01 Le problème
Un raisonnement écrit pour les humains, facturé à la machine
Quand un modèle raisonne pas à pas, il écrit ces étapes en phrases humaines, comme s'il énonçait ses pensées à voix haute. Le domaine appelle cela une chaîne de pensée, en abrégé CoT, et une CoT abstraite est ce même raisonnement porté par quelque chose de plus dense que des mots. Cette narration n'a jamais été retenue parce qu'un modèle en aurait besoin. Elle l'a été parce que nous savons la lire, et parce qu'un modèle entraîné sur nos textes sait déjà la produire.
Deux conséquences en découlent, et elles vont dans le même sens. La narration est longue, donc elle consomme du contexte, de la latence et de l'argent à chaque requête. Et elle est un compte rendu du calcul plutôt que le calcul lui-même, si bien que rien ne garantit que ce que disent les phrases corresponde à ce que le modèle a fait. Celui qui paie la facture et celui qui doit justifier la réponse regardent donc la même faiblesse par deux côtés.
02 Pourquoi cela compte
La facture est imprévisible et le relevé est incomplet
Les tokens de raisonnement sont produits avant la réponse, facturés comme n'importe quelle sortie, et largement invisibles pour qui a écrit la requête. Des mesures indépendantes de ce volume caché l'ont trouvé assez grand pour inverser le classement des prix affichés, et assez variable pour que la même question posée deux fois ne coûte pas la même chose. Dans le même temps, l'obligation de conserver les journaux générés automatiquement par un système à haut risque est désormais inscrite dans le droit européen.
Coût
La verbosité se facture au token à chaque requête, si bien que la forme prise par le raisonnement est un coût d'exploitation récurrent plutôt qu'un choix de conception ponctuel.
Prévisibilité
Un coût par requête qui varie d'un ordre de grandeur pour la même entrée est difficile à budgéter, et difficile à garantir sous une exigence de latence.
Redevabilité
Un journal conservé six mois ne fait preuve que s'il consigne ce qui a réellement déterminé la réponse. Une narration qui omet l'influence décisive satisfait la lettre et manque l'essentiel.
03 Pourquoi cela est difficile
Un code plus dense s'obtient facilement et se croit difficilement
Comprimer le raisonnement en quelque chose de plus compact que des phrases n'est pas la difficulté. La difficulté est de montrer que cette chose compacte porte le raisonnement, au lieu de côtoyer un calcul qui aurait eu lieu de toute façon.
Compact ne veut pas dire porteur
N'importe quel goulot peut produire un code interne court. Savoir s'il porte le calcul ou s'il l'accompagne seulement est une autre question, à laquelle la compression seule ne répond jamais.
L'échec ressemble à une réussite
Un modèle peut contourner son propre canal pendant que toutes les métriques du tableau de bord continuent de progresser. Rien dans les courbes d'entraînement habituelles ne distingue un canal porteur d'un canal décoratif.
Concevoir soi-même la langue est un piège
Rien ne garantit qu'un code conçu par des humains convienne à un modèle, pas plus que la grammaire humaine. L'autre voie, laisser un code émerger à l'entraînement, oblige à inspecter quelque chose que personne n'a spécifié.
La densité se paie en lisibilité
La compression qui économise des tokens rend la trace plus difficile à lire pour un humain, si bien qu'un système de ce type doit à son auditeur un test plutôt qu'une transcription.
04 Où cela en est
La ligne est close. Le test qu'elle a produit ne l'est pas
Nous avons exploré cette question entre octobre 2025 et janvier 2026, sur sept familles d'architectures. La ligne est conclue : le mécanisme s'est révélé être un terrain public, des laboratoires mieux dotés l'ont porté à l'échelle, et notre propre montée en échelle a cassé en phase deux et a été arrêtée.
Ce qui a survécu se transfère mieux que ce qui était visé. Brouillez le code interne : un canal qui porte réellement le raisonnement doit casser, un canal qui ne le porte pas ne cassera pas. C'est un test auquel tout système de ce type peut être soumis, et les notes consignent les runs qui l'ont passé, ceux qui l'ont manqué, et celui qui passait tous les tableaux de bord sans rien porter.