PI logo

CoT abstraite, le prix de la pensée à voix haute

Un modèle qui raisonne en phrases paie chaque mot, et ces phrases ne consignent pas fidèlement le calcul. Les deux problèmes mènent à la même question.

01 Le problème

Un raisonnement écrit pour les humains, facturé à la machine

Quand un modèle raisonne pas à pas, il écrit ces étapes en phrases humaines, comme s'il énonçait ses pensées à voix haute. Le domaine appelle cela une chaîne de pensée, en abrégé CoT, et une CoT abstraite est ce même raisonnement porté par quelque chose de plus dense que des mots. Cette narration n'a jamais été retenue parce qu'un modèle en aurait besoin. Elle l'a été parce que nous savons la lire, et parce qu'un modèle entraîné sur nos textes sait déjà la produire.

Deux conséquences en découlent, et elles vont dans le même sens. La narration est longue, donc elle consomme du contexte, de la latence et de l'argent à chaque requête. Et elle est un compte rendu du calcul plutôt que le calcul lui-même, si bien que rien ne garantit que ce que disent les phrases corresponde à ce que le modèle a fait. Celui qui paie la facture et celui qui doit justifier la réponse regardent donc la même faiblesse par deux côtés.

02 Pourquoi cela compte

La facture est imprévisible et le relevé est incomplet

Les tokens de raisonnement sont produits avant la réponse, facturés comme n'importe quelle sortie, et largement invisibles pour qui a écrit la requête. Des mesures indépendantes de ce volume caché l'ont trouvé assez grand pour inverser le classement des prix affichés, et assez variable pour que la même question posée deux fois ne coûte pas la même chose. Dans le même temps, l'obligation de conserver les journaux générés automatiquement par un système à haut risque est désormais inscrite dans le droit européen.

32 %
des comparaisons entre deux modèles où celui dont le prix affiché est le plus bas revient en fait plus cher, sur huit modèles de raisonnement de pointe et douze tâches. Source : arXiv 2603.23971, 2026
9,7×
l'écart le plus large observé sur les tokens de réflexion lors d'exécutions répétées d'une seule et même requête, de sorte que la même question ne coûte pas nécessairement deux fois le même prix. Source : arXiv 2603.23971, 2026
<20 %
la fréquence, dans la plupart des configurations mesurées, à laquelle un modèle de raisonnement mentionne dans sa chaîne de pensée un indice qui a manifestement changé sa réponse. Source : Chen et al., arXiv 2505.05410, 2025
6 mois
la durée minimale pendant laquelle un déployeur de système d'IA à haut risque doit conserver les journaux générés automatiquement, au titre de l'article 26(6) du règlement européen sur l'IA. Source : règlement (UE) 2024/1689, article 26(6)

Coût

La verbosité se facture au token à chaque requête, si bien que la forme prise par le raisonnement est un coût d'exploitation récurrent plutôt qu'un choix de conception ponctuel.

Prévisibilité

Un coût par requête qui varie d'un ordre de grandeur pour la même entrée est difficile à budgéter, et difficile à garantir sous une exigence de latence.

Redevabilité

Un journal conservé six mois ne fait preuve que s'il consigne ce qui a réellement déterminé la réponse. Une narration qui omet l'influence décisive satisfait la lettre et manque l'essentiel.

03 Pourquoi cela est difficile

Un code plus dense s'obtient facilement et se croit difficilement

Comprimer le raisonnement en quelque chose de plus compact que des phrases n'est pas la difficulté. La difficulté est de montrer que cette chose compacte porte le raisonnement, au lieu de côtoyer un calcul qui aurait eu lieu de toute façon.

Compact ne veut pas dire porteur

N'importe quel goulot peut produire un code interne court. Savoir s'il porte le calcul ou s'il l'accompagne seulement est une autre question, à laquelle la compression seule ne répond jamais.

L'échec ressemble à une réussite

Un modèle peut contourner son propre canal pendant que toutes les métriques du tableau de bord continuent de progresser. Rien dans les courbes d'entraînement habituelles ne distingue un canal porteur d'un canal décoratif.

Concevoir soi-même la langue est un piège

Rien ne garantit qu'un code conçu par des humains convienne à un modèle, pas plus que la grammaire humaine. L'autre voie, laisser un code émerger à l'entraînement, oblige à inspecter quelque chose que personne n'a spécifié.

La densité se paie en lisibilité

La compression qui économise des tokens rend la trace plus difficile à lire pour un humain, si bien qu'un système de ce type doit à son auditeur un test plutôt qu'une transcription.

04 Où cela en est

La ligne est close. Le test qu'elle a produit ne l'est pas

Nous avons exploré cette question entre octobre 2025 et janvier 2026, sur sept familles d'architectures. La ligne est conclue : le mécanisme s'est révélé être un terrain public, des laboratoires mieux dotés l'ont porté à l'échelle, et notre propre montée en échelle a cassé en phase deux et a été arrêtée.

Ce qui a survécu se transfère mieux que ce qui était visé. Brouillez le code interne : un canal qui porte réellement le raisonnement doit casser, un canal qui ne le porte pas ne cassera pas. C'est un test auquel tout système de ce type peut être soumis, et les notes consignent les runs qui l'ont passé, ceux qui l'ont manqué, et celui qui passait tous les tableaux de bord sans rien porter.