PI logo

Planifier aide-t-il un modèle à concevoir une molécule ?

Une ligne de recherche conclue sur les tokens de planification discrets émergents : trois variantes, cinq régimes, et une référence sans plan que rien n'a battue, chaque chiffre étant rattaché à sa source.

PI Project · Notes R&D/ Raisonnement propre à la machine/ Note 3 · le volet moléculaire· Note 1 · méthode & résultat· Note 2 · les échecs

§01 Cadre

Une tâche de conception, et le témoin qui tranche

Les notes 1 et 2 étudient un canal latent discret sur des tâches jouets de langage et d'arithmétique, où la question est de savoir si le canal porte véritablement le calcul. Cette note rapporte une ligne distincte et conclue, qui applique le même mécanisme à une tâche dotée d'une mesure externe : la génération moléculaire pilotable. Le modèle reçoit un objectif de propriété, émet une courte séquence de codes de planification discrets qu'il invente pendant l'entraînement, puis produit une molécule à partir de ce plan.

Savoir si le plan mérite sa place tient à une seule comparaison. Face au même décodeur conditionné directement sur l'objectif, sans aucun goulot et à budget de pas identique, insérer le plan apporte-t-il le moindre supplément de pilotage ? Trois variantes partagent le pipeline et ne diffèrent que par ce qui se place entre l'objectif et le décodeur : rien (direct), un plan discret (l'hypothèse), ou un latent gaussien continu apparié. Le plan discret provient d'une quantification vectorielle, VQ dans la suite : l'état interne du modèle est ramené à l'entrée la plus proche dans un codebook appris, si bien que le décodeur reçoit une courte suite d'entiers plutôt qu'un vecteur continu.

Les trois variantes · seul le bloc central diffère
direct · sans goulot
objectif aucun goulot décodeur molécule

le décodeur lit l'objectif lui-même

discret · plan VQ
objectif plan à 8 slots décodeur molécule

8 entiers tirés d'un codebook appris de 256 entrées

continu · gaussien
objectif latent gaussien décodeur molécule

un vecteur continu, apparié à la capacité du plan

même décodeur · même budget de 16k pas · un seul chemin d'évaluation

Les molécules sont décodées en SELFIES, un encodage textuel des graphes moléculaires où toute chaîne bien formée décode par construction en une molécule chimiquement valide : un écart entre variantes ne peut donc pas venir d'une chimie invalide. L'entraînement et l'évaluation reposent sur ZINC-250k, un sous-ensemble public de référence d'environ 249 000 composés d'allure médicamenteuse tirés de la chimiothèque ZINC. Deux propriétés sont pilotées : le QED, un score composite borné de 0 à 1 qui mesure le caractère médicamenteux, et le logP pénalisé, un score de lipophilie non borné, à queue lourde.

La métrique retenue est l'amplitude de pilotage. Sur une grille de propriétés cibles, on demande au modèle de viser chaque cible tour à tour, et l'amplitude est l'écart entre la plus haute et la plus basse médiane de propriété obtenue. Un modèle que l'on peut déplacer d'un bout à l'autre de la grille a une amplitude large ; un modèle dont les sorties bougent à peine en a une étroite. Sont également rapportés : la corrélation entre propriété demandée et propriété obtenue, et le gain de réussite sur une base non conditionnée. Un même chemin d'évaluation note toutes les variantes.

SELFIES · Chimiothèque ZINC

Ligne / run
denovo / h1 · h3
Architecture
Modèle séquentiel VQ, d=384 · 4+4 couches · 21.5M paramètres
Plan
8 slots · VQ dur, 256 codes · 64-d
Données
ZINC-250k · SELFIES, vocabulaire de 111 tokens
Budget d'entraînement
deux phases · 10k + 6k pas · un GPU de 16 Go
Variantes
direct · discret · continu
Journal
outputs/*_aggregate.json · 2026-07
Statut
Conclue · négatif, avec un résultat transférable
§02 · La comparaison · 1/4

Deux variantes, et un écart qui se lit comme un appui

La comparaison part de deux bras. Sur trois seeds, le plan discret pilote le QED sur une amplitude de 0,311 ± 0,022 ; le latent gaussien continu apparié n'atteint que 0,054 ± 0,013. Soit un facteur 5,8, avec des valeurs par seed qui ne se recouvrent pas. Pris isolément, c'est un résultat en faveur des codes de planification discrets.

§02 · La comparaison · 2/4

Le bras qui change la lecture

Le troisième bras est le même décodeur, conditionné directement sur l'objectif : sans goulot, sans plan, au même budget de 16k pas. Il obtient 0,358 ± 0,030, au-dessus du plan discret et non en dessous, et les valeurs par seed listées à côté recouvrent celles du plan. Insérer le plan n'apporte aucun pilotage supplémentaire par rapport au conditionnement direct du décodeur.

§02 · La comparaison · 3/4

Deux rapports, pas un seul

À trois bras, l'écart doit être cité deux fois. Le discret vaut 5,8× le continu, et le direct 6,6× le continu. Le plus grand des deux revient à la variante dépourvue de tout goulot, et c'est ce qui fixe la lecture : l'écart renseigne sur le goulot continu plutôt que sur un bénéfice de la planification.

Gain de réussite sur une base non conditionnée : +12,1 % pour le direct, +8,8 % pour le discret, +2,5 % pour le continu. Corrélation de suivi de cible 0,988, 0,963 et 0,887. Trois seeds par variante, meilleure température de décodage par seed.

§02 · La comparaison · 4/4

Ce que la comparaison autorise

Sur le QED, le plan n'est ni inerte ni utile : il égale le conditionnement direct, au bruit de seed près. Les seuils de compétence avaient été franchis avant toute notation, si bien que l'énoncé porte sur le pilotage et non sur une génération dégradée. Sur l'ensemble des variantes, la validité est de 100 %, l'unicité de 99 %, la nouveauté de 100 % et la diversité interne de 0,87.

§03 Là où un plan aurait dû l'emporter

Trois régimes choisis pour avantager le plan

Une égalité ne fait pas un verdict. Si un goulot de planification paie quelque part, c'est du côté d'une propriété plus difficile à piloter, d'une tâche à deux contraintes simultanées et d'une base sous-jacente plus forte. Les trois ont été exécutés face au même témoin direct.

Une seconde propriété : le logP pénalisé

Le logP pénalisé n'est pas borné et sa queue négative est lourde : la mesure retenue est donc une médiane et non une moyenne. Ici, le direct dépasse le plan d'environ un facteur deux, et les valeurs par seed ne se recouvrent pas.

logP pénalisé · gain de réussite · 3 seeds · mesure médiane
direct · sans goulot +11.4%
discret · plan VQ +5.8%
continu · gaussien +0.4%
direct  12.2 · 9.6 · 12.5  (±1.3) discret  5.8 · 5.3 · 6.3  (±0.4) continu  0.6 · −0.9 · 1.4  (±1.0)

Le seed le plus bas du direct (9,6 %) reste au-dessus du plus haut du plan (6,3 %).

chaque point est un seed · le trait est la moyenne · axe −2% à +14%

Deux objectifs à la fois

Atteindre ensemble une cible de QED et une cible de logP pénalisé, sur une grille 3×3 de couples de cibles, c'est le régime où un plan a le plus de chances de payer : les deux propriétés sont presque indépendantes, si bien que le modèle doit satisfaire deux contraintes en une seule génération. Trois seeds, direct contre discret.

QED et logP pénalisé conjointement · grille 3×3 de cibles · 3 seeds gain de réussite conjointe · axe 0 à +6%
direct · sans goulot +4.1%
discret · plan VQ +2.1%
direct  4.9 · 3.7 · 3.6  (±0.6) discret  1.6 · 2.8 · 1.9  (±0.5)
corrélation de pilotage du logP · axe −0,6 à +0,9
direct · sans goulot +0.47
discret · plan VQ −0.25
direct  0.82 · 0.33 · 0.26 discret  −0.53 · +0.21 · −0.44

chaque point est un seed · le trait est la moyenne · la verticale marque le zéro

Les deux variantes pilotent bien le QED (+0,98 pour le direct, +0,91 pour le discret). C'est sur le second objectif qu'elles se séparent : le direct le suit, le plan non. La moyenne du discret, −0,25, masque un seed positif sur trois, si bien que la dispersion est la forme honnête de ce chiffre, et les gains de réussite conjointe forment la plus solide des deux comparaisons, puisque leurs valeurs par seed ne se recouvrent pas.

Une base plus forte

Reste une explication candidate : la force de la base. Les travaux voisins rapportent que les latents discrets aident sur une base pré-entraînée forte. Ce régime est hors de portée ici, puisqu'un seul GPU de 16 Go place le plafond à environ 30 M de paramètres. Ce qui restait possible est un contrôle de robustesse plutôt qu'un test d'échelle : porter la base à la plus grande taille que le plafond autorise, tripler son pré-entraînement, couper le démarrage à chaud pour que ce pré-entraînement allongé soit le seul levier de force, puis rejouer la même comparaison. La figure ci-dessous porte la taille et le budget obtenus.

Cette base a un d de 416 sur 5 couches, contre 384 sur 4+4 pour la configuration par défaut.

Base plus forte · 28,2 M de paramètres · 30k pas de pré-entraînement
direct · 2 seeds 0.442
discret · 3 seeds 0.362
direct  0.453 · 0.432  (±0.010) discret  0.240 · 0.485 · 0.360  (±0.100)

Recouvrement, Mann-Whitney p=0,40. Le chiffre du direct repose sur deux seeds, pas trois.

amplitude de pilotage du QED · axe 0,20 à 0,50 · chaque point est un seed

La base plus forte fait passer le direct de 0,358 à 0,442, et elle l'y porte régulièrement d'un seed à l'autre. Le plan atteint 0,362, à peine au-dessus de son point de départ, et ses seeds sont dix fois plus dispersés. L'usage du codebook reste à 98,8 % : le plan est donc effectivement écrit et lu, non abandonné. Avec deux seeds d'un côté et trois de l'autre, la preuve est plus faible que celle de la comparaison sur le QED, et c'est un contrôle de robustesse sous le plafond matériel plutôt qu'un énoncé sur l'échelle.

§04 · La relance · 1/4

Une géométrie a franchi la barre

Le dernier levier non testé était la forme même du plan : le nombre d'entrées du codebook, noté |V|, et le nombre de slots qu'occupe le plan, noté L. Quinze combinaisons des deux ont été balayées, un seed chacune. Le direct n'a pas de goulot : il est donc sans géométrie et sa barre reste fixée à 0,358. Une combinaison a franchi cette barre, à 0,446.

L parmi 1, 2, 4, 8 et 16, croisé avec |V| parmi 64, 256 et 1 024, au budget complet de 16k pas. La combinaison qui a franchi la barre est la géométrie nommée dans le panneau ci-contre.

§04 · La relance · 2/4

Le criblage avait noté son propre bruit

Le balayage comportait son propre contrôle. Il rejouait aussi la géométrie par défaut, 256 codes sur 8 slots, dont la valeur sur trois seeds est connue : 0,311. Sur ce passage à seed unique, elle a obtenu 0,367. Un seed unique à ce budget porte donc environ +0,05 d'inflation due au décodage stochastique, soit l'essentiel de la marge du prétendant au-dessus de la barre.

§04 · La relance · 3/4

Relancée, elle est revenue à la barre

Deux seeds supplémentaires de la même géométrie ont donné 0,232 et 0,381. La moyenne sur trois est de 0,353, sous le 0,358 du direct, et les seeds se recouvrent. Le second prétendant, lui, a suivi le même chemin. Ce contrôle explique que la géométrie remarquée ait été relancée plutôt que publiée.

Mann-Whitney p=0,50 pour la géométrie remarquée. Le second prétendant, |V|=256 sur L=2, a obtenu 0,377 au criblage et 0,329 sur trois seeds, p=0,90.

§04 · La relance · 4/4

Le résultat nul n'est pas un codebook effondré

Un garde-fou sur l'usage écarte l'explication banale. Les deux prétendants confirmés utilisent de 97 % à 100 % de leur codebook, à perplexité saine : le plan est donc effectivement écrit et lu. Le seul négatif net du balayage est le plus grand codebook : à 1 024 codes, toutes les configurations restent à 0,34 ou en dessous et l'utilisation tombe entre 31 % et 86 %, un vocabulaire que ce budget ne parvient pas à faire vivre.

Criblage : 15 configurations, seed 0. Confirmation : 3 seeds, test U de Mann-Whitney et vérification du recouvrement par seed, face au 0,358 ± 0,030 verrouillé du direct.

§05 Ce que le run établit bel et bien

C'est la nature du goulot qui déplace la pilotabilité, pas la présence d'un plan

Sur les cinq régimes ci-dessus, le plan ne dépasse jamais le conditionnement direct. La variation qui apparaît, elle, se situe entre les natures de goulot, et elle est importante. Le latent gaussien continu pilote le QED sur 0,054, là où le plan discret atteint 0,311 et où l'absence complète de goulot atteint 0,358. Sur le logP pénalisé, il ne pilote presque pas : +0,4 % ± 1,0 contre +5,8 % et +11,4 %.

Les cinq régimes · le direct face au plan
QED · de novo amplitude de pilotage · 3 seeds
direct 0.358
plan 0.311

Égalité : les valeurs par seed se recouvrent.

logP pénalisé gain de réussite · 3 seeds · mesure médiane
direct +11.4%
plan +5.8%

Le direct devant : son seed le plus bas dépasse le plus haut du plan.

Deux objectifs à la fois gain de réussite conjointe · grille 3×3 · 3 seeds
direct +4.1%
plan +2.1%

Le direct devant sur le gain conjoint, et le plan ne suit pas la seconde propriété.

Géométrie du plan amplitude de pilotage du QED · 15 configurations
direct 0.358
meilleure géométrie 0.353

La seule des quinze à franchir la barre retombe à 0,353 sur trois seeds.

Une base plus forte amplitude de pilotage du QED · 28,2M paramètres
direct 0.442
plan 0.362

Recouvrement, p=0,40. Le chiffre du direct repose sur deux seeds, pas trois.

Chaque panneau conserve son unité et son échelle propres, si bien que les longueurs de barres se comparent à l'intérieur d'un panneau et non d'un panneau à l'autre. Le bras continu figure au §02 ainsi que dans la figure ci-dessous.

Le mécanisme est le moyennage des modes. Appelé à représenter deux façons chimiquement distinctes de satisfaire le même objectif, un latent gaussien n'a qu'une moyenne à placer, et il la place entre les deux, en un point qui n'en satisfait aucune. Un codebook discret y échappe parce que la quantification impose de choisir une entrée. Conditionner le décodeur directement y échappe parce qu'il n'y a alors aucun intermédiaire à moyenner.

L'objection évidente, à savoir qu'une gaussienne unique ne peut tout simplement pas exprimer ce qu'expriment 256 catégories, a fait l'objet d'un contrôle dédié. Un planificateur à mélange de 16 gaussiennes, apparié à l'expressivité de la loi catégorielle, atteint 0,097 ± 0,035 sur trois seeds. Il récupère une partie de l'écart et reste 3,2× sous le plan discret, avec des valeurs par seed qui ne se recouvrent pas : le minimum discret, 0,288, dépasse le maximum du mélange, 0,129. Ce n'est donc pas la multimodalité qui manquait au latent gaussien.

Schéma · un mécanisme, pas une mesure
deux solutions distinctes latent continu une seule moyenne à placer un point qui n'en satisfait aucune
amplitude de pilotage du QED · axe 0 à 0,45 · 3 seeds chacune
direct
0.358
discret
0.311
mélange · K=16
0.097
continu
0.054

le mélange récupère une partie de l'écart et reste 3,2× sous le plan discret

RÈGLE DE CONCEPTION · DANS LES LIMITES DE CE RUN

Pour la génération pilotable de ce type, à cette échelle, préférer un goulot discret, ou pas de goulot du tout, au goulot continu et lisse qu'emploie un auto-encodeur variationnel. Le résultat tient sur deux propriétés et survit au contrôle de multimodalité ; c'est le seul ici qui se transfère hors de la tâche moléculaire.

Un point de méthode sous-tend tout cela. Avec les seuls bras discret et continu, cette comparaison se lit comme un appui à l'hypothèse : un écart de 5,8× dans la direction prévue. Le bras direct, ajouté ensuite, supprime cette lecture et laisse un résultat nul. Pour affirmer qu'une représentation intermédiaire aide, il faut le témoin sans intermédiaire, à budget apparié ; faute de quoi un effet de conception du goulot sera rapporté comme un effet de planification.

§06 Le pont

Un canal dont le contenu est causal et dont l'ordre ne l'est pas

À l'intérieur de la variante discrète, le plan n'est pas décoratif. Corruption à l'évaluation uniquement, le modèle entraîné et tout le reste étant maintenus fixes : rendre aléatoires les codes du plan fait s'effondrer l'amplitude de pilotage du QED, de 0,272 à 0,030, soit un facteur 9,1. Mélanger ces mêmes codes entre leurs slots la laisse à 0,270, inchangée.

Lus ensemble, ces deux résultats disent quelle sorte d'objet est le plan émergent. Son contenu porte le pilotage : les codes transportent donc l'objectif au lieu de servir de remplissage. Son ordre, lui, ne porte rien : le plan est donc un ensemble de codes non ordonné plutôt qu'une séquence.

La note 1 définit shuffle comme son intervention la plus diagnostique et énonce à l'avance ce que serait un canal qui y survivrait : un sac de marqueurs, par opposition à un canal qui lie le sens à la position. Ce protocole décrivait le cas sans l'observer. Ce run l'observe. Le même couple d'interventions, appliqué à une autre tâche et à une autre architecture, renvoie la signature que le protocole nomme : inchangé sous shuffle, effondré sous random.

Il existe un second lien entre les deux lignes. La note 1 établit qu'un canal discret peut être rendu causalement nécessaire. Ce run établit qu'être nécessaire n'est pas la même chose qu'être utile : ici, il est démontré que le canal est utilisé et que son contenu porte le signal de pilotage ; ce canal n'apporte pourtant rien de plus que le conditionnement direct du décodeur.

Le protocole d'intervention et le run qu'il a certifié : Note 1 · un canal de raisonnement doit se briser quand on le brouille →

§07 Limites

Ce que ce résultat nul ne couvre pas

  • L'échelle n'est pas testée, elle n'est pas non plus mise hors de cause. Un GPU de 16 Go, une base par défaut de 21,5 M de paramètres et un plafond proche de 30 M. Le régime dans lequel les travaux voisins rapportent que le mécanisme aide, celui d'une grande base pré-entraînée, est hors d'atteinte sous ces contraintes. Le contrôle sur base forte opère sous ce plafond ; ce n'est pas un balayage d'échelle.
  • Une architecture, un encodage. Un modèle séquentiel VQ décodant du SELFIES sur ZINC-250k. Un mécanisme de plan différent, dont les unités seraient par exemple des opérations d'édition de graphe plutôt que des codes émis, relève d'une autre question et n'a pas été exécuté.
  • Le chiffre du direct sur base forte repose sur deux seeds. 0,453 et 0,432, face à trois seeds pour la variante discrète. Toutes les autres comparaisons de cette page opposent trois seeds à trois.
  • Deux propriétés et une seule grille de cibles. Le QED et le logP pénalisé ont été retenus parce qu'ils diffèrent par nature : un composite borné face à une queue lourde non bornée. Deux propriétés ne font pas un panorama des objectifs de conception.
  • Les moyennes de corrélation de pilotage masquent leur dispersion. Le −0,25 du discret sur la tâche à deux objectifs est une moyenne de −0,53, +0,21 et −0,44 : un seed sur trois est positif. Le gain de réussite conjointe est la moitié la plus solide de cette comparaison.
  • Le criblage de géométrie est à seed unique par construction. Son propre contrôle mesure l'inflation qui en résulte, et c'est pourquoi aucun chiffre du criblage n'est cité comme résultat tant qu'il n'a pas été rejoué sur trois seeds.

Travaux voisins

arXiv 2604.22709 · IBM · 2026

Abstract-CoT · "Thinking Without Words"

Remplace la chaîne de pensée verbale par un vocabulaire abstrait réservé, sur des modèles pré-entraînés. Son résultat positif repose sur une base pré-entraînée forte et sur une tâche exigeante en raisonnement, précisément le régime que les contraintes retenues ici mettent hors de portée : ce résultat nul et ce résultat positif ne testent donc pas le même régime. La note 1 cite le même article pour une autre raison : il ne formule aucune affirmation de nécessité causale par token.

§08 Conclusion

C'est le témoin qui décide de la lecture

L'hypothèse était qu'un plan discret entre un objectif et une molécule apporte de la pilotabilité. Sous la forme la plus exigeante de la comparaison disponible à cette échelle, il n'en apporte pas : ni sur le QED, où il égale le conditionnement direct ; ni sur le logP pénalisé ou la tâche à deux objectifs, où il décroche ; ni sur aucune des quinze géométries de plan ; ni sur la plus grande base que le matériel autorise. Le plan est utilisé et son contenu est causal, ce qui est un constat sur le canal plutôt qu'un bénéfice qui en découle.

Ce qui se transfère est plus étroit que l'hypothèse, et plus ferme. Quand le goulot est un latent gaussien continu, la pilotabilité chute d'environ un facteur six, et l'ingrédient manquant n'est pas la multimodalité mais le moyennage qu'un tel latent opère. Et le bras qu'il est le plus facile d'omettre, le décodeur conditionné directement sur l'objectif, est ce qui sépare un résultat sur la conception du goulot d'un résultat sur la planification.

Provenance · ce sur quoi repose chaque affirmation

Amplitude de pilotage du QED, gain de réussite et corrélation de pilotage pour les trois variantes (0,358 / 0,311 / 0,054, 3 seeds chacune) outputs/h1_direct_aggregate.json · outputs/h3_aggregate.json
Contrôle d'équité par mélange de gaussiennes (0,097 ± 0,035, K=16, 3 seeds) outputs/h3_mog_aggregate.json · outputs/h3_continuous_mog_s{0,1,2}/h3_result.json
Gain de réussite sur logP pénalisé (+11,4 % / +5,8 % / +0,4 %, 3 seeds, mesure médiane) outputs/h1_plogp_direct_aggregate.json · outputs/h3_plogp_aggregate.json
Gain de réussite conjointe à deux objectifs et corrélations de pilotage par propriété (grille 3×3 de cibles, 3 seeds) outputs/mo_aggregate.json · scripts/train_denovo_multiobj.py
Criblage de géométrie du plan (15 configurations, seed 0), le négatif à |V|=1024, et le contrôle intégré qui a noté 0,367 face à un 0,311 verrouillé outputs/geom_aggregate.json · scripts/run_geometry_sweep.sh
Confirmation des deux prétendants sur trois seeds, valeurs p de Mann-Whitney et utilisation du codebook outputs/geom_confirm_aggregate.json · scripts/aggregate_geometry_confirm.py
Contrôle de robustesse sur base forte : architecture, 30k pas de pré-entraînement, usage du codebook, valeur p de Mann-Whitney, direct sur 2 seeds et discret sur 3 outputs/strongbase_aggregate.json · scripts/run_strongbase_seeds.sh
La contrainte matérielle de 16 Go et le plafond de paramètres qu'elle impose FINDINGS.md · RESEARCH_PROPOSAL.md
Ablation par corruption du plan (0,272 intact, 0,030 aléatoire, 0,270 mélangé, 3 seeds, évaluation uniquement) docs/experiment_D_denovo_planner.md · src/adpt/ablations.py
Seuils de compétence (validité 100 %, unicité 99 %, nouveauté 100 %, diversité interne 0,87), configuration du modèle et budget de pas outputs/h3_aggregate.json · scripts/train_denovo_h3.py
Source complète, journaux d'expérience et documents dépôt de recherche privé · disponible sur demande

Les valeurs par seed sont citées telles qu'elles figurent dans les agrégats listés ci-dessus, sans être recalculées, et l'identifiant arXiv a été vérifié sur l'article source en juillet 2026. Ceci est une ligne de recherche conclue, publiée pour la valeur de sa méthode.