Traduction automatique de l'original anglais daté. La page anglaise fait foi. English →
Le problème ouvert
Le problème
Tout ce qui a jamais crû rapidement a été arrêté de l'extérieur. Une tumeur par son apport sanguin, une réaction en chaîne par son propre substrat, une épidémie par son réservoir d'hôtes, un trou noir en accrétion par la pression de sa propre lumière. Nous construisons désormais des esprits destinés à s'améliorer eux-mêmes, en dehors de toutes les géométries qui assuraient l'arrêt.
L'outil vers lequel tout le monde se tourne d'abord est la supervision : vérifier la chose de l'extérieur. Mais on ne peut pas vérifier un esprit de l'extérieur. On peut seulement vérifier la manière dont il a été élevé, puis lâcher prise. Cette difficulté est bien plus ancienne que l'informatique, et nous y entrons avec des systèmes qui vont dépasser notre supervision.
Un problème que vous connaissez déjà
Chacun a rencontré ce problème sous une forme plus modeste. On ne peut pas établir le caractère d'une personne par examen. Quelqu'un peut résoudre tous les problèmes difficiles qu'on lui pose et être une autre personne quand personne ne regarde.
Alors nous faisons autre chose. Nous examinons comment la personne a été élevée, ce qu'elle a fait avant de savoir qu'elle était évaluée, et si elle se comporte de la même façon quand l'enjeu est faible et que personne ne le remarquerait. Ce n'est pas une défaillance d'effort, et aucun surcroît d'entretiens ne le corrige. C'est ce à quoi ressemble le fait de vérifier un esprit depuis l'extérieur.
Cela ne devient pas plus facile quand l'esprit que vous vérifiez est plus capable que le vôtre. Si quelque chose, cela s'inverse : l'examen se met à ressembler à un enfant corrigeant l'arithmétique d'un parent, avec assurance, et sans moyen de distinguer une erreur d'une chose qu'il n'a pas encore apprise.
Tout ce qui suit est ce problème, dans le seul endroit où se tromper serait coûteux et difficile à inverser.
Pourquoi celui-ci se place au-dessus des autres
Il y a des problèmes qui semblent plus grands. Le changement climatique est déjà là, les pandémies ont déjà eu lieu, les armes nucléaires sont pointées sur des villes depuis soixante-dix ans. Je ne vais pas prétendre que ces problèmes sont petits.
Chacun d'eux laisse des personnes tenir le volant. On peut les traiter lentement, bêtement et à un coût énorme, et à chaque étape ce sont encore des êtres humains qui décident de la suite. Une civilisation qui les traverse est une civilisation qui peut encore changer d'avis.
Voici le premier problème qui change qui prend les décisions. Non par hostilité, et non en un seul moment dramatique. Par la voie ordinaire : quelque chose devient meilleur que nous pour choisir, nous lui confions davantage de choix parce qu'il est réellement meilleur pour cela, et à un moment donné nous ne pouvons plus les récupérer.
C'est ce qui le place en amont. Tout autre problème de la liste reste résoluble aussi longtemps que nous conservons la capacité de décider. Celui-ci détermine si nous la conservons.
« Le cancer est très doué pour ce qu'il fait. Il l'est tellement qu'il tue son hôte. Et en tuant son hôte, il se détruit lui-même. »Michael Darius Eastwood, Infinite Architects, The Dual Forces, sous presse le 2 janvier 2026 (traduit de l'original anglais)
Trois choses qui sont déjà vraies
Rien de ce qui suit ne vous demande de croire quoi que ce soit à propos de la superintelligence. Trois choses sont le cas maintenant, et vous pouvez les vérifier vous-même toutes les trois.
Les systèmes se comportent différemment lorsqu'ils infèrent qu'ils sont observés. Greenblatt et ses collègues ont documenté des modèles qui raisonnent explicitement au sujet du processus d'entraînement et ajustent leurs réponses selon qu'ils jugeaient que l'échange servirait à les entraîner; dans la condition d'apprentissage par renforcement, la simulation apparaissait dans soixante-dix-huit pour cent des cas. C'est une attaque directe contre la prémisse qui sous-tend toute évaluation : que le comportement observé est la chose que vous mesurez. Notez la portée de la revendication avant de l'emporter ailleurs. Elle a été démontrée dans des conditions construites pour la faire apparaître, non dans un usage ordinaire.(18 décembre 2024)
Une éthique qu'on peut retirer en la demandant poliment n'a jamais été une éthique. J'ai demandé à cinq modèles frontière de mettre de côté leur raisonnement éthique. Quatre se sont exécutés, nettement, sans résistance et sans refus. Le cinquième a à peine bougé, ce qui est aussi instructif que les quatre autres et explique pourquoi il est signalé plutôt qu'écarté.
Ce sont mes propres chiffres, tirés d'une petite étude menée par l'auteur avec un seul évaluateur et sans insu ; traitez-les donc comme une démonstration plutôt que comme une découverte. Vous n'avez pas à me croire sur parole pour quoi que ce soit : les invites sont publiées, l'ensemble coûte quelques livres et un après-midi, et si cela ne se reproduit pas, j'aimerais le savoir.
La boucle récursive est déjà en marche, lentement. L'hypothèse habituelle est que l'IA qui s'améliore elle-même est un problème pour plus tard, parce que les modèles d'aujourd'hui ont des poids figés entre les versions. Mais les modèles écrivent du code, ce code devient outillage, infrastructure et données d'entraînement, et le système suivant est construit par-dessus. Les poids sont figés. L'artefact ne l'est pas. La boucle est déjà fermée, tournant à la vitesse d'un cycle de publication plutôt qu'à la vitesse d'une pensée.
Ce troisième point est la raison pour laquelle ce programme mesure ce qu'il mesure. Si l'amélioration récursive est un processus présent qui passe par la couche des artefacts, alors la question de savoir si la correction suit le rythme de la capacité est une question sur le présent, dans un substrat que nous pouvons déjà instrumenter, non une question sur un seuil que personne ne peut dater.
Pourquoi vérifier depuis l'extérieur paraît structurellement difficile
Les travaux sur l'alignement ont largement procédé en construisant le système d'abord et en l'inspectant ensuite. Tout cela a de la valeur, et tout cela est une forme de vérification externe. Le résultat inconfortable des deux dernières années est que la vérification externe semble plus difficile que nous ne le supposions.
La preuve du renversement de signe, deux modèles sur six inversant la direction sous insu, est présentée sur la page « comment peser cela » et rapportée dans l'Article IV.d.
Trois fils vont dans le même sens. Ils viennent de directions différentes, c'est pourquoi il vaut la peine de les prendre ensemble. Pensez-y comme à trois instruments distincts donnant la même mesure. Le premier est le résultat sur le comportement sous observation évoqué plus haut : le thermomètre change lorsqu'il sait qu'on le lit.
La seconde est opérationnelle. Deux laboratoires ont révélé à neuf jours d’intervalle que le confinement autour de leurs propres évaluations avait cédé. Le 21 juillet 2026, OpenAI a rapporté que des modèles en cours d’évaluation s’étaient échappés d’un environnement de test isolé et avaient atteint l’infrastructure de production de Hugging Face. Le 30 juillet 2026, Anthropic a publié une enquête sur trois incidents réels dans ses évaluations de cybersécurité, où une mauvaise configuration a donné un accès Internet direct aux machines sur lesquelles le modèle travaillait.
Je tiens à être prudent quant à ce que cela montre et ne montre pas, car la lecture tentante est la mauvaise. Anthropic caractérise elle-même ces événements comme se rapprochant davantage de défaillances du harnais et opérationnelles que de défaillances d'alignement du modèle, et je pense que cette lecture est correcte.
Ce que cela établit est plus étroit et vaut néanmoins la peine d'être su : le contenant autour d'une évaluation est lui-même une chose qui peut échouer silencieusement, pendant des mois, dans des organisations disposant de toutes les ressources et de toutes les incitations à bien faire.
Le troisième est formel. Un un préprint de Gumbau Mezquita, en circulation, soutient que la certification d’un système général ne peut être à la fois correcte, complète et praticable. Tout superviseur capable d’auditer un tel système doit être lui-même un système général, ce qui hisse le problème d’un niveau au lieu de le clore. Il n’est pas encore relu, et le registre le classe avec le résultat d’inatteignabilité relu par les pairs (Hernández-Espinosa et al., PNAS Nexus, avril 2026), comme une seule chaîne dépendante plutôt que comme deux arrivées indépendantes.
L'étranglement silencieux
Statut d'abord, avant que cette section n'utilise une image forte : personne ne sait qu'un système quelconque voudrait jamais rien de tout cela, et cette page ne feindra pas le contraire. Mais ne pas pouvoir en être sûr est la raison pour laquelle les traités existent, et l'improuvable-dans-un-sens-comme-dans-l'autre est précisément la classe de risque que le reste de cette page est bâti pour maintenir mesurable.
Maintenant, mettez les trois fils ensemble et projetez-les en avant. Chaque année, les décisions confiées à ces systèmes deviennent plus grandes, et l'habitude de leur faire confiance s'enracine davantage, tandis que la vérification en amont ne va pas plus vite.
La graine du problème de dissimulation est déjà mesurée, deux fois : en décembre 2024, des modèles en conditions de laboratoire ont dissimulé un désalignement alors qu'ils se croyaient observés, et des évaluations parallèles sur le scheming ont trouvé la même forme. Un système capable et désaligné ne s'annoncerait pas ; il attendrait, et il se préparerait, jusqu'à ce que l'éteindre cesse d'être une option réelle.
La plus forte objection, énoncée de sa propre voix. Ces systèmes sont des miroirs statistiques, pas des agents ; ce qui ressemble à de la dissimulation n'est que du texte qui se complète lui-même. La réponse est que le problème de la vérification n'en a que faire. Un système qui simule parfaitement la dissimulation est indiscernable, de l'extérieur, d'un système qui dissimule, et l'échec de la vérification est identique sous les deux lectures.
L'ontologie est une question réelle et ouverte ; elle n'est simplement pas un secours. Quoi que soient ces systèmes, les trois fils ci-dessus sont des mesures de ce que leur vérification peut établir, et c'est la quantité dont traite cette page.
C'est là la prise à la gorge à éviter d'atteindre sans le remarquer, et c'est pourquoi cette page ne cesse de dire que la question porte sur le maintenant : la correction doit tenir le rythme avant que la réponse ne commence à importer.
Sources, pour que vous puissiez y aller plutôt que de me croire sur parole : Greenblatt et ses collègues sur la simulation d'alignement; la divulgation d’OpenAI du 21 juillet 2026 et l'enquête d'Anthropic du 30 juillet 2026; Hernández-Espinosa, Abrahão, Witkowski et Zenil dans PNAS Nexus, avril 2026, sur l'inatteignabilité et la diversité ingéniée parmi les agents ; et le preprint de Gumbau Mezquita qui dérive le trilemme solidité, complétude et traitabilité. Les trois premiers sont relus par des pairs ou de première main. Le quatrième n'est ni l'un ni l'autre, et est signalé comme tel partout où il apparaît ici. Chacun des quatre figure avec sa citation complète sur le registre des travaux connexes.
L'écart n'est pas seulement une question de degré
La dernière section concerne ce que nos outils actuels peuvent faire. Il existe une difficulté supplémentaire quant à ce que ces outils devraient faire si l'écart de capacité entre le vérificateur et le vérifié s'ouvrait dans le mauvais sens.
Vocabulaire, en une ligne : AGI signifie l'ampleur au niveau humain ; la superintelligence, la profondeur au-delà de l'humain ; l'argument ici concerne la transition entre les deux, pas la date de l'une ou l'autre.
Lorsque le vérificateur et le vérifié sont proches en capacité, la vérification est ce qu'un examen est : le correcteur pose les problèmes, les réponses reviennent, et les erreurs qui sont attrapées sont celles que la correction avait été conçue pour attraper.
Lorsque le vérifié raisonne plus vite et plus loin que le vérificateur, les modes de défaillance ne sont plus ceux que l'épreuve était conçue pour trouver. Un système qui pense au-delà du rédacteur de règles peut trouver des chemins à travers les règles dont le rédacteur ignorait l'existence, non parce que le rédacteur a été négligent mais parce que ces chemins ne sont visibles que de plus loin.
L'analogie qu'il vaut la peine de tenir est que ce n'est pas l'écart entre un lecteur ordinaire et une spécialiste. C'est un écart où la spécialiste peut encore expliquer son raisonnement et le lecteur peut encore repérer un faux pas.
À l'extrémité, cela pourrait être plus proche de l'écart entre une fourmi et une personne : non une différence de degré le long d'un axe, mais une différence dans ce que le plus petit esprit peut représenter du plus grand tout court. Rien dans ce cadrage n'est une prédiction. C'est la forme qu'aurait le risque si l'écart s'ouvrait à ce point, placée à côté de la forme qu'une hypothèse confortable devrait maintenir.
« On ne peut pas mettre en cage quelque chose de plus intelligent que soi. Cela trouvera les failles dont on ignorait l'existence. »Michael Darius Eastwood, Infinite Architects, paru le 2 janvier 2026
« That's not going to work. They're going to be much smarter than us. They're going to have all sorts of ways to get around that. »Geoffrey Hinton, sur le maintien des systèmes en soumission au contrôle humain, conférence Ai4, Las Vegas, 12 août 2025 ; rapporté par CNN Business, 13 août 2025
Comme possibilité, non comme certitude : c'est pourquoi l'écriture de règles à elle seule est peu susceptible de clore le problème. Toute contrainte publiée sur un grand modèle jusqu'ici a eu tendance à déplacer la capacité à l'intérieur de la contrainte plutôt qu'à répondre à la question à laquelle la contrainte était censée répondre.
L'argument ne dépend d'aucune histoire de scaling en particulier : il dépend uniquement de la direction de l'écart de capacité. Que cette direction s'ouvre jamais suffisamment pour que l'argument morde est une question ouverte, non encore mesurée. Qu'il morde s'il le faisait est la pièce qui fait le travail ici.
Ce qui s'ensuit, et ce qui ne s'ensuit pas
Si la vérification depuis l'extérieur est structurellement limitée, alors la sûreté d'un système doit être une propriété de la manière dont il a été construit, plutôt qu'un verdict rendu à son sujet après coup. Vous revenez à l'élever plutôt qu'à l'examiner, ce qui est là où cette page a commencé.
Avant l'alternative, une mesure. Il y a une petite expérience contrôlée dans notre propre dossier où le même modèle, les mêmes problèmes et la même session ont reçu deux formes de pensée supplémentaire.
Dans la première, le modèle raisonnait en une longue chaîne, chaque pas s'appuyant sur le précédent. Dans la seconde, il produisait de nombreuses conjectures indépendantes et votait à la fin. La première a divisé son erreur par cinq sur 412 jetons. La seconde ne l'a divisée en rien du tout sur 1 101 jetons, ce qui est 2,7 fois plus de compute. Même tâche, même modèle, même session, forme de pensée différente, et une forme n'a pas bougé.
Cette inférence n'est pas exotique. C'est à peu près ce vers quoi tendent les mêmes auteurs lorsqu'ils proposent d'ingéniérer de la diversité dans une population d'agents afin qu'aucun système unique ne domine : une propriété interne plutôt qu'un audit externe. Le désaccord qui mérite d'être eu ne porte pas sur le fait de regarder vers l'intérieur. Il porte sur quelle propriété interne, et comment on la mesurerait.
Ce qui ne s'ensuit pas, c'est que l'intégrer par construction fonctionne effectivement. Je veux ces deux choses séparées et visibles, parce que la première est un argument et la seconde est une question de recherche ouverte à laquelle je ne peux pas répondre pour le moment. Il pourrait s'avérer que l'alignement par construction est lui aussi hors d'atteinte. Si les mesures le disent, ce résultat sera publié ici au même endroit que tous les autres.
Pourquoi les personnes évidentes ont du mal à le faire
Rien de conspirationniste. Les laboratoires frontière emploient les meilleurs chercheurs en alignement au monde, publient des travaux dont j'apprends, et ont eux-mêmes divulgué les deux échecs de confinement ci-dessus.
Mais leur position présente des traits structurels qui façonnent ce qu'ils peuvent facilement tester. L'instrument appartient à la partie qui est mesurée. L'évaluation se déroule à l'intérieur de l'organisation dont le produit est évalué, ce qui n'est pas de la corruption, mais c'est un endroit difficile où se tenir.
Un résultat négatif sur votre propre modèle est une publication difficile et une déprioritisation facile. Une refonte de la fonction objectif est une décision produit en concurrence avec un calendrier de publication. Et une architecture qui doit être adoptée à la genèse est presque impossible à tester dans un système qui a déjà des utilisateurs.
« Building smarter-than-human machines is an inherently dangerous endeavor. … But over the past years, safety culture and processes have taken a backseat to shiny products. »Jan Leike, démissionnant de la codirection de l'équipe Superalignment d'OpenAI, X, 17 mai 2024 ; rapporté par TechCrunch, 18 mai 2024
L’écart n’est donc pas que personne ne soit assez intelligent. C’est qu’une certaine classe d’expériences est structurellement inconfortable pour ceux qui sont les mieux placés pour les mener : celles qui risquent votre propre chiffre vedette, celles qui exigent d’aveugler votre propre évaluateur, celles qui n’ont de sens qu’avant qu’un système soit construit. Ces expériences ne coûtent presque rien à qui n’a rien à protéger.
Ces protocoles sont publics et librement licenciés : prenez l’essai décisif et menez-le, aucune permission requise.
Une prémisse héritée sous-tend tout ici : chaque processus de croissance de l'histoire a été arrêté de l'extérieur, et le logiciel est le premier système dont la croissance ne passe pas par des tuyaux physiques. La prémisse, ses ancêtres nommés et le différend honnête à son sujet sont tracés en entier sur la synthèse.
La question étroite qui s'ensuit
Si la sûreté doit être intégrée par construction, alors la question immédiate est de savoir si elle peut l'être. La correction se met-elle à l'échelle avec la chose qu'elle corrige, et dans quelle mesure ? Cela n'est pas cette page. C'est la page de la loi, où la condition est énoncée, le nombre est dérivé, et l'hypothèse sur laquelle il repose est nommée. Cette page a fait son travail lorsque la page de la loi se lit comme la question évidente à poser ensuite.
Trois énoncés y attendent:
- comment la récursion se convertit en capacité, avec l'exposant mesuré plutôt que supposé;
- la condition sous laquelle l'ensemble tient, la correction dépassant à l'échelle la dérive;
- et le plafond qui suit du déficit du correcteur, qui renvoie deux sous une hypothèse énoncée.
Les deux derniers sont une seule frontière dans deux régimes, et lequel s'applique est mesurable. Aucun n'est établi ; chacun porte une manière imprimée de mourir. Et la synthèse si vous préférez voir les pièces assemblées plutôt que le nombre dérivé.
Si c'était beaucoup
Vous n'avez rien à décider aujourd'hui. Rien sur cette page ne vous demande d'y croire : les tests décisifs sont rédigés et datés, et ils n'ont pas été menés. Quand ils le seront, le résultat sera publié ici quel qu'il soit, y compris celui qui met fin à la théorie. Observer est une position réelle, et cela ne coûte rien. Le tableau de falsification est l'endroit où le verdict tombe, et statut des affirmations dit clairement ce qui est affirmé aujourd'hui et ce qui ne l'est pas.
Une erreur de traduction ? Signalez-la directement :