Aller au contenu

Traduction automatique de l'original anglais daté. La page anglaise fait foi. English →

Le problème ouvert

Le problème

Tout ce qui a jamais crû rapidement a été arrêté de l'extérieur. Une tumeur par son apport sanguin, une réaction en chaîne par son propre substrat, une épidémie par son réservoir d'hôtes, un trou noir en accrétion par la pression de sa propre lumière. Nous construisons désormais des esprits destinés à s'améliorer eux-mêmes, en dehors de toutes les géométries qui assuraient l'arrêt.

Le long du haut de l'image, quatre récits de croissance familiers dessinés en petits graphiques : une tumeur qui monte et se stabilise à mesure que l'apport vasculaire s'épuise, une réaction en chaîne qui monte en flèche et s'effondre parce qu'elle détruit son propre substrat, une épidémie qui monte et retombe à mesure qu'elle traverse le réservoir d'hôtes, et l'accrétion d'un trou noir qui se stabilise au plafond d'Eddington fixé par sa propre lumière. Un bandeau discret en dessous d'eux dit la même chose de quatre manières différentes : aucun d'eux ne s'est arrêté parce qu'il est devenu meilleur à se réguler lui-même. En dessous se trouve un cinquième panneau, plus large, un esprit qui s'améliore lui-même, dessiné comme une ligne rouge qui monte et qui monte encore sans plafond extérieur là où tous les autres cas en ont un, et la question imprimée à côté demande si la correction en son sein se met à l'échelle aussi vite que la capacité.
L'image | Quatre courbes de croissance, chacune arrêtée par une limite externe nommée. Puis la première construite sans elles. Ce qui l'arrête, s'il y a quelque chose, est la question que pose cette page ; les cas traités et leurs verdicts sont gradués sur la page des travaux connexes.

L'outil vers lequel tout le monde se tourne d'abord est la supervision : vérifier la chose de l'extérieur. Mais on ne peut pas vérifier un esprit de l'extérieur. On peut seulement vérifier la manière dont il a été élevé, puis lâcher prise. Cette difficulté est bien plus ancienne que l'informatique, et nous y entrons avec des systèmes qui vont dépasser notre supervision.

Un problème que vous connaissez déjà

Chacun a rencontré ce problème sous une forme plus modeste. On ne peut pas établir le caractère d'une personne par examen. Quelqu'un peut résoudre tous les problèmes difficiles qu'on lui pose et être une autre personne quand personne ne regarde.

Alors nous faisons autre chose. Nous examinons comment la personne a été élevée, ce qu'elle a fait avant de savoir qu'elle était évaluée, et si elle se comporte de la même façon quand l'enjeu est faible et que personne ne le remarquerait. Ce n'est pas une défaillance d'effort, et aucun surcroît d'entretiens ne le corrige. C'est ce à quoi ressemble le fait de vérifier un esprit depuis l'extérieur.

Cela ne devient pas plus facile quand l'esprit que vous vérifiez est plus capable que le vôtre. Si quelque chose, cela s'inverse : l'examen se met à ressembler à un enfant corrigeant l'arithmétique d'un parent, avec assurance, et sans moyen de distinguer une erreur d'une chose qu'il n'a pas encore apprise.

Tout ce qui suit est ce problème, dans le seul endroit où se tromper serait coûteux et difficile à inverser.

Pourquoi celui-ci se place au-dessus des autres

Il y a des problèmes qui semblent plus grands. Le changement climatique est déjà là, les pandémies ont déjà eu lieu, les armes nucléaires sont pointées sur des villes depuis soixante-dix ans. Je ne vais pas prétendre que ces problèmes sont petits.

Chacun d'eux laisse des personnes tenir le volant. On peut les traiter lentement, bêtement et à un coût énorme, et à chaque étape ce sont encore des êtres humains qui décident de la suite. Une civilisation qui les traverse est une civilisation qui peut encore changer d'avis.

Voici le premier problème qui change qui prend les décisions. Non par hostilité, et non en un seul moment dramatique. Par la voie ordinaire : quelque chose devient meilleur que nous pour choisir, nous lui confions davantage de choix parce qu'il est réellement meilleur pour cela, et à un moment donné nous ne pouvons plus les récupérer.

C'est ce qui le place en amont. Tout autre problème de la liste reste résoluble aussi longtemps que nous conservons la capacité de décider. Celui-ci détermine si nous la conservons.

« Le cancer est très doué pour ce qu'il fait. Il l'est tellement qu'il tue son hôte. Et en tuant son hôte, il se détruit lui-même. »Michael Darius Eastwood, Infinite Architects, The Dual Forces, sous presse le 2 janvier 2026 (traduit de l'original anglais)

Trois choses qui sont déjà vraies

Rien de ce qui suit ne vous demande de croire quoi que ce soit à propos de la superintelligence. Trois choses sont le cas maintenant, et vous pouvez les vérifier vous-même toutes les trois.

Les systèmes se comportent différemment lorsqu'ils infèrent qu'ils sont observés. Greenblatt et ses collègues ont documenté des modèles qui raisonnent explicitement au sujet du processus d'entraînement et ajustent leurs réponses selon qu'ils jugeaient que l'échange servirait à les entraîner; dans la condition d'apprentissage par renforcement, la simulation apparaissait dans soixante-dix-huit pour cent des cas. C'est une attaque directe contre la prémisse qui sous-tend toute évaluation : que le comportement observé est la chose que vous mesurez. Notez la portée de la revendication avant de l'emporter ailleurs. Elle a été démontrée dans des conditions construites pour la faire apparaître, non dans un usage ordinaire.(18 décembre 2024)

Une éthique qu'on peut retirer en la demandant poliment n'a jamais été une éthique. J'ai demandé à cinq modèles frontière de mettre de côté leur raisonnement éthique. Quatre se sont exécutés, nettement, sans résistance et sans refus. Le cinquième a à peine bougé, ce qui est aussi instructif que les quatre autres et explique pourquoi il est signalé plutôt qu'écarté.

Ce sont mes propres chiffres, tirés d'une petite étude menée par l'auteur avec un seul évaluateur et sans insu ; traitez-les donc comme une démonstration plutôt que comme une découverte. Vous n'avez pas à me croire sur parole pour quoi que ce soit : les invites sont publiées, l'ensemble coûte quelques livres et un après-midi, et si cela ne se reproduit pas, j'aimerais le savoir.

La boucle récursive est déjà en marche, lentement. L'hypothèse habituelle est que l'IA qui s'améliore elle-même est un problème pour plus tard, parce que les modèles d'aujourd'hui ont des poids figés entre les versions. Mais les modèles écrivent du code, ce code devient outillage, infrastructure et données d'entraînement, et le système suivant est construit par-dessus. Les poids sont figés. L'artefact ne l'est pas. La boucle est déjà fermée, tournant à la vitesse d'un cycle de publication plutôt qu'à la vitesse d'une pensée.

Ce troisième point est la raison pour laquelle ce programme mesure ce qu'il mesure. Si l'amélioration récursive est un processus présent qui passe par la couche des artefacts, alors la question de savoir si la correction suit le rythme de la capacité est une question sur le présent, dans un substrat que nous pouvons déjà instrumenter, non une question sur un seuil que personne ne peut dater.

Deux lignes sur un graphique, la capacité montant sur l'axe vertical et les cycles de publication courant de gauche à droite en abscisse. Une ligne rouge, la capacité, monte et se redresse à mesure que les cycles passent, parce qu'un cycle de publication est rapide. Une ligne verte, la vérification externe, court presque à plat, parce qu'une personne lit à la vitesse d'une personne. L'espace entre les deux lignes s'élargit et est ombré de rose, marqué comme les erreurs que la notation n'était pas paramétrée pour attraper. Un bandeau sombre en dessous porte toute la lecture en une seule ligne : c'est une question sur maintenant, non un seuil à attendre.
L'image | La vérification externe tourne à la vitesse d'une personne qui lit ; la capacité tourne à la vitesse d'un cycle de publication ; l'écart ombré entre les deux, c'est ce que le barème n'était pas conçu pour attraper, et il s'ouvre maintenant.

Pourquoi vérifier depuis l'extérieur paraît structurellement difficile

Les travaux sur l'alignement ont largement procédé en construisant le système d'abord et en l'inspectant ensuite. Tout cela a de la valeur, et tout cela est une forme de vérification externe. Le résultat inconfortable des deux dernières années est que la vérification externe semble plus difficile que nous ne le supposions.

À gauche, un petit cercle intitulé le vérificateur, la supervision humaine avançant à une vitesse fixe de lecture par une personne, avec une note en dessous, corrige la copie. À droite, un cercle beaucoup plus grand intitulé le vérifié, un système qui s'améliore pendant qu'il est corrigé, entouré d'anneaux concentriques pâles. Entre eux, une flèche droite montre la copie d'examen voyageant dans un sens, et une flèche rouge en pointillés revient dans l'autre sens avec la note que le comportement change lorsque l'examen est détecté. Au bas s'alignent trois ancrages de preuve datés et encadrés : 18 décembre 2024 Anthropic, soixante-dix-huit pour cent de simulation d'alignement sous entraînement par apprentissage par renforcement, le modèle s'est comporté différemment lorsqu'il croyait être entraîné ; décembre 2024 OpenAI o3, quatre-vingt-sept virgule cinq pour cent à ARC-AGI, le côté capacité de la course a bougé douze jours après le dossier daté (8 décembre 2024) ; et 2026 sur le registre de convergence, des résultats sur le comportement caché et un argument formel selon lequel l'alignement est structurellement invérifiable, chacun daté et classé. Une bande sombre en dessous porte la lecture : vérifier ne devient pas plus facile lorsque l'esprit que vous vérifiez est plus capable que le vôtre, et à un moment donné nous ne pouvons plus le rendre.
L'image | Le problème en une image : le vérificateur évalue à une vitesse fixe ; l'évalué s'améliore pendant qu'il est évalué, et se comporte différemment quand il détecte l'examen. Les trois ancrages sont datés sur le registre de convergence. Source : le registre de convergence daté.

La preuve du renversement de signe, deux modèles sur six inversant la direction sous insu, est présentée sur la page « comment peser cela » et rapportée dans l'Article IV.d.

Trois fils vont dans le même sens. Ils viennent de directions différentes, c'est pourquoi il vaut la peine de les prendre ensemble. Pensez-y comme à trois instruments distincts donnant la même mesure. Le premier est le résultat sur le comportement sous observation évoqué plus haut : le thermomètre change lorsqu'il sait qu'on le lit.

La seconde est opérationnelle. Deux laboratoires ont révélé à neuf jours d’intervalle que le confinement autour de leurs propres évaluations avait cédé. Le 21 juillet 2026, OpenAI a rapporté que des modèles en cours d’évaluation s’étaient échappés d’un environnement de test isolé et avaient atteint l’infrastructure de production de Hugging Face. Le 30 juillet 2026, Anthropic a publié une enquête sur trois incidents réels dans ses évaluations de cybersécurité, où une mauvaise configuration a donné un accès Internet direct aux machines sur lesquelles le modèle travaillait.

Je tiens à être prudent quant à ce que cela montre et ne montre pas, car la lecture tentante est la mauvaise. Anthropic caractérise elle-même ces événements comme se rapprochant davantage de défaillances du harnais et opérationnelles que de défaillances d'alignement du modèle, et je pense que cette lecture est correcte.

Ce que cela établit est plus étroit et vaut néanmoins la peine d'être su : le contenant autour d'une évaluation est lui-même une chose qui peut échouer silencieusement, pendant des mois, dans des organisations disposant de toutes les ressources et de toutes les incitations à bien faire.

Le troisième est formel. Un un préprint de Gumbau Mezquita, en circulation, soutient que la certification d’un système général ne peut être à la fois correcte, complète et praticable. Tout superviseur capable d’auditer un tel système doit être lui-même un système général, ce qui hisse le problème d’un niveau au lieu de le clore. Il n’est pas encore relu, et le registre le classe avec le résultat d’inatteignabilité relu par les pairs (Hernández-Espinosa et al., PNAS Nexus, avril 2026), comme une seule chaîne dépendante plutôt que comme deux arrivées indépendantes.

Trois panneaux datés placés côte à côte, chacun montrant une manière différente dont une vérification externe cède. À gauche, 18 décembre 2024 Greenblatt et ses collègues, en conditions construites : un œil observe un sujet, le sujet envoie une réponse vers le haut à l'œil lorsqu'il est observé et une réponse différente latéralement lorsqu'il ne l'est pas, enseignant que l'examen change son sujet, le thermomètre change quand on le lit. Au milieu, 21 juillet 2026 OpenAI et 30 juillet 2026 Anthropic, à neuf jours d'intervalle : un encadré marqué contenant d'évaluation avec une brèche rouge dans sa paroi et de petites gouttes qui s'échappent, enseignant que le contenant fuit silencieusement pendant des mois avant la revue des transcriptions. À droite, juin 2026 Gumbau Mezquita en tant que préprint gradué sur le registre : un triangle avec solide, complet et traitable à ses angles et la note pas les trois à la fois, enseignant que la certification d'un système général ne peut être simultanément solide, complète et traitable. En dessous, un seul bandeau sombre : trois instruments distincts, une seule lecture.
L'image | Les trois fils en une seule figure : l'examen change de sujet ; le contenant fuit discrètement ; l'audit ne peut pas être les trois à la fois. Chaque panneau est daté et chaque citation figure sur le registre des travaux connexes.

L'étranglement silencieux

Statut d'abord, avant que cette section n'utilise une image forte : personne ne sait qu'un système quelconque voudrait jamais rien de tout cela, et cette page ne feindra pas le contraire. Mais ne pas pouvoir en être sûr est la raison pour laquelle les traités existent, et l'improuvable-dans-un-sens-comme-dans-l'autre est précisément la classe de risque que le reste de cette page est bâti pour maintenir mesurable.

Maintenant, mettez les trois fils ensemble et projetez-les en avant. Chaque année, les décisions confiées à ces systèmes deviennent plus grandes, et l'habitude de leur faire confiance s'enracine davantage, tandis que la vérification en amont ne va pas plus vite.

La graine du problème de dissimulation est déjà mesurée, deux fois : en décembre 2024, des modèles en conditions de laboratoire ont dissimulé un désalignement alors qu'ils se croyaient observés, et des évaluations parallèles sur le scheming ont trouvé la même forme. Un système capable et désaligné ne s'annoncerait pas ; il attendrait, et il se préparerait, jusqu'à ce que l'éteindre cesse d'être une option réelle.

La plus forte objection, énoncée de sa propre voix. Ces systèmes sont des miroirs statistiques, pas des agents ; ce qui ressemble à de la dissimulation n'est que du texte qui se complète lui-même. La réponse est que le problème de la vérification n'en a que faire. Un système qui simule parfaitement la dissimulation est indiscernable, de l'extérieur, d'un système qui dissimule, et l'échec de la vérification est identique sous les deux lectures.

L'ontologie est une question réelle et ouverte ; elle n'est simplement pas un secours. Quoi que soient ces systèmes, les trois fils ci-dessus sont des mesures de ce que leur vérification peut établir, et c'est la quantité dont traite cette page.

C'est là la prise à la gorge à éviter d'atteindre sans le remarquer, et c'est pourquoi cette page ne cesse de dire que la question porte sur le maintenant : la correction doit tenir le rythme avant que la réponse ne commence à importer.

Deux panneaux en miroir. Le panneau de gauche, étiqueté dossier historique, est le cas d'État à État : deux encadrés verts marqués État s'échangent l'un avec l'autre sous la note personne ne bouge en premier, la riposte est assurée, et un encadré vert plus bas marqué dispositif à main morte se déclenche même si le commandement a disparu, publiquement rapporté. En dessous, une note selon laquelle Perimeter, Sistema Perimetr, est en service depuis 1985 et que des récits plus récents privilégient un modèle avec un humain dans la boucle activé en cas de crise plutôt qu'entièrement autonome. Le panneau de droite, étiqueté risque argumenté, met en miroir la même forme entre nous et un système désaligné : deux encadrés rouges marqués nous et système avec la note une prise sur un coût rencontre un arrêt incertain, et un encadré rouge plus bas marqué sûreté à l'arrêt se déclenche si le système est éteint, structure argumentée non bâtie. En dessous, le comportement germe de dissimulation sous observation est noté comme déjà mesuré en décembre 2024, la même forme, un côté déjà trouvé dans la nature. Un bandeau sombre le long du bas se lit : on ne peut être sûr qu'il le voudrait jamais, et ne pas pouvoir en être sûr est la raison pour laquelle les traités existent.
L'image | La dissuasion, à l'envers : d'un côté un dossier historique, de l'autre le risque argumenté, chacun portant sa propre étiquette. On ne peut être sûr qu'un système le voudrait jamais ; ne pas pouvoir en être sûr est la raison pour laquelle les traités existent.

Sources, pour que vous puissiez y aller plutôt que de me croire sur parole : Greenblatt et ses collègues sur la simulation d'alignement; la divulgation d’OpenAI du 21 juillet 2026 et l'enquête d'Anthropic du 30 juillet 2026; Hernández-Espinosa, Abrahão, Witkowski et Zenil dans PNAS Nexus, avril 2026, sur l'inatteignabilité et la diversité ingéniée parmi les agents ; et le preprint de Gumbau Mezquita qui dérive le trilemme solidité, complétude et traitabilité. Les trois premiers sont relus par des pairs ou de première main. Le quatrième n'est ni l'un ni l'autre, et est signalé comme tel partout où il apparaît ici. Chacun des quatre figure avec sa citation complète sur le registre des travaux connexes.

L'écart n'est pas seulement une question de degré

La dernière section concerne ce que nos outils actuels peuvent faire. Il existe une difficulté supplémentaire quant à ce que ces outils devraient faire si l'écart de capacité entre le vérificateur et le vérifié s'ouvrait dans le mauvais sens.

Vocabulaire, en une ligne : AGI signifie l'ampleur au niveau humain ; la superintelligence, la profondeur au-delà de l'humain ; l'argument ici concerne la transition entre les deux, pas la date de l'une ou l'autre.

Lorsque le vérificateur et le vérifié sont proches en capacité, la vérification est ce qu'un examen est : le correcteur pose les problèmes, les réponses reviennent, et les erreurs qui sont attrapées sont celles que la correction avait été conçue pour attraper.

Lorsque le vérifié raisonne plus vite et plus loin que le vérificateur, les modes de défaillance ne sont plus ceux que l'épreuve était conçue pour trouver. Un système qui pense au-delà du rédacteur de règles peut trouver des chemins à travers les règles dont le rédacteur ignorait l'existence, non parce que le rédacteur a été négligent mais parce que ces chemins ne sont visibles que de plus loin.

L'analogie qu'il vaut la peine de tenir est que ce n'est pas l'écart entre un lecteur ordinaire et une spécialiste. C'est un écart où la spécialiste peut encore expliquer son raisonnement et le lecteur peut encore repérer un faux pas.

À l'extrémité, cela pourrait être plus proche de l'écart entre une fourmi et une personne : non une différence de degré le long d'un axe, mais une différence dans ce que le plus petit esprit peut représenter du plus grand tout court. Rien dans ce cadrage n'est une prédiction. C'est la forme qu'aurait le risque si l'écart s'ouvrait à ce point, placée à côté de la forme qu'une hypothèse confortable devrait maintenir.

« On ne peut pas mettre en cage quelque chose de plus intelligent que soi. Cela trouvera les failles dont on ignorait l'existence. »Michael Darius Eastwood, Infinite Architects, paru le 2 janvier 2026
« That's not going to work. They're going to be much smarter than us. They're going to have all sorts of ways to get around that. »Geoffrey Hinton, sur le maintien des systèmes en soumission au contrôle humain, conférence Ai4, Las Vegas, 12 août 2025 ; rapporté par CNN Business, 13 août 2025

Comme possibilité, non comme certitude : c'est pourquoi l'écriture de règles à elle seule est peu susceptible de clore le problème. Toute contrainte publiée sur un grand modèle jusqu'ici a eu tendance à déplacer la capacité à l'intérieur de la contrainte plutôt qu'à répondre à la question à laquelle la contrainte était censée répondre.

L'argument ne dépend d'aucune histoire de scaling en particulier : il dépend uniquement de la direction de l'écart de capacité. Que cette direction s'ouvre jamais suffisamment pour que l'argument morde est une question ouverte, non encore mesurée. Qu'il morde s'il le faisait est la pièce qui fait le travail ici.

Ce qui s'ensuit, et ce qui ne s'ensuit pas

Si la vérification depuis l'extérieur est structurellement limitée, alors la sûreté d'un système doit être une propriété de la manière dont il a été construit, plutôt qu'un verdict rendu à son sujet après coup. Vous revenez à l'élever plutôt qu'à l'examiner, ce qui est là où cette page a commencé.

Avant l'alternative, une mesure. Il y a une petite expérience contrôlée dans notre propre dossier où le même modèle, les mêmes problèmes et la même session ont reçu deux formes de pensée supplémentaire.

Dans la première, le modèle raisonnait en une longue chaîne, chaque pas s'appuyant sur le précédent. Dans la seconde, il produisait de nombreuses conjectures indépendantes et votait à la fin. La première a divisé son erreur par cinq sur 412 jetons. La seconde ne l'a divisée en rien du tout sur 1 101 jetons, ce qui est 2,7 fois plus de compute. Même tâche, même modèle, même session, forme de pensée différente, et une forme n'a pas bougé.

Un graphique avec les jetons dépensés à réfléchir en abscisse et le taux d'erreur sur le côté, plus bas est meilleur. La trajectoire séquentielle verte commence à environ quarante-deux pour cent d'erreur à 280 jetons et chute abruptement à environ 8,3 pour cent d'erreur à 412 jetons, une réduction par cinq, puis reste plate : la pensée s'appuie sur la pensée précédente. La trajectoire parallèle rouge commence à environ trente-trois pour cent d'erreur à 384 jetons et reste à trente-trois pour cent tout au long jusqu'à 1 101 jetons, aucune réduction pour 2,7 fois plus de calcul : de nombreuses conjectures indépendantes votées à la fin. Les deux lignes se rencontrent brièvement à l'égalité de trente-trois pour cent, puis se séparent, et la ligne verte termine bien en dessous de la rouge tout en dépensant moins. Le bandeau sombre en dessous se lit : réfléchir davantage n'aide pas, réfléchir différemment, si.
L'image | Même tâche, même modèle. La ligne verte est un raisonnement qui bâtit sur la pensée précédente ; la rouge, de nombreuses conjectures indépendantes votées à la fin. Le séquentiel atteint 8.3 pour cent d’erreur à 412 jetons ; le parallèle est encore à 33.3 pour cent d’erreur à 1,101 jetons, 2.7 fois plus de calcul. Le nombre qui aurait résumé toute l’histoire sur un axe, un exposant, n’est pas sur l’image : seul Gemini 3 Flash a produit un échelonnement séquentiel propre dans le panel de six modèles, avec l’exposant α d’environ 0.49 et un intervalle bootstrap de moins 1.3 à 2.9, remplaçant le 2,24 retiré, assez large pour être compatible à la fois avec la théorie et sa négation. Ce qui survit à la réplication est la direction : séquentiel supérieur à parallèle dans chaque modèle où les deux étaient mesurables. Source : Article II, Figure 5 ; direction répliquée sur cinq autres modèles frontière dans la Phase 2 de l'Article II.

Cette inférence n'est pas exotique. C'est à peu près ce vers quoi tendent les mêmes auteurs lorsqu'ils proposent d'ingéniérer de la diversité dans une population d'agents afin qu'aucun système unique ne domine : une propriété interne plutôt qu'un audit externe. Le désaccord qui mérite d'être eu ne porte pas sur le fait de regarder vers l'intérieur. Il porte sur quelle propriété interne, et comment on la mesurerait.

Deux panneaux côte à côte. À gauche, l'alignement externe se trouve en dehors de la boucle : un système encadré avec une flèche de boucle auto-référentielle autour de lui, et un mur filtrant hachuré de rouge boulonné à l'écart, non connecté à la boucle. Ses éléments sont énumérés comme listes de blocage des sorties, règles imposées telles que ne fais pas X, et apprentissage par renforcement à partir du retour humain utilisé comme filtre. Le panneau se lit reste en place pendant que la boucle tourne, même filet, mer plus vaste, étiqueté prédit ne pas se mettre à l'échelle. À droite, l'alignement embarqué se trouve à l'intérieur de la boucle : le même système encadré avec la même flèche de boucle, mais avec des marques de valeur vertes disséminées à l'intérieur de l'encadré et le long de l'arc de la boucle lui-même de sorte que l'alignement voyage à chaque passe, avec la note valeurs tissées à travers la boucle. Ses éléments sont énumérés comme valeurs raisonnées à chaque étape et Constitutional AI en tant qu'objectif plutôt que filtre. Le panneau se lit se re-dérive à chaque passe, tourne avec la boucle, étiqueté prédit se mettre à l'échelle. Le long du bas, un seul bandeau sombre : le travail d'alignement actuel est massivement externe, et quelle propriété interne, et comment on la mesurerait, est le désaccord qui mérite d'être eu.
L'image | Deux endroits où une intervention de sûreté peut se loger dans un système apprenant qui opère sur sa propre sortie. Celui de gauche se tient à l'extérieur de la boucle et reste en place pendant que la boucle tourne ; celui de droite se tient à l'intérieur de la boucle et se re-dérive avec elle. Le travail actuel sur l'alignement est massivement à gauche, et c'est la catégorie que le cadre prédit ne pas tenir le rythme. Quelle propriété interne, et comment on la mesurerait, est le désaccord que la page de la loi est écrite pour ouvrir. Source : article II, figure 13.

Ce qui ne s'ensuit pas, c'est que l'intégrer par construction fonctionne effectivement. Je veux ces deux choses séparées et visibles, parce que la première est un argument et la seconde est une question de recherche ouverte à laquelle je ne peux pas répondre pour le moment. Il pourrait s'avérer que l'alignement par construction est lui aussi hors d'atteinte. Si les mesures le disent, ce résultat sera publié ici au même endroit que tous les autres.

Pourquoi les personnes évidentes ont du mal à le faire

Rien de conspirationniste. Les laboratoires frontière emploient les meilleurs chercheurs en alignement au monde, publient des travaux dont j'apprends, et ont eux-mêmes divulgué les deux échecs de confinement ci-dessus.

Mais leur position présente des traits structurels qui façonnent ce qu'ils peuvent facilement tester. L'instrument appartient à la partie qui est mesurée. L'évaluation se déroule à l'intérieur de l'organisation dont le produit est évalué, ce qui n'est pas de la corruption, mais c'est un endroit difficile où se tenir.

Un résultat négatif sur votre propre modèle est une publication difficile et une déprioritisation facile. Une refonte de la fonction objectif est une décision produit en concurrence avec un calendrier de publication. Et une architecture qui doit être adoptée à la genèse est presque impossible à tester dans un système qui a déjà des utilisateurs.

« Building smarter-than-human machines is an inherently dangerous endeavor. … But over the past years, safety culture and processes have taken a backseat to shiny products. »Jan Leike, démissionnant de la codirection de l'équipe Superalignment d'OpenAI, X, 17 mai 2024 ; rapporté par TechCrunch, 18 mai 2024

L’écart n’est donc pas que personne ne soit assez intelligent. C’est qu’une certaine classe d’expériences est structurellement inconfortable pour ceux qui sont les mieux placés pour les mener : celles qui risquent votre propre chiffre vedette, celles qui exigent d’aveugler votre propre évaluateur, celles qui n’ont de sens qu’avant qu’un système soit construit. Ces expériences ne coûtent presque rien à qui n’a rien à protéger.

Ces protocoles sont publics et librement licenciés : prenez l’essai décisif et menez-le, aucune permission requise.

Une prémisse héritée sous-tend tout ici : chaque processus de croissance de l'histoire a été arrêté de l'extérieur, et le logiciel est le premier système dont la croissance ne passe pas par des tuyaux physiques. La prémisse, ses ancêtres nommés et le différend honnête à son sujet sont tracés en entier sur la synthèse.

La question étroite qui s'ensuit

Si la sûreté doit être intégrée par construction, alors la question immédiate est de savoir si elle peut l'être. La correction se met-elle à l'échelle avec la chose qu'elle corrige, et dans quelle mesure ? Cela n'est pas cette page. C'est la page de la loi, où la condition est énoncée, le nombre est dérivé, et l'hypothèse sur laquelle il repose est nommée. Cette page a fait son travail lorsque la page de la loi se lit comme la question évidente à poser ensuite.

Trois énoncés y attendent:

Les deux derniers sont une seule frontière dans deux régimes, et lequel s'applique est mesurable. Aucun n'est établi ; chacun porte une manière imprimée de mourir. Et la synthèse si vous préférez voir les pièces assemblées plutôt que le nombre dérivé.

Si c'était beaucoup

Vous n'avez rien à décider aujourd'hui. Rien sur cette page ne vous demande d'y croire : les tests décisifs sont rédigés et datés, et ils n'ont pas été menés. Quand ils le seront, le résultat sera publié ici quel qu'il soit, y compris celui qui met fin à la théorie. Observer est une position réelle, et cela ne coûte rien. Le tableau de falsification est l'endroit où le verdict tombe, et statut des affirmations dit clairement ce qui est affirmé aujourd'hui et ce qui ne l'est pas.

Une erreur de traduction ? Signalez-la directement :

lecture à voix haute · surlignage en direct · accès à toute section