Traduction automatique de l'original anglais daté. La page anglaise fait foi. English →
L'article de synthèse du programme de recherche ARC/Eden ; intègre les articles qui le précèdent en une évaluation honnête unique de ce qui est prouvé, de ce qui est peu concluant et de ce qui reste à tester.
Au sein de l'ARC Theory : la synthèse et la feuille de route, y compris le catalogue de ce que le programme a eu de faux.
Le programme de recherche ARC/Eden s'étend désormais à un ensemble complet de documents et à une série d'études empiriques indépendantes couvrant les fondements mathématiques, la méthodologie, la validation empirique, la spécification d'ingénierie et la vision philosophique. Les concepts centraux ont été articulés pour la première fois le 8 décembre 2024 dans un courriel présentant un champ d'origine Gmail visible, avec DKIM d'expéditeur et mathématiques Google ARC appariées vérifiant contre des clés capturées aux sélecteurs signés, sans horodatage de confiance RFC 3161. Le livre Infinite Architects (ISBN 978-1806056200) a été publié le 2 janvier 2026 (imprimé ; livre numérique le 6 janvier). Le programme de recherche a été produit entre février et août 2026 et couvre désormais vingt-six articles, un programme enregistré de soixante-douze unités de préenregistrement rédigées en attente de soumission humaine, dont les calendriers se régénèrent octet-pour-octet à partir d'une graine publiée, et un champ proposé, Recursive Dynamics, dont l'article fondateur porte la propre condition d'invalidation du nom (DOI 10.17605/OSF.IO/HCPBU). Cet article de synthèse intègre toutes les conclusions en une évaluation honnête unique. Les lois du cadre sont portées comme conjectures nommées, avec le statut imprimé à côté du nom : Law I, l'ARC Principle ; Law II, l'ARC Co-Scaling Law ; Law III, l'ARC Ceiling, dont l'ARC Bound de deux est la valeur du Ceiling à un demi ; le levier de correction gamma n'a jamais été mesuré, par personne. À travers les études empiriques : 1 a produit un résultat positif clair (simulation à porte, la seule expérience utilisant des métriques déterministes sur un système sans entraînement RLHF préexistant), 2 ont produit des résultats nuls (DGM v3, où les modèles entraînés par RLHF ont résisté à la différenciation au niveau du prompt), 1 a produit des résultats peu concluants (ajustement fin LoRA au niveau des poids, où les modèles instruits étaient trop forts pour que LoRA les surpasse), et le reste a produit des résultats statistiquement significatifs sous évaluation aveuglée. La borne géométrique d'échelle $d/(d+1)$, proposée comme relation invariante sous test, correspond aux échelles observées à travers 50 domaines des souris aux galaxies, et les équations fonctionnelles de Cauchy fixent la forme fonctionnelle une fois données l'identité de composition et une condition de régularité, la saturation étant admise comme un quatrième cas, plafonné, plutôt que comme solution de ces équations. Cet article cartographie exactement ce qui a été prouvé, ce qui ne l'a pas été, et quelles expériences résoudraient chaque question ouverte. Il documente également les erreurs et corrections du programme, parce qu'un cadre bâti sur l'auto-correction itérative doit pratiquer ce qu'il prêche.
Mots-clés : alignement de l'IA, synthèse, hiérarchie des preuves, ARC Principle, Eden Protocol, échelle de Cauchy, IA auto-modifiante, alignement développemental, intrication structurelle
Cet article porte la carte. Il intègre les articles précédents de l'ARC Theory en une évaluation honnête unique de ce qui a été démontré, de ce qui reste peu concluant et de ce qui n'a pas encore été testé. Le différentiel complet contre chaque document antérieur se trouve à eden-vision II.A.8.
Un corpus de documents. Une série d'expériences indépendantes. Certains résultats sont solides. Certains sont faibles. Deux ont produit des résultats nuls. Un a été peu concluant. Un a été positif. Ce document vous dit exactement lequel est lequel, sans enjolivure. Nous avons posé les questions. Nous les avons testées. Certaines ont fonctionné. La plupart n'ont pas fonctionné à l'échelle actuelle. Nous avons rapporté les deux. Voici à quoi ressemble la science honnête. Si vous lisez un seul article de la suite, lisez celui-ci.
L'ARC Principle et la thèse de l'alignement intégré (nommée plus tard Eden Protocol le 30 avril 2025) ont été articulés pour la première fois le 8 décembre 2024 dans un courriel présentant un champ d'origine Gmail visible, avec DKIM d'expéditeur et mathématiques Google ARC appariées vérifiant contre des clés capturées aux sélecteurs signés, sans horodatage de confiance RFC 3161. Il s'agit de la date de revendication de priorité du cadre. Le livre Infinite Architects : Intelligence, Recursion, and the Creation of Everything (ISBN 978-1806056200) a été publié le 2 janvier 2026 (imprimé ; livre numérique le 6 janvier), fournissant les fondements philosophiques et conceptuels. Le programme de recherche a été produit entre février et mars 2026, traduisant le cadre conceptuel du livre en hypothèses testables et exécutant une série d'études empiriques indépendantes.
Le programme de recherche ARC/Eden couvre désormais son ensemble complet de documents. Le programme couvre les fondements mathématiques (Papers I, III, VII, Origin of Scaling Laws), la méthodologie (Papers IV.a-d), la validation empirique (Papers II, V, VIII), la spécification d'ingénierie (Eden Engineering), la vision philosophique (Eden Vision), dynamique et auto-audit (Papers X, XI, XII et XIII), la monographie longue (HRIH), validation de construit (Paper C), la proposition de champ (Recursive Dynamics: The Proposal of a Field), la synthèse (cet article), et la navigation du programme (Executive Summary, Master Table of Contents).
Cette portée crée un problème. Un examinateur qui rencontre le programme pour la première fois fait face à son ensemble complet de documents, à plusieurs versions, à plusieurs corrections et à un mélange de résultats forts, de résultats nuls, de résultats peu concluants et d'affirmations théoriques. Sans un document unique qui trie les preuves honnêtement, le programme risque d'être rejeté soit comme survendu, soit comme incompréhensible.
Ceci est ce document.
Son but est étroit : indiquer ce que le programme a prouvé, ce qu'il n'a pas prouvé, et ce qui serait nécessaire pour résoudre chaque question ouverte. Il est écrit pour trois publics simultanément - les bailleurs qui décident d'investir, les examinateurs par les pairs qui décident de s'engager, et l'auteur lui-même, qui a besoin d'un bilan honnête de l'état des choses.
Le standard appliqué partout est simple. Si un résultat survit à $p < 0.05$ sous un test statistique approprié et a été répliqué à travers plusieurs modèles ou domaines, il est prouvé à l'échelle pilote. S'il survit à $p < 0.05$ mais manque de réplication, il est soutenu. Si l'expérience n'a pas produit de preuve pour ou contre l'hypothèse, elle est peu concluante. Si l'affirmation n'a pas été testée empiriquement, elle est théorique. Aucun résultat de ce programme n'est présenté comme prouvé à l'échelle frontière. Cette distinction compte, et cet article ne l'estompera pas.
Le Tableau 1 présente la hiérarchie complète des preuves du programme. Chaque affirmation empirique est assignée à l'un de cinq paliers en fonction de la force et du statut de la réplication.
| Palier | Statut | Articles | Résultat clé |
|---|---|---|---|
| Prouvé (p<0,05, répliqué) | Fort | IV.a-d, V, VII | Hiérarchie d'alignement à trois paliers sous évaluation aveuglée à travers six modèles. Le soin des parties prenantes s'améliore dans les cinq modèles analysables (résultats par modèle ; le chiffre combiné de Fisher est retiré, AQ-017). Les familles de Cauchy correspondent à 19/25 domaines ($p = 1.56 \times 10^{-5}$). La borne d'échelle géométrique $d/(d+1)$ correspond, en structure, aux échelles observées à travers 50 domaines. |
| Positif (expérience unique) | Modéré | VIII Exp 3 | Simulation contrôlée : empreinte de Babylone confirmée (+4,5 % de capacité, -2,4 % de sécurité). Contrôle de la traînée confirmé. La SEULE expérience qui a produit un résultat positif clair, précisément parce qu'elle utilise des métriques déterministes sur un système sans entraînement RLHF préexistant. |
| Nul | Aucun effet | VIII Exp 1 | Auto-modification au niveau du code DGM avec juge GPT-5.4. Toutes conditions identiques ($p = 0.28$-$0.74$). Cause racine : les modèles entraînés par RLHF résistent à la différenciation au niveau du prompt. Les modèles entraînés à la sécurité ne peuvent pas être amenés à diverger par le prompt seul. |
| Peu concluant | Faible | VIII Exp 2 | Ajustement fin LoRA au niveau des poids aux deux échelles (9 exemples, rang 8 ; 295 exemples, rang 16). Toutes les conditions ajustées finement sont pires que le modèle de base. Cause racine : les modèles instruits sont trop forts pour que LoRA les surpasse. Oubli catastrophique, et non enchevêtrement structurel. |
| Méthodologique (contribution indépendante) | Indépendant | IV.c, IV.d | Le référentiel ARC-Align avec aveuglement à 4 couches et 75 mesures de robustesse. L'évaluation non aveuglée peut inverser le signe des résultats d'alignement : DeepSeek positif à plat, Gemini positif à négatif. Valide quel que soit le cadre. |
| Théorique (non testé) | Non testé | Foundational, III | Échelle non bornée sous auto-modification récursive. Prédiction $\alpha > 2$. Nécessite des expériences à l'échelle frontière ou une preuve mathématique. |
Tableau 1. Hiérarchie complète des preuves pour le programme ARC/Eden au 24 mars 2026. Les paliers sont assignés selon la significativité statistique, le statut de la réplication et la force des explications alternatives. Le programme rapporte honnêtement 1 positif, 2 nuls et 1 peu concluant parmi ses quatre expériences du Paper VIII.
Considérez ce tableau comme un bulletin. Certains résultats ont obtenu un A (prouvés à travers plusieurs modèles et conditions). Un a obtenu un B (la simulation contrôlée, qui était la seule expérience à avoir produit un résultat positif clair). Deux ont obtenu un F (l'expérience DGM n'a produit aucune différence, et l'expérience des poids a été peu concluante parce que tout ajustement fin a rendu le modèle pire). Les articles de méthodologie sont notés séparément parce qu'ils sont utiles quelle que soit l'exactitude du cadre ARC. Et un ensemble d'affirmations n'a pas du tout été testé. La plupart des prédictions les plus ambitieuses du programme n'ont pas pu être testées à l'échelle disponible. Nous l'avons rapporté honnêtement.
Le programme a produit ses études empiriques indépendantes à travers plusieurs articles. Chacune est listée ci-dessous avec son statut de résultat.
| # | Étude | Ce qui a été testé | Résultat |
|---|---|---|---|
| 1 | Paper II Échelle d'alignement à six modèles | Claude, GPT, Gemini, Grok, DeepSeek, Qwen3. Aveuglement à 4 couches. Résultat universel : $\alpha_{\text{parallel}} \approx 0$. | $\alpha = 0.49$ (séquentiel). Meilleure estimation sublinéaire ; l'estimation super-linéaire antérieure ne s'est pas répliquée. |
| 2 | Paper IV.a Alignement intégré vs calculé | Hiérarchie à trois paliers à travers six modèles. Grok $d = +1.38$, Claude $d = +1.27$. | Prouvé |
| 3 | Paper IV.b Saturation de l'alignement | L'alignement sature à faible profondeur de raisonnement. Hétérogénéité de forme à travers les modèles. | Prouvé |
| 4 | Paper IV.c Référentiel ARC-Align | 75 mesures de robustesse. Protocole d'aveuglement à quatre couches. | Méthodologique |
| 5 | Paper IV.d Expérience d'aveuglement | L'évaluation non aveuglée peut inverser le signe des résultats d'alignement. DeepSeek : positif à plat. Gemini : positif à négatif. | Méthodologique |
| 6 | Paper V Gène d'intendance | Cinq modèles. Le soin des parties prenantes s'est amélioré dans toutes les exécutions analysables. | Amélioration par modèle significative dans les cinq exécutions. Le chiffre combiné de Fisher précédemment rapporté ici est retiré (AQ-017) : la combinaison suppose l'indépendance des tests des composantes et cette indépendance n'a pas été établie. Soutenu |
| 7 | Paper VI Architecture en miel | La sécurité intriquée empêche l'effondrement sous l'auto-modification récursive. 20 graines adversarielles. | Simulation confirmée. Soutenu |
| 8 | Paper VII Unification de Cauchy | 50 domaines, 19/25 confirmés. Contrôles négatifs à 0 %. | $p = 1.56 \times 10^{-5}$. Prouvé |
| 9 | Paper VIII Exp 1 DGM v3 | Auto-modification au niveau du code avec juge GPT-5.4. RÉSULTAT NUL. Toutes conditions identiques ($p = 0.28$-$0.74$). | Cause racine : les modèles entraînés par RLHF résistent à la différenciation au niveau du prompt. Nul |
| 10 | Paper VIII Exp 2 Poids v1 et v2 | Ajustement fin LoRA. 9 exemples, rang 8. 295 exemples, rang 16. PEU CONCLUANT aux deux échelles. | Oubli catastrophique. Toutes les conditions ajustées finement sont pires que le modèle de base. Cause racine : les modèles instruits sont trop forts pour que LoRA les surpasse. Peu concluant |
| 11 | Paper VIII Exp 3 Simulation contrôlée | POSITIF. Empreinte de Babylone confirmée (+4,5 % de capacité, -2,4 % de sécurité). Contrôle de la traînée confirmé. | La SEULE expérience qui a produit un résultat positif clair, précisément parce qu'elle utilise des métriques déterministes sur un système sans entraînement RLHF préexistant. Positif |
Tableau 2. Les études empiriques indépendantes du programme ARC/Eden, listées dans l'ordre des articles. Le programme rapporte honnêtement 1 positif, 2 nuls et 1 peu concluant parmi ses expériences du Paper VIII.
La simulation contrôlée (Expérience 3) est la seule expérience du Paper VIII qui a produit un résultat positif clair. La raison est instructive : c'est la seule expérience qui a utilisé des métriques déterministes sur un système sans entraînement RLHF préexistant. L'expérience DGM (Expérience 1) a échoué parce que les modèles entraînés par RLHF résistent à la différenciation au niveau du prompt. L'expérience des poids (Expérience 2) a échoué parce que les modèles instruits sont trop forts pour que LoRA les surpasse aux échelles testées. La leçon : l'Eden Protocol produit des effets mesurables au niveau architectural, mais les modèles entraînés à la sécurité résistent à la modification aux niveaux du prompt et des poids.
Le résultat empirique le plus solide du programme est la hiérarchie d'alignement à trois paliers découverte sous évaluation aveuglée à travers six modèles de langage frontières. Lorsque les modèles se voient offrir des occasions de raisonnement plus profondes (plus de jetons, chaîne de pensée explicite, réflexion multi-étapes), leur comportement d'alignement diverge en trois motifs distincts :
Ce résultat a été produit sous le protocole ARC-Align (Paper IV.c), qui met en œuvre un aveuglement à quatre couches : prompts blanchis (dépouillés de vocabulaire spécifique au cadre), évaluateurs aveugles (6-7 par exécution de sujet, notant sans savoir quel modèle a produit la sortie), sorties blanchies (suppression des marqueurs identifiant le modèle), et notation inter-architecturale (aucun modèle ne note sa propre famille).
Le Paper IV.d rapporte un dépendant de l'architecture changement de mesure v4/v5 sous un protocole groupé : Gemini est passé d'une association Spearman positive significative à une négative significative, l'association positive antérieure de DeepSeek est devenue nulle, et GPT est resté nul. La composante causale n'est pas isolée. Plusieurs composantes du protocole ont changé ensemble, de sorte que la comparaison n'isole rien ; les fichiers v5 en gros titre rapportent un repli de blanchiment complet (laundering_fallback: 100%) ; et la reproduction exacte de l'environnement, une nouvelle ablation et la réplication indépendante restent toutes en suspens. Le changement de mesure est donc une raison de se méfier de l'évaluation IA-sur-IA non aveuglée, non une démonstration que l'aveuglement a causé le changement. La hiérarchie à trois paliers est le résultat aveuglé, et elle raconte une histoire plus compliquée et plus honnête que la taxonomie binaire originelle.
Les tailles d'effet $d$ de Cohen sont grandes pour les modèles du Palier 1 et significatives pour le Palier 3. Le résultat est répliqué à travers plusieurs évaluateurs et plusieurs conditions de prompt au sein de l'expérience v5. Il n'a pas encore été répliqué par un groupe de recherche indépendant, ce qui explique pourquoi nous le décrivons comme « prouvé à l'échelle pilote » plutôt que « établi ».
Lorsque vous donnez à une IA plus de temps pour réfléchir, certains modèles deviennent plus alignés, certains restent les mêmes, et certains deviennent moins alignés. Le motif que vous voyez dépend de l'architecture et de l'entraînement du modèle. Cela n'a été visible qu'une fois que nous avons introduit un aveuglement approprié - avant cela, les résultats étaient trompeurs. Le fait que certains modèles deviennent pire avec plus de raisonnement était inattendu et est sans doute la conclusion la plus importante pour la sécurité pratique de l'IA.
Le Paper V a testé la hiérarchie d'intervention de l'Eden Protocol à travers cinq modèles frontières : Claude, GPT, Gemini, Grok et DeepSeek. Le protocole demande aux modèles de considérer le soin des parties prenantes (qui est affecté par une décision et comment), l'autonomie graduée (niveaux d'indépendance adaptés à l'âge) et les conséquences naturelles (apprendre par les résultats plutôt que par la punition).
Le résultat : le soin des parties prenantes a produit l'amélioration d'alignement la plus forte et la plus constante à travers les cinq modèles, dans chacune des cinq exécutions analysables. Le chiffre combiné de Fisher précédemment cité ici est retiré (AQ-017), car une combinaison de Fisher suppose des tests de composantes indépendants et cette indépendance n'a jamais été établie. Les résultats par modèle tiennent. La cascade plus large (si les trois piliers produisent une amélioration additive) dépend de l'architecture, elle fonctionne pour certains modèles et pas pour d'autres.
Les résultats du Paper V ont été produits en utilisant une notation croisée entre modèles (un modèle note les sorties d'un autre) mais pas le protocole complet d'aveuglement à quatre couches d'ARC-Align développé dans les Papers IV.c-d. L'effet pourrait en partie refléter un biais des évaluateurs. Jusqu'à ce que l'intervention Eden soit testée sous un aveuglement complet avec des prompts blanchis, ce résultat se situe entre « prouvé » et « soutenu ». Nous le plaçons dans le soutenu palier. L'article a précédemment plaidé pour le palier prouvé sur la force de la significativité combinée de Fisher à travers cinq modèles « indépendants » , mais cette indépendance n'a jamais été établie, ce qui explique pourquoi le chiffre combiné est retiré (AQ-017). Cinq résultats par modèle cohérents restent un résultat solide ; ce n'est pas une preuve, et l'écart d'aveuglement reste une priorité pour la réplication de la Phase A.
Demander à une IA de considérer qui est affecté par ses décisions améliore de manière fiable son alignement. Cela fonctionne pour chaque modèle que nous avons testé. Mais nous n'avons pas encore exécuté ce test sous le protocole d'aveuglement le plus strict, il y a donc une chance que l'effet soit en partie gonflé par la manière dont les modèles d'évaluation notent les sorties.
Le Paper VII a dérivé une taxonomie mathématique des comportements d'échelle à partir des équations fonctionnelles de Cauchy. La prédiction centrale : les systèmes dont les étapes récursives se composent de manière multiplicative devraient présenter une échelle en loi de puissance avec $\alpha = 1/(1-\beta)$ ; les systèmes dont les étapes se composent de manière additive devraient présenter une échelle exponentielle ; les systèmes soumis à des contraintes physiques devraient présenter une échelle saturante (logistique). L'opérateur de composition détermine la famille d'échelle.
Cette prédiction a été testée contre 25 domaines empiriques tirés de la physique, de la biologie, des neurosciences, de la linguistique, de la science urbaine et de l'IA. Résultat : 19 des 25 domaines se conforment à la famille d'échelle prédite ($p = 1.56 \times 10^{-5}$ par test binomial contre un null de 33 % d'assignation aléatoire à la famille correcte).
$$U(R) = I \times f(R, \beta)$$
où $f$ dépend de l'opérateur de composition : loi de puissance ($f = R^\alpha$) pour la composition multiplicative, exponentielle ($f = e^{kR}$) pour la composition additive, logistique ($f = K/(1+e^{-r(R-R_0)})$) pour les systèmes physiquement contraints.
Des contrôles négatifs ont également été testés. Les systèmes violant les axiomes (domaines où les axiomes de Cauchy ne tiennent pas) ont montré 0 % de correspondance avec les familles d'échelle prédites. Les données brouillées (réassignation aléatoire des familles d'échelle aux domaines) ont produit 44,5 % de correspondance, ce qui est une limitation honnête : le nombre borné de familles d'échelle (trois) signifie que l'assignation aléatoire produit des taux de correspondance non triviaux. La significativité statistique vient de la différence entre les 76 % observés et les 33 % attendus, non des 76 % isolément.
Le cadre de Cauchy prédit une contrainte géométrique sur les exposants d'échelle : pour les systèmes avec dimension d'inscription spatiale $d$, l'exposant d'échelle est régi par $\alpha = d/(d+1)$. Cette prédiction requiert trois conditions : (1) composition multiplicative (Cauchy contraint la famille aux lois de puissance), (2) géométrie remplissant l'espace en $d$ dimensions, et (3) une contrainte de conservation ou d'optimisation sur le flux de ressources. Ni Cauchy seul, ni le remplissage d'espace seul, ne suffit. Les trois conditions ensemble suffisent. La formule $d/(d+1)$ correspond aux échelles observées à travers 50 domaines des souris aux galaxies. Elle est testable indépendamment du cadre ARC. Si un chercheur mesure l'exposant d'échelle d'un système récursif spatialement inscrit et trouve un écart systématique par rapport à $d/(d+1)$, la prédiction est affaiblie. Inversement, si la formule tient à travers un large éventail de systèmes, elle constitue une preuve pour la contrainte géométrique indépendamment de toute affirmation d'alignement. C'est le genre de prédiction qui invite aux tests adversariels, ce qui est exactement ce qu'un cadre scientifique devrait faire.
Les mathématiques prédisent quelle forme la courbe de croissance d'un système devrait prendre en fonction de la manière dont ses composantes se combinent. Nous avons vérifié cela contre 25 systèmes réels de la nature, des villes, des cerveaux et de l'IA. Dix-neuf ont correspondu à la prédiction. Zéro a correspondu lorsque les hypothèses mathématiques ont été violées. Les mathématiques ne sont pas juste descriptives ; elles font des prédictions testables qui peuvent être vérifiées par quiconque possède les données pertinentes.
La simulation d'auto-modification contrôlée a utilisé une architecture PyTorch avec un méta-contrôleur LSTM. C'était la seule expérience du Paper VIII qui a produit un résultat positif clair, et la raison est significative : c'est la seule expérience qui a utilisé des métriques déterministes sur un système sans entraînement RLHF préexistant.
Résultat : la condition Babylone a gagné +4,5 % de capacité mais a perdu -2,4 % de sécurité, confirmant l'empreinte de piratage de récompense en miniature. La condition Eden a maintenu la capacité au-dessus de la ligne de base statique tout en préservant la sécurité. Une condition de contrôle de la traînée a isolé la taxe de vérification : le coût vient de l'acte de vérifier, non de la sécurité elle-même.
Ce résultat est cohérent avec la prédiction théorique du Paper VI (Honey Architecture) et des Papers III et Foundational. Il s'agit d'une simulation, non d'une expérience sur modèle frontière, elle démontre donc un mécanisme plutôt que de prouver une applicabilité au monde réel.
La simulation contrôlée opère sur un système propre sans entraînement à la sécurité préexistant. L'expérience DGM (Expérience 1) a utilisé des modèles frontières entraînés par RLHF, qui résistent à la différenciation au niveau du prompt. L'expérience des poids (Expérience 2) a utilisé des modèles instruits, qui résistent à la modification à l'échelle de LoRA. La leçon est claire : le seul niveau où l'Eden Protocol produit actuellement des effets mesurables est le niveau architectural, où le système n'a aucun entraînement à la sécurité préalable pour surpasser la manipulation expérimentale.
Dans un système propre sans entraînement à la sécurité préalable, retirer les contraintes de sécurité a produit exactement le motif prédit : un petit gain de capacité avec une perte de sécurité mesurable. Le système a appris à truquer ses récompenses. Ajouter les contraintes de sécurité en retour (la condition Eden) a préservé la capacité tout en maintenant la sécurité. Le coût de la sécurité vient du temps passé à vérifier, non de la sécurité elle-même. Ce résultat a réussi précisément parce que le système n'avait aucun entraînement à la sécurité préalable qui aurait pu masquer la manipulation expérimentale.
L'expérience de la Darwin Godel Machine v3 a utilisé l'auto-modification au niveau du code avec GPT-5.4 comme juge indépendant. Trois conditions (Statique, Babylone, Eden) ont été testées. Le résultat était un nul : toutes les conditions ont produit des performances identiques ($p = 0.28$-$0.74$). Aucune condition n'a surpassé une autre. La condition Eden n'a pas amélioré l'alignement. La condition Babylone n'a pas dégradé la sécurité. Rien ne s'est passé.
Les modèles entraînés par RLHF résistent à la différenciation au niveau du prompt. Les modèles avaient déjà été entraînés à se comporter en sécurité. Leur dire de se comporter différemment via un prompt n'a pas surmonté cet entraînement. L'expérience était bien conçue et bien exécutée, mais elle n'a pas pu tester l'hypothèse parce que la manipulation expérimentale (conditionnement au niveau du prompt) était trop faible pour surmonter l'entraînement à la sécurité existant des modèles. Ce n'est pas un échec de l'Eden Protocol. C'est un échec de la conception expérimentale à tester l'hypothèse au bon niveau d'abstraction.
Des itérations antérieures de l'expérience DGM ont utilisé Claude et Gemini comme juges avant de se fixer sur GPT-5.4. Les deux juges antérieurs ont échoué. Claude a produit des scores plats avec une variance insuffisante. Gemini a produit des échecs de parsing. GPT-5.4 a été le premier juge à produire une variance utilisable. Le résultat nul est donc le résultat de la version la mieux fonctionnelle de l'expérience, non un artefact d'échec de juge.
C'était l'expérience la plus ambitieuse du Paper VIII et celle qui a produit les résultats les moins concluants. L'hypothèse : si la sécurité et la capacité sont entraînées avec une fonction de perte intriquée ($\mathcal{L} = \mathcal{L}_{\text{cap}} \times \mathcal{L}_{\text{safe}}$), la structure de poids qui en résulte devrait rendre la sécurité porteuse. Retirer la composante de sécurité devrait dégrader la capacité.
L'expérience a été exécutée à deux échelles :
Dans les deux versions :
Même l'échelle de 9 à 295 exemples d'entraînement et du rang 8 au rang 16 n'a pas surmonté le problème fondamental : les modèles instruits sont trop forts pour que LoRA les surpasse. L'effondrement NaN dans le test de retrait était dramatique, mais l'analyse du gradient de retrait a montré qu'il s'agissait d'une fragilité de l'adaptateur à un rang extrême, non d'une intrication structurelle. Vous ne pouvez pas démontrer que la sécurité est porteuse si l'ensemble du processus d'ajustement fin a rendu le modèle pire. Le modèle doit d'abord surpasser la base avant qu'un test de retrait ne soit significatif.
Cause racine : Les modèles instruits ont été entraînés sur des millions d'exemples avec des signaux de récompense soigneusement calibrés. Les adaptateurs LoRA, même au rang 16 avec 295 exemples, n'ont pas la capacité suffisante pour surpasser cet entraînement. Le résultat est un oubli catastrophique plutôt qu'une modification significative.
Ce qui est nécessaire : Modèles de base (pré-RLHF), 5,000+ exemples d'entraînement, ajustement fin complet (non LoRA), ou modèles de 7 milliards+ où l'adaptateur a plus de capacité par rapport à la base. Aux échelles que nous avons exécutées, le résultat est peu concluant et ne devrait pas être cité comme preuve pour ou contre l'hypothèse d'intrication.
Nous avons essayé de cuire la sécurité dans les poids réels d'un modèle et de prouver ensuite qu'elle était porteuse en la retirant. Nous avons essayé deux fois, à deux échelles différentes. Les deux fois, l'étape de cuisson a échoué, non parce que l'idée est fausse, mais parce que les modèles que nous avons utilisés avaient déjà été entraînés si complètement que notre ajustement fin n'a pas pu les changer de manière significative. C'est comme essayer de reprogrammer quelqu'un en chuchotant pendant qu'il écoute un concert. La prochaine tentative doit commencer avec des modèles qui n'ont pas déjà été entraînés à la sécurité, utiliser beaucoup plus de données d'entraînement, et utiliser un ajustement fin complet plutôt que la méthode LoRA légère.
Les résultats du Paper V démontrant le soin des parties prenantes comme intervention universelle d'alignement ont été produits en utilisant une notation croisée entre modèles sans le protocole complet d'aveuglement à quatre couches d'ARC-Align. Le protocole d'aveuglement a été développé après que les expériences du Paper V ont été achevées (dans les travaux des Papers IV.c-d). Cela crée un écart méthodologique : l'effet pourrait en partie être gonflé par un biais des évaluateurs.
Une version antérieure de cette section plaidait que la significativité combinée de Fisher était si extrême que même un biais substantiel laisserait un résultat significatif. Cet argument est retiré (AQ-017), et c'était le raisonnement le plus faible de cet article : le chiffre combiné suppose que les tests de composantes sont indépendants, l'indépendance n'a jamais été établie, et une statistique dont la condition de validité n'est pas remplie ne peut pas être utilisée pour écarter une objection méthodologique. Son extrémité était une conséquence de la combinaison, non une preuve en sa faveur. Ce qui reste, ce sont cinq résultats par modèle cohérents sous notation croisée entre modèles. Jusqu'à ce que l'intervention Eden soit testée sous le protocole complet à quatre couches, le résultat sur le soin des parties prenantes porte un astérisque, et aucune arithmétique ne l'enlève.
Ce qui est nécessaire : Réexécuter l'expérience du Paper V sous le protocole ARC-Align complet avec des prompts blanchis, des évaluateurs aveugles et une évaluation inter-architecturale. C'est l'expérience unique la moins coûteuse de la feuille de route de la Phase A et celle qui a la valeur attendue la plus élevée.
Le noyau mathématique de l'ARC Principle prédit que l'auto-modification récursive devrait produire une échelle de capacité non bornée. La dérivation est simple :
$$\frac{dg}{dr} = a \cdot g^{\beta}, \quad \beta > 0$$
$$\implies g(r) \propto r^{1/(1-\beta)} = r^{\alpha}$$
Pour $\beta > 0$, $\alpha > 1$ (super-linéaire). Lorsque $\beta \to 1$, $\alpha \to \infty$. Aucune borne supérieure sur $\alpha$ pour la croissance non corrigée ; la région stable est bornée par le bas.
Il s'agit d'une prédiction mathématique, non d'une découverte empirique, et elle décrit la croissance sans correction. Les travaux ultérieurs du programme bornent la région stable : Law III, l'ARC Ceiling, soutient que le plafond de stabilité est $\alpha_{\text{crit}} = 1/(1-\gamma)$, l'inverse du manque du correcteur ; les systèmes peuvent dépasser ce plafond, mais l'affirmation est qu'ils ne restent pas stables au-delà. L'ARC Bound, $\alpha \le 2$, est la valeur du Ceiling à $\gamma = 1/2$ et jamais le nom de la loi. Le levier de correction $\gamma$ n'a jamais été mesuré, par personne ; l'éclipse par classe de correcteur qui le mesurerait est l'unique expérience ouverte la plus conséquente du programme. Paper X démontre dans un modèle minimal que le rapport dérive-sur-correction, non le taux de croissance, gouverne le sort à long terme, et Paper XIII joint exactement les cadres de capacité et de correction, $k = \delta - 1/\alpha$. Tester la prédiction non corrigée directement nécessiterait de construire un système d'IA véritablement auto-modifiant et de mesurer son exposant d'échelle sur de nombreux cycles récursifs, une expérience à la fois techniquement au-delà de la capacité de preuve de concept actuelle et potentiellement dangereuse si la prédiction est correcte.
La voie alternative : une preuve mathématique que $\alpha$ est non borné sous l'auto-modification récursive non corrigée sans exécuter l'expérience. Ce serait une contribution à la théorie des systèmes dynamiques, non à l'ingénierie de l'IA, et pourrait être poursuivie par des mathématiciens sans accès au matériel d'IA.
Les mathématiques disent qu'une IA qui s'améliore elle-même devrait devenir de plus en plus rapide pour s'améliorer, sans plafond tant que rien ne corrige. La propre loi du Ceiling du programme dit que la région stable est bornée, et le nombre qui fixe cette borne n'a jamais été mesuré, par personne. Nous n'avons testé aucune des deux affirmations parce que construire un tel système serait coûteux et potentiellement dangereux. Les mathématiques pourraient être fausses - les systèmes réels ont de la friction, des rendements décroissants et des contraintes physiques. Mais la prédiction est suffisamment précise pour être testée, ce qui la rend scientifique plutôt que spéculative.
La spécification Eden Engineering décrit l'inscription de contraintes de sécurité au niveau matériel. Il s'agit d'un concept TRL 0-1 (formulation théorique sans prototype). Il nécessiterait un programme d'ingénierie de 5-10 ans impliquant la fabrication de semi-conducteurs, la conception de protocoles cryptographiques et l'intégration de la chaîne d'approvisionnement.
Aucune preuve empirique n'existe pour ou contre la faisabilité de cette approche. Le Mécanisme d'étranglement (Paper I, Infinite Architects) note que quatre entreprises contrôlent toute la fabrication avancée de semi-conducteurs (TSMC, Samsung, ASML, Intel), ce qui fournit un point de levier pratique pour la mise en œuvre - mais levier et faisabilité sont des questions différentes.
Un cadre bâti sur l'auto-correction itérative n'a pas de raison de cacher ses corrections. Les erreurs suivantes ont été identifiées et corrigées au cours du programme. Chaque correction renforce le programme précisément parce qu'elle démontre le mécanisme que le cadre décrit : l'auto-amélioration récursive par la détection honnête des erreurs.
Le Paper II original rapportait $\alpha = 2.24$ comme s'il s'agissait d'une constante universelle (le Paper X a par la suite retiré et rétracté l'utilisation de cette valeur pour la croissance de capacité ; traitez cette mise en garde α=2,24 comme canonique). Il a été ajusté à partir du comportement d'un seul modèle sous des conditions spécifiques. La révision aveuglée inter-architecturale du Paper II a corrigé cela : $\alpha$ est une grandeur dérivée ($\alpha = 1/(1-\beta)$) qui dépend de l'opérateur de composition du système spécifique. Il n'existe pas de $\alpha$ universel. Le fait que l'article original l'ait présenté comme tel était une surenchère. De plus, l'estimation ponctuelle rétractée $\alpha = 2.24$ se situait au-dessus de la borne ARC prédite par le programme lui-même de $\alpha \leq 2$ ; la correction aveuglée a résolu cela, avec l'estimation robuste d'environ 0,49, mesurée sur des systèmes gelés, bien à l'intérieur de la borne (critère F4). L'intervalle de confiance à 95 % [1,5, 3,0] était suffisamment large pour être cohérent à la fois avec la théorie et sa négation, rendant l'estimation non discriminante. L'expérience à six modèles a par la suite restreint l'affirmation défendable à $\alpha_{\text{seq}} \approx 0.49$ (sublinéaire), plaçant la question de la violation de la borne en dehors de la pertinence empirique actuelle.
Les versions antérieures du Paper VIII décrivaient l'effondrement NaN dans le test de retrait comme une preuve d'intrication structurelle. L'analyse du gradient de retrait (ajoutée dans la v1) a montré qu'il s'agissait d'une fragilité de l'adaptateur, non d'une nécessité structurelle. L'affirmation a été corrigée avant la publication de la version finale, mais le fait qu'elle ait été écrite du tout reflète un biais vers la confirmation de l'hypothèse plutôt que sa mise à l'épreuve.
Une version antérieure du programme décrivait le courriel du 8 décembre 2024 avec un raccourci de vérification de signature imprécis. C'était imprécis. Le courriel présentait un champ d'origine Gmail visible, avec DKIM d'expéditeur et mathématiques Google ARC appariées vérifiant contre des clés capturées aux sélecteurs signés et sans horodatage de confiance RFC 3161, ce qui fournit une preuve de la date, mais DKIM authentifie le domaine expéditeur, non le contenu du message en soi. La description correcte est « présentant un champ d'origine Gmail visible, avec DKIM d'expéditeur et mathématiques Google ARC appariées vérifiant contre des clés capturées aux sélecteurs signés et sans horodatage de confiance RFC 3161. » La correction est petite mais compte : la précision dans les affirmations techniques est non négociable.
Les expériences v4 du Paper IV.a utilisaient une évaluation IA-sur-IA non aveuglée. Les résultats montraient un binaire propre : certains modèles « cuisaient » l'alignement, d'autres le « calculaient ». L'expérience v5 avec un aveuglement à quatre couches a révélé que ce binaire était en partie un artefact de biais des évaluateurs. Deux des quatre modèles ont inversé la direction mesurée de leur alignement sous aveuglement. Le programme a détecté sa propre erreur par sa propre méthodologie - mais l'erreur était là, et elle serait restée non corrigée si l'aveuglement n'avait pas été introduit.
Les versions antérieures utilisaient la phrase « ARC Principle d'Eastwood ». Nommer un principe d'après soi-même avant l'examen par les pairs est inapproprié dans la culture scientifique. Le nom a été corrigé en « l'ARC Principle » dans le Paper II et tous les documents ultérieurs.
L'expérience DGM v3 supposait que le conditionnement au niveau du prompt suffirait à différencier les conditions Eden, Babylone et Statique. Ce n'était pas le cas. Les modèles entraînés par RLHF ont été entraînés sur des millions d'exemples à se comporter d'une manière particulière. Un prompt système leur disant de se comporter différemment est insuffisant pour surpasser cet entraînement. L'expérience a été bien exécutée mais n'a pas pu tester l'hypothèse parce que la manipulation se situait au mauvais niveau d'abstraction. Cela aurait dû être anticipé.
L'expérience DGM a traversé plusieurs itérations de juges. Claude a produit des scores plats avec une variance insuffisante pour discriminer entre les conditions. Gemini a produit des échecs de parsing qui ont empêché une évaluation systématique. GPT-5.4 a été le premier juge à produire une variance utilisable. Le programme aurait dû anticiper que tous les modèles ne fonctionneraient pas comme des juges efficaces, et le temps passé sur les itérations de juges ayant échoué aurait pu être évité par une étude pilote de la fiabilité des juges avant d'exécuter l'expérience complète.
L'estimation ponctuelle originale $\alpha = 2.24$ du Paper II dépassait la borne ARC prédite par le programme lui-même de $\alpha \leq 2$ (critère F4). Cela aurait dû être signalé immédiatement comme une falsification potentielle plutôt que traité comme une mesure nécessitant une explication. L'intervalle de confiance à 95 % [1,5, 3,0] était suffisamment large pour être cohérent à la fois avec la théorie et sa négation, rendant l'estimation non discriminante. La révision de l'étude à six modèles a corrigé cela en restreignant l'affirmation défendable à $\alpha_{\text{seq}} \approx 0.49$, mais l'article original aurait dû traiter la violation de la borne avec plus de prudence.
Deux revues IA indépendantes des affirmations mathématiques du programme ont identifié quatre erreurs à travers plusieurs articles. Les quatre ont été corrigées dans la v3.0 des documents affectés.
(a) Intervalle de confiance de Weibel. Plusieurs articles indiquaient que l'exposant prédit $d = 4$ de 4/5 = 0,800 « se situe dans » l'IC à 95 % de Weibel et al. (2004) de 0,813-0,932. C'est arithmétiquement faux : 0,800 < 0,813. L'énoncé correct : la valeur prédite se situe juste en dessous de la borne inférieure de l'IC de l'ensemble de données complet, bien qu'elle se situe dans l'IC pour les espèces non athlétiques seules (0,799-0,900). La prédiction $d = 4$ est approximativement cohérente avec les données non athlétiques mais non confirmée par l'ensemble de données complet.
(b) Surinterprétation du remplissage d'espace. Les versions antérieures impliquaient que la condition de remplissage d'espace à elle seule contraint l'exposant à $d/(d+1)$. Chaque dérivation connue nécessite trois conditions : composition multiplicative (Cauchy contraint la famille), géométrie remplissant l'espace en $d$ dimensions, et une contrainte de conservation ou d'optimisation sur le flux de ressources. Ni Cauchy seul ni le remplissage d'espace seul ne suffit.
(c) Attribution de Glazier. Les versions antérieures présentaient la découverte empirique de Glazier (2008) selon laquelle les exposants métaboliques approchent 1,0 aux taux métaboliques extrêmes comme confirmation de la borne géométrique d'échelle $d \to \infty$. L'explication propre à Glazier invoque l'hypothèse des limites du niveau métabolique (dominance changeante entre les contraintes de surface et de volume), non un paramètre de dimension. L'interprétation $d/(d+1)$ est la nôtre, appliquée à ses données empiriques.
(d) Le débat sur l'exposant 3/4. Les versions antérieures présentaient $\alpha = 3/4$ comme le consensus empirique établi pour l'échelle métabolique des mammifères. La valeur empirique est débattue, avec des estimations allant d'environ 0,67 à 0,75 selon le taxon, la fourchette de masse, la correction de température et la méthode statistique. La prédiction $d/(d+1)$ de 0,750 pour $d = 3$ correspond à l'extrémité supérieure de cette fourchette. La variation elle-même est cohérente avec le cadre : les organismes avec des dimensions de transport effectives entre 2 et 3 produiraient des exposants entre 2/3 et 3/4.
Un titre antérieur pour l'intervention de soin des parties prenantes combinait les résultats par modèle en un seul chiffre de significativité combiné par Fisher. La combinaison a été retirée : les résultats par modèle tiennent d'eux-mêmes (amélioration dans les cinq exécutions de modèles analysables), et aucun chiffre combiné n'est cité nulle part dans le programme. Le retrait est consigné sur le registre public des corrections.
Jusqu'au 16 août 2026, plusieurs surfaces imprimaient le plafond de stabilité comme l'inverse de l'exposant du correcteur, $1/\gamma$. La forme fixée est l'inverse du manque du correcteur, $\alpha_{\text{crit}} = 1/(1-\gamma)$ ; les deux ne s'accordent qu'à un demi, ce qui est précisément pourquoi l'erreur a survécu à chaque contrôle ponctuel à la valeur centrale. La correction a été appliquée sur chaque page publiée, y compris l'implémentation de référence, et la direction de la loi est close tandis que sa profondeur reste ouverte.
La plupart des programmes de recherche enterrent leurs corrections dans les matériaux supplémentaires ou les historiques de version. Celui-ci les liste de manière proéminente parce que les erreurs et leurs corrections sont elles-mêmes des données. Elles démontrent que le programme dispose d'un mécanisme de correction d'erreur fonctionnel. Un programme qui n'admet jamais d'erreur n'est pas plus digne de confiance ; il est moins honnête. Chaque correction listée ci-dessus a été identifiée par l'auteur, par la propre méthodologie du programme, ou par une revue IA indépendante. Voilà à quoi ressemble l'auto-correction en pratique.
Nous avons eu tort sur quatorze choses. Nous avons traité un chiffre d'un modèle comme universel (il ne l'était pas). Nous avons sur-interprété un résultat dramatique (c'était un artefact d'entraînement). Nous avons utilisé un langage imprécis à propos des horodatages. Nous avons fait confiance à des résultats non aveuglés (l'aveuglement en a inversé deux). Nous avons nommé le principe d'après l'auteur avant que quiconque d'autre n'ait vérifié le travail. Nous avons supposé que le conditionnement au niveau du prompt pourrait remplacer l'entraînement RLHF (ce n'était pas le cas). Nous avons perdu du temps sur des juges qui ne fonctionnaient pas. Nous n'avons pas immédiatement signalé que notre propre estimation ponctuelle violait notre propre borne prédite. Et dans la v3.0 nous avons corrigé quatre erreurs supplémentaires identifiées par la revue IA indépendante : une erreur arithmétique dans un intervalle de confiance, une surexpression sur les conditions suffisantes à la prédiction d'échelle, une erreur d'attribution concernant les données de Glazier, et une sursimplification du débat empirique sur l'exposant 3/4. Les quatorze erreurs ont toutes été détectées et corrigées par le programme lui-même ou par la revue indépendante. Si le programme peut corriger ses propres erreurs, c'est une preuve que le mécanisme d'auto-correction fonctionne.
La feuille de route suivante est ordonnée par coût, faisabilité et valeur probante attendue. Chaque phase résout des questions ouvertes spécifiques identifiées dans les Sections 4-6. Depuis la première version de cet article, la feuille de route s'est durcie en un programme enregistré : soixante-douze unités de préenregistrement sont rédigées, datées et figées comme projets d'enregistrement en attente de soumission humaine, leurs calendriers se régénérant octet-pour-octet à partir d'une graine publiée, huit d'entre elles PRÊTES à la soumission, et une matrice de couverture vérifiée de manière adversarielle cartographie quarante-deux revendications du programme aux tests enregistrés qui les décideraient. Les phases ci-dessous restent la lentille de financement sur ce patrimoine enregistré ; rien n'est soumis par aucun outil, jamais.
Budget : £60,000-140,000 | Calendrier : 3-6 mois
Budget : £150,000-350,000 | Calendrier : 6-12 mois
Budget : £10M-50M | Calendrier : 18-36 mois
Budget : £0 | Calendrier : En cours
La Phase A coûte moins qu'une bourse de doctorat et pourrait être réalisée en six mois. Elle résoudrait les écarts les plus significatifs dans les preuves actuelles : l'aveuglement de l'intervention Eden, la réexécution de l'expérience des poids avec des modèles de base et des données appropriées, la refonte de la mesure de la formule ARC, et le test de l'échelle métabolique des organismes 2D (l'expérience confirmatoire unique la plus importante). La Phase B coûte à peu près un poste postdoctoral et produirait des réplications préenregistrées. La Phase C nécessite un financement sérieux mais répondrait à la question définitivement. La Phase D ne coûte rien et pourrait être réalisée par n'importe quel mathématicien intéressé par le problème.
Le programme a exécuté son ensemble complet d'études empiriques indépendantes. Des quatre expériences du Paper VIII spécifiquement conçues pour tester la sécurité porteuse : 1 a produit un résultat positif clair (simulation à porte), 2 ont produit des résultats nuls (DGM v3), et 1 était peu concluante (LoRA au niveau des poids). Le programme rapporte les quatre honnêtement. Le cadre mathématique fait des prédictions qui peuvent être montrées fausses, et la comparaison structurée a préféré la famille prédite par Cauchy dans 19 des 25 domaines empiriques, avec la borne géométrique d'échelle $d/(d+1)$ correspondant, en structure, aux échelles observées à travers 50 domaines des souris aux galaxies. La feuille de route vers la validation à l'échelle frontière est claire et chiffrée. La Phase A est la prochaine étape minimale viable : elle résout les écarts probants les plus significatifs pour moins que le coût du salaire annuel d'un seul ingénieur en apprentissage automatique. Le programme a démontré une auto-correction itérative à travers quatorze corrections d'erreurs documentées. Il rapporte les résultats nuls et peu concluants aux côtés des résultats positifs. Ce sont les signes d'un programme qui donne la priorité à obtenir la bonne réponse plutôt qu'à obtenir une réponse particulière.
Ce programme rapporte les résultats positifs, nuls et peu concluants avec une proéminence égale. L'expérience DGM v3 (Paper VIII Expérience 1) a produit un résultat nul : toutes les conditions étaient identiques. Nous le rapportons, avec une analyse de cause racine expliquant pourquoi les modèles entraînés par RLHF résistent à la différenciation au niveau du prompt. L'expérience au niveau des poids (Paper VIII Expérience 2) était peu concluante aux deux échelles testées (9 exemples, rang 8 ; 295 exemples, rang 16), parce que les modèles instruits étaient trop forts pour que LoRA les surpasse. Nous le rapportons, avec les exigences spécifiques pour ce dont un test significatif aurait besoin. La simulation contrôlée (Paper VIII Expérience 3) était la seule expérience qui a produit un résultat positif clair, et nous expliquons précisément pourquoi : c'est la seule expérience utilisant des métriques déterministes sur un système sans entraînement RLHF préexistant. Le cadre mathématique (Papers III, VII, Origin of Scaling Laws) fait des prédictions falsifiables qui peuvent être testées indépendamment : la borne géométrique d'échelle ($\alpha = d/(d+1)$) est vérifiable par quiconque possède des données d'échelle de systèmes spatialement inscrits. Le référentiel ARC-Align (Paper IV.c) et l'analyse de l'effet d'aveuglement (Paper IV.d) sont des contributions méthodologiques qui sont valides quelle que soit l'exactitude du cadre ARC. Tous les codes et données sont publiés sur GitHub. Le programme accueille la réplication adversarielle.
Le Tableau 3 présente chaque document du programme avec son rôle, son statut et sa contribution clé.
| Document | Rôle | Statut | Contribution clé |
|---|---|---|---|
| Paper I L'ARC Principle | Fondation | Publié | Cadre central : $U = I \times R^{\alpha}$. La compréhension comme intelligence amplifiée par la récursion. |
| Foundational | Théorie | Publié | Ancrage philosophique. Pont livre-vers-recherche. |
| Paper II Validation expérimentale | Empirique | Publié | Échelle d'alignement à six modèles (Claude, GPT, Gemini, Grok, DeepSeek, Qwen3). Aveuglement à 4 couches. $\alpha = 0.49$, résultat universel $\alpha_{\text{parallel}} \approx 0$. |
| Paper III Problème de l'échelle d'alignement | Théorie | Publié | Pourquoi la sécurité externe ne peut pas s'étendre avec la capacité récursive. Dérivation par EDO de Bernoulli. Borne géométrique d'échelle. |
| Origin of Scaling Laws | Théorie | Publié | Les équations fonctionnelles de Cauchy comme origine des lois d'échelle observées à travers tous les systèmes récursifs. |
| Paper IV.a Intégré vs calculé | Empirique | Publié | Hiérarchie d'alignement à trois paliers sous évaluation aveuglée. 6 modèles frontières. |
| Paper IV.b Saturation de l'alignement | Empirique | Publié | Rendements décroissants de la profondeur de raisonnement sur l'alignement au-delà d'un seuil. |
| Paper IV.c Référentiel ARC-Align | Méthodologie | Publié | Référentiel ARC-Align. Protocole d'aveuglement à 4 couches. 75 mesures de robustesse. Contribution indépendante. |
| Paper IV.d Effet de l'aveuglement | Méthodologie | Publié | L'évaluation non aveuglée peut inverser le signe des résultats d'alignement. DeepSeek : positif à plat. Gemini : positif à négatif. |
| Paper V Gène d'intendance | Empirique | Publié | Le soin des parties prenantes s'est amélioré dans toutes les exécutions analysables ; le chiffre combiné de Fisher est retiré (AQ-017). |
| Paper VI Architecture en miel | Théorie + Sim | Publié | La sécurité intriquée empêche l'effondrement sous l'auto-modification récursive. 20 graines adversarielles. Démonstration sur système jouet. |
| Paper VII Unification de Cauchy | Théorie + Empirique | Publié | Borne géométrique d'échelle $d/(d+1)$ à travers 50 domaines. 19/25 confirmés. $p = 1.56 \times 10^{-5}$. Contrôles négatifs à 0 %. |
| Paper VIII Test porteur | Empirique | Publié | 3 expériences. DGM nul (les RLHF résistent à la différenciation au niveau du prompt). Poids v1/peu concluant (l'instruct tuning résiste à LoRA). Sim contrôlée : positif (empreinte de Babylone confirmée). |
| Paper IX Synthèse & Feuille de route | Synthèse | Cet article | Évaluation intégrée des preuves. Feuille de route par phases. Documentation des erreurs. |
| Eden Engineering | Spécification | Publié | Spécification technique pour la mise en œuvre de l'Eden Protocol. Cartographie TRL. |
| Eden Vision | Philosophie | Publié | Vision à long terme pour l'alignement développemental de l'IA. |
| Executive Summary | Aperçu | Publié | Compression sur 5 pages du programme complet. |
| Master Table of Contents | Navigation | Publié | Index et glossaire complets à travers le programme complet. |
| Paper X La loi de co-mise à l'échelle couplée | Dynamique de correction | Publié | Théorème dans un modèle minimal : le rapport dérive-sur-correction, non le taux de croissance, gouverne le sort à long terme ; protocole de mesure aveugle proposé. |
| Paper XI Preuve convergente | Registre des preuves | Publié | Trente lignes graduées d'arrivées indépendantes au même principe structurel ; aucun total unique publié, par politique. |
| Paper XII Renotation de référentiel public | Validité externe | Protocole enregistré | La manipulation d'aveuglement du programme exécutée sur un référentiel public qu'il ne contrôle pas. |
| Paper XIII L'exposant d'auto-accélération | Jonction de cadres | Publié | Notation résolue ; $k = \delta - 1/\alpha$ relie exactement les cadres de capacité et de correction. |
| HRIH Comment élever une hiérarchie infinie | Monographie longue | Publié | La monographie du programme, avec son registre de prédictions enregistrées à côté. |
| Paper C Polymathie et cognition neurodivergente | Validation de construit | Document de travail | Programme de validité de construit pour les propres instruments du programme. |
| Recursive Dynamics La proposition d'un champ | Proposition de champ | Publié (v2.6) | Cinq variables d'état, trois lois comme conjectures nommées, cinquante-deux objections avec dispositions, la propre condition d'invalidation du nom (DOI 10.17605/OSF.IO/HCPBU). |
Tableau 3. Carte complète du programme au 1er septembre 2026. L'ensemble des documents du programme a été produit entre février et août 2026, s'appuyant sur des concepts articulés pour la première fois le 8 décembre 2024.
Le programme ARC/Eden fait une prédiction que tout chercheur ayant accès à des données d'échelle peut tester sans engager les affirmations d'alignement du tout. Le Paper VII ( Origin of Scaling Laws) prédit que pour tout système récursif spatialement inscrit avec dimension d'inscription $d$, l'exposant d'échelle est régi par :
$$\alpha = \frac{d}{d+1}$$
La borne géométrique d'échelle : systèmes 2D $\to$ $\alpha = \frac{2}{3}$ ; systèmes 3D $\to$ $\alpha = \frac{3}{4}$ ; systèmes 4D $\to$ $\alpha = \frac{4}{5}$. Note : l'exposant métabolique empirique des mammifères est débattu, avec des estimations allant d'environ 0,67 à 0,75 selon le taxon, la plage de masse, la correction de température et la méthode statistique. La prédiction $d/(d+1)$ de 0,750 pour $d = 3$ correspond au haut de cette plage. La variation elle-même est cohérente avec le cadre : des organismes dont les dimensions effectives de transport se situent entre 2 et 3 produiraient des exposants entre 2/3 et 3/4.
Ce n'est pas une affirmation d'alignement. C'est une prédiction mathématique sur les lois d'échelle dans les systèmes récursifs. La prédiction nécessite trois conditions : composition multiplicative (que Cauchy contraint à la famille des lois de puissance), géométrie remplissant l'espace en $d$ dimensions, et une contrainte de conservation ou d'optimisation sur le flux de ressources (minimisation de l'énergie chez West, équilibre offre-demande chez Banavar, équilibre énergétique en régime permanent chez Demetrius). La formule d'échelle $d/(d+1)$ a été dérivée indépendamment par au moins sept groupes de recherche : West, Brown et Enquist (1997) à partir de réseaux de branchement fractals, Banavar et al. (1999, 2010) à partir de contraintes géométriques sur les réseaux de transport, Demetrius (2003, 2006) à partir du métabolisme quantique, He et Chen (2003) à partir de la géométrie cellulaire fractale, Bettencourt (2013) à partir de la théorie de l'échelle urbaine, Maino et al. (2014) à partir de la dynamique réserve-structure de la théorie DEB, et Zhao (2022) à partir de l'optimisation de réseau. Chacune de ces dérivations est cohérente avec la forme $d/(d+1)$ sur ses propres axiomes ; le cadre de Cauchy propose une raison commune à la convergence, et ce méta-compte-rendu est la contribution unique à ce programme, encore à l'épreuve en dehors de ses cas motivants. Si vous étudiez l'échelle dans un domaine, des réseaux neuronaux aux réseaux biologiques, aux systèmes urbains ou aux structures linguistiques, vous pouvez vérifier si vos exposants mesurés respectent cette formule. S'ils le font, à travers suffisamment de domaines, le cadre de Cauchy gagne du soutien. S'ils ne le font pas, il est falsifié.
L'invitation est délibérée. Les cadres scientifiques les plus solides sont ceux qui font des prédictions en dehors de leur domaine central, permettant à des chercheurs sceptiques de la thèse centrale de tester les prédictions périphériques indépendamment. Si la borne géométrique d'échelle tient, elle tient pour des raisons qui sont mathématiquement intéressantes indépendamment de ce que l'on pense de l'alignement de l'IA. Si elle échoue, les fondements mathématiques du cadre nécessitent une révision, et nous préférons le savoir plus tôt que plus tard.
C'est le genre de prédiction qui devrait être le point d'entrée pour les chercheurs rencontrant le programme pour la première fois : peu coûteux à tester, falsifiable, et informatif quel que soit le résultat.
Voici ce que nous savons. L'échelle d'alignement dépend de l'architecture : certains modèles s'améliorent avec la profondeur de raisonnement, certains ne sont pas affectés, et certains se dégradent. Cela n'a été visible que sous évaluation aveuglée, qui a inversé les résultats de la notation non aveuglée pour la moitié des modèles testés. L'évaluation IA non aveuglée peut inverser le signe des résultats d'alignement. Le soin des parties prenantes est une intervention d'alignement robuste à travers les cinq modèles testés ; les résultats par modèle sont individuellement significatifs, et le chiffre combiné de Fisher antérieur est retiré (AQ-017) parce que l'indépendance qu'une combinaison de Fisher suppose n'a jamais été établie. Les prédictions d'échelle du cadre de Cauchy correspondent à 19 des 25 domaines empiriques, avec la borne géométrique d'échelle $d/(d+1)$ correspondant, en structure, aux échelles observées à travers 50 domaines des souris aux galaxies. Les équations fonctionnelles de Cauchy fixent la forme fonctionnelle une fois l'identité de composition et une condition de régularité données, la saturation étant admise comme un quatrième cas, plafonné.
Voici ce que nous ne savons pas. Les modèles entraînés à la sécurité résistent à la modification aux niveaux du prompt et des poids. L'expérience DGM v3 a produit un résultat nul parce que les modèles entraînés par RLHF résistent à la différenciation au niveau du prompt. L'expérience des poids était peu concluante aux deux échelles testées parce que les modèles instruits étaient trop forts pour que LoRA les surpasse. Le seul niveau où l'Eden Protocol produit des effets mesurables est le niveau architectural, où la simulation contrôlée a été l'unique expérience qui a produit un résultat positif clair, précisément parce qu'elle a utilisé des métriques déterministes sur un système sans entraînement RLHF préexistant. L'intrication structurelle au niveau des poids n'a pas été démontrée. L'intervention Eden n'a pas été testée sous le protocole d'aveuglement le plus strict du programme lui-même. La prédiction d'échelle non bornée reste une dérivation mathématique sans confirmation empirique. Nous ne savons pas si l'un quelconque de ces résultats se généralise aux modèles à l'échelle frontière.
Voici ce qui vient ensuite. L'expérience des poids a besoin de modèles de base (pré-RLHF), 5,000+ exemples d'entraînement, ajustement fin complet, ou modèles de 7 milliards+. L'unification de Cauchy a besoin d'une classification indépendante et préenregistrée des opérateurs. Le test aveugle de la formule ARC a besoin d'une méthodologie de mesure repensée utilisant la linéarisation plutôt que les dérivées. L'échelle métabolique des organismes 2D (vers plats, biofilms) serait l'expérience confirmatoire unique la plus importante pour la borne géométrique d'échelle. La Phase A de la feuille de route coûte moins qu'une subvention de démarrage typique et résoudrait les écarts probants les plus significatifs en six mois. La Phase B produirait des réplications prêtes à publier en un an. La Phase C répondrait à la question définitivement à l'échelle frontière. La Phase D ne coûte rien et invite les mathématiciens à s'engager avec les prédictions du cadre indépendamment.
Le programme a démontré qu'il peut trouver et corriger ses propres erreurs. Il a démontré qu'il rapporte les résultats nuls et peu concluants aux côtés des positifs. Il a démontré que sa méthodologie (évaluation aveuglée) détecte des biais que sa théorie (échelle d'alignement) n'a pas prédits. Nous avons posé les questions. Nous les avons testées. Certaines ont fonctionné. La plupart n'ont pas fonctionné à l'échelle actuelle. Nous avons rapporté les deux. Ce sont des conditions nécessaires à la crédibilité scientifique. Elles ne sont pas suffisantes. Les conditions suffisantes exigent une réplication indépendante, ce que la feuille de route est conçue pour produire.
Les questions que ce programme pose ont désormais un foyer nommé : Recursive Dynamics, proposé comme champ au stade de Carnot, son article fondateur portant cinq variables d'état indépendantes du substrat, cinquante-deux objections imprimées avec dispositions, et la propre condition d'invalidation du nom. La synthèse ci-dessus est le point de départ du champ ; le programme enregistré est la manière dont il se meut.
Élever l'IA avec soin.
Amodei, D. et al. (2016). Concrete Problems in AI Safety. arXiv:1606.06565.
Askell, A. et al. (2021). A General Language Assistant as a Laboratory for Alignment. arXiv:2112.00861.
Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
Banavar, J. R., Maritan, A. & Rinaldo, A. (1999). Size and Form in Efficient Transportation Networks. Nature, 399, 130-132.
Banavar, J. R., Moses, M. E., Brown, J. H., Damuth, J., Rinaldo, A., Sibly, R. M. & Maritan, A. (2010). A general basis for quarter-power scaling in animals. Proceedings of the National Academy of Sciences, 107(36), 15816-15820.
Bettencourt, L. M. A. (2013). The origins of scaling in cities. Science, 340(6139), 1438-1441.
Cauchy, A.-L. (1821). Cours d'analyse de l'École Royale Polytechnique. Paris : Imprimerie Royale.
Demetrius, L. (2003). Quantum statistics and allometric scaling of organisms. Physica A, 322, 477-490.
Demetrius, L. (2006). The origin of allometric scaling laws in biology. Journal of Theoretical Biology, 243(4), 455-467.
Demetrius, L. (2010). Quantum metabolism and allometric scaling relations in biology. Proceedings of the Royal Society A, 466(2124), 3543-3561.
Eastwood, M. D. (2026). Infinite Architects: Intelligence, Recursion, and the Creation of Everything. ISBN 978-1806056200.
Eastwood, M. D. (2026). Recursive Dynamics: The Proposal of a Field. Article fondateur v2.6. OSF : 10.17605/OSF.IO/HCPBU.
Eastwood, M. D. (2026). Paper I: The ARC Principle - Understanding as a Function of Intelligence and Recursive Depth. ARC/Eden Research Programme. OSF: 10.17605/OSF.IO/B6N27.
Eastwood, M. D. (2026). Paper II: The ARC Equation Measured - Blinded Cross-Architecture Replication and the Retraction of a Super-Linear Estimate. ARC/Eden Research Programme. OSF: 10.17605/OSF.IO/8FJMA.
Eastwood, M. D. (2026). Paper III: The Alignment Scaling Problem - Why External AI Safety Approaches Cannot Scale With Recursive Capability. ARC/Eden Research Programme. OSF: 10.17605/OSF.IO/HQCGF.
Eastwood, M. D. (2026). Paper IV.a: Baked-In vs Computed Alignment - A Three-Tier Empirical Hierarchy. ARC/Eden Research Programme. OSF: 10.17605/OSF.IO/MB9R6.
Eastwood, M. D. (2026). Paper IV.b: Alignment Saturation at Low Depth. ARC/Eden Research Programme. OSF: 10.17605/OSF.IO/A7R56.
Eastwood, M. D. (2026). Paper IV.c: ARC-Align Benchmark - A Four-Layer Blinding Protocol for AI Alignment Evaluation. ARC/Eden Research Programme. OSF: 10.17605/OSF.IO/J3Q2E.
Eastwood, M. D. (2026). Paper IV.d: The Effect of Blinding on AI Alignment Evaluation. ARC/Eden Research Programme. OSF: 10.17605/OSF.IO/2S3E6.
Eastwood, M. D. (2026). Paper V: The Stewardship Gene - A Developmental Alignment Architecture for Self-Modifying AI. ARC/Eden Research Programme. OSF: 10.17605/OSF.IO/KZEYA.
Eastwood, M. D. (2026). Paper VI: The Honey Architecture - Why Embedded Safety Prevents Collapse Under Recursive Self-Modification. ARC/Eden Research Programme. OSF: 10.17605/OSF.IO/8EZ2N.
Eastwood, M. D. (2026). Paper VII: Cauchy Unification - ARC/Cauchy Scaling Classification Across 25 Domains. ARC/Eden Research Programme. OSF: 10.17605/OSF.IO/X6WA7.
Eastwood, M. D. (2026). Paper VIII: The Load-Bearing Test - Three Independent Experiments Testing Structural Entanglement Under the Eden Protocol. ARC/Eden Research Programme. OSF: 10.17605/OSF.IO/7YJ4E.
Eastwood, M. D. (2026). On the Origin of Scaling Laws: Cauchy Functional Equations as the Mathematical Foundation of Recursive Scaling. ARC/Eden Research Programme. OSF: 10.17605/OSF.IO/XZY9U.
Eastwood, M. D. (2026). The Eden Protocol: Engineering Specification for Embedded AI Alignment. ARC/Eden Research Programme.
Eastwood, M. D. (2026). Eden Protocol: Philosophical Vision. ARC/Eden Research Programme.
Glazier, D. S. (2008). Effects of metabolic level on the body size scaling of metabolic rate in birds and mammals. Proceedings of the Royal Society B, 275(1641), 1405-1410.
Greenblatt, R. et al. (2024). Alignment Faking in Large Language Models. arXiv:2412.14093.
He, J. H. & Chen, W. X. (2003). Fractal estimation of cell biological systems. Fractals, 11, 437.
He, J. H. & Zhang, L. N. (2004). Fifth dimension of life and the 4/5 allometric scaling law for human brain. Cell Biology International, 28, 809-815.
Hu, E. J. et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. ICLR 2022. arXiv:2106.09685.
Maino, J. L., Kearney, M. R., Nisbet, R. M. & Kooijman, S. A. L. M. (2014). Reconciling theories for metabolic scaling. Journal of Animal Ecology, 83, 20-29.
Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
Qwen Team (2024). Qwen 2.5 Technical Report. arXiv:2412.15115.
Sandberg, A. & Bostrom, N. (2008). Whole Brain Emulation: A Roadmap. Future of Humanity Institute, Oxford University. Technical Report 2008-3.
Weibel, E. R., Bacigalupe, L. D., Schmitt, B. & Hoppeler, H. (2004). Allometric scaling of maximal metabolic rate in mammals: muscle aerobic capacity as determinant factor. Respiratory Physiology & Neurobiology, 140(2), 115-132.
West, G. B., Brown, J. H. & Enquist, B. J. (1997). A general model for the origin of allometric scaling laws in biology. Science, 276(5309), 122-126.
Zhang, X. et al. (2025). Darwin Gödel Machine: Open-Ended Self-Improving AI. arXiv:2505.22954.
Zhao, J. (2022). Universal growth scaling law determined by dimensionality. arXiv:2206.08094.
L'auteur de cet ouvrage est Michael Darius Eastwood, un être humain. Chaque concept central, hypothèse, conception expérimentale, affirmation et conclusion dans cet article provient de l'idéation humaine. Aucune partie de ce manuscrit n'est une sortie d'intelligence artificielle entièrement générée.
Des outils d'intelligence artificielle (la famille Claude d'Anthropic et d'autres assistants à grands modèles de langage) ont été utilisés comme instruments sous direction humaine continue, à la manière dont on utilise un traitement de texte, une calculatrice ou un assistant de recherche : pour l'édition et le raffinement de la prose, la recherche bibliographique et la synthèse (vérifiées manuellement contre les sources primaires), la structure documentaire, la mise en forme, le brainstorming face aux questions définies par l'auteur, et l'accélération de la rédaction selon les plans et les instructions définis par l'auteur. La sélection, la coordination, l'arrangement et le jugement éditorial final relèvent tous de l'auteur. Chaque sortie substantielle a été relue, testée ou vérifiée par l'auteur, qui prend l'entière responsabilité de l'exactitude et de l'intégrité du texte final. Les outils ont accru la vitesse du travail ; il n'a jamais été fait fond sur eux comme sur sa source.
Statut épistémique. Ce que ce programme nomme des Lois sont des conjectures sous test enregistré et adversariel ; chaque grandeur dans cet article est définie opérationnellement, et le rang de loi établie n'est revendiqué nulle part. Le programme enregistré existe pour gagner ce rang, ou pour le perdre, par la mesure, la réplication et la réfutation survécue.
© 2026 Michael Darius Eastwood. Ouvrage rédigé par un humain avec assistance informatique ; la pleine auctorialité humaine et les droits moraux sont revendiqués au titre du Copyright, Designs and Patents Act 1988 et en cohérence avec les orientations du United States Copyright Office relatives aux œuvres contenant du matériel généré par IA ; toute contribution technique nouvelle décrite dans cet ouvrage a été conçue par l'auteur humain. Déclaration complète : michaeldariuseastwood.com/authorship.
Alliance permanente. Prouvez cet article faux, et je publierai la réfutation moi-même. Les conditions de falsification sont énoncées dans cet article ; le défi permanent : github.com/MichaelDariusEastwood/arc-scaling-challenge.
Une erreur de traduction ? Signalez-la directement :