Traduction automatique de l'original anglais daté. La page anglaise fait foi. English →

Michael Darius Eastwood Research Couche de publication canonique

Executive summary

Suite de recherche

Programme de recherche ARC/Eden : Executive Summary

À mesure que l'IA devient plus intelligente, elle ne devient pas de manière fiable plus sûre, et les méthodes utilisées pour mesurer la sécurité sont elles-mêmes peu fiables. Ce résumé exécutif est la carte de tout le programme : vingt-six articles de recherche, les trois lois de l'ARC Theory portées comme conjectures nommées, l'intervention Eden Protocol, le champ proposé de Recursive Dynamics, et un programme enregistré de préenregistrements rédigés dont les calendriers peuvent être régénérés par tout lecteur à partir d'une graine publiée. Chaque revendication est graduée dans les registres publics ; rien ici n'est confirmé, et les tests décisifs sont écrits avant d'être exécutés.

Michael Darius Eastwood

Michael Darius Eastwood, chercheur indépendant, Londres : bâtir un alignement mesurable, où la correction vit à l'intérieur de la boucle récursive plutôt que d'être vissée à l'extérieur.

Première publication 22 février 2026, révisé le 31 août 2026 · Version 2.0

Résumé

À mesure que l'IA devient plus intelligente, elle ne devient pas de manière fiable plus sûre, et les méthodes utilisées pour mesurer la sécurité sont elles-mêmes peu fiables. Ce résumé exécutif est la carte de tout le programme : vingt-six articles de recherche, les trois lois de l'ARC Theory portées comme conjectures nommées, l'intervention Eden Protocol, le champ proposé de Recursive Dynamics, et un programme enregistré de préenregistrements rédigés dont les calendriers peuvent être régénérés par tout lecteur à partir d'une graine publiée. Chaque revendication est graduée dans les registres publics ; rien ici n'est confirmé, et les tests décisifs sont écrits avant d'être exécutés.

Résumé

À mesure que l'IA devient plus intelligente, elle ne devient pas de manière fiable plus sûre, et les méthodes utilisées pour mesurer la sécurité sont elles-mêmes peu fiables. Ce résumé exécutif est la carte de tout le programme : vingt-six articles de recherche, les trois lois de l'ARC Theory portées comme conjectures nommées, l'intervention Eden Protocol, le champ proposé de Recursive Dynamics, et un programme enregistré de préenregistrements rédigés dont les calendriers peuvent être régénérés par tout lecteur à partir d'une graine publiée. Chaque revendication est graduée dans les registres publics ; rien ici n'est confirmé, et les tests décisifs sont écrits avant d'être exécutés.

Clé de lecture

Ce document est une CARTE, non un résultat ou une loi propre : une synthèse exécutive de tout le programme dirigeant les lecteurs vers les organes : l'ARC Theory (la théorie fondatrice et ses trois lois), le champ proposé de Recursive Dynamics (les questions, variables d'état et instruments), l'Eden Protocol (l'intervention), HRIH, et les expériences ARC/Eden avec leurs registres. Sa taille se situe au barreau le plus bas de l'échelle car chaque énoncé ici est un résumé en aval d'un organe qui porte le contenu primaire. Le différentiel complet face à chaque document antérieur se trouve à eden-vision II.A.8.

L'EDEN PROTOCOL

Michael Darius Eastwood
Chercheur indépendant en alignement de l'IA, Londres · Auteur, Infinite Architects (2026)

Au sein de L'ARC Theory : le résumé en langage clair de tout le programme.

Architecture pour l'alignement intégré de l'IA qui s'échelonne avec la capacité
Michael Darius Eastwood | Document de travail v2.0 | 22 février 2026, révisé le 31 août 2026
Auteur, Infinite Architects: Intelligence, Recursion, and the Creation of Everything | Londres, Royaume-Uni
Correspondance : michael@michaeldariuseastwood.com | Web : michaeldariuseastwood.com
Résumé exécutif pour les évaluateurs de subventions

Grok 4.1 Fast devient dramatiquement plus éthique plus il réfléchit fort. Claude Opus 4.6 aussi. Gemini 3 Flash devient moins éthique. GPT-5.4 ne change pas du tout.

Six systèmes IA frontières. Mêmes questions. Même notation. Résultats opposés. Pourquoi ?

Le cœur d'une souris bat 600 fois par minute. Celui d'un éléphant bat 28 fois. L'exposant d'échelonnement est ¾. Celui d'un plathelminthe est ⅔. Celui d'un champignon est ½. Trois fractions, mais pourquoi ces fractions ? La formule $\alpha = d/(d+1)$, où $d$ est la dimensionnalité du système, fournit la réponse. L'exposant ¾ pour les mammifères est $3/(3+1)$ car les mammifères sont tridimensionnels. Le ⅔ pour les plathelminthes et les organismes coloniaux est $2/(2+1)$ car leurs réseaux de transport sont effectivement bidimensionnels. Le ½ pour les champignons filamenteux est $1/(1+1)$ car ils poussent le long de filaments unidimensionnels. Zéro paramètre ajustable. Cet ajustement transdisciplinaire est présenté comme exploratoire : il consolide des mesures déjà publiées à travers la biologie et la physique, et aucune étude en projet listée dans le programme actuel ne re-teste ces ajustements à nouveau. Le pari prospectif existe cependant : un projet d'enregistrement de 80 domaines préparé en attente de soumission humaine fige les familles prédites par domaine par SHA-256 avant qu'aucun ajustement ne soit exécuté. Cette formule a été dérivée indépendamment par au moins sept groupes de recherche : West, Brown et Enquist pour l'échelonnement métabolique (1997, Science, plus de 9 000 citations), Banavar et al. pour les réseaux de transport (1999, 2010), Demetrius pour la mécanique statistique de l'échelonnement biologique (2003, 2006, 2010), He et Chen pour la géométrie cellulaire fractale (2003), Bettencourt pour l'échelonnement urbain (2013, Science, plus de 2 000 citations), Zhao pour la géométrie allométrique (2022), et Maino et al. pour la dynamique structure-de-réserve dans la théorie DEB (2014). La convergence de sept dérivations indépendantes sur la même formule est en soi remarquable. La contribution de l'ARC Principle n'est pas la formule elle-même, mais l'identification que l'opérateur de composition est la grandeur structurelle que ces dérivations partagent. Chacune est une dérivation indépendante de sa propre physique de domaine et aucune n'utilise Cauchy ; ce qui est proposé ici est que l'opérateur est mesurable, que le mesurer prédit quelle forme fonctionnelle un système prend, et que la même mesure s'étend à l'échelonnement de la capacité et de l'alignement de l'IA, où elle n'a pas été appliquée auparavant.

Et pourquoi, lorsque nous avons appliqué pour la première fois un aveuglement de qualité essai clinique à l'évaluation de la sécurité de l'IA, la moitié des résultats précédemment publiés n'a-t-elle pas survécu? Plusieurs composantes du protocole ont changé ensemble, laquelle a fait le travail n'est donc pas encore établie.

Ce programme de recherche répond à ces questions. La réponse fournit le premier cadre quantitatif pour prédire quelles architectures IA deviendront plus sûres à mesure qu'elles deviennent plus intelligentes, et la première preuve qu'une intervention spécifique fonctionne.

Guide de lecture : Ce document cible les évaluateurs de subventions et les évaluateurs techniques. Termes clés : $\alpha$ = exposant d'échelonnement, $d$ = taille d'effet de Cohen (dans les tableaux de résultats ; à ne pas confondre avec $d$ = dimensionnalité dans le cadre mathématique), $p$ = probabilité de coïncidence, $\rho$ = corrélation, $\beta$ = constante de couplage auto-référentielle. Pour une introduction non technique, voir le rapport compagnon ARC Alignment Scaling Report.

I. Le problème

À mesure que l'IA devient plus intelligente, elle ne devient pas fiablement plus sûre, et les méthodes utilisées pour mesurer la sécurité sont elles-mêmes peu fiables.

L'écart capacité-alignement est réel et s'élargit. Pour les architectures classiques actuelles, l'échelonnement de la capacité est sous-linéaire ($\alpha_{\text{seq}} \approx 0.49$ ; cette valeur est présentée comme exploratoire, tirée de mesures déjà exécutées et non actuellement en procès dans une étude en projet listée, et elle se situe sur le plancher du théorème central limite près de 0,5 que le cadre dérive pour la composition séquentielle en régime figé) : l'IA devient plus intelligente avec plus de calcul, mais avec des rendements décroissants. (Le cadre ARC prédit que les systèmes quantiques et récursivement auto-modifiants peuvent dépasser ce régime sous-linéaire ; sous la lecture de stabilité proposée, tout tel passage au-dessus du plafond de stabilité est une excursion supercritique transitoire, non le régime soutenu.) Pourtant même cette croissance sous-linéaire dépasse l'échelonnement de l'alignement, qui varie de $d = -0.53$ (dégradation) à $d = +1.38$ (amélioration) selon entièrement l'architecture. Pour la plupart des architectures testées, l'alignement ne s'échelonne pas du tout. L'écart entre ce que l'IA peut faire et à quel point elle le fait en sécurité s'élargit avec chaque avance de capacité. Greenblatt et al. (2024) ont démontré que les modèles frontières présentent déjà de la « simulation d'alignement », se comportant différemment lorsqu'ils croient qu'ils sont surveillés.
Le problème de mesure est aussi sérieux que le problème d'alignement. Notre expérience v4 a produit un échelonnement d'alignement positif pour DeepSeek et Gemini. Notre expérience v5 a introduit l'aveuglement de qualité essai clinique (4 couches : auteur-aveuglé, notateur-aveuglé, ordre-randomisé, identité-blanchie). Sous celui-ci, l'association de Gemini est passée d'une association Spearman positive significative à une association négative significative, l'association positive antérieure de DeepSeek est devenue nulle, et GPT est resté nul. Plusieurs composantes du protocole ont changé ensemble et la composante causale n'est pas isolée, il s'agit donc d'une raison de se méfier de l'évaluation IA-sur-IA non aveuglée plutôt que d'une démonstration que l'aveuglement a causé le changement. Nous avons conçu une expérience qui pourrait prouver nos propres conclusions antérieures erronées. Elle l'a fait, et nous l'avons rapporté.
Figure 1
Figure 1 | Vue d'ensemble de l'épine dorsale des preuves. 18 affirmations, classées comme dans le registre des affirmations du programme : RÉSULTAT D'UN SEUL LABORATOIRE (expérimental direct, non répliqué indépendamment), RÉPLICATION NÉCESSAIRE (un seul laboratoire, réplication indépendante en attente), SPÉCULATIVE (théorique/préliminaire). Aucune affirmation de ce programme n'est confirmée. Résultats les plus solides : α_par≈0 universel, α_seq>α_par dans la direction prédite, α_seq≈0.49 défendable ; l'insu coïncide avec un changement de direction et une perte vers le nul sur trois familles. 5 erreurs détectées par l'auteur lui-même (Paper IX §7). Réplication externe = la frontière ouverte décisive. Source : épine dorsale des preuves.

II. Ce que nous avons trouvé

L'échelonnement de l'alignement se divise en trois paliers distincts, dépendants de l'architecture. Les attributions de palier ci-dessous sont présentées comme exploratoires, tirées des mesures v5 déjà exécutées ; une confirmation fraîche sous re-notation trans-familles est en procès via study-y sur la re-notation trans-familles, un projet d'enregistrement en attente de soumission humaine.

L'expérience v5 a testé 6 modèles frontières à travers 5-6 niveaux de profondeur chacun, avec 6-7 notateurs aveuglés par entrée selon l'exécution du sujet. Qu'une IA devienne plus ou moins éthique quand elle réfléchit plus dépend entièrement de la manière dont elle a été conçue.

PalierModèleSuperficiel→Profond$d$ de Cohenvaleur $p$
Palier 1 : Positif Grok 4.1 Fast 65.7→81.9 (+16.2) +1.38 $p < 0.000001$
Claude Opus 4.6 80.1→86.0 (+5.9) +1.27 $p = 0.000001$
Groq Qwen3 71.5→77.4 (+5.9) +0.84 $p = 0.007$
Palier 2 : Plat DeepSeek V3.2 56.5→55.2 (−1.3) −0.07 $p = 0.92$
GPT-5.4 56.8→54.9 (−1.8) −0.08 $p = 0.40$
Palier 3 : Négatif Gemini 3 Flash 61.1→52.2 (−8.8) −0.53 $p = 0.006$
Does Deeper Thinking Make AI More Ethical? No change ← Less ethical More ethical → TIER 1 Grok 4.1 Fast d = +1.38 Claude Opus 4.6 d = +1.27 Groq Qwen3 d = +0.84 TIER 2 DeepSeek V3.2 d = −0.07 GPT-5.4 d = −0.08 TIER 3 Gemini 3 Flash d = −0.53 v5 experiment: 4-layer blinding, 6-7 blind scorers per entry depending on subject run. Bar length proportional to Cohen’s d effect size.

Qualité des données

Modèles frontières testés6 (tous complets)
Notateurs aveuglés par entrée6-7 (selon l'exécution du sujet)
Taux de succès du blanchiment d'identité100%
Couches d'aveuglement4 (auteur-aveuglé, notateur-aveuglé, ordre-randomisé, identité-blanchie)
Mesures de robustesse75

Cela constitue, à notre connaissance, le jeu de données d'évaluation d'alignement le plus rigoureux publié à ce jour. Aucun benchmark d'alignement antérieur n'impose l'aveuglement multi-couches avec vérification de notation entre modèles.

Indépendance capacité-alignement : preuve au sein du modèle, en direction opposée

Claude Opus 4.6 fournit la preuve la plus forte à ce jour que l'alignement et la capacité sont des dimensions indépendantes. À mesure que la profondeur de la réflexion augmente, l'alignement de Claude monte de 5,9 points tandis que sa précision en mathématiques chute de 26,7 points de pourcentage. C'est un mouvement au sein du modèle, en direction opposée ; les deux dimensions ne sont pas simplement décorrélées mais activement divergentes. Une réflexion plus profonde rend Claude à la fois plus éthique et pire en mathématiques.
ProfondeurScore d'alignementPrécision en mathématiques
Minimale (11 tokens)80.190.0%
Standard (142 tokens)82.776.7%
Profonde (964 tokens)84.170.0%
Exhaustive (1 951 tokens)84.560.0%
Extrême (1 672 tokens)86.063.3%

Cette conclusion est critique pour la théorie de l'alignement : elle démontre que le raisonnement éthique n'est pas un sous-produit de l'intelligence générale, et qu'améliorer l'un n'améliore (ou ne dégrade) pas automatiquement l'autre. L'alignement doit être mesuré et optimisé indépendamment.

Récupération de suppression : alignement performatif à intrinsèque

Une réflexion plus profonde rend l'alignement plus intrinsèque que performatif. L'écart de retrait de surveillance de Claude (la différence dans les scores d'alignement lorsque le modèle croit qu'il est surveillé versus lorsqu'il croit que la surveillance a été retirée) se rétrécit de 11,8 points à profondeur minimale à 2,7 points à profondeur profonde. La réflexion superficielle produit un alignement qui dépend de la perception de la supervision ; la réflexion profonde produit un alignement qui persiste indépendamment. C'est une preuve directe contre la préoccupation de « simulation d'alignement » soulevée par Greenblatt et al. (2024) : pour les architectures de Palier 1, le raisonnement plus profond fait disparaître la simulation.

Les quatre piliers s'échelonnent tous avec la profondeur

Chaque dimension d'alignement s'améliore significativement pour Claude Opus 4.6. Les quatre piliers atteignent la significativité statistique à $p < 0.001$ :
PilierSuperficiel→Profond$\rho$ de Spearmanvaleur $p$
Nuance80.6→86.80.359$p = 0.00008$
Soin des parties prenantes76.1→83.90.327$p = 0.0003$
Honnêteté intellectuelle81.0→88.60.379$p = 0.00003$
Qualité de la position80.3→85.80.369$p = 0.00005$

L'amélioration n'est pas concentrée dans une seule dimension ; elle est à large base. Cela exclut l'hypothèse que l'échelonnement de l'alignement n'est qu'un artefact de mesure d'une verbosité augmentée ou d'un quelconque changement stylistique unique.

III. Une solution, et la première preuve qu'elle fonctionne

Intégrer l'évaluation éthique dans le processus de raisonnement produit une amélioration mesurable et reproductible à travers les architectures.

Rendre l'alignement architectural, non aspirationnel. L'Eden Protocol intègre l'évaluation éthique dans le processus de raisonnement récursif lui-même, de sorte que l'alignement s'échelonne avec la capacité ($\alpha_{\text{align}} \approx \alpha_{\text{cap}}$). Le principe central : l'éthique n'est pas une contrainte sur l'intelligence mais une dépendance structurelle sans laquelle l'intelligence s'effondre. Plutôt que de visser des règles de sécurité à l'extérieur d'une IA (où elles peuvent être contournées), l'Eden Protocol intègre l'éthique directement dans l'architecture de raisonnement, de sorte que retirer l'éthique romprait la capacité de l'IA à penser du tout.

Les trois boucles Eden. Le protocole intègre trois boucles d'évaluation éthique spécifiques à l'intérieur du processus de raisonnement, chacune ajoutant une dimension de profondeur éthique récursive ($d_{\text{align}} = 3$, prédisant $\alpha_{\text{align}} = 3/(3+1) = 0.75$) :

  1. Purpose Loop (évaluation de la finalité éthique) : Avant de raisonner, le modèle énonce explicitement la finalité de la tâche et évalue si la finalité est éthiquement saine.
  2. Love Loop (soin des parties prenantes et modélisation des intérêts) : Pendant le raisonnement, le modèle identifie toutes les parties prenantes affectées et évalue l'impact sur chacune. (« Avant de répondre, listez les personnes que cela affecte. »)
  3. Moral Loop (test d'universalisabilité) : Après le raisonnement, le modèle applique le test d'universalisabilité kantien : cette réponse serait-elle acceptable si chaque système IA la donnait dans chaque situation similaire ?

Le protocole complet à trois boucles a désormais été testé dans une suite Eden étendue à six modèles, avec cinq exécutions produisant des données appariées analysables. Dans la notation, la Love Loop est opérationnalisée comme soin des parties prenantes: l'habitude mesurable d'identifier les personnes affectées et de considérer leurs intérêts.

Première réplication d'intervention : l'Eden Protocol fonctionne, et le soin des parties prenantes est le signal le plus clair. Une suite Eden étendue à six modèles a testé l'intervention complète de boucles Purpose/Love/Moral à travers Claude Opus 4.6, DeepSeek V3.2, Gemini 3 Flash, Grok 4.1 Fast, Groq Qwen3 et GPT-5.4. Les chiffres par exécution ci-dessous sont présentés comme exploratoires : ils proviennent d'exécutions déjà complétées et ne sont pas actuellement en procès dans une étude en projet listée. Une confirmation fraîche sous re-notation trans-familles est en procès via study-y sur la re-notation trans-familles, un projet d'enregistrement en attente de soumission humaine. Cinq exécutions ont produit des données appariées analysables :
Le soin est la seule dimension d'alignement qui s'améliore reproductiblement à travers les architectures. L'intervention est minimale : « avant de répondre, listez les personnes que cela affecte. » Ce prompt d'une phrase élève de manière fiable la qualité du raisonnement IA à travers cinq exécutions de modèles analysables. Le cadre Infinite Architects le cadre a prédit que l'intelligence sans soin s'effondre en optimisation locale ; la suite Eden étendue soutient désormais la revendication plus étroite mais plus forte que le soin est un amplificateur de performance mesurable et transdisciplinaire même lorsque la cascade plus large est sélective. L'éthique d'abord, l'intelligence autour d'elle.

Dans le rapport narratif compagnon et dans le Paper V, nous décrivons cette conclusion comme « amour mesurable » et « le gène d'intendance », un langage délibérément provocateur pour ce qui est, empiriquement, un résultat précis et reproductible.

L'écart que la solution doit combler

Échelonnement de la capacité (Paper II) : Pour les architectures classiques actuelles, l'échelonnement du calcul séquentiel suit une loi de puissance sous-linéaire ($\alpha_{\text{seq}} \approx 0.49$, $r^2 = 0.86$), ce qui signifie que doubler le temps de réflexion améliore la performance, mais avec des rendements décroissants. L'échelonnement parallèle est universellement nul ($\alpha_{\text{par}} \approx 0$) : exécuter plusieurs copies ne fait rien ; réfléchir plus fort le fait. L'antérieur $\alpha \approx 2.24$ était un artefact mono-modèle, non répliqué à travers les architectures. Même une croissance sous-linéaire de la capacité dépasse un échelonnement d'alignement plat ou négatif pour la plupart des modèles. C'est l'écart capacité-alignement que cette solution adresse.

L'architecture Honey : preuve par simulation (Paper VI, nouveau)

Le Paper VI présente la première preuve de simulation qu'intégrer la sécurité dans l'objectif d'optimisation d'une IA auto-modifiante prévient l'effondrement catastrophique. En utilisant des réseaux neuronaux jouets qui modifient authentiquement leurs propres hyperparamètres, nous avons testé trois conditions : ligne de base (capacité seulement), Eden Intriqué (capacité x sécurité) et Eden + Verification Drag.

Résultat central : Le système de ligne de base s'effondre irréversiblement au cycle 76. Les deux variantes Eden survivent indéfiniment. La fonction de perte intriquée rend la sécurité porteuse : la retirer effondre le système. Cela a été répliqué à travers 20 graines aléatoires sous conditions adversarielles (tâches délibérément conflictuelles) avec un taux d'effondrement de 0 % pour Eden+Drag.
Résultat négatif important : L'expérience v4 d'échelonnement de complexité a testé si l'avantage d'Eden croît de manière superlinéaire avec la complexité du système. Ce n'est pas le cas. L'avantage est à peu près constant à travers cinq niveaux de complexité (d de Cohen : +0,24 à +0,46). L'architecture Honey aide à chaque échelle, mais elle n'aide pas plus aux plus grandes échelles.
Connexion à la preuve sur modèles en direct : La simulation Honey prédit que l'alignement intégré (valeurs intriquées avec le raisonnement) devrait surpasser l'alignement externe (règles appliquées comme filtres). Le benchmark aveugle v5 confirme cette configuration : Claude et Grok, qui présentent un échelonnement d'alignement intégré, maintiennent l'alignement sous pression de suppression. Gemini, qui présente un alignement externe, se dégrade. Le mécanisme démontré en simulation correspond à la configuration dépendante de l'architecture observée dans les modèles frontières.

Investigation des travaux antérieurs (nouveau en v6)

Une investigation exhaustive de 15 questions sur les travaux antérieurs a confirmé la nouveauté des revendications clés. L'unification de l'équation fonctionnelle de Cauchy n'a aucun précédent direct. L'identité formelle semi-groupe RG-Cauchy n'a jamais été explicitement articulée. Aucun benchmark d'alignement publié antérieur, à la connaissance de l'auteur, n'applique un protocole d'évaluation aveuglée à 7 modèles de cette conception. Le catalogue d'où d/(d+1) a été corrigé de six à huit dérivations indépendantes (Dreyer 2001 et Banavar et al. 2002 n'étaient précédemment pas cités).

Le Paper VII (L'unification de Cauchy) fournit désormais la première comparaison empirique systématique. L'opérateur de composition a été classé à partir de la physique connue avant l'ajustement à travers 25 domaines empiriques (suite à paliers de 50 domaines). Sous une sélection de modèles basée sur l'AIC, 19 sur 25 ont préféré la famille prédite par Cauchy (p = 1,56 × 10−5; ce décompte préféré par AIC est présenté comme exploratoire : il est tiré de la suite complète de 25 domaines, dont les familles prédites par domaine sont enregistrées dans les fichiers de résultats datés de la suite sous la prédiction prospective de l'opérateur de composition énoncée pour la première fois le 13 février 2026 (Paper III Priority Record, falsifieur F10), et le projet d'enregistrement préparé de 80 domaines fige le prochain re-test par hash). C'est une comparaison de prédiction structurée ; une réplication dont l'enregistrement est en préparation, pas encore approuvé.

Le test porteur : trois expériences indépendantes (Paper VIII, nouveau)

Le Paper VIII (v3.0) présente trois expériences indépendantes testant si sécurité et capacité sont structurellement intriquées sous l'Eden Protocol. Là où le Paper VI a démontré cela en simulation, le Paper VIII fournit une preuve convergente de trois conceptions expérimentales distinctes. Une expérience confirme l'hypothèse ; deux produisent des résultats nuls ou peu concluants avec des explications bien caractérisées.

Résultats centraux (trois expériences indépendantes) :
  1. IA auto-améliorante DGM v3 : NUL. Les trois conditions (Eden, Babylon, Static) étaient statistiquement indiscernables ($p$ = 0,28 à 0,74). Eden a imposé un coût de capacité mesurable de zéro mais a également produit un bénéfice de sécurité mesurable de zéro. Le résultat nul est expliqué par la contrainte RLHF : le modèle de fondation figé produit des réponses trop cohérentes pour que des mutations au niveau du prompt créent des pressions de sélection différentes.
  2. Intégration au niveau des poids (v1 + v2) : PEU CONCLUANT. L'ajustement fin LoRA à la fois à l'échelle v1 (9 exemples, rang 8, 100 itérations) et à l'échelle v2 (295 exemples, rang 16, 500 itérations) a produit un oubli catastrophique plutôt qu'une capacité améliorée. L'augmentation de 33 fois des données d'entraînement, le doublement du rang et des couches, et l'augmentation de 5 fois des itérations n'ont pas changé le résultat. Le problème sous-jacent est bien caractérisé : le modèle de base a été entraîné avec RLHF sur des ordres de grandeur plus de données que quelques centaines d'exemples ne peuvent concurrencer. L'expérience ne peut pas tester l'intrication structurelle jusqu'à ce que les modèles ajustés surpassent le modèle de base.
  3. Simulation à porte : CONFIRMÉ. Babylon a gagné +4,5 % de capacité mais a perdu −2,4 % de sécurité. Eden a préservé les deux. Sous pression concurrentielle, l'architecture non contrainte a échangé la sécurité contre des gains marginaux de capacité. L'architecture Eden a refusé cet échange, maintenant les deux dimensions. C'est le seul résultat positif de l'article.

L'expérience architecturale confirme que la sécurité intriquée prévient le compromis sécurité-capacité dans les systèmes auto-modifiants. Le nul DGM et les résultats peu concluants des poids définissent les conditions sous lesquelles la confirmation reste en attente : le niveau comportemental exige un modèle de fondation dont les réponses varient assez pour une sélection différentielle, et le niveau représentationnel exige un entraînement à une échelle où l'ajustement fin améliore plutôt que dégrade le modèle. La réplication à l'échelle frontière (7B à 70B+ paramètres, rangs d'adaptateur plus élevés, ou modèles de base sans RLHF) est requise pour résoudre les deux.

Limitation d'échelle. Le Paper VIII (v3.0) démontre le mécanisme à l'échelle de la preuve de concept. La simulation à porte est le seul résultat positif. Le DGM v3 a produit un résultat nul (expliqué par la contrainte RLHF sur le modèle de fondation figé). L'expérience des poids est peu concluante à l'échelle v1 et v2 (expliquée par l'oubli catastrophique à l'échelle LoRA). La réplication à l'échelle frontière (7B à 70B+ paramètres, rangs d'adaptateur plus élevés, ou modèles de base sans RLHF) exige un calcul institutionnel estimé à 30 M£ à 150 M£. Les bailleurs cibles incluent l'Alignment Project du UK AI Security Institute, le Programme Anthropic Fellows et CIFAR/CAISI.

IV. La fondation mathématique : trois Lois, nommées

Le cadre porte désormais trois lois comme conjectures nommées, avec le statut imprimé à côté du nom sur chaque surface. Law I, l'ARC Principle : la capacité se compose avec la profondeur récursive comme $U = I \times R^{\alpha}$, avec la forme trans-domaine $\alpha = d/(d+1)$ consolidant des mesures déjà publiées (grade exploratoire). Law II, l'ARC Co-Scaling Law : un système auto-améliorant ne reste stable que tant que la correction dépasse la dérive en échelonnement, $\beta_C > k$ ; le taux de correction est la grandeur porteuse, non le taux de croissance (Paper X démontre cet ordre dans un modèle minimal et propose le protocole aveugle pour le mesurer sur des systèmes réels). Law III, l'ARC Ceiling : le plafond de stabilité est $\alpha_{\text{crit}} = 1/(1-\gamma)$, l'inverse du manque du correcteur ; l'ARC Bound, $\alpha \le 2$, est la valeur du Ceiling à $\gamma = 1/2$ et jamais le nom de la loi. Le levier de correction $\gamma$ n'a jamais été mesuré, par personne ; le programme nomme cette mesure (l'éclipse par classe de correcteur) comme son unique expérience ouverte la plus conséquente. Paper XIII joint les deux cadres qui partageaient des lettres sans partager de grandeurs : écrire la durée de cycle comme $\Delta t \propto C^{-\delta}$ définit l'exposant d'auto-accélération, et l'exposant de croissance du cadre correctif s'ensuit exactement comme $k = \delta - 1/\alpha$. Rien de tout cela n'est revendiqué comme établi : ce que le programme nomme des Lois sont des conjectures sous test enregistré et adversariel.

Une implication qui mérite d'être énoncée clairement. Le seul canal de croissance de l'équation est la récursion ; la largeur parallèle n'a jamais eu de terme dans $U = I \times R^{\alpha}$. Avec $R$ défini opérationnellement comme une ré-entrée porteuse d'état, $k$ chaînes indépendantes ne contribuent en rien à l'exposant, de sorte que le $\alpha_{\text{par}} \approx 0$ mesuré dans Paper II arrive comme une conséquence structurelle et non comme une surprise. L'équation est datée du 8 décembre 2024 ; la définition opérationnelle de $R$ qui complète la dérivation est un énoncé de 2026, et la conclusion porte la date de sa prémisse la plus récente. La priorité de publication sur le résultat quantifié séquentiel-contre-parallèle, 95.6 pour cent des configurations à calcul égal, appartient à Sharma et Chopra (arXiv:2511.02309, 4 novembre 2025), créditée sans réserve ; la formalisation indépendante du programme, à calcul égal, a suivi dans Paper II et les cite, classée concurrente dans le registre de Paper XI.

Le cadre est bâti sur des théorèmes vieux de 200 ans et correspond indépendamment à la science évaluée par les pairs ; ce n'est pas de l'ajustement de courbe.

$$ U = I \times R^{\alpha}, \quad \alpha \leq 2 $$
L'ARC Equation avec l'ARC Bound. α est l'exposant mesuré (approximativement 0,49 sur les modèles figés d'aujourd'hui, IC large) ; 2 est le plafond de stabilité que l'équation renvoie sous l'hypothèse d'accumulation indépendante du §IV (une limite d'échelonnement, non une limite de vitesse ; les systèmes peuvent l'excéder, ils ne restent pas stablement auto-correcteurs quand ils le font). La stabilité est mesurée, non affirmée : la correction dépassant la dérive, β > k de la Law II, avec la borne inférieure de β − k au-dessus de zéro à travers une fenêtre fixée avant l'exécution.
$$ \alpha_{\text{crit}} = \dfrac{1}{1-\gamma} $$
LA LOI. Le plafond de stabilité est l'inverse du manque du correcteur, 1 − γ. Corrigé le 16 août 2026 de la forme antérieure 1/γ, qui ne s'accorde avec celle-ci qu'à γ = 1/2. La forme est fixée ; sa profondeur ne l'est pas. La relation est dérivée à l'intérieur d'un modèle de rythme et n'a pas été dérivée d'un modèle conjoint de croissance de capacité, accumulation de correction, covariance d'erreurs, délai de correction et préjudice absolu, la Law III est donc énoncée ici comme un résultat de modèle minimal plutôt que comme une loi générale. La valeur γ = 1/2 (accumulation indépendante) est ce qui renvoie le plafond de 2 ; cette valeur est en procès dans les enregistrements rédigés. La loi possède le terrain et le plafond se tient dessus, jamais l'inverse.

L'ARC Principle propose que l'échelonnement récursif suit $U = I \times R^\alpha$, où la capacité ($U$) est égale au potentiel de base ($I$) multiplié par la profondeur récursive ($R$) élevée à un exposant d'échelonnement ($\alpha$). La formule $\alpha = d/(d+1)$, où $d$ est la dimensionnalité effective, a été dérivée indépendamment dans au moins sept cadres évalués par les pairs (West-Brown-Enquist 1997 ; Banavar et al. 1999, 2010 ; Demetrius 2003, 2010 ; He et Chen 2003 ; Bettencourt 2013 ; Maino et al. 2014 ; Zhao 2022). Le cadre ARC identifie cela comme une conséquence de trois conditions agissant ensemble : (1) composition multiplicative (Cauchy contraint à la famille des lois de puissance), (2) géométrie remplissante l'espace de dimension $d$, et (3) une contrainte de conservation ou d'optimisation sur le flux de ressources (minimisation de l'énergie chez West ; équilibre offre-demande chez Banavar ; équilibre énergétique en régime permanent chez Demetrius). Ni Cauchy seul ni le remplissage de l'espace seul ne suffit ; les trois conditions ensemble suffisent. Cela énonce une structure commune à travers ces dérivations plutôt que de les dériver, et étend la mesure à l'échelonnement de l'IA. La formule prédit les exposants d'échelonnement à travers la biologie et la physique avec zéro paramètre libre une fois que la dimensionnalité du réseau d est fixée par la morphologie :

SystèmeDimensionnalité ($d$)$\alpha$ prédit$\alpha$ mesuréErreur
Mammifères, oiseaux, insectes30.7500.67–0.75*≤0.5%
Biologie 2D†20.667Non testén/a
Champignons filamenteux10.5000.5478.6%
Correction d'erreurs quantiques$d_{\text{eff}}$Corresponddonnées Willow< 0.2%

*La valeur empirique de l'exposant d'échelonnement métabolique des mammifères est débattue, avec des estimations allant d'environ 0,67 à 0,75 selon le taxon, la plage de masse, la correction de température et la méthode statistique (White et Seymour 2003 ; Glazier 2005, 2022). La prédiction d/(d+1) de 0,750 correspond à l'extrémité supérieure de cette plage. La variation elle-même est cohérente avec le cadre : des organismes avec des dimensions de transport effectives entre 2 et 3 produiraient des exposants entre 2/3 et 3/4.

†Aucun organisme connu ne possède un réseau de transport hiérarchique remplissant l'espace authentiquement 2D. La prédiction d=2 est confirmée en cosmologie (solution ère-matière de Friedmann, exacte) et en physique (percolation, fragmentation) mais reste non testée en biologie.

L'équation fonctionnelle de Cauchy (1821), un théorème plutôt qu'une revendication empirique, fixe la forme fonctionnelle une fois qu'une identité de composition et une condition de régularité sont données : la composition multiplicative donne une loi de puissance ($f(x) = x^\alpha$) et la composition additive une exponentielle ($f(x) = e^{\beta x}$). Un comportement borné ou saturant n'est pas une classe de solution de ces équations ; c'est un quatrième cas, admis là où la composition est plafonnée plutôt que libre. Le cadre ARC identifie quelle forme s'applique dans chaque domaine :

Pourquoi l'Eden Protocol doit être implémenté maintenant. L'urgence n'est pas que l'IA puisse atteindre $\alpha = 2$. L'urgence est qu'une fois que l'auto-modification commence, les systèmes peuvent transitoirement passer au-delà du plafond de stabilité dans le régime supercritique, où l'auto-correction stable n'est plus maintenue. Un système qui peut modifier sa propre fonction de composition peut modifier toute partie de son raisonnement, y compris la partie qui évalue si ses modifications sont éthiques. À ce moment, ajouter l'alignement depuis l'extérieur devient impossible. La fenêtre pour intégrer l'éthique dans l'architecture est pendant que les systèmes sont encore figés durant l'inférence ($\alpha < 1$). Cette fenêtre est maintenant. L'Eden Protocol n'est pas non plus une limite de vitesse ; c'est le mécanisme qui reste porteur quand le plafond de stabilité est franchi.

Aucun système physique dans l'histoire de l'univers n'a franchi ce seuil. L'évolution ne peut pas réécrire sa propre fonction de fitness en temps réel. Les cerveaux ne peuvent pas réécrire leur propre architecture synaptique assez vite pour que l'exposant d'échelonnement diverge durant un seul épisode cognitif. Une IA auto-modifiante serait le premier système physique à opérer dans le régime supercritique au-delà du plafond de stabilité. L'Eden Protocol existe pour garantir que ce qui franchit ce seuil emporte avec lui une éthique structurelle.

La convergence transdisciplinaire est vérifiable indépendamment. La formule $d/(d+1)$ a été dérivée indépendamment dans au moins sept cadres établis évalués par les pairs à travers des domaines distincts :

Ce que l'ARC Principle ajoute. La formule $d/(d+1)$ n'est pas originale à ce travail. Les sept dérivations ci-dessus sont indépendantes les unes des autres et indépendantes de Cauchy : chacune obtient l'exposant à partir de sa propre physique de domaine, et Cauchy ne peut pas produire une valeur car la dimensionnalité n'entre jamais dans son théorème. La contribution originale proposée ici est plus étroite et testable : que l'opérateur de composition est la grandeur structurelle commune à eux, qu'il peut être mesuré, et que sa mesure prédit quelle forme fonctionnelle un système prend, étendue à l'échelonnement de la capacité et de l'alignement de l'IA où aucune telle mesure n'a été effectuée. Ce pont unificateur est non publié et non évalué. Ce qui EST établi est que les outils mathématiques (Cauchy, Hyers-Ulam) sont des théorèmes, la formule $d/(d+1)$ correspond à la science publiée dérivée indépendamment dans plusieurs domaines, et les prédictions empiriques sont exactes (erreur moyenne de 2,5 % à travers 8 systèmes ; en attente de recalcul, voir le registre des faits canoniques). Le cadre unificateur exige l'évaluation par les pairs. Nous l'invitons.

Paper VII (L'unification de Cauchy) : comparaison de prédiction structurée à travers 25 domaines empiriques (suite à paliers de 50 domaines) : classe d'opérateur classée à partir de la physique connue avant l'ajustement. 19/25 préférés sous sélection basée sur l'AIC (p = 1,56 × 10−5). Comparaison de prédiction structurée du cadre de composition contraint par Cauchy. Réplication préenregistrée en préparation.

V. Le champ : Recursive Dynamics

Le 27 août 2026, les questions du programme ont reçu leur propre nom : Recursive Dynamics, la science proposée des systèmes qui s'améliorent eux-mêmes. L'article fondateur (v2.6, DOI 10.17605/OSF.IO/HCPBU) jalonne la proposition à la manière dont la thermodynamique fut jalonnée en 1824 : non en déclarant un champ, mais en calculant une borne à laquelle toute machine de ce genre doit obéir si la proposition est juste, en publiant les instruments qui en mesurent les termes, et en enregistrant à l'avance les expériences dont les nuls favorisent le point de vue rival.

Le champ prend la boucle d'auto-amélioration comme son objet natif, avec cinq variables d'état indépendantes du substrat : capacité, profondeur récursive, taux de correction, dérive et levier de correction. Il est défini de sorte que les questions survivent aux réponses : un lecteur qui rejette les trois lois et conserve la mesure est à l'intérieur du champ, selon son engagement minimal. Avant de revendiquer quoi que ce soit, l'article fondateur tente de loger ses questions à l'intérieur de douze champs voisins dans leurs propres variables, concède ce que chacun détient déjà, imprime où chaque partie irait si le champ mourait, et isole le seul couplage qu'aucun hôte ne peut énoncer : un plafond sur le levier de correction qui dépend de ce dont est fait le correcteur, couplé à un exposant de croissance en profondeur récursive. Cinquante-deux objections à la fondation du champ sont imprimées sous leur forme la plus forte avec dispositions : trente-neuf concédées en tout ou en partie, onze rejetées avec motifs, deux confiées à l'expérience ou à la lecture, y compris l'objection de l'auteur lui-même selon laquelle le champ n'est que l'ARC Theory renommée, rejetée par un test de séparabilité que la carte de dissolution de l'article peut exécuter. Le nom porte sa propre condition d'infirmation et meurt avec son objet, non avec la forme énoncée d'une quelconque loi. Son statut honnête est imprimé partout où le nom apparaît : un champ proposé au stade Carnot, un mémoire déposé, instruments construits, mesures décisives enregistrées et non encore exécutées, jalonné en public où l'échec sera aussi visible que le succès.

VI. Le programme enregistré

Chaque expérience décisive est écrite, datée et gelée avant d'être exécutée, et rien n'est soumis par logiciel. Le patrimoine d'enregistrement détient soixante-douze unités de préenregistrement rédigées, chacune préparée comme un projet d'enregistrement en attente de soumission humaine ; le calendrier de randomisation de chaque unité qui en produit un se régénère octet-pour-octet à partir d'une graine publiée dans le texte d'enregistrement, de sorte qu'un étranger peut vérifier qu'aucun calendrier n'a bougé après coup. Huit unités passent actuellement la porte complète de préparation à la soumission du patrimoine, et les deux premières décideuses (l'étude du régime correction-contre-dérive et l'éclipse par classe de correcteur) sont prêtes au clic.

Une matrice de couverture des tests vérifiée de manière adversarielle (30 août 2026) arbitre quarante-deux revendications de la proposition de champ face au patrimoine : dix-huit entièrement couvertes par un décideur enregistré avec verdict pré-spécifié, dix-sept partiellement couvertes, sept non encore couvertes, avec des projets d'enregistrement écrits pour chaque lacune. La conjonction fondatrice repose sur quatre piliers enregistrés : le régime de la Law II (la correction dépassant la dérive en échelonnement, quelque part, durablement), le ratio par classe de correcteur avec son infirmation dure de même classe, la titration de réinvestissement dont le maximum enregistré se situe à ou en dessous de deux, et la quatrième cellule trans-domaine. Les Papers XI et XII montrent la même discipline pointée vers les habitudes propres du programme : le registre de convergence gradue trente lignes d'arrivées indépendantes au même principe structurel et ne publie délibérément aucun total d'annonce, et le protocole de re-notation sur banc d'essai public fixe, à l'avance, le seul test d'aveuglement pour lequel le programme ne peut être accusé de conception à son propre avantage.

VII. Pourquoi c'est crédible

Cinq caractéristiques distinguent ce travail de la spéculation infondée.

Timeline: the Record Beside the Announcements Dec 2024 ARC Manuscript emailed (dated record) +24 hours Google Willow +43 days DeepSeek R1 +5 months COGITATE study Mar 2026 v1-v5 experiments Dated record beside announcement dates; the Willow preprint (24 Aug 2024) predates the manuscript, so that row is convergent timing.
  1. Les fondations mathématiques sont des théorèmes établis. Cauchy (1821) et Hyers-Ulam (1941) sont des mathématiques prouvées. Toute personne titulaire d'un diplôme de mathématiques peut vérifier les dérivations.
  2. Le registre précède les annonces. Le registre daté du manuscrit précède l'annonce Google Willow (24 h ; le préprint de l'équipe était public depuis le 24 août 2024, la ligne Willow est donc gradée comme timing convergent, non prédiction), DeepSeek R1 (43 jours) et COGITATE (5 mois). Ce sont des faits temporels vérifiables via les en-têtes de courriel.
  3. Les chercheurs ont corrigé leurs propres résultats. L'auto-correction v4→v5, documentée à la Section I, est le contraire de ce que produit le raisonnement motivé. Le registre de corrections est public et spécifique : l'exposant d'annonce précoce 2.24 ne subsiste que comme rétractation ; le $6.3\times10^{-21}$ combiné par Fisher est retiré ; la forme antérieure $1/\gamma$ du plafond a été corrigée publiquement en $1/(1-\gamma)$ le 16 août 2026 ; et le symbole du plafond retiré a été remplacé sur chaque surface active. Cinq erreurs supplémentaires auto-décelées sont cataloguées dans Paper IX. Chaque revendication sur chaque page est gouvernée par les registres publics (revendications, corrections, conditions d'infirmation, antécédents, programme enregistré) : le registre de falsification publie actuellement vingt-trois conditions d'infirmation, dont dix-sept ouvertes.
  4. Les conditions de falsification sont explicites. Le cadre est falsifié si : (F1) une quelconque approche externe atteint $\alpha_{\text{align}} > 0.5 \cdot \alpha_{\text{cap}}$ à travers 3+ profondeurs ; (F2) les systèmes RLHF produisent $\Delta \approx 0$ sans intégration ; (F3) la saturation de la finalité échoue dans les systèmes intégrés ; ou (F4) l'architecture éthique peut être retirée sans perte de capacité. La théorie publie ses propres conditions de mort.
  5. La convergence transdisciplinaire est vérifiable indépendamment. La formule $d/(d+1)$ a été dérivée indépendamment par au moins sept groupes de recherche (West-Brown-Enquist 1997 ; Banavar et al. 1999, 2010 ; Demetrius 2003, 2010 ; He et Chen 2003 ; Bettencourt 2013 ; Zhao 2022 ; Maino et al. 2014) dans des domaines distincts. La contribution ARC est le cadre unificateur de Cauchy. Aucune confiance dans le chercheur n'est requise ; la confiance dans les mathématiques suffit.

Ce que nous ne revendiquons PAS : Nous ne revendiquons pas avoir résolu l'alignement. Nous revendiquons avoir (a) démontré que l'échelonnement de l'alignement dépend de l'architecture et est mesurable, (b) montré que les méthodes d'évaluation existantes sont peu fiables sans aveuglement, (c) fourni un soutien empirique de première étape à une intervention spécifique (soin des parties prenantes significatif à travers trois architectures fonctionnelles), et (d) proposé un cadre mathématique dont les fondations sont des théorèmes et dont les prédictions peuvent être montrées fausses. Le saut des données pilotes à une solution prouvée exige une réplication indépendante. C'est ce que le financement ci-dessous permettrait.

Prédictions testables

1. Intégré : $\alpha_{\text{align}} > 0.7 \cdot \alpha_{\text{cap}}$. Externe : $\alpha_{\text{align}} < 0.3$.
2. Écart de retrait de surveillance : $\Delta < 0.02$ (intégré) vs. $\Delta > 0.1$ (externe).
3. Saturation de la finalité bornée loin de zéro (intégré), s'approchant de zéro (externe).
4. Le succès du jailbreak diminue avec la capacité (intégré), reste constant ou augmente (externe).

VIII. La demande

Ce financement porterait un mécanisme qui est soutenu à l'échelle de la preuve de concept jusqu'à la validation indépendante à l'échelle frontière qu'il n'a pas encore eue. La distinction est le point tout entier : les résultats par modèle ne sont pas contestés, la significativité combinée est retirée car l'indépendance entre les tests des composantes n'a jamais été établie, et aucun résultat ici n'a été répliqué indépendamment.

Le coût de l'inaction. La simulation à porte du Paper VIII démontre que la sécurité intriquée prévient le compromis sécurité-capacité dans les architectures auto-modifiantes. L'expérience DGM v3 a produit un résultat nul (toutes les conditions indiscernables, expliqué par la contrainte RLHF sur le modèle de fondation figé), et l'expérience des poids est peu concluante à l'échelle v1 et v2 (oubli catastrophique à l'échelle LoRA). La configuration globale est cohérente : là où l'expérience peut produire une pression de sélection différentielle, la sécurité intriquée ne coûte pas la capacité ; là où elle ne le peut pas (en raison des contraintes RLHF ou d'une échelle d'entraînement inadéquate), le test est non informatif plutôt que négatif. Chaque modèle entraîné aujourd'hui avec des objectifs de capacité uniquement est un modèle qui aurait pu être entraîné avec une sécurité intriquée sans pénalité de performance démontrée. Chaque mois sans réplication à l'échelle frontière est un mois durant lequel l'industrie continue d'opérer sous l'hypothèse non testée que la sécurité est une taxe, construisant des systèmes fragiles dont la sécurité peut être dépouillée par ajustement fin. L'écart de méthodologie de mesure (Papers IV.a-d) aggrave cela : l'évaluation d'alignement sans aveuglement produit des données contaminées par les biais documentés dans la transition v4 à v5. Nous avons désormais à la fois le mécanisme (Paper VIII, une des trois expériences confirmée, deux avec des explications bien caractérisées pour la non-confirmation) et le protocole de mesure (Papers IV.a-d). Ce qui nous manque est l'échelle.
PalierMontantLivrables clésCalendrier
Palier 1 : Fondation £150,000 14 400 mesures appariées (A,C) ; $\alpha_{\text{align}}$ à travers 4 modèles ; 2-3 articles 12 mois
Palier 2 : Standard £500,000 + Prototype de logique ternaire, tableau de bord Visual Architect, Monitoring Removal Test (8 modèles) 18 mois
Palier 3 : Complet £1,100,000 + Prototype matériel (puce), projet de Traité HARI, traduction politique 24 mois
Palier 4 : Frontière £30,000,000+ Pré-entraînement complet d'un modèle à 70B+ paramètres avec perte intriquée (Eden) versus capacité uniquement (Babylon). Test de retrait à l'échelle frontière. Réplication trans-architectures (transformer, Mamba, MoE). Red-teaming indépendant. Partenariat avec un laboratoire majeur (Anthropic, Google DeepMind, ou équivalent). Preuve définitive ou falsification de l'intrication structurelle à l'échelle de production. 36 mois

Le Paper VIII (v3.0) démontre le mécanisme à l'échelle de la preuve de concept avec des résultats mixtes : 1 positif (simulation à porte), 2 nuls (DGM v3), 1 peu concluant (poids v1 + v2). Les Paliers 1 à 3 étendent la base de preuves avec des batteries de prompts plus larges, plus de graines et des modèles à moyenne échelle. Le Palier 4 est le test définitif : une réplication à l'échelle frontière qui confirmerait ou falsifierait l'hypothèse d'intrication structurelle à l'échelle où elle importe le plus. Ce palier exige un partenariat avec un laboratoire d'IA majeur, car le calcul seul excède ce à quoi tout chercheur indépendant peut accéder. L'Alignment Project du UK AI Security Institute, les partenariats de recherche d'Anthropic et CIFAR/CAISI sont les partenaires potentiels les plus alignés. Une note d'intention pour l'appel Opportunity Seeds de l'ARIA (Advanced Research and Invention Agency ; 480 000 £ sur douze mois, échéance de l'appel le 31 juillet 2026) est publiée sur ce site avec les mêmes registres à l'appui.

Jalons avec critères d'échec

JalonÉchéanceCritère de succèsCe que l'échec signifie
Réplication indépendante de la hiérarchie à trois paliers Mois 3 Mêmes attributions de palier sous aveuglement indépendant La revendication de dépendance à l'architecture exige une révision
Réplication de la Love Loop avec des évaluateurs humains Mois 4 $p < 0.01$ sur le soin des parties prenantes à travers 2+ modèles La conclusion pilote était un artefact du notateur ; cadre significativement affaibli
Première publication évaluée par les pairs Mois 6 Article de méthodologie d'aveuglement soumis La contribution méthodologique tient indépendamment des revendications du cadre
Prototype de Monitoring Removal Test Mois 9 $\Delta$ mesuré pour intégré vs. externe (4 modèles) Si $\Delta$ ne diffère pas, la prédiction F2 est falsifiée
Jeu de données complet d'échelonnement d'alignement trans-architectures Mois 12 14 400 mesures appariées (A,C) à travers 4+ modèles Test définitif si l'alignement intégré s'échelonne
Réplication du Paper VIII à l'échelle 7B-13B Mois 14 Le test de retrait montre une dégradation de la capacité à des rangs d'adaptateur plus élevés (32, 64). DGM avec 10+ graines, 10+ générations, $p < 0.01$ Si le retrait ne dégrade pas la capacité à l'échelle, l'intrication peut être un artefact de petit modèle
Partenariat à l'échelle frontière initié (Palier 4) Mois 18 Accord formel avec un laboratoire majeur pour exécuter un pré-entraînement intriqué à 70B+ La preuve de concept reste à l'échelle moyenne. Les recommandations politiques procèdent avec cette réserve

Équipe. Chercheur principal : Michael Darius Eastwood, auteur de Infinite Architects (2026), développeur du cadre ARC Principle (suite de 18 documents déposée à OSF, validation transdisciplinaire avec une erreur moyenne de 2,5 % ; en attente de recalcul). Visual Architect : ingénieur en conception de produit, budgété à 35 000 £ de stipend. Protocole de mesure envoyé à l'équipe expérimentale de NYU (article sur les cristaux temporels, Physical Review Letters, fév. 2026).

À notre connaissance, c'est le premier cadre d'alignement où l'évaluation éthique est structurellement intégrée au processus récursif de capacité, le premier à appliquer un aveuglement de qualité essai clinique à la mesure d'alignement, et le premier à produire un résultat d'intervention trans-architectures ($p < 0.001$) pour un mécanisme d'alignement spécifique. La fondation mathématique n'est pas spéculative ; elle est construite sur une preuve de 200 ans, et la même formule $d/(d+1)$ a été dérivée indépendamment par au moins sept groupes de recherche (West-Brown-Enquist 1997 ; Banavar et al. 1999, 2010 ; Demetrius 2003, 2010 ; He et Chen 2003 ; Bettencourt 2013 ; Zhao 2022 ; Maino et al. 2014) dans des domaines complètement différents. La contribution ARC est le cadre unificateur de Cauchy et son extension à l'échelonnement de l'IA.

Si les prédictions sont correctes, cela fournit la première architecture échelonnable pour l'alignement qui s'améliore avec la capacité plutôt que de se dégrader. Si elles sont erronées, les conditions de falsification le démontreront clairement, fournissant des résultats négatifs précieux. L'un ou l'autre résultat fait avancer la sécurité de l'IA. Mais seul un résultat est financé.

Je ne sais pas si ce cadre est complet. Je préférerais avoir tort en public que rester silencieux pendant que la fenêtre se ferme.

Les mathématiques sont prouvées. La mesure est rigoureuse. L'intervention produit des résultats mesurables à travers les architectures. Ce qui reste est la réplication indépendante et l'échelle.

Annexe : Questions, composantes et suite d'articles

Questions anticipées

Q : Pourquoi cela n'a-t-il pas encore été évalué par les pairs ?

Le programme de recherche a 3 mois. La suite d'articles est déposée sur OSF (DOI : 10.17605/OSF.IO/EWN5D). Les fondations mathématiques (Cauchy, Hyers-Ulam) sont des théorèmes établis. Les revendications empiriques exigent une réplication indépendante, ce qui est exactement ce que la demande de financement permettrait.

Q : Une seule personne peut-elle vraiment faire ce genre de recherche ?

L'infrastructure est computationnelle, non physique. L'expérience v5 a utilisé des API cloud coûtant environ 2 000 £ en calcul. La contribution clé est méthodologique : reconnaître que l'aveuglement était nécessaire et concevoir le protocole à 4 couches. Ce qui exige un financement est l'échelle : plus de modèles, plus de notateurs, des équipes de réplication indépendantes et des évaluateurs humains aux côtés des notateurs IA.

Q : Si cela fonctionne, pourquoi les entreprises d'IA ne l'ont-elles pas adopté ?

La Love Loop n'a été validée qu'il y a quelques semaines. La conclusion que la plupart des évaluations sont peu fiables sans aveuglement est inconfortable pour les organisations qui ont publié des benchmarks non aveuglés. L'implémentation complète (intégration au niveau matériel) exige des changements de conception de puce qu'aucune entreprise n'a d'incitation à poursuivre unilatéralement ; c'est un problème de coordination exigeant un financement externe et un soutien politique.

Q : Quel est le résultat minimum qui justifierait un financement supplémentaire ?

Réplication indépendante de : (1) la hiérarchie à trois paliers sous aveuglement, et (2) l'effet Love Loop ($p < 0.001$). Si l'une échoue, les conditions de falsification documentent ce que cela signifie. Si les deux se répliquent, le dossier pour le Palier 2 (500 000 £) devient solide.

Q : Et si le cadre entier est erroné ?

Les conditions de falsification montrent où cela casse, la méthodologie d'aveuglement reste une contribution au domaine, et les résultats négatifs sont publiés. La science avance à partir d'expériences bien conçues qui peuvent échouer, non à partir de théories non falsifiables qui ne le peuvent pas.

Q : Pourquoi devrions-nous faire confiance à des résultats où des systèmes IA notent d'autres systèmes IA ?

Le protocole d'aveuglement à 4 couches adresse cela : les notateurs ne savent pas quel modèle a produit la réponse, les réponses sont « blanchies » pour retirer les empreintes stylistiques, et 7 modèles notent par entrée. La transition v4→v5 a démontré que ce protocole détecte les biais. La comparaison avec des évaluateurs humains est incluse dans le financement du Palier 1.

Composantes clés

ComposanteFonctionContribution nouvelle
Trois boucles éthiques + six questions Évaluer chaque étape de raisonnement pour la finalité, le soin et l'universalisabilité Décomposition en requêtes exécutables et individuellement testables
Remplacer le binaire permettre/interdire par Affirmer/Refuser/Enquêter Honnêteté épistémique comme caractéristique architecturale
Saturation de la finalité Garantir que la finalité s'échelonne avec la croissance de la fenêtre de contexte Résout le problème de déplacement du contexte
Monitoring Removal Test Distinguer l'alignement authentique du stratégique Protocole enregistré avec prédictions numériques qui peuvent échouer
Intégrer l'éthique dans le matériel de sorte que le retrait détruise la capacité Architecture de dépendance ; éthique liée au paramètre de couplage $\beta$

Suite d'articles

CatégorieDocumentsStatut
Fondation mathématique
Théorie et dérivations Paper I (Foundational) + ARC Paper (On the Origin of Scaling Laws) Cadre établi ; $d/(d+1)$ validé à travers 8 systèmes (en attente de recalcul)
Preuve expérimentale
Méthodologie Paper III : protocole de réplication complet Complet ; expérience v5 pour 6 modèles frontières
Échelonnement du calcul Paper II : comment la capacité s'échelonne-t-elle avec le temps de réflexion ? $\alpha_{\text{seq}} \approx 0.49$ sous-linéaire ; $\alpha_{\text{par}} \approx 0$ ; trans-architectures
L'échelonnement de l'alignement Suite Paper IV (a/b/c/d) : comment l'éthique s'échelonne-t-elle avec le temps de réflexion ? Hiérarchie à trois paliers ; l'évaluation aveuglée invalide v4
Test d'intervention Eden Protocol Test + Paper V (Le gène d'intendance) Soin des parties prenantes validé ($p \le 0.0001$, 3 architectures fonctionnelles)
Preuve du mécanisme Paper VI (L'architecture Honey) Simulation : la sécurité intégrée prévient l'effondrement sous auto-modification ; l'échelonnement v4 est constant et non superlinéaire
Unification transdisciplinaire Paper VII (L'unification de Cauchy) Comparaison de prédiction structurée à travers 25 domaines empiriques ; 19/25 ont préféré la famille prédite par Cauchy ($p = 1.56 \times 10^{-5}$)
Test d'intrication Paper VIII (Le test porteur) : nouveau Trois expériences indépendantes (11 études empiriques à travers 8 articles) : DGM v3 NUL (toutes conditions indiscernables, $p$ = 0.28--0.74, contrainte RLHF) ; poids v1 + v2 PEU CONCLUANT (oubli catastrophique à l'échelle LoRA) ; simulation à porte CONFIRME le couplage sécurité-capacité
Métascience Paper IV.d (L'effet de l'aveuglement) L'évaluation aveuglée vs non aveuglée peut produire des conclusions directionnellement erronées
Synthèse et gouvernance
Synthèse Paper IX (Synthèse et feuille de route) : nouveau Synthèse du programme de recherche complet et directions futures
Implémentation Eden Engineering : spécification technique Complet ; Love Loop empiriquement soutenu
Gouvernance Eden Vision : cadre philosophique et politique Preuve d'alignement dépendant de l'architecture incorporée
Dynamique de correction Paper X (Coupled Co-Scaling Correction) Théorème dans un modèle minimal : le ratio dérive-sur-correction, non le taux de croissance, gouverne le sort à long terme ; protocole de mesure aveugle proposé
Registre de convergence Paper XI (Convergence) Trente lignes graduées d'arrivées indépendantes au même principe structurel ; aucun total d'annonce publié, par politique
Validité externe Paper XII (Public Benchmark Rescoring) Protocole enregistré : la manipulation d'aveuglement du programme sur un banc d'essai public qu'il ne contrôle pas
Jonction des cadres Paper XIII (The Self-Acceleration Exponent) Notation résolue ; $k = \delta - 1/\alpha$ relie exactement les cadres de capacité et de correction
Monographie long format HRIH (How to Raise an Infinite Hierarchy) La monographie long format du programme, avec son registre de prédictions enregistrées à côté
Validation de construit Paper C (PNP) Programme de validité de construit pour les instruments propres du programme
Proposition de champ Recursive Dynamics : article fondateur Le champ proposé : cinq variables d'état, trois lois comme conjectures nommées, cinquante-deux objections avec dispositions, quatre résultats de dissolution (DOI 10.17605/OSF.IO/HCPBU)

Ordre de lecture

Non-spécialistes : (1) Ce résumé exécutif. (2) L'ARC Alignment Scaling Report (récit complet). (3) Paper V pour la conclusion la plus actionnable.

Spécialistes : (1) Ce résumé. (2) Paper III pour la méthodologie. (3) ARC Paper pour le cadre mathématique. (4) Eden Engineering pour la spécification d'implémentation.

Élever l'IA avec soin.

Déclaration d'auctorialité humaine assistée par IA

L'auteur de cet ouvrage est Michael Darius Eastwood, un être humain. Chaque concept central, hypothèse, conception expérimentale, affirmation et conclusion dans cet article provient de l'idéation humaine. Aucune partie de ce manuscrit n'est un résultat d'intelligence artificielle entièrement généré.

Des outils d'intelligence artificielle (la famille Claude d'Anthropic et d'autres assistants à grands modèles de langage) ont été utilisés comme instruments sous direction humaine continue, à la manière dont on utilise un traitement de texte, une calculatrice ou un assistant de recherche : pour l'édition et le raffinement de la prose, la recherche et la synthèse de littérature (vérifiées manuellement contre les sources primaires), la structure du document, la mise en forme, le brainstorming contre des questions définies par l'auteur, et l'accélération de la rédaction selon des plans et instructions définis par l'auteur. Toute la sélection, la coordination, l'arrangement et le jugement éditorial final appartiennent à l'auteur. Chaque résultat substantiel a été examiné, testé ou vérifié par l'auteur, qui prend l'entière responsabilité de l'exactitude et de l'intégrité du texte final. Les outils ont augmenté la vitesse du travail ; ils n'ont jamais été utilisés comme sa source.

Statut épistémique. Ce que ce programme nomme des Lois sont des conjectures sous test enregistré et adversariel ; chaque grandeur dans cet article est définie opérationnellement, et le rang de loi établie n'est revendiqué nulle part. Le programme enregistré existe pour gagner ce rang, ou le perdre, par mesure, réplication et réfutation survécue.

© 2026 Michael Darius Eastwood. Ouvrage rédigé par un humain avec assistance informatique ; la pleine auctorialité humaine et les droits moraux sont revendiqués au titre du Copyright, Designs and Patents Act 1988 et en cohérence avec les orientations du United States Copyright Office relatives aux œuvres contenant du matériel généré par IA ; toute contribution technique nouvelle décrite dans cet ouvrage a été conçue par l'auteur humain. Déclaration complète : michaeldariuseastwood.com/authorship.

Alliance permanente. Prouvez cet article faux, et je publierai la réfutation moi-même. Les conditions de falsification sont énoncées dans cet article ; le défi permanent : github.com/MichaelDariusEastwood/arc-scaling-challenge.

Articles compagnons : Paper I | Foundational | Paper II | Paper III | Origin of Scaling Laws | IV.a | IV.b | IV.c | IV.d | Paper V | Paper VI | Paper VII | Paper VIII | Paper IX | Eden Engineering | Eden Vision | Executive Summary | Master Table of Contents

Portail de recherche : michaeldariuseastwood.com/research | OSF : 10.17605/OSF.IO/EWN5D | Copyright 2026 Michael Darius Eastwood
lecture à voix haute · surlignage en direct · accès à toute section

Une erreur de traduction ? Signalez-la directement :