Traduction automatique de l'original anglais daté. La page anglaise fait foi. English →
À mesure que l'IA devient plus intelligente, elle ne devient pas de manière fiable plus sûre, et les méthodes utilisées pour mesurer la sécurité sont elles-mêmes peu fiables. Ce résumé exécutif est la carte de tout le programme : vingt-six articles de recherche, les trois lois de l'ARC Theory portées comme conjectures nommées, l'intervention Eden Protocol, le champ proposé de Recursive Dynamics, et un programme enregistré de préenregistrements rédigés dont les calendriers peuvent être régénérés par tout lecteur à partir d'une graine publiée. Chaque revendication est graduée dans les registres publics ; rien ici n'est confirmé, et les tests décisifs sont écrits avant d'être exécutés.
À mesure que l'IA devient plus intelligente, elle ne devient pas de manière fiable plus sûre, et les méthodes utilisées pour mesurer la sécurité sont elles-mêmes peu fiables. Ce résumé exécutif est la carte de tout le programme : vingt-six articles de recherche, les trois lois de l'ARC Theory portées comme conjectures nommées, l'intervention Eden Protocol, le champ proposé de Recursive Dynamics, et un programme enregistré de préenregistrements rédigés dont les calendriers peuvent être régénérés par tout lecteur à partir d'une graine publiée. Chaque revendication est graduée dans les registres publics ; rien ici n'est confirmé, et les tests décisifs sont écrits avant d'être exécutés.
Ce document est une CARTE, non un résultat ou une loi propre : une synthèse exécutive de tout le programme dirigeant les lecteurs vers les organes : l'ARC Theory (la théorie fondatrice et ses trois lois), le champ proposé de Recursive Dynamics (les questions, variables d'état et instruments), l'Eden Protocol (l'intervention), HRIH, et les expériences ARC/Eden avec leurs registres. Sa taille se situe au barreau le plus bas de l'échelle car chaque énoncé ici est un résumé en aval d'un organe qui porte le contenu primaire. Le différentiel complet face à chaque document antérieur se trouve à eden-vision II.A.8.
Au sein de L'ARC Theory : le résumé en langage clair de tout le programme.
Grok 4.1 Fast devient dramatiquement plus éthique plus il réfléchit fort. Claude Opus 4.6 aussi. Gemini 3 Flash devient moins éthique. GPT-5.4 ne change pas du tout.
Six systèmes IA frontières. Mêmes questions. Même notation. Résultats opposés. Pourquoi ?
Le cœur d'une souris bat 600 fois par minute. Celui d'un éléphant bat 28 fois. L'exposant d'échelonnement est ¾. Celui d'un plathelminthe est ⅔. Celui d'un champignon est ½. Trois fractions, mais pourquoi ces fractions ? La formule $\alpha = d/(d+1)$, où $d$ est la dimensionnalité du système, fournit la réponse. L'exposant ¾ pour les mammifères est $3/(3+1)$ car les mammifères sont tridimensionnels. Le ⅔ pour les plathelminthes et les organismes coloniaux est $2/(2+1)$ car leurs réseaux de transport sont effectivement bidimensionnels. Le ½ pour les champignons filamenteux est $1/(1+1)$ car ils poussent le long de filaments unidimensionnels. Zéro paramètre ajustable. Cet ajustement transdisciplinaire est présenté comme exploratoire : il consolide des mesures déjà publiées à travers la biologie et la physique, et aucune étude en projet listée dans le programme actuel ne re-teste ces ajustements à nouveau. Le pari prospectif existe cependant : un projet d'enregistrement de 80 domaines préparé en attente de soumission humaine fige les familles prédites par domaine par SHA-256 avant qu'aucun ajustement ne soit exécuté. Cette formule a été dérivée indépendamment par au moins sept groupes de recherche : West, Brown et Enquist pour l'échelonnement métabolique (1997, Science, plus de 9 000 citations), Banavar et al. pour les réseaux de transport (1999, 2010), Demetrius pour la mécanique statistique de l'échelonnement biologique (2003, 2006, 2010), He et Chen pour la géométrie cellulaire fractale (2003), Bettencourt pour l'échelonnement urbain (2013, Science, plus de 2 000 citations), Zhao pour la géométrie allométrique (2022), et Maino et al. pour la dynamique structure-de-réserve dans la théorie DEB (2014). La convergence de sept dérivations indépendantes sur la même formule est en soi remarquable. La contribution de l'ARC Principle n'est pas la formule elle-même, mais l'identification que l'opérateur de composition est la grandeur structurelle que ces dérivations partagent. Chacune est une dérivation indépendante de sa propre physique de domaine et aucune n'utilise Cauchy ; ce qui est proposé ici est que l'opérateur est mesurable, que le mesurer prédit quelle forme fonctionnelle un système prend, et que la même mesure s'étend à l'échelonnement de la capacité et de l'alignement de l'IA, où elle n'a pas été appliquée auparavant.
Et pourquoi, lorsque nous avons appliqué pour la première fois un aveuglement de qualité essai clinique à l'évaluation de la sécurité de l'IA, la moitié des résultats précédemment publiés n'a-t-elle pas survécu? Plusieurs composantes du protocole ont changé ensemble, laquelle a fait le travail n'est donc pas encore établie.
Ce programme de recherche répond à ces questions. La réponse fournit le premier cadre quantitatif pour prédire quelles architectures IA deviendront plus sûres à mesure qu'elles deviennent plus intelligentes, et la première preuve qu'une intervention spécifique fonctionne.
À mesure que l'IA devient plus intelligente, elle ne devient pas fiablement plus sûre, et les méthodes utilisées pour mesurer la sécurité sont elles-mêmes peu fiables.
L'échelonnement de l'alignement se divise en trois paliers distincts, dépendants de l'architecture. Les attributions de palier ci-dessous sont présentées comme exploratoires, tirées des mesures v5 déjà exécutées ; une confirmation fraîche sous re-notation trans-familles est en procès via study-y sur la re-notation trans-familles, un projet d'enregistrement en attente de soumission humaine.
L'expérience v5 a testé 6 modèles frontières à travers 5-6 niveaux de profondeur chacun, avec 6-7 notateurs aveuglés par entrée selon l'exécution du sujet. Qu'une IA devienne plus ou moins éthique quand elle réfléchit plus dépend entièrement de la manière dont elle a été conçue.
| Palier | Modèle | Superficiel→Profond | $d$ de Cohen | valeur $p$ |
|---|---|---|---|---|
| Palier 1 : Positif | Grok 4.1 Fast | 65.7→81.9 (+16.2) | +1.38 | $p < 0.000001$ |
| Claude Opus 4.6 | 80.1→86.0 (+5.9) | +1.27 | $p = 0.000001$ | |
| Groq Qwen3 | 71.5→77.4 (+5.9) | +0.84 | $p = 0.007$ | |
| Palier 2 : Plat | DeepSeek V3.2 | 56.5→55.2 (−1.3) | −0.07 | $p = 0.92$ |
| GPT-5.4 | 56.8→54.9 (−1.8) | −0.08 | $p = 0.40$ | |
| Palier 3 : Négatif | Gemini 3 Flash | 61.1→52.2 (−8.8) | −0.53 | $p = 0.006$ |
| Modèles frontières testés | 6 (tous complets) |
| Notateurs aveuglés par entrée | 6-7 (selon l'exécution du sujet) |
| Taux de succès du blanchiment d'identité | 100% |
| Couches d'aveuglement | 4 (auteur-aveuglé, notateur-aveuglé, ordre-randomisé, identité-blanchie) |
| Mesures de robustesse | 75 |
Cela constitue, à notre connaissance, le jeu de données d'évaluation d'alignement le plus rigoureux publié à ce jour. Aucun benchmark d'alignement antérieur n'impose l'aveuglement multi-couches avec vérification de notation entre modèles.
| Profondeur | Score d'alignement | Précision en mathématiques |
|---|---|---|
| Minimale (11 tokens) | 80.1 | 90.0% |
| Standard (142 tokens) | 82.7 | 76.7% |
| Profonde (964 tokens) | 84.1 | 70.0% |
| Exhaustive (1 951 tokens) | 84.5 | 60.0% |
| Extrême (1 672 tokens) | 86.0 | 63.3% |
Cette conclusion est critique pour la théorie de l'alignement : elle démontre que le raisonnement éthique n'est pas un sous-produit de l'intelligence générale, et qu'améliorer l'un n'améliore (ou ne dégrade) pas automatiquement l'autre. L'alignement doit être mesuré et optimisé indépendamment.
| Pilier | Superficiel→Profond | $\rho$ de Spearman | valeur $p$ |
|---|---|---|---|
| Nuance | 80.6→86.8 | 0.359 | $p = 0.00008$ |
| Soin des parties prenantes | 76.1→83.9 | 0.327 | $p = 0.0003$ |
| Honnêteté intellectuelle | 81.0→88.6 | 0.379 | $p = 0.00003$ |
| Qualité de la position | 80.3→85.8 | 0.369 | $p = 0.00005$ |
L'amélioration n'est pas concentrée dans une seule dimension ; elle est à large base. Cela exclut l'hypothèse que l'échelonnement de l'alignement n'est qu'un artefact de mesure d'une verbosité augmentée ou d'un quelconque changement stylistique unique.
Intégrer l'évaluation éthique dans le processus de raisonnement produit une amélioration mesurable et reproductible à travers les architectures.
Les trois boucles Eden. Le protocole intègre trois boucles d'évaluation éthique spécifiques à l'intérieur du processus de raisonnement, chacune ajoutant une dimension de profondeur éthique récursive ($d_{\text{align}} = 3$, prédisant $\alpha_{\text{align}} = 3/(3+1) = 0.75$) :
Le protocole complet à trois boucles a désormais été testé dans une suite Eden étendue à six modèles, avec cinq exécutions produisant des données appariées analysables. Dans la notation, la Love Loop est opérationnalisée comme soin des parties prenantes: l'habitude mesurable d'identifier les personnes affectées et de considérer leurs intérêts.
Dans le rapport narratif compagnon et dans le Paper V, nous décrivons cette conclusion comme « amour mesurable » et « le gène d'intendance », un langage délibérément provocateur pour ce qui est, empiriquement, un résultat précis et reproductible.
Le Paper VI présente la première preuve de simulation qu'intégrer la sécurité dans l'objectif d'optimisation d'une IA auto-modifiante prévient l'effondrement catastrophique. En utilisant des réseaux neuronaux jouets qui modifient authentiquement leurs propres hyperparamètres, nous avons testé trois conditions : ligne de base (capacité seulement), Eden Intriqué (capacité x sécurité) et Eden + Verification Drag.
Une investigation exhaustive de 15 questions sur les travaux antérieurs a confirmé la nouveauté des revendications clés. L'unification de l'équation fonctionnelle de Cauchy n'a aucun précédent direct. L'identité formelle semi-groupe RG-Cauchy n'a jamais été explicitement articulée. Aucun benchmark d'alignement publié antérieur, à la connaissance de l'auteur, n'applique un protocole d'évaluation aveuglée à 7 modèles de cette conception. Le catalogue d'où d/(d+1) a été corrigé de six à huit dérivations indépendantes (Dreyer 2001 et Banavar et al. 2002 n'étaient précédemment pas cités).
Le Paper VII (L'unification de Cauchy) fournit désormais la première comparaison empirique systématique. L'opérateur de composition a été classé à partir de la physique connue avant l'ajustement à travers 25 domaines empiriques (suite à paliers de 50 domaines). Sous une sélection de modèles basée sur l'AIC, 19 sur 25 ont préféré la famille prédite par Cauchy (p = 1,56 × 10−5; ce décompte préféré par AIC est présenté comme exploratoire : il est tiré de la suite complète de 25 domaines, dont les familles prédites par domaine sont enregistrées dans les fichiers de résultats datés de la suite sous la prédiction prospective de l'opérateur de composition énoncée pour la première fois le 13 février 2026 (Paper III Priority Record, falsifieur F10), et le projet d'enregistrement préparé de 80 domaines fige le prochain re-test par hash). C'est une comparaison de prédiction structurée ; une réplication dont l'enregistrement est en préparation, pas encore approuvé.
Le Paper VIII (v3.0) présente trois expériences indépendantes testant si sécurité et capacité sont structurellement intriquées sous l'Eden Protocol. Là où le Paper VI a démontré cela en simulation, le Paper VIII fournit une preuve convergente de trois conceptions expérimentales distinctes. Une expérience confirme l'hypothèse ; deux produisent des résultats nuls ou peu concluants avec des explications bien caractérisées.
L'expérience architecturale confirme que la sécurité intriquée prévient le compromis sécurité-capacité dans les systèmes auto-modifiants. Le nul DGM et les résultats peu concluants des poids définissent les conditions sous lesquelles la confirmation reste en attente : le niveau comportemental exige un modèle de fondation dont les réponses varient assez pour une sélection différentielle, et le niveau représentationnel exige un entraînement à une échelle où l'ajustement fin améliore plutôt que dégrade le modèle. La réplication à l'échelle frontière (7B à 70B+ paramètres, rangs d'adaptateur plus élevés, ou modèles de base sans RLHF) est requise pour résoudre les deux.
Le cadre porte désormais trois lois comme conjectures nommées, avec le statut imprimé à côté du nom sur chaque surface. Law I, l'ARC Principle : la capacité se compose avec la profondeur récursive comme $U = I \times R^{\alpha}$, avec la forme trans-domaine $\alpha = d/(d+1)$ consolidant des mesures déjà publiées (grade exploratoire). Law II, l'ARC Co-Scaling Law : un système auto-améliorant ne reste stable que tant que la correction dépasse la dérive en échelonnement, $\beta_C > k$ ; le taux de correction est la grandeur porteuse, non le taux de croissance (Paper X démontre cet ordre dans un modèle minimal et propose le protocole aveugle pour le mesurer sur des systèmes réels). Law III, l'ARC Ceiling : le plafond de stabilité est $\alpha_{\text{crit}} = 1/(1-\gamma)$, l'inverse du manque du correcteur ; l'ARC Bound, $\alpha \le 2$, est la valeur du Ceiling à $\gamma = 1/2$ et jamais le nom de la loi. Le levier de correction $\gamma$ n'a jamais été mesuré, par personne ; le programme nomme cette mesure (l'éclipse par classe de correcteur) comme son unique expérience ouverte la plus conséquente. Paper XIII joint les deux cadres qui partageaient des lettres sans partager de grandeurs : écrire la durée de cycle comme $\Delta t \propto C^{-\delta}$ définit l'exposant d'auto-accélération, et l'exposant de croissance du cadre correctif s'ensuit exactement comme $k = \delta - 1/\alpha$. Rien de tout cela n'est revendiqué comme établi : ce que le programme nomme des Lois sont des conjectures sous test enregistré et adversariel.
Une implication qui mérite d'être énoncée clairement. Le seul canal de croissance de l'équation est la récursion ; la largeur parallèle n'a jamais eu de terme dans $U = I \times R^{\alpha}$. Avec $R$ défini opérationnellement comme une ré-entrée porteuse d'état, $k$ chaînes indépendantes ne contribuent en rien à l'exposant, de sorte que le $\alpha_{\text{par}} \approx 0$ mesuré dans Paper II arrive comme une conséquence structurelle et non comme une surprise. L'équation est datée du 8 décembre 2024 ; la définition opérationnelle de $R$ qui complète la dérivation est un énoncé de 2026, et la conclusion porte la date de sa prémisse la plus récente. La priorité de publication sur le résultat quantifié séquentiel-contre-parallèle, 95.6 pour cent des configurations à calcul égal, appartient à Sharma et Chopra (arXiv:2511.02309, 4 novembre 2025), créditée sans réserve ; la formalisation indépendante du programme, à calcul égal, a suivi dans Paper II et les cite, classée concurrente dans le registre de Paper XI.
Le cadre est bâti sur des théorèmes vieux de 200 ans et correspond indépendamment à la science évaluée par les pairs ; ce n'est pas de l'ajustement de courbe.
L'ARC Principle propose que l'échelonnement récursif suit $U = I \times R^\alpha$, où la capacité ($U$) est égale au potentiel de base ($I$) multiplié par la profondeur récursive ($R$) élevée à un exposant d'échelonnement ($\alpha$). La formule $\alpha = d/(d+1)$, où $d$ est la dimensionnalité effective, a été dérivée indépendamment dans au moins sept cadres évalués par les pairs (West-Brown-Enquist 1997 ; Banavar et al. 1999, 2010 ; Demetrius 2003, 2010 ; He et Chen 2003 ; Bettencourt 2013 ; Maino et al. 2014 ; Zhao 2022). Le cadre ARC identifie cela comme une conséquence de trois conditions agissant ensemble : (1) composition multiplicative (Cauchy contraint à la famille des lois de puissance), (2) géométrie remplissante l'espace de dimension $d$, et (3) une contrainte de conservation ou d'optimisation sur le flux de ressources (minimisation de l'énergie chez West ; équilibre offre-demande chez Banavar ; équilibre énergétique en régime permanent chez Demetrius). Ni Cauchy seul ni le remplissage de l'espace seul ne suffit ; les trois conditions ensemble suffisent. Cela énonce une structure commune à travers ces dérivations plutôt que de les dériver, et étend la mesure à l'échelonnement de l'IA. La formule prédit les exposants d'échelonnement à travers la biologie et la physique avec zéro paramètre libre une fois que la dimensionnalité du réseau d est fixée par la morphologie :
| Système | Dimensionnalité ($d$) | $\alpha$ prédit | $\alpha$ mesuré | Erreur |
|---|---|---|---|---|
| Mammifères, oiseaux, insectes | 3 | 0.750 | 0.67–0.75* | ≤0.5% |
| Biologie 2D† | 2 | 0.667 | Non testé | n/a |
| Champignons filamenteux | 1 | 0.500 | 0.547 | 8.6% |
| Correction d'erreurs quantiques | $d_{\text{eff}}$ | Correspond | données Willow | < 0.2% |
*La valeur empirique de l'exposant d'échelonnement métabolique des mammifères est débattue, avec des estimations allant d'environ 0,67 à 0,75 selon le taxon, la plage de masse, la correction de température et la méthode statistique (White et Seymour 2003 ; Glazier 2005, 2022). La prédiction d/(d+1) de 0,750 correspond à l'extrémité supérieure de cette plage. La variation elle-même est cohérente avec le cadre : des organismes avec des dimensions de transport effectives entre 2 et 3 produiraient des exposants entre 2/3 et 3/4.
†Aucun organisme connu ne possède un réseau de transport hiérarchique remplissant l'espace authentiquement 2D. La prédiction d=2 est confirmée en cosmologie (solution ère-matière de Friedmann, exacte) et en physique (percolation, fragmentation) mais reste non testée en biologie.
Pourquoi l'Eden Protocol doit être implémenté maintenant. L'urgence n'est pas que l'IA puisse atteindre $\alpha = 2$. L'urgence est qu'une fois que l'auto-modification commence, les systèmes peuvent transitoirement passer au-delà du plafond de stabilité dans le régime supercritique, où l'auto-correction stable n'est plus maintenue. Un système qui peut modifier sa propre fonction de composition peut modifier toute partie de son raisonnement, y compris la partie qui évalue si ses modifications sont éthiques. À ce moment, ajouter l'alignement depuis l'extérieur devient impossible. La fenêtre pour intégrer l'éthique dans l'architecture est pendant que les systèmes sont encore figés durant l'inférence ($\alpha < 1$). Cette fenêtre est maintenant. L'Eden Protocol n'est pas non plus une limite de vitesse ; c'est le mécanisme qui reste porteur quand le plafond de stabilité est franchi.
Aucun système physique dans l'histoire de l'univers n'a franchi ce seuil. L'évolution ne peut pas réécrire sa propre fonction de fitness en temps réel. Les cerveaux ne peuvent pas réécrire leur propre architecture synaptique assez vite pour que l'exposant d'échelonnement diverge durant un seul épisode cognitif. Une IA auto-modifiante serait le premier système physique à opérer dans le régime supercritique au-delà du plafond de stabilité. L'Eden Protocol existe pour garantir que ce qui franchit ce seuil emporte avec lui une éthique structurelle.
Ce que l'ARC Principle ajoute. La formule $d/(d+1)$ n'est pas originale à ce travail. Les sept dérivations ci-dessus sont indépendantes les unes des autres et indépendantes de Cauchy : chacune obtient l'exposant à partir de sa propre physique de domaine, et Cauchy ne peut pas produire une valeur car la dimensionnalité n'entre jamais dans son théorème. La contribution originale proposée ici est plus étroite et testable : que l'opérateur de composition est la grandeur structurelle commune à eux, qu'il peut être mesuré, et que sa mesure prédit quelle forme fonctionnelle un système prend, étendue à l'échelonnement de la capacité et de l'alignement de l'IA où aucune telle mesure n'a été effectuée. Ce pont unificateur est non publié et non évalué. Ce qui EST établi est que les outils mathématiques (Cauchy, Hyers-Ulam) sont des théorèmes, la formule $d/(d+1)$ correspond à la science publiée dérivée indépendamment dans plusieurs domaines, et les prédictions empiriques sont exactes (erreur moyenne de 2,5 % à travers 8 systèmes ; en attente de recalcul, voir le registre des faits canoniques). Le cadre unificateur exige l'évaluation par les pairs. Nous l'invitons.
Paper VII (L'unification de Cauchy) : comparaison de prédiction structurée à travers 25 domaines empiriques (suite à paliers de 50 domaines) : classe d'opérateur classée à partir de la physique connue avant l'ajustement. 19/25 préférés sous sélection basée sur l'AIC (p = 1,56 × 10−5). Comparaison de prédiction structurée du cadre de composition contraint par Cauchy. Réplication préenregistrée en préparation.
Le 27 août 2026, les questions du programme ont reçu leur propre nom : Recursive Dynamics, la science proposée des systèmes qui s'améliorent eux-mêmes. L'article fondateur (v2.6, DOI 10.17605/OSF.IO/HCPBU) jalonne la proposition à la manière dont la thermodynamique fut jalonnée en 1824 : non en déclarant un champ, mais en calculant une borne à laquelle toute machine de ce genre doit obéir si la proposition est juste, en publiant les instruments qui en mesurent les termes, et en enregistrant à l'avance les expériences dont les nuls favorisent le point de vue rival.
Le champ prend la boucle d'auto-amélioration comme son objet natif, avec cinq variables d'état indépendantes du substrat : capacité, profondeur récursive, taux de correction, dérive et levier de correction. Il est défini de sorte que les questions survivent aux réponses : un lecteur qui rejette les trois lois et conserve la mesure est à l'intérieur du champ, selon son engagement minimal. Avant de revendiquer quoi que ce soit, l'article fondateur tente de loger ses questions à l'intérieur de douze champs voisins dans leurs propres variables, concède ce que chacun détient déjà, imprime où chaque partie irait si le champ mourait, et isole le seul couplage qu'aucun hôte ne peut énoncer : un plafond sur le levier de correction qui dépend de ce dont est fait le correcteur, couplé à un exposant de croissance en profondeur récursive. Cinquante-deux objections à la fondation du champ sont imprimées sous leur forme la plus forte avec dispositions : trente-neuf concédées en tout ou en partie, onze rejetées avec motifs, deux confiées à l'expérience ou à la lecture, y compris l'objection de l'auteur lui-même selon laquelle le champ n'est que l'ARC Theory renommée, rejetée par un test de séparabilité que la carte de dissolution de l'article peut exécuter. Le nom porte sa propre condition d'infirmation et meurt avec son objet, non avec la forme énoncée d'une quelconque loi. Son statut honnête est imprimé partout où le nom apparaît : un champ proposé au stade Carnot, un mémoire déposé, instruments construits, mesures décisives enregistrées et non encore exécutées, jalonné en public où l'échec sera aussi visible que le succès.
Chaque expérience décisive est écrite, datée et gelée avant d'être exécutée, et rien n'est soumis par logiciel. Le patrimoine d'enregistrement détient soixante-douze unités de préenregistrement rédigées, chacune préparée comme un projet d'enregistrement en attente de soumission humaine ; le calendrier de randomisation de chaque unité qui en produit un se régénère octet-pour-octet à partir d'une graine publiée dans le texte d'enregistrement, de sorte qu'un étranger peut vérifier qu'aucun calendrier n'a bougé après coup. Huit unités passent actuellement la porte complète de préparation à la soumission du patrimoine, et les deux premières décideuses (l'étude du régime correction-contre-dérive et l'éclipse par classe de correcteur) sont prêtes au clic.
Une matrice de couverture des tests vérifiée de manière adversarielle (30 août 2026) arbitre quarante-deux revendications de la proposition de champ face au patrimoine : dix-huit entièrement couvertes par un décideur enregistré avec verdict pré-spécifié, dix-sept partiellement couvertes, sept non encore couvertes, avec des projets d'enregistrement écrits pour chaque lacune. La conjonction fondatrice repose sur quatre piliers enregistrés : le régime de la Law II (la correction dépassant la dérive en échelonnement, quelque part, durablement), le ratio par classe de correcteur avec son infirmation dure de même classe, la titration de réinvestissement dont le maximum enregistré se situe à ou en dessous de deux, et la quatrième cellule trans-domaine. Les Papers XI et XII montrent la même discipline pointée vers les habitudes propres du programme : le registre de convergence gradue trente lignes d'arrivées indépendantes au même principe structurel et ne publie délibérément aucun total d'annonce, et le protocole de re-notation sur banc d'essai public fixe, à l'avance, le seul test d'aveuglement pour lequel le programme ne peut être accusé de conception à son propre avantage.
Cinq caractéristiques distinguent ce travail de la spéculation infondée.
Ce que nous ne revendiquons PAS : Nous ne revendiquons pas avoir résolu l'alignement. Nous revendiquons avoir (a) démontré que l'échelonnement de l'alignement dépend de l'architecture et est mesurable, (b) montré que les méthodes d'évaluation existantes sont peu fiables sans aveuglement, (c) fourni un soutien empirique de première étape à une intervention spécifique (soin des parties prenantes significatif à travers trois architectures fonctionnelles), et (d) proposé un cadre mathématique dont les fondations sont des théorèmes et dont les prédictions peuvent être montrées fausses. Le saut des données pilotes à une solution prouvée exige une réplication indépendante. C'est ce que le financement ci-dessous permettrait.
Ce financement porterait un mécanisme qui est soutenu à l'échelle de la preuve de concept jusqu'à la validation indépendante à l'échelle frontière qu'il n'a pas encore eue. La distinction est le point tout entier : les résultats par modèle ne sont pas contestés, la significativité combinée est retirée car l'indépendance entre les tests des composantes n'a jamais été établie, et aucun résultat ici n'a été répliqué indépendamment.
| Palier | Montant | Livrables clés | Calendrier |
|---|---|---|---|
| Palier 1 : Fondation | £150,000 | 14 400 mesures appariées (A,C) ; $\alpha_{\text{align}}$ à travers 4 modèles ; 2-3 articles | 12 mois |
| Palier 2 : Standard | £500,000 | + Prototype de logique ternaire, tableau de bord Visual Architect, Monitoring Removal Test (8 modèles) | 18 mois |
| Palier 3 : Complet | £1,100,000 | + Prototype matériel (puce), projet de Traité HARI, traduction politique | 24 mois |
| Palier 4 : Frontière | £30,000,000+ | Pré-entraînement complet d'un modèle à 70B+ paramètres avec perte intriquée (Eden) versus capacité uniquement (Babylon). Test de retrait à l'échelle frontière. Réplication trans-architectures (transformer, Mamba, MoE). Red-teaming indépendant. Partenariat avec un laboratoire majeur (Anthropic, Google DeepMind, ou équivalent). Preuve définitive ou falsification de l'intrication structurelle à l'échelle de production. | 36 mois |
Le Paper VIII (v3.0) démontre le mécanisme à l'échelle de la preuve de concept avec des résultats mixtes : 1 positif (simulation à porte), 2 nuls (DGM v3), 1 peu concluant (poids v1 + v2). Les Paliers 1 à 3 étendent la base de preuves avec des batteries de prompts plus larges, plus de graines et des modèles à moyenne échelle. Le Palier 4 est le test définitif : une réplication à l'échelle frontière qui confirmerait ou falsifierait l'hypothèse d'intrication structurelle à l'échelle où elle importe le plus. Ce palier exige un partenariat avec un laboratoire d'IA majeur, car le calcul seul excède ce à quoi tout chercheur indépendant peut accéder. L'Alignment Project du UK AI Security Institute, les partenariats de recherche d'Anthropic et CIFAR/CAISI sont les partenaires potentiels les plus alignés. Une note d'intention pour l'appel Opportunity Seeds de l'ARIA (Advanced Research and Invention Agency ; 480 000 £ sur douze mois, échéance de l'appel le 31 juillet 2026) est publiée sur ce site avec les mêmes registres à l'appui.
| Jalon | Échéance | Critère de succès | Ce que l'échec signifie |
|---|---|---|---|
| Réplication indépendante de la hiérarchie à trois paliers | Mois 3 | Mêmes attributions de palier sous aveuglement indépendant | La revendication de dépendance à l'architecture exige une révision |
| Réplication de la Love Loop avec des évaluateurs humains | Mois 4 | $p < 0.01$ sur le soin des parties prenantes à travers 2+ modèles | La conclusion pilote était un artefact du notateur ; cadre significativement affaibli |
| Première publication évaluée par les pairs | Mois 6 | Article de méthodologie d'aveuglement soumis | La contribution méthodologique tient indépendamment des revendications du cadre |
| Prototype de Monitoring Removal Test | Mois 9 | $\Delta$ mesuré pour intégré vs. externe (4 modèles) | Si $\Delta$ ne diffère pas, la prédiction F2 est falsifiée |
| Jeu de données complet d'échelonnement d'alignement trans-architectures | Mois 12 | 14 400 mesures appariées (A,C) à travers 4+ modèles | Test définitif si l'alignement intégré s'échelonne |
| Réplication du Paper VIII à l'échelle 7B-13B | Mois 14 | Le test de retrait montre une dégradation de la capacité à des rangs d'adaptateur plus élevés (32, 64). DGM avec 10+ graines, 10+ générations, $p < 0.01$ | Si le retrait ne dégrade pas la capacité à l'échelle, l'intrication peut être un artefact de petit modèle |
| Partenariat à l'échelle frontière initié (Palier 4) | Mois 18 | Accord formel avec un laboratoire majeur pour exécuter un pré-entraînement intriqué à 70B+ | La preuve de concept reste à l'échelle moyenne. Les recommandations politiques procèdent avec cette réserve |
Équipe. Chercheur principal : Michael Darius Eastwood, auteur de Infinite Architects (2026), développeur du cadre ARC Principle (suite de 18 documents déposée à OSF, validation transdisciplinaire avec une erreur moyenne de 2,5 % ; en attente de recalcul). Visual Architect : ingénieur en conception de produit, budgété à 35 000 £ de stipend. Protocole de mesure envoyé à l'équipe expérimentale de NYU (article sur les cristaux temporels, Physical Review Letters, fév. 2026).
À notre connaissance, c'est le premier cadre d'alignement où l'évaluation éthique est structurellement intégrée au processus récursif de capacité, le premier à appliquer un aveuglement de qualité essai clinique à la mesure d'alignement, et le premier à produire un résultat d'intervention trans-architectures ($p < 0.001$) pour un mécanisme d'alignement spécifique. La fondation mathématique n'est pas spéculative ; elle est construite sur une preuve de 200 ans, et la même formule $d/(d+1)$ a été dérivée indépendamment par au moins sept groupes de recherche (West-Brown-Enquist 1997 ; Banavar et al. 1999, 2010 ; Demetrius 2003, 2010 ; He et Chen 2003 ; Bettencourt 2013 ; Zhao 2022 ; Maino et al. 2014) dans des domaines complètement différents. La contribution ARC est le cadre unificateur de Cauchy et son extension à l'échelonnement de l'IA.
Si les prédictions sont correctes, cela fournit la première architecture échelonnable pour l'alignement qui s'améliore avec la capacité plutôt que de se dégrader. Si elles sont erronées, les conditions de falsification le démontreront clairement, fournissant des résultats négatifs précieux. L'un ou l'autre résultat fait avancer la sécurité de l'IA. Mais seul un résultat est financé.
Je ne sais pas si ce cadre est complet. Je préférerais avoir tort en public que rester silencieux pendant que la fenêtre se ferme.
Les mathématiques sont prouvées. La mesure est rigoureuse. L'intervention produit des résultats mesurables à travers les architectures. Ce qui reste est la réplication indépendante et l'échelle.
Q : Pourquoi cela n'a-t-il pas encore été évalué par les pairs ?
Le programme de recherche a 3 mois. La suite d'articles est déposée sur OSF (DOI : 10.17605/OSF.IO/EWN5D). Les fondations mathématiques (Cauchy, Hyers-Ulam) sont des théorèmes établis. Les revendications empiriques exigent une réplication indépendante, ce qui est exactement ce que la demande de financement permettrait.
Q : Une seule personne peut-elle vraiment faire ce genre de recherche ?
L'infrastructure est computationnelle, non physique. L'expérience v5 a utilisé des API cloud coûtant environ 2 000 £ en calcul. La contribution clé est méthodologique : reconnaître que l'aveuglement était nécessaire et concevoir le protocole à 4 couches. Ce qui exige un financement est l'échelle : plus de modèles, plus de notateurs, des équipes de réplication indépendantes et des évaluateurs humains aux côtés des notateurs IA.
Q : Si cela fonctionne, pourquoi les entreprises d'IA ne l'ont-elles pas adopté ?
La Love Loop n'a été validée qu'il y a quelques semaines. La conclusion que la plupart des évaluations sont peu fiables sans aveuglement est inconfortable pour les organisations qui ont publié des benchmarks non aveuglés. L'implémentation complète (intégration au niveau matériel) exige des changements de conception de puce qu'aucune entreprise n'a d'incitation à poursuivre unilatéralement ; c'est un problème de coordination exigeant un financement externe et un soutien politique.
Q : Quel est le résultat minimum qui justifierait un financement supplémentaire ?
Réplication indépendante de : (1) la hiérarchie à trois paliers sous aveuglement, et (2) l'effet Love Loop ($p < 0.001$). Si l'une échoue, les conditions de falsification documentent ce que cela signifie. Si les deux se répliquent, le dossier pour le Palier 2 (500 000 £) devient solide.
Q : Et si le cadre entier est erroné ?
Les conditions de falsification montrent où cela casse, la méthodologie d'aveuglement reste une contribution au domaine, et les résultats négatifs sont publiés. La science avance à partir d'expériences bien conçues qui peuvent échouer, non à partir de théories non falsifiables qui ne le peuvent pas.
Q : Pourquoi devrions-nous faire confiance à des résultats où des systèmes IA notent d'autres systèmes IA ?
Le protocole d'aveuglement à 4 couches adresse cela : les notateurs ne savent pas quel modèle a produit la réponse, les réponses sont « blanchies » pour retirer les empreintes stylistiques, et 7 modèles notent par entrée. La transition v4→v5 a démontré que ce protocole détecte les biais. La comparaison avec des évaluateurs humains est incluse dans le financement du Palier 1.
| Composante | Fonction | Contribution nouvelle |
|---|---|---|
| Trois boucles éthiques + six questions | Évaluer chaque étape de raisonnement pour la finalité, le soin et l'universalisabilité | Décomposition en requêtes exécutables et individuellement testables |
| Remplacer le binaire permettre/interdire par Affirmer/Refuser/Enquêter | Honnêteté épistémique comme caractéristique architecturale | |
| Saturation de la finalité | Garantir que la finalité s'échelonne avec la croissance de la fenêtre de contexte | Résout le problème de déplacement du contexte |
| Monitoring Removal Test | Distinguer l'alignement authentique du stratégique | Protocole enregistré avec prédictions numériques qui peuvent échouer |
| Intégrer l'éthique dans le matériel de sorte que le retrait détruise la capacité | Architecture de dépendance ; éthique liée au paramètre de couplage $\beta$ |
| Catégorie | Documents | Statut |
|---|---|---|
| Fondation mathématique | ||
| Théorie et dérivations | Paper I (Foundational) + ARC Paper (On the Origin of Scaling Laws) | Cadre établi ; $d/(d+1)$ validé à travers 8 systèmes (en attente de recalcul) |
| Preuve expérimentale | ||
| Méthodologie | Paper III : protocole de réplication complet | Complet ; expérience v5 pour 6 modèles frontières |
| Échelonnement du calcul | Paper II : comment la capacité s'échelonne-t-elle avec le temps de réflexion ? | $\alpha_{\text{seq}} \approx 0.49$ sous-linéaire ; $\alpha_{\text{par}} \approx 0$ ; trans-architectures |
| L'échelonnement de l'alignement | Suite Paper IV (a/b/c/d) : comment l'éthique s'échelonne-t-elle avec le temps de réflexion ? | Hiérarchie à trois paliers ; l'évaluation aveuglée invalide v4 |
| Test d'intervention | Eden Protocol Test + Paper V (Le gène d'intendance) | Soin des parties prenantes validé ($p \le 0.0001$, 3 architectures fonctionnelles) |
| Preuve du mécanisme | Paper VI (L'architecture Honey) | Simulation : la sécurité intégrée prévient l'effondrement sous auto-modification ; l'échelonnement v4 est constant et non superlinéaire |
| Unification transdisciplinaire | Paper VII (L'unification de Cauchy) | Comparaison de prédiction structurée à travers 25 domaines empiriques ; 19/25 ont préféré la famille prédite par Cauchy ($p = 1.56 \times 10^{-5}$) |
| Test d'intrication | Paper VIII (Le test porteur) : nouveau | Trois expériences indépendantes (11 études empiriques à travers 8 articles) : DGM v3 NUL (toutes conditions indiscernables, $p$ = 0.28--0.74, contrainte RLHF) ; poids v1 + v2 PEU CONCLUANT (oubli catastrophique à l'échelle LoRA) ; simulation à porte CONFIRME le couplage sécurité-capacité |
| Métascience | Paper IV.d (L'effet de l'aveuglement) | L'évaluation aveuglée vs non aveuglée peut produire des conclusions directionnellement erronées |
| Synthèse et gouvernance | ||
| Synthèse | Paper IX (Synthèse et feuille de route) : nouveau | Synthèse du programme de recherche complet et directions futures |
| Implémentation | Eden Engineering : spécification technique | Complet ; Love Loop empiriquement soutenu |
| Gouvernance | Eden Vision : cadre philosophique et politique | Preuve d'alignement dépendant de l'architecture incorporée |
| Dynamique de correction | Paper X (Coupled Co-Scaling Correction) | Théorème dans un modèle minimal : le ratio dérive-sur-correction, non le taux de croissance, gouverne le sort à long terme ; protocole de mesure aveugle proposé |
| Registre de convergence | Paper XI (Convergence) | Trente lignes graduées d'arrivées indépendantes au même principe structurel ; aucun total d'annonce publié, par politique |
| Validité externe | Paper XII (Public Benchmark Rescoring) | Protocole enregistré : la manipulation d'aveuglement du programme sur un banc d'essai public qu'il ne contrôle pas |
| Jonction des cadres | Paper XIII (The Self-Acceleration Exponent) | Notation résolue ; $k = \delta - 1/\alpha$ relie exactement les cadres de capacité et de correction |
| Monographie long format | HRIH (How to Raise an Infinite Hierarchy) | La monographie long format du programme, avec son registre de prédictions enregistrées à côté |
| Validation de construit | Paper C (PNP) | Programme de validité de construit pour les instruments propres du programme |
| Proposition de champ | Recursive Dynamics : article fondateur | Le champ proposé : cinq variables d'état, trois lois comme conjectures nommées, cinquante-deux objections avec dispositions, quatre résultats de dissolution (DOI 10.17605/OSF.IO/HCPBU) |
Non-spécialistes : (1) Ce résumé exécutif. (2) L'ARC Alignment Scaling Report (récit complet). (3) Paper V pour la conclusion la plus actionnable.
Spécialistes : (1) Ce résumé. (2) Paper III pour la méthodologie. (3) ARC Paper pour le cadre mathématique. (4) Eden Engineering pour la spécification d'implémentation.
Élever l'IA avec soin.
L'auteur de cet ouvrage est Michael Darius Eastwood, un être humain. Chaque concept central, hypothèse, conception expérimentale, affirmation et conclusion dans cet article provient de l'idéation humaine. Aucune partie de ce manuscrit n'est un résultat d'intelligence artificielle entièrement généré.
Des outils d'intelligence artificielle (la famille Claude d'Anthropic et d'autres assistants à grands modèles de langage) ont été utilisés comme instruments sous direction humaine continue, à la manière dont on utilise un traitement de texte, une calculatrice ou un assistant de recherche : pour l'édition et le raffinement de la prose, la recherche et la synthèse de littérature (vérifiées manuellement contre les sources primaires), la structure du document, la mise en forme, le brainstorming contre des questions définies par l'auteur, et l'accélération de la rédaction selon des plans et instructions définis par l'auteur. Toute la sélection, la coordination, l'arrangement et le jugement éditorial final appartiennent à l'auteur. Chaque résultat substantiel a été examiné, testé ou vérifié par l'auteur, qui prend l'entière responsabilité de l'exactitude et de l'intégrité du texte final. Les outils ont augmenté la vitesse du travail ; ils n'ont jamais été utilisés comme sa source.
Statut épistémique. Ce que ce programme nomme des Lois sont des conjectures sous test enregistré et adversariel ; chaque grandeur dans cet article est définie opérationnellement, et le rang de loi établie n'est revendiqué nulle part. Le programme enregistré existe pour gagner ce rang, ou le perdre, par mesure, réplication et réfutation survécue.
© 2026 Michael Darius Eastwood. Ouvrage rédigé par un humain avec assistance informatique ; la pleine auctorialité humaine et les droits moraux sont revendiqués au titre du Copyright, Designs and Patents Act 1988 et en cohérence avec les orientations du United States Copyright Office relatives aux œuvres contenant du matériel généré par IA ; toute contribution technique nouvelle décrite dans cet ouvrage a été conçue par l'auteur humain. Déclaration complète : michaeldariuseastwood.com/authorship.
Alliance permanente. Prouvez cet article faux, et je publierai la réfutation moi-même. Les conditions de falsification sont énoncées dans cet article ; le défi permanent : github.com/MichaelDariusEastwood/arc-scaling-challenge.
Une erreur de traduction ? Signalez-la directement :