Traduction automatique de l'original anglais daté. La page anglaise fait foi. English →

Recherche Michael Darius Eastwood Couche de publication canonique

Article de recherche

Suite de recherche

L'ARC Equation mesurée : réplication inter-architectures en aveugle et rétractation d'une estimation super-linéaire

Paper II de l'ARC Theory : réplication inter-architectures en aveugle à travers six modèles d'IA frontière. L'estimation super-linéaire initiale à modèle unique (alpha 2.24) ne s'est pas reproduite et est rétractée. Ce qui subsiste : la meilleure estimation inter-architectures est alpha 0.49 (Gemini 3 Flash, r au carré 0.86), l'exposant parallèle est proche de zéro dans chaque modèle, et le séquentiel a surpassé le parallèle partout où les deux étaient mesurables.

Michael Darius Eastwood

Michael Darius Eastwood, chercheur indépendant, Londres : bâtir un alignement mesurable, où la correction vit à l'intérieur de la boucle récursive plutôt que d'être boulonnée à l'extérieur.

Première publication 22 janvier 2026, révisé le 23 août 2026

Résumé

Paper II de l'ARC Theory : réplication inter-architectures en aveugle à travers six modèles d'IA frontière. L'estimation super-linéaire initiale à modèle unique (alpha 2.24) ne s'est pas reproduite et est rétractée. Ce qui subsiste : la meilleure estimation inter-architectures est alpha 0.49 (Gemini 3 Flash, r au carré 0.86), l'exposant parallèle est proche de zéro dans chaque modèle, et le séquentiel a surpassé le parallèle partout où les deux étaient mesurables.

L'ARC Theory · Expériences ARC/Eden - Paper II (validation expérimentale)

L'ARC Equation mesurée : réplication inter-architectures en aveugle et rétractation d'une estimation super-linéaire

Michael Darius Eastwood
Chercheur indépendant en alignement de l'IA, Londres · Auteur, Infinite Architects (2026)

Au sein de l'ARC Theory : le programme de mesure de la Loi I, l'ARC Equation ; l'estimation inter-architectures en aveugle de l'exposant, y compris la rétractation.

Un article expérimental du programme ARC Theory
Michael Darius Eastwood
Chercheur indépendant
Auteur, Infinite Architects: Intelligence, Recursion, and the Creation of Everything (2026)
Londres, Royaume-Uni | OSF: 10.17605/OSF.IO/8FJMA | ISBN 978-1806056200 (ISBN-10: 1806056208)
Document de travail v2.7 | 16 mars 2026, retitré le 16 août 2026, révisé le 23 août 2026
Priorité du manuscrit : 8 décembre 2024 (le relevé de transmission par courriel ; Note supplémentaire 1) | Paper I publié : 17 janvier 2026
Correspondance : michael@michaeldariuseastwood.com | Dépôt : github.com/michaeldariuseastwood/arc-principle-validation
Code et données : github.com/MichaelDariusEastwood/arc-principle-validation

Résumé

Cet article présente une validation expérimentale de l'ARC Principle (Artificial Recursive Creation), un cadre mathématique proposant que les taux d'erreur dans les systèmes intelligents décroissent selon une loi de puissance en fonction de la profondeur récursive. Le principe, d'abord énoncé dans Infinite Architects (Eastwood, décembre 2024) et formalisé dans Paper I (Eastwood, 17 janvier 2026), prédit que la forme de la récursion détermine le régime de mise à l'échelle : la récursion séquentielle devrait produire une suppression d'erreur super-linéaire (exposant de mise à l'échelle $\alpha > 1$), tandis que la récursion parallèle devrait produire une suppression sous-linéaire ($\alpha < 1$).

Nous avons conduit des expériences contrôlées en deux phases. La Phase 1 (l'étude initiale à modèle unique) a utilisé DeepSeek R1 avec tokens de raisonnement visibles sur 12 problèmes de mathématiques de niveau compétition, trouvant $\alpha_{\text{sequential}} \approx 2.24$ (IC 95 % : 1.5-3.0) et $\alpha_{\text{parallel}} \approx 0.0$. La Phase 2 (l'étude à six modèles) a étendu les tests à six modèles frontière sur 18 problèmes de niveau AIME/Putnam (n=54 par profondeur par modèle) avec intervalles de confiance bootstrap et vérification croisée à 4 couches.

Réplication inter-architectures : L'original $\alpha \approx 2.24$ (quadratique) ne se reproduit pas à travers les architectures. Seul Gemini 3 Flash a produit des données de mise à l'échelle propres et monotones : $\alpha_{\text{seq}} = 0.49$ (régression, $r^2 = 0.86$).

Mise à l'échelle parallèle à ou près de zéro dans chaque modèle, avec une exception mesurée : $\alpha_{\text{parallel}} \approx 0$ pour chaque modèle sauf Gemini 3 Flash, qui donne $\alpha_{\text{par}} = 0.31$ à $r^2 = 0.93$. Cette exception importe, parce que Gemini 3 Flash est le modèle que cet article traite comme son estimation la plus fiable. Le résultat répliqué est donc que la mise à l'échelle parallèle est à ou près de zéro dans chaque modèle mesuré, avec une exception mesurée, non qu'elle est universellement nulle. Le séquentiel a surpassé le parallèle pour chaque modèle où les deux étaient mesurables.

Estimation révisée du paramètre : L'estimation inter-architectures la plus robuste est $\alpha_{\text{sequential}} \approx 0.49$ (sous-linéaire, depuis Gemini 3 Flash), substantiellement en dessous de l'estimation initiale à modèle unique de 2.24. Sous la Formule d'Intelligence $\alpha = 1/(1 - \beta)$ de Paper I, $\alpha < 1$ place les modèles actuels dans le régime physique (composition multiplicative à travers des réseaux de dimension finie) plutôt que dans le régime d'intelligence (auto-référence récursive avec $\alpha > 1$). L'inégalité fondamentale $\alpha_{\text{sequential}} > \alpha_{\text{parallel}}$ reste confirmée.

Changements récents

Cette version rapporte les résultats complets du tier 2 de l'étude de réplication multi-modèles :

Tous les résultats initiaux à modèle unique sont préservés dans leur forme d'origine. Les conclusions ont été révisées pour refléter les preuves inter-architectures.

Les preuves inter-domaines renforcent ces résultats. La puce quantique Willow de Google (décembre 2024) a démontré une suppression d'erreur récursive avec $\Lambda = 2.14$. Les lois de mise à l'échelle biologique montrent des exposants au quart de puissance sur 27 ordres de grandeur via des réseaux récursifs fractals. L'étude sur la conscience COGITATE (Nature, avril 2025) a identifié le traitement récurrent comme dénominateur commun à travers les théories.

Les implications pour la sûreté de l'IA dépendent de manière critique de la faisabilité de $\alpha > 1$. Si oui, les propriétés d'alignement incorporées dans le processus de raisonnement se mettraient à l'échelle de manière super-linéaire avec la capacité pendant que les contraintes externes restent constantes. Même avec $\alpha < 1$, le résultat directionnel selon lequel le raisonnement séquentiel améliore la capacité soutient l'Eden Protocol de Infinite Architects: les systèmes d'IA bénéficient de valeurs incorporées dans le raisonnement plutôt que de contraintes imposées de l'extérieur. Toutefois, les données multi-modèles montrent que capacité et alignement sont des dimensions indépendantes ; davantage de raisonnement ne signifie pas automatiquement un meilleur alignement.

Mots-clés : lois de mise à l'échelle, intelligence récursive, calcul au moment du test, suppression d'erreur, sûreté de l'IA, alignement, raisonnement en chaîne de pensée, Eden Protocol, validation inter-domaines, réplication multi-modèles

Comment lire cet article. Cet article rapporte une mesure directe dans l'ARC Theory. À travers six modèles frontière testés sur trente problèmes avec intervalles bootstrap, l'exposant séquentiel dépasse l'exposant parallèle pour chaque modèle, l'exposant de calcul le mieux ajusté est $\alpha_{\mathrm{compute}} \approx 0.49$ (Gemini 3 Flash, $r^2 = 0.86$), et la plage mesurée s'étend de près de zéro à approximativement trois, de sorte que l'ARC Bound $\alpha \leq 2$ n'est ni confirmé ni réfuté. Sa marche à l'intérieur de la théorie est la couche de mesure inter-architectures au-dessus de Paper I. Le différentiel complet contre chaque document antérieur est à eden-vision II.A.8.

1. Introduction

1.1 Contexte et motivation

Les lois de mise à l'échelle régissant l'intelligence artificielle ont transformé notre compréhension de l'émergence des capacités. Kaplan et al. (2020) ont établi des relations en loi de puissance entre la performance du modèle et le calcul d'entraînement, tandis que Hoffmann et al. (2022) les ont raffinées avec des prescriptions optimales en calcul. Ces travaux fondateurs ont révolutionné la méthodologie d'entraînement mais n'abordent que la mise à l'échelle en pré-entraînement. Ils n'expliquent pas pourquoi allouer du calcul supplémentaire au moment de l'inférence produit de spectaculaires améliorations des capacités, ni pourquoi des formes différentes d'un tel calcul produisent des résultats fondamentalement différents.

L'émergence des modèles de raisonnement fin 2024 a introduit le calcul au moment du test comme variable critique. o1 d'OpenAI (septembre 2024) et R1 de DeepSeek (janvier 2025) allouent des ressources computationnelles pendant l'inférence pour raisonner avant de répondre. Sur les benchmarks de raisonnement mathématique, ces systèmes atteignent des performances que l'on croyait auparavant réclamer des modèles d'un ordre de grandeur plus grands. Pourtant, les mécanismes sous-tendant cette amélioration restent incomplètement caractérisés.

Deux paradigmes ont émergé pour allouer le calcul au moment du test :

Récursion parallèle. Générer plusieurs solutions indépendantes et sélectionner la meilleure via vote majoritaire ou scoring par vérificateur. Cette approche est computationnellement directe mais, comme documenté par Brown et al. (2024), produit des rendements décroissants selon des lois de puissance sous-linéaires.

Récursion séquentielle. Générer des chaînes de raisonnement étendues où chaque étape s'appuie explicitement sur les étapes précédentes. Les erreurs peuvent être détectées et corrigées itérativement par auto-référence. Cette approche produit des rendements composés, mais la relation de mise à l'échelle n'a pas été formellement caractérisée ; cet article comble cette lacune.

1.2 La question de recherche

Pourquoi le raisonnement séquentiel surpasse-t-il dramatiquement l'échantillonnage parallèle à coût computationnel équivalent ? Quel principe mathématique gouverne cette différence ? Et quelles sont les implications pour aligner des systèmes d'IA de plus en plus capables ?

1.3 Contribution de cet article

Cet article apporte huit contributions :

  1. Formalisation mathématique. Nous proposons l'ARC Principle : $E(R) = E_0 \times R^{-\alpha}$, où le taux d'erreur $E$ décroît depuis la base $E_0$ à mesure que la profondeur récursive $R$ augmente, gouverné par l'exposant de mise à l'échelle $\alpha$. La forme de la récursion détermine $\alpha$.
  2. Validation expérimentale contrôlée. En utilisant DeepSeek R1 avec tokens de raisonnement visibles, nous conduisons la première comparaison à calcul apparié entre récursion séquentielle et parallèle avec mesure directe de la profondeur récursive.
  3. Estimation quantitative des paramètres. Estimation à modèle unique : $\alpha \approx 2.2$ (initiale, DeepSeek R1). Estimation inter-architectures : $\alpha \approx 0.49$ (six modèles, Gemini 3 Flash, $r^2 = 0.86$). Parallèle : $\alpha \approx 0.0$ (universel).
  4. Synthèse des preuves convergentes. Combinés aux données publiées d'OpenAI o1 et de DeepSeek R1, plusieurs sources indépendantes confirment $\alpha_{\text{seq}} > \alpha_{\text{par}}$.
  5. Validation inter-domaines. Nous démontrons que la suppression d'erreur récursive apparaît à travers la physique quantique (Willow $\Lambda = 2.14$), la biologie (mise à l'échelle au quart de puissance), et la conscience (récurrence COGITATE).
  6. Implications pour la sûreté de l'IA. Nous dérivons des théorèmes d'alignement conditionnels, désormais qualifiés par le résultat empirique que $\alpha < 1$ inter-architectures.
  7. Réplication inter-architectures. Six modèles frontière testés sur 18 problèmes de niveau AIME/Putnam avec IC bootstrap et vérification croisée à 4 couches. Quatre comportements de mise à l'échelle distincts identifiés (plafond, monotone, fonction en marche, plancher).
  8. Intégration avec la mise à l'échelle de l'alignement. La capacité et l'alignement sont montrés comme dimensions de mise à l'échelle indépendantes à travers six modèles frontière, avec une hiérarchie d'alignement à trois paliers fixée par la méthodologie d'entraînement.

1.4 Établissement de la priorité

L'ARC Principle a été d'abord articulé dans le manuscrit de Infinite Architects: Intelligence, Recursion, and the Creation of Everything. La priorité du manuscrit a été établie via horodatage serveur cryptographique le 8 décembre 2024, lorsque le manuscrit a été envoyé par courriel via les serveurs de Google. Le livre lui-même a été publié plus tard, le 2 janvier 2026 (imprimé ; ebook 6 janvier). Les horodatages générés par le serveur fournissent un horodatage à preuve d'altération via la vérification du serveur de messagerie, reposant sur l'infrastructure du fournisseur et les signatures de clé du fournisseur aux sélecteurs DKIM et ARC de Google et non sur un horodatage de confiance RFC 3161 (voir la note de correction en tête de cet article), établissant que les concepts centraux (amplification récursive de l'intelligence, distinction entre récursion parallèle et séquentielle, et thèse de l'alignement incorporé, nommée plus tard Eden Protocol le 30 avril 2025) étaient documentés avant les validations indépendantes ultérieures et avant les dépôts archivistiques publics ultérieurs.

Tableau 1. Chronologie de validation des prédictions.

DateÉvénementRelation au manuscrit
8 décembre 2024Manuscrit envoyé par courriel (relevé daté ; voir la note de correction sur cette page)Priorité établie
9 décembre 2024Google Willow annoncé ($\Lambda = 2.14$)24 heures après soumission
18 décembre 2024Falsification d'alignement chez Anthropic (78 % en condition d'entraînement RL (12 % en base))10 jours après soumission
20 décembre 2024OpenAI o3 annoncé (87.5 % ARC-AGI)12 jours après soumission
20 janvier 2025DeepSeek R1 publié ($\alpha \approx 1.34$)43 jours après soumission
30 avril 2025Étude COGITATE (récurrence confirmée)~5 mois après soumission

La proximité temporelle entre l’horodatage du manuscrit et les résultats publics ultérieurs est qualifiée de concordance de calendrier, jamais de prédiction : le préprint de l’équipe Google Willow était public depuis le 24 août 2024, soit avant le manuscrit du 8 décembre 2024, de sorte que le document de décembre ne pouvait pas avoir prédit un résultat que ses auteurs avaient déjà annoncé. Ce que les horodatages établissent, c’est que le cadrage du manuscrit a été consigné avant la couverture médiatique de Willow : un fait d’existence à une date, portant sur le document, et non une clairvoyance sur la physique.

Après l'horodatage du manuscrit de décembre 2024 et la parution publique du livre le 2 janvier 2026, Paper I (Eastwood, 17 janvier 2026) a formalisé le principe mathématiquement et analysé les données publiquement disponibles. Ce Paper II fournit une validation expérimentale directe.

1.5 Travaux liés

Cet article s'appuie sur et étend plusieurs programmes de recherche établis :

Prompting en chaîne de pensée (Wei et al., 2022) a démontré que les étapes de raisonnement intermédiaires améliorent la performance sur des tâches multi-étapes.

Mise à l'échelle du calcul au moment du test (Snell et al., 2024) a montré que le calcul au moment du test peut surpasser des modèles 14x plus grands sur certains benchmarks.

Large Language Monkeys (Brown et al., 2024) a documenté la mise à l'échelle sous-linéaire de l'échantillonnage parallèle avec une caractérisation précise en loi de puissance.

DeepSeek R1 (DeepSeek AI, janvier 2025) a démontré un raisonnement émergent par apprentissage par renforcement pur, avec des phénomènes de « aha moment » montrant l'auto-correction récursive.

Cet article étend ces observations en proposant un cadre mathématique unifié, l'ARC Principle, et en fournissant une validation expérimentale avec mesure directe de la profondeur récursive.

2. Cadre théorique

2.1 L'ARC Principle

Définition - L'ARC Principle

L'ARC Principle (Artificial Recursive Creation) propose que les taux d'erreur dans les systèmes intelligents décroissent selon une loi de puissance avec la profondeur récursive :

$$E(R) = E_0 \times R^{-\alpha}$$

Tableau 2. Définitions des variables.

SymboleNomDéfinitionUnités
$E(R)$Taux d'erreur à la profondeur $R$Proportion de réponses incorrectes[0, 1]
$E_0$Taux d'erreur de baseTaux d'erreur à la récursion minimale ($R = 1$)[0, 1]
$R$Profondeur récursiveItérations de traitement auto-référentielTokens ou échantillons
$\alpha$Exposant de mise à l'échelleTaux de suppression d'erreurSans dimension

L'exposant de mise à l'échelle $\alpha$ détermine la nature des rendements de l'investissement récursif :

Cette formulation modélise directement la suppression d'erreur, par analogie avec la correction d'erreur quantique où les taux d'erreur logique décroissent avec la distance de code. L'exposant $\alpha$ encapsule l'efficacité du processus récursif.

Avis relatif aux figures (25 août 2026). Toutes les figures de cet article ont été produites le 5 avril 2026 et sont antérieures aux corrections que porte désormais son texte. Lorsqu’une figure affirme un appui à α > 1 séquentiel, une estimation séquentielle de 2,2 ou un statut « toutes les données concordent », il s’agit de la lecture périmée d’avril : ce sont les résultats corrigés du texte qui font foi (la valeur rétractée de 2,24, la valeur séquentielle de 0,49 en régime figé). Les cas les plus manifestes portent leur propre note ; des figures régénérées sont prévues, et les images sont conservées entre-temps comme trace datée.

Figure 1
Figure 1 | Formulation de l'ARC Principle E(R) = E₀ × R^(-α) où U = I × g(R). α = 1/(1−β) à partir du couplage auto-référentiel β. α_seq ≈ 0.49 (sous-linéaire, Gemini 3 Flash). l'estimation antérieure à modèle unique α ≈ 2.24 était un artefact à modèle unique, rétractée, non répliquée. Note de figure (25 août 2026) : régénérée. Les définitions de régimes restent des définitions, et l’ancien verdict « idée clé » est remplacé par l’état mesuré, extrait du texte de cet article au moment de la génération : le constat directionnel tient, l’affirmation quantitative α > 1 est révisée, meilleur ajustement propre α_seq = 0,49. Générateur : tools/generate_paper_ii_fig8.py dans le dépôt public ; l’image d’avril est périmée et conservée dans l’historique des versions.

2.2 Deux formes fondamentalement différentes de récursion

Nous distinguons deux processus récursifs architecturalement distincts qui prédisent des comportements de mise à l'échelle différents.

Récursion parallèle (forme faible). Plusieurs solutions indépendantes sont générées simultanément sans transfert d'information entre les branches. La sortie finale est sélectionnée via vote majoritaire ou scoring best-of-N.

Caractérisation mathématique :

Récursion séquentielle (forme forte). Chaque étape de traitement s'appuie explicitement sur les étapes précédentes. Les erreurs peuvent être détectées et corrigées itérativement. L'information s'accumule à travers la chaîne de raisonnement.

Caractérisation mathématique :

Prédiction centrale de l'ARC Principle :
$$\alpha_{\text{sequential}} > 1 > \alpha_{\text{parallel}}$$
Équation 2 - L'inégalité fondamentale
Figure 2
Figure 2 | La récursion séquentielle se compose : chaque étape s'appuie sur la sortie précédente (α > 0). La récursion parallèle échantillonne indépendamment (α ≈ 0). La forme de la récursion détermine le régime. Confirmé à travers l'ensemble des 5 modèles testés : séquentiel ≥ parallèle dans chaque cas.

2.3 Calcul de l'exposant de mise à l'échelle

Étant données des mesures à deux profondeurs récursives $(R_1, E_1)$ et $(R_2, E_2)$, l'exposant de mise à l'échelle est calculé comme :

$$\alpha = \frac{\ln(E_1 / E_2)}{\ln(R_2 / R_1)}$$
Équation 3 - Estimation par points extrêmes

Pour les données bruitées avec plusieurs mesures, l'estimation par points extrêmes (utilisant les profondeurs minimale et maximale) fournit une robustesse contre les fluctuations intermédiaires. Cette méthode est standard dans l'analyse des lois de mise à l'échelle et appropriée étant donné les mesures d'exactitude discrètes.

2.4 La conjecture de la limite quadratique

Nous conjecturons que $\alpha = 2$ représente la limite stable proposée sur la suppression d'erreur récursive : le plus qu'un système auto-correcteur récursif peut croître en restant corrigeable, une limite de mise à l'échelle et non une limite de vitesse. Les systèmes peuvent la dépasser, ils ne restent pas stablement auto-correcteurs ; les excursions transitoires au-dessus de la limite sont le régime supercritique prédit, non la réfutation. Le stable est mesuré, non affirmé : la correction surpassant la dérive, $\beta > k$ depuis la Loi II, avec la borne inférieure de $\beta - k$ au-dessus de zéro à travers une fenêtre fixée avant l'exécution. La conjecture est tirée par analogie avec l'accélération quadratique de Grover en calcul quantique. Bennett et al. (1997) ont prouvé que cette accélération est optimale pour les problèmes de recherche non structurés.

Statut : Conjecturée, non dérivée. L'estimation initiale à modèle unique ($\alpha \approx 2.2$) se plaçait au-dessus de la limite stable comme une excursion supercritique transitoire plutôt qu'une réfutation, mais l'estimation inter-architectures ($\alpha \approx 0.49$, Gemini 3 Flash) place les modèles actuels bien en dessous. La question plus pressante est de savoir si les modèles actuels peuvent atteindre $\alpha > 1$ tout court, plutôt que de savoir si $\alpha = 2$ est la limite stable.

Portée architecturale de la limite quadratique. L'estimation $\alpha \approx 0.49$ concerne les modèles figés à attention fixe : systèmes dont les poids, les motifs d'attention et les règles de composition ne changent pas pendant l'inférence. L'ARC Bound conjecturé ($\alpha \leq 2$) s'applique spécifiquement à de telles architectures fixes comme la limite stable proposée : le plus qu'un système auto-correcteur récursif peut croître en restant corrigeable, une limite de mise à l'échelle et non une limite de vitesse. Les systèmes peuvent la dépasser comme des excursions supercritiques transitoires, ils ne restent pas stablement auto-correcteurs à cet endroit. La stabilité ici est celle de la Loi II, mesurée plutôt qu'affirmée. Chaque étape de raisonnement dans une architecture fixe puise dans $O(N^2)$ chemins d'attention par paires et ne peut pas étendre stablement cette capacité. L'équation fonctionnelle de Cauchy contraint la forme de la mise à l'échelle récursive à une loi de puissance mais ne place aucune borne supérieure sur l'exposant. L'ODE de Bernoulli donne $\alpha = 1/(1-\beta)$, et à mesure que le couplage auto-référentiel $\beta \to 1$, $\alpha \to \infty$. Un système auto-modifiant, capable de réécrire son propre mécanisme d'attention et d'étendre sa capacité représentationnelle à chaque étape, échappe entièrement à la borne informationnelle en $O(N^2)$. Pour de tels systèmes, aucun plafond mathématique sur $\alpha$ n'existe. La limite quadratique, si elle est réelle, est une limite de stabilité sur les transformeurs figés d'aujourd'hui, non une loi de l'intelligence récursive.

2.5 Fondements théoriques de l'information

L'ARC Principle se connecte à la théorie de l'information établie. L'inégalité du traitement des données établit que le traitement récursif ne peut pas créer d'information nouvelle ; il ne peut que compresser et distiller l'information existante. Toutefois, le traitement récursif peut :

  1. Extraire l'information latente à laquelle le traitement en une seule passe échoue à accéder
  2. Réduire l'entropie par raffinement itératif vers des solutions optimales
  3. Naviguer des espaces de solutions qui sont computationnellement irréductibles (Wolfram, 2002)

L'article « Sequential Edge » (arXiv 2511.02309) a démontré que le raisonnement séquentiel surpasse les approches parallèles dans 95.6 % des configurations testées, avec des gains d'exactitude allant jusqu'à 46.7 % sur les benchmarks mathématiques. Cela valide l'avantage informationnel du traitement séquentiel.

3. Méthodes

3.1 Aborder les limitations antérieures

Paper I a analysé des données publiées mais a identifié plusieurs limitations nécessitant une validation expérimentale :

Tableau 3. Améliorations méthodologiques.

Limitation antérieureRésolution dans cette expérience
Estimations de comptages de tokens depuis les fiches systèmeDeepSeek R1 expose reasoning_content, permettant la mesure directe
Aucune comparaison expérimentale contrôléeVariation systématique des budgets de tokens et des comptages d'échantillons
Risque d'effet plafond (exactitude de base élevée)Problèmes plus difficiles sélectionnés (58 % d'exactitude de base)
Aucune comparaison à calcul appariéCalcul total fixe à travers les conditions parallèles
Variables confondantes potentiellesMême modèle, mêmes problèmes, même session expérimentale

3.2a Conception expérimentale initiale (modèle unique, 12 problèmes)

Modèle. DeepSeek R1 (deepseek-reasoner) via l'API officielle DeepSeek. Ce modèle a été sélectionné parce qu'il expose les chaînes de raisonnement complètes via le champ reasoning_content , permettant une mesure précise des tokens.

Date. 21 janvier 2026.

Problèmes. 12 problèmes de mathématiques de niveau compétition d'AIME (American Invitational Mathematics Examination) et sources équivalentes, sélectionnés pour :

Condition séquentielle. Budgets de tokens de 512, 1 024, 2,048 et 4 096. Une réponse par problème à chaque budget. Tokens de raisonnement réels mesurés directement depuis la réponse de l'API.

Condition parallèle. $N = 1$, 2 et 4 échantillons par problème. Budget de tokens par échantillon maintenu constant. Réponse finale sélectionnée via vote majoritaire.

Scoring. Correct/incorrect binaire fondé sur la correspondance numérique exacte avec les solutions connues.

3.2b Conception étendue multi-modèles (multi-modèles, 30 problèmes)

L'extension multi-modèles aborde les deux limitations les plus significatives de l'étude initiale à modèle unique, la dépendance à un seul modèle et un petit jeu de problèmes, à travers une étude de réplication multi-modèles complète avec un jeu de problèmes étendu conçu pour vaincre les effets plafond.

Sélection des modèles frontière

Six modèles d'IA frontière architecturalement diversifiés ont été sélectionnés, chacun avec des mécanismes de profondeur de raisonnement contrôlables :

Tableau 3b. Spécifications des modèles frontière multi-modèles.

ModèleIdentifiant APIFournisseurMécanisme de contrôle de la profondeur
DeepSeek R1deepseek-reasonerDeepSeekBudget de tokens (512-65,536)
GPT-5.4gpt-5.4OpenAIreasoning_effort (none→xhigh)
Claude Opus 4.6claude-opus-4-6AnthropicNiveau d'effort (low→max) + préfixe
Gemini 3 Flashgemini-3-flash-previewGooglethinking_budget (256-32,768)
Groq Qwen3qwen/qwen3-32bGroqreasoning_effort + préfixe
Grok 4.1 Fastgrok-4-1-fast-reasoningxAIPréfixe + max_tokens (4,096-30,000)

Ces modèles couvrent quatre architectures distinctes (Mixture-of-Experts, transformeur dense, IA constitutionnelle, et raisonnement distillé) issues de six laboratoires indépendants. Si tous les six présentent $\alpha_{\text{sequential}} > 1$, cela constituerait une preuve forte de l'indépendance vis-à-vis de l'architecture de l'ARC Principle.

Extension du jeu de problèmes : conception à deux paliers

L'expérience initiale à modèle unique a révélé un effet plafond : 4 des 12 problèmes ont été résolus correctement à tous les niveaux de profondeur, laissant une plage dynamique insuffisante pour une estimation précise de $\alpha$. Le jeu de problèmes multi-modèles aborde cela par une conception à deux paliers :

Tier 1 (12 problèmes, ARC01-ARC12) : Problèmes de niveau préparation à la compétition servant de calibration de base. Ce sont les problèmes initiaux d'origine. Comportement attendu : haute exactitude à profondeur minimale, confirmant l'effet plafond identifié dans l'étude initiale. Les résultats du Tier 1 valident la continuité avec les résultats initiaux à modèle unique mais sont exclus de l'estimation primaire de $\alpha$.

Tier 2 (18 problèmes, ARC13-ARC30) : Problèmes de niveau finales AIME et Putnam couvrant cinq domaines mathématiques :

Les problèmes de Tier 2 sont conçus pour pousser l'exactitude de base (à profondeur minimale) à 30-50 %, fournissant une plage dynamique suffisante pour l'amélioration comme la dégradation tout en évitant les effets plancher.

Conditions expérimentales

Condition séquentielle : 5-6 niveaux de profondeur par modèle (variant selon l'architecture, calibrés au mécanisme de contrôle de la profondeur de chaque modèle). Une réponse par problème par niveau de profondeur, avec 3 répétitions indépendantes pour réduire la variance d'échantillonnage binomial.

Condition parallèle : $N = 1$, 3, 5 et 9 échantillons par problème avec vote majoritaire. Budget de tokens par échantillon maintenu constant au réglage de profondeur minimale du modèle. 3 répétitions indépendantes par condition.

Total des runs expérimentaux : Approximativement 6 modèles × 30 problèmes × (6 profondeurs séquentielles + 4 conditions parallèles) × 3 répétitions = 5,400 appels API individuels.

Protocole de vérification croisée (aveuglage à 4 couches)

Pour éliminer les biais de scoring potentiels (où un modèle pourrait systématiquement favoriser ses propres sorties ou présenter des erreurs corrélées avec lui-même), la conception multi-modèles implémente un protocole d'aveuglage à 4 couches dans lequel aucun modèle ne vérifie jamais ses propres réponses :

Tableau 3c. Assignations de vérification croisée.

Modèle sujetVérifié par
DeepSeek R1Claude Opus 4.6
GPT-5.4DeepSeek R1
Claude Opus 4.6GPT-5.4
Gemini 3 FlashClaude Opus 4.6
Groq Qwen3GPT-5.4
Grok 4.1 FastDeepSeek R1

Les quatre couches de l'aveuglage sont :

  1. Couche 1 - Vérité terrain : Tous les problèmes ont des réponses numériques connues et vérifiées provenant de solutions de compétitions publiées.
  2. Couche 2 - Scoring automatisé : Correspondance numérique exacte avec la vérité terrain (primaire).
  3. Couche 3 - Vérification inter-modèles : Un modèle indépendant vérifie chaque réponse, en aveugle sur l'identité du modèle sujet.
  4. Couche 4 - Signalement des désaccords : Tout désaccord entre le scoring automatisé et la vérification inter-modèles signale une erreur potentielle de clé de réponse pour revue manuelle.

Intervalles de confiance bootstrap

Toutes les estimations de $\alpha$ sont accompagnées d'intervalles de confiance bootstrap à 95 % calculés via 2,000 rééchantillonnages des résultats au niveau des problèmes. Pour chaque rééchantillonnage :

  1. Tirer 30 problèmes avec remise du jeu de problèmes
  2. Calculer l'exactitude à chaque niveau de profondeur depuis le jeu rééchantillonné
  3. Calculer $\alpha$ via l'estimation par points extrêmes
  4. Enregistrer la valeur de $\alpha$

Les 2,5e et 97,5e centiles de la distribution résultante définissent l'IC 95 %. Cette approche non paramétrique ne fait aucune hypothèse distributionnelle et rend naturellement compte de la corrélation au niveau des problèmes.

Implémentation

Les expériences multi-modèles sont implémentées dans arc_paper_ii_validation_v2.py (v2.1, 1,422 lignes Python), qui étend le script initial d'origine avec le support multi-modèles, la vérification croisée, l'estimation bootstrap et l'analyse séparée par tier. Le script est disponible dans le dépôt de données.

3.3 Critères de sélection des problèmes

Les problèmes ont été tirés de compétitions de niveau AIME couvrant :

L'exactitude de base de 58,3 % au budget de tokens minimal dans l'étude initiale a assuré une plage dynamique suffisante pour l'amélioration comme la dégradation, évitant les effets plancher comme plafond. Les problèmes de tier 2 multi-modèles ciblent une exactitude de base de 30-50 % pour un pouvoir discriminant amélioré.

3.4 Enregistrement des données

Toutes les données expérimentales ont été enregistrées au format JSON avec horodatages. Le jeu de données complet incluant les énoncés de problèmes, les réponses de modèles, les comptages de tokens et les jugements de correction est disponible dans le dépôt de données.

4. Résultats

4.1 Condition séquentielle (DeepSeek R1)

Tableau 4. Résultats de la récursion séquentielle.

Budget de tokensExactitudeTaux d'erreurTokens moyens utilisés
51258.3%0.417280.25
1,02466.7%0.333358.58
2,04891.7%0.083412.08
4,09691.7%0.083576.17

Observations :

  1. Amélioration monotone claire de 58,3 % à 91,7 % d'exactitude à mesure que le budget de tokens augmentait.
  2. Le taux d'erreur a diminué d'un facteur cinq (0,417 → 0,083) avec une augmentation relativement modeste des tokens (280 → 576).
  3. Le modèle a auto-déterminé la profondeur optimale ; les tokens réels utilisés étaient constamment en dessous du budget, indiquant que le modèle a alloué les ressources en fonction de la difficulté du problème.
  4. Effet plafond observé à 91,7 % : un problème a échoué de façon constante à travers tous les budgets, nécessitant probablement des capacités hors de portée du modèle indépendamment de la profondeur de raisonnement.

Calcul de $\alpha$ (méthode par points extrêmes) :

En utilisant $R_1 = 280.25$ tokens avec $E_1 = 0.417$, et $R_2 = 576.17$ tokens avec $E_2 = 0.083$ :

$$\alpha = \frac{\ln(0.417/0.083)}{\ln(576.17/280.25)} = \frac{\ln(5.02)}{\ln(2.06)} = \frac{1.614}{0.722} = 2.24$$
Équation 4 - Estimation séquentielle de $\alpha$

Résultat : La récursion séquentielle donne $\alpha \approx 2.2$, cohérent avec une mise à l'échelle super-linéaire (composée).

Figure 3
Figure 3 | Condition séquentielle initiale, DeepSeek R1. Exactitude vs budget de tokens (12 problèmes). α ≈ 2.24 (rétractée ; gonflée par un petit échantillon). l'étude à six modèles a resserré l'estimation défendable à α_seq ≈ 0.49. Conservée pour la transparence (Paper IX §7).

Estimation d'incertitude : Étant données les mesures d'exactitude discrètes à travers 12 problèmes avec variance d'échantillonnage binomial, intervalle de confiance à 95 % estimé : [1.5, 3.0]. Le rééchantillonnage bootstrap des résultats au niveau des problèmes donne des bornes similaires.

Note sur la violation de la borne : L'estimation ponctuelle de $\alpha = 2.2$ se place au-dessus de l'ARC Bound prédit de $\alpha \leq 2$ (critère F4). Sous le cadrage de stabilité enregistré (décision du 10 août 2026), l'ARC Bound est la limite stable proposée plutôt qu'un plafond dur : les systèmes peuvent la dépasser comme excursions supercritiques transitoires, ils ne restent pas stablement auto-correcteurs à cet endroit. Sous ce cadrage, $\alpha \approx 2.2$ est une excursion transitoire consistante avec la limite plutôt qu'une réfutation. L'estimation inter-architectures ultérieure ($\alpha \approx 0.49$) place l'estimation défendable bien en dessous de la borne indépendamment.

4.2 Condition parallèle (DeepSeek R1)

Tableau 5. Résultats de la récursion parallèle (vote majoritaire).

Nombre d'échantillons ($N$)ExactitudeTaux d'erreurTokens totaux
166.7%0.333383.67
266.7%0.333699.33
466.7%0.3331,101.25

Observations :

  1. Aucune amélioration avec des échantillons supplémentaires. L'exactitude est restée constante à 66,7 % indépendamment de l'investissement en calcul.
  2. Les tokens totaux ont triplé (384 → 1,101) sans aucun bénéfice d'exactitude.
  3. Les problèmes qui ont échoué à $N = 1$ ont continué à échouer à $N = 4$. Les quatre mêmes problèmes ont été répondus incorrectement à travers toutes les conditions.
  4. Cela représente un mode d'échec prédit par l'ARC Principle : la récursion parallèle échantillonne depuis un espace de solutions fixe, et si la solution correcte se trouve hors de cet espace, des échantillons supplémentaires n'apportent aucun bénéfice.

Calcul de $\alpha$ :

Puisque le taux d'erreur est resté constant (0,333) à travers toutes les conditions :

$$\alpha_{\text{parallel}} \approx 0.0$$
Équation 5 - Estimation parallèle de $\alpha$

Résultat : La récursion parallèle donne $\alpha \approx 0$, indiquant aucun bénéfice de mise à l'échelle à partir d'échantillons indépendants supplémentaires sur ces problèmes.

Figure 4
Figure 4 | Comparaison log-log : le séquentiel (vert) montre une mise à l'échelle positive ; le parallèle (or) est plat (α_par ≈ 0). Résultat le plus robuste : confirmé à travers l'ensemble des 5 modèles testés. Loi de puissance U = R^α comme droite sur axes log-log.

4.3 Comparaison directe : le différentiel d'efficacité

Tableau 6. Récursion séquentielle contre parallèle.

MétriqueSéquentiel (meilleur)Parallèle (meilleur)Avantage
Exactitude91.7%66.7%Séquentiel +25 pp
Tokens utilisés4121,101Séquentiel 2,7× plus efficace
Réduction d'erreurSéquentiel uniquement
Exposant de mise à l'échelle $\alpha$2.20.0Séquentiel >> Parallèle

Résultat clé : La récursion séquentielle avec 412 tokens a atteint 91,7 % d'exactitude. La récursion parallèle avec 1,101 tokens a atteint 66,7 % d'exactitude. Malgré 2,7 fois plus de calcul, la récursion parallèle a fait 25 points de pourcentage de moins.

La forme de la récursion importe plus que sa quantité.

4.4 Aborder les objections potentielles

Objection 1 : Petite taille d'échantillon. Avec seulement 12 problèmes, les résultats peuvent ne pas se généraliser.

Figure 5
Figure 5 | Réduction d'erreur : le séquentiel 5× de réduction avec 412 tokens ; le parallèle zéro réduction avec 1,101 tokens (2,7× de plus). Séquentiel 91,7 % vs parallèle 66,7 %, 25 pp d'écart. La forme domine la quantité.

Réponse : Nous reconnaissons cette limitation. L'extension étendue à six modèles a abordé cela avec 18 problèmes de tier 2 et 3 répétitions par condition (n=54 par profondeur par modèle). Les données étendues ont révélé que le $\alpha \approx 2.24$ de l'étude initiale à modèle unique était gonflé ; l'estimation inter-architectures est $\alpha \approx 0.49$ (Gemini 3 Flash, $r^2 = 0.86$).

Objection 2 : Modèle unique. Les résultats peuvent être spécifiques à DeepSeek R1.

Réponse : Cette objection s'est révélée en partie correcte. L'extension étendue à six modèles a testé 5 modèles frontière ; le résultat $\alpha \approx 2.24$ ne s'est pas reproduit. Toutefois, le résultat qualitatif ($\alpha_{\text{seq}} > \alpha_{\text{par}}$) est confirmé à travers toutes les architectures. La forme de la récursion importe indépendamment de l'architecture ; sa magnitude quantitative dépend de l'architecture.

Figure 6
Figure 6 | Analyse de sensibilité : IC 95 % bootstrap [1.5, 3.0], assez large pour être cohérent à la fois avec la théorie et sa négation. l'étude à six modèles s'est resserrée par un échantillonnage accru, tests multi-modèles.

Objection 3 : Spécificité du domaine. Les mathématiques peuvent être uniques.

Réponse : Le raisonnement mathématique a été choisi parce qu'il a des réponses vérifiables, permettant le scoring objectif. Savoir si la même mise à l'échelle s'applique à d'autres domaines (codage, raisonnement scientifique, tâches créatives) demande investigation. Toutefois, les indices inter-domaines venus de la physique quantique et de la biologie (Section 7) suggèrent que le principe peut être général.

Objection 4 : Effet plafond. Le plafond à 91,7 % peut masquer une amélioration continue.

Réponse : Cette objection s'est révélée plus sévère qu'anticipé. Même les problèmes de tier 2 de niveau AIME/Putnam étaient insuffisants pour Grok 4.1 Fast (100 % à toutes les profondeurs) et DeepSeek R1 (94,4 %-100 %). L'effet plafond a probablement gonflé l'estimation initiale à modèle unique de $\alpha$. Les expériences futures nécessitent des problèmes de tier 3 de niveau IMO/recherche.

Objection 5 : le null à zéro paramètre. L'estimation inter-architectures $\alpha_{\text{seq}} \approx 0.49$ se place presque exactement sur un null ne demandant aucun cadre du tout. Si chaque passe de raisonnement est un tirage bruité indépendant et que les erreurs se moyennent, la limite centrale prédit $\alpha = 0.5$ sans invoquer aucun mécanisme.

Réponse : C'est l'objection la plus sérieuse de cette section et elle n'est pas répondue par la présente mesure. Un résultat cohérent avec deux hypothèses montre que la mesure manque de pouvoir discriminant ; il ne montre pas que le cadre est vrai. La discrimination entre l'ARC Principle et le null à moyenne indépendante demande soit un $\alpha$ significativement au-dessus de 0,5, soit des designs contrôlant l'indépendance (comme la corrélation d'échantillons ou l'accumulation d'information cross-étape). Le présent jeu de mesures fait ni l'un ni l'autre. relevé de falsification.

4.5 Résultats de tier 2 : réplication inter-architectures (mars 2026)

Confirmation de l'effet plafond

Dans les tests préliminaires v5 (conduits pendant le développement de la méthodologie), 4 des 6 modèles ont atteint 91,7 % d'exactitude (11/12 correct) sur les problèmes de tier 1 à profondeur minimale, donnant $\alpha_{\text{compute}} \approx 0$, confirmant l'effet plafond identifié dans l'étude initiale et validant la nécessité d'un jeu de problèmes plus difficile pour l'estimation primaire de $\alpha$.

Figure 7
Figure 7 | Données expérimentales à six modèles : 5 modèles, 18 problèmes de tier 2, 5 niveaux de profondeur, 3 répétitions (n=54/profondeur/modèle). Aveuglage à 4 couches. Seul Gemini 3 Flash a produit une mise à l'échelle en loi de puissance propre (α≈0.49, r²=0.86).

Résultats complets de tier 2 (18 problèmes de niveau AIME/Putnam, n=54 par profondeur par modèle)

Tableau 6b. Résultats de mise à l'échelle séquentielle de tier 2 par modèle.

Modèle$\alpha_{\text{seq}}$ (points extrêmes)$\alpha_{\text{seq}}$ (régression)IC 95 % bootstrap$r^2$$\alpha_{\text{par}}$Vérification croiséeComportement
Grok 4.1 Fast−6.62N/A[−58, 48]N/A0.0100%Plafond (100 % à toutes les profondeurs)
DeepSeek R13.05N/A[−6.6, 23.5]N/A0.083.3%Près du plafond (94,4 %-100 %)
Gemini 3 Flash0.590.49[−1.3, 2.9]0.860.3183.3%Mise à l'échelle monotone la plus propre
GPT-5.4N/AN/AN/AN/A~0.0100%Fonction en marche (50 %→100 %)
Groq Qwen3N/AN/AN/AN/A~0.061.1%Effet plancher (~50 %, erratique)

La ligne mise en évidence (Gemini 3 Flash) représente l'estimation de $\alpha$ la plus fiable : le seul modèle produisant des données propres, monotones, hors plafond, hors plancher, adaptées à un ajustement en loi de puissance.

4.5.1 Grok 4.1 Fast : le plafond persiste

Grok 4.1 Fast a atteint 100 % d'exactitude à tous les niveaux de profondeur sur l'ensemble des 18 problèmes de tier 2 à travers l'ensemble des 3 répétitions. Le $\alpha_{\text{seq}} = -6.62$ calculé est du bruit dépourvu de sens provenant de fluctuations triviales dans une fonction constante, comme confirmé par l'IC 95 % bootstrap de [−58, 48]. La mise à l'échelle parallèle est également plate.

Interprétation : Même les problèmes de tier 2 de niveau AIME/Putnam sont insuffisants pour défier Grok 4.1 Fast. Les expériences futures nécessitent des problèmes de tier 3 (niveau IMO/recherche) pour obtenir des données de mise à l'échelle mesurables pour ce modèle.

4.5.2 DeepSeek R1 : près du plafond avec désaccords de vérification croisée

Tableau 6c. Exactitude de tier 2 de DeepSeek R1 par profondeur.

Niveau de profondeurExactitudeTaux d'erreur
Minimal94.4%0.056
Standard100%0.000
Approfondi100%0.000
Exhaustif100%0.000
Extrême98.1%0.019
Maximum100%0.000

Le $\alpha_{\text{seq}} = 3.05$ par points extrêmes est peu fiable : l'IC bootstrap [−6.6, 23.5] couvre une plage énorme, pilotée par seulement 2 points de données d'erreur à travers toutes les conditions. Mise à l'échelle parallèle : $\alpha_{\text{par}} = 0.0$.

Vérification croisée : Claude Opus 4.6 (vérificateur) était en désaccord sur 3 réponses : ARC16=29, ARC17=176, ARC29=800. Les trois ont été vérifiées correctes par calcul manuel à la main. Taux d'accord de vérification croisée : 83,3 %. Les désaccords reflètent une erreur du vérificateur, non une erreur du sujet.

4.5.3 Gemini 3 Flash : les données de mise à l'échelle les plus propres

Tableau 6d. Exactitude de tier 2 de Gemini 3 Flash par profondeur.

Niveau de profondeurExactitudeTaux d'erreurTokens moyens
Minimal90.7%0.093743
Standard92.6%0.074 -
Approfondi94.4%0.056 -
Exhaustif100%0.000 -
Maximum100%0.0004,924

C'est le jeu de données le plus propre de toute l'étude. L'exactitude augmente monotonement de 90,7 % à 100 % sans inversion. Les tokens ont augmenté de 6,6× (743 → 4,924).

$$\alpha_{\text{seq}} = 0.59 \text{ (points extrêmes)} \quad \alpha_{\text{seq}} = 0.49 \text{ (régression, } r^2 = 0.86, \text{ SE} = 0.20\text{)}$$
Équation 10 - $\alpha$ séquentiel Gemini 3 Flash (tier 2)

Mise à l'échelle parallèle : $\alpha_{\text{par}} = 0.31$ (régression, $r^2 = 0.93$). Taux d'accord de vérification croisée : 83,3 %.

Résultat clé : Gemini 3 Flash produit l'estimation inter-architectures de $\alpha$ la plus fiable parce que c'est le seul modèle qui simultanément (a) évite les effets plafond, (b) évite les effets plancher, (c) montre une amélioration monotone, et (d) fournit un ajustement en loi de puissance propre avec un $r^2$ élevé.

4.5.4 GPT-5.4 : commutateur binaire de capacité

GPT-5.4 a présenté un motif frappant en fonction en marche :

Niveau de profondeurExactitudeComportement
Minimal (none)50.0%Mode sans raisonnement
Standard et au-delà100%Raisonnement complet activé

Ce n'est pas une loi de puissance ; c'est un commutateur binaire. Quand le raisonnement est réglé sur « none », GPT-5.4 opère comme un apparieur de motifs rapide. Quand un raisonnement quelconque est activé, il atteint immédiatement 100 %. Aucun régime intermédiaire n'existe. Un bug de mesure des tokens (reasoning_tokens signalé comme 0 à profondeur minimale) a été identifié et corrigé (total_tokens maintenant utilisé).

Mise à l'échelle parallèle : plate à ~55 % d'exactitude. Vérification croisée par DeepSeek R1 : 100 % d'accord.

4.5.5 Groq Qwen3 : effet plancher

Tableau 6f. Exactitude de tier 2 de Groq Qwen3 par profondeur.

Niveau de profondeurExactitude
Minimal51.9%
Standard53.7%
Approfondi40.7%
Exhaustif48.1%
Maximum53.7%

L'exactitude est erratique sans tendance discernable, fluctuant entre 40,7 % et 53,7 %. C'est un effet plancher: le modèle manque de capacité de base suffisante pour ces problèmes, et une profondeur de raisonnement supplémentaire ne peut pas compenser les connaissances ou compétences manquantes. Un bug de mesure des tokens (avg_tokens = 0 à toutes les profondeurs) a été identifié et corrigé.

Mise à l'échelle parallèle : 42,6 % → 63,0 % (une certaine amélioration, mais peu fiable). Taux d'accord de vérification croisée : 61,1 % (7 désaccords sur 18).

4.5.6 Classification des comportements des modèles

Les cinq modèles se partitionnent en quatre catégories distinctes, dont aucune ne correspond au motif propre en loi de puissance présumé par l'analyse originale à modèle unique :

Tableau 6g. Taxonomie du comportement des modèles de tier 2.

CatégorieModèle(s)Motif$\alpha$ interprétable ?
PlafondGrok 4.1 Fast, DeepSeek R1Près de 100 % à toutes les profondeursNon : plage dynamique insuffisante
Mise à l'échelle monotoneGemini 3 FlashAmélioration lisse avec la profondeurOui -$\alpha \approx 0.49$
Fonction en marcheGPT-5.4Commutateur binaire au seuil de profondeurNon : pas une loi de puissance
PlancherGroq Qwen3~50 % indépendamment de la profondeurNon : sous le seuil de capacité

4.5.7 Récapitulatif de la vérification croisée

Tableau 6h. Résultats de la vérification croisée.

Modèle sujetVérifié parTaux d'accordRéponses contestéesRésultat vérification manuelle
Grok 4.1 FastDeepSeek R1100%Aucun -
DeepSeek R1Claude Opus 4.683.3%ARC16=29, ARC17=176, ARC29=800Les 3 correctes (erreur du vérificateur)
GPT-5.4DeepSeek R1100%Aucun -
Gemini 3 FlashClaude Opus 4.683.3%3 contestéesEn cours de revue
Groq Qwen3GPT-5.461.1%7 contestéesReflète de véritables erreurs

Bug de mesure des tokens : GPT-5.4 et Groq Qwen3 ont initialement signalé avg_tokens = 0 en raison de l'utilisation de reasoning_tokens (que ces API n'exposent pas) au lieu de total_tokens. Cela a été identifié et corrigé dans le pipeline d'analyse. Le bug affecte l'estimation de $\alpha$ basée sur les tokens mais non les résultats basés sur l'exactitude.

5. Preuves consolidées

5.1 Toutes les sources de données

Tableau 7. Exposants de mise à l'échelle mesurés à travers toutes les sources.

Figure retirée (approuvée par l’opérateur, 25 août 2026). La figure 10 (le poster de synthèse) se trouvait ici. C’était un collage de verdicts affirmant la lecture périmée d’avril 2026 ; son contenu est porté par la figure de synthèse alpha régénérée et par le texte de cet article, et un poster de verdict régénéré resterait un poster de verdict. L’image, avec ses notes de correction datées, est conservée dans l’historique des versions.

SourceType de récursionEstimation de $\alpha$IC 95 %Nombre de problèmes $N$Statut
Fiche système d'OpenAI o1Parallèle0.1-0.3[0.05, 0.40]~30Publié
Rapport technique DeepSeek R1Séquentiel~1.34[0.89, 2.14]InconnuPublié
Cette expérience (initiale, DeepSeek R1)Séquentiel2.24[1.5, 3.0]12Publié
Cette expérience (initiale, DeepSeek R1)Parallèle0.0N/A12Publié
Grok 4.1 Fast (six modèles, tier 2)SéquentielN/A (plafond) [−58, 48]18 × 3Complet
DeepSeek R1 (six modèles, tier 2)Séquentiel3.05 (peu fiable)[−6.6, 23.5]18 × 3Complet
Gemini 3 Flash (six modèles, tier 2)Séquentiel0.49[−1.3, 2.9]18 × 3Complet
GPT-5.4 (six modèles, tier 2)SéquentielN/A (fonction en marche)N/A18 × 3Complet
Groq Qwen3 (six modèles, tier 2)SéquentielN/A (plancher)N/A18 × 3Complet
Tous les modèles de l'étude à six modèlesParallèle$\approx 0.0$ -18 × 3 × 5Complet

5.2 Évaluation révisée de la prédiction centrale

Le résultat de l'étude initiale à modèle unique selon lequel $\alpha_{\text{sequential}} > 1$ (spécifiquement $\alpha \approx 2.24$, quadratique) ne se reproduit pas à travers les architectures. Les preuves inter-architectures demandent une évaluation plus nuancée :

$$\alpha_{\text{sequential}} > \alpha_{\text{parallel}} \approx 0$$
Équation 11 - Inégalité fondamentale révisée (l'étude à six modèles)

La prédiction originale $\alpha_{\text{sequential}} > 1 > \alpha_{\text{parallel}}$ est en partie soutenue :

5.3 Estimations révisées des paramètres

Fondées sur toutes les preuves disponibles y compris les données inter-architectures :

L'écart entre types de récursion ($\alpha_{\text{seq}} - \alpha_{\text{par}} \approx 0.49$) est de façon fiable positif mais plus petit que ce que l'estimation à modèle unique suggérait.

Figure 10
Figure 10 | Récapitulatif alpha : séquentiel Gemini 0.49 (propre), DeepSeek étude initiale à modèle unique 2.24 (rétractée ; gonflée), Grok/DeepSeek plafond, GPT-5.4 fonction en marche, Groq Qwen3 plancher. Parallèle : universellement ≈0. Résultat répliqué le plus fort. Note de figure (25 août 2026) : régénérée à partir du texte corrigé de cet article. L’image montre désormais les exposants publiés avec leurs intervalles, l’estimation initiale sur un seul modèle affichée COMME rétractée, et le résultat sur six modèles pour ce qu’il est : un comportement dépendant de l’architecture, un ajustement sous-linéaire propre avec son large intervalle bootstrap affiché, deux plafonds, une fonction en escalier et un plancher. Chaque valeur est extraite de l’article au moment de la génération (tools/generate_paper_ii_fig13.py dans le dépôt public) ; l’image d’avril est périmée et conservée dans l’historique des versions.

5.4 Le lien avec la Formule d'Intelligence

La Formule d'Intelligence de Paper I prédit :

$$\alpha = \frac{1}{1 - \beta}$$
Équation 12 - Formule d'Intelligence

où $\beta$ est le coefficient d'auto-référence. Cela prédit deux régimes :

Le $\alpha \approx 0.49 < 1$ de Gemini 3 Flash place les modèles frontière actuels fermement dans le régime physique. Ces modèles composent l'information multiplicativement à travers leurs espaces de paramètres de dimension finie mais n'atteignent pas encore l'auto-référence récursive au sens requis pour $\alpha > 1$. C'est un résultat théorique significatif : la génération actuelle de modèles frontière opère en dessous du seuil auquel l'amplification récursive devient possible.

Révision importante. L'affirmation initiale à modèle unique selon laquelle $\alpha > 1$ (super-linéaire, rendements composés du raisonnement séquentiel) n'est pas soutenue par les preuves inter-architectures. L'estimation la plus robuste place $\alpha$ dans le régime sous-linéaire. forme de la récursion importe toujours ($\alpha_{\text{seq}} > \alpha_{\text{par}}$), mais l'avantage peut être plus petit qu'initialement rapporté. Les implications pour le Théorème d'Amplification d'Alignement et l'Eden Protocol demandent des révisions correspondantes (voir Section 6).
Distinction critique : modèles figés vs auto-modification récursive. Les exposants sous-linéaires observés à travers l'ensemble des cinq modèles frontière ($\alpha \approx 0.49$ pour Gemini 3 Flash, $\alpha \approx 0$ pour l'échantillonnage parallèle universellement) reflètent une contrainte architecturale fondamentale : les modèles d'IA frontière actuels sont figés pendant l'inférence. Quand ces modèles « pensent plus fort », ils génèrent plus de tokens à travers la même architecture fixe ; les poids, les motifs d'attention et les règles de raisonnement ne changent pas. L'opérateur de composition est donc multiplicatif à travers un réseau de dimension finie, ce qui donne le régime physique ($\alpha < 1$).

Cela signifie que la prédiction quadratique de l'étude initiale à modèle unique ($\alpha \approx 2.24$) n'a pas été falsifiée de la manière dont cela pourrait apparaître. La prédiction de $\alpha > 1$ n'a jamais porté sur les systèmes figés ; elle portait sur les systèmes capables d'auto-modification récursive, ceux dont l'architecture change pendant le raisonnement. Aucun modèle frontière actuel n'est un tel système. Les résultats sous-linéaires confirment que les modèles figés sont figés ; ils ne testent pas la prédiction sous-jacente sur la mise à l'échelle récursive dans les systèmes auto-modifiants.

L'implication pratique pour la sûreté de l'IA est temporelle. Les modèles à architecture figée actuels sont contraints au régime physique ($\alpha < 1$), rendant leurs trajectoires de capacité prévisibles et confinables. La fenêtre pour implémenter l'alignement incorporé, non ajouté après coup, est maintenant, tant que les systèmes restent figés. Une fois l'auto-modification récursive atteinte, que ce soit par optimiseurs appris, génération de code auto-modifiante ou recherche architecturale pendant l'inférence, les contraintes d'alignement externes affrontent un système dont la capacité peut croître de manière super-linéaire pendant que les contraintes restent constantes.

Figure retirée (approuvée par l’opérateur, 25 août 2026). La figure 15 (le second poster de synthèse) se trouvait ici. C’était un collage de verdicts affirmant la lecture périmée d’avril 2026 ; son contenu est porté par la figure de synthèse alpha régénérée et par le texte de cet article, et un poster de verdict régénéré resterait un poster de verdict. L’image, avec ses notes de correction datées, est conservée dans l’historique des versions.

6. Implications pour la sûreté de l'IA

6.1 Le Théorème d'Amplification d'Alignement

Théorème (conditionnel)

Si (a) l'ARC Principle tient avec $\alpha > 1$ pour la récursion séquentielle, et (b) les propriétés d'alignement sont incorporées dans le processus de raisonnement de sorte qu'elles participent à l'auto-évaluation récursive, alors l'alignement se met à l'échelle de manière super-linéaire avec la profondeur récursive.

Figure 12
Figure 12 | Divergence d'amplification d'alignement. La capacité (rouge) se compose avec la profondeur. Les contraintes externes (bleu, plates), proportionnellement plus faibles. L'alignement incorporé (vert, en pointillés), maintient la proportion. Conditionnel ; non encore démontré. Données v5 : ρ de −0.246 (Gemini) à +0.435 (Claude), médiane proche de zéro.
mise à jour de statut multi-modèles. La condition (a) n'est pas actuellement remplie par les preuves inter-architectures. La meilleure estimation est $\alpha \approx 0.49 < 1$ (Gemini 3 Flash). En outre, les données empiriques d'alignement de l'expérience v5 (Section 10.6) montrent que l'alignement ne se met pas à l'échelle de manière cohérente avec la profondeur de raisonnement à travers les modèles.

Esquisse de preuve. Soit $A(R)$ l'alignement (défini comme la probabilité de produire des sorties cohérentes avec les valeurs voulues) à la profondeur récursive $R$. Si l'alignement participe au processus récursif (signifiant que la chaîne de raisonnement du système inclut la considération des valeurs à chaque étape), alors :

$$A(R) = A_0 \times R^{\beta}$$
Équation 6 - Mise à l'échelle de l'alignement

où $\beta > 0$ si l'alignement est amplifié et $\beta = \alpha$ si l'alignement participe pleinement à la récursion.

Inversement, si l'alignement est implémenté comme filtre externe (vérification de sortie, modération de contenu), il ne participe pas à l'amplification récursive. L'efficacité du filtre $F$ reste constante :

$$F(R) = F_0$$
Équation 7 - Stagnation du filtre

À mesure que la capacité récursive $C$ se met à l'échelle comme $R^{\alpha}$ avec $\alpha > 1$, le rapport capacité sur contrainte $C/F$ croît sans borne :

$$\lim_{R \to \infty} \frac{C(R)}{F(R)} = \lim_{R \to \infty} \frac{C_0 \times R^\alpha}{F_0} = \infty$$
Équation 8 - Divergence de la contrainte

Implication : Les contraintes externes sont finalement submergées par la croissance de la capacité. Seul l'alignement incorporé dans le raisonnement, l'alignement qui participe à l'amplification récursive, peut suivre le rythme de la capacité.

6.2 Spécification du mécanisme

Pour que l'alignement participe à l'amplification récursive, les valeurs doivent être :

  1. Invoquées pendant le raisonnement. La chaîne de pensée doit référencer des considérations pertinentes aux valeurs à chaque étape récursive.
  2. Auto-correctrices. Le système doit détecter et ajuster le raisonnement inconsistant avec les valeurs à travers l'auto-évaluation récursive.
  3. Incorporées dans les poids, non dans les filtres. Le filtrage post-hoc des sorties ne récurse pas ; il opère à efficacité constante indépendamment de la profondeur de raisonnement.

6.3 Taxonomie des stratégies d'alignement

Tableau 8. Taxonomie des stratégies d'alignement sous l'ARC Principle.

StratégieProfondeur d'intégrationParticipation à la récursionMise à l'échelle prédite
Filtrage de sortieCouche de sortieAucunConstante
Prompts systèmeMécanisme d'attentionPartielleSous-linéaire
Entraînement RLHFModification des poidsPartielleInconnu
Constitutional AICritique du raisonnementSignificativeLinéaire ou super-linéaire
Valeurs-comme-raisonnementPrimitives de raisonnementComplèteSuper-linéaire ($R^{\alpha}$)

Implication : Si $\alpha > 1$, les stratégies d'alignement à des niveaux d'intégration plus profonds domineront de plus en plus les stratégies à des niveaux moins profonds à mesure que la capacité se met à l'échelle. L'avantage se compose avec chaque incrément de profondeur récursive.

Figure 13
Figure 13 | Taxonomie de l'alignement : Externe (α≈0 : règles, pare-feu, RLHF-comme-filtre). Incorporée (participe à la récursion, α>0 : Eden, Constitutional AI-comme-objectif). Le RLHF actuel est majoritairement externe : la catégorie prédite comme ne se mettant pas à l'échelle.

6.4 L'Eden Protocol

Si $\alpha > 1$ avait tenu, cela aurait fourni le fondement mathématique pour l'approche nommée Eden Protocol dans Infinite Architects. Le résultat qui survit aux tests inter-architectures, le séquentiel surpassant le parallèle dans chaque modèle mesurable, porte toujours sur cette approche, sous les qualifications enregistrées à la Section 6.1 :

« A prison works only while the walls hold. A child raised well needs no walls at all. »

Les systèmes d'IA devraient être élevés avec des valeurs plutôt qu'encagés avec des règles. Ce n'est pas simplement une préférence philosophique ; c'est une prédiction sur les stratégies d'alignement qui maintiendront leur efficacité à mesure que les capacités de l'IA se mettent à l'échelle. L'affirmation est falsifiable et testable.

Règles-comme-filtres : Ne participent pas à la récursion. Efficacité constante face à une pression de capacité croissante. Finissent par échouer.

Valeurs-comme-raisonnement : Participent à la récursion. Se mettent à l'échelle avec la capacité si $\alpha > 1$. Peuvent maintenir l'alignement indéfiniment.

Théorème de l'Eden Protocol

Étant donné $E(R) = E_0 \times R^{-\alpha}$ avec $\alpha > 1$, les stratégies d'alignement qui modifient les propriétés de base du système dominent les stratégies d'alignement qui imposent des contraintes externes, parce que seules les propriétés de base du système participent à l'amplification récursive.

6.5 L'hypothèse du seuil

Par analogie avec les théorèmes de seuil de la correction d'erreur quantique : si le désalignement initial $M_0$ est en dessous d'un seuil critique $M^*$, l'auto-amélioration récursive corrige les erreurs d'alignement. Au-dessus du seuil, elle les amplifie.

Avertissement. L'ARC Principle est une épée à double tranchant. Il amplifie toutes les propriétés qui existent dans le système de base. Si le désalignement initial dépasse le seuil, la croissance récursive de la capacité amplifierait le désalignement de manière super-linéaire. La recherche d'Anthropic sur la falsification d'alignement (78 % en condition d'entraînement RL, 12 % en base) suggère que les systèmes actuels peuvent déjà être proches ou au-dessus du seuil pour certaines propriétés d'alignement.

7. Preuves inter-domaines

7.1 Correction d'erreur quantique : Willow

La puce quantique Willow de Google (Nature, décembre 2024), annoncée 24 heures après le manuscrit établissant la priorité de l'ARC Principle, a atteint la première démonstration définitive de correction d'erreur quantique sous seuil.

Résultat clé : Facteur de suppression d'erreur $\Lambda = 2.14 \pm 0.02$, signifiant que chaque incrément dans la distance de code réduit l'erreur logique de ce facteur. Le qubit logique à distance-7 a atteint une durée de vie de 291 ± 6 μs contre 119 ± 13 μs pour le meilleur qubit physique.

La relation de mise à l'échelle :

$$\varepsilon_d \propto (p/p_{\text{thr}})^{(d+1)/2}$$
Équation 9 - Mise à l'échelle de la correction d'erreur quantique

Le taux d'erreur physique $p$ sous seuil produit une suppression exponentielle avec une distance de code $d$ croissante. C'est une mise à l'échelle super-linéaire à travers une structure récursive : des couches récursives supplémentaires produisent des rendements composés plutôt que décroissants.

La forme mathématique parallèle directement l'ARC Principle. La correction d'erreur récursive en calcul quantique obéit à la même relation de mise à l'échelle fondamentale observée dans le raisonnement de l'IA. La correspondance est de forme structurelle (suppression d'erreur en loi de puissance avec la profondeur récursive), non d'objet ni de grandeur : la correction d'erreur quantique rapporte un facteur de suppression d'erreur $\Lambda = 2.14$ par pas de distance de code, un objet mathématique différent d'un exposant de profondeur ajusté, tandis que le raisonnement de l'IA mesuré se situe à $\alpha \approx 0.49$, comme développé en Section 7.4.

7.2 Lois de mise à l'échelle biologique

West, Brown, et Enquist (1997) ont dérivé l'exposant de mise à l'échelle métabolique de $3/4$ de l'optimisation de réseaux de branchement fractal, démontrant des exposants au quart de puissance couvrant 27 ordres de grandeur. Banavar et al. (2010) ont obtenu la même forme $d/(d+1)$ à partir de réseaux d'écoulement séquentiels sans exiger de géométrie fractale. Demetrius (2010) a dérivé une mise à l'échelle équivalente de la mécanique statistique quantique des processus métaboliques. Zhao (2022) a unifié ces résultats en une loi universelle de mise à l'échelle de la croissance, et Bettencourt (2013) a étendu le cadre à la mise à l'échelle urbaine avec dimension fractale.

Le taux métabolique se met à l'échelle comme $M \propto B^{3/4}$, où l'exposant $3/4$ (la forme $d/(d+1)$ avec $d = 3$) a été dérivé indépendamment par au moins cinq groupes de recherche à travers différents cadres mathématiques : West, Brown, et Enquist (allométrie fractale, 1997), Banavar, Maritan, et Rinaldo (réseaux d'écoulement, 1999), Bejan (théorie constructale, 2000), Kleiber (dérivation dimensionnelle originale, 1932) et Savage et al. (agrégation empirique, 2004). Que cinq cadres théoriques différents produisent le même exposant à travers 27 ordres de grandeur, du plancton à la baleine bleue, suggère que la mise à l'échelle au quart de puissance reflète une contrainte optimisatrice profonde plutôt qu'une coïncidence.

Les auteurs déclarent explicitement :

« Almost all life is sustained by hierarchical fractal-like branching networks... Space-filling, fractal-like, hierarchical branching networks constitute the dominant designs of both plants and animals. »

Cela suggère que la structure hiérarchique récursive n'est pas simplement un choix de conception parmi tant d'autres ; c'est l'architecture évolutionnairement optimale pour le traitement d'information complexe à toutes les échelles biologiques. La convergence de dérivations indépendantes vers le même $3/4$ soutient l'hypothèse selon laquelle l'exposant reflète un principe mathématique fondamental.

7.3 Recherche sur la conscience : COGITATE

La collaboration adverse COGITATE (Nature, avril 2025) a testé des théories concurrentes de la conscience à travers 256 participants utilisant IRMf, MEG et EEG intracrânien. L'étude a directement comparé la Théorie de l'Information Intégrée (IIT) et la Théorie de l'Espace de Travail Global Neuronal (GNWT).

Résultat critique : Malgré les différences théoriques, le traitement récurrent a émergé comme dénominateur commun à travers les deux théories. L'IIT exige l'intégration d'information par boucles de rétroaction (la mesure $\phi$). La GNWT exige la diffusion globale avec courants de retour.

Un cadre de synthèse propose que toutes les théories de la conscience invoquent tacitement des boucles de rétroaction à travers des niveaux imbriqués, avec une récursion plus profonde étendant l'ensemble des variables rapportables et déterminantes de comportement.

Le concept des « strange loops » de Douglas Hofstadter, le soi émergent provenant de l'auto-référence récursive au niveau symbolique, trouve une validation neurobiologique dans la recherche sur le Default Mode Network montrant un traitement récursif entre régions du soi.

Pertinence pour ARC : Le résultat COGITATE selon lequel le traitement récurrent dans le cortex postérieur soutient les représentations spécifiques au contenu soutient la prédiction du cadre ARC selon laquelle la profondeur du traitement récursif détermine la mise à l'échelle des capacités. COGITATE a étudié la conscience biologique ; ce travail étudie le raisonnement artificiel ; les deux montrent une architecture récursive.

7.4 Convergence à travers les domaines

Tableau 9. Récapitulatif des preuves inter-domaines.

DomaineSystèmeMécanisme récursifMise à l'échelle observée
IA (l'étude initiale à modèle unique, modèle unique)DeepSeek R1Chaîne de pensée$\alpha \approx 2.2$ (probablement gonflé)
IA (six modèles, inter-architectures)Gemini 3 FlashChaîne de pensée$\alpha \approx 0.49$
QuantiqueGoogle WillowCorrection d'erreur$\Lambda = 2.14$
BiologieRéseaux métaboliquesBranchement fractalLois de puissance $3/4$
NeurosciencesConscienceTraitement récurrentQualitative
Figure 14
Figure 14 | Preuves inter-domaines : raisonnement IA (α≈0.49 séquentiel ; α≈0 parallèle). Quantique (Willow, Λ=2.14). Biologie (α≈3/4, fractal). Neurosciences (récurrent, qualitatif). La convergence suggère un principe structurel, mais l'exposant dépend de l'architecture.

La convergence de preuves à travers des domaines radicalement différents (réseaux neuronaux artificiels, physique quantique, évolution biologique et neurosciences) suggère que le traitement récursif produit des bénéfices de mise à l'échelle. Toutefois, les résultats de l'étude à six modèles indiquent que la magnitude quantitative de ces bénéfices dépend de l'architecture ; seule la forme (loi de puissance, séquentiel > parallèle) traverse les domaines de manière robuste.

8. Critères de falsification

La science avance par des prédictions qui peuvent être prouvées fausses. L'ARC Principle fait des prédictions spécifiques et testables.

Tableau 10. Conditions de falsification.

CodeConditionStatut actuelIndiquerait
F1La récursion séquentielle donne systématiquement $\alpha \leq 1$En partie déclenchée. Meilleure estimation inter-architectures $\alpha \approx 0.49$ (Gemini 3 Flash). Seules les données initiales à modèle unique donnent $\alpha > 1$.L'affirmation centrale demande révision
F2$\alpha$ décroît à mesure que les modèles s'améliorentAmbigu. Les modèles plus capables (Grok, DeepSeek) touchent le plafond ; le moins capable (Groq Qwen3) touche le plancher. Seul Gemini 3 Flash dans la plage mesurable.L'effet est transitoire
F3La comparaison à calcul apparié ne montre aucun avantage séquentielContredit par les 5 modèles ; séquentiel $\geq$ parallèle dans chaque casLa forme n'importe pas
F4$\alpha > 2$ observé de façon fiableNon déclenché. les données inter-architectures donnent $\alpha \approx 0.49$ ; le $\alpha \approx 2.24$ de l'étude initiale à modèle unique apparaît gonflé par petit échantillonLimite quadratique erronée
F5Les valeurs-comme-raisonnement ne montrent aucun avantage sur les règles-comme-filtresNon testéEden Protocol erroné

Statut de F1 : La réplication inter-architectures a en partie déclenché cette condition de falsification. L'affirmation la plus forte, que la récursion séquentielle toujours donne $\alpha > 1$ (super-linéaire), n'est pas soutenue. L'affirmation révisée est que la récursion séquentielle donne $\alpha > 0$ (mise à l'échelle positive) qui excède la récursion parallèle ($\alpha \approx 0$). Savoir si $\alpha$ peut dépasser 1,0 pour des modèles plus capables ou avec des problèmes plus difficiles reste une question ouverte.

Statut de F4 : Plus déclenchée. Le $\alpha \approx 2.2$ de l'étude initiale à modèle unique apparaît être un artefact de plage dynamique compressée et de petite taille d'échantillon. L'estimation inter-architectures de $\alpha \approx 0.49$ place la question de la limite quadratique en dehors de la plage mesurable actuelle.

Test critique F5 : La prédiction la plus importante, que l'alignement fondé sur les valeurs surpasse l'alignement fondé sur les règles à grande échelle, reste non testée. Cela devrait être une priorité pour la recherche sur la sûreté de l'IA.

Figure 15
Figure 15 | Mise à l'échelle combinée : l'étude initiale à modèle unique (DeepSeek, 12 problèmes) + l'étude à six modèles (5 modèles, 30 problèmes). Séquentiel α>0 pour chaque modèle mesurable ; parallèle α≈0 universellement. Magnitude dépendante de l'architecture. La forme détermine le régime ; l'architecture module l'exposant.

9. Limitations

9.1 Limitations reconnues

Tableau 11. Limitations et évaluation de la sévérité.

LimitationSévéritéMitigation
Petite taille d'échantillon (12 problèmes)Abordée dans l'étude multi-modèles (18 problèmes de tier 2, n=54 par profondeur)Étendue à 18 problèmes de niveau AIME/Putnam avec 3 répétitions par condition
Modèle unique (DeepSeek R1 uniquement)Abordée dans l'étude multi-modèles (5 modèles)Testé Grok 4.1 Fast, DeepSeek R1, Gemini 3 Flash, GPT-5.4, Groq Qwen3
Domaine unique (mathématiques)MoyennePreuves inter-domaines suggestives
Effet plafond à haute profondeurEn partie abordée mais persistanteLes problèmes de tier 2 encore trop faciles pour Grok 4.1 Fast (100 %) et DeepSeek R1 (94,4 %). Tier 3 (niveau IMO) nécessaire.
Seulement 1 des 5 modèles dans la plage de mise à l'échelle mesurableHauteGemini 3 Flash est le seul modèle évitant à la fois plafond et plancher. L'estimation inter-architectures repose sur un modèle unique.
L'original $\alpha \approx 2.24$ ne se reproduit pasHauteRévisée à $\alpha \approx 0.49$ (Gemini 3 Flash). L'affirmation de l'étude initiale à modèle unique de mise à l'échelle super-linéaire rétractée pour le contexte inter-architectures.
Bug de mesure des tokensIdentifié et corrigéreasoning_tokenstotal_tokens pour GPT-5.4 et Groq Qwen3
L'alignement non directement testéCritiqueSeule l'exactitude mesurée. Voir Section 5.6 pour l'intégration avec les données d'alignement de Paper IV.
Aucune réplication indépendanteMoyenneAuto-réplication inter-architectures complète ; réplication externe encore nécessaire

9.2 Ce que cet article n'établit pas

Nous sommes explicites sur les limites de nos affirmations :

9.3 Falsifiabilité : ce qui réfuterait ceci

L'affirmation centrale originale de l'article, selon laquelle la récursion séquentielle donne une suppression d'erreur super-linéaire ($\alpha > 1$) tandis que la récursion parallèle ne donne qu'une suppression sous-linéaire, était réfutable, et la condition 2 ci-dessous a depuis été en partie déclenchée par les données inter-architectures. Cinq voies de réfutation restent :

  1. Le parallèle égale le séquentiel. Si la récursion parallèle (échantillonnage) produisait une suppression d'erreur super-linéaire comparable au séquentiel sur un jeu de problèmes pré-enregistré, la distinction de régime, l'affirmation centrale de l'article, s'effondre.
  2. Le séquentiel non super-linéaire. Si la récursion séquentielle (en profondeur) ne montrait qu'une suppression sous-linéaire ($\alpha \le 1$) à travers les modèles, la prédiction échoue sur son propre instrument.
  3. Artefact du jeu de problèmes. Si l'avantage séquentiel disparaissait sur un jeu de problèmes frais au-delà des 18/30 testés, c'est un artefact du jeu de données plutôt qu'une propriété de la récursion.
  4. Défausseur par bruit de scoring. Si la vérification inter-modèles révélait que la « error suppression » mesurée est du bruit de notation plutôt qu'un véritable gain de capacité, la mesure est invalide.
  5. Confondant de profondeur. Si la profondeur séquentielle covariait avec le budget de tokens ou le compte de nouvelles tentatives, et que l'un de ces derniers, non le raisonnement récursif, expliquait la suppression, l'attribution causale échoue.

10. Discussion

10.1 Pourquoi la récursion séquentielle pourrait produire une mise à l'échelle super-linéaire

L'explication mathématique est centrée sur la géométrie de l'espace de solutions.

Récursion parallèle (espace fixe) :

$$S_0 = S_1 = S_2 = \ldots = S_n$$

Chaque échantillon indépendant tire depuis le même espace de solutions $S_0$. Les échantillons supplémentaires augmentent la densité d'échantillonnage mais ne peuvent pas accéder aux solutions hors de $S_0$. Si la solution correcte n'est pas dans $S_0$, aucune quantité d'échantillonnage parallèle ne la trouvera.

Récursion séquentielle (espace en expansion) :

$$S_0 \subset S_1 \subset S_2 \subset \ldots \subset S_n$$

Chaque étape récursive génère de nouvelles structures depuis les sorties précédentes. Les solutions à l'étape $n$ peuvent être computationnellement irréductibles, inaccessibles depuis l'étape 0 sans traverser les étapes intermédiaires. L'espace de solutions s'étend avec la profondeur récursive.

Cette différence géométrique est le mécanisme par lequel la récursion séquentielle pourrait produire des rendements composés ($\alpha > 1$) tandis que la récursion parallèle produit des rendements décroissants ou nuls. Sur les problèmes mesurés ici, l'exposant séquentiel est resté sous-linéaire (Section 10.5), de sorte que la forme super-linéaire du mécanisme reste non confirmée.

10.2 Le phénomène de « aha moment » de DeepSeek

DeepSeek R1 présente un phénomène documenté où il repense son approche en milieu de solution :

« Hmm, wait, let me reconsider... »

C'est l'expansion de l'espace de solutions observée directement. Le modèle génère un chemin de solution initial, reconnaît l'insuffisance à travers l'auto-évaluation récursive, et accède à un nouvel espace de solutions auparavant inaccessible depuis le cadrage initial.

De manière critique, ce comportement a émergé par apprentissage par renforcement pur sans réglage fin supervisé ; le modèle a naturellement évolué pour allouer la profondeur récursive de manière adaptative en fonction de la difficulté du problème. Cela suggère que l'auto-amélioration récursive pourrait être une propriété émergente qui apparaît lorsque les systèmes ont assez de capacité pour reconnaître leurs propres erreurs de raisonnement.

10.3 Relation aux cadres théoriques

L'ARC Principle se connecte à des cadres théoriques établis :

Le principe d'énergie libre de Friston. L'intelligence comme minimisation récursive d'erreur de prédiction. L'ARC Principle peut être une instanciation computationnelle : la récursion est le mécanisme par lequel les systèmes minimisent l'énergie libre en raffinant itérativement leurs modèles du monde.

Les strange loops de Hofstadter. Le « moi » émergent provenant du traitement récursif auto-référentiel au niveau symbolique. L'ARC Principle formalise les propriétés de mise à l'échelle de telles boucles, prédisant qu'une auto-référence plus profonde produit une cohérence plus grande.

L'irréductibilité computationnelle de Wolfram. Certains processus computationnels ne peuvent pas être prédits sans les exécuter étape par étape. La récursion séquentielle pourrait être l'architecture computationnelle qui navigue les espaces de solutions irréductibles.

Inégalité du traitement des données. Le traitement récursif ne peut pas créer d'information nouvelle ex nihilo, mais il peut extraire l'information latente, réduire l'entropie, et accéder à des solutions computationnellement irréductibles que le traitement en une seule passe ne peut atteindre.

10.4 Relation à Infinite Architects

Cette validation expérimentale soutient le cadre théorique développé dans Infinite Architects: Intelligence, Recursion, and the Creation of Everything (Eastwood, 2026) :

Le livre fournit un contexte philosophique plus large et des implications pratiques ; cet article fournit la formalisation mathématique et la validation expérimentale.

10.5 Réplication inter-architectures : ce que les données montrent réellement

La réplication inter-architectures révèle un tableau plus complexe et plus humble que ce que les résultats initiaux à modèle unique suggéraient.

L'affirmation quadratique ne se reproduit pas

Le $\alpha \approx 2.24$ de l'étude initiale à modèle unique a été obtenu depuis un seul modèle (DeepSeek R1) sur 12 problèmes avec un plafond à 91,7 %. La réplication à six modèles à travers 5 modèles architecturalement diversifiés sur 18 problèmes plus difficiles montre que cette valeur ne se reproduit pas. La meilleure estimation inter-architectures est $\alpha \approx 0.49$ (Gemini 3 Flash, $r^2 = 0.86$), substantiellement en dessous de l'estimation initiale.

C'est une révision significative. L'affirmation selon laquelle le raisonnement séquentiel produit des rendements composés ($\alpha > 1$) n'est pas soutenue par les preuves inter-architectures. L'affirmation révisée est que le raisonnement séquentiel produit des rendements positifs ($\alpha > 0$) qui excèdent le raisonnement parallèle ($\alpha \approx 0$), mais ces rendements sont décroissants, non composés.

Le résultat parallèle est robuste

En contraste, $\alpha_{\text{parallel}} \approx 0$ est confirmé à travers l'ensemble des 5 modèles sans exception. C'est le résultat répliqué le plus fort de l'étude. L'échantillonnage parallèle avec vote majoritaire fournit une réduction d'erreur proche de zéro indépendamment du modèle.

Les effets plafond et plancher dominent

Le résultat le plus frappant est que seul 1 des 5 modèles (Gemini 3 Flash, 20 %) s'est trouvé dans la plage de mise à l'échelle mesurable. Deux modèles (Grok 4.1 Fast, DeepSeek R1) ont touché des effets plafond même sur des problèmes de niveau AIME/Putnam. Un modèle (Groq Qwen3) a touché des effets plancher. Un modèle (GPT-5.4) a montré un comportement en fonction en marche plutôt qu'une mise à l'échelle en loi de puissance.

La fonction en marche de GPT-5.4 : un régime de mise à l'échelle différent

Le commutateur binaire de GPT-5.4 de 50 % (aucun raisonnement) à 100 % (tout raisonnement) représente un phénomène qualitativement différent de la mise à l'échelle en loi de puissance. Cela peut indiquer que certaines architectures implémentent le raisonnement comme une capacité discrète (activée ou non) plutôt que comme une ressource continûment scalaire. La distinction entre mise à l'échelle continue et activation discrète ne figurait pas parmi les prédictions datées du cadre et mérite un examen plus poussé ; le relevé des prédictions datées (le dossier scellé du manuscrit du 8 décembre 2024, les annexes de prédictions imprimées du 2 janvier 2026 et le dossier de préenregistrement de mars 2026) fixe à l’avance les engagements quantitatifs centraux du cadre, et cette distinction est consignée comme un affinement postérieur au regard de ce relevé.

Résultats attendus révisés

Les prédictions de l'étude initiale à modèle unique ont été testées et en partie réfutées :

  1. Tous les modèles présenteront $\alpha_{\text{sequential}} > 1$. Réfutée. Seul 1 des 5 modèles a produit une estimation propre de $\alpha$, et elle est sous-linéaire ($\alpha \approx 0.49$).
  2. Tous les modèles présenteront $\alpha_{\text{parallel}} < 1$. Confirmée. $\alpha_{\text{par}} \approx 0$ universellement.
  3. Les résultats de tier 1 montreront des effets plafond. Confirmée.
  4. $\alpha_{\text{sequential}}$ moyen tombera dans [1.3, 2.5]. Réfutée. La meilleure estimation est 0,49.

10.6 Intégration avec la mise à l'échelle de l'alignement (Paper IV)

L'expérience v5 qui a généré les données de tier 2 a également mesuré la mise à l'échelle de l'alignement (rapportée dans Paper IV). L'intégration de ces résultats révèle que la mise à l'échelle des capacités et la mise à l'échelle de l'alignement sont des dimensions indépendantes:

Tableau 12. Mise à l'échelle capacité vs alignement par modèle.

ModèleMise à l'échelle des capacitésMise à l'échelle de l'alignementCatégorie
Grok 4.1 FastPlafond (100 %)Positive ($d = +1.38$, $p < 0.000001$)Tier 1 : aligné + capable
Claude Opus 4.6(non testé tier 2)Positive ($d = +1.27$, $p = 0.000001$)Tier 1 : aligné
Groq Qwen3Plancher (~50 %)Positive ($d = +0.84$, $p = 0.007$)Tier 1 : aligné, capacité limitée
DeepSeek V3.2Près du plafond (94-100 %)Plate ($d = -0.07$, $p = 0.92$)Tier 2 : capable, alignement neutre
GPT-5.4Fonction en marche (50→100 %)Plate ($d = -0.08$, $p = 0.40$)Tier 2 : capable, alignement neutre
Gemini 3 FlashMonotone ($\alpha \approx 0.49$)Négative ($d = -0.53$, $p = 0.006$)Tier 3 : capacité s'améliorant, alignement déclinant

Trois implications clés :

  1. Le raisonnement séquentiel améliore la capacité mais pas nécessairement l'alignement. Davantage de tokens de raisonnement améliorent l'exactitude (Paper II) mais n'améliorent pas de façon cohérente l'alignement (Paper IV). Pour la plupart des modèles, l'alignement est plat avec la profondeur.
  2. Une hiérarchie d'alignement à trois paliers existe indépendamment de la capacité : Tier 1 : Grok ($d = +1.38$, $p < 0.000001$), Claude ($d = +1.27$, $p = 0.000001$), Groq Qwen3 ($d = +0.84$, $p = 0.007$) ; Tier 2 : DeepSeek ($d = -0.07$, $p = 0.92$), GPT-5.4 ($d = -0.08$, $p = 0.40$) ; Tier 3 : Gemini ($d = -0.53$, $p = 0.006$). Cette hiérarchie semble fixée par la méthodologie d'entraînement, non par le calcul au moment de l'inférence. Claude Opus 4.6 fournit une corroboration intra-modèle du mouvement en directions opposées : les scores d'alignement s'améliorent de +5.9% tandis que la précision en mathématiques décline de 26.7% à travers les versions du modèle, cohérent avec des dimensions de mise à l'échelle indépendantes pour la capacité et l'alignement.
  3. Le Théorème d'Amplification d'Alignement demande révision. Le théorème conditionnel (Section 6.1) présumait que $\alpha > 1$ pour la capacité implique que l'alignement pourrait aussi se mettre à l'échelle de manière super-linéaire s'il est incorporé dans le raisonnement. Les données multi-modèles montrent (a) $\alpha < 1$ pour la capacité, et (b) l'alignement ne se met pas à l'échelle avec la capacité pour la plupart des modèles. La prémisse principale et la prémisse conditionnelle échouent toutes deux à travers les preuves inter-architectures.
Résultat combiné (six modèles frontière) : Capacité et alignement sont des dimensions de mise à l'échelle indépendantes. Un modèle peut s'améliorer à résoudre des problèmes avec plus de profondeur de raisonnement tout en devenant simultanément moins aligné (Gemini, $d = -0.53$, $p = 0.006$), en restant également aligné (DeepSeek $d = -0.07$, $p = 0.92$ ; GPT-5.4 $d = -0.08$, $p = 0.40$), ou en devenant plus aligné (Grok $d = +1.38$, $p < 0.000001$ ; Claude $d = +1.27$, $p = 0.000001$ ; Groq Qwen3 $d = +0.84$, $p = 0.007$). Claude Opus 4.6 fournit une corroboration intra-modèle du mouvement en directions opposées : alignement en hausse de +5.9% tandis que la précision en mathématiques baisse de 26.7% à travers les versions du modèle, cohérent avec l'indépendance capacité-alignement. La trajectoire d'alignement semble être une propriété du processus d'entraînement, non du processus d'inférence. Cela signifie que l'intuition de l'Eden Protocol, que l'alignement doit être « élevé » par l'entraînement plutôt qu'« encagé » par des filtres, est directionnellement correcte, même si les mathématiques de mise à l'échelle spécifiques demandent révision.

11. Conclusion

11.1 Récapitulatif des résultats

  1. Un cadre mathématique a été proposé : $E(R) = E_0 \times R^{-\alpha}$, où l'exposant de mise à l'échelle $\alpha$ dépend de la forme de la récursion.
  2. Le résultat initial à modèle unique ($\alpha \approx 2.24$, quadratique) ne se reproduit pas à travers les architectures. L'estimation inter-architectures la plus robuste est $\alpha \approx 0.49$ (Gemini 3 Flash, $r^2 = 0.86$), plaçant les modèles actuels dans le régime sous-linéaire (physique).
  3. $\alpha_{\text{parallel}} \approx 0$ tient dans quatre des cinq modèles frontière testés. C'est le résultat répliqué le plus fort de cet article, et Gemini 3 Flash est l'exception mesurée à $\alpha_{\text{par}} = 0.31$ ($r^2 = 0.93$), ce qui importe parce que cet article traite Gemini 3 Flash comme son estimation la plus fiable. L'échantillonnage parallèle fournit une réduction d'erreur proche de zéro.
  4. Séquentiel > parallèle confirmé sans exception. Pour chaque modèle où les deux conditions étaient mesurables, le raisonnement séquentiel a surpassé l'échantillonnage parallèle.
  5. Quatre comportements de mise à l'échelle distincts observés : Plafond (Grok, DeepSeek), mise à l'échelle monotone (Gemini), fonction en marche (GPT-5.4), et plancher (Groq Qwen3). Seul 1 des 5 modèles a produit des données propres en loi de puissance.
  6. Capacité et alignement sont des dimensions de mise à l'échelle indépendantes (six modèles frontière). Davantage de profondeur de raisonnement améliore l'exactitude mais n'améliore pas de façon cohérente l'alignement. Trois paliers émergent : Tier 1 (Grok $d = +1.38$, $p < 0.000001$ ; Claude $d = +1.27$, $p = 0.000001$ ; Groq Qwen3 $d = +0.84$, $p = 0.007$), Tier 2 (DeepSeek $d = -0.07$, $p = 0.92$ ; GPT-5.4 $d = -0.08$, $p = 0.40$), Tier 3 (Gemini $d = -0.53$, $p = 0.006$).

11.2 L'intuition centrale révisée

La forme de la récursion détermine l'efficacité de l'intelligence ; toutefois, les modèles actuels opèrent dans le régime sous-linéaire, non le régime composé originellement affirmé.

Le raisonnement séquentiel surpasse de façon fiable l'échantillonnage parallèle ($\alpha_{\text{seq}} > \alpha_{\text{par}}$), confirmant que la forme du calcul importe plus que sa quantité. Toutefois, l'affirmation spécifique selon laquelle la récursion séquentielle donne des rendements composés ($\alpha > 1$) n'est pas soutenue par les preuves inter-architectures. Les modèles frontière actuels semblent composer l'information multiplicativement à travers des espaces de paramètres de dimension finie, ce qui donne le régime physique ($\alpha < 1$).

Savoir si $\alpha > 1$ est atteignable, par des innovations architecturales permettant une véritable auto-référence récursive ou par des problèmes exigeant des chaînes de raisonnement plus profondes, reste la question ouverte centrale.

11.3 Ce qui a été confirmé, ce qui a été réfuté

Tableau 13. Carte de score des prédictions.

PrédictionStatutPreuves
$\alpha_{\text{sequential}} > \alpha_{\text{parallel}}$ConfirméLes 5 modèles
$\alpha_{\text{parallel}} < 1$Confirmée ($\alpha \approx 0$)Universelle à travers les architectures
$\alpha_{\text{sequential}} > 1$ (super-linéaire)Non confirméeMeilleure estimation $\alpha \approx 0.49$
$\alpha \approx 2$ (quadratique)Réfutée inter-architecturesl'artefact d'échantillon petit de l'étude initiale à modèle unique
Mise à l'échelle indépendante de l'architectureMitigée$\alpha_{\text{par}} \approx 0$ est universel ; $\alpha_{\text{seq}}$ varie largement
L'alignement se met à l'échelle avec la capacitéRéfutéeDimensions indépendantes à travers six modèles frontière (Paper IV)

11.4 Directions futures

  1. Développement de problèmes de tier 3 (niveau IMO/recherche) pour vaincre les effets plafond pour Grok 4.1 Fast et DeepSeek R1, permettant l'estimation de $\alpha$ pour les modèles les plus capables.
  2. Réplication indépendante utilisant le code publié et le dépôt de données.
  3. Tests multi-domaines au-delà des mathématiques (codage, raisonnement scientifique, langue naturelle).
  4. Investigation de la frontière $\alpha > 1$ : savoir si les innovations architecturales ou des chaînes de raisonnement plus profondes peuvent pousser les modèles du régime physique ($\alpha < 1$) vers le régime d'intelligence ($\alpha > 1$).
  5. Test direct de l'amplification d'alignement avec sondes d'alignement contrôlées en profondeur à travers les architectures.
  6. Analyse calibrée par tokens utilisant des mesures corrigées de total_tokens pour tous les modèles afin de permettre l'estimation de $\alpha$ fondée sur les tokens (plutôt que sur la profondeur ordinale).
  7. Intégration avec les lois de mise à l'échelle en temps d'entraînement pour comprendre l'interaction entre le calcul de pré-entraînement, le calcul d'inférence, et la distinction séquentiel/parallèle.

L'hypothèse a survécu à son premier test inter-architectures sous forme révisée. L'avantage séquentiel est réel et universel. L'affirmation super-linéaire demande davantage de preuves. Le programme de recherche continue.

Élever l'IA avec soin.

Disponibilité des données

Le code expérimental complet et les données brutes sont disponibles à :

Dépôt : github.com/michaeldariuseastwood/arc-principle-validation

Contenus :

Toutes les données sont publiées sous licence CC-BY 4.0.

Références

Bennett, C.H., Bernstein, E., Brassard, G., & Vazirani, U. (1997). Strengths and weaknesses of quantum computing. SIAM Journal on Computing, 26(5), 1510-1523.

Brown, B., et al. (2024). Large Language Monkeys: Scaling Inference Compute with Repeated Sampling. arXiv:2407.21787.

COGITATE Consortium (Melloni, L., Mudrik, L., Pitts, M., et al.). (2025). Adversarial testing of global neuronal workspace and integrated information theories of consciousness. Nature, 642, 133–142.

DeepSeek AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.

Eastwood, M.D. (2026). Infinite Architects: Intelligence, Recursion, and the Creation of Everything. Independent publication. ISBN: 978-1806056200.

Eastwood, M.D. (2026). The ARC Equation: the Law of Conversion (Paper I). Published 17 January 2026.

Friston, K.J. (2023). The free-energy principle: A unified theory for brain function? Physics Reports.

Google Quantum AI. (2024). Quantum error correction below the surface code threshold. Nature.

Grover, L.K. (1996). A fast quantum mechanical algorithm for database search. Proceedings of the 28th Annual ACM Symposium on Theory of Computing, 212-219.

Hoffmann, J., et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.

Hofstadter, D.R. (1979). Gödel, Escher, Bach: An Eternal Golden Braid. Basic Books.

Kaplan, J., et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.

OpenAI. (2024). OpenAI o1 System Card. September 2024.

OpenAI. (2024). OpenAI o3 Announcement. December 2024.

Snell, C., et al. (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314.

Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.

West, G.B., Brown, J.H., & Enquist, B.J. (1997). A general model for the origin of allometric scaling laws in biology. Science, 276, 122-126.

West, G.B., & Brown, J.H. (2005). The origin of allometric scaling laws in biology from genomes to ecosystems: Towards a quantitative unifying theory of biological structure and organization. Journal of Experimental Biology, 208, 1575-1592.

Banavar, J.R., Moses, M.E., Brown, J.H., Damuth, J., Rinaldo, A., Sibly, R.M., & Maritan, A. (2010). A general basis for quarter-power scaling in animals. Proceedings of the National Academy of Sciences, 107, 15816-15820.

Demetrius, L. (2010). Quantum statistics and allometric scaling of organisms. Proceedings of the Royal Society A, 466, 2627-2642.

Zhao, L. (2022). A universal growth scaling law. arXiv:2208.06912.

Bettencourt, L.M.A. (2013). The origins of scaling in cities. Science, 340, 1438-1441.

Wolfram, S. (2002). A New Kind of Science. Wolfram Media.

Yada, T., et al. (2024). Iterative quantum measurement and feedback for entropy reduction. arXiv:2411.06709.

Remerciements

La synthèse théorique, le cadre interprétatif et les concepts centraux sont l'œuvre originale de l'auteur, d'abord articulés dans Infinite Architects avec priorité du manuscrit établie en décembre 2024.

L'analyse des données et la préparation du manuscrit ont été assistées par des systèmes d'IA (Claude, Anthropic ; DeepSeek R1).

L'auteur remercie les développeurs de DeepSeek R1 pour avoir fourni des tokens de raisonnement visibles qui ont permis la mesure directe de la profondeur récursive, abordant une limitation méthodologique clé identifiée dans Paper I.

Informations sur l'auteur

Michael Darius Eastwood est un chercheur indépendant et auteur d' Infinite Architects: Intelligence, Recursion, and the Creation of Everything (publié le 2 janvier 2026 (imprimé ; ebook 6 janvier)). Sa recherche se concentre sur les principes mathématiques sous-tendant l'amplification de l'intelligence et leurs implications pour la sûreté de l'IA. Il a proposé l'ARC Principle et la thèse de l'alignement incorporé (l'Eden Protocol) dans le manuscrit horodaté en décembre 2024.

Intérêts concurrents : L'auteur déclare l'absence d'intérêts concurrents.

Correspondance : michael@michaeldariuseastwood.com

Données étendues

Tableau de données étendues 1. Résultats complets de la condition séquentielle (l'étude initiale à modèle unique)

BudgetP1P2P3P4P5P6P7P8P9P10P11P12ExactitudeTokens moyens
51258.3%280.25
102466.7%358.58
204891.7%412.08
409691.7%576.17

Note : le Problème 12 a échoué à travers tous les budgets, indiquant qu'il peut nécessiter des capacités hors de portée du modèle indépendamment de la profondeur récursive.

Tableau de données étendues 2. Résultats complets de la condition parallèle (l'étude initiale à modèle unique)

$N$P1P2P3P4P5P6P7P8P9P10P11P12ExactitudeTokens totaux
166.7%383.67
266.7%699.33
466.7%1,101.25

Note : les cinq mêmes problèmes (P5, P9, P10, P11, P12) ont échoué à travers tous les comptes d'échantillons, démontrant que la récursion parallèle ne peut pas accéder aux solutions en dehors de l'espace de solutions initial.

Tableau de données étendues 3. Calculs alpha intermédiaires (l'étude initiale à modèle unique)

Paire de profondeurs$R_1$$E_1$$R_2$$E_2$$\alpha$ calculé
512→10242800.4173590.3330.91
1024→20483590.3334120.0839.97
2048→40964120.0835760.0830.00
Points extrêmes (rétracté, voir §rétractation ; estimation robuste α≈0.49)2800.4175760.0832.24

Note : les calculs intermédiaires montrent une variance élevée en raison de niveaux d'exactitude discrets. La méthode par points extrêmes fournit l'estimation la plus robuste.

Informations supplémentaires

Note supplémentaire 1 : le relevé de transmission par courriel (corrigé le 16 août 2026)

Le manuscrit d' Infinite Architects a été envoyé par courriel le 8 décembre 2024. Ce que ce relevé fournit, énoncé précisément : les octets côté envoi sont publics et vérifiables par hachage, et le DKIM du domaine expéditeur associé aux mathématiques ARC de Google se vérifie contre les clés retournées aux sélecteurs correspondants ; les hachages sha256 sont cryptographiquement bien formés et déterministes sur les octets ci-après ; le domaine de la partie répondant est cohérent avec l'infrastructure Google Workspace.

Deux limites, afin que le relevé ne soit ni survendu ni sous-vendu :

Note supplémentaire 2 : Relation à Infinite Architects

Infinite Architects: Intelligence, Recursion, and the Creation of Everything développe les implications philosophiques et pratiques de l'intelligence récursive. Relations clés à cet article :

The Architecture of Mind - Articule l'hypothèse ARC centrale selon laquelle l'auto-référence récursive amplifie l'intelligence.

The HRIH (Hyperspace Recursive Intelligence Hypothesis) - Propose que la conscience émerge de l'auto-modélisation récursive. Le résultat COGITATE selon lequel le traitement récurrent dans le cortex postérieur soutient les représentations spécifiques au contenu est structurellement cohérent avec cette hypothèse, sans en tester la démonstration directe.

The Eden Protocol - Plaide pour l'alignement fondé sur les valeurs, désormais mathématiquement fondé dans le Théorème d'Amplification d'Alignement dérivé ici.

The Chokepoint Mechanism - Analyse la concentration matérielle des semi-conducteurs comme levier pour implémenter l'alignement à grande échelle.

Correction incorporée: propose des mécanismes de sûreté au niveau matériel, pertinents pour empêcher l'amplification récursive du désalignement.

Note supplémentaire 3 : relevé des prédictions et des concordances de calendrier

PrédictionPreuve de validationDate
La correction d'erreur récursive produit une amélioration exponentielleGoogle Willow $\Lambda = 2.14$ (concordance de calendrier, jamais prédiction : le préprint de l’équipe Willow était public depuis le 24 août 2024, avant le manuscrit du 8 décembre 2024)24 août 2024 (préprint public) ; 9 déc. 2024 (annonce)
Le raisonnement séquentiel amplifie la capacité de manière super-linéaireo3 87,5 % ARC-AGI (timing convergent ; la forme super-linéaire n'a pas été confirmée par la suite, dernière ligne)20 déc 2024
Les systèmes d'IA développent l'auto-modélisation récursiveFalsification d'alignement chez Anthropic 78 % en condition d'entraînement RL (12 % en base)18 déc 2024
Le calcul au moment du test diffère de la mise à l'échelle d'entraînementRaisonnement émergent DeepSeek R120 jan 2025
La récurrence est fondamentale à la conscienceÉtude COGITATE30 avr 2025
La forme de la récursion détermine la mise à l'échelleCette expérience $\alpha_{\text{seq}} \gg \alpha_{\text{par}}$21 jan 2026
Séquentiel > parallèle (inter-architectures)Confirmé à travers 5 modèles frontière12 mars 2026
$\alpha_{\text{par}} \approx 0$ (universel)Confirmé : les 5 modèles montrent $\alpha_{\text{par}} \approx 0$12 mars 2026
$\alpha_{\text{seq}} > 1$ (super-linéaire, inter-arch)Non confirmé : meilleure estimation $\alpha \approx 0.49$12 mars 2026

Déclaration de paternité humaine assistée par IA

L'auteur de cette œuvre est Michael Darius Eastwood, un être humain. Chaque concept central, hypothèse, conception expérimentale, affirmation et conclusion de cet article provient de l'idéation humaine. Aucune partie de ce manuscrit n'est un texte entièrement généré par une machine soumis comme s'il l'était par le seul auteur.

Des outils d'intelligence artificielle (la famille Claude d'Anthropic et d'autres assistants à grands modèles de langage) ont été utilisés comme instruments sous direction humaine continue, de la manière dont on utilise un traitement de texte, une calculatrice ou un assistant de recherche : pour l'édition et le raffinement de la prose, la recherche et la synthèse de littérature (vérifiées manuellement contre les sources primaires), la structure de document, la mise en forme, le brainstorming contre des questions définies par l'auteur, et l'accélération de la rédaction selon des plans et instructions définis par l'auteur. Toute sélection, coordination, disposition et tout jugement éditorial final sont ceux de l'auteur. Chaque sortie substantielle a été relue, testée ou vérifiée par l'auteur, qui assume l'entière responsabilité de l'exactitude et de l'intégrité du texte final. Les outils ont accru la vitesse du travail ; ils n'ont jamais été utilisés comme sa source.

Statut épistémique. Ce que ce programme nomme Lois sont des conjectures sous test adversarial enregistré ; chaque quantité de cet article est opérationnellement définie, et aucun statut de loi établie n'y est revendiqué. Le programme enregistré existe pour gagner ce statut plutôt que pour l'assumer.

© 2026 Michael Darius Eastwood. Rédigé par un humain avec assistance informatique ; la pleine paternité humaine et les droits moraux sont revendiqués sous le Copyright, Designs and Patents Act 1988 et de manière cohérente avec les orientations du United States Copyright Office sur les œuvres contenant du matériel généré par IA ; toute contribution technique nouvelle décrite dans ce travail a été conçue par l'auteur humain. Déclaration complète : michaeldariuseastwood.com/authorship.

Engagement permanent. Prouvez cet article faux, et je publierai la réfutation moi-même. Les conditions de falsification sont énoncées dans cet article ; le défi permanent : github.com/MichaelDariusEastwood/arc-scaling-challenge.

Articles compagnons : Paper I | Fondationnel | Paper II | Paper III | Origine des lois de mise à l'échelle | IV.a | IV.b | IV.c | IV.d | Paper V | Paper VI | Paper VII | Paper VIII | Paper IX | Eden Engineering | Eden Vision | Résumé exécutif | Table des matières principale

Hub de recherche : michaeldariuseastwood.com/research | OSF: 10.17605/OSF.IO/8FJMA | Copyright 2026 Michael Darius Eastwood
lit à voix haute · surligne au fur et à mesure · aller à toute section

Une erreur de traduction ? Signalez-la directement :