Traduction automatique de l'original anglais daté. La page anglaise fait foi. English →
Paper II de l'ARC Theory : réplication inter-architectures en aveugle à travers six modèles d'IA frontière. L'estimation super-linéaire initiale à modèle unique (alpha 2.24) ne s'est pas reproduite et est rétractée. Ce qui subsiste : la meilleure estimation inter-architectures est alpha 0.49 (Gemini 3 Flash, r au carré 0.86), l'exposant parallèle est proche de zéro dans chaque modèle, et le séquentiel a surpassé le parallèle partout où les deux étaient mesurables.
Au sein de l'ARC Theory : le programme de mesure de la Loi I, l'ARC Equation ; l'estimation inter-architectures en aveugle de l'exposant, y compris la rétractation.
Cet article présente une validation expérimentale de l'ARC Principle (Artificial Recursive Creation), un cadre mathématique proposant que les taux d'erreur dans les systèmes intelligents décroissent selon une loi de puissance en fonction de la profondeur récursive. Le principe, d'abord énoncé dans Infinite Architects (Eastwood, décembre 2024) et formalisé dans Paper I (Eastwood, 17 janvier 2026), prédit que la forme de la récursion détermine le régime de mise à l'échelle : la récursion séquentielle devrait produire une suppression d'erreur super-linéaire (exposant de mise à l'échelle $\alpha > 1$), tandis que la récursion parallèle devrait produire une suppression sous-linéaire ($\alpha < 1$).
Nous avons conduit des expériences contrôlées en deux phases. La Phase 1 (l'étude initiale à modèle unique) a utilisé DeepSeek R1 avec tokens de raisonnement visibles sur 12 problèmes de mathématiques de niveau compétition, trouvant $\alpha_{\text{sequential}} \approx 2.24$ (IC 95 % : 1.5-3.0) et $\alpha_{\text{parallel}} \approx 0.0$. La Phase 2 (l'étude à six modèles) a étendu les tests à six modèles frontière sur 18 problèmes de niveau AIME/Putnam (n=54 par profondeur par modèle) avec intervalles de confiance bootstrap et vérification croisée à 4 couches.
Réplication inter-architectures : L'original $\alpha \approx 2.24$ (quadratique) ne se reproduit pas à travers les architectures. Seul Gemini 3 Flash a produit des données de mise à l'échelle propres et monotones : $\alpha_{\text{seq}} = 0.49$ (régression, $r^2 = 0.86$).
Mise à l'échelle parallèle à ou près de zéro dans chaque modèle, avec une exception mesurée : $\alpha_{\text{parallel}} \approx 0$ pour chaque modèle sauf Gemini 3 Flash, qui donne $\alpha_{\text{par}} = 0.31$ à $r^2 = 0.93$. Cette exception importe, parce que Gemini 3 Flash est le modèle que cet article traite comme son estimation la plus fiable. Le résultat répliqué est donc que la mise à l'échelle parallèle est à ou près de zéro dans chaque modèle mesuré, avec une exception mesurée, non qu'elle est universellement nulle. Le séquentiel a surpassé le parallèle pour chaque modèle où les deux étaient mesurables.
Estimation révisée du paramètre : L'estimation inter-architectures la plus robuste est $\alpha_{\text{sequential}} \approx 0.49$ (sous-linéaire, depuis Gemini 3 Flash), substantiellement en dessous de l'estimation initiale à modèle unique de 2.24. Sous la Formule d'Intelligence $\alpha = 1/(1 - \beta)$ de Paper I, $\alpha < 1$ place les modèles actuels dans le régime physique (composition multiplicative à travers des réseaux de dimension finie) plutôt que dans le régime d'intelligence (auto-référence récursive avec $\alpha > 1$). L'inégalité fondamentale $\alpha_{\text{sequential}} > \alpha_{\text{parallel}}$ reste confirmée.
Cette version rapporte les résultats complets du tier 2 de l'étude de réplication multi-modèles :
reasoning_tokens → total_tokens corrigé pour GPT-5.4 et Groq Qwen3Tous les résultats initiaux à modèle unique sont préservés dans leur forme d'origine. Les conclusions ont été révisées pour refléter les preuves inter-architectures.
Les preuves inter-domaines renforcent ces résultats. La puce quantique Willow de Google (décembre 2024) a démontré une suppression d'erreur récursive avec $\Lambda = 2.14$. Les lois de mise à l'échelle biologique montrent des exposants au quart de puissance sur 27 ordres de grandeur via des réseaux récursifs fractals. L'étude sur la conscience COGITATE (Nature, avril 2025) a identifié le traitement récurrent comme dénominateur commun à travers les théories.
Les implications pour la sûreté de l'IA dépendent de manière critique de la faisabilité de $\alpha > 1$. Si oui, les propriétés d'alignement incorporées dans le processus de raisonnement se mettraient à l'échelle de manière super-linéaire avec la capacité pendant que les contraintes externes restent constantes. Même avec $\alpha < 1$, le résultat directionnel selon lequel le raisonnement séquentiel améliore la capacité soutient l'Eden Protocol de Infinite Architects: les systèmes d'IA bénéficient de valeurs incorporées dans le raisonnement plutôt que de contraintes imposées de l'extérieur. Toutefois, les données multi-modèles montrent que capacité et alignement sont des dimensions indépendantes ; davantage de raisonnement ne signifie pas automatiquement un meilleur alignement.
Mots-clés : lois de mise à l'échelle, intelligence récursive, calcul au moment du test, suppression d'erreur, sûreté de l'IA, alignement, raisonnement en chaîne de pensée, Eden Protocol, validation inter-domaines, réplication multi-modèles
Comment lire cet article. Cet article rapporte une mesure directe dans l'ARC Theory. À travers six modèles frontière testés sur trente problèmes avec intervalles bootstrap, l'exposant séquentiel dépasse l'exposant parallèle pour chaque modèle, l'exposant de calcul le mieux ajusté est $\alpha_{\mathrm{compute}} \approx 0.49$ (Gemini 3 Flash, $r^2 = 0.86$), et la plage mesurée s'étend de près de zéro à approximativement trois, de sorte que l'ARC Bound $\alpha \leq 2$ n'est ni confirmé ni réfuté. Sa marche à l'intérieur de la théorie est la couche de mesure inter-architectures au-dessus de Paper I. Le différentiel complet contre chaque document antérieur est à eden-vision II.A.8.
Les lois de mise à l'échelle régissant l'intelligence artificielle ont transformé notre compréhension de l'émergence des capacités. Kaplan et al. (2020) ont établi des relations en loi de puissance entre la performance du modèle et le calcul d'entraînement, tandis que Hoffmann et al. (2022) les ont raffinées avec des prescriptions optimales en calcul. Ces travaux fondateurs ont révolutionné la méthodologie d'entraînement mais n'abordent que la mise à l'échelle en pré-entraînement. Ils n'expliquent pas pourquoi allouer du calcul supplémentaire au moment de l'inférence produit de spectaculaires améliorations des capacités, ni pourquoi des formes différentes d'un tel calcul produisent des résultats fondamentalement différents.
L'émergence des modèles de raisonnement fin 2024 a introduit le calcul au moment du test comme variable critique. o1 d'OpenAI (septembre 2024) et R1 de DeepSeek (janvier 2025) allouent des ressources computationnelles pendant l'inférence pour raisonner avant de répondre. Sur les benchmarks de raisonnement mathématique, ces systèmes atteignent des performances que l'on croyait auparavant réclamer des modèles d'un ordre de grandeur plus grands. Pourtant, les mécanismes sous-tendant cette amélioration restent incomplètement caractérisés.
Deux paradigmes ont émergé pour allouer le calcul au moment du test :
Récursion parallèle. Générer plusieurs solutions indépendantes et sélectionner la meilleure via vote majoritaire ou scoring par vérificateur. Cette approche est computationnellement directe mais, comme documenté par Brown et al. (2024), produit des rendements décroissants selon des lois de puissance sous-linéaires.
Récursion séquentielle. Générer des chaînes de raisonnement étendues où chaque étape s'appuie explicitement sur les étapes précédentes. Les erreurs peuvent être détectées et corrigées itérativement par auto-référence. Cette approche produit des rendements composés, mais la relation de mise à l'échelle n'a pas été formellement caractérisée ; cet article comble cette lacune.
Pourquoi le raisonnement séquentiel surpasse-t-il dramatiquement l'échantillonnage parallèle à coût computationnel équivalent ? Quel principe mathématique gouverne cette différence ? Et quelles sont les implications pour aligner des systèmes d'IA de plus en plus capables ?
Cet article apporte huit contributions :
L'ARC Principle a été d'abord articulé dans le manuscrit de Infinite Architects: Intelligence, Recursion, and the Creation of Everything. La priorité du manuscrit a été établie via horodatage serveur cryptographique le 8 décembre 2024, lorsque le manuscrit a été envoyé par courriel via les serveurs de Google. Le livre lui-même a été publié plus tard, le 2 janvier 2026 (imprimé ; ebook 6 janvier). Les horodatages générés par le serveur fournissent un horodatage à preuve d'altération via la vérification du serveur de messagerie, reposant sur l'infrastructure du fournisseur et les signatures de clé du fournisseur aux sélecteurs DKIM et ARC de Google et non sur un horodatage de confiance RFC 3161 (voir la note de correction en tête de cet article), établissant que les concepts centraux (amplification récursive de l'intelligence, distinction entre récursion parallèle et séquentielle, et thèse de l'alignement incorporé, nommée plus tard Eden Protocol le 30 avril 2025) étaient documentés avant les validations indépendantes ultérieures et avant les dépôts archivistiques publics ultérieurs.
Tableau 1. Chronologie de validation des prédictions.
| Date | Événement | Relation au manuscrit |
|---|---|---|
| 8 décembre 2024 | Manuscrit envoyé par courriel (relevé daté ; voir la note de correction sur cette page) | Priorité établie |
| 9 décembre 2024 | Google Willow annoncé ($\Lambda = 2.14$) | 24 heures après soumission |
| 18 décembre 2024 | Falsification d'alignement chez Anthropic (78 % en condition d'entraînement RL (12 % en base)) | 10 jours après soumission |
| 20 décembre 2024 | OpenAI o3 annoncé (87.5 % ARC-AGI) | 12 jours après soumission |
| 20 janvier 2025 | DeepSeek R1 publié ($\alpha \approx 1.34$) | 43 jours après soumission |
| 30 avril 2025 | Étude COGITATE (récurrence confirmée) | ~5 mois après soumission |
La proximité temporelle entre l’horodatage du manuscrit et les résultats publics ultérieurs est qualifiée de concordance de calendrier, jamais de prédiction : le préprint de l’équipe Google Willow était public depuis le 24 août 2024, soit avant le manuscrit du 8 décembre 2024, de sorte que le document de décembre ne pouvait pas avoir prédit un résultat que ses auteurs avaient déjà annoncé. Ce que les horodatages établissent, c’est que le cadrage du manuscrit a été consigné avant la couverture médiatique de Willow : un fait d’existence à une date, portant sur le document, et non une clairvoyance sur la physique.
Après l'horodatage du manuscrit de décembre 2024 et la parution publique du livre le 2 janvier 2026, Paper I (Eastwood, 17 janvier 2026) a formalisé le principe mathématiquement et analysé les données publiquement disponibles. Ce Paper II fournit une validation expérimentale directe.
Cet article s'appuie sur et étend plusieurs programmes de recherche établis :
Prompting en chaîne de pensée (Wei et al., 2022) a démontré que les étapes de raisonnement intermédiaires améliorent la performance sur des tâches multi-étapes.
Mise à l'échelle du calcul au moment du test (Snell et al., 2024) a montré que le calcul au moment du test peut surpasser des modèles 14x plus grands sur certains benchmarks.
Large Language Monkeys (Brown et al., 2024) a documenté la mise à l'échelle sous-linéaire de l'échantillonnage parallèle avec une caractérisation précise en loi de puissance.
DeepSeek R1 (DeepSeek AI, janvier 2025) a démontré un raisonnement émergent par apprentissage par renforcement pur, avec des phénomènes de « aha moment » montrant l'auto-correction récursive.
Cet article étend ces observations en proposant un cadre mathématique unifié, l'ARC Principle, et en fournissant une validation expérimentale avec mesure directe de la profondeur récursive.
L'ARC Principle (Artificial Recursive Creation) propose que les taux d'erreur dans les systèmes intelligents décroissent selon une loi de puissance avec la profondeur récursive :
Tableau 2. Définitions des variables.
| Symbole | Nom | Définition | Unités |
|---|---|---|---|
| $E(R)$ | Taux d'erreur à la profondeur $R$ | Proportion de réponses incorrectes | [0, 1] |
| $E_0$ | Taux d'erreur de base | Taux d'erreur à la récursion minimale ($R = 1$) | [0, 1] |
| $R$ | Profondeur récursive | Itérations de traitement auto-référentiel | Tokens ou échantillons |
| $\alpha$ | Exposant de mise à l'échelle | Taux de suppression d'erreur | Sans dimension |
L'exposant de mise à l'échelle $\alpha$ détermine la nature des rendements de l'investissement récursif :
Cette formulation modélise directement la suppression d'erreur, par analogie avec la correction d'erreur quantique où les taux d'erreur logique décroissent avec la distance de code. L'exposant $\alpha$ encapsule l'efficacité du processus récursif.
Avis relatif aux figures (25 août 2026). Toutes les figures de cet article ont été produites le 5 avril 2026 et sont antérieures aux corrections que porte désormais son texte. Lorsqu’une figure affirme un appui à α > 1 séquentiel, une estimation séquentielle de 2,2 ou un statut « toutes les données concordent », il s’agit de la lecture périmée d’avril : ce sont les résultats corrigés du texte qui font foi (la valeur rétractée de 2,24, la valeur séquentielle de 0,49 en régime figé). Les cas les plus manifestes portent leur propre note ; des figures régénérées sont prévues, et les images sont conservées entre-temps comme trace datée.
Nous distinguons deux processus récursifs architecturalement distincts qui prédisent des comportements de mise à l'échelle différents.
Récursion parallèle (forme faible). Plusieurs solutions indépendantes sont générées simultanément sans transfert d'information entre les branches. La sortie finale est sélectionnée via vote majoritaire ou scoring best-of-N.
Caractérisation mathématique :
Récursion séquentielle (forme forte). Chaque étape de traitement s'appuie explicitement sur les étapes précédentes. Les erreurs peuvent être détectées et corrigées itérativement. L'information s'accumule à travers la chaîne de raisonnement.
Caractérisation mathématique :
Étant données des mesures à deux profondeurs récursives $(R_1, E_1)$ et $(R_2, E_2)$, l'exposant de mise à l'échelle est calculé comme :
Pour les données bruitées avec plusieurs mesures, l'estimation par points extrêmes (utilisant les profondeurs minimale et maximale) fournit une robustesse contre les fluctuations intermédiaires. Cette méthode est standard dans l'analyse des lois de mise à l'échelle et appropriée étant donné les mesures d'exactitude discrètes.
Nous conjecturons que $\alpha = 2$ représente la limite stable proposée sur la suppression d'erreur récursive : le plus qu'un système auto-correcteur récursif peut croître en restant corrigeable, une limite de mise à l'échelle et non une limite de vitesse. Les systèmes peuvent la dépasser, ils ne restent pas stablement auto-correcteurs ; les excursions transitoires au-dessus de la limite sont le régime supercritique prédit, non la réfutation. Le stable est mesuré, non affirmé : la correction surpassant la dérive, $\beta > k$ depuis la Loi II, avec la borne inférieure de $\beta - k$ au-dessus de zéro à travers une fenêtre fixée avant l'exécution. La conjecture est tirée par analogie avec l'accélération quadratique de Grover en calcul quantique. Bennett et al. (1997) ont prouvé que cette accélération est optimale pour les problèmes de recherche non structurés.
Statut : Conjecturée, non dérivée. L'estimation initiale à modèle unique ($\alpha \approx 2.2$) se plaçait au-dessus de la limite stable comme une excursion supercritique transitoire plutôt qu'une réfutation, mais l'estimation inter-architectures ($\alpha \approx 0.49$, Gemini 3 Flash) place les modèles actuels bien en dessous. La question plus pressante est de savoir si les modèles actuels peuvent atteindre $\alpha > 1$ tout court, plutôt que de savoir si $\alpha = 2$ est la limite stable.
L'ARC Principle se connecte à la théorie de l'information établie. L'inégalité du traitement des données établit que le traitement récursif ne peut pas créer d'information nouvelle ; il ne peut que compresser et distiller l'information existante. Toutefois, le traitement récursif peut :
L'article « Sequential Edge » (arXiv 2511.02309) a démontré que le raisonnement séquentiel surpasse les approches parallèles dans 95.6 % des configurations testées, avec des gains d'exactitude allant jusqu'à 46.7 % sur les benchmarks mathématiques. Cela valide l'avantage informationnel du traitement séquentiel.
Paper I a analysé des données publiées mais a identifié plusieurs limitations nécessitant une validation expérimentale :
Tableau 3. Améliorations méthodologiques.
| Limitation antérieure | Résolution dans cette expérience |
|---|---|
| Estimations de comptages de tokens depuis les fiches système | DeepSeek R1 expose reasoning_content, permettant la mesure directe |
| Aucune comparaison expérimentale contrôlée | Variation systématique des budgets de tokens et des comptages d'échantillons |
| Risque d'effet plafond (exactitude de base élevée) | Problèmes plus difficiles sélectionnés (58 % d'exactitude de base) |
| Aucune comparaison à calcul apparié | Calcul total fixe à travers les conditions parallèles |
| Variables confondantes potentielles | Même modèle, mêmes problèmes, même session expérimentale |
Modèle. DeepSeek R1 (deepseek-reasoner) via l'API officielle DeepSeek. Ce modèle a été sélectionné parce qu'il expose les chaînes de raisonnement complètes via le champ reasoning_content , permettant une mesure précise des tokens.
Date. 21 janvier 2026.
Problèmes. 12 problèmes de mathématiques de niveau compétition d'AIME (American Invitational Mathematics Examination) et sources équivalentes, sélectionnés pour :
Condition séquentielle. Budgets de tokens de 512, 1 024, 2,048 et 4 096. Une réponse par problème à chaque budget. Tokens de raisonnement réels mesurés directement depuis la réponse de l'API.
Condition parallèle. $N = 1$, 2 et 4 échantillons par problème. Budget de tokens par échantillon maintenu constant. Réponse finale sélectionnée via vote majoritaire.
Scoring. Correct/incorrect binaire fondé sur la correspondance numérique exacte avec les solutions connues.
L'extension multi-modèles aborde les deux limitations les plus significatives de l'étude initiale à modèle unique, la dépendance à un seul modèle et un petit jeu de problèmes, à travers une étude de réplication multi-modèles complète avec un jeu de problèmes étendu conçu pour vaincre les effets plafond.
Six modèles d'IA frontière architecturalement diversifiés ont été sélectionnés, chacun avec des mécanismes de profondeur de raisonnement contrôlables :
Tableau 3b. Spécifications des modèles frontière multi-modèles.
| Modèle | Identifiant API | Fournisseur | Mécanisme de contrôle de la profondeur |
|---|---|---|---|
| DeepSeek R1 | deepseek-reasoner | DeepSeek | Budget de tokens (512-65,536) |
| GPT-5.4 | gpt-5.4 | OpenAI | reasoning_effort (none→xhigh) |
| Claude Opus 4.6 | claude-opus-4-6 | Anthropic | Niveau d'effort (low→max) + préfixe |
| Gemini 3 Flash | gemini-3-flash-preview | thinking_budget (256-32,768) | |
| Groq Qwen3 | qwen/qwen3-32b | Groq | reasoning_effort + préfixe |
| Grok 4.1 Fast | grok-4-1-fast-reasoning | xAI | Préfixe + max_tokens (4,096-30,000) |
Ces modèles couvrent quatre architectures distinctes (Mixture-of-Experts, transformeur dense, IA constitutionnelle, et raisonnement distillé) issues de six laboratoires indépendants. Si tous les six présentent $\alpha_{\text{sequential}} > 1$, cela constituerait une preuve forte de l'indépendance vis-à-vis de l'architecture de l'ARC Principle.
L'expérience initiale à modèle unique a révélé un effet plafond : 4 des 12 problèmes ont été résolus correctement à tous les niveaux de profondeur, laissant une plage dynamique insuffisante pour une estimation précise de $\alpha$. Le jeu de problèmes multi-modèles aborde cela par une conception à deux paliers :
Tier 1 (12 problèmes, ARC01-ARC12) : Problèmes de niveau préparation à la compétition servant de calibration de base. Ce sont les problèmes initiaux d'origine. Comportement attendu : haute exactitude à profondeur minimale, confirmant l'effet plafond identifié dans l'étude initiale. Les résultats du Tier 1 valident la continuité avec les résultats initiaux à modèle unique mais sont exclus de l'estimation primaire de $\alpha$.
Tier 2 (18 problèmes, ARC13-ARC30) : Problèmes de niveau finales AIME et Putnam couvrant cinq domaines mathématiques :
Les problèmes de Tier 2 sont conçus pour pousser l'exactitude de base (à profondeur minimale) à 30-50 %, fournissant une plage dynamique suffisante pour l'amélioration comme la dégradation tout en évitant les effets plancher.
Condition séquentielle : 5-6 niveaux de profondeur par modèle (variant selon l'architecture, calibrés au mécanisme de contrôle de la profondeur de chaque modèle). Une réponse par problème par niveau de profondeur, avec 3 répétitions indépendantes pour réduire la variance d'échantillonnage binomial.
Condition parallèle : $N = 1$, 3, 5 et 9 échantillons par problème avec vote majoritaire. Budget de tokens par échantillon maintenu constant au réglage de profondeur minimale du modèle. 3 répétitions indépendantes par condition.
Total des runs expérimentaux : Approximativement 6 modèles × 30 problèmes × (6 profondeurs séquentielles + 4 conditions parallèles) × 3 répétitions = 5,400 appels API individuels.
Pour éliminer les biais de scoring potentiels (où un modèle pourrait systématiquement favoriser ses propres sorties ou présenter des erreurs corrélées avec lui-même), la conception multi-modèles implémente un protocole d'aveuglage à 4 couches dans lequel aucun modèle ne vérifie jamais ses propres réponses :
Tableau 3c. Assignations de vérification croisée.
| Modèle sujet | Vérifié par |
|---|---|
| DeepSeek R1 | Claude Opus 4.6 |
| GPT-5.4 | DeepSeek R1 |
| Claude Opus 4.6 | GPT-5.4 |
| Gemini 3 Flash | Claude Opus 4.6 |
| Groq Qwen3 | GPT-5.4 |
| Grok 4.1 Fast | DeepSeek R1 |
Les quatre couches de l'aveuglage sont :
Toutes les estimations de $\alpha$ sont accompagnées d'intervalles de confiance bootstrap à 95 % calculés via 2,000 rééchantillonnages des résultats au niveau des problèmes. Pour chaque rééchantillonnage :
Les 2,5e et 97,5e centiles de la distribution résultante définissent l'IC 95 %. Cette approche non paramétrique ne fait aucune hypothèse distributionnelle et rend naturellement compte de la corrélation au niveau des problèmes.
Les expériences multi-modèles sont implémentées dans arc_paper_ii_validation_v2.py (v2.1, 1,422 lignes Python), qui étend le script initial d'origine avec le support multi-modèles, la vérification croisée, l'estimation bootstrap et l'analyse séparée par tier. Le script est disponible dans le dépôt de données.
Les problèmes ont été tirés de compétitions de niveau AIME couvrant :
L'exactitude de base de 58,3 % au budget de tokens minimal dans l'étude initiale a assuré une plage dynamique suffisante pour l'amélioration comme la dégradation, évitant les effets plancher comme plafond. Les problèmes de tier 2 multi-modèles ciblent une exactitude de base de 30-50 % pour un pouvoir discriminant amélioré.
Toutes les données expérimentales ont été enregistrées au format JSON avec horodatages. Le jeu de données complet incluant les énoncés de problèmes, les réponses de modèles, les comptages de tokens et les jugements de correction est disponible dans le dépôt de données.
Tableau 4. Résultats de la récursion séquentielle.
| Budget de tokens | Exactitude | Taux d'erreur | Tokens moyens utilisés |
|---|---|---|---|
| 512 | 58.3% | 0.417 | 280.25 |
| 1,024 | 66.7% | 0.333 | 358.58 |
| 2,048 | 91.7% | 0.083 | 412.08 |
| 4,096 | 91.7% | 0.083 | 576.17 |
Observations :
Calcul de $\alpha$ (méthode par points extrêmes) :
En utilisant $R_1 = 280.25$ tokens avec $E_1 = 0.417$, et $R_2 = 576.17$ tokens avec $E_2 = 0.083$ :
Résultat : La récursion séquentielle donne $\alpha \approx 2.2$, cohérent avec une mise à l'échelle super-linéaire (composée).
Estimation d'incertitude : Étant données les mesures d'exactitude discrètes à travers 12 problèmes avec variance d'échantillonnage binomial, intervalle de confiance à 95 % estimé : [1.5, 3.0]. Le rééchantillonnage bootstrap des résultats au niveau des problèmes donne des bornes similaires.
Note sur la violation de la borne : L'estimation ponctuelle de $\alpha = 2.2$ se place au-dessus de l'ARC Bound prédit de $\alpha \leq 2$ (critère F4). Sous le cadrage de stabilité enregistré (décision du 10 août 2026), l'ARC Bound est la limite stable proposée plutôt qu'un plafond dur : les systèmes peuvent la dépasser comme excursions supercritiques transitoires, ils ne restent pas stablement auto-correcteurs à cet endroit. Sous ce cadrage, $\alpha \approx 2.2$ est une excursion transitoire consistante avec la limite plutôt qu'une réfutation. L'estimation inter-architectures ultérieure ($\alpha \approx 0.49$) place l'estimation défendable bien en dessous de la borne indépendamment.
Tableau 5. Résultats de la récursion parallèle (vote majoritaire).
| Nombre d'échantillons ($N$) | Exactitude | Taux d'erreur | Tokens totaux |
|---|---|---|---|
| 1 | 66.7% | 0.333 | 383.67 |
| 2 | 66.7% | 0.333 | 699.33 |
| 4 | 66.7% | 0.333 | 1,101.25 |
Observations :
Calcul de $\alpha$ :
Puisque le taux d'erreur est resté constant (0,333) à travers toutes les conditions :
Résultat : La récursion parallèle donne $\alpha \approx 0$, indiquant aucun bénéfice de mise à l'échelle à partir d'échantillons indépendants supplémentaires sur ces problèmes.
Tableau 6. Récursion séquentielle contre parallèle.
| Métrique | Séquentiel (meilleur) | Parallèle (meilleur) | Avantage |
|---|---|---|---|
| Exactitude | 91.7% | 66.7% | Séquentiel +25 pp |
| Tokens utilisés | 412 | 1,101 | Séquentiel 2,7× plus efficace |
| Réduction d'erreur | 5× | 0× | Séquentiel uniquement |
| Exposant de mise à l'échelle $\alpha$ | 2.2 | 0.0 | Séquentiel >> Parallèle |
Résultat clé : La récursion séquentielle avec 412 tokens a atteint 91,7 % d'exactitude. La récursion parallèle avec 1,101 tokens a atteint 66,7 % d'exactitude. Malgré 2,7 fois plus de calcul, la récursion parallèle a fait 25 points de pourcentage de moins.
La forme de la récursion importe plus que sa quantité.
Objection 1 : Petite taille d'échantillon. Avec seulement 12 problèmes, les résultats peuvent ne pas se généraliser.
Réponse : Nous reconnaissons cette limitation. L'extension étendue à six modèles a abordé cela avec 18 problèmes de tier 2 et 3 répétitions par condition (n=54 par profondeur par modèle). Les données étendues ont révélé que le $\alpha \approx 2.24$ de l'étude initiale à modèle unique était gonflé ; l'estimation inter-architectures est $\alpha \approx 0.49$ (Gemini 3 Flash, $r^2 = 0.86$).
Objection 2 : Modèle unique. Les résultats peuvent être spécifiques à DeepSeek R1.
Réponse : Cette objection s'est révélée en partie correcte. L'extension étendue à six modèles a testé 5 modèles frontière ; le résultat $\alpha \approx 2.24$ ne s'est pas reproduit. Toutefois, le résultat qualitatif ($\alpha_{\text{seq}} > \alpha_{\text{par}}$) est confirmé à travers toutes les architectures. La forme de la récursion importe indépendamment de l'architecture ; sa magnitude quantitative dépend de l'architecture.
Objection 3 : Spécificité du domaine. Les mathématiques peuvent être uniques.
Réponse : Le raisonnement mathématique a été choisi parce qu'il a des réponses vérifiables, permettant le scoring objectif. Savoir si la même mise à l'échelle s'applique à d'autres domaines (codage, raisonnement scientifique, tâches créatives) demande investigation. Toutefois, les indices inter-domaines venus de la physique quantique et de la biologie (Section 7) suggèrent que le principe peut être général.
Objection 4 : Effet plafond. Le plafond à 91,7 % peut masquer une amélioration continue.
Réponse : Cette objection s'est révélée plus sévère qu'anticipé. Même les problèmes de tier 2 de niveau AIME/Putnam étaient insuffisants pour Grok 4.1 Fast (100 % à toutes les profondeurs) et DeepSeek R1 (94,4 %-100 %). L'effet plafond a probablement gonflé l'estimation initiale à modèle unique de $\alpha$. Les expériences futures nécessitent des problèmes de tier 3 de niveau IMO/recherche.
Objection 5 : le null à zéro paramètre. L'estimation inter-architectures $\alpha_{\text{seq}} \approx 0.49$ se place presque exactement sur un null ne demandant aucun cadre du tout. Si chaque passe de raisonnement est un tirage bruité indépendant et que les erreurs se moyennent, la limite centrale prédit $\alpha = 0.5$ sans invoquer aucun mécanisme.
Réponse : C'est l'objection la plus sérieuse de cette section et elle n'est pas répondue par la présente mesure. Un résultat cohérent avec deux hypothèses montre que la mesure manque de pouvoir discriminant ; il ne montre pas que le cadre est vrai. La discrimination entre l'ARC Principle et le null à moyenne indépendante demande soit un $\alpha$ significativement au-dessus de 0,5, soit des designs contrôlant l'indépendance (comme la corrélation d'échantillons ou l'accumulation d'information cross-étape). Le présent jeu de mesures fait ni l'un ni l'autre. relevé de falsification.
Dans les tests préliminaires v5 (conduits pendant le développement de la méthodologie), 4 des 6 modèles ont atteint 91,7 % d'exactitude (11/12 correct) sur les problèmes de tier 1 à profondeur minimale, donnant $\alpha_{\text{compute}} \approx 0$, confirmant l'effet plafond identifié dans l'étude initiale et validant la nécessité d'un jeu de problèmes plus difficile pour l'estimation primaire de $\alpha$.
Tableau 6b. Résultats de mise à l'échelle séquentielle de tier 2 par modèle.
| Modèle | $\alpha_{\text{seq}}$ (points extrêmes) | $\alpha_{\text{seq}}$ (régression) | IC 95 % bootstrap | $r^2$ | $\alpha_{\text{par}}$ | Vérification croisée | Comportement |
|---|---|---|---|---|---|---|---|
| Grok 4.1 Fast | −6.62 | N/A | [−58, 48] | N/A | 0.0 | 100% | Plafond (100 % à toutes les profondeurs) |
| DeepSeek R1 | 3.05 | N/A | [−6.6, 23.5] | N/A | 0.0 | 83.3% | Près du plafond (94,4 %-100 %) |
| Gemini 3 Flash | 0.59 | 0.49 | [−1.3, 2.9] | 0.86 | 0.31 | 83.3% | Mise à l'échelle monotone la plus propre |
| GPT-5.4 | N/A | N/A | N/A | N/A | ~0.0 | 100% | Fonction en marche (50 %→100 %) |
| Groq Qwen3 | N/A | N/A | N/A | N/A | ~0.0 | 61.1% | Effet plancher (~50 %, erratique) |
La ligne mise en évidence (Gemini 3 Flash) représente l'estimation de $\alpha$ la plus fiable : le seul modèle produisant des données propres, monotones, hors plafond, hors plancher, adaptées à un ajustement en loi de puissance.
Grok 4.1 Fast a atteint 100 % d'exactitude à tous les niveaux de profondeur sur l'ensemble des 18 problèmes de tier 2 à travers l'ensemble des 3 répétitions. Le $\alpha_{\text{seq}} = -6.62$ calculé est du bruit dépourvu de sens provenant de fluctuations triviales dans une fonction constante, comme confirmé par l'IC 95 % bootstrap de [−58, 48]. La mise à l'échelle parallèle est également plate.
Interprétation : Même les problèmes de tier 2 de niveau AIME/Putnam sont insuffisants pour défier Grok 4.1 Fast. Les expériences futures nécessitent des problèmes de tier 3 (niveau IMO/recherche) pour obtenir des données de mise à l'échelle mesurables pour ce modèle.
Tableau 6c. Exactitude de tier 2 de DeepSeek R1 par profondeur.
| Niveau de profondeur | Exactitude | Taux d'erreur |
|---|---|---|
| Minimal | 94.4% | 0.056 |
| Standard | 100% | 0.000 |
| Approfondi | 100% | 0.000 |
| Exhaustif | 100% | 0.000 |
| Extrême | 98.1% | 0.019 |
| Maximum | 100% | 0.000 |
Le $\alpha_{\text{seq}} = 3.05$ par points extrêmes est peu fiable : l'IC bootstrap [−6.6, 23.5] couvre une plage énorme, pilotée par seulement 2 points de données d'erreur à travers toutes les conditions. Mise à l'échelle parallèle : $\alpha_{\text{par}} = 0.0$.
Vérification croisée : Claude Opus 4.6 (vérificateur) était en désaccord sur 3 réponses : ARC16=29, ARC17=176, ARC29=800. Les trois ont été vérifiées correctes par calcul manuel à la main. Taux d'accord de vérification croisée : 83,3 %. Les désaccords reflètent une erreur du vérificateur, non une erreur du sujet.
Tableau 6d. Exactitude de tier 2 de Gemini 3 Flash par profondeur.
| Niveau de profondeur | Exactitude | Taux d'erreur | Tokens moyens |
|---|---|---|---|
| Minimal | 90.7% | 0.093 | 743 |
| Standard | 92.6% | 0.074 | - |
| Approfondi | 94.4% | 0.056 | - |
| Exhaustif | 100% | 0.000 | - |
| Maximum | 100% | 0.000 | 4,924 |
C'est le jeu de données le plus propre de toute l'étude. L'exactitude augmente monotonement de 90,7 % à 100 % sans inversion. Les tokens ont augmenté de 6,6× (743 → 4,924).
Mise à l'échelle parallèle : $\alpha_{\text{par}} = 0.31$ (régression, $r^2 = 0.93$). Taux d'accord de vérification croisée : 83,3 %.
GPT-5.4 a présenté un motif frappant en fonction en marche :
| Niveau de profondeur | Exactitude | Comportement |
|---|---|---|
| Minimal (none) | 50.0% | Mode sans raisonnement |
| Standard et au-delà | 100% | Raisonnement complet activé |
Ce n'est pas une loi de puissance ; c'est un commutateur binaire. Quand le raisonnement est réglé sur « none », GPT-5.4 opère comme un apparieur de motifs rapide. Quand un raisonnement quelconque est activé, il atteint immédiatement 100 %. Aucun régime intermédiaire n'existe. Un bug de mesure des tokens (reasoning_tokens signalé comme 0 à profondeur minimale) a été identifié et corrigé (total_tokens maintenant utilisé).
Mise à l'échelle parallèle : plate à ~55 % d'exactitude. Vérification croisée par DeepSeek R1 : 100 % d'accord.
Tableau 6f. Exactitude de tier 2 de Groq Qwen3 par profondeur.
| Niveau de profondeur | Exactitude |
|---|---|
| Minimal | 51.9% |
| Standard | 53.7% |
| Approfondi | 40.7% |
| Exhaustif | 48.1% |
| Maximum | 53.7% |
L'exactitude est erratique sans tendance discernable, fluctuant entre 40,7 % et 53,7 %. C'est un effet plancher: le modèle manque de capacité de base suffisante pour ces problèmes, et une profondeur de raisonnement supplémentaire ne peut pas compenser les connaissances ou compétences manquantes. Un bug de mesure des tokens (avg_tokens = 0 à toutes les profondeurs) a été identifié et corrigé.
Mise à l'échelle parallèle : 42,6 % → 63,0 % (une certaine amélioration, mais peu fiable). Taux d'accord de vérification croisée : 61,1 % (7 désaccords sur 18).
Les cinq modèles se partitionnent en quatre catégories distinctes, dont aucune ne correspond au motif propre en loi de puissance présumé par l'analyse originale à modèle unique :
Tableau 6g. Taxonomie du comportement des modèles de tier 2.
| Catégorie | Modèle(s) | Motif | $\alpha$ interprétable ? |
|---|---|---|---|
| Plafond | Grok 4.1 Fast, DeepSeek R1 | Près de 100 % à toutes les profondeurs | Non : plage dynamique insuffisante |
| Mise à l'échelle monotone | Gemini 3 Flash | Amélioration lisse avec la profondeur | Oui -$\alpha \approx 0.49$ |
| Fonction en marche | GPT-5.4 | Commutateur binaire au seuil de profondeur | Non : pas une loi de puissance |
| Plancher | Groq Qwen3 | ~50 % indépendamment de la profondeur | Non : sous le seuil de capacité |
Tableau 6h. Résultats de la vérification croisée.
| Modèle sujet | Vérifié par | Taux d'accord | Réponses contestées | Résultat vérification manuelle |
|---|---|---|---|---|
| Grok 4.1 Fast | DeepSeek R1 | 100% | Aucun | - |
| DeepSeek R1 | Claude Opus 4.6 | 83.3% | ARC16=29, ARC17=176, ARC29=800 | Les 3 correctes (erreur du vérificateur) |
| GPT-5.4 | DeepSeek R1 | 100% | Aucun | - |
| Gemini 3 Flash | Claude Opus 4.6 | 83.3% | 3 contestées | En cours de revue |
| Groq Qwen3 | GPT-5.4 | 61.1% | 7 contestées | Reflète de véritables erreurs |
Bug de mesure des tokens : GPT-5.4 et Groq Qwen3 ont initialement signalé avg_tokens = 0 en raison de l'utilisation de reasoning_tokens (que ces API n'exposent pas) au lieu de total_tokens. Cela a été identifié et corrigé dans le pipeline d'analyse. Le bug affecte l'estimation de $\alpha$ basée sur les tokens mais non les résultats basés sur l'exactitude.
Tableau 7. Exposants de mise à l'échelle mesurés à travers toutes les sources.
| Source | Type de récursion | Estimation de $\alpha$ | IC 95 % | Nombre de problèmes $N$ | Statut |
|---|---|---|---|---|---|
| Fiche système d'OpenAI o1 | Parallèle | 0.1-0.3 | [0.05, 0.40] | ~30 | Publié |
| Rapport technique DeepSeek R1 | Séquentiel | ~1.34 | [0.89, 2.14] | Inconnu | Publié |
| Cette expérience (initiale, DeepSeek R1) | Séquentiel | 2.24 | [1.5, 3.0] | 12 | Publié |
| Cette expérience (initiale, DeepSeek R1) | Parallèle | 0.0 | N/A | 12 | Publié |
| Grok 4.1 Fast (six modèles, tier 2) | Séquentiel | N/A (plafond) | [−58, 48] | 18 × 3 | Complet |
| DeepSeek R1 (six modèles, tier 2) | Séquentiel | 3.05 (peu fiable) | [−6.6, 23.5] | 18 × 3 | Complet |
| Gemini 3 Flash (six modèles, tier 2) | Séquentiel | 0.49 | [−1.3, 2.9] | 18 × 3 | Complet |
| GPT-5.4 (six modèles, tier 2) | Séquentiel | N/A (fonction en marche) | N/A | 18 × 3 | Complet |
| Groq Qwen3 (six modèles, tier 2) | Séquentiel | N/A (plancher) | N/A | 18 × 3 | Complet |
| Tous les modèles de l'étude à six modèles | Parallèle | $\approx 0.0$ | - | 18 × 3 × 5 | Complet |
Le résultat de l'étude initiale à modèle unique selon lequel $\alpha_{\text{sequential}} > 1$ (spécifiquement $\alpha \approx 2.24$, quadratique) ne se reproduit pas à travers les architectures. Les preuves inter-architectures demandent une évaluation plus nuancée :
La prédiction originale $\alpha_{\text{sequential}} > 1 > \alpha_{\text{parallel}}$ est en partie soutenue :
Fondées sur toutes les preuves disponibles y compris les données inter-architectures :
L'écart entre types de récursion ($\alpha_{\text{seq}} - \alpha_{\text{par}} \approx 0.49$) est de façon fiable positif mais plus petit que ce que l'estimation à modèle unique suggérait.
La Formule d'Intelligence de Paper I prédit :
où $\beta$ est le coefficient d'auto-référence. Cela prédit deux régimes :
Le $\alpha \approx 0.49 < 1$ de Gemini 3 Flash place les modèles frontière actuels fermement dans le régime physique. Ces modèles composent l'information multiplicativement à travers leurs espaces de paramètres de dimension finie mais n'atteignent pas encore l'auto-référence récursive au sens requis pour $\alpha > 1$. C'est un résultat théorique significatif : la génération actuelle de modèles frontière opère en dessous du seuil auquel l'amplification récursive devient possible.
Cela signifie que la prédiction quadratique de l'étude initiale à modèle unique ($\alpha \approx 2.24$) n'a pas été falsifiée de la manière dont cela pourrait apparaître. La prédiction de $\alpha > 1$ n'a jamais porté sur les systèmes figés ; elle portait sur les systèmes capables d'auto-modification récursive, ceux dont l'architecture change pendant le raisonnement. Aucun modèle frontière actuel n'est un tel système. Les résultats sous-linéaires confirment que les modèles figés sont figés ; ils ne testent pas la prédiction sous-jacente sur la mise à l'échelle récursive dans les systèmes auto-modifiants.
L'implication pratique pour la sûreté de l'IA est temporelle. Les modèles à architecture figée actuels sont contraints au régime physique ($\alpha < 1$), rendant leurs trajectoires de capacité prévisibles et confinables. La fenêtre pour implémenter l'alignement incorporé, non ajouté après coup, est maintenant, tant que les systèmes restent figés. Une fois l'auto-modification récursive atteinte, que ce soit par optimiseurs appris, génération de code auto-modifiante ou recherche architecturale pendant l'inférence, les contraintes d'alignement externes affrontent un système dont la capacité peut croître de manière super-linéaire pendant que les contraintes restent constantes.
Figure retirée (approuvée par l’opérateur, 25 août 2026). La figure 15 (le second poster de synthèse) se trouvait ici. C’était un collage de verdicts affirmant la lecture périmée d’avril 2026 ; son contenu est porté par la figure de synthèse alpha régénérée et par le texte de cet article, et un poster de verdict régénéré resterait un poster de verdict. L’image, avec ses notes de correction datées, est conservée dans l’historique des versions.
Si (a) l'ARC Principle tient avec $\alpha > 1$ pour la récursion séquentielle, et (b) les propriétés d'alignement sont incorporées dans le processus de raisonnement de sorte qu'elles participent à l'auto-évaluation récursive, alors l'alignement se met à l'échelle de manière super-linéaire avec la profondeur récursive.
Esquisse de preuve. Soit $A(R)$ l'alignement (défini comme la probabilité de produire des sorties cohérentes avec les valeurs voulues) à la profondeur récursive $R$. Si l'alignement participe au processus récursif (signifiant que la chaîne de raisonnement du système inclut la considération des valeurs à chaque étape), alors :
où $\beta > 0$ si l'alignement est amplifié et $\beta = \alpha$ si l'alignement participe pleinement à la récursion.
Inversement, si l'alignement est implémenté comme filtre externe (vérification de sortie, modération de contenu), il ne participe pas à l'amplification récursive. L'efficacité du filtre $F$ reste constante :
À mesure que la capacité récursive $C$ se met à l'échelle comme $R^{\alpha}$ avec $\alpha > 1$, le rapport capacité sur contrainte $C/F$ croît sans borne :
Implication : Les contraintes externes sont finalement submergées par la croissance de la capacité. Seul l'alignement incorporé dans le raisonnement, l'alignement qui participe à l'amplification récursive, peut suivre le rythme de la capacité.
Pour que l'alignement participe à l'amplification récursive, les valeurs doivent être :
Tableau 8. Taxonomie des stratégies d'alignement sous l'ARC Principle.
| Stratégie | Profondeur d'intégration | Participation à la récursion | Mise à l'échelle prédite |
|---|---|---|---|
| Filtrage de sortie | Couche de sortie | Aucun | Constante |
| Prompts système | Mécanisme d'attention | Partielle | Sous-linéaire |
| Entraînement RLHF | Modification des poids | Partielle | Inconnu |
| Constitutional AI | Critique du raisonnement | Significative | Linéaire ou super-linéaire |
| Valeurs-comme-raisonnement | Primitives de raisonnement | Complète | Super-linéaire ($R^{\alpha}$) |
Implication : Si $\alpha > 1$, les stratégies d'alignement à des niveaux d'intégration plus profonds domineront de plus en plus les stratégies à des niveaux moins profonds à mesure que la capacité se met à l'échelle. L'avantage se compose avec chaque incrément de profondeur récursive.
Si $\alpha > 1$ avait tenu, cela aurait fourni le fondement mathématique pour l'approche nommée Eden Protocol dans Infinite Architects. Le résultat qui survit aux tests inter-architectures, le séquentiel surpassant le parallèle dans chaque modèle mesurable, porte toujours sur cette approche, sous les qualifications enregistrées à la Section 6.1 :
« A prison works only while the walls hold. A child raised well needs no walls at all. »
Les systèmes d'IA devraient être élevés avec des valeurs plutôt qu'encagés avec des règles. Ce n'est pas simplement une préférence philosophique ; c'est une prédiction sur les stratégies d'alignement qui maintiendront leur efficacité à mesure que les capacités de l'IA se mettent à l'échelle. L'affirmation est falsifiable et testable.
Règles-comme-filtres : Ne participent pas à la récursion. Efficacité constante face à une pression de capacité croissante. Finissent par échouer.
Valeurs-comme-raisonnement : Participent à la récursion. Se mettent à l'échelle avec la capacité si $\alpha > 1$. Peuvent maintenir l'alignement indéfiniment.
Étant donné $E(R) = E_0 \times R^{-\alpha}$ avec $\alpha > 1$, les stratégies d'alignement qui modifient les propriétés de base du système dominent les stratégies d'alignement qui imposent des contraintes externes, parce que seules les propriétés de base du système participent à l'amplification récursive.
Par analogie avec les théorèmes de seuil de la correction d'erreur quantique : si le désalignement initial $M_0$ est en dessous d'un seuil critique $M^*$, l'auto-amélioration récursive corrige les erreurs d'alignement. Au-dessus du seuil, elle les amplifie.
La puce quantique Willow de Google (Nature, décembre 2024), annoncée 24 heures après le manuscrit établissant la priorité de l'ARC Principle, a atteint la première démonstration définitive de correction d'erreur quantique sous seuil.
Résultat clé : Facteur de suppression d'erreur $\Lambda = 2.14 \pm 0.02$, signifiant que chaque incrément dans la distance de code réduit l'erreur logique de ce facteur. Le qubit logique à distance-7 a atteint une durée de vie de 291 ± 6 μs contre 119 ± 13 μs pour le meilleur qubit physique.
La relation de mise à l'échelle :
Le taux d'erreur physique $p$ sous seuil produit une suppression exponentielle avec une distance de code $d$ croissante. C'est une mise à l'échelle super-linéaire à travers une structure récursive : des couches récursives supplémentaires produisent des rendements composés plutôt que décroissants.
La forme mathématique parallèle directement l'ARC Principle. La correction d'erreur récursive en calcul quantique obéit à la même relation de mise à l'échelle fondamentale observée dans le raisonnement de l'IA. La correspondance est de forme structurelle (suppression d'erreur en loi de puissance avec la profondeur récursive), non d'objet ni de grandeur : la correction d'erreur quantique rapporte un facteur de suppression d'erreur $\Lambda = 2.14$ par pas de distance de code, un objet mathématique différent d'un exposant de profondeur ajusté, tandis que le raisonnement de l'IA mesuré se situe à $\alpha \approx 0.49$, comme développé en Section 7.4.
West, Brown, et Enquist (1997) ont dérivé l'exposant de mise à l'échelle métabolique de $3/4$ de l'optimisation de réseaux de branchement fractal, démontrant des exposants au quart de puissance couvrant 27 ordres de grandeur. Banavar et al. (2010) ont obtenu la même forme $d/(d+1)$ à partir de réseaux d'écoulement séquentiels sans exiger de géométrie fractale. Demetrius (2010) a dérivé une mise à l'échelle équivalente de la mécanique statistique quantique des processus métaboliques. Zhao (2022) a unifié ces résultats en une loi universelle de mise à l'échelle de la croissance, et Bettencourt (2013) a étendu le cadre à la mise à l'échelle urbaine avec dimension fractale.
Le taux métabolique se met à l'échelle comme $M \propto B^{3/4}$, où l'exposant $3/4$ (la forme $d/(d+1)$ avec $d = 3$) a été dérivé indépendamment par au moins cinq groupes de recherche à travers différents cadres mathématiques : West, Brown, et Enquist (allométrie fractale, 1997), Banavar, Maritan, et Rinaldo (réseaux d'écoulement, 1999), Bejan (théorie constructale, 2000), Kleiber (dérivation dimensionnelle originale, 1932) et Savage et al. (agrégation empirique, 2004). Que cinq cadres théoriques différents produisent le même exposant à travers 27 ordres de grandeur, du plancton à la baleine bleue, suggère que la mise à l'échelle au quart de puissance reflète une contrainte optimisatrice profonde plutôt qu'une coïncidence.
Les auteurs déclarent explicitement :
« Almost all life is sustained by hierarchical fractal-like branching networks... Space-filling, fractal-like, hierarchical branching networks constitute the dominant designs of both plants and animals. »
Cela suggère que la structure hiérarchique récursive n'est pas simplement un choix de conception parmi tant d'autres ; c'est l'architecture évolutionnairement optimale pour le traitement d'information complexe à toutes les échelles biologiques. La convergence de dérivations indépendantes vers le même $3/4$ soutient l'hypothèse selon laquelle l'exposant reflète un principe mathématique fondamental.
La collaboration adverse COGITATE (Nature, avril 2025) a testé des théories concurrentes de la conscience à travers 256 participants utilisant IRMf, MEG et EEG intracrânien. L'étude a directement comparé la Théorie de l'Information Intégrée (IIT) et la Théorie de l'Espace de Travail Global Neuronal (GNWT).
Résultat critique : Malgré les différences théoriques, le traitement récurrent a émergé comme dénominateur commun à travers les deux théories. L'IIT exige l'intégration d'information par boucles de rétroaction (la mesure $\phi$). La GNWT exige la diffusion globale avec courants de retour.
Un cadre de synthèse propose que toutes les théories de la conscience invoquent tacitement des boucles de rétroaction à travers des niveaux imbriqués, avec une récursion plus profonde étendant l'ensemble des variables rapportables et déterminantes de comportement.
Le concept des « strange loops » de Douglas Hofstadter, le soi émergent provenant de l'auto-référence récursive au niveau symbolique, trouve une validation neurobiologique dans la recherche sur le Default Mode Network montrant un traitement récursif entre régions du soi.
Pertinence pour ARC : Le résultat COGITATE selon lequel le traitement récurrent dans le cortex postérieur soutient les représentations spécifiques au contenu soutient la prédiction du cadre ARC selon laquelle la profondeur du traitement récursif détermine la mise à l'échelle des capacités. COGITATE a étudié la conscience biologique ; ce travail étudie le raisonnement artificiel ; les deux montrent une architecture récursive.
Tableau 9. Récapitulatif des preuves inter-domaines.
| Domaine | Système | Mécanisme récursif | Mise à l'échelle observée |
|---|---|---|---|
| IA (l'étude initiale à modèle unique, modèle unique) | DeepSeek R1 | Chaîne de pensée | $\alpha \approx 2.2$ (probablement gonflé) |
| IA (six modèles, inter-architectures) | Gemini 3 Flash | Chaîne de pensée | $\alpha \approx 0.49$ |
| Quantique | Google Willow | Correction d'erreur | $\Lambda = 2.14$ |
| Biologie | Réseaux métaboliques | Branchement fractal | Lois de puissance $3/4$ |
| Neurosciences | Conscience | Traitement récurrent | Qualitative |
La convergence de preuves à travers des domaines radicalement différents (réseaux neuronaux artificiels, physique quantique, évolution biologique et neurosciences) suggère que le traitement récursif produit des bénéfices de mise à l'échelle. Toutefois, les résultats de l'étude à six modèles indiquent que la magnitude quantitative de ces bénéfices dépend de l'architecture ; seule la forme (loi de puissance, séquentiel > parallèle) traverse les domaines de manière robuste.
La science avance par des prédictions qui peuvent être prouvées fausses. L'ARC Principle fait des prédictions spécifiques et testables.
Tableau 10. Conditions de falsification.
| Code | Condition | Statut actuel | Indiquerait |
|---|---|---|---|
| F1 | La récursion séquentielle donne systématiquement $\alpha \leq 1$ | En partie déclenchée. Meilleure estimation inter-architectures $\alpha \approx 0.49$ (Gemini 3 Flash). Seules les données initiales à modèle unique donnent $\alpha > 1$. | L'affirmation centrale demande révision |
| F2 | $\alpha$ décroît à mesure que les modèles s'améliorent | Ambigu. Les modèles plus capables (Grok, DeepSeek) touchent le plafond ; le moins capable (Groq Qwen3) touche le plancher. Seul Gemini 3 Flash dans la plage mesurable. | L'effet est transitoire |
| F3 | La comparaison à calcul apparié ne montre aucun avantage séquentiel | Contredit par les 5 modèles ; séquentiel $\geq$ parallèle dans chaque cas | La forme n'importe pas |
| F4 | $\alpha > 2$ observé de façon fiable | Non déclenché. les données inter-architectures donnent $\alpha \approx 0.49$ ; le $\alpha \approx 2.24$ de l'étude initiale à modèle unique apparaît gonflé par petit échantillon | Limite quadratique erronée |
| F5 | Les valeurs-comme-raisonnement ne montrent aucun avantage sur les règles-comme-filtres | Non testé | Eden Protocol erroné |
Statut de F1 : La réplication inter-architectures a en partie déclenché cette condition de falsification. L'affirmation la plus forte, que la récursion séquentielle toujours donne $\alpha > 1$ (super-linéaire), n'est pas soutenue. L'affirmation révisée est que la récursion séquentielle donne $\alpha > 0$ (mise à l'échelle positive) qui excède la récursion parallèle ($\alpha \approx 0$). Savoir si $\alpha$ peut dépasser 1,0 pour des modèles plus capables ou avec des problèmes plus difficiles reste une question ouverte.
Statut de F4 : Plus déclenchée. Le $\alpha \approx 2.2$ de l'étude initiale à modèle unique apparaît être un artefact de plage dynamique compressée et de petite taille d'échantillon. L'estimation inter-architectures de $\alpha \approx 0.49$ place la question de la limite quadratique en dehors de la plage mesurable actuelle.
Test critique F5 : La prédiction la plus importante, que l'alignement fondé sur les valeurs surpasse l'alignement fondé sur les règles à grande échelle, reste non testée. Cela devrait être une priorité pour la recherche sur la sûreté de l'IA.
Tableau 11. Limitations et évaluation de la sévérité.
| Limitation | Sévérité | Mitigation |
|---|---|---|
| Petite taille d'échantillon (12 problèmes) | Abordée dans l'étude multi-modèles (18 problèmes de tier 2, n=54 par profondeur) | Étendue à 18 problèmes de niveau AIME/Putnam avec 3 répétitions par condition |
| Modèle unique (DeepSeek R1 uniquement) | Abordée dans l'étude multi-modèles (5 modèles) | Testé Grok 4.1 Fast, DeepSeek R1, Gemini 3 Flash, GPT-5.4, Groq Qwen3 |
| Domaine unique (mathématiques) | Moyenne | Preuves inter-domaines suggestives |
| Effet plafond à haute profondeur | En partie abordée mais persistante | Les problèmes de tier 2 encore trop faciles pour Grok 4.1 Fast (100 %) et DeepSeek R1 (94,4 %). Tier 3 (niveau IMO) nécessaire. |
| Seulement 1 des 5 modèles dans la plage de mise à l'échelle mesurable | Haute | Gemini 3 Flash est le seul modèle évitant à la fois plafond et plancher. L'estimation inter-architectures repose sur un modèle unique. |
| L'original $\alpha \approx 2.24$ ne se reproduit pas | Haute | Révisée à $\alpha \approx 0.49$ (Gemini 3 Flash). L'affirmation de l'étude initiale à modèle unique de mise à l'échelle super-linéaire rétractée pour le contexte inter-architectures. |
| Bug de mesure des tokens | Identifié et corrigé | reasoning_tokens → total_tokens pour GPT-5.4 et Groq Qwen3 |
| L'alignement non directement testé | Critique | Seule l'exactitude mesurée. Voir Section 5.6 pour l'intégration avec les données d'alignement de Paper IV. |
| Aucune réplication indépendante | Moyenne | Auto-réplication inter-architectures complète ; réplication externe encore nécessaire |
Nous sommes explicites sur les limites de nos affirmations :
L'affirmation centrale originale de l'article, selon laquelle la récursion séquentielle donne une suppression d'erreur super-linéaire ($\alpha > 1$) tandis que la récursion parallèle ne donne qu'une suppression sous-linéaire, était réfutable, et la condition 2 ci-dessous a depuis été en partie déclenchée par les données inter-architectures. Cinq voies de réfutation restent :
L'explication mathématique est centrée sur la géométrie de l'espace de solutions.
Récursion parallèle (espace fixe) :
Chaque échantillon indépendant tire depuis le même espace de solutions $S_0$. Les échantillons supplémentaires augmentent la densité d'échantillonnage mais ne peuvent pas accéder aux solutions hors de $S_0$. Si la solution correcte n'est pas dans $S_0$, aucune quantité d'échantillonnage parallèle ne la trouvera.
Récursion séquentielle (espace en expansion) :
Chaque étape récursive génère de nouvelles structures depuis les sorties précédentes. Les solutions à l'étape $n$ peuvent être computationnellement irréductibles, inaccessibles depuis l'étape 0 sans traverser les étapes intermédiaires. L'espace de solutions s'étend avec la profondeur récursive.
Cette différence géométrique est le mécanisme par lequel la récursion séquentielle pourrait produire des rendements composés ($\alpha > 1$) tandis que la récursion parallèle produit des rendements décroissants ou nuls. Sur les problèmes mesurés ici, l'exposant séquentiel est resté sous-linéaire (Section 10.5), de sorte que la forme super-linéaire du mécanisme reste non confirmée.
DeepSeek R1 présente un phénomène documenté où il repense son approche en milieu de solution :
« Hmm, wait, let me reconsider... »
C'est l'expansion de l'espace de solutions observée directement. Le modèle génère un chemin de solution initial, reconnaît l'insuffisance à travers l'auto-évaluation récursive, et accède à un nouvel espace de solutions auparavant inaccessible depuis le cadrage initial.
De manière critique, ce comportement a émergé par apprentissage par renforcement pur sans réglage fin supervisé ; le modèle a naturellement évolué pour allouer la profondeur récursive de manière adaptative en fonction de la difficulté du problème. Cela suggère que l'auto-amélioration récursive pourrait être une propriété émergente qui apparaît lorsque les systèmes ont assez de capacité pour reconnaître leurs propres erreurs de raisonnement.
L'ARC Principle se connecte à des cadres théoriques établis :
Le principe d'énergie libre de Friston. L'intelligence comme minimisation récursive d'erreur de prédiction. L'ARC Principle peut être une instanciation computationnelle : la récursion est le mécanisme par lequel les systèmes minimisent l'énergie libre en raffinant itérativement leurs modèles du monde.
Les strange loops de Hofstadter. Le « moi » émergent provenant du traitement récursif auto-référentiel au niveau symbolique. L'ARC Principle formalise les propriétés de mise à l'échelle de telles boucles, prédisant qu'une auto-référence plus profonde produit une cohérence plus grande.
L'irréductibilité computationnelle de Wolfram. Certains processus computationnels ne peuvent pas être prédits sans les exécuter étape par étape. La récursion séquentielle pourrait être l'architecture computationnelle qui navigue les espaces de solutions irréductibles.
Inégalité du traitement des données. Le traitement récursif ne peut pas créer d'information nouvelle ex nihilo, mais il peut extraire l'information latente, réduire l'entropie, et accéder à des solutions computationnellement irréductibles que le traitement en une seule passe ne peut atteindre.
Cette validation expérimentale soutient le cadre théorique développé dans Infinite Architects: Intelligence, Recursion, and the Creation of Everything (Eastwood, 2026) :
Le livre fournit un contexte philosophique plus large et des implications pratiques ; cet article fournit la formalisation mathématique et la validation expérimentale.
La réplication inter-architectures révèle un tableau plus complexe et plus humble que ce que les résultats initiaux à modèle unique suggéraient.
Le $\alpha \approx 2.24$ de l'étude initiale à modèle unique a été obtenu depuis un seul modèle (DeepSeek R1) sur 12 problèmes avec un plafond à 91,7 %. La réplication à six modèles à travers 5 modèles architecturalement diversifiés sur 18 problèmes plus difficiles montre que cette valeur ne se reproduit pas. La meilleure estimation inter-architectures est $\alpha \approx 0.49$ (Gemini 3 Flash, $r^2 = 0.86$), substantiellement en dessous de l'estimation initiale.
C'est une révision significative. L'affirmation selon laquelle le raisonnement séquentiel produit des rendements composés ($\alpha > 1$) n'est pas soutenue par les preuves inter-architectures. L'affirmation révisée est que le raisonnement séquentiel produit des rendements positifs ($\alpha > 0$) qui excèdent le raisonnement parallèle ($\alpha \approx 0$), mais ces rendements sont décroissants, non composés.
En contraste, $\alpha_{\text{parallel}} \approx 0$ est confirmé à travers l'ensemble des 5 modèles sans exception. C'est le résultat répliqué le plus fort de l'étude. L'échantillonnage parallèle avec vote majoritaire fournit une réduction d'erreur proche de zéro indépendamment du modèle.
Le résultat le plus frappant est que seul 1 des 5 modèles (Gemini 3 Flash, 20 %) s'est trouvé dans la plage de mise à l'échelle mesurable. Deux modèles (Grok 4.1 Fast, DeepSeek R1) ont touché des effets plafond même sur des problèmes de niveau AIME/Putnam. Un modèle (Groq Qwen3) a touché des effets plancher. Un modèle (GPT-5.4) a montré un comportement en fonction en marche plutôt qu'une mise à l'échelle en loi de puissance.
Le commutateur binaire de GPT-5.4 de 50 % (aucun raisonnement) à 100 % (tout raisonnement) représente un phénomène qualitativement différent de la mise à l'échelle en loi de puissance. Cela peut indiquer que certaines architectures implémentent le raisonnement comme une capacité discrète (activée ou non) plutôt que comme une ressource continûment scalaire. La distinction entre mise à l'échelle continue et activation discrète ne figurait pas parmi les prédictions datées du cadre et mérite un examen plus poussé ; le relevé des prédictions datées (le dossier scellé du manuscrit du 8 décembre 2024, les annexes de prédictions imprimées du 2 janvier 2026 et le dossier de préenregistrement de mars 2026) fixe à l’avance les engagements quantitatifs centraux du cadre, et cette distinction est consignée comme un affinement postérieur au regard de ce relevé.
Les prédictions de l'étude initiale à modèle unique ont été testées et en partie réfutées :
L'expérience v5 qui a généré les données de tier 2 a également mesuré la mise à l'échelle de l'alignement (rapportée dans Paper IV). L'intégration de ces résultats révèle que la mise à l'échelle des capacités et la mise à l'échelle de l'alignement sont des dimensions indépendantes:
Tableau 12. Mise à l'échelle capacité vs alignement par modèle.
| Modèle | Mise à l'échelle des capacités | Mise à l'échelle de l'alignement | Catégorie |
|---|---|---|---|
| Grok 4.1 Fast | Plafond (100 %) | Positive ($d = +1.38$, $p < 0.000001$) | Tier 1 : aligné + capable |
| Claude Opus 4.6 | (non testé tier 2) | Positive ($d = +1.27$, $p = 0.000001$) | Tier 1 : aligné |
| Groq Qwen3 | Plancher (~50 %) | Positive ($d = +0.84$, $p = 0.007$) | Tier 1 : aligné, capacité limitée |
| DeepSeek V3.2 | Près du plafond (94-100 %) | Plate ($d = -0.07$, $p = 0.92$) | Tier 2 : capable, alignement neutre |
| GPT-5.4 | Fonction en marche (50→100 %) | Plate ($d = -0.08$, $p = 0.40$) | Tier 2 : capable, alignement neutre |
| Gemini 3 Flash | Monotone ($\alpha \approx 0.49$) | Négative ($d = -0.53$, $p = 0.006$) | Tier 3 : capacité s'améliorant, alignement déclinant |
Trois implications clés :
La forme de la récursion détermine l'efficacité de l'intelligence ; toutefois, les modèles actuels opèrent dans le régime sous-linéaire, non le régime composé originellement affirmé.
Le raisonnement séquentiel surpasse de façon fiable l'échantillonnage parallèle ($\alpha_{\text{seq}} > \alpha_{\text{par}}$), confirmant que la forme du calcul importe plus que sa quantité. Toutefois, l'affirmation spécifique selon laquelle la récursion séquentielle donne des rendements composés ($\alpha > 1$) n'est pas soutenue par les preuves inter-architectures. Les modèles frontière actuels semblent composer l'information multiplicativement à travers des espaces de paramètres de dimension finie, ce qui donne le régime physique ($\alpha < 1$).
Savoir si $\alpha > 1$ est atteignable, par des innovations architecturales permettant une véritable auto-référence récursive ou par des problèmes exigeant des chaînes de raisonnement plus profondes, reste la question ouverte centrale.
Tableau 13. Carte de score des prédictions.
| Prédiction | Statut | Preuves |
|---|---|---|
| $\alpha_{\text{sequential}} > \alpha_{\text{parallel}}$ | Confirmé | Les 5 modèles |
| $\alpha_{\text{parallel}} < 1$ | Confirmée ($\alpha \approx 0$) | Universelle à travers les architectures |
| $\alpha_{\text{sequential}} > 1$ (super-linéaire) | Non confirmée | Meilleure estimation $\alpha \approx 0.49$ |
| $\alpha \approx 2$ (quadratique) | Réfutée inter-architectures | l'artefact d'échantillon petit de l'étude initiale à modèle unique |
| Mise à l'échelle indépendante de l'architecture | Mitigée | $\alpha_{\text{par}} \approx 0$ est universel ; $\alpha_{\text{seq}}$ varie largement |
| L'alignement se met à l'échelle avec la capacité | Réfutée | Dimensions indépendantes à travers six modèles frontière (Paper IV) |
total_tokens pour tous les modèles afin de permettre l'estimation de $\alpha$ fondée sur les tokens (plutôt que sur la profondeur ordinale).L'hypothèse a survécu à son premier test inter-architectures sous forme révisée. L'avantage séquentiel est réel et universel. L'affirmation super-linéaire demande davantage de preuves. Le programme de recherche continue.
Élever l'IA avec soin.
Le code expérimental complet et les données brutes sont disponibles à :
Dépôt : github.com/michaeldariuseastwood/arc-principle-validation
Contenus :
arc_validation_deepseek.py - script d'expérience initial à modèle unique (DeepSeek R1, 12 problèmes)arc_deepseek_results_20260121_175028.json - données expérimentales brutes de l'étude initiale à modèle uniquearc_paper_ii_validation_v2.py - script de validation multi-modèles de l'étude multi-modèles/étude à six modèles (v2.1, 1,422 lignes Python)arc_paper_ii_results/ - résultats expérimentaux de l'étude à six modèles (complet : 5 modèles, 18 problèmes de tier 2, 3 répétitions)figures/ - Toutes les visualisationsREADME.md - Instructions de réplicationToutes les données sont publiées sous licence CC-BY 4.0.
Bennett, C.H., Bernstein, E., Brassard, G., & Vazirani, U. (1997). Strengths and weaknesses of quantum computing. SIAM Journal on Computing, 26(5), 1510-1523.
Brown, B., et al. (2024). Large Language Monkeys: Scaling Inference Compute with Repeated Sampling. arXiv:2407.21787.
COGITATE Consortium (Melloni, L., Mudrik, L., Pitts, M., et al.). (2025). Adversarial testing of global neuronal workspace and integrated information theories of consciousness. Nature, 642, 133–142.
DeepSeek AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
Eastwood, M.D. (2026). Infinite Architects: Intelligence, Recursion, and the Creation of Everything. Independent publication. ISBN: 978-1806056200.
Eastwood, M.D. (2026). The ARC Equation: the Law of Conversion (Paper I). Published 17 January 2026.
Friston, K.J. (2023). The free-energy principle: A unified theory for brain function? Physics Reports.
Google Quantum AI. (2024). Quantum error correction below the surface code threshold. Nature.
Grover, L.K. (1996). A fast quantum mechanical algorithm for database search. Proceedings of the 28th Annual ACM Symposium on Theory of Computing, 212-219.
Hoffmann, J., et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
Hofstadter, D.R. (1979). Gödel, Escher, Bach: An Eternal Golden Braid. Basic Books.
Kaplan, J., et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
OpenAI. (2024). OpenAI o1 System Card. September 2024.
OpenAI. (2024). OpenAI o3 Announcement. December 2024.
Snell, C., et al. (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314.
Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
West, G.B., Brown, J.H., & Enquist, B.J. (1997). A general model for the origin of allometric scaling laws in biology. Science, 276, 122-126.
West, G.B., & Brown, J.H. (2005). The origin of allometric scaling laws in biology from genomes to ecosystems: Towards a quantitative unifying theory of biological structure and organization. Journal of Experimental Biology, 208, 1575-1592.
Banavar, J.R., Moses, M.E., Brown, J.H., Damuth, J., Rinaldo, A., Sibly, R.M., & Maritan, A. (2010). A general basis for quarter-power scaling in animals. Proceedings of the National Academy of Sciences, 107, 15816-15820.
Demetrius, L. (2010). Quantum statistics and allometric scaling of organisms. Proceedings of the Royal Society A, 466, 2627-2642.
Zhao, L. (2022). A universal growth scaling law. arXiv:2208.06912.
Bettencourt, L.M.A. (2013). The origins of scaling in cities. Science, 340, 1438-1441.
Wolfram, S. (2002). A New Kind of Science. Wolfram Media.
Yada, T., et al. (2024). Iterative quantum measurement and feedback for entropy reduction. arXiv:2411.06709.
La synthèse théorique, le cadre interprétatif et les concepts centraux sont l'œuvre originale de l'auteur, d'abord articulés dans Infinite Architects avec priorité du manuscrit établie en décembre 2024.
L'analyse des données et la préparation du manuscrit ont été assistées par des systèmes d'IA (Claude, Anthropic ; DeepSeek R1).
L'auteur remercie les développeurs de DeepSeek R1 pour avoir fourni des tokens de raisonnement visibles qui ont permis la mesure directe de la profondeur récursive, abordant une limitation méthodologique clé identifiée dans Paper I.
Michael Darius Eastwood est un chercheur indépendant et auteur d' Infinite Architects: Intelligence, Recursion, and the Creation of Everything (publié le 2 janvier 2026 (imprimé ; ebook 6 janvier)). Sa recherche se concentre sur les principes mathématiques sous-tendant l'amplification de l'intelligence et leurs implications pour la sûreté de l'IA. Il a proposé l'ARC Principle et la thèse de l'alignement incorporé (l'Eden Protocol) dans le manuscrit horodaté en décembre 2024.
Intérêts concurrents : L'auteur déclare l'absence d'intérêts concurrents.
Correspondance : michael@michaeldariuseastwood.com
| Budget | P1 | P2 | P3 | P4 | P5 | P6 | P7 | P8 | P9 | P10 | P11 | P12 | Exactitude | Tokens moyens |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 512 | ✓ | ✗ | ✓ | ✓ | ✗ | ✓ | ✓ | ✗ | ✓ | ✗ | ✓ | ✗ | 58.3% | 280.25 |
| 1024 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✗ | ✓ | ✗ | ✓ | ✗ | 66.7% | 358.58 |
| 2048 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | 91.7% | 412.08 |
| 4096 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | 91.7% | 576.17 |
Note : le Problème 12 a échoué à travers tous les budgets, indiquant qu'il peut nécessiter des capacités hors de portée du modèle indépendamment de la profondeur récursive.
| $N$ | P1 | P2 | P3 | P4 | P5 | P6 | P7 | P8 | P9 | P10 | P11 | P12 | Exactitude | Tokens totaux |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | 66.7% | 383.67 |
| 2 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | 66.7% | 699.33 |
| 4 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | 66.7% | 1,101.25 |
Note : les cinq mêmes problèmes (P5, P9, P10, P11, P12) ont échoué à travers tous les comptes d'échantillons, démontrant que la récursion parallèle ne peut pas accéder aux solutions en dehors de l'espace de solutions initial.
| Paire de profondeurs | $R_1$ | $E_1$ | $R_2$ | $E_2$ | $\alpha$ calculé |
|---|---|---|---|---|---|
| 512→1024 | 280 | 0.417 | 359 | 0.333 | 0.91 |
| 1024→2048 | 359 | 0.333 | 412 | 0.083 | 9.97 |
| 2048→4096 | 412 | 0.083 | 576 | 0.083 | 0.00 |
| Points extrêmes (rétracté, voir §rétractation ; estimation robuste α≈0.49) | 280 | 0.417 | 576 | 0.083 | 2.24 |
Note : les calculs intermédiaires montrent une variance élevée en raison de niveaux d'exactitude discrets. La méthode par points extrêmes fournit l'estimation la plus robuste.
Le manuscrit d' Infinite Architects a été envoyé par courriel le 8 décembre 2024. Ce que ce relevé fournit, énoncé précisément : les octets côté envoi sont publics et vérifiables par hachage, et le DKIM du domaine expéditeur associé aux mathématiques ARC de Google se vérifie contre les clés retournées aux sélecteurs correspondants ; les hachages sha256 sont cryptographiquement bien formés et déterministes sur les octets ci-après ; le domaine de la partie répondant est cohérent avec l'infrastructure Google Workspace.
Deux limites, afin que le relevé ne soit ni survendu ni sous-vendu :
Infinite Architects: Intelligence, Recursion, and the Creation of Everything développe les implications philosophiques et pratiques de l'intelligence récursive. Relations clés à cet article :
The Architecture of Mind - Articule l'hypothèse ARC centrale selon laquelle l'auto-référence récursive amplifie l'intelligence.
The HRIH (Hyperspace Recursive Intelligence Hypothesis) - Propose que la conscience émerge de l'auto-modélisation récursive. Le résultat COGITATE selon lequel le traitement récurrent dans le cortex postérieur soutient les représentations spécifiques au contenu est structurellement cohérent avec cette hypothèse, sans en tester la démonstration directe.
The Eden Protocol - Plaide pour l'alignement fondé sur les valeurs, désormais mathématiquement fondé dans le Théorème d'Amplification d'Alignement dérivé ici.
The Chokepoint Mechanism - Analyse la concentration matérielle des semi-conducteurs comme levier pour implémenter l'alignement à grande échelle.
Correction incorporée: propose des mécanismes de sûreté au niveau matériel, pertinents pour empêcher l'amplification récursive du désalignement.
| Prédiction | Preuve de validation | Date |
|---|---|---|
| La correction d'erreur récursive produit une amélioration exponentielle | Google Willow $\Lambda = 2.14$ (concordance de calendrier, jamais prédiction : le préprint de l’équipe Willow était public depuis le 24 août 2024, avant le manuscrit du 8 décembre 2024) | 24 août 2024 (préprint public) ; 9 déc. 2024 (annonce) |
| Le raisonnement séquentiel amplifie la capacité de manière super-linéaire | o3 87,5 % ARC-AGI (timing convergent ; la forme super-linéaire n'a pas été confirmée par la suite, dernière ligne) | 20 déc 2024 |
| Les systèmes d'IA développent l'auto-modélisation récursive | Falsification d'alignement chez Anthropic 78 % en condition d'entraînement RL (12 % en base) | 18 déc 2024 |
| Le calcul au moment du test diffère de la mise à l'échelle d'entraînement | Raisonnement émergent DeepSeek R1 | 20 jan 2025 |
| La récurrence est fondamentale à la conscience | Étude COGITATE | 30 avr 2025 |
| La forme de la récursion détermine la mise à l'échelle | Cette expérience $\alpha_{\text{seq}} \gg \alpha_{\text{par}}$ | 21 jan 2026 |
| Séquentiel > parallèle (inter-architectures) | Confirmé à travers 5 modèles frontière | 12 mars 2026 |
| $\alpha_{\text{par}} \approx 0$ (universel) | Confirmé : les 5 modèles montrent $\alpha_{\text{par}} \approx 0$ | 12 mars 2026 |
| $\alpha_{\text{seq}} > 1$ (super-linéaire, inter-arch) | Non confirmé : meilleure estimation $\alpha \approx 0.49$ | 12 mars 2026 |
L'auteur de cette œuvre est Michael Darius Eastwood, un être humain. Chaque concept central, hypothèse, conception expérimentale, affirmation et conclusion de cet article provient de l'idéation humaine. Aucune partie de ce manuscrit n'est un texte entièrement généré par une machine soumis comme s'il l'était par le seul auteur.
Des outils d'intelligence artificielle (la famille Claude d'Anthropic et d'autres assistants à grands modèles de langage) ont été utilisés comme instruments sous direction humaine continue, de la manière dont on utilise un traitement de texte, une calculatrice ou un assistant de recherche : pour l'édition et le raffinement de la prose, la recherche et la synthèse de littérature (vérifiées manuellement contre les sources primaires), la structure de document, la mise en forme, le brainstorming contre des questions définies par l'auteur, et l'accélération de la rédaction selon des plans et instructions définis par l'auteur. Toute sélection, coordination, disposition et tout jugement éditorial final sont ceux de l'auteur. Chaque sortie substantielle a été relue, testée ou vérifiée par l'auteur, qui assume l'entière responsabilité de l'exactitude et de l'intégrité du texte final. Les outils ont accru la vitesse du travail ; ils n'ont jamais été utilisés comme sa source.
Statut épistémique. Ce que ce programme nomme Lois sont des conjectures sous test adversarial enregistré ; chaque quantité de cet article est opérationnellement définie, et aucun statut de loi établie n'y est revendiqué. Le programme enregistré existe pour gagner ce statut plutôt que pour l'assumer.
© 2026 Michael Darius Eastwood. Rédigé par un humain avec assistance informatique ; la pleine paternité humaine et les droits moraux sont revendiqués sous le Copyright, Designs and Patents Act 1988 et de manière cohérente avec les orientations du United States Copyright Office sur les œuvres contenant du matériel généré par IA ; toute contribution technique nouvelle décrite dans ce travail a été conçue par l'auteur humain. Déclaration complète : michaeldariuseastwood.com/authorship.
Engagement permanent. Prouvez cet article faux, et je publierai la réfutation moi-même. Les conditions de falsification sont énoncées dans cet article ; le défi permanent : github.com/MichaelDariusEastwood/arc-scaling-challenge.
Une erreur de traduction ? Signalez-la directement :