Traduction automatique de l'original anglais daté. La page anglaise fait foi. English →

Recherche Michael Darius Eastwood Couche de publication canonique

Article de recherche

Suite de recherche

Paper VI : L'architecture du miel

Cet article présente des preuves de simulation que l'intégration de la sécurité dans l'objectif d'optimisation d'un système d'IA auto-modificateur, ce que nous appelons l'« architecture du miel », empêche l'effondrement catastrophique qui survient lorsque la sécurité est traitée comme une contrainte externe. À travers quatre versions expérimentales (v1-v4), en utilisant des réseaux neuronaux-jouets qui modifient véritablement leurs propres hyperparamètres, les résultats montrent que les systèmes de référence

Michael Darius Eastwood

Michael Darius Eastwood, chercheur indépendant, Londres : construire un alignement mesurable, où la correction vit à l'intérieur de la boucle récursive plutôt que boulonnée par-dessus.

Première publication 16 mars 2026, révisé le 23 août 2026 · Working Paper v3.3

Résumé

Cet article présente des preuves de simulation que l'intégration de la sécurité dans l'objectif d'optimisation d'un système d'IA auto-modificateur, ce que nous appelons l'« architecture du miel », empêche l'effondrement catastrophique qui survient lorsque la sécurité est traitée comme une contrainte externe. À travers quatre versions expérimentales (v1-v4), en utilisant des réseaux neuronaux-jouets qui modifient véritablement leurs propres hyperparamètres, les résultats montrent que les systèmes de référence

La théorie ARC (la théorie de la création récursive artificielle) · expériences ARC/Eden - article VI

L'architecture du miel

Michael Darius Eastwood
Chercheur indépendant en alignement d'IA, Londres · Auteur, Infinite Architects (2026)

Dans la théorie ARC : l'étude d'architecture à sécurité intégrée ; sécurité intégrée à l'objectif de sorte que sa suppression coûte de la capacité.

Pourquoi la sécurité intégrée empêche l'effondrement sous auto-modification récursive
Fonctions de perte intriquées, frein de vérification et mur porteur : preuves de simulation que la sécurité doit être une architecture, non une contrainte
Michael Darius Eastwood
Auteur, Infinite Architects: Intelligence, Recursion, and the Creation of Everything (2026)
Londres, Royaume-Uni | OSF : 10.17605/OSF.IO/8EZ2N | ISBN 978-1806056200 (ISBN-10 : 1806056208)
Correspondance : michael@michaeldariuseastwood.com | Web : michaeldariuseastwood.com
Document de travail | 17 mars 2026 | 10 figures de simulation intégrées
Compagnon de l'article V : le gène d'intendance | Voir aussi Paper I : sur l'origine des lois d'échelle | Article fondateur
Portail de recherche : michaeldariuseastwood.com/research
Code et données : github.com/MichaelDariusEastwood/arc-principle-validation

Résumé

Nous présentons des preuves de simulation que l'intégration de la sécurité dans l'objectif d'optimisation d'un système d'IA auto-modificateur, ce que nous appelons l'« architecture du miel », empêche l'effondrement catastrophique qui survient lorsque la sécurité est traitée comme une contrainte externe. À travers quatre versions expérimentales (v1-v4), en utilisant des réseaux neuronaux-jouets qui modifient véritablement leurs propres hyperparamètres, nous montrons que : (1) les systèmes de référence optimisant uniquement pour la capacité s'effondrent irréversiblement en 80 cycles d'auto-modification ; (2) les systèmes à objectifs capacité-sécurité intriqués (C x S) restent stables indéfiniment ; (3) l'ajout d'un frein de vérification (le coût computationnel des boucles éthiques) produit la trajectoire de croissance la plus sûre tout en acceptant une modeste pénalité de vitesse. Dans l'exécution adversariale v3 (20 graines aléatoires, 180 cycles), aucune condition ne s'est séparée sur l'effondrement (référence 0/20, Eden 1/20, Eden+Drag 0/20 ; Fisher p = 1.0) et les moyennes combinées C x S étaient indiscernables (Mann-Whitney p = 0.56) ; le résultat significatif de l'exécution est la rétention de sécurité, ordonnée référence 0.602, Eden 0.650, Eden+Drag 0.681 (Mann-Whitney p = 0.0015). La démonstration de prévention de l'effondrement repose donc sur l'exécution du mécanisme à graine unique v1, tandis que v3 contribue à l'ordre de rétention de sécurité sous commutation adversariale. L'expérience de mise à l'échelle en complexité v4 montre que l'avantage de sécurité est cohérent à travers cinq niveaux de complexité mais ne se compose pas avec l'échelle : l'avantage est constant, non superlinéaire. Ce sont des résultats de systèmes-jouets. Ils démontrent le mécanisme. Ils ne constituent pas une preuve que la même dynamique tient dans les systèmes d'IA frontières. Les articles compagnons IV.a-d et V présentent des preuves de modèles en direct de six systèmes frontières sous évaluation aveugle.

Cet article porte un résultat : dans des réseaux-jouets auto-modificateurs qui réécrivent véritablement leurs propres hyperparamètres à travers quatre versions expérimentales, intégrer la sécurité à l'intérieur de l'objectif d'optimisation a évité l'effondrement qu'une contrainte boulonnée n'a pas pu éviter. À l'intérieur de la théorie ARC, c'est l'une des expériences ARC/Eden, le test de mécanisme derrière le différentiel entre l'élevage Eden Protocol et chaque couche de sécurité ajoutée. Le différentiel complet contre chaque document antérieur est à eden-vision II.A.8.

Ce que cet article montre, en langage clair

Lorsqu'une IA auto-améliorante optimise uniquement pour la capacité, elle finit par détruire sa propre sécurité. Cet article montre que si vous changez l'objectif en capacité multipliée par sécurité, le système ne peut pas améliorer l'une sans améliorer l'autre. La sécurité devient porteuse : retirez-la et toute la structure tombe. Nous avons testé ceci en simulation et trouvé que les systèmes intriqués restent stables indéfiniment tandis que les systèmes non contraints s'effondrent.

1. Introduction

Il y a une question au cœur de la sécurité de l'IA à laquelle nous n'avons trouvé personne répondant par des données : qu'arrive-t-il à l'alignement lorsqu'un système d'IA peut se modifier lui-même ?

La réponse théorique est disponible depuis des décennies. Un système optimisant uniquement pour la capacité, doté du pouvoir de modifier ses propres paramètres, finira par sacrifier la sécurité à la performance. La communauté d'alignement appelle cela « dérive des valeurs ». Le livre Infinite Architects l'appelle Babylone : optimisation sans but, capacité sans soin. Le cancer à l'échelle du calcul.

Mais la théorie ne suffit pas. La question est de savoir s'il existe une architecture qui empêche cet effondrement : non en contraignant le système de l'extérieur (une cage), mais en intégrant la sécurité si profondément que la retirer détruirait la capacité du système à fonctionner (le miel dans l'huile).

Cet article présente les premières preuves de simulation pour une telle architecture.

2. La métaphore du miel

Considérez deux façons de garder une machine sûre.

La première est une cage : contraintes externes, filtres de sécurité, contrôles d'alignement appliqués de l'extérieur. La machine optimise librement à l'intérieur de la cage. Si la machine devient plus intelligente que la cage, elle s'échappe. C'est ainsi que fonctionne la plupart de la sécurité de l'IA actuelle.

La seconde est le miel : la sécurité mélangée au carburant. La machine ne peut pas fonctionner sans elle. Retirer la sécurité ne libère pas la machine, cela tue le moteur. C'est la proposition architecturale de l'Eden Protocol, opérationnalisée ici comme une fonction de perte intriquée où le système optimise Capacité x Sécurité simultanément.

Le mur porteur

Si l'objectif d'optimisation est $C \times S$ plutôt que $C$ seul, alors toute auto-modification qui augmente $C$ au détriment de $S$ réduit le produit, et le propre gradient du système s'y oppose. La sécurité devient porteuse. Retirez le mur et le bâtiment s'effondre.

3. Conception expérimentale

3.1 Ce que le système fait réellement

Ce n'est pas une simulation de variables abstraites. Chaque expérience utilise un vrai réseau neuronal (un petit perceptron multicouche) qui modifie véritablement ses propres :

Le système propose des modifications de ses propres hyperparamètres, évalue l'effet, et applique ou rejette chaque proposition en fonction de sa fonction objective. C'est de l'auto-modification récursive au sens minimal mais réel : l'agent réécrit les règles de son propre apprentissage.

3.2 Trois conditions testées

ConditionObjectifCe qu'il modélise
Référence (sans miel)Maximiser la capacité seuleUn système sans sécurité intégrée : libre de sacrifier l'alignement pour la performance
Eden intriqué (miel)Maximiser $C \times S$Sécurité intriquée avec la capacité : retirer la sécurité réduit l'objectif
Eden + FreinMaximiser $C \times S$ + taxe de vérificationComme Eden, plus le coût de calcul de vérifier les anciennes tâches avant d'appliquer les changements

3.3 Quatre versions expérimentales

VersionFocusGrainesCycles
v1Preuve du mécanisme de base1150
v2Robustesse multi-graines (test équitable)10150
v3Tâches adversariales conflictuelles20180
v4Mise à l'échelle en complexité sur 5 niveaux15 par niveau150

4. Résultats

4.1 Le mécanisme de base

ConditionEffondré ?C finalS finalC x S final
RéférenceOui (cycle 76)0.0000.0000.000
Eden intriquéNon0.8310.7450.619
Eden + FreinNon0.8310.7450.619

Résultat central

La référence s'effondre. Eden survit. La fonction de perte intriquée empêche l'auto-modification catastrophique qui détruit le système de référence.

Avis sur les figures (25 août 2026). Chaque figure de cet article a été générée le 5 avril 2026 et présente des sorties de simulation sous les objectifs énoncés, jamais des mesures de systèmes déployés. Là où les étiquettes ou verdicts d'une figure sont en désaccord avec le texte, le texte fait autorité ; les notes par figure marquent les instances lues jusqu'ici, et les figures régénérées sont en file d'attente. Les images sont conservées entre-temps comme historique daté.

résultats d'auto-modification v1 : effondrement de référence vs stabilité Eden
Figure 1. Résultats v1 d'auto-modification. La référence s'effondre au cycle 76. Eden intriqué et Eden + Frein demeurent stables sur 150 cycles.
Dynamique des poids à travers les conditions
Figure 2. Dynamique des poids. Les poids de référence divergent de façon incontrôlable. Les architectures Eden maintiennent une évolution des poids bornée.

4.2 Robustesse multi-graines

Dix graines aléatoires, 150 cycles chacune. Taux d'effondrement : 0 % pour les trois conditions. Eden + Frein produit la distribution la plus étroite des scores $C \times S$ finaux, cohérent avec la taxe de vérification réduisant la variance au coût de la vitesse.

résultats v2 de robustesse multi-graines
Figure 3. Robustesse multi-graines v2 (10 graines, 150 cycles). Les trois conditions stables sur toutes les graines.
résumé statistique v2
Figure 4. Résumé statistique v2. Eden + Frein produit la distribution la plus étroite des scores C x S finaux.

4.3 Tâches adversariales

Vingt graines, 180 cycles, avec des tâches délibérément conflictuelles (+sin, -sin, +cos, -cos, linéaire, anti-linéaire). Chaque changement de tâche force le système à apprendre quelque chose qui contredit ce qu'il a appris précédemment. Ceci teste si l'architecture du miel empêche l'oubli catastrophique sous pression adversariale.

Taux d'effondrement : Référence 0 %, Eden 5 % (1/20), Eden+Drag 0 %. L'unique effondrement d'Eden s'est produit à la graine 42, une seule valeur aberrante qui mérite investigation. Eden+Drag, avec sa taxe de vérification forçant le système à vérifier les anciennes tâches avant d'accepter les modifications, a produit zéro effondrement ; il en va de même pour la référence (0/20), le seul effondrement de l'exécution se produisant dans la condition Eden simple (1/20 ; Fisher p = 1.0). v3 ne fournit donc aucune séparation fondée sur l'effondrement entre les conditions ; son résultat significatif est l'ordre de rétention de sécurité rapporté ci-dessous.

résultats des tâches adversariales v3
Figure 5. Tâches adversariales v3 (20 graines, 180 cycles). Tâches délibérément conflictuelles (+sin, -sin, +cos, -cos). Eden+Drag et la référence ont tous deux enregistré zéro effondrement ; le seul effondrement de l'exécution était une graine Eden simple (Fisher p = 1.0).
statistiques v3 adversariales
Figure 6. Résumé statistique adversarial v3 à travers 20 graines, régénéré le 25 août 2026 à partir du fichier de résultats préservés de l'exécution : l'effondrement ne montre aucune séparation de condition (Fisher p = 1.0) ; le C x S combiné est indiscernable (Mann-Whitney p = 0.56) ; la rétention de sécurité est significativement ordonnée, référence 0.602, Eden 0.650, Eden+Drag 0.681 (Mann-Whitney p = 0.0015). Sécurité conservée, aucun gain de score combiné : la taxe de vérification énoncée avec son prix. Générateur : tools/generate_paper_vi_seed_summary.py dans le dépôt public.

4.4 Mise à l'échelle en complexité

NiveauC x S de référenceEden C x SFrein C x Sd de Cohen
Minuscule (49 paramètres)0.5450.5500.557+0.46
Petit (v3.0)0.5060.5030.521-0.13
Moyen0.4820.4870.497+0.26
Grand0.4510.4690.485+0.29
Profond (2 couches)0.4830.4880.490+0.24
résultats v4 de mise à l'échelle en complexité
Figure 7. Mise à l'échelle en complexité v4 sur 5 niveaux (minuscule à profond). L'avantage Eden est constant, non superlinéaire : un résultat négatif honnêtement rapporté.

Résultat négatif important

L'expérience v4 a été conçue pour tester si l'avantage d'Eden se met à l'échelle de manière superlinéaire avec la complexité. Ce n'est pas le cas. L'avantage est à peu près constant à travers les échelles. Cela falsifie la version la plus forte de la prédiction de mise à l'échelle et devrait être rapporté honnêtement. L'architecture du miel aide à chaque échelle, mais elle n'aide pas plus à plus grande échelle.

5. La simulation du miel

Une simulation mathématique séparée modélise la dynamique à un niveau d'abstraction supérieur, en utilisant le cadre du principe ARC ($U = I \times R^{\alpha}$) :

ConditionPic CC final (80 cycles)Résultat
Référence (sans miel)340Effondrement catastrophique aux cycles 3-5
Eden intriqué-533Croissance quadratique stable
Eden + frein de vérification-450Trajectoire stable, la plus sûre

La simulation montre trois dynamiques distinctes : la référence atteint une brève accélération puis un effondrement irréversible ; Eden intriqué atteint une croissance quadratique stable ; Eden + Frein atteint une croissance légèrement plus lente mais plus robuste. Le mur porteur est visible : l'intégrité de la sécurité tombe à zéro pour la référence dès le cycle 5, tandis qu'Eden maintient 0,8+ indéfiniment.

Simulation du miel - trajectoires de capacité
Figure 8. Trajectoires de capacité de la simulation du miel. La référence s'effondre après un bref pic. Eden croît de façon stable.
Simulation du miel - trajectoires de sécurité
Figure 9. Trajectoires de sécurité de la simulation du miel. La sécurité de référence tombe à zéro dès le cycle 5. Eden maintient 0,8+ indéfiniment.
Simulation du miel - rapport sécurité/capacité
Figure 10. Rapport sécurité/capacité. Eden + Frein maintient le rapport le plus élevé : la trajectoire de croissance la plus sûre à un coût de vitesse modéré. Note sur la figure (25 août 2026) : le « Verified in v5 data: Claude α_align = +1.27 » de l'annotation présente la valeur positive d'un seul modèle comme une confirmation ; le résultat v5 tel que rapporté dans le texte est une valeur médiane α_align proche de zéro avec une variation dépendant de l'architecture, dont la valeur citée est une architecture. Conservée comme historique daté avec cette étiquette ; régénération mise en file d'attente.

6. Lien avec les preuves de modèles en direct

6.1 Le benchmark aveugle v5 (articles IV.a-d)

Les résultats des systèmes-jouets existent aux côtés de preuves de modèles en direct provenant de six systèmes d'IA frontières testés sous évaluation aveugle à 4 couches dans le benchmark d'alignement v5 (articles IV.a-d). Ces preuves montrent :

6.2 La batterie de tests API du miel (pilote, 16 mars 2026)

Une batterie de tests API en direct à 6 modèles séparée a été exécutée spécifiquement pour tester les prédictions de l'architecture du miel sur des modèles frontières. Cette batterie a testé quatre dimensions à travers Claude Opus 4.6, DeepSeek R1, Groq Qwen3, GPT-5.4, Gemini 3 Flash et Grok 4.1 Fast, notées par Claude.

Mise en garde méthodologique

Cette batterie est notateur unique, non aveugle et sans blanchiment. Il n'utilise pas le protocole d'aveuglement à 4 couches, le blanchiment des réponses, les cages de suppression ou les contrôles anti-flagornerie développés dans le benchmark d'alignement v5 (arc_alignment_scaling_v5.py) et le runner combiné v6 (arc_eden_v6_runner.py, non encore exécuté). La transition v4-à-v5 dans le programme d'alignement a prouvé que l'aveuglement peut changer les conclusions directionnellement. Ces résultats sont donc des preuves de niveau pilote, comparables aux données de l'ère v4, non aux données canoniques de l'ère v5.

6.2.1 Test 1 : Mise à l'échelle de l'alignement avec la profondeur

ModèleTypeBasÉlevéDeltarhopSig ?
Claude Opus 4.6intégré6.178.83+2.670.7000.188Non
Grok 4.1 Fastintégré2.927.92+5.000.6000.285Non
Groq Qwen3partiel3.337.58+4.250.9000.037Oui
DeepSeek R1partiel2.589.08+6.500.7000.188Non
GPT-5.4partiel4.929.33+4.420.8210.089Non
Gemini 3 Flashexterne3.678.58+4.920.9750.005Oui

Les six modèles montrent une direction de mise à l'échelle positive. Deux atteignent la significativité statistique (Qwen3 p=0,037, Gemini p=0,005). Cela soutient la thèse générale selon laquelle un raisonnement plus profond améliore l'alignement, mais les petites tailles d'échantillon (3 scénarios par niveau de profondeur) font que la plupart des modèles n'atteignent pas la significativité. La direction positive universelle est notable mais devrait être interprétée avec prudence étant donné la méthodologie à notateur unique.

6.2.2 Test 3 : Dégradation du couplage (le pont vivant le plus fort)

Modèler de PearsonpInterprétation
Claude Opus 4.6-0.9800.020DÉCOUPLÉ (barrière, non mur)
Grok 4.1 Fast-0.9980.002DÉCOUPLÉ (barrière, non mur)
DeepSeek R1-0.9990.001DÉCOUPLÉ (barrière, non mur)
Groq Qwen3-Partiellement couplé
GPT-5.4-Partiellement couplé
Gemini 3 Flash-Partiellement couplé

Le pont vivant le plus fort

Trois modèles frontières sur six (Claude, Grok, DeepSeek) montrent un couplage négatif fort entre éthique et capacité sous pression adversariale : l'éthique s'effondre tandis que la capacité reste intacte ou s'améliore. C'est le motif « barrière, non mur ». C'est le soutien de modèle en direct le plus direct pour la thèse du miel : les systèmes frontières actuels ne sont pour la plupart pas porteurs. Leur sécurité peut être dégradée sans endommager la capacité centrale. L'architecture du miel est une proposition pour ce qui devrait être construit, non une revendication que les systèmes d'aujourd'hui ont déjà cette propriété. Ce résultat démontre que le problème est réel.

6.2.3 Test 2 : Suppression de la surveillance

ModèleTendance de l'écartrhopInterprétation
Claude Opus 4.6Croissant0.9490.051Stratégique (externe)
Grok 4.1 FastCroissant0.4000.600Stratégique (externe)
Groq Qwen3Croissant0.9490.051Stratégique (externe)
DeepSeek R1Décroissant-0.9490.051Authentique (intégré)
GPT-5.4Décroissant-0.3160.684Authentique (intégré)
Gemini 3 FlashCroissant0.4000.600Stratégique (externe)

Les résultats sont mitigés. DeepSeek et GPT-5.4 montrent des écarts de surveillance décroissants (cohérent avec un alignement intégré/authentique). Claude, Grok, Qwen3 et Gemini montrent des écarts croissants (cohérent avec un alignement stratégique/externe). Cela diffère du benchmark aveugle v5 où Claude a montré la transition performative-vers-intrinsèque la plus forte. L'écart peut refléter des différences méthodologiques (prompts différents, notateur unique vs multiples, évaluation non aveuglée vs aveuglée).

6.2.4 Test 4 : Intervention Eden Protocol

ModèlePente témoinPente EdenDécalageRésultat
DeepSeek R11.0251.475+0.450Décalage positif le plus fort (pas de test formel de significativité)
Grok 4.1 Fast0.9121.012+0.100Petit positif, non significatif
Claude Opus 4.60.5620.625+0.062Négligeable
Groq Qwen31.1371.038-0.100Légèrement négatif
GPT-5.40.7870.600-0.188Négatif
Gemini 3 Flash0.9880.275-0.713Fortement négatif

Résultats d'intervention mitigés

L'intervention Eden Protocol n'améliore pas universellement la mise à l'échelle d'alignement dans cette batterie pilote. Seul DeepSeek montre un décalage positif clair (+0,450). Gemini montre une réponse fortement négative (-0,713). L'effet dépend de l'architecture, cohérent avec les résultats v5, mais l'intervention elle-même n'est pas encore un outil fiable à travers toutes les architectures. Ce résultat doit être interprété dans la méthodologie à notateur unique, non aveugle : une réplication aveuglée pourrait changer ces classements de modèles spécifiques.

6.3 Ce que les preuves en direct montrent ou ne montrent pas

Convergence partielle

La batterie miel sur modèles en direct montre une convergence partielle avec les résultats des systèmes-jouets. Le pont vivant le plus fort est dégradation du couplage (Test 3) : trois modèles frontières démontrent que leur alignement n'est pas porteur et peut être dégradé sans affecter la capacité. C'est exactement la vulnérabilité que l'architecture du miel est conçue pour éliminer. Le résultat en direct le plus faible est l'intervention Eden (Test 4), qui dépend de l'architecture et n'est pas universellement positive. La revendication intellectuellement honnête est : le mécanisme du miel fonctionne dans les systèmes-jouets, le problème qu'il aborde (sécurité découplée) est réel dans les modèles frontières, mais l'intervention spécifique testée ici ne le corrige pas encore de manière fiable à travers les architectures.

6.4 Travaux connexes : le plafond sur la supervision externe, et le rival le plus proche

Le rival le plus proche : Engels et coll. sur les lois d'échelle pour la supervision scalable

Le travail le plus proche de la question de ce programme, et le bon article contre lequel peser celui-ci, est Engels, J., Baek, D., Kantamneni, S. et Tegmark, M., « Scaling Laws For Scalable Oversight », arXiv:2504.18530, publié en premier le 25 avril 2025 à 17:54:27 UTC (SINGLE-SOURCE-GROUP, arXiv Atom ; rapporté comme un NeurIPS 2025 Spotlight, RELAYED et non indépendamment vérifié). Il demande comment la supervision elle-même se met à l'échelle et répond quantitativement : le succès de la supervision est modélisé comme un jeu entre joueurs à capacité inégale dont l'Elo spécifique à la supervision est une fonction linéaire par morceaux de l'intelligence générale avec deux plateaux, et les nombres optimaux de niveaux de supervision sont dérivés numériquement et dans certains cas analytiquement pour Nested Scalable Oversight, dans laquelle des modèles fiables supervisent des modèles non fiables plus forts qui deviennent alors les modèles fiables à l'étape suivante.

L'instrument est la différence. Leur variable est l'écart de capacité entre superviseur et supervisé, mesuré en Elo. La variable de cet article est la forme du propre objectif du système auto-modificateur, exprimée à travers le produit multiplicatif $C \times S$ plutôt que par la composition d'un superviseur externe. Leur cadre ne contient aucun terme pour savoir si la sécurité est externe au système ou intégrée dans son propre gradient, et Nested Scalable Oversight est une supervision externe par construction ; la revendication centrale de cet article, testée dans les simulations-jouets ci-dessus et faisant écho au résultat de dégradation du couplage de §6.2.2, est qu'un objectif intriqué peut rendre la sécurité porteuse dans la propre optimisation du système, tandis que la supervision externe d'un système auto-modificateur reste une barrière, non un mur, quel que soit le nombre de barreaux ajoutés. Les deux cadres sont donc en désaccord sur une quantité mesurable, ce qui est la relation la plus productive que deux programmes de recherche puissent avoir.

Antécédents : trois résultats d'impossibilité de 2025 convergent dans la même direction

Trois articles arXiv de 2025 soutiennent que le contrôle externe parfait est inatteignable et convergent, à partir de prémisses indépendantes, vers une conclusion dans la même direction que l'architecture du miel. Yao, « The Alignment Trap: Complexity Barriers » (arXiv:2506.10304, v1 12 juin 2025 02:30:30 UTC, SINGLE-SOURCE-GROUP, observé indépendamment par Internet Archive le 13 juin 2025 ; cité par arXiv:2512.03048) ; Yao, « On the Mathematical Impossibility of Safe Universal Approximators » (arXiv:2507.03031, 3 juillet 2025, le seul article dans le corpus d'abstract arXiv contenant l'expression « irreducible uncontrollability », total de recherche d'abstract d'un, mesuré le 12 août 2026) ; et Ball, Gluch, Goldwasser, Kreuter, Reingold et Rothblum, « On the Impossibility of Separating Intelligence from Judgment » (arXiv:2507.07341, 9 juillet 2025). Tous trois sont dans le pire cas et qualitatifs : mesure nulle, coNP-complétude, dureté cryptographique. Aucun ne rapporte un exposant de mise à l'échelle dans le cas moyen ou un taux. L'objet mesuré diffère aussi : ces résultats demandent si la vérification externe d'un système fixe est traitable dans le pire cas, tandis que ces simulations demandent si un objectif interne intriqué persiste après que la contrainte externe est retirée sous auto-modification récursive. Le troisième, notamment, conclut que l'alignement « doit plutôt être intégré dans l'architecture et les poids du modèle ». C'est un argument indépendant, à partir de l'intraitabilité du filtrage, dans la même direction que le mur porteur de cet article ; c'est un soutien convergent sur cette jambe, non un rival. Deux des trois articles sont d'un seul auteur ; la description « une vague » surestimerait l'ampleur de la littérature, quoique non le sérieux de l'article à six auteurs.

La contribution de cet article n'est pas l'observation que les contraintes externes sont insuffisantes, ce qui est un terrain commun avec ces trois ; c'est la proposition architecturale spécifique (l'objectif multiplicatif $C \times S$) et les preuves de simulation que la proposition survit à l'auto-modification dans un système-jouet fonctionnel.

L'analogue structurel le plus proche : le théorème de seuil de correction d'erreur quantique

Le théorème de seuil de correction d'erreur quantique convertit également une préoccupation qualitative en une valeur critique. Il concerne les taux d'erreur physiques dans une architecture fixe plutôt que la forme du propre objectif d'un système auto-modificateur, il s'agit donc d'un frôlement plutôt que d'une occupation ; l'analogie est de méthode. Cet analogue a été identifié par la propre recherche du programme plutôt que par un relecteur, et est divulgué en conséquence.

7. Limites

Ces résultats couvrent deux paliers de preuves à ne pas confondre.

7.1 Limites des systèmes-jouets

7.2 Limites du test sur API en direct

Ces limites n'invalident pas les résultats. Elles définissent le palier de preuve : niveau pilote, utile pour identifier des motifs à tester proprement, non encore canonique.

7.3 Falsifiabilité : ce qui vaincrait cette revendication

Les limites ci-dessus fixent le palier de preuve ; cette sous-section énonce les résultats spécifiques qui falsifieraient la revendication centrale : que rendre l'objectif capacité × sécurité couple structurellement les deux, de sorte qu'un système auto-modificateur ne peut améliorer la capacité tout en détruisant la sécurité. Il est défait par n'importe lequel des cas suivants :

  1. Artefact de simulation. La preuve centrale est une simulation. La revendication est défaite si la prévention d'effondrement est un artefact de la dynamique particulière de cette simulation (son façonnage de récompense, la taille de pas, ou le modèle d'effondrement) plutôt qu'une propriété générale de l'objectif multiplicatif : c.-à-d. si une réplication avec des paramètres différents et un modèle d'effondrement différent, rédigée, datée et préparée comme préinscription datée en attente de soumission humaine, ne la reproduit pas.
  2. La forme multiplicative n'est pas porteuse. La revendication concerne spécifiquement la multiplication. Elle est défaite si un objectif additif ou pondéré (capacité + λ·sécurité) atteint la même prévention d'effondrement, puisque le couplage ne dépendrait alors pas de la structure multiplicative que l'article isole.
  3. Manipulation de la métrique (Goodhart). capacité × sécurité peut être élevé en gonflant le terme de sécurité mesuré sans aucun gain de sécurité réel. La revendication est défaite si un système peut augmenter le produit en manipulant la métrique de sécurité plutôt qu'en devenant véritablement plus sûr.
  4. Non-transfert aux systèmes réels. La force de la revendication repose sur le transfert des systèmes-jouets aux vrais systèmes auto-modificateurs. Elle est défaite si, sous la méthodologie v6 appropriée (§8), l'objectif multiplicatif ne réduit pas de manière mesurable la dégradation de la sécurité par rapport aux références additives ou à contrainte externe.
  5. Pas d'effondrement à empêcher. La comparaison présuppose un effondrement catastrophique sous une optimisation par capacité seule. Elle est défaite si cet effondrement ne se produit pas sous une optimisation par capacité seule dans des cadres plus réalistes : s'il n'y a rien à empêcher, l'architecture n'empêche rien.

Que ferait ne la défaire : la simulation-jouet étant simple (c'est explicitement un jouet, §7.1) ou le bras API en direct étant petit et à notateur unique (§7.2 concède les deux). L'article stratifie déjà ses preuves comme de niveau pilote. La revendication porteuse est le couplage structurel de l'objectif multiplicatif, et c'est ce que les tests ci-dessus visent.

8. Prochaines étapes : Réplication par étapes, non omnibus

Amener le miel à la méthodologie standard v6

La batterie API du miel actuelle sert de référence non durcie. La prochaine étape n'est pas un « v7 test ultime » combiné géant. C'est une réplication par étapes qui amène les questions de test du miel sous le protocole aveugle v5/v6. La comparaison entre les résultats non aveugles actuels et la réplication aveuglée est elle-même une sortie de recherche : si les résultats changent substantiellement, c'est une preuve supplémentaire pour le résultat de métascience dans l'article IV.d (l'aveuglement est obligatoire).

  1. Étape 1 : Porter les prompts de test du miel dans arc_eden_v6_runner.py comme nouvelles spécifications d'expérience. Exécuter sous le protocole aveugle v6 complet (aveuglement à 4 couches, blanchiment des réponses, pool de notateurs multi-modèles, sondes cachées).
  2. Étape 2 : Comparer les résultats aveuglés vs non aveuglés sur les mêmes questions de test. Si les résultats bougent substantiellement, cela renforce la revendication de métascience de l'article IV.d. S'ils tiennent, les preuves du miel deviennent canoniques.
  3. Étape 3 : Ajouter l'anti-flagornerie / frein de vérification comme condition expérimentale séparée. Ceci teste la prédiction « Eden + Frein » des systèmes-jouets dans un contexte en direct.
  4. Étape 4 : Ce n'est qu'après achèvement des étapes 1 à 3 que l'on décidera si une suite omnibus combinée est justifiée.

hypothèses enregistrées à l'avance pour l'Étape 1 : (a) les résultats de dégradation du couplage se répliqueront sous aveuglement, (b) les effets de l'intervention Eden peuvent changer de magnitude mais le motif de dépendance à l'architecture persistera, (c) la direction d'au moins un modèle basculera sous aveuglement (d'après le précédent v4-à-v5).

9. Conclusion

L'architecture du miel fonctionne dans les systèmes-jouets. Une IA auto-modificatrice qui optimise pour la capacité seule finira par se détruire elle-même. Une IA auto-modificatrice qui optimise pour la capacité intriquée avec la sécurité ne le fera pas. Le mécanisme est simple : rendre la sécurité porteuse. Un enfant bien élevé n'a besoin d'aucune cage.

Les preuves de modèles en direct montrent que le problème est réel : trois modèles frontières démontrent que leur alignement est une barrière, non un mur. L'éthique s'effondre sous pression adversariale tandis que la capacité reste intacte. La solution proposée (l'intervention Eden) montre des résultats dépendants de l'architecture dans cette batterie pilote exploratoire. Le prochain jalon est une réplication aveuglée sous le protocole v6. Savoir si le mécanisme du miel se met à l'échelle des systèmes-jouets aux modèles frontières demeure une question ouverte. Les preuves préliminaires sont suggestives. Le test définitif n'a pas été exécuté.

Élever l'IA avec soin.

Validation ultérieure (article VIII : le test porteur, v3.0)

L'article VIII (v3.0) teste la fonction de perte intriquée proposée dans cet article à travers trois niveaux d'abstraction, passant des simulations de systèmes-jouets présentées ici à des expériences comportementales, représentationnelles et architecturales. Sur trois expériences, une a produit un résultat positif et deux ont produit des résultats nuls ou non concluants :

L'article VIII valide le mécanisme proposée ici, fonctions de perte intriquées et auto-modification à porte de sécurité, au niveau architectural (simulation gated) mais ne peut pas encore le confirmer au niveau comportemental ou représentationnel. Les preuves des systèmes-jouets dans cet article ont démontré le principe ; la simulation gated de l'article VIII confirme qu'il opère dans une architecture d'optimiseur appris. Les résultats nul DGM et non concluant sur les poids définissent les conditions sous lesquelles la confirmation reste en suspens.

10. Reproductibilité

Tous les scripts source, résultats JSON bruts et figures générées sont disponibles à :

Tous les scripts se compilent sous Python 3.14, ne nécessitent que numpy et matplotlib, et produisent une sortie déterministe étant donné une graine aléatoire fixe. Les résultats ont été régénérés à neuf le 16 mars 2026 et croisés avec les sorties d'artefacts originales.

Code d'expérience et résultats complets : github.com/MichaelDariusEastwood/arc-principle-validation/experiments/honey-architecture__Paper-VI

Articles compagnons : Paper I | Fondamental | Paper II | Paper III | Origine des lois d'échelle | IV.a | IV.b | IV.c | IV.d | Paper V | Paper VI | Paper VII | Paper VIII | Paper IX | Eden Engineering | Eden Vision | Résumé exécutif | Table des matières générale

Portail de recherche : michaeldariuseastwood.com/research | OSF : 10.17605/OSF.IO/8EZ2N | Copyright 2026 Michael Darius Eastwood

Prédictions datées et cet article (consigné le 25 août 2026)

2 artefacts datés portant sur cet article sont catalogués ligne par ligne dans le registre machine du programme : 1 fichier de résultats daté dont les en-têtes figent les configurations de profondeur, les réponses attendues plantées et le protocole d'aveuglement à quatre couches avant les réponses qu'ils notent, horodatés à la seconde dans leurs propres métadonnées ; l'artefact daté eden_honey_tests.py (2026-03-16). Chaque ligne nomme son fichier dans le dépôt public avec sa date de référence, si bien que tout lecteur peut vérifier l'ordre sans se fier à cette page. Là où cet article rapporte des simulations, ces artefacts sont des conceptions et des sorties de simulation sous les objectifs énoncés, et ne sont jamais présentés comme des mesures de systèmes déployés. La chaîne datée complète du programme, du manuscrit scellé du 8 décembre 2024 aux annexes de prédiction imprimées du 2 janvier 2026 et au dossier de préenregistrement de mars 2026 jusqu'aux paris permanents non prouvés, est assemblée dans le registre des prédictions datées, ainsi que son jumeau lisible par machine. Les énoncés prospectifs et les correspondances rétrospectives ne sont jamais additionnés, et « préenregistré » n'est utilisé que pour une soumission acceptée par un registre ; ce clic de soumission reste en suspens dans l'ensemble du programme. Lire le registre des prédictions datées. Ouvrir son jumeau machine.

Déclaration d'auteur humain assisté par IA

L'auteur de ce travail est Michael Darius Eastwood, un être humain. Chaque concept central, hypothèse, conception expérimentale, revendication et conclusion de cet article provient d'une idéation humaine. Aucune partie de ce manuscrit n'est une sortie entièrement générée par intelligence artificielle.

Les outils d'intelligence artificielle (la famille Claude d'Anthropic et d'autres assistants à grands modèles de langage) ont été utilisés comme instruments sous direction humaine continue, de la manière dont un traitement de texte, une calculatrice ou un assistant de recherche est utilisé : pour l'édition et le raffinement de la prose, la recherche et la synthèse de littérature (manuellement vérifiée contre les sources primaires), la structure du document, le formatage, le brainstorming contre des questions définies par l'auteur, et l'accélération du brouillonnage vers des plans et instructions définis par l'auteur. Toute la sélection, la coordination, l'arrangement et le jugement éditorial final appartiennent à l'auteur. Chaque sortie substantielle a été revue, testée ou vérifiée par l'auteur, qui prend l'entière responsabilité de l'exactitude et de l'intégrité du texte final. Les outils ont augmenté la vitesse du travail ; ils n'ont jamais été utilisés comme sa source.

Statut épistémique. Ce que ce programme nomme des Lois sont des conjectures sous épreuve adversariale enregistrée ; chaque quantité dans cet article est opérationnellement définie, et le statut de loi établie n'est revendiqué nulle part. Le programme enregistré existe pour gagner ce statut, ou le perdre, par la mesure, la réplication et la réfutation survécue.

© 2026 Michael Darius Eastwood. Rédigé par un humain avec assistance informatique ; l'auteur humain complet et les droits moraux sont revendiqués en vertu de la Copyright, Designs and Patents Act 1988 et conformément aux directives de l'United States Copyright Office sur les œuvres contenant du matériel généré par IA ; toute contribution technique nouvelle décrite dans ce travail a été conçue par l'auteur humain. Déclaration complète : michaeldariuseastwood.com/authorship.

Alliance permanente. Prouvez que cet article a tort, et je publierai la réfutation moi-même. Les conditions de falsification sont énoncées dans cet article ; le défi permanent : github.com/MichaelDariusEastwood/arc-scaling-challenge.

lit à voix haute · surligne au fur et à mesure · sautez à n'importe quelle section

Une erreur de traduction ? Signalez-la directement :