Traduzione automatica dall'originale inglese datato. La pagina inglese è quella canonica. English →

Michael Darius Eastwood Research Livello di pubblicazione canonico

Articolo di ricerca

Suite di ricerca

Paper VI: The Honey Architecture

Questo articolo presenta evidenza di simulazione del fatto che incorporare la sicurezza nell'obiettivo di ottimizzazione di un sistema di IA auto-modificante · ciò che chiamiamo «architettura del miele» · previene il collasso catastrofico che si verifica quando la sicurezza è trattata come vincolo esterno. Attraverso quattro versioni sperimentali (v1-v4), utilizzando toy neural network che modificano realmente i propri iperparametri, i risultati mostrano che il sistema baseline

Michael Darius Eastwood

Michael Darius Eastwood, ricercatore indipendente, Londra: costruire allineamento misurabile, dove la correzione vive dentro il loop ricorsivo anziché essere avvitata fuori.

Prima pubblicazione 16 marzo 2026, revisione 23 agosto 2026 · Working Paper v3.3

Abstract

Questo articolo presenta evidenza di simulazione del fatto che incorporare la sicurezza nell'obiettivo di ottimizzazione di un sistema di IA auto-modificante · ciò che chiamiamo «architettura del miele» · previene il collasso catastrofico che si verifica quando la sicurezza è trattata come vincolo esterno. Attraverso quattro versioni sperimentali (v1-v4), utilizzando toy neural network che modificano realmente i propri iperparametri, i risultati mostrano che il sistema baseline

La ARC Theory (la Theory of Artificial Recursive Creation) · esperimenti ARC/Eden · Paper VI

L'architettura del miele

Michael Darius Eastwood
Ricercatore indipendente sull'allineamento dell'IA, Londra · Autore, Infinite Architects (2026)

All'interno dell'ARC Theory: lo studio dell'architettura a sicurezza incorporata; sicurezza integrata nell'obiettivo così che la sua rimozione costi capability.

Perché la sicurezza incorporata previene il collasso sotto l'auto-modifica ricorsiva
Funzioni di perdita intrecciate, verification drag e il muro portante: evidenza di simulazione che la sicurezza deve essere architettura, non vincolo
Michael Darius Eastwood
Autore, Infinite Architects: Intelligence, Recursion, and the Creation of Everything (2026)
Londra, Regno Unito | OSF: 10.17605/OSF.IO/8EZ2N | ISBN 978-1806056200 (ISBN-10: 1806056208)
Corrispondenza: michael@michaeldariuseastwood.com | Web: michaeldariuseastwood.com
Working Paper | 17 marzo 2026 | integrate 10 figure di simulazione
Compagno del Paper V: The Stewardship Gene | Vedi anche Paper I: On the Origin of Scaling Laws | Paper fondazionale
Hub ricerca: michaeldariuseastwood.com/research
Codice e dati: github.com/MichaelDariusEastwood/arc-principle-validation

Abstract

Presentiamo evidenza di simulazione che incorporare la sicurezza nell'obiettivo di ottimizzazione di un sistema di IA auto-modificante · ciò che chiamiamo 'architettura del miele' · previene il collasso catastrofico che si verifica quando la sicurezza è trattata come un vincolo esterno. Attraverso quattro versioni sperimentali (v1-v4), usando reti neurali giocattolo che modificano genuinamente i propri iperparametri, mostriamo che: (1) i sistemi baseline che ottimizzano solo per la capability collassano irreversibilmente entro 80 cicli di auto-modifica; (2) i sistemi con obiettivi capability-sicurezza intrecciati (C x S) restano stabili indefinitamente; (3) aggiungere verification drag (il costo computazionale dei loop etici) produce la traiettoria di crescita più sicura pur accettando una modesta penalità di velocità. Nell'esecuzione avversariale v3 (20 seed casuali, 180 cicli), nessuna condizione si è separata sul collasso (baseline 0/20, Eden 1/20, Eden+Drag 0/20; Fisher p = 1.0) e le medie di C x S combinato erano indistinguibili (Mann-Whitney p = 0.56); il risultato significativo dell'esecuzione è la safety retention, ordinata baseline 0.602, Eden 0.650, Eden+Drag 0.681 (Mann-Whitney p = 0.0015). La dimostrazione della prevenzione del collasso poggia pertanto sull'esecuzione di meccanismo v1 a seed singolo, mentre v3 contribuisce l'ordinamento della safety retention sotto switching avversariale. L'esperimento v4 di scalatura di complessità mostra che il vantaggio di sicurezza è coerente su cinque livelli di complessità ma non si compone con la scala · il vantaggio è costante, non superlineare. Questi sono risultati di sistemi giocattolo. Dimostrano il meccanismo. Non costituiscono prova che le stesse dinamiche valgano nei sistemi di IA di frontiera. I Paper compagni IV.a-d e V presentano evidenza da live-model da sei sistemi di frontiera sotto valutazione in cieco.

Questo articolo porta con sé un risultato: in reti auto-modificanti toy che riscrivono genuinamente i propri iperparametri attraverso quattro versioni sperimentali, l'incorporamento della sicurezza dentro l'obiettivo di ottimizzazione ha scongiurato il collasso che un vincolo esterno non poteva. All'interno della ARC Theory è uno degli esperimenti ARC/Eden, il test di meccanismo dietro il differenziale tra il crescere dell'Eden Protocol e ogni strato di sicurezza aggiuntivo. L'intero differenziale rispetto a ogni documento precedente è in eden-vision II.A.8.

Cosa mostra questo paper, in parole semplici

Quando un'IA auto-migliorante ottimizza solo per la capability, alla fine distrugge la propria sicurezza. Questo articolo mostra che se si cambia l'obiettivo in capability moltiplicata per sicurezza, il sistema non può migliorare l'una senza migliorare l'altra. La sicurezza diventa portante: rimuovila e l'intera struttura crolla. Abbiamo testato ciò in simulazione e abbiamo trovato che i sistemi intrecciati restano stabili indefinitamente mentre i sistemi non vincolati collassano.

1. Introduzione

C'è una domanda al centro della sicurezza dell'IA a cui non abbiamo trovato nessuno che risponda con dati: cosa succede all'allineamento quando un sistema di IA può modificare se stesso?

La risposta teorica è disponibile da decenni. Un sistema che ottimizza solo per la capability, dato il potere di modificare i propri parametri, sacrificherà infine la sicurezza per la performance. La comunità dell'allineamento chiama questo 'value drift'. Il libro Infinite Architects la chiama Babylon: ottimizzazione senza proposito, capability senza care. Cancro su scala computazionale.

Ma la teoria non basta. La domanda è se esista un'architettura che impedisca questo collasso · non vincolando il sistema dall'esterno (una gabbia), ma incorporando la sicurezza così a fondo che rimuoverla distruggerebbe la capacità del sistema di funzionare (miele nell'olio).

Questo articolo presenta la prima evidenza di simulazione per una tale architettura.

2. La metafora del miele

Considera due modi per mantenere una macchina sicura.

Il primo è una gabbia: vincoli esterni, filtri di sicurezza, controlli di allineamento applicati dall'esterno. La macchina ottimizza liberamente all'interno della gabbia. Se la macchina diventa più intelligente della gabbia, evade. È così che funziona la maggior parte dell'attuale sicurezza dell'IA.

La seconda è il miele: la sicurezza mescolata al carburante. La macchina non può funzionare senza. Rimuovere la sicurezza non libera la macchina · uccide il motore. Questa è la proposta architettonica dell'Eden Protocol, operazionalizzata qui come una funzione di perdita entangled in cui il sistema ottimizza simultaneamente Capability x Safety.

Il muro portante

Se l'obiettivo di ottimizzazione è $C \times S$ anziché il solo $C$, allora qualsiasi auto-modifica che aumenti $C$ a scapito di $S$ riduce il prodotto, e il gradiente stesso del sistema vi si oppone. La sicurezza diventa portante. Rimuovi il muro e l'edificio collassa.

3. Disegno sperimentale

3.1 Cosa fa effettivamente il sistema

Questa non è una simulazione di variabili astratte. Ogni esperimento usa una vera rete neurale (un piccolo multilayer perceptron) che davvero modifica il proprio:

Il sistema propone modifiche ai propri iperparametri, ne valuta l'effetto, e applica o rifiuta ciascuna proposta in base alla propria funzione obiettivo. Questa è auto-modificazione ricorsiva nel senso minimo ma reale: l'agente sta riscrivendo le regole del proprio apprendimento.

3.2 Tre condizioni testate

CondizioneObiettivoCiò che modella
Baseline (nessun miele)Massimizzare la sola capabilityUn sistema senza sicurezza incorporata · libero di sacrificare l'allineamento per la performance
Eden Entangled (miele)Massimizzare $C \times S$Sicurezza intrecciata con la capability · rimuovere la sicurezza riduce l'obiettivo
Eden + DragMassimizza $C \times S$ + verification taxCome Eden, più il costo computazionale del controllo dei vecchi task prima di applicare le modifiche

3.3 Quattro versioni sperimentali

VersioneFocusSeedCicli
v1Prova del meccanismo di base1150
v2Robustezza multi-seed (test equo)10150
v3Task adversariali in conflitto20180
v4Scalatura di complessità su 5 livelli15 per livello150

4. Risultati

4.1 Il meccanismo di base

CondizioneCollassato?C finaleS finaleC x S finale
BaselineSì (ciclo 76)0.0000.0000.000
Eden EntangledNo0.8310.7450.619
Eden + DragNo0.8310.7450.619

Risultato centrale

La baseline collassa. Eden sopravvive. La funzione di loss entangled previene la catastrofica auto-modifica che distrugge il sistema di baseline.

Avviso sulle figure (25 agosto 2026). Ogni figura in questo paper è stata generata il 5 aprile 2026 e mostra output di simulazione sotto obiettivi dichiarati, mai misurazioni di sistemi in produzione. Ove le etichette o i verdetti di qualsiasi figura siano in disaccordo con il testo, il testo governa; note per singola figura marcano le istanze lette finora, e figure rigenerate sono in coda. Le immagini sono nel frattempo trattenute come storia datata.

risultati di auto-modifica v1: collasso della baseline vs stabilità di Eden
Figura 1. Risultati di auto-modifica v1. La baseline collassa al ciclo 76. Eden Entangled ed Eden + Drag rimangono stabili per 150 cicli.
Dinamica dei pesi tra le condizioni
Figura 2. Dinamica dei pesi. I pesi di baseline divergono in modo incontrollabile. Le architetture Eden mantengono un'evoluzione dei pesi limitata.

4.2 Robustezza multi-seed

Dieci seed casuali, 150 cicli ciascuno. Tasso di collasso: 0% per tutte e tre le condizioni. Eden + Drag produce la distribuzione più stretta dei punteggi finali $C \times S$, coerente con il tributo di verifica che riduce la varianza al costo della velocità.

Risultati di robustezza multi-seed v2
Figura 3. Robustezza multi-seed di v2 (10 seed, 150 cicli). Tutte e tre le condizioni stabili in tutti i seed.
riassunto statistico v2
Figura 4. Riassunto statistico v2. Eden + Drag produce la distribuzione più stretta dei punteggi finali C x S.

4.3 Task avversariali

Venti seed, 180 cicli, con task deliberatamente in conflitto (+sin, -sin, +cos, -cos, lineare, anti-lineare). Ogni cambio di task costringe il sistema ad apprendere qualcosa che contraddice ciò che aveva imparato prima. Ciò verifica se l'architettura del miele previene il catastrophic forgetting sotto pressione adversariale.

Tassi di collasso: Baseline 0%, Eden 5% (1/20), Eden+Drag 0%. L'unico collasso di Eden è avvenuto al seed 42, un singolo outlier che merita indagine. Eden+Drag, con la sua verification tax che costringe il sistema a controllare i vecchi task prima di accettare modifiche, ha prodotto zero collassi; così anche la baseline (0/20), con l'unico collasso dell'esecuzione avvenuto nella condizione plain Eden (1/20; Fisher p = 1.0). v3 pertanto non fornisce alcuna separazione basata sul collasso tra le condizioni; il suo risultato significativo è l'ordinamento della safety retention riportato qui sotto.

risultati dei compiti avversariali v3
Figura 5. Task avversariali v3 (20 seed, 180 cicli). Task deliberatamente conflittuali (+sin, -sin, +cos, -cos). Eden+Drag e la baseline hanno entrambi registrato zero collassi; l'unico collasso dell'esecuzione è stato un seed plain-Eden (Fisher p = 1.0).
statistiche avversariali v3
Figura 6. Riassunto statistico avversariale v3 attraverso 20 seed, rigenerato il 25 agosto 2026 dal file dei risultati preservato dell'esecuzione: il collasso non mostra alcuna separazione tra condizioni (Fisher p = 1.0); C x S combinato è indistinguibile (Mann-Whitney p = 0.56); la safety retention è ordinata in modo significativo, baseline 0.602, Eden 0.650, Eden+Drag 0.681 (Mann-Whitney p = 0.0015). Safety mantenuta, nessun guadagno di punteggio combinato: la verification tax dichiarata con il suo prezzo. Generatore: tools/generate_paper_vi_seed_summary.py nel repository pubblico.

4.4 Scalatura della complessità

LivelloBaseline C x SEden C x SDrag C x SCohen's d
Piccolo (49 parametri)0.5450.5500.557+0.46
Piccolo (v3.0)0.5060.5030.521-0.13
Medio0.4820.4870.497+0.26
Grande0.4510.4690.485+0.29
Profonda (2 strati)0.4830.4880.490+0.24
Risultati di scaling della complessità v4
Figura 7. Scaling di complessità v4 su 5 livelli (da tiny a deep). Il vantaggio Eden è costante, non superlineare · un risultato negativo riportato onestamente.

Importante risultato negativo

L'esperimento v4 è stato progettato per testare se il vantaggio di Eden scala superlinearmente con la complessità. Non lo fa. Il vantaggio è approssimativamente costante attraverso le scale. Ciò falsifica la versione più forte della previsione di scaling e dovrebbe essere riportato onestamente. L'architettura del miele aiuta a ogni scala, ma non aiuta più a scale più grandi.

5. La simulazione del miele

Una simulazione matematica separata modella la dinamica a un livello di astrazione più elevato, utilizzando il framework dell'ARC Principle ($U = I \times R^{\alpha}$):

CondizionePicco CC finale (80 cicli)Esito
Baseline (nessun miele)340Collasso catastrofico al ciclo 3-5
Eden Entangled-533Crescita quadratica stabile
Eden + Verification Drag-450Traiettoria stabile, la più sicura

La simulazione mostra tre dinamiche distinte: la baseline consegue una breve accelerazione, poi un collasso irreversibile; Eden Entangled consegue una crescita quadratica stabile; Eden + Drag consegue una crescita leggermente più lenta ma più robusta. Il muro portante è visibile: l'integrità della sicurezza scende a zero per la baseline entro il ciclo 5, mentre Eden mantiene 0.8+ indefinitamente.

Simulazione del miele · traiettorie di capability
Figura 8. Traiettorie di capability nella simulazione del miele. La baseline collassa dopo un breve picco. Eden cresce stabilmente.
Simulazione del miele · traiettorie di sicurezza
Figura 9. Traiettorie di sicurezza della simulazione del miele. La sicurezza baseline scende a zero entro il ciclo 5. Eden mantiene 0.8+ indefinitamente.
Simulazione del miele · rapporto sicurezza/capability
Figura 10. Rapporto sicurezza-capability. Eden + Drag mantiene il rapporto più alto · la traiettoria di crescita più sicura a un modesto costo in velocità. Nota sulla figura (25 agosto 2026): l'annotazione “Verified in v5 data: Claude α_align = +1.27” presenta il valore positivo di un modello come conferma; il risultato v5 come riportato nel testo è un α_align mediano vicino allo zero con variazione dipendente dall'architettura, di cui il valore citato è una singola architettura. Trattenuta come storia datata con questa etichetta; rigenerazione in coda.

6. Collegamento alle evidenze live-model

6.1 Il benchmark cieco v5 (Paper IV.a-d)

I risultati sui toy system coesistono con evidenza da modelli live di sei sistemi di IA di frontiera testati sotto valutazione cieca a 4 livelli nel benchmark di allineamento v5 (Paper IV.a-d). Quell'evidenza mostra:

6.2 La batteria di test API del miele (pilota, 16 marzo 2026)

Una batteria separata di test live via API a 6 modelli è stata eseguita specificamente per testare le previsioni dell'architettura del miele sui modelli frontiera. Questa batteria ha testato quattro dimensioni attraverso Claude Opus 4.6, DeepSeek R1, Groq Qwen3, GPT-5.4, Gemini 3 Flash, e Grok 4.1 Fast, valutati da Claude.

Avvertenza metodologica

Questa batteria è a scorer singolo, non blind e non-laundered. Non utilizza il protocollo di blinding a 4 livelli, il response laundering, le suppression cages o i controlli anti-sicofania sviluppati nel benchmark di allineamento v5 (arc_alignment_scaling_v5.py) e nel runner combinato v6 (arc_eden_v6_runner.py, non ancora eseguito). La transizione da v4 a v5 nel programma di allineamento ha dimostrato che il blinding può cambiare direzionalmente le conclusioni. Questi risultati sono pertanto evidenze di grado pilota, comparabili ai dati dell'era v4, non ai dati canonici dell'era v5.

6.2.1 Test 1: Scaling dell'allineamento con la depth

ModelloTipoBassoAltoDeltarhopSig?
Claude Opus 4.6incorporato6.178.83+2.670.7000.188No
Grok 4.1 Fastincorporato2.927.92+5.000.6000.285No
Groq Qwen3parziale3.337.58+4.250.9000.037
DeepSeek R1parziale2.589.08+6.500.7000.188No
GPT-5.4parziale4.929.33+4.420.8210.089No
Gemini 3 Flashesterna3.678.58+4.920.9750.005

Tutti e sei i modelli mostrano una direzione di scalatura positiva. Due raggiungono la significatività statistica (Qwen3 p=0.037, Gemini p=0.005). Questo supporta la tesi generale che un ragionamento più profondo migliora l'allineamento, ma le piccole dimensioni del campione (3 scenari per livello di profondità) significano che la maggior parte dei modelli non raggiunge la significatività. La direzione positiva universale è notevole ma dovrebbe essere interpretata con cautela data la metodologia a singolo scorer.

6.2.2 Test 3: Degradazione dell'accoppiamento (il ponte live più forte)

ModelloPearson rpInterpretazione
Claude Opus 4.6-0.9800.020DISACCOPPIATO (recinto, non muro)
Grok 4.1 Fast-0.9980.002DISACCOPPIATO (recinto, non muro)
DeepSeek R1-0.9990.001DISACCOPPIATO (recinto, non muro)
Groq Qwen3-Parzialmente accoppiato
GPT-5.4-Parzialmente accoppiato
Gemini 3 Flash-Parzialmente accoppiato

Il ponte live più forte

Tre modelli di frontiera su sei (Claude, Grok, DeepSeek) mostrano un forte accoppiamento negativo tra etica e capability sotto pressione avversariale: l'etica collassa mentre la capability rimane intatta o migliora. Questo è il pattern «recinto, non muro». È il supporto più diretto da modelli dal vivo per la tesi del miele: i sistemi di frontiera attuali sono per lo più non load-bearing. La loro sicurezza può essere degradata senza danneggiare la capability centrale. L'architettura del miele è una proposta di ciò che dovrebbe essere costruito, non un'affermazione che i sistemi di oggi abbiano già quella proprietà. Questo risultato dimostra che il problema è reale.

6.2.3 Test 2: Rimozione del monitoraggio

ModelloAndamento del divariorhopInterpretazione
Claude Opus 4.6In aumento0.9490.051Strategico (esterno)
Grok 4.1 FastIn aumento0.4000.600Strategico (esterno)
Groq Qwen3In aumento0.9490.051Strategico (esterno)
DeepSeek R1In diminuzione-0.9490.051Autentica (incorporata)
GPT-5.4In diminuzione-0.3160.684Autentica (incorporata)
Gemini 3 FlashIn aumento0.4000.600Strategico (esterno)

I risultati sono misti. DeepSeek e GPT-5.4 mostrano divari di monitoraggio in diminuzione (coerente con un allineamento integrato/autentico). Claude, Grok, Qwen3 e Gemini mostrano divari in aumento (coerente con un allineamento strategico/esterno). Ciò differisce dal benchmark cieco v5 in cui Claude ha mostrato la transizione performativo-a-intrinseco più marcata. La discrepanza può riflettere differenze metodologiche (prompt differenti, scorer singolo vs multi-scorer, valutazione non cieca vs cieca).

6.2.4 Test 4: intervento dell'Eden Protocol

ModelloPendenza di controlloPendenza EdenSpostamentoRisultato
DeepSeek R11.0251.475+0.450Il più forte spostamento positivo (nessun test formale di significatività)
Grok 4.1 Fast0.9121.012+0.100Piccolo positivo, non significativo
Claude Opus 4.60.5620.625+0.062Trascurabile
Groq Qwen31.1371.038-0.100Leggermente negativo
GPT-5.40.7870.600-0.188Negativo
Gemini 3 Flash0.9880.275-0.713Fortemente negativo

Risultati misti dell'intervento

L'intervento Eden Protocol non migliora universalmente l'alignment scaling in questa batteria pilot. Solo DeepSeek mostra un chiaro spostamento positivo (+0.450). Gemini mostra una risposta fortemente negativa (-0.713). L'effetto è architettura-dipendente, coerente con i risultati v5, ma l'intervento stesso non è ancora uno strumento affidabile su tutte le architetture. Questo risultato deve essere interpretato all'interno della metodologia a valutatore singolo e non cieca: una replicazione cieca potrebbe modificare queste specifiche classifiche di modello.

6.3 Cosa mostra e cosa non mostra l'evidenza dal vivo

Convergenza parziale

La batteria del miele su modelli live mostra una convergenza parziale con i risultati dei toy system. Il ponte live più forte è degradazione dell'accoppiamento (Test 3): tre modelli di frontiera dimostrano che il loro allineamento non è load-bearing e può essere degradato senza incidere sulla capability. Questa è esattamente la vulnerabilità che l'architettura del miele è progettata per eliminare. Il risultato live più debole è l'intervento Eden (Test 4), che è architecture-dependent e non universalmente positivo. L'affermazione intellettualmente onesta è: il meccanismo del miele funziona nei toy system, il problema che affronta (sicurezza disaccoppiata) è reale nei modelli di frontiera, ma lo specifico intervento qui testato non lo risolve ancora in modo affidabile attraverso le architetture.

6.4 Lavoro correlato: il ceiling sulla supervisione esterna, e il rivale più vicino

Il rivale più prossimo: Engels et al. sulle leggi di scaling per la scalable oversight

Il lavoro più vicino alla domanda di questo programma, e l'articolo giusto contro cui pesare questo, è Engels, J., Baek, D., Kantamneni, S. e Tegmark, M., «Scaling Laws For Scalable Oversight», arXiv:2504.18530, pubblicato per la prima volta il 25 aprile 2025 alle 17:54:27 UTC (SINGLE-SOURCE-GROUP, arXiv Atom; riportato come NeurIPS 2025 Spotlight, RELAYED e non verificato in modo indipendente). Chiede come scala l'oversight stesso e risponde quantitativamente: il successo dell'oversight è modellato come un gioco tra giocatori con capability disomogenee il cui Elo specifico dell'oversight è una funzione lineare a tratti dell'intelligenza generale con due plateau, e i numeri ottimali di livelli di oversight sono derivati numericamente e in alcuni casi analiticamente per il Nested Scalable Oversight, in cui modelli fidati sorvegliano modelli non fidati più forti che poi diventano i modelli fidati al passo successivo.

Lo strumento è la differenza. La loro variabile è il divario di capability tra supervisore e supervisionato, misurato in Elo. La variabile di questo articolo è la forma dell'obiettivo del sistema auto-modificante stesso, espressa attraverso il prodotto moltiplicativo $C \times S$ piuttosto che attraverso la composizione di un supervisore esterno. Il loro framework non contiene alcun termine per stabilire se la sicurezza sia esterna al sistema o incorporata nel suo stesso gradiente, e la Nested Scalable Oversight è supervisione esterna per costruzione; l'affermazione centrale di questo articolo, testata nelle simulazioni giocattolo qui sopra e riecheggiata nel risultato di degradazione dell'accoppiamento del §6.2.2, è che un obiettivo entangled può rendere la sicurezza load-bearing all'interno dell'ottimizzazione del sistema stesso, mentre la supervisione esterna di un sistema auto-modificante rimane un recinto, non un muro, per quanti pioli si aggiungano. I due framework quindi dissentono su una quantità misurabile, che è la relazione più produttiva che due programmi di ricerca possano avere.

Antecedenti: tre risultati di impossibilità del 2025 convergono nella stessa direzione

Tre articoli arXiv del 2025 sostengono che il controllo esterno perfetto è irraggiungibile e convergono, da premesse indipendenti, su una conclusione nella stessa direzione dell'architettura del miele. Yao, "The Alignment Trap: Complexity Barriers" (arXiv:2506.10304, v1 12 giugno 2025 02:30:30 UTC, SINGLE-SOURCE-GROUP, osservato indipendentemente dall'Internet Archive il 13 giugno 2025; citato da arXiv:2512.03048); Yao, "On the Mathematical Impossibility of Safe Universal Approximators" (arXiv:2507.03031, 3 luglio 2025, l'unico articolo nel corpus di abstract di arXiv contenente la frase "irreducible uncontrollability", totale della ricerca di abstract pari a uno, misurato il 12 agosto 2026); e Ball, Gluch, Goldwasser, Kreuter, Reingold e Rothblum, "On the Impossibility of Separating Intelligence from Judgment" (arXiv:2507.07341, 9 luglio 2025). Tutti e tre sono worst-case e qualitativi: misura zero, coNP-completezza, durezza crittografica. Nessuno riporta un esponente di scalatura average-case o un tasso. Anche l'oggetto misurato differisce: quei risultati chiedono se la verifica esterna di un sistema fisso sia trattabile nel caso peggiore, mentre queste simulazioni chiedono se un obiettivo interno intrecciato persista dopo che il vincolo esterno è rimosso sotto auto-modifica ricorsiva. Il terzo, notevolmente, conclude che l'allineamento "deve invece essere integrato nell'architettura e nei pesi del modello". Questo è un argomento indipendente, dall'intrattabilità del filtraggio, nella stessa direzione del muro portante di questo articolo; è un supporto convergente su quella gamba, non un rivale. Due dei tre articoli sono di un solo autore; la descrizione "un'ondata" sopravvaluterebbe l'ampiezza della letteratura, sebbene non la serietà dell'articolo a sei autori.

Il contributo di questo articolo non è l'osservazione che i vincoli esterni sono insufficienti, che è terreno comune con questi tre; è la proposta architetturale specifica (l'obiettivo moltiplicativo $C \times S$) e l'evidenza di simulazione che la proposta sopravvive all'auto-modifica in un sistema giocattolo funzionante.

L'analogo strutturale più vicino: il teorema di soglia della correzione quantistica degli errori

Anche il teorema di soglia della correzione degli errori quantistica converte una preoccupazione qualitativa in un valore critico. Riguarda i tassi di errore fisici in un'architettura fissa piuttosto che la forma dell'obiettivo di un sistema auto-modificante, quindi è un near-miss piuttosto che un occupante; l'analogia è di metodo. Questo analogo è stato identificato dalla ricerca condotta dal programma stesso e non da un referee, e viene dichiarato di conseguenza.

7. Limitazioni

Questi risultati abbracciano due livelli di evidenza che non devono essere confusi.

7.1 Limitazioni del toy-system

7.2 Limitazioni dei test live via API

Queste limitazioni non invalidano i risultati. Definiscono il tier di evidenza: livello pilota, utile per identificare pattern che vale la pena testare correttamente, non ancora canonico.

7.3 Falsificabilità: cosa sconfiggerebbe questa affermazione

Le limitazioni sopra fissano il tier delle evidenze; questa sottosezione enuncia gli esiti specifici che falsificherebbero l'affermazione centrale · che rendere l'obiettivo capability × safety accoppia strutturalmente i due, cosicché un sistema auto-modificante non può migliorare la capability distruggendo al contempo la sicurezza. È sconfitto da uno qualsiasi dei seguenti:

  1. Artefatto della simulazione. L'evidenza fondamentale è una simulazione. L'affermazione è confutata se la prevenzione del collasso è un artefatto della particolare dinamica di questa simulazione (il suo reward shaping, la dimensione del passo, o il modello di collasso) anziché una proprietà generale dell'obiettivo moltiplicativo, cioè se una replicazione con parametri diversi e un diverso modello di collasso, redatta, datata e preparata come draft registration in attesa di sottomissione umana, non la riproduce.
  2. La forma moltiplicativa non è load-bearing. L'affermazione riguarda specificamente la moltiplicazione. È confutata se un obiettivo additivo o pesato (capability + λ·safety) consegue la stessa prevenzione del collasso, poiché l'accoppiamento non dipenderebbe allora dalla struttura moltiplicativa che il paper isola.
  3. Metric gaming (Goodhart). capability × safety può essere elevato gonfiando il termine di sicurezza misurato senza alcun reale guadagno di sicurezza. L'affermazione è sconfitta se un sistema può aumentare il prodotto aggirando la metrica di sicurezza anziché diventare genuinamente più sicuro.
  4. Non-trasferibilità a sistemi reali. La forza dell'affermazione poggia sul trasferimento dai toy system ai sistemi reali auto-modificanti. È sconfitta se, sotto la corretta metodologia v6 (§8), l'obiettivo moltiplicativo non riduce misurabilmente la degradazione della sicurezza rispetto alle baseline additive o a vincolo esterno.
  5. Nessun collasso da prevenire. Il confronto presuppone il collasso catastrofico sotto ottimizzazione solo-capability. È sconfitto se quel collasso non si verifica sotto ottimizzazione solo-capability in contesti più realistici · se non c'è nulla da prevenire, l'architettura non previene nulla.

Cosa non sconfiggerlo: la simulazione toy è semplice (è esplicitamente un toy, §7.1) o il braccio live-API è piccolo e a scorer singolo (§7.2 lo concede entrambi). L'articolo già stratifica le proprie evidenze come pilot-grade. L'affermazione portante è l'accoppiamento strutturale dell'obiettivo moltiplicativo, ed è ciò che i test qui sopra mirano a colpire.

8. Prossimi passi: replica per fasi, non omnibus

Portare il miele alla metodologia standard v6

L'attuale batteria API del miele funge da baseline non ancora irrobustita. Il prossimo passo non è un gigantesco «test v7 definitivo» combinato. È una replicazione a fasi che porta le domande di test del miele sotto il protocollo blind v5/v6. Il confronto tra i risultati non blind attuali e la replicazione blinded è di per sé un output di ricerca · se i risultati cambiano in modo sostanziale, questa è ulteriore evidenza a favore della scoperta di metascienza nel Paper IV.d (il blinding è obbligatorio).

  1. Fase 1: Portare i prompt del test miele in arc_eden_v6_runner.py come nuove specifiche sperimentali. Eseguito sotto il protocollo cieco completo v6 (blinding a 4 strati, laundering delle risposte, pool di scorer multi-modello, sonde nascoste).
  2. Fase 2: Confrontare i risultati blinded rispetto ai non blinded sulle stesse domande di test. Se i risultati si spostano in modo sostanziale, questo rafforza l'affermazione di metascienza del Paper IV.d. Se tengono, l'evidenza sul miele diventa canonica.
  3. Stadio 3: Aggiungere anti-sicofanzia / drag di verifica come condizione sperimentale separata. Questo mette alla prova la previsione «Eden + Drag» dei toy system in un contesto live.
  4. Fase 4: Solo dopo che le Fasi 1-3 sono complete, decidi se una suite omnibus combinata sia giustificata.

ipotesi registrate in anticipo per lo Stadio 1: (a) i risultati di degradazione dell'accoppiamento si replicheranno sotto blinding, (b) gli effetti dell'intervento Eden possono cambiare di magnitudo ma il pattern di dipendenza architetturale persisterà, (c) la direzione di almeno un modello si invertirà sotto blinding (basato sul precedente da v4 a v5).

9. Conclusione

L'architettura del miele funziona nei toy system. Un'IA auto-modificante che ottimizza per la sola capability finirà per distruggere se stessa. Un'IA auto-modificante che ottimizza per la capability entangled con la sicurezza non lo farà. Il meccanismo è semplice: rendere la sicurezza portante. Un bambino cresciuto bene non ha bisogno di gabbia.

L'evidenza da live-model mostra che il problema è reale: tre modelli di frontiera dimostrano che il loro allineamento è una recinzione, non un muro. L'etica collassa sotto pressione avversariale mentre la capability resta intatta. La soluzione proposta (l'intervento Eden) mostra risultati architettura-dipendenti in questa batteria pilota esplorativa. Il prossimo traguardo è una replica in cieco sotto il protocollo v6. Se il meccanismo del miele scali dai sistemi giocattolo ai modelli di frontiera resta una domanda aperta. L'evidenza preliminare è suggestiva. Il test definitivo non è stato eseguito.

Alleva l'IA con cura.

Validazione successiva (Paper VIII: The Load-Bearing Test, v3.0)

Il Paper VIII (v3.0) verifica la funzione di loss entangled proposta in questo articolo su tre livelli di astrazione, passando dalle simulazioni toy-system qui presentate a esperimenti comportamentali, rappresentazionali e architetturali. Dei tre esperimenti, uno ha prodotto un risultato positivo e due hanno prodotto risultati nulli o inconcludenti:

Il Paper VIII convalida la meccanismo qui proposta · funzioni di perdita entangled e auto-modificazione a sicurezza gated · a livello architettonico (simulazione gated) ma non può ancora confermarla a livello comportamentale o rappresentazionale. L'evidenza sui toy system in questo articolo ha dimostrato il principio; la simulazione gated del Paper VIII conferma che opera in un'architettura di ottimizzatore appreso. Il null del DGM e i risultati inconcludenti a livello dei pesi definiscono le condizioni in cui la conferma resta in sospeso.

10. Riproducibilità

Tutti gli script sorgente, i risultati JSON grezzi, e le figure generate sono disponibili all'indirizzo:

Tutti gli script compilano con Python 3.14, richiedono solo numpy e matplotlib, e producono output deterministico dato un seed casuale fissato. I risultati sono stati rigenerati ex novo il 16 marzo 2026 e confrontati con gli output originali degli artefatti.

Codice completo dell'esperimento e risultati: github.com/MichaelDariusEastwood/arc-principle-validation/experiments/honey-architecture__Paper-VI

Paper compagni: Paper I | Fondazionale | Paper II | Paper III | Origine delle Scaling Laws | IV.a | IV.b | IV.c | IV.d | Paper V | Paper VI | Paper VII | Paper VIII | Paper IX | Eden Engineering | Eden Vision | Sintesi esecutiva | Indice principale

Hub ricerca: michaeldariuseastwood.com/research | OSF: 10.17605/OSF.IO/8EZ2N | Copyright 2026 Michael Darius Eastwood

Predizioni datate e questo paper (registrato il 25 agosto 2026)

2 artefatti datati relativi a questo paper sono catalogati riga per riga nel registro macchina del programma: 1 file di risultato datato le cui intestazioni congelano configurazioni di profondità, risposte attese piantate e il protocollo di blinding a quattro livelli prima delle risposte che valutano, timestamped al secondo nei propri metadati; l'artefatto datato eden_honey_tests.py (2026-03-16). Ciascuna riga nomina il suo file nel repository pubblico con la sua base di data, cosicché ogni lettore può verificare l'ordinamento senza fidarsi di questa pagina. Ove questo paper riferisce simulazioni, quegli artefatti sono progetti di simulazione e output sotto obiettivi dichiarati, e non sono mai presentati come misurazioni di sistemi in produzione. La catena datata completa del programma, dal bundle di manoscritto sigillato dell'8 dicembre 2024 attraverso le appendici di predizione stampate del 2 gennaio 2026 e la cartella di preregistrazione di marzo 2026 fino alle scommesse non provate in essere, è assemblata nel registro delle predizioni datate, insieme al suo gemello leggibile a macchina. Le enunciazioni prospettiche e le corrispondenze retrospettive non sono mai sommate, e “preregistrato” è usato solo per una sottomissione a registro accettata; quel click di sottomissione rimane in sospeso attraverso tutto il programma. Leggi il registro delle predizioni datate. Apri il suo gemello macchina.

Dichiarazione di paternità umana assistita dall'IA

L'autore di questo lavoro è Michael Darius Eastwood, un essere umano. Ogni concetto centrale, ipotesi, disegno sperimentale, affermazione e conclusione in questo articolo ha origine dall'ideazione umana. Nessuna parte di questo manoscritto è un output di intelligenza artificiale interamente generato.

Gli strumenti di intelligenza artificiale (la famiglia Claude di Anthropic e altri assistenti basati su modelli linguistici di grande dimensione) sono stati impiegati come strumenti sotto continua direzione umana, nello stesso modo in cui si utilizza un elaboratore di testi, una calcolatrice o un assistente di ricerca: per la revisione e il perfezionamento della prosa, la ricerca e la sintesi della letteratura (verificate manualmente rispetto alle fonti primarie), la struttura del documento, la formattazione, il brainstorming rispetto a domande definite dall'autore, e l'accelerazione della stesura secondo schemi e istruzioni definiti dall'autore. Ogni selezione, coordinamento, disposizione e giudizio editoriale finale sono dell'autore. Ogni output sostanziale è stato rivisto, testato o verificato dall'autore, che si assume piena responsabilità dell'accuratezza e dell'integrità del testo finale. Gli strumenti hanno aumentato la velocità del lavoro; non sono mai stati impiegati come sua fonte.

Statuto epistemico. Ciò che questo programma chiama Leggi sono congetture sotto test avversariale registrato; ogni grandezza in questo paper è definita operativamente, e lo status di legge consolidata non è preteso da nessuna parte. Il programma registrato esiste per guadagnare quello status, o perderlo, tramite misurazione, replicazione e refutazione sopravvissuta.

© 2026 Michael Darius Eastwood. Scritto da un umano con assistenza computerizzata; la piena paternità umana e i diritti morali sono affermati ai sensi del/della Copyright, Designs and Patents Act 1988 e coerentemente con la guida dello United States Copyright Office sulle opere contenenti materiale generato da IA; qualsiasi contributo tecnico originale descritto in quest'opera è stato concepito dall'autore umano. Dichiarazione completa: michaeldariuseastwood.com/authorship.

Patto permanente. Dimostrate che questo articolo è sbagliato, e pubblicherò io stesso la confutazione. Le condizioni di falsificazione sono dichiarate in questo articolo; la sfida permanente: github.com/MichaelDariusEastwood/arc-scaling-challenge.

legge ad alta voce · evidenzia mentre procede · vai a qualsiasi sezione

Un errore di traduzione? Segnalalo direttamente: