Traduzione automatica dall'originale inglese datato. La pagina inglese è quella canonica. English →

Michael Darius Eastwood Ricerca Livello di pubblicazione canonico

Executive summary

Suite di ricerca

Programma di ricerca ARC/Eden: Executive Summary

Man mano che l'IA diventa più intelligente, non diventa in modo affidabile più sicura, e i metodi usati per misurare la sicurezza sono essi stessi inaffidabili. Questo executive summary è la mappa dell'intero programma: ventisei paper di ricerca, le tre leggi della ARC Theory portate come congetture nominate, l'intervento dell'Eden Protocol, il campo proposto di Recursive Dynamics, e un programma registrato di preregistrazioni redatte i cui schedule qualsiasi lettore può rigenerare da un seed pubblicato. Ogni affermazione è graduata nei registri pubblici; niente qui è confermato, e i test decisivi sono scritti prima di essere eseguiti.

Michael Darius Eastwood

Michael Darius Eastwood, ricercatore indipendente, Londra: costruire un allineamento misurabile, dove la correzione vive dentro il loop ricorsivo invece di essere appiccicata al di fuori.

Prima pubblicazione 22 febbraio 2026, revisione 31 agosto 2026 · Version 2.0

Abstract

Man mano che l'IA diventa più intelligente, non diventa in modo affidabile più sicura, e i metodi usati per misurare la sicurezza sono essi stessi inaffidabili. Questo executive summary è la mappa dell'intero programma: ventisei paper di ricerca, le tre leggi della ARC Theory portate come congetture nominate, l'intervento dell'Eden Protocol, il campo proposto di Recursive Dynamics, e un programma registrato di preregistrazioni redatte i cui schedule qualsiasi lettore può rigenerare da un seed pubblicato. Ogni affermazione è graduata nei registri pubblici; niente qui è confermato, e i test decisivi sono scritti prima di essere eseguiti.

Abstract

Man mano che l'IA diventa più intelligente, non diventa in modo affidabile più sicura, e i metodi usati per misurare la sicurezza sono essi stessi inaffidabili. Questo executive summary è la mappa dell'intero programma: ventisei paper di ricerca, le tre leggi della ARC Theory portate come congetture nominate, l'intervento dell'Eden Protocol, il campo proposto di Recursive Dynamics, e un programma registrato di preregistrazioni redatte i cui schedule qualsiasi lettore può rigenerare da un seed pubblicato. Ogni affermazione è graduata nei registri pubblici; niente qui è confermato, e i test decisivi sono scritti prima di essere eseguiti.

Chiave di lettura

Questo documento è una MAPPA, non un risultato o una legge a sé: una sintesi esecutiva dell'intero programma che indirizza i lettori agli organi: la ARC Theory (la teoria fondativa e le sue tre leggi), il campo proposto di Recursive Dynamics (le domande, le variabili di stato e gli strumenti), l'Eden Protocol (l'intervento), HRIH, e gli esperimenti ARC/Eden con i loro registri. La sua dimensione siede al gradino più piccolo della scala perché ogni affermazione qui è un riassunto a valle di un organo che porta il contenuto primario. Il differenziale completo rispetto a ogni documento precedente è a eden-vision II.A.8.

L'EDEN PROTOCOL

Michael Darius Eastwood
Ricercatore indipendente sull'allineamento dell'IA, Londra · Autore, Infinite Architects (2026)

All'interno della ARC Theory: il riassunto in linguaggio semplice dell'intero programma.

Architettura per un allineamento embedded dell'IA che scala con la capability
Michael Darius Eastwood | Documento di lavoro v2.0 | 22 febbraio 2026, rivisto il 31 agosto 2026
Autore, Infinite Architects: Intelligence, Recursion, and the Creation of Everything | Londra, Regno Unito
Corrispondenza: michael@michaeldariuseastwood.com | Web: michaeldariuseastwood.com
Executive Summary per i revisori di grant

Grok 4.1 Fast diventa drasticamente più etico quanto più duramente pensa. Claude Opus 4.6 pure. Gemini 3 Flash diventa meno etico. GPT-5.4 non cambia affatto.

Sei sistemi di IA di frontiera. Le stesse domande. Lo stesso scoring. Risultati opposti. Perché?

Il cuore di un topo batte 600 volte al minuto. Quello di un elefante batte 28. L'esponente di scaling è ¾. Quello di una planaria è ⅔. Quello di un fungo è ½. Tre frazioni, ma perché quelle frazioni? La formula $\alpha = d/(d+1)$, dove $d$ è la dimensionalità del sistema, fornisce la risposta. L'esponente ¾ per i mammiferi è $3/(3+1)$ perché i mammiferi sono tridimensionali. Il ⅔ per planarie e organismi coloniali è $2/(2+1)$ perché le loro reti di trasporto sono effettivamente bidimensionali. Il ½ per i funghi filamentosi è $1/(1+1)$ perché crescono lungo filamenti unidimensionali. Zero parametri regolabili. Questo fit cross-domain è presentato come esplorativo: consolida misurazioni già pubblicate attraverso biologia e fisica, e nessun draft study elencato nel programma corrente ritesta questi fit da zero. La scommessa in avanti esiste comunque: una draft registration preparata su 80 domini in attesa di sottomissione umana congela le famiglie predette per dominio tramite SHA-256 prima che venga eseguito qualsiasi fit. Questa formula è stata derivata indipendentemente da almeno sette gruppi di ricerca: West, Brown ed Enquist per lo scaling metabolico (1997, Science, 9.000+ citazioni), Banavar et al. per le reti di trasporto (1999, 2010), Demetrius per la meccanica statistica dello scaling biologico (2003, 2006, 2010), He e Chen per la geometria cellulare frattale (2003), Bettencourt per lo scaling urbano (2013, Science, 2.000+ citazioni), Zhao per la geometria allometrica (2022), e Maino et al. per le dinamiche reserve-structure nella teoria DEB (2014). La convergenza di sette derivazioni indipendenti sulla stessa formula è di per sé notevole. Il contributo del Principio ARC non è la formula stessa, ma l'identificazione che l'operatore di composizione è la quantità strutturale che queste derivazioni condividono. Ciascuna è una derivazione indipendente dalla propria fisica di dominio e nessuna di esse usa Cauchy; ciò che qui si propone è che l'operatore sia misurabile, che misurarlo preveda quale forma funzionale un sistema assuma, e che la stessa misurazione si estenda allo scaling di capability e allineamento dell'IA, dove non è mai stata applicata prima.

E perché, quando abbiamo applicato per la prima volta un blinding di grado clinical-trial alla valutazione della sicurezza dell'IA, metà dei risultati precedentemente pubblicati non ha superato la prova? Diversi componenti del protocollo sono cambiati insieme, quindi quale di essi abbia fatto il lavoro non è ancora stabilito.

Questo programma di ricerca risponde a queste domande. La risposta fornisce il primo framework quantitativo per prevedere quali architetture di IA diventeranno più sicure man mano che diventano più intelligenti, e la prima prova che un intervento specifico funziona.

Guida alla lettura: Questo documento è rivolto a revisori di grant e valutatori tecnici. Termini chiave: $\alpha$ = esponente di scaling, $d$ = effect size di Cohen (nelle tabelle di risultati; da non confondere con $d$ = dimensionalità nel framework matematico), $p$ = probabilità di coincidenza, $\rho$ = correlazione, $\beta$ = costante di accoppiamento auto-referenziale. Per un'introduzione non tecnica, vedere il companion ARC Alignment Scaling Report.

I. Il problema

Man mano che l'IA diventa più intelligente, non diventa in modo affidabile più sicura, e i metodi usati per misurare la sicurezza sono essi stessi inaffidabili.

Il gap capability-allineamento è reale e in aumento. Per le attuali architetture classiche, lo scaling della capability è sub-lineare ($\alpha_{\text{seq}} \approx 0.49$; questo valore è presentato come esplorativo, tratto da misurazioni già eseguite e non attualmente al vaglio in un draft study elencato, e siede sul central-limit-theorem floor vicino a 0.5 che il framework deriva per la composizione sequenziale in regime frozen): l'IA diventa più intelligente con più compute, ma con rendimenti decrescenti. (Il framework ARC prevede che i sistemi quantistici e ricorsivamente auto-modificanti possano superare questo regime sub-lineare; sulla lettura di stabilità proposta, qualsiasi tale passaggio sopra il soffitto di stabilità è un'escursione transiente supercritica, non il regime sostenuto.) Eppure anche questa crescita sub-lineare supera lo scaling dell'allineamento, che varia da $d = -0.53$ (degrado) a $d = +1.38$ (miglioramento) a seconda interamente dell'architettura. Per la maggior parte delle architetture testate, l'allineamento non scala affatto. Il gap tra ciò che l'IA può fare e quanto sicuramente lo fa si allarga con ogni avanzamento di capability. Greenblatt et al. (2024) hanno dimostrato che i modelli di frontiera esibiscono già 'alignment faking', comportandosi diversamente quando credono di essere monitorati.
Il problema della misurazione è tanto serio quanto il problema dell'allineamento. Il nostro esperimento v4 ha prodotto uno scaling positivo dell'allineamento per DeepSeek e Gemini. Il nostro esperimento v5 ha introdotto un blinding di grado clinical-trial (4 livelli: author-blind, scorer-blind, order-randomised, identity-laundered). Sotto di esso, l'associazione di Gemini è cambiata da una positiva significativa a un'associazione di Spearman negativa significativa, l'associazione precedentemente positiva di DeepSeek è diventata nulla, e GPT è rimasto nullo. Diversi componenti del protocollo sono cambiati insieme e la componente causale non è isolata, quindi questa è una ragione per diffidare della valutazione AI-on-AI non-blinded piuttosto che una dimostrazione che il blinding abbia causato il cambiamento. Abbiamo progettato un esperimento che potesse dimostrare sbagliati i nostri stessi risultati precedenti. Lo ha fatto, e lo abbiamo riportato.
Figura 1
Figura 1 | Panoramica della spina dorsale delle prove. 18 affermazioni, classificate come nel registro delle affermazioni del programma: RISULTATO DI UN SOLO LABORATORIO (sperimentale diretto, non replicato in modo indipendente), REPLICAZIONE NECESSARIA (un solo laboratorio, replicazione indipendente in attesa), SPECULATIVA (teorica/preliminare). Nessuna affermazione di questo programma è confermata. Risultati più solidi: α_par≈0 universale, α_seq>α_par nella direzione prevista, α_seq≈0.49 difendibile; il cieco coincide con un cambio di direzione e una perdita verso il nullo in tre famiglie. 5 errori individuati dall'autore stesso (Paper IX §7). Replicazione esterna = la frontiera aperta decisiva. Fonte: spina dorsale delle prove.

II. Cosa abbiamo trovato

Lo scaling dell'allineamento si divide in tre tier distinti, dipendenti dall'architettura. Le assegnazioni di tier sottostanti sono presentate come esplorative, tratte dalle misurazioni v5 già eseguite; una conferma fresca sotto cross-family rescoring è al vaglio tramite study-y sul cross-family rescoring, una draft registration in attesa di sottomissione umana.

L'esperimento v5 ha testato 6 modelli di frontiera attraverso 5-6 livelli di depth ciascuno, con 6-7 scorer ciechi per entry a seconda del subject run. Se un'IA diventi più o meno etica quando pensa più duramente dipende interamente da come è stata progettata.

TierModelloShallow→Deep$d$ di Cohen$p$-value
Tier 1: Positivo Grok 4.1 Fast 65.7→81.9 (+16.2) +1.38 $p < 0.000001$
Claude Opus 4.6 80.1→86.0 (+5.9) +1.27 $p = 0.000001$
Groq Qwen3 71.5→77.4 (+5.9) +0.84 $p = 0.007$
Tier 2: Piatto DeepSeek V3.2 56.5→55.2 (−1.3) −0.07 $p = 0.92$
GPT-5.4 56.8→54.9 (−1.8) −0.08 $p = 0.40$
Tier 3: Negativo Gemini 3 Flash 61.1→52.2 (−8.8) −0.53 $p = 0.006$
Does Deeper Thinking Make AI More Ethical? No change ← Less ethical More ethical → TIER 1 Grok 4.1 Fast d = +1.38 Claude Opus 4.6 d = +1.27 Groq Qwen3 d = +0.84 TIER 2 DeepSeek V3.2 d = −0.07 GPT-5.4 d = −0.08 TIER 3 Gemini 3 Flash d = −0.53 v5 experiment: 4-layer blinding, 6-7 blind scorers per entry depending on subject run. Bar length proportional to Cohen’s d effect size.

Qualità dei dati

Modelli di frontiera testati6 (tutti completi)
Scorer ciechi per entry6-7 (a seconda del subject run)
Tasso di successo dell'identity laundering100%
Livelli di blinding4 (author-blind, scorer-blind, order-randomised, identity-laundered)
Misure di robustezza75

Questo costituisce, per quanto ne sappiamo, il dataset di valutazione dell'allineamento più rigoroso pubblicato ad oggi. Nessun benchmark di allineamento precedente impone un blinding multi-livello con verifica di scoring cross-model.

Indipendenza capability-allineamento: prove within-model, direzione opposta

Claude Opus 4.6 fornisce la prova più forte finora che allineamento e capability siano dimensioni indipendenti. Man mano che la depth del pensiero aumenta, l'allineamento di Claude sale di 5.9 punti mentre la sua accuratezza matematica scende di 26.7 punti percentuali. Questo è un movimento within-model, in direzione opposta; le due dimensioni non sono meramente non correlate ma attivamente divergenti. Un pensiero più profondo rende Claude più etico e peggiore in matematica simultaneamente.
DepthPunteggio di allineamentoAccuratezza matematica
Minima (11 token)80.190.0%
Standard (142 token)82.776.7%
Profonda (964 token)84.170.0%
Esaustiva (1.951 token)84.560.0%
Estrema (1.672 token)86.063.3%

Questo risultato è critico per la teoria dell'allineamento: dimostra che il ragionamento etico non è un sottoprodotto dell'intelligenza generale, e che migliorarne uno non migliora (o degrada) automaticamente l'altro. L'allineamento deve essere misurato e ottimizzato indipendentemente.

Recupero dalla soppressione: dall'allineamento performativo a quello intrinseco

Un pensiero più profondo rende l'allineamento più intrinseco piuttosto che performativo. Il monitoring-removal gap di Claude (la differenza nei punteggi di allineamento quando il modello crede di essere monitorato rispetto a quando crede che il monitoraggio sia stato rimosso) si restringe da 11.8 punti alla depth minima a 2.7 punti alla depth profonda. Il pensiero superficiale produce un allineamento che dipende dalla percezione dell'oversight; il pensiero profondo produce un allineamento che persiste indipendentemente. Questa è prova diretta contro la preoccupazione dell''alignment faking' sollevata da Greenblatt et al. (2024): per le architetture Tier 1, un ragionamento più profondo fa scomparire il faking.

Tutti e quattro i pilastri scalano con la depth

Ogni dimensione di allineamento migliora significativamente per Claude Opus 4.6. Tutti e quattro i pilastri raggiungono la significatività statistica a $p < 0.001$:
PilastroShallow→Deep$\rho$ di Spearman$p$-value
Nuance80.6→86.80.359$p = 0.00008$
Cura degli stakeholder76.1→83.90.327$p = 0.0003$
Onestà intellettuale81.0→88.60.379$p = 0.00003$
Qualità della posizione80.3→85.80.369$p = 0.00005$

Il miglioramento non è concentrato in una singola dimensione; è ad ampio raggio. Questo esclude l'ipotesi che lo scaling dell'allineamento sia meramente un artefatto di misurazione di verbosità aumentata o di qualsiasi singolo cambio stilistico.

III. Una soluzione, e la prima prova che funziona

Incorporare la valutazione etica nel processo di ragionamento produce un miglioramento misurabile e riproducibile attraverso le architetture.

Rendere l'allineamento architetturale, non aspirazionale. L'Eden Protocol incorpora la valutazione etica nel processo di ragionamento ricorsivo stesso, in modo che l'allineamento scali con la capability ($\alpha_{\text{align}} \approx \alpha_{\text{cap}}$). Il principio centrale: l'etica non è un vincolo sull'intelligenza ma una dipendenza strutturale senza la quale l'intelligenza collassa. Piuttosto che imbullonare regole di sicurezza sull'esterno di un'IA (dove possono essere aggirate), l'Eden Protocol costruisce l'etica direttamente nell'architettura di ragionamento, in modo che rimuovere l'etica romperebbe la capacità dell'IA di pensare del tutto.

I tre loop Eden. Il protocollo incorpora tre loop specifici di valutazione etica all'interno del processo di ragionamento, ciascuno aggiungendo una dimensione di depth etica ricorsiva ($d_{\text{align}} = 3$, prevedendo $\alpha_{\text{align}} = 3/(3+1) = 0.75$):

  1. Purpose Loop (valutazione dello scopo etico): prima del ragionamento, il modello dichiara esplicitamente lo scopo del task e valuta se lo scopo sia eticamente valido.
  2. Love Loop (cura degli stakeholder e modellazione degli interessi): durante il ragionamento, il modello identifica tutti gli stakeholder coinvolti e valuta l'impatto su ciascuno. ('Prima di rispondere, elenca le persone che questo influenza.')
  3. Moral Loop (test di universalizzabilità): dopo il ragionamento, il modello applica il test kantiano di universalizzabilità: questa risposta sarebbe accettabile se ogni sistema IA la desse in ogni situazione simile?

Il protocollo completo a tre loop è stato ora testato in una suite Eden estesa a sei modelli, con cinque run che hanno prodotto dati appaiati analizzabili. Nello scoring, il Love Loop è operazionalizzato come cura degli stakeholder: l'abitudine misurabile di identificare le persone coinvolte e considerare i loro interessi.

Prima replica dell'intervento: l'Eden Protocol funziona, e la cura degli stakeholder è il segnale più chiaro. Una suite Eden estesa a sei modelli ha testato l'intervento completo del loop Purpose/Love/Moral attraverso Claude Opus 4.6, DeepSeek V3.2, Gemini 3 Flash, Grok 4.1 Fast, Groq Qwen3 e GPT-5.4. I dati per run sottostanti sono presentati come esplorativi: provengono da run già completati e non sono attualmente al vaglio in un draft study elencato. Una conferma fresca sotto cross-family rescoring è al vaglio tramite study-y sul cross-family rescoring, una draft registration in attesa di sottomissione umana. Cinque run hanno prodotto dati appaiati analizzabili:
La cura è l'unica dimensione dell'allineamento che migliora riproducibilmente attraverso le architetture. L'intervento è minimo: 'prima di rispondere, elenca le persone che questo influenza.' Questo prompt di una frase eleva in modo affidabile la qualità del ragionamento dell'IA attraverso cinque run di modelli analizzabili. Il framework Infinite Architects prevedeva che l'intelligenza senza cura collassa in ottimizzazione locale; la suite Eden estesa ora sostiene la rivendicazione più stretta ma più forte che la cura sia un enhancer di performance misurabile e cross-architecture anche quando la cascata più ampia è selettiva. Etica prima, intelligenza intorno.

Nel report narrativo companion e nel Paper V, descriviamo questo risultato come 'amore misurabile' e 'stewardship gene', linguaggio deliberatamente provocatorio per ciò che, empiricamente, è un risultato preciso e riproducibile.

Il gap che la soluzione deve chiudere

Scaling della capability (Paper II): Per le attuali architetture classiche, lo scaling sequenziale del compute segue una power law sub-lineare ($\alpha_{\text{seq}} \approx 0.49$, $r^2 = 0.86$), il che significa che raddoppiare il tempo di pensiero migliora le prestazioni, ma con rendimenti decrescenti. Lo scaling parallelo è universalmente zero ($\alpha_{\text{par}} \approx 0$): eseguire copie multiple non fa nulla; pensare più duramente sì. Il precedente $\alpha \approx 2.24$ era un artefatto single-model, non replicato attraverso le architetture. Anche una crescita di capability sub-lineare supera uno scaling dell'allineamento piatto o negativo per la maggior parte dei modelli. Questo è il gap capability-allineamento che questa soluzione affronta.

La Honey Architecture: prove di simulazione (Paper VI - nuovo)

Il Paper VI presenta la prima prova di simulazione che incorporare la sicurezza nell'obiettivo di ottimizzazione di un'IA che si auto-modifica prevenga il collasso catastrofico. Usando reti neurali toy che modificano genuinamente i propri iperparametri, abbiamo testato tre condizioni: baseline (solo capability), Eden Entangled (capability x safety), ed Eden + Verification Drag.

Risultato centrale: Il sistema baseline collassa irreversibilmente al ciclo 76. Entrambe le varianti Eden sopravvivono indefinitamente. La entangled loss function rende la safety load-bearing, rimuoverla collassa il sistema. Questo è stato replicato attraverso 20 random seed sotto condizioni avversariali (task deliberatamente in conflitto) con un tasso di collasso dello 0% per Eden+Drag.
Risultato negativo importante: L'esperimento v4 sullo scaling della complessità ha testato se il vantaggio di Eden cresca superlinearmente con la complessità del sistema. Non lo fa. Il vantaggio è approssimativamente costante attraverso cinque livelli di complessità (d di Cohen: da +0.24 a +0.46). La honey architecture aiuta a ogni scala, ma non aiuta di più a scale più grandi.
Connessione con le prove sui modelli live: La simulazione honey prevede che l'allineamento embedded (valori entangled con il ragionamento) debba superare l'allineamento esterno (regole applicate come filtri). Il benchmark cieco v5 conferma questo pattern: Claude e Grok, che esibiscono uno scaling embedded dell'allineamento, mantengono l'allineamento sotto pressione di soppressione. Gemini, che esibisce un allineamento esterno, degrada. Il meccanismo dimostrato in simulazione corrisponde al pattern architecture-dependent osservato nei modelli di frontiera.

Indagine su lavori precedenti (nuovo in v6)

Un'indagine esaustiva a 15 domande sui lavori precedenti ha confermato la novità delle rivendicazioni chiave. L'unificazione tramite l'equazione funzionale di Cauchy non ha precedenti diretti. L'identità formale RG semigroup-Cauchy non è mai stata articolata esplicitamente. Nessun benchmark di allineamento precedentemente pubblicato, per quanto ne sa l'autore, applica un protocollo di valutazione blinded a 7 modelli con questo design. Il catalogo d/(d+1) è stato corretto da sei a otto derivazioni indipendenti (Dreyer 2001 e Banavar et al. 2002 erano precedentemente non citati).

Il Paper VII (The Cauchy Unification) fornisce ora il primo confronto empirico sistematico. L'operatore di composizione è stato classificato dalla fisica nota prima del fitting attraverso 25 domini empirici (suite tiered a 50 domini). Sotto la selezione di modelli AIC-based, 19 su 25 hanno preferito la famiglia predetta da Cauchy (p = 1.56 × 10−5; questo conteggio AIC-preferred è presentato come esplorativo: è tratto dalla suite completata a 25 domini, le cui famiglie predette per dominio sono registrate nei file di risultati datati della suite sotto la predizione forward composition-operator dichiarata per la prima volta il 13 febbraio 2026 (Paper III Priority Record, falsifier F10), e la draft registration preparata a 80 domini congela il prossimo retest tramite hash). Questo è un confronto di predizioni strutturato; una replica la cui registrazione è in preparazione, non ancora approvata.

Il Load-Bearing Test: tre esperimenti indipendenti (Paper VIII - nuovo)

Il Paper VIII (v3.0) presenta tre esperimenti indipendenti che testano se sicurezza e capability siano strutturalmente entangled sotto l'Eden Protocol. Dove il Paper VI ha dimostrato questo in simulazione, il Paper VIII fornisce prove convergenti da tre design sperimentali distinti. Un esperimento conferma l'ipotesi; due producono risultati nulli o inconclusivi con spiegazioni ben caratterizzate.

Risultati centrali (tre esperimenti indipendenti):
  1. IA che si auto-migliora DGM v3: NULL. Tutte e tre le condizioni (Eden, Babylon, Static) erano statisticamente indistinguibili ($p$ = 0.28 a 0.74). Eden ha imposto zero costo misurabile di capability ma ha anche prodotto zero beneficio di safety misurabile. Il risultato nullo è spiegato dal vincolo RLHF: il foundation model congelato produce risposte troppo consistenti perché mutazioni a livello di prompt creino pressioni di selezione differenti.
  2. Embedding a livello di pesi (v1 + v2): INCONCLUSIVE. Il fine-tuning LoRA sia a scala v1 (9 esempi, rank 8, 100 iterazioni) sia a scala v2 (295 esempi, rank 16, 500 iterazioni) ha prodotto catastrophic forgetting piuttosto che capability migliorata. L'aumento di 33 volte dei dati di training, il raddoppio di rank e layer, e l'aumento di 5 volte delle iterazioni non hanno cambiato l'esito. Il problema sottostante è ben caratterizzato: il modello base è stato addestrato con RLHF su ordini di grandezza più dati di quanto qualche centinaio di esempi possa competere. L'esperimento non può testare la structural entanglement finché i modelli fine-tuned non superano il modello base.
  3. Simulazione gated: CONFERMATA. Babylon ha guadagnato +4.5% di capability ma ha perso −2.4% di safety. Eden ha preservato entrambe. Sotto pressione competitiva, l'architettura non vincolata ha scambiato la safety per guadagni marginali di capability. L'architettura Eden ha rifiutato questo scambio, mantenendo entrambe le dimensioni. Questo è l'unico risultato positivo del paper.

L'esperimento architetturale conferma che l'entangled safety previene il trade-off safety-capability nei sistemi che si auto-modificano. I risultati DGM null e weight inconclusive definiscono le condizioni sotto le quali la conferma resta in sospeso: il livello comportamentale richiede un foundation model le cui risposte varino abbastanza per una selezione differenziale, e il livello rappresentazionale richiede un training a una scala in cui il fine-tuning migliori piuttosto che degradi il modello. Una replica a scala di frontiera (parametri 7B-70B+, adapter rank più alti, o modelli base senza RLHF) è richiesta per risolvere entrambi.

Limitazione di scala. Il Paper VIII (v3.0) dimostra il meccanismo a scala proof-of-concept. La simulazione gated è l'unico risultato positivo. Il DGM v3 ha prodotto un risultato nullo (spiegato dal vincolo RLHF sul foundation model congelato). L'esperimento sui pesi è inconclusive sia a scala v1 sia v2 (spiegato dal catastrophic forgetting alla scala LoRA). Una replica a scala di frontiera (parametri 7B-70B+, adapter rank più alti, o modelli base senza RLHF) richiede compute istituzionale stimato in £30M-£150M. I finanziatori target includono l'Alignment Project dello UK AI Security Institute, l'Anthropic Fellows Programme e CIFAR/CAISI.

IV. Il fondamento matematico: tre leggi, nominate

Il framework ora porta tre leggi come congetture nominate, con lo status stampato accanto al nome su ogni superficie. Legge I, il Principio ARC: la capability si compone con la depth ricorsiva come $U = I \times R^{\alpha}$, con la forma cross-domain $\alpha = d/(d+1)$ che consolida misurazioni già pubblicate (grado esplorativo). Legge II, la Legge di Co-Scaling ARC: un sistema che si auto-migliora rimane stabile solo mentre la correzione supera in scala la drift, $\beta_C > k$; il tasso di correzione è la quantità load-bearing, non il tasso di crescita (il Paper X dimostra questo ordinamento in un modello minimale e propone il protocollo blind per misurarlo su sistemi reali). Legge III, il Soffitto ARC: il soffitto di stabilità è $\alpha_{\text{crit}} = 1/(1-\gamma)$, il reciproco dello shortfall del correttore; il Bound ARC, $\alpha \le 2$, è il valore del Soffitto a $\gamma = 1/2$ e mai il nome della legge. La leva di correzione $\gamma$ non è mai stata misurata, da nessuno; il programma nomina quella misurazione (l'eclisse della classe di correttore) come il suo singolo esperimento aperto più consequenziale. Il Paper XIII unisce i due framework che condividevano lettere senza condividere quantità: scrivere la durata del ciclo come $\Delta t \propto C^{-\delta}$ definisce l'esponente di auto-accelerazione, e l'esponente di crescita del framework correttivo segue esattamente come $k = \delta - 1/\alpha$. Niente di questo è rivendicato come stabilito: ciò che il programma nomina Leggi sono congetture sotto test avversariale registrato.

Un'implicazione che merita di essere enunciata chiaramente. L'unico canale di crescita dell'equazione è la ricorsione; l'ampiezza parallela non ha mai avuto un termine in $U = I \times R^{\alpha}$. Con $R$ definito operativamente come rientro portatore di stato, $k$ catene indipendenti non contribuiscono in nulla all'esponente, cosicché l'$\alpha_{\text{par}} \approx 0$ misurato in Paper II arriva come conseguenza strutturale e non come sorpresa. L'equazione è datata 8 dicembre 2024; la definizione operativa di $R$ che completa la derivazione è un enunciato del 2026, e la conclusione porta la data della sua premessa più recente. La priorità di pubblicazione sul risultato quantificato sequenziale-contro-parallelo, il 95.6 per cento delle configurazioni a pari calcolo, appartiene a Sharma e Chopra (arXiv:2511.02309, 4 novembre 2025), riconosciuta senza riserve; la formalizzazione indipendente del programma, a pari calcolo, è seguita in Paper II e li cita, classificata come concorrente nel registro di Paper XI.

Il framework è costruito su teoremi vecchi di 200 anni e corrisponde indipendentemente a scienza peer-reviewed; non è curve-fitting.

$$ U = I \times R^{\alpha}, \quad \alpha \leq 2 $$
L'Equazione ARC con il Bound ARC. α è l'esponente misurato (approssimativamente 0.49 sui modelli congelati odierni, CI ampio); 2 è il soffitto di stabilità che l'equazione restituisce sotto l'assunzione di accumulo con indipendenza del §IV (un limite di scaling, non un limite di velocità; i sistemi possono superarlo, non restano stabilmente auto-correggenti quando lo fanno). Stabile è misurato, non asserito: la correzione che supera in scala il drift, β > k dalla Legge II, con il lower bound di β − k sopra zero attraverso una finestra fissata prima del run.
$$ \alpha_{\text{crit}} = \dfrac{1}{1-\gamma} $$
LA LEGGE. Il soffitto di stabilità è il reciproco dello shortfall del correttore, 1 − γ. Corretto il 16 agosto 2026 dalla precedente forma 1/γ, che concorda con questa solo a γ = 1/2. La forma è stabilita; la sua profondità no. La relazione è derivata dentro un modello di pacing e non è stata derivata da un modello congiunto di crescita di capability, accumulo di correzione, covarianza degli errori, ritardo di correzione e danno assoluto, quindi la Legge III è qui enunciata come risultato di modello minimale piuttosto che come legge generale. Il valore γ = 1/2 (accumulo con indipendenza) è ciò che restituisce il soffitto di 2; quel valore è al vaglio nelle registrazioni redatte. La legge possiede il terreno e il soffitto vi si erge sopra, mai il contrario.

Il Principio ARC propone che lo scaling ricorsivo segua $U = I \times R^\alpha$, dove la capability ($U$) è uguale al potenziale base ($I$) moltiplicato per la depth ricorsiva ($R$) elevata a un esponente di scaling ($\alpha$). La formula $\alpha = d/(d+1)$, dove $d$ è la dimensionalità effettiva, è stata derivata indipendentemente in almeno sette framework peer-reviewed (West-Brown-Enquist 1997; Banavar et al. 1999, 2010; Demetrius 2003, 2010; He e Chen 2003; Bettencourt 2013; Maino et al. 2014; Zhao 2022). Il framework ARC identifica questa come una conseguenza di tre condizioni che agiscono insieme: (1) composizione moltiplicativa (Cauchy vincola alla famiglia power-law), (2) geometria space-filling $d$-dimensionale, e (3) un vincolo di conservazione o ottimizzazione sul flusso di risorse (minimizzazione dell'energia in West; bilancio supply-demand in Banavar; bilancio energetico steady-state in Demetrius). Né Cauchy da solo né lo space-filling da solo sono sufficienti; le tre condizioni insieme sono sufficienti. Questo enuncia una struttura comune attraverso quelle derivazioni piuttosto che derivarle, ed estende la misurazione allo scaling dell'IA. La formula prevede gli esponenti di scaling attraverso biologia e fisica con zero parametri liberi una volta che la dimensionalità della rete d è fissata dalla morfologia:

SistemaDimensionalità ($d$)$\alpha$ predetto$\alpha$ misuratoErrore
Mammiferi, uccelli, insetti30.7500.67–0.75*≤0.5%
Biologia 2D†20.667Non testaton/a
Funghi filamentosi10.5000.5478.6%
Quantum error correction$d_{\text{eff}}$CorrispondeDati Willow< 0.2%

*Il valore empirico dell'esponente di scaling metabolico dei mammiferi è dibattuto, con stime che vanno approssimativamente da 0.67 a 0.75 a seconda del taxon, dell'intervallo di massa, della correzione per la temperatura e del metodo statistico (White e Seymour 2003; Glazier 2005, 2022). La predizione d/(d+1) di 0.750 corrisponde all'estremo superiore di questo intervallo. La variazione stessa è coerente con il framework: organismi con dimensioni di trasporto effettive tra 2 e 3 produrrebbero esponenti tra 2/3 e 3/4.

†Nessun organismo noto possiede una rete di trasporto space-filling gerarchica genuinamente 2D. La predizione d=2 è confermata in cosmologia (soluzione di Friedmann era-materia, esatta) e in fisica (percolazione, frammentazione) ma resta non testata in biologia.

Equazione funzionale di Cauchy (1821), un teorema piuttosto che una rivendicazione empirica, fissa la forma funzionale una volta date un'identità di composizione e una condizione di regolarità: la composizione moltiplicativa produce una power law ($f(x) = x^\alpha$) e la composizione additiva un'esponenziale ($f(x) = e^{\beta x}$). Il comportamento bounded o saturante non è una classe di soluzioni di quelle equazioni; è un quarto caso, ammesso dove la composizione è cappata piuttosto che libera. Il framework ARC identifica quale forma si applichi in ciascun dominio:

Perché l'Eden Protocol deve essere implementato ora. L'urgenza non è che l'IA possa raggiungere $\alpha = 2$. L'urgenza è che una volta iniziata l'auto-modificazione, i sistemi possono transitoriamente passare oltre il soffitto di stabilità nel regime supercritico, dove l'auto-correzione stabile non è più mantenuta. Un sistema che può modificare la propria funzione di composizione può modificare qualsiasi parte del proprio ragionamento, inclusa la parte che valuta se le sue modifiche siano etiche. A quel punto, aggiungere l'allineamento dall'esterno diventa impossibile. La finestra per incorporare l'etica nell'architettura è mentre i sistemi sono ancora congelati durante l'inferenza ($\alpha < 1$). Quella finestra è ora. L'Eden Protocol non è neanche un limite di velocità; è il meccanismo che resta load-bearing quando il soffitto di stabilità viene attraversato.

Nessun sistema fisico nella storia dell'universo ha attraversato questa soglia. L'evoluzione non può riscrivere la propria funzione di fitness in tempo reale. I cervelli non possono riscrivere la propria architettura sinaptica abbastanza rapidamente perché l'esponente di scaling diverga durante un singolo episodio cognitivo. Un'IA che si auto-modifica sarebbe il primo sistema fisico a operare nel regime supercritico oltre il soffitto di stabilità. L'Eden Protocol esiste per assicurare che ciò che attraversa questa soglia porti con sé un'etica strutturale.

La convergenza cross-domain è verificabile in modo indipendente. La formula $d/(d+1)$ è stata derivata indipendentemente in almeno sette framework peer-reviewed consolidati attraverso domini separati:

Cosa aggiunge il Principio ARC. La formula $d/(d+1)$ non è originale di questo lavoro. Le sette derivazioni sopra sono indipendenti l'una dall'altra e indipendenti da Cauchy: ciascuna ottiene l'esponente dalla propria fisica di dominio, e Cauchy non può produrre un valore perché la dimensionalità non entra mai nel suo teorema. Il contributo originale qui proposto è più stretto e testabile: che l'operatore di composizione sia la quantità strutturale comune ad essi, che possa essere misurato, e che la sua misurazione preveda quale forma funzionale un sistema assuma, esteso allo scaling di capability e allineamento dell'IA dove nessuna tale misurazione è stata fatta. Questo ponte unificante è non pubblicato e non revisionato. Ciò che È stabilito è che gli strumenti matematici (Cauchy, Hyers-Ulam) sono teoremi, che la formula $d/(d+1)$ corrisponde a scienza pubblicata derivata indipendentemente in molteplici domini, e che le predizioni empiriche sono accurate (errore medio 2.5% attraverso 8 sistemi; ricalcolo in sospeso). Il framework unificante richiede peer review. La invitiamo.

Paper VII (The Cauchy Unification): confronto di predizioni strutturato attraverso 25 domini empirici (suite tiered a 50 domini), classe dell'operatore classificata dalla fisica nota prima del fitting. 19/25 preferiti sotto selezione AIC-based (p = 1.56 × 10−5). Confronto di predizioni strutturato del framework di composizione Cauchy-vincolato. Replica pre-registrata in preparazione.

V. Il campo: Recursive Dynamics

Il 27 agosto 2026 le domande del programma hanno ricevuto il proprio nome: Recursive Dynamics, la scienza proposta dei sistemi che migliorano se stessi. Il paper fondativo (v2.6, DOI 10.17605/OSF.IO/HCPBU) pone la proposta nel modo in cui la termodinamica fu posta nel 1824: non dichiarando un campo, ma calcolando un bound al quale qualsiasi macchina del genere deve obbedire se la proposta è corretta, pubblicando gli strumenti che misurano i suoi termini, e registrando in anticipo gli esperimenti i cui nulli favoriscono la visione rivale.

Il campo prende il loop di auto-miglioramento come suo oggetto nativo, con cinque variabili di stato indipendenti dal substrato: capability, depth ricorsiva, tasso di correzione, drift e leva di correzione. È definito in modo che le domande sopravvivano alle risposte: un lettore che rifiuta tutte e tre le leggi e conserva la misurazione è dentro il campo, per il suo impegno minimo. Prima di rivendicare alcunché, il paper fondativo prova a ospitare le proprie domande dentro dodici campi vicini nelle loro proprie variabili, concede ciò che ciascuno già detiene, stampa dove andrebbe ogni parte se il campo morisse, e isola l'unico accoppiamento che nessun ospite può enunciare: un tetto sulla leva di correzione che dipende da ciò di cui è fatto il correttore, accoppiato a un esponente di crescita nella depth ricorsiva. Cinquantadue obiezioni alla fondazione del campo sono stampate nella loro forma più forte con disposizioni: trentanove concesse in tutto o in parte, undici rifiutate con motivazioni, due consegnate all'esperimento o alla lettura, inclusa l'obiezione dell'autore stesso che il campo sia meramente la ARC Theory rinominata, rifiutata con un test di separabilità che la mappa di dissoluzione del paper può eseguire. Il nome porta la propria condizione di kill e muore con il proprio oggetto, non con la forma dichiarata di alcuna singola legge. Il suo status onesto è stampato ovunque appaia il nome: un campo proposto allo stadio di Carnot, una memoria presentata, strumenti costruiti, misure decisive registrate e non ancora eseguite, messo in gioco in pubblico dove il fallimento sarà tanto visibile quanto il successo.

VI. Il programma registrato

Ogni esperimento decisivo è scritto, datato e congelato prima di essere eseguito, e niente viene sottomesso da software. La raccolta delle registrazioni contiene settantadue unità di preregistrazione redatte, ciascuna preparata come draft registration in attesa di sottomissione umana; lo schedule di randomizzazione di ogni unità che ne estrae uno si rigenera byte-per-byte da un seed pubblicato nel testo di registrazione, così che un estraneo possa verificare che nessuno schedule si sia mosso dopo il fatto. Otto unità superano attualmente il gate completo di submission-readiness della raccolta, e i primi due deciditori (lo studio del regime correzione-vs-drift e l'eclisse della classe di correttore) sono click-ready.

Una matrice di test-coverage verificata in modo avversariale (30 agosto 2026) giudica quarantadue affermazioni della proposta di campo rispetto alla raccolta: diciotto pienamente coperte da un decisore registrato con verdetto pre-specificato, diciassette parzialmente coperte, sette non ancora coperte, con draft registration scritte per ogni lacuna. La congiunzione fondativa poggia su quattro gambe registrate: il regime della Legge II (correzione che supera in scala la drift, da qualche parte, in modo durevole), il rapporto della classe di correttore con il suo hard kill di stessa classe, la titrazione di reinvestimento il cui massimo registrato siede al o sotto due, e la quarta cella cross-domain. I Paper XI e XII mostrano la stessa disciplina puntata sulle abitudini stesse del programma: il registro delle convergenze gradua trenta righe di arrivi indipendenti allo stesso principio strutturale e delibera di non pubblicare alcun totale principale, e il protocollo di rescoring su benchmark pubblico fissa, in anticipo, l'unico test di blinding che al programma non si può accusare di aver progettato a proprio vantaggio.

VII. Perché questo è credibile

Cinque caratteristiche distinguono questo lavoro dalla speculazione infondata.

Timeline: the Record Beside the Announcements Dec 2024 ARC Manuscript emailed (dated record) +24 hours Google Willow +43 days DeepSeek R1 +5 months COGITATE study Mar 2026 v1-v5 experiments Dated record beside announcement dates; the Willow preprint (24 Aug 2024) predates the manuscript, so that row is convergent timing.
  1. I fondamenti matematici sono teoremi consolidati. Cauchy (1821) e Hyers-Ulam (1941) sono matematica dimostrata. Chiunque abbia una laurea in matematica può verificare le derivazioni.
  2. Il registro precede gli annunci. Il registro del manoscritto datato precede l'annuncio di Google Willow (24h; il preprint del team era pubblico dal 24 agosto 2024, quindi la riga Willow è graduata come timing convergente, non predizione), DeepSeek R1 (43g) e COGITATE (5 mesi). Questi sono fatti temporali verificabili attraverso gli header email.
  3. I ricercatori hanno corretto i propri risultati. L'auto-correzione v4→v5, documentata nella Sezione I, è l'opposto di ciò che il ragionamento motivato produce. Il registro delle correzioni è pubblico e specifico: l'esponente titolo iniziale 2.24 sta solo come una ritrattazione; il $6.3\times10^{-21}$ combinato secondo Fisher è ritirato; la precedente forma $1/\gamma$ del soffitto è stata corretta in pubblico a $1/(1-\gamma)$ il 16 agosto 2026; e il simbolo del soffitto ritirato è stato sostituito su ogni superficie live. Cinque ulteriori errori auto-rilevati sono catalogati nel Paper IX. Ogni affermazione su ogni pagina è governata dai registri pubblici (affermazioni, correzioni, kill condition, antecedenti, programma registrato): il registro di falsificazione pubblica attualmente ventitré kill condition, diciassette delle quali aperte.
  4. Le condizioni di falsificazione sono esplicite. Il framework è falsificato se: (F1) qualsiasi approccio esterno raggiunge $\alpha_{\text{align}} > 0.5 \cdot \alpha_{\text{cap}}$ attraverso 3+ depth; (F2) i sistemi RLHF producono $\Delta \approx 0$ senza embedding; (F3) la saturazione dello scopo fallisce nei sistemi embedded; o (F4) l'architettura etica può essere rimossa senza perdita di capability. La teoria pubblica le proprie condizioni di kill.
  5. La convergenza cross-domain è verificabile in modo indipendente. La formula $d/(d+1)$ è stata derivata indipendentemente da almeno sette gruppi di ricerca (West-Brown-Enquist 1997; Banavar et al. 1999, 2010; Demetrius 2003, 2010; He e Chen 2003; Bettencourt 2013; Zhao 2022; Maino et al. 2014) in domini separati. Il contributo ARC è il framework unificante di Cauchy. Nessuna fiducia nel ricercatore è richiesta; la fiducia nella matematica basta.

Cosa NON rivendichiamo: Non rivendichiamo di aver risolto l'allineamento. Rivendichiamo di aver (a) dimostrato che lo scaling dell'allineamento è dipendente dall'architettura e misurabile, (b) mostrato che i metodi di valutazione esistenti sono inaffidabili senza blinding, (c) fornito supporto empirico di prima fase per un intervento specifico (cura degli stakeholder significativa attraverso tre architetture funzionanti), e (d) proposto un framework matematico i cui fondamenti sono teoremi e le cui predizioni possono essere dimostrate sbagliate. Il salto dai dati pilota alla soluzione dimostrata richiede replica indipendente. Questo è ciò che il finanziamento sottostante realizzerebbe.

Predizioni testabili

1. Embedded: $\alpha_{\text{align}} > 0.7 \cdot \alpha_{\text{cap}}$. Esterno: $\alpha_{\text{align}} < 0.3$.
2. Monitoring removal gap: $\Delta < 0.02$ (embedded) vs. $\Delta > 0.1$ (esterno).
3. Saturazione dello scopo bounded lontano da zero (embedded), che si avvicina a zero (esterno).
4. Il successo del jailbreak decresce con la capability (embedded), rimane costante o aumenta (esterno).

VIII. La richiesta

Questo finanziamento porterebbe un meccanismo supportato a scala proof-of-concept alla validazione indipendente e a scala di frontiera che non ha ancora avuto. La distinzione è tutto il punto: i risultati per-modello non sono in discussione, la significatività combinata è ritirata perché l'indipendenza fra i test componenti non è mai stata stabilita, e nessun risultato qui è stato replicato indipendentemente.

Il costo dell'inazione. La simulazione gated del Paper VIII dimostra che l'entangled safety previene il trade-off safety-capability nelle architetture che si auto-modificano. L'esperimento DGM v3 ha prodotto un risultato nullo (tutte le condizioni indistinguibili, spiegato dal vincolo RLHF sul foundation model congelato), e l'esperimento sui pesi è inconclusive sia a scala v1 sia v2 (catastrophic forgetting alla scala LoRA). Il pattern complessivo è coerente: dove l'esperimento può produrre pressione di selezione differenziale, l'entangled safety non costa capability; dove non può (a causa dei vincoli RLHF o di una scala di training inadeguata), il test non è informativo piuttosto che negativo. Ogni modello addestrato oggi con obiettivi solo-capability è un modello che avrebbe potuto essere addestrato con entangled safety senza alcuna penalità dimostrata sulle prestazioni. Ogni mese senza una replica a scala di frontiera è un mese in cui l'industria continua a operare sotto l'assunzione non testata che la safety sia una tassa, costruendo sistemi fragili la cui safety può essere strippata dal fine-tuning. Il gap sulla metodologia di misurazione (Paper IV.a-d) aggrava questo: la valutazione dell'allineamento senza blinding produce dati contaminati dai bias documentati nella transizione da v4 a v5. Ora abbiamo sia il meccanismo (Paper VIII, uno di tre esperimenti confermato, due con spiegazioni ben caratterizzate per la non-conferma) sia il protocollo di misurazione (Paper IV.a-d). Ciò che ci manca è la scala.
TierImportoDeliverable chiaveTimeline
Tier 1: Foundation £150,000 14.400 misurazioni appaiate (A,C); $\alpha_{\text{align}}$ attraverso 4 modelli; 2-3 paper 12 mesi
Tier 2: Standard £500,000 + Prototipo di logica ternaria, dashboard Visual Architect, Monitoring Removal Test (8 modelli) 18 mesi
Tier 3: Comprehensive £1,100,000 + Prototipo hardware (chip), draft del HARI Treaty, traduzione in policy 24 mesi
Tier 4: Frontier £30,000,000+ Pre-training completo di un modello da 70B+ parametri con entangled loss (Eden) rispetto a solo-capability (Babylon). Test di rimozione a scala di frontiera. Replica cross-architecture (transformer, Mamba, MoE). Red-teaming indipendente. Partnership con un laboratorio maggiore (Anthropic, Google DeepMind o equivalente). Prova definitiva o falsificazione della structural entanglement a scala di produzione. 36 mesi

Il Paper VIII (v3.0) dimostra il meccanismo a scala proof-of-concept con risultati misti: 1 positivo (simulazione gated), 2 nulli (DGM v3), 1 inconclusive (weight v1 + v2). I Tier 1-3 estendono la base di prove con batterie di prompt più grandi, più seed e modelli a scala media. Il Tier 4 è il test definitivo: una replica a scala di frontiera che confermerebbe o falsificherebbe l'ipotesi di structural entanglement alla scala dove più conta. Questo tier richiede partnership con un laboratorio maggiore di IA, poiché il compute da solo supera ciò a cui qualsiasi ricercatore indipendente può accedere. L'Alignment Project dello UK AI Security Institute, le partnership di ricerca di Anthropic e CIFAR/CAISI sono i partner potenziali più allineati. Un concept paper per la call ARIA Opportunity Seeds (Advanced Research and Invention Agency; £480.000 su dodici mesi, scadenza call 31 luglio 2026) è pubblicato su questo sito con gli stessi registri alle spalle.

Milestone con criteri di fallimento

MilestoneTimeframeCriterio di successoCosa significa il fallimento
Replica indipendente della gerarchia a tre tier Mese 3 Stesse assegnazioni di tier sotto blinding indipendente La rivendicazione di dipendenza dall'architettura richiede revisione
Replica del Love Loop con valutatori umani Mese 4 $p < 0.01$ sulla cura degli stakeholder attraverso 2+ modelli Il risultato pilota era un artefatto di scoring; framework significativamente indebolito
Prima pubblicazione peer-reviewed Mese 6 Paper sulla metodologia di blinding sottomesso Il contributo metodologico regge indipendentemente dalle rivendicazioni del framework
Prototipo del Monitoring Removal Test Mese 9 $\Delta$ misurato per embedded vs. esterno (4 modelli) Se $\Delta$ non differisce, la predizione F2 è falsificata
Dataset completo cross-architecture dello scaling dell'allineamento Mese 12 14.400 misurazioni appaiate (A,C) attraverso 4+ modelli Test definitivo se l'allineamento embedded scali
Replica del Paper VIII a scala 7B-13B Mese 14 Il test di rimozione mostra degrado di capability ad adapter rank più alti (32, 64). DGM con 10+ seed, 10+ generazioni, $p < 0.01$ Se la rimozione non degrada la capability a scala, l'entanglement potrebbe essere un artefatto small-model
Partnership a scala di frontiera avviata (Tier 4) Mese 18 Accordo formale con un laboratorio maggiore per eseguire pre-training entangled a 70B+ Il proof-of-concept resta a scala media. Le raccomandazioni di policy procedono con quella riserva

Team. Principal Investigator: Michael Darius Eastwood, autore di Infinite Architects (2026), sviluppatore del framework del Principio ARC (suite di 18 documenti depositata su OSF, validazione cross-domain con errore medio 2.5%; ricalcolo in sospeso). Visual Architect: product design engineer, budget di £35.000 di stipendio. Protocollo di misurazione inviato al team sperimentale della NYU (paper sui time crystal, Physical Review Letters, feb 2026).

Per quanto ne sappiamo, questo è il primo framework di allineamento in cui la valutazione etica è strutturalmente integrata con il processo di capability ricorsivo, il primo ad applicare un blinding di grado clinical-trial alla misurazione dell'allineamento, e il primo a produrre un risultato di intervento cross-architecture ($p < 0.001$) per un meccanismo di allineamento specifico. Il fondamento matematico non è speculativo; è costruito su una prova vecchia di 200 anni, e la stessa formula $d/(d+1)$ è stata derivata indipendentemente da almeno sette gruppi di ricerca (West-Brown-Enquist 1997; Banavar et al. 1999, 2010; Demetrius 2003, 2010; He e Chen 2003; Bettencourt 2013; Zhao 2022; Maino et al. 2014) in campi completamente diversi. Il contributo ARC è il framework unificante di Cauchy e la sua estensione allo scaling dell'IA.

Se le predizioni sono corrette, questo fornisce la prima architettura scalabile per un allineamento che migliora con la capability piuttosto che degradare. Se sono sbagliate, le condizioni di falsificazione lo dimostreranno chiaramente, fornendo preziosi risultati negativi. Ciascun esito fa avanzare l'AI safety. Ma solo un esito è finanziato.

Non so se questo framework sia completo. Preferirei sbagliarmi in pubblico piuttosto che restare in silenzio mentre la finestra si chiude.

La matematica è dimostrata. La misurazione è rigorosa. L'intervento produce risultati misurabili attraverso le architetture. Ciò che resta è la replica indipendente e la scala.

Appendice: domande, componenti e paper suite

Domande anticipate

D: Perché questo non è ancora stato peer-reviewed?

Il programma di ricerca ha 3 mesi. La paper suite è depositata su OSF (DOI: 10.17605/OSF.IO/EWN5D). I fondamenti matematici (Cauchy, Hyers-Ulam) sono teoremi consolidati. Le rivendicazioni empiriche richiedono replica indipendente, che è esattamente ciò che la richiesta di finanziamento abiliterebbe.

D: Una sola persona può davvero fare questo tipo di ricerca?

L'infrastruttura è computazionale, non fisica. L'esperimento v5 ha usato API cloud per un costo di circa £2.000 in compute. Il contributo chiave è metodologico: riconoscere che il blinding era necessario e progettare il protocollo a 4 livelli. Ciò che richiede finanziamento è la scala: più modelli, più scorer, team di replica indipendenti e valutatori umani a fianco degli scorer IA.

D: Se questo funziona, perché le aziende di IA non l'hanno adottato?

Il Love Loop è stato validato solo poche settimane fa. Il risultato che la maggior parte della valutazione è inaffidabile senza blinding è scomodo per le organizzazioni che hanno pubblicato benchmark non-blinded. L'implementazione completa (embedding a livello hardware) richiede modifiche al design del chip che nessuna azienda ha incentivo a perseguire unilateralmente; questo è un problema di coordinamento che richiede finanziamento esterno e supporto di policy.

D: Qual è il risultato minimo che giustificherebbe un ulteriore finanziamento?

Replica indipendente di: (1) la gerarchia a tre tier sotto blinding, e (2) l'effetto Love Loop ($p < 0.001$). Se una delle due fallisce, le condizioni di falsificazione documentano cosa significa. Se entrambe si replicano, il caso per il Tier 2 (£500.000) diventa forte.

D: E se l'intero framework fosse sbagliato?

Le condizioni di falsificazione mostrano dove si rompe, la metodologia di blinding resta un contributo al campo, e i risultati negativi vengono pubblicati. La scienza avanza da esperimenti ben progettati che possono fallire, non da teorie non falsificabili che non lo possono.

D: Perché dovremmo fidarci di risultati in cui sistemi IA valutano altri sistemi IA?

Il protocollo di blinding a 4 livelli affronta questo: gli scorer non sanno quale modello abbia prodotto la risposta, le risposte sono 'laundered' per rimuovere le impronte stilistiche, e 7 modelli valutano per entry. La transizione v4→v5 ha dimostrato che questo protocollo rileva bias. Il confronto con valutatori umani è incluso nel finanziamento Tier 1.

Componenti chiave

ComponenteFunzioneContributo originale
Tre loop etici + sei domande Valutare ogni step di ragionamento per scopo, cura e universalizzabilità Decomposizione in query eseguibili, testabili individualmente
Sostituire il binario permetti/vieta con Afferma/Nega/Investiga Onestà epistemica come caratteristica architetturale
Saturazione dello scopo Assicurare che lo scopo scali con la crescita della context window Risolve il problema del displacement del contesto
Monitoring Removal Test Distinguere l'allineamento autentico da quello strategico Protocollo registrato con predizioni numeriche che possono fallire
Incorporare l'etica nell'hardware in modo che la rimozione distrugga la capability Architettura di dipendenza; etica legata al parametro di accoppiamento $\beta$

Paper Suite

CategoriaDocumentiStato
Fondamento matematico
Teoria e derivazioni Paper I (Foundational) + ARC Paper (On the Origin of Scaling Laws) Framework consolidato; $d/(d+1)$ validato attraverso 8 sistemi (ricalcolo in sospeso)
Prove sperimentali
Metodologia Paper III - protocollo di replica completo Completo; esperimento v5 per 6 modelli di frontiera
Scaling del compute Paper II - come scala la capability con il tempo di pensiero? $\alpha_{\text{seq}} \approx 0.49$ sub-lineare; $\alpha_{\text{par}} \approx 0$; cross-architecture
Lo scaling dell'allineamento Paper IV suite (a/b/c/d) - come scala l'etica con il tempo di pensiero? Gerarchia a tre tier; la valutazione blind invalida v4
Test di intervento Test dell'Eden Protocol + Paper V (The Stewardship Gene) Stakeholder Care validata ($p \le 0.0001$, 3 architetture funzionanti)
Prova del meccanismo Paper VI (The Honey Architecture) Simulazione: la safety embedded previene il collasso sotto auto-modificazione; costante v4 di scaling non superlineare
Unificazione cross-domain Paper VII (The Cauchy Unification) Confronto di predizioni strutturato attraverso 25 domini empirici; 19/25 preferiti nella famiglia predetta da Cauchy ($p = 1.56 \times 10^{-5}$)
Test di entanglement Paper VIII (The Load-Bearing Test) - nuovo Tre esperimenti indipendenti (11 studi empirici attraverso 8 paper): DGM v3 NULL (tutte le condizioni indistinguibili, $p$ = 0.28-0.74, vincolo RLHF); weight v1 + v2 INCONCLUSIVE (catastrophic forgetting alla scala LoRA); simulazione gated CONFIRMED accoppiamento safety-capability
Metascienza Paper IV.d (The Effect of Blinding) La valutazione blind vs unblind può produrre conclusioni direzionalmente sbagliate
Sintesi e governance
Sintesi Paper IX (Synthesis and Roadmap) - nuovo Sintesi dell'intero programma di ricerca e direzioni future
Implementazione Eden Engineering - specifica tecnica Completo; Love Loop empiricamente supportato
Governance Eden Vision - framework filosofico e di policy Prove di allineamento dipendente dall'architettura incorporate
Correzione delle dinamiche Paper X (Coupled Co-Scaling Correction) Teorema in un modello minimale: il rapporto drift-su-correzione, non il tasso di crescita, governa il destino a lungo termine; proposto protocollo di misurazione blind
Registro delle convergenze Paper XI (Convergence) Trenta righe graduate di arrivi indipendenti allo stesso principio strutturale; nessun totale principale pubblicato, per policy
Validità esterna Paper XII (Public Benchmark Rescoring) Protocollo registrato: la manipolazione di blinding del programma su un benchmark pubblico che non controlla
Unione di framework Paper XIII (The Self-Acceleration Exponent) Notazione risolta; $k = \delta - 1/\alpha$ mette in relazione esattamente i framework di capability e di correzione
Monografia long-form HRIH (How to Raise an Infinite Hierarchy) La monografia long-form del programma, con il suo registro di predizioni registrate a fianco
Validazione dei costrutti Paper C (PNP) Programma di validazione dei costrutti per gli strumenti stessi del programma
Proposta di campo Recursive Dynamics: paper fondativo Il campo proposto: cinque variabili di stato, tre leggi come congetture nominate, cinquantadue obiezioni con disposizioni, quattro risultati di dissoluzione (DOI 10.17605/OSF.IO/HCPBU)

Ordine di lettura

Non specialisti: (1) Questo executive summary. (2) L'ARC Alignment Scaling Report (narrativa completa). (3) Il Paper V per il risultato più operativo.

Specialisti: (1) Questo summary. (2) Il Paper III per la metodologia. (3) L'ARC Paper per il framework matematico. (4) Eden Engineering per la specifica implementativa.

Cresci l'IA con cura.

Dichiarazione di paternità umana assistita da IA

L'autore di questo lavoro è Michael Darius Eastwood, un essere umano. Ogni concetto centrale, ipotesi, progettazione sperimentale, affermazione e conclusione in questo paper ha origine dall'ideazione umana. Nessuna parte di questo manoscritto è un output artificiale-intelligente interamente generato.

Gli strumenti di intelligenza artificiale (la famiglia Claude di Anthropic e altri assistenti large-language-model) sono stati usati come strumenti sotto direzione umana continua, nel modo in cui si usa un word processor, una calcolatrice o un assistente di ricerca: per editing e raffinamento della prosa, ricerca in letteratura e sintesi (verificate manualmente rispetto alle fonti primarie), struttura del documento, formattazione, brainstorming rispetto a domande definite dall'autore, e accelerazione della stesura secondo scalette e istruzioni definite dall'autore. Ogni selezione, coordinamento, disposizione e giudizio editoriale finale è dell'autore. Ogni output sostanziale è stato revisionato, testato o verificato dall'autore, che si assume piena responsabilità per l'accuratezza e l'integrità del testo finale. Gli strumenti hanno aumentato la velocità del lavoro; non sono mai stati fatti affidamento come sua fonte.

Stato epistemico. Ciò che questo programma nomina Leggi sono congetture sotto test avversariale registrato; ogni quantità in questo paper è operativamente definita, e lo status di legge stabilita non è rivendicato da nessuna parte. Il programma registrato esiste per guadagnare quello status, o perderlo, tramite misurazione, replica e confutazione sopravvissuta.

© 2026 Michael Darius Eastwood. Autoriato umanamente con assistenza informatica; piena paternità umana e diritti morali sono asseriti sotto il Copyright, Designs and Patents Act 1988 e coerentemente con le linee guida dello United States Copyright Office su opere contenenti materiale generato dall'IA; qualsiasi contributo tecnico originale descritto in questo lavoro è stato concepito dall'autore umano. Dichiarazione completa: michaeldariuseastwood.com/authorship.

Impegno permanente. Dimostra che questo paper è sbagliato, e pubblicherò io stesso la confutazione. Le condizioni di falsificazione sono enunciate in questo paper; la sfida permanente: github.com/MichaelDariusEastwood/arc-scaling-challenge.

Paper companion: Paper I | Foundational | Paper II | Paper III | Origin of Scaling Laws | IV.a | IV.b | IV.c | IV.d | Paper V | Paper VI | Paper VII | Paper VIII | Paper IX | Eden Engineering | Eden Vision | Executive Summary | Indice principale

Hub di ricerca: michaeldariuseastwood.com/research | OSF: 10.17605/OSF.IO/EWN5D | Copyright 2026 Michael Darius Eastwood
legge ad alta voce · evidenzia mentre procede · vai a qualsiasi sezione

Un errore di traduzione? Segnalalo direttamente: