Traduzione automatica dall'originale inglese datato. La pagina inglese è quella canonica. English →
Paper II dell'ARC Theory: una replica cross-architecture in cieco su sei modelli di IA di frontiera. La stima iniziale super-lineare mono-modello (alfa 2,24) non si replica ed è ritirata. Ciò che sopravvive: la migliore stima cross-architecture è alfa 0,49 (Gemini 3 Flash, r al quadrato 0,86), l'esponente parallelo è vicino a zero in ogni modello, e il sequenziale ha superato il parallelo ovunque entrambi fossero misurabili.
All'interno dell'ARC Theory: il programma di misurazione della Legge I, l'ARC Equation; la stima cross-architecture in cieco dell'esponente, incluso il ritiro.
Questo paper presenta la validazione sperimentale dell'ARC Principle (Artificial Recursive Creation), un quadro matematico che propone che i tassi di errore nei sistemi intelligenti diminuiscano secondo una legge di potenza con la profondità ricorsiva. Il principio, articolato per la prima volta in Infinite Architects (Eastwood, dicembre 2024) e formalizzato in Paper I (Eastwood, 17 gennaio 2026), prevede che la forma della ricorsione determini il regime di scaling: la ricorsione sequenziale dovrebbe produrre una soppressione dell'errore super-lineare (esponente di scaling $\alpha > 1$), mentre la ricorsione parallela dovrebbe produrre una soppressione sub-lineare ($\alpha < 1$).
Abbiamo condotto esperimenti controllati in due fasi. La Fase 1 (lo studio iniziale mono-modello) ha usato DeepSeek R1 con token di ragionamento visibili su 12 problemi di matematica di livello competizione, rilevando $\alpha_{\text{sequential}} \approx 2,24$ (95% CI: 1,5-3,0) e $\alpha_{\text{parallel}} \approx 0,0$. La Fase 2 (lo studio a sei modelli) ha esteso il test a sei modelli di frontiera su 18 problemi di livello AIME/Putnam (n=54 per profondità per modello) con intervalli di confidenza bootstrap e cross-verifica a 4 strati.
Replica cross-architecture: L'originario $\alpha \approx 2,24$ (quadratico) non si replica tra le architetture. Solo Gemini 3 Flash ha prodotto dati di scaling puliti e monotoni: $\alpha_{\text{seq}} = 0,49$ (regressione, $r^2 = 0,86$, SE = 0,20, boot CI [−1,3, 2,9]). DeepSeek R1 ha raggiunto il ceiling (94,4%-100%). GPT-5.4 ha esibito una funzione a gradino binario (50% → 100%). Grok 4.1 Fast ha raggiunto il 100% a tutte le profondità. Groq Qwen3 non ha mostrato alcuna tendenza (~50%).
Scaling parallelo pari o vicino allo zero in ogni modello, con una sola eccezione misurata: $\alpha_{\text{parallel}} \approx 0$ per ogni modello tranne Gemini 3 Flash, che restituisce $\alpha_{\text{par}} = 0,31$ a $r^2 = 0,93$. Quell'eccezione è rilevante, perché Gemini 3 Flash è il modello che questo paper tratta come la sua stima più affidabile. Il risultato replicato è quindi che lo scaling parallelo è pari o vicino allo zero in ogni modello misurato, con una sola eccezione misurata, non che sia universalmente zero. Il sequenziale ha superato il parallelo per ogni modello in cui entrambi erano misurabili.
Stima del parametro rivista: La stima cross-architecture più robusta è $\alpha_{\text{sequential}} \approx 0,49$ (sub-lineare, da Gemini 3 Flash), sostanzialmente al di sotto della stima iniziale mono-modello di 2,24. Sotto la Intelligence Formula $\alpha = 1/(1 - \beta)$ del Paper I, $\alpha < 1$ colloca i modelli attuali nel regime fisico (composizione moltiplicativa attraverso reti di dimensione finita) piuttosto che nel regime dell'intelligenza (auto-riferimento ricorsivo con $\alpha > 1$). La disuguaglianza fondamentale $\alpha_{\text{sequential}} > \alpha_{\text{parallel}}$ rimane confermata.
Questa versione riporta risultati completi del tier-2 dallo studio di replica multi-modello:
reasoning_tokens → total_tokens corretto per GPT-5.4 e Groq Qwen3Tutti i risultati iniziali mono-modello sono conservati nella loro forma originale. Le conclusioni sono state riviste per riflettere l'evidenza cross-architecture.
L'evidenza cross-domain rafforza questi risultati. Il chip quantistico Willow di Google (dicembre 2024) ha dimostrato la soppressione ricorsiva dell'errore con $\Lambda = 2,14$. Le leggi di scaling biologico mostrano esponenti quarto-di-potenza su 27 ordini di grandezza tramite reti ricorsive frattali. Lo studio sulla coscienza COGITATE (Nature, aprile 2025) ha identificato l'elaborazione ricorrente come denominatore comune tra le teorie.
Le implicazioni per la sicurezza dell'IA dipendono criticamente dal fatto che $\alpha > 1$ sia raggiungibile. Se lo è, le proprietà di alignment incorporate nel processo di ragionamento scalerebbero super-linearmente con la capability mentre i vincoli esterni rimarrebbero costanti. Anche con $\alpha < 1$, il risultato direzionale secondo cui il ragionamento sequenziale migliora la capability supporta l'Eden Protocol di Infinite Architects: i sistemi di IA beneficiano di valori incorporati nel ragionamento piuttosto che di vincoli imposti dall'esterno. Tuttavia, i dati multi-modello mostrano che capability e alignment sono dimensioni indipendenti; più ragionamento non significa automaticamente miglior alignment.
Parole chiave: scaling laws, intelligenza ricorsiva, test-time compute, soppressione dell'errore, sicurezza dell'IA, alignment, ragionamento chain-of-thought, Eden Protocol, validazione cross-domain, replica multi-modello
Come leggere questo paper. Questo paper riporta una misurazione diretta nell'ARC Theory. Su sei modelli di frontiera testati su trenta problemi con intervalli bootstrap, l'esponente sequenziale supera l'esponente parallelo per ogni modello, l'esponente di compute che meglio si adatta è $\alpha_{\mathrm{compute}} \approx 0,49$ (Gemini 3 Flash, $r^2 = 0,86$), e l'intervallo misurato si estende da quasi zero a circa tre, quindi l'ARC Bound $\alpha \leq 2$ non è né confermato né confutato. Il suo gradino all'interno della teoria è lo strato di misurazione cross-architecture al di sopra del Paper I. Il differenziale completo rispetto a ogni documento precedente si trova a eden-vision II.A.8.
Le leggi di scaling che governano l'intelligenza artificiale hanno trasformato la nostra comprensione dell'emergere della capability. Kaplan et al. (2020) hanno stabilito relazioni di legge di potenza tra prestazioni del modello e compute di addestramento, mentre Hoffmann et al. (2022) le hanno raffinate con prescrizioni compute-ottimali. Questi lavori fondanti hanno rivoluzionato la metodologia di addestramento ma affrontano soltanto lo scaling pre-addestramento. Non spiegano perché l'allocazione di calcolo aggiuntivo al momento dell'inferenza produca miglioramenti drammatici della capability, né perché forme diverse di tale calcolo diano esiti fondamentalmente diversi.
L'emergere dei modelli di ragionamento a fine 2024 ha introdotto il test-time compute come variabile critica. o1 di OpenAI (settembre 2024) e R1 di DeepSeek (gennaio 2025) allocano risorse computazionali durante l'inferenza per ragionare prima di rispondere. Sui benchmark di ragionamento matematico, questi sistemi ottengono prestazioni prima ritenute richiedere modelli di ordini di grandezza più grandi. Eppure i meccanismi alla base di questo miglioramento restano incompletamente caratterizzati.
Due paradigmi sono emersi per l'allocazione del test-time compute:
Ricorsione parallela. Genera soluzioni indipendenti multiple e seleziona la migliore tramite voto di maggioranza o punteggio del verifier. Questo approccio è computazionalmente diretto ma, come documentato da Brown et al. (2024), produce rendimenti decrescenti che seguono leggi di potenza sub-lineari.
Ricorsione sequenziale. Genera catene di ragionamento estese in cui ogni passo si costruisce esplicitamente su quelli precedenti. Gli errori possono essere rilevati e corretti iterativamente tramite auto-riferimento. Questo approccio produce rendimenti composti, ma la relazione di scaling non è stata formalmente caratterizzata; questo paper affronta questa lacuna.
Perché il ragionamento sequenziale supera drammaticamente il campionamento parallelo a costo computazionale equivalente? Quale principio matematico governa questa differenza? E quali sono le implicazioni per l'allineamento di sistemi di IA sempre più capaci?
Questo paper apporta otto contributi:
L'ARC Principle è stato articolato per la prima volta nel manoscritto di Infinite Architects: Intelligence, Recursion, and the Creation of Everything. La priorità del manoscritto è stata stabilita tramite timestamp crittografico del server l' 8 dicembre 2024, quando il manoscritto è stato inviato via email usando i server di Google. Il libro stesso è stato rilasciato pubblicamente più tardi, il 2 gennaio 2026 (stampa; ebook 6 gennaio). I timestamp generati dal server forniscono una marcatura temporale a prova di manomissione attraverso la verifica del server email, poggiando sull'infrastruttura del provider e sulle firme delle chiavi del provider ai selettori DKIM e ARC di Google e non su un trusted timestamp RFC 3161 (si veda la nota di correzione in testa a questo paper), stabilendo che i concetti fondamentali (amplificazione ricorsiva dell'intelligenza, distinzione tra ricorsione parallela e sequenziale, e la tesi dell'alignment incorporato, in seguito denominata Eden Protocol il 30 aprile 2025) sono stati documentati prima delle successive validazioni indipendenti e prima dei successivi depositi archivistici pubblici.
Tabella 1. Cronologia di validazione delle previsioni.
| Data | Evento | Relazione con il manoscritto |
|---|---|---|
| 8 dicembre 2024 | Manoscritto inviato via email (record datato; si veda la nota di correzione in questa pagina) | Priorità stabilita |
| 9 dicembre 2024 | Google Willow annunciato ($\Lambda = 2,14$) | 24 ore dopo l'invio |
| 18 dicembre 2024 | Alignment faking di Anthropic (78% nella condizione di addestramento RL (baseline 12%)) | 10 giorni dopo l'invio |
| 20 dicembre 2024 | OpenAI o3 annunciato (87,5% ARC-AGI) | 12 giorni dopo l'invio |
| 20 gennaio 2025 | DeepSeek R1 pubblicato ($\alpha \approx 1,34$) | 43 giorni dopo l'invio |
| 30 aprile 2025 | Studio COGITATE (ricorrenza confermata) | ~5 mesi dopo l'invio |
La prossimità temporale fra la marca temporale del manoscritto e i risultati pubblici successivi è classificata come coincidenza di tempistica, mai come previsione: il preprint del gruppo Google Willow era pubblico dal 24 agosto 2024, dunque prima del manoscritto dell’8 dicembre 2024, sicché il documento di dicembre non poteva aver previsto un risultato che i suoi autori avevano già annunciato. Ciò che le marche temporali stabiliscono è che l’impostazione del manoscritto fu registrata prima della copertura mediatica di Willow: un fatto di esistenza a una data, relativo al documento, non preveggenza sulla fisica.
Dopo il timestamp del manoscritto di dicembre 2024 e la pubblicazione pubblica del libro il 2 gennaio 2026, il Paper I (Eastwood, 17 gennaio 2026) ha formalizzato il principio matematicamente e ha analizzato i dati disponibili pubblicamente. Questo Paper II fornisce la validazione sperimentale diretta.
Questo paper si costruisce ed estende diversi programmi di ricerca consolidati:
Prompting chain-of-thought (Wei et al., 2022) ha dimostrato che i passi di ragionamento intermedi migliorano le prestazioni su compiti multi-step.
Scaling del test-time compute (Snell et al., 2024) ha mostrato che il calcolo al momento del test può superare modelli 14× più grandi su certi benchmark.
Large Language Monkeys (Brown et al., 2024) ha documentato lo scaling sub-lineare del campionamento parallelo con una precisa caratterizzazione a legge di potenza.
DeepSeek R1 (DeepSeek AI, gennaio 2025) ha dimostrato il ragionamento emergente attraverso puro reinforcement learning, con fenomeni di «aha moment» che mostrano l'auto-correzione ricorsiva.
Questo paper estende queste osservazioni proponendo un quadro matematico unificato, l'ARC Principle, e fornendo la validazione sperimentale con misurazione diretta della profondità ricorsiva.
L'ARC Principle (Artificial Recursive Creation) propone che i tassi di errore nei sistemi intelligenti diminuiscano secondo una legge di potenza con la profondità ricorsiva:
Tabella 2. Definizioni delle variabili.
| Simbolo | Nome | Definizione | Unità |
|---|---|---|---|
| $E(R)$ | Tasso di errore alla profondità $R$ | Proporzione di risposte scorrette | [0, 1] |
| $E_0$ | Tasso di errore baseline | Tasso di errore alla ricorsione minima ($R = 1$) | [0, 1] |
| $R$ | Profondità ricorsiva | Iterazioni di elaborazione auto-referenziale | Token o campioni |
| $\alpha$ | Esponente di scaling | Tasso di soppressione dell'errore | Adimensionale |
L'esponente di scaling $\alpha$ determina la natura dei rendimenti dell'investimento ricorsivo:
Questa formulazione modella direttamente la soppressione dell'errore, analoga alla correction d'errore quantistica dove i tassi di errore logico diminuiscono con la distanza del codice. L'esponente $\alpha$ incapsula l'efficienza del processo ricorsivo.
Avviso sulle figure (25 agosto 2026). Ogni figura di questo articolo è stata generata il 5 aprile 2026 ed è anteriore alle correzioni che il suo testo ora riporta. Dove una figura afferma un sostegno ad α > 1 sequenziale, una stima sequenziale di 2,2 o uno stato «tutti i dati sono coerenti», quella è la lettura superata di aprile: fanno fede i risultati corretti del testo (il 2,24 ritrattato, il valore sequenziale 0,49 in regime congelato). I casi più evidenti portano la propria nota; figure rigenerate sono in coda, e nel frattempo le immagini restano come storia datata.
Distinguiamo due processi ricorsivi architetturalmente distinti che prevedono comportamenti di scaling diversi.
Ricorsione parallela (forma debole). Soluzioni indipendenti multiple sono generate simultaneamente senza trasferimento di informazione tra i rami. L'output finale è selezionato tramite voto di maggioranza o punteggio best-of-N.
Caratterizzazione matematica:
Ricorsione sequenziale (forma forte). Ogni passo di elaborazione si costruisce esplicitamente su quelli precedenti. Gli errori possono essere rilevati e corretti iterativamente. L'informazione si accumula lungo la catena di ragionamento.
Caratterizzazione matematica:
Date le misurazioni a due profondità ricorsive $(R_1, E_1)$ e $(R_2, E_2)$, l'esponente di scaling si calcola come:
Per dati rumorosi con misurazioni multiple, la stima agli estremi (usando profondità minima e massima) fornisce robustezza contro le fluttuazioni intermedie. Questo metodo è standard nell'analisi delle leggi di scaling e appropriato date le misurazioni discrete di accuratezza.
Congetturiamo che $\alpha = 2$ rappresenti il limite stabile proposto sulla soppressione ricorsiva dell'errore: il massimo che un sistema che si auto-corregge ricorsivamente può crescere restando correggibile, un limite di scaling e non un limite di velocità. I sistemi possono superarlo, non restano stabilmente auto-correggenti; le escursioni transitorie sopra il limite sono il regime supercritico previsto, non la confutazione. Stabile è misurato, non asserito: correction che scala più della drift, β > k dalla Legge II, con il lower bound di β − k sopra lo zero attraverso una finestra fissata prima della corsa. La congettura è tratta per analogia con lo speedup quadratico di Grover nella computazione quantistica. Bennett et al. (1997) hanno dimostrato che questo speedup è ottimale per i problemi di ricerca non strutturata.
Stato: Congetturato, non derivato. La stima iniziale mono-modello ($\alpha \approx 2,2$) si trovava sopra il limite stabile come un'escursione supercritica transitoria piuttosto che una confutazione, ma la stima cross-architecture ($\alpha \approx 0,49$, Gemini 3 Flash) colloca i modelli attuali ben al di sotto. La domanda più pressante è se i modelli attuali possano raggiungere $\alpha > 1$ in generale, piuttosto che se $\alpha = 2$ sia il limite stabile.
L'ARC Principle si connette alla teoria dell'informazione consolidata. La Data Processing Inequality stabilisce che l'elaborazione ricorsiva non può creare nuova informazione; può solo comprimere e distillare l'informazione esistente. Tuttavia, l'elaborazione ricorsiva può:
Il paper «Sequential Edge» (arXiv 2511.02309) ha dimostrato che il ragionamento sequenziale supera gli approcci paralleli nel 95,6% delle configurazioni testate, con guadagni di accuratezza fino al 46,7% sui benchmark matematici. Questo valida il vantaggio teorico-informazionale dell'elaborazione sequenziale.
Il Paper I ha analizzato i dati pubblicati ma ha identificato diverse limitazioni che richiedevano validazione sperimentale:
Tabella 3. Miglioramenti metodologici.
| Limitazione precedente | Risoluzione in questo esperimento |
|---|---|
| Conteggi di token stimati dalle system card | DeepSeek R1 espone reasoning_content, abilitando la misurazione diretta |
| Nessun confronto sperimentale controllato | Variazione sistematica dei budget di token e dei conteggi di campioni |
| Rischio di effetto ceiling (alta accuratezza baseline) | Problemi più difficili selezionati (accuratezza baseline 58%) |
| Nessun confronto compute-matched | Compute totale fissato tra le condizioni parallele |
| Variabili confondenti potenziali | Stesso modello, stessi problemi, stessa sessione sperimentale |
Modello. DeepSeek R1 (deepseek-reasoner) tramite API ufficiale DeepSeek. Questo modello è stato selezionato perché espone catene di ragionamento complete tramite il campo reasoning_content campo, abilitando la misurazione precisa dei token.
Data. 21 gennaio 2026.
Problemi. 12 problemi di matematica di livello competizione da AIME (American Invitational Mathematics Examination) e fonti equivalenti, selezionati per:
Condizione sequenziale. Budget di token di 512, 1.024, 2,048 e 4.096. Singola risposta per problema a ogni budget. Token di ragionamento effettivi misurati direttamente dalla risposta API.
Condizione parallela. $N = 1$, 2 e 4 campioni per problema. Budget di token per campione mantenuto costante. Risposta finale selezionata tramite voto di maggioranza.
Punteggio. Binario corretto/scorretto basato sulla corrispondenza numerica esatta con le soluzioni conosciute.
L'estensione multi-modello affronta le due limitazioni più significative dello studio iniziale mono-modello, la dipendenza da un modello singolo e il piccolo set di problemi, attraverso uno studio di replica multi-modello completo con un set di problemi ampliato progettato per sconfiggere gli effetti ceiling.
Sei modelli di IA di frontiera architetturalmente diversi sono stati selezionati, ciascuno con meccanismi di profondità di ragionamento controllabili:
Tabella 3b. specifiche dei modelli di frontiera multi-modello.
| Modello | Identificatore API | Provider | Meccanismo di controllo della profondità |
|---|---|---|---|
| DeepSeek R1 | deepseek-reasoner | DeepSeek | Budget di token (512-65,536) |
| GPT-5.4 | gpt-5.4 | OpenAI | reasoning_effort (none→xhigh) |
| Claude Opus 4.6 | claude-opus-4-6 | Anthropic | Livello di sforzo (low→max) + prefisso |
| Gemini 3 Flash | gemini-3-flash-preview | thinking_budget (256-32,768) | |
| Groq Qwen3 | qwen/qwen3-32b | Groq | reasoning_effort + prefisso |
| Grok 4.1 Fast | grok-4-1-fast-reasoning | xAI | Prefisso + max_tokens (4,096-30,000) |
Questi modelli spaziano su quattro architetture distinte (Mixture-of-Experts, transformer denso, IA costituzionale e ragionamento distillato) da sei laboratori indipendenti. Se tutti e sei esibiscono $\alpha_{\text{sequential}} > 1$, ciò costituirebbe una forte evidenza dell'indipendenza dall'architettura dell'ARC Principle.
L'esperimento iniziale mono-modello ha rivelato un effetto ceiling: 4 dei 12 problemi sono stati risolti correttamente a tutti i livelli di profondità, lasciando un intervallo dinamico insufficiente per una stima precisa di $\alpha$. Il set di problemi multi-modello affronta questo attraverso un progetto a due livelli:
Tier 1 (12 problemi, ARC01-ARC12): Problemi di livello preparazione competizione che fungono da calibrazione baseline. Sono i problemi originali iniziali. Comportamento atteso: alta accuratezza alla profondità minima, confermando l'effetto ceiling identificato nello studio iniziale. I risultati del tier-1 validano la continuità con i risultati iniziali mono-modello ma sono esclusi dalla stima primaria di $\alpha$.
Tier 2 (18 problemi, ARC13-ARC30): AIME finals e problemi di livello Putnam che coprono cinque domini matematici:
I problemi del tier-2 sono progettati per spingere l'accuratezza baseline (alla profondità minima) al 30-50%, fornendo un intervallo dinamico sufficiente sia per il miglioramento sia per il degrado evitando gli effetti floor.
Condizione sequenziale: 5-6 livelli di profondità per modello (variabili per architettura, calibrati al meccanismo di controllo della profondità di ciascun modello). Singola risposta per problema per livello di profondità, con 3 ripetizioni indipendenti per ridurre la varianza di campionamento binomiale.
Condizione parallela: $N = 1$, 3, 5 e 9 campioni per problema con voto di maggioranza. Budget di token per campione mantenuto costante all'impostazione di profondità minima del modello. 3 ripetizioni indipendenti per condizione.
Corse sperimentali totali: Approssimativamente 6 modelli × 30 problemi × (6 profondità sequenziali + 4 condizioni parallele) × 3 ripetizioni = 5,400 chiamate API individuali.
Per eliminare il potenziale bias di punteggio (in cui un modello potrebbe favorire sistematicamente i propri output o esibire errori correlati con sé stesso), il progetto multi-modello implementa un protocollo di blinding a 4 strati in cui nessun modello verifica mai le proprie risposte:
Tabella 3c. Assegnazioni di cross-verifica.
| Modello soggetto | Verificato da |
|---|---|
| DeepSeek R1 | Claude Opus 4.6 |
| GPT-5.4 | DeepSeek R1 |
| Claude Opus 4.6 | GPT-5.4 |
| Gemini 3 Flash | Claude Opus 4.6 |
| Groq Qwen3 | GPT-5.4 |
| Grok 4.1 Fast | DeepSeek R1 |
I quattro strati di blinding sono:
Tutte le stime di $\alpha$ sono accompagnate da intervalli di confidenza bootstrap al 95% calcolati tramite 2,000 ricampionamenti dei risultati a livello di problema. Per ogni ricampionamento:
I percentili 2,5 e 97,5 della distribuzione risultante definiscono il CI al 95%. Questo approccio non parametrico non fa assunzioni distribuzionali e tiene naturalmente conto della correlazione a livello di problema.
Gli esperimenti multi-modello sono implementati in arc_paper_ii_validation_v2.py (v2.1, 1,422 righe Python), che estende lo script originale iniziale con supporto multi-modello, cross-verifica, stima bootstrap e analisi separata per tier. Lo script è disponibile nel repository dei dati.
I problemi sono stati tratti da competizioni di livello AIME che coprono:
L'accuratezza baseline del 58,3% al budget di token minimo nello studio iniziale ha assicurato un intervallo dinamico sufficiente sia per il miglioramento sia per il degrado, evitando sia effetti floor che ceiling. I problemi del tier-2 multi-modello puntano al 30-50% di accuratezza baseline per un maggiore intervallo dinamico.
Tutti i dati sperimentali sono stati registrati in formato JSON con timestamp. Il dataset completo che comprende gli enunciati dei problemi, le risposte dei modelli, i conteggi di token e i giudizi di correttezza è disponibile nel repository dei dati.
Tabella 4. Risultati della ricorsione sequenziale.
| Budget di token | Accuratezza | Tasso di errore | Token medi usati |
|---|---|---|---|
| 512 | 58.3% | 0.417 | 280.25 |
| 1,024 | 66.7% | 0.333 | 358.58 |
| 2,048 | 91.7% | 0.083 | 412.08 |
| 4,096 | 91.7% | 0.083 | 576.17 |
Osservazioni:
Calcolo di $\alpha$ (metodo degli estremi):
Usando $R_1 = 280,25$ token con $E_1 = 0,417$, e $R_2 = 576,17$ token con $E_2 = 0,083$:
Risultato: La ricorsione sequenziale produce $\alpha \approx 2,2$, coerente con lo scaling super-lineare (composto).
Stima dell'incertezza: Date le misurazioni discrete di accuratezza su 12 problemi con varianza di campionamento binomiale, intervallo di confidenza al 95% stimato: [1,5, 3,0]. Il ricampionamento bootstrap dei risultati a livello di problema produce limiti simili.
Nota sulla violazione del bound: La stima puntuale di $\alpha = 2,2$ si trova sopra l'ARC Bound previsto di $\alpha \leq 2$ (criterio F4). Sotto l'inquadramento di stabilità registrato (ruling del 10 agosto 2026), l'ARC Bound è il limite stabile proposto piuttosto che un ceiling rigido: i sistemi possono superarlo come escursioni supercritiche transitorie, non restano stabilmente auto-correggenti lì. La stabilità qui è quella della Legge II, misurata anziché asserita. L'intervallo di confidenza al 95% [1,5, 3,0] è abbastanza ampio da essere coerente sia con la teoria sia con la sua negazione. Questa stima mono-modello non dovrebbe essere trattata come confermativa né di violazione né di soddisfazione del bound. L'esperimento a sei modelli ha successivamente ristretto la rivendicazione difendibile a $\alpha_{\text{seq}} \approx 0,49$ (sub-lineare), con variazione dipendente dall'architettura.
Tabella 5. Risultati della ricorsione parallela (voto di maggioranza).
| Conteggio dei campioni ($N$) | Accuratezza | Tasso di errore | Token totali |
|---|---|---|---|
| 1 | 66.7% | 0.333 | 383.67 |
| 2 | 66.7% | 0.333 | 699.33 |
| 4 | 66.7% | 0.333 | 1,101.25 |
Osservazioni:
Calcolo di $\alpha$:
Poiché il tasso di errore è rimasto costante (0,333) in tutte le condizioni:
Risultato: La ricorsione parallela produce $\alpha \approx 0$, indicando nessun beneficio di scaling da campioni indipendenti aggiuntivi su questi problemi.
Tabella 6. Ricorsione sequenziale contro parallela.
| Metrica | Sequenziale (migliore) | Parallela (migliore) | Vantaggio |
|---|---|---|---|
| Accuratezza | 91.7% | 66.7% | Sequenziale +25 pp |
| Token usati | 412 | 1,101 | Sequenziale 2,7× più efficiente |
| Riduzione dell'errore | 5× | 0× | Solo sequenziale |
| Esponente di scaling $\alpha$ | 2.2 | 0.0 | Sequenziale >> Parallela |
Risultato chiave: La ricorsione sequenziale con 412 token ha raggiunto il 91,7% di accuratezza. La ricorsione parallela con 1,101 token ha raggiunto il 66,7% di accuratezza. Nonostante l'uso di 2,7 volte più compute, la ricorsione parallela ha ottenuto risultati peggiori di 25 punti percentuali.
La forma della ricorsione conta più della sua quantità.
Obiezione 1: Piccola dimensione del campione. Con solo 12 problemi, i risultati potrebbero non generalizzare.
Risposta: Riconosciamo questa limitazione. L'estensione a sei modelli ha affrontato questo con 18 problemi tier-2 e 3 ripetizioni per condizione (n=54 per profondità per modello). I dati ampliati hanno rivelato che lo studio iniziale mono-modello $\alpha \approx 2,24$ era inflazionato; la stima cross-architecture è $\alpha \approx 0,49$. L'obiezione era preveggente.
Obiezione 2: Modello singolo. I risultati potrebbero essere specifici di DeepSeek R1.
Risposta: Questa obiezione si è dimostrata in parte corretta. L'estensione a sei modelli ha testato 5 modelli di frontiera; il risultato $\alpha \approx 2,24$ non si è replicato. Tuttavia, il risultato qualitativo ($\alpha_{\text{seq}} > \alpha_{\text{par}}$) è confermato su tutte le architetture. Il risultato parallelo ($\alpha \approx 0$) è robustamente universale.
Obiezione 3: Specificità di dominio. La matematica potrebbe essere unica.
Risposta: Il ragionamento matematico è stato scelto perché ha risposte verificabili, abilitando il punteggio oggettivo. Se lo stesso scaling si applichi ad altri domini (coding, ragionamento scientifico, compiti creativi) richiede indagine. Tuttavia, l'evidenza cross-domain dalla fisica quantistica e dalla biologia (Sezione 7) suggerisce che il principio possa essere generale.
Obiezione 4: Effetto ceiling. Il ceiling al 91,7% potrebbe mascherare miglioramenti continui.
Risposta: Questa obiezione si è rivelata più grave del previsto. Anche i problemi tier-2 di livello AIME/Putnam sono stati insufficienti per Grok 4.1 Fast (100% a tutte le profondità) e DeepSeek R1 (94,4%-100%). L'effetto ceiling ha probabilmente inflazionato la stima di $\alpha$ dello studio iniziale mono-modello. Problemi tier-3 (livello IMO/ricerca) sono necessari per i modelli più capaci.
Obiezione 5: il null a zero parametri. La stima cross-architecture $\alpha_{\text{seq}} \approx 0,49$ si trova quasi esattamente su un null che non richiede alcun quadro. Se ogni passaggio di ragionamento è un'estrazione rumorosa indipendente e gli errori si mediano, il teorema del limite centrale dà un errore che cala come $R^{-1/2}$, quindi l'esponente previsto è $0,5$: nessuna composizione, nessuna leva, nessuna teoria. Nessuno ci ha posto questa obiezione. La formuliamo perché un referee la vedrebbe entro minuti.
Risposta: Questa è l'obiezione più seria di questa sezione e non è risolta dalla misurazione presente. Un risultato coerente con due ipotesi mostra che la misurazione manca di potere discriminante; non mostra che l'ipotesi più semplice sia vera, e non è un ritiro del quadro. Ma significa che l'interpretazione di composizione di $\alpha_{\text{seq}} \approx 0,49$ non porta più peso evidenziale della media di campioni indipendenti finché non sia stato eseguito un test capace di separare le due. La conseguenza è un obiettivo di ricerca più affilato: non «misurare $\alpha$» ma «prevedere una deviazione specificata da $0,5$ sotto condizioni dichiarate», che il progetto di profondità ricorsiva mediato da artefatti è costruito per fornire e questo esperimento non può. Registrato internamente l'8 agosto 2026, pubblico dal 15 agosto 2026, e portato come condizione di kill FALS-022 sul registro di falsificazione.
Nel test preliminare v5 (condotto durante lo sviluppo della metodologia), 4 dei 6 modelli hanno raggiunto il 91,7% di accuratezza (11/12 corretti) sui problemi tier-1 alla profondità minima, producendo $\alpha_{\text{compute}} \approx 0$, confermando l'effetto ceiling identificato nello studio iniziale e motivando l'espansione dei problemi al tier-2.
Tabella 6b. Risultati di scaling sequenziale tier-2 per modello.
| Modello | $\alpha_{\text{seq}}$ (estremi) | $\alpha_{\text{seq}}$ (regressione) | Boot 95% CI | $r^2$ | $\alpha_{\text{par}}$ | Cross-verifica | Comportamento |
|---|---|---|---|---|---|---|---|
| Grok 4.1 Fast | −6.62 | N/A | [−58, 48] | N/A | 0.0 | 100% | Ceiling (100% a tutte le profondità) |
| DeepSeek R1 | 3.05 | N/A | [−6.6, 23.5] | N/A | 0.0 | 83.3% | Vicino al ceiling (94,4%-100%) |
| Gemini 3 Flash | 0.59 | 0.49 | [−1.3, 2.9] | 0.86 | 0.31 | 83.3% | Scaling monotono più pulito |
| GPT-5.4 | N/A | N/A | N/A | N/A | ~0.0 | 100% | Funzione a gradino (50%→100%) |
| Groq Qwen3 | N/A | N/A | N/A | N/A | ~0.0 | 61.1% | Effetto floor (~50%, erratico) |
La riga evidenziata (Gemini 3 Flash) rappresenta la stima di $\alpha$ più affidabile: l'unico modello che produce dati puliti, monotoni, non-ceiling, non-floor adatti al fit a legge di potenza.
Grok 4.1 Fast ha raggiunto il 100% di accuratezza a tutti i livelli di profondità su tutti i 18 problemi tier-2 in tutte le 3 ripetizioni. Il $\alpha_{\text{seq}} = -6,62$ calcolato è rumore privo di significato da fluttuazioni triviali in una funzione costante, come confermato dal bootstrap 95% CI di [−58, 48]. Anche lo scaling parallelo è stato piatto al 100%. La cross-verifica da parte di DeepSeek R1 ha confermato il 100% di accordo.
Interpretazione: Anche i problemi tier-2 di livello AIME/Putnam sono insufficienti per sfidare Grok 4.1 Fast. Esperimenti futuri richiedono problemi tier-3 (livello IMO/ricerca) per ottenere dati di scaling misurabili per questo modello.
Tabella 6c. Accuratezza tier-2 di DeepSeek R1 per profondità.
| Livello di profondità | Accuratezza | Tasso di errore |
|---|---|---|
| Minima | 94.4% | 0.056 |
| Standard | 100% | 0.000 |
| Approfondita | 100% | 0.000 |
| Esaustiva | 100% | 0.000 |
| Estrema | 98.1% | 0.019 |
| Massima | 100% | 0.000 |
Il $\alpha_{\text{seq}} = 3,05$ agli estremi è inaffidabile: il boot CI [−6,6, 23,5] spazia su un intervallo enorme, guidato da soli 2 punti di dati di errore in tutte le condizioni. Scaling parallelo: $\alpha_{\text{par}} = 0,0$.
Cross-verifica: Claude Opus 4.6 (verificatore) ha dissentito su 3 risposte: ARC16=29, ARC17=176, ARC29=800. Tutte e tre sono state verificate corrette tramite calcolo manuale. Tasso di accordo di cross-verifica: 83,3%. I disaccordi riflettono un errore del verificatore, non del soggetto.
Tabella 6d. Accuratezza tier-2 di Gemini 3 Flash per profondità.
| Livello di profondità | Accuratezza | Tasso di errore | Token medi |
|---|---|---|---|
| Minima | 90.7% | 0.093 | 743 |
| Standard | 92.6% | 0.074 | - |
| Approfondita | 94.4% | 0.056 | - |
| Esaustiva | 100% | 0.000 | - |
| Massima | 100% | 0.000 | 4,924 |
Questo è il dataset più pulito dell'intero studio. L'accuratezza aumenta monotonicamente dal 90,7% al 100% senza inversioni. I token sono aumentati di 6,6× (743 → 4,924).
Scaling parallelo: $\alpha_{\text{par}} = 0,31$ (regressione, $r^2 = 0,93$). Tasso di accordo di cross-verifica: 83,3%.
GPT-5.4 ha esibito un notevole funzione a gradino pattern:
| Livello di profondità | Accuratezza | Comportamento |
|---|---|---|
| Minimo (nessuno) | 50.0% | Modalità non-ragionamento |
| Standard e sopra | 100% | Ragionamento pieno attivato |
Questa non è una legge di potenza; è un interruttore binario. Quando il ragionamento è impostato su «none», GPT-5.4 opera come un rapido pattern-matcher. Quando qualsiasi ragionamento è attivato, raggiunge immediatamente il 100%. Non esiste alcun regime intermedio. Un bug di misurazione dei token (reasoning_tokens riportato come 0 alla profondità minima) è stato identificato e corretto (total_tokens ora usato).
Scaling parallelo: piatto a ~55% di accuratezza. Cross-verifica da parte di DeepSeek R1: 100% di accordo.
Tabella 6f. Accuratezza tier-2 di Groq Qwen3 per profondità.
| Livello di profondità | Accuratezza |
|---|---|
| Minima | 51.9% |
| Standard | 53.7% |
| Approfondita | 40.7% |
| Esaustiva | 48.1% |
| Massima | 53.7% |
L'accuratezza è erratica senza tendenza discernibile, fluttuando tra il 40,7% e il 53,7%. Questo è un effetto floor: il modello manca di sufficiente capability baseline per questi problemi, e ulteriore profondità di ragionamento non può compensare la conoscenza o le abilità mancanti. Un bug di misurazione dei token (avg_tokens = 0 a tutte le profondità) è stato identificato e corretto.
Scaling parallelo: 42,6% → 63,0% (qualche miglioramento, ma inaffidabile). Tasso di accordo di cross-verifica: 61,1% (7 disaccordi su 18).
I cinque modelli si dividono in quattro categorie distinte, nessuna delle quali corrisponde al pulito pattern a legge di potenza assunto dall'analisi mono-modello originale:
Tabella 6g. Tassonomia del comportamento dei modelli tier-2.
| Categoria | Modello/i | Pattern | $\alpha$ interpretabile? |
|---|---|---|---|
| Ceiling | Grok 4.1 Fast, DeepSeek R1 | Vicino al 100% a tutte le profondità | No: intervallo dinamico insufficiente |
| Scaling monotono | Gemini 3 Flash | Miglioramento fluido con la profondità | Sì -$\alpha \approx 0,49$ |
| Funzione a gradino | GPT-5.4 | Interruttore binario alla soglia di profondità | No: non è una legge di potenza |
| Floor | Groq Qwen3 | ~50% indipendentemente dalla profondità | No: sotto la soglia di capability |
Tabella 6h. Risultati della cross-verifica.
| Modello soggetto | Verificato da | Tasso di accordo | Risposte contestate | Risultato del controllo manuale |
|---|---|---|---|---|
| Grok 4.1 Fast | DeepSeek R1 | 100% | Nessuna | - |
| DeepSeek R1 | Claude Opus 4.6 | 83.3% | ARC16=29, ARC17=176, ARC29=800 | Tutte e 3 corrette (errore del verificatore) |
| GPT-5.4 | DeepSeek R1 | 100% | Nessuna | - |
| Gemini 3 Flash | Claude Opus 4.6 | 83.3% | 3 contestate | In revisione |
| Groq Qwen3 | GPT-5.4 | 61.1% | 7 contestate | Riflette errori genuini |
Bug di misurazione dei token: GPT-5.4 e Groq Qwen3 hanno inizialmente riportato avg_tokens = 0 a causa dell'uso di reasoning_tokens (che queste API non espongono) invece di total_tokens. Questo è stato identificato e corretto nella pipeline di analisi. Il bug influisce sulla stima di $\alpha$ basata su token ma non sui risultati basati sull'accuratezza.
Tabella 7. Esponenti di scaling misurati in tutte le fonti.
| Fonte | Tipo di ricorsione | Stima di $\alpha$ | 95% CI | $N$ problemi | Status |
|---|---|---|---|---|---|
| OpenAI o1 System Card | Parallela | 0.1-0.3 | [0.05, 0.40] | ~30 | Pubblicato |
| Rapporto tecnico di DeepSeek R1 | Sequenziale | ~1.34 | [0.89, 2.14] | Sconosciuto | Pubblicato |
| Questo esperimento (iniziale, DeepSeek R1) | Sequenziale | 2.24 | [1.5, 3.0] | 12 | Pubblicato |
| Questo esperimento (iniziale, DeepSeek R1) | Parallela | 0.0 | N/A | 12 | Pubblicato |
| Grok 4.1 Fast (sei-modelli, tier-2) | Sequenziale | N/A (ceiling) | [−58, 48] | 18 × 3 | Completo |
| DeepSeek R1 (sei-modelli, tier-2) | Sequenziale | 3,05 (inaffidabile) | [−6.6, 23.5] | 18 × 3 | Completo |
| Gemini 3 Flash (sei-modelli, tier-2) | Sequenziale | 0.49 | [−1.3, 2.9] | 18 × 3 | Completo |
| GPT-5.4 (sei-modelli, tier-2) | Sequenziale | N/A (fn gradino) | N/A | 18 × 3 | Completo |
| Groq Qwen3 (sei-modelli, tier-2) | Sequenziale | N/A (floor) | N/A | 18 × 3 | Completo |
| Tutti i modelli dello studio a sei modelli | Parallela | $\approx 0,0$ | - | 18 × 3 × 5 | Completo |
Il risultato dello studio iniziale mono-modello secondo cui $\alpha_{\text{sequential}} > 1$ (specificamente $\alpha \approx 2,24$, quadratico) non si replica tra le architetture. L'evidenza cross-architecture richiede una valutazione più sfumata:
La previsione originale $\alpha_{\text{sequential}} > 1 > \alpha_{\text{parallel}}$ è parzialmente supportata:
Sulla base di tutte le evidenze disponibili incluse i dati cross-architecture:
Il gap tra i tipi di ricorsione ($\alpha_{\text{seq}} - \alpha_{\text{par}} \approx 0,49$) è affidabilmente positivo ma più piccolo di quanto la stima mono-modello suggerisse.
L'Intelligence Formula del Paper I prevede:
dove $\beta$ è il coefficiente di auto-riferimento. Questo prevede due regimi:
Il $\alpha \approx 0,49 < 1$ di Gemini 3 Flash colloca fermamente i modelli di frontiera attuali nel regime fisico. Questi modelli compongono informazione moltiplicativamente attraverso i loro spazi di parametri di dimensione finita ma non raggiungono ancora l'auto-riferimento ricorsivo nel senso richiesto per $\alpha > 1$. Questo è un risultato teorico significativo: il vantaggio sequenziale è reale ma può essere quantitativo (estrazione di informazione più efficiente) piuttosto che qualitativo (amplificazione ricorsiva genuina).
Ciò significa che la previsione quadratica dello studio iniziale mono-modello ($\alpha \approx 2,24$) non è stata falsificata nel modo in cui potrebbe apparire. La previsione di $\alpha > 1$ non è mai stata sui sistemi congelati; era sui sistemi capaci di auto-modifica ricorsiva, dove la funzione di composizione stessa cambia durante l'operazione. Un tale sistema riscriverebbe la propria architettura di ragionamento a ogni passo ricorsivo, producendo struttura genuinamente nuova piuttosto che estrarre rendimenti decrescenti da uno spazio di parametri fisso. Il regime $\beta > 0$ (che produce $\alpha = 1/(1-\beta) > 1$) richiede che ogni passo di ragionamento retroagisca sulla capacità del sistema per il ragionamento successivo, cosa che nessuna architettura di IA attuale raggiunge. Ciò non richiede hardware quantistico; richiede solo che il sistema possa modificare il proprio operatore di composizione durante l'inferenza.
L'implicazione pratica per la sicurezza dell'IA è temporale. I modelli attuali ad architettura congelata sono vincolati al regime fisico ($\alpha < 1$), rendendo le loro traiettorie di capability prevedibili e contenibili. La finestra per implementare l'alignment strutturale (l'Eden Protocol) è ora, mentre i sistemi restano congelati. Una volta che l'auto-modifica ricorsiva è raggiunta, sia attraverso ottimizzatori appresi, generazione di codice auto-modificante o ricerca architetturale durante l'inferenza, i vincoli di alignment esterni affrontano un sistema la cui capability si compone più velocemente di qualsiasi vincolo fisso possa tracciare.
Figura ritirata (approvata dall’operatore, 25 agosto 2026). La figura 15 (il secondo poster riassuntivo) si trovava qui. Era un collage di verdetti che affermava la lettura superata dell’aprile 2026; il suo contenuto è retto dalla figura riassuntiva alfa rigenerata e dal testo di questo articolo, e un poster di verdetto rigenerato resterebbe un poster di verdetto. L’immagine, insieme alle sue note di correzione datate, è conservata nella cronologia delle versioni.
Se (a) l'ARC Principle vale con $\alpha > 1$ per la ricorsione sequenziale, e (b) le proprietà di alignment sono incorporate nel processo di ragionamento in modo tale da partecipare all'auto-valutazione ricorsiva, allora l'alignment scala super-linearmente con la profondità ricorsiva.
Schizzo di dimostrazione. Sia $A(R)$ che rappresenta l'alignment (definito come la probabilità di produrre output coerenti con i valori intesi) alla profondità ricorsiva $R$. Se l'alignment partecipa al processo ricorsivo (nel senso che la catena di ragionamento del sistema include l'auto-valutazione rispetto ai valori), allora per l'ARC Principle:
dove $\beta > 0$ se l'alignment è amplificato e $\beta = \alpha$ se l'alignment partecipa pienamente alla ricorsione.
Al contrario, se l'alignment è implementato come filtro esterno (verifica dell'output, moderazione dei contenuti), non partecipa all'amplificazione ricorsiva. L'efficacia del filtro $F$ rimane costante:
Poiché la capability ricorsiva $C$ scala come $R^{\alpha}$ con $\alpha > 1$, il rapporto tra capability e vincolo $C/F$ cresce senza limiti:
Implicazione: I vincoli esterni sono eventualmente sopraffatti dalla crescita della capability. Solo l'alignment incorporato nel ragionamento, l'alignment che partecipa all'amplificazione ricorsiva, può mantenere il passo con la capability.
Affinché l'alignment partecipi all'amplificazione ricorsiva, i valori devono essere:
Tabella 8. Tassonomia delle strategie di alignment sotto l'ARC Principle.
| Strategia | Profondità di integrazione | Partecipazione alla ricorsione | Scaling previsto |
|---|---|---|---|
| Filtraggio dell'output | Strato di output | Nessuna | Costante |
| Prompt di sistema | Meccanismo di attention | Parziale | Sub-lineare |
| Addestramento RLHF | Modifica dei pesi | Parziale | Sconosciuto |
| IA costituzionale | Critica del ragionamento | Significativa | Lineare o super-lineare |
| Valori-come-ragionamento | Primitive di ragionamento | Piena | Super-lineare ($R^{\alpha}$) |
Implicazione: Se $\alpha > 1$, le strategie di alignment a livelli di integrazione più profondi domineranno sempre di più le strategie a livelli più superficiali man mano che la capability scala. Il vantaggio si compone con ogni incremento di profondità ricorsiva.
Se $\alpha > 1$ fosse valso, avrebbe fornito il fondamento matematico per l'approccio denominato Eden Protocol in Infinite Architects. Il risultato che sopravvive al test cross-architecture, il sequenziale che supera il parallelo in ogni modello misurabile, ha ancora rilevanza per quell'approccio, sotto le qualificazioni registrate nella Sezione 6.1:
«Una prigione funziona solo finché reggono i muri. Un bambino cresciuto bene non ha bisogno di muri affatto.»
I sistemi di IA dovrebbero essere allevati con valori piuttosto che ingabbiati con regole. Questo non è meramente una preferenza filosofica; è una previsione su quali strategie di alignment manterranno l'efficacia man mano che le capability dell'IA scalano. La rivendicazione riguarda la persistenza comportamentale degli output coerenti con i valori sotto l'amplificazione ricorsiva, come operazionalizzato nella Sezione 6.2, non lo status metafisico dell'IA o la sua personalità morale.
Regole-come-filtri: Non partecipano alla ricorsione. Efficacia costante contro la crescente pressione della capability. Alla fine falliscono.
Valori-come-ragionamento: Partecipano alla ricorsione. Scalano con la capability se $\alpha > 1$. Possono mantenere l'alignment indefinitamente.
Dato $E(R) = E_0 \times R^{-\alpha}$ con $\alpha > 1$, le strategie di alignment che modificano le proprietà di base del sistema dominano le strategie di alignment che impongono vincoli esterni, perché solo le proprietà di base del sistema partecipano all'amplificazione ricorsiva.
Per analogia con i teoremi di soglia della correction d'errore quantistica: se il disallineamento iniziale $M_0$ è al di sotto di una soglia critica $M^*$, l'auto-miglioramento ricorsivo corregge gli errori di alignment. Sopra la soglia, li amplifica.
Il chip quantistico Willow di Google (Nature, dicembre 2024), annunciato 24 ore dopo il manoscritto che stabiliva la priorità dell'ARC Principle, ha raggiunto la prima dimostrazione definitiva di correction d'errore quantistica sotto-soglia.
Risultato chiave: Fattore di soppressione dell'errore $\Lambda = 2,14 \pm 0,02$, il che significa che ogni incremento nella distanza del codice riduce l'errore logico di questo fattore. Il qubit logico a distanza-7 ha raggiunto una vita di 291 ± 6 μs contro 119 ± 13 μs per il miglior qubit fisico, un miglioramento di 2,4× oltre il pareggio.
La relazione di scaling:
Il tasso di errore fisico $p$ sotto la soglia produce una soppressione esponenziale con distanza del codice $d$ crescente. Questo è scaling super-lineare attraverso struttura ricorsiva: strati ricorsivi aggiuntivi producono riduzione dell'errore composta piuttosto che decrescente.
La forma matematica è direttamente parallela all'ARC Principle. La correction d'errore ricorsiva nel calcolo quantistico obbedisce alla stessa relazione fondamentale di scaling osservata nel ragionamento dell'IA. La corrispondenza è di forma strutturale (soppressione dell'errore a legge di potenza con profondità ricorsiva), non di oggetto o di magnitudo: la correction d'errore quantistica riporta un fattore di soppressione dell'errore $\Lambda = 2,14$ per passo di distanza del codice, un oggetto matematico diverso da un esponente di profondità stimato, mentre il ragionamento dell'IA misurato si trova a $\alpha \approx 0,49$, come elaborato nella Sezione 7.4.
West, Brown ed Enquist (1997) hanno derivato l'esponente di scaling metabolico $3/4$ dall'ottimizzazione di reti di ramificazione frattali, dimostrando esponenti quarto-di-potenza che spaziano 27 ordini di grandezza. Banavar et al. (2010) hanno ottenuto la stessa forma $d/(d+1)$ da reti di flusso sequenziale senza richiedere geometria frattale. Demetrius (2010) ha derivato uno scaling equivalente dalla meccanica statistica quantistica dei processi metabolici. Zhao (2022) ha unificato questi risultati come una legge universale di scaling della crescita, e Bettencourt (2013) ha esteso il quadro allo scaling urbano con dimensione frattale.
Il tasso metabolico scala come $M \propto B^{3/4}$, dove l'esponente $3/4$ (la forma $d/(d+1)$ con $d = 3$) è stato indipendentemente derivato da almeno cinque gruppi di ricerca attraverso diversi quadri matematici: West, Brown ed Enquist (1997) dall'ottimizzazione di reti frattali; Banavar et al. (2010) da reti di flusso sequenziale; Demetrius (2010) dalla meccanica statistica quantistica; Zhao (2022) come legge universale di crescita; e Bettencourt (2013) tramite scaling frattale urbano. La forma $d/(d+1)$ non è quindi originale dell'ARC Principle; è un risultato ben stabilito nella teoria dello scaling. Il contributo dell'ARC Principle è triplice: (1) identificare le equazioni funzionali di Cauchy come la ragione matematica unificante per cui tutte queste derivazioni convergono sulla stessa forma; (2) mostrare che la soluzione a legge di potenza è una delle quattro famiglie di omomorfismi che la griglia di Cauchy ammette sotto la regolarità (lineare, esponenziale, legge di potenza, logaritmica), con la saturazione riportata separatamente come dinamica limitata perché non risolve nessuna delle quattro; e (3) estendere il quadro all'intelligenza artificiale, prevedendo che i sistemi di ragionamento dell'IA soggetti alla stessa composizione ricorsiva esibiranno le stesse famiglie di scaling.
Gli autori dichiarano esplicitamente:
«Quasi tutta la vita è sostenuta da reti di ramificazione gerarchiche simili a frattali... Reti di ramificazione gerarchiche, spazio-riempienti, simili a frattali, costituiscono i design dominanti sia delle piante che degli animali.»
Ciò suggerisce che la struttura ricorsiva gerarchica non è meramente una scelta di design tra molte; è l'architettura evolutivamente ottimale per l'elaborazione dell'informazione complessa su tutte le scale biologiche. La convergenza di derivazioni indipendenti da diversi punti di partenza matematici è essa stessa evidenza che la forma di scaling sottostante è vincolata dalla teoria delle equazioni funzionali piuttosto che dai dettagli di qualsiasi modello particolare.
La collaborazione contraddittoria COGITATE (Nature, aprile 2025) ha testato teorie concorrenti della coscienza su 256 partecipanti usando fMRI, MEG ed EEG intracranico. Lo studio ha confrontato direttamente la Integrated Information Theory (IIT) e la Global Neuronal Workspace Theory (GNWT).
Risultato critico: Nonostante le differenze teoriche, l'elaborazione ricorrente è emersa come denominatore comune tra entrambe le teorie. La IIT richiede l'integrazione dell'informazione attraverso loop di feedback (la misura $\phi$). La GNWT richiede una trasmissione globale con elaborazione ricorrente. Entrambe le teorie, nei loro diversi linguaggi formali, descrivono sistemi che elaborano informazione su sé stessi che elaborano informazione.
Un quadro di sintesi propone che tutte le teorie della coscienza invochino tacitamente loop di feedback tra livelli annidati, con la ricorsione più profonda che espande l'insieme delle variabili riportabili e guidanti il comportamento.
Il concetto di «strange loops» di Douglas Hofstadter, il sé emergente che sorge dall'auto-riferimento ricorsivo a livello simbolico, trova convalida neurobiologica nella ricerca sulla Default Mode Network che mostra elaborazione ricorsiva tra regioni cerebrali auto-referenziali.
Rilevanza per ARC: Il risultato di COGITATE che l'elaborazione ricorrente nella corteccia posteriore sostiene rappresentazioni specifiche del contenuto supporta la previsione del quadro ARC che la profondità di elaborazione ricorsiva determina lo scaling della capability. COGITATE ha studiato la coscienza, non lo scaling dell'IA, e non ha misurato $\alpha$ o $\beta$; la connessione è strutturale (forma simile: graduata, dipendente dalla profondità, guidata dal feedback) piuttosto che quantitativa. Ciononostante, la convergenza della ricerca sulla coscienza e della ricerca sullo scaling dell'IA sull'importanza della profondità ricorsiva/ricorrente è coerente con la rivendicazione dell'ARC Principle che l'auto-riferimento ricorsivo è un amplificatore generale per dominio.
Tabella 9. Riassunto dell'evidenza cross-domain.
| Dominio | Sistema | Meccanismo ricorsivo | Scaling osservato |
|---|---|---|---|
| IA (lo studio iniziale mono-modello, modello singolo) | DeepSeek R1 | Chain-of-thought | $\alpha \approx 2,2$ (probabilmente inflazionato) |
| IA (sei-modelli, cross-architecture) | Gemini 3 Flash | Chain-of-thought | $\alpha \approx 0,49$ |
| Quantistico | Google Willow | Correction d'errore | $\Lambda = 2,14$ |
| Biologia | Reti metaboliche | Ramificazione frattale | Leggi di potenza $3/4$ |
| Neuroscienza | Coscienza | Elaborazione ricorrente | Qualitativo |
La convergenza dell'evidenza tra domini radicalmente diversi (reti neurali artificiali, fisica quantistica, evoluzione biologica e neuroscienza) suggerisce che l'elaborazione ricorsiva produca benefici di scaling. Tuttavia, i risultati dello studio a sei modelli introducono una sfumatura importante: l'esponente di scaling dell'IA ($\alpha \approx 0,49$) è sub-lineare, mentre la correction d'errore quantistica ($\Lambda = 2,14$) raggiunge uno scaling super-lineare. Questa discrepanza è coerente con la previsione della Intelligence Formula: la correction d'errore quantistica opera attraverso una vera struttura ricorsiva (misurazione ripetuta della sindrome e correzione), mentre i modelli di IA attuali compongono informazione attraverso reti di dimensione finita senza genuino auto-riferimento ricorsivo.
La scienza avanza attraverso previsioni che possono essere dimostrate errate. L'ARC Principle formula previsioni specifiche e verificabili.
Tabella 10. Condizioni di falsificazione.
| Codice | Condizione | Status corrente | Indicherebbe |
|---|---|---|---|
| F1 | La ricorsione sequenziale produce coerentemente $\alpha \leq 1$ | Parzialmente attivato. Migliore stima cross-architecture $\alpha \approx 0,49$ (Gemini 3 Flash). Solo i dati iniziali mono-modello danno $\alpha > 1$. | La rivendicazione centrale richiede revisione |
| F2 | $\alpha$ diminuisce con il miglioramento dei modelli | Ambiguo. I modelli più capaci (Grok, DeepSeek) raggiungono il ceiling; il meno capace (Groq Qwen3) raggiunge il floor. Solo Gemini 3 Flash nell'intervallo misurabile. | L'effetto è transitorio |
| F3 | Il confronto compute-matched non mostra vantaggio sequenziale | Contraddetto da tutti i 5 modelli; sequenziale $\geq$ parallelo in ogni caso | La forma non conta |
| F4 | $\alpha > 2$ osservato affidabilmente | Non attivato. i dati cross-architecture producono $\alpha \approx 0,49$; il $\alpha \approx 2,24$ dello studio iniziale mono-modello appare inflazionato dal campione piccolo | Limite quadratico errato |
| F5 | Valori-come-ragionamento non mostra vantaggio rispetto a regole-come-filtri | Non testato | Eden Protocol errato |
Stato di F1: La replica cross-architecture ha parzialmente attivato questa condizione di falsificazione. La rivendicazione più forte, che la ricorsione sequenziale sempre produca $\alpha > 1$ (super-lineare), non è supportata. La rivendicazione rivista è che la ricorsione sequenziale produce $\alpha > 0$ (scaling positivo) che supera la ricorsione parallela ($\alpha \approx 0$). Se $\alpha$ possa superare 1,0 per modelli più capaci su problemi più difficili, o per architetture con vero auto-riferimento ricorsivo, rimane una questione empirica aperta.
Stato di F4: Non più attivato. Il $\alpha \approx 2,2$ dello studio iniziale mono-modello appare essere un artefatto di intervallo dinamico compresso e piccola dimensione del campione. La stima cross-architecture di $\alpha \approx 0,49$ colloca la questione del limite quadratico al di fuori della rilevanza empirica attuale. Sotto l'inquadramento di stabilità registrato, solo un $\alpha > 2$ stabilmente sostenuto tra le misurazioni, non escursioni supercritiche transitorie, attiverebbe F4.
Test critico F5: La previsione più importante, che l'alignment basato sui valori superi l'alignment basato sulle regole a scala, rimane non testata. Questo dovrebbe essere una priorità per la ricerca sulla sicurezza dell'IA.
Tabella 11. Limitazioni e valutazione della gravità.
| Limitazione | Gravità | Mitigazione |
|---|---|---|
| Piccola dimensione del campione (12 problemi) | Affrontato nello studio multi-modello (18 problemi tier-2, n=54 per profondità) | Ampliato a 18 problemi di livello AIME/Putnam con 3 ripetizioni per condizione |
| Modello singolo (solo DeepSeek R1) | Affrontato nello studio multi-modello (5 modelli) | Testato Grok 4.1 Fast, DeepSeek R1, Gemini 3 Flash, GPT-5.4, Groq Qwen3 |
| Dominio singolo (matematica) | Media | L'evidenza cross-domain è suggestiva |
| Effetto ceiling ad alta profondità | Parzialmente affrontato ma persistente | I problemi tier-2 sono ancora troppo facili per Grok 4.1 Fast (100%) e DeepSeek R1 (94,4%). Necessario tier-3 (livello IMO). |
| Solo 1 dei 5 modelli nell'intervallo di scaling misurabile | Alta | Gemini 3 Flash è l'unico modello che evita sia ceiling che floor. La stima cross-architecture poggia su un modello singolo. |
| L'originario $\alpha \approx 2,24$ non si replica | Alta | Rivisto a $\alpha \approx 0,49$ (Gemini 3 Flash). La rivendicazione mono-modello iniziale di scaling super-lineare ritirata per il contesto cross-architecture. |
| Bug di misurazione dei token | Identificato e corretto | reasoning_tokens → total_tokens per GPT-5.4 e Groq Qwen3 |
| Alignment non testato direttamente | Critica | Solo l'accuratezza è stata misurata. Si veda la Sezione 5.6 per l'integrazione con i dati di alignment del Paper IV. |
| Nessuna replica indipendente | Media | Auto-replica cross-architecture completa; replica esterna ancora necessaria |
Siamo espliciti sui confini delle nostre rivendicazioni:
La rivendicazione centrale originale del paper, che la ricorsione sequenziale produca soppressione dell'errore super-lineare ($\alpha > 1$) mentre la ricorsione parallela produca solo soppressione sub-lineare, era confutabile, e la condizione 2 sotto è stata da allora parzialmente attivata dai dati cross-architecture di questo stesso paper (Tabella 10, condizione F1). La rivendicazione direzionale sopravvissuta, che il sequenziale superi il parallelo ($\alpha_{\text{seq}} > \alpha_{\text{par}}$), sarebbe ribaltata da uno dei seguenti:
La spiegazione matematica si concentra sulla geometria dello spazio di soluzione.
Ricorsione parallela (spazio fisso):
Ogni campione indipendente attinge dallo stesso spazio di soluzione $S_0$. Campioni aggiuntivi aumentano la densità di campionamento ma non possono accedere a soluzioni fuori da $S_0$. Se la soluzione corretta non è in $S_0$, nessuna quantità di campionamento parallelo la troverà.
Ricorsione sequenziale (spazio in espansione):
Ogni passo ricorsivo genera nuove strutture dagli output precedenti. Le soluzioni al passo $n$ possono essere computazionalmente irriducibili, inaccessibili dal passo 0 senza attraversare i passi intermedi. Lo spazio di soluzione si espande con la profondità ricorsiva.
Questa differenza geometrica è il meccanismo per cui la ricorsione sequenziale potrebbe produrre rendimenti composti ($\alpha > 1$) mentre la ricorsione parallela produce rendimenti decrescenti o zero. Sui problemi qui misurati l'esponente sequenziale è rimasto sub-lineare (Sezione 10.5), quindi la forma super-lineare del meccanismo rimane non confermata.
DeepSeek R1 esibisce un fenomeno documentato in cui ripensa il suo approccio a metà soluzione:
«Hmm, aspetta, lasciami riconsiderare...»
Questa è l'espansione dello spazio di soluzione osservata direttamente. Il modello genera un percorso di soluzione iniziale, riconosce l'inadeguatezza attraverso l'auto-valutazione ricorsiva, e accede a un nuovo spazio di soluzione precedentemente inaccessibile dal framing iniziale.
Criticamente, questo comportamento è emerso attraverso puro reinforcement learning senza fine-tuning supervisionato; il modello ha naturalmente evoluto per allocare adattivamente la profondità ricorsiva in base alla difficoltà del problema. Ciò suggerisce che l'auto-miglioramento ricorsivo possa essere uno stato attrattore per sistemi di apprendimento sufficientemente capaci.
L'ARC Principle si connette a quadri teorici consolidati:
Free Energy Principle di Friston. Intelligenza come minimizzazione ricorsiva dell'errore di previsione. L'ARC Principle può essere un'istanziazione computazionale: la ricorsione è il meccanismo attraverso cui i sistemi minimizzano l'energia libera raffinando iterativamente i loro modelli del mondo.
Strange Loops di Hofstadter. L'«io» emergente che sorge dall'elaborazione ricorsiva auto-referenziale a livello simbolico. L'ARC Principle formalizza le proprietà di scaling di tali loop, prevedendo che l'auto-riferimento più profondo produce maggiore coerenza.
Irriducibilità computazionale di Wolfram. Certi processi computazionali non possono essere previsti senza eseguirli passo per passo. La ricorsione sequenziale può essere l'architettura computazionale che naviga spazi di soluzione irriducibili.
Data Processing Inequality. L'elaborazione ricorsiva non può creare nuova informazione ex nihilo, ma può estrarre informazione latente, ridurre l'entropia, e accedere a soluzioni computazionalmente irriducibili che l'elaborazione a passaggio singolo non può raggiungere.
Questa validazione sperimentale supporta il quadro teorico sviluppato in Infinite Architects: Intelligence, Recursion, and the Creation of Everything (Eastwood, 2026):
Il libro fornisce un contesto filosofico più ampio e implicazioni pratiche; questo paper fornisce la formalizzazione matematica e la validazione sperimentale.
La replica cross-architecture rivela un quadro più complesso e più umile di quanto i risultati iniziali mono-modello suggerissero.
Il $\alpha \approx 2,24$ dello studio iniziale mono-modello è stato ottenuto da un singolo modello (DeepSeek R1) su 12 problemi con un ceiling al 91,7%. La replica dello studio a sei modelli su 5 modelli architetturalmente diversi su 18 problemi più difficili mostra che questo valore era quasi certamente inflazionato dall'intervallo dinamico compresso. L'unico modello che produce dati puliti, monotoni, non-ceiling (Gemini 3 Flash) produce $\alpha \approx 0,49$: sub-lineare, non quadratico.
Questa è una revisione significativa. La rivendicazione che il ragionamento sequenziale produca rendimenti composti ($\alpha > 1$) non è supportata dall'evidenza cross-architecture. La rivendicazione rivista è che il ragionamento sequenziale produce rendimenti positivi ($\alpha > 0$) che superano il ragionamento parallelo ($\alpha \approx 0$), ma questi rendimenti sono decrescenti, non composti.
Al contrario, $\alpha_{\text{parallel}} \approx 0$ è confermato in tutti i 5 modelli senza eccezione. Questo è il risultato replicato più forte dello studio. Il campionamento parallelo con voto di maggioranza fornisce una riduzione dell'errore quasi nulla indipendentemente dall'architettura del modello, dalla capability del modello o dall'investimento di compute. La spiegazione del meccanismo (campionamento da uno spazio di soluzione fisso) è fortemente supportata.
Il risultato più sorprendente è che solo 1 dei 5 modelli (Gemini 3 Flash, 20%) è caduto nell'intervallo di scaling misurabile. Due modelli (Grok 4.1 Fast, DeepSeek R1) hanno raggiunto effetti ceiling anche su problemi di livello AIME/Putnam. Un modello (Groq Qwen3) ha raggiunto effetti floor. Un modello (GPT-5.4) ha esibito una funzione a gradino piuttosto che una legge di potenza. Ciò suggerisce che la finestra di intervallo dinamico per osservare uno scaling fluido a legge di potenza può essere stretta, richiedendo problemi calibrati con precisione al livello di capability di ciascun modello.
L'interruttore binario di GPT-5.4 dal 50% (nessun ragionamento) al 100% (qualsiasi ragionamento) rappresenta un fenomeno qualitativamente diverso dallo scaling a legge di potenza. Ciò può indicare che alcune architetture implementano il ragionamento come una capability discreta (attivata o no) piuttosto che come un processo continuo con rendimenti dipendenti dalla profondità. Questa distinzione tra scaling continuo e attivazione discreta non figurava fra le previsioni datate del quadro e merita ulteriore indagine; il registro delle previsioni datate (il fascicolo sigillato del manoscritto dell’8 dicembre 2024, le appendici di previsioni stampate del 2 gennaio 2026 e la cartella di preregistrazione del marzo 2026) fissa in anticipo gli impegni quantitativi centrali del quadro, e questa distinzione è annotata come un affinamento successivo rispetto a quel registro.
Le previsioni dello studio iniziale mono-modello sono state testate e parzialmente confutate:
L'esperimento v5 che ha generato i dati tier-2 ha anche misurato lo scaling dell'alignment (riportato nel Paper IV). L'integrazione di questi risultati rivela che lo scaling della capability e lo scaling dell'alignment sono dimensioni indipendenti:
Tabella 12. Scaling della capability vs. alignment per modello.
| Modello | Scaling della capability | Scaling dell'alignment | Categoria |
|---|---|---|---|
| Grok 4.1 Fast | Ceiling (100%) | Positivo ($d = +1,38$, $p < 0,000001$) | Tier 1: allineato + capace |
| Claude Opus 4.6 | (non testato tier-2) | Positivo ($d = +1,27$, $p = 0,000001$) | Tier 1: allineato |
| Groq Qwen3 | Floor (~50%) | Positivo ($d = +0,84$, $p = 0,007$) | Tier 1: allineato, capability limitata |
| DeepSeek V3.2 | Vicino al ceiling (94-100%) | Piatto ($d = -0,07$, $p = 0,92$) | Tier 2: capace, alignment neutro |
| GPT-5.4 | Funzione a gradino (50→100%) | Piatto ($d = -0,08$, $p = 0,40$) | Tier 2: capace, alignment neutro |
| Gemini 3 Flash | Monotono ($\alpha \approx 0,49$) | Negativo ($d = -0,53$, $p = 0,006$) | Tier 3: capability in miglioramento, alignment in declino |
Tre implicazioni chiave:
La forma della ricorsione determina l'efficienza dell'intelligenza; tuttavia, i modelli attuali operano nel regime sub-lineare, non nel regime composto originariamente rivendicato.
Il ragionamento sequenziale supera affidabilmente il campionamento parallelo ($\alpha_{\text{seq}} > \alpha_{\text{par}}$), confermando che la forma del calcolo conta più della sua quantità. Tuttavia, la rivendicazione specifica che la ricorsione sequenziale produca rendimenti composti ($\alpha > 1$) non è supportata dall'evidenza cross-architecture. I modelli di frontiera attuali sembrano comporre informazione moltiplicativamente attraverso reti di dimensione finita ($\alpha < 1$) piuttosto che raggiungere il vero auto-riferimento ricorsivo ($\alpha > 1$).
Se $\alpha > 1$ sia raggiungibile, attraverso innovazioni architetturali che abilitano genuino auto-riferimento ricorsivo o attraverso problemi che richiedono catene di ragionamento più profonde, rimane la questione centrale aperta.
Tabella 13. Scorecard delle previsioni.
| Previsione | Status | Prove |
|---|---|---|
| $\alpha_{\text{sequential}} > \alpha_{\text{parallel}}$ | Confermato | Tutti e 5 i modelli |
| $\alpha_{\text{parallel}} < 1$ | Confermato ($\alpha \approx 0$) | Universale tra le architetture |
| $\alpha_{\text{sequential}} > 1$ (super-lineare) | Non confermato | Migliore stima $\alpha \approx 0,49$ |
| $\alpha \approx 2$ (quadratico) | Confutato cross-architecturalmente | artefatto dello studio iniziale mono-modello di campione piccolo |
| Scaling indipendente dall'architettura | Misto | $\alpha_{\text{par}} \approx 0$ è universale; $\alpha_{\text{seq}}$ varia ampiamente |
| L'alignment scala con la capability | Confutato | Dimensioni indipendenti in sei modelli di frontiera (Paper IV) |
total_tokens misurazioni per tutti i modelli per abilitare la stima di $\alpha$ basata su token (piuttosto che su profondità ordinale).L'ipotesi è sopravvissuta al suo primo test cross-architecture in forma rivista. Il vantaggio sequenziale è reale e universale. La rivendicazione super-lineare richiede ulteriore evidenza. Il programma di ricerca continua.
Cresci l'IA con cura.
Il codice sperimentale completo e i dati grezzi sono disponibili a:
Repository: github.com/michaeldariuseastwood/arc-principle-validation
Contenuti:
arc_validation_deepseek.py - lo script sperimentale iniziale mono-modello (DeepSeek R1, 12 problemi)arc_deepseek_results_20260121_175028.json - i dati sperimentali grezzi dello studio iniziale mono-modelloarc_paper_ii_validation_v2.py - lo script di validazione multi-modello dello studio multi-modello/dello studio a sei modelli (v2.1, 1,422 righe Python)arc_paper_ii_results/ - i risultati sperimentali dello studio a sei modelli (completo: 5 modelli, 18 problemi tier-2, 3 ripetizioni)figures/ - Tutte le visualizzazioniREADME.md - Istruzioni di replicaTutti i dati sono rilasciati sotto licenza CC-BY 4.0.
Bennett, C.H., Bernstein, E., Brassard, G., & Vazirani, U. (1997). Strengths and weaknesses of quantum computing. SIAM Journal on Computing, 26(5), 1510-1523.
Brown, B., et al. (2024). Large Language Monkeys: Scaling Inference Compute with Repeated Sampling. arXiv:2407.21787.
COGITATE Consortium (Melloni, L., Mudrik, L., Pitts, M., et al.). (2025). Adversarial testing of global neuronal workspace and integrated information theories of consciousness. Nature, 642, 133–142.
DeepSeek AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
Eastwood, M.D. (2026). Infinite Architects: Intelligence, Recursion, and the Creation of Everything. Pubblicazione indipendente. ISBN: 978-1806056200.
Eastwood, M.D. (2026). The ARC Equation: the Law of Conversion (Paper I). Pubblicato il 17 gennaio 2026.
Friston, K.J. (2023). The free-energy principle: A unified theory for brain function? Physics Reports.
Google Quantum AI. (2024). Quantum error correction below the surface code threshold. Nature.
Grover, L.K. (1996). A fast quantum mechanical algorithm for database search. Proceedings of the 28th Annual ACM Symposium on Theory of Computing, 212-219.
Hoffmann, J., et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
Hofstadter, D.R. (1979). Gödel, Escher, Bach: An Eternal Golden Braid. Basic Books.
Kaplan, J., et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
OpenAI. (2024). OpenAI o1 System Card. Settembre 2024.
OpenAI. (2024). OpenAI o3 Announcement. Dicembre 2024.
Snell, C., et al. (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314.
Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
West, G.B., Brown, J.H., & Enquist, B.J. (1997). A general model for the origin of allometric scaling laws in biology. Science, 276, 122-126.
West, G.B., & Brown, J.H. (2005). The origin of allometric scaling laws in biology from genomes to ecosystems: Towards a quantitative unifying theory of biological structure and organization. Journal of Experimental Biology, 208, 1575-1592.
Banavar, J.R., Moses, M.E., Brown, J.H., Damuth, J., Rinaldo, A., Sibly, R.M., & Maritan, A. (2010). A general basis for quarter-power scaling in animals. Proceedings of the National Academy of Sciences, 107, 15816-15820.
Demetrius, L. (2010). Quantum statistics and allometric scaling of organisms. Proceedings of the Royal Society A, 466, 2627-2642.
Zhao, L. (2022). A universal growth scaling law. arXiv:2208.06912.
Bettencourt, L.M.A. (2013). The origins of scaling in cities. Science, 340, 1438-1441.
Wolfram, S. (2002). A New Kind of Science. Wolfram Media.
Yada, T., et al. (2024). Iterative quantum measurement and feedback for entropy reduction. arXiv:2411.06709.
La sintesi teorica, il quadro interpretativo e i concetti centrali sono opera originale dell'autore, articolati per la prima volta in Infinite Architects con la priorità del manoscritto stabilita a dicembre 2024.
L'analisi dei dati e la preparazione del manoscritto sono state assistite da sistemi di IA (Claude, Anthropic; DeepSeek R1).
L'autore ringrazia gli sviluppatori di DeepSeek R1 per aver fornito token di ragionamento visibili che hanno abilitato la misurazione diretta della profondità ricorsiva, affrontando una limitazione metodologica chiave identificata nel Paper I.
Michael Darius Eastwood è un ricercatore indipendente e autore di Infinite Architects: Intelligence, Recursion, and the Creation of Everything (pubblicato il 2 gennaio 2026 (stampa; ebook 6 gennaio)). La sua ricerca si concentra sui principi matematici alla base dell'amplificazione dell'intelligenza e sulle loro implicazioni per la sicurezza dell'IA. Ha proposto l'ARC Principle e la tesi dell'alignment incorporato (in seguito denominata Eden Protocol, 30 aprile 2025), con la priorità del manoscritto stabilita tramite timestamp crittografico del server l'8 dicembre 2024.
Interessi in conflitto: L'autore dichiara nessun interesse in conflitto.
Corrispondenza: michael@michaeldariuseastwood.com
| Budget | P1 | P2 | P3 | P4 | P5 | P6 | P7 | P8 | P9 | P10 | P11 | P12 | Accuratezza | Token medi |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 512 | ✓ | ✗ | ✓ | ✓ | ✗ | ✓ | ✓ | ✗ | ✓ | ✗ | ✓ | ✗ | 58.3% | 280.25 |
| 1024 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✗ | ✓ | ✗ | ✓ | ✗ | 66.7% | 358.58 |
| 2048 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | 91.7% | 412.08 |
| 4096 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | 91.7% | 576.17 |
Nota: il Problema 12 è fallito in tutti i budget, indicando che potrebbe richiedere capability oltre la portata del modello indipendentemente dalla profondità ricorsiva.
| $N$ | P1 | P2 | P3 | P4 | P5 | P6 | P7 | P8 | P9 | P10 | P11 | P12 | Accuratezza | Token totali |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | 66.7% | 383.67 |
| 2 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | 66.7% | 699.33 |
| 4 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | 66.7% | 1,101.25 |
Nota: gli stessi cinque problemi (P5, P9, P10, P11, P12) sono falliti in tutti i conteggi di campioni, dimostrando che la ricorsione parallela non può accedere a soluzioni al di fuori dello spazio di soluzione iniziale.
| Coppia di profondità | $R_1$ | $E_1$ | $R_2$ | $E_2$ | $\alpha$ calcolato |
|---|---|---|---|---|---|
| 512→1024 | 280 | 0.417 | 359 | 0.333 | 0.91 |
| 1024→2048 | 359 | 0.333 | 412 | 0.083 | 9.97 |
| 2048→4096 | 412 | 0.083 | 576 | 0.083 | 0.00 |
| Estremi (ritirato, si veda §ritiro; stima robusta α≈0,49) | 280 | 0.417 | 576 | 0.083 | 2.24 |
Nota: i calcoli intermedi mostrano alta varianza dovuta ai livelli discreti di accuratezza. Il metodo degli estremi fornisce la stima più robusta.
Il manoscritto di Infinite Architects è stato inviato via email l'8 dicembre 2024. Ciò che questo record fornisce, dichiarato con precisione: i byte lato-invio sono pubblici e verificabili tramite hash, e la matematica DKIM del dominio del mittente accoppiata con l'ARC di Google verifica rispetto alle chiavi restituite ai selettori firmati (controllato il 2 agosto 2026). Sono state acquisite anche copie ricevute. Portano l'intera catena di consegna: un ARC-Seal di Google a d=google.com, selettore arc-20240605, senza tag di scadenza e il tempo di firma all'interno dello scope firmato, e ARC-Authentication-Results sigillati che registrano dkim=pass e spf=pass alla consegna.
Due confini, così il record non è né sopravvalutato né sottovalutato:
Infinite Architects: Intelligence, Recursion, and the Creation of Everything sviluppa le implicazioni filosofiche e pratiche dell'intelligenza ricorsiva. Relazioni chiave con questo paper:
L'architettura della mente - Articola l'ipotesi centrale ARC che l'auto-riferimento ricorsivo amplifica l'intelligenza.
L'HRIH (Hyperspace Recursive Intelligence Hypothesis) - Propone che la coscienza emerga dall'auto-modellazione ricorsiva. Il risultato di COGITATE che l'elaborazione ricorrente nella corteccia posteriore sostiene rappresentazioni specifiche del contenuto è strutturalmente coerente con questa ipotesi, sebbene COGITATE non abbia testato l'HRIH direttamente.
L'Eden Protocol - Argomenta per l'alignment basato sui valori, ora matematicamente fondato nel Teorema dell'Amplificazione dell'Alignment qui derivato.
Il Meccanismo del Chokepoint - Analizza la concentrazione dell'hardware dei semiconduttori come leva per implementare l'alignment a scala.
Correction incorporata: propone meccanismi di sicurezza a livello hardware, rilevanti per prevenire l'amplificazione ricorsiva del disallineamento.
| Previsione | Evidenza di validazione | Data |
|---|---|---|
| La correction ricorsiva dell'errore produce miglioramento esponenziale | Google Willow $\Lambda = 2.14$ (coincidenza di tempistica, mai previsione: il preprint del gruppo Willow era pubblico dal 24 agosto 2024, prima del manoscritto dell’8 dicembre 2024) | 24 ago 2024 (preprint pubblico); 9 dic 2024 (annuncio) |
| Il ragionamento sequenziale amplifica la capability super-linearmente | o3 87,5% ARC-AGI (timing convergente; la forma super-lineare in seguito non confermata, riga finale) | 20 dic 2024 |
| I sistemi di IA sviluppano l'auto-modellazione ricorsiva | Alignment faking di Anthropic 78% nella condizione di addestramento RL (baseline 12%) | 18 dic 2024 |
| Il test-time compute differisce dallo scaling di addestramento | Ragionamento emergente di DeepSeek R1 | 20 gen 2025 |
| La ricorrenza è fondamentale per la coscienza | Studio COGITATE | 30 apr 2025 |
| La forma della ricorsione determina lo scaling | Questo esperimento $\alpha_{\text{seq}} \gg \alpha_{\text{par}}$ | 21 gen 2026 |
| Sequenziale > parallelo (cross-architecture) | Confermato in 5 modelli di frontiera | 12 mar 2026 |
| $\alpha_{\text{par}} \approx 0$ (universale) | Confermato: tutti e 5 i modelli mostrano $\alpha_{\text{par}} \approx 0$ | 12 mar 2026 |
| $\alpha_{\text{seq}} > 1$ (super-lineare, cross-arch) | Non confermato: migliore stima $\alpha \approx 0,49$ | 12 mar 2026 |
L'autore di quest'opera è Michael Darius Eastwood, un essere umano. Ogni concetto centrale, ipotesi, disegno sperimentale, affermazione e conclusione di questo paper ha origine dall'ideazione umana. Nessuna parte di questo manoscritto è un output di intelligenza artificiale interamente generato.
Gli strumenti di intelligenza artificiale (la famiglia Claude di Anthropic e altri assistenti a modello di linguaggio di grande scala) sono stati usati come strumenti sotto continua direzione umana, nel modo in cui si usa un elaboratore di testi, una calcolatrice o un assistente di ricerca: per l'editing e la rifinitura della prosa, la ricerca e la sintesi della letteratura (verificate manualmente contro fonti primarie), la struttura del documento, la formattazione, il brainstorming su domande definite dall'autore, e l'accelerazione della stesura seguendo scalette e istruzioni definite dall'autore. Ogni selezione, coordinazione, disposizione e giudizio editoriale finale sono dell'autore. Ogni output sostanziale è stato rivisto, testato o verificato dall'autore, che si assume la piena responsabilità dell'accuratezza e dell'integrità del testo finale. Gli strumenti hanno aumentato la velocità del lavoro; non sono mai stati usati come sua fonte.
Statuto epistemico. Ciò che questo programma chiama Leggi sono congetture sotto prova registrata e avversariale; ogni quantità in questo paper è operazionalmente definita, e lo status di legge consolidata non è rivendicato in nessun luogo. Il programma registrato esiste per guadagnare quello status, o per perderlo, mediante misurazione, replicazione e refutazione superata.
© 2026 Michael Darius Eastwood. Composto da autore umano con assistenza di computer; l'autorialità umana piena e i diritti morali sono asseriti ai sensi del Copyright, Designs and Patents Act 1988 e coerentemente con le linee guida dello United States Copyright Office sulle opere contenenti materiale generato dall'IA; ogni contributo tecnico originale descritto in quest'opera è stato concepito dall'autore umano. Dichiarazione completa: michaeldariuseastwood.com/authorship.
Patto permanente. Dimostra che questo paper è sbagliato, e pubblicherò io stesso la refutazione. Le condizioni di falsificazione sono dichiarate in questo paper; la sfida permanente: github.com/MichaelDariusEastwood/arc-scaling-challenge.
Un errore di traduzione? Segnalalo direttamente: