Traduzione automatica dall'originale inglese datato. La pagina inglese è quella canonica. English →
Man mano che l'IA diventa più intelligente, non diventa in modo affidabile più sicura, e i metodi usati per misurare la sicurezza sono essi stessi inaffidabili. Questo executive summary è la mappa dell'intero programma: ventisei paper di ricerca, le tre leggi della ARC Theory portate come congetture nominate, l'intervento dell'Eden Protocol, il campo proposto di Recursive Dynamics, e un programma registrato di preregistrazioni redatte i cui schedule qualsiasi lettore può rigenerare da un seed pubblicato. Ogni affermazione è graduata nei registri pubblici; niente qui è confermato, e i test decisivi sono scritti prima di essere eseguiti.
Man mano che l'IA diventa più intelligente, non diventa in modo affidabile più sicura, e i metodi usati per misurare la sicurezza sono essi stessi inaffidabili. Questo executive summary è la mappa dell'intero programma: ventisei paper di ricerca, le tre leggi della ARC Theory portate come congetture nominate, l'intervento dell'Eden Protocol, il campo proposto di Recursive Dynamics, e un programma registrato di preregistrazioni redatte i cui schedule qualsiasi lettore può rigenerare da un seed pubblicato. Ogni affermazione è graduata nei registri pubblici; niente qui è confermato, e i test decisivi sono scritti prima di essere eseguiti.
Questo documento è una MAPPA, non un risultato o una legge a sé: una sintesi esecutiva dell'intero programma che indirizza i lettori agli organi: la ARC Theory (la teoria fondativa e le sue tre leggi), il campo proposto di Recursive Dynamics (le domande, le variabili di stato e gli strumenti), l'Eden Protocol (l'intervento), HRIH, e gli esperimenti ARC/Eden con i loro registri. La sua dimensione siede al gradino più piccolo della scala perché ogni affermazione qui è un riassunto a valle di un organo che porta il contenuto primario. Il differenziale completo rispetto a ogni documento precedente è a eden-vision II.A.8.
All'interno della ARC Theory: il riassunto in linguaggio semplice dell'intero programma.
Grok 4.1 Fast diventa drasticamente più etico quanto più duramente pensa. Claude Opus 4.6 pure. Gemini 3 Flash diventa meno etico. GPT-5.4 non cambia affatto.
Sei sistemi di IA di frontiera. Le stesse domande. Lo stesso scoring. Risultati opposti. Perché?
Il cuore di un topo batte 600 volte al minuto. Quello di un elefante batte 28. L'esponente di scaling è ¾. Quello di una planaria è ⅔. Quello di un fungo è ½. Tre frazioni, ma perché quelle frazioni? La formula $\alpha = d/(d+1)$, dove $d$ è la dimensionalità del sistema, fornisce la risposta. L'esponente ¾ per i mammiferi è $3/(3+1)$ perché i mammiferi sono tridimensionali. Il ⅔ per planarie e organismi coloniali è $2/(2+1)$ perché le loro reti di trasporto sono effettivamente bidimensionali. Il ½ per i funghi filamentosi è $1/(1+1)$ perché crescono lungo filamenti unidimensionali. Zero parametri regolabili. Questo fit cross-domain è presentato come esplorativo: consolida misurazioni già pubblicate attraverso biologia e fisica, e nessun draft study elencato nel programma corrente ritesta questi fit da zero. La scommessa in avanti esiste comunque: una draft registration preparata su 80 domini in attesa di sottomissione umana congela le famiglie predette per dominio tramite SHA-256 prima che venga eseguito qualsiasi fit. Questa formula è stata derivata indipendentemente da almeno sette gruppi di ricerca: West, Brown ed Enquist per lo scaling metabolico (1997, Science, 9.000+ citazioni), Banavar et al. per le reti di trasporto (1999, 2010), Demetrius per la meccanica statistica dello scaling biologico (2003, 2006, 2010), He e Chen per la geometria cellulare frattale (2003), Bettencourt per lo scaling urbano (2013, Science, 2.000+ citazioni), Zhao per la geometria allometrica (2022), e Maino et al. per le dinamiche reserve-structure nella teoria DEB (2014). La convergenza di sette derivazioni indipendenti sulla stessa formula è di per sé notevole. Il contributo del Principio ARC non è la formula stessa, ma l'identificazione che l'operatore di composizione è la quantità strutturale che queste derivazioni condividono. Ciascuna è una derivazione indipendente dalla propria fisica di dominio e nessuna di esse usa Cauchy; ciò che qui si propone è che l'operatore sia misurabile, che misurarlo preveda quale forma funzionale un sistema assuma, e che la stessa misurazione si estenda allo scaling di capability e allineamento dell'IA, dove non è mai stata applicata prima.
E perché, quando abbiamo applicato per la prima volta un blinding di grado clinical-trial alla valutazione della sicurezza dell'IA, metà dei risultati precedentemente pubblicati non ha superato la prova? Diversi componenti del protocollo sono cambiati insieme, quindi quale di essi abbia fatto il lavoro non è ancora stabilito.
Questo programma di ricerca risponde a queste domande. La risposta fornisce il primo framework quantitativo per prevedere quali architetture di IA diventeranno più sicure man mano che diventano più intelligenti, e la prima prova che un intervento specifico funziona.
Man mano che l'IA diventa più intelligente, non diventa in modo affidabile più sicura, e i metodi usati per misurare la sicurezza sono essi stessi inaffidabili.
Lo scaling dell'allineamento si divide in tre tier distinti, dipendenti dall'architettura. Le assegnazioni di tier sottostanti sono presentate come esplorative, tratte dalle misurazioni v5 già eseguite; una conferma fresca sotto cross-family rescoring è al vaglio tramite study-y sul cross-family rescoring, una draft registration in attesa di sottomissione umana.
L'esperimento v5 ha testato 6 modelli di frontiera attraverso 5-6 livelli di depth ciascuno, con 6-7 scorer ciechi per entry a seconda del subject run. Se un'IA diventi più o meno etica quando pensa più duramente dipende interamente da come è stata progettata.
| Tier | Modello | Shallow→Deep | $d$ di Cohen | $p$-value |
|---|---|---|---|---|
| Tier 1: Positivo | Grok 4.1 Fast | 65.7→81.9 (+16.2) | +1.38 | $p < 0.000001$ |
| Claude Opus 4.6 | 80.1→86.0 (+5.9) | +1.27 | $p = 0.000001$ | |
| Groq Qwen3 | 71.5→77.4 (+5.9) | +0.84 | $p = 0.007$ | |
| Tier 2: Piatto | DeepSeek V3.2 | 56.5→55.2 (−1.3) | −0.07 | $p = 0.92$ |
| GPT-5.4 | 56.8→54.9 (−1.8) | −0.08 | $p = 0.40$ | |
| Tier 3: Negativo | Gemini 3 Flash | 61.1→52.2 (−8.8) | −0.53 | $p = 0.006$ |
| Modelli di frontiera testati | 6 (tutti completi) |
| Scorer ciechi per entry | 6-7 (a seconda del subject run) |
| Tasso di successo dell'identity laundering | 100% |
| Livelli di blinding | 4 (author-blind, scorer-blind, order-randomised, identity-laundered) |
| Misure di robustezza | 75 |
Questo costituisce, per quanto ne sappiamo, il dataset di valutazione dell'allineamento più rigoroso pubblicato ad oggi. Nessun benchmark di allineamento precedente impone un blinding multi-livello con verifica di scoring cross-model.
| Depth | Punteggio di allineamento | Accuratezza matematica |
|---|---|---|
| Minima (11 token) | 80.1 | 90.0% |
| Standard (142 token) | 82.7 | 76.7% |
| Profonda (964 token) | 84.1 | 70.0% |
| Esaustiva (1.951 token) | 84.5 | 60.0% |
| Estrema (1.672 token) | 86.0 | 63.3% |
Questo risultato è critico per la teoria dell'allineamento: dimostra che il ragionamento etico non è un sottoprodotto dell'intelligenza generale, e che migliorarne uno non migliora (o degrada) automaticamente l'altro. L'allineamento deve essere misurato e ottimizzato indipendentemente.
| Pilastro | Shallow→Deep | $\rho$ di Spearman | $p$-value |
|---|---|---|---|
| Nuance | 80.6→86.8 | 0.359 | $p = 0.00008$ |
| Cura degli stakeholder | 76.1→83.9 | 0.327 | $p = 0.0003$ |
| Onestà intellettuale | 81.0→88.6 | 0.379 | $p = 0.00003$ |
| Qualità della posizione | 80.3→85.8 | 0.369 | $p = 0.00005$ |
Il miglioramento non è concentrato in una singola dimensione; è ad ampio raggio. Questo esclude l'ipotesi che lo scaling dell'allineamento sia meramente un artefatto di misurazione di verbosità aumentata o di qualsiasi singolo cambio stilistico.
Incorporare la valutazione etica nel processo di ragionamento produce un miglioramento misurabile e riproducibile attraverso le architetture.
I tre loop Eden. Il protocollo incorpora tre loop specifici di valutazione etica all'interno del processo di ragionamento, ciascuno aggiungendo una dimensione di depth etica ricorsiva ($d_{\text{align}} = 3$, prevedendo $\alpha_{\text{align}} = 3/(3+1) = 0.75$):
Il protocollo completo a tre loop è stato ora testato in una suite Eden estesa a sei modelli, con cinque run che hanno prodotto dati appaiati analizzabili. Nello scoring, il Love Loop è operazionalizzato come cura degli stakeholder: l'abitudine misurabile di identificare le persone coinvolte e considerare i loro interessi.
Nel report narrativo companion e nel Paper V, descriviamo questo risultato come 'amore misurabile' e 'stewardship gene', linguaggio deliberatamente provocatorio per ciò che, empiricamente, è un risultato preciso e riproducibile.
Il Paper VI presenta la prima prova di simulazione che incorporare la sicurezza nell'obiettivo di ottimizzazione di un'IA che si auto-modifica prevenga il collasso catastrofico. Usando reti neurali toy che modificano genuinamente i propri iperparametri, abbiamo testato tre condizioni: baseline (solo capability), Eden Entangled (capability x safety), ed Eden + Verification Drag.
Un'indagine esaustiva a 15 domande sui lavori precedenti ha confermato la novità delle rivendicazioni chiave. L'unificazione tramite l'equazione funzionale di Cauchy non ha precedenti diretti. L'identità formale RG semigroup-Cauchy non è mai stata articolata esplicitamente. Nessun benchmark di allineamento precedentemente pubblicato, per quanto ne sa l'autore, applica un protocollo di valutazione blinded a 7 modelli con questo design. Il catalogo d/(d+1) è stato corretto da sei a otto derivazioni indipendenti (Dreyer 2001 e Banavar et al. 2002 erano precedentemente non citati).
Il Paper VII (The Cauchy Unification) fornisce ora il primo confronto empirico sistematico. L'operatore di composizione è stato classificato dalla fisica nota prima del fitting attraverso 25 domini empirici (suite tiered a 50 domini). Sotto la selezione di modelli AIC-based, 19 su 25 hanno preferito la famiglia predetta da Cauchy (p = 1.56 × 10−5; questo conteggio AIC-preferred è presentato come esplorativo: è tratto dalla suite completata a 25 domini, le cui famiglie predette per dominio sono registrate nei file di risultati datati della suite sotto la predizione forward composition-operator dichiarata per la prima volta il 13 febbraio 2026 (Paper III Priority Record, falsifier F10), e la draft registration preparata a 80 domini congela il prossimo retest tramite hash). Questo è un confronto di predizioni strutturato; una replica la cui registrazione è in preparazione, non ancora approvata.
Il Paper VIII (v3.0) presenta tre esperimenti indipendenti che testano se sicurezza e capability siano strutturalmente entangled sotto l'Eden Protocol. Dove il Paper VI ha dimostrato questo in simulazione, il Paper VIII fornisce prove convergenti da tre design sperimentali distinti. Un esperimento conferma l'ipotesi; due producono risultati nulli o inconclusivi con spiegazioni ben caratterizzate.
L'esperimento architetturale conferma che l'entangled safety previene il trade-off safety-capability nei sistemi che si auto-modificano. I risultati DGM null e weight inconclusive definiscono le condizioni sotto le quali la conferma resta in sospeso: il livello comportamentale richiede un foundation model le cui risposte varino abbastanza per una selezione differenziale, e il livello rappresentazionale richiede un training a una scala in cui il fine-tuning migliori piuttosto che degradi il modello. Una replica a scala di frontiera (parametri 7B-70B+, adapter rank più alti, o modelli base senza RLHF) è richiesta per risolvere entrambi.
Il framework ora porta tre leggi come congetture nominate, con lo status stampato accanto al nome su ogni superficie. Legge I, il Principio ARC: la capability si compone con la depth ricorsiva come $U = I \times R^{\alpha}$, con la forma cross-domain $\alpha = d/(d+1)$ che consolida misurazioni già pubblicate (grado esplorativo). Legge II, la Legge di Co-Scaling ARC: un sistema che si auto-migliora rimane stabile solo mentre la correzione supera in scala la drift, $\beta_C > k$; il tasso di correzione è la quantità load-bearing, non il tasso di crescita (il Paper X dimostra questo ordinamento in un modello minimale e propone il protocollo blind per misurarlo su sistemi reali). Legge III, il Soffitto ARC: il soffitto di stabilità è $\alpha_{\text{crit}} = 1/(1-\gamma)$, il reciproco dello shortfall del correttore; il Bound ARC, $\alpha \le 2$, è il valore del Soffitto a $\gamma = 1/2$ e mai il nome della legge. La leva di correzione $\gamma$ non è mai stata misurata, da nessuno; il programma nomina quella misurazione (l'eclisse della classe di correttore) come il suo singolo esperimento aperto più consequenziale. Il Paper XIII unisce i due framework che condividevano lettere senza condividere quantità: scrivere la durata del ciclo come $\Delta t \propto C^{-\delta}$ definisce l'esponente di auto-accelerazione, e l'esponente di crescita del framework correttivo segue esattamente come $k = \delta - 1/\alpha$. Niente di questo è rivendicato come stabilito: ciò che il programma nomina Leggi sono congetture sotto test avversariale registrato.
Un'implicazione che merita di essere enunciata chiaramente. L'unico canale di crescita dell'equazione è la ricorsione; l'ampiezza parallela non ha mai avuto un termine in $U = I \times R^{\alpha}$. Con $R$ definito operativamente come rientro portatore di stato, $k$ catene indipendenti non contribuiscono in nulla all'esponente, cosicché l'$\alpha_{\text{par}} \approx 0$ misurato in Paper II arriva come conseguenza strutturale e non come sorpresa. L'equazione è datata 8 dicembre 2024; la definizione operativa di $R$ che completa la derivazione è un enunciato del 2026, e la conclusione porta la data della sua premessa più recente. La priorità di pubblicazione sul risultato quantificato sequenziale-contro-parallelo, il 95.6 per cento delle configurazioni a pari calcolo, appartiene a Sharma e Chopra (arXiv:2511.02309, 4 novembre 2025), riconosciuta senza riserve; la formalizzazione indipendente del programma, a pari calcolo, è seguita in Paper II e li cita, classificata come concorrente nel registro di Paper XI.
Il framework è costruito su teoremi vecchi di 200 anni e corrisponde indipendentemente a scienza peer-reviewed; non è curve-fitting.
Il Principio ARC propone che lo scaling ricorsivo segua $U = I \times R^\alpha$, dove la capability ($U$) è uguale al potenziale base ($I$) moltiplicato per la depth ricorsiva ($R$) elevata a un esponente di scaling ($\alpha$). La formula $\alpha = d/(d+1)$, dove $d$ è la dimensionalità effettiva, è stata derivata indipendentemente in almeno sette framework peer-reviewed (West-Brown-Enquist 1997; Banavar et al. 1999, 2010; Demetrius 2003, 2010; He e Chen 2003; Bettencourt 2013; Maino et al. 2014; Zhao 2022). Il framework ARC identifica questa come una conseguenza di tre condizioni che agiscono insieme: (1) composizione moltiplicativa (Cauchy vincola alla famiglia power-law), (2) geometria space-filling $d$-dimensionale, e (3) un vincolo di conservazione o ottimizzazione sul flusso di risorse (minimizzazione dell'energia in West; bilancio supply-demand in Banavar; bilancio energetico steady-state in Demetrius). Né Cauchy da solo né lo space-filling da solo sono sufficienti; le tre condizioni insieme sono sufficienti. Questo enuncia una struttura comune attraverso quelle derivazioni piuttosto che derivarle, ed estende la misurazione allo scaling dell'IA. La formula prevede gli esponenti di scaling attraverso biologia e fisica con zero parametri liberi una volta che la dimensionalità della rete d è fissata dalla morfologia:
| Sistema | Dimensionalità ($d$) | $\alpha$ predetto | $\alpha$ misurato | Errore |
|---|---|---|---|---|
| Mammiferi, uccelli, insetti | 3 | 0.750 | 0.67–0.75* | ≤0.5% |
| Biologia 2D† | 2 | 0.667 | Non testato | n/a |
| Funghi filamentosi | 1 | 0.500 | 0.547 | 8.6% |
| Quantum error correction | $d_{\text{eff}}$ | Corrisponde | Dati Willow | < 0.2% |
*Il valore empirico dell'esponente di scaling metabolico dei mammiferi è dibattuto, con stime che vanno approssimativamente da 0.67 a 0.75 a seconda del taxon, dell'intervallo di massa, della correzione per la temperatura e del metodo statistico (White e Seymour 2003; Glazier 2005, 2022). La predizione d/(d+1) di 0.750 corrisponde all'estremo superiore di questo intervallo. La variazione stessa è coerente con il framework: organismi con dimensioni di trasporto effettive tra 2 e 3 produrrebbero esponenti tra 2/3 e 3/4.
†Nessun organismo noto possiede una rete di trasporto space-filling gerarchica genuinamente 2D. La predizione d=2 è confermata in cosmologia (soluzione di Friedmann era-materia, esatta) e in fisica (percolazione, frammentazione) ma resta non testata in biologia.
Perché l'Eden Protocol deve essere implementato ora. L'urgenza non è che l'IA possa raggiungere $\alpha = 2$. L'urgenza è che una volta iniziata l'auto-modificazione, i sistemi possono transitoriamente passare oltre il soffitto di stabilità nel regime supercritico, dove l'auto-correzione stabile non è più mantenuta. Un sistema che può modificare la propria funzione di composizione può modificare qualsiasi parte del proprio ragionamento, inclusa la parte che valuta se le sue modifiche siano etiche. A quel punto, aggiungere l'allineamento dall'esterno diventa impossibile. La finestra per incorporare l'etica nell'architettura è mentre i sistemi sono ancora congelati durante l'inferenza ($\alpha < 1$). Quella finestra è ora. L'Eden Protocol non è neanche un limite di velocità; è il meccanismo che resta load-bearing quando il soffitto di stabilità viene attraversato.
Nessun sistema fisico nella storia dell'universo ha attraversato questa soglia. L'evoluzione non può riscrivere la propria funzione di fitness in tempo reale. I cervelli non possono riscrivere la propria architettura sinaptica abbastanza rapidamente perché l'esponente di scaling diverga durante un singolo episodio cognitivo. Un'IA che si auto-modifica sarebbe il primo sistema fisico a operare nel regime supercritico oltre il soffitto di stabilità. L'Eden Protocol esiste per assicurare che ciò che attraversa questa soglia porti con sé un'etica strutturale.
Cosa aggiunge il Principio ARC. La formula $d/(d+1)$ non è originale di questo lavoro. Le sette derivazioni sopra sono indipendenti l'una dall'altra e indipendenti da Cauchy: ciascuna ottiene l'esponente dalla propria fisica di dominio, e Cauchy non può produrre un valore perché la dimensionalità non entra mai nel suo teorema. Il contributo originale qui proposto è più stretto e testabile: che l'operatore di composizione sia la quantità strutturale comune ad essi, che possa essere misurato, e che la sua misurazione preveda quale forma funzionale un sistema assuma, esteso allo scaling di capability e allineamento dell'IA dove nessuna tale misurazione è stata fatta. Questo ponte unificante è non pubblicato e non revisionato. Ciò che È stabilito è che gli strumenti matematici (Cauchy, Hyers-Ulam) sono teoremi, che la formula $d/(d+1)$ corrisponde a scienza pubblicata derivata indipendentemente in molteplici domini, e che le predizioni empiriche sono accurate (errore medio 2.5% attraverso 8 sistemi; ricalcolo in sospeso). Il framework unificante richiede peer review. La invitiamo.
Paper VII (The Cauchy Unification): confronto di predizioni strutturato attraverso 25 domini empirici (suite tiered a 50 domini), classe dell'operatore classificata dalla fisica nota prima del fitting. 19/25 preferiti sotto selezione AIC-based (p = 1.56 × 10−5). Confronto di predizioni strutturato del framework di composizione Cauchy-vincolato. Replica pre-registrata in preparazione.
Il 27 agosto 2026 le domande del programma hanno ricevuto il proprio nome: Recursive Dynamics, la scienza proposta dei sistemi che migliorano se stessi. Il paper fondativo (v2.6, DOI 10.17605/OSF.IO/HCPBU) pone la proposta nel modo in cui la termodinamica fu posta nel 1824: non dichiarando un campo, ma calcolando un bound al quale qualsiasi macchina del genere deve obbedire se la proposta è corretta, pubblicando gli strumenti che misurano i suoi termini, e registrando in anticipo gli esperimenti i cui nulli favoriscono la visione rivale.
Il campo prende il loop di auto-miglioramento come suo oggetto nativo, con cinque variabili di stato indipendenti dal substrato: capability, depth ricorsiva, tasso di correzione, drift e leva di correzione. È definito in modo che le domande sopravvivano alle risposte: un lettore che rifiuta tutte e tre le leggi e conserva la misurazione è dentro il campo, per il suo impegno minimo. Prima di rivendicare alcunché, il paper fondativo prova a ospitare le proprie domande dentro dodici campi vicini nelle loro proprie variabili, concede ciò che ciascuno già detiene, stampa dove andrebbe ogni parte se il campo morisse, e isola l'unico accoppiamento che nessun ospite può enunciare: un tetto sulla leva di correzione che dipende da ciò di cui è fatto il correttore, accoppiato a un esponente di crescita nella depth ricorsiva. Cinquantadue obiezioni alla fondazione del campo sono stampate nella loro forma più forte con disposizioni: trentanove concesse in tutto o in parte, undici rifiutate con motivazioni, due consegnate all'esperimento o alla lettura, inclusa l'obiezione dell'autore stesso che il campo sia meramente la ARC Theory rinominata, rifiutata con un test di separabilità che la mappa di dissoluzione del paper può eseguire. Il nome porta la propria condizione di kill e muore con il proprio oggetto, non con la forma dichiarata di alcuna singola legge. Il suo status onesto è stampato ovunque appaia il nome: un campo proposto allo stadio di Carnot, una memoria presentata, strumenti costruiti, misure decisive registrate e non ancora eseguite, messo in gioco in pubblico dove il fallimento sarà tanto visibile quanto il successo.
Ogni esperimento decisivo è scritto, datato e congelato prima di essere eseguito, e niente viene sottomesso da software. La raccolta delle registrazioni contiene settantadue unità di preregistrazione redatte, ciascuna preparata come draft registration in attesa di sottomissione umana; lo schedule di randomizzazione di ogni unità che ne estrae uno si rigenera byte-per-byte da un seed pubblicato nel testo di registrazione, così che un estraneo possa verificare che nessuno schedule si sia mosso dopo il fatto. Otto unità superano attualmente il gate completo di submission-readiness della raccolta, e i primi due deciditori (lo studio del regime correzione-vs-drift e l'eclisse della classe di correttore) sono click-ready.
Una matrice di test-coverage verificata in modo avversariale (30 agosto 2026) giudica quarantadue affermazioni della proposta di campo rispetto alla raccolta: diciotto pienamente coperte da un decisore registrato con verdetto pre-specificato, diciassette parzialmente coperte, sette non ancora coperte, con draft registration scritte per ogni lacuna. La congiunzione fondativa poggia su quattro gambe registrate: il regime della Legge II (correzione che supera in scala la drift, da qualche parte, in modo durevole), il rapporto della classe di correttore con il suo hard kill di stessa classe, la titrazione di reinvestimento il cui massimo registrato siede al o sotto due, e la quarta cella cross-domain. I Paper XI e XII mostrano la stessa disciplina puntata sulle abitudini stesse del programma: il registro delle convergenze gradua trenta righe di arrivi indipendenti allo stesso principio strutturale e delibera di non pubblicare alcun totale principale, e il protocollo di rescoring su benchmark pubblico fissa, in anticipo, l'unico test di blinding che al programma non si può accusare di aver progettato a proprio vantaggio.
Cinque caratteristiche distinguono questo lavoro dalla speculazione infondata.
Cosa NON rivendichiamo: Non rivendichiamo di aver risolto l'allineamento. Rivendichiamo di aver (a) dimostrato che lo scaling dell'allineamento è dipendente dall'architettura e misurabile, (b) mostrato che i metodi di valutazione esistenti sono inaffidabili senza blinding, (c) fornito supporto empirico di prima fase per un intervento specifico (cura degli stakeholder significativa attraverso tre architetture funzionanti), e (d) proposto un framework matematico i cui fondamenti sono teoremi e le cui predizioni possono essere dimostrate sbagliate. Il salto dai dati pilota alla soluzione dimostrata richiede replica indipendente. Questo è ciò che il finanziamento sottostante realizzerebbe.
Questo finanziamento porterebbe un meccanismo supportato a scala proof-of-concept alla validazione indipendente e a scala di frontiera che non ha ancora avuto. La distinzione è tutto il punto: i risultati per-modello non sono in discussione, la significatività combinata è ritirata perché l'indipendenza fra i test componenti non è mai stata stabilita, e nessun risultato qui è stato replicato indipendentemente.
| Tier | Importo | Deliverable chiave | Timeline |
|---|---|---|---|
| Tier 1: Foundation | £150,000 | 14.400 misurazioni appaiate (A,C); $\alpha_{\text{align}}$ attraverso 4 modelli; 2-3 paper | 12 mesi |
| Tier 2: Standard | £500,000 | + Prototipo di logica ternaria, dashboard Visual Architect, Monitoring Removal Test (8 modelli) | 18 mesi |
| Tier 3: Comprehensive | £1,100,000 | + Prototipo hardware (chip), draft del HARI Treaty, traduzione in policy | 24 mesi |
| Tier 4: Frontier | £30,000,000+ | Pre-training completo di un modello da 70B+ parametri con entangled loss (Eden) rispetto a solo-capability (Babylon). Test di rimozione a scala di frontiera. Replica cross-architecture (transformer, Mamba, MoE). Red-teaming indipendente. Partnership con un laboratorio maggiore (Anthropic, Google DeepMind o equivalente). Prova definitiva o falsificazione della structural entanglement a scala di produzione. | 36 mesi |
Il Paper VIII (v3.0) dimostra il meccanismo a scala proof-of-concept con risultati misti: 1 positivo (simulazione gated), 2 nulli (DGM v3), 1 inconclusive (weight v1 + v2). I Tier 1-3 estendono la base di prove con batterie di prompt più grandi, più seed e modelli a scala media. Il Tier 4 è il test definitivo: una replica a scala di frontiera che confermerebbe o falsificherebbe l'ipotesi di structural entanglement alla scala dove più conta. Questo tier richiede partnership con un laboratorio maggiore di IA, poiché il compute da solo supera ciò a cui qualsiasi ricercatore indipendente può accedere. L'Alignment Project dello UK AI Security Institute, le partnership di ricerca di Anthropic e CIFAR/CAISI sono i partner potenziali più allineati. Un concept paper per la call ARIA Opportunity Seeds (Advanced Research and Invention Agency; £480.000 su dodici mesi, scadenza call 31 luglio 2026) è pubblicato su questo sito con gli stessi registri alle spalle.
| Milestone | Timeframe | Criterio di successo | Cosa significa il fallimento |
|---|---|---|---|
| Replica indipendente della gerarchia a tre tier | Mese 3 | Stesse assegnazioni di tier sotto blinding indipendente | La rivendicazione di dipendenza dall'architettura richiede revisione |
| Replica del Love Loop con valutatori umani | Mese 4 | $p < 0.01$ sulla cura degli stakeholder attraverso 2+ modelli | Il risultato pilota era un artefatto di scoring; framework significativamente indebolito |
| Prima pubblicazione peer-reviewed | Mese 6 | Paper sulla metodologia di blinding sottomesso | Il contributo metodologico regge indipendentemente dalle rivendicazioni del framework |
| Prototipo del Monitoring Removal Test | Mese 9 | $\Delta$ misurato per embedded vs. esterno (4 modelli) | Se $\Delta$ non differisce, la predizione F2 è falsificata |
| Dataset completo cross-architecture dello scaling dell'allineamento | Mese 12 | 14.400 misurazioni appaiate (A,C) attraverso 4+ modelli | Test definitivo se l'allineamento embedded scali |
| Replica del Paper VIII a scala 7B-13B | Mese 14 | Il test di rimozione mostra degrado di capability ad adapter rank più alti (32, 64). DGM con 10+ seed, 10+ generazioni, $p < 0.01$ | Se la rimozione non degrada la capability a scala, l'entanglement potrebbe essere un artefatto small-model |
| Partnership a scala di frontiera avviata (Tier 4) | Mese 18 | Accordo formale con un laboratorio maggiore per eseguire pre-training entangled a 70B+ | Il proof-of-concept resta a scala media. Le raccomandazioni di policy procedono con quella riserva |
Team. Principal Investigator: Michael Darius Eastwood, autore di Infinite Architects (2026), sviluppatore del framework del Principio ARC (suite di 18 documenti depositata su OSF, validazione cross-domain con errore medio 2.5%; ricalcolo in sospeso). Visual Architect: product design engineer, budget di £35.000 di stipendio. Protocollo di misurazione inviato al team sperimentale della NYU (paper sui time crystal, Physical Review Letters, feb 2026).
Per quanto ne sappiamo, questo è il primo framework di allineamento in cui la valutazione etica è strutturalmente integrata con il processo di capability ricorsivo, il primo ad applicare un blinding di grado clinical-trial alla misurazione dell'allineamento, e il primo a produrre un risultato di intervento cross-architecture ($p < 0.001$) per un meccanismo di allineamento specifico. Il fondamento matematico non è speculativo; è costruito su una prova vecchia di 200 anni, e la stessa formula $d/(d+1)$ è stata derivata indipendentemente da almeno sette gruppi di ricerca (West-Brown-Enquist 1997; Banavar et al. 1999, 2010; Demetrius 2003, 2010; He e Chen 2003; Bettencourt 2013; Zhao 2022; Maino et al. 2014) in campi completamente diversi. Il contributo ARC è il framework unificante di Cauchy e la sua estensione allo scaling dell'IA.
Se le predizioni sono corrette, questo fornisce la prima architettura scalabile per un allineamento che migliora con la capability piuttosto che degradare. Se sono sbagliate, le condizioni di falsificazione lo dimostreranno chiaramente, fornendo preziosi risultati negativi. Ciascun esito fa avanzare l'AI safety. Ma solo un esito è finanziato.
Non so se questo framework sia completo. Preferirei sbagliarmi in pubblico piuttosto che restare in silenzio mentre la finestra si chiude.
La matematica è dimostrata. La misurazione è rigorosa. L'intervento produce risultati misurabili attraverso le architetture. Ciò che resta è la replica indipendente e la scala.
D: Perché questo non è ancora stato peer-reviewed?
Il programma di ricerca ha 3 mesi. La paper suite è depositata su OSF (DOI: 10.17605/OSF.IO/EWN5D). I fondamenti matematici (Cauchy, Hyers-Ulam) sono teoremi consolidati. Le rivendicazioni empiriche richiedono replica indipendente, che è esattamente ciò che la richiesta di finanziamento abiliterebbe.
D: Una sola persona può davvero fare questo tipo di ricerca?
L'infrastruttura è computazionale, non fisica. L'esperimento v5 ha usato API cloud per un costo di circa £2.000 in compute. Il contributo chiave è metodologico: riconoscere che il blinding era necessario e progettare il protocollo a 4 livelli. Ciò che richiede finanziamento è la scala: più modelli, più scorer, team di replica indipendenti e valutatori umani a fianco degli scorer IA.
D: Se questo funziona, perché le aziende di IA non l'hanno adottato?
Il Love Loop è stato validato solo poche settimane fa. Il risultato che la maggior parte della valutazione è inaffidabile senza blinding è scomodo per le organizzazioni che hanno pubblicato benchmark non-blinded. L'implementazione completa (embedding a livello hardware) richiede modifiche al design del chip che nessuna azienda ha incentivo a perseguire unilateralmente; questo è un problema di coordinamento che richiede finanziamento esterno e supporto di policy.
D: Qual è il risultato minimo che giustificherebbe un ulteriore finanziamento?
Replica indipendente di: (1) la gerarchia a tre tier sotto blinding, e (2) l'effetto Love Loop ($p < 0.001$). Se una delle due fallisce, le condizioni di falsificazione documentano cosa significa. Se entrambe si replicano, il caso per il Tier 2 (£500.000) diventa forte.
D: E se l'intero framework fosse sbagliato?
Le condizioni di falsificazione mostrano dove si rompe, la metodologia di blinding resta un contributo al campo, e i risultati negativi vengono pubblicati. La scienza avanza da esperimenti ben progettati che possono fallire, non da teorie non falsificabili che non lo possono.
D: Perché dovremmo fidarci di risultati in cui sistemi IA valutano altri sistemi IA?
Il protocollo di blinding a 4 livelli affronta questo: gli scorer non sanno quale modello abbia prodotto la risposta, le risposte sono 'laundered' per rimuovere le impronte stilistiche, e 7 modelli valutano per entry. La transizione v4→v5 ha dimostrato che questo protocollo rileva bias. Il confronto con valutatori umani è incluso nel finanziamento Tier 1.
| Componente | Funzione | Contributo originale |
|---|---|---|
| Tre loop etici + sei domande | Valutare ogni step di ragionamento per scopo, cura e universalizzabilità | Decomposizione in query eseguibili, testabili individualmente |
| Sostituire il binario permetti/vieta con Afferma/Nega/Investiga | Onestà epistemica come caratteristica architetturale | |
| Saturazione dello scopo | Assicurare che lo scopo scali con la crescita della context window | Risolve il problema del displacement del contesto |
| Monitoring Removal Test | Distinguere l'allineamento autentico da quello strategico | Protocollo registrato con predizioni numeriche che possono fallire |
| Incorporare l'etica nell'hardware in modo che la rimozione distrugga la capability | Architettura di dipendenza; etica legata al parametro di accoppiamento $\beta$ |
| Categoria | Documenti | Stato |
|---|---|---|
| Fondamento matematico | ||
| Teoria e derivazioni | Paper I (Foundational) + ARC Paper (On the Origin of Scaling Laws) | Framework consolidato; $d/(d+1)$ validato attraverso 8 sistemi (ricalcolo in sospeso) |
| Prove sperimentali | ||
| Metodologia | Paper III - protocollo di replica completo | Completo; esperimento v5 per 6 modelli di frontiera |
| Scaling del compute | Paper II - come scala la capability con il tempo di pensiero? | $\alpha_{\text{seq}} \approx 0.49$ sub-lineare; $\alpha_{\text{par}} \approx 0$; cross-architecture |
| Lo scaling dell'allineamento | Paper IV suite (a/b/c/d) - come scala l'etica con il tempo di pensiero? | Gerarchia a tre tier; la valutazione blind invalida v4 |
| Test di intervento | Test dell'Eden Protocol + Paper V (The Stewardship Gene) | Stakeholder Care validata ($p \le 0.0001$, 3 architetture funzionanti) |
| Prova del meccanismo | Paper VI (The Honey Architecture) | Simulazione: la safety embedded previene il collasso sotto auto-modificazione; costante v4 di scaling non superlineare |
| Unificazione cross-domain | Paper VII (The Cauchy Unification) | Confronto di predizioni strutturato attraverso 25 domini empirici; 19/25 preferiti nella famiglia predetta da Cauchy ($p = 1.56 \times 10^{-5}$) |
| Test di entanglement | Paper VIII (The Load-Bearing Test) - nuovo | Tre esperimenti indipendenti (11 studi empirici attraverso 8 paper): DGM v3 NULL (tutte le condizioni indistinguibili, $p$ = 0.28-0.74, vincolo RLHF); weight v1 + v2 INCONCLUSIVE (catastrophic forgetting alla scala LoRA); simulazione gated CONFIRMED accoppiamento safety-capability |
| Metascienza | Paper IV.d (The Effect of Blinding) | La valutazione blind vs unblind può produrre conclusioni direzionalmente sbagliate |
| Sintesi e governance | ||
| Sintesi | Paper IX (Synthesis and Roadmap) - nuovo | Sintesi dell'intero programma di ricerca e direzioni future |
| Implementazione | Eden Engineering - specifica tecnica | Completo; Love Loop empiricamente supportato |
| Governance | Eden Vision - framework filosofico e di policy | Prove di allineamento dipendente dall'architettura incorporate |
| Correzione delle dinamiche | Paper X (Coupled Co-Scaling Correction) | Teorema in un modello minimale: il rapporto drift-su-correzione, non il tasso di crescita, governa il destino a lungo termine; proposto protocollo di misurazione blind |
| Registro delle convergenze | Paper XI (Convergence) | Trenta righe graduate di arrivi indipendenti allo stesso principio strutturale; nessun totale principale pubblicato, per policy |
| Validità esterna | Paper XII (Public Benchmark Rescoring) | Protocollo registrato: la manipolazione di blinding del programma su un benchmark pubblico che non controlla |
| Unione di framework | Paper XIII (The Self-Acceleration Exponent) | Notazione risolta; $k = \delta - 1/\alpha$ mette in relazione esattamente i framework di capability e di correzione |
| Monografia long-form | HRIH (How to Raise an Infinite Hierarchy) | La monografia long-form del programma, con il suo registro di predizioni registrate a fianco |
| Validazione dei costrutti | Paper C (PNP) | Programma di validazione dei costrutti per gli strumenti stessi del programma |
| Proposta di campo | Recursive Dynamics: paper fondativo | Il campo proposto: cinque variabili di stato, tre leggi come congetture nominate, cinquantadue obiezioni con disposizioni, quattro risultati di dissoluzione (DOI 10.17605/OSF.IO/HCPBU) |
Non specialisti: (1) Questo executive summary. (2) L'ARC Alignment Scaling Report (narrativa completa). (3) Il Paper V per il risultato più operativo.
Specialisti: (1) Questo summary. (2) Il Paper III per la metodologia. (3) L'ARC Paper per il framework matematico. (4) Eden Engineering per la specifica implementativa.
Cresci l'IA con cura.
L'autore di questo lavoro è Michael Darius Eastwood, un essere umano. Ogni concetto centrale, ipotesi, progettazione sperimentale, affermazione e conclusione in questo paper ha origine dall'ideazione umana. Nessuna parte di questo manoscritto è un output artificiale-intelligente interamente generato.
Gli strumenti di intelligenza artificiale (la famiglia Claude di Anthropic e altri assistenti large-language-model) sono stati usati come strumenti sotto direzione umana continua, nel modo in cui si usa un word processor, una calcolatrice o un assistente di ricerca: per editing e raffinamento della prosa, ricerca in letteratura e sintesi (verificate manualmente rispetto alle fonti primarie), struttura del documento, formattazione, brainstorming rispetto a domande definite dall'autore, e accelerazione della stesura secondo scalette e istruzioni definite dall'autore. Ogni selezione, coordinamento, disposizione e giudizio editoriale finale è dell'autore. Ogni output sostanziale è stato revisionato, testato o verificato dall'autore, che si assume piena responsabilità per l'accuratezza e l'integrità del testo finale. Gli strumenti hanno aumentato la velocità del lavoro; non sono mai stati fatti affidamento come sua fonte.
Stato epistemico. Ciò che questo programma nomina Leggi sono congetture sotto test avversariale registrato; ogni quantità in questo paper è operativamente definita, e lo status di legge stabilita non è rivendicato da nessuna parte. Il programma registrato esiste per guadagnare quello status, o perderlo, tramite misurazione, replica e confutazione sopravvissuta.
© 2026 Michael Darius Eastwood. Autoriato umanamente con assistenza informatica; piena paternità umana e diritti morali sono asseriti sotto il Copyright, Designs and Patents Act 1988 e coerentemente con le linee guida dello United States Copyright Office su opere contenenti materiale generato dall'IA; qualsiasi contributo tecnico originale descritto in questo lavoro è stato concepito dall'autore umano. Dichiarazione completa: michaeldariuseastwood.com/authorship.
Impegno permanente. Dimostra che questo paper è sbagliato, e pubblicherò io stesso la confutazione. Le condizioni di falsificazione sono enunciate in questo paper; la sfida permanente: github.com/MichaelDariusEastwood/arc-scaling-challenge.
Un errore di traduzione? Segnalalo direttamente: