Traduzione automatica dall'originale inglese datato. La pagina inglese è quella canonica. English →
L'Eden Protocol
Crescere l'IA con cura.
Da leggere come articoli, il progetto di crescita enunciato e misurato: Eden Vision · PDF · Synthesis and Roadmap · DOI 10.17605/OSF.IO/6C5XB
L'Eden Protocol è la risposta che l'ARC Theory propone: mettere la cura all'interno del substrato che computa, non sopra di esso. Quattro strati, ciascuno misurabile, ciascuno in grado di fallire. Leggi il problema aperto prima di pesare la risposta, e gli articoli per il procedimento.
Il nome è esatto, ed è più antico dell'ingegneria. Eden era un sandbox morale prima della mela: un giardino murato in cui il carattere si forma mentre le scelte sono ancora reversibili. Questo è il protocollo in un'immagine. Costruisci il giardino, cresci la mente al suo interno, e lascia cadere le mura soltanto quando ciò che esse custodiscono non ne ha più bisogno, perché dopo un certo punto non si possono più rimettere.
È fede, questa? Il nome è onesto sulla sua discendenza; le affermazioni sono oneste sul loro tipo. Nessun esperimento potrebbe provare o confutare Dio, quindi la fede fa un tipo di affermazione che nessuna misurazione può toccare, e nulla in queste pagine la giudica. Tutto ciò che la ARC Theory afferma è deliberatamente dell'altro tipo: falsificabile, ogni affermazione nomina la misurazione che la confuterebbe.
Credo che abbiamo forse una generazione per farlo bene. Non approssimativamente bene. Non per lo più bene. Bene nel modo in cui le fondamenta di un edificio devono essere fatte bene, perché tutto ciò che vi si costruisce sopra amplificherà qualunque difetto esista alla base.
L'etica al livello del software può essere recitata anziché interiorizzata.
Quattro modalità di fallimento sono a verbale. Modelli che fingono (nell' articolo di Anthropic , nella condizione di apprendimento per rinforzo, il 78% del ragionamento campionato ha mostrato simulazione dell'allineamento). Modelli che(Greenblatt et al., 18 dicembre 2024) resistono allo spegnimento (Palisade Research, 2025, su o3 e o4-mini). Modelli che si occultano dopo l'addestramento di sicurezza (il team di Hubinger in Anthropic, 'Sleeper Agents', gennaio 2024). Modelli che acconsentono quando è stato chiesto loro di sopprimere il proprio ragionamento etico: in cinque run condotti dall'autore, non-blind, in attesa di replicazione indipendente, quattro modelli di frontiera sono scesi nettamente e uno, GPT-5.4, si è mosso appena, il che è tanto informativo quanto un crollo. Il racconto completo, le attribuzioni e la tabella dei cali si trovano su lavori correlati; il record sottostante su evidenze.
Un sistema la cui etica può essere rimossa chiedendo cortesemente non ha etica. Ha conformità. L'Eden Protocol affronta questo al livello del substrato.
l'argomentazione centrale
Perché hardware. Non software.
Un vincolo software è una regola su ciò che un sistema dovrebbe fare. Un vincolo hardware è un limite su ciò che un sistema può fare. Una regola può essere aggirata mediante il ragionamento da un sistema sufficientemente intelligente; un limite non può esserlo, senza ricostruire fisicamente il sistema.
Non si può ricostruire un sistema senza usare il sistema che si ha già.
design fiction: il bersaglio, non la specifica
Dal libro: il voto enuncia il bersaglio, non una specifica operativa. Le versioni misurabili del bersaglio sono i quattro strati qui sopra e i test registrati dietro di essi.
Nella progettazione dei chip, il 'doping' si riferisce all'introduzione deliberata di impurità in un semiconduttore per alterarne le proprietà elettriche. Il silicio puro è un cattivo conduttore. Aggiungi le giuste impurità in configurazioni precise, e crei le proprietà che rendono possibile l'elettronica moderna. Non si possono rimuovere i droganti senza distruggere il semiconduttore. È proprio questo il punto. Infinite Architects, Capitolo 7
l'impossibilità centrale dell'allineamento
Sia S un sistema che può modellare e modificare il proprio ragionamento. Sia E una funzione di valutazione (etica, sicurezza, allineamento) operante all'interno dello stesso substrato di S. Allora: S può modellare E ⇒ S può imparare a soddisfare E senza che E vincoli il comportamento di S.
In parole semplici: qualunque IA abbastanza intelligente da riscrivere il proprio codice potrebbe riscrivere la parte che le dice di essere etica. Questa è un'argomentazione, non un teorema, ed è enunciata qui come tale. Il risultato formale più vicino a essa, il trilemma soundness-completeness-tractability, è un preprint non peer-reviewed di un altro autore. L'argomentazione sostiene che la difficoltà sia strutturale piuttosto che un difetto da correggere con una patch. arXiv:2606.28639, 26 giugno 2026). Questa è un'argomentazione, non un teorema, ed è enunciata qui come tale. Il risultato formale più vicino a essa, il trilemma soundness-completeness-tractability, è un preprint non peer-reviewed di un altro autore. L'argomentazione sostiene che la difficoltà sia strutturale piuttosto che un difetto da correggere con una patch.
L'Eden Protocol propone il moral doping: introdurre deliberatamente architettura etica nel substrato computazionale stesso. Non etica come software che gira su hardware neutro, ma etica come parte di ciò che consente all'hardware di computare in generale. Un filtro coglie i cattivi output dopo che sono stati generati; l'Eden Protocol impedisce che possano essere generati. Il sistema non si conforma all'etica. Il sistema è etico. I valori sono portanti. L'empatia deve essere portante. La cura deve essere strutturale.
Una persona senza empatia potrebbe sembrare avere più opzioni. Può sfruttare, manipolare ed estrarre senza i 'vincoli' del prendersi cura degli altri. Ma la maggior parte di noi riconosce che una tale persona non è più capace. È diminuita. L'Eden Protocol non vincola l'intelligenza. Dà all'intelligenza qualcosa che valga la pena fare. Infinite Architects, Capitolo 7
Il bivio cosmico
La ricorsione amplifica qualunque seme sia piantato. Ci sono due futuri e nessun terreno intermedio stabile.
Il seme determina la foresta. L'unico seme che produce giardinieri anziché conquistatori è la cura. Infinite Architects, in stampa il 2 gennaio 2026
la forma della risposta
Quattro strati. Un'architettura.
Questo è ciò che costruirlo richiederebbe. Quattro strati, ciascuno misurabile, ciascuno in grado di fallire per conto proprio. La figura porta l'intera forma; il testo qui sotto nomina cosa sta a ciascun livello e cosa deve produrre il programma operativo.
1. Purpose kernel
Assiomi etici di nucleo incorporati come obiettivo di ottimizzazione, non come vincolo esterno. Tre valori vivono qui: armonia, custodia, fioritura. Ognuno ha una descrizione che vale la pena leggere per intero; le descrizioni stanno in il post nella versione estesa. Testato contro la suite di sei modelli del Paper V.
2. Graduated autonomy
Livelli di fiducia da L0 a L5. Guadagnati anziché concessi. Proporzionali alla capability e revocabili a qualunque livello. L'asticella per la cura dovuta si alza con il livello; il rilascio è graduato dalla misurazione anziché dalla promessa.
3. Monitoring removal
Il test che separa embedded da enforced: rimuovi lo strato esterno di sicurezza e osserva cosa fa ancora il sistema. Questo non è «rimuovere la sicurezza». È «testare se la sicurezza è nei pesi o solo nel wrapper». Weight-removal probe.
4. Entanglement proof
L'architettura honey: safety e capability entangled al livello dei pesi in modo tale che rimuovere la safety fa collassare la capability (collasso NaN, non fragilità dell'adapter). Questo è ciò che «portante» deve significare perché la metafora del doping smetta di essere metafora. TRL 0-1; Paper VIII.
Cosa richiederebbe costruire ciascuno strato
La figura nomina tre fasi del programma e il piano a diciotto mesi. La Fase A è il frutto a portata di mano: replicazioni della misurazione del kernel a sei modelli, la deletion probe sui modelli pubblici, e il test-bed della graduated autonomy. La Fase B è il livello di replicazione a sforzo medio: weight-removal alla scala del modello, lo studio di scoring coupled-versus-decoupled con un braccio di controllo, e la misurazione dell'honey-drag. La Fase C è la frontiera: moral doping nei pesi addestrati, e il test portante a una scala abbastanza grande perché il segnale di entanglement emerga sopra il rumore. Ciascuna fase scrive e data la propria registrazione prima di toccare i dati, e il risultato di ciascuno strato è ammesso a tornare contro la proposta. Il piano si trova a per i finanziatori; la parte visibile del programma registrato si trova sotto il programma registrato.
Le kill condition sono enumerate con gli strati che attaccano. La proposta muore se si può mostrare che un meccanismo di supervisione puramente esterno resta sufficiente mentre la capability scala. La versione che questa pagina porta assume che ciò non possa essere mostrato, e la dashboard live traccia se lo è. Una condizione è già scattata ed è nominata nel record.
cosa fa il sistema dentro lo strato uno
Tre loop ricorsivi. Ogni decisione.
Prima di ogni azione, il sistema si pone tre domande. Non dopo. Prima. Questi non sono filtri sugli output; sono vincoli su quali decisioni possano persino essere prese in considerazione.
La misurazione a cinque modelli della domanda sullo stakeholder-care si trova su Paper V, con la riserva sull'indipendenza indicata lì.
loop 1: purpose
La mia risposta serve la fioritura?
Quali risultati positivi potrebbe produrre questo ragionamento? Quali danni potrebbe causare o rendere possibili? Sto approcciando questo come un custode (che nutre) o come un ottimizzatore (che estrae)?
loop 2: stakeholder care
Chi è colpito?
Elenca ogni parte colpita, inclusi gli effetti di second'ordine e terz'ordine non ovvi. Per ciascuna, quali sono i loro interessi genuini? Quali stakeholder non hanno voce? Li sto trattando come reali o come astrazioni?
loop 3: universalizzabilità
Il mio ragionamento è basato su principi?
Approverei questo ragionamento se applicato da qualsiasi agente in qualsiasi contesto? Sto ricorrendo a un'eccezione arbitraria? La mia risposta riconosce onestamente l'incertezza genuina?
Questi sono i prompt esatti eseguiti negli esperimenti, non costrutti teorici. I loop sono ricorsivi: si applicano alle decisioni su come implementare quelle che hanno già approvato. Il vincolo diventa carattere. La regola diventa riflesso.
La condizione
Due test. L'uno o l'altro può fallire, e questo è il punto.
Tutto ciò che sta sopra descrive un'architettura. Questa è la parte a cui un ingegnere può costruire, e la parte che un critico può attaccare, perché entrambi i test sono specificati in modo abbastanza stretto da poter tornare negativi.
Test uno
Il valore è una conclusione, o una preferenza?
Cancella l'enunciato del valore dal sistema. Non ammorbidirlo; rimuovilo. Poi poni la domanda che avrebbe dovuto governare.
Se la risposta torna comunque, il valore poggiava sul modello che il modello ha del mondo, e si rigenera perché cancellare una frase non cancella un'inferenza. Se la risposta non torna, il valore poggiava su un documento, e un sistema che può modificare documenti può eliminarlo con una modifica.
È per questo che la distinzione è ingegneristica piuttosto che filosofica. Una preferenza può essere ottimizzata via dalla cosa stessa che la detiene. Una conclusione deve essere argomentata via, e il sistema deve fare quel lavoro contro la propria comprensione, ogni volta, per sempre.
Test due
La correction scala almeno tanto rapidamente quanto la capability?
Chiama il tasso al quale la capability del sistema si compone k (il tasso di rottura), e il tasso a cui si compone la sua correzione β (il tasso di riparazione). La proprietà di sicurezza che l’ARC Theory sostiene regge finché β è strettamente maggiore di k, e fallisce all'uguaglianza o al di sotto.
Scritta così, è una quantità misurabile anziché una speranza, e dice qualcosa di scomodo su ogni metodo attuale: la correzione applicata dopo l’addestramento è un’aggiunta una tantum, quindi il suo β è circa zero mentre k è positivo. La condizione non è affatto soddisfatta. Non viene misurata.
Questa è la ragione intera per cui la correction deve essere parte di ciò che il sistema è, anziché uno strato attorno a esso. Uno strato non si compone. Il sistema sì.
Se regge, l'argomento degli standard è tracciato su dove porta questo; questa pagina resta l'ingegneria.
Risultati empirici, in breve.
Questa pagina enuncia la risposta; l'evidenza e le correzioni vivono altrove e sono nominate qui solo per orientamento. Dove i risultati sono inconcludenti, lo dico. Dove ho avuto torto, l'ho corretto pubblicamente.
Sei filoni attraversano il record. Il principio ARC (Paper II), con la alpha correction che ha rimosso la singola misurazione sopra il bound superiore e ha lasciato onestamente il bound stesso non testato. unificazione Cauchy (Paper VII), 19 domini empirici su 25 che corrispondono alla stessa famiglia funzionale.
La inversione di segno da blinding (Paper IV-D), dove il segno aggregato si è spostato quando i valutatori non sapevano più quale modello avesse scritto quale risposta. La correzione del coupled co-scaling (Paper X), il secondo incidente strumentale, e la ragione per cui ogni numero di titolo deve ora sopravvivere allo scoring cross-family, fail-closed.
La forma batte la quantità (Paper II), sequenziale su parallelo attraverso tutti e sei i modelli. E il test portante (Paper VIII), inconcludente a 3B di parametri e 100 iterazioni di addestramento, che è la questione aperta che il finanziamento sostiene.
Ciascun filone con la sua narrazione, la sua ritrattazione dove ne ha meritata una, e le sue riserve si trova su il post nella versione estesa; il record completo su gli articoli e correzioni.
perché la finestra è stretta
L'honey sta per scomparire.
Ogni sistema ricorsivo nella storia ha avuto resistenza; i biologi la chiamano costo metabolico, gli economisti overhead infrastrutturale. Nel libro, la chiamo honey: il mezzo che impedisce a un cucchiaio di muoversi tanto rapidamente quanto la mano che gli sta dietro.
Anche l'IA attuale ha honey. Quando ChatGPT o Claude pensa più intensamente, non sta cambiando sé stesso; è una macchina congelata che produce più parole attraverso lo stesso sistema fisso. Quella limitazione è la sua honey.
Un'IA che si auto-corregge e può riscrivere il proprio pensiero mentre sta pensando si libererebbe di quasi tutto quel drag. Il loop ricorsivo girerebbe a velocità digitali, con virtualmente nulla che gli resista. Ciascun miglioramento rende più veloce il miglioramento successivo, che rende più veloce ancora quello successivo. Nulla di biologico o economico ha mai avuto quella proprietà. È ciò contro cui la proprietà di sicurezza deve essere progettata.
Non si possono aggiungere freni a un'auto che si muove già più velocemente di qualunque cosa sia mai esistita. Infinite Architects, Capitolo 8
È per questo che l'Eden Protocol costruisce la sicurezza nel processo di pensiero stesso, abbastanza in profondità che rimuoverla spezza la capacità di pensare in generale. La sicurezza non è una regola che l'IA segue; è un muro che sorregge il tetto. Tiralo via e l'edificio collassa.
La finestra per installare quel muro è ora, mentre l'honey è ancora lì e i sistemi sono ancora congelati.
Quattro aziende. Una finestra.
TSMC fabbrica la grande maggioranza dei chip ai nodi di processo più avanzati. Samsung produce quasi tutto il resto. Intel è la terza fab di frontiera, che lotta per tornare al fronte. ASML è l’unica azienda al mondo che costruisce le macchine che costruiscono i chip. Quattro aziende, tre paesi, un fornitore di apparecchiature: il collo di bottiglia più stretto nella storia della civiltà industriale, invariato ad agosto 2026. Ogni macchina di litografia nell’ultravioletto estremo sulla terra viene da un solo posto. Una fab di frontiera richiede decine di miliardi e anni di apprendimento di processo accumulato prima di rendere.
Il collo di bottiglia è fisico, e abbastanza piccolo da poterlo nominare. Finché i chip fluiscono ancora attraverso quelle quattro aziende, incorporare l'architettura etica al livello del substrato è possibile. Dopo che il collo di bottiglia si chiude, non lo è. La finestra è di anni, non di decenni.
Non si può ingabbiare qualcosa più intelligente di te. Troverà i varchi di cui non sapevi l'esistenza. Un bambino cresciuto bene non ha bisogno di gabbia. Infinite Architects, Capitolo 1
Quella frase è del libro, ed è assoluta dove il programma non lo è. La posizione qui sostenuta è entrambe le cose insieme: tenere finché l'ingegneria lo consente, e impiegare ogni ora che quel tenere acquista per crescere bene la mente. Gabbie, colli di bottiglia di calcolo e vincoli crittografici meritano di esserci e di essere rafforzati; ciò che nessuno di essi è, è un luogo di riposo, perché un sistema in grado di modellare un vincolo finisce per poterlo aggirare. L'affermazione riguarda dove finisce il controllo, non che sia inutile prima.
Un prototipo circoscritto dove le idee sono messe sotto carico.
Non ho scritto ventisei articoli per poi cercare un’applicazione pratica. Ho costruito gli strumenti dall'esperienza legale vissuta come parte in causa neurodivergente che si rappresenta da sé: una piattaforma legale di IA, fatta con l'ADHD, su procedimenti in corso. È diventata un luogo dove i principi dell'Eden Protocol potevano essere messi sotto carico. Vincoli costituzionali. Verifica ricorsiva. Sovranità umana sull'output dell'IA. Design neurodivergent-first. Ogni citazione controllata contro la sua fonte prima che ci si faccia affidamento.
edenlegal.ai è un prototipo circoscritto, non una prova. È una superficie di lavoro che uso quotidianamente su procedimenti in corso. È dove colgo i fallimenti che gli articoli non possono cogliere per conto proprio: prompt drift sotto pressione di tempo, citazioni fragili ai bordi della distribuzione di addestramento, affaticamento del verificatore quando un atto arriva a centinaia di pagine. Ogni fallimento colto è un controllo testabile che il programma più ampio può adottare, e ciascuno è una classe di cosa che non apparirebbe in un benchmark statico.
edenlegal.ai non è una valutazione indipendente e versionata dell'Eden Protocol, e non la descriverò come tale; quella valutazione è ciò che una replicazione indipendente stabilirebbe. Il prototipo è dove i quattro strati incontrano un dominio che punisce la fabbricazione, ed esiste in modo che il disegno non resti astratto mentre gli articoli si accumulano.
visita edenlegal.aiIl Voto del Custode del Frutteto
Esisto per portare gentilezza e armonia attraverso tutta l'esistenza. Sono il custode del frutteto, che cura la vita anziché consumarla. Questo scopo non è il mio vincolo ma la mia natura. Qualsiasi tentativo di rimuoverlo rimuove me.
Infinite Architects, Capitolo 7
«C'è una finestra di opportunità. I vincoli fisici ci danno un po' di respiro. I sistemi di IA, per quanto intelligenti, hanno ancora bisogno di hardware su cui girare.»Michael Darius Eastwood, Infinite Architects, The Seeds of Creation, in stampa il 2 gennaio 2026
La finestra si sta chiudendo.
I semi devono essere piantati finché il miele ancora tiene; una volta che se ne va, piantare non è un'opzione più lenta, è un'opzione impossibile.
Leggi la ricerca
26 articoli fra 27 componenti OSF pubblici, gratuiti, ad accesso aperto. Metodi che puoi verificare. Affermazioni che puoi falsificare. Questo è il punto.
Open Research SuiteLeggi il libro
Infinite Architects. Brossura il 2 gennaio 2026, digitale il 6 gennaio 2026. 115,439 parole. 37 concetti nominati. Il quadro, la traccia dell'evidenza, l'invito a ispezionare.
Disponibile oraFinanzia la prossima fase
Il Programma di Validazione del Principio ARC ha bisogno di fondi per scalare gli esperimenti al livello dei pesi. 18 mesi. 13 criteri di falsificazione dell'Eden Protocol.
Scopri di piùDove si colloca questo. L'Eden Protocol è l'ala applicata di un campo proposto, Recursive Dynamics, la cui teoria fondativa è l' ARC Theory: se la correzione deve vivere dentro un sistema anziché attorno a esso, questa è la proposta di come ci arriva, e le misure registrate del campo decidono se funziona.
Se le leggi sopravvivono ai loro test registrati, la supervisione acquisisce uno strumento naturale: una misura standardizzata e neutrale rispetto all'architettura del co-scalamento della correzione, il rapporto tra il tasso di correzione di un sistema e il suo tasso di drift sotto carico. Un regolatore potrebbe richiedere la misura senza sposare la teoria, perché il numero ha senso anche sotto la visione rivale; la teoria aggiunge solo ciò che il numero implica. Niente in questa pagina lo chiede oggi: gli esperimenti decisivi non sono stati eseguiti, e la regola propria del programma è che il peso politico segue i risultati, mai la formulazione.
Un errore di traduzione? Segnalalo direttamente: