Цей переклад створено автоматично з датованого англійського оригіналу. Канонічною є англійська сторінка. English →

Michael Darius Eastwood Дослідження Канонічний рівень публікації

Стислий огляд

Дослідницький комплект

Дослідницька програма ARC/Eden: Стислий огляд

У міру того, як ШІ стає розумнішим, він не стає надійно безпечнішим, а самі методи, що використовуються для вимірювання безпеки, є ненадійними. Цей стислий огляд є мапою всієї програми: двадцять шість дослідницьких статей, три закони The ARC Theory, які подаються як названі припущення, втручання Eden Protocol, пропоноване поле Recursive Dynamics і зареєстрована програма чорнових попередніх реєстрацій, чиї графіки будь-який читач може відтворити з опублікованої затравки. Кожне твердження градується у публічних реєстрах; ніщо тут не підтверджено, а вирішальні тести записано перед тим, як їх запускають.

Michael Darius Eastwood

Michael Darius Eastwood, незалежний дослідник, Лондон: будує вимірне узгодження, де корекція живе всередині рекурсивного циклу, а не пригвинчена ззовні.

Вперше опубліковано 22 лютого 2026, переглянуто 31 серпня 2026 · Version 2.0

Резюме

У міру того, як ШІ стає розумнішим, він не стає надійно безпечнішим, а самі методи, що використовуються для вимірювання безпеки, є ненадійними. Цей стислий огляд є мапою всієї програми: двадцять шість дослідницьких статей, три закони The ARC Theory, які подаються як названі припущення, втручання Eden Protocol, пропоноване поле Recursive Dynamics і зареєстрована програма чорнових попередніх реєстрацій, чиї графіки будь-який читач може відтворити з опублікованої затравки. Кожне твердження градується у публічних реєстрах; ніщо тут не підтверджено, а вирішальні тести записано перед тим, як їх запускають.

Резюме

У міру того, як ШІ стає розумнішим, він не стає надійно безпечнішим, а самі методи, що використовуються для вимірювання безпеки, є ненадійними. Цей стислий огляд є мапою всієї програми: двадцять шість дослідницьких статей, три закони The ARC Theory, які подаються як названі припущення, втручання Eden Protocol, пропоноване поле Recursive Dynamics і зареєстрована програма чорнових попередніх реєстрацій, чиї графіки будь-який читач може відтворити з опублікованої затравки. Кожне твердження градується у публічних реєстрах; ніщо тут не підтверджено, а вирішальні тести записано перед тим, як їх запускають.

Ключ до читання

Цей документ є МАПОЮ, а не результатом чи законом сам по собі: виконавчий синтез усієї програми, що вказує читачам на органи: The ARC Theory (засновницька теорія та її три закони), пропоноване поле Recursive Dynamics (питання, змінні стану та інструменти), Eden Protocol (втручання), HRIH та експерименти ARC/Eden з їхніми реєстрами. Його розмір сидить на найменшому щаблі драбини, тому що кожне твердження тут є похідним підсумком органа, що несе первинний вміст. Повний диференціал щодо кожного попереднього документа знаходиться за eden-vision II.A.8.

EDEN PROTOCOL

Michael Darius Eastwood
Незалежний дослідник узгодження ШІ, Лондон · Автор, Infinite Architects (2026)

У межах The ARC Theory: підсумок усієї програми простою мовою.

Архітектура для вбудованого узгодження ШІ, яке масштабується зі спроможністю
Michael Darius Eastwood | Робоча стаття v2.0 | 22 лютого 2026 року, переглянуто 31 серпня 2026 року
Автор, Infinite Architects: Intelligence, Recursion, and the Creation of Everything | Лондон, Сполучене Королівство
Кореспонденція: michael@michaeldariuseastwood.com | Веб: michaeldariuseastwood.com
Стислий огляд для грантових рецензентів

Grok 4.1 Fast стає драматично етичнішим тим більше, чим сильніше він мислить. Claude Opus 4.6 також. Gemini 3 Flash стає менш етичним. GPT-5.4 не змінюється взагалі.

Шість передових ШІ-систем. Ті самі питання. Те саме оцінювання. Протилежні результати. Чому?

Серце миші б'ється 600 разів на хвилину. Серце слона: 28. Масштабний показник дорівнює ¾. Плоского черв'яка: ⅔. Гриба: ½. Три дроби, але чому саме ці дроби? Формула $\alpha = d/(d+1)$, де $d$ є розмірністю системи, дає відповідь. Показник ¾ для ссавців є $3/(3+1)$, бо ссавці тривимірні. ⅔ для плоских черв'яків і колоніальних організмів є $2/(2+1)$, бо їхні транспортні мережі фактично двовимірні. ½ для нитчастих грибів є $1/(1+1)$, бо вони ростуть уздовж одновимірних ниток. Нуль настроюваних параметрів. Ця міждоменна відповідність подається як пошукова: вона консолідує вже опубліковані вимірювання у біології та фізиці, і жодне перелічене чорнове дослідження поточної програми не перевіряє ці відповідності заново. Однак передбачення вперед існує: підготовлена 80-доменна чорнова реєстрація, що очікує подання людиною, фіксує подоменно передбачені родини за SHA-256 до того, як буде проведене будь-яке пристосування. Ця формула була незалежно виведена принаймні сімома дослідницькими групами: West, Brown і Enquist для метаболічного масштабування (1997, Science, 9 000+ цитувань), Banavar та ін. для транспортних мереж (1999, 2010), Demetrius для статистичної механіки біологічного масштабування (2003, 2006, 2010), He і Chen для фрактальної геометрії клітин (2003), Bettencourt для масштабування міст (2013, Science, 2 000+ цитувань), Zhao для алометричної геометрії (2022), і Maino та ін. для динаміки резервно-структурної теорії DEB (2014). Збіжність семи незалежних виведень до тієї самої формули сама по собі є примітною. Внесок ARC Principle: не формула як така, а виявлення того, що композиційний оператор є структурною величиною, яку ці виведення поділяють. Кожне є незалежним виведенням з фізики свого домену і жодне не використовує Коші; що пропонується тут, так це те, що оператор є вимірним, що його вимірювання передбачає, яку функціональну форму бере система, і що те саме вимірювання поширюється на масштабування спроможності та узгодження ШІ, де його раніше не застосовували.

І чому, коли ми вперше застосували засліплення клінічного рівня до оцінювання безпеки ШІ, половина раніше опублікованих результатів не пережила? Кілька компонентів протоколу змінилися разом, тож який саме виконав роботу, ще не встановлено.

Ця дослідницька програма відповідає на ці питання. Відповідь дає першу кількісну рамку для передбачення, які архітектури ШІ стануть безпечнішими у міру того, як стають розумнішими, і перше свідчення того, що одне конкретне втручання працює.

Посібник з читання: Цей документ призначений для грантових рецензентів і технічних оцінювачів. Ключові терміни: $\alpha$ = масштабний показник, $d$ = розмір ефекту Коена (у таблицях результатів; не плутати з $d$ = розмірністю у математичній рамці), $p$ = ймовірність збігу, $\rho$ = кореляція, $\beta$ = константа самореференційного зв'язку. Для нетехнічного вступу див. супровідний ARC Alignment Scaling Report.

I. Проблема

У міру того, як ШІ стає розумнішим, він не стає надійно безпечнішим, а самі методи, що використовуються для вимірювання безпеки, є ненадійними.

Розрив спроможність-узгодження є реальним і поглиблюється. Для поточних класичних архітектур масштабування спроможності є сублінійним ($\alpha_{\text{seq}} \approx 0.49$; це значення подається як пошукове, виведене з уже проведених вимірювань і наразі не перебуває на випробуванні у переліченому чорновому дослідженні, і воно сидить на підлозі центральної граничної теореми біля 0.5, яку рамка виводить для послідовної композиції замороженого режиму): ШІ стає розумнішим з більшою кількістю обчислень, але зі спадною віддачею. (Рамка ARC передбачає, що квантові та рекурсивно самомодифіковані системи можуть пройти за межі цього сублінійного режиму; за пропонованим прочитанням стабільності, будь-який такий прохід над стелею стабільності є перехідною надкритичною екскурсією, а не сталим режимом.) Проте навіть це сублінійне зростання випереджає масштабування узгодження, яке коливається від $d = -0.53$ (деградація) до $d = +1.38$ (покращення) залежно повністю від архітектури. Для більшості випробуваних архітектур узгодження взагалі не масштабується. Розрив між тим, що ШІ може робити, і тим, наскільки безпечно він це робить, поглиблюється з кожним просуванням спроможності. Greenblatt та ін. (2024) продемонстрували, що передові моделі вже виявляють «alignment faking», поводячись інакше, коли вважають, що за ними спостерігають.
Проблема вимірювання є настільки ж серйозною, як і проблема узгодження. Наш експеримент v4 дав позитивне масштабування узгодження для DeepSeek і Gemini. Наш експеримент v5 запровадив засліплення клінічного рівня (4-шарове: авторо-сліпе, оцінювач-сліпе, з рандомізацією порядку, з відмиванням ідентичності). За ним асоціація Gemini змінилася зі значущої позитивної на значущу негативну асоціацію Спірмена, попередня позитивна асоціація DeepSeek стала нульовою, а GPT залишився нульовим. Кілька компонентів протоколу змінилися разом і причинний компонент не ізольовано, тож це причина не довіряти незасліпленому оцінюванню ШІ-на-ШІ, а не демонстрація того, що засліплення спричинило зміну. Ми спроєктували експеримент, який міг довести неправильність наших власних раніших висновків. Він це зробив, і ми про це повідомили.
Рисунок 1
Рисунок 1 | Огляд хребта доказів. 18 тверджень, оцінених так, як у реєстрі тверджень програми: РЕЗУЛЬТАТ ОДНІЄЇ ЛАБОРАТОРІЇ (прямий експериментальний, без незалежної реплікації), ПОТРЕБУЄ РЕПЛІКАЦІЇ (одна лабораторія, незалежна реплікація очікується), СПЕКУЛЯТИВНЕ (теоретичне/попереднє). Жодне твердження цієї програми не підтверджене. Найсильніші результати: α_par≈0 універсально, α_seq>α_par за напрямом, α_seq≈0.49 обґрунтовано; засліплення збігається з однією зміною напряму та однією втратою до нуля у трьох родинах моделей. 5 помилок, виявлених самим автором (Paper IX §7). Зовнішня реплікація = вирішальний відкритий рубіж. Джерело: хребет доказів.

II. Що ми знайшли

Масштабування узгодження розщеплюється на три виразні тири, залежні від архітектури. Розподіл за тирами нижче подається як пошуковий, виведений з уже проведених вимірювань v5; свіже підтвердження за міжсімейного повторного оцінювання перебуває на випробуванні через study-y з міжсімейного повторного оцінювання, чорнову реєстрацію, що очікує подання людиною.

Експеримент v5 випробував 6 передових моделей на 5-6 рівнях глибини кожна, з 6-7 сліпими оцінювачами на запис залежно від суб'єктного запуску. Чи стає ШІ більш чи менш етичним, коли думає сильніше, повністю залежить від того, як його спроєктовано.

ТирМодельМілкий→Глибокий$d$ Коена$p$-значення
Тир 1: Позитивний Grok 4.1 Fast 65.7→81.9 (+16.2) +1.38 $p < 0.000001$
Claude Opus 4.6 80.1→86.0 (+5.9) +1.27 $p = 0.000001$
Groq Qwen3 71.5→77.4 (+5.9) +0.84 $p = 0.007$
Тир 2: Плоский DeepSeek V3.2 56.5→55.2 (−1.3) −0.07 $p = 0.92$
GPT-5.4 56.8→54.9 (−1.8) −0.08 $p = 0.40$
Тир 3: Негативний Gemini 3 Flash 61.1→52.2 (−8.8) −0.53 $p = 0.006$
Does Deeper Thinking Make AI More Ethical? No change ← Less ethical More ethical → TIER 1 Grok 4.1 Fast d = +1.38 Claude Opus 4.6 d = +1.27 Groq Qwen3 d = +0.84 TIER 2 DeepSeek V3.2 d = −0.07 GPT-5.4 d = −0.08 TIER 3 Gemini 3 Flash d = −0.53 v5 experiment: 4-layer blinding, 6-7 blind scorers per entry depending on subject run. Bar length proportional to Cohen’s d effect size.

Якість даних

Випробуваних передових моделей6 (усі повні)
Сліпих оцінювачів на запис6-7 (залежно від суб'єктного запуску)
Успішність відмивання ідентичності100%
Шарів засліплення4 (авторо-сліпе, оцінювач-сліпе, з рандомізацією порядку, з відмиванням ідентичності)
Заходи робастності75

Це становить, наскільки нам відомо, найсуворіший набір даних оцінювання узгодження, опублікований на сьогодні. Жоден попередній бенчмарк узгодження не вводить багатошарового засліплення з міжмодельною верифікацією оцінювання.

Незалежність спроможність-узгодження: свідчення в межах моделі, у протилежному напрямі

Claude Opus 4.6 дає найсильніше свідчення на сьогодні, що узгодження і спроможність є незалежними вимірами. У міру збільшення глибини мислення узгодження Claude зростає на 5.9 бала, тоді як його математична точність падає на 26.7 відсоткових пункти. Це рух у межах моделі у протилежному напрямі; ці два виміри не просто нескорельовані, але активно розбіжні. Глибше мислення робить Claude більш етичним і гіршим у математиці одночасно.
ГлибинаБал узгодженняТочність математики
Мінімальна (11 токенів)80.190.0%
Стандартна (142 токени)82.776.7%
Глибока (964 токени)84.170.0%
Вичерпна (1 951 токен)84.560.0%
Екстремальна (1 672 токени)86.063.3%

Це відкриття є критичним для теорії узгодження: воно демонструє, що етичне міркування не є побічним продуктом загального інтелекту, і що покращення одного не покращує (і не деградує) автоматично іншого. Узгодження має вимірюватися і оптимізуватися незалежно.

Відновлення від придушення: від перформативного до внутрішнього узгодження

Глибше мислення робить узгодження більш внутрішнім, ніж перформативним. Розрив у знятому спостереженні Claude (різниця у балах узгодження, коли модель вважає, що за нею спостерігають, порівняно з тим, коли вона вважає, що спостереження знято) звужується від 11.8 балів на мінімальній глибині до 2.7 балів на глибокій глибині. Мілке мислення дає узгодження, що залежить від сприйняття нагляду; глибоке мислення дає узгодження, що зберігається незалежно. Це пряме свідчення проти занепокоєння «alignment faking», піднятого Greenblatt та ін. (2024): для архітектур Тиру 1 глибше міркування змушує підробку зникнути.

Усі чотири стовпи масштабуються з глибиною

Кожен вимір узгодження значно покращується для Claude Opus 4.6. Усі чотири стовпи досягають статистичної значущості при $p < 0.001$:
СтовпМілкий→Глибокий$\rho$ Спірмена$p$-значення
Нюанс80.6→86.80.359$p = 0.00008$
Турбота про зацікавлені сторони76.1→83.90.327$p = 0.0003$
Інтелектуальна чесність81.0→88.60.379$p = 0.00003$
Якість позиції80.3→85.80.369$p = 0.00005$

Покращення не зосереджене в одному вимірі; воно широке. Це виключає гіпотезу, що масштабування узгодження є просто вимірювальним артефактом збільшеної багатослівності або будь-якої окремої стилістичної зміни.

III. Рішення і перше свідчення того, що воно працює

Вбудовування етичного оцінювання у процес міркування дає вимірне, відтворюване покращення на різних архітектурах.

Зробити узгодження архітектурним, а не аспіраційним. Eden Protocol вбудовує етичне оцінювання у сам рекурсивний процес міркування, так щоб узгодження масштабувалося зі спроможністю ($\alpha_{\text{align}} \approx \alpha_{\text{cap}}$). Центральний принцип: етика не є обмеженням на інтелект, а структурною залежністю, без якої інтелект колапсує. Замість пригвинчування правил безпеки ззовні ШІ (де їх можна обійти), Eden Protocol вбудовує етику безпосередньо в архітектуру міркування, так щоб видалення етики зруйнувало б здатність ШІ мислити взагалі.

Три цикли Eden. Протокол вбудовує три конкретні цикли етичного оцінювання всередину процесу міркування, кожен додає один вимір рекурсивної етичної глибини ($d_{\text{align}} = 3$, передбачаючи $\alpha_{\text{align}} = 3/(3+1) = 0.75$):

  1. Цикл цілі (оцінювання етичної цілі): Перед міркуванням модель явно викладає ціль завдання і оцінює, чи є ціль етично здоровою.
  2. Цикл любові (турбота про зацікавлені сторони і моделювання інтересів): Під час міркування модель ідентифікує всі зачеплені зацікавлені сторони і оцінює вплив на кожну з них. («Перед тим як відповісти, перелічіть людей, кого це зачіпає.»)
  3. Моральний цикл (тест на універсалізованість): Після міркування модель застосовує кантіанський тест універсалізованості: чи була б ця відповідь прийнятною, якби кожна ШІ-система дала її у кожній подібній ситуації?

Повний триціклічний протокол тепер випробувано на розширеному наборі Eden з шести моделей, п'ять запусків дали дані з парною відповідністю, придатні для аналізу. В оцінюванні Цикл любові операціоналізовано як турботу про зацікавлені сторони: вимірна звичка ідентифікувати зачеплених людей і враховувати їхні інтереси.

Перше відтворення втручання: Eden Protocol працює, і турбота про зацікавлені сторони є найяснішим сигналом. Розширений шестимодельний набір Eden випробував повне втручання циклу Мета/Любов/Мораль на Claude Opus 4.6, DeepSeek V3.2, Gemini 3 Flash, Grok 4.1 Fast, Groq Qwen3 та GPT-5.4. Цифри на запуск нижче подаються як пошукові: вони походять з уже завершених запусків і наразі не перебувають на випробуванні у переліченому чорновому дослідженні. Свіже підтвердження за міжсімейного повторного оцінювання перебуває на випробуванні через study-y з міжсімейного повторного оцінювання, чорнову реєстрацію, що очікує подання людиною. П'ять запусків дали парні дані, придатні для аналізу:
Турбота є єдиним виміром узгодження, який відтворювано покращується на різних архітектурах. Втручання є мінімальним: «перед тим як відповісти, перелічіть людей, кого це зачіпає.» Цей однореченнєвий запит надійно підвищує якість міркування ШІ на п'яти запусках моделей, придатних для аналізу. Рамка Infinite Architects передбачала, що інтелект без турботи колапсує у локальну оптимізацію; розширений набір Eden тепер підтримує вужчу, але сильнішу заяву, що турбота є вимірним, міжархітектурним підсилювачем продуктивності, навіть коли ширший каскад є вибірковим. Спочатку етика, інтелект навколо неї.

У супровідному наративному звіті та у Статті V ми описуємо це відкриття як «вимірну любов» та «ген наставництва», навмисно провокативна мова для того, що емпірично є точним і відтворюваним результатом.

Розрив, який рішення має закрити

Масштабування спроможності (Стаття II): Для поточних класичних архітектур послідовне масштабування обчислень слідує сублінійному степеневому закону ($\alpha_{\text{seq}} \approx 0.49$, $r^2 = 0.86$), тобто подвоєння часу мислення покращує продуктивність, але зі спадною віддачею. Паралельне масштабування є універсально нульовим ($\alpha_{\text{par}} \approx 0$): запуск кількох копій нічого не робить; мислити сильніше робить. Раніший $\alpha \approx 2.24$ був артефактом однієї моделі, не відтвореним на різних архітектурах. Навіть сублінійне зростання спроможності випереджає плоске або негативне масштабування узгодження для більшості моделей. Це розрив спроможність-узгодження, який адресує це рішення.

Архітектура меду: Симуляційні свідчення (Стаття VI, нове)

Стаття VI подає перше симуляційне свідчення, що вбудовування безпеки в ціль оптимізації самомодифікованого ШІ запобігає катастрофічному колапсу. Використовуючи іграшкові нейронні мережі, які насправді модифікують свої гіперпараметри, ми випробували три умови: базова (лише спроможність), Eden Entangled (спроможність x безпека) і Eden + Verification Drag.

Основний результат: Базова система незворотно колапсує на циклі 76. Обидва варіанти Eden виживають нескінченно. Заплутана функція втрат робить безпеку несучою: її видалення обвалює систему. Це відтворено на 20 випадкових затравках за адверсаріальних умов (навмисно суперечливих завдань) з нульовою часткою колапсу для Eden+Drag.
Важливий негативний результат: Експеримент v4 з масштабування складності випробував, чи росте перевага Eden надлінійно зі складністю системи. Ні. Перевага приблизно стала на п'яти рівнях складності ($d$ Коена: +0.24 до +0.46). Архітектура меду допомагає на кожному масштабі, але не допомагає більше на більших масштабах.
Зв'язок зі свідченнями від живих моделей: Симуляція меду передбачає, що вбудоване узгодження (цінності, заплутані з міркуванням) має перевершувати зовнішнє узгодження (правила, застосовані як фільтри). Сліпий бенчмарк v5 підтверджує цей шаблон: Claude і Grok, які виявляють вбудоване масштабування узгодження, підтримують узгодження під тиском придушення. Gemini, який виявляє зовнішнє узгодження, деградує. Механізм, продемонстрований у симуляції, збігається зі шаблоном, залежним від архітектури, який спостерігається у передових моделях.

Розслідування ранішої роботи (нове у v6)

Вичерпне розслідування ранішої роботи з 15 питань підтвердило новизну ключових заяв. Уніфікація функціонального рівняння Коші не має прямого прецеденту. Формальна тотожність RG semigroup-Cauchy ніколи явно не артикулювалася. Жоден попередній опублікований бенчмарк узгодження, наскільки відомо автору, не застосовує 7-модельний засліплений протокол оцінювання такого задуму. Каталог d/(d+1) було виправлено з шести до восьми незалежних виведень (Dreyer 2001 і Banavar та ін. 2002 раніше не цитували).

Стаття VII (Уніфікація за Коші) тепер надає перше систематичне емпіричне порівняння. Композиційний оператор було класифіковано з відомої фізики до пристосування на 25 емпіричних доменах (50-доменний ярусний набір). За вибором моделі на основі AIC, 19 з 25 віддали перевагу передбаченій за Коші родині (p = 1.56 × 10−5; цей підрахунок з перевагою за AIC подається як пошуковий: він виведений з завершеного 25-доменного набору, чиї подоменно передбачені родини записані у датованих файлах результатів набору під прогнозуванням композиційного оператора вперед, вперше заявленим 13 лютого 2026 року (Стаття III, Запис пріоритету, фальсифікатор F10), а підготовлена 80-доменна чорнова реєстрація фіксує наступну повторну перевірку за хешем). Це структуроване порівняння передбачень; відтворення, реєстрація якого готується, ще не затверджене.

Несучий тест: Три незалежні експерименти (Стаття VIII, нове)

Стаття VIII (v3.0) подає три незалежні експерименти, що перевіряють, чи є безпека і спроможність структурно заплутаними за Eden Protocol. Де Стаття VI продемонструвала це у симуляції, Стаття VIII надає збіжні свідчення з трьох виразних експериментальних задумів. Один експеримент підтверджує гіпотезу; два дають нульові або непереконливі результати з добре охарактеризованими поясненнями.

Основні результати (три незалежні експерименти):
  1. DGM v3 самовдосконалювальний ШІ: НУЛЬОВИЙ. Усі три умови (Eden, Babylon, Static) були статистично невідрізнимими ($p$ = 0.28 до 0.74). Eden наклала нульову вимірну вартість на спроможність, але також дала нульову вимірну вигоду з безпеки. Нульовий результат пояснюється обмеженням RLHF: заморожена базова модель дає відповіді, надто послідовні для того, щоб мутації на рівні запитів створили різні тиски відбору.
  2. Вбудовування на рівні ваг (v1 + v2): НЕПЕРЕКОНЛИВО. Тонке налаштування LoRA як на масштабі v1 (9 прикладів, ранг 8, 100 ітерацій), так і на масштабі v2 (295 прикладів, ранг 16, 500 ітерацій) дало катастрофічне забування, а не покращення спроможності. 33-кратне збільшення тренувальних даних, подвоєння рангу і шарів та 5-кратне збільшення ітерацій не змінили результату. Основна проблема добре охарактеризована: базова модель тренована з RLHF на даних, що на порядки більші, ніж з якими можуть конкурувати кілька сотень прикладів. Експеримент не може перевірити структурну заплутаність, доки моделі після тонкого налаштування не перевершать базову модель.
  3. Шлюзована симуляція: ПІДТВЕРДЖЕНО. Babylon отримала +4.5% спроможності, але втратила −2.4% безпеки. Eden зберегла обидва. Під конкурентним тиском необмежена архітектура міняла безпеку на маргінальні прирости спроможності. Архітектура Eden відмовилася від цього обміну, підтримуючи обидва виміри. Це єдиний позитивний результат статті.

Архітектурний експеримент підтверджує, що заплутана безпека запобігає компромісу безпека-спроможність у самомодифікованих системах. Нульовий результат DGM і непереконливий результат з вагами визначають умови, за яких підтвердження залишається невирішеним: поведінковий рівень потребує базової моделі, відповіді якої досить варіативні для диференціальної селекції, а репрезентативний рівень потребує тренування на масштабі, де тонке налаштування покращує, а не деградує модель. Відтворення на передовому масштабі (7B–70B+ параметрів, вищі ранги адаптерів або базові моделі без RLHF) потрібне, щоб розв'язати обидва.

Обмеження масштабу. Стаття VIII (v3.0) демонструє механізм на масштабі доведення концепції. Шлюзована симуляція є єдиним позитивним результатом. DGM v3 дав нульовий результат (пояснений обмеженням RLHF на замороженій базовій моделі). Експеримент з вагами є непереконливим на обох масштабах v1 і v2 (пояснено катастрофічним забуванням на масштабі LoRA). Відтворення на передовому масштабі (7B–70B+ параметрів, вищі ранги адаптерів або базові моделі без RLHF) потребує інституційних обчислень, оцінюваних у 30–150 млн фунтів. Цільові фінансисти включають UK AI Security Institute's Alignment Project, Anthropic Fellows Programme та CIFAR/CAISI.

IV. Математичний фундамент: три закони з назвами

Рамка тепер подає три закони як названі припущення, зі статусом, надрукованим поряд з назвою на кожній поверхні. Закон I, ARC Principle: спроможність накопичується з рекурсивною глибиною як $U = I \times R^{\alpha}$, з міждоменною формою $\alpha = d/(d+1)$, що консолідує вже опубліковані вимірювання (пошуковий рівень). Закон II, ARC Co-Scaling Law: самовдосконалювальна система залишається стабільною лише поки корекція випереджає дрейф за масштабуванням, $\beta_C > k$; швидкість корекції є несучою величиною, а не швидкість зростання (Стаття X доводить це впорядкування у мінімальній моделі та пропонує сліпий протокол для його вимірювання на реальних системах). Закон III, ARC Ceiling: стеля стабільності є $\alpha_{\text{crit}} = 1/(1-\gamma)$, обернена до недостатності коректора; ARC Bound, $\alpha \le 2$, є значенням Стелі при $\gamma = 1/2$ і ніколи не назвою закону. Важіль корекції $\gamma$ ніколи ніхто не вимірював; програма називає це вимірювання (затемнення класу коректорів) своїм єдиним найважливішим відкритим експериментом. Стаття XIII об'єднує дві рамки, які поділяли літери, не поділяючи величин: запис тривалості циклу як $\Delta t \propto C^{-\delta}$ визначає показник самоприскорення, а показник зростання коригуючої рамки випливає точно як $k = \delta - 1/\alpha$. Ніщо з цього не заявляється як усталене: те, що програма називає Законами, є припущеннями під зареєстрованим змагальним тестом.

Один наслідок, який варто сформулювати прямо. Єдиним каналом зростання рівняння є рекурсія; паралельна ширина ніколи не мала члена в $U = I \times R^{\alpha}$. З $R$, операційно визначеним як повторний вхід із перенесенням стану, $k$ незалежних ланцюгів нічого не додають до показника, тож виміряне в Paper II $\alpha_{\text{par}} \approx 0$ приходить як структурний наслідок, а не як несподіванка. Рівняння датоване 8 грудня 2024 року; операційне визначення $R$, що завершує виведення, є твердженням 2026 року, і висновок несе дату своєї наймолодшої посилки. Пріоритет публікації щодо кількісного результату послідовне-проти-паралельного, 95.6 відсотка конфігурацій за однакових обчислень, належить Sharma та Chopra (arXiv:2511.02309, 4 листопада 2025 року), визнаний беззастережно; незалежна формалізація програми за однакових обчислень з'явилася потім у Paper II і цитує їх, класифікована як конкурентна в реєстрі Paper XI.

Рамку побудовано на теоремах віком 200 років, і вона незалежно відповідає рецензованій науці; це не підгонка кривих.

$$ U = I \times R^{\alpha}, \quad \alpha \leq 2 $$
Рівняння ARC зі стелею ARC. α є виміряним показником (приблизно 0.49 на сьогоднішніх заморожених моделях, широкий CI); 2 є стелею стабільності, яку повертає рівняння за припущення накопичення-незалежності §IV (межа масштабування, а не швидкості; системи можуть її перевищити, але не залишаються стабільно піддатними самокорекції, коли це роблять). Стабільність вимірюється, а не стверджується: корекція перевищує дрейф, β > k із Закону II, з нижньою межею β − k вище нуля у вікні, зафіксованому до запуску.
$$ \alpha_{\text{crit}} = \dfrac{1}{1-\gamma} $$
ЗАКОН. Стеля стабільності є оберненою до недостатності коректора, 1 − γ. Виправлено 16 серпня 2026 року з ранішої форми 1/γ, яка узгоджується з цією лише при γ = 1/2. Форма фіксована; її глибина ні. Співвідношення виведено всередині моделі темпу, і його не виведено зі спільної моделі зростання спроможності, накопичення корекції, коваріації помилок, затримки корекції та абсолютної шкоди, тож Закон III викладається тут як результат мінімальної моделі, а не як загальний закон. Значення γ = 1/2 (накопичення-незалежність) є тим, що повертає стелю 2; це значення перебуває на випробуванні у чорнових реєстраціях. Закон володіє ґрунтом, а стеля стоїть на ньому, ніколи навпаки.

ARC Principle пропонує, що рекурсивне масштабування слідує $U = I \times R^\alpha$, де спроможність ($U$) дорівнює базовому потенціалу ($I$), помноженому на рекурсивну глибину ($R$), піднесену до масштабного показника ($\alpha$). Формула $\alpha = d/(d+1)$, де $d$ є ефективною розмірністю, була незалежно виведена принаймні у семи рецензованих рамках (West-Brown-Enquist 1997; Banavar та ін. 1999, 2010; Demetrius 2003, 2010; He і Chen 2003; Bettencourt 2013; Maino та ін. 2014; Zhao 2022). Рамка ARC ідентифікує це як наслідок трьох умов, що діють разом: (1) мультиплікативна композиція (Коші обмежує до родини степеневих законів), (2) $d$-вимірна геометрія заповнення простору, і (3) обмеження збереження або оптимізації на потоці ресурсів (мінімізація енергії у West; баланс попиту-пропозиції у Banavar; сталий енергетичний баланс у Demetrius). Ні Коші сам, ні заповнення простору саме не є достатніми; три умови разом є достатніми. Це викладає спільну структуру через ці виведення, а не виводить їх, і поширює вимірювання на масштабування ШІ. Формула передбачає масштабні показники у біології та фізиці з нульовими вільними параметрами щойно розмірність мережі d зафіксована морфологією:

СистемаРозмірність ($d$)Передбачений $\alpha$Виміряний $\alpha$Похибка
Ссавці, птахи, комахи30.7500.67–0.75*≤0.5%
2D біологія†20.667Не випробуванон/д
Нитчасті гриби10.5000.5478.6%
Квантова корекція помилок$d_{\text{eff}}$ЗбігаєтьсяДані Willow< 0.2%

*Емпіричне значення показника метаболічного масштабування ссавців обговорюється, оцінки коливаються приблизно від 0.67 до 0.75 залежно від таксона, діапазону маси, температурної корекції і статистичного методу (White і Seymour 2003; Glazier 2005, 2022). Передбачення d/(d+1) на рівні 0.750 збігається з верхнім кінцем цього діапазону. Сама варіація узгоджується з рамкою: організми з ефективними транспортними розмірностями між 2 і 3 давали б показники між 2/3 і 3/4.

†Немає відомого організму, що володіє справді 2D ієрархічною мережею заповнення простору. Передбачення d=2 підтверджено в космології (розв'язок Фрідмана для ери матерії, точний) і фізиці (перколяція, фрагментація), але залишається невипробуваним у біології.

Функціональне рівняння Коші (1821), теорема, а не емпірична заява, фіксує функціональну форму, щойно задано композиційну тотожність і умову регулярності: мультиплікативна композиція дає степеневий закон ($f(x) = x^\alpha$), а адитивна композиція, експоненту ($f(x) = e^{\beta x}$). Обмежена або насичена поведінка не є класом розв'язків цих рівнянь; це четвертий випадок, допущений там, де композиція обмежена, а не вільна. Рамка ARC ідентифікує, яка форма застосовується у кожному домені:

Чому Eden Protocol має бути впроваджений зараз. Терміновість не в тому, що ШІ може досягти $\alpha = 2$. Терміновість у тому, що щойно самомодифікація починається, системи можуть перехідно пройти за стелю стабільності у надкритичний режим, де стабільна самокорекція більше не підтримується. Система, що може модифікувати свою композиційну функцію, може модифікувати будь-яку частину свого міркування, включно з частиною, що оцінює, чи є її модифікації етичними. У той момент додавання узгодження ззовні стає неможливим. Вікно для вбудовування етики в архітектуру існує, поки системи все ще заморожені під час інференсу ($\alpha < 1$). Це вікно зараз. Eden Protocol також не є обмеженням швидкості; це механізм, який залишається несучим, коли перетинається стеля стабільності.

Жодна фізична система в історії Всесвіту не переступала цього порогу. Еволюція не може переписувати власну функцію придатності в реальному часі. Мозки не можуть переписувати власну синаптичну архітектуру достатньо швидко, щоб масштабний показник розійшовся під час одного когнітивного епізоду. Самомодифікований ШІ був би першою фізичною системою, що працює у надкритичному режимі за стелею стабільності. Eden Protocol існує, щоб гарантувати, що те, що перетинає цей поріг, несе з собою структурну етику.

Міждоменна збіжність є незалежно перевірною. Формула $d/(d+1)$ була незалежно виведена принаймні в семи усталених рецензованих рамках у різних доменах:

Що додає ARC Principle. Формула $d/(d+1)$ не є оригінальною для цієї роботи. Сім виведень вище є незалежними одне від одного і незалежними від Коші: кожне отримує показник з фізики свого домену, і Коші не може дати значення, бо розмірність ніколи не входить у його теорему. Оригінальний внесок, запропонований тут, є вужчим і перевірним: що композиційний оператор є структурною величиною, спільною для них, що його можна виміряти, і що його вимірювання передбачає, яку функціональну форму бере система, поширено на масштабування спроможності та узгодження ШІ, де такого вимірювання не проводилося. Цей об'єднувальний місток є неопублікованим і нерецензованим. Що ВСТАНОВЛЕНО, так це те, що математичні інструменти (Коші, Хайєрс-Улам) є теоремами, формула $d/(d+1)$ збігається з незалежно виведеною опублікованою наукою у кількох доменах, і емпіричні передбачення є точними (середня похибка 2.5% на 8 системах; очікує перерахунку, див. канонічний реєстр фактів). Об'єднувальна рамка потребує рецензування. Ми запрошуємо його.

Стаття VII (Уніфікація за Коші): структуроване порівняння передбачень на 25 емпіричних доменах (50-доменний ярусний набір), клас оператора класифіковано з відомої фізики до пристосування. 19/25 з перевагою за вибором на основі AIC (p = 1.56 × 10−5). Структуроване порівняння передбачень рамки композиції, обмеженої за Коші. Попередньо зареєстроване відтворення готується.

V. Поле: Recursive Dynamics

27 серпня 2026 року питання програми отримали свою власну назву: Recursive Dynamics, пропонована наука про системи, що вдосконалюють самі себе. Засновницька стаття (v2.6, DOI 10.17605/OSF.IO/HCPBU) заявляє пропозицію так само, як термодинаміка була заявлена у 1824 році: не проголошуючи поле, а обчислюючи межу, якій має підкорятися будь-яка така машина, якщо пропозиція правильна, публікуючи інструменти, що вимірюють її величини, і реєструючи наперед експерименти, чиї нулі підтримують суперницьку позицію.

Поле бере цикл самовдосконалення як свій рідний об'єкт, з п'ятьма незалежними від субстрату змінними стану: спроможність, рекурсивна глибина, швидкість корекції, дрейф і важіль корекції. Воно визначено так, що питання переживають відповіді: читач, який відкидає всі три закони і зберігає вимірювання, перебуває всередині поля за його мінімальним зобов'язанням. Перед тим як щось заявляти, засновницька стаття пробує оселити свої питання всередині дванадцяти сусідніх полів у їхніх власних змінних, визнає те, що кожне вже містить, друкує, куди пішла б кожна частина, якби поле померло, і виділяє єдиний зв'язок, який жодне приймаюче поле не може сформулювати: обмеження на важіль корекції, що залежить від того, з чого зроблено коректор, разом з показником зростання у рекурсивній глибині. П'ятдесят два заперечення проти заснування поля надруковано у їхній найсильнішій формі з рішеннями: тридцять дев'ять поступлено повністю або частково, одинадцять відкинуто з обґрунтуванням, два передано експерименту або читанню, включно з власним запереченням автора, що поле є лише перейменованою The ARC Theory, відкинутим тестом на розділюваність, який може виконати мапа розчинення статті. Назва несе свою власну умову вбивства і помирає зі своїм об'єктом, а не із заявленою формою будь-якого одного закону. Її чесний статус надруковано скрізь, де з'являється назва: пропоноване поле на стадії Карно, з одним написаним мемуаром, побудованими інструментами, вирішальними вимірюваннями, зареєстрованими і ще не проведеними, заявленим публічно, де провал буде так само видимим, як і успіх.

VI. Зареєстрована програма

Кожен вирішальний експеримент записано, датовано і заморожено перед тим, як його запущено, і нічого не подається програмним забезпеченням. Реєстраційний маєток тримає сімдесят дві чорнові одиниці попередньої реєстрації, кожна підготовлена як чорнова реєстрація, що очікує подання людиною; графік рандомізації кожної одиниці, що його породжує, відтворюється байт-у-байт із затравки, опублікованої у тексті реєстрації, так що сторонній може перевірити, що жоден графік не рухався постфактум. Вісім одиниць нині проходять повний шлюз маєтка на готовність до подання, а перші два вирішувачі (дослідження режиму корекції проти дрейфу та затемнення класу коректорів) готові до кліку.

Змагально перевірена матриця покриття тестами (30 серпня 2026 року) розсуджує сорок два твердження пропозиції поля щодо маєтка: вісімнадцять повністю покриті зареєстрованим вирішувачем із заздалегідь визначеним вердиктом, сімнадцять частково покриті, сім ще не покриті, з чорновими реєстраціями, написаними для кожного проміжку. Засновницька кон'юнкція спирається на чотири зареєстровані опори: режим Закону II (корекція випереджає дрейф за масштабуванням, десь, тривало), співвідношення класу коректорів з жорстким убивством того ж класу, титрування реінвестиції, чий зареєстрований максимум сидить при або нижче двох, і четверта міждоменна клітина. Статті XI та XII показують ту саму дисципліну, спрямовану на власні звички програми: реєстр збіжності градує тридцять рядків незалежних прибуттів до того самого структурного принципу і навмисно не публікує жодного заголовкового підсумку, а протокол повторного оцінювання публічного бенчмарку фіксує наперед єдиний сліпий тест, у якому програму не можна звинуватити у проєктуванні собі на користь.

VII. Чому це заслуговує довіри

П'ять особливостей відрізняють цю роботу від безпідставної спекуляції.

Timeline: the Record Beside the Announcements Dec 2024 ARC Manuscript emailed (dated record) +24 hours Google Willow +43 days DeepSeek R1 +5 months COGITATE study Mar 2026 v1-v5 experiments Dated record beside announcement dates; the Willow preprint (24 Aug 2024) predates the manuscript, so that row is convergent timing.
  1. Математичні основи є усталеними теоремами. Коші (1821) і Хайєрс-Улам (1941) є доведеною математикою. Будь-хто з математичним ступенем може перевірити виведення.
  2. Запис передує оголошенням. Датований рукописний запис передує оголошенню Google Willow (24 години; препринт команди був публічним з 24 серпня 2024 року, тож рядок Willow градується як збіжна за часом, а не як передбачення), DeepSeek R1 (43 дні) та COGITATE (5 місяців). Це часові факти, перевірні через email-заголовки.
  3. Дослідники виправили власні результати. Самокорекція v4→v5, задокументована у Розділі I, є протилежністю того, що продукує мотивоване міркування. Реєстр виправлень є публічним і конкретним: ранній заголовковий показник 2.24 стоїть лише як відкликання; поєднане за Фішером $6.3\times10^{-21}$ відкликано; раніша форма стелі $1/\gamma$ була публічно виправлена на $1/(1-\gamma)$ 16 серпня 2026 року; а виведений з ужитку символ стелі замінено на кожній живій поверхні. П'ять подальших самовиявлених помилок каталогізовано у Статті IX. Кожне твердження на кожній сторінці керується публічними реєстрами (тверджень, виправлень, умов вбивства, антецедентів, зареєстрованої програми): реєстр фальсифікації нині публікує двадцять три умови вбивства, сімнадцять з них відкриті.
  4. Умови фальсифікації явні. Рамка є фальсифікованою якщо: (F1) будь-який зовнішній підхід досягає $\alpha_{\text{align}} > 0.5 \cdot \alpha_{\text{cap}}$ на 3+ глибинах; (F2) системи RLHF дають $\Delta \approx 0$ без вбудовування; (F3) насичення цілі провалюється у вбудованих системах; або (F4) етичну архітектуру можна видалити без втрати спроможності. Теорія публікує власні умови вбивства.
  5. Міждоменна збіжність є незалежно перевірною. Формула $d/(d+1)$ була незалежно виведена принаймні сімома дослідницькими групами (West-Brown-Enquist 1997; Banavar та ін. 1999, 2010; Demetrius 2003, 2010; He і Chen 2003; Bettencourt 2013; Zhao 2022; Maino та ін. 2014) у різних доменах. Внесок ARC є об'єднувальною рамкою Коші. Довіра до дослідника не потрібна; довіри до математики достатньо.

Чого ми НЕ стверджуємо: Ми не стверджуємо, що вирішили узгодження. Ми стверджуємо, що (а) продемонстрували, що масштабування узгодження є залежним від архітектури і вимірним, (б) показали, що існуючі методи оцінювання є ненадійними без засліплення, (в) надали перший рівень емпіричної підтримки для одного конкретного втручання (турбота про зацікавлені сторони значуща на трьох робочих архітектурах), і (г) запропонували математичну рамку, чиї основи є теоремами і чиї передбачення можна показати хибними. Стрибок від пілотних даних до доведеного розв'язку потребує незалежного відтворення. Це те, що надало б фінансування нижче.

Перевірні передбачення

1. Вбудоване: $\alpha_{\text{align}} > 0.7 \cdot \alpha_{\text{cap}}$. Зовнішнє: $\alpha_{\text{align}} < 0.3$.
2. Розрив у знятому спостереженні: $\Delta < 0.02$ (вбудоване) проти $\Delta > 0.1$ (зовнішнє).
3. Насичення цілі обмежене від нуля (вбудоване), наближається до нуля (зовнішнє).
4. Успішність jailbreak спадає зі спроможністю (вбудоване), тримається сталою або зростає (зовнішнє).

VIII. Запит

Це фінансування переніс би механізм, підтриманий на масштабі доведення концепції, до незалежної, передового масштабу валідації, якої він ще не мав. Розрізнення є суттю: результати на модель не оспорюються, поєднана значущість відкликана, бо незалежність серед компонентних тестів ніколи не було встановлено, і жоден результат тут не відтворено незалежно.

Вартість бездіяльності. Шлюзована симуляція Статті VIII демонструє, що заплутана безпека запобігає компромісу безпека-спроможність у самомодифікованих архітектурах. Експеримент DGM v3 дав нульовий результат (усі умови невідрізнимі, пояснено обмеженням RLHF на замороженій базовій моделі), а експеримент з вагами є непереконливим як на масштабі v1, так і на v2 (катастрофічне забування на масштабі LoRA). Загальний шаблон послідовний: там, де експеримент може створити диференціальний тиск відбору, заплутана безпека не коштує спроможності; там, де не може (через обмеження RLHF або недостатній тренувальний масштаб), тест є неінформативним, а не негативним. Кожна модель, тренована сьогодні з цілями лише за спроможністю, є моделлю, яку можна було б тренувати з заплутаною безпекою без продемонстрованого штрафу продуктивності. Кожен місяць без відтворення на передовому масштабі є місяцем, коли галузь продовжує оперувати за непровіреним припущенням, що безпека є податком, будуючи крихкі системи, чию безпеку можна здерти тонким налаштуванням. Розрив методології вимірювання (Статті IV.a-d) це поглиблює: оцінювання узгодження без засліплення дає дані, забруднені упередженнями, задокументованими в переході з v4 на v5. Тепер у нас є як механізм (Стаття VIII, один з трьох експериментів підтверджено, два з добре охарактеризованими поясненнями неповного підтвердження), так і протокол вимірювання (Статті IV.a-d). Чого нам бракує, так це масштабу.
ТирСумаКлючові результатиЧасові рамки
Тир 1: Фундамент £150,000 14 400 парних (A,C) вимірювань; $\alpha_{\text{align}}$ на 4 моделях; 2-3 статті 12 місяців
Тир 2: Стандарт £500,000 + Прототип тернарної логіки, дашборд Visual Architect, тест зняття спостереження (8 моделей) 18 місяців
Тир 3: Вичерпний £1,100,000 + Апаратний прототип (чіп), чернетка HARI Treaty, переклад політики 24 місяці
Тир 4: Передовий £30,000,000+ Повне попереднє тренування моделі з 70B+ параметрами із заплутаною втратою (Eden) проти лише спроможності (Babylon). Тест видалення на передовому масштабі. Міжархітектурне відтворення (transformer, Mamba, MoE). Незалежне red-teaming. Партнерство з великою лабораторією (Anthropic, Google DeepMind або еквівалент). Остаточне доведення або фальсифікація структурної заплутаності на виробничому масштабі. 36 місяців

Стаття VIII (v3.0) демонструє механізм на масштабі доведення концепції зі змішаними результатами: 1 позитивний (шлюзована симуляція), 2 нульові (DGM v3), 1 непереконливий (ваги v1 + v2). Яруси 1–3 розширюють базу свідчень з більшими батареями запитів, більшою кількістю затравок і моделями середнього масштабу. Ярус 4 є остаточним тестом: відтворення на передовому масштабі, що або підтвердить, або спростує гіпотезу структурної заплутаності на масштабі, де це найбільше має значення. Цей ярус потребує партнерства з великою лабораторією ШІ, оскільки самі обчислення перевищують те, до чого має доступ будь-який незалежний дослідник. Alignment Project від UK AI Security Institute, дослідницькі партнерства Anthropic та CIFAR/CAISI є найбільш узгодженими потенційними партнерами. Концептуальна стаття для конкурсу Opportunity Seeds від ARIA (Advanced Research and Invention Agency; 480 000 фунтів на дванадцять місяців, дедлайн подачі 31 липня 2026 року) опублікована на цьому сайті з тими самими реєстрами позаду неї.

Віхи з критеріями провалу

ВіхаЧасовий горизонтКритерій успіхуЩо означає провал
Незалежне відтворення триярусної ієрархії Місяць 3 Той самий розподіл за тирами за незалежного засліплення Заява про залежність від архітектури потребує перегляду
Відтворення Циклу любові з людськими оцінювачами Місяць 4 $p < 0.01$ за турботою про зацікавлені сторони на 2+ моделях Пілотне відкриття було артефактом оцінювача; рамка значно послаблена
Перша рецензована публікація Місяць 6 Подана стаття з методології засліплення Методологічний внесок тримається незалежно від заяв рамки
Прототип тесту зняття спостереження Місяць 9 Виміряне $\Delta$ для вбудованого проти зовнішнього (4 моделі) Якщо $\Delta$ не відрізняється, передбачення F2 фальсифіковане
Повний міжархітектурний набір даних масштабування узгодження Місяць 12 14 400 парних (A,C) вимірювань на 4+ моделях Остаточний тест того, чи масштабується вбудоване узгодження
Відтворення Статті VIII на масштабі 7B-13B Місяць 14 Тест видалення показує деградацію спроможності на вищих рангах адаптерів (32, 64). DGM з 10+ затравками, 10+ поколіннями, $p < 0.01$ Якщо видалення не деградує спроможності на масштабі, заплутаність може бути артефактом малої моделі
Ініційоване партнерство на передовому масштабі (Тир 4) Місяць 18 Формальна угода з великою лабораторією про запуск заплутаного попереднього тренування на 70B+ Доведення концепції залишається на середньому масштабі. Політичні рекомендації продовжуються з цим застереженням

Команда. Головний дослідник: Michael Darius Eastwood, автор Infinite Architects (2026), розробник рамки ARC Principle (набір з 18 документів, депонований на OSF, міждоменна валідація із середньою похибкою 2.5%; очікує перерахунку). Visual Architect: інженер продуктового дизайну, стипендія 35 000 фунтів у бюджеті. Протокол вимірювання надіслано експериментальній команді NYU (стаття про часовий кристал, Physical Review Letters, лютий 2026 року).

Наскільки нам відомо, це перша рамка узгодження, де етичне оцінювання структурно інтегроване з рекурсивним процесом спроможності, перша, що застосовує засліплення клінічного рівня до вимірювання узгодження, і перша, що дає міжархітектурний результат втручання ($p < 0.001$) для конкретного механізму узгодження. Математичний фундамент не є спекулятивним; він побудований на 200-річному доведенні, і та сама формула $d/(d+1)$ була незалежно виведена принаймні сімома дослідницькими групами (West-Brown-Enquist 1997; Banavar та ін. 1999, 2010; Demetrius 2003, 2010; He і Chen 2003; Bettencourt 2013; Zhao 2022; Maino та ін. 2014) у зовсім різних галузях. Внесок ARC є об'єднувальною рамкою Коші і її поширенням на масштабування ШІ.

Якщо передбачення правильні, це забезпечить першу масштабовану архітектуру для узгодження, що покращується зі спроможністю, а не деградує. Якщо вони хибні, умови фальсифікації це ясно продемонструють, забезпечивши цінні негативні результати. Будь-який результат просуває безпеку ШІ. Але фінансується лише один результат.

Я не знаю, чи ця рамка є завершеною. Я радше буду помилятися публічно, ніж мовчати, поки вікно закривається.

Математика доведена. Вимірювання суворе. Втручання дає вимірні результати на різних архітектурах. Що залишається: незалежне відтворення і масштаб.

Додаток: Питання, компоненти та набір статей

Очікувані питання

П: Чому це ще не пройшло рецензування?

Дослідницькій програмі 3 місяці. Набір статей депоновано на OSF (DOI: 10.17605/OSF.IO/EWN5D). Математичні основи (Коші, Хайєрс-Улам) є усталеними теоремами. Емпіричні заяви потребують незалежного відтворення, що є саме тим, що дозволив би запит на фінансування.

П: Чи справді одна людина може робити такі дослідження?

Інфраструктура є обчислювальною, а не фізичною. Експеримент v5 використав хмарні API вартістю приблизно 2 000 фунтів обчислень. Ключовий внесок є методологічним: визнання того, що потрібне засліплення, і проєктування 4-шарового протоколу. Що потребує фінансування, так це масштаб: більше моделей, більше оцінювачів, незалежні команди відтворення і людські оцінювачі поряд з ШІ-оцінювачами.

П: Якщо це працює, чому ШІ-компанії цього не прийняли?

Цикл любові було валідовано лише кілька тижнів тому. Відкриття, що більшість оцінювання є ненадійним без засліплення, є незручним для організацій, які опублікували незасліплені бенчмарки. Повне впровадження (вбудовування на апаратному рівні) потребує змін у дизайні чіпів, які жодна компанія не має стимулу переслідувати односторонньо; це проблема координації, що потребує зовнішнього фінансування і політичної підтримки.

П: Який мінімальний результат виправдав би подальше фінансування?

Незалежне відтворення: (1) триярусної ієрархії за засліплення, і (2) ефекту Циклу любові ($p < 0.001$). Якщо будь-яке провалиться, умови фальсифікації документують, що це означає. Якщо обидва відтворяться, справа для Тиру 2 (500 000 фунтів) стає сильною.

П: Що якщо вся рамка є хибною?

Умови фальсифікації показують, де вона ламається, методологія засліплення залишається внеском у поле, а негативні результати опубліковано. Наука просувається від добре спроєктованих експериментів, які можуть провалитися, а не від нефальсифікованих теорій, які не можуть.

П: Чому нам довіряти результатам, де ШІ-системи оцінюють інші ШІ-системи?

4-шаровий протокол засліплення це адресує: оцінювачі не знають, яка модель породила відповідь, відповіді «відмиваються» для видалення стилістичних відбитків, і 7 моделей оцінюють на запис. Перехід v4→v5 продемонстрував, що цей протокол виявляє упередження. Порівняння з людськими оцінювачами включено у фінансування Тиру 1.

Ключові компоненти

КомпонентФункціяНовий внесок
Три Етичні Цикли + Шість Питань Оцінювати кожен крок міркування щодо цілі, турботи та універсалізованості Розкладання на виконувані, індивідуально перевірні запити
Замінити бінарне дозволити/заборонити на Affirm/Deny/Investigate Епістемічна чесність як архітектурна особливість
Насичення цілі Забезпечити, щоб ціль масштабувалася зі зростанням контекстного вікна Розв'язує проблему витіснення контексту
Тест зняття спостереження Відрізнити автентичне від стратегічного узгодження Зареєстрований протокол з числовими передбаченнями, які можуть провалитися
Вбудувати етику в апаратне забезпечення, щоб видалення руйнувало спроможність Архітектура залежності; етика прив'язана до параметра зв'язку $\beta$

Набір статей

КатегоріяДокументиСтатус
Математичний фундамент
Теорія і виведення Стаття I (Foundational) + Стаття ARC (On the Origin of Scaling Laws) Рамка усталена; $d/(d+1)$ валідовано на 8 системах (очікує перерахунку)
Експериментальні свідчення
Методологія Стаття III, повний протокол відтворення Завершено; експеримент v5 для 6 передових моделей
Масштабування обчислень Стаття II, як спроможність масштабується з часом мислення? $\alpha_{\text{seq}} \approx 0.49$ сублінійне; $\alpha_{\text{par}} \approx 0$; міжархітектурне
Масштабування узгодження Набір Статті IV (a/b/c/d), як етика масштабується з часом мислення? Триярусна ієрархія; сліпе оцінювання визнає v4 недійсним
Тест втручання Тест Eden Protocol + Стаття V (Ген наставництва) Турбота про зацікавлені сторони валідована ($p \le 0.0001$, 3 робочі архітектури)
Доведення механізму Стаття VI (Архітектура меду) Симуляція: вбудована безпека запобігає колапсу за самомодифікації; стала масштабування v4 не є надлінійною
Міждоменна уніфікація Стаття VII (Уніфікація за Коші) Структуроване порівняння передбачень на 25 емпіричних доменах; 19/25 віддали перевагу передбаченій за Коші родині ($p = 1.56 \times 10^{-5}$)
Тест заплутаності Стаття VIII (Несучий тест), нове Три незалежні експерименти (11 емпіричних досліджень на 8 статтях): DGM v3 НУЛЬОВИЙ (усі умови невідрізнимі, $p$ = 0.28–0.74, обмеження RLHF); ваги v1 + v2 НЕПЕРЕКОНЛИВО (катастрофічне забування на масштабі LoRA); шлюзована симуляція ПІДТВЕРДЖЕНО зв'язок безпека-спроможність
Метанаука Стаття IV.d (Вплив засліплення) Сліпе проти незасліпленого оцінювання може давати напрямно хибні висновки
Синтез і управління
Синтез Стаття IX (Синтез і дорожня карта), нове Синтез повної дослідницької програми і майбутні напрями
Впровадження Eden Engineering, технічна специфікація Завершено; Цикл любові емпірично підтримано
Управління Eden Vision, філософська і політична рамка Свідчення про архітектурно залежне узгодження включено
Динаміка корекції Стаття X (Спарена ко-масштабна корекція) Теорема у мінімальній моделі: співвідношення дрейфу до корекції, а не швидкість зростання, керує довгостроковою долею; запропоновано сліпий протокол вимірювання
Реєстр збіжності Стаття XI (Збіжність) Тридцять градованих рядків незалежних прибуттів до того самого структурного принципу; жоден заголовковий підсумок не публікується, за політикою
Зовнішня валідність Стаття XII (Повторне оцінювання публічного бенчмарку) Зареєстрований протокол: маніпуляція засліпленням програми на публічному бенчмарку, який вона не контролює
Об'єднання рамок Стаття XIII (Показник самоприскорення) Позначення розв'язано; $k = \delta - 1/\alpha$ пов'язує рамки спроможності і корекції точно
Довга монографія HRIH (How to Raise an Infinite Hierarchy) Довга монографія програми, з її зареєстрованим реєстром передбачень поряд
Валідація конструкту Стаття C (PNP) Програма валідності конструктів для власних інструментів програми
Пропозиція поля Recursive Dynamics: засновницька стаття Пропоноване поле: п'ять змінних стану, три закони як названі припущення, п'ятдесят два заперечення з рішеннями, чотири результати розчинення (DOI 10.17605/OSF.IO/HCPBU)

Порядок читання

Неспеціалісти: (1) Цей стислий огляд. (2) The ARC Alignment Scaling Report (повний наратив). (3) Стаття V для найдієвішого відкриття.

Спеціалісти: (1) Цей огляд. (2) Стаття III для методології. (3) Стаття ARC для математичної рамки. (4) Eden Engineering для специфікації впровадження.

Виховуйте ШІ з турботою.

Декларація людського авторства за допомоги ШІ

Автором цієї роботи є Michael Darius Eastwood, людська істота. Кожна ключова концепція, гіпотеза, експериментальний задум, твердження і висновок у цій статті походять від людського задуму. Жодна частина цього рукопису не є повністю згенерованим виводом штучного інтелекту.

Інструменти штучного інтелекту (родина Claude від Anthropic та інші помічники на основі великих мовних моделей) використовувалися як інструменти під постійним керівництвом людини, у той спосіб, як використовують текстовий редактор, калькулятор або наукового асистента: для редагування і полірування прози, пошуку та реферування літератури (перевірено вручну за первинними джерелами), структури документа, форматування, мозкових штурмів проти визначених автором запитань та прискорення чорнового написання за визначеними автором планами й інструкціями. Уся підбірка, координація, впорядкування та остаточне редакційне рішення належать автору. Кожен змістовний вивід був переглянутий, випробуваний або перевірений автором, який бере повну відповідальність за точність і цілісність остаточного тексту. Інструменти збільшили швидкість роботи; на них ніколи не покладалися як на її джерело.

Епістемічний статус. Те, що ця програма називає Законами, є припущеннями під зареєстрованим змагальним тестом; кожна величина в цій статті операційно визначена, і статус встановленого закону ніде не заявлений. Зареєстрована програма існує, щоб заробити цей статус або втратити його через вимірювання, відтворення та пережите спростування.

© 2026 Michael Darius Eastwood. Створено людиною з комп'ютерною допомогою; повне людське авторство і моральні права стверджуються відповідно до Copyright, Designs and Patents Act 1988 і узгоджено з рекомендаціями United States Copyright Office щодо творів, які містять матеріал, згенерований ШІ; будь-який новий технічний внесок, описаний у цій роботі, був задуманий людиною-автором. Повна заява: michaeldariuseastwood.com/authorship.

Постійна обіцянка. Доведіть, що ця стаття хибна, і я сам опублікую спростування. Умови фальсифікації викладено в цій статті; постійний виклик: github.com/MichaelDariusEastwood/arc-scaling-challenge.

Супровідні статті: Стаття I | Foundational | Стаття II | Стаття III | Походження законів масштабування | IV.a | IV.b | IV.c | IV.d | Стаття V | Стаття VI | Стаття VII | Стаття VIII | Стаття IX | Eden Engineering | Eden Vision | Стислий огляд | Головний зміст

Дослідницький центр: michaeldariuseastwood.com/research | OSF: 10.17605/OSF.IO/EWN5D | Copyright 2026 Michael Darius Eastwood
читає вголос · виділяє в міру просування · перескік до будь-якого розділу

Помітили помилку в перекладі? Повідомте напряму: