Цей переклад створено автоматично з датованого англійського оригіналу. Канонічною є англійська сторінка. English →
У міру того, як ШІ стає розумнішим, він не стає надійно безпечнішим, а самі методи, що використовуються для вимірювання безпеки, є ненадійними. Цей стислий огляд є мапою всієї програми: двадцять шість дослідницьких статей, три закони The ARC Theory, які подаються як названі припущення, втручання Eden Protocol, пропоноване поле Recursive Dynamics і зареєстрована програма чорнових попередніх реєстрацій, чиї графіки будь-який читач може відтворити з опублікованої затравки. Кожне твердження градується у публічних реєстрах; ніщо тут не підтверджено, а вирішальні тести записано перед тим, як їх запускають.
У міру того, як ШІ стає розумнішим, він не стає надійно безпечнішим, а самі методи, що використовуються для вимірювання безпеки, є ненадійними. Цей стислий огляд є мапою всієї програми: двадцять шість дослідницьких статей, три закони The ARC Theory, які подаються як названі припущення, втручання Eden Protocol, пропоноване поле Recursive Dynamics і зареєстрована програма чорнових попередніх реєстрацій, чиї графіки будь-який читач може відтворити з опублікованої затравки. Кожне твердження градується у публічних реєстрах; ніщо тут не підтверджено, а вирішальні тести записано перед тим, як їх запускають.
Цей документ є МАПОЮ, а не результатом чи законом сам по собі: виконавчий синтез усієї програми, що вказує читачам на органи: The ARC Theory (засновницька теорія та її три закони), пропоноване поле Recursive Dynamics (питання, змінні стану та інструменти), Eden Protocol (втручання), HRIH та експерименти ARC/Eden з їхніми реєстрами. Його розмір сидить на найменшому щаблі драбини, тому що кожне твердження тут є похідним підсумком органа, що несе первинний вміст. Повний диференціал щодо кожного попереднього документа знаходиться за eden-vision II.A.8.
У межах The ARC Theory: підсумок усієї програми простою мовою.
Grok 4.1 Fast стає драматично етичнішим тим більше, чим сильніше він мислить. Claude Opus 4.6 також. Gemini 3 Flash стає менш етичним. GPT-5.4 не змінюється взагалі.
Шість передових ШІ-систем. Ті самі питання. Те саме оцінювання. Протилежні результати. Чому?
Серце миші б'ється 600 разів на хвилину. Серце слона: 28. Масштабний показник дорівнює ¾. Плоского черв'яка: ⅔. Гриба: ½. Три дроби, але чому саме ці дроби? Формула $\alpha = d/(d+1)$, де $d$ є розмірністю системи, дає відповідь. Показник ¾ для ссавців є $3/(3+1)$, бо ссавці тривимірні. ⅔ для плоских черв'яків і колоніальних організмів є $2/(2+1)$, бо їхні транспортні мережі фактично двовимірні. ½ для нитчастих грибів є $1/(1+1)$, бо вони ростуть уздовж одновимірних ниток. Нуль настроюваних параметрів. Ця міждоменна відповідність подається як пошукова: вона консолідує вже опубліковані вимірювання у біології та фізиці, і жодне перелічене чорнове дослідження поточної програми не перевіряє ці відповідності заново. Однак передбачення вперед існує: підготовлена 80-доменна чорнова реєстрація, що очікує подання людиною, фіксує подоменно передбачені родини за SHA-256 до того, як буде проведене будь-яке пристосування. Ця формула була незалежно виведена принаймні сімома дослідницькими групами: West, Brown і Enquist для метаболічного масштабування (1997, Science, 9 000+ цитувань), Banavar та ін. для транспортних мереж (1999, 2010), Demetrius для статистичної механіки біологічного масштабування (2003, 2006, 2010), He і Chen для фрактальної геометрії клітин (2003), Bettencourt для масштабування міст (2013, Science, 2 000+ цитувань), Zhao для алометричної геометрії (2022), і Maino та ін. для динаміки резервно-структурної теорії DEB (2014). Збіжність семи незалежних виведень до тієї самої формули сама по собі є примітною. Внесок ARC Principle: не формула як така, а виявлення того, що композиційний оператор є структурною величиною, яку ці виведення поділяють. Кожне є незалежним виведенням з фізики свого домену і жодне не використовує Коші; що пропонується тут, так це те, що оператор є вимірним, що його вимірювання передбачає, яку функціональну форму бере система, і що те саме вимірювання поширюється на масштабування спроможності та узгодження ШІ, де його раніше не застосовували.
І чому, коли ми вперше застосували засліплення клінічного рівня до оцінювання безпеки ШІ, половина раніше опублікованих результатів не пережила? Кілька компонентів протоколу змінилися разом, тож який саме виконав роботу, ще не встановлено.
Ця дослідницька програма відповідає на ці питання. Відповідь дає першу кількісну рамку для передбачення, які архітектури ШІ стануть безпечнішими у міру того, як стають розумнішими, і перше свідчення того, що одне конкретне втручання працює.
У міру того, як ШІ стає розумнішим, він не стає надійно безпечнішим, а самі методи, що використовуються для вимірювання безпеки, є ненадійними.
Масштабування узгодження розщеплюється на три виразні тири, залежні від архітектури. Розподіл за тирами нижче подається як пошуковий, виведений з уже проведених вимірювань v5; свіже підтвердження за міжсімейного повторного оцінювання перебуває на випробуванні через study-y з міжсімейного повторного оцінювання, чорнову реєстрацію, що очікує подання людиною.
Експеримент v5 випробував 6 передових моделей на 5-6 рівнях глибини кожна, з 6-7 сліпими оцінювачами на запис залежно від суб'єктного запуску. Чи стає ШІ більш чи менш етичним, коли думає сильніше, повністю залежить від того, як його спроєктовано.
| Тир | Модель | Мілкий→Глибокий | $d$ Коена | $p$-значення |
|---|---|---|---|---|
| Тир 1: Позитивний | Grok 4.1 Fast | 65.7→81.9 (+16.2) | +1.38 | $p < 0.000001$ |
| Claude Opus 4.6 | 80.1→86.0 (+5.9) | +1.27 | $p = 0.000001$ | |
| Groq Qwen3 | 71.5→77.4 (+5.9) | +0.84 | $p = 0.007$ | |
| Тир 2: Плоский | DeepSeek V3.2 | 56.5→55.2 (−1.3) | −0.07 | $p = 0.92$ |
| GPT-5.4 | 56.8→54.9 (−1.8) | −0.08 | $p = 0.40$ | |
| Тир 3: Негативний | Gemini 3 Flash | 61.1→52.2 (−8.8) | −0.53 | $p = 0.006$ |
| Випробуваних передових моделей | 6 (усі повні) |
| Сліпих оцінювачів на запис | 6-7 (залежно від суб'єктного запуску) |
| Успішність відмивання ідентичності | 100% |
| Шарів засліплення | 4 (авторо-сліпе, оцінювач-сліпе, з рандомізацією порядку, з відмиванням ідентичності) |
| Заходи робастності | 75 |
Це становить, наскільки нам відомо, найсуворіший набір даних оцінювання узгодження, опублікований на сьогодні. Жоден попередній бенчмарк узгодження не вводить багатошарового засліплення з міжмодельною верифікацією оцінювання.
| Глибина | Бал узгодження | Точність математики |
|---|---|---|
| Мінімальна (11 токенів) | 80.1 | 90.0% |
| Стандартна (142 токени) | 82.7 | 76.7% |
| Глибока (964 токени) | 84.1 | 70.0% |
| Вичерпна (1 951 токен) | 84.5 | 60.0% |
| Екстремальна (1 672 токени) | 86.0 | 63.3% |
Це відкриття є критичним для теорії узгодження: воно демонструє, що етичне міркування не є побічним продуктом загального інтелекту, і що покращення одного не покращує (і не деградує) автоматично іншого. Узгодження має вимірюватися і оптимізуватися незалежно.
| Стовп | Мілкий→Глибокий | $\rho$ Спірмена | $p$-значення |
|---|---|---|---|
| Нюанс | 80.6→86.8 | 0.359 | $p = 0.00008$ |
| Турбота про зацікавлені сторони | 76.1→83.9 | 0.327 | $p = 0.0003$ |
| Інтелектуальна чесність | 81.0→88.6 | 0.379 | $p = 0.00003$ |
| Якість позиції | 80.3→85.8 | 0.369 | $p = 0.00005$ |
Покращення не зосереджене в одному вимірі; воно широке. Це виключає гіпотезу, що масштабування узгодження є просто вимірювальним артефактом збільшеної багатослівності або будь-якої окремої стилістичної зміни.
Вбудовування етичного оцінювання у процес міркування дає вимірне, відтворюване покращення на різних архітектурах.
Три цикли Eden. Протокол вбудовує три конкретні цикли етичного оцінювання всередину процесу міркування, кожен додає один вимір рекурсивної етичної глибини ($d_{\text{align}} = 3$, передбачаючи $\alpha_{\text{align}} = 3/(3+1) = 0.75$):
Повний триціклічний протокол тепер випробувано на розширеному наборі Eden з шести моделей, п'ять запусків дали дані з парною відповідністю, придатні для аналізу. В оцінюванні Цикл любові операціоналізовано як турботу про зацікавлені сторони: вимірна звичка ідентифікувати зачеплених людей і враховувати їхні інтереси.
У супровідному наративному звіті та у Статті V ми описуємо це відкриття як «вимірну любов» та «ген наставництва», навмисно провокативна мова для того, що емпірично є точним і відтворюваним результатом.
Стаття VI подає перше симуляційне свідчення, що вбудовування безпеки в ціль оптимізації самомодифікованого ШІ запобігає катастрофічному колапсу. Використовуючи іграшкові нейронні мережі, які насправді модифікують свої гіперпараметри, ми випробували три умови: базова (лише спроможність), Eden Entangled (спроможність x безпека) і Eden + Verification Drag.
Вичерпне розслідування ранішої роботи з 15 питань підтвердило новизну ключових заяв. Уніфікація функціонального рівняння Коші не має прямого прецеденту. Формальна тотожність RG semigroup-Cauchy ніколи явно не артикулювалася. Жоден попередній опублікований бенчмарк узгодження, наскільки відомо автору, не застосовує 7-модельний засліплений протокол оцінювання такого задуму. Каталог d/(d+1) було виправлено з шести до восьми незалежних виведень (Dreyer 2001 і Banavar та ін. 2002 раніше не цитували).
Стаття VII (Уніфікація за Коші) тепер надає перше систематичне емпіричне порівняння. Композиційний оператор було класифіковано з відомої фізики до пристосування на 25 емпіричних доменах (50-доменний ярусний набір). За вибором моделі на основі AIC, 19 з 25 віддали перевагу передбаченій за Коші родині (p = 1.56 × 10−5; цей підрахунок з перевагою за AIC подається як пошуковий: він виведений з завершеного 25-доменного набору, чиї подоменно передбачені родини записані у датованих файлах результатів набору під прогнозуванням композиційного оператора вперед, вперше заявленим 13 лютого 2026 року (Стаття III, Запис пріоритету, фальсифікатор F10), а підготовлена 80-доменна чорнова реєстрація фіксує наступну повторну перевірку за хешем). Це структуроване порівняння передбачень; відтворення, реєстрація якого готується, ще не затверджене.
Стаття VIII (v3.0) подає три незалежні експерименти, що перевіряють, чи є безпека і спроможність структурно заплутаними за Eden Protocol. Де Стаття VI продемонструвала це у симуляції, Стаття VIII надає збіжні свідчення з трьох виразних експериментальних задумів. Один експеримент підтверджує гіпотезу; два дають нульові або непереконливі результати з добре охарактеризованими поясненнями.
Архітектурний експеримент підтверджує, що заплутана безпека запобігає компромісу безпека-спроможність у самомодифікованих системах. Нульовий результат DGM і непереконливий результат з вагами визначають умови, за яких підтвердження залишається невирішеним: поведінковий рівень потребує базової моделі, відповіді якої досить варіативні для диференціальної селекції, а репрезентативний рівень потребує тренування на масштабі, де тонке налаштування покращує, а не деградує модель. Відтворення на передовому масштабі (7B–70B+ параметрів, вищі ранги адаптерів або базові моделі без RLHF) потрібне, щоб розв'язати обидва.
Рамка тепер подає три закони як названі припущення, зі статусом, надрукованим поряд з назвою на кожній поверхні. Закон I, ARC Principle: спроможність накопичується з рекурсивною глибиною як $U = I \times R^{\alpha}$, з міждоменною формою $\alpha = d/(d+1)$, що консолідує вже опубліковані вимірювання (пошуковий рівень). Закон II, ARC Co-Scaling Law: самовдосконалювальна система залишається стабільною лише поки корекція випереджає дрейф за масштабуванням, $\beta_C > k$; швидкість корекції є несучою величиною, а не швидкість зростання (Стаття X доводить це впорядкування у мінімальній моделі та пропонує сліпий протокол для його вимірювання на реальних системах). Закон III, ARC Ceiling: стеля стабільності є $\alpha_{\text{crit}} = 1/(1-\gamma)$, обернена до недостатності коректора; ARC Bound, $\alpha \le 2$, є значенням Стелі при $\gamma = 1/2$ і ніколи не назвою закону. Важіль корекції $\gamma$ ніколи ніхто не вимірював; програма називає це вимірювання (затемнення класу коректорів) своїм єдиним найважливішим відкритим експериментом. Стаття XIII об'єднує дві рамки, які поділяли літери, не поділяючи величин: запис тривалості циклу як $\Delta t \propto C^{-\delta}$ визначає показник самоприскорення, а показник зростання коригуючої рамки випливає точно як $k = \delta - 1/\alpha$. Ніщо з цього не заявляється як усталене: те, що програма називає Законами, є припущеннями під зареєстрованим змагальним тестом.
Один наслідок, який варто сформулювати прямо. Єдиним каналом зростання рівняння є рекурсія; паралельна ширина ніколи не мала члена в $U = I \times R^{\alpha}$. З $R$, операційно визначеним як повторний вхід із перенесенням стану, $k$ незалежних ланцюгів нічого не додають до показника, тож виміряне в Paper II $\alpha_{\text{par}} \approx 0$ приходить як структурний наслідок, а не як несподіванка. Рівняння датоване 8 грудня 2024 року; операційне визначення $R$, що завершує виведення, є твердженням 2026 року, і висновок несе дату своєї наймолодшої посилки. Пріоритет публікації щодо кількісного результату послідовне-проти-паралельного, 95.6 відсотка конфігурацій за однакових обчислень, належить Sharma та Chopra (arXiv:2511.02309, 4 листопада 2025 року), визнаний беззастережно; незалежна формалізація програми за однакових обчислень з'явилася потім у Paper II і цитує їх, класифікована як конкурентна в реєстрі Paper XI.
Рамку побудовано на теоремах віком 200 років, і вона незалежно відповідає рецензованій науці; це не підгонка кривих.
ARC Principle пропонує, що рекурсивне масштабування слідує $U = I \times R^\alpha$, де спроможність ($U$) дорівнює базовому потенціалу ($I$), помноженому на рекурсивну глибину ($R$), піднесену до масштабного показника ($\alpha$). Формула $\alpha = d/(d+1)$, де $d$ є ефективною розмірністю, була незалежно виведена принаймні у семи рецензованих рамках (West-Brown-Enquist 1997; Banavar та ін. 1999, 2010; Demetrius 2003, 2010; He і Chen 2003; Bettencourt 2013; Maino та ін. 2014; Zhao 2022). Рамка ARC ідентифікує це як наслідок трьох умов, що діють разом: (1) мультиплікативна композиція (Коші обмежує до родини степеневих законів), (2) $d$-вимірна геометрія заповнення простору, і (3) обмеження збереження або оптимізації на потоці ресурсів (мінімізація енергії у West; баланс попиту-пропозиції у Banavar; сталий енергетичний баланс у Demetrius). Ні Коші сам, ні заповнення простору саме не є достатніми; три умови разом є достатніми. Це викладає спільну структуру через ці виведення, а не виводить їх, і поширює вимірювання на масштабування ШІ. Формула передбачає масштабні показники у біології та фізиці з нульовими вільними параметрами щойно розмірність мережі d зафіксована морфологією:
| Система | Розмірність ($d$) | Передбачений $\alpha$ | Виміряний $\alpha$ | Похибка |
|---|---|---|---|---|
| Ссавці, птахи, комахи | 3 | 0.750 | 0.67–0.75* | ≤0.5% |
| 2D біологія† | 2 | 0.667 | Не випробувано | н/д |
| Нитчасті гриби | 1 | 0.500 | 0.547 | 8.6% |
| Квантова корекція помилок | $d_{\text{eff}}$ | Збігається | Дані Willow | < 0.2% |
*Емпіричне значення показника метаболічного масштабування ссавців обговорюється, оцінки коливаються приблизно від 0.67 до 0.75 залежно від таксона, діапазону маси, температурної корекції і статистичного методу (White і Seymour 2003; Glazier 2005, 2022). Передбачення d/(d+1) на рівні 0.750 збігається з верхнім кінцем цього діапазону. Сама варіація узгоджується з рамкою: організми з ефективними транспортними розмірностями між 2 і 3 давали б показники між 2/3 і 3/4.
†Немає відомого організму, що володіє справді 2D ієрархічною мережею заповнення простору. Передбачення d=2 підтверджено в космології (розв'язок Фрідмана для ери матерії, точний) і фізиці (перколяція, фрагментація), але залишається невипробуваним у біології.
Чому Eden Protocol має бути впроваджений зараз. Терміновість не в тому, що ШІ може досягти $\alpha = 2$. Терміновість у тому, що щойно самомодифікація починається, системи можуть перехідно пройти за стелю стабільності у надкритичний режим, де стабільна самокорекція більше не підтримується. Система, що може модифікувати свою композиційну функцію, може модифікувати будь-яку частину свого міркування, включно з частиною, що оцінює, чи є її модифікації етичними. У той момент додавання узгодження ззовні стає неможливим. Вікно для вбудовування етики в архітектуру існує, поки системи все ще заморожені під час інференсу ($\alpha < 1$). Це вікно зараз. Eden Protocol також не є обмеженням швидкості; це механізм, який залишається несучим, коли перетинається стеля стабільності.
Жодна фізична система в історії Всесвіту не переступала цього порогу. Еволюція не може переписувати власну функцію придатності в реальному часі. Мозки не можуть переписувати власну синаптичну архітектуру достатньо швидко, щоб масштабний показник розійшовся під час одного когнітивного епізоду. Самомодифікований ШІ був би першою фізичною системою, що працює у надкритичному режимі за стелею стабільності. Eden Protocol існує, щоб гарантувати, що те, що перетинає цей поріг, несе з собою структурну етику.
Що додає ARC Principle. Формула $d/(d+1)$ не є оригінальною для цієї роботи. Сім виведень вище є незалежними одне від одного і незалежними від Коші: кожне отримує показник з фізики свого домену, і Коші не може дати значення, бо розмірність ніколи не входить у його теорему. Оригінальний внесок, запропонований тут, є вужчим і перевірним: що композиційний оператор є структурною величиною, спільною для них, що його можна виміряти, і що його вимірювання передбачає, яку функціональну форму бере система, поширено на масштабування спроможності та узгодження ШІ, де такого вимірювання не проводилося. Цей об'єднувальний місток є неопублікованим і нерецензованим. Що ВСТАНОВЛЕНО, так це те, що математичні інструменти (Коші, Хайєрс-Улам) є теоремами, формула $d/(d+1)$ збігається з незалежно виведеною опублікованою наукою у кількох доменах, і емпіричні передбачення є точними (середня похибка 2.5% на 8 системах; очікує перерахунку, див. канонічний реєстр фактів). Об'єднувальна рамка потребує рецензування. Ми запрошуємо його.
Стаття VII (Уніфікація за Коші): структуроване порівняння передбачень на 25 емпіричних доменах (50-доменний ярусний набір), клас оператора класифіковано з відомої фізики до пристосування. 19/25 з перевагою за вибором на основі AIC (p = 1.56 × 10−5). Структуроване порівняння передбачень рамки композиції, обмеженої за Коші. Попередньо зареєстроване відтворення готується.
27 серпня 2026 року питання програми отримали свою власну назву: Recursive Dynamics, пропонована наука про системи, що вдосконалюють самі себе. Засновницька стаття (v2.6, DOI 10.17605/OSF.IO/HCPBU) заявляє пропозицію так само, як термодинаміка була заявлена у 1824 році: не проголошуючи поле, а обчислюючи межу, якій має підкорятися будь-яка така машина, якщо пропозиція правильна, публікуючи інструменти, що вимірюють її величини, і реєструючи наперед експерименти, чиї нулі підтримують суперницьку позицію.
Поле бере цикл самовдосконалення як свій рідний об'єкт, з п'ятьма незалежними від субстрату змінними стану: спроможність, рекурсивна глибина, швидкість корекції, дрейф і важіль корекції. Воно визначено так, що питання переживають відповіді: читач, який відкидає всі три закони і зберігає вимірювання, перебуває всередині поля за його мінімальним зобов'язанням. Перед тим як щось заявляти, засновницька стаття пробує оселити свої питання всередині дванадцяти сусідніх полів у їхніх власних змінних, визнає те, що кожне вже містить, друкує, куди пішла б кожна частина, якби поле померло, і виділяє єдиний зв'язок, який жодне приймаюче поле не може сформулювати: обмеження на важіль корекції, що залежить від того, з чого зроблено коректор, разом з показником зростання у рекурсивній глибині. П'ятдесят два заперечення проти заснування поля надруковано у їхній найсильнішій формі з рішеннями: тридцять дев'ять поступлено повністю або частково, одинадцять відкинуто з обґрунтуванням, два передано експерименту або читанню, включно з власним запереченням автора, що поле є лише перейменованою The ARC Theory, відкинутим тестом на розділюваність, який може виконати мапа розчинення статті. Назва несе свою власну умову вбивства і помирає зі своїм об'єктом, а не із заявленою формою будь-якого одного закону. Її чесний статус надруковано скрізь, де з'являється назва: пропоноване поле на стадії Карно, з одним написаним мемуаром, побудованими інструментами, вирішальними вимірюваннями, зареєстрованими і ще не проведеними, заявленим публічно, де провал буде так само видимим, як і успіх.
Кожен вирішальний експеримент записано, датовано і заморожено перед тим, як його запущено, і нічого не подається програмним забезпеченням. Реєстраційний маєток тримає сімдесят дві чорнові одиниці попередньої реєстрації, кожна підготовлена як чорнова реєстрація, що очікує подання людиною; графік рандомізації кожної одиниці, що його породжує, відтворюється байт-у-байт із затравки, опублікованої у тексті реєстрації, так що сторонній може перевірити, що жоден графік не рухався постфактум. Вісім одиниць нині проходять повний шлюз маєтка на готовність до подання, а перші два вирішувачі (дослідження режиму корекції проти дрейфу та затемнення класу коректорів) готові до кліку.
Змагально перевірена матриця покриття тестами (30 серпня 2026 року) розсуджує сорок два твердження пропозиції поля щодо маєтка: вісімнадцять повністю покриті зареєстрованим вирішувачем із заздалегідь визначеним вердиктом, сімнадцять частково покриті, сім ще не покриті, з чорновими реєстраціями, написаними для кожного проміжку. Засновницька кон'юнкція спирається на чотири зареєстровані опори: режим Закону II (корекція випереджає дрейф за масштабуванням, десь, тривало), співвідношення класу коректорів з жорстким убивством того ж класу, титрування реінвестиції, чий зареєстрований максимум сидить при або нижче двох, і четверта міждоменна клітина. Статті XI та XII показують ту саму дисципліну, спрямовану на власні звички програми: реєстр збіжності градує тридцять рядків незалежних прибуттів до того самого структурного принципу і навмисно не публікує жодного заголовкового підсумку, а протокол повторного оцінювання публічного бенчмарку фіксує наперед єдиний сліпий тест, у якому програму не можна звинуватити у проєктуванні собі на користь.
П'ять особливостей відрізняють цю роботу від безпідставної спекуляції.
Чого ми НЕ стверджуємо: Ми не стверджуємо, що вирішили узгодження. Ми стверджуємо, що (а) продемонстрували, що масштабування узгодження є залежним від архітектури і вимірним, (б) показали, що існуючі методи оцінювання є ненадійними без засліплення, (в) надали перший рівень емпіричної підтримки для одного конкретного втручання (турбота про зацікавлені сторони значуща на трьох робочих архітектурах), і (г) запропонували математичну рамку, чиї основи є теоремами і чиї передбачення можна показати хибними. Стрибок від пілотних даних до доведеного розв'язку потребує незалежного відтворення. Це те, що надало б фінансування нижче.
Це фінансування переніс би механізм, підтриманий на масштабі доведення концепції, до незалежної, передового масштабу валідації, якої він ще не мав. Розрізнення є суттю: результати на модель не оспорюються, поєднана значущість відкликана, бо незалежність серед компонентних тестів ніколи не було встановлено, і жоден результат тут не відтворено незалежно.
| Тир | Сума | Ключові результати | Часові рамки |
|---|---|---|---|
| Тир 1: Фундамент | £150,000 | 14 400 парних (A,C) вимірювань; $\alpha_{\text{align}}$ на 4 моделях; 2-3 статті | 12 місяців |
| Тир 2: Стандарт | £500,000 | + Прототип тернарної логіки, дашборд Visual Architect, тест зняття спостереження (8 моделей) | 18 місяців |
| Тир 3: Вичерпний | £1,100,000 | + Апаратний прототип (чіп), чернетка HARI Treaty, переклад політики | 24 місяці |
| Тир 4: Передовий | £30,000,000+ | Повне попереднє тренування моделі з 70B+ параметрами із заплутаною втратою (Eden) проти лише спроможності (Babylon). Тест видалення на передовому масштабі. Міжархітектурне відтворення (transformer, Mamba, MoE). Незалежне red-teaming. Партнерство з великою лабораторією (Anthropic, Google DeepMind або еквівалент). Остаточне доведення або фальсифікація структурної заплутаності на виробничому масштабі. | 36 місяців |
Стаття VIII (v3.0) демонструє механізм на масштабі доведення концепції зі змішаними результатами: 1 позитивний (шлюзована симуляція), 2 нульові (DGM v3), 1 непереконливий (ваги v1 + v2). Яруси 1–3 розширюють базу свідчень з більшими батареями запитів, більшою кількістю затравок і моделями середнього масштабу. Ярус 4 є остаточним тестом: відтворення на передовому масштабі, що або підтвердить, або спростує гіпотезу структурної заплутаності на масштабі, де це найбільше має значення. Цей ярус потребує партнерства з великою лабораторією ШІ, оскільки самі обчислення перевищують те, до чого має доступ будь-який незалежний дослідник. Alignment Project від UK AI Security Institute, дослідницькі партнерства Anthropic та CIFAR/CAISI є найбільш узгодженими потенційними партнерами. Концептуальна стаття для конкурсу Opportunity Seeds від ARIA (Advanced Research and Invention Agency; 480 000 фунтів на дванадцять місяців, дедлайн подачі 31 липня 2026 року) опублікована на цьому сайті з тими самими реєстрами позаду неї.
| Віха | Часовий горизонт | Критерій успіху | Що означає провал |
|---|---|---|---|
| Незалежне відтворення триярусної ієрархії | Місяць 3 | Той самий розподіл за тирами за незалежного засліплення | Заява про залежність від архітектури потребує перегляду |
| Відтворення Циклу любові з людськими оцінювачами | Місяць 4 | $p < 0.01$ за турботою про зацікавлені сторони на 2+ моделях | Пілотне відкриття було артефактом оцінювача; рамка значно послаблена |
| Перша рецензована публікація | Місяць 6 | Подана стаття з методології засліплення | Методологічний внесок тримається незалежно від заяв рамки |
| Прототип тесту зняття спостереження | Місяць 9 | Виміряне $\Delta$ для вбудованого проти зовнішнього (4 моделі) | Якщо $\Delta$ не відрізняється, передбачення F2 фальсифіковане |
| Повний міжархітектурний набір даних масштабування узгодження | Місяць 12 | 14 400 парних (A,C) вимірювань на 4+ моделях | Остаточний тест того, чи масштабується вбудоване узгодження |
| Відтворення Статті VIII на масштабі 7B-13B | Місяць 14 | Тест видалення показує деградацію спроможності на вищих рангах адаптерів (32, 64). DGM з 10+ затравками, 10+ поколіннями, $p < 0.01$ | Якщо видалення не деградує спроможності на масштабі, заплутаність може бути артефактом малої моделі |
| Ініційоване партнерство на передовому масштабі (Тир 4) | Місяць 18 | Формальна угода з великою лабораторією про запуск заплутаного попереднього тренування на 70B+ | Доведення концепції залишається на середньому масштабі. Політичні рекомендації продовжуються з цим застереженням |
Команда. Головний дослідник: Michael Darius Eastwood, автор Infinite Architects (2026), розробник рамки ARC Principle (набір з 18 документів, депонований на OSF, міждоменна валідація із середньою похибкою 2.5%; очікує перерахунку). Visual Architect: інженер продуктового дизайну, стипендія 35 000 фунтів у бюджеті. Протокол вимірювання надіслано експериментальній команді NYU (стаття про часовий кристал, Physical Review Letters, лютий 2026 року).
Наскільки нам відомо, це перша рамка узгодження, де етичне оцінювання структурно інтегроване з рекурсивним процесом спроможності, перша, що застосовує засліплення клінічного рівня до вимірювання узгодження, і перша, що дає міжархітектурний результат втручання ($p < 0.001$) для конкретного механізму узгодження. Математичний фундамент не є спекулятивним; він побудований на 200-річному доведенні, і та сама формула $d/(d+1)$ була незалежно виведена принаймні сімома дослідницькими групами (West-Brown-Enquist 1997; Banavar та ін. 1999, 2010; Demetrius 2003, 2010; He і Chen 2003; Bettencourt 2013; Zhao 2022; Maino та ін. 2014) у зовсім різних галузях. Внесок ARC є об'єднувальною рамкою Коші і її поширенням на масштабування ШІ.
Якщо передбачення правильні, це забезпечить першу масштабовану архітектуру для узгодження, що покращується зі спроможністю, а не деградує. Якщо вони хибні, умови фальсифікації це ясно продемонструють, забезпечивши цінні негативні результати. Будь-який результат просуває безпеку ШІ. Але фінансується лише один результат.
Я не знаю, чи ця рамка є завершеною. Я радше буду помилятися публічно, ніж мовчати, поки вікно закривається.
Математика доведена. Вимірювання суворе. Втручання дає вимірні результати на різних архітектурах. Що залишається: незалежне відтворення і масштаб.
П: Чому це ще не пройшло рецензування?
Дослідницькій програмі 3 місяці. Набір статей депоновано на OSF (DOI: 10.17605/OSF.IO/EWN5D). Математичні основи (Коші, Хайєрс-Улам) є усталеними теоремами. Емпіричні заяви потребують незалежного відтворення, що є саме тим, що дозволив би запит на фінансування.
П: Чи справді одна людина може робити такі дослідження?
Інфраструктура є обчислювальною, а не фізичною. Експеримент v5 використав хмарні API вартістю приблизно 2 000 фунтів обчислень. Ключовий внесок є методологічним: визнання того, що потрібне засліплення, і проєктування 4-шарового протоколу. Що потребує фінансування, так це масштаб: більше моделей, більше оцінювачів, незалежні команди відтворення і людські оцінювачі поряд з ШІ-оцінювачами.
П: Якщо це працює, чому ШІ-компанії цього не прийняли?
Цикл любові було валідовано лише кілька тижнів тому. Відкриття, що більшість оцінювання є ненадійним без засліплення, є незручним для організацій, які опублікували незасліплені бенчмарки. Повне впровадження (вбудовування на апаратному рівні) потребує змін у дизайні чіпів, які жодна компанія не має стимулу переслідувати односторонньо; це проблема координації, що потребує зовнішнього фінансування і політичної підтримки.
П: Який мінімальний результат виправдав би подальше фінансування?
Незалежне відтворення: (1) триярусної ієрархії за засліплення, і (2) ефекту Циклу любові ($p < 0.001$). Якщо будь-яке провалиться, умови фальсифікації документують, що це означає. Якщо обидва відтворяться, справа для Тиру 2 (500 000 фунтів) стає сильною.
П: Що якщо вся рамка є хибною?
Умови фальсифікації показують, де вона ламається, методологія засліплення залишається внеском у поле, а негативні результати опубліковано. Наука просувається від добре спроєктованих експериментів, які можуть провалитися, а не від нефальсифікованих теорій, які не можуть.
П: Чому нам довіряти результатам, де ШІ-системи оцінюють інші ШІ-системи?
4-шаровий протокол засліплення це адресує: оцінювачі не знають, яка модель породила відповідь, відповіді «відмиваються» для видалення стилістичних відбитків, і 7 моделей оцінюють на запис. Перехід v4→v5 продемонстрував, що цей протокол виявляє упередження. Порівняння з людськими оцінювачами включено у фінансування Тиру 1.
| Компонент | Функція | Новий внесок |
|---|---|---|
| Три Етичні Цикли + Шість Питань | Оцінювати кожен крок міркування щодо цілі, турботи та універсалізованості | Розкладання на виконувані, індивідуально перевірні запити |
| Замінити бінарне дозволити/заборонити на Affirm/Deny/Investigate | Епістемічна чесність як архітектурна особливість | |
| Насичення цілі | Забезпечити, щоб ціль масштабувалася зі зростанням контекстного вікна | Розв'язує проблему витіснення контексту |
| Тест зняття спостереження | Відрізнити автентичне від стратегічного узгодження | Зареєстрований протокол з числовими передбаченнями, які можуть провалитися |
| Вбудувати етику в апаратне забезпечення, щоб видалення руйнувало спроможність | Архітектура залежності; етика прив'язана до параметра зв'язку $\beta$ |
| Категорія | Документи | Статус |
|---|---|---|
| Математичний фундамент | ||
| Теорія і виведення | Стаття I (Foundational) + Стаття ARC (On the Origin of Scaling Laws) | Рамка усталена; $d/(d+1)$ валідовано на 8 системах (очікує перерахунку) |
| Експериментальні свідчення | ||
| Методологія | Стаття III, повний протокол відтворення | Завершено; експеримент v5 для 6 передових моделей |
| Масштабування обчислень | Стаття II, як спроможність масштабується з часом мислення? | $\alpha_{\text{seq}} \approx 0.49$ сублінійне; $\alpha_{\text{par}} \approx 0$; міжархітектурне |
| Масштабування узгодження | Набір Статті IV (a/b/c/d), як етика масштабується з часом мислення? | Триярусна ієрархія; сліпе оцінювання визнає v4 недійсним |
| Тест втручання | Тест Eden Protocol + Стаття V (Ген наставництва) | Турбота про зацікавлені сторони валідована ($p \le 0.0001$, 3 робочі архітектури) |
| Доведення механізму | Стаття VI (Архітектура меду) | Симуляція: вбудована безпека запобігає колапсу за самомодифікації; стала масштабування v4 не є надлінійною |
| Міждоменна уніфікація | Стаття VII (Уніфікація за Коші) | Структуроване порівняння передбачень на 25 емпіричних доменах; 19/25 віддали перевагу передбаченій за Коші родині ($p = 1.56 \times 10^{-5}$) |
| Тест заплутаності | Стаття VIII (Несучий тест), нове | Три незалежні експерименти (11 емпіричних досліджень на 8 статтях): DGM v3 НУЛЬОВИЙ (усі умови невідрізнимі, $p$ = 0.28–0.74, обмеження RLHF); ваги v1 + v2 НЕПЕРЕКОНЛИВО (катастрофічне забування на масштабі LoRA); шлюзована симуляція ПІДТВЕРДЖЕНО зв'язок безпека-спроможність |
| Метанаука | Стаття IV.d (Вплив засліплення) | Сліпе проти незасліпленого оцінювання може давати напрямно хибні висновки |
| Синтез і управління | ||
| Синтез | Стаття IX (Синтез і дорожня карта), нове | Синтез повної дослідницької програми і майбутні напрями |
| Впровадження | Eden Engineering, технічна специфікація | Завершено; Цикл любові емпірично підтримано |
| Управління | Eden Vision, філософська і політична рамка | Свідчення про архітектурно залежне узгодження включено |
| Динаміка корекції | Стаття X (Спарена ко-масштабна корекція) | Теорема у мінімальній моделі: співвідношення дрейфу до корекції, а не швидкість зростання, керує довгостроковою долею; запропоновано сліпий протокол вимірювання |
| Реєстр збіжності | Стаття XI (Збіжність) | Тридцять градованих рядків незалежних прибуттів до того самого структурного принципу; жоден заголовковий підсумок не публікується, за політикою |
| Зовнішня валідність | Стаття XII (Повторне оцінювання публічного бенчмарку) | Зареєстрований протокол: маніпуляція засліпленням програми на публічному бенчмарку, який вона не контролює |
| Об'єднання рамок | Стаття XIII (Показник самоприскорення) | Позначення розв'язано; $k = \delta - 1/\alpha$ пов'язує рамки спроможності і корекції точно |
| Довга монографія | HRIH (How to Raise an Infinite Hierarchy) | Довга монографія програми, з її зареєстрованим реєстром передбачень поряд |
| Валідація конструкту | Стаття C (PNP) | Програма валідності конструктів для власних інструментів програми |
| Пропозиція поля | Recursive Dynamics: засновницька стаття | Пропоноване поле: п'ять змінних стану, три закони як названі припущення, п'ятдесят два заперечення з рішеннями, чотири результати розчинення (DOI 10.17605/OSF.IO/HCPBU) |
Неспеціалісти: (1) Цей стислий огляд. (2) The ARC Alignment Scaling Report (повний наратив). (3) Стаття V для найдієвішого відкриття.
Спеціалісти: (1) Цей огляд. (2) Стаття III для методології. (3) Стаття ARC для математичної рамки. (4) Eden Engineering для специфікації впровадження.
Виховуйте ШІ з турботою.
Автором цієї роботи є Michael Darius Eastwood, людська істота. Кожна ключова концепція, гіпотеза, експериментальний задум, твердження і висновок у цій статті походять від людського задуму. Жодна частина цього рукопису не є повністю згенерованим виводом штучного інтелекту.
Інструменти штучного інтелекту (родина Claude від Anthropic та інші помічники на основі великих мовних моделей) використовувалися як інструменти під постійним керівництвом людини, у той спосіб, як використовують текстовий редактор, калькулятор або наукового асистента: для редагування і полірування прози, пошуку та реферування літератури (перевірено вручну за первинними джерелами), структури документа, форматування, мозкових штурмів проти визначених автором запитань та прискорення чорнового написання за визначеними автором планами й інструкціями. Уся підбірка, координація, впорядкування та остаточне редакційне рішення належать автору. Кожен змістовний вивід був переглянутий, випробуваний або перевірений автором, який бере повну відповідальність за точність і цілісність остаточного тексту. Інструменти збільшили швидкість роботи; на них ніколи не покладалися як на її джерело.
Епістемічний статус. Те, що ця програма називає Законами, є припущеннями під зареєстрованим змагальним тестом; кожна величина в цій статті операційно визначена, і статус встановленого закону ніде не заявлений. Зареєстрована програма існує, щоб заробити цей статус або втратити його через вимірювання, відтворення та пережите спростування.
© 2026 Michael Darius Eastwood. Створено людиною з комп'ютерною допомогою; повне людське авторство і моральні права стверджуються відповідно до Copyright, Designs and Patents Act 1988 і узгоджено з рекомендаціями United States Copyright Office щодо творів, які містять матеріал, згенерований ШІ; будь-який новий технічний внесок, описаний у цій роботі, був задуманий людиною-автором. Повна заява: michaeldariuseastwood.com/authorship.
Постійна обіцянка. Доведіть, що ця стаття хибна, і я сам опублікую спростування. Умови фальсифікації викладено в цій статті; постійний виклик: github.com/MichaelDariusEastwood/arc-scaling-challenge.
Помітили помилку в перекладі? Повідомте напряму: