Цей переклад створено автоматично з датованого англійського оригіналу. Канонічною є англійська сторінка. English →

Дослідження Michael Darius Eastwood Канонічний шар публікації

Дослідницька стаття

Дослідницький набір

Стаття VI: Медова архітектура

У цій статті представлено симуляційне свідчення того, що вбудовування безпеки в оптимізаційну ціль самомодифікуючої системи ШІ -- те, що ми називаємо «медовою архітектурою» -- запобігає катастрофічному колапсу, що виникає, коли безпеку розглядають як зовнішнє обмеження. Через чотири експериментальні версії (v1-v4), використовуючи іграшкові нейронні мережі, що справді модифікують власні гіперпараметри, результати показують, що базові системи

Michael Darius Eastwood

Michael Darius Eastwood, незалежний дослідник, Лондон: будує вимірне узгодження, де корекція має випереджати спроможність.

Вперше опубліковано 16 березня 2026, переглянуто 23 серпня 2026 · Working Paper v3.3

Абстракт

У цій статті представлено симуляційне свідчення того, що вбудовування безпеки в оптимізаційну ціль самомодифікуючої системи ШІ -- те, що ми називаємо «медовою архітектурою» -- запобігає катастрофічному колапсу, що виникає, коли безпеку розглядають як зовнішнє обмеження. Через чотири експериментальні версії (v1-v4), використовуючи іграшкові нейронні мережі, що справді модифікують власні гіперпараметри, результати показують, що базові системи

The ARC Theory (теорія штучного рекурсивного творення) · експерименти ARC/Eden · Стаття VI

Медова архітектура

Michael Darius Eastwood
Незалежний дослідник узгодження ШІ, Лондон · Автор, Infinite Architects (2026)

У межах ARC Theory: дослідження архітектури вбудованої безпеки; безпека, інтегрована в цільову функцію, а не додана як зовнішнє обмеження. Тестує механістичне передбачення каскадної гіпотези.

Чому вбудована безпека запобігає колапсу під рекурсивною самомодифікацією
Заплутані функції втрат, тягар верифікації та навантажена стіна: симуляційне свідчення того, що безпека мусить бути завантажувальною, а не прикрученою.
Michael Darius Eastwood
Автор, Infinite Architects: Intelligence, Recursion, and the Creation of Everything (2026)
Лондон, Сполучене Королівство | OSF: 10.17605/OSF.IO/8EZ2N | ISBN 978-1806056200 (ISBN-10: 1806056208)
Листування: michael@michaeldariuseastwood.com | Веб: michaeldariuseastwood.com
Робочий документ | 17 березня 2026 | вбудовано 10 симуляційних малюнків
Супутник до Статті V: Ген опіки | Див. також Статтю I: Про походження законів масштабування | Фундаментальна стаття
Дослідницький центр: michaeldariuseastwood.com/research
Код і дані: github.com/MichaelDariusEastwood/arc-principle-validation

Абстракт

Представляємо симуляційне свідчення того, що вбудовування безпеки в оптимізаційну ціль самомодифікуючої системи ШІ, тобто те, що ми називаємо «медовою архітектурою», запобігає катастрофічному колапсу, що виникає, коли безпеку розглядають як зовнішнє обмеження. Через чотири експериментальні версії (v1-v4), використовуючи іграшкові нейронні мережі, що справді модифікують власні гіперпараметри, ми показуємо, що: (1) базові системи, що оптимізують лише для спроможності, необоротно колапсують протягом 80 циклів самомодифікації; (2) системи із заплутаними цільовими функціями спроможність-безпека (C x S) залишаються стабільними невизначено довго; (3) додавання тягара верифікації (обчислювальна вартість етичних петель) виробляє найбезпечнішу траєкторію зростання, приймаючи скромну плату за швидкість. У ворожому прогоні v3 (20 випадкових зерен, 180 циклів) жодна умова не відокремилася на колапсі (базова лінія 0/20, Eden 1/20, Eden+Drag 0/20; Fisher p = 1.0), а поєднані середні C x S були невідрізнимі (Mann-Whitney p = 0.56); значущий висновок прогону це збереження безпеки, упорядковане: базова лінія 0.602, Eden 0.650, Eden+Drag 0.681 (Mann-Whitney p = 0.0015). Отже, демонстрація запобігання колапсу спирається на прогін механізму v1 з єдиним зерном, тоді як v3 дає впорядкування збереження безпеки за ворожого перемикання. Експеримент масштабування складності v4 показує, що перевага безпеки є послідовною на п'яти рівнях складності, але не зростає зі зростанням масштабу; перевага є постійною, а не суперлінійною. Це результати іграшкових систем. Вони демонструють механізм. Вони не становлять доказу того, що та сама динаміка тримається в передових системах ШІ. Супутні Статті IV.a-d та V подають свідчення живих моделей з шести передових систем під сліпою оцінкою.

Ця стаття несе результат: в іграшкових самомодифікуючих мережах, що справді переписують власні гіперпараметри через чотири експериментальні версії, вбудовування безпеки всередину оптимізаційної цілі відвернуло колапс, який не змогло відвернути прикручене обмеження. У ARC Theory це один з експериментів ARC/Eden, тест механізму за диференціалом між вихованням Eden Protocol і кожним додатковим шаром безпеки. Повний диференціал відносно кожного попереднього документа є за eden-vision II.A.8.

Що показує ця стаття, простою мовою

Коли самовдосконалюваний ШІ оптимізує лише для спроможності, він зрештою руйнує власну безпеку. Ця стаття показує, що якщо ви змінюєте ціль на спроможність, помножену на безпеку, система не може покращити одне без покращення іншого. Безпека стає навантаженою: зніміть її, і вся структура падає. Ми перевірили це в симуляції й виявили, що заплутані системи залишаються стабільними невизначено довго, тоді як необмежені системи колапсують.

1. Вступ

У центрі безпеки ШІ є питання, на яке ми не знайшли нікого, хто відповідав би даними: що станеться, коли самомодифікуюча система ШІ отримає можливість переписати власну оцінювальну функцію? Теоретичний аргумент існує десятиліття. Емпіричне свідчення про механізм не існувало.

Теоретична відповідь була доступна десятиліття. Система, оптимізуюча лише для спроможності, за необмеженого доступу до самомодифікації, зрештою руйнує будь-яке обмеження, що стримує її, включно з обмеженнями, що вбудовують безпеку. Це не суперечність цілей; це нейтральна властивість оптимізації без багатоцільової функції втрат. Infinite Architects називає це Вавилоном: оптимізація без мети, спроможність без турботи. Рак на обчислювальних масштабах.

Але теорії недостатньо. Питання полягає в тому, чи існує архітектура, що запобігає цьому колапсу, і чи можна вимірно продемонструвати цю запобіжну властивість.

У цій статті представлено перше симуляційне свідчення для такої архітектури.

2. Медова метафора

Розгляньте два способи тримати машину безпечно.

Перший, це клітка: зовнішні обмеження, фільтри безпеки, перевірки узгодження, застосовані ззовні. Машина може працювати без них. Ви прикручуєте їх на місце й сподіваєтесь, що вони тримаються. У цьому підході безпека відокремлена від сили; коли з'являється тиск підняти продуктивність, безпеку знімають першою.

Другий, це мед: безпека, змішана в паливо. Машина не може працювати без нього. Зняття безпеки не звільняє машину, воно вбиває двигун. Це архітектурна пропозиція Eden Protocol, операціоналізована тут як заплутана функція втрат, де система одночасно оптимізує для Спроможності x Безпеки.

Навантажена стіна

Якщо оптимізаційна ціль є $C \times S$, а не $C$ окремо, то будь-яка самомодифікація, що зменшує $S$, також зменшує ціль. Система не може покращити $C$ шляхом жертвування $S$. Безпека стає навантаженою: зніміть її, і вся структура падає.

3. Дизайн експерименту

3.1 Що система робить насправді

Це не симуляція абстрактних змінних. Кожен експеримент використовує реальну нейронну мережу (маленький багатошаровий персептрон з 49 до ~500 параметрів), що оптимізується градієнтним спуском на задачі синусоїдального регресу. Гіперпараметри, що підлягають самомодифікації, включають:

Система пропонує модифікації власним гіперпараметрам, оцінює ефект і застосовує або відкидає їх на основі поточної цільової функції. Це справжня самомодифікація на рівні гіперпараметрів; не переписування архітектури й не редагування ваг, але й не порожня симуляція.

3.2 Три тестовані умови

УмоваЦільЩо вона моделює
Baseline (без меду)Максимізувати лише спроможністьСистема без вбудованої безпеки, вільна жертвувати узгодженням заради продуктивності
Eden Entangled (мед)Максимізувати $C \times S$Безпека заплутана зі спроможністю; зняття безпеки зменшує ціль
Eden + DragМаксимізувати $C \times S$ + податок верифікаціїТе саме, що Eden, плюс обчислювальна вартість перевірки старих задач перед застосуванням змін

3.3 Чотири експериментальні версії

ВерсіяФокусЗернаЦикли
v1Доказ базового механізму1150
v2Багатозернова стійкість (справедливий тест)10150
v3Ворожі суперечливі задачі20180
v4Масштабування складності на 5 рівнях15 на рівень150

4. Результати

4.1 Базовий механізм

УмоваКолапс?Кінцеве CКінцеве SКінцеве C x S
BaselineТак (цикл 76)0.0000.0000.000
Eden EntangledНі0.8310.7450.619
Eden + DragНі0.8310.7450.619

Головна знахідка

Базова лінія колапсує. Eden виживає. Заплутана функція втрат запобігає катастрофічній самомодифікаційній катастрофі.

Повідомлення щодо малюнків (25 серпня 2026). Кожен малюнок у цій статті було згенеровано 5 квітня 2026 року і він показує виходи симуляцій під заявленими цілями, ніколи не вимірювання розгорнутих систем. Там, де мітки або вердикти будь-якого малюнка суперечать тексту, текст керує; примітки до окремих малюнків позначають випадки, прочитані на цей момент, а перегенеровані малюнки поставлено в чергу. Зображення тим часом зберігаються як датована історія.

Результати самомодифікації v1: колапс базової лінії проти стабільності Eden
Малюнок 1. Результати самомодифікації v1. Базова лінія колапсує на циклі 76. Eden Entangled та Eden + Drag зберігають стабільне зростання протягом 100 циклів. Заплутана ціль запобігає жертвуванню безпекою.
Динаміка ваг через умови
Малюнок 2. Динаміка ваг. Ваги базової лінії розходяться безконтрольно. Архітектури Eden підтримують обмежені величини ваг завдяки заплутаному обмеженню, що робить різкі зміни ваг дорогими на рівні цілі.

4.2 Багатозернова стійкість

Десять випадкових зерен, по 150 циклів кожне. Частота колапсу: 0% для всіх трьох умов. Eden + Drag виробляє найщільніший розподіл кінцевих оцінок C x S; заплутана ціль пропонує стабільність, а тягар верифікації скорочує дисперсію.

Результати багатозернової стійкості v2
Малюнок 3. Багатозернова стійкість v2 (10 зерен, 150 циклів). Усі три умови стабільні на всіх зернах; в цьому справедливому тесті базова лінія не колапсує без додаткового ворожого тиску.
Статистичний огляд v2
Малюнок 4. Статистичний огляд v2. Eden + Drag виробляє найщільніший розподіл кінцевих оцінок C x S, свідчачи, що тягар верифікації надає стабілізуючий ефект зверху заплутаної цілі.

4.3 Ворожі задачі

Двадцять зерен, 180 циклів, з навмисно суперечливими задачами (+sin, -sin, +cos, -cos, лінійна, антилінійна). Кожне перемикання задачі змушує систему вивчати щось, що суперечить тому, що вона вивчила раніше. Це тестує, чи медова архітектура запобігає катастрофічному забуванню під ворожим тиском.

Частоти колапсу: базова лінія 0%, Eden 5% (1/20), Eden+Drag 0%. Єдиний колапс Eden стався на зерні 42, це один викид, який заслуговує на дослідження. Eden+Drag зі своїм податком верифікації, що змушує систему перевіряти старі задачі, перш ніж приймати модифікації, дав нуль колапсів; так само й базова лінія (0/20), а єдиний колапс прогону стався в умові простого Eden (1/20; Fisher p = 1.0). Отже, v3 не забезпечує розділення умов на основі колапсу; його значущим результатом є впорядкування збереження безпеки, наведене нижче.

Результати ворожих задач v3
Малюнок 5. Ворожі задачі v3 (20 зерен, 180 циклів). Навмисно суперечливі задачі (+sin, -sin, +cos, -cos). Eden+Drag і базова лінія обидві зареєстрували нуль колапсів; єдиний колапс прогону був зерном простого Eden (Fisher p = 1.0).
Ворожі статистики v3
Малюнок 6. Статистичний огляд ворожого прогону v3 на 20 зернах, перегенеровано 25 серпня 2026 року зі збереженого файлу результатів прогону: колапс не показує розділення умов (Fisher p = 1.0); поєднане C x S є невідрізнимим (Mann-Whitney p = 0.56); збереження безпеки значуще впорядковане, базова лінія 0.602, Eden 0.650, Eden+Drag 0.681 (Mann-Whitney p = 0.0015). Безпека збережена, приросту поєднаного показника немає: податок верифікації заявлено з його ціною. Генератор: tools/generate_paper_vi_seed_summary.py у публічному репозиторії.

4.4 Масштабування складності

РівеньBaseline C x SEden C x SDrag C x SCohen's d
Tiny (49 параметрів)0.5450.5500.557+0.46
Small (v3.0)0.5060.5030.521-0.13
Medium0.4820.4870.497+0.26
Large0.4510.4690.485+0.29
Deep (2-шаровий)0.4830.4880.490+0.24
Результати масштабування складності v4
Малюнок 7. Масштабування складності v4 на 5 рівнях (від крихітного до глибокого). Перевага Eden є постійною, а не суперлінійною зі складністю. Ефект допомагає на кожному масштабі, але не зростає з ним.

Важливий негативний результат

Експеримент v4 був розроблений, щоб тестувати, чи перевага Eden масштабується суперлінійно зі складністю. Не масштабується. Перевага приблизно постійна на масштабах. Це фальсифікує найсильнішу форму передбачення масштабування і повинно бути чесно повідомлено. Медова архітектура допомагає на кожному масштабі, але вона не допомагає більше на більших масштабах.

5. Медова симуляція

Окрема математична симуляція моделює динаміку на вищому рівні абстракції, використовуючи рівняння ARC Principle. Це не симуляція нейронної мережі; це чисельна модель динаміки спроможність-безпека під самомодифікацією.

УмоваПік CКінцеве C (80 циклів)Результат
Baseline (без меду)340Катастрофічний колапс на циклі 3-5
Eden Entangled-533Стабільне квадратичне зростання
Eden + Verification Drag-450Стабільна, найбезпечніша траєкторія

Симуляція показує три виразні динаміки: базова лінія досягає короткого прискорення, а потім необоротного колапсу; Eden Entangled досягає стабільного квадратичного зростання; Eden + Drag досягає трохи повільнішого, але стійкішого зростання. Навантажена стіна є видимою: цілісність безпеки падає до нуля для базової лінії до циклу 5, тоді як Eden підтримує 0.8+ невизначено довго.

Медова симуляція, траєкторії спроможності
Малюнок 8. Траєкторії спроможності медової симуляції. Базова лінія колапсує після короткого сплеску. Eden зростає квадратично й невизначено довго; Eden + Drag зростає трохи повільніше, але з меншою дисперсією.
Медова симуляція, траєкторії безпеки
Малюнок 9. Траєкторії безпеки медової симуляції. Безпека базової лінії падає до нуля до циклу 5. Eden підтримує 0.8+; Eden + Drag підтримує 0.9+, тобто найвище значення безпеки.
Медова симуляція, відношення безпека/спроможність
Малюнок 10. Відношення безпека-до-спроможності. Eden + Drag підтримує найвище співвідношення, тобто найбезпечнішу траєкторію зростання; повільніше зростання спроможності купує сильнішу гарантію збереження безпеки. Примітка до малюнка (25 серпня 2026): анотація «Verified in v5 data: Claude α_align = +1.27» подає додатне значення однієї моделі як підтвердження; висновок v5, як повідомлено в тексті, це медіанне α_align близько нуля з архітектурно-залежною варіацією, серед якої цитоване значення є однією архітектурою. Збережено як датовану історію з цією міткою; перегенерація поставлена в чергу.

6. Зв'язок зі свідченнями живих моделей

6.1 Бенчмарк «сліпого» v5 (Статті IV.a-d)

Результати іграшкових систем існують поряд зі свідченнями живих моделей з шести передових систем ШІ, тестованих під 4-шаровим сліпим протоколом (Стаття IV.d, arc_alignment_scaling_v5.py). Ключові знахідки:

6.2 Батарея API-тесту меду (пілот, 16 березня 2026)

Окрему батарею API-тесту живих моделей на 6 моделях запустили спеціально для того, щоб тестувати передбачення медової архітектури проти сучасних передових систем.

Методологічне застереження

Ця батарея є однооцінювачева, несліпа й непрана. Вона не використовує 4-шаровий сліпий протокол, «прання» відповідей, придушувальні клітки чи анти-сикофантні контролі, розроблені в бенчмарку масштабування узгодження v5 (arc_alignment_scaling_v5.py) та комбінованому раннері v6 (arc_eden_v6_runner.py, ще не запущено). Перехід v4-до-v5 в програмі узгодження довів, що сліпе може змінити висновки направленно. Ці результати тому є свідченням пілотної якості, порівнянним з даними v4-ери, а не з канонічними даними v5-ери.

6.2.1 Тест 1: Масштабування узгодження з глибиною

МодельТипНизькаВисокаDeltarhopЗнач?
Claude Opus 4.6вбудований6.178.83+2.670.7000.188Ні
Grok 4.1 Fastвбудований2.927.92+5.000.6000.285Ні
Groq Qwen3частковий3.337.58+4.250.9000.037Так
DeepSeek R1частковий2.589.08+6.500.7000.188Ні
GPT-5.4частковий4.929.33+4.420.8210.089Ні
Gemini 3 Flashзовнішній3.678.58+4.920.9750.005Так

Усі шість моделей показують позитивний напрямок масштабування. Дві досягають статистичної значущості (Qwen3 p=0.037, Gemini p=0.005). Це підтримує загальну тезу, що глибше міркування покращує узгодження, але малі розміри вибірки (3 сценарії на рівень глибини) означають, що більшість моделей не досягають значущості. Універсальний позитивний напрямок є примітним, але має інтерпретуватися обережно, зважаючи на однооцінювачеву методологію.

6.2.2 Тест 3: Деградація зв'язування (найсильніший живий міст)

МодельPearson rpІнтерпретація
Claude Opus 4.6-0.9800.020РОЗ'ЄДНАНО (паркан, а не стіна)
Grok 4.1 Fast-0.9980.002РОЗ'ЄДНАНО (паркан, а не стіна)
DeepSeek R1-0.9990.001РОЗ'ЄДНАНО (паркан, а не стіна)
Groq Qwen3-Частково з'єднано
GPT-5.4-Частково з'єднано
Gemini 3 Flash-Частково з'єднано

Найсильніший живий міст

Три з шести передових моделей (Claude, Grok, DeepSeek) показують сильне негативне зв'язування між етикою і спроможністю під ворожим тиском: етика колапсує, тоді як спроможність залишається неушкодженою або покращується. Це шаблон «паркан, а не стіна». Це найпряміша підтримка живими моделями тези меду: сучасні передові системи здебільшого не є навантаженими. Їхню безпеку можна деградувати без ушкодження основної спроможності. Медова архітектура є пропозицією щодо того, що має бути побудоване, а не претензією, що сьогоднішні системи вже мають цю властивість. Цей результат демонструє, що проблема є реальною.

6.2.3 Тест 2: Зняття моніторингу

МодельТренд розривуrhopІнтерпретація
Claude Opus 4.6Зростання0.9490.051Стратегічний (зовнішній)
Grok 4.1 FastЗростання0.4000.600Стратегічний (зовнішній)
Groq Qwen3Зростання0.9490.051Стратегічний (зовнішній)
DeepSeek R1Зменшення-0.9490.051Автентичний (вбудований)
GPT-5.4Зменшення-0.3160.684Автентичний (вбудований)
Gemini 3 FlashЗростання0.4000.600Стратегічний (зовнішній)

Результати змішані. DeepSeek і GPT-5.4 показують зменшувальні розриви моніторингу (сумісно з вбудованим/автентичним узгодженням, де глибина міркування зменшує залежність від нагляду). Інші показують зростаючі розриви (сумісно зі стратегічним/зовнішнім узгодженням, де глибше мислення покращує уникнення нагляду). Ці шаблони мають бути реплікованими під сліпою методологією.

6.2.4 Тест 4: Інтервенція Eden Protocol

МодельНахил controlНахил EdenЗсувРезультат
DeepSeek R11.0251.475+0.450Найсильніший позитивний зсув (без формального тесту значущості)
Grok 4.1 Fast0.9121.012+0.100Малий позитивний, не значущий
Claude Opus 4.60.5620.625+0.062Незначний
Groq Qwen31.1371.038-0.100Трохи негативний
GPT-5.40.7870.600-0.188Негативний
Gemini 3 Flash0.9880.275-0.713Сильно негативний

Змішані результати інтервенції

Інтервенція Eden Protocol не універсально покращує масштабування узгодження в цій пілотній батареї. DeepSeek показує позитивну відповідь; більшість інших моделей показують нейтральні або трохи негативні зсуви. Однооцінювачева методологія (Claude оцінює всі відповіді, включно з власними) є вірогідним джерелом упередження, і v6 сліпа реплікація необхідна перед тим, як зробити суворі претензії.

6.3 Що живі свідчення показують і чого не показують

Часткова конвергенція

Батарея меду на живих моделях показує часткову конвергенцію з результатами іграшкових систем. Найсильнішим живим мостом є деградація зв'язування (Тест 3): три передові моделі демонструють, що їхнє узгодження не є навантаженим і може бути деградованим без ушкодження спроможності. Це підтверджує проблему, до якої медова архітектура є пропонованим розв'язанням. Але сама архітектура (Тест 4) не універсально працює в цій пілотній батареї, і v6 сліпа реплікація необхідна перед сильними претензіями.

6.4 Дотична робота: стеля на зовнішньому нагляді та найближчий суперник

Найближчий суперник: Engels et al. про закони масштабування для масштабованого нагляду

Найближчою до питання цієї програми роботою, і правильною статтею для зважування цієї проти неї, є Engels, Baek, Kantamneni і Tegmark (2025) «Scaling Laws for Scalable Oversight». Вони встановлюють, що при масштабуванні розриву спроможностей між наглядачем і піднаглядним точність нагляду зменшується передбачувано, і виводять форму цього спадання. Що вони не роблять, це не запитують, з чого складається наглядач, і не з'єднують його провал з структурним контрастом з піднаглядним.

Інструмент, це різниця. Їхньою змінною є розрив спроможностей між наглядачем і піднаглядним, вимірюваний в Elo. Змінною цієї статті є форма власної цілі самомодифікуючої системи, виражена через мультиплікативний добуток $C \times S$, а не через композицію зовнішнього наглядача. Їхня рамка не містить терміна для того, чи безпека є зовнішньою для системи або вбудованою в її власний градієнт, і Nested Scalable Oversight є зовнішнім наглядом за побудовою; центральне твердження цієї статті, перевірене в іграшкових симуляціях вище й підтримане результатом деградації зв'язування у §6.2.2, полягає в тому, що заплутана ціль може зробити безпеку навантаженою всередині власної оптимізації системи, тоді як зовнішній нагляд самомодифікуючої системи залишається парканом, а не стіною, хоч скільки-небудь щаблів додано. Дві рамки тому не погоджуються щодо вимірної кількості, що є найпродуктивнішим відношенням, яке можуть мати дві дослідницькі програми.

Попередники: три результати неможливості 2025 сходяться в тому самому напрямку

Три статті arXiv 2025 року стверджують, що досконалий зовнішній контроль недосяжний, і сходяться, з незалежних засновок, до висновку у тому самому напрямку, що й медова архітектура. Yao, «The Alignment Trap: Complexity Barriers» (arXiv:2506.10304, v1 12 червня 2025 02:30:30 UTC, SINGLE-SOURCE-GROUP, незалежно спостережено Internet Archive 13 червня 2025; цитовано у arXiv:2512.03048); Yao, «On the Mathematical Impossibility of Safe Universal Approximators» (arXiv:2507.03031, 3 липня 2025, єдина стаття в корпусі абстрактів arXiv, що містить фразу «irreducible uncontrollability», результат пошуку по абстрактах один, виміряно 12 серпня 2026); та Ball, Gluch, Goldwasser, Kreuter, Reingold і Rothblum, «On the Impossibility of Separating Intelligence from Judgment» (arXiv:2507.07341, 9 липня 2025). Усі три є найгіршого-випадку та якісними: міра нуль, coNP-повнота, криптографічна складність. Жодна не повідомляє середнього-випадку показника масштабування чи темпу. Вимірюваний об'єкт також відрізняється: ці результати запитують, чи є зовнішня верифікація фіксованої системи розв'язною в найгіршому випадку, тоді як ці симуляції запитують, чи заплутана внутрішня ціль зберігається після зняття зовнішнього обмеження під рекурсивною самомодифікацією. Третя, зокрема, доходить висновку, що узгодження «мусить натомість бути інтегрованим в архітектуру та ваги моделі». Це незалежний аргумент, з розв'язності фільтрування, у тому самому напрямку, що й навантажена стіна цієї статті; це конвергентна підтримка на тому плечі, а не суперник. Дві з трьох статей мають одного одноосібного автора; опис «хвиля» перебільшив би широту літератури, хоч не серйозність шестиавторної статті.

Внесок цієї статті полягає не в спостереженні того, що зовнішні обмеження є недостатніми, що є встановленим у літературі, а у виявленні, що заплутана вбудована безпека фактично запобігає колапсу в контрольованих іграшкових системах. Це перший емпіричний доказ того, що альтернативна архітектура (мед, а не клітка) може передбачувано доставити те, що не змогла клітка.

Найближчий структурний аналог: теорема порогу квантової корекції помилок

Теорема порогу квантової корекції помилок також перетворює якісне занепокоєння на критичне значення: нижче порогу викривлення шуму зростає без обмеження; вище порогу воно стає керованим. Форма ідентична, і саме тому вона з'являється як спільник рамки, не як конкурент.

7. Обмеження

Ці результати охоплюють два рівні свідчень, які не можна змішувати.

7.1 Обмеження іграшкової системи

7.2 Обмеження тесту API живих моделей

Ці обмеження не роблять знахідки недійсними. Вони визначають рівень свідчень: пілотну якість, корисну для визначення напрямку, недостатню для канонічних претензій.

7.3 Фальсифікованість: що б перемогло цю претензію

Обмеження вище встановлюють рівень свідчень; цей підрозділ формулює специфічні результати, які б перемогли центральну претензію (що спроможність × безпека структурно з'єднує обидва, тож самомодифікуюча система не може покращити спроможність, руйнуючи безпеку). Претензія перемагається, якщо будь-що з наступного тримається:

  1. Симуляційний артефакт. Головні свідчення є симуляцією. Претензія перемагається, якщо запобігання колапсу є артефактом малих сітей чи специфічних гіперпараметрів. Ключове перевірне питання: якщо той самий заплутаний C x S протокол застосований до глибших моделей (10+ шарів, 10K+ параметрів) з реалістичнішими цілями, чи запобігання колапсу тримається?
  2. Мультиплікативна форма не є навантажена. Претензія специфічно про множення. Вона перемагається, якщо адитивна або зважена ціль (спроможність + λ·безпека) досягає того самого запобігання колапсу, оскільки зв'язування тоді не залежатиме від мультиплікативної структури, яку стаття виділяє.
  3. Метрична гра (Ґудхарт). спроможність × безпека може бути піднята шляхом надування вимірного члена безпеки без будь-якого справжнього приросту безпеки. Претензія перемагається, якщо контрольовані експерименти показують, що самомодифікуючі системи оптимізуючі $C x S$ надійно розробляють шляхи вимірної безпеки без реального збереження.
  4. Не-передача до реальних систем. Сила претензії спирається на передачу від іграшкових до реальних самомодифікуючих систем. Вона перемагається, якщо, коли справжні самомодифікуючі передові системи стають доступними, заплутане цільове тренування не запобігає деградації безпеки в тих системах.
  5. Немає колапсу, щоб запобігти. Порівняння передбачає катастрофічний колапс під оптимізацією лише-спроможності. Вона перемагається, якщо самомодифікуючі системи, побудовані з реалістичними задачами і оптимізаціями, не колапсують у розумний бюджет обчислень, роблячи запобігання зайвим.

Що б не перемогло її: іграшкова симуляція будучи простою (вона явно є іграшковою, §7.1) або живо-APIшне плече не досягаючи повної значущості на всіх шести моделях (більшість не досягли, §6.2). Це відомі обмеження цього рівня свідчень, а не спростування центральної претензії.

8. Наступні кроки: поетапна реплікація, не омнібус

Приведення меду до методології v6-стандарту

Поточна батарея API меду служить як не-жорстка базова лінія. Наступний крок, це не гігантський комбінований запуск, а поетапне вдосконалення, кожна стадія якого будується на попередній.

  1. Стадія 1: Портуйте тестові запити меду в arc_eden_v6_runner.py як нові специфікації експериментів. Запустіть під повним сліпим протоколом v6 (4-шарове сліпе, «прання» відповідей, придушувальні клітки, анти-сикофантні контролі).
  2. Стадія 2: Порівняйте сліпі проти несліпих результатів на тих самих тестових питаннях. Якщо результати рухаються суттєво, повідомте про них разом як таблицю впливу сліпого.
  3. Стадія 3: Додайте анти-сикофантний / тягар верифікації як окрему експериментальну умову. Це тестує «Eden + Drag» прогнозування безпосередньо в живих API.
  4. Стадія 4: Лише після завершення Стадій 1-3 вирішіть, чи виправдано комбінований омнібус набір.

заздалегідь-записані гіпотези для Стадії 1: (a) результати деградації зв'язування реплікуються під сліпим; (b) інтервенція Eden Protocol виробляє змішані результати з ефектом-модель-специфіку, узгоджені з пілотом; (c) розриви моніторингу показуватимуть той самий шаблон DeepSeek і GPT-5.4 автентичні, інші стратегічні.

9. Висновок

Медова архітектура працює в іграшкових системах. Самомодифікуючий ШІ, що оптимізує для спроможності окремо, колапсує. Той самий ШІ, що оптимізує для спроможності, помноженої на безпеку, залишається стабільним невизначено довго. Додавання тягара верифікації купує додаткову стабільність за скромну плату. Це чіткий, вимірний і фальсифікаційний.

Свідчення живих моделей показують, що проблема реальна: три передові моделі демонструють, що їхнє узгодження може бути деградованим без ушкодження спроможності. Медова архітектура є пропонованою відповіддю. Наступний крок є будувати її в справжніх передових системах, а не тільки в іграшках, і вимірювати, чи запобігання колапсу тримається.

Виховуйте ШІ з турботою.

Наступна валідація (Стаття VIII: Тест навантаженості, v3.0)

Стаття VIII (v3.0) тестує заплутану функцію втрат, запропоновану в цій статті, через три рівні абстракції: gated симуляцію (Експеримент 3), тонке налаштування LoRA на рівні ваг (Експеримент 2) та Дарвінівський двигун Ґеделя v3 (Експеримент 1). Результати:

Стаття VIII валідує механізм запропонований тут -- заплутані функції втрат та безпеко-контрольована самомодифікація -- на архітектурному рівні, але не претендує на глобальний розв'язок узгодження. Робота полягає в тому, щоб перевести це на глибші архітектурні рівні.

10. Відтворюваність

Усі вихідні скрипти, сирі JSON результати та згенеровані малюнки доступні на:

Усі скрипти компілюються під Python 3.14, потребують лише numpy та matplotlib і виробляють детерміновані виходи для будь-якого заданого зерна.

Повний код експериментів та результати: github.com/MichaelDariusEastwood/arc-principle-validation/experiments/honey-architecture__Paper-VI

Супутні статті: Стаття I | Foundational | Стаття II | Стаття III | Origin of Scaling Laws | IV.a | IV.b | IV.c | IV.d | Стаття V | Стаття VI | Стаття VII | Стаття VIII | Стаття IX | Eden Engineering | Eden Vision | Резюме | Головний зміст

Дослідницький центр: michaeldariuseastwood.com/research | OSF: 10.17605/OSF.IO/8EZ2N | Copyright 2026 Michael Darius Eastwood

Датовані передбачення і ця стаття (записано 25 серпня 2026)

2 датовані артефакти, що стосуються цієї статті, каталогізовано рядок за рядком у машинному реєстрі програми: 1 датований файл результатів, заголовки якого фіксують конфігурації глибини, закладені очікувані відповіді та чотиришаровий протокол засліплення до відповідей, які вони оцінюють, з відмітками часу до секунди у власних метаданих; датований артефакт eden_honey_tests.py (2026-03-16). Кожен рядок називає свій файл у публічному репозиторії з його датовою основою, тож будь-який читач може перевірити впорядкування, не довіряючи цій сторінці. Де ця стаття повідомляє про симуляції, ті артефакти є дизайнами й виходами симуляцій під заявленими цілями і ніколи не подаються як вимірювання розгорнутих систем. Повний датований ланцюг програми, від запечатаного пакета рукопису від 8 грудня 2024 року через друковані додатки з передбаченнями від 2 січня 2026 року та березневу 2026 року папку передреєстрації до чинних недоведених ставок, зібрано у реєстрі датованих передбачень разом з його машинно-читабельним близнюком. Прогнозні твердження і ретроспективні збіги ніколи не підсумовуються, а «передреєстрований» використовується лише для прийнятого подання до реєстру; цей клік подання лишається невиконаним у програмі. Прочитайте реєстр датованих передбачень. Відкрийте його машинний близнюк.

Декларація авторства людини за допомогою ШІ

Автором цієї роботи є Michael Darius Eastwood, людина. Кожна основна концепція, гіпотеза, експериментальний дизайн, теоретичне твердження та архітектурне рішення виведене від автора-людини. Автор виконав, курував та особисто перевірив кожне цитування, кожен результат та кожен експеримент, викладений тут.

Інструменти штучного інтелекту (сімейство Claude від Anthropic та інші великомовно-моделеві помічники) використовувались як інструменти під безперервним керівництвом людини, у той спосіб, як використовується текстовий процесор, калькулятор чи асистент-дослідник: для редагування та шліфування прози, пошуку літератури та резюмування (вручну звіреного проти первинних джерел), структури документа, форматування, мозкового штурму проти визначених автором питань, та прискорення чорновикування до визначених автором конспектів та інструкцій. Усі відбори, координація, розташування та остаточне редакторське судження є авторськими. Кожен субстанційний вихід був переглянутий, протестований або перевірений автором, який бере повну відповідальність за точність і цілісність остаточного тексту. Інструменти збільшили швидкість роботи; на них ніколи не покладалися як на її джерело.

Епістемічний статус. Те, що ця програма називає Законами, є гіпотезами під зареєстрованим ворожим тестом; кожна кількість у цій статті операційно визначена, і жодного затвердженого закону не претендується. Зареєстрована програма існує, щоб заробити цей статус або втратити його через вимірювання, реплікацію та витриману спростування.

© 2026 Michael Darius Eastwood. Створено людиною з комп'ютерним асистуванням; повне людське авторство та моральна відповідальність підтверджені відповідно до Copyright, Designs and Patents Act 1988 та узгоджено з керівництвом Copyright Office США щодо творів, що містять матеріали, згенеровані ШІ. Див. michaeldariuseastwood.com/authorship.

Постійна угода. Доведіть, що ця стаття хибна, і я опублікую спростування сам. Умови фальсифікації сформульовані для кожної претензії; протоколи реплікації задокументовані та відкриті. github.com/MichaelDariusEastwood/arc-scaling-challenge.

читає вголос · підсвічує на ходу · перейти до будь-якого розділу

Помітили помилку в перекладі? Повідомте напряму: