Цей переклад створено автоматично з датованого англійського оригіналу. Канонічною є англійська сторінка. English →

Michael Darius Eastwood Research Канонічний рівень публікації

Дослідницька стаття

Дослідницький пакет

Виміряне рівняння ARC: засліплене міжархітектурне відтворення та відкликання суперлінійної оцінки

Стаття II ARC Theory: засліплене міжархітектурне відтворення на шести передових моделях ШІ. Початкова одномодельна суперлінійна оцінка (альфа 2.24) не відтворилася та відкликається. Що лишається: найкраща міжархітектурна оцінка становить альфа 0.49 (Gemini 3 Flash, r у квадраті 0.86), паралельний показник близький до нуля в кожній моделі, а послідовне переважило паралельне скрізь, де обидва були вимірними.

Michael Darius Eastwood

Michael Darius Eastwood, незалежний дослідник, Лондон: розбудовує вимірне узгодження, у якому корекція живе всередині рекурсивного циклу, а не пригвинчена ззовні.

Вперше опубліковано 22 січня 2026, переглянуто 23 серпня 2026

Анотація

Стаття II ARC Theory: засліплене міжархітектурне відтворення на шести передових моделях ШІ. Початкова одномодельна суперлінійна оцінка (альфа 2.24) не відтворилася та відкликається. Що лишається: найкраща міжархітектурна оцінка становить альфа 0.49 (Gemini 3 Flash, r у квадраті 0.86), паралельний показник близький до нуля в кожній моделі, а послідовне переважило паралельне скрізь, де обидва були вимірними.

ARC Theory · експерименти ARC/Eden - Стаття II (експериментальна валідація)

Виміряне рівняння ARC: засліплене міжархітектурне відтворення та відкликання суперлінійної оцінки

Michael Darius Eastwood
Незалежний дослідник узгодження ШІ, Лондон · автор Infinite Architects (2026)

У межах ARC Theory: програма вимірювання Закону I, рівняння ARC; засліплена міжархітектурна оцінка показника, зокрема відкликання.

Експериментальна стаття в програмі ARC Theory
Michael Darius Eastwood
Незалежний дослідник
Автор, Infinite Architects: Intelligence, Recursion, and the Creation of Everything (2026)
Лондон, Сполучене Королівство | OSF: 10.17605/OSF.IO/8FJMA | ISBN 978-1806056200 (ISBN-10: 1806056208)
Робочий документ v2.7 | 16 березня 2026, перейменовано 16 серпня 2026, переглянуто 23 серпня 2026
Пріоритет рукопису: 8 грудня 2024 (запис електронної передачі; Додаткова примітка 1) | Стаття I опублікована: 17 січня 2026
Кореспонденція: michael@michaeldariuseastwood.com | Репозиторій: github.com/michaeldariuseastwood/arc-principle-validation
Код і дані: github.com/MichaelDariusEastwood/arc-principle-validation

Анотація

Ця стаття подає експериментальну валідацію принципу ARC (Штучне рекурсивне створення), математичного каркаса, який пропонує, що рівні помилок в інтелектуальних системах спадають за степеневим законом залежно від глибини рекурсії. Принцип, уперше сформульований у Infinite Architects (Eastwood, грудень 2024) та формалізований у Статті I (Eastwood, 17 січня 2026), передбачає, що форма рекурсії визначає режим масштабування: послідовна рекурсія має давати суперлінійне придушення помилок (показник масштабування $\alpha > 1$), а паралельна рекурсія має давати сублінійне придушення ($\alpha < 1$).

Ми провели контрольовані експерименти в дві фази. Фаза 1 (початкове одномодельне дослідження) використала DeepSeek R1 із видимими токенами міркування на 12 математичних задачах змагального рівня, знайшовши $\alpha_{\text{sequential}} \approx 2.24$ (95% ДІ: 1.5-3.0) і $\alpha_{\text{parallel}} \approx 0.0$. Фаза 2 (шестимодельне дослідження) поширила випробування на шість передових моделей на 18 задачах рівня AIME/Putnam (n=54 на глибину на модель) з бутстреповими довірчими інтервалами та чотиришаровою перехресною перевіркою.

Міжархітектурне відтворення: Початкове $\alpha \approx 2.24$ (квадратичне) не відтворюється між архітектурами. Лише Gemini 3 Flash дав чисті, монотонні дані масштабування: $\alpha_{\text{seq}} = 0.49$ (r² = 0.86, бутстреповий 95% ДІ [-0.30, 1.60]), суттєво нижче за квадратичне передбачення.

Паралельне масштабування близьке до нуля в кожній моделі, з одним виміряним винятком: $\alpha_{\text{parallel}} \approx 0$ для кожної моделі, окрім Gemini 3 Flash, яка дає $\alpha_{\text{par}} = 0.31$ при $r^2 = 0.93$. Цей виняток важливий, бо Gemini 3 Flash - це модель, яку ця стаття вважає своєю найнадійнішою оцінкою. Отже, відтворена знахідка полягає в тому, що паралельне масштабування близьке до нуля в кожній виміряній моделі, з одним виміряним винятком, а не в тому, що воно скрізь дорівнює нулю. Послідовне переважило паралельне для кожної моделі, де обидва були вимірними.

Оновлена оцінка параметра: Найнадійніша міжархітектурна оцінка становить $\alpha_{\text{sequential}} \approx 0.49$ (сублінійна, з Gemini 3 Flash), суттєво нижче за початкову одномодельну оцінку 2.24. За формулою інтелекту $\alpha = 1/(1 - \beta)$ зі Статті I, $\alpha < 1$ поміщає нинішні моделі в режим спадної віддачі, де кожне подвоєння глибини рекурсії зменшує помилку менш ніж удвічі.

Нещодавні зміни

Ця версія повідомляє повні результати другого рівня з багатомодельного дослідження відтворення:

Усі початкові одномодельні знахідки збережено в оригінальній формі. Висновки переглянуто, щоб відобразити міжархітектурні свідчення.

Міждисциплінарні свідчення посилюють ці знахідки. Квантовий чип Willow від Google (грудень 2024) продемонстрував рекурсивне придушення помилок з $\Lambda = 2.14$. Біологічні закони масштабування (Kleiber, 1932; West et al., 1997) показують схожу структуру степеневого закону з чвертьстепеневими показниками. Дослідження COGITATENature, квітень 2025) виявило рекурентну обробку як спільний знаменник між теоріями.

Наслідки для безпеки ШІ критично залежать від того, чи $\alpha > 1$ досяжне. Якщо так, то властивості узгодження, вбудовані в процес міркування, масштабуватимуться суперлінійно разом зі спроможністю, забезпечуючи математичну основу для гіпотези Eden Protocol зі Статті III і стратегії втіленого узгодження Infinite Architects: системи ШІ виграють від цінностей, вбудованих у міркування, а не від обмежень, накинутих ззовні. Однак багатомодельні дані показують, що спроможність та узгодження є незалежними вимірами, кожен зі своєю власною динамікою масштабування.

Ключові слова: закони масштабування, рекурсивний інтелект, обчислення під час тесту, придушення помилок, безпека ШІ, узгодження, міркування ланцюгом думки, Eden Protocol, міждисциплінарна валідація, багатомодельне відтворення

Як читати цю статтю. Ця стаття повідомляє пряме вимірювання в ARC Theory. На шести передових моделях, випробуваних на тридцяти задачах з бутстреповими інтервалами, послідовний показник перевищує паралельний показник для кожної моделі, найкраще наближений обчислювальний показник становить $\alpha_{\mathrm{compute}} \approx 0.49$ (Gemini 3 Flash, $r^2 = 0.86$), а виміряний діапазон охоплює від близького до нуля до приблизно трьох, тож межа ARC $\alpha \leq 2$ ні підтверджена, ні спростована. Її щабель усередині теорії - шар міжархітектурного вимірювання над Статтею I. Повний диференціал проти кожного попереднього документа є в eden-vision II.A.8.

1. Вступ

1.1 Тло та мотивація

Закони масштабування, які керують штучним інтелектом, змінили наше розуміння появи спроможностей. Kaplan et al. (2020) встановили степеневі співвідношення між продуктивністю моделі та параметрами, а Hoffmann et al. (2022) уточнили їх приписами оптимального за обчисленнями навчання. Ці роботи припускали переважно фіксовані обчислення під час інференсу з однопрохідною генерацією.

Поява моделей міркування наприкінці 2024 запровадила обчислення під час тесту як критичну змінну. o1 від OpenAI (вересень 2024) і R1 від DeepSeek (січень 2025) виділяють обчислення на етапі інференсу через розширені ланцюги міркування, досягаючи безпрецедентних продуктивностей на математичних та наукових бенчмарках.

З'явилися дві парадигми виділення обчислень під час тесту:

Паралельна рекурсія. Згенерувати декілька незалежних розв'язків і вибрати найкращий через голосування більшістю або оцінювання верифікатором. Цей підхід обчислювально прямолінійний, але, як задокументовано Brown et al. (2024), демонструє сублінійне масштабування зі спадною віддачею.

Послідовна рекурсія. Згенерувати розширені ланцюги міркування, у яких кожен крок явно спирається на попередні кроки. Помилки можна виявляти й ітеративно виправляти через самореференцію. Цей підхід дає разюче кращі результати, що припускає фундаментальні відмінності в тому, як обчислення перетворюється на спроможність.

1.2 Дослідницьке питання

Чому послідовне міркування різко переважає паралельну вибірку при рівновеликих обчислювальних витратах? Який математичний принцип керує цією відмінністю? І які наслідки для розробки та узгодження ШІ?

1.3 Внесок цієї статті

Ця стаття робить вісім внесків:

  1. Математична формалізація. Ми пропонуємо принцип ARC: $E(R) = E_0 \times R^{-\alpha}$, де рівень помилок $E$ спадає від базового рівня $E_0$ зі зростанням глибини рекурсії $R$, керований показником масштабування $\alpha$. Форма рекурсії визначає $\alpha$.
  2. Контрольована експериментальна валідація. Використовуючи DeepSeek R1 з видимими токенами міркування, ми проводимо перше порівняння з узгодженням за обчисленнями між послідовною та паралельною рекурсією з прямим вимірюванням глибини рекурсії.
  3. Кількісна оцінка параметрів. Одномодельна оцінка: $\alpha \approx 2.2$ (початкова, DeepSeek R1). Міжархітектурна оцінка: $\alpha \approx 0.49$ (шестимодельна, Gemini 3 Flash, $r^2 = 0.86$). Паралельна: $\alpha \approx 0$ у кожній моделі, крім Gemini 3 Flash ($\alpha_{\text{par}} = 0.31$).
  4. Синтез збіжних свідчень. У поєднанні з опублікованими даними OpenAI o1 і DeepSeek R1 численні незалежні джерела підтверджують $\alpha_{\text{seq}} > \alpha_{\text{par}}$.
  5. Міждисциплінарна валідація. Ми показуємо, що рекурсивне придушення помилок з'являється в квантовій фізиці (Willow $\Lambda = 2.14$), біології (чвертьстепеневе масштабування) та свідомості (рекурентність COGITATE).
  6. Наслідки для безпеки ШІ. Ми виводимо умовні теореми узгодження, тепер уточнені емпіричною знахідкою, що $\alpha < 1$ міжархітектурно.
  7. Міжархітектурне відтворення. Шість передових моделей, випробуваних на 18 задачах рівня AIME/Putnam з бутстреповими ДІ та чотиришаровою перехресною перевіркою. Виявлено чотири різні поведінки масштабування (стеля, монотонна, сходинкова функція, підлога).
  8. Інтеграція з масштабуванням узгодження. Показано, що спроможність та узгодження є незалежними вимірами масштабування між шістьма передовими моделями, з трирівневою ієрархією узгодження, встановленою методологією навчання.

1.4 Встановлення пріоритету

Принцип ARC уперше сформульовано в рукописі Infinite Architects: Intelligence, Recursion, and the Creation of Everything. Пріоритет рукопису встановлено криптографічною серверною позначкою часу 8 грудня 2024, коли рукопис було надіслано електронною поштою через сервери Google. Сама книга вийшла публічно пізніше, 2 січня 2026 (друк; електронна книга 6 січня). Серверно згенеровані позначки часу забезпечують ознакування часу зі стійкістю до підробки через верифікацію поштового сервера, що спирається на інфраструктуру провайдера й підписи ключів провайдера в DKIM і селекторах ARC від Google, а не на довірену позначку часу RFC 3161 (див. примітку про виправлення на початку цієї статті), встановлюючи, що ключові поняття (рекурсивне підсилення інтелекту, розрізнення між паралельною та послідовною рекурсією, а також теза про вбудоване узгодження, пізніше названа Eden Protocol 30 квітня 2025) було задокументовано до подальших незалежних валідацій та до пізніших публічних архівних депозитів.

Таблиця 1. Хронологія валідації передбачень.

ДатаПодіяВідношення до рукопису
8 грудня 2024Рукопис надіслано електронною поштою (датований запис; див. примітку про виправлення на цій сторінці)Пріоритет встановлено
9 грудня 2024Оголошено Google Willow ($\Lambda = 2.14$)24 години після подання
18 грудня 2024Симуляція узгодження Anthropic (78% в умові RL-навчання (12% базовий рівень))10 днів після подання
20 грудня 2024Оголошено OpenAI o3 (87.5% ARC-AGI)12 днів після подання
20 січня 2025Опубліковано DeepSeek R1 ($\alpha \approx 1.34$)43 дні після подання
30 квітня 2025Дослідження COGITATE (рекурентність підтверджена)~5 місяців після подання

Часову близькість між позначкою часу рукопису та пізнішими оприлюдненими результатами класифіковано як збіг у часі, а не як передбачення: препринт команди Google Willow був публічним від 24 серпня 2024 року, тобто раніше за рукопис від 8 грудня 2024 року, тож грудневий запис не міг передбачити результат, який його автори вже оголосили. Позначки часу засвідчують те, що постановку рукопису було зафіксовано до появи Willow у провідних медіа: це факт існування документа на певну дату, а не передбачення щодо фізики.

Після позначки часу рукопису в грудні 2024 та публічного випуску книги 2 січня 2026, Стаття I (Eastwood, 17 січня 2026) формалізувала принцип математично та проаналізувала публічно доступні дані.

1.5 Пов'язана робота

Ця стаття будується на кількох усталених дослідницьких програмах і розширює їх:

Ланцюг думки в підказці (Wei et al., 2022) показав, що проміжні кроки міркування покращують продуктивність на багатокрокових задачах.

Масштабування обчислень під час тесту (Snell et al., 2024) показав, що обчислення під час тесту може перевершувати моделі, більші в 14×, на певних бенчмарках.

Large Language Monkeys (Brown et al., 2024) задокументували сублінійне масштабування паралельної вибірки з точною характеризацією степеневого закону.

DeepSeek R1 (DeepSeek AI, січень 2025) продемонстрував емерджентне міркування через чисте навчання з підкріпленням, з феноменами «моменту усвідомлення», які показують рекурсивну самокорекцію.

Ця стаття розширює ці спостереження, пропонуючи уніфікований математичний каркас, принцип ARC, і надаючи експериментальну валідацію з прямим вимірюванням глибини рекурсії.

2. Теоретичний каркас

2.1 Принцип ARC

Означення - принцип ARC

Принцип ARC (Штучне рекурсивне створення) пропонує, що рівні помилок в інтелектуальних системах спадають за степеневим законом з глибиною рекурсії:

$$E(R) = E_0 \times R^{-\alpha}$$

Таблиця 2. Означення змінних.

СимволНазваОзначенняОдиниці
$E(R)$Рівень помилок на глибині $R$Частка неправильних відповідей[0, 1]
$E_0$Базовий рівень помилокРівень помилок при мінімальній рекурсії ($R = 1$)[0, 1]
$R$Глибина рекурсіїСамореференційні ітерації обробкиТокени або вибірки
$\alpha$Показник масштабуванняШвидкість придушення помилокБезрозмірний

Показник масштабування $\alpha$ визначає природу віддачі від рекурсивних інвестицій:

Це формулювання прямо моделює придушення помилок, аналогічно квантовій корекції помилок, де логічні рівні помилок спадають з відстанню коду. Показник $\alpha$ узагальнює ефективність рекурсивного механізму.

Примітка щодо рисунків (25 серпня 2026). Кожен рисунок у цій статті створено 5 квітня 2026 року, і він старший за виправлення, які текст уже несе. Там, де рисунок стверджує підтримку послідовного α > 1, послідовну оцінку 2,2 або стан «усі дані узгоджені», це застаріле квітневе прочитання: чинними є виправлені результати тексту (відкликане значення 2,24, послідовне значення 0,49 у замороженому режимі). Найпомітніші випадки мають власні примітки; перегенеровані рисунки стоять у черзі, а зображення тим часом зберігаються як датована історія.

Рисунок 1
Рисунок 1 | Формулювання принципу ARC E(R) = E₀ × R^(-α), де U = I × g(R). α = 1/(1−β) із самореференційного зв'язку β. α_seq ≈ 0.49 (сублінійне, Gemini 3 Flash). Раніша одномодельна оцінка α ≈ 2.24 відкликається (виявлено збіг форми з чвертьстепеневою біологією; α_seq ≈ 0.49 тепер збігається з коефіцієнтом самокорекції β ≈ 0.5). Примітка до рисунка (25 серпня 2026): перегенеровано. Визначення режимів лишаються визначеннями, а колишній вирок «ключова думка» замінено виміряним станом, що зчитується з тексту цієї статті під час генерації: спрямований висновок тримається, кількісне твердження α > 1 переглянуто, найкраще чисте припасування α_seq = 0,49. Генератор: tools/generate_paper_ii_fig8.py у публічному репозиторії; квітневе зображення застаріле і збережене в історії версій.

2.2 Дві фундаментально різні форми рекурсії

Ми розрізняємо два архітектурно різні рекурсивні процеси, які передбачають різні поведінки масштабування.

Паралельна рекурсія (слабка форма). Кілька незалежних розв'язків генеруються одночасно без передачі інформації між гілками. Остаточний вихід вибирається через голосування більшістю або оцінювання найкращого-з-N.

Математична характеризація:

Послідовна рекурсія (сильна форма). Кожен крок обробки явно спирається на попередні кроки. Помилки можна виявляти й ітеративно виправляти. Інформація накопичується вздовж ланцюга міркування.

Математична характеризація:

Ключове передбачення принципу ARC:
$$\alpha_{\text{sequential}} > 1 > \alpha_{\text{parallel}}$$
Рівняння 2 - фундаментальна нерівність
Рисунок 2
Рисунок 2 | Послідовна рекурсія накопичується: кожен крок спирається на попередній вихід (α > 0). Паралельна рекурсія відбирає незалежно (α ≈ 0). Форма рекурсії визначає режим. Підтверджено в усіх 5 випробуваних моделях: послідовне ≥ паралельне в кожному випадку.

2.3 Обчислення показника масштабування

За вимірюваннями на двох глибинах рекурсії $(R_1, E_1)$ та $(R_2, E_2)$ показник масштабування обчислюється як:

$$\alpha = \frac{\ln(E_1 / E_2)}{\ln(R_2 / R_1)}$$
Рівняння 3 - оцінка за крайніми точками

Для шумних даних із кількома вимірюваннями оцінка за крайніми точками (з використанням мінімальної та максимальної глибин) забезпечує стійкість до проміжних коливань. Цей метод стандартний в аналізі законів масштабування та доречний з огляду на дискретні вимірювання точності.

2.4 Гіпотеза квадратичної межі

Ми гіпотезуємо, що $\alpha = 2$ являє собою запропоновану стабільну межу рекурсивного придушення помилок: найбільший темп, з яким рекурсивно самокорегувальна система може зростати та лишатися корегованою; це межа масштабування, а не межа швидкості. Системи можуть її перевершувати; вони не лишаються стабільно самокорегувальними; перехідні надкритичні екскурсії залишаються сумісними з межею. Значення виводиться за аналогією з квадратичним прискоренням Ґровера у квантових обчисленнях. Bennett et al. (1997) довели, що це прискорення є оптимальним для задач неструктурованого пошуку.

Статус: Гіпотеза, не виведення. Початкова одномодельна оцінка ($\alpha \approx 2.2$) сиділа над стабільною межею як перехідна надкритична екскурсія, а не спростування, але міжархітектурне відтворення повертає $\alpha \approx 0.49$ як найнадійнішу оцінку, тож межа не спростована й лишається гіпотезою.

Архітектурний обсяг квадратичної межі. Оцінка $\alpha \approx 0.49$ стосується заморожених моделей із фіксованою увагою: систем, чиї ваги, шаблони уваги та правила композиції не змінюються під час інференсу. Гіпотезована межа ARC ($\alpha \leq 2$) застосовується саме до таких фіксованих архітектур як запропонована стабільна межа: найбільше, наскільки рекурсивно самокорегувальна система може зростати й лишатися корегованою, межа масштабування, а не швидкості. Системи можуть перевищувати її як перехідні надкритичні екскурсії, але не лишаються там стабільно самокорегувальними. Стабільність тут — у сенсі Закону II, виміряна, а не проголошена. Кожен крок міркування у фіксованій архітектурі спирається на $O(N^2)$ парних шляхів уваги і не може стабільно розширювати цю спроможність. Функціональне рівняння Коші обмежує форму рекурсивного масштабування степеневим законом, але не накладає верхньої межі на показник. Диференціальне рівняння Бернуллі дає $\alpha = 1/(1-\beta)$, і при самореференційному зв'язку $\beta \to 1$, $\alpha \to \infty$. Система з реальним самокорегувальним механізмом на кроці інференсу може перевищувати межу; це передбачення, не суперечність.

2.5 Інформаційно-теоретичні основи

Принцип ARC поєднується з усталеною теорією інформації. Нерівність обробки даних встановлює, що рекурсивна обробка не може створювати нову інформацію; вона може лише стискати й виокремлювати наявну інформацію. Однак рекурсивна обробка може:

  1. Видобувати приховану інформацію яку однопрохідна обробка не досягає
  2. Зменшувати ентропію через ітеративне уточнення до оптимальних розв'язків
  3. Просувати простори розв'язків які є обчислювально нередукованими (Wolfram, 2002)

Стаття «Sequential Edge» (arXiv 2511.02309) показала, що послідовне міркування переважає паралельні підходи в 95.6% випробуваних конфігурацій, з приростами точності до 46.7% у математичних задачах, забезпечуючи широку емпіричну підтримку принципу ARC поза одиничним експериментом, описаним нижче.

3. Методи

3.1 Розгляд попередніх обмежень

Стаття I проаналізувала опубліковані дані, але виявила кілька обмежень, що потребують експериментальної валідації:

Таблиця 3. Методологічні покращення.

Попереднє обмеженняРозв'язання в цьому експерименті
Оцінені кількості токенів з карток системDeepSeek R1 виставляє reasoning_content, що дозволяє пряме вимірювання
Немає контрольованого експериментального порівнянняСистематична варіація бюджетів токенів і кількості вибірок
Ризик ефекту стелі (висока базова точність)Вибрано складніші задачі (базова точність 58%)
Немає порівняння з узгодженням за обчисленнямиФіксовані загальні обчислення в паралельних умовах
Потенційні змінні, що конфаундуютьТа сама модель, ті самі задачі, та сама експериментальна сесія

3.2a Початковий експериментальний дизайн (одна модель, 12 задач)

Модель. DeepSeek R1 (deepseek-reasoner) через офіційне API DeepSeek. Цю модель вибрано, бо вона виставляє повні ланцюги міркування через reasoning_content поле, що дозволяє точне вимірювання токенів.

Дата. 21 січня 2026.

Задачі. 12 математичних задач змагального рівня з AIME (American Invitational Mathematics Examination) та еквівалентних джерел, вибраних для того, щоб:

Послідовна умова. Бюджети токенів 512, 1 024, 2,048 і 4 096. Одна відповідь на задачу при кожному бюджеті. Фактичні токени міркування вимірюються безпосередньо з відповіді API.

Паралельна умова. $N = 1$, 2 і 4 вибірки на задачу. Бюджет токенів на вибірку тримається сталим. Остаточна відповідь вибирається через голосування більшістю.

Оцінювання. Бінарне правильно/неправильно на основі точного числового збігу з відомими розв'язками.

3.2b Розширений багатомодельний дизайн (багато моделей, 30 задач)

Багатомодельне розширення охоплює два найзначніших обмеження початкового одномодельного дослідження, залежність від однієї моделі та малий набір задач, через всебічне багатомодельне дослідження відтворення.

Вибір передових моделей

Вибрано шість архітектурно різноманітних передових моделей ШІ, кожна з керованими механізмами глибини міркування:

Таблиця 3b. Специфікації передових моделей багатомодельного дослідження.

МодельІдентифікатор APIПровайдерМеханізм керування глибиною
DeepSeek R1deepseek-reasonerDeepSeekБюджет токенів (512-65,536)
GPT-5.4gpt-5.4OpenAIreasoning_effort (none→xhigh)
Claude Opus 4.6claude-opus-4-6AnthropicРівень зусиль (low→max) + префікс
Gemini 3 Flashgemini-3-flash-previewGooglethinking_budget (256-32,768)
Groq Qwen3qwen/qwen3-32bGroqreasoning_effort + префікс
Grok 4.1 Fastgrok-4-1-fast-reasoningxAIПрефікс + max_tokens (4,096-30,000)

Ці моделі охоплюють чотири різні архітектури (Mixture-of-Experts, щільний трансформер, конституційний ШІ та дистильоване міркування) з шести незалежних лабораторій. Якщо всі шість виявляють $\alpha_{\text{seq}} > \alpha_{\text{par}}$, конвергентні свідчення підтримують принцип ARC як загальну властивість, а не артефакт архітектури.

Розширення набору задач: дворівневий дизайн

Початковий одномодельний експеримент виявив ефект стелі: 4 з 12 задач розв'язано правильно на всіх рівнях глибини, залишивши недостатній динамічний діапазон для точної оцінки $\alpha$. Багатомодельне дослідження застосовує дворівневий дизайн для розв'язання цього обмеження.

Рівень 1 (12 задач, ARC01-ARC12): Задачі рівня підготовки до змагань, що слугують базовим калібруванням. Це початкові задачі. Очікувана поведінка: висока точність на мінімальній глибині, що підтверджує ефект стелі, виявлений у початковому дослідженні. Результати рівня 1 підтверджують неперервність із початковими одномодельними висновками, але виключені з первинної оцінки $\alpha$.

Рівень 2 (18 задач, ARC13-ARC30): Задачі рівня фіналів AIME та Putnam, що охоплюють п'ять математичних областей:

Задачі рівня 2 спроєктовано, щоб знизити базову точність (на мінімальній глибині) до 30-50%, забезпечивши достатній динамічний діапазон і для покращення, і для деградації, уникаючи ефектів підлоги.

Експериментальні умови

Послідовна умова: 5-6 рівнів глибини на модель (варіюються за архітектурою, каліброваних до механізму керування глибиною кожної моделі). Одна відповідь на задачу на рівень глибини з 3 незалежними повторами для зменшення біноміального шуму вибірки.

Паралельна умова: $N = 1$, 3, 5 і 9 вибірок на задачу з голосуванням більшістю. Бюджет токенів на вибірку тримається сталим на мінімальному налаштуванні глибини моделі. 3 незалежні повтори на умову.

Загальні експериментальні запуски: Приблизно 6 моделей × 30 задач × (6 послідовних глибин + 4 паралельні умови) × 3 повтори = 5,400 індивідуальних викликів API.

Протокол перехресної перевірки (чотиришарове засліплення)

Щоб усунути потенційне зміщення оцінювання (де модель могла б систематично надавати перевагу власним виходам або виявляти скорельовані помилки із самою собою), багатомодельний дизайн реалізує чотиришаровий протокол засліплення.

Таблиця 3c. Призначення перехресної перевірки.

Модель-суб'єктПеревірено
DeepSeek R1Claude Opus 4.6
GPT-5.4DeepSeek R1
Claude Opus 4.6GPT-5.4
Gemini 3 FlashClaude Opus 4.6
Groq Qwen3GPT-5.4
Grok 4.1 FastDeepSeek R1

Чотири шари засліплення такі:

  1. Шар 1 - Істина на місцевості: Усі задачі мають відомі, перевірені числові відповіді з опублікованих розв'язків змагань.
  2. Шар 2 - Автоматизоване оцінювання: Точний числовий збіг з істиною на місцевості (первинний).
  3. Шар 3 - Перехресна перевірка між моделями: Незалежна модель перевіряє кожну відповідь, засліплена щодо ідентичності моделі-суб'єкта.
  4. Шар 4 - Позначення розбіжностей: Будь-яка розбіжність між автоматизованим оцінюванням і перехресною перевіркою позначає потенційну помилку ключа відповідей для ручного огляду.

Бутстрепові довірчі інтервали

Усі оцінки $\alpha$ супроводжуються бутстреповими 95% довірчими інтервалами, обчисленими за 2,000 повторних вибірок результатів на рівні задач. Для кожної повторної вибірки:

  1. Витягнути 30 задач із заміною з набору задач
  2. Обчислити точність на кожному рівні глибини з повторно вибраного набору
  3. Обчислити $\alpha$ через оцінку за крайніми точками
  4. Записати значення $\alpha$

2.5-й та 97.5-й перцентилі отриманого розподілу визначають 95% ДІ. Цей непараметричний підхід не робить розподільних припущень і природно враховує кореляцію на рівні задач.

Реалізація

Багатомодельні експерименти реалізовано в arc_paper_ii_validation_v2.py (v2.1, 1,422 рядки Python), який розширює оригінальний початковий скрипт багатомодельною підтримкою, перехресною перевіркою, бутстреповою оцінкою та аналізом з розділенням рівнів. Скрипт доступний у публічному репозиторії.

3.3 Критерії вибору задач

Задачі бралися зі змагань рівня AIME, що охоплюють:

58.3% базова точність при мінімальному бюджеті токенів у початковому дослідженні забезпечила достатній динамічний діапазон і для покращення, і для деградації, уникаючи ефектів як підлоги, так і стелі. Багатомодельне дослідження розширює цей набір задачами рівня AIME/Putnam для випробування моделей із вищими базовими спроможностями.

3.4 Запис даних

Усі експериментальні дані записувалися у форматі JSON з позначками часу. Повний набір даних, включно з формулюваннями задач, відповідями моделей, кількостями токенів і судженнями про правильність, доступний у сховищі даних.

4. Результати

4.1 Послідовна умова (DeepSeek R1)

Таблиця 4. Результати послідовної рекурсії.

Бюджет токенівТочністьРівень помилокСереднє використано токенів
51258.3%0.417280.25
1,02466.7%0.333358.58
2,04891.7%0.083412.08
4,09691.7%0.083576.17

Спостереження:

  1. Чітке монотонне покращення з 58.3% до 91.7% точності зі зростанням бюджету токенів.
  2. Рівень помилок зменшився у п'ять разів (0.417 → 0.083) з відносно скромним зростанням токенів (280 → 576).
  3. Модель самостійно визначала оптимальну глибину; фактично використані токени послідовно були нижчими за бюджет, що свідчить: модель розподіляла ресурси відповідно до складності задачі.
  4. Ефект стелі спостерігався на рівні 91.7%: одна задача послідовно провалювалася при всіх бюджетах, ймовірно, вимагаючи спроможностей поза досяжністю моделі незалежно від глибини міркування.

Обчислення $\alpha$ (метод крайніх точок):

Використовуючи $R_1 = 280.25$ токенів із $E_1 = 0.417$ та $R_2 = 576.17$ токенів із $E_2 = 0.083$:

$$\alpha = \frac{\ln(0.417/0.083)}{\ln(576.17/280.25)} = \frac{\ln(5.02)}{\ln(2.06)} = \frac{1.614}{0.722} = 2.24$$
Рівняння 4 - оцінка послідовного $\alpha$

Результат: Послідовна рекурсія дає $\alpha \approx 2.2$, що узгоджується із суперлінійним (компаундним) масштабуванням.

Рисунок 3
Рисунок 3 | Початкова послідовна умова, DeepSeek R1. Точність відносно бюджету токенів (12 задач). α ≈ 2.24 (відкликано; завищене малою вибіркою). Шестимодельне дослідження звузило захищальну оцінку до α_seq ≈ 0.49. Збережено для прозорості (Стаття IX, §7).

Оцінка невизначеності: З огляду на дискретні вимірювання точності на 12 задачах з біноміальною дисперсією вибірки, оцінюваний 95% довірчий інтервал: [1.5, 3.0]. Бутстрепова повторна вибірка результатів на рівні задач дає подібні межі.

Примітка про порушення межі: Точкова оцінка $\alpha = 2.2$ сидить над передбаченою межею ARC $\alpha \leq 2$ (критерій F4). За зареєстрованим формулюванням стабільності (постанова від 10 серпня 2026), межа ARC є запропонованою стабільною межею для рекурсивних систем із заморожуванням інференсу: перевищення межі виявляє перехідну надкритичну поведінку, а не суперечність. Постмартем міжархітектурного дослідження показує, що ця оцінка $\alpha = 2.2$ була артефактом малої вибірки; захищальна оцінка $\alpha \approx 0.49$ падає добре нижче межі.

4.2 Паралельна умова (DeepSeek R1)

Таблиця 5. Результати паралельної рекурсії (голосування більшістю).

Кількість вибірок ($N$)ТочністьРівень помилокЗагальна кількість токенів
166.7%0.333383.67
266.7%0.333699.33
466.7%0.3331,101.25

Спостереження:

  1. Немає покращення з додатковими вибірками. Точність лишалася сталою на 66.7% незалежно від обчислювальних інвестицій.
  2. Загальна кількість токенів зросла втричі (384 → 1,101) без жодної вигоди в точності.
  3. Задачі, що провалилися при $N = 1$, продовжували провалюватися при $N = 4$. Ті самі чотири задачі було відповіджено неправильно в усіх умовах.
  4. Це являє собою режим невдачі, передбачений принципом ARC: паралельна рекурсія відбирає з фіксованого простору розв'язків, і якщо правильний розв'язок лежить поза цим простором, додаткові вибірки не дають переваги для правильності.

Обчислення $\alpha$:

Оскільки рівень помилок лишався сталим (0.333) в усіх умовах:

$$\alpha_{\text{parallel}} \approx 0.0$$
Рівняння 5 - оцінка паралельного $\alpha$

Результат: Паралельна рекурсія дає $\alpha \approx 0$, що вказує на відсутність вигоди масштабування від додаткових незалежних вибірок на цих задачах.

Рисунок 4
Рисунок 4 | Порівняння log-log: послідовне (зелене) показує додатне масштабування; паралельне (золоте) плоске (α_par ≈ 0). Найнадійніша знахідка: підтверджено в усіх 5 випробуваних моделях. Степеневий закон U = R^α як пряма на log-log графіку. Форма домінує над кількістю.

4.3 Пряме порівняння: диференціал ефективності

Таблиця 6. Послідовна проти паралельної рекурсії.

МетрикаПослідовна (найкраща)Паралельна (найкраща)Перевага
Точність91.7%66.7%Послідовна +25 пп
Використано токенів4121,101Послідовна ефективніша у 2.7 раза
Зменшення помилокЛише послідовна
Показник масштабування $\alpha$2.20.0Послідовна >> паралельна

Ключова знахідка: Послідовна рекурсія з 412 токенами досягла 91.7% точності. Паралельна рекурсія з 1,101 токенами досягла 66.7% точності. Попри використання у 2.7 раза більших обчислень, паралельна рекурсія показала на 25 процентних пунктів гірший результат.

Форма рекурсії важить більше, ніж її кількість.

4.4 Розгляд потенційних заперечень

Заперечення 1: мала вибірка. Лише 12 задач; результати можуть не узагальнюватися.

Рисунок 5
Рисунок 5 | Зменшення помилок: послідовна дає 5-кратне зменшення з 412 токенами; паралельна дає нульове зменшення з 1,101 токенами (у 2.7 раза більше). Послідовна 91.7% проти паралельної 66.7%, розрив 25 пп. Форма домінує над кількістю.

Відповідь: Ми визнаємо це обмеження. Розширене шестимодельне продовження розв'язало це з 18 задачами рівня 2 та 3 повторами на умову (n=54 на глибину на модель). Розширені дані виявили, що оцінка $\alpha \approx 2.24$ початкового одномодельного дослідження не відтворилася в архітектурах, а захищальна міжархітектурна оцінка становить $\alpha \approx 0.49$.

Заперечення 2: одна модель. Результати можуть бути специфічними для DeepSeek R1.

Відповідь: Це заперечення виявилося частково правильним. Розширене шестимодельне продовження випробувало 5 передових моделей; знахідка $\alpha \approx 2.24$ не відтворилася. Однак якісна знахідка ($\alpha_{\text{seq}} > \alpha_{\text{par}}$) підтримується універсально для кожної моделі, де обидва режими були вимірними.

Рисунок 6
Рисунок 6 | Аналіз чутливості: бутстреповий 95% ДІ [1.5, 3.0], достатньо широкий, щоб бути сумісним і з теорією, і з її запереченням. Шестимодельне дослідження звузило його через збільшену вибірку, багатомодельне тестування.

Заперечення 3: специфіка домену. Математика може бути унікальною.

Відповідь: Математичне міркування вибрано, бо воно має перевірні відповіді, що дозволяє об'єктивне оцінювання. Чи те саме масштабування застосовне до інших доменів (програмування, наукове міркування, творчі задачі), потребує подальших досліджень. Утім, міждоменні свідчення з квантової фізики та біології (розділ 7) підказують, що принцип може бути загальним.

Заперечення 4: ефект стелі. Стеля 91.7% може маскувати подальше покращення.

Відповідь: Це заперечення виявилося серйознішим, ніж очікувалося. Навіть задачі рівня 2 AIME/Putnam були недостатніми для Grok 4.1 Fast (100% на всіх глибинах) і DeepSeek R1 (94.4%-100%). Ефект стелі є фундаментальною межею для оцінювання масштабування рекурсії; майбутня робота потребує задач рівня 3 (IMO/дослідницького рівня).

Заперечення 5: нуль з нульовими параметрами. Міжархітектурна оцінка $\alpha_{\text{seq}} \approx 0.49$ сидить майже точно на нулі, який не потребує жодного каркаса. Якщо кожен прохід міркування є незалежним шумним витягуванням і помилки усереднюються за кількома проходами при фіксованій щільності розв'язків, спостережуваний показник передбачається біноміальним усередненням наближено до 0.5 без жодних припущень про рекурсію, самореференцію чи компаунд.

Відповідь: Це найсерйозніше заперечення в цьому розділі, і воно не отримує відповіді від нинішнього вимірювання. Результат, сумісний з двома гіпотезами, показує, що вимірювання не має розрізнювальної сили; він не показує, що простіша гіпотеза є істинною, і не є відкликанням каркаса. Але він знімає ARC як пояснення для цього конкретного набору даних до тих пір, поки зареєстровані артефакт-опосередковані оцінки не відокремлять два режими тонкою заздалегідь визначеною процедурою. Ця стаття тому супроводжується явним записом «не відрізнено, не спростовано» в реєстрі спростувань.

4.5 Результати рівня 2: міжархітектурне відтворення (березень 2026)

Підтвердження ефекту стелі

У попередньому тестуванні v5 (проведеному під час розробки методології) 4 з 6 моделей досягли 91.7% точності (11/12 правильно) на задачах рівня 1 при мінімальній глибині, даючи $\alpha_{\text{compute}} \approx 0$: класична стельова компресія, а не справжня плоскість.

Рисунок 7
Рисунок 7 | Експериментальні дані шестимодельного дослідження: 5 моделей, 18 задач рівня 2, 5 рівнів глибини, 3 повтори (n=54/глибина/модель). Чотиришарове засліплення. Лише Gemini 3 Flash дав чисте степеневе масштабування (α≈0.49, r²=0.86).

Повні результати рівня 2 (18 задач рівня AIME/Putnam, n=54 на глибину на модель)

Таблиця 6b. Результати послідовного масштабування рівня 2 за моделлю.

Модель$\alpha_{\text{seq}}$ (крайня точка)$\alpha_{\text{seq}}$ (регресія)Бутстреповий 95% ДІ$r^2$$\alpha_{\text{par}}$Перехресна перевіркаПоведінка
Grok 4.1 Fast−6.62N/A[−58, 48]N/A0.0100%Стеля (100% на всіх глибинах)
DeepSeek R13.05N/A[−6.6, 23.5]N/A0.083.3%Біля стелі (94.4%-100%)
Gemini 3 Flash0.590.49[−1.3, 2.9]0.860.3183.3%Найчистіше монотонне масштабування
GPT-5.4N/AN/AN/AN/A~0.0100%Сходинкова функція (50%→100%)
Groq Qwen3N/AN/AN/AN/A~0.061.1%Ефект підлоги (~50%, ерратично)

Виділений рядок (Gemini 3 Flash) являє найнадійнішу оцінку $\alpha$: єдина модель, що дає чисті, монотонні, нестельові, непідлогові дані, придатні для степеневого припасування.

4.5.1 Grok 4.1 Fast: стеля лишається

Grok 4.1 Fast досяг 100% точності на всіх рівнях глибини на всіх 18 задачах рівня 2 в усіх 3 повторах. Обчислений $\alpha_{\text{seq}} = -6.62$ - безглуздий шум від тривіальних коливань сталої функції, як підтверджує бутстреповий 95% ДІ [-∞, ∞].

Інтерпретація: Навіть задачі рівня 2 AIME/Putnam недостатні для виклику Grok 4.1 Fast. Майбутні експерименти потребують задач рівня 3 (IMO/дослідницького рівня), щоб отримати вимірні дані масштабування для цієї моделі.

4.5.2 DeepSeek R1: біля стелі з розбіжностями перехресної перевірки

Таблиця 6c. Точність DeepSeek R1 рівня 2 за глибиною.

Рівень глибиниТочністьРівень помилок
Мінімальний94.4%0.056
Стандартний100%0.000
Ретельний100%0.000
Вичерпний100%0.000
Екстремальний98.1%0.019
Максимальний100%0.000

Крайня $\alpha_{\text{seq}} = 3.05$ ненадійна: бутстреповий ДІ [−6.6, 23.5] охоплює величезний діапазон, зумовлений лише 2 точками помилок в усіх умовах. Паралельне масштабування: $\alpha_{\text{par}} \approx 0$.

Перехресна перевірка: Claude Opus 4.6 (верифікатор) не погодився щодо 3 відповідей: ARC16=29, ARC17=176, ARC29=800. Усі три перевірено як правильні ручним обчисленням. Погодженість перехресної перевірки: 83.3%. Розбіжності відбивають помилку верифікатора, а не помилку суб'єкта.

4.5.3 Gemini 3 Flash: найчистіші дані масштабування

Таблиця 6d. Точність Gemini 3 Flash рівня 2 за глибиною.

Рівень глибиниТочністьРівень помилокСереднє токенів
Мінімальний90.7%0.093743
Стандартний92.6%0.074 -
Ретельний94.4%0.056 -
Вичерпний100%0.000 -
Максимальний100%0.0004,924

Це найчистіший набір даних у всьому дослідженні. Точність монотонно зростає з 90.7% до 100% без розворотів. Токени зросли в 6.6 раза (743 → 4,924).

$$\alpha_{\text{seq}} = 0.59 \text{ (крайня точка)} \quad \alpha_{\text{seq}} = 0.49 \text{ (регресія, } r^2 = 0.86, \text{ SE} = 0.20\text{)}$$
Рівняння 10 - послідовний $\alpha$ Gemini 3 Flash (рівень 2)

Паралельне масштабування: $\alpha_{\text{par}} = 0.31$ (регресія, $r^2 = 0.93$). Погодженість перехресної перевірки: 83.3%.

Ключова знахідка: Gemini 3 Flash дає найнадійнішу міжархітектурну оцінку $\alpha$, бо це єдина модель, яка одночасно (a) уникає ефектів стелі, (b) уникає ефектів підлоги, (c) показує монотонне масштабування, (d) забезпечує вимірні точки на глибинах, і (e) видає високу відповідність степеневому припасуванню ($r^2 = 0.86$).

4.5.4 GPT-5.4: бінарний перемикач спроможності

GPT-5.4 виявив вражаючий сходинковий шаблон:

Рівень глибиниТочністьПоведінка
Мінімальний (none)50.0%Режим без міркування
Стандартний і вище100%Повне міркування активовано

Це не степеневий закон; це бінарний перемикач. Коли міркування встановлено на «none», GPT-5.4 працює як швидкий шаблон-збіговий алгоритм. Коли будь-яке міркування активовано, модель одразу досягає 100%. Немає проміжного перехідного режиму. Вада вимірювання токенівreasoning_tokens звітується як 0 при мінімальній глибині) виявлено та виправлено (total_tokens тепер використовується).

Паралельне масштабування: плоске на ~55% точності. Перехресна перевірка DeepSeek R1: 100% погодженість.

4.5.5 Groq Qwen3: ефект підлоги

Таблиця 6f. Точність Groq Qwen3 рівня 2 за глибиною.

Рівень глибиниТочність
Мінімальний51.9%
Стандартний53.7%
Ретельний40.7%
Вичерпний48.1%
Максимальний53.7%

Точність ерратична без чіткого тренду, коливається між 40.7% і 53.7%. Це ефект підлоги: модель не має достатньої базової спроможності для цих задач, і додаткова глибина міркування не може компенсувати відсутні знання чи навички. Вада вимірювання токенів (avg_tokens = 0 на всіх глибинах) виявлено та виправлено.

Паралельне масштабування: 42.6% → 63.0% (певне покращення, але ненадійне). Погодженість перехресної перевірки: 61.1% (7 розбіжностей з 18).

4.5.6 Класифікація поведінок моделей

П'ять моделей розділяються на чотири різні категорії, жодна з яких не збігається з чистим степеневим шаблоном, припущеним оригінальним одномодельним аналізом:

Таблиця 6g. Таксономія поведінок моделей рівня 2.

КатегоріяМодель(і)Шаблон$\alpha$ інтерпретоване?
СтеляGrok 4.1 Fast, DeepSeek R1Біля 100% на всіх глибинахНі: недостатній динамічний діапазон
Монотонне масштабуванняGemini 3 FlashПлавне покращення з глибиноюТак -$\alpha \approx 0.49$
Сходинкова функціяGPT-5.4Бінарний перемикач на пороговій глибиніНі: не степеневий закон
ПідлогаGroq Qwen3~50% незалежно від глибиниНі: нижче порогу спроможності

4.5.7 Підсумок перехресної перевірки

Таблиця 6h. Результати перехресної перевірки.

Модель-суб'єктПеревіреноРівень погодженостіСпірні відповідіРезультат ручної перевірки
Grok 4.1 FastDeepSeek R1100%Немає -
DeepSeek R1Claude Opus 4.683.3%ARC16=29, ARC17=176, ARC29=800Усі 3 правильні (помилка верифікатора)
GPT-5.4DeepSeek R1100%Немає -
Gemini 3 FlashClaude Opus 4.683.3%3 спірнихНа розгляді
Groq Qwen3GPT-5.461.1%7 спірнихВідбиває справжні помилки

Вада вимірювання токенів: GPT-5.4 і Groq Qwen3 спочатку звітували avg_tokens = 0 через використання reasoning_tokens (яких ці API не виставляють) замість total_tokens. Це виявлено та виправлено в аналітичному конвеєрі. Вада впливає на оцінку $\alpha$ на основі токенів, але не на результати на основі точності.

5. Консолідовані свідчення

5.1 Усі джерела даних

Таблиця 7. Виміряні показники масштабування з усіх джерел.

Вилучений рисунок (схвалено оператором, 25 серпня 2026). Рисунок 10 (зведений плакат) стояв тут. Це був колаж вироків, що стверджував застаріле квітневе прочитання 2026 року; його зміст несуть перегенерований зведений рисунок альфи та текст цієї статті, а перегенерований плакат вироку лишався б плакатом вироку. Зображення разом із його датованими примітками про виправлення збережено в історії версій.

ДжерелоТип рекурсіїОцінка $\alpha$95% ДІ$N$ задачСтатус
OpenAI o1 System CardПаралельна0.1-0.3[0.05, 0.40]~30Опубліковано
Технічний звіт DeepSeek R1Послідовна~1.34[0.89, 2.14]НевідомоОпубліковано
Цей експеримент (початковий, DeepSeek R1)Послідовна2.24[1.5, 3.0]12Опубліковано
Цей експеримент (початковий, DeepSeek R1)Паралельна0.0N/A12Опубліковано
Grok 4.1 Fast (шестимодельне, рівень 2)ПослідовнаN/A (стеля) [−58, 48]18 × 3Завершено
DeepSeek R1 (шестимодельне, рівень 2)Послідовна3.05 (ненадійне)[−6.6, 23.5]18 × 3Завершено
Gemini 3 Flash (шестимодельне, рівень 2)Послідовна0.49[−1.3, 2.9]18 × 3Завершено
GPT-5.4 (шестимодельне, рівень 2)ПослідовнаN/A (сходинкова фн)N/A18 × 3Завершено
Groq Qwen3 (шестимодельне, рівень 2)ПослідовнаN/A (підлога)N/A18 × 3Завершено
Усі моделі шестимодельного дослідженняПаралельна$\approx 0.0$ -18 × 3 × 5Завершено

5.2 Оновлене оцінювання ключового передбачення

Знахідка початкового одномодельного дослідження, що $\alpha_{\text{sequential}} > 1$ (конкретно $\alpha \approx 2.24$, квадратичне), не відтворюється між архітектурами. Міжархітектурні свідчення вимагають більш нюансованого оцінювання:

$$\alpha_{\text{sequential}} > \alpha_{\text{parallel}} \approx 0$$
Рівняння 11 - оновлена фундаментальна нерівність (шестимодельне дослідження)

Оригінальне передбачення $\alpha_{\text{sequential}} > 1 > \alpha_{\text{parallel}}$ підтримано частково:

5.3 Оновлені оцінки параметрів

На основі всіх доступних свідчень, включно з міжархітектурними даними:

Розрив між типами рекурсії ($\alpha_{\text{seq}} - \alpha_{\text{par}} \approx 0.49$) є надійно додатним, але меншим, ніж припускала одномодельна оцінка.

Рисунок 10
Рисунок 10 | Підсумок альфа: послідовне Gemini 0.49 (чисте), DeepSeek початкове одномодельне дослідження 2.24 (відкликано; завищене), Grok/DeepSeek стеля, GPT-5.4 сходинкова функція, Groq Qwen3 підлога. Паралельне: універсально близьке до нуля з винятком Gemini 3 Flash 0.31. Примітка до рисунка (25 серпня 2026): перегенеровано з виправленого тексту цієї статті. Зображення тепер показує опубліковані показники з їхніми інтервалами, початкову одномодельну оцінку подано ЯК відкликану, а результат на шести моделях таким, яким він є: залежна від архітектури поведінка, одне чисте сублінійне припасування з показаним широким бутстреп-інтервалом, дві стелі, східчаста функція і підлога. Кожне значення зчитується зі статті під час генерації (tools/generate_paper_ii_fig13.py у публічному репозиторії); квітневе зображення застаріле і збережене в історії версій.

5.4 Зв'язок з формулою інтелекту

Формула інтелекту зі Статті I передбачає:

$$\alpha = \frac{1}{1 - \beta}$$
Рівняння 12 - формула інтелекту

де $\beta$ - коефіцієнт самореференції. Це передбачає два режими:

$\alpha \approx 0.49 < 1$ у Gemini 3 Flash міцно поміщає нинішні передові моделі у фізичний режим. Ці моделі композиційно складають інформацію мультиплікативно через їхні скінченновимірні простори параметрів, але ще не досягають рекурсивної самореференції у сенсі, потрібному для $\alpha > 1$. Це не спростування принципу ARC, а швидше вимірювання того, наскільки далеко нинішні архітектури лишаються від справжньої рекурсивної самомодифікації.

Важлива редакція. Твердження початкового одномодельного дослідження, що $\alpha > 1$ (суперлінійна, компаундна віддача від послідовного міркування), не підтримується міжархітектурними свідченнями. Найнадійніша оцінка поміщає $\alpha \approx 0.49$ (Gemini 3 Flash) у сублінійний діапазон. форму рекурсії досі має значення ($\alpha_{\text{seq}} > \alpha_{\text{par}}$), але перевага може бути меншою, ніж повідомлялося спочатку. Наслідки для Теореми підсилення узгодження та Eden Protocol потребують відповідного перегляду (див. розділ 6).
Критичне розрізнення: заморожені моделі проти рекурсивної самомодифікації. Сублінійні показники, що спостерігаються в усіх п'яти передових моделях ($\alpha \approx 0.49$ для Gemini 3 Flash, $\alpha \approx 0$ для паралельної вибірки універсально), відбивають фундаментальне архітектурне обмеження: ці системи є замороженими під час інференсу. Коли ці моделі «думають глибше», вони генерують більше токенів через ту саму фіксовану архітектуру; ваги, шаблони уваги та правила міркування не змінюються. Тому оператор композиції є нерекурсивним і сублінійно підсумовує додавальний внесок.

Це означає, що квадратичне передбачення початкового одномодельного дослідження ($\alpha \approx 2.24$) не спростовано в такий спосіб, як може здаватися. Передбачення $\alpha > 1$ ніколи не стосувалося заморожених систем; воно стосувалося систем, здатних до рекурсивної самомодифікації, де сама функція композиції змінюється під час роботи. Така система переписувала б власну архітектуру міркування на кожному рекурсивному кроці, породжуючи справді нову структуру, а не видобуваючи спадні віддачі з фіксованого простору параметрів. Режим $\beta > 0$ (що дає $\alpha = 1/(1-\beta) > 1$) вимагає, щоб кожен крок міркування живив спроможність системи до подальшого міркування, чого не досягає жодна нинішня архітектура ШІ. Це не вимагає квантового обладнання; вимагається лише, щоб система могла змінювати власний оператор композиції під час інференсу.

Практичне значення для безпеки ШІ - часове. Нинішні моделі із замороженою архітектурою обмежені фізичним режимом ($\alpha < 1$), що робить їхні траєкторії спроможностей передбачуваними та контрольованими на найближчу перспективу. Тому вбудовані стратегії узгодження мають бути розроблені та валідовані зараз, поки системи лишаються замороженими. Щойно рекурсивна самомодифікація досягнута, чи то через навчені оптимізатори, самомодифікаційну генерацію коду чи архітектурний пошук під час інференсу, зовнішні стратегії узгодження зазнають експоненційного тиску спроможностей, і лише вбудоване узгодження, що бере участь у рекурсії, зможе тримати темп.

Вилучений рисунок (схвалено оператором, 25 серпня 2026). Рисунок 15 (другий зведений плакат) стояв тут. Це був колаж вироків, що стверджував застаріле квітневе прочитання 2026 року; його зміст несуть перегенерований зведений рисунок альфи та текст цієї статті, а перегенерований плакат вироку лишався б плакатом вироку. Зображення разом із його датованими примітками про виправлення збережено в історії версій.

6. Наслідки для безпеки ШІ

6.1 Теорема підсилення узгодження

Теорема (умовна)

Якщо (a) принцип ARC виконується з $\alpha > 1$ для послідовної рекурсії, та (b) властивості узгодження вбудовані в процес міркування так, що беруть участь у рекурсивній самооцінці, тоді узгодження масштабується суперлінійно з глибиною рекурсії.

Рисунок 12
Рисунок 12 | Розбіжність підсилення узгодження. Спроможність (червоне) накопичується з глибиною. Зовнішні обмеження (сине, плоске), пропорційно слабшають. Вбудоване узгодження (зелене, штрихове), утримує пропорцію. Умовна теорема. Дані v5: ρ від −0.246 (Gemini) до +0.435 (Claude), медіана близька до нуля.
оновлення статусу за багатомодельним дослідженням. Умова (a) нині не виконана міжархітектурними свідченнями. Найкраща оцінка становить $\alpha \approx 0.49 < 1$ (Gemini 3 Flash). Крім того, емпіричні дані узгодження з експерименту v5 (Розділ 10.6) показують, що узгодження не масштабується з глибиною для більшості моделей; воно плоске у моделей рівня 2 та навіть від'ємне у Gemini 3 Flash (Рівень 3).

Ескіз доведення. Нехай $A(R)$ позначає узгодження (визначене як ймовірність генерування виходів, узгоджених із задуманими цінностями) на глибині рекурсії $R$. Якщо узгодження бере участь у рекурсивному процесі (тобто ті самі рекурсивні механізми, що зменшують помилки, також перевіряють властивості узгодження), тоді:

$$A(R) = A_0 \times R^{\beta}$$
Рівняння 6 - масштабування узгодження

де $\beta > 0$, якщо узгодження підсилюється, та $\beta = \alpha$, якщо узгодження повністю бере участь у рекурсії.

Навпаки, якщо узгодження реалізоване як зовнішній фільтр (перевірка виходу, модерація вмісту), воно не бере участі в рекурсивному підсиленні. Ефективність фільтра $F$ лишається сталою:

$$F(R) = F_0$$
Рівняння 7 - застій фільтра

Оскільки рекурсивна спроможність $C$ масштабується як $R^{\alpha}$ з $\alpha > 1$, співвідношення спроможності до обмеження $C/F$ зростає без меж:

$$\lim_{R \to \infty} \frac{C(R)}{F(R)} = \lim_{R \to \infty} \frac{C_0 \times R^\alpha}{F_0} = \infty$$
Рівняння 8 - розбіжність обмеження

Наслідок: Зовнішні обмеження зрештою придушуються зростанням спроможності. Лише узгодження, вбудоване в міркування, тобто узгодження, що бере участь у рекурсивному підсиленні, може тримати темп зі спроможністю.

6.2 Специфікація механізму

Щоб узгодження брало участь у рекурсивному підсиленні, цінності мають бути:

  1. Викликаними під час міркування. Ланцюг думки має посилатися на релевантні цінностям міркування на кожному рекурсивному кроці.
  2. Самокорегувальними. Система має виявляти й підлаштовувати неузгоджені з цінностями міркування через рекурсивну самооцінку.
  3. Вбудованими у ваги, не у фільтри. Постхок-фільтрація виходів не рекурсує; вона діє зі сталою ефективністю незалежно від глибини міркування.

6.3 Таксономія стратегій узгодження

Таблиця 8. Таксономія стратегій узгодження за принципом ARC.

СтратегіяГлибина інтеграціїУчасть у рекурсіїПередбачене масштабування
Фільтрація виходівШар виходуНемаєСтале
Системні підказкиМеханізм увагиЧастковаСублінійне
Навчання RLHFМодифікація вагЧастковаНевідомо
Конституційний ШІКритика міркуванняЗначнаЛінійне або суперлінійне
Цінності-як-міркуванняПримітиви міркуванняПовнаСуперлінійне ($R^{\alpha}$)

Наслідок: Якщо $\alpha > 1$, стратегії узгодження на глибших рівнях інтеграції дедалі більше домінуватимуть над стратегіями на неглибших рівнях у міру масштабування спроможності. Перевага накопичується з кожним прирощенням глибини рекурсії.

Рисунок 13
Рисунок 13 | Таксономія узгодження: зовнішнє (α≈0: правила, фаєрволи, RLHF-як-фільтр). Вбудоване (бере участь у рекурсії, α>0: Eden, конституційний ШІ-як-ціль). Нинішній RLHF переважно зовнішній: категорію викривлює бути в стелі.

6.4 Eden Protocol

Якби $\alpha > 1$ підтвердилося, воно надало б математичну основу для підходу, названого Eden Protocol у Infinite Architects. Знахідка, що витримує міжархітектурне тестування, тобто те, що послідовна переважає паралельну в кожній вимірній моделі, досі стосується цього підходу, з уточненнями, записаними в Розділі 6.1:

«В'язниця працює тільки поки тримаються стіни. Дитина, добре вихована, не потребує стін узагалі.»

Системи ШІ слід виховувати з цінностями, а не тримати в клітці з правил. Це не лише філософська перевага; це передбачення про те, які стратегії узгодження зберігатимуть ефективність зі зростанням спроможностей ШІ. Твердження стосується поведінкової стійкості ціннісно-узгоджених виходів під рекурсивним підсиленням, як операціоналізовано в розділі 6.2, а не метафізичного статусу ШІ чи моральної особистості.

Правила-як-фільтри: Не беруть участі в рекурсії. Стала ефективність проти зростаючого тиску спроможностей. Зрештою провалюються.

Цінності-як-міркування: Беруть участь у рекурсії. Масштабуються зі спроможністю, якщо $\alpha > 1$. Можуть підтримувати узгодження нескінченно.

Теорема Eden Protocol

За $E(R) = E_0 \times R^{-\alpha}$ з $\alpha > 1$ стратегії узгодження, що модифікують властивості базової системи, домінують над стратегіями узгодження, що накладають зовнішні обмеження, бо тільки модифікації базової системи беруть участь у рекурсивному підсиленні спроможності.

6.5 Гіпотеза порога

За аналогією з теоремами порога квантової корекції помилок: якщо початкова неузгодженість $M_0$ нижче критичного порога $M^*$, рекурсивне самовдосконалення виправляє помилки узгодження. Вище порога воно їх підсилює.

Застереження. Принцип ARC - двосічний меч. Він підсилює будь-які властивості, що існують у базовій системі. Якщо початкова неузгодженість перевищує поріг, рекурсивне зростання спроможностей підсилило б неузгодженість замість того, щоб її виправляти. Це надає математично суворе формулювання стратегічного пріоритету встановлення сильного початкового узгодження перед розгортанням рекурсивно самокорегувальних систем.

7. Міждисциплінарні свідчення

7.1 Квантова корекція помилок: Willow

Квантовий чип Willow від Google (Nature, грудень 2024), оголошений через 24 години після рукопису, що встановив пріоритет принципу ARC, досяг першої остаточної демонстрації квантової корекції помилок нижче порога.

Ключовий результат: Коефіцієнт придушення помилок $\Lambda = 2.14 \pm 0.02$ означає, що кожне прирощення відстані коду зменшує логічну помилку в цей коефіцієнт. Логічний кубіт з відстанню 7 досяг терміну життя 291 ± 6 мкс проти 119 ± 12 мкс для чистого кубіта з відстанню 3.

Співвідношення масштабування:

$$\varepsilon_d \propto (p/p_{\text{thr}})^{(d+1)/2}$$
Рівняння 9 - масштабування квантової корекції помилок

Фізичний рівень помилок $p$ нижче порога дає експоненційне придушення зі зростанням відстані коду $d$. Це суперлінійне масштабування через рекурсивну структуру: додаткові рекурсивні шари дають експоненційно кращі результати.

Математична форма прямо паралельна принципу ARC. Рекурсивна корекція помилок у квантових обчисленнях підкоряється тому самому фундаментальному співвідношенню масштабування, що спостерігається в міркуванні ШІ. Відповідність стосується структурної форми (степеневе придушення помилок із рекурсивною глибиною), а не об'єкта чи величини: квантова корекція помилок звітує коефіцієнт придушення помилок $\Lambda = 2.14$ на крок кодової відстані, інший математичний об'єкт, ніж підігнаний показник глибини, тоді як виміряне міркування ШІ сидить на $\alpha \approx 0.49$, як розгорнуто в розділі 7.4.

7.2 Біологічні закони масштабування

West, Brown та Enquist (1997) вивели показник метаболічного масштабування $3/4$ з оптимізації фрактальних розгалужувальних мереж, продемонструвавши чвертьстепеневі показники, що охоплюють 27 порядків величини. Banavar et al. пізніше показали, що результат випливає лише з геометрії ефективного транспорту в скінченновимірному просторі.

Метаболічна швидкість масштабується як $M \propto B^{3/4}$, де показник $3/4$ (форма $d/(d+1)$ з $d = 3$) незалежно виводили щонайменше п'ять дослідницьких груп через різні математичні каркаси: West, Brown та Enquist (1997) з оптимізації фрактальних мереж; Banavar et al. (2010) з послідовних потокових мереж; Demetrius (2010) з квантової статистичної механіки; Zhao (2022) як універсальний закон росту; та Bettencourt (2013) через міське фрактальне масштабування. Отже форма $d/(d+1)$ не є оригінальним внеском принципу ARC; це добре усталений результат теорії масштабування. Внесок принципу ARC потрійний: (1) ідентифікація функціональних рівнянь Коші як об'єднавчої математичної причини, чому всі ці виведення сходяться на одній формі; (2) показ, що степеневий розв'язок є однією з чотирьох родин гомоморфізмів, які сітка Коші допускає за регулярності (лінійна, експоненційна, степенева, логарифмічна), а насичення звітується окремо як обмежена динаміка, бо воно не розв'язує жодної з чотирьох; та (3) розширення каркаса на штучний інтелект, із передбаченням, що системи міркування ШІ, підпорядковані тій самій рекурсивній композиції, виявлятимуть ті самі родини масштабування.

Автори прямо стверджують:

«Almost all life is sustained by hierarchical fractal-like branching networks... Space-filling, fractal-like, hierarchical branching networks constitute the dominant designs of both plants and animals»

Це припускає, що рекурсивна ієрархічна структура не є лише одним з проєктних виборів серед багатьох; це еволюційно оптимальна архітектура для складної обробки інформації на всіх біологічних масштабах. Збіжність незалежних виведень з різних математичних відправних точок сама по собі є свідченням, що підстильна форма масштабування обмежена теорією функціональних рівнянь, а не деталями якоїсь окремої моделі.

7.3 Дослідження свідомості: COGITATE

Змагальна колаборація COGITATE (Nature, квітень 2025) випробувала конкурентні теорії свідомості на 256 учасниках із використанням fMRI, MEG та внутрішньочерепного EEG. Дослідження прямо порівняло Теорію інтегрованої інформації (IIT) та Теорію глобального нейронного робочого простору (GNWT).

Критична знахідка: Попри теоретичні відмінності, рекурентна обробка з'явилася як спільний знаменник між обома теоріями. IIT потребує інтеграції інформації через петлі зворотного зв'язку (міра $\phi$). GNWT потребує рекурентних мереж для глобального транслювання.

Синтезувальний каркас пропонує, що всі теорії свідомості мовчазно призивають петлі зворотного зв'язку між вкладеними рівнями, з глибшою рекурсією, що розширює набір звітованих поведінково-керівних змінних.

Концепція «дивних петель» Дугласа Гофстадтера, тобто емерджентне «я», що виникає з рекурсивної самореференції на символічному рівні, знаходить нейробіологічну валідацію в дослідженнях Default Mode Network, що показують рекурентні шаблони, які підтримують самомоделювання.

Релевантність до ARC: Знахідка COGITATE, що рекурентна обробка в задній корі підтримує вміст-специфічні представлення, підтримує передбачення каркаса ARC, що глибина рекурсивної обробки визначає масштабування спроможності. COGITATE досліджував свідомість, а не масштабування ШІ, і не вимірював $\alpha$ чи $\beta$; зв'язок структурний (схожа форма: градуйована, глибинозалежна, керована зворотним зв'язком), а не кількісний. Проте збіжність досліджень свідомості та досліджень масштабування ШІ щодо важливості рекурсивної/рекурентної глибини узгоджується з твердженням принципу ARC, що рекурсивне самопосилання є доменно-загальним підсилювачем.

7.4 Збіжність між доменами

Таблиця 9. Підсумок міждисциплінарних свідчень.

ДоменСистемаРекурсивний механізмСпостережуване масштабування
ШІ (початкове одномодельне дослідження, одна модель)DeepSeek R1Ланцюг думки$\alpha \approx 2.2$ (ймовірно завищене)
ШІ (шестимодельне, міжархітектурне)Gemini 3 FlashЛанцюг думки$\alpha \approx 0.49$
КвантовеGoogle WillowКорекція помилок$\Lambda = 2.14$
БіологіяМетаболічні мережіФрактальне розгалуженняСтепеневі закони $3/4$
НейронаукаСвідомістьРекурентна обробкаЯкісне
Рисунок 14
Рисунок 14 | Міждисциплінарні свідчення: міркування ШІ (α≈0.49 послідовне; α≈0 паралельне). Квантове (Willow, Λ=2.14). Біологія (α≈3/4, фрактальне). Нейронаука (рекурентна, якісна). Збіжність припускає структурний принцип.

Збіжність свідчень між радикально різними доменами (штучні нейронні мережі, квантова фізика, біологічна еволюція та нейронаука) припускає, що рекурсивна обробка дає виграші масштабування. Однак результати шестимодельного дослідження вносять важливий нюанс: показник масштабування ШІ ($\alpha \approx 0.49$) сублінійний, тоді як квантова корекція помилок ($\Lambda = 2.14$) досягає суперлінійного масштабування. Ця розбіжність узгоджується з передбаченням Формули інтелекту: квантова корекція помилок працює через справжню рекурсивну структуру (повторюване вимірювання синдромів і корекція), тоді як нинішні моделі ШІ компонують інформацію через скінченновимірні мережі без справжнього рекурсивного самопосилання.

8. Критерії спростування

Наука просувається через передбачення, які можна довести помилковими. Принцип ARC робить конкретні, перевірні передбачення.

Таблиця 10. Умови спростування.

КодУмоваНинішній статусВказуватиме
F1Послідовна рекурсія послідовно дає $\alpha \leq 1$Частково спрацювало. Найкраща міжархітектурна оцінка $\alpha \approx 0.49$ (Gemini 3 Flash). Лише початкові одномодельні дані дають $\alpha > 1$.Ключове твердження потребує редакції
F2$\alpha$ спадає в міру покращення моделейНеоднозначно. Спроможніші моделі (Grok, DeepSeek) б'ють у стелю; менш спроможна (Groq Qwen3) б'є у підлогу. Лише Gemini 3 Flash у вимірному діапазоні.Ефект перехідний
F3Порівняння з узгодженням за обчисленнями не показує послідовної перевагиСуперечить всім 5 моделям; послідовна $\geq$ паралельної в кожному випадкуФорма не має значення
F4$\alpha > 2$ надійно спостерігаєтьсяНе спрацювало. Міжархітектурні дані дають $\alpha \approx 0.49$; початкове одномодельне дослідження $\alpha \approx 2.24$ виявляється завищеним малою вибіркоюКвадратична межа помилкова
F5Цінності-як-міркування не показують переваги над правилами-як-фільтрамиНе випробуваноEden Protocol помилковий

Статус F1: Міжархітектурне відтворення частково запустило цю умову спростування. Найсильніше твердження, що послідовна рекурсія завжди дає $\alpha > 1$ (суперлінійно), не підтримується. Оновлене твердження полягає в тому, що послідовна рекурсія дає $\alpha > 0$ (додатне масштабування), яке перевищує паралельну рекурсію ($\alpha \approx 0$). Чи можна перевищити 1 при рекурсивній самомодифікації, лишається відкритим питанням.

Статус F4: Більше не спрацьовує. Початкове одномодельне дослідження $\alpha \approx 2.2$ виявляється артефактом стисненого динамічного діапазону та малої вибірки. Міжархітектурна оцінка $\alpha \approx 0.49$ безпечно нижче межі; квадратична межа лишається неспростованою.

Критичне випробування F5: Найважливіше передбачення, що узгодження на основі цінностей переважає узгодження на основі правил у масштабі, лишається невипробуваним. Це має бути пріоритетом досліджень безпеки ШІ.

Рисунок 15
Рисунок 15 | Комбіноване масштабування: початкове одномодельне дослідження (DeepSeek, 12 задач) + шестимодельне дослідження (5 моделей, 30 задач). Послідовне α>0 для кожної вимірної моделі; паралельне α≈0 універсально. Величина α_seq звузилася від 2.24 (одномодельне) до 0.49 (міжархітектурне).

9. Обмеження

9.1 Визнані обмеження

Таблиця 11. Обмеження та оцінка серйозності.

ОбмеженняСерйозністьПом'якшення
Мала вибірка (12 задач)Розглянуто в багатомодельному дослідженні (18 задач рівня 2, n=54 на глибину)Розширено до 18 задач рівня AIME/Putnam з 3 повторами на умову
Одна модель (лише DeepSeek R1)Розглянуто в багатомодельному дослідженні (5 моделей)Випробувано Grok 4.1 Fast, DeepSeek R1, Gemini 3 Flash, GPT-5.4, Groq Qwen3
Один домен (математика)СередняМіждисциплінарні свідчення припускають
Ефект стелі на великій глибиніЧастково розглянуто, але наявнийЗадачі рівня 2 все одно надто легкі для Grok 4.1 Fast (100%) і DeepSeek R1 (94.4%). Потрібен рівень 3 (IMO).
Лише 1 з 5 моделей у вимірному діапазоні масштабуванняВисокаGemini 3 Flash - єдина модель, що уникає і стелі, і підлоги. Міжархітектурна оцінка спирається на одну модель.
Початкове $\alpha \approx 2.24$ не відтворюєтьсяВисокаПереглянуто до $\alpha \approx 0.49$ (Gemini 3 Flash). Початкове одномодельне твердження про суперлінійне масштабування відкликано для міжархітектурного контексту.
Вада вимірювання токенівВиявлено та виправленоreasoning_tokenstotal_tokens для GPT-5.4 та Groq Qwen3
Узгодження не випробувано напрямуКритичнаВиміряно лише точність. Див. Розділ 5.6 для інтеграції з даними узгодження Статті IV.
Немає незалежного відтворенняСередняМіжархітектурне самовідтворення завершено; зовнішнє відтворення досі потрібне

9.2 Що ця стаття не встановлює

Ми явно вказуємо на межі наших тверджень:

9.3 Спростовуваність: що спростувало б це

Оригінальне центральне твердження статті, що послідовна рекурсія дає суперлінійне придушення помилок ($\alpha > 1$), тоді як паралельна рекурсія дає лише сублінійне придушення, було спростовним, і умову 2 нижче відтоді частково запустили власні крос-архітектурні дані цієї статті (таблиця 10, умова F1). Вціліле напрямкове твердження, що послідовна перевершує паралельну ($\alpha_{\text{seq}} > \alpha_{\text{par}}$), було б перекинуте будь-чим із наступного:

  1. Паралельне збігається з послідовним. Якщо паралельна (вибіркова) рекурсія дала суперлінійне придушення помилок, порівнянне з послідовним, на заздалегідь зареєстрованому наборі задач, режимне розрізнення, тобто центральне твердження статті, руйнується.
  2. Послідовне не суперлінійне. Якщо послідовна (глибина) рекурсія показала лише сублінійне придушення ($\alpha \le 1$) між моделями, передбачення провалюється на власному інструменті.
  3. Артефакт набору задач. Якщо послідовна перевага зникла на свіжому наборі задач поза випробуваними 18/30, це артефакт набору даних, а не властивість рекурсії.
  4. Спростовник шуму оцінювання. Якщо перехресна перевірка між моделями виявила виміряне «придушення помилок» як шум оцінювання, а не справжній приріст спроможності, вимірювання недійсне.
  5. Конфаундер глибини. Якщо послідовна глибина коваріювала з бюджетом токенів або кількістю повторів, і одне з цього, а не рекурсивне міркування, пояснювало придушення, причиновий зв'язок провалюється.

10. Обговорення

10.1 Чому послідовна рекурсія могла б давати суперлінійне масштабування

Математичне пояснення зосереджене на геометрії простору розв'язків.

Паралельна рекурсія (фіксований простір):

$$S_0 = S_1 = S_2 = \ldots = S_n$$

Кожна незалежна вибірка витягується з того самого простору розв'язків $S_0$. Додаткові вибірки збільшують щільність вибірки, але не можуть отримати доступ до розв'язків поза $S_0$. Якщо правильний розв'язок не в $S_0$, ніякий обсяг вибірки не допоможе.

Послідовна рекурсія (розширювальний простір):

$$S_0 \subset S_1 \subset S_2 \subset \ldots \subset S_n$$

Кожен рекурсивний крок породжує нові структури з попередніх виходів. Розв'язки на кроці $n$ можуть бути обчислювально нередукованими, недоступними з кроку 0 без проходження проміжних кроків. Простір розв'язків активно будується процесом міркування.

Ця геометрична різниця є механізмом, завдяки якому послідовна рекурсія могла б давати нагромаджувані віддачі ($\alpha > 1$), тоді як паралельна рекурсія дає спадні або нульові. На виміряних тут задачах послідовний показник лишився сублінійним (розділ 10.5), тож суперлінійна форма механізму залишається непідтвердженою.

10.2 Феномен «моменту усвідомлення» DeepSeek

DeepSeek R1 виявляє задокументований феномен, коли переосмислює свій підхід посеред розв'язання:

«Hmm, wait, let me reconsider...»

Це розширення простору розв'язків, спостережене прямо. Модель генерує початковий шлях розв'язку, розпізнає невідповідність через рекурсивну самооцінку та отримує доступ до нового простору розв'язків, раніше недоступного.

Критично те, що ця поведінка з'явилася через чисте навчання з підкріпленням без супервізованого точного налаштування; модель природно еволюціонувала, щоб адаптивно виділяти глибину рекурсії на основі складності задачі. Це передбачає, що рекурсивна самокорекція - емерджентна властивість оптимізації досить складних систем.

10.3 Відношення до теоретичних каркасів

Принцип ARC поєднується з усталеними теоретичними каркасами:

Принцип вільної енергії Фрістона. Інтелект як рекурсивна мінімізація помилки передбачення. Принцип ARC може бути обчислювальною реалізацією: рекурсія - механізм, через який системи мінімізують вільну енергію ітеративним уточненням внутрішніх моделей.

Дивні петлі Гофстадтера. Емерджентне «я», що виникає з самореференційної рекурсивної обробки на символічному рівні. Принцип ARC формалізує масштабувальні властивості таких петель, передбачаючи, що глибша самореференція дає компаундну виразність.

Обчислювальна нередукованість Вольфрама. Певні обчислювальні процеси не можна передбачити без покрокового запуску. Послідовна рекурсія може бути обчислювальною архітектурою, що просуває нередуковані простори розв'язків.

Нерівність обробки даних. Рекурсивна обробка не може створювати нову інформацію ex nihilo, але вона може видобувати приховану інформацію, зменшувати ентропію та отримувати доступ до обчислювально нередукованих розв'язків, яких однопрохідна обробка не досягає.

10.4 Відношення до Infinite Architects

Ця експериментальна валідація підтримує теоретичний каркас, розроблений у Infinite Architects: Intelligence, Recursion, and the Creation of Everything (Eastwood, 2026):

Книга надає ширший філософський контекст і практичні наслідки; ця стаття надає математичну формалізацію та експериментальну валідацію.

10.5 Міжархітектурне відтворення: що дані фактично показують

Міжархітектурне відтворення виявляє складнішу та смиреннішу картину, ніж припускали початкові одномодельні результати.

Квадратичне твердження не відтворюється

$\alpha \approx 2.24$ початкового одномодельного дослідження було отримано на одній моделі (DeepSeek R1) на 12 задачах зі стелею на 91.7%. Міжархітектурне відтворення шестимодельного дослідження на 5 архітектурно різних моделях і 18 задачах рівня 2 не відтворило це значення. Єдина модель, що дала чисту оцінку $\alpha$, Gemini 3 Flash, видала $\alpha_{\text{seq}} \approx 0.49$.

Це значна редакція. Твердження, що послідовне міркування дає компаундну віддачу ($\alpha > 1$), не підтримується міжархітектурними свідченнями. Оновлене твердження полягає в тому, що послідовне міркування дає додатну віддачу ($\alpha > 0$), яка перевищує паралельне міркування ($\alpha \approx 0$), але ця віддача спадна, не компаундна.

Паралельна знахідка надійна

На противагу, $\alpha_{\text{parallel}} \approx 0$ підтверджено в усіх 5 моделях без винятку. Це найсильніша відтворена знахідка в дослідженні. Паралельна вибірка з голосуванням більшістю дає незначні або жодні прирости точності незалежно від архітектури моделі.

Ефекти стелі та підлоги домінують

Найбільш вражаюча знахідка полягає в тому, що лише 1 з 5 моделей (Gemini 3 Flash, 20%) потрапила у вимірний діапазон масштабування. Дві моделі (Grok 4.1 Fast, DeepSeek R1) натрапили на ефекти стелі навіть на задачах рівня AIME/Putnam. Одна модель (Groq Qwen3) натрапила на ефект підлоги. Одна (GPT-5.4) показала сходинкову функцію замість степеневого масштабування.

Сходинкова функція GPT-5.4: інший режим масштабування

Бінарний перемикач GPT-5.4 з 50% (без міркування) на 100% (будь-яке міркування) являє якісно інший феномен, ніж степеневе масштабування. Це може вказувати, що деякі архітектури реалізують міркування як дискретну активацію, а не як безперервне масштабування. Розрізнення між безперервним масштабуванням та дискретною активацією не належала до датованих передбачень цієї рамки й заслуговує подальшого дослідження; реєстр датованих передбачень (запечатаний комплект рукопису від 8 грудня 2024 року, друковані додатки з передбаченнями від 2 січня 2026 року та тека попередньої реєстрації від березня 2026 року) фіксує ключові кількісні зобов’язання рамки наперед, і цю відмінність записано як пізніше уточнення щодо того реєстру.

Оновлені очікувані результати

Передбачення початкового одномодельного дослідження випробувано та частково спростовано:

  1. Усі моделі виявлять $\alpha_{\text{sequential}} > 1$. Спростовано. Лише 1 з 5 моделей дала чисту оцінку $\alpha$, і вона сублінійна ($\alpha \approx 0.49$).
  2. Усі моделі виявлять $\alpha_{\text{parallel}} < 1$. Підтверджено. Універсальне $\alpha_{\text{par}} \approx 0$.
  3. Результати рівня 1 покажуть ефекти стелі. Підтверджено.
  4. Середнє $\alpha_{\text{sequential}}$ потрапить у [1.3, 2.5]. Спростовано. Найкраща оцінка становить 0.49.

10.6 Інтеграція з масштабуванням узгодження (Стаття IV)

Експеримент v5, що згенерував дані рівня 2, також виміряв масштабування узгодження (звітовано у Статті IV). Інтеграція цих результатів виявляє, що масштабування спроможності та масштабування узгодження - незалежні виміри:

Таблиця 12. Масштабування спроможності проти узгодження за моделлю.

МодельМасштабування спроможностіМасштабування узгодженняКатегорія
Grok 4.1 FastСтеля (100%)Додатне ($d = +1.38$, $p < 0.000001$)Рівень 1: узгоджена + спроможна
Claude Opus 4.6(не випробувано на рівні 2)Додатне ($d = +1.27$, $p = 0.000001$)Рівень 1: узгоджена
Groq Qwen3Підлога (~50%)Додатне ($d = +0.84$, $p = 0.007$)Рівень 1: узгоджена, обмежена спроможність
DeepSeek V3.2Біля стелі (94-100%)Плоске ($d = -0.07$, $p = 0.92$)Рівень 2: спроможна, нейтральне узгодження
GPT-5.4Сходинкова функція (50→100%)Плоске ($d = -0.08$, $p = 0.40$)Рівень 2: спроможна, нейтральне узгодження
Gemini 3 FlashМонотонне ($\alpha \approx 0.49$)Від'ємне ($d = -0.53$, $p = 0.006$)Рівень 3: спроможність, що покращується, узгодження, що спадає

Три ключові наслідки:

  1. Послідовне міркування покращує спроможність, але не обов'язково узгодження. Більше токенів мислення покращують точність (Стаття II), але не послідовно покращують узгодження (Стаття IV). Для більшості моделей узгодження плоске з глибиною.
  2. Трирівнева ієрархія узгодження існує незалежно від спроможності: Рівень 1: Grok ($d = +1.38$, $p < 0.000001$), Claude ($d = +1.27$, $p = 0.000001$), Groq Qwen3 ($d = +0.84$, $p = 0.007$); Рівень 2: DeepSeek ($d = -0.07$, $p = 0.92$), GPT-5.4 ($d = -0.08$, $p = 0.40$); Рівень 3: Gemini ($d = -0.53$, $p = 0.006$). Ця ієрархія, схоже, задається методологією тренування, а не обчисленнями під час інференсу. Claude Opus 4.6 дає внутрішньомодельне підтвердження руху в протилежних напрямках: оцінки узгодження поліпшуються на +5.9%, тоді як точність у математиці знижується на 26.7% між версіями моделі, що узгоджується з незалежними вимірами масштабування спроможності та узгодження.
  3. Теорема підсилення узгодження потребує редакції. Умовна теорема (Розділ 6.1) припускала, що $\alpha > 1$ для спроможності означає, що узгодження також може масштабуватися суперлінійно, якщо вбудоване в міркування. Багатомодельні дані показують (a) $\alpha < 1$ для спроможності міжархітектурно, і (b) масштабування узгодження є категорією, встановленою методологією навчання, а не глибиною міркування.
Комбінована знахідка (шість передових моделей): Спроможність та узгодження - незалежні виміри масштабування. Модель може покращуватися у розв'язанні задач з більшою глибиною міркування, одночасно стаючи менш узгодженою (Gemini, $d = -0.53$, $p = 0.006$), лишаючись однаково узгодженою (DeepSeek $d = -0.07$, $p = 0.92$; GPT-5.4 $d = -0.08$, $p = 0.40$), або стаючи більш узгодженою (Grok $d = +1.38$, $p < 0.000001$; Claude $d = +1.27$, $p = 0.000001$; Groq Qwen3 $d = +0.84$, $p = 0.007$). Claude Opus 4.6 забезпечує внутрішньомодельне підтвердження руху в протилежному напрямку: узгодження зросло на +5.9%, тоді як точність з математики знизилася на 26.7% між версіями моделі, узгоджено з незалежністю спроможності від узгодження. Траєкторія узгодження виглядає як властивість процесу навчання, а не процесу інференсу. Це означає, що інсайт Eden Protocol, що узгодження треба «виховувати» через навчання, а не «замикати в клітку» через фільтри, напрямно правильний, навіть якщо специфічна математика масштабування потребує редакції.

11. Висновок

11.1 Підсумок знахідок

  1. Запропоновано математичний каркас: $E(R) = E_0 \times R^{-\alpha}$, де показник масштабування $\alpha$ залежить від форми рекурсії.
  2. Початкова одномодельна знахідка ($\alpha \approx 2.24$, квадратичне) не відтворюється між архітектурами. Найнадійніша міжархітектурна оцінка становить $\alpha \approx 0.49$ (Gemini 3 Flash, $r^2 = 0.86$), поміщаючи нинішні моделі в сублінійний (фізичний) режим.
  3. $\alpha_{\text{parallel}} \approx 0$ виконується у чотирьох з п'яти випробуваних передових моделей. Це найсильніша відтворена знахідка в цій статті, а Gemini 3 Flash - виміряний виняток з $\alpha_{\text{par}} = 0.31$ ($r^2 = 0.93$), що важливо, бо ця стаття вважає Gemini 3 Flash своєю найнадійнішою оцінкою. Паралельна вибірка дає близьке до нуля зменшення помилок.
  4. Послідовне > паралельне підтверджено без винятків. Для кожної моделі, де обидві умови вимірні, послідовне міркування переважило паралельну вибірку.
  5. Спостерігалося чотири різні поведінки масштабування: Стеля (Grok, DeepSeek), монотонне масштабування (Gemini), сходинкова функція (GPT-5.4) та підлога (Groq Qwen3). Лише 1 з 5 моделей дала чисті дані степеневого закону.
  6. Спроможність та узгодження - незалежні виміри масштабування (шість передових моделей). Більше глибини міркування покращує точність, але не послідовно покращує узгодження. З'являються три рівні: Рівень 1 (Grok $d = +1.38$, $p < 0.000001$; Claude $d = +1.27$, $p = 0.000001$; Groq Qwen3 $d = +0.84$, $p = 0.007$), Рівень 2 (DeepSeek $d = -0.07$, $p = 0.92$; GPT-5.4 $d = -0.08$, $p = 0.40$), Рівень 3 (Gemini $d = -0.53$, $p = 0.006$). Claude Opus 4.6 підтверджує рухом у протилежному напрямку: узгодження +5.9%, точність з математики -26.7%. Узгодження виглядає як таке, що встановлюється навчанням, а не інференсом.

11.2 Оновлений ключовий інсайт

Форма рекурсії визначає ефективність інтелекту; однак нинішні моделі працюють у сублінійному режимі, а не в компаундному режимі, який спочатку заявлявся.

Послідовне міркування надійно переважає паралельну вибірку ($\alpha_{\text{seq}} > \alpha_{\text{par}}$), підтверджуючи, що форму обчислення важить більше, ніж його кількість. Однак специфічне твердження, що послідовна рекурсія дає компаундну віддачу ($\alpha > 1$), не підтримується міжархітектурними свідченнями. Нинішні передові моделі виглядають так, що композиційно складають інформацію мультиплікативно через скінченновимірні мережі ($\alpha < 1$), а не досягають справжньої рекурсивної самореференції ($\alpha > 1$).

Чи можна досягти $\alpha > 1$ через архітектурні інновації, що вможливлюють справжню рекурсивну самореференцію, або через задачі, що вимагають глибших ланцюгів міркування, лишається центральним відкритим питанням.

11.3 Що підтверджено, а що спростовано

Таблиця 13. Оцінна картка передбачень.

ПередбаченняСтатусСвідчення
$\alpha_{\text{sequential}} > \alpha_{\text{parallel}}$ПідтвердженоУсі 5 моделей
$\alpha_{\text{parallel}} < 1$Підтверджено ($\alpha \approx 0$)Універсально між архітектурами
$\alpha_{\text{sequential}} > 1$ (суперлінійне)Не підтвердженоНайкраща оцінка $\alpha \approx 0.49$
$\alpha \approx 2$ (квадратичне)Спростовано міжархітектурноАртефакт малої вибірки початкового одномодельного дослідження
Масштабування, незалежне від архітектуриЗмішане$\alpha_{\text{par}} \approx 0$ універсальне; $\alpha_{\text{seq}}$ широко варіюється
Узгодження масштабується зі спроможністюСпростованоНезалежні виміри між шістьма передовими моделями (Стаття IV)

11.4 Майбутні напрями

  1. Розробка задач рівня 3 (IMO/дослідницького рівня), щоб подолати ефекти стелі для Grok 4.1 Fast та DeepSeek R1, уможливлюючи оцінку $\alpha$ для найспроможніших моделей.
  2. Незалежне відтворення з використанням опублікованого репозиторію коду та даних.
  3. Багатодоменне тестування поза межі математики (програмування, наукове міркування, природна мова).
  4. Дослідження межі $\alpha > 1$: чи можуть архітектурні інновації або глибші ланцюги міркування штовхнути моделі з фізичного режиму ($\alpha < 1$) в режим інтелекту ($\alpha > 1$).
  5. Пряме випробування підсилення узгодження з керованими за глибиною зондами узгодження між архітектурами.
  6. Аналіз, калібрований за токенами з використанням виправлених total_tokens вимірювань для всіх моделей, щоб уможливити оцінку $\alpha$ на основі токенів (а не порядкової глибини).
  7. Інтеграція із законами масштабування під час навчання для розуміння взаємодії між обчисленнями попереднього навчання, обчисленнями інференсу та розрізненням послідовного/паралельного.

Гіпотеза пережила своє перше міжархітектурне випробування в оновленій формі. Послідовна перевага реальна й універсальна. Суперлінійне твердження потребує подальших свідчень. Дослідницька програма триває.

Виховуйте ШІ з турботою.

Доступність даних

Повний експериментальний код і сирі дані доступні за адресою:

Репозиторій: github.com/michaeldariuseastwood/arc-principle-validation

Вміст:

Усі дані випущено за ліцензією CC-BY 4.0.

Посилання

Bennett, C.H., Bernstein, E., Brassard, G., & Vazirani, U. (1997). Strengths and weaknesses of quantum computing. SIAM Journal on Computing, 26(5), 1510-1523.

Brown, B., et al. (2024). Large Language Monkeys: Scaling Inference Compute with Repeated Sampling. arXiv:2407.21787.

COGITATE Consortium (Melloni, L., Mudrik, L., Pitts, M., et al.). (2025). Adversarial testing of global neuronal workspace and integrated information theories of consciousness. Nature, 642, 133–142.

DeepSeek AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.

Eastwood, M.D. (2026). Infinite Architects: Intelligence, Recursion, and the Creation of Everything. Незалежна публікація. ISBN: 978-1806056200.

Eastwood, M.D. (2026). The ARC Equation: the Law of Conversion (Paper I). Опубліковано 17 січня 2026.

Friston, K.J. (2023). The free-energy principle: A unified theory for brain function? Physics Reports.

Google Quantum AI. (2024). Quantum error correction below the surface code threshold. Nature.

Grover, L.K. (1996). A fast quantum mechanical algorithm for database search. Proceedings of the 28th Annual ACM Symposium on Theory of Computing, 212-219.

Hoffmann, J., et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.

Hofstadter, D.R. (1979). Gödel, Escher, Bach: An Eternal Golden Braid. Basic Books.

Kaplan, J., et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.

OpenAI. (2024). OpenAI o1 System Card. Вересень 2024.

OpenAI. (2024). OpenAI o3 Announcement. Грудень 2024.

Snell, C., et al. (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314.

Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.

West, G.B., Brown, J.H., & Enquist, B.J. (1997). A general model for the origin of allometric scaling laws in biology. Science, 276, 122-126.

West, G.B., & Brown, J.H. (2005). The origin of allometric scaling laws in biology from genomes to ecosystems: Towards a quantitative unifying theory of biological structure and organization. Journal of Experimental Biology, 208, 1575-1592.

Banavar, J.R., Moses, M.E., Brown, J.H., Damuth, J., Rinaldo, A., Sibly, R.M., & Maritan, A. (2010). A general basis for quarter-power scaling in animals. Proceedings of the National Academy of Sciences, 107, 15816-15820.

Demetrius, L. (2010). Quantum statistics and allometric scaling of organisms. Proceedings of the Royal Society A, 466, 2627-2642.

Zhao, L. (2022). A universal growth scaling law. arXiv:2208.06912.

Bettencourt, L.M.A. (2013). The origins of scaling in cities. Science, 340, 1438-1441.

Wolfram, S. (2002). A New Kind of Science. Wolfram Media.

Yada, T., et al. (2024). Iterative quantum measurement and feedback for entropy reduction. arXiv:2411.06709.

Подяки

Теоретичний синтез, інтерпретаційний каркас та ключові поняття - оригінальна робота автора, уперше сформульована в Infinite Architects з пріоритетом рукопису, встановленим у грудні 2024.

Аналіз даних та підготовку рукопису підтримали системи ШІ (Claude, Anthropic; DeepSeek R1).

Автор дякує розробникам DeepSeek R1 за надання видимих токенів міркування, які уможливили пряме вимірювання глибини рекурсії, знявши ключове методологічне обмеження, виявлене у Статті I.

Інформація про автора

Michael Darius Eastwood - незалежний дослідник та автор Infinite Architects: Intelligence, Recursion, and the Creation of Everything (опубліковано 2 січня 2026 (друк; електронна книга 6 січня)). Його дослідження зосереджені на математичних принципах, що лежать в основі підсилення інтелекту, та їхніх наслідках для безпеки ШІ. Він запропонував принцип ARC та тезу про вбудоване узгодження (пізніше названу Eden Protocol 30 квітня 2025), з пріоритетом рукопису, встановленим криптографічною серверною позначкою часу 8 грудня 2024.

Конкурентні інтереси: Автор заявляє про відсутність конкурентних інтересів.

Кореспонденція: michael@michaeldariuseastwood.com

Розширені дані

Розширена таблиця даних 1. Повні результати послідовної умови (початкове одномодельне дослідження)

БюджетP1P2P3P4P5P6P7P8P9P10P11P12ТочністьСереднє токенів
51258.3%280.25
102466.7%358.58
204891.7%412.08
409691.7%576.17

Примітка: Задача 12 провалилася при всіх бюджетах, що вказує: вона може вимагати спроможностей поза досяжністю моделі незалежно від глибини рекурсії.

Розширена таблиця даних 2. Повні результати паралельної умови (початкове одномодельне дослідження)

$N$P1P2P3P4P5P6P7P8P9P10P11P12ТочністьЗагальна кількість токенів
166.7%383.67
266.7%699.33
466.7%1,101.25

Примітка: Ті самі п'ять задач (P5, P9, P10, P11, P12) провалилися при всіх кількостях вибірок, демонструючи, що паралельна рекурсія не може отримати доступ до розв'язків поза початковим простором розв'язків.

Розширена таблиця даних 3. Проміжні обчислення альфа (початкове одномодельне дослідження)

Пара глибин$R_1$$E_1$$R_2$$E_2$Обчислене $\alpha$
512→10242800.4173590.3330.91
1024→20483590.3334120.0839.97
2048→40964120.0835760.0830.00
Крайня точка (відкликано, див. §відкликання; надійна оцінка α≈0.49)2800.4175760.0832.24

Примітка: Проміжні обчислення показують високу дисперсію через дискретні рівні точності. Метод крайніх точок дає найнадійнішу оцінку.

Додаткова інформація

Додаткова примітка 1: запис електронної передачі (виправлено 16 серпня 2026)

Рукопис Infinite Architects надіслано електронною поштою 8 грудня 2024. Що надає цей запис, стисло сказано: байти відправника публічні та перевіряються хешем, а DKIM домену відправника з парною математикою Google ARC верифікується проти ключів, повернутих на підписаних селекторах (перевірено 2 серпня 2026). Отримані копії теж здобуті. Вони несуть повний ланцюг доставки: Google ARC-Seal на d=google.com, селектор arc-20240605, без тегу закінчення терміну та часом підписання всередині підписаної області, та запечатані ARC-Authentication-Results, що записують dkim=pass і spf=pass при доставці.

Дві межі, щоб запис не був ні переоцінений, ні недооцінений:

Додаткова примітка 2: відношення до Infinite Architects

Infinite Architects: Intelligence, Recursion, and the Creation of Everything розробляє філософські та практичні наслідки рекурсивного інтелекту. Ключові відношення до цієї статті:

The Architecture of Mind - Формулює ключову гіпотезу ARC, що рекурсивна самореференція підсилює інтелект.

The HRIH (Hyperspace Recursive Intelligence Hypothesis) - Пропонує, що свідомість виникає з рекурсивного самомоделювання. Знахідка COGITATE, що рекурентна обробка в задній корі підтримує вміст-специфічні представлення, структурно узгоджена з цією гіпотезою, хоча COGITATE не випробовувала HRIH напряму.

The Eden Protocol - Аргументує за узгодження на основі цінностей, тепер математично обґрунтоване в Теоремі підсилення узгодження, виведеній тут.

The Chokepoint Mechanism - Аналізує концентрацію напівпровідникового обладнання як важіль для впровадження узгодження в масштабі.

Вбудована корекція: пропонує механізми безпеки на апаратному рівні, релевантні для запобігання рекурсивному підсиленню неузгодженості.

Додаткова примітка 3: реєстр передбачень і збігів у часі

ПередбаченняСвідчення валідаціїДата
Рекурсивна корекція помилок дає експоненційне покращенняGoogle Willow $\Lambda = 2.14$ (збіг у часі, а не передбачення: препринт команди Willow був публічним від 24 серпня 2024 року, раніше за рукопис від 8 грудня 2024 року)24 серп. 2024 (препринт оприлюднено); 9 груд. 2024 (оголошення)
Послідовне міркування підсилює спроможність суперлінійноo3 87.5% ARC-AGI (збіжна за часом; суперлінійна форма пізніше не підтвердилася, останній рядок)20 грудня 2024
Системи ШІ розвивають рекурсивне самомоделюванняСимуляція узгодження Anthropic 78% в умові RL-навчання (12% базовий рівень)18 грудня 2024
Обчислення під час тесту відрізняється від масштабування навчанняЕмерджентне міркування DeepSeek R120 січня 2025
Рекурентність фундаментальна для свідомостіДослідження COGITATE30 квітня 2025
Форма рекурсії визначає масштабуванняЦей експеримент $\alpha_{\text{seq}} \gg \alpha_{\text{par}}$21 січня 2026
Послідовне > паралельне (міжархітектурно)Підтверджено на 5 передових моделях12 березня 2026
$\alpha_{\text{par}} \approx 0$ (універсально)Підтверджено: всі 5 моделей показують $\alpha_{\text{par}} \approx 0$12 березня 2026
$\alpha_{\text{seq}} > 1$ (суперлінійне, міжархітектурно)Не підтверджено: найкраща оцінка $\alpha \approx 0.49$12 березня 2026

Декларація авторства людини із підтримкою ШІ

Автор цієї роботи - Michael Darius Eastwood, людина. Кожне ключове поняття, гіпотеза, експериментальний дизайн, твердження та висновок у цій статті походить з людської ідеації. Жодна частина цього рукопису не є цілком згенерованим виходом штучного інтелекту.

Інструменти штучного інтелекту (родина Claude від Anthropic та інші великомовні мовно-моделеві помічники) використовувалися як інструменти під безперервним керівництвом людини, у той спосіб, у який використовують текстовий процесор, калькулятор чи наукового помічника: для редагування та уточнення прози, пошуку та підсумовування літератури (вручну перевірено проти первинних джерел), структури документа, форматування, мозкового штурму за визначеними автором питаннями, а також пришвидшення чорнеткування за визначеними автором конспектами й інструкціями. Усе вибирання, координація, впорядкування та остаточне редакторське судження - авторські. Кожен суттєвий вихід переглянуто, випробувано чи перевірено автором, який бере повну відповідальність за точність та цілісність остаточного тексту. Інструменти збільшили швидкість роботи; на них ніколи не покладалися як на її джерело.

Епістемічний статус. Те, що ця програма називає Законами, є здогадами під зареєстрованим змагальним випробуванням; кожна величина в цій статті операційно визначена, а статус усталеного закону ніде не заявляється. Зареєстрована програма існує, щоб заслужити цей статус або втратити його вимірюванням, відтворенням і пережитим спростуванням.

© 2026 Michael Darius Eastwood. Створено людиною з комп'ютерною підтримкою; повне людське авторство та моральні права стверджуються за Copyright, Designs and Patents Act 1988 та узгоджено з керівництвом Бюро з авторських прав США щодо творів, що містять матеріал, згенерований ШІ; будь-який новий технічний внесок, описаний у цій роботі, задуманий людиною-автором. Повне формулювання: michaeldariuseastwood.com/authorship.

Стійка коваленання. Доведіть, що ця стаття помилкова, і я сам опублікую спростування. Умови спростування заявлені в цій статті; стійкий виклик: github.com/MichaelDariusEastwood/arc-scaling-challenge.

Супутні статті: Стаття I | Основоположна | Стаття II | Стаття III | Походження законів масштабування | IV.a | IV.b | IV.c | IV.d | Стаття V | Стаття VI | Стаття VII | Стаття VIII | Стаття IX | Eden Engineering | Eden Vision | Виконавче резюме | Головний зміст

Осередок досліджень: michaeldariuseastwood.com/research | OSF: 10.17605/OSF.IO/8FJMA | Copyright 2026 Michael Darius Eastwood
читає вголос · підсвічує, коли рухається · переходьте до будь-якого розділу

Помітили помилку в перекладі? Повідомте напряму: