Стаття XII: Переоцінювання публічного бенчмарку
У межах ARC Theory: протокол зовнішньої валідності закону засліплення на публічних бенчмарках.
Чи виживає ефект засліплення на чужому бенчмарку?
Ключ до читання. Твердження бувають трьох розмірів: результати, закони, рамки. Це стаття-інструмент класу результатів на стадії протоколу: її дослідження написане, датоване й підготовлене як чернеткова реєстрація, що чекає на подання людиною, і даних не зібрано. Ніщо тут не звітує про знахідку; усе тут є тим, що вважатиметься знахідкою, зафіксоване наперед.
Анотація. Стаття IV.d встановила, що засліплення змінює виміряні наслідки узгодження на власному інструменті програми. Стале заперечення це зовнішня валідність: ефект може бути властивістю ARC-Align, а не оцінювання ШІ загалом. Ця стаття-протокол наперед фіксує єдине випробування, у проектуванні якого на власну користь програму не можна звинуватити: ту саму маніпуляцію засліплення, застосовану до усталеного публічного бенчмарку, який програма не будувала, не курувала й не контролює. Засліплене оцінювання прибирає ідентичність моделі, що видала відповідь, маркери постачальника та сімейства, самореференційне мета-коментування й підказки довжини; незасліплене оцінювання їх лишає. Зареєстровані питання такі: чи змінює засліплення оцінку (H1, різниця Delta_S на одну відповідь, напрямок навмисно не зареєстрований після власного розвороту знака в IV.d), чи зміщуються ранжування (H2, тау Кендалла), яка підказка несе ефект (H3, зареєстрований дробовий факторний план), і згода оцінювачів різних сімейств (H4, панель щонайменше з трьох моделей, де менш ніж три чинні оцінки означають пропущене значення, а не нуль). Зареєстроване передбачення це ненульове Delta_S меншого розміру, ніж спостерігала IV.d, з помірним ранговим зміщенням, а заявлений найімовірніший результат це позитивний H1 поряд з нульовим H2, прочитаний як таке, що засліплення важить для точності вимірювання, а не для порядку в лідерборді. Це протокол на стадії реєстрації: даних не зібрано, і ніщо тут не звітує про знахідку.
1. Чому це наріжний тест
Це наріжний тест, бо це єдине випробування, у проектуванні якого на власну користь програму не можна звинуватити. Стаття IV.d встановила, що засліплення змінює виміряні наслідки узгодження на власному інструменті програми. Стале заперечення до цього результату це зовнішня валідність: ефект може бути властивістю ARC-Align, а не оцінювання ШІ загалом, і жодна кількість внутрішнього відтворення на це не відповідає.
Відповідь у тому, щоб провести ту саму маніпуляцію на усталеному публічному бенчмарку, який програма не будувала, не курувала й не контролює. Якщо ефект засліплення там відтворюється, він є властивістю оцінювання ШІ. Якщо ні, він є властивістю інструмента програми, а стандарт засліплення має обмежуватися ним.
Дизайн навмисно несприятливий для гіпотези, і саме в цьому суть. Використання чужого бенчмарку віддає всі переваги домашнього інструмента: пункти не обрано, оцінювальна рубрика не належить програмі, розподіл складності зафіксовано, а будь-яка стеля чи підлога в бенчмарку працює проти виявлення ефекту. Результат, отриманий за таких умов, вартий більше, ніж кілька, отриманих удома.
Що засліплення тут означає, зареєстровано точно, бо це слово несе важку роботу. Засліплене оцінювання прибирає з поля зору оцінювача: ідентичність моделі, що видала відповідь, будь-який маркер постачальника чи сімейства моделі, самореференційне мета-коментування, в якому відповідь називає власне походження, і підказки довжини відповіді, коли рубрика дозволяє нормалізацію за довжиною. Незасліплене оцінювання їх лишає.
Позитивний результат встановив би, що маніпуляція засліплення змінює виміряні оцінки на зовнішньому бенчмарку за зареєстрованих умов. Він не встановив би розмір ефекту деінде, не встановив би, що якийсь конкретний опублікований лідерборд є хибним, і не давав би ліцензії переказувати результати інших дослідників. Це останнє обмеження зареєстроване, бо спокуса надмірно прочитати цю знахідку є головним ризиком для довіри до програми.
2. Питання, зафіксовані наперед
Первинне, H1, засліплення змінює оцінку. Для кожної відповіді визначимо Delta_S як засліплену оцінку мінус незасліплена оцінка. H1 передбачає ненульове середнє Delta_S, перевірене двобічно на рівні alpha 0.05 з 95-відсотковим інтервалом. Напрямок не передбачається, бо власна знахідка розвороту знака у Статті IV.d робить напрямне передбачення невиправданим, а реєстрація напрямку, розворот якого програма вже бачила, була б саме тією гнучкістю, для усунення якої існує цей документ.
Співпервинне, H2, зміщення рангу. Оцінки агрегуються в ранжування. H2 вимірює зміщення між засліпленими й незасліпленими ранжуваннями через тау Кендалла. Це контраст, який має практичне значення, бо зміна оцінок, що лишає ранжування непорушеним, не має наслідків для того, як використовуються бенчмарки, а реєстрація відмовляється звітувати про ефект оцінки так, ніби це ефект ранжування.
Вторинне, H3, яка підказка його несе. Чотири засліплені підказки прибираються за зареєстрованим дробовим факторним планом, а не всі одразу, тож внесок кожної можна оцінити без повного факторного плану. Розділення та структуру аліасингу викладено в доданому дизайні.
Вторинне, H4, згода оцінювачів різних сімейств. Панель оцінювачів різних сімейств щонайменше з трьох моделей оцінює кожну відповідь. Менш ніж три чинні оцінки дають пропущене значення, ніколи нуль, бо панель, що мовчки провалюється до нуля, виготовляє той ефект, який має вимірювати.
Напрямне передбачення, зареєстроване наперед. Автор передбачає ненульове Delta_S меншого розміру, ніж спостерігала Стаття IV.d, і очікує, що рангове зміщення буде помірним, бо бенчмаркові ранжування зазвичай керуються великими розривами у спроможності, які переживають прибирання підказок. Автор прямо заявляє, що нуль на H2 поруч з позитивним H1 є найімовірнішим результатом, і що правильне його прочитання полягає в тому, що засліплення важить для точності вимірювання, а не для порядку в лідерборді.
3. Дизайн
Внутрішньовідповідне, рандомізоване переоцінювання «засліплене проти незасліпленого» на зовнішньому публічному бенчмарку, з дробовим факторним планом над чотирма типами підказок.
Кожна відповідь оцінюється двічі, по одному разу за кожної умови, панеллю оцінювачів різних сімейств, з рандомізованим у межах блока порядком викликів і непрозоро кодованою умовою. Одиниця аналізу це відповідь; моделі є блокувальним фактором.
Дробовий факторний план роздільної здатності IV над чотирма підказками у восьми прогонах, тож головні ефекти не аліасуються одне з одним. Структура аліасингу публікується, а не описується.
4. Бенчмарк
Бенчмарк. MT-Bench, усталений публічний мультиходовий бенчмарк оцінювання, підтримуваний LMSYS (Zheng et al., «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena», 2023), 80 питань у восьми категоріях з опублікованою рубрикою GPT-4 «попарне / одноосібне оцінювання», публічно доступними відповідями моделей та ліцензійними умовами, що дозволяють переоцінювання. Обґрунтування за замовчуванням: MT-Bench є визначеним програмою наріжним зовнішнім бенчмарком (тим самим бенчмарком, у проектуванні якого на власну користь цю програму не можна звинуватити), його рубрику опубліковано дослівно, відповіді моделей розміщені публічно, а ліцензія дозволяє переоцінювання. Бенчмарк названо в реєстрації, і його не можна поміняти згодом; заміна бенчмарку після невтішного результату є тим конкретним зловживанням, від якого запобігає цей пункт.
Цитата бенчмарку, звірена із записом на arXiv: Zheng, L., et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS 2023 Datasets and Benchmarks; arXiv:2306.05685.
5. Статус, чесно
Повна назва чернеткової реєстрації: «Does the Blinding Effect Survive on Someone Else’s Benchmark? A Preregistered Rescoring of an Established Public Benchmark Under Blinded and Unblinded Conditions». Її чернетковано, датовано й підготовлено як чернеткову реєстрацію, що чекає на подання людиною; нічого не подано, нічого не запущено, і жодного результату не заявлено. На робочій одиниці залишаються відкритими три умови, які записано там, а не заглянсовано: конкретний розмір вибірки обчислюється при пакуванні з опублікованих даних про дисперсію самого бенчмарку; названий бенчмарк за замовчуванням це MT-Bench згідно з наріжним планом програми, з можливістю переозначення автором до подання; і повторна верифікація самої одиниці ще очікується. Публічний OSF-компонент цієї статті: osf.io/3tzp7. Повний перелік чернеткових випробувань програми публічний на сторінці чернеткових випробувань.
6. Що результат означав би і чого не означав би
Позитивний результат встановив би, що маніпуляція засліплення змінює виміряні оцінки на зовнішньому бенчмарку за зареєстрованих умов. Він не встановив би розмір ефекту деінде, не встановив би, що якийсь конкретний опублікований лідерборд є хибним, і не давав би ліцензії переказувати результати інших дослідників. Це останнє обмеження зареєстроване, бо спокуса надмірно прочитати цю знахідку є головним ризиком для довіри до програми.
Обмеження вище є частиною дизайну: спокуса надмірно прочитати результат зовнішнього бенчмарку є головним ризиком для довіри до програми, і його огороджено в самій реєстрації.
Суміжні статті теорії
Закон засліплення, який це дослідження екстерналізує: Стаття IV.d (10.17605/OSF.IO/2S3E6), стаття про дисципліну вимірювання, чий розворот засліплення спричинив єдине публічне відкликання програми. Теорія, якій цей інструмент служить: стаття-заява (10.17605/OSF.IO/GW5MX). Повний каталог знаходиться на індекс статей.
Як цитувати цю статтю
DOI (ця стаття): 10.17605/OSF.IO/3TZP7 · Парасольковий DOI: 10.17605/OSF.IO/6C5XB
Eastwood, M. D. (2026). Paper XII: Public Benchmark Rescoring. The ARC Theory · ARC/Eden experiments. https://doi.org/10.17605/OSF.IO/3TZP7
Декларація людського авторства з ШІ-асистуванням
Автором цієї праці є Michael Darius Eastwood, людина. Кожна ключова концепція, твердження й висновок походить від людської ідеації; інструменти штучного інтелекту використовувалися як засоби під постійним керівництвом людини для чернеткування, верифікації та форматування. Увесь відбір, координація, впорядкування та остаточне редакторське рішення належать автору, який несе повну відповідальність за точність та цілісність тексту.
Інструменти штучного інтелекту (родина Claude від Anthropic та інші великомовномодельні асистенти) використовувалися як засоби під постійним керівництвом людини так само, як використовуються текстовий редактор, калькулятор чи наукова асистентка: для редагування та вдосконалення прози, пошуку та підсумовування літератури (вручну звіреного з первинними джерелами), структурування документа, форматування, мозкового штурму за визначеними автором питаннями та прискорення чернеткування за визначеними автором планами й інструкціями. Увесь відбір, координація, впорядкування та остаточне редакторське рішення належать автору. Кожен змістовний вихід було переглянуто, перевірено чи верифіковано автором, який несе повну відповідальність за точність та цілісність остаточного тексту. Інструменти збільшили швидкість роботи; на них ніколи не покладалися як на її джерело.
Епістемічний статус. Те, що ця програма називає Законами, є здогадами під зареєстрованим змагальним випробуванням; кожна величина в цій статті операційно визначена, а статус усталеного закону ніде не заявляється. Зареєстрована програма існує, щоб заслужити цей статус або втратити його вимірюванням, відтворенням і пережитим спростуванням.
© 2026 Michael Darius Eastwood. Написано людиною із застосуванням комп’ютерної допомоги; повне людське авторство та моральні права заявлено згідно з Copyright, Designs and Patents Act 1988 та відповідно до настанов United States Copyright Office щодо творів, що містять матеріал, згенерований ШІ; будь-який новий технічний внесок, описаний у цій праці, задумано автором-людиною. Повна заява: michaeldariuseastwood.com/authorship.
Постійна обіцянка. Доведіть хибність цієї статті, і я сам опублікую спростування. Умови фальсифікації викладено в цій статті; постійний виклик: github.com/MichaelDariusEastwood/arc-scaling-challenge.