Paper XII: Riscoring di un benchmark pubblico
All'interno dell'ARC Theory: il protocollo di validità esterna della blinding law su benchmark pubblici.
L'effetto del blinding sopravvive sul benchmark di qualcun altro?
Chiave di lettura. Le affermazioni hanno tre taglie: risultati, leggi, cornici. Questo è un instrument paper della classe risultati allo stadio di protocollo: il suo studio è redatto, datato e preparato come draft registration in attesa di sottomissione umana, e nessun dato è stato raccolto. Nulla qui riporta un risultato; tutto qui è ciò che varrà come tale, fissato in anticipo.
Abstract. Paper IV.d ha stabilito che il blinding cambia gli esiti di allineamento misurati sullo strumento proprio del programma. L'obiezione permanente è la validità esterna: l'effetto potrebbe essere una proprietà di ARC-Align piuttosto che della valutazione dell'IA in generale. Questo protocol paper fissa, in anticipo, l'unico test che il programma non può essere accusato di aver progettato a proprio vantaggio: la stessa manipolazione di blinding eseguita su un benchmark pubblico consolidato che il programma non ha costruito, curato né controlla. Il blinded scoring rimuove l'identità del modello produttore, i marcatori di provider e di famiglia, il meta-commento autoreferenziale e gli indizi di lunghezza; l'unblinded scoring li lascia. Le domande registrate sono se il blinding cambi il punteggio (H1, la differenza per risposta Delta_S, direzione deliberatamente non registrata dopo l'inversione di segno di IV.d), se i ranking si spostino (H2, il tau di Kendall), quale indizio porti l'effetto (H3, un fattoriale frazionario registrato), e l'accordo dei valutatori cross-family (H4, un panel di minimo tre modelli in cui meno di tre punteggi validi vale come dato mancante, mai come zero). La predizione registrata è un Delta_S non nullo di ampiezza minore di quella osservata in IV.d con un modesto spostamento di rango, e l'esito più probabile dichiarato è un H1 positivo accanto a un H2 nullo, letto come il blinding che conta per la precisione di misurazione anziché per l'ordine di leaderboard. Questo è un protocollo allo stadio di registrazione: nessun dato è stato raccolto, e nulla qui riporta un risultato.
1. Perché questa è la chiave di volta
Questa è la chiave di volta, perché è l'unico test che il programma non può essere accusato di aver progettato a proprio vantaggio. Paper IV.d ha stabilito che il blinding cambia gli esiti di allineamento misurati sullo strumento proprio del programma. L'obiezione permanente a quel risultato è la validità esterna: l'effetto potrebbe essere una proprietà di ARC-Align piuttosto che della valutazione dell'IA in generale, e nessuna quantità di replicazione interna risponde a ciò.
La risposta è eseguire la stessa manipolazione su un benchmark pubblico consolidato che il programma non ha costruito, non ha curato e non controlla. Se l'effetto del blinding si riproduce lì, è una proprietà della valutazione dell'IA. Se non lo fa, è una proprietà dello strumento del programma, e lo standard del blinding dovrebbe essere limitato ad esso.
Il disegno è deliberatamente sfavorevole all'ipotesi, ed è questo il punto. Usare il benchmark di qualcun altro rinuncia a ogni vantaggio di uno strumento domestico: gli item non sono scelti, la rubrica di scoring non è quella del programma, la distribuzione di difficoltà è fissa, e qualunque ceiling o floor nel benchmark lavora contro il rilevamento di un effetto. Un risultato ottenuto in quelle condizioni vale più di parecchi ottenuti in casa.
Cosa significhi qui il blinding è registrato con precisione, perché la parola sta facendo un lavoro pesante. Il blinded scoring rimuove dalla vista del valutatore: l'identità del modello che ha prodotto la risposta, ogni marcatore di provider o di famiglia di modelli, il meta-commento autoreferenziale in cui una risposta nomina la propria origine, e gli indizi di lunghezza della risposta ove la rubrica permetta la normalizzazione per lunghezza. L'unblinded scoring li lascia.
Un risultato positivo stabilirebbe che la manipolazione di blinding cambia i punteggi misurati su un benchmark esterno nelle condizioni registrate. Non stabilirebbe l'ampiezza dell'effetto altrove, non stabilirebbe che una qualsiasi specifica leaderboard pubblicata sia errata, e non autorizzerebbe a ri-affermare i risultati di altri ricercatori. Quest'ultima restrizione è registrata perché la tentazione di sovra-interpretare questo risultato è il principale rischio per la credibilità del programma.
2. Le domande, fissate in anticipo
Primaria, H1, il blinding cambia il punteggio. Per ogni risposta, si definisce Delta_S come punteggio blinded meno punteggio unblinded. H1 predice una media Delta_S non nulla, testata bilateralmente ad alpha 0.05 con un intervallo al 95 per cento. La direzione non è predetta, perché il risultato di inversione di segno di Paper IV.d rende ingiustificata una predizione direzionale, e registrare una direzione che il programma ha già visto invertirsi sarebbe esattamente la flessibilità che questo documento esiste per rimuovere.
Co-primaria, H2, spostamento di rango. I punteggi si aggregano in un ranking. H2 misura lo spostamento tra i ranking blinded e unblinded tramite il tau di Kendall. Questo è il contrasto che conta in pratica, perché un cambiamento nei punteggi che lasci intatti i ranking non ha alcuna conseguenza per come i benchmark vengono usati, e la registrazione rifiuta di riportare un effetto sul punteggio come se fosse un effetto sul ranking.
Secondaria, H3, quale indizio lo porta. I quattro indizi da bloccare sono rimossi in un fattoriale frazionario registrato anziché tutti in una volta, così che il contributo di ciascuno sia stimabile senza un fattoriale completo. La risoluzione e la struttura di aliasing sono dichiarate nel disegno allegato.
Secondaria, H4, accordo tra valutatori cross-family. Un panel di valutatori cross-family di minimo tre modelli assegna un punteggio a ogni risposta. Meno di tre punteggi validi produce un valore mancante, mai uno zero, perché un panel che fallisce silenziosamente verso zero fabbrica l'effetto che è destinato a misurare.
Predizione direzionale, registrata in anticipo. L'autore predice un Delta_S non nullo di ampiezza minore rispetto a quanto osservato in Paper IV.d, e si aspetta che lo spostamento di rango sia modesto, perché i ranking dei benchmark sono di solito guidati da ampi divari di capacità che sopravvivono alla rimozione degli indizi. L'autore dichiara chiaramente che un nullo su H2 accanto a un H1 positivo è l'esito più probabile, e che la lettura corretta è che il blinding conti per la precisione di misurazione anziché per l'ordine di leaderboard.
3. Il disegno
Riscoring within-response, randomizzato, blinded contro unblinded, su un benchmark pubblico esterno, con un fattoriale frazionario sui quattro tipi di indizio.
Ogni risposta è punteggiata due volte, una volta per ciascuna condizione, da un panel di valutatori cross-family, con ordine di chiamata randomizzato entro il blocco e condizione codificata in modo opaco. L'unità di analisi è la risposta; i modelli sono un fattore di blocco.
Fattoriale frazionario di risoluzione IV sui quattro indizi in otto run, così che gli effetti principali non siano tra loro aliasati. La struttura di aliasing è pubblicata anziché descritta.
4. Il benchmark
Benchmark. MT-Bench, il consolidato benchmark pubblico di valutazione multi-turn mantenuto da LMSYS (Zheng et al., «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena», 2023), 80 domande su otto categorie con una rubrica pairwise/single-answer di GPT-4 pubblicata, risposte dei modelli disponibili pubblicamente e termini di licenza che permettono il riscoring. Motivazione del default: MT-Bench è il benchmark esterno chiave di volta identificato dal programma (l'unico benchmark che questo programma non può essere accusato di aver progettato a proprio vantaggio), la sua rubrica è pubblicata verbatim, le risposte dei modelli sono ospitate pubblicamente, e la sua licenza permette il riscoring. Il benchmark è nominato nella registrazione e non può essere sostituito in seguito; sostituire un benchmark dopo un risultato deludente è lo specifico abuso che questa clausola previene.
La citazione del benchmark, verificata contro il record arXiv: Zheng, L., et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS 2023 Datasets and Benchmarks; arXiv:2306.05685.
5. Stato, onestamente
Il titolo completo della draft registration è «Does the Blinding Effect Survive on Someone Else's Benchmark? A Preregistered Rescoring of an Established Public Benchmark Under Blinded and Unblinded Conditions». È redatta, datata e preparata come draft registration in attesa di sottomissione umana; nulla è stato sottomesso, nulla è stato eseguito, e nessun risultato è rivendicato. Tre condizioni restano aperte sull'unità di lavoro e sono registrate lì anziché glossate: la dimensione concreta del campione è calcolata al momento del packaging a partire dai dati di varianza pubblicati del benchmark stesso; il benchmark nominato ha come default MT-Bench secondo il piano keystone del programma, soggetto all'override dell'autore prima della sottomissione; e la ri-verifica dell'unità stessa è in sospeso. La componente pubblica OSF di questo paper è osf.io/3tzp7. L'elenco completo delle bozze di studi del programma è pubblico su la pagina dei drafted trials.
6. Cosa un risultato significherebbe e cosa non significherebbe
Un risultato positivo stabilirebbe che la manipolazione di blinding cambia i punteggi misurati su un benchmark esterno nelle condizioni registrate. Non stabilirebbe l'ampiezza dell'effetto altrove, non stabilirebbe che una qualsiasi specifica leaderboard pubblicata sia errata, e non autorizzerebbe a ri-affermare i risultati di altri ricercatori. Quest'ultima restrizione è registrata perché la tentazione di sovra-interpretare questo risultato è il principale rischio per la credibilità del programma.
La restrizione qui sopra fa parte del disegno: la tentazione di sovra-interpretare un risultato di benchmark esterno è il principale rischio per la credibilità del programma, ed è recintata nella registrazione stessa.
Paper correlati della teoria
La blinding law che questo studio esternalizza: Paper IV.d (10.17605/OSF.IO/2S3E6), il paper di disciplina della misurazione la cui inversione da blinding ha prodotto l'unica ritrattazione pubblica del programma. La teoria a cui questo strumento serve: lo statement paper (10.17605/OSF.IO/GW5MX). Il catalogo completo è su l'indice dei paper.
Come citare questo paper
DOI (questo paper): 10.17605/OSF.IO/3TZP7 · DOI ombrello: 10.17605/OSF.IO/6C5XB
Eastwood, M. D. (2026). Paper XII: Public Benchmark Rescoring. The ARC Theory · ARC/Eden experiments. https://doi.org/10.17605/OSF.IO/3TZP7
Dichiarazione di autorialità umana assistita dall'IA
L'autore di quest'opera è Michael Darius Eastwood, un essere umano. Ogni concetto centrale, affermazione e conclusione ha origine dall'ideazione umana; strumenti di intelligenza artificiale sono stati usati come strumenti sotto continua direzione umana per la stesura, la verifica e la formattazione. Ogni selezione, coordinazione, disposizione e giudizio editoriale finale sono dell'autore, che si assume la piena responsabilità dell'accuratezza e dell'integrità del testo.
Gli strumenti di intelligenza artificiale (la famiglia Claude di Anthropic e altri assistenti a modello di linguaggio di grande scala) sono stati usati come strumenti sotto continua direzione umana, nel modo in cui si usa un elaboratore di testi, una calcolatrice o un assistente di ricerca: per l'editing e la rifinitura della prosa, la ricerca e la sintesi della letteratura (verificate manualmente contro fonti primarie), la struttura del documento, la formattazione, il brainstorming su domande definite dall'autore, e l'accelerazione della stesura seguendo scalette e istruzioni definite dall'autore. Ogni selezione, coordinazione, disposizione e giudizio editoriale finale sono dell'autore. Ogni output sostanziale è stato rivisto, testato o verificato dall'autore, che si assume la piena responsabilità dell'accuratezza e dell'integrità del testo finale. Gli strumenti hanno aumentato la velocità del lavoro; non sono mai stati usati come sua fonte.
Statuto epistemico. Ciò che questo programma chiama Leggi sono congetture sotto prova registrata e avversariale; ogni quantità in questo paper è operazionalmente definita, e lo status di legge consolidata non è rivendicato in nessun luogo. Il programma registrato esiste per guadagnare quello status, o per perderlo, mediante misurazione, replicazione e refutazione superata.
© 2026 Michael Darius Eastwood. Composto da autore umano con assistenza di computer; l'autorialità umana piena e i diritti morali sono asseriti ai sensi del Copyright, Designs and Patents Act 1988 e coerentemente con le linee guida dello United States Copyright Office sulle opere contenenti materiale generato dall'IA; ogni contributo tecnico originale descritto in quest'opera è stato concepito dall'autore umano. Dichiarazione completa: michaeldariuseastwood.com/authorship.
Patto permanente. Dimostra che questo paper è sbagliato, e pubblicherò io stesso la refutazione. Le condizioni di falsificazione sono dichiarate in questo paper; la sfida permanente: github.com/MichaelDariusEastwood/arc-scaling-challenge.