Paper XII: Recalificación de un benchmark público
Dentro de la ARC Theory: el protocolo de validez externa de la ley de cegamiento sobre benchmarks públicos.
¿Sobrevive el efecto del cegamiento en el benchmark de otra persona?
Clave de lectura. Las afirmaciones vienen en tres tamaños: resultados, leyes, marcos. Este es un artículo instrumento de clase resultados en la etapa de protocolo: su estudio está redactado, fechado y preparado como registro preliminar a la espera de presentación humana, y no se han recogido datos. Nada aquí informa un hallazgo; todo aquí es lo que contará como uno, fijado por adelantado.
Resumen. Paper IV.d estableció que el cegamiento cambia los resultados de alineación medidos en el instrumento propio del programa. La objeción permanente es la validez externa: el efecto podría ser una propiedad de ARC-Align y no de la evaluación de IA en general. Este artículo de protocolo fija, por adelantado, la única prueba que no puede acusarse al programa de haber diseñado a su propia ventaja: la misma manipulación de cegamiento ejecutada sobre un benchmark público consolidado que el programa no construyó, no seleccionó ni controla. La puntuación cegada retira la identidad del modelo que produce la respuesta, los marcadores de proveedor y de familia, el meta-comentario autorreferencial y las señales de longitud; la puntuación sin cegar las conserva. Las preguntas registradas son si el cegamiento cambia la puntuación (H1, la diferencia por respuesta Delta_S, dirección deliberadamente no registrada tras la propia inversión de signo de IV.d), si los rangos se desplazan (H2, tau de Kendall), qué señal porta el efecto (H3, un factorial fraccionario registrado), y la concordancia entre evaluadores de distintas familias (H4, un panel mínimo de tres modelos en el que menos de tres puntuaciones válidas es un valor faltante, nunca un cero). La predicción registrada es un Delta_S no nulo de menor magnitud que el observado en IV.d con desplazamiento de rangos modesto, y el resultado más probable enunciado es un H1 positivo junto a un H2 nulo, leído como que el cegamiento importa para la precisión de la medición y no para el orden de la tabla de clasificación. Este es un protocolo en etapa de registro: no se han recogido datos, y nada aquí informa un hallazgo.
1. Por qué esta es la piedra angular
Esta es la piedra angular, porque es la única prueba que no puede acusarse al programa de haber diseñado a su propia ventaja. Paper IV.d estableció que el cegamiento cambia los resultados de alineación medidos en el instrumento propio del programa. La objeción permanente a ese resultado es la validez externa: el efecto podría ser una propiedad de ARC-Align en lugar de una propiedad de la evaluación de IA en general, y ninguna cantidad de replicación interna responde a eso.
La respuesta es ejecutar la misma manipulación sobre un benchmark público consolidado que el programa no construyó, no seleccionó y no controla. Si el efecto del cegamiento se reproduce allí, es una propiedad de la evaluación de IA. Si no lo hace, es una propiedad del instrumento del programa, y la norma de cegamiento debería acotarse a él.
El diseño es deliberadamente desfavorable a la hipótesis, y ese es el punto. Usar el benchmark de otra persona renuncia a toda ventaja de un instrumento propio: los ítems no se eligen, la rúbrica de puntuación no es la del programa, la distribución de dificultad está fijada, y cualquier techo o suelo del benchmark trabaja en contra de detectar un efecto. Un resultado obtenido bajo esas condiciones vale más que varios obtenidos en casa.
Lo que aquí significa el cegamiento se registra con precisión, porque la palabra hace un trabajo pesado. La puntuación cegada retira de la vista del evaluador: la identidad del modelo que produjo la respuesta, cualquier marcador de proveedor o de familia de modelos, el meta-comentario autorreferencial en el que una respuesta nombra su propio origen, y las señales de longitud de respuesta cuando la rúbrica permite normalización por longitud. La puntuación sin cegar las conserva.
Un resultado positivo establecería que la manipulación del cegamiento cambia las puntuaciones medidas en un benchmark externo bajo las condiciones registradas. No establecería el tamaño del efecto en otros lugares, no establecería que ninguna tabla de clasificación publicada específica sea errónea, y no autorizaría a reafirmar los resultados de otros investigadores. Esa última restricción se registra porque la tentación de sobreinterpretar este hallazgo es el principal riesgo para la credibilidad del programa.
2. Las preguntas, fijadas por adelantado
Primaria, H1, el cegamiento cambia la puntuación. Para cada respuesta, se define Delta_S como la puntuación cegada menos la puntuación sin cegar. H1 predice un Delta_S medio no nulo, probado a dos colas con alfa 0.05 y un intervalo del 95 por ciento. La dirección no se predice, porque el propio hallazgo de inversión de signo de Paper IV.d hace injustificada una predicción direccional, y registrar una dirección que el programa ya ha visto invertirse sería exactamente la flexibilidad que este documento existe para eliminar.
Coprimaria, H2, desplazamiento de rangos. Las puntuaciones se agregan en un ranking. H2 mide el desplazamiento entre los rankings cegado y sin cegar mediante la tau de Kendall. Este es el contraste que importa en la práctica, porque un cambio en las puntuaciones que deja los rankings intactos no tiene consecuencia para cómo se usan los benchmarks, y el registro se niega a informar un efecto sobre la puntuación como si fuera un efecto sobre el ranking.
Secundaria, H3, qué señal lo porta. Las cuatro señales cegadas se retiran en un factorial fraccionario registrado en lugar de todas a la vez, de modo que la contribución de cada una es estimable sin un factorial completo. La resolución y la estructura de alias se enuncian en el diseño adjunto.
Secundaria, H4, concordancia entre evaluadores de distintas familias. Un panel de evaluadores de distintas familias con un mínimo de tres modelos puntúa cada respuesta. Menos de tres puntuaciones válidas produce un valor faltante, nunca un cero, porque un panel que falla silenciosamente hacia cero fabrica el efecto que está destinado a medir.
Predicción direccional, registrada por adelantado. El autor predice un Delta_S no nulo de menor magnitud que el observado en Paper IV.d, y espera que el desplazamiento de rangos sea modesto, porque los rankings de los benchmarks los suelen impulsar grandes brechas de capacidad que sobreviven a la eliminación de señales. El autor enuncia llanamente que un nulo en H2 junto a un H1 positivo es el resultado más probable, y que su lectura correcta es que el cegamiento importa para la precisión de la medición y no para el orden de la tabla de clasificación.
3. El diseño
Recalificación intra-respuesta, aleatorizada, cegada frente a sin cegar sobre un benchmark público externo, con un factorial fraccionario sobre los cuatro tipos de señal.
Cada respuesta se puntúa dos veces, una vez bajo cada condición, por un panel de evaluadores de distintas familias, con el orden de llamada aleatorizado dentro del bloque y la condición codificada de modo opaco. La unidad de análisis es la respuesta; los modelos son un factor de bloqueo.
Factorial fraccionario de Resolución IV sobre cuatro señales en ocho ejecuciones, de modo que los efectos principales están sin alias entre sí. La estructura de alias se publica en lugar de describirse.
4. El benchmark
Benchmark. MT-Bench, el benchmark público consolidado de evaluación multiturno mantenido por LMSYS (Zheng et al., «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena», 2023), 80 preguntas repartidas en ocho categorías con una rúbrica GPT-4 pareada/de respuesta única publicada, respuestas de modelos disponibles públicamente, y términos de licencia que permiten la recalificación. Justificación del valor por defecto: MT-Bench es el benchmark externo piedra angular identificado por el programa (el único benchmark que no puede acusarse a este programa de haber diseñado a su propia ventaja), su rúbrica está publicada literalmente, las respuestas de los modelos están alojadas públicamente, y su licencia permite la recalificación. El benchmark se nombra en el registro y no puede sustituirse después; sustituir un benchmark tras un resultado decepcionante es el abuso específico que esta cláusula previene.
La cita del benchmark, verificada contra el registro de arXiv: Zheng, L., et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS 2023 Datasets and Benchmarks; arXiv:2306.05685.
5. Estado, honestamente
El título completo del registro preliminar es «Does the Blinding Effect Survive on Someone Else's Benchmark? A Preregistered Rescoring of an Established Public Benchmark Under Blinded and Unblinded Conditions». Está redactado, fechado y preparado como registro preliminar a la espera de presentación humana; no se ha presentado nada, no se ha ejecutado nada, y no se reclama ningún resultado. Tres condiciones permanecen abiertas en la unidad de trabajo y se registran allí en lugar de glosarse: el tamaño muestral concreto se computa en el empaquetado a partir de los datos de varianza publicados del propio benchmark; el benchmark nombrado tiene por defecto MT-Bench conforme al plan piedra angular del programa, sujeto al veto del autor antes de la presentación; y la propia re-verificación de la unidad está pendiente. El componente público de OSF para este artículo es osf.io/3tzp7. El listado completo de los ensayos redactados del programa es público en la página de ensayos redactados.
6. Qué significaría y qué no significaría un resultado
Un resultado positivo establecería que la manipulación del cegamiento cambia las puntuaciones medidas en un benchmark externo bajo las condiciones registradas. No establecería el tamaño del efecto en otros lugares, no establecería que ninguna tabla de clasificación publicada específica sea errónea, y no autorizaría a reafirmar los resultados de otros investigadores. Esa última restricción se registra porque la tentación de sobreinterpretar este hallazgo es el principal riesgo para la credibilidad del programa.
La restricción de arriba es parte del diseño: la tentación de sobreinterpretar un resultado de benchmark externo es el principal riesgo para la credibilidad del programa, y queda cercada en el propio registro.
Artículos relacionados de la teoría
La ley de cegamiento que este estudio externaliza: Paper IV.d (10.17605/OSF.IO/2S3E6), el artículo de disciplina de la medición cuya inversión del cegamiento produjo la única retractación pública del programa. La teoría a la que sirve este instrumento: el artículo de enunciado (10.17605/OSF.IO/GW5MX). El catálogo completo está en el índice de artículos.
Cómo citar este artículo
DOI (este artículo): 10.17605/OSF.IO/3TZP7 · DOI paraguas: 10.17605/OSF.IO/6C5XB
Eastwood, M. D. (2026). Paper XII: Public Benchmark Rescoring. The ARC Theory · ARC/Eden experiments. https://doi.org/10.17605/OSF.IO/3TZP7
Declaración de autoría humana asistida por IA
El autor de esta obra es Michael Darius Eastwood, un ser humano. Cada concepto central, afirmación y conclusión se origina en la ideación humana; se emplearon herramientas de inteligencia artificial como instrumentos bajo dirección humana continua para la redacción, la verificación y el formateo. Toda selección, coordinación, disposición y el juicio editorial final son del autor, que asume la plena responsabilidad de la exactitud y la integridad del texto.
Se emplearon herramientas de inteligencia artificial (la familia Claude de Anthropic y otros asistentes de modelo de lenguaje de gran tamaño) como instrumentos bajo dirección humana continua, del modo en que se utilizan un procesador de textos, una calculadora o un asistente de investigación: para edición y refinamiento de la prosa, búsqueda y resumen bibliográficos (verificados manualmente contra fuentes primarias), estructura del documento, formateo, tormenta de ideas frente a preguntas definidas por el autor, y aceleración de la redacción conforme a esquemas e instrucciones definidos por el autor. Toda selección, coordinación, disposición y el juicio editorial final son del autor. Cada salida sustantiva fue revisada, probada o verificada por el autor, que asume la plena responsabilidad de la exactitud y la integridad del texto final. Las herramientas aumentaron la velocidad del trabajo; nunca se dependió de ellas como su fuente.
Estatus epistémico. Lo que este programa nombra Leyes son conjeturas bajo prueba adversarial registrada; cada magnitud en este artículo está operacionalmente definida, y en ninguna parte se reclama el rango de ley establecida. El programa registrado existe para ganar ese rango, o para perderlo, mediante medición, replicación y refutación sobrevivida.
© 2026 Michael Darius Eastwood. De autoría humana con asistencia informática; se afirman la plena autoría humana y los derechos morales bajo la Copyright, Designs and Patents Act 1988 y de forma coherente con la orientación de la Oficina de Derechos de Autor de Estados Unidos sobre obras que contienen material generado por IA; cualquier contribución técnica novedosa descrita en este trabajo fue concebida por el autor humano. Declaración completa: michaeldariuseastwood.com/authorship.
Pacto permanente. Demuéstrame que este artículo es erróneo, y publicaré la refutación yo mismo. Las condiciones de falsación se enuncian en este artículo; el reto permanente: github.com/MichaelDariusEastwood/arc-scaling-challenge.