Traduction automatique de l'original anglais daté. La page anglaise fait foi. English →

Paper XII : Renotation de référentiel public

Michael Darius Eastwood
Chercheur indépendant en alignement de l'IA, Londres · Auteur d' Infinite Architects (2026)

Au sein de l'ARC Theory : le protocole de validité externe de la loi d'aveuglement sur les référentiels publics.

L'ARC Theory (la théorie de la création récursive artificielle) · Paper XII · Article de protocole · Première publication le 14 août 2026 · révisé le 27 août 2026 · DOI · Document de travail v1.9 10.17605/OSF.IO/3TZP7

L'effet d'aveuglement survit-il sur le référentiel de quelqu'un d'autre ?

Clé de lecture. Les affirmations viennent en trois tailles : résultats, lois, cadres. Ceci est un article d'instrument de la classe résultats au stade de protocole : son étude est rédigée, datée et préparée comme un projet d'enregistrement en attente de soumission humaine, et aucune donnée n'a été collectée. Rien ici ne rapporte de conclusion ; tout ici est ce qui comptera comme telle, fixé à l'avance.

Résumé. Le Paper IV.d a établi que l'aveuglement modifie les résultats d'alignement mesurés sur l'instrument propre au programme. L'objection permanente est celle de la validité externe : l'effet pourrait être une propriété d'ARC-Align plutôt que de l'évaluation de l'IA en général. Cet article de protocole fixe, à l'avance, le seul test que le programme ne peut être accusé d'avoir conçu à son propre avantage : la même manipulation d'aveuglement exécutée sur un référentiel public établi que le programme n'a ni bâti, ni conservé, et qu'il ne contrôle pas. La notation aveuglée retire l'identité du modèle producteur, les marqueurs de fournisseur et de famille, le méta-commentaire autoréférentiel et les indices de longueur ; la notation non aveuglée les laisse. Les questions enregistrées sont : l'aveuglement modifie-t-il le score (H1, la différence par réponse Delta_S, direction délibérément non enregistrée après l'inversion de signe propre à IV.d), les classements se déplacent-ils (H2, tau de Kendall), quel indice porte l'effet (H3, un plan factoriel fractionnaire enregistré), et l'accord entre évaluateurs inter-familles (H4, un panel d'au moins trois modèles où moins de trois scores valides constitue une valeur manquante, jamais un zéro). La prédiction enregistrée est un Delta_S non nul d'une magnitude inférieure à celle observée par IV.d avec un déplacement de rang modeste, et le résultat le plus probable énoncé est un H1 positif à côté d'un H2 nul, à lire comme signifiant que l'aveuglement importe pour la précision de mesure plutôt que pour l'ordre au classement. Ceci est un protocole au stade d'enregistrement : aucune donnée n'a été collectée, et rien ici ne rapporte de conclusion.

1. Pourquoi c'est la pièce maîtresse

Ceci est la pièce maîtresse, parce que c'est le seul test que le programme ne peut être accusé d'avoir conçu à son propre avantage. Le Paper IV.d a établi que l'aveuglement modifie les résultats d'alignement mesurés sur l'instrument propre au programme. L'objection permanente à ce résultat est celle de la validité externe : l'effet pourrait être une propriété d'ARC-Align plutôt que de l'évaluation de l'IA en général, et aucune réplication interne n'y répond.

La réponse consiste à exécuter la même manipulation sur un référentiel public établi que le programme n'a pas bâti, n'a pas conservé et ne contrôle pas. Si l'effet d'aveuglement se reproduit là, c'est une propriété de l'évaluation de l'IA. Sinon, c'est une propriété de l'instrument du programme, et le standard d'aveuglement devrait y être circonscrit.

Le dispositif est délibérément défavorable à l'hypothèse, et c'est là le point. Utiliser le référentiel de quelqu'un d'autre fait perdre tous les avantages d'un instrument maison : les items ne sont pas choisis, le barème de notation n'est pas celui du programme, la distribution de difficulté est fixée, et tout plafond ou plancher dans le référentiel joue contre la détection d'un effet. Un résultat obtenu dans ces conditions vaut plus que plusieurs obtenus à la maison.

Ce que signifie l'aveuglement ici est enregistré avec précision, parce que le mot fait un travail lourd. La notation aveuglée retire de la vue de l'évaluateur : l'identité du modèle qui a produit la réponse, tout marqueur de fournisseur ou de famille de modèles, le méta-commentaire autoréférentiel dans lequel une réponse nomme sa propre origine, et les indices de longueur de réponse là où le barème permet une normalisation par la longueur. La notation non aveuglée les laisse.

Un résultat positif établirait que la manipulation d'aveuglement modifie les scores mesurés sur un référentiel externe dans les conditions enregistrées. Cela n'établirait pas la taille de l'effet ailleurs, n'établirait pas qu'un classement publié spécifique quelconque est faux, et ne permettrait pas de reformuler les résultats d'autres chercheurs. Cette dernière retenue est enregistrée parce que la tentation de surinterpréter cette conclusion est le risque principal pour la crédibilité du programme.

2. Les questions, fixées à l'avance

Primaire, H1, l'aveuglement modifie le score. Pour chaque réponse, définir Delta_S comme le score aveuglé moins le score non aveuglé. H1 prédit une moyenne de Delta_S non nulle, testée en bilatéral à alpha 0,05 avec un intervalle à 95 pour cent. La direction n'est pas prédite, parce que la conclusion propre au Paper IV.d en matière d'inversion de signe rend une prédiction directionnelle injustifiée, et enregistrer une direction que le programme a déjà vue s'inverser serait exactement la flexibilité que ce document existe pour éliminer.

Co-primaire, H2, déplacement de rang. Les scores s'agrègent en un classement. H2 mesure le déplacement entre les classements aveuglés et non aveuglés par le tau de Kendall. C'est le contraste qui compte en pratique, parce qu'un changement de scores qui laisse les classements intacts n'a aucune conséquence pour la manière dont les référentiels sont utilisés, et l'enregistrement refuse de rapporter un effet de score comme s'il s'agissait d'un effet de classement.

Secondaire, H3, quel indice le porte. Les quatre indices aveuglés sont retirés dans un plan factoriel fractionnaire enregistré plutôt que tous à la fois, de sorte que la contribution de chacun est estimable sans un plan factoriel complet. La résolution et la structure d'aliasing sont énoncées dans le dispositif joint.

Secondaire, H4, accord entre évaluateurs inter-familles. Un panel d'évaluateurs inter-familles d'au moins trois modèles note chaque réponse. Moins de trois scores valides donne une valeur manquante, jamais un zéro, parce qu'un panel qui échoue silencieusement vers zéro fabrique l'effet qu'il est censé mesurer.

Prédiction directionnelle, enregistrée à l'avance. L'auteur prédit un Delta_S non nul d'une magnitude inférieure à celle observée par le Paper IV.d, et s'attend à ce que le déplacement de rang soit modeste, parce que les classements de référentiels sont habituellement conduits par de grands écarts de capacité qui survivent au retrait des indices. L'auteur affirme clairement qu'un H2 nul aux côtés d'un H1 positif est le résultat le plus probable, et que la lecture correcte en est que l'aveuglement importe pour la précision de mesure plutôt que pour l'ordre au classement.

3. Le dispositif

Renotation intra-réponse, randomisée, aveuglée versus non aveuglée sur un référentiel public externe, avec un plan factoriel fractionnaire sur les quatre types d'indices.

Chaque réponse est notée deux fois, une fois sous chaque condition, par un panel d'évaluateurs inter-familles, avec l'ordre d'appel randomisé au sein d'un bloc et la condition codée de manière opaque. L'unité d'analyse est la réponse ; les modèles sont un facteur de blocage.

Plan factoriel fractionnaire de résolution IV sur quatre indices en huit exécutions, de sorte que les effets principaux ne sont pas confondus entre eux. La structure d'aliasing est publiée plutôt que décrite.

4. Le référentiel

Référentiel. MT-Bench, le référentiel public établi d'évaluation multi-tours maintenu par LMSYS (Zheng et al., « Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena », 2023), 80 questions à travers huit catégories avec un barème GPT-4 par paires / à réponse unique publié, des réponses de modèles disponibles publiquement, et des conditions de licence permettant la renotation. Justification par défaut : MT-Bench est le référentiel externe pivot identifié par le programme (le seul référentiel que ce programme ne peut être accusé d'avoir conçu à son propre avantage), son barème est publié mot pour mot, les réponses de modèles sont hébergées publiquement, et sa licence permet la renotation. Le référentiel est nommé dans l'enregistrement et ne peut être changé par la suite ; changer de référentiel après un résultat décevant est l'abus spécifique que cette clause empêche.

La citation du référentiel, vérifiée par rapport à l'enregistrement arXiv : Zheng, L., et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS 2023 Datasets and Benchmarks ; arXiv:2306.05685.

5. État, honnêtement

Le titre complet du projet d'enregistrement est « Does the Blinding Effect Survive on Someone Else's Benchmark? A Preregistered Rescoring of an Established Public Benchmark Under Blinded and Unblinded Conditions ». Il est rédigé, daté et préparé comme un projet d'enregistrement en attente de soumission humaine ; rien n'a été soumis, rien n'a été exécuté, et aucun résultat n'est revendiqué. Trois conditions restent ouvertes sur l'unité de travail et y sont consignées plutôt que glissées : la taille d'échantillon concrète est calculée à l'emballage à partir des données de variance publiées du référentiel lui-même ; le référentiel nommé prend MT-Bench par défaut selon le plan pivot du programme, sous réserve d'un remplacement par l'auteur avant soumission ; et la re-vérification propre à l'unité est en attente. La composante OSF publique de cet article est osf.io/3tzp7. La liste complète des essais rédigés du programme est publique sur la page des essais rédigés.

6. Ce qu'un résultat signifierait et ne signifierait pas

Un résultat positif établirait que la manipulation d'aveuglement modifie les scores mesurés sur un référentiel externe dans les conditions enregistrées. Cela n'établirait pas la taille de l'effet ailleurs, n'établirait pas qu'un classement publié spécifique quelconque est faux, et ne permettrait pas de reformuler les résultats d'autres chercheurs. Cette dernière retenue est enregistrée parce que la tentation de surinterpréter cette conclusion est le risque principal pour la crédibilité du programme.

La retenue ci-dessus fait partie du dispositif : la tentation de surinterpréter un résultat de référentiel externe est le risque principal pour la crédibilité du programme, et elle est cantonnée dans l'enregistrement lui-même.

Articles connexes de la théorie

La loi d'aveuglement que cette étude externalise : Paper IV.d (10.17605/OSF.IO/2S3E6), l'article de discipline de mesure dont l'inversion d'aveuglement a produit l'unique rétractation publique du programme. La théorie que cet instrument sert : le papier d'énoncé (10.17605/OSF.IO/GW5MX). Le catalogue complet se trouve à l'index des articles.

Comment citer cet article

DOI (cet article) : 10.17605/OSF.IO/3TZP7 · DOI parapluie : 10.17605/OSF.IO/6C5XB

Eastwood, M. D. (2026). Paper XII: Public Benchmark Rescoring. The ARC Theory · ARC/Eden experiments. https://doi.org/10.17605/OSF.IO/3TZP7

Déclaration d'auctorialité humaine assistée par IA

L'auteur de cette œuvre est Michael Darius Eastwood, un être humain. Chaque concept central, affirmation et conclusion trouve son origine dans l'idéation humaine ; des outils d'intelligence artificielle ont été utilisés comme instruments sous direction humaine continue pour la rédaction, la vérification et la mise en forme. La sélection, la coordination, l'arrangement et le jugement éditorial final relèvent tous de l'auteur, qui prend l'entière responsabilité de l'exactitude et de l'intégrité du texte.

Des outils d'intelligence artificielle (la famille Claude d'Anthropic et d'autres assistants à grands modèles de langage) ont été utilisés comme instruments sous direction humaine continue, à la manière dont on utilise un traitement de texte, une calculatrice ou un assistant de recherche : pour l'édition et le raffinement de la prose, la recherche bibliographique et la synthèse (vérifiées manuellement contre les sources primaires), la structure documentaire, la mise en forme, le brainstorming face aux questions définies par l'auteur, et l'accélération de la rédaction selon les plans et les instructions définis par l'auteur. La sélection, la coordination, l'arrangement et le jugement éditorial final relèvent tous de l'auteur. Chaque sortie substantielle a été relue, testée ou vérifiée par l'auteur, qui prend l'entière responsabilité de l'exactitude et de l'intégrité du texte final. Les outils ont accru la vitesse du travail ; il n'a jamais été fait fond sur eux comme sur sa source.

Statut épistémique. Ce que ce programme nomme des Lois sont des conjectures sous test enregistré et adversariel ; chaque grandeur dans cet article est définie opérationnellement, et le rang de loi établie n'est revendiqué nulle part. Le programme enregistré existe pour gagner ce rang, ou pour le perdre, par la mesure, la réplication et la réfutation survécue.

© 2026 Michael Darius Eastwood. Ouvrage rédigé par un humain avec assistance informatique ; la pleine auctorialité humaine et les droits moraux sont revendiqués au titre du Copyright, Designs and Patents Act 1988 et en cohérence avec les orientations du United States Copyright Office relatives aux œuvres contenant du matériel généré par IA ; toute contribution technique nouvelle décrite dans cet ouvrage a été conçue par l'auteur humain. Déclaration complète : michaeldariuseastwood.com/authorship.

Alliance permanente. Prouvez cet article faux, et je publierai la réfutation moi-même. Les conditions de falsification sont énoncées dans cet article ; le défi permanent : github.com/MichaelDariusEastwood/arc-scaling-challenge.

lecture à voix haute · surlignage en direct · accès à toute section

Une erreur de traduction ? Signalez-la directement :