Paper XII: بازنمرهدهی بنچمارک عمومی
درونِ ARC Theory: پروتکلِ اعتبارِ بیرونیِ قانونِ کورسازی بر بنچمارکهای عمومی.
آیا اثرِ کورسازی روی بنچمارکِ کسِ دیگری دوام میآورد؟
کلیدِ خواندن. ادعاها در سه اندازه میآیند: نتایج، قوانین، چارچوبها. این یک مقالهٔ ابزار از ردهٔ نتایج در مرحلهٔ پروتکل است: مطالعهاش نوشته، تاریخگذاری و بهعنوان ثبتِ پیشنویس آمادهٔ ارائهٔ انسانی شده است، و هیچ دادهای گرد نیامده است. هیچچیز در اینجا یافتهای را گزارش نمیکند؛ همهچیز در اینجا آن چیزی است که پیشاپیش بهعنوان یافته به شمار خواهد آمد، از پیش تثبیتشده.
چکیده. Paper IV.d ثابت کرد که کورسازی نتایجِ اندازهگیریشدهٔ همراستایی را بر ابزارِ خودِ برنامه تغییر میدهد. اعتراضِ پابرجا اعتبارِ بیرونی است: این اثر ممکن است خاصیتی از ARC-Align باشد و نه از ارزیابیِ هوش مصنوعی بهطور کلی. این مقالهٔ پروتکل، پیشاپیش، همان یک آزمونی را تثبیت میکند که نمیتوان برنامه را به طراحیِ آن به سودِ خویش متهم کرد: همان دستکاریِ کورسازی که بر یک بنچمارکِ عمومیِ جاافتادهای اجرا میشود که برنامه آن را نه ساخته، نه گردآوری و نه کنترل کرده است. نمرهدهیِ کور، هویتِ مدلِ تولیدکننده، نشانههای ارائهدهنده و خانواده، فراتفسیرِ خودارجاع و نشانههای طول را از دیدِ ارزیاب حذف میکند؛ نمرهدهیِ ناکور آنها را باقی میگذارد. پرسشهای ثبتشده عبارتاند از اینکه آیا کورسازی نمره را تغییر میدهد (H1، تفاضلِ بهازای هر پاسخ Delta_S، جهت بهعمد پس از وارونگیِ علامت در خودِ IV.d ثبتنشده)، آیا رتبهبندیها جابهجا میشوند (H2، تاوِ Kendall)، کدام نشانه اثر را حمل میکند (H3، یک عاملی جزئیِ ثبتشده)، و توافقِ ارزیابانِ میانخانوادگی (H4، هیئتی دستِکم سهمدلی که در آن کمتر از سه نمرهٔ معتبر «مقدارِ گمشده» به شمار میآید، نه صفر). پیشبینیِ ثبتشده یک Delta_S ناصفر با اندازهای کوچکتر از آنچه IV.d مشاهده کرد است، همراه با جابهجاییِ رتبهایِ متوسط، و نتیجهٔ محتملترین که بهروشنی بیان شده H1 مثبت در کنارِ H2 تُهی است، که به این معنا خوانده میشود که کورسازی برای دقتِ اندازهگیری اهمیت دارد و نه برای ترتیبِ جدولِ ردهبندی. این پروتکلی در مرحلهٔ ثبت است: هیچ دادهای گرد نیامده است، و هیچچیز در اینجا یافتهای را گزارش نمیکند.
۱. چرا این سنگ کلید است
این سنگ کلید است، زیرا همان یک آزمونی است که نمیتوان برنامه را به طراحیِ آن به سودِ خویش متهم کرد. Paper IV.d ثابت کرد که کورسازی نتایجِ اندازهگیریشدهٔ همراستایی را بر ابزارِ خودِ برنامه تغییر میدهد. اعتراضِ پابرجا به آن نتیجه اعتبارِ بیرونی است: این اثر ممکن است خاصیتی از ARC-Align باشد و نه از ارزیابیِ هوش مصنوعی بهطور کلی، و هیچ اندازه از تکرارِ درونی به این پرسخ نمیدهد.
پاسخ این است که همان دستکاری روی یک بنچمارکِ عمومیِ جاافتاده که برنامه آن را نه ساخته، نه گردآوری کرده و نه کنترل میکند. اگر اثرِ کورسازی در آنجا بازتولید شود، خاصیتی از ارزیابیِ هوش مصنوعی است. اگر نشود، خاصیتی از ابزارِ برنامه است، و معیارِ کورسازی باید به همان دامنه محدود شود.
طراحی بهعمد به زیانِ فرضیه است، و همین نکته اهمیت دارد. استفاده از بنچمارکِ کسِ دیگری هر مزیتِ یک ابزارِ خانگی را از دست میدهد: پرسشها انتخاب نمیشوند، رهنمودِ نمرهدهی از آنِ برنامه نیست، توزیعِ دشواری ثابت است، و هر سقف یا کفی در بنچمارک علیه تشخیصِ اثر عمل میکند. نتیجهای که تحتِ چنین شرایطی به دست آید، از چندین نتیجه در خانه ارزشمندتر است.
معنای کورسازی در اینجا با دقت ثبت شده است، زیرا این واژه بارِ سنگینی به دوش میکشد. نمرهدهیِ کور از دیدِ ارزیاب اینها را حذف میکند: هویتِ مدلی که پاسخ را تولید کرده، هرگونه نشانهٔ ارائهدهنده یا خانوادهٔ مدل، فراتفسیرِ خودارجاع که در آن پاسخ منشأ خویش را نام میبرد، و نشانههای طولِ پاسخ آنجا که رهنمود اجازهٔ نرمالسازیِ طول را میدهد. نمرهدهیِ ناکور آنها را باقی میگذارد.
یک نتیجهٔ مثبت این را ثابت میکند که دستکاریِ کورسازی نمرات اندازهگیریشده را بر یک بنچمارکِ بیرونی تحتِ شرایطِ ثبتشده تغییر میدهد. اندازهٔ اثر را در جای دیگر ثابت نمیکند، نادرستبودنِ هیچ جدولِ ردهبندیِ منتشرشدهٔ مشخصی را ثابت نمیکند، و پروانهٔ بازگفتِ نتایجِ سایر پژوهشگران را نمیدهد. این مهارِ پایانی به این دلیل ثبت شده که وسوسهٔ خوانشِ افراطیِ این یافته اصلیترین تهدید برای اعتبارِ برنامه است.
۲. پرسشها، پیشاپیش تثبیتشده
اصلی، H1، کورسازی نمره را تغییر میدهد. برای هر پاسخ، Delta_S را چنین تعریف کنید: نمرهٔ کور منهای نمرهٔ ناکور. H1 پیشبینی میکند که میانگینِ Delta_S ناصفر باشد، آزمون دوسویه در alpha 0.05 با یک فاصلهٔ اطمینانِ ۹۵ درصد. جهت پیشبینی نمیشود، زیرا خودِ یافتهٔ وارونگیِ علامت در Paper IV.d پیشبینیِ جهتدار را ناموجه میکند، و ثبتِ جهتی که برنامه پیشتر دیده است وارونه شود دقیقاً همان انعطافی است که این سند برای حذفِ آن وجود دارد.
هماصلی، H2، جابهجاییِ رتبه. نمرات به یک رتبهبندی جمع میشوند. H2 جابهجایی میان رتبهبندیهای کور و ناکور را با تاوِ Kendall اندازه میگیرد. این تقابلی است که عملاً اهمیت دارد، زیرا تغییری در نمرات که رتبهبندیها را دستنخورده بگذارد هیچ پیامدی برای شیوهٔ استفاده از بنچمارکها ندارد، و ثبت از گزارشِ اثرِ نمره چنانکه گویی اثرِ رتبه است سر باز میزند.
ثانوی، H3، کدام نشانه آن را حمل میکند. چهار نشانهٔ کورسازیشده در یک عاملیِ جزئیِ ثبتشده حذف میشوند، نه همه با هم، تا سهمِ هر یک بینیاز از یک عاملیِ کامل قابلِ برآورد باشد. تفکیکپذیری و ساختارِ همپوشانی در طرحِ پیوست بیان شدهاند.
ثانوی، H4، توافقِ ارزیابانِ میانخانوادگی. یک هیئتِ ارزیابیِ میانخانوادگیِ دستِکم سهمدلی هر پاسخ را نمره میدهد. کمتر از سه نمرهٔ معتبر یک مقدارِ گمشده به شمار میآید، هرگز صفر، زیرا هیئتی که خاموش به سمتِ صفر میلغزد اثری را که قرار است اندازه بگیرد خود میسازد.
پیشبینیِ جهتدار، پیشاپیش ثبتشده. نویسنده پیشبینی میکند یک Delta_S ناصفر با اندازهای کوچکتر از آنچه Paper IV.d مشاهده کرد، و انتظار دارد جابهجاییِ رتبه متوسط باشد، زیرا رتبهبندیهای بنچمارک معمولاً از سوی شکافهای بزرگِ توانایی رانده میشوند که در برابرِ حذفِ نشانه دوام میآورند. نویسنده بهروشنی بیان میکند که یک تُهی روی H2 در کنارِ یک H1 مثبت محتملترین نتیجه است، و خوانشِ درستِ آن این است که کورسازی برای دقتِ اندازهگیری اهمیت دارد و نه برای ترتیبِ جدولِ ردهبندی.
۳. طرح
بازنمرهدهیِ درونپاسخی، تصادفیشده، کور در برابرِ ناکور بر یک بنچمارکِ عمومیِ بیرونی، با یک عاملیِ جزئی روی چهار نوع نشانه.
هر پاسخ دو بار نمره داده میشود، یک بار تحتِ هر شرط، توسط یک هیئتِ ارزیابیِ میانخانوادگی، با ترتیبِ فراخوانی تصادفیشده درون بلوک و شرط بهصورتِ نامشخص کدگذاریشده. واحدِ تحلیل پاسخ است؛ مدلها یک عاملِ بلوکیاند.
یک عاملیِ جزئیِ Resolution-IV روی چهار نشانه در هشت اجرا، تا اثراتِ اصلی نسبت به یکدیگر همپوشان نباشند. ساختارِ همپوشانی منتشر میشود و نه توصیف.
۴. بنچمارک
بنچمارک. MT-Bench، بنچمارکِ عمومیِ جاافتادهٔ ارزیابیِ چندنوبتی که توسطِ LMSYS نگهداری میشود (Zheng et al., «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena»، 2023)، ۸۰ پرسش در هشت مقوله با یک رهنمودِ منتشرشدهٔ GPT-4 برای مقایسهٔ زوجی/پاسخِ تکی، پاسخهای مدلهای عمومیدسترس، و شرایطِ مجوز که بازنمرهدهی را مجاز میکند. توجیهِ پیشفرض: MT-Bench بنچمارکِ سنگ کلیدِ بیرونیِ شناساییشدهٔ برنامه است (همان یگانه بنچمارکی که نمیتوان برنامه را به طراحیِ آن به سودِ خویش متهم کرد)، رهنمودش عیناً منتشر شده، پاسخهای مدل بهطور عمومی میزبانی میشوند، و مجوزش بازنمرهدهی را مجاز میکند. بنچمارک در ثبت نام برده میشود و پس از آن قابلِ تعویض نیست؛ تعویضِ یک بنچمارک پس از یک نتیجهٔ ناامیدکننده همان سوءاستفادهٔ مشخصی است که این بند از آن جلوگیری میکند.
استنادِ بنچمارک، بررسیشده در برابرِ رکوردِ arXiv: Zheng, L., et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS 2023 Datasets and Benchmarks; arXiv:2306.05685.
۵. وضعیت، صادقانه
عنوانِ کاملِ ثبتِ پیشنویس این است: «Does the Blinding Effect Survive on Someone Else’s Benchmark? A Preregistered Rescoring of an Established Public Benchmark Under Blinded and Unblinded Conditions». پیشنویس شده، تاریخگذاری شده و بهعنوانِ ثبتِ پیشنویسِ در انتظارِ ارائهٔ انسانی آماده شده است؛ هیچچیز ارائه نشده، هیچچیز اجرا نشده، و هیچ نتیجهای ادعا نمیشود. سه شرط بر واحدِ کاری باز است و در همانجا ثبت شدهاند تا اجمالاً از قلم نیفتند: اندازهٔ نمونهٔ مشخص در زمانِ بستهبندی از دادهٔ واریانسِ منتشرشدهٔ خودِ بنچمارک محاسبه میشود؛ بنچمارکِ نامگرفته بهصورتِ پیشفرض بر MT-Bench بنا بر طرحِ سنگ کلیدِ برنامه است، مشروط به بازنگریِ نویسنده پیش از ارائه؛ و بازوارسیِ خودِ واحد در انتظار است. مؤلفهٔ عمومیِ OSF برای این مقاله osf.io/3tzp7. فهرستِ کاملِ آزمایشهای پیشنویسشدهٔ برنامه بهطور عمومی در دسترس است در صفحهٔ آزمایشهای پیشنویس.
۶. یک نتیجه چه چیزی را نشان میدهد و چه چیزی را نه
یک نتیجهٔ مثبت این را ثابت میکند که دستکاریِ کورسازی نمرات اندازهگیریشده را بر یک بنچمارکِ بیرونی تحتِ شرایطِ ثبتشده تغییر میدهد. اندازهٔ اثر را در جای دیگر ثابت نمیکند، نادرستبودنِ هیچ جدولِ ردهبندیِ منتشرشدهٔ مشخصی را ثابت نمیکند، و پروانهٔ بازگفتِ نتایجِ سایر پژوهشگران را نمیدهد. این مهارِ پایانی به این دلیل ثبت شده که وسوسهٔ خوانشِ افراطیِ این یافته اصلیترین تهدید برای اعتبارِ برنامه است.
مهارِ بالا بخشی از طرح است: وسوسهٔ خوانشِ افراطیِ یک نتیجهٔ بنچمارکِ بیرونی اصلیترین تهدید برای اعتبارِ برنامه است، و در خودِ ثبت محصور شده است.
مقالههای مرتبطِ نظریه
قانونِ کورسازی که این مطالعه آن را برونسازی میکند: Paper IV.d (10.17605/OSF.IO/2S3E6)، مقالهٔ نظمِ اندازهگیری که وارونگیِ کورسازیاش تنها بازپسگیریِ عمومیِ برنامه را پدید آورد. نظریهای که این ابزار به آن خدمت میکند: مقالهٔ بیانیه (10.17605/OSF.IO/GW5MX). فهرستِ کامل در فهرستِ مقالات.
چگونه این مقاله را ارجاع دهیم
DOI (این مقاله): 10.17605/OSF.IO/3TZP7 · DOI چتری: 10.17605/OSF.IO/6C5XB
Eastwood, M. D. (2026). Paper XII: Public Benchmark Rescoring. The ARC Theory · ARC/Eden experiments. https://doi.org/10.17605/OSF.IO/3TZP7
اعلامیهٔ تألیفِ انسانیِ بهکمکِ هوش مصنوعی
نویسندهٔ این اثر Michael Darius Eastwood است، یک انسان. هر مفهومِ بنیادین، ادعا و نتیجه از ایدهپردازیِ انسانی سرچشمه میگیرد؛ ابزارهای هوش مصنوعی بهعنوانِ ابزار، تحتِ هدایتِ مستمرِ انسانی، برای پیشنویسی، بازبینی و قالببندی به کار گرفته شدهاند. تمامِ گزینش، هماهنگی، چیدمان و داوریِ نهاییِ ویراستاری از آنِ نویسنده است، که مسئولیتِ کاملِ صحت و یکپارچگیِ متن را بر عهده میگیرد.
ابزارهای هوش مصنوعی (خانوادهٔ Claude از Anthropic و دیگر دستیارهای مدلهای زبانیِ بزرگ) بهعنوان ابزار، تحتِ هدایتِ مستمرِ انسانی به کار گرفته شدهاند، به همان شیوهای که یک واژهپرداز، ماشینحساب یا دستیارِ پژوهشی به کار میرود: برای ویرایش و پرداختِ نثر، جستوجو و خلاصهسازیِ ادبیات (که بهصورتِ دستی در برابرِ منابعِ نخستین بررسی شده)، ساختارِ سند، قالببندی، طوفانِ فکری در برابرِ پرسشهای تعریفشدهٔ نویسنده، و شتابدادن به پیشنویسی مطابقِ رئوس و دستورالعملهای تعریفشدهٔ نویسنده. تمامِ گزینش، هماهنگی، چیدمان و داوریِ نهاییِ ویراستاری از آنِ نویسنده است. هر خروجیِ اساسی توسطِ نویسنده بازبینی، آزمون یا وارسی شده است، که مسئولیتِ کاملِ صحت و یکپارچگیِ متنِ نهایی را بر عهده میگیرد. این ابزارها سرعتِ کار را افزایش دادند؛ هرگز بهعنوانِ منبعِ آن به آنها اتکا نشده است.
جایگاهِ معرفتی. آنچه این برنامه «قوانین» مینامد، حدسهاییاند تحتِ آزمونِ خصمانهٔ ثبتشده؛ هر کمیت در این مقاله عملیاتی تعریف شده است، و جایگاهِ «قانونِ جاافتاده» در هیچ کجا ادعا نمیشود. برنامهٔ ثبتشده وجود دارد تا آن جایگاه را با اندازهگیری، تکرار و ردشدنِ ازمیانِ برخاسته به دست آورد، یا از دست بدهد.
© 2026 Michael Darius Eastwood. تألیفِ انسانی با کمکِ رایانه؛ تألیفِ کاملِ انسانی و حقوقِ معنوی ادعا میشود بر پایهٔ Copyright, Designs and Patents Act 1988 و همسو با راهنمای دفترِ حقِ نشرِ ایالات متحده دربارهٔ آثار حاوی موادِ تولیدشده توسطِ هوش مصنوعی؛ هر مشارکتِ فنیِ نوینِ توصیفشده در این اثر توسطِ نویسندهٔ انسانی طراحی شده است. بیانیهٔ کامل: michaeldariuseastwood.com/authorship.
پیمانِ پابرجا. ثابت کنید این مقاله نادرست است، و من خود ابطالِ آن را منتشر خواهم کرد. شرایطِ ابطال در این مقاله بیان شدهاند؛ چالشِ پابرجا: github.com/MichaelDariusEastwood/arc-scaling-challenge.