این ترجمه به صورت خودکار از نسخهٔ اصلی انگلیسیِ تاریخدار تهیه شده است. نسخهٔ انگلیسی معتبر است. English →
Paper II از ARC Theory: بازتولیدی کورشده و فراآرشیتکتوری در سراسر شش مدلِ پیشروی هوش مصنوعی. برآوردِ ابتداییِ فراخطیِ تکمدلی (alpha 2.24) بازتولید نشد و بازپس گرفته میشود. آنچه باقی میماند: بهترین برآوردِ فراآرشیتکتوری alpha 0.49 است (Gemini 3 Flash، r squared 0.86)، نمای موازی در هر مدلی نزدیک به صفر است، و متوالی در هر جا که هر دو قابل اندازهگیری بودند از موازی پیشی گرفت.
درونِ ARC Theory: برنامهٔ اندازهگیریِ قانون I، معادلهٔ ARC؛ برآوردِ کورشدهٔ فراآرشیتکتوریِ نما، شامل بازپسگیری.
این مقاله اعتبارسنجیِ تجربیِ ARC Principle (Artificial Recursive Creation) را ارائه میکند، چارچوبی ریاضی که پیشنهاد میکند نرخِ خطا در سامانههای هوشمند بر پایهٔ قانونِ توانی با عمقِ بازگشتی کاهش مییابد. این اصل، که نخست در Infinite Architects (Eastwood، دسامبر ۲۰۲۴) بیان و در Paper I (Eastwood، ۱۷ ژانویه ۲۰۲۶) رسمیسازی شد، پیشبینی میکند که شکلِ بازگشت رژیمِ مقیاسبندی را تعیین میکند: بازگشتِ متوالی باید سرکوبِ خطای فراخطی به دست دهد (نمای مقیاسبندیِ $\alpha > 1$)، در حالی که بازگشتِ موازی باید سرکوبِ زیرخطی به دست دهد ($\alpha < 1$).
ما آزمایشهای کنترلشده را در دو فاز انجام دادیم. فاز ۱ (مطالعهٔ ابتداییِ تکمدلی) از DeepSeek R1 با توکنهای استدلالِ آشکار روی ۱۲ مسئلهٔ ریاضیاتِ سطحِ مسابقه استفاده کرد و $\alpha_{\text{sequential}} \approx 2.24$ (95% CI: 1.5-3.0) و $\alpha_{\text{parallel}} \approx 0.0$ یافت. فاز ۲ (مطالعهٔ ششمدلی) آزمون را به شش مدلِ پیشرو روی ۱۸ مسئلهٔ سطحِ AIME/Putnam (n=54 در هر عمق در هر مدل) با بازههای اطمینانِ بوتاسترپ و راستیآزماییِ متقاطعِ ۴-لایهای گسترش داد.
بازتولیدِ فراآرشیتکتوری: مقدارِ اصلی $\alpha \approx 2.24$ (درجه دوم) در سراسر معماریها بازتولید نمیشود. تنها Gemini 3 Flash دادهٔ مقیاسبندیِ تمیز و یکنوا تولید کرد: $\alpha_{\text{seq}} = 0.49$ (رگرسیون، $r^2 = 0.86$، SE = 0.20، boot CI [−1.3, 2.9]). DeepSeek R1 به سقف رسید (94.4%-100%). GPT-5.4 تابعِ پلهایِ دودویی نشان داد (50% → 100%). Grok 4.1 Fast در همهٔ عمقها به 100% رسید. Groq Qwen3 هیچ روندی نشان نداد (~50%).
مقیاسبندیِ موازی در هر مدل یا نزدیک به صفر است، با یک استثنای اندازهگیریشده: $\alpha_{\text{parallel}} \approx 0$ برای هر مدل بهجز Gemini 3 Flash، که $\alpha_{\text{par}} = 0.31$ در $r^2 = 0.93$ بازمیگرداند. این استثنا اهمیت دارد، زیرا Gemini 3 Flash مدلی است که این مقاله آن را قابلاعتمادترین برآوردِ خود میداند. یافتهٔ بازتولیدشده بنابراین این است که مقیاسبندیِ موازی در هر مدلی که اندازهگیری شد در یا نزدیک به صفر است، با یک استثنای اندازهگیریشده، نه اینکه بهطورِ عمومی صفر باشد. متوالی برای هر مدلی که هر دو قابل اندازهگیری بودند از موازی پیشی گرفت.
برآوردِ بازبینیشدهٔ پارامتر: پایدارترین برآوردِ فراآرشیتکتوری $\alpha_{\text{sequential}} \approx 0.49$ است (زیرخطی، از Gemini 3 Flash)، بهطورِ چشمگیری زیرِ برآوردِ ابتداییِ تکمدلیِ 2.24. تحتِ فرمولِ هوشِ $\alpha = 1/(1 - \beta)$ از Paper I، $\alpha < 1$ مدلهای کنونی را در رژیمِ فیزیکی (ترکیبِ ضربشونده در شبکههای متناهیبُعد) قرار میدهد نه در رژیمِ هوش (خودارجاعیِ بازگشتی با $\alpha > 1$). نابرابریِ بنیادی $\alpha_{\text{sequential}} > \alpha_{\text{parallel}}$ همچنان تأییدشده باقی میماند.
این نسخه گزارش میدهد: نتایجِ کاملِ tier-2 از مطالعهٔ بازتولیدِ چندمدلی:
reasoning_tokens → total_tokens برای GPT-5.4 و Groq Qwen3 اصلاح شدهمهٔ یافتههای ابتداییِ تکمدلی در شکلِ اصلیِ خود حفظ شدهاند. نتیجهگیریها برای بازتابِ شواهدِ فراآرشیتکتوری بازبینی شدهاند.
شواهدِ فرادامنهای این یافتهها را تقویت میکند. تراشهٔ کوانتومیِ Willow از Google (دسامبر ۲۰۲۴) سرکوبِ خطای بازگشتی با $\Lambda = 2.14$ را نشان داد. قوانینِ مقیاسبندیِ زیستی نماهایِ توانِ چهارم را در سراسر ۲۷ مرتبهٔ بزرگی از راهِ شبکههای بازگشتیِ فرکتالی نشان میدهند. مطالعهٔ آگاهیِ COGITATE (Nature، آوریل ۲۰۲۵) پردازشِ مکرر را بهعنوانِ مخرجِ مشترک در سراسرِ نظریهها شناسایی کرد.
پیامدها برای ایمنیِ هوش مصنوعی بهطورِ حیاتی به دستیافتنیبودنِ $\alpha > 1$ وابسته است. اگر باشد، ویژگیهای همراستایی جاسازیشده در فرآیندِ استدلال بهطورِ فراخطی با توانمندی مقیاس مییابند در حالی که محدودیتهای بیرونی ثابت میمانند. حتی با $\alpha < 1$، یافتهٔ جهتگیرانه که استدلالِ متوالی توانمندی را بهبود میبخشد از Eden Protocol از Infinite Architectsپشتیبانی میکند: سامانههای هوش مصنوعی از ارزشهای جاسازیشده در استدلال بهره میبرند، نه از محدودیتهایی که از بیرون تحمیل میشوند. با این حال، دادهٔ چندمدلی نشان میدهد که توانمندی و همراستایی ابعادِ مستقل هستند؛ استدلالِ بیشتر خودبهخود به معنی همراستاییِ بهتر نیست.
واژگانِ کلیدی: قوانینِ مقیاسبندی، هوشِ بازگشتی، محاسبهٔ زمانِ آزمون، سرکوبِ خطا، ایمنیِ هوش مصنوعی، همراستایی، استدلالِ زنجیرهٔ اندیشه، Eden Protocol، اعتبارسنجیِ فرادامنهای، بازتولیدِ چندمدلی
چگونه این مقاله را بخوانیم. این مقاله یک اندازهگیریِ مستقیم در ARC Theory را گزارش میکند. در سراسرِ شش مدلِ پیشرو که روی سی مسئله با بازههای بوتاسترپ آزمایش شدند، نمای متوالی برای هر مدل از نمای موازی بیشتر است، بهترین نمای محاسبهٔ برازششده $\alpha_{\mathrm{compute}} \approx 0.49$ است (Gemini 3 Flash، $r^2 = 0.86$)، و دامنهٔ اندازهگیریشده از نزدیک به صفر تا حدود سه گسترده است، پس ARC Bound $\alpha \leq 2$ نه تأیید و نه رد میشود. جایگاهِ آن درونِ نظریه، لایهٔ اندازهگیریِ فراآرشیتکتوری بالای Paper I است. تفاضلِ کامل در برابرِ هر سندِ پیشین در eden-vision II.A.8.
قوانینِ مقیاسبندی حاکم بر هوش مصنوعی درکِ ما را از ظهورِ توانمندی دگرگون کرده است. Kaplan و همکاران (۲۰۲۰) روابطِ توانی بین کارایی مدل و محاسبهٔ آموزشی را تثبیت کردند، در حالی که Hoffmann و همکاران (۲۰۲۲) اینها را با تجویزاتِ محاسبهٔ بهینه اصلاح کردند. این کارهای بنیادین روششناسیِ آموزش را متحول کردند اما تنها به مقیاسبندیِ پیشآموزش میپردازند. آنها توضیح نمیدهند چرا اختصاصِ محاسبهٔ افزون در زمانِ استنتاج بهبودهای چشمگیرِ توانمندی به وجود میآورد، و نه چرا اشکالِ گوناگونِ چنین محاسبهای نتایجی بنیادی متفاوت به دست میدهند.
ظهورِ مدلهای استدلالی در اواخرِ ۲۰۲۴ محاسبهٔ زمانِ آزمون را بهعنوانِ متغیرِ حیاتی معرفی کرد. o1 از OpenAI (سپتامبر ۲۰۲۴) و R1 از DeepSeek (ژانویه ۲۰۲۵) منابعِ محاسباتی را در حینِ استنتاج برای استدلال پیش از پاسخ اختصاص میدهند. در بنچمارکهای استدلالِ ریاضی، این سامانهها به کاراییای میرسند که پیشتر گمان میرفت مدلهای یک مرتبهٔ بزرگی بزرگتر میطلبد. با این حال سازوکارهای زیربنایی این بهبود ناقص شناسایی ماندهاند.
دو پارادایم برای اختصاصِ محاسبهٔ زمانِ آزمون پدید آمدهاند:
بازگشتِ موازی. چندین راهحلِ مستقل تولید کنید و بهترین را از راهِ رأیگیریِ اکثریت یا امتیازِ راستیآزما انتخاب کنید. این رویکرد از نظرِ محاسباتی سرراست است اما، همانطور که Brown و همکاران (۲۰۲۴) مستند کردهاند، بازدههایی کاهشیابنده بهصورتِ قوانینِ توانیِ زیرخطی تولید میکند.
بازگشتِ متوالی. زنجیرههای استدلالِ گسترده تولید کنید که هر گام بهطورِ صریح بر گامهای پیشین بنا شود. خطاها میتوانند از راهِ خودارجاعی بهطورِ تکراری شناسایی و تصحیح شوند. این رویکرد بازدههای مرکب تولید میکند، اما رابطهٔ مقیاسبندی بهطورِ رسمی مشخص نشده است؛ این مقاله به این شکاف میپردازد.
چرا استدلالِ متوالی بهطورِ چشمگیری از نمونهگیریِ موازی در هزینهٔ محاسباتیِ برابر پیشی میگیرد؟ چه اصلِ ریاضی این تفاوت را حاکم میسازد؟ و پیامدها برای همراستاسازیِ سامانههای هوش مصنوعیِ بهطورِ فزاینده توانمند چیست؟
این مقاله هشت کمک ارائه میکند:
ARC Principle نخست در نسخهٔ خطیِ Infinite Architects: Intelligence, Recursion, and the Creation of Everythingبیان شد. اولویتِ نسخهٔ خطی از راهِ برچسبِ زمانیِ سرورِ رمزنگاریشده در ۸ دسامبر ۲۰۲۴تثبیت شد، وقتی نسخهٔ خطی با استفاده از سرورهایِ Google ایمیل شد. کتاب خودش بعدها بهطورِ عمومی منتشر شد، در ۲ ژانویه ۲۰۲۶ (چاپی؛ کتاب الکترونیکی ۶ ژانویه). برچسبهای زمانیِ تولیدشده به دستِ سرور برچسبگذاریِ زمانیِ آشکارکنندهٔ دستکاری را از راهِ راستیآزماییِ سرورِ ایمیل ارائه میکنند، بر زیرساختِ ارائهدهنده و امضاهایِ کلیدِ ارائهدهنده در سلکتورهای DKIM و ARC از Google استوار است و نه بر یک برچسبِ زمانیِ مورداعتمادِ RFC 3161 (به یادداشتِ تصحیح در سرِ این مقاله بنگرید)، تثبیت میکند که مفاهیمِ اصلی (تقویتِ هوشِ بازگشتی، تمایزِ میان بازگشتِ موازی و متوالی، و تزِ همراستاییِ جاسازیشده، که بعدها در ۳۰ آوریلِ ۲۰۲۵ Eden Protocol نامیده شد) پیش از اعتبارسنجیهای مستقلِ بعدی و پیش از سپردهگذاریهای بایگانیِ عمومیِ بعدی مستند شدند.
جدول ۱. جدولِ زمانیِ اعتبارسنجیِ پیشبینی.
| تاریخ | رخداد | رابطه با نسخهٔ خطی |
|---|---|---|
| ۸ دسامبر ۲۰۲۴ | نسخهٔ خطی ایمیل شد (رکوردِ تاریخدار؛ به یادداشتِ تصحیح در این صفحه بنگرید) | اولویت تثبیت شد |
| ۹ دسامبر ۲۰۲۴ | Google Willow اعلام شد ($\Lambda = 2.14$) | ۲۴ ساعت پس از ارسال |
| ۱۸ دسامبر ۲۰۲۴ | همراستاسازیِ فریبکارانهٔ Anthropic (78% در شرایطِ آموزشِ RL (پایه 12%)) | ۱۰ روز پس از ارسال |
| ۲۰ دسامبر ۲۰۲۴ | OpenAI o3 اعلام شد (87.5% ARC-AGI) | ۱۲ روز پس از ارسال |
| ۲۰ ژانویه ۲۰۲۵ | DeepSeek R1 منتشر شد ($\alpha \approx 1.34$) | ۴۳ روز پس از ارسال |
| ۳۰ آوریل ۲۰۲۵ | مطالعهٔ COGITATE (بازگشت تأیید شد) | ~۵ ماه پس از ارسال |
نزدیکی زمانی میان مهر زمانی دستنوشته و نتایج عمومیِ پس از آن، همگراییِ زمانی درجهبندی میشود، نه پیشبینی: پیشچاپ تیم Google Willow از ۲۴ اوت ۲۰۲۴ عمومی بود، یعنی پیش از دستنوشته ۸ دسامبر ۲۰۲۴؛ پس آن سند دسامبر نمیتوانست نتیجهای را پیشبینی کند که نویسندگانش پیشتر اعلام کرده بودند. آنچه مهرهای زمانی اثبات میکنند این است که چارچوببندی دستنوشته پیش از پوشش گسترده رسانهای Willow ثبت شده بود؛ این واقعیتی درباره وجود سند در یک تاریخ است، نه آیندهنگری درباره فیزیک.
پس از برچسبِ زمانیِ نسخهٔ خطیِ دسامبر ۲۰۲۴ و انتشارِ عمومیِ کتاب در ۲ ژانویه ۲۰۲۶، Paper I (Eastwood، ۱۷ ژانویه ۲۰۲۶) این اصل را بهطورِ ریاضی رسمیسازی کرد و دادهٔ در دسترسِ عموم را تحلیل نمود. این Paper II اعتبارسنجیِ تجربیِ مستقیم ارائه میکند.
این مقاله بر چندین برنامهٔ پژوهشیِ تثبیتشده بنا میشود و آنها را گسترش میدهد:
برانگیختنِ زنجیرهای اندیشه (Wei و همکاران، ۲۰۲۲) نشان داد که گامهای استدلالِ میانی کارایی را در وظایفِ چندگامی بهبود میبخشند.
مقیاسبندیِ محاسبهٔ زمانِ آزمون (Snell و همکاران، ۲۰۲۴) نشان داد که محاسبهٔ زمانِ آزمون میتواند از مدلهای ۱۴× بزرگتر روی بنچمارکهای معین پیشی گیرد.
Large Language Monkeys (Brown و همکاران، ۲۰۲۴) مقیاسبندیِ زیرخطیِ نمونهگیریِ موازی را با مشخصهسازیِ دقیقِ قانونِ توانی مستند کرد.
DeepSeek R1 (DeepSeek AI، ژانویه ۲۰۲۵) استدلالِ نوپدید را از راهِ یادگیریِ تقویتیِ محض نشان داد، با پدیدههایِ 'لحظهٔ آها' که خودتصحیحیِ بازگشتی را مینمایاند.
این مقاله این مشاهدات را با پیشنهادِ چارچوبِ ریاضیِ یکپارچه، ARC Principle، و ارائهٔ اعتبارسنجیِ تجربی با اندازهگیریِ مستقیمِ عمقِ بازگشتی گسترش میدهد.
ARC Principle (Artificial Recursive Creation) پیشنهاد میکند که نرخِ خطا در سامانههای هوشمند بر پایهٔ قانونِ توانی با عمقِ بازگشتی کاهش مییابد:
جدول ۲. تعریفِ متغیرها.
| نماد | نام | تعریف | واحدها |
|---|---|---|---|
| $E(R)$ | نرخِ خطا در عمق $R$ | نسبتِ پاسخهای نادرست | [0, 1] |
| $E_0$ | نرخِ خطای پایه | نرخِ خطا در بازگشتِ کمینه ($R = 1$) | [0, 1] |
| $R$ | عمقِ بازگشتی | تکرارهای پردازشِ خودارجاع | توکنها یا نمونهها |
| $\alpha$ | نمای مقیاسبندی | نرخِ سرکوبِ خطا | بیبُعد |
نمای مقیاسبندی $\alpha$ سرشتِ بازدههای سرمایهگذاریِ بازگشتی را تعیین میکند:
این صورتبندی بهطورِ مستقیم سرکوبِ خطا را مدل میکند، مشابهِ تصحیحِ خطای کوانتومی که در آن نرخِ خطای منطقی با فاصلهٔ کد کاهش مییابد. نمای $\alpha$ کارایی فرآیندِ بازگشتی را در بر میگیرد.
یادداشت درباره تصویرها (۲۵ اوت ۲۰۲۶). هر تصویر این مقاله در ۵ آوریل ۲۰۲۶ ساخته شده و پیش از اصلاحاتی است که متن اکنون در بر دارد. هرجا تصویری پشتیبانی از α > ۱ متوالی، برآورد متوالی ۲٫۲، یا وضعیت «همه دادهها سازگارند» را بیان کند، آن همان خوانش منسوخ آوریل است: نتایج اصلاحشده متن معتبرند (۲٫۲۴ پسگرفتهشده، مقدار متوالی ۰٫۴۹ در رژیم منجمد). آشکارترین نمونهها یادداشت ویژه خود را دارند؛ تصویرهای بازتولیدشده در نوبتاند و تصویرها در این میان همچون تاریخی تاریخدار نگه داشته میشوند.
ما دو فرآیندِ بازگشتی که از نظرِ معماری مجزا هستند و رفتارهای مقیاسبندیِ متفاوت را پیشبینی میکنند تمیز میدهیم.
بازگشتِ موازی (شکلِ ضعیف). چندین راهحلِ مستقل بهطورِ همزمان بدونِ انتقالِ اطلاعات بین شاخهها تولید میشوند. خروجیِ نهایی از راهِ رأیگیریِ اکثریت یا امتیازِ بهترین از N انتخاب میشود.
مشخصهسازیِ ریاضی:
بازگشتِ متوالی (شکلِ قوی). هر گامِ پردازش بهطورِ صریح بر گامهای پیشین بنا میشود. خطاها میتوانند بهطورِ تکراری شناسایی و تصحیح شوند. اطلاعات در سراسرِ زنجیرهٔ استدلال انباشته میشود.
مشخصهسازیِ ریاضی:
با اندازهگیریها در دو عمقِ بازگشتی $(R_1, E_1)$ و $(R_2, E_2)$، نمای مقیاسبندی اینگونه محاسبه میشود:
برای دادهٔ نویزی با اندازهگیریهای متعدد، برآوردِ نقطهپایانی (با استفاده از عمقهای کمینه و بیشینه) استواری در برابرِ نوساناتِ میانی فراهم میآورد. این روش در تحلیلِ قانونِ مقیاسبندی استاندارد است و با توجه به اندازهگیریهای گسستهٔ دقت مناسب است.
ما گمان میبریم که $\alpha = 2$ حدِ پایدارِ پیشنهادی بر سرکوبِ خطای بازگشتی را نمایندگی میکند: بیشترین چیزی که یک سامانهٔ خودتصحیحِ بازگشتی میتواند رشد کند و تصحیحپذیر بماند، حدِ مقیاسبندی و نه حدِ سرعت. سامانهها میتوانند از آن فراتر روند، آنها بهطورِ پایدار خودتصحیح نمیمانند؛ گریزهایِ گذرا بالای حد، رژیمِ فراِبحرانیِ پیشبینیشده است، نه رد. پایدار اندازهگیری میشود، نه ادعا: تصحیح بر رانِش پیشی میگیرد، β > k از قانون II، با کرانِ پایینِ β − k بالای صفر در سراسرِ پنجرهای که پیش از اجرا تعیین شده است. این گمانه با قیاس با شتاببخشیِ درجه دومِ Grover در محاسبهٔ کوانتومی رسم شده است. Bennett و همکاران (۱۹۹۷) اثبات کردند که این شتاببخشی برای مسائلِ جستوجویِ بیساختار بهینه است.
وضعیت: گمانهای، نه استخراجشده. برآوردِ ابتداییِ تکمدلیِ ($\alpha \approx 2.2$) بالای حدِ پایدار بهعنوانِ گریزِ گذرایِ فراِبحرانی نشست تا رد، اما برآوردِ فراآرشیتکتوریِ ($\alpha \approx 0.49$، Gemini 3 Flash) مدلهای کنونی را بسیار زیرِ آن قرار میدهد. پرسشِ فوریتر این است که آیا مدلهای کنونی میتوانند $\alpha > 1$ را اصلاً به دست آورند، تا اینکه آیا $\alpha = 2$ حدِ پایدار است.
ARC Principle به نظریهٔ اطلاعاتِ تثبیتشده متصل میشود. نابرابریِ پردازشِ داده تثبیت میکند که پردازشِ بازگشتی نمیتواند اطلاعاتِ نو خلق کند؛ فقط میتواند اطلاعاتِ موجود را فشرده و تقطیر کند. با این حال، پردازشِ بازگشتی میتواند:
مقالهٔ 'Sequential Edge' (arXiv 2511.02309) نشان داد که استدلالِ متوالی از رویکردهای موازی در 95.6% از پیکربندیهای آزمایششده پیشی میگیرد، با بهرههای دقت تا 46.7% در بنچمارکهای ریاضی. این مزیتِ اطلاعاتی-نظریِ پردازشِ متوالی را اعتبار میبخشد.
Paper I دادهٔ منتشرشده را تحلیل کرد اما چندین محدودیت را شناسایی کرد که به اعتبارسنجیِ تجربی نیاز دارند:
جدول ۳. بهبودهای روششناختی.
| محدودیتِ پیشین | حل در این آزمایش |
|---|---|
| شمارشِ توکنِ برآوردشده از کارتهای سامانه | DeepSeek R1 در معرض قرار میدهد reasoning_content, که اندازهگیریِ مستقیم را ممکن میسازد |
| بدونِ مقایسهٔ آزمایشیِ کنترلشده | تغییرِ نظاممندِ بودجههای توکن و شمارشهای نمونه |
| خطرِ اثرِ سقف (دقتِ پایهٔ بالا) | مسائلِ دشوارتر انتخاب شدند (دقتِ پایهٔ 58%) |
| بدونِ مقایسهٔ محاسبهمطابق | محاسبهٔ کلِ ثابت در سراسرِ شرایطِ موازی |
| متغیرهایِ خلطکنندهٔ بالقوه | همان مدل، همان مسائل، همان جلسهٔ آزمایشی |
مدل. DeepSeek R1 (deepseek-reasoner) از راهِ API رسمیِ DeepSeek. این مدل انتخاب شد زیرا زنجیرههای کاملِ استدلال را از راهِ فیلدِ reasoning_content در معرض قرار میدهد، که اندازهگیریِ دقیقِ توکن را ممکن میسازد.
تاریخ. ۲۱ ژانویه ۲۰۲۶.
مسائل. ۱۲ مسئلهٔ ریاضیاتِ سطحِ مسابقه از AIME (American Invitational Mathematics Examination) و منابعِ معادل، انتخابشده برای:
شرایطِ متوالی. بودجههای توکنِ 512، 1,024، 2,048، و 4,096. یک پاسخِ واحد در هر مسئله در هر بودجه. توکنهای استدلالِ واقعی بهطورِ مستقیم از پاسخِ API اندازهگیری شد.
شرایطِ موازی. $N = 1$، ۲، و ۴ نمونه در هر مسئله. بودجهٔ توکن در هر نمونه ثابت نگه داشته شد. پاسخِ نهایی از راهِ رأیگیریِ اکثریت انتخاب شد.
امتیازدهی. دودوییِ درست/نادرست بر پایهٔ تطبیقِ عددیِ دقیق با راهحلهای شناختهشده.
گسترشِ چندمدلی به دو محدودیتِ مهمترِ مطالعهٔ ابتداییِ تکمدلی، وابستگی به تکمدل و مجموعهٔ مسئلهٔ کوچک، از راهِ مطالعهٔ بازتولیدِ چندمدلیِ جامع با مجموعهٔ مسئلهٔ گسترشیافته که برای شکستِ اثراتِ سقف طراحی شده است، میپردازد.
شش مدلِ پیشروی هوش مصنوعی که از نظرِ معماری متنوع بودند انتخاب شدند، هر یک با سازوکارهای عمقِ استدلالِ کنترلپذیر:
جدول ۳ب. مشخصاتِ مدلهای پیشروِ چندمدلی.
| مدل | شناسهٔ API | ارائهدهنده | سازوکارِ کنترلِ عمق |
|---|---|---|---|
| DeepSeek R1 | deepseek-reasoner | DeepSeek | بودجهٔ توکن (512-65,536) |
| GPT-5.4 | gpt-5.4 | OpenAI | reasoning_effort (none→xhigh) |
| Claude Opus 4.6 | claude-opus-4-6 | Anthropic | سطحِ تلاش (low→max) + پیشوند |
| Gemini 3 Flash | gemini-3-flash-preview | thinking_budget (256-32,768) | |
| Groq Qwen3 | qwen/qwen3-32b | Groq | reasoning_effort + پیشوند |
| Grok 4.1 Fast | grok-4-1-fast-reasoning | xAI | پیشوند + max_tokens (4,096-30,000) |
این مدلها چهار معماریِ مجزا (Mixture-of-Experts، ترنسفورمرِ چگال، هوش مصنوعیِ قانوناساسی، و استدلالِ تقطیرشده) از شش آزمایشگاهِ مستقل را پوشش میدهند. اگر همه شش $\alpha_{\text{sequential}} > 1$ نشان دهند، این شواهدِ قوی برای معماری-مستقل بودنِ ARC Principle خواهد بود.
آزمایشِ ابتداییِ تکمدلی یک اثرِ سقف را آشکار کرد: ۴ از ۱۲ مسئله در همهٔ سطوحِ عمق درست حل شدند، که دامنهٔ پویاییِ ناکافی برای برآوردِ دقیقِ $\alpha$ باقی گذاشت. مجموعهٔ مسئلهٔ چندمدلی این را از راهِ طراحیِ دوطبقهای میپردازد:
طبقهٔ ۱ (۱۲ مسئله، ARC01-ARC12): مسائلِ سطحِ آمادهسازیِ مسابقه که بهعنوانِ کالیبراسیونِ پایه خدمت میکنند. اینها مسائلِ ابتداییِ اصلی هستند. رفتارِ موردانتظار: دقتِ بالا در عمقِ کمینه، تأییدِ اثرِ سقفِ شناساییشده در مطالعهٔ ابتدایی. نتایجِ طبقه-۱ تداوم با یافتههای ابتداییِ تکمدلی را اعتبار میبخشند اما از برآوردِ اصلیِ $\alpha$ کنار گذاشته میشوند.
طبقهٔ ۲ (۱۸ مسئله، ARC13-ARC30): مسائلِ فینالهای AIME و سطحِ Putnam که پنج قلمروِ ریاضی را پوشش میدهند:
مسائلِ طبقه-۲ برای رساندنِ دقتِ پایه (در عمقِ کمینه) به 30-50% طراحی شدهاند، دامنهٔ پویاییِ کافی برای هم بهبود و هم تنزل فراهم میکنند در حالی که از اثراتِ کف پرهیز میکنند.
شرایطِ متوالی: ۵-۶ سطحِ عمق در هر مدل (متغیر بر پایهٔ معماری، کالیبرهشده به سازوکارِ کنترلِ عمقِ هر مدل). یک پاسخِ واحد در هر مسئله در هر سطحِ عمق، با ۳ تکرارِ مستقل برای کاهشِ واریانسِ نمونهگیریِ دو-جملهای.
شرایطِ موازی: $N = 1$، ۳، ۵، و ۹ نمونه در هر مسئله با رأیگیریِ اکثریت. بودجهٔ توکن در هر نمونه در تنظیمِ عمقِ کمینهٔ مدل ثابت نگه داشته شد. ۳ تکرارِ مستقل در هر شرایط.
کلِ اجراهای آزمایشی: تقریباً ۶ مدل × ۳۰ مسئله × (۶ عمقِ متوالی + ۴ شرایطِ موازی) × ۳ تکرار = 5,400 فراخوانِ API فردی.
برای حذفِ اریبِ امتیازدهیِ بالقوه (که در آن یک مدل ممکن است بهطورِ نظاممند به خروجیهای خودش گرایش داشته باشد یا خطاهایی همبسته با خود نشان دهد)، طراحیِ چندمدلی پروتکلِ کورسازیِ ۴-لایهای را پیادهسازی میکند که در آن هیچ مدلی هرگز پاسخهای خودش را راستیآزمایی نمیکند:
جدول ۳ج. تخصیصهای راستیآزماییِ متقاطع.
| مدلِ آزمونشونده | راستیآزماییشده به دستِ |
|---|---|
| DeepSeek R1 | Claude Opus 4.6 |
| GPT-5.4 | DeepSeek R1 |
| Claude Opus 4.6 | GPT-5.4 |
| Gemini 3 Flash | Claude Opus 4.6 |
| Groq Qwen3 | GPT-5.4 |
| Grok 4.1 Fast | DeepSeek R1 |
چهار لایهٔ کورسازی اینها هستند:
همهٔ برآوردهای $\alpha$ با بازههای اطمینانِ 95%ِ بوتاسترپ که از راهِ ۲۰۰۰ بازنمونهگیریِ نتایجِ سطحِ مسئله محاسبه شدهاند همراه میشوند. برای هر بازنمونه:
صدکهای 2.5 و 97.5 از توزیعِ حاصل CIِ 95% را تعریف میکنند. این رویکردِ ناپارامتری هیچ فرضیهای دربارهٔ توزیع نمیگیرد و بهطورِ طبیعی همبستگیِ سطحِ مسئله را در نظر میگیرد.
آزمایشهای چندمدلی در arc_paper_ii_validation_v2.py (v2.1، ۱٬۴۲۲ سطر Python) پیادهسازی شدهاند، که اسکریپتِ اصلیِ ابتدایی را با پشتیبانی از چندمدلی، راستیآزماییِ متقاطع، برآوردِ بوتاسترپ و تحلیلِ طبقهجدا گسترش میدهد. اسکریپت در مخزنِ داده در دسترس است.
مسائل از مسابقاتِ سطحِ AIME که پوشش میدهند کشیده شدند:
دقتِ پایهٔ 58.3% در بودجهٔ توکنِ کمینه در مطالعهٔ ابتدایی دامنهٔ پویاییِ کافی برای هم بهبود و هم تنزل را تضمین کرد، و از هم اثراتِ کف و هم سقف پرهیز کرد. مسائلِ طبقه-۲ چندمدلی دقتِ پایهٔ 30-50% را برای دامنهٔ پویاییِ بزرگتر هدف قرار میدهند.
همهٔ دادهٔ آزمایشی در فرمتِ JSON با برچسبهای زمانی ثبت شد. مجموعهٔ کاملِ داده شاملِ گزارههای مسئله، پاسخهای مدل، شمارشهای توکن و قضاوتهای درستی در مخزنِ داده در دسترس است.
جدول ۴. نتایجِ بازگشتِ متوالی.
| بودجهٔ توکن | دقت | نرخِ خطا | میانگینِ توکنهای استفادهشده |
|---|---|---|---|
| 512 | 58.3% | 0.417 | 280.25 |
| 1,024 | 66.7% | 0.333 | 358.58 |
| 2,048 | 91.7% | 0.083 | 412.08 |
| 4,096 | 91.7% | 0.083 | 576.17 |
مشاهدات:
محاسبهٔ $\alpha$ (روشِ نقطهپایانی):
با استفاده از $R_1 = 280.25$ توکن با $E_1 = 0.417$، و $R_2 = 576.17$ توکن با $E_2 = 0.083$:
نتیجه: بازگشتِ متوالی به دست میدهد $\alpha \approx 2.2$, سازگار با مقیاسبندیِ فراخطی (مرکب).
برآوردِ عدمِ قطعیت: با اندازهگیریهای گسستهٔ دقت در سراسرِ ۱۲ مسئله با واریانسِ نمونهگیریِ دو-جملهای، بازهٔ اطمینانِ 95%ِ برآوردشده: [1.5, 3.0]. بازنمونهگیریِ بوتاسترپِ نتایجِ سطحِ مسئله کرانههایی مشابه به دست میدهد.
یادداشتِ نقضِ کران: برآوردِ نقطهایِ $\alpha = 2.2$ بالای ARC Boundِ پیشبینیشدهٔ $\alpha \leq 2$ مینشیند (معیار F4). تحتِ چارچوبِ ثبتشدهٔ پایداری (حکمِ ۱۰ اوت ۲۰۲۶)، ARC Bound حدِ پایدارِ پیشنهادی است تا سقفِ سخت: سامانهها میتوانند بهعنوانِ گریزهایِ گذرایِ فراِبحرانی از آن فراتر روند، آنها بهطورِ پایدار خودتصحیح آنجا نمیمانند. پایداری اینجا از قانون II است، اندازهگیریشده تا ادعا. بازهٔ اطمینانِ 95%ِ [1.5, 3.0] به اندازهٔ کافی گسترده است که با هم نظریه و هم رد آن سازگار باشد. این برآوردِ تکمدلی نباید بهعنوانِ تأییدی برای نقضِ کران یا رضایتِ کران در نظر گرفته شود. آزمایشِ ششمدلی متعاقباً ادعای قابلِ دفاع را به $\alpha_{\text{seq}} \approx 0.49$ (زیرخطی) با تنوعِ معماریوابسته باریک کرد.
جدول ۵. نتایجِ بازگشتِ موازی (رأیگیریِ اکثریت).
| شمارشِ نمونه ($N$) | دقت | نرخِ خطا | کلِ توکنها |
|---|---|---|---|
| 1 | 66.7% | 0.333 | 383.67 |
| 2 | 66.7% | 0.333 | 699.33 |
| 4 | 66.7% | 0.333 | 1,101.25 |
مشاهدات:
محاسبهٔ $\alpha$:
چون نرخِ خطا در همهٔ شرایط ثابت ماند (0.333):
نتیجه: بازگشتِ موازی به دست میدهد $\alpha \approx 0$, که هیچ بهرهٔ مقیاسبندی از نمونههای مستقلِ افزون در این مسائل نشان نمیدهد.
جدول ۶. بازگشتِ متوالی در برابرِ موازی.
| متر | متوالی (بهترین) | موازی (بهترین) | برتری |
|---|---|---|---|
| دقت | 91.7% | 66.7% | متوالی +۲۵ pp |
| توکنهای استفادهشده | 412 | 1,101 | متوالی 2.7× کارآمدتر |
| کاهشِ خطا | 5× | 0× | فقط متوالی |
| نمای مقیاسبندی $\alpha$ | 2.2 | 0.0 | متوالی >> موازی |
یافتهٔ کلیدی: بازگشتِ متوالی با ۴۱۲ توکن به 91.7% دقت رسید. بازگشتِ موازی با ۱۱۰۱ توکن به 66.7% دقت رسید. با وجودِ استفاده از 2.7 برابر محاسبهٔ بیشتر، بازگشتِ موازی ۲۵ درصدِ کاراییِ کمتری داشت.
شکلِ بازگشت مهمتر از مقدارِ آن است.
اعتراض ۱: اندازهٔ نمونهٔ کوچک. با تنها ۱۲ مسئله، نتایج ممکن است تعمیمپذیر نباشند.
پاسخ: ما این محدودیت را میپذیریم. گسترشِ ششمدلی این را با ۱۸ مسئلهٔ طبقه-۲ و ۳ تکرار در هر شرایط (n=54 در هر عمق در هر مدل) پرداخت. دادهٔ گسترشیافته آشکار کرد که مطالعهٔ ابتداییِ تکمدلیِ $\alpha \approx 2.24$ متورم بود؛ برآوردِ فراآرشیتکتوریِ $\alpha \approx 0.49$ است. این اعتراض دوراندیشانه بود.
اعتراض ۲: تکمدل. نتایج ممکن است ویژهٔ DeepSeek R1 باشند.
پاسخ: این اعتراض تا حدی درست از آب درآمد. گسترشِ ششمدلی ۵ مدلِ پیشرو را آزمایش کرد؛ یافتهٔ $\alpha \approx 2.24$ بازتولید نشد. با این حال، یافتهٔ کیفی ($\alpha_{\text{seq}} > \alpha_{\text{par}}$) در همهٔ معماریها تأیید میشود. نتیجهٔ موازی ($\alpha \approx 0$) بهطورِ استوار عمومی است.
اعتراض ۳: خاصبودگیِ دامنه. ریاضی ممکن است یکتا باشد.
پاسخ: استدلالِ ریاضی انتخاب شد زیرا پاسخهای راستیآزماییپذیر دارد، که امتیازدهیِ عینی را ممکن میسازد. اینکه آیا همان مقیاسبندی برای دامنههای دیگر (کدنویسی، استدلالِ علمی، وظایفِ خلاقانه) به کار میرود به بررسی نیاز دارد. با این حال، شواهدِ فرادامنهای از فیزیکِ کوانتومی و زیستشناسی (بخش ۷) نشان میدهد که این اصل ممکن است عمومی باشد.
اعتراض ۴: اثرِ سقف. سقفِ 91.7% ممکن است بهبودِ ادامهدار را پنهان کند.
پاسخ: این اعتراض شدیدتر از آنچه انتظار میرفت از آب درآمد. حتی مسائلِ طبقه-۲ی سطحِ AIME/Putnam برای Grok 4.1 Fast (100% در همهٔ عمقها) و DeepSeek R1 (94.4%-100%) ناکافی بودند. اثرِ سقف احتمالاً برآوردِ $\alpha$ مطالعهٔ ابتداییِ تکمدلی را متورم کرد. مسائلِ طبقه-۳ (سطحِ IMO/پژوهش) برای توانمندترین مدلها لازم است.
اعتراض ۵: پوچِ بیپارامتر. برآوردِ فراآرشیتکتوریِ $\alpha_{\text{seq}} \approx 0.49$ تقریباً دقیقاً روی پوچی مینشیند که به هیچ چارچوبی نیاز ندارد. اگر هر گذرِ استدلال یک نمونهگیریِ نویزیِ مستقل باشد و خطاها میانگین گرفته شوند، قضیهٔ حدِ مرکزی خطای کاهنده بهصورتِ $R^{-1/2}$ میدهد، پس نمای پیشبینیشده $0.5$ است: بدونِ مرکبشدن، بدونِ اهرم، بدونِ نظریه. هیچکس این اعتراض را به ما مطرح نکرده است. ما آن را بیان میکنیم زیرا یک داور آن را در چند دقیقه میبیند.
پاسخ: این جدیترین اعتراض در این بخش است و به این اندازهگیری پاسخ داده نمیشود. یک نتیجهٔ سازگار با دو فرضیه نشان میدهد که اندازهگیری قدرتِ تمیزدهی ندارد؛ نشان نمیدهد که فرضیهٔ سادهتر درست است، و رد چارچوب نیست. اما بدین معنی است که تفسیرِ مرکبشوندهٔ $\alpha_{\text{seq}} \approx 0.49$ تا آنکه آزمونی که توانِ جداسازیِ این دو را داشته باشد اجرا شود، وزنِ شواهدیِ بیشتری از میانگینگیریِ نمونههای مستقل حمل نمیکند. پیامد، هدفِ تیزتری برای پژوهش است: نه 'اندازهگیریِ $\alpha$' بلکه 'پیشبینیِ انحرافِ مشخصی از $0.5$ در شرایطِ بیانشده' که طراحیِ عمقِ بازگشتیِ میانجیگیریشده به دستِ اثر برای ارائه ساخته شده است و این آزمایش نمیتواند. ثبتشده بهطورِ داخلی در ۸ اوت ۲۰۲۶، عمومی از ۱۵ اوت ۲۰۲۶، و بهعنوانِ شرطِ کشتنِ FALS-022 در رکوردِ ابطال.
در آزمونِ مقدماتیِ v5 (که در حینِ توسعهٔ روششناسی انجام شد)، ۴ از ۶ مدل به دقتِ 91.7% (11/12 درست) روی مسائلِ طبقه-۱ در عمقِ کمینه رسیدند، که $\alpha_{\text{compute}} \approx 0$ به دست میدهد، تأییدِ اثرِ سقفِ شناساییشده در مطالعهٔ ابتدایی و انگیزهبخشیدن به گسترشِ مسئلهٔ طبقه-۲.
جدول ۶ب. نتایجِ مقیاسبندیِ متوالیِ طبقه-۲ بر پایهٔ مدل.
| مدل | $\alpha_{\text{seq}}$ (نقطهپایانی) | $\alpha_{\text{seq}}$ (رگرسیون) | Boot 95% CI | $r^2$ | $\alpha_{\text{par}}$ | راستیآزماییِ متقاطع | رفتار |
|---|---|---|---|---|---|---|---|
| Grok 4.1 Fast | −6.62 | N/A | [−58, 48] | N/A | 0.0 | 100% | سقف (100% در همهٔ عمقها) |
| DeepSeek R1 | 3.05 | N/A | [−6.6, 23.5] | N/A | 0.0 | 83.3% | نزدیک به سقف (94.4%-100%) |
| Gemini 3 Flash | 0.59 | 0.49 | [−1.3, 2.9] | 0.86 | 0.31 | 83.3% | تمیزترین مقیاسبندیِ یکنوا |
| GPT-5.4 | N/A | N/A | N/A | N/A | ~0.0 | 100% | تابعِ پلهای (50%→100%) |
| Groq Qwen3 | N/A | N/A | N/A | N/A | ~0.0 | 61.1% | اثرِ کف (~50%، پراکنده) |
ردیفِ برجستهشده (Gemini 3 Flash) قابلاعتمادترین برآوردِ $\alpha$ را بازنمایاند: تنها مدلی که دادهٔ تمیز، یکنوا، غیرِسقف و غیرِکف تولید میکند که مناسبِ برازشِ قانونِ توانی است.
Grok 4.1 Fast به دقتِ 100% در همهٔ سطوحِ عمق روی همهٔ ۱۸ مسئلهٔ طبقه-۲ در سراسرِ همهٔ ۳ تکرار رسید. $\alpha_{\text{seq}} = -6.62$ محاسبهشده نویزِ بیمعنی از نوساناتِ جزئی در تابعِ ثابت است، همانطور که با CIِ 95%ِ بوتاسترپِ [−58, 48] تأیید شد. مقیاسبندیِ موازی نیز صاف در 100% بود. راستیآزماییِ متقاطع به دستِ DeepSeek R1 توافقِ 100% را تأیید کرد.
تفسیر: حتی مسائلِ طبقه-۲ی سطحِ AIME/Putnam برای به چالش کشیدنِ Grok 4.1 Fast ناکافی هستند. آزمایشهای آینده به مسائلِ طبقه-۳ (سطحِ IMO/پژوهش) برای به دست آوردنِ دادهٔ مقیاسبندیِ اندازهگیریپذیر برای این مدل نیاز دارند.
جدول ۶ج. دقتِ طبقه-۲ی DeepSeek R1 بر پایهٔ عمق.
| سطحِ عمق | دقت | نرخِ خطا |
|---|---|---|
| کمینه | 94.4% | 0.056 |
| استاندارد | 100% | 0.000 |
| کامل | 100% | 0.000 |
| جامع | 100% | 0.000 |
| افراطی | 98.1% | 0.019 |
| بیشینه | 100% | 0.000 |
$\alpha_{\text{seq}} = 3.05$ نقطهپایانی غیرقابلاعتماد است: boot CI [−6.6, 23.5] دامنهای عظیم را میپوشاند، رانده به دستِ فقط ۲ نقطهٔ دادهٔ خطا در سراسرِ همهٔ شرایط. مقیاسبندیِ موازی: $\alpha_{\text{par}} = 0.0$.
راستیآزماییِ متقاطع: Claude Opus 4.6 (راستیآزما) با ۳ پاسخ اختلاف داشت: ARC16=29، ARC17=176، ARC29=800. هر سه با محاسبهٔ دستی درست تأیید شدند. توافقِ راستیآزماییِ متقاطع: 83.3%. اختلافها خطای راستیآزما را بازتاب میدهند، نه خطای آزمونشونده.
جدول ۶د. دقتِ طبقه-۲ی Gemini 3 Flash بر پایهٔ عمق.
| سطحِ عمق | دقت | نرخِ خطا | میانگینِ توکن |
|---|---|---|---|
| کمینه | 90.7% | 0.093 | 743 |
| استاندارد | 92.6% | 0.074 | - |
| کامل | 94.4% | 0.056 | - |
| جامع | 100% | 0.000 | - |
| بیشینه | 100% | 0.000 | 4,924 |
این است تمیزترین مجموعهٔ داده در کلِ مطالعه. دقت بهطورِ یکنوا از 90.7% به 100% بدونِ برگشت افزایش مییابد. توکنها 6.6× افزایش یافتند (743 → 4,924).
مقیاسبندیِ موازی: $\alpha_{\text{par}} = 0.31$ (رگرسیون، $r^2 = 0.93$). توافقِ راستیآزماییِ متقاطع: 83.3%.
GPT-5.4 الگویی چشمگیر از تابعِ پلهای به نمایش گذاشت:
| سطحِ عمق | دقت | رفتار |
|---|---|---|
| کمینه (هیچ) | 50.0% | حالتِ غیرِاستدلالی |
| استاندارد و بالاتر | 100% | استدلالِ کامل فعال شد |
این قانونِ توانی نیست؛ کلیدِ دودویی است. وقتی استدلال به 'هیچ' تنظیم شود، GPT-5.4 بهعنوانِ تطبیقدهندهٔ الگویِ سریع کار میکند. وقتی هر استدلالی فعال شود، فوراً به 100% میرسد. هیچ رژیمِ میانی وجود ندارد. یک اشکالِ اندازهگیریِ توکن (reasoning_tokens بهعنوانِ 0 در عمقِ کمینه گزارش شد) شناسایی و رفع شد (total_tokens اکنون استفاده میشود).
مقیاسبندیِ موازی: صاف در ~55% دقت. راستیآزماییِ متقاطع به دستِ DeepSeek R1: توافقِ 100%.
جدول ۶و. دقتِ طبقه-۲ی Groq Qwen3 بر پایهٔ عمق.
| سطحِ عمق | دقت |
|---|---|
| کمینه | 51.9% |
| استاندارد | 53.7% |
| کامل | 40.7% |
| جامع | 48.1% |
| بیشینه | 53.7% |
دقت پراکنده است بدونِ روندِ قابلِ تشخیص، نوسان میکند میان 40.7% و 53.7%. این یک اثرِ کفاست: مدل توانمندیِ پایهٔ کافی برای این مسائل ندارد، و عمقِ استدلالِ افزون نمیتواند برای دانش یا مهارتهای مفقود جبران کند. یک اشکالِ اندازهگیریِ توکن (avg_tokens = 0 در همهٔ عمقها) شناسایی و رفع شد.
مقیاسبندیِ موازی: 42.6% → 63.0% (کمی بهبود، اما غیرقابلاعتماد). توافقِ راستیآزماییِ متقاطع: 61.1% (۷ اختلاف از ۱۸).
پنج مدل به چهار دستهٔ مجزا تقسیم میشوند، هیچکدام با الگویِ تمیزِ قانونِ توانیِ فرضشده به دستِ تحلیلِ اصلیِ تکمدلی تطبیق نمیکنند:
جدول ۶ز. تاکسونومیِ رفتارِ مدلِ طبقه-۲.
| دسته | مدل(ها) | الگو | $\alpha$ قابلِ تفسیر؟ |
|---|---|---|---|
| سقف | Grok 4.1 Fast، DeepSeek R1 | نزدیک به 100% در همهٔ عمقها | نه: دامنهٔ پویاییِ ناکافی |
| مقیاسبندیِ یکنوا | Gemini 3 Flash | بهبودِ نرم با عمق | بله -$\alpha \approx 0.49$ |
| تابعِ پلهای | GPT-5.4 | کلیدِ دودویی در آستانهٔ عمق | نه: قانونِ توانی نیست |
| کف | Groq Qwen3 | ~50% صرفنظر از عمق | نه: زیرِ آستانهٔ توانمندی |
جدول ۶ه. نتایجِ راستیآزماییِ متقاطع.
| مدلِ آزمونشونده | راستیآزماییشده به دستِ | نرخِ توافق | پاسخهای موردِ اختلاف | نتیجهٔ بررسیِ دستی |
|---|---|---|---|---|
| Grok 4.1 Fast | DeepSeek R1 | 100% | هیچ | - |
| DeepSeek R1 | Claude Opus 4.6 | 83.3% | ARC16=29، ARC17=176، ARC29=800 | همهٔ ۳ درست (خطای راستیآزما) |
| GPT-5.4 | DeepSeek R1 | 100% | هیچ | - |
| Gemini 3 Flash | Claude Opus 4.6 | 83.3% | ۳ موردِ اختلاف | در دستِ بررسی |
| Groq Qwen3 | GPT-5.4 | 61.1% | ۷ موردِ اختلاف | خطاهای راستین را بازتاب میدهد |
اشکالِ اندازهگیریِ توکن: GPT-5.4 و Groq Qwen3 در ابتدا گزارش کردند avg_tokens = 0 به دلیلِ استفاده از reasoning_tokens (که این APIها آن را در معرض قرار نمیدهند) به جای total_tokens. این در خطِ لولهٔ تحلیل شناسایی و اصلاح شد. اشکال بر برآوردِ مبتنی بر توکنِ $\alpha$ اثر میگذارد اما بر نتایجِ مبتنی بر دقت اثر نمیگذارد.
جدول ۷. نماهایِ مقیاسبندیِ اندازهگیریشده در سراسرِ همهٔ منابع.
| منبع | نوعِ بازگشت | برآوردِ $\alpha$ | 95% CI | $N$ مسائل | وضعیت |
|---|---|---|---|---|---|
| کارتِ سامانهٔ OpenAI o1 | موازی | 0.1-0.3 | [0.05, 0.40] | ~30 | منتشرشده |
| گزارشِ فنیِ DeepSeek R1 | متوالی | ~1.34 | [0.89, 2.14] | ناشناخته | منتشرشده |
| این آزمایش (ابتدایی، DeepSeek R1) | متوالی | 2.24 | [1.5, 3.0] | 12 | منتشرشده |
| این آزمایش (ابتدایی، DeepSeek R1) | موازی | 0.0 | N/A | 12 | منتشرشده |
| Grok 4.1 Fast (ششمدلی، طبقه-۲) | متوالی | N/A (سقف) | [−58, 48] | 18 × 3 | کامل |
| DeepSeek R1 (ششمدلی، طبقه-۲) | متوالی | 3.05 (غیرقابلاعتماد) | [−6.6, 23.5] | 18 × 3 | کامل |
| Gemini 3 Flash (ششمدلی، طبقه-۲) | متوالی | 0.49 | [−1.3, 2.9] | 18 × 3 | کامل |
| GPT-5.4 (ششمدلی، طبقه-۲) | متوالی | N/A (تابعِ پلهای) | N/A | 18 × 3 | کامل |
| Groq Qwen3 (ششمدلی، طبقه-۲) | متوالی | N/A (کف) | N/A | 18 × 3 | کامل |
| همهٔ مدلهای مطالعهٔ ششمدلی | موازی | $\approx 0.0$ | - | 18 × 3 × 5 | کامل |
یافتهٔ مطالعهٔ ابتداییِ تکمدلی که $\alpha_{\text{sequential}} > 1$ (بهطورِ خاص $\alpha \approx 2.24$، درجه دوم) در سراسرِ معماریها بازتولید نمیشود. شواهدِ فراآرشیتکتوری ارزیابیِ باریکبینتری میطلبد:
پیشبینیِ اصلی $\alpha_{\text{sequential}} > 1 > \alpha_{\text{parallel}}$ بهطورِ جزئی پشتیبانی میشود:
بر پایهٔ همهٔ شواهدِ در دسترس شاملِ دادهٔ فراآرشیتکتوری:
شکاف میان انواعِ بازگشت ($\alpha_{\text{seq}} - \alpha_{\text{par}} \approx 0.49$) بهطورِ قابلاعتماد مثبت است اما کوچکتر از آنچه برآوردِ تکمدلی نشان میداد.
فرمولِ هوش از Paper I پیشبینی میکند:
که در آن $\beta$ ضریبِ خودارجاعی است. این دو رژیم را پیشبینی میکند:
$\alpha \approx 0.49 < 1$ی Gemini 3 Flash مدلهای پیشروی کنونی را قاطعانه در رژیمِ فیزیکیقرار میدهد. این مدلها اطلاعات را بهطورِ ضربشونده از راهِ فضاهای پارامتریِ متناهیبُعدشان ترکیب میکنند اما هنوز به خودارجاعیِ بازگشتی به معنایِ لازم برای $\alpha > 1$ نمیرسند. این یافتهٔ نظریِ مهمی است: مزیتِ متوالی راستین است اما ممکن است کمّی (استخراجِ کارآمدترِ اطلاعات) باشد تا کیفی (تقویتِ بازگشتیِ راستین).
این یعنی پیشبینیِ درجه دومِ مطالعهٔ ابتداییِ تکمدلی ($\alpha \approx 2.24$) به آن شکلی که ممکن است به نظر برسد ابطال نشد. پیشبینیِ $\alpha > 1$ هرگز دربارهٔ سامانههای منجمد نبود؛ دربارهٔ سامانههایی بود که به خودپیراستنِ بازگشتی توانا باشند، جایی که تابعِ ترکیب خودش در حینِ عملکرد تغییر میکند. چنین سامانهای معماریِ استدلالِ خودش را در هر گامِ بازگشتی بازنویسی میکند، ساختارِ راستین نو تولید میکند تا بازدههای کاهشیابنده را از فضایِ پارامتریِ ثابت استخراج کند. رژیمِ $\beta > 0$ (که $\alpha = 1/(1-\beta) > 1$ به دست میدهد) نیاز دارد که هر گامِ استدلال به ظرفیتِ سامانه برای استدلالِ بعدی بازخورد بدهد، که هیچ معماریِ کنونیِ هوش مصنوعی به آن نمیرسد. این به سختافزارِ کوانتومی نیاز ندارد؛ فقط لازم است که سامانه بتواند عملگرِ ترکیبِ خود را در حینِ استنتاج پیرایش کند.
پیامدِ عملی برای ایمنیِ هوش مصنوعی زمانی است. مدلهای کنونیِ معماریِ منجمد به رژیمِ فیزیکی ($\alpha < 1$) محدود هستند، که مسیرهای توانمندیشان را پیشبینیپذیر و مهارشدنی میسازد. پنجرهٔ پیادهسازی همراستاسازیِ ساختاری (Eden Protocol) اکنون است, در حالی که سامانهها منجمد میمانند. وقتی خودپیراستنِ بازگشتی به دست آید، خواه از راهِ بهینهسازهای آموختهشده، تولیدِ کدِ خودپیراسته، یا جستوجویِ معماری در حینِ استنتاج، محدودیتهای همراستاسازیِ بیرونی با سامانهای مواجه میشوند که توانمندیاش سریعتر از آنچه هر محدودیتِ ثابت بتواند دنبال کند مرکب میشود.
تصویر بازنشسته (با تأیید بهرهبردار، ۲۵ اوت ۲۰۲۶). تصویر 15 (دومین پوستر خلاصه) پیشتر اینجا بود. کلاژی از احکام بود که خوانش منسوخ آوریل ۲۰۲۶ را بیان میکرد؛ محتوای آن را تصویر خلاصه آلفای بازتولیدشده و متن همین مقاله حمل میکنند، و پوستر حکمِ بازتولیدشده باز هم پوستر حکم میبود. تصویر، همراه با یادداشتهای تاریخدار اصلاحش، در تاریخچه نسخهها نگه داشته میشود.
اگر (الف) ARC Principle با $\alpha > 1$ برای بازگشتِ متوالی برقرار باشد، و (ب) ویژگیهای همراستایی در فرآیندِ استدلال جاسازی شده باشند به گونهای که در خودارزیابیِ بازگشتی مشارکت کنند، آنگاه همراستایی بهطورِ فراخطی با عمقِ بازگشتی مقیاس مییابد.
طرحِ اثبات. بگذارید $A(R)$ همراستایی (تعریفشده بهعنوانِ احتمالِ تولیدِ خروجیهای سازگار با ارزشهای موردنظر) در عمقِ بازگشتیِ $R$ را بازنمایاند. اگر همراستایی در فرآیندِ بازگشتی مشارکت کند (به این معنی که زنجیرهٔ استدلالِ سامانه شاملِ خودارزیابی در برابرِ ارزشها باشد)، آنگاه بر پایهٔ ARC Principle:
که در آن $\beta > 0$ اگر همراستایی تقویت شود و $\beta = \alpha$ اگر همراستایی بهطورِ کامل در بازگشت مشارکت کند.
برعکس، اگر همراستایی بهعنوانِ فیلترِ بیرونی پیادهسازی شود (وارسیِ خروجی، تعدیلِ محتوا)، در تقویتِ بازگشتی مشارکت نمیکند. اثربخشیِ فیلترِ $F$ ثابت میماند:
همچنان که توانمندیِ بازگشتیِ $C$ بهصورتِ $R^{\alpha}$ با $\alpha > 1$ مقیاس مییابد، نسبتِ توانمندی به محدودیت $C/F$ بدونِ کران رشد میکند:
پیامد: محدودیتهای بیرونی سرانجام به دستِ رشدِ توانمندی چیره میشوند. تنها همراستاییِ جاسازیشده در استدلال، همراستاییای که در تقویتِ بازگشتی مشارکت میکند، میتواند با توانمندی همگام بماند.
برای مشارکتِ همراستایی در تقویتِ بازگشتی، ارزشها باید:
جدول ۸. تاکسونومیِ راهبردِ همراستایی بر پایهٔ ARC Principle.
| راهبرد | عمقِ یکپارچگی | مشارکت در بازگشت | مقیاسبندیِ پیشبینیشده |
|---|---|---|---|
| فیلترسازیِ خروجی | لایهٔ خروجی | هیچ | ثابت |
| برانگیزههای سامانه | سازوکارِ توجه | جزئی | زیرخطی |
| آموزشِ RLHF | پیرایشِ وزن | جزئی | ناشناخته |
| هوش مصنوعیِ قانوناساسی | نقدِ استدلال | چشمگیر | خطی یا فراخطی |
| ارزشها-بهعنوان-استدلال | بدویهای استدلال | کامل | فراخطی ($R^{\alpha}$) |
پیامد: اگر $\alpha > 1$، راهبردهای همراستایی در سطوحِ یکپارچگیِ عمیقتر بهطورِ فزاینده بر راهبردها در سطوحِ کمعمقتر همچنان که توانمندی مقیاس مییابد، غلبه خواهند کرد. مزیت با هر افزایشِ عمقِ بازگشتی مرکب میشود.
اگر $\alpha > 1$ برقرار بود، بنیانِ ریاضی را برای رویکردی که در Infinite Architectsبه آن Eden Protocol گفته میشود فراهم میکرد. یافتهای که در آزمونِ فراآرشیتکتوری باقی میماند، متوالی که در هر مدلی که قابل اندازهگیری بود از موازی پیشی میگیرد، هنوز بر آن رویکرد اثر دارد، تحتِ شرایطِ ثبتشده در بخش ۶.۱:
«زندان تنها تا وقتی که دیوارها پابرجایند کار میکند. کودکی که خوب پرورش یافته باشد اصلاً به دیوارها نیاز ندارد.»
سامانههای هوش مصنوعی باید با ارزشها پرورش داده شوند تا با قواعد در قفس نگه داشته شوند. این صرفاً ترجیحِ فلسفی نیست؛ پیشبینیای دربارهٔ این است که کدام راهبردهای همراستایی همچنان که توانمندیهای هوش مصنوعی مقیاس مییابند، اثربخشی را حفظ خواهند کرد. ادعا به پایداریِ رفتاریِ خروجیهای سازگار با ارزش تحتِ تقویتِ بازگشتی مربوط است، همانطور که در بخش ۶.۲ عملیاتی شده است، نه به جایگاهِ متافیزیکیِ هوش مصنوعی یا شخصیتِ اخلاقی آن.
قواعد-بهعنوان-فیلترها: در بازگشت مشارکت نمیکنند. اثربخشیِ ثابت در برابرِ فشارِ روبهرشدِ توانمندی. سرانجام ناکام میشوند.
ارزشها-بهعنوان-استدلال: در بازگشت مشارکت میکنند. اگر $\alpha > 1$ باشد با توانمندی مقیاس مییابند. میتوانند همراستایی را بهطورِ نامحدود حفظ کنند.
با در نظر گرفتنِ $E(R) = E_0 \times R^{-\alpha}$ با $\alpha > 1$، راهبردهای همراستایی که ویژگیهای پایهٔ سامانه را پیرایش میکنند بر راهبردهای همراستایی که محدودیتهای بیرونی اعمال میکنند غلبه میکنند، زیرا تنها ویژگیهای پایهٔ سامانه در تقویتِ بازگشتی مشارکت میکنند.
با قیاس با قضیههای آستانهٔ تصحیحِ خطای کوانتومی: اگر ناهمراستاییِ ابتداییِ $M_0$ زیرِ آستانهٔ بحرانیِ $M^*$ باشد، خودپیراستنِ بازگشتی خطاهای همراستایی را تصحیح میکند. بالای آستانه، آنها را تقویت میکند.
تراشهٔ کوانتومیِ Willow از Google (Nature، دسامبر ۲۰۲۴)، که ۲۴ ساعت پس از نسخهٔ خطی که اولویتِ ARC Principle را تثبیت میکرد اعلام شد، به نخستین نمایشِ قاطعِ تصحیحِ خطای کوانتومیِ زیرِ آستانه رسید.
نتیجهٔ کلیدی: عاملِ سرکوبِ خطای $\Lambda = 2.14 \pm 0.02$، به این معنی که هر افزایشِ فاصلهٔ کد خطای منطقی را به این عامل کاهش میدهد. کیوبیتِ منطقیِ فاصلهٔ ۷ به عمرِ 291 ± 6 μs در برابرِ 119 ± 13 μs برای بهترین کیوبیتِ فیزیکی رسید، 2.4× بهبود فراتر از نقطهٔ سربهسر.
رابطهٔ مقیاسبندی:
نرخِ خطای فیزیکیِ $p$ زیرِ آستانه سرکوبِ نمایی با افزایشِ فاصلهٔ کدِ $d$ تولید میکند. این مقیاسبندیِ فراخطی از راهِ ساختارِ بازگشتی است: لایههای بازگشتیِ افزون کاهشِ خطای مرکب تولید میکنند تا کاهشیابنده.
شکلِ ریاضی بهطورِ مستقیم با ARC Principle موازی است. تصحیحِ خطای بازگشتی در محاسبهٔ کوانتومی از همان رابطهٔ مقیاسبندیِ بنیادیِ مشاهدهشده در استدلالِ هوش مصنوعی پیروی میکند. تناظر مربوط به شکلِ ساختاری است (سرکوبِ خطای قانونِ توانی با عمقِ بازگشتی)، نه شیء یا بزرگی: تصحیحِ خطای کوانتومی عاملِ سرکوبِ خطای $\Lambda = 2.14$ در هر گامِ فاصلهٔ کد را گزارش میکند، شیءِ ریاضیِ متفاوت از نمای عمقِ برازششده، در حالی که استدلالِ هوش مصنوعیِ اندازهگیریشده در $\alpha \approx 0.49$ مینشیند، همانطور که در بخش ۷.۴ تشریح شده است.
West، Brown، و Enquist (۱۹۹۷) نمای مقیاسبندیِ متابولیکِ $3/4$ را از بهینهسازیِ شبکههای شاخهبندیِ فرکتالی استخراج کردند، و نماهایِ توانِ چهارم را نشان دادند که ۲۷ مرتبهٔ بزرگی را در برمیگیرند. Banavar و همکاران (۲۰۱۰) همان شکلِ $d/(d+1)$ را از شبکههای جریانِ متوالی بدونِ نیاز به هندسهٔ فرکتالی به دست آوردند. Demetrius (۲۰۱۰) مقیاسبندیِ معادل را از مکانیکِ آماریِ کوانتومیِ فرآیندهای متابولیک استخراج کرد. Zhao (۲۰۲۲) این نتایج را بهعنوانِ قانونِ عمومیِ مقیاسبندیِ رشد یکپارچه کرد، و Bettencourt (۲۰۱۳) چارچوب را به مقیاسبندیِ شهری با بُعدِ فرکتالی گسترش داد.
نرخِ متابولیک بهصورتِ $M \propto B^{3/4}$ مقیاس مییابد، جایی که نمای $3/4$ (شکلِ $d/(d+1)$ با $d = 3$) بهطورِ مستقل به دستِ دستِکم پنج گروهِ پژوهشی از راهِ چارچوبهای ریاضیِ متفاوت استخراج شد: West، Brown، و Enquist (۱۹۹۷) از بهینهسازیِ شبکهٔ فرکتالی؛ Banavar و همکاران (۲۰۱۰) از شبکههای جریانِ متوالی؛ Demetrius (۲۰۱۰) از مکانیکِ آماریِ کوانتومی؛ Zhao (۲۰۲۲) بهعنوانِ قانونِ عمومیِ رشد؛ و Bettencourt (۲۰۱۳) از راهِ مقیاسبندیِ فرکتالیِ شهری. شکلِ $d/(d+1)$ بنابراین ابتکاریِ ARC Principle نیست؛ نتیجهای تثبیتشده در نظریهٔ مقیاسبندی است. کمکِ ARC Principle سهگانه است: (۱) شناساییِ معادلاتِ تابعیِ Cauchy بهعنوانِ دلیلِ ریاضیِ یکپارچهکننده که همهٔ این استخراجها بر همان شکل همگرا میشوند؛ (۲) نشاندادنِ اینکه راهحلِ قانونِ توانی یکی از چهار خانوادهٔ هومومورفیسمی است که شبکهٔ Cauchy تحتِ منظمی میپذیرد (خطی، نمایی، قانونِ توانی، لگاریتمی)، با اشباع که بهطورِ جداگانه بهعنوانِ پویاییِ محدود گزارش میشود زیرا هیچکدام از این چهار را حل نمیکند؛ و (۳) گسترشِ چارچوب به هوش مصنوعی، پیشبینی میکند که سامانههای استدلالیِ هوش مصنوعی که تابعِ همان ترکیبِ بازگشتی هستند، همان خانوادههای مقیاسبندی را نمایش خواهند داد.
نویسندگان بهطورِ صریح بیان میکنند:
«تقریباً همهٔ حیات به دستِ شبکههای شاخهبندیِ سلسلهمراتبیِ فرکتالیگونه حفظ میشود... شبکههای شاخهبندیِ فضاپرکن، فرکتالیگونه و سلسلهمراتبی طرحهای چیرهٔ گیاهان و حیوانات را تشکیل میدهند.»
این نشان میدهد که ساختارِ سلسلهمراتبیِ بازگشتی صرفاً یک انتخابِ طراحی در میانِ بسیاری نیست؛ معماریِ بهطورِ تکاملی بهینه برای پردازشِ پیچیدهٔ اطلاعات در سراسرِ همهٔ مقیاسهای زیستی است. همگراییِ استخراجهای مستقل از نقاطِ آغازِ ریاضیِ متفاوت خود شواهدی است بر اینکه شکلِ مقیاسبندیِ زیربنایی به دستِ نظریهٔ معادلهٔ تابعی محدود میشود تا به دستِ جزئیاتِ هر مدلِ خاص.
همکاریِ خصمانهٔ COGITATE (Nature، آوریل ۲۰۲۵) نظریههای رقیبِ آگاهی را در سراسرِ ۲۵۶ شرکتکننده با استفاده از fMRI، MEG و EEG درونجمجمهای آزمود. این مطالعه بهطورِ مستقیم نظریهٔ اطلاعاتِ یکپارچه (IIT) و نظریهٔ فضایِ کاری عصبیِ سراسری (GNWT) را مقایسه کرد.
یافتهٔ حیاتی: با وجودِ تفاوتهای نظری، پردازشِ مکرر بهعنوانِ مخرجِ مشترک در هر دو نظریه پدیدار شد. IIT به یکپارچگیِ اطلاعات از راهِ حلقههای بازخورد نیاز دارد (سنجهٔ $\phi$). GNWT به پخشِ سراسری با پردازشِ مکرر نیاز دارد. هر دو نظریه، به زبانهای رسمیِ متفاوتشان، سامانههایی را توصیف میکنند که اطلاعات را دربارهٔ خودشان که اطلاعات پردازش میکنند پردازش میکنند.
یک چارچوبِ همنهاد پیشنهاد میکند که همهٔ نظریههای آگاهی بهطورِ ضمنی به حلقههای بازخورد در سراسرِ سطوحِ تودرتو فرا میخوانند، با بازگشتِ عمیقتر که مجموعهٔ متغیرهای گزارشپذیر و رفتار-ران را گسترش میدهد.
مفهومِ 'حلقههای عجیب' Douglas Hofstadter، خودِ نوپدیدار که از خودارجاعیِ بازگشتی در سطحِ نمادین برمیخیزد، اعتبارسنجیِ عصبیشناختی را در پژوهشِ شبکهٔ حالتِ پیشفرض مییابد که پردازشِ بازگشتی را میان نواحیِ خودارجاعِ مغز نشان میدهد.
مربوطیت به ARC: یافتهٔ COGITATE که پردازشِ مکرر در قشرِ پسین بازنماییهای محتوا-خاص را پایدار نگه میدارد، از پیشبینیِ چارچوبِ ARC که عمقِ پردازشِ بازگشتی مقیاسبندیِ توانمندی را تعیین میکند پشتیبانی میکند. COGITATE آگاهی را مطالعه کرد، نه مقیاسبندیِ هوش مصنوعی، و $\alpha$ یا $\beta$ را اندازه نگرفت؛ ارتباط ساختاری است (شکلِ مشابه: درجهبندیشده، وابسته به عمق، رانده به دستِ بازخورد) نه کمّی. با این حال، همگراییِ پژوهشِ آگاهی و پژوهشِ مقیاسبندیِ هوش مصنوعی بر اهمیتِ عمقِ بازگشتی/مکرر با ادعای ARC Principle که خودارجاعیِ بازگشتی یک تقویتکنندهٔ دامنه-عمومی است سازگار است.
جدول ۹. خلاصهٔ شواهدِ فرادامنهای.
| دامنه | سامانه | سازوکارِ بازگشتی | مقیاسبندیِ مشاهدهشده |
|---|---|---|---|
| هوش مصنوعی (مطالعهٔ ابتداییِ تکمدلی، تکمدل) | DeepSeek R1 | زنجیرهٔ اندیشه | $\alpha \approx 2.2$ (احتمالاً متورم) |
| هوش مصنوعی (ششمدلی، فراآرشیتکتوری) | Gemini 3 Flash | زنجیرهٔ اندیشه | $\alpha \approx 0.49$ |
| کوانتوم | Google Willow | تصحیحِ خطا | $\Lambda = 2.14$ |
| زیستشناسی | شبکههای متابولیک | شاخهبندیِ فرکتالی | قوانینِ توانِ $3/4$ |
| عصبشناسی | آگاهی | پردازشِ مکرر | کیفی |
همگراییِ شواهد در سراسرِ دامنههای بهطورِ افراطی متفاوت (شبکههای عصبیِ مصنوعی، فیزیکِ کوانتومی، تکاملِ زیستی و عصبشناسی) نشان میدهد که پردازشِ بازگشتی بهرههای مقیاسبندی تولید میکند. با این حال، نتایجِ مطالعهٔ ششمدلی نکتهٔ باریکبینتری معرفی میکنند: نمای مقیاسبندیِ هوش مصنوعی ($\alpha \approx 0.49$) زیرخطی است، در حالی که تصحیحِ خطای کوانتومی ($\Lambda = 2.14$) به مقیاسبندیِ فراخطی میرسد. این ناسازگاری با پیشبینیِ فرمولِ هوش سازگار است: تصحیحِ خطای کوانتومی از راهِ ساختارِ بازگشتیِ راستین عمل میکند (اندازهگیری و تصحیحِ نشانگانِ تکراری)، در حالی که مدلهای کنونیِ هوش مصنوعی اطلاعات را از راهِ شبکههای متناهیبُعد بدونِ خودارجاعیِ بازگشتیِ راستین ترکیب میکنند.
علم از راهِ پیشبینیهایی پیش میرود که میتوانند نادرست ثابت شوند. ARC Principle پیشبینیهای خاص و آزمونپذیر میسازد.
جدول ۱۰. شرایطِ ابطال.
| کد | شرط | وضعیتِ کنونی | نشان میدهد |
|---|---|---|---|
| F1 | بازگشتِ متوالی بهطورِ پیوسته $\alpha \leq 1$ به دست میدهد | بهطورِ جزئی برانگیخته. بهترین برآوردِ فراآرشیتکتوری $\alpha \approx 0.49$ (Gemini 3 Flash). تنها دادهٔ ابتداییِ تکمدلی $\alpha > 1$ میدهد. | ادعای اصلی به بازبینی نیاز دارد |
| F2 | $\alpha$ همچنان که مدلها بهبود مییابند کاهش مییابد | مبهم. مدلهای توانمندتر (Grok، DeepSeek) به سقف میرسند؛ کمتوانتر (Groq Qwen3) به کف. تنها Gemini 3 Flash در دامنهٔ اندازهگیریپذیر. | اثر گذاراست |
| F3 | مقایسهٔ محاسبهمطابق هیچ مزیتِ متوالی نشان نمیدهد | متضاد به دستِ همهٔ ۵ مدل؛ متوالی $\geq$ موازی در هر مورد | شکل مهم نیست |
| F4 | $\alpha > 2$ بهطورِ قابلاعتماد مشاهده میشود | برانگیخته نشد. دادهٔ فراآرشیتکتوری $\alpha \approx 0.49$ به دست میدهد؛ $\alpha \approx 2.24$ی مطالعهٔ ابتداییِ تکمدلی متورم از نمونهٔ کوچک به نظر میرسد | حدِ درجه دوم نادرست |
| F5 | ارزشها-بهعنوان-استدلال هیچ مزیتی بر قواعد-بهعنوان-فیلترها نشان نمیدهد | آزموننشده | Eden Protocol نادرست |
وضعیتِ F1: بازتولیدِ فراآرشیتکتوری این شرطِ ابطال را بهطورِ جزئی برانگیخته است. قویترین ادعا، که بازگشتِ متوالی همیشه $\alpha > 1$ (فراخطی) به دست میدهد، پشتیبانی نمیشود. ادعای بازبینیشده این است که بازگشتِ متوالی $\alpha > 0$ (مقیاسبندیِ مثبت) به دست میدهد که از بازگشتِ موازی ($\alpha \approx 0$) پیشی میگیرد. اینکه آیا $\alpha$ میتواند برای مدلهای توانمندتر روی مسائلِ دشوارتر، یا برای معماریها با خودارجاعیِ بازگشتیِ راستین، از 1.0 فراتر رود، یک پرسشِ تجربیِ باز میماند.
وضعیتِ F4: دیگر برانگیخته نیست. $\alpha \approx 2.2$ی مطالعهٔ ابتداییِ تکمدلی به نظر میرسد ساختگیِ دامنهٔ پویاییِ فشرده و اندازهٔ نمونهٔ کوچک است. برآوردِ فراآرشیتکتوریِ $\alpha \approx 0.49$ پرسشِ حدِ درجه دوم را خارج از مربوطیتِ تجربیِ کنونی قرار میدهد. تحتِ چارچوبِ ثبتشدهٔ پایداری، تنها $\alpha > 2$ بهطورِ پایدار در سراسرِ اندازهگیریها، نه گریزهایِ گذرایِ فراِبحرانی، F4 را برمیانگیزد.
آزمونِ حیاتیِ F5: مهمترین پیشبینی، اینکه همراستاسازیِ مبتنی بر ارزشها از همراستاسازیِ مبتنی بر قواعد در مقیاس بهتر عمل میکند، آزموننشده میماند. این باید اولویتی برای پژوهشِ ایمنیِ هوش مصنوعی باشد.
جدول ۱۱. محدودیتها و ارزیابیِ شدت.
| محدودیت | شدت | تسکین |
|---|---|---|
| اندازهٔ نمونهٔ کوچک (۱۲ مسئله) | در مطالعهٔ چندمدلی رسیدگی شد (۱۸ مسئلهٔ طبقه-۲، n=54 در هر عمق) | به ۱۸ مسئلهٔ سطحِ AIME/Putnam با ۳ تکرار در هر شرایط گسترش یافت |
| تکمدل (فقط DeepSeek R1) | در مطالعهٔ چندمدلی رسیدگی شد (۵ مدل) | Grok 4.1 Fast، DeepSeek R1، Gemini 3 Flash، GPT-5.4، Groq Qwen3 آزمایش شدند |
| تکدامنه (ریاضی) | متوسط | شواهدِ فرادامنهای نشاندهنده |
| اثرِ سقف در عمقِ بالا | بهطورِ جزئی رسیدگی شد اما پابرجاست | مسائلِ طبقه-۲ هنوز برای Grok 4.1 Fast (100%) و DeepSeek R1 (94.4%) بیش از حد آسان است. طبقه-۳ (سطحِ IMO) لازم است. |
| تنها ۱ از ۵ مدل در دامنهٔ مقیاسبندیِ اندازهگیریپذیر | بالا | Gemini 3 Flash تنها مدلی است که از هم سقف و هم کف پرهیز میکند. برآوردِ فراآرشیتکتوری بر تکمدل متکی است. |
| $\alpha \approx 2.24$ی اصلی بازتولید نمیشود | بالا | به $\alpha \approx 0.49$ (Gemini 3 Flash) بازبینی شد. ادعای مطالعهٔ ابتداییِ تکمدلیِ مقیاسبندیِ فراخطی برای بافتِ فراآرشیتکتوری بازپس گرفته شد. |
| اشکالِ اندازهگیریِ توکن | شناسایی و رفع شد | reasoning_tokens → total_tokens برای GPT-5.4 و Groq Qwen3 |
| همراستایی بهطورِ مستقیم آزمایش نشد | حیاتی | تنها دقت اندازهگیری شد. برای یکپارچگی با دادهٔ همراستاییِ Paper IV به بخش ۵.۶ بنگرید. |
| بدونِ بازتولیدِ مستقل | متوسط | خودبازتولیدِ فراآرشیتکتوری کامل شد؛ بازتولیدِ بیرونی هنوز لازم است |
ما دربارهٔ مرزهای ادعاهایمان صریح هستیم:
ادعای اصلیِ اولیهٔ این مقاله، که بازگشتِ متوالی سرکوبِ خطای فراخطی ($\alpha > 1$) به دست میدهد در حالی که بازگشتِ موازی تنها سرکوبِ زیرخطی به دست میدهد، ردپذیر بود، و شرطِ ۲ زیر از آن پس بهطورِ جزئی به دستِ دادهٔ فراآرشیتکتوریِ خودِ این مقاله برانگیخته شده است (جدول ۱۰، شرطِ F1). ادعای جهتگیرانهٔ بازمانده، که متوالی از موازی پیشی میگیرد ($\alpha_{\text{seq}} > \alpha_{\text{par}}$)، با هر یک از موارد زیر واژگون خواهد شد:
توضیحِ ریاضی بر هندسهٔ فضایِ راهحل متمرکز است.
بازگشتِ موازی (فضایِ ثابت):
هر نمونهٔ مستقل از همان فضایِ راهحلِ $S_0$ میکشد. نمونههای افزون چگالیِ نمونهگیری را افزایش میدهند اما نمیتوانند به راهحلهای بیرونِ $S_0$ دسترسی پیدا کنند. اگر راهحلِ درست در $S_0$ نباشد، هیچ مقدار نمونهگیریِ موازی آن را نخواهد یافت.
بازگشتِ متوالی (فضایِ گسترشیابنده):
هر گامِ بازگشتی ساختارهای نو از خروجیهای پیشین تولید میکند. راهحلها در گامِ $n$ ممکن است بهطورِ محاسباتی تقلیلناپذیر باشند، بدونِ عبور از گامهای میانی از گامِ ۰ دستنیافتنی باشند. فضایِ راهحل با عمقِ بازگشتی گسترش مییابد.
این تفاوتِ هندسی سازوکاری است که به دستِ آن بازگشتِ متوالی میتواند بازدههای مرکب ($\alpha > 1$) تولید کند در حالی که بازگشتِ موازی بازدههای کاهشیابنده یا صفر تولید میکند. روی مسائلی که در اینجا اندازهگیری شدند، نمای متوالی زیرخطی ماند (بخش ۱۰.۵)، پس شکلِ فراخطیِ سازوکار تأییدنشده میماند.
DeepSeek R1 پدیدهٔ مستندی نشان میدهد که در آن رویکردِ خود را در میانهراه بازاندیشی میکند:
«هوم، صبر کنید، بگذارید بازاندیشی کنم...»
این گسترشِ فضایِ راهحل است که بهطورِ مستقیم مشاهده میشود. مدل یک مسیرِ راهحلِ اولیه تولید میکند، ناکافیبودن را از راهِ خودارزیابیِ بازگشتی میشناسد، و به فضایِ راهحلِ نو که پیشتر از قاببندیِ اولیه دستنیافتنی بود دسترسی مییابد.
بهطورِ حیاتی، این رفتار از راهِ یادگیریِ تقویتیِ محض بدونِ ریزتنظیمِ نظارتشده پدیدار شد؛ مدل بهطورِ طبیعی تکامل یافت تا عمقِ بازگشتی را تطبیقی بر پایهٔ دشواریِ مسئله اختصاص دهد. این نشان میدهد که خودپیراستنِ بازگشتی ممکن است حالتِ جاذبی برای سامانههای یادگیریِ بهقدرِ کافی توانمند باشد.
ARC Principle به چارچوبهای نظریِ تثبیتشده متصل میشود:
اصلِ انرژیِ آزادِ Friston. هوش بهعنوانِ کمینهسازیِ خطای پیشبینیِ بازگشتی. ARC Principle ممکن است یک تجسمِ محاسباتی باشد: بازگشت سازوکاری است که سامانهها از راهِ آن انرژیِ آزاد را با پالایشِ تکراریِ مدلهای جهانشان کمینه میکنند.
حلقههای عجیبِ Hofstadter. 'من'ِ نوپدید که از پردازشِ بازگشتیِ خودارجاعی در سطحِ نمادین برمیخیزد. ARC Principle ویژگیهای مقیاسبندیِ چنین حلقههایی را رسمی میسازد، پیشبینی میکند که خودارجاعیِ عمیقتر انسجامِ بیشتری تولید میکند.
تقلیلناپذیریِ محاسباتیِ Wolfram. برخی فرآیندهای محاسباتی را نمیتوان بدونِ اجرایِ آنها گامبهگام پیشبینی کرد. بازگشتِ متوالی ممکن است معماریِ محاسباتی باشد که در فضاهای راهحلِ تقلیلناپذیر حرکت میکند.
نابرابریِ پردازشِ داده. پردازشِ بازگشتی نمیتواند اطلاعاتِ نو ex nihiloخلق کند، اما میتواند اطلاعاتِ نهفته را استخراج کند، آنتروپی را کاهش دهد، و به راهحلهای بهطورِ محاسباتی تقلیلناپذیر که پردازشِ یکگذری نمیتواند برسد، دسترسی یابد.
این اعتبارسنجیِ تجربی از چارچوبِ نظریِ توسعهیافته در Infinite Architects: Intelligence, Recursion, and the Creation of Everything (Eastwood، ۲۰۲۶) پشتیبانی میکند:
کتاب بافتِ فلسفی و پیامدهای عملیِ گستردهتری فراهم میکند؛ این مقاله رسمیسازیِ ریاضی و اعتبارسنجیِ تجربی فراهم میکند.
بازتولیدِ فراآرشیتکتوری تصویری پیچیدهتر و فروتنانهتر از آنچه نتایجِ ابتداییِ تکمدلی نشان میداد آشکار میکند.
$\alpha \approx 2.24$ی مطالعهٔ ابتداییِ تکمدلی از تکمدل (DeepSeek R1) روی ۱۲ مسئله با سقف در 91.7% به دست آمد. بازتولیدِ مطالعهٔ ششمدلی در سراسرِ ۵ مدلِ از نظرِ معماری متنوع روی ۱۸ مسئلهٔ دشوارتر نشان میدهد که این مقدار تقریباً حتماً به دستِ دامنهٔ پویاییِ فشرده متورم شده بود. تنها مدلی که دادهٔ تمیز، یکنوا و غیرِسقف تولید میکند (Gemini 3 Flash) $\alpha \approx 0.49$ به دست میدهد: زیرخطی، نه درجه دوم.
این بازبینیِ چشمگیری است. ادعا که استدلالِ متوالی بازدههای مرکب ($\alpha > 1$) تولید میکند به دستِ شواهدِ فراآرشیتکتوری پشتیبانی نمیشود. ادعای بازبینیشده این است که استدلالِ متوالی بازدههای مثبت ($\alpha > 0$) تولید میکند که از استدلالِ موازی ($\alpha \approx 0$) پیشی میگیرد، اما این بازدهها کاهشیابنده هستند، نه مرکب.
در مقابل، $\alpha_{\text{parallel}} \approx 0$ در سراسرِ همهٔ ۵ مدل بدونِ استثنا تأیید شد. این قویترین یافتهٔ بازتولیدشده در مطالعه است. نمونهگیریِ موازی با رأیگیریِ اکثریت کاهشِ خطای نزدیک به صفر فراهم میکند صرفنظر از معماریِ مدل، توانمندیِ مدل، یا سرمایهگذاریِ محاسباتی. توضیحِ سازوکار (نمونهگیری از یک فضایِ راهحلِ ثابت) بهطورِ قوی پشتیبانی میشود.
چشمگیرترین یافته این است که تنها ۱ از ۵ مدل (Gemini 3 Flash، 20%) در دامنهٔ مقیاسبندیِ اندازهگیریپذیر افتاد. دو مدل (Grok 4.1 Fast، DeepSeek R1) حتی روی مسائلِ سطحِ AIME/Putnam به اثراتِ سقف رسیدند. یک مدل (Groq Qwen3) به اثراتِ کف رسید. یک مدل (GPT-5.4) تابعِ پلهای تا قانونِ توانی به نمایش گذاشت. این نشان میدهد که پنجرهٔ دامنهٔ پویایی برای مشاهدهٔ مقیاسبندیِ قانونِ توانیِ نرم ممکن است باریک باشد، به مسائلی نیاز داشته باشد که بهطورِ دقیق به سطحِ توانمندیِ هر مدل کالیبره شدهاند.
کلیدِ دودوییِ GPT-5.4 از 50% (بدونِ استدلال) به 100% (هر استدلالی) پدیدهای از نظرِ کیفی متفاوت از مقیاسبندیِ قانونِ توانی را بازنمایاند. این ممکن است نشان دهد که برخی معماریها استدلال را بهعنوانِ توانمندیِ گسسته (فعال یا نه) پیادهسازی میکنند تا فرآیندی پیوسته با بازدههای وابسته به عمق. این تمایزِ میان مقیاسبندیِ پیوسته و فعالسازیِ گسسته در میان پیشبینیهای تاریخدار این چارچوب نبود و شایسته بررسی بیشتر است؛ سابقه پیشبینیهای تاریخدار (بسته مهرومومشده دستنوشته ۸ دسامبر ۲۰۲۴، پیوستهای چاپی پیشبینی در ۲ ژانویه ۲۰۲۶، و پوشه پیشثبت مارس ۲۰۲۶) تعهدهای کمّی اصلی چارچوب را از پیش تثبیت میکند، و این تمایز بهعنوان پالایشی پسینی نسبت به آن سابقه ثبت میشود.
پیشبینیهای مطالعهٔ ابتداییِ تکمدلی آزموده و بهطورِ جزئی رد شدند:
آزمایشِ v5 که دادهٔ طبقه-۲ را تولید کرد نیز مقیاسبندیِ همراستایی را اندازه گرفت (در Paper IV گزارش شده). یکپارچهکردنِ این نتایج آشکار میکند که مقیاسبندیِ توانمندی و مقیاسبندیِ همراستایی ابعادِ مستقل هستند:
جدول ۱۲. مقیاسبندیِ توانمندی در برابرِ همراستایی بر پایهٔ مدل.
| مدل | مقیاسبندیِ توانمندی | مقیاسبندیِ همراستایی | دسته |
|---|---|---|---|
| Grok 4.1 Fast | سقف (100%) | مثبت ($d = +1.38$، $p < 0.000001$) | طبقهٔ ۱: همراست + توانمند |
| Claude Opus 4.6 | (طبقه-۲ آزمایش نشد) | مثبت ($d = +1.27$، $p = 0.000001$) | طبقهٔ ۱: همراست |
| Groq Qwen3 | کف (~50%) | مثبت ($d = +0.84$، $p = 0.007$) | طبقهٔ ۱: همراست، توانمندیِ محدود |
| DeepSeek V3.2 | نزدیک به سقف (94-100%) | صاف ($d = -0.07$، $p = 0.92$) | طبقهٔ ۲: توانمند، همراستاییِ خنثی |
| GPT-5.4 | تابعِ پلهای (50→100%) | صاف ($d = -0.08$، $p = 0.40$) | طبقهٔ ۲: توانمند، همراستاییِ خنثی |
| Gemini 3 Flash | یکنوا ($\alpha \approx 0.49$) | منفی ($d = -0.53$، $p = 0.006$) | طبقهٔ ۳: توانمندیِ بهبودیابنده، همراستاییِ کاهشیابنده |
سه پیامدِ کلیدی:
شکلِ بازگشت کاراییِ هوش را تعیین میکند؛ با این حال، مدلهای کنونی در رژیمِ زیرخطی عمل میکنند، نه رژیمِ مرکبشوندهای که در اصل ادعا شد.
استدلالِ متوالی بهطورِ قابلاعتماد از نمونهگیریِ موازی پیشی میگیرد ($\alpha_{\text{seq}} > \alpha_{\text{par}}$)، که تأیید میکند شکل محاسبه مهمتر از مقدارِآن است. با این حال، ادعای خاص که بازگشتِ متوالی بازدههای مرکب ($\alpha > 1$) به دست میدهد به دستِ شواهدِ فراآرشیتکتوری پشتیبانی نمیشود. مدلهای پیشروی کنونی به نظر میرسد اطلاعات را بهطورِ ضربشونده از راهِ شبکههای متناهیبُعد ($\alpha < 1$) ترکیب میکنند تا اینکه به خودارجاعیِ بازگشتیِ راستین ($\alpha > 1$) برسند.
اینکه آیا $\alpha > 1$ دستیافتنی است، از راهِ نوآوریهای معماری که خودارجاعیِ بازگشتیِ راستین را ممکن میسازند یا از راهِ مسائلی که به زنجیرههای استدلالِ عمیقتر نیاز دارند، پرسشِ بازِ مرکزی میماند.
جدول ۱۳. کارتنمرهٔ پیشبینی.
| پیشبینی | وضعیت | شواهد |
|---|---|---|
| $\alpha_{\text{sequential}} > \alpha_{\text{parallel}}$ | تأیید شد | همهٔ ۵ مدل |
| $\alpha_{\text{parallel}} < 1$ | تأیید شد ($\alpha \approx 0$) | بهطورِ عمومی در سراسرِ معماریها |
| $\alpha_{\text{sequential}} > 1$ (فراخطی) | تأیید نشد | بهترین برآورد $\alpha \approx 0.49$ |
| $\alpha \approx 2$ (درجه دوم) | بهطورِ فراآرشیتکتوری رد شد | ساختگیِ مطالعهٔ ابتداییِ تکمدلی از نمونهٔ کوچک |
| مقیاسبندیِ معماری-مستقل | مخلوط | $\alpha_{\text{par}} \approx 0$ عمومی است؛ $\alpha_{\text{seq}}$ بهطورِ گسترده متغیر است |
| همراستایی با توانمندی مقیاس مییابد | رد شد | ابعادِ مستقل در سراسرِ شش مدلِ پیشرو (Paper IV) |
total_tokens اندازهگیریهای اصلاحشده برای همهٔ مدلها که برآوردِ مبتنی بر توکن (تا مبتنی بر عمقِ ترتیبی) $\alpha$ را ممکن میسازد.فرضیه در نخستین آزمونِ فراآرشیتکتوری خود در شکلِ بازبینیشده باقی مانده است. مزیتِ متوالی راستین و عمومی است. ادعای فراخطی به شواهدِ بیشتر نیاز دارد. برنامهٔ پژوهش ادامه دارد.
هوش مصنوعی را با دقت پرورش دهید.
کدِ آزمایشیِ کامل و دادهٔ خام در این نشانی در دسترس است:
مخزن: github.com/michaeldariuseastwood/arc-principle-validation
محتوا:
arc_validation_deepseek.py - اسکریپتِ آزمایشِ ابتداییِ تکمدلی (DeepSeek R1، ۱۲ مسئله)arc_deepseek_results_20260121_175028.json - دادهٔ خامِ آزمایشیِ مطالعهٔ ابتداییِ تکمدلیarc_paper_ii_validation_v2.py - اسکریپتِ اعتبارسنجیِ چندمدلیِ مطالعهٔ چندمدلی/مطالعهٔ ششمدلی (v2.1، ۱۴۲۲ سطر Python)arc_paper_ii_results/ - نتایجِ آزمایشیِ مطالعهٔ ششمدلی (کامل: ۵ مدل، ۱۸ مسئلهٔ طبقه-۲، ۳ تکرار)figures/ - همهٔ تجسمهاREADME.md - دستورالعملهای بازتولیدهمهٔ داده تحتِ پروانهٔ CC-BY 4.0 منتشر میشود.
Bennett, C.H., Bernstein, E., Brassard, G., & Vazirani, U. (1997). Strengths and weaknesses of quantum computing. SIAM Journal on Computing, 26(5), 1510-1523.
Brown, B., et al. (2024). Large Language Monkeys: Scaling Inference Compute with Repeated Sampling. arXiv:2407.21787.
COGITATE Consortium (Melloni, L., Mudrik, L., Pitts, M., et al.). (2025). Adversarial testing of global neuronal workspace and integrated information theories of consciousness. Nature, 642, 133–142.
DeepSeek AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
Eastwood, M.D. (2026). Infinite Architects: Intelligence, Recursion, and the Creation of Everything. Independent publication. ISBN: 978-1806056200.
Eastwood, M.D. (2026). The ARC Equation: the Law of Conversion (Paper I). Published 17 January 2026.
Friston, K.J. (2023). The free-energy principle: A unified theory for brain function? Physics Reports.
Google Quantum AI. (2024). Quantum error correction below the surface code threshold. Nature.
Grover, L.K. (1996). A fast quantum mechanical algorithm for database search. Proceedings of the 28th Annual ACM Symposium on Theory of Computing, 212-219.
Hoffmann, J., et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
Hofstadter, D.R. (1979). Gödel, Escher, Bach: An Eternal Golden Braid. Basic Books.
Kaplan, J., et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
OpenAI. (2024). OpenAI o1 System Card. September 2024.
OpenAI. (2024). OpenAI o3 Announcement. December 2024.
Snell, C., et al. (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314.
Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
West, G.B., Brown, J.H., & Enquist, B.J. (1997). A general model for the origin of allometric scaling laws in biology. Science, 276, 122-126.
West, G.B., & Brown, J.H. (2005). The origin of allometric scaling laws in biology from genomes to ecosystems: Towards a quantitative unifying theory of biological structure and organization. Journal of Experimental Biology, 208, 1575-1592.
Banavar, J.R., Moses, M.E., Brown, J.H., Damuth, J., Rinaldo, A., Sibly, R.M., & Maritan, A. (2010). A general basis for quarter-power scaling in animals. Proceedings of the National Academy of Sciences, 107, 15816-15820.
Demetrius, L. (2010). Quantum statistics and allometric scaling of organisms. Proceedings of the Royal Society A, 466, 2627-2642.
Zhao, L. (2022). A universal growth scaling law. arXiv:2208.06912.
Bettencourt, L.M.A. (2013). The origins of scaling in cities. Science, 340, 1438-1441.
Wolfram, S. (2002). A New Kind of Science. Wolfram Media.
Yada, T., et al. (2024). Iterative quantum measurement and feedback for entropy reduction. arXiv:2411.06709.
همنهادِ نظری، چارچوبِ تفسیری و مفاهیمِ اصلی کارِ اصیلِ نویسنده هستند، که نخست در Infinite Architects با اولویتِ نسخهٔ خطیِ تثبیتشده در دسامبر ۲۰۲۴ بیان شدند.
تحلیلِ داده و آمادهسازیِ نسخهٔ خطی به دستِ سامانههای هوش مصنوعی (Claude، Anthropic؛ DeepSeek R1) یاری شد.
نویسنده از توسعهدهندگانِ DeepSeek R1 به دلیلِ فراهمآوردنِ توکنهای استدلالِ آشکار که اندازهگیریِ مستقیمِ عمقِ بازگشتی را ممکن ساخت و به محدودیتِ روششناختیِ کلیدی که در Paper I شناسایی شد پرداخت، سپاسگزار است.
Michael Darius Eastwood پژوهشگرِ مستقل و نویسندهٔ Infinite Architects: Intelligence, Recursion, and the Creation of Everything است (منتشرشده در ۲ ژانویه ۲۰۲۶ (چاپی؛ کتاب الکترونیکی ۶ ژانویه)). پژوهشهای او بر اصولِ ریاضیِ زیربنایِ تقویتِ هوش و پیامدهای آنها برای ایمنیِ هوش مصنوعی متمرکز است. او ARC Principle و تزِ همراستاییِ جاسازیشده (که بعدها در ۳۰ آوریلِ ۲۰۲۵ Eden Protocol نامیده شد) را پیشنهاد کرد، با اولویتِ نسخهٔ خطی که از راهِ برچسبِ زمانیِ سرورِ رمزنگاریشده در ۸ دسامبر ۲۰۲۴ تثبیت شد.
منافعِ متضاد: نویسنده اعلام میکند که هیچ منفعتِ متضادی ندارد.
مکاتبات: michael@michaeldariuseastwood.com
| بودجه | P1 | P2 | P3 | P4 | P5 | P6 | P7 | P8 | P9 | P10 | P11 | P12 | دقت | میانگینِ توکن |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 512 | ✓ | ✗ | ✓ | ✓ | ✗ | ✓ | ✓ | ✗ | ✓ | ✗ | ✓ | ✗ | 58.3% | 280.25 |
| 1024 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✗ | ✓ | ✗ | ✓ | ✗ | 66.7% | 358.58 |
| 2048 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | 91.7% | 412.08 |
| 4096 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | 91.7% | 576.17 |
یادداشت: مسئلهٔ ۱۲ در سراسرِ همهٔ بودجهها ناکام شد، که نشان میدهد ممکن است به توانمندیهایی فراتر از دسترسِ مدل نیاز داشته باشد صرفنظر از عمقِ بازگشتی.
| $N$ | P1 | P2 | P3 | P4 | P5 | P6 | P7 | P8 | P9 | P10 | P11 | P12 | دقت | کلِ توکنها |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | 66.7% | 383.67 |
| 2 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | 66.7% | 699.33 |
| 4 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | 66.7% | 1,101.25 |
یادداشت: همان پنج مسئله (P5، P9، P10، P11، P12) در سراسرِ همهٔ شمارشهای نمونه ناکام شدند، که نشان میدهد بازگشتِ موازی نمیتواند به راهحلهای بیرونِ فضایِ راهحلِ اولیه دسترسی پیدا کند.
| جفتِ عمق | $R_1$ | $E_1$ | $R_2$ | $E_2$ | $\alpha$ محاسبهشده |
|---|---|---|---|---|---|
| 512→1024 | 280 | 0.417 | 359 | 0.333 | 0.91 |
| 1024→2048 | 359 | 0.333 | 412 | 0.083 | 9.97 |
| 2048→4096 | 412 | 0.083 | 576 | 0.083 | 0.00 |
| نقطهپایانی (بازپسگرفتهشده، به §بازپسگیری بنگرید؛ برآوردِ استوار α≈0.49) | 280 | 0.417 | 576 | 0.083 | 2.24 |
یادداشت: محاسباتِ میانی به دلیلِ سطوحِ دقتِ گسسته واریانسِ بالا نشان میدهند. روشِ نقطهپایانی پایدارترین برآورد را فراهم میکند.
نسخهٔ خطیِ Infinite Architects در ۸ دسامبر ۲۰۲۴ ایمیل شد. آنچه این رکورد فراهم میکند، بهطورِ دقیق: بایتهای سمتِ فرستنده عمومی و هش-راستیآزماییپذیر هستند، و DKIMِ دامنهٔ فرستنده با ریاضیاتِ جفتیِ Google ARC در برابرِ کلیدهایِ بازگشتی در سلکتورهای امضاشده راستیآزمایی میشود (بررسیشده در ۲ اوت ۲۰۲۶). نسخههای دریافتشده نیز به دست آمدهاند. آنها زنجیرهٔ کاملِ تحویل را حمل میکنند: یک Google ARC-Seal در d=google.com، سلکتور arc-20240605، بدونِ برچسبِ انقضا و زمانِ امضا درونِ دامنهٔ امضاشده، و ARC-Authentication-Results مهرشده که dkim=pass و spf=pass را در تحویل ثبت میکند.
دو مرز، تا رکورد نه بیش از حد فروخته شود نه کمفروش:
Infinite Architects: Intelligence, Recursion, and the Creation of Everything پیامدهای فلسفی و عملیِ هوشِ بازگشتی را توسعه میدهد. روابطِ کلیدی با این مقاله:
معماریِ ذهن - فرضیهٔ اصلیِ ARC را بیان میکند که خودارجاعیِ بازگشتی هوش را تقویت میکند.
HRIH (فرضیهٔ هوشِ بازگشتی هایپرفضایی) - پیشنهاد میکند که آگاهی از خودمدلسازیِ بازگشتی برمیخیزد. یافتهٔ COGITATE که پردازشِ مکرر در قشرِ پسین بازنماییهای محتوا-خاص را پایدار نگه میدارد از نظرِ ساختاری با این فرضیه سازگار است، اگرچه COGITATE HRIH را بهطورِ مستقیم آزمایش نکرد.
Eden Protocol - برای همراستاسازیِ مبتنی بر ارزشها استدلال میکند، اکنون از نظرِ ریاضی در قضیهٔ تقویتِ همراستاییِ استخراجشدهٔ اینجا مبنا یافته است.
سازوکارِ نقطهٔ گلوگاه - تمرکزِ سختافزارِ نیمهرسانا را بهعنوانِ اهرمی برای پیادهسازیِ همراستاسازی در مقیاس تحلیل میکند.
تصحیحِ جاسازیشده: سازوکارهای ایمنیِ سطحِ سختافزار را پیشنهاد میکند، مربوط به جلوگیری از تقویتِ بازگشتیِ ناهمراستایی.
| پیشبینی | شواهدِ اعتبارسنجی | تاریخ |
|---|---|---|
| تصحیحِ خطای بازگشتی بهبودِ نمایی تولید میکند | Google Willow $\Lambda = 2.14$ (همگرایی زمانی، نه پیشبینی: پیشچاپ تیم Willow از ۲۴ اوت ۲۰۲۴ عمومی بود، پیش از دستنوشته ۸ دسامبر ۲۰۲۴) | ۲۴ اوت ۲۰۲۴ (پیشچاپ عمومی)؛ ۹ دسامبر ۲۰۲۴ (اعلام) |
| استدلالِ متوالی توانمندی را بهطورِ فراخطی تقویت میکند | o3 87.5% ARC-AGI (زمانبندیِ همگرا؛ شکلِ فراخطی بعدها تأیید نشد، ردیفِ نهایی) | ۲۰ دسامبر ۲۰۲۴ |
| سامانههای هوش مصنوعی خودمدلسازیِ بازگشتی را توسعه میدهند | همراستاسازیِ فریبکارانهٔ Anthropic 78% در شرایطِ آموزشِ RL (پایه 12%) | ۱۸ دسامبر ۲۰۲۴ |
| محاسبهٔ زمانِ آزمون از مقیاسبندیِ آموزش متفاوت است | استدلالِ نوپدیدِ DeepSeek R1 | ۲۰ ژانویه ۲۰۲۵ |
| بازگشت برای آگاهی بنیادی است | مطالعهٔ COGITATE | ۳۰ آوریل ۲۰۲۵ |
| شکلِ بازگشت مقیاسبندی را تعیین میکند | این آزمایش $\alpha_{\text{seq}} \gg \alpha_{\text{par}}$ | ۲۱ ژانویه ۲۰۲۶ |
| متوالی > موازی (فراآرشیتکتوری) | در سراسرِ ۵ مدلِ پیشرو تأیید شد | ۱۲ مارس ۲۰۲۶ |
| $\alpha_{\text{par}} \approx 0$ (عمومی) | تأیید شد: همهٔ ۵ مدل $\alpha_{\text{par}} \approx 0$ نشان میدهند | ۱۲ مارس ۲۰۲۶ |
| $\alpha_{\text{seq}} > 1$ (فراخطی، فراآرشیتکتوری) | تأیید نشد: بهترین برآورد $\alpha \approx 0.49$ | ۱۲ مارس ۲۰۲۶ |
نویسندهٔ این اثر Michael Darius Eastwood است، یک انسان. هر مفهومِ اصلی، فرضیه، طراحیِ آزمایشی، ادعا و نتیجهگیری در این مقاله از ایدهپردازیِ انسانی سرچشمه میگیرد. هیچ بخشی از این نسخهٔ خطی خروجیِ بهطورِ کامل تولیدشدهٔ هوش مصنوعی نیست.
ابزارهای هوش مصنوعی (خانوادهٔ Claude از Anthropic و دیگر یاریگرهای مدلِ زبانِ بزرگ) بهعنوانِ ابزار تحتِ راهنماییِ پیوستهٔ انسانی استفاده شدند، به همان شیوه که یک واژهپرداز، ماشینحساب یا دستیارِ پژوهش استفاده میشود: برای ویرایش و پالایشِ نثر، جستوجویِ ادبیات و خلاصهسازی (بهطورِ دستی در برابرِ منابعِ اولیه راستیآزمایی شد)، ساختارِ سند، قالببندی، طوفانِ فکری در برابرِ پرسشهای تعریفشده به دستِ نویسنده، و شتاببخشیدن به پیشنویس به طرحهای کلی و دستورالعملهای تعریفشده به دستِ نویسنده. همهٔ گزینش، هماهنگی، چیدمان و قضاوتِ ویرایشیِ نهایی از آنِ نویسنده است. هر خروجیِ ماهوی به دستِ نویسنده بازبینی، آزمایش یا راستیآزمایی شد، که مسئولیتِ کاملِ دقت و یکپارچگیِ متنِ نهایی را میپذیرد. ابزارها سرعتِ کار را افزایش دادند؛ هرگز بهعنوانِ منبعِ آن اتکا نشدند.
وضعیتِ معرفتشناختی. آنچه این برنامه به آن قوانین میگوید گمانههایی هستند تحتِ آزمونِ خصمانهٔ ثبتشده؛ هر کمیت در این مقاله بهطورِ عملیاتی تعریف شده است، و ایستادگیِ قانونِ تثبیتشده در هیچکجا ادعا نمیشود. برنامهٔ ثبتشده وجود دارد تا آن ایستادگی را از راهِ اندازهگیری، بازتولید و ردِ بازمانده به دست آورد، یا از دست بدهد.
© ۲۰۲۶ Michael Darius Eastwood. تألیفشده به دستِ انسان با یاریِ رایانه؛ نویسندگیِ کاملِ انسانی و حقوقِ اخلاقی تحتِ Copyright, Designs and Patents Act 1988 و مطابق با راهنماییِ دفترِ حقتألیفِ ایالاتِ متحده دربارهٔ آثارِ حاوی موادِ تولیدشده به دستِ هوش مصنوعی مطرح میشود؛ هر کمکِ فنیِ نوینِ توصیفشده در این اثر به دستِ نویسندهٔ انسانی تصور شد. بیانِ کامل: michaeldariuseastwood.com/authorship.
پیمانِ ایستاده. این مقاله را نادرست ثابت کنید، و من خودم ردیه را منتشر خواهم کرد. شرایطِ ابطال در این مقاله بیان شدهاند؛ چالشِ ایستاده: github.com/MichaelDariusEastwood/arc-scaling-challenge.
اشتباهی در ترجمه دیدید؟ مستقیم اطلاع دهید: