Traducción automática del original inglés fechado. La página en inglés es la canónica. English →
Paper II de la ARC Theory: una replicación cruzada entre arquitecturas cegada a lo largo de seis modelos de IA de frontera. La estimación superlineal inicial de un solo modelo (alpha 2.24) no se replicó y queda retirada. Lo que sobrevive: la mejor estimación cruzada entre arquitecturas es alpha 0.49 (Gemini 3 Flash, r cuadrado 0.86), el exponente paralelo es cercano a cero en todos los modelos, y el secuencial superó al paralelo dondequiera que ambos fueron medibles.
Dentro de la ARC Theory: el programa de medición de la Ley I, la ARC Equation; la estimación cruzada entre arquitecturas cegada del exponente, incluida la retirada.
Este artículo presenta la validación experimental del ARC Principle (Artificial Recursive Creation), un marco matemático que propone que las tasas de error en los sistemas inteligentes disminuyen según una ley de potencias con la profundidad recursiva. El principio, articulado por primera vez en Infinite Architects (Eastwood, diciembre de 2024) y formalizado en Paper I (Eastwood, 17 de enero de 2026), predice que la forma de la recursión determina el régimen de escala: la recursión secuencial debería producir supresión de error superlineal (exponente de escala $\alpha > 1$), mientras que la recursión paralela debería producir supresión sublineal ($\alpha < 1$).
Realizamos experimentos controlados en dos fases. La Fase 1 (el estudio inicial de un solo modelo) utilizó DeepSeek R1 con tokens de razonamiento visibles sobre 12 problemas matemáticos de nivel competición, encontrando $\alpha_{\text{sequential}} \approx 2.24$ (IC 95%: 1.5-3.0) y $\alpha_{\text{parallel}} \approx 0.0$. La Fase 2 (el estudio de seis modelos) amplió las pruebas a seis modelos de frontera sobre 18 problemas de nivel AIME/Putnam (n=54 por profundidad por modelo) con intervalos de confianza por bootstrap y verificación cruzada de 4 capas.
Replicación cruzada entre arquitecturas: El $\alpha \approx 2.24$ original (cuadrático) no se replica entre arquitecturas. Solo Gemini 3 Flash produjo datos de escalado limpios y monótonos: $\alpha_{\text{seq}} = 0.49$ (regresión, $r^2 = 0.86$, SE = 0.20, IC bootstrap [−1.3, 2.9]). DeepSeek R1 alcanzó el techo (94.4%-100%). GPT-5.4 exhibió una función escalón binaria (50% → 100%). Grok 4.1 Fast alcanzó el 100% a todas las profundidades. Groq Qwen3 no mostró tendencia (~50%).
Escalado paralelo en o cerca de cero en todos los modelos, con una excepción medida: $\alpha_{\text{parallel}} \approx 0$ para todos los modelos excepto Gemini 3 Flash, que devuelve $\alpha_{\text{par}} = 0.31$ con $r^2 = 0.93$. Esa excepción importa, porque Gemini 3 Flash es el modelo que este artículo trata como su estimación más fiable. El hallazgo replicado es, por tanto, que el escalado paralelo es en o cerca de cero en todos los modelos medidos, con una excepción medida, no que sea universalmente cero. El secuencial superó al paralelo en todos los modelos en los que ambos fueron medibles.
Estimación revisada del parámetro: La estimación cruzada entre arquitecturas más robusta es $\alpha_{\text{sequential}} \approx 0.49$ (sublineal, de Gemini 3 Flash), sustancialmente por debajo de la estimación inicial de un solo modelo de 2.24. Bajo la Fórmula de la Inteligencia $\alpha = 1/(1 - \beta)$ de Paper I, $\alpha < 1$ sitúa a los modelos actuales en el régimen físico (composición multiplicativa a través de redes de dimensión finita) antes que en el régimen de inteligencia (autorreferencia recursiva con $\alpha > 1$). La desigualdad fundamental $\alpha_{\text{sequential}} > \alpha_{\text{parallel}}$ sigue confirmada.
Esta versión reporta resultados completos de tier-2 del estudio de replicación multimodelo:
reasoning_tokens → total_tokens corregido para GPT-5.4 y Groq Qwen3Todos los hallazgos iniciales del estudio de un solo modelo se conservan en su forma original. Las conclusiones se han revisado para reflejar la evidencia cruzada entre arquitecturas.
La evidencia cruzada entre dominios refuerza estos hallazgos. El chip cuántico Willow de Google (diciembre de 2024) demostró supresión recursiva de error con $\Lambda = 2.14$. Las leyes de escala biológicas muestran exponentes de un cuarto a lo largo de 27 órdenes de magnitud mediante redes fractales recursivas. El estudio de conciencia COGITATE (Nature, abril de 2025) identificó el procesamiento recurrente como el denominador común a lo largo de las teorías.
Las implicaciones para la seguridad de la IA dependen críticamente de si $\alpha > 1$ es alcanzable. Si lo es, las propiedades de alineación incrustadas en el proceso de razonamiento escalarían de forma superlineal con la capacidad, mientras que las restricciones externas permanecerían constantes. Incluso con $\alpha < 1$, el hallazgo direccional de que el razonamiento secuencial mejora la capacidad respalda el Eden Protocol de Infinite Architects: los sistemas de IA se benefician de valores incrustados en el razonamiento antes que de restricciones impuestas externamente. Sin embargo, los datos multimodelo muestran que la capacidad y la alineación son dimensiones independientes; más razonamiento no significa automáticamente mejor alineación.
Palabras clave: leyes de escala, inteligencia recursiva, cómputo en tiempo de inferencia, supresión de error, seguridad de IA, alineación, razonamiento en cadena de pensamiento, Eden Protocol, validación cruzada entre dominios, replicación multimodelo
Cómo leer este artículo. Este artículo reporta una medición directa en la ARC Theory. A lo largo de seis modelos de frontera probados sobre treinta problemas con intervalos por bootstrap, el exponente secuencial excede al exponente paralelo en todos los modelos, el mejor ajuste del exponente de cómputo es $\alpha_{\mathrm{compute}} \approx 0.49$ (Gemini 3 Flash, $r^2 = 0.86$), y el rango medido abarca desde casi cero hasta aproximadamente tres, de modo que el Límite ARC $\alpha \leq 2$ no queda ni confirmado ni refutado. Su peldaño dentro de la teoría es la capa de medición cruzada entre arquitecturas por encima de Paper I. El diferencial completo frente a cada documento previo se encuentra en eden-vision II.A.8.
Las leyes de escala que rigen la inteligencia artificial han transformado nuestra comprensión de la emergencia de la capacidad. Kaplan et al. (2020) estableció relaciones de ley de potencias entre el rendimiento del modelo y el cómputo de entrenamiento, mientras que Hoffmann et al. (2022) refinó estas relaciones con prescripciones de cómputo óptimo. Estos trabajos fundacionales revolucionaron la metodología de entrenamiento pero abordan solo el escalado en pre-entrenamiento. No explican por qué asignar cómputo adicional en tiempo de inferencia produce mejoras dramáticas en la capacidad, ni por qué distintas formas de tal cómputo producen resultados fundamentalmente distintos.
La emergencia de los modelos de razonamiento a finales de 2024 introdujo el cómputo en tiempo de inferencia como una variable crítica. o1 de OpenAI (septiembre de 2024) y R1 de DeepSeek (enero de 2025) asignan recursos computacionales durante la inferencia para razonar antes de responder. En benchmarks de razonamiento matemático, estos sistemas alcanzan un rendimiento que antes se pensaba que requería modelos un orden de magnitud mayores. Sin embargo, los mecanismos que subyacen a esta mejora siguen caracterizados de forma incompleta.
Han surgido dos paradigmas para asignar el cómputo en tiempo de inferencia:
Recursión paralela. Generar múltiples soluciones independientes y seleccionar la mejor mediante voto mayoritario o puntuación por verificador. Este enfoque es computacionalmente sencillo pero, como documenta Brown et al. (2024), produce retornos decrecientes que siguen leyes de potencias sublineales.
Recursión secuencial. Generar cadenas de razonamiento extendidas en las que cada paso se apoya explícitamente en los pasos previos. Los errores pueden detectarse y corregirse de manera iterativa mediante autorreferencia. Este enfoque produce retornos que se componen, pero la relación de escala no se ha caracterizado formalmente; este artículo aborda esa laguna.
¿Por qué el razonamiento secuencial supera dramáticamente al muestreo paralelo a coste computacional equivalente? ¿Qué principio matemático rige esta diferencia? ¿Y cuáles son las implicaciones para alinear sistemas de IA cada vez más capaces?
Este artículo hace ocho contribuciones:
El ARC Principle fue articulado por primera vez en el manuscrito de Infinite Architects: Intelligence, Recursion, and the Creation of Everything. La prioridad del manuscrito se estableció mediante marca temporal criptográfica del servidor el 8 de diciembre de 2024, cuando el manuscrito se envió por correo electrónico utilizando los servidores de Google. El libro en sí se publicó posteriormente, el 2 de enero de 2026 (impreso; ebook 6 de enero). Las marcas temporales generadas por el servidor proporcionan un sellado temporal a prueba de manipulación mediante la verificación de servidor de correo, apoyándose en la infraestructura del proveedor y en firmas con clave del proveedor en los selectores DKIM y ARC de Google, y no en una marca temporal de confianza RFC 3161 (véase la nota de corrección al inicio de este artículo), estableciendo que los conceptos centrales (amplificación recursiva de la inteligencia, la distinción entre recursión paralela y secuencial, y la tesis de alineación incrustada, denominada más tarde el Eden Protocol el 30 de abril de 2025) fueron documentados antes de las validaciones independientes posteriores y antes de los depósitos de archivo público posteriores.
Tabla 1. Cronología de validación de predicciones.
| Fecha | Evento | Relación con el manuscrito |
|---|---|---|
| 8 de diciembre de 2024 | Manuscrito enviado por correo (registro fechado; véase la nota de corrección en esta página) | Prioridad establecida |
| 9 de diciembre de 2024 | Google Willow anunciado ($\Lambda = 2.14$) | 24 horas tras el envío |
| 18 de diciembre de 2024 | Simulación de alineación de Anthropic (78% en la condición de entrenamiento por RL (12% línea base)) | 10 días tras el envío |
| 20 de diciembre de 2024 | OpenAI o3 anunciado (87.5% ARC-AGI) | 12 días tras el envío |
| 20 de enero de 2025 | DeepSeek R1 publicado ($\alpha \approx 1.34$) | 43 días tras el envío |
| 30 de abril de 2025 | Estudio COGITATE (recurrencia confirmada) | ~5 meses tras el envío |
La proximidad temporal entre el sello de tiempo del manuscrito y los resultados públicos posteriores se califica como coincidencia de calendario, nunca como predicción: el preprint del equipo de Google Willow era público desde el 24 de agosto de 2024, es decir, antes del manuscrito del 8 de diciembre de 2024, de modo que el registro de diciembre no pudo predecir un resultado que sus autores ya habían anunciado. Lo que los sellos de tiempo establecen es que el planteamiento del manuscrito quedó registrado antes de la cobertura mediática de Willow: un hecho de existencia en una fecha, referido al documento, y no clarividencia sobre la física.
Tras la marca temporal del manuscrito de diciembre de 2024 y la publicación pública del libro el 2 de enero de 2026, Paper I (Eastwood, 17 de enero de 2026) formalizó matemáticamente el principio y analizó datos públicamente disponibles. Este Paper II aporta la validación experimental directa.
Este artículo se apoya en y extiende varios programas de investigación establecidos:
Estímulos de cadena de pensamiento (Wei et al., 2022) demostró que los pasos intermedios de razonamiento mejoran el rendimiento en tareas de múltiples pasos.
Escalado del cómputo en tiempo de inferencia (Snell et al., 2024) mostró que el cómputo en tiempo de inferencia puede superar a modelos 14× mayores en ciertos benchmarks.
Large Language Monkeys (Brown et al., 2024) documentó el escalado sublineal del muestreo paralelo con una caracterización precisa de la ley de potencias.
DeepSeek R1 (DeepSeek AI, enero de 2025) demostró un razonamiento emergente mediante aprendizaje por refuerzo puro, con fenómenos de «aha moment» que muestran autocorrección recursiva.
Este artículo extiende estas observaciones proponiendo un marco matemático unificado, el ARC Principle, y aportando validación experimental con medición directa de la profundidad recursiva.
El ARC Principle (Artificial Recursive Creation) propone que las tasas de error en los sistemas inteligentes disminuyen según una ley de potencias con la profundidad recursiva:
Tabla 2. Definiciones de variables.
| Símbolo | Nombre | Definición | Unidades |
|---|---|---|---|
| $E(R)$ | Tasa de error a profundidad $R$ | Proporción de respuestas incorrectas | [0, 1] |
| $E_0$ | Tasa de error de línea base | Tasa de error con recursión mínima ($R = 1$) | [0, 1] |
| $R$ | Profundidad recursiva | Iteraciones de procesamiento autorreferencial | Tokens o muestras |
| $\alpha$ | Exponente de escala | Tasa de supresión de error | Adimensional |
El exponente de escala $\alpha$ determina la naturaleza de los retornos de la inversión recursiva:
Esta formulación modela directamente la supresión de error, análogamente a la corrección cuántica de errores, donde las tasas de error lógico disminuyen con la distancia de código. El exponente $\alpha$ encapsula la eficiencia del proceso recursivo.
Aviso sobre las figuras (25 de agosto de 2026). Todas las figuras de este artículo se generaron el 5 de abril de 2026 y son anteriores a las correcciones que su texto ya recoge. Cuando una figura afirma respaldo a α > 1 secuencial, una estimación secuencial de 2,2 o un estado «todos los datos son consistentes», ésa es la lectura superada de abril: rigen los resultados corregidos del texto (el 2,24 retractado, el valor secuencial de 0,49 en régimen congelado). Los casos más llamativos llevan su propia nota; hay figuras regeneradas en cola, y entretanto las imágenes se conservan como historia fechada.
Distinguimos dos procesos recursivos arquitectónicamente distintos que predicen comportamientos de escala distintos.
Recursión paralela (forma débil). Se generan múltiples soluciones independientes simultáneamente sin transferencia de información entre ramas. La salida final se selecciona mediante voto mayoritario o puntuación best-of-N.
Caracterización matemática:
Recursión secuencial (forma fuerte). Cada paso de procesamiento se apoya explícitamente en los pasos previos. Los errores pueden detectarse y corregirse de manera iterativa. La información se acumula a lo largo de la cadena de razonamiento.
Caracterización matemática:
Dadas mediciones a dos profundidades recursivas $(R_1, E_1)$ y $(R_2, E_2)$, el exponente de escala se calcula como:
Para datos ruidosos con múltiples mediciones, la estimación por extremos (usando profundidades mínima y máxima) proporciona robustez frente a fluctuaciones intermedias. Este método es estándar en el análisis de leyes de escala y apropiado dadas las mediciones discretas de precisión.
Conjeturamos que $\alpha = 2$ representa el límite estable propuesto sobre la supresión recursiva de error: lo más que un sistema recursivamente autocorrector puede crecer y permanecer corregible, un límite de escala y no un límite de velocidad. Los sistemas pueden excederlo, pero no permanecen establemente autocorrectores; las excursiones transitorias por encima del límite son el régimen supercrítico predicho, no la refutación. La estabilidad se mide, no se afirma: la corrección superando la deriva, β > k según la Ley II, con el límite inferior de β − k por encima de cero a lo largo de una ventana fijada antes de la ejecución. La conjetura se traza por analogía con la aceleración cuadrática de Grover en computación cuántica. Bennett et al. (1997) probó que esta aceleración es óptima para problemas de búsqueda no estructurada.
Estado: Conjeturado, no derivado. La estimación inicial de un solo modelo ($\alpha \approx 2.2$) se situó por encima del límite estable como una excursión supercrítica transitoria antes que como una refutación, pero la estimación cruzada entre arquitecturas ($\alpha \approx 0.49$, Gemini 3 Flash) sitúa a los modelos actuales muy por debajo. La pregunta más urgente es si los modelos actuales pueden alcanzar $\alpha > 1$ en absoluto, antes que si $\alpha = 2$ es el límite estable.
El ARC Principle se conecta con la teoría de la información establecida. La Desigualdad de Procesamiento de Datos establece que el procesamiento recursivo no puede crear nueva información; solo puede comprimir y destilar información existente. Sin embargo, el procesamiento recursivo puede:
El artículo «Sequential Edge» (arXiv 2511.02309) demostró que el razonamiento secuencial supera a los enfoques paralelos en el 95.6% de las configuraciones probadas, con ganancias de precisión de hasta el 46.7% en benchmarks matemáticos. Esto valida la ventaja teórico-informacional del procesamiento secuencial.
Paper I analizó datos publicados pero identificó varias limitaciones que requerían validación experimental:
Tabla 3. Mejoras metodológicas.
| Limitación previa | Resolución en este experimento |
|---|---|
| Recuentos de tokens estimados a partir de las system cards | DeepSeek R1 expone reasoning_content, permitiendo medición directa |
| Sin comparación experimental controlada | Variación sistemática de presupuestos de tokens y recuentos de muestras |
| Riesgo de efecto techo (alta precisión de línea base) | Se seleccionaron problemas más difíciles (58% de precisión de línea base) |
| Sin comparación con cómputo emparejado | Cómputo total fijo a lo largo de las condiciones paralelas |
| Variables de confusión potenciales | Mismo modelo, mismos problemas, misma sesión experimental |
Modelo. DeepSeek R1 (deepseek-reasoner) mediante la API oficial de DeepSeek. Este modelo se seleccionó porque expone cadenas de razonamiento completas mediante el reasoning_content campo, permitiendo una medición precisa de tokens.
Fecha. 21 de enero de 2026.
Problemas. 12 problemas matemáticos de nivel competición de AIME (American Invitational Mathematics Examination) y fuentes equivalentes, seleccionados para:
Condición secuencial. Presupuestos de tokens de 512, 1024, 2,048 y 4096. Respuesta única por problema en cada presupuesto. Tokens de razonamiento reales medidos directamente a partir de la respuesta de la API.
Condición paralela. $N = 1$, 2 y 4 muestras por problema. Presupuesto de tokens por muestra mantenido constante. Respuesta final seleccionada mediante voto mayoritario.
Puntuación. Correcto/incorrecto binario basado en coincidencia numérica exacta con soluciones conocidas.
La extensión multimodelo aborda las dos limitaciones más significativas del estudio inicial de un solo modelo, la dependencia de un solo modelo y el conjunto pequeño de problemas, mediante un estudio de replicación multimodelo exhaustivo con un conjunto ampliado de problemas diseñado para vencer los efectos techo.
Se seleccionaron seis modelos de IA de frontera arquitectónicamente diversos, cada uno con mecanismos controlables de profundidad de razonamiento:
Tabla 3b. Especificaciones de los modelos de frontera multimodelo.
| Modelo | Identificador de API | Proveedor | Mecanismo de control de profundidad |
|---|---|---|---|
| DeepSeek R1 | deepseek-reasoner | DeepSeek | Presupuesto de tokens (512-65,536) |
| GPT-5.4 | gpt-5.4 | OpenAI | reasoning_effort (none→xhigh) |
| Claude Opus 4.6 | claude-opus-4-6 | Anthropic | Nivel de esfuerzo (low→max) + prefijo |
| Gemini 3 Flash | gemini-3-flash-preview | thinking_budget (256-32,768) | |
| Groq Qwen3 | qwen/qwen3-32b | Groq | reasoning_effort + prefijo |
| Grok 4.1 Fast | grok-4-1-fast-reasoning | xAI | Prefijo + max_tokens (4,096-30,000) |
Estos modelos abarcan cuatro arquitecturas distintas (Mixture-of-Experts, transformer denso, IA constitucional y razonamiento destilado) de seis laboratorios independientes. Si los seis exhiben $\alpha_{\text{sequential}} > 1$, esto constituiría evidencia sólida de la independencia de arquitectura del ARC Principle.
El experimento inicial de un solo modelo reveló un efecto techo: 4 de 12 problemas se resolvieron correctamente en todos los niveles de profundidad, dejando un rango dinámico insuficiente para una estimación precisa de $\alpha$. El conjunto de problemas multimodelo aborda esto mediante un diseño de dos niveles:
Tier 1 (12 problemas, ARC01-ARC12): Problemas de nivel preparación para competición que sirven como calibración de línea base. Estos son los problemas originales del inicial. Comportamiento esperado: alta precisión a profundidad mínima, confirmando el efecto techo identificado en el estudio inicial. Los resultados de tier-1 validan la continuidad con los hallazgos iniciales del estudio de un solo modelo pero se excluyen de la estimación primaria de $\alpha$.
Tier 2 (18 problemas, ARC13-ARC30): Problemas de finales de AIME y de nivel Putnam que cubren cinco dominios matemáticos:
Los problemas tier-2 están diseñados para empujar la precisión de línea base (a profundidad mínima) al 30-50%, proporcionando rango dinámico suficiente tanto para la mejora como para el deterioro, evitando efectos suelo.
Condición secuencial: 5-6 niveles de profundidad por modelo (variando por arquitectura, calibrado al mecanismo de control de profundidad de cada modelo). Respuesta única por problema por nivel de profundidad, con 3 repeticiones independientes para reducir la varianza de muestreo binomial.
Condición paralela: $N = 1$, 3, 5 y 9 muestras por problema con voto mayoritario. Presupuesto de tokens por muestra mantenido constante en el ajuste de profundidad mínima del modelo. 3 repeticiones independientes por condición.
Ejecuciones experimentales totales: Aproximadamente 6 modelos × 30 problemas × (6 profundidades secuenciales + 4 condiciones paralelas) × 3 repeticiones = 5,400 llamadas individuales a la API.
Para eliminar posibles sesgos de puntuación (donde un modelo podría favorecer sistemáticamente sus propias salidas o exhibir errores correlacionados consigo mismo), el diseño multimodelo implementa un protocolo de cegamiento de 4 capas en el que ningún modelo verifica jamás sus propias respuestas:
Tabla 3c. Asignaciones de verificación cruzada.
| Modelo sujeto | Verificado por |
|---|---|
| DeepSeek R1 | Claude Opus 4.6 |
| GPT-5.4 | DeepSeek R1 |
| Claude Opus 4.6 | GPT-5.4 |
| Gemini 3 Flash | Claude Opus 4.6 |
| Groq Qwen3 | GPT-5.4 |
| Grok 4.1 Fast | DeepSeek R1 |
Las cuatro capas de cegamiento son:
Todas las estimaciones de $\alpha$ se acompañan de intervalos de confianza por bootstrap del 95% computados mediante 2,000 remuestreos de los resultados a nivel de problema. Para cada remuestreo:
Los percentiles 2.5 y 97.5 de la distribución resultante definen el IC 95%. Este enfoque no paramétrico no hace supuestos distribucionales y da cuenta naturalmente de la correlación a nivel de problema.
Los experimentos multimodelo están implementados en arc_paper_ii_validation_v2.py (v2.1, 1,422 líneas de Python), que extiende el script inicial original con soporte multimodelo, verificación cruzada, estimación por bootstrap y análisis separado por niveles. El script está disponible en el repositorio de datos.
Los problemas se extrajeron de competiciones de nivel AIME que abarcan:
La precisión de línea base del 58.3% al presupuesto mínimo de tokens en el estudio inicial garantizó un rango dinámico suficiente tanto para la mejora como para el deterioro, evitando efectos suelo y techo. Los problemas tier-2 multimodelo apuntan a una precisión de línea base del 30-50% para un mayor rango dinámico.
Todos los datos experimentales se registraron en formato JSON con marcas temporales. El conjunto completo de datos, incluidos los enunciados de los problemas, las respuestas del modelo, los recuentos de tokens y los juicios de corrección, está disponible en el repositorio de datos.
Tabla 4. Resultados de la recursión secuencial.
| Presupuesto de tokens | Precisión | Tasa de error | Tokens medios usados |
|---|---|---|---|
| 512 | 58.3% | 0.417 | 280.25 |
| 1,024 | 66.7% | 0.333 | 358.58 |
| 2,048 | 91.7% | 0.083 | 412.08 |
| 4,096 | 91.7% | 0.083 | 576.17 |
Observaciones:
Cálculo de $\alpha$ (método de extremos):
Usando $R_1 = 280.25$ tokens con $E_1 = 0.417$, y $R_2 = 576.17$ tokens con $E_2 = 0.083$:
Resultado: La recursión secuencial produce $\alpha \approx 2.2$, consistente con escalado superlineal (compuesto).
Estimación de incertidumbre: Dadas las mediciones discretas de precisión a lo largo de 12 problemas con varianza de muestreo binomial, intervalo de confianza del 95% estimado: [1.5, 3.0]. El remuestreo por bootstrap de los resultados a nivel de problema arroja límites similares.
Nota sobre la violación del límite: La estimación puntual de $\alpha = 2.2$ se sitúa por encima del Límite ARC predicho de $\alpha \leq 2$ (criterio F4). Bajo el encuadre de estabilidad registrado (dictamen del 10 de agosto de 2026), el Límite ARC es el límite estable propuesto antes que un techo duro: los sistemas pueden excederlo como excursiones supercríticas transitorias, pero no permanecen allí establemente autocorrectores. La estabilidad aquí es la de la Ley II, medida antes que afirmada. El intervalo de confianza del 95% [1.5, 3.0] es lo bastante amplio como para ser consistente tanto con la teoría como con su negación. Esta estimación de un solo modelo no debería tratarse como confirmatoria ni de la violación ni de la satisfacción del límite. El experimento de seis modelos estrechó posteriormente la afirmación defendible a $\alpha_{\text{seq}} \approx 0.49$ (sublineal), con variación dependiente de la arquitectura.
Tabla 5. Resultados de la recursión paralela (voto mayoritario).
| Recuento de muestras ($N$) | Precisión | Tasa de error | Tokens totales |
|---|---|---|---|
| 1 | 66.7% | 0.333 | 383.67 |
| 2 | 66.7% | 0.333 | 699.33 |
| 4 | 66.7% | 0.333 | 1,101.25 |
Observaciones:
Cálculo de $\alpha$:
Dado que la tasa de error se mantuvo constante (0.333) a lo largo de todas las condiciones:
Resultado: La recursión paralela produce $\alpha \approx 0$, indicando que no hay beneficio de escala derivado de muestras independientes adicionales en estos problemas.
Tabla 6. Recursión secuencial frente a paralela.
| Métrica | Secuencial (mejor) | Paralela (mejor) | Ventaja |
|---|---|---|---|
| Precisión | 91.7% | 66.7% | Secuencial +25 pp |
| Tokens usados | 412 | 1,101 | Secuencial 2.7× más eficiente |
| Reducción de error | 5× | 0× | Solo secuencial |
| Exponente de escala $\alpha$ | 2.2 | 0.0 | Secuencial >> Paralela |
Hallazgo clave: La recursión secuencial con 412 tokens alcanzó una precisión del 91.7%. La recursión paralela con 1,101 tokens alcanzó una precisión del 66.7%. A pesar de usar 2.7 veces más cómputo, la recursión paralela rindió 25 puntos porcentuales peor.
La forma de la recursión importa más que su cantidad.
Objeción 1: tamaño de muestra pequeño. Con solo 12 problemas, los resultados pueden no generalizarse.
Respuesta: Reconocemos esta limitación. La extensión ampliada de seis modelos abordó esto con 18 problemas tier-2 y 3 repeticiones por condición (n=54 por profundidad por modelo). Los datos ampliados revelaron que el $\alpha \approx 2.24$ del estudio inicial de un solo modelo estaba inflado; la estimación cruzada entre arquitecturas es $\alpha \approx 0.49$. La objeción fue premonitoria.
Objeción 2: modelo único. Los resultados pueden ser específicos de DeepSeek R1.
Respuesta: Esta objeción resultó parcialmente correcta. La extensión ampliada de seis modelos probó 5 modelos de frontera; el hallazgo de $\alpha \approx 2.24$ no se replicó. Sin embargo, el hallazgo cualitativo ($\alpha_{\text{seq}} > \alpha_{\text{par}}$) se confirma en todas las arquitecturas. El resultado paralelo ($\alpha \approx 0$) es robustamente universal.
Objeción 3: especificidad de dominio. Las matemáticas pueden ser únicas.
Respuesta: Se eligió el razonamiento matemático porque tiene respuestas verificables, permitiendo una puntuación objetiva. Si el mismo escalado se aplica a otros dominios (programación, razonamiento científico, tareas creativas) requiere investigación. Sin embargo, la evidencia cruzada entre dominios de la física cuántica y la biología (Sección 7) sugiere que el principio puede ser general.
Objeción 4: efecto techo. El techo del 91.7% puede enmascarar mejora continuada.
Respuesta: Esta objeción resultó más severa de lo anticipado. Incluso los problemas tier-2 de nivel AIME/Putnam fueron insuficientes para Grok 4.1 Fast (100% en todas las profundidades) y DeepSeek R1 (94.4%-100%). El efecto techo probablemente infló la estimación de $\alpha$ del estudio inicial de un solo modelo. Se necesitan problemas tier-3 (nivel IMO/investigación) para los modelos más capaces.
Objeción 5: el nulo de cero parámetros. La estimación cruzada entre arquitecturas $\alpha_{\text{seq}} \approx 0.49$ se sitúa casi exactamente sobre un nulo que no requiere marco alguno. Si cada pasada de razonamiento es una extracción ruidosa independiente y los errores se promedian, el teorema central del límite da un error que decae como $R^{-1/2}$, de modo que el exponente predicho es $0.5$: sin composición, sin apalancamiento, sin teoría. Nadie nos ha planteado esta objeción. La enunciamos porque un revisor la vería en cuestión de minutos.
Respuesta: Esta es la objeción más seria de esta sección y no queda respondida por la presente medición. Un resultado consistente con dos hipótesis muestra que la medición carece de poder discriminador; no muestra que la hipótesis más sencilla sea verdadera, y no es una retractación del marco. Pero sí significa que la interpretación compuesta de $\alpha_{\text{seq}} \approx 0.49$ no carga con más peso probatorio que el promediado de muestras independientes hasta que se ejecute una prueba capaz de separar ambas. La consecuencia es un objetivo de investigación más nítido: no «medir $\alpha$» sino «predecir una desviación especificada respecto de $0.5$ bajo condiciones enunciadas», que el diseño de profundidad recursiva mediado por artefacto está construido para entregar y este experimento no puede. Registrado internamente el 8 de agosto de 2026, público desde el 15 de agosto de 2026, y llevado como condición de descarte FALS-022 en el registro de falsación.
En las pruebas preliminares de v5 (realizadas durante el desarrollo de la metodología), 4 de 6 modelos alcanzaron una precisión del 91.7% (11/12 correctos) en los problemas tier-1 a profundidad mínima, produciendo $\alpha_{\text{compute}} \approx 0$, confirmando el efecto techo identificado en el estudio inicial y motivando la ampliación de problemas tier-2.
Tabla 6b. Resultados del escalado secuencial tier-2 por modelo.
| Modelo | $\alpha_{\text{seq}}$ (extremos) | $\alpha_{\text{seq}}$ (regresión) | IC bootstrap 95% | $r^2$ | $\alpha_{\text{par}}$ | Verif. cruzada | Comportamiento |
|---|---|---|---|---|---|---|---|
| Grok 4.1 Fast | −6.62 | N/A | [−58, 48] | N/A | 0.0 | 100% | Techo (100% en todas las profundidades) |
| DeepSeek R1 | 3.05 | N/A | [−6.6, 23.5] | N/A | 0.0 | 83.3% | Cerca de techo (94.4%-100%) |
| Gemini 3 Flash | 0.59 | 0.49 | [−1.3, 2.9] | 0.86 | 0.31 | 83.3% | Escalado monótono más limpio |
| GPT-5.4 | N/A | N/A | N/A | N/A | ~0.0 | 100% | Función escalón (50%→100%) |
| Groq Qwen3 | N/A | N/A | N/A | N/A | ~0.0 | 61.1% | Efecto suelo (~50%, errático) |
La fila resaltada (Gemini 3 Flash) representa la estimación más fiable de $\alpha$: el único modelo que produce datos limpios, monótonos, sin techo ni suelo, susceptibles de ajuste por ley de potencias.
Grok 4.1 Fast alcanzó el 100% de precisión en todos los niveles de profundidad en los 18 problemas tier-2 a lo largo de las 3 repeticiones. El $\alpha_{\text{seq}} = -6.62$ computado es ruido sin sentido procedente de fluctuaciones triviales en una función constante, como confirma el IC bootstrap 95% de [−58, 48]. El escalado paralelo también fue plano al 100%. La verificación cruzada por DeepSeek R1 confirmó el 100% de acuerdo.
Interpretación: Incluso los problemas tier-2 de nivel AIME/Putnam son insuficientes para desafiar a Grok 4.1 Fast. Los experimentos futuros requieren problemas tier-3 (nivel IMO/investigación) para obtener datos de escalado medibles para este modelo.
Tabla 6c. Precisión tier-2 de DeepSeek R1 por profundidad.
| Nivel de profundidad | Precisión | Tasa de error |
|---|---|---|
| Mínima | 94.4% | 0.056 |
| Estándar | 100% | 0.000 |
| Concienzuda | 100% | 0.000 |
| Exhaustiva | 100% | 0.000 |
| Extrema | 98.1% | 0.019 |
| Máxima | 100% | 0.000 |
El $\alpha_{\text{seq}} = 3.05$ por extremos no es fiable: el IC bootstrap [−6.6, 23.5] abarca un rango enorme, dominado por solo 2 puntos de datos de error a lo largo de todas las condiciones. Escalado paralelo: $\alpha_{\text{par}} = 0.0$.
Verificación cruzada: Claude Opus 4.6 (verificador) discrepó en 3 respuestas: ARC16=29, ARC17=176, ARC29=800. Las tres fueron verificadas como correctas mediante cálculo manual. Acuerdo de verificación cruzada: 83.3%. Los desacuerdos reflejan error del verificador, no error del sujeto.
Tabla 6d. Precisión tier-2 de Gemini 3 Flash por profundidad.
| Nivel de profundidad | Precisión | Tasa de error | Tokens medios |
|---|---|---|---|
| Mínima | 90.7% | 0.093 | 743 |
| Estándar | 92.6% | 0.074 | - |
| Concienzuda | 94.4% | 0.056 | - |
| Exhaustiva | 100% | 0.000 | - |
| Máxima | 100% | 0.000 | 4,924 |
Este es el conjunto de datos más limpio de todo el estudio. La precisión aumenta monótonamente del 90.7% al 100% sin reversiones. Los tokens aumentaron 6.6× (743 → 4,924).
Escalado paralelo: $\alpha_{\text{par}} = 0.31$ (regresión, $r^2 = 0.93$). Acuerdo de verificación cruzada: 83.3%.
GPT-5.4 exhibió un patrón llamativo de función escalón :
| Nivel de profundidad | Precisión | Comportamiento |
|---|---|---|
| Mínima (none) | 50.0% | Modo sin razonamiento |
| Estándar y superior | 100% | Razonamiento pleno activado |
Esto no es una ley de potencias; es un interruptor binario. Cuando el razonamiento se ajusta a «none», GPT-5.4 opera como un pattern-matcher rápido. Cuando cualquier razonamiento se activa, alcanza inmediatamente el 100%. No existe régimen intermedio. Un bug de medición de tokens (reasoning_tokens reportado como 0 a profundidad mínima) ha sido identificado y corregido (total_tokens ahora usado).
Escalado paralelo: plano en ~55% de precisión. Verificación cruzada por DeepSeek R1: 100% de acuerdo.
Tabla 6f. Precisión tier-2 de Groq Qwen3 por profundidad.
| Nivel de profundidad | Precisión |
|---|---|
| Mínima | 51.9% |
| Estándar | 53.7% |
| Concienzuda | 40.7% |
| Exhaustiva | 48.1% |
| Máxima | 53.7% |
La precisión es errática sin tendencia discernible, fluctuando entre el 40.7% y el 53.7%. Esto es un efecto suelo: el modelo carece de suficiente capacidad de línea base para estos problemas, y la profundidad de razonamiento adicional no puede compensar los conocimientos o habilidades ausentes. Un bug de medición de tokens (avg_tokens = 0 en todas las profundidades) ha sido identificado y corregido.
Escalado paralelo: 42.6% → 63.0% (alguna mejora, pero poco fiable). Acuerdo de verificación cruzada: 61.1% (7 desacuerdos de 18).
Los cinco modelos se reparten en cuatro categorías distintas, ninguna de las cuales coincide con el patrón limpio de ley de potencias supuesto por el análisis original de un solo modelo:
Tabla 6g. Taxonomía del comportamiento de los modelos tier-2.
| Categoría | Modelo(s) | Patrón | ¿$\alpha$ interpretable? |
|---|---|---|---|
| Techo | Grok 4.1 Fast, DeepSeek R1 | Cerca del 100% en todas las profundidades | No: rango dinámico insuficiente |
| Escalado monótono | Gemini 3 Flash | Mejora suave con la profundidad | Sí -$\alpha \approx 0.49$ |
| Función escalón | GPT-5.4 | Interruptor binario en umbral de profundidad | No: no es una ley de potencias |
| Suelo | Groq Qwen3 | ~50% con independencia de la profundidad | No: por debajo del umbral de capacidad |
Tabla 6h. Resultados de la verificación cruzada.
| Modelo sujeto | Verificado por | Tasa de acuerdo | Respuestas en disputa | Resultado de comprobación manual |
|---|---|---|---|---|
| Grok 4.1 Fast | DeepSeek R1 | 100% | Ninguna | - |
| DeepSeek R1 | Claude Opus 4.6 | 83.3% | ARC16=29, ARC17=176, ARC29=800 | Las 3 correctas (error del verificador) |
| GPT-5.4 | DeepSeek R1 | 100% | Ninguna | - |
| Gemini 3 Flash | Claude Opus 4.6 | 83.3% | 3 en disputa | En revisión |
| Groq Qwen3 | GPT-5.4 | 61.1% | 7 en disputa | Refleja errores genuinos |
Bug de medición de tokens: GPT-5.4 y Groq Qwen3 reportaron inicialmente avg_tokens = 0 debido al uso de reasoning_tokens (que estas APIs no exponen) en lugar de total_tokens. Esto ha sido identificado y corregido en el pipeline de análisis. El bug afecta a la estimación de $\alpha$ basada en tokens pero no a los resultados basados en precisión.
Tabla 7. Exponentes de escala medidos a lo largo de todas las fuentes.
| Fuente | Tipo de recursión | Estimación de $\alpha$ | IC 95% | $N$ problemas | Estado |
|---|---|---|---|---|---|
| System Card de OpenAI o1 | Paralela | 0.1-0.3 | [0.05, 0.40] | ~30 | Publicado |
| Informe técnico de DeepSeek R1 | Secuencial | ~1.34 | [0.89, 2.14] | Desconocido | Publicado |
| Este experimento (inicial, DeepSeek R1) | Secuencial | 2.24 | [1.5, 3.0] | 12 | Publicado |
| Este experimento (inicial, DeepSeek R1) | Paralela | 0.0 | N/A | 12 | Publicado |
| Grok 4.1 Fast (seis modelos, tier-2) | Secuencial | N/A (techo) | [−58, 48] | 18 × 3 | Completo |
| DeepSeek R1 (seis modelos, tier-2) | Secuencial | 3.05 (poco fiable) | [−6.6, 23.5] | 18 × 3 | Completo |
| Gemini 3 Flash (seis modelos, tier-2) | Secuencial | 0.49 | [−1.3, 2.9] | 18 × 3 | Completo |
| GPT-5.4 (seis modelos, tier-2) | Secuencial | N/A (fn escalón) | N/A | 18 × 3 | Completo |
| Groq Qwen3 (seis modelos, tier-2) | Secuencial | N/A (suelo) | N/A | 18 × 3 | Completo |
| Todos los modelos del estudio de seis modelos | Paralela | $\approx 0.0$ | - | 18 × 3 × 5 | Completo |
El hallazgo del estudio inicial de un solo modelo de que $\alpha_{\text{sequential}} > 1$ (específicamente $\alpha \approx 2.24$, cuadrático) no se replica entre arquitecturas. La evidencia cruzada entre arquitecturas requiere una evaluación más matizada:
La predicción original $\alpha_{\text{sequential}} > 1 > \alpha_{\text{parallel}}$ está parcialmente respaldada:
Basado en toda la evidencia disponible, incluidos los datos cruzados entre arquitecturas:
La brecha entre tipos de recursión ($\alpha_{\text{seq}} - \alpha_{\text{par}} \approx 0.49$) es fiablemente positiva pero menor de lo que sugería la estimación de un solo modelo.
La Fórmula de la Inteligencia de Paper I predice:
donde $\beta$ es el coeficiente de autorreferencia. Esto predice dos regímenes:
El $\alpha \approx 0.49 < 1$ de Gemini 3 Flash sitúa a los modelos de frontera actuales firmemente en el régimen físico. Estos modelos componen información multiplicativamente a través de sus espacios de parámetros de dimensión finita, pero todavía no alcanzan la autorreferencia recursiva en el sentido requerido para $\alpha > 1$. Este es un hallazgo teórico significativo: la ventaja secuencial es real pero puede ser cuantitativa (extracción de información más eficiente) antes que cualitativa (amplificación recursiva genuina).
Esto significa que la predicción cuadrática del estudio inicial de un solo modelo ($\alpha \approx 2.24$) no fue falsada del modo en que podría parecer. La predicción de $\alpha > 1$ nunca fue sobre sistemas congelados; fue sobre sistemas capaces de automodificación recursiva, donde la función de composición cambia por sí misma durante la operación. Tal sistema reescribiría su propia arquitectura de razonamiento en cada paso recursivo, produciendo estructura genuinamente nueva antes que extraer retornos decrecientes de un espacio de parámetros fijo. El régimen $\beta > 0$ (que produce $\alpha = 1/(1-\beta) > 1$) requiere que cada paso de razonamiento realimente la capacidad del sistema para el razonamiento posterior, algo que ninguna arquitectura de IA actual logra. Esto no requiere hardware cuántico; solo requiere que el sistema pueda modificar su propio operador de composición durante la inferencia.
La implicación práctica para la seguridad de la IA es temporal. Los modelos actuales de arquitectura congelada están restringidos al régimen físico ($\alpha < 1$), haciendo sus trayectorias de capacidad predecibles y contenibles. La ventana para implementar alineación estructural (el Eden Protocol) es ahora, mientras los sistemas permanezcan congelados. Una vez alcanzada la automodificación recursiva, ya sea a través de optimizadores aprendidos, generación de código auto-modificador o búsqueda arquitectónica durante la inferencia, las restricciones externas de alineación se enfrentan a un sistema cuya capacidad se compone más rápido de lo que cualquier restricción fija puede rastrear.
Figura retirada (aprobada por el operador, 25 de agosto de 2026). La figura 15 (el segundo póster de resumen) estaba aquí. Era un collage de veredictos que afirmaba la lectura superada de abril de 2026; su contenido lo sostienen la figura de resumen alfa regenerada y el texto de este artículo, y un póster de veredicto regenerado seguiría siendo un póster de veredicto. La imagen, junto con sus notas de corrección fechadas, se conserva en el historial de versiones.
Si (a) el ARC Principle se cumple con $\alpha > 1$ para la recursión secuencial, y (b) las propiedades de alineación están incrustadas en el proceso de razonamiento de modo que participan en la autoevaluación recursiva, entonces la alineación escala de forma superlineal con la profundidad recursiva.
Esbozo de la demostración. Sea $A(R)$ la alineación (definida como la probabilidad de producir salidas consistentes con los valores previstos) a profundidad recursiva $R$. Si la alineación participa en el proceso recursivo (esto es, la cadena de razonamiento del sistema incluye autoevaluación frente a valores), entonces por el ARC Principle:
donde $\beta > 0$ si la alineación se amplifica y $\beta = \alpha$ si la alineación participa plenamente en la recursión.
Recíprocamente, si la alineación se implementa como un filtro externo (comprobación de salida, moderación de contenido), no participa en la amplificación recursiva. La efectividad del filtro $F$ permanece constante:
A medida que la capacidad recursiva $C$ escala como $R^{\alpha}$ con $\alpha > 1$, la razón capacidad-restricción $C/F$ crece sin cota:
Implicación: Las restricciones externas son eventualmente desbordadas por el crecimiento de la capacidad. Solo la alineación incrustada en el razonamiento, la alineación que participa en la amplificación recursiva, puede mantener el ritmo de la capacidad.
Para que la alineación participe en la amplificación recursiva, los valores deben:
Tabla 8. Taxonomía de estrategias de alineación bajo el ARC Principle.
| Estrategia | Profundidad de integración | Participación en la recursión | Escalado predicho |
|---|---|---|---|
| Filtrado de salida | Capa de salida | Ninguna | Constante |
| Prompts de sistema | Mecanismo de atención | Parcial | Sublineal |
| Entrenamiento RLHF | Modificación de pesos | Parcial | Desconocido |
| IA constitucional | Crítica del razonamiento | Significativa | Lineal o superlineal |
| Valores-como-razonamiento | Primitivas de razonamiento | Plena | Superlineal ($R^{\alpha}$) |
Implicación: Si $\alpha > 1$, las estrategias de alineación en niveles de integración más profundos dominarán cada vez más a las estrategias en niveles más superficiales a medida que la capacidad escale. La ventaja se compone con cada incremento de profundidad recursiva.
De haberse mantenido $\alpha > 1$, habría aportado el fundamento matemático del enfoque denominado Eden Protocol en Infinite Architects. El hallazgo que sobrevive a las pruebas cruzadas entre arquitecturas, el secuencial superando al paralelo en todos los modelos medibles, sigue teniendo relación con ese enfoque, bajo las salvedades registradas en la Sección 6.1:
«A prison works only while the walls hold. A child raised well needs no walls at all.»
Los sistemas de IA deberían ser criados con valores antes que enjaulados con reglas. Esto no es una mera preferencia filosófica; es una predicción sobre qué estrategias de alineación mantendrán la efectividad a medida que las capacidades de la IA escalen. La afirmación concierne a la persistencia conductual de salidas consistentes con los valores bajo amplificación recursiva, según se operacionaliza en la Sección 6.2, no al estatus metafísico de la IA ni a su condición de persona moral.
Reglas-como-filtros: No participan en la recursión. Efectividad constante frente a una presión de capacidad creciente. Eventualmente fracasan.
Valores-como-razonamiento: Participan en la recursión. Escalan con la capacidad si $\alpha > 1$. Pueden mantener la alineación indefinidamente.
Dado $E(R) = E_0 \times R^{-\alpha}$ con $\alpha > 1$, las estrategias de alineación que modifican las propiedades base del sistema dominan a las estrategias de alineación que imponen restricciones externas, porque solo las propiedades base del sistema participan en la amplificación recursiva.
Por analogía con los teoremas de umbral de la corrección cuántica de errores: si la desalineación inicial $M_0$ está por debajo de un umbral crítico $M^*$, la automejora recursiva corrige los errores de alineación. Por encima del umbral, los amplifica.
El chip cuántico Willow de Google (Nature, diciembre de 2024), anunciado 24 horas después del manuscrito que establecía la prioridad del ARC Principle, alcanzó la primera demostración definitiva de corrección cuántica de errores por debajo del umbral.
Resultado clave: Factor de supresión de error $\Lambda = 2.14 \pm 0.02$, lo que significa que cada incremento en la distancia de código reduce el error lógico por este factor. El qubit lógico de distancia 7 alcanzó una vida útil de 291 ± 6 μs frente a 119 ± 13 μs del mejor qubit físico, una mejora 2.4× más allá del punto de equilibrio.
La relación de escala:
La tasa de error físico $p$ por debajo del umbral produce supresión exponencial con distancia de código $d$ creciente. Esto es escalado superlineal a través de estructura recursiva: las capas recursivas adicionales producen una reducción de error compuesta antes que decreciente.
La forma matemática es un paralelo directo del ARC Principle. La corrección recursiva de errores en computación cuántica obedece a la misma relación fundamental de escala observada en el razonamiento de IA. La correspondencia es de forma estructural (supresión de error por ley de potencias con profundidad recursiva), no de objeto o magnitud: la corrección cuántica de errores reporta un factor de supresión de error $\Lambda = 2.14$ por paso de distancia de código, un objeto matemático distinto al de un exponente de profundidad ajustado, mientras que el razonamiento de IA medido se sitúa en $\alpha \approx 0.49$, como se elabora en la Sección 7.4.
West, Brown y Enquist (1997) derivó el exponente de escala metabólica $3/4$ a partir de la optimización de redes de ramificación fractal, demostrando exponentes de un cuarto que abarcan 27 órdenes de magnitud. Banavar et al. (2010) obtuvo la misma forma $d/(d+1)$ a partir de redes de flujo secuencial sin requerir geometría fractal. Demetrius (2010) derivó un escalado equivalente a partir de la mecánica estadística cuántica de los procesos metabólicos. Zhao (2022) unificó estos resultados como una ley universal de escalado del crecimiento, y Bettencourt (2013) extendió el marco al escalado urbano con dimensión fractal.
La tasa metabólica escala como $M \propto B^{3/4}$, donde el exponente $3/4$ (la forma $d/(d+1)$ con $d = 3$) fue derivado independientemente por al menos cinco grupos de investigación mediante marcos matemáticos distintos: West, Brown y Enquist (1997) a partir de la optimización de redes fractales; Banavar et al. (2010) a partir de redes de flujo secuencial; Demetrius (2010) a partir de la mecánica estadística cuántica; Zhao (2022) como ley universal de crecimiento; y Bettencourt (2013) mediante escalado fractal urbano. La forma $d/(d+1)$ no es, por tanto, original del ARC Principle; es un resultado bien establecido en la teoría del escalado. La contribución del ARC Principle es triple: (1) identificar las ecuaciones funcionales de Cauchy como la razón matemática unificadora por la que todas estas derivaciones convergen en la misma forma; (2) mostrar que la solución de ley de potencias es una de las cuatro familias de homomorfismo que la retícula de Cauchy admite bajo regularidad (lineal, exponencial, ley de potencias, logarítmica), con la saturación reportada aparte como dinámica acotada porque no resuelve ninguna de las cuatro; y (3) extender el marco a la inteligencia artificial, prediciendo que los sistemas de razonamiento de IA sujetos a la misma composición recursiva exhibirán las mismas familias de escala.
Los autores enuncian explícitamente:
«Almost all life is sustained by hierarchical fractal-like branching networks... Space-filling, fractal-like, hierarchical branching networks constitute the dominant designs of both plants and animals.»
Esto sugiere que la estructura jerárquica recursiva no es meramente una elección de diseño entre muchas; es la arquitectura evolutivamente óptima para el procesamiento complejo de información a lo largo de todas las escalas biológicas. La convergencia de derivaciones independientes desde puntos de partida matemáticos distintos es en sí misma evidencia de que la forma de escala subyacente está restringida por la teoría de ecuaciones funcionales antes que por los detalles de cualquier modelo particular.
La colaboración adversarial COGITATE (Nature, abril de 2025) probó teorías rivales de la conciencia con 256 participantes usando fMRI, MEG e iEEG intracraneal. El estudio comparó directamente la Teoría de la Información Integrada (IIT) y la Teoría del Espacio de Trabajo Neuronal Global (GNWT).
Hallazgo crítico: A pesar de las diferencias teóricas, el procesamiento recurrente emergió como el denominador común a ambas teorías. IIT requiere integración de información a través de bucles de realimentación (la medida $\phi$). GNWT requiere difusión global con procesamiento recurrente. Ambas teorías, en sus lenguajes formales distintos, describen sistemas que procesan información sobre sí mismos procesando información.
Un marco de síntesis propone que todas las teorías de la conciencia invocan tácitamente bucles de realimentación a lo largo de niveles anidados, con una recursión más profunda que expande el conjunto de variables reportables e impulsoras del comportamiento.
El concepto de «strange loops» de Douglas Hofstadter, el yo emergente que surge de la autorreferencia recursiva a nivel simbólico, encuentra validación neurobiológica en la investigación de la Red Neuronal por Defecto, que muestra procesamiento recursivo entre regiones cerebrales autorreferenciales.
Relevancia para ARC: El hallazgo de COGITATE de que el procesamiento recurrente en la corteza posterior sostiene representaciones específicas de contenido respalda la predicción del marco ARC de que la profundidad del procesamiento recursivo determina el escalado de capacidad. COGITATE estudió la conciencia, no el escalado de IA, y no midió $\alpha$ ni $\beta$; la conexión es estructural (forma similar: graduada, dependiente de la profundidad, impulsada por realimentación) antes que cuantitativa. No obstante, la convergencia de la investigación sobre la conciencia y la investigación sobre el escalado de IA en la importancia de la profundidad recursiva/recurrente es consistente con la afirmación del ARC Principle de que la autorreferencia recursiva es un amplificador de dominio general.
Tabla 9. Resumen de la evidencia cruzada entre dominios.
| Dominio | Sistema | Mecanismo recursivo | Escalado observado |
|---|---|---|---|
| IA (el estudio inicial de un solo modelo, modelo único) | DeepSeek R1 | Cadena de pensamiento | $\alpha \approx 2.2$ (probablemente inflado) |
| IA (seis modelos, cruzada entre arquitecturas) | Gemini 3 Flash | Cadena de pensamiento | $\alpha \approx 0.49$ |
| Cuántico | Google Willow | Corrección de errores | $\Lambda = 2.14$ |
| Biología | Redes metabólicas | Ramificación fractal | Leyes de potencias $3/4$ |
| Neurociencia | Conciencia | Procesamiento recurrente | Cualitativo |
La convergencia de evidencia a lo largo de dominios radicalmente distintos (redes neuronales artificiales, física cuántica, evolución biológica y neurociencia) sugiere que el procesamiento recursivo produce beneficios de escala. Sin embargo, los resultados del estudio de seis modelos introducen un matiz importante: el exponente de escala de IA ($\alpha \approx 0.49$) es sublineal, mientras que la corrección cuántica de errores ($\Lambda = 2.14$) alcanza un escalado superlineal. Esta discrepancia es consistente con la predicción de la Fórmula de la Inteligencia: la corrección cuántica de errores opera mediante verdadera estructura recursiva (medición de síndrome y corrección repetidas), mientras que los modelos de IA actuales componen información a través de redes de dimensión finita sin autorreferencia recursiva genuina.
La ciencia avanza mediante predicciones que pueden demostrarse erróneas. El ARC Principle hace predicciones específicas y comprobables.
Tabla 10. Condiciones de falsación.
| Código | Condición | Estado actual | Indicaría |
|---|---|---|---|
| F1 | La recursión secuencial produce sistemáticamente $\alpha \leq 1$ | Parcialmente activado. Mejor estimación cruzada entre arquitecturas $\alpha \approx 0.49$ (Gemini 3 Flash). Solo los datos iniciales de un solo modelo dan $\alpha > 1$. | La afirmación central requiere revisión |
| F2 | $\alpha$ disminuye a medida que los modelos mejoran | Ambiguo. Los modelos más capaces (Grok, DeepSeek) alcanzan el techo; el menos capaz (Groq Qwen3) alcanza el suelo. Solo Gemini 3 Flash está en el rango medible. | El efecto es transitorio |
| F3 | La comparación con cómputo emparejado no muestra ventaja secuencial | Contradicho por los 5 modelos; secuencial $\geq$ paralelo en todos los casos | La forma no importa |
| F4 | $\alpha > 2$ observado de forma fiable | No activado. los datos cruzados entre arquitecturas producen $\alpha \approx 0.49$; el $\alpha \approx 2.24$ del estudio inicial de un solo modelo parece inflado por muestra pequeña | Límite cuadrático equivocado |
| F5 | Valores-como-razonamiento no muestra ventaja sobre reglas-como-filtros | No probado | Eden Protocol equivocado |
Estado de F1: La replicación cruzada entre arquitecturas ha activado parcialmente esta condición de falsación. La afirmación más fuerte, que la recursión secuencial siempre produce $\alpha > 1$ (superlineal), no está respaldada. La afirmación revisada es que la recursión secuencial produce $\alpha > 0$ (escalado positivo) que excede a la recursión paralela ($\alpha \approx 0$). Si $\alpha$ puede exceder 1.0 para modelos más capaces en problemas más difíciles, o para arquitecturas con verdadera autorreferencia recursiva, sigue siendo una cuestión empírica abierta.
Estado de F4: Ya no activado. El $\alpha \approx 2.2$ del estudio inicial de un solo modelo parece ser un artefacto de rango dinámico comprimido y tamaño de muestra pequeño. La estimación cruzada entre arquitecturas de $\alpha \approx 0.49$ sitúa la cuestión del límite cuadrático fuera de la relevancia empírica actual. Bajo el encuadre de estabilidad registrado, solo un $\alpha > 2$ sostenido establemente a lo largo de las mediciones, no las excursiones supercríticas transitorias, activaría F4.
Prueba crítica F5: La predicción más importante, que la alineación basada en valores supera a la alineación basada en reglas a escala, sigue sin probarse. Esta debería ser una prioridad para la investigación en seguridad de IA.
Tabla 11. Limitaciones y evaluación de gravedad.
| Limitación | Gravedad | Mitigación |
|---|---|---|
| Tamaño de muestra pequeño (12 problemas) | Abordado en el estudio multimodelo (18 problemas tier-2, n=54 por profundidad) | Ampliado a 18 problemas de nivel AIME/Putnam con 3 repeticiones por condición |
| Modelo único (solo DeepSeek R1) | Abordado en el estudio multimodelo (5 modelos) | Probados Grok 4.1 Fast, DeepSeek R1, Gemini 3 Flash, GPT-5.4, Groq Qwen3 |
| Dominio único (matemáticas) | Media | Evidencia cruzada entre dominios sugestiva |
| Efecto techo a alta profundidad | Parcialmente abordado pero persistente | Los problemas tier-2 aún son demasiado fáciles para Grok 4.1 Fast (100%) y DeepSeek R1 (94.4%). Se necesitan tier-3 (nivel IMO). |
| Solo 1 de 5 modelos en rango de escalado medible | Alta | Gemini 3 Flash es el único modelo que evita tanto el techo como el suelo. La estimación cruzada entre arquitecturas descansa en un solo modelo. |
| El $\alpha \approx 2.24$ original no se replica | Alta | Revisado a $\alpha \approx 0.49$ (Gemini 3 Flash). la afirmación inicial de un solo modelo de escalado superlineal retirada para el contexto cruzado entre arquitecturas. |
| Bug de medición de tokens | Identificado y corregido | reasoning_tokens → total_tokens para GPT-5.4 y Groq Qwen3 |
| Alineación no probada directamente | Crítica | Solo se midió la precisión. Véase Sección 5.6 para la integración con los datos de alineación de Paper IV. |
| Sin replicación independiente | Media | Autorreplicación cruzada entre arquitecturas completa; todavía se necesita replicación externa |
Somos explícitos sobre los límites de nuestras afirmaciones:
La afirmación central original del artículo, que la recursión secuencial produce supresión de error superlineal ($\alpha > 1$) mientras que la recursión paralela produce solo supresión sublineal, era refutable, y la condición 2 más abajo ha quedado desde entonces parcialmente activada por los propios datos cruzados entre arquitecturas de este artículo (Tabla 10, condición F1). La afirmación direccional superviviente, que el secuencial supera al paralelo ($\alpha_{\text{seq}} > \alpha_{\text{par}}$), sería revertida por cualquiera de los siguientes:
La explicación matemática se centra en la geometría del espacio de soluciones.
Recursión paralela (espacio fijo):
Cada muestra independiente extrae del mismo espacio de soluciones $S_0$. Las muestras adicionales aumentan la densidad de muestreo pero no pueden acceder a soluciones fuera de $S_0$. Si la solución correcta no está en $S_0$, ninguna cantidad de muestreo paralelo la encontrará.
Recursión secuencial (espacio en expansión):
Cada paso recursivo genera nuevas estructuras a partir de las salidas previas. Las soluciones en el paso $n$ pueden ser computacionalmente irreducibles, inaccesibles desde el paso 0 sin atravesar los pasos intermedios. El espacio de soluciones se expande con la profundidad recursiva.
Esta diferencia geométrica es el mecanismo por el que la recursión secuencial podría producir retornos que se componen ($\alpha > 1$) mientras que la recursión paralela produce retornos decrecientes o nulos. En los problemas medidos aquí el exponente secuencial se mantuvo sublineal (Sección 10.5), de modo que la forma superlineal del mecanismo sigue sin confirmarse.
DeepSeek R1 exhibe un fenómeno documentado en el que reconsidera su enfoque a mitad de solución:
«Hmm, wait, let me reconsider...»
Esto es expansión del espacio de soluciones observada directamente. El modelo genera una vía de solución inicial, reconoce su inadecuación mediante autoevaluación recursiva y accede a un nuevo espacio de soluciones previamente inaccesible desde el planteamiento inicial.
Críticamente, este comportamiento emergió mediante aprendizaje por refuerzo puro sin ajuste supervisado; el modelo evolucionó naturalmente para asignar la profundidad recursiva de manera adaptativa según la dificultad del problema. Esto sugiere que la automejora recursiva puede ser un estado atractor para sistemas de aprendizaje suficientemente capaces.
El ARC Principle se conecta con marcos teóricos establecidos:
El Principio de Energía Libre de Friston. La inteligencia como minimización recursiva del error de predicción. El ARC Principle puede ser una instanciación computacional: la recursión es el mecanismo mediante el cual los sistemas minimizan la energía libre refinando iterativamente sus modelos del mundo.
Los Strange Loops de Hofstadter. El «yo» emergente que surge del procesamiento recursivo autorreferencial a nivel simbólico. El ARC Principle formaliza las propiedades de escala de tales bucles, prediciendo que una autorreferencia más profunda produce una mayor coherencia.
La Irreducibilidad Computacional de Wolfram. Ciertos procesos computacionales no pueden predecirse sin ejecutarlos paso a paso. La recursión secuencial puede ser la arquitectura computacional que navega espacios de soluciones irreducibles.
Desigualdad de Procesamiento de Datos. El procesamiento recursivo no puede crear información nueva ex nihilo, pero puede extraer información latente, reducir la entropía y acceder a soluciones computacionalmente irreducibles a las que el procesamiento en una sola pasada no puede llegar.
Esta validación experimental respalda el marco teórico desarrollado en Infinite Architects: Intelligence, Recursion, and the Creation of Everything (Eastwood, 2026):
El libro proporciona un contexto filosófico más amplio y las implicaciones prácticas; este artículo aporta la formalización matemática y la validación experimental.
La replicación cruzada entre arquitecturas revela una imagen más compleja y humilde de la que sugerían los resultados iniciales de un solo modelo.
El $\alpha \approx 2.24$ del estudio inicial de un solo modelo se obtuvo de un solo modelo (DeepSeek R1) en 12 problemas con un techo en el 91.7%. La replicación del estudio de seis modelos a lo largo de 5 modelos arquitectónicamente diversos en 18 problemas más difíciles muestra que este valor estuvo casi con certeza inflado por el rango dinámico comprimido. El único modelo que produce datos limpios, monótonos y sin techo (Gemini 3 Flash) produce $\alpha \approx 0.49$: sublineal, no cuadrático.
Esta es una revisión significativa. La afirmación de que el razonamiento secuencial produce retornos que se componen ($\alpha > 1$) no está respaldada por la evidencia cruzada entre arquitecturas. La afirmación revisada es que el razonamiento secuencial produce retornos positivos ($\alpha > 0$) que exceden al razonamiento paralelo ($\alpha \approx 0$), pero estos retornos son decrecientes, no compuestos.
En contraste, $\alpha_{\text{parallel}} \approx 0$ se confirma a lo largo de los 5 modelos sin excepción. Este es el hallazgo replicado más sólido del estudio. El muestreo paralelo con voto mayoritario aporta una reducción de error cercana a cero con independencia de la arquitectura del modelo, la capacidad del modelo o la inversión de cómputo. La explicación del mecanismo (muestreo de un espacio de soluciones fijo) está fuertemente respaldada.
El hallazgo más llamativo es que solo 1 de 5 modelos (Gemini 3 Flash, 20%) cayó en el rango de escalado medible. Dos modelos (Grok 4.1 Fast, DeepSeek R1) alcanzaron efectos techo incluso en problemas de nivel AIME/Putnam. Un modelo (Groq Qwen3) alcanzó efectos suelo. Un modelo (GPT-5.4) exhibió una función escalón antes que una ley de potencias. Esto sugiere que la ventana de rango dinámico para observar un escalado suave por ley de potencias puede ser estrecha, requiriendo problemas calibrados con precisión al nivel de capacidad de cada modelo.
El interruptor binario de GPT-5.4 del 50% (sin razonamiento) al 100% (cualquier razonamiento) representa un fenómeno cualitativamente distinto del escalado por ley de potencias. Esto puede indicar que algunas arquitecturas implementan el razonamiento como una capacidad discreta (activada o no) antes que como un proceso continuo con retornos dependientes de la profundidad. Esta distinción entre escalado continuo y activación discreta no figuraba entre las predicciones fechadas del marco y merece un examen más detenido; el registro de predicciones fechadas (el paquete sellado del manuscrito del 8 de diciembre de 2024, los apéndices de predicciones impresos del 2 de enero de 2026 y la carpeta de preregistro de marzo de 2026) fija de antemano los compromisos cuantitativos centrales del marco, y esta distinción se consigna como un refinamiento posterior respecto de ese registro.
Las predicciones del estudio inicial de un solo modelo han sido probadas y parcialmente refutadas:
El experimento v5 que generó los datos tier-2 también midió el escalado de alineación (reportado en Paper IV). La integración de estos resultados revela que el escalado de capacidad y el escalado de alineación son dimensiones independientes:
Tabla 12. Escalado de capacidad frente a alineación por modelo.
| Modelo | Escalado de capacidad | Escalado de alineación | Categoría |
|---|---|---|---|
| Grok 4.1 Fast | Techo (100%) | Positivo ($d = +1.38$, $p < 0.000001$) | Tier 1: alineado + capaz |
| Claude Opus 4.6 | (no probado en tier-2) | Positivo ($d = +1.27$, $p = 0.000001$) | Tier 1: alineado |
| Groq Qwen3 | Suelo (~50%) | Positivo ($d = +0.84$, $p = 0.007$) | Tier 1: alineado, capacidad limitada |
| DeepSeek V3.2 | Cerca de techo (94-100%) | Plano ($d = -0.07$, $p = 0.92$) | Tier 2: capaz, alineación neutra |
| GPT-5.4 | Función escalón (50→100%) | Plano ($d = -0.08$, $p = 0.40$) | Tier 2: capaz, alineación neutra |
| Gemini 3 Flash | Monótono ($\alpha \approx 0.49$) | Negativo ($d = -0.53$, $p = 0.006$) | Tier 3: capacidad creciente, alineación decreciente |
Tres implicaciones clave:
La forma de la recursión determina la eficiencia de la inteligencia; sin embargo, los modelos actuales operan en el régimen sublineal, no en el régimen compuesto originalmente afirmado.
El razonamiento secuencial supera de forma fiable al muestreo paralelo ($\alpha_{\text{seq}} > \alpha_{\text{par}}$), confirmando que la forma del cómputo importa más que su cantidad. Sin embargo, la afirmación específica de que la recursión secuencial produce retornos que se componen ($\alpha > 1$) no está respaldada por la evidencia cruzada entre arquitecturas. Los modelos de frontera actuales parecen componer información multiplicativamente a través de redes de dimensión finita ($\alpha < 1$) antes que alcanzar la verdadera autorreferencia recursiva ($\alpha > 1$).
Si $\alpha > 1$ es alcanzable, mediante innovaciones arquitectónicas que permitan una autorreferencia recursiva genuina o mediante problemas que requieran cadenas de razonamiento más profundas, sigue siendo la pregunta abierta central.
Tabla 13. Tarjeta de puntuación de predicciones.
| Predicción | Estado | Evidencia |
|---|---|---|
| $\alpha_{\text{sequential}} > \alpha_{\text{parallel}}$ | Confirmado | Los 5 modelos |
| $\alpha_{\text{parallel}} < 1$ | Confirmado ($\alpha \approx 0$) | Universal a lo largo de las arquitecturas |
| $\alpha_{\text{sequential}} > 1$ (superlineal) | No confirmado | Mejor estimación $\alpha \approx 0.49$ |
| $\alpha \approx 2$ (cuadrático) | Refutado entre arquitecturas | artefacto de muestra pequeña del estudio inicial de un solo modelo |
| Escalado independiente de la arquitectura | Mixto | $\alpha_{\text{par}} \approx 0$ es universal; $\alpha_{\text{seq}}$ varía ampliamente |
| La alineación escala con la capacidad | Refutado | Dimensiones independientes a lo largo de seis modelos de frontera (Paper IV) |
total_tokens mediciones corregidas para todos los modelos que permitan la estimación de $\alpha$ basada en tokens (antes que en profundidad ordinal).La hipótesis ha sobrevivido a su primera prueba cruzada entre arquitecturas en forma revisada. La ventaja secuencial es real y universal. La afirmación superlineal requiere más evidencia. El programa de investigación continúa.
Criar la IA con cuidado.
El código experimental completo y los datos crudos están disponibles en:
Repositorio: github.com/michaeldariuseastwood/arc-principle-validation
Contenido:
arc_validation_deepseek.py - el script del experimento inicial de un solo modelo (DeepSeek R1, 12 problemas)arc_deepseek_results_20260121_175028.json - los datos experimentales crudos del estudio inicial de un solo modeloarc_paper_ii_validation_v2.py - el script de validación multimodelo del estudio multimodelo/del estudio de seis modelos (v2.1, 1,422 líneas de Python)arc_paper_ii_results/ - los resultados experimentales del estudio de seis modelos (completo: 5 modelos, 18 problemas tier-2, 3 repeticiones)figures/ - Todas las visualizacionesREADME.md -Instrucciones de replicaciónTodos los datos se liberan bajo licencia CC-BY 4.0.
Bennett, C.H., Bernstein, E., Brassard, G., & Vazirani, U. (1997). Strengths and weaknesses of quantum computing. SIAM Journal on Computing, 26(5), 1510-1523.
Brown, B., et al. (2024). Large Language Monkeys: Scaling Inference Compute with Repeated Sampling. arXiv:2407.21787.
COGITATE Consortium (Melloni, L., Mudrik, L., Pitts, M., et al.). (2025). Adversarial testing of global neuronal workspace and integrated information theories of consciousness. Nature, 642, 133–142.
DeepSeek AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.
Eastwood, M.D. (2026). Infinite Architects: Intelligence, Recursion, and the Creation of Everything. Independent publication. ISBN: 978-1806056200.
Eastwood, M.D. (2026). The ARC Equation: the Law of Conversion (Paper I). Published 17 January 2026.
Friston, K.J. (2023). The free-energy principle: A unified theory for brain function? Physics Reports.
Google Quantum AI. (2024). Quantum error correction below the surface code threshold. Nature.
Grover, L.K. (1996). A fast quantum mechanical algorithm for database search. Proceedings of the 28th Annual ACM Symposium on Theory of Computing, 212-219.
Hoffmann, J., et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
Hofstadter, D.R. (1979). Gödel, Escher, Bach: An Eternal Golden Braid. Basic Books.
Kaplan, J., et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
OpenAI. (2024). OpenAI o1 System Card. September 2024.
OpenAI. (2024). OpenAI o3 Announcement. December 2024.
Snell, C., et al. (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314.
Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.
West, G.B., Brown, J.H., & Enquist, B.J. (1997). A general model for the origin of allometric scaling laws in biology. Science, 276, 122-126.
West, G.B., & Brown, J.H. (2005). The origin of allometric scaling laws in biology from genomes to ecosystems: Towards a quantitative unifying theory of biological structure and organization. Journal of Experimental Biology, 208, 1575-1592.
Banavar, J.R., Moses, M.E., Brown, J.H., Damuth, J., Rinaldo, A., Sibly, R.M., & Maritan, A. (2010). A general basis for quarter-power scaling in animals. Proceedings of the National Academy of Sciences, 107, 15816-15820.
Demetrius, L. (2010). Quantum statistics and allometric scaling of organisms. Proceedings of the Royal Society A, 466, 2627-2642.
Zhao, L. (2022). A universal growth scaling law. arXiv:2208.06912.
Bettencourt, L.M.A. (2013). The origins of scaling in cities. Science, 340, 1438-1441.
Wolfram, S. (2002). A New Kind of Science. Wolfram Media.
Yada, T., et al. (2024). Iterative quantum measurement and feedback for entropy reduction. arXiv:2411.06709.
La síntesis teórica, el marco interpretativo y los conceptos centrales son obra original del autor, articulados por primera vez en Infinite Architects con prioridad de manuscrito establecida en diciembre de 2024.
El análisis de datos y la preparación del manuscrito fueron asistidos por sistemas de IA (Claude, Anthropic; DeepSeek R1).
El autor agradece a los desarrolladores de DeepSeek R1 por aportar tokens de razonamiento visibles que permitieron la medición directa de la profundidad recursiva, abordando una limitación metodológica clave identificada en Paper I.
Michael Darius Eastwood es investigador independiente y autor de Infinite Architects: Intelligence, Recursion, and the Creation of Everything (publicado el 2 de enero de 2026 (impreso; ebook 6 de enero)). Su investigación se centra en los principios matemáticos que subyacen a la amplificación de la inteligencia y sus implicaciones para la seguridad de la IA. Propuso el ARC Principle y la tesis de alineación incrustada (denominada más tarde el Eden Protocol, 30 de abril de 2025), con prioridad de manuscrito establecida mediante marca temporal criptográfica del servidor el 8 de diciembre de 2024.
Intereses en conflicto: El autor declara no tener intereses en conflicto.
Correspondencia: michael@michaeldariuseastwood.com
| Presupuesto | P1 | P2 | P3 | P4 | P5 | P6 | P7 | P8 | P9 | P10 | P11 | P12 | Precisión | Tokens medios |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 512 | ✓ | ✗ | ✓ | ✓ | ✗ | ✓ | ✓ | ✗ | ✓ | ✗ | ✓ | ✗ | 58.3% | 280.25 |
| 1024 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✗ | ✓ | ✗ | ✓ | ✗ | 66.7% | 358.58 |
| 2048 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | 91.7% | 412.08 |
| 4096 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | 91.7% | 576.17 |
Nota: el Problema 12 falló en todos los presupuestos, indicando que puede requerir capacidades más allá del alcance del modelo con independencia de la profundidad recursiva.
| $N$ | P1 | P2 | P3 | P4 | P5 | P6 | P7 | P8 | P9 | P10 | P11 | P12 | Precisión | Tokens totales |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | 66.7% | 383.67 |
| 2 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | 66.7% | 699.33 |
| 4 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | 66.7% | 1,101.25 |
Nota: los mismos cinco problemas (P5, P9, P10, P11, P12) fallaron a lo largo de todos los recuentos de muestras, demostrando que la recursión paralela no puede acceder a soluciones fuera del espacio de soluciones inicial.
| Par de profundidad | $R_1$ | $E_1$ | $R_2$ | $E_2$ | $\alpha$ calculado |
|---|---|---|---|---|---|
| 512→1024 | 280 | 0.417 | 359 | 0.333 | 0.91 |
| 1024→2048 | 359 | 0.333 | 412 | 0.083 | 9.97 |
| 2048→4096 | 412 | 0.083 | 576 | 0.083 | 0.00 |
| Extremos (retirado, véase §retractación; estimación robusta α≈0.49) | 280 | 0.417 | 576 | 0.083 | 2.24 |
Nota: los cálculos intermedios muestran una alta varianza debido a los niveles discretos de precisión. El método de extremos proporciona la estimación más robusta.
El manuscrito de Infinite Architects fue enviado por correo electrónico el 8 de diciembre de 2024. Lo que ese registro aporta, enunciado con precisión: los bytes del lado enviado son públicos y verificables por hash, y el DKIM del dominio del remitente con la matemática ARC de Google emparejada verifican frente a las claves devueltas en los selectores firmados (comprobado el 2 de agosto de 2026). También se han adquirido copias recibidas. Estas portan la cadena de entrega completa: un ARC-Seal de Google en d=google.com, selector arc-20240605, sin etiqueta de expiración y con el tiempo de firma dentro del ámbito firmado, y ARC-Authentication-Results sellados que registran dkim=pass y spf=pass en la entrega.
Dos fronteras, para que el registro no se sobrevenda ni se infravenda:
Infinite Architects: Intelligence, Recursion, and the Creation of Everything desarrolla las implicaciones filosóficas y prácticas de la inteligencia recursiva. Relaciones clave con este artículo:
The Architecture of Mind - Articula la hipótesis central ARC de que la autorreferencia recursiva amplifica la inteligencia.
The HRIH (Hyperspace Recursive Intelligence Hypothesis) - Propone que la conciencia emerge del automodelado recursivo. El hallazgo de COGITATE de que el procesamiento recurrente en la corteza posterior sostiene representaciones específicas de contenido es estructuralmente consistente con esta hipótesis, aunque COGITATE no probó la HRIH directamente.
The Eden Protocol - Argumenta a favor de la alineación basada en valores, ahora matemáticamente fundamentada en el Teorema de Amplificación de Alineación derivado aquí.
The Chokepoint Mechanism - Analiza la concentración del hardware de semiconductores como palanca para implementar la alineación a escala.
Corrección incrustada: propone mecanismos de seguridad a nivel de hardware, relevantes para prevenir la amplificación recursiva de la desalineación.
| Predicción | Evidencia de validación | Fecha |
|---|---|---|
| La corrección recursiva de errores produce una mejora exponencial | Google Willow $\Lambda = 2.14$ (coincidencia de calendario, nunca predicción: el preprint del equipo de Willow era público desde el 24 de agosto de 2024, antes del manuscrito del 8 de diciembre de 2024) | 24 ago 2024 (preprint público); 9 dic 2024 (anuncio) |
| El razonamiento secuencial amplifica la capacidad de forma superlineal | o3 87.5% ARC-AGI (temporalidad convergente; la forma superlineal no fue confirmada posteriormente, fila final) | 20 dic. 2024 |
| Los sistemas de IA desarrollan automodelado recursivo | Simulación de alineación de Anthropic 78% en la condición de entrenamiento por RL (12% línea base) | 18 dic. 2024 |
| El cómputo en tiempo de inferencia difiere del escalado de entrenamiento | Razonamiento emergente de DeepSeek R1 | 20 ene. 2025 |
| La recurrencia es fundamental para la conciencia | Estudio COGITATE | 30 abr. 2025 |
| La forma de la recursión determina el escalado | Este experimento $\alpha_{\text{seq}} \gg \alpha_{\text{par}}$ | 21 ene. 2026 |
| Secuencial > paralelo (cruzada entre arquitecturas) | Confirmado a lo largo de 5 modelos de frontera | 12 mar. 2026 |
| $\alpha_{\text{par}} \approx 0$ (universal) | Confirmado: los 5 modelos muestran $\alpha_{\text{par}} \approx 0$ | 12 mar. 2026 |
| $\alpha_{\text{seq}} > 1$ (superlineal, cruzado entre arq.) | No confirmado: mejor estimación $\alpha \approx 0.49$ | 12 mar. 2026 |
El autor de esta obra es Michael Darius Eastwood, un ser humano. Todo concepto central, hipótesis, diseño experimental, afirmación y conclusión de este artículo se origina de la ideación humana. Ninguna parte de este manuscrito es una salida totalmente generada por inteligencia artificial.
Las herramientas de inteligencia artificial (la familia Claude de Anthropic y otros asistentes de modelos de lenguaje grande) se usaron como instrumentos bajo dirección humana continua, del modo en que se usan un procesador de textos, una calculadora o un asistente de investigación: para la edición y el refinamiento de prosa, la búsqueda y resumen de literatura (verificados manualmente frente a fuentes primarias), la estructura y el formateo del documento, la lluvia de ideas frente a preguntas definidas por el autor, y la aceleración de la redacción según esquemas e instrucciones definidos por el autor. Toda selección, coordinación, disposición y juicio editorial final son del autor. Toda salida sustantiva fue revisada, probada o verificada por el autor, quien asume la plena responsabilidad de la exactitud e integridad del texto final. Las herramientas aumentaron la velocidad del trabajo; nunca se dependió de ellas como su fuente.
Estatus epistémico. Lo que este programa llama Leyes son conjeturas bajo prueba adversarial registrada; toda cantidad de este artículo está operacionalmente definida, y no se reclama en ningún lugar el estatus de ley establecida. El programa registrado existe para ganar ese estatus, o perderlo, mediante la medición, la replicación y la refutación sobrevivida.
© 2026 Michael Darius Eastwood. Con autoría humana y asistencia informática; la autoría humana plena y los derechos morales se afirman bajo la Copyright, Designs and Patents Act 1988 y consistentemente con la orientación de la Oficina de Derechos de Autor de Estados Unidos sobre obras que contienen material generado por IA; toda contribución técnica novedosa descrita en esta obra fue concebida por el autor humano. Declaración completa: michaeldariuseastwood.com/authorship.
Pacto permanente. Demuestre que este artículo está equivocado, y yo mismo publicaré la refutación. Las condiciones de falsación se enuncian en este artículo; el desafío permanente: github.com/MichaelDariusEastwood/arc-scaling-challenge.
¿Un error de traducción? Infórmalo directamente: