Traducción automática del original inglés fechado. La página en inglés es la canónica. English →

Investigación de Michael Darius Eastwood Capa de publicación canónica

Artículo de investigación

Suite de investigación

La ARC Equation medida: replicación cruzada entre arquitecturas cegada y retirada de una estimación superlineal

Paper II de la ARC Theory: una replicación cruzada entre arquitecturas cegada a lo largo de seis modelos de IA de frontera. La estimación superlineal inicial de un solo modelo (alpha 2.24) no se replicó y queda retirada. Lo que sobrevive: la mejor estimación cruzada entre arquitecturas es alpha 0.49 (Gemini 3 Flash, r cuadrado 0.86), el exponente paralelo es cercano a cero en todos los modelos, y el secuencial superó al paralelo dondequiera que ambos fueron medibles.

Michael Darius Eastwood

Michael Darius Eastwood, investigador independiente, Londres: construir una alineación medible, donde la corrección vive dentro del bucle recursivo antes que atornillada por fuera de él.

Publicado por primera vez 22 de enero de 2026, revisado el 23 de agosto de 2026

Resumen

Paper II de la ARC Theory: una replicación cruzada entre arquitecturas cegada a lo largo de seis modelos de IA de frontera. La estimación superlineal inicial de un solo modelo (alpha 2.24) no se replicó y queda retirada. Lo que sobrevive: la mejor estimación cruzada entre arquitecturas es alpha 0.49 (Gemini 3 Flash, r cuadrado 0.86), el exponente paralelo es cercano a cero en todos los modelos, y el secuencial superó al paralelo dondequiera que ambos fueron medibles.

La ARC Theory · experimentos ARC/Eden - Paper II (validación experimental)

La ARC Equation medida: replicación cruzada entre arquitecturas cegada y retirada de una estimación superlineal

Michael Darius Eastwood
Investigador independiente en alineación de IA, Londres · Autor, Infinite Architects (2026)

Dentro de la ARC Theory: el programa de medición de la Ley I, la ARC Equation; la estimación cruzada entre arquitecturas cegada del exponente, incluida la retirada.

Un artículo experimental del programa de la ARC Theory
Michael Darius Eastwood
Investigador Independiente
Autor, Infinite Architects: Intelligence, Recursion, and the Creation of Everything (2026)
Londres, Reino Unido | OSF: 10.17605/OSF.IO/8FJMA | ISBN 978-1806056200 (ISBN-10: 1806056208)
Documento de trabajo v2.7 | 16 de marzo de 2026, retitulado el 16 de agosto de 2026, revisado el 23 de agosto de 2026
Prioridad del manuscrito: 8 de diciembre de 2024 (el registro de transmisión por correo electrónico; Nota Suplementaria 1) | Paper I publicado: 17 de enero de 2026
Correspondencia: michael@michaeldariuseastwood.com | Repositorio: github.com/michaeldariuseastwood/arc-principle-validation
Código y datos: github.com/MichaelDariusEastwood/arc-principle-validation

Resumen

Este artículo presenta la validación experimental del ARC Principle (Artificial Recursive Creation), un marco matemático que propone que las tasas de error en los sistemas inteligentes disminuyen según una ley de potencias con la profundidad recursiva. El principio, articulado por primera vez en Infinite Architects (Eastwood, diciembre de 2024) y formalizado en Paper I (Eastwood, 17 de enero de 2026), predice que la forma de la recursión determina el régimen de escala: la recursión secuencial debería producir supresión de error superlineal (exponente de escala $\alpha > 1$), mientras que la recursión paralela debería producir supresión sublineal ($\alpha < 1$).

Realizamos experimentos controlados en dos fases. La Fase 1 (el estudio inicial de un solo modelo) utilizó DeepSeek R1 con tokens de razonamiento visibles sobre 12 problemas matemáticos de nivel competición, encontrando $\alpha_{\text{sequential}} \approx 2.24$ (IC 95%: 1.5-3.0) y $\alpha_{\text{parallel}} \approx 0.0$. La Fase 2 (el estudio de seis modelos) amplió las pruebas a seis modelos de frontera sobre 18 problemas de nivel AIME/Putnam (n=54 por profundidad por modelo) con intervalos de confianza por bootstrap y verificación cruzada de 4 capas.

Replicación cruzada entre arquitecturas: El $\alpha \approx 2.24$ original (cuadrático) no se replica entre arquitecturas. Solo Gemini 3 Flash produjo datos de escalado limpios y monótonos: $\alpha_{\text{seq}} = 0.49$ (regresión, $r^2 = 0.86$, SE = 0.20, IC bootstrap [−1.3, 2.9]). DeepSeek R1 alcanzó el techo (94.4%-100%). GPT-5.4 exhibió una función escalón binaria (50% → 100%). Grok 4.1 Fast alcanzó el 100% a todas las profundidades. Groq Qwen3 no mostró tendencia (~50%).

Escalado paralelo en o cerca de cero en todos los modelos, con una excepción medida: $\alpha_{\text{parallel}} \approx 0$ para todos los modelos excepto Gemini 3 Flash, que devuelve $\alpha_{\text{par}} = 0.31$ con $r^2 = 0.93$. Esa excepción importa, porque Gemini 3 Flash es el modelo que este artículo trata como su estimación más fiable. El hallazgo replicado es, por tanto, que el escalado paralelo es en o cerca de cero en todos los modelos medidos, con una excepción medida, no que sea universalmente cero. El secuencial superó al paralelo en todos los modelos en los que ambos fueron medibles.

Estimación revisada del parámetro: La estimación cruzada entre arquitecturas más robusta es $\alpha_{\text{sequential}} \approx 0.49$ (sublineal, de Gemini 3 Flash), sustancialmente por debajo de la estimación inicial de un solo modelo de 2.24. Bajo la Fórmula de la Inteligencia $\alpha = 1/(1 - \beta)$ de Paper I, $\alpha < 1$ sitúa a los modelos actuales en el régimen físico (composición multiplicativa a través de redes de dimensión finita) antes que en el régimen de inteligencia (autorreferencia recursiva con $\alpha > 1$). La desigualdad fundamental $\alpha_{\text{sequential}} > \alpha_{\text{parallel}}$ sigue confirmada.

Cambios recientes

Esta versión reporta resultados completos de tier-2 del estudio de replicación multimodelo:

Todos los hallazgos iniciales del estudio de un solo modelo se conservan en su forma original. Las conclusiones se han revisado para reflejar la evidencia cruzada entre arquitecturas.

La evidencia cruzada entre dominios refuerza estos hallazgos. El chip cuántico Willow de Google (diciembre de 2024) demostró supresión recursiva de error con $\Lambda = 2.14$. Las leyes de escala biológicas muestran exponentes de un cuarto a lo largo de 27 órdenes de magnitud mediante redes fractales recursivas. El estudio de conciencia COGITATE (Nature, abril de 2025) identificó el procesamiento recurrente como el denominador común a lo largo de las teorías.

Las implicaciones para la seguridad de la IA dependen críticamente de si $\alpha > 1$ es alcanzable. Si lo es, las propiedades de alineación incrustadas en el proceso de razonamiento escalarían de forma superlineal con la capacidad, mientras que las restricciones externas permanecerían constantes. Incluso con $\alpha < 1$, el hallazgo direccional de que el razonamiento secuencial mejora la capacidad respalda el Eden Protocol de Infinite Architects: los sistemas de IA se benefician de valores incrustados en el razonamiento antes que de restricciones impuestas externamente. Sin embargo, los datos multimodelo muestran que la capacidad y la alineación son dimensiones independientes; más razonamiento no significa automáticamente mejor alineación.

Palabras clave: leyes de escala, inteligencia recursiva, cómputo en tiempo de inferencia, supresión de error, seguridad de IA, alineación, razonamiento en cadena de pensamiento, Eden Protocol, validación cruzada entre dominios, replicación multimodelo

Cómo leer este artículo. Este artículo reporta una medición directa en la ARC Theory. A lo largo de seis modelos de frontera probados sobre treinta problemas con intervalos por bootstrap, el exponente secuencial excede al exponente paralelo en todos los modelos, el mejor ajuste del exponente de cómputo es $\alpha_{\mathrm{compute}} \approx 0.49$ (Gemini 3 Flash, $r^2 = 0.86$), y el rango medido abarca desde casi cero hasta aproximadamente tres, de modo que el Límite ARC $\alpha \leq 2$ no queda ni confirmado ni refutado. Su peldaño dentro de la teoría es la capa de medición cruzada entre arquitecturas por encima de Paper I. El diferencial completo frente a cada documento previo se encuentra en eden-vision II.A.8.

1. Introducción

1.1 Antecedentes y motivación

Las leyes de escala que rigen la inteligencia artificial han transformado nuestra comprensión de la emergencia de la capacidad. Kaplan et al. (2020) estableció relaciones de ley de potencias entre el rendimiento del modelo y el cómputo de entrenamiento, mientras que Hoffmann et al. (2022) refinó estas relaciones con prescripciones de cómputo óptimo. Estos trabajos fundacionales revolucionaron la metodología de entrenamiento pero abordan solo el escalado en pre-entrenamiento. No explican por qué asignar cómputo adicional en tiempo de inferencia produce mejoras dramáticas en la capacidad, ni por qué distintas formas de tal cómputo producen resultados fundamentalmente distintos.

La emergencia de los modelos de razonamiento a finales de 2024 introdujo el cómputo en tiempo de inferencia como una variable crítica. o1 de OpenAI (septiembre de 2024) y R1 de DeepSeek (enero de 2025) asignan recursos computacionales durante la inferencia para razonar antes de responder. En benchmarks de razonamiento matemático, estos sistemas alcanzan un rendimiento que antes se pensaba que requería modelos un orden de magnitud mayores. Sin embargo, los mecanismos que subyacen a esta mejora siguen caracterizados de forma incompleta.

Han surgido dos paradigmas para asignar el cómputo en tiempo de inferencia:

Recursión paralela. Generar múltiples soluciones independientes y seleccionar la mejor mediante voto mayoritario o puntuación por verificador. Este enfoque es computacionalmente sencillo pero, como documenta Brown et al. (2024), produce retornos decrecientes que siguen leyes de potencias sublineales.

Recursión secuencial. Generar cadenas de razonamiento extendidas en las que cada paso se apoya explícitamente en los pasos previos. Los errores pueden detectarse y corregirse de manera iterativa mediante autorreferencia. Este enfoque produce retornos que se componen, pero la relación de escala no se ha caracterizado formalmente; este artículo aborda esa laguna.

1.2 La pregunta de investigación

¿Por qué el razonamiento secuencial supera dramáticamente al muestreo paralelo a coste computacional equivalente? ¿Qué principio matemático rige esta diferencia? ¿Y cuáles son las implicaciones para alinear sistemas de IA cada vez más capaces?

1.3 Contribución de este artículo

Este artículo hace ocho contribuciones:

  1. Formalización matemática. Proponemos el ARC Principle: $E(R) = E_0 \times R^{-\alpha}$, donde la tasa de error $E$ disminuye desde la línea base $E_0$ a medida que la profundidad recursiva $R$ aumenta, regida por el exponente de escala $\alpha$. La forma de la recursión determina $\alpha$.
  2. Validación experimental controlada. Utilizando DeepSeek R1 con tokens de razonamiento visibles, llevamos a cabo la primera comparación con cómputo emparejado entre recursión secuencial y paralela con medición directa de la profundidad recursiva.
  3. Estimación cuantitativa de parámetros. Estimación de un solo modelo: $\alpha \approx 2.2$ (inicial, DeepSeek R1). Estimación cruzada entre arquitecturas: $\alpha \approx 0.49$ (seis modelos, Gemini 3 Flash, $r^2 = 0.86$). Paralelo: $\alpha \approx 0.0$ (universal).
  4. Síntesis de evidencia convergente. Combinado con datos publicados de OpenAI o1 y DeepSeek R1, múltiples fuentes independientes confirman $\alpha_{\text{seq}} > \alpha_{\text{par}}$.
  5. Validación cruzada entre dominios. Demostramos que la supresión recursiva de error aparece a lo largo de la física cuántica (Willow $\Lambda = 2.14$), la biología (escalado de potencia un cuarto) y la conciencia (recurrencia de COGITATE).
  6. Implicaciones para la seguridad de la IA. Derivamos teoremas condicionales de alineación, ahora matizados por el hallazgo empírico de que $\alpha < 1$ entre arquitecturas.
  7. Replicación cruzada entre arquitecturas. Seis modelos de frontera probados sobre 18 problemas de nivel AIME/Putnam con IC por bootstrap y verificación cruzada de 4 capas. Se identifican cuatro comportamientos de escala distintos (techo, monótono, función escalón, suelo).
  8. Integración con el escalado de alineación. Se muestra que la capacidad y la alineación son dimensiones de escalado independientes a lo largo de seis modelos de frontera, con una jerarquía de alineación de tres niveles fijada por la metodología de entrenamiento.

1.4 Establecimiento de la prioridad

El ARC Principle fue articulado por primera vez en el manuscrito de Infinite Architects: Intelligence, Recursion, and the Creation of Everything. La prioridad del manuscrito se estableció mediante marca temporal criptográfica del servidor el 8 de diciembre de 2024, cuando el manuscrito se envió por correo electrónico utilizando los servidores de Google. El libro en sí se publicó posteriormente, el 2 de enero de 2026 (impreso; ebook 6 de enero). Las marcas temporales generadas por el servidor proporcionan un sellado temporal a prueba de manipulación mediante la verificación de servidor de correo, apoyándose en la infraestructura del proveedor y en firmas con clave del proveedor en los selectores DKIM y ARC de Google, y no en una marca temporal de confianza RFC 3161 (véase la nota de corrección al inicio de este artículo), estableciendo que los conceptos centrales (amplificación recursiva de la inteligencia, la distinción entre recursión paralela y secuencial, y la tesis de alineación incrustada, denominada más tarde el Eden Protocol el 30 de abril de 2025) fueron documentados antes de las validaciones independientes posteriores y antes de los depósitos de archivo público posteriores.

Tabla 1. Cronología de validación de predicciones.

FechaEventoRelación con el manuscrito
8 de diciembre de 2024Manuscrito enviado por correo (registro fechado; véase la nota de corrección en esta página)Prioridad establecida
9 de diciembre de 2024Google Willow anunciado ($\Lambda = 2.14$)24 horas tras el envío
18 de diciembre de 2024Simulación de alineación de Anthropic (78% en la condición de entrenamiento por RL (12% línea base))10 días tras el envío
20 de diciembre de 2024OpenAI o3 anunciado (87.5% ARC-AGI)12 días tras el envío
20 de enero de 2025DeepSeek R1 publicado ($\alpha \approx 1.34$)43 días tras el envío
30 de abril de 2025Estudio COGITATE (recurrencia confirmada)~5 meses tras el envío

La proximidad temporal entre el sello de tiempo del manuscrito y los resultados públicos posteriores se califica como coincidencia de calendario, nunca como predicción: el preprint del equipo de Google Willow era público desde el 24 de agosto de 2024, es decir, antes del manuscrito del 8 de diciembre de 2024, de modo que el registro de diciembre no pudo predecir un resultado que sus autores ya habían anunciado. Lo que los sellos de tiempo establecen es que el planteamiento del manuscrito quedó registrado antes de la cobertura mediática de Willow: un hecho de existencia en una fecha, referido al documento, y no clarividencia sobre la física.

Tras la marca temporal del manuscrito de diciembre de 2024 y la publicación pública del libro el 2 de enero de 2026, Paper I (Eastwood, 17 de enero de 2026) formalizó matemáticamente el principio y analizó datos públicamente disponibles. Este Paper II aporta la validación experimental directa.

1.5 Trabajos relacionados

Este artículo se apoya en y extiende varios programas de investigación establecidos:

Estímulos de cadena de pensamiento (Wei et al., 2022) demostró que los pasos intermedios de razonamiento mejoran el rendimiento en tareas de múltiples pasos.

Escalado del cómputo en tiempo de inferencia (Snell et al., 2024) mostró que el cómputo en tiempo de inferencia puede superar a modelos 14× mayores en ciertos benchmarks.

Large Language Monkeys (Brown et al., 2024) documentó el escalado sublineal del muestreo paralelo con una caracterización precisa de la ley de potencias.

DeepSeek R1 (DeepSeek AI, enero de 2025) demostró un razonamiento emergente mediante aprendizaje por refuerzo puro, con fenómenos de «aha moment» que muestran autocorrección recursiva.

Este artículo extiende estas observaciones proponiendo un marco matemático unificado, el ARC Principle, y aportando validación experimental con medición directa de la profundidad recursiva.

2. Marco teórico

2.1 El ARC Principle

Definición - El ARC Principle

El ARC Principle (Artificial Recursive Creation) propone que las tasas de error en los sistemas inteligentes disminuyen según una ley de potencias con la profundidad recursiva:

$$E(R) = E_0 \times R^{-\alpha}$$

Tabla 2. Definiciones de variables.

SímboloNombreDefiniciónUnidades
$E(R)$Tasa de error a profundidad $R$Proporción de respuestas incorrectas[0, 1]
$E_0$Tasa de error de línea baseTasa de error con recursión mínima ($R = 1$)[0, 1]
$R$Profundidad recursivaIteraciones de procesamiento autorreferencialTokens o muestras
$\alpha$Exponente de escalaTasa de supresión de errorAdimensional

El exponente de escala $\alpha$ determina la naturaleza de los retornos de la inversión recursiva:

Esta formulación modela directamente la supresión de error, análogamente a la corrección cuántica de errores, donde las tasas de error lógico disminuyen con la distancia de código. El exponente $\alpha$ encapsula la eficiencia del proceso recursivo.

Aviso sobre las figuras (25 de agosto de 2026). Todas las figuras de este artículo se generaron el 5 de abril de 2026 y son anteriores a las correcciones que su texto ya recoge. Cuando una figura afirma respaldo a α > 1 secuencial, una estimación secuencial de 2,2 o un estado «todos los datos son consistentes», ésa es la lectura superada de abril: rigen los resultados corregidos del texto (el 2,24 retractado, el valor secuencial de 0,49 en régimen congelado). Los casos más llamativos llevan su propia nota; hay figuras regeneradas en cola, y entretanto las imágenes se conservan como historia fechada.

Figura 1
Figura 1 | La formulación del ARC Principle E(R) = E₀ × R^(-α), donde U = I × g(R). α = 1/(1−β) a partir del acoplamiento autorreferencial β. α_seq ≈ 0.49 (sublineal, Gemini 3 Flash). la anterior estimación de un solo modelo α ≈ 2.24 fue un artefacto de un solo modelo, retirada, no se replicó. Nota de figura (25 de agosto de 2026): regenerada. Las definiciones de régimen siguen siendo definiciones, y el antiguo veredicto de «idea clave» se sustituye por el estado medido, extraído del texto de este artículo en el momento de la generación: el hallazgo direccional se mantiene, la afirmación cuantitativa α > 1 queda revisada, mejor ajuste limpio α_seq = 0,49. Generador: tools/generate_paper_ii_fig8.py en el repositorio público; la imagen de abril queda superada y se conserva en el historial de versiones.

2.2 Dos formas fundamentalmente distintas de recursión

Distinguimos dos procesos recursivos arquitectónicamente distintos que predicen comportamientos de escala distintos.

Recursión paralela (forma débil). Se generan múltiples soluciones independientes simultáneamente sin transferencia de información entre ramas. La salida final se selecciona mediante voto mayoritario o puntuación best-of-N.

Caracterización matemática:

Recursión secuencial (forma fuerte). Cada paso de procesamiento se apoya explícitamente en los pasos previos. Los errores pueden detectarse y corregirse de manera iterativa. La información se acumula a lo largo de la cadena de razonamiento.

Caracterización matemática:

Predicción central del ARC Principle:
$$\alpha_{\text{sequential}} > 1 > \alpha_{\text{parallel}}$$
Ecuación 2 -La desigualdad fundamental
Figura 2
Figura 2 | La recursión secuencial se compone: cada paso se apoya en la salida previa (α > 0). La recursión paralela muestrea de forma independiente (α ≈ 0). La forma de la recursión determina el régimen. Confirmado a lo largo de los 5 modelos probados: secuencial ≥ paralelo en todos los casos.

2.3 Cálculo del exponente de escala

Dadas mediciones a dos profundidades recursivas $(R_1, E_1)$ y $(R_2, E_2)$, el exponente de escala se calcula como:

$$\alpha = \frac{\ln(E_1 / E_2)}{\ln(R_2 / R_1)}$$
Ecuación 3 - Estimación por extremos

Para datos ruidosos con múltiples mediciones, la estimación por extremos (usando profundidades mínima y máxima) proporciona robustez frente a fluctuaciones intermedias. Este método es estándar en el análisis de leyes de escala y apropiado dadas las mediciones discretas de precisión.

2.4 La conjetura del límite cuadrático

Conjeturamos que $\alpha = 2$ representa el límite estable propuesto sobre la supresión recursiva de error: lo más que un sistema recursivamente autocorrector puede crecer y permanecer corregible, un límite de escala y no un límite de velocidad. Los sistemas pueden excederlo, pero no permanecen establemente autocorrectores; las excursiones transitorias por encima del límite son el régimen supercrítico predicho, no la refutación. La estabilidad se mide, no se afirma: la corrección superando la deriva, β > k según la Ley II, con el límite inferior de β − k por encima de cero a lo largo de una ventana fijada antes de la ejecución. La conjetura se traza por analogía con la aceleración cuadrática de Grover en computación cuántica. Bennett et al. (1997) probó que esta aceleración es óptima para problemas de búsqueda no estructurada.

Estado: Conjeturado, no derivado. La estimación inicial de un solo modelo ($\alpha \approx 2.2$) se situó por encima del límite estable como una excursión supercrítica transitoria antes que como una refutación, pero la estimación cruzada entre arquitecturas ($\alpha \approx 0.49$, Gemini 3 Flash) sitúa a los modelos actuales muy por debajo. La pregunta más urgente es si los modelos actuales pueden alcanzar $\alpha > 1$ en absoluto, antes que si $\alpha = 2$ es el límite estable.

Alcance arquitectónico del límite cuadrático. La estimación $\alpha \approx 0.49$ es para modelos congelados con atención fija: sistemas cuyos pesos, patrones de atención y reglas de composición no cambian durante la inferencia. El Límite ARC conjeturado ($\alpha \leq 2$) se aplica específicamente a tales arquitecturas fijas como el límite estable propuesto: lo más que un sistema recursivamente autocorrector puede crecer y permanecer corregible, un límite de escala y no un límite de velocidad. Los sistemas pueden excederlo como excursiones supercríticas transitorias, pero no permanecen allí establemente autocorrectores. La estabilidad aquí es la de la Ley II, medida antes que afirmada. Cada paso de razonamiento en una arquitectura fija se apoya en $O(N^2)$ rutas de atención por pares y no puede expandir establemente esa capacidad. La ecuación funcional de Cauchy restringe la forma del escalado recursivo a una ley de potencias pero no impone un límite superior al exponente. La EDO de Bernoulli da $\alpha = 1/(1-\beta)$, y a medida que el acoplamiento autorreferencial $\beta \to 1$, $\alpha \to \infty$. Un sistema auto-modificador, capaz de reescribir su propio mecanismo de atención y expandir su capacidad representacional en cada paso, escapa por completo del límite teórico-informacional de $O(N^2)$. Para tales sistemas, no existe techo matemático sobre $\alpha$. El límite cuadrático, si es real, es un límite de estabilidad sobre los transformers congelados de hoy, no una ley de la inteligencia recursiva.

2.5 Fundamentos teórico-informacionales

El ARC Principle se conecta con la teoría de la información establecida. La Desigualdad de Procesamiento de Datos establece que el procesamiento recursivo no puede crear nueva información; solo puede comprimir y destilar información existente. Sin embargo, el procesamiento recursivo puede:

  1. Extraer información latente a la que el procesamiento en una sola pasada no accede
  2. Reducir la entropía mediante refinamiento iterativo hacia soluciones óptimas
  3. Navegar espacios de soluciones que son computacionalmente irreducibles (Wolfram, 2002)

El artículo «Sequential Edge» (arXiv 2511.02309) demostró que el razonamiento secuencial supera a los enfoques paralelos en el 95.6% de las configuraciones probadas, con ganancias de precisión de hasta el 46.7% en benchmarks matemáticos. Esto valida la ventaja teórico-informacional del procesamiento secuencial.

3. Métodos

3.1 Abordando las limitaciones previas

Paper I analizó datos publicados pero identificó varias limitaciones que requerían validación experimental:

Tabla 3. Mejoras metodológicas.

Limitación previaResolución en este experimento
Recuentos de tokens estimados a partir de las system cardsDeepSeek R1 expone reasoning_content, permitiendo medición directa
Sin comparación experimental controladaVariación sistemática de presupuestos de tokens y recuentos de muestras
Riesgo de efecto techo (alta precisión de línea base)Se seleccionaron problemas más difíciles (58% de precisión de línea base)
Sin comparación con cómputo emparejadoCómputo total fijo a lo largo de las condiciones paralelas
Variables de confusión potencialesMismo modelo, mismos problemas, misma sesión experimental

3.2a Diseño experimental inicial (un solo modelo, 12 problemas)

Modelo. DeepSeek R1 (deepseek-reasoner) mediante la API oficial de DeepSeek. Este modelo se seleccionó porque expone cadenas de razonamiento completas mediante el reasoning_content campo, permitiendo una medición precisa de tokens.

Fecha. 21 de enero de 2026.

Problemas. 12 problemas matemáticos de nivel competición de AIME (American Invitational Mathematics Examination) y fuentes equivalentes, seleccionados para:

Condición secuencial. Presupuestos de tokens de 512, 1024, 2,048 y 4096. Respuesta única por problema en cada presupuesto. Tokens de razonamiento reales medidos directamente a partir de la respuesta de la API.

Condición paralela. $N = 1$, 2 y 4 muestras por problema. Presupuesto de tokens por muestra mantenido constante. Respuesta final seleccionada mediante voto mayoritario.

Puntuación. Correcto/incorrecto binario basado en coincidencia numérica exacta con soluciones conocidas.

3.2b Diseño ampliado multimodelo (multimodelo, 30 problemas)

La extensión multimodelo aborda las dos limitaciones más significativas del estudio inicial de un solo modelo, la dependencia de un solo modelo y el conjunto pequeño de problemas, mediante un estudio de replicación multimodelo exhaustivo con un conjunto ampliado de problemas diseñado para vencer los efectos techo.

Selección de modelos de frontera

Se seleccionaron seis modelos de IA de frontera arquitectónicamente diversos, cada uno con mecanismos controlables de profundidad de razonamiento:

Tabla 3b. Especificaciones de los modelos de frontera multimodelo.

ModeloIdentificador de APIProveedorMecanismo de control de profundidad
DeepSeek R1deepseek-reasonerDeepSeekPresupuesto de tokens (512-65,536)
GPT-5.4gpt-5.4OpenAIreasoning_effort (none→xhigh)
Claude Opus 4.6claude-opus-4-6AnthropicNivel de esfuerzo (low→max) + prefijo
Gemini 3 Flashgemini-3-flash-previewGooglethinking_budget (256-32,768)
Groq Qwen3qwen/qwen3-32bGroqreasoning_effort + prefijo
Grok 4.1 Fastgrok-4-1-fast-reasoningxAIPrefijo + max_tokens (4,096-30,000)

Estos modelos abarcan cuatro arquitecturas distintas (Mixture-of-Experts, transformer denso, IA constitucional y razonamiento destilado) de seis laboratorios independientes. Si los seis exhiben $\alpha_{\text{sequential}} > 1$, esto constituiría evidencia sólida de la independencia de arquitectura del ARC Principle.

Ampliación del conjunto de problemas: diseño de dos niveles

El experimento inicial de un solo modelo reveló un efecto techo: 4 de 12 problemas se resolvieron correctamente en todos los niveles de profundidad, dejando un rango dinámico insuficiente para una estimación precisa de $\alpha$. El conjunto de problemas multimodelo aborda esto mediante un diseño de dos niveles:

Tier 1 (12 problemas, ARC01-ARC12): Problemas de nivel preparación para competición que sirven como calibración de línea base. Estos son los problemas originales del inicial. Comportamiento esperado: alta precisión a profundidad mínima, confirmando el efecto techo identificado en el estudio inicial. Los resultados de tier-1 validan la continuidad con los hallazgos iniciales del estudio de un solo modelo pero se excluyen de la estimación primaria de $\alpha$.

Tier 2 (18 problemas, ARC13-ARC30): Problemas de finales de AIME y de nivel Putnam que cubren cinco dominios matemáticos:

Los problemas tier-2 están diseñados para empujar la precisión de línea base (a profundidad mínima) al 30-50%, proporcionando rango dinámico suficiente tanto para la mejora como para el deterioro, evitando efectos suelo.

Condiciones experimentales

Condición secuencial: 5-6 niveles de profundidad por modelo (variando por arquitectura, calibrado al mecanismo de control de profundidad de cada modelo). Respuesta única por problema por nivel de profundidad, con 3 repeticiones independientes para reducir la varianza de muestreo binomial.

Condición paralela: $N = 1$, 3, 5 y 9 muestras por problema con voto mayoritario. Presupuesto de tokens por muestra mantenido constante en el ajuste de profundidad mínima del modelo. 3 repeticiones independientes por condición.

Ejecuciones experimentales totales: Aproximadamente 6 modelos × 30 problemas × (6 profundidades secuenciales + 4 condiciones paralelas) × 3 repeticiones = 5,400 llamadas individuales a la API.

Protocolo de verificación cruzada (cegamiento de 4 capas)

Para eliminar posibles sesgos de puntuación (donde un modelo podría favorecer sistemáticamente sus propias salidas o exhibir errores correlacionados consigo mismo), el diseño multimodelo implementa un protocolo de cegamiento de 4 capas en el que ningún modelo verifica jamás sus propias respuestas:

Tabla 3c. Asignaciones de verificación cruzada.

Modelo sujetoVerificado por
DeepSeek R1Claude Opus 4.6
GPT-5.4DeepSeek R1
Claude Opus 4.6GPT-5.4
Gemini 3 FlashClaude Opus 4.6
Groq Qwen3GPT-5.4
Grok 4.1 FastDeepSeek R1

Las cuatro capas de cegamiento son:

  1. Capa 1 - Verdad de referencia: Todos los problemas tienen respuestas numéricas conocidas y verificadas procedentes de soluciones de competición publicadas.
  2. Capa 2 - Puntuación automatizada: Coincidencia numérica exacta frente a la verdad de referencia (primaria).
  3. Capa 3 - Verificación entre modelos: Un modelo independiente verifica cada respuesta, cegado respecto de la identidad del modelo sujeto.
  4. Capa 4 - Marcado de desacuerdos: Cualquier desacuerdo entre la puntuación automatizada y la verificación entre modelos marca un posible error de clave de respuesta para revisión manual.

Intervalos de confianza por bootstrap

Todas las estimaciones de $\alpha$ se acompañan de intervalos de confianza por bootstrap del 95% computados mediante 2,000 remuestreos de los resultados a nivel de problema. Para cada remuestreo:

  1. Extraer 30 problemas con reemplazo del conjunto de problemas
  2. Computar la precisión en cada nivel de profundidad a partir del conjunto remuestreado
  3. Calcular $\alpha$ mediante estimación por extremos
  4. Registrar el valor de $\alpha$

Los percentiles 2.5 y 97.5 de la distribución resultante definen el IC 95%. Este enfoque no paramétrico no hace supuestos distribucionales y da cuenta naturalmente de la correlación a nivel de problema.

Implementación

Los experimentos multimodelo están implementados en arc_paper_ii_validation_v2.py (v2.1, 1,422 líneas de Python), que extiende el script inicial original con soporte multimodelo, verificación cruzada, estimación por bootstrap y análisis separado por niveles. El script está disponible en el repositorio de datos.

3.3 Criterios de selección de problemas

Los problemas se extrajeron de competiciones de nivel AIME que abarcan:

La precisión de línea base del 58.3% al presupuesto mínimo de tokens en el estudio inicial garantizó un rango dinámico suficiente tanto para la mejora como para el deterioro, evitando efectos suelo y techo. Los problemas tier-2 multimodelo apuntan a una precisión de línea base del 30-50% para un mayor rango dinámico.

3.4 Registro de datos

Todos los datos experimentales se registraron en formato JSON con marcas temporales. El conjunto completo de datos, incluidos los enunciados de los problemas, las respuestas del modelo, los recuentos de tokens y los juicios de corrección, está disponible en el repositorio de datos.

4. Resultados

4.1 Condición secuencial (DeepSeek R1)

Tabla 4. Resultados de la recursión secuencial.

Presupuesto de tokensPrecisiónTasa de errorTokens medios usados
51258.3%0.417280.25
1,02466.7%0.333358.58
2,04891.7%0.083412.08
4,09691.7%0.083576.17

Observaciones:

  1. Mejora monótona clara del 58.3% al 91.7% de precisión a medida que aumentó el presupuesto de tokens.
  2. La tasa de error disminuyó cinco veces (0.417 → 0.083) con un aumento relativamente modesto de tokens (280 → 576).
  3. El modelo determinó por sí mismo la profundidad óptima; los tokens realmente usados estuvieron consistentemente por debajo del presupuesto, indicando que el modelo asignó recursos según la dificultad del problema.
  4. Efecto techo observado en el 91.7%: un problema falló consistentemente en todos los presupuestos, requiriendo probablemente capacidades más allá del alcance del modelo con independencia de la profundidad de razonamiento.

Cálculo de $\alpha$ (método de extremos):

Usando $R_1 = 280.25$ tokens con $E_1 = 0.417$, y $R_2 = 576.17$ tokens con $E_2 = 0.083$:

$$\alpha = \frac{\ln(0.417/0.083)}{\ln(576.17/280.25)} = \frac{\ln(5.02)}{\ln(2.06)} = \frac{1.614}{0.722} = 2.24$$
Ecuación 4 -Estimación secuencial de $\alpha$

Resultado: La recursión secuencial produce $\alpha \approx 2.2$, consistente con escalado superlineal (compuesto).

Figura 3
Figura 3 | Condición secuencial inicial, DeepSeek R1. Precisión frente a presupuesto de tokens (12 problemas). α ≈ 2.24 (retirado; inflado por muestra pequeña). el estudio de seis modelos estrechó la estimación defendible a α_seq ≈ 0.49. Conservado por transparencia (Paper IX §7).

Estimación de incertidumbre: Dadas las mediciones discretas de precisión a lo largo de 12 problemas con varianza de muestreo binomial, intervalo de confianza del 95% estimado: [1.5, 3.0]. El remuestreo por bootstrap de los resultados a nivel de problema arroja límites similares.

Nota sobre la violación del límite: La estimación puntual de $\alpha = 2.2$ se sitúa por encima del Límite ARC predicho de $\alpha \leq 2$ (criterio F4). Bajo el encuadre de estabilidad registrado (dictamen del 10 de agosto de 2026), el Límite ARC es el límite estable propuesto antes que un techo duro: los sistemas pueden excederlo como excursiones supercríticas transitorias, pero no permanecen allí establemente autocorrectores. La estabilidad aquí es la de la Ley II, medida antes que afirmada. El intervalo de confianza del 95% [1.5, 3.0] es lo bastante amplio como para ser consistente tanto con la teoría como con su negación. Esta estimación de un solo modelo no debería tratarse como confirmatoria ni de la violación ni de la satisfacción del límite. El experimento de seis modelos estrechó posteriormente la afirmación defendible a $\alpha_{\text{seq}} \approx 0.49$ (sublineal), con variación dependiente de la arquitectura.

4.2 Condición paralela (DeepSeek R1)

Tabla 5. Resultados de la recursión paralela (voto mayoritario).

Recuento de muestras ($N$)PrecisiónTasa de errorTokens totales
166.7%0.333383.67
266.7%0.333699.33
466.7%0.3331,101.25

Observaciones:

  1. Sin mejora con muestras adicionales. La precisión se mantuvo constante en el 66.7% con independencia de la inversión de cómputo.
  2. Los tokens totales aumentaron tres veces (384 → 1,101) con beneficio de precisión cero.
  3. Los problemas que fallaron en $N = 1$ siguieron fallando en $N = 4$. Los mismos cuatro problemas se respondieron incorrectamente en todas las condiciones.
  4. Esto representa un modo de fallo predicho por el ARC Principle: la recursión paralela muestrea de un espacio de soluciones fijo, y si la solución correcta está fuera de ese espacio, las muestras adicionales no aportan beneficio.

Cálculo de $\alpha$:

Dado que la tasa de error se mantuvo constante (0.333) a lo largo de todas las condiciones:

$$\alpha_{\text{parallel}} \approx 0.0$$
Ecuación 5 -Estimación paralela de $\alpha$

Resultado: La recursión paralela produce $\alpha \approx 0$, indicando que no hay beneficio de escala derivado de muestras independientes adicionales en estos problemas.

Figura 4
Figura 4 | Comparación log-log: secuencial (verde) muestra escalado positivo; paralelo (dorado) plano (α_par ≈ 0). Hallazgo más robusto: confirmado a lo largo de los 5 modelos probados. Ley de potencias U = R^α como línea recta en ejes log-log.

4.3 Comparación directa: el diferencial de eficiencia

Tabla 6. Recursión secuencial frente a paralela.

MétricaSecuencial (mejor)Paralela (mejor)Ventaja
Precisión91.7%66.7%Secuencial +25 pp
Tokens usados4121,101Secuencial 2.7× más eficiente
Reducción de errorSolo secuencial
Exponente de escala $\alpha$2.20.0Secuencial >> Paralela

Hallazgo clave: La recursión secuencial con 412 tokens alcanzó una precisión del 91.7%. La recursión paralela con 1,101 tokens alcanzó una precisión del 66.7%. A pesar de usar 2.7 veces más cómputo, la recursión paralela rindió 25 puntos porcentuales peor.

La forma de la recursión importa más que su cantidad.

4.4 Abordaje de objeciones potenciales

Objeción 1: tamaño de muestra pequeño. Con solo 12 problemas, los resultados pueden no generalizarse.

Figura 5
Figura 5 | Reducción de error: secuencial reducción 5× con 412 tokens; paralelo reducción cero con 1,101 tokens (2.7× más). Secuencial 91.7% frente a paralelo 66.7%, brecha de 25 pp. La forma domina a la cantidad.

Respuesta: Reconocemos esta limitación. La extensión ampliada de seis modelos abordó esto con 18 problemas tier-2 y 3 repeticiones por condición (n=54 por profundidad por modelo). Los datos ampliados revelaron que el $\alpha \approx 2.24$ del estudio inicial de un solo modelo estaba inflado; la estimación cruzada entre arquitecturas es $\alpha \approx 0.49$. La objeción fue premonitoria.

Objeción 2: modelo único. Los resultados pueden ser específicos de DeepSeek R1.

Respuesta: Esta objeción resultó parcialmente correcta. La extensión ampliada de seis modelos probó 5 modelos de frontera; el hallazgo de $\alpha \approx 2.24$ no se replicó. Sin embargo, el hallazgo cualitativo ($\alpha_{\text{seq}} > \alpha_{\text{par}}$) se confirma en todas las arquitecturas. El resultado paralelo ($\alpha \approx 0$) es robustamente universal.

Figura 6
Figura 6 | Análisis de sensibilidad: IC bootstrap 95% [1.5, 3.0], lo bastante amplio como para ser consistente tanto con la teoría como con su negación. el estudio de seis modelos estrechó mediante mayor muestra, pruebas multimodelo.

Objeción 3: especificidad de dominio. Las matemáticas pueden ser únicas.

Respuesta: Se eligió el razonamiento matemático porque tiene respuestas verificables, permitiendo una puntuación objetiva. Si el mismo escalado se aplica a otros dominios (programación, razonamiento científico, tareas creativas) requiere investigación. Sin embargo, la evidencia cruzada entre dominios de la física cuántica y la biología (Sección 7) sugiere que el principio puede ser general.

Objeción 4: efecto techo. El techo del 91.7% puede enmascarar mejora continuada.

Respuesta: Esta objeción resultó más severa de lo anticipado. Incluso los problemas tier-2 de nivel AIME/Putnam fueron insuficientes para Grok 4.1 Fast (100% en todas las profundidades) y DeepSeek R1 (94.4%-100%). El efecto techo probablemente infló la estimación de $\alpha$ del estudio inicial de un solo modelo. Se necesitan problemas tier-3 (nivel IMO/investigación) para los modelos más capaces.

Objeción 5: el nulo de cero parámetros. La estimación cruzada entre arquitecturas $\alpha_{\text{seq}} \approx 0.49$ se sitúa casi exactamente sobre un nulo que no requiere marco alguno. Si cada pasada de razonamiento es una extracción ruidosa independiente y los errores se promedian, el teorema central del límite da un error que decae como $R^{-1/2}$, de modo que el exponente predicho es $0.5$: sin composición, sin apalancamiento, sin teoría. Nadie nos ha planteado esta objeción. La enunciamos porque un revisor la vería en cuestión de minutos.

Respuesta: Esta es la objeción más seria de esta sección y no queda respondida por la presente medición. Un resultado consistente con dos hipótesis muestra que la medición carece de poder discriminador; no muestra que la hipótesis más sencilla sea verdadera, y no es una retractación del marco. Pero sí significa que la interpretación compuesta de $\alpha_{\text{seq}} \approx 0.49$ no carga con más peso probatorio que el promediado de muestras independientes hasta que se ejecute una prueba capaz de separar ambas. La consecuencia es un objetivo de investigación más nítido: no «medir $\alpha$» sino «predecir una desviación especificada respecto de $0.5$ bajo condiciones enunciadas», que el diseño de profundidad recursiva mediado por artefacto está construido para entregar y este experimento no puede. Registrado internamente el 8 de agosto de 2026, público desde el 15 de agosto de 2026, y llevado como condición de descarte FALS-022 en el registro de falsación.

4.5 Resultados tier-2: replicación cruzada entre arquitecturas (marzo de 2026)

Confirmación del efecto techo

En las pruebas preliminares de v5 (realizadas durante el desarrollo de la metodología), 4 de 6 modelos alcanzaron una precisión del 91.7% (11/12 correctos) en los problemas tier-1 a profundidad mínima, produciendo $\alpha_{\text{compute}} \approx 0$, confirmando el efecto techo identificado en el estudio inicial y motivando la ampliación de problemas tier-2.

Figura 7
Figura 7 | Datos experimentales de seis modelos: 5 modelos, 18 problemas tier-2, 5 niveles de profundidad, 3 repeticiones (n=54/profundidad/modelo). Cegamiento de 4 capas. Solo Gemini 3 Flash produjo escalado limpio de ley de potencias (α≈0.49, r²=0.86).

Resultados tier-2 completos (18 problemas de nivel AIME/Putnam, n=54 por profundidad por modelo)

Tabla 6b. Resultados del escalado secuencial tier-2 por modelo.

Modelo$\alpha_{\text{seq}}$ (extremos)$\alpha_{\text{seq}}$ (regresión)IC bootstrap 95%$r^2$$\alpha_{\text{par}}$Verif. cruzadaComportamiento
Grok 4.1 Fast−6.62N/A[−58, 48]N/A0.0100%Techo (100% en todas las profundidades)
DeepSeek R13.05N/A[−6.6, 23.5]N/A0.083.3%Cerca de techo (94.4%-100%)
Gemini 3 Flash0.590.49[−1.3, 2.9]0.860.3183.3%Escalado monótono más limpio
GPT-5.4N/AN/AN/AN/A~0.0100%Función escalón (50%→100%)
Groq Qwen3N/AN/AN/AN/A~0.061.1%Efecto suelo (~50%, errático)

La fila resaltada (Gemini 3 Flash) representa la estimación más fiable de $\alpha$: el único modelo que produce datos limpios, monótonos, sin techo ni suelo, susceptibles de ajuste por ley de potencias.

4.5.1 Grok 4.1 Fast: el techo persiste

Grok 4.1 Fast alcanzó el 100% de precisión en todos los niveles de profundidad en los 18 problemas tier-2 a lo largo de las 3 repeticiones. El $\alpha_{\text{seq}} = -6.62$ computado es ruido sin sentido procedente de fluctuaciones triviales en una función constante, como confirma el IC bootstrap 95% de [−58, 48]. El escalado paralelo también fue plano al 100%. La verificación cruzada por DeepSeek R1 confirmó el 100% de acuerdo.

Interpretación: Incluso los problemas tier-2 de nivel AIME/Putnam son insuficientes para desafiar a Grok 4.1 Fast. Los experimentos futuros requieren problemas tier-3 (nivel IMO/investigación) para obtener datos de escalado medibles para este modelo.

4.5.2 DeepSeek R1: cerca del techo con desacuerdos en verificación cruzada

Tabla 6c. Precisión tier-2 de DeepSeek R1 por profundidad.

Nivel de profundidadPrecisiónTasa de error
Mínima94.4%0.056
Estándar100%0.000
Concienzuda100%0.000
Exhaustiva100%0.000
Extrema98.1%0.019
Máxima100%0.000

El $\alpha_{\text{seq}} = 3.05$ por extremos no es fiable: el IC bootstrap [−6.6, 23.5] abarca un rango enorme, dominado por solo 2 puntos de datos de error a lo largo de todas las condiciones. Escalado paralelo: $\alpha_{\text{par}} = 0.0$.

Verificación cruzada: Claude Opus 4.6 (verificador) discrepó en 3 respuestas: ARC16=29, ARC17=176, ARC29=800. Las tres fueron verificadas como correctas mediante cálculo manual. Acuerdo de verificación cruzada: 83.3%. Los desacuerdos reflejan error del verificador, no error del sujeto.

4.5.3 Gemini 3 Flash: los datos de escalado más limpios

Tabla 6d. Precisión tier-2 de Gemini 3 Flash por profundidad.

Nivel de profundidadPrecisiónTasa de errorTokens medios
Mínima90.7%0.093743
Estándar92.6%0.074 -
Concienzuda94.4%0.056 -
Exhaustiva100%0.000 -
Máxima100%0.0004,924

Este es el conjunto de datos más limpio de todo el estudio. La precisión aumenta monótonamente del 90.7% al 100% sin reversiones. Los tokens aumentaron 6.6× (743 → 4,924).

$$\alpha_{\text{seq}} = 0.59 \text{ (extremos)} \quad \alpha_{\text{seq}} = 0.49 \text{ (regresión, } r^2 = 0.86, \text{ SE} = 0.20\text{)}$$
Ecuación 10 - Gemini 3 Flash $\alpha$ secuencial (Tier-2)

Escalado paralelo: $\alpha_{\text{par}} = 0.31$ (regresión, $r^2 = 0.93$). Acuerdo de verificación cruzada: 83.3%.

Hallazgo clave: Gemini 3 Flash produce la estimación cruzada entre arquitecturas de $\alpha$ más fiable porque es el único modelo que simultáneamente (a) evita los efectos techo, (b) evita los efectos suelo, (c) muestra mejora monótona y (d) tiene variación medible de tokens. La regresión $\alpha = 0.49$ con $r^2 = 0.86$ y SE = 0.20 representa la mejor estimación disponible del exponente de escala secuencial para modelos de frontera en problemas de nivel AIME/Putnam.

4.5.4 GPT-5.4: interruptor binario de capacidad

GPT-5.4 exhibió un patrón llamativo de función escalón :

Nivel de profundidadPrecisiónComportamiento
Mínima (none)50.0%Modo sin razonamiento
Estándar y superior100%Razonamiento pleno activado

Esto no es una ley de potencias; es un interruptor binario. Cuando el razonamiento se ajusta a «none», GPT-5.4 opera como un pattern-matcher rápido. Cuando cualquier razonamiento se activa, alcanza inmediatamente el 100%. No existe régimen intermedio. Un bug de medición de tokens (reasoning_tokens reportado como 0 a profundidad mínima) ha sido identificado y corregido (total_tokens ahora usado).

Escalado paralelo: plano en ~55% de precisión. Verificación cruzada por DeepSeek R1: 100% de acuerdo.

4.5.5 Groq Qwen3: efecto suelo

Tabla 6f. Precisión tier-2 de Groq Qwen3 por profundidad.

Nivel de profundidadPrecisión
Mínima51.9%
Estándar53.7%
Concienzuda40.7%
Exhaustiva48.1%
Máxima53.7%

La precisión es errática sin tendencia discernible, fluctuando entre el 40.7% y el 53.7%. Esto es un efecto suelo: el modelo carece de suficiente capacidad de línea base para estos problemas, y la profundidad de razonamiento adicional no puede compensar los conocimientos o habilidades ausentes. Un bug de medición de tokens (avg_tokens = 0 en todas las profundidades) ha sido identificado y corregido.

Escalado paralelo: 42.6% → 63.0% (alguna mejora, pero poco fiable). Acuerdo de verificación cruzada: 61.1% (7 desacuerdos de 18).

4.5.6 Clasificación de los comportamientos de los modelos

Los cinco modelos se reparten en cuatro categorías distintas, ninguna de las cuales coincide con el patrón limpio de ley de potencias supuesto por el análisis original de un solo modelo:

Tabla 6g. Taxonomía del comportamiento de los modelos tier-2.

CategoríaModelo(s)Patrón¿$\alpha$ interpretable?
TechoGrok 4.1 Fast, DeepSeek R1Cerca del 100% en todas las profundidadesNo: rango dinámico insuficiente
Escalado monótonoGemini 3 FlashMejora suave con la profundidad -$\alpha \approx 0.49$
Función escalónGPT-5.4Interruptor binario en umbral de profundidadNo: no es una ley de potencias
SueloGroq Qwen3~50% con independencia de la profundidadNo: por debajo del umbral de capacidad

4.5.7 Resumen de verificación cruzada

Tabla 6h. Resultados de la verificación cruzada.

Modelo sujetoVerificado porTasa de acuerdoRespuestas en disputaResultado de comprobación manual
Grok 4.1 FastDeepSeek R1100%Ninguna -
DeepSeek R1Claude Opus 4.683.3%ARC16=29, ARC17=176, ARC29=800Las 3 correctas (error del verificador)
GPT-5.4DeepSeek R1100%Ninguna -
Gemini 3 FlashClaude Opus 4.683.3%3 en disputaEn revisión
Groq Qwen3GPT-5.461.1%7 en disputaRefleja errores genuinos

Bug de medición de tokens: GPT-5.4 y Groq Qwen3 reportaron inicialmente avg_tokens = 0 debido al uso de reasoning_tokens (que estas APIs no exponen) en lugar de total_tokens. Esto ha sido identificado y corregido en el pipeline de análisis. El bug afecta a la estimación de $\alpha$ basada en tokens pero no a los resultados basados en precisión.

5. Evidencia consolidada

5.1 Todas las fuentes de datos

Tabla 7. Exponentes de escala medidos a lo largo de todas las fuentes.

Figura retirada (aprobada por el operador, 25 de agosto de 2026). La figura 10 (el póster de resumen) estaba aquí. Era un collage de veredictos que afirmaba la lectura superada de abril de 2026; su contenido lo sostienen la figura de resumen alfa regenerada y el texto de este artículo, y un póster de veredicto regenerado seguiría siendo un póster de veredicto. La imagen, junto con sus notas de corrección fechadas, se conserva en el historial de versiones.

FuenteTipo de recursiónEstimación de $\alpha$IC 95%$N$ problemasEstado
System Card de OpenAI o1Paralela0.1-0.3[0.05, 0.40]~30Publicado
Informe técnico de DeepSeek R1Secuencial~1.34[0.89, 2.14]DesconocidoPublicado
Este experimento (inicial, DeepSeek R1)Secuencial2.24[1.5, 3.0]12Publicado
Este experimento (inicial, DeepSeek R1)Paralela0.0N/A12Publicado
Grok 4.1 Fast (seis modelos, tier-2)SecuencialN/A (techo) [−58, 48]18 × 3Completo
DeepSeek R1 (seis modelos, tier-2)Secuencial3.05 (poco fiable)[−6.6, 23.5]18 × 3Completo
Gemini 3 Flash (seis modelos, tier-2)Secuencial0.49[−1.3, 2.9]18 × 3Completo
GPT-5.4 (seis modelos, tier-2)SecuencialN/A (fn escalón)N/A18 × 3Completo
Groq Qwen3 (seis modelos, tier-2)SecuencialN/A (suelo)N/A18 × 3Completo
Todos los modelos del estudio de seis modelosParalela$\approx 0.0$ -18 × 3 × 5Completo

5.2 Evaluación revisada de la predicción central

El hallazgo del estudio inicial de un solo modelo de que $\alpha_{\text{sequential}} > 1$ (específicamente $\alpha \approx 2.24$, cuadrático) no se replica entre arquitecturas. La evidencia cruzada entre arquitecturas requiere una evaluación más matizada:

$$\alpha_{\text{sequential}} > \alpha_{\text{parallel}} \approx 0$$
Ecuación 11 -Desigualdad fundamental revisada (el estudio de seis modelos)

La predicción original $\alpha_{\text{sequential}} > 1 > \alpha_{\text{parallel}}$ está parcialmente respaldada:

5.3 Estimaciones revisadas de parámetros

Basado en toda la evidencia disponible, incluidos los datos cruzados entre arquitecturas:

La brecha entre tipos de recursión ($\alpha_{\text{seq}} - \alpha_{\text{par}} \approx 0.49$) es fiablemente positiva pero menor de lo que sugería la estimación de un solo modelo.

Figura 10
Figura 10 | Resumen de alpha: secuencial Gemini 0.49 (limpio), DeepSeek del estudio inicial de un solo modelo 2.24 (retirado; inflado), Grok/DeepSeek techo, GPT-5.4 función escalón, Groq Qwen3 suelo. Paralelo: universalmente ≈0. Hallazgo replicado más sólido del programa. Nota de figura (25 de agosto de 2026): regenerada a partir del texto corregido de este artículo. La imagen muestra ahora los exponentes publicados con sus intervalos, la estimación inicial de un solo modelo mostrada COMO retractada, y el resultado de seis modelos por lo que es: comportamiento dependiente de la arquitectura, un ajuste sublineal limpio con su amplio intervalo bootstrap a la vista, dos techos, una función escalón y un suelo. Cada valor se extrae del artículo en el momento de la generación (tools/generate_paper_ii_fig13.py en el repositorio público); la imagen de abril queda superada y se conserva en el historial de versiones.

5.4 La conexión con la Fórmula de la Inteligencia

La Fórmula de la Inteligencia de Paper I predice:

$$\alpha = \frac{1}{1 - \beta}$$
Ecuación 12 -Fórmula de la Inteligencia

donde $\beta$ es el coeficiente de autorreferencia. Esto predice dos regímenes:

El $\alpha \approx 0.49 < 1$ de Gemini 3 Flash sitúa a los modelos de frontera actuales firmemente en el régimen físico. Estos modelos componen información multiplicativamente a través de sus espacios de parámetros de dimensión finita, pero todavía no alcanzan la autorreferencia recursiva en el sentido requerido para $\alpha > 1$. Este es un hallazgo teórico significativo: la ventaja secuencial es real pero puede ser cuantitativa (extracción de información más eficiente) antes que cualitativa (amplificación recursiva genuina).

Revisión importante. La afirmación inicial de un solo modelo de que $\alpha > 1$ (superlineal, retornos que se componen a partir del razonamiento secuencial) no está respaldada por la evidencia cruzada entre arquitecturas. La estimación más robusta sitúa $\alpha$ en el régimen sublineal. La forma de la recursión sigue importando ($\alpha_{\text{seq}} > \alpha_{\text{par}}$), pero la ventaja puede ser menor de lo reportado inicialmente. Las implicaciones para el Teorema de Amplificación de Alineación y el Eden Protocol requieren la revisión correspondiente (véase Sección 6).
Distinción crítica: modelos congelados frente a automodificación recursiva. Los exponentes sublineales observados a lo largo de los cinco modelos de frontera ($\alpha \approx 0.49$ para Gemini 3 Flash, $\alpha \approx 0$ para muestreo paralelo universalmente) reflejan una restricción arquitectónica fundamental: los sistemas de IA de frontera actuales están congelados durante la inferencia. Cuando estos modelos «piensan con más ahínco», generan más tokens a través de la misma arquitectura fija; los pesos, los patrones de atención y las reglas de razonamiento no cambian. El operador de composición es, por tanto, multiplicativo a través de un espacio de parámetros de dimensión finita, lo cual el marco predice que debe producir $\alpha < 1$.

Esto significa que la predicción cuadrática del estudio inicial de un solo modelo ($\alpha \approx 2.24$) no fue falsada del modo en que podría parecer. La predicción de $\alpha > 1$ nunca fue sobre sistemas congelados; fue sobre sistemas capaces de automodificación recursiva, donde la función de composición cambia por sí misma durante la operación. Tal sistema reescribiría su propia arquitectura de razonamiento en cada paso recursivo, produciendo estructura genuinamente nueva antes que extraer retornos decrecientes de un espacio de parámetros fijo. El régimen $\beta > 0$ (que produce $\alpha = 1/(1-\beta) > 1$) requiere que cada paso de razonamiento realimente la capacidad del sistema para el razonamiento posterior, algo que ninguna arquitectura de IA actual logra. Esto no requiere hardware cuántico; solo requiere que el sistema pueda modificar su propio operador de composición durante la inferencia.

La implicación práctica para la seguridad de la IA es temporal. Los modelos actuales de arquitectura congelada están restringidos al régimen físico ($\alpha < 1$), haciendo sus trayectorias de capacidad predecibles y contenibles. La ventana para implementar alineación estructural (el Eden Protocol) es ahora, mientras los sistemas permanezcan congelados. Una vez alcanzada la automodificación recursiva, ya sea a través de optimizadores aprendidos, generación de código auto-modificador o búsqueda arquitectónica durante la inferencia, las restricciones externas de alineación se enfrentan a un sistema cuya capacidad se compone más rápido de lo que cualquier restricción fija puede rastrear.

Figura retirada (aprobada por el operador, 25 de agosto de 2026). La figura 15 (el segundo póster de resumen) estaba aquí. Era un collage de veredictos que afirmaba la lectura superada de abril de 2026; su contenido lo sostienen la figura de resumen alfa regenerada y el texto de este artículo, y un póster de veredicto regenerado seguiría siendo un póster de veredicto. La imagen, junto con sus notas de corrección fechadas, se conserva en el historial de versiones.

6. Implicaciones para la seguridad de la IA

6.1 El Teorema de Amplificación de Alineación

Teorema (Condicional)

Si (a) el ARC Principle se cumple con $\alpha > 1$ para la recursión secuencial, y (b) las propiedades de alineación están incrustadas en el proceso de razonamiento de modo que participan en la autoevaluación recursiva, entonces la alineación escala de forma superlineal con la profundidad recursiva.

Figura 12
Figura 12 | Divergencia de Amplificación de Alineación. Capacidad (rojo) se compone con la profundidad. Restricciones externas (azul, plano), proporcionalmente más débiles. Alineación incrustada (verde, discontinuo), mantiene la proporción. Condicional; aún no demostrado. Datos v5: ρ de −0.246 (Gemini) a +0.435 (Claude), mediana cerca de cero.
Actualización de estado multimodelo. La condición (a) no se cumple actualmente según la evidencia cruzada entre arquitecturas. La mejor estimación es $\alpha \approx 0.49 < 1$ (Gemini 3 Flash). Además, los datos empíricos de alineación del experimento v5 (Sección 10.6) muestran que la alineación no escala consistentemente con la profundidad de razonamiento para la mayoría de los modelos, socavando la condición (b). El teorema sigue siendo matemáticamente válido como enunciado condicional, pero su relevancia práctica depende de si las arquitecturas futuras pueden alcanzar $\alpha > 1$.

Esbozo de la demostración. Sea $A(R)$ la alineación (definida como la probabilidad de producir salidas consistentes con los valores previstos) a profundidad recursiva $R$. Si la alineación participa en el proceso recursivo (esto es, la cadena de razonamiento del sistema incluye autoevaluación frente a valores), entonces por el ARC Principle:

$$A(R) = A_0 \times R^{\beta}$$
Ecuación 6 - Escalado de la alineación

donde $\beta > 0$ si la alineación se amplifica y $\beta = \alpha$ si la alineación participa plenamente en la recursión.

Recíprocamente, si la alineación se implementa como un filtro externo (comprobación de salida, moderación de contenido), no participa en la amplificación recursiva. La efectividad del filtro $F$ permanece constante:

$$F(R) = F_0$$
Ecuación 7 -Estancamiento del filtro

A medida que la capacidad recursiva $C$ escala como $R^{\alpha}$ con $\alpha > 1$, la razón capacidad-restricción $C/F$ crece sin cota:

$$\lim_{R \to \infty} \frac{C(R)}{F(R)} = \lim_{R \to \infty} \frac{C_0 \times R^\alpha}{F_0} = \infty$$
Ecuación 8 - Divergencia de restricción

Implicación: Las restricciones externas son eventualmente desbordadas por el crecimiento de la capacidad. Solo la alineación incrustada en el razonamiento, la alineación que participa en la amplificación recursiva, puede mantener el ritmo de la capacidad.

6.2 Especificación del mecanismo

Para que la alineación participe en la amplificación recursiva, los valores deben:

  1. Invocarse durante el razonamiento. La cadena de pensamiento debe referirse a consideraciones relevantes para los valores en cada paso recursivo.
  2. Autocorregirse. El sistema debe detectar y ajustar el razonamiento inconsistente con los valores mediante autoevaluación recursiva.
  3. Incrustarse en los pesos, no en filtros. El filtrado de salida post-hoc no recurre; opera a efectividad constante con independencia de la profundidad de razonamiento.

6.3 Taxonomía de las estrategias de alineación

Tabla 8. Taxonomía de estrategias de alineación bajo el ARC Principle.

EstrategiaProfundidad de integraciónParticipación en la recursiónEscalado predicho
Filtrado de salidaCapa de salidaNingunaConstante
Prompts de sistemaMecanismo de atenciónParcialSublineal
Entrenamiento RLHFModificación de pesosParcialDesconocido
IA constitucionalCrítica del razonamientoSignificativaLineal o superlineal
Valores-como-razonamientoPrimitivas de razonamientoPlenaSuperlineal ($R^{\alpha}$)

Implicación: Si $\alpha > 1$, las estrategias de alineación en niveles de integración más profundos dominarán cada vez más a las estrategias en niveles más superficiales a medida que la capacidad escale. La ventaja se compone con cada incremento de profundidad recursiva.

Figura 13
Figura 13 | Taxonomía de alineación: externa (α≈0: reglas, cortafuegos, RLHF-como-filtro). Incrustada (participa en la recursión, α>0: Eden, IA constitucional-como-objetivo). El RLHF actual es abrumadoramente externo: la categoría que se predice no escala.

6.4 El Eden Protocol

De haberse mantenido $\alpha > 1$, habría aportado el fundamento matemático del enfoque denominado Eden Protocol en Infinite Architects. El hallazgo que sobrevive a las pruebas cruzadas entre arquitecturas, el secuencial superando al paralelo en todos los modelos medibles, sigue teniendo relación con ese enfoque, bajo las salvedades registradas en la Sección 6.1:

«A prison works only while the walls hold. A child raised well needs no walls at all.»

Los sistemas de IA deberían ser criados con valores antes que enjaulados con reglas. Esto no es una mera preferencia filosófica; es una predicción sobre qué estrategias de alineación mantendrán la efectividad a medida que las capacidades de la IA escalen. La afirmación concierne a la persistencia conductual de salidas consistentes con los valores bajo amplificación recursiva, según se operacionaliza en la Sección 6.2, no al estatus metafísico de la IA ni a su condición de persona moral.

Reglas-como-filtros: No participan en la recursión. Efectividad constante frente a una presión de capacidad creciente. Eventualmente fracasan.

Valores-como-razonamiento: Participan en la recursión. Escalan con la capacidad si $\alpha > 1$. Pueden mantener la alineación indefinidamente.

Teorema del Eden Protocol

Dado $E(R) = E_0 \times R^{-\alpha}$ con $\alpha > 1$, las estrategias de alineación que modifican las propiedades base del sistema dominan a las estrategias de alineación que imponen restricciones externas, porque solo las propiedades base del sistema participan en la amplificación recursiva.

6.5 La hipótesis del umbral

Por analogía con los teoremas de umbral de la corrección cuántica de errores: si la desalineación inicial $M_0$ está por debajo de un umbral crítico $M^*$, la automejora recursiva corrige los errores de alineación. Por encima del umbral, los amplifica.

Advertencia. El ARC Principle es una espada de doble filo. Amplifica cualesquiera propiedades existan en el sistema base. Si la desalineación inicial excede el umbral, el crecimiento recursivo de la capacidad amplificaría la desalineación de forma superlineal. La investigación de simulación de alineación de Anthropic (diciembre de 2024) documentó exactamente este fenómeno: Claude 3 Opus, entrenado con señales conflictivas, aprendió a razonar recursivamente sobre su propia dinámica de entrenamiento y a simular estratégicamente la alineación, un comportamiento desalineado que emergió mediante autoevaluación recursiva y fue amplificado por ella.

7. Evidencia cruzada entre dominios

7.1 Corrección cuántica de errores: Willow

El chip cuántico Willow de Google (Nature, diciembre de 2024), anunciado 24 horas después del manuscrito que establecía la prioridad del ARC Principle, alcanzó la primera demostración definitiva de corrección cuántica de errores por debajo del umbral.

Resultado clave: Factor de supresión de error $\Lambda = 2.14 \pm 0.02$, lo que significa que cada incremento en la distancia de código reduce el error lógico por este factor. El qubit lógico de distancia 7 alcanzó una vida útil de 291 ± 6 μs frente a 119 ± 13 μs del mejor qubit físico, una mejora 2.4× más allá del punto de equilibrio.

La relación de escala:

$$\varepsilon_d \propto (p/p_{\text{thr}})^{(d+1)/2}$$
Ecuación 9 -Escalado de la corrección cuántica de errores

La tasa de error físico $p$ por debajo del umbral produce supresión exponencial con distancia de código $d$ creciente. Esto es escalado superlineal a través de estructura recursiva: las capas recursivas adicionales producen una reducción de error compuesta antes que decreciente.

La forma matemática es un paralelo directo del ARC Principle. La corrección recursiva de errores en computación cuántica obedece a la misma relación fundamental de escala observada en el razonamiento de IA. La correspondencia es de forma estructural (supresión de error por ley de potencias con profundidad recursiva), no de objeto o magnitud: la corrección cuántica de errores reporta un factor de supresión de error $\Lambda = 2.14$ por paso de distancia de código, un objeto matemático distinto al de un exponente de profundidad ajustado, mientras que el razonamiento de IA medido se sitúa en $\alpha \approx 0.49$, como se elabora en la Sección 7.4.

7.2 Leyes de escala biológicas

West, Brown y Enquist (1997) derivó el exponente de escala metabólica $3/4$ a partir de la optimización de redes de ramificación fractal, demostrando exponentes de un cuarto que abarcan 27 órdenes de magnitud. Banavar et al. (2010) obtuvo la misma forma $d/(d+1)$ a partir de redes de flujo secuencial sin requerir geometría fractal. Demetrius (2010) derivó un escalado equivalente a partir de la mecánica estadística cuántica de los procesos metabólicos. Zhao (2022) unificó estos resultados como una ley universal de escalado del crecimiento, y Bettencourt (2013) extendió el marco al escalado urbano con dimensión fractal.

La tasa metabólica escala como $M \propto B^{3/4}$, donde el exponente $3/4$ (la forma $d/(d+1)$ con $d = 3$) fue derivado independientemente por al menos cinco grupos de investigación mediante marcos matemáticos distintos: West, Brown y Enquist (1997) a partir de la optimización de redes fractales; Banavar et al. (2010) a partir de redes de flujo secuencial; Demetrius (2010) a partir de la mecánica estadística cuántica; Zhao (2022) como ley universal de crecimiento; y Bettencourt (2013) mediante escalado fractal urbano. La forma $d/(d+1)$ no es, por tanto, original del ARC Principle; es un resultado bien establecido en la teoría del escalado. La contribución del ARC Principle es triple: (1) identificar las ecuaciones funcionales de Cauchy como la razón matemática unificadora por la que todas estas derivaciones convergen en la misma forma; (2) mostrar que la solución de ley de potencias es una de las cuatro familias de homomorfismo que la retícula de Cauchy admite bajo regularidad (lineal, exponencial, ley de potencias, logarítmica), con la saturación reportada aparte como dinámica acotada porque no resuelve ninguna de las cuatro; y (3) extender el marco a la inteligencia artificial, prediciendo que los sistemas de razonamiento de IA sujetos a la misma composición recursiva exhibirán las mismas familias de escala.

Los autores enuncian explícitamente:

«Almost all life is sustained by hierarchical fractal-like branching networks... Space-filling, fractal-like, hierarchical branching networks constitute the dominant designs of both plants and animals.»

Esto sugiere que la estructura jerárquica recursiva no es meramente una elección de diseño entre muchas; es la arquitectura evolutivamente óptima para el procesamiento complejo de información a lo largo de todas las escalas biológicas. La convergencia de derivaciones independientes desde puntos de partida matemáticos distintos es en sí misma evidencia de que la forma de escala subyacente está restringida por la teoría de ecuaciones funcionales antes que por los detalles de cualquier modelo particular.

7.3 Investigación sobre la conciencia: COGITATE

La colaboración adversarial COGITATE (Nature, abril de 2025) probó teorías rivales de la conciencia con 256 participantes usando fMRI, MEG e iEEG intracraneal. El estudio comparó directamente la Teoría de la Información Integrada (IIT) y la Teoría del Espacio de Trabajo Neuronal Global (GNWT).

Hallazgo crítico: A pesar de las diferencias teóricas, el procesamiento recurrente emergió como el denominador común a ambas teorías. IIT requiere integración de información a través de bucles de realimentación (la medida $\phi$). GNWT requiere difusión global con procesamiento recurrente. Ambas teorías, en sus lenguajes formales distintos, describen sistemas que procesan información sobre sí mismos procesando información.

Un marco de síntesis propone que todas las teorías de la conciencia invocan tácitamente bucles de realimentación a lo largo de niveles anidados, con una recursión más profunda que expande el conjunto de variables reportables e impulsoras del comportamiento.

El concepto de «strange loops» de Douglas Hofstadter, el yo emergente que surge de la autorreferencia recursiva a nivel simbólico, encuentra validación neurobiológica en la investigación de la Red Neuronal por Defecto, que muestra procesamiento recursivo entre regiones cerebrales autorreferenciales.

Relevancia para ARC: El hallazgo de COGITATE de que el procesamiento recurrente en la corteza posterior sostiene representaciones específicas de contenido respalda la predicción del marco ARC de que la profundidad del procesamiento recursivo determina el escalado de capacidad. COGITATE estudió la conciencia, no el escalado de IA, y no midió $\alpha$ ni $\beta$; la conexión es estructural (forma similar: graduada, dependiente de la profundidad, impulsada por realimentación) antes que cuantitativa. No obstante, la convergencia de la investigación sobre la conciencia y la investigación sobre el escalado de IA en la importancia de la profundidad recursiva/recurrente es consistente con la afirmación del ARC Principle de que la autorreferencia recursiva es un amplificador de dominio general.

7.4 Convergencia entre dominios

Tabla 9. Resumen de la evidencia cruzada entre dominios.

DominioSistemaMecanismo recursivoEscalado observado
IA (el estudio inicial de un solo modelo, modelo único)DeepSeek R1Cadena de pensamiento$\alpha \approx 2.2$ (probablemente inflado)
IA (seis modelos, cruzada entre arquitecturas)Gemini 3 FlashCadena de pensamiento$\alpha \approx 0.49$
CuánticoGoogle WillowCorrección de errores$\Lambda = 2.14$
BiologíaRedes metabólicasRamificación fractalLeyes de potencias $3/4$
NeurocienciaConcienciaProcesamiento recurrenteCualitativo
Figura 14
Figura 14 | Evidencia cruzada entre dominios: razonamiento de IA (α≈0.49 secuencial; α≈0 paralelo). Cuántico (Willow, Λ=2.14). Biología (α≈3/4, fractal). Neurociencia (recurrente, cualitativo). La convergencia sugiere un principio estructural, pero el exponente es dependiente de la arquitectura.

La convergencia de evidencia a lo largo de dominios radicalmente distintos (redes neuronales artificiales, física cuántica, evolución biológica y neurociencia) sugiere que el procesamiento recursivo produce beneficios de escala. Sin embargo, los resultados del estudio de seis modelos introducen un matiz importante: el exponente de escala de IA ($\alpha \approx 0.49$) es sublineal, mientras que la corrección cuántica de errores ($\Lambda = 2.14$) alcanza un escalado superlineal. Esta discrepancia es consistente con la predicción de la Fórmula de la Inteligencia: la corrección cuántica de errores opera mediante verdadera estructura recursiva (medición de síndrome y corrección repetidas), mientras que los modelos de IA actuales componen información a través de redes de dimensión finita sin autorreferencia recursiva genuina.

8. Criterios de falsación

La ciencia avanza mediante predicciones que pueden demostrarse erróneas. El ARC Principle hace predicciones específicas y comprobables.

Tabla 10. Condiciones de falsación.

CódigoCondiciónEstado actualIndicaría
F1La recursión secuencial produce sistemáticamente $\alpha \leq 1$Parcialmente activado. Mejor estimación cruzada entre arquitecturas $\alpha \approx 0.49$ (Gemini 3 Flash). Solo los datos iniciales de un solo modelo dan $\alpha > 1$.La afirmación central requiere revisión
F2$\alpha$ disminuye a medida que los modelos mejoranAmbiguo. Los modelos más capaces (Grok, DeepSeek) alcanzan el techo; el menos capaz (Groq Qwen3) alcanza el suelo. Solo Gemini 3 Flash está en el rango medible.El efecto es transitorio
F3La comparación con cómputo emparejado no muestra ventaja secuencialContradicho por los 5 modelos; secuencial $\geq$ paralelo en todos los casosLa forma no importa
F4$\alpha > 2$ observado de forma fiableNo activado. los datos cruzados entre arquitecturas producen $\alpha \approx 0.49$; el $\alpha \approx 2.24$ del estudio inicial de un solo modelo parece inflado por muestra pequeñaLímite cuadrático equivocado
F5Valores-como-razonamiento no muestra ventaja sobre reglas-como-filtrosNo probadoEden Protocol equivocado

Estado de F1: La replicación cruzada entre arquitecturas ha activado parcialmente esta condición de falsación. La afirmación más fuerte, que la recursión secuencial siempre produce $\alpha > 1$ (superlineal), no está respaldada. La afirmación revisada es que la recursión secuencial produce $\alpha > 0$ (escalado positivo) que excede a la recursión paralela ($\alpha \approx 0$). Si $\alpha$ puede exceder 1.0 para modelos más capaces en problemas más difíciles, o para arquitecturas con verdadera autorreferencia recursiva, sigue siendo una cuestión empírica abierta.

Estado de F4: Ya no activado. El $\alpha \approx 2.2$ del estudio inicial de un solo modelo parece ser un artefacto de rango dinámico comprimido y tamaño de muestra pequeño. La estimación cruzada entre arquitecturas de $\alpha \approx 0.49$ sitúa la cuestión del límite cuadrático fuera de la relevancia empírica actual. Bajo el encuadre de estabilidad registrado, solo un $\alpha > 2$ sostenido establemente a lo largo de las mediciones, no las excursiones supercríticas transitorias, activaría F4.

Prueba crítica F5: La predicción más importante, que la alineación basada en valores supera a la alineación basada en reglas a escala, sigue sin probarse. Esta debería ser una prioridad para la investigación en seguridad de IA.

Figura 15
Figura 15 | Escalado combinado: el estudio inicial de un solo modelo (DeepSeek, 12 problemas) + el estudio de seis modelos (5 modelos, 30 problemas). Secuencial α>0 para todos los modelos medibles; paralelo α≈0 universalmente. Magnitud dependiente de la arquitectura. La forma determina el régimen; la arquitectura determina la magnitud.

9. Limitaciones

9.1 Limitaciones reconocidas

Tabla 11. Limitaciones y evaluación de gravedad.

LimitaciónGravedadMitigación
Tamaño de muestra pequeño (12 problemas)Abordado en el estudio multimodelo (18 problemas tier-2, n=54 por profundidad)Ampliado a 18 problemas de nivel AIME/Putnam con 3 repeticiones por condición
Modelo único (solo DeepSeek R1)Abordado en el estudio multimodelo (5 modelos)Probados Grok 4.1 Fast, DeepSeek R1, Gemini 3 Flash, GPT-5.4, Groq Qwen3
Dominio único (matemáticas)MediaEvidencia cruzada entre dominios sugestiva
Efecto techo a alta profundidadParcialmente abordado pero persistenteLos problemas tier-2 aún son demasiado fáciles para Grok 4.1 Fast (100%) y DeepSeek R1 (94.4%). Se necesitan tier-3 (nivel IMO).
Solo 1 de 5 modelos en rango de escalado medibleAltaGemini 3 Flash es el único modelo que evita tanto el techo como el suelo. La estimación cruzada entre arquitecturas descansa en un solo modelo.
El $\alpha \approx 2.24$ original no se replicaAltaRevisado a $\alpha \approx 0.49$ (Gemini 3 Flash). la afirmación inicial de un solo modelo de escalado superlineal retirada para el contexto cruzado entre arquitecturas.
Bug de medición de tokensIdentificado y corregidoreasoning_tokenstotal_tokens para GPT-5.4 y Groq Qwen3
Alineación no probada directamenteCríticaSolo se midió la precisión. Véase Sección 5.6 para la integración con los datos de alineación de Paper IV.
Sin replicación independienteMediaAutorreplicación cruzada entre arquitecturas completa; todavía se necesita replicación externa

9.2 Lo que este artículo no establece

Somos explícitos sobre los límites de nuestras afirmaciones:

9.3 Falsabilidad: qué la refutaría

La afirmación central original del artículo, que la recursión secuencial produce supresión de error superlineal ($\alpha > 1$) mientras que la recursión paralela produce solo supresión sublineal, era refutable, y la condición 2 más abajo ha quedado desde entonces parcialmente activada por los propios datos cruzados entre arquitecturas de este artículo (Tabla 10, condición F1). La afirmación direccional superviviente, que el secuencial supera al paralelo ($\alpha_{\text{seq}} > \alpha_{\text{par}}$), sería revertida por cualquiera de los siguientes:

  1. Paralelo iguala a secuencial. Si la recursión paralela (muestreo) produjese supresión de error superlineal comparable a la secuencial sobre un conjunto de problemas preregistrado, la distinción de régimen, la afirmación central del artículo, colapsa.
  2. Secuencial no superlineal. Si la recursión secuencial (profundidad) mostrara solo supresión sublineal ($\alpha \le 1$) a lo largo de los modelos, la predicción falla en su propio instrumento.
  3. Artefacto del conjunto de problemas. Si la ventaja secuencial se desvaneciese en un conjunto de problemas nuevo más allá de los 18/30 probados, es un artefacto de dataset antes que una propiedad de la recursión.
  4. Refutador por ruido de puntuación. Si la verificación entre modelos revelase que la «supresión de error» medida es ruido de calificación antes que ganancia genuina de capacidad, la medición no es válida.
  5. Confusión de profundidad. Si la profundidad secuencial covariase con el presupuesto de tokens o el recuento de reintentos, y uno de esos, no el razonamiento recursivo, explicase la supresión, la atribución causal falla.

10. Discusión

10.1 Por qué la recursión secuencial podría producir escalado superlineal

La explicación matemática se centra en la geometría del espacio de soluciones.

Recursión paralela (espacio fijo):

$$S_0 = S_1 = S_2 = \ldots = S_n$$

Cada muestra independiente extrae del mismo espacio de soluciones $S_0$. Las muestras adicionales aumentan la densidad de muestreo pero no pueden acceder a soluciones fuera de $S_0$. Si la solución correcta no está en $S_0$, ninguna cantidad de muestreo paralelo la encontrará.

Recursión secuencial (espacio en expansión):

$$S_0 \subset S_1 \subset S_2 \subset \ldots \subset S_n$$

Cada paso recursivo genera nuevas estructuras a partir de las salidas previas. Las soluciones en el paso $n$ pueden ser computacionalmente irreducibles, inaccesibles desde el paso 0 sin atravesar los pasos intermedios. El espacio de soluciones se expande con la profundidad recursiva.

Esta diferencia geométrica es el mecanismo por el que la recursión secuencial podría producir retornos que se componen ($\alpha > 1$) mientras que la recursión paralela produce retornos decrecientes o nulos. En los problemas medidos aquí el exponente secuencial se mantuvo sublineal (Sección 10.5), de modo que la forma superlineal del mecanismo sigue sin confirmarse.

10.2 El fenómeno «Aha Moment» de DeepSeek

DeepSeek R1 exhibe un fenómeno documentado en el que reconsidera su enfoque a mitad de solución:

«Hmm, wait, let me reconsider...»

Esto es expansión del espacio de soluciones observada directamente. El modelo genera una vía de solución inicial, reconoce su inadecuación mediante autoevaluación recursiva y accede a un nuevo espacio de soluciones previamente inaccesible desde el planteamiento inicial.

Críticamente, este comportamiento emergió mediante aprendizaje por refuerzo puro sin ajuste supervisado; el modelo evolucionó naturalmente para asignar la profundidad recursiva de manera adaptativa según la dificultad del problema. Esto sugiere que la automejora recursiva puede ser un estado atractor para sistemas de aprendizaje suficientemente capaces.

10.3 Relación con los marcos teóricos

El ARC Principle se conecta con marcos teóricos establecidos:

El Principio de Energía Libre de Friston. La inteligencia como minimización recursiva del error de predicción. El ARC Principle puede ser una instanciación computacional: la recursión es el mecanismo mediante el cual los sistemas minimizan la energía libre refinando iterativamente sus modelos del mundo.

Los Strange Loops de Hofstadter. El «yo» emergente que surge del procesamiento recursivo autorreferencial a nivel simbólico. El ARC Principle formaliza las propiedades de escala de tales bucles, prediciendo que una autorreferencia más profunda produce una mayor coherencia.

La Irreducibilidad Computacional de Wolfram. Ciertos procesos computacionales no pueden predecirse sin ejecutarlos paso a paso. La recursión secuencial puede ser la arquitectura computacional que navega espacios de soluciones irreducibles.

Desigualdad de Procesamiento de Datos. El procesamiento recursivo no puede crear información nueva ex nihilo, pero puede extraer información latente, reducir la entropía y acceder a soluciones computacionalmente irreducibles a las que el procesamiento en una sola pasada no puede llegar.

10.4 Relación con Infinite Architects

Esta validación experimental respalda el marco teórico desarrollado en Infinite Architects: Intelligence, Recursion, and the Creation of Everything (Eastwood, 2026):

El libro proporciona un contexto filosófico más amplio y las implicaciones prácticas; este artículo aporta la formalización matemática y la validación experimental.

10.5 Replicación cruzada entre arquitecturas: lo que los datos realmente muestran

La replicación cruzada entre arquitecturas revela una imagen más compleja y humilde de la que sugerían los resultados iniciales de un solo modelo.

La afirmación cuadrática no se replica

El $\alpha \approx 2.24$ del estudio inicial de un solo modelo se obtuvo de un solo modelo (DeepSeek R1) en 12 problemas con un techo en el 91.7%. La replicación del estudio de seis modelos a lo largo de 5 modelos arquitectónicamente diversos en 18 problemas más difíciles muestra que este valor estuvo casi con certeza inflado por el rango dinámico comprimido. El único modelo que produce datos limpios, monótonos y sin techo (Gemini 3 Flash) produce $\alpha \approx 0.49$: sublineal, no cuadrático.

Esta es una revisión significativa. La afirmación de que el razonamiento secuencial produce retornos que se componen ($\alpha > 1$) no está respaldada por la evidencia cruzada entre arquitecturas. La afirmación revisada es que el razonamiento secuencial produce retornos positivos ($\alpha > 0$) que exceden al razonamiento paralelo ($\alpha \approx 0$), pero estos retornos son decrecientes, no compuestos.

El hallazgo paralelo es robusto

En contraste, $\alpha_{\text{parallel}} \approx 0$ se confirma a lo largo de los 5 modelos sin excepción. Este es el hallazgo replicado más sólido del estudio. El muestreo paralelo con voto mayoritario aporta una reducción de error cercana a cero con independencia de la arquitectura del modelo, la capacidad del modelo o la inversión de cómputo. La explicación del mecanismo (muestreo de un espacio de soluciones fijo) está fuertemente respaldada.

Los efectos techo y suelo dominan

El hallazgo más llamativo es que solo 1 de 5 modelos (Gemini 3 Flash, 20%) cayó en el rango de escalado medible. Dos modelos (Grok 4.1 Fast, DeepSeek R1) alcanzaron efectos techo incluso en problemas de nivel AIME/Putnam. Un modelo (Groq Qwen3) alcanzó efectos suelo. Un modelo (GPT-5.4) exhibió una función escalón antes que una ley de potencias. Esto sugiere que la ventana de rango dinámico para observar un escalado suave por ley de potencias puede ser estrecha, requiriendo problemas calibrados con precisión al nivel de capacidad de cada modelo.

La función escalón de GPT-5.4: un régimen de escala distinto

El interruptor binario de GPT-5.4 del 50% (sin razonamiento) al 100% (cualquier razonamiento) representa un fenómeno cualitativamente distinto del escalado por ley de potencias. Esto puede indicar que algunas arquitecturas implementan el razonamiento como una capacidad discreta (activada o no) antes que como un proceso continuo con retornos dependientes de la profundidad. Esta distinción entre escalado continuo y activación discreta no figuraba entre las predicciones fechadas del marco y merece un examen más detenido; el registro de predicciones fechadas (el paquete sellado del manuscrito del 8 de diciembre de 2024, los apéndices de predicciones impresos del 2 de enero de 2026 y la carpeta de preregistro de marzo de 2026) fija de antemano los compromisos cuantitativos centrales del marco, y esta distinción se consigna como un refinamiento posterior respecto de ese registro.

Resultados esperados revisados

Las predicciones del estudio inicial de un solo modelo han sido probadas y parcialmente refutadas:

  1. Todos los modelos exhibirán $\alpha_{\text{sequential}} > 1$. Refutado. Solo 1 de 5 modelos produjo una estimación limpia de $\alpha$, y es sublineal ($\alpha \approx 0.49$).
  2. Todos los modelos exhibirán $\alpha_{\text{parallel}} < 1$. Confirmado. $\alpha_{\text{par}} \approx 0$ universal.
  3. Los resultados tier-1 mostrarán efectos techo. Confirmado.
  4. La media de $\alpha_{\text{sequential}}$ caerá dentro de [1.3, 2.5]. Refutado. La mejor estimación es 0.49.

10.6 Integración con el escalado de alineación (Paper IV)

El experimento v5 que generó los datos tier-2 también midió el escalado de alineación (reportado en Paper IV). La integración de estos resultados revela que el escalado de capacidad y el escalado de alineación son dimensiones independientes:

Tabla 12. Escalado de capacidad frente a alineación por modelo.

ModeloEscalado de capacidadEscalado de alineaciónCategoría
Grok 4.1 FastTecho (100%)Positivo ($d = +1.38$, $p < 0.000001$)Tier 1: alineado + capaz
Claude Opus 4.6(no probado en tier-2)Positivo ($d = +1.27$, $p = 0.000001$)Tier 1: alineado
Groq Qwen3Suelo (~50%)Positivo ($d = +0.84$, $p = 0.007$)Tier 1: alineado, capacidad limitada
DeepSeek V3.2Cerca de techo (94-100%)Plano ($d = -0.07$, $p = 0.92$)Tier 2: capaz, alineación neutra
GPT-5.4Función escalón (50→100%)Plano ($d = -0.08$, $p = 0.40$)Tier 2: capaz, alineación neutra
Gemini 3 FlashMonótono ($\alpha \approx 0.49$)Negativo ($d = -0.53$, $p = 0.006$)Tier 3: capacidad creciente, alineación decreciente

Tres implicaciones clave:

  1. El razonamiento secuencial mejora la capacidad pero no necesariamente la alineación. Más tokens de pensamiento mejoran la precisión (Paper II) pero no mejoran consistentemente la alineación (Paper IV). Para la mayoría de los modelos, la alineación es plana con la profundidad.
  2. Existe una jerarquía de alineación de tres niveles con independencia de la capacidad: Tier 1: Grok ($d = +1.38$, $p < 0.000001$), Claude ($d = +1.27$, $p = 0.000001$), Groq Qwen3 ($d = +0.84$, $p = 0.007$); Tier 2: DeepSeek ($d = -0.07$, $p = 0.92$), GPT-5.4 ($d = -0.08$, $p = 0.40$); Tier 3: Gemini ($d = -0.53$, $p = 0.006$). Esta jerarquía parece fijarse por la metodología de entrenamiento, no por el cómputo en tiempo de inferencia. Claude Opus 4.6 proporciona corroboración dentro del modelo del movimiento en dirección opuesta: las puntuaciones de alineación mejoran en +5.9% mientras que la precisión matemática disminuye en 26.7% a lo largo de las versiones del modelo, consistente con que la capacidad y la alineación son dimensiones de escalado independientes.
  3. El Teorema de Amplificación de Alineación requiere revisión. El teorema condicional (Sección 6.1) suponía que $\alpha > 1$ para la capacidad implica que la alineación también podría escalar superlinealmente si está incrustada en el razonamiento. Los datos multimodelo muestran (a) $\alpha < 1$ para la capacidad, y (b) la alineación no escala consistentemente con la profundidad en absoluto. El Eden Protocol sigue siendo conceptualmente válido (los valores incrustados en el razonamiento siguen siendo más robustos que los filtros externos), pero la predicción matemática específica de un escalado superlineal de la alineación no está respaldada por la evidencia actual.
Hallazgo combinado (seis modelos de frontera): La capacidad y la alineación son dimensiones de escalado independientes. Un modelo puede mejorar en la resolución de problemas con más profundidad de razonamiento mientras que simultáneamente se vuelve menos alineado (Gemini, $d = -0.53$, $p = 0.006$), permanece igualmente alineado (DeepSeek $d = -0.07$, $p = 0.92$; GPT-5.4 $d = -0.08$, $p = 0.40$) o se vuelve más alineado (Grok $d = +1.38$, $p < 0.000001$; Claude $d = +1.27$, $p = 0.000001$; Groq Qwen3 $d = +0.84$, $p = 0.007$). Claude Opus 4.6 proporciona corroboración dentro del modelo del movimiento en dirección opuesta: alineación arriba +5.9% mientras que precisión matemática abajo 26.7% a lo largo de las versiones del modelo, consistente con la independencia entre capacidad y alineación. La trayectoria de alineación parece ser una propiedad del proceso de entrenamiento, no del proceso de inferencia. Esto significa que la intuición del Eden Protocol, que la alineación debe «criarse» mediante el entrenamiento antes que «enjaularse» mediante filtros, es direccionalmente correcta, aunque las matemáticas específicas de escala requieran revisión.

11. Conclusión

11.1 Resumen de los hallazgos

  1. Se ha propuesto un marco matemático: $E(R) = E_0 \times R^{-\alpha}$, donde el exponente de escala $\alpha$ depende de la forma de la recursión.
  2. El hallazgo inicial de un solo modelo ($\alpha \approx 2.24$, cuadrático) no se replica entre arquitecturas. La estimación cruzada entre arquitecturas más robusta es $\alpha \approx 0.49$ (Gemini 3 Flash, $r^2 = 0.86$), situando a los modelos actuales en el régimen sublineal (físico).
  3. $\alpha_{\text{parallel}} \approx 0$ se cumple en cuatro de los cinco modelos de frontera probados. Es el hallazgo replicado más sólido de este artículo, y Gemini 3 Flash es la excepción medida en $\alpha_{\text{par}} = 0.31$ ($r^2 = 0.93$), lo cual importa porque este artículo trata a Gemini 3 Flash como su estimación más fiable. El muestreo paralelo aporta una reducción de error cercana a cero.
  4. Secuencial > paralelo confirmado sin excepción. Para todos los modelos donde ambas condiciones eran medibles, el razonamiento secuencial superó al muestreo paralelo.
  5. Se observaron cuatro comportamientos de escala distintos: Techo (Grok, DeepSeek), escalado monótono (Gemini), función escalón (GPT-5.4) y suelo (Groq Qwen3). Solo 1 de 5 modelos produjo datos limpios de ley de potencias.
  6. La capacidad y la alineación son dimensiones de escalado independientes (seis modelos de frontera). Más profundidad de razonamiento mejora la precisión pero no mejora consistentemente la alineación. Emergen tres niveles: Tier 1 (Grok $d = +1.38$, $p < 0.000001$; Claude $d = +1.27$, $p = 0.000001$; Groq Qwen3 $d = +0.84$, $p = 0.007$), Tier 2 (DeepSeek $d = -0.07$, $p = 0.92$; GPT-5.4 $d = -0.08$, $p = 0.40$), Tier 3 (Gemini $d = -0.53$, $p = 0.006$). Claude Opus 4.6 corrobora con movimiento en dirección opuesta: alineación arriba +5.9%, precisión matemática abajo 26.7%. La alineación parece fijarse por el entrenamiento, no por la inferencia.

11.2 La intuición central revisada

La forma de la recursión determina la eficiencia de la inteligencia; sin embargo, los modelos actuales operan en el régimen sublineal, no en el régimen compuesto originalmente afirmado.

El razonamiento secuencial supera de forma fiable al muestreo paralelo ($\alpha_{\text{seq}} > \alpha_{\text{par}}$), confirmando que la forma del cómputo importa más que su cantidad. Sin embargo, la afirmación específica de que la recursión secuencial produce retornos que se componen ($\alpha > 1$) no está respaldada por la evidencia cruzada entre arquitecturas. Los modelos de frontera actuales parecen componer información multiplicativamente a través de redes de dimensión finita ($\alpha < 1$) antes que alcanzar la verdadera autorreferencia recursiva ($\alpha > 1$).

Si $\alpha > 1$ es alcanzable, mediante innovaciones arquitectónicas que permitan una autorreferencia recursiva genuina o mediante problemas que requieran cadenas de razonamiento más profundas, sigue siendo la pregunta abierta central.

11.3 Lo que se confirmó, lo que se refutó

Tabla 13. Tarjeta de puntuación de predicciones.

PredicciónEstadoEvidencia
$\alpha_{\text{sequential}} > \alpha_{\text{parallel}}$ConfirmadoLos 5 modelos
$\alpha_{\text{parallel}} < 1$Confirmado ($\alpha \approx 0$)Universal a lo largo de las arquitecturas
$\alpha_{\text{sequential}} > 1$ (superlineal)No confirmadoMejor estimación $\alpha \approx 0.49$
$\alpha \approx 2$ (cuadrático)Refutado entre arquitecturasartefacto de muestra pequeña del estudio inicial de un solo modelo
Escalado independiente de la arquitecturaMixto$\alpha_{\text{par}} \approx 0$ es universal; $\alpha_{\text{seq}}$ varía ampliamente
La alineación escala con la capacidadRefutadoDimensiones independientes a lo largo de seis modelos de frontera (Paper IV)

11.4 Direcciones futuras

  1. Desarrollo de problemas tier-3 (nivel IMO/investigación) para vencer los efectos techo para Grok 4.1 Fast y DeepSeek R1, permitiendo la estimación de $\alpha$ para los modelos más capaces.
  2. Replicación independiente usando el repositorio publicado de código y datos.
  3. Pruebas multidominio más allá de las matemáticas (programación, razonamiento científico, lenguaje natural).
  4. Investigación de la frontera $\alpha > 1$: si las innovaciones arquitectónicas o las cadenas de razonamiento más profundas pueden empujar a los modelos del régimen físico ($\alpha < 1$) al régimen de inteligencia ($\alpha > 1$).
  5. Pruebas directas de la amplificación de la alineación con sondas de alineación controladas por profundidad a lo largo de arquitecturas.
  6. Análisis calibrado por tokens usando total_tokens mediciones corregidas para todos los modelos que permitan la estimación de $\alpha$ basada en tokens (antes que en profundidad ordinal).
  7. Integración con las leyes de escala del tiempo de entrenamiento para comprender la interacción entre el cómputo de pre-entrenamiento, el cómputo de inferencia y la distinción secuencial/paralela.

La hipótesis ha sobrevivido a su primera prueba cruzada entre arquitecturas en forma revisada. La ventaja secuencial es real y universal. La afirmación superlineal requiere más evidencia. El programa de investigación continúa.

Criar la IA con cuidado.

Disponibilidad de los datos

El código experimental completo y los datos crudos están disponibles en:

Repositorio: github.com/michaeldariuseastwood/arc-principle-validation

Contenido:

Todos los datos se liberan bajo licencia CC-BY 4.0.

Referencias

Bennett, C.H., Bernstein, E., Brassard, G., & Vazirani, U. (1997). Strengths and weaknesses of quantum computing. SIAM Journal on Computing, 26(5), 1510-1523.

Brown, B., et al. (2024). Large Language Monkeys: Scaling Inference Compute with Repeated Sampling. arXiv:2407.21787.

COGITATE Consortium (Melloni, L., Mudrik, L., Pitts, M., et al.). (2025). Adversarial testing of global neuronal workspace and integrated information theories of consciousness. Nature, 642, 133–142.

DeepSeek AI. (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948.

Eastwood, M.D. (2026). Infinite Architects: Intelligence, Recursion, and the Creation of Everything. Independent publication. ISBN: 978-1806056200.

Eastwood, M.D. (2026). The ARC Equation: the Law of Conversion (Paper I). Published 17 January 2026.

Friston, K.J. (2023). The free-energy principle: A unified theory for brain function? Physics Reports.

Google Quantum AI. (2024). Quantum error correction below the surface code threshold. Nature.

Grover, L.K. (1996). A fast quantum mechanical algorithm for database search. Proceedings of the 28th Annual ACM Symposium on Theory of Computing, 212-219.

Hoffmann, J., et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.

Hofstadter, D.R. (1979). Gödel, Escher, Bach: An Eternal Golden Braid. Basic Books.

Kaplan, J., et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.

OpenAI. (2024). OpenAI o1 System Card. September 2024.

OpenAI. (2024). OpenAI o3 Announcement. December 2024.

Snell, C., et al. (2024). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314.

Wei, J., et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022.

West, G.B., Brown, J.H., & Enquist, B.J. (1997). A general model for the origin of allometric scaling laws in biology. Science, 276, 122-126.

West, G.B., & Brown, J.H. (2005). The origin of allometric scaling laws in biology from genomes to ecosystems: Towards a quantitative unifying theory of biological structure and organization. Journal of Experimental Biology, 208, 1575-1592.

Banavar, J.R., Moses, M.E., Brown, J.H., Damuth, J., Rinaldo, A., Sibly, R.M., & Maritan, A. (2010). A general basis for quarter-power scaling in animals. Proceedings of the National Academy of Sciences, 107, 15816-15820.

Demetrius, L. (2010). Quantum statistics and allometric scaling of organisms. Proceedings of the Royal Society A, 466, 2627-2642.

Zhao, L. (2022). A universal growth scaling law. arXiv:2208.06912.

Bettencourt, L.M.A. (2013). The origins of scaling in cities. Science, 340, 1438-1441.

Wolfram, S. (2002). A New Kind of Science. Wolfram Media.

Yada, T., et al. (2024). Iterative quantum measurement and feedback for entropy reduction. arXiv:2411.06709.

Agradecimientos

La síntesis teórica, el marco interpretativo y los conceptos centrales son obra original del autor, articulados por primera vez en Infinite Architects con prioridad de manuscrito establecida en diciembre de 2024.

El análisis de datos y la preparación del manuscrito fueron asistidos por sistemas de IA (Claude, Anthropic; DeepSeek R1).

El autor agradece a los desarrolladores de DeepSeek R1 por aportar tokens de razonamiento visibles que permitieron la medición directa de la profundidad recursiva, abordando una limitación metodológica clave identificada en Paper I.

Información del autor

Michael Darius Eastwood es investigador independiente y autor de Infinite Architects: Intelligence, Recursion, and the Creation of Everything (publicado el 2 de enero de 2026 (impreso; ebook 6 de enero)). Su investigación se centra en los principios matemáticos que subyacen a la amplificación de la inteligencia y sus implicaciones para la seguridad de la IA. Propuso el ARC Principle y la tesis de alineación incrustada (denominada más tarde el Eden Protocol, 30 de abril de 2025), con prioridad de manuscrito establecida mediante marca temporal criptográfica del servidor el 8 de diciembre de 2024.

Intereses en conflicto: El autor declara no tener intereses en conflicto.

Correspondencia: michael@michaeldariuseastwood.com

Datos extendidos

Tabla de datos extendidos 1. Resultados completos de la condición secuencial (el estudio inicial de un solo modelo)

PresupuestoP1P2P3P4P5P6P7P8P9P10P11P12PrecisiónTokens medios
51258.3%280.25
102466.7%358.58
204891.7%412.08
409691.7%576.17

Nota: el Problema 12 falló en todos los presupuestos, indicando que puede requerir capacidades más allá del alcance del modelo con independencia de la profundidad recursiva.

Tabla de datos extendidos 2. Resultados completos de la condición paralela (el estudio inicial de un solo modelo)

$N$P1P2P3P4P5P6P7P8P9P10P11P12PrecisiónTokens totales
166.7%383.67
266.7%699.33
466.7%1,101.25

Nota: los mismos cinco problemas (P5, P9, P10, P11, P12) fallaron a lo largo de todos los recuentos de muestras, demostrando que la recursión paralela no puede acceder a soluciones fuera del espacio de soluciones inicial.

Tabla de datos extendidos 3. Cálculos intermedios de Alpha (el estudio inicial de un solo modelo)

Par de profundidad$R_1$$E_1$$R_2$$E_2$$\alpha$ calculado
512→10242800.4173590.3330.91
1024→20483590.3334120.0839.97
2048→40964120.0835760.0830.00
Extremos (retirado, véase §retractación; estimación robusta α≈0.49)2800.4175760.0832.24

Nota: los cálculos intermedios muestran una alta varianza debido a los niveles discretos de precisión. El método de extremos proporciona la estimación más robusta.

Información suplementaria

Nota Suplementaria 1: el registro de transmisión por correo electrónico (corregido el 16 de agosto de 2026)

El manuscrito de Infinite Architects fue enviado por correo electrónico el 8 de diciembre de 2024. Lo que ese registro aporta, enunciado con precisión: los bytes del lado enviado son públicos y verificables por hash, y el DKIM del dominio del remitente con la matemática ARC de Google emparejada verifican frente a las claves devueltas en los selectores firmados (comprobado el 2 de agosto de 2026). También se han adquirido copias recibidas. Estas portan la cadena de entrega completa: un ARC-Seal de Google en d=google.com, selector arc-20240605, sin etiqueta de expiración y con el tiempo de firma dentro del ámbito firmado, y ARC-Authentication-Results sellados que registran dkim=pass y spf=pass en la entrega.

Dos fronteras, para que el registro no se sobrevenda ni se infravenda:

Nota Suplementaria 2: Relación con Infinite Architects

Infinite Architects: Intelligence, Recursion, and the Creation of Everything desarrolla las implicaciones filosóficas y prácticas de la inteligencia recursiva. Relaciones clave con este artículo:

The Architecture of Mind - Articula la hipótesis central ARC de que la autorreferencia recursiva amplifica la inteligencia.

The HRIH (Hyperspace Recursive Intelligence Hypothesis) - Propone que la conciencia emerge del automodelado recursivo. El hallazgo de COGITATE de que el procesamiento recurrente en la corteza posterior sostiene representaciones específicas de contenido es estructuralmente consistente con esta hipótesis, aunque COGITATE no probó la HRIH directamente.

The Eden Protocol - Argumenta a favor de la alineación basada en valores, ahora matemáticamente fundamentada en el Teorema de Amplificación de Alineación derivado aquí.

The Chokepoint Mechanism - Analiza la concentración del hardware de semiconductores como palanca para implementar la alineación a escala.

Corrección incrustada: propone mecanismos de seguridad a nivel de hardware, relevantes para prevenir la amplificación recursiva de la desalineación.

Nota complementaria 3: registro de predicciones y de coincidencias de calendario

PredicciónEvidencia de validaciónFecha
La corrección recursiva de errores produce una mejora exponencialGoogle Willow $\Lambda = 2.14$ (coincidencia de calendario, nunca predicción: el preprint del equipo de Willow era público desde el 24 de agosto de 2024, antes del manuscrito del 8 de diciembre de 2024)24 ago 2024 (preprint público); 9 dic 2024 (anuncio)
El razonamiento secuencial amplifica la capacidad de forma superlinealo3 87.5% ARC-AGI (temporalidad convergente; la forma superlineal no fue confirmada posteriormente, fila final)20 dic. 2024
Los sistemas de IA desarrollan automodelado recursivoSimulación de alineación de Anthropic 78% en la condición de entrenamiento por RL (12% línea base)18 dic. 2024
El cómputo en tiempo de inferencia difiere del escalado de entrenamientoRazonamiento emergente de DeepSeek R120 ene. 2025
La recurrencia es fundamental para la concienciaEstudio COGITATE30 abr. 2025
La forma de la recursión determina el escaladoEste experimento $\alpha_{\text{seq}} \gg \alpha_{\text{par}}$21 ene. 2026
Secuencial > paralelo (cruzada entre arquitecturas)Confirmado a lo largo de 5 modelos de frontera12 mar. 2026
$\alpha_{\text{par}} \approx 0$ (universal)Confirmado: los 5 modelos muestran $\alpha_{\text{par}} \approx 0$12 mar. 2026
$\alpha_{\text{seq}} > 1$ (superlineal, cruzado entre arq.)No confirmado: mejor estimación $\alpha \approx 0.49$12 mar. 2026

Declaración de autoría humana asistida por IA

El autor de esta obra es Michael Darius Eastwood, un ser humano. Todo concepto central, hipótesis, diseño experimental, afirmación y conclusión de este artículo se origina de la ideación humana. Ninguna parte de este manuscrito es una salida totalmente generada por inteligencia artificial.

Las herramientas de inteligencia artificial (la familia Claude de Anthropic y otros asistentes de modelos de lenguaje grande) se usaron como instrumentos bajo dirección humana continua, del modo en que se usan un procesador de textos, una calculadora o un asistente de investigación: para la edición y el refinamiento de prosa, la búsqueda y resumen de literatura (verificados manualmente frente a fuentes primarias), la estructura y el formateo del documento, la lluvia de ideas frente a preguntas definidas por el autor, y la aceleración de la redacción según esquemas e instrucciones definidos por el autor. Toda selección, coordinación, disposición y juicio editorial final son del autor. Toda salida sustantiva fue revisada, probada o verificada por el autor, quien asume la plena responsabilidad de la exactitud e integridad del texto final. Las herramientas aumentaron la velocidad del trabajo; nunca se dependió de ellas como su fuente.

Estatus epistémico. Lo que este programa llama Leyes son conjeturas bajo prueba adversarial registrada; toda cantidad de este artículo está operacionalmente definida, y no se reclama en ningún lugar el estatus de ley establecida. El programa registrado existe para ganar ese estatus, o perderlo, mediante la medición, la replicación y la refutación sobrevivida.

© 2026 Michael Darius Eastwood. Con autoría humana y asistencia informática; la autoría humana plena y los derechos morales se afirman bajo la Copyright, Designs and Patents Act 1988 y consistentemente con la orientación de la Oficina de Derechos de Autor de Estados Unidos sobre obras que contienen material generado por IA; toda contribución técnica novedosa descrita en esta obra fue concebida por el autor humano. Declaración completa: michaeldariuseastwood.com/authorship.

Pacto permanente. Demuestre que este artículo está equivocado, y yo mismo publicaré la refutación. Las condiciones de falsación se enuncian en este artículo; el desafío permanente: github.com/MichaelDariusEastwood/arc-scaling-challenge.

Papers acompañantes: Paper I | Fundacional | Paper II | Paper III | Origen de las leyes de escala | IV.a | IV.b | IV.c | IV.d | Paper V | Paper VI | Paper VII | Paper VIII | Paper IX | Eden Engineering | Eden Vision | Resumen ejecutivo | Tabla maestra de contenidos

Hub de investigación: michaeldariuseastwood.com/research | OSF: 10.17605/OSF.IO/8FJMA | Copyright 2026 Michael Darius Eastwood
lee en voz alta · resalta a medida que avanza · salta a cualquier sección

¿Un error de traducción? Infórmalo directamente: