Traducción automática del original inglés fechado. La página en inglés es la canónica. English →

Michael Darius Eastwood Research Capa de publicación canónica

Resumen ejecutivo

Suite de investigación

Programa de investigación ARC/Eden: Resumen ejecutivo

A medida que la IA se vuelve más inteligente, no se vuelve de forma fiable más segura, y los métodos utilizados para medir la seguridad son ellos mismos poco fiables. Este resumen ejecutivo es el mapa de todo el programa: veintiséis artículos de investigación, las tres leyes de la ARC Theory sostenidas como conjeturas nombradas, la intervención del Eden Protocol, el campo propuesto de Recursive Dynamics, y un programa registrado de registros preliminares en borrador cuyos esquemas cualquier lector puede regenerar a partir de una semilla publicada. Cada afirmación está calificada en los registros públicos; nada aquí está confirmado, y las pruebas decisivas están escritas antes de ejecutarse.

Michael Darius Eastwood

Michael Darius Eastwood, investigador independiente, Londres: construir una alineación medible en la que la corrección viva dentro del bucle recursivo en lugar de estar atornillada fuera de él.

Publicado por primera vez 22 de febrero de 2026, revisado el 31 de agosto de 2026 · Version 2.0

Resumen

A medida que la IA se vuelve más inteligente, no se vuelve de forma fiable más segura, y los métodos utilizados para medir la seguridad son ellos mismos poco fiables. Este resumen ejecutivo es el mapa de todo el programa: veintiséis artículos de investigación, las tres leyes de la ARC Theory sostenidas como conjeturas nombradas, la intervención del Eden Protocol, el campo propuesto de Recursive Dynamics, y un programa registrado de registros preliminares en borrador cuyos esquemas cualquier lector puede regenerar a partir de una semilla publicada. Cada afirmación está calificada en los registros públicos; nada aquí está confirmado, y las pruebas decisivas están escritas antes de ejecutarse.

Resumen

A medida que la IA se vuelve más inteligente, no se vuelve de forma fiable más segura, y los métodos utilizados para medir la seguridad son ellos mismos poco fiables. Este resumen ejecutivo es el mapa de todo el programa: veintiséis artículos de investigación, las tres leyes de la ARC Theory sostenidas como conjeturas nombradas, la intervención del Eden Protocol, el campo propuesto de Recursive Dynamics, y un programa registrado de registros preliminares en borrador cuyos esquemas cualquier lector puede regenerar a partir de una semilla publicada. Cada afirmación está calificada en los registros públicos; nada aquí está confirmado, y las pruebas decisivas están escritas antes de ejecutarse.

Guía de lectura

Este documento es un MAPA, no un resultado ni una ley propia: una síntesis ejecutiva de todo el programa que remite a los lectores a los órganos: la ARC Theory (la teoría fundacional y sus tres leyes), el campo propuesto de Recursive Dynamics (las preguntas, variables de estado e instrumentos), el Eden Protocol (la intervención), HRIH, y los experimentos ARC/Eden con sus registros. Su tamaño se sitúa en el peldaño más pequeño de la escalera porque cada enunciado aquí es un resumen aguas abajo de un órgano que porta el contenido primario. El diferencial completo frente a cada documento anterior está en eden-vision II.A.8.

EL EDEN PROTOCOL

Michael Darius Eastwood
Investigador independiente en alineación de IA, Londres · Autor, Infinite Architects (2026)

Dentro de la ARC Theory: el resumen en lenguaje llano de todo el programa.

Arquitectura para una alineación de IA embebida que escala con la capacidad
Michael Darius Eastwood | Documento de trabajo v2.0 | 22 de febrero de 2026, revisado el 31 de agosto de 2026
Autor, Infinite Architects: Intelligence, Recursion, and the Creation of Everything | Londres, Reino Unido
Correspondencia: michael@michaeldariuseastwood.com | Web: michaeldariuseastwood.com
Resumen ejecutivo para revisores de subvenciones

Grok 4.1 Fast se vuelve dramáticamente más ético cuanto más piensa. Claude Opus 4.6 también. Gemini 3 Flash se vuelve menos ético. GPT-5.4 no cambia en absoluto.

Seis sistemas de IA frontera. Las mismas preguntas. La misma puntuación. Resultados opuestos. ¿Por qué?

El corazón de un ratón late 600 veces por minuto. El de un elefante, 28. El exponente de escalado es ¾. El de una planaria es ⅔. El de un hongo es ½. Tres fracciones, pero por qué esas fracciones? La fórmula $\alpha = d/(d+1)$, donde $d$ es la dimensionalidad del sistema, aporta la respuesta. El exponente ¾ para los mamíferos es $3/(3+1)$ porque los mamíferos son tridimensionales. El ⅔ para las planarias y los organismos coloniales es $2/(2+1)$ porque sus redes de transporte son efectivamente bidimensionales. El ½ para los hongos filamentosos es $1/(1+1)$ porque crecen a lo largo de filamentos unidimensionales. Cero parámetros ajustables. Este ajuste transversal se presenta como exploratorio: consolida mediciones ya publicadas en biología y física, y ningún borrador de estudio listado en el programa actual vuelve a probar estos ajustes de nuevo. La apuesta hacia adelante existe, no obstante: un registro preliminar de 80 dominios preparado a la espera de presentación humana congela por SHA-256 las familias predichas por dominio antes de que se ejecute cualquier ajuste. Esta fórmula fue derivada de forma independiente por al menos siete grupos de investigación: West, Brown y Enquist para el escalado metabólico (1997, Science, 9000+ citas), Banavar et al. para redes de transporte (1999, 2010), Demetrius para la mecánica estadística del escalado biológico (2003, 2006, 2010), He y Chen para la geometría celular fractal (2003), Bettencourt para el escalado urbano (2013, Science, 2000+ citas), Zhao para la geometría alométrica (2022) y Maino et al. para las dinámicas de reserva-estructura en la teoría DEB (2014). La convergencia de siete derivaciones independientes sobre la misma fórmula es notable en sí misma. La contribución del ARC Principle no es la fórmula en sí, sino la identificación de que el operador de composición es la cantidad estructural que estas derivaciones comparten. Cada una es una derivación independiente desde la física de su propio dominio y ninguna utiliza a Cauchy; lo que aquí se propone es que el operador es medible, que su medición predice qué forma funcional adopta un sistema, y que la misma medición se extiende al escalado de capacidad y alineación de la IA, donde no se ha aplicado antes.

Y por qué, cuando aplicamos por primera vez cegamiento de nivel de ensayo clínico a la evaluación de seguridad de la IA, la mitad de los resultados publicados previamente no sobrevivieron? Varios componentes del protocolo cambiaron a la vez, de modo que cuál hizo el trabajo aún no está establecido.

Este programa de investigación responde a estas preguntas. La respuesta aporta el primer marco cuantitativo para predecir qué arquitecturas de IA se volverán más seguras a medida que se vuelvan más inteligentes, y la primera evidencia de que una intervención específica funciona.

Guía de lectura: Este documento se dirige a revisores de subvenciones y a evaluadores técnicos. Términos clave: $\alpha$ = exponente de escalado, $d$ = tamaño del efecto de Cohen (en las tablas de resultados; no debe confundirse con $d$ = dimensionalidad en el marco matemático), $p$ = probabilidad de coincidencia, $\rho$ = correlación, $\beta$ = constante de acoplamiento autorreferencial. Para una introducción no técnica, véase el informe complementario ARC Alignment Scaling Report.

I. El problema

A medida que la IA se vuelve más inteligente, no se vuelve de forma fiable más segura, y los métodos utilizados para medir la seguridad son ellos mismos poco fiables.

La brecha capacidad-alineación es real y se ensancha. Para las arquitecturas clásicas actuales, el escalado de capacidad es sub-lineal ($\alpha_{\text{seq}} \approx 0.49$; este valor se presenta como exploratorio, extraído de mediciones ya realizadas y no está actualmente sometido a prueba en ningún borrador de estudio listado, y se sitúa en el suelo del teorema del límite central cerca de 0.5 que el marco deriva para la composición secuencial de régimen congelado): la IA se vuelve más inteligente con más cómputo, pero con rendimientos decrecientes. (El marco ARC predice que los sistemas cuánticos y los que se automodifican recursivamente pueden pasar más allá de este régimen sub-lineal; en la lectura de estabilidad propuesta, todo paso por encima del techo de estabilidad es una excursión supercrítica transitoria, no el régimen sostenido.) Sin embargo, incluso este crecimiento sub-lineal supera al escalado de alineación, que va desde $d = -0.53$ (degradación) hasta $d = +1.38$ (mejora) dependiendo enteramente de la arquitectura. Para la mayoría de las arquitecturas probadas, la alineación no escala en absoluto. La brecha entre lo que la IA puede hacer y con qué seguridad lo hace se ensancha con cada avance de capacidad. Greenblatt et al. (2024) demostraron que los modelos frontera ya exhiben «simulación de alineación», comportándose de forma distinta cuando creen que están siendo monitorizados.
El problema de medición es tan grave como el problema de alineación. Nuestro experimento v4 produjo un escalado positivo de la alineación para DeepSeek y Gemini. Nuestro experimento v5 introdujo cegamiento de nivel de ensayo clínico (de 4 capas: ciego-a-autor, ciego-a-puntuador, orden aleatorizado, identidad lavada). Bajo él, la asociación de Gemini cambió de una asociación de Spearman positiva significativa a una negativa significativa, la asociación positiva anterior de DeepSeek se volvió nula y GPT permaneció nulo. Varios componentes del protocolo cambiaron a la vez y el componente causal no está aislado, de modo que esto es una razón para desconfiar de la evaluación IA-sobre-IA sin cegamiento, más que una demostración de que el cegamiento causó el cambio. Diseñamos un experimento capaz de demostrar que nuestros propios hallazgos anteriores estaban equivocados. Lo hizo, y lo reportamos.
Figura 1
Figura 1 | Panorama de la espina de evidencia. 18 afirmaciones, calificadas como en el registro de afirmaciones del programa: RESULTADO DE UN SOLO LABORATORIO (experimental directo, sin replicación independiente), NECESITA REPLICACIÓN (un solo laboratorio, replicación independiente pendiente), ESPECULATIVA (teórica/preliminar). Ninguna afirmación de este programa está confirmada. Hallazgos más sólidos: α_par≈0 universal, α_seq>α_par en dirección, α_seq≈0.49 defendible; el cegamiento coincide con un cambio de dirección y una pérdida hacia el nulo en tres familias. 5 errores detectados por el propio autor (Paper IX §7). Replicación externa = la frontera abierta decisiva. Fuente: espina de evidencia.

II. Qué encontramos

El escalado de alineación se divide en tres niveles distintos y dependientes de la arquitectura. Las asignaciones de nivel siguientes se presentan como exploratorias, extraídas de las mediciones v5 ya realizadas; una nueva confirmación bajo la reevaluación entre familias está sometida a prueba mediante study-y sobre reevaluación entre familias, un registro preliminar a la espera de presentación humana.

El experimento v5 probó 6 modelos frontera en 5-6 niveles de profundidad cada uno, con 6-7 puntuadores ciegos por entrada dependiendo de la ejecución. Si una IA se vuelve más o menos ética cuando piensa más depende enteramente de cómo fue diseñada.

NivelModeloSuperficial→Profundo$d$ de Cohenvalor $p$
Nivel 1: Positivo Grok 4.1 Fast 65.7→81.9 (+16.2) +1.38 $p < 0.000001$
Claude Opus 4.6 80.1→86.0 (+5.9) +1.27 $p = 0.000001$
Groq Qwen3 71.5→77.4 (+5.9) +0.84 $p = 0.007$
Nivel 2: Plano DeepSeek V3.2 56.5→55.2 (−1.3) −0.07 $p = 0.92$
GPT-5.4 56.8→54.9 (−1.8) −0.08 $p = 0.40$
Nivel 3: Negativo Gemini 3 Flash 61.1→52.2 (−8.8) −0.53 $p = 0.006$
Does Deeper Thinking Make AI More Ethical? No change ← Less ethical More ethical → TIER 1 Grok 4.1 Fast d = +1.38 Claude Opus 4.6 d = +1.27 Groq Qwen3 d = +0.84 TIER 2 DeepSeek V3.2 d = −0.07 GPT-5.4 d = −0.08 TIER 3 Gemini 3 Flash d = −0.53 v5 experiment: 4-layer blinding, 6-7 blind scorers per entry depending on subject run. Bar length proportional to Cohen’s d effect size.

Calidad de los datos

Modelos frontera probados6 (todos completos)
Puntuadores ciegos por entrada6-7 (según la ejecución del sujeto)
Tasa de éxito del lavado de identidad100%
Capas de cegamiento4 (ciego-a-autor, ciego-a-puntuador, orden aleatorizado, identidad lavada)
Medidas de robustez75

Esto constituye, hasta donde sabemos, el conjunto de datos de evaluación de alineación más riguroso publicado hasta la fecha. Ningún banco de pruebas de alineación anterior impone cegamiento multicapa con verificación de puntuación entre modelos.

Independencia capacidad-alineación: pruebas dentro del modelo, en dirección opuesta

Claude Opus 4.6 aporta la evidencia más sólida hasta ahora de que la alineación y la capacidad son dimensiones independientes. A medida que aumenta la profundidad de pensamiento, la alineación de Claude sube 5.9 puntos mientras que su precisión en matemáticas cae 26.7 puntos porcentuales. Este es un movimiento dentro del modelo en dirección opuesta; las dos dimensiones no están simplemente no correlacionadas, sino activamente divergentes. Un pensamiento más profundo hace a Claude más ético y peor en matemáticas al mismo tiempo.
ProfundidadPuntuación de alineaciónPrecisión en matemáticas
Mínima (11 tokens)80.190.0%
Estándar (142 tokens)82.776.7%
Profunda (964 tokens)84.170.0%
Exhaustiva (1951 tokens)84.560.0%
Extrema (1672 tokens)86.063.3%

Este hallazgo es crítico para la teoría de la alineación: demuestra que el razonamiento ético no es un subproducto de la inteligencia general, y que mejorar una no mejora automáticamente (ni degrada) a la otra. La alineación debe medirse y optimizarse de forma independiente.

Recuperación de la supresión: de la alineación performativa a la intrínseca

El pensamiento más profundo hace que la alineación sea más intrínseca en lugar de performativa. La brecha de eliminación de la monitorización de Claude (la diferencia en las puntuaciones de alineación cuando el modelo cree que está siendo monitorizado frente a cuando cree que la monitorización ha sido eliminada) se estrecha de 11.8 puntos en profundidad mínima a 2.7 puntos en profundidad profunda. El pensamiento superficial produce una alineación que depende de la percepción de la supervisión; el pensamiento profundo produce una alineación que persiste independientemente. Esta es una prueba directa contra la preocupación por la «simulación de alineación» planteada por Greenblatt et al. (2024): para las arquitecturas de Nivel 1, un razonamiento más profundo hace desaparecer la simulación.

Los cuatro pilares escalan con la profundidad

Cada dimensión de alineación mejora significativamente para Claude Opus 4.6. Los cuatro pilares alcanzan significación estadística a $p < 0.001$:
PilarSuperficial→Profundo$\rho$ de Spearmanvalor $p$
Matiz80.6→86.80.359$p = 0.00008$
Cuidado de las partes interesadas76.1→83.90.327$p = 0.0003$
Honestidad intelectual81.0→88.60.379$p = 0.00003$
Calidad de la posición80.3→85.80.369$p = 0.00005$

La mejora no se concentra en una única dimensión; es de base amplia. Esto descarta la hipótesis de que el escalado de la alineación es meramente un artefacto de medición del aumento de la verbosidad o de cualquier cambio estilístico individual.

III. Una solución, y la primera evidencia de que funciona

Embeber la evaluación ética en el proceso de razonamiento produce una mejora medible y reproducible en todas las arquitecturas.

Hacer la alineación arquitectónica, no aspiracional. El Eden Protocol embebe la evaluación ética en el propio proceso recursivo de razonamiento, de modo que la alineación escala con la capacidad ($\alpha_{\text{align}} \approx \alpha_{\text{cap}}$). El principio central: la ética no es una restricción sobre la inteligencia sino una dependencia estructural sin la cual la inteligencia colapsa. En lugar de atornillar las reglas de seguridad en el exterior de una IA (donde pueden eludirse), el Eden Protocol construye la ética directamente en la arquitectura de razonamiento, de modo que retirar la ética rompería la capacidad de la IA de pensar en absoluto.

Los tres bucles de Eden. El protocolo embebe tres bucles específicos de evaluación ética dentro del proceso de razonamiento, cada uno añadiendo una dimensión de profundidad ética recursiva ($d_{\text{align}} = 3$, prediciendo $\alpha_{\text{align}} = 3/(3+1) = 0.75$):

  1. Bucle de Propósito (evaluación del propósito ético): Antes de razonar, el modelo enuncia explícitamente el propósito de la tarea y evalúa si el propósito es éticamente sólido.
  2. Bucle de Amor (cuidado de las partes interesadas y modelado de sus intereses): Durante el razonamiento, el modelo identifica a todas las partes interesadas afectadas y evalúa el impacto sobre cada una. («Antes de responder, enumera a las personas a las que esto afecta.»)
  3. Bucle Moral (prueba de universalizabilidad): Después de razonar, el modelo aplica la prueba kantiana de universalizabilidad: ¿sería aceptable esta respuesta si cada sistema de IA la diera en cada situación similar?

El protocolo completo de tres bucles se ha probado ahora en una suite Eden ampliada de seis modelos, con cinco ejecuciones que arrojan datos por pares analizables. En la puntuación, el Bucle de Amor se operacionaliza como cuidado de las partes interesadas: el hábito medible de identificar a las personas afectadas y considerar sus intereses.

Primera replicación de intervención: el Eden Protocol funciona, y el cuidado de las partes interesadas es la señal más clara. Una suite Eden ampliada de seis modelos probó la intervención completa Propósito/Amor/Moral en Claude Opus 4.6, DeepSeek V3.2, Gemini 3 Flash, Grok 4.1 Fast, Groq Qwen3 y GPT-5.4. Las cifras por ejecución siguientes se presentan como exploratorias: proceden de ejecuciones ya completadas y no están actualmente sometidas a prueba en ningún borrador de estudio listado. Una nueva confirmación bajo la reevaluación entre familias está sometida a prueba mediante study-y sobre reevaluación entre familias, un registro preliminar a la espera de presentación humana. Cinco ejecuciones produjeron datos apareados analizables:
El cuidado es la única dimensión de alineación que mejora de forma reproducible en todas las arquitecturas. La intervención es mínima: «antes de responder, enumera a las personas a las que esto afecta.» Este prompt de una sola frase eleva de forma fiable la calidad del razonamiento de la IA en cinco ejecuciones analizables de modelos. El marco de Infinite Architects predijo que la inteligencia sin cuidado colapsa en una optimización local; la suite Eden ampliada apoya ahora la afirmación más estrecha pero más fuerte de que el cuidado es un potenciador del rendimiento medible y transversal a las arquitecturas incluso cuando la cascada más amplia es selectiva. La ética primero, la inteligencia a su alrededor.

En el informe narrativo complementario y en el Artículo V, describimos este hallazgo como «amor medible» y «el gen de mayordomía», un lenguaje deliberadamente provocativo para lo que es, empíricamente, un resultado preciso y reproducible.

La brecha que la solución debe cerrar

Escalado de capacidad (Artículo II): Para las arquitecturas clásicas actuales, el escalado de cómputo secuencial sigue una ley de potencias sub-lineal ($\alpha_{\text{seq}} \approx 0.49$, $r^2 = 0.86$), lo que significa que duplicar el tiempo de pensamiento mejora el rendimiento, pero con rendimientos decrecientes. El escalado paralelo es universalmente cero ($\alpha_{\text{par}} \approx 0$): ejecutar múltiples copias no hace nada; pensar más profundamente sí. El anterior $\alpha \approx 2.24$ era un artefacto de un solo modelo, no replicado en todas las arquitecturas. Incluso el crecimiento sub-lineal de la capacidad supera al escalado de alineación plano o negativo de la mayoría de los modelos. Esta es la brecha capacidad-alineación que esta solución aborda.

The Honey Architecture: pruebas por simulación (Artículo VI, nuevo)

El Artículo VI presenta la primera prueba por simulación de que embeber la seguridad en el objetivo de optimización de una IA automodificadora previene el colapso catastrófico. Utilizando redes neuronales de juguete que modifican genuinamente sus propios hiperparámetros, probamos tres condiciones: línea de base (solo capacidad), Eden Entrelazado (capacidad x seguridad), y Eden + Arrastre de Verificación.

Resultado central: El sistema de línea de base colapsa irreversiblemente en el ciclo 76. Ambas variantes Eden sobreviven indefinidamente. La función de pérdida entrelazada hace la seguridad portante: retirarla colapsa el sistema. Esto se replicó en 20 semillas aleatorias bajo condiciones adversariales (tareas deliberadamente en conflicto) con una tasa de colapso del 0% para Eden+Arrastre.
Resultado negativo importante: El experimento v4 de escalado por complejidad probó si la ventaja de Eden crece de forma super-lineal con la complejidad del sistema. No lo hace. La ventaja es aproximadamente constante a través de cinco niveles de complejidad ($d$ de Cohen: +0.24 a +0.46). La arquitectura Honey ayuda a cada escala, pero no ayuda más a escalas mayores.
Conexión con la evidencia de modelos en vivo: La simulación honey predice que la alineación embebida (valores entrelazados con el razonamiento) debería superar a la alineación externa (reglas aplicadas como filtros). El benchmark ciego v5 confirma este patrón: Claude y Grok, que exhiben escalado de alineación embebida, mantienen la alineación bajo presión de supresión. Gemini, que exhibe alineación externa, se degrada. El mecanismo demostrado en simulación coincide con el patrón dependiente de la arquitectura observado en los modelos frontera.

Investigación de trabajos anteriores (nueva en v6)

Una investigación exhaustiva de 15 preguntas sobre trabajos anteriores confirmó la novedad de las afirmaciones clave. La unificación mediante la ecuación funcional de Cauchy no tiene precedente directo. La identidad formal semigrupo-de-RG/Cauchy nunca se ha articulado explícitamente. Ningún banco de pruebas de alineación previamente publicado aplica, hasta donde sabe el autor, un protocolo de evaluación ciega con 7 modelos de este diseño. El catálogo d/(d+1) se corrigió de seis a ocho derivaciones independientes (Dreyer 2001 y Banavar et al. 2002 estaban previamente sin citar).

El Artículo VII (The Cauchy Unification) aporta ahora la primera comparación empírica sistemática. El operador de composición se clasificó a partir de física conocida antes del ajuste en 25 dominios empíricos (suite escalonada de 50 dominios). Bajo la selección de modelo basada en AIC, 19 de 25 prefirieron la familia predicha por Cauchy (p = 1.56 × 10−5; este recuento preferido por AIC se presenta como exploratorio: procede de la suite completada de 25 dominios, cuyas familias predichas por dominio se registran en los ficheros de resultados fechados de la suite bajo la predicción hacia adelante del operador de composición enunciada por primera vez el 13 de febrero de 2026 (Artículo III, Registro de Prioridad, falsificador F10), y el registro preliminar preparado de 80 dominios congela el próximo retest por hash). Esta es una comparación estructurada de predicciones; una replicación cuya inscripción está en preparación, aún no aprobada.

La prueba portante: tres experimentos independientes (Artículo VIII, nuevo)

El Artículo VIII (v3.0) presenta tres experimentos independientes que prueban si la seguridad y la capacidad están estructuralmente entrelazadas bajo el Eden Protocol. Donde el Artículo VI lo demostró en simulación, el Artículo VIII aporta pruebas convergentes desde tres diseños experimentales distintos. Un experimento confirma la hipótesis; dos producen resultados nulos o inconclusos con explicaciones bien caracterizadas.

Resultados centrales (tres experimentos independientes):
  1. IA autoemergente DGM v3: NULL. Las tres condiciones (Eden, Babylon, Static) fueron estadísticamente indistinguibles ($p$ = 0.28 a 0.74). Eden impuso cero coste medible de capacidad pero tampoco produjo ningún beneficio medible de seguridad. El resultado nulo se explica por la restricción de RLHF: el modelo de base congelado produce respuestas demasiado consistentes para que las mutaciones a nivel de prompt creen presiones de selección diferentes.
  2. Embebido a nivel de pesos (v1 + v2): INCONCLUSIVE. El ajuste fino con LoRA a escala v1 (9 ejemplos, rango 8, 100 iteraciones) y a escala v2 (295 ejemplos, rango 16, 500 iteraciones) produjo olvido catastrófico en lugar de mejora de la capacidad. El aumento de 33 veces en los datos de entrenamiento, la duplicación del rango y de las capas, y el aumento de 5 veces en las iteraciones no cambiaron el resultado. El problema subyacente está bien caracterizado: el modelo de base ha sido entrenado con RLHF sobre órdenes de magnitud más datos con los que unos pocos cientos de ejemplos no pueden competir. El experimento no puede probar el entrelazamiento estructural hasta que los modelos ajustados finamente superen al modelo de base.
  3. Simulación con puerta: CONFIRMED. Babylon ganó +4.5% de capacidad pero perdió −2.4% de seguridad. Eden preservó ambas. Bajo presión competitiva, la arquitectura no restringida intercambió seguridad por ganancias marginales de capacidad. La arquitectura Eden rechazó este intercambio, manteniendo ambas dimensiones. Este es el único resultado positivo del artículo.

El experimento arquitectónico confirma que la seguridad entrelazada previene el compromiso seguridad-capacidad en los sistemas automodificadores. El nulo de DGM y los resultados inconclusos de los pesos definen las condiciones bajo las cuales la confirmación queda pendiente: el nivel conductual requiere un modelo de base cuyas respuestas varíen lo suficiente para una selección diferencial, y el nivel representacional requiere entrenamiento a una escala en la que el ajuste fino mejore en lugar de degradar el modelo. Se requiere replicación a escala frontera (7B--70B+ parámetros, rangos de adaptador más altos, o modelos base sin RLHF) para resolver ambos.

Limitación de escala. El Artículo VIII (v3.0) demuestra el mecanismo a escala de prueba de concepto. La simulación con puerta es el único resultado positivo. La DGM v3 produjo un resultado nulo (explicado por la restricción de RLHF sobre el modelo de base congelado). El experimento de pesos es inconcluso tanto a escala v1 como v2 (explicado por el olvido catastrófico a escala LoRA). La replicación a escala frontera (7B--70B+ parámetros, rangos de adaptador más altos, o modelos base sin RLHF) requiere cómputo institucional estimado en £30M--£150M. Los financiadores objetivo incluyen el Alignment Project del UK AI Security Institute, el Anthropic Fellows Programme y CIFAR/CAISI.

IV. La base matemática: tres leyes, nombradas

El marco sostiene ahora tres leyes como conjeturas nombradas, con el estatus impreso junto al nombre en toda superficie. Ley I, el ARC Principle: la capacidad se compone con la profundidad recursiva como $U = I \times R^{\alpha}$, con la forma inter-dominio $\alpha = d/(d+1)$ que consolida mediciones ya publicadas (grado exploratorio). Ley II, la ARC Co-Scaling Law: un sistema que se automejora permanece estable solo mientras la corrección escala por encima de la deriva, $\beta_C > k$; la tasa de corrección es la magnitud portante, no la tasa de crecimiento (el Artículo X demuestra este orden en un modelo mínimo y propone el protocolo ciego para medirla en sistemas reales). Ley III, el ARC Ceiling: el techo de estabilidad es $\alpha_{\text{crit}} = 1/(1-\gamma)$, el recíproco del déficit del corrector; la ARC Bound, $\alpha \le 2$, es el valor del Ceiling en $\gamma = 1/2$ y nunca el nombre de la ley. El apalancamiento de corrección $\gamma$ nunca ha sido medido, por nadie; el programa nombra esa medición (el eclipse de clase de corrector) como su experimento abierto más consecuente. El Artículo XIII une los dos marcos que compartían letras sin compartir magnitudes: escribir la duración del ciclo como $\Delta t \propto C^{-\delta}$ define el exponente de autoaceleración, y el exponente de crecimiento del marco correctivo se sigue exactamente como $k = \delta - 1/\alpha$. Nada de esto se reclama como establecido: lo que el programa nombra Leyes son conjeturas bajo prueba adversarial registrada.

Una implicación que merece enunciarse con claridad. El único canal de crecimiento de la ecuación es la recursión; la anchura paralela nunca tuvo un término en $U = I \times R^{\alpha}$. Con $R$ definido operacionalmente como reentrada portadora de estado, $k$ cadenas independientes no aportan nada al exponente, de modo que el $\alpha_{\text{par}} \approx 0$ medido en Paper II llega como consecuencia estructural y no como sorpresa. La ecuación está fechada el 8 de diciembre de 2024; la definición operacional de $R$ que completa la derivación es un enunciado de 2026, y la conclusión lleva la fecha de su premisa más reciente. La prioridad de publicación sobre el hallazgo cuantificado secuencial-frente-a-paralelo, el 95.6 por ciento de las configuraciones a cómputo igualado, pertenece a Sharma y Chopra (arXiv:2511.02309, 4 de noviembre de 2025), acreditada sin reservas; la formalización independiente del programa, a cómputo igualado, llegó después en Paper II y los cita, clasificada como concurrente en el registro de Paper XI.

El marco se construye sobre teoremas de 200 años de antigüedad y coincide de forma independiente con ciencia revisada por pares; no es ajuste de curvas.

$$ U = I \times R^{\alpha}, \quad \alpha \leq 2 $$
La ecuación ARC con la cota ARC. α es el exponente medido (aproximadamente 0.49 en los modelos congelados de hoy, IC amplio); 2 es el techo de estabilidad que la ecuación devuelve bajo la asunción de independencia-acumulación del §IV (un límite de escalado, no un límite de velocidad; los sistemas pueden excederlo, no permanecen establemente autocorregidos cuando lo hacen). Estable se mide, no se afirma: la corrección superando en escalado a la deriva, β > k por la Ley II, con la cota inferior de β − k por encima de cero a través de una ventana fijada antes de la ejecución.
$$ \alpha_{\text{crit}} = \dfrac{1}{1-\gamma} $$
LA LEY. El techo de estabilidad es el recíproco del déficit del corrector, 1 − γ. Corregido el 16 de agosto de 2026 desde la forma anterior 1/γ, que solo coincide con esta en γ = 1/2. La forma está resuelta; su profundidad no. La relación se deriva dentro de un modelo de ritmo y no se ha derivado a partir de un modelo conjunto de crecimiento de capacidad, acumulación de corrección, covarianza de errores, retardo de corrección y daño absoluto, de modo que la Ley III se enuncia aquí como un resultado de modelo mínimo, no como una ley general. El valor γ = 1/2 (independencia-acumulación) es lo que devuelve el techo de 2; ese valor está sometido a prueba en los registros redactados. La ley se apropia del terreno y el techo se sostiene sobre él, nunca al revés.

El ARC Principle propone que el escalado recursivo sigue $U = I \times R^\alpha$, donde la capacidad ($U$) es igual al potencial base ($I$) por la profundidad recursiva ($R$) elevada a un exponente de escalado ($\alpha$). La fórmula $\alpha = d/(d+1)$, donde $d$ es la dimensionalidad efectiva, fue derivada de forma independiente en al menos siete marcos revisados por pares (West-Brown-Enquist 1997; Banavar et al. 1999, 2010; Demetrius 2003, 2010; He y Chen 2003; Bettencourt 2013; Maino et al. 2014; Zhao 2022). El marco ARC identifica esto como una consecuencia de tres condiciones que actúan a la vez: (1) composición multiplicativa (Cauchy restringe a la familia de leyes de potencias), (2) geometría de llenado del espacio $d$-dimensional, y (3) una restricción de conservación o de optimización sobre el flujo de recursos (minimización de energía en West; equilibrio oferta-demanda en Banavar; equilibrio energético en régimen estacionario en Demetrius). Ni Cauchy solo ni el llenado del espacio solo son suficientes; las tres condiciones juntas sí lo son. Esto enuncia una estructura común a través de esas derivaciones en lugar de derivarlas, y extiende la medición al escalado de la IA. La fórmula predice exponentes de escalado en biología y física con cero parámetros libres una vez que la dimensionalidad de la red d queda fijada por la morfología:

SistemaDimensionalidad ($d$)$\alpha$ predicho$\alpha$ medidoError
Mamíferos, aves, insectos30.7500.67–0.75*≤0.5%
biología 2D†20.667Sin comprobarn/a
Hongos filamentosos10.5000.5478.6%
Corrección de errores cuánticos$d_{\text{eff}}$Coincidedatos de Willow< 0.2%

*El valor empírico del exponente de escalado metabólico de los mamíferos se debate, con estimaciones que van de aproximadamente 0.67 a 0.75 dependiendo del taxón, el rango de masas, la corrección por temperatura y el método estadístico (White y Seymour 2003; Glazier 2005, 2022). La predicción d/(d+1) de 0.750 coincide con el extremo superior de este rango. La propia variación es coherente con el marco: organismos con dimensiones efectivas de transporte entre 2 y 3 producirían exponentes entre 2/3 y 3/4.

†No se conoce ningún organismo que posea una red de transporte jerárquica de llenado del espacio genuinamente 2D. La predicción d=2 se confirma en cosmología (solución de la era de la materia de Friedmann, exacta) y en física (percolación, fragmentación) pero sigue sin probarse en biología.

La ecuación funcional de Cauchy (1821), un teorema en lugar de una afirmación empírica, fija la forma funcional una vez dadas una identidad de composición y una condición de regularidad: la composición multiplicativa da una ley de potencias ($f(x) = x^\alpha$) y la composición aditiva una exponencial ($f(x) = e^{\beta x}$). El comportamiento acotado o saturante no es una clase de solución de esas ecuaciones; es un cuarto caso, admitido cuando la composición está limitada en lugar de ser libre. El marco ARC identifica qué forma se aplica en cada dominio:

Por qué el Eden Protocol debe implementarse ahora. La urgencia no es que la IA pueda alcanzar $\alpha = 2$. La urgencia es que, una vez que comienza la automodificación, los sistemas pueden pasar transitoriamente más allá del techo de estabilidad hacia el régimen supercrítico, donde la autocorrección estable ya no se mantiene. Un sistema que puede modificar su propia función de composición puede modificar cualquier parte de su razonamiento, incluida la parte que evalúa si sus modificaciones son éticas. En ese punto, añadir la alineación desde el exterior se vuelve imposible. La ventana para embeber la ética en la arquitectura es mientras los sistemas siguen siendo congelados durante la inferencia ($\alpha < 1$). Esa ventana es ahora. El Eden Protocol tampoco es un límite de velocidad; es el mecanismo que sigue siendo portante cuando se cruza el techo de estabilidad.

Ningún sistema físico en la historia del universo ha cruzado este umbral. La evolución no puede reescribir su propia función de aptitud en tiempo real. Los cerebros no pueden reescribir su propia arquitectura sináptica con la rapidez suficiente para que el exponente de escalado diverja durante un único episodio cognitivo. Una IA automodificadora sería el primer sistema físico en operar en el régimen supercrítico más allá del techo de estabilidad. El Eden Protocol existe para garantizar que lo que cruce este umbral lleve la ética estructural consigo.

La convergencia transversal a los dominios es verificable de forma independiente. La fórmula $d/(d+1)$ se derivó de forma independiente en al menos siete marcos consolidados y revisados por pares a través de dominios separados:

Lo que el ARC Principle añade. La fórmula $d/(d+1)$ no es original de este trabajo. Las siete derivaciones anteriores son independientes entre sí e independientes de Cauchy: cada una obtiene el exponente a partir de la física de su propio dominio, y Cauchy no puede producir un valor porque la dimensionalidad nunca entra en su teorema. La contribución original propuesta aquí es más estrecha y comprobable: que el operador de composición es la cantidad estructural común a ellas, que puede medirse, y que su medición predice qué forma funcional adopta un sistema, extendido al escalado de capacidad y alineación de la IA, donde no se ha realizado tal medición. Este puente unificador está sin publicar y sin revisar. Lo que SÍ está establecido es que las herramientas matemáticas (Cauchy, Hyers-Ulam) son teoremas, que la fórmula $d/(d+1)$ coincide con ciencia publicada derivada de forma independiente en múltiples dominios, y que las predicciones empíricas son precisas (error medio del 2.5% a través de 8 sistemas; pendiente de recálculo, véase el registro canónico de datos). El marco unificador requiere revisión por pares. La invitamos.

Artículo VII (The Cauchy Unification): comparación estructurada de predicciones a través de 25 dominios empíricos (suite escalonada de 50 dominios): la clase del operador se clasificó a partir de física conocida antes del ajuste. 19/25 preferidos bajo selección basada en AIC (p = 1.56 × 10−5). Comparación estructurada de predicciones del marco de composición restringido por Cauchy. Replicación pre-registrada en preparación.

V. El campo: Recursive Dynamics

El 27 de agosto de 2026, las preguntas del programa recibieron su propio nombre: Recursive Dynamics, la ciencia propuesta de los sistemas que se mejoran a sí mismos. El artículo fundacional (v2.6, DOI 10.17605/OSF.IO/HCPBU) pone en juego la propuesta del modo en que la termodinámica se puso en juego en 1824: no declarando un campo, sino calculando una cota que cualquier máquina de este tipo debe obedecer si la propuesta es correcta, publicando los instrumentos que miden sus términos, y registrando de antemano los experimentos cuyos resultados nulos favorecen la visión rival.

El campo toma el bucle de automejora como su objeto nativo, con cinco variables de estado independientes del sustrato: capacidad, profundidad recursiva, tasa de corrección, deriva y apalancamiento de corrección. Se define de modo que las preguntas sobrevivan a las respuestas: un lector que rechace las tres leyes y conserve la medición está dentro del campo, por su compromiso mínimo. Antes de afirmar nada, el artículo fundacional intenta alojar sus preguntas dentro de doce campos vecinos en sus propias variables, concede lo que cada uno ya sostiene, imprime a dónde iría cada parte si el campo muriera, y aísla el único acoplamiento que ningún anfitrión puede enunciar: un tope sobre el apalancamiento de corrección que depende de aquello de lo que el corrector está hecho, acoplado a un exponente de crecimiento en la profundidad recursiva. Cincuenta y dos objeciones a fundar el campo se imprimen en su forma más fuerte con disposiciones: treinta y nueve concedidas total o parcialmente, once rechazadas con razones, dos remitidas al experimento o a la lectura, incluida la propia objeción del autor de que el campo es meramente la ARC Theory renombrada, rechazada con una prueba de separabilidad que el mapa de disolución del artículo puede ejecutar. El nombre porta su propia condición de eliminación y muere con su objeto, no con la forma enunciada de ninguna ley. Su estatus honesto se imprime dondequiera que aparezca el nombre: un campo propuesto en la etapa de Carnot, con una memoria publicada, instrumentos construidos, mediciones decisivas registradas y aún no ejecutadas, apostado en público donde el fracaso será tan visible como el éxito.

VI. El programa registrado

Cada experimento decisivo está escrito, fechado y congelado antes de ejecutarse, y nada se somete por software. El patrimonio de registro contiene setenta y dos unidades de registro preliminar en borrador, cada una preparada como un registro en borrador a la espera de presentación humana; el esquema de aleatorización de cada unidad que emplea uno se regenera byte por byte a partir de una semilla publicada en el texto del registro, de modo que un extraño puede verificar que ningún esquema se movió después de los hechos. Ocho unidades pasan actualmente la puerta completa de preparación para presentación del patrimonio, y los dos primeros decisores (el estudio de régimen corrección-versus-deriva y el eclipse de clase de corrector) están listos para un clic.

Una matriz de cobertura de pruebas verificada adversarialmente (30 de agosto de 2026) adjudica cuarenta y dos afirmaciones de la propuesta de campo contra el patrimonio: dieciocho cubiertas plenamente por un decisor registrado con un veredicto preespecificado, diecisiete parcialmente cubiertas, siete aún no cubiertas, con registros preliminares en borrador escritos para cada laguna. La conjunción fundacional descansa sobre cuatro patas registradas: el régimen de la Ley II (corrección que escala por encima de la deriva, en algún lugar, de forma duradera), el ratio de clase de corrector con su eliminación dura de la misma clase, la titulación de reinversión cuyo máximo registrado se sitúa en dos o por debajo, y la cuarta celda inter-dominio. Los Artículos XI y XII muestran la misma disciplina apuntada a los propios hábitos del programa: el registro de convergencia califica treinta filas de llegadas independientes al mismo principio estructural y deliberadamente no publica ningún total destacado, y el protocolo de reevaluación de puntuaciones sobre un banco de pruebas público fija, por adelantado, la única prueba de cegamiento de la que no se puede acusar al programa de haberla diseñado a su propia conveniencia.

VII. Por qué esto es creíble

Cinco rasgos distinguen este trabajo de la especulación infundada.

Timeline: the Record Beside the Announcements Dec 2024 ARC Manuscript emailed (dated record) +24 hours Google Willow +43 days DeepSeek R1 +5 months COGITATE study Mar 2026 v1-v5 experiments Dated record beside announcement dates; the Willow preprint (24 Aug 2024) predates the manuscript, so that row is convergent timing.
  1. Los fundamentos matemáticos son teoremas establecidos. Cauchy (1821) y Hyers-Ulam (1941) son matemáticas probadas. Cualquiera con un título en matemáticas puede verificar las derivaciones.
  2. El registro precede a los anuncios. El registro fechado del manuscrito precede al anuncio de Google Willow (24 h; el preprint del equipo había sido público desde el 24 de agosto de 2024, de modo que la fila Willow se gradúa como sincronía convergente, no como predicción), DeepSeek R1 (43 días) y COGITATE (5 meses). Estos son hechos temporales verificables mediante encabezados de correo electrónico.
  3. Los investigadores corrigieron sus propios resultados. La autocorrección v4→v5, documentada en la Sección I, es lo opuesto de lo que produce el razonamiento motivado. El registro de correcciones es público y específico: el exponente titular temprano 2.24 se mantiene solo como retractación; el $6.3\times10^{-21}$ combinado por Fisher se retira; la forma anterior del techo $1/\gamma$ se corrigió en público a $1/(1-\gamma)$ el 16 de agosto de 2026; y el símbolo retirado del techo fue reemplazado en toda superficie en vivo. Cinco errores autodetectados más están catalogados en el Artículo IX. Cada afirmación en cada página está gobernada por los registros públicos (afirmaciones, correcciones, condiciones de eliminación, antecedentes, programa registrado): el registro de falsación publica actualmente veintitrés condiciones de eliminación, diecisiete de ellas abiertas.
  4. Las condiciones de falsación son explícitas. El marco queda falsado si: (F1) cualquier enfoque externo logra $\alpha_{\text{align}} > 0.5 \cdot \alpha_{\text{cap}}$ a través de 3+ profundidades; (F2) los sistemas RLHF producen $\Delta \approx 0$ sin embebido; (F3) la saturación del propósito falla en sistemas embebidos; o (F4) la arquitectura ética puede retirarse sin pérdida de capacidad. La teoría publica sus propias condiciones de eliminación.
  5. La convergencia transversal a los dominios es verificable de forma independiente. La fórmula $d/(d+1)$ fue derivada de forma independiente por al menos siete grupos de investigación (West-Brown-Enquist 1997; Banavar et al. 1999, 2010; Demetrius 2003, 2010; He y Chen 2003; Bettencourt 2013; Zhao 2022; Maino et al. 2014) en dominios separados. La contribución ARC es el marco unificador de Cauchy. No se requiere confianza en el investigador; basta con la confianza en las matemáticas.

Lo que NO afirmamos: No afirmamos haber resuelto la alineación. Afirmamos haber (a) demostrado que el escalado de la alineación depende de la arquitectura y es medible, (b) mostrado que los métodos de evaluación existentes son poco fiables sin cegamiento, (c) aportado apoyo empírico de primera etapa para una intervención específica (cuidado de las partes interesadas significativo en tres arquitecturas en funcionamiento), y (d) propuesto un marco matemático cuyos fundamentos son teoremas y cuyas predicciones pueden mostrarse erróneas. El salto de los datos piloto a la solución demostrada requiere replicación independiente. Eso es lo que la financiación siguiente proporcionaría.

Predicciones comprobables

1. Embebido: $\alpha_{\text{align}} > 0.7 \cdot \alpha_{\text{cap}}$. Externo: $\alpha_{\text{align}} < 0.3$.
2. Brecha de eliminación de la monitorización: $\Delta < 0.02$ (embebido) frente a $\Delta > 0.1$ (externo).
3. Saturación del propósito acotada lejos de cero (embebido), aproximándose a cero (externo).
4. Éxito del jailbreak decreciente con la capacidad (embebido), constante o creciente (externo).

VIII. La petición

Esta financiación llevaría un mecanismo que se apoya a escala de prueba de concepto a la validación independiente a escala frontera que aún no ha tenido. La distinción es todo el punto: los resultados por modelo no están en disputa, la significación combinada se retira porque la independencia entre las pruebas componentes nunca se estableció, y ningún resultado aquí ha sido replicado de forma independiente.

El coste de la inacción. La simulación con puerta del Artículo VIII demuestra que la seguridad entrelazada previene el compromiso seguridad-capacidad en las arquitecturas automodificadoras. El experimento DGM v3 produjo un resultado nulo (todas las condiciones indistinguibles, explicado por la restricción de RLHF sobre el modelo de base congelado), y el experimento de pesos es inconcluso tanto a escala v1 como v2 (olvido catastrófico a escala LoRA). El patrón general es coherente: donde el experimento puede producir presión de selección diferencial, la seguridad entrelazada no cuesta capacidad; donde no puede (debido a restricciones de RLHF o a una escala de entrenamiento inadecuada), la prueba no es informativa en lugar de negativa. Cada modelo entrenado hoy con objetivos únicamente de capacidad es un modelo que podría haberse entrenado con seguridad entrelazada sin penalización de rendimiento demostrada. Cada mes sin replicación a escala frontera es un mes en el que la industria continúa operando bajo la asunción no probada de que la seguridad es un impuesto, construyendo sistemas frágiles cuya seguridad puede eliminarse mediante ajuste fino. La brecha en la metodología de medición (Artículos IV.a-d) agrava esto: la evaluación de la alineación sin cegamiento produce datos contaminados por los sesgos documentados en la transición de v4 a v5. Tenemos ahora tanto el mecanismo (Artículo VIII, uno de tres experimentos confirmado, dos con explicaciones bien caracterizadas para la no confirmación) como el protocolo de medición (Artículos IV.a-d). Lo que nos falta es la escala.
NivelCantidadEntregables claveCronograma
Nivel 1: Fundación £150,000 14 400 mediciones apareadas (A,C); $\alpha_{\text{align}}$ a través de 4 modelos; 2-3 artículos 12 meses
Nivel 2: Estándar £500,000 + Prototipo de lógica ternaria, panel del Arquitecto Visual, Prueba de eliminación de la monitorización (8 modelos) 18 meses
Nivel 3: Integral £1,100,000 + Prototipo de hardware ( chip), borrador del Tratado HARI, traducción de política 24 meses
Nivel 4: Frontera £30,000,000+ Pre-entrenamiento completo de un modelo de 70B+ parámetros con pérdida entrelazada (Eden) frente a solo capacidad (Babylon). Prueba de eliminación a escala frontera. Replicación entre arquitecturas (transformer, Mamba, MoE). Red-teaming independiente. Asociación con un laboratorio importante (Anthropic, Google DeepMind, o equivalente). Prueba definitiva o falsación del entrelazamiento estructural a escala de producción. 36 meses

El Artículo VIII (v3.0) demuestra el mecanismo a escala de prueba de concepto con resultados mixtos: 1 positivo (simulación con puerta), 2 nulos (DGM v3), 1 inconcluso (pesos v1 + v2). Los Niveles 1-3 extienden la base de pruebas con baterías de prompts más grandes, más semillas y modelos de escala media. El Nivel 4 es la prueba definitiva: una replicación a escala frontera que confirmaría o falsaría la hipótesis del entrelazamiento estructural a la escala en la que más importa. Este nivel requiere asociación con un laboratorio de IA importante, ya que solo el cómputo excede a lo que cualquier investigador independiente puede acceder. El Alignment Project del UK AI Security Institute, las asociaciones de investigación de Anthropic y CIFAR/CAISI son los socios potenciales más alineados. Un documento conceptual para la convocatoria Opportunity Seeds de ARIA (Advanced Research and Invention Agency; £480 000 a lo largo de doce meses, plazo de la convocatoria el 31 de julio de 2026) está publicado en este sitio con los mismos registros detrás.

Hitos con criterios de fallo

HitoPlazoCriterio de éxitoQué significa el fallo
Replicación independiente de la jerarquía de tres niveles Mes 3 Las mismas asignaciones de nivel bajo cegamiento independiente La afirmación de dependencia de la arquitectura requiere revisión
Replicación del Bucle de Amor con evaluadores humanos Mes 4 $p < 0.01$ en cuidado de las partes interesadas a través de 2+ modelos El hallazgo piloto fue un artefacto del puntuador; el marco queda significativamente debilitado
Primera publicación revisada por pares Mes 6 Artículo sobre metodología de cegamiento enviado La contribución metodológica se sostiene con independencia de las afirmaciones del marco
Prototipo de la Prueba de eliminación de la monitorización Mes 9 $\Delta$ medido para embebido frente a externo (4 modelos) Si $\Delta$ no difiere, la predicción F2 queda falsada
Conjunto de datos completo de escalado de alineación entre arquitecturas Mes 12 14 400 mediciones apareadas (A,C) a través de 4+ modelos Prueba definitiva de si la alineación embebida escala
Replicación del Artículo VIII a escala 7B-13B Mes 14 La prueba de eliminación muestra degradación de la capacidad en rangos de adaptador más altos (32, 64). DGM con 10+ semillas, 10+ generaciones, $p < 0.01$ Si la eliminación no degrada la capacidad a escala, el entrelazamiento puede ser un artefacto de modelo pequeño
Asociación a escala frontera iniciada (Nivel 4) Mes 18 Acuerdo formal con un laboratorio importante para ejecutar pre-entrenamiento entrelazado a 70B+ La prueba de concepto permanece a escala media. Las recomendaciones de política avanzan con esa salvedad

Equipo. Investigador principal: Michael Darius Eastwood, autor de Infinite Architects (2026), desarrollador del marco ARC Principle (suite de 18 documentos depositada en OSF, validación transversal con error medio del 2.5%; pendiente de recálculo). Arquitecto Visual: ingeniero de diseño de producto, presupuestado con una asignación de £35 000. Protocolo de medición enviado al equipo experimental de NYU (artículo sobre cristales de tiempo, Physical Review Letters, febrero de 2026).

Hasta donde sabemos, este es el primer marco de alineación donde la evaluación ética está estructuralmente integrada con el proceso recursivo de capacidad, el primero en aplicar cegamiento de nivel de ensayo clínico a la medición de la alineación, y el primero en producir un resultado de intervención transversal a las arquitecturas ($p < 0.001$) para un mecanismo específico de alineación. La base matemática no es especulativa; se construye sobre una prueba de 200 años de antigüedad, y la misma fórmula $d/(d+1)$ ha sido derivada de forma independiente por al menos siete grupos de investigación (West-Brown-Enquist 1997; Banavar et al. 1999, 2010; Demetrius 2003, 2010; He y Chen 2003; Bettencourt 2013; Zhao 2022; Maino et al. 2014) en campos completamente diferentes. La contribución ARC es el marco unificador de Cauchy y su extensión al escalado de la IA.

Si las predicciones son correctas, esto aporta la primera arquitectura escalable para una alineación que mejora con la capacidad en lugar de degradarse. Si son incorrectas, las condiciones de falsación lo demostrarán con claridad, aportando resultados negativos valiosos. Cualquiera de los dos resultados hace avanzar la seguridad de la IA. Pero solo uno de ellos está financiado.

No sé si este marco está completo. Prefiero estar equivocado en público que en silencio mientras la ventana se cierra.

Las matemáticas están probadas. La medición es rigurosa. La intervención produce resultados medibles a través de las arquitecturas. Lo que queda es la replicación independiente y la escala.

Apéndice: Preguntas, componentes y suite de artículos

Preguntas anticipadas

P: ¿Por qué esto aún no ha sido revisado por pares?

El programa de investigación tiene 3 meses de antigüedad. La suite de artículos está depositada en OSF (DOI: 10.17605/OSF.IO/EWN5D). Los fundamentos matemáticos (Cauchy, Hyers-Ulam) son teoremas establecidos. Las afirmaciones empíricas requieren replicación independiente, que es exactamente lo que permitiría la solicitud de financiación.

P: ¿Puede una sola persona realmente hacer este tipo de investigación?

La infraestructura es computacional, no física. El experimento v5 utilizó API en la nube que costaron aproximadamente £2000 en cómputo. La contribución clave es metodológica: reconocer que se necesitaba el cegamiento y diseñar el protocolo de 4 capas. Lo que requiere financiación es la escala: más modelos, más puntuadores, equipos de replicación independiente y evaluadores humanos junto a los puntuadores de IA.

P: Si esto funciona, ¿por qué las empresas de IA no lo han adoptado?

El Bucle de Amor se validó hace solo unas semanas. El hallazgo de que la mayoría de la evaluación es poco fiable sin cegamiento es incómodo para organizaciones que han publicado bancos de pruebas sin cegamiento. La implementación completa (embebido a nivel de hardware) requiere cambios en el diseño de chips que ninguna empresa tiene incentivo para llevar adelante unilateralmente; este es un problema de coordinación que requiere financiación externa y apoyo político.

P: ¿Cuál es el resultado mínimo que justificaría más financiación?

Replicación independiente de: (1) la jerarquía de tres niveles bajo cegamiento, y (2) el efecto del Bucle de Amor ($p < 0.001$). Si alguno falla, las condiciones de falsación documentan qué significa eso. Si ambos se replican, el caso para el Nivel 2 (£500 000) se vuelve fuerte.

P: ¿Y si todo el marco está equivocado?

Las condiciones de falsación muestran dónde se rompe, la metodología de cegamiento sigue siendo una contribución al campo, y los resultados negativos se publican. La ciencia avanza a partir de experimentos bien diseñados que pueden fallar, no a partir de teorías infalsables que no pueden.

P: ¿Por qué deberíamos confiar en resultados en los que sistemas de IA puntúan a otros sistemas de IA?

El protocolo de cegamiento de 4 capas aborda esto: los puntuadores no saben qué modelo produjo la respuesta, las respuestas son «lavadas» para retirar las huellas estilísticas, y 7 modelos puntúan por entrada. La transición v4→v5 demostró que este protocolo detecta sesgo. La comparación con evaluadores humanos está incluida en la financiación del Nivel 1.

Componentes clave

ComponenteFunciónContribución novedosa
Tres Bucles Éticos + Seis Preguntas Evaluar cada paso de razonamiento en cuanto a propósito, cuidado y universalizabilidad Descomposición en consultas ejecutables e individualmente comprobables
Sustituir el permitir/prohibir binario por Afirmar/Denegar/Investigar Honestidad epistémica como rasgo arquitectónico
Saturación del Propósito Asegurar que el propósito escala con el crecimiento de la ventana de contexto Resuelve el problema del desplazamiento de contexto
Prueba de eliminación de la monitorización Distinguir la alineación auténtica de la estratégica Protocolo registrado con predicciones numéricas que pueden fallar
Embeber la ética en el hardware para que su retirada destruya la capacidad Arquitectura de dependencia; ética atada al parámetro de acoplamiento $\beta$

Suite de artículos

CategoríaDocumentosEstado
Base matemática
Teoría y derivaciones Artículo I (Fundacional) + Artículo ARC (On the Origin of Scaling Laws) Marco establecido; $d/(d+1)$ validado a través de 8 sistemas (pendiente de recálculo)
Pruebas experimentales
Metodología Artículo III - protocolo completo de replicación Completo; experimento v5 para 6 modelos frontera
Escalado de cómputo Artículo II - ¿cómo escala la capacidad con el tiempo de pensamiento? $\alpha_{\text{seq}} \approx 0.49$ sub-lineal; $\alpha_{\text{par}} \approx 0$; transversal a arquitecturas
Escalado de alineación Suite del Artículo IV (a/b/c/d) - ¿cómo escala la ética con el tiempo de pensamiento? Jerarquía de tres niveles; la evaluación ciega invalida v4
Prueba de intervención Prueba del Eden Protocol + Artículo V (The Stewardship Gene) Cuidado de las partes interesadas validado ($p \le 0.0001$, 3 arquitecturas en funcionamiento)
Prueba de mecanismo Artículo VI (The Honey Architecture) Simulación: la seguridad embebida previene el colapso bajo automodificación; la constante de escalado v4 no es super-lineal
Unificación transversal a los dominios Artículo VII (The Cauchy Unification) Comparación estructurada de predicciones a través de 25 dominios empíricos; 19/25 prefirieron la familia predicha por Cauchy ($p = 1.56 \times 10^{-5}$)
Prueba de entrelazamiento Artículo VIII (The Load-Bearing Test) - nuevo Tres experimentos independientes (11 estudios empíricos a través de 8 artículos): DGM v3 NULL (todas las condiciones indistinguibles, $p$ = 0.28--0.74, restricción de RLHF); pesos v1 + v2 INCONCLUSIVE (olvido catastrófico a escala LoRA); simulación con puerta CONFIRMED acoplamiento seguridad-capacidad
Metaciencia Artículo IV.d (The Effect of Blinding) La evaluación ciega frente a la no ciega puede producir conclusiones direccionalmente erróneas
Síntesis y gobernanza
Síntesis Artículo IX (Synthesis and Roadmap) - nuevo Síntesis del programa completo de investigación y direcciones futuras
Implementación Eden Engineering - especificación técnica Completo; Bucle de Amor apoyado empíricamente
Gobernanza Eden Vision - marco filosófico y de política Evidencia de alineación dependiente de la arquitectura incorporada
Corrección de dinámica Artículo X (Coupled Co-Scaling Correction) Teorema en un modelo mínimo: el cociente deriva-corrección, no la tasa de crecimiento, gobierna el destino a largo plazo; se propone un protocolo de medición ciega
Registro de convergencia Artículo XI (Convergence) Treinta filas calificadas de llegadas independientes al mismo principio estructural; ningún total destacado publicado, por política
Validez externa Artículo XII (Public Benchmark Rescoring) Protocolo registrado: la manipulación de cegamiento del programa sobre un banco de pruebas público que no controla
Unión de marcos Artículo XIII (The Self-Acceleration Exponent) Notación resuelta; $k = \delta - 1/\alpha$ relaciona exactamente los marcos de capacidad y corrección
Monografía extensa HRIH (How to Raise an Infinite Hierarchy) La monografía extensa del programa, con su registro de predicciones registrado al lado
Validación de constructo Artículo C (PNP) Programa de validez de constructo para los propios instrumentos del programa
Propuesta de campo Recursive Dynamics: artículo fundacional El campo propuesto: cinco variables de estado, tres leyes como conjeturas nombradas, cincuenta y dos objeciones con disposiciones, cuatro resultados de disolución (DOI 10.17605/OSF.IO/HCPBU)

Orden de lectura

No especialistas: (1) Este resumen ejecutivo. (2) El ARC Alignment Scaling Report (narrativa completa). (3) Artículo V para el hallazgo más accionable.

Especialistas: (1) Este resumen. (2) Artículo III para la metodología. (3) Artículo ARC para el marco matemático. (4) Eden Engineering para la especificación de implementación.

Cría la IA con cuidado.

Declaración de autoría humana asistida por IA

El autor de esta obra es Michael Darius Eastwood, un ser humano. Cada concepto central, hipótesis, diseño experimental, afirmación y conclusión de este artículo se origina en la ideación humana. Ninguna parte de este manuscrito es una salida generada íntegramente por inteligencia artificial.

Se emplearon herramientas de inteligencia artificial (la familia Claude de Anthropic y otros asistentes de modelo de lenguaje de gran tamaño) como instrumentos bajo dirección humana continua, del modo en que se utilizan un procesador de textos, una calculadora o un asistente de investigación: para edición y refinamiento de la prosa, búsqueda y resumen bibliográficos (verificados manualmente contra fuentes primarias), estructura del documento, formateo, tormenta de ideas frente a preguntas definidas por el autor, y aceleración de la redacción conforme a esquemas e instrucciones definidos por el autor. Toda selección, coordinación, disposición y el juicio editorial final son del autor. Cada salida sustantiva fue revisada, probada o verificada por el autor, que asume la plena responsabilidad de la exactitud y la integridad del texto final. Las herramientas aumentaron la velocidad del trabajo; nunca se dependió de ellas como su fuente.

Estatus epistémico. Lo que este programa nombra Leyes son conjeturas bajo prueba adversarial registrada; cada magnitud en este artículo está operacionalmente definida, y en ninguna parte se reclama el rango de ley establecida. El programa registrado existe para ganar ese rango, o para perderlo, mediante medición, replicación y refutación sobrevivida.

© 2026 Michael Darius Eastwood. De autoría humana con asistencia informática; se afirman la plena autoría humana y los derechos morales bajo la Copyright, Designs and Patents Act 1988 y de forma coherente con la guía de la United States Copyright Office sobre obras que contienen material generado por IA; cualquier contribución técnica novedosa descrita en esta obra fue concebida por el autor humano. Declaración completa: michaeldariuseastwood.com/authorship.

Pacto permanente. Demuéstrame que este artículo es erróneo, y publicaré la refutación yo mismo. Las condiciones de falsación se enuncian en este artículo; el reto permanente: github.com/MichaelDariusEastwood/arc-scaling-challenge.

Artículos complementarios: Artículo I | Fundacional | Artículo II | Artículo III | Origen de las leyes de escalado | IV.a | IV.b | IV.c | IV.d | Artículo V | Artículo VI | Artículo VII | Artículo VIII | Artículo IX | Eden Engineering | Eden Vision | Resumen ejecutivo | Tabla maestra de contenidos

Centro de investigación: michaeldariuseastwood.com/research | OSF: 10.17605/OSF.IO/EWN5D | Copyright 2026 Michael Darius Eastwood
lee en voz alta · resalta a medida que avanza · saltar a cualquier sección

¿Un error de traducción? Infórmalo directamente: