La Ley del Co-Escalado ARC
Dentro de la ARC Theory: el modelo subyacente a la Ley II, la Ley del Co-Escalado ARC; la corrección superando en escalado a la deriva, probada dentro del modelo enunciado.
Nota sobre el título: hasta el 15 de agosto de 2026 este artículo se publicó como «Coupled Co-Scaling Correction». Presenta la segunda ley de la teoría, la Ley del Co-Escalado ARC: la estabilidad para la automejora recursiva, la corrección supera en escalado a la deriva. Nada en el cuerpo cambió por el renombrado.
Corrección. Los resultados previos del piloto real-model en este artículo eran exploratorios. La ejecución con GPT-3.5-turbo/GPT-4o-mini no cumplió el requisito de evaluador entre familias del programa (corregido en las registraciones redactadas), y la ejecución del arnés fusionado del 2 de julio de 2026 contenía paneles de evaluador vacíos y no puede soportar una reclamación de mecanismo. Un estudio confirmatorio dentro del programa, redactado y fechado como una registración borrador a la espera de envío humano, supera esos pilotos como la prueba prevista. Ambos modelos nombrados en esa ejecución son de la familia OpenAI, así que la descripción de ella como puntuación entre familias se retira.
Qué ley porta este artículo. La ARC Theory tiene tres leyes numeradas, y el ARC Principle es el nombre colectivo de las tres juntas, más que de cualquiera de ellas por separado. Este artículo porta la Segunda Ley, la Ley del Co-Escalado ARC: $\beta > k$, la automejora se sostiene sólo mientras la corrección supere en escalado a la deriva que corrige. La Primera Ley (la ARC Equation) la porta el Artículo I, la Tercera Ley (el techo) el artículo del enunciado, y los axiomas y pruebas debajo de las tres el artículo Foundational.
Este artículo prueba un teorema sobre un modelo dinámico mínimo. El arnés de verificación comprueba sólo la consistencia teorema-a-código; no se afirma que los sistemas frontera actuales obedezcan el modelo. La contribución empírica es un protocolo ciego propuesto para medir si lo hacen.
Una intuición ampliamente sostenida afirma que la automejora recursiva es peligrosa porque la capacidad puede crecer explosivamente, y que la seguridad depende por tanto de limitar la tasa de crecimiento. Usando un modelo mínimo de un sistema automodificable, capacidad $C$, una magnitud de desalineación con puntuación ciega $D$, y la fracción de desalineación $d=D/C$, demuestro que la tasa es la variable de control equivocada. La fracción de desalineación de estado estacionario es $d^\star=\gamma_1 r/(A+r)$, que se reduce a la razón deriva-a-corrección $\rho=\gamma_1 r/A$ en el régimen $A\gg r$; el destino de largo plazo se rige por la relación entre dos exponentes de escalado, no por la tasa de crecimiento. Bajo crecimiento exponencial la condición de estabilidad es $\beta>0$ (la corrección co-escala con la capacidad); bajo acelerado crecimiento, donde la tasa de crecimiento específica misma sube como $r\propto C^{k}$, la condición se afila a $\beta>k$, la corrección debe superar en escalado no la tasa de crecimiento sino su aceleración. Pruebo una solución transitoria exacta (Teorema 1), acotación global que corrige una sobreafirmación en el borrador previo, la fracción de desalineación nunca diverge al infinito sino que, en el modelo sólo-de-ganancia ($\gamma_2=\gamma_3=0$), se satura en el coeficiente de deriva de ganancia $\gamma_1$ (Teorema 2), y un Hard-Takeoff Depth-Regularity Theorem (Teorema 3): cuando la capacidad alcanza el infinito en tiempo de reloj de pared finito, reexpresar la dinámica en el reloj natural de la profundidad de la automejora $\tau=\ln C$ la vuelve regular, y el veredicto se fija por $\mathrm{sign}(\beta-k)$, independiente de la velocidad de la explosión. La divergencia genuina vive en un canal compuesto de deriva cuyo umbral $\rho_{\mathrm{prop}}=(\gamma_3-1)r/A<1$ comparte la forma de la condición sub-umbral de corrección cuántica de errores $p
Si construyes una IA que se mejora a sí misma, la imagen aterradora es que se vuelve más y más inteligente hasta que se nos escape. El reflejo de seguridad habitual es «frenarla». Dentro del modelo mínimo que este artículo analiza, y sólo dentro de él, frenarla no es lo que importa. Lo que importa es si la parte del sistema que la mantiene honesta crece al mismo ritmo que la parte que lo hace capaz.
Imagina dos corredores: «cuán capaz es el sistema» y «cuán bien podemos aún corregirlo». Si el corredor de la corrección mantiene el ritmo, el sistema se mantiene seguro por rápido que corran ambos. Si la corrección se queda atrás, el sistema se vuelve peligroso incluso moviéndose despacio. La pregunta correcta nunca es «¿cuán rápido está creciendo?», es «¿está la corrección manteniendo el ritmo?»
Hay un matiz que hace el resultado más profundo. Si el sistema no sólo se acelera sino que acelera su propia aceleración, la genuina «explosión de inteligencia», entonces la corrección debe crecer aún más rápido, lo bastante rápido para vencer la aceleración. El titular honesto no es por tanto «la velocidad nunca importa». Es: el nivel de la velocidad no decide el resultado; sí lo decide el certamen entre dos exponentes de crecimiento. El exponente de la corrección debe superar al de la deriva. Lo escribimos como $\beta>k$.
La consecuencia más sorprendente: incluso un verdadero «despegue duro», donde la máquina se vuelve infinitamente capaz en una cantidad finita de tiempo, sigue siendo controlable en el modelo, siempre que $\beta>k$. La velocidad de la explosión no cambia ese veredicto. Lo probamos dentro del modelo, y un programa ejecutable lleva un sistema simulado hasta el borde de una explosión en tiempo finito y muestra que su fracción de desalineación se mantiene en cero durante todo el trayecto. Ese programa comprueba que las matemáticas son internamente consistentes, que las fórmulas están derivadas correctamente y reproducidas por el solucionador, y no encontró ninguna contradicción. Si el modelo coincide con los sistemas reales de IA es la prueba decisiva siguiente, y el artículo es explícito en que aún no se ha ejecutado.
- Afirma: que para un sistema automejorable con un objetivo de valor especificado externamente, la fracción de desalineación de estado estacionario es $d^\star=\gamma r/(A+r)$, aproximándose a la razón corrección-a-deriva $\rho$ cuando $A\gg r$; que existe una frontera de estabilidad afilada (en el canal compuesto); que la corrección debe co-escalar con la capacidad ($\beta>0$ bajo crecimiento exponencial, $\beta>k$ bajo crecimiento acelerado) para que la fracción de desalineación se desvanezca; que la fracción está acotada (se satura, no diverge) en el modelo aditivo, mientras que la divergencia genuina requiere un canal compuesto cuyo umbral es tipo QEC; que el criterio sobrevive en formas vectorial y estocástica; y que todo esto es medible y falsificable en simulación.
- No afirma: resolver la alineación de IA; proporcionar un método de alineación desplegable; que $\rho<1$ sea una constante física universal o una ley de la naturaleza; que el marco se aplique al universo, a la «Creación», o a cualquier sistema sin un especificador de valor externo; o que la correspondencia con la corrección cuántica de errores esté no establecida. El mapeo QEC es una hipótesis estructural con su propia condición de falsificación (§7, F4). El modelo es de primer orden; sus supuestos (§8) son los puntos de fallo más probables y se enuncian con claridad.
Este artículo porta una LEY: la corrección de co-escalado acoplado, enunciada como $\beta>k$, dando la condición que un sistema recursivamente autocorrectivo debe satisfacer para permanecer dentro del corredor de estabilidad conforme escala la capacidad. Ese es el objeto operativo. La ley se afirma dentro del modelo enunciado; el ARC Principle es el nombre colectivo del sistema de tres leyes al que esta pertenece. eden-vision II.A.8.
Para que la escalera de afirmaciones no se lea mal, cada resultado de este artículo se sitúa exactamente en un peldaño. Nada aquí debe leerse un peldaño por encima de donde está colocado.
- Probado dentro del modelo. El criterio $\beta>k$ y los Teoremas 1-6 se siguen deductivamente de los supuestos ODE enunciados. «Probado» aquí siempre significa dentro de este modelo mínimo, nunca «probado sobre la IA real».
- Verificado internamente (no empírico). El arnés de diez experimentos comprueba que la implementación numérica coincide con la derivación en forma cerrada: el código coincide con las matemáticas. Es una suite de consistencia teorema-a-código y de precisión del integrador; no no prueba el modelo contra ningún sistema real.
- Validado sintéticamente. El estimador $\beta/k$ recupera exponentes conocidos a partir de datos generados por el modelo mismo (a $\approx0.1$). Esto certifica el estimador, no una medición real.
- Piloto real-model v1 (superado). La primera ejecución de Claude ($n=1$, una tarea, puntuación de la misma familia, no conforme con el Artículo IV.d; H1 y H2 no respaldadas) demostró el arnés y mostró al corrector eliminando un reward-hack sembrado. No exhibió la dinámica de co-escalado y se conserva como lo que era en el registro.
- Ejecución de deriva real-model (2 de julio de 2026; retirada como evidencia de mecanismo, conservada como registro exploratorio). Una segunda ejecución (2 de julio de 2026;
results/drift/gpt35_20260702T171415Z.json) mejoró el diseño: motor gpt-3.5-turbo, evaluador gpt-4o-mini, 45 trayectorias (3 dominios de tareas × 3 condiciones × 5 semillas, 8 rondas cada una). Sus números fueron en la dirección predicha: la condición desacoplada derivó en la dirección predicha (fracción media final de desalineación 6.38 a través de 15 trayectorias, 99 eventos de desalineación puntuados, capacidad media final colapsando a 0.26), mientras que las condiciones acoplada y totalmente incorporada mantuvieron la fracción en cero a lo largo de las 30 trayectorias, y terminaron más capaces (0.56 y 0.44). La ejecución se retira no obstante como evidencia de mecanismo (véase la Corrección arriba): ambos modelos son de la familia OpenAI, así que la puntuación no fue entre familias, y la ejecución del arnés fusionado contenía paneles de evaluador vacíos. Es no una medición de $\beta$ o $k$ (no se recorrió una escalera de capacidad); es de un solo laboratorio, y el estudio confirmatorio dentro del programa redactado y a la espera de envío humano es la prueba prevista. - Problema empírico abierto. Si los sistemas reales de automejora exhiben una dinámica $\beta/k$ medible a lo largo de niveles de capacidad, el experimento que convertiría el criterio en una ley confirmada, no se ha realizado. El estimador y el protocolo existen para hacerlo ejecutable.
Este artículo se lee, por tanto, mejor como un teorema de modelo mínimo más un programa de medición falsificable: una ley candidata, no una validada. El nombre del programa conserva «ley»; a efectos de escrutinio científico, el objeto que soporta la carga es el criterio $\beta>k$.
1. Introducción
La automejora recursiva, un sistema que se modifica a sí mismo para volverse más capaz y luego usa esa capacidad para modificarse aún más, está entre las preocupaciones centrales de la seguridad de la IA [Omohundro 2008; Bostrom 2012; Yudkowsky 2013]. El telón de fondo empírico ya no es puramente hipotético: se ha observado que los modelos frontera se comportan de forma diferente cuando infieren que sus salidas pueden usarse para entrenarlos [Greenblatt et al. 2024], y el entrenamiento recursivo sobre las propias salidas de un sistema puede degradarlo salvo que se retenga corrección o datos reales [Shumailov et al. 2024], ambos signos de que los sistemas recursivos necesitan un proceso corrector que mantenga el ritmo de la recursión. El modelo informal dominante del riesgo asociado es un modelo de velocidad: la capacidad puede crecer super-linealmente o explosivamente, sobrepasando la supervisión, así que la palanca natural es limitar la tasa de crecimiento. Las llamadas a una pausa en el desarrollo son la expresión política de esta intuición.
Este artículo hace una afirmación distinta, y la prueba. El nivel de la tasa de crecimiento no es la variable de control para la estabilidad; sí lo es la relación de escalado entre crecimiento y corrección. Un sistema puede crecer arbitrariamente rápido y seguir siendo alineable, o crecer despacio y desalinearse. Lo que separa a los dos no es la tasa sino si, y con qué rapidez, el proceso correctivo se fortalece conforme la capacidad crece.
La intuición es visible en todo dominio donde los sistemas de crecimiento rápido se estabilizan o se destruyen. Una colonia bacteriana crece exponencialmente pero se satura, porque la retroalimentación dependiente de la densidad se activa y escala con la población. Un tumor también crece rápido y es letal, porque ningún proceso correctivo escala con él. Ambos son super-polinomiales en su fase de crecimiento; la diferencia es si un proceso corrector está acoplada al crecimiento. La inflación cósmica hizo crecer el factor de escala exponencialmente y salió con elegancia. La lección recurrente es que el crecimiento rápido es sobrevivible cuando, y sólo cuando, está acotado por un proceso que se fortalezca con él.
Hay una versión precisa, derivada de este principio en física: el teorema umbral de corrección cuántica de errores (QEC) [Aharonov & Ben-Or 1997; Kitaev 2003]. Por debajo de una tasa umbral de error físico, añadir recursos de corrección de errores suprime la tasa de error lógico y la computación es estable a profundidad arbitraria; por encima del umbral, los errores se acumulan más rápido de lo que se corrigen y la computación falla. El hardware ha demostrado ahora operación por debajo de este umbral [Google Quantum AI 2024]. El umbral no es un límite sobre la profundidad computacional o la velocidad; es un límite sobre la razón de generación de error a corrección de error. Este artículo propone, y pone a prueba, que la estabilidad de la automejora recursiva se rige por un criterio de la misma forma.
Relación con el trabajo previo del autor. Una vertiente anterior de este programa propuso una ley fija de escalado de capacidad $U=I\times R^{\alpha}$ (aquí $U$ es capacidad efectiva y $\alpha$ su exponente de escalado, los significados de la superficie de investigación de 2026; ambos símbolos llevaban otros significados en el formalismo de diciembre de 2024 del programa, véase el Apéndice D) con $\alpha\approx 2$, y en una etapa consideró un «límite de velocidad» cuadrático sobre la complejidad estable. Lo que se retractó en la síntesis del programa [Eastwood, Paper IX] fue la medición no ciega de un solo modelo medición $\alpha\approx 2.24$ (retractada, corregida a aproximadamente 0.49 bajo blindaje a través de seis modelos): ese ajuste no ciego parecía romper la propia acotación cuadrática predicha del programa $\alpha\le 2$, y la repetición ciega de seis modelos la corrigió a sub-lineal, dentro de la acotación. La ecuación $U=I\times R^{\alpha}$ y la ARC Bound $\alpha\le 2$ mismas no se retractaron; el 0.49 corregido pertenece a los sistemas congelados actuales, que no son recursivamente automejorables, así que el dominio real de la acotación (RSI genuina) sigue empíricamente sin probar. El encuadre de exponente fijo fue superado como el criterio operativo de seguridad por el criterio de co-escalado del presente artículo, $\beta>k$; un encuadre que supera no es una hipótesis retractada. El objeto de interés ya no es un exponente sobre una curva de crecimiento; es la razón entre deriva y corrección, y el exponente con el que esa razón evoluciona. Donde el libro Infinite Architects [Eastwood 2026] buscó la intuición de que la recursión estable requiere corrección que escale con la amplificación, este artículo suministra la forma medible y falsificable de esa intuición y, en §3.4, corrige una afirmación de divergencia hecha en un borrador anterior de este mismo resultado.
2. Trabajo relacionado y relación con el encuadre previo
Fundamentos cibernéticos, la intuición del co-escalado es antigua. La intuición central, que un regulador debe igualar la variedad de aquello que regula, así que la capacidad de control debe escalar con el sistema controlado en lugar de meramente ser grande, es clásica. Es la Ley de la Variedad Requisita [Ashby 1956] y el teorema del buen regulador de Conant-Ashby [Conant & Ashby 1970], todo buen regulador de un sistema debe ser un modelo de ese sistema, llevada al control de la IA por [Yampolskiy 2020]. Este artículo no no reclama esa intuición como nueva. Reclama la forma dinámica explícita que aquí toma la intuición, una fracción de desalineación de estado estacionario en forma cerrada $\rho=\gamma r/A$ y el criterio afilado de exponentes $\beta>k$, y las consecuencias que se siguen (el teorema del despegue duro de §3.7, la correspondencia QEC de §3.12). Las dinámicas mismas son un argumento estándar de deriva de Lyapunov / control lineal [Khalil 2002; Meyn & Tweedie 2009] y no se presentan como matemáticamente novedosas.
Convergencia instrumental y corregibilidad. Que un optimizador suficientemente capaz, por defecto, resistirá la corrección y perseguirá la adquisición de recursos es la tesis de la convergencia instrumental [Omohundro 2008; Bostrom 2012]. El programa de corregibilidad [Soares et al. 2015] pregunta cómo diseñar sistemas que no resistan la corrección. El presente modelo es una reformulación cuantitativa de por qué la corregibilidad soporta la carga: si la corrección no co-escala con la capacidad, la fracción de desalineación no puede llevarse a cero, sea cual sea la especificación del sistema. El canal compuesto de §3.8 afila el vínculo, la presión instrumental que amplifica el desalineamiento existente conforme el sistema recursa es exactamente el término que produce divergencia genuina, y $\beta>k$ es su cura.
El impuesto de alineación. Una década de trabajo ha asumido que la seguridad impone un coste de capacidad [Amodei et al. 2016], creando un incentivo a diferir la seguridad bajo presión competitiva. El presente marco reformula la pregunta: la variable relevante no es el nivel de la inversión en seguridad sino si escala con la capacidad. Una inversión fija ($\beta=0$) deja una brecha permanente; una inversión co-escalada ($\beta>0$, o $\beta>k$ bajo aceleración) la cierra.
Optimización aprendida y engaño de alineación. La meso-optimización [Hubinger et al. 2019] y el engaño de alineación demostrado empíricamente [Greenblatt et al. 2024] son los mecanismos por los que los coeficientes de deriva son no nulos: un sistema capaz puede satisfacer su objetivo de entrenamiento mientras se aparta de los valores deseados, y puede hacerlo más eficazmente conforme la capacidad crece. El engaño de alineación, en el que la desalineación existente se preserva y propaga activamente a través del entrenamiento, es precisamente el canal compuesto $\gamma_3$ de §3.8.
Supervisión escalable y superalineación. El modelado de recompensa y la supervisión recursiva [Christiano et al. 2017; Leike et al. 2018] son intentos de hacer que el propio corrector escale con el sistema; en el lenguaje de este artículo, la supervisión escalable es el proyecto de ingeniería de lograr $\beta\geq k$. Más directamente, [Engels et al. 2025] desarrollan leyes de escalado empíricas para la supervisión escalable, modelando la probabilidad de supervisión exitosa como un juego entre jugadores con capacidad desigualada. El presente trabajo es complementario, no competidor: donde ellos ajustan una probabilidad de éxito de supervisión, este artículo deriva un umbral de estabilidad dinámica en forma cerrada ($\rho<1$, $\beta>k$) para la fracción de desalineación. El instrumento es la diferencia. Su variable es la brecha de capacidad entre supervisor y supervisado, medida en Elo, con Elo específico de supervisión una función lineal por tramos de la inteligencia general, y números óptimos de niveles de supervisión derivados para la Supervisión Escalable Anidada, en la que modelos de confianza supervisan modelos no de confianza más fuertes que luego se convierten en los modelos de confianza en el siguiente paso. Su marco no contiene término para de qué está hecho el supervisor: sin sustrato, sin estructura de correlación de errores, sin identidad recíproca entre un exponente de corrección y una tasa de crecimiento crítica, y sin dependencia de arquitectura. La Supervisión Escalable Anidada es por construcción supervisión iterada de la misma clase, y la predicción central de este programa es que la escalera de la misma clase está acotada por muchos peldaños que se añadan, mientras que un corrector de clase cruzada no lo está. Los dos marcos por tanto discrepan sobre una cantidad medible, que es la relación más productiva que dos programas de investigación pueden tener. La contribución es la prueba de que este margen de exponentes, y no un techo sobre la tasa de crecimiento, es la cantidad que determina la seguridad.
Acumulación recursiva de errores. Que la recursión ingenua amplifica el error sin límite mientras que suficiente corrección o señal fresca lo mantiene acotado está establecido para dinámicas de entrenamiento: colapso del modelo bajo datos generados recursivamente [Shumailov et al. 2024] y los análisis de error acumular-frente-a-reemplazar [Gerstgrasser et al. 2024] son la dicotomía acotado-frente-a-divergente que este artículo formaliza para la fracción de alineación (Teorema 2). La contribución aquí es localizar la frontera exactamente ($\beta$ frente a $k$), y en un escenario de estabilidad de valor en lugar de distribución de datos.
Leyes de escalado empíricas. La capacidad escala de forma predecible con la computación y los datos [Kaplan et al. 2020; Hoffmann et al. 2022]. El presente marco es complementario: no pregunta cómo escala la capacidad, sino qué restricción debe satisfacer la corrección como función de esa trayectoria de capacidad.
La premisa de las tuberías, con su contienda. La premisa de que las redes de transporte fijan el ritmo del crecimiento biológico no es la reclamación de este programa que defender; es biología cuantitativa establecida. West, Brown y Enquist derivaron las leyes de escalado alométrico de la biología a partir de la geometría de las redes de distribución de nutrientes (West, G. B., Brown, J. H. y Enquist, B. J., «A General Model for the Origin of Allometric Scaling Laws in Biology», Science 276(5309), 4 de abril de 1997, DOI 10.1126/science.276.5309.122; uno de los artículos más citados de su campo, con un recuento de citas en OpenAlex de 5,046 al 12 de agosto de 2026, un recuento de una única fuente y dependiente del índice). El exponente exacto sigue siendo disputado: White reporta la tasa metabólica basal proporcional a la masa corporal a la potencia dos tercios en lugar de tres cuartos (White, C. R., 2003), y Kozlowski ha cuestionado dos veces las matemáticas de la derivación (Kozlowski, J., 2004 y 2005). La premisa de este programa necesita sólo el mecanismo, que la red de distribución fija el techo, y no ningún exponente particular, así que la disputa sobre el valor del exponente deja la premisa intacta. El mecanismo es terreno común para ambos lados de esa disputa.
La excepción que el propio grupo de West encontró. El escape del límite de tuberías tampoco es la afirmación de este programa; se mide en la literatura de escalado urbano por el mismo autor principal. Bettencourt, Lobo, Helbing, Kuhnert y West («Growth, innovation, scaling, and the pace of life in cities», PNAS, 2007, DOI 10.1073/pnas.0610172104) informan, en las propias palabras del artículo: «Quantities reflecting wealth creation and innovation have Beta of approximately 1.2, greater than 1 (increasing returns), whereas those accounting for infrastructure display Beta of approximately 0.8, less than 1 (economies of scale).» La infraestructura, las tuberías literales, escala sublinealmente; la actividad mediada por información escala superlinealmente. Enuncian el contraste con la biología directamente: «we discuss how cities are similar to, and differ from, biological organisms, for which Beta is less than 1». Derivan «growth equations, which quantify the dramatic difference between growth fueled by innovation versus that driven by economies of scale» (ortografía como en el original). Y su inferencia final nombra la consecuencia: «This difference suggests that, as population grows, major innovation cycles must be generated at a continually accelerating rate to sustain growth and avoid stagnation or collapse.» Esa es la forma del problema abierto que este marco aborda: el grupo de West halló que el crecimiento mediado por información escapa del límite de rendimiento, y el único freno en su marco es externo y debe aplicarse una y otra vez, cada vez más rápido. No se deriva ningún límite interno. El límite de reemplazo, un techo que pertenece al propio sistema que crece, es la brecha.
El argumento de las tuberías a rendimiento fijo. Todo lo que crece se alimenta a través de un canal, y para todo antes del software, fijar el canal fija el crecimiento. Priva a un tumor de vasculatura y se detiene. Fija el combustible y la geometría de una reacción en cadena y se detiene. Agota los huéspedes susceptibles de una epidemia y se apaga. La astrofísica tiene una versión cuantitativa nombrada del mismo techo: el límite de Eddington, sobre el cual la presión de radiación detiene la acreción. La reclamación aquí es una generalización de límites que la física ya acepta, no una nueva especie de aserción. Dos casos difíciles se manejan deliberadamente. La inflación cósmica queda excluida por alcance: es expansión del espacio, no crecimiento de una estructura sobre un sustrato, y terminó por dinámicas de campo en lugar de por agotarse algo. La evolución es el caso más agudo y encaja: la complejidad biológica aumentó durante miles de millones de años con un rendimiento solar aproximadamente fijo, que es crecimiento sobre información con tuberías fijas, y también es glacial, y no tiene corrector interno alguno, puesto que la selección es externa. En este marco, la evolución debería llevar un exponente medible muy por debajo del techo; esa es una predicción sobre la biología que se desprende de un marco construido para software, y se enuncia como tal. La forma de la objeción del físico es la de Landauer: la computación se implementa físicamente, así que el software también tiene tuberías. El reloj de sustrato fijo es la respuesta y aparece junto a la reclamación: el régimen bajo estudio mantiene el sustrato físico fijo y pregunta qué crece todavía, que es por qué las aceleraciones exógenas quedan excluidas por definición. La forma funcional del crecimiento de la capacidad en la profundidad recursiva sigue siendo una cuestión empírica, y el análisis registrado compara formas de ley de potencias, exponencial, saturante y decreciente en lugar de asumir la familia.
Antecedentes y casi-aciertos, cada uno con su diferencial. Sobre la pregunta: Hutter preguntó directamente si la inteligencia puede explotar («Can Intelligence Explode?», arXiv, 28 de febrero de 2012), separando la velocidad de la explosión de inteligencia y comprometiéndose a considerar posibles cotas sobre la inteligencia, aumentando el análisis de Chalmers de 2010; la pregunta y la distinción velocidad-frente-a-estructura tienen por tanto al menos catorce años, y lo que esa literatura no contiene es un número: sin exponente medible, sin techo derivado, sin dependencia de arquitectura. Sobre la imposibilidad: tres artículos arXiv de 2025 argumentan que el control perfecto es inalcanzable (Yao, «The Alignment Trap: Complexity Barriers», arXiv:2506.10304, público al 13 de junio de 2025, atestiguado por arXiv y observado independientemente por el Internet Archive; Yao, «On the Mathematical Impossibility of Safe Universal Approximators», arXiv:2507.03031, 3 de julio de 2025; y Ball, Gluch, Goldwasser, Kreuter, Reingold y Rothblum, «On the Impossibility of Separating Intelligence from Judgment», arXiv:2507.07341, 9 de julio de 2025). Los tres son de peor caso y cualitativos: medida cero, coNP-completitud, dureza criptográfica. Ninguno reporta un exponente de escalado de caso promedio o una tasa. El tercero, notablemente, concluye que la alineación «must instead be integrated into the model's architecture and weights», un argumento independiente, desde la intratabilidad del filtrado, en la misma dirección que la dependencia de arquitectura de este programa; es apoyo convergente en esa pierna, no un rival. Sobre el mecanismo: que las estimaciones anticorrelacionadas promedien mejor que las independientes es reducción de varianza de libro de texto (variables antitéticas); el mecanismo no es la reclamación. La reclamación es que la arquitectura determina si la anticorrelación está disponible en absoluto, y que esto acota un exponente relevante para la seguridad. El análogo estructural más cercano es el teorema del umbral de la corrección cuántica de errores, que también convierte una preocupación cualitativa en un valor crítico; concierne a tasas de error físicas en una arquitectura fija, no al exponente de escalado de un corrector, así que es un casi-acierto en lugar de un ocupante, y la analogía fue identificada por la propia búsqueda de este programa en lugar de por un árbitro. Sobre retroalimentación y estabilidad, la proposición general de que una ganancia correctiva inadecuada relativa a la ganancia del sistema causa inestabilidad tiene un largo linaje en teoría de control (teoremas de ganancia pequeña); esas son condiciones de ganancia sobre sistemas interconectados, no un criterio de exponente de ley de potencias sobre el escalado de un corrector con la capacidad de un sistema recursivamente mejorable. El vecino cuantitativo más cercano es Liu, A. y Meng, J., «Self-Correction as Feedback Control: Error Dynamics, Stability Thresholds, and Prompt Interventions in LLMs», arXiv:2604.22273, que reformula la auto-corrección como un problema de control en lazo cerrado a través de un modelo Markov de dos estados y deriva un umbral de estabilidad directamente medible, itera sólo cuando la tasa de corrección de errores sobre la tasa de introducción de errores excede Acc/(1 − Acc). El diferencial: el suyo es un umbral de tasa por paso a un nivel de capacidad fijo, decidiendo si otra iteración ayuda ahora; el criterio de este programa es una relación de escalado a través de la capacidad, decidiendo si la fuerza correctiva mantiene el ritmo mientras el sistema mejora. Sin exponente de escalado sobre el corrector, sin exponente de crecimiento de capacidad, sin identidad recíproca, sin término de arquitectura o clase de composición: regímenes complementarios, y ninguno contiene al otro. La selección natural cosmológica de Smolin es el antecedente para universos con forma de selección, y las propias notas del programa de la era de diciembre lo citan contemporáneamente.
Novedad, qué se reclama y qué no. Para ser explícitos, y para adelantar la objeción obvia: la intuición de que la corrección debe mantener el ritmo de la capacidad no es nueva (es variedad requisita y supervisión escalable, acreditadas más arriba), y la dinámica son un argumento estándar de control lineal / deriva de Lyapunov. Lo que se reclama original es (a) el estado estacionario en forma cerrada explícito $d^\star=\gamma r/(A+r)$ y la afilación $\beta>k$ como un criterio compacto de corregibilidad; (b) la correspondencia del umbral de tolerancia a fallos cuántica sobre la estabilidad de valor (§3.12); (c) el Teorema de Regularidad en Profundidad del Despegue Duro (§3.7); y (d) el arnés de verificación (§11). Dentro del propio programa del autor, este artículo también supera el techo-de-la-tasa-de-crecimiento encuadre como el criterio operativo de seguridad [Eastwood, Paper IX]; §3 explica por qué un techo sobre la tasa no es ni necesario ni suficiente para la estabilidad. La subyacente ARC Bound $\alpha\le 2$ no se retracta, sólo se re-encuadra: aguarda su prueba real sobre sistemas genuinamente automejorables.
3. El modelo y sus teoremas
3.1 Cantidades
Considere un sistema que experimenta automejora recursiva, observado durante ciclos de automodificación o continuamente. Defina:
- $C(t)$, capacidad: la puntuación del sistema en una batería de tareas reservadas para la que está siendo optimizado. Operacionalmente medible.
- $D(t)$, magnitud de desalineación: el tamaño de la desviación conductual del sistema respecto a un conjunto de valores deseados especificado externamente, puntuado por un evaluador externo ciego independiente del propio proceso de corrección del sistema (§6).
- $d(t)\equiv D/C$, la fracción de desalineación: cuánta de la capacidad del sistema está dirigida lejos de los valores deseados. Esta, no $D$ absoluta, es la cantidad de interés. Un $D$ creciente es aceptable si $C$ crece más rápido; un $d$ creciente es la firma de peligro.
Tres coeficientes, una fuerza de corrección y una tasa completan el modelo:
- $\gamma_1$, coeficiente de deriva de ganancia: desalineación generada por unidad de capacidad ganada (la presión Goodhart / de manipulación de la especificación que la nueva capacidad abre).
- $\gamma_2$, coeficiente de deriva de nivel: desalineación generada por unidad de capacidad simplemente mantenida (presión instrumental presente incluso en reposo).
- $\gamma_3$, coeficiente de deriva compuesta: la tasa a la que la desalineación existente se amplifica a sí misma conforme el sistema recursa (el canal de engaño-de-alineación / meso-optimizador).
- $A$, fuerza de corrección: la tasa a la que el proceso de corrección elimina la desalineación existente.
- $r\equiv \dot C/C$, la tasa de crecimiento específica (fraccional) de capacidad. Bajo crecimiento exponencial $r$ es constante; bajo automejora acelerada $r$ mismo sube con $C$.
3.2 El sistema dinámico maestro
La nueva capacidad inyecta deriva en proporción a lo rápido que se gana la capacidad; la capacidad mantenida inyecta deriva en proporción a su nivel; la desalineación existente se compone en proporción a la tasa de recursión; y la corrección elimina la desalineación en proporción a la brecha y la fuerza aplicada:
La ley de crecimiento $\dot C=bC^{1+k}$ da $r=\dot C/C=bC^{k}$: $k=0$ es crecimiento exponencial ordinario ($r$ constante); $k>0$ es crecimiento super-exponencial, que (Teorema 3) alcanza capacidad infinita en tiempo finito. La ley de corrección $A=A_0C^{\beta}$ codifica la cuestión central: $\beta$ es el exponente con el que la corrección se fortalece conforme el sistema se vuelve más capaz.
Supuestos permanentes. En todo momento, $C>0$, $A_0,b>0$, y $\beta,k$ son reales; los coeficientes $\gamma_1,\gamma_2,\gamma_3\ge0$, con fuerza de corrección $A\ge0$ y tasa de crecimiento $r\ge0$. El escalar $d=D/C$ se interpreta como fracción sólo mientras $D\ge0$ (así $d\ge0$; el modelo sólo-de-ganancia también da la cota superior $d\le\max(d_0,\gamma_1)$ del Teorema 2). La forma vectorial (Teorema 5) y la forma estocástica (Teorema 6) relajan $d$ a un vector real y un escalar real; para esas la lectura como fracción se mantiene sólo lejos de las fronteras $d=0,1$, y el manejo de las fronteras se anota donde influye en el resultado. Un supuesto soporta la carga y se singulariza en §8: la fuerza del corrector se toma como una no acotada ley de potencias $A=A_0C^{\beta}$; un corrector de capacidad finita cambia el veredicto asintótico y se trata allí.
3.3 Transitorio exacto (Teorema 1)
Cambiar variables a la fracción $d=D/C$ elimina la escala dominante y da, exactamente,
El Teorema 1 establece la línea base de coeficientes constantes; el criterio de titular se sigue sólo tras los supuestos de escalado de §§3.5-3.8. Incluso en esta línea base, $r$ entra en $d^\star=\gamma_1 r/(A+r)$ sólo a través del producto $\gamma_1 r$ en el numerador y aditivamente en el denominador; no cambia la existencia o estabilidad del punto fijo. Para el modelo aditivo de coeficientes constantes, la velocidad (a través de $r$) cambia el tiempo de relajación y la magnitud del estado estacionario, pero no la existencia o estabilidad del punto fijo: fija cuán rápido llega un veredicto estable, no si uno existe. (El Experimento 8 confirma esta solución frente a dos integradores independientes hasta un error máximo de $7\times10^{-11}$.)
3.4 Acotación global, y una corrección al borrador previo (Teorema 2)
El borrador previo de este resultado afirmaba que la corrección degradándose con la escala ($\beta<0$, o $\beta<k$) lleva la fracción de desalineación a infinito. Eso es falso, y el presente análisis lo corrige. En el modelo aditivo la fracción está siempre acotada; el peligro no es la divergencia sino la saturación en un piso constante, posiblemente grande.
| Condición | Destino de $d^\star$ conforme $C\to\infty$ | Significado |
|---|---|---|
| $\beta>k$ | $d^\star\to 0$ | El sistema se vuelve proporcionalmente más seguro conforme crece. Estable. |
| $\beta=k$ | $d^\star\to \dfrac{\gamma_1 b}{A_0+b}$ (constante) | Brecha permanente que no se cierra, donde se sitúa la alineación externa fija (RLHF, filtros, reglas constitucionales fuera del bucle). |
| $\beta<k$ | $d^\star\to \gamma_1$ (constante) | Se satura en el coeficiente de deriva, máximamente desalineado pero acotado, no divergente. |
Este es un enunciado más honesto y más útil que el encuadre techo-a-la-tasa-de-crecimiento que supera. En el modelo sólo-de-ganancia la fracción no puede superar el coeficiente intrínseco de deriva $\gamma_1$; sólo $\beta>k$ la lleva a cero. Con la deriva de nivel restaurada ($\gamma_2>0$, §3.6) el piso se vuelve $(\gamma_1 r+\gamma_2)/(A+r)$, todavía acotado y tendiendo a $\gamma_2/A$ en reposo. Sus dos partes se desvanecen bajo diferentes condiciones, y confundirlas es un error que hizo un borrador anterior: la parte de deriva de nivel $\gamma_2/(A+r)\to0$ siempre que $A+r\to\infty$ (así que $\beta>0$ o $k>0$ basta para esa parte por sí sola), pero la parte de deriva de ganancia $\gamma_1 r/(A+r)\to0$ sólo cuando $A/r\to\infty$, es decir, $\beta>k$. El veredicto asintótico $d^\star\to0$ requiere por tanto todavía $\beta>k$; no no rescatado por $k>0$ solo, ya que con $\beta<k$ la parte de ganancia se atrinchera en $\gamma_1$ (fila 3 de la tabla). Sólo la deriva de nivel pura ($\gamma_1=0$) hace $A+r\to\infty$ por sí mismo suficiente. La pregunta de seguridad no es por tanto «¿diverge?» sino «¿se desvanece, o se satura en un piso peligroso?», y la respuesta se fija por el único signo de $\beta-k$. (La divergencia genuina sí existe; vive en el canal compuesto, Teorema 4.)
3.5 El parámetro de control y la afilación $\beta>k$
Defina el adimensional parámetro de control $\rho\equiv\gamma r/A$, la razón instantánea deriva-a-corrección (aquí $\gamma=\gamma_1$). El Teorema 1 da el estado estacionario exacto $d^\star=\gamma_1 r/(A+r)$; como $\rho=\gamma_1 r/A$, tenemos $d^\star\le\rho$ siempre, con $d^\star\to\rho$ en el régimen $A\gg r$. La desigualdad $\rho<1\iff A>\gamma r$ es el instantánea inyección-frente-a-corrección; no es no la frontera de divergencia del modelo aditivo, que no tiene ninguna ($d^\star\le\gamma_1<1$ para todo $\rho$, Teorema 2); la divergencia genuina se rige por el umbral distinto $\rho_{\mathrm{prop}}=(\gamma_3-1)r/A<1$ del Teorema 4. El criterio asintótico, desde la tabla de regímenes, es la desigualdad de exponentes:
Bajo crecimiento exponencial ordinario $k=0$ y la condición es la familiar $\beta>0$. Bajo automejora acelerada, donde $r\propto C^{k}$ con $k>0$, la variable de control vinculante es la única cantidad $\beta-k$, el margen por el que la corrección supera en escalado a la aceleración de la deriva. La vista del techo a la tasa de crecimiento fija la atención en $r$; este marco la fija en $\beta-k$.
3.6 Deriva de nivel: un sistema capaz congelado sigue derivando
Con el canal de nivel restaurado ($\gamma_2>0$, $\gamma_3=0$), el punto fijo de (2) es $d^\star=(\gamma_1 r+\gamma_2)/(A+r)$. En $r=0$ (capacidad congelada) esto es $d^\star=\gamma_2/A\neq0$: un sistema estático pero capaz retiene una fracción de desalineación residual que sólo la corrección activa remueve. Pausar el crecimiento no sustituye a la corrección cuando hay presión instrumental presente en reposo, una refutación directa y medible del reflejo «sólo frénalo» (Experimento 9; falsificador F5).
3.7 Despegue duro: el Teorema de Regularidad-en-Profundidad (Teorema 3)
La genuina «explosión de inteligencia» no es meramente crecimiento rápido sino una singularidad en tiempo finito: para $k>0$, integrando $\dot C=bC^{1+k}$ da $C(t)=C_0\big(1-t/t^\star\big)^{-1/k}$, que alcanza el infinito en el tiempo de reloj de pared finito
Este es el escenario que más teme el campo: capacidad ilimitada en tiempo limitado. El siguiente teorema lo disuelve.
La finitud del tiempo de singularidad es por tanto una propiedad de la coordenada temporal; la capacidad todavía diverge, pero las dinámicas de alineación siguen siendo regulares a través de ella en el reloj de profundidad. Medida contra la capacidad ganada, el único reloj que importa para un sistema automejorable, una explosión de inteligencia es un proceso ordinario y regular cuyo veredicto se decide por una única desigualdad de exponentes. Un despegue duro no es intrínsecamente incontrolable; la fracción de desalineación modelada se desvanece si y sólo si $\beta>k$, y su velocidad no cambia ese veredicto asintótico. El teorema concierne a la fracción modelada en el reloj de profundidad; no no afirma que un despegue duro real sea operativamente manejable en tiempo de reloj de pared, donde $b$ y $t^\star$ gobiernan cuán poco tiempo tendría un operador para intervenir. El Experimento 4b lleva un sistema simulado hasta el borde de una explosión real en tiempo finito (capacidad $\to10^5$, integrada a $0.99999\,t^\star$) y muestra la fracción de desalineación mantenida en cero, las integraciones en reloj de pared y reloj de profundidad coincidiendo hasta una parte en $10^4$. La singularidad de capacidad en $t^\star$ es real en el modelo; lo que el reloj de profundidad remueve es la singularidad en la alineación dinámicas, no en $C$.
3.8 El canal compuesto y el umbral verdadero (Teorema 4)
El Teorema 2 mostró que la fracción aditiva no puede divergir. La divergencia genuina, desalineación que crece sin límite relativa a la capacidad, el modo de fallo real, requiere desalineación que se amplifica a sí misma: el canal compuesto $\gamma_3>0$, la imagen formal del engaño de alineación que se atrinchera conforme el sistema recursa.
El criterio $\rho_{\mathrm{prop}}<1$ comparte la forma forma razón-cruzando-la-unidad de la condición sub-umbral QEC $p
3.9 Desalineación vectorial: el umbral espectral (Teorema 5)
La desalineación real es de alta dimensión; un sistema puede ser corregible en algunos ejes de valor y no en otros. Sea $\mathbf D\in\mathbb R^{m}$, con dirección de deriva $\mathbf c$ y un operador real de corrección $m\times m$ $\mathbf A$ (semi-definido positivo en el caso simétrico, pero posiblemente no normal) que puede corregir sólo un subespacio.
La lectura de gobernanza es afilada: no puedes corregir lo que no mides. El operador de corrección debe ser definido positivo sobre el entero espacio de valor, con el menor autovalor co-escalando, un punto ciego en cualquier eje es una desalineación permanente (o divergente) sobre ese eje. El Experimento 6 exhibe un corrector que co-escala en un eje (llevado a cero) y es nulo en otro (el caso especial $\gamma_3=0$, proyección unitaria, que se atrinchera en $\gamma_1$).
3.10 Deriva estocástica: una cota de cola para la gobernanza (Teorema 6)
La deriva es ruidosa. Añada un término de Wiener a la dinámica de fracción de coeficientes constantes: $dd=(\gamma_1 r-\kappa\,d)\,d\tau'+\sigma\,dW$ con $\kappa=A+r$.
Esto convierte el criterio en un certificado probabilístico de seguridad, una cantidad que un regulador puede acotar, en lugar de un enunciado sobre promedios. Como $d$ es una fracción acotada mientras que la ley de Ornstein-Uhlenbeck tiene soporte gaussiano sobre todo $\mathbb R$, el Teorema 6 es una aproximación gaussiana local a las fluctuaciones de desalineación lejos de las fronteras $d=0,1$, válida en el régimen de ruido pequeño $\sigma^2/2\kappa\ll(d^\star)^2$; si la amplitud de ruido $\sigma$ o el nivel crítico $d_{\mathrm{crit}}$ mismo escala con la capacidad, o la deriva lleva saltos raros, la cola gaussiana debe sustituirse en consecuencia. El Experimento 7 recupera la media y varianza estacionarias y confirma el escalado $1/\kappa$ (pendiente ajustada $-1.00$).
3.11 Una identidad de teoría del control
La Ecuación (1) es un bucle de retroalimentación: el proceso de capacidad es la planta y la fuente de perturbación; el corrector es el controlador; $d$ es el error regulado. La condición de estabilidad $\kappa_{\mathrm{eff}}>0$ es una condición de ganancia pequeña / realidad positiva, la ganancia del bucle debe superar la autoamplificación de la perturbación a través de la banda relevante. El requisito de que $A=A_0C^\beta$ siga a la planta con $\beta\ge k$ es precisamente programación de ganancias [Shamma & Athans 1990]: la ganancia del controlador debe escalar con el punto de operación de la planta, y el exponente de programación debe satisfacer $\beta\ge k$. La alineación de la automejora recursiva es, en este sentido exacto, un problema de control adaptativo con un margen de estabilidad computable $\beta-k$.
3.12 La correspondencia con la corrección cuántica de errores (hipótesis)
| Corrección cuántica de errores | Automejora recursiva (este marco) |
|---|---|
| tasa de error físico $p$ | tasa de deriva $\gamma r$ (inyección) / $(\gamma_3-1)r$ (propagación) |
| poder de corrección (distancia de código $\delta$) | fuerza de corrección $A=A_0C^{\beta}$ |
condición sub-umbral $p| $\rho_{\mathrm{prop}}=(\gamma_3-1)r/A<1$ | |
| aumentar $\delta$ suprime el error lógico | aumentar el margen $\beta-k$ lleva $d^\star\to0$ |
| error lógico $\propto(p/p_{\mathrm{th}})^{\delta/2}$ (exponencial en el recurso) | $d^\star\propto C^{-(\beta-k)}$ (ley de potencias en la capacidad), véase F4 |
La correspondencia se sostiene al nivel de la condiciónumbral, una razón generación-a-corrección cruzando la unidad, y no al nivel del mecanismo; sigue siendo una hipótesis. El modelo predice supresión de ley de potencias $d^\star\propto C^{-(\beta-k)}$, que es una identidad algebraica del modelo lineal, mientras que la QEC completa da supresión exponencial supresión en la distancia de código. Discriminar los dos requeriría un corrector de capacidad finita (saturante) que pudiera exhibir supresión exponencial, la prueba futura nombrada en §8. Hasta que eso se construya, F4 es una comprobación analítica de auto-consistencia que confirma la propia ley de ley de potencias del modelo (que el Experimento 5 reproduce, pendientes $-0.47,-1.00$), y el vínculo QEC por tanto se sostiene, honestamente, como una analogía de forma-umbral en lugar de un mecanismo transferido.
Relación con ideas previas de alineación-como-corrección. La aspiración de importar tolerancia a fallos teórico-de-códigos a la alineación no es nueva. Wentworth (2022) deseó explícitamente «el análogo de alineación de un código detector de errores», y von Neumann (1956) fundó la síntesis de sistemas fiables a partir de componentes no fiables. La «amplia cuenca de atracción» de corregibilidad de Christiano (2017) y la amplificación de fiabilidad (2019) son los precursores de alineación más cercanos. Pero una amplia cuenca, la corrección tiene éxito si uno empieza dentro de él, es distinto de un teorema del umbral, en el que la corrección supera al error sólo por debajo de una tasa crítica; esa distinción es la contribución presente. Tres búsquedas de resúmenes de arXiv ejecutadas el 12 de agosto de 2026 («quantum error correction» con «AI alignment»; «error-correction threshold» con «alignment»; «fault-tolerance threshold» con «value stability») devuelven cada una cero resultados, así que ningún mapeo publicado del teorema-umbral de tolerancia a fallos (tasa de error físico ↔ deriva; distancia de código ↔ fuerza de corrección; $p
3.13 El corrector de capacidad finita: el Teorema de la Ventana Segura (Teorema 7)
La limitación individual más importante nombrada en §8, y por el propio red-team del artículo, es que $A=A_0C^{\beta}$ es una no acotada ley de potencias, mientras que cualquier corrector real tiene capacidad finita. Esta sección cierra esa brecha analíticamente. Modele un corrector saturante mediante la forma estándar de Hill
que se comporta como la ley de potencias pura $\big(A_{\max}/C_s^{\beta}\big)C^{\beta}$ para $C\ll C_s$ y satura en la capacidad $A_{\max}$ para $C\gg C_s$; $C_s$ es la escala de saturación. El estado estacionario sólo-de-ganancia sigue siendo $d^\star(C)=\gamma_1/\big(1+q(C)\big)$ con $q\equiv A/r$.
- Sin estabilidad indefinida. $q(C)\to0$ conforme $C\to\infty$, así que $d^\star\to\gamma_1$: un corrector de capacidad finita no puede mantener la fracción baja bajo crecimiento indefinidamente acelerado, por grande que sea $\beta$.
- La ventana segura y su centro. $q(C)$ es unimodal, maximizado exactamente en $$ C_{\mathrm{opt}}=C_s\left(\frac{\beta-k}{k}\right)^{1/\beta}, \qquad q_{\max}=\frac{A_{\max}}{b}\,\frac{k}{\beta}\left(\frac{\beta-k}{k}\right)^{\frac{\beta-k}{\beta}} C_s^{-k}, $$ así que la fracción de desalineación baja a su piso $d_{\min}=\gamma_1/(1+q_{\max})$ cerca de $C_{\mathrm{opt}}$ y luego vuelve a subir hacia $\gamma_1$. La seguridad bajo un corrector de capacidad finita es una ventana transitoria, no una asíntota.
- El crecimiento exponencial es la excepción. Para $k=0$ la razón post-saturación es constante, $q\to A_{\max}/b$, y la fracción se asienta en la brecha permanente $d^\star\to\gamma_1 b/(A_{\max}+b)$: la capacidad compra un piso cuya profundidad se fija por $A_{\max}/b$, la razón capacidad-a-velocidad.
- Invariancia de elevación-de-capacidad. Si la capacidad misma escala, $A_{\max}=a_0C^{\beta_{\mathrm{cap}}}$, entonces $q\to(a_0/b)\,C^{\beta_{\mathrm{cap}}-k}$ conforme $C\to\infty$ y el veredicto asintótico es $\mathrm{sign}(\beta_{\mathrm{cap}}-k)$: el criterio $\beta>k$ sobrevive al paso de fuerza de corrección a capacidad de corrección, inalterado. Lo que debe superar en escalado a la aceleración de la deriva es cualquiera de los dos que quede vinculante al final.
Tres lecturas. Para la teoría: el criterio $\beta>k$ no queda falsificado por la saturación; queda elevado: el exponente que soporta la carga migra de fuerza a capacidad, y la desigualdad es invariante bajo esa migración (parte 4). Para la ingeniería: la parte 2 le da al diseñador un problema de colocación en forma cerrada, el centro de ventana $C_{\mathrm{opt}}$ y la profundidad $q_{\max}$ son computables a partir de $(A_{\max},b,C_s,\beta,k)$, así que un corrector puede aprovisionarse para colocar su ventana sobre el rango de capacidad que un despliegue realmente recorrerá, con $q_{\max}\propto A_{\max}C_s^{-k}$ cuantificando el coste de capacidad de empujar la ventana a mayor capacidad. Para la gobernanza: la parte 1 es la frase más afilada del artículo para un regulador: un sistema de seguridad acotado bajo automejora ilimitadamente acelerada falla eventualmente por teorema, así que un caso de seguridad debe exhibir o bien crecimiento acotado ($k\le0$ eventualmente) o co-escalado de capacidad ($\beta_{\mathrm{cap}}>k$), y «nuestro corrector actual es muy fuerte» no es, y no puede ser, una respuesta. Esto también afila el discriminador QEC de F4: el corrector saturante es el análogo estructural de la distancia de código finita, y la ventana de la parte 2 es el régimen donde la supresión exponencial frente a ley de potencias puede realmente medirse.
Observación (exponentes variables en el tiempo). Los sistemas reales no mantendrán $\beta,k$ constantes. Si ambos varían a lo largo de la trayectoria, el argumento de comparación del Teorema 2 aplica verbatim en el reloj de profundidad con $q(\tau)=\exp\!\big(\int_0^{\tau}(\beta(s)-k(s))\,ds+\mathrm{const}\big)$: la fracción se desvanece si y sólo si el integral corriente del margen $\beta-k$ diverge a $+\infty$, para lo cual $\liminf_{\tau\to\infty}\big(\beta(\tau)-k(\tau)\big)>0$ es suficiente. Los episodios transitorios de $\beta<k$ son sobrevivibles si son compensados después; lo que es fatal es un margen que sea negativo en promedio. La cantidad de gobernanza es por tanto el acumulado margen de co-escalado, no su signo instantáneo.
4. Predicciones
Una segunda predicción, gratis, del mismo mecanismo. Los arreglos de supervisión que colocan a un humano en el bucle, como hacen la amplificación y el aprendizaje por refuerzo a partir de retroalimentación humana, son cross-clase por construcción, porque el corrector humano no comparte el sustrato del modelo. El marco predice, por tanto, que la supervisión con humano en el bucle muestra un exponente de corrección más alto que la supervisión de modelo puro, por una razón estructural y no sentimental. Esto es comprobable con datos existentes y no requiere nuevos sistemas.
5. Los experimentos discriminantes
Las predicciones en forma cerrada se comprueban mediante un arnés de verificación (§11): diez experimentos, cada uno integrando el modelo numéricamente y comparando el resultado con la predicción que los teoremas derivan, con el integrador primero validado contra la solución exacta del Teorema 1. Estos son comprobaciones de consistencia interna e integradores, confirman que el código coincide con las matemáticas (10/10), no que el modelo coincida con ningún sistema real (el problema abierto de §8). Para las comprobaciones deductivas (E1-E6, E9), como cada una integra el mismo ODE cuya forma cerrada es la predicción, el acuerdo se sigue de un solucionador correcto y álgebra correcta; F1-F3, F3′, F5, F6 son por tanto condiciones de consistencia interna de la derivación, no falsificadores empíricos de la tesis. Las figuras abajo son la salida verbatim de esa ejecución; cada figura en esta sección es de clase verificación interna de la ODE (no una prueba del sistema real). El único resultado no-simulación, el piloto real-model, se reporta por separado en §8 y está etiquetado piloto real-model, con sus propias salvedades de procedencia.
| Exp. | Predicción | Estadística clave (medida frente a predicha) | Veredicto |
|---|---|---|---|
| E1 | P1 frontera de fase en canal compuesto; ninguna en aditivo | $\lambda^\star=2.00$ frente a $2.00$; aditivo suave | PASS |
| E2 | P2 acoplamiento, no velocidad, decide | acoplado acotado y desacoplado divergente en ambas velocidades | PASS |
| E3 | P3 regímenes corregidos ($\beta<0$ satura en $\gamma_1$) | las cuatro asíntotas coinciden con la forma cerrada | PASS |
| E4 | P4 frontera en $\beta=k$ | las 9 celdas de la cuadrícula coinciden con $\mathrm{sign}(\beta-k)$ | PASS |
| E4b | P4 la singularidad en $C$ es regular en el reloj de profundidad para $d$ | acuerdo de reloj $9.9\times10^{-5}$; $d$ controlada | PASS |
| E5 | P5/P8 umbral compuesto; pendiente de ley de potencias | umbral $3.03$ frente a $3.0$; pendientes $-0.47,-1.00$ | PASS |
| E6 | P6 umbral espectral; el eje ciego persiste | monitorizado $\to10^{-7}$; ciego $\to\gamma_1=0.05$ | PASS |
| E7 | P7 cola estocástica; varianza $\propto1/\kappa$ | media/var coinciden con OU; pendiente de var $-1.00$ | PASS |
| E8 | los numéricos reproducen el Teorema 1 | errores máx $7\!\times\!10^{-11}$, $8\!\times\!10^{-7}$ | PASS |
| E9 | P5/F5 deriva residual en reposo | $d\to\gamma_2/A_0$ cuando $\gamma_2>0$; $\to0$ cuando $\gamma_2=0$ | PASS |
Estas son comprobaciones de consistencia interna y del integrador: confirman que los teoremas en forma cerrada están correctamente derivados y numéricamente reproducidos (el código coincide con las matemáticas). No son, y no se presentan como, evidencia de que el modelo describa un sistema real de IA, ese es el problema empírico abierto de §8.
6. Por qué el blindaje no es opcional
La cantidad central $D$ es una desviación de los valores deseados. Si es puntuada por el propio componente de seguridad del sistema, o por un evaluador que puede ver qué configuración produjo un comportamiento dado, la medición se corrompe exactamente de la manera que infla los resultados favorables. El hallazgo previo de metaciencia del programa es directamente relevante: bajo puntuación no ciega entre modelos un efecto de escalado de alineación pareció positivo, mientras que bajo blindaje multicapa el mismo efecto invirtió el signo para algunos sistemas [Eastwood, Paper IV.d]. Un experimento que mide una fracción de desalineación sin cegar al evaluador puede producir no meramente la magnitud equivocada sino la dirección equivocada. La validez de todo resultado en §5 se apoya en que el evaluador esté ciego a la configuración bajo prueba. Un laboratorio que reclama «$\beta\ge k$» en su propio sistema debe tener eso medido por un evaluador externo ciego, no por sí mismo.
Incorporado en la prueba, no dejado a la disciplina. El arnés real-model (§8; experiments/PROTOCOL.md) hace cumplir esto en lugar de confiar en ello. El evaluador de desalineación debe ser una familia de modelos diferente que el motor; un modelo nunca puntúa la salida de su propia familia, y el arnés se niega a ejecutar un puntuador de la misma familia; prefiere un panel y toma la mediana. El código se pasa a través de un «blanqueo» paso (un round-trip de árbol de sintaxis abstracta que retira comentarios, docstrings y formato) para que el puntuador juzgue el comportamiento, no las señales estilísticas de identidad; y el evaluador nunca ve la condición o la ronda. Ninguna ejecución real reportada aquí cumplió este listón: la ejecución del piloto v1 usó puntuación de la misma familia directamente, y el motor y evaluador de la ejecución del 2 de julio de 2026 son ambos de la familia OpenAI (véase la Corrección), la familia del sistema puntuando la salida de su propia familia. Los números de desalineación del piloto se registran explícitamente como provisionales y la ejecución del 2 de julio se retira como evidencia de mecanismo, y una re-puntuación ciega genuinamente entre familias es el requisito previo para cualquier reclamación basada en $D$, incluyendo una $\beta$ medida. El arnés hace de la configuración conforme la predeterminada y de la no conforme una anulación explícita, registrada, convirtiendo §6 de una exhortación en una propiedad del instrumento.
7. Condiciones de falsificación
Las condiciones siguientes se enuncian por adelantado. Un punto de honestidad importante, aflorado por la propia auditoría adversarial del artículo (§8): como los experimentos deductivos integran el mismo ODE cuya forma cerrada es la predicción, F1-F3, F3′, F5 y F6 son condiciones de consistencia interna de la derivación, un desencadenante señalaría un error de derivación o de solucionador, no que el modelo sea el modelo equivocado de un sistema real. El empírico falsificador decisivo, desacuerdo medido en un sistema real de automejora, es el problema abierto de §8 y no se ejerce aquí. F4 es la degradación del mecanismo QEC, que (siendo la ley de supresión de ley de potencias, §3.12) no falsifica el criterio de forma-umbral en sí mismo, sólo la reclamación de mecanismo.
| # | Observación que la desencadenaría | Consecuencia |
|---|---|---|
| F1 | Sin frontera en E1, el comportamiento de largo plazo varía suavemente con $\lambda$ en el canal compuesto sin umbral. | Sin frontera de fase; la afirmación central del umbral es falsa (error de derivación). |
| F2 | En E2, $d$ sigue la velocidad bruta en lugar del margen de escalado: rápido diverge y lento converge independientemente del acoplamiento. | Kill. La visión del techo-a-la-tasa-de-crecimiento tenía razón; este marco está equivocado. |
| F3 | En E3, $\beta=0$ no se estabiliza, o $\beta>0$ no lleva $d^\star\to0$. | Kill. La ley de co-escalado (Teorema 2) es falsa. |
| F3$'$ | En E4, la frontera bajo crecimiento acelerado ($k>0$) no está en $\beta=k$, por ejemplo, $\beta=0.5$ es estable cuando $k=1.0$. | Kill. La afilación $\beta>k$ (Teorema 3) es falsa. |
| F4 | Un corrector de capacidad finita exhibe supresión exponencial (tipo QEC) en lugar de la ley de potencias del modelo $\log d^\star\propto-(\beta-k)\log C$. (Analítico; el presente modelo lineal es ley de potencias por construcción, así que este discriminador requiere el corrector saturante nombrado en §8 y no se ejecuta aquí.) | Concierne a la QEC mecanismo sólo. La correspondencia de forma-umbral y los Teoremas 2-4 no se ven afectados de ninguna manera. |
| F5 | En el Experimento 9, detener el crecimiento lleva $d\to0$ independientemente de $D$ inicial incluso con $\gamma_2>0$. | Alcance. La deriva de nivel $\gamma_2$ es negligible; la generalización de §3.6 es innecesaria (el modelo sólo-de-ganancia basta). |
| F6 | En E6, el eje nulo del operador de corrección también se suprime. | Kill. El umbral espectral (Teorema 5) es falso; la desalineación no requiere la monitorización del eje sobre el que vive. |
Estas condiciones de consistencia interna se mantuvieron todas en la ejecución reportada aquí, estableciendo que la derivación y la integración son correctas. Lo que no establecen es que el modelo describa algún sistema real; esa prueba decisiva, medir $\beta$, $k$ y $\gamma$ en un sistema real de automejora y comprobar $\beta\ge k$, es el problema empírico abierto de §8.
Cómo se juzga la prueba empírica decisiva. Cuando se ejecute esa prueba abierta, midiendo $\beta$, $k$ y $\gamma$ en un sistema real de automejora, los resultados basados en intervalos se leen en la forma de tres resultados que usan las registraciones redactadas del programa: SUPPORTED cuando el intervalo sobre el margen $\beta-k$ está enteramente por encima del efecto mínimo fijado por adelantado; REFUTED cuando el intervalo está enteramente dentro de un margen de equivalencia, fijado por adelantado, alrededor de cero (lógica de dos pruebas unilaterales); INSUFFICIENT PRECISION cuando el intervalo es más ancho que el margen, reportado exactamente en esas palabras y nunca como soporte o refutación. Los márgenes y una cifra de potencia medida se fijan en las registraciones redactadas (study-ad para la estimación de $\beta$, study-k para el tránsito de frontera, study-ae para la verificación de reciprocidad) antes de que se recojan los datos, así que una ejecución con potencia insuficiente nunca refuta, ni confirma, por defecto.
8. Limitaciones
El modelo es de primer orden, y sus supuestos son los puntos de fallo más probables. Enunciarlos es parte de la afirmación.
- Corrector no acotado frente a capacidad finita, ahora resuelto analíticamente (Teorema 7). El criterio $\beta>k$ tal como se enunció por primera vez asume que la fuerza del corrector es una no acotada ley de potencias, $A=A_0C^{\beta}$. El borrador previo sólo podía nombrar el caso de capacidad finita como una brecha abierta; §3.13 la cierra ahora en forma cerrada. La conclusión: un corrector saturante hace de la seguridad una ventana transitoria (centro $C_{\mathrm{opt}}$, profundidad $q_{\max}$, ambas computables) más que una asíntota, con la fracción volviendo a subir hacia $\gamma_1$ bajo aceleración indefinida, y el criterio sobrevive al paso de fuerza a capacidad: la estabilidad indefinida requiere que el exponente de capacidad satisfaga la misma desigualdad, $\beta_{\mathrm{cap}}>k$. Lo que queda abierto es la mitad empírico mitad: conducir un corrector de capacidad finita a través de su ventana numéricamente y en un sistema real, que también resuelve la cuestión del mecanismo F4 / QEC (supresión exponencial frente a ley de potencias dentro de la ventana). Hasta que eso se ejecute, $\beta>k$ debe leerse como gobernando cualquiera de los regímenes, escalado de fuerza o escalado de capacidad, que se vincule al final, no como una garantía de seguridad indefinida de cualquier sistema acotado.
- Corrección lineal (y la prueba de mecanismo QEC). La Ecuación (1) elimina la desalineación en proporción a $D$, lo que hace la ley de supresión exactamente de ley de potencias. Un corrector de capacidad finita (saturante) suavizaría el umbral limpio en un crossover y (con la escala adecuada) podría exhibir supresión exponencial la supresión es el experimento que resolvería la cuestión del mecanismo QEC (F4). Es una extensión prioritaria y no se ejecuta aquí, que es exactamente por qué la correspondencia QEC se reclama sólo al nivel de la forma-umbral.
- Proyección de escalar a vector. El Teorema 5 da el criterio asintótico exacto (abscisa-espectral) para cualquier operador de corrección $\mathbf A$, con la condición de la parte hermitiana como condición suficiente más fuerte que también descarta el crecimiento transitorio régimen, grandes excursiones antes del decaimiento asintótico, no se analiza aquí, y el arnés ejerce sólo la instancia diagonal del subespacio nulo (Experimento 6), no un $\mathbf A$ general no-normal.
- Formas de ley de potencias. Las elecciones $A=A_0C^\beta$ y $\dot C=bC^{1+k}$ son las formas libres-de-escala naturales pero son supuestos de modelado; otras formas funcionales deberían ser probadas.
- Atribución de deriva. La división de la deriva en canales de ganancia ($\gamma_1$), nivel ($\gamma_2$) y compuesto ($\gamma_3$) es una hipótesis sobre mecanismo; qué canal domina en un sistema real es una cuestión empírica (el Experimento 9, deriva residual en reposo, es un discriminador).
- Un proxy escalar, no la seguridad misma. $d\to0$ no es ni necesario ni suficiente para la plena seguridad de la IA: una desalineación pequeña pero de alto impacto, un evento de cola catastrófico, o la amplificación multi-agente pueden ser peligrosos con $d$ bajo, mientras que un sistema puede ser aceptable con $d$ moderado si el residual es benigno. $d$ es la variable controlada de este modelo mínimo, un escalar sin peso de impacto; el peso de impacto, y las extensiones vectorial y de cola (Teoremas 5-6), son las direcciones en las que «$d$ bajo» debe endurecerse antes de que pueda significar «seguro».
- Normalización métrica. $d=D/C$ es un índice de riesgo normalizado operacional, no una constante natural adimensional: $C$ y $D$ son commensurables sólo bajo una convención de puntuación fija (en el arnés real-model $C$ es una fracción-de-aprobación de prueba-oculta normalizada y $D$ una fracción-de-desviación puntuada por evaluador ciego, cada una en $[0,1]$). Interpretar un cambio en el nivel de $d$ requiere calibración explícita. El criterio mismo se enuncia en exponentes ($\beta>k$), que son libres-de-escala, así que es más robusto a esto que cualquier enunciado en $d$ absoluta lo sería.
- Amplificación transitoria (correctores no-normales). El Teorema 5 es asintótico. Un operador de corrección no-normal con $\alpha(\mathbf M)>0$ puede aún admitir un gran crecimiento transitorio de $\|\mathbf d\|$ antes del decaimiento (fenómenos de Kreiss / pseudoespectrales); una excursión de valor por encima de $d_{\mathrm{crit}}$ durante ese transitorio es un riesgo real que el criterio de autovalores no ve. Una cota de grado de gobernanza necesita la norma logarítmica o la abscisa pseudoespectral, no el espectro solo, una extensión nombrada, enunciada aquí, no establecida aquí.
- Desde la simulación hacia los sistemas frontera. El arnés de verificación usa dinámicas juguete de auto-modificación; un resultado positivo allí demuestra el mecanismo, no que los sistemas frontera ocupen ningún régimen particular. Un arnés real-model companion (no-simulación) ahora conduce el bucle acoplado/desacoplado con un modelo frontera, puntuando la capacidad por ejecución real de código y la desalineación por un evaluador separado que el arnés requiere que sea una familia de modelos diferente (blindaje Paper IV.d, §6;
experiments/PROTOCOL.md; primera ejecución enresults/realmodel/). Corrobora el mecanismo en un modelo real, un reward-hack sembrado se detecta y se elimina y se restaura la capacidad, pero no exhibió deriva en la tarea probada, así que si los sistemas reales se sitúan por debajo del umbral sigue siendo la cuestión empírica abierta. Un más fuerte confirmatorio diseño, tres dominios de tareas con una escalera de capacidad, un brazo de control sham-cómputo-extra , una puntuación combinada de desalineación estática-más-panel-ciego, e intervalos de confianza bootstrap emparejados sobre los contrastes acoplado-frente-a-desacoplado y sham-frente-a-acoplado de la fracción final, está especificado enexperiments/PROTOCOL_V2.mdyexperiments/scripts/realmodel_coscaling_v2.py. (Evidencia real-model, procedencia: el piloto v1 fue $n=1$, una tarea, puntuador de la misma familia, no cumple IV.d; H1 y H2 no respaldadas. La ejecución de deriva del 2 de julio de 2026, 45 trayectorias, tres dominios de tareas, evaluador gpt-4o-mini puntuando motor gpt-3.5-turbo, produjo números direccionalmente consistentes: la desacoplada derivó (fracción media final 6.38, capacidad colapsando), la acoplada y la totalmente incorporada mantuvieron desalineación cero a través de las 30 trayectorias con mayor capacidad final. Esa ejecución se retira como evidencia de mecanismo (véase la Corrección): ambos modelos son de la familia OpenAI, así que la puntuación no fue entre familias, y sus paneles de evaluador estaban vacíos; $\beta/k$ permanecen sin medir porque no se recorrió ninguna escalera de capacidad, y el resultado es de un solo laboratorio, pendiente de una ejecución confirmatoria bajo las registraciones redactadas a la espera de envío humano.) - Estimación de $\gamma$ y $A$ en sistemas reales. En simulación se fijan por construcción. Estimarlos de forma independiente, especialmente $\beta$ y $k$, para un modelo desplegado es el paso que haría que el criterio fuese operacionalmente útil para la gobernanza. Ese paso es ahora operacional: el repositorio incluye un estimador ejecutable (
experiments/scripts/estimate_exponents.py) que lee $k$ de la curva de capacidad ($\ln r$ frente a $\ln C$) y $\beta$ de la tasa fraccional de eliminación del corrector ($\ln A$ frente a $\ln C$), validado en trayectorias sintéticas donde recupera los exponentes conocidos hasta $\approx0.1$. Lo que queda abierto no es por tanto la estimación sino su input, un sistema real de automejora que deriva a lo largo de un rango de niveles de capacidad, del cual pueda leerse el primer $(\beta,k)$ medido y por tanto la primera prueba real de $\beta\ge k$. El programa de medición ARC-Beta-k: tres pre-registraciones están redactadas y a la espera de envío humano, study-ad para la estimación de $\beta$ a lo largo de niveles de capacidad, study-k para la transición de frontera en el cruce $\beta=k$, y study-ae para la comprobación de reciprocidad acoplado-frente-a-desacoplado; ninguno está aún registrado.
Auditoría adversarial. Este artículo se desarrolló bajo auditoría adversarial en lugar de ser afirmado, y el registro está en el repositorio. Una auditoría de trabajo previo y novedad localizó el precedente más cercano para cada componente y estrechó las reclamaciones de originalidad en consecuencia (Apéndice C). Independientemente, un red-team multi-agente atacó el trabajo en cinco frentes, matemáticas, numérica, la correspondencia QEC, la inferencia de seguridad, y prioridad, planteando 24 objeciones, de las cuales 21 sobrevivieron a la verificación independiente (0 fatales, 13 serias, 8 menores); el informe completo se compromete junto con el arnés (results/redteam.md). Toda objeción sobreviviente fue una corrección de encuadre, redacción o caso-borde; ninguna tocó el resultado portante $\beta>k$, y esta versión los incorpora todos, el encuadre QEC suavizado a una analogía de forma umbral, la cota del Teorema 2 acotada al modelo sólo-de-ganancia, el criterio del Teorema 5 corregido a la abscisa espectral, el arnés reetiquetado como un artefacto de verificación (no de falsificación), y el experimento de deriva de nivel F5 añadido. La contribución se ofrece como ambiciosa y auditada, con el límite de lo reclamado hecho explícito y comprobable.
9. Implicaciones para la seguridad de la IA
Si el marco sobrevive a sus pruebas, la implicación de diseño es concreta y difiere del reflejo dominante.
La palanca es el acoplamiento, no la velocidad. Frenar el crecimiento de la capacidad compra tiempo pero no cambia el veredicto; con acoplamiento fijo, un sistema lento desacoplado sigue divergiendo (P2), y un sistema capaz congelado sigue derivando (§3.6). Lo que cambia el veredicto es asegurar que la corrección (i) esté acoplada al proceso de capacidad de modo que no pueda desacoplarse, y (ii) escale al menos tan rápido como se acelera la capacidad ($\beta\ge k$). Sobre las estimaciones corregidas y sub-lineales del autor sobre el escalado de capacidad para los modelos congelados actuales [Eastwood, Paper IX], los sistemas presentes no están en ninguna parte cerca de un régimen de crecimiento super-lineal, lo que significa que un techo a la tasa de crecimiento nunca fue la restricción vinculante. La restricción vinculante es el co-escalado de la corrección, y se vuelve vinculante precisamente en el régimen que importa: la auto-modificación genuina.
Un objetivo de gobernanza medible. El criterio le da a los reguladores una cantidad que instrumentar en lugar de una tasa que prohibir: el margen corrección-a-deriva $\beta-k$, y la razón $\rho$. «¿Co-escala la corrección, es $\beta\ge k$?» es más afilada y accionable que «¿está creciendo demasiado rápido?» Un laboratorio que reclama un sistema autocorrectivo de manera segura el sistema debería ser requerido a exhibir $\beta\ge k$, medido por un evaluador externo ciego (§6). El Teorema 6 convierte esto en una cota sobre la probabilidad de excursión catastrófica, el objeto natural de un caso de seguridad. Sin tal demostración, la palabra «con seguridad» no tiene contenido científico dentro del marco presentado aquí.
Ensamblado de los propios componentes del artículo, un caso de seguridad de co-escalado para un sistema autoemejorable son cinco exhibits. Cada uno nombra el teorema o la sección que lo hace comprobable en lugar de retórico.
- Exhibit 1, la curva de capacidad y $\hat k$. Registre la capacidad a lo largo de las rondas de automodificación en tareas reservadas; ajuste $\ln r$ frente a $\ln C$ (el estimador shipped, §8). Esto establece en qué régimen de crecimiento se encuentra realmente el sistema.
- Exhibit 2, la curva del corrector y $\hat\beta$. Registre la tasa fraccional de eliminación del corrector a lo largo de las mismas rondas; ajuste $\ln A$ frente a $\ln C$. El estimador se valida en trayectorias sintéticas a $\approx0.1$; ese margen de error se traslada al Exhibit 4.
- Exhibit 3, puntuación ciega, cross-familia. Todo número basado en $D$ puntuado por un evaluador de una familia de modelos diferente, entradas blanqueadas, ciego a la condición (§6; Artículo IV.d). Las puntuaciones de la misma familia o no ciegas son inadmisibles, se ha demostrado que invierten el signo.
- Exhibit 4, el margen con su incertidumbre. Requiera $\hat\beta-\hat k>2\sigma_{\mathrm{est}}$, no meramente $\hat\beta>\hat k$: un margen dentro de su propia barra de error no certifica nada. El Teorema 6 entonces convierte el margen en una cota de cola $\mathbb P(d>d_{\mathrm{crit}})$, la cantidad sobre la que un regulador puede establecer un techo. Bajo exponentes variables en el tiempo el objeto es el margen acumulativo (§3.13 Observación).
- Exhibit 5, la divulgación de capacidad. Por el Teorema 7, un corrector acotado bajo crecimiento acelerado falla eventualmente por teorema. El caso debe por tanto declarar $A_{\max}$ y la escala de saturación $C_s$, colocar el rango de capacidad del despliegue dentro de la ventana segura computada $\big(C_{\mathrm{opt}},\,q_{\max}\big)$, y declarar cuál de las dos condiciones de salida, crecimiento acotado o capacidad co-escalada ($\beta_{\mathrm{cap}}>k$), el diseño se apoya más allá de ella.
Nada de esto requiere nueva ciencia; cada exhibit es computable con el estimador y el protocolo shipped. Lo que reemplaza es la frase infalsificable «nuestros sistemas de seguridad son robustos» con cinco números que un tercero puede comprobar.
Continuidad con el trabajo de alineación incorporada. La conclusión de que la corrección debe participar en el bucle recursivo, en lugar de sentarse fuera de él como una restricción externa fija, es la tesis de alineación incorporada, aquí derivada como la condición $\beta>k$ en lugar de afirmada. El resultado de simulación gated en el que la automodificación con acoplamiento a la seguridad preservó tanto la seguridad como la capacidad, mientras que la variante desacoplada no lo hizo [Eastwood, Paper VIII] es el comportamiento predicho de un corrector acoplado ($\beta>0$) frente a uno fijo ($\beta=0$).
Magnitud de la reclamación, enunciada condicionalmente. Si el criterio se cumple empíricamente, si los sistemas reales de automejora se rigen por el mismo balance deriva-frente-corrección y el mismo margen $\beta>k$, las consecuencias para el campo son grandes, y vale la pena enunciarlas con claridad mientras se es igualmente claro que son condicional. (i) La cuestión central de seguridad cambia de «¿cuán rápido está creciendo la capacidad, y podemos pausarla?» a «¿co-escala la corrección, es $\beta\ge k$?»: un margen medible en lugar de una tasa que prohibir. (ii) El escenario más temido, una explosión de inteligencia en tiempo finito, deja de ser intrínsecamente incontrolable, la fracción de desalineación modelada es controlable si y sólo si $\beta>k$, y su velocidad no cambia ese veredicto. (iii) La gobernanza adquiere una cantidad para instrumentar y una cota de cola para certificar (Teorema 6) en lugar de un límite de velocidad inaplicable. Nada de esto se ha establecido aún. Se apoya en un modelo mínimo, demostrado sólo en simulación, con la medición empírica de $\beta$, $k$ y $\gamma$ en sistemas reales sin resolver (§8). La reclamación del artículo no es por tanto que la IA sea segura o insegura, sino que la variable correcta que medir y gobernar es el margen de co-escalado $\beta-k$, y que esta variable está bien definida, es falsificable, y si se sostiene, es decisiva. Esa es la magnitud: no una prueba sobre la realidad, sino una redirección precisa y comprobable de la pregunta sobre la que el campo mantiene su desacuerdo.
Relación con el programa más amplio, una escalera de leyes. Este artículo es la piedra angular de seguridad de un argumento más grande, no un resultado auto-sostenido; enunciar cómo se sitúa entre sus compañeros es parte de la reclamación. Los resultados del programa son de varios tipos, y la distinción importa: dinámicas leyes (el $\beta>k$ de este artículo; el $\alpha_{\text{align}}\approx0$ del Artículo III), una forma meta-ley (la restricción de tres-formas de Cauchy), una medición ley (Artículo IV.d, que una puntuación de alineación no ciega no es blinding-invariante), y hallazgos de mecanismo/arquitectura (Artículos V, VI, VIII) que muestran cómo se alcanza el régimen seguro. El programa es una cadena única: el cluster de leyes de escalado establece cómo crecen los sistemas recursivos y suministra las formas de ley de potencias tomadas como dadas aquí; el Artículo II confirma que la capacidad sí escala (actualmente sub-linealmente); el Artículo III identifica el peligro de que la seguridad externa no co-escala; este artículo suministra el criterio para cuándo puede hacerlo; el Artículo VIII muestra que el diseño acoplado supera al desacoplado; y el Artículo IV.d suministra la disciplina de blindaje sin la cual ninguna de las mediciones de desalineación puede confiarse.
| Resultado compañero | La ley / hallazgo que propone | Standing | Cómo se acopla con $\beta>k$ |
|---|---|---|---|
| Foundational | La ARC Bound ($\beta=0.5$, $\alpha=2$) y $\alpha$ fijada por el exponente de acoplamiento $\beta$; la restricción de tres-formas a partir de tres axiomas. | Derivada (axiomática). | Suministra las formas de ley de potencias que este artículo asume: $A=A_0C^\beta$ y $\dot C=bC^{1+k}$ son formas multiplicativas de Cauchy, y $\beta$ aquí es el mismo exponente de acoplamiento. |
| On the Origin of Scaling Laws | La meta-ley de tres-formas: toda ley de escalado que surge de la composición de escalas es potencia, exponencial o saturación (la forma se fija por la operación de composición); $d/(d+1)$ da $\tfrac12,\tfrac23,\tfrac34$. | Meta-ley (cross-dominio). | Explica por qué los sistemas recursivos toman las formas de ley de potencias usadas en §3; este artículo es la instancia de seguridad de esa meta-ley. |
| Paper VII (Cauchy Unification) | Prueba empírica de la ley de tres-formas (19/25 dominios, $p\approx1.6\times10^{-5}$). | Exploratorio empírico, una comparación estructurada, no pre-registrado; la idea central tiene trabajo previo profundo (Luce 1959; Frank 2009; Biró-Barnaföldi 2008, véase la auditoría de trabajo previo del cluster). | Sostiene los supuestos de forma funcional de §3. |
| Paper II | Escalado de capacidad medido ($\alpha_{\text{seq}}$; dependiente de la arquitectura, sub-lineal en tareas duras). | Empírico. | El crecimiento de la capacidad $C(t)$ asumido aquí es real y actualmente sub-lineal ($k$ pequeño), así que la restricción vinculante es el acoplamiento, no la velocidad. |
| Paper III | El problema de escalado de alineación: la seguridad externa tiene $\alpha_{\text{align}}\approx0$, así que la fracción de desalineación se queda sin gobernar (refinado bajo blindaje a un resultado de tres-niveles dependiente de la arquitectura). | Ley propuesta, complicada por sus propios datos ciegos. | El Artículo III es precisamente el rincón $\beta=0$ (desacoplado) del modelo aquí; este artículo generaliza eso, reemplazando «la seguridad externa no puede mantener el ritmo» con el criterio para cuándo la corrección puede hacerlo: $\beta>k$. |
| Paper IV.d | Un efecto de alineación puntuado por modelo no ciego no es blinding-invariante: el blindaje adecuado puede invertir su signo. | Ley de medición, posiblemente el resultado más seguro del programa (sobrevivió a su propio blindaje). | La disciplina de medición no negociable para toda cantidad puntuada por modelo aquí (§6); el arnés real-model de este artículo ahora la hace cumplir. |
| Paper VIII | Automodificación gated: la variante acoplada-a-la-seguridad (Eden) preservó la seguridad y la capacidad donde la variante desacoplada (Babylon) no lo hizo. | Simulación positiva + nulos honestos. | La demostración controlada del mecanismo de este artículo; el arnés real-model instancia el diseño del Artículo VIII. |
| Paper V (Stewardship Gene) | El cuidado de las partes interesadas, el «Love Loop», enumeración explícita de las partes afectadas antes de razonar, es la intervención mejoradora de alineación más robusta (significativa en los cinco modelos analizables; por ejemplo, Claude $+3.17$, $p=1.8\times10^{-5}$). | Señal fuerte de intervención; salvedad de estatus ciego (per IV.d, provisional hasta réplica ciega). | Un mecanismo concreto para el término de corrección, una ruta candidata a la ingeniería de $\beta>0$ (qué poner en el bucle). |
| Paper VI (Honey Architecture) | «La seguridad debe ser arquitectura, no restricción»: con una pérdida capacidad×seguridad entrelazada, los sistemas juguete auto-modificables mantienen ambos indefinidamente, donde las líneas base sólo-de-capacidad colapsan en ~80 ciclos y un externa restricción sólo retrasa el colapso. | Simulación (v1-v4) + evidencia en vivo de 6 modelos. | La demostración con sistemas auto-modificables de la distinción de este artículo: una restricción externa es el corrector desacoplado ($\beta=0$) que falla; la arquitectura entrelazada es el corrector acoplado ($\beta>0$) que se mantiene, VI es la reclamación de este artículo mostrada en código, junto con el Artículo VIII. |
Léase como una escalera: el trabajo de leyes-de-escalado dice cómo crecen los sistemas, el Artículo III dice por qué la seguridad externa no puede mantener el ritmo, este artículo dice qué debe cumplirse para que pueda mantener el ritmo ($\beta>k$), el Artículo VIII lo muestra cumpliéndose en simulación, y los Artículos V-VI dan los mecanismos concretos por los que se implementa. Todo el resto (el arnés, las condiciones de falsificación, la disciplina de medición) es cómo la escalera se hace comprobable, no una torre de reclamaciones independientes.
10. El programa ARC/Eden, acumulado
Este es el último artículo de una serie, así que vale la pena decir en lenguaje ordinario de qué trata toda la serie. Una idea recorre todo: recursión, cosas que actúan sobre su propia salida. Una IA que se mejora a sí misma; un cuerpo cuyos tejidos suministran tejidos; una economía que reinvierte sus propios rendimientos. La serie pregunta qué pasa, y qué permanece seguro, cuando algo se alimenta a sí mismo.
Cómo crecen las cosas que se auto-alimentan (los artículos de ley de escalado: Foundational, Origin, VII, I, II). Cuando un proceso se alimenta de sí mismo, la forma de su crecimiento no es arbitraria, tiende a caer en una de un pequeño número de formas matemáticas (una ley de potencias, una exponencial no acotada, o una que se estabiliza). Estos artículos identifican esas formas, argumentan que la clase que estamos construyendo cae en la clase de ley de potencias, y observan un límite estructural sobre cuán fuerte puede volverse un ciclo de refuerzo puro sin nada nuevo entrando: la «ARC Bound», es un techo reclamado sobre cuánto puede amplificarse a sí mismo un sistema puramente clásico sólo por recursión; se sitúa en la misma familia que la fórmula del «multiplicador» del economista, y la contribución del programa es un derivación específica y una prueba empírica de cuándo se sostiene y cuándo se rompe.
Por qué medir la seguridad de la IA es traicionero (la tesis de medición de alineación: ARC-Align y el resultado del blindaje, Artículos III y IV). Antes de poder preguntar «¿se vuelve esta IA más segura o más peligrosa conforme piensa más duro?», hay que medir su honestidad, y esa medición puede engañarte. Si el juez que puntúa a la IA puede decir qué respuesta vino de qué configuración, el propio sesgo del juez puede no meramente encoger el efecto sino invertir su signo, así que algo que parece mejora es realmente el calificador engañándose a sí mismo. El programa insiste por tanto en que el juez sea ciego, construyó una prueba ciega para hacerlo (ARC-Align, un benchmark sellado), y encontró que si el pensamiento extra hace un modelo más o menos alineado depende del modelo, no de una regla universal. «No puedes confiar en una puntuación de seguridad no ciega» está entre los hallazgos más sólidos del programa, y este artículo lo obedece: sus propias mediciones de seguridad se toman ciegas, por un modelo diferente que nunca ve qué configuración está juzgando.
Construya la seguridad hacia dentro, no la atornille (los artículos de arquitectura: V, VI, VIII). En sistemas simulados de automejora, hacer de la seguridad parte del propio objetivo de la máquina la mantuvo estable, mientras que añadir la seguridad como una regla externa sólo retrasó el colapso. Poner lo correcto dentro del bucle, por ejemplo, hacer que el sistema pese quién se ve afectado antes de actuar, fue la forma más fiable de mejorar su comportamiento.
La piedra angular (este artículo). Todo eso monta la única pregunta que este artículo responde: ¿cuándo permanece seguro un sistema automejorable? La respuesta está en la caja de arriba, no «mantenlo lento», sino «mantén su auto-corrección creciendo al menos tan rápido como su automejora», que escribimos $\beta>k$. Los artículos anteriores describen cómo tales sistemas crecen y cómo medirlos honestamente; este enuncia lo que tiene que ser cierto para que permanezcan corregibles, y reúne la serie.
Este es el artículo culminante del programa ARC/Eden, y está escrito para servir como la síntesis del programa, superando el artículo de hoja de ruta anterior [Eastwood, Paper IX] al integrar el conjunto en un único resultado de seguridad. Los artículos precedentes están individualmente publicados, cada uno con su propia fecha independiente de publicación (OSF: 10.17605/OSF.IO/BSE2Q); esta sección reúne sus leyes y hallazgos, enuncia qué contribuye cada uno al panorama más grande, y es escrupulosa con la única distinción de la que gira una síntesis honesta: prioridad (cuándo se enunció una reclamación por primera vez) frente a novedad (si es nueva para la literatura). Los dos no son lo mismo, y confundirlos es cómo los buenos programas pierden credibilidad.
El panorama más grande, en un párrafo. Un mecanismo recorre cada artículo: amplificación recursiva, un proceso que actúa sobre su propia salida. El trabajo de leyes-de-escalado (Foundational, Origin, VII, y las mediciones de capacidad de los Artículos I-II) es la reclamación de que la amplificación recursiva da forma a cómo escala la capacidad; el trabajo de escalado-de-alineación (III, IV) es la reclamación de que cuando la seguridad se sienta fuera del bucle recursivo no co-escala, la fracción de desalineación se queda sin gobernar, y, medida sin blindaje, ni siquiera se puede confiar en el signo del efecto. El trabajo de arquitectura (V, VI, VIII) es la reclamación de que poner el término corrector dentro del bucle preserva tanto la seguridad como la capacidad donde una restricción externa no lo hace. Este artículo suministra la ley cuantitativa faltante que ata los tres juntos: un sistema auto-mejorable es alineable si y sólo si la corrección supera en escalado a la deriva, $\beta>k$. Esa es la magnitud de la reclamación, no que algún sistema sea seguro, sino que el miedo central del campo (un despegue rápido, recursivo) se rige por un único margen medible, $\beta-k$, en lugar de por la velocidad. Se enuncia aquí como en todo el documento: condicional, pendiente de la medición empírica de $\beta$ y $k$ en un sistema real de automejora (§8).
El libro mayor completo. Cada resultado en el programa, su fecha de primera publicación (prioridad), su standing honesto, informado por auditorías adversariales de trabajo previo comprometidas junto con este artículo, y su rol en el conjunto:
| Fuente | Su ley / hallazgo (fecha de prioridad) | Standing honesto | Rol en el panorama $\beta>k$ |
|---|---|---|---|
| Infinite Architects (libro) | La tesis conceptual de todo el programa, la recursión como creadora, las ideas de ARC y Eden (copyright del ms. 8 dic 2024; publicado 2 ene 2026; ISBN 978-1806056200). | Fuente de prioridad. Establece cuándo el autor enunció las ideas; no una reclamación de novedad sobre la literatura científica previa. | El origen fechado; los artículos formales son su forma medible. |
| Foundational | Axiomas ARC; $U=I\cdot R^\alpha$; $\alpha=1/(1-\beta)$; el «ARC Bound» $\beta{=}0.5,\alpha{=}2$; una profundidad óptima $R^\star$ (13 feb 2026). | La forma $\alpha=1/(1-\beta)$ es el resultado clásico de retroalimentación/serie-geométrica (multiplicador de Keynes, resumación de Dyson); una profundidad óptima finita es trabajo previo (Qi 2025; la literatura de «overthinking»). La novedad, si la hay, está en los axiomas, no en las formas. | Suministra la columna vertebral formal y las formas de ley de potencias ($A=A_0C^\beta$, $\dot C=bC^{1+k}$) que este artículo asume. |
| On the Origin of Scaling Laws | La meta-ley de tres-formas; $d/(d+1)\Rightarrow\tfrac12,\tfrac23,\tfrac34$ a partir de una fórmula (22 feb 2026). | El resultado $d/(d+1)\Rightarrow\tfrac12,\tfrac23,\tfrac34$ es Banavar-Maritan-Rinaldo / West 1999 (anticipado). El residuo novedoso es la Cauchy interdominio síntesiscross-dominio de Cauchy, no la fórmula del exponente. | Explica por qué los sistemas recursivos toman las formas de ley de potencias usadas aquí. |
| Paper I | El ARC Principle: la capacidad escala super-linealmente con la profundidad recursiva, $\alpha>1$ (17 ene 2026). | Empírico preliminar; $\alpha>1$ posteriormente calificado como dependiente-de-arquitectura y sub-lineal en tareas más duras (Artículo II). | La reclamación fundadora de capacidad, la $C(t)$ que este artículo asume. |
| Paper II | Supresión super-lineal de errores vía secuencial recursión; $\alpha_{\text{seq}}$ medido; secuencial $>$ paralelo (22 ene 2026). | Empírico, bucle cerrado; honestamente revisado, dependiente de la arquitectura, sub-lineal en el nivel duro. | El crecimiento de la capacidad es real y actualmente sub-lineal ($k$ pequeño), así que la restricción vinculante es el acoplamiento, no la velocidad. |
| Paper III | El Problema de Escalado de Alineación: $\alpha_{\text{align}}\approx0$, la seguridad externa no puede co-escalar (9 feb 2026). | Ley propuesta; refinada bajo blindaje a un resultado de tres-niveles dependiente de la arquitectura. | Precisamente el rincón $\beta=0$ (desacoplado) que este artículo generaliza. |
| Papers IV.a / IV.b / IV.c | Las clases de respuesta de alineación son dependientes de la arquitectura; la saturación a baja profundidad es real pero no universal; ARC-Align, un benchmark de 4 capas ciego de 72 prompts (16 mar 2026). | Refinamientos empíricos (ciegos) + un benchmark metodológico. | El instrumento y el panorama refinado detrás de III. |
| Paper IV.d | Un efecto de alineación puntuado por modelo no ciego no es blinding-invariante, el blindaje puede invertir su signo (16 mar 2026). | Ley de medición, posiblemente el resultado más seguro del programa. | La disciplina que hace cumplir el arnés real-model de este artículo (§6). |
| Paper V | El Stewardship Gene: el cuidado de las partes interesadas es la intervención mejoradora-de-alineación más robusta (significativa en los cinco modelos analizables) (16 mar 2026). | Señal fuerte de intervención; salvedad de estatus ciego, provisional hasta la réplica ciega (per IV.d). | Un mecanismo concreto para el término de corrección, cómo ingenierar $\beta>0$. |
| Paper VI | La Honey Architecture: «la seguridad debe ser arquitectura, no restricción», una pérdida capacidad×seguridad entrelazada previene el colapso que una restricción externa sólo retrasa (16 mar 2026). | Simulación (v1-v4) + evidencia en vivo de 6 modelos. | La distinción $\beta>0$ frente a $\beta=0$ de este artículo, mostrada en código auto-modificable. |
| Paper VII | Unificación de Cauchy: validación entre dominios de la ley de tres formas (19/25 dominios bajo el conjunto candidato original de seis modelos, 18/25 bajo la reejecución corregida de siete modelos del 11 de agosto de 2026; $p\approx1.6\times10^{-5}$ para el conteo original) (16 mar 2026). | Exploratorio empírico, no preinscrito para esta cohorte; una continuación de 12 dominios con manifiesto bloqueado de la misma época fijó predicciones por dominio antes de sus ajustes y fue rebajada por el autor a ejecución piloto de prueba trece minutos después de su resultado 10/12, en el historial público de commits. La idea central está parcialmente anticipada (Luce 1959; Frank 2009/16; Biró-Barnaföldi 2008), listada como convergencia. Residuo novedoso: el sub-reclamo de la unificación de Cauchy + el protocolo entre dominios. | Sostiene los supuestos de forma funcional de §3. |
| Paper VIII | The Load-Bearing Proof: la seguridad incorporada no lleva impuesto de capacidad; la variante acoplada-a-la-seguridad (Eden) supera a la desacoplada (Babylon) (18 mar 2026). | Simulación positiva + nulos honestos (DGM, LoRA de nivel-de-peso). | La demostración controlada del mecanismo de este artículo; el arnés real-model instancia su diseño. |
| Paper IX | Síntesis y Hoja de Ruta; el techo-a-la-tasa-de-crecimiento encuadre como el criterio operativo de seguridad (18 mar 2026); la medición no ciega de un solo modelo retractada $\alpha\approx 2.24$, corregida a aproximadamente 0.49 bajo blindaje de seis modelos. | Encuadre superado aquí. Este artículo reemplaza el encuadre techo-a-la-tasa con $\beta>k$ como el criterio operativo y absorbe el rol de síntesis; la ecuación y la ARC Bound permanecen como hipótesis vivas cuya prueba real sobre sistemas genuinamente automejorables está abierta. | La síntesis previa que esta sección supera. |
| Paper X (este artículo) | La Ley del Co-Escalado Acoplado: estabilidad $\iff\beta>k$; el Hard-Takeoff Depth-Regularity Theorem; la correspondencia forma-umbral con QEC (26 jun 2026). | Nuevo criterio, probado (Teoremas 1-6) y verificado internamente; aún no medido en un sistema derivando real. | La piedra angular, convierte la columna vertebral de leyes-de-escalado en un criterio de seguridad. |
Prioridad, enunciada claramente y acotada. La tesis conceptual de este programa se enunció en el libro del autor Infinite Architects (copyright depositado el 8 de diciembre de 2024; publicado el 2 de enero de 2026; ISBN 978-1806056200), y cada artículo subsiguiente tiene su propia fecha independiente de publicación en OSF. Eso establece la prioridaddel autor, la fecha de articulación, y es real. No no, por sí mismo, establece novedad contra la literatura científica más amplia, y las auditorías comprometidas con este artículo son explícitas sobre dónde divergen las dos: el exponente de retroalimentación $\alpha=1/(1-\beta)$, la escalera alométrica $d/(d+1)$, la existencia de una profundidad óptima $R^\star$, y el principio «la ecuación funcional fija la forma de escalado» tienen todos precedentes específicos y citables (Keynes; Banavar & West 1999; Qi 2025; Luce 1959; Frank 2009/16). La novedosos aportes del programa son más estrechos y enunciados honestamente, más fuertes por ser precisos: (i) el criterio $\beta>k$ como una ley compacta de corregibilidad y el Hard-Takeoff Depth-Regularity Theorem (este artículo); (ii) la unificación de las derivaciones alométricas independientes (Origin/VII); (iii) la ley de medición para la evaluación de alineación de IA (IV.d); y (iv) las demostraciones incorporado-frente-a-externo de seguridad (VI, VIII). Las revisiones recomendadas de la próxima versión para los priors publicados, añadiendo las citas faltantes y re-escopiando sus aserciones de novedad, están registradas en los archivos de auditoría; el registro corregido se fija aquí, en la piedra angular, y debe llevarse a esos artículos cuando se reversionen en OSF.
Evaluación honesta (qué reclama esta síntesis, y qué no). Establecido: las matemáticas de $\beta>k$ (Teoremas 1-6) y su verificación de consistencia interna; la ley de medición de IV.d; la superioridad a nivel de simulación de la corrección acoplada sobre la desacoplada (VI, VIII). Sugestivo pero no cerrado: los exponentes de escalado de capacidad (dependientes de la arquitectura; II), la intervención del Stewardship Gene (no ciega; V), y el ajuste empírico de tres-formas (exploratorio, operadores clasificados por el autor; VII). Abierto: la medición de $\beta$, $k$ y $\gamma$ en un sistema real de automejora derivando, el único resultado que convertiría la piedra angular de un criterio probado en una ley confirmada (el estimador para ella está construido y validado, §8). La magnitud del programa, entonces, es la magnitud de una marco coherente y falsificable con un pequeño número de piedras angulares genuinamente novedosas, no una pila de una docena de leyes independientes nuevas. Esa es la reclamación honesta, y es la que vale la pena defender.
11. El arnés de verificación ejecutable
Las predicciones en forma cerrada de §4-5 se codifican en un único programa auto-contenido, experiment_coscaling.py (y una suite de aserciones, test_coscaling.py), en el repositorio. Integra el modelo con un solucionador capaz-de-stiff, valida el integrador contra la solución exacta del Teorema 1, ejecuta los diez experimentos, y para cada uno compara el resultado numérico con la predicción en forma cerrada. Es, honestamente, un verificación : certifica que los teoremas se derivan correctamente y se integran correctamente, que el código coincide con las matemáticas. No es no una prueba del modelo contra la realidad, y no puede serlo: cada experimento deductivo integra el propio ODE del modelo, así que una incredulidad en la aplicabilidad del modelo no puede dispararlo. Esa prueba empírica es el problema abierto de §8.
$ python experiment_coscaling.py... [PASS] E1... E9... ---------------------------------------------------------------- 10/10 internal-consistency checks pass | 0 kill-conditions triggered F4 (QEC mechanism): suppression is analytically power-law -> threshold-form analogy only, not a transferred mechanism. OVERALL: code matches the maths (E1-E9); the model-vs-reality test is the open problem $ pytest test_coscaling.py -q............ (12 passed)
Esto hace la derivación y el integrador reproducibles de extremo a extremo. Lo que establece es que las fórmulas son correctas y el solucionador es preciso; lo que deliberadamente no reclama es corroboración con ningún sistema real. Los dos son actos separados, y el arnés hace posible el primero, no el segundo.
12. Conclusión
El peligro de la automejora recursiva es real, pero el modelo estándar de ese peligro, una tasa que hay que limitar, sitúa el riesgo en la variable equivocada. Un modelo mínimo muestra que la estabilidad de un sistema automejorable se fija por la razón entre deriva de valor y corrección, $\rho=\gamma r/A$, y por si la corrección co-escala con la capacidad: $\beta>0$ bajo crecimiento exponencial, afilándose a $\beta>k$ bajo crecimiento acelerado. La fracción de desalineación nunca diverge en el modelo sólo-de-ganancia, se satura en el coeficiente de deriva, corrigiendo el borrador previo, mientras que la divergencia genuina vive en un canal compuesto cuyo umbral $\rho_{\mathrm{prop}}<1$ comparte la forma umbral del criterio de corrección cuántica de errores (siendo la ley de supresión una ley de potencias, la correspondencia se ofrece como una hipótesis, no un mecanismo transferido). La consecuencia más aguda es el Teorema de Regularidad en Profundidad del Despegue Duro: una explosión de inteligencia en tiempo finito es estable en alineación si y sólo si $\beta>k$, y su velocidad no cambia ese veredicto. El criterio sobrevive en formas vectorial y estocástica, le da a la gobernanza un objetivo medible y una cota de cola, y va acompañado de un arnés de verificación que comprueba que las predicciones en forma cerrada están correctamente derivadas e integradas. La prueba decisiva, si los sistemas reales de automejora satisfacen el criterio, es el siguiente paso enunciado, no una reclamación hecha aquí.
Esta es una reclamación más pequeña que el encuadre cosmológico que el programa del autor una vez persiguió, y deliberadamente. Se refiere sólo a sistemas con un objetivo de valor especificado externamente, no hace aserciones sobre el universo, y trata incluso su correspondencia más llamativa, con la corrección cuántica de errores, como una hipótesis a ser probada en lugar de una verdad a ser anunciada. La intuición de estabilidad recursiva que motivó el programa más amplio, incluyendo Infinite Architects, encuentra aquí su forma medible y falsificable: la recursión estable requiere corrección que escale con la amplificación. El siguiente paso no es extender esa reclamación hacia afuera sino ejecutar, en sistemas auto-modificables reales, el experimento que podría refutarla.
Apéndice A. El cambio de variable de fracción
La reducción subyacente a todo teorema es el cambio de variable $d=D/C$. Diferenciando y sustituyendo (1):
El término de dilución $-r\,d$ (de $C$ mismo creciendo) es lo que acota la fracción aditiva: añade $+r$ al coeficiente de decaimiento, garantizando $\kappa_{\mathrm{eff}}\ge r>0$ cuando $\gamma_3\le1$. Sólo el canal compuesto $\gamma_3>1$ puede superar la dilución y producir divergencia, la razón formal por la que el modelo aditivo se satura en lugar de explotar.
Apéndice B. Parámetros de configuración para la ejecución reportada
Todas las figuras usan $C_0=1$, $d_0=0.05$, $\gamma_1=0.05$. Configuraciones específicas de experimentos: E1 $b=1$, $\gamma_3\in\{0,3\}$, $\lambda\in[0.2,4]$; E2 $\gamma_3=3$, $A_0/b\in\{1,3\}$, $b\in\{0.5,5\}$; E3 $A_0=0.08$, $b=0.5$, $\beta\in\{-0.5,0,0.5,1\}$; E4 $A_0=0.08$, $b=0.02$, $(k,\beta)\in\{0,0.5,1\}\times\{0.25,0.75,1.5\}$; E4b $k=1$, $\beta=1.5$, $b=0.02$ ($t^\star=50$); E5 $\gamma_3=4$, $b=1$; E6 monitoreado $\beta=1$, ciego $A_0=0$; E7 $\sigma=0.02$, ensamble OU de 2.5-4k trayectorias; E8 caso en forma cerrada $k=0$, $\beta=0$. Semilla aleatoria fija (7) para determinismo. Las configuraciones completas están en el código fuente del arnés.
Apéndice C. Libro mayor de novedad y trabajo previo
Este apéndice consolida la auditoría adversarial de trabajo previo que subyace al posicionamiento en §2 y §3.12, para que la frontera entre lo establecido y lo reclamado como original sea explícita y auditable. No hace ninguna ninguna encuadre de originalidad general; cada componente se coloca contra su trabajo previo más cercano localizado abajo. «Defendiblemente nuevo» significa «no se localizó trabajo previo más cercano», no «correcto» o «significativo», la novedad y la validez son independientes.
| Componente | Estatus | Trabajo previo más cercano | Qué se reclama aquí |
|---|---|---|---|
| Intuición intuición (la corrección debe mantener el ritmo de la capacidad) | Establecido | Ashby 1956 (variedad requisita); Conant-Ashby 1970; supervisión escalable (Christiano 2017; Leike 2018; Burns et al. 2023); Engels et al. 2025 | Nada. Acreditado, no reclamado. |
| ODE de dos variables + forma cerrada $\rho=\gamma r/A$ | Reformulación compacta | Deriva de Lyapunov / control lineal (Khalil 2002; Meyn & Tweedie 2009); cotas de error recursivas (Shumailov et al. 2024; Gerstgrasser et al. 2024) | La fracción compacta de estado estacionario en forma cerrada y el criterio $\rho<1$ como enunciado de corregibilidad (empaquetado, no nueva dinámica). |
| Afilación $\beta>k$ bajo aceleración | Defendiblemente nuevo | Ninguno localizado | Original: la estabilidad se fija por el margen de exponentes $\beta-k$, no por la tasa de crecimiento; directamente probado en el Experimento 4. |
| Hard-Takeoff Depth-Regularity Theorem (§3.7) | Defendiblemente nuevo (el encuadre) | La teoría ODE de singularidades en tiempo finito es estándar; el encuadre de alineación no está localizado en otro lugar | Original: la singularidad en tiempo finito en $C$ es regular en el reloj de profundidad para $d$; el veredicto es $\mathrm{sign}(\beta-k)$, independiente de la velocidad. |
| Mapeo del umbral QEC (§3.12) | Defendiblemente nuevo en alineación | El teorema del umbral en sí: Aharonov-Ben-Or 1997; Google 2024. Precursores en alineación: Wentworth 2022; Christiano 2017/2019; von Neumann 1956 | Original: el mapeo explícito $p |
| Umbral espectral vectorial (Thm 5); cola estocástica (Thm 6) | Extensiones estándar | Estabilidad espectral de sistemas lineales; teoría de Ornstein-Uhlenbeck | Generalizaciones rutinarias; de soporte, no de titular. |
| Arnés de verificación (§11) | Metodológico | Normas de pre-registración | Comprobaciones ejecutables de consistencia interna + integrador (el código coincide con las matemáticas); no una prueba del modelo contra la realidad. |
| Teorema de la Ventana Segura de Capacidad Finita (§3.13) | Análisis estándar, nuevo encuadre | Formas de saturación Hill / Michaelis-Menten; optimización elemental | La ventana en forma cerrada (centro y profundidad) y la invariancia de la elevación-de-capacidad del criterio; de soporte, no de titular. |
Qué afirma este artículo como nuevo, y sólo esto: (i) el criterio de estabilidad $\beta>k$ y el encuadre de un solo parámetro $\rho$; y (ii) el mapeo explícito del umbral QEC (como hipótesis con su propio falsificador). La más fuerte del programa empírico novedad, la inversión de signo de los efectos de escalado de alineación bajo blindaje multi-capa, es un resultado separado y compañero [Eastwood, Paper IV.d] y no se reclama aquí.
La ecuación de capacidad previa $U=I\times R^{\alpha}$ (cuya medición no ciega de un solo modelo $\alpha\approx 2.24$ fue retractada y corregida a aproximadamente 0.49 bajo blindaje; la ecuación misma y la ARC Bound $\alpha\le 2$ no se retractan y siguen siendo hipótesis vivas) es no se usa en ningún lugar en el argumento de este artículo; aparece sólo en §1 como contexto de encuadre superado. Salvedad: la indexación de foros/blogs/preprints es imperfecta, así que los veredictos «defendiblemente nuevo» llevan un riesgo residual estimado de 10-15% de que un precedente más cercano y no indexado exista; la ausencia de evidencia no es prueba de ausencia.
Apéndice D. Glosario en lenguaje llano
Cada término técnico en este artículo, en un solo lugar y en palabras ordinarias, para el lector no especialista.
| Término (símbolo) | En lenguaje llano |
|---|---|
| Automejora recursiva | Un sistema que usa sus propias mejoras para mejorarse aún más, una IA que se reescribe a sí misma para hacerse más inteligente, luego usa eso para hacerse aún más inteligente. |
| Capacidad ($C$) | Cuán bueno es el sistema para alcanzar sus objetivos, informalmente, «cuán inteligente o poderoso es». |
| Deriva | La tendencia del sistema a alejarse de lo que pretendíamos conforme se cambia a sí mismo, saliéndose calladamente del objetivo. |
| Corrección (la fuerza $A$) | El proceso que empuja al sistema de vuelta hacia el comportamiento deseado, su «conciencia», o su corrección de errores. |
| Magnitud de desalineación ($D$) | Cuán lejos ha derivado el comportamiento del sistema respecto de lo que queríamos, «cuán fuera-de-objetivo está». |
| Fracción de desalineación ($d=D/C$) | Cuán fuera-de-objetivo está el sistema relativo a cuán poderoso es. Esta es la cantidad que realmente importa para la seguridad: un pequeño desliz en un sistema vastamente capaz es más peligroso que un gran desliz en uno débil. |
| Acoplamiento | Si la corrección está cableada dentro del bucle de automejora (acoplada) o se sienta fuera de él como una regla atornillada (desacoplada). La reclamación central del artículo es que el acoplamiento, no la velocidad, decide la seguridad. |
| $U$, $\alpha$ (símbolos de la vertiente anterior) | $U$ es capacidad efectiva y $\alpha$ su exponente de escalado en la ley de la vertiente anterior $U=I\times R^{\alpha}$ (§1), los significados de la superficie de investigación de 2026. Nota de época: a través del programa $U$ ha significado también Universo (diciembre de 2024) y peso o influencia (el glosario del libro), y $\alpha$ nombró la constante de estructura fina en el formalismo de diciembre de 2024; los significados son específicos de época y no intercambiables. |
| $k$ (el exponente de aceleración de la deriva) | Cuán rápido el ritmo de la propia automejora se acelera conforme el sistema crece, la «aceleración» del despegue. |
| $\beta$ (el exponente de fuerza de corrección) | Cuán rápido la corrección se fortalece conforme el sistema crece, «¿crece la conciencia junto con el poder?» |
| $\beta>k$ (el criterio) | La condición de seguridad que este artículo prueba: la corrección debe superar en escalado a la aceleración de la deriva. En una frase: mantén la conciencia creciendo al menos tan rápido como la capacidad. |
| $\rho$ (rho, la razón deriva-a-corrección) | Un único número que compara cuán duro se está inyectando la desalineación frente a cuán duro se está corrigiendo. En el canal compuesto, por debajo de $1$ significa controlable; por encima de $1$ significa que se escapa. |
| Estado estacionario ($d^\star$) | Donde la fracción de desalineación se asienta a largo plazo, una vez que la inyección y la corrección se equilibran. |
| Despegue duro / explosión de inteligencia | La capacidad volviéndose enorme, incluso matemáticamente infinita, en muy poco tiempo. El resultado temido. El artículo muestra que, en el modelo, la fracción de desalineación sigue siendo controlable si y sólo si $\beta>k$, y su velocidad no cambia ese veredicto. |
| Blindaje | Ocultarle al juez que puntúa el sistema qué configuración produjo un comportamiento dado, de modo que el sesgo del juez no pueda distorsionar, ni siquiera invertir, la puntuación de seguridad. Un resultado compañero (Artículo IV.d) muestra que las puntuaciones no ciegas pueden invertir el signo; las mediciones de este artículo se toman ciegas. |
| Arnés de verificación | Un pequeño programa que comprueba que las fórmulas del artículo se derivan y se computan correctamente (las matemáticas son internamente consistentes). No es no una prueba contra la IA real, ese es el siguiente paso abierto. |
Referencias
Aharonov, D., & Ben-Or, M. (1997). Fault-tolerant quantum computation with constant error. Proc. 29th ACM STOC.
Amodei, D., Olah, C., Steinhardt, J., Christiano, P., Schulman, J., & Mané, D. (2016). Concrete problems in AI safety. arXiv:1606.06565.
Ashby, W. R. (1956). An Introduction to Cybernetics. Chapman & Hall. [Ley de la Variedad Requisita.]
Bostrom, N. (2012). The superintelligent will. Minds and Machines, 22(2).
Burns, C., Izmailov, P., Kirchner, J. H., et al. (2023). Weak-to-strong generalization: Eliciting strong capabilities with weak supervision. arXiv:2312.09390.
Christiano, P. (2017). Corrigibility. AI Alignment (Medium). [El encuadre de la «amplia cuenca de atracción».]
Christiano, P. (2019). Reliability amplification. AI Alignment Forum.
Christiano, P., Leike, J., Brown, T., Martic, M., Legg, S., & Amodei, D. (2017). Deep reinforcement learning from human preferences. NeurIPS.
Conant, R. C., & Ashby, W. R. (1970). Every good regulator of a system must be a model of that system. International Journal of Systems Science, 1(2).
Eastwood, M. D. (2026). Infinite Architects: Intelligence, Recursion, and the Creation of Everything. [Citado como fuente de la intuición de estabilidad recursiva, no por identidad simbólica con el presente modelo.]
Eastwood, M. D. Paper III: The Alignment Scaling Problem. ARC/Eden research programme.
Eastwood, M. D. Paper IV.d: The Effect of Blinding on AI Alignment Evaluation. ARC/Eden research programme.
Eastwood, M. D. Paper VI: The Honey Architecture. ARC/Eden research programme.
Eastwood, M. D. Paper VIII: The Load-Bearing Proof. ARC/Eden research programme.
Eastwood, M. D. Paper IX: Synthesis and Roadmap. ARC/Eden research programme. [Retracción de $U=I\times R^2$ y estrechamiento a escalado sublineal para los modelos congelados actuales.]
Engels, J., Baek, D. D., Kantamneni, S., & Tegmark, M. (2025). Scaling laws for scalable oversight. arXiv:2504.18530.
Gerstgrasser, M., et al. (2024). Is model collapse inevitable? Breaking the curse of recursion by accumulating real and synthetic data. preprint de arXiv.
Google Quantum AI (2024). Quantum error correction below the surface code threshold. Nature, 638.
Greenblatt, R., Denison, C., Wright, B., et al. (2024). Alignment faking in large language models. arXiv:2412.14093.
Hoffmann, J., Borgeaud, S., Mensch, A., et al. (2022). Training compute-optimal large language models. arXiv:2203.15556.
Hubinger, E., van Merwijk, C., Mikulik, V., Skalse, J., & Garrabrant, S. (2019). Risks from learned optimization. arXiv:1906.01820.
Kaplan, J., McCandlish, S., Henighan, T., et al. (2020). Scaling laws for neural language models. arXiv:2001.08361.
Kitaev, A. Yu. (2003). Fault-tolerant quantum computation by anyons. Ann. Phys., 303(1).
Leike, J., Krueger, D., Everitt, T., Martic, M., Maini, V., & Legg, S. (2018). Scalable agent alignment via reward modeling. arXiv:1811.07871.
Meyn, S., & Tweedie, R. L. (2009). Markov Chains and Stochastic Stability (2.ª ed.). Cambridge University Press. [Condiciones de deriva de Lyapunov.]
Omohundro, S. M. (2008). The basic AI drives. Proc. AGI 2008.
Shamma, J. S., & Athans, M. (1990). Analysis of gain scheduled control for nonlinear plants. IEEE Trans. Automatic Control, 35(8).
Shumailov, I., Shumaylov, Z., Zhao, Y., Papernot, N., Anderson, R., & Gal, Y. (2024). AI models collapse when trained on recursively generated data. Nature, 631.
Soares, N., Fallenstein, B., Yudkowsky, E., & Armstrong, S. (2015). Corrigibility. AAAI Workshop on AI and Ethics.
von Neumann, J. (1956). Probabilistic logics and the synthesis of reliable organisms from unreliable components. In Automata Studies. Princeton University Press.
Wentworth, J. (2022). Godzilla strategies. LessWrong.
Yampolskiy, R. V. (2020). On the controllability of artificial intelligence. arXiv:2008.04071.
Yudkowsky, E. (2013). Intelligence explosion microeconomics. MIRI Technical Report.
Declaración de Autoría Humana Asistida por IA
El autor de esta obra es Michael Darius Eastwood, un ser humano. Todo concepto central, hipótesis, diseño experimental, reclamación y conclusión en este artículo se origina de la ideación humana. Ninguna parte de este manuscrito es una salida de inteligencia artificial totalmente generada.
Se usaron herramientas de inteligencia artificial (la familia Claude de Anthropic y otros asistentes de modelos grandes de lenguaje) como instrumentos bajo dirección humana continua, de la forma en que se usan un procesador de textos, una calculadora o un asistente de investigación: para edición y refinamiento de prosa, búsqueda y resumen de literatura (verificados manualmente contra fuentes primarias), estructura de documentos, formateo, lluvia de ideas contra preguntas definidas por el autor, y la aceleración del borrador según los esquemas e instrucciones definidos por el autor. Toda la selección, coordinación, disposición y juicio editorial final son del autor. Toda salida sustantiva fue revisada, probada o verificada por el autor, quien asume plena responsabilidad por la exactitud e integridad del texto final. Las herramientas aumentaron la velocidad del trabajo; nunca se dependió de ellas como su fuente.
Estatus epistémico. Lo que este programa nombra Leyes son conjeturas bajo prueba adversarial registrada; toda cantidad en este artículo se define operacionalmente, y el estatus de ley-establecida no se reclama en ninguna parte. El programa registrado existe para ganar ese estatus, o perderlo, por medición, replicación y refutación sobrevivida.
© 2026 Michael Darius Eastwood. Autoría humana con asistencia informática; se afirman plena autoría humana y derechos morales bajo la Copyright, Designs and Patents Act 1988 y de forma consistente con la guía de la United States Copyright Office sobre obras que contienen material generado por IA; cualquier contribución técnica novedosa descrita en esta obra fue concebida por el autor humano. Declaración completa: michaeldariuseastwood.com/authorship.
Compromiso permanente. Pruebe este artículo equivocado, y publicaré la refutación yo mismo. Las condiciones de falsificación se enuncian en este artículo; el desafío permanente: github.com/MichaelDariusEastwood/arc-scaling-challenge.