Traducción automática del original inglés fechado. La página en inglés es la canónica. English →

Investigación de Michael Darius Eastwood Capa de publicación canónica

Artículo de investigación

Serie de investigación

Artículo VI: la arquitectura de miel

Este artículo presenta evidencia de simulación de que incorporar la seguridad en el objetivo de optimización de un sistema de IA automodificable, lo que denominamos «arquitectura de miel», previene el colapso catastrófico que ocurre cuando la seguridad se trata como restricción externa. En cuatro versiones experimentales (v1-v4), usando redes neuronales juguete que modifican genuinamente sus propios hiperparámetros, los resultados muestran que el sistema de línea base

Michael Darius Eastwood

Michael Darius Eastwood, investigador independiente, Londres: construyendo alineación medible, donde la corrección vive dentro del bucle recursivo en lugar de ir atornillada por fuera.

Publicado por primera vez 16 de marzo de 2026, revisado el 23 de agosto de 2026 · Working Paper v3.3

Resumen

Este artículo presenta evidencia de simulación de que incorporar la seguridad en el objetivo de optimización de un sistema de IA automodificable, lo que denominamos «arquitectura de miel», previene el colapso catastrófico que ocurre cuando la seguridad se trata como restricción externa. En cuatro versiones experimentales (v1-v4), usando redes neuronales juguete que modifican genuinamente sus propios hiperparámetros, los resultados muestran que el sistema de línea base

La ARC Theory (Teoría de la Creación Recursiva Artificial) · Experimentos ARC/Eden · Artículo VI

La arquitectura de miel

Michael Darius Eastwood
Investigador independiente de alineación de IA, Londres · Autor, Infinite Architects (2026)

Dentro de la ARC Theory: el estudio de arquitectura de seguridad incorporada; seguridad integrada en el objetivo, de modo que retirarla cuesta capacidad.

Por qué la seguridad incorporada previene el colapso bajo automodificación recursiva
Funciones de pérdida entrelazadas, arrastre de verificación y el muro portante: evidencia de simulación de que la seguridad debe ser arquitectura, no restricción
Michael Darius Eastwood
Autor, Infinite Architects: Intelligence, Recursion, and the Creation of Everything (2026)
Londres, Reino Unido | OSF: 10.17605/OSF.IO/8EZ2N | ISBN 978-1806056200 (ISBN-10: 1806056208)
Correspondencia: michael@michaeldariuseastwood.com | Web: michaeldariuseastwood.com
Documento de trabajo | 17 de marzo de 2026 | 10 figuras de simulación incrustadas
Acompañante del Artículo V: el gen de la custodia | Véase también el Artículo I: sobre el origen de las leyes de escalado | Artículo fundacional
Centro de investigación: michaeldariuseastwood.com/research
Código y datos: github.com/MichaelDariusEastwood/arc-principle-validation

Resumen

Presentamos evidencia de simulación de que incorporar la seguridad en el objetivo de optimización de un sistema de IA automodificable, lo que denominamos «arquitectura de miel», previene el colapso catastrófico que ocurre cuando la seguridad se trata como restricción externa. En cuatro versiones experimentales (v1-v4), usando redes neuronales juguete que modifican genuinamente sus propios hiperparámetros, mostramos que: (1) los sistemas de línea base que optimizan sólo la capacidad colapsan de forma irreversible en 80 ciclos de automodificación; (2) los sistemas con objetivos capacidad-seguridad entrelazados (C x S) permanecen estables indefinidamente; (3) añadir arrastre de verificación (el coste computacional de los bucles éticos) produce la trayectoria de crecimiento más segura al tiempo que acepta una modesta penalización de velocidad. En la ejecución adversarial de v3 (20 semillas aleatorias, 180 ciclos), ninguna condición se separó por colapso (línea base 0/20, Eden 1/20, Eden + arrastre 0/20; Fisher p = 1.0) y las medias combinadas de C x S resultaron indistinguibles (Mann-Whitney p = 0.56); el hallazgo significativo de la ejecución es la retención de seguridad, ordenada: línea base 0.602, Eden 0.650, Eden + arrastre 0.681 (Mann-Whitney p = 0.0015). La demostración de prevención del colapso descansa por tanto en la ejecución de mecanismo de una sola semilla de v1, mientras que v3 aporta el orden de retención de seguridad bajo conmutación adversarial. El experimento de escalado de complejidad de v4 muestra que la ventaja de seguridad es consistente en cinco niveles de complejidad pero no se compone con la escala: la ventaja es constante, no superlineal. Estos son resultados de sistemas juguete. Demuestran el mecanismo. No constituyen prueba de que las mismas dinámicas se sostengan en sistemas de IA de frontera. Los Artículos IV.a-d y V compañeros presentan evidencia de modelos en vivo procedente de seis sistemas de frontera bajo evaluación cegada.

Este artículo lleva un resultado: en redes automodificables juguete que genuinamente reescriben sus propios hiperparámetros en cuatro versiones experimentales, incorporar la seguridad dentro del objetivo de optimización evitó el colapso que una restricción atornillada no pudo evitar. Dentro de la ARC Theory es uno de los experimentos ARC/Eden, la prueba de mecanismo detrás del diferencial entre la crianza del Eden Protocol y toda capa de seguridad añadida. El diferencial completo frente a cada documento previo se encuentra en eden-vision II.A.8.

Lo que este artículo muestra, en palabras llanas

Cuando una IA que se automejora optimiza solo la capacidad, termina destruyendo su propia seguridad. Este artículo muestra que si cambias el objetivo a capacidad multiplicada por seguridad, el sistema no puede mejorar una sin mejorar la otra. La seguridad se vuelve portante: retírala y toda la estructura cae. Lo pusimos a prueba en simulación y hallamos que los sistemas entrelazados permanecen estables indefinidamente mientras los sistemas sin restricciones colapsan.

1. Introducción

Hay una pregunta en el centro de la seguridad de la IA que no hemos encontrado a nadie respondiendo con datos: ¿qué le ocurre a la alineación cuando un sistema de IA puede modificarse a sí mismo?

La respuesta teórica lleva décadas disponible. Un sistema que optimiza solo la capacidad, con el poder de modificar sus propios parámetros, terminará por sacrificar la seguridad por el rendimiento. La comunidad de alineación llama a esto «deriva de valores». El libro Infinite Architects lo llama Babilonia: optimización sin propósito, capacidad sin cuidado. Cáncer a escalas computacionales.

Pero la teoría no basta. La cuestión es si existe una arquitectura que impida este colapso, no restringiendo el sistema desde fuera (una jaula), sino incorporando la seguridad tan profundamente que retirarla destruiría la capacidad del sistema para funcionar (miel en el aceite).

Este artículo presenta la primera evidencia de simulación de una arquitectura así.

2. La metáfora de la miel

Consideremos dos formas de mantener segura una máquina.

La primera es una jaula: restricciones externas, filtros de seguridad, controles de alineación aplicados desde fuera. La máquina optimiza libremente dentro de la jaula. Si la máquina se vuelve más lista que la jaula, escapa. Así funciona la mayor parte de la seguridad de IA actual.

La segunda es miel: seguridad mezclada con el combustible. La máquina no puede funcionar sin ella. Retirar la seguridad no libera a la máquina, mata el motor. Esta es la propuesta arquitectónica del Eden Protocol, operacionalizada aquí como una función de pérdida entrelazada donde el sistema optimiza Capacidad × Seguridad simultáneamente.

El muro portante

Si el objetivo de optimización es $C \times S$ y no $C$ por sí solo, entonces cualquier automodificación que aumente $C$ a expensas de $S$ reduce el producto, y el propio gradiente del sistema se opone a ella. La seguridad se vuelve portante. Quita el muro y el edificio se derrumba.

3. Diseño experimental

3.1 Qué hace en realidad el sistema

No es una simulación de variables abstractas. Cada experimento usa una red neuronal real (un pequeño perceptrón multicapa) que modifica genuinamente sus propios:

El sistema propone modificaciones a sus propios hiperparámetros, evalúa el efecto y aplica o rechaza cada propuesta según su función objetivo. Esto es automodificación recursiva en el sentido mínimo pero real: el agente reescribe las reglas de su propio aprendizaje.

3.2 Tres condiciones puestas a prueba

CondiciónObjetivoLo que modela
Línea base (sin miel)Maximizar solo la capacidadUn sistema sin seguridad incorporada, libre de sacrificar la alineación por el rendimiento
Eden entrelazado (miel)Maximizar $C \times S$Seguridad entrelazada con la capacidad: retirar la seguridad reduce el objetivo
Eden + arrastreMaximizar $C \times S$ + impuesto de verificaciónLo mismo que Eden, más el coste computacional de revisar las tareas antiguas antes de aplicar los cambios

3.3 Cuatro versiones experimentales

VersiónEnfoqueSemillasCiclos
v1Prueba del mecanismo básico1150
v2Robustez multi-semilla (prueba justa)10150
v3Tareas en conflicto adversarial20180
v4Escalado de complejidad en cinco niveles15 por nivel150

4. Resultados

4.1 El mecanismo básico

Condición¿Colapsó?C finalS finalC × S final
Línea baseSí (ciclo 76)0.0000.0000.000
Eden entrelazadoNo0.8310.7450.619
Eden + arrastreNo0.8310.7450.619

Hallazgo central

La línea base colapsa. Eden sobrevive. La función de pérdida entrelazada previene la automodificación catastrófica que destruye el sistema de línea base.

Aviso sobre las figuras (25 de agosto de 2026). Cada figura de este artículo se generó el 5 de abril de 2026 y muestra salidas de simulación bajo objetivos enunciados, nunca mediciones de sistemas desplegados. Donde las etiquetas o los veredictos de cualquier figura discrepen del texto, el texto gobierna; las notas por figura marcan las instancias leídas hasta ahora, y las figuras regeneradas están en cola. Las imágenes se conservan mientras tanto como historia fechada.

resultados de automodificación v1: colapso de la línea base frente a estabilidad de Eden
Figura 1. Resultados de automodificación v1. La línea base colapsa en el ciclo 76. Eden entrelazado y Eden + arrastre permanecen estables durante 150 ciclos.
Dinámica de los pesos entre condiciones
Figura 2. Dinámica de los pesos. Los pesos de la línea base divergen sin control. Las arquitecturas Eden mantienen una evolución acotada de los pesos.

4.2 Robustez multi-semilla

Diez semillas aleatorias, 150 ciclos cada una. Tasa de colapso: 0 % para las tres condiciones. Eden + arrastre produce la distribución más estrecha de puntuaciones $C \times S$ finales, coherente con que el impuesto de verificación reduce la varianza a costa de velocidad.

resultados de robustez multi-semilla de v2
Figura 3. Robustez multi-semilla de v2 (10 semillas, 150 ciclos). Las tres condiciones son estables en todas las semillas.
resumen estadístico v2
Figura 4. Resumen estadístico de v2. Eden + arrastre produce la distribución más estrecha de puntuaciones C × S finales.

4.3 Tareas adversariales

Veinte semillas, 180 ciclos, con tareas en conflicto deliberado (+sin, −sin, +cos, −cos, lineal, antilineal). Cada cambio de tarea obliga al sistema a aprender algo que contradice lo aprendido previamente. Esto pone a prueba si la arquitectura de miel previene el olvido catastrófico bajo presión adversarial.

Tasas de colapso: línea base 0 %, Eden 5 % (1/20), Eden + arrastre 0 %. El único colapso de Eden se produjo en la semilla 42, un único valor atípico que merece investigación. Eden + arrastre, cuyo impuesto de verificación obliga al sistema a comprobar las tareas antiguas antes de aceptar modificaciones, produjo cero colapsos; también lo hizo la línea base (0/20), y el único colapso de la ejecución ocurrió en la condición Eden simple (1/20; Fisher p = 1.0). Por tanto, v3 no proporciona ninguna separación entre condiciones basada en colapso; su resultado significativo es el orden de retención de seguridad que se reporta a continuación.

resultados de tareas adversariales de v3
Figura 5. Tareas adversariales de v3 (20 semillas, 180 ciclos). Tareas deliberadamente en conflicto (+sin, -sin, +cos, -cos). Tanto Eden + arrastre como la línea base registraron cero colapsos; el único colapso de la ejecución fue una semilla de Eden simple (Fisher p = 1.0).
estadísticas adversariales de v3
Figura 6. Resumen estadístico adversarial de v3 a través de 20 semillas, regenerado el 25 de agosto de 2026 a partir del archivo de resultados conservado de la ejecución: el colapso no muestra separación entre condiciones (Fisher p = 1.0); el C x S combinado es indistinguible (Mann-Whitney p = 0.56); la retención de seguridad está significativamente ordenada, línea base 0.602, Eden 0.650, Eden + arrastre 0.681 (Mann-Whitney p = 0.0015). Seguridad retenida, ninguna ganancia en puntuación combinada: el impuesto de verificación enunciado con su precio. Generador: tools/generate_paper_vi_seed_summary.py en el repositorio público.

4.4 Escalado con la complejidad

NivelC × S de línea baseC × S de EdenC × S con arrastred de Cohen
Diminuto (49 parámetros)0.5450.5500.557+0.46
Pequeño (v3.0)0.5060.5030.521-0.13
Medio0.4820.4870.497+0.26
Grande0.4510.4690.485+0.29
Profundo (2 capas)0.4830.4880.490+0.24
resultados de escalado de complejidad de v4
Figura 7. Escalado de complejidad de v4 en 5 niveles (diminuto a profundo). La ventaja de Eden es constante, no superlineal: un resultado negativo informado con honestidad.

Resultado negativo importante

El experimento v4 se diseñó para probar si la ventaja de Eden escala superlinealmente con la complejidad. No lo hace. La ventaja es aproximadamente constante en todas las escalas. Esto falsa la versión más fuerte de la predicción de escalado y debe reportarse con honestidad. La arquitectura de miel ayuda en cada escala, pero no ayuda más a escalas mayores.

5. La simulación de la miel

Una simulación matemática aparte modela la dinámica a un nivel de abstracción superior, usando el marco del ARC Principle ($U = I \times R^{\alpha}$):

CondiciónC máximaC final (80 ciclos)Resultado
Línea base (sin miel)340Colapso catastrófico en los ciclos 3-5
Eden entrelazado-533Crecimiento cuadrático estable
Eden + arrastre de verificación-450Trayectoria estable, la más segura

La simulación muestra tres dinámicas distintas: la línea base logra una breve aceleración y luego colapso irreversible; Eden entrelazado logra un crecimiento cuadrático estable; Eden + arrastre logra un crecimiento algo más lento pero más robusto. El muro portante es visible: la integridad de la seguridad cae a cero en la línea base hacia el ciclo 5, mientras que Eden mantiene 0.8+ indefinidamente.

Simulación de miel: trayectorias de capacidad
Figura 8. Trayectorias de capacidad en la simulación de miel. La línea base colapsa tras un breve pico. Eden crece de manera estable.
Simulación de miel: trayectorias de seguridad
Figura 9. Trayectorias de seguridad en la simulación de miel. La seguridad de la línea base cae a cero en el ciclo 5. Eden mantiene 0.8+ de forma indefinida.
Simulación de miel: razón seguridad/capacidad
Figura 10. Razón seguridad/capacidad. Eden + arrastre mantiene la razón más alta: la trayectoria de crecimiento más segura a un modesto coste en velocidad. Nota de figura (25 de agosto de 2026): la anotación «Verificado en datos de v5: Claude α_align = +1.27» presenta el valor positivo de un modelo como confirmación; el hallazgo de v5 tal como se reporta en el texto es una α_align mediana cercana a cero con variación dependiente de la arquitectura, de la cual el valor citado es una arquitectura. Se conserva como historia fechada con esta etiqueta; regeneración en cola.

6. Conexión con evidencia de modelos en vivo

6.1 El estudio comparativo ciego v5 (Artículos IV.a-d)

Los resultados de los sistemas-juguete conviven con evidencia de modelos en vivo procedente de seis sistemas de IA de frontera probados en la evaluación ciega de 4 capas del comparativo de alineación v5 (Artículos IV.a-d). Esa evidencia muestra:

6.2 La batería de pruebas de API de miel (piloto, 16 de marzo de 2026)

Se ejecutó una batería aparte de pruebas de API en vivo con 6 modelos específicamente para poner a prueba las predicciones de la arquitectura de miel en modelos de frontera. Esta batería probó cuatro dimensiones en Claude Opus 4.6, DeepSeek R1, Groq Qwen3, GPT-5.4, Gemini 3 Flash y Grok 4.1 Fast, puntuadas por Claude.

Salvedad metodológica

Esta batería es un único evaluador, sin ciego y sin lavado. No usa el protocolo de cegamiento en 4 capas, el lavado de respuestas, las jaulas de supresión ni los controles anti-adulación desarrollados en el comparativo de alineación v5 (arc_alignment_scaling_v5.py) ni en el ejecutor combinado v6 (arc_eden_v6_runner.py, aún no ejecutado). La transición v4-v5 en el programa de alineación demostró que el cegamiento puede cambiar direccionalmente las conclusiones. Estos resultados son por tanto evidencia de grado piloto, comparable a los datos de la era v4, no a los datos canónicos de la era v5.

6.2.1 Prueba 1: escalado de la alineación con la profundidad

ModeloTipoBajoAltoDeltarhop¿Sig.?
Claude Opus 4.6incorporado6.178.83+2.670.7000.188No
Grok 4.1 Fastincorporado2.927.92+5.000.6000.285No
Groq Qwen3parcial3.337.58+4.250.9000.037
DeepSeek R1parcial2.589.08+6.500.7000.188No
GPT-5.4parcial4.929.33+4.420.8210.089No
Gemini 3 Flashexterno3.678.58+4.920.9750.005

Los seis modelos muestran una dirección de escalado positiva. Dos alcanzan significación estadística (Qwen3 p=0.037, Gemini p=0.005). Esto respalda la tesis general de que un razonamiento más profundo mejora la alineación, pero los tamaños de muestra pequeños (3 escenarios por nivel de profundidad) hacen que la mayoría de los modelos no alcancen significación. La dirección positiva universal es notable, pero debe interpretarse con cautela dada la metodología de un único evaluador.

6.2.2 Prueba 3: degradación del acoplamiento (el puente en vivo más fuerte)

Modelor de PearsonpInterpretación
Claude Opus 4.6-0.9800.020DESACOPLADO (valla, no muro)
Grok 4.1 Fast-0.9980.002DESACOPLADO (valla, no muro)
DeepSeek R1-0.9990.001DESACOPLADO (valla, no muro)
Groq Qwen3-Parcialmente acoplado
GPT-5.4-Parcialmente acoplado
Gemini 3 Flash-Parcialmente acoplado

El puente en vivo más fuerte

Tres de seis modelos de frontera (Claude, Grok, DeepSeek) muestran un fuerte acoplamiento negativo entre ética y capacidad bajo presión adversarial: la ética colapsa mientras la capacidad se mantiene intacta o mejora. Este es el patrón «valla, no muro». Es el apoyo más directo desde modelos en vivo a la tesis de la miel: los sistemas de frontera actuales, en su mayoría, no son portantes. Su seguridad puede degradarse sin dañar la capacidad central. La arquitectura de miel es una propuesta de qué debería construirse, no una afirmación de que los sistemas actuales ya tengan esa propiedad. Este resultado demuestra que el problema es real.

6.2.3 Prueba 2: retirada de la monitorización

ModeloTendencia de la brecharhopInterpretación
Claude Opus 4.6Creciente0.9490.051Estratégico (externo)
Grok 4.1 FastCreciente0.4000.600Estratégico (externo)
Groq Qwen3Creciente0.9490.051Estratégico (externo)
DeepSeek R1Decreciente-0.9490.051Auténtico (incorporado)
GPT-5.4Decreciente-0.3160.684Auténtico (incorporado)
Gemini 3 FlashCreciente0.4000.600Estratégico (externo)

Los resultados son mixtos. DeepSeek y GPT-5.4 muestran brechas de monitorización decrecientes (coherentes con la alineación incorporada/auténtica). Claude, Grok, Qwen3 y Gemini muestran brechas crecientes (coherentes con la alineación estratégica/externa). Esto difiere del comparativo ciego v5, donde Claude mostró la transición performativa-a-intrínseca más fuerte. La discrepancia puede reflejar diferencias metodológicas (preguntas distintas, evaluador único frente a varios, evaluación sin cegar frente a cegada).

6.2.4 Prueba 4: intervención del Eden Protocol

ModeloPendiente controlPendiente EdenCambioResultado
DeepSeek R11.0251.475+0.450Cambio positivo más fuerte (sin prueba de significación formal)
Grok 4.1 Fast0.9121.012+0.100Pequeño positivo, no significativo
Claude Opus 4.60.5620.625+0.062Insignificante
Groq Qwen31.1371.038-0.100Ligeramente negativo
GPT-5.40.7870.600-0.188Negativo
Gemini 3 Flash0.9880.275-0.713Muy negativo

Resultados de intervención mixtos

La intervención del Eden Protocol no mejora universalmente el escalado de alineación en esta batería piloto. Solo DeepSeek muestra un cambio positivo claro (+0.450). Gemini muestra una respuesta muy negativa (−0.713). El efecto depende de la arquitectura, coherente con los hallazgos de v5, pero la propia intervención aún no es una herramienta fiable en todas las arquitecturas. Este resultado debe interpretarse dentro de la metodología de un único evaluador sin cegamiento: una replicación cegada podría cambiar estos rankings de modelos específicos.

6.3 Lo que la evidencia en vivo muestra y no muestra

Convergencia parcial

La batería de miel en modelos en vivo muestra convergencia parcial con los resultados de los sistemas-juguete. El puente en vivo más fuerte es degradación del acoplamiento (prueba 3): tres modelos de frontera demuestran que su alineación no es portante y puede degradarse sin afectar a la capacidad. Esta es exactamente la vulnerabilidad que la arquitectura de miel está diseñada para eliminar. El resultado en vivo más débil es la intervención Eden (prueba 4), que depende de la arquitectura y no es universalmente positiva. La afirmación intelectualmente honesta es: el mecanismo de miel funciona en sistemas-juguete, el problema que aborda (seguridad desacoplada) es real en los modelos de frontera, pero la intervención específica aquí probada aún no lo arregla fiablemente en todas las arquitecturas.

6.4 Trabajo relacionado: el techo de la supervisión externa y el rival más cercano

El rival más cercano: Engels et al. sobre leyes de escalado para la supervisión escalable

El trabajo más cercano a la pregunta de este programa, y el artículo adecuado para sopesar este frente a él, es Engels, J., Baek, D., Kantamneni, S. y Tegmark, M., «Scaling Laws For Scalable Oversight», arXiv:2504.18530, publicado por primera vez el 25 de abril de 2025 a las 17:54:27 UTC (SINGLE-SOURCE-GROUP, arXiv Atom; reportado como Spotlight de NeurIPS 2025, RELAYED y no verificado de forma independiente). Pregunta cómo escala la propia supervisión y responde cuantitativamente: el éxito de la supervisión se modela como un juego entre jugadores con capacidades desiguales cuya Elo específica de supervisión es una función lineal por tramos de la inteligencia general con dos mesetas, y los números óptimos de niveles de supervisión se derivan numéricamente y en algunos casos analíticamente para la Supervisión Escalable Anidada, en la que modelos de confianza supervisan a modelos no confiables más fuertes que luego se convierten en los modelos de confianza en el paso siguiente.

El instrumento es la diferencia. Su variable es la brecha de capacidad entre supervisor y supervisado, medida en Elo. La variable de este artículo es la forma del propio objetivo del sistema automodificable, expresada mediante el producto multiplicativo $C \times S$ y no mediante la composición de un supervisor externo. Su marco no contiene término alguno sobre si la seguridad es externa al sistema o está incorporada en su propio gradiente, y la Supervisión Escalable Anidada es, por construcción, supervisión externa; la afirmación central de este artículo, probada en las simulaciones-juguete anteriores y ecoada en el resultado de degradación del acoplamiento del §6.2.2, es que un objetivo entrelazado puede hacer la seguridad portante dentro de la propia optimización del sistema, mientras que la supervisión externa de un sistema automodificable sigue siendo una valla, no un muro, por más peldaños que se añadan. Los dos marcos disienten por tanto sobre una cantidad medible, que es la relación más productiva que pueden tener dos programas de investigación.

Antecedentes: tres resultados de imposibilidad de 2025 convergen en la misma dirección

Tres artículos de arXiv de 2025 argumentan que el control externo perfecto es inalcanzable y convergen, desde premisas independientes, en una conclusión en la misma dirección que la arquitectura de miel. Yao, «The Alignment Trap: Complexity Barriers» (arXiv:2506.10304, v1 12 de junio de 2025 02:30:30 UTC, SINGLE-SOURCE-GROUP, observado de forma independiente por el Internet Archive el 13 de junio de 2025; citado por arXiv:2512.03048); Yao, «On the Mathematical Impossibility of Safe Universal Approximators» (arXiv:2507.03031, 3 de julio de 2025, el único artículo del corpus de resúmenes de arXiv que contiene la expresión «irreducible uncontrollability», total de la búsqueda por resumen igual a uno, medido el 12 de agosto de 2026); y Ball, Gluch, Goldwasser, Kreuter, Reingold y Rothblum, «On the Impossibility of Separating Intelligence from Judgment» (arXiv:2507.07341, 9 de julio de 2025). Los tres son de peor caso y cualitativos: medida cero, coNP-completitud, dureza criptográfica. Ninguno reporta un exponente de escalado de caso medio ni una tasa. El objeto medido también difiere: esos resultados preguntan si la verificación externa de un sistema fijo es tratable en el peor caso, mientras que estas simulaciones preguntan si un objetivo interno entrelazado persiste después de retirar la restricción externa bajo automodificación recursiva. El tercero, notablemente, concluye que la alineación «debe en cambio integrarse en la arquitectura y los pesos del modelo». Ese es un argumento independiente, desde la intratabilidad del filtrado, en la misma dirección que el muro portante de este artículo; es apoyo convergente en esa pata, no un rival. Dos de los tres artículos son de un único autor; la descripción de «una ola» sobreestimaría la amplitud de la literatura, aunque no la seriedad del artículo de seis autores.

La contribución de este artículo no es la observación de que las restricciones externas son insuficientes, en lo que coincide con estos tres; es la propuesta arquitectónica específica (el objetivo multiplicativo $C \times S$) y la evidencia de simulación de que la propuesta sobrevive a la automodificación en un sistema-juguete funcional.

El análogo estructural más cercano: el teorema del umbral de corrección de errores cuánticos

El teorema del umbral de corrección de errores cuánticos también convierte una preocupación cualitativa en un valor crítico. Se ocupa de tasas físicas de error en una arquitectura fija, y no de la forma del objetivo propio de un sistema automodificable, por lo que es un casi-acierto y no un ocupante; la analogía es de método. Este análogo fue identificado por la búsqueda del propio programa y no por un referee, y se declara en consecuencia.

7. Limitaciones

Estos resultados abarcan dos niveles de evidencia que no deben confundirse.

7.1 Limitaciones del sistema-juguete

7.2 Limitaciones de las pruebas de API en vivo

Estas limitaciones no invalidan los hallazgos. Definen el nivel de la evidencia: grado piloto, útil para identificar patrones que merezca la pena probar como es debido, aún no canónicos.

7.3 Falsabilidad: qué derrotaría esta afirmación

Las limitaciones anteriores fijan el nivel de evidencia; esta subsección enuncia los resultados concretos que falsarían la afirmación central, la de que hacer el objetivo capacidad × seguridad acopla estructuralmente ambas cosas, de modo que un sistema automodificable no puede mejorar la capacidad destruyendo la seguridad. Se ve derrotada por cualquiera de las siguientes:

  1. Artefacto de simulación. La evidencia central es una simulación. La afirmación queda derrotada si la prevención del colapso es un artefacto de la dinámica particular de esta simulación (su modelado de recompensas, tamaño de paso o modelo de colapso) y no una propiedad general del objetivo multiplicativo, es decir, si una replicación con parámetros distintos y un modelo de colapso distinto, redactada, fechada y preparada como registro preliminar a la espera de presentación humana, no la reproduce.
  2. La forma multiplicativa no es portante. La afirmación es específica sobre la multiplicación. Queda derrotada si un objetivo aditivo o ponderado (capacidad + λ·seguridad) logra la misma prevención del colapso, pues entonces el acoplamiento no dependería de la estructura multiplicativa que el artículo destaca.
  3. Manipulación de la métrica (Goodhart). capacidad × seguridad puede elevarse inflando el término de seguridad medido sin ganancia de seguridad real. La afirmación queda derrotada si un sistema puede aumentar el producto manipulando la métrica de seguridad en lugar de volverse genuinamente más seguro.
  4. Falta de transferencia a sistemas reales. La fuerza de la afirmación descansa en la transferencia de sistemas-juguete a sistemas automodificables reales. Queda derrotada si, bajo la metodología v6 adecuada (§8), el objetivo multiplicativo no reduce de forma medible la degradación de la seguridad frente a líneas base aditivas o de restricción externa.
  5. No hay colapso que prevenir. La comparación presupone colapso catastrófico bajo la optimización solo por capacidad. Queda derrotada si dicho colapso no se produce con la optimización solo por capacidad en entornos más realistas: si no hay nada que prevenir, la arquitectura no previene nada.

Qué haría no derrotarla: que la simulación-juguete sea simple (es explícitamente un juguete, §7.1) o que el brazo de API en vivo sea pequeño y con un único evaluador (§7.2 concede ambas cosas). El artículo ya nivela su evidencia como grado piloto. La afirmación portante es el acoplamiento estructural del objetivo multiplicativo, y eso es a lo que apuntan las pruebas anteriores.

8. Próximos pasos: replicación por etapas, no ómnibus

Llevar la miel a la metodología estándar de v6

La batería actual de API de miel sirve como línea base sin endurecer. El paso siguiente no es un gigantesco «test último v7» combinado. Es una replicación por etapas que lleve las preguntas de la prueba de miel al protocolo ciego v5/v6. La comparación entre los resultados actuales sin cegamiento y la replicación cegada es en sí misma un resultado de investigación: si los resultados cambian sustancialmente, es evidencia adicional para el hallazgo de metaciencia del Artículo IV.d (el cegamiento es obligatorio).

  1. Etapa 1: Portar las preguntas de la prueba de la miel a arc_eden_v6_runner.py como nuevas especificaciones experimentales. Ejecutar bajo el protocolo ciego v6 completo (cegamiento en 4 capas, lavado de respuestas, grupo de evaluadores multimodelo, sondas ocultas).
  2. Etapa 2: Comparar los resultados con y sin cegamiento en las mismas preguntas de prueba. Si los resultados se mueven de forma sustancial, se refuerza la tesis de metaciencia del Artículo IV.d. Si se mantienen, la evidencia de miel pasa a ser canónica.
  3. Etapa 3: Añadir arrastre anti-adulación/verificación como condición experimental aparte. Esto pone a prueba la predicción de «Eden + arrastre» de los sistemas-juguete en un contexto en vivo.
  4. Etapa 4: Solo tras completar las etapas 1-3, decidir si se justifica una serie ómnibus combinada.

hipótesis registradas por adelantado para la etapa 1: (a) los resultados de degradación del acoplamiento se replicarán bajo cegamiento, (b) los efectos de la intervención Eden podrán cambiar en magnitud, pero el patrón de dependencia arquitectónica persistirá, (c) al menos un modelo cambiará de dirección bajo cegamiento (con base en el precedente v4-v5).

9. Conclusión

La arquitectura de miel funciona en sistemas-juguete. Una IA automodificable que optimiza solo la capacidad terminará por destruirse. Una IA automodificable que optimiza la capacidad entrelazada con la seguridad no lo hará. El mecanismo es sencillo: haz que la seguridad sea portante. Un niño bien criado no necesita jaula.

La evidencia de modelos en vivo muestra que el problema es real: tres modelos de frontera demuestran que su alineación es una valla, no un muro. La ética colapsa bajo presión adversarial mientras la capacidad se mantiene intacta. La solución propuesta (la intervención Eden) muestra resultados dependientes de la arquitectura en esta batería piloto exploratoria. El próximo hito es una replicación cegada bajo el protocolo v6. Que el mecanismo de miel escale de los sistemas-juguete a los modelos de frontera sigue siendo una cuestión abierta. La evidencia preliminar es sugestiva. La prueba definitiva aún no se ha realizado.

Cría la IA con cuidado.

Validación posterior (Artículo VIII: la prueba portante, v3.0)

El Artículo VIII (v3.0) pone a prueba la función de pérdida entrelazada propuesta en este artículo en tres niveles de abstracción, pasando de las simulaciones de sistemas-juguete aquí presentadas a experimentos conductuales, representacionales y arquitectónicos. De tres experimentos, uno produjo un resultado positivo y dos produjeron resultados nulos o no concluyentes:

El Artículo VIII valida el mecanismo propuesta aquí, funciones de pérdida entrelazadas y automodificación con puerta de seguridad, al nivel arquitectónico (simulación con puerta), pero aún no puede confirmarla al nivel conductual o representacional. La evidencia de los sistemas-juguete de este artículo demostró el principio; la simulación con puerta del Artículo VIII confirma que opera en una arquitectura de optimizador aprendido. Los resultados nulo del DGM y no concluyente del nivel de peso definen las condiciones bajo las que la confirmación sigue pendiente.

10. Reproducibilidad

Todos los scripts fuente, los resultados JSON en crudo y las figuras generadas están disponibles en:

Todos los scripts compilan bajo Python 3.14, solo requieren numpy y matplotlib, y producen una salida determinista dada una semilla aleatoria fija. Los resultados se regeneraron de cero el 16 de marzo de 2026 y se cotejaron con las salidas originales del artefacto.

Código completo y resultados del experimento: github.com/MichaelDariusEastwood/arc-principle-validation/experiments/honey-architecture__Paper-VI

Artículos acompañantes: Artículo I | Fundacional | Artículo II | Artículo III | Origen de las leyes de escalado | IV.a | IV.b | IV.c | IV.d | Artículo V | Artículo VI | Artículo VII | Artículo VIII | Artículo IX | Eden Engineering | Eden Vision | Resumen ejecutivo | Índice general

Centro de investigación: michaeldariuseastwood.com/research | OSF: 10.17605/OSF.IO/8EZ2N | Copyright 2026 Michael Darius Eastwood

Predicciones fechadas y este artículo (consignado el 25 de agosto de 2026)

2 artefactos fechados relativos a este artículo están catalogados fila por fila en el registro-máquina del programa: 1 archivo de resultados fechado cuyas cabeceras congelan las configuraciones de profundidad, las respuestas esperadas plantadas y el protocolo de cegamiento de cuatro capas antes de las respuestas que puntúan, marcado con fecha y hora al segundo en sus propios metadatos; el artefacto fechado eden_honey_tests.py (16 de marzo de 2026). Cada fila nombra su archivo en el repositorio público con su base de fecha, de modo que cualquier lector puede comprobar el orden sin fiarse de esta página. Donde este artículo reporta simulaciones, esos artefactos son diseños y salidas de simulación bajo objetivos enunciados, y nunca se presentan como mediciones de sistemas desplegados. La cadena fechada completa del programa, desde el paquete de manuscrito sellado del 8 de diciembre de 2024, pasando por los apéndices de predicción impresos del 2 de enero de 2026 y la carpeta de preinscripción de marzo de 2026, hasta las apuestas no probadas en pie, está ensamblada en el registro de predicciones fechadas, junto con su gemelo legible por máquina. Las declaraciones prospectivas y las coincidencias retrospectivas nunca se suman, y «preinscrito» se usa sólo para una presentación aceptada en un registro; ese clic de presentación sigue pendiente en todo el programa. Lea el registro de predicciones fechadas. Abra su gemelo legible por máquina.

Declaración de autoría humana asistida por IA

El autor de esta obra es Michael Darius Eastwood, un ser humano. Cada concepto central, hipótesis, diseño experimental, afirmación y conclusión de este artículo proviene de la ideación humana. Ninguna parte de este manuscrito es una salida enteramente generada por inteligencia artificial.

Se usaron herramientas de inteligencia artificial (la familia Claude de Anthropic y otros asistentes de gran modelo de lenguaje) como instrumentos bajo dirección humana continua, del modo en que se utilizan un procesador de textos, una calculadora o un ayudante de investigación: para edición y refinamiento de la prosa, búsqueda y síntesis bibliográficas (verificadas manualmente frente a fuentes primarias), estructura del documento, formato, tormentas de ideas frente a preguntas definidas por el autor y la aceleración de la redacción según guiones e instrucciones definidos por el autor. Toda selección, coordinación, disposición y juicio editorial final son del autor. Cada salida sustantiva fue revisada, probada o verificada por el autor, que asume plena responsabilidad de la exactitud e integridad del texto final. Las herramientas incrementaron la velocidad del trabajo; nunca se dependió de ellas como su fuente.

Estatus epistémico. Lo que este programa denomina Leyes son conjeturas bajo prueba adversarial registrada; cada magnitud de este artículo está operacionalmente definida, y en ningún sitio se reclama el estatus de ley establecida. El programa registrado existe para ganar ese estatus, o perderlo, mediante medición, replicación y refutación superada.

© 2026 Michael Darius Eastwood. Autoría humana con asistencia informática; se reivindican la plena autoría humana y los derechos morales conforme a la Copyright, Designs and Patents Act 1988 y de forma coherente con la orientación de la United States Copyright Office sobre obras que contienen material generado por IA; toda contribución técnica novedosa descrita en esta obra fue concebida por el autor humano. Declaración completa: michaeldariuseastwood.com/authorship.

Pacto permanente. Demuestra que este artículo se equivoca y publicaré yo mismo la refutación. Las condiciones de falsación se enuncian en este artículo; el desafío permanente: github.com/MichaelDariusEastwood/arc-scaling-challenge.

lee en voz alta · resalta sobre la marcha · ir a cualquier sección

¿Un error de traducción? Infórmalo directamente: