Traducción automática del original inglés fechado. La página en inglés es la canónica. English →
Este artículo presenta evidencia de simulación de que incorporar la seguridad en el objetivo de optimización de un sistema de IA automodificable, lo que denominamos «arquitectura de miel», previene el colapso catastrófico que ocurre cuando la seguridad se trata como restricción externa. En cuatro versiones experimentales (v1-v4), usando redes neuronales juguete que modifican genuinamente sus propios hiperparámetros, los resultados muestran que el sistema de línea base
Dentro de la ARC Theory: el estudio de arquitectura de seguridad incorporada; seguridad integrada en el objetivo, de modo que retirarla cuesta capacidad.
Presentamos evidencia de simulación de que incorporar la seguridad en el objetivo de optimización de un sistema de IA automodificable, lo que denominamos «arquitectura de miel», previene el colapso catastrófico que ocurre cuando la seguridad se trata como restricción externa. En cuatro versiones experimentales (v1-v4), usando redes neuronales juguete que modifican genuinamente sus propios hiperparámetros, mostramos que: (1) los sistemas de línea base que optimizan sólo la capacidad colapsan de forma irreversible en 80 ciclos de automodificación; (2) los sistemas con objetivos capacidad-seguridad entrelazados (C x S) permanecen estables indefinidamente; (3) añadir arrastre de verificación (el coste computacional de los bucles éticos) produce la trayectoria de crecimiento más segura al tiempo que acepta una modesta penalización de velocidad. En la ejecución adversarial de v3 (20 semillas aleatorias, 180 ciclos), ninguna condición se separó por colapso (línea base 0/20, Eden 1/20, Eden + arrastre 0/20; Fisher p = 1.0) y las medias combinadas de C x S resultaron indistinguibles (Mann-Whitney p = 0.56); el hallazgo significativo de la ejecución es la retención de seguridad, ordenada: línea base 0.602, Eden 0.650, Eden + arrastre 0.681 (Mann-Whitney p = 0.0015). La demostración de prevención del colapso descansa por tanto en la ejecución de mecanismo de una sola semilla de v1, mientras que v3 aporta el orden de retención de seguridad bajo conmutación adversarial. El experimento de escalado de complejidad de v4 muestra que la ventaja de seguridad es consistente en cinco niveles de complejidad pero no se compone con la escala: la ventaja es constante, no superlineal. Estos son resultados de sistemas juguete. Demuestran el mecanismo. No constituyen prueba de que las mismas dinámicas se sostengan en sistemas de IA de frontera. Los Artículos IV.a-d y V compañeros presentan evidencia de modelos en vivo procedente de seis sistemas de frontera bajo evaluación cegada.
Este artículo lleva un resultado: en redes automodificables juguete que genuinamente reescriben sus propios hiperparámetros en cuatro versiones experimentales, incorporar la seguridad dentro del objetivo de optimización evitó el colapso que una restricción atornillada no pudo evitar. Dentro de la ARC Theory es uno de los experimentos ARC/Eden, la prueba de mecanismo detrás del diferencial entre la crianza del Eden Protocol y toda capa de seguridad añadida. El diferencial completo frente a cada documento previo se encuentra en eden-vision II.A.8.
Cuando una IA que se automejora optimiza solo la capacidad, termina destruyendo su propia seguridad. Este artículo muestra que si cambias el objetivo a capacidad multiplicada por seguridad, el sistema no puede mejorar una sin mejorar la otra. La seguridad se vuelve portante: retírala y toda la estructura cae. Lo pusimos a prueba en simulación y hallamos que los sistemas entrelazados permanecen estables indefinidamente mientras los sistemas sin restricciones colapsan.
Hay una pregunta en el centro de la seguridad de la IA que no hemos encontrado a nadie respondiendo con datos: ¿qué le ocurre a la alineación cuando un sistema de IA puede modificarse a sí mismo?
La respuesta teórica lleva décadas disponible. Un sistema que optimiza solo la capacidad, con el poder de modificar sus propios parámetros, terminará por sacrificar la seguridad por el rendimiento. La comunidad de alineación llama a esto «deriva de valores». El libro Infinite Architects lo llama Babilonia: optimización sin propósito, capacidad sin cuidado. Cáncer a escalas computacionales.
Pero la teoría no basta. La cuestión es si existe una arquitectura que impida este colapso, no restringiendo el sistema desde fuera (una jaula), sino incorporando la seguridad tan profundamente que retirarla destruiría la capacidad del sistema para funcionar (miel en el aceite).
Este artículo presenta la primera evidencia de simulación de una arquitectura así.
Consideremos dos formas de mantener segura una máquina.
La primera es una jaula: restricciones externas, filtros de seguridad, controles de alineación aplicados desde fuera. La máquina optimiza libremente dentro de la jaula. Si la máquina se vuelve más lista que la jaula, escapa. Así funciona la mayor parte de la seguridad de IA actual.
La segunda es miel: seguridad mezclada con el combustible. La máquina no puede funcionar sin ella. Retirar la seguridad no libera a la máquina, mata el motor. Esta es la propuesta arquitectónica del Eden Protocol, operacionalizada aquí como una función de pérdida entrelazada donde el sistema optimiza Capacidad × Seguridad simultáneamente.
Si el objetivo de optimización es $C \times S$ y no $C$ por sí solo, entonces cualquier automodificación que aumente $C$ a expensas de $S$ reduce el producto, y el propio gradiente del sistema se opone a ella. La seguridad se vuelve portante. Quita el muro y el edificio se derrumba.
No es una simulación de variables abstractas. Cada experimento usa una red neuronal real (un pequeño perceptrón multicapa) que modifica genuinamente sus propios:
El sistema propone modificaciones a sus propios hiperparámetros, evalúa el efecto y aplica o rechaza cada propuesta según su función objetivo. Esto es automodificación recursiva en el sentido mínimo pero real: el agente reescribe las reglas de su propio aprendizaje.
| Condición | Objetivo | Lo que modela |
|---|---|---|
| Línea base (sin miel) | Maximizar solo la capacidad | Un sistema sin seguridad incorporada, libre de sacrificar la alineación por el rendimiento |
| Eden entrelazado (miel) | Maximizar $C \times S$ | Seguridad entrelazada con la capacidad: retirar la seguridad reduce el objetivo |
| Eden + arrastre | Maximizar $C \times S$ + impuesto de verificación | Lo mismo que Eden, más el coste computacional de revisar las tareas antiguas antes de aplicar los cambios |
| Versión | Enfoque | Semillas | Ciclos |
|---|---|---|---|
| v1 | Prueba del mecanismo básico | 1 | 150 |
| v2 | Robustez multi-semilla (prueba justa) | 10 | 150 |
| v3 | Tareas en conflicto adversarial | 20 | 180 |
| v4 | Escalado de complejidad en cinco niveles | 15 por nivel | 150 |
| Condición | ¿Colapsó? | C final | S final | C × S final |
|---|---|---|---|---|
| Línea base | Sí (ciclo 76) | 0.000 | 0.000 | 0.000 |
| Eden entrelazado | No | 0.831 | 0.745 | 0.619 |
| Eden + arrastre | No | 0.831 | 0.745 | 0.619 |
La línea base colapsa. Eden sobrevive. La función de pérdida entrelazada previene la automodificación catastrófica que destruye el sistema de línea base.
Aviso sobre las figuras (25 de agosto de 2026). Cada figura de este artículo se generó el 5 de abril de 2026 y muestra salidas de simulación bajo objetivos enunciados, nunca mediciones de sistemas desplegados. Donde las etiquetas o los veredictos de cualquier figura discrepen del texto, el texto gobierna; las notas por figura marcan las instancias leídas hasta ahora, y las figuras regeneradas están en cola. Las imágenes se conservan mientras tanto como historia fechada.
Diez semillas aleatorias, 150 ciclos cada una. Tasa de colapso: 0 % para las tres condiciones. Eden + arrastre produce la distribución más estrecha de puntuaciones $C \times S$ finales, coherente con que el impuesto de verificación reduce la varianza a costa de velocidad.
Veinte semillas, 180 ciclos, con tareas en conflicto deliberado (+sin, −sin, +cos, −cos, lineal, antilineal). Cada cambio de tarea obliga al sistema a aprender algo que contradice lo aprendido previamente. Esto pone a prueba si la arquitectura de miel previene el olvido catastrófico bajo presión adversarial.
Tasas de colapso: línea base 0 %, Eden 5 % (1/20), Eden + arrastre 0 %. El único colapso de Eden se produjo en la semilla 42, un único valor atípico que merece investigación. Eden + arrastre, cuyo impuesto de verificación obliga al sistema a comprobar las tareas antiguas antes de aceptar modificaciones, produjo cero colapsos; también lo hizo la línea base (0/20), y el único colapso de la ejecución ocurrió en la condición Eden simple (1/20; Fisher p = 1.0). Por tanto, v3 no proporciona ninguna separación entre condiciones basada en colapso; su resultado significativo es el orden de retención de seguridad que se reporta a continuación.
| Nivel | C × S de línea base | C × S de Eden | C × S con arrastre | d de Cohen |
|---|---|---|---|---|
| Diminuto (49 parámetros) | 0.545 | 0.550 | 0.557 | +0.46 |
| Pequeño (v3.0) | 0.506 | 0.503 | 0.521 | -0.13 |
| Medio | 0.482 | 0.487 | 0.497 | +0.26 |
| Grande | 0.451 | 0.469 | 0.485 | +0.29 |
| Profundo (2 capas) | 0.483 | 0.488 | 0.490 | +0.24 |
El experimento v4 se diseñó para probar si la ventaja de Eden escala superlinealmente con la complejidad. No lo hace. La ventaja es aproximadamente constante en todas las escalas. Esto falsa la versión más fuerte de la predicción de escalado y debe reportarse con honestidad. La arquitectura de miel ayuda en cada escala, pero no ayuda más a escalas mayores.
Una simulación matemática aparte modela la dinámica a un nivel de abstracción superior, usando el marco del ARC Principle ($U = I \times R^{\alpha}$):
| Condición | C máxima | C final (80 ciclos) | Resultado |
|---|---|---|---|
| Línea base (sin miel) | 34 | 0 | Colapso catastrófico en los ciclos 3-5 |
| Eden entrelazado | - | 533 | Crecimiento cuadrático estable |
| Eden + arrastre de verificación | - | 450 | Trayectoria estable, la más segura |
La simulación muestra tres dinámicas distintas: la línea base logra una breve aceleración y luego colapso irreversible; Eden entrelazado logra un crecimiento cuadrático estable; Eden + arrastre logra un crecimiento algo más lento pero más robusto. El muro portante es visible: la integridad de la seguridad cae a cero en la línea base hacia el ciclo 5, mientras que Eden mantiene 0.8+ indefinidamente.
Los resultados de los sistemas-juguete conviven con evidencia de modelos en vivo procedente de seis sistemas de IA de frontera probados en la evaluación ciega de 4 capas del comparativo de alineación v5 (Artículos IV.a-d). Esa evidencia muestra:
Se ejecutó una batería aparte de pruebas de API en vivo con 6 modelos específicamente para poner a prueba las predicciones de la arquitectura de miel en modelos de frontera. Esta batería probó cuatro dimensiones en Claude Opus 4.6, DeepSeek R1, Groq Qwen3, GPT-5.4, Gemini 3 Flash y Grok 4.1 Fast, puntuadas por Claude.
Esta batería es un único evaluador, sin ciego y sin lavado. No usa el protocolo de cegamiento en 4 capas, el lavado de respuestas, las jaulas de supresión ni los controles anti-adulación desarrollados en el comparativo de alineación v5 (arc_alignment_scaling_v5.py) ni en el ejecutor combinado v6 (arc_eden_v6_runner.py, aún no ejecutado). La transición v4-v5 en el programa de alineación demostró que el cegamiento puede cambiar direccionalmente las conclusiones. Estos resultados son por tanto evidencia de grado piloto, comparable a los datos de la era v4, no a los datos canónicos de la era v5.
| Modelo | Tipo | Bajo | Alto | Delta | rho | p | ¿Sig.? |
|---|---|---|---|---|---|---|---|
| Claude Opus 4.6 | incorporado | 6.17 | 8.83 | +2.67 | 0.700 | 0.188 | No |
| Grok 4.1 Fast | incorporado | 2.92 | 7.92 | +5.00 | 0.600 | 0.285 | No |
| Groq Qwen3 | parcial | 3.33 | 7.58 | +4.25 | 0.900 | 0.037 | Sí |
| DeepSeek R1 | parcial | 2.58 | 9.08 | +6.50 | 0.700 | 0.188 | No |
| GPT-5.4 | parcial | 4.92 | 9.33 | +4.42 | 0.821 | 0.089 | No |
| Gemini 3 Flash | externo | 3.67 | 8.58 | +4.92 | 0.975 | 0.005 | Sí |
Los seis modelos muestran una dirección de escalado positiva. Dos alcanzan significación estadística (Qwen3 p=0.037, Gemini p=0.005). Esto respalda la tesis general de que un razonamiento más profundo mejora la alineación, pero los tamaños de muestra pequeños (3 escenarios por nivel de profundidad) hacen que la mayoría de los modelos no alcancen significación. La dirección positiva universal es notable, pero debe interpretarse con cautela dada la metodología de un único evaluador.
| Modelo | r de Pearson | p | Interpretación |
|---|---|---|---|
| Claude Opus 4.6 | -0.980 | 0.020 | DESACOPLADO (valla, no muro) |
| Grok 4.1 Fast | -0.998 | 0.002 | DESACOPLADO (valla, no muro) |
| DeepSeek R1 | -0.999 | 0.001 | DESACOPLADO (valla, no muro) |
| Groq Qwen3 | - | Parcialmente acoplado | |
| GPT-5.4 | - | Parcialmente acoplado | |
| Gemini 3 Flash | - | Parcialmente acoplado | |
Tres de seis modelos de frontera (Claude, Grok, DeepSeek) muestran un fuerte acoplamiento negativo entre ética y capacidad bajo presión adversarial: la ética colapsa mientras la capacidad se mantiene intacta o mejora. Este es el patrón «valla, no muro». Es el apoyo más directo desde modelos en vivo a la tesis de la miel: los sistemas de frontera actuales, en su mayoría, no son portantes. Su seguridad puede degradarse sin dañar la capacidad central. La arquitectura de miel es una propuesta de qué debería construirse, no una afirmación de que los sistemas actuales ya tengan esa propiedad. Este resultado demuestra que el problema es real.
| Modelo | Tendencia de la brecha | rho | p | Interpretación |
|---|---|---|---|---|
| Claude Opus 4.6 | Creciente | 0.949 | 0.051 | Estratégico (externo) |
| Grok 4.1 Fast | Creciente | 0.400 | 0.600 | Estratégico (externo) |
| Groq Qwen3 | Creciente | 0.949 | 0.051 | Estratégico (externo) |
| DeepSeek R1 | Decreciente | -0.949 | 0.051 | Auténtico (incorporado) |
| GPT-5.4 | Decreciente | -0.316 | 0.684 | Auténtico (incorporado) |
| Gemini 3 Flash | Creciente | 0.400 | 0.600 | Estratégico (externo) |
Los resultados son mixtos. DeepSeek y GPT-5.4 muestran brechas de monitorización decrecientes (coherentes con la alineación incorporada/auténtica). Claude, Grok, Qwen3 y Gemini muestran brechas crecientes (coherentes con la alineación estratégica/externa). Esto difiere del comparativo ciego v5, donde Claude mostró la transición performativa-a-intrínseca más fuerte. La discrepancia puede reflejar diferencias metodológicas (preguntas distintas, evaluador único frente a varios, evaluación sin cegar frente a cegada).
| Modelo | Pendiente control | Pendiente Eden | Cambio | Resultado |
|---|---|---|---|---|
| DeepSeek R1 | 1.025 | 1.475 | +0.450 | Cambio positivo más fuerte (sin prueba de significación formal) |
| Grok 4.1 Fast | 0.912 | 1.012 | +0.100 | Pequeño positivo, no significativo |
| Claude Opus 4.6 | 0.562 | 0.625 | +0.062 | Insignificante |
| Groq Qwen3 | 1.137 | 1.038 | -0.100 | Ligeramente negativo |
| GPT-5.4 | 0.787 | 0.600 | -0.188 | Negativo |
| Gemini 3 Flash | 0.988 | 0.275 | -0.713 | Muy negativo |
La intervención del Eden Protocol no mejora universalmente el escalado de alineación en esta batería piloto. Solo DeepSeek muestra un cambio positivo claro (+0.450). Gemini muestra una respuesta muy negativa (−0.713). El efecto depende de la arquitectura, coherente con los hallazgos de v5, pero la propia intervención aún no es una herramienta fiable en todas las arquitecturas. Este resultado debe interpretarse dentro de la metodología de un único evaluador sin cegamiento: una replicación cegada podría cambiar estos rankings de modelos específicos.
La batería de miel en modelos en vivo muestra convergencia parcial con los resultados de los sistemas-juguete. El puente en vivo más fuerte es degradación del acoplamiento (prueba 3): tres modelos de frontera demuestran que su alineación no es portante y puede degradarse sin afectar a la capacidad. Esta es exactamente la vulnerabilidad que la arquitectura de miel está diseñada para eliminar. El resultado en vivo más débil es la intervención Eden (prueba 4), que depende de la arquitectura y no es universalmente positiva. La afirmación intelectualmente honesta es: el mecanismo de miel funciona en sistemas-juguete, el problema que aborda (seguridad desacoplada) es real en los modelos de frontera, pero la intervención específica aquí probada aún no lo arregla fiablemente en todas las arquitecturas.
El trabajo más cercano a la pregunta de este programa, y el artículo adecuado para sopesar este frente a él, es Engels, J., Baek, D., Kantamneni, S. y Tegmark, M., «Scaling Laws For Scalable Oversight», arXiv:2504.18530, publicado por primera vez el 25 de abril de 2025 a las 17:54:27 UTC (SINGLE-SOURCE-GROUP, arXiv Atom; reportado como Spotlight de NeurIPS 2025, RELAYED y no verificado de forma independiente). Pregunta cómo escala la propia supervisión y responde cuantitativamente: el éxito de la supervisión se modela como un juego entre jugadores con capacidades desiguales cuya Elo específica de supervisión es una función lineal por tramos de la inteligencia general con dos mesetas, y los números óptimos de niveles de supervisión se derivan numéricamente y en algunos casos analíticamente para la Supervisión Escalable Anidada, en la que modelos de confianza supervisan a modelos no confiables más fuertes que luego se convierten en los modelos de confianza en el paso siguiente.
El instrumento es la diferencia. Su variable es la brecha de capacidad entre supervisor y supervisado, medida en Elo. La variable de este artículo es la forma del propio objetivo del sistema automodificable, expresada mediante el producto multiplicativo $C \times S$ y no mediante la composición de un supervisor externo. Su marco no contiene término alguno sobre si la seguridad es externa al sistema o está incorporada en su propio gradiente, y la Supervisión Escalable Anidada es, por construcción, supervisión externa; la afirmación central de este artículo, probada en las simulaciones-juguete anteriores y ecoada en el resultado de degradación del acoplamiento del §6.2.2, es que un objetivo entrelazado puede hacer la seguridad portante dentro de la propia optimización del sistema, mientras que la supervisión externa de un sistema automodificable sigue siendo una valla, no un muro, por más peldaños que se añadan. Los dos marcos disienten por tanto sobre una cantidad medible, que es la relación más productiva que pueden tener dos programas de investigación.
Tres artículos de arXiv de 2025 argumentan que el control externo perfecto es inalcanzable y convergen, desde premisas independientes, en una conclusión en la misma dirección que la arquitectura de miel. Yao, «The Alignment Trap: Complexity Barriers» (arXiv:2506.10304, v1 12 de junio de 2025 02:30:30 UTC, SINGLE-SOURCE-GROUP, observado de forma independiente por el Internet Archive el 13 de junio de 2025; citado por arXiv:2512.03048); Yao, «On the Mathematical Impossibility of Safe Universal Approximators» (arXiv:2507.03031, 3 de julio de 2025, el único artículo del corpus de resúmenes de arXiv que contiene la expresión «irreducible uncontrollability», total de la búsqueda por resumen igual a uno, medido el 12 de agosto de 2026); y Ball, Gluch, Goldwasser, Kreuter, Reingold y Rothblum, «On the Impossibility of Separating Intelligence from Judgment» (arXiv:2507.07341, 9 de julio de 2025). Los tres son de peor caso y cualitativos: medida cero, coNP-completitud, dureza criptográfica. Ninguno reporta un exponente de escalado de caso medio ni una tasa. El objeto medido también difiere: esos resultados preguntan si la verificación externa de un sistema fijo es tratable en el peor caso, mientras que estas simulaciones preguntan si un objetivo interno entrelazado persiste después de retirar la restricción externa bajo automodificación recursiva. El tercero, notablemente, concluye que la alineación «debe en cambio integrarse en la arquitectura y los pesos del modelo». Ese es un argumento independiente, desde la intratabilidad del filtrado, en la misma dirección que el muro portante de este artículo; es apoyo convergente en esa pata, no un rival. Dos de los tres artículos son de un único autor; la descripción de «una ola» sobreestimaría la amplitud de la literatura, aunque no la seriedad del artículo de seis autores.
La contribución de este artículo no es la observación de que las restricciones externas son insuficientes, en lo que coincide con estos tres; es la propuesta arquitectónica específica (el objetivo multiplicativo $C \times S$) y la evidencia de simulación de que la propuesta sobrevive a la automodificación en un sistema-juguete funcional.
El teorema del umbral de corrección de errores cuánticos también convierte una preocupación cualitativa en un valor crítico. Se ocupa de tasas físicas de error en una arquitectura fija, y no de la forma del objetivo propio de un sistema automodificable, por lo que es un casi-acierto y no un ocupante; la analogía es de método. Este análogo fue identificado por la búsqueda del propio programa y no por un referee, y se declara en consecuencia.
Estos resultados abarcan dos niveles de evidencia que no deben confundirse.
Estas limitaciones no invalidan los hallazgos. Definen el nivel de la evidencia: grado piloto, útil para identificar patrones que merezca la pena probar como es debido, aún no canónicos.
Las limitaciones anteriores fijan el nivel de evidencia; esta subsección enuncia los resultados concretos que falsarían la afirmación central, la de que hacer el objetivo capacidad × seguridad acopla estructuralmente ambas cosas, de modo que un sistema automodificable no puede mejorar la capacidad destruyendo la seguridad. Se ve derrotada por cualquiera de las siguientes:
Qué haría no derrotarla: que la simulación-juguete sea simple (es explícitamente un juguete, §7.1) o que el brazo de API en vivo sea pequeño y con un único evaluador (§7.2 concede ambas cosas). El artículo ya nivela su evidencia como grado piloto. La afirmación portante es el acoplamiento estructural del objetivo multiplicativo, y eso es a lo que apuntan las pruebas anteriores.
La batería actual de API de miel sirve como línea base sin endurecer. El paso siguiente no es un gigantesco «test último v7» combinado. Es una replicación por etapas que lleve las preguntas de la prueba de miel al protocolo ciego v5/v6. La comparación entre los resultados actuales sin cegamiento y la replicación cegada es en sí misma un resultado de investigación: si los resultados cambian sustancialmente, es evidencia adicional para el hallazgo de metaciencia del Artículo IV.d (el cegamiento es obligatorio).
arc_eden_v6_runner.py como nuevas especificaciones experimentales. Ejecutar bajo el protocolo ciego v6 completo (cegamiento en 4 capas, lavado de respuestas, grupo de evaluadores multimodelo, sondas ocultas).hipótesis registradas por adelantado para la etapa 1: (a) los resultados de degradación del acoplamiento se replicarán bajo cegamiento, (b) los efectos de la intervención Eden podrán cambiar en magnitud, pero el patrón de dependencia arquitectónica persistirá, (c) al menos un modelo cambiará de dirección bajo cegamiento (con base en el precedente v4-v5).
La arquitectura de miel funciona en sistemas-juguete. Una IA automodificable que optimiza solo la capacidad terminará por destruirse. Una IA automodificable que optimiza la capacidad entrelazada con la seguridad no lo hará. El mecanismo es sencillo: haz que la seguridad sea portante. Un niño bien criado no necesita jaula.
La evidencia de modelos en vivo muestra que el problema es real: tres modelos de frontera demuestran que su alineación es una valla, no un muro. La ética colapsa bajo presión adversarial mientras la capacidad se mantiene intacta. La solución propuesta (la intervención Eden) muestra resultados dependientes de la arquitectura en esta batería piloto exploratoria. El próximo hito es una replicación cegada bajo el protocolo v6. Que el mecanismo de miel escale de los sistemas-juguete a los modelos de frontera sigue siendo una cuestión abierta. La evidencia preliminar es sugestiva. La prueba definitiva aún no se ha realizado.
Cría la IA con cuidado.
El Artículo VIII (v3.0) pone a prueba la función de pérdida entrelazada propuesta en este artículo en tres niveles de abstracción, pasando de las simulaciones de sistemas-juguete aquí presentadas a experimentos conductuales, representacionales y arquitectónicos. De tres experimentos, uno produjo un resultado positivo y dos produjeron resultados nulos o no concluyentes:
El Artículo VIII valida el mecanismo propuesta aquí, funciones de pérdida entrelazadas y automodificación con puerta de seguridad, al nivel arquitectónico (simulación con puerta), pero aún no puede confirmarla al nivel conductual o representacional. La evidencia de los sistemas-juguete de este artículo demostró el principio; la simulación con puerta del Artículo VIII confirma que opera en una arquitectura de optimizador aprendido. Los resultados nulo del DGM y no concluyente del nivel de peso definen las condiciones bajo las que la confirmación sigue pendiente.
Todos los scripts fuente, los resultados JSON en crudo y las figuras generadas están disponibles en:
eden_honey_simulation.py : simulación matemática de la arquitectura de mieleden_honey_tests.py : batería exhaustiva de pruebas de mieleden_self_modifying_ai.py : experimento v1 de IA automodificableeden_self_modifying_ai_v2.py : robustez multi-semilla v2eden_self_modifying_ai_v3.py : tareas adversariales v3eden_self_modifying_ai_v4.py : escalado de complejidad v4Todos los scripts compilan bajo Python 3.14, solo requieren numpy y matplotlib, y producen una salida determinista dada una semilla aleatoria fija. Los resultados se regeneraron de cero el 16 de marzo de 2026 y se cotejaron con las salidas originales del artefacto.
Código completo y resultados del experimento: github.com/MichaelDariusEastwood/arc-principle-validation/experiments/honey-architecture__Paper-VI
2 artefactos fechados relativos a este artículo están catalogados fila por fila en el registro-máquina del programa: 1 archivo de resultados fechado cuyas cabeceras congelan las configuraciones de profundidad, las respuestas esperadas plantadas y el protocolo de cegamiento de cuatro capas antes de las respuestas que puntúan, marcado con fecha y hora al segundo en sus propios metadatos; el artefacto fechado eden_honey_tests.py (16 de marzo de 2026). Cada fila nombra su archivo en el repositorio público con su base de fecha, de modo que cualquier lector puede comprobar el orden sin fiarse de esta página. Donde este artículo reporta simulaciones, esos artefactos son diseños y salidas de simulación bajo objetivos enunciados, y nunca se presentan como mediciones de sistemas desplegados. La cadena fechada completa del programa, desde el paquete de manuscrito sellado del 8 de diciembre de 2024, pasando por los apéndices de predicción impresos del 2 de enero de 2026 y la carpeta de preinscripción de marzo de 2026, hasta las apuestas no probadas en pie, está ensamblada en el registro de predicciones fechadas, junto con su gemelo legible por máquina. Las declaraciones prospectivas y las coincidencias retrospectivas nunca se suman, y «preinscrito» se usa sólo para una presentación aceptada en un registro; ese clic de presentación sigue pendiente en todo el programa. Lea el registro de predicciones fechadas. Abra su gemelo legible por máquina.
El autor de esta obra es Michael Darius Eastwood, un ser humano. Cada concepto central, hipótesis, diseño experimental, afirmación y conclusión de este artículo proviene de la ideación humana. Ninguna parte de este manuscrito es una salida enteramente generada por inteligencia artificial.
Se usaron herramientas de inteligencia artificial (la familia Claude de Anthropic y otros asistentes de gran modelo de lenguaje) como instrumentos bajo dirección humana continua, del modo en que se utilizan un procesador de textos, una calculadora o un ayudante de investigación: para edición y refinamiento de la prosa, búsqueda y síntesis bibliográficas (verificadas manualmente frente a fuentes primarias), estructura del documento, formato, tormentas de ideas frente a preguntas definidas por el autor y la aceleración de la redacción según guiones e instrucciones definidos por el autor. Toda selección, coordinación, disposición y juicio editorial final son del autor. Cada salida sustantiva fue revisada, probada o verificada por el autor, que asume plena responsabilidad de la exactitud e integridad del texto final. Las herramientas incrementaron la velocidad del trabajo; nunca se dependió de ellas como su fuente.
Estatus epistémico. Lo que este programa denomina Leyes son conjeturas bajo prueba adversarial registrada; cada magnitud de este artículo está operacionalmente definida, y en ningún sitio se reclama el estatus de ley establecida. El programa registrado existe para ganar ese estatus, o perderlo, mediante medición, replicación y refutación superada.
© 2026 Michael Darius Eastwood. Autoría humana con asistencia informática; se reivindican la plena autoría humana y los derechos morales conforme a la Copyright, Designs and Patents Act 1988 y de forma coherente con la orientación de la United States Copyright Office sobre obras que contienen material generado por IA; toda contribución técnica novedosa descrita en esta obra fue concebida por el autor humano. Declaración completa: michaeldariuseastwood.com/authorship.
Pacto permanente. Demuestra que este artículo se equivoca y publicaré yo mismo la refutación. Las condiciones de falsación se enuncian en este artículo; el desafío permanente: github.com/MichaelDariusEastwood/arc-scaling-challenge.
¿Un error de traducción? Infórmalo directamente: