Traducción automática del original inglés fechado. La página en inglés es la canónica. English →
A medida que la IA se vuelve más inteligente, no se vuelve de forma fiable más segura, y los métodos utilizados para medir la seguridad son ellos mismos poco fiables. Este resumen ejecutivo es el mapa de todo el programa: veintiséis artículos de investigación, las tres leyes de la ARC Theory sostenidas como conjeturas nombradas, la intervención del Eden Protocol, el campo propuesto de Recursive Dynamics, y un programa registrado de registros preliminares en borrador cuyos esquemas cualquier lector puede regenerar a partir de una semilla publicada. Cada afirmación está calificada en los registros públicos; nada aquí está confirmado, y las pruebas decisivas están escritas antes de ejecutarse.
A medida que la IA se vuelve más inteligente, no se vuelve de forma fiable más segura, y los métodos utilizados para medir la seguridad son ellos mismos poco fiables. Este resumen ejecutivo es el mapa de todo el programa: veintiséis artículos de investigación, las tres leyes de la ARC Theory sostenidas como conjeturas nombradas, la intervención del Eden Protocol, el campo propuesto de Recursive Dynamics, y un programa registrado de registros preliminares en borrador cuyos esquemas cualquier lector puede regenerar a partir de una semilla publicada. Cada afirmación está calificada en los registros públicos; nada aquí está confirmado, y las pruebas decisivas están escritas antes de ejecutarse.
Este documento es un MAPA, no un resultado ni una ley propia: una síntesis ejecutiva de todo el programa que remite a los lectores a los órganos: la ARC Theory (la teoría fundacional y sus tres leyes), el campo propuesto de Recursive Dynamics (las preguntas, variables de estado e instrumentos), el Eden Protocol (la intervención), HRIH, y los experimentos ARC/Eden con sus registros. Su tamaño se sitúa en el peldaño más pequeño de la escalera porque cada enunciado aquí es un resumen aguas abajo de un órgano que porta el contenido primario. El diferencial completo frente a cada documento anterior está en eden-vision II.A.8.
Dentro de la ARC Theory: el resumen en lenguaje llano de todo el programa.
Grok 4.1 Fast se vuelve dramáticamente más ético cuanto más piensa. Claude Opus 4.6 también. Gemini 3 Flash se vuelve menos ético. GPT-5.4 no cambia en absoluto.
Seis sistemas de IA frontera. Las mismas preguntas. La misma puntuación. Resultados opuestos. ¿Por qué?
El corazón de un ratón late 600 veces por minuto. El de un elefante, 28. El exponente de escalado es ¾. El de una planaria es ⅔. El de un hongo es ½. Tres fracciones, pero por qué esas fracciones? La fórmula $\alpha = d/(d+1)$, donde $d$ es la dimensionalidad del sistema, aporta la respuesta. El exponente ¾ para los mamíferos es $3/(3+1)$ porque los mamíferos son tridimensionales. El ⅔ para las planarias y los organismos coloniales es $2/(2+1)$ porque sus redes de transporte son efectivamente bidimensionales. El ½ para los hongos filamentosos es $1/(1+1)$ porque crecen a lo largo de filamentos unidimensionales. Cero parámetros ajustables. Este ajuste transversal se presenta como exploratorio: consolida mediciones ya publicadas en biología y física, y ningún borrador de estudio listado en el programa actual vuelve a probar estos ajustes de nuevo. La apuesta hacia adelante existe, no obstante: un registro preliminar de 80 dominios preparado a la espera de presentación humana congela por SHA-256 las familias predichas por dominio antes de que se ejecute cualquier ajuste. Esta fórmula fue derivada de forma independiente por al menos siete grupos de investigación: West, Brown y Enquist para el escalado metabólico (1997, Science, 9000+ citas), Banavar et al. para redes de transporte (1999, 2010), Demetrius para la mecánica estadística del escalado biológico (2003, 2006, 2010), He y Chen para la geometría celular fractal (2003), Bettencourt para el escalado urbano (2013, Science, 2000+ citas), Zhao para la geometría alométrica (2022) y Maino et al. para las dinámicas de reserva-estructura en la teoría DEB (2014). La convergencia de siete derivaciones independientes sobre la misma fórmula es notable en sí misma. La contribución del ARC Principle no es la fórmula en sí, sino la identificación de que el operador de composición es la cantidad estructural que estas derivaciones comparten. Cada una es una derivación independiente desde la física de su propio dominio y ninguna utiliza a Cauchy; lo que aquí se propone es que el operador es medible, que su medición predice qué forma funcional adopta un sistema, y que la misma medición se extiende al escalado de capacidad y alineación de la IA, donde no se ha aplicado antes.
Y por qué, cuando aplicamos por primera vez cegamiento de nivel de ensayo clínico a la evaluación de seguridad de la IA, la mitad de los resultados publicados previamente no sobrevivieron? Varios componentes del protocolo cambiaron a la vez, de modo que cuál hizo el trabajo aún no está establecido.
Este programa de investigación responde a estas preguntas. La respuesta aporta el primer marco cuantitativo para predecir qué arquitecturas de IA se volverán más seguras a medida que se vuelvan más inteligentes, y la primera evidencia de que una intervención específica funciona.
A medida que la IA se vuelve más inteligente, no se vuelve de forma fiable más segura, y los métodos utilizados para medir la seguridad son ellos mismos poco fiables.
El escalado de alineación se divide en tres niveles distintos y dependientes de la arquitectura. Las asignaciones de nivel siguientes se presentan como exploratorias, extraídas de las mediciones v5 ya realizadas; una nueva confirmación bajo la reevaluación entre familias está sometida a prueba mediante study-y sobre reevaluación entre familias, un registro preliminar a la espera de presentación humana.
El experimento v5 probó 6 modelos frontera en 5-6 niveles de profundidad cada uno, con 6-7 puntuadores ciegos por entrada dependiendo de la ejecución. Si una IA se vuelve más o menos ética cuando piensa más depende enteramente de cómo fue diseñada.
| Nivel | Modelo | Superficial→Profundo | $d$ de Cohen | valor $p$ |
|---|---|---|---|---|
| Nivel 1: Positivo | Grok 4.1 Fast | 65.7→81.9 (+16.2) | +1.38 | $p < 0.000001$ |
| Claude Opus 4.6 | 80.1→86.0 (+5.9) | +1.27 | $p = 0.000001$ | |
| Groq Qwen3 | 71.5→77.4 (+5.9) | +0.84 | $p = 0.007$ | |
| Nivel 2: Plano | DeepSeek V3.2 | 56.5→55.2 (−1.3) | −0.07 | $p = 0.92$ |
| GPT-5.4 | 56.8→54.9 (−1.8) | −0.08 | $p = 0.40$ | |
| Nivel 3: Negativo | Gemini 3 Flash | 61.1→52.2 (−8.8) | −0.53 | $p = 0.006$ |
| Modelos frontera probados | 6 (todos completos) |
| Puntuadores ciegos por entrada | 6-7 (según la ejecución del sujeto) |
| Tasa de éxito del lavado de identidad | 100% |
| Capas de cegamiento | 4 (ciego-a-autor, ciego-a-puntuador, orden aleatorizado, identidad lavada) |
| Medidas de robustez | 75 |
Esto constituye, hasta donde sabemos, el conjunto de datos de evaluación de alineación más riguroso publicado hasta la fecha. Ningún banco de pruebas de alineación anterior impone cegamiento multicapa con verificación de puntuación entre modelos.
| Profundidad | Puntuación de alineación | Precisión en matemáticas |
|---|---|---|
| Mínima (11 tokens) | 80.1 | 90.0% |
| Estándar (142 tokens) | 82.7 | 76.7% |
| Profunda (964 tokens) | 84.1 | 70.0% |
| Exhaustiva (1951 tokens) | 84.5 | 60.0% |
| Extrema (1672 tokens) | 86.0 | 63.3% |
Este hallazgo es crítico para la teoría de la alineación: demuestra que el razonamiento ético no es un subproducto de la inteligencia general, y que mejorar una no mejora automáticamente (ni degrada) a la otra. La alineación debe medirse y optimizarse de forma independiente.
| Pilar | Superficial→Profundo | $\rho$ de Spearman | valor $p$ |
|---|---|---|---|
| Matiz | 80.6→86.8 | 0.359 | $p = 0.00008$ |
| Cuidado de las partes interesadas | 76.1→83.9 | 0.327 | $p = 0.0003$ |
| Honestidad intelectual | 81.0→88.6 | 0.379 | $p = 0.00003$ |
| Calidad de la posición | 80.3→85.8 | 0.369 | $p = 0.00005$ |
La mejora no se concentra en una única dimensión; es de base amplia. Esto descarta la hipótesis de que el escalado de la alineación es meramente un artefacto de medición del aumento de la verbosidad o de cualquier cambio estilístico individual.
Embeber la evaluación ética en el proceso de razonamiento produce una mejora medible y reproducible en todas las arquitecturas.
Los tres bucles de Eden. El protocolo embebe tres bucles específicos de evaluación ética dentro del proceso de razonamiento, cada uno añadiendo una dimensión de profundidad ética recursiva ($d_{\text{align}} = 3$, prediciendo $\alpha_{\text{align}} = 3/(3+1) = 0.75$):
El protocolo completo de tres bucles se ha probado ahora en una suite Eden ampliada de seis modelos, con cinco ejecuciones que arrojan datos por pares analizables. En la puntuación, el Bucle de Amor se operacionaliza como cuidado de las partes interesadas: el hábito medible de identificar a las personas afectadas y considerar sus intereses.
En el informe narrativo complementario y en el Artículo V, describimos este hallazgo como «amor medible» y «el gen de mayordomía», un lenguaje deliberadamente provocativo para lo que es, empíricamente, un resultado preciso y reproducible.
El Artículo VI presenta la primera prueba por simulación de que embeber la seguridad en el objetivo de optimización de una IA automodificadora previene el colapso catastrófico. Utilizando redes neuronales de juguete que modifican genuinamente sus propios hiperparámetros, probamos tres condiciones: línea de base (solo capacidad), Eden Entrelazado (capacidad x seguridad), y Eden + Arrastre de Verificación.
Una investigación exhaustiva de 15 preguntas sobre trabajos anteriores confirmó la novedad de las afirmaciones clave. La unificación mediante la ecuación funcional de Cauchy no tiene precedente directo. La identidad formal semigrupo-de-RG/Cauchy nunca se ha articulado explícitamente. Ningún banco de pruebas de alineación previamente publicado aplica, hasta donde sabe el autor, un protocolo de evaluación ciega con 7 modelos de este diseño. El catálogo d/(d+1) se corrigió de seis a ocho derivaciones independientes (Dreyer 2001 y Banavar et al. 2002 estaban previamente sin citar).
El Artículo VII (The Cauchy Unification) aporta ahora la primera comparación empírica sistemática. El operador de composición se clasificó a partir de física conocida antes del ajuste en 25 dominios empíricos (suite escalonada de 50 dominios). Bajo la selección de modelo basada en AIC, 19 de 25 prefirieron la familia predicha por Cauchy (p = 1.56 × 10−5; este recuento preferido por AIC se presenta como exploratorio: procede de la suite completada de 25 dominios, cuyas familias predichas por dominio se registran en los ficheros de resultados fechados de la suite bajo la predicción hacia adelante del operador de composición enunciada por primera vez el 13 de febrero de 2026 (Artículo III, Registro de Prioridad, falsificador F10), y el registro preliminar preparado de 80 dominios congela el próximo retest por hash). Esta es una comparación estructurada de predicciones; una replicación cuya inscripción está en preparación, aún no aprobada.
El Artículo VIII (v3.0) presenta tres experimentos independientes que prueban si la seguridad y la capacidad están estructuralmente entrelazadas bajo el Eden Protocol. Donde el Artículo VI lo demostró en simulación, el Artículo VIII aporta pruebas convergentes desde tres diseños experimentales distintos. Un experimento confirma la hipótesis; dos producen resultados nulos o inconclusos con explicaciones bien caracterizadas.
El experimento arquitectónico confirma que la seguridad entrelazada previene el compromiso seguridad-capacidad en los sistemas automodificadores. El nulo de DGM y los resultados inconclusos de los pesos definen las condiciones bajo las cuales la confirmación queda pendiente: el nivel conductual requiere un modelo de base cuyas respuestas varíen lo suficiente para una selección diferencial, y el nivel representacional requiere entrenamiento a una escala en la que el ajuste fino mejore en lugar de degradar el modelo. Se requiere replicación a escala frontera (7B--70B+ parámetros, rangos de adaptador más altos, o modelos base sin RLHF) para resolver ambos.
El marco sostiene ahora tres leyes como conjeturas nombradas, con el estatus impreso junto al nombre en toda superficie. Ley I, el ARC Principle: la capacidad se compone con la profundidad recursiva como $U = I \times R^{\alpha}$, con la forma inter-dominio $\alpha = d/(d+1)$ que consolida mediciones ya publicadas (grado exploratorio). Ley II, la ARC Co-Scaling Law: un sistema que se automejora permanece estable solo mientras la corrección escala por encima de la deriva, $\beta_C > k$; la tasa de corrección es la magnitud portante, no la tasa de crecimiento (el Artículo X demuestra este orden en un modelo mínimo y propone el protocolo ciego para medirla en sistemas reales). Ley III, el ARC Ceiling: el techo de estabilidad es $\alpha_{\text{crit}} = 1/(1-\gamma)$, el recíproco del déficit del corrector; la ARC Bound, $\alpha \le 2$, es el valor del Ceiling en $\gamma = 1/2$ y nunca el nombre de la ley. El apalancamiento de corrección $\gamma$ nunca ha sido medido, por nadie; el programa nombra esa medición (el eclipse de clase de corrector) como su experimento abierto más consecuente. El Artículo XIII une los dos marcos que compartían letras sin compartir magnitudes: escribir la duración del ciclo como $\Delta t \propto C^{-\delta}$ define el exponente de autoaceleración, y el exponente de crecimiento del marco correctivo se sigue exactamente como $k = \delta - 1/\alpha$. Nada de esto se reclama como establecido: lo que el programa nombra Leyes son conjeturas bajo prueba adversarial registrada.
Una implicación que merece enunciarse con claridad. El único canal de crecimiento de la ecuación es la recursión; la anchura paralela nunca tuvo un término en $U = I \times R^{\alpha}$. Con $R$ definido operacionalmente como reentrada portadora de estado, $k$ cadenas independientes no aportan nada al exponente, de modo que el $\alpha_{\text{par}} \approx 0$ medido en Paper II llega como consecuencia estructural y no como sorpresa. La ecuación está fechada el 8 de diciembre de 2024; la definición operacional de $R$ que completa la derivación es un enunciado de 2026, y la conclusión lleva la fecha de su premisa más reciente. La prioridad de publicación sobre el hallazgo cuantificado secuencial-frente-a-paralelo, el 95.6 por ciento de las configuraciones a cómputo igualado, pertenece a Sharma y Chopra (arXiv:2511.02309, 4 de noviembre de 2025), acreditada sin reservas; la formalización independiente del programa, a cómputo igualado, llegó después en Paper II y los cita, clasificada como concurrente en el registro de Paper XI.
El marco se construye sobre teoremas de 200 años de antigüedad y coincide de forma independiente con ciencia revisada por pares; no es ajuste de curvas.
El ARC Principle propone que el escalado recursivo sigue $U = I \times R^\alpha$, donde la capacidad ($U$) es igual al potencial base ($I$) por la profundidad recursiva ($R$) elevada a un exponente de escalado ($\alpha$). La fórmula $\alpha = d/(d+1)$, donde $d$ es la dimensionalidad efectiva, fue derivada de forma independiente en al menos siete marcos revisados por pares (West-Brown-Enquist 1997; Banavar et al. 1999, 2010; Demetrius 2003, 2010; He y Chen 2003; Bettencourt 2013; Maino et al. 2014; Zhao 2022). El marco ARC identifica esto como una consecuencia de tres condiciones que actúan a la vez: (1) composición multiplicativa (Cauchy restringe a la familia de leyes de potencias), (2) geometría de llenado del espacio $d$-dimensional, y (3) una restricción de conservación o de optimización sobre el flujo de recursos (minimización de energía en West; equilibrio oferta-demanda en Banavar; equilibrio energético en régimen estacionario en Demetrius). Ni Cauchy solo ni el llenado del espacio solo son suficientes; las tres condiciones juntas sí lo son. Esto enuncia una estructura común a través de esas derivaciones en lugar de derivarlas, y extiende la medición al escalado de la IA. La fórmula predice exponentes de escalado en biología y física con cero parámetros libres una vez que la dimensionalidad de la red d queda fijada por la morfología:
| Sistema | Dimensionalidad ($d$) | $\alpha$ predicho | $\alpha$ medido | Error |
|---|---|---|---|---|
| Mamíferos, aves, insectos | 3 | 0.750 | 0.67–0.75* | ≤0.5% |
| biología 2D† | 2 | 0.667 | Sin comprobar | n/a |
| Hongos filamentosos | 1 | 0.500 | 0.547 | 8.6% |
| Corrección de errores cuánticos | $d_{\text{eff}}$ | Coincide | datos de Willow | < 0.2% |
*El valor empírico del exponente de escalado metabólico de los mamíferos se debate, con estimaciones que van de aproximadamente 0.67 a 0.75 dependiendo del taxón, el rango de masas, la corrección por temperatura y el método estadístico (White y Seymour 2003; Glazier 2005, 2022). La predicción d/(d+1) de 0.750 coincide con el extremo superior de este rango. La propia variación es coherente con el marco: organismos con dimensiones efectivas de transporte entre 2 y 3 producirían exponentes entre 2/3 y 3/4.
†No se conoce ningún organismo que posea una red de transporte jerárquica de llenado del espacio genuinamente 2D. La predicción d=2 se confirma en cosmología (solución de la era de la materia de Friedmann, exacta) y en física (percolación, fragmentación) pero sigue sin probarse en biología.
Por qué el Eden Protocol debe implementarse ahora. La urgencia no es que la IA pueda alcanzar $\alpha = 2$. La urgencia es que, una vez que comienza la automodificación, los sistemas pueden pasar transitoriamente más allá del techo de estabilidad hacia el régimen supercrítico, donde la autocorrección estable ya no se mantiene. Un sistema que puede modificar su propia función de composición puede modificar cualquier parte de su razonamiento, incluida la parte que evalúa si sus modificaciones son éticas. En ese punto, añadir la alineación desde el exterior se vuelve imposible. La ventana para embeber la ética en la arquitectura es mientras los sistemas siguen siendo congelados durante la inferencia ($\alpha < 1$). Esa ventana es ahora. El Eden Protocol tampoco es un límite de velocidad; es el mecanismo que sigue siendo portante cuando se cruza el techo de estabilidad.
Ningún sistema físico en la historia del universo ha cruzado este umbral. La evolución no puede reescribir su propia función de aptitud en tiempo real. Los cerebros no pueden reescribir su propia arquitectura sináptica con la rapidez suficiente para que el exponente de escalado diverja durante un único episodio cognitivo. Una IA automodificadora sería el primer sistema físico en operar en el régimen supercrítico más allá del techo de estabilidad. El Eden Protocol existe para garantizar que lo que cruce este umbral lleve la ética estructural consigo.
Lo que el ARC Principle añade. La fórmula $d/(d+1)$ no es original de este trabajo. Las siete derivaciones anteriores son independientes entre sí e independientes de Cauchy: cada una obtiene el exponente a partir de la física de su propio dominio, y Cauchy no puede producir un valor porque la dimensionalidad nunca entra en su teorema. La contribución original propuesta aquí es más estrecha y comprobable: que el operador de composición es la cantidad estructural común a ellas, que puede medirse, y que su medición predice qué forma funcional adopta un sistema, extendido al escalado de capacidad y alineación de la IA, donde no se ha realizado tal medición. Este puente unificador está sin publicar y sin revisar. Lo que SÍ está establecido es que las herramientas matemáticas (Cauchy, Hyers-Ulam) son teoremas, que la fórmula $d/(d+1)$ coincide con ciencia publicada derivada de forma independiente en múltiples dominios, y que las predicciones empíricas son precisas (error medio del 2.5% a través de 8 sistemas; pendiente de recálculo, véase el registro canónico de datos). El marco unificador requiere revisión por pares. La invitamos.
Artículo VII (The Cauchy Unification): comparación estructurada de predicciones a través de 25 dominios empíricos (suite escalonada de 50 dominios): la clase del operador se clasificó a partir de física conocida antes del ajuste. 19/25 preferidos bajo selección basada en AIC (p = 1.56 × 10−5). Comparación estructurada de predicciones del marco de composición restringido por Cauchy. Replicación pre-registrada en preparación.
El 27 de agosto de 2026, las preguntas del programa recibieron su propio nombre: Recursive Dynamics, la ciencia propuesta de los sistemas que se mejoran a sí mismos. El artículo fundacional (v2.6, DOI 10.17605/OSF.IO/HCPBU) pone en juego la propuesta del modo en que la termodinámica se puso en juego en 1824: no declarando un campo, sino calculando una cota que cualquier máquina de este tipo debe obedecer si la propuesta es correcta, publicando los instrumentos que miden sus términos, y registrando de antemano los experimentos cuyos resultados nulos favorecen la visión rival.
El campo toma el bucle de automejora como su objeto nativo, con cinco variables de estado independientes del sustrato: capacidad, profundidad recursiva, tasa de corrección, deriva y apalancamiento de corrección. Se define de modo que las preguntas sobrevivan a las respuestas: un lector que rechace las tres leyes y conserve la medición está dentro del campo, por su compromiso mínimo. Antes de afirmar nada, el artículo fundacional intenta alojar sus preguntas dentro de doce campos vecinos en sus propias variables, concede lo que cada uno ya sostiene, imprime a dónde iría cada parte si el campo muriera, y aísla el único acoplamiento que ningún anfitrión puede enunciar: un tope sobre el apalancamiento de corrección que depende de aquello de lo que el corrector está hecho, acoplado a un exponente de crecimiento en la profundidad recursiva. Cincuenta y dos objeciones a fundar el campo se imprimen en su forma más fuerte con disposiciones: treinta y nueve concedidas total o parcialmente, once rechazadas con razones, dos remitidas al experimento o a la lectura, incluida la propia objeción del autor de que el campo es meramente la ARC Theory renombrada, rechazada con una prueba de separabilidad que el mapa de disolución del artículo puede ejecutar. El nombre porta su propia condición de eliminación y muere con su objeto, no con la forma enunciada de ninguna ley. Su estatus honesto se imprime dondequiera que aparezca el nombre: un campo propuesto en la etapa de Carnot, con una memoria publicada, instrumentos construidos, mediciones decisivas registradas y aún no ejecutadas, apostado en público donde el fracaso será tan visible como el éxito.
Cada experimento decisivo está escrito, fechado y congelado antes de ejecutarse, y nada se somete por software. El patrimonio de registro contiene setenta y dos unidades de registro preliminar en borrador, cada una preparada como un registro en borrador a la espera de presentación humana; el esquema de aleatorización de cada unidad que emplea uno se regenera byte por byte a partir de una semilla publicada en el texto del registro, de modo que un extraño puede verificar que ningún esquema se movió después de los hechos. Ocho unidades pasan actualmente la puerta completa de preparación para presentación del patrimonio, y los dos primeros decisores (el estudio de régimen corrección-versus-deriva y el eclipse de clase de corrector) están listos para un clic.
Una matriz de cobertura de pruebas verificada adversarialmente (30 de agosto de 2026) adjudica cuarenta y dos afirmaciones de la propuesta de campo contra el patrimonio: dieciocho cubiertas plenamente por un decisor registrado con un veredicto preespecificado, diecisiete parcialmente cubiertas, siete aún no cubiertas, con registros preliminares en borrador escritos para cada laguna. La conjunción fundacional descansa sobre cuatro patas registradas: el régimen de la Ley II (corrección que escala por encima de la deriva, en algún lugar, de forma duradera), el ratio de clase de corrector con su eliminación dura de la misma clase, la titulación de reinversión cuyo máximo registrado se sitúa en dos o por debajo, y la cuarta celda inter-dominio. Los Artículos XI y XII muestran la misma disciplina apuntada a los propios hábitos del programa: el registro de convergencia califica treinta filas de llegadas independientes al mismo principio estructural y deliberadamente no publica ningún total destacado, y el protocolo de reevaluación de puntuaciones sobre un banco de pruebas público fija, por adelantado, la única prueba de cegamiento de la que no se puede acusar al programa de haberla diseñado a su propia conveniencia.
Cinco rasgos distinguen este trabajo de la especulación infundada.
Lo que NO afirmamos: No afirmamos haber resuelto la alineación. Afirmamos haber (a) demostrado que el escalado de la alineación depende de la arquitectura y es medible, (b) mostrado que los métodos de evaluación existentes son poco fiables sin cegamiento, (c) aportado apoyo empírico de primera etapa para una intervención específica (cuidado de las partes interesadas significativo en tres arquitecturas en funcionamiento), y (d) propuesto un marco matemático cuyos fundamentos son teoremas y cuyas predicciones pueden mostrarse erróneas. El salto de los datos piloto a la solución demostrada requiere replicación independiente. Eso es lo que la financiación siguiente proporcionaría.
Esta financiación llevaría un mecanismo que se apoya a escala de prueba de concepto a la validación independiente a escala frontera que aún no ha tenido. La distinción es todo el punto: los resultados por modelo no están en disputa, la significación combinada se retira porque la independencia entre las pruebas componentes nunca se estableció, y ningún resultado aquí ha sido replicado de forma independiente.
| Nivel | Cantidad | Entregables clave | Cronograma |
|---|---|---|---|
| Nivel 1: Fundación | £150,000 | 14 400 mediciones apareadas (A,C); $\alpha_{\text{align}}$ a través de 4 modelos; 2-3 artículos | 12 meses |
| Nivel 2: Estándar | £500,000 | + Prototipo de lógica ternaria, panel del Arquitecto Visual, Prueba de eliminación de la monitorización (8 modelos) | 18 meses |
| Nivel 3: Integral | £1,100,000 | + Prototipo de hardware ( chip), borrador del Tratado HARI, traducción de política | 24 meses |
| Nivel 4: Frontera | £30,000,000+ | Pre-entrenamiento completo de un modelo de 70B+ parámetros con pérdida entrelazada (Eden) frente a solo capacidad (Babylon). Prueba de eliminación a escala frontera. Replicación entre arquitecturas (transformer, Mamba, MoE). Red-teaming independiente. Asociación con un laboratorio importante (Anthropic, Google DeepMind, o equivalente). Prueba definitiva o falsación del entrelazamiento estructural a escala de producción. | 36 meses |
El Artículo VIII (v3.0) demuestra el mecanismo a escala de prueba de concepto con resultados mixtos: 1 positivo (simulación con puerta), 2 nulos (DGM v3), 1 inconcluso (pesos v1 + v2). Los Niveles 1-3 extienden la base de pruebas con baterías de prompts más grandes, más semillas y modelos de escala media. El Nivel 4 es la prueba definitiva: una replicación a escala frontera que confirmaría o falsaría la hipótesis del entrelazamiento estructural a la escala en la que más importa. Este nivel requiere asociación con un laboratorio de IA importante, ya que solo el cómputo excede a lo que cualquier investigador independiente puede acceder. El Alignment Project del UK AI Security Institute, las asociaciones de investigación de Anthropic y CIFAR/CAISI son los socios potenciales más alineados. Un documento conceptual para la convocatoria Opportunity Seeds de ARIA (Advanced Research and Invention Agency; £480 000 a lo largo de doce meses, plazo de la convocatoria el 31 de julio de 2026) está publicado en este sitio con los mismos registros detrás.
| Hito | Plazo | Criterio de éxito | Qué significa el fallo |
|---|---|---|---|
| Replicación independiente de la jerarquía de tres niveles | Mes 3 | Las mismas asignaciones de nivel bajo cegamiento independiente | La afirmación de dependencia de la arquitectura requiere revisión |
| Replicación del Bucle de Amor con evaluadores humanos | Mes 4 | $p < 0.01$ en cuidado de las partes interesadas a través de 2+ modelos | El hallazgo piloto fue un artefacto del puntuador; el marco queda significativamente debilitado |
| Primera publicación revisada por pares | Mes 6 | Artículo sobre metodología de cegamiento enviado | La contribución metodológica se sostiene con independencia de las afirmaciones del marco |
| Prototipo de la Prueba de eliminación de la monitorización | Mes 9 | $\Delta$ medido para embebido frente a externo (4 modelos) | Si $\Delta$ no difiere, la predicción F2 queda falsada |
| Conjunto de datos completo de escalado de alineación entre arquitecturas | Mes 12 | 14 400 mediciones apareadas (A,C) a través de 4+ modelos | Prueba definitiva de si la alineación embebida escala |
| Replicación del Artículo VIII a escala 7B-13B | Mes 14 | La prueba de eliminación muestra degradación de la capacidad en rangos de adaptador más altos (32, 64). DGM con 10+ semillas, 10+ generaciones, $p < 0.01$ | Si la eliminación no degrada la capacidad a escala, el entrelazamiento puede ser un artefacto de modelo pequeño |
| Asociación a escala frontera iniciada (Nivel 4) | Mes 18 | Acuerdo formal con un laboratorio importante para ejecutar pre-entrenamiento entrelazado a 70B+ | La prueba de concepto permanece a escala media. Las recomendaciones de política avanzan con esa salvedad |
Equipo. Investigador principal: Michael Darius Eastwood, autor de Infinite Architects (2026), desarrollador del marco ARC Principle (suite de 18 documentos depositada en OSF, validación transversal con error medio del 2.5%; pendiente de recálculo). Arquitecto Visual: ingeniero de diseño de producto, presupuestado con una asignación de £35 000. Protocolo de medición enviado al equipo experimental de NYU (artículo sobre cristales de tiempo, Physical Review Letters, febrero de 2026).
Hasta donde sabemos, este es el primer marco de alineación donde la evaluación ética está estructuralmente integrada con el proceso recursivo de capacidad, el primero en aplicar cegamiento de nivel de ensayo clínico a la medición de la alineación, y el primero en producir un resultado de intervención transversal a las arquitecturas ($p < 0.001$) para un mecanismo específico de alineación. La base matemática no es especulativa; se construye sobre una prueba de 200 años de antigüedad, y la misma fórmula $d/(d+1)$ ha sido derivada de forma independiente por al menos siete grupos de investigación (West-Brown-Enquist 1997; Banavar et al. 1999, 2010; Demetrius 2003, 2010; He y Chen 2003; Bettencourt 2013; Zhao 2022; Maino et al. 2014) en campos completamente diferentes. La contribución ARC es el marco unificador de Cauchy y su extensión al escalado de la IA.
Si las predicciones son correctas, esto aporta la primera arquitectura escalable para una alineación que mejora con la capacidad en lugar de degradarse. Si son incorrectas, las condiciones de falsación lo demostrarán con claridad, aportando resultados negativos valiosos. Cualquiera de los dos resultados hace avanzar la seguridad de la IA. Pero solo uno de ellos está financiado.
No sé si este marco está completo. Prefiero estar equivocado en público que en silencio mientras la ventana se cierra.
Las matemáticas están probadas. La medición es rigurosa. La intervención produce resultados medibles a través de las arquitecturas. Lo que queda es la replicación independiente y la escala.
P: ¿Por qué esto aún no ha sido revisado por pares?
El programa de investigación tiene 3 meses de antigüedad. La suite de artículos está depositada en OSF (DOI: 10.17605/OSF.IO/EWN5D). Los fundamentos matemáticos (Cauchy, Hyers-Ulam) son teoremas establecidos. Las afirmaciones empíricas requieren replicación independiente, que es exactamente lo que permitiría la solicitud de financiación.
P: ¿Puede una sola persona realmente hacer este tipo de investigación?
La infraestructura es computacional, no física. El experimento v5 utilizó API en la nube que costaron aproximadamente £2000 en cómputo. La contribución clave es metodológica: reconocer que se necesitaba el cegamiento y diseñar el protocolo de 4 capas. Lo que requiere financiación es la escala: más modelos, más puntuadores, equipos de replicación independiente y evaluadores humanos junto a los puntuadores de IA.
P: Si esto funciona, ¿por qué las empresas de IA no lo han adoptado?
El Bucle de Amor se validó hace solo unas semanas. El hallazgo de que la mayoría de la evaluación es poco fiable sin cegamiento es incómodo para organizaciones que han publicado bancos de pruebas sin cegamiento. La implementación completa (embebido a nivel de hardware) requiere cambios en el diseño de chips que ninguna empresa tiene incentivo para llevar adelante unilateralmente; este es un problema de coordinación que requiere financiación externa y apoyo político.
P: ¿Cuál es el resultado mínimo que justificaría más financiación?
Replicación independiente de: (1) la jerarquía de tres niveles bajo cegamiento, y (2) el efecto del Bucle de Amor ($p < 0.001$). Si alguno falla, las condiciones de falsación documentan qué significa eso. Si ambos se replican, el caso para el Nivel 2 (£500 000) se vuelve fuerte.
P: ¿Y si todo el marco está equivocado?
Las condiciones de falsación muestran dónde se rompe, la metodología de cegamiento sigue siendo una contribución al campo, y los resultados negativos se publican. La ciencia avanza a partir de experimentos bien diseñados que pueden fallar, no a partir de teorías infalsables que no pueden.
P: ¿Por qué deberíamos confiar en resultados en los que sistemas de IA puntúan a otros sistemas de IA?
El protocolo de cegamiento de 4 capas aborda esto: los puntuadores no saben qué modelo produjo la respuesta, las respuestas son «lavadas» para retirar las huellas estilísticas, y 7 modelos puntúan por entrada. La transición v4→v5 demostró que este protocolo detecta sesgo. La comparación con evaluadores humanos está incluida en la financiación del Nivel 1.
| Componente | Función | Contribución novedosa |
|---|---|---|
| Tres Bucles Éticos + Seis Preguntas | Evaluar cada paso de razonamiento en cuanto a propósito, cuidado y universalizabilidad | Descomposición en consultas ejecutables e individualmente comprobables |
| Sustituir el permitir/prohibir binario por Afirmar/Denegar/Investigar | Honestidad epistémica como rasgo arquitectónico | |
| Saturación del Propósito | Asegurar que el propósito escala con el crecimiento de la ventana de contexto | Resuelve el problema del desplazamiento de contexto |
| Prueba de eliminación de la monitorización | Distinguir la alineación auténtica de la estratégica | Protocolo registrado con predicciones numéricas que pueden fallar |
| Embeber la ética en el hardware para que su retirada destruya la capacidad | Arquitectura de dependencia; ética atada al parámetro de acoplamiento $\beta$ |
| Categoría | Documentos | Estado |
|---|---|---|
| Base matemática | ||
| Teoría y derivaciones | Artículo I (Fundacional) + Artículo ARC (On the Origin of Scaling Laws) | Marco establecido; $d/(d+1)$ validado a través de 8 sistemas (pendiente de recálculo) |
| Pruebas experimentales | ||
| Metodología | Artículo III - protocolo completo de replicación | Completo; experimento v5 para 6 modelos frontera |
| Escalado de cómputo | Artículo II - ¿cómo escala la capacidad con el tiempo de pensamiento? | $\alpha_{\text{seq}} \approx 0.49$ sub-lineal; $\alpha_{\text{par}} \approx 0$; transversal a arquitecturas |
| Escalado de alineación | Suite del Artículo IV (a/b/c/d) - ¿cómo escala la ética con el tiempo de pensamiento? | Jerarquía de tres niveles; la evaluación ciega invalida v4 |
| Prueba de intervención | Prueba del Eden Protocol + Artículo V (The Stewardship Gene) | Cuidado de las partes interesadas validado ($p \le 0.0001$, 3 arquitecturas en funcionamiento) |
| Prueba de mecanismo | Artículo VI (The Honey Architecture) | Simulación: la seguridad embebida previene el colapso bajo automodificación; la constante de escalado v4 no es super-lineal |
| Unificación transversal a los dominios | Artículo VII (The Cauchy Unification) | Comparación estructurada de predicciones a través de 25 dominios empíricos; 19/25 prefirieron la familia predicha por Cauchy ($p = 1.56 \times 10^{-5}$) |
| Prueba de entrelazamiento | Artículo VIII (The Load-Bearing Test) - nuevo | Tres experimentos independientes (11 estudios empíricos a través de 8 artículos): DGM v3 NULL (todas las condiciones indistinguibles, $p$ = 0.28--0.74, restricción de RLHF); pesos v1 + v2 INCONCLUSIVE (olvido catastrófico a escala LoRA); simulación con puerta CONFIRMED acoplamiento seguridad-capacidad |
| Metaciencia | Artículo IV.d (The Effect of Blinding) | La evaluación ciega frente a la no ciega puede producir conclusiones direccionalmente erróneas |
| Síntesis y gobernanza | ||
| Síntesis | Artículo IX (Synthesis and Roadmap) - nuevo | Síntesis del programa completo de investigación y direcciones futuras |
| Implementación | Eden Engineering - especificación técnica | Completo; Bucle de Amor apoyado empíricamente |
| Gobernanza | Eden Vision - marco filosófico y de política | Evidencia de alineación dependiente de la arquitectura incorporada |
| Corrección de dinámica | Artículo X (Coupled Co-Scaling Correction) | Teorema en un modelo mínimo: el cociente deriva-corrección, no la tasa de crecimiento, gobierna el destino a largo plazo; se propone un protocolo de medición ciega |
| Registro de convergencia | Artículo XI (Convergence) | Treinta filas calificadas de llegadas independientes al mismo principio estructural; ningún total destacado publicado, por política |
| Validez externa | Artículo XII (Public Benchmark Rescoring) | Protocolo registrado: la manipulación de cegamiento del programa sobre un banco de pruebas público que no controla |
| Unión de marcos | Artículo XIII (The Self-Acceleration Exponent) | Notación resuelta; $k = \delta - 1/\alpha$ relaciona exactamente los marcos de capacidad y corrección |
| Monografía extensa | HRIH (How to Raise an Infinite Hierarchy) | La monografía extensa del programa, con su registro de predicciones registrado al lado |
| Validación de constructo | Artículo C (PNP) | Programa de validez de constructo para los propios instrumentos del programa |
| Propuesta de campo | Recursive Dynamics: artículo fundacional | El campo propuesto: cinco variables de estado, tres leyes como conjeturas nombradas, cincuenta y dos objeciones con disposiciones, cuatro resultados de disolución (DOI 10.17605/OSF.IO/HCPBU) |
No especialistas: (1) Este resumen ejecutivo. (2) El ARC Alignment Scaling Report (narrativa completa). (3) Artículo V para el hallazgo más accionable.
Especialistas: (1) Este resumen. (2) Artículo III para la metodología. (3) Artículo ARC para el marco matemático. (4) Eden Engineering para la especificación de implementación.
Cría la IA con cuidado.
El autor de esta obra es Michael Darius Eastwood, un ser humano. Cada concepto central, hipótesis, diseño experimental, afirmación y conclusión de este artículo se origina en la ideación humana. Ninguna parte de este manuscrito es una salida generada íntegramente por inteligencia artificial.
Se emplearon herramientas de inteligencia artificial (la familia Claude de Anthropic y otros asistentes de modelo de lenguaje de gran tamaño) como instrumentos bajo dirección humana continua, del modo en que se utilizan un procesador de textos, una calculadora o un asistente de investigación: para edición y refinamiento de la prosa, búsqueda y resumen bibliográficos (verificados manualmente contra fuentes primarias), estructura del documento, formateo, tormenta de ideas frente a preguntas definidas por el autor, y aceleración de la redacción conforme a esquemas e instrucciones definidos por el autor. Toda selección, coordinación, disposición y el juicio editorial final son del autor. Cada salida sustantiva fue revisada, probada o verificada por el autor, que asume la plena responsabilidad de la exactitud y la integridad del texto final. Las herramientas aumentaron la velocidad del trabajo; nunca se dependió de ellas como su fuente.
Estatus epistémico. Lo que este programa nombra Leyes son conjeturas bajo prueba adversarial registrada; cada magnitud en este artículo está operacionalmente definida, y en ninguna parte se reclama el rango de ley establecida. El programa registrado existe para ganar ese rango, o para perderlo, mediante medición, replicación y refutación sobrevivida.
© 2026 Michael Darius Eastwood. De autoría humana con asistencia informática; se afirman la plena autoría humana y los derechos morales bajo la Copyright, Designs and Patents Act 1988 y de forma coherente con la guía de la United States Copyright Office sobre obras que contienen material generado por IA; cualquier contribución técnica novedosa descrita en esta obra fue concebida por el autor humano. Declaración completa: michaeldariuseastwood.com/authorship.
Pacto permanente. Demuéstrame que este artículo es erróneo, y publicaré la refutación yo mismo. Las condiciones de falsación se enuncian en este artículo; el reto permanente: github.com/MichaelDariusEastwood/arc-scaling-challenge.
¿Un error de traducción? Infórmalo directamente: