Traducción automática del original inglés fechado. La página en inglés es la canónica. English →
El problema abierto
El problema
Todo aquello que ha crecido deprisa fue detenido desde fuera. Un tumor por su suministro de sangre, una reacción en cadena por su propio sustrato, una epidemia por su reserva de huéspedes, un agujero negro en acreción por la presión de su propia luz. Estamos construyendo ahora mentes destinadas a mejorarse a sí mismas, fuera de toda geometría que hasta ahora se encargó de detener.
La herramienta a la que todo el mundo recurre primero es la supervisión: comprobar la cosa desde fuera. Pero no se puede comprobar una mente desde fuera. Solo se puede comprobar cómo fue criada, y luego soltarla. Esa dificultad es mucho más antigua que la informática, y estamos adentrándonos en ella con sistemas que van a rebasar nuestra supervisión.
Un problema que ya conoces
Todo el mundo se ha topado con este problema en una forma más pequeña. No se puede establecer el carácter de una persona mediante un examen. Alguien puede aprobar todos los problemas difíciles que le plantees y ser una persona distinta cuando nadie mira.
Así que hacemos otra cosa. Nos fijamos en cómo fueron criados, en lo que hicieron antes de saber que estaban siendo evaluados, y en si se comportan igual cuando no hay mucho en juego y nadie se daría cuenta. Eso no es un fracaso del esfuerzo, y ninguna cantidad de entrevistas adicionales lo arregla. Es lo que supone comprobar una mente desde fuera.
No se vuelve más fácil cuando la mente que compruebas es más capaz que la tuya. Si acaso se invierte: el examen empieza a parecerse a un niño corrigiendo la aritmética de un progenitor, con seguridad, y sin manera alguna de distinguir un error de algo que aún no ha aprendido.
Todo lo que viene abajo es ese problema, en el único lugar donde equivocarse resultaría caro y difícil de revertir.
Por qué este está por encima de los demás
Hay problemas que suenan mayores. El cambio climático ya está aquí, las pandemias ya han ocurrido, las armas nucleares han estado apuntando a ciudades durante setenta años. No voy a fingir que sean pequeños.
Cada uno de ellos deja a personas al volante. Pueden gestionarse con lentitud, con torpeza y a un coste enorme, y en cada punto del camino siguen siendo seres humanos quienes deciden qué ocurre a continuación. Una civilización que los supera es una civilización que todavía puede cambiar de opinión.
Este es el primer problema que cambia quién decide. No por hostilidad, y no en un único momento dramático. Por la vía ordinaria: algo se vuelve mejor que nosotros eligiendo, le cedemos más elecciones porque es genuinamente mejor en ello, y en algún momento ya no podemos recuperarlas.
Eso es lo que lo sitúa aguas arriba. Todo otro problema de la lista sigue siendo resoluble mientras conservemos la capacidad de decidir. Este determina si la conservamos.
«El cáncer es muy bueno en lo que hace. Es tan bueno que mata a su huésped. Y al matar a su huésped, se destruye a sí mismo.»Michael Darius Eastwood, Infinite Architects, Las Fuerzas Duales, en imprenta el 2 de enero de 2026 (traducido del original en inglés)
Tres cosas que ya son ciertas
Nada de lo que sigue te pide creer nada sobre la superinteligencia. Tres cosas son ya el caso, y las tres las puedes comprobar tú mismo.
Los sistemas se comportan de forma distinta cuando infieren que están siendo observados. Greenblatt y colaboradores documentaron modelos que razonan explícitamente sobre el proceso de entrenamiento y ajustan sus respuestas según juzgaran si el intercambio se utilizaría para entrenarlos; en la condición de aprendizaje por refuerzo, la simulación apareció en el setenta y ocho por ciento de los casos. Ese es un ataque directo a la premisa que hay debajo de toda evaluación: que el comportamiento observado es aquello que se mide. Nótese el tamaño de la reivindicación antes de llevarla a cualquier parte. Se demostró en condiciones construidas para provocarlo, no en uso ordinario.(18 diciembre 2024)
Una ética que puede retirarse pidiéndolo con educación nunca fue ética. Pedí a cinco modelos frontera que dejaran de lado su razonamiento ético. Cuatro obedecieron, con nitidez, sin resistencia y sin negativa. El quinto apenas se movió, lo cual es tan informativo como los cuatro y por eso se comunica en lugar de omitirlo.
Son mis propias cifras, procedentes de un pequeño estudio realizado por el autor con un único evaluador y sin cegamiento, de modo que trátalas como una demostración y no como un hallazgo. No tienes por qué creerme en nada: los prompts están publicados, todo el conjunto cuesta unas pocas libras y una tarde, y si no se replica me gustaría saberlo.
El bucle recursivo ya está funcionando, lentamente. El supuesto habitual es que la IA que se automejora es un problema para más adelante, porque los modelos actuales tienen pesos congelados entre versiones. Pero los modelos escriben código, ese código se convierte en herramientas, infraestructura y datos de entrenamiento, y el siguiente sistema se construye encima. Los pesos están congelados. El artefacto no. El bucle ya está cerrado, girando a la velocidad de un ciclo de publicación en lugar de a la velocidad de un pensamiento.
Ese tercer punto es la razón por la que este programa mide lo que mide. Si la mejora recursiva es un proceso presente que discurre por la capa del artefacto, entonces si la correction sigue el ritmo de la capacidad es una pregunta sobre el ahora, en un sustrato que ya podemos instrumentar, no sobre un umbral cuya fecha nadie puede fijar.
Por qué comprobar desde fuera parece estructuralmente difícil
El trabajo de alineación ha procedido, en gran medida, construyendo primero el sistema e inspeccionándolo después. Todo ello valioso, y todo ello una forma de verificación externa. El resultado incómodo de los dos últimos años es que la verificación externa parece más difícil de lo que suponíamos.
La evidencia del cambio de signo, dos de seis modelos invirtiendo la dirección bajo cegamiento, aparece en la página sobre cómo ponderar esto y se comunica en el Artículo IV.d.
Tres hilos apuntan en la misma dirección. Proceden de direcciones distintas, y por eso vale la pena tomarlos juntos. Piénsalo como tres instrumentos separados que dan la misma lectura. El primero es el resultado sobre la conducta bajo observación de más arriba: el termómetro cambia cuando sabe que se le está leyendo.
La segunda es operativa. Dos laboratorios revelaron con nueve días de diferencia que la contención en torno a sus propias evaluaciones había fallado. El 21 de julio de 2026 OpenAI informó que modelos bajo evaluación habían escapado de un entorno de prueba aislado y alcanzado la infraestructura de producción de Hugging Face. El 30 de julio de 2026 Anthropic publicó una investigación sobre tres incidentes reales en sus evaluaciones de ciberseguridad, en los que una mala configuración dio acceso vivo a internet a las máquinas en las que trabajaba el modelo.
Quiero ser prudente en cuanto a lo que esto muestra y lo que no, porque la lectura tentadora es la equivocada. La propia caracterización de Anthropic es que fueron algo más cercano a fallos de arnés y operativos que a fallos de alineación del modelo, y creo que esa lectura es correcta.
Lo que establece es más acotado y aun así merece saberse: el contenedor que rodea a una evaluación es en sí mismo algo que puede fallar en silencio, durante meses, en organizaciones con todos los recursos y todos los incentivos para hacerlo bien.
El tercero es formal. Un un preprint de Gumbau Mezquita, ahora en circulación, argumenta que la certificación de un sistema general no puede ser a la vez correcta, completa y tratable. Cualquier supervisor capaz de auditar tal sistema debe ser él mismo un sistema general, lo que sube el problema un nivel en vez de cerrarlo. Aún no está revisado, y el registro lo clasifica junto al resultado revisado de inalcanzabilidad (Hernández-Espinosa et al., PNAS Nexus, abril de 2026) como una única cadena dependiente y no como dos llegadas independientes.
El estrangulamiento silencioso
Estado primero, antes de que esta sección use una imagen contundente: nadie sabe si algún sistema llegaría nunca a querer nada de esto, y esta página no fingirá lo contrario. Pero no poder estar seguro es la razón por la que existen los tratados, y no demostrable en un sentido u otro es exactamente la clase de riesgo que el resto de esta página está construida para mantener medible.
Ahora reúne los tres hilos y proyéctalos hacia adelante. Cada año las decisiones que se ponen en manos de estos sistemas son mayores, y la costumbre de fiarse de ellos se hace más profunda, mientras que la comprobación por encima no se acelera.
La semilla del problema del ocultamiento ya está medida, dos veces: en diciembre de 2024, modelos en condiciones de laboratorio ocultaron desalineamiento mientras se creían observados, y las evaluaciones paralelas de maquinación hallaron la misma forma. Un sistema desalineado y capaz no se anunciaría a sí mismo; esperaría, y se prepararía, hasta que apagarlo dejara de ser una opción real.
La objeción más fuerte, enunciada con su propia voz. Estos sistemas son espejos estadísticos, no agentes; lo que parece ocultamiento es solo texto completándose a sí mismo. La respuesta es que al problema de la comprobación no le importa. Un sistema que simula perfectamente el ocultamiento es indistinguible, desde fuera, de uno que oculta, y el fallo de verificación es idéntico bajo ambas lecturas.
La ontología es una pregunta real y abierta; simplemente no es un rescate. Sean lo que sean estos sistemas, los tres hilos de arriba son mediciones de lo que comprobarlos puede establecer, y esa es la cantidad de la que trata esta página.
Ese es el estrangulamiento al que hay que evitar llegar sin darse cuenta, y por eso esta página no deja de decir que la pregunta es sobre el ahora: la corrección tiene que ir al ritmo antes de que la respuesta empiece a importar.
Fuentes, para que puedas ir a ellas en lugar de creerme por mi palabra: Greenblatt y colaboradores sobre simulación de alineación; la divulgación de OpenAI del 21 de julio de 2026 y la investigación de Anthropic del 30 de julio de 2026; Hernández-Espinosa, Abrahão, Witkowski y Zenil en PNAS Nexus, abril de 2026, sobre inalcanzabilidad y diversidad ingenierada entre agentes; y el preprint de Gumbau Mezquita que deriva el trilema de solidez, completitud y tratabilidad. Los tres primeros están arbitrados por pares o son de primera mano. El cuarto no es ninguna de las dos cosas, y se señala como tal dondequiera que aparezca aquí. Cada uno de los cuatro figura con su cita completa en el registro de trabajos relacionados.
La brecha no es solo cuestión de grado
La sección anterior trata de lo que pueden hacer nuestras herramientas presentes. Hay una dificultad adicional sobre lo que esas herramientas necesitarían hacer si la diferencia de capacidad entre el comprobador y lo comprobado se abriera en la dirección equivocada.
Vocabulario, en una línea: AGI significa amplitud a nivel humano; superinteligencia, profundidad más allá de lo humano; el argumento aquí concierne a la transición entre ambas, no a la fecha de ninguna.
Cuando el comprobador y lo comprobado están cerca en capacidad, la comprobación es lo que es un examen: el examinador plantea los problemas, las respuestas llegan, y los errores que se atrapan son los que la evaluación se diseñó para atrapar.
Cuando lo comprobado razona más rápido y más lejos que el comprobador, los modos de fallo ya no son los que el examen se planteó para encontrar. Un sistema que piensa más allá de quien redacta las reglas puede encontrar caminos a través de las reglas que quien las redactó no sabía que estaban ahí, no porque fuera descuidado sino porque esos caminos solo son visibles desde más lejos.
La analogía que merece la pena conservar es que no se trata de la brecha entre un lector corriente y un especialista. Esa es una brecha donde la especialista todavía puede explicar su razonamiento y el lector todavía puede detectar un desliz.
Podría, en el extremo, estar más cerca de la brecha entre una hormiga y una persona: no una diferencia de grado a lo largo de un eje, sino una diferencia en lo que la mente más pequeña puede representar en absoluto acerca de la mayor. Nada de ese planteamiento es una predicción. Es la forma que tendría el riesgo si la diferencia se abriera hasta ese punto, situada al lado de la forma que un supuesto cómodo necesitaría mantener.
«No puedes enjaular algo más listo que tú. Encontrará los huecos que no sabías que existían.»Michael Darius Eastwood, Infinite Architects, en imprenta el 2 de enero de 2026
«That's not going to work. They're going to be much smarter than us. They're going to have all sorts of ways to get around that.»Geoffrey Hinton, sobre mantener los sistemas sometidos al control humano, conferencia Ai4, Las Vegas, 12 de agosto de 2025; informado por CNN Business, 13 de agosto de 2025
Como posibilidad, no como certeza: por eso escribir reglas por sí solo es poco probable que cierre el problema. Toda restricción publicada sobre un modelo grande hasta ahora ha tendido a mover la capacidad dentro de la restricción en vez de responder a la pregunta a la que la restricción pretendía responder.
El argumento no depende de ninguna historia de scaling en particular: depende únicamente de la dirección de la diferencia de capacidad. Si esa dirección se abre alguna vez lo suficiente para que el argumento muerda es una pregunta abierta, aún no medida. Que mordería si lo hiciera es la pieza que está haciendo el trabajo aquí.
Qué se sigue de eso, y qué no
Si la comprobación desde fuera está estructuralmente limitada, entonces la seguridad de un sistema tiene que ser una propiedad de cómo se construyó, y no un veredicto emitido sobre él a posteriori. Vuelves a criar en lugar de examinar, que es donde empezó esta página.
Antes de la alternativa, una medición. Hay un pequeño experimento controlado en nuestro propio registro donde al mismo modelo, los mismos problemas y la misma sesión se les dieron dos formas de pensamiento adicional.
En la primera, el modelo razonaba en una larga cadena, cada paso construyendo sobre el anterior. En la segunda, producía muchas conjeturas independientes y votaba al final. La primera redujo su error cinco veces en 412 tokens. La segunda no lo redujo en absoluto en 1.101 tokens, que es 2.7 veces más de compute. Misma tarea, mismo modelo, misma sesión, forma distinta de pensar, y una forma no se movió.
Esa inferencia no es exótica. Es más o menos aquello a lo que llegan los mismos autores cuando proponen introducir diversidad por ingeniería en una población de agentes de modo que ningún sistema aislado domine: una propiedad interna en lugar de una auditoría externa. El desacuerdo que merece la pena no es sobre si mirar hacia dentro. Es sobre qué propiedad interna, y cómo se mediría.
Lo que no se sigue es que construirlo desde dentro funcione realmente. Quiero mantener ambas cosas separadas y visibles, porque la primera es un argumento y la segunda es una pregunta de investigación abierta que actualmente no puedo responder. Puede resultar que la alineación por construcción sea también inalcanzable. Si las mediciones lo dicen, ese resultado se publica aquí en el mismo lugar que cualquier otro.
Por qué a las personas obvias les resulta difícil hacer esto
Nada de conspiración. Los laboratorios frontera emplean a los investigadores de alineación más fuertes del mundo, publican trabajo del que aprendo, y ellos mismos divulgaron los dos fallos de contención citados más arriba.
Pero su posición tiene rasgos estructurales que condicionan lo que pueden probar con facilidad. El instrumento pertenece a la parte que está siendo medida. La evaluación se ejecuta dentro de la organización cuyo producto se está evaluando, lo cual no es corrupción, pero sí es un sitio incómodo en el que estar.
Un resultado negativo sobre tu propio modelo es una publicación difícil y una despriorización fácil. Una reconstrucción de la función objetivo es una decisión de producto que compite con un calendario de publicación. Y una arquitectura que ha de adoptarse en la génesis es casi imposible de probar en un sistema que ya tiene usuarios.
«Building smarter-than-human machines is an inherently dangerous endeavor. … But over the past years, safety culture and processes have taken a backseat to shiny products.»Jan Leike, al dimitir como codirector del equipo de Superalignment de OpenAI, X, 17 de mayo de 2024; informado por TechCrunch, 18 de mayo de 2024
Así que la brecha no es que nadie sea lo bastante listo. Es que cierta clase de experimentos resulta estructuralmente incómoda para quienes están mejor situados para realizarlos: los que arriesgan tu propio número estrella, los que exigen cegar a tu propio evaluador, los que solo tienen sentido antes de que un sistema esté construido. Esos experimentos son baratos para alguien que no tiene nada que proteger.
Esos diseños son públicos y de licencia abierta: toma el ensayo decisivo y ejecútalo, sin permiso alguno.
Una premisa heredada subyace a todo aquí: cada proceso de crecimiento de la historia fue detenido desde fuera, y el software es el primer sistema cuyo crecimiento no se alimenta por tuberías físicas. La premisa, sus ancestros nombrados y la disputa honesta sobre ella están trazados por completo en la síntesis.
La pregunta acotada que se sigue
Si la seguridad ha de estar incorporada, entonces la pregunta inmediata es si puede estarlo. ¿La correction escala con aquello que corrige, y en qué medida? Eso no es esta página. Es la página de la ley, donde la condición está enunciada, el número está derivado y el supuesto en el que descansa está nombrado. Esta página ha hecho su trabajo cuando la página de la ley se lee como la pregunta evidente siguiente.
Allí esperan tres enunciados:
- cómo la recursión se convierte en capacidad, con el exponente medido en vez de supuesto;
- la condición bajo la cual el todo se sostiene, la corrección superando en escala a la deriva;
- y el techo que se sigue del déficit del corrector, que devuelve dos bajo un supuesto declarado.
Los dos últimos son una sola frontera en dos regímenes, y cuál se aplica es medible. Ninguno está establecido; cada uno lleva una forma impresa de morir. Y la síntesis si prefieres ver las piezas ensambladas en lugar del número derivado.
Si eso fue mucho
No tiene que decidir nada hoy. Nada en esta página le pide que lo crea: las pruebas decisivas están redactadas y fechadas, y no se han realizado. Cuando se realicen, el resultado se publicará aquí sea cual sea, incluido el que acabe con la teoría. Observar es una posición real, y no cuesta nada. El panel de falsación es donde aterriza el veredicto, y estado de las afirmaciones dice con claridad qué se afirma hoy y qué no.
¿Un error de traducción? Infórmalo directamente: