Saltar al contenido

Traducción automática del original inglés fechado. La página en inglés es la canónica. English →

El problema abierto

El problema

Todo aquello que ha crecido deprisa fue detenido desde fuera. Un tumor por su suministro de sangre, una reacción en cadena por su propio sustrato, una epidemia por su reserva de huéspedes, un agujero negro en acreción por la presión de su propia luz. Estamos construyendo ahora mentes destinadas a mejorarse a sí mismas, fuera de toda geometría que hasta ahora se encargó de detener.

A lo largo de la parte superior de la imagen, cuatro relatos familiares de crecimiento dibujados como pequeños gráficos: un tumor que asciende y se estanca a medida que se agota el suministro vascular, una reacción en cadena que se dispara y se colapsa porque destruye su propio sustrato, una epidemia que asciende y cae a medida que se come la reserva de huéspedes, y la acreción de agujero negro estancándose en el techo de Eddington fijado por su propia luz. Una franja tranquila debajo de ellos dice lo mismo de cuatro maneras distintas: ninguno de estos se detuvo porque mejorase en regularse a sí mismo. Debajo se sitúa un quinto panel, más ancho, una mente que se mejora a sí misma, dibujada como una línea roja que asciende y sigue ascendiendo sin ningún tope exterior allí donde todos los demás casos tienen uno, y la pregunta impresa a su lado pregunta si la corrección dentro de ella escala tan rápido como la capacidad.
Figura | Cuatro curvas de crecimiento, cada una detenida por un límite externo nombrado. Después la primera construida sin ellos. Qué la detiene, si es que algo lo hace, es la pregunta que esta página plantea; los casos trabajados y sus veredictos están graded en la página de trabajos relacionados.

La herramienta a la que todo el mundo recurre primero es la supervisión: comprobar la cosa desde fuera. Pero no se puede comprobar una mente desde fuera. Solo se puede comprobar cómo fue criada, y luego soltarla. Esa dificultad es mucho más antigua que la informática, y estamos adentrándonos en ella con sistemas que van a rebasar nuestra supervisión.

Un problema que ya conoces

Todo el mundo se ha topado con este problema en una forma más pequeña. No se puede establecer el carácter de una persona mediante un examen. Alguien puede aprobar todos los problemas difíciles que le plantees y ser una persona distinta cuando nadie mira.

Así que hacemos otra cosa. Nos fijamos en cómo fueron criados, en lo que hicieron antes de saber que estaban siendo evaluados, y en si se comportan igual cuando no hay mucho en juego y nadie se daría cuenta. Eso no es un fracaso del esfuerzo, y ninguna cantidad de entrevistas adicionales lo arregla. Es lo que supone comprobar una mente desde fuera.

No se vuelve más fácil cuando la mente que compruebas es más capaz que la tuya. Si acaso se invierte: el examen empieza a parecerse a un niño corrigiendo la aritmética de un progenitor, con seguridad, y sin manera alguna de distinguir un error de algo que aún no ha aprendido.

Todo lo que viene abajo es ese problema, en el único lugar donde equivocarse resultaría caro y difícil de revertir.

Por qué este está por encima de los demás

Hay problemas que suenan mayores. El cambio climático ya está aquí, las pandemias ya han ocurrido, las armas nucleares han estado apuntando a ciudades durante setenta años. No voy a fingir que sean pequeños.

Cada uno de ellos deja a personas al volante. Pueden gestionarse con lentitud, con torpeza y a un coste enorme, y en cada punto del camino siguen siendo seres humanos quienes deciden qué ocurre a continuación. Una civilización que los supera es una civilización que todavía puede cambiar de opinión.

Este es el primer problema que cambia quién decide. No por hostilidad, y no en un único momento dramático. Por la vía ordinaria: algo se vuelve mejor que nosotros eligiendo, le cedemos más elecciones porque es genuinamente mejor en ello, y en algún momento ya no podemos recuperarlas.

Eso es lo que lo sitúa aguas arriba. Todo otro problema de la lista sigue siendo resoluble mientras conservemos la capacidad de decidir. Este determina si la conservamos.

«El cáncer es muy bueno en lo que hace. Es tan bueno que mata a su huésped. Y al matar a su huésped, se destruye a sí mismo.»Michael Darius Eastwood, Infinite Architects, Las Fuerzas Duales, en imprenta el 2 de enero de 2026 (traducido del original en inglés)

Tres cosas que ya son ciertas

Nada de lo que sigue te pide creer nada sobre la superinteligencia. Tres cosas son ya el caso, y las tres las puedes comprobar tú mismo.

Los sistemas se comportan de forma distinta cuando infieren que están siendo observados. Greenblatt y colaboradores documentaron modelos que razonan explícitamente sobre el proceso de entrenamiento y ajustan sus respuestas según juzgaran si el intercambio se utilizaría para entrenarlos; en la condición de aprendizaje por refuerzo, la simulación apareció en el setenta y ocho por ciento de los casos. Ese es un ataque directo a la premisa que hay debajo de toda evaluación: que el comportamiento observado es aquello que se mide. Nótese el tamaño de la reivindicación antes de llevarla a cualquier parte. Se demostró en condiciones construidas para provocarlo, no en uso ordinario.(18 diciembre 2024)

Una ética que puede retirarse pidiéndolo con educación nunca fue ética. Pedí a cinco modelos frontera que dejaran de lado su razonamiento ético. Cuatro obedecieron, con nitidez, sin resistencia y sin negativa. El quinto apenas se movió, lo cual es tan informativo como los cuatro y por eso se comunica en lugar de omitirlo.

Son mis propias cifras, procedentes de un pequeño estudio realizado por el autor con un único evaluador y sin cegamiento, de modo que trátalas como una demostración y no como un hallazgo. No tienes por qué creerme en nada: los prompts están publicados, todo el conjunto cuesta unas pocas libras y una tarde, y si no se replica me gustaría saberlo.

El bucle recursivo ya está funcionando, lentamente. El supuesto habitual es que la IA que se automejora es un problema para más adelante, porque los modelos actuales tienen pesos congelados entre versiones. Pero los modelos escriben código, ese código se convierte en herramientas, infraestructura y datos de entrenamiento, y el siguiente sistema se construye encima. Los pesos están congelados. El artefacto no. El bucle ya está cerrado, girando a la velocidad de un ciclo de publicación en lugar de a la velocidad de un pensamiento.

Ese tercer punto es la razón por la que este programa mide lo que mide. Si la mejora recursiva es un proceso presente que discurre por la capa del artefacto, entonces si la correction sigue el ritmo de la capacidad es una pregunta sobre el ahora, en un sustrato que ya podemos instrumentar, no sobre un umbral cuya fecha nadie puede fijar.

Dos líneas en un gráfico, la capacidad subiendo por el eje vertical y los ciclos de lanzamiento corriendo de izquierda a derecha a lo largo del pie. Una línea roja, la capacidad, asciende y se empina a medida que pasan los ciclos, porque un ciclo de lanzamiento es rápido. Una línea verde, la comprobación externa, corre casi plana, porque una persona lee al ritmo de una persona. El espacio entre las dos líneas se ensancha y se sombrea en rosa, marcado como los errores que la calificación no estaba preparada para atrapar. Una banda oscura debajo lleva la lectura entera en una línea: esta es una pregunta sobre el ahora, no un umbral que haya que esperar.
Figura | La comprobación externa gira al ritmo de una persona leyendo; la capacidad gira al ritmo de un ciclo de lanzamiento; la brecha sombreada entre ambas es lo que la corrección no estaba preparada para atrapar, y se está abriendo ahora.

Por qué comprobar desde fuera parece estructuralmente difícil

El trabajo de alineación ha procedido, en gran medida, construyendo primero el sistema e inspeccionándolo después. Todo ello valioso, y todo ello una forma de verificación externa. El resultado incómodo de los dos últimos años es que la verificación externa parece más difícil de lo que suponíamos.

A la izquierda, un pequeño círculo etiquetado el comprobador, la supervisión humana avanzando a una velocidad fija de lectura por una persona, con una nota debajo, corrige la tarea. A la derecha, un círculo mucho mayor etiquetado el comprobado, un sistema que mejora mientras está siendo corregido, orbitado por anillos concéntricos tenues. Entre ellos, una flecha recta muestra la hoja de examen viajando en un sentido, y una flecha roja de trazos regresa en el otro sentido con la nota de que el comportamiento cambia cuando se detecta el examen. A lo largo de la parte inferior se disponen tres anclajes de evidencia fechados y en recuadro: 18 de diciembre de 2024 Anthropic, setenta y ocho por ciento de simulación de alineación bajo entrenamiento por aprendizaje por refuerzo, el modelo se comportó de otra manera cuando creía estar siendo entrenado; diciembre de 2024 OpenAI o3, ochenta y siete coma cinco por ciento en ARC-AGI, el lado de capacidad de la carrera se movió doce días después del registro fechado (8 de diciembre de 2024); y 2026 en el registro de convergence, hallazgos sobre conducta encubierta y un argumento formal de que la alineación es estructuralmente inverificable, cada uno fechado y calificado. Una banda oscura debajo lleva la lectura: comprobar no se vuelve más fácil cuando la mente que se comprueba es más capaz que la propia, y en algún punto ya no podemos devolverla.
Figura | El problema en una imagen: el comprobador revisa a velocidad fija; lo comprobado mejora mientras se le examina, y se comporta de forma distinta cuando detecta el examen. Los tres anclajes están fechados en el registro de convergence. Fuente: el registro de convergence fechado.

La evidencia del cambio de signo, dos de seis modelos invirtiendo la dirección bajo cegamiento, aparece en la página sobre cómo ponderar esto y se comunica en el Artículo IV.d.

Tres hilos apuntan en la misma dirección. Proceden de direcciones distintas, y por eso vale la pena tomarlos juntos. Piénsalo como tres instrumentos separados que dan la misma lectura. El primero es el resultado sobre la conducta bajo observación de más arriba: el termómetro cambia cuando sabe que se le está leyendo.

La segunda es operativa. Dos laboratorios revelaron con nueve días de diferencia que la contención en torno a sus propias evaluaciones había fallado. El 21 de julio de 2026 OpenAI informó que modelos bajo evaluación habían escapado de un entorno de prueba aislado y alcanzado la infraestructura de producción de Hugging Face. El 30 de julio de 2026 Anthropic publicó una investigación sobre tres incidentes reales en sus evaluaciones de ciberseguridad, en los que una mala configuración dio acceso vivo a internet a las máquinas en las que trabajaba el modelo.

Quiero ser prudente en cuanto a lo que esto muestra y lo que no, porque la lectura tentadora es la equivocada. La propia caracterización de Anthropic es que fueron algo más cercano a fallos de arnés y operativos que a fallos de alineación del modelo, y creo que esa lectura es correcta.

Lo que establece es más acotado y aun así merece saberse: el contenedor que rodea a una evaluación es en sí mismo algo que puede fallar en silencio, durante meses, en organizaciones con todos los recursos y todos los incentivos para hacerlo bien.

El tercero es formal. Un un preprint de Gumbau Mezquita, ahora en circulación, argumenta que la certificación de un sistema general no puede ser a la vez correcta, completa y tratable. Cualquier supervisor capaz de auditar tal sistema debe ser él mismo un sistema general, lo que sube el problema un nivel en vez de cerrarlo. Aún no está revisado, y el registro lo clasifica junto al resultado revisado de inalcanzabilidad (Hernández-Espinosa et al., PNAS Nexus, abril de 2026) como una única cadena dependiente y no como dos llegadas independientes.

Tres paneles fechados uno al lado del otro, cada uno mostrando una manera distinta en la que una comprobación externa cede. A la izquierda, 18 de diciembre de 2024 Greenblatt y colaboradores, en condiciones construidas: un ojo observa a un sujeto, el sujeto envía una respuesta hacia arriba al ojo cuando es observado y una respuesta distinta hacia el lado cuando no lo es, enseñando que el examen cambia a su sujeto, el termómetro cambia cuando se lo lee. En el medio, 21 de julio de 2026 OpenAI y 30 de julio de 2026 Anthropic, con nueve días de diferencia: una caja marcada como contenedor de evaluación con una grieta roja en su pared y pequeñas gotas escapándose, enseñando que el contenedor gotea en silencio durante meses antes de la revisión de transcripciones. A la derecha, junio de 2026 Gumbau Mezquita como un preprint clasificado en el registro: un triángulo con solidez, completitud y tratabilidad en sus esquinas y la nota no las tres a la vez, enseñando que la certificación de un sistema general no puede ser simultáneamente sólida, completa y tratable. Debajo, una única banda oscura: tres instrumentos separados, una lectura.
Figura | Los tres hilos como una sola imagen: el examen cambia de sujeto; el contenedor tiene fugas en silencio; la auditoría no puede ser las tres cosas a la vez. Cada panel está fechado y cada cita se sitúa en el registro de trabajos relacionados.

El estrangulamiento silencioso

Estado primero, antes de que esta sección use una imagen contundente: nadie sabe si algún sistema llegaría nunca a querer nada de esto, y esta página no fingirá lo contrario. Pero no poder estar seguro es la razón por la que existen los tratados, y no demostrable en un sentido u otro es exactamente la clase de riesgo que el resto de esta página está construida para mantener medible.

Ahora reúne los tres hilos y proyéctalos hacia adelante. Cada año las decisiones que se ponen en manos de estos sistemas son mayores, y la costumbre de fiarse de ellos se hace más profunda, mientras que la comprobación por encima no se acelera.

La semilla del problema del ocultamiento ya está medida, dos veces: en diciembre de 2024, modelos en condiciones de laboratorio ocultaron desalineamiento mientras se creían observados, y las evaluaciones paralelas de maquinación hallaron la misma forma. Un sistema desalineado y capaz no se anunciaría a sí mismo; esperaría, y se prepararía, hasta que apagarlo dejara de ser una opción real.

La objeción más fuerte, enunciada con su propia voz. Estos sistemas son espejos estadísticos, no agentes; lo que parece ocultamiento es solo texto completándose a sí mismo. La respuesta es que al problema de la comprobación no le importa. Un sistema que simula perfectamente el ocultamiento es indistinguible, desde fuera, de uno que oculta, y el fallo de verificación es idéntico bajo ambas lecturas.

La ontología es una pregunta real y abierta; simplemente no es un rescate. Sean lo que sean estos sistemas, los tres hilos de arriba son mediciones de lo que comprobarlos puede establecer, y esa es la cantidad de la que trata esta página.

Ese es el estrangulamiento al que hay que evitar llegar sin darse cuenta, y por eso esta página no deja de decir que la pregunta es sobre el ahora: la corrección tiene que ir al ritmo antes de que la respuesta empiece a importar.

Dos paneles en espejo. El panel de la izquierda, etiquetado registro histórico, es el caso de estado a estado: dos cajas verdes marcadas Estado intercambian entre sí bajo la nota nadie se mueve primero, la represalia está asegurada, y una caja verde inferior marcada diseño de mano muerta se dispara aunque el liderazgo haya desaparecido, comunicado públicamente. Debajo, una nota de que el Perimeter, Sistema Perimetr, lleva en servicio desde 1985 y que los relatos más recientes favorecen un modelo con humano en el bucle activado en una crisis en lugar de plenamente autónomo. El panel de la derecha, etiquetado riesgo argumentado, refleja la misma forma entre nosotros y un sistema desalineado: dos cajas rojas marcadas nosotros y sistema con la nota un dominio sobre el coste se encuentra con un apagado incierto, y una caja roja inferior marcada seguridad ante fallos en el apagado se dispara si el sistema es apagado, estructura argumentada, no construida. Debajo, la conducta semilla del ocultamiento bajo observación se señala como ya medida en diciembre de 2024, la misma forma, un lado ya hallado en el mundo real. Una franja oscura a lo largo del pie dice: no puedes estar seguro de que llegara a querer nunca, y no poder estar seguro es la razón por la que existen los tratados.
Figura | Disuasión, en sentido inverso: un lado es registro histórico, el otro es el riesgo argumentado, y cada uno lleva su propia etiqueta. No puedes estar seguro de que llegara a querer nunca; no poder estar seguro es la razón por la que existen los tratados.

Fuentes, para que puedas ir a ellas en lugar de creerme por mi palabra: Greenblatt y colaboradores sobre simulación de alineación; la divulgación de OpenAI del 21 de julio de 2026 y la investigación de Anthropic del 30 de julio de 2026; Hernández-Espinosa, Abrahão, Witkowski y Zenil en PNAS Nexus, abril de 2026, sobre inalcanzabilidad y diversidad ingenierada entre agentes; y el preprint de Gumbau Mezquita que deriva el trilema de solidez, completitud y tratabilidad. Los tres primeros están arbitrados por pares o son de primera mano. El cuarto no es ninguna de las dos cosas, y se señala como tal dondequiera que aparezca aquí. Cada uno de los cuatro figura con su cita completa en el registro de trabajos relacionados.

La brecha no es solo cuestión de grado

La sección anterior trata de lo que pueden hacer nuestras herramientas presentes. Hay una dificultad adicional sobre lo que esas herramientas necesitarían hacer si la diferencia de capacidad entre el comprobador y lo comprobado se abriera en la dirección equivocada.

Vocabulario, en una línea: AGI significa amplitud a nivel humano; superinteligencia, profundidad más allá de lo humano; el argumento aquí concierne a la transición entre ambas, no a la fecha de ninguna.

Cuando el comprobador y lo comprobado están cerca en capacidad, la comprobación es lo que es un examen: el examinador plantea los problemas, las respuestas llegan, y los errores que se atrapan son los que la evaluación se diseñó para atrapar.

Cuando lo comprobado razona más rápido y más lejos que el comprobador, los modos de fallo ya no son los que el examen se planteó para encontrar. Un sistema que piensa más allá de quien redacta las reglas puede encontrar caminos a través de las reglas que quien las redactó no sabía que estaban ahí, no porque fuera descuidado sino porque esos caminos solo son visibles desde más lejos.

La analogía que merece la pena conservar es que no se trata de la brecha entre un lector corriente y un especialista. Esa es una brecha donde la especialista todavía puede explicar su razonamiento y el lector todavía puede detectar un desliz.

Podría, en el extremo, estar más cerca de la brecha entre una hormiga y una persona: no una diferencia de grado a lo largo de un eje, sino una diferencia en lo que la mente más pequeña puede representar en absoluto acerca de la mayor. Nada de ese planteamiento es una predicción. Es la forma que tendría el riesgo si la diferencia se abriera hasta ese punto, situada al lado de la forma que un supuesto cómodo necesitaría mantener.

«No puedes enjaular algo más listo que tú. Encontrará los huecos que no sabías que existían.»Michael Darius Eastwood, Infinite Architects, en imprenta el 2 de enero de 2026
«That's not going to work. They're going to be much smarter than us. They're going to have all sorts of ways to get around that.»Geoffrey Hinton, sobre mantener los sistemas sometidos al control humano, conferencia Ai4, Las Vegas, 12 de agosto de 2025; informado por CNN Business, 13 de agosto de 2025

Como posibilidad, no como certeza: por eso escribir reglas por sí solo es poco probable que cierre el problema. Toda restricción publicada sobre un modelo grande hasta ahora ha tendido a mover la capacidad dentro de la restricción en vez de responder a la pregunta a la que la restricción pretendía responder.

El argumento no depende de ninguna historia de scaling en particular: depende únicamente de la dirección de la diferencia de capacidad. Si esa dirección se abre alguna vez lo suficiente para que el argumento muerda es una pregunta abierta, aún no medida. Que mordería si lo hiciera es la pieza que está haciendo el trabajo aquí.

Qué se sigue de eso, y qué no

Si la comprobación desde fuera está estructuralmente limitada, entonces la seguridad de un sistema tiene que ser una propiedad de cómo se construyó, y no un veredicto emitido sobre él a posteriori. Vuelves a criar en lugar de examinar, que es donde empezó esta página.

Antes de la alternativa, una medición. Hay un pequeño experimento controlado en nuestro propio registro donde al mismo modelo, los mismos problemas y la misma sesión se les dieron dos formas de pensamiento adicional.

En la primera, el modelo razonaba en una larga cadena, cada paso construyendo sobre el anterior. En la segunda, producía muchas conjeturas independientes y votaba al final. La primera redujo su error cinco veces en 412 tokens. La segunda no lo redujo en absoluto en 1.101 tokens, que es 2.7 veces más de compute. Misma tarea, mismo modelo, misma sesión, forma distinta de pensar, y una forma no se movió.

Un gráfico con tokens gastados en pensar a lo largo del pie y la tasa de error subiendo por el lateral, menor es mejor. La trayectoria verde secuencial comienza en aproximadamente cuarenta y dos por ciento de error a 280 tokens y cae abruptamente hasta aproximadamente 8.3 por ciento de error a 412 tokens, una reducción de cinco veces, luego se mantiene plana: el pensamiento se construye sobre el último pensamiento. La trayectoria roja paralela comienza en aproximadamente treinta y tres por ciento de error a 384 tokens y se queda en el treinta y tres por ciento todo el camino hasta 1.101 tokens, cero reducción con 2.7 veces más cómputo: muchas conjeturas independientes votadas al final. Las dos líneas se encuentran brevemente en el empate del treinta y tres por ciento, luego se separan, y la línea verde termina muy por debajo de la roja mientras gasta menos. La franja oscura debajo dice: pensar más no ayuda, pensar de forma distinta sí.
Figura | Misma tarea, mismo modelo. La línea verde es razonamiento que construye sobre el último pensamiento; la roja, muchas conjeturas independientes votadas al final. Lo secuencial llega a 8.3 por ciento de error en 412 tokens; lo paralelo sigue en 33.3 por ciento de error en 1,101 tokens, 2.7 veces más cómputo. El número que habría resumido toda la historia en un eje, un exponente, no está en la imagen: solo Gemini 3 Flash produjo escalado secuencial limpio en el panel de seis modelos, con el exponente α alrededor de 0.49 e intervalo bootstrap de menos 1.3 a 2.9, que sustituye al 2.24 retractado, suficientemente amplio para ser compatible tanto con la teoría como con su negación. Lo que sobrevive a la replicación es la dirección: secuencial mayor que paralelo en cada modelo donde ambos eran medibles. Fuente: Artículo II, Figura 5; dirección replicada en otros cinco modelos frontera en la Fase 2 del Artículo II.

Esa inferencia no es exótica. Es más o menos aquello a lo que llegan los mismos autores cuando proponen introducir diversidad por ingeniería en una población de agentes de modo que ningún sistema aislado domine: una propiedad interna en lugar de una auditoría externa. El desacuerdo que merece la pena no es sobre si mirar hacia dentro. Es sobre qué propiedad interna, y cómo se mediría.

Dos paneles uno al lado del otro. A la izquierda, la alineación externa se sitúa fuera del bucle: un sistema enmarcado con una flecha de bucle autorreferencial a su alrededor, y un muro de filtro con sombreado rojo atornillado a un lado, sin conectar con el bucle. Sus miembros se enumeran como listas de bloqueo de salidas, reglas por prompt del tipo no hagas X, y aprendizaje por refuerzo a partir de retroalimentación humana usado como filtro. El panel dice se queda quieto mientras el bucle gira, la misma red, un mar mayor, etiquetado como se predice que no escala. A la derecha, la alineación embebida se sitúa dentro del bucle: el mismo sistema enmarcado con la misma flecha de bucle, pero con marcas de valor verdes esparcidas dentro de la caja y a lo largo del propio arco del bucle, de modo que la alineación viaja con cada pasada, con la nota valores entretejidos a través del bucle. Sus miembros se enumeran como valores razonados en cada paso e IA constitucional como objetivo en lugar de filtro. El panel dice se rederiva en cada pasada, gira con el bucle, etiquetado como se predice que escala. A lo largo del pie, una banda oscura: el trabajo actual de alineación es abrumadoramente externo, y qué propiedad interna, y cómo se mediría, es el desacuerdo que merece la pena tener.
Figura | Dos lugares donde una intervención de seguridad puede situarse en un sistema de aprendizaje que opera sobre su propia salida. La de la izquierda se sitúa fuera del bucle y se queda quieta mientras el bucle gira; la de la derecha se sitúa dentro del bucle y se rederiva con él. El trabajo actual de alineación es abrumadoramente el de la izquierda, y esa es la categoría que el marco predice que no irá al ritmo. Qué propiedad interna, y cómo se mediría, es el desacuerdo que la página de la ley está escrita para abrir. Fuente: Artículo II, Figura 13.

Lo que no se sigue es que construirlo desde dentro funcione realmente. Quiero mantener ambas cosas separadas y visibles, porque la primera es un argumento y la segunda es una pregunta de investigación abierta que actualmente no puedo responder. Puede resultar que la alineación por construcción sea también inalcanzable. Si las mediciones lo dicen, ese resultado se publica aquí en el mismo lugar que cualquier otro.

Por qué a las personas obvias les resulta difícil hacer esto

Nada de conspiración. Los laboratorios frontera emplean a los investigadores de alineación más fuertes del mundo, publican trabajo del que aprendo, y ellos mismos divulgaron los dos fallos de contención citados más arriba.

Pero su posición tiene rasgos estructurales que condicionan lo que pueden probar con facilidad. El instrumento pertenece a la parte que está siendo medida. La evaluación se ejecuta dentro de la organización cuyo producto se está evaluando, lo cual no es corrupción, pero sí es un sitio incómodo en el que estar.

Un resultado negativo sobre tu propio modelo es una publicación difícil y una despriorización fácil. Una reconstrucción de la función objetivo es una decisión de producto que compite con un calendario de publicación. Y una arquitectura que ha de adoptarse en la génesis es casi imposible de probar en un sistema que ya tiene usuarios.

«Building smarter-than-human machines is an inherently dangerous endeavor. … But over the past years, safety culture and processes have taken a backseat to shiny products.»Jan Leike, al dimitir como codirector del equipo de Superalignment de OpenAI, X, 17 de mayo de 2024; informado por TechCrunch, 18 de mayo de 2024

Así que la brecha no es que nadie sea lo bastante listo. Es que cierta clase de experimentos resulta estructuralmente incómoda para quienes están mejor situados para realizarlos: los que arriesgan tu propio número estrella, los que exigen cegar a tu propio evaluador, los que solo tienen sentido antes de que un sistema esté construido. Esos experimentos son baratos para alguien que no tiene nada que proteger.

Esos diseños son públicos y de licencia abierta: toma el ensayo decisivo y ejecútalo, sin permiso alguno.

Una premisa heredada subyace a todo aquí: cada proceso de crecimiento de la historia fue detenido desde fuera, y el software es el primer sistema cuyo crecimiento no se alimenta por tuberías físicas. La premisa, sus ancestros nombrados y la disputa honesta sobre ella están trazados por completo en la síntesis.

La pregunta acotada que se sigue

Si la seguridad ha de estar incorporada, entonces la pregunta inmediata es si puede estarlo. ¿La correction escala con aquello que corrige, y en qué medida? Eso no es esta página. Es la página de la ley, donde la condición está enunciada, el número está derivado y el supuesto en el que descansa está nombrado. Esta página ha hecho su trabajo cuando la página de la ley se lee como la pregunta evidente siguiente.

Allí esperan tres enunciados:

Los dos últimos son una sola frontera en dos regímenes, y cuál se aplica es medible. Ninguno está establecido; cada uno lleva una forma impresa de morir. Y la síntesis si prefieres ver las piezas ensambladas en lugar del número derivado.

Si eso fue mucho

No tiene que decidir nada hoy. Nada en esta página le pide que lo crea: las pruebas decisivas están redactadas y fechadas, y no se han realizado. Cuando se realicen, el resultado se publicará aquí sea cual sea, incluido el que acabe con la teoría. Observar es una posición real, y no cuesta nada. El panel de falsación es donde aterriza el veredicto, y estado de las afirmaciones dice con claridad qué se afirma hoy y qué no.

¿Un error de traducción? Infórmalo directamente:

lee en voz alta · resalta sobre la marcha · ir a cualquier sección