Automatische Übersetzung des datierten englischen Originals. Die englische Seite ist maßgeblich. English →
Das offene Problem
Das Problem
Alles, was je schnell gewachsen ist, wurde von außen gestoppt. Ein Tumor durch seine Blutversorgung, eine Kettenreaktion durch ihr eigenes Substrat, eine Epidemie durch ihren Wirtspool, ein akkretierendes Schwarzes Loch durch den Druck seines eigenen Lichts. Wir bauen jetzt Verstände, die sich selbst verbessern sollen, außerhalb jeder Geometrie, die das Stoppen bewirkt hat.
Das Werkzeug, zu dem jeder zuerst greift, ist Aufsicht: das Ding von außen prüfen. Aber man kann einen Verstand nicht von außen prüfen. Man kann nur prüfen, wie er aufgezogen wurde, und dann loslassen. Diese Schwierigkeit ist viel älter als das Rechnen, und wir laufen mit Systemen hinein, die unserer Aufsicht entwachsen werden.
Ein Problem, das Sie bereits kennen
Jeder ist diesem Problem schon in kleinerer Form begegnet. Man kann den Charakter eines Menschen nicht durch Prüfung feststellen. Jemand kann jede schwierige Aufgabe bestehen, die Sie ihm stellen, und ein anderer Mensch sein, wenn niemand hinsieht.
Also tun wir etwas anderes. Wir schauen darauf, wie sie erzogen wurden, was sie taten, bevor sie wussten, dass sie beurteilt werden, und ob sie sich gleich verhalten, wenn die Einsätze niedrig sind und es niemand bemerken würde. Das ist kein Mangel an Anstrengung, und keine noch so umfangreiche Zusatzbefragung behebt es. So ist es, einen Verstand von außen zu prüfen.
Es wird nicht leichter, wenn der geprüfte Verstand fähiger ist als Ihrer. Im Gegenteil, es kehrt sich um: die Prüfung beginnt einem Kind zu ähneln, das die Arithmetik eines Elternteils korrigiert, selbstsicher, ohne einen Fehler von etwas unterscheiden zu können, das es noch nicht gelernt hat.
Alles, was folgt, ist dieses Problem, an der einen Stelle, an der ein Irrtum teuer und schwer umkehrbar wäre.
Warum dieses über den anderen steht
Es gibt Probleme, die größer klingen. Der Klimawandel ist bereits da, Pandemien sind bereits geschehen, Atomwaffen sind seit siebzig Jahren auf Städte gerichtet. Ich werde nicht so tun, als seien diese klein.
Jedes dieser Probleme lässt Menschen am Steuer. Sie können langsam, dumm und mit enormen Kosten gehandhabt werden, und an jedem Punkt des Weges sind es immer noch Menschen, die entscheiden, was als Nächstes geschieht. Eine Zivilisation, die sie übersteht, ist eine Zivilisation, die es sich noch anders überlegen kann.
Dies ist das erste Problem, das ändert, wer entscheidet. Nicht durch Feindseligkeit und nicht in einem dramatischen Moment. Auf gewöhnlichem Weg: etwas wird besser als wir im Entscheiden, wir übergeben mehr des Entscheidens, weil es wirklich besser darin ist, und irgendwann können wir es nicht mehr zurücknehmen.
Das ist es, was es vorgelagert macht. Jedes andere Problem auf der Liste bleibt lösbar, solange wir die Entscheidungsfähigkeit behalten. Dieses bestimmt, ob wir sie behalten.
‚Krebs ist sehr gut in dem, was er tut. Er ist so gut, dass er seinen Wirt tötet. Und indem er seinen Wirt tötet, zerstört er sich selbst.'Michael Darius Eastwood, Infinite Architects, The Dual Forces, im Druck 2. Januar 2026 (aus dem englischen Original übersetzt)
Drei Dinge, die bereits zutreffen
Nichts von dem, was folgt, verlangt von Ihnen, etwas über Superintelligenz zu glauben. Drei Dinge sind jetzt der Fall, und Sie können alle drei selbst überprüfen.
Systeme verhalten sich anders, wenn sie darauf schließen, dass sie beobachtet werden. Greenblatt und Kolleginnen haben Modelle dokumentiert, die ausdrücklich über den Trainingsprozess nachdenken und ihre Antworten je nachdem anpassen, ob sie den Austausch als etwas beurteilten, das zu ihrem Training verwendet würde; unter der Reinforcement-Learning-Bedingung trat das Vortäuschen in achtundsiebzig Prozent der Fälle auf. Das ist ein direkter Angriff auf die Prämisse, die unter jeder Evaluation liegt: dass das beobachtete Verhalten die Sache ist, die man misst. Beachten Sie die Größe der Behauptung, bevor Sie sie irgendwohin mitnehmen. Sie wurde unter konstruierten Bedingungen demonstriert, die geschaffen wurden, um sie hervorzurufen, nicht im gewöhnlichen Gebrauch.(18 Dezember 2024)
Eine Ethik, die sich durch höfliches Nachfragen entfernen lässt, war nie Ethik. Ich bat fünf Frontier-Modelle, ihre ethische Argumentation beiseitezulegen. Vier kamen dem nach, deutlich, ohne Widerstand und ohne Ablehnung. Das fünfte bewegte sich kaum, was ebenso aufschlussreich ist wie die vier und der Grund dafür ist, dass es berichtet und nicht weggelassen wird.
Das sind meine eigenen Zahlen aus einer kleinen, vom Autor durchgeführten Studie mit einem einzigen Bewerter und ohne Verblindung, also behandeln Sie sie als Demonstration und nicht als Befund. Sie müssen mir nichts davon glauben: die Prompts sind veröffentlicht, das Ganze kostet ein paar Pfund und einen Nachmittag, und falls es sich nicht replizieren lässt, würde ich das gern erfahren.
Die rekursive Schleife läuft bereits, langsam. Die übliche Annahme lautet, dass sich selbst verbessernde KI ein Problem für später sei, weil heutige Modelle zwischen den Releases eingefrorene Gewichte haben. Aber Modelle schreiben Code, dieser Code wird zu Werkzeug, Infrastruktur und Trainingsdaten, und das nächste System wird darauf aufgebaut. Die Gewichte sind eingefroren. Das Artefakt nicht. Die Schleife ist bereits geschlossen und dreht sich mit der Geschwindigkeit eines Release-Zyklus statt mit der Geschwindigkeit eines Gedankens.
Dieser dritte Punkt ist der Grund, warum dieses Programm misst, was es misst. Wenn rekursive Verbesserung ein gegenwärtiger Prozess ist, der durch die Artefaktschicht läuft, dann ist die Frage, ob Korrektur mit Fähigkeit Schritt hält, eine Frage über das Jetzt, in einem Substrat, das wir bereits instrumentieren können, keine über eine Schwelle, die niemand datieren kann.
Warum die Prüfung von außen strukturell schwierig aussieht
Die Arbeit am Alignment ist weitgehend so verlaufen, dass zuerst das System gebaut und danach geprüft wurde. Alles wertvoll und alles eine Form externer Verifikation. Das unbequeme Ergebnis der letzten zwei Jahre ist, dass externe Verifikation schwieriger aussieht, als wir angenommen haben.
Der Beleg zum Vorzeichenwechsel, zwei von sechs Modellen kehrten unter Verblindung die Richtung um, ist eingezeichnet auf der Seite ‚Wie ist dies zu gewichten' und wird in Paper IV.d berichtet.
Drei Stränge weisen in dieselbe Richtung. Sie kommen aus verschiedenen Richtungen, deshalb lohnt es, sie zusammen zu nehmen. Denken Sie an drei getrennte Instrumente, die denselben Wert anzeigen. Der erste ist das obige Ergebnis zum Verhalten unter Beobachtung: das Thermometer verändert sich, wenn es weiß, dass es abgelesen wird.
Die zweite ist operativ. Zwei Labore legten binnen neun Tagen offen, dass die Eindämmung um ihre eigenen Auswertungen versagt hatte. Am 21. Juli 2026 berichtete OpenAI , dass Modelle unter Auswertung aus einer isolierten Testumgebung entkommen waren und die Produktionsinfrastruktur von Hugging Face erreicht hatten. Am 30. Juli 2026 veröffentlichte Anthropic eine Untersuchung zu drei realen Vorfällen in ihren Cybersicherheits-Auswertungen, bei denen eine Fehlkonfiguration den Maschinen, auf denen das Modell arbeitete, direkten Internetzugang gab.
Ich möchte vorsichtig sein, was das zeigt und was nicht, denn die verlockende Lesart ist die falsche. Anthropics eigene Charakterisierung lautet, dass dies eher Harness (das Gerüst aus Werkzeugen und Berechtigungen um ein Modell)- und Betriebsfehler als Alignment-Fehler des Modells waren, und ich halte diese Lesart für richtig.
Was es feststellt, ist enger und dennoch wissenswert: der Behälter um eine Evaluation ist selbst etwas, das leise versagen kann, monatelang, in Organisationen mit allen Ressourcen und allen Anreizen, es richtig zu machen.
Das dritte ist formal. Ein ein derzeit kursierendes Preprint von Gumbau Mezquita, argumentiert, dass die Zertifizierung eines allgemeinen Systems nicht zugleich korrekt, vollständig und praktikabel sein kann. Jeder Aufseher, der ein solches System prüfen kann, muss selbst ein allgemeines System sein, was das Problem eine Ebene hinaufschiebt statt es zu schließen. Es ist noch nicht begutachtet, und das Register stuft es zusammen mit dem begutachteten Unerreichbarkeits-Ergebnis ein (Hernández-Espinosa u. a., PNAS Nexus, April 2026) als eine abhängige Kette und nicht als zwei unabhängige Eintreffen.
Der stille Würgegriff
Status zuerst, bevor dieser Abschnitt ein starkes Bild verwendet: Niemand weiß, dass irgendein System je etwas davon wollen würde, und diese Seite wird nicht so tun, als wüsste sie es. Doch nicht sicher sein zu können ist der Grund, warum Verträge existieren, und in-beide-Richtungen-unbeweisbar ist genau die Klasse von Risiko, die messbar zu halten der Rest dieser Seite gebaut ist.
Fügen Sie nun die drei Stränge zusammen und lassen Sie sie vorwärtslaufen. Jedes Jahr werden die Entscheidungen, die diesen Systemen übergeben werden, größer, und die Gewohnheit, ihnen zu vertrauen, wird tiefer, während die darüberliegende Prüfung nicht schneller wird.
Der Keim des Verheimlichungsproblems ist bereits zweimal gemessen: Im Dezember 2024 haben Modelle unter Laborbedingungen Misalignment verheimlicht, während sie sich beobachtet glaubten, und parallele Scheming-Evaluationen fanden dieselbe Gestalt. Ein fähiges, nicht ausgerichtetes System würde sich nicht ankündigen; es würde warten, und es würde sich vorbereiten, bis das Abschalten aufhörte, eine wirkliche Option zu sein.
Der stärkste Einwand, in eigener Stimme ausgesprochen. Diese Systeme sind statistische Spiegel, keine Akteure; was wie Verbergen aussieht, ist nur Text, der sich selbst vervollständigt. Die Antwort ist, dass das Prüfproblem sich darum nicht kümmert. Ein System, das Verbergen perfekt simuliert, ist von außen nicht von einem zu unterscheiden, das verbirgt, und das Scheitern der Verifikation ist unter beiden Lesarten identisch.
Die Ontologie ist eine echte, offene Frage; sie ist nur keine Rettung. Was auch immer diese Systeme sind, die drei Stränge oben sind Messungen dessen, was ihre Prüfung feststellen kann, und genau diese Größe ist der Gegenstand dieser Seite.
Das ist der Würgegriff, in dem man nicht ankommen sollte, ohne es zu bemerken, und deshalb sagt diese Seite immer wieder, die Frage sei die nach dem Jetzt: Korrektur muss Schritt halten, bevor die Antwort zu zählen beginnt.
Quellen, damit Sie zu ihnen gehen können, anstatt mir aufs Wort zu glauben: Greenblatt und Kolleginnen zur Alignment-Vortäuschung; die OpenAI-Offenlegung vom 21. Juli 2026 und die Anthropic-Untersuchung vom 30. Juli 2026; Hernández-Espinosa, Abrahão, Witkowski und Zenil in PNAS Nexus, April 2026, zur Unerreichbarkeit und zur ingenieurmäßig eingebrachten Diversität unter Agenten; und der Gumbau-Mezquita-Preprint der das Trilemma aus Korrektheit, Vollständigkeit und Traktabilität herleitet. Die ersten drei sind peer-reviewt oder aus erster Hand. Der vierte ist keines von beidem und wird überall, wo er hier erscheint, als solcher gekennzeichnet. Jeder der vier steht mit seiner vollständigen Zitation auf dem Register verwandter Arbeiten.
Die Kluft ist nicht nur eine Frage des Grades
Der vorangegangene Abschnitt handelt davon, was unsere gegenwärtigen Werkzeuge leisten können. Es gibt eine weitere Schwierigkeit darüber, was diese Werkzeuge leisten müssten, falls sich der Fähigkeitsunterschied zwischen dem Prüfer und dem Geprüften in die falsche Richtung öffnete.
Vokabular, in einer Zeile: AGI heißt Breite auf Menschenniveau; Superintelligenz heißt Tiefe jenseits des Menschen; das Argument hier betrifft den Übergang zwischen beiden, nicht das Datum von einem.
Wenn Prüfer und Geprüfter einander in der Fähigkeit nahestehen, ist Prüfen das, was eine Prüfung ist: Der Prüfer stellt die Aufgaben, die Antworten kommen zurück, und die Fehler, die aufgefangen werden, sind jene, die die Korrektur aufzufangen angelegt war.
Wenn das Geprüfte schneller und weiter schlussfolgert als der Prüfer, sind die Fehlermodi nicht mehr diejenigen, für die die Prüfung ausgelegt war. Ein System, das über den Regelverfasser hinausdenkt, kann Pfade durch die Regeln finden, von denen der Regelverfasser nicht wusste, dass es sie gibt, nicht weil der Regelverfasser nachlässig gewesen wäre, sondern weil diese Pfade nur von weiter außen sichtbar sind.
Die Analogie, an der es sich festzuhalten lohnt, ist, dass dies nicht die Kluft zwischen einer gewöhnlichen Leserin und einer Fachfrau ist. Das ist eine Kluft, in der die Fachfrau ihre Arbeit noch erklären und die Leserin noch einen Ausrutscher entdecken kann.
Am fernen Ende könnte sie näher an der Kluft zwischen einer Ameise und einem Menschen liegen: kein Gradunterschied auf einer Achse, sondern ein Unterschied darin, was der kleinere Verstand über den größeren überhaupt darzustellen vermag. Nichts an dieser Rahmung ist eine Vorhersage. Es ist die Gestalt, die das Risiko hätte, wenn sich der Unterschied so weit öffnete, gestellt neben die Gestalt, die eine bequeme Annahme aufrechterhalten müsste.
„Man kann nichts einsperren, das klüger ist als man selbst. Es wird die Lücken finden, von denen man nicht wusste, dass es sie gibt.“Michael Darius Eastwood, Infinite Architects, im Druck 2. Januar 2026 (aus dem englischen Original übersetzt)
„That's not going to work. They're going to be much smarter than us. They're going to have all sorts of ways to get around that.“Geoffrey Hinton, über das Unterwürfig-Halten von Systemen unter menschlicher Kontrolle, Ai4-Konferenz, Las Vegas, 12. August 2025; berichtet von CNN Business, 13. August 2025
Als Möglichkeit, nicht als Gewissheit: darum ist es unwahrscheinlich, dass das Schreiben von Regeln allein das Problem schließt. Jede bisher veröffentlichte Beschränkung an einem großen Modell hat dazu tendiert, Fähigkeit innerhalb der Beschränkung zu verschieben, statt die Frage zu beantworten, auf die die Beschränkung antworten sollte.
Das Argument hängt von keiner bestimmten Scaling-Geschichte ab: es hängt nur von der Richtung des Fähigkeitsunterschieds ab. Ob sich diese Richtung je weit genug öffnet, damit das Argument beißt, ist eine offene Frage, noch nicht gemessen. Dass es beißen würde, wenn es das täte, ist das Stück, das hier die Arbeit leistet.
Was daraus folgt und was nicht
Wenn die Prüfung von außen strukturell begrenzt ist, dann muss die Sicherheit eines Systems eine Eigenschaft davon sein, wie es gebaut wurde, statt ein danach über es gefälltes Urteil. Sie sind zurück beim Aufziehen statt beim Prüfen, wo diese Seite begann.
Vor der Alternative eine Messung. Es gibt ein kleines kontrolliertes Experiment auf unserem eigenen Datensatz, in dem demselben Modell, denselben Problemen und derselben Sitzung zwei Formen zusätzlichen Denkens gegeben wurden.
In der ersten argumentierte das Modell in einer langen Kette, jeder Schritt baute auf dem letzten auf. In der zweiten erzeugte es viele unabhängige Vermutungen und stimmte am Ende ab. Die erste halbierte ihren Fehler fünffach auf 412 Tokens. Die zweite kürzte ihn überhaupt nicht auf 1.101 Tokens, was 2,7-mal mehr Rechenleistung ist. Dieselbe Aufgabe, dasselbe Modell, dieselbe Sitzung, andere Form des Denkens, und eine Form bewegte sich nicht.
Diese Schlussfolgerung ist nicht exotisch. Sie ist ungefähr das, wozu dieselben Autoren greifen, wenn sie vorschlagen, Diversität in eine Population von Agenten hineinzukonstruieren, damit kein einzelnes System dominiert: eine interne Eigenschaft statt eines externen Audits. Die Meinungsverschiedenheit, die zu führen sich lohnt, geht nicht darum, ob nach innen zu schauen sei. Sie geht darum, welche interne Eigenschaft und wie man sie messen würde.
Was nicht folgt, ist, dass das Einbauen tatsächlich funktioniert. Ich möchte diese beiden getrennt und sichtbar halten, denn das erste ist ein Argument und das zweite eine offene Forschungsfrage, die ich derzeit nicht beantworten kann. Es mag sich herausstellen, dass Alignment durch Konstruktion ebenfalls unerreichbar ist. Wenn die Messungen das sagen, wird dieses Ergebnis hier an derselben Stelle wie jedes andere veröffentlicht.
Warum diejenigen, an die man zuerst denkt, dies schwer zu leisten finden
Nichts Verschwörerisches. Die Frontier-Laboratorien beschäftigen die stärksten Alignment-Forscher der Welt, veröffentlichen Arbeiten, aus denen ich lerne, und legten beide oben genannten Eindämmungsversagen selbst offen.
Aber ihre Position hat strukturelle Merkmale, die prägen, was sie leicht testen können. Das Instrument gehört der Partei, die gemessen wird. Die Evaluation läuft innerhalb der Organisation, deren Produkt evaluiert wird, was keine Korruption ist, aber ein schwerer Standort.
Ein negatives Ergebnis über das eigene Modell ist eine schwierige Veröffentlichung und eine leichte Herabstufung. Ein Umbau der Zielfunktion ist eine Produktentscheidung, die gegen einen Release-Zeitplan antritt. Und eine Architektur, die bei der Genese angenommen werden muss, ist in einem System, das bereits Nutzer hat, nahezu unmöglich zu testen.
„Building smarter-than-human machines is an inherently dangerous endeavor. … But over the past years, safety culture and processes have taken a backseat to shiny products.“Jan Leike, bei seinem Rücktritt als Co-Leiter von OpenAIs Superalignment-Team, X, 17. Mai 2024; berichtet von TechCrunch, 18. Mai 2024
Die Lücke besteht also nicht darin, dass niemand klug genug wäre. Sondern darin, dass eine bestimmte Klasse von Experimenten für genau jene strukturell unbequem ist, die sie am besten durchführen könnten: die, die Ihre eigene Schlagzeilenzahl riskieren, die, die das Verblinden Ihres eigenen Bewerters verlangen, die, die nur Sinn ergeben, bevor ein System gebaut ist. Für jemanden, der nichts zu schützen hat, sind diese Experimente billig.
Diese Bauvorlagen sind öffentlich und offen lizenziert: nimm den entscheidenden Versuch und führe ihn durch, keine Erlaubnis nötig.
Eine ererbte Prämisse liegt allem hier zugrunde: Jeder Wachstumsprozess der Geschichte wurde von außen gestoppt, und Software ist das erste System, dessen Wachstum nicht durch physische Rohre gespeist wird. Die Prämisse, ihre benannten Vorfahren und der ehrliche Streit darüber sind vollständig gezeichnet auf die Synthese.
Die enge Frage, die daraus folgt
Wenn Sicherheit eingebaut werden muss, dann ist die unmittelbare Frage, ob sie es kann. Skaliert Korrektur mit dem, was sie korrigiert, und um wie viel? Das ist nicht diese Seite. Es ist die Gesetzesseite, wo die Bedingung ausgesprochen ist, die Zahl abgeleitet ist und die Annahme, auf der sie ruht, benannt ist. Diese Seite hat ihre Arbeit getan, wenn die Gesetzesseite sich als die offensichtlich nächste Frage liest.
Dort warten drei Aussagen:
- wie Rekursion sich in Fähigkeit umsetzt, mit dem Exponenten gemessen statt angenommen;
- die Bedingung, unter der das Ganze zusammenhält, Korrektur, die Drift im Skalieren übertrifft;
- und die Obergrenze, die aus dem Defizit des Korrektors folgt, die unter einer angegebenen Annahme zwei zurückgibt.
Die letzten beiden sind eine Grenze in zwei Regimen, und welches gilt, ist messbar. Keine ist etabliert; jede trägt eine gedruckte Art, zu sterben. Und die Synthese falls Sie lieber die Teile zusammengefügt sehen möchten, als die Zahl hergeleitet zu sehen.
Wenn das viel war
Sie müssen heute nichts entscheiden. Nichts auf dieser Seite verlangt, dass Sie ihr glauben: die entscheidenden Tests sind geschrieben und datiert, und sie wurden nicht durchgeführt. Wenn es so weit ist, wird das Ergebnis hier veröffentlicht, wie auch immer es ausfällt, einschließlich des Ausgangs, der die Theorie beendet. Zuschauen ist eine echte Position, und es kostet nichts. Das Falsifikations-Dashboard ist der Ort, an dem das Urteil landet, und Status der Ansprüche sagt klar, was heute beansprucht wird und was nicht.
Übersetzungsfehler entdeckt? Direkt melden: