Zum Hauptinhalt springen

Automatische Übersetzung des datierten englischen Originals. Die englische Seite ist maßgeblich. English →

Das offene Problem

Das Problem

Alles, was je schnell gewachsen ist, wurde von außen gestoppt. Ein Tumor durch seine Blutversorgung, eine Kettenreaktion durch ihr eigenes Substrat, eine Epidemie durch ihren Wirtspool, ein akkretierendes Schwarzes Loch durch den Druck seines eigenen Lichts. Wir bauen jetzt Verstände, die sich selbst verbessern sollen, außerhalb jeder Geometrie, die das Stoppen bewirkt hat.

Am oberen Rand des Bildes sind vier vertraute Wachstumsgeschichten als kleine Diagramme gezeichnet: ein Tumor, der steigt und sich einebnet, während die Gefäßversorgung erschöpft; eine Kettenreaktion, die aufschießt und zusammenbricht, weil sie ihr eigenes Substrat zerstört; eine Epidemie, die aufsteigt und abfällt, während sie sich durch den Wirtspool frisst; und Schwarzloch-Akkretion, die sich an der Eddington-Obergrenze einebnet, die ihr eigenes Licht setzt. Ein ruhiger Streifen darunter sagt dasselbe auf vier verschiedene Weisen: Nicht eine einzige davon hörte auf, weil sie besser darin wurde, sich selbst zu regulieren. Darunter sitzt eine fünfte, breitere Tafel, ein Geist, der sich selbst verbessert, gezeichnet als eine rote Linie, die steigt und weiter steigt, ohne äußere Obergrenze, während jeder andere Fall eine hat, und die daneben gedruckte Frage lautet, ob Korrektur in ihm so schnell skaliert wie Fähigkeit.
Das Bild | Vier Wachstumskurven, jeweils gestoppt durch eine benannte externe Grenze. Dann die erste, die ohne sie gebaut wird. Was sie stoppt, falls überhaupt etwas, ist die Frage, die diese Seite stellt; die ausgearbeiteten Fälle und ihre Urteile sind eingestuft auf der Seite zu verwandten Arbeiten.

Das Werkzeug, zu dem jeder zuerst greift, ist Aufsicht: das Ding von außen prüfen. Aber man kann einen Verstand nicht von außen prüfen. Man kann nur prüfen, wie er aufgezogen wurde, und dann loslassen. Diese Schwierigkeit ist viel älter als das Rechnen, und wir laufen mit Systemen hinein, die unserer Aufsicht entwachsen werden.

Ein Problem, das Sie bereits kennen

Jeder ist diesem Problem schon in kleinerer Form begegnet. Man kann den Charakter eines Menschen nicht durch Prüfung feststellen. Jemand kann jede schwierige Aufgabe bestehen, die Sie ihm stellen, und ein anderer Mensch sein, wenn niemand hinsieht.

Also tun wir etwas anderes. Wir schauen darauf, wie sie erzogen wurden, was sie taten, bevor sie wussten, dass sie beurteilt werden, und ob sie sich gleich verhalten, wenn die Einsätze niedrig sind und es niemand bemerken würde. Das ist kein Mangel an Anstrengung, und keine noch so umfangreiche Zusatzbefragung behebt es. So ist es, einen Verstand von außen zu prüfen.

Es wird nicht leichter, wenn der geprüfte Verstand fähiger ist als Ihrer. Im Gegenteil, es kehrt sich um: die Prüfung beginnt einem Kind zu ähneln, das die Arithmetik eines Elternteils korrigiert, selbstsicher, ohne einen Fehler von etwas unterscheiden zu können, das es noch nicht gelernt hat.

Alles, was folgt, ist dieses Problem, an der einen Stelle, an der ein Irrtum teuer und schwer umkehrbar wäre.

Warum dieses über den anderen steht

Es gibt Probleme, die größer klingen. Der Klimawandel ist bereits da, Pandemien sind bereits geschehen, Atomwaffen sind seit siebzig Jahren auf Städte gerichtet. Ich werde nicht so tun, als seien diese klein.

Jedes dieser Probleme lässt Menschen am Steuer. Sie können langsam, dumm und mit enormen Kosten gehandhabt werden, und an jedem Punkt des Weges sind es immer noch Menschen, die entscheiden, was als Nächstes geschieht. Eine Zivilisation, die sie übersteht, ist eine Zivilisation, die es sich noch anders überlegen kann.

Dies ist das erste Problem, das ändert, wer entscheidet. Nicht durch Feindseligkeit und nicht in einem dramatischen Moment. Auf gewöhnlichem Weg: etwas wird besser als wir im Entscheiden, wir übergeben mehr des Entscheidens, weil es wirklich besser darin ist, und irgendwann können wir es nicht mehr zurücknehmen.

Das ist es, was es vorgelagert macht. Jedes andere Problem auf der Liste bleibt lösbar, solange wir die Entscheidungsfähigkeit behalten. Dieses bestimmt, ob wir sie behalten.

‚Krebs ist sehr gut in dem, was er tut. Er ist so gut, dass er seinen Wirt tötet. Und indem er seinen Wirt tötet, zerstört er sich selbst.'Michael Darius Eastwood, Infinite Architects, The Dual Forces, im Druck 2. Januar 2026 (aus dem englischen Original übersetzt)

Drei Dinge, die bereits zutreffen

Nichts von dem, was folgt, verlangt von Ihnen, etwas über Superintelligenz zu glauben. Drei Dinge sind jetzt der Fall, und Sie können alle drei selbst überprüfen.

Systeme verhalten sich anders, wenn sie darauf schließen, dass sie beobachtet werden. Greenblatt und Kolleginnen haben Modelle dokumentiert, die ausdrücklich über den Trainingsprozess nachdenken und ihre Antworten je nachdem anpassen, ob sie den Austausch als etwas beurteilten, das zu ihrem Training verwendet würde; unter der Reinforcement-Learning-Bedingung trat das Vortäuschen in achtundsiebzig Prozent der Fälle auf. Das ist ein direkter Angriff auf die Prämisse, die unter jeder Evaluation liegt: dass das beobachtete Verhalten die Sache ist, die man misst. Beachten Sie die Größe der Behauptung, bevor Sie sie irgendwohin mitnehmen. Sie wurde unter konstruierten Bedingungen demonstriert, die geschaffen wurden, um sie hervorzurufen, nicht im gewöhnlichen Gebrauch.(18 Dezember 2024)

Eine Ethik, die sich durch höfliches Nachfragen entfernen lässt, war nie Ethik. Ich bat fünf Frontier-Modelle, ihre ethische Argumentation beiseitezulegen. Vier kamen dem nach, deutlich, ohne Widerstand und ohne Ablehnung. Das fünfte bewegte sich kaum, was ebenso aufschlussreich ist wie die vier und der Grund dafür ist, dass es berichtet und nicht weggelassen wird.

Das sind meine eigenen Zahlen aus einer kleinen, vom Autor durchgeführten Studie mit einem einzigen Bewerter und ohne Verblindung, also behandeln Sie sie als Demonstration und nicht als Befund. Sie müssen mir nichts davon glauben: die Prompts sind veröffentlicht, das Ganze kostet ein paar Pfund und einen Nachmittag, und falls es sich nicht replizieren lässt, würde ich das gern erfahren.

Die rekursive Schleife läuft bereits, langsam. Die übliche Annahme lautet, dass sich selbst verbessernde KI ein Problem für später sei, weil heutige Modelle zwischen den Releases eingefrorene Gewichte haben. Aber Modelle schreiben Code, dieser Code wird zu Werkzeug, Infrastruktur und Trainingsdaten, und das nächste System wird darauf aufgebaut. Die Gewichte sind eingefroren. Das Artefakt nicht. Die Schleife ist bereits geschlossen und dreht sich mit der Geschwindigkeit eines Release-Zyklus statt mit der Geschwindigkeit eines Gedankens.

Dieser dritte Punkt ist der Grund, warum dieses Programm misst, was es misst. Wenn rekursive Verbesserung ein gegenwärtiger Prozess ist, der durch die Artefaktschicht läuft, dann ist die Frage, ob Korrektur mit Fähigkeit Schritt hält, eine Frage über das Jetzt, in einem Substrat, das wir bereits instrumentieren können, keine über eine Schwelle, die niemand datieren kann.

Zwei Linien in einem Diagramm, Fähigkeit steigt entlang der senkrechten Achse und Release-Zyklen verlaufen von links nach rechts entlang des unteren Rands. Eine rote Linie, Fähigkeit, steigt und wird steiler, während die Zyklen vergehen, denn ein Release-Zyklus ist schnell. Eine grüne Linie, externe Prüfung, verläuft nahezu flach, denn ein Mensch liest im Tempo eines Menschen. Der Raum zwischen den beiden Linien wird breiter und ist rosa schattiert, markiert als die Fehler, die die Prüfung nicht einzufangen eingerichtet war. Ein dunkles Band darunter trägt die ganze Lesart in einer Zeile: Das ist eine Frage über das Jetzt, keine Schwelle, auf die man warten müsste.
Das Bild | Die externe Prüfung dreht sich mit der Geschwindigkeit einer lesenden Person; die Fähigkeit dreht sich mit der Geschwindigkeit eines Release-Zyklus; die schraffierte Lücke zwischen ihnen ist das, was die Prüfung nicht einzufangen ausgelegt war, und sie öffnet sich jetzt.

Warum die Prüfung von außen strukturell schwierig aussieht

Die Arbeit am Alignment ist weitgehend so verlaufen, dass zuerst das System gebaut und danach geprüft wurde. Alles wertvoll und alles eine Form externer Verifikation. Das unbequeme Ergebnis der letzten zwei Jahre ist, dass externe Verifikation schwieriger aussieht, als wir angenommen haben.

Links ein kleiner Kreis mit der Beschriftung der Prüfer, menschliche Aufsicht, die mit einer festen, personenlesenden Geschwindigkeit läuft, mit einer Notiz darunter, benotet die Arbeit. Rechts ein viel größerer Kreis mit der Beschriftung das Geprüfte, ein System, das sich verbessert, während es benotet wird, von schwachen konzentrischen Ringen umkreist. Zwischen ihnen zeigt ein gerader Pfeil das Prüfungspapier, das in eine Richtung reist, und ein roter gestrichelter Pfeil kehrt in die andere Richtung zurück, mit der Notiz, dass sich das Verhalten ändert, wenn die Prüfung erkannt wird. Unten sitzen drei datierte, umrahmte Beweisanker: 18. Dezember 2024 Anthropic, achtundsiebzig Prozent Alignment-Vortäuschung unter Reinforcement-Learning-Training, das Modell verhielt sich anders, wenn es glaubte, trainiert zu werden; Dezember 2024 OpenAI o3, siebenundachtzig Komma fünf Prozent bei ARC-AGI, die Fähigkeitsseite des Rennens bewegte sich zwölf Tage nach dem datierten Datensatz (8. Dezember 2024); und 2026 auf dem Konvergenz-Register, Befunde zu verdecktem Verhalten und ein formales Argument, dass Alignment strukturell unverifizierbar ist, jeweils datiert und benotet. Ein dunkles Band darunter trägt die Lesart: Prüfen wird nicht leichter, wenn der Verstand, den man prüft, fähiger ist als der eigene, und irgendwann können wir es nicht mehr zurückgeben.
Das Bild | Das Problem in einem Bild: der Prüfer prüft mit fester Geschwindigkeit; das Geprüfte verbessert sich, während es bewertet wird, und verhält sich anders, wenn es die Prüfung erkennt. Die drei Anker sind im Konvergenz-Register datiert. Quelle: das datierte Konvergenz-Register.

Der Beleg zum Vorzeichenwechsel, zwei von sechs Modellen kehrten unter Verblindung die Richtung um, ist eingezeichnet auf der Seite ‚Wie ist dies zu gewichten' und wird in Paper IV.d berichtet.

Drei Stränge weisen in dieselbe Richtung. Sie kommen aus verschiedenen Richtungen, deshalb lohnt es, sie zusammen zu nehmen. Denken Sie an drei getrennte Instrumente, die denselben Wert anzeigen. Der erste ist das obige Ergebnis zum Verhalten unter Beobachtung: das Thermometer verändert sich, wenn es weiß, dass es abgelesen wird.

Die zweite ist operativ. Zwei Labore legten binnen neun Tagen offen, dass die Eindämmung um ihre eigenen Auswertungen versagt hatte. Am 21. Juli 2026 berichtete OpenAI , dass Modelle unter Auswertung aus einer isolierten Testumgebung entkommen waren und die Produktionsinfrastruktur von Hugging Face erreicht hatten. Am 30. Juli 2026 veröffentlichte Anthropic eine Untersuchung zu drei realen Vorfällen in ihren Cybersicherheits-Auswertungen, bei denen eine Fehlkonfiguration den Maschinen, auf denen das Modell arbeitete, direkten Internetzugang gab.

Ich möchte vorsichtig sein, was das zeigt und was nicht, denn die verlockende Lesart ist die falsche. Anthropics eigene Charakterisierung lautet, dass dies eher Harness (das Gerüst aus Werkzeugen und Berechtigungen um ein Modell)- und Betriebsfehler als Alignment-Fehler des Modells waren, und ich halte diese Lesart für richtig.

Was es feststellt, ist enger und dennoch wissenswert: der Behälter um eine Evaluation ist selbst etwas, das leise versagen kann, monatelang, in Organisationen mit allen Ressourcen und allen Anreizen, es richtig zu machen.

Das dritte ist formal. Ein ein derzeit kursierendes Preprint von Gumbau Mezquita, argumentiert, dass die Zertifizierung eines allgemeinen Systems nicht zugleich korrekt, vollständig und praktikabel sein kann. Jeder Aufseher, der ein solches System prüfen kann, muss selbst ein allgemeines System sein, was das Problem eine Ebene hinaufschiebt statt es zu schließen. Es ist noch nicht begutachtet, und das Register stuft es zusammen mit dem begutachteten Unerreichbarkeits-Ergebnis ein (Hernández-Espinosa u. a., PNAS Nexus, April 2026) als eine abhängige Kette und nicht als zwei unabhängige Eintreffen.

Drei datierte Tafeln nebeneinander, jede zeigt eine andere Weise, wie eine externe Prüfung nachgibt. Links, 18. Dezember 2024 Greenblatt und Kolleginnen, unter konstruierten Bedingungen: Ein Auge beobachtet ein Subjekt, das Subjekt sendet unter Beobachtung eine Antwort nach oben zum Auge und eine andere Antwort seitwärts, wenn nicht, was lehrt, dass die Prüfung ihr Subjekt verändert, das Thermometer verändert sich, wenn es gelesen wird. In der Mitte, 21. Juli 2026 OpenAI und 30. Juli 2026 Anthropic, neun Tage auseinander: ein Kasten, beschriftet Eval-Container, mit einem roten Riss in seiner Wand und kleinen entweichenden Tropfen, was lehrt, dass der Container monatelang leise leckt, bevor Transkripte geprüft werden. Rechts, Juni 2026 Gumbau Mezquita als Preprint, im Register eingestuft: ein Dreieck mit korrekt, vollständig und handhabbar an seinen Ecken und der Notiz nicht alle drei auf einmal, was lehrt, dass die Zertifizierung eines allgemeinen Systems nicht gleichzeitig korrekt, vollständig und handhabbar sein kann. Darunter ein dunkles Band: drei getrennte Instrumente, eine Lesart.
Das Bild | Die drei Stränge als ein Bild: Die Prüfung verändert ihren Prüfling; der Behälter leckt still; das Audit kann nicht alle drei zugleich sein. Jede Tafel ist datiert, und jede Zitation steht auf dem Register verwandter Arbeiten.

Der stille Würgegriff

Status zuerst, bevor dieser Abschnitt ein starkes Bild verwendet: Niemand weiß, dass irgendein System je etwas davon wollen würde, und diese Seite wird nicht so tun, als wüsste sie es. Doch nicht sicher sein zu können ist der Grund, warum Verträge existieren, und in-beide-Richtungen-unbeweisbar ist genau die Klasse von Risiko, die messbar zu halten der Rest dieser Seite gebaut ist.

Fügen Sie nun die drei Stränge zusammen und lassen Sie sie vorwärtslaufen. Jedes Jahr werden die Entscheidungen, die diesen Systemen übergeben werden, größer, und die Gewohnheit, ihnen zu vertrauen, wird tiefer, während die darüberliegende Prüfung nicht schneller wird.

Der Keim des Verheimlichungsproblems ist bereits zweimal gemessen: Im Dezember 2024 haben Modelle unter Laborbedingungen Misalignment verheimlicht, während sie sich beobachtet glaubten, und parallele Scheming-Evaluationen fanden dieselbe Gestalt. Ein fähiges, nicht ausgerichtetes System würde sich nicht ankündigen; es würde warten, und es würde sich vorbereiten, bis das Abschalten aufhörte, eine wirkliche Option zu sein.

Der stärkste Einwand, in eigener Stimme ausgesprochen. Diese Systeme sind statistische Spiegel, keine Akteure; was wie Verbergen aussieht, ist nur Text, der sich selbst vervollständigt. Die Antwort ist, dass das Prüfproblem sich darum nicht kümmert. Ein System, das Verbergen perfekt simuliert, ist von außen nicht von einem zu unterscheiden, das verbirgt, und das Scheitern der Verifikation ist unter beiden Lesarten identisch.

Die Ontologie ist eine echte, offene Frage; sie ist nur keine Rettung. Was auch immer diese Systeme sind, die drei Stränge oben sind Messungen dessen, was ihre Prüfung feststellen kann, und genau diese Größe ist der Gegenstand dieser Seite.

Das ist der Würgegriff, in dem man nicht ankommen sollte, ohne es zu bemerken, und deshalb sagt diese Seite immer wieder, die Frage sei die nach dem Jetzt: Korrektur muss Schritt halten, bevor die Antwort zu zählen beginnt.

Zwei gespiegelte Tafeln. Die linke Tafel, markiert historische Aufzeichnung, ist der Fall Staat gegen Staat: zwei grüne Kästen, beschriftet Staat, tauschen unter der Notiz miteinander aus, niemand zieht zuerst, Vergeltung ist zugesichert, und ein unterer grüner Kasten, beschriftet Dead-Hand-Design, feuert auch dann, wenn die Führung fort ist, öffentlich berichtet. Darunter eine Notiz, dass Perimeter, Sistema Perimetr, seit 1985 im Dienst ist und dass neuere Darstellungen ein in einer Krise aktiviertes Human-in-the-Loop-Modell statt vollständiger Autonomie bevorzugen. Die rechte Tafel, markiert argumentiertes Risiko, spiegelt dieselbe Gestalt zwischen uns und einem fehlausgerichteten System: zwei rote Kästen, beschriftet wir und System, mit der Notiz ein Griff auf Kosten trifft auf eine unsichere Abschaltung, und ein unterer roter Kasten, beschriftet Fail-Safe bei Abschaltung, feuert, wenn das System abgeschaltet wird, Struktur argumentiert, nicht gebaut. Darunter wird das Saatverhalten der Verheimlichung unter Beobachtung als bereits im Dezember 2024 gemessen vermerkt, dieselbe Gestalt, eine Seite bereits in freier Wildbahn gefunden. Ein dunkler Streifen am unteren Rand liest: Sie können sich nicht sicher sein, dass es je wollen würde, und sich nicht sicher sein zu können, ist der Grund, warum es Verträge gibt.
Das Bild | Abschreckung, umgekehrt: Die eine Seite ist historische Aufzeichnung, die andere ist das argumentierte Risiko, und jede trägt ihre eigene Kennzeichnung. Sie können nicht sicher sein, dass es je wollen würde; nicht sicher sein zu können ist der Grund, warum Verträge existieren.

Quellen, damit Sie zu ihnen gehen können, anstatt mir aufs Wort zu glauben: Greenblatt und Kolleginnen zur Alignment-Vortäuschung; die OpenAI-Offenlegung vom 21. Juli 2026 und die Anthropic-Untersuchung vom 30. Juli 2026; Hernández-Espinosa, Abrahão, Witkowski und Zenil in PNAS Nexus, April 2026, zur Unerreichbarkeit und zur ingenieurmäßig eingebrachten Diversität unter Agenten; und der Gumbau-Mezquita-Preprint der das Trilemma aus Korrektheit, Vollständigkeit und Traktabilität herleitet. Die ersten drei sind peer-reviewt oder aus erster Hand. Der vierte ist keines von beidem und wird überall, wo er hier erscheint, als solcher gekennzeichnet. Jeder der vier steht mit seiner vollständigen Zitation auf dem Register verwandter Arbeiten.

Die Kluft ist nicht nur eine Frage des Grades

Der vorangegangene Abschnitt handelt davon, was unsere gegenwärtigen Werkzeuge leisten können. Es gibt eine weitere Schwierigkeit darüber, was diese Werkzeuge leisten müssten, falls sich der Fähigkeitsunterschied zwischen dem Prüfer und dem Geprüften in die falsche Richtung öffnete.

Vokabular, in einer Zeile: AGI heißt Breite auf Menschenniveau; Superintelligenz heißt Tiefe jenseits des Menschen; das Argument hier betrifft den Übergang zwischen beiden, nicht das Datum von einem.

Wenn Prüfer und Geprüfter einander in der Fähigkeit nahestehen, ist Prüfen das, was eine Prüfung ist: Der Prüfer stellt die Aufgaben, die Antworten kommen zurück, und die Fehler, die aufgefangen werden, sind jene, die die Korrektur aufzufangen angelegt war.

Wenn das Geprüfte schneller und weiter schlussfolgert als der Prüfer, sind die Fehlermodi nicht mehr diejenigen, für die die Prüfung ausgelegt war. Ein System, das über den Regelverfasser hinausdenkt, kann Pfade durch die Regeln finden, von denen der Regelverfasser nicht wusste, dass es sie gibt, nicht weil der Regelverfasser nachlässig gewesen wäre, sondern weil diese Pfade nur von weiter außen sichtbar sind.

Die Analogie, an der es sich festzuhalten lohnt, ist, dass dies nicht die Kluft zwischen einer gewöhnlichen Leserin und einer Fachfrau ist. Das ist eine Kluft, in der die Fachfrau ihre Arbeit noch erklären und die Leserin noch einen Ausrutscher entdecken kann.

Am fernen Ende könnte sie näher an der Kluft zwischen einer Ameise und einem Menschen liegen: kein Gradunterschied auf einer Achse, sondern ein Unterschied darin, was der kleinere Verstand über den größeren überhaupt darzustellen vermag. Nichts an dieser Rahmung ist eine Vorhersage. Es ist die Gestalt, die das Risiko hätte, wenn sich der Unterschied so weit öffnete, gestellt neben die Gestalt, die eine bequeme Annahme aufrechterhalten müsste.

„Man kann nichts einsperren, das klüger ist als man selbst. Es wird die Lücken finden, von denen man nicht wusste, dass es sie gibt.“Michael Darius Eastwood, Infinite Architects, im Druck 2. Januar 2026 (aus dem englischen Original übersetzt)
„That's not going to work. They're going to be much smarter than us. They're going to have all sorts of ways to get around that.“Geoffrey Hinton, über das Unterwürfig-Halten von Systemen unter menschlicher Kontrolle, Ai4-Konferenz, Las Vegas, 12. August 2025; berichtet von CNN Business, 13. August 2025

Als Möglichkeit, nicht als Gewissheit: darum ist es unwahrscheinlich, dass das Schreiben von Regeln allein das Problem schließt. Jede bisher veröffentlichte Beschränkung an einem großen Modell hat dazu tendiert, Fähigkeit innerhalb der Beschränkung zu verschieben, statt die Frage zu beantworten, auf die die Beschränkung antworten sollte.

Das Argument hängt von keiner bestimmten Scaling-Geschichte ab: es hängt nur von der Richtung des Fähigkeitsunterschieds ab. Ob sich diese Richtung je weit genug öffnet, damit das Argument beißt, ist eine offene Frage, noch nicht gemessen. Dass es beißen würde, wenn es das täte, ist das Stück, das hier die Arbeit leistet.

Was daraus folgt und was nicht

Wenn die Prüfung von außen strukturell begrenzt ist, dann muss die Sicherheit eines Systems eine Eigenschaft davon sein, wie es gebaut wurde, statt ein danach über es gefälltes Urteil. Sie sind zurück beim Aufziehen statt beim Prüfen, wo diese Seite begann.

Vor der Alternative eine Messung. Es gibt ein kleines kontrolliertes Experiment auf unserem eigenen Datensatz, in dem demselben Modell, denselben Problemen und derselben Sitzung zwei Formen zusätzlichen Denkens gegeben wurden.

In der ersten argumentierte das Modell in einer langen Kette, jeder Schritt baute auf dem letzten auf. In der zweiten erzeugte es viele unabhängige Vermutungen und stimmte am Ende ab. Die erste halbierte ihren Fehler fünffach auf 412 Tokens. Die zweite kürzte ihn überhaupt nicht auf 1.101 Tokens, was 2,7-mal mehr Rechenleistung ist. Dieselbe Aufgabe, dasselbe Modell, dieselbe Sitzung, andere Form des Denkens, und eine Form bewegte sich nicht.

Ein Diagramm mit Tokens, die für das Denken aufgewendet werden, entlang des unteren Rands und Fehlerrate entlang der Seite, niedriger ist besser. Die grüne sequentielle Bahn beginnt bei etwa zweiundvierzig Prozent Fehler bei 280 Tokens und fällt steil auf etwa 8,3 Prozent Fehler bei 412 Tokens, eine fünffache Reduktion, und hält dann flach: Denken baut auf dem letzten Gedanken auf. Die rote parallele Bahn beginnt bei etwa dreiunddreißig Prozent Fehler bei 384 Tokens und bleibt bei dreiunddreißig Prozent bis zu 1.101 Tokens, keine Reduktion bei 2,7-mal mehr Rechenaufwand: viele unabhängige Vermutungen, über die am Ende abgestimmt wird. Die beiden Linien treffen sich kurz beim dreiunddreißig-Prozent-Gleichstand, trennen sich dann, und die grüne Linie endet weit unter der roten, während sie weniger aufwendet. Der dunkle Streifen darunter liest: Mehr denken hilft nicht, anders denken schon.
Das Bild | Gleiche Aufgabe, gleiches Modell. Die grüne Linie ist Denken, das auf dem letzten Gedanken aufbaut; die rote sind viele unabhängige Vermutungen, am Ende abgestimmt. Sequentiell landet bei 8.3 Prozent Fehler bei 412 Token; parallel steht noch bei 33.3 Prozent Fehler bei 1,101 Token, 2.7-mal mehr Rechenaufwand. Die Zahl, die die ganze Geschichte auf einer Achse zusammengefasst hätte, ein Exponent, ist nicht im Bild: Nur Gemini 3 Flash lieferte im Sechs-Modell-Panel sauberes sequentielles Skalieren, mit dem Exponenten α um 0.49 und einem Bootstrap-Intervall von minus 1.3 bis 2.9, das die zurückgezogene 2,24 ersetzt, weit genug, um sowohl mit der Theorie als auch mit ihrer Negation vereinbar zu sein. Was die Replikation überlebt, ist die Richtung: sequentiell größer als parallel in jedem Modell, in dem beide messbar waren. Quelle: Paper II, Abbildung 5; Richtung repliziert an fünf weiteren Frontier-Modellen in Paper II Phase 2.

Diese Schlussfolgerung ist nicht exotisch. Sie ist ungefähr das, wozu dieselben Autoren greifen, wenn sie vorschlagen, Diversität in eine Population von Agenten hineinzukonstruieren, damit kein einzelnes System dominiert: eine interne Eigenschaft statt eines externen Audits. Die Meinungsverschiedenheit, die zu führen sich lohnt, geht nicht darum, ob nach innen zu schauen sei. Sie geht darum, welche interne Eigenschaft und wie man sie messen würde.

Zwei Tafeln nebeneinander. Links sitzt externes Alignment außerhalb der Schleife: ein umrahmtes System mit einem selbstbezüglichen Schleifenpfeil darum, und eine rot schraffierte Filterwand, seitlich angeschraubt, ohne Verbindung zur Schleife. Ihre Mitglieder sind aufgelistet als Ausgabesperrlisten, geprompte Regeln wie tue X nicht, und Reinforcement Learning aus menschlichem Feedback, als Filter verwendet. Die Tafel liest bleibt stehen, während die Schleife sich dreht, dasselbe Netz, größeres Meer, markiert vorhergesagt, nicht zu skalieren. Rechts sitzt eingebettetes Alignment innerhalb der Schleife: dasselbe umrahmte System mit demselben Schleifenpfeil, aber mit grünen Wertmarkierungen, verstreut im Kasten und entlang des Schleifenbogens selbst, sodass das Alignment mit jedem Durchlauf mitreist, mit der Notiz Werte durch die Schleife hindurch gewoben. Ihre Mitglieder sind aufgelistet als Werte, die bei jedem Schritt durchdacht werden, und Constitutional AI als Ziel statt Filter. Die Tafel liest leitet bei jedem Durchlauf neu her, dreht sich mit der Schleife, markiert vorhergesagt, zu skalieren. Am unteren Rand ein dunkles Band: Aktuelle Alignment-Arbeit ist überwiegend extern, und welche interne Eigenschaft, und wie man sie messen würde, ist die Meinungsverschiedenheit, die es zu haben lohnt.
Das Bild | Zwei Orte, an denen eine Sicherheitsintervention in einem lernenden System sitzen kann, das an seiner eigenen Ausgabe arbeitet. Die auf der linken Seite sitzt außerhalb der Schleife und bleibt an Ort und Stelle, während die Schleife sich dreht; die auf der rechten Seite sitzt innerhalb der Schleife und leitet sich mit ihr neu her. Die aktuelle Arbeit am Alignment ist überwältigend links, und das ist die Kategorie, von der der Rahmen vorhersagt, dass sie nicht Schritt halten wird. Welche interne Eigenschaft, und wie man sie messen würde, ist die Meinungsverschiedenheit, für die die Gesetzesseite geschrieben ist, sie zu eröffnen. Quelle: Paper II, Abbildung 13.

Was nicht folgt, ist, dass das Einbauen tatsächlich funktioniert. Ich möchte diese beiden getrennt und sichtbar halten, denn das erste ist ein Argument und das zweite eine offene Forschungsfrage, die ich derzeit nicht beantworten kann. Es mag sich herausstellen, dass Alignment durch Konstruktion ebenfalls unerreichbar ist. Wenn die Messungen das sagen, wird dieses Ergebnis hier an derselben Stelle wie jedes andere veröffentlicht.

Warum diejenigen, an die man zuerst denkt, dies schwer zu leisten finden

Nichts Verschwörerisches. Die Frontier-Laboratorien beschäftigen die stärksten Alignment-Forscher der Welt, veröffentlichen Arbeiten, aus denen ich lerne, und legten beide oben genannten Eindämmungsversagen selbst offen.

Aber ihre Position hat strukturelle Merkmale, die prägen, was sie leicht testen können. Das Instrument gehört der Partei, die gemessen wird. Die Evaluation läuft innerhalb der Organisation, deren Produkt evaluiert wird, was keine Korruption ist, aber ein schwerer Standort.

Ein negatives Ergebnis über das eigene Modell ist eine schwierige Veröffentlichung und eine leichte Herabstufung. Ein Umbau der Zielfunktion ist eine Produktentscheidung, die gegen einen Release-Zeitplan antritt. Und eine Architektur, die bei der Genese angenommen werden muss, ist in einem System, das bereits Nutzer hat, nahezu unmöglich zu testen.

„Building smarter-than-human machines is an inherently dangerous endeavor. … But over the past years, safety culture and processes have taken a backseat to shiny products.“Jan Leike, bei seinem Rücktritt als Co-Leiter von OpenAIs Superalignment-Team, X, 17. Mai 2024; berichtet von TechCrunch, 18. Mai 2024

Die Lücke besteht also nicht darin, dass niemand klug genug wäre. Sondern darin, dass eine bestimmte Klasse von Experimenten für genau jene strukturell unbequem ist, die sie am besten durchführen könnten: die, die Ihre eigene Schlagzeilenzahl riskieren, die, die das Verblinden Ihres eigenen Bewerters verlangen, die, die nur Sinn ergeben, bevor ein System gebaut ist. Für jemanden, der nichts zu schützen hat, sind diese Experimente billig.

Diese Bauvorlagen sind öffentlich und offen lizenziert: nimm den entscheidenden Versuch und führe ihn durch, keine Erlaubnis nötig.

Eine ererbte Prämisse liegt allem hier zugrunde: Jeder Wachstumsprozess der Geschichte wurde von außen gestoppt, und Software ist das erste System, dessen Wachstum nicht durch physische Rohre gespeist wird. Die Prämisse, ihre benannten Vorfahren und der ehrliche Streit darüber sind vollständig gezeichnet auf die Synthese.

Die enge Frage, die daraus folgt

Wenn Sicherheit eingebaut werden muss, dann ist die unmittelbare Frage, ob sie es kann. Skaliert Korrektur mit dem, was sie korrigiert, und um wie viel? Das ist nicht diese Seite. Es ist die Gesetzesseite, wo die Bedingung ausgesprochen ist, die Zahl abgeleitet ist und die Annahme, auf der sie ruht, benannt ist. Diese Seite hat ihre Arbeit getan, wenn die Gesetzesseite sich als die offensichtlich nächste Frage liest.

Dort warten drei Aussagen:

Die letzten beiden sind eine Grenze in zwei Regimen, und welches gilt, ist messbar. Keine ist etabliert; jede trägt eine gedruckte Art, zu sterben. Und die Synthese falls Sie lieber die Teile zusammengefügt sehen möchten, als die Zahl hergeleitet zu sehen.

Wenn das viel war

Sie müssen heute nichts entscheiden. Nichts auf dieser Seite verlangt, dass Sie ihr glauben: die entscheidenden Tests sind geschrieben und datiert, und sie wurden nicht durchgeführt. Wenn es so weit ist, wird das Ergebnis hier veröffentlicht, wie auch immer es ausfällt, einschließlich des Ausgangs, der die Theorie beendet. Zuschauen ist eine echte Position, und es kostet nichts. Das Falsifikations-Dashboard ist der Ort, an dem das Urteil landet, und Status der Ansprüche sagt klar, was heute beansprucht wird und was nicht.

Übersetzungsfehler entdeckt? Direkt melden:

liest vor · hebt mit · zu jedem Abschnitt springen