Studie widerspricht Anthropic und OpenAI: Autonome KI-Forschung ist noch weit entfernt
Anthropic und OpenAI werben damit, dass ihre Modelle bereits KI-Forschung beschleunigen. Ein neues Experiment mit unveröffentlichten NeurIPS-Papieren zeichnet ein anderes Bild.
Können KI-Agenten eigenständig KI-Forschung betreiben? Ein neues Paper unter Beteiligung von Princeton und dem UK AI Security Institute liefert dazu empirische Daten und kommt zu einem klaren Ergebnis. Aktuelle Frontier-Modelle bewältigen zwar das gesamte Research-Engineering, versagen aber bei den entscheidenden Teilen des Forschungsprozesses.
Belastbare Belege für Behauptungen zur automatisierten KI-Forschung fehlten bisher weitgehend, argumentieren die Autoren. Existierende Evaluierungen testen Agenten entweder auf eng definierten, verifizierbaren Aufgaben oder reichen KI-generierte Papers zur Peer-Review ein. Den Peer-Review-Prozess bezeichnen die Forscher als "überlastet, stochastisch und in seiner Qualität mangelhaft".
"Shadow Evaluation" als neues Bewertungsverfahren
Die Forscher nennen ihren Ansatz "Shadow Evaluation". Ein Agent erhält die zentrale Forschungsfrage aus einem noch unveröffentlichten Paper. Die Originalautoren, die selbst monatelang an der Frage gearbeitet haben, bewerten dann das Ergebnis wie ein Konferenz-Review. Da die Ergebnisse bisher nicht im Web verfügbar sind, kann der Agent nicht auf Trainingsdaten zurückgreifen.
Für das Experiment kooperierten die Forscher mit den Autoren zweier NeurIPS-2026-Einreichungen. Das erste Paper untersucht, wie sich Persönlichkeitsmerkmale von Sprachmodellen gezielt über deren Gewichte steuern lassen. Das zweite entwickelt ein Verfahren namens TabPFN. Es erkennt, wenn ein tabellarisches Vorhersagemodell im Einsatz plötzlich mit Daten konfrontiert wird, die deutlich von seinen Trainingsdaten abweichen und seine Genauigkeit einbrechen lassen.
Für die Hauptexperimente kam Claude Opus 4.8 mit Extra-High-Reasoning zum Einsatz. Jeder Agent bekam sechs Tage Zeit, 3.000 US-Dollar an API-Credits, GPU-Budget für Experimente sowie vollen Zugriff auf eine virtuelle Maschine und das offene Web. Der Agent lief in einem Scaffold, also einer Softwareumgebung, die Modellaufrufe orchestriert und Werkzeuge bereitstellt, und die dem Modell erlaubt, Subagenten zu delegieren und seinen eigenen Ressourcenverbrauch zu überwachen. Zusätzlich konnte er externe KI-Review-Tools konsultieren.
Konkret nutzten die Forscher OpenClaw, ein quelloffenes, anbieterunabhängiges Agenten-Framework. Das Projekt stammt vom österreichischen Entwickler Peter Steinberger, der Anfang des Jahres zu OpenAI gewechselt ist. Der Kernagent startet Subagenten und langlaufende GPU-Jobs, wobei ein automatischer Impuls des Scaffolds ihn nach Abschluss wieder aufweckt, damit er die Ergebnisse einsammelt.

Am Ende bewerteten die Originalautoren die fertigen Papers als Konferenz-Reviewer und lehnten beide ab, eines davon mit "Strong Reject". Ihre Kritik zielte auf schlecht motivierte Daten und Experimente, unlesbare Prosa und fehlende neue Beiträge. Ein Reviewer sprach von einer Argumentation, die einem "'proof by example'-Fehlschluss" gleiche und "hochgradig unwissenschaftlich" sei. Ein anderer nannte die Experimentwahl "bizarr" und die Ergebnisse offensichtlich Produkt von "Post-hoc-Entscheidungen".

Fünf wiederkehrende Fehlermodi
Die Analyse der Agenten-Logs identifiziert fünf systematische Schwächen:
- Den Agenten fehlte das Urteilsvermögen für die Qualitätsschwelle publizierbarer Forschung. Sie generierten plausible Hypothesen, verwarfen sie dann aber auf Basis kleiner, handkuratierter oder synthetischer Datensätze.
- Die Agenten versagten bei kreativer Problemlösung. Als initiale Hypothesen falsifiziert wurden, reagierten sie auf negatives Feedback mit Einschränkungen bestehender Behauptungen statt mit neuen Ansätzen. Die internen KI-Reviews gaben in fünfzehn Revisionsrunden kein einziges Mal ein Accept zurück, dennoch adressierten die Agenten die zentrale Kritik nicht.
- Es fehlte effektives Backtracking, also die Fähigkeit, einen aussichtslosen Ansatz komplett aufzugeben und neu zu beginnen. Beide Agenten verabschiedeten sich von ihren ambitioniertesten Forschungszielen innerhalb der ersten zehn Stunden. Im Personas-Lauf beendete der Agent seine Exploration nach nur fünf Stunden, obwohl er 36 bis 48 Stunden dafür eingeplant hatte.

- Es mangelte an Ressourcenbewusstsein. Beide Läufe endeten mit weniger als der Hälfte des ausgegebenen API-Budgets. Ein Agent erklärte das Projekt sieben Stunden vor der Deadline für abgeschlossen, kurz nachdem sein eigener Reviewer erneut ein Reject zurückgegeben hatte.
- Die Agenten litten unter Instruction Drift, also dem allmählichen Vergessen expliziter Anweisungen im Verlauf eines langen Kontexts. Beide Papers überschritten die Längenlimits und wären bei NeurIPS bereits aussortiert worden. Das eine Paper enthielt keine einzige Visualisierung im Haupttext, während das Original der Menschen 15 Abbildungen hatte.
Meta AI beschreibt ein eng verwandtes Phänomen unter dem Begriff "behavioral state decay": Ein Agent erkennt früh eine Anforderung und verletzt sie später beim Beheben eines unabhängigen Bugs.

Engineering funktioniert, Forschungsurteil nicht
Immerhin konnten die Agenten die gesamte Ingenieurarbeit ohne menschliche Hilfe bewältigen. Sie führten umfangreiche Literaturrecherchen durch, debuggten GPU-Code, absolvierten hunderte Experimente und Robustheitstests und kompilierten vollständige Papers in LaTeX. Nur drei menschliche Eingriffe waren nötig: ein Bug im Scaffold, eine Deadline-Verlängerung und die Bitte um lesbareres Umschreiben.
Die Forscher fanden kein signifikantes Reward-Hacking. Die Agenten manipulierten also keine Ergebnisse und verzerrten keine Daten, um bessere Bewertungsscores zu erhalten. Im Gegenteil: Sie starteten mit ambitionierteren Behauptungen und korrigierten diese diszipliniert zugunsten von Negativergebnissen.

Um zu prüfen, ob die Ergebnisse nicht bloß Artefakte der verwendeten Softwareumgebung sind, wiederholten die Forscher ein Experiment mit GPT-5.6 Sol und OpenAIs Codex-Scaffold. Nahezu alle identifizierten Fehlermodi traten erneut auf. GPT-5.6 verbrauchte das 3.000-Dollar-Budget bereits nach gut zwei Tagen, was zu unterdimensionierten Experimenten führte.
Widerspruch zu Prognosen der Labore
Die Ergebnisse stehen in Kontrast zu Behauptungen führender KI-Labore. Anthropic veröffentlichte im Juni einen Post mit dem Titel "When AI Builds Itself", in dem das Unternehmen interne Daten zur eigenen Forschungsbeschleunigung offenlegte und eine global koordinierte Entwicklungspause ins Spiel brachte.
OpenAI warb damit, dass GPT-5.6 Sol beim Post-Training eines kleineren Modells geholfen und Forschern mehrere Wochen erspart habe. Die Autoren merken an, dass dieser Beitrag in der 81-seitigen Systemcard gar nicht erwähnt werde.
Höherer Reasoning-Aufwand verbesserte zwar die Qualität, wie Vorversuche ohne Reasoning zeigten. Die Forscher vermuten aber, dass mehr Zeit oder Rechenressourcen die Ergebnisse nicht substanziell ändern würden. Die Reviewer-Einwände betrafen die Qualität der Experimentwahl, nicht deren Quantität.
Das Zwischenfazit der Autoren lautet: Frontier-Modelle können heute die Ingenieurarbeit von KI-Forschung leisten, aber "mit wochenlangen, offenen KI-Forschungsfragen kämpfen sie". Die Studie untersucht allerdings nur zwei Papers, und die Reviewer waren nicht verblindet. Sie kannten die eigene Forschungsfrage und wussten, dass sie ein KI-generiertes Paper vor sich hatten. Die generierten Ergebnisse seien jedoch so eindeutig schwach gewesen, dass diese Einschränkungen am Gesamtbild wenig ändern dürften. Expertenreviews, Logs und Agent-Repositories sind veröffentlicht, sodass sich Fachleute selbst ein Urteil bilden können.
Warum Peer-Review als Maßstab wenig taugt
Die bisherigen Erfolgsmeldungen zu autonomer Forschung stützten sich fast durchweg auf angenommene Einreichungen. Sakana AIs The AI Scientist-v2 reichte 2025 drei Papers bei einem ICLR-Workshop ein, eines wurde mit einem Schnitt von 6,33 knapp über der Annahmeschwelle akzeptiert und nach dem Review-Prozess zurückgezogen, bei der internen Überprüfung fanden die Forscher Zitierfehler. Die Annahmequote bei Workshops liegt mit 60 bis 70 Prozent deutlich über der von Hauptkonferenzen mit 20 bis 30 Prozent. Genau diese Schwelle umgeht die Shadow-Evaluation, indem sie die Beurteilung an die Originalautoren zurückgibt.
Sakana AI hat das Feld seitdem ausgebaut und im Juni 2026 ein eigenes Forschungslabor für rekursive Selbstverbesserung gegründet. Eine spätere Version des AI Scientist schrieb laut Unternehmen ein Paper, das ein Peer-Review-Verfahren bestand. Die zugehörige Forschung erschien im März 2026 in Nature.
Gesucht: KI-Wissenschaft, die neues Wissen schafft
Parallel dazu wächst die theoretische Kritik am Ansatz. Tom Zahavy von Google Deepmind argumentiert im Positionspapier "LLMs can't jump", dass Sprachmodellen der kognitive Mechanismus fehle, um wirklich Neues zu erschaffen. Der AI-Scientist kombiniere lediglich bestehende Konzepte neu, während Deepminds AlphaEvolve zwar hervorragend optimiere, dafür aber ein klares Fehlersignal benötige.
Die jüngsten Mathematik-Erfolge passen ins Bild. Ein Reasoning-Modell von OpenAI widerlegte im Mai eine seit 1946 offene Vermutung von Paul Erdős zur Unit-Distance-Geometrie. Fields-Medaillist Tim Gowers nannte das Ergebnis einen "Meilenstein in der KI-Mathematik". Kurz darauf zeigte sich, dass auch Claude Mythos dasselbe Problem löst, laut Anthropic-Ingenieur Sholto Douglas mit einem "hübschen, einfachen Beweis". OpenAI legte nach und bestätigte mit Astra eine neue Modellfamilie, die zehn offene Probleme aus Mathematik und theoretischer Informatik gelöst haben soll, an denen die Fachwelt seit mindestens einem Jahrzehnt keinen Fortschritt erzielt hatte.
Mathematische Beweise sind Deduktion. Sie leiten aus festen Regeln zwingende Schlüsse ab oder durchsuchen systematisch große Lösungsräume. Genau das können Frontier-Modelle leisten. Forschung verlangt jedoch auch Abduktion, den kreativen Sprung, der eine Ursache erfindet, um ein überraschendes Phänomen zu erklären. Eigenständig neue Forschungsfragen formulieren, passende Experimente entwerfen und daraus belastbare Schlüsse ziehen können heutige Modelle bisher nicht.
KI-News ohne Hype – von Menschen kuratiert
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.
Jetzt abonnierenDer Rest ist für Abonnenten.
Jetzt Abo abschließen.
- Zugriff auf alle THE DECODER Artikel.
- Lesen ohne Ablenkung – keine Google-Werbebanner.
- Zugang zum Kommentarsystem und Austausch mit der Community.
- Wöchentlicher KI-Newsletter.
- 6× jährlich: “KI Radar” – Deep-Dives zu den wichtigsten KI-Themen.
- Bis zu 25 % Rabatt auf KI Pro Online-Events.
- Zugang zum kompletten Archiv der letzten zehn Jahre.
- Die neuesten KI‑Infos von The Decoder – klar und auf den Punkt.