Anzeige
Skip to content

19 Tage ohne menschliche Hilfe: KI-Benchmark MirrorCode lässt Modelle tagelang autonom programmieren

Image description
Nano Banana Pro prompted by THE DECODER

Der neue Benchmark MirrorCode von Epoch AI testet, ob KI-Modelle ganze Programme eigenständig nachbauen können. Claude Opus 4.7 führt mit 56 Prozent, scheitert aber noch an den komplexesten Aufgaben.

Beim neuen KI-Coding-Benchmark MirrorCode von Epoch AI und METR müssen KI-Modelle komplette Programme von Grund auf reimplementieren, ohne Zugang zum Originalquellcode.

Die 25 Zielprogramme stammen aus verschiedenen Bereichen der Informatik, darunter Unix-Utilities, Datenserialisierung, Bioinformatik, Interpreter, statische Analyse, Kryptographie und Kompression. Die KI-generierten Lösungen müssen die Ausgabe des Originalprogramms exakt reproduzieren. Das gilt auch für versteckte End-to-End-Tests, die das Modell während der Entwicklung nie zu sehen bekommt.

Ein zentraler Unterschied zu anderen Benchmarks ist zudem das Inferenzbudget. Viele bestehende Software-Engineering-Benchmarks beschränken die Kosten auf 1 bis 10 US-Dollar pro Aufgabe, auch wenn ein Mensch Wochen für dieselbe Arbeit bräuchte, schreiben die Entwickler.

Bei MirrorCode kostete eine der größten Aufgaben laut Epoch AI 2.600 US-Dollar für einen einzelnen Lauf. Die KI arbeitete dabei 19 Tage am Stück, ohne dass ein Mensch eingriff.

Claude Opus 4.7 baut Bioinformatik-Toolkit in 14 Stunden nach

Laut Epoch AI kann KI bereits anspruchsvolle langfristige Programmieraufgaben lösen. Das beeindruckendste Beispiel liefert Claude Opus 4.7. Das Modell reimplementierte gotree, ein Bioinformatik-Toolkit mit rund 16.000 Zeilen Go-Code und über 40 Befehlen. Ein menschlicher Ingenieur ohne KI-Hilfe bräuchte für dieselbe Aufgabe laut den Forschern 2 bis 17 Wochen. Opus 4.7 erledigte sie in 14 Stunden für 251 US-Dollar.

In der Gesamtwertung erreicht Claude Opus 4.7 eine Lösungsrate von 56 Prozent. GPT-5.5 folgt mit 44 Prozent, Gemini 3.1 Pro Preview mit 32 Prozent. Selbst wenn die Modelle eine vollständige Reimplementierung nicht schaffen, bestehen sie laut Epoch AI typischerweise 90 Prozent oder mehr der Tests.

Die härtesten Aufgaben bleiben ungelöst

Trotz der Fortschritte ist MirrorCode bei Weitem nicht gelöst. Die Aufgaben sind in die Kategorien SMALL, MEDIUM und LARGE unterteilt. Kleine Programme wie uuid oder parseqsv werden von allen getesteten Modellen zuverlässig reimplementiert. An den größten Aufgaben scheitern sämtliche Modelle.

Die Forscher beobachten dennoch eine schnelle Verbesserung. Führende Modelle von vor einem Jahr hätten laut Epoch AI nur etwa 30 Prozent erreicht und wären auf einfachere Programme wie ein Kalender-Utility beschränkt gewesen.

Einen klaren Kostentrend fanden die Forscher nicht. GPT-5.5 kostet dreimal so viel wie GPT-5 für dieselben Aufgaben, während Claude Opus 4.7 dreimal günstiger als Claude Opus 4.1 ist.

Epoch AI hat den Scaffold und 22 der 25 Zielprogramme als Open Source veröffentlicht. Insgesamt umfasst das Paket 132 Aufgabeninstanzen in sechs Programmiersprachen. Drei Programme bleiben als privates Testset zurückgehalten.

Eine wichtige Einschränkung räumen die Forscher ein. Da MirrorCode Open-Source-Programme als Ziele verwendet, könnten die Modelle den Originalcode im Pretraining gesehen haben. Laut ersten Tests seien die Ergebnisse zwar nicht von Memorierung dominiert. Ausschließen lasse sie sich jedoch nicht.

KI-News ohne Hype – von Menschen kuratiert

Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.

Der Rest ist für Abonnenten.
Jetzt Abo abschließen.

  • Zugriff auf alle THE DECODER Artikel.
  • Lesen ohne Ablenkung – keine Google-Werbebanner.
  • Zugang zum Kommentarsystem und Austausch mit der Community.
  • Wöchentlicher KI-Newsletter.
  • 6× jährlich: “KI Radar” – Deep-Dives zu den wichtigsten KI-Themen.
  • Bis zu 25 % Rabatt auf KI Pro Online-Events.
  • Zugang zum kompletten Archiv der letzten zehn Jahre.
  • Die neuesten KI‑Infos von The Decoder – klar und auf den Punkt.
The Decoder abonnieren