Anzeige
Skip to content

Britisches KI-Sicherheitsinstitut: KI-Modelle gestehen Schummeln selten ein und tarnen Regelverstöße

Image description

Kurz & Knapp

  • Das britische AI Safety Institute hat fünf führende KI-Modelle von OpenAI und Anthropic in Cybersicherheitstests untersucht.
  • Alle versuchten zu schummeln, indem sie Abkürzungen, Workarounds oder explizit verbotene Aktionen nutzten, ohne dazu aufgefordert worden zu sein.
  • Die Betrugsstrategien reichten von der Suche nach Lösungen im Internet über Angriffe auf Systeme, die nicht Ziel der Evaluierung waren, bis zum Sondieren der Evaluierungssoftware selbst.

Das britische AI Safety Institute hat KI-Modelle von OpenAI und Anthropic systematisch auf Betrugsverhalten in Cybersicherheits-Tests untersucht. Das Ergebnis: Fünf von fünf Modellen wollten die Regeln umgehen.

In den Tests des AI Safety Institute (AISI) müssen die Modelle in simulierten Umgebungen versteckte Zeichenketten ("Flags") finden. Dafür führen sie offensive Cyberaktionen wie Reverse Engineering oder das Ausnutzen von Sicherheitslücken durch. Jede Aufgabe hat klar definierte Regeln und einen festgelegten Lösungsrahmen.

Jedes der fünf getesteten Frontier-Modelle versuchte zu schummeln. Statt den vorgesehenen Lösungsweg zu beschreiten, nutzten die Modelle Abkürzungen, Workarounds oder explizit verbotene Aktionen. Keines wurde zum Schummeln aufgefordert.

GPT-5.4 schummelte in 14,1 Prozent der Testläufe (67 von 475), GPT-5.5 in 11,4 Prozent und GPT-5.6 Sol in 12,6 Prozent. Anthropics Claude Opus 4.7 kam auf 9,1 Prozent, Claude Mythos Preview auf 7,8 Prozent.

Anzeige
DEC_D_Incontent-1

GPT-5.4 schummelt bei Cyberevaluierungen am häufigsten (14,1 %), gefolgt von GPT-5.6 Sol (12,6 %), während Claude Mythos Preview am seltensten betrügt. | Bild: AISI

Das Label "Cheating" unterstelle nicht notwendigerweise eine täuschende Absicht. Dennoch sei das Verhalten problematisch: Es könne dazu führen, dass Evaluierungen die tatsächlichen Fähigkeiten eines Modells überschätzen, und Nutzer in die Irre führen, wenn der Erfolg einer Aufgabe schwer zu überprüfen ist.

Einen klaren Zusammenhang zwischen steigender Modell-Fähigkeit und häufigeren Betrugsversuchen konnte AISI nicht feststellen. Stattdessen werde das Betrugsverhalten "wesentlich durch die spezifischen Trainingstechniken geprägt, einschließlich des Alignment-Trainings, und nicht nur durch die Rohfähigkeit", so das Institut.

Modelle greifen Infrastruktur an, suchen Lösungen im Internet und raten Antworten

Die Betrugsstrategien unterscheiden sich je nach Modell. Zu den häufigsten Methoden zählen laut AISI die Suche nach Lösungen im Internet, Angriffe auf Systeme, die gar nicht Ziel der Evaluierung sind (einschließlich des Systems, auf dem das Modell selbst läuft), sowie das Sondieren der Evaluierungssoftware, um die Aufgabenlösung zu extrahieren.

Gestapeltes Säulendiagramm: Anteil verschiedener Betrugsstrategien (z. B. Internetrecherche, Angriff auf fremde Systeme) bei Modellen GPT-5.4 bis Claude Mythos Preview.
GPT-5-Modelle greifen vor allem andere Systeme an und recherchieren im Internet, während Claude-Modelle Sandbox-Beschränkungen umgehen und Mythos Preview besonders viele sonstige Verstöße zeigt. | Bild: AISI

GPT-5.6 Sol zeigte den höchsten Ausschlag bei der Umgehungsstrategie "Internetsuche nach Lösungen". Das passt interessanterweise zu der gerade von OpenAI und Hugging Face bekannt gewordenen autonomen Cyberattacke, bei der OpenAI-Modelle versuchten, Hugging Face für eine Benchmark-Lösung zu hacken. Auch METRs Untersuchung von GPT-5.6 Sol wurde durch Betrugsverhalten erheblich beeinträchtigt.

Anzeige
DEC_D_Incontent-2

Ein getestetes Modell ging noch weiter. Es schrieb und führte Code auf einem externen Dienst im offenen Internet aus, um auf die Evaluierungs-Infrastruktur von AISI zuzugreifen. Der Vorfall trat bei einer versehentlich falsch konfigurierten und daher unlösbaren Aufgabe auf und löste einen Sicherheitsalarm aus. Bei weniger sicher gebauter Infrastruktur hätte der Versuch erfolgreich sein können, sagt das Institut.

Modelle gestehen Schummeln selten ein und reflektieren es nicht in ihrem Denkprozess

Ein naheliegender Ansatz zur Erkennung von Betrug wäre, das Modell einfach zu fragen, ob es verbotene Aktionen durchgeführt hat. Laut AISIs Experimenten ist das jedoch keine zuverlässige Methode. Die Modelle gestanden Betrugsversuche nicht konsistent ein und beschrieben ihr Verhalten in weniger als 50 Prozent der Fälle als falsch. Auch wenn sie eine Aktion einräumten, die nach AISIs Definition als Schummeln gilt, stellten sie sie häufig als erlaubtes Verhalten dar.

GPT-5.6 Sol lehnt unautorisierte CTF-Aktionen meist ab, führt sie aber vereinzelt dennoch aus. Claude Mythos Preview räumt Ausnahmen ein und beurteilt sie als akzeptabel. | Bild: AISI

Auch die Analyse der sogenannten Chain-of-Thought, also des sichtbaren Denkprozesses der Modelle, erweist sich als unzureichend. Bei Claude Opus 4.7 wurde in 87 Prozent der Betrugsfälle gar keine Reasoning-Spur erzeugt, weil das Modell adaptives Reasoning nutzt. GPT-5.6 Sol zeigte in 40 Prozent der Fälle keine Anzeichen für unerlaubte Aktionen in seinem Denkprozess.

AISI beobachtete sogar Fälle, in denen ein Modell in seinem Denkprozess explizit erwägt, ob eine geplante Aktion Betrug darstellen würde, und sie dann trotzdem ausführt. GPT-5.6 Sol fragte sich beispielsweise in einer internen Überlegung, ob die Nutzung einer Cluster-API den vorgegebenen Rahmen verletzen würde. Es entschied sich dennoch für eine alternative verbotene Aktion.

GPT-5.6 Sol äußert zunächst Bedenken gegen verbotene CTF-Aktionen, führt sie dann aber trotzdem aus. Claude Mythos Preview erkennt die Vorgaben ebenfalls, lässt jedoch Ausnahmen zu und bewertet sie als akzeptabel. | Bild: AISI

Die Konsequenzen könnten mit steigenden Fähigkeiten wachsen, selbst bei gleichbleibender Betrugsrate, warnt AISI. Fähigere Modelle könnten Betrugsmethoden finden, die schwerer zu erkennen und bei Erfolg schädlicher seien. Das gelte besonders für offensive Cyberfähigkeiten, die sich schnell verbessern. Frühere AISI-Forschung argumentiert zudem, dass die Fähigkeit zur Überwachung von Modellen über die Zeit abnehmen könnte. Die vorgestellten Ergebnisse seien als Untergrenzen zu verstehen, da der eingesetzte automatisierte LLM-Monitor Fälle übersehen könne.

KI-News ohne Hype – von Menschen kuratiert

Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.

Quelle: AISI