Warum KI-Detektoren funktionieren: Verhaltenstraining macht Sprachmodelle sprachlich eintönig
LLMs könnten theoretisch ähnlich vielfältig wie Menschen schreiben, aber: Solange sie als hilfreiche Assistenten trainiert oder ihre Ausgaben stark abgesichert werden, bleibt ihr Text erkennbar. Das argumentiert der CTO des KI-Text-Detektors Bradley Emi in einem Blogbeitrag.
Systeme wie ChatGPT, Claude oder Gemini werden durch sogenanntes Post-Training stark eingeschränkt, bei dem ihnen Verhaltensregeln beigebracht werden, etwa um gefährliche Ausgaben zu vermeiden oder bestimmte politische Angaben zu zensieren. Das verenge ihre Ausdrucksvielfalt stark: ein Effekt namens "Mode Collapse".

Basismodelle ohne Post-Training schreiben bereits deutlich vielfältiger, sodass Pangrams Erkennung hier nicht anspringe, so Emi. Gleiches gelte für eng spezialisierte Feinabstimmungen, etwa nur auf Hemingway-Texte trainierte Modelle, sowie für fehlerhafte Ausgaben wie unzusammenhängende Texte.
KI-News ohne Hype – von Menschen kuratiert
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.
Jetzt abonnieren