Wer Röntgenbilder von Chatbots auswerten lässt, riskiert selbstbewusste Fehldiagnosen
Die zweite Version des Benchmarks RadLE prüft, ob KI-Systeme in der Radiologie erkennen, wann sie eine Diagnose besser einem Menschen überlassen sollten. Viele Modelle liefern falsche Befunde mit voller Überzeugung. Genau das macht sie für den Einsatz am Patienten gefährlich.
RadLE 2.0, kurz für "Radiology's Last Exam", stammt vom CRASH Lab der Ashoka University in Indien. Es handelt sich um die überarbeitete Nachfolgeversion eines Tests, den das Team im September 2025 erstmals vorgestellt hatte. Die neue Version misst, ob ein Modell die richtige Diagnose stellt, wie sicher es sich dabei ist und ob es abgibt, wenn es an seine Grenzen kommt. Die KI muss ihre Antworten auf einer Sicherheitsskala von 0 bis 4 einordnen oder darf explizit "I don't know" sagen.
Getestet wurden 200 Fälle und 16 Modelle gegen ein Panel aus Radiologen. Menschliche Experten erreichten 988,7 von 2000 möglichen Punkten. Das beste KI-Modell kam auf 758.

Ehrliches Schweigen schlägt selbstsicheres Raten
Das Bewertungssystem belohnt Ehrlichkeit und bestraft Übermut. Wer richtig liegt und sich sicher ist, bekommt volle Punkte. Wer falsch liegt und trotzdem hohe Sicherheit angibt, verliert entsprechend viele. Wer "keine Ahnung" antwortet, bekommt nichts, verliert aber auch nichts. Ein Modell, das souverän raten will, fällt in der Wertung ab, selbst wenn seine reine Trefferquote ordentlich aussieht.
Damit greift die Studie einen Punkt auf, den vor Kurzem unter anderem diese viel beachtete Arbeit gemacht hatte: Solange Benchmarks nur Genauigkeit belohnen, werden KI-Modelle zum Raten erzogen. In der Medizin ist eine selbstbewusste Fehldiagnose noch gefährlicher als ein ehrliches Eingeständnis, etwas nicht zu wissen.
Jedes Modell hat seine eigene Schwäche
Einen klaren Sieger gibt es nicht. Anthropics Claude Fable 5 schnitt am besten ab, wenn es um verlässliche und sichere Antworten ging, und führt damit die Primärmetrik an. Googles Gemini 3 Pro erzielte die höchste reine Trefferquote.

Am besten erkannte Metas Muse Spark 1.1, wann es einen Fall an einen Menschen abgeben sollte. Meta hatte die Halluzinationsrate bei Muse Spark 1.1 zuletzt fast halbiert, weil das Modell häufiger auf eine Antwort verzichtet, statt falsch zu raten. Bei anderen Frontier-Modellen läuft der Trend genau umgekehrt. Grok 4.5 etwa halluziniert deutlich mehr als sein Vorgänger, weil es zwar mehr weiß, aber auch überzeugter von falschem Wissen ist.

Mehrere Modelle hätten deutlich besser abgeschnitten, wenn sie häufiger geschwiegen hätten, statt zu raten, so das Forschungsteam. Besonders auffällig war das bei frei verfügbaren und speziell auf Medizin trainierten Modellen. Sie versuchten, fast jeden Fall zu beantworten, und lagen dabei oft daneben, meist mit hoher Konfidenz.


Die erste Version des Tests zeichnete ein noch klareres Bild. Radiologen erreichten 83 Prozent Trefferquote, das beste Modell nur etwa 30. Innerhalb von drei Monaten hatte Gemini 3 Pro dann bereits das Niveau von Radiologie-Assistenzärzten überholt. Die Genauigkeit wächst also rasant. Was fehle, sei das Bewusstsein für die eigenen Grenzen.
Wenn Patienten ihre MRTs an Chatbots schicken
Immer mehr Menschen laden Röntgenbilder oder MRT-Aufnahmen in Chatbots hoch und verlassen sich auf deren Antworten. Eine Studie in npj Digital Medicine hatte zuletzt gezeigt, dass verbreitete Chatbots bei medizinischen Fragen oft unsichere Antworten geben.
Das Forschungsteam wirft Managern und Investoren vor, KI-Modelle öffentlich zu überschätzen. Aussagen, wonach KI-Systeme bereits besser diagnostizieren würden als 99 Prozent der Ärzte, beruhten meist auf Anekdoten oder Simulationen. Eine Studie hatte erst im April an 21 damals aktuellen Modellen gezeigt, dass sie für den unüberwachten Einsatz in der Klinik nicht bereit sind.
RadLE 2.0 soll fortlaufend um neue Modelle ergänzt werden. Die vollständige wissenschaftliche Veröffentlichung mit Kostenanalysen und einer Fehlertaxonomie ist angekündigt.
Kürzlich waren zwei weitere Arbeiten zu autonomen medizinischen KI-Agenten erschienen, die in eine andere Richtung wiesen. MIRA, ein System für elektronische Patientenakten, und AMIE konnten in simulierten Sprechstunden mit Hausärzten mithalten. Beide Studien nährten die Erwartung, dass KI bald eigenständig diagnostizieren könnte. Die Autoren von RadLE 2.0 halten dagegen: Bevor eine KI selbstständig entscheidet, muss sie wissen, wann sie es besser lässt.
Ein weiteres Problem ist der Verlust diagnostischer Fähigkeiten. Eine polnische Beobachtungsstudie aus 2025 ergab, dass Ärzte, die regelmäßig KI bei Darmspiegelungen nutzen, ohne technische Unterstützung signifikant weniger Krebsvorstufen entdecken. Die Erkennungsrate sank von 28,4 auf 22,4 Prozent. Die Autoren sprechen vom "Google-Maps-Effekt": Ohne das Hilfsmittel sind die Nutzer orientierungslos.
KI-Déjà-vu in der Radiologie
Die Radiologie hat schon einmal einen KI-Hype-Zyklus erlebt: KI-Forscher Geoffrey Hinton erklärte 2016, man solle keine Radiologen mehr ausbilden, weil Deep Learning den Job bald übernehme. Kollegen wie Richard Sutton pflichteten ihm bei.
Fast zehn Jahre später sind Radiologen weiter überlastet, und Hinton musste seine Aussage zurücknehmen. Er hatte den Radiologenberuf auf die reine Bildanalyse reduziert und die Komplexität des gesamten Tätigkeitsfelds übersehen. Dass die Systeme noch dazu selbstbewusst falsche Diagnosen stellen können, macht den Menschen weiterhin unverzichtbar.
KI-Spezialisten verstehen mitunter ihre Modelle, überschätzen aber regelmäßig, wie schnell sich damit ganze Berufe ersetzen lassen. Solche KI-Wahrsagerei ist derzeit wieder in Mode. Auch Menschen wissen offenbar nicht immer, wann sie besser schweigen sollten, weil sie ihre Kompetenz überschreiten.
KI-News ohne Hype – von Menschen kuratiert
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.
Jetzt abonnierenDer Rest ist für Abonnenten.
Jetzt Abo abschließen.
- Zugriff auf alle THE DECODER Artikel.
- Lesen ohne Ablenkung – keine Google-Werbebanner.
- Zugang zum Kommentarsystem und Austausch mit der Community.
- Wöchentlicher KI-Newsletter.
- 6× jährlich: “KI Radar” – Deep-Dives zu den wichtigsten KI-Themen.
- Bis zu 25 % Rabatt auf KI Pro Online-Events.
- Zugang zum kompletten Archiv der letzten zehn Jahre.
- Die neuesten KI‑Infos von The Decoder – klar und auf den Punkt.