Anzeige
Skip to content

KI-Modell von Anthropic löst Aufgaben mit fast fünf Stunden Zeithorizont

Die KI-Forschungsorganisation METR hat neue Testergebnisse für Claude Opus 4.5 veröffentlicht. Das Modell von Anthropic erreicht einen sogenannten 50-Prozent-Zeithorizont von etwa 4 Stunden und 49 Minuten. Das ist der höchste bisher gemessene Wert. Der Zeithorizont beschreibt, wie lange Aufgaben sein können, die ein KI-Modell mit einer bestimmten Erfolgsrate (in diesem Fall 50 Prozent) löst.

METR

Auffällig ist der Unterschied zwischen verschiedenen Schwierigkeitsstufen. Der 80%-Zeithorizont liegt weiter bei nur 27 Minuten, ähnlich wie bei früheren Modellen. Laut METR zeigt das, dass Opus 4.5 besonders bei längeren Aufgaben besser abschneidet als Vorgänger. Die theoretische Obergrenze von mehr als 20 Stunden hält METR indes für unwahrscheinlich und führt sie eher auf fehlende Testdaten und statistische Unschärfe zurück als auf die tatsächliche Leistungsfähigkeit des Modells.

Wie jeder Benchmark hat auch die METR-Messung Einschränkungen, unter anderem, dass der Benchmark auf nur 14 Testfällen basiert. Eine ausführliche Analyse der Schwächen steht hier.

Anzeige
DEC_D_Incontent-1

KI-News ohne Hype – von Menschen kuratiert

Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den „KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.

Quelle: METR