Anzeige
Skip to content

Moonshots Kimi K3 schlägt Claude und GPT bei Frontend, bleibt bei komplexer Mathematik aber weit zurück

Moonshots KI-Modell Kimi K3 sorgt derzeit für Diskussionen in der westlichen KI-Szene. Wie gut ist das Modell wirklich? In der Frontend Code Arena steht es mit einem Score von 1.679 auf Platz 1. In diesem Benchmark bewerten menschliche Tester die Frontend-Ergebnisse der Modelle. Kimi K3 schlägt damit Claude Fable 5 (1.631), GPT-5.6 Sol (1.618) und alle anderen getesteten Modelle deutlich. Es ist das erste Mal, dass ein chinesisches Modell die Spitze dieses Benchmarks erreicht.

Bei anspruchsvoller Mathematik zeigt Kimi K3 jedoch klare Schwächen. Laut Daten von Epoch AI erreicht es im FrontierMath-Benchmark (Tier 4, die schwierigsten Experten-Mathematikaufgaben) nur etwa 39 Prozent Genauigkeit. Modelle von OpenAI oder Anthropic erzielen dort teils beinahe 90 Prozent.

Bei komplexen mathematischen Aufgaben liegt Kimi K3 deutlich hinter den westlichen Spitzenmodellen. | Bild: Epoch AI
Anzeige
DEC_D_Incontent-1

KI-News ohne Hype – von Menschen kuratiert

Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.

Quelle: via X | Frontier Math