Meta schließt mit Muse Spark 1.3 zur Spitze auf, lockt mit niedrigen Preisen
Kurz & Knapp
- Meta hat Muse Spark 1.3 veröffentlicht. Die Stufe "xhigh" ist verfügbar, während die stärkere "max"-Version vorerst als limitierte Preview läuft.
- Das Modell verbessert sich vor allem bei agentischen Aufgaben, bleibt in den meisten Leistungstests aber weiterhin hinter Spitzenreitern wie Claude Fable 5.1 zurück.
- Mit 0,55 Dollar pro Aufgabe ist es das derzeit günstigste Modell seiner Leistungsklasse. Meta kündigt zudem eine kommende Open-Weights-Version an.
Meta hat Muse Spark 1.3 veröffentlicht, das vierte Modell der Reihe in fünf Monaten. Unabhängige Messungen zeigen deutliche Zuwächse bei agentischen Aufgaben, aber weiter Abstand zur Spitze. Das stärkste Argument bleibt der Preis.
Meta hat Muse Spark 1.3 veröffentlicht, verfügbar in Muse Code und der Meta-Model-API. Die Reihe startete im April, Version 1.1 folgte im Juli, 1.2 im August. Die stärkste Rechenstufe max kommt erst nach zusätzlichen Sicherheitstests und läuft laut Artificial Analysis derzeit als limitierte Partner-Preview. Verfügbar ist xhigh.
Im Intelligence Index erreicht max 62 Punkte, xhigh 61, nach 57 im August und 53 im Juli. Dass Meta so weit vorrückt, hängt an der Gewichtung des Index: GDPval-AA v2 zählt 20 Prozent, Terminal-Bench 2.1 16 Prozent, τ³-Bench Banking 14 Prozent. Genau dort liegen die Zuwächse.
Die einzige Führungsposition gehört der Preview-Variante
In τ³-Banking, wo Agenten in einem simulierten Bankszenario Werkzeuge bedienen, kommt max auf 52 Prozent und ist damit laut Artificial Analysis aktuell die Nummer eins. Die verfügbare xhigh-Stufe erreicht 47 Prozent und liegt damit gleichauf mit Claude Fable 5.1 (max) und GLM-5.3-Flash, nicht allein vorn. Vorgänger 1.2 lag bei 35 Prozent.
Terminal-Bench 2.1 (Coding im Terminal) steigt von 80 auf 85 Prozent bei xhigh und 86 bei max. Die aktuelle Spitze hält dort Claude Fable 5.1 mit 91,4 Prozent in der max-Stufe, 91,0 bei xhigh und 89,9 bei high. Der Abstand bleibt also deutlich.

In GDPval-AA v2, der höchstgewichteten Prüfung mit 220 realen Berufsaufgaben und einer auf menschliche Expertenleistung bei 1000 geeichten Elo-Skala, verbessert sich Meta von 1615 auf 1709 und 1754. Claude Fable 5.1 (max) steht bei 1853. Den Vorsprung der max-Variante erkauft Meta mit Rechenzeit: 62 Prozent mehr Reasoning-Token als xhigh.
Bei GPQA Diamond (naturwissenschaftliche Expertenfragen) steigt Muse Spark von 90 auf 94 Prozent und liegt damit in der Spitzengruppe, aber unter Gemini 3.8 Flash (high) mit 95,3 und Grok 4.6 (high) mit 94,9. CritPt (Forschungsphysik) legt von 18 auf 26 Prozent zu, die Spitze halten GPT-5.6 Sol (max) mit 32,3 und Claude Fable 5.1 (xhigh) mit 31,1 Prozent.
Zwei Werte fallen gegenüber 1.2: AA-LCR von 83 auf 79 Prozent, die Faktengenauigkeit in AA-Omniscience um bis zu drei Punkte, weil das Modell bei Unsicherheit häufiger nicht antwortet.
Preis pro Aufgabe als eigentliches Verkaufsargument
Bei unveränderten 1,25 und 4,25 Dollar pro Million Ein- und Ausgabetoken kostet eine Index-Aufgabe 0,55 Dollar. Kein Modell ab 59 Punkten ist günstiger, die Konkurrenten auf gleichem Indexniveau liegen zwischen 0,94 und 1,23 Dollar. Teurer als Version 1.2 mit 0,40 Dollar ist Muse Spark 1.3 dennoch.
Für die max-Variante haben weder Meta noch Artificial Analysis bislang einen Preis genannt. Angekündigt sind größere Modelle und ein Open-Weights-Release.
KI-News ohne Hype – von Menschen kuratiert
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.
Jetzt abonnieren