Deepseeks DSpark beschleunigt KI-Antworten pro Nutzer um bis zu 85 Prozent
Deepseek hat mit DSpark ein neues Verfahren vorgestellt, das die Antwortgeschwindigkeit seiner KI-Modelle pro Nutzer um 60 bis 85 Prozent steigern soll.
Herkömmliche KI-Modelle erzeugen Text Wort für Wort, was bei langen Antworten zu langsamer GPU-Auslastung und Wartezeiten führt. DSpark nutzt ein sogenanntes "Speculative Decoding": Dabei schlägt ein kleines, schlankes Modell Antwort-Kandidaten vor, die dann gebündelt vom großen Modell geprüft werden. Zusätzlich erzeugt es kleine Wortgruppen statt einzelner Wörter. Ein Konfidenz-basiertes System passt die Prüftiefe je nach Rechenlast dynamisch an. Es reduziert so verschwendete Rechenkapazität bei der Prüfung von Token-Vorschlägen.

Deepseek testete DSpark auch mit offenen Modellen von Google Deepmind (Gemma) und Alibaba (Qwen), was auf eine breite Einsetzbarkeit hindeutet. Das gemeinsam mit der Peking University entwickelte Framework samt Deepseek-V4-Pro-Modell ist auf Hugging Face unter der offenen MIT-Lizenz verfügbar. Technische Details stehen im Paper.

Entlastung der Infrastruktur – oder schnellere Skalierung
Auch diese Veröffentlichung ist für China strategisch bedeutsam. Schnellere Inferenz senkt die Chiplast und damit den Aufwand bei Infrastrukturinvestitionen.
Das ist zunächst gut für China und potenziell für die EU. Allerdings könnte das Jevons-Paradoxon greifen. Effizientere Inferenz senkt zwar den Chipbedarf pro Anfrage. Doch die freigewordene Rechenleistung wird vermutlich sofort für mehr KI-Anfragen, längere Kontexte oder neue Anwendungen genutzt. Der Gesamtbedarf an Chips könnte also gleichbleiben oder sogar steigen. Auch Deepseek spricht von einer Verschiebung der "Pareto-Grenze" des eigenen Serving-Systems: Das Modell ermögliche Leistungsniveaus, die vorher nicht erreichbar waren.
Kurzfristig sind solche Effizienzgewinne für China und die EU dennoch vorteilhaft. Sie können mit weniger High-End-Chips mehr KI-Leistung erzielen. Angesichts der schlechten Verfügbarkeit der Chips und der US-Exportbeschränkungen ist das strategisch relevant. Für die USA könnte es bedeuten, dass der Chip-Hebel als geopolitisches Druckmittel an Wirkung verliert.
KI-News ohne Hype – von Menschen kuratiert
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.
Jetzt abonnieren