Warum Thomson Reuters 40 Millionen Dollar in ein eigenes Sprachmodell investiert
Kurz & Knapp
- Thomson Reuters hat mit "Thomson" ein eigenes KI-Sprachmodell auf Basis von Alibabas Qwen für juristische Fachanwendungen entwickelt.
- Das 40 Millionen US-Dollar teure Modell wurde mit eigenen Daten und Fachexperten trainiert. In Tests übertrifft es Konkurrenten wie GPT-5.4 jedoch nur, wenn es auf exklusive Konzerninhalte zugreifen kann.
- Die Eigenentwicklung soll Kosten senken und Unabhängigkeit sichern, statt externe Modelle anzupassen. "Thomson" wird zunächst für die Dokumentenprüfung eingesetzt, eine kleinere Version wird nichtkommerziell veröffentlicht.
Mit "Thomson" bringt der Fachinformationskonzern sein erstes eigenes Sprachmodell auf Basis von Alibabas Qwen. Die selbst veröffentlichten Zahlen zeigen: Spitzenwerte erreicht es nur mit Zugriff auf die konzerneigenen Inhalte und Werkzeuge.
Thomson Reuters investierte nach eigenen Angaben über zwei Jahre rund 40 Millionen US-Dollar in Personal und Rechenleistung. Die prominenter beworbenen 450.000 Dollar beziffern lediglich den finalen Trainingslauf der aktuellen Version. Selbst die Gesamtsumme klammert das eigentliche Kapital aus: jahrzehntealte Inhalte aus Westlaw, Practical Law, Checkpoint und Reuters sowie die Arbeitszeit hunderter Fachexperten.
Als Basis dient Alibabas offenes Qwen, zuletzt laut Unternehmen Qwen3.5-397B. Gemeinsam mit dem Imperial College trainierte Thomson Reuters das chinesische Modell zunächst auf Sicherheit, Ethik und politische Neutralität um. DFiese Zwischenstufe heißt "Snowdon", benannt nach dem Berg in Wales.
Darauf folgten Pre-Training auf eigenen Inhalten, Post-Training mit Fachexperten und agentisches Reinforcement Learning in den konzerneigenen Tool-Umgebungen. Bisher flossen weniger als zehn Prozent der verfügbaren Inhalte ins Training.
Den Startpunkt habe man schon rund ein halbes Dutzend Mal gewechselt, sagt CTO Joel Hron. Die eigentliche Errungenschaft sei die wiederverwendbare "Modellfabrik", nicht das einzelne Modell, ergänzt Forschungschef Jonathan Schwartz.
Benchmarks mit schiefem Vergleichsmaßstab
Der Blogpost behauptet, Thomson zähle zu den besten Modellen der Welt. Die eigenen Zahlen zeichnen ein nüchterneres Bild: Auf Stanford LegalBench liegt Thomson (0,823) hinter Gemini 3.1 Pro und GPT-5.5, beim Harvey Legal Agent Benchmark knapp hinter Opus 4.8. Vorn liegt es bei Instruction Following und dem schweren PrBench Legal. Bei Reasoning und vor allem Coding fällt es deutlich ab. Methodisch ist der Vergleich zudem schief: Thomson tritt mit Test-Time Scaling an, GPT-5.5 dagegen ohne Reasoning-Modus.
Auch der hausinterne Deep-Research-Benchmark relativiert: Mit reinem Webzugriff erreicht Thomson bei der Faktentreue 0,53, GPT 5.4 kommt auf 0,65. Erst mit Zugriff auf Konzerninhalte zieht Thomson mit 0,83 knapp an GPT 5.4 (0,82) vorbei. Mit Webzugriff sei das Modell "sicher noch nicht führend", räumt Evaluationsleiter Andrew Bean ein.
Der Vorsprung entstehe durch das Training auf den eigenen Tools, ein Zugang, den externe Anbieter nicht haben. Bemerkenswert: Auch GPT 5.4 legt mit den Inhalten deutlich zu, der Datenzugang wirkt also fast so stark wie das Spezialtraining. Neuere Modelle hat das Unternehmen nicht getestet. Womöglich könnte der extrem knappe Vorsprung des internen Modell sich allerdings vergrößern, wenn das Unternehmen auf eine leistungsfähigere Variante wie Qwen3.8 umsteigt und für das Training verfügbare Inhalte deutlich über die 10‑Prozent-Marke schiebt.
Eigenes Modell statt Frontier-Fine-Tuning
Warum dann also ein eigenes Modell und nicht ein Frontier-Modell von OpenAI oder Anthropic auf Rechtsdaten anpassen? Dagegen sprechen aus Sicht von Thomson Reuters drei Punkte. Erstens die Ökonomie: Standard-Fine-Tuning verschlechtert laut Schwartz oft die generellen Fähigkeiten, und man bleibt bei Inferenzkosten und Roadmap vom Anbieter abhängig. Ein eigenes, kleineres Modell rechnet sich gerade bei hochvolumigen Aufgaben wie der Dokumentenprüfung.
Zweitens die Datenlage: Beim Training in den eigenen Tool-Umgebungen wie Westlaw entsteht genau der Leistungssprung, den die Benchmarks zeigen, und diesen Zugang will der Konzern keinem Dritten geben. Drittens der Zinseszinseffekt, den Hron mit dem Vergleich von Miete und Eigenheim beschreibt: Jede Expertenbewertung bei Produktupdates ist Trainingsdatenmaterial, das nur bei einem eigenen Modell als "Eigenkapital" kumuliert, statt beim Modellanbieter zu verpuffen.
Übertragbar ist das Muster allerdings nur bedingt. Der Ansatz funktioniert, weil Thomson Reuters drei seltene Zutaten vereint: exklusive Datenbestände, hunderte angestellte Fachexperten und Workflows, in denen sich Qualität objektiv messen lässt. Für Unternehmen mit diesem Profil zeigt der Fall, dass die Open-Source-Community den Frontier-Laboren nur um Monate hinterherläuft und 40 Millionen Dollar für ein konkurrenzfähiges Spezialmodell reichen können. Wer dagegen weder proprietäre Daten noch Evaluationsinfrastruktur besitzt, kauft mit einem eigenen Modell vor allem laufende Wartungskosten ein.
Die eigentliche Lektion ist Hrons Schlusspointe: Entscheidend ist nicht der Besitz von Intelligenz an sich, sondern das Wissen, welche Intelligenz wichtig genug ist, um sie zu besitzen.
Erster Einsatz bei Dokumentenprüfung in hohem Volumen
Zum Start übernimmt Thomson die Funktion Tabular Analysis in CoCounsel Legal, wo ein kleineres, günstigeres Modell wirtschaftlich sinnvoll ist. Das Produkt bleibt mehrmodellig, Administratoren können umstellen. Thomson soll nicht als Orchestrator dienen, sondern Teilaufgaben wie Zitatprüfung übernehmen. Kundendaten fließen laut Unternehmen nicht ins Training.
Eine kleine Version erscheint als Open-Weight-Modell auf Hugging Face unter nichtkommerzieller Lizenz, ein technischer Bericht und ein Developer-Portal sollen folgen. Mit Kanzleien laufen laut Hron erste, noch unverbindliche Gespräche über direkte Lizenzierung.
KI-News ohne Hype – von Menschen kuratiert
Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.
Jetzt abonnieren