Anzeige
Skip to content

Googles Gemini 3.5 Transcribe erkennt über 85 Sprachen und filtert Füllwörter in Echtzeit heraus

Google hat Gemini 3.5 Transcribe vorgestellt, ein neues Sprache-zu-Text-Modell für präzise Echtzeit-Transkription. Das Modell erkennt mehr als 85 Sprachen automatisch, filtert Füllwörter wie "ähm" heraus, korrigiert Versprecher im laufenden Gespräch und formatiert den Text selbstständig. Laut Google erreicht es eine Wortfehlerrate von 4,0 Prozent im Streaming und 2,6 Prozent bei aufgezeichnetem Audio. Gegenüber dem Vorgänger Chirp 3 soll sich die Latenz um 70 Prozent verbessern. Über sogenanntes Function Calling kann das Modell Aufgaben wie Bilderzeugung oder Websuchen an andere Gemini-Modelle delegieren.

Das Modell steht über zwei Schnittstellen bereit: die Live-API für Echtzeit-Streaming mit sehr niedriger Verzögerung (gemini-3.5-transcribe-live) und die Interactions-API für aufgezeichnetes Audio mit Sprecherzuordnung und Zeitstempeln (gemini-3.5-transcribe).

Gemini 3.5 Transcribe ist ab sofort in Google AI Studio und auf der Gemini Enterprise Agent Platform verfügbar. Es steckt bereits in Gboard für Android (über "Rambler"), in der Gemini-App auf macOS und kommt bald in Chrome.

Anzeige

KI-News ohne Hype – von Menschen kuratiert

Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den "KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.

Quelle: Google