Anzeige
Skip to content

Neues Google-Modell soll Browser und Mobile-Apps autonom steuern

Image description
Google

Google Deepmind hat ein KI-Modell vorgestellt, das Web- und Mobile-Interfaces bedienen kann. Das Gemini 2.5 Computer Use Modell ist ab sofort als Preview verfügbar.

Entwickler können über die Gemini API auf das Modell zugreifen. Es basiert auf Gemini 2.5 Pro und soll Agenten ermöglichen, mit grafischen Benutzeroberflächen zu interagieren.

Das Modell arbeitet in einem Loop: Es erhält einen Screenshot der Umgebung, die User-Anfrage und eine Historie bisheriger Aktionen. Daraus generiert es UI-Aktionen wie Klicken, Tippen oder Scrollen. Nach der Ausführung wird ein neuer Screenshot an das Modell zurückgesendet, der Prozess wiederholt sich.

Google hat das Modell primär für Web-Browser optimiert, es funktioniert laut dem Unternehmen aber auch bei Mobile-UI-Kontrolle. Für Desktop-OS-Level-Kontrolle sei es noch nicht geeignet.

Anzeige

Laut Google übertrifft das Modell Alternativen bei den Benchmarks Online-Mind2Web, WebVoyager und AndroidWorld. Die Zahlen stammen aus eigenen Tests und Evaluierungen von Browserbase. Das Modell erreicht demnach über 70 Prozent Accuracy bei etwa 225 Sekunden Latenz.

Safety-Mechanismen gegen Missbrauch

Google nennt drei Hauptrisiken: intentionaler Missbrauch durch User, unerwartetes Modellverhalten und Prompt Injections im Web. Das Unternehmen hat nach eigenen Angaben Safety-Features ins Modell integriert.

Zusätzlich prüft ein Per-Step Safety Service jede vom Modell vorgeschlagene Aktion vor der Ausführung. Entwickler können über System Instructions festlegen, dass der Agent bestimmte High-Stakes-Aktionen ablehnt oder eine User-Bestätigung anfordert. Beispiele sind das Umgehen von CAPTCHAs oder die Kontrolle medizinischer Geräte.

Laut eigenen Angaben nutzt Google das Modell bereits für UI-Testing, Project Mariner, den Firebase Testing Agent und Funktionen im AI Mode in Search. Das Modell ist über Google AI Studio und Vertex AI verfügbar. Eine Demo-Umgebung hostet Browserbase.

Anzeige
DEC_D_Incontent-1

KI-News ohne Hype – von Menschen kuratiert

Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den „KI Radar"‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.

KI-News ohne Hype
Von Menschen kuratiert.

  • Mehr als 20 Prozent Launch-Rabatt.
  • Lesen ohne Ablenkung – keine Google-Werbebanner.
  • Zugang zum Kommentarsystem und Austausch mit der Community.
  • Wöchentlicher KI-Newsletter.
  • 6× jährlich: „KI Radar“ – Deep-Dives zu den wichtigsten KI-Themen.
  • Bis zu 25 % Rabatt auf KI Pro Online-Events.
  • Zugang zum kompletten Archiv der letzten zehn Jahre.
  • Die neuesten KI‑Infos von The Decoder – klar und auf den Punkt.
The Decoder abonnieren