Skip to content
Read full article about: Neues KI-Modell von Alibaba macht statische Bilder nachträglich editierbar

Alibabas KI-Einheit Qwen hat ein neues Bild-Editierungsmodell veröffentlicht. Qwen-Image-Layered zerlegt Bilder in mehrere einzelne Ebenen mit transparentem Hintergrund (RGBA-Ebenen). Jede Ebene kann dann unabhängig bearbeitet werden, ohne andere Bildinhalte zu beeinflussen.

Das Modell ermöglicht einfache Bearbeitungen wie Größenänderung, Neupositionierung und Farbänderung einzelner Elemente. Nutzer können etwa den Hintergrund umfärben, Personen austauschen, Texte ändern oder Objekte löschen, verschieben und vergrößern.

Ein Bild kann wahlweise in 3 oder 8 Ebenen zerlegt werden. Zudem lässt sich die Zerlegung beliebig oft wiederholen – jede Ebene kann erneut in weitere Ebenen aufgeteilt werden. Das Qwen-Team bezeichnet den Ansatz als Brücke zwischen normalen Bildern und strukturierten, bearbeitbaren Darstellungen.

Das Qwen-Team stellt den Code bereit. Die Modelle sind auf Hugging Face und ModelScope verfügbar. Weitere Infos liefern der Blog sowie der technische Bericht. Wer es testen will, findet Demos auf Hugging Face und ModelScope.

Read full article about: KI-Modell von Anthropic löst Aufgaben mit fast fünf Stunden Zeithorizont

Die KI-Forschungsorganisation METR hat neue Testergebnisse für Claude Opus 4.5 veröffentlicht. Das Modell von Anthropic erreicht einen sogenannten 50-Prozent-Zeithorizont von etwa 4 Stunden und 49 Minuten. Das ist der höchste bisher gemessene Wert. Der Zeithorizont beschreibt, wie lange Aufgaben sein können, die ein KI-Modell mit einer bestimmten Erfolgsrate (in diesem Fall 50 Prozent) löst.

METR

Auffällig ist der Unterschied zwischen verschiedenen Schwierigkeitsstufen. Der 80%-Zeithorizont liegt weiter bei nur 27 Minuten, ähnlich wie bei früheren Modellen. Laut METR zeigt das, dass Opus 4.5 besonders bei längeren Aufgaben besser abschneidet als Vorgänger. Die theoretische Obergrenze von mehr als 20 Stunden hält METR indes für unwahrscheinlich und führt sie eher auf fehlende Testdaten und statistische Unschärfe zurück als auf die tatsächliche Leistungsfähigkeit des Modells.

Wie jeder Benchmark hat auch die METR-Messung Einschränkungen, unter anderem, dass der Benchmark auf nur 14 Testfällen basiert. Eine ausführliche Analyse der Schwächen steht hier.

Read full article about: ChatGPT lässt sich jetzt im Ton anpassen: OpenAI führt neue Personalisierungsoptionen ein

OpenAI ermöglicht Nutzern ab sofort, den Kommunikationsstil von ChatGPT anzupassen. In den "Personalisierung"-Einstellungen lassen sich verschiedene Eigenschaften wie Wärme, Enthusiasmus, die Verwendung von Überschriften und Listen sowie Emojis einstellen. Jede Eigenschaft kann auf "More" oder "Less" gesetzt werden. Zusätzlich gibt es einen Basis-Stil, etwa "effizient" für prägnant formulierte Antworten.

OpenAI erklärt, dass diese Einstellungen nur den Ton und Stil der Gespräche beeinflussen, nicht jedoch die eigentlichen Fähigkeiten des Chatbots. Sehr wahrscheinlich funktioniere diese Vorgaben als Anhängsel der "individuellen Hinweise", die sich im selben Fenster einstellen lassen.

Offener Google-Standard soll KI-Agenten schnell Nutzeroberflächen generieren lassen

Google stellt mit A2UI einen offenen Standard vor, der KI-Agenten das Erstellen grafischer Oberflächen erlaubt. Statt nur Textnachrichten zu senden, können KIs dynamisch Formulare oder Buttons generieren, die sich optisch nahtlos in die jeweilige App einfügen.

Read full article about: FunctionGemma: Googles lokale Mini-KI steuert Apps und Spiele per Sprache

Google hat FunctionGemma veröffentlicht, eine spezialisierte Version des kleinen Sprachmodells Gemma 3 270M. Das Modell wurde basierend auf dem im August vorgestellten Basismodell gezielt für das sogenannte "Function Calling" erweitert. Damit kann die KI nicht nur Texte generieren, sondern konkrete Befehle an Software weitergeben, um Kalendereinträge zu erstellen oder Spielelemente zu steuern. Über die AI Edge Gallery lässt sich auf Android-Geräten ein Farming-Minispiel ausprobieren, das Prompts wie "Plant the sunflower seed in plot 8" umsetzt. Hier gibt es eine Demo mit Physikrätseln, die sich durch natürliche Sprache direkt im Browser lösen lassen.

Da das Modell sehr kompakt ist, läuft es direkt auf Endgeräten wie Smartphones, was die Datensicherheit erhöht und Verzögerungen minimiert. Laut Google lässt sich die Zuverlässigkeit durch weiteres Training von 58 auf 85 Prozent steigern. FunctionGemma dient als Brücke zwischen natürlicher Sprache und Software und kann auch als "Verkehrsleiter" fungieren, der komplexe Anfragen an größere Modelle weiterleitet. Das Modell ist ab sofort auf Plattformen wie Hugging Face und Kaggle verfügbar.

Read full article about: OpenAI weitet Zugang zu günstigerem ChatGPT-Tarif "Go" deutlich aus

OpenAI hat die Verfügbarkeit seines günstigen Abonnements ChatGPT Go massiv ausgeweitet. Nach dem Start im August in Indien ist das Abo nun in über 70 weiteren Ländern verfügbar, darunter viele in Europa und Südamerika, wie aus einem aktualisierten Hilfe-Dokument hervorgeht. In Deutschland kostet der Zugang 8 Euro monatlich. Neben dem erweiterten Zugriff auf das Flaggschiff-Modell umfasst das Abo auch mehr Möglichkeiten zur Bildgenerierung, Datei-Analyse und Datenauswertung sowie ein größeres Kontextfenster für längere Gespräche. Nutzer können zudem Projekte organisieren und eigene GPTs erstellen. Nicht enthalten sind hingegen der Zugriff auf Sora, die API oder ältere Modelle wie GPT-4o.

Dem breiteren Rollout geht auch eine Sparmaßnahme voran: OpenAI hat den automatischen Modell-Router für Nutzer der kostenlosen Version und des Go-Abos kürzlich entfernt. Anfragen werden nun standardmäßig vom schnelleren GPT-5.2 Instant beantwortet. Nutzer müssen die leistungsfähigeren Reasoning-Modelle nun manuell auswählen, während der automatische Router nur noch in den teureren Tarifen aktiv bleibt.