Mit Giraffe wird ein Vorteil kommerzieller Chatbots Open Source

Midjourney prompted by THE DECODER

Giraffe ist ein Open-Source-Sprachmodell mit einem Kontextfenster von 32.000 Token, was es für viele Geschäftsanwendungen nützlich machen könnte.

Große Sprachmodelle wie GPT-4 zeigen beeindruckende Fähigkeiten, haben aber oft ein begrenztes Kontextfenster, was ihren Einsatz bei Aufgaben einschränkt, bei denen sie Dutzende von Seiten verarbeiten müssten. Varianten wie GPT-4-32k oder Anthropic's Claude mit einem Kontextfenster von 100.000 Token bieten einen viel größeren "Speicher" und sind daher in solchen Anwendungsfällen leistungsfähiger.

Nun haben Forschende das Kontextfenster des quelloffenen LLaMA-Modells um das Zehnfache erweitert. Das daraus resultierende Sprachmodell Giraffe liegt in einer Version mit 13 Milliarden Parametern und einem Kontextfenster von 32.000 Token vor, kann so dutzende Seiten Text verarbeiten und verfügt damit über eines der größten Kontextfenster aller Open-Source-Sprachmodelle.

Giraffe bietet Einblick in die Skalierung von Kontextfenstern

Da es sich um eine Open-Source-Version handelt, bietet die Forschung auch einige wichtige Einblicke in das Innenleben von Sprachmodellen und verschiedene Skalierungstechniken zur Vergrößerung des Kontextfensters. Das Abacus.AI-Team fand heraus, dass die lineare Skalierung, bei der der Positionsvektor durch einen Skalierungsfaktor geteilt wird, der die Eingabe innerhalb der Kontextlänge des ursprünglichen Kontextfensters anpasst, am effektivsten ist, um die Kontextlänge von Giraffe zu erhöhen.

Sie stellten auch fest, dass die Genauigkeit bei Aufgaben mit langem Kontext mit zunehmender Länge abnimmt, was die Grenzen der derzeitigen Techniken aufzeige. Zudem sei Perplexität, die üblicherweise zur Messung der Sprachmodell-Leistung verwendet wird, allein nicht ausreichend, um die Leistung bei Aufgaben mit langem Kontext zu messen. Es benötige daher in Zukunft neue Tests für solche Sprachmodelle.

Weitere Informationen und Daten sind auf GitHub verfügbar, das Modell Giraffe-v2-13b-32k wird auf Hugging Face gehostet.

Community beitreten

Kommt in die DECODER-Community bei Discord,Reddit, Twitter und Co. - wir freuen uns auf euch!

Mit Giraffe wird ein Vorteil kommerzieller Chatbots Open Source

Giraffe bietet Einblick in die Skalierung von Kontextfenstern

Google Gemini zieht erstmals an ChatGPT vorbei

Bericht: Microsoft soll ein Drittel von OpenAI halten, Umsatzbeteiligung sinkt dafür deutlich

Alibabas Qwen3-Next setzt auf schnellere MoE-Architektur

KI-Tools antworten immer – und immer häufiger mit Fake News

Nutzer hatten Recht: Anthropic bestätigt Qualitätsprobleme bei Claude

Anthropic zahlt Buchautoren 1,5 Milliarden US-Dollar Abfindung

Mit Giraffe wird ein Vorteil kommerzieller Chatbots Open Source

Giraffe bietet Einblick in die Skalierung von Kontextfenstern

Google Gemini zieht erstmals an ChatGPT vorbei

Bericht: Microsoft soll ein Drittel von OpenAI halten, Umsatzbeteiligung sinkt dafür deutlich

Alibabas Qwen3-Next setzt auf schnellere MoE-Architektur