Anzeige
Skip to content

Forscher entdecken automatisierte Jailbreak-Angriffe auf LLMs wie ChatGPT oder Bard

Forscher haben herausgefunden, dass es möglich ist, Angriffe zu automatisieren, die große Sprachmodelle (LLMs) wie ChatGPT, Bard und Claude dazu bringen, unerwünschte und potenziell schädliche Inhalte bereitzustellen. Herkömmliche Jailbreaks erfordern einen erheblichen manuellen Entwicklungsaufwand und können in der Regel von den LLM-Anbietern behoben werden. Diese automatisierten Angriffe können jedoch in großer Zahl erstellt und auf quelloffene und öffentlich verfügbare Chatbots angewendet werden.

Ähnliche gegnerische Angriffe gibt es seit mehr als einem Jahrzehnt im Bereich des maschinellen Sehens. Nach Ansicht der Forscher ist das ein Zeichen dafür, dass solche Bedrohungen KI-Systemen innewohnen könnten. Sie weisen darauf hin, dass diese Art von Angriffen möglicherweise nicht vollständig verhindert werden kann.

KI-News ohne Hype – von Menschen kuratiert

Mit dem THE‑DECODER‑Abo liest du werbefrei und wirst Teil unserer Community: Diskutiere im Kommentarsystem, erhalte unseren wöchentlichen KI‑Newsletter, 6× im Jahr den „KI Radar“‑Frontier‑Newsletter mit den neuesten Entwicklungen aus der Spitze der KI‑Forschung, bis zu 25 % Rabatt auf KI Pro‑Events und Zugriff auf das komplette Archiv der letzten zehn Jahre.

KI-News ohne Hype
Von Menschen kuratiert.

  • Mehr als 20 Prozent Launch-Rabatt.
  • Lesen ohne Ablenkung – keine Google-Werbebanner.
  • Zugang zum Kommentarsystem und Austausch mit der Community.
  • Wöchentlicher KI-Newsletter.
  • 6× jährlich: „KI Radar“ – Deep-Dives zu den wichtigsten KI-Themen.
  • Bis zu 25 % Rabatt auf KI Pro Online-Events.
  • Zugang zum kompletten Archiv der letzten zehn Jahre.
  • Die neuesten KI‑Infos von The Decoder – klar und auf den Punkt.
The Decoder abonnieren