"Radioaktive Daten": Facebook entwickelt Tracking für KI-Training

Falls Künstliche Intelligenz zukünftig tatsächlich Wirtschaft und Gesellschaft umkrempelt, dann wird den Daten für das KI-Training ein besonderer Wert zuteil. Wie schützen wir uns vor schlechten Trainingsdaten oder bewahren die Rechte der Ersteller guter Trainingsdaten?

Zwar sind viele vortrainierte KI-Modelle und Trainingsdatensätze frei verfügbar. Aber je spezifischer die zu entwickelnde KI sein soll, desto genauer müssen auch die Trainingsdaten zusammengestellt werden.

Menschen müssen definieren, welche Inhalte im Datensatz stecken sollen. Dieser Schritt ist für das KI-Training ausschlaggebend, denn auf Basis dieser Daten wird die KI später ihre Entscheidungen fällen.

Ein gut zusammengestellter Datensatz mit seltenen Trainingsdaten könnte demnach einen hohen Wert haben.

Ist der Datensatz hingegen schlecht zusammengestellt, verfehlt die KI ihre Ziele, oder, schlimmer noch, sie produziert Ergebnisse, die zwar oberflächlich korrekt erscheinen, in denen aber Vorurteile stecken.

KI-Trainingsdatentracking gegen Diebstahl und Vorurteil

KI-Forscher von Facebook entwickeln jetzt eine Methode, mit der nachgewiesen werden kann, mit welchen Trainingsdaten eine Künstliche Intelligenz trainiert wurde.

Das Prinzip folgt dem eines Wasserzeichens: In ein Bild oder Video werden minimale Veränderungen eingefügt, die für das bloße Auge nicht sichtbar sind und die Genauigkeit einer Bildanalyse-KI nicht beeinflussen sollen.

Die Bilder in der obersten Reihe sind unbearbeitet, die darunter enthalten die Markierung. Die dritte Reihe zeigt die Markierung um den Faktor fünf vergrößert. Die letzte Zeile zeigt zu Demonstrationszwecken die Bilder mit der vergrößerten Markierung. Bild: Facebook AI

Ist dieses Wasserzeichen in einen Datensatz implementiert, kann es "mit hoher Wahrscheinlichkeit" im fertig trainierten KI-Modell nachgewiesen werden. So wäre offensichtlich, ob ein KI-Modell beispielsweise mit gestohlenen oder vorurteilsbehafteten Daten trainiert wurde. Die Blackbox KI würde dadurch ein stückweit transparenter.

Die Forscher sprechen bei ihrer Markierung auch von "radioaktiven Daten", analog zu entsprechenden Markern in der Medizin, die erst unter Röntgenstrahlung sichtbar werden. Laut der Forscher reicht es, wenn nur ein Prozent der gesamten Trainingsdaten markiert ist. Es sei "extrem schwierig", zu erkennen, ob ein Datensatz markiert ist oder übertragene Markierungen von einem trainierten KI-Modell zu entfernen.

Community beitreten

Kommt in die DECODER-Community bei Discord,Reddit, Twitter und Co. - wir freuen uns auf euch!

Empfehlung

KI und Gesellschaft

"Radioaktive Daten": Facebook entwickelt Tracking für KI-Training

KI-Trainingsdatentracking gegen Diebstahl und Vorurteil

OpenAI und Anthropic warnen die US-Regierung vor Deepseek und KI aus China

Weiterlesen über Künstliche Intelligenz:

Meta will KI-Verhaltenskodex der EU nicht unterzeichnen - OpenAI schon

Trump will KI-Unternehmen mit Bundesaufträgen zu politischer Neutralität verpflichten

Anthropic könnte bald 100 Milliarden Dollar wert sein – dank Claude Code

ChatGPT Agent: OpenAI stattet ChatGPT mit autonomen Agenten-Fähigkeiten aus

Kimi K2: Das nächste Open-Model-Wunder nach Deepseek kommt wieder aus China

Neue KI-Architektur verspricht besseres "System 2-Denken"

"Radioaktive Daten": Facebook entwickelt Tracking für KI-Training

KI-Trainingsdatentracking gegen Diebstahl und Vorurteil

Weiterlesen über Künstliche Intelligenz:

Artikel teilen

Bankverbindung