Google veröffentlicht Datensatz für AR-Anwendungen

Googles Objectron-KI kann die Dimensionen von Objekten anhand zweidimensionaler Bilder erkennen. Mit dem jetzt veröffentlichten Datensatz können AR-Entwickler und Robotik-Tüftler von Googles Daten profitieren.

Moderne Bildanalyse-KIs sind meist mit 2D-Aufnahmen trainiert und erreichen bei der Motiv-Erkennung dank eines umfangreichen KI-Trainings hohe Genauigkeit. Wenn sie jedoch aus einem zweidimensionalen Foto 3D-Daten ableiten sollen, versagen die KI-Systeme – ihnen fehlt das räumliche Vorstellungsvermögen.

Dieses Vorstellungsvermögen ist jedoch elementar für Aufgaben, bei denen Faktoren wie Dimension, Ausrichtung und Position eines Objekts eine elementare Rolle spielen, etwa in der Robotik, bei Augmented Reality (News) oder für das autonome Fahren.

Anfang 2020 veröffentlichte Google eine 3D-Bildanalyse-KI, die diesem Problem entgegenwirken soll: MediaPipe Objectron kann die Dimensionen eines 3D-Objekts allein anhand einer Smartphone-Kamera abschätzen. Trainiert wurde die Künstliche Intelligenz mit einem von Google zusammengestellten 3D-Datensatz.

Objectron-Datensatz für 3D-Boxen

Nun stellen die KI-Forscher von Google den Objectron-Datensatz anderen Forschern kostenlos zur Verfügung. Für den Datensatz sammelten die Forscher kurze Videoclips von Objekten aus verschiedenen Blickwinkeln.

Jeder Clip wurde anschließend mit AR-Metadaten wie etwa Sparse Point-Clouds und Kamerapositionen versehen. Jede Aufnahme enthält außerdem Rahmendaten mit Informationen über die Position, Ausrichtung und Dimensionen des Objekts.

Insgesamt kommt Googles Objectron-Datensatz auf 14.000 Videoclips und vier Millionen kommentierte Bilder von verschiedenen Objekten. Der Datensatz enthält aktuell Aufnahmen von Fahrrädern, Büchern, Flaschen, Kameras, Cornflakes-Packungen, Stühlen, Tassen, Notebooks und Schuhen.

Neue Objectron-Variante für Mediapipe

Neben dem Datensatz veröffentlicht Google auch eine neue Variante der Objectron-KI, die aus zweidimensionalen Smartphone-Aufnahmen die Dimensionen von Schuhen, Stühlen, Tassen und Kameras erkennen kann.

Die neue Version setzt auf eine zweistufige Architektur: Zuerst analysiert ein Tensorflow Bilderkennungsmodell die Aufnahme und generiert einen 2D-Ausschnitt des gesuchten Objekts. Anschließend generiert das neuronale Netz eine dreidimensionale Bounding Box für das Objekt im Bildausschnitt.

Empfehlung

KI in der Praxis

Meta nutzte Piraterie-Netzwerke für KI-Trainingsdaten - mit Zuckerbergs Segen

Die KI ist in Googles Open-Source Framework MediaPipe eingebunden. Den Objectron-Datensatz plus Tutorial gibt es bei GitHub.

Via: Google

Community beitreten

Kommt in die DECODER-Community bei Discord,Reddit, Twitter und Co. - wir freuen uns auf euch!

Google veröffentlicht Datensatz für AR-Anwendungen

Objectron-Datensatz für 3D-Boxen

Neue Objectron-Variante für Mediapipe

Meta nutzte Piraterie-Netzwerke für KI-Trainingsdaten - mit Zuckerbergs Segen

Weiterlesen über Künstliche Intelligenz:

ChatGPT wächst zweistellig inmitten schrumpfender Web-Giganten

Trump will Bidens KI-Chip-Exportregeln kippen und vereinfachen

Netflix führt ChatGPT-gestützte Suche ein - erst mal nur für iOS-Nutzer

US-Denkfabrik warnt vor "umgekehrtem Brain Drain" in Chinas KI-Sektor

Umstrittenes KI-Manipulationsexperiment der Universität Zürich auf Reddit endet ohne Paper

OpenAIs o3 ist weniger AGI als ursprünglich angekündigt

Google veröffentlicht Datensatz für AR-Anwendungen

Objectron-Datensatz für 3D-Boxen

Neue Objectron-Variante für Mediapipe

Weiterlesen über Künstliche Intelligenz:

Artikel teilen

Bankverbindung