Geht die Robotersteuerung dank KI-Technologie natürlich? Google’s RT-2 verspricht das!

- Google stellt den Robotics Transformer 2 (RT-2) vor, eine bahnbrechende KI-Technologie, die eine natürliche Sprachsteuerung von Robotern ermöglicht.
- RT-2 nutzt Sprachmodelle wie Bard und ChatGPT, um Roboter darauf zu trainieren, Aktionen basierend auf Text- und Bilddaten aus dem Web auszuführen.
- Mit RT-2 ausgestattete Roboter können Aufgaben schnell erlernen, wie etwa das Erkennen und Entsorgen von Müll, was das Potenzial zeigt, die Robotikanwendungen zu revolutionieren.
Google’s neueste Innovation in der künstlichen Intelligenz, der Robotics Transformer 2 (RT-2), bahnt in der Welt der Robotik neue Wege. Durch die Nutzung modernster KI-Technologie, ähnlich den Systemen, die KI-Chatbots wie Bard und ChatGPT antreiben, zielt Google darauf ab, Robotern zu ermöglichen, Aufgaben effizienter und effektiver auszuführen. Vincent Vanhoucke, Leiter der Robotik bei Google DeepMind, stellte RT-2 als ein „Modell der ersten seiner Art für Vision-Sprache-Aktion (VLA)“ vor, das es Nutzern ermöglicht, Roboter mit natürlicher Sprache zu steuern.
Diese bahnbrechende Entwicklung ermöglicht es Robotern, Text- und Bilddaten aus dem Internet zu interpretieren und entsprechende Aktionen auszuführen. Mit RT-2 macht Google Fortschritte bei der Revolutionierung der Art und Weise, wie Roboter die Welt um sie herum verstehen, und verbessert damit letztlich ihre Fähigkeiten in verschiedenen Bereichen, beginnend mit der banalen, aber wesentlichen Aufgabe, Müll zu entsorgen.
KI-Technologie für die herkömmliche Robotersteuerung von Google’s RT-2
Google’s RT-2, das visionäre Vision-Sprache-Aktion (VLA) Modell, hat das Robotik-Feld um Sprünge vorangebracht. Durch die Nutzung von Technologie, die der von KI-Chatbots wie Bard und ChatGPT ähnelt, überwindet RT-2 die Grenzen der herkömmlichen Robotersteuerung. Im Gegensatz zu Chatbots, die Textdaten für menschliche Interaktionen verarbeiten, stehen Roboter vor einer komplexeren Herausforderung: dem Verständnis ihrer physischen Umgebung. Diese Unterscheidung stellt eine einzigartige Hürde dar, da Roboter Objekte unterscheiden, Kontexte interpretieren und präzise Aktionen basierend auf ihren Wahrnehmungen ausführen müssen.
Vincent Vanhoucke betonte die Komplexität des robotischen Verständnisses und wies darauf hin, dass das Erkennen eines einfachen Objekts wie eines Apfels viel einfacher ist, als zwischen einem köstlichen roten Apfel und einem roten Ball zu unterscheiden, bevor das gewünschte Element gegriffen wird. Google’s RT-2 schließt diese Lücke effektiv und befähigt Roboter, reale Szenarien zu verstehen und auf Anweisungen in natürlicher Sprache zu reagieren. Durch die Kombination von Sprachverständnis und visueller Wahrnehmung läutet RT-2 ein neues Zeitalter der Robotik ein, mit Anwendungen in der Fertigung, im Gesundheitswesen, bei Katastrophenhilfemaßnahmen und darüber hinaus. Mit den bemerkenswerten Fähigkeiten von RT-2 ist das Potenzial für die Zusammenarbeit zwischen Mensch und Roboter sowie transformative Fortschritte in verschiedenen Branchen kaum zu übertreffen.
Roboter zur Müllentsorgung befähigen
Bisher war das Training von Robotern für scheinbar einfache Aufgaben wie das Wegwerfen von Müll ein mühsamer und zeitaufwändiger Prozess. Ingenieure mussten dem Roboter beibringen, den Müll zu identifizieren, ihn angemessen zu greifen, einen geeigneten Mülleimer zu finden und die Abfälle dann sorgfältig zu entsorgen. Diese komplexe Choreografie erforderte umfangreiches Training und Feinabstimmung zahlreicher Parameter, was den Prozess langsam und eintönig machte.
Mit dem Aufkommen von RT-2 und seiner Fähigkeit, auf riesige Mengen an Online-Bilddaten zurückzugreifen, hat sich der Trainingsprozess für Roboter verändert. Das neue KI-Modell befähigt Roboter, Müll schnell zu identifizieren und die notwendigen Schritte autonom auszuführen, um ihn aufzuheben und korrekt zu entsorgen. Mit einer kleinen Menge an Trainingsdaten ermöglicht RT-2 bemerkenswert, dass Roboter Konzepte, die in ihren Sprach- und Sehtrainingsdaten eingebettet sind, übertragen können, sodass sie komplexe Aufgaben ausführen können, für die sie nie explizit trainiert wurden.
Bei einer beeindruckenden Demonstration identifizierte ein Roboter mühelos und hob ein Spielzeugdinosaurier auf, als er aufgefordert wurde, ein ausgestorbenes Tier aus einer Gruppe von Spielzeugen auszuwählen. Bei einer weiteren Herausforderung bewegte der Roboter geschickt ein kleines Spielzeug-Volkswagen-Auto in Richtung einer deutschen Flagge. Diese realen Beispiele veranschaulichen, wie die Sprach- und Sehfähigkeiten von RT-2 die Robotik auf ein neues Niveau an Vielseitigkeit und Reaktionsfähigkeit heben.
Wenn Sie dies lesen, sind Sie bereits einen Schritt voraus. Bleiben Sie mit unserem Newsletter auf dem Laufenden.
Haftungsausschluss. Die bereitgestellten Informationen stellen keine Anlageberatung dar. Cryptopolitan.com Wir übernehmen keine Haftung für Investitionen, die auf den auf dieser Seite bereitgestellten Informationen basieren. Wir empfehlen dringend, vor jeglichen Anlageentscheidungen eine unabhängige Recherche durchzuführen und/oder einen qualifizierten Fachmann zu konsultieren.

Aamir Sheikh
Aamir ist Tech-Journalist mit fast sechs Jahren Erfahrung in der Krypto- und Technologiebranche. Er absolvierte sein Studium an der MAJ University mit einem MBA in Finanzen und Marketing. Heute arbeitet er für Cryptopolitan, wo er über die neuesten Entwicklungen in den Kryptowährungsmärkten und Preisprognosen berichtet.
















