RT-2
Robotics Transformer 2 — ein VLA-Modell von Google DeepMind, das ein großes Vision-Language-Modell (PaLI-X oder PaLM-E) feinabstimmt, um Roboter-Aktionen als Text-Token auszugeben. RT-2 zeigt, dass Vortraining im Internet-Maßstab Robotern ermöglicht, neuartige Sprachanweisungen zu befolgen und auf ungesehene Objekte und Szenarien zu verallgemeinern. Es repräsentiert das Paradigma, die Vorhersage von Roboter-Aktionen als ein Vision-Language-Modellierungsproblem zu behandeln.







