RT-2
Robotics Transformer 2 — un modelo VLA de Google DeepMind que ajusta un modelo de visión-lenguaje grande (PaLI-X o PaLM-E) para generar acciones de robot como tokens de texto. RT-2 demuestra que el preentrenamiento a escala de internet permite que los robots sigan instrucciones de lenguaje novedosas y generalicen a objetos y escenarios no vistos. Representa el paradigma de tratar la predicción de acciones de robot como un problema de modelado visión-lenguaje.







