RT-2
Robotics Transformer 2 — 谷歌 DeepMind 的 VLA 模型,微调大型视觉-语言模型(PaLI-X 或 PaLM-E)以将机器人动作输出为文本标记。RT-2 证明了互联网规模的预训练使机器人能够遵循新颖的语言指令并泛化到未见过的物体和场景。它代表了将机器人动作预测视为视觉-语言建模问题的范式。
Robotics Transformer 2 — 谷歌 DeepMind 的 VLA 模型,微调大型视觉-语言模型(PaLI-X 或 PaLM-E)以将机器人动作输出为文本标记。RT-2 证明了互联网规模的预训练使机器人能够遵循新颖的语言指令并泛化到未见过的物体和场景。它代表了将机器人动作预测视为视觉-语言建模问题的范式。