RT-2
Robotics Transformer 2 — Google DeepMindのVLAモデルで、大規模ビジョン言語モデル(PaLI-XまたはPaLM-E)をファインチューニングしてロボットアクションをテキストトークンとして出力します。RT-2は、インターネット規模の事前学習によってロボットが新しい言語指示に従い、未知のオブジェクトとシナリオに一般化できることを実証しています。ロボットアクション予測をビジョン言語モデリング問題として扱うパラダイムを表しています。
Robotics Transformer 2 — Google DeepMindのVLAモデルで、大規模ビジョン言語モデル(PaLI-XまたはPaLM-E)をファインチューニングしてロボットアクションをテキストトークンとして出力します。RT-2は、インターネット規模の事前学習によってロボットが新しい言語指示に従い、未知のオブジェクトとシナリオに一般化できることを実証しています。ロボットアクション予測をビジョン言語モデリング問題として扱うパラダイムを表しています。