言語条件付き制御ポリシー
言語条件付き制御ポリシーは、自然言語命令(例:「赤いカップを拾ってトレイの上に置く」)を視覚観測と共に追加入力として受け取り、単一の制御ポリシーネットワークが再学習なしに実行時に選択された複数のタスクを実行できるようにします。言語条件付けは通常、事前学習済み言語モデル(CLIP、T5、PaLM)で命令をエンコードし、結果の埋め込みを画像特徴と融合させることで実装されます。RT-2、OpenVLA、pi0などのVLAモデルは設計上言語条件付けされています。このアプローチはタスクごとに個別の制御ポリシーを学習する必要性を減らし、新しい命令表現への零ショット汎化をサポートします。 実践例を見る:当社の実世界評価 →







