Glossaryに戻る

VLA(Vision-Language-Actionモデル)

Foundation ModelLanguageCore Concept

視覚観測(RGB画像)、自然言語指示、ロボットの固有感覚を共同で処理してアクション出力を生成するニューラルネットワーク。VLAは大規模視覚言語モデル(PaLM-E、LLaVA、Geminiなどの VLM)を拡張し、アクションヘッドを追加することで、言語予測と並行してロボット関節位置またはエンドエフェクターデルタを出力するようにモデルを訓練します。注目すべきVLAには、RT-2(アクションをテキストトークンとしてトークン化し、VLMを微調整)、OpenVLA(オープンソース、7Bパラメータ、Open X-Embodiedで訓練)、pi0(Physical Intelligenceのフロー・マッチングVLA)が含まれます。VLAおよびVLM記事およびRCSVモデルカタログを参照してください。 実際の例を見る:当社の実世界評価 →

Related terms