オープンVLA
ロボット学のための 7Bパラメータオープンソースビジョン言語アクションモデル.スタンフォード,バークレー,TRI,GoogleDeepMind,MIT.
[←モデル]
ロボット操作のためのオープンソースビジョン・言語・アクションモデル スタンフォード,バークレー,TRI,GoogleDeepMind,MIT
概要
OpenVLAは,Open X-Embodimentから970Kのリアルワールドロボットデモで訓練された7Bパラメータ視力言語アクション (VLA) モデルである.Llama 2を融合した視覚エンコーダー (DINOv2 + SigLIP) と組み合わせ,RT-2-X (55B) を16.5%に上回る.
建築と訓練
- 7Bパラメータ
- Llama 2 脊椎 + DINOv2/ SigLIP 視覚エンコード
- 970K オープンX-エンボディメントのデモ
- 多ロボット,ゼロショット転送
- 消費者のGPUのLoRA細かな調整
公式リンク
- openvla.github.io
プロジェクトサイト - [github.com/openvla/openvla]
- [ハグリングフェイス: openvla]
T3 ) 検問所モデル
引用
プロジェクトサイトをご覧ください.
ビデオの各部には 自分のデモで調整できます







