VLA Modelsに戻る

オープンVLA

ロボット学のための 7Bパラメータオープンソースビジョン言語アクションモデル.スタンフォード,バークレー,TRI,GoogleDeepMind,MIT.

[←モデル]

ロボット操作のためのオープンソースビジョン・言語・アクションモデル スタンフォード,バークレー,TRI,GoogleDeepMind,MIT

概要

OpenVLAは,Open X-Embodimentから970Kのリアルワールドロボットデモで訓練された7Bパラメータ視力言語アクション (VLA) モデルである.Llama 2を融合した視覚エンコーダー (DINOv2 + SigLIP) と組み合わせ,RT-2-X (55B) を16.5%に上回る.

建築と訓練

  • 7Bパラメータ
  • Llama 2 脊椎 + DINOv2/ SigLIP 視覚エンコード
  • 970K オープンX-エンボディメントのデモ
  • 多ロボット,ゼロショット転送
  • 消費者のGPUのLoRA細かな調整

公式リンク

  • openvla.github.io プロジェクトサイト
  • [github.com/openvla/openvla]
  • [ハグリングフェイス: openvla] T3) 検問所モデル

引用

プロジェクトサイトをご覧ください.

ビデオの各部には 自分のデモで調整できます

デモを集める → それを実行するハードウェア → ポリシーをスコア →