VLA Modelsに戻る

ブリッジVLA

ブリッジVLA:効率的な3D操作のための入力・出力調整 88.2% RLBench, 64% COLOSSEUM NeurIPS 2025.

[←モデル]

視覚言語モデルによる効率的な3D操作学習のための入力・出力調整

概要

BridgeVLAは,VLMのバックボーンをプリートレーニングして,2D画像を入力として撮影し,2D熱地図を輸出として生成し,ポイントクラウドをマルチビュー画像にプロジェクチャーしながら細調調化します.最小限のデータで効率的な3D操作を可能にします.

基準値

  • RLBench 88.2% (81.4%)
  • コロッセム 64.0%
  • 10以上のタスク 95.4%でタスクごとに3つの軌跡のみ

公式リンク

  • プロジェクトサイト
  • ニューリップス 2025 紙

引用

プロジェクトサイトをご覧ください.

ビデオの各部には 自分のデモで調整できます

デモを集める → それを実行するハードウェア → ポリシーをスコア →