ブリッジVLA
ブリッジVLA:効率的な3D操作のための入力・出力調整 88.2% RLBench, 64% COLOSSEUM NeurIPS 2025.
[←モデル]
視覚言語モデルによる効率的な3D操作学習のための入力・出力調整
概要
BridgeVLAは,VLMのバックボーンをプリートレーニングして,2D画像を入力として撮影し,2D熱地図を輸出として生成し,ポイントクラウドをマルチビュー画像にプロジェクチャーしながら細調調化します.最小限のデータで効率的な3D操作を可能にします.
基準値
- RLBench 88.2% (81.4%)
- コロッセム 64.0%
- 10以上のタスク 95.4%でタスクごとに3つの軌跡のみ
公式リンク
- プロジェクトサイト
- ニューリップス 2025 紙
引用
プロジェクトサイトをご覧ください.
ビデオの各部には 自分のデモで調整できます







