브리지VLA
브리지VLA: 효율적인 3D 조작을 위한 입력 출력 조율 88.2% RLBench, 64% COLOSSEUM NeurIPS 2025.
[← 모델]
시각 언어 모델로 효율적인 3D 조작 학습을 위한 입력-출력 조정은
전체적인 설명
브리지VLA는 VLM 척추를 미리 훈련시켜 2D 이미지를 입력으로 촬영하고 출력으로 2D 온도 지도를 생성하고, 지점 클라우드를 멀티뷰 이미지로 프로젝하는 동안 미세하게 조정합니다. 최소한의 데이터로 효율적인 3D 조작을 가능하게합니다.
기준
- RLBench 88.2% (81.4%)
- 콜로시엄 64.0%
- 10+ 작업 95.4% 일 작업에 3개의 궤도만
공식 링크
- bridgevla.github.io
프로젝트 사이트 - [OpenReview]
T2 ) NeurIPS 2025 논문
인용
NeurIPS 2025: BibTeX 프로젝트 사이트를 참조하십시오.
여기 있는 모든 VLA는 여러분의 직접적인 시위에 맞춰 조정될 수 있습니다.







