VLA Models(으)로 돌아가기

브리지VLA

브리지VLA: 효율적인 3D 조작을 위한 입력 출력 조율 88.2% RLBench, 64% COLOSSEUM NeurIPS 2025.

[← 모델]

시각 언어 모델로 효율적인 3D 조작 학습을 위한 입력-출력 조정은

전체적인 설명

브리지VLA는 VLM 척추를 미리 훈련시켜 2D 이미지를 입력으로 촬영하고 출력으로 2D 온도 지도를 생성하고, 지점 클라우드를 멀티뷰 이미지로 프로젝하는 동안 미세하게 조정합니다. 최소한의 데이터로 효율적인 3D 조작을 가능하게합니다.

기준

  • RLBench 88.2% (81.4%)
  • 콜로시엄 64.0%
  • 10+ 작업 95.4% 일 작업에 3개의 궤도만

공식 링크

인용

NeurIPS 2025: BibTeX 프로젝트 사이트를 참조하십시오.

여기 있는 모든 VLA는 여러분의 직접적인 시위에 맞춰 조정될 수 있습니다.

디모를 수집하라 → 하드웨어가 실행되는 것 → 정책 점수를 →