오픈VLA
오픈VLA: 7B 매개 변수 오픈소스 비전 언어 행동 모델 로봇 공학 Stanford, Berkeley, TRI, Google DeepMind, MIT
[← 모델]
로봇 조작을 위한 오픈소스 비전 언어 액션 모델. 스탠퍼드, 버클리, TRI, 구글 딥마인드, MIT
전체적인 설명
OpenVLA는 Open X-Embodiment에서 970K의 실제 로봇 시범을 통해 훈련된 7B 파라미터 비전 언어 행동 (VLA) 모델이다. Llama 2를 화합 시각 코더 (DINOv2 + SigLIP) 와 결합하고, 7 × 더 적은 파라미터로 RT-2-X (55B) 를 16.5% 이상 우월합니다.
건축 & 교육
- 7B 매개 변수
- Llama 2 척추 + DINOv2/ SigLIP 시각 엔코더
- ** 970K** 오픈 X-Embodiment의 디모
- 멀티 로봇, 제로샷 전송
- 소비자 GPU에 LoRA 정렬
공식 링크
- openvla.github.io
프로젝트 사이트 - github.com/openvla/openvla
코드 & 교육 - [
거 얼굴: openvla] T3 ) 모델 체크포인트
인용
CoRL 2025. BibTeX 프로젝트 사이트 참조.
여기 있는 모든 VLA는 여러분의 직접적인 시위에 맞춰 조정될 수 있습니다.







