OpenVLA와 Octo: 어떤 시각 언어 행동 모델이 승리합니까?
OpenVLA (7B) 와 Octo (27M/93M) <unk>의 직접적인 비교, Open-X 교육, 라이선스, 하드웨어 요구 사항 및 배포 적합성. 오늘 올바른 VLA를 선택하십시오.
두 개의 랜드마크의 오픈 웨이트 VLA가 오픈 X-Embodiment Corpus에 훈련되었습니다. 하나는 7B 멀티모달 짐승이고 다른 하나는 27M/93M 희미한 디프러시온 트랜스퍼머입니다.
2026년 4월 업데이트 7B vs 93M 패럼 MIT 라이선스
[모든 모델을 탐색] [T1
TL;DR OpenVLA를 선택하면 넓은 언어 지형, Llama-2 척추, 그리고 조작 기준에 가장 좋은 엑스포-오프-오프-오프-박스 제로샷 행동
왜 이 비교가 중요 한 이유
오픈VLA와 옥토는 2024년에 출시된 두 가지 가장 많이 인용된 오픈 웨이트 비전 언어 액션 모델이며, 둘 다 오픈 X-Embodiment 데이터 세트에 훈련되어 있습니다. 2026년에 로봇 학습 스택을 세우고 있다면 [하우스 픽싱] (
이 페이지에서는 건축, 훈련 데이터, 배포 발자국, 언어 조건화 및 정직한 타협을 통해 진행됩니다. 대신 깊은 디렉토리 조사를 원한다면, 우리의 VLA 모델 디렉토리 또는 개인 OpenVLA 페이지 및 Octo 페이지 를 참조하십시오.
눈치채기 위한 비교
| Dimension | OpenVLA | Octo |
|---|---|---|
| Parameters | 7B | 27M (Octo-Small) / 93M (Octo-Base) |
| Backbone / architecture | Llama-2 7B LLM + DINOv2 + SigLIP vision encoders | Transformer diffusion policy from scratch, multimodal token stream |
| Action head | Discretized action tokens output by the LLM | Conditional diffusion over continuous actions (DDPM-style) |
| Training data | ~970K trajectories from Open X-Embodiment | ~800K trajectories from Open X-Embodiment |
| Language conditioning | Native (LLM-level), strong instruction following | Supported via text or goal-image tokens, weaker instruction grounding |
| Action space | 7-DOF end-effector delta (extensible via fine-tune) | Flexible — supports varied action dims across embodiments |
| Inference hardware | ~16 GB VRAM bf16, ideally A100/H100/L40S for real-time | Runs comfortably on a single RTX 4090 or smaller |
| Throughput (typical) | ~5–10 Hz on A100 without quantization | ~10–30 Hz on consumer GPUs with action chunking |
| Fine-tuning cost | LoRA on 1× A100 is practical; full fine-tune needs multi-GPU | Full fine-tune feasible on a single 24 GB GPU |
| License | MIT | MIT |
| Paper | Kim et al., CoRL 2024 (arXiv:2406.09246) | Octo Model Team, arXiv:2405.12213 |
| Code | github.com/openvla/openvla | github.com/octo-models/octo |
건축물 심층 다이빙
OpenVLA: 언어 모델 첫 번째 설계
OpenVLA는 기본적으로 액션 토큰을 발송하는 것을 배운 Llama-2 7B입니다. 이미지는 합성 DINOv2 + SigLIP 시각 스택에 의해 암호화되어 LLM의 토큰 스트림에 투영됩니다. 연속적인 액션은 한 차원당 256 개의 칸으로 분별되어 모델이 자율적으로 예측하는 새로운 어휘로 취급됩니다. 액션 공간은 언어와 같은 토큰 공간에서 표현되기 때문에 LLM의 구성 일반화를 물려받습니다. 모델은 훈련 중에 본 적이 없는 새로운 지침을 따라갈 수 있으며, 저자들은 RT-2-X와 BridgeData V2 스위트에서 RT-2-X의 55B 변수보다 7x 적은 매개 변수를 사용하더라도 RT-2-X보다 더 뛰어난 성능을 보여줬습니다.
비용은 크기에 달려 있습니다. OpenVLA의 7B 무게와 오토레그레시브 디코딩은 실시간 제어가 까다롭습니다. 실제로 팀들은 액션
Octo: 정책 규모의 전파 변환기
오크토는 반대 방향으로 설계되었습니다. 오크토 팀은 대부분의 로봇 정책이 7B 언어 모델을 필요로하지 않는다는 관찰에서 출발했습니다. 그들은 다양한 실시예와 행동 공간을 흡수 할 수있는 작고 빠르고 다형 네트워크가 필요합니다. 오크토는 이미지, 언어 및 목표 이미지에 조건화된 액션 순서를 표시하는 조건화 전파 헤드로 처음부터 훈련 된 트랜스포머입니다. 액션 덩어리들이 들어있어요
27M 및 93M 변종은 소비자 하드웨어에서 높은 주파수를 사용할 수 있을 만큼 작으며, 디스포이션 공식은 다모달 디스포먼트 배포를 깨끗하게 캡처합니다. 타협은 오크토의 언어 이해는 LLM 전공보다는 훈련 시간 배포에 기반하고 있기 때문에 진정으로 새로운 명령에 따라 무사한 교육은 오픈VLA보다 약합니다.
교육 데이터 및 일반화
두 모델 모두 [오픈 X-Embodiment]
OpenVLA가 승리할 때
- 언어 지형이 필요합니다. 운영자가 자유형 명령어를 발행할 경우 ("그리그 왼쪽에 빨간 블록을 넣으십시오"), OpenVLA의 Llama-2 척추는 작곡 언어 이해를 박스 밖으로 제공합니다.
- ** H100/A100급 하드웨어가 있습니다.** 40 GB GPU를 가진 작업 스테이션에서 OpenVLA는 편안하게 실행되며 언어 충실성이 스스로 보상됩니다.
- ** 데이터를 수집하기 전에 강력한 제로샷 기본 라인을 원합니다.** OpenVLA의 LIBERO-Spatial, LIBERO-Object, BridgeData V2에 대한 발표된 숫자는 탄탄한 출발점입니다.
- ** 특정 실시예에 대한 LoRA 정밀 조정을 계획합니다.** OpenVLA 커뮤니티는 많은 LoRA 레시피를 배포했으며, 어댑터 무게는 완전한 정밀 조정에 비해 작습니다.
오크토가 승리할 때
- ** 당신은 24 GB 소비자 GPU 또는 엣지 박스에 배포하고 있습니다.** Octo-Small (27M) 는 인식 및 계획 스택과 함께 실행할 수 있을 만큼 작습니다.
- 당신의 임무는 다모달 디모네스트이션 모방입니다. 디포지션 헤드들은 자연스럽게 "이렇게하는 방법은 세 가지다" 디모네스트이션 배포를 캡처합니다.
- ** 다양한 실시예에 정교하게 조정하고 싶습니다.** Octo는 다양한 액션 차원과 카메라 조사를 수용하도록 명시적으로 제작되었습니다.
- 고등 제어 주파수 문제. Octo의 작은 발자국과 분포는 하나의 GPU에서 20
30 Hz 폐쇄 루프 제어를 달성 할 수 있게 한다.
정직한 타협
두 모델 모두 보편적인 승자가 아닙니다. OpenVLA의 언어 장점은 좁은 작업 분포에 미세하게 조정되면 사라집니다. 그 시점에서 93M 정책이 생성 할 수있는 행동을위한 7B 매개 변수를 지불합니다. 반대로, Octo의 언어 컨디션은 배포되지 않은 명령어에서 조용히 실패할 수 있으며, 정책이 LLM를 요구할 수 없을 때 "로봇이 왜 잘못된 객체를 선택했는지"를 디버깅하는 것이 더 어렵습니다. 귀하의 배포가 언어 경미 및 작업 좁으면 (빈 선택, [하우스 키팅]
시청할 수 있는 기준
단일 종이에 대한 숫자를 신뢰하기보다는 표준화된 스위트를 사용하여 두 모델을 모두 자신의 작업 분포에 평가하는 것이 좋습니다. [LIBERO 벤치마크]
미묘하지만 중요한 점: OpenVLA와 Octo 사이의 기준 번호는 항상 사과와 사과가 아닙니다. OpenVLA의 발표 된 LIBERO 점수는 LIBERO 궤도에 대한 짧은 LoRA 미세조각을 통해 7B 기본 체크포인트로 수집되었습니다. Octo는 Octo-Base 평가된 제로샷으로 수집되었습니다. 이 두 가지를 복제할 때 정확한 체크포인트, 정비된 요리법, 평가 프로토콜을 기록하세요. 온도, 액션 덩어리, 시간적 집합의 작은 차이로 인해 커뮤니티 결과에서 볼 수 있는 확산의 대부분은 나타납니다.
배포의 정신을 위해, 우리는 또한 하나의 모델에 참여하기 전에 자신의 작업의 10 에피소드에서 짧은 내부 평가 리너스를 실행하는 것을 권장합니다. 두 일간의 비교 비용은 잘못된 기지에 8 주간의 정교 조정 비용보다 훨씬 낮습니다.
실제에서 정렬 할 수 있는 요리법
두 모델 모두 정렬 파이프라인을 성숙시켰으며, 레시피는 모델에 대해 많은 것을 보여줍니다. OpenVLA의 참조 LoRA 레시피는
Octo의 정렬 스토리는 더 간단합니다. 기본 체크포인트를 로드하고, 작업 공간이 다르다면 작업 특정 헤드를 첨부하고, 궤도 데이터에 10K
생태계 및 도구
OpenVLA는 Llama 생태계로부터 혜택을 누리고 있습니다. LLM 추론을 위해 만들어진 모든 양분화, 서비스 및 어댑터 도구가 적용됩니다. 사용자 지정 샘플러를 사용하여 vLLM를 통해 OpenVLA를 실행하거나 4 비트와 비트와 바이트로 양분화하거나 생산 처리량을 위해 TensorRT-LLM로 컴파일 할 수 있습니다.
오크토의 생태계는 작지만 로봇과 잘 맞물려 있습니다. 레로봇, RLDS 및 대부분의 현대 데이터 수집 스택은 그것을 원산적으로 지원합니다. 이미 생태계의 호그징 페이스 로봇 측면을 구축하고 있다면, 오크토는 홈 팀 모델처럼 느껴집니다.
우리의 권고
이 경우 첫 번째 VLA 배포가 되고 A100급 작업장 (workstation) 를 가지고 있다면, OpenVLA를 시작하면 언어 동작은 몇 주 동안 프롬프트 템플릿 엔지니어링을 절약할 수 있으며 MIT 라이선스는 상업적인 경로를 열어두고 있습니다. 소비자 하드웨어에 배포하고, 높은 주파수를 실행하거나 좁은 작업을 목표로 하고 있다면, Octo-Base를 선택하고 자신의 텔레오프 데이터를 정렬하십시오. 많은 제작팀들은 _both_를 실행하게 됩니다. 명령에 따라 오프닝VLA를 앞면으로, 빠른 낮은 수준의 정책으로 Octo를 실행하게 됩니다.
RCSV는 OpenArm, Unitree G1 및 Mobile ALOHA 기장 모두에 배치되었습니다. 특정 로봇과 작업에 대한 모델 추천을 원한다면 [콜 예약]
** 관련 읽기** RT-X vs OpenVLA → 방산 정책 vs ACT → 최고의 VLA 모델 2026 → 열린 X-Embodiment 데이터 세트 → LIBERO 벤치마크 → Teleop 데이터 수집 →
여기 있는 모든 VLA는 여러분의 직접적인 시위에 맞춰 조정될 수 있습니다.







