VLA Models(으)로 돌아가기

OpenVLA와 Octo: 어떤 시각 언어 행동 모델이 승리합니까?

OpenVLA (7B) 와 Octo (27M/93M) <unk>의 직접적인 비교, Open-X 교육, 라이선스, 하드웨어 요구 사항 및 배포 적합성. 오늘 올바른 VLA를 선택하십시오.

두 개의 랜드마크의 오픈 웨이트 VLA가 오픈 X-Embodiment Corpus에 훈련되었습니다. 하나는 7B 멀티모달 짐승이고 다른 하나는 27M/93M 희미한 디프러시온 트랜스퍼머입니다.

2026년 4월 업데이트 7B vs 93M 패럼 MIT 라이선스

[모든 모델을 탐색] [T1] [공학자와 이야기] [T2]

TL;DR OpenVLA를 선택하면 넓은 언어 지형, Llama-2 척추, 그리고 조작 기준에 가장 좋은 엑스포-오프-오프-오프-박스 제로샷 행동 을 원하면 단 하나의 A100/H100를 추론할 수 있습니다. 다양한 실시예들을 통해 저렴하게 정렬하고 상품 GPU를 실행하는 컴팩트하고 빠른 디스포지션 트랜스포머가 필요할 때 Octo를 선택하여 속도와 유연성을 위해 낮은 언어 충실성을 받아들이십시오.

왜 이 비교가 중요 한 이유

오픈VLA와 옥토는 2024년에 출시된 두 가지 가장 많이 인용된 오픈 웨이트 비전 언어 액션 모델이며, 둘 다 오픈 X-Embodiment 데이터 세트에 훈련되어 있습니다. 2026년에 로봇 학습 스택을 세우고 있다면 [하우스 픽싱] (T3), [랩 자동화] (T4), 또는 인형 텔레오프 파이프라인 (T4) 이 거의 확실히 당신의 출발점입니다. 하지만 두 모델은 매우 다른 철학으로 설계되었습니다. 잘못된 선택은 몇 주간의 정렬과 많은 GPU 시간을 소요할 것입니다.

이 페이지에서는 건축, 훈련 데이터, 배포 발자국, 언어 조건화 및 정직한 타협을 통해 진행됩니다. 대신 깊은 디렉토리 조사를 원한다면, 우리의 VLA 모델 디렉토리 또는 개인 OpenVLA 페이지Octo 페이지 를 참조하십시오.

눈치채기 위한 비교

Dimension OpenVLA Octo
Parameters 7B 27M (Octo-Small) / 93M (Octo-Base)
Backbone / architecture Llama-2 7B LLM + DINOv2 + SigLIP vision encoders Transformer diffusion policy from scratch, multimodal token stream
Action head Discretized action tokens output by the LLM Conditional diffusion over continuous actions (DDPM-style)
Training data ~970K trajectories from Open X-Embodiment ~800K trajectories from Open X-Embodiment
Language conditioning Native (LLM-level), strong instruction following Supported via text or goal-image tokens, weaker instruction grounding
Action space 7-DOF end-effector delta (extensible via fine-tune) Flexible — supports varied action dims across embodiments
Inference hardware ~16 GB VRAM bf16, ideally A100/H100/L40S for real-time Runs comfortably on a single RTX 4090 or smaller
Throughput (typical) ~5–10 Hz on A100 without quantization ~10–30 Hz on consumer GPUs with action chunking
Fine-tuning cost LoRA on 1× A100 is practical; full fine-tune needs multi-GPU Full fine-tune feasible on a single 24 GB GPU
License MIT MIT
Paper Kim et al., CoRL 2024 (arXiv:2406.09246) Octo Model Team, arXiv:2405.12213
Code github.com/openvla/openvla github.com/octo-models/octo

건축물 심층 다이빙

OpenVLA: 언어 모델 첫 번째 설계

OpenVLA는 기본적으로 액션 토큰을 발송하는 것을 배운 Llama-2 7B입니다. 이미지는 합성 DINOv2 + SigLIP 시각 스택에 의해 암호화되어 LLM의 토큰 스트림에 투영됩니다. 연속적인 액션은 한 차원당 256 개의 칸으로 분별되어 모델이 자율적으로 예측하는 새로운 어휘로 취급됩니다. 액션 공간은 언어와 같은 토큰 공간에서 표현되기 때문에 LLM의 구성 일반화를 물려받습니다. 모델은 훈련 중에 본 적이 없는 새로운 지침을 따라갈 수 있으며, 저자들은 RT-2-X와 BridgeData V2 스위트에서 RT-2-X의 55B 변수보다 7x 적은 매개 변수를 사용하더라도 RT-2-X보다 더 뛰어난 성능을 보여줬습니다.

비용은 크기에 달려 있습니다. OpenVLA의 7B 무게와 오토레그레시브 디코딩은 실시간 제어가 까다롭습니다. 실제로 팀들은 액션 킹, bfloat16 추론, 그리고 전용 A100 클래스 GPU를 사용하여 사용하거나 특정 로봇에 대한 작은 액션 헤드를 LoRA-조정합니다. OpenArm 또는 AlphaRobot 플랫폼에서 OpenVLA는 작동하지만 언어 행동에는 부가가치를 지불합니다.

Octo: 정책 규모의 전파 변환기

오크토는 반대 방향으로 설계되었습니다. 오크토 팀은 대부분의 로봇 정책이 7B 언어 모델을 필요로하지 않는다는 관찰에서 출발했습니다. 그들은 다양한 실시예와 행동 공간을 흡수 할 수있는 작고 빠르고 다형 네트워크가 필요합니다. 오크토는 이미지, 언어 및 목표 이미지에 조건화된 액션 순서를 표시하는 조건화 전파 헤드로 처음부터 훈련 된 트랜스포머입니다. 액션 덩어리들이 들어있어요

27M 및 93M 변종은 소비자 하드웨어에서 높은 주파수를 사용할 수 있을 만큼 작으며, 디스포이션 공식은 다모달 디스포먼트 배포를 깨끗하게 캡처합니다. 타협은 오크토의 언어 이해는 LLM 전공보다는 훈련 시간 배포에 기반하고 있기 때문에 진정으로 새로운 명령에 따라 무사한 교육은 오픈VLA보다 약합니다.

교육 데이터 및 일반화

두 모델 모두 [오픈 X-Embodiment]T9) 데이터 세트에 훈련 받았습니다. 22 개체에서 대략 970K의 실제 로봇 궤도를 가진 다 기관 코퍼스. OpenVLA는 전체 970K 버전을 사용했으며, Octo는 구리 된 800K 궤도 하위 세트를 사용했습니다. 이 공유 출산은 두 모델 모두 프랭카, 와이도우X, 구글 로봇과 긴 꼬리 실험실 팔을 보았을 것을 의미합니다. 그러나 그들의 인덕티브 편향은 다릅니다. OpenVLA는 언어 모델 프리어를 상속합니다 ( 명령어 문장들 사이에서 일반화하기에 적합합니다). Octo는 디스포지션 프리어를 상속합니다 (다 모달, 고 주파수 궤도에서 좋습니다). [RCSV의 데이터 서비스]T10을 통해 수집된 자신의 텔레오프 데이터에 대해 정밀 조정하면, 이러한 프리어는 당신이 필요로하는 데이터의 양을 형성합니다.

OpenVLA가 승리할 때

  • 언어 지형이 필요합니다. 운영자가 자유형 명령어를 발행할 경우 ("그리그 왼쪽에 빨간 블록을 넣으십시오"), OpenVLA의 Llama-2 척추는 작곡 언어 이해를 박스 밖으로 제공합니다.
  • ** H100/A100급 하드웨어가 있습니다.** 40 GB GPU를 가진 작업 스테이션에서 OpenVLA는 편안하게 실행되며 언어 충실성이 스스로 보상됩니다.
  • ** 데이터를 수집하기 전에 강력한 제로샷 기본 라인을 원합니다.** OpenVLA의 LIBERO-Spatial, LIBERO-Object, BridgeData V2에 대한 발표된 숫자는 탄탄한 출발점입니다.
  • ** 특정 실시예에 대한 LoRA 정밀 조정을 계획합니다.** OpenVLA 커뮤니티는 많은 LoRA 레시피를 배포했으며, 어댑터 무게는 완전한 정밀 조정에 비해 작습니다.

오크토가 승리할 때

  • ** 당신은 24 GB 소비자 GPU 또는 엣지 박스에 배포하고 있습니다.** Octo-Small (27M) 는 인식 및 계획 스택과 함께 실행할 수 있을 만큼 작습니다.
  • 당신의 임무는 다모달 디모네스트이션 모방입니다. 디포지션 헤드들은 자연스럽게 "이렇게하는 방법은 세 가지다" 디모네스트이션 배포를 캡처합니다.
  • ** 다양한 실시예에 정교하게 조정하고 싶습니다.** Octo는 다양한 액션 차원과 카메라 조사를 수용하도록 명시적으로 제작되었습니다.
  • 고등 제어 주파수 문제. Octo의 작은 발자국과 분포는 하나의 GPU에서 2030 Hz 폐쇄 루프 제어를 달성 할 수 있게 한다.

정직한 타협

두 모델 모두 보편적인 승자가 아닙니다. OpenVLA의 언어 장점은 좁은 작업 분포에 미세하게 조정되면 사라집니다. 그 시점에서 93M 정책이 생성 할 수있는 행동을위한 7B 매개 변수를 지불합니다. 반대로, Octo의 언어 컨디션은 배포되지 않은 명령어에서 조용히 실패할 수 있으며, 정책이 LLM를 요구할 수 없을 때 "로봇이 왜 잘못된 객체를 선택했는지"를 디버깅하는 것이 더 어렵습니다. 귀하의 배포가 언어 경미 및 작업 좁으면 (빈 선택, [하우스 키팅]T11), 고정 위치 조립), Octo는 거의 항상 올바른 호출입니다. 만약 여러분의 배포가 언어에 많은데, 업무도 넓고 (가정 보조, 유연한 실험실 자동화) 있다면, OpenVLA는 그 발자취를 얻습니다.

시청할 수 있는 기준

단일 종이에 대한 숫자를 신뢰하기보다는 표준화된 스위트를 사용하여 두 모델을 모두 자신의 작업 분포에 평가하는 것이 좋습니다. [LIBERO 벤치마크]T12) 는 짧은 지평을 조작하는 것을 포함하고, [CALVIN]T13) 는 긴 지평을 사용하는 언어 조건 작업을 포함하고, [Google 로봇]T14) 는 테이블 상위 일반화를 포함합니다. OpenVLA와 Octo 모두 각각의 참조 번호를 게시합니다.

미묘하지만 중요한 점: OpenVLA와 Octo 사이의 기준 번호는 항상 사과와 사과가 아닙니다. OpenVLA의 발표 된 LIBERO 점수는 LIBERO 궤도에 대한 짧은 LoRA 미세조각을 통해 7B 기본 체크포인트로 수집되었습니다. Octo는 Octo-Base 평가된 제로샷으로 수집되었습니다. 이 두 가지를 복제할 때 정확한 체크포인트, 정비된 요리법, 평가 프로토콜을 기록하세요. 온도, 액션 덩어리, 시간적 집합의 작은 차이로 인해 커뮤니티 결과에서 볼 수 있는 확산의 대부분은 나타납니다.

배포의 정신을 위해, 우리는 또한 하나의 모델에 참여하기 전에 자신의 작업의 10 에피소드에서 짧은 내부 평가 리너스를 실행하는 것을 권장합니다. 두 일간의 비교 비용은 잘못된 기지에 8 주간의 정교 조정 비용보다 훨씬 낮습니다.

실제에서 정렬 할 수 있는 요리법

두 모델 모두 정렬 파이프라인을 성숙시켰으며, 레시피는 모델에 대해 많은 것을 보여줍니다. OpenVLA의 참조 LoRA 레시피는 T0 훈련 스택을 사용하여 단일 80 GB A100에 약 50K 단계에 대한 16 순위 어댑터를 훈련합니다. 완전한 정렬은 4 A100 또는 더 나은 것을 필요로합니다. 체크포인트는 일반적으로 LoRA 어댑터에서 150200 MB에 달하며, 공유된 7B 기반에 많은 작업 특수한 어댑터를 전송하는 것이 실용적입니다. 각 작업 스테이션이 약간 다른 프로토콜을 실행하는 [실내 자동화] (T15) 배포에 유용한 속성입니다.

Octo의 정렬 스토리는 더 간단합니다. 기본 체크포인트를 로드하고, 작업 공간이 다르다면 작업 특정 헤드를 첨부하고, 궤도 데이터에 10K50K 기하급수 단계를 실행합니다. 모델이 작기 때문에, 단일 24 GB GPU에 대한 완전한 정렬은 일상적이며 커뮤니티는 프랑카, UR5, xArm 및 여러 인형 플랫폼의 레시피를 공유했습니다. 데이터 파이프라인이 이미 LeRobot 또는 RLDS 형식으로 있다면, Octo는 마찰 없이 그것을 검색할 것입니다.

생태계 및 도구

OpenVLA는 Llama 생태계로부터 혜택을 누리고 있습니다. LLM 추론을 위해 만들어진 모든 양분화, 서비스 및 어댑터 도구가 적용됩니다. 사용자 지정 샘플러를 사용하여 vLLM를 통해 OpenVLA를 실행하거나 4 비트와 비트와 바이트로 양분화하거나 생산 처리량을 위해 TensorRT-LLM로 컴파일 할 수 있습니다.

오크토의 생태계는 작지만 로봇과 잘 맞물려 있습니다. 레로봇, RLDS 및 대부분의 현대 데이터 수집 스택은 그것을 원산적으로 지원합니다. 이미 생태계의 호그징 페이스 로봇 측면을 구축하고 있다면, 오크토는 홈 팀 모델처럼 느껴집니다.

우리의 권고

이 경우 첫 번째 VLA 배포가 되고 A100급 작업장 (workstation) 를 가지고 있다면, OpenVLA를 시작하면 언어 동작은 몇 주 동안 프롬프트 템플릿 엔지니어링을 절약할 수 있으며 MIT 라이선스는 상업적인 경로를 열어두고 있습니다. 소비자 하드웨어에 배포하고, 높은 주파수를 실행하거나 좁은 작업을 목표로 하고 있다면, Octo-Base를 선택하고 자신의 텔레오프 데이터를 정렬하십시오. 많은 제작팀들은 _both_를 실행하게 됩니다. 명령에 따라 오프닝VLA를 앞면으로, 빠른 낮은 수준의 정책으로 Octo를 실행하게 됩니다.

RCSV는 OpenArm, Unitree G1 및 Mobile ALOHA 기장 모두에 배치되었습니다. 특정 로봇과 작업에 대한 모델 추천을 원한다면 [콜 예약]

** 관련 읽기** RT-X vs OpenVLA → 방산 정책 vs ACT → 최고의 VLA 모델 2026 → 열린 X-Embodiment 데이터 세트 → LIBERO 벤치마크 → Teleop 데이터 수집 →

여기 있는 모든 VLA는 여러분의 직접적인 시위에 맞춰 조정될 수 있습니다.

Demos 수집 → 하드웨어 실행 → 정책 점수를 →