Tools(으)로 돌아가기

VLA 모델 비교 2026: Octo, OpenVLA, π₀, GR00T, SmolVLA, OpenPI

로봇 학습을 위한 시각 언어 행동 (VLA) 모델을 비교하십시오. Octo, OpenVLA, π₀, GR00T, SmolVLA. 건축, 훈련 데이터, 추론 속도, 하드웨어 호환성, 실제 로봇 성능.

비전 언어 행동 (VLA) 모델은 2026년 일반적 로봇 학습의 지배적인 건축물이다. 이 페이지에서는 모든 주요 VLA 모델 건축 세부 사항, 훈련 데이터, 추론 속도, 하드웨어 호환성 및 실제 로봇 성능 을 비교하여 프로젝트에 적합한 모델을 선택할 수 있습니다.

2026년 4월 16일 업데이트 · RCSV 연구팀 · 12분 읽기

VLA 모델은 무엇 입니까?

비전 언어 행동 (VLA) 모델은 ** 카메라 이미지** (비전) 및 ** 자연어 작업 명령** (언어) 를 입력 및 출력으로 ** 로봇 모터 명령** (행동) 로봇이 직접 실행할 수 있는 결합 위치, 최종 효과자 속도 또는 토크를 취하는 엔드-투-엔드 신경 네트워크입니다.

VLA의 핵심 통찰력은 건축적 통일입니다. VLA 이전에는 로봇 학습 시스템은 모듈형 파이프라인이었습니다. 별도의 시야 모델은 객체를 감지하고, 별도의 계획자는 전략을 생성하고, 별도의 컨트롤러는 모터 명령을 생성합니다. 각 모듈은 독립적으로 훈련되었고, 모듈 사이에 오류가 캐스케이드되었습니다. VLA는 이 파이프라인을 단일 모델로 대체하여, 인터페이스 엔지니어링과 오류 전파를 제거하여 시범에 종합적으로 훈련되어 있습니다.

"언어" 구성 요소는 VLA를 이전 로봇 학습 접근법과 질적으로 구별하는 것입니다 [ACT] (T0) 또는 [방포 정책] (T1)). 자연어 지침 ("붉은 잔을 들고, "토울을 반으로 접어라") 에 조건함으로써 단일 VLA는 훈련받은 특정 작업에 제한되지 않고 열린 일련의 작업을 처리 할 수 있습니다. 언어 기반은 전 교육받은 LLM 척추에서 비롯되어 세계 지식을 물리 영역으로 옮긴다.

건축 비교

Model Vision 엔코더 LLM Backbone Action Head 액션 공간 Context Length
Octo Custom ViT Transformer (93M total) Diffusion Continuous (EEF delta) 2 frames
OpenVLA SigLIP (400M) LLaMA 2 (7B) Discrete tokenization 256 bins per dim 2048 tokens
π₀ PaLI-based (est.) Custom (~3B total) 플로우 매칭 Continuous (joint + EEF) Not disclosed
GR00T N1 Eagle (NVIDIA) Custom (~2B total) Dual (diffusion + MLP) Continuous (whole-body) Not disclosed
SmolVLA SigLIP (400M) SmolLM2 (135M) Diffusion Continuous (joint pos) 1024 tokens
OpenPI SigLIP (400M) LLaMA-based (~3B) 플로우 매칭 Continuous (joint + EEF) 2048 tokens

모델 깊은 다이빙

오크토 (UC 버클리)

Octo는 오픈소스 VLA 커뮤니티의 작업마이다. 버클리 로봇 학습 연구소 (Ghosh et al., 2024) 에서 구축된 Octo는 명확한 엔지니어링 철학을 가지고 설계되었습니다. 단일 GPU에 정렬할 수 있을 만큼 작고, 실시간 제어에 충분히 빠르며, 구현을 통해 작동할 수 있을 만큼 일반적입니다.

** 아키텍처:** 공유 관심층을 통해 토큰화된 이미지 관측과 언어 지침을 처리하고, 디스포지션 헤드 (diffusion head) 를 통해 동작을 생성하는 컴팩트 트랜스포머. 디스포지션 헤드는 별도의 액션 칩 메커니즘이 필요하지 않고 16 단계 액션 칩 (0.32 초 50 Hz) 를 예측하고, 시간 매끄러운 기능을 제공합니다.

** 훈련 데이터:** 오픈 X-Embodiment 데이터 세트에서 800K 에피소드, 브리지 V2 데이터 세트 (WidowX 로봇) 및 RT-1 데이터 (Google의 일상의 로봇) 로 중소되어 있습니다. 이것은 Octo가 WidowX 클래스 팔을 사용하여 테이블 조작에서 가장 잘 작동한다는 것을 의미합니다.

** 정비:** Octo는 50-100 시범을 가진 단일 A100에서 20-30분 동안 정비한다. 이 빠른 회전으로 빠른 반복을 위해 이상적입니다. 아침에는 50 개의 디모를 수집하고 점심 시간에 정비하고 오후에 평가합니다. RCSV에서는 파일럿 데이터 수집 프로젝트에서 기본 기준으로 Octo를 사용합니다. 왜냐하면 그것은 데이터 품질에 대한 가장 빠른 피드백을 제공하므로.

** 제한:** 93M 매개 변수 예산은 언어 이해와 시각적 추론을 제한한다. Octo는 공간적 추론을 필요로 하는 작업 ("판의 왼쪽에 컵을 넣는다") 또는 브리지 V2에서 잘 표현되지 않는 새로운 객체 범주와 어려움을 겪는다. 이러한 작업에 대해, OpenVLA의 더 큰 LLM 척추는 훨씬 더 잘 수행합니다.

**** 빠른 작업 로봇 정책이 필요한 팀, 제한된 컴퓨팅 또는 더 큰 모델에 참여하기 전에 데이터 수집 품질에 대해 반복하는 팀.

오픈VLA (스탠퍼드 / 버클리)

OpenVLA (Kim et al., 2024) 는 7B 매개 변수 LLM 척추가 본래 언어 조건화된 작업 일반화를 위한 충분한 용량을 제공하는 통찰력을 바탕으로 가장 유력한 오픈소스 VLA입니다. 보이지 않는 객체에서 새로운 작업 설명에 제로샷 전송을 입증하는 최초의 오픈 모델이었습니다.

** 아키텍처:** SigLIP 비전 코더 (400M 파램) 는 시각 토큰을 정교한 LLaMA 2 (7B 파램) 로 공급한다. 액션은 각 차원별 256 개의 분리된 칸으로 토큰화되어 다음 토큰으로 예측된다. 이 분리된 토큰화는 연속적인 전파 헤드보다 덜 표현적이지만 모델은 LLM의 전체 자동 퇴행성 생성 기계를 활용할 수 있게 한다.

** 훈련 데이터:** 오픈 X-Embodiment 데이터 세트에서 970K 에피소드 (22 로봇 실시예). Octo와 비교하여 더 넓은 실시예 포괄은 OpenVLA를 더 나은 로봇 간 일반화합니다.

** 정밀 조정:** 7B 매개 변수 크기 때문에 효율적인 정밀 조정을 위해 8xA100 (또는 동등한) 를 필요로 한다. LoRA 정밀 조정은 약간 낮은 성능의 비용으로 이 12A100s로 줄이는데, 새로운 작업에 100200 개의 시범이 권장된다. 정밀 조정은 4~8시간을 걸린다.

** 인퍼런스:** ~5 Hz A100, ~2 Hz Jetson AGX Orin에서. 실시간 배포를 위해 액션 덩어리 (예측 10-20 단계, 50 Hz에서 실행) 를 필요로 한다. 인퍼런스 당 200-500ms 지연은 로봇이 0.2-0.4 초 플랜에서 작동한다는 것을 의미합니다. 대부분의 조작 작업에 용납되지만 캡처 또는 삽입과 같은 반응 작업에 문제가 있습니다.

**어 조건으로 구성된 다 작업 시스템에서 가장 좋은 방법은 다양한 작업 지침을 처리하는 단일 모델을 필요로 하는 것입니다. 적절한 GPU 자원을 가진 연구팀.

피0 (물리적 지능)

π₀는 세르게이 레빈, 첼시 핀, 그리고 다른 버클리/스탠포드 졸업생들이 설립한 회사인 물리 지능에서 독자적인 최첨단 기술이다. π₀의 특징적인 기술 공헌은 ** 흐름 일치하는 액션 헤드**이다.

** 흐름 일치와 전파:** 둘 다 행동 궤도를 생성하는 생성 모델이지만 흐름 일치는 파급의 곡선 소음-신호 경로보다는 직선 인터폴레이션 경로를 (최적 운송) 사용한다. 실제적으로 흐름 일치는 더 적은 소명 단계 (4-8 대 16-32 대포) 로 konverges, 질 손실 없이 더 빠른 추론을 가능하게 한다.

** 성능:** π₀ 시범은 오픈소스 모델이 일치하지 않은 크로스-타스킹 일반화를 보여줍니다. 단일 체크포인트 접는 세탁, 클리어 테이블, 포장 상자 및 부엌 기기를 작동하는 것. π₀와 오픈 모델 사이의 격차는 더 큰 독자적인 데이터 세트 및 흐름 일치 아키텍처 모두에 의한 멀티태스킹 벤치마크에서 15-25%의 성공률을 추정합니다.

** 액세스:** π₀는 공개적으로 사용할 수 없습니다. 물리 지능은 선택된 파트너에게 API 액세스 기능을 제공합니다. 커뮤니티 재시행 OpenPI ( 아래에 참조) 는 공개된 건축 세부 사항을 사용하여 대략적인 정보를 제공합니다.

** 최첨단 성능을 필요로 하고 공급자 로크-인을 기꺼이 받아들이는 PI 파트너십 협약을 가진 팀들

GR00T N1 (NVIDIA)

GR00T N1는 NVIDIA의 인형형 중심의 기반 모델입니다. 이사는 아이작 랩 생태계와 함께 Jetson Thor 엣지 배포에 최적화되었습니다.

중 시스템 아키텍처: GR00T N1는 서로 연결된 두 모델을 사용한다. " 느린 " VLA 척추 (2-5 Hz) 는 고 수준의 행동 계획을 만들기 위해 시각 장상과 언어 지침을 해석하고, 계획 (200+ Hz) 는 계획을 반응적 피드백으로 모터 명령으로 변환합니다. 이것은 의도적인 계획과 반사 모터 제어 사이의 생물학적 차이를 반영합니다.

시프스트 트레이닝: 아이작 랩에서 1M+ 에피소드 (분야 무작위로 물리 시뮬레이션) 에 미리 훈련되어, 50K-100K 실제 인형 에피소드로 정밀 조정되었습니다. 이 시프스트 접근법은 이동과 전체 신체 균형에 잘 작동하지만 여전히 조작 작업에 상당한 실제 데이터를 필요로합니다.

** 하드웨어 생태계:** NVIDIA Jetson Thor (인류형 컴퓨터 플랫폼) 에 최적화. 또한 저조된 성능으로 Jetson AGX Orin에서 실행됩니다. GR00T SDK는 피겨, 애기리티 로봇, 앱트론ik 및 1X 인류형에 표준화된 인터페이스를 제공합니다.

** 인간형 로봇 프로젝트, 특히 NVIDIA 생태계에서 이미 사용되고 있는 프로젝트. 테이블탑 조작 팔에 적합하지 않습니다.

스몰블라 (Hugging Face)

SmolVLA는 VLA 모델이 소비자 하드웨어에 유용하게 일반화되지 않고 충분히 작게 만들어질 수 있다는 Hugging Face의 베팅입니다. 총 500M 매개 변수로, 연구자와 취미가 가장 접근 가능한 VLA입니다.

건축: SigLIP 비전 코더 (400M) 는 SmolLM2 (135M 매개 변수 언어 모델) 와 디스푸시온 액션 헤드 (diffusion action head) 와 결합되어 있다. 작은 언어 모델은 복잡한 추론을 제한하지만 여전히 일반적인 작업 설명에 의미 있는 언어 조건을 제공합니다.

LeRobot 통합: SmolVLA는 [LeRobot]T2) 프레임워크의 1급 시민이다. 레로봇 코드베이스의 일부로 훈련, 평가 및 배포 스크립트가 유지됩니다. Hugging Face Hub에서 데이터 세트 로딩은 네이티브입니다. 이 긴밀한 통합은 단일 도구 체인으로 데이터 수집에서 배포 정책으로 이동할 수 있음을 의미합니다.

** 성능:** 표준 벤치마크 (SIMPLER, Bridge V2 eval) 에서 SmolVLA는 파라미터 수의 1/14에서 OpenVLA의 성공률의 60-75%를 달성합니다. 단일 작업 미세 조정에서는 충분한 시범 (200+) 으로 간격이 5-10%로 좁아집니다.

** 레로봇 사용자, 소비자 GPU, 교육 및 Jetson AGX Orin ($ 1,999) 대신 Jetson Orin NX ($ 499) 에 추론을 실행해야하는 팀의 취미가 **

OPPI (공동체)

OpenPI는 공개된 논문과 역공학적 설계 선택에 기초하여 피지컬 인텔리전스의 π₀ 아키텍처의 커뮤니티 재시행입니다. 그것은 오픈 소스 패키지에서 π₀를 다른 VLA에서 구별하는 흐름 일치하는 액션 헤드를 제공합니다.

** 건축:** LLaMA 기반의 척추 (~ 3B 매개 변수 총) 및 흐름 일치하는 액션 헤드 (플로우 매칭 Action Head) 을 가진 SigLIP 비전 코더. 액션 헤드 (플로우 매칭 Head) 는 추론을 위해 8 단계의 흐름 일치를 사용하며 원활한 연속적인 액션 예측을 달성합니다.

교육: 커뮤니티에서 열린 X-Embodiment, DROID, 그리고 커뮤니티에 의해 기여된 데이터 세트의 조합에 대한 교육을 실시합니다. 전체 교육 데이터는 원래의 π₀ 데이터 세트에 비해 작습니다. 이는 일반화를 제한합니다.

** 성능:** 비교적 비교적 높은 기준에 따라 보고된 π₀ 성능의 약 70-80%를 달성한다. 흐름 일치 헤드는 일부 사용자들이 접촉에 풍부한 작업에 선호하는 디푸전 기반 대안 (Octo, SmolVLA) 보다 특히 부드러운 행동 궤도를 제공합니다.

이용적: 오픈소스 접근과 전체 모델을 검사하고 수정할 수 있는 능력을 원하는 흐름 일치 구조에 관심이 있는 연구자.

하드웨어 호환성

Model WidowX / ALOHA OpenArm 1 Franka Unitree G1 Koch / SO-100
Octo Native Fine-tune Native Fine-tune Fine-tune
OpenVLA Native Fine-tune Native Fine-tune Fine-tune
π₀ Supported Via PI API Supported Via PI API Not supported
GR00T N1 Not targeted Not targeted Not targeted Native Not targeted
SmolVLA Native Native (LeRobot) Fine-tune Fine-tune Native (LeRobot)
OpenPI Community Fine-tune Community Fine-tune Community

"네이티브" = 이 실시예에서 얻은 데이터에 미리 훈련된; 0 샷 또는 최소한의 정렬을 가진 작업. "Fine-tune" = 이 특정 로봇에 대한 50-200 개의 시범이 필요합니다. "공동체" = 지역 사회가 유지되는 통합; 수동 설정을 필요로 할 수 있습니다.

자신 의 VLA 를 훈련 시키십시오

대부분의 팀은 처음부터 훈련하기보다는 기존 VLA를 정렬해야 합니다.

정렬 (대부분의 팀에 권장)

  1. ** 기본 모델을 선택하세요:** 속도로는 Octo, 능력으로는 OpenVLA, 레로봇 통합으로는 SmolVLA
  2. 특정 로봇 플랫폼에서 목표 작업의 50~200개의 시범을 수집하세요 ([데이터 수집 안내서]T3 참조))
  3. ** 형식 데이터:** 모델의 예상 형식으로 변환 (SmolVLA/Octo의 LeRobot 데이터 세트 형식, OpenVLA의 RLDS)
  4. ** 파이인 튜닝:** 오ક્ટો: 1 GPU에서 30 분. SmolVLA: 1 GPU에서 1-2 시간. OpenVLA: 8 GPU에서 4-8 시간 (또는 LoRA와 함께 1-2 GPU)
  5. 평가: 50개의 평가 에피소드를 실행하고 성공률을 측정하고 실패 모드를 분석한다

처음부터 훈련 (전문 건축물)

처음부터 훈련은 100K+의 시범과 상당한 계산 (64-256 GPU 시간 오크토 스케일, 1,000+ GPU 시간 오픈VLA 스케일) 을 필요로 한다. 이것은 새로운 아키텍처, 독자적인 대규모 데이터 또는 기존 모델이 충족하지 못하는 요구 사항만 있으면 적합하다.

인퍼런스 속도 벤치마크

Model A100 (80GB) Jetson AGX Orin Jetson Orin NX RTX 4090 Action Chunking Needed?
Octo 40+ Hz 15-20 Hz 8-12 Hz 30+ Hz No (built-in)
OpenVLA 5-8 Hz 1.5-3 Hz OOM 4-6 Hz Yes (10-20 steps)
π₀ 10-15 Hz 5-8 Hz Not tested 8-12 Hz Optional
SmolVLA 25+ Hz 10-15 Hz 5-8 Hz 20+ Hz No (built-in)
OpenPI 8-12 Hz 3-5 Hz OOM 6-10 Hz Optional

FP16 정확성, 배트 크기 1, 단일 카메라 입력으로 측정된 벤치마크. 실제 세계 성능은 카메라 해상도와 조회수에 따라 달라진다.

언제 어떤 VLA를 사용해야 하는가

이 결정 트리를 사용하여 모델을 선택하십시오.

  • 이주 최소 계산으로 결과를 필요로 합니다?Octo. 30분 안에 정렬하고 같은 날 배포합니다.
  • 어 조건으로 구성된 멀티 작업이 필요하십니까?OpenVLA. 가장 좋은 오픈소스 언어 기반.
  • ** 레로봇과 함께 일하고 원동생 생태계 지원을 원하십니까?** → ** 스모일VLA**.
  • 인류형 로봇 응용 프로그램을 구축하는 것?GR00T N1. 전체 신체 인류형 제어용으로 제작되었습니다.
  • ** 가장 원활한 동작 궤도를 원하십니까 (접촉이 풍부한 작업)?** → OpenPI. 흐름 일치는 전파보다 원활한 움직임을 만들어 냅니다.
  • 최고의 성능이 필요하고 PI 파트너십이 필요합니까?π₀. 최첨단, 하지만 독자적인.
  • ** 매우 구체적인 단일 작업이 있고 언어 조건화 필요 없습니까?** → VLA 대신 [ACT] (T4) 또는 [방포 정책] (T5) 를 고려하십시오. 그들은 더 간단하고 훈련이 더 빠르고 종종 단일 작업 성공률을 달성합니다.

VLA- 호환성 교육 자료 수집

VLA 교육 데이터는 보다 간단한 정책에 대한 데이터와 다른 구체적인 요구 사항이 있습니다.

카메라 요구 사항

  • 상화: 최소 640x480, 권장 1280x720. VLA 비전 코더는 내부적으로 샘플을 하위에서 224x224 또는 336x336로 표시하지만, 더 높은 소스 해상도는 하위 샘플링 중에 세부 사항을 보존합니다.
  • ** 프레임 속도는:** 카메라 프레임에 30fps, 50Hz 공동 상태 기록과 동기화. 부합은 데이터 로더 (최근 이웃 간섭) 에 의해 처리된다.
  • 뷰: 최소 1개의 손목 카메라 + 1개의 외부 카메라. 대부분의 VLA는 2-4개의 조사를 허용한다. 추가 조치는 성능을 향상시키지만 저장 및 추론 비용을 증가시킨다.
  • ** 캘리브레이션:** 카메라 내적 및 외적 요소는 기록되어야 하지만 대부분의 VLA 아키텍처에서 요구되지 않습니다 (그들은 직접 픽셀에서 시각적 특징을 학습합니다).

행동 형식

  • 공동 위치: 50 Hz에서 절대공동 위치를 기록합니다. 이것은 가장 보편적인 형식입니다.
  • ** 최종 효과자 포지:** 또한 EEF 위치 + 사용 가능한 경우 사각형 방향성을 기록합니다. 일부 모델 (Octo, π₀) 은 EEF 공간 동작을 직접 사용할 수 있습니다.
  • 지착기 상태: 쌍성 (오픈/ 닫힌) 또는 연속지착기 위치. 공동 데이터와 동일한 50 Hz 주파수에서 기록한다.

언어 표기

  • 모든 에피소드는 자연어 작업 설명이 필요합니다. "붉은 잔을 들고 소추에 넣으십시오".
  • 구체적이고 설명적인 언어를 사용 하십시오. "사업을 해 보세요"는 쓸모없습니다. "왼쪽 가장 큰 물체를 선택하세요"는 유용합니다.
  • 언어 일반화를 개선하기 위해 같은 작업에 대한 에피소드마다 다른 언어: "배를 잡아라", "커피 컵을 들어라", " 테이블에서 컵을 가져라"

출력 형식

  • HDF5: ACT, 방출 정책 및 직접 오토 소비 표준
  • RLDS (TensorFlow 데이터 세트): OpenVLA 사전 훈련 데이터 형식에 필요한
  • LeRobot 형식: 포옹 얼굴 허브에서 파켓 + 비디오 파일. SmolVLA 내이티브

RCSV의 [데이터 수집 서비스]T6) 는 기본으로 세 가지 형식 모두에서 출력합니다. 제공되는 모든 데이터 세트에는 HDF5, RLDS 및 LeRobot 호환되는 수출이 포함되어 있으므로 재편화 없이 모든 VLA를 훈련시킬 수 있습니다.

관련 독서

  • [2026년 물리 인공지능: 기초 모델의 심층 다이빙]
  • [VLA 모델 설명 (인트로) ]
  • [행정 정책 설명]
  • [로봇의 분포 정책]
  • [레로봇 프레임워크 가이드]
  • [SpaceMouse의 원격 조작 안내서]
  • [RCSV 데이터 서비스]

RCSV에서 VLA 교육 데이터를 수집

표준화된 HDF5, RLDS, 그리고 LeRobot 출력 50+ 로봇 설정. 2500 달러의 파일럿으로 시작하세요.

데이터 서비스를 탐구 우리와 연락하세요

여기 있는 모든 VLA는 여러분의 직접적인 시위에 맞춰 조정될 수 있습니다.

Demos 수집 → 하드웨어 실행 → 정책 점수를 →