Research(으)로 돌아가기

VLA 모델 비교: RT-2, OpenVLA, π₀, SmolVLA, RoboFlamingo (2025)

2025 년 Vision-Language-Action (VLA) 모델: RT-2, OpenVLA, π₀, SmolVLA, RoboFlamingo의 완전한 비교. 매개 변수, 훈련 데이터, 추론 속도, 하드웨어 요구 사항, 오픈 소스 상태, 언제 처음부터 훈련에 대한 정렬을 할 때.

[← 연구]

가장 중요한 비전 언어 행동 모델의 실제 비교

VLA는 로봇 동작을 생성하기 위해 시각적 인식에서 기초 언어 지침을 모델링합니다.

비전 언어 LLM 활동

VLA 모델은 무엇 입니까?

비전 언어 행동 (VLA) 모델은 시각적 관측 (카메라 이미지) 과 자연어 명령어를 입력으로 받아들이고 출력으로 로봇 행동 예측을 생성하는 신경 네트워크입니다. 이전 로봇 학습 모델과 주요한 차이점은 ** 언어 조건화**입니다. 동일한 모델은 재교육 없이 다른 지침을 따라갈 수 있으며, 순수한 모방 학습 정책이 달성할 수 없는 작업 일반화를 가능하게합니다.

전형적인 VLA 아키텍처는 세 가지 구성 요소를 묶어 놓습니다.

  1. 비전 코더: 원본 픽셀 관측을 특징 표현으로 처리합니다 (일반적으로 CLIP ViT 또는 SigLIP)
  2. 언어 모델 척추: 언어 토큰과 함께 시각 토큰을 받는 사전 훈련된 LLM (Llama, Gemma, PaLM, Flamingo-style)
  3. ** 액션 헤드:** LLM 출력 토큰을 로봇 액션 예측에 매핑하는 가벼운 디코더

이 전제는 시각 언어 데이터에 대한 인터넷 규모의 사전 훈련이 LLM의 척추 기반 세계 지식을 제공한다는 것입니다. 이는 처음부터 훈련보다 훨씬 적은 로봇 특정 데이터로 로봇 조작에 전달됩니다.

다섯 가지 모델: 알아야 할 것

RT-2 (Google DeepMind, 2023)

RT-2 (로봇 트랜스포머 2) 는 Google DeepMind에서 PaLI-X (55B 매개 변수) 및 PaLM-E (562B 매개 변수) 위에 구축한 VLA입니다. 로봇 시범시에 막대한 시각 언어 모델을 끝에서 끝으로 정렬하여 언어 모델과 동일한 어휘에 텍스트 토큰으로 동작을 나타냅니다. 결과는 추론 시 새로운 지침에 대해 논의를 할 수 있는 모델입니다. "기밀 칩을 공룡으로 옮기십시오"라고 요청하는 것은 LLM가 의미학을 이해하기 때문에 보이지 않는 조화를 통해 작동합니다.

RT-2는 새로운 추론 능력을 보여주었습니다. 사슬의 사고는 작업 성능 향상을 촉발하고, 모델은 실행 중간에 사실적인 질문에 대답할 수 있습니다. 그러나, 그것은 ** 폐쇄적 소스** 구글은 무게 또는 훈련 코드를 공개하지 않았습니다. 당신은 자신의 로봇에서 RT-2를 정교하게 조정할 수 없습니다. 그것은 VLA 패러다임에 대한 기준 기준과 개념 증명이며 대부분의 실험실에 배치 가능한 도구가 아닙니다.

오픈VLA (스탠퍼드 + UC 버클리, 2024)

오픈VLA는 최초의 완전히 오픈소스, 대규모 VLA 모델이다. 그것은 프리스마틱 VLM (7B 매개 변수를 기반으로 Llama 2 + SigLIP 비전 엔코더) 를 구축하고 오픈 X-Embodiment에서 970k 로봇 시범을 정비했다. 오픈VLA는 방면당 256 개의 빈으로 동작을 분별하고 RT-2의 공식화를 따라 언어 토큰으로 예측한다.

HuggingFace에서 전체 훈련 레시피, 모델 무게 및 정렬 코드를 공개합니다. 새로운 작업에 정렬 OpenVLA는 일반적으로 50200 개의 시범이 필요하며 단일 A100에서 ~612 시간을 소요합니다. 모델은 A100에서 ~6 Hz로 추론을 실행합니다 (이 빠르지 않습니다. OpenVLA-OFT (2024) 는 LoRA 정교조정 지원을 추가하고 정교조정 시간을 24배 줄입니다.

피0 (물리적 지능, 2024)

π₀는 버클리 로봇 커뮤니티에서 세르게이 레빈, 첼시 핀 등이 설립한 스타트업인 피시컬 인텔리전스 (pi.ai) 에서의 VLA입니다. π₀는 디스크릿 액션 토큰보다는 흐름 일치 액션 헤드를 사용합니다. 이는 토큰 기반 VLA보다 더 부드럽고 유능한 궤도와 더 높은 주파수 제어 기능을 제공합니다. 기본 모델은 파리게마 (3B 매개 변수) 에 의해 구축되어 있으며, 디푸지션에서 영감을 받은 액션 생성 헤드 (action generation head) 이 있다.

피0는 오픈 웨이트 VLA에서 이전에 보여주지 않은 수준에서 실세계의 현명한 조작을 보여준다. 접는 세탁, 엉뚱한 테이블 청소, 객체를 조립한다. 무게는 ** 부분적으로 열려있다** 물리 지능은 상업적인 정비 서비스를 제공합니다.

스몰VLA (HuggingFace, 2025)

SmolVLA는 VLA 공간에 HuggingFace의 입력을 소비자 하드웨어에서 실행하도록 설계된 의도적으로 작고 효율적인 VLA입니다. SmolVLA는 언어 척추로 SmolLM2 (135M1.7B 매개 변수) 를 사용하며 시그립-400M와 결합하여 시각을 제공합니다. 전체 모델은 구성에 따라 450M2B 매개 변수입니다.

SmolVLA는 RTX 3090에서 ~30 Hz로 추론을 실행하고, 엔터프라이즈 GPU 없이 실시간 로봇 제어에 실질적으로 사용할 수 있는 최초의 VLA가 된다. 레로봇 데이터 세트에서 훈련되고 레로봇 훈련 스택과 원산적으로 통합된다. 복잡한 오픈 어휘자료 작업에 성능은 오픈VLA를 뒤쳐지만, 미세 조정 후 좁은 작업 도메인에서 일치하거나 초과한다. GPU 예산이 제한된 실험실에서는 SmolVLA가 가장 접근 가능한 출발점입니다.

로보 플라밍고 (베eking Institute of Technology + Microsoft Research, 2023)

로보 플라밍고는 로봇 조작을 위해 오프닝 플라밍고 비전 언어 모델 (9B 매개 변수를 MPT-7B + CLIP ViT-L에 기초로) 를 정밀하게 조정한다. RT-2 및 OpenVLA와 달리, 로보 플라밍고는 디코더만 사용한다. 이것은 건축물을 매우 유연하게 만들지만 추론 (A100에서 ~35 Hz) 에서 느리게 만듭니다.

로보 플라밍고는 주로 생산 준비된 모델이 아닌 연구 기여입니다. 그것의 핵심 통찰력은 OpenFlamingo의 맥락 내 학습 능력 (관계 창에서 몇 가지 시범 사례를 직접 먹여) 로보트 조작으로 전환된다는 것입니다. 당신은 맥락으로 14 시범 궤도를 제공 할 수 있으며 모델은 gradient 업데이트 없이 적응합니다. 이러한 "현황 내 로봇 학습"은 진정으로 새로운 것이며, 후속 작업에서는 아직까지 미흡한 것으로 밝혀졌습니다.

한 눈에 보이는 비교 테이블

Model Params Base LLM Training Data Inference Hz Open Source? Fine-tune?
RT-2 55B / 562B PaLI-X / PaLM-E RT-1 dataset + web 1–3 Hz No (Google internal) No
OpenVLA 7B Llama 2 + SigLIP Open X-Embodiment (970k) 6 Hz (A100) Yes (weights + code) Yes (LoRA / full)
π₀ ~3B PaliGemma pi.ai proprietary 10–25 Hz Weights (research) Via pi.ai (commercial)
SmolVLA 450M–2B SmolLM2 + SigLIP LeRobot datasets 30 Hz (RTX 3090) Yes (fully open) Yes (LeRobot native)
RoboFlamingo 9B OpenFlamingo (MPT-7B) Open X-Embodiment 3–5 Hz (A100) Yes (weights + code) Yes (+ in-context)

각 모델에 대한 하드웨어 요구 사항

Model Min GPU (inference) Recommended (inference) Fine-tuning GPU VRAM (inference)
RT-2 N/A (not available) TPU pod (Google) N/A N/A
OpenVLA RTX 3090 (slow) A100 40GB A100 80GB (full) / RTX 4090 (LoRA) ~16GB (BF16)
π₀ RTX 3090 RTX 4090 / A100 A100 40GB ~8GB (BF16)
SmolVLA RTX 3080 10GB RTX 3090 RTX 3090 / RTX 4090 2–6GB
RoboFlamingo A100 40GB A100 80GB 2× A100 80GB ~22GB (BF16)

행동 표현: 중요한 차이

각각의 모델이 어떤 작업을 잘 수행하고 얼마나 빨리 실행할 수 있는지 어떻게 행동으로 내보내는지 결정합니다.

  • ** 디스크리트 액션 토큰 (RT-2, OpenVLA, RoboFlamingo):** 액션들은 칸으로 양자화되어 (일반적으로 256개 차원) 그리고 LLM에서 텍스트 토큰으로 예측된다. LLM의 완전한 자율 퇴행 기계와 맥락 학습을 활용할 수 있게 한다. 단점은: 양자화 오류는 미세한 조작에 대한 정확성을 제한하고, 제어 주파수는 LLM 추론 속도로 제한된다.
  • 파수 일치 (π₀) 을 가진 연속적인 동작 헤드: 파수 감추기 유래의 흐름 일치 과정을 통해 동작은 연속적인 벡터로 예측된다. 부드럽고 정확한 궤도와 능숙한 제어를 가능하게 한다. 동원 매개 변수 수를 가진 토큰 기반 모델보다 높은 주파수.
  • ** 하이브리드 토큰 + 연속 (SmolVLA):** 논리용 언어 토큰; 동작용 연속 출력 헤드. 언어 일반화를 제어 정확성과 균형 잡는다.

언제부터 정규 조율 을 맞추어야 하며, 언제부터 훈련 해야 합니까?

거의 모든 팀에 있어서, 미리 훈련된 VLA를 정렬하는 것은 올바른 출발점이다. 처음부터 VLA를 훈련시키는 것은 수백만 개의 로봇 시범과 구글, 딥마인드, 물리 지능만이 을 할 수 있는 대규모 컴퓨팅 자원들을 필요로 한다. 실제 문제는 미리 훈련된 모델이 어떤 방식으로 정렬해야 하는지 그리고 어떻게 해야 하는지입니다.

정렬이 가능하면:

  • 목표 작업은 훈련 전 데이터와 비슷한 스타일 (탁판 조작, 픽업 및 장소, 부엌 작업)
  • 목표 작업의 50~500개의 시범이 있습니다.
  • 로봇 형태학은 오픈 X-Embodiment 또는 LeRobot 데이터 세트에서 나타납니다.
  • 작업 범주 내에서 합리적인 제로 샷 일반화가 필요합니다

처음부터 열 (또는 비VLA 정책을 사용)

  • 당신의 작업 영역은 사전 훈련과 근본적으로 다릅니다 (수중 조작, 수술 로봇, 산업 조립)
  • 액션 공간은 비표준 (예를 들어, 수동, 케이블 가동, >7 DoF 손)
  • 최대 추론 속도가 필요하고 작업의 일반성을 제한할 수 있습니다. 이 경우 ACT 또는 처음부터 훈련된 퍼포지션 정책은 특정 좁은 작업에서 정교한 VLA를 능가합니다.
  • 해석성 또는 안전적 제약으로 인해 큰 LLM 척추가 문제가 됩니다.

OPENVLA: 실용적인 단계

OpenVLA는 자체적인 정렬을 실행하려는 연구소들에 가장 접근 가능한 출발점입니다. 다음은 최소한의 작업 흐름입니다.

# Install OpenVLA dependencies
pip install openvla

# Fine-tune with LoRA (requires single RTX 4090)
python experiments/robot/finetune.py \
  --pretrained_checkpoint openvla/openvla-7b \
  --data_root_dir /path/to/your/lerobot/dataset \
  --dataset_name your_task_name \
  --run_root_dir ./runs \
  --use_lora True \
  --lora_rank 32 \
  --batch_size 16 \
  --num_steps 10000 \
  --learning_rate 2e-4

RTX 4090에서 LoRA를 통해 예상되는 정밀 조정 시간은: ~ 6 시간, 100 개의 시범과 함께 10k 단계. 완전한 정밀 조정에는 A100 80GB가 필요하며 ~ 18~24 시간 소요됩니다.

스모르블라 를 정렬 하는 것: 실용적 인 단계

SmolVLA는 레로봇과 직접 통합되어 로봇에서 실행되는 VLA로 가장 빠른 경로를 제공합니다.

python lerobot/scripts/train.py \
  policy=smolvla \
  env=aloha \
  dataset_repo_id=your-username/your-dataset \
  hydra.run.dir=outputs/train/smolvla_task \
  training.batch_size=32 \
  training.num_epochs=100 \
  policy.pretrained_backbone_kwargs.pretrained=true

어떤 모범 을 사용 해야 합니까?

SmolVLA를 시작하면

  • 실험실에는 소비자 GPU (RTX 3090 또는 비슷한)
  • 당신은 이미 레로봇 생태계를 사용하고 있습니다
  • 당신은 데모 수집에서 로봇 추론에서 가장 빠른 반복 순환을 원
  • 당신의 작업은 비교적 좁습니다 (한 테이블, 일관된 조명, 알려진 물체)

OpenVLA를 사용 하려면

  • 당신은 최고의 오픈 소스 일반화 성능을 필요로
  • A100 또는 H100에 접근할 수 있습니다
  • 당신의 작업은 훈련 중에 볼 수 없는 새로운 객체 범주 또는 명령어 문장을 포함합니다
  • 발표된 벤치마킹 결과를 비교하고

π₀를 고려하면:

  • 숙련된 조작 품질이 필요합니다 (다 손가락, 접촉 부)
  • 당신은 피시컬 인텔리전스와 함께 작업할 준비가 되어 있습니다
  • 작업은 OpenVLA가 제공하는 것보다 더 높은 제어 주파수를 필요로 합니다

다음의 경우 RoboFlamingo를 사용하십시오.

  • 맥락에서 로봇 학습을 원 (현황 창에서 시범 사례를 통해 새로운 작업에 적응하고 gradient 업데이트가 없습니다)
  • 당신은 작업 성능을 최적화하기보다는 몇 번의 일반화에 대한 연구를 하고 있습니다.

참조 RT-2:

  • 벤치마크에 대한 VLA 성능의 이론적 상위 한계를 설정
  • 글쓰기 관련 작업 그것은 가톨릭 VLA 참조
  • 하지만 시스템을 계획하지 마세요

성공적 인 정렬 을 위해 데이터 요구 사항

어떤 모델에 상관없이, 시범 품질은 가장 중요한 변수입니다. 소음, 불일치 또는 형식화되지 않은 데이터에 미세하게 조정된 VLA는 깨끗한 데이터에 훈련된 작은 비 VLA 정책보다 저질러질 것입니다. 주요 요구 사항:

  • ** 카메라 배치 일관성:** VLA는 특정 카메라 구성을 가진 시범에 미리 훈련되었습니다. 가능한 한 가깝게 일치하거나 미세 조정에서 카메라 포지 증강을 포함합니다.
  • ** 에피소드 형식:** HDF5 (RLDS 호환) 또는 레로봇 네이티브 형식. OpenVLA는 RLDS를 필요로 한다. SmolVLA는 레로봇을 선호한다. 훈련 전에 변환, 훈련 중에는 변환하지 않는다.
  • ** 언어 해설:** 각 에피소드는 자연어 명령 문자열이 필요합니다. 좁은 작업에 대해 작업에 대한 단일 고정 명령이 작동합니다. 일반화를 위해, 수집 중에 문장을 변경하십시오.
  • ** 최소 디모 수:** SmolVLA: 50+; OpenVLA: 100+; π₀: 200+ 새로운 작업 유형에 대해.

우리는 ALOHA, OpenArm, DK1 하드웨어에서 [데이터 수집 서비스] T3) 통신을 제공하며, 전체 수집 파이프라인을 직접 구축하지 않고 VLA를 정렬하고 싶은 팀들을 위해 LeRobot 및 RLDS 형식으로 출력합니다.

모든 모델 → 행동과 전파 정책 → OpenVLA vs Octo →

평가에 대해 읽는 것은 한 가지 실제 하드웨어에 대한 정책을 증명하는 것은 다른 것입니다.

실제 평가판을 실행하라 → 위원회 평가 자료가 있는 것 → 당신의 평가장치용 하드웨어 →