시각 언어 행동 모델: VLA가 어떻게 현대 로봇을 작동시키는지를 설명
VLA 모델은 무엇입니까? OpenVLA, pi0, RT-2와 같은 시각 언어 행동 모델이 어떻게 작동하는지, 전통적인 정책과 어떻게 다르는지, 그리고 RCSV 데이터와 어떻게 정교하게 조정할 수 있는지 알아보십시오.
[이미테이션 학습 가이드]
시각 언어 행동 모델은 GPT-4
실리콘밸리의 로봇 센터의 제리 허랑이
비전 언어 의 행동 모델 은 무엇 입니까?
시각 언어 행동 모델 (VLA) 은 시각 관측 (카메라 이미지) 및 자연 언어 지침을 입력으로 받아들이고 로봇 동작을
인터넷 데이터에 대한 사전 훈련은 로봇 척추에 물리적 세계의 풍부한 표현을 제공합니다. 물체가 무엇인지, 공간적으로 어떻게 연관되어 있는지, 언어의 의미는
VLA 아키텍처: 세 가지 구성요소
각 VLA는 동일한 3단계 아키텍처를 공유하지만 구현은 각 단계의 구현 방식에 크게 차이가 있습니다.
1. 비전 앵코더: 카메라 이미지를 시각 토큰의 연속으로 변환합니다. 대부분의 VLA는 미리 훈련된 비전 트랜스포머 (ViT) 를 사용합니다. 시각 코딩은 인터넷 사전 훈련에서 가장 직접적으로 전송되는 구성 요소입니다. 웹 이미지에서 배운 시각적 특징 (물질 인식, 공간 레이아웃, 텍스처 이해) 은 로봇 인식에 직접적으로 유용하기 때문입니다. 이미지 해상도 문제: 224x224는 표준이지만 미세한 점수를 제한하고 있습니다. 일부 모델 (pi0) 은 subcm 시각 정확성을 필요로 하는 작업에 384x384 또는 더 높은 것을 사용합니다.
2. 언어 조건의 척추: 언어 명령 토큰과 함께 시각 토큰을 처리하는 큰 언어 모델. 여기서 의미적 추론이 발생합니다. OpenVLA는 LLaMA-2 7B, RT-2는 PaLM-E 55B, pi0는 사용자 지정 3B 척추를 사용합니다. 척추 크기는 모델의 추론 능력과 추론 비용 모두 결정합니다.
3. 액션 헤드: 척추의 출력을 로봇에 대한 특정 액션으로 변환합니다. 이것은 VLA 아키텍처를 차별화하는 중요한 디자인 선택입니다.
- ** 토큰화된 액션 (RT-2, OpenVLA):** 연속적인 액션 공간을 칸으로 구분하여 (일반적으로 한 차원당 256 칸) 언어 모델의 토큰 예측 헤드를 사용하여 액션 토큰을 예측합니다. 언어 모델의 기존 출력 기계를 재사용하기 때문에 구현하기 쉽습니다. 제한: 분별화는 양량 오류 (~12cm 작업 공간에 걸쳐 256 칸에서 0.5mm) 를 도입하고, 다단계 예측은 느린 자율 퇴행성 생성이 필요합니다.
- ** 연속적 행동 회귀 (Octo):** 연속적 행동 값을 직접 예측하는 작은 MLP 헤드를 추가합니다. 토큰화된 접근 방식보다 낮은 지연시간이지만 언어 모델의 일반화 혜택 중 일부를 잃을 수 있습니다.
- ** 흐름 일치 행동 머리 (pi0):** 액션 분포를 연속적인 흐름으로 모델링하고, 분포형 비명 과정을 사용하여 샘플을 가져옵니다. 부드럽고 연속적인 액션 궤도를 생성합니다. 유능한 작업에 가장 좋습니다. 그러나 추론 시간 50-100ms를 추가합니다.
주요 모델 비교
| Model | Parameters | Action Head | Training Data | GPU for Fine-Tune | Inference 지연시간 | Access |
|---|---|---|---|---|---|---|
| RT-2 | 55B | Tokenized | Google internal + web | TPU v4 pod (not public) | ~1-2s per step | Closed (Google) |
| RT-2-X | 55B | Tokenized | Open X-Embodiment | TPU v4 pod (not public) | ~1-2s per step | Closed (Google) |
| OpenVLA | 7B | Tokenized | Open X-Embodiment (970K eps) | 1x A100 80GB | ~200ms per step | Open source (HuggingFace) |
| Octo | 93M | Continuous (diffusion) | Open X-Embodiment (800K eps) | 1x RTX 4090 24GB | ~50ms per step | Open source (HuggingFace) |
| pi0 | 3B | Flow-matching | Proprietary (10K+ hours) | Enterprise access only | ~100ms per step | Commercial (Physical Intelligence) |
RT-2 및 RT-2-X: 구글 딥마인드 기본 기준
2023년 구글 딥마인드가 발표한 RT-2 (로봇 트랜스포머 2) 는 로봇 제어로 시각 언어 모델을 확장하는 것이 질적으로 새로운 기능을 생산한 최초의 시범이었다. RT-2는 웹 데이터와 로봇 궤도에 대한 PaLI-X 비전 언어 모델을 동시에 조정하여 새로운 지침을 따르고 객체 속성에 대해 논하고 인터넷에서만 로봇 시범에서 볼 수 없었던 객체에 일반화 할 수있는 정책을 생산했습니다.
RT-2는 VLA가 사상의 연쇄 추론을 수행할 수 있음을 보여주었습니다. "출출을 청소하기 위해 사용할 수 있는 무언가를" 가져오라고 요청받았으며, 모델은 스폰지를 청소와 연관시키는 것을 명시적으로 지시하지 않고 현장에서 스폰지를 확인했습니다. 이러한 새로운 능력
RT-2-X는 RT-2를 오픈 X-Embodiment 데이터 세트에 대한 훈련 (로봇 실시예 22개에서 보여준) 으로 확장하여, 크로스 인보디먼트 훈련이 일반화를 향상시킨다는 것을 보여준다. 여러 로봇의 데이터에 대한 훈련 정책은 단일 로봇에 대한 훈련 정책보다 개별 로봇에 대한 수행 효과가 더 좋습니다.
오픈VLA: 오픈소스 시작점
2024년 스탠퍼드와 버클리 연구자들이 발표한 OpenVLA는 오픈소스 프리스마틱 VLM (LLaMA에 기반한 자체) 를 기반으로 VLA 미세조정을 민주화하고, 오픈 X-Embodiment 데이터셋에 대한 훈련으로 22개의 다른 실시예에서 970k 에피소드 컬렉션을 구성했다. 오픈VLA는 오늘날 대부분의 연구팀들이 사용하는 출발점으로, 그것은 완전히 오픈 소스이며, 잘 문서화되어 있으며, 표준 조작 기준에 대한 강력한 성과를 달성하기 때문입니다.
사용자 지정 작업에 대한 OpenVLA 정렬은 50-200 개의 시범, HuggingFace LeRobot 컨벤션으로 포맷 된 데이터 세트, 그리고 몇 시간 동안 훈련하는 단일 80GB A100 또는 H100 GPU가 필요합니다. 결과적으로 정책은 예전에 훈련된 시각 척추의 덕에 훈련에서 볼 수없는 장면 변동 및 새로운 객체 위치로 일반화 할 수 있습니다.
# OpenVLA 정렬 (편화) # 요구: 1x A100 80GB, ~4시간 200 데모 파이프에 대해 설치 openvla # LeRobot 형식 python 스크립트/ 변환_to_lerobot.py에서 데이터를 포맷합니다 \ --input_dir svrc_demos/ \ --output_dir lerobot_dataset/ # Fine-tune OpenVLA 작업 python finetune.py에 대한 작업에 대해
RCSV의 [데이터 수집 서비스]
오크토: 가벼운 대안
오크토 (Ghosh et al., 2024) 는 다른 접근 방식을 취한다: 대규모 언어 모델을 확장하는 대신, 재화 하드웨어에서 실행할 수 있을 만큼 작은 목적으로 만들어진 트랜스포머 아키텍처를 구축한다. 93M 매개 변수에서, 오크토는 OpenVLA보다 75배 작으며 RTX 4090
Octo는 토큰화된 동작보다는 디스포지션 액션 헤드를 사용하며, 보다 원활한 궤도를 생성한다. 언어 조건화와 목표 이미지 조건화 (로봇이 원하는 최종 상태의 그림을 언어로 설명하는 대신 보여주기) 를 모두 지원한다. A100 액세스 또는 가장자 하드웨어에 실시간 추론을 필요로 하는 팀에게는 Octo는 실용적인 선택이다. 200개의 사용자 정의 시범에서 Octo를 정렬하는 것은 단일 RTX 4090에서 약 2시간이 걸립니다.
타협: Octo의 작은 척추는 의미적 이해가 덜 된다. RT-2가 할 수 있는 사상의 연쇄 추론을 수행할 수 없다. 명령이 간단하고 새로운 객체에 일반화되는 작업은 중요한 것이 아니다. Octo의 성능은 계산 비용의 일부로 OpenVLA와 일치한다. 객체 속성에 대한 복잡한 언어 이해 또는 추론을 필요로 하는 작업에 OpenVLA 또는 더 큰 모델이 필요합니다.
pi0: 물리 지능의 일반적 정책
피시컬 인텔리전스 (pi.ai) 에서 얻은 pi0는 VLA 개발의 상업적 경계를 나타냅니다. 언어 모델 척추를 계승하는 OpenVLA와 달리, pi0는 연속적이고 부드러운 행동 궤도를 생성하는 흐름 일치하는 액션 헤드를 사용합니다. diskreet 토큰화된 액션보다 현명한 작업에 더 적합합니다. pi0는 수십 개의 작업과 하드웨어 플랫폼에서 10,000 시간 이상의 로봇 시범을 가진 독자적인 데이터 세트에 훈련되었습니다.
건축적으로 pi0를 구별하는 것은 " 느린 " 언어 조건적 추론 경로와 " 빠른 " 반응형 모터 제어 경로 사이의 분리입니다. 이것은 이중 프로세스 제어 시스템에 대한 인지 과학의 통찰력을 반영합니다. 느린 경로는 작업 명령과 현 현상을 처리하여 고 수준의 계획을 생성합니다. 빠른 경로는 저 지연성 모터 명령을 생성합니다. 이 결과로 장평선 추론과 높은 주파수 반응 제어 모두 처리할 수 있는 정책이 이루어지고 있습니다.
Pii0에 대한 접근은 Pii0 스타일의 아키텍처를 탐구하는 팀들을 위해, RCSV의 [Benchmarks] (
교육 데이터 요구 사항
VLA 성능 스케일은 사전 훈련 데이터 다양성과 작업에 대한 정밀한 조정 데이터 품질 모두와 함께합니다.
| Scenario | Fine-Tune Demos | Expected Success Rate | Notes |
|---|---|---|---|
| Zero-shot (no fine-tuning) | 0 | 10-30% | Works only if task is in pre-training distribution |
| Minimal fine-tuning | 10-50 | 40-60% | Sufficient for simple tasks with pre-trained backbone |
| Standard fine-tuning | 50-200 | 70-85% | Sweet spot for most tasks — best ROI on data collection |
| Heavy fine-tuning | 200-1000 | 85-95% | Diminishing returns above 500; variation matters more |
| Specialist fine-tuning | 1000+ | 90-98% | Industrial deployment quality; may overfit to task |
중요한 데이터 품질 요구 사항: 시범은 언어 지침을 메타 데이터로 포함해야 하며, 카메라 관점들은 배포 설정과 일치해야 하며, 시범은 정책이 마주할 모든 객체 포즈와 장면 구성을 포함해야 합니다. 다양한 구성의 200개의 시범이 반복적인 구성의 500개의 시범보다 더 좋은 성능을 가진 데이터 세트.
인퍼런스 요구 사항 및 배포
VLA 배포는 컴퓨팅 문제입니다. 추론 요구 사항은 모델마다 크게 다릅니다.
- Octo (93M 파램): RTX 4090 (24GB VRAM) 에서 20 Hz에서 실행된다. TensorRT 최적화로 Jetson AGX Orin에서 5-8 Hz에서 배포될 수 있다. 크로스-인체포먼트 일반화를 유지하는 가장 작은 VLA.
- OpenVLA (7B 파라미): 5 Hz에서 완전 정밀 추론을 위해 A100 또는 H100 (80GB VRAM) 를 필요로 한다. 4 비트 양자화 (GPTQ 또는 AWQ) 를 통해 RTX 4090에서 3-4 Hz로 적합합니다. LoRA 정교 조정은 ~ 40GB에 메모리를 줄인다.
- RT-2 (55B 파라미): 텐서 병렬성을 가진 여러 A100/H100 GPU가 필요합니다. 단일 로봇 배포에 실용적이지 않습니다. 원래는 구글의 내부 TPU 인프라에서 실행되었습니다. 이 때문에 OpenVLA는 배포 가능한 규모에서 RT-2 클래스 기능을 제공하기 위해 존재합니다.
- pi0 (3B 파라미): 배포를 위해 최적화. 단일 A100 또는 10 Hz에서 동등하게 실행됩니다. 물리 지능은 다 로봇 배포를 위한 배팅 요청을 처리하는 추론 서버를 제공합니다.
대부분의 연구팀은 Octo (싼, 빠르고, 덜 능력) 과 OpenVLA (비용, 느린, 더 능력) 사이에서 선택한다. 작업과 데이터 파이프라인을 검증하기 위해 Octo를 시작하여, 더 나은 언어 이해 또는 새로운 객체 일반화가 필요한 경우 OpenVLA로 업그레이드하십시오.
제로 샷 vs 피인 튜닝 성능
연습생들에게 중요한 질문: 얼마나 미세조정이 중요하며, 언제
제로샷은: 작업이 일반적일 때 작동합니다 (
** 미세 조정이 필요한 경우:** 작업은 사용자 지정 하드웨어 또는 비정상적인 운동학이 포함되며, 객체는 전문 (실장 장비, 산업 부품), 카메라 구성은 표준적이지 않은 경우, 작업은 사전 훈련된 모델이 달성하는 것 이상의 정확성을 필요로하거나 배포 환경은 독특한 시각적 특성을 가지고 있습니다 (특별한 조명, 배경).
실제적으로 거의 모든 생산 배치에는 미세조정이 필요합니다. 제로샷 성능은 유용한 정신 검사를 제공합니다. VLA가 제로샷 모드에서 작업을 수행 할 수 없다면, 작업은 훈련 배포로부터 매우 멀리 떨어져 있습니다 (미세조율 데이터를 많이 필요로합니다) 또는 VLA가 아닌 접근 방식으로 작업이 더 잘 수행 될 수 있습니다.
현재 제한
- 유명성 지연시간: 가장 빠른 VLA (Octo 50ms) 이 클래식 정책보다 느리다 (ACT 10ms, DDIM로 15ms에서 방전 정책).
- ** 접촉 단계 성능:** VLA는 접근 단계 (물질 식별, 계획 궤도) 에서 우수하지만 접촉 단계 (강력 조절, 삽입, 손 조작) 에 어려움을 겪습니다. 언어 척추는 접촉 역학에 유용한 선행이 없습니다. 하이브리드 접근 방식
접근, 힘/촉촉촉 정책 은 현재 최고의 관행입니다. - ** 환각:** 언어 모델과 마찬가지로 VLA는 올바른 행동이 불확실한 상황에서 자신감 있는 행동을 예측할 수 있습니다. 이것은 로봇이 손잡을 수 있는 물체가 없을 때 잡기 동작을 실행하거나 물리적으로 불가능한 지시 사항을 따르는 것으로 나타납니다. 안전 계층 (힘 제한, 작업 공간 제한) 은 필수적입니다.
- ** 훈련 비용:** 처음부터 VLA를 미리 훈련시키는 데는 수백만 개의 로봇 시범과 수백 개의 GPU 시간이 필요합니다. 심지어는 OpenVLA를 정렬하는 데는 훈련 실행 당 클라우드 컴퓨팅에 $ 50-200가 소요됩니다. 작업 정의에 빠르게 반복하는 팀에게는 이 비용은 추가됩니다.
VLA는 고전적 모방 학습 정책과 어떻게 다르는가
클래식 IL 정책
VLA는 일반화를 위한 계산을 거래한다. GPU에 대한 고전적인 ACT 정책은 추론당 페인스를 지불한다. 7B 파라미터 모델에 대한 VLA 추론 단계는 규모의 질서를 더 많이 지불한다. 환경과 지침을 통해 광범위하게 일반화해야 하는 작업에 대해 VLA는 승리한다. 1,000개 이상의 시범을 가지고 환경을 조정할 수 있는 좁게 정의된 반복되는 산업 작업에 있어서, 고전 정책은 종종 더 나은 속도와 신뢰성을 낮은 비용으로 달성합니다. 실제 의사결정 프레임워크: 작업이 일반화를 필요로 한다면 VLA 척추로 시작하십시오. 좁고 출력량이 높으면 고전 정책을 최적화하십시오.
RCSV 데이터로 정렬된 VLA
RCSV는 VLA 정렬 프로젝트들을 종면으로 지원합니다. 우리의 [텔레오퍼레이션 인프라] (T4
규모로 사용자 정의 데이터를 필요로 하는 팀들을 위해 샌프란시스코 시설에서 관리된 수집 서비스는 훈련된 운영자들로 조작 작업의 라이브러리를 통해 하루에 수백 개의 시범을 만들 수 있습니다. 우리는 또한 범위를 정의하는 작업 설계에 대한 상담을 제공합니다. 시범 프로젝트는 200개의 시범을 위해 2,500달러에서 시작되며, 1,000개 이상의 시범을 위해 8,000달러에서 시작됩니다. [우리 팀과 연락하세요]
관련: 로봇을 위한 모방 학습 · 로봇 학습에 대한 분포 정책 · ALOHA 로봇 가이드 · 데이터 서비스 · 벤치마크







