정렬 을 잘 하는 로봇 기초 모델: 실용적 인 지침서
로봇 기반 모델을 (OpenVLA, Octo, π0) 에 대해 작업에 대한 <unk> 데이터 요구 사항, 훈련 설정 및 예상 성능 향상을 어떻게 정비할 수 있습니까?
[← 연구]
로봇 기반 모델은 새로운 작업에 대한 데이터 요구 사항을 3
왜 처음부터 열차 하기 보다는 정밀 조정 하는 것 인가?
처음부터 조작 정책을 훈련시키는 데는 수천 개의 작업에 대한 구체적인 시범이 필요합니다. 잘 훈련된 기초 모델은 이 방정식을 크게 변화시킵니다.
다양한 인터넷 규모의 시각 데이터와 수천 개의 로봇 시범을 미리 훈련받은 로봇 기반 모델은 이미 이해합니다: 시각적 의미론 ("붉은 잔"와 "블루 mug"), 객체 제공 (잔은 가장자리 또는 몸으로 잡을 수 있습니다), 언어 지형 ("픽업"와 "추진") 및 기본 행동 전원 (순순 궤도, 접근 각).
정정화는 이 전향을 특정 작업에 옮깁니다. 결과는 3
기초 모델 옵션
- OpenVLA (7B 매개 변수, LLaMA 척추, 완전히 열린 무게)
2025년부터 정렬을 위한 가장 접근 가능한 기초 모델. 강력한 커뮤니티, 잘 문서화된 정렬 레시피, 활성 HuggingFace 페이지. 언어 조건: 자유 텍스트 지침을 받아들이고. 시각 영역에서 가장 좋은 일반화. 인퍼런스: A100에서 6 Hz, RTX 4090에서 2 Hz. - Octo (90M 변압기 + 디스푸시온 액션 헤드, 완전히 열린 무게)
보다 빠른 추론 (25 Hz 단일 A100에서) 그리고 OpenVLA보다 낮은 미세조정 비용. 디스푸시온 헤드 원활한 궤도를 생성합니다. OpenVLA보다 시각적인 일반화가 적지만 내 배포 작업에 탁월하다. CoRL 2024에서 출판되었습니다. - π0 (물리적 지능, 흐름 일치 구조, 제한된 접근)
2025년 초부터 현명한 조작 기준에 대한 최첨단 기술. 흐름 일치는 접촉 부양한 작업에 대한 고품질 궤도를 생성합니다. 물리적인 지능 파트너십 프로그램을 통해 액세스합니다. 이 글쓰기 현재 완전히 개방되지 않습니다. 현명한 조작 (복, 조립) 이 목표라면 가장 좋은 선택입니다. - RoboFlamingo / 3D-VLA
강력한 3D 공간적 추론을 가진 새로운 대안. 정확한 3D 배치가 필요한 작업에 대해 이것들을 확인하십시오.
데이터 요구 사항
미세조정과 처음부터 훈련하는 데 필요한 최소 시범수:
- OpenVLA 정렬: 작업 복잡성에 따라 50
500개의 시범을 실시한다. 간단한 선택 및 장소: 50개의 디모가 충분하다. 복잡한 다단계 조립: 300 500. 손목 장착 카메라 + 외부 조명으로 수집한다. - Octo 정렬: 200~1,000개의 시범. 같은 작업에 대한 OpenVLA보다 약간 더 많은 데이터에 굶주린, 하지만 훈련에 더 빠르다. 특히 BridgeData (탁판 조작) 과 유사한 작업이 되면 효율적입니다.
- ** 처음부터 훈련 (ACT, 퍼포먼스 정책) **: 작업에 따라 5,000~50,000개의 시범이 이루어졌습니다. ALOHA 종이 간단한 작업에 50개의 시범을 사용했고, 복잡한 양동행에 200개의 시범이 사용되었습니다. 그러나 이들은 일반화 없이 강력한 유통 모델입니다.
- 데이터 품질은 양보다 중요 합니다. 100개의 전문가 시범 (순고하고 일관하고, 의 تردد 없이) 는 500개의 중간 시범을 능가합니다.
훈련 설정
미세조정을 위한 실용적인 계산 요구 사항:
- OpenVLA 전체 정렬: 4×A100 80GB, 500개의 시범을 위해 약 8시간, 10,000개의 계층 단계. 전체 클라우드 비용은: Lambda 클라우드 또는 RunPod에서 ~$200
400. - LoRA와 함께 오픈VLA: 16위 로라는 A100 40GB에 탑재될 수 있도록 메모리를 줄이고, 최소한의 성능 손실을 초래한다 (일반적으로 <5%의 성공률 차이와 완전한 정렬). 훈련 시간은: 3~4시간.
- Octo 정교: 1×A100 40GB, 200
500 시범을 위한 2 4시간. - OpenVLA LoRA에 HuggingFace <unk>T0
+ <unk>T1 를 사용하세요. <unk>T2 라이브러리는 Octo 정비 스크립트를 제공합니다. 하드웨어 평가 실행 전에 20%의 디모니스트를 유효화하십시오.
기대 되는 결과
| Model | Demos Required | Expected Success Rate (Fine-Tune) | Training from Scratch (Same Demos) |
|---|---|---|---|
| OpenVLA | 100 | 55–70% | 15–30% |
| OpenVLA | 300 | 70–85% | 35–55% |
| Octo | 200 | 60–75% | 20–40% |
| Octo | 500 | 75–88% | 45–65% |
| π0 (if available) | 100 | 65–80% | N/A (requires much more) |
숫자는 대략적이고 작업에 의존합니다. 명확한 시각적 구별을 가진 선택 및 배치 작업은 높은 끝입니다. 섬세한 조작 (복, 변형 가능한 물체) 은 낮은 끝입니다. 항상 수직된 물체에서 검증하십시오.
흔히 발생하는 실패
- ** 재앙적 인 잊기**
미세 조정은 미리 훈련된 특징을 덮어버리고 일반화를 저하한다. 해결책: LoRA (대부분의 무게를 얼어붙이는) 를 사용하거나 미세 조율 혼합에 사전 훈련 데이터의 작은 부분을 추가하십시오. - ** 모드 붕괴**
정책은 객체 다양성을 무시하여 단일 행동으로 (예를 들어 항상 같은 각에서 접근) 으로 konverges. - ** 과장 적합**
정책은 훈련 시범을 기억합니다. 신호: 훈련 성공률 >> 80% 하지만 새로운 객체 성공 < 30%. 해결책: 훈련 중에 걸린 객체에 검증, 조기 중단을 사용, 중단을 추가합니다. - ** 액션 배포 부합**
로봇의 액션 공간 (관각, 최종 효과자 자세) 은 기초 모델의 예상된 형식에 일치하지 않습니다. 미세 조정 전에 로봇의 액션 공간은 모델의 예상된 인터페이스에 신중하게 지도합니다.
배포
정렬 후, 배포 하드웨어에서 추론 속도를 최적화하십시오.
- ONNX 수출
하드웨어 비정상적 배포를 위해 OpenVLA 또는 Octo를 ONNX에 수출합니다. 파이썬의 오버하스트를 줄이고 가장자리 배포를 가능하게합니다. - Jetson용 TensorRT
NVIDIA 제트슨 AGX 오린용 TensorRT 엔진으로 ONNX를 변환합니다. OpenVLA 로라 모델은 INT8 양량화로 제트슨 AGX 오린에서 4 6 Hz에서 실행됩니다. - 량화
INT8량화 는 대부분의 조작 작업 에서 <3%의 성공률 감소 를 기록 하여 모델 크기를 4x로 줄이게 합니다. 빠른량화 를 위해 <unk>T3 를 사용 합니다.
[RCSV 플랫폼] (
RCSV 데이터 세트에서 정렬을 시작
작업에 대한 로봇 기반 모델을 정렬하기 위해 큐레이션된 조작 데이터 세트, GPU 훈련 인프라 및 평가 환경을 액세스하십시오.
[데이터 서비스를 탐구]







