제로 샷과 몇 샷 로봇 정책: 현실적인 기대를 설정
2025년 제로샷과 소수의 로봇 정책 성과에 대한 정직한 평가
[← 블로그]
제로 샷 로봇은 단순한 작업에 대한 실제입니다. 통제된 조건에서, 유통된 객체로. 여기 전체적인 그림입니다.
정의
제로샷는 새로운 작업을 실행하거나 새로운 시범 없이 새로운 객체를 처리하는 것을 의미합니다. 로봇은 사전 훈련 중에 배운 것에 전적으로 의존합니다. ** Few-shot**는 5-50 새로운 시범으로 새로운 작업에 적응하는 것을 의미합니다. 이것들은 의미있는 다른 기능이며, 그것들을 혼합하면 비현실적인 계획으로 이어집니다.
제로 샷의 현재 현실
로봇 조작의 기초 모델
- 개방형 어휘자료 객체 탐지 + 간단한 위에서 아래로 잡기 계획 작업은 깨끗한 표면에 정렬 지향으로 제시된 일반 가정용 객체의 ~60%에 대해 무사냥으로
- 이전에 탐구된 환경에서 언어 조건으로 내비게이션이 작동하는 것은 구조화된 설정에서 ~75%의 성공으로 무사히 작동합니다
- 익숙한 객체 범주 (mugs, bottles, blocks) 를 가진 Pick-and-place는 표준 벤치마크에서 OpenVLA로 50-65%의 성공적 0-shot을 달성합니다.
0샷이 안정적으로 실패할 경우: 미 5mm 이하의 배치, 능숙한 조작, 새로운 도구 사용, 객체가 비통칙적인 (
몇 장의 촬영 을 잘 조정 하는 능력: 더 실용적 인 능력
새로운 작업에 대한 미세한 조정이 (20-100개 시범) 은 기초 모델이 가장 명확한 실용적 가치를 보여주는 곳입니다.
| Training Approach | Demos Required | Typical Success Rate | Time to Train |
|---|---|---|---|
| Foundation model, zero-shot | 0 | 30–65% (simple tasks) | N/A |
| Foundation model + 20 demo fine-tune | 20 | 70–80% | 30 min GPU |
| Foundation model + 100 demo fine-tune | 100 | 80–90% | 2 hr GPU |
| Train from scratch (ACT) | 500 | 75–88% | 3–4 hr GPU |
| Train from scratch (Diffusion) | 1000 | 82–92% | 8–12 hr GPU |
기초 모델의 장점은 데이터 저체제 (100개 이상의 시범) 에서 가장 두드러진다. 20개 시범과 함께 정교한 기초 모델은 500개 시범에서 ACT를 처음부터 훈련시키는 것과 비교할 수 있는 성공률을 달성한다. 이는 25배의 데이터 효율성 향상을
오늘날 '제로 샷'이 실제로 작동 하는 곳
- ** 명확한 객체 탐지:** DETIC + GraspNet 스타일의 개방형 어휘 탐지 + 간단한 잡기 계획기는 조직된 버섯에 있는 일반 객체에 대해 무사히 작동합니다. 이것은 전자 상거래 및 물류에 생산 준비가 되었습니다.
- ** 알려진 공간에서 언어 조건으로 탐색:** VLN (Vision-Language Navigation) 모델은 이해하도록 훈련받은 공간에서 0 샷으로 작동하며, 다른 건물의 동일한 레이아웃 공간에 좋은 일반화를 제공합니다.
- 분별별로 객체 인식 및 분류: 언어 조건으로 분류 ("빨간 항목을 왼쪽 칸에 넣으십시오") 는 RGB 분류를 가진 알려진 범주에서 0-샷으로 작동합니다.
그렇지 않은 곳 (아직)
- ** 접촉 부가한 조작:**
구멍, - 신작 도구 사용: 익숙하지 않은 도구 (통 열기, 특정 스크류 드라이버) 를 사용하면 아직 신뢰성이 떨어집니다. 몇 번의 촬영 (20-50 데모) 는 작동합니다.
- 외부 조작: 모든 생산 모델에 대한 전동 제로샷 기능 이외의 손가락 제어를 이용한 물체의 회전, 손 재잡기.
재단 모델 벤치마크 결과 (2025-2026)
| Model | Provider | Zero-Shot (SimplerEnv) | 20-Shot Fine-Tune | Parameters |
|---|---|---|---|---|
| OpenVLA | Stanford/TRI | 48-62% | 72-80% | 7B |
| Octo | Berkeley | 35-55% | 65-78% | 93M |
| pi-0 | Physical Intelligence | 55-70% | 78-88% | 3B |
| RT-2-X | Google DeepMind | 50-65% | 75-85% | 55B |
| ACT (from scratch) | Stanford | N/A | 40-55% (20 demos) | 12M |
이러한 숫자는 제어된 실험실 환경에서 간단한 조작 벤치마크 (픽-플레이스, 드래프트 오픈, 버튼 누르기) 에서 성능을 나타냅니다. 실제 세계 배포 숫자는 일반적으로 벤치마크 조건에서 표시되지 않는 조명 변동, 배경 오더러, 객체 다양성 때문에 10-20 퍼센트 포인트 낮습니다.
몇 번의 촬영 데이터 효율 곡선
실무자 들 에게 가장 가치 있는 통찰 은, 미세 조율 시범 과 성능 의 규모 가 어떻게 겹치는 지 이다.
- ** 5 예제:** 기초 모델은 0% 샷보다 5-15%의 향상률을 나타냅니다. 처음부터 훈련은 신뢰할 수 없는 정책을 만들어냅니다. 기초 모델의 장점은 여기에 가장 크습니다. 대략 10배 더 많은 데이터 효율성이 있습니다.
- 20 시범: 기초 모델 정렬의 최첨단점. 대부분의 모델들은 이 시점에서 최종 성능의 70-80%를 달성한다. 처음부터 ACT는 일반적으로 40-55%에 도달한다. 사전 훈련과 스크래치 사이의 격차는 20-30 퍼센트 포인트이다.
- 50개 시범: 기초 모델은 천장 (80
88%) 에 접근한다. 스크래치 훈련 모델은 그 격차를 좁히고, 잘 수집된 데이터로 6075%에 달한다. 비용 차이점은 크다. 50개 시범 시범 시범 시범 시범 시범 시상대 (RCSV) 비율로 200~500달러에 달한다. 기초 모델에 투자된 사전 훈련 계산 기간에 비해. - 100개 시범: 기초 모델 정렬은 대부분의 작업에 대해 감소하는 수익률을 달성합니다. 스크래치 훈련 모델은 더 빨리 (75-85%) 따라갑니다. 실제 질문은 남은 성능 격차가 추론을 위해 3-7B 파라미터 모델을 사용하는 복잡성을 정당화하는지 여부입니다.
- ** 500 예제:** 스크래치 훈련 ACT 및 디스푸지션 정책은 일반적으로 정교한 기초 모델과 일치하거나 이보다 더합니다. 이 데이터 볼륨에서 사전 훈련의 장점은 단일 작업 배포에 최소한입니다. 기초 모델은 다 작업 일반화에 대한 장점을 유지합니다.
언제 어떤 접근 방식을 사용해야 하는가: 결정 매트릭스
| Scenario | Recommendation | Why |
|---|---|---|
| Quick feasibility test, simple task | Zero-shot with OpenVLA/pi-0 | No data cost; instant evaluation |
| New task, limited budget (<$2K data) | Foundation model + 20-50 demo fine-tune | Maximum performance per dollar |
| Production deployment, single task | ACT/Diffusion from scratch, 300-500 demos | Smaller model = faster inference, simpler deployment |
| Multi-task deployment (10+ tasks) | Foundation model + per-task fine-tuning | Shared backbone amortizes model cost |
| 정밀도 task (sub-2mm tolerance) | Scratch Diffusion Policy, 500+ demos | Foundation models lack precision for tight tolerances |
| Edge compute (Jetson, no GPU server) | Small model from scratch (ACT 12M params) | 7B VLA models cannot run on edge devices |
인체체 격차: 왜 제로 샷이 보이는 것보다 더 힘들지
NLP에서 제로샷 성능은 모델 규모로 안정적으로 향상됩니다. 70B 언어 모델은 7B 모델보다 제로샷 텍스트 작업에서 지속적으로 더 좋습니다. 같은 확장 관계는 로봇 기반 모델에 적용되지 않으며, 현실적인 기대를 설정하는 데 중요한 이유를 이해하는 것이 중요합니다.
근본적인 도전은 ** 인체 격차**: 텍스트와 달리 (유니버설 토케니징이 있는) 로봇 동작은 실시예에 특이하다. 프랭카 리서치 3의 7DOF 공동 속도 명령은 6DOF 오픈아름 또는 다른 운동 연쇄를 가진 모바일 조작기에 의미가 없습니다. 현재 기초 모델은 액션 공간 정상화를 통해 (모든 로봇을 공유된 7-DOF 표현으로 매핑하여, 더 이상의 DOF를 가진 로봇에 대한 정보를 잃게) 또는 실시예별 출력 헤드 (출력 헤드를 캘리버하기 위해 목표 실시예에 대해 적어도 몇 가지 시범이 필요한) 를 통해 이것을 처리합니다.
즉, 새로운 로봇 구현에 대한 "허로샷"은 현존하는 아키텍처와 함께 기능적으로 불가능합니다. 항상 적어도 한 번의 캘리브레이션 단계가 필요합니다. 오늘날 작동하는 제로샷 기능은 모델이 훈련받은 동일한 구현에 대한 ** 새로운 작업에 ** 제로샷입니다. 새로운 구현에 대한 전송은 항상 최소 몇 번의 촬영입니다.
** 인식 격차**는 두 번째 주요 도전이다. 기초 모델은 특정 카메라, 조명 및 배경으로 특정 실험실에서 수집된 데이터 세트에 훈련된다. 다른 시각 조건의 새로운 환경에서 배치되면 시각 코딩의 표현이 변화하여 정책 성능을 저하한다. 이 때문에 발표된 제로 샷 숫자는 (훈련 데이터와 유사한 실험실에서 수집된) 실제 세계 숫자에 비해 10-20 퍼센트 더 높습니다. 훈련과 시각 언어 사전 훈련 중에 도메인 무작위로 분류하는 것은 모두 도움이 되지만 오늘날 이 격차를 완전히 닫는 것은 없습니다.
행동 분포 격차. 다른 작업들은 근본적으로 다른 행동 분포를 가지고 있습니다. 픽앤플레스는 분리된 포착/방해 이벤트, 지우는 것은 지속적인 접촉 유지보수를 포함합니다. 주로 픽앤플레스의 데이터에 훈련된 기초 모델은 시각적 이해가 완벽하게 전송되더라도 접촉 부가 많은 작업에 낮은 제로샷 성능을 가질 것입니다. 그렇기 때문에 사전 훈련 데이터의 작업 다양성은 데이터 세트의 크기를 초점 일반화보다 더 중요합니다.
인퍼런스 비용 및 지연률 비교
제로샷과 몇 번의 촬영 토론에서 종종 간과되는 요인: 생산에서 기초 모델을 실행하는 추론 비용. 7B 파라미터 VLA 모델은 추론을 위해 전용 GPU (A10G 최소, 클라우드에서 ~ $ 0.75 / 시간) 를 필요로 하며, 액션 당 100-300ms 지연을 도입합니다. 12M 파라미터 ACT 모델은 $ 200 Jetson Orin Nano에서 5-15ms에 실행됩니다.
규모로 배포되는 (10+ 로봇) 경우, GPU 추론 비용은 연간 5만 달러를 초과할 수 있습니다. 이는 작은 작업 특수한 모델을 훈련시키기 위해 충분한 데이터를 수집하는 비용보다 더 높을 수 있습니다. 이것은 직관적 경제적 주장입니다. 데이터 수집에 투자하는 것은 (단회적인 비용) 기초 모델에 대한 지속적인 추론 비용을 지불하는 것보다 저렴할 수 있습니다.
실용적 인 지침
기초 모델**를 이용해서도 새로운 작업에 대한 **200-500개의 시범을 계획하십시오. 제로샷 성능은 측정해야 할 보너스이고, 기본 라인이라고 가정하지 않습니다. 제로샷이 작업에서 60% 이상의 성공을 달성하면, 계획보다 앞서 자신을 고려하십시오. 30%를 달성하면 계획된 정렬 데이터 수집을 진행하십시오.
RCSV [데이터 서비스] (
관련 독서
- RL vs. 모방 학습 결정 지침
- 로봇 데이터 수집 비용 분할 - 미세조정에 필요한 시범 프로그램들에 대한 예산 계획
- LeRobot 가이드 - ACT 및 방전 정책에 대한 교육
- [좋은 로봇 훈련 데이터가 무엇으로 만들어지는가?]
- [인체화된 인공지능 설명 간단하게] (
T6 ) -- 기초 모델과 물리적 인공지능에서의 역할 - RCSV 플랫폼 -- 데이터베이스 관리 및 모델 교육 인프라
- [데이터 서비스]
T8 ) - 20-500개의 시범을 수집하여 정렬을 할 필요가 있습니다
업무 에 대한 현실적 인 데이터 예산 을 마련 하십시오
RCSV는 당신의 작업을 무사용 및 소수사용의 실현 가능성을 평가하고 적절한 시범량을 추천할 수 있습니다.
[우리 팀과 이야기]







