로봇 정책 학습의 샘플 효율성: 얼마나 많은 데모가 정말로 필요합니까?
작업, 알고리즘 및 로봇 유형 <unk>에 대한 시범 샘플 효율성 분석과 데이터 수집을 예산화하는 데 대한 실용적인 지침을 제공합니다.
[← 연구]
샘플 요구사항을 잘못 판단하는 것은 로봇 학습 프로그램의 실패의 가장 흔한 원인입니다.
샘플 효율성 문제
로봇 정책 훈련에 필요한 시범은 몇 개입니까? 솔직한 대답은: 그것은
이 분석은 발표된 로봇 학습 논문과 RCSV의 내부 수집 프로그램에서 실증적인 결과를 합성하여 demo 예산에 대한 실질적인 지침을 제공합니다.
경험적 데이터: 알고리즘과 작업에 의해 요구되는 데모
다음 범위는 표준화된 평가 프로토콜을 가진 출판된 결과로부터 나온다. "성공률"은 각 작업에서 보고된 주요 작업 메트릭을 의미합니다.
| Algorithm | Task Type | Demos for ~70% SR | Demos for ~85% SR | Notes |
|---|---|---|---|---|
| Behavioral Cloning (ResNet) | Simple single-object grasp | 50–100 | 150–200 | Plateaus early; limited generalization |
| ACT (Action Chunking) | Bimanual pick-and-place | 50–150 | 200–500 | Strong for precise, short-horizon tasks |
| Diffusion Policy | 정밀도 assembly | 200–500 | 800–2000 | Best for multi-modal behavior |
| Foundation model fine-tune | Novel grasp variants | 20–100 | 200–500 | Requires pretrained visual encoder |
| OpenVLA fine-tune | Language-conditioned manipulation | 50–200 | 300–800 | Generalizes across objects with diverse data |
| From-scratch VLA | Broad manipulation suite | 20,000+ | 50,000+ | Not practical per-task; amortized across tasks |
핵심 점: 기초 모델 정렬 (예전에 훈련된 VLA 또는 시각 코더를 시작으로) 는 같은 작업에 처음부터 훈련하는 것보다 3
과제 난이도 증제자
위의 숫자는 레벨 1 작업 난이도를 가정합니다. 실제 작업은 거의 결코 레벨 1이 아닙니다. 특정 작업에 대한 데모 요구 사항을 추정하기 위해 이러한 곱셈을 적용하십시오:
| Level | Task Description | Demo Multiplier | Example |
|---|---|---|---|
| L1 | Simple, fixed-position, single object | 1× | Pick block from fixed location |
| L2 | Variable position/orientation, single object | 2–5× | Pick block from random position in 10cm radius |
| L3 | Multi-step, 2–3 subtasks | 5–20× | Pick block, place on target, press confirm button |
| L4 | Contact-rich, precision required | 20–100× | Peg insertion, drawer opening, plug connection |
| L5 | Deformable objects or bimanual dexterous | 100×+ | Fold cloth, bimanual tool use |
"단순한 잡기"처럼 보이지만 다양한 기하학으로 50가지 다른 객체 유형을 넘나들어야 하는 작업은 L2
알고리즘 효율성 비교
| Algorithm | Relative 샘플 효율성 | Inference Speed | Best For |
|---|---|---|---|
| BC-RNN | Low (1×) | Fast (< 5ms) | Simple tasks, constrained compute |
| ACT | High (5–10×) | Medium (10–20ms) | Precise bimanual, short-horizon |
| Diffusion Policy | Medium (3–7×) | Slow (50–200ms) | Multi-modal, contact-rich |
| π0 / foundation model fine-tune | Very high (10–20×) | Slow (100–500ms) | Broad generalization, novel objects |
| From-scratch CNN-MLP | Very low (0.5×) | Very fast (< 2ms) | Constrained robots, simple tasks only |
실용적 인 예산 관리 가이드
전체적인 수집 프로그램에 참여하기 전에 시범적인 예산결산에 대한 체계적인 접근:
- 단계 1
파일럿 수집: 정확히 200개의 시범을 수집합니다. 이것은 현대 알고리즘을 이용한 비 비 비약적인 작업에 대한 최소한의 실행 가능한 데이터 세트입니다. - 단계 2
훈련 및 측정: 200개의 데모에서 목표 알고리즘을 훈련하십시오. 최소 50개의 실험을 포함한 지속된 평가 세트에서 성공률을 측정하십시오. - 단계 3
학습 곡선 추출: 200개의 데모가 S%의 성공률을 제시하고 목표가 T%인 경우, 필요한 데모의 전체를 추정하기 위해 로가리듬 곡선을 적용하십시오. 대략적인 규칙: 200개의 데모의 기본 라인에서, 데이터 세트의 두 배로 인해 이론 최대까지 남은 격차의 약 60~70%가 발생합니다. - ** 4 단계
알고리즘 재평가:** 만약 당신의 200 템포의 성공률이 40% 이하라면, 더 많은 데이터에 투자하기 전에 알고리즘을 전환하거나 미리 훈련된 시각적 코더를 추가하는 것을 고려하십시오. 200 템포의 약한 신호는 일반적으로 데이터 양 문제 아닌 알고리즘-task 부합을 나타냅니다. - ** 5 단계
비행륜기 예산:** 예상 전체 요구량의 50 60%를 초기 수집 계획. 초기 배포 후 실패 대상 수집에 남은 예산을 예약. 실패 대상 데이터는 최종 성능 격차를 메우기 위해 무작위 수집보다 25배 더 효율적입니다.
환율 감소: 학습 곡선의 무릎
학습 곡선은 "목"이 있습니다. 이 곡선에는 가장자리 수익이 급격히 떨어지는 기울기점이 있습니다. 30개 이상의 수집 프로그램에서 경험적 데이터에서 무릎은 작업의 경험적 최대 성공률의 70~80%에 지속적으로 나타납니다.
무릎 아래 100개의 새로운 배트마다 성공률이 3
이 점 은 프로그램 관리 에 직접적인 영향 을 끼칩니다. 만약 당신의 성공률 이 85% 이상이고 목표 는 90% 이상이라면, 당신은 무릎 위 에 활동 하고 있습니다.
90%+가 필요한 작업 (안전적 중요 조작, 의료기기 조립) 에 있어서 최종 5~10%의 성능 비용은 85%에 도달하는 비용보다 종종 더 높습니다.
RCSV의 [데이터 수집 서비스] (
과제 에 대한 예산을 예고 해 보십시오
RCSV의 데이터 과학 팀은 새로운 로봇 학습 프로그램
[데이터 추정을 요청]







