Research(으)로 돌아가기

로봇 정책 학습의 샘플 효율성: 얼마나 많은 데모가 정말로 필요합니까?

작업, 알고리즘 및 로봇 유형 <unk>에 대한 시범 샘플 효율성 분석과 데이터 수집을 예산화하는 데 대한 실용적인 지침을 제공합니다.

[← 연구]

샘플 요구사항을 잘못 판단하는 것은 로봇 학습 프로그램의 실패의 가장 흔한 원인입니다.

샘플 효율성 문제

로봇 정책 훈련에 필요한 시범은 몇 개입니까? 솔직한 대답은: 그것은 에 달려 있으며 범위는 4 대의 규모를 띠고 있습니다. 간단한 단일 객체 포착은 50 가지 시범에서 배울 수 있습니다. 시야 언어 행동 모델을 처음부터 훈련하는 것은 50,000 개 이상의 것을 필요로 합니다. 데이터 수집 프로그램을 시작하기 전에 이것을 잘못 판단하면 두 가지 실패 모드 중 하나로 이어집니다. 과잉 수집 (정책이 결코 공감하지 않습니다) 또는 과잉 수집 (비용이 불필요한 데이터에 낭비되는 예산).

이 분석은 발표된 로봇 학습 논문과 RCSV의 내부 수집 프로그램에서 실증적인 결과를 합성하여 demo 예산에 대한 실질적인 지침을 제공합니다.

경험적 데이터: 알고리즘과 작업에 의해 요구되는 데모

다음 범위는 표준화된 평가 프로토콜을 가진 출판된 결과로부터 나온다. "성공률"은 각 작업에서 보고된 주요 작업 메트릭을 의미합니다.

Algorithm Task Type Demos for ~70% SR Demos for ~85% SR Notes
Behavioral Cloning (ResNet) Simple single-object grasp 50–100 150–200 Plateaus early; limited generalization
ACT (Action Chunking) Bimanual pick-and-place 50–150 200–500 Strong for precise, short-horizon tasks
Diffusion Policy 정밀도 assembly 200–500 800–2000 Best for multi-modal behavior
Foundation model fine-tune Novel grasp variants 20–100 200–500 Requires pretrained visual encoder
OpenVLA fine-tune Language-conditioned manipulation 50–200 300–800 Generalizes across objects with diverse data
From-scratch VLA Broad manipulation suite 20,000+ 50,000+ Not practical per-task; amortized across tasks

핵심 점: 기초 모델 정렬 (예전에 훈련된 VLA 또는 시각 코더를 시작으로) 는 같은 작업에 처음부터 훈련하는 것보다 310x 더 샘플 효율적입니다. 작업이 오픈 X-Embodiment 또는 OXE 파생 모델에 해당하는 작업과 시각적 유사성을 가지고 있다면, 정렬은 거의 항상 올바른 출발점입니다.

과제 난이도 증제자

위의 숫자는 레벨 1 작업 난이도를 가정합니다. 실제 작업은 거의 결코 레벨 1이 아닙니다. 특정 작업에 대한 데모 요구 사항을 추정하기 위해 이러한 곱셈을 적용하십시오:

Level Task Description Demo Multiplier Example
L1 Simple, fixed-position, single object Pick block from fixed location
L2 Variable position/orientation, single object 2–5× Pick block from random position in 10cm radius
L3 Multi-step, 2–3 subtasks 5–20× Pick block, place on target, press confirm button
L4 Contact-rich, precision required 20–100× Peg insertion, drawer opening, plug connection
L5 Deformable objects or bimanual dexterous 100×+ Fold cloth, bimanual tool use

"단순한 잡기"처럼 보이지만 다양한 기하학으로 50가지 다른 객체 유형을 넘나들어야 하는 작업은 L2L3 작업이고, L1이 아닙니다. 대부분의 산업 조작 작업은 L2L3입니다.

알고리즘 효율성 비교

Algorithm Relative 샘플 효율성 Inference Speed Best For
BC-RNN Low (1×) Fast (< 5ms) Simple tasks, constrained compute
ACT High (5–10×) Medium (10–20ms) Precise bimanual, short-horizon
Diffusion Policy Medium (3–7×) Slow (50–200ms) Multi-modal, contact-rich
π0 / foundation model fine-tune Very high (10–20×) Slow (100–500ms) Broad generalization, novel objects
From-scratch CNN-MLP Very low (0.5×) Very fast (< 2ms) Constrained robots, simple tasks only

실용적 인 예산 관리 가이드

전체적인 수집 프로그램에 참여하기 전에 시범적인 예산결산에 대한 체계적인 접근:

  • 단계 1 파일럿 수집: 정확히 200개의 시범을 수집합니다. 이것은 현대 알고리즘을 이용한 비 비 비약적인 작업에 대한 최소한의 실행 가능한 데이터 세트입니다.
  • 단계 2 훈련 및 측정: 200개의 데모에서 목표 알고리즘을 훈련하십시오. 최소 50개의 실험을 포함한 지속된 평가 세트에서 성공률을 측정하십시오.
  • 단계 3 학습 곡선 추출: 200개의 데모가 S%의 성공률을 제시하고 목표가 T%인 경우, 필요한 데모의 전체를 추정하기 위해 로가리듬 곡선을 적용하십시오. 대략적인 규칙: 200개의 데모의 기본 라인에서, 데이터 세트의 두 배로 인해 이론 최대까지 남은 격차의 약 60~70%가 발생합니다.
  • ** 4 단계 알고리즘 재평가:** 만약 당신의 200 템포의 성공률이 40% 이하라면, 더 많은 데이터에 투자하기 전에 알고리즘을 전환하거나 미리 훈련된 시각적 코더를 추가하는 것을 고려하십시오. 200 템포의 약한 신호는 일반적으로 데이터 양 문제 아닌 알고리즘-task 부합을 나타냅니다.
  • ** 5 단계 비행륜기 예산:** 예상 전체 요구량의 5060%를 초기 수집 계획. 초기 배포 후 실패 대상 수집에 남은 예산을 예약. 실패 대상 데이터는 최종 성능 격차를 메우기 위해 무작위 수집보다 25배 더 효율적입니다.

환율 감소: 학습 곡선의 무릎

학습 곡선은 "목"이 있습니다. 이 곡선에는 가장자리 수익이 급격히 떨어지는 기울기점이 있습니다. 30개 이상의 수집 프로그램에서 경험적 데이터에서 무릎은 작업의 경험적 최대 성공률의 70~80%에 지속적으로 나타납니다.

무릎 아래 100개의 새로운 배트마다 성공률이 38% 향상되는 것을 나타냅니다. 무릎 위쪽에서는 5%의 개선이 310x가 이전 5%의 개선만큼 많은 시범이 필요합니다.

이 점 은 프로그램 관리 에 직접적인 영향 을 끼칩니다. 만약 당신의 성공률 이 85% 이상이고 목표 는 90% 이상이라면, 당신은 무릎 위 에 활동 하고 있습니다.

90%+가 필요한 작업 (안전적 중요 조작, 의료기기 조립) 에 있어서 최종 5~10%의 성능 비용은 85%에 도달하는 비용보다 종종 더 높습니다.

RCSV의 [데이터 수집 서비스] (T1) 는 모든 프로그램 시작의 일환으로 학습 곡선 추정을 포함한다. 우리의 [Fearless Platform] (T2) 는 실시간으로 학습 곡선을 추적하고, 무릎을 횡단할 때 자동으로 표시하고 실패 대상 수집 모드를 활성화합니다.

과제 에 대한 예산을 예고 해 보십시오

RCSV의 데이터 과학 팀은 새로운 로봇 학습 프로그램 에 대한 무료 데모 예산 추정치를 제공합니다. 알고리즘 권고 및 학습 곡선 예측을 포함합니다.

[데이터 추정을 요청]