ロボット政策学習におけるサンプル効率:実際にどれだけのデモが必要ですか?
作業,アルゴリズム,ロボットタイプにおける示範サンプル効率の分析 データの収集の予算を活用するための実践的なガイドライン
[←研究]
試料要求を誤って判断することは ロボット学習プログラムが失敗する最も一般的な原因です 完全に予防可能です
サンプル効率の問題
ロボット政策を訓練するには,何回の示範が必要ですか?正直な答えは,それは
この分析では,公開されたロボット学習論文と RCSVの内部収集プログラムから得た経験的な結果を合成し,デモ予算に関する実践的なガイドラインを提供しています.
実験データ:アルゴリズムとタスクによって求められるデモ
"成功率"は,各作業で報告された主要な作業メトリックを指します.
| Algorithm | Task Type | Demos for ~70% SR | Demos for ~85% SR | Notes |
|---|---|---|---|---|
| Behavioral Cloning (ResNet) | Simple single-object grasp | 50–100 | 150–200 | Plateaus early; limited generalization |
| ACT (Action Chunking) | Bimanual pick-and-place | 50–150 | 200–500 | Strong for precise, short-horizon tasks |
| Diffusion Policy | 精度(再現性) assembly | 200–500 | 800–2000 | Best for multi-modal behavior |
| Foundation model fine-tune | Novel grasp variants | 20–100 | 200–500 | Requires pretrained visual encoder |
| OpenVLA fine-tune | Language-conditioned manipulation | 50–200 | 300–800 | Generalizes across objects with diverse data |
| From-scratch VLA | Broad manipulation suite | 20,000+ | 50,000+ | Not practical per-task; amortized across tasks |
基本モデルの微調整 (前訓練されたVLAまたは視覚エンコーダーからスタート) は,同じ作業のゼロからトレーニングするよりもサンプル効率が 3
作業難度倍数
上記の数字は,レベル1の作業難度を想定します.実際の作業はほとんど決してレベル1ではありません.特定の作業のデモ要件を推定するためにこれらの倍数を使用します.
| Level | Task Description | Demo Multiplier | Example |
|---|---|---|---|
| L1 | Simple, fixed-position, single object | 1× | Pick block from fixed location |
| L2 | Variable position/orientation, single object | 2–5× | Pick block from random position in 10cm radius |
| L3 | Multi-step, 2–3 subtasks | 5–20× | Pick block, place on target, press confirm button |
| L4 | Contact-rich, precision required | 20–100× | Peg insertion, drawer opening, plug connection |
| L5 | Deformable objects or bimanual dexterous | 100×+ | Fold cloth, bimanual tool use |
"簡単な把握"のように見えるが,異なる幾何学で50種類の異なるオブジェクト型で作業を要求するタスクは,L2
アルゴリズム効率の比較
| Algorithm | Relative サンプル効率 | Inference Speed | Best For |
|---|---|---|---|
| BC-RNN | Low (1×) | Fast (< 5ms) | Simple tasks, constrained compute |
| ACT | High (5–10×) | Medium (10–20ms) | Precise bimanual, short-horizon |
| Diffusion Policy | Medium (3–7×) | Slow (50–200ms) | Multi-modal, contact-rich |
| π0 / foundation model fine-tune | Very high (10–20×) | Slow (100–500ms) | Broad generalization, novel objects |
| From-scratch CNN-MLP | Very low (0.5×) | Very fast (< 2ms) | Constrained robots, simple tasks only |
予算 運用 ガイド
完全な収集プログラムへのコミットメントの前にデモ予算を体系的にアプローチする
- ステップ 1
パイロット収集: 200個のデモを正確に収集する. これは近代的なアルゴリズムによる非微小な作業の最小可行データセットです. - ステップ2
訓練と測定: 200 回のデモで目標アルゴリズムを訓練する.少なくとも 50 回の試験で実施された評価セットで成功率を測定する. - ステップ3 学習曲線抽出: 200 つのデモが S% の成功率を与え,あなたの目標は T% で,必要なすべてのデモを推定するために,ログリズム曲線を調整します.粗略な規則:200 つのデモベースラインから,データセットの2倍化により,理論上最大限の残留差の約 60~70% が生成されます.
- ステップ4
アルゴリズム再評価: もしあなたの200デモの成功率は40%未満なら,より多くのデータに投資する前にアルゴリズムを切り替えるか,訓練前の視覚エンコードを追加するかを検討してください.200デモの弱い信号は通常,アルゴリズムとタスクの不一致を示し,データ量の問題ではありません. - ステップ5
フライホイルの予算: 推定総需要の5060%で初回収集を計画する.初回導入後,失敗対象収集のために残る予算を預算する.失敗対象データでは最終的なパフォーマンスギャップを埋めるためにランダムな収集よりも25倍効率的です.
返金 減少: 学習 曲線 の 膝
学習曲線ごとに"膝"が存在し,その横断返済が急激に低下する傾斜点です.30以上の収集プログラムにおける経験的データでは,膝は,課題の経験的最大成功率の70~80%に一貫して表示されます.
膝の下では100回の新しいパッチで3
プログラム管理に直接的な影響がある.あなたの成功率は85%以上で,あなたの目標は90%以上なら,あなたは膝の上を操作している.それに従って予算は,100点ではなく5点のギャップを閉じるために,500~1,500個の標的型デモが必要になると予想します.
90%以上が必要とする作業 (安全性・重要な操作,医療機器の組み立て) では,最終的な5~10%の性能コストは, 85%に達するコストよりも高い.
RCSVの [データ収集サービス] (
作業のためのデモ予算を計算する
RCSVのデータ科学チームは新しいロボット学習プログラムのための無料デモ予算推定を提供します アルゴリズム推薦と学習曲線予測を含む.
[データ推定を要請する]







