Researchに戻る

ロボット政策学習におけるサンプル効率:実際にどれだけのデモが必要ですか?

作業,アルゴリズム,ロボットタイプにおける示範サンプル効率の分析 データの収集の予算を活用するための実践的なガイドライン

[←研究]

試料要求を誤って判断することは ロボット学習プログラムが失敗する最も一般的な原因です 完全に予防可能です

サンプル効率の問題

ロボット政策を訓練するには,何回の示範が必要ですか?正直な答えは,それは に依存し,範囲は四次大小です.単純な単一のオブジェクトの把握は,50回の示範から学べる.視覚言語行動モデルをゼロから訓練するには5万以上の必要があります. データ収集プログラムを開始する前にこれを誤った判断すると,二つの失敗モードの一つに繋がります:不足収集 (ポリシーが決して収束しない) または過剰収集 (冗長なデータで予算が無駄になる).

この分析では,公開されたロボット学習論文と RCSVの内部収集プログラムから得た経験的な結果を合成し,デモ予算に関する実践的なガイドラインを提供しています.

実験データ:アルゴリズムとタスクによって求められるデモ

"成功率"は,各作業で報告された主要な作業メトリックを指します.

Algorithm Task Type Demos for ~70% SR Demos for ~85% SR Notes
Behavioral Cloning (ResNet) Simple single-object grasp 50–100 150–200 Plateaus early; limited generalization
ACT (Action Chunking) Bimanual pick-and-place 50–150 200–500 Strong for precise, short-horizon tasks
Diffusion Policy 精度(再現性) assembly 200–500 800–2000 Best for multi-modal behavior
Foundation model fine-tune Novel grasp variants 20–100 200–500 Requires pretrained visual encoder
OpenVLA fine-tune Language-conditioned manipulation 50–200 300–800 Generalizes across objects with diverse data
From-scratch VLA Broad manipulation suite 20,000+ 50,000+ Not practical per-task; amortized across tasks

基本モデルの微調整 (前訓練されたVLAまたは視覚エンコーダーからスタート) は,同じ作業のゼロからトレーニングするよりもサンプル効率が 310x高い.あなたの作業がOpen X-EmbodimentまたはOXE衍生モデルにカバーされている作業に視覚的に類似している場合は,微調整はほぼ常に正しい出発点です.

作業難度倍数

上記の数字は,レベル1の作業難度を想定します.実際の作業はほとんど決してレベル1ではありません.特定の作業のデモ要件を推定するためにこれらの倍数を使用します.

Level Task Description Demo Multiplier Example
L1 Simple, fixed-position, single object Pick block from fixed location
L2 Variable position/orientation, single object 2–5× Pick block from random position in 10cm radius
L3 Multi-step, 2–3 subtasks 5–20× Pick block, place on target, press confirm button
L4 Contact-rich, precision required 20–100× Peg insertion, drawer opening, plug connection
L5 Deformable objects or bimanual dexterous 100×+ Fold cloth, bimanual tool use

"簡単な把握"のように見えるが,異なる幾何学で50種類の異なるオブジェクト型で作業を要求するタスクは,L2L3タスクであり,L1ではない.ほとんどの産業操作タスクはL2L3である.

アルゴリズム効率の比較

Algorithm Relative サンプル効率 Inference Speed Best For
BC-RNN Low (1×) Fast (< 5ms) Simple tasks, constrained compute
ACT High (5–10×) Medium (10–20ms) Precise bimanual, short-horizon
Diffusion Policy Medium (3–7×) Slow (50–200ms) Multi-modal, contact-rich
π0 / foundation model fine-tune Very high (10–20×) Slow (100–500ms) Broad generalization, novel objects
From-scratch CNN-MLP Very low (0.5×) Very fast (< 2ms) Constrained robots, simple tasks only

予算 運用 ガイド

完全な収集プログラムへのコミットメントの前にデモ予算を体系的にアプローチする

  • ステップ 1 パイロット収集: 200個のデモを正確に収集する. これは近代的なアルゴリズムによる非微小な作業の最小可行データセットです.
  • ステップ2 訓練と測定: 200 回のデモで目標アルゴリズムを訓練する.少なくとも 50 回の試験で実施された評価セットで成功率を測定する.
  • ステップ3 学習曲線抽出: 200 つのデモが S% の成功率を与え,あなたの目標は T% で,必要なすべてのデモを推定するために,ログリズム曲線を調整します.粗略な規則:200 つのデモベースラインから,データセットの2倍化により,理論上最大限の残留差の約 60~70% が生成されます.
  • ステップ4 アルゴリズム再評価: もしあなたの200デモの成功率は40%未満なら,より多くのデータに投資する前にアルゴリズムを切り替えるか,訓練前の視覚エンコードを追加するかを検討してください.200デモの弱い信号は通常,アルゴリズムとタスクの不一致を示し,データ量の問題ではありません.
  • ステップ5 フライホイルの予算: 推定総需要の5060%で初回収集を計画する.初回導入後,失敗対象収集のために残る予算を預算する.失敗対象データでは最終的なパフォーマンスギャップを埋めるためにランダムな収集よりも25倍効率的です.

返金 減少: 学習 曲線 の 膝

学習曲線ごとに"膝"が存在し,その横断返済が急激に低下する傾斜点です.30以上の収集プログラムにおける経験的データでは,膝は,課題の経験的最大成功率の70~80%に一貫して表示されます.

膝の下では100回の新しいパッチで38%の成功率が向上する.膝上では5%の改善ごとに前5%の改善に比べて310xの示例が必要である.

プログラム管理に直接的な影響がある.あなたの成功率は85%以上で,あなたの目標は90%以上なら,あなたは膝の上を操作している.それに従って予算は,100点ではなく5点のギャップを閉じるために,500~1,500個の標的型デモが必要になると予想します.

90%以上が必要とする作業 (安全性・重要な操作,医療機器の組み立て) では,最終的な5~10%の性能コストは, 85%に達するコストよりも高い.

RCSVの [データ収集サービス] (T1) は,プログラム開始の各回合として学習曲線推定を含む.私たちの [Fearless Platform] (T2) は,学習曲線をリアルタイムで追跡し,膝を横切ると自動的にマークし,失敗をターゲットとした収集モードを起動します.

作業のためのデモ予算を計算する

RCSVのデータ科学チームは新しいロボット学習プログラムのための無料デモ予算推定を提供します アルゴリズム推薦と学習曲線予測を含む.

[データ推定を要請する]