Blogに戻る

ロボット操作のためのRL対模倣学習:決定ガイド

訓練ロボット操作政策の訓練に強化学習と模倣学習を活用する時 作業タイプ,データ利用量,計算予算

部分: [模倣学習ガイド]

[←ブログ]

RLと ILの選択はどちらが良いかではなく 特定の制限に適したものについてです

迅速 な 決定 の 規則

詳細な分析の前に:もしあなたが遠隔操作システムでタスクを簡単に示せるなら,模倣学習を使用してください.それを示せが,明確なスケラー報酬信号を定義できなければ,RLを使用してください.いずれも適用されない場合,タスクは複雑すぎる.

この規則は,実践的な操作シナリオの80%に当てはまる.残りの20%には,ハイブリッドアプローチまたは下記のトレードオフの慎重な分析が必要である.

模倣 学問: 能力 と 限界

低評価されるI.I.の利点:

  • 急速な開発サイクル: 100回のデモ → 2-4時間間で訓練された政策. 完全な繰り返すサイクル (収集,訓練,評価,より多くの収集) は,1日で完了できます.
  • 建設によって安全: ポリシーは実証された行動に近付くことを学びます. RL探検家のように危険な端のケースを発見しません.
  • 報酬エンジニアリングは存在しない: 精密な組み立てのための報酬関数を定義することは驚くほど難しい. ILはこれを完全に回避します.
  • 予測可能コスト: 性能向上ごとにコストは線形で測定可能です さらに100回のデモを集めて,%の改善を期待します.

IL制限:

  • 示範者品質によって制限される: この政策は示範を提供した事業者のスキルを超えることはできません.
  • 複合誤り: 行動クローン化は長時間間の訓練分布から逸脱する.
  • 明らかにない解決策を見つけられない: 実証が難しいが実行が容易な戦略がある場合 (例えば,物体をゴミ箱に投げ込むために慣性動力を使う) ILは決して見つけません.

強化 学習: 能力 と 限界

RLの利点:

  • 人間のパフォーマンスを超えることができる: RLはゲームで超人的な戦略を発見し,特定の物体に対する非直感的なが優れた把握戦略を発見した.
  • 非実証可能な行動を処理する: 人間がロボットを簡単に制御できない作業 (高速動力学,複雑な接触序列) は自然的なRL標的である.
  • 長期計画: 形状の良い報酬により,RLはILで誤差を増やす傾向にある20〜50ステップ作業を処理することができます.

RL制限は,しばしば過小評価される.

  • サンプル効率: 現代操作RLは単純な作業のために500K-5M環境ステップを必要とします. 10Hzシミュレーションでは,シミュレーション時間14~140時間です.
  • 報酬エンジニアリングの困難: 省略報酬 (成功/失敗のみ) は,慎重に形作らないとほとんど機能しない.操作のための密集した報酬機能は正しく指定することは難しい.誤った形状の報酬は,課題を解決するよりも報酬を搾取する政策を生み出します.
  • **実体ロボットにおける Sim-to-Real依存性:**実体ロボットにおける RLは可能だが,遅い,高価である.RLはほとんど常にシミュレーションを必要とし,これは sim-to-real転送を必要とする.

面対面 比較

Dimension 模倣学習 Reinforcement Learning
Sample efficiency 100-500 demos for most tasks 500K-5M sim steps (much more data)
Reward design needed? No (demonstrations are the reward) Yes (hardest part of the pipeline)
Simulation required? No (works on real robot directly) Practically yes (real-world RL is too slow)
Hardware access needed? Yes (physical robot + teleoperation) Only for validation (training is in sim)
GPU compute cost $5-50 per policy (2-12 hr training) $50-500 per policy (8-100 hr training)
Performance ceiling Bounded by demonstrator skill Can exceed human performance
Safety during training Inherently safe (follows demo distribution) 探索 can be dangerous on real hardware
Time to first policy 1-3 days (collect + train) 1-4 weeks (sim setup + training)
Sim-to-real gap? No (trained on real data) Yes (major challenge for deployment)
Multi-task scaling Linear cost per task (need demos for each) Reward re-engineering per task (often harder)

決定流図

この質問の配列を フォローして,あなたの特定の課題に適切なアプローチを 導き出します.

  1. **人間が遠隔操作で作業を証明できるか?**もしそうなら,I.L.は出発点です.もしそうでないなら (例えば,作業には超人間的な速度,反応時間,自由制御の度が必要) ステップ3に移動してください.
  2. 作業は示範者の能力を超えた精度が必要か? IL政策が70~80%の成功を達成するが, 95%+が必要であれば,IL温室スタート +RL精錬 (ハイブリッド) を使用してください.ILのみが目標に達した場合,停止してください.
  3. **タスクのためのスケラー報酬関数を定義できますか?**もしそうでシミュレーションにアクセスできれば,RLを使用してください.報酬が曖昧または多目的であれば,GAIL (報酬を学ぶための示範を使用します) を考慮してください.
  4. シム-トゥ-リアル転送は,あなたの任務のために実行可能ですか? 任務は,既知の幾何学を持つ硬い物体を含む場合,シム-トゥ-リアルは通常実行可能である.変形可能な物体,流体,または複雑な接触動力を含む場合,シム忠実性は,十分なものではなく,実際のハードウェアでデフォルトのILに不十分である可能性があります.
  5. あなたの計算予算はどのくらいですか? A100/H100 GPUにアクセスでき,10100時間間のトレーニングを余裕があれば,RLは実用的です.あなたの計算が限られている場合 (単一のRTX 3090またはクラウドスポットインスタンスの場合),ILは10100倍計算効率が高い.

ハイブリッド 方法: 両方 の 最高

Approach Description Benefit When to Use
IL warm-start + RL fine-tuning Train IL policy first, use as RL initialization 10× more efficient RL When IL policy is 60-70% and you need 90%+
GAIL RL with reward from discriminator trained on demos No reward engineering When reward is hard to specify
DAgger IL with online data collection from expert Fixes compounding error When BC diverges at test time
Residual RL Base IL policy + RL residual corrector Safe exploration near IL behavior 精度(再現性) refinement of IL policies

費用と時間表の比較

技術的メリットを超えて,RLとILの間の実践的な決定はしばしばプロジェクト時間軸と予算に限ります.典型的な操作作業の現実的な比較はこちらです.

Resource IL (ACT, 500 demos) RL (PPO in Isaac Lab) Hybrid (IL + Residual RL)
Upfront engineering 1-2 weeks (pipeline setup) 2-4 weeks (sim setup + reward eng.) 3-5 weeks (both pipelines)
Data/experience collection 1-2 weeks (500 demos at 40/hr) 0 (automated in sim) 1 week (200 demos)
Training time 3-4 hours (RTX 4090) 8-24 hours (A100) 4 hr IL + 8 hr RL
GPU compute cost $5-15 $30-100 $35-80
Hardware access cost $800-2,000 (lease + operator) $0 (sim only until validation) $400-1,000
Total timeline 2-4 weeks 4-8 weeks 4-6 weeks
Typical success rate 80-90% 70-85% (after sim-to-real) 85-95%

重要な教訓:ILは,ほとんどの操作作業において,より速く,安くなります.ILが要求されるパフォーマンスレベルに達できないとき,作業が実証できないとき,または人間のレベルでのパフォーマンスを上回る必要があるとき,RLは正当化されます.ハイブリッドアプローチは,最も高い成功率をもたらしますが,両方のパイプラインに投資が必要です.

方法 を 選ぶ の で よく 行なっ て いる 間違い

**誤り1:RLから始めると,より洗練された音が聞こえる.**MLの背景を持つチームはRLにデフォルトで RLを設定する.これは技術的により興味深いアプローチである.しかし,ほとんどの実践的な操作作業では,ILはより早くより良い結果をもたらします.ILから始め,ILが明確なパフォーマンス上限に達する場合にのみRLに切り替える.

**誤り2:報酬エンジニアリングに投資不足.**RLを選択した場合,報酬機能設計と再演のために少なくとも40%のエンジニアリング時間を予算する.報酬機能はRLパイプラインの最も重要な構成要素であり,それを正しく行うには広範な実験が必要です. 報酬がうまくいかないので 報酬を活用する政策が生まれ 作業を解決する代わりに ロボットは意図された行動を実行せずに 数を最大限に 増やすための 創造的な方法を見つけます

誤り3: sim-to-realギャップを無視する. 模擬訓練を受けた RL ポリシーは,しばしば sim で 95%+ の成功を達成しますが,ドメインランダム化なしで実際のロボットでは 40-60% を達成します.ドメインランダム化のための予算時間と計算,そして常に成功を主張する前に,実際のハードウェアで sim-trained ポリシーを検証します.ドメインランダム化設定については,私たちの [Isaac Lab ガイド]T2) を参照してください.

エラー4: IL中に故障データを収集しない. オペレーターはデフォルトで失敗したデモを捨てます.しかし,我々の [データ品質ガイド]T3 で議論されているように,ラベル付きの故障デモは,復旧行動と故障検出の訓練に価値があります.適切なラベルで保存してください.

任務型に関する勧告

Task Type Recommended Approach Reason
Pick-and-place (varied poses) IL (ACT or Diffusion) Easily demonstrated, contact minimal
精度(再現性) peg insertion IL or IL + Residual RL Demonstrable; RL refines final alignment
Dexterous in-hand manipulation RL (in sim) + IL for initialization Hard to demonstrate; RL finds solutions
Long-horizon assembly (10+ steps) Hierarchical: task planner + IL per step Neither alone handles long horizon well
Locomotion gait optimization RL Non-demonstrable, clear energy reward
Tool use (novel tools) IL for known tools, RL generalization Few-shot IL + sim RL exploration

RCSVの [RL環境サービス] (T4) は RLトレーニングのためのシミュレーション設定を提供し, [データサービス] (T5) は上記に説明されているハイブリッドアプローチの組み合わせで使用される IL示例収集を処理します.

関連 読書

  • [NVIDIA Isaac Labでスタート] GPU加速RLトレーニングの主要なプラットフォーム
  • LeRobot Guide -- ACTと拡散政策に関するIL政策の訓練
  • [ゼロショット対少数のロボット政策] (T8) - 基礎モデルがRLとILの両方に代替としてゼロから
  • ロボットデータ収集コスト -- IL示例収集のための予算計画
  • [ロボット訓練データに何が良いのか?] (T10)
  • RCSV RL環境サービス --RL訓練のための先編設定されたシミュレーション
  • データサービス --ハイブリッドパイプラインのIL側におけるIL示例収集管理

正しい 方法 を 選ぶ に 助け が 必要 か

RCSVはRLシミュレーション環境とILデータ収集の両方を提供します 私たちはあなたの仕事のために適切なパイプラインを設計するのに役立ちます.

[我々のサービスを調べる]