ロボット学習カリキュラムの設計:タスクの順序と困難の進行
ロボット学習のためのカリキュラムの設計方法 簡単な作業から複雑な作業の順序化,示範要件,学習戦略の転送
[←ガイド]
模倣学習のためのカリキュラム設計の構造化アプローチ
勉強 計画 が 重要 な の は なぜ です か
複雑な作業をロボット学習プログラムに開始することは,チームに最も一般的な誤りであり,最も高価な誤りである.二手用布をゼロから折り畳むような複雑な作業に直接訓練された政策は,最初の2000回のデモで有用な何かを学ぶことができない.タスクスペースは大きすぎ,報酬信号は稀であり,ネットワークには以前は構築するスキルがない.
設計されたカリキュラムは,初期技能から複雑な構成まで,それぞれの段階が前の段階で習得した技能に基づいて作業を順序化します.結果として,より速く学習し,よりよく一般化し,全体示範を少なくする政策が生まれます. RCSVのカリキュラム学習を活用するチームは,複雑な操作作業に対して,直接の端から端への訓練と比較して,合計示範要件を**40-60%**削減しました.
機械学では,この理論は カリキュラム学習 (Bengio et al., 2009) として公式化されている. 難易度が増加する例で訓練することは,ランダムな順序よりも優れた一般化をもたらします.
学習計画 ロボット学理論
ロボット操作の背景でのカリキュラム学習は3つの理論的柱に基礎を置くが,それぞれが作業の順序と示範予算の配分に実践的な影響を与える.
簡単に注文する
基本原理:まずより簡単な作業を提示し,徐々により難しい変数を導入する.操作においては",簡単"とは接触の移行が少なく,視界が短く,視覚的変化が少なく,初期条件がより制限されていることを意味します.
- 固定位置の把握
対象は常に同じ姿,同じ照明,同じ背景で. ポリシーは基本のビジョモーターマッピングを学ぶ. - ** 位置の不変性について学習します.
- ** 異なる物体把握** 異なる位置で複数の物体形を学習します.
- 選択,輸送,場所 複数の状態の移行
- 接触型作業 挿入,組み立て,力感の操作
廃棄物示範を早期に進めること 難しい作業を効率的に学ぶための基礎が欠けている政策について
自動化カリキュラム方法
手動カリキュラム設計には,作業の難易度の順序について人間の判断が必要である.自動カリキュラム方法では,政策の現在の能力に基づいて,学習アルゴリズムは次にどの作業を訓練するか決める.
| Method | How It Works | Best For | Limitation |
|---|---|---|---|
| Self-paced learning | Up-weight training samples where the policy's loss is low (already learned) or in a "learning zone" (moderate loss) | Large, heterogeneous demonstration datasets | Requires all data upfront; no active collection |
| Competence-based progression | Evaluate policy on current stage every N episodes; advance when success rate > threshold | Active data collection pipelines (RCSV default) | Requires evaluation infrastructure between stages |
| Hindsight relabeling | Failed demonstrations are relabeled as successes for easier goals (e.g., "reach to where the object ended up") | Goal-conditioned policies; RL fine-tuning | Not directly applicable to pure IL without RL component |
| Domain randomization scheduling | Gradually increase visual/physical randomization range during training | Sim-to-real transfer; robustness training | Requires simulation environment |
実践的には,RCSVは能力に基づく進歩を有効なデータ収集プロジェクトに使用し,現行のカリキュラム段階での示範を収集し,訓練し,評価し,成功の限界が満たされたときにのみ前進する. これにより,高額な運用者時間の無駄を防止し,政策がまだ学ぶことができない示範を収集する.
失敗例の注射
成功したデモのみを含むカリキュラムは脆弱な政策を生み出します.導入された政策が新しい状況に直面し,部分的に失敗すると,回復経路は見られず,通常は完全な失敗に転落する分散状態に入ります.
故意な故障注射は,各カリキュラム段階において,失敗と回復の示範を10~20%に含め,この問題に対処します.
- **Grasp失敗:**オペレーターは故意に弱い握りを実行し,滑りを見出します.再握りします. ポリシーは滑り検出と回復を学ぶ.
- 位置付けエラー: 操作者は,オブジェクトを中心から少し離れているところへ近づいて,中途径で修正します. ポリシーは修正行動を学習します.
- オブジェクトの乱: 接近中に第二人がオブジェクトを移動します.操作者は再計画します. ポリシーは反応再計画学んでいます.
- 部分的な作業完了: 作業員が作業の70%を完了し,オブジェクトが落ち,操作員が回復し完了します. ポリシーは作業中での復元を学習します.
L1 (固定原始) では,失敗は稀で情報提供しない.L2+では,失敗復元は生産の強さを大幅に向上させる重要なスキルである.
カリキュラム設計原則
- 原始的なスキル (到達,把握) から始めます:"アクセス・オブジェクト"と"安定なオブジェクトを把握する"のポリシーは,ほとんどすべての操作作業の基礎です.
- 複雑な作業に組む: 原始的なスキルが訓練されたら,複雑な作業は,すでに関連する認識と運動のサブスキルを備えているため,はるかに速く学習されます. 政策に到達し,それを把握した後訓練された"カップ・イン・トレイ"の作業は,構成を学ぶために300-500回の示範が必要になります.ゼロから訓練するには2,000〜5,000個の作業が必要です.
- タスク間での再利用デモ: 原始的なスキル実証は,これらのスキルを必要とするすべてのタスクのための予備訓練データとして再利用できます.これは高品質の原始的な実証を収集するコストを減算します.
- 原始的なスキルの質を厳密に測定する: 80% の時間しか機能しない原始的なスキルは,複合された作業で不良に複合する.
任務分解戦略
複雑な操作作業は,原始的な行動の連続に分解することができます. 分解は,カリキュラムの構造,示範予算の割り当て,政策の作成を決定します. 実施の複雑性によって排列される三つの分解戦略は:
戦略1: 序列的な原始性 (最もシンプル)
作業を明確な交付条件で,一後に実行する原始の固定連行に分割します.
- 例
カップスタッキング: REACH(cup_A) → GRASP(cup_A) → TRANSPORT(cup_A,上_cup_B) → PLACE(cup_A,上_cup_B) → RELEASE - Hand-off条件: 各原始は成功条件を宣言する (例えば,グリッパー閉ざされ,GRASPではグリッパー力>2N). 次の原始は,前者の成功が始まる時のみ開始される.
- ** 利点:** デバッグが簡単 (故障は1つの原始にローカル化されます),各原始は独立した訓練が可能で,原始は再利用可能です.
- 制限: 厳格なシーケンスが,順序が文脈依存性のある作業や,原始的なものが時間的に重複している作業を処理できない.
戦略2:階層政策 (適度)
高レベルの政策は,現在の観察に基づいて,実行すべき原始的なものを選択します.原始的な者は,前もって訓練されています.
- 例
排序作業: 高レベルのポリシーでは,シーンを観察し,次の排序対象を特定し,REACH → GRASP → PLACE_BIN_AまたはREACH → GRASP → PLACE_BIN_Bを選択します. - 訓練: すべての原始人を独立して訓練する (カリキュラム段階 L1-L2). その後,原始的な選択ではなく,原始的な共同コマンドである高レベルのアクションが完全な分類作業の示範で,高レベルのポリシーを訓練する.
- 優位性: 変数長さの作業と条件の分岐を処理する. 高レベルの政策では,端から端まで訓練よりも示範 (50-200) がはるかに少ない.
戦略3: 課程準備訓練の終結 (最も柔軟)
完全作業のための単一のエンドツーエンドポリシーを訓練する. しかし,初期化する視覚エンコードとアクションデコードの重量は,原始的なスキル訓練から.
- プロセス: (1) プリミティブを訓練し,視覚エンコードの重さを抽出する. (2) プリミティブエンコードでフルタスクポリシーを初期化する. (3) 完全なタスクの示範を細かく調整する.
- 利点: 明確な交付条件はありません. 政策は暗黙の移行を学んでいます.
- 制限: 障害が発生したときにデバッグするのが難しく.戦略2よりフルタスクの示範が必要.
任務難度レベル L1-L5
| Level | Task Description | Examples | Demo Requirement | Key Challenge |
|---|---|---|---|---|
| L1 — Primitive single-step | Top grasp of flat, stationary object in fixed position | Pick flat block, open/close gripper on fixed peg | 50-200 | Precise approach trajectory |
| L2 — Varied grasp | Grasp objects with varied size, position, or orientation | Pick cylinder of varying diameter, grasp in +/-30 deg orientation range | 500-1,000 | Visual generalization |
| L3 — Two-step manipulation | Sequential actions with state dependency | Pick and place, open box lid then insert item | 1,000-5,000 | State estimation between steps |
| L4 — Contact-rich assembly | Precise insertion, assembly under uncertainty | USB plug insertion, snap-fit assembly, nut threading | 5,000-20,000 | Reactive force control |
| L5 — Bimanual deformable | Two arms, deformable objects, long horizons | Fold towel, bag groceries, cut with knife and fork | 20,000+ | Bimanual coordination, deformable state |
これらの範囲は,現代のトランスフォーマーベースの模倣学習アーキテクチャ (ACT,拡散政策) を想定する.古い行動クローン方法には,同じ作業のために2-5倍以上の示範が必要である. pi-0のような新しいアーキテクチャまたは大きな,訓練前の視覚言語行動モデルを使用している場合は,訓練前の先例のためにL1-L3での示範要件は3-10倍低い可能性があります.
演示 課程 段階 による 計測 規模
試算予算は,カリキュラムの段階全体で非線形スケーリングパターンを遵守すべきです.最初の段階では比較的少数の試算が必要ですが,次段階ごとに作業の複雑性が増加したため,比例的により多くの試算が必要となります.
| Curriculum Stage | Demos (Without Curriculum) | Demos (With Curriculum) | Savings | Success Threshold to Advance |
|---|---|---|---|---|
| L1 — リーチ + grasp (fixed) | 100-200 | 100-200 | 0% (baseline) | 95% |
| L2 — Varied grasp | 500-1,000 | 300-600 | 30-40% | 90% |
| L3 — Pick-place sequence | 2,000-5,000 | 800-2,000 | 50-60% | 85% |
| L4 — Contact assembly | 10,000-20,000 | 4,000-8,000 | 50-60% | 80% |
| L5 — Bimanual deformable | 20,000-50,000 | 8,000-20,000 | 50-60% | 75% |
重要な洞察:カリキュラムからの百分比貯蓄はL3-L5で最も高い. デモが最も高価である. デモに2580ドル (RCSVデータサービス価格設定) 200,000ドルを節約します.
操縦のカリキュラム:選択,スタック,挿入
この作業した例では,生産組み立ての作業のための完全なカリキュラムを示しています. 構成要素を住宅に挿入する. 最終的な作業はL4 (接触豊富な挿入) です. しかしカリキュラムはL1-L3段階を通して最初に構築されます.
ステージ1: コンポーネント (L1) に到達 - 150 デモ
腕を動かすために,主位置から,元部位から3cm上のプレグラップポーズへ移動させる.固定部品位置,固定照明.成功:目標プレグラップポーズから5mm以内にエンドエフェクター.
- ハードウェア: OpenArm 1 (6-DOF,500gの役に立たない荷) 手首に搭載されたRealSense D405
- データ速度は:腕カメラから30 Hz 結合位置 + 60 fps RGB
- 輸出形式: /観測/qpos [6], /観測/画像/カメラ_腕 [480x640x3], /アクション [6]
- 評価:20件の試験,目標>95%の成功
ステージ2: グラップコンポーネント (L2) - 400 デモ
収縮前から収縮前まで伸ばす.構成要素の位置は15cm×15cm以内で変化する.三つの構成要素のサイズ (小,中,大) 成功: 5cmを降らないまま持ち上げることで安定した収縮を確認する.
- ステージ1の重量から視覚エンコードを初期化する
- 握りしめしししめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめしめ
- 評価:すべての変異種で50回の試験で,目標>90%の成功
ステージ3: 交通と調整 (L3) - 800件
部品を拾い,収納に運び,挿入点上に並べます. 成功:挿入軸の2mmと3度以内に並べられた部品.
- ステップ2の重量から初期化 (エンコード + アクションデコード)
- 10cm x 10cm内の様々な居場所
- 15%の中心外で正しいアプローチの示範を含める
- 評価:50件の試験,目標>85%の成功
ステージ4: 構成要素を挿入する (L4) - 2,000 件
フォース制御による完全な挿入.観測スペースにF/Tセンサーデータを追加.成功:部品が完全に座っている (F/Tセンサーは座っているフォースサインを検出する).
- ステージ3の重量から初期化する.ネットワークにF/T観測ブランチを追加する
- [手首F/Tセンサー]
T3 ) で 100 Hz で 30 Hz で視線と並べて収集する - 20%の回復示例を含みます:不一致するアプローチ,力反射によって修正
- 評価:100件の試験,目標>80%の成功
**カリキュラムの合計:3350デモ. カリキュラムなしの合計: 10,00020,000デモ. 費用削減40ドル/デモ:266K666Kドル.
各段階における評価指標
課程の各段階には,単純に成功/失敗以外の具体的な評価指標が必要である.これらの指標は,政策が進歩する準備ができているか,より多くのデータが必要なのかを診断する.
| Metric | What It Measures | Target | Stage Applicability |
|---|---|---|---|
| Success rate | Binary task completion | 75-95% (by stage) | All stages |
| 軌跡 smoothness (jerk) | Third derivative of joint positions; lower = smoother | <2x demonstration average | L1-L3 |
| Positional accuracy | End-effector error at target pose | <5 mm for L1-L2, <2 mm for L3-L4 | L1-L4 |
| エピソード duration variance | Consistency of task execution timing | CV < 0.3 | L2-L5 |
| Force regulation error | Deviation from target contact force | +/- 1 N of target | L4-L5 only |
| Bimanual sync error | Timing offset between left and right arm actions | <50 ms | L5 only |
| 汎化 gap | Success rate on held-out object positions vs. training positions | <10% drop | L2-L5 |
学習プログラム段階における自動メトリック計算と傾向追跡のために,すべての評価データを [RCSVデータプラットフォーム]
技能分解例
カップを積み重ねる作業 (L3) を 考えてみましょう. カップを拾って,第二のカップに積み重ねる. この作業は,3つの再利用可能なスキルに分解されます.
- ** 接近能力:** 端効果をカップハンドル領域から2cm以内に移動し,正しい接近角度で. 100-200のデモで独立して訓練されています. カップハンドリングのあらゆる作業で再利用できます.
- Grip skills: 握手姿勢からカップを握り,握手位置のフィードバックを通じて握手成功を確認する. 50-100 のデモで訓練された (握手技能重量から初期化). すべてのカップ処理作業に使用できます.
- ** 能力:** 目標杯にカップを低くし,センターを並べ,グリッパーを解放する. カップの積み重ねの新技. 300-500 回のデモを要求する. リーチ+グラップ予備訓練. 予備訓練なし: 1,500-2,500 回のデモ.
課程の合計: 450-800 演示.課程なしの合計: 2,000-5,000 演示.課程はこの作業のためのデータ要件を 4-6 倍削減します.
学習 を 任務 に 移す
現代の政策アーキテクチャは観察空間全体で視覚エンコーダーを共有しています.このエンコーダーは画像からタスク関連機能を抽出することを学んでいます.カリキュラムを通じてさまざまなタスクについてエンコーダーを訓練すると,新しいタスクにより効果的に転送するより豊かな表現を開発します.
- 共有ビジュアルエンコーダー: すべてのカリキュラム作業に単一のResNet-18またはViT小型エンコーダーを共同で訓練します.このエンコーダーは"オブジェクトエッジ","グリッパー近距離",および"グラスプコンタクト"などの機能を学び,多くの作業に役立ちます.
- カリキュラムによるサンプル効率3倍: 経験的には,カリキュラムに備えた視覚エンコードは,新しいL3タスクの示範要件を2000のデモから約600~700のデモに削減します
- ** 調整戦略:** 新しい作業では,カリキュラムからコードの重量を凍結 (または低学習率を使用) し,新しい作業の示範にアクションデコーダーのみを訓練します.これは新しい作業を学習する間に過去のスキルを壊滅的に忘れることを防ぐ.
課程 を 逃す 時
課程設計には時間がかかり 複雑な作業にしか 効果がない.
- L1-L2タスク:直接に行ってください. シンプルな単段階や多重なタスクは,100〜1,000のデモで端から端まで訓練できます.カリキュラムの設計の総コストは節約を上回ります.
- L3の課題:状況による. 明確なスキル分解を備えた場合,他のプロジェクトから既に原始的なスキルデータを持っている場合は,カリキュラムを使用してください.
- **L4-L5課題:カリキュラムは必須です.**カリキュラムなしで直接ゼロから接触型組み立てや双手作業を訓練しようとすることは高価で,通常失敗します.このレベルでは,カリキュラム設計の努力は正当化されています.
- 前訓練されたVLAを使用する: 訓練された視力言語行動モデル (RT-2,Octo,pi-0) を細かく調整している場合は,モデルはすでに重要な先知識を持っています.カリキュラムはまだ役立つかもしれませんが,ベースラインのパフォーマンスははるかに高いので,ギャップを縮小します.
データ収集順序
学習プログラム順にデータを収集する 訓練開始前にすべての作業データを収集するわけではありません.これはより困難な作業示範を収集するための出発点として以前の作業ポリシーを使用することを可能にします.
- L1データを最初に収集する: L1ポリシーを95%以上成功させる.これらのポリシーでは,L2/L3データ収集のアプローチ経路を自律的に収集することができます (オペレータは接触の近くで修正する,完全なアプローチではありません).
- データ増強のための訓練されたポリシーを使用する訓練されたアクセスポリシーは,人間操作者が接入段階から遠隔操作を行う間,自律的にアプローチ段階を実行できます. これにより,操作者の認知負荷を減らすことができ,より一貫した示範が得られます.
- 初期段階での速度よりも一貫性を優先する: L1とL2のデモはゆっくりと意図的に実行されるべきです. 政策はデータから推定速度を学ぶでしょう ゆっくりと明瞭なデモは分解するのが難しい速いデモよりも情報提供的です.
- ** 訓練と収集を間断する:** 100~200回のデモの後,チェックポイントを訓練して評価する.政策が平ら化している場合は,単に同じものより多様なデモ (新しい物体の位置,照明条件) を収集する.
課程設計チェックリスト
- 最終目標課題とその成功基準を正確に定義する
- L1から目標レベルまで3~5つのカリキュラム段階に分解する
- ステージごとに示例数予算を指定する (上記のスケーリング表を使用する)
- 各段階における評価指標と進捗の限界を定義する
- L2およびそれ以上の段階では,計画障害注射率は 10-20%
- 収集開始前に段階ごとに追跡するための [データプラットフォーム] (
T5 ) を設定する - 計画より多くのデモが必要とする段階に予算の20%を預算として割り当て
- 段階間のエンコードの重量移転戦略 (凍結対細調) を計画する
- 各段階前に,作業特有の要求に関するスケジュール管理者訓練
- 審査のカデンスを設定する: ステージ終了だけでなく, 200回のデモごとにチェックポイントを評価する
関連ガイド
- [ロボットデータ収集サービス購入者ガイド]
T6 ) カリキュラム規模プロジェクトにおけるデータ提供者の評価 - [データフォーマットガイド (HDF5/RLDS/LeRobot) ]
T7 ) カリキュラムデータが互換性のあるフォーマットで保存されることを確保する - 双手遠隔操作ハードウェアの設定 L5カリキュラムの課題のためのハードウェア
- チームを組んで プログラムを実行する
- [力/トルクセンサー選択ガイド]
T10 ) L4+カリキュラム段階のF/Tセンサーを追加する - [遠隔操作 Labを設置する方法]
T11 ) データ収集のためのラボインフラストラクチャ
RCSVとの作業
RCSVはロボット学習プロジェクトのためのエンドツーエンドカリキュラム設計と実行を提供しています.私たちのチームは L1単段階のハプニングから L5双手形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形形
- カリキュラムコンサルティング: データの収集が始まる前に,あなたの目標課題をレビューし,カリキュラム構造を提案し,示範予算を推定します.
- データ収集実行: サンフランシスコ, CA と Allston, MA の認証されたオペレーターは, OpenArm 1,DK1双手帳,Unitree G1および5以上の追加のアームプラットフォームでカリキュラム段階のデータを収集します.
- プラットフォーム統合: 収集されたすべてのデータは,各段階のメトリック,評価ダッシュボード,およびHDF5/LeRobot/RLDSに形式輸出を含む [RCSVデータプラットフォーム] (T15
) にアップロードされます. - ** ハードウェアレンタル:** 内部学習プログラム実行のためにハードウェアが必要ですか? [レンタルロボット]
訓練データセットを 構築する
RCSVデータサービスでは,ロボット学習チームにカリキュラムに詳しいデータ収集インフラストラクチャ,オペレータートレーニング,データセット品質分析を提供しています.
[データサービスを探求] (T17







