Blogに戻る

ロボット の 模倣 学習: 実践 的 な ガイド

ロボットのための模倣学習に関する実践的なガイド:それが何であるか,ACT,拡散政策,およびVLAがどのように比較されるか,データ要件,ハードウェア,およびRCSVがあなたのIL研究を支援する方法

[模倣学習ガイド]

模倣学習はロボットに巧妙な操作技法を教える 主要なパラダイムとして登場しました.手作り報酬機能や運動プランを書く代わりに,ロボットに何をすべきかを説明します.このガイドでは,どのように機能するか,どのアルゴリズムを使用するか,結果を得るために必要なインフラストラクチャを説明します.

模倣 学問 は 何 です か

模倣学習 (IL) - 演示から学習 (LfD) または行動クローンと呼ばれる - は,人間の操作者から捕まった行動を複製する方針を訓練します.データ収集中に,熟練したデモーターは,ターゲットタスクを通じてロボットを遠隔操作します.センサーは関節位置,エンドエフェクターポーズ,カメラフレーム,その他の関連状態を記録します. ニューラルネットワークの政策の訓練セットになります

補強学習に対するILの魅力は実用的です 報酬信号を設計したり,何百万人ものシミュレーションを実行したり,稀有報酬探索問題を解決したりする必要はありません. 人間が任務をこなすことができれば,ロボットはその作業を数百から数千回の示例から学ぶことができます. 課題は概要化です 狭い示範で訓練された政策は 対象の位置や照明や 作業の変異が訓練分布と違って失敗する可能性があります

現代IL研究は,より良いアーキテクチャ,より大きな,より多様なデータセット,および訓練前の視覚表現を通じてこれを解決しています.この分野は2023年以降急速に進歩し,生産品質の模倣学習は,ロボット学博士課程にアクセスできないチームに現在到達できます.

ILアルゴリズム分類:BC,DAgger,およびHG-DAgger

**行動クローン (BC) **は,模倣学習の最も簡単な形態です. デモンストレーションから (観察,アクション) カップルの静的なデータセットを収集し,その後,監視学習を通じて観察から行動を予測する神経ネットワークを訓練します.BCは実装し,訓練しやすいし,オンラインの相互作用を必要としません. 基本的弱点は"複合誤り"です 導入時に,小さな予測誤りにより観測分布は訓練データから離れ,後の予測はさらに悪化します 政策は訓練中に見られなかった状態に外出しています

複合エラー問題は軌道の長さによってスケールされます.エプシロンの一歩間エラー率では,Ross and Bagnell (2010) の最悪のケース分析では,Tステップにおける予想される総エラーはO (epsilon *T^2) として増加します. 実践的には,BCは短時間で (制御周波数では30ステップ未満) 作業にうまく機能しますが,アクション・チャンキングのような緩和戦略なしに,より長い地平面で急速に劣化します.

**DAgger (データセットの統合) **は,オンラインデータ収集を通じて複合エラーを処理します.初期BC段階の後,学習されたポリシーが展開され,専門家が実際に政策を訪問した州で実行されるべき行動を標識します.この新しいデータはトレーニングセットに追加され,ポリシーが再訓練されます. このプロセスを繰り返すことは,限界の専門家と同じ効果のある政策に収まる.実際コストは,DAggerが訓練中に専門家への繰り返しアクセスを必要とするということです.専門家が政策を実行し,実時で誤りを修正する必要があります.

**HG-DAgger (Human-Gated DAgger) **はロボット学習のより実用的な変形である.訪問されたすべての状態を専門家がラベルに付けることを要求する代わりに,HG-DAggerは,ポリシーが失敗するときにのみ人間に介入することを許可します.オペレーターはロボットが学習されたポリシーを実行するのを観察し,必要に応じて制御を引き継ぐ. 介入経路 (政策の遭遇に関する特定の失敗から修正的な示例を表現する) は,データセットに追加されます.このアプローチは,標準DAggerよりも3~5倍効率的です. 人間が最も必要な場所でのみ示例を提供しているからです.

RCSVのほとんどの実践的なロボット学習プロジェクトでは,アクションチャッキング (複合エラーを劇的に減らす) を使って BCから始め,追加 BCデータが解決しない持続的な故障モードがある場合のみ, HG-DAggerに卒業することを推奨します.

模倣学習のためのデータセットサイズスケーリング法

テストの実施は,作業の複雑性,アルゴリズム,および一般化量によって異なります. 公開された結果とRCSVの内部評価データに基づいて,以下は,経験的なスケーリング行動です.

Dataset Size Typical Result (single task, ACT) When to Stop Adding Data
10-25 demos 20-40% success; policy captures gross motion but misses details Never -- this is only useful for sanity checks
50-100 demos 60-80% success on in-distribution objects/positions Acceptable for a research prototype with fixed conditions
200-500 demos 80-92% success; handles moderate position/object variation Sufficient for most single-task deployments
500-2000 demos 88-95% success; robust to diverse objects, positions, lighting Diminishing returns unless adding diversity, not volume

重要な洞察は,同じ条件下で同じ作業の約200回の示範を超えて,より同一のデータを追加すると,減少する返点が得られます.高レバレッジの動きは,より多くの繰り返すよりも,新しいオブジェクトインスタンスの新しい位置,新しい照明を _ diverse_データを追加することです. RCSVの [データ収集プロトコル] (T4) は,まさにこの理由のために多様性目標を中心に構成されています.

国務代表の選択

学習効率と一般化には,あなたの政策に与えられている観察空間が大きく影響します.

関節角 +画像 (推奨標準). 各時間ステップでの観測は,カメラ画像 (通常224x224または256x256 RGB) と結合されたロボット関節位置のベクトルである. 画像は,オブジェクトとワークスペースのレイアウトを識別するために必要な視覚的な文脈を提供します.これはACT,拡散ポリシー,およびほとんどのVLAモデルのための標準入力形式です.

エンドエフェクターポーズ +画像.* 観測には,関節角ではなく,ロボットのベースフレーム内のエンドエフェクター位置 (x, y, z) と方向 (四角形または回転マトリックス) が含まれます.この表現はよりコンパクトで,直接に作業に関連する空間情報をコードします. 機能は,特定の関節構成の違いとして,エンドエフェクター運動を制御するだけである場合,うまく機能する. 弊点は:複数の関節構成が同じエンドエフェクターポーズを生む冗長な操作でエンドエフェクター表現が曖昧さを生み出す可能性があります.

** 合図角度のみ (画像なし).** 既知のオブジェクト位置 (例えば固定部品を工場で組み立て) の固定環境の作業では,合図角度のみを訓練した純粋なプロピオシプティブ・ポリシーが,非常に少ない示例 (20-50) で高い成功率を達成できます. このポリシーは視覚運動マッピングよりも,合図空間軌道を学ぶ. このアプローチは 訓練に迅速で 展開に容易で 信頼性が高いのですが 視覚的な変化に 概括をゼロです

アクションスペースデザイン: 絶対対デルタ

行動がどのように表現されるかは 実践者の多くは理解していないよりも重要だ

絶対的な共同位置** 各行動は次の時間ステップのための目標共同角度ベクトルである.利点:行動は解釈可能であり,共同限界によって制限される.デメリット:政策は観測から絶対的な共同目標までの完全なマッピングを学ぶ必要がある.そして,小さな観測変更は大きな行動変更を必要とする可能性があります (絶対的な目標が現在の位置から遠くにある可能性があるため). ACTは既定として絶対的な共同目標を使用します.

デルタ (相対) 行動. 各行動は,現在の状態から関節角または最終効果ポーズの変化である.メリット:デルタ行動は,自然に小さいため,正確に予測することが容易であり,訓練中に見られなかったスタート状態によりよく一般化する (政策は絶対的な目標よりも相対的な動きを学ぶため). デルタアクションは,絶対的な参照修正がない場合,長い軌道を漂流に蓄積する.拡散ポリシーは,通常,デルタエンドエフェクターアクションを使用します.

実践的な勧告:10〜20 Hz制御で100ステップ未満の作業では,偶発的な絶対路線点を持つデルタエンドエフェクターアクションが概括と精度を最もよく組み合わせます.共同調整が重要である双手作業では,絶対的な共同目標 (ACTの場合のように) は,デルタアクションが2つの腕間で生み出す同期の問題を回避します.

ACT: トランスフォーマーで行動する

スタンフォード大学から導入された ALOHAの双手ロボットプラットフォームとともに ロボット制御を序列予測の問題として扱います この方針は 次回のアクションではなく 将来のアクションを予測します 通常は50~100時間ステップです このアクションチャンキングは複合エラーを減らすため,小規模な予測エラーが軌道を積むような 素朴な行動クローンによる主要な失敗モードです.

ACTは訓練中にCVAE (条件変異自動エンコード) を使用して,人間のデモの多模性を捕捉します.その理由は,作業を完了する方法は1つ以上あるということです.推論時に,デコーダーは現在のカメラ観測と関節状態に基づいて動作シーケンスを生成します. 平均的な形態のアーテファクトなしで人間によって示された作業の自然変化を処理する政策です

性能に影響を与える重要な実装詳細:CVAE損失における KL差分重は,再構築精度と潜伏空間の規則化との間のトレードオフを制御します.重量10から開始し,掃描 [1,5,10,50].時間集合技術 - 超重するアクションブロックと指数重量を平均する - ブロック間の移行を平滑化し,ジートを軽減します. テンパロアサンブルでは,指数重量0.01 を使用します.

ACTは双手操作作業の強力な出発点である.比較的比較的小さなデータ量 (50200デモ/タスク) を要求し,24時間以内に単一のGPUに電力をつけます. ALOHAハードウェアまたは類似した双手操作セットアップで作業している場合は,ACTは試す最初のアルゴリズムであるべきです. RCSVの データサービス には,ALOHAクラスのプラットフォームで収集されたACT対応のデータセットが事前に処理されている.

拡散政策:多型行動配分処理

拡散政策は,スコアを合わせた拡散モデルをロボットアクションスペースに適用します. 動作空間は,ロボットアクションの最好のアクションを予測する代わりに,人間のデモが実行する行動の完全な分布を学習します. 結論の時に,その分布から高品質のアクションをサンプルとして取り出すために,否定プロセスを実行します.

ACTの主要な優位性は,マルチモダルの作業を処理する方法です. 人々が左から右に物体を把握したり,複数の有効な角度からターゲットに近づける場合のシナリオです.標準的な行動クローン化はこれらのモードを平均して,中間下り失敗するポリシーを生成します. 流通政策のサンプルは,現在の文脈を考慮して正しいモードから,曖昧な作業でより堅固な行動を生み出します.

引き換えは推理速度である.UNet背骨付きの拡散ポリシーには,デフォルトによる推理 (DDPM) で約500msを要する100ステップのデノイズが必要であり,RTX 3090ではリアルタイム制御にはあまりにも遅い.DDIMサンプラーではこれを10ステップ (~200ms) に削減し,一貫性蒸留変数は単段階生成 (~50ms) を達成し,リアルタイム操作が実行可能になる. 推論のタイミングと各変数を何時使用するかについては, [ACT vs. Diffusion Policy Decision Guide]T6を参照してください.

拡散政策は一般的にはACTよりも多くの示範から恩恵を受けますが,データセットの多様性を原数よりも多く報いる.実用的なルール: 200以上の示範があり,あなたの課題には,ポリシーが処理したい複数の有効な戦略がある場合,拡散政策を使用します.

視覚言語行動モデル: IL 規模

OpenVLA,pi0,RT-2などのVLAは,ロボットデモの微調整前にインターネット規模の視覚および言語データでプレトレーニングを行い,模倣学習を拡張します.プレトレーニングされた脊椎骨は,物体,シーン,関係を豊かに表現し,ロボット操作に力強く移行します. 訓練をゼロから始めるよりも 演示が要る程度は少ない 時には10~50個程度です

実践的な妥協点: VLAは訓練と推論の両方のために大幅により多くの計算を必要とします.OpenVLA (7Bパラメータ) は細かな調整のために A100または H100 GPU を必要とし,約3 Hz で推論を実行します.遅い操作に適していますが,反応的な作業には適しません.より小さな蒸留変数は出現していますが,完全なモデルよりも能力が低いままです. 計算とライセンス要件を担うチームにとって,VLAはIL性能の現在の境界線を表しています.新しいオブジェクト,新しい環境,言語指定タスクの変異によりよく一般化します.

RCSVは,主要なVLA訓練パイプラインが期待するデータフォーマットと互換性のある細かな調整データセットと [テレオペレーションインフラストラクチャ] (T7) を提供しています.詳細な技術的な説明については,当社の [VLAモデル説明ガイド] (T8) を参照してください.

BCを超えて: GAIL,IBC,逆強化学習

行動クローンとDAggerが実践的なロボットILを支配している一方で,他のいくつかの方法は特定のシナリオに注目に値する.

**GAIL (Generative Adversarial 模倣学習) **GAILは,専門家による示範と学習政策の展開を区別するために差別者を訓練し,その後の差別者の出力を強化学習の報酬信号として利用します. 成果は,専門家による_state-action分布を個々の行動ではなく,比較した政策であり,示範データセットが小さいとき (50エピソード未満) BCよりも優れた一般化を提供している.コスト:GAILは環境 (シミュレーションまたはリアル) でオンライン展開を必要とし,BCよりも計算的に10-100倍高い. 実践的な使用例: 演示が少ない (10-20) が,良いシミュレーターへのアクセスがある作業 (例えば,Mujokoが物理を正確にモデル化するペグ挿入)

IBC (暗黙行動クローン). IBCは,政策を明示的な行動予測器ではなくエネルギーベースのモデル (EBM) として表現する.単一のアクションを出す代わりに,モデルは候補 (観察,行動) の各カップルにエネルギースコアを割り当てます.推論では,政策は梯度ベースの最適化またはランゲヴィン動力サンプルによるエネルギーを最小限に抑えるアクションを見つけます. IBCは,分散型モデルやCVAEの建築的な複雑さなしに自然にマルチモダルのアクション分布を処理する.デメリット:推論は,RTX 3090上でステップごとに遅い (100-500ms) である. IBCは,鋭い,よく分離された動作分布が存在する正確な接触型作業 (挿入,配合) に強力な成果を示しています.

逆RL (IRL). IRLは,専門家が暗黙に最適化していた報酬機能を直接学習する代わりに,RLを通じて回収された報酬を使用してポリシーを訓練します.このアプローチはBCよりも新しい初期条件に優れている.なぜなら,ポリシーは固定マッピングではなく,根本的な目標を学習します. 実践的な障壁:IRLは内部ループで繰り返しRLトレーニングを必要とする.これは計算的に高価でシミュレーターまたは広範な現実世界の相互作用を必要とする.シミュレーションが成熟し,報酬仕様が本当に困難である自動運転およびナビゲーションの作業ではIRLが最も実用的です.操作のために,現代の建築を持つBCは通常十分です.

失敗分析枠組み IL政策

訓練されたポリシーが実際のロボットで失敗すると,システム的な失敗分析は試行錯誤のデバッグを数日間節約します. この5ステップの枠組みを使用して,ポリシー失敗を診断し修正します.

ステップ1: 障害モードを分類する. 10以上の障害エピソードを見て,それぞれを以下のタイプに分類する:

  • 方法障害: ロボットは物体に向かって正しく動かない (間違った方向,あまりにも速く/遅い,短く止まる).
  • 機械は物体を到達するが,それを掴まんではならない (指が不一致,力不足,角度が間違っている).
  • 輸送障害: ロボットは成功して物体を掴んで,輸送中に落とします (グリップの緩解,障害物との衝突).
  • 位置変更失敗:_ ロボットは成功して運び出したが最終位置変更に失敗 (誤った方向,位置過失).
  • _ 回復失敗:_ ロボットは軌道外状態に入ります (例えば,部分的な把握の後) そして回復できません.

ステップ2: カリブラとハードウェアの問題を確認する. ポリシーを責める前に,カメラが カリブラした位置にあることを確認する (参照マークに対する支配器で測定),結合エンコーダーは漂流していない (腕を既知の姿勢に指揮し,視覚的にチェック) そしてグリッパが予想された幅に近づいていることを確認する. 政策の失敗を偽装するハードウェア問題は 誤ったデバッグ時間の一般的な源です

ステップ3: 障害観測を訓練配分と比較する. 障害の瞬間カメラフレームを抽出して,訓練データと視覚的に比較する. 対象は,政策が見たことのない位置にあるのか? 照明は劇的に異なるのか? 訓練中に隠蔽対象が存在しないのか? そうであれば,修正はデータ収集であり,超パラメータ調節ではありません.

ステップ4:モード平均をチェック. ロボットが有効な2つのターゲット (例えば,どちらかを選択するときに2つのオブジェクトの間) の間の点に向かって移動した場合,デモンストレーションデータにおけるモードを平均する方針です.マルチモダルのアーキテクチャ (CVAEが有効化された分散ポリシーまたはACT) に切り替えるか,一貫した戦略選択を強制するためにデモンストレーションを清掃する.

ステップ5: ストラット・パー・タイムステップアクションエラー. ポリシーがうまく開始するが,20〜40ステップ後に悪化すると,複合エラーが主な問題である.アクションの部品サイズを増加させ,タイムセットを追加するか,特定の故障状態からHG-DAggerデータを収集します.

パイthonトレーニングスニペット:LeRobotでACT

キー設定決定と注釈された Hugging Face LeRobot フレームワークを使用して ACT の最小限の作業訓練スクリプトです

# train_act.py -- Minimal ACT training with LeRobot
from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
from lerobot.common.policies.act.modeling_act import ACTPolicy
from lerobot.common.policies.act.configuration_act import ACTConfig
import torch

# 1. Load dataset (HDF5 format, collected via LeRobot record)
dataset = LeRobotDataset("svrc/openarm-pick-place-v1")
print(f"Episodes: {dataset.num_episodes}, Steps: {len(dataset)}")

# 2. Configure ACT policy
config = ACTConfig(
    chunk_size=100,           # Predict 100 future actions per step
    kl_weight=10.0,           # CVAE KL divergence weight; sweep [1, 5, 10, 50]
    dim_model=512,            # Transformer hidden dimension
    n_heads=8,                # Multi-head attention heads
    n_encoder_layers=4,       # Visual encoder depth
    n_decoder_layers=7,       # Action decoder depth
    input_shapes={
        "observation.images.top": [3, 480, 640],
        "observation.state": [14],  # 7 joints x 2 arms (bimanual)
    },
    output_shapes={
        "action": [14],       # Joint position targets
    },
)

# 3. Train
policy = ACTConfig(config)
optimizer = torch.optim.AdamW(policy.parameters(), lr=1e-5, weight_decay=1e-4)

for epoch in range(2000):
    for batch in torch.utils.data.DataLoader(dataset, batch_size=8, shuffle=True):
        loss = policy.forward(batch)  # Returns dict with "loss" key
        loss["loss"].backward()
        optimizer.step()
        optimizer.zero_grad()
    if epoch % 100 == 0:
        print(f"Epoch {epoch}: loss={loss['loss'].item():.4f}")

# 4. Export for deployment
policy.save_pretrained("checkpoints/act-pick-place-v1")

このスクリプトでは,LeRobot の T1 コマンドを使用してデータを収集し,HDF5 形式で保存したものと仮定します.単一のRTX 4090 でトレーニング時間は: 200 回のデモで2000 年代間約2-3時間.完全な超パラメータースイープとマルチGPUトレーニングについては,LeRobot フレームワークガイド](T9 を参照してください.

共通データ品質問題と解決

Symptom Likely Cause Fix
Policy jerky, oscillates near grasp Inconsistent operator technique across demos Use single operator; filter demos by trajectory smoothness
High train loss, low success Misaligned camera timestamps (>50ms offset) Re-record with hardware sync; check USB bandwidth
Overfit: 95% train, 30% eval Insufficient pose/lighting diversity Add color jitter + random crop augmentation; collect 50+ demos with varied object positions
Policy ignores one camera Redundant viewpoints; model shortcuts to easier camera Random camera dropout during training (p=0.1-0.3)
グリッパー never closes / always closed グリッパー action normalization error Verify gripper action range matches hardware limits; check open/close polarity
Works day 1, fails day 2 Camera or arm bumped; lighting changed Add daily calibration check to deployment routine; mount cameras rigidly

課題の成功指標:政策品質の測定

訓練された政策の質は,非公式の観察ではなく,構造化された評価プロトコルによって測定されるべきです.

  • タスク成功率. 基本指標:評価試験のどれだけの割合でポリシーが完全な作業を成功に完了させるか? 条件ごとに最低20回の評価試験を実行する. 95%の信頼間隔を報告する. 20回の試験では間隔は幅広く (約 +/- 15%),だから小違いを過大に解釈しないでください.
  • 部分完成率. 多段階のタスクでは,完全なタスクが失敗しても,どのサブタスクが完了しているかを追跡してください. 対象に一貫して到達するが,把握に失敗するポリシーは,アプローチ段階で失敗する方法とは異なる失敗モードを持っています.
  • 配布中と配布中でのパフォーマンス* 訓練中に見られる条件と訓練中に見られない条件 (置かれた物体,位置,環境) に対して常に成功率を別々に報告する. 90%の配布中と 40%の配布中での政策は,80%/70%の展開準備と根本的に異なる. 評価プロトコルについては,当社の [政策概括ガイド] (T10) を参照してください.
  • 軌道の品質指標* バイナリー成功/失敗の向こう側:平均の転移 (スムーズさ),経路長さの効率 (実際の経路長さ vs 最短可能な経路) と,専門家示範と比較して実行時間.技術的に成功する冗長な政策は,時間とともにハードウェアを壊し,さらなる収集に使用した場合,より悪いデータを生成します.

訓練監視: 検証失損パターン

政策訓練中に,これらの信号を監視して,問題を早期に診断してください.

検証損失平面. 検証損失が減少し,トレーニング損失が減少し続けていると,あなたはトレーニングセットに過剰に適合している.標準の修正:データ増や (色の振動,ランダム作物) を追加するか,より多様なデモを収集します.

**検証損失振動.**検証損失の大きな変動は,不安定なトレーニング構成を示します.学習速度は2-5倍に減少します. 拡散政策については,騒音スケジュール変動があまりにも攻撃的でないことを確認してください.

KL差分崩れ (ACTのみ). ACTの損失における KL用語がトレーニング初期にゼロに上がると,CVAEの潜伏空間が崩れ,政策は潜伏変数を無視している. KL体重を増やするか,訓練の最初の20%で徐々に体重を増やす KLの暖房スケジュールを使用する.

アクション予測エラーは時間ステップによって. 動作段全体に毎ステップ予測エラーをプロットする.後期的な時間段でエラーが急激に増加した場合 (例えば,100ステップ段でステップ60+) 段の長さを減らす.エラーが均等に高い場合,モデル容量は不足する可能性があります.トランスフォーマー隠れた次元または注意頭の数を増やす.

訓練されたモデルから本物のロボットへ

リアルハードウェアに関する訓練されたIL政策を導入することは,訓練パイプラインが暴露していない実用的な課題を提示します.

カメラの校正漂移. 訓練データ収集と部署の間にはカメラが転機または再装着された場合,2-3cmのシフトでも政策パフォーマンスを10~20%低下させることができます. toujours vérifier les positions de la caméra avant le déploiement en utilisant une procédure de calibration.

制御周波数マッチング. ポリシーは示範収集の同じ制御周波数で実行する必要があります.示範が50Hzで収集されたが,あなたの推論パイプラインが20Hzで実行されている場合 (GPUが追跡できないので),ポリシーのアクション予測は一時的に誤りします. 訓練データを 部署制御周波数に一致させるように 低サンプルするか, 推論ハードウェアが 十分に速くであることを確認する. RTX 3090 の ACT は,たったのカメラで約 20 Hz を達成する.

動作平滑と安全制限. ロボットに送る前に,原油ポリシーの出力を安全層でフィルタリングし,関節制限に絞り込み,速度制限 (通常関節あたり1.0-1.5rad/s) を適用し,低パスフィルター (5-10 Hzカットオフ) を使用して高周波予測騒音を除去する. フィルタ化されていないポリシー出力が引き起こすハードウェア損傷を防ぐため,この方法により,1~2フレームの遅延が追加されます.

模倣学習 の データ 要求

操作作業の最小可行データセットは,ACTでは50回のデモ,拡散政策では100-200回のデモ,VLAの微調整では20-50回のデータセットです.これらは,適条件下での床の推定値です. 一貫した照明,固定カメラのビューポイント,予測可能な位置にある物体. システムに発生する変化をカバーするために 3~5倍以上のデータが 必要になります

データ品質は量と同じくらい重要だ. 作業を一貫して清潔に遂行する熟練したオペレーターによって示範が収集されるべきである. 失敗した試み,躊躇,修正が訓練セットに成功とラベル付けされた場合,政策のパフォーマンスを低下させる. RCSVの [管理されたデータ収集サービス] (パイロット 2500ドル / キャンペーン総額 8000ドル) は 訓練されたオペレーター, 品質でフィルタリングされたエピソード選択, 構造化されたデータセットパッケージを提供しています.

センサーの多様性も重要です. 腕カメラで訓練された政策は,カメラが遮断されたときにしばしば失敗します.最もよい慣習は,少なくとも2つのカメラの視点を - 一つの固定上のまたは横の視点を,一方の腕に搭載された - から収集し,視覚観測とともにプロピオセプティブ状態 (関節角と速度) を含む.

IL研究のためのハードウェアとインフラストラクチャ

模倣学習研究プロジェクトのための最小ハードウェアスタックには,あなたの任務のために十分な自由度を持つロボット腕 (一般操作のために少なくとも6DOF),データ収集のためのリーダーフォローまたはVRベースの遠隔操作システム,2台のカメラまたはそれ以上,少なくとも1つのNVIDIA GPU (ACT/ディフュージョンポリシーのためにRTX 3090またはそれ以上;VLAの微調整のために推奨されるA100またはH100) が含まれる.

RCSVの [ハードウェア・カタログ] (T13) には,同梱可能な遠隔操作リーダー腕と標準カメラ構成のためのマウントハードウェアを搭載している[OpenArm 1] (T14) ($4,500) が含まれています.双手研究のために,DK1プラットフォームは同期記録による双手遠隔操作を提供します. [RCSVプラットフォーム] (T15) はソフトウェア層を提供している.エピソード記録,データセット管理,政策訓練パイプライン,評価ツール.チームは,動作するILプロトタイプへの最も速い経路である [ロボットリースプログラム] (T16) を介して短期プロジェクトのためのハードウェアを購入する代わりに,レンズすることができます.

ハードウェアに投資する前に データから始めたいチームにとって RCSVは サンフランシスコ施設で収集された キュレーションされた 多作業デモデータセットにアクセスできます このデータセットは一般的な操作原始的なものをカバーします 拾い込み,配置,注ぎ込み,折り畳み,組み立てです ACT,拡散ポリシー,そしてハグ・フェイス [LeRobot] (T17) で直接使用するためにフォーマットされています

アルゴリズム比較表:どのIL方法,どのシナリオ

Method Min Demos Multimodal? Inference Speed GPU Required Best For
BC (MLP/ResNet) 50 No ~1ms RTX 3060+ Simple short-horizon tasks, proprioception-only
ACT 50 Yes (CVAE) ~50ms RTX 3090+ Bimanual, long-horizon, ALOHA-class hardware
Diffusion Policy 200 Yes (diffusion) ~200ms (DDIM) RTX 3090+ Multi-strategy tasks, diverse demonstrations
VLA (OpenVLA) 20 Yes (language) ~300ms A100/H100 Novel object generalization, language-conditioned tasks
GAIL 10 N/A (RL-based) ~1ms A100 (training) Few demos + good sim (e.g., peg insertion in MuJoCo)
IBC 100 Yes (EBM) ~200ms RTX 3090+ Contact-rich precision tasks with sharp modes

ほとんどのチームにとって決定流程図:200以上のデモを備えた双手ハードウェアまたは長視野のタスクがある場合はACTから始めましょう.200以上のデモを備えたディフュージョンポリシーを使用し,タスクには複数の有効戦略がある場合は使用してください.言語条件化または最小限のタスク特有のデータを持つ新しいオブジェクト概要が必要であればVLAの微調整を使用します. BCは最も簡単な,最も短い作業または診断基線としてのみ適しています.

多重任務のIL:多重任務のための訓練の1つの政策

複数の操作作業 (ピックアップ・スポット,ドラフト開設,倒し,など) を処理するための単一の政策を訓練することは,現代建築ではますます実用化されています.

**言語コンディショニングは多タスクで必須です.**言語指示がなければ,ポリシーはどのタスクを実行するかを知る方法がありません.言語コンディショニングポリシーは",赤いカップを拾い上げ"または"上部のドラフトを開く"などの指示を受け付け,それに応じてルート行動を行います.ACTとディフュージョンポリシーは,追加のエンコードヘッドを通じて言語コンディショニングをサポートします.

タスク間のデータバランス. ピックアップの500個のデモを収集しても,倒す50件しか収集しない場合,ポリシーはピックアップの行動を強く支持します.タスクの頻度をバランスするためにトレーニング中に重量サンプルを使用するか,タスクのサンプル収集確率をタスクごとにデータセットサイズに逆比例的に明示的に設定します.

多タスクの利用は一般化に役立つ. 逆の見方として,100のデモがそれぞれある5つのタスクでトレーニングすると,100のデモが1つのタスクでトレーニングをするよりも,タスクごとにパフォーマンスはよくなる.多タスクトレーニングは,暗黙の規則化として機能し,視覚エンコーダーはタスクの特定の視覚ショートカットを記憶するよりも,タスクに関連する特徴を学習するよう強制します. [オープンX体体検査結果]T19) はこの効果を大規模に確認した.

期待されるオーバーヘッド. 多作業訓練は,単作業訓練よりも2~5倍以上の計算を必要とします (データが増える,安定性のためにパッチサイズが大きくなります). 推移速度は変わらない.RCSVの データサービス は,複数の作業収集キャンペーンをサポートしています.

超パラメーター 敏感 性: 本当 に 重要 な こと

重要でない超パラメータを調整し,重要でない超パラメータを調整するのに IL 専門家はあまりにも多くの時間を費やします. ACTと拡散政策の何百もの政策を訓練するRCSVの経験に基づいて,ここは,評価された敏感性分析です.

Hyperparameter Sensitivity Recommended Default When to Tune
Action chunk size (ACT) Very High 100 steps Reduce to 20-50 for reactive tasks; increase to 150-200 for slow, smooth tasks
KL weight (ACT) High 10.0 Increase (50-100) if multimodal demos; decrease (1-5) if all demos use same strategy
Noise schedule (Diffusion) High Cosine schedule, 100 diffusion steps Reduce diffusion steps to 10-20 with DDIM for faster inference
Learning rate Medium 1e-5 (ACT), 3e-4 (Diffusion) If training diverges, reduce 5x; if too slow, increase 2x
Batch size Low 8 (single GPU) Increase to 16-32 if GPU memory allows for more stable training
Number of epochs Low 2000 Use early stopping on validation loss; 2000 is typically sufficient for 200 demos
Image resolution Low 224x224 or 480x640 Only increase if task requires fine visual detail (text reading, small object ID)

相互作用効果: ACTではアクション・パーツサイズとKL重量が強く相互作用する.KL重量低 (<5) の大きなパーツサイズ (150+) は,精密な動きを逃す過度に滑らかな平均軌道を生成する.KL重量高 (50+) の大きなパーツサイズは,鋭い,異なるアクションモードを生成しますが,作業中間には振動する.デフォルトペアリング (chunk=100,KL=10) はほとんどの作業で動作します. 部品のサイズを大きくすると,各部品の動作多様性を維持するために,KLの重量を比例的に増やす.

実践的な意味:あなたの政策が低性能であれば,まずアクションの部分サイズやKL重量 (ACT) またはノイズスケジュール (ディフュージョン政策) を調整してください.これらのことは成功率に10〜20%の影響を及ぼします.学習率とバッチサイズは2〜5%の影響を及ぼします. 画像解像度と時代数値は,ベースラインが重度の誤った設定がない限り,2%の影響を及ぼします.

抗うつ病が不足しているとき

行動クローンには,複合誤差が伴う.小規模な予測誤差が時間とともに蓄積されるのは,政策の遭遇では,その過程が訓練されていないことが示されているため (政策の誤差は専門家が示した軌道を押し出す).DAgger (データセット集積) と人間の導かれた変形HG-DAggerは,学習された政策の独自の州分布からデータを繰り返し収集することによってこれを解決する.

標準DAggerプロトコル:

  1. 試行データセットで BCの初期方針を練る
  2. 政策を導入し,自律的に実行させてください. ヒト専門家は,各段階においてどのような行動をとっていたか観察し,記録します (政策の軌道を専門家行動で再標記します).
  3. 訓練セットに再標識された軌道を追加して再訓練します
  4. 政策の軌跡が専門家と一致するまで3~5回繰り返します

**HG-DAgger (Human-Gated DAgger) **は,実際のロボット学習の実用的な変数です.専門家が各時間のステップをリレーベルする代わりに,人間はポリシーを実行を見て,ポリシーが失敗するときにのみ介入します.人間が管理を継承すると (ゲティング) システムでは,人間の修正を記録し,回復が完了したらポリシーに戻ります. 標準DAggerより3~5倍速く 専門家が 重要な失敗状態でしか動かないからです

予想される影響:HG-DAggerは3回の修正回合 (それぞれ20-50の修正経路を追加) を用い,通常,純粋 BCと比較して15-25%の長視野作業成功率を向上させ,修正が対象となる特定の失敗状態の最大の改善を図る.DAgger回合ごとに2~4時間の専門家時間予算.

臨時組成と行動分解:実施詳細

BCパフォーマンスを制限する複合エラーを減らすには,二つの技術が不可欠である.アクション・チャックリング (同時に複数の将来の行動を予測する) とタイムリー・エンセリング (平均的な重複するアクション予測).それらの相互作用を理解することは良い結果を得る鍵である.

アクション・チャンキングは,各観測から次のKアクション (チャンクサイズK) を予測する.ロボットがポリシーを再查询する前にすべてのKアクションを実行する.これは,エピソード length T (エピソード長さ) からT/Kに1つのポリシークエリ数を減少させ,ポリシーにK倍も少ないエラーを起こす機会があることを意味します. 典型的な部品サイズ: ACTではK=50-100 (50 Hz で将来の動作を予測する 1-2 秒).大きい部品は,より平滑な動きを発生しますが,予期せぬ出来事に対して遅い反応を示します.小さな部品はより反応的で,より複合エラーに敏感です.

時間集合は複数の重複したブロックからの予測を平均する.時間ステップtでは,政策は現在のブロックからおよび以前の重複したブロックからこの時間ステップのための予測をしました.これらの予測の指数重度の平均はよりスムーズで一貫した軌道を生み出します. タイムロップ・アセンブリング・ウェイト (ACTのデフォルト設定ではw=0.01) は,最近の予測が古いものと比べてどのくらいの重さをコントロールする.より低いw値はより平滑な動きを生み出します.より高い値はポリシーをより反応的にします.

** パーツサイズを選択する:** パーツサイズが最適なのは,タスクの時間構造に依存する. パーツサイズが異なる段階 (接近,握り,引き上げ,位置) の作業では,パーツサイズが少なくとも1つの完全な段階をカバーするのに十分な長さを持つ必要があります. 通常50 Hz (1-2秒) で50-100歩. 反応的なタスクでは,ポリシーは200ms以内で環境変化に対応しなければならない (ダイナミックキャッチング,力制御挿入) については,部品サイズを10〜20ステップに減らします.簡単なヒューリスティック:デモデータセットの最小タスクフェーズの平均期間を設定します.

** 重要な実装詳細:** 作業をロボットに送る前に,後ではなく,一時的な組み立てが適用されなければならない. 正確な実装はすべてのアクティブブロックから待機予測されたアクションのバッファを保持し,ロボットを指揮する前に各時間ステップで重量平均を計算します.

RCSVのデータ収集事業者は標準的なテレ操作とHG-DAgger修正プロトコルの両方で訓練されています.既にポリシーを訓練し,完全に新しいデモを収集する代わりに標的型修正を通じて改善したいチームのために,HG-DAggerデータ収集は当社の [データサービス]の一部として利用できます.

多重タスク模倣学習:建築とデータに関する検討

複数の作業を行うための単一の政策を訓練することは,個々の政策を訓練するよりもサンプル効率が高く,しかし,特定の建築とデータ設計の選択を必要とする.

タスクコンディショニング. ポリシーには,どのタスクを遂行するかを知らなければなりません.証明された3つのコンディショニングメカニズムは:

  • 言語条件: 政策への入力として自然言語指示 ("赤杯を拾い上げ") を提供する.指示は凍結された言語モデル (CLIPテキストエンコードまたは文言-BERT) によってコードされ,視覚的な機能で連鎖される.これは最も柔軟なアプローチです.政策は既知の概念を組み合わせる新しい言語指示に一般化することができます. 訓練データに言語の注釈が必要である.
  • タスクIDの埋め込み: 各タスクに学習可能な埋め込みベクトルを割り当てます.言語条件付けよりも簡単でタスクセットが固定されたときに動作します. 再訓練なしに新しいタスクに一般化しません.
  • 目標画像の条件付け: 追加入力として望ましい目標状態の画像を提供します. ポリシーは現在の観測を目標に一致させる方法を学びます. 推論時に目標画像が必要ですが,トレーニング中に言語注釈は必要ありません.

**タスク間のデータバランス.**タスクAが500回のデモとタスクBが50回のデモを構成している場合,タスクAに大きく偏見がある.訓練中に温度量によるサンプリングを使用します. 深刻な不均衡 (10x+) の場合は,未充分に表記された作業のためにより多くのデータを収集します - サンプリングトリックは,欠けている多様性を完全に補うことはできません.

訓練 の 常識 の 罠 と その 解決法

Symptom Likely Cause Diagnostic Fix
Robot moves to average of two positions Mode averaging from MSE loss Check if demos have multimodal actions for same observation Switch to Diffusion Policy or increase ACT KL weight
Low validation loss but low success rate Compounding error (policy drifts off-distribution) Plot per-step error over rollout; look for divergence after step 20-30 Increase chunk size, add temporal ensembling, or collect DAgger data
Training loss plateaus at high value Noisy or inconsistent demonstrations Visualize 20 random demos; check for strategy inconsistency Filter demos by smoothness; retrain on clean subset
Robot overshoots targets consistently Action space mismatch (delta vs absolute) Check if demo actions are delta-position or absolute-position Ensure training and inference use identical action representation
Works on one camera but not another Camera extrinsics changed between collection and deployment Compare camera mount position to training-time calibration Recalibrate camera to match training position; or add camera pose to observation
Policy freezes mid-task Observation out of training distribution Log the observation embedding distance from training mean Collect more demos in the OOD region; or add data augmentation

デバッグ作業流: 訓練された方針が実際のロボットに失敗した場合,モデルが悪いかデータ不足であるかを結論付ける前に,この診断配列を遵守してください.

  1. 訓練設定と部署設定の間の動作正常化統計の一致性を確認する.
  2. チェックカメラの位置はデータ収集以来動いていない (視覚的な重複を参照画像と比較する).
  3. 実行する ポリシー 予告された評価エピソード "再プレイモード"で,アクション出力が期待値に一致する確認します.
  4. フォローアップの注意力地図や現在の観測の中間アクティベーションを視覚化します 注意が課題に関連したオブジェクトではなく背景にある場合,視覚入力が壊れたり,並行が間違っている可能性があります.
  5. テストの終了後,データ品質や量の問題が解決される. 再訓練前に,故障モードを対象とした20〜50回のデモを追加します.

このシーケンスにより,リアルロボット部署の失敗の80%が1~2時間以内に解決され,データ早期回収を回避できます.

初心者にとって最も一般的な罠は,アクションスペースの不一致である.この方針はデルタ位置操作 (右に5mm移動) に訓練されているが,絶対位置モード (x=0.35 に移動) に展開される.これは劇的な失敗 (オーバーショットまたはほとんど移動) を生み出す.これは壊れたモデルのように見えるが,実際には構成エラーである. モデルをデバッグする前に常にアクションスペースのコンベンションを確認します.

最初のILプロジェクトへのチェックリスト

  1. 開始する前に,明確な成功基準を設定します.* データを収集する前に,あなたの任務の"成功"の意味を測定可能な言葉で定義してください. ピックアンド・プレス: "対象は目標位置から2cm以内にあり,放出後1秒間安定 (ロール/落) している".挿入: "pegは30N強を上回らないまま完全に挿入される (目標深さ1mm以内に). "曖昧な成功基準は不一致な示標に導致し,政策訓練を劣化させる. すべてのオペレーターと注釈者が参照する共有文書に成功基準を書きなさい.
  2. あなたの作業を選択してください. 単腕で単体で選択して置く作業から始めましょう.これは模倣学習の"こんにちは世界"です. より困難な問題を解決する前に,すべての統合問題を浮上します.
  3. ハードウェアを設置する. 腕を設置し,カメラを校正する (内側 +外側) そして,データを収集する前に端から端までテレ操作制御作業を検証する.
  4. **50のデモを収集する.**一貫したタスク設定を使用します.失敗した試みを拒否します.この初期データセットは,展開可能なポリシーではなく,トレーニングパイプラインの検証のためにです.
  5. Train ACT. LeRobot のトレーニングスクリプトをデフォルトハイパーパラメータで使用します. 100 年代間の検証損失を監視します.
  6. 評価. 訓練の位置にある物体で実際のロボットで20回の試験を実行する.目標: 60%+の成功率. 40%未満の場合,より多くのデータを収集する前にデータの質をデバッグする.
  7. 多様性を追加する. 異なるオブジェクト位置,23つのオブジェクトインスタンスのほか,軽度の照明変更を含む100200のデモを収集する.再訓練して評価する.
  8. Iterate. 構造化評価を通じて故障モードを特定する.これらのモードに対応する標的データ収集する.展開準備が整えるまで繰り返す (85%+代表的な条件での成功).

関連 読書

ACT vs. Diffusion Policy Decision Guide · VLAモデル説明 · 政策概括ガイド · LeRobot開始 · デモ分析費用 · ロボット学習のためのスケーリング法 · データサービス

模倣 学習 プロジェクト を 始め

RCSVは,データセット管理と政策訓練のための OpenArm 1ハードウェア ($4,500), 管理データ収集 ($2,500パイロット) と プラットフォームツール の完全なスタックを提供しています. 試作のために50回のデモが必要か 生産部署のために2000回のデモが必要か サンフランシスコの施設と訓練されたオペレーターは インフラを内部で構築するよりも 早く 機能する政策を 実現することができます

[開始するために連絡してください]