Guidesに戻る

ロボットのための模倣学習:ACT,拡散政策,VLAs <unk>実用ガイド (2026)

ロボティクスにおける模倣学習に関する実用的なガイド <unk> ACT,拡散政策,OpenVLA,データ要件,トレーニングパイプライン,故障モード診断

[←ガイド]

人体デモからロボット訓練に関する実践者のガイド ACT,拡散政策,OpenVLA,データ要件,トレーニングパイプライン,故障モード診断,現実世界操作のための展開戦略をカバーする.

模倣 学問 は 何 です か

模倣学習は,ロボットに望ましい行動の例を示して訓練します. 強化学習のための軌道を手動にプログラミングする代わりに,あなたは [テレオペレーション]T3) を通じて作業を示し,ロボットが示範データからあなたの行動を複製することを学んでいます.

基本的な考えは単純です. 人間のデモから (観察,行動) のペアを集めて,その後にニューラルネットワークを訓練して,現在の観察から正しい行動を予測します.訓練されたネットワークはロボットのポリシーとなり,ロボットを自動制御するためにリアルタイムで実行します.

模倣学習は2026年にロボットが新しい操作作業を行うための最も信頼できる方法である.強化学習には,何百万人もの環境相互作用と慎重に形作られた報酬機能が必要です.古典的な運動計画には,すべてのオブジェクトの明示的な幾何モデルが必要です. 模倣学習には示範のみが必要で 現代の建築では 驚くほど少ない

短い 歴史: 行動 複製 から 現代 建築

**行動クローン (BC) **は最も単純な形態である.観察を直接行動に映し出す監督学習.標準回帰損失を使用して (画像,関節_位置) → (次_行動) 対に神経ネットワークを訓練する.BCは実証データが一貫して,ロボットの部署中に遭遇する状態の分布をカバーするときにうまく動作します. 機器が示された軌道を離れる時 失敗する 原因は _compounding error_または _distribution shift_と呼ばれる問題です

**Dagger (データセットアグレーゲーション) **は,Ross et al.によって2011年に導入された. ロボットが実際に訪問する州で繰り返し新しいデモを収集することによって分布シフトを扱います.初期BCポリシーを訓練した後,それを展開し,それを漂流させ,その後人間に結果の状態を修正させます.これらの修正はトレーニングセットに追加されます. 理論上には優雅だが,運用的には高価である. 訓練の各回中に人間専門家が必要である.

**GAIL (Generative Adversarial 模倣学習) **は,ホーとエームンによって2016年に導入され,模倣学習と逆の訓練を組み合わせています.差別者はロボット行動と人間の行動を区別することを学び,政策は差別者を騙す訓練を受けています. GAILはBCよりもマルチモダルのデモをうまく処理するが,オンライン環境の相互作用 (通常はシミュレーション) を要求し,調節するのが悪名高い.現時点ではリアルロボット設定では使用が限られている.

2026年に現実世界のロボット操作を支配する3つのアプローチは ACT,拡散政策,およびVLAモデルが行動クローンパラダイムに基づいているが,その核心制限に対処する建築革新を加える.

模倣 を 学ぶ こと が 操り に 勝っ て いる の は なぜ です か

2023年以前,ほとんどのロボット工学研究所では,強化学習が最終的に操作を解決すると仮定した.その期待は接触型作業では実現していない.

  • サンプル効率: 効果的な模倣学習方針は,1日間で収集された50~500人の示範で訓練できます.同じ作業のRLには数百万の環境ステップが必要で,数週間のシミュレーションまたは実際のハードウェアで数ヶ月かかります.
  • **報酬エンジニアリングは不要:**RLには"成功"の意味を正確に把握する報酬機能が必要です.服を折り畳むことや部品を組み立てることなどの操作作業では,報酬を定義することは非常に困難です.模倣学習は問題を完全に回避します.
  • 遠隔操作データが自然である: 現代遠隔操作ハードウェア (リーダーフォローアーム,VRコントローラー,外骨格手袋) は,高品質のデモを直接収集することを容易にする.データ収集プロセスは,ポリシー入力フォーマットに直接マッピングする.
  • **実世界の互換性:**RL電車はシミュレーションにおいて最も優れたものですが,接触型操作のためのシム-トゥ-リアル転送は依然として信頼性がない.真世界のデータで直接模倣学習電車は,訓練段階における現実のギャップを排除します.
  • 基礎モデルとの複合性: 訓練前の視言語モデル (SigLIP, DINOv2) は,模倣学習が直接利用できる強力な視覚表現を提供している.RLは,報酬信号がネットワーク全体を通して流れるため,訓練前の表現を簡単に組み込むことはできません.

RLは,まだ移動 (UnitreeのG1,ボストンダイナミックスのアトラス) と明瞭な報酬信号 (ゲームプレイ,ナビゲーション) の作業において優位である.操作の場合は,取れ,配置,挿入,折り,注ぎ,組み立て 模倣学習が実践的な選択である.

ACT: トランスフォーマーで行動する

ACTは2023年にスタンフォード大学でトニー・シャオ等によって導入された.これはテーブル操作のための模倣学習のワークホースである.それは行動クローンにおける複合エラー問題を直接解決する,単一の次のアクションよりも将来のアクションの chunk (シーケンス) を予測する.

ACT の 働き方

ACTは,トランスフォーマー背骨を持つCVAE (条件変異自動エンコーダー) 架構を使用します.エンコーダーは,ResNetまたはViTビジュアルエンコーダーを通過した現在の観測カメラ画像を処理し,関節位置を加え,それを潜伏表現にコードします. 解読器はこの潜伏コードを採取し,将来の _k_アクションの連続を生成します (通常は k=100, 50 Hz制御で2秒を表します).

重要な洞察は,chunkingによって時間滑らかすること (chunking) です.モデルが同時に100の将来の行動を予測することで,次の直接的な行動をのみならず,一貫した軌道を生成する必要があります.これは個々の示範軌跡がわずかに異なる場合でも,滑らかで一貫した動きを生成する暗黙の調節器として機能します.

部署中に,ACTは タイムラブル・エンセンブリングを使用します.各タイムステップで,新しい100ステップアクション・パートを生成しますが,実行されたアクションは,現在のパートと以前のブロックのこのタイムステップのための予測アクションの重量平均です.これは軌道をさらに平滑させ,緊張を軽減します.

ACT を いつ 使うか

  • 12ロボット腕でテーブルタップ操作 (オリジナル ALOHA用ケース)
  • 比較的決定的な戦略を持つタスク (選択場所,挿入,組み立て)
  • 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで 訓練の速さで
  • 適量なハードウェアに展開する必要があるとき (単一の消費者のGPUで実行される, ~15 msの推論)

ACTに関する典型的なデータ要件

  • 簡単な選択: 50回のデモ → 85%+の成功
  • 双手調整:100回のデモ → 80%+の成功
  • 精密な挿入 (ペグイン・ホール,USB): 200 回のデモ → 70%+の成功
  • 複雑な多段階の課題: 400~800回のデモが必要

質量より質量の方が重要だ. 清潔で一貫した 50 回のデモは 騒音が大きい500 回のデモよりも 優れている.

レロボットでACT訓練

2026年にACTを訓練する最もアクセス可能な方法は,ハグ・フェイスの [LeRobot] (T4) フレームワークです. HDF5のデモデータをLeRobotフォーマットに変換した後:

# Install LeRobot
pip install lerobot

# Convert your dataset
python -m lerobot.scripts.convert_dataset \
  --raw-dir ./my_episodes/ \
  --repo-id my-org/my-task \
  --raw-format hdf5_aloha

# Train ACT policy
python -m lerobot.scripts.train \
  policy=act \
  dataset_repo_id=my-org/my-task \
  training.num_epochs=2000 \
  training.batch_size=8

訓練は通常,1つのRTX 4090で28時間間で収束する 100200エピソードのデータセット.

ACT: 利点とデメリット

Pros Cons
Extremely data-efficient (50 demos for simple tasks) Struggles with multi-modal action distributions
Fast inference (50+ Hz on consumer GPU) No language conditioning
Smooth trajectories via temporal ensembling Sensitive to demonstration inconsistency
Well-supported in LeRobot framework Single-task only (one policy per task)
Low training compute (single GPU, hours) Temporal ensembling weight requires manual tuning

拡散政策

拡散政策は,チェン・チ・アト・コロンビアで2023年に導入されたもので,ステーブル・ディフュージョンのようなイメージ生成モデルに似たアプローチを,ロボットアクション予測に適用している. デモンストレーションデータには複数の有効戦略が存在するタスクの選択に適している.

拡散 政策 の 働き

直接行動予測をする代わりに,ディフュージョン・ポリシーはランダムなノイズベクトルをクリーンアクション軌道を繰り返し指定することを学びます.トレーニング中に,デモからクリーンアクション軌道を取り,ガウスノイズのレベルを変化させ,ネットワーク (通常は1D U-Netまたはトランスフォーマー) を訓練して追加ノイズを予測します. 推論中に,純粋な騒音から始まり, K ステップ (通常は DDIM スケジュリングを使用して K=1050) を繰り返して,クリーンなアクション軌道を生成します.

重要な利点は ** 多様性**:拡散モデルは自然に複数の有効なソリューションを表します.物体を把握する二つの方法が同じくらい良い場合 (左から右にアプローチする),拡散ポリシーは,単一の誤った中間軌道を平均せずに両方のモードを表現できます. MSE損失の平均モードで標準行動クローンが作られ,バイモダル作業には大惨事である.

拡散政策は,除算プロセスが本質的に一時的に一貫したアクションシーケンスを生成するため,また例外的に滑らかな軌跡を**生成する.これは,軌跡の滑らかに直接成功に影響を与えるような擦り出し,注ぎ込み,表面追記などの接触に富んだ作業に適しています.

拡散 政策 を いつ 使う べき です か

  • 複数の有効な戦略を持つタスク (データには同じ目標への異なるアプローチが含まれています)
  • 精密な力軌跡が重要である接触型作業
  • 高軌道の滑らかに要求される作業 (流し,描き,表面拭き)
  • 操作は少し異なるスタイルで複数のオペレーターからデータを持っている場合
  • 繰り返すデノイジング (3080 ms推理) に十分な計算能力を持つGPUが搭載されている場合

拡散政策の典型データ要件

  • シンプルな単模作業: 100~200回のデモ
  • 多様式作業 (多種有効戦略): 200~500回のデモ
  • 複雑な接触型操作: 500~1,000回のデモ

ACTとは重要な違い:拡散政策は,多型分布を表現できるため,示例不一致性に敏感性が低い.これは複数のオペレーターによって収集されたデータに対して寛容性を高めます.

拡散政策: 利点とデメリット

Pros Cons
Handles multi-modal action distributions natively Slower inference than ACT (10-30 Hz)
Exceptionally smooth trajectories Needs more data than ACT for simple tasks
Robust to operator variation in demonstrations More hyperparameters (diffusion steps, noise schedule)
Strong performance on contact-rich tasks No language conditioning (without extensions)
Supported in LeRobot and robomimic Higher GPU memory requirements during training

OpenVLAとビジョン言語アクションモデル

ビジョン言語行動 (VLA) モデルは,2026年にロボット学習の境界線を表しています.彼らは,前訓練されたビジョン言語モデルとアクション予測を組み合わせ,ロボットが自然言語の指示 ("赤いカップを拾ってトレイに置く") を従って,微調整中に見たことがないタスクやオブジェクトを一般化することができます.

基礎モデル に 関する 変化

伝統的な模倣学習 (ACT, Diffusion Policy) は,タスクの特定ポリシーをゼロから訓練します.各新しいタスクには新しいデータセットと新しいトレーニングランが必要になります.VLAモデルは,すでに視覚シーンと言語を理解する,プリトレーニングされた表現を提供することでこの方程式を変更します.

実践的な結果:VLAモデルは,視覚的理解と言語の基礎を重く担う作業が,インターネット規模データやOpen X-Embodiment (970K+エピソード,22+ロボットタイプ) のような大規模なクロス・エンボディメントロボットデータセットでの予備訓練中に行われたため,タスク特有の示範が少ない場合で合理的なパフォーマンスを達成できます.

キーVLAモデル

  • OpenVLA (バークレー, 2024):Llama 2 + SigLIPで構築されたオープンソース7Bパラメータ VLA.Open X-Embodimentデータで訓練された.100500のデモで新しいロボットにフィーナティューン.A100GPUで5Hzで動作する.
  • pi0 (物理知能, 20242025): 巧みな手を含むクロスインボディメントデータで訓練されたプロパエタリVLA. 見えないタスクへのゼロショット転送が示された.物理知能のAPIを通じて利用可能.
  • Octo (バークレー, 2024):軽量93Mパラメータ一般主義政策. 50200のデモで迅速な微調整のために設計された.オープンソース,単一の消費GPUで動作する.
  • RT-2 (Google DeepMind, 2023): PaLM-Eに基づく55Bパラメータ VLA. 最新的な通用化だが,大規模な計算 (8 TPU v5eチップ) が必要である.公に利用できない.

調整と訓練をゼロから始める

** 訓練前のVLAを精準調節する** (実践的な経路):OpenVLAまたはOctoチェックポイントからスタート.ロボットで100500のデモを収集する.LoRA (7B+モデル) または完全な精準調節 (Octo-scaleモデル) を使用する.トレーニング時間:14GPUで424時間.これは,訓練前の視覚と言語表現を活用し,ほとんどのチームに推奨されるアプローチです.

VLAをゼロから訓練する (資金がよくあるラボのみ):様々なロボットやタスクで10,000100,000+のデモ,加えて1001,000+のGPU時間が必要です.新しいロボット実施形態クラスのための基礎モデルを構築している場合のみ,または既存のVLAに含まれていない機能が必要な場合のみ.

VLAモデル:メリット・デメリット

Pros Cons
Language-conditioned task execution Slow inference (3-10 Hz)
Multi-task from a single model Requires A100-class GPU for 7B+ models
Strong generalization to new objects Fine-tuning is more complex than ACT/DP training
Leverages internet-scale pre-training Larger models are sensitive to prompt formatting
Cross-embodiment transfer potential Still maturing — fewer deployment success stories than ACT/DP

アルゴリズム比較表

Algorithm Data Efficiency 汎化 Compute (Train) Compute (Infer) Ease of Training Best For
ACT Very high (50-200) Low (single task) 1 GPU, 2-8 hrs 50+ Hz, 1 GPU Easy Single-task tabletop, fast iteration
Diffusion Policy High (100-500) Medium (multi-strategy) 1 GPU, 4-16 hrs 10-30 Hz, 1 GPU Moderate Multi-modal tasks, contact-rich
Behavioral Cloning High (50-200) Very low 1 GPU, 1-4 hrs 100+ Hz Very easy Prototyping, baselines
GAIL Medium (100-1000) Medium Needs sim, days 50+ Hz Difficult Sim-only research, locomotion
OpenVLA / Octo High (50-500 fine-tune) High (cross-task) 1-4 A100s, 4-24 hrs 3-10 Hz, 1 A100 Moderate-Hard Multi-task, language-conditioned

訓練 ライン: 5 段階

どのアルゴリズムを選んでも,訓練パイプラインはこれらの段階に従います. それぞれの段階の詳細は最終的な政策の実行に非常に重要です.

第1段階:データ収集

人体デモを [テレオペレーション] (T5) で収集する.最高品質のデータのためにリーダーフォロワー腕を使用するか,総操作作業で高速通路のためにVRコントローラを使用する.共同データのために50Hzで記録し,カメラでは30fpsで記録する.HDF5フォーマットで保存する.完全なプロトコルについては,当社の [データ収集ガイド] (T6) を参照してください.

この段階における重要な決定は:示例数 (上記のアルゴリズム特有の勧告を参照),操作者の一貫性 (ブートストラップの操作者13),スタートステートランダム化 (さまざまなオブジェクトの位置が体系的に設定される) とカメラの設定 (最小: 1腕 + 1オーバーヘッドカメラ).

ステップ 2: データフォーマットと事前処理

訓練準備の格式に原始録音を変換する:

  • 画像サイズ変更: モデルが予想する入力解像度にカメラフレームをサイズ変更 (通常 ViTベースのエンコーダーでは224x224 と ResNetでは256x256 です).細かい詳細を保全するために,反アライズ式サイズ変更 (ランチョスまたはビキュビック) を使用します.
  • アクション正常化: 動作を[-1, 1]範囲に正常化する.訓練セットから平均と標準偏差を計算する.部署時に同一の正常化を実行する.
  • エピソードフィルタリング: 失敗したエピソード,異常期間 (>3標準偏差) のエピソード,品質レビュー中にマークされたエピソードを削除する.
  • 電車/検証分割: 検証のために10~15%のエピソードを保持する.エピソードごとに分割,フレームによって分割することはありません.
  • ** フォーマット変換:** レロボットトレーニングでは, T1を使用して HDF5 を パークレットに変換します. ロボミミックでは,ネイティブ HDF5 ローダーを使用します.詳細については, [データフォーマットガイド](T7]を参照してください.

第 3 段階:訓練

アルゴリズムによる典型的なトレーニング構成:

  • ACT: 2,000~5,000時代,学習速度は 1e-5 とコシヌスケジュール,パッチサイズ 816.トレーニング時間: RTX 4090 で 28時間.
  • 拡散政策: 5002,000時代,学習率1e-4とコシヌスケジュール.訓練のための100の拡散ステップを持つDDPM,推論のための1050のステップを持つDDIM.訓練時間:1RTX4090で4~16時間.
  • VLAの精細調整: 20100時代,学習速度は2e-5. 7B+モデルに対する LoRA (ランク1664) またはサブ-1Bモデルに対する完全な精細調整. 14A100GPUでトレーニング時間:424時間.

検証損失と検証損失を監視する 数百年後に検証損失が訓練損失と異なった場合,あなたは過度に適しています

第4段階:評価

検証損失は実世界のパフォーマンスに関する弱い予測指標である.唯一の信頼できる評価は,実際のロボットに関するポリシーを展開し,作業の成功率を測定する.統計的に有意な結果を得るために少なくとも20回の評価試験を実行する (95%信頼間隔は20回の試験で約 ±20%であり,50回の試験では ±10%である).失敗分析のためにすべての評価エピソードを記録する.

評価条件は以下の2つである: (1) 定数 対象位置,照明,カメラ角度がトレーニングデータと同じ; (2) 乱乱 ランダム化位置,異なる照明,または未見物例.定数と乱 した成功率の差は,あなたのポリシーの一般化境界を示します.

段階5 部署

訓練されたモデルをONNXまたはTorchScriptに展開するために輸出する.ロボットのオンボードGPUで推論を実行する (内蔵のNVIDIA Jetson Orin,ワークステーションのRTX 4060+).推論遅延を監視する 政策がロボットの制御周波数で実行できない場合は,推論通話ごとに複数の将来のアクションを予測するためにアクションチャンキングを使用する.

[データフライホイール]T8) のフィードバックのために,すべての展開エピソードを記録する.ポリシーバージョン,観測データ,予測されたアクション,結果ラベル (成功/失敗) を含む.

アルゴリズムによるデータ要件

Task Complexity ACT Diffusion Policy OpenVLA (fine-tune) Octo (fine-tune) Typical Success Rate
Simple pick-place 50 100 100 50 80-95%
Bimanual coordination 100 200 200 100 70-85%
Precise insertion 200 300 300 150 65-80%
Multi-step assembly 500 500 500 300 50-70%
Multi-task (language-cond.) N/A N/A 500-2000 200-1000 40-70%

訓練のためのハードウェア要件: ACTと拡散政策は,単一のRTX 3060またはそれ以上の (16 GB VRAM推奨) で訓練されます.OpenVLAの微調整には少なくとも 1 A100 (40 GB) または 2 RTX 4090s が必要です.単一のRTX 4090でオクトー微調整です.すべてのアルゴリズムは画像データセットをロードするために高速 NVMeストレージを利用します.

5 常見 な 失敗 方法 と その 解決方法

1. 分布シフト (複合誤差)

症状: 政策は最初の数秒間に有効になり,徐々に軌道を外れて失敗します.

根本原因: 時間の経過とともに小規模な予測誤差が加え,ロボットは訓練データに反映されていない状態に押し込まれています.政策はこれらの状態を一度も見ていないため,ますます誤った行動を生み出しています.

修正: アクション・チャンキングを使用する (ACTは100ステップ・チャンキングを予測し,エラーが複合する意思決定ポイントの数を減らす).訓練中に画像増幅 (ランダム作物,色のジート) を追加して,視覚エンコーダーを軽度のビューポイント変更まで強固にする.復元デモを収集する:ポリシーを漂流するまで実行し,漂流状態からタスク完了まで遠隔操作する. 追加できる最高値のデータです.

2\ 多様式崩壊 (モード平均)

症状: ロボットは有効な戦略の2つ間の位置に向かって移動し,どちらにも到達しない. または複数の戦略が平等に有効な意思決定点でロボットが凍結する.

**根本原因:**訓練データは,異なる戦略 (左から右にアプローチ) の示範を含み,MSE損失はそれらを単一の誤った中間軌道を平均する.

修正: マルチモダルの分布をネイティブに表示する拡散ポリシーに切り替える.ACTに留まる場合は,実証戦略を標準化する. 証明はすべて同じアプローチに従うことを確認する.少数戦略を使用するデモを削除する. 代替的に,トレーニング中に戦略指標変数に政策を条件付けする.

3. 行動予測による誤差を複合する

症状: ロボットは正しい軌道を作りますが,時間の経過とともに位置誤りを蓄積し,目標から13cm離れた把握をします.

**根源:**訓練と展開の間の動作正常化不一致 (異なる平均/std値) または政策は長軌を逸した軌道をわたって浮動点エラーを蓄積するデルタアクションを予測する.

修正: 訓練と部署中に同じ標準化統計 (平均, std, min, max) が使用されていることを確認する.可能な限りデルタ行動よりも絶対的な共同位置目標を好む.デルタ行動政策では,純粋にデルタを統合するよりも,予測された軌道を現在の観測状態に定期的に再固定する.

4 ハードウェア不一致

症状: 元のデータ収集設定でうまく機能するポリシーは,別のテーブル,異なる照明,または同じロボットモデルの別のインスタンスの移動で完全に失敗します.

** 原因:** カメラの位置が変化した (連 5 mm 度程度で把握),照明条件が変化した (視覚的特性を影響する) またはロボット関節の校正がユニットごとに異なる.

修正: 固定装置を固く搭載したカメラを設置し,部署セッションごとに外部の内容を確認する.カメラの姿を確認するために校准対象 (ArUcoボード) を使用する.多ロボット部署のために,各ロボットユニットに小さな校准データセット (2030 デモ) を収集する.訓練中にドメインランダム化:ランダムな明るさ/コントラスト,ランダムなカメラ作物,ランダムな背景テクストを適用する.

5 十分なリセットが不足している

症状: この政策は低成功率があるようですが,より詳しく調べると,多くの失敗は,訓練配分から外れた状態から始まることが明らかになりました

根源: 評価プロトコルは,エピソード間の訓練分布内の状態にシーンを適切にリセットしない.または訓練データは,部署条件に一致しない狭いスタート状態分布を有する.

修正: 対象位置,ロボットホーム設定,シーン配置など,明示的なリセット基準を定義する. 各評価エピソード前にリセット品質を確認する.データ収集中に,意図された展開分布を介して,開始状態をランダムに並べ替える.データセットメトリックとして開始状態の覆い方を追跡する.

リアル・シム・トゥ・リアル評価

リアルロボットにシミュレーションや部署を訓練することは魅力的です リアルロボットデータも基本的に無料です しかし現実のギャップは 純粋なシムからリアルに 操作のほとんどの作業では信頼性が低下します

模倣 が 助け に なり ます か

  • **Simプレトレーニング +実在のフィニチューニング:**10,000100,000のシミュレーションエピソードでトレーニングし,その後50200の実在エピソードでフィニチューニングします.Simプレトレーニングは強力な初期化を提供します.実在のフィニチューニングは現実のギャップを埋める.実在のデータが稀であるときに,これは実在データだけでトレーニングを一貫して上回ります.
  • ドメインランダム化: 模擬訓練中に視覚的特性 (テクスチャー,照明,カメラ位置) と物理 (摩擦,質量,関節抑制) をランダム化する. 政策は変化に強固になるように強制する.その一部は現実の変化に重なり合っている.実際の微調整と組み合わせると最も効果的です.
  • 移動と全体制御: Sim-to-realは操作よりも移動にはるかにうまく機能します UnitreeのG1とGo2コントローラはほぼ完全にIsaac Labを使用してシミュレーションに訓練されています.
  • ポリシー検証とデバッグ: 実用ハードウェアに展開する前に,訓練されたポリシーをシミュレーションで実行します.シミュレーションはハードウェアの損傷をリスクにさらさずに,重大なエラー (誤ったアクションスペース,正常化バグ,制御周波数不一致) を捕捉します.

模倣 が 役に立たない 時

  • 接触に富んだ操作のための純粋なシム-トゥ-リアル: シミュレーションは実際のオブジェクトの摩擦,変形,接触動態を正確にモデル化することはできません.純粋にシムに訓練されたポリシーは柔らかいオブジェクト,薄いオブジェクト,または精度挿入作業を把握することができません.
  • 訓練データとしてシミュレーションカメラ画像: 光現実的なレンダリングの進歩にもかかわらず,シミュレーション画像のみで訓練された政策は,実際のカメラで30~50%の成功率低下を示しています.神経レンダリング (NeRFベースの) は改善していますが,まだ政策訓練のための生産準備はできていません.
  • 変形可能な物体に関するタスク: 服,ロープ,食品を正確にシミュレーションすることは非常に困難です.変形可能な操作のためのシム訓練されたポリシーは,膨大な実データなしで,実際のハードウェアに転送されることは稀です.

チェックリスト を 始め

ゼロから導入された模倣学習政策へ移行するための 10 つのステップを

  1. ** ロボットハードウェアを選択してください.** 最初のプロジェクトでは:ViperX-300 S2, Koch v1.1 または [OpenArm]T9.予算: 2,000$~8,000$.腕には 50Hzの位置制御が必要です.
  2. **テレオペレーションを設定.**最高データ品質のリーダーフォローアーム,または低コストのVRコントローラー (Meta Quest 3) を設定します. [テレオペレーションガイド]T10 を参照してください.
  3. マウントカメラ. 最低: 1 つの腕カメラ (インテル・リアルセンス D405) + 1 つのオーバーヘッドカメラ (リアルセンス D435). 硬いマウントを使用する.
  4. 記録ソフトウェアをインストール. LeRobot のデータ記録ツールや ALOHA 記録スタックを使用します. HDF5 輸出を確認するには,正しい周波数で画像,関節位置,アクションが含まれます.
  5. 最初のタスクを定義する. シンプルなスタート: 固定された場所から単一のオブジェクトを選んで目標地帯に配置する.複雑さを追加する前にこれをマスターする.
  6. 50回のデモを集める. 一貫した操作,一貫した戦略. 20回の間に10分かけてデータ品質を確認する. 悪いエピソードをすぐに拒絶し,再録画する.
  7. 最初の ACT ポリシーを訓練する. LeRobot の訓練スクリプト を デフォルト 超パラメータ で使ってください.訓練は 2~4 時間 で 1 つの GPU で完了する必要があります.
  8. 20回の評価試験を実行します. 各試験前のシーンを同一にリセットします.成功/失敗を記録し,失敗分析のために各試験のビデオを保存します.
  9. 故障を診断し,ターゲットデータ収集する. 最も一般的な故障モードを特定する.その故障を特定的にターゲットとする20~30の示例を収集する.再訓練
  10. ** 80% の成功率まで繰り返します.** ほとんどのチームは,簡単な作業のために23 の収集訓練サイクルで80%+に達します.その後, [データフライホイール] (T11) 操作に拡大します.

よく 聞かれる 質問

何度示しが必要か?

簡単なピックアンド・プレスタスクでのACTでは: 80%以上の成功率のために50回のデモは十分です. 拡散政策では:100200から始めましょう. VLAの微調整では:100500がタスクの複雑さに依存します.すべての場合,データ品質は量よりも重要です 清潔なデモは500回のノイズよりも優れている.タスクの複雑さによる詳細な推定については,上記のデータ要件表を参照してください.

流通政策に対する ACT どれを選びましょうか?

作業に明確な戦略が一つある場合,展開への最も速い経路を希望する場合,ACTを使用します.データに同じ作業に複数の有効なアプローチが含まれている場合 (複数のオペレーター,曖昧な把握戦略),拡散ポリシーを使用します.言語条件付きの多作業実行が必要な場合は,VLAを使用します. 疑いがある場合は ACT を始めましょう 比較速くなって 複雑なモデルに投資する前に データ収集パイプラインを検証できます

シミュレーションデータを使ってもいいですか?

模擬データだけでは接触豊富な操作では信頼できない.最も効果的なアプローチは, sim プリトレーニング + リアル・フィーナティングです. 10,000+ の模擬エピソードでトレーニングし,その後 50200 のリアルエピソードでフィーナティングします. ローコモーションタスクでは,ドメインランダム化による純粋な sim-to-real がうまく機能します.

どんなロボットハードウェアが必要か?

最低は:50Hz (ViperX-300, Koch v1.1, OpenArm,または類似) に位置制御するロボット腕,遠隔操作インターフェース (リードアームまたはVRコントローラー),23カメラ (腕 +オーバーヘッド),およびNVIDIA GPU (ACTのRTX 3060またはより良いRTX 4090またはA100のDifusion PolicyおよびVLA) を搭載する作業ステーション.スタートアップセットアップの総予算:5,000~15,000ドル.

模倣学習 と 強化学習 の 違い は 何 です か

人体デモから模倣学習訓練 ロボットに何をすべきか示します. 報酬信号で試行錯誤から学習訓練を強化します. ロボットは,報酬を最大限に高める行動を探検し,学習します.操縦のために,模倣学習はサンプル効率がはるかに高い (50500デモ対数百万 RLステップ) で,報酬エンジニアリングを必要としません. RLは移動と作業に優位性があり 明確な報酬信号があります

訓練はどのくらいかかるのか?

放送方針 500話: 416時間.VLA 細かな調整 500話: 14A100 GPU で 424時間.実際のボトルネックは通常データ収集と評価であり,コンピューティング訓練ではありません.

どのデータ形式を使えばよいのか?

HDF5はロボットデモデータのための標準形式です.各エピソードファイル内の個々のデータセットとして共同位置 (qpos),速度 (qvel),カメラ画像,アクションを保存します.LeRobotでトレーニングするには,パルケットフォーマットに変換してください.詳細な仕様については,当社の [データフォーマットガイド]T12]を参照してください.

模倣学習は 携帯操作に役立つのか?

オープンVLAとpi0のようなVLAモデルは,モバイル操作に適しているため,そのプレトレーニングは様々な実施形態をカバーしている.テーブルタスクでは,ACTとディフュージョンポリシーが最も実践的な選択であり続けています.

訓練データ を RCSV の 専門家 に 集め て ください

RCSVは,訓練を受けたオペレーター,校正されたハードウェア,品質管理,目標格式での配達など,エンドツーエンドデータ収集サービスを提供しています.また,独自の収集パイプラインを構築するチームにロボットリースも提供します.

[データ収集サービス] T13] [パイロットのためのハードウェアを借りる]