Researchに戻る

行動 チェンキング と 経路 模倣: 実践 的 な 比較

行動の重積 (ACT) と全体的な軌道の行動クローン (cloning) を何時使うか. 遅延,タスクの視界,トレーニングデータへの影響.

[←研究]

行動の塊と全体的な軌道を予測する時と,選択がロボットパフォーマンス,トレーニングコスト,展開遅延に影響を与える方法を理解する.

純真 な 行動 の 複製 問題

標準行動クローン (BC) は,現在の観測を踏まえ,次の行動を予測するためのポリシー π a ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙ ゙

まず ** 複合エラー**: 小さい予測エラーがロボットをわずかに未知の状態に移すため,より大きなエラーを引き起こし,その状態をさらに移すため,タスクが完了する前に大惨な失敗につながる.これは典型的なDAgger問題です. 実践的には,テーブル上の作業に関するBC政策は,訓練の展開中に80%に成功しますが (配布中に残ります) 同じ作業に展開する際には40~50%に失敗します.

モード平均:同じタスクのために複数の有効な戦略が存在する場合 (例えば,左から右に物体を握る) 一模型のBCポリシーが示範を平均して,いずれの戦略も成功に実行しない中間軌道を生成します.

行動 減量 は 何 です か

ACT論文 (Zhao et al., 2023) で導入されたアクション・チャンキングは,現在の観測からHの将来のアクションの _sequence_を予測し,ポリシーを再び查る前に最初のkアクションを実行することによって,複合エラーを処理します.

政策 π(a_{t:t+H} ◎ s_t) は一度にHのアクションを多く出します.H=100を50Hzの制御で,単一のクエリが2秒の動きをカバーします.鍵となる洞察は,単一のステップではなく短視の計画を予測することで,政策は時間文脈を利用して,一貫した戦略にコミットし,平均の問題を回避します.

  • ** パーツサイズ H:** 単一のクエリで予測される将来の時間ステップの数. 50 Hz でテーブルタップ操作の場合,H=100 (2秒) は標準的な ACT 構成です.より大きなH は,作業の多くをカバーしますが,予想外の状態に反応する機会が少ない.
  • 再計画頻度 k: ポリシーを再查询する前に実行されたアクションの数.ACTでは,k=H/4〜H (再計画なしで完全な部分実行).時間集合 (重複部分予測の重量平均) は,さらに実行を平滑にする.
  • CVAEエンコード: ACTは,全デモのスタイル/モードをエンコードするために条件変数自動エンコードを使用し,政策は平均ではなく,一つの戦略にコミットすることを可能にします.これは多モードデモの処理の主なメカニズムです.

拡散政策: 消化による割れ目

拡散政策 (Chi et al., 2023) は,異なるメカニズムを通じて同様の多様性処理を達成します.行動分布を一連の行動における拡散プロセスとしてモデル化します.この政策は,現在の観察に基づいて条件付けられている騒音なアクションシーケンスを否定します.

  • **U-Net拡散:**コンボルショナルなU-Netはアクションブロックを指す.トランスフォーマーベースの拡散よりも速い推理 (GPUで~1050 ms) 構造化,繰り返しの動きを持つ作業に好ましい.
  • トランスフォーマー拡散: 動作シーケンスで長距離依存を捕捉するのによりよい. 遅い (100300 ms). 複雑な双手作業または多段階作業により適しています.
  • 典型的な部品サイズ: H=816 10 Hz制御ポリシーの場合; H=3264 50 Hz制御ポリシーの場合.

任務の視野分析

適切な部品のサイズと再計画頻度は,タスクの視野に依存します.

  • 短視線作業 (<3秒): シンプルなピック・アンド・プレイス,カップスタッキング.BCはしばしば適切に動作します.ACTを使用する場合,H=50100は50Hzで全体の作業を1〜2つのクエリでカバーします.H=1632の拡散も効果的です.
  • 中間水平の作業 (315秒): ペン挿入,ケーブル路由,食品組み立て.これはACTの甘い点です.H=100は2秒をカバーします.2550ステップ (0.51秒) に一度再計画することで,ポリシーが反応的に維持されます.一時的な組成は推奨されます.
  • 長時間作業 (>30秒): 料理の作業流程,多抽出し組成,部屋の組織. 単レベルの割れ目には失敗する. 片段は全作業をカバーできないが,長時間割れ目には反応性がない.階層的なアプローチ (高レベルのタスクプランナー +低レベルの割れ目実行器) が必要である. RT-2 または OpenVLA などのVLM は,高レベルのタスク分解を処理する. ACT または拡散は低レベルの実行を処理する.

訓練データ要件

細分化によって データ要求が微妙に変化します

  • **時間的一貫性要件:**アクション・チャンキングは,デモの連続的な時間ステップが一貫した計画の一部であると仮定する.デモ内の躊躇,修正,後回りはチャンキング予測を混乱させる.騒音な作業では,アクション・チャンキングは,同じパフォーマンスを達成するために,BCより約2倍以上のデータが必要である.なぜなら,デモのより大きな部分は高品質である必要があります.
  • 多モードカバー: ACTにおけるCVAEは,クリーン・ラテンントモードを学ぶために,各戦略の少なくとも2030回のデモが必要です.あなたのタスクには3つの有効な戦略がある場合は,一般政策品質の前に,モードカバーのために6090回のデモが必要です.
  • エピソード長さの正常化: 変数長さのエピソードは固定部分予測に課題をもたらす. 標準長さのエピソードを詰め込むか,トレーニング中に部品マスクを使用することを考慮してください.

性能基準

Algorithm ALOHA Insertion ALOHA Transfer Cube ALOHA Slot Battery Inference レイテンシ
動作のクローン作成 45% 62% 30% 2–5 ms
ACT (H=100) 80% 92% 65% 15–30 ms
Diffusion Policy (U-Net) 76% 88% 60% 10–50 ms
Diffusion Policy (Transformer) 82% 91% 68% 100–300 ms
ACT + temporal ensemble 83% 94% 70% 20–40 ms

ALOHA双手操作基準に関するオリジナル ACT論文 (Zhao et al., 2023) と Chi et al. (2023) の結果.あなたの結果は,タスク,データ品質,ハードウェアに基づいて異なります.

作業とデータ状況に適したアルゴリズムに関する勧告については, RCSV訓練プラットフォーム または [基礎モデル調査](T2 を参照してください.

任務タイプによる勧告

Task Type Recommended Algorithm Chunk Size Notes
Simple pick-and-place BC or ACT N/A or H=50 BC sufficient if single strategy
精度(再現性) insertion ACT or Diffusion-T H=100 Multi-modality in approach angle
Bimanual coordination ACT H=100–200 Joint state space required
Long-horizon (>30s) Hierarchical (VLM + ACT) H=50–100 per subtask Subtask decomposition required
Deformable objects Diffusion Policy H=32–64 Diffusion handles uncertainty better
High-speed (>5 Hz query) BC or U-Net Diffusion H=8–16 Transformer diffusion too slow

RCSV プラットフォームで自分の政策を訓練する

RCSV のトレーニング プラットフォームは,自動 超パラメータ 検索 で BC,ACT,拡散 ポリシー,OpenVLA の 細かな調整 を サポート し て い ます.データセット を 接続 し,数 分 の 間 で 訓練 実行 を 開始 し ます.

プラットフォームを探索 →