Learnに戻る

ロボット学習における軌道の表現:共同空間,タスク空間,デルタ

ロボット軌跡が学習アルゴリズムに保存され,どのように表現されるのか <unk>関節角,カーテジアンポーズ,デルタアクション,相対表現.

[←学び]

ロボット軌道を表現する方法は,あなたの政策が何を学ぶことができ,そしてどのように一般化するかに影響します.

ロボット軌跡とは?

ロボット軌道は,ロボット操作の1つのエピソードで記録された状態とアクションの連続である.公式には: T0,ここで T1は,時間のステップで完全なセンサー観測です T2 (カメラ画像 +関節状態 +力読み込み) そして, T3は,実行されたアクションです.

訓練では,行動順序が政策が再現することを学ぶ必要がある.しかし"行動"は単一の普遍的な形式ではありません. デザインの選択によって異なります.

共同宇宙代表団

直接表現: 動作 T4 は絶対関節角 T5 のベクトルである.ロボット制御器は関節角の標的を受信し,各関節を指揮位置に移動する.

  • メリット: IKは必要ない 角はモーターコントローラに直接届きます.決定性:同じアクションが常に同じコイントコンフィギュレーションを生成します.高速実行 中間計算はありません.
  • **デメリット:**腕特異性. 6DOF腕を訓練した方針は,同じ作業のためにも再訓練なしに 7DOF腕に転送することはできません. 直感性ではない:角度値は,意味のある作業概念に対応しません.
  • 標準使用: ALOHAとACTは,絶対的な共同空間を主要なアクション表現として使用します.固定作業空間,単臂作業では,これはうまく機能します.

カートセイアンタスクスペース

T6は,望ましい最終効果的姿勢を表します. T7 は3つの位置構成要素と方向のための四角形です.

  • メリット: 直感性 動作は,最終効果がどこに位置するかを直接指定します. 異なる共同構成が異なるロボットに,類似した作業空間を介してより転送可能です.
  • デメリット: 共同コマンドに変換するには IK を必要とする. 遅延と単一性リスクが増加する. 回転表現は難しい. エイラー角はギムバルのロック (回避) を持っている. 四角形はコンパクトであるがユニークではない (SOの2重カバー) 3.
  • 回転表示注意: コードでは常に四角 (ユラー角ではなく) を使用する.神経ネットワークの出力については,6D回転表示 (回転マトリックスの最初の2列) を考慮してください.

デルタ行動

絶対目標ではなく,デルタアクションは現在の状態から _change_を指定します: T8 (関節角の変化) または T9 (カートセイアの姿の変化).

  • **Deltaが学ぶのはなぜ簡単なのか:**Deltaのアクションの大きさは小で軌道を横断してほぼ恒常である.ネットワークは,ワークスペースの位置によって変化する大きな絶対座標よりも小規模で制限された値を予測することを容易に学んでいます.
  • 暗示的な安全性: デルタ操作を最大規模に切り落とすことで ロボットの速度が制限されます
  • 標準使用: 拡散ポリシー,RT-1,Octo,およびほとんどのVLAモデルは,カーテジアンデルタアクションを主なアクションスペースとして使用します.

絶対対物相関表現

基本的な一般化問題です. ロボットの作業空間枠で行動が表現されるべきか,それとも操作されている物体に対して相対的に表現されるべきか.

  • 絶対 (ワークスペースフレーム): 動作値は,オブジェクトがワークスペースにある場所に依存します.テーブルが10cm移動すると,ポリシーが失敗します.固定設定に良い;展開一般化に悪い.
  • オブジェクト関連: アクションは検出されたオブジェクトポーズからのオフセットとして表現されます.ポリシーは"オブジェクトより5cm上の"から"0.3, -0.1,0.15) に移動する"よりも"オブジェクトより5cm上から"を把握します.

軌道の長さとパッディング

作業の期間は異なります 簡単な握手には2秒 (100ステップ50Hzで) 時間がかかるし,多段階の組み立てには30秒 (1500ステップ) がかかるので,パッチトレーニングには実用的な課題が生じます.

  • ** 固定長さ:** 特別な"no-op"アクショントークンで最大長さまで短編エピソードをパッドする. ネットワークがパディングトークンを無視するようにトランスフォーマーベースのポリシーで注意をマスクする. 実行簡単.
  • マスク付きの長さの変動: 各エピソードを自然長さで処理する. 注意深くパッチリング (類似長さでグループ化するか動的なパッチングを使用する) を要求する.
  • アクション・チャンキング: ACTスタイル:軌道を固定長さのチャンキング (例えば100ステップ) に割って,独立してチャンキングを訓練する.自然に,固定サイズモデル入力を維持しながら,変化するエピソード長さを処理する.

代表性比較

Representation Intuitive Generalizable IK Needed Used In
Absolute joint angles No Low No ALOHA, ACT, RoboAgent
Absolute Cartesian pose Yes Moderate Yes Classic manipulation research
Cartesian delta actions Yes High Yes (incremental) Diffusion Policy, RT-1, Octo
Object-relative Cartesian Yes Very High Yes Generalizable grasping research
ウェイポイント sequences Yes High Yes Long-horizon task planning

軌道の表現はロボット学習システムにおける最も影響のある設計決定の一つである.大規模なデータ収集に投資する前に,この選択に時間を費やしてください.上記のすべての表現を組み込みフォーマット変換でサポートするツールについては, [RCSVプラットフォーム] (T11) を参照してください.