ロボット学習語彙: 60 の 重要な 用語 が 定義 さ れ た
ロボット学習,テレオペレーション,操作の用語の包括的な語彙 行動クローンからVLAまで,実践者にとって明確に定義されています.
[←学び]
ロボット学者の模倣学習,政策アーキテクチャ,データ収集,ハードウェア,評価用語を含む参考語彙.
この語彙は,ロボット学習,遠隔操作,操作において使用される6つのカテゴリーにおける60のキーワードをカバーしています.各定義は実践者向けに書かれています. 簡潔で具体的で短い例があります.どの概念のより視覚的な説明のために,残りの部分を探求してください [ロボット図書館]
模倣 学習 用語
- 行動クローン (BC): 最も簡単な模倣学習アルゴリズム
監督モデルを訓練して,特定の状態の専門家行動を予測し,それを回帰問題として扱う. 例:CNNを訓練して,カメラ画像からグリッパー位置を予測する 100 件の記録されたピックアンド・ロケーションデモを使用して. - DAgger (データセットの集積): 学習された政策の行動を専門家が実際に訪問している州で修正することで分布シフトを修正する再帰型ILアルゴリズム. 例:BCポリシーを展開し,オペレーターがリアルタイムでエラーを修正し,トレーニングデータに修正を加え,再訓練.
- アクション・チャンキング: ACT (K=100) で使用されるステップごとに1つのアクションではなく,K連続で将来のアクションを同時に予測する. _例:ポリシーが同時に2秒間の将来の腕動きを出力し,その後再計画する.
- **分布シフト:**訓練 (デモ) の際に観測された状態分布と試験時に観測された分布の不一致性 (ロボット実行). 例:訓練データは常に特定の場所でのオブジェクトから開始され,オブジェクトがわずかに移動するとロボットが失敗します.
- Covariate Shift: 入力分布 (状態) が変化する特定の分布変異が条件付き出力分布 (与えられた状態のアクション) が変化しない. 例:ロボットが,自分の不完全な行動によって示された道から逸れるため,トレーニングデータには記載されていない.
- 複合誤り: 微小なステップ予測誤りが時間とともに幾何学的に蓄積され,水平TでO(T2ε) とステップ誤り εとして増加する現象.
- マルチモード性: 同じ状態に複数の異なるアクションが有効である示例データセットの性質. 例:左から右に赤いブロックを把握できます
どちらも正しいが,単モードモデルでは平均的に悪い中部把握にします. - 示例: ロボットが学ぶべき任務を遂行する人間専門家が記録した単一の例. 例:ブロックを拾い出し,ゴミ箱に放す操作者の完全な記録.
- エピソード: センサーデータを含む,開始から終了まで,作業を完了する1回の完全な試み.成功または失敗する可能性があります. 例:一回のピックアンド・プレイスの試みで150秒の同期画像と共同データ.
- Rollout: 学習された政策によって生成されたエピソード (人間ではなく). 評価するために使用され,時には追加のトレーニングデータを収集します. 例:訓練されたBC政策を20回のテストで導入して,成功率を測定します.
政策構造の条件
- トランスフォーマーポリシー: トランスフォーマー神経ネットワークとして実装されたポリシー
タイムステップまたは画像パッチ間の空間依存性をモデル化するために自注意を活用する. 例:ACTは視覚観測に基づいて動作シーケンスを生成するためにトランスフォーマーデコーダーを使用します. - CVAE (条件式変異自動編码器): 観測された変数に基づいて隠された分布を学習する生成モデル. ACTで示例の多様性をスタイル変数にコード化するために使用. 例:ACTのCVAEエンコーダーは,完全なアクションシーケンスを隠されたコード zに圧縮し,デコーダーは一貫したアクションブロックを生成することができます.
- 拡散政策: 行動分布を表現する拡散プロセスとしてモデル化する政策
繰り返しランダムな騒音を観測に基づく合理的な行動軌道を表現する政策. 例: Chi et al. 2023 は,複数の有効な把握を同時に表現することで,分散政策が多モダルの作業でBCを上回ることを示した. - エネルギーベースのモデル (EBM): 各 (状態,行動) ペアにスケラー"エネルギー"を割り当てるモデル;推論は,行動を最小限に抑えるエネルギーを見つけます.
- フローマッチング: 連続した正常化流通を通じてサンプルを単純な分布から複雑なターゲット分布へと輸送することを学ぶ生成モデル. 例: π0 (物理知能の基礎モデル) はアクション生成のためにフローマッチングを使用します.
- 予測の視野: 政策が同時に予測する将来の時間段数.長時間視野は,より平滑で調整された動きを可能にしますが,より正確なモデルが必要.
- ** 部品サイズ:** 予測部品のアクションステップの数 (ACT型ポリシーにおける予測水平と同じ). 例:ACTは50Hzで部品サイズK=100を使用しているので,腕は同時に2秒の動きを計画する.
- アクションヘッド: 行動値に潜伏特性を映射するポリシーネットワークの出力モジュール. 例:トランスフォーマーデコーダー出力を取り出し,6DOF腕+グリッパーのための7つの関節角を出力する MLPヘッド.
データの収集条件
- 遠隔インターフェースからロボットを操作する_____________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________
- キネステティック・教学: 作業員がロボット腕を物理的に握り動かして作業を示す (重力補償,後駆けモード)
- リーダーフォロワー: 操作者が軽量なレプリカ腕 (リード) を動かし,ロボット腕 (フォロワー) がリアルタイムで動きを反映する遠隔操作アーキテクチャ. 例:ALOHAは双手ロボットシステムを制御するために,2つのリーダー腕 (一手あたり) を使用します.
- HDF5 (階層データ形式5): 断片式,圧縮されたマレイで大きな数値データセットを保存するためのバイナリファイル形式. ロボットエピソードデータのための標準のストレージ形式. 例: /画像, /joint_states, /アクション, /メタデータのためのグループを含むエピソードごとに1つの HDF5ファイル.
- RLDS (Reinforcement Learning Datasets): ロボット学習データ,エピソードとステップ構造の標準化のためのTensorFlowデータセットベースのフォーマット.Octoで使用,Open X-Embodiment. 例:コード変更を最小限に抑えながら,Octoをカスタムデータで訓練するために,HDF5ファイルをRLDSに変換します.
- LeRobot: パーケートファイルと標準化されたスケーマを使用してHuggingFaceベースのロボット学習フレームワークとデータセットフォーマット. 例:コミュニティと共有するためにLeRobot形式でHuggingFaceHubにデータセットを公開します.
- データ増幅: 政策概括を向上させるために訓練データにランダムな変換を適用する. 例:訓練中にランダムに画像を ±10%,色を ±15% 振動させ,ガウスノイズを関節状態に追加する.
- 成功率: 政策が任務を成功に完了した評価展開の割合. 操纵政策の主要な評価指標. 例: 18/20の成功率 = 90%の成功率.
- 質のフィルタリング中に廃棄された集まったエピソードの割合. 例:355%の拒絶率で500エピソードを集めた結果,トレーニングの3225エピソードが発生します.
- エピソード長さ: 1話の期間 (時間段または秒) 例:50Hzで8秒間の平均エピソード長さ =1話あたり400時間段.
ロボットハードウェアの用語
- **DOF (自由度):**ロボット腕の独立運動軸の数. 6 DOFは任意のエンドエフェクターポーズにとって最小値である. 7 DOFは冗長性を追加する.
- ** 役に立たない負荷:** 機械腕が最終効果で持ちうる最大の重量で,その名乗りの性能を維持する.
- ** リーチ:** ロボットのベースから最終エフェクターが達成できる最大半径. リンク長さの合計で決定される. 例: UR5e は標準的なラボテーブルセットアップのために850 mm の リーチ
を足す. - 重複性: 腕が重複した試みで同じ指揮位置に戻る精度,±X mmで測定される.
- エンドエフェクター: ロボット腕の端に設置された装置で,物体と相互作用する"手"です. 例:並行な下下部握手,吸い杯配列,または多指の巧妙な手.
- グリッパー: 固定力によって物体を握る特定のタイプのエンドエフェッサー.平行マウンのグリッパーはピックアンドプレスで最も一般的な. 例:ロボティク2F-85は85mmに開いて最大235N力で閉じる.
- 力/トーク (F/T) センサー: 終力エフェクターにおける腕の6軸センサー (Fx, Fy, Fz) とトーク (Tx, Ty, Tz) の力測定. 例:シリップトークがないと,グリッパー力が5Nを超えていることを確認することによって,成功した握手を検出する.
- タクティルセンサ: 指先のレベルでの分散接触圧または幾何学を測定するセンサー. 例:GelSightは指接触幾何学の高解像度画像を生成し,滑り検出と把握品質評価を可能にします.
- 絶対エンコーダーは,ホーミングなしで真の角度を報告します. 例:19ビット絶対エンコーダーは,1kHzで0.0007°解像度を提供します.
- Servo: ロボティクスでは,位置,速度,トークのコマンドを受け入れている自動モーター+エンコーダー+コントローラユニット. _例:ダイナミクセルセルセルボは低コストの研究腕に広く使用されています.
学習 パラダイグム
- 補強学習 (RL): 行動をとり,スケラー報酬信号を受け取ることで学習するモデル
専門家による示範は必要ありません. 例:シミュレーションにおける把握策を訓練し,成功したリフトの報酬が +1 と 0 となる. - RLをオフラインする: 既存の経験から収集された固定データセットから,環境との相互作用なしにRLをオフラインする. 例:保守的なQ-learning (CQL(Conservative Q-Learning)) を使用して人間によって収集されたロボットデータセットから政策を訓練して,配布終了の行動を避ける.
- オンラインRL: 積極的な環境相互作用のRL
ポリシーは新しいデータを収集し,すぐにそこから学びます. 例:シミュレーションされたロボットが繰り返し,毎回の試みでポリシーを把握し,更新し,徐々に改善します. - Sim-to-Real: シミュレーションにおけるポリシーを訓練し,その後実際のロボットに展開する.核心課題は"現実ギャップ"です. シミュレーションは決して完全に正確ではありません. 例:ランダム化物理パラメータでアイザックGymでローモーションポリシーを訓練し,その後実際の四角に展開する.
- ドメインランダム化: シム-トゥ-リアル技術で,シミュレーションパラメータ (摩擦,照明,質量,質量) をランダム化することで,ポリシーはこれらの変異に耐えるように学べる. 例:トレーニング中に0.3
0.9のテーブル摩擦をランダムに変えており,ポリシーは未知の摩擦で実際のテーブルで動作します. - 基礎モデル: 特定の作業に適した幅広いデータ (インターネット規模またはクロスロボットデータセット) に上手に訓練された大規模な神経ネットワーク. 例:OctoはOpen X-Embodimentから800Kのロボットエピソードで上手に訓練され,その後50のタスク特有のエピソードで上手に調整された.
- VLA(Vision-Language-Actionモデル): 視覚観測と自然言語の指示を入力と出力するモデル. 例:OpenVLAはカメラ画像と"赤いカップを拾い上げ"という指示を受け取り,コイントアングルデルタを出力する.
- 精細調整: 作業の特定データセットで訓練を継続することで,新しい作業または環境に先編訓練されたモデルを調整する.
- Zero-Shot: 訓練されたモデルを新しいタスクや環境に特定のタスクの訓練なしに適用する. 例:多くのタスクに訓練されたVLAは,訓練中に特定の指示を見たことがないのに新しい指示"ブルーブロックを拾い上げ"に成功します.
- Few-Shot: ほんの少数の例 (通常は1
20) を使って新しいタスクに適応する. 例:メタ学習ポリシーは,5回の示例エピソードのみを見た後に新しいオブジェクト形に適応する.
評価条件
- 成功率: 政策が任務を完了する評価試験の割引.標準的初等メトリック. 例:16/20 =20回の実際のロボット評価試験で80%の成功率.
- OOD: 訓練分布とは異なる入力
訓練中に見られなかった新しいオブジェクト色,位置,環境. 例:緑のブロックで評価された赤いブロックで訓練されたポリシーが色でOODをテストします. - 一般化差: 配布中のおよび配布外の成功率の差. 広大な差は,訓練条件に過度に適合することを示しています.
- ベンチマーク: 標準化されたタスク,オブジェクト,評価プロトコルでアルゴリズムを公平に比較できます. 例:FurnitureBench,RLBench,および LIBEROは一般的なロボット操作ベンチマークです.
- **実世界の評価:**物理ロボットにおける政策評価 (シミュレーションではない). 金基準と考えられる;シミュレーション指標はしばしば転送されない. 例:強度を測定するために5つの異なるテーブルセットアップで50の実世界の試験を実行する.
- Ablation Study: システムの一つの構成要素を削除または変更してその貢献を測定する実験.
- Held-Out Set: 訓練から完全に分離され,最終評価のみに使用されるデータサブセット. 評価指標が過度に充実されないようにします.
この語彙のどの概念についても,詳細な説明は, [RCSV語彙]







