Guidesに戻る

ロボティクスのための機械学習:初心者の完全なガイド (2026)

機械学習が現代のロボットに どのようにして力を貸しているのか 模倣学習,強化学習,拡散政策,そして実際のハードウェアをどのように開始するかについて学びましょう

機械学習は現代のロボットに 模倣学習と強化学習から 基礎モデルまで 動力を与え リアルハードウェアを導入するための実用的なロードマップです

なぜロボットにとって機械学習が今

ロボットは,何十年もの間,Xを調整する方向に移動し,グリッパーを閉め,30mmを上げ,Yを調整する方向に移動する方向でプログラムされてきた.これは,構造化された工場環境では,すべてのオブジェクトが既知の位置にあるのに効果があった.しかし,構造のない環境では,壊滅的な失敗した.

機械学習は,ロボットが手書きのルールではなくデータから行動を学ぶことでこの方程式を変えました.可能なすべてのシナリオをプログラミングする代わりに,ロボットに例を示して一般化させてください.この概念は新しいものではありません.研究者は1990年代から学習ベースのロボット工学に取り組んでいます.

実践 的 な 方法 に 役立つ 3 つの 発見

  • ロボットに適用されるトランスフォーマーアーキテクチャ (2022-2024): 大きい言語モデルを動かす同じ注意力メカニズムがロボット観測シーケンス処理に非常に効果的であることが判明しました.GoogleのRT-2,スタンフォードのACT,および拡散政策の研究は,トランスフォーマーベースのモデルは比較的微小なデータセットから複雑な操作行動を学ぶことができると示しました. これは,何百万人もの相互作用サンプルを必要とする以前のアプローチから 段階的な変化でした.
  • ** 基礎モデルとビジョン言語行動モデル (2024-2026):** OpenVLA,RT-X,Octoなどのモデルは,単一の予備訓練モデルが異なるロボット実施形態,タスク,環境に一般化できることを示しました.新しいタスクごとにゼロからトレーニングするのではなく,数百回のデモで基礎モデルを細かく調整します. これにより 数十万回のエピソードから 数百回まで データが必要となることが 分かりました リアルワールドロボット学習は 小さなチームにとって 実践的になります
  • **手首カメラ,コンピュータの搭載で6DOF腕の完全なロボット学習装置が現在 [OpenArm] (T0) と SO-101のようなプラットフォームで5000ドル以下で使用されています. 5年前,同等の設置には5万ドル以上の産業用ハードウェアが必要でした. 費用削減により 機械機械 ML 研究は 既存のハードウェアを 買えなかった大学の研究室や初創企業や 医療従事者にも できるようになりました

成果は,2026年に研究生や初心者エンジニアが 模倣学習を使って 週末に新しい操作作業を遂行するロボットを訓練できる. 50~200回のデモで.これは 5年前のSFでした.このガイドには,その方法やツール,そして実践的なステップが取り上げられています.

ロボット ML の 4 つの 主要 な 方法

ロボット機械学習は単一の技術ではありません.各種のアプローチは4つの主要な家族で,それぞれが異なる強み,データ要件,使用事例を持っています.各の使用時期を理解することは,あなたが行う最も重要な戦略的決定です.

Approach How It Works Data Needed Best For Limitations
模倣学習 Robot learns from human demonstrations (teleoperation recordings) 50-500 demonstrations per task マニピュレーション tasks with clear human strategy: pick-and-place, assembly, tool use Cannot exceed demonstrator skill; struggles with tasks requiring exploration
Reinforcement Learning Robot learns by trial and error, maximizing a reward signal Millions of trials (usually in simulation) Locomotion, dynamic tasks, behaviors that exceed human capability Requires careful reward design; sample-inefficient; sim-to-real gap
シミュレーション・トゥ・リアル転移 Train in simulation, transfer learned policy to real robot Unlimited (simulated), plus domain randomization Tasks where simulation is accurate: locomotion, grasping simple shapes, navigation Reality gap for contact-rich manipulation; sim fidelity limits policy quality
Foundation Models / VLAs Large pretrained models fine-tuned for robot control using vision and language 10-100 demonstrations for fine-tuning (pretrained on millions of diverse robot episodes) General-purpose manipulation, language-conditioned tasks, multi-task robots Compute-heavy inference; still maturing; may not match specialist policies on specific tasks

模倣学習はほとんどの初心者にとって正しい出発点です.入場への障壁は最低で,作業方針は最も速く作成され,最終的にどのアプローチに専門化するかに関係なく必要なデータ収集と評価スキルを構築します.

深層 潜り: 模倣 し て 学ぶ

模倣学習 (示範から学ぶことも呼ばれ) は,ロボットが新しい操作作業を実行するための最も実践的なアプローチです. 核心アイデアは: 人間がロボットを望ましい行動を通して何度も遠隔操作し,ロボットはそのデモを訓練することによって観察 (カメラ画像,共同位置) から行動 (共同速度または位置コマンド) までマッピングを学ぶ.

行動 クローン

模倣学習の最も単純な形態は行動クローン (BC) です.問題を監督学習として扱う.実証軌跡 (観察-行動ペアの序列) を収集し,観察によって与えられた行動を予測するために神経ネットワークを訓練します.推論時に,ロボットが現在の状態を観察し,訓練されたネットワークを通じてそれを供給し,予測された行動を実行します.

行動クローン化は,実装し,訓練しやすいが,基本的な欠陥がある.それは複合誤りである.ロボットが示された軌道を少し偏った場合 (常にそうする) は,トレーニング中に見たことのない観測を遭遇し,予測がますます悪くなってしまう. 下記の解決法はこの問題に対処します

ACT (トランスフォーマーでアクション・チャンキング)

ACTは,2023年にスタンフォード大学でトニー・シャオ等によって導入されたもので,単一の次のステップアクションではなく,将来のアクションのブロックを予測することによって複合エラーを解決する.このモデルは,観察の連続を取り,次の50~100回のアクションを1つの前進パスで出力します. この"アクション・チャンキング"は,ロボットが軌道の段落にコミットし,予測エラーが蓄積する頻度を減らすことを意味します.

ACTは観測履歴を処理するトランスフォーマーエンコードと,示例の多様性を処理する CVAE (条件変数自動エンコード) を使用する. 異なるオペレーターは同じ作業をわずかに異なる方法で実行することが可能であり,モデルはこの変異をキャプチャする代わりに平均する必要がある. ACTはロボット工学コミュニティで最も広く再現されている方法の一つとなり,特にALOHA型ハードウェアによる双手操作に特化した.

詳細については, [模倣学習ガイド]T1 を参照してください.

拡散政策

拡散政策は,チェン・チ・アト・コロンビアで2023年に導入されたもので,ロボットアクション予測にデノイジング・ディフュージョンフレームワーク (ステーブルディフュージョンのような画像生成モデルの背後にある同じ核心思想) を適用する.直接アクションを予測する代わりに,モデルは,ランダムアクションシーケンスを,現在の観測に基づいて条件付けされた一貫した軌道を繰り返しデノイジングすることを学んでいます.

拡散ベースのアクション生成の利点は,マルチモダルのアクション分布を自然に処理することです.タスクを実行する複数の有効な方法がある場合 (左または右側から選択,上からまたは横からアプローチ),拡散モデルは平均ではなく明示的にこの不確実性を表現し,よりスムーズで自然なロボット行動を生成します. 拡散政策は,多くの操作基準で最新のパフォーマンスを達成し,挿入,拭き,折り畳みなどの接触に富んだ作業に特に効果的です.

ACTでは1回の前進パスと比べて,反復式デノイズによるアクション生成に 520回の前進パスが必要である.現代GPUでは1030Hzで動作する.これはほとんどの操作に適しているが,高速作業では制限される可能性があります.

深層 潜り: 強化 学習

強化学習 (RL) は根本的に異なるアプローチをとります:ロボットに何をすべきか示す代わりに,ロボットがどれほどうまくやっているかを測定し,試行錯誤を通じて効果的な行動を発見できるようにする報酬機能を定義します.ロボットが行動を起こし,結果を観察し,報酬信号を受け取り,累積報酬を最大限に高めるために徐々に方針を改善します.

キーアルゴリズム:PPOとSAC

**PPO (近隣政策最適化) **はロボット工学で最も広く使用されているRLアルゴリズムです.OpenAIによって開発された,PPOは,災害的なパフォーマンス低下を避けるために政策更新を制限する政策梯度方法です.安定し,調節が比較的簡単で,連続的および離散的なアクションスペースの両方でうまく動作します. ユニトリやボストンダイナミックスの研究チームなどの企業による印象的な四角動力デモ (歩行,走行,パークー) の背後にあるアルゴリズムです

**SAC (Soft Actor-Critic) **は,ポリシー外アルゴリズムで,ポリシー内の報酬とエントロピー (ランダム性) を最大限に高めます.エントロピーボーナスにより探索が促進され,混乱に耐えるポリシーが生成されます.SACは,リプレイバッファから過去の経験を再利用するため,多くのタスクでPPOよりもサンプル効率的です. 操作作業で訓練された操作作業において特に有効です

RL と 模倣学習 の 活用 の 時

RLは,次の任務で優れている:

  • 理想的な行動は人間に示すことは難しい (ダイナミックな投げる,手中での再方向化,敏捷な移動)
  • ロボットが人間の能力を超えた戦略を 見つけたい
  • ロボットが何百万人ものエピソードを 実行できる 信頼性の高いシミュレーション環境があります
  • 報酬機能は定義するのは簡単です (目標に到達し,バランスを維持し,距離を最大限に伸ばす)

RLは,以下のように苦しんでいる

  • 報酬機能は正確に指定することは難しい (スカラー報酬として"シャツをきれいに折る"とはどんなものですか?)
  • 操作は,接触力のある操作が必要で,シミュレーションの精度が低い.
  • 作業方針を迅速に必要とする (RLトレーニングは通常数時間から数日までの GPU時間が必要)
  • 模擬環境が良くないので,実際のハードウェアで訓練する必要があります (ほとんどのリアルワールドRLではサンプル効率が不足している)

シミュレーション環境: イザック・シムとムジョコ

NVIDIA Isaac Simは,オムニバースに構築されたGPU加速物理シミュレーターである.その主要な利点は巨大なパラレル性である.アイザック・シムは,単一のGPUで何千ものロボット環境を同時に実行し,毎時間に数百万の体験サンプルを生成することができる.これは,ローモーションと操作政策のRLトレーニングの好ましいプラットフォームとなっています. また,イザック・シムは,RLトレーニングのためにアイザック・ジムとネイティブ統合を Sim-to-real視覚転送のための写真現実的なレンダリングも提供しています.

**MuJoCo (Multi-Joint dynamics with Contact) **,現在DeepMindでオープンソース化されているが,ロボット学習研究において最も広く使用されている物理エンジンである.MuJoCoは,高速で数値的に安定しており,操作作業のために正確な接触動力を作ります. MJXを通じてCPU (そしてますますGPU) で動作し,すべての主要なRLフレームワークと統合し,既製ロボットモデルとベンチマークタスクの最大のエコシステムを持っています.初心者にとって,Mujokoは,広範なドキュメントと標準化されたベンチマークタスク (Gymnasium robotics環境) の利用のために,しばしばより簡単な出発点です.

データの要求: どれだけの 十分な 量 です か

初期段階の質問は"何度示範が必要か"です.正直な答えはアプローチ,課題の複雑性,モデル構造に依存します.掲載された結果とRCSVの経験に基づいて実践的なガイドラインはこちらです.

模倣学習データ要件

  • **シンプルな単腕のピックアンドプレイス (固定物体,固定位置):**20-50のデモ.ACTとディフュージョンポリシーはこのスケールで80%以上の成功率を達成します.
  • 変数・ピック・アンド・プレイス (ランダム化位置,異なるオブジェクト): 100-200 デモンストレーション.物体の位置とタイプの変化により,一般化するためにより多くのデータが必要である.
  • 接触型操作 (挿入,擦り,折りたたみ): 200-500 回のデモ.これらの作業は,小さなエラーが故障を引き起こす狭い成功地域があり,より密集したデータカバーが必要である.
  • 多段階の作業 (組立て順,調理ステップ): 300~1,000回の示例.長視線の作業には,順序の各段階においてデータが必要です.

ロボット訓練データが良いもの

優れた [ロボット訓練データ] (T2) は以下の性質を持っています:

  • ** 音量による多様性:** 異なる物体位置,照明,接近角度で100のデモは,すべて同じに見える500のデモよりも良いトレーニングを行います. 意図的に初期条件が異なります.
  • 一貫した品質: 操作者が作業中に誤りを犯し修正した失敗した示例,躊躇エピソード,示例を削除する.訓練データにおける騒音は,その騒音を再現することをモデルに教えます.
  • マッチされた配分: 訓練データには,ロボットの配備時に直面する条件に一致する必要があります. 白いテーブル上の物体で訓練をしても,木の表面に配備すれば,性能が低下します. 現実的な条件でデータを捕捉します.
  • マルチカメラカバー: 2~3つのカメラ角度 (腕部+上部,または腕部+側部+上部) は,単一のカメラと比べて,政策性能を大幅に向上させる.モデルは,深さ,接触,空間関係を明らかにする視点から作業を観察する必要があります.
  • 適切な同期化: カメラフレーム,コイントステート,アクションコマンドは一時的に並べ替えなければなりません.50msの脱同期化でさえパフォーマンスを低下させる.ハードウェアタイムスタンプを使用してください.ソフトウェアの到着時間ではありません.

高品質のロボットデータ収集に関する詳細なガイドについては, [ロボットデータ収集ガイド]T3 を参照してください.

重要な枠組みとツール

ゼロから全てを構築する必要はありません. これらのフレームワークは,必要なアルゴリズムとインフラストラクチャのテストされた実装を提供します.

リーロボット (ハグする顔)

レロボットはロボット模倣学習のための最も初心者向けのフレームワークです.ハグジングフェイスによって開発され,エンドツーリングを提供しています.一般的なロボット腕のためのデータ収集スクリプト,標準化されたフォーマットでデータセット管理,ACTとディフュージョンポリシーのトレーニング実装,評価ユーティリティ.レロボットはデータセット共有とモデル配布のためにハグジングフェイスハブと統合されています. 機械 ML プロジェクトを始めてみている場合は,レロボットが推奨される出発点です. SO-101, ALOHA,カスタム・アウト・オブ・ザ・ボックスをサポートします.

ロボミミック (スタンフォード)

RoboMimicは模倣学習アルゴリズムを研究するための研究フレームワークである.標準化シミュレーションベンチマーク,複数のBCアルゴリズム実装 (BC-RNN,HBC,IRIS) および慎重な評価プロトコルを提供しています.Real-robot展開では,RoboMimicはレロボットよりも鍵が少ないが,ほとんどの模倣学習論文に引用されている標準基準基準フレームワークです. ロボミミックを使用すると,アルゴリズム変数を厳密に比較したり,公表された結果を再現したりします.

ROS2 (ロボット操作システム2)

ROS2 はロボットソフトウェアの事実上のミドルウェアである.ROS2は,パブリック・サブスクリプションメッセージシステムを通じてセンサー,アクチュエーター,およびコンピューティングノード間の通信を処理する.ROS2はMLフレームワークではなく,MLポリシーを実際のロボットハードウェアに接続する粘合剤である. モーターにアクションコマンドを送信し,カメラやエンコーダーから観測データを受信するには,ROS2 (または直接シリアル/USB通信のようなより簡単な代替品) が必要です.Ubuntu 22.04のROS2 Humble (LTS) は新しいプロジェクトに推奨されているバージョンです.

NVIDIA イザック・シム

イザック・シムはRLトレーニングと合成データ生成の両方のためにGPU加速シミュレーションを提供します.並行環境の実行によりRLトレーニングは必要なスケール (数百万エピソード) で実行可能になります.また,アイザック・シムはドメインランダム化をサポートします. 学習曲線は MuJoCoよりも りですが,大規模な RL訓練や 光現実的な合成データが必要なとき, Isaac Simは正しい選択です.

安定した基線3

安定ベースライン3 (SB3) は,標準RLアルゴリズム (PPO, SAC, TD3, A2C, DQN) の信頼性のある実装を提供する PyTorch ライブラリです. SB3は使いやすさのために設計されています. 生産RL訓練のためのアイザックジムやrl_gamesのようなより専門的な枠組みに移る前にRL概念を学ぶための推奨の出発点です

開始するハードウェア

ロボット MLをするために ロボットが必要です 学習と開発の証明されたエコシステムを持つ各価格の異なるハードウェアオプションが3つあります

OpenArm (予算: 2,000~ 4,000ドル)

[OpenArm] (T4) は,RCSVのオープンソースの6DOFロボット腕であり,特にML研究と教育のために設計されています.完全なシステム (腕 +グリッパー +腕カメラ +コントローラー) に対して4,000ドル未満で,手動ロボットMLにとって最もアクセス可能なエントリーポイントです. OpenArmはレロボットをネイティブで運営し,テレオペレーションデータ収集と自律的なポリシー実行の両方をサポートし,データセットとプレトレーニングモデルを積極的に提供するコミュニティを持っています.この腕は,模倣学習研究のパンとバターであるテーブルタスク操作作業に十分な400mmの範囲と500gの役に立たないダイナミクセルセルセルボールを使用します.

SO-101 (予算:500ドル~1,000ドル)

SO-101 (SO-100とその変種とも呼ばれ) は,原料セルボモーターと3Dプリントコンポーネントから作られた超低コストの6DOF腕.完全なリーダーフォロワーペアが1000ドル以下で購入されています.SO-101は低コストとハグジングフェイスの広範なドキュメントにより,レロボットコミュニティプロジェクトで最も人気のある腕になりました. 妥協点は,OpenArmや商業兵器と比較して,精度,使用負荷能力,構築品質が低い.最初のプロジェクトや教室の設定では,SO-101は価格で打ち勝つことが困難です.

フランカ FR3 (予算:2万5千~3万5千ドル)

フランカ・エミカ・FR3 (旧パンダ) は,学術 ML 研究室で最も広く使用されている研究級ロボット腕.優れたトークスセンサー,サブミリメートル重複性,ROS2とMuJoCoとのネイティブ統合を備えた7DOFを提供している.FR3は多くのランドマーク論文 (ACT,拡散政策,RT-X) で使用されている腕である. FR3 は 標準 的 な プラットフォーム です.より 高額 な 費用 が 高いほど,出版 された 成果 を 直接 複製 する 能力 が 高さ な もの と 信頼性 が 高い こと に なり ます.

予算の分割 完全な設置

Component Budget Option Mid-Range Option Research-Grade
Robot arm + gripper SO-101 pair: $800 OpenArm: $3,500 Franka FR3: $30,000
Cameras (2-3x) Logitech C920: $150 RealSense D405: $600 RealSense D435i: $900
Compute (training) Cloud GPU rental: $50/mo RTX 4070 workstation: $1,800 RTX 4090 workstation: $3,500
Compute (inference) Laptop with GPU: $0 (existing) Same as training: $0 Dedicated inference PC: $2,000
Total ~$1,000 + cloud ~$6,000 ~$36,000

学習経路:ゼロから導入政策へ

基礎知識から実際のハードウェアに関する訓練された政策を導入する4段階のカリキュラムです.各段階は前の段階に基づいています.

段階1: 基礎知識 (2~4週間)

ロボットに触れる前に MLの基礎を 構築する

  • PyTorch の 基礎 について 学べば:テンソール,オートグラッド,トレーニングループ,データセット/データローダー の パターン.公式 PyTorch の チュートリアル は 十分 です.
  • 画像処理のための convolutional neural networks (CNN) を理解する ロボットのカメラは,ポリシーが処理しなければならない画像を生成します.
  • トランスフォーマー構造を概念的なレベルで学びます 注意,位置化コーディング,シーケンスの処理. トランスフォーマーをゼロから実装する必要はありませんが,その機能を理解する必要があります.
  • 元のACT論文 (Zhao et al., 2023) と拡散政策論文 (Chi et al., 2023) を読みなさい. 問題を表す方法論と評価方法論を理解することに集中する,すべての数学的な詳細ではなく.

ステージ2: シミュレーション (2~4週間)

リアルなハードウェアに触れる前に 模擬を練習する 模擬は無料で 自由に実験できます

  • MuJoCoをインストールし,標準のGymnasiumロボット環境 (FetchReach,FetchPush,FetchPickAndPlace) を実行します.
  • FetchReach で 安定型ベースライン3 を 活用して RL の 基本 的 な 方針 を 訓練 する.これ は ハードウェア の 複雑さ を 欠かさ ない RL の 訓練 ループ を 教え て くれる.
  • ロボミミックを使って,リフトとキャンの作業で行動クローン実験を実行します. これは模倣学習パイプラインを教えます:データセットのロード,モデルトレーニング,評価.
  • 学習速さ,パッチサイズ,トレーニング期間数,アクションパーツサイズなどについて実験する. 性能に影響を与えるものに対する直感を育む.

ステージ3 リアルハードウェア (4~8週間)

物理的なロボットに 技能を移す

  • ロボット腕 (OpenArm, SO-101 またはアクセスできるもの) を LeRobot に設定します
  • 簡単なピックアンド・プレイスタスクの50の遠隔操作デモを収集します データ品質に集中します 一貫したデモ,カメラの良い角度,多様なオブジェクトの位置.
  • レロボットの訓練スクリプトを使って収集したデータについて ACTポリシーを訓練します
  • 試行錯誤を 20 回の試行錯誤で 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を 試行錯誤を
  • 繰り返す: 観測した失敗モードを対象とした示例をさらに収集し,再訓練し,再評価する. 目標は,データ収集 →訓練 →評価ループを深く理解することです.

段階4:展開と一般化 (進行中)

より困難な任務に進み,強力な展開:

  • 複雑な作業を試してください. 多段階の組み立て,双手操作,変形物で作業.
  • 同じ作業とデータセットで ACTと結果を比較する実験です
  • 基礎モデルの調整を探索する: 訓練前のVLAモデルを使用して,示例を少なくして作業を調整する.
  • 安定性に関する作業: 異なる照明,見えない物体,物理的な混乱の後で,あなたの政策をテストします. 制御条件でのみではなく,信頼性の高い政策を導入します.
  • 貢献:ハグ・フェイスでデータセットを共有し,結果を公開し,RCSVとLeRobotコミュニティに参加してください.

6 始め の 人 が よく する 間違い

機械 ML 旅を始めるチームから何度もこれらの間違いが 目に付きます

1. データ量に対してデータ品質をスキップする

誤り: 数百の粗末なデモを収集する理由 "より多くのデータが常に良い"です. 躊躇,部分的な失敗,不一致な戦略によるデモは,モデルを混乱させる騒音を注入します.

修正: 無慈悲にキュレーションする.操作者が躊躇したり,間違いを犯したり,不一致な戦略を使用した場合の示範を削除する. 100 つのクリーン示範は,常に騒音な示範500 台を上回る.

2 評価 厳格 な 訓練

エラー: ポリシーを訓練し,ロボットに数回実行し,一度実行して,完了するとします. 一つの成功はポリシーを検証しません.

修正: ランダム化した初期条件を持つ少なくとも20回の展開で,すべてのポリシーを評価する.成功率をX/20と報告する. "うまくいく"ではなく.一貫した評価プロトコルでトレーニングランスの改善を追跡する.

3 カメラの配置を無視する

誤り: カメラを最も有用な情報を提供する場所ではなく,便利な場所に配置する.グリッパーと対象の接触点を見ることができないカメラは,任務の最も重要な段階に関する情報を提供しません.

修正: 手首に搭載されたカメラ (操作を近視する) と,上部または横部カメラ (グローバルコンテキストを提供する) を使用する.

4 任務を過度に複雑にする

エラー: 複雑な複数のステップのタスクを最初のプロジェクトとして学ぶことを試みる.ポリシーが失敗すると (そうなるでしょう),アルゴリズム,データ,ハードウェア,またはタスクの複雑性の問題かどうかを診断することはできません.

修正: 単一のオブジェクトの単段階のピックアップと場所から始めましょう. この作業を信頼性 (>90%の成功) にします. その後,複雑さを増やします:複数のオブジェクト,異なる位置,長いシーケンス. 各インクリメントは,破損を正確に教えてくれます.

5 行動空間設計を無視する

誤り: カルテジアン空間行動がより自然である場合,または逆の場合,関節空間行動を使用する.デルタ (増進) 行動で絶対位置を使用すると,より平滑な動きが生じる.アクション空間表現は学習困難に劇的な影響を与える.

修正: ほとんどの操作作業では,デルタエンドエフェクター位置制御 (カーテシア式 dx, dy, dz + 握手開/閉) が学習する最も簡単なアクションスペースである.関節空間制御は特定の腕配置を必要とする作業や逆動力学が信頼性が低い場合よりよい.両方と実験して比較する.

6 列車と配備条件に一致しない

誤り: 照明条件,カメラの位置,テーブル表面の1つのセットでトレーニングデータを収集し,その後,異なる環境でポリシーを展開し,なぜ失敗したのかを疑問に思う.

修正: 訓練を受けた条件と同じ条件で展開するか,データ収集中に意図的に条件を変更して,安定性を構築する.

必須資源

重要な文書

  • ACT 低コストハードウェアによる精細な二手操作を学ぶ (Zhao et al., 2023):トランスフォーマーとALOHAハードウェアプラットフォームによるアクション・チャッキングを導入.現代模倣学習の基礎文書.
  • 拡散政策 行動拡散による視覚運動政策学習 (Chi et al., 2023):ロボット行動予測に拡散モデルを否定する応用.多くの操作基準の最新技術.
  • RT-X オープンX体:ロボット学習データセットとRT-Xモデル (オープンX体協力,2024):22のロボットプラットフォームからのデータを使用してクロス-ボディメント転送学習を実証した.ロボット学習は言語モデルスケーリングに類似する大規模多様なデータから利益を得ることが確立された.
  • OpenVLA オープンソースビジョン言語アクションモデル (Kim et al., 2024):特定のロボット作業に細かく調整できるオープンボートVLAモデル. 訓練前の基礎モデルがタスクごとにデータ要件を大幅に削減することを示した.

授業と教科書

  • CS 224R:深度強化学習 (スタンフォード,YouTubeで利用可能): ロボティクスのためのRLの総合研究生レベルのカバー.
  • LeRobot スタート・チュートリアル (ハグ・フェイスドキュメンテーション):LeRobot で最初のポリシーを収集し,トレーニングするためのステップ・バイ・ステップガイド.
  • Deep RLをスピンアップする (OpenAI): 明確な実装によるRLアルゴリズムへの優れた自立的な導入.
  • MuJoCo トチュオリアル (ディープマインドドキュメンテーション): ロボット学習研究のための物理シミュレーションの基礎

地域社会

  • RCSVコミュニティ: [RCSVアカデミー] (T5) に参加して,実践的なワークショップ,共有ハードウェアアクセス,そして湾区のロボット ML 専門家のコミュニティに参加してください.
  • **LeRobot Discord:**LeRobotユーザー向けのアクティブコミュニティでデータセットを共有し,トラブルシューティング,プロジェクトアイデアを共有します.
  • ロボットスタック交換: 技術的なロボットに関する質問と回答

ロボット・MLの旅を RCSVで開始する

RCSVはロボットハードウェアにアクセスし 実践的な訓練と 学習を加速させるための 専門家のコミュニティを提供します. 最初の選択・場所方針から 生産部署まで,私たちは助けることができます.

[RCSVアカデミーを探求]