Blogに戻る

2025年 移動操作:最新技術と実践的な展開

モバイル操作ロボットに関する調査 プラットフォーム,能力,アルゴリズム,そして移動と腕操作を組み合わせた現実世界の展開

部分: [ロボット兵器ガイド]

[←ブログ]

ロボット業界で最も難しい問題として 2025年に 最も活発な投資と研究も 引き寄せています

モバイル 操作 は 何 です か

モバイル操作は,移動 (環境を移動する能力) と操作 (物体を捉え,移動し,相互作用する能力) を組み合わせるロボットを指す.この組み合わせは,ロボットに固定された場所に持ち込まれた物体だけでなく,作業の場所へ移動する能力を与える.

固定ベース腕は,既知の,校正された作業空間で動作する.移動操作者は,任意のトレーニング構成とは異なる環境で,不正確な既知のベース位置から,潜在的に動くプラットフォームで把握する必要があります.固定ベースから把握することは,固定ベース操作と比較して有効な把握誤りを3~5倍増加させます.

建築分類: 脱対端から端

モバイル操作における基本的な建築選択は,ナビゲーションと操作を分離されたサブシステムとして扱うか,または統一されたエンドツーエンド政策として扱うかである.

** 離合 (ナビゲート・アンド・マニプレーション):** クラシックアプローチ.ナビゲーションプランナーが,腕の作業空間内の先計算された姿勢にベースを移動し,その後操作ポリシーが接管する.ナビゲーションモジュールと操作モジュールは,分離したモデル,分離したトレーニングデータ,およびそれらの間のハンドオフプロトコルを持つ分離したシステムである. これは産業部署における支配的なアプローチである.それはモジュール化であり,デバッグ可能であり,各コンポーネントが独立して検証できるため.制限:ベースポーズは操作作業を考慮せずに計算され,サブ最適的アプローチ構成につながる可能性があります.再配置は5~15秒で試みられ,局所エラーが導入されます.

エンドツーエンド (統一政策): 単一の神経ネットワークはセンサー入力 (カメラ,リダー,プロピオセプション) を取り出し,ベース速度と腕のコモンストの両方を出力します.モバイル ALOHA (ジペンフー等,スタンフォード, 2024) は,ACT ポリシーが50回のテレオペレーションデモから全体双手動移動操作を学ぶことができることを示した. 端から端までのアプローチは,より平滑で調整された動きを生み出すが,デバッグするのが難しく,より多くの示範が必要であり,安全保証が少ない.

階層的な (タスクレベル計画 +学習技能): 高レベルのプランナー (潜在的に基礎モデルまたはTAMPシステム) は,タスクを一連のスキル ("キッチンへナビゲートする",冷蔵庫を開く",ミルクを握る") に分解し,それぞれのスキルが専門的ポリシーによって実行されます.SayCan (Google, 2022) とTidyBot (Wu et al., Princeton, 2023) はこのアーキテクチャを使用します. 学習された政策の柔軟性と明示的な計画の解釈性を組み合わせています

2025年の主要なプラットフォーム

Platform Price Type ペイロード Arms Key Strength
Hello Robot Stretch 3 $28,000 Wheeled + telescoping arm 1.5 kg 1 (4-DOF) ROS2, elder care, affordable
Mobile ALOHA (Stanford) $32K + base Wheeled + bimanual 3 kg each 2 (6-DOF ViperX) Bimanual, open-source, ACT-ready
Spot + Arm (Boston Dynamics) $100,000+ Legged + arm 4 kg 1 (6-DOF) Rough terrain, enterprise support
Unitree G1 $16,000 Humanoid (bipedal) 3 kg each 2 (7-DOF) Lowest cost humanoid, growing ecosystem
Unitree H1 $90,000 Humanoid (bipedal) 5 kg each 2 (7-DOF) Strongest humanoid arms, whole-body control
Fetch Robotics (OTTO) $150,000+ Wheeled + arm 6 kg 1 (7-DOF) Warehouse logistics, enterprise AMR
TIAGo Pro (PAL Robotics) $80,000+ Wheeled + arm 3 kg 1-2 (7-DOF) ROS2 native, RoboCup standard

重要な文書とシステム

モバイルALOHA (スタンフォード, 2024)

モバイルALOHAは,端から端まで模倣学習が驚くほど能力のある全身移動操作を可能にすることを示した.このシステムは,車輪ベースに2つのViperX300腕を使用し,ロボットの後ろで歩いて両腕とベースの動きを同時に制御する人間のテレオペレーターがある. ACT (トランスフォーマーでアクションを乱す) 政策は 50台のテレオペレーションデモで を料理し,キャビネットを開け,キッチンカウンターをきれいにし, プッシュチェアを操作する方法を学びました

重要な洞察:静態ALOHAデータセット (固定ベースALOHAから) の共同訓練により,静態データにはベース動きがないにもかかわらず,モバイル操作の成功率は30-50%向上しました.共有された操作スキル転送,そして政策はモバイルデモからのみベース動きでそれらを構成することを学んでいます.これは実際のデータ収集の負担を大幅に削減します.

TidyBot (プリンセトン, 2023)

TidyBotは,長い視線の整理問題に取り組んだ.混乱した部屋を考慮して,すべての失落物体を拾い,正しい場所に置いた.高レベルの推論のためにLLM (GPT-4) を使用した ("カップは棚に, "シャツは衣庫に") と実際のピックアップと配置のための学習された操作ポリシーを使用した.ナビゲーションは古典的なSLAM +プランナースタックを使用した. 重要な貢献は,言語モデルは,オープンな家庭でのタスク計画に必要な常識的な推論を提供できることを示している.

サイカン (Google, 2022)

言語モデルを,地面化されたロボットアファドナンスのと結びつけることができる.自然言語の指示 ("私は飲み物を倒した,あなたは助けることができるか?") を考慮して,LLMは,原始的なスキル ("スポンジを見つけ," "スポンジ拾い," "流すために航行"," "表面を拭い") の連続として計画を提案する.各スキルには,ロボットの現在の観察から推定される関連成功確率があります. LLMの計画確率とスキル成功確率の結果,最高のアクションが選択されます.SayCanは,モバイル操作に必要な行動操作を継続して,LLMベースのタスク計画が実行できることを示す,単一の7DOF腕を持つモバイルエビデーロボットで実行されました.

航行・操作の調整の課題

腕とベース調整: ベースが動いたとき,腕が伸びたとき? 人体型プラットフォーム (H1,G1) の全体制御最適化では,ベースと腕を統一した кинеマティックチェーンとして扱います.車輪型プラットフォームは通常,離断計画を使用します.

**操縦時の動力安定性:**腕を通る力を適用することで,ベースに反応力が生まれる. 制限された作業中に腕を通る20N水平力を使用する足のロボットが,安定を維持するために同時に足の接触を調整する必要があります.この全体力調整は活発な研究問題です. 輪のプラットフォームは,この点で利点があります. 反応力は,足の接触動力よりもモデルと制御がはるかに簡単である輪の地面摩擦によって吸収されます.

**移動ベースからGraspポーズ推定:**移動ベースから認識すると,位置不確定性が把握推定に導入される. 2cmのベース位置誤差は,精度作業の把握点誤差に拡大する.移動操作システムには高精度なベース位置定位化またはベース位置不確定性に堅固な把握ポリシーが必要.

Handoff 問題: 離合されたアーキテクチャでは,ナビゲーションシステムはロボットを"前操作"ポーズに引き渡し,その後操作コントローラに手を差し出す.このハンドオフは失敗点である.もしベースポーズは操縦政策の訓練配分範囲内にない場合,操縦が成功しても操縦は失敗する. 操作制御は,現在の姿勢が適切でない場合,ベース再配置を要求できる必要があります.この反発ループは,ほとんどの現在のシステムではうまく扱われていません.

長視線状態の推定: 複数の分間の移動操作作業 (例えば部屋の掃除) において,ロボットがSLAMベースのローカライゼーションが漂移を蓄積する.ロボットが1分で物体を拾い,5分で特定の場所に配置する必要がある場合,ローカライゼーションエラーは位置付け容認を上回る可能性があります. ループの閉ざし 既知のランドマークに対する移動 操作中に視覚のオドメトリ更新は全て必要ですが 計算上のオーバーヘッドを追加します

計画方法 比較

Approach Task Horizon 汎化 Compute Data Needed Maturity
Whole-body control (WBC) Single skill Low (task-specific) High (1kHz QP) Dynamics model Production-ready for locomotion
Decoupled nav + manip Single skill Moderate Low SLAM map + manip demos Most deployed approach
End-to-end IL (ACT) Multi-step skill High (within task) Moderate (GPU) 50-500 teleop demos Research demos (Mobile ALOHA)
TAMP (タスク・モーション計画) Multi-room High (combinatorial) Very high Domain specification Academic demos, limited production
LLM + skill library (SayCan) Open-ended Very high (language) High (LLM inference) Skill demos + affordance model Emerging (TidyBot, SayCan)
VLA end-to-end (pi0-style) Multi-step Very high Very high (7B+ model) Large-scale diverse demos Early commercial (Physical Intelligence)

携帯電話操作のためのデータ収集

移動操作のための遠隔操作示例を収集することは,固定ベース操作よりも困難である.操作者は,ベースと腕の動きを同時に制御しなければならない.

  • **ウォークバックテレオペレーション (モバイルALOHAスタイル):**操作者はロボットの後ろで歩いて,リーダー腕を通して腕の動きを制御し,ベースは操作者の歩行動きをフォローする.操作者は最も直感的なが,大きな物理空間を必要とし,ベーススピードを歩行ペース (~1.5 m/s) に制限する. ベース軌跡が重要である任務 (例えば,物体を運ぶ間に家具を周りに移動する) に最適です.
  • **VRテレ操作:**操作者はVRヘッドセットを使用してロボットの視点から眺め,手制御器とジョイスティックを通じてベース+腕を制御します.リモート操作を可能にしますが,接触作業の示範品質を低下させる遅延 (20-50msネットワーク+10msレンダリング) を追加します.操作精度が中等であるナビゲーション重作業に最適です.
  • ウェイポイント Based Collection: 操作演示からベース軌道を分離する.まず,ロボットを手動で操作前姿勢に移動する (または自動ナビゲーションスタックを使用する).その後,固定ベース位置から操作演示を収集する.操作者は操作を簡単にするが,調整されたベース腕動きを捕捉しない. 操縦とナビゲーションが時間的に重複しない作業に最適です

RCSVのデータ収集インフラストラクチャは3つのアプローチをサポートしています.サンフランシスコ施設はモバイル操作データ収集のための800+平方フィート以上の構成可能なフロアスペースがあり,地上真実ベース追跡のための動きキャプチャグレードのローカライゼーションがあります.オールストン施設は廊下および多室のシナリオをサポートしています.

部署 の 実例

  • 勤勉ロボットモキシ: 病院の配送および布団輸送のために病院の病棟に部署された車輪移動操作装置. 2025年時点で20以上の米国病院で商業部署. 構造化された環境 (既知の病棟のレイアウト,ラベル付きの保管場所) と分離されたナビゲーション +操作を使用します.
  • 6 リバーシステム (Shopify): AMRベースの倉庫ピックリングシステムで,人間労働者を支援する.構造化されたゴミ収集を処理する,完全なモバイル操作ではない.制限されたモバイル操作 (既知の物体,既知の場所) が商業的に実行可能であることを証明する.
  • **Hello Robot Stretch臨床試験:**ワシントン大学とジョージア工科大学が自宅で高齢者支援の作業 (物品の取れ,ドアを開く) に Stretchを試験した.公表された結果は,日常生活の作業で65%から80%の成功を示している.望遠鏡腕設計は,伝統的な6DOF腕が不適した家庭環境に適しています.
  • Google DeepMind RT-2 on Everyday Robots: RT-2 VLAモデルはGoogleのオフィスビル内の移動操作機の艦隊に部署され,キッチン掃除とデスク掃除の作業を行いました. VLAの背骨は,新しい物体にゼロショット通用化で,次の指示を有効にした ("モニターの近くでリンゴを拾い,堆肥箱に入れて") 操作精度は5mm+耐容性を持つ作業に限定されていたが.

携帯電話操作データギャップ

モバイル操作研究における最大のボトルネックルはデータ不足である.固定ベース操作データセット (Open X-Embodiment, DROID, BridgeData V2) は,数百万回のエピソードを含んでいるが,収集が難しく,遅いため,モバイル操作データセットは10~100倍小さい. このデータギャップは,特に長期課題に対して,固定ベース政策に対して,モバイル操作に関する政策が欠熟していることを意味します.

このギャップを埋めるには,目的的に構築されたデータ収集インフラストラクチャが必要である 航行のための十分なスペース,腕状態とともにベースオドメトリーを捕捉するハードウェア,全体テレオペレーションに訓練されたオペレーター. RCSVの [データ収集サービス] (T2) は,ACT,Difusion Policy,VLAの細かな調整パイプラインと互換性のあるHDF5/RLDS形式で標準化されたモバイル操作収集プロトコルと輸出で,このギャップを直接解決します.パイロットプロジェクトは2,500ドルから開始し,完全なモバイル操作キャンペーンは8,000ドル以上で開始します.

関連 読書

  • ローボットのガイド
  • ユニットリーG1レビュー
  • [オープンソースの人類ロボット2025]
  • [VLAモデル説明]
  • [Grasp計画調査]
  • [なぜテレオップデータがシムに勝った]
  • [データサービス]
  • [ロボットリース]
  • [語彙] T11

モバイル操作ソリューション

RCSVはモバイル操作部署のためのハードウェアコンサルティング,データ収集,システム統合を提供しています.

[解決策を探求]