ロボット学習におけるオープン問題:2025~2028年の10の研究方向
機械操作学習における最も重要な問題 <unk>サンプル効率から長期計画へ <unk> そして進歩の様子
[←研究]
ロボット学習は2022年以降に 驚くべき進歩を遂げています ロボットが構造化されていない環境で信頼に適した働きをする前に まだ解決する必要がある問題です
2025年のフィールド状況
ロボット学習 演示データや環境相互作用から神経政策を訓練する 機械学習は過去3年間で過去10年よりも多くの進歩を遂げました 拡散政策,ACT,RT-2と π0のような視覚言語行動モデルが,単一のロボットで50
しかし"実験室で可能"と"部署で信頼性のある"は,長いオープン問題リストによって分離されている.次の10つの問題は,部署経験,文献合成,および実践者と会話に基づいて2025年から2028年にかけての分野のための最も優先的な研究方向を表しています.
1 効率的なデータ収集をスケーリングする
ボトルネック: リアルワールドロボットデモデータ収集は,タスクの複雑さに依存して4~30ドルで費用がかかります. 最先端の一般主義政策のトレーニングには,数万回のエピソードが必要です. 数学は,ほとんどの組織では現在の収集コストで機能しません.
研究方向: 活発な学習 (最も情報提供的な示例のみ収集する,ランダムな示例ではない); リアルデータ要求を減らすためにドメインランダム化によるシミュレーション前訓練; 異体化転送 (ロボットAからのデータへのトレーニング,最小限の微調整でロボットBに展開する); そして半監督されたアプローチで,レーベル付きのロボットビデオから信号を抽出します.
進歩信号: バニラ行動クローン基線と比較して標準化されたベンチマークタスクで一定の成功率を達成するために必要な示範の10倍減少.
2 長期課題の完成
現在の状態: 最先端のロボットポリシーでは,制御された設定で1020ステップタスクを信頼に適した処理を行います.現実の世界での操作には50200ステップシーケンスが必要になります.エラー化合物:ステップごとに95%の成功率は50ステップでタスクの成功率を8%にしか与えません.
研究方向: 明確なサブゴール表現を持つ階層的政策;操作原始的な学習構成要素とのタスク・ムーブメントプランニング (TAMP) の統合; 低レベルの学習政策と組み合わせた大規模な言語モデルサブゴール生成;およびアクション表現における時間抽象.
進歩信号: 構造化されていない環境で50+ステップ操作作業を 70%以上で確実に完了する
3 精巧な手操作
現在の状態: ほとんどのロボット学習作業は,パワーキャップを実行する並行爪のグリッパーを使用します.手中の精巧な操作は,多指手中のオブジェクトを再配置,回転,規則付けする. 一般的なオブジェクトではほとんど解決されていません.
研究方向: 人間の指尖の敏感性と比較できる接触情報を提供する高解像度触覚センサーマレイ;示範収集のためのデータ手袋で巧妙な手作業 (RCSVは 手袋ベースのデータ収集プログラム を運営する);オブジェクト形や表面性において一般化する学習された接触モデル.
進歩信号: 50以上の新しいオブジェクトタイプにおいて,任意のオブジェクトが指定された方向に手動に回転し,80%以上の成功率を持つ.
4 概括して新作物
現在状態: 対象群に訓練された政策は,通常,その対象群で6075%の成功を達成する. 訓練中に見られない新型オブジェクトは,2540%の成功に低下する. 2×の一般化差は,ほとんどの政策を現実環境では不実用にする.
研究方向: 基礎モデル視覚機能 (CLIP, DINOv2) は,意味的通用化を提供する凍結されたエンコーディング; 5
進歩信号: 50つの保持されたオブジェクトカテゴリーの標準評価セットで訓練されたオブジェクトの成功率の15%以内に新しいオブジェクトの成功率.
5 物理 的 な 世界 を 理解 する
現在の状態: 現在のロボット政策は優れたパターンマッチングですが,物理的なオブジェクトの性質を理解することが不足しています.硬い物体で訓練されたロボットが脆弱な物体に対して握力調整することはできません.政策には質量,歪み,または脆弱性の表現がありません.
研究方向: 相互作用データから学んだ暗黙の物理モデル;触覚世界モデルが触覚観測から接触結果を予測する; 政策構成に統合された言語条件付きの属性表現 ("これを穏やかに処理する 脆弱である")
進歩信号: 変形可能な物体 (布,泡,軟食) の成功率が70%を超えた作業特別の訓練なしで成功する操作.
6 ヒト・ロボット協力
現在の状態: ロボットポリシーは静的な環境のために設計されています.人間が存在するときに,予測不能な動きはポリシー仮定を無効にし,失敗や不安全な行動を引き起こす.
研究方向: 姿と目からリアルタイムの人間の意図予測; 予想外の人間の近所に対応してロボット運動を適応させる安全なコンプライアント制御; 人間とロボット相互作用データに基づいて訓練された協力操作政策; そして,学習されたタイミングで明示的な譲渡プロトコル.
進歩信号: 人間の行動が期待から逸れる時,優雅な失敗モードで,協力作業の成功の完了 (人間の手がロボットに反対し,ロボットが作業を続ける)
7. 連絡先の作業のための強力な Sim-to-Real
現在の状態: Sim-to-real転送は自由空間運動 (到達,プリ-gripアプローチ) にうまく機能する.接触作業 (挿入,組み立て,表面フォロー) の転送は sim-to-realとの接触ダイナミクスにおけるギャップにより不十分である.
研究方向: 実用ロボットデータに校準化された学習された接触モデルによる差別化可能なシミュレーション; 強力なポリシーを作成するための訓練中にランダム化された接触パラメータ; シミュレーションエラーを修正する学習された残留動力学モデル;および,拡張のためのシミュレーションのみで,主に実用データで訓練された接触豊かな基礎モデル.
進歩信号: 完全にシミュレーションに訓練されたペグインホール挿入 (0.5mm クリアランス) リアルハードウェアで実際のデータ微調整なしに80%以上の成功を達成する.
8 忘れる こと に ならない 生涯 の 学習
現在の状態: 導入されたロボット政策は静態です 運用経験から改善されません.新しいタスクを追加したり,既存のタスクを更新する必要がある場合,標準的なアプローチは,コストが高く,遅いものとして,ゼロから完全な再訓練です.
**研究指針:**既存の機能を覆いずに新しいタスク機能を追加する継続的な学習方法; LoRAおよび他のパラメータ効率的な細かな調整方法が,ポリシーをモジュール的に拡張する;災害的な忘れを防ぐためにキュレーテッドメモリバッファで体験を再現する;およびタスク特有のモジュールが独立した交換できるモジュール型ポリシーアーキテクチャ.
進歩信号: ロボット・ポリシーが,完全な再訓練なしで,すべての以前の任務で90%以上の元のパフォーマンスを維持しながら,連続して10つの新しいタスクを学習します.
9 効果的な 実世界 強化 学習
現在の状態: 実用ロボットでの強化学習はほとんどアプリケーションでは遅すぎ,安全性が低い. ゼロから学習するには何千もの環境相互作用が必要であり,その多くは機器に損傷を与える障害や安全リスクをもたらすことが多い.ほとんどの実践的なロボット学習は示範から模倣学習を使用します.
研究方向: モデルベースのRLが,小さな数々の実際の相互作用と計画から世界モデルを学習する;学習中にエージェントの行動空間を制限する安全な探索方法; 模倣学習初期化と最終的なパフォーマンスギャップのためのRL細かな調整を組み合わせる;およびオンライン相互作用なしにログインされた運用データからポリシーを改善するオフラインRL方法.
進歩信号: 接触力のある操作作業で 85%以上の成功率を達成し,実際のロボット相互作用 (シミュレーションなし) の2時間しか使え,学習中に安全違反はゼロ.
10 評価標準化
現在の状態: ロボット学習論文は,異なるロボット,タスク,成功指標,評価プロトコルとの互換性のない基準に関する結果を報告する.ビジョンのイメージネットや言語のMMLUに類似する合意された基準はない.論文間の方法を比較することはほぼ不可能である.
研究方向: 標準基準の小さなセットにおけるコミュニティの融合
進歩信号: 論文の受け入れのための共通の基準子集に関する結果を要求する3つ以上の主要なロボット学習場 (CoRL,ICRA, RSS)
RCSV が この 方向 に 貢献 する 方法
RCSVの研究・インフラストラクチャプログラムは,直接問題1 (データ収集効率),3 (手袋収集による繊細な操作データ),8 (連続データフライホイールによる生涯学習) と10 (標準化されたタスクセットによる評価) に関する.
これらのオープンな問題に取り組む研究者のために,RCSVは,ベンチマーク品質の示範データセット,ハードウェア・イン・ザ・ループ評価のためのロボットアクセスプログラム,レロボットハブとオープンX-エンボディメントフォーマットへのデータセット貢献を制作する [データ収集サービス] (
ロボット学習研究 に 協力 する
RCSVは,データ収集,ロボットアクセス,インフラストラクチャなどで学術・産業研究プログラムを支援しています.研究協力について議論するために,私たちと連絡してください.
[研究プログラムを見る]







