Blogに戻る

なぜ 遠隔操作データ は 機械 の 訓練 策略 の シミュレーション を 勝てる の です か

模擬技術の進歩にもかかわらず,実際の遠隔操作デモは訓練操作政策の黄金基準であり続けています.

[電動操作ガイド]

[←ブログ]

シンとリアルとのギャップは縮小しているが,まだ閉ざされていない.接触豊かな作業では,完全に閉ざすことはないかもしれない.

持続するシム - リアル ギャップ

サイクルのサイクルは長距離を進みました イザックラボは毎秒数千フレームで固体物理を 表現しています MuJoCo MPCはミリ秒で操作ループを閉じる しかし,シミュレーションに専用訓練を受けた接触豊かな政策を 発送しようとした全てのチームは 同じ壁に遭遇しました: 現実世界はシミュレーターの予測通りに振る舞わないし, 診断が困難で 修正が高価な方法で政策が失敗します

基本の問題点は接触モデルです.ロボット指が石棒に触ると,接触硬度,摩擦系数,表面微型幾何学が相互作用し,バーが滑り,ロールするか,または置かれているかどうかを決定します.シミュレーションエンジンは数々のスケールパラメータでこれを近似します. 湿ったABS表面のシリコン石は滑動速度,正常な力,表面湿度によって変化する摩擦系数があり,物理エンジンでは正確にモデルを模倣できない.シミュレーションに訓練された政策は,真似された接触モデルではなく,利用することを学んでいます.

接触 富: 模擬 図 に 収め られ ない もの

接触型操作作業 接し,挿入,組み立て,表面をフォローする は,成功または失敗を決定する情報が接触インターフェースの力,変形,摩擦動力にコード化されている物理的な相互作用を含む.この情報は,基本的にはシミュレーションを困難にするいくつかの性質を有する:

Contact Property Sim Fidelity Real-World Complexity Gap Severity
Static friction coefficient Single scalar per pair Varies with normal force, velocity, surface wear, moisture High
Contact patch geometry Point/line contact models Deformable patch with pressure distribution High
Surface micro-geometry Not modeled Micro-roughness, grain direction, surface coatings Moderate
Soft body deformation FEM or MPM (slow, approximate) Viscoelastic, rate-dependent, non-linear Very high
アクチュエータ dynamics Idealized motor models Backlash, cable stretch, thermal drift, gear wear Moderate
Visual appearance under contact PBR rendering (improving) Specular reflections, shadows from gripper, occlusion Low-moderate

これらのギャップの複合効果は,接触作業の sim-to-real転送を非常に困難にするものです.個々の近似は小さなエラーしかもたらさないが,摩擦,幾何学,動力学のエラーは多段階の接触配列中に倍増します. 接触モデリングの不正確さによるステップごとに5%のエラーによる10ステップ挿入作業は,視覚観測における分布変化を考慮する前に,全体的な成功率の0.95^10 = 60% を得ます.

配分シフト: 量的な証拠

配分シフトは,政策が訓練中に見られる州配分と部署中に遭遇する州配分との不一致を指す.シミュレーション訓練を受けた政策は,配分シフトによって2つの異なる方法で影響を受ける.

視覚分布シフト: ドメインランダム化と神経レンダリングの進歩にもかかわらず,シミュレーションされた画像は実際のカメラフィードと分布的に異なるままです. この変化は測定可能である.IsaacSimがレンダリングした操作シーンと同じシーンをリアルRealSenseで撮影する間のFID (Frechet Inception Distance) は,通常80120であり,異なるリアルカメラセットアップの間に2040である.このギャップに敏感な学習した視覚エンコーダーを持つポリシーは,シムからリアルにシムなしで転送されたときに15~30%のパフォーマンス低下を示します.

ダイナミック分布シフト: 視覚転送が成功する場合でも (ドメインランダム化またはリアル画像レンダリングを通じて) ダイナミック不一致は,訓練中にポリシーが見たことのない状態軌道を展開する.シミュレーターのダイナミックモデルによって形作られた軌道を対象にシミュレーターが訓練した把握方針が接近する. 実際には,アクチュエーターモデリングのエラーにより,腕は略微の異なる軌道をたどっており,その結果,ポリシーの配分が外れている把握アプローチ構成が生じます.この動力シフトは測定するのが困難ですが,接触タスクにおける sim-to-real失敗の大部分を占めています.

人 の デモ が 正しい 配分 を 捕らえる の は なぜ です か

熟練した操作者がロボット腕を遠隔操作して石けんを取り上げる時,彼らは計算された軌道をたどっていない.彼らは進化が数百万年かけて最適化した同じセンサーモーター・ヘーリスティックを使用している.彼らは丸い表面を見たときに直感的に接近角を調整する.彼らはハプティックフィードバックや視覚信号を通して,把握が不安定で失敗する前に正しいとき (感知する). グローバルに最適ではなく,現地で安定している 把握配置を見つけます 部署に移行する解決方法の種類です

これは,テレ操作デモが暗示的にシミュレーションが簡単に提供できない2つのことをコードするという意味です. 正しいタスク分布 (物体ポーズ,把握戦略,そして物理世界で実際に動作するアクションシーケンスの集合) と 暗示的な制約満足度 (熟練したオペレーターは経験から知ると失敗すると決して理解しようとしません.

操作者は,滑りを感じているため,握力力を軌道の中間調整すると,実際の摩擦系数を示範軌道にコード化している.オブジェクトが不都合に位置しているため,接近速度を遅らせると,実際の運動的制約をコード化している. 動作配列に組み込まれているので,シムデモが間違えるのはまさにその情報です.

作業タイプによるシムからリアルまでのギャップ:量的な証拠

シンとリアルとの差異の大きさは,タスクタイプによって劇的に異なります.以下のデータは,複数のハードウェアプラットフォームにおける公開されたベンチマークとRCSVの内部評価から集約されています.

Task Type Sim Success Real Success (Sim Policy) Real Success (Teleop Data) Demos Needed
Pick-place (rigid, top-down) 95% 75-85% 90-95% 100-200
Peg-in-hole (1mm clearance) 90% 30-50% 80-90% 200-400
Deformable manipulation (cloth) 80% 15-30% 65-80% 300-600
Cable routing / insertion 70% 10-25% 70-85% 400-800
Liquid pouring 85% 20-40% 75-90% 150-300
Tool use (e.g., screwdriver) 75% 5-15% 60-75% 500-1000

パターンは明確である.より豊かな接触動力を持つタスクでは sim-to-realのギャップが大きい.上下硬いピックプレイスでは,ギャップはドメインランダム化で管理可能な 10-20パーセントポイントです.複雑な接触シーケンスのツール使用では,ギャップは60パーセントポイントを超え, sim-onlyトレーニングを効果的に使用できないようにします.

価格対品質の比較

リアルデータアプローチに対する一般的な反対はコストです.環境が手に入ると シミュレーションデータは"無料"です.実際のデモにはオペレーター,ハードウェア,時間が必要です. しかし,このフレームリングは,最終的に政策のパフォーマンスを決定する示範品質のコストを無視します.

Data Source Cost/Demo Demos for 80% Success Total Cost to 80% Time to 80%
Sim-only (Isaac Sim) ~$0.001 Often unreachable for contact tasks N/A (ceiling ~50-60%) 2-4 weeks sim engineering
Sim + domain rand (tuned) ~$0.01 (compute) 500K-1M episodes $5K-10K compute + 4-8 weeks engineering 4-8 weeks
Real teleop (in-house) $15-30 200-400 $3K-12K + hardware setup 2-3 weeks
Real teleop (RCSV managed) $8-16 200-400 $2,500 pilot / $8,000 campaign 1-2 weeks
Hybrid (sim pre-train + real fine-tune) $0.01 sim + $10 real 50K sim + 100-200 real $2K-5K total 3-4 weeks

重要な洞察:接触型作業では,シミュレーションだけでは,常に目標の成功率に達することはできません. 性能上限は,接触型モデリングの信頼性によって制限されているため. リアルデータは,より早く,より予測可能な方法で目標に到達し,管理された収集経路 (RCSVの [データサービス]T2)) は,独自の収集インフラストラクチャを設定する上方費用をなくします.

模擬が失敗する3つの事例

  • ソープバーの把握: 業界全体で6つのチームは,PBR摩擦パラメータをデフォルトで利用したアイザックシムで訓練された政策がシミュレーションで80%以上成功したが,実際のハードウェアでは40%以上を達成したと報告した.接触硬度モデルは間違っていた.実際の遠隔操作データへの移行は300回のデモで85%以上の成功率をもたらした.
  • ケーブル挿入: 変形性幾何学は,リアルタイム物理エンジンでは基本的に解消されていない.指の接触の下にあるUSB-Cケーブルの変形は,その特定の糸筋緊張,ジャケットの硬さ,およびコアコンプライアンスに依存する.ケーブルルーティングのシミュレーションポリシーは,実際の成功率約20%を達成する.500のデモでテレオペレーション訓練されたポリシーは,70~80%を達成する.
  • 液体流出: グラス水のスケールで流体動力シミュレーションは,SPHまたはグリッドベースの方法によって計算的に処理可能だが,流体,グラスリム幾何学,および表面張力間の相互作用は,シム訓練された政策が体系的に過度に流出するほど複雑である. 200 デモの遠隔操作データセットは,シミュレーションで訓練された50KステップRL政策よりも優れた政策を生産した.

模倣 が 本当 に 適切 な もの

シンミュレーションの効果を証明する理由です. simが本当に役立つ3つの分野です.

  • 自由空間運動計画: 既知の環境で衝突のない軌道を生成する過程は, sim から real に 良く移転する.
  • 様式生成: シミュレーションは,物理的に設定するのに数週間かかる数千のオブジェクトポーズ,テーブル構成,環境レイアウトを生成することができます.この多様性は視覚表現の訓練前には価値があります.
  • 粗い行動のための無限データスケール: ロボットが目標に向かって,物体に近づくか,廊下を移動させるには,何百万人ものシミュレーションされたエピソードからブートストラップできます.細粒度の接触ポリシーではそうでないとしても,粗い行動が転送されます.
  • 視覚エンコーダーを予備訓練: 異なるオブジェクト外観,照明条件,カメラの視点を含む数百万ものシミュレーションシーンで視覚の脊髄を訓練することで,実際のカメラにうまく転送される表現が生成されます.これはおそらく現在のシミュレーションのROI利用率が最も高いです.

模擬データ が 役立つ 時: 訓練 前 の ケース

模擬データに対する最も強い議論は,主要な訓練源ではなく,訓練前の段階である.

1.視覚表現前訓練. 1Mの模擬シーンでResNet-50またはViTのバックボーンを訓練する.結果となるエンコーダーは物体レベルの特徴 (端,形,空間関係) を学び,実際のカメラに転送します. 200個の実用デモの精細調整は,ゼロからトレーニングするよりも3~5倍少ない再演で,結果となる方針は,新しいカメラの視点と照明条件によりよく一般化されます.

2.粗い運動技能初期化. 100Kのシミュレーションエピソードで粗い運動原始的 (接近オブジェクト,方向握手,閉指) を学ぶためのポリシーを予備訓練する.これは,多くのタスクで実際のデータ要求を500のデモから100-200のデモに削減します.

3. 失敗モード発見. 10K ランダム化されたシナリオで sim ポリシーを実行して,失敗モードをカタログにします.このカタログを使用して,標的型実用データ収集を設計します. sim ポリシーが失敗した構成で特に示例を収集します. この失敗方向アプローチは, sim-to-real ギャップを閉じるために最大限の情報を提供するデータセットを生成します.

ハイブリッド 方法: 実践 的 な 境界

2025年の最も効果的なチームは,シムとリアルの間で選択していない. 構造化されたハイブリッドパイプラインを使用している. 最も実証された3つのハイブリッド戦略は:

**Simプレトレーニング +実用フィーナツーニング (標準アプローチ):**Simでトレーニング,実用デモ100-500でフィーナツーニング.Simポリシーが4060%の実用的な成功を達成するタスクではうまく動作します.期待される改善:フィーナツーニングから2040パーセントポイント.これはpi0,OpenVLA,およびほとんどのVLAベースのシステムがタスク特集に使用するものです.

**リアルバックbone + sim増幅:**リアルデータについて基本方針を訓練し, simデータで simデータで 1:3〜 1:5 real:sim比で増幅する. simデータでは,リアルで収集するのに数週かかる状態空間覆盖を提供します.

探索のためのSim + 精錬のためのリアル: 難しい課題 (例えば,ツール利用戦略,再把握シーケンス) の新しい解決策を発見するために,RLをSimで使用します.発見された戦略を,経路点シーケンスとして抽出します.その後,これらの戦略に従って実際の示範を収集し,実際の方針を訓練します. このアプローチは,部署中に接触モデリングの問題を回避しながら,数百万の軌道を調査するシムの能力を活用します.

RCSVの遠隔操作方法

RCSVのデータ収集方法法は,実際の示範データにおける信号対騒音比を最大限に高めるために設計されています.私たちのアプローチは,いくつかの重要な点でアドホックテレオップ収集とは異なります.

  • 構造化変異プロトコル: すべての示例を単一のシーン構成で収集する代わりに,私たちは事前に定義されたグリッドでオブジェクトの位置,方向,シーン背景を体系的に変化させます.これはデータセットが単一の構成を過度に表現するのではなく,一般化にとって重要な変異軸をカバーすることを保証します.
  • オペレーターレベルシステム: ジュニアオペレーター (1〜2週間の訓練) はL1タスク (シンプルなピックアップ場所) を収集します. 上級オペレーター (1ヶ月以上の経験) はL2タスク (多段階操作) を処理します. QAリーダーは (3ヶ月以上) はL3タスク (精度挿入,ツール使用) を処理します.この操作者のスキルとタスクの複雑性の組み合わせは,各難度レベルでデモ品質を最大化します.
  • 3ゲート品質パイプライン: 各デモは (1) 自動化ヘューリスティックチェック (速度制限,作業空間制限,エピソード長さ) (2) 50K+ラベル付きエピソードで訓練されたMLベースの品質分類器 (3) 10%のサンプリング率でヒトスポットチェックレビューを通過します.拒否率は通常15-25%,最終データセットにクリーンなデモのみが入力されることを保証します.
  • ハードウェア標準化: 標準化されたワークステーションですべての収集が行われます [OpenArm 1] (T3) ($4,500) または DK1 の双手設定で同期されたマルチカメラ記録を使用します.これは異なる収集設定における政策訓練を劣化させるハードウェアの特定の騒音を排除します.

結果:RCSVで収集されたデータセットは,ACTと拡散政策アーキテクチャに関する12つのタスクの比較に基づいて,アドホックセットで収集された相当規模のデータセットよりも一貫して15~25%高い政策成功率を達成します.

正しい メンタル モデル: シム で 粗大 で,実 に は 優れている

機械は,物体へのアプローチ,把握候補の推定,そして数千のオブジェクトカテゴリーで粗略な選択動作を実行することを学んでいます.この段階は,単一のA100で一晩で実行され,適切な把握から10cm以内に得られるポリシーを生産します.

2 段階では,特定の作業に関する200-500 件の実用テレオペレーションデモを収集します.この実用データに基づいてシミュレーション訓練モデルを精細に調整します.この組み合わせは,通常,シムのみまたは実用のみのアプローチを上回り,ゼロからトレーニングと比較して実用データ要求を5〜10倍削減します.

データの収集作業からRCSVの観測

RCSVの数十のデータ収集プロジェクトでは,データ品質が接触作業のデータ量より大きいことが一貫して観察されています.訓練を受けたオペレーターからの300人の専門家によるデモは接触,挿入,または表面追跡に関する作業に関する初心者の1500回のデモよりもはるかに優れている. 専門家のオペレーターは,政策を混乱させるデモを本能的に避けます 学習アルゴリズムは実際に信号を抽出できる一貫した,クリーンな動きを使用します.

実験では,L2複雜性の課題 (構造化ピックプレス) の多くにおいて,最初の200のデモが減少していることも観察しました.次回の300のデモは,新しいオブジェクトポーズに対する強さを向上させています.500以上のさらなる改善は,新しいオブジェクトインスタンスの導入と環境変異を要求します.

ハイブリッド 戦略 を 実用 に 導入 する

新しい操作作業を開始するチームにとって推奨するアプローチは: (1) 粗い行動前訓練のためのシミュレーション環境を構築またはダウンロードする (2) ポリシーを初期化するために 50K-100Kのシムステップを実行する (3) 構造化されたデータ収集プロトコルを通じて 300-500の実際のテレオペレーションデモを収集する (4) 細かな調整する (5) あなたが訓練されていない新しい条件で3つの評価する このパイプラインは,通常,シムのみアプローチに必要な3-6ヶ月ではなく,導入準備の準備が整った政策を 4-6週間で生産します.

#例ハイブリッドパイプライン (pseudocode) # ステージ 1: Sim プレトレーニング python train.py \ --data sim _dataset/ \ --epochs 100 \ --backbone resnet50 \ --domain-rand visual+physics \ --save checkpoint_sim.pt # ステージ 2: リアル・フィニットチューニング python train.py \ --data real_teleop_dataset/ \ --epochs 50 \ --backbone resnet50 \ --resume checkpoint_sim.pt \ --lr 1e-4 \ # 低LR ファイニットチューニングのための リアーゼ・バックbone 10 # ファースト10のビジュアルエンコードを凍結する # 3: Evaluate python # ステージ 3: --value point checkpoint \ \ \ end_etript. \ --evalue-scenes\ \ 年代末のシーン\ \ サイプット \ 図書

本日実際のデモデータを収集を開始したいチームには RCSVの [データ収集サービス] (T4) は訓練されたオペレーター,校正されたハードウェア,構造化された品質パイプラインを提供します インフラを自分で構築せずに 清潔でポリシーに備えられたデータを入手できるようにします 試行プロジェクトは200のデモで2,500ドルから始まり 1,000以上のデモで8,000ドルで品質保証で完全なキャンペーンです

関連 読書

  • [ロボット訓練データガイド]
  • [シムからリアルへの転送]
  • [ロボットに関する拡散政策]
  • [データ収集チームをスケールする]
  • [ロボットデータ注釈]
  • [VLAモデル説明]
  • [データサービス]
  • [RCSVプラットフォーム]
  • [語彙] T13

リアルロボットデモを集め始め

RCSVは訓練されたオペレーター,OpenArm 1ハードウェア,ロボットデモ収集のための完全な品質パイプラインを提供しています.

[データサービスを探求]