ロボット学習のためのスケーリング法:2026年に知られるもの
ロボット学習にスケーリング法が適用されるのか? オープンX-エンボディメント,RT-X,DROIDの証拠,および2026年にデータ収集,モデルサイズ,コンピューティング予算に対する実用的な影響.
[←ブログ]
ロボット学習には独自のスケーリング動態があり 言語モデルとは 異なるのは データの収集予算をどのように割り当てるか モデルサイズを選択するか コンピューティングインフラストラクチャを計画するかに 関係するということです
規模 測定 法 は 何 で ある か
スケーリング法は,リソース入力 (データ,計算,モデルパラメータ) とモデル性能の予測可能な関係を記述する.大規模な言語モデルでは,チンチラ論文 (Hoffmann et al., 2022) は,最適なトレーニングはモデルサイズとデータセットサイズを比例的にスケーリングする必要があることを確立した.データダブル化せずにパラメータを倍増することは,サブ最適モデルを生成する. この枠組みは,資源をコミットする前に,予算を割り当て,業績を予測するための原則的な方法を提供しました.
拡張法には学術的な価値はありません. データ収集やより大きな GPU クラスターにさらに10万ドルを費やしても能力の向上がもたらされるかどうか教えてくれます. 現在のアプローチが天井に達し,より多くのリソースではなく構造的な変化が必要になったときを教えてくれます. 性能目標を達成するか 根本的に異なるアプローチが必要かどうかです
ロボット学の核心問題です 似たような法律が適用されるのか もしそうなら 予測するものは? 2026年までに 微妙な 実行可能な答えを 示すのに十分な経験的証拠があります
ロボットスケーリングは言語モデルスケーリングとどう違いますか?
証拠を調べる前に,ロボット学習のスケーリング法がLLMスケーリングダイナミックの単純なコピーになれない理由を理解することが重要です.
データ収集は高価で遅い. LLMトレーニングデータ (インターネットからのテキスト) は,基本的に取得する費用は何もありません - 瓶頸は計算です. ロボットデモデータ収集はエピソードごとに5〜50ドル (オペレーター時間,ハードウェア磨損,品質保証) です. ロボット学習では "どれだけの計算能力があるか"ではなく "どれだけの多様なデータを収集できるか"という問題です
**データ分布は多型で物理と結びついている.**言語モデルトレーニングデータは比較的均等な分布 (インターネットのテキスト) から抽出されています.ロボット学習データは基本的に多型です:視覚観測,自感状態,力反射,時間動力と結びついています. ポリシーは,この高次元入力空間から物理的に有効なモーターコマンドへのマッピングを学ぶ必要があります.LLMにより多くのテキストを追加することは常に役立ちます. ロボットポリシーにより多くの示範を追加することは,これらの示範が入力空間の新しい領域をカバーした場合のみ役立ちます.
評価は物理的に基礎となる. LLMのパフォーマンスは,スケールで保持されたテキストベンチマークで評価することができます. ロボット政策のパフォーマンスは,物理的なハードウェアに関するポリシーを実行することによってのみ,実際に評価することができます.これは遅い,高価で,ハードウェアの変動に આધિનです.これはスケーリング曲線を正確に特徴付けることが難しくし,騒音を経験的測定に導入します.
証拠:オープンX体とRT-X
Open X-Embodimentプロジェクト (パダルカー・アト・2023年) は,33の研究機関における22の異なるロボット実施形態から100万以上のロボット操作エピソードを集めた.このデータに基づいて訓練されたRT-Xモデルは,クロス-インボディメントスケーリングに関する最初の大規模な証拠を提供した.
重要な発見は,全体的な多体体データセットに訓練を受けたRT-2-Xが,既得の一般化作業で単ロボットの専門家の政策を約50%上回った.これは,異なるロボットタイプからのデータがモデルへの騒音だけでなく,新しいロボットや新しい作業への一般化を改善する,転送可能な操作知識を含んでいることを示した. LLMのスケーリング曲線のように スケーリングは平滑で予測不能でしたが 方向は明確で一貫していました
より具体的に,RT-Xの結果は,転送の階層を示した.視覚シーン理解は実施形態間で最も容易に転送された.高レベルのタスク概念 (ピック,場所,オープン,閉) は適度に良好に転送された.低レベルのモーター制御 (特定の関節軌跡,正確な接触タイミング) は不良に転送され,依然として実施形態特有の微調整が必要であった.
証拠:DROIDとデータスケーリング
DROIDデータセット (Khazatsky et al., 2024) はロボット操作のためのデータスケーリングに関する最も包括的な経験的研究です.86のラボ,22のロボットタイプ,および564の異なる環境で収集された76,000のデモにより,DROIDは研究者がデータ量とデータ多様性との政策パフォーマンスのスケーリングを独立してテストすることを可能にしました.
重要な結果は: データ多様性ではデータ量より信頼性の高いパフォーマンスが評価される.著者は,DROIDデータのサブセットの増加についてACTとDifusion Policyを訓練した際,およそ1万回の示例まで一貫した改善を観察し,収益は3万回,および内部配信のパフォーマンスでは5万回近く減少した. しかし,様々なデータ (新しい環境,新しいオブジェクトカテゴリー) を追加することは,すでに見たシナリオの示範を追加した後も, 配布外でのパフォーマンスを改善し続けました.
これは言語モデルスケーリングとは根本的な構造的違いである.同じ分布からより多くのウェブテキストが言語モデルを改善し続けています.同じ環境で同じ作業の示例が増えることは,比較的低い天井を超えてロボット政策を改善し続けません.ボトルネックスは多樣性であり,容量ではありません.
ロボット 学習 に 関する 適度 な 尺度
視覚表現品質. より大きな,以前訓練された視覚エンコーダー (DINOv2-Large vs DINOv2-Base, SigLIP-400M vs SigLIP-100M) は,操作政策のために一貫してよりよい視覚機能を生む.このスケーリングはコンピュータビジョンから馴染みのあるパターンに従う.より大きなモデルはより豊かな,より一般化可能な視覚表現を学ぶ.これはロボット学習における最もLLMのようなスケーリング動力です.
**訓練前のデータにおけるタスク多様性.**より多くのタスクカテゴリーで訓練された政策は新しいタスクによりよく一般化されます.この軸に関するオープンX-エンボディメント結果は堅固で,次回の作業で複製されています. 訓練前混合に追加された追加のタスクカテゴリーごとに,実行されたタスクのゼロショットパフォーマンスは向上し,現在のデータセット (タスクカテゴリー数百) の限界まで減少するが,ポジティブな返却が観測されます.
** 身体横断転送.** 訓練前セットに追加されたロボットタイプからのデータを追加することで,対象ロボットが訓練セットの他のロボットと кинеマチック的に異なった場合でも,新しいターゲットロボットに一般化が改善されます. 機械は,多様な実施形態データによってモデルが,機械の運動学に過度に適合する代わりに実施形態-無知的な操作表現を学ぶことを強要する.これは訓練セット内の実施形態数と信頼に適している.
環境多様性* より物理的な環境 (異なる部屋,照明条件,テーブル表面) から示しを行なう政策は,新しい展開環境によりよく一般化されます.これは,約20個ほどの異なる環境数とほぼ線形的にスケールされ,その後,減少する返済率です.
清潔 な 規模 を 測ら ない もの
精巧な操作を精確にします. サブセンチメートル精度を必要とする作業 (線,挿入,螺旋駆動) は,より多くのデータやより大きなモデルによって予測可能なほど改善されません. 瓶頸は視覚表現の質やタスク知識ではなく,正確な接触動態は,一般化を倒す方法で各例によって異なる物体特性を (摩擦,コンプライアンス,幾何学) に敏感である.より多くのデータが役立ちますが,スケーリング曲線は粗大操作タスクと比較して浅いと騒音です.
コンタクトダイナミクス. 対象の特性 (脆弱性対強固性,硬性対変形性) に基づいて握力調節を要するポリシーでは,データスケーリングだけで限られた改善が示されています.問題なのは,コンタクト関連性のある特性がカメラには見えません.RGB画像から物体の摩擦系数またはコンプライアンスが表示できません. フォース・トーク・センサーデータは助けますが,独自の分布シフト問題を導入します.これはハイブリッドアプローチ (学習感知 +古典的な力制御) が学習された政策の純粋なスケーリングを上回る分野です.
長期的タスク計画. 10以上の連続的なサブタスクを実行を必要とするタスクでは,データで成功率が低い.複合エラーの問題とは,ステップごとに95%の成功率を持つポリシーでさえ,10ステップタスクで60%の成功率と20ステップタスクで36%の成功率しか達成できないことを意味します.より多くのデータはステップごとに信頼性を向上させるが,複合算数を変化させません. 階層政策 (高レベルのプランナー +低レベルのスキル) はこれを緩和しますが,高レベルのプランナーのスケーリング動態は,スキルレベルスケーリングよりもよく表されない.
Raw model parameters count for fine-tuned policies. 大きいが一貫して良い言語モデルとは異なり,タスク特別の細かな調整後のモデルサイズと操纵性能の関係は単調ではない.OpenVLA (7Bパラメータ) はゼロショットタスクではOcto (93M) を上回るが,タスク特別のデモ200以上の細かな調整後,優位性が低下する. 専用のデータ収集予算を持つチームにとって,よく調整された小さなモデルは,軽に適応した大きなモデルよりもしばしばより実用的です.
ロボットデータ収集の競争が 産業に迫る理由
規模拡大の証拠は,2026年に各大ロボット工学企業や研究ラボが現実世界のロボットデータ収集インフラに大きく投資している理由を説明します.多様性はボトルネックであり,多様性は多くのロボットに多くのオブジェクトを持つ多くの環境でデータを収集する必要がある場合,競争優位性は規模で多様なロボットデータを生成できる組織に蓄積されます.
物理知能,Google DeepMind,トヨタ研究研究所,そして多くの資金調達したスタートアップは 数十のロボットステーション,標準化されたタスクプロトコル,およびプロのオペレーターを持つ大規模なデータ収集施設を建設または構築しています 論理は直接的です 機械操作データが最も多様である者は 最高の基礎モデルを訓練し 最高の基礎モデルには 顧客に合った最小の微調整が必要になります
RCSVはこのエコシステムにおいて特定の役割を果たしています. 多様な高品質な操作データが必要なチームにデータ収集インフラとプロフェッショナルなオペレーターを提供していますが,独自の収集施設を構築し,スタッフを配置したくない. この記事で説明されているスケーリングダイナミクス (スケーリングダイナミクス) に合わせて, [データサービス]は,単にエピソード数を増やすのではなく,オブジェクト,環境,タスク構成の多様性を最大化します.
研究 研究 研究室 に は,この こと が 意味 し て いる
専門の研究室は,産業がしていない規模化課題に直面している.大学の研究室には通常,1〜3台のロボット腕,1部屋,物件調達とオペレーター時間のための予算が限られている.規模化証拠によると,投資する最も影響力のある次元は多样性であり,容量ではない.
- 基礎モデルを使用. 訓練前のモデル (Octo, OpenVLA) は,単一の研究室が複製できない多体化,多作業基盤を提供します.
- ドルあたり物品多様性を最大化. 3つの高価な精密物品ではなく,使い捨て店から30種類の物品を購入する.
- 複数の部屋で収集する. 実験室,キッチン,オフィスの間を移動することは,不都合であっても,環境多様性を提供し,政策の強度を劇的に向上させます. 100個のデモを持つ3つの環境は,分散以外での一般化のために 300個のデモを1つの環境に優れている.
- オープンデータセットに貢献し,そこから抽出する. オープンX-Embodiment,DROID,および Bridge V2は無料のスケーリングで,追加のデモを集めても,トレーニングパイプラインに追加することができます.
企業 に は どんな 意味 が あり ます か
生産ロボットシステムを構築する企業は,異なるスケーリング課題に直面しています.彼らは通常,特定の部署環境と特定のタスクポートフォリオを持っています.スケーリングの証拠は段階的なアプローチを示唆しています.
- 第1段階: 基礎モデル選択. ロボットタイプとタスクドメインの最良の現有予備訓練モデルから始めましょう.これは収集コストなしでコミュニティ規模でのデータ多様性の恩恵をもたらします.
- 第2段階:ターゲット型細かな調整. 特定の部署環境で特定のタスクの200-500のデモを収集する.目標型 SKUカテゴリー内のオブジェクト多様性,作業場内の位置多様性に焦点を当てます.
- 第3段階:継続的な改善. 改善された政策を導入し,記録された展開データを (人間による成功/失敗標籤で) 活用して失敗モードを特定する.これらの失敗を解決するために標的データ収集する.ここで多樣性超容量原則が最も重要である.既に持っているデータを再収集しないでください.ギャップをカバーするデータを収集する.
- 第4段階:各サイトを拡大する. 各新しい部署サイトは,環境多様性を提供し,ベースポリシーを向上させます.部署データパイプラインを構造化して,すべてのサイトからデータを中央トレーニングプールに流れ戻します. これにより,部署規模はデータスケーリングの利点になります.
データ量対モデルサイズ対性能: 数字
| Configuration | Model Size | Training Data | In-Distribution Success | OOD Success |
|---|---|---|---|---|
| ACT from scratch | ~30M params | 100 demos | 75-85% | 20-35% |
| ACT from scratch | ~30M params | 500 demos | 88-93% | 35-50% |
| Octo (fine-tuned) | 93M params | OXE + 200 task demos | 85-92% | 45-60% |
| OpenVLA (fine-tuned) | 7B params | OXE + 200 task demos | 88-95% | 55-70% |
| OpenVLA (fine-tuned) | 7B params | OXE + 500 task demos | 92-97% | 60-75% |
これらの数字から得られる重要な教訓は 200 つのタスク特有の示範を持つ 細かな調整された基礎モデルが 通常 500 つの示範を含む ゼロからモデルに一致するか超えることです 配布中でも配布中でもです 基礎モデルの利点は完全に OOD 一般化です - 新しいオブジェクトと環境で 20-30 パーセントポイントの改善を提供します 配分上の優位性は小さい (5~10ポイント) で,小さい評価セットでは統計的に重要ではない.
費用予測:データ収集対計算
| Resource | 100 Demos | 500 Demos | 2,000 Demos | 10,000 Demos |
|---|---|---|---|---|
| Data collection (RCSV rates) | $2,500 | $6,000 | $18,000 | $65,000 |
| Training compute (ACT, single A100) | $5 (2 hrs) | $10 (4 hrs) | $25 (10 hrs) | $60 (24 hrs) |
| Training compute (OpenVLA fine-tune, 4x A100) | $50 (5 hrs) | $100 (10 hrs) | $300 (30 hrs) | $800 (80 hrs) |
| Data-to-compute cost ratio | 50:1 to 500:1 | 60:1 to 600:1 | 60:1 to 720:1 | 80:1 to 1083:1 |
ロボット学習におけるデータ対計算コスト比は,コンピュータが支配的なコストである言語モデルトレーニングとは大きく異なります.ロボット学習では,データ収集は,データ訓練の計算よりも50~1000倍高いコストです.これは直接的戦略的影響があります.すべての額外ドルは,より大きなモデルや長時間のトレーニングにではなく,データ品質と多様性を向上させるために費やされるべきです. 異なるデータセットのトレーニングに 10倍以上の計算よりも 200の多種多様なデモに費やされた場合 5,000ドルの予算は より多くの能力向上をもたらします
スケーリング曲線データポイント:経験的パフォーマンス対データセットサイズ
次の表は,出版された論文やRCSV内部評価から得られたパフォーマンスデータポイントをまとめ,異なるアーキテクチャのデータセットサイズによってタスク成功率がどのようにスケールされるかを示しています.すべての数字は,単一のタスクタスクタスクテーブルピックアップと場所で,保持されたオブジェクトポジションで評価されています.
| Demo Count | ACT (from scratch) | Diffusion Policy | Octo (fine-tuned) | OpenVLA (fine-tuned) |
|---|---|---|---|---|
| 10 | 15-25% | 10-20% | 40-50% | 45-55% |
| 25 | 30-40% | 25-35% | 55-65% | 60-70% |
| 50 | 55-65% | 45-55% | 70-78% | 72-80% |
| 100 | 72-82% | 65-75% | 82-88% | 84-90% |
| 200 | 82-90% | 78-86% | 86-92% | 88-94% |
| 500 | 88-93% | 85-92% | 90-95% | 92-96% |
| 1000 | 90-94% | 88-94% | 91-95% | 93-97% |
| 2000+ | 91-95% | 90-95% | 92-96% | 94-97% |
重要な観察: (1) 基礎モデルの微調整 (Octo, OpenVLA) は,前訓練の視覚的および行動的先例が作業特有のデータに限られたことを補償する低デモ数 (10-100) で最大の利点を提供します. (2) 500以上のデモでは,ゼロからモデルがギャップを大幅に縮小し,基礎モデルの利点が2〜5パーセントポイントに縮小します. (3) すべてのアーキテクチャは,分布式パフォーマンスにおける500のデモを超えて,収益が減少していることが示されており,多様性超容量という原則が強化されている. (4) ACTは,分散政策よりも少数のデモで競争力のあるパフォーマンスを達成し,データ限定チームにとってより良い選択となっています.
チーム規模による実践的な勧告
規模を拡大する証拠は 資源に応じて具体的なガイドラインに 翻訳されます
ソロ研究者/趣味者 (予算: <5,000ドル). 基礎モデル (Octo) を使用する. 1 つのタスクで50-100 のデモを収集する. パフォーマンスを最適化するよりもデータ収集パイプラインを学ぶことに集中する.期待結果は:配布条件での成功率7080% 配布中の条件で,OODの3040%です. これは研究プロトタイプまたはデモに十分です. ハードウェア: OpenArm 1 (4,500ドル) または RCSVでレンタルされた.
小型研究ラボ (予算:1万~5万ドル). 対象物10〜20個と2〜3個環境で収集された200〜500個間の示範でOpenVLAまたはOctoを精細調化します. 体系的な評価 (保持物,保持位置) に投資します.期待結果は: 85-92%の配布,50-65%の OOD. これは制御環境のために展開準備ができています. [2,500ドル]の試行進は最初の200のデモをカバーし, [8,000ドル]のキャンペーンでは,多様性プロトコルで500以上のデモをカバーする.
**スタートアップ/企業 (予算:年間5万500,000ドル) ** 継続的なデータ収集インフラストラクチャを構築する. 30以上のオブジェクトと5以上の環境で1つのタスクあたり1,0005,000のデモを収集する.自動再訓練と評価パイプラインを実施する.目標:90-95%の配布,70~80%OOD. この規模では,データ対計算コスト比は,予算の90%のデータ収集と10%の計算を左右するということです.より大きなモデルよりも,収集効率 (よりよい遠隔操作ツール,訓練されたオペレーター,簡素化されたQA) に投資する.
大企業 (予算: >$500,000/年). 標準化されたプロトコルで多サイト収集を確立する.独自のデータプールで多タスク基盤モデルを訓練する.各部署サイトは,データを再集中訓練パイプラインに供給する.この規模では,クロスサイト多様性は,あなたの主要な競争優位となる. 期待された結果: 95%+の配布, 80%+の OOD 展開環境.企業データ収集パートナーシップのために RCSV に連絡してください.
データとスケールモデルをスケールする時
規模化証拠に基づく実用的な決定枠組み:
- ** 広報における成功率は85%未満である場合 (さらに示例) ** 訓練において不足している特定のオブジェクトポジションや方向性においてあなたの方針は失敗する.あなたの任務には複数の実行可能な戦略があり,モードが崩壊している (方針は一つの戦略に収束し,その戦略が適用されない場合,失敗する).
- スケール多様性 (より多くのオブジェクト/環境) 当: 配送における成功率は85%以上だが,OOD性能は50%未満である. 訓練対象に機能的に類似する新型オブジェクトについては,あなたの政策は失敗する.あなたの配備環境は,あなたの訓練環境とは視覚的に異なる.
- スケールモデル (より大きなアーキテクチャ) は: 膨大な多様なデータ (>2,000 件以上のオブジェクトカテゴリー) が表示され,性能が平ら化している.あなたの作業は複雑な空間関係や長方形計画を理解する必要があります.あなたは,ゼロから訓練するのではなく,細かく調整できる,訓練済みの基礎モデル重量にアクセスできます.
- ** 方法を変更する:** 1,000+ の多様なデモにもかかわらず,成功率は <70% に 安定した.あなたのタスクには,視覚政策が画像からのみ学ぶことができない精密な力制御が必要です.あなたのタスクには,複合エラーが支配する>10 の連続ステップがあります.
身体間 規模: どれ程 ロボット が 必要 です か
オープンX-エンボディメントの結果は,追加のロボットタイプからのデータを追加することで,ターゲットロボットにおける一般化が向上すると示しています.しかし,どれだけの実施形態が意味のある利益をもたらすのか?
- **1実施形態:**ベースライン. 単ロボットの専門政策.
- 3-5実施形態: 最も急激な改善領域. 3-5種類の異なるロボット (異なる運動性,異なるグリッパー) のデータを追加することで,目標ロボットにおけるOOD概括を15-25%向上させる.
- **5-10実施形態:**継続的な改善が減少する利回り.
- 10+実施形態: 実施形態ごとに限界改善は小規模 (<2%),しかし累積効果は相当である.現在22実施形態を有するOXEデータセットは,交叉実施形態訓練の強い基盤を提供します.
対象ロボットが1つあるチームにとって,実践的なアドバイスは明確です. OXEやDROIDで訓練された基礎モデル (クロスインボディメント多様性を無料で提供する) を利用し,タスクに特化したデータを細かく調整します. 5以上の異なるロボットプラットフォームにアクセスできなければ,ゼロから独自のクロスインボディメントデータセットを構築することはコスト効率の悪いことではありません.
計算予算の配分:実用的な枠組み
ロボット学習におけるデータと計算コストの極端な比分を考慮すると,チームはデータ収集,計算,エンジニアリング時間との間の総予算を分配するための原則的な方法が必要です.スケーリングの証拠に基づいて,プロジェクト段階によって推奨された割り当てはこちらです.
| Project Phase | Data Collection | Compute (Training) | Engineering / Evaluation | Rationale |
|---|---|---|---|---|
| Prototype (0-50 demos) | 40% | 10% | 50% | Focus on pipeline setup; data collection validates hardware and workflow |
| Development (50-500 demos) | 70% | 10% | 20% | Maximize data diversity; compute costs are negligible relative to collection |
| Production (500-5000 demos) | 60% | 15% | 25% | Larger model fine-tuning justified; evaluation and deployment engineering critical |
| Scale (5000+ demos) | 50% | 20% | 30% | Continuous collection from deployments; multi-task training requires more compute |
統計学部 (英語版) の研究員 (英語版) は,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ収集を中心に,データ処理する技術に,データ処理を中心に,データ処理を中心に,データ処理に,データ処理する技術に,データ処理に,データ処理を中心に,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,データに,
多様性倍数: 多様性のデータ の 価値 を 量化 する
規模調査の最も強力な実用的な発見は多様性倍数です. これは同じ量度の同質データと比較して多様なデータから得られる超大なパフォーマンスです.
標準的なピックアンド・ロークタスクでは,多様性スコアを以下のように定義する: D = (ユニークなオブジェクトの数) x (オブジェクトごとに異なる位置の数) x (照明条件数) x (操作者の数).複数のタスクにおけるRCSV評価では:
- D=200の200のデモ (10つの物体,5つの位置,2つの照明,2つの操作員) は,OODの85%の成功を達成しました.
- D=20 (物体1個,5個,照明2個,操作者2) の200のデモが40%のOOD成功を達成しました.
- D=20の 1000個のデモは 55%のOOD成功を達成しました まだ200個のデモセットの 30点以下です
影響は深刻である. 200 種類のデモは,分散外一般化における 1000 種類の均質デモを上回る.それゆえ,RCSVの収集プロトコルは,多样性目標ではなく,量目標に基づいて構築されている.2,500ドル規模のパイロットパッケージでは,タスク仕様の中で最大多样性に基づいて設計された 200 つのデモを収集しています. D>150の200のデモを対象とした収集キャンペーンは,D<50の500のデモを対象としたキャンペーンよりも一貫してより実装可能な政策を生み出す.
失敗モード解析: なぜ政策は異なるレベルに平坦である
政策の高原を理解するには,学習パイプラインのどの構成要素がボトルネックであるかを診断する必要があります.
| Plateau Signature | In-Dist. Rate | OOD Rate | Root Cause | Intervention |
|---|---|---|---|---|
| Low ceiling | <70% | <30% | Data quality issue (inconsistent demonstrations, high noise) | Audit and clean existing data; retrain operators; tighten QA gates |
| High in-dist, low OOD | >90% | <50% | Diversity bottleneck (overfitting to training distribution) | Add diverse environments and objects; use data augmentation; switch to foundation model |
| Mode collapse | 70-85% | 30-50% | Architecture limitation (BC averaging over multimodal demonstrations) | Switch from BC to Diffusion Policy or ACT; add action chunking |
| 精度(再現性) failures | 80-90% | 60-75% | Observation gap (task requires force/tactile data not in obs space) | Add F/T sensor; add wrist camera for close-up view; use hybrid classical+learned control |
| Long-horizon decay | 85-95% per step | N/A | Compounding error over 10+ steps | Decompose into sub-policies; add hierarchical planning; use DAgger |
| Random failures | 85-92% | 70-80% | Stochastic environment factors (object slip, lighting flicker) | Add retry mechanisms; increase action frequency; use closed-loop control |
診断プロセス: 50 回の評価を実行し,各失敗を分類し,特定の作業段階 (アプローチ,把握,輸送,配置) で失敗が集まるか,または均等に分布されているかどうかを特定します.集まった失敗は,ターゲットデータで解決できる特定のスキルギャップを示します. 均等に分布された故障は,同じタイプのデータが増えても解決できないシステム問題 (データ品質,建築不一致,センサー制限) を示唆します.
実践的なスケーリング実験テンプレート
データを集める大規模なキャンペーンに取り組み始める前に 自分のスケーリング曲線を特徴づけたいチームにとって RCSVがクライアントに対して使用する実験プロトコルです
# Scaling experiment protocol
# Collect demos in batches, train and evaluate after each batch
import json
from pathlib import Path
def run_scaling_experiment(task_name, max_demos=500, batch_size=50):
"""
Protocol:
1. Collect batch_size demos
2. Train policy on cumulative dataset
3. Evaluate on fixed held-out test set (20 episodes)
4. Log results and decide whether to continue
"""
results = []
cumulative_demos = 0
for batch_idx in range(max_demos // batch_size):
cumulative_demos += batch_size
# Train on all demos collected so far
model = train_policy(
dataset_path=f"data/{task_name}",
num_demos=cumulative_demos,
architecture="act", # or "diffusion_policy"
epochs=2000,
)
# Evaluate on fixed test set (same 20 configs every time)
in_dist_rate = evaluate(model, test_set="in_distribution", n=20)
ood_rate = evaluate(model, test_set="out_of_distribution", n=20)
results.append({
"demos": cumulative_demos,
"in_dist": in_dist_rate,
"ood": ood_rate,
"delta_in_dist": in_dist_rate - (results[-1]["in_dist"] if results else 0),
"delta_ood": ood_rate - (results[-1]["ood"] if results else 0),
})
# Stop if both metrics have plateaued (<2% improvement for 2 batches)
if len(results) >= 3:
recent = results[-2:]
if all(r["delta_in_dist"] < 0.02 for r in recent) and \
all(r["delta_ood"] < 0.02 for r in recent):
print(f"Plateau detected at {cumulative_demos} demos")
break
Path(f"results/{task_name}_scaling.json").write_text(json.dumps(results, indent=2))
return results
このプロトコルは通常,特定のタスクのほぼ平原を特定するために 3-5 回収集訓練評価サイクル (150-250 回のデモ) を要求します.主要出力は: (1) 部署グレードの分散性能 (通常85-90%), (2) OOD性能の減少率のポイント,および (3) 瓶頸がデータ量,データ多様性,またはアーキテクチャかどうかです. RCSVはこのプロトコルを 2,500ドルのパイロットエンゲージメントの一環として実行し, 完全な収集キャンペーンにコミットする前にクライアントにデータ駆動したスケーリング曲線を提供します.
多タスクスケーリング:タスク数値がタスクごとにデータ要件に影響を与える方法
最近の研究から得られた重要な反直感的な発見は,複数のタスクに関する政策を同時に訓練することで,タスクごとにデータが必要となる必要性を軽減することがあります.タスクが視覚的または運動的原始性を共有するとき (すべては把握を伴う,すべて同じグリッパーを使用し,すべて同じテーブルで発生する) 作業間の共有学習は,個々のタスクのデータ効率性を向上させる規則化効果をもたらします.
RCSVの多作業訓練から得た経験的観測:
- 1つのタスク,200のデモ: 85%の配信成功.
- ** 5つの関連タスク,それぞれ200のデモ (1,000件合計):** 平均的な配布成功率は88%とOODの62%です. 3ポイントの配布改善と強大なOODパフォーマンスはタスク間移転から"無料"です.
- 5つの関連タスク,それぞれ100回のデモ (合計500件): 平均の84%の配布成功と55%のOOD.
- 5つの関連のない作業,それぞれ200のデモ (1000件合計): 平均の83%の配布成功. 単作業訓練と比較して軽度の劣化,作業は有用な原始的な要素を共有していないため.
原則: 作業が動作原始性の少なくとも50% (同じ作業空間,同じグリッパー,類似のオブジェクト) を共有している場合,言語コンディショニングによる多作業訓練は,タスクごとにデータ要求を30%〜50%削減します. RCSVの多タスク展開のためのデータ収集キャンペーンは,独立単タスクキャンペーンと比較して,合計収集コストを 20-40%削減して,クロスタスク共有原始的なものを最大限に活用するように構成されています.
計算スケーリング: 大きいモデルを訓練する時 vs.より多くのデータを収集する時
ロボット学習は言語モデリングとは異なる計算データトレードオフに直面している.言語モデリングでは,固定データでモデルサイズをスケーリングすることでパフォーマンスは予測可能に向上する.ロボット学習では,データ多様性はほとんどの実用的な作業においてモデルサイズよりも重要であることを示す証拠があります.
| Model Size | Architecture Example | Demos for Peak In-Dist | In-Dist Success | OOD Success | Training Cost |
|---|---|---|---|---|---|
| Small (5-20M params) | ACT (ResNet-18 backbone) | 200-300 | 85-92% | 40-55% | $5-15 |
| Medium (50-200M params) | ACT (DINOv2-B backbone) | 300-500 | 88-94% | 55-70% | $50-200 |
| Large (1-7B params) | OpenVLA (Llama-7B backbone) | 100-200 (fine-tune) | 90-96% | 65-80% | $500-3,000 |
重要な発見:多様なデータを持つ中型モデルは,OOD評価に関するより少ない多様なデータを持つ大型モデルによく匹敵する. 500 種類の異なるデモで訓練されたDINOv2の脊椎を持つ100Mパラメータ ACTは,より少ない150 つのデモで微調整された 7Bパラメータ OpenVLA と比べると,65〜70%のOOD 成功を達成することができます. 広範囲のモデルでは,配分におけるピーク性能が高く,しかし,訓練データの多様性は一般化の主な要因である.
予算配分の基本ルール: プロジェクト予算が X で,70%をデータ収集 (多様性に焦点を当て),20%を計算 (訓練と評価) に,10%をエンジニアリング (パイプライン,統合) に費やす.データ多様性によって計算に過剰投資するチームは,一貫して多様なデータ収集を優先するチームに劣っている.
シミュレーションデータによるスケーリング:シムがどれだけの実際のデータを交換できるのか
模擬データでは安価にスケールができますが 完璧に転送されません. 実用的な問題は,模擬で実際のデータ収集の量をどれだけ抵当できるのかです.
- 視覚多様性: シンはドメインランダム化によって無制限の視覚多様性を提供できます.視覚的一般化のために (新しいオブジェクト,照明,背景) 域ランダム化による10Kのシンエピソードは,実際の500〜1000のエピソードに相当する利点を提供します.これはスケーリングコンテキストにおけるシンデータにとって最も強力な使用例です.
- モーター制御精度: 物理シミュレーションエラーが複合するため,シムデータは精度作業 (sub-mm挿入,変形操作) に不十分転送されます.これらの作業では,シムデータは,相当な実際のデータの0~20%の値を提供します.常に現実の微調整で検証します.
- 実践的なミックス比: 最も効果的なアプローチは,Simデータ (視覚的多様性と粗い行動) の80
90%と,実際のデータ (物理的基礎と精度) の1020%です.このハイブリッドアプローチは,通常,実際のデータ収集コストの2030%で,完全な実際のデータパフォーマンスの8590%に達します. - Sim の返済が減少する: Sim のデータはほとんどのタスクでは10K-50K エピソードで独自の平原を示しています. 50K の sim エピソードを超えて, Sim の追加データは軽視する改善をもたらします - 瓶頸は sim からリアル ギャップに移動します. データ 容量ではなく. より多くのエピソードよりもより良いドメイン ランダム化に投資します.
RCSVは, [データサービス] (
オープン 疑問 と まだ わからない こと
ロボット学習のスケーリングに関するいくつかの重要な質問は2026年にまだ回答されていない. 連続的なデータ収集 (ロールデプロイ +定期的な再訓練) がオフラインバッチトレーニングと同じスケーリング曲線に従っているかどうかは不明. 異動型データ (人間操作のビデオ,シミュレーション示例,言語説明) が実際のロボットデータと同じスケーリング効果を提供しているかどうかについては積極的に議論されており,初期証拠は視覚表現に役立つが,正確なモーター制御には役立つことを示唆しています.
データ収集速度:どのくらいの速度でスケールできるのか
予算の適切な配分でも データ収集速度は物理的な現実によって制限されます. これらの制限を理解することで チームは現実的なタイムラインを設定できます.
| Configuration | Demos/Hour | Demos/Day (8hr) | Time to 500 Demos |
|---|---|---|---|
| 1 arm, simple pick-place, expert operator | 60-120 | 400-800 | 1 day |
| 1 arm, multi-step assembly, expert | 15-30 | 100-200 | 3-5 days |
| Bimanual (ALOHA), simple task | 30-60 | 200-400 | 2 days |
| Bimanual, complex task, novice operator | 8-15 | 50-100 | 5-10 days |
| Remote teleop (100ms+ latency) | 10-30 | 80-200 | 3-6 days |
並行: データ収集をスケールする最も速い方法は,複数のロボットステーションを同時に実行することです.各追加ステーションは近線性通量増加 (調整オーバーヘッドは10%〜15%減) を提供します.RCSVは大規模なキャンペーンでは4-8つの収集ステーションを並行して運営し,簡単なタスクのために,1日1,000〜2,000以上のデモを達成します. 追加駅のコストはキャンペーンごとに減額され,並行収集は単一の駅を長時間運営するよりもコスト効率的です.
これらの料金では,ハードウェアの問題のない成熟した収集パイプラインを想定します.最初のセットアップの場合,オペレーターとパイプラインがデバッグされる間,最初の週間に吞吐量期待を50%削減します.RCSVの施設は,複数のタスクカテゴリーで500時間以上のテレオペレーション経験があるため,一貫して"専門家オペレーター"の割合を達成します.
プレートウの問題: データの増殖が 役に立たないとき
チーム全員が 最終的に 性能のレベルに達し デモを追加することで 軽い改善が得られます レベルに達したときに認識し データ品質や多様性が瓶頸になっている場合を 認識することは 無駄な収集努力を避けるのに不可欠です
実質的な高原にたどり着いた兆候: 過去3回の収集訓練サイクルで成功率は+/- 2% の範囲内でした. 体系的な多様性変数による200回の示例を追加することで,OODのパフォーマンスは改善されませんでした. 検証損失は平坦化しており,より多くの訓練期間とともに減少しません.
多様性高原と多量高原を区別する: 最も一般的な誤りは多量高原を多量高原と解釈することです.あなたが打ち負かすものをテストするには:最大多量 (新しい物体,新しい位置,新しい照明) の50個の追加デモを収集し,既存のデータと同じ多量プロファイルを持つ50個の追加デモと比較して政策改善を比較します. 異なるパッチが性能を向上させ,統一パッチが改善しない場合,多様性の問題がある.どちらも性能を向上させない場合,実際の量高原に達し,建築の変更を検討すべきです.
** Plateau が 人工 (固定) の兆候:** 配分 性能 は 強い (>90%) が OOD 性能 は 弱い (<50%) - これは 多様性 の 瓶頸 を 示す こと です.データ 量 の 瓶頸 を 示す こと は ない.故障 は 特定の 条件 に 集中 し て いる (一つの 物体 タイプ,ひとつの 作業 空間 の 地域) - その 条件 に 対象 的 な データ 収集 が 助け に なり ます. 政策はモード平均 (戦略間の猶予) - 建築上の変更 (BCから拡散政策への切り替え) またはデータ浄化により多くのデータに役立つことを示しています
真の高原にたどり着く際には,選択肢は: (1) 交体体予備訓練を伴う基礎モデルに移行し,ゼロから高原を新基線とする; (2) 政策が既存の観測から抽出できない情報を提供する方法を追加する (F/T感知,深度) または (3) 任務を子政策に分割し,それぞれが全作業高原を過ぎて独立した改善できる.
実践的なチェックポイント: データを収集する時を止める
チームに最もよく聞かれる質問の一つは"何度デモが必要か"です 誠実な答えは,あなたの任務と目標の成功率に依存します.
- **50 デモ:**パイプライン検証チェックポイント.ポリシーを練り,20回の試験を評価する.成功率が30%未満であれば,データ量問題ではなくパイプラインバグ (データフォーマット,アクション正常化,カメラ校正) が起こる可能性があります.より多くのデータを収集する前にパイプラインを修正します.
- **100 デモ:**可行性チェックポイント. 配送における成功率の50%以上を達成した場合,現在のアーキテクチャとデータ品質によって作業が学習可能である. デバッグ後に50%未満であれば,作業に追加的な方法 (F/Tセンサー,深度) または別のアルゴリズムが必要かどうかを検討してください.
- 200デモ: 多様性チェックポイント. 持っていた物体/ポジションで評価する. 配送成功率が80%以上だが,OOD成功率は40%未満なら,問題は多様性ではなく,量です. 同じ量の多様性を集めるよりも,次の100デモの多様性を増加させる.
- 500 デモ: チェックポイントの返却が減少する. L2 の作業で単作業 BC の場合,ほとんどのチームは 300~500 デモの成績より 3% 未満の改善を目にします. 500 デモで目標の成功率に達していない場合,ボトルネックスはデータ量よりも建築的な可能性があります.
- 1,000+ デモ: L3/L4 の作業 (複雑な組み立て,多段階の順序) や 多作業訓練でのみ正当化される. デモの総数は5〜10 の作業に分割される. 200 のパッチで収集し,パッチ間で評価して廃棄を避ける.
おそらく最も重要なことは,50万回のデモでDROIDの高原が現在の建築の基本上限を反映するか,テストされた特定のモデル (ACT,拡散政策) の制限,またはデータセットの多様性プロフィルのアーティファクトが反映されているかどうかは不明である.より大きな多様性のあるより大きなデータセットは,この高原をさらに押し上げることができる. 代替的に,現在のスケーリング天井を突破するために建築革新 (より良いアクション表示,改善された時間モデリング,または力・トルクデータのより効果的な利用) が求められる可能性があります.
RCSV [データプラットフォーム]
関連 読書
- [オープンX-エンボディメント: ロボットデータセット すべてを変えた]
- [一般化課題:なぜロボット政策は2026年に失敗する]
- [ロボット学習: 演示分析の費用]
- [ロボット学習ビデオ:2026年の最新技術]
- [ACT vs. Diffusion Policy: いつどれを使えばいいか]
- [RCSVデータ収集サービス]
多様で高品質なデータセットを 作る
RCSVのデータ収集サービスは多様性を最大限に高めるために構成されています.
[データサービスを探求]







