一般化 課題: 2026 年 に ロボット 政策 が まだ 失敗 し て いる の は なぜ です か
ロボット政策が一般化できない理由を深入に技術的に処理する:分布シフト,災害的な忘却,構成性障害,2026年の実践的な緩和戦略
[←ブログ]
訓練対象に95%の成功を達成する政策は,新しい対象に完全に失敗する可能性があります.この記事は,なぜ,そしてその分野がそれについて何をしているのかを深く技術的に説明します.
一般化戦略の詳細については, [ロボット政策一般化:なぜロボットが新しいオブジェクトで失敗する] (
問題 の 規模
汎用化失敗は,ロボット学習研究デモと生産部署の間の最大のギャップである. 5つの赤いカップを使用した300回の"カップを拾い上げ"の示例で訓練された操作策は,それらのカップで92%の成功を達成する.透明なガラス,金属熱水器,または紙カップで同じ方針を提示すると,成功率は10-30%に低下する. これは仮説的なシナリオではなく,ACT,拡散政策,OpenVLAを含む,これまでにテストされたすべての主要な政策アーキテクチャのドキュメントベースライン行動です.
基準値から見たよりも問題がある.ほとんどの公開された評価では,狭い帯の範囲内で一般化をテストする.同じオブジェクトカテゴリーで異なる色,同じテーブルで異なる位置,同じ部屋で異なる照明.現実の世界部署は,これらのすべての軸を同時に一般化し,故障モードが複合する. 新しい色と新しい位置を別々にうまく扱う政策は,新しい位置で新しい色を組み合わせることに失敗する可能性があります. 代表はこれらの次元を独立した要素として理解し得ていないからです.
配分シフト:基本メカニズム
計算レベルでは,一般化失敗は分布シフト問題である. ポリシーは,訓練分布 P_train への損失を最小限に抑えるために訓練された関数近似である. 展開時に,ポリシーは異なる分布 P_deploy から抽出された観測と遭遇する. P_train と P_deploy の間の重複が関連性次元において小さい場合,政策の出力はインターポレーションではなく,外出であり,神経ネットワークは信頼性が低い外出である.
ロボット学習における分布の変化は,コンピュータビジョン分類よりも厳しく,時間が経つにつれて結果が複合する.ビデオのフレームを誤って識別する分類器にはローカルエラーがあります. 誤った観測を誤った識別するポリシーは誤った行動を発生させ,次の観測を変化させ,訓練分布からさらに遠く離れ,カスタダリング失敗を引き起こす.この複合エラー動態は,小さな分布シフトでさえ,完全な任務失敗を引き起こす可能性があります.
ロボット操作における分布の変化を促すのは3つの特定のメカニズムである.
- 視覚分布シフト: 新たに登場するオブジェクト (色,質感,透明性,反射性) は,エンコーダーが見ていない視覚的特徴を生成します.最も危険なケースは,透明で反射的なオブジェクトであり,ほとんどのトレーニングデータセットを支配する不透明でマットなオブジェクトと根本的に異なるピクセルパターンを生成します. 透明な物体でも深度センサーが失敗し,一部の政策が頼る深度ベースの落とし穴を排除します
- ** ジオメトリック分布シフト:** ニューオブジェクト形は,ポリシーは学んでいない異なる把握設定を必要とします. 円筒形カップで訓練されたポリシーは,円筒形ボックスで提示されたときに円筒に適した接近ベクトルを生成することができます. 訓練データでは円筒形幾何学と密接に結びついている把握戦略を学んでしまったため.
- ダイナミック分布シフト: 操作中に新物体質量,摩擦系数,およびコンプライアンスが接触動力を変えます.硬いプラスチック物体で訓練された政策は,硬いプラスチックのために校正された握力を生成します.軟泡の物体を提示し,政策はそれを粉砕します (過度の力) またはそれを落とします (不十分な摩擦). この変化は視覚レベルでは見えません 視覚データ増強だけでは解決できません
継続 的 な 学習 に よっ て 失敗 的 な 忘却
一般化失敗に対する自然な反応は,より多くのデータを収集し再訓練することである.しかし,天才的な再訓練は,第二の失敗モードを導入する:災害的な忘れる.新しいオブジェクトカテゴリーにポリシーが細かく調整された場合,旧データが再訓練セットに混ざらない限り,以前にマスターされたカテゴリーでのパフォーマンスを失います. 基本的な原因は 新しいデータに最適化する 神経ネットワークパラメータの更新が 古い機能をコードした表現を 重複するということです
機械学習では,災害的な忘却は特に危険である.データ収集は高価であり,訓練・部署・再訓練サイクルは遅い. 透明な物体に関する政策の失敗を発見するチーム. 彼らは透明な物体と再訓練によるデモを2週間かけて収集する. この政策は現在透明なオブジェクトを扱うが,以前はマスターしていた不透明なオブジェクトの15%を劣化している.彼らは古いデータを追加して再訓練する.しかし,現在モデルはより多くの容量またはより慎重な学習速度スケジュールが必要である. サイクルは,部署で発見された新しい故障モードごとに繰り返されます.
現在,緩和策は,経験再現 (再訓練中に古いデータと新しいデータを混ぜること),弾力的な重量整合 (旧作業に重要なパラメータの変更を罰金にする) と進歩的な神経ネットワーク (新しい作業に新しいネットワーク容量を割り当てること) を含む.これらのいずれも完全に問題を解決する. 2026年に最も実践的なアプローチは,包括的なデータプールを維持し,定期的にゼロから再訓練し,信頼性の高い多カテゴリーパフォーマンスと代引きで計算コストを受け入れることです.
構成性:最も難しい一般化
構成概要は,熟知要素の新組み合わせを実行することを意味します. "テーブル左側からカップを拾い上げ"と"テーブル右側から碗を拾い上げ"を訓練した政策は",テーブル右側からカップを拾い上げ"を扱うべきです. これは,オブジェクトのアイデンティティと空間位置に関する独立した表現を学んでほしいという政策であり,それらを絡み合える全体的な表現ではなく,
機械のポリシーは,実際には,多くのロボットが絡み合った表現を学ぶ.それらは"何"と"どこで"を別々に表現するのではなく,単一のパターンとして"左の位置にある赤杯"を組み合わせた表現を学ぶ.これは,構成概括は,通常,可能な要素組み合わせの組み合わせ空間をカバーするために指数的により多くのトレーニングデータを必要とすることを意味します. 明らかに要素化表示なしの構成概括を達成するには,すべての150の組み合わせの重要な部分をカバーする示範が必要となる.
言語条件のポリシー (VLA) は,言語指示が,ポリシーが従うことを学ぶことができる構成構造を提供するため,部分的な緩和を提供します. "赤いカップを拾い上げ"と"青い碗を拾い上げ"は動詞と文法構造を共有し,オブジェクトアイデンティティがアクションから分離した変数であることをモデルに学ぶことを奨励します. しかし,VLAにおける構成概要は,アクションシーケンスが特定のオブジェクト幾何学に依存する正確な操作作業のために脆弱なままである.
一般化ギャップを測定する:厳格なプロトコル
概括は各軸に沿って明示的におよび別々に評価されなければならない.単一の"概括"番号を報告することは,何が変化し,何が恒常であったかを指定せずに意味がない.
| 汎化 Axis | Test Protocol | Typical Gap (2026) |
|---|---|---|
| Novel objects (same category) | 10 held-out objects, same task setup | 15-40% drop |
| Novel positions | Uniform random across full workspace | 10-25% drop |
| Novel backgrounds/lighting | Different room, table surface, ambient light | 25-50% drop |
| Novel object category | Different object type, same task verb | 40-70% drop |
| Compositional (object + position) | New combination of seen object and seen position | 20-45% drop |
実際 に 役立つもの: 影響 に よっ て 順番
公開されたアブラーションとRCSVの独自の評価データから導入された政策に基づいて,配布外の一般化への影響によって排列された介入はこちらです.
- 訓練データにおけるオブジェクト多様性 (最も高い影響). 作業カテゴリーごとに15以上の真に異なるオブジェクトを訓練することで,一貫して最大の一般化改善がもたらされます.同じカップの15色の変異ではなく,異なる形,材料,サイズ,視覚的性質を持つ15種類のオブジェクトです. 合計の2
5パーセントポイントを減らし,回帰が減少する2530個まで増やします.これは最も高価で最も効果的介入です. - 前訓練の視覚エンコーダー. DINOv2 または SigLIP をゼロから訓練する代わりに視覚の脊髄として使用すると,すでに何千ものオブジェクトカテゴリーに一般化されている視覚機能が提供されます.これらのエンコーダーを操作データで細かく調整し,幅広い表示を維持すると,新しいオブジェクトでゼロからエンコーダーを10~20%に一貫して上回ります.
- **攻撃的な視覚拡張.**ランダムな色の振動 (hue +/-0.4),ランダムな作物 (85
100%の画像面積,元のサイズに変更),ランダムな明るさとコントラスト,訓練中に適用されるガウスス模糊.これらの拡張は無料 (追加データ収集コストはありません) そして,新型オブジェクトと新型環境評価に一貫して815%の改善を提供します. 物質の多様性を置き換えることはなく,強力な補足である. - 言語条件付け. 作業 IDではなくタスク説明 ("コンテナを拾い上げ") のポリシーを条件付けすることで,モデルは視覚パターンではなく,意味的な意味での行動に迫られる.これはオブジェクトカテゴリー概要や正確な幾何概要に最も役立つ.
- 訓練データにおける位置多様性. 方向性を含む各方向で40cm以上の範囲で物体のスタート位置が異なる.コストは中等 (同じ物体,各エピソードで異なる配置) で,位置概括に影響は大きく,通常15~25%の改善です.
- 多環境データ収集. 3つ以上の異なる物理環境 (異なるテーブル,背景,照明) で示例を収集することは,視覚分布の変化に対する主要な防御である.これは物体多様性よりも物流的に困難である.
一般化ギャップの数学的な公式
一般化差は,分布内と出行外の予想損失の差として形式化することができる. L(pi,D) は,分布上の政策 pi の予想される作業損失を表示する. 一般化差は G = L(pi,D_deploy) - L(pi,D_train. 訓練された政策では,L(pi,D_train) は小さい (訓練対象で高い成功率). 展開が D_列車から離れていると G がどのくらい大きくなるか
経験的には,GはD_rainとD_deployの間の分布距離でスケールする.しかし,関係は非常に非線形である.小さなシフト (同じオブジェクトカテゴリー,異なる色) はGの515%を生成する.中程度のシフト (同じカテゴリー,異なる形) はGの2040%を生成する.大きなシフト (異なるカテゴリー,同じタスク動詞) はGの40~70%を生成する. 重要なことは,Gは崖の振る舞いを示し,性能は分布距離の限界まで滑らかに低下し,その後急に崩壊する.この崖の効果は,通常,精密な操縦作業のために訓練分布から約10cmの位置の偏移で,捉え作業のために約20〜30度の方向性偏移で観測される.
崖効果には機械的な説明があります. 政策の視覚エンコードは,訓練観測の空間周波数に調節された受容フィールドパターンを学習します. 対象が十分に遠く移動すると,関連する機能が学習された受容フィールドアクティベーションの外に落ちると,エンコードの出力は,ポリシーヘッドがトレーニング信号を持たない機能空間の領域に入ります.予測されたアクションは基本的にランダムになります. これは徐々に劣化ではなく,段階的な移行です.
基礎モデルと蒸留:現在の状態
ロボティクスのための基礎モデル (Octo, OpenVLA, pi0, RT-2-X) は,さまざまなデータで事前訓練された視覚的および意味的表現を提供することによって一般化に対処する.実用的な問題は,どの程度一般化改善を提供するか,どの費用にも関する.
ゼロショット一般化: 基礎モデルは既知のカテゴリー内の新しいオブジェクトで,タスク特有の微調整なしで2540%の成功率を達成し,ゼロからの政策では515%と比べて.これは意味のある改善だが,ほとんどのアプリケーションでは導入準備はまだ遠い.
**50100つのタスク特有のデモでは,精細な基礎モデルは,通常300500回のデモで訓練されたゼロから策略に一致するまたは超えます.サンプル効率の向上は3~5倍になり,直接データ収集コストが削減されます.
蒸留方法: 知識蒸留は,大規模な基礎モデルから,より小さな展開準備ができているモデルまで,活発な領域です.標準的なアプローチは:大きなモデル (OpenVLA 7Bパラメータ) を使用して,大きな未ラベルデータセットのためのアクションラベルを作成し,この偽ラベルデータに基づいてコンパクトな学生モデル (50-200Mパラメータ) を訓練します. 蒸留された学生は通常教師の概括性能の8090%を 1050倍低減の推理コストで保持します これは端末ハードウェアに展開を可能にし 蒸留された政策はジェットソン・オリンで20Hzで実行されます 教師モデルには A100 GPUが必要です
基礎モデルベースの一般化における限界:視覚的および意味的一般化 (異なったものが同じ機能する新しい物体) に最も良い機能があり,幾何学的および動力的な一般化 (根本的に異なる操作戦略を必要とする新しい物体) に最も悪い機能があります. 1,000 異なるカップを見た基礎モデルは, 1,001 番目のカップによく一般化します. 滑りやすい形形形形のある物体の操作戦略は 硬いコンテナの戦略とは根本的に異なるため 訓練前のデータにおける視覚的多様性は その違いを教えてくれません
崖 の 効果: 経験 的 な 証拠
崖っぷち効果 - 政策のパフォーマンスは すぐさま 限界まで低下し 急に崩壊する - は 多様な設定で 量的に記録されています. その限界を理解することで チームは 部署に対する現実的な期待を設定できます.
| Perturbation Type | Graceful Degradation Range | Cliff Threshold | Post-Cliff Performance |
|---|---|---|---|
| Object position offset (tabletop pick) | 0-8 cm: 85-92% success | ~10 cm from training centroid | < 20% success |
| Object orientation (grasp tasks) | 0-15 deg: 80-90% | ~25-30 deg from training orientations | < 25% success |
| Camera displacement | 0-3 cm: 75-90% | ~5 cm from calibrated position | < 30% success |
| Lighting intensity change | +/- 30% lux: 80-90% | +/- 60% lux change | < 40% success |
| Background scene change | Minor changes: 85-90% | Complete scene change (new room) | < 35% success |
| Object mass change (pour/place) | +/- 50g: 80-90% | +/- 200g from training objects | < 30% success |
これらの限界値は,政策構造と訓練データ多様性によって差異する近似であり,より多様なデータに基づいて訓練された政策は,より広い優雅な劣化範囲と高い崖の限界を示しています. 部署計画における重要な洞察:部署環境における潜在的な乱乱範囲を特定し,その範囲の少なくとも120%を訓練データに覆うことを確認し,限界値を超えたパフォーマンスを維持します.
SOTA一般化ランキング表 (2026年4月)
下記の表は標準化評価プロトコルに関する主要な政策構造における最もよく報告された一般化結果をまとめています.結果は,出版された論文や再評価から得られます.すべての数字は,実施されたテスト条件での成功率です.
| Model | Novel Objects (same cat.) | Novel Positions | Novel Environment | Training Demos |
|---|---|---|---|---|
| ACT (from scratch) | 52% | 68% | 35% | 200 |
| ACT + DINOv2 backbone | 67% | 75% | 52% | 200 |
| Diffusion Policy | 58% | 72% | 40% | 300 |
| Octo (zero-shot) | 35% | 42% | 28% | 0 (pre-trained) |
| Octo (fine-tuned, 100 demos) | 68% | 76% | 55% | 100 |
| OpenVLA (fine-tuned, 100 demos) | 72% | 78% | 58% | 100 |
| pi0 (fine-tuned, 50 demos) | 75% | 80% | 60% | 50 |
| RoboAgent (diverse data) | 82% | 85% | 62% | 800 (diverse) |
重要なポイントは: (1) 基礎モデルの細かな調整は,デモの35倍も少ないデモの35倍に比べられる一般化を実現する. (2) データの多様性 (ロボエージェント) は,デモごとに測定されたモデル規模を上回る. (3) 標準化された評価では,標準化された評価では,方法が62%を超えないため,新しい環境の一般化はすべてのアーキテクチャにとって最も難しい軸であり続けています. (4) 基礎モデルの骨組み + 多様な細かな調整データ (pi0 + ターゲット収集) の組み合わせは,現在の実用的な最適を表しています.
チーム規模による 効果的な 緩和策
適切な緩和策は チームの資源に依存します 規模別で実行可能な勧告です
ソロ研究者 / 1-2 人組. 発足点として基礎モデル (Octoまたは OpenVLA) を使用する.少なくとも10個異なるオブジェクトと3つ以上の照明条件で,特定の課題に関する50〜100個多様なデモを収集する.攻撃的な視覚拡張 (色の振動,ランダム作物,ガウス模糊) を適用する.期待される一般化:同じカテゴリーの新型オブジェクトで60〜70% 予算: 2,000~5,000ドル 計算+データ収集時間
小型研究室 / 3-10 人組. 15 以上の物体, 3 以上の環境,および言語指導ラベルで収集された200-500 以上の示範で基礎モデルを細かく調整する.各軸に沿って実行されたテストセットで体系的な評価を実施する.特定の故障モードをターゲットにするためにDAgger型データ収集を使用する.新物体では予想される一般化: 70-80% 予算:ハードウェア時間と計算を含む1万~3万ドル.RCSVの [2,500ドルパイロット]
企業/生産チーム. 連続的なデータ収集パイプラインを構築する. 対象カテゴリーにわたる多様なオブジェクトライブラリ (50+オブジェクト) を維持する. 実験室設定だけでなく生産環境で収集する. 新しいデータが蓄積するにつれて週刊または毎月再訓練する. 各モデルバージョンで実行される自動評価セットを実装する. 目標:部署関連条件で85%+一般化. 予算:データ運用に年間5万~200万米ドル.RCSVの [8,000米ドルキャンペーン]
一般化に関する評価プロトコルは
厳格な一般化評価には各軸に沿って構造化されたテストセットが必要.以下のプロトコルが少なくとも推奨される:
- 分割プロトコル: 作業場での位置の20%を,訓練で使用しないままにテスト対象として預けます. 作業場での位置の20%を,テスト対象として預けます. 最強の一般化テストのために,テスト対象の横産物について評価します.
- **最低試験数:**統計的意義を達成するために,試験条件ごとに少なくとも20回の試験を実行する. 95% の信頼間隔 (バイノミアル比例のためのウィルソンスコア間隔) で成功率を報告する.80% の成功率を持つ20回の評価では, 95% の CI が [56%, 94%] - 十分な幅で,方法間の単桁の差が意味がない.
- システム的な乱射: ランダムな進行中の評価の向こう側では,個々の特定の乱射軸をテストする. カメラを訓練位置から5cm移動する.テーブル表面を変更する (テーブル布を追加する,色を変更する);背景を変更する (作業場の後ろの物体を追加/削除する);照明を変更する (LEDに
光灯,窓光源を追加/削除する). これは政策が最も敏感な障害を明らかにし,標的型データ収集を指針します. - 各軸ごとに結果を報告する: 概括結果を単数にまとめてはいけません. 概括対象の成功,概括位置の成功,概括環境の成功,概括成功を別々に報告する. 90%の概括対象の概括と30%の概括対象の政策は,位置の多様性ではなく,対象の多様性が必要である.
2026 年 の 境界: 改善 し て いる こと や 改善 し て い ない こと
ロボティクスのための基礎モデル (Octo, OpenVLA, pi0) は,熟知カテゴリー内の新しいオブジェクトへのゼロショット通用化を継続的に改善しています.新型オブジェクト評価に関する細かな基礎モデルとゼロから政策の間のギャップは,2024年に約15%から2026年に25-30%に拡大しました. つまり,基礎モデルは通用基準を前進させています.
素早く改善していないのは:精密な幾何学的概括 (異なる捉え方策を必要とする真に新しいオブジェクト形を扱う),動力的な概括 (新しい物理特性を持つオブジェクトを扱う),および多段階的な構成概括 (熟練したスキルの新しいシーケンスを実行する). これらの問題はデータスケールとモデルスケールのまだ解決していない難しい問題です.
RCSVの [データ収集サービス] (
関連 読書
- [ロボット政策一般化:なぜロボットが新しい物体で失敗する]
- [ロボット学習のスケーリング法:2026年我々が知っていること]
- [ロボットのための模倣学習:デモから部署まで]
- [オープンX体: ロボットデータセット すべてを変えた]
- [ACT vs. Diffusion Policy: いつどれを使えばいいのか]
- [RCSVデータ収集サービス]
一般化のために設計されたデータ収集
RCSVは,さまざまなオブジェクト,多様な環境,および実行されたテストセットで体系的な評価を通じて,政策の概括を最大限にするためにデータ収集を構成します.
[データサービスを探求]







