ロボット政策一般化:なぜ難しいのか? 2026年に何がうまくいくのか
ロボット政策が一般化できない理由:分布シフトの種類, データ増強から基礎モデルへの解決策, 2026年に実際に一般化されるもの,そしてそれを測定する方法
訓練対象の 90%の成功率です 新しいカップを導入して 照明を交換し テーブルを左に6インチ移動して 性能が30%に低下します これは一般化の問題です 実験室でのロボット学習と現実の世界でのロボット学習の間の 核心課題です
一般化 は 実際 に 意味 する こと
ロボット・ポリシーは,トレーニングデータに含まれていない条件で作業を成功に実行すると一般化します.これは,特定の視覚入力に結びついている特定の動きのシーケンスを再現するポリシーであるメモリと根本的に異なります. 汎用的な政策は 作業概念を学びました 容器を取り上げて液体を注ぎ 釘を挿入し その概念を 対象外観 位置 照明 作業構成の違いにも 応用できます
一般化は二次性ではない.それはスペクトル上に存在し,一般化の異なる軸は異なる困難を呈している.ある政策はオブジェクトの色 (簡単) でよく一般化するが,オブジェクトの形 (ハード) で失敗する.それはトレーニングワークスペース内の新しいポジションを扱うかもしれない (中等),しかし,新しい部屋 (非常に難しい). 展開シナリオにどの概要軸が重要かを理解することは,それらの分野に対応するデータ収集戦略を設計するための最初のステップです.
配分シフトの種類
視覚的配分シフトは,部署環境の視覚的な外観が訓練とは異なる場合が発生します. これは照明 (温かい空頭と涼しい日光と混合物) の変化,オブジェクトの外観 (異なる品牌のカップ,異なる色,異なる材料反射性),背景乱雑 (クリーンな作業スペースと混雑したデスクトップ) とカメラの特性 (位置,露出,ホワイトバランスのわずかな違い) を含む. 視覚シフトはビジョンベースの政策における一般化失敗の最も一般的な原因であり,データサイドソリューションに最も適応するものです.
物理的な分布変化は,物体や環境の物理的性質が訓練とは異なる場合が発生します.硬いプラスチックカップで訓練された政策は,握りの動力が異なるため,柔らかい紙カップで失敗する可能性があります.滑らかなテーブル表面で訓練された政策は,摩擦系数が変化するため,テクスチャのあるテーブルカバーで失敗する可能性があります. 物理的な変化を データの増幅だけで解決することは 難しくなります なぜなら 政策は 異なる物理的戦略を学ぶ必要があるからです 単に異なる視覚パターンを認識するだけでなく
タスクの変異は,タスクの目標や構造が変化するときに発生する.特定のターゲット場所にオブジェクトを配置するために訓練されたポリシーは,言語またはジェスチャーによって指定された任意の場所にオブジェクトを配置することに一般化できない.単一のオブジェクトのピックアンドプレイスに訓練されたポリシーは,シーケンシング決定を必要とする複数のオブジェクトのシーンを処理するように要求されたときに失敗する. 作業変異は一般化の最も難しい形態であり,通常は言語条件定制または明示的な作業分解アーキテクチャを必要とします.
効果 的 な 解決策: データ の 側 の 方法
** 意図的なデータセット多様化**は,概括を改善するための最も信頼できるアプローチです.オブジェクト多様性のために,各対象オブジェクトカテゴリーの少なくとも10〜20個異なる例,異なるサイズ,色,材料,ブランドを含むデモを収集します.位置多様性のために,30〜40cm格里でスタートポジションを変化させ,異なるオブジェクト指向を含む. 環境多様性のために,収集セッションの間,照明条件 (少なくとも3つの異なる設定),テーブル表面および背景混乱レベルを変更してください.
データ拡張は合成生成した変異で実際の多様性を補完します.標準的な視覚拡張 - 色の振動,ランダム作物,明るさとコントラストの変異,ガウス模糊 - 照明とカメラの変異に対する強度を改善します. 生成型モデルを使用して新しいテクスチャをオブジェクトに貼り付けたり背景を変更したりするより高度な拡張は,追加の示例を収集せずにデータセットの効果的な多様性を拡張することができます.しかし,拡張はオブジェクト幾何学,把握戦略,物理動力学の多様性を置き換えることはできません. 視覚多様性を拡大するために拡張を使用し,多様な物体で収集を避けるのではなく
ドメインランダム化は,データ多様化のシミュレーション側アナログである. [sim-to-real training] (T2
効果 的 な 解決策: 建築 的 な 方法
言語条件付けは,自然言語の指示を入力として受け入れることで,タスクの変異を一般化するポリシーを可能にします. "赤いカップを拾い"と "青い碗を拾い"を訓練した言語条件の政策は 普段は"緑のボトルを拾い"に 概括できます 訓練中に緑のボトルが 見られていなかったとしても 視覚言語の基礎は 何を探すべきか 意義ある理解を 提供します [RT-2,OpenVLA,Octo]
基礎モデルの背骨は,インターネット規模データで訓練された視覚的および意味的表現を提供し,どのロボットデータセットよりもはるかに多くの視覚的な知識へのアクセスが政策に与えられます. 政策の骨組みとして [ビデオ訓練の先駆け視覚エンコード] (R3M, SPA, DINOv2) または訓練の先駆け視覚言語モデル (CLIP, SigLIP) を利用することで,骨組みは既に数千のオブジェクトカテゴリーを認識することを学んでおり,新しいオブジェクトへの一般化を一貫して改善します.
拡散政策アーキテクチャは,行動分布を否定する拡散プロセスとしてモデル化し,自然に多型行動分布を処理する - 同じ観察が複数の有効な行動につながることができます.この建築選択は,政策が単一の行動戦略にコミットする必要がないため,一般化を改善します. 拡散政策は,複数の把握戦略が有効である課題について特に強い一般化を示しています.
実際 に よく 概括 する こと (そして 概括 する こと)
移動はよく一般化します. 歩行,走行,粗野地交差政策は,表面型,斜面,および小規模な地形変動を信頼に適して転送します.これは,移動は,細粒度な視覚知覚ではなく,主に動力 (関節トルク,地面反応力) に依存し,環境全体において動力は非常に一貫しているからです. ドメインランダム化によるシミュレーションに訓練された脚の移動方針は,実際のハードウェアでほぼシミュレーション性能を達成します.
基本的な把握は適度によく一般化します. 明確な把握能力 (カップ,ボックス,ツール) の固い物体 (グラフ,ボックス,ツール) のピックアンドプレイスポリシーは,訓練されたカテゴリー内の新しい物体インスタンスを一般化することができます. 特に基礎モデルの脊椎骨を使う場合. 訓練における 対象の多様性が十分である. クラスごとに10回以上は,一般化が信頼性のある実践的な限界です.
外部の操作は一般化が不十分である. 指の位置を正確に配置し,手中に再方向化したり,接触に富んだ相互作用 (穴内ピッグ,コネクタの配合,細かい制御によるツール使用) を要求する作業は,一般化することは困難である.これらの作業は,物体幾何学ごとに大きく異なる正確な物理相互作用に依存し,小さなエラーが急速に複合する. 精巧な操作政策は,通常,部署の正確な物体と環境条件を特定する作業の示範を必要とする.
**長視線作業は不良に一般化します.**多くの連続段階からなる作業は複合概括エラーを伴う - ステップごとに失敗確率は5%で10ステップで作業失敗40%につながります.長視線概括には,作業を独立した概括するサブポリシーの分解または個々のステップ失敗から回復できる計画レベルの抽象を使用する必要があります.
一般化 を 測定 する: 正しく する
一般化は,分布内のパフォーマンスから推論せず,構造化評価プロトコルを通じて明示的に測定されるべきである.標準アプローチでは,実行されたテストセットを使用する.
- ** 持ち出た物:** 訓練中に使わない各カテゴリーに 5-10 件もの物例を預けます.これらの物体は,部署で期待する視覚的および幾何学的変化範囲を覆う必要があります.
- ** 作業場の端にある位置や訓練で希少だった方向を含む訓練配分に含まれていない物体スタート位置を評価する.
- ** 訓練環境とは異なる物理的な設定で評価してください - 異なるテーブル,異なる照明,異なる背景.
配送中および配送中での成功率を別々に報告する. 85%の配送中でも 40%の配送中でも達成する政策は,概括を制限し,より多様なトレーニングデータやより強力なバックボーンを必要とする. 80%の配送中でも70%の配送中でも達成する政策は,強い概括を備えているため,展開可能である.
訓練と同じ分布からランダムなエピソードを展開することで一般化評価の一般的な誤りを避ける.これは一般化ではなく,インターポレーションを測定する.真の一般化テストは,導入時に政策が処理したい要素を体系的に変化させる必要がある.
一般化分類:四つの軸
ロボット学習における一般化は単一の能力ではありません. 各軸は4つの異なる難度レベルと異なるデータ要件を持つ.
| Axis | What Varies | Difficulty | Primary Mitigation |
|---|---|---|---|
| Object generalization | Color, shape, size, material within a category | Moderate | 15+ diverse object instances in training |
| Scene generalization | Lighting, background, table surface, camera angle | Moderate-Hard | 3+ environments + aggressive augmentation |
| Task generalization | Novel task instructions, new goal configurations | Hard | Language conditioning + multi-task training |
| Robot generalization | Different robot embodiment, kinematics, gripper type | Very Hard | Cross-embodiment pretraining (OXE) |
作業とロボット概括は主に 2026年に研究領域である - 基礎モデルによって扱われるが,作業ごとに細かな調整なしで生産するのに十分な信頼性がない.
政策が一般化できない理由: 変異的なシフトと配分の不一致
一般化失敗の数学的な説明は,コバリアートシフトである.P_trainを配分に訓練したポリシーでは,配分時にP_deployが遭遇する.配備環境からの画像が訓練画像とは異なる神経ネットワーク機能を活性化すると,政策のアクション予測は不確実になる. 失敗は沈黙する危険性がある. 政策は自信を持って 間違った行動を生み出します. 内部信号がない限り 政策は外極化している.
機械学習では標準コンピュータビジョンよりも コバリアシフトが悪化する3つの特定のメカニズムがあります
- 複合誤差. 単離して一つの画像を誤って標識する分類器には限られた誤差がある.一つの誤ったアクションを発生させる政策は次の観察を変化させ,訓練分布からさらに押し出す可能性がある.誤差は軌道を幾何的に複合する.
- アクション分布の絡み合っている. 政策は"何をすべきか"だけでなく"この特定の視覚的な文脈から何をすべきか"を学ぶ. "視覚的な文脈が変化する際,正しいアクションの概念でさえ変化する可能性があります (新しいオブジェクト形状は異なる把握戦略を必要とします).
- 低データ体制. ロボットデータセットは,コンピュータビジョンデータセットよりも大きさの順序が小さい. 500回のデモで訓練された政策では,ImageNetで訓練された分類器が画像を見たよりもはるかに少ない視覚的な文脈が見られるため,その機能空間は新しい入力に対して脆弱性が高い.
基準結果: ロボアジェントとRT-2-X
2026年より一般化で何が機能するかを示す2つの基準は,最もよい量的な証拠を提供します.
**RoboAgent (Bharadhwaj et al., 2024) **は,攻撃的なデータ増強 (オブジェクトテクスチャを置き換えるイメージ生成モデルを使用して意味増強) を用いて12種類の異なる作業に訓練された単一の政策が,標準行動クローンでは40%と25%と比較して,完全に新しいオブジェクトで68%の成功と新しい環境で55%の成功を達成したことを示した. 重要な発見は 生成的増幅による視覚多様性を合成的に拡大することは 追加の環境から実際のデータを収集するほど効果的です
RT-2-X (Open X-Embodiment) プロジェクトから) 22 つの異なるロボット実施形態のデータで訓練されたが,実施された一般化作業で単ロボット専門家の政策を約50%上回った.メカニズム:クロス-エンボディメントトレーニングは,モデルに新しい物体やシーンにより良く転送する実施形態-アグノスティック視覚表現を学ぶことを強制した. これは [データ多様性 (容量ではなく) が通用化を促す]という最も強力な証拠です.
テクニック:データ増やし ドメインランダム化
操作政策訓練のための実践的な補充スタック (これらの補充は訓練中に適用され,データ収集ではなく)
# PyTorch augmentation pipeline for robot policy training
import torchvision.transforms as T
train_transform = T.Compose([
T.RandomResizedCrop(224, scale=(0.85, 1.0)), # position invariance
T.ColorJitter(
brightness=0.3,
contrast=0.3,
saturation=0.3,
hue=0.1 # conservative hue -- too much breaks object ID
),
T.GaussianBlur(kernel_size=5, sigma=(0.1, 2.0)),
T.RandomAdjustSharpness(sharpness_factor=2, p=0.3),
T.ToTensor(),
T.Normalize(mean=[0.485, 0.456, 0.406],
std=[0.229, 0.224, 0.225]),
])
この拡張スタックから期待される改善:新型オブジェクト評価の815%,新型環境評価の1020%で,追加データ収集コストはゼロ.ACT,拡散政策,VLAの細かな調整においてこれらの数字は一貫しています.
テクニック: 基礎モデル 細かな調節
訓練前の基礎モデル (Octo, OpenVLA, pi0) を細かく調整することは,2026年に一般化を改善するための最も効果的な建築選択です.訓練前の脊椎は,何千ものオブジェクトカテゴリー,照明条件,環境を覆う数百万もの画像から視覚的な表現を学びました. 作業の特定細かな調整データでは 視覚的理解ではなく 行動マッピングを教えるだけです
練習期間中の最初の50%の視覺エンコードを凍結し (訓練前の表現を保存するために),その後,残りの期間における低学習率 (1/10分の1の政策指導者の学習率) で凍結する.この"段階的な凍結"は,細かな調整データが一般化を提供する広い視覺特性を覆すのを防ぐ.
建築による量的な一般化結果
各技術がどれだけの一般化改善をもたらすのか? 次の表は,標準化された選択・場所基準 (10 件のトレーニング,10 件の開催,200 件のトレーニングデモ) に基づいて,発表された論文やRCSV評価の結果をまとめています.
| Method | In-Distribution | Novel Objects | Novel Scene | Novel Object + Scene |
|---|---|---|---|---|
| ACT (ResNet, no augmentation) | 85% | 42% | 35% | 22% |
| ACT + augmentation | 83% | 55% | 48% | 35% |
| ACT + DINOv2 backbone | 88% | 65% | 55% | 45% |
| Diffusion Policy + augmentation | 86% | 58% | 50% | 38% |
| Octo (fine-tuned, 200 demos) | 87% | 68% | 58% | 48% |
| OpenVLA (fine-tuned, 200 demos) | 90% | 72% | 60% | 52% |
| RoboAgent (semantic aug + 12 tasks) | 88% | 75% | 62% | 55% |
重要なポイントは: (1) データ増強は,新しいオブジェクトの1015%の改善をゼロの収集コストで提供します. すべてのチームはそれを利用するべきです. (2) 基礎モデル脊椎骨 (DINOv2,Octo,OpenVLA) は,増強に加えて,さらに1015%の改善を提供します. (3) シーマンティック増強 (ロボアジェントアプローチ) で多作業訓練により,最高の全体的な一般化が得られます. (4) 最も難しい軸 - 革新的な物体と新しいシーンが組み合わせた - はすべての方法では 55%未満であり,問題の根本的な困難を強調します
OOD検出器として距離を埋め込み
部署観測が分散していないときの実用的な技術:観測の視覚埋め込みと訓練埋め込みの中枢点間のコシヌ距離を計算する.距離が限界を超えると,観測はOODである可能性があり,政策の行動は信頼されるべきではない.
# ood_detector.py -- Detect out-of-distribution observations
import torch
import numpy as np
from scipy.spatial.distance import cosine
class OODDetector:
"""Flag observations that are far from the training distribution."""
def __init__(self, encoder, training_embeddings, threshold_percentile=95):
self.encoder = encoder
# Compute centroid and distances for threshold calibration
self.centroid = training_embeddings.mean(axis=0)
train_distances = [cosine(e, self.centroid) for e in training_embeddings]
self.threshold = np.percentile(train_distances, threshold_percentile)
def is_ood(self, observation_image):
with torch.no_grad():
embedding = self.encoder(observation_image).cpu().numpy()
distance = cosine(embedding, self.centroid)
return distance > self.threshold, distance
def get_confidence(self, observation_image):
"""Return 0-1 confidence score (1 = in-distribution)."""
_, distance = self.is_ood(observation_image)
return max(0.0, 1.0 - distance / (2 * self.threshold))
この検出器は,一般化障害の70~85%を発生する前に検出する.OODフラグが掲げられたとき,システムは停滞したり,人間の指導を要請したり,保守的な古典的なコントローラに戻ることもできます.これは静かな障害が高価な生産部署で特に価値があります.
異体移植: オクセが教えてくれたこと
[Open X-Embodiment] (T8
機械は22台のロボットを同時に制御することを学ぶのではなく,交体訓練により,視覚エンコーダーは,ロボットの一方のカメラの視角や腕の幾何学に特異な特徴ではなく,操作作業に一般的に関連する特徴 (オブジェクトのアイデンティティ,空間関係,把握能力) を学ぶようにします. これらの一般目的の視覚機能は 作業に関連した構造をコードするため 新しいロボットに転送されます
22台のロボットにアクセスできないチームにとって,この利点の大半を収めることができる:クロスインボディメントプリトレーニングモデル (Octo, OpenVLA) から細かな調整ができます.目標ロボットで100~200個のタスク特有のデモで,Octoからの細かな調整は5倍以上のデータでゼロからトレーニングに匹敵する一般化を実現します. 訓練前のモデルでは,あなたがこれまで収集していない実施形態から"無料"のデータ多様性を効果的に提供します.
空間一般化:位置と方向性不変
対象位置一般化はしばしば失敗する最初の一般化軸であり,修正するのが最も簡単である. "悪い一般化"に関連付けられるILの失敗の多くは,実際に訓練データにおける空間覆い方における失敗である.
**作業場覆蓋要件.**典型的な40cm×40cmのテーブルプレートワークスペースでは,トレーニングデモは少なくとも5cmの距離を持つグリッドを覆う必要があります.つまり,ターゲットオブジェクトの少なくとも64の異なるスタートポジションです.もしデモが中心にクラスタされれば (オペレーターがオブジェクトを便利に配置するときに自然に起こるように),作業場の境界線ではポリシーが失敗します. RCSVの収集プロトコルは,格付けの位置を標記して,均等な空間覆盖を確保します.
方向の多様性. 旋回不対称性のある物体 (ツール,ラベル付きのボトル,電子部品) では,位置ごとに少なくとも8つの方向性 (垂直軸の周りに45度ごとに) を含みます.対称的な物体 (カップ,球) では,4つの方向性が十分です. ガイドラインをカバーしないことは,最も一般的なデータ収集の誤りであり, "簡単"ガイドラインで働く政策を生み出し,他のガイドラインでは完全に失敗します.
高度変動** 展開には異なる高度にある物体 (堆積物,棚) が含まれる場合,訓練には高度変動を含みます. テーブルが2cm以上または低いとき,テーブルが2cm以上または低いとき,トレーニングの方針は失敗します. 物体の視覚スケールが変化し,必要なアプローチ軌跡が変化します.
身体間の一般化:ロボット間の転送
一般化の一例は,ロボット体現の1つで訓練されたポリシーを別のロボットに展開するものです.これはOctoやOpenVLAのような基礎モデルが約束しているもので,その機能の程度はソースとターゲット体現の類似性に依存します.
| Transfer Scenario | Source | Target | ゼロショット転送 | 50-Demo Fine-Tune |
|---|---|---|---|---|
| Same class, same gripper | WidowX 250 | ViperX 300 | 35-50% | 75-85% |
| Same class, different gripper | Franka + parallel jaw | Franka + Robotiq 2F | 15-25% | 65-78% |
| Different class, same action space | Franka | OpenArm 1 | 10-20% | 60-75% |
| Different action space | 6-DOF arm | Bimanual (ALOHA) | 0-5% | 40-55% |
RCSV クライアントにとって実用的な意味: ローボットプラットフォームから別のロボットプラットフォームに移行する場合 (例えば,WidowXからOpenArm1にアップグレードする場合),既存のデータは無駄にはなりません.WidowXデータで訓練されたビジュアルエンコードーは依然として有用なオブジェクトとシーン理解を提供します.新しいプラットフォームで50-100のデモを収集し,ビジュアルエンコードを凍結しながらアクションヘッドを細かく調節します. これは通常,最低限の新しいデータ収集で元の政策のパフォーマンスの7085%を回復し,同じ50100のデモでゼロからトレーニングの40~55%を回復します.
重要な洞察:視覚表現は実施形態間で良好に転送されます (先訓練された視覚エンコーダーはロボットに関係なく同じオブジェクトを見ます), しかしアクションスペースが異なるときにアクションポリシーがうまく転送されません. 50-100 目標体現示例で精細調整は,実践的な展開のためにほぼ常に必要です. 横体化前の訓練から得られる視覚エンコードは一般化効果をもたらし,アクションヘッドは適応する必要があります.
常識な失敗パターンと標的の修正
誤差を修正する際には,特定の障害パターンを特定する際には,正しい修正を指します.
- パターン: ポリシーが新しいオブジェクトに接近するが,それを逃す. 視覚エンコーダーはオブジェクトを認識するが,新しい幾何学では把握戦略が間違っている.修正:幾何学的的により多様なオブジェクト (色の多様性ではなく形の多様性に焦点を当て) を示し集める.
- パターン: ポリシーは新しい環境でオブジェクトを完全に無視します. 背景視覚機能が支配しており,ポリシーはオブジェクト機能ではなく背景信号と作業行動を関連付けることを学んでいます. 修正:トレーニング中に攻撃的な背景拡張を使用し,視覚的に異なる環境で3つ以上を収集します.
- パターン: 政策は朝に動作しますが,午後には失敗します. 政策は照明の変化に敏感です (窓の光角が昼間変化します). 修正:明るさとコントラストの増幅を加え,昼間の複数の時間でのデモを収集します. 色のタスクに関係がない場合,深度入力のみを検討します.
- **パターン: ポリシーは,残された物体の80%で動作しますが,透明/反射性のある物では一貫して失敗します.**透明と反射性のある物体は,不透明物体と根本的に異なる視覚的特徴を生み出します.修正:トレーニングデータに透明な物体を含みます (最低3例);RGBと並んで深度入力を追加します (深度センサーはRGBよりも透明な物体をうまく処理します).
- パターン: 作業場の中心部では成功しますが,端では失敗します. 位置概括は限られています. 修正:トレーニングデモが境界地域を強調して全作業場を覆うようにしてください. 訓練中に目に見えるオブジェクトの位置をシフトするためにランダムな作物増やを使用します.
データ増やし対現的な多様性:コスト・利益分析
データ増幅は無料 (計算コストのみ).実際の多様性は追加のデータ収集を必要とする. 増幅と収集を何時行うべきか?
| 汎化 Axis | Augmentation Effective? | Real Diversity Needed? | Recommendation |
|---|---|---|---|
| Lighting variation | Yes (brightness, contrast jitter) | Helpful but not required | Augment first; collect in 2-3 lighting setups if augment insufficient |
| Object color/texture | Partially (color jitter helps) | Yes, for material changes | Augment for color; collect for material/texture variation |
| Object shape/geometry | No | Yes, essential | Collect with 15+ geometrically diverse objects |
| Object position | Partially (random crop) | Yes, for workspace coverage | Collect with full workspace grid; augment for sub-grid interpolation |
| Background/environment | Partially (background randomization) | Yes, for real robustness | Augment + collect in 3+ environments |
| Grasp strategy variation | No | Yes, essential | Collect with diverse objects that require different grasp approaches |
原則:拡張は視覚的変化 (照明,色,カメラ角度) を効果的に処理する.物理的な変化 (オブジェクト幾何学,把握戦略,接触動力) において,実際のデータ収集が必要である. 200種類のデモのよく増やされたデータセットは視覚的一般化に関する500個のデモの未増やされたデータセットを上回りますが,物理的なオブジェクト多様性の代替品は増やされるものではありません.
配分シフトの下での一般化:実世界のケース研究
配分シフトの特定の種類において政策がどのように失敗するか理解することは,チームにデータ収集と拡張戦略を優先させるのに役立ちます.
| Scenario | Training Conditions | Deployment Change | Success Rate Drop | Fix Applied |
|---|---|---|---|---|
| Warehouse bin picking | Lab with fluorescent lighting, 15 SKUs | Warehouse with skylights (variable sunlight), 50 SKUs | 92% to 54% | Aggressive color jitter augmentation + 100 on-site demos restored to 82% |
| Lab sample handling | Standard test tubes, white background | Colored reagent tubes, patterned rack | 88% to 41% | DINOv2 backbone (replacing ResNet) + 50 tube demos restored to 79% |
| Kitchen manipulation | RCSV facility kitchen, 20 utensils | Customer kitchen, different counter color, different utensil set | 85% to 62% | Multi-environment training (3 kitchens) during initial collection restored to 78% |
| Electronics assembly | Rev A board design, fixed fixture | Rev B board (shifted connector position by 3mm) | 91% to 12% | 30 new demos on Rev B + random position offset augmentation restored to 87% |
| Retail shelf stocking | Mock shelf, 10 product types | Real store shelf with price tags, adjacent products | 83% to 55% | Background randomization + OpenVLA fine-tune (language conditioning) restored to 76% |
これらのケースにおけるパターンは: 各部署は配分シフトを含みます. 性能低下の大きさは,部署条件が訓練とどれほど異なるかに依存しており,修正は常に (1) よりよい視覚表現 (基礎モデル脊椎) (2) 変異の特定の軸のためのデータ増強, (3) 標的性現場データ収集の組み合わせを含みます. 配分を計画するチームは 最初から 配分を計画するチームです 配分を初期に組み込むことで 配分を初期に組み込むことで 配分を小さくし 回復を迅速にします
一般化 を 測定 する: 成功 率 を 超え
バイナリー成功率は標準一般化メトリックですが,政策の堅牢性のすべての側面を把握していません.生産部署については,これらの追加メトリックを追跡してください.
- 優雅な劣化率. 政策が失敗すると,安全 (停止,帰国) または危険 (テーブルから物体を叩き,障害物と衝突) で失敗するのか? 70%の成功と 25%の優雅な失敗が 80%の成功と 15%の危険な失敗よりも実装可能である. "安全"と"安全でない"の失敗の割合を追跡する.
- リターン成功率. 失敗後,システムがリセットして再試した場合,第2回の成功率はどのくらいですか? 最初の試みでの失敗が高く,しかし再試の成功が高い (故障がシステムを回復可能な状態に置き去りにしているため) 基準が示唆するよりも実装が容易です.
- 信頼性校正. OOD検出器を導入した場合 (上記の埋め込み距離アプローチを参照) 信頼性スコアは実際の成功とどの程度関連しているかを測定します.よく校正されたシステムは,不確実な状況を人間によるレビューのために標識し,一般化失敗を静かなエラーではなく,人間によるループの介入に変えることができます.
- 時間とともに一般化衰退. 週刊または毎月成功率を追跡する. 徐々に劣化 (季節による照明変化,ハードウェアの磨損,物件の配列の変動) は,最も一般的な生産故障モードであり,定期的にデータ更新を要する.
最大の一般化のための基礎モデル選択
基本モデルによって一般化プロフィールが異なります. 選択は,どの軸が部署にとって最も重要かによって異なります.
| 基礎モデル | Novel Object 汎化 | Novel Environment 汎化 | Language 汎化 | Compute Requirement |
|---|---|---|---|---|
| Octo (93M) | Good (+20% over ACT) | Moderate (+15%) | Basic | 1x A100 (fine-tune) |
| OpenVLA (7B) | Strong (+30% over ACT) | Strong (+25%) | Strong | 4x A100 (fine-tune) |
| ACT + DINOv2 backbone | Good (+23% over ACT) | Good (+20%) | None | 1x RTX 4090 |
| ACT + R3M backbone | Moderate (+15% over ACT) | Moderate (+12%) | None | 1x RTX 3090 |
限られたコンピューティング (1 GPU, RTX 3090/4090) を備えたチームでは,DINOv2のバックボーンを持つACTがドルあたり最高の概括を提供します.A100アクセスおよび言語条件付け要件を持つチームでは,OpenVLAの微調整が最も強力な総合概括を提供します.Octoは中途半端を占めています.適度に計算要件のある合理的な概括です. 訓練前のガイドの動画をご覧ください 訓練のパイプラインにこれらの脊髄を統合する方法について詳細に
一般化影響によるデータ増幅技術
データ増幅は概括を改善する最も安価な方法ですが,すべての増幅は同じように効果的ではありません. 12 つのテーブルタスク操作作業における RCSV 抽離研究に基づくランキングです.
| Augmentation | OOD Improvement | In-Dist Impact | Compute Cost | Implementation Difficulty |
|---|---|---|---|---|
| Random crop (224 from 256) | +8-15% | -1 to +2% | Near zero | Trivial (2 lines of code) |
| Color jitter (brightness, contrast, saturation) | +5-12% | -2 to +1% | Near zero | Trivial |
| Background randomization (paste object on random bg) | +10-20% | -3 to 0% | Low | Moderate (needs segmentation mask) |
| Gaussian noise (sigma=0.02) | +2-5% | -1 to 0% | Near zero | Trivial |
| Random erasing (cutout 10-20% of image) | +3-8% | -2 to +1% | Near zero | Trivial |
| Spatial action perturbation (+/- 2mm noise on demo actions) | +5-10% | -1 to +3% | Near zero | Easy (add noise to action labels) |
計算コストではほぼ無償で組み合わせることができる.通常はOOD一般化を15-30%向上させ,分散性能に最小限の影響を与える.すべての3つのことをデフォルトとして適用する. 背景ランダム化には,各エピソードの最初のフレームに SAM (Segment Anything Model) を用いて自動的に生成できるオブジェクトセグメント化マスクが必要です.
アクション拡張は,あまり使えていない技術です. 訓練中に示範行動ラベルに小さな空間騒音 (1~3mm) を追加することで,政策が正確な軌道を記憶するのを阻む規制器として機能します. これは,政策が小さな偏見から回復しなければならないDAgger型の訓練において特に効果的です.
部署監視:生産における一般化変動の検出
政策が導入されると,普及環境が変化するにつれて,一般化障害が徐々に現れ,生産信頼性に影響される前に,効果的な監視はこれらの障害を早期に検出します.
- インベディング・ドリフモニタリング. 政策の視覚エンコードを使用して生産観測の平均インベディングを計算し,トレーニングセットの平均インベディングと比較します. L2距離がトレーニングセットの分布の標準偏差2を超えると,操作チームに警告します. 視覚分布の変化 (照明の変化,新しい物体,カメラの誤った配列) が 失われることから 失われることがわかります
- 統計的なプロセス制御による成功率追跡. 移動平均から標準偏差3点に設定された上下制御制限を表示する制御表に,毎日成功率を図示する.下限を下回った1日で調査が開始される.連続した2日で自動的な人間回転が開始される. このアプローチでは,突然の故障 (ハードウェア問題) と徐々に劣化 (環境漂移) を検出します.
- 失敗分類. 失敗エピソードを視覚エンコーダー埋め込みでログアップし,失敗をクラスターする.新しい失敗クラスターが出現した場合 (既知のトレーニング配分と一致しない失敗) は,新しいOOD状態を示します.特定の失敗モード (10-30 デモ) のターゲットデータ収集は,完全な再訓練なしでギャップを修正するのに通常十分です.
- 定期再評価. 月間全般化評価プロトコルを実行します (残された物体,残された条件) 展開前ベースラインと結果を比較します.任意の軸で5%以上の減少はデータ更新サイクルを引き起こす.この再評価のための予算は月2~4時間です.
2026年における実践的な一般化戦略
2026年に操縦政策を構築するチームにとって 一貫して最高の一般化結果を出す方法です
- ** 基礎モデルのバックドーンからスタートします.** ビデオ訓練前の視覚エンコード (DINOv2, SigLIP,または R3M) をあなたのポリシーの視覚バックドーンとして使用します.これは最初の日から幅広い視覚的通用化を提供します.
- 展示を集める,大きなものではなく 多様なもの.** 15 つのオブジェクトインスタンスの 200 つの展示, 3 つのライト設定, 3 つのオペレーターは, 1 つのオブジェクトで 2,000 以上の展示を一般化します. 集合プロトコルを多様性目標の周りに設計します.
- 言語条件付けを使用します. 部署に課題の変更が必要であれば,言語指示のポリシーを条件付けしてください.これは構成概括を開きます.
- ** 攻撃的 に 増強 する.** 訓練 の 間 に 色 の 緊張,ランダム 収穫,明るさ の 変化,背景 の 増強 を 適用 する.これは 視覚 的 な 配分 変化 に 対し て 安い 保険 です.
- 一般化を明示的に測定する. 対象と条件を外して,OODメトリックを報告する.一般化を測定していないポリシーを送信しないでください.
一般化評価チェックリスト
- 訓練中に使わないカテゴリーごとに5〜10個のオブジェクトインスタンスを予約する
- 訓練配分に含まれていない3以上の作業場でのテスト
- 訓練中に見られない少なくとも2つの照明条件で評価する
- 統計的意義のために条件ごとに最低20回の評価試験を実行する
- 配布中の成功率と配布外の成功率を別々に報告する
- 軌道の軸通用化 (物体,位置,照明)
- 記録された正確な集合を 復元できるようにします
- 評価を実行する前に,評価後ではなく,合格/失敗の限界値を定義する
一般化テストプロトコル:完全なテンプレート
このテンプレートを使って,訓練された操作方針の標準化された概括評価を実行します.プロトコルは実行するのに2-3時間かかります.そして,公開可能な概括メトリックを生成します.
- **試験マトリックスを定義する.**評価条件の格列を作成する: 5 つの分布式オブジェクト × 3 つの分布式位置 = 15 つの分布式条件. 5 つの保持されたオブジェクト × 3 つの保持された位置 = 15 つの OOD 条件. 2 つの代替照明条件 × 5 つのオブジェクト = 10 つの照明シフト条件.合計: 40 つの条件.
- 条件ごとに3回の試験を実行する. 各条件で3回実行する.成功/失敗,完了時間,および必要な介入を記録する.合計: 120回の試験 (リセットを含む1回の試験で約2
3時間,12分) - 計算メトリック* 分布成功率 (平均および95%IC45試験以上) OOD成功率 (平均および95%IC45試験以上) 光強度 (ベースラインから代替照明への成功率低下) 一般化差 (分布率マイナスOOD率)
- **レポート形式.**信頼間隔で4つの指標をすべて報告する.15%未満の一般化差は良い一般化を示唆する.30%以上の差は,政策が訓練配分に大きく過適合しており,多種化や拡張が必要であることを示す.
RCSVの [データサービス] (
関連 読書
深深潜入:一般化課題 · X体体データセットを開放 · ロボット学習のためのスケーリング法 · シミュレーション・トゥ・リアル転移 Tips · ビデオから学ぶ · 模倣学習ガイド · データサービス
一般 的 な 政策 を 構築 する
RCSVのデータ収集プロトコルは,汎用化を最大限に高める多様性目標に設計されています.標準パッケージ (2500$パイロット / 8,000$キャンペーン) には,多オブジェクト,多環境,多オペレーター多様性が含まれ,私たちの評価パイプラインには新しいオブジェクトと条件で継続的な汎用化テストが含まれます.
[一般化要件について議論する]







