ロボットがビデオから学ぶ - 2026年の最新技術
2026年にロボットがビデオから学ぶことを全面的に調査する:視覚訓練前 (R3M, MVP),ビデオ言語行動モデル,何が機能するか,何が機能しないのか,データ収集への実用的な影響
[←ブログ]
インターネットには何十億時間もの人間の操作ビデオがあります このデータをロボットに教えるのに使うという約束は現実ですが 実際には機能するメカニズムは 多くの人が期待するものとは違いますが ビデオが提供するものとロボットが必要とするものとの間のギャップは 大きく残っています
機械 の 学習 に は なぜ ビデオ が 魅力 的 な もの で ある か
呼び出しは単純に算数的なものです. [テレオペレーション] (
ロボットがこのビデオから直接学習できれば,物理的なAIを制限するデータボトルネックはほとんど消えていきます.特定のハードウェアでタスクの特定デモを収集する代わりに,チームは単にインターネットビデオの関連サブセットにモデルを指し,一般目的の操作ポリシーを訓練することができます.
2026年現在では 現実はより微妙です ビデオはロボット学習に 非常に有用であることが証明されていますが 単純な物語の示唆とは違います ビデオからロボット行動への道は 特定の技術的なアプローチを通り抜けています それぞれが明確な強みと 厳しい限界を持っています
3つの基本問題
ビデオは,何が起こるか示します. 手がカップを伸ばし,それを上げ,水を注ぐが,その動きを発生させたモーターコマンドを記録しません. ロボットポリシーでは,観察を行動にマップする必要があります.関節速度,エンドエフェクター移動,グリッパーコマンド.ビデオは観察側を提供しますが,アクション側ではありません. ビデオからアクションを復元するには 根本的に未確定な逆の問題を解決する必要があります
体体格不一致.* 人間の手には27度自由,触覚的なフィードバックが豊富で,ロボットグリッパーと劇的に異なる力能力があります.人間の注水は7DOF腕に搭載された平行爪グリッパーに直接アナログがない指圧,腕のトーク,および液体の動きの信号からプロピオセプティブフィードバックを使用します. ビデオから完璧なアクションラベルを 抽出しても そのアクションはロボットではなく 人間のモーターコマンドを記述します
*視点を不一致する.**ロボットカメラの配置にほとんど一致しない第一人 (自己中心) または第三人視点から人間のビデオが撮影される.ロボットには通常腕カメラと固定された上部カメラが1つまたは複数のものがあります.人間視点から学んだ視覚的特徴は,ロボット視点からの観測で正しくアクティブ化できないため,視覚的ポリシーの直接転送を制限します.
実際 に 効果 を 得るもの: 視覚 表現 の 前 の 訓練
ビデオベースのロボット学習の最も強力な検証結果は 視覚表現前の訓練です アプローチは: 人による操作ビデオの大量に視覚エンコードを訓練します 動作ラベルなしでです 結果となる表示を使用して ロボット政策ネットワークの視覚の脊髄を初期化します これはローストローロボット学習のサンプル効率を 15~40%に 一貫して向上させます
R3M (Nair et al., 2022) は,言語の調整と組み合わせた時間対比的な学習目標を使用して,メタのエゴ4Dデータセットのエゴ4DデータセットでResNetをプリートレーニングした.結果,視覚エンコードが,フランカ操作ポリシーを初期化するために使用されたとき,複数のベンチマークタスクにおけるImageNetプリートレーニングと比較して15-40%のサンプル効率を向上させた. R3Mはロボット学習研究において最も広く使用されているビデオ訓練を先行したエンコードの一つである.
MVP (Masked Visual 事前学習, Xiao et al., 2022) は,自中心的なビデオと ImageNet のデータを組み合わせた masked autoencoding を使用した.学習された表現はロボット制御作業にうまく転送され,操作関連ビデオの自己監督のプレトレーニングがロボット政策学習のための ImageNet の機能を監督したことを示した.
SPA (Zhu et al., 2024) は,空間意識の目標で,訓練前のパラダイムを拡張し,より優れた3D空間推理で表現を生産した.SPAはR3Mよりも下流ロボット性能を比較したり,より優れたことを示し,同時により解釈可能な空間特性を提供した.
これらの結果の背後にあるメカニズムはよく理解されています 人間の操作ビデオは 物体の容量について 膨大な情報を含んでいます 物体がどのように見えるか 押したり握り合ったりするとどのように動くか 安定した構成を構成するものです 明確なアクションラベルがなければさえ この情報は視覚的な特徴に暗号化され ロボットの認識に直接転送されます グラスをつかむ人間は何千時間も 観察してきた視覚エンコードは グラスをつかむことができるカップの 姿を知っています これはまさに ロボットが グラスをつかむための 政策が必要とする表現です
ビデオ 言語 行動 モデル: 新しい 境界
ビデオ言語行動 (VLA) モデルは,ビデオ訓練の先端の視覚エンコーダーと言語理解とアクション予測を単一のアーキテクチャで組み合わせています.鍵となる洞察は:言語は,ビデオの意味的な内容とロボットが実行する必要がある特定のアクションの間に橋渡しを提供します.
RT-2 (Brohan et al., 2023) は,インターネット規模での画像テキストデータで訓練されたVLMがロボットアクションを直接実行するために調整できると実証した. 視力予備訓練には,広範なビデオデータが含まれていた. RT-2はロボットデータ収集中に見られなかった新しいオブジェクトと指示に意味のあるゼロショット通用化を示した.
SuSIE (Black et al., 2023) は,サブゴール生成器としてビデオ生成モデルを使用した. 現在の観測と言語指示により,目標状態を示す可視な将来のイメージを生成し,その後,低レベルのポリシーが生成されたサブゴールに到達するためのアクションを実行する. このアプローチは ビデオ予測能力を利用し オンラインビデオで訓練を受け ロボットに視覚的な計画を提供します
UniSim (Yang et al., 2023) はさらに進んで,ビデオデータから視覚の世界が行動に対してどのように進化するかを予測できる普遍的なシミュレーターを訓練した.この学習された世界モデルはモデル予測制御を可能にします.ロボットはビデオ予測モデルを通して実行することによって候補行動の結果を想像し,最も予測可能な結果を持つアクションシーケンスを選択します.
これらのアプローチは真の進歩を表しますが 重要な限界があります 信頼性の高いアクションを生み出すために VLA モデルには ロボットに特化した 微調整データが必要です ビデオ訓練の前もって 視覚的理解と意味力的な基礎が提供されます 精密なモーター制御ではありません SuSIEとUniSimは構造的な環境で動作しますが,まだ精度作業に生産部署するのに十分な強度はありません.
まだ 機能 し ない もの: インターネット ビデオ から 直接 政策 学べ
オンラインビデオで ロボット政策を端から端まで訓練するという夢は 2026年に実現されず 多くの研究分野がこれを試みています
- 逆動力学モデルは,連続したフレーム間の動作を予測することによって,ビデオを偽動作でラベル付けしようとする.これは,人間のポーズ推定をサブセンチメートル精度に解決し,人間の関節角をロボット動力学に再標的にし,実施体隙を処理することを要求する. 現在 リターゲティングパイプラインは 腕の動きに効果があるが 機械学習に 最も価値のある 細い指操作に失敗する.
- DMP軌跡調整は,ポーズ推定を用いてビデオから手軌跡を抽出し,ダイナミック・ムーブメント・プリミティブをそれに合わせる.これは粗い移動を移転させるが,接触動力が重要である特定の作業の精度把握,挿入,または他の作業に失敗する.
- ビデオデモを入力として受け取り,ロボットアクションを生成する直接ビデオコンディションされたポリシーは,制御された設定で単純な作業で有望な結果を示したが,一般部署のために十分な力を持って視点を,実施形態,物理のギャップを処理していない.
基本的な問題は ビデオにはロボット政策に必要な行動監視信号が欠けているということです 視覚的表現は 良く伝達されます 感知はほとんど体現に依存しません 人体やロボットがそれを見ているかどうかに関係なく カップはカップのように見えるのです しかし モーター制御は体現に深く依存しており ビデオにはそのギャップを埋めるために必要な情報が含まれていません
視覚訓練前モデル の 比較
次の表は2026年初旬からロボット政策初期化のために利用可能な主要なビデオ訓練の視覚エンコーダーを比較します.すべての数字は,下流操作基準を反映しています.
| Model | 事前学習 Data | Backbone | サンプル効率 Gain | Novel Object Improvement | Params |
|---|---|---|---|---|---|
| R3M | Ego4D (egocentric video) | ResNet-50 | 15-40% | +12-18% | 25M |
| MVP | Ego4D + ImageNet | ViT-B/16 | 20-35% | +10-16% | 86M |
| SPA | Ego4D + spatial tasks | ViT-B/16 | 25-40% | +14-20% | 86M |
| DINOv2 | LVD-142M (curated images) | ViT-L/14 | 20-35% | +15-25% | 300M |
| SigLIP | WebLI (image-text pairs) | ViT-L/16 | 15-30% | +12-22% | 300M |
| VC-1 | Ego4D + ImageNet + robot video | ViT-L/16 | 25-45% | +15-22% | 300M |
| ImageNet ResNet (baseline) | ImageNet-1K (classification) | ResNet-50 | Baseline (0%) | Baseline (0%) | 25M |
重要な発見:DINOv2とVC-1は2026年に最も強力な全体的な結果を提供していますが,推論速度に影響を与える最大のモデル (300Mパラメータ) もである.推論遅延が重要である場合 (25MパラメータはCPUで実行されます).SPAは正確な配置作業に重要な最高の空間推論を提供します. 後にVLAパイプラインに細かな調節を計画する場合は,有用な言語の調整を提供します.
精細調整ガイド: 訓練済みのエンコードからロボット政策へ
ビデオ訓練を先行したエンコードを政策訓練パイプラインに統合するには どれだけのエンコードを凍結するか,どのように行動予測と組み合わせるか,学習率スケジュールを管理する方法について慎重に決定する必要があります.
ステップ1:コードを選択する. ほとんどのテーブル操作作業では,DINOv2 ViT-B/14 (86Mパラメータ) が表現品質と推論速度間の最良のトレードオフを提供します.遅延感受性の高いアプリケーション (>20 Hz制御) では,R3M ResNet-50 (25Mパラメータ) を使用します.VLA対応パイプラインでは,SigLIP を使用します.
ステップ2: 凍結するものを決定する. 最も保守的なから 最低保守的なまで3つの戦略
- プログラムが実行される時,すべてのエンコードレイヤを凍結します._ 既訓練されたエンコードを固定機能抽出器として使用します.タスクデータでポリシーヘッド (アクション予測ネットワーク) をのみ訓練します. 100 件未満のデモがある場合,これは最もうまく機能します.トレーニング時間: 1 - 2 時間.
- _ 初期層を凍結し,後期層を細かく調整する._ 初期層の75%を凍結し,最後の25%をポリシーのヘッドとともに細かく調整する.これは,コーダーはカメラの特定の視野と照明に適応し,幅広い視覚知識を維持することを可能にする. 100-500 の示範に最適です.
- プログラミングのレベルは,政策頭よりも10~100倍低い学習率で,モデル全体を訓練する (例えば,コード LR = 1e-6,政策頭 LR = 1e-4). これは最も柔軟性のあるものですが,コードを過度に配合しないために300以上の示範が必要です.
ステップ3: 解析度不一致を処理する. 予備訓練されたエンコーダーは224x224または384x384の入力を期待する.ロボットカメラはしばしばより高い解析度 (640x480, 1280x720) で撮影する.エンコーダーの予備解析度に一致する入力をサイズ変更する.エンコーダーのパッチサイズやポジショナルのエンコーディングを変更しないでください.これは予備訓練された情報を排除します. 作業に高解像度細かい内容が必要であれば (例えばパッケージに小さなテキストを読み込む) 縮小するよりも複数の作物から特性を抽出することを検討してください.
# Example: Using DINOv2 as a frozen encoder for ACT-style policy
import torch
from transformers import AutoModel, AutoImageProcessor
# Load pre-trained DINOv2
encoder = AutoModel.from_pretrained("facebook/dinov2-base")
processor = AutoImageProcessor.from_pretrained("facebook/dinov2-base")
# Freeze encoder weights
for param in encoder.parameters():
param.requires_grad = False
# Extract features from a robot camera image
image = camera.capture_rgb() # (480, 640, 3) numpy array
inputs = processor(images=image, return_tensors="pt")
with torch.no_grad():
features = encoder(**inputs).last_hidden_state # (1, 257, 768)
cls_token = features[:, 0, :] # (1, 768) -- global image feature
# Feed cls_token + proprioception to your action prediction head
obs = torch.cat([cls_token, joint_state], dim=-1) # (1, 768+7)
action = policy_head(obs) # (1, chunk_size, action_dim)
代表基準: どの作業のためのエンコード器?
作業型において,すべての先訓練されたエンコードが同じ性能を有していない.公開されたアブラーションおよび内部RCSV評価に基づいて,以下は,作業特有の勧告である.
- テーブルトップピックアンドプレイス (硬いオブジェクト): DINOv2 ViT-Bは最も強力なパフォーマンスを提供します.自主監督のプレトレーニングは,直接操作に移すオブジェクトレベルの機能を捕捉します. イメージネットベースラインより18-25%の改善.
- 変形可能なオブジェクト操作 (織物,食品): R3MまたはVC-1は変形可能な作業でDINOv2を上回る,なぜならビデオプレトレーニングにおける時間対比目標は静态画像プレトレーニングが欠けているオブジェクト動力を捕捉するため. 20-30%の改善.
- 言語による操作: SigLIPは,前訓練された言語と視覚の調整が,視覚機能の基礎言語指示に役立つため,最も強力な転送を提供します. 15-25%の改善.
- コンタクト豊富な挿入作業: すべての視覚エンコーダーは最小の利益 (<10%の改善) をもたらします.これらの作業は視覚機能ではなく,プロピオセプティブとフォースフィードバックが支配しているため.より大きな視覚エンコーダーではなく, [フォーストークセンサー]
T6 ) データを追加することを検討してください. - 多環境一般化: DINOv2とVC-1は,様々な訓練前データに幅広い視覚的多様性が含まれているため,最大限のOOD改善 (20-30%) を提供します.R3Mのエゴ中心的なビデオデータセットは狭いため,環境変化にうまく転送されません.
データパイプライン統合:ビデオエンコードから政策訓練
既存の模倣学習パイプラインにビデオ再訓練のエンコードを統合するには,データ処理とトレーニングの変更を特定する必要があります.
# video_encoder_pipeline.py -- Integrate pre-trained encoder into IL training
import torch
from torchvision import transforms
class VideoPretrainedPipeline:
"""Pipeline for using video-pretrained encoders in IL training."""
def __init__(self, encoder_name="dinov2_vitb14", freeze=True):
self.encoder = torch.hub.load('facebookresearch/dinov2', encoder_name)
self.freeze = freeze
if freeze:
for param in self.encoder.parameters():
param.requires_grad = False
# Normalization must match pre-training distribution
self.transform = transforms.Compose([
transforms.Resize(224),
transforms.CenterCrop(224),
transforms.Normalize(
mean=[0.485, 0.456, 0.406],
std=[0.229, 0.224, 0.225]),
])
def extract_features(self, image_tensor):
"""Extract features from a single camera image.
Args: image_tensor: (B, 3, H, W) in [0, 1]
Returns: (B, 768) feature vector for ViT-B
"""
x = self.transform(image_tensor)
with torch.no_grad() if self.freeze else torch.enable_grad():
features = self.encoder(x) # CLS token: (B, 768)
return features
def build_observation(self, image, proprioception):
"""Combine visual and proprioceptive features.
Args:
image: (B, 3, H, W) camera image
proprioception: (B, D) joint angles, gripper state
Returns: (B, 768 + D) combined observation
"""
vis_features = self.extract_features(image)
return torch.cat([vis_features, proprioception], dim=-1)
** 重要な実装詳細:** 標準化パラメータ (平均, std) は,エンコーダーの予備訓練中に使用された値と正確に一致する必要があります.誤った標準化を使用すると,エンコーダーは配送外の入力を受け取るため,パフォーマンスは10-30%低下します. DINOv2と R3Mの両方がImageNet標準化値を使用します. 統合する前にモデルカードをチェックします 統合する前にモデルカードをチェックします
マルチカメラセットアップでは,カメラビューごとに1つのエンコーダーをインスタント化するか,ビュー間で1つのエンコーダーを共有する (重量共有) によりよい.重量共有は優先される:メモリ使用を削減し,ビュー間でより一貫した機能スペースを生成する. GPUの最大利用のために,バッチ付き前進パスを使用して相機を並行処理する.
注目すべき 書籍 と システム
ビデオベースのロボット学習を基盤とするチームにとって 2026年初頭からの主要な参照は以下の通りです
- R3M (Meta, 2022):ロボット操作表現のためのエゴ中心的なビデオプレトレーニング.視覚プレトレーニングのベースライン.
- MVP (2022):映像と画像データを組み合わせたマスクされた視覚予備訓練. 異なるトレーニング方法を持つR3Mへの強力な代替.
- SuSIE (2023): ロボット操作のサブゴール計画としてのビデオ生成. ビデオ予測モデルはロボット行動にどのように導かれるかを示します.
- UniSim (2023):ビデオから学習された普遍シミュレーター.ビデオ訓練の世界モデルがモデル予測制御をサポートできることを示します.
- RT-2 (Google DeepMind, 2023):ロボット行動に調整されたビジョン言語モデル. 現在の研究を支配するVLAパラダイムを確立した.
- GR-2 (ByteDance, 2024):ロボット政策学習に適応したビデオ生成モデルで,SuSIEアプローチをより大規模に拡張する.
- Octo (2024): ビデオ訓練の先駆けの視覚的脊髄を持つオープンソースの一般主義ロボット政策. VLAアーキテクチャを構築したいチームにとって実用的な出発点.
現在 の 限界: ビデオ が ロボット に 教え られる もの は ない
ビデオベースの学習の厳しい境界を理解することで,チームは特定の課題に効果を及ぼす方法に過剰投資するのを防ぐことができます.
- 力調節. ビデオは握力,挿入力,接触圧に関する情報を提供していません.人として水を注ぐ水器は,体重変化,腕のトーク,液体流動動力に基づいて握力調整します.
- プロピオセプティブフィードバックループ * 初期視覚指針の後,人間は目をつかんで操作の多くの作業を行います. モーター制御はプロピオセプティブです.ビデオは視覚の結果のみを捕捉します.プロピオセプティブ制御ループではありません. 関節モルチフィードバック,触覚接触感知,または運動記憶 (盲目挿入,標的モルチに螺旋回線を絞る) に依存する作業は,ビデオ前訓練から何も得られません.
- タイムとスピードプロフィール. ビデオフレーム速度は (通常24-30fps) は,高速操作の作業の時間動力に欠点を示しています. 0.8秒間の迅速なピックアンドプレイスサイクルは30fpsで20-24フレームしか続かない. フレームと加速プロフィールを学ぶのに十分な時間解像度がないため,スムーズな専門家動きと不気味な初心者との区別が可能です.
- 双手調整時間. [双手作業] (
T8 ) では,左から右の腕の調整の正確なタイミングは極めて重要であり,ビデオから回復できない.ビデオでは両腕が同時に動き出ているように見えるが,衝突を避けるためまたは適切なシーケンシングを達成するために実際のモーターコマンドで50~100msの時間オフセットが必要である.
ビデオ 訓練前 実施チェックリスト
ビデオ訓練を自分のパイプラインに統合する準備ができているチームには この実践的なチェックリストをご覧ください
- タスクタイプに基づいてエンコードを選択する (上記表示基準を参照).デフォルト推奨:一般操作のための DINOv2 ViT-B; 遅延感受性のアプリケーションのための R3M.
- ** 予備訓練された重量ダウンロード.** 推奨されているすべてのエンコードは, Hugging Face:
T2 , T3 ,またはオリジナルの紙資料庫から入手できます. - 入力解像度をマッチする. ロボットカメラ画像をエンコードの予想される入力に一致させるように再サイズ (224x224ほとんどの ViTモデル, 224x224 R3M ResNet).ダウンスケーリングのために二線間間隔を使用します.
- **ベンチマーク凍結対細かい調節式エンコード.**凍結式エンコード (最も速く,最も安全) を開始します. 50+のデモ後にパフォーマンスは十分でない場合は,最後の25%の部分細かい調節に切り替えます.
- モニター機能の質. ロボットカメラ画像にエンコーダーの注意力地図 (ViT) やアクティベーション地図 (ResNet) を表示してください.エンコーダーは,作業に関連する物体よりも,主に背景に注目している場合は,有用な機能を提供していないため,異なる訓練前ソースまたはより攻撃的な微調整が必要かもしれません.
- 制御されたアブラレーションを実行する. より複雑なパイプラインに取り組み始める前に,特定のタスクの実際の利益を定量化するために,常にImageNetのベースラインと比較してください.
データ収集チームにとって実践的な影響
2026年の 現場の状況を考慮すると,データ収集決定を行うチームにとって研究が意味するのは以下です
ビデオ・プレトレーニングのビジュアルエンコーダーを使用します. ビデオ・プレトレーニングのビジュアルエンコーダーを使用します. これは無料の15~30%のサンプル効率の向上です.追加のデータ収集は必要ありません.すべてのチームはこれをすべきです.
**アクション学習のためのロボットネイティブデモを収集する. ** ビデオは視覚表現を提供する.ロボットテレオペレーションはアクションラベル付きのトレーニングデータを提供する.これらは代替品ではなく補完的なものです. 高品質のテレオペレーションデータ収集に投資し,ビデオ再訓練されたエンコーダーを使用するチームは,いずれかのアプローチを専用的に依存するチームを上回ります.
**ビデオプレトレーニングとデータ増強を組み合わせる.**ビデオプレトレーニングのエンコーダーとデータ増強は補完であり,代替品ではありません.ビデオプレトレーニングは一般的視覚表現を提供します.データ増強は,それらの表示を特定の展開変異に堅くします.ビデオプレトレーニングのエンコーダーを使用するときにさえ,色のジッター,ランダム作物,明るさの増強を適用します. RCSV アブラーションでは,DINOv2 プレトレーニングと標準増強の組み合わせは,増強なしで画像ネット基線よりもOOD 成功率を2535%向上させる - 単一の技術 (1520%ずつ) より多い.
データ収集で言語指示を使用する. VLA パラダイムは言語条件付きの行動に依存します.関連する自然言語指示 ("赤のカップを拾い,"穴にボルトを置く") との示例を収集した場合,ビデオ訓練された言語-視覚的アライナメントを利用する VLAの細かな調管道と直接互換性があります. 言語標識のないデモを集めると このつながりが失われます
対象タスクドメインが 料理やパッケージや電子機器の組み立てなど 豊富な動画を備えている場合 視覚エンコーダーを訓練する 特定のドメインのビデオデータセットを 管理することで 一般的な訓練を上回る可能性があります 料理ビデオから学んだ視覚的特徴は,一般的なインターネットビデオから学んだ特徴よりも,キッチン操作の作業により関連があります.
前計算とキャッシュエンコーダー機能. 1,000 回の未満のデータセットでは,各フレームの視覚エンコーダー機能を前計算して原始画像とともに保存します.これはトレーニング中にエンコーダーが前向きに通過することを排除し (凍結されたエンコーダーのためのトレーニング時間の50~80%を節約し) 視覚エンコーダーを再起動せずにアクション予測アーキテクチャの急速な繰り返しを可能にします. ViT-B機能のキャッシュファイルは通常10〜50MB/エピソードで (30秒間に30fpsで1フレームに768次元) になります.
**ビデオのみのトレーニングが効果を及ぼすのを待つな.**ビデオのみとビデオ・プラスロボットデータアプローチの間のギャップは依然として大きい.ビデオのみの方法が成熟するのを待つデータ収集を遅らせているチームは戦略的間違いをしている.現在から実際のロボットデータを収集し,ビデオプリトレーニングを使用してその価値を拡大し,よりよいビデオベースの方法を利用する.
実践 的 な 評価: ビデオ の 訓練 前 の 益 を 測る 方法
ビデオ訓練を採用するチームは,効果を評価するよりも,その効果を厳密に測定すべきです.
- 制御式アブラレーション: 作業データで同じ2つのポリシーアーキテクチャを訓練する - ビデオ訓練前の視覚骨組み (R3M,SPA,またはDINOv2) を搭載する1つ,画像ネット訓練前の視覚骨組みを搭載する1つ.同じテストセットで評価する.成功率の違いは,特定の作業のためのビデオ訓練前の利点である.
- サンプル効率曲線: 訓練データのうちの25%,50%,75%,100%で両変数を訓練する.それぞれにデータ分数と成功率を図示する.ビデオ前訓練は,データ分数 (25-50%) が低い場合,100%よりも大きな利点を示すべきです.
- OOD評価: 既定物体と環境で両変数をテストする.ビデオ前訓練のエンコーダーは,通常,配布中の評価よりも,配布外の評価 (15-30%の改善) で最大の利点を示します (5-15%の改善).
公開されたおよびRCSV内部評価に基づく期待された結果: 100-300のデモによるテーブルタスク操作の場合は,ビデオプレトレーニングはサンプル効率の15-25%向上 (同じパフォーマンスを達成するために15-25%減少させる) と,新作オブジェクト一般化における絶対的な改善は 10-20%です. 膨大なデータ (1000+デモ) の作業では改善が5〜10%に縮小します.
身体の格差: なぜ ビデオ アクション は 直ちに 移転 し ない か
実施形態のギャップは,インターネットビデオから直接的な政策学習が実現されていない根本的な理由です. その具体的な次元を理解することで,技術的に何が可能か,何が不可能かが明らかになります.
映画不一致.* 人間の腕には7つの主要なDOF (肩3,肘1,腕3) +27DOFが手の中にある.典型的なロボット腕には1DOFの並行マ jaws gripperで 6-7DOFがあります.人間とロボットが実行する同じ作業は,動力構造が異なるため,根本的に異なる関節軌道を使用します.完璧な人間の手追跡でさえ,ロボットが実行できる軌道を生成しません.
- 握手戦略の不一致.** 人間 は 握手柄,握手柄,握手柄,握手柄 など の 何十 種類 を 互換 に 使う.並行 jaws gripper は 握手 モード を ひとつ に 合わせ て い ます.その 状態 を 閉ざ する.人間の 握手柄 の 実験 を 並行 jaws gripper に 移すには,単に 関節 の 角 を 狙う だけ で なく,新しい 握手 戦略 を 発明 する 必要 が あり ます.
力と合致性不一致.* 人間の操作は,皮膚と筋肉組織が自然に合致するものに大きく依存し,これは被動的な力適応を可能にします.ロボットグリッパーは硬い (または制限された,エンジニアリングによる合致性があります).人間が紙のカップを軽く絞り上げ,自動的にカップの合致に調整します. 同じ効果を達成するために ロボットには 明確な力制御が必要です ビデオデータでは ロボットに 自身の力動力について教えることはできません
スケールインパクティブ. これらの不一致は,ビデオが視覚表現の有用な知識 (物体がどんな姿をしているか,どこにいるか,どのような能力を持っているか) を提供するが,有用な運動制御知識 (関節を動かす方法,どの程度の力を使うか,タイミングを調整する方法) を提供しないことを意味します. 機械学習へのビデオの貢献の実用的な限度は この分別によって設定されています:ビデオは操作の"何"と"どこで"に役立つが"どのように"ではなく.
ロボット学習のためのマルチカメラビデオ融合
2026年に研究が拡大する分野は,ロボット学習を改善するために複数のビデオビューポイントを同時に利用している.ほとんどのビデオプレトレーニングは単一のビューポイントデータを使用している一方で,ロボットには実際は複数のカメラ (腕首,上頭,側) があります.このビューポイントの間で表示を並べ替えるのは課題です.
クロスビューコントラスト学習は,エンコーダーに同じシーンの異なるカメラビューの類似した埋め込みを生成するように訓練します.これはビデオプレトレーニングと組み合わせると特に効果的です. 一般的な視覚機能のために,単ビューインターネットビデオでプレトレーニングし,その後マルチカメラロボットデータでクロスビューコントラスト目標で細かく調節します. 映像の知識をインターネット規模で 転送する 視覚エンコードが 実現されつつ ロボットのカメラの配置に 安定しています
| Camera Configuration | Typical Resolution | Frame Rate | Primary Use for Policy | Video 事前学習 Benefit |
|---|---|---|---|---|
| Overhead (third-person) | 640x480 | 30 fps | Spatial layout, object positions | High (matches internet video perspectives) |
| Wrist-mounted (eye-in-hand) | 640x480 | 30 fps | Grasp precision, contact detection | Moderate (egocentric video data helps) |
| Side-angle (45-degree) | 640x480 | 30 fps | Depth disambiguation, approach angle | High (common in cooking/tutorial videos) |
| Depth camera (RealSense) | 640x480 + depth | 30 fps | 3D geometry, height estimation | Low (no depth in internet video) |
実践的なガイド: ビデオを先駆けて訓練したエンコーダー (最高利益) を使って,腕カメラを別々の,より小さなエンコーダーまたは同じエンコーダーの細かなバージョンで処理します. ポリシーのヘッドの前に結果の特徴ベクトルをコンカテネートします. この二重エンコーダーアプローチは,最小の遅延 (並行前行) を追加し,カメラビューでビデオの予備訓練の恩恵を最大限に高めます.
ドメイン特有のビデオキュレーション: ステップバイ・ステッププロトコル
部署領域がインターネットビデオ (調理,パッケージング,電子機器の組み立て,実験室作業) を豊富に備えたチームでは,エンコーダー前のトレーニングのためのドメイン特定ビデオデータセットをキュレーティングすることで,一般的なモデルを10~15%上回ることができます.
- ** 作業に関連したビデオカテゴリーを定義する.** キッチン操作部署の関連カテゴリーには:料理のチュートリアル,料理の準備,キッチン掃除,皿洗濯機の読み込み,食料品の開封が含まれます. 具体的に述べてください. "料理"はあまりにも広い. "切削板で野菜を切り割る"は正しい粒度です.
- **YouTube,Ego4D,およびドメイン専用プラットフォームから動画をダウンロードする.**Yt-dlpを使用して関連する再生リストをダウンロード (ライセンス遵守を保証する).Ego4Dでは,アクティビティラベルによってフィルタ.ドメイン専用ビデオの500~2,000時間を目標にします.より前訓練は良いが,ほとんどのドメインでは過去2,000時間で設定された収益は減少します.
- 操作関連セグメントのフィルター. 調理ビデオのすべてのフレームに操作が表示されない.手検モデル (MediaPipe Handsまたは微調整された YOLO) を使用して,手が目に見える物体と接触するセグメントのみを抽出します.これは通常,操作関連視覚コンテンツを集中しながら,ビデオ全体の60〜70%を削減します.
- 時間対比学習を用いた予備訓練. キュレーティングドメインビデオでR3Mトレーニング目標 (時間対比 +言語調整) を使用する.トレーニングは4×A100 GPUで24
72時間かかる. 1,000時間ビデオでResNet-50のバックボーンでは,4896時間予算. - 一般的なエンコードに比較する. 目標作業から50台のロボットデモを集めた小さなセットで,ドメイン特有のエンコードをDINOv2とR3Mと比較する.ドメイン特有の予備訓練が少なくとも5%の成功率を向上させない場合,一般的なエンコードは十分で維持するのが簡単です.
RCSV内部評価の予想結果: 800時間間の料理ビデオでの領域特別の予備訓練は,一般R3Mと比較して28%でキッチン操作政策サンプル効率を向上させ,DINOv2と比較して12%で改善しました. 改善は新型オブジェクトカテゴリー (ロボット訓練セットに含まれていない食品) に最も大きくなったため,ドメイン特有のビデオは特に強力なオブジェクトの知識を提供していることを示唆している.
リアルタイム部署のための遅延考慮
ビデオ訓練前のエンコーダーは,リアルタイムロボット制御において重要な推論速度で大きく異なります. 10 Hz で実行されるポリシーでは制御サイクルごとに 100ms が必要です.視覚エンコーダーは,アクション予測と通信オーバーヘッドに時間が残るため,この予算内で前向きのパスを完了する必要があります.
| エンコーダ | Params | RTX 4090 (ms) | Jetson Orin (ms) | CPU Only (ms) | Max Control Freq |
|---|---|---|---|---|---|
| R3M (ResNet-50) | 25M | 3-5 | 8-12 | 25-40 | 25+ Hz (all platforms) |
| DINOv2 ViT-B/14 | 86M | 6-10 | 18-25 | 60-90 | 15+ Hz (GPU required) |
| DINOv2 ViT-L/14 | 300M | 15-22 | 40-60 | 180-250 | 10 Hz (desktop GPU only) |
| SigLIP ViT-L/16 | 300M | 14-20 | 38-55 | 170-240 | 10 Hz (desktop GPU only) |
| VC-1 ViT-L/16 | 300M | 15-22 | 42-58 | 185-260 | 10 Hz (desktop GPU only) |
キーイン사이트:R3Mはジェットソン・オリンで20Hz以上で動作できる唯一のエンコードで,デスクトップGPUなしでエッジ部署されたロボットにとって実践的な選択です.部署ハードウェアにはRTX 4090またはそれと同等が含まれる場合,DINOv2 ViT-Bは最高の品質のスピードトレードオフを提供します. ViT-Lモデル (DINOv2-L, SigLIP-L, VC-1) は,デスクトップGPU以外の何かにリアルタイム制御するには通常遅いため,オフライン評価またはバッチ処理に適しています.
端末推論速度で大きなエンコーダーの質が必要とするチームにとって, 知識蒸留は実行可能な方法です.小さな学生エンコーダー (ResNet-50または ViT-S) を訓練して,ロボットカメラデータで大きな教師 (DINOv2 ViT-L) の出力を合わせます.これは,推論速度の35倍で大きなモデルの表現品質の7085%のコンパクトエンコーダーを生成します. 蒸留プロセスは,ロボットカメラデータセット (最低1000+フレーム) と 4~8時間のGPUトレーニングが必要です.
タイムリー・レプレランテーション・学習:フレームレベル対クリップレベル機能
ビデオを先駆けて訓練したエンコーダーを使用する際に重要な建築的な決定は,個々のフレームから機能を取り出すか,または短いビデオクリップから取り出すかである.この選択はパフォーマンスと計算コストの両方に重要な影響を与える.
フレームレベル機能は,エンコードでカメラ画像を独立して処理する.これは最も簡単な統合です.ポリシーは現在のフレームから特徴ベクトルを受信します (オプションとして,以前の1〜3フレームを短い歴史として).2026年に導入されたほとんどのシステムは,任意の画像エンコードと互換性があり,時間計算オーバーヘッドを追加しないため,フレームレベル機能を使用します. R3M,DINOv2とSigLIPは全てフレームレベルの機能を生み出します
クリップレベル機能は,時間動態を捕捉するビデオエンコーダーを通じて,短いフレームの連続 (416フレームで通常515fps) を処理します.VideoMAE,TimeSformer,Hieraのようなモデルは,物体が動く方向,操作行動の段階,または接触に近づく速度などの動き情報をエンコーデする機能を生成します. 映像レベル機能は,動的な相互作用を含む作業において特に価値あるものとする. 投げられた物体を捕まえ,動く織物を折り畳み,または接近軌跡が重要である場所への接続器を挿入する.
妥協は具体的なものです.クリップレベルエンコーダーは前向きパスごとに4-16倍以上の計算を必要とします (複数のフレームを処理する対1),これは最大制御周波数を減らす.RTX 4090で8フレームを処理する ViT-Bビデオエンコーダーは40-60msを要します.制御を15Hzに制限します. フレームレベル DINOv2 ViT-B は同じハードウェアで 6-10ms をかかっており,アクション予測のためのヘッドスペースを 50+ Hz 制御することができます.
実用的な推奨事項: フレームレベル機能をデフォルトとして使用します. 作業が動的なオブジェクト動きを伴う場合のみ,オブジェクト (ロボットだけでなく) の速度と軌跡が決定的に関係している場合のみ,クリップレベル機能に切り替えます. テーブル操作のほとんどは ピックアップ,挿入,スタッキング 3フレームのプロピオシプティブ・歴史を持つフレームレベルの機能が 十分な時間的な文脈を提供します
移転学習戦略:冷凍と調整されたエンコード
ビデオ訓練を先行したエンコーダーを選択すると,政策訓練中にエンコーダー重量を凍結するか,ロボットデータに微調整を許可するか決めなければなりません.両アプローチは,それぞれに優れた制度があります.
| Strategy | Robot Demos | Training Time | In-Distribution | OOD 汎化 | Best When |
|---|---|---|---|---|---|
| Fully frozen encoder | 50-200 | 1-2 hours | 75-85% | 60-75% | Limited data, need fast iteration |
| Frozen + linear probe, then unfreeze last 2 layers | 100-300 | 4-8 hours | 82-90% | 65-80% | Moderate data, balanced in-dist/OOD |
| Full fine-tuning (low LR) | 300-1000 | 12-48 hours | 88-95% | 55-70% | Abundant data, maximum in-dist performance |
| LoRA fine-tuning (rank 4-16) | 100-500 | 3-6 hours | 84-92% | 62-78% | Good in-dist with OOD preservation |
RCSV評価の重要な洞察: ロボットデータが制限されたとき (<200 デモ) に比べて,完全に細かな調整がしばしば_ hurt_ OOD 一般化に影響する.エンコーダーは訓練カメラのビューポイントとオブジェクトインスタンスを過度に超え,ビデオプレトレーニングから得た広い視覚的理解を失います. ロラの4-16級の細かな調整は,ほとんどの実用的なシナリオでは最高のバランスを提供します. コーダーは一般的な視覚表現を壊滅的に忘れずにロボットに特有の視覚機能に適応します.
2段階のトレーニングプロトコル: 200以上のデモを実施したチームでは,2段階のアプローチを使用します.Fase 1: 政策長を冷凍のエンコードで100つの時代を訓練して,強力な行動予測ベースラインを確立します.Fase 2: 最後の24つのエンコードレイヤを冷凍し,50100つの時代を 10倍低い学習率でトレーニングを続けます. このプロトコルは,作業特異的な適応を可能にする一方で,前訓練された特徴を損なう早期梯度ノイズを防ぐ.このプロトコルは,RCSV基準では完全に凍結されたおよび完全に精細化されたアプローチを3〜8%に一貫して上回ります.
プログラミングを 比較する 実践的な 評価 プロトコル
生産パイプラインの特定のエンコードにコミットする前に,この構造評価を実行してデータに基づく決定を下す.
- ** 校正データセットを収集する.** 5 つの持久されたオブジェクトインスタンスを含む目標タスクの50例を表示します (訓練で使用されていません). これは,悪いエンコードの選択を防ぐことで自費を払う一次性コストです.
- 3つのエンコード候補を実行する. 3つのエンコードバージョン (a) のインメイジェネットResNet-50 (ベースライン), (b) R3MResNet-50, (c) DINOv2 ViT-B) で同じポリシーアーキテクチャ (同じアクションヘッド,同じハイパーパラメータ) を訓練する.
- 計算表現品質メトリック. 100 件のトレーニング画像のエンコード機能と計算を抽出する (a) 機能変数 (より高い = より情報提供), (b) 対象のアイデンティティ (より高い = より良いオブジェクト理解) のために最も近い隣人取出し精度, (c) 課題関連属性 (オブジェクト位置,グリッパー状態) のために線形探査精度.
- 推論遅延を測定する. 配備ハードウェア (訓練GPUではなく) にエンコーダーを転送する時間を バッチサイズで1つ 確保してください.操作予測と通信のための少なくとも30%のヘッドスペースを備えた制御ループ予算に収まる.
- 決定をしてください. ビデオ訓練を先行したエンコーダー (R3MまたはDINOv2) がOOD評価で少なくとも5%のImagenet基線を上回らない場合,よりシンプルなImagenetエンコーダーが展開のシンプルさを考慮して好ましいかもしれません.
新たに 登場する 方法: 世界 の モデル の よう に ビデオ
ロボット学習におけるビデオの最も前向きな利用は,表現前訓練を超えて世界モデリングに進む.インターネット規模データで訓練されたビデオ予測モデルは,視覚の世界が時間とともにどのように進化するかを生成モデルに学ぶ. 行動 (または行動の言語説明) に条件付けられた場合 これらのモデルは 次に何が起こるかを予測できます 物理学のシミュレーターとして効果的に提供します
2026年にロボット学習に 3つの具体的な応用があります
- データ増強: リアルデータに存在しないオブジェクト構成のための可視視視軌道を合成するためにビデオ生成モデルを使用します.生成された軌跡は正確なアクションラベルを提供していませんが,トレーニングデータの視覚多様性を増やすことができます.初期の実験では,ビデオ生成増強から一般化改善が5〜10%を示しています.
- 計画: モデル予測制御における先駆モデルとしてビデオ予測モデルを使用します.候補アクションシーケンスの予測視覚的な未来を生成し,目標画像または言語説明に対してスコアします.これは明示的な物理モデルなしで計画が可能ですが,現在のビデオ予測モデルは,高速作業でリアルタイムMPCに遅すぎます.
- 報酬学習: RL の報酬信号としてビデオ予測品質を使用します.ロボットの行動がビデオ予測モデルに高い確率を割り当てている観測を生成した場合,その行動は物理的に合理的である可能性があります.これはビデオモデルに埋め込まれた"物理直感"から導かれる密集した報酬信号を提供します.
ソラとビデオ生成モデル. 大規模なビデオ生成モデル (OpenAI Sora, Runway Gen-3, Google Veo) はテキスト説明から物理的に妥当な操作シーケンスを生成できます.生成されたビデオはアクションラベル抽出に十分な精度がないが,視覚エンコーダーのための追加の予備訓練データとして機能することができます. RCSVでの初試実験では,実際のロボットビデオとソラ生成した操作ビデオの混合でDINOv2を細かく調整することで,ダウンストリーム政策評価で視覚表現の質が 3-7%向上すると示されている.おそらく生成されたビデオは,訓練前のデータにおけるオブジェクトの外観と相互作用の種類の多様性を増加しているためである.
これらのアプローチは2026年に研究段階であり 生産準備はできていませんが 分野が進む方向を代表しています 今日 データインフラを構築するチームは ビデオコンディション付きモデルとの互換性を 将来的な設計基準として考慮すべきです
二つ の 方法 の 優位 に 基づい て 行動 する
RCSVの [データ収集サービス] (
ロボット学習プロジェクトをスタートし,サンプル効率を最初から最大限に高めたい場合は, ビデオプレトレーニングをリアル・ワールドデータ収集と組み合わせるステップ・バイ・ステップアプローチについて, [模倣学習ガイド] (T11
関連 読書
- [オープンX体: ロボットデータセット すべてを変えた]
- [ロボットのための模倣学習:デモから部署まで]
- [ロボット学習のスケーリング法:2026年に知られるもの]
- [ACT vs. Diffusion Policy: いつどれを使えばいいか]
- [ロボット政策一般化:なぜロボットが新しい物体で失敗する]
- [RCSVデータ収集サービス]
ビデオ 訓練 を 高級 の 演示 と 組み合わせる
RCSVのプラットフォームは,最大限のサンプル効率のために高品質の遠隔操作データを持つビデオ訓練式エンコーダーをサポートします.
[模倣学習ガイドを読む]







