返回Blog

机器人从视频中学习:2026年最先进的技术

2026年从视频中学习机器人的全面调查:视觉预训练 (R3M, MVP),视频语言行动模型,什么工作,什么不工作,以及对数据收集的实际影响.

T4)

在互联网上存在数十亿小时的人类操纵视频.使用这些数据来教导机器人的承诺是真实的,

为什么机器人学习视频如此吸引人

通过 [电话操作]收集机器人示范数据每小时产生30到120集.一个每天运行8小时的机器人站的研究小组每天收集约500到1,000集.同时,YouTube单独每分钟收到500多小时的视频. 教程,木匠演示,工厂装配录像,手术程序,互联网包含了实质上每一个机器人可能需要完成的物理任务的演示,

如果机器人能够直接从这段视频中学习,限制物理人工智能的数据瓶将在很大程度上消失.而不是花费数月收集特定硬件上的任务具体示范,团队可以简单地将其模型指向互联网视频的相关子集并训练通用操纵政策.

现实,从2026年开始,更加微妙.视频已经证明对机器人学习非常有用,但不是简单的叙述所示的方式. 从视频到机器人行为的道路通过特定的技术方法,每个都有不同的优势和严格的限制.

三大基本问题

视频显示发生的事情 - - 一个手伸手拿到杯子,抬起来,倒水 - - 但它不记录产生这些运动的动力命令. 机器人政策需要将观察到行动:关联速度,终端效应器的移动,抓住器命令.视频提供了观察侧面,但不是行动侧面. 恢复视频中的行动需要解决根本未确定的反向问题.

体体不匹配. 人手具有27度的自由度,具有丰富的触觉反的符合性皮肤,与机器人抓住器有着显著不同的力量能力.人类倒水使用指压,手腕扭矩和液体运动信号来进行自觉反,而在7DOF臂上安装的平行爪抓住器上没有直接模拟. 即使你可以从视频中提取完美的行动标签, 这些行动描述了人类的动机命令,

视角不匹配. 人类视频从第一人 (自私) 或第三人视角捕获,这些视频很少与机器人摄像头的放置相匹配.机器人通常拥有手腕摄像头和一个或多个固定的空头摄像头.从人视视频中学习的视觉特征可能不会在机器人视觉观测上正确激活,从而限制了视觉政策的直接转移.

实际上是什么:视觉表现预训练

基于视频的机器人学习最强大的验证结果是视觉表示预训练. 方法:训练一个视觉编码器在大量的人类操纵视频上 - - 没有任何行动标签 - - 然后使用结果的表示来初始化机器人政策网络的视觉脊柱. 这将持续提高下游机器人学习的样本效率15-40%.

R3M (Nair et al., 2022) 在Meta的Ego4D数据集中预训练了ResNet,使用与语言配合相结合的时间对比学习目标.当使用于启动Franka操纵策略时,该视觉编码器在多个基准任务中提高了15-40%的样本效率,而相比于ImageNet预训练. 在机器人学习研究中,R3M仍然是最广泛使用的视频预训练的编码器之一.

MVP (Masked Visual 预训练, Xiao et al., 2022) 在自我中心视频和 ImageNet 数据的组合上使用了掩盖的自动编码.学习的表示将很好地转移到机器人控制任务,证明自主监督的预训练在操纵相关的视频上超越了监督的机器人政策学习的 ImageNet 功能.

SPA (Zhu et al., 2024) 扩大了预训练范式,以空间意识目标,以更好的3D空间推理产生表示.SPA比R3M更具可解释空间特征,同时显示了比较或更好的下游机器人性能.

结果背后的机制是很清楚的:人类操纵视频包含了大量关于物体的信息 - - 物体如何看起来,被推或抓住时如何移动, 视觉编码器已经看到数千小时的人抓住杯子, 知道一个可抓住的杯子是什么样子, 这正是机器人抓住政策所需要的表现.

视频语言行动模式:新边界

视频语言行动模型 (VLA) 组合了视频预训练的视觉编码器,语言理解和行动预测在一个单一的架构中.关键见解:语言提供了视频的语义内容和机器人需要执行的具体行动之间的桥梁.

RT-2 (Brohan等, 2023) 证明,在互联网尺度上预训练的VLM图像文本数据可以精细调整,直接输出机器人操作.视觉预训练 - 包括广泛的视频数据 - 给了RT-2强大的视觉理解,转移到机器人操纵. RT-2 显示了对新物体和在机器人数据收集过程中未见的指令的有意义的零射通用化.

SuSIE (Black et al., 2023) 作为一个子目标生成器使用了视频生成模型:在当前的观察和语言指令的情况下,它生成了一个可信的未来图像,显示了目标状态,然后一个低级的政策执行了行动,以达到所生成的子目标. 这种方法利用视频预测能力 - - 在互联网视频上训练 - - 为机器人提供视觉规划.

UniSim (Yang等同, 2023) 进一步了,从视频数据中训练了一种通用模拟器,可以预测视觉世界如何应对行动而演变.这个学习的世界模型可以实现模型预测控制:机器人通过视频预测模型运行它们来想象候选行动的后果,并选择最好的预测结果的行动序列.

这些方法代表了真正的进步,但它们有重要局限性.VLA模型需要大量的机器人特定的细调数据来产生可靠的行动 - - 视频预训提供视觉理解和语义定位,而不是精确的运动控制. 苏西和UniSim在结构化环境中工作,但尚未足够强大,以实现精密任务的生产部署.

尚未有效的:直接从互联网视频中学习政策

通过互联网视频进行端到端的机器人政策培训的梦想 - - 没有机器人数据 - - 仍然无法实现到2026年.

  • 反动力学模型试图通过预测连续之间的作用来将视频标记为伪动作.这需要解决人类姿势估计到分厘米精度,将人类关节角重定向于机器人动力学,并处理体现差距. 现在的重定位管道适用于手臂运动,
  • DMP轨迹配件通过姿势估计从视频中提取手轨迹,并将动态运动原始物与它们相匹配. 这将移动到达粗,但无法准确抓住,插入或任何接触动态重要任务.
  • 视频直接调节的政策,将视频示范作为输入并产生机器人操作,在控制设置中表现出了简单任务的承诺,但尚未对待视角,实施和物理的缺口,足以充分实现一般部署.

基本问题是,视频缺乏机器人政策所需的行动监督信号.视觉表示传输很好,因为感知很大程度上是独立于体现 - - 一杯看起来像杯子,不管人类还是机器人看着它.

视觉预训模拟比较

下面的表将2026年初可用于机器人政策初始化的主要视频预训练的视觉编码器进行比较.所有数字都反映了已发布的下游操纵基准.

Model 预训练 Data Backbone 样本效率 Gain Novel Object Improvement Params
R3M Ego4D (egocentric video) ResNet-50 15-40% +12-18% 25M
MVP Ego4D + ImageNet ViT-B/16 20-35% +10-16% 86M
SPA Ego4D + spatial tasks ViT-B/16 25-40% +14-20% 86M
DINOv2 LVD-142M (curated images) ViT-L/14 20-35% +15-25% 300M
SigLIP WebLI (image-text pairs) ViT-L/16 15-30% +12-22% 300M
VC-1 Ego4D + ImageNet + robot video ViT-L/16 25-45% +15-22% 300M
ImageNet ResNet (baseline) ImageNet-1K (classification) ResNet-50 Baseline (0%) Baseline (0%) 25M

重要发现:DINOv2和VC-1在2026年提供了最强大的总体结果,但它们也是最大的模型 (300M参数),这影响了推理速度.R3M仍然是一个强大的选择,当推理延迟问题 (25M参数,运行在CPU).SPA提供了最佳的空间推理,这对于精确的放置任务很重要. 如果您计划稍后调整到VLA管道中,则 SigLIP提供语言配对,这是有用的.

精细调节指南:从预训练的编码器到机器人政策

集成视频预训练的编码器到您的政策培训管道中需要仔细决定该编码器的数量要结,如何将其结合到行动预测,以及如何管理学习率计划.

**步骤1:选择你的编码器.**对于大多数桌面操作任务,DINOv2 ViT-B/14 (86M参数) 提供了表现质量和推断速度之间的最佳权衡.对于延迟敏感的应用 (>20 Hz控制),使用R3M ResNet-50 (25M参数).对于VLA兼容的管道,使用SigLIP.

步骤2:决定要结什么. 三种策略,从最保守到最不保守:

  • 通过使用预训练的编码器作为固定功能提取器. 仅在任务数据上训练政策主题 (行动预测网络). 这最适合你有不到100个示范时. 训练时间:在单个GPU上1-2小时.
  • 结早期层,调整后期层. 结第75%的编码器 (捕捉到一般视觉特征),并调整最后25%的政策头. 这使编码器能够适应您的特定摄像头视角和照明,同时保持广泛的视觉知识. 最适合100-500次示范.
  • 训练整个模型,编码器的学习速度比政策主题低10-100倍 (例如编码器 LR = 1e-6,政策主题 LR = 1e-4).这是最灵活的,但需要300多个示范,以避免编码器过度适应.

**步骤3:处理分辨率不匹配.**大多数预训练有素的编码器预计224x224或384x384输入.机器人摄像头通常以更高的分辨率 (640x480,1280x720) 捕捉.重新尺寸输入以匹配编码器的预期分辨率.不要改变编码器的补丁尺寸或位置编码 - 这会丢弃预训练的信息. 如果您的任务需要高分辨率的细节 (例如阅读包装上的小文字),请考虑从多种作物中提取功能,而不是缩小规模.

# Example: Using DINOv2 as a frozen encoder for ACT-style policy
import torch
from transformers import AutoModel, AutoImageProcessor

# Load pre-trained DINOv2
encoder = AutoModel.from_pretrained("facebook/dinov2-base")
processor = AutoImageProcessor.from_pretrained("facebook/dinov2-base")

# Freeze encoder weights
for param in encoder.parameters():
    param.requires_grad = False

# Extract features from a robot camera image
image = camera.capture_rgb()  # (480, 640, 3) numpy array
inputs = processor(images=image, return_tensors="pt")
with torch.no_grad():
    features = encoder(**inputs).last_hidden_state  # (1, 257, 768)
    cls_token = features[:, 0, :]  # (1, 768) -- global image feature

# Feed cls_token + proprioception to your action prediction head
obs = torch.cat([cls_token, joint_state], dim=-1)  # (1, 768+7)
action = policy_head(obs)  # (1, chunk_size, action_dim)

代表性基准:哪个编码器用于哪个任务?

基于已发表的废除和内部RCSV评估,以下是具体任务的建议:

  • 桌面上选择和位置 (硬体): DINOv2 ViT-B提供了最强的性能.自主监督的预训练捕获了直接转移到操纵的对象级别特性.
  • 可变化的物体操纵 (织物,食品): R3M或VC-1在变形任务上超过DINOv2,因为视频预训练中的时间对比目标捕获了静态图像预训练错过的物体动态. 20-30%的改善.
  • 语言调控: SigLIP提供了最强大的转移,因为预训练的语言视觉配合帮助政策基础语言指令在视觉特征中提高15-25%.
  • ** 接触丰富的插入任务:** 所有视觉编码器都提供了最小的好处 (<10%的改善),因为这些任务主要由自觉感知和力反,而不是视觉功能.考虑在更大的视觉编码器的位置添加[力扭矩传感器]T6) 数据.
  • 多环境通用化: DINOv2 和 VC-1 提供了最大的OOD改善 (20-30%) 因为它们的多元化预训练数据包括广泛的视觉多样性.R3M的自我中心视频数据集更窄,并且在环境变化中更不好地传输.

数据管道集成:从视频编码器到政策培训

为了将视频预训练的编码器集成到现有的模仿学习管道,需要具体的数据处理和训练修改.

# video_encoder_pipeline.py -- Integrate pre-trained encoder into IL training
import torch
from torchvision import transforms

class VideoPretrainedPipeline:
    """Pipeline for using video-pretrained encoders in IL training."""

    def __init__(self, encoder_name="dinov2_vitb14", freeze=True):
        self.encoder = torch.hub.load('facebookresearch/dinov2', encoder_name)
        self.freeze = freeze
        if freeze:
            for param in self.encoder.parameters():
                param.requires_grad = False

        # Normalization must match pre-training distribution
        self.transform = transforms.Compose([
            transforms.Resize(224),
            transforms.CenterCrop(224),
            transforms.Normalize(
                mean=[0.485, 0.456, 0.406],
                std=[0.229, 0.224, 0.225]),
        ])

    def extract_features(self, image_tensor):
        """Extract features from a single camera image.
        Args: image_tensor: (B, 3, H, W) in [0, 1]
        Returns: (B, 768) feature vector for ViT-B
        """
        x = self.transform(image_tensor)
        with torch.no_grad() if self.freeze else torch.enable_grad():
            features = self.encoder(x)  # CLS token: (B, 768)
        return features

    def build_observation(self, image, proprioception):
        """Combine visual and proprioceptive features.
        Args:
            image: (B, 3, H, W) camera image
            proprioception: (B, D) joint angles, gripper state
        Returns: (B, 768 + D) combined observation
        """
        vis_features = self.extract_features(image)
        return torch.cat([vis_features, proprioception], dim=-1)

关键的实施细节: 标准化参数 (平均,STD) 必须与编码器预训练中使用的值完全匹配.使用不正确的正常化降低了10-30%的性能,因为编码器接收了未经分配的输入.DINOv2和R3M都使用ImageNet正常化值. SigLIP使用了不同的正常化-- 在整合之前检查模型卡.

对于多摄像头设置,每一个摄像头视图即时化一个编码器或在视图中共享一个编码器 (权重共享).重量共享是最好选择的:它减少了记忆使用量,并在视图中产生了更一致的功能空间.

值得注意的重要论文和系统

对于基于视频的机器人学习的团队来说,

  • 机器人操纵演示的自我中心视频预训.视觉预训练的基础.
  • 面具视觉预训练,结合视频和图像数据.与不同训练方法的R3M强大的替代品.
  • SuSIE (2023):视频生成作为机器人操纵的子目标规划. 展示了视频预测模型如何指导机器人行为.
  • UniSim (2023):从视频中学习的通用模拟器.显示视频训练的世界模型可以支持模型预测控制.
  • RT-2 (谷歌深思, 2023):视觉语言模型为机器人操作进行了微调.建立了主导目前研究的VLA范式.
  • GR-2 (ByteDance, 2024):视频生成模型适用于机器人政策学习,扩大了更大的SuSIE方法.
  • 10月 (2024):开源通用机器人政策,视频预训练的视觉脊柱.希望建立VLA架构的团队的实用起点.

目前的限制:视频不能教导机器人

了解基于视频学习的严格界限,可以防止团队过度投资于无法满足特定任务的方法.

  • ** 动力调节.** 视频没有提供有关抓紧力,插入力或接触压力的信息.从中倒水的人根据重量变化,腕矩和液体流动动态调整抓紧力 - - 任何这些都无法从视频中恢复.对强力敏感任务的政策需要使用 [强力矩感知]T7的机器人本土示范.
  • 视觉指导后,人类在闭上眼睛完成许多操纵任务 - - 运动控制是自觉的.视频只捕捉到视觉结果,而不是自觉控制循环. 基于关节扭矩反,触觉接触感知或动力记忆 (盲目插入,将螺丝紧到目标扭矩) 的任务没有任何益处.
  • **时间和速度配置.**视频速率 (通常是24-30fps) 低于快速操纵任务的时间动态.一个快速的选择和位置周期,持续0.8秒,仅在30fps时的20-24,时间分辨率不足以学习分辨一个流的专家运动和一个的初学者的速度和加速配置.
  • 双手协调时间.双手任务,左到右臂协调的精确时间至关重要,无法从视频中恢复.视频中两个臂可能似乎同时移动,但需要实际的动机命令中50-100ms的时间抵消以避免碰撞或实现适当的测序.

视频 预训练实施检查列表

为了让团队能够将视频预训集成到他们的管道,

  1. 根据您的任务类型选择编码器 (参见上述表示基准).默认建议:DINOv2 ViT-B用于一般操作;R3M用于缓存敏感应用.
  2. ** 下载预训练的权重.**所有建议的编码器都可以从T2,T3或原始的纸质存储库中获得.
  3. 匹配输入分辨率. 改造机器人摄像头图像以匹配编码器预期输入 (224x224对于大多数VIT模型,224x224对于R3MResNet).用于缩小尺度使用双线插射.
  4. ** 结的标准标志与精细调节码器.** 开始使用结的码器 (最快,最安全). 如果50多次演示后性能不足,则切换到最后25%的部分精细调节.
  5. **监控功能质量.**在机器人摄像头图像上可视化编码器的注意力图 (ViT) 或激活图 (ResNet).如果编码器主要关注背景而不是与任务相关的对象,则它不会提供有用的功能,您可能需要不同的预训练来源或更积极的细节调整.
  6. ** 运行控制式除.** 在开始更复杂的管道之前,总是与ImageNet的基线进行比较,以量化您的具体任务的实际效益.

收集数据的团队的实际影响

鉴于2026年的现状,研究对数据收集决策的团队意味着:

** 使用视频预训练的视觉编码器.** 启动您的视觉脊柱使用R3M,SPA,MVP或视频预训练的视觉变压器而不是ImageNet重量.这是免费的15-30%样本效率提高,不需要额外的数据收集.每个团队都应该这样做.

**还收集机器人本土演示,用于行动学习.**视频提供视觉表示;机器人远程操作提供动作标签训练数据.这些是互补的,而不是替代品.投资高质量的远程操作数据收集和使用视频训练的编码器的团队将超过一个完全依赖于任何方法的团队.

**将视频预训练与数据增强组合起来.**视频预训练的编码器和数据增强是互补的,而不是替代的.视频预训练提供了一般的视觉表示;数据增强使这些表示对特定部署变化强大.即使使用视频预训练的编码器,也可以应用颜色,随机产量和亮度增强. 在RCSV排放中,DINOv2预训练加上标准增强的组合可以提高OOD成功率的25-35%比ImageNet基线没有增强的比率 - - 比任何技术本身提供的比率高15-20%.

**在数据收集中使用语言指令.**VLA范式依赖于语言条件的行为.如果你收集与相关的自然语言指令 ("取红杯","放螺栓在洞里"),你的数据将直接与视频训练的语言视觉配合的VLA细调管道兼容. 如果没有语言标签,你会失去这种联系.

考虑域名特定视频策划. 如果你的目标任务域域拥有丰富的视频 - - 例如,包装或电子设备组装 - - 通过视频学习的视觉特征对于厨房操纵任务更相关,

**预计算和缓存编码功能.**对于1000集以下的数据集,预计算每个框的视觉编码功能,并将其与原始图像一起存储.这消除了训练期间编码器的前进通过 (节省了结编码器的训练时间的50-80%) 并允许在视觉编码器重新运行的情况下快速代行动预测架构. 维特-B功能的缓存文件通常为10-50MB/集 (768个尺寸/框30fps30秒).

**不要等待仅仅视频训练才能发挥作用.**视频和视频加机器人数据方法之间的差距仍然很大. 延迟数据收集等待仅视频方法成熟的团队正在犯一个战略错误. 现在收集真正的机器人数据,使用视频预训练来增强其价值,并随着它们的可用性,整合更好的视频方法.

实用评估:如何衡量视频预训的好处

通过视频预训的团队应严格测量其影响,而不是假设它有帮助.

  • ** 控制式排放:** 在任务数据上训练两个相同的政策架构 - 一个具有视频预训练的视觉脊柱 (R3M,SPA或DINOv2), 一个具有ImageNet预训练的脊柱. 根据相同的测试组进行评估.成功率的差异是视频预训练对您的具体任务的可归因的好处.
  • 样本效率曲线: 训练两种变体使用25%,50%,75%和100%的训练数据. 绘制成绩率与数据分数.视频预训应在较低的数据分数 (25-50%) 上显示更大的优势,而不是100%,因为预训练的表征在任务特定数据稀缺时提供更强大的预训.
  • OOD评估: 在保留物体和环境上测试两种变体.预训练的视频编码器通常在未经分配的评估 (15-30%的改善) 上显示了它们的最大优势,而不是在分配中的评估 (5-15%的改善).

基于已发表的内部评估和RCSV的预期结果:对于100-300次示范的桌面操纵任务,视频预训提供了15-25%的样本效率提高 (这意味着需要15-25%的示范减少才能达到相同的性能) 和新物体概括的10-20%的绝对改善. 对于大量数据 (1000多次示例) 的任务,改善缩小到5-10%.

身体的差距:为什么视频行动不会直接传输

互联网视频的直接学习政策仍然未实现的根本原因是体现差距.

机器人手臂具有7个主要DOF (肩膀3,肘部1,手腕3) 加上27个DOF.典型的机器人手臂具有6个和7个DOF,并行部抓住器是1DOF.人类和机器人执行的任务基本上使用不同的关节轨迹,因为机器人结构不同.即使是完美的人类手跟踪也不能产生机器人可以执行的轨迹.

手抓手套的方法不一致.** 人类可以互换地使用手指尖抓手套,动力抓手套,手抓手套和其他几十种手套配置.平行手套的抓手套的模式完全是一个:关闭手套.将人类的手指尖抓手套的示范转移到平行手套需要发明一种新的抓手套,而不仅仅是重新定向关节角.

机器人抓住器是刚硬的 (或有限的,工程的合规性).一个人用温柔的挤压来拿起一杯纸,自动调整到杯子的合规性. 机器人需要明确的控制力来实现相同的效果, 没有多少视频数据能教导机器人自身的力量动态.

规模影响. 这些不匹配意味着视频提供有用的视觉表示知识 (物体的外观,位置,它们的功能) 但没有有用的运动控制知识 (如何移动关节,应用多少力,如何协调时间). 视频对机器人学习的贡献的实际上限是由此分区设定的:视频帮助操纵的"什么"和"何处",但不是"如何".

多摄像头视频融合用于机器人学习

2026年,越来越多的研究领域正在同时使用多个视频视角来提高机器人学习.虽然大多数视频预训使用单个视角数据,但实际上机器人拥有多个摄像头 (手腕,上头,侧).挑战是将这些视角中的表示对齐,以便预训练的功能无论摄像头的位置如何都保持有用.

跨视觉对比学习训练编码器产生相同场景的不同摄像头视图的类似嵌入.这在与视频预训练相结合时尤其有效:在单视频互联网视频上进行预训练,以获得一般视觉功能,然后在多摄像头机器人数据上进行对比目标的微调. 结果是视觉编码器, 传输互联网规模的视觉知识,

Camera Configuration Typical Resolution Frame Rate Primary Use for Policy Video 预训练 Benefit
Overhead (third-person) 640x480 30 fps Spatial layout, object positions High (matches internet video perspectives)
Wrist-mounted (eye-in-hand) 640x480 30 fps Grasp precision, contact detection Moderate (egocentric video data helps)
Side-angle (45-degree) 640x480 30 fps Depth disambiguation, approach angle High (common in cooking/tutorial videos)
Depth camera (RealSense) 640x480 + depth 30 fps 3D geometry, height estimation Low (no depth in internet video)

实际指导:使用视频预训练的编码器 (最大效益) 处理手腕摄像机,使用单独的更小的编码器或相同编码器的精细调节. 这种双码码方法增加了最小的延迟 (并行前行) 同时最大限度地提高了视频预训练的效益,

域名特定视频监护:一步一步的协议

对于部署领域的团队 (,包装,电子组装,实验室工作) 提供大量的互联网视频,编码器预训练的域特定视频数据集的策划可以超过一般模型10-15%.

  1. ** 定义与任务相关的视频类别.** 对于厨房操纵部署,相关类别包括:教程,准备食物,厨房清洁,洗碗机装载,杂货卸载. 具体说明 - - ""太广泛; "切割板上的蔬菜"是正确的细分性.
  2. ** 从YouTube,Ego4D和特定域名平台上获取视频.**使用 yt-dlp下载相关播放列表 (确保许可合规).对于Ego4D,按活动标签过.目标500-2,000小时的域名特定视频.更多是预训练的好处,但对于大多数域名来说,过去2000小时的回报率下降.
  3. ** 制相关段片的过器.** 制视频中的每一个图片都不显示操纵. 使用现货手检测模型 (MediaPipe Hands或精细调化的YOLO) 仅提取手可见和接触物体的段片.这通常会减少视频总量60-70%,同时集中操纵相关视觉内容.
  4. 使用时间对比学习进行预训. 在您的策划域视频上使用R3M训练目标 (时间对比 +语言对齐).训练需要24-72小时使用4xA100GPU,用于1000小时视频的ResNet-50脊柱.对于ViT-B,预算为48-96小时.
  5. 与通用编码器进行评估. 在您的目标任务中进行50个机器人示范的小组中,将您的域名特定编码器与DINOv2和R3M进行比较. 如果域名特定预训练不会提高至少5%的成功率,通用编码器是足够的,更简单的维护.

预期RCSV内部评估结果:在100个机器人示范中进行特定领域的预训练,在视频800小时时时,与一般R3M相比,厨房操纵政策样本效率提高了28%,与DINOv2相比提高了12%. 改进在新型物体类别 (不属于机器人培训集中的食物) 上是最大的,这表明特定领域的视频提供了特别强大的物体供应知识.

实时部署的延迟考虑

视频预训练的编码器在推理速度上有很大的不同,这对于实时机器人控制来说很重要.在10Hz运行的政策中,每个控制周期有100ms;视觉编码器必须在这个预算范围内完成前进传递,以留下行动预测和通信上空费用的时间.

编码器 Params RTX 4090 (ms) Jetson Orin (ms) CPU Only (ms) Max Control Freq
R3M (ResNet-50) 25M 3-5 8-12 25-40 25+ Hz (all platforms)
DINOv2 ViT-B/14 86M 6-10 18-25 60-90 15+ Hz (GPU required)
DINOv2 ViT-L/14 300M 15-22 40-60 180-250 10 Hz (desktop GPU only)
SigLIP ViT-L/16 300M 14-20 38-55 170-240 10 Hz (desktop GPU only)
VC-1 ViT-L/16 300M 15-22 42-58 185-260 10 Hz (desktop GPU only)

关键见解:R3M是Jetson Orin上可运行20+Hz的唯一编码器,因此它是没有桌面GPU的边缘部署机器人实际选择.如果您的部署硬件包括RTX 4090或相等,DINOv2 ViT-B提供了最佳的质量速度交易. 维特-L模型 (DINOv2-L,SigLIP-L,VC-1) 通常太慢,无法实时控制任何其他桌面GPU,并且更适合离线评估或批量处理.

对于需要在边缘推理速度的大型编码器的质量,**知识蒸**是一个可行的途径:训练一个小学生编码器 (ResNet-50或ViT-S) 来匹配一个大老师 (DINOv2 ViT-L) 的输出. 这产生了一个紧的编码器,具有70-85%的大型模型的表示质量,在推理速度的 3-5倍. 化过程需要您的机器人摄像头数据集 (最低1000+个框架) 和4-8小时的GPU训练.

时间表现学习:框架级别与剪辑级别特征

在使用视频预训练的编码器时,一个关键的建筑决定是从单个框架中提取功能还是从短视频片段中.

** 框架级功能** 通过编码器独立处理每个摄像头图像.这是最简单的整合:该政策从当前的框架中接收了一个特征向量 (选择性地将前1-3个框架作为一个简短的历史). 2026 年大多数部署的系统使用了框架级功能,因为它们与任何图像编码器兼容,并且没有添加时间计算的总费用. 它们都具有层级的功能.

** 剪辑级功能**通过捕捉时间动态的视频编码器处理短片序列 (通常4-16个框架以5-15fps速度) 视频编码器.像VideoMAE,TimeSformer和Hiera这样的模型产生编码运动信息的功能 - - 物体移动方向,操纵行动的阶段或接触速度. 剪辑级别的功能对于涉及动态交互的任务特别有价值:捕获抛出的物体,折叠移动的布料或插入接头,即接近轨迹是重要的.

交易是具体的:剪辑级码器需要每次前进传输的计算量增加4-16倍 (处理多个框架与一个),从而降低了最大的控制频率.RTX 4090上处理8个框架的ViT-B视频码器需要40-60ms,限制控制到15Hz - 对接触丰富的任务来说是边缘性的. 级DINOv2 ViT-B在同一硬件上采用6-10ms,允许50+Hz控制,以预测行动空间.

实用建议: 默认使用级功能.只要任务涉及动态对象运动,而对象的速度和轨迹 (而不仅仅是机器人) 具有决定性意义,只需转换到剪辑级功能. 对于大多数桌面操作 - - 选取位置,插入,堆叠 - - 具有3个的自觉感知历史的框架级功能提供了足够的时间背景.

转移学习策略:冷与精确调节的编码器

一旦你选择了视频训练先进的编码器,你必须决定在政策训练中是否将编码器重量结,或者允许它们对你的机器人数据进行细节调整.

Strategy Robot Demos Training Time In-Distribution OOD 泛化能力 Best When
Fully frozen encoder 50-200 1-2 hours 75-85% 60-75% Limited data, need fast iteration
Frozen + linear probe, then unfreeze last 2 layers 100-300 4-8 hours 82-90% 65-80% Moderate data, balanced in-dist/OOD
Full fine-tuning (low LR) 300-1000 12-48 hours 88-95% 55-70% Abundant data, maximum in-dist performance
LoRA fine-tuning (rank 4-16) 100-500 3-6 hours 84-92% 62-78% Good in-dist with OOD preservation

根据RCSV评估的关键见解:在机器人数据有限时,与结的编码器相比,完整的细调通常会造成伤害. (<200个演示).编码器过度进入训练摄像头的视角和对象实例,从而失去了它从视频预训练中获得的广泛视觉理解. 对于大多数实际场景来说,LoRA的4-16级调整提供了最佳平衡:它将编码器适应机器人特定的视觉特征,而不会破坏一般视觉表示.

**两阶段培训协议:**对于200多次示范的团队,使用两阶段方法.第一阶段:将政策负责人训练用结的编码器100个时代,以建立强大的行动预测基线.第二阶段:解最后的2至4个编码器层,并继续训练,50至100个时代的学习速度降低了10倍. 这样,防止早期梯度噪音破坏预训练的特性,同时允许具体任务的适应.该协议在RCSV基准中,在完全结和完全精细调化的方法中,都保持3%至8%的性能.

测量你的编码器:一个实用的评估协议

在对生产管道进行特定编码之前,执行此结构化评估以做出数据驱动的决定.

  1. 收集一个校准数据集. 50次展示你的目标任务,包括5次持久的对象实例 (从未用于训练).这是一次性成本,通过防止错误的编码选择来支付自己.
  2. **运行三个编码程序候选人.**使用三个编码程序变体训练相同的政策架构 (相同的行动头,相同的超参数): (a) ImageNet ResNet-50 (基线), (b) R3M ResNet-50, (c) DINOv2 ViT-B.
  3. 计算表现质量指标. 100个训练图像的编码功能和计算 (a) 特性差异 (更高 = 提供更多信息), (b) 对象身份的近邻检索精度 (更高 = 更好的对象理解), (c) 对任务相关属性 (对象位置,抓住器状态) 的线性探测精度.
  4. ** 测量推断延迟.** 时间将编码器传递到您的部署硬件 (而不是您的训练GPU) 上,并使用批量大小 1. 确保它符合您的控制循环预算,至少有30%的预测和通信空间.
  5. ** 决定.** 如果视频训练先进的编码器 (R3M或DINOv2) 在OD评估中不超过ImageNet的基线至少5%,更简单的ImageNet编码器可能是最好用于部署的简单性.如果它确实超过了基线,请使用它 - 并且根据预算计算.

新兴方法:视频作为世界模式

视频在机器人学习中最具前景性的使用超越了表现预训练到世界建模.在互联网规模数据上训练的视频预测模型学习了视觉世界随着时间的推移的生成模型. 当这些模型被条件化到行动 (或语言描述行动) 上时,它们可以预测下一步会发生什么 - - 有效地提供一个学到的物理模拟器.

这有三个具体的应用程序,

  • 数据增强: 使用视频生成模型合成可观的视觉轨迹,用于在实际数据中不存在的对象配置.生成的轨迹不提供准确的行动标签,但它们可以增加训练数据的视觉多样性.早期实验显示,视频生成的增强率提高了5-10%.
  • 规划: 在模型预测控制中使用视频预测模型作为前进模型.生成候选行动序列的预测视觉未来,并根据目标图像或语言描述进行分数.这使得没有明确的物理模型的规划能够实现,尽管当前的视频预测模型对于快速任务的实时MPC太慢 (每秒预测).
  • 奖励学习: 使用视频预测质量作为奖励信号.如果机器人的行为产生了视频预测模型赋予高概率的观察,则行为很可能是物理可行的.这提供了来自视频模型内嵌的"物理直觉"的密集奖励信号.

索拉和视频生成模型. 大规模视频生成模型 (OpenAI Sora, Runway Gen-3, Google Veo) 可以从文本描述中生成物理可靠的操纵序列.虽然生成的视频不足以准确地提取行动标签,但它们可以作为视觉编码器的额外预训练数据. 在RCSV进行初步实验表明,在真实机器人视频和索拉生成的操纵视频混合中调整DINOv2可以在下游政策评估中提高视觉表示质量3-7%,可能是因为生成的视频增加了预训数据中的物体外观和交互类型的多样性.

这些方法在2026年才有研究阶段,而不是生产阶段. 但它们代表了该领域正在发展的方向,

建立在两种方法中最好的方法

根据RCSV的 [数据收集服务]和 [数据平台]的基础构建了研究支持的混合方法:视频预训练的视觉编码器与高质量的机器人示范数据结合,用于行动学习. 我们的收集管道将数据出口到与主要VLA架构兼容的格式中,包括Octo,OpenVLA和RT-2-类型的模型,默认包含语言指令标签.

如果您正在启动机器人学习项目,并且希望从一开始就能最大限度地提高样本效率,请查看我们的 [模仿学习指南]T11) 逐步方法,将视频预训练结合与目标实体数据收集.

相关阅读

  • [开放的X体:改变了一切的机器人数据集]
  • [机器人模仿学习:从示范到部署]
  • [机器人学习的规模规则:2026年我们所知道的内容]
  • [活动与传播政策:何时使用哪种]
  • [机器人政策概括:为什么机器人在新物体上失败]
  • [RCSV数据收集服务]

结合视频预训练与高质量的演示

RCSV 的平台支持视频预训练的编码器,具有高质量的远程操作数据,以实现最大的样本效率.

[阅读模仿学习指南]