世界机器人模型:它们为什么重要,它们如何工作
了解如何通过基于想象力的规划,真实转移和安全验证,实现了像Dreamer,IRIS和TD-MPC2这样的学习动态模型.
杰里·黄 · 2026年4月22日
世界模型是从行动中预测未来状态的学习动态模型,允许机器人在实际世界中执行之前,在想象中规划,探索和验证行为.它们正在迅速成为机器人学习堆
世界榜样是什么?
世界模型是一个神经网络,从数据中学习环境的动态.鉴于当前状态 (或观察) 和行动,模型预测下一个状态,奖励,以及是否结束了事件. 这不是一个新想法 -- 基于模型的增强学习已经存在了几十年了 -- 但深度学习,大规模数据和现代序列建模的结合使得世界模型从2020年以来更加有能力.
实际上,大多数现代世界模型在学习的隐藏空间中运作,而不是直接基于原始观测.该模型由三个组成部分组成:
- 编码器: 将原始观测 (图像,自观,点云) 映射到一个紧
的隐形表示中. - 动力学模型: 根据当前的潜伏状态 z_{t+1} 预测下一个潜伏状态 z_t 和动作 a_t.这是世界模型的核心.
- **解码器 (decoder):**从潜伏状态中重建观测,预测奖励和预测事件结束.这些提供训练信号,并使想象中的轨迹进行评估.
让世界模型有用的关键属性是,一旦训练,动态模型可以在想象中"滚动" - - 您可以模拟数千条轨迹,而不用触摸真正的机器人. 这使得计划,政策优化和安全验证完全可以在学习模型内进行.
机器人需要世界模型
无模型增强学习 (RL) 方法如PPO和SAC通过尝试和错误学习,需要数百万个环境相互作用融合.在模拟中,这只是昂贵.在真实硬件上,它是不实用的和危险的 - - 机器人手臂随机探索将与物体碰撞,损坏最终效应器,浪费数周的墙钟时间. 世界模型通过四种机制解决了这一根本的瓶
1. 样品效率
世界模型从每一个现实世界的互动中提取更多的学习信号.世界模型将其作为训练数据存储,而不是一次更新值函数的过渡 (s,a,r,s').一旦模型足够准确,代理可以通过推出模型来产生无限的合成体验. 例如,Dreamer v3从200万个环境框架中学习了Atari游戏,在哪里无模型方法需要50-200万个框架,从而提高了样本效率100-1000倍.对于机器人,每个框架的成本是实时和硬件的实际磨损,这种差异是存在性的.
计划和看头
通过一个准确的世界模型,机器人可以在承诺之前评估候选行动序列.使用学习动态模型的模型预测控制 (MPC) 通过: (1) 提出N候选行动序列, (2) 通过世界模型推出每个序列, (3) 通过预测累积奖励评分每个轨迹,以及 (4) 从最佳轨迹执行第一个行动. 这种规划循环在每一步都重复,
3 安全验证
在使用实用机器人之前,你可以用世界模型运行它,以检查危险状态 - - 碰撞,关节限制违规,过度强力或工作空间边界违规. 这比物理模拟更快,更便宜,因为世界模型在GPU上运行,每步都像一个前进的通行, 它也比手调模拟更现实,因为世界模型从实际数据中学习,并捕捉到难以分析模拟的现象 (电缆动态,软物体变形,传感器噪音).
4. 转移到真实
基于真实的机器人数据训练的世界模型是学习的模拟器,它们与真实动态相匹配. 模拟与真实之间的差距 - - 物理模拟与现实之间的不匹配 - - 是模拟训练的机器人政策中占主导地位的失败模式. 训练在即使是适量实体数据 (1-10小时的互动) 的世界模型可以捕捉到难以模拟的动态:电缆路由,可变形的对象操纵,各种表面上的摩擦和合规的接触.
关键建筑
机器人技术专业人员最关心的建筑是以下.
梦想家 (v1, v2, v3) --哈夫纳等人, 2020-2023
梦想家是最成熟和最广泛使用的世界模型框架.它学习了反复状态空间模型 (RSSM),它保持了确定性反复状态 (捕捉历史) 和静止隐形状态 (捕捉不确定性). 经纪人完全学习了演员-批评政策, 完全在世界模型的想象中的轨迹内, 没有必要在最初的数据收集阶段之后在现实环境中进行RL.
梦想家v3 (2023) 引入了几个关键改进:对具有极其不同的奖励规模的任务中奖励和值正常化的符号预测,分离隐形表示 (32个类别变量每个类别为32个级别 = 1024维分离码),以及一个统一的超参数组,在150多个任务中工作,而不调节. 它是世界上第一个收集从零开始的钻石模型代理人. 这项任务需要在各种游戏状态中进行数百次连续的决定.
对于机器人,Dreamer v3是默认的起点.它自然处理连续控制,在适度的GPU预算 (单个RTX 3090) 上训练,并已成功应用于现实机器人操纵,机动和导航任务.它的主要限制是长视线组合错误:对于需要200+步的准确预测任务,想象中的轨迹偏离现实.
国际货币基金组织 (IRIS) --米切利等人,2023年
IRIS (在内话中自动回归的想象) 采用了根本不同的方法:它将观测和行动都作为VQ-VAE的分离代币,然后用自动回归变压器来模型联合序列.世界模型基本上是GPT式的下一个代币预测器,对交叉的观测和行动代币进行预测.
这种架构具有巨大的优势:它继承了大型语言模型的扩展特性.随着模型尺寸和数据的增加,预测质量会有望预测地提高.IRIS在26款Atari游戏中10个游戏中实现了超人性能,仅使用100K环境互动 - 与Dreamer v3相比,但具有更容易扩展的架构.
交易的结局是,通过VQ-VAE的代号化引入了损失压缩.对于精确的操纵 (螺丝头的确切位置,连接器的方向) 有关的细粒度空间信息可以在离散的瓶
其他技术技术:
TD-MPC2 (模型预测控制的时间差异学习,版本2) 结合了学习的隐形动态模型与模型预测控制在推断时.与Dreamer不同,TD-MPC2使用了通过模型预测路径整体 (MPPI) 算法直接用于在线规划的世界模型. 在每一步控制时,它采样行动序列,通过动态模型推出它们,使用学习值函数进行分数,并执行最佳的第一步.
TD-MPC2的关键贡献是表明,单一组超参数和单一模型架构可以解决104个连续控制任务,包括移动,操纵和导航.该模型使用了一个简单的基于多层感知器的隐形动态模型 (没有重复,没有注意力) 与共同学习的编码器,动态,奖励和值函数. 这种简单的方法使得训练速度快,
在机器人领域,TD-MPC2是令人信服的,当你希望世界模型通过规划直接驱动控制而不是将其蒸
等,2024年
基于视频传播模型架构,它可以从单个模型中模拟各种环境 (室内,室外,操纵,导航). 关键的见解是,互联网规模的视频数据包含隐含的物理 - - 物体掉落,流体流动,门摇摆 - - 一个足够大的生成模型可以在没有明确的物理监督的情况下学习这些动态.
UniSim在像素空间而不是隐藏空间中运作,这意味着它可以呈现可直接解释的光现实未来框架. 这对于人类对计划轨迹的检查和训练下游视觉政策来说是有用的. 然而,像素空间生成是计算上昂贵的:在A100上生成16个
无线电系统的功能在机器人堆
灵魂/灵魂2 - 布鲁斯等,2024年
基尼 (Generative Interactive Environments) 是谷歌DeepMind的基础世界模型,它基于互联网规模的视频.基尼2将其扩展到3D环境,从单个图像提示生成一致的可控制的世界模拟.与任务特定的世界模型不同,基尼是作为一个用于特定领域的环境生成器设计的.
对于机器人,Genie的重要性是作为一个预先训练的基础模型.而不是从零开始训练一个世界模型,用机器人数据 (需要10-100多小时的互动),你可以在一个小量的域特定数据上调整Genie,并利用其以前对物理和空间关系的知识. 这种范式 - - 基础世界模型 + - 域细节调整 - - 反映了基础语言模型的成功,
隐形空间与像素空间世界模型
建筑设计的决定是最重要的,
| Property | Latent-Space (Dreamer, TD-MPC2) | Pixel-Space (UniSim, Genie) |
|---|---|---|
| Rollout speed | ~0.1ms per step (GPU) | ~50-200ms per step |
| Planning compatibility | Real-time MPC feasible | Offline planning only |
| Human interpretability | Low (latent vectors are opaque) | High (viewable video frames) |
| Spatial precision | Task-dependent (can be high) | Limited by generation resolution |
| Training compute | Single GPU (hours-days) | Multi-GPU cluster (days-weeks) |
| Data efficiency | Good (100K-1M frames) | Poor (needs millions of frames or pre-training) |
| 泛化能力 | Narrow (domain-specific) | Broad (foundation models generalize across domains) |
| Best use case | Real-time control + online RL | Data augmentation + offline evaluation |
**实用建议:**2026年大多数机器人工程项目,将隐藏空间世界模型 (Dreamer v3或 TD-MPC2) 作为主要动态模型.如果您需要人类可检查的安全审查或利益相关者沟通部署,请添加一个使隐藏轨迹成为视频的像素空间解码器. 这让你能够实现隐藏空间规划的速度,
培训数据要求
世界模型只能与训练数据一样好.这是世界模型性能中最重要的单一因素,并且是新进入该领域的团队最常低估的.
什么样的数据
世界模型需要过渡双倍数: (观察_t,行动_t,奖励_t,观察_{t+1},完成_t).对于机器人,观察通常包括:
- 从一个或多个摄像头 (手腕安装,上头或两者). 64x64到 256x256分辨率是标准的;更高的分辨率会增加训练成本,而大多数任务都没有成比例的好处.
- ** 亲自感知状态:** 关节位置,速度,抓住状态,终端效应器姿势.总是包括这个 - 它提供了精确的状态信息,补充了噪音视觉观测.
- ** 行动:** 在每一步时间中发送给机器人的命令.对于武器,这通常是联合速度或终端效应的德尔塔命令. 行动表示必须与您的部署政策输出一致.
- 奖励 (在线培训时可选):完成任务的信号,距离到目标的距离或稀少的成功指标.
数据量
根据结构和任务复杂性,数据要求有所不同:
- Dreamer v3: 50-200集 (10K-50K转型)用于单任务操作. 500-2000集用于多任务或复杂的接触丰富任务.
- **TD-MPC2:**类似于Dreamer用于操纵.可以开始有效地计划,只需20-50集,才能完成简单的任务,但复杂的任务需要200+集.
- **IRIS:**由于VQ-VAE代币化培训,更渴望数据.
- **UniSim/Genie:**需要在互联网规模数据上进行预先培训. 如果基础模型强
,则在域特定数据上进行精细调节可以使用50-500集.
质量不仅仅是质量
低质量的数据积极损害世界模型培训.
- 不一致的控制频率: 如果数据收集以可变的速度运行 (有时10Hz,有时30Hz),动态模型会学习不一致的时间关系.
- 状态动作错误排列: 如果观察时间和行动时间标记不合适,模型会学习错误的动态. 使用硬件时间标记,而不是软件时间标记.
- 不够的状态覆盖: 一套1000集的数据集,所有集都从相同的初始配置开始,价值不到200集,初始状态不同.世界模型只能预测它观察到的动态.
- ** 错误的事件:** 由于硬件问题 (编码漂移,通信下降,抓住器故障) 任务失败的事件教导世界模型错误的动态.
目前的限制
作为一个世界型号,我们有能力,但并不是一个解决的问题.
造成错误的复杂性
每个世界模型预测都有一些错误.当你推出100多步的模型时,这些错误会复合--每一个预测都是基于之前的预测,而不是地面真相.到200步,想象中的轨迹可能与实际发生的情况很不相似.这限制了有效的规划视野为当前模型的20-50步 (在10Hz控制下2-5秒). 需要更长的规划视野的任务需要层次性方法或定期重新依据实际观察.
分配变化
世界模型只能在训练期间看到的状态空间区域上准确. 如果您的政策探讨了世界模型从未遇到的状态 - - 一个新奇的对象配置,一个不寻常的碰撞状态,或不同的照明条件 - - 更糟糕的是,政策可以学习利用世界模型中的不准确性,找到"想象中的"高收益轨迹,而这些轨迹不会转移到现实中.基于集体的不确定性估计 (训练多个世界模型和测量预测不一致) 通过标记不确定预测部分缓解这一点.
长期忠诚
即使在分布中,世界模型也面临着长时间的接触式交互序列.堆叠三个块,通过多个指南线程,或组装多部分机制,每个都需要精确预测数百次连接事件. 目前的世界模型可以处理短接触序列 (抓住,推,插入),但在扩展的多步骤组装任务上降低.这是一个积极的研究界限.
计算在线规划的成本
对于MPPI的TD-MPC2来说,这意味着512次推出 x5次 =2560动态模型前进通过每次控制步骤.在RTX 4090上,这运行在15Hz,这对许多操纵任务而言是足够的,但对高频机动控制来说是不足的. 减产规划 (将规划器
世界模式如何补充VLA和传播政策
世界模型不是视觉语言行动 (VLA) 模型或传播政策的替代品.它们占据了机器人学习堆
**世界模型+VLA:**RT-2或Octo这样的VLA可以从视觉观测和语言指令中生成操作.世界模型可以作为验证器 - - 在机器人执行VLA的建议行动之前,世界模型模拟结果并检查安全违规. 如果预测结果是危险的 (碰撞,过度的力),系统可以拒绝行动并要求替代. 这类似于象棋机使用世界模型 (游戏规则) 来评估候选人的运动,然后选择一个.
世界模型+传播政策: 传播政策通过从学习分布中抽取样本来生成各种行动轨迹.一个世界模型可以根据预测结果质量评分这些候选人,选择最有可能成功的轨迹.这结合了传播政策的多模式表达性和世界模型的前
数据增强的世界模型: 可能是最实用的短期用途:将收集的数据训练成世界模型,然后使用它来生成下游VLA或扩散政策的合成训练集. 这可以以 GPU计算而不是额外的数据收集为代价,增加您的有效数据集规模3-10倍. 合成数据应与真实数据 (通常是50至80%的合成,20至50%的真实) 混合,以保持基层.
实际比较:Dreamer v3 vs IRIS vs TD-MPC2 vs UniSim
| Property | Dreamer v3 | IRIS | TD-MPC2 | UniSim |
|---|---|---|---|---|
| Architecture | RSSM (GRU + stochastic latent) | VQ-VAE + autoregressive Transformer | 多层感知器 encoder + 多层感知器 dynamics | Video diffusion (U-Net or DiT) |
| Parameters | ~20M (S), ~100M (L), ~200M (XL) | ~80M (base), ~300M (large) | ~5M (S), ~19M (M), ~317M (L) | ~1-3B |
| Data needs (single task) | 50-200 episodes | 200-500 episodes | 50-200 episodes | Pre-trained + 50-500 fine-tune episodes |
| Training GPU | 1x RTX 3090 (6-24h) | 1x RTX 3090 (12-48h) | 1x RTX 3090 (2-12h) | 8x A100 (days-weeks) |
| Inference speed | ~50us/step (imagination) | ~1ms/token | ~0.1ms/step (latent rollout) | ~100-200ms/frame |
| Primary task domains | 操纵, locomotion, games | Atari, discrete-action domains | Continuous control (manipulation, locomotion) | Navigation, manipulation (visual) |
| Key strength | Universal hyperparameters, robust | Scaling properties, discrete tokens | Fast training, flexible reward | Photorealistic, broad generalization |
| Open-source | Yes (danijar/dreamerv3) | Yes (eloialonso/iris) | Yes (nicklashansen/tdmpc2) | No (research preview only) |
连接到RCSV:世界模型培训数据收集
建立一个好的世界模型从好数据开始.RCSV的 [数据收集服务]
对于训练世界模型的团队,我们提供与Dreamer v3 (NPZ剧集),TD-MPC2 (HDF5) 和HuggingFace LeRobot生态系统 (Parquet +视频) 兼容的格式数据集.每个数据集包括自感状态 (关联位置,速度,抓住状态),多视觉RGB (手腕 + 640x480的顶部摄像头) 和校准的行动标签.
世界模型预训练特别受益于数据多样性 - - 包含许多不同的场景,对象和操纵策略的集.我们的 [公共数据集] (
相关阅读
- Dreamer vs IRIS vs TD-MPC2 -- 选择世界模型的详细比较
- [开始与世界模型]
T4 ) -- 实践教程与代码 - [机器人学习的传播政策]
T5 ) - 如何扩散政策补充世界模型 - VLA模型解释 --视觉语言行动模型和世界模型集成
- [机器人培训数据是什么?]
- RCSV数据服务 --世界模型培训轨迹数据集
- [公共数据集]
T9 ) -- 准备使用的操纵数据集







