机器人模仿学习:ACT,传播政策,VLAs <unk>实用指南 (2026)
完整的机器人学习模仿指南 <unk> ACT,扩散政策,OpenVLA,数据要求,培训管道和故障模式诊断.
从人类示范中训练机器人的实践者指南
模仿学习是什么?
模仿学习通过向机器人展示所需行为示例来训练机器人.而不是手动编程轨迹或工程奖励功能来加强学习,你通过 [远程操作]
核心想法很简单:从人类示范中收集一组数据集 (观察,行动) 双,然后训练一个神经网络来预测当前的观察所做出的正确行动.训练的网络成为机器人的政策,实时运行,以自主控制机器人.
实践中,模仿学习是让机器人在2026年完成新的操纵任务的最可靠方法.强化学习需要数百万个环境相互作用和精心塑造的奖励功能.经典运动规划需要每个对象的明确几何模型. 模仿学习只需要示范
简短的历史:从行为克隆到现代建筑
**行为克隆 (BC) **是最简单的形式:监督学习,直接将观察到行动. 训练一个神经网络 (图像,联合_位置) → (下_行动) 双重使用标准回归损失.BC在示范数据一致时运行良好,并涵盖了机器人在部署过程中遇到的状态分布. 机器人偏离了所示轨迹时失败了.
**Dagger (数据集) **,由Ross等人于2011年推出,通过在机器人实际访问的状态上反复收集新的示范来解决分布转移.训练后,你部署了最初的BC政策,让它漂移,然后让人类纠正结果的状态.这些纠正被添加到训练集中.
**GAIL (Generative Adversarial 模仿学习) **,由霍和埃尔蒙于2016年推出,将模仿学习与对抗训练结合在一起:一个歧视者学习如何区分机器人行为与人类行为, 盖尔处理多模式演示比BC更好,但需要在线环境交互 (通常是在模拟中) 并很难调整.它在现实机器人设置中使用的限制.
2026年占据实世界机器人操纵的三种方法都是基于行为克隆范式的 ACT,扩散政策和VLA模型,但增加了解决其核心局限性的建筑创新.
为什么模仿学习赢得了操纵
在2023年之前,大多数机器人实验室认为强化学习最终会解决操纵.这种期望并没有实现接触丰富的任务.
- **样本效率:**可在一天内收集的50
500个人类示范中训练出有用的模仿学习策略. - **没有奖励工程:**RL需要一个奖励功能,它能完全捕捉到"成功"意味着什么.对于操纵任务,如折叠服装或组装组件,定义奖励是非常困难的.模仿学习完全回避问题.
- **远程运行数据是自然的:**现代远程运行硬件 (领先跟随手臂,VR控制器,外骨架手套) 简单地收集高质量的示范.数据收集过程直接映射到政策输入格式.
- **现实世界兼容性:**RL训练在模拟方面最好,但对接触丰富的操纵的真实传输仍然不靠谱.模拟学习训练直接基于现实世界的数据,消除了训练阶段的现实差距.
- **与基础模型的复合性:**预训练的视觉语言模型 (SigLIP,DINOv2) 提供了强大的视觉表示,模仿学习可以直接利用.RL无法轻松地纳入预训练的表示,因为奖励信号必须流通整个网络.
对于机动 (Unitree的G1,波士顿动力学的亚特拉斯) 和具有明确奖励信号的任务 (游戏玩,导航) 仍然占据了RL的主导地位.
动作与变压器的缩
ACT由2023年斯坦福大学的托尼
如何执行ACT
ACT使用CVAE (条件变动自动编码器) 架构,具有变压器脊椎.编码器处理通过ResNet或ViT视觉编码器传递的当前观测摄像头图像,加上联合位置,并将其编码成隐形表示. 解码器采用了这个隐藏代码并生成了未来_k_行动的序列 (通常是 k=100,代表50 Hz控制的2秒).
关键见解是通过
在部署过程中,ACT使用时间组装:在每一步时,它生成一个新的100步行动部分,但执行的行动是当前部分和之前的预测行动的权重平均值.这进一步平滑了轨迹,减少了
什么时候使用ACT
- 用1
2的机器人手臂操作桌面 (原始的ALOHA使用案例) - 具有相对确定性策略的任务 (选择,插入,组装)
- 需要快速训练的管道
- 当你需要部署在适度硬件上 (运行在单个消费者GPU, ~ 15 ms推理)
对于ACT的典型数据要求
- 简单的选择:50次演示 → 85%+成功
- 双手协调:100次示范 →80%以上的成功
- 精确插入 (插孔,USB):200次示范 →70%以上成功
- 复杂的多步骤任务:需要400
800个示范
清洁的50个,一致的演示通常比有500个
训练ACT与LeRobot
2026年训练ACT的最容易使用的方法是通过
# Install LeRobot
pip install lerobot
# Convert your dataset
python -m lerobot.scripts.convert_dataset \
--raw-dir ./my_episodes/ \
--repo-id my-org/my-task \
--raw-format hdf5_aloha
# Train ACT policy
python -m lerobot.scripts.train \
policy=act \
dataset_repo_id=my-org/my-task \
training.num_epochs=2000 \
training.batch_size=8
训练通常在2
行为:优势与缺点
| Pros | Cons |
|---|---|
| Extremely data-efficient (50 demos for simple tasks) | Struggles with multi-modal action distributions |
| Fast inference (50+ Hz on consumer GPU) | No language conditioning |
| Smooth trajectories via temporal ensembling | Sensitive to demonstration inconsistency |
| Well-supported in LeRobot framework | Single-task only (one policy per task) |
| Low training compute (single GPU, hours) | Temporal ensembling weight requires manual tuning |
传播政策
扩散政策由Chang Chi等人在2023年在哥伦比亚大学推出,应用了
传播政策的运行方式
什么时候使用传播政策
- 具有多个有效战略的任务 (数据包含不同的方法实现相同目标)
- 精确的力轨迹重要的地方,
- 需要高轨迹顺度的任务 (倒,绘制,表面擦拭)
- 当你有多个操作员的数据,
- 当你有一个足够的计算的GPU进行反复代码时 (30
80 ms推理)
传播政策的典型数据要求
- 简单单单模任务:100
200个示范 - 多模式任务 (多个有效战略):200
500次示范 - 复杂接触式操纵:500
1,000次示例
与ACT的主要区别:扩散政策对示范不一致性不那么敏感,因为它可以代表多模式分布.这使得它更宽容于多个运营商收集的数据.
传播政策:优势与缺点
| Pros | Cons |
|---|---|
| Handles multi-modal action distributions natively | Slower inference than ACT (10-30 Hz) |
| Exceptionally smooth trajectories | Needs more data than ACT for simple tasks |
| Robust to operator variation in demonstrations | More hyperparameters (diffusion steps, noise schedule) |
| Strong performance on contact-rich tasks | No language conditioning (without extensions) |
| Supported in LeRobot and robomimic | Higher GPU memory requirements during training |
开放VLA和视觉语言行动模型
视觉语言行动 (VLA) 模型代表2026年机器人学习的边界.它们结合了预训练的视觉语言模型和行动预测,使机器人能够遵循自然语言指令 ("取红杯并将其放在托盘上") 并将其通用到未见过的任务和物体中.
基础模式发生了什么变化
传统模仿学习 (ACT,扩散政策) 从零开始培训任务特定的政策.每项新任务都需要一个新的数据集和一个新的培训运行.VLA模型通过提供已经理解视觉场景和语言的预训练表示改变了这个方程.
实际结果:VLA模型可以在较少的任务具体示范下实现合理的性能,因为视觉理解和语言定位的重量在互联网规模数据和像Open X-Embodiment这样的大型跨体机器人数据集中进行了预训练,
关键的VLA模型
- OpenVLA (伯克利, 2024):基于Llama 2 + SigLIP的开源7B参数VLA.基于开放X-Embodiment数据进行训练.与100
500个示范的新机器人进行精细调.在单个A100 GPU上运行在5Hz. - pi0 (物理智能, 2024
2025):专有VLA训练在跨体体数据,包括巧妙的手. 证明了零射击转移到未见的任务.可通过物理智能的API. - 10月 (伯克利,2024):轻量93M参数一般主义政策. 设计用于快速调整50
200个示范.开源,运行于单个消费者GPU. - RT-2 (谷歌深度思维, 2023):基于 PaLM-E 的 55B 参数 VLA. 最先进的通用化,但需要大量计算 (8 TPU v5e 芯片).
精细调节与从零开始训练
** 精细调节预训练的VLA** (实践路径):从OpenVLA或Octo检查点开始.在机器人上收集100
从零开始训练VLA (仅用于资金丰富的实验室):需要在各种机器人和任务中进行10,000100,000+的示范,加上1001,000+的GPU小时.只有当您正在为新机器人体现类构建基础模型或需要未包含现有VLA的功能时才是合理的.
VLA 模型:优势和缺点
| Pros | Cons |
|---|---|
| Language-conditioned task execution | Slow inference (3-10 Hz) |
| Multi-task from a single model | Requires A100-class GPU for 7B+ models |
| Strong generalization to new objects | Fine-tuning is more complex than ACT/DP training |
| Leverages internet-scale pre-training | Larger models are sensitive to prompt formatting |
| Cross-embodiment transfer potential | Still maturing — fewer deployment success stories than ACT/DP |
算法比较表
| Algorithm | Data Efficiency | 泛化能力 | Compute (Train) | Compute (Infer) | Ease of Training | Best For |
|---|---|---|---|---|---|---|
| ACT | Very high (50-200) | Low (single task) | 1 GPU, 2-8 hrs | 50+ Hz, 1 GPU | Easy | Single-task tabletop, fast iteration |
| Diffusion Policy | High (100-500) | Medium (multi-strategy) | 1 GPU, 4-16 hrs | 10-30 Hz, 1 GPU | Moderate | Multi-modal tasks, contact-rich |
| Behavioral Cloning | High (50-200) | Very low | 1 GPU, 1-4 hrs | 100+ Hz | Very easy | Prototyping, baselines |
| GAIL | Medium (100-1000) | Medium | Needs sim, days | 50+ Hz | Difficult | Sim-only research, locomotion |
| OpenVLA / Octo | High (50-500 fine-tune) | High (cross-task) | 1-4 A100s, 4-24 hrs | 3-10 Hz, 1 A100 | Moderate-Hard | Multi-task, language-conditioned |
培训管道:五个阶段
无论你选择哪个算法,培训管道都遵循这些阶段.
阶段1:数据收集
通过 [远程操作]
在这个阶段,关键的决定是:演示次数 (参见上述算法具体建议),操作员一致性 (启动带的操作员为
阶段2:数据格式化和预处理
转换原始录音为准备训练的格式:
- 图像改大小: 将相机框架改大小,达到模型预期输入分辨率 (通常为基于ViT的编码器224x224 ,为ResNet256x256).使用反
缩改大小 (兰乔或双立方) 保存细节. - ** 行动正常化:** 将操作正常化到 [-1, 1] 范围.计算从训练集中平均和标准偏差.在部署时应用相同的正常化.
- ** 事件过
:** 删除失败的事件,异常持续时间 (>3标准偏差) 的事件,以及质量审查期间标记的事件. - 火车/验证分类: 保持10
15%的节目进行验证. 分类按节目,从来没有按框架. - **格式转换:**对于LeRobot培训,使用
T1 将 HDF5转换为Parquet.对于robomimic,使用其本土的 HDF5加载器.查看我们的 [数据格式指南] T7 ) 详细信息.
第三阶段:培训
典型的训练配置按算法:
- ACT: 2,000
5,000个时代,学习率1e-5与可西斯时间表,批量大小8 16.训练时间:在单个RTX 4090上2 8小时. 散政策: 5002,000个时代,学习率1e-4与可西因时间表.DDPM与100个 散步步骤进行培训,DDIM与10 50步骤进行推断.培训时间:4 16小时,单个RTX 4090. - VLA精细调节: 20
100时代,学习率2e-5.7B+型号的LoRA (排名16 64) 或1B型号的完全精细调节. 1 4A100GPU上训练时间:4 24小时.
监测训练损失和验证损失. 如果验证损失在几百个时代后与训练损失分歧,你已经过度适应了
阶段4:评估
验证损失是现实世界性能的弱预测.唯一可靠的评估是部署实际机器人的政策和测量任务成功率.运行至少20次评估试验以获得统计意义的结果 (95%的保证间隔约为20次试验的 ±20%,50次试验的 ±10%).记录每个评估事件进行故障分析.
根据两个条件进行评估: (1) 标题
阶段5:部署
导出训练模型到ONNX或TorchScript用于部署.在机器人的内置GPU上运行推理 (内嵌的NVIDIA Jetson Orin,工作站RTX 4060+).监测推理延迟
记录每一个部署事件,以获得 [数据飞行车]
算法数据要求
| Task Complexity | ACT | Diffusion Policy | OpenVLA (fine-tune) | Octo (fine-tune) | Typical Success Rate |
|---|---|---|---|---|---|
| Simple pick-place | 50 | 100 | 100 | 50 | 80-95% |
| Bimanual coordination | 100 | 200 | 200 | 100 | 70-85% |
| Precise insertion | 200 | 300 | 300 | 150 | 65-80% |
| Multi-step assembly | 500 | 500 | 500 | 300 | 50-70% |
| Multi-task (language-cond.) | N/A | N/A | 500-2000 | 200-1000 | 40-70% |
训练硬件要求: ACT和扩散政策训练在单个RTX 3060或更好的 (16GBVRAM推
5常见的失败方式和如何解决它们
1. 分布转移 (组合错误)
症状: 政策在最初几秒钟内运行,然后逐渐偏离轨道并失败.
**根源原因:**随着时间的推移,小预测错误复杂,将机器人推向训练数据中未表示的状态.
修正: 使用动作分量 (ACT预测100步分量,减少错误可能复杂的决策点数量).在训练期间添加图像增强 (随机作物,色彩震动) 让视觉编码器强大到轻微的视角变化.收集恢复示范:运行政策直到它漂移,然后从漂移状态进行远程操作完成任务. 这些"DAgger式"纠正是您可以添加的最高价值数据.
2\ 多模式崩 (模式平均)
**症状:**机器人移动到两个有效的策略之间位置,没有达到任何一个.或者机器人在决策点结冰,多个策略同样有效.
根源原因: 培训数据包含了不同的战略示范 (从左到右的方法),而MSE损失平均将它们归纳到单个错误的中间轨迹.
修正: 转换为多模式分布的扩散政策. 如果您留在ACT,则将示范策略标准化
3. 行动预测的复合错误
**症状:**机器人产生正确的轨迹,但随着时间的推移积累了位置错误,导致1
**根源原因:**训练和部署之间的行动正常化不匹配 (不同平均/日值),或政策预测长轨道上积累浮点错误的三角形行动.
** 修复:** 检查在训练和部署期间使用相同的正常化统计数据 (平均,STD,min,max). 偏好绝对的联合位置目标,而不是多角行动.对于多角行动政策,定期将预测的轨迹重新定向当前观察到的状态,而不是纯粹集成多角.
硬件不匹配
症状: 当移动到不同的表格,不同的照明或相同机器人模型的不同实例时,在原始数据收集设置中运行良好的政策完全失败.
**根源原因:**摄像头位置转移 (即使是5毫米度的抓住),照明条件变化 (影响视觉特征),或机器人关节校准不同单位.
** 修复:** 永久安装硬灯的摄像头,在每次部署会议之前检查外观.使用校准目标 (ArUco板) 检查摄像头姿势.多机器人部署,收集每个机器人单元上的小型校准数据集 (20
5. 无法设置重置
症状: 政策似乎成功率低,但仔细检查显示,许多失败来自于已出门训练分布的状态,
根源原因: 评估协议无法正确地将场景重新设置在训练间分布状态下.
** 修正:** 定义明确的重置标准:对象位置,机器人家庭配置和场景安排. 在每个评估事件之前检查重置质量. 在数据收集期间,系统地随机地对预期部署分布进行初始状态进行排序. 作为数据集的指标,追踪初始状态覆盖.
实体对象的评估
模拟和部署在真实机器人上训练是吸引人的,因为模拟数据基本上是免费的.
模拟有什么帮助
- **Sim预训练+真实细节调整:**训练10,000
100,000模拟集,然后对50 200真实集进行细节调整.Sim预训练提供了强大的初始化;真实细节调整弥合了现实差距. - 域间随机化: 在模拟训练中随机化视觉特性 (纹理,照明,摄像头位置) 和物理 (摩擦,质量,关节
缩).强迫政策强有力的变化,其中一些与现实变化重叠. - 机动和全身控制: Sim-to-real对机动的操作效果比操纵更好. Unitree的G1和Go2控制器几乎完全通过 Isaac Lab进行模拟.
- 政策验证和调试: 在在实际硬件上部署之前,在模拟中运行训练有素的政策.模拟捕获严重错误 (错误的操作空间,正常化错误,控制频率不匹配) 没有冒着硬件损坏的风险.
模拟没有帮助
- **纯真实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实
- **模拟摄像头图像作为训练数据:**尽管光现实
染技术取得了进展,但仅仅在模拟摄像头上训练的政策显示,在实际摄像头上,成功率降低了30 50%.神经 染 (基于NeRF) 正在改善,但尚未为政策培训做好生产准备. - 涉及可变形物体的任务: 织物,绳索和食品非常难以精确模拟.
开始检查列表
按照以下10步骤,从零到实施模仿学习政策:
- ** 选择您的机器人硬件.** 对于第一个项目:ViperX-300 S2,Koch v1.1或[OpenArm]
T9 ).预算:2000美元 8,000美元.您需要控制位置在50Hz最小. - 设置远程操作. 领袖跟随手臂以获得最高数据质量,或VR控制器 (Meta Quest 3) 以更低的成本.
- 安装摄像头. 最低: 1 个手腕摄像头 (Intel RealSense D405) + 1 个空头摄像头 (RealSense D435).使用
硬的安装 - 安装录音软件. 使用LeRobot的数据录音工具或ALOHA录音堆
.验证HDF5输出包括正确频率的图像,联合位置和操作. - 定义你的第一项任务. 开始简单:从一个固定位置中选出一个单个对象,将其放置在目标区.
- ** 收集50个示范.** 连贯操作员,一致的策略. 每20集中每次要花10分钟检查数据质量. 立即拒绝和重新记录坏集.
- ** 训练您的第一份ACT政策.** 使用LeRobot的训练脚本,使用默认的超参数.训练应该在2
4小时内完成,使用单个GPU. - 运行20次评估试验. 每次试验前重置场景相同.记录成功/失败,并保存每个试验的视频用于失败分析.
- 诊断故障并收集针对数据. 确定最常见的故障模式. 收集20
30个专门针对故障的示范. 重新训练. - ** 修复到80%的成功率.** 大多数团队在2
3个收集培训周期内达到80%以上,然后开始扩展到 数据飞行车 操作.
常见的问题
我需要多少次演示?
对于 ACT 进行简单的选择和放置任务:50次示范通常足以实现80%以上的成功率.对于扩散政策:从100
哪个选择?
如果您的任务有一个单一的明确战略,并且您希望实现最快的途径,请使用ACT. 如果您的数据包含多种有效方法用于相同的任务 (多个运营商,模糊的把握策略),请使用扩散政策.如果您需要语言条件的多任务执行,请使用VLA. 在怀疑时, 开始使用ACT
我可以用模拟数据吗?
模拟数据本身对于接触丰富的操纵来说是不可靠的.最有效的方法是模拟预训练+真实细调:训练在10,000+个模拟集中,然后细调在50
我需要什么机器人硬件?
最少:一个机器人手臂,可控制50Hz的位置 (ViperX-300,Koch v1.1,OpenArm或类似),一个远程操作接口 (领袖手臂或VR控制器),2
模仿学习与加强学习有什么区别?
模仿学习从人类示范中
训练需要多长时间?
通过RTX 4090播放200集:2
我应该使用哪种数据格式?
HDF5是机器人示范数据的标准格式. 存储联合位置 (qpos),速度 (qvel),摄像头图像和操作作为每个集文件中的单独数据集.与LeRobot进行训练,转换为Parquet格式.查看我们的 [数据格式指南]
模仿学习能否有效地操纵移动?
虽然它需要更多的数据 (500
让RCSV专家收集你的训练数据
斯威尔士国家数据集团提供端到端数据收集服务:训练有素的运营商,校准硬件,质量控制和在您的目标格式中交付.







