返回Guides

机器学习机器人:初学者的完整指南 (2026)

了解机器学习如何推动现代机器人 模仿学习,增强学习,扩散政策,以及如何使用真正的硬件.

机器学习如何推动现代机器人从模仿学习和强化学习到基础模型以及开始使用真正的硬件的实际路线图.

机器人学习现在为什么要成为机器人学习

几十年来,机器人被用明确的指示编程:移动协调X,紧握,升30mm,移动协调Y.这对于每个物体都处于已知位置的结构化工厂环境来说有效.但在不结构化的环境中,它然失败了.

机器学习通过让机器人从数据而不是手写的规则中学习行为来改变了这个方程.而不是编程每一个可能的场景,你会给机器人展示例子,让它通用化.这个概念并不是新的.研究人员自1990年代以来一直在学习基础上的机器人技术上工作.

让它变得实用的三项突破

  • 用于机器人技术的变压器架构 (2022-2024): 作为大型语言模型的驱动器,相同的注意力机制在处理机器人观测序列方面表现出了显著的效果.谷歌的RT-2,斯坦福的ACT和流散政策工作表明,基于变压器的模型可以从相对适度的数据集中学习复杂的操纵行为. 这与以前的方法相比,需要数百万个相互作用样本的步骤改变.
  • 基础模型和视觉语言行动模型 (2024-2026): OpenVLA,RT-X和Octo等模型证明,一个预训练模型可以在不同的机器人实施,任务和环境中通用化. 这使得数据需求从数万集降至数百个,使实世界机器人学习成为小团队的实用性.
  • 可负担的可用硬件: 完全的机器人学习设置 6-DOF 臂,手腕摄像头和计算 现在成本低于5,000美元,像 [OpenArm]T0) 和SO-101等平台.五年前,相当的设置需要5万美元以上的工业硬件. 降低成本使得大学实验室,初创公司和以前无法购买硬件的个人医生能够接受机器人 ML 研究.

结果是,在2026年,一名研究生或初创工程师可以通过模拟学习,在一个周末训练一个机器人执行新的操纵任务.

机器人 ML 的四大方法

机器人机器学习不是单一的技术.有四种主要方法,每个方法都有不同的优势,数据需求和使用情况.

Approach How It Works Data Needed Best For Limitations
模仿学习 Robot learns from human demonstrations (teleoperation recordings) 50-500 demonstrations per task 操纵 tasks with clear human strategy: pick-and-place, assembly, tool use Cannot exceed demonstrator skill; struggles with tasks requiring exploration
Reinforcement Learning Robot learns by trial and error, maximizing a reward signal Millions of trials (usually in simulation) Locomotion, dynamic tasks, behaviors that exceed human capability Requires careful reward design; sample-inefficient; sim-to-real gap
仿真到现实迁移 Train in simulation, transfer learned policy to real robot Unlimited (simulated), plus domain randomization Tasks where simulation is accurate: locomotion, grasping simple shapes, navigation Reality gap for contact-rich manipulation; sim fidelity limits policy quality
Foundation Models / VLAs Large pretrained models fine-tuned for robot control using vision and language 10-100 demonstrations for fine-tuning (pretrained on millions of diverse robot episodes) General-purpose manipulation, language-conditioned tasks, multi-task robots Compute-heavy inference; still maturing; may not match specialist policies on specific tasks

对于大多数初学者来说,模仿学习是正确的起点. 它具有最低的进入障碍,最快地产生工作政策,并建立了您需要的数据收集和评估技能,无论您最终专业化的方法如何.

深入潜水:模仿学习

模仿学习 (也称为从示范中学习) 是让机器人执行新的操纵任务的最实用的方法. 核心想法:一个人通过想要的行为多次远程操作机器人,机器人通过训练学习从观测 (摄像头图像,联合位置) 到行动 (联合速度或位置命令) 的地图绘制.

行为克隆

模仿学习的最简单形式是行为克隆 (BC):把问题视为监督学习.收集示范轨迹 (观察-行动对的序列),然后训练神经网络来预测所观察的行为.在推断时,机器人观察当前状态,通过训练的网络来养它,并执行预测的行动.

行为克隆是易于实施的,而且很快训练的,但它有一个基本缺点:复合错误.如果机器人略微偏离了所示轨迹 (而且它总是这样做),它会遇到在训练中从未见过的观测,导致越来越差的预测.这就是为什么天真行为克隆经常在长视野任务上失败的原因. 下面的解决方案解决了这个问题.

动作与变压器的

ACT由2023年斯坦福大学的托尼·等人推出,通过预测未来行动的块而不是单一下一步行动来解决复合错误.该模型采用了一系列观察,并在一个前进传输中输出了下50-100个时间行动步骤. 这种"行动分断"意味着机器人承诺执行轨迹段,从而减少预测错误积累的频率.

ACT使用变压器编码器处理观察历史和CVAE (条件变量自动编码器) 来处理示范的多种模式不同的运营商可能以稍微不同的方式执行相同的任务,模型需要捕捉这种变化而不是平均对其进行. 机器人技术界中,ACT已成为最广泛复制的方法之一,特别是用于使用ALOHA式硬件进行双手操作.

详细的了解,请参阅我们的 [模仿学习指南]T1.

传播政策

扩散政策由Chang Chi等人在2023年在哥伦比亚大学推出,将拒绝扩散框架 (像稳定的扩散等图像生成模型背后的相同核心想法) 应用到机器人行动预测.而不是直接预测行动,模型学习以反复将随机行动序列归纳在一个基于当前观测的连贯轨迹.

基于扩散的行动生成的优势在于它自然处理多模式的行动分布.当执行任务的多种有效方法 (从左或右侧选择,从上方或侧面接近),扩散模型则明确地表达这种不确定性,而不是平均,从而产生更平滑,更自然的机器人行为. 扩散政策在许多操纵基准上实现了最先进的性能,并且对于插入,擦拭和折叠等接触丰富的任务特别有效.

交易是推断速度:通过反复测试生成操作需要每个操作部分5-20次前进通行,而ACT则需要单次前进通行.在现代GPU上,这在10-30Hz上运行,这对于大多数操作来说是足够的,但可能是限制的高速度任务.

深入潜水:加强学习

强化学习 (RL) 采用了根本不同的方法:而不是向机器人展示该做什么,你定义了一个奖励函数,它测量机器人表现得多好,并通过试错发现有效的行为.机器人采取行动,观察结果,接收奖励信号,并逐渐改进其政策以最大限度地提高累积奖励.

关键算法:PPO和SAC

**PPO (近距离政策优化) **是机器人技术中最广泛使用的RL算法.由OpenAI开发,PPO是一种政策梯度方法,限制了政策更新以避免灾难性性能下降.它是稳定的,相对容易调整,并且对连续和离散的行动空间都很好. 据悉,PPO是来自Unitree和波士顿动力学研究团队的四旋翼运动示范 (步行,跑步,停车) 的最令人印象深刻的算法.

**SAC (软演员评论) **是一个非政策算法,可以最大限度地提高政策中的奖励和透 (随机性).透奖励鼓励探索并产生适合扰乱的政策.SAC在许多任务中比PPO更有效,因为它利用从重播缓冲中重新获得过去的经验. 对于训练在模拟中进行操纵任务,它特别有效.

什么时候使用RL与模仿学习

在以下任务中,RL优异:

  • 人类难以证明最佳行为 (动态投篮,手中的转向,敏捷的运动)
  • 你希望机器人能发现超越人类能力的策略
  • 你有一个可靠的模拟环境,机器人可以运行数百万集
  • 奖励函数是简单的定义 (达到目标,保持平衡,最大化距离)

染病发生在:

  • 奖励函数很难精确地指定 ("衫好好"看起来像什么?
  • 任务需要接触丰富的操纵,而模拟精度很差
  • 您需要快速制定工作政策 (RL培训通常需要几个小时到几天的GPU时间)
  • 你没有良好的模拟环境,必须在现实硬件上训练 (样本效率不足于大多数现实世界RL)

模拟环境:伊萨克·西姆和MuJoCo

NVIDIA Isaac Sim是一个基于Omniverse的GPU加速物理模拟器.其主要优势是巨大的平行性: Isaac Sim可以在单个GPU上同时运行数千个机器人环境,每小时产生数百万的体验样本.这使其成为RL训练和操纵政策的首选平台. 艾萨克·西姆还为真实视觉传输提供了光现实染,并与艾萨克健身房进行了本土整合,用于RL训练.

**MuJoCo (多关联动态与接触) **,现在在DeepMind下开源,是机器人学习研究中最广泛使用的物理引擎.MuJoCo是快速的,数量稳定,并为操纵任务产生精确的接触动态. 它运行于CPU (并且通过MJX越来越多的GPU),与所有主要RL框架集成,并且拥有最大的预建机器人模型和基准任务生态系统.对于初学者来说,MuJoCo通常是更容易的起点,因为其广泛的文档和标准化基准任务 (Gymnasium机器人环境).

需要的数据:多少足够?

首先,我们需要一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的方法,一个实践的

模仿学习数据要求

  • **简单单单臂的选择和位置 (固定物体,固定位置):**20-50次示范.ACT和扩散政策都在这个规模中达到80%以上的成功率.
  • 可变的选择和位置 (随机定位,不同对象): 100-200个示例.对象位置和类型的更大变化需要更多的数据来概括.
  • **接触丰富的操纵 (插入,擦拭,折叠):**200-500次示范.这些任务具有较小的错误导致故障的狭窄成功区域,需要更密集的数据覆盖.
  • 多步骤任务 (组装序列,步骤): 300-1000个示范.长视线任务需要数据在序列的每个阶段.

什么使得机器人训练数据好

没有所有示范都具有同等价值.

  • **多样性:**100个具有不同物体位置,照明和接近角的示范训练比500个具有相同的示范训练更好.
  • 一致质量: 消除操作员在任务中犯下并纠正错误的失败示范,犹事件和示范.训练数据中的噪音教导模型重现这种噪音.
  • 匹配分布: 训练数据应与机器人在部署时面临的条件相匹配.如果你用白色桌子上的物体进行训练,但部署在木材表面,性能将降低. 捕获数据在现实的条件下.
  • **多摄像头覆盖:**两个或三个摄像头角 (手腕+上头,或手腕+侧+上头) 与单个摄像头相比显著提高了政策性能.模型需要从透露深度,接触和空间关系的视角观察任务.
  • 适当的同步: 摄像头框架,联合状态和操作命令必须暂时对齐.即使50ms的脱同步也降低了性能.使用硬件时间标,而不是软件到达时间.

详细说明如何收集高质量的机器人数据,请参阅我们的 [机器人数据收集指南]T3.

关键框架和工具

您不需要从零开始构建一切. 这些框架提供了您需要的算法和基础设施的经过测试的实现.

雷罗特 (拥抱脸)

勒罗бот是最适合初学者学习机器人模仿的框架.由Hugging Face开发,它提供端到端的工具:用于普通机器人手臂的数据收集脚本,使用标准化格式的数据集管理,ACT和扩散政策的培训实施以及评估工具.勒罗бот与Hugging Face Hub集成数据集共享和模型分布. 如果您正在开始您的第一个机器人 ML 项目,LeRobot 是推的起点. 它支持SO-101,ALOHA和自定义的手臂.

机器人模拟 (斯坦福)

机器人模拟是一种研究框架,用于学习模拟学习算法.它提供了标准化模拟基准,多个BC算法实现 (BC-RNN,HBC,IRIS),并谨慎评估协议.机器人模拟对于实机器人部署而言,比雷罗बोट更少的关键,但它是大多数模拟学习论文中引用的标准基准框架. 使用 RoboMimic 当您想严格比较算法变体或复制已发表的结果时.

机器人操作系统2

ROS2是机器人软件的真实中级软件.它通过发布订阅消息系统来处理传感器,执行器和计算节点之间的通信.ROS2不是ML框架,但它是将ML政策连接到真正的机器人硬件的粘合剂. 您需要ROS2 (或直接串行/USB通信等更简单的替代方案) 来发送动机的操作命令并从摄像头和编码器接收观察数据. Ubuntu 22.04上的ROS2 Humble (LTS) 是新项目推的版本.

爱尔兰人

艾萨克·西姆为RL训练和合成数据生成提供了GPU加速模拟.其平行环境执行使RL训练可行于所需的规模 (数百万集).艾萨克·西姆还支持域名随机化 为了改善Sim到真实传输,自动变化的纹理,照明和物理参数. 学习曲线比MuJoCo更,但如果需要大规模的RL训练或光现实合成数据,

稳定基准3

稳定基线3 (SB3) 是一个PyTorch图书馆,提供了标准RL算法的可靠实现:PPO,SAC,TD3,A2C和DQN.SB3是为了使用便利而设计的. 建议学习RL概念的起点是转向像艾萨克健身房或生产RL训练的rl_games这样的更专业的框架之前.

开始的硬件

需要机器人来做机器人 ML. 这里有三个不同的价格硬件选择,每个都有一个被证明的学习和开发生态系统.

开放手臂 (预算:2000至4000美元)

[OpenArm]T4) 是RCSV的开源6DOF机器人臂,专门用于ML研究和教育.为完整系统 (臂 + 抓住器 + 手腕摄像头 + 控制器) 价格低于4,000美元,是实践机器人ML最容易进入的入口点. 开臂本地运行LeRobot,支持远程操作数据收集和自主执行政策,并拥有积极的社区贡献数据集和预训练模型.该臂使用400mm的Dynamixel服务器和500g的有效载荷,足以完成桌面操纵任务,这是模仿学习研究的面包和黄油.

苏-101 (预算:500美元至1000美元)

SO-101 (也称为SO-100及其变体) 是一种超低成本的6DOF臂,由原料伺服电机和3D打印组件制造.一个完整的领导跟随者对价格低于1000美元.由于其低成本和拥抱面部的广泛文档,SO-101已成为勒罗бот社区项目最受欢迎的臂. 对于首个项目或课堂设置,SO-101很难以以以价格击败.

弗兰卡FR3 (预算:25,000至35,000美元)

弗兰卡-埃米卡-FR3 (前称-潘达) 是学术 ML 实验室中最广泛使用的研究级机器人臂.它提供了7DOF,具有优秀的扭矩感知,微米重复性,并与ROS2和MuJoCo结合. 如果你在大学或资金丰富的初创公司进行可发表研究,FR3是标准平台.

预算分类,完成设置

Component Budget Option Mid-Range Option Research-Grade
Robot arm + gripper SO-101 pair: $800 OpenArm: $3,500 Franka FR3: $30,000
Cameras (2-3x) Logitech C920: $150 RealSense D405: $600 RealSense D435i: $900
Compute (training) Cloud GPU rental: $50/mo RTX 4070 workstation: $1,800 RTX 4090 workstation: $3,500
Compute (inference) Laptop with GPU: $0 (existing) Same as training: $0 Dedicated inference PC: $2,000
Total ~$1,000 + cloud ~$6,000 ~$36,000

学习路径:从零到实施政策

您可以从基本知识到实际硬件的训练政策.每个阶段都建立在前一个阶段.

阶段1:基本知识 (2-4周)

在触摸机器人之前, 建立你的 ML 基础:

  • 了解PyTorch的基本知识:子,自动化,训练循环,数据集/数据载荷器模式.
  • 了解卷积神经网络 (CNN) 图像处理的过程.
  • 了解变压器架构在概念层面上:注意力,定位编码,序列处理.你不需要从零开始实现变压器,但你需要了解它做什么.
  • 阅读原本的ACT论文 (Zhao et al., 2023) 和扩散政策论文 (Chi et al., 2023). 专注于了解问题制订和评估方法,而不是每一个数学细节.

阶段2:模拟 (2-4周)

在接触到真正的硬件之前练习模拟.模拟费用是无用的,你可以自由实验.

  • 安装MuJoCo并运行标准的健身房机器人环境 (FetchReach,FetchPush,FetchPickAndPlace).
  • 在FetchReach上使用稳定基线3训练基本RL政策. 这将教你没有任何硬件复杂性的RL训练循环.
  • 使用RoboMimic来运行对升起和起任务的行为克隆实验. 这将教你模仿学习管道:数据集加载,模型训练,评估.
  • 试验超级参数:学习速度,批量,训练期数,行动部分大小.

阶段3:真正的硬件 (4-8周)

现在把你的技能转移到一个物理机器人:

  • 设置你的机器人手臂 (OpenArm,SO-101,或任何你有机会访问) 与LeRobot.
  • 收集50个简单的选择和位置任务的远程操作演示. 专注于数据质量:一致的演示,良好的摄像头角度,各种对象位置.
  • 通过LeRobot的培训脚本来训练ACT的数据.
  • 测量在20次试验中成功率,你可能会在第一次试验中获得40-70%.
  • 重复:收集更多针对你观察到的故障模式的示范,重新训练和重新评估.目标是深入了解数据收集 →训练 →评估循环.

阶段4:部署和通用化 (正在进行)

进步到更艰难的任务和强大的部署:

  • 尝试更复杂的任务:多步骤组装,双手操作,具有变量对象的任务.
  • 试验与散政策并对同一任务和数据集进行 ACT 的结果进行比较.
  • 探索基础模型的细节调整:使用预训练的VLA模型,并以更少的示范来细节调整您的任务.
  • 工作强度:在不同的照明下,在未见的物体下,在物理扰乱后,测试您的政策. 部署可靠的政策,而不仅仅是在控制的条件下.
  • 贡献回报:分享您的数据集在 Hugging Face,发布您的结果,并参与RCSV和LeRobot社区.

6 开始学习的人常犯错误

我们看到这些错误的团队开始他们的机器人 ML 旅程.

1. 跳过数据质量而跳过数据量

**错误:**收集数百个粗鲁的示范,因为"更多数据总是更好".

解决方案: 无情地处理. 删除操作员犹,犯错误或使用不一致的示范. 100 个清洁的示范持续超过 500 个有噪音的示范.

2. 没有严格评估的培训

**错误:**训练一个政策,在机器人上运行它几次,看到它工作一次,并称它完成.

解决方案: 随机化初始条件的至少20次推广评估每项政策. 报告成功率为X/20,而不是"它有效". 随着一致的评估协议,在培训过程中进行改进.

忽略摄像头的位置

错误: 设置相机在方便的地方,而不是提供最有用的信息的地方.无法看到抓住器对象接触点的相机不会给政策提供有关任务最关键阶段的信息.

** 解决方案:** 使用手腕安装的相机 (提供操作的近距离视图) 以及一个上部或侧部相机 (提供全球背景).确保相机能够在关键接触阶段清晰地看到任务工作空间,而不会被遮蔽.

4. 过度复杂化第一任务

**错误:**试图作为您的第一项目的复杂多步骤任务学习.当政策失败时 (而且会失败),您无法诊断问题是算法,数据,硬件或任务复杂性.

解决方案: 开始单步选取和放置单个对象.让它能够靠谱地工作 (>90%成功).然后逐步增加复杂性:多个对象,多种位置,长的序列.每一个增量告诉你什么是破产.

5. 忽略行动空间设计

**错误:**使用联合空间操作时,卡特西亚空间操作会更自然,或者相反.使用绝对位置时,多角 (增量) 行动会产生更平滑的运动.行动空间表示对学习难度产生了显著的影响.

**解决方案:**对于大多数操纵任务,三角果端效应器位置控制 (卡特西式dx, dy, dz + 抓住器开/关) 是学习最容易的操作空间.关节空间控制对于需要特定的臂配置或反动动力学不可靠的任务更好.使用两者进行实验并比较.

6. 不符合列车和部署条件

**错误:**收集训练数据,采用一组照明条件,摄像头位置和桌面表面,然后在不同的环境中部署该政策,并想知道为什么它失败.

** 解决方案:** 在您训练的条件下部署,或者在数据收集过程中故意改变条件以建立强度.

基本资源

关键文件

  • ACT 低成本硬件使用精细化双手操作学习 (Zhao等,2023年):引入了变压器和ALOHA硬件平台的动作分工.现代模仿学习的基础论文.
  • 通过行动传播学习视觉动力政策 (Chi et al., 2023):应用了指导传播模型到机器人行动预测.
  • RT-X 开放X体:机器人学习数据集和RT-X模型 (开放X体协作,2024):通过22个机器人平台的数据进行了跨体转移学习. 确定机器人学习从大规模的多元化数据中受益,类似于语言模型扩展.
  • OpenVLA 一个开源视觉语言行动模型 (Kim等人,2024):一个可以为特定机器人任务进行细节调整的开放权重VLA模型. 证明预训练的基础模型显著减少每任务数据需求.

课程和教程

  • CS 224R:深度强化学习 (斯坦福,可在YouTube上找到):全面的研究生级的机器人技术RL覆盖.
  • LeRobot 开始教程 (面文件): 步骤指南收集数据和训练您的第一项政策与LeRobot.
  • 深度RL转换 (OpenAI):具有明确的实现的RL算法的优秀自主介绍.
  • MuJoCo教程 (深思文档):用于机器人学习研究的物理模拟基础.

欧洲共同体

  • **RCSV社区:**加入RCSV学院 实践研讨会,共享硬件访问,以及海湾地区机器人 ML 实践者社区.
  • LeRobot Discord: 乐罗бот用户共享数据集,解决问题和项目想法的活跃社区.
  • 机器人工作交换: 技术机器人问题问答.

在RCSV开始你的机器人 ML旅程

通过RCSV提供机器人硬件访问,实践培训,以及一个实践者社区来加速您的学习. 从您的首次选择到生产部署,

T6) [查看服务]T7)