部署和改进
运行你的训练政策在真实手臂,系统地评估它,并启动数据飞行车.目标:7/10自主成功率.
部署和改进 · ~1.5小时
现在把它放在真正的手臂上,严格评估它,并了解如何改善它. 这就是数据飞行器的开始.
实际的手臂
部署意味着实时运行训练有素的检查点,将现场摄像头和联合观测输入网络,并执行物理臂上的输出操作.
源 ~/openarm-env/bin/activate # 确保ROS 2运行 (实际硬件模式,从1个单元) python -m lerobot.scripts.eval \ --policy-checkpoint ~/openarm-policy/pick-and-place-v1/checkpoint_XXXXX \ --device cuda \ --num-eval-episodes 10 \ --record-video \ --output-dir ~/openarm-s/v1 \ # 取代XXXXX用您最好的检查步数从5个单元 # --record-video保存每个集为 mp4进行审查
在第一次部署时,请把手放在物理E-stop附近.新部署的政策可能会偶尔在升温到实际硬件环境时,会发生意想不到的运动.这对于前2
详细的部署和生产指南,包括安全包裹和监护犬计时器,请见 [OpenArm生产指南]
评估方法
通过结构化协议,您可以知道您所做的变化 (更多数据,不同的检查点,不同的任务框架) 是否实际上改善了性能:
| Protocol Item | Specification |
|---|---|
| Number of episodes per evaluation | 10 minimum, 20 for high-confidence results |
| Object starting position | Fixed. Use tape marks. Same position every episode. |
| Object type | Same object as training. Lighting must match training conditions. |
| What counts as success | Object placed within 3cm of target. Arm returns to home. No human intervention during episode. |
| Failure classification | Log failure type: missed grasp / dropped object / wrong target / timeout. This tells you what to fix. |
| Report metric | Success rate = successful episodes / total episodes. Report with episode count (e.g., "7/10 = 70%"). |
数据飞行车:如何变得更好
通过数据飞轮来实现9/10或更高的目标.这是机器人学习的核心循环:
其他
收藏
记录示范,包括您目前的政策与失败的案件
其他
列车
随着新示范的添加,重新训练 (或细节调整) 扩展的数据集
其他
评估
运行结构化评估协议. 成功率有没有改善? 仍然存在哪些失败模式?
其他
分析
查看失败视频,确定政策破产的具体状态,收集目标数据.
飞行车的关键见解:目标数据比随机数据更好. 取而代之的是记录50个随机示范,观看失败视频并确定事情发生错误的确切时刻.记录20个具体涵盖困难状态的示范 (例如,在工作空间边缘的抓住,或在不寻常的角度对物体). 您的成功率将会提高,比50个随机演示更快.
常见的失败模式和如何解决它们
- ** 臂超越抓取位置:** 政策的行动部分太大,或者数据的速度变化很高. 记录在抓取点附近的慢速度下再进行10个演示.或者在训练配置中将
T0 从100降至50个. - ** 武器在训练对象上取得成功,但在稍微不同的对象上失败:** 您的训练数据缺乏对象位置的多样性.记录20个演示,对象在10厘米半径内的5个不同位置. 这教导了政策的概括.
- 政策
结或产生重复运动: CVAE 风格变量正在崩.这通常意味着你的数据集有太多的差异.
第六单元完成,当...
您的手臂在结构化评估中自动完成选定和放置任务10次中的7次.您已经看过3个失败视频并确定了什么是错误的.您了解数据飞轮足够好地规划下一次改进.这是结构化的路径的结束
你成功了.
你从打开机器人到培训和部署真正的模仿学习政策. 这让你超过了99%的人曾触及过机器人手臂.你在这里建立的东西是:
接下来是什么?
你有了基础,从这里开始,
现在,
开放手机生产指南
安全包裹,监护犬计时器,多臂设置,以及长期部署模式.
进一步研究:传播政策
训练多模式任务,其中多个策略有效.
双手动装备
两个同步的手臂用于双手工任务.
分享自己的结果
在OpenArm论坛上发布你的成功率,数据集和政策.
[← 回到路径概述]







