返回OpenArm Path

部署和改进

运行你的训练政策在真实手臂,系统地评估它,并启动数据飞行车.目标:7/10自主成功率.

部署和改进 · ~1.5小时

现在把它放在真正的手臂上,严格评估它,并了解如何改善它. 这就是数据飞行器的开始.

实际的手臂

部署意味着实时运行训练有素的检查点,将现场摄像头和联合观测输入网络,并执行物理臂上的输出操作.

源 ~/openarm-env/bin/activate # 确保ROS 2运行 (实际硬件模式,从1个单元) python -m lerobot.scripts.eval \ --policy-checkpoint ~/openarm-policy/pick-and-place-v1/checkpoint_XXXXX \ --device cuda \ --num-eval-episodes 10 \ --record-video \ --output-dir ~/openarm-s/v1 \ # 取代XXXXX用您最好的检查步数从5个单元 # --record-video保存每个集为 mp4进行审查

在第一次部署时,请把手放在物理E-stop附近.新部署的政策可能会偶尔在升温到实际硬件环境时,会发生意想不到的运动.这对于前23集来说是正常的.之后,行为应该稳定.

详细的部署和生产指南,包括安全包裹和监护犬计时器,请见 [OpenArm生产指南]T1.

评估方法

通过结构化协议,您可以知道您所做的变化 (更多数据,不同的检查点,不同的任务框架) 是否实际上改善了性能:

Protocol Item Specification
Number of episodes per evaluation 10 minimum, 20 for high-confidence results
Object starting position Fixed. Use tape marks. Same position every episode.
Object type Same object as training. Lighting must match training conditions.
What counts as success Object placed within 3cm of target. Arm returns to home. No human intervention during episode.
Failure classification Log failure type: missed grasp / dropped object / wrong target / timeout. This tells you what to fix.
Report metric Success rate = successful episodes / total episodes. Report with episode count (e.g., "7/10 = 70%").

数据飞行车:如何变得更好

通过数据飞轮来实现9/10或更高的目标.这是机器人学习的核心循环:

其他

收藏

记录示范,包括您目前的政策与失败的案件

其他

列车

随着新示范的添加,重新训练 (或细节调整) 扩展的数据集

其他

评估

运行结构化评估协议. 成功率有没有改善? 仍然存在哪些失败模式?

其他

分析

查看失败视频,确定政策破产的具体状态,收集目标数据.

飞行车的关键见解:目标数据比随机数据更好. 取而代之的是记录50个随机示范,观看失败视频并确定事情发生错误的确切时刻.记录20个具体涵盖困难状态的示范 (例如,在工作空间边缘的抓住,或在不寻常的角度对物体). 您的成功率将会提高,比50个随机演示更快.

常见的失败模式和如何解决它们

  • ** 臂超越抓取位置:** 政策的行动部分太大,或者数据的速度变化很高. 记录在抓取点附近的慢速度下再进行10个演示.或者在训练配置中将T0从100降至50个.
  • ** 武器在训练对象上取得成功,但在稍微不同的对象上失败:** 您的训练数据缺乏对象位置的多样性.记录20个演示,对象在10厘米半径内的5个不同位置. 这教导了政策的概括.
  • 政策结或产生重复运动: CVAE 风格变量正在崩.这通常意味着你的数据集有太多的差异.

第六单元完成,当...

您的手臂在结构化评估中自动完成选定和放置任务10次中的7次.您已经看过3个失败视频并确定了什么是错误的.您了解数据飞轮足够好地规划下一次改进.这是结构化的路径的结束,但这是您的机器人学习实践的开始.

你成功了.

你从打开机器人到培训和部署真正的模仿学习政策. 这让你超过了99%的人曾触及过机器人手臂.你在这里建立的东西是:

接下来是什么?

你有了基础,从这里开始,

现在,

开放手机生产指南

安全包裹,监护犬计时器,多臂设置,以及长期部署模式.

进一步研究:传播政策

训练多模式任务,其中多个策略有效.

T3)

双手动装备

两个同步的手臂用于双手工任务.

T4) [

分享自己的结果

在OpenArm论坛上发布你的成功率,数据集和政策.

[← 回到路径概述]