评估自己的政策
测量成功率,诊断失败模式,确定是否要改进或部署. ~ 1 小时.
单位5个6个 · 评估 · ~1小时
通过一个结构化的20次试验协议来测量成功率, 确定导致失败的最高模式.
模拟评估
总是在模拟中进行评估,即使你有一个真正的机器人.
源 ~/lerobot-env/bin/activate # 评估您的最佳检查点 (替换步骤_050000 用您的检查点步骤) python -m lerobot.scripts.eval \ --pretrained-policy-name-or-path \ ~/lerobot-policy/pick-place-v1/checkpoints/step_050000 \ --env.name gym_pusht/PushT-v0 -- \eval.n-episodes 20 \eval --.use-async-envs false # 输出:成功_rate, mean_reward, episode_videos/
预期什么: 50个模拟演示的训练有素政策应该在MuJoCo中达到60
实际机器人安全检查清单
如果您正在评估一个真正的机器人, 在您的第一次部署之前,请查看此清单.
- 清除任何不属于任务的对象的工作空间.学习在特定视觉环境中行动的政策
意想不到的对象可能导致不稳定的行为. - 保持紧急停车位 (E-stop) 或准备在整个评估会议中按Ctrl+C.不要离开运行政策.
- 开始使用速度限制在50%以上,如果第一次试验看起来很
或不准确,则减少到30%. - 设置物体,以完全匹配训练工作场所的设置. 使用相同的摄像头角度,相同的照明,相同的物体颜色.分布转移是零实际成功率的最常见原因.
- 首先,在第一次运行前,请检查机器人组合中.
实际机器人评估协议
执行20次实验.这给你足够的样本来可靠的成功率估计 (±10%在95%的信心水平).记录每次实验视频
运行您的真正机器人python的政策 -m lerobot.scripts.control_robot \ --robot-path lerobot/configs/robot/so100.yaml \ --control-mode eval \ --pretrained-policy-name-or-path \ ~/lerobot-policy/pick-place-v1/checkpoints/step_050000 \ --eval.n-episodes 20 \ --record-video 1
每次试验后,手动评分:完成任务成功1个,任何失败 (部分抓住,落下,失败) 均为0个.
诊断失败方式
观看录像,并将失败分类.
数据质量
臂从来没有完全承诺抓住
政策是对训练数据中多种抓取策略进行平均化.这发生在一些示范活动从左边和其他活动从右边接近时,或者抓住器关闭时间不一致时.
模型容量
轨道看起来合理,但精度不一定是12cm
模型正在学习正确的行为,但缺乏精确的能力. 这发生在一个部分的尺寸太短 (计划视野不足) 或一个太小的模糊. 修复:将部分的尺寸增加到150,重新训练. 或添加更多的多样性示范来规范网络.
分布转变
在某些位置上,它是完美的,在其他位置上却是完全失败的.
评估过程中的对象位置在训练数据的分布之外.该政策以前没有看到这些位置. 修正:收集更多具有更多样化的对象位置的示范,或将评估限制在训练数据中很好地代表的位置.
第五单元完成,当...
您已经进行了20次评估试验 (在模拟或在您的实机器人上) 并测量了成功率.您已经看过所有失败模式视频并确定了主要失败是数据质量,模型容量或分布转移.您已记录了这一诊断.
[← 回到路径概述]







