运行和改进双手政策
部署两个手臂的推断,运行双手动评估协议,修复常见双手动故障模式,并启动数据飞轮. ~ 2 小时.
部署和改进 · ~ 2 小时
现在,你有一个训练有素的检查点. 现在,同时部署它在两个手臂上, 严格地评估它使用双手协议,
两臂的插曲设置
双手推理运行一个单一的政策网络,同时输出两个手臂的操作.观察-行动循环运行在50Hz
源 ~/dk1-env/bin/activate # 保持你的手在E-stop前3个评估集 Python -m lerobot.scripts.eval \ --policy-checkpoint ~/dk1-policies/cube-handoff-v1/checkpoint_XXXXX \ --robot-path ~/dk1-config.yaml \ --robot-type dk1_bimanual \ --device cuda \ --num-eval-episodes 10 \ --record-video \ --output-dir ~/dk1-evals/v1 \ # 取代XXXXX用您的最佳检查点 (从5个单位损失曲线分析) # --record-video保存两个手臂视图作为分别的mp4文件分析失败分析
对于第一次评估,允许政策执行无间断,除非发生物理碰撞.二手术政策通常在第一段1
双手续评估议定书
通过结构化协议进行非正式评估, "看起来它是有效的" 对于双手政策来说是不可靠的,因为部分成功更常见,并且可以掩盖基本破碎的交付.
| Protocol Item | Bimanual Specification |
|---|---|
| Number of episodes | 10 minimum; 20 for high-confidence results before adding more data |
| Cube starting position | Fixed, tape-marked position — same as your Unit 4 training setup |
| Lighting | Must match training conditions. Even opening a window can shift lighting enough to affect the workspace camera |
| What counts as full success | Cube starts on right side, ends on left side, both arms return to home pose, no human contact during episode |
| What counts as partial success | Correct grasp achieved but transfer fails, or transfer succeeds but placement is off-target. Log these separately. |
| Failure classification | Log: (A) grasp failure, (B) handoff failure — arm-to-arm transfer drops, (C) placement failure, (D) timeout. The handoff failure category (B) is unique to bimanual and most informative for improvement. |
| Report metric | Full success rate (episodes with all 4 phases correct). Also report partial success rate. Example: "4/10 full, 7/10 reached handoff phase". |
常见的双手机故障模式
这些故障模式与单臂故障不同,需要双手续修复:
- 手臂在交付点上达成异步: 一只手臂到达交付位置并等待;另一只手臂到达迟到.政策未了解手臂之间的相对时间. 修正:添加20个示例,在交付点上两只手臂在交付点上显然停留1
2秒之前. 这使得数据中同步要求明确. - ** 交手
立方体在两臂之间落下:** 最常见的双手动特定故障.接收手臂相对于交手的释放速度关闭抓手过早或过晚. 纠正:以25%的速度收集15个缓慢移动交手示范.过度的时间给政策提供了更清晰的信号,说明抓手状态过渡序列. - **政策与单臂战略相结合:**政策学会使用单臂完成任务,忽略另一臂的能力.这发生在一个臂的示范比另一臂更一致时.
- ** 双臂碰撞:** 两臂都试图占据同一个工作空间位置. 这是一个安全事件.
在评估期间,使 DK1 硬件服务器 ( T0 在 dk1-config.yaml) 避免碰撞. 持续尊重安全的臂分离的示范训练将防止大多数碰撞; 硬件级别的防护人员处理边缘情况. - 部署时的阶段脱节: 政策执行正确的操作,但不是按正确的时间顺序执行.
双手机改进的数据飞轮
对于单臂政策而言,相同的改进循环也适用于双手动
其他
评估
运行10集.按阶段分类每个失败 (A/B/C/D)
其他
目标
确定第一个失败阶段. 收集20
其他
恢复训练
添加针对性的演示数据集. 从零开始重新训练或精细调制最佳检查点
其他
评估
运行10集,全成功率有没有改善?
接下来是什么?
立方交换是基础
现在,
变速电话操作
适应速度的电操作,用于接触丰富的任务,其中反动力改变最佳运动速度.
加入精的手
结合DK1臂和Orca手,以提高手指水平的技巧,在需要精确的手动操作的任务上.
扩展数据集
操作员,任务和硬件配置之间扩展双手动数据收集的技术.
分享自己的结果
在 DK1 论坛上发布您的成功率,数据集和政策.
第六单元完成,当...
您的DK1自主完成立方交换任务,在结构化评估中至少获得6/10的成功率.您已按阶段分类所有失败事件 (A/B/C/D) 并确定哪个阶段是导致大多数失败的.您已经看过失败视频,并可以具体阐述发生错误的情况. 你已经理解了双手动数据飞行器,
你建立了一个工作的双手机学习系统.
你配置了领导/追随者架构,收集了同步的两臂示范,从零开始训练了一个协调的政策,并部署在真实硬件上.在这级的双手操纵是研究实验室的运营.你在这里建立的基础是
[← 回到路径概述]







