返回DK1 Path

运行和改进双手政策

部署两个手臂的推断,运行双手动评估协议,修复常见双手动故障模式,并启动数据飞轮. ~ 2 小时.

部署和改进 · ~ 2 小时

现在,你有一个训练有素的检查点. 现在,同时部署它在两个手臂上, 严格地评估它使用双手协议,

两臂的插曲设置

双手推理运行一个单一的政策网络,同时输出两个手臂的操作.观察-行动循环运行在50Hz 与训练数据相同的频率,两个追随手臂都在同步执行各自的行动块.

源 ~/dk1-env/bin/activate # 保持你的手在E-stop前3个评估集 Python -m lerobot.scripts.eval \ --policy-checkpoint ~/dk1-policies/cube-handoff-v1/checkpoint_XXXXX \ --robot-path ~/dk1-config.yaml \ --robot-type dk1_bimanual \ --device cuda \ --num-eval-episodes 10 \ --record-video \ --output-dir ~/dk1-evals/v1 \ # 取代XXXXX用您的最佳检查点 (从5个单位损失曲线分析) # --record-video保存两个手臂视图作为分别的mp4文件分析失败分析

对于第一次评估,允许政策执行无间断,除非发生物理碰撞.二手术政策通常在第一段12节目中产生意想不到的运动,因为它们适应现实环境. 观察政策是否持续达到任务的相同阶段 (接近,抓住,转移,地点,家) 即使最终失败.

双手续评估议定书

通过结构化协议进行非正式评估, "看起来它是有效的" 对于双手政策来说是不可靠的,因为部分成功更常见,并且可以掩盖基本破碎的交付.

Protocol Item Bimanual Specification
Number of episodes 10 minimum; 20 for high-confidence results before adding more data
Cube starting position Fixed, tape-marked position — same as your Unit 4 training setup
Lighting Must match training conditions. Even opening a window can shift lighting enough to affect the workspace camera
What counts as full success Cube starts on right side, ends on left side, both arms return to home pose, no human contact during episode
What counts as partial success Correct grasp achieved but transfer fails, or transfer succeeds but placement is off-target. Log these separately.
Failure classification Log: (A) grasp failure, (B) handoff failure — arm-to-arm transfer drops, (C) placement failure, (D) timeout. The handoff failure category (B) is unique to bimanual and most informative for improvement.
Report metric Full success rate (episodes with all 4 phases correct). Also report partial success rate. Example: "4/10 full, 7/10 reached handoff phase".

常见的双手机故障模式

这些故障模式与单臂故障不同,需要双手续修复:

  • 手臂在交付点上达成异步: 一只手臂到达交付位置并等待;另一只手臂到达迟到.政策未了解手臂之间的相对时间. 修正:添加20个示例,在交付点上两只手臂在交付点上显然停留12秒之前. 这使得数据中同步要求明确.
  • ** 交手 立方体在两臂之间落下:** 最常见的双手动特定故障.接收手臂相对于交手的释放速度关闭抓手过早或过晚. 纠正:以25%的速度收集15个缓慢移动交手示范.过度的时间给政策提供了更清晰的信号,说明抓手状态过渡序列.
  • **政策与单臂战略相结合:**政策学会使用单臂完成任务,忽略另一臂的能力.这发生在一个臂的示范比另一臂更一致时.
  • ** 双臂碰撞:** 两臂都试图占据同一个工作空间位置. 这是一个安全事件. 在评估期间,使 DK1 硬件服务器 (T0 在 dk1-config.yaml) 避免碰撞. 持续尊重安全的臂分离的示范训练将防止大多数碰撞; 硬件级别的防护人员处理边缘情况.
  • 部署时的阶段脱节: 政策执行正确的操作,但不是按正确的时间顺序执行.

双手机改进的数据飞轮

对于单臂政策而言,相同的改进循环也适用于双手动,其中有一个双手动的具体补充:始终针对任务序列中的_first_失败模式.如果抓 (B阶段) 仍然不一致,则无法改进.

其他

评估

运行10集.按阶段分类每个失败 (A/B/C/D)

其他

目标

确定第一个失败阶段. 收集2030个具体涵盖该阶段的演示

其他

恢复训练

添加针对性的演示数据集. 从零开始重新训练或精细调制最佳检查点

其他

评估

运行10集,全成功率有没有改善?

接下来是什么?

立方交换是基础 对于更复杂的任务的相同架构规模:

现在,

变速电话操作

适应速度的电操作,用于接触丰富的任务,其中反动力改变最佳运动速度.

加入精的手

结合DK1臂和Orca手,以提高手指水平的技巧,在需要精确的手动操作的任务上.

T3)

扩展数据集

操作员,任务和硬件配置之间扩展双手动数据收集的技术.

T4) [

分享自己的结果

在 DK1 论坛上发布您的成功率,数据集和政策.

第六单元完成,当...

您的DK1自主完成立方交换任务,在结构化评估中至少获得6/10的成功率.您已按阶段分类所有失败事件 (A/B/C/D) 并确定哪个阶段是导致大多数失败的.您已经看过失败视频,并可以具体阐述发生错误的情况. 你已经理解了双手动数据飞行器,

你建立了一个工作的双手机学习系统.

你配置了领导/追随者架构,收集了同步的两臂示范,从零开始训练了一个协调的政策,并部署在真实硬件上.在这级的双手操纵是研究实验室的运营.你在这里建立的基础是组,和接触丰富的任务,

[← 回到路径概述]