返回DK1 Path

通过ACT培训双手术政策

根据你的双手动数据集,训练一项ACT政策.为什么ACT在双手动,训练指令,阅读训练曲线,超参数方面优秀. ~4小时.

政策培训的第五个单位

启动ACT训练,理解双手训练曲线,并知道你在6个单元中有什么值得部署的检查点.

为什么ACT在两手工任务中优秀

ACT (Action Chunked Transformers) 最初专门用于双手操作研究.其核心见解是,预测未来行动的序列 (零件) 而不是单步行动减少了复合错误.

行动分量机制有效地为政策提供了一个规划视野. ACT不承诺每一个50Hz时间步骤都会执行单一联合命令,而是计划100步前进并将执行顺利.对于交付任务,这意味着该政策可以"看到"两个手臂向交付点的接近,而不是独立对每个框架反应. 经验上,这将中转失败率降低到一半,

警告:ACT假设您的数据集中的示范代表了 _一致的策略. 如果不同的示范显示了基本不同的执行方式 不同的手臂启动,不同的交付高度 CVAE 组件将难以编码一个单一的风格.您的100个示范都应该执行相同的运动策略.

训练指挥部

source ~/dk1-env/bin/activate python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id cube-handoff-v1 \ --root ~/dk1-datasets \ --output-dir ~/dk1-policy/cube-handoff-v1 \ --config-overrides \ policy.action_dim=14 \ policy.chunk_size=100 \ policy.n_action_steps=100 \ policy.dim_feedforward=3200 \ policy.n_heads=8 \ policy.n_encoder=4 \ \ \ \ save.n_decoder=7 training.number_steps=80000\ \ \ dimench \ \ frequency training.\ \ \ 节省每一个步骤的训练前,每一个步骤的训练中, AC_batch \ 节省的步骤是146 \ 节省的步骤.

实践训练时间需要GPU: 在RTX 3080 (10GB) 上,80,000步骤需要大约90分钟.在RTX 4090上,大约50分钟.在CPU上,预计1014小时.如果您有GPU,请使用T0.云GPU选项 (Lambda Labs,Vast.ai) 运行约0.501.50/小时.

阅读双手训练曲线

双手训练曲线与单臂曲线有一个重要方面不同:你有两个行动空间,政策必须学会协调它们.

恢复 (整体行动损失)

应该从3.0降低到0.4以下6万步.在4万步后,高原高于0.7表示数据集质量问题可能在交付时间或位置上存在过大的差异.

(CVAE规范化)

开始于0附近,慢慢上升到515.如果它上升到30以上,CVAE正在努力找到一个紧的风格嵌入.这通常意味着你的演示具有太多的行为多样性.考虑剪除下 20%的不一致的演示和重训.

动作错误:左对右

如果您启用每臂操作错误记录 (通过T2过标),您将看到左边和右边操作尺寸的分离损失曲线.两者之间的长期差距表明,一个臂的示范比另一个臂的更一致.

双手术特定超参数

Parameter Default (single-arm) DK1 Bimanual Recommended Why
action_dim 7 14 Two 6-DOF arms + 2 grippers = 14 action dimensions
chunk_size 100 100 Same — action chunking is already well-suited to bimanual coordination timescales
dim_feedforward 3200 3200 No change needed — the larger action space is handled by the action head, not the transformer width
num_steps 50000 80000 Bimanual coordination requires more training steps to converge reliably; 80k is the practical minimum for 100 demos
batch_size 32 16 Reduced to fit the larger bimanual dataset samples (dual camera feeds) in GPU memory
kl_weight 10 10 Default works well; increase to 20 only if L_kl stays near zero after 30k steps (CVAE not learning)

检查点的选择

节省检查站每5000步 (T9).不要假设最后的检查站是最好的.双手术政策可以在高步数时过度适应.

选择T10达到最低点的步骤,然后开始高原或稍微增加.通常,这在100个模拟双手数据集的60,00080,000步骤范围内.部署两个检查点 (最低损失检查点和最后一个) 并将其现实世界表现进行比较6.

第五单元完成,当...

训练完成了80,000步骤,检查点保存在T11.最终的T12值低于0.5.你已经根据损失曲线确定了最佳检查点.你明白为什么L_kl曲线在你的运行中表现得像这样. 您准备好在第6单元中部署到真正的硬件. 立方交换目标成功率为>60% (双手机比单臂更难,这是一个强大的第一运行结果).

[← 回到路径概述]