通过ACT培训双手术政策
根据你的双手动数据集,训练一项ACT政策.为什么ACT在双手动,训练指令,阅读训练曲线,超参数方面优秀. ~4小时.
政策培训的第五个单位
启动ACT训练,理解双手训练曲线,并知道你在6个单元中有什么值得部署的检查点.
为什么ACT在两手工任务中优秀
ACT (Action Chunked Transformers) 最初专门用于双手操作研究.其核心见解是,预测未来行动的序列 (零件) 而不是单步行动减少了复合错误.
行动分量机制有效地为政策提供了一个规划视野. ACT不承诺每一个50Hz时间步骤都会执行单一联合命令,而是计划100步前进并将执行顺利.对于交付任务,这意味着该政策可以"看到"两个手臂向交付点的接近,而不是独立对每个框架反应. 经验上,这将中转失败率降低到一半,
警告:ACT假设您的数据集中的示范代表了 _一致的策略. 如果不同的示范显示了基本不同的执行方式
训练指挥部
source ~/dk1-env/bin/activate python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id cube-handoff-v1 \ --root ~/dk1-datasets \ --output-dir ~/dk1-policy/cube-handoff-v1 \ --config-overrides \ policy.action_dim=14 \ policy.chunk_size=100 \ policy.n_action_steps=100 \ policy.dim_feedforward=3200 \ policy.n_heads=8 \ policy.n_encoder=4 \ \ \ \ save.n_decoder=7 training.number_steps=80000\ \ \ dimench \ \ frequency training.\ \ \ 节省每一个步骤的训练前,每一个步骤的训练中, AC_batch \ 节省的步骤是146 \ 节省的步骤.
实践训练时间需要GPU: 在RTX 3080 (10GB) 上,80,000步骤需要大约90分钟.在RTX 4090上,大约50分钟.在CPU上,预计10
阅读双手训练曲线
双手训练曲线与单臂曲线有一个重要方面不同:你有两个行动空间,政策必须学会协调它们.
恢复 (整体行动损失)
应该从3.0降低到0.4以下6万步.在4万步后,高原高于0.7表示数据集质量问题
(CVAE规范化)
开始于0附近,慢慢上升到5
动作错误:左对右
如果您启用每臂操作错误记录 (通过
双手术特定超参数
| Parameter | Default (single-arm) | DK1 Bimanual Recommended | Why |
|---|---|---|---|
action_dim |
7 | 14 | Two 6-DOF arms + 2 grippers = 14 action dimensions |
chunk_size |
100 | 100 | Same — action chunking is already well-suited to bimanual coordination timescales |
dim_feedforward |
3200 | 3200 | No change needed — the larger action space is handled by the action head, not the transformer width |
num_steps |
50000 | 80000 | Bimanual coordination requires more training steps to converge reliably; 80k is the practical minimum for 100 demos |
batch_size |
32 | 16 | Reduced to fit the larger bimanual dataset samples (dual camera feeds) in GPU memory |
kl_weight |
10 | 10 | Default works well; increase to 20 only if L_kl stays near zero after 30k steps (CVAE not learning) |
检查点的选择
节省检查站每5000步 (
选择
第五单元完成,当...
训练完成了80,000步骤,检查点保存在
[← 回到路径概述]







