列车和部署
训练一个 ACT或传播政策在你的 O6 数据集,并将其实时部署. 训练工作流程,评估协议,和数据飞行车进行持续改进. ~ 3 小时.
五个单元中的五个 · 列车和部署 · ~ 3小时
在50集的数据集中训练一个模仿学习政策,在线评估,并在O6上实行实践.目标:在20个实践评估试验中成功率≥70%.
选择一个政策架构
建议适用于初学者
动作与变压器的碎
快速训练 (1
传播政策
慢训练 (3
步骤1:使用ACT训练
python -m lerobot.scripts.train \
--dataset_repo_id=your-username/o6-pick-place \
--policy.type=act \
--policy.chunk_size=100 \
--training.num_epochs=200 \
--training.batch_size=32 \
--training.lr=1e-4 \
--output_dir=./checkpoints/o6-act-v1
# Monitor training loss
tensorboard --logdir=./checkpoints/o6-act-v1/logs/
在50集的数据集中,ACT训练通常在100~150个时代内稳定.在停止之前,请注意验证损失.仅仅基于训练时间,不要早点停止.
步骤2:在线评估
在部署到硬件之前,评估数据集中的延期事件的检查点:
python -m lerobot.scripts.eval \
--pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
--env.type=linker_bot_o6_sim \
--eval.n_episodes=20 \
--eval.batch_size=10
如果您的环境没有一个模拟模型,请使用数据集重播评估器:
python -m lerobot.scripts.visualize_dataset \
--repo-id your-username/o6-pick-place \
--episode-index 0 \
--policy-checkpoint ./checkpoints/o6-act-v1
步骤3:在O6上进行直播部署
python -m lerobot.scripts.control_robot \
--robot.type=linker_bot_o6 \
--control.type=evaluate \
--pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
--control.fps=30 \
--control.num_episodes=20 \
--control.episode_time_s=30
对于每次试验:
- 放物体在标准的起始位置.
- 确认手臂在家位置.
- 开始,除非手臂即将与自己或马座接触.
- 记录成功 (任务完成) 或失败,并注意失败模式.
解释结果
| Success Rate | Action |
|---|---|
| ≥70% | Path complete. Share your results and contribute your dataset. |
| 50–69% | Collect 20–30 more episodes targeting your top failure mode. Retrain. |
| Below 50% | Review dataset quality. Check camera alignment and starting position consistency. Consider a simpler task variant. |
数据飞行车
在您的第一次部署后,不断改善:
- 从评估日志中确定您最重要的2
3故障模式. - 收集20
30个针对这些故障的示范. - 混合新节目与原始数据集 (50/50或重量为失败).
- 从零开始重新训练 (不是从检查点
新训练避免在小数据集上发生灾难性的遗忘). - 检查,重复,直到达到目标成功率.
分享自己的结果
# Push your trained policy to HuggingFace Hub
python -m lerobot.scripts.push_policy_to_hub \
--pretrained_policy_path=./checkpoints/o6-act-v1 \
--repo-id=your-username/o6-pick-place-act
第五单元完成,当...
您的ACT (或扩散政策) 检查点在O6上进行20次实时评估试验中取得了70%以上的成功率.您已记录了所有试验结果并确定了剩下的故障模式.您的数据集和政策检查点已备份并可在HuggingFace Hub上共享.
完整的路径
您已经从解包LinkerBot O6到生产中的模仿学习政策. 在 [RCSV论坛](
[← 回到路径概述]







