列车和部署
在你的Booster K1数据集上训练全身模仿学习政策,并将其实体部署.
五个单元中的五个 · 列车和部署 · ~ 6小时
训练一个全身模仿学习政策,在数据集中评估它,并通过安全监测部署到真正的K1.目标:在示范任务中成功率超过60%.
步骤1:将数据集转换为LeRobot格式
python convert_k1_to_lerobot.py \
--input-dir ./recordings/session_001/ \
--output-dir ./dataset/k1-pick-place/ \
--repo-id your-username/k1-pick-place \
--success-only # filters to episodes labeled success=true
第二步:使用传播政策训练
扩散政策对全体任务工作很好,因为它处理多模式的行动分布,并产生平稳的轨迹.使用NVIDIA GPU (推
python -m lerobot.scripts.train \
--dataset_repo_id=your-username/k1-pick-place \
--policy.type=diffusion \
--policy.obs_as_global_cond=true \
--training.num_epochs=300 \
--training.batch_size=64 \
--output_dir=./checkpoints/k1-diffusion-v1
# Monitor training (open in browser)
tensorboard --logdir=./checkpoints/k1-diffusion-v1/logs/
观察训练损失和验证损失曲线.训练完成时验证损失已平稳至少20个时代.仅仅基于墙时刻,不要早点停止训练.
步骤3:在MuJoCo模拟中进行评估
python eval_policy_sim.py \
--checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
--env=booster_gym/envs/pick_place.py \
--num_episodes=20 \
--render
目标:在部署到实际硬件之前,模拟成功率 ≥60%.如果低于60%,则收集更多示范 (返回第4单元) 或检查数据质量.
步骤4:在真实K1上进行直播部署
python deploy_policy.py \
--checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
--robot-ip=192.168.10.102 \
--cameras head_cam,external \
--task "pick up the red block" \
--max-episode-duration=30 \
--safety-monitor=true
评估自己的政策
进行20次评估试验,以获得统计意义上的成功率:
python eval_policy_live.py \
--checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
--robot-ip=192.168.10.102 \
--num-trials=20 \
--log-results=./eval_results/k1-diffusion-v1-eval.json
对于每次试验,重置场景到与训练示范相同的启动配置.记录成功/失败结果和失败试验失败模式.常见失败模式:场景变化 (照明,对象位置),sim 和真实,不足的训练数据之间的域转移.
数据飞行车
在你的第一次部署后:
- 根据评估日志,确定您的前3种故障模式.
- 收集这些故障模式的针对性示范 (返回4单元).
- 混合新集与原始数据集 (50/50或重量为失败).
- 练习,重新评估,重复直到你达到目标成功率.
第五单元完成,当...
您有训练有素的扩散政策或ACT检查点,在模拟中取得60%以上的成功率.您已将其直接部署到K1并运行至少10次实时评估试验.您已确定了您最严重的故障模式,并制定了下一次数据收集会议的计划.
完整的路径
您已经从安全启动到一个有效的全身模仿学习政策, 在Booster K1. 在 [RCSV论坛]
[← 回到路径概述]







