返回Booster K1 Path

列车和部署

在你的Booster K1数据集上训练全身模仿学习政策,并将其实体部署.

五个单元中的五个 · 列车和部署 · ~ 6小时

训练一个全身模仿学习政策,在数据集中评估它,并通过安全监测部署到真正的K1.目标:在示范任务中成功率超过60%.

步骤1:将数据集转换为LeRobot格式

python convert_k1_to_lerobot.py \
  --input-dir ./recordings/session_001/ \
  --output-dir ./dataset/k1-pick-place/ \
  --repo-id your-username/k1-pick-place \
  --success-only  # filters to episodes labeled success=true

第二步:使用传播政策训练

扩散政策对全体任务工作很好,因为它处理多模式的行动分布,并产生平稳的轨迹.使用NVIDIA GPU (推16GBVRAM) 进行训练需要36小时.

python -m lerobot.scripts.train \
  --dataset_repo_id=your-username/k1-pick-place \
  --policy.type=diffusion \
  --policy.obs_as_global_cond=true \
  --training.num_epochs=300 \
  --training.batch_size=64 \
  --output_dir=./checkpoints/k1-diffusion-v1

# Monitor training (open in browser)
tensorboard --logdir=./checkpoints/k1-diffusion-v1/logs/

观察训练损失和验证损失曲线.训练完成时验证损失已平稳至少20个时代.仅仅基于墙时刻,不要早点停止训练.

步骤3:在MuJoCo模拟中进行评估

python eval_policy_sim.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --env=booster_gym/envs/pick_place.py \
  --num_episodes=20 \
  --render

目标:在部署到实际硬件之前,模拟成功率 ≥60%.如果低于60%,则收集更多示范 (返回第4单元) 或检查数据质量.

步骤4:在真实K1上进行直播部署

政策部署期间,所有安全协议都适用. 发现器存在,电子站测试,3m × 3m清洁面积.在第一次直播中,保持电子站的手.该政策可能在边缘情况下产生意想不到的运动.

python deploy_policy.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --robot-ip=192.168.10.102 \
  --cameras head_cam,external \
  --task "pick up the red block" \
  --max-episode-duration=30 \
  --safety-monitor=true

T5在联合速度或扭矩超过安全门时,可以自动降低DAMP. 在初始部署时始终可以实现这一功能.

评估自己的政策

进行20次评估试验,以获得统计意义上的成功率:

python eval_policy_live.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --robot-ip=192.168.10.102 \
  --num-trials=20 \
  --log-results=./eval_results/k1-diffusion-v1-eval.json

对于每次试验,重置场景到与训练示范相同的启动配置.记录成功/失败结果和失败试验失败模式.常见失败模式:场景变化 (照明,对象位置),sim 和真实,不足的训练数据之间的域转移.

数据飞行车

在你的第一次部署后:

  1. 根据评估日志,确定您的前3种故障模式.
  2. 收集这些故障模式的针对性示范 (返回4单元).
  3. 混合新集与原始数据集 (50/50或重量为失败).
  4. 练习,重新评估,重复直到你达到目标成功率.

第五单元完成,当...

您有训练有素的扩散政策或ACT检查点,在模拟中取得60%以上的成功率.您已将其直接部署到K1并运行至少10次实时评估试验.您已确定了您最严重的故障模式,并制定了下一次数据收集会议的计划.

完整的路径

您已经从安全启动到一个有效的全身模仿学习政策, 在Booster K1. 在 [RCSV论坛]T6分享您的结果,并将您的数据集贡献到 [数据集注册表]T7.

[← 回到路径概述]