返回LeRobot Path

培养一个政策

选择ACT,扩散政策和SmolVLA. 在数据集中训练ACT政策,阅读训练日志,管理检查站. ~ 3小时.

列车政策 列车政策 列车政策

选择一个政策架构,在数据集中启动训练,解释训练日志,并保存一个准备部署的检查点5.

政策选择

您可以在训练之前选择一个,您不能在训练中切换.

建议使用此路径

法律

动作碎变压器. 最适合巧妙的单臂操纵. 在13h内在GPU上. 预测性超参数. 使用这个.

传播政策

精度任务的高峰精度,但训练和推断速度是35倍慢.

斯莫尔维拉

语言条件的VLA. 当您的任务需要自然语言指令或多任务通用化时使用.需要更多数据.

行动训练指挥部

取代T0用从3个单元的数据集备份ID.

source ~/lerobot-env/bin/activate python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id $HF_USER/pick-place-v1 \ --output-dir ~/lerobot-policy/pick-place-v1 \ --config-overrides \ training.num_steps=50000 \ training.event_freq=5000 \ training.save GPU_freq=5000 \ training.batch_size=32 \ policy.chunk_size=100 \ policy.n_action_steps=100 # Add --device cuda if you have a (strongly recommended) \ Checkpoint every 5k to sleep ~ steps/obot-pick-v1/# 开始运行之前

GPU与CPU训练时间: 在RTX 3090 (24GB) 上,5万步程需要大约6080分钟.在RTX 3080 (10GB) 上,大约90120分钟.在CPU上,预计812小时.云GPU选项 (Lambda Labs,Vast.ai) 运行0.501.50/小时.

建议单臂接器的超参数

Parameter Recommended Why
num_steps 50000 Sufficient for 50–100 demos of a simple pick-and-place. Increase to 80k if your loss plateau occurs late.
batch_size 32 Standard for single-arm datasets. Reduce to 16 if you run out of GPU memory.
chunk_size 100 ACT plans 100 steps ahead. At 30fps this is ~3.3 seconds — a good planning horizon for pick-and-place.
n_action_steps 100 Must match chunk_size. Reduces inference frequency and smooths execution.
kl_weight 10 LeRobot default. Do not change unless L_kl stays near zero after 20k steps.
lr 1e-5 LeRobot default for ACT. Lower to 5e-6 if reconstruction loss oscillates instead of converging.

阅读训练日志

打印训练日志到终端和TensorBoard.

机板--logdir ~/雷罗बोट-政策/

然后在浏览器中打开T1.

损失/重建 (L_recon)

基本训练信号.应该从2.53.5降低到0.1以下5万步.在4万步后,高原高于0.15通常意味着你的数据集有太多的差异.

损失/kl (L_kl)

慢慢从近0到520上升.这是预期的行为.CVAE正在学习一个紧的风格嵌入.如果超过40个,你的演示包含了太多的行为多样性.如果它在20k步骤后保持在0附近,CVAE没有学习;增加kl_weight到20.

列车/损失 (总损失)

重量 × L_kl. 早期训练中由L_recon主导. 应该单调降低. 初步降低后增加的总损失表明学习速度衰退太激进.

检查点管理

检查点每5,000步都保存到T2.不要假设最后的检查点是最好的.政策可以在高步数上过度适应,特别是小数据集.

训练后,确定您最好的检查点:这是L_重建在开始高原之前达到最低的步骤.对于50次示范,这通常发生在35,00050,000步骤范围内. 保存这个步骤号码,您将在5个单元中使用它.

第四单元完成时...

训练完成了5万步骤,检查点在T3中保存.最终的L_重建损失低于0.1.你已经根据损失曲线确定了最好的检查点步骤.你明白L_kl在训练中做什么.你准备好评估5个单元的政策.

[← 回到路径概述]