政策 を 訓練 する
学習経路の4単位.ACT,拡散政策,SmolVLAの間で選択してください.データセットでACTポリシーを訓練し,トレーニングログを読み,チェックポイントを管理します. ~3時間.
6件中4件 · 電車政策 · ~3時間
ポリシーアーキテクチャを選択し,データセットでトレーニングを開始し,トレーニングログを解釈し,Unit 5に展開準備ができているチェックポイントを保存します.
政策選択
訓練開始前に1つを選んでください 訓練中を切り替えることはできません
この道に推奨される
法律
動作型トランスフォーマー 腕の操縦に最適 GPUで1~3hで電車 予測可能な超パラメータ
拡散政策
精度作業のピーク精度が高く,訓練と推論の速度が3~5倍も遅い. ACTのベースラインが有効になった後,それを使用します.
スモルヴァラ
言語条件付きVLA. 作業に必要な自然言語の指示や多作業通用化.より多くのデータが必要です.
ACT訓練司令部
ユニット3からのデータセット repo ID で
source ~/lerobot-env/bin/activate python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id $HF_USER/pick-place-v1 \ --output-dir ~/lerobot-policy/pick-place-v1 \ --config-overrides \ training.num_steps=50000 \ training.evval_freq=5000 \ training.save GPU_freq=5000 \ training.batch_size=32 \ policy.chunk_size=100 \ policy.n_action_steps=100 # Add --device cuda if you have a (strongly recommended) \ Checkpoint every 5k to sleep ~ steps/obotlerot-pick-v1/1 スタートアップ・ポリスは実行する前に終了します #
GPUとCPUのトレーニング時間: RTX 3090 (24GB) では,5万歩は約6080分かかります. RTX 3080 (10GB) では約90120分です.CPUでは812時間をお待ちください.クラウドGPUオプション (Lambda Labs,Vast.ai) は,必要なハードウェアに対して0.501.50ドル/時間かかります.
単腕ピックアンド・プレイスの推奨ハイパーパラメータ
| Parameter | Recommended | Why |
|---|---|---|
| num_steps | 50000 | Sufficient for 50–100 demos of a simple pick-and-place. Increase to 80k if your loss plateau occurs late. |
| batch_size | 32 | Standard for single-arm datasets. Reduce to 16 if you run out of GPU memory. |
| chunk_size | 100 | ACT plans 100 steps ahead. At 30fps this is ~3.3 seconds — a good planning horizon for pick-and-place. |
| n_action_steps | 100 | Must match chunk_size. Reduces inference frequency and smooths execution. |
| kl_weight | 10 | LeRobot default. Do not change unless L_kl stays near zero after 20k steps. |
| lr | 1e-5 | LeRobot default for ACT. Lower to 5e-6 if reconstruction loss oscillates instead of converging. |
訓練日記 を 読書
端末と TensorBoard にトレーニングログを印刷します
テンソボード --logdir ~/レロボット・ポリシーズ/
損失/再建 (L_recon)
基本訓練信号は,0.1から0.1以下に5万ステップに減少する.4万ステップ後に0.15以上を高原とする場合,通常データセットが多変性があることを意味します.
損失/kl (L_kl)
動作は 0 から 5 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 〜 20 〜 20 〜 〜 〜 〜 20 〜 20 〜 20 〜 20 〜 〜 〜 〜 〜 〜 〜 〜 〜 20 〜 〜 〜 〜
列車/損失 (総損失)
L_recon + kl_weight × L_kl.初期トレーニングでL_reconが支配する.単調に減少する.初期減少後増加する総損失は学習速度の衰退があまりにも攻撃的であることを示します. スケジュール設定を確認します.
チェックポイント管理
チェックポイントは,
訓練後,最高のチェックポイントを特定します. レベルを始める前に L__再構築が最低に達した段階です. 50 回のデモでは,通常35,000
ユニット4 完成する...
訓練は5万歩を完了し,チェックポイントは
[← 経路概要に戻る]







