LeRobot Pathに戻る

政策 を 訓練 する

学習経路の4単位.ACT,拡散政策,SmolVLAの間で選択してください.データセットでACTポリシーを訓練し,トレーニングログを読み,チェックポイントを管理します. ~3時間.

6件中4件 · 電車政策 · ~3時間

ポリシーアーキテクチャを選択し,データセットでトレーニングを開始し,トレーニングログを解釈し,Unit 5に展開準備ができているチェックポイントを保存します.

政策選択

訓練開始前に1つを選んでください 訓練中を切り替えることはできません

この道に推奨される

法律

動作型トランスフォーマー 腕の操縦に最適 GPUで1~3hで電車 予測可能な超パラメータ

拡散政策

精度作業のピーク精度が高く,訓練と推論の速度が3~5倍も遅い. ACTのベースラインが有効になった後,それを使用します.

スモルヴァラ

言語条件付きVLA. 作業に必要な自然言語の指示や多作業通用化.より多くのデータが必要です.

ACT訓練司令部

ユニット3からのデータセット repo ID で T0 を置き換える

source ~/lerobot-env/bin/activate python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id $HF_USER/pick-place-v1 \ --output-dir ~/lerobot-policy/pick-place-v1 \ --config-overrides \ training.num_steps=50000 \ training.evval_freq=5000 \ training.save GPU_freq=5000 \ training.batch_size=32 \ policy.chunk_size=100 \ policy.n_action_steps=100 # Add --device cuda if you have a (strongly recommended) \ Checkpoint every 5k to sleep ~ steps/obotlerot-pick-v1/1 スタートアップ・ポリスは実行する前に終了します #

GPUとCPUのトレーニング時間: RTX 3090 (24GB) では,5万歩は約6080分かかります. RTX 3080 (10GB) では約90120分です.CPUでは812時間をお待ちください.クラウドGPUオプション (Lambda Labs,Vast.ai) は,必要なハードウェアに対して0.501.50ドル/時間かかります.

単腕ピックアンド・プレイスの推奨ハイパーパラメータ

Parameter Recommended Why
num_steps 50000 Sufficient for 50–100 demos of a simple pick-and-place. Increase to 80k if your loss plateau occurs late.
batch_size 32 Standard for single-arm datasets. Reduce to 16 if you run out of GPU memory.
chunk_size 100 ACT plans 100 steps ahead. At 30fps this is ~3.3 seconds — a good planning horizon for pick-and-place.
n_action_steps 100 Must match chunk_size. Reduces inference frequency and smooths execution.
kl_weight 10 LeRobot default. Do not change unless L_kl stays near zero after 20k steps.
lr 1e-5 LeRobot default for ACT. Lower to 5e-6 if reconstruction loss oscillates instead of converging.

訓練日記 を 読書

端末と TensorBoard にトレーニングログを印刷します

テンソボード --logdir ~/レロボット・ポリシーズ/

T1をブラウザで開いて,この曲線を見てください.

損失/再建 (L_recon)

基本訓練信号は,0.1から0.1以下に5万ステップに減少する.4万ステップ後に0.15以上を高原とする場合,通常データセットが多変性があることを意味します.

損失/kl (L_kl)

動作は 0 から 5 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 20 〜 〜 20 〜 20 〜 〜 〜 〜 20 〜 20 〜 20 〜 20 〜 〜 〜 〜 〜 〜 〜 〜 〜 20 〜 〜 〜 〜

列車/損失 (総損失)

L_recon + kl_weight × L_kl.初期トレーニングでL_reconが支配する.単調に減少する.初期減少後増加する総損失は学習速度の衰退があまりにも攻撃的であることを示します. スケジュール設定を確認します.

チェックポイント管理

チェックポイントは, T2まで5000歩ごとに保存します.最終チェックポイントがベストだと仮定しないでください. 政策は,特に小さなデータセットで高いステップ数でオーバーフィットすることができます.

訓練後,最高のチェックポイントを特定します. レベルを始める前に L__再構築が最低に達した段階です. 50 回のデモでは,通常35,00050,000のステップ範囲で発生します. このステップ番号を保存します 5 ユニットで使用します.

ユニット4 完成する...

訓練は5万歩を完了し,チェックポイントは T3で保存されます.最終的な L_再構築損失は0.1未満です. 損失曲線に基づいて最高のチェックポイントステップを特定しました. 訓練の実行中に L_kl が何をしているかを理解しています. ユニット5のポリシーを評価する準備ができています.

[← 経路概要に戻る]