原則 を 訓練 する
学習経路の第5単位.データセットでACT模倣学習方針を訓練する.トレーニング曲線を理解する,いつ停止するかを知る,そして70%以上の成功率に達する. ~3時間.
6つ目の5つ目 · 政策訓練 · ~3時間
テストの訓練に 50 件のデータセットを入れ 訓練曲線を監視し,正しいチェックポイントで停止します 目標はテストの作業の 70%以上を成功させる方針です
模倣 学習 が 実際 に 何 を 行なう の です か
模倣学習は,観察 (カメラ画像 + 現在の共同状態) を行動 (次なる関節角度) に映し出すための政策ネットワークを訓練します. ネットワークは報酬信号を受け取らない
ACT(Action Chunking with Transformers) は,単一のステップではなく,同時に100の将来のアクションを予測する.これはエピソード全体でエラーの蓄積を防ぐ.個別予測がわずかにオフであっても,その部分は安定した軌道のバッファーを提供します.その後,100時間のステップごとに2秒で50Hzに再計画します.それゆえ,ACTは単純な行動クローンよりも長い作業をうまく処理します.
理論的な背景については,ロボット工学図書館で [模倣学習基礎] (
GPUか CPUか?
8GB+VRAMのNVIDIA GPUのトレーニングは100kステップで約45分かかります. CPUのトレーニングは3
データを集める上で ACT を列挙する
仮想環境からトレーニングスクリプトを実行します.下記の設定値は,OpenArm の50エピソードのピックアンド・プレイスデータセットに校正されています.
source ~/openarm-env/bin/activate python -m lerobot.scripts.train \ --dataset-path ~/openarm-datasets/pick-and-place \ --policy act \ --batch-size 8 \ --lr 1e-5 \ ----num-train-steps 100000 \ --eval-freq 5000 \ --save-freq 10000 \ --log-freq 500 \ --output-dir ~/openarm-policy/pick-and-place-v1 # 訓練は500歩ごとに損失を印刷し,5000歩ごとに結果を評価します
訓練を開始し,その後出力を監視する. 時間を全う観察する必要はありません. 負荷が減って,走行が崩れていないことを確認するために20~30分ごとにチェックしてください. 睡眠中にトレーニングは夜間実行できます.
訓練曲線 を 理解 する
ACTのトレーニング結果には2つの重要な指標が示されています.正しく読むことを学びます.
訓練の喪失
初期20kのステップで急激に減少し,その後よりゆっくりと減少し続けなければならない.0.05以上の高原の損失は通常データ品質の問題を示します.データセットをチェックします.広く振動する損失は,学習率があまりにも高いことを示します.
同等 の 成功 率
運動の速度が上昇するにつれて,運動の速度が上昇する. 運動の速度が上昇するにつれて,運動の速度が上昇する.
行動 MSE
予測された行動と基本的真実の行動の間での平均の2乗誤り. 訓練されたピックアンドプレイスポリシーでは0.01以下に下がる必要があります. 80kステップ後に高いアクション MSEは,モデルが課題の複雑さと闘っていることを意味します.またはあなたのデータは一貫性がない.
KL 差異 (ATT特有の)
ACTは,トレーニング中に0から10までのアニールでCVAEを用いています.40kのステップの周辺で安定化することを注意してください.もし決して収束しない場合は,モデルはスタイルをコードできない.
訓練 を 止める 時
チェックポイントが展開準備ができている時を決めるために この信号を使ってください.
- 同等の成功率は3回の連続評価で平ら化した モデルが収束した.
- ユニット6の展開の限界値です. 60kステップで70%に達すると,早く立ち止まってチェックポイントを展開できます.
- 訓練損失は依然として減少していますが, evalは平らか低下している モデルが過度に合っている. evalがピークに達した最後のチェックポイントをご覧ください.これは最高のチェックポイントです.
- 100000歩を踏んだ後
成功率は40%未満なら,第4単位に戻る. この時点でデータ問題は訓練の問題よりも多い.
オプション ディープダイブ
ACT 拡散政策と π0
ACTの動作方針が確立された後,自然に次の実験は拡散政策です.よりゆっくりと推論するコストで多モードタスクをうまく処理します.RCSV研究セクションは両方カバーします.
ユニット5が完成したら...
訓練が完了した (または良いチェックポイントで停止した). チェックポイントの評価成功率は70%以上です. チェックポイントは
[← 経路概要に戻る]







