OpenArm Pathに戻る

原則 を 訓練 する

学習経路の第5単位.データセットでACT模倣学習方針を訓練する.トレーニング曲線を理解する,いつ停止するかを知る,そして70%以上の成功率に達する. ~3時間.

6つ目の5つ目 · 政策訓練 · ~3時間

テストの訓練に 50 件のデータセットを入れ 訓練曲線を監視し,正しいチェックポイントで停止します 目標はテストの作業の 70%以上を成功させる方針です

模倣 学習 が 実際 に 何 を 行なう の です か

模倣学習は,観察 (カメラ画像 + 現在の共同状態) を行動 (次なる関節角度) に映し出すための政策ネットワークを訓練します. ネットワークは報酬信号を受け取らない 単にあなたのデモをみているだけで 似たような状態で実行した行動の分布を 複製することを学んでいます

ACT(Action Chunking with Transformers) は,単一のステップではなく,同時に100の将来のアクションを予測する.これはエピソード全体でエラーの蓄積を防ぐ.個別予測がわずかにオフであっても,その部分は安定した軌道のバッファーを提供します.その後,100時間のステップごとに2秒で50Hzに再計画します.それゆえ,ACTは単純な行動クローンよりも長い作業をうまく処理します.

理論的な背景については,ロボット工学図書館で [模倣学習基礎] (T1) をご覧ください.

GPUか CPUか?

8GB+VRAMのNVIDIA GPUのトレーニングは100kステップで約45分かかります. CPUのトレーニングは34時間かかります.両方が同等モデル品質のGPUを生産します.ローカルGPUがない場合は,トレーニングコマンドはクラウドインスタンスの (Lambda Labsまたは Google ColabとA100実行時間) に一致します.指示はLeRobot レポの READMEにあります.

データを集める上で ACT を列挙する

仮想環境からトレーニングスクリプトを実行します.下記の設定値は,OpenArm の50エピソードのピックアンド・プレイスデータセットに校正されています.

source ~/openarm-env/bin/activate python -m lerobot.scripts.train \ --dataset-path ~/openarm-datasets/pick-and-place \ --policy act \ --batch-size 8 \ --lr 1e-5 \ ----num-train-steps 100000 \ --eval-freq 5000 \ --save-freq 10000 \ --log-freq 500 \ --output-dir ~/openarm-policy/pick-and-place-v1 # 訓練は500歩ごとに損失を印刷し,5000歩ごとに結果を評価します

訓練を開始し,その後出力を監視する. 時間を全う観察する必要はありません. 負荷が減って,走行が崩れていないことを確認するために20~30分ごとにチェックしてください. 睡眠中にトレーニングは夜間実行できます.

訓練曲線 を 理解 する

ACTのトレーニング結果には2つの重要な指標が示されています.正しく読むことを学びます.

訓練の喪失

初期20kのステップで急激に減少し,その後よりゆっくりと減少し続けなければならない.0.05以上の高原の損失は通常データ品質の問題を示します.データセットをチェックします.広く振動する損失は,学習率があまりにも高いことを示します.

同等 の 成功 率

運動の速度が上昇するにつれて,運動の速度が上昇する. 運動の速度が上昇するにつれて,運動の速度が上昇する.

行動 MSE

予測された行動と基本的真実の行動の間での平均の2乗誤り. 訓練されたピックアンドプレイスポリシーでは0.01以下に下がる必要があります. 80kステップ後に高いアクション MSEは,モデルが課題の複雑さと闘っていることを意味します.またはあなたのデータは一貫性がない.

KL 差異 (ATT特有の)

ACTは,トレーニング中に0から10までのアニールでCVAEを用いています.40kのステップの周辺で安定化することを注意してください.もし決して収束しない場合は,モデルはスタイルをコードできない.

訓練 を 止める 時

チェックポイントが展開準備ができている時を決めるために この信号を使ってください.

  • 同等の成功率は3回の連続評価で平ら化した モデルが収束した.
  • ユニット6の展開の限界値です. 60kステップで70%に達すると,早く立ち止まってチェックポイントを展開できます.
  • 訓練損失は依然として減少していますが, evalは平らか低下している モデルが過度に合っている. evalがピークに達した最後のチェックポイントをご覧ください.これは最高のチェックポイントです.
  • 100000歩を踏んだ後 成功率は40%未満なら,第4単位に戻る. この時点でデータ問題は訓練の問題よりも多い.

オプション ディープダイブ

ACT 拡散政策と π0

ACTの動作方針が確立された後,自然に次の実験は拡散政策です.よりゆっくりと推論するコストで多モードタスクをうまく処理します.RCSV研究セクションは両方カバーします.

ユニット5が完成したら...

訓練が完了した (または良いチェックポイントで停止した). チェックポイントの評価成功率は70%以上です. チェックポイントは T0で保存され,どのステップ番号が最高の結果をもたらしたかを知っています. このポリシーをユニット6の実際の腕に入れる準備ができています.

[← 経路概要に戻る]