DK1 Pathに戻る

ACTで二手法の訓練

DK1の2手動学習経路の5単位. 2手動データセットでACTポリシーを練る. なぜACTが2手動,トレーニングコマンド,トレーニング曲線読み,ハイパーパラメータで優れているのか. ~4時間.

6つ目の5つ目 · 政策訓練 · ~4時間

ACTトレーニングを同期した双手データセットで開始し,双手訓練曲線を理解し,ユニット6に配備する価値のあるチェックポイントがある時を知ってください.

ACT が 双手作業 で 優れている の は なぜ です か

ACT (Action Chunked Transformers) は,当初は双手操纵研究のために開発された.その核心洞察は,単段階のアクションではなく将来のアクション (パーツ) のシーケンスを予測することで複合エラーが減少する.

行動の散歩メカニズムは,政策に計画的な視界を与えます.ACTは50Hzの時間ステップごとに単一の共同コマンドにコミットする代わりに,100歩前に計画し,実行を平滑にします.手渡し作業の場合,これは,計画されたシーケンスの一部として,それぞれのフレームに独立した反応する代わりに,両腕の手渡し点へのアプローチを"見ることができる"ということです. 経験的には,これは二手データセットの非分割アプローチと比較して 中間転送失敗率を半分に減らす.

ACTは,データセットのデモが一貫した戦略を代表すると仮定します.異なるデモが,ハンドオフを実行する根本的に異なる方法を示す場合,異なる腕が起動し,異なるハンドオフ高度,CVAEコンポーネントは単一のスタイルをコードするのに苦労します.あなたの100のデモはすべて同じ動き戦略を実行する必要があります.

訓練司令部

source ~/dk1-env/bin/activate python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id cube-handoff-v1 \ --root ~/dk1-datasets \ --output-dir ~/dk1-policy/cube-handoff-v1 \ --config-overrides \ policy.action_dim=14 \ policy.chunk_size=100 \ policy.n_action_steps=100 \ policy.dim_feedforward=3200 \ policy.n_heads=8 \ policy.n_encoder=4 \ \ \ save.n_decoder=7 training.number_steps=80000\.frequency training.\\\r\n\r\n\r\r\n\r\r\n\r\r\r\n\r\r\r\r\r\r\r\r\r\n\r\r\r\r\r\r\n\r\r\r\r\r\n\r\r\r\r\r\r\r\r\n\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\

GPUは実践的なトレーニング時間のために必要である: RTX 3080 (10GB) では,80,000 ステップは約90分かかります. RTX 4090 では,約50分です. CPU では,1014時間を期待してください. GPU を持っている場合は T0旗を使用してください.クラウド GPU オプション (Lambda Labs, Vast.ai) は,必要なハードウェアのために約0.501.50$/h を実行します.

バイマニュアル の 訓練 曲線 を 読ん で

双手訓練曲線は,単腕と重要な点で異なります. 行動スペースが2つあり,政策はそれらを調整することを学ばなければなりません. 損失曲線におけるこれらのパターンを注意してください (TensorBoardでT1で参照してください):

L_再構築 (全体的な行動損失)

ステップ3から0.4以下に60万ステップに減少する.40万ステップ後に0.7以上を高原とする場合,データセットの品質の問題が示される.

L_kl (CVAEの規則化)

CVAEは30以上上昇すると,コンパクトなスタイルを組み込むために苦労している.これはしばしば示例の行動多様性が過剰であることを意味します.下位20%の最も一貫性のないデモと再訓練を切り取ることを考慮してください.

行動エラー:左対右

T2 オーバーライド (per-arm action error logging) を有効にすると,左と右のアクション次元に別々の損失曲線が表示されます.両者の間の大きな持続的なギャップは,一方の手の示例が他の方の手よりも一貫性があることを示します チェックリストの4号単位の品質チェックリストを遅れた腕にチェックします.

双手動型特殊ハイパーパラメータ

Parameter Default (single-arm) DK1 Bimanual Recommended Why
action_dim 7 14 Two 6-DOF arms + 2 grippers = 14 action dimensions
chunk_size 100 100 Same — action chunking is already well-suited to bimanual coordination timescales
dim_feedforward 3200 3200 No change needed — the larger action space is handled by the action head, not the transformer width
num_steps 50000 80000 Bimanual coordination requires more training steps to converge reliably; 80k is the practical minimum for 100 demos
batch_size 32 16 Reduced to fit the larger bimanual dataset samples (dual camera feeds) in GPU memory
kl_weight 10 10 Default works well; increase to 20 only if L_kl stays near zero after 30k steps (CVAE not learning)

チェックポイント選択

チェックポイントは5,000歩ごとに保存する (T9).最終チェックポイントがベストだと仮定しないでください.二手法の手順は,高いステップ数でオーバーフィットすることができます.

T10が平原に達し,わずかに上昇する前に最低値に達した段階でチェックポイントを選択します.通常は100のデモバイマニュアルデータセットで6万~8万のステップ範囲です. 2つのチェックポイント (最小損失チェックポイントと最終的なチェックポイント) を展開して,ユニット6で実世界のパフォーマンスを比較します.

ユニット5が完成したら...

訓練は8万歩を完了し,チェックポイントは T11で保存されます.最終的な T12値は 0.5 未満です. 損失曲線に基づいて最高のチェックポイントを特定しました. L_kl曲線があなたの走行中にどのように振る舞うかを理解します. ユニット6の実際のハードウェアに展開する準備ができています √ キューブハンドオフの目標成功率は>60% (双手作業は単腕作業よりも難しいので,これは強固な初走結果です).

[← 経路概要に戻る]