ACTで二手法の訓練
DK1の2手動学習経路の5単位. 2手動データセットでACTポリシーを練る. なぜACTが2手動,トレーニングコマンド,トレーニング曲線読み,ハイパーパラメータで優れているのか. ~4時間.
6つ目の5つ目 · 政策訓練 · ~4時間
ACTトレーニングを同期した双手データセットで開始し,双手訓練曲線を理解し,ユニット6に配備する価値のあるチェックポイントがある時を知ってください.
ACT が 双手作業 で 優れている の は なぜ です か
ACT (Action Chunked Transformers) は,当初は双手操纵研究のために開発された.その核心洞察は,単段階のアクションではなく将来のアクション (パーツ) のシーケンスを予測することで複合エラーが減少する.
行動の散歩メカニズムは,政策に計画的な視界を与えます.ACTは50Hzの時間ステップごとに単一の共同コマンドにコミットする代わりに,100歩前に計画し,実行を平滑にします.手渡し作業の場合,これは,計画されたシーケンスの一部として,それぞれのフレームに独立した反応する代わりに,両腕の手渡し点へのアプローチを"見ることができる"ということです. 経験的には,これは二手データセットの非分割アプローチと比較して 中間転送失敗率を半分に減らす.
ACTは,データセットのデモが一貫した戦略を代表すると仮定します.異なるデモが,ハンドオフを実行する根本的に異なる方法を示す場合,異なる腕が起動し,異なるハンドオフ高度,CVAEコンポーネントは単一のスタイルをコードするのに苦労します.あなたの100のデモはすべて同じ動き戦略を実行する必要があります.
訓練司令部
source ~/dk1-env/bin/activate python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id cube-handoff-v1 \ --root ~/dk1-datasets \ --output-dir ~/dk1-policy/cube-handoff-v1 \ --config-overrides \ policy.action_dim=14 \ policy.chunk_size=100 \ policy.n_action_steps=100 \ policy.dim_feedforward=3200 \ policy.n_heads=8 \ policy.n_encoder=4 \ \ \ save.n_decoder=7 training.number_steps=80000\.frequency training.\\\r\n\r\n\r\r\n\r\r\n\r\r\r\n\r\r\r\r\r\r\r\r\r\n\r\r\r\r\r\r\n\r\r\r\r\r\n\r\r\r\r\r\r\r\r\n\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\r\
GPUは実践的なトレーニング時間のために必要である: RTX 3080 (10GB) では,80,000 ステップは約90分かかります. RTX 4090 では,約50分です. CPU では,10
バイマニュアル の 訓練 曲線 を 読ん で
双手訓練曲線は,単腕と重要な点で異なります. 行動スペースが2つあり,政策はそれらを調整することを学ばなければなりません. 損失曲線におけるこれらのパターンを注意してください (TensorBoardで
L_再構築 (全体的な行動損失)
ステップ3から0.4以下に60万ステップに減少する.40万ステップ後に0.7以上を高原とする場合,データセットの品質の問題が示される.
L_kl (CVAEの規則化)
CVAEは30以上上昇すると,コンパクトなスタイルを組み込むために苦労している.これはしばしば示例の行動多様性が過剰であることを意味します.下位20%の最も一貫性のないデモと再訓練を切り取ることを考慮してください.
行動エラー:左対右
双手動型特殊ハイパーパラメータ
| Parameter | Default (single-arm) | DK1 Bimanual Recommended | Why |
|---|---|---|---|
action_dim |
7 | 14 | Two 6-DOF arms + 2 grippers = 14 action dimensions |
chunk_size |
100 | 100 | Same — action chunking is already well-suited to bimanual coordination timescales |
dim_feedforward |
3200 | 3200 | No change needed — the larger action space is handled by the action head, not the transformer width |
num_steps |
50000 | 80000 | Bimanual coordination requires more training steps to converge reliably; 80k is the practical minimum for 100 demos |
batch_size |
32 | 16 | Reduced to fit the larger bimanual dataset samples (dual camera feeds) in GPU memory |
kl_weight |
10 | 10 | Default works well; increase to 20 only if L_kl stays near zero after 30k steps (CVAE not learning) |
チェックポイント選択
チェックポイントは5,000歩ごとに保存する (
ユニット5が完成したら...
訓練は8万歩を完了し,チェックポイントは
[← 経路概要に戻る]







