ACT로 2편의 정책을 훈련시키
DK1의 양동력 학습 경로 5부. 양동력 데이터 세트에 ACT 정책을 훈련하십시오. 왜 ACT가 양동력, 훈련 명령, 훈련 곡선을 읽는, 하이퍼 파라미터에서 우수한지. ~ 4 시간.
6개 중 5개 부대 · 정책 교육 · ~4시간
동기화된 양동력 데이터 세트에 ACT 훈련을 시작하고, 양동력 훈련 곡선을 이해하고, 6단계에서 배치할 가치가 있는 체크포인트가 언제 있는지 알 수 있습니다.
왜 ACT가 두 가지 과제 에서 우수 한 것 입니까?
ACT (Action Chunked Transformers) 는 원래 쌍방향 조작 연구를 위해 개발되었습니다. 그것의 핵심 통찰력은
액션
한 가지 주의 사항: ACT는 데이터 세트의 시범이 일관된 전략을 나타내는 것으로 가정합니다. 다른 시범이 시범을 실행하는 근본적으로 다른 방법을 보여주면, 다른 팔이 시범을 하는, 다른 시범 높이는 CVAE 구성 요소는 단일 스타일을 암호화하는 데 어려움을 겪을 것입니다. 당신의 100 개의 시범이 모두 같은 동작 전략을 실행해야 합니다.
훈련 지휘
소스 ~/dk1-env/bin/activate python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id cube-handoff-v1 \ --root ~/dk1-datasets \ --output-dir ~/dk1-policy/cube-handoff-v1 \ --config-overrides \ policy.action_dim=14 \ policy.chunk_size=100 \ policy.n_action_steps=100 \ policy.dim=feedforward=3200 \ policy.n_heads=8 \ policy.n_encoder=4 \.n_decoder=7 training.number_steps=80000.frequency training.\\q 5000 .frequency training.\q 5000 .ffffm = 14000 .fm = 14000 .fm = 14000 .fm = 14000 .fm = 14000 .fm = 14000 .fm = 14000
GPU가 필요한 연습 시간: RTX 3080 (10GB) 에서 80,000 단계가 약 90 분 소요됩니다. RTX 4090에서는 약 50 분. CPU에서는 10
2차 교육 곡선을 읽는 것
이중 수습 곡선은 한 팔과 한 가지 중요한 측면에서 다릅니다. 당신은 두 개의 행동 공간을 가지고 있으며 정책은 그것들을 조정하는 것을 배워야 합니다. 손실 곡선에서 이러한 패턴을 관찰하십시오 (TensorBoard에서
재건 (전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환전환
약 3.0에서 0.4에서 6만 단계 아래로 감소해야 합니다. 40,000 단계 후 0.7 이상의 고원도는 데이터 세트 품질 문제를 나타냅니다.
L_kl (CVAE 정규화)
CVAE는 30보다 높으면, 컴팩트 된 스타일 임베디션을 찾기 위해 고군분투하고 있습니다. 이것은 종종 당신의 시연이 너무 많은 행동 다양성을 의미합니다. 아래 20%의 가장 낮은 데모와 재교육을 줄이는 것을 고려하십시오.
행동 오류: 왼쪽과 오른쪽
팔당 동작 오류 로깅을 활성화하면 (
2기본별 하이퍼파라메터
| Parameter | Default (single-arm) | DK1 Bimanual Recommended | Why |
|---|---|---|---|
action_dim |
7 | 14 | Two 6-DOF arms + 2 grippers = 14 action dimensions |
chunk_size |
100 | 100 | Same — action chunking is already well-suited to bimanual coordination timescales |
dim_feedforward |
3200 | 3200 | No change needed — the larger action space is handled by the action head, not the transformer width |
num_steps |
50000 | 80000 | Bimanual coordination requires more training steps to converge reliably; 80k is the practical minimum for 100 demos |
batch_size |
32 | 16 | Reduced to fit the larger bimanual dataset samples (dual camera feeds) in GPU memory |
kl_weight |
10 | 10 | Default works well; increase to 20 only if L_kl stays near zero after 30k steps (CVAE not learning) |
체크포인트 선택
체크포인트 (
5부대 완료...
훈련은 80,000 단계가 완료되었고 체크포인트들은
[← 경로 개요로 돌아가요]







