정책 을 훈련 시키십시오
레로봇 학습 경로 4단계. ACT, 디스포지션 정책, SmolVLA 사이에서 선택하세요. 데이터 세트에 ACT 정책을 훈련하세요. 훈련 로그를 읽어 보세요. 체크포인트 관리하세요. ~ 3시간.
6개 중 4개 부대 · 기차 정책 · ~ 3시간
정책 구조를 선택하고 데이터 세트에 교육을 시작하여 훈련 로그를 해석하고 Unit 5에 배치할 준비가 된 체크포인트를 저장합니다.
정책 선택
레로봇은 생산 준비 된 3가지 정책 아키텍처를 선보인다. 훈련 전에 하나를 선택하세요.
이 경로로 추천
ACT
액션
전파 정책
정확성 과제 에서 높은 최고 정확성, 하지만 훈련 및 추론 을 위해 3
스몰블라
언어 조건 VLA. 작업에 자연어 지침이나 다 작업 일반화가 필요한 경우 사용하십시오. 더 많은 데이터가 필요합니다.
ACT 훈련 지휘
Unit 3에서 데이터 세트 repo ID로
소스 ~/레로봇-env/bin/activate python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id $HF_USER/pick-place-v1 \ --output-dir ~/레로봇-정책/pick-place-v1 \ --config-overrides \ training.num_steps=50000 \ training.evval_freq=5000 \ training.save GPU_freq=5000 \ training.batch_size=32 \ policy.chunk_size=100 \ policy.n_action_steps=100 # Add --device cuda if you have a (strongly recommended) \
GPU와 CPU 훈련 시간: RTX 3090 (24GB) 에서 50,000 단계가 약 6080 분 소요됩니다. RTX 3080 (10GB) 에서 약 90120 분. CPU에서 812 시간을 예상합니다. 클라우드 GPU 옵션 (Lambda Labs, Vast.ai) 는 필요한 하드웨어에 대해 0.501.50달러/시간을 사용합니다.
단일 팔 픽 앤 플레이스용 권장 하이퍼파라미터
| Parameter | Recommended | Why |
|---|---|---|
| num_steps | 50000 | Sufficient for 50–100 demos of a simple pick-and-place. Increase to 80k if your loss plateau occurs late. |
| batch_size | 32 | Standard for single-arm datasets. Reduce to 16 if you run out of GPU memory. |
| chunk_size | 100 | ACT plans 100 steps ahead. At 30fps this is ~3.3 seconds — a good planning horizon for pick-and-place. |
| n_action_steps | 100 | Must match chunk_size. Reduces inference frequency and smooths execution. |
| kl_weight | 10 | LeRobot default. Do not change unless L_kl stays near zero after 20k steps. |
| lr | 1e-5 | LeRobot default for ACT. Lower to 5e-6 if reconstruction loss oscillates instead of converging. |
교육 로그 를 읽는 것
터미널과 TensorBoard에 훈련 로그를 인쇄합니다. 두 번째 터미널에서 TensorBoard를 시작하십시오.
다음 브라우저에서
손실/재생 (L_recon)
기본 훈련 신호. ~ 2.5
손실/kl (L_kl)
CVAE는 콤팩트 스타일 임베디션을 배우고 있다. 40을 넘으면, 당신의 시연은 행동 다양성이 너무 많을 것이다. 20k 단계 후 0에 가까이 남아 있다면, CVAE는 학습하지 않고 있다. kl_중량을 20으로 증가시킨다.
열차/손실 (총손실)
L_recon + kl_weight × L_kl. 초기 훈련에서 L_recon에 의해 지배된다. 단조적으로 감소해야 한다. 초기 감소 후 증가하는 전체 손실은 학습 속도 붕괴가 너무 공격적인 것을 나타냅니다.
체크포인트 관리
체크포인트들은
훈련 후 가장 좋은 점검점을 확인하세요. 그것은 L__재건이 평야에 도달하기 전에 최저 수준에 도달한 단계입니다. 50 개의 시범에서는 일반적으로 35,000
4단체 완료...
훈련은 50,000 단계가 완료되었으며 체크포인트들은
[← 경로 개요로 돌아가]







