LeRobot Path(으)로 돌아가기

정책 을 훈련 시키십시오

레로봇 학습 경로 4단계. ACT, 디스포지션 정책, SmolVLA 사이에서 선택하세요. 데이터 세트에 ACT 정책을 훈련하세요. 훈련 로그를 읽어 보세요. 체크포인트 관리하세요. ~ 3시간.

6개 중 4개 부대 · 기차 정책 · ~ 3시간

정책 구조를 선택하고 데이터 세트에 교육을 시작하여 훈련 로그를 해석하고 Unit 5에 배치할 준비가 된 체크포인트를 저장합니다.

정책 선택

레로봇은 생산 준비 된 3가지 정책 아키텍처를 선보인다. 훈련 전에 하나를 선택하세요.

이 경로로 추천

ACT

액션 크 트랜스포머. 실력 있는 단팔 조작에 가장 좋습니다. GPU에서 1~3h에 열차합니다. 예측 가능한 하이퍼파레머. 이 방법을 사용하세요.

전파 정책

정확성 과제 에서 높은 최고 정확성, 하지만 훈련 및 추론 을 위해 35배 느려. ACT 기본 라인을 사용 한 후 사용 하십시오.

스몰블라

언어 조건 VLA. 작업에 자연어 지침이나 다 작업 일반화가 필요한 경우 사용하십시오. 더 많은 데이터가 필요합니다.

ACT 훈련 지휘

Unit 3에서 데이터 세트 repo ID로 T0을 교체하십시오.

소스 ~/레로봇-env/bin/activate python -m lerobot.scripts.train \ --policy-type act \ --dataset-repo-id $HF_USER/pick-place-v1 \ --output-dir ~/레로봇-정책/pick-place-v1 \ --config-overrides \ training.num_steps=50000 \ training.evval_freq=5000 \ training.save GPU_freq=5000 \ training.batch_size=32 \ policy.chunk_size=100 \ policy.n_action_steps=100 # Add --device cuda if you have a (strongly recommended) \

GPU와 CPU 훈련 시간: RTX 3090 (24GB) 에서 50,000 단계가 약 6080 분 소요됩니다. RTX 3080 (10GB) 에서 약 90120 분. CPU에서 812 시간을 예상합니다. 클라우드 GPU 옵션 (Lambda Labs, Vast.ai) 는 필요한 하드웨어에 대해 0.501.50달러/시간을 사용합니다.

단일 팔 픽 앤 플레이스용 권장 하이퍼파라미터

Parameter Recommended Why
num_steps 50000 Sufficient for 50–100 demos of a simple pick-and-place. Increase to 80k if your loss plateau occurs late.
batch_size 32 Standard for single-arm datasets. Reduce to 16 if you run out of GPU memory.
chunk_size 100 ACT plans 100 steps ahead. At 30fps this is ~3.3 seconds — a good planning horizon for pick-and-place.
n_action_steps 100 Must match chunk_size. Reduces inference frequency and smooths execution.
kl_weight 10 LeRobot default. Do not change unless L_kl stays near zero after 20k steps.
lr 1e-5 LeRobot default for ACT. Lower to 5e-6 if reconstruction loss oscillates instead of converging.

교육 로그 를 읽는 것

터미널과 TensorBoard에 훈련 로그를 인쇄합니다. 두 번째 터미널에서 TensorBoard를 시작하십시오.

스보드 --logdir ~/레로봇-정책/

다음 브라우저에서 T1을 열고 이 곡선을 보세요.

손실/재생 (L_recon)

기본 훈련 신호. ~ 2.53.5에서 0.1에서 50,000 단계 아래로 감소해야 합니다. 40,000 단계 후 0.15 이상의 고원도는 일반적으로 데이터 세트가 너무 많은 변수를 의미합니다.

손실/kl (L_kl)

CVAE는 콤팩트 스타일 임베디션을 배우고 있다. 40을 넘으면, 당신의 시연은 행동 다양성이 너무 많을 것이다. 20k 단계 후 0에 가까이 남아 있다면, CVAE는 학습하지 않고 있다. kl_중량을 20으로 증가시킨다.

열차/손실 (총손실)

L_recon + kl_weight × L_kl. 초기 훈련에서 L_recon에 의해 지배된다. 단조적으로 감소해야 한다. 초기 감소 후 증가하는 전체 손실은 학습 속도 붕괴가 너무 공격적인 것을 나타냅니다.

체크포인트 관리

체크포인트들은 T2까지 5,000 단계마다 저장합니다. 최종 체크포인트가 가장 좋은 것으로 생각하지 마십시오. 정책은 높은 단계 수를 통해, 특히 작은 데이터 세트에서 과장될 수 있습니다.

훈련 후 가장 좋은 점검점을 확인하세요. 그것은 L__재건이 평야에 도달하기 전에 최저 수준에 도달한 단계입니다. 50 개의 시범에서는 일반적으로 35,00050,000 단계 범위에서 발생합니다. 이 단계 번호를 저장하세요.

4단체 완료...

훈련은 50,000 단계가 완료되었으며 체크포인트들은 T3에서 저장됩니다. 최종 L_재건 손실은 0.1 이하입니다. 손실 곡선을 기반으로 최고의 체크포인트 단계를 확인했습니다. 훈련 과정에서 L_kl가 무엇을 하는지 이해합니다. 당신은 5 단위에서 정책을 평가할 준비가되어 있습니다.

[← 경로 개요로 돌아가]