Booster K1 Path(으)로 돌아가기

열차 및 배치

부스터 K1 데이터 세트에 전체 신체 모방 학습 정책을 훈련하고 실시간으로 배포하십시오. 훈련 작업 흐름, 평가 매트릭 및 안전한 실시간 배포 프로토콜.

5개 중 5개 부대 · 기차 & 배치 · ~ 6시간

데이터 세트에 전체 신체 모방 학습 정책을 훈련시키고 시뮬레이션에서 평가하고 안전 모니터링을 통해 실제 K1에 배치하십시오. 목표: 시범 작업에서 60% 이상의 성공률.

단계 1: 데이터 세트를 LeRobot 형식으로 변환

python convert_k1_to_lerobot.py \
  --input-dir ./recordings/session_001/ \
  --output-dir ./dataset/k1-pick-place/ \
  --repo-id your-username/k1-pick-place \
  --success-only  # filters to episodes labeled success=true

2 단계: 전파 정책 을 적용 하여 훈련 하십시오

디푸지언 정책은 다모달 액션 배포를 처리하고 원활한 궤도를 생성하기 때문에 전체 신체 작업에 잘 작동합니다. NVIDIA GPU (16 GB VRAM 권장) 에서 훈련은 3~6 시간 소요됩니다.

python -m lerobot.scripts.train \
  --dataset_repo_id=your-username/k1-pick-place \
  --policy.type=diffusion \
  --policy.obs_as_global_cond=true \
  --training.num_epochs=300 \
  --training.batch_size=64 \
  --output_dir=./checkpoints/k1-diffusion-v1

# Monitor training (open in browser)
tensorboard --logdir=./checkpoints/k1-diffusion-v1/logs/

훈련 손실 및 검증 손실 곡선을 관찰하십시오. 검증 손실이 적어도 20 시대 동안 평평하게 유지되면 훈련이 완료됩니다. 벽 시간만으로 훈련을 일찍 중단하지 마십시오.

단계 3: MuJoCo 시뮬레이션에서 평가

python eval_policy_sim.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --env=booster_gym/envs/pick_place.py \
  --num_episodes=20 \
  --render

목표: 실제 하드웨어에 배치되기 전에 시뮬레이션 성공률 ≥60%; 60% 이하라면 더 많은 시범을 수집하거나 데이터 품질을 확인합니다.

단계 4: 실제 K1에서 실시간 배치

정책 배포 시 모든 안전 프로토콜이 적용됩니다. 스포터 현존, 전자 정지 테스트, 3m × 3m 깨끗한 영역. 첫 번째 라이브 런트 동안, 전자 정지 위에 손을 두십시오. 정책은 가장자리에 예상치 못한 움직임을 일으킬 수 있습니다.

python deploy_policy.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --robot-ip=192.168.10.102 \
  --cameras head_cam,external \
  --task "pick up the red block" \
  --max-episode-duration=30 \
  --safety-monitor=true

T5 플래그는 결합 속속이나 토크가 안전 문턱을 초과하면 자동 DAMP 회전 기능을 가능하게 합니다. 초기 배치 중에 항상 이것을 가능하게 합니다.

당신 의 정책 을 평가 하는 것

통계적으로 의미 있는 성공률을 얻기 위해 20개의 평가 실험을 수행하십시오.

python eval_policy_live.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --robot-ip=192.168.10.102 \
  --num-trials=20 \
  --log-results=./eval_results/k1-diffusion-v1-eval.json

각 시험에 대해, 시나리오를 훈련 시범과 같은 시작 구성으로 재설정하십시오. 실패한 시험의 성공/실패 결과와 실패 모드를 기록하십시오. 일반적인 실패 모드는: 시나리오 변동 (빛, 객체 위치), 시기와 실제 훈련 데이터 사이의 도메인 전환, 충분하지 않습니다.

데이터 플라이휠

첫 번째 배치 후:

  1. 평가 로그에서 가장 큰 3가지 오류 모드를 확인하세요.
  2. 해당 오류 모드를 포함하는 목표된 시범을 수집한다 (부동 4로 돌아가면).
  3. 새로운 에피소드를 원래 데이터 세트 (50/50 또는 실패로 중소) 와 혼합하십시오.
  4. 훈련하고 재평가하고 목표 성공률을 달성할 때까지 반복하십시오.

5부대 완료...

당신은 시뮬레이션에서 ≥60%의 성공률을 달성하는 훈련된 퍼포시전 정책 또는 ACT 체크포인트를 가지고 있습니다. 당신은 K1에 실시간으로 배치하고 적어도 10 개의 실제 평가 실험을 실행했습니다. 당신은 당신의 주요 실패 모드를 확인하고 다음 데이터 수집 세션에 대한 계획을 가지고 있습니다.

길 이 완성

당신은 안전 전력에서 부스터 K1에 대한 전체 신체 모방 학습 정책으로 이동했습니다. RCSV 포럼 에서 결과를 공유하고 [데이터셋 레지스트리](T7에 데이터 세트를 기여하십시오.

[← 경로 개요로 돌아가]