열차 및 배치
O6 데이터 세트에 ACT 또는 방출 정책을 훈련하고 실시간으로 배포하십시오. 지속적인 개선을 위해 훈련 작업 흐름, 평가 프로토콜 및 데이터 플라이휠. ~ 3 시간.
5개 중 5개 부대 · 기차 & 배치 · ~ 3시간
50 에피소드 데이터 세트에 따라 모방 학습 정책을 훈련하고 오프라인에서 평가하고 O6에서 실시간으로 배포합니다. 목표: 실제 평가 실험 20개에서 ≥70%의 성공률.
정책 구조를 선택
초보자를 위한 추천
ACT (전환기 사용으로 액션 킹)
빠른 훈련 (1
전파 정책
느린 훈련 (3
단계 1: ACT를 이용한 훈련
python -m lerobot.scripts.train \
--dataset_repo_id=your-username/o6-pick-place \
--policy.type=act \
--policy.chunk_size=100 \
--training.num_epochs=200 \
--training.batch_size=32 \
--training.lr=1e-4 \
--output_dir=./checkpoints/o6-act-v1
# Monitor training loss
tensorboard --logdir=./checkpoints/o6-act-v1/logs/
ACT 훈련은 일반적으로 50 에피소드 데이터 세트에서 100~150 시대 내에 안정됩니다. 멈추기 전에 평판에 대한 유효성 손실을 확인하십시오. 훈련 시간에만 기초하여 일찍 멈추지 마십시오.
단계 2: 오프라인 평가
하드웨어에 배치하기 전에 데이터 세트에서 지연된 에피소드 점검점을 평가하십시오.
python -m lerobot.scripts.eval \
--pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
--env.type=linker_bot_o6_sim \
--eval.n_episodes=20 \
--eval.batch_size=10
환경이 시뮬레이션 모델을 가지고 있지 않다면 데이터 세트 재생 평가기를 사용하십시오.
python -m lerobot.scripts.visualize_dataset \
--repo-id your-username/o6-pick-place \
--episode-index 0 \
--policy-checkpoint ./checkpoints/o6-act-v1
단계 3: O6에서 실시간 배치
python -m lerobot.scripts.control_robot \
--robot.type=linker_bot_o6 \
--control.type=evaluate \
--pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
--control.fps=30 \
--control.num_episodes=20 \
--control.episode_time_s=30
각 시험에 대해:
- 객체를 표준 시작 위치로 배치하십시오.
- 팔이 집 위치에서 확인해
- 에피소드를 시작하세요. 팔이 직접 접촉하거나 마운트를 접촉하기 전까지는 개입하지 마십시오.
- 성공 (사업 완료) 또는 실패를 기록하고 실패 모드를 참고하십시오.
결과 를 해석 하는 것
| Success Rate | Action |
|---|---|
| ≥70% | Path complete. Share your results and contribute your dataset. |
| 50–69% | Collect 20–30 more episodes targeting your top failure mode. Retrain. |
| Below 50% | Review dataset quality. Check camera alignment and starting position consistency. Consider a simpler task variant. |
데이터 플라이휠
첫 번째 배치 후 지속적인 개선:
- 평가 로그에서 가장 큰 2
3 오류 모드를 확인하세요. - 이러한 실패를 다루는 20~30개의 목표 시범을 수집한다.
- 새로운 에피소드를 원래 데이터 세트 (50/50 또는 실패로 인한 중소) 와 혼합하십시오.
- 처음부터 재 훈련 (검정점에서 아니라)
- 다시 평가하고 목표 성공률을 달성할 때까지 반복합니다.
결과 를 공유 하는 것
# Push your trained policy to HuggingFace Hub
python -m lerobot.scripts.push_policy_to_hub \
--pretrained_policy_path=./checkpoints/o6-act-v1 \
--repo-id=your-username/o6-pick-place-act
5부대 완료...
귀하의 ACT (또는 방급 정책) 체크포인트는 O6에서 20개의 실시간 평가 실험에서 ≥70%의 성공률을 달성합니다. 모든 테스트 결과를 기록하고 남은 실패 모드를 확인했습니다. 데이터 세트 및 정책 체크포인트는 백업되어 선택적으로 HuggingFace Hub에서 공유됩니다.
길 이 완성
당신은 LinkerBot O6의 팩싱에서 생산에서 작동하는 모방 학습 정책으로 이동했습니다. RCSV 포럼 에서 결과를 공유하고 [데이터셋 레지스트리](
[← 경로 개요로 돌아가요]







