LinkerBot O6 Path(으)로 돌아가기

열차 및 배치

O6 데이터 세트에 ACT 또는 방출 정책을 훈련하고 실시간으로 배포하십시오. 지속적인 개선을 위해 훈련 작업 흐름, 평가 프로토콜 및 데이터 플라이휠. ~ 3 시간.

5개 중 5개 부대 · 기차 & 배치 · ~ 3시간

50 에피소드 데이터 세트에 따라 모방 학습 정책을 훈련하고 오프라인에서 평가하고 O6에서 실시간으로 배포합니다. 목표: 실제 평가 실험 20개에서 ≥70%의 성공률.

정책 구조를 선택

초보자를 위한 추천

ACT (전환기 사용으로 액션 킹)

빠른 훈련 (12h 16GB GPU) 픽 앤 플레이 및 짧은 지평선 작업에 탁월하다. O6 테이블탑 조작에 기본 선택.

전파 정책

느린 훈련 (35h) 하지만 다 모달 행동 분포를 더 잘 처리합니다. 여러 유효한 완료 경로를 가진 작업에 사용하십시오.

단계 1: ACT를 이용한 훈련

python -m lerobot.scripts.train \
  --dataset_repo_id=your-username/o6-pick-place \
  --policy.type=act \
  --policy.chunk_size=100 \
  --training.num_epochs=200 \
  --training.batch_size=32 \
  --training.lr=1e-4 \
  --output_dir=./checkpoints/o6-act-v1

# Monitor training loss
tensorboard --logdir=./checkpoints/o6-act-v1/logs/

ACT 훈련은 일반적으로 50 에피소드 데이터 세트에서 100~150 시대 내에 안정됩니다. 멈추기 전에 평판에 대한 유효성 손실을 확인하십시오. 훈련 시간에만 기초하여 일찍 멈추지 마십시오.

단계 2: 오프라인 평가

하드웨어에 배치하기 전에 데이터 세트에서 지연된 에피소드 점검점을 평가하십시오.

python -m lerobot.scripts.eval \
  --pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
  --env.type=linker_bot_o6_sim \
  --eval.n_episodes=20 \
  --eval.batch_size=10

환경이 시뮬레이션 모델을 가지고 있지 않다면 데이터 세트 재생 평가기를 사용하십시오.

python -m lerobot.scripts.visualize_dataset \
  --repo-id your-username/o6-pick-place \
  --episode-index 0 \
  --policy-checkpoint ./checkpoints/o6-act-v1

단계 3: O6에서 실시간 배치

python -m lerobot.scripts.control_robot \
  --robot.type=linker_bot_o6 \
  --control.type=evaluate \
  --pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
  --control.fps=30 \
  --control.num_episodes=20 \
  --control.episode_time_s=30

각 시험에 대해:

  1. 객체를 표준 시작 위치로 배치하십시오.
  2. 팔이 집 위치에서 확인해
  3. 에피소드를 시작하세요. 팔이 직접 접촉하거나 마운트를 접촉하기 전까지는 개입하지 마십시오.
  4. 성공 (사업 완료) 또는 실패를 기록하고 실패 모드를 참고하십시오.

결과 를 해석 하는 것

Success Rate Action
≥70% Path complete. Share your results and contribute your dataset.
50–69% Collect 20–30 more episodes targeting your top failure mode. Retrain.
Below 50% Review dataset quality. Check camera alignment and starting position consistency. Consider a simpler task variant.

데이터 플라이휠

첫 번째 배치 후 지속적인 개선:

  1. 평가 로그에서 가장 큰 23 오류 모드를 확인하세요.
  2. 이러한 실패를 다루는 20~30개의 목표 시범을 수집한다.
  3. 새로운 에피소드를 원래 데이터 세트 (50/50 또는 실패로 인한 중소) 와 혼합하십시오.
  4. 처음부터 재 훈련 (검정점에서 아니라)
  5. 다시 평가하고 목표 성공률을 달성할 때까지 반복합니다.

결과 를 공유 하는 것

# Push your trained policy to HuggingFace Hub
python -m lerobot.scripts.push_policy_to_hub \
  --pretrained_policy_path=./checkpoints/o6-act-v1 \
  --repo-id=your-username/o6-pick-place-act

5부대 완료...

귀하의 ACT (또는 방급 정책) 체크포인트는 O6에서 20개의 실시간 평가 실험에서 ≥70%의 성공률을 달성합니다. 모든 테스트 결과를 기록하고 남은 실패 모드를 확인했습니다. 데이터 세트 및 정책 체크포인트는 백업되어 선택적으로 HuggingFace Hub에서 공유됩니다.

길 이 완성

당신은 LinkerBot O6의 팩싱에서 생산에서 작동하는 모방 학습 정책으로 이동했습니다. RCSV 포럼 에서 결과를 공유하고 [데이터셋 레지스트리](T6에 데이터 세트를 기여합니다.

[← 경로 개요로 돌아가요]