OpenArm Path(으)로 돌아가기

첫 번째 정책 을 훈련 하라

오픈아름 학습 경로 5단계. 데이터 세트에 ACT 모방 학습 정책을 훈련하십시오. 훈련 곡선을 이해하고, 언제 멈출지 알고, 70% 이상의 성공률을 달성하십시오. ~ 3 시간.

6개 중 5개 부대 · 정책 교육 · ~ 3시간

50개의 디모 데이터 세트를 ACT 트레이너에 입력하고 훈련 곡선을 모니터링하고 올바른 체크포인트에서 멈추십시오. 목표: 테스트 작업의 70% 이상의 시간을 성공적으로 수행하는 정책

본능 으로 모방 하는 것 이 실제로 무슨 일 이 됩니까?

훈련 명령어를 실행하기 전에 모델이 실제로 배우는 것을 이해하기 위해 2 분 시간을 사용하십시오. 모방 학습은 관찰 (카메라 이미지 + 현재 공동 상태) 를 행동으로 (다음의 공동 각) 로 지도하는 정책 네트워크를 훈련시킵니다. 네트워크는 보상을 받지 않습니다. 그것은 당신의 시범을 보고, 비슷한 상태에서 수행한 행동의 배포를 재생하는 것을 배우게 됩니다.

ACT (Action Chunking with Transformers) 는 하나의 단계보다는 100개의 미래의 동작을 동시에 예측한다. 이것은 에피소드 전체에 걸쳐 오류 축적을 방지한다. 개별 예측이 약간 떨어져 있음에도 불구하고, 조각은 안정적인 궤도 버퍼를 제공합니다. 그 다음 100개의 시간 단계 (50Hz에서 2초) 마다 재계획합니다. 이 때문에 ACT는 단순한 행동 클론링보다 더 긴 작업을 더 잘 처리합니다.

전체 이론적 배경에 대해서는 [이미테이션 학습 기본] (T1) 로보틱스 도서관에서 읽어보십시오.

GPU나 CPU?

8GB+ VRAM를 가진 NVIDIA GPU에 대한 훈련은 100k 단계에 약 45분 소요된다. CPU에 대한 훈련은 같은 실행에 34시간 소요된다. 두 가지 모두 동일한 모델 품질을 생산합니다. GPU는 더 빨리합니다. 로컬 GPU가 없으면 훈련 명령어는 클라우드 인스턴스에서 동일하게 작동합니다.

데이터 세트에 ACT를 열

가상 환경에서 훈련 스크립트를 실행하세요. 아래의 구성 값은 OpenArm에서 50 에피소드 선택 및 위치 데이터 세트에 대한 캘리브레이션입니다.

소스 ~/openarm-env/bin/activate python -m lerobot.scripts.train \ --dataset-path ~/openarm-datasets/pick-and-place \ --policy act \ --batch-size 8 \ --lr 1e-5 \ --num-train-steps 100000 \ --eval-freq 5000 \ --save-freq 10000 \ --log-freq 500 \ --output-dir ~/openarm-policy/pick-and-place-v1 # 훈련은 500 단계마다 손실을 인쇄하고 5000 단계마다 결과를 평가합니다

훈련 시작, 그리고 출력을 모니터링. 당신은 그것을 모든 시간 을 볼 필요가 없습니다. 하지만 손실이 감소하고 실행이 충돌하지 않았는지 확인하기 위해 2030 분마다 다시 확인합니다. 훈련은 당신이 잠을 자고있는 동안 밤새 실행될 수 있습니다.

훈련 곡선을 이해 하는 것

ACT의 훈련 결과 는 두 가지 주요 매트릭을 나타낸다. 그것들을 올바르게 읽도록 배우십시오.

훈련 손실

첫 20k 단계에 급격히 감소해야 하고, 더 느리게 감소하는 것을 계속해야 합니다. 0.05 이상의 고원도는 일반적으로 데이터 품질 문제를 나타냅니다.

동등 한 성공률

5k 단계마다 나타납니다 (물리적 팔이나 시밍이 필요합니다). 이것은 실제로 중요한 숫자입니다. 배포하기 전에 70% 이상을 원합니다. 종종 훈련 손실을 지연합니다.

MSE 활동

예측된 과 기본 진실의 행동 사이의 평균 2차 오류. 잘 훈련된 선택과 장소 정책에서 0.01 이하로 떨어져야 합니다. 80k 단계 후 높은 행동 MSE는 모델이 작업 복잡성과 어려움을 겪고 있거나 데이터가 일치하지 않는다는 것을 의미합니다.

KL 분화 (행위기준별)

ACT는 훈련 중에 0에서 10까지 을 하는 KL 무게의 CVAE를 사용합니다. 단계 40k에 대한 안정성을 관찰하십시오. konverges는 결코되지 않으면 모델은 스타일 코딩에 실패합니다.

훈련 을 언제 중단 해야 합니까?

단순히 100만 단계까지 달려서 멈추지 말고, 이 신호를 사용하여 체크포인트가 배치될 준비가 되어 있는 시점에 결정하세요.

  • 평등 성공률은 3번 연속 평가에서 평평해졌다 모델이 공감되었다. 더 많은 데이터 또는 다른 데이터 없이는 추가 교육은 도움이 되지 않을 것이다.
  • 평등 성공률은 70% 이상 이것은 6단계 배포의 임계입니다. 60k 단계에서 70%를 달성하면 일찍 멈추고 그 체크포인트를 배포할 수 있습니다.
  • ** 훈련 손실은 여전히 감소하고 있지만 eval는 평평하거나 감소하고 있습니다** 모델은 과잉 적합합니다. eval가 최고 수준에 있던 마지막 점검점을 보세요. 이것은 가장 좋은 점검점입니다.
  • ** 100k 단계** 성공률이 40% 이하인 경우, Unit 4로 돌아가십시오. 데이터 문제는 이 시점에서 훈련 문제보다 더 가능성이 높습니다.

선택적 인 깊은 다이브

ACT 이외의 전파 정책과 π0

일단 작동하는 ACT 정책이 있으면 자연스러운 다음 실험은 디스푸지언 정책입니다. 더 느린 추론 비용으로 다 모달 작업을 더 잘 처리합니다. RCSV 연구 섹션은 둘 다 포함됩니다.

5부대 완료...

훈련이 완료되었거나 좋은 체크포인트에서 중단되었습니다. 선택과 장소 작업에서 당신의 평가 성공률은 70% 이상입니다. 당신은 T0에서 저장된 체크포인트가 있으며 어떤 단계 번호가 가장 좋은 결과를 가져왔는지 알고 있습니다. 당신은 이 정책을 실제 팔에 배치 할 준비가되어 있습니다.

[← 경로 개요로 돌아가]