LeRobot Path(으)로 돌아가기

당신 의 정책 을 평가 하십시오

레로봇 학습 경로 5단계: 시뮬레이션이나 실제 로봇에서 ACT 정책을 평가하고 성공률을 측정하고 실패 모드를 진단하고 개선하거나 배포할 것인지 결정합니다. ~ 1시간

6중 5단위 · 평가 · ~ 1시간

훈련된 체크포인트를 시뮬레이션이나 실제 로봇에서 실행하고, 구조화된 20개의 시험 프로토콜을 사용하여 성공률을 측정하고,

시뮬레이션 평가

항상 실제 로봇을 가지고 있더라도 시뮬레이션에서 먼저 평가합니다. 시뮬레이션 평가는 빠르고 안전하며, 재훈련 후 비교할 수 있는 재생 가능한 기본 번호를 제공합니다.

소스 ~/lerobot-env/bin/activate # 최고의 체크포인트를 평가하십시오 (제단 단계를 _050000로 교체하십시오) python -m lerobot.scripts.eval \ --pretrained-policy-name-or-path \ ~/lerobot-policy/pick-place-v1/checkpoints/step_050000 \ --env.name gym_pusht/PushT-v0 -- \eval.n-episodes 20 \eval --.use-async-envs false # 출력: 성공_rate, mean_reward, episode_videos/

무엇을 기대할 수 있습니다: 50개의 시뮬레이션에 대한 잘 훈련된 정책은 MuJoCo에서 60~85%의 성공률을 달성해야 합니다. 40% 이하는 데이터 세트 품질 문제라고 제안합니다. 85% 이상은 작업이 너무 쉽거나 시뮬레이션 환경이 너무 용납하는 것을 의미합니다.

실제 로봇 안전 체크리스트

실제 로봇을 이용해서 평가하는 경우, 첫 번째 발급 전에 이 체크리스트를 살펴보세요. 테스트되지 않은 정책은 예상치 못한 방식으로 움직일 수 있습니다.

  • 작업의 일부 아닌 모든 객체의 작업 공간을 제거합니다. 특정 시각적 맥락에서 행동하는 법을 배운 예상치 못한 객체는 부적절한 행동을 유발할 수 있습니다.
  • 응급정지 (E-stop) 에서 머무르거나 전체 평가 세션 동안 Ctrl+C를 누르기 위해 준비하십시오. 실행 정책에서 벗어나지 마십시오.
  • 50%까지 제한된 속도로 시작하세요. 첫 번째 실험이 비정상적인 경우 30%까지 줄여주세요.
  • 객체를 위치하여 훈련 작업 공간 설정과 정확히 일치합니다. 동일한 카메라 각, 동일한 조명, 동일한 객체 색을 사용하십시오. 분포 전환은 실세계의 성공률이 0의 가장 일반적인 원인입니다.
  • 로봇 관절의 물리적인 정지 제한을 초과하지 말고, 첫 번째 실행 전에 로봇 구성에서 확인하세요.

실제 로봇 평가 프로토콜

정확히 20개의 실험을 실행하세요. 이것은 신뢰할 수 있는 성공률 추정 (±10% 95% 신뢰 수준에서) 을 위해 충분한 샘플을 제공합니다. 각 실험을 비디오로 녹음합니다.

# 실제 로봇 파이썬에서 정책을 실행하세요 -m lerobot.scripts.control_robot \ --robot-path lerobot/configs/robot/so100.yaml \ --control-mode eval \ --pretrained-policy-name-or-path \ ~/lerobot-policy/pick-place-v1/checkpoints/step_050000 \ --eval.n-episodes 20 \ --record-video 1

각 시도 후, 수동적으로 점수를 얻으세요: 완전한 작업 성공, 실패 (부부분적 인 포착, 떨어지는, 놓친) 에 대한 0

실패 모드를 진단 하는 방법

비디오 녹음 을 보고 실패 를 분류 하십시오. 대부분의 실패 는 다음 세 가지 범주 중 하나 로 나눌 수 있습니다.

데이터 품질

불일관된 접근 궤도 팔은 절대 포착에 완전히 헌신하지 않습니다

이 정책은 훈련 데이터에 있는 여러 가지 포착 전략들을 평균적으로 나타냅니다. 이것은 어떤 시범이 왼쪽에서 오른쪽으로 접근하거나, 또는 그립어 닫기 시기가 일관성이 없을 때 발생합니다.

모델 용량

궤도는 합리적인 것처럼 보이지만 정확도는 12cm로 지속적으로 떨어집니다

모델은 올바른 행동을 배우고 있지만 정확할 능력이 부족합니다. 이것은 크기가 너무 짧을 때 발생합니다. (계획 지평이 충분하지 않거나) 또는 이 너무 작을 때 발생합니다. 수정: 크기를 150으로 늘려, 재 훈련하십시오. 또는 네트워크를 규제하기 위해 더 다양한 시범을 추가하십시오.

분배 시위

어떤 위치에서 완벽하게 작동하고 다른 위치에서는 완전히 실패합니다

평가 시 대상 위치 는 훈련 데이터 분포 밖 에 있다. 정책 은 그 위치 를 이전에 보지 못했다. 수정: 보다 다양한 객체 위치 를 가진 더 많은 시범 을 수집 하거나, 훈련 데이터 에서 잘 표현 된 위치 로 평가 를 제한 한다.

5부대 완료...

20개의 평가 실험을 수행 (시프 또는 실제 로봇) 하고 성공률을 측정했습니다. 모든 실패 모드 비디오를 보고 데이터 품질, 모델 용량 또는 배포 변화가 주요 실패인지 확인했습니다. 이 진단이 기록되어 있습니다.

[← 경로 개요로 돌아가]