배포 하고 개선
오픈아름 학습 경로 6단계 실제 팔에 대한 훈련 정책을 실행하고 체계적으로 평가하고 데이터 플라이휠을 시작하세요. 목표: 7/10 자율성 성공률
6개 중 6개 부대 · 배포 및 개선 · ~ 1.5시간
훈련된 정책이 있습니다. 이제 실제 팔에 넣고, 엄격하게 평가하고, 어떻게 개선할 수 있는지 이해합니다. 여기서 데이터 플라이휠이 시작됩니다.
실제 팔 에 대한 인퍼런스
배포는 훈련된 체크포인트를 실시간으로 실행하고, 실시간 카메라와 공동 관측을 네트워크에 공급하고, 물리적인 팔에서 출력 동작을 실행하는 것을 의미합니다. 추론 스크립트는 50Hz에서 관측-행동 루프를 처리합니다.
소스 ~/openarm-env/bin/activate # ROS 2가 실행되고 있는지 확인하세요 (실제 하드웨어 모드, 1부에서) python -m lerobot.scripts.eval \ --policy-checkpoint ~/openarm-policy/pick-and-place-v1/checkpoint_XXXXX \ --device cuda \ --num-eval-episodes 10 \ --record-video \ --output-dir ~/openarm-s/v1 \ #
첫 번째 배포 실행에, 당신의 손을 물리적 E-stop 근처에 보관하십시오. 새로 배포된 정책은 때때로 실제 하드웨어 환경에 온화 할 때 예상치 못한 움직임을 일으킬 수 있습니다. 이것은 처음 2
안전 봉투 및 감시견 타이머를 포함한 종합적인 배치 및 생산 지침은 [OpenArm Production Guide]
평가 방법론
비공식적인 정책 평가 하지 마십시오. 구조화된 프로토콜을 사용하세요.
| Protocol Item | Specification |
|---|---|
| Number of episodes per evaluation | 10 minimum, 20 for high-confidence results |
| Object starting position | Fixed. Use tape marks. Same position every episode. |
| Object type | Same object as training. Lighting must match training conditions. |
| What counts as success | Object placed within 3cm of target. Arm returns to home. No human intervention during episode. |
| Failure classification | Log failure type: missed grasp / dropped object / wrong target / timeout. This tells you what to fix. |
| Report metric | Success rate = successful episodes / total episodes. Report with episode count (e.g., "7/10 = 70%"). |
데이터 플라이휠: 어떻게 더 나아질 수 있습니까?
7/10 배의 성공 정책은 좋은 시작입니다. 하지만 9/10 또는 그 이상의 길이 데이터 플라이휠을 통해 이루어집니다. 이것은 생산에서 로봇 학습의 핵심 루프입니다.
1
수집
현재 정책에 대한 어려움을 겪는 실패 사례를 포함한 기록적인 시범
2
열차
새로운 디모네스트를 추가한 확장된 데이터 세트를 재교육 (또는 정렬)
3
평가
구조화된 평가 프로토콜을 실행하세요. 성공률이 향상되었나요?
4
분석
실패 동영상을 보세요. 정책이 붕괴되는 특정 상태를 확인하고, 그 곳에서 목표 데이터를 수집하세요.
플라이휠의 핵심 통찰력: ** 목표 데이터 는 무작위 데이터 를 이겨내기 위해**. 50 가지 더 무작위 디모네스트를 녹화 하기 보다는, 실패 동영상을 보고 모든 것이 잘못되는 정확한 순간을 확인 하십시오. 그 어려운 상태를 구체적으로 다루는 20 가지 디모네스트를 녹화 하십시오. 20개의
흔히 발생하는 실패 방법 과 그 를 해결 하는 방법
- 팔이 포착 위치를 초과한다: 정책의 액션 덩어리들이 너무 크거나 데이터의 속도가 높습니다. 포착 포인트 근처에서 느린 속도로 10 개의 더 많은 데모를 기록하거나 훈련 구성에서 100에서 50으로 줄일 수 있습니다.
- 무기는 훈련 객체에서 성공하지만 약간 다른 객체에서 실패합니다: 훈련 데이터는 객체 위치 다양성이 부족했습니다. 10cm 반경 내에서 5 개의 다른 위치에서 객체를 가지고 20 개의 데모를 기록하십시오. 이것은 정책에 일반화하도록 가르칩니다.
- 정책은 얼어붙거나 반복된 동작을 생성합니다: CVAE 스타일 변수는 붕괴되고 있습니다. 이것은 종종 데이터 세트가 너무 많은 변형을 의미합니다.
6단체 완료...
당신의 팔은 구조화된 평가 실행에서 10번의 7번의 선택과 장소 작업을 자율적으로 완료합니다. 당신은 3 개의 실패 비디오를 보았고 무엇이 잘못되었는지 확인했습니다. 당신은 다음 개선 반복을 계획할 만큼 데이터 플라이휠을 충분히 이해합니다. 이것은 구조화된 경로의 끝입니다.
넌 해냈어
로봇을 뜯어내는 것에서 실제 모방 학습 정책을 훈련하고 배포하는 것까지 거듭났습니다. 이것은 로봇 팔을 만질 99%의 사람들보다 앞서 있습니다. 여기서 여러분이 만든 것은
다음은 뭐야?
당신은 기초를 가지고 있습니다. 여기서부터는 어디로 갈 수 있는지 여쭤봅니다.
[
오픈아름 생산 가이드
안전 봉투, 감시용 타임머리, 다발기 설정, 그리고 장기적인 배치 패턴
[
더 깊이 들어가: 전파 정책
여러 전략이 유효한 다 모달 작업에 훈련하십시오. 일부 작업 유형에 대해 ACT보다 더 나은 일반화.
[
DK1 2기본 키트
두 개의 동기화 팔이 두 가지 작업을 수행합니다. 접촉이 풍부한 조작 연구를 위한 다음 하드웨어 단계입니다.
[
결과 를 공유 하십시오
OpenArm 포럼에 성공률, 데이터 세트, 정책을 게시하세요. 커뮤니티는 모든 결과로부터 배울 수 있습니다.
](
[← 경로 개요로 돌아가]







