OpenArm Path(으)로 돌아가기

배포 하고 개선

오픈아름 학습 경로 6단계 실제 팔에 대한 훈련 정책을 실행하고 체계적으로 평가하고 데이터 플라이휠을 시작하세요. 목표: 7/10 자율성 성공률

6개 중 6개 부대 · 배포 및 개선 · ~ 1.5시간

훈련된 정책이 있습니다. 이제 실제 팔에 넣고, 엄격하게 평가하고, 어떻게 개선할 수 있는지 이해합니다. 여기서 데이터 플라이휠이 시작됩니다.

실제 팔 에 대한 인퍼런스

배포는 훈련된 체크포인트를 실시간으로 실행하고, 실시간 카메라와 공동 관측을 네트워크에 공급하고, 물리적인 팔에서 출력 동작을 실행하는 것을 의미합니다. 추론 스크립트는 50Hz에서 관측-행동 루프를 처리합니다.

소스 ~/openarm-env/bin/activate # ROS 2가 실행되고 있는지 확인하세요 (실제 하드웨어 모드, 1부에서) python -m lerobot.scripts.eval \ --policy-checkpoint ~/openarm-policy/pick-and-place-v1/checkpoint_XXXXX \ --device cuda \ --num-eval-episodes 10 \ --record-video \ --output-dir ~/openarm-s/v1 \ #

첫 번째 배포 실행에, 당신의 손을 물리적 E-stop 근처에 보관하십시오. 새로 배포된 정책은 때때로 실제 하드웨어 환경에 온화 할 때 예상치 못한 움직임을 일으킬 수 있습니다. 이것은 처음 23 에피소드에서 정상입니다. 그 후, 행동이 안정되어야합니다.

안전 봉투 및 감시견 타이머를 포함한 종합적인 배치 및 생산 지침은 [OpenArm Production Guide]T1 참조하십시오.

평가 방법론

비공식적인 정책 평가 하지 마십시오. 구조화된 프로토콜을 사용하세요.

Protocol Item Specification
Number of episodes per evaluation 10 minimum, 20 for high-confidence results
Object starting position Fixed. Use tape marks. Same position every episode.
Object type Same object as training. Lighting must match training conditions.
What counts as success Object placed within 3cm of target. Arm returns to home. No human intervention during episode.
Failure classification Log failure type: missed grasp / dropped object / wrong target / timeout. This tells you what to fix.
Report metric Success rate = successful episodes / total episodes. Report with episode count (e.g., "7/10 = 70%").

데이터 플라이휠: 어떻게 더 나아질 수 있습니까?

7/10 배의 성공 정책은 좋은 시작입니다. 하지만 9/10 또는 그 이상의 길이 데이터 플라이휠을 통해 이루어집니다. 이것은 생산에서 로봇 학습의 핵심 루프입니다.

1

수집

현재 정책에 대한 어려움을 겪는 실패 사례를 포함한 기록적인 시범

2

열차

새로운 디모네스트를 추가한 확장된 데이터 세트를 재교육 (또는 정렬)

3

평가

구조화된 평가 프로토콜을 실행하세요. 성공률이 향상되었나요?

4

분석

실패 동영상을 보세요. 정책이 붕괴되는 특정 상태를 확인하고, 그 곳에서 목표 데이터를 수집하세요.

플라이휠의 핵심 통찰력: ** 목표 데이터 는 무작위 데이터 를 이겨내기 위해**. 50 가지 더 무작위 디모네스트를 녹화 하기 보다는, 실패 동영상을 보고 모든 것이 잘못되는 정확한 순간을 확인 하십시오. 그 어려운 상태를 구체적으로 다루는 20 가지 디모네스트를 녹화 하십시오. 20개의 ላማ된 데모를 통해 50개의 셈보다 더 빠르게 성공률을 높일 수 있습니다.

흔히 발생하는 실패 방법 과 그 를 해결 하는 방법

  • 팔이 포착 위치를 초과한다: 정책의 액션 덩어리들이 너무 크거나 데이터의 속도가 높습니다. 포착 포인트 근처에서 느린 속도로 10 개의 더 많은 데모를 기록하거나 훈련 구성에서 100에서 50으로 줄일 수 있습니다.
  • 무기는 훈련 객체에서 성공하지만 약간 다른 객체에서 실패합니다: 훈련 데이터는 객체 위치 다양성이 부족했습니다. 10cm 반경 내에서 5 개의 다른 위치에서 객체를 가지고 20 개의 데모를 기록하십시오. 이것은 정책에 일반화하도록 가르칩니다.
  • 정책은 얼어붙거나 반복된 동작을 생성합니다: CVAE 스타일 변수는 붕괴되고 있습니다. 이것은 종종 데이터 세트가 너무 많은 변형을 의미합니다.

6단체 완료...

당신의 팔은 구조화된 평가 실행에서 10번의 7번의 선택과 장소 작업을 자율적으로 완료합니다. 당신은 3 개의 실패 비디오를 보았고 무엇이 잘못되었는지 확인했습니다. 당신은 다음 개선 반복을 계획할 만큼 데이터 플라이휠을 충분히 이해합니다. 이것은 구조화된 경로의 끝입니다.

넌 해냈어

로봇을 뜯어내는 것에서 실제 모방 학습 정책을 훈련하고 배포하는 것까지 거듭났습니다. 이것은 로봇 팔을 만질 99%의 사람들보다 앞서 있습니다. 여기서 여러분이 만든 것은 텔레오퍼레이션 설정, 데이터 파이프라인, 훈련 작업 흐름 모든 작업과 하드웨어에 대한 스케일입니다.

다음은 뭐야?

당신은 기초를 가지고 있습니다. 여기서부터는 어디로 갈 수 있는지 여쭤봅니다.

[

오픈아름 생산 가이드

안전 봉투, 감시용 타임머리, 다발기 설정, 그리고 장기적인 배치 패턴

[T2]

더 깊이 들어가: 전파 정책

여러 전략이 유효한 다 모달 작업에 훈련하십시오. 일부 작업 유형에 대해 ACT보다 더 나은 일반화.

[T3]

DK1 2기본 키트

두 개의 동기화 팔이 두 가지 작업을 수행합니다. 접촉이 풍부한 조작 연구를 위한 다음 하드웨어 단계입니다.

[T4]

결과 를 공유 하십시오

OpenArm 포럼에 성공률, 데이터 세트, 정책을 게시하세요. 커뮤니티는 모든 결과로부터 배울 수 있습니다.

](T5)

[← 경로 개요로 돌아가]