로봇 모방 학습 에서 흔히 발생하는 10 가지 실수 (그리고 그 를 해결 하는 방법)
가장 흔한 오류는 팀들이 모방 학습으로 로봇 정책을 훈련할 때 발생하는 것입니다. 데이터 품질, 알고리즘 선택, 평가 및 배포 오류, 각각의 특정 수정 사항과 함께.
[이미테이션 학습 가이드]
[← 블로그]
대부분의 모방 학습 실패는 데이터 문제로 이어지는 것이 아니라 알고리즘 문제로 이어지는 것입니다. 여기 10가지의 오류가 있습니다.
소개
모방 학습은 속박하게 접근할 수 있습니다. 알고리즘은 간단하고 설정은 표준이며 [ACT] (
실수 1: 과제 어려움 을 겪기 위해 너무 적은 데모
가장 흔한 오류는 작업 복잡성에 관계없이 고정된 디모 카운트를 적용하는 것입니다. 팀들은 ACT가 간단한 선택 작업에 대한 50 개의 시범으로 강력한 결과를 얻었으며 200 개가 정확성 조립 작업에 충분하다고 가정합니다. 그렇지 않습니다.
대략적인 난이도 규모: L1 (큰 물체의 개방형 루프 접근 및 잡기): 50-200 데모. L2 (다양한 물체 포즈를 가진 폐쇄적인 루프 선택 장소): 300-800 데모. L3 (접촉 부가 있는 삽입, 5mm 용납량 있는 조립): 1,000-5,000 데모. L4 (독성한 손 조작): 5,000-20,000 데모.
** 어떻게 감지할 수 있는 방법:** 훈련 손실은 모순하지만 평가 성공률은 낮다 (<60%). 정책은 일반적인 운동 패턴을 학습하지만 정확한 접촉 부가적인 단계에서 실패합니다.
정치: 수집 시작하기 전에 위 위의 난이도 계정을 예산 추정으로 사용하십시오. 예상 비용은 예산이 초과되면 작업이 한 가지 난이도 수준을 낮추기 위해 작업을 단순화 할 수 있는지 여부를 고려하십시오. RCSV의 [데이터 서비스]
오류 2: 수집 및 배포 사이의 불일치 있는 조명
인간의 눈에 비약적인 조명 변화가 있습니다. 아침부터 오후까지 태양이 창을 통해 이동하고, 상공의 광선관 하나를 교체하고, 근처 문을 열고, 우리는 데이터 수집실에서 90%의 성공률을 가진 정책들이 다른 건물에서 한 층을 배치하면 20%의 성공률을 달성하는 것을 보았습니다.
** 탐지 방법:** 수집 환경에서는 정책이 잘 작동하지만 배포에 실패합니다. 두 환경에서 카메라 피드를 시각화하십시오. 어떤 채널에서도 히스토그램 차이 > 15%는 조명 문제가 있음을 나타냅니다.
** 수정:** 데이터 수집 중 조명을 제어하십시오 (정상화온도 고정된 색상 커튼이나 LED 패널, 5000K 일광 균형). 훈련 중에 공격적인 색상 긴장 증강을 적용하십시오: 밝기 +/-30%, 색채 +/-20%, 포화 +/-15%.
실수 3: 실패 한 시연 을 필터링 하지 않는 것
새로운 운영자로부터의 원시 시범 데이터는 일반적으로 15-30%의 실패한 에피소드를 포함합니다. 텔레 운영 시스템을 배우는 운영자는 엉뚱한 포착을 하거나, 우연히 객체를 풀어 주거나, 작업 중 중 중단합니다. 이러한 것들을 훈련 세트에 포함하면 정책은 성공적과 실패한 행동을 모방하는 것을 배우게 됩니다. 이는 평균적인 정책으로 나타납니다.
** 어떻게 알아낼 수 있습니까?** 정책은 두 가지 다른 전략 사이의 평균을 보이는 의 의지, 부분적 인 잡지, 또는 " 혼란스러운" 행동을 나타냅니다. 훈련 세트를 검토하십시오: <5%의 에피소드가 분명히 실패하면, 당신은이 문제를 가지고 있습니다.
** 수정:** 간단한 성공 분류기를 만들거나 사용하십시오. 선택 장소 작업에 있어서, 이것은 에피소드의 끝에서 객체가 목표 영역에 있는지 확인하는 것만큼 간단할 수 있습니다. 훈련 전에 실패한 에피소드를 필터링하십시오. RCSV에서, 우리는 자동화된 성공 분류와 배달 전에 수집된 모든 데이터에 대한 인간 검토를 실행합니다. 10%의 실패한 데모가 bile 정책 성공률에서 20-30% 감소합니다.
실수 4: 단 한 카메라 를 사용 하는 것
단일 고정된 카메라는 접근 중에 잠금 문제를 발생시킵니다. 로봇 팔이 작업 공간으로 이동할 때, 그것은 동시에 객체와 지지를 보는 것을 차단할 수 있습니다. 가장 자세한 정보가 필요할 때 정확하게 시각 정보가 없습니다. 이것은 특히 마지막 5cm 접근이 중요한 삽입 작업에 위해 유해합니다.
** 탐지 방법:** 정책은 프라-그래프 접근에서 성공하지만 최종 2-5cm 접촉 단계에서 실패합니다. 실패 비디오 분석은 중요한 순간에 목표 물체가 팔에 의해 폐쇄되어 있음을 보여줍니다.
** 수정:** 기본 라인으로서 3 개의 카메라 설정을 사용하십시오: (1) 작업 공간의 개요를 위해 상공 고정된 카메라, (2) 팔-물질 관계의 측면 각 카메라, (3) 접촉 구역을 위해 손목 장착된 카메라. 손목 카메라는 가장 영향력 있는 추가입니다. 그것은 외부 카메라가 제공 할 수 없는 손잡이 접촉에 대한 직접적인 시각 피드백을 정책에 제공합니다. [전화 조작 안내]
실수 5: 잘못된 객체 포지 Randomization
많은 팀은 거의 동일한 시작 위치에서 객체를 가지고 시범을 수집합니다. 운영자는 객체를 각 에피소드 전에 대략 같은 위치에 배치합니다. 이것은 정확한 위치에서 객체에 작동하는 정책을 훈련합니다. 그리고 객체가 5cm로 이동하면 실패합니다.
** 어떻게 감지 할 수 있습니까? ** 훈련 분포 위치 (>90%) 에서 높은 성공률, 하지만 작은 위치 혼란에도 불구하고 빠른 퇴적. 모든 훈련 에피소드의 (x, y) 시작 위치 를 기획하십시오.
** 수정:** 각 에피소드 이전에 접근 가능한 작업 공간 내에서 무작위 위치로 대상 객체를 배치하십시오. 체계적인 커버리를 보장하기 위해 격자 또는 표시된 영역을 사용하십시오. 최소 훈련 세트는 객체가 배치 시 나타날 수 있는 작업 공간의 80%를 차지해야합니다. 방향성 민감한 작업 (insertion, assembly) 에 있어서도, 무작위로 방향성을 조정하십시오.
오류 6: 접촉 부가 있는 단계 데이터가 없어지는
많은 작업들은 접근, 접촉, 조작, 방출 등이 다른 단계로 이루어진다. 운영자는 종종 접촉 단계 (지착기 가 물체를 만지는 순간) 를 통과하기 위해 서둘러 이동한다. 그러나 이것은 정책이 가장 많은 데이터를 필요로 하는 단계입니다. 시위가 2-3 단계의 시간으로 접촉 단계를 통과하면, 정책은 작업의 가장 중요한 순간에 훈련 신호를 거의 가지 않습니다.
** 탐지 방법:** 정책은 접근을 올바르게 수행합니다 (정확한 위치로 이동) 하지만 접촉 시 실패합니다 - 잡은 것이 불안정하고, 삽입이 빠지고, 배치가 중단됩니다. 시범 시기를 조사하십시오: 접촉 단계 (첫 번째 접촉에서 안정적인 잡기) 는 50Hz에서 <5 시간 단계라면, 당신은이 문제를 가지고 있습니다.
정치: 접촉 단계 동안 가속을 줄이는 것을 지시합니다. 유용한 프로토콜: 정상 속도에서 접근하고, 가속기가 물체로부터 3cm 이내에 있을 때 50% 가량 가속으로 느려지고, 안정적인 잡기를 달성할 때까지 접촉을 통해 느린 속도를 유지하십시오. 이것은 정책에 3-5배 더 많은 훈련 신호를 제공합니다. 그 외, 접촉 단계 직전부터 시작되는 추가적인 시범을 수집하십시오 (잡잡기는 이미 물체 근처에 위치하고 있습니다).
실수 7: 교육 배포에만 평가
정확히 훈련된 객체 사례와 위치에 90%의 성공률을 달성한 정책은 약간 다른 조건에서 30%를 달성할 수 있습니다. 훈련 배포에 대한 평가만 하면 배치 성과를 예측하지 않는 낙관적인 숫자를 제공합니다.
검증 방법: 만약 당신이 훈련 조건에 대해 평가하지 않은 경우, 당신은 정의에 따라 이 문제를 가지고 있습니다. 훈련 조건에서만 보고된 성공률은 신뢰할 수 없습니다.
정치: 정책을 최종적으로 완료하기 전에 세 가지 조건으로 평가를 실행하십시오: (1) 같은 범주의 새로운 객체 인스턴스 (다른 색상, 크기와 질감), (2) 훈련 배포 밖의 새로운 시작 위치, (3) 다른 배경/ 테이블 표면. 세 가지 조건에서 모두 성공 목표를 달성하기 위해 정책을 요구하십시오. 조건마다 30-50개의 평가 에피소드 예산.
실수 8: 합성 에러 를 무시 하는 것
행동 복제 정책은 합성 오류로 고통 받고 있습니다. 시간이 지남에 따라 작은 오류가 축적되어 로봇이 훈련 중에 볼 수 없었던 상태로 밀어 넣습니다. 정책은 이러한 신기한 상태에서 복구 할 데이터가 없습니다. 그래서 또 다른 나쁜 결정을 내립니다. 이는 더욱 신기한 상태로 이어집니다. 5~10초 이상 긴 작업에서는 초기 단계가 올바르게 보이더라도 완전히 실패할 수 있습니다.
** 탐지 방법:** 정책은 잘 시작되지만 한 에피소드 내에서 시간이 지남에 따라 악화됩니다. 첫 2-3 초는 잘 보입니다. 5~8 초에 로봇은 회복 불가능한 상태입니다. 더 긴 에피소드는 짧은 에피소드보다 더 높은 속도로 실패합니다.
** 수정:** 두 가지 구체적인 접근법. ** 액션 쪼개림** (ACT에서 사용된 바와 같이) 은 20~100개의 미래의 행동을 한 번에 예측하고, 이를 오픈 루프로 실행하여 추론 호출을 줄이고, 컴포넌스를 제한합니다. ** 시간적 집합**은 보다 원활한 실행을 위해 여러 최근의 액션 쪼개리에서 평균 예측을 한다. 매우 긴 작업 (>30s) 에 대해서는 과제를 3-5s 하위 작업으로 나눌 수 있는 계층적 정책을 고려하거나, 복원 시범을 수집하기 위해 DAgger 방식의 온라인 데이터 수집을 고려하십시오.
실수 9: 잘못된 행동 공간 선택
행동 공간 - 정책이 실제로 예측하는 것 - 은 성능에 놀랍도록 큰 영향을 미친다. 두 가지 일반적인 선택은 공동 공간 행동 (목적 공동 위치) 와 카르테시아 공간 행동 (목적 최종 효과 포즈). 임무에 대한 잘못된 선택은 정책에 불필요한 어려움을 만듭니다.
** 탐지 방법:** 정책은 잘 훈련 (저하 손실) 하지만 배포 시 거칠고 또는 물리적으로 믿을 수 없는 움직임을 발생시킵니다. 공동 공간 정책은 자기 충돌을 겪는 구성을 생성할 수 있습니다. 카르테시아 공간 정책은 운동적으로 도달할 수 없는 목표를 생성할 수 있습니다.
** 수정:** 리더-후배 텔레오퍼레이션 데이터의 기본값으로 공동 공간 동작 (목적 공동 위치) 을 사용하십시오. 리더 팔은 자연스럽게 공동 공간 목표물을 생성하기 때문입니다. 작업이 강력한 기하학적 구조를 가지고 있다면만 카르테시아 좌표로 표현하기 쉬워 (예를 들어 직선을 그리는 것) 을 사용하십시오. 특히 ACT에 대해서는 원래의 구현은 공동 공간 동작을 사용하며, 이것은 권장 기본이다.
# Joint-space vs Cartesian-space action -- use joint-space by default
# This is how RCSV records actions for ACT training:
# GOOD: Joint-space action (7-dim: 6 joints + gripper)
action = leader_arm.get_joint_positions() # Direct from leader arm
# Stored as: [j1, j2, j3, j4, j5, j6, gripper_width]
# AVOID (unless you have a specific reason):
# Cartesian-space action (7-dim: xyz + quaternion)
# action = robot.get_ee_pose() # Requires IK at deployment
# IK solutions may be non-unique, introducing discontinuities
실수 10: 데이터 플라이휠을 건너뛰는 것
가장 좋은 성과를 내는 정책이 있는 팀은 가장 많은 데이터를 미리 수집한 것이 아니라 관찰된 실패 모드를 기반으로 데이터를 지속적으로 개선한 팀입니다. 한 번 수집과 한 번 훈련은 초기 데이터 세트의 품질에 대한 정책을 얼어붙여줍니다.
** 탐지 방법:** 정책을 훈련시켰고, X%의 성공률을 가지고 작동하고, 이후 추가 데이터를 수집하지 않았습니다. 새로운 데이터 없이는 X가 개선되지 않습니다.
** 수정:** 첫 날부터 데이터 플라이휠을 구축하십시오. 정책을 배포하고 모든 오류를 기록하고, 매주 오류를 검토하고, 가장 큰 3 개의 오류 모드 범주를 식별하고, 해당 오류 모드를 다루는 50-100 개의 목표된 시범을 수집하고, 재 훈련합니다. 반복당 50-100 개의 목표형 오류 복구 시범은 강도를 크게 향상시킬 수 있습니다. RCSV 데이터 플랫폼 는 이 루프를 효율적으로 만듭니다. 오류 로그는 수집 작업 줄을 직접 입력하고, 운영자는 특정 오류 범주에 대한 목표 시범을 수집합니다.
데이터셋 품질 확인 목록
훈련 전에, 데이터 세트가 이 모든 검사를 통과하는지 확인하세요:
- [ ] 에피소드 수는 어려움 임대점을 충족합니다 -- L1: 50+, L2: 300+, L3: 1000+, L4: 5000+
- [ ] 실패한 에피소드 필터링 -- <5% 훈련 세트에서 실패율이 필터링 후
- [ ] 객체 포즈가 무작위로 - 시작 위치가 배포 작업 공간의 80%를 차지합니다
- [ ] 제어 또는 증강된 조명 - 수집 중 일관된 조명 OR 공격적인 증강 계획
- [ ] 멀티 카메라 설정 - 최소 2개의 카메라 (상면 + 손목), 이상적으로 3개의 카메라
- [ ] 시간표는 단조적이고 동기화되어 -- 관찰과 행동의 조율은 10ms 이내에
- [ ] 접촉 단계에 대한 샘플을 적절히 가져오 -- > 5 단계 첫 접촉에서 안정적인 포착까지
- [ ] 어떤 사업자가 확인된 유물도 없습니다 - 의문의 경우, 수정 또는 특이한 패턴을 찾기 위해 10개의 무작위 에피소드를 검토하십시오
- [ ] 경로 순수성 한계 내에서 - 작업에 대한 특정 임대 이하의 평균
- [ ] 수립된 평가 집합 준비 -- 30-50 에피소드
RCSV의 데이터 수집 파이프라인에서 이러한 대부분의 검사가 자동으로 시행됩니다. 자신의 데이터를 수집하는 팀들을 위해, 이 체크리스트는 모든 훈련 실행 전에 검토되어야 합니다. 이 체크리스트에서 사용되는 기술 용어의 정의를 위해 [전문자]
관련 독서
- ACT 정책 설명 -- 가장 인기있는 IL 알고리즘의 아키텍처 세부 사항
- [전용수술 시작] (
T10 ) - 수집을 올바르게 설정하는 방법 - [체육중 훈련] (
T11 ) -- 다중 로봇 데이터를 활용 - RCSV 데이터 서비스 -- 품질 필터링된 시범 수집
- RCSV 데이터 플랫폼 -- 데이터 세트 관리 및 품질 추적
알고리즘을 수정하기 전에 데이터 파이프라인을 수정
RCSV의 데이터 수집 서비스는 자동화된 성공 분류와 기본으로 시행되는 완전한 품질 체크리스트로 품질 필터링된, 멀티 카메라 시범을 제공합니다.
[데이터 서비스를 탐구]







