로봇 정책 실패 모드 분석: 훈련된 로봇이 배치에 실패하는 이유
훈련된 로봇 정책이 실패하는 방법의 체계적인 분석 <unk> 분배 전환, 변동 전환, 모드 붕괴 및 복구 전략
[← 연구]
로봇 정책 실패 모드의 분류학, 실제 환경에 훈련된 정책을 배치하기 전에 각 필수 읽기
왜 실패 모드 분석이 중요 합니까?
실험실 평가에서 82%의 성공을 달성하는 정책은 40
아래의 실패 모드는 근본 원인에 따라 조직되어 있으며 진단 신호 (이 모드가 실패를 일으키는지를 확인하는 방법) 과 완화 전략 (데이터, 건축 변경 또는 배포 변경으로 수정하는 방법) 모두 포함됩니다.
오류 모드 1: 배포되지 않은 시각 입력
** 증상:** 정책은 실험실 환경에서 잘 작동하지만 새로운 장소, 다른 조명 또는 약간 다른 물체의 외모 (새색 변종, 노화 라벨, 다른 표면 마감) 에서 배치되면 즉시 실패합니다.
- ** 근본 원인은:** 훈련 데이터는 좁은 시각 조건에서 수집되었습니다. 정책의 시각적 코더는 배포 환경에서 없는 특정 텍스처, 조명 패턴 또는 배경에 적합합니다.
- ** 진단 테스트:** 3가지 다른 조명 조건 (오버헤드 플루오렌세스 대 자연광 대 희미), 2개의 테이블 높 (±10cm) 와 작업 공간에 배치된 3개의 방해물들로 20개의 테스트 에피소드를 수집한다. 어떤 조건에서도 성공률이 20% 이상 감소하면 OOD 시각 입력이 가장 가능성이 높다.
- ** 미디게이션
데이터 증강:** 무작위 색상의 (빛도 ±30%, 대조 ±30%, 색소 ±20%), 무작위 배경 대체 (동작적인 이미지네트 배경에 작업 공간을 붙여넣어) 및 무작위 조명 시뮬레이션으로 훈련 이미지를 증강하십시오. - 중화
다양한 데이터 수집: 초기 데이터 수집 단계에서 여러 조명 조건, 테이블 표면 및 배경 구성에서 시범을 수집합니다. 5x 비용 vs. 단일 조건 수집, 그러나 훨씬 더 강력한 정책. - ** 미팅
도메인 적응:** 배포 후 배포 환경에서 50 100개의 시범 에피소드를 수집하고 정책을 정비하십시오. 작은 도메인 특수한 정비 세트조차도 실질적으로 성능을 회복합니다.
실패 모드 2: 컴파넌트 오류 (BC 코버라이어트 시프트)
증상: 정책은 작업을 올바르게 시작하지만 점차 훈련에서 볼 수 없는 비정상적인 상태로 이동하고, 이후 재앙적으로 실패합니다. 조건이 덜 익숙해지면서 작업 초기에는 실패가 점점 발생합니다. 행동 복제 정책의 고전적인 패턴
- 뿌리 원인: 행동 복제 (그리고 그 변형) 는 배포 상태 (훈련 궤도에 나타난 상태) 에만 훈련된다. 어떤 작은 정책 오류는 로봇을 훈련 배포 상태가 아닌 상태로 이동시켜 더 큰 오류를 유발하여 훈련에서 더 멀리 떨어져 있는 상태, 그리고 결국 재앙적인 실패로 이어진다.
- ** 진단 테스트:** 작업 시간 내에 실패가 발생하는 상태의 분포를 일괄적으로 그려보세요. 작업의 후반기에 실패가 집합되어 있고 정책이 더 짧은 작업에 더 성공하면 합성 오류가 원인입니다.
- 중화
행동 쪼개 (ACT): H의 미래 단계를 예측하는 것은 정책이 단계별로 반응하는 대신 일관된 궤도를 계획하도록 강요합니다. - 중화
DAgger: 데이터 세트 집합. 초기 훈련 세트 후, 정책을 배포하고 정책이 오류를 발생했을 때 인적 전문가 표기판 수정을 한다. 이러한 오류를 훈련 세트에 추가하고 재 훈련한다. 인적 전문가들이 정책 배포를 효율적으로 관찰할 수 있을 때 가장 효과적이다. - ** 미티게이션
디푸지션 정책:** 디푸지션의 반복적인 액션 시퀀스 디푸지션은 단일 단계 예측보다 초기 실행 오류에 더 견고합니다. 왜냐하면 디푸지션 프로세스는 암시적으로 유연한 궤도에 다시 집중하기 때문입니다.
실패 모드 3: 모드 붕괴 및 모드 평균
증상: 훈련 데이터에는 여러 가지 유효한 전략이 존재합니다 (예를 들어 왼쪽이나 오른쪽으로 잡을 수 있습니다), 그러나 정책은 전략이 아닌 혼란스러운 중간 궤도를 실행합니다. 또는: 정책은 항상 작업 상태와 상관없이 동일한 단일 전략을 실행합니다. 그 전략이 차단되면 실패합니다.
- ** 근본 원인은:** 결정적 정책의 표준 평균 제곱 오류 훈련은 시범을 통해 평균 예측 오류를 최소화합니다. 여러 모드가 존재할 때, 최소 평균 오류 예측은 유효한 궤도가 아닌 모든 모드의 평균입니다.
- ** 진단 테스트:** 모든 훈련 시범을 검토하고 여러 가지 다른 전략이 있는지 수동적으로 확인합니다. 사업자가 질적으로 다른 접근 방식을 사용한다면 (다양한 접근 각, 다른 포착 유형) 모드 평균이 가능합니다.
- 중화
CVAE (ACT): ACT의 조건 VAE는 시범의 "양식"을 잠정 변수로 암호화하여, 정책이 추론 시 한 모드로 전속될 수 있도록 한다. 각 모드의 충분한 시범이 요구된다 (2050 모드 최소). - 중화
전파 정책: 방산은 자연적으로 다모달 분포를 처리합니다. - 중화
데이터 큐레이션: 한 가지 전략이 강하게 선호되는 경우 (예를 들어, 배포 환경에서 항상 왼쪽에서 접근) 그 전략을 과잉으로 표현하기 위해 훈련 세트를 큐레이션하십시오. 50/50 대신 70/30 믹스는 선호하는 모드로 정책을 편향합니다.
실패 모드 4: 접촉 근처에서 정확성 저하
** 증상:** 접근과
- ** 근본 원인은:** 카메라 기반의 인식은 제한적 해상도를 가지고 있습니다. 작업 공간에서 전형적인 고정 카메라 거리에서 60
80cm, 1 카메라 픽셀은 작업 공간의 위치에 약 0.5 1mm에 해당합니다. <3mm의 정확성을 필요로 하는 작업에서는 픽셀 소음이 필요한 정확도에 비교할 수 있습니다. - ** 미티게이션
손목 카메라:** 손목 장착 카메라 (접촉 지점에서 5 15cm) 는 중요한 정밀 단계에서 10 20x 더 높은 효과적 해상도를 제공합니다. - 중소
힘/토크 피드백: 손목에 탑재된 F/T 센서를 (ATI Mini45, OnRobot HEX) 추가하면 카메라 해상도에 의존하지 않는 접촉 검출을 제공합니다. - 중화
2단계 정책: 과제를 대략적인 위치 단계 (카메라 기반, 표준 해상) 와 정밀 접촉 단계 (목목 카메라 또는 F/T 피드백) 로 나눌 수 있습니다.
실패 모드 5: 잠복 처리
** 증상:** 작업 공간이 닫혀 있지 않은 상태에서 정책이 잘 작동하지만 로봇 팔이나 지갑이 카메라와 관심 대상이 사이에 있을 때 실패합니다. 팔이 카메라 시선을 차단하는 최종 접근 단계에서 실패가 집중됩니다.
- ** 근본 원인은:** 고정된 카메라가 로봇 팔을 통해 볼 수 없습니다. 로봇이 객체에 접근할 때, 팔은 고정된 카메라의 시선을 차단합니다. 훈련 데이터는 동일한 폐쇄 조건에서 수집되지 않은 경우, 정책은 정확한 시각 피드백이 가장 필요한 때 정확하게 배포되지 않은 이미지를 수신합니다.
- ** 미티게이션
손목 카메라:** 손목 카메라에 장착된 카메라는 팔 구성에 관계없이 지갑과 객체 인터페이스의 일관된 시각을 유지합니다. 손목 카메라에 손목에 의한 잠기는 물리적으로 불가능합니다. - 중화
다방면 설정: 다른 각에서 두 번째 고정된 카메라를 추가하면 (예를 들어, 상면 + 측면) 적어도 한 카메라가 팔 잠금 중에도 항상 작업 공간의 명확한 시각을 확보할 수 있습니다. - 중화
일관된 수집 조건: 배포 시 압축이 불가피하다면, 동일한 압축 구성의 팔로 훈련 데이터를 수집하도록 하십시오. 압축이 발생하지 않는 다른 모양의 테이블에서 훈련 데이터를 수집하는 것은 배포-대표적 시각 입력에 대한 정책을 훈련시킵니다.
실패 모드 평가 프로토콜
정책을 도입하기 전에 이 체계적인 평가 프로토콜을 실행하십시오.
- 명칭 조건: 30개의 실험실 훈련 조건에서 수행된 실험.
- 등화 변종: 각 10개의 시험은 3개의 다른 조명 조건 (오버헤드 플루오렌세스, 따뜻한 환경, 희미) 에서 수행된다.
- 높이와 위치 변수는: 2개의 테이블 높이에 10개의 시험 (훈련 높이는 ±10cm)
- ** 디스트라커 객체:** 작업 공간에서 3
5 개의 무관한 객체와 10 번의 실험. - 신작 객체 변종: 대상 객체의 색이나 질이 다른 변종을 10번 시험해봤다.
- ** 배포 환경:** 발사 이전 실제 배포 환경에서의 20개의 시험.
체계적인 정책 평가
RCSV 플랫폼은 구조화된 평가 프레임워크를 포함하고 있으며, 시뮬레이션에서 자동으로 실패 모드 프로토콜에 대한 정책을 실행하고 실제 세계 배포 전에 위험을 표시합니다.
[플랫폼을 탐험해 보세요]







