로봇 이 모방 학습: 행동 복제 에서 전파 정책
모방 학습에 대한 명확한 소개 <unk> 행동 복제, 분배 전환, DAgger, 액션 덩어리 및 전파 정책에 대해 설명했습니다.
[← 배우기]
로봇이 인간들의 시범으로 기술을 습득하는 방법, 왜 순진한 모방이 실패하는지, 그리고 현대 알고리즘이 핵심적인 도전을 어떻게 극복하는지 알아보세요.
모방 학습 은 무엇 입니까?
모방 학습 (IL) 은 로봇이 전문가의 시범에서 학습하여 행동하도록 가르치는 알고리즘의 일족이다. 공식적으로는 우리는 시범의 데이터 세트를 가지고 있습니다.
IL의 매력은 실용적입니다. 인물은 보너스 함수를 손으로 설계하거나 운동 원시물을 작성하는 것보다 로봇에게 무엇을 해야 하는지 보여주기 훨씬 쉽습니다.
행동 복제: 기본 기준
행동 복제 (BC) 는 가장 간단한 IL 알고리즘입니다. 그것은 문제를 감독된 학습으로 취급합니다. 주어진 상태
BC는 훈련이 빠르고 구현이 쉬워지고 단시간 작업에 놀라울 정도로 잘 작동합니다. 표준 BC 파이프라인은 오후에 실행될 수 있습니다. 50 개의 시범을 수집하고 100 시대 동안 레스넷+MLP를 훈련시키고 배포합니다.
** 비판적 한계:** 합성 오류. 훈련 중에 네트워크는 시범에서 나타나는 상태만을 볼 수 있습니다. 테스트 시간 동안, 작은 예측 오류조차도 로봇을 전혀 보지 못한 약간 다른 상태로 이동합니다. 다음 예측은 정확도가 떨어지고 오류가 커지고 몇 초 이내에 로봇은 완전히 배포되지 않은 상태로 돌아갑니다.
분배 변화 문제
배포 전환은 모방 학습의 핵심 과제이다. 훈련 배포
수학적 통찰력: 단계별 오류
DAgger: 분배 전환을 고정
데이터셋 집합 (DAgger) 은 배포 전환을 반복적으로 처리합니다.
- 단계 1: 초기 시범에 대한 BC 정책의 초기 훈련.
- 단계 2: 학습된 정책을 실제 환경에서 적용하세요. 정책은 새로운 주들을 방문할 것입니다.
- 단계 3: 정책 방문의 모든 국가에 인간 전문가가 올바른 조치를 취하도록 요청하십시오.
- 단계 4: 데이터 세트에 이러한 ( 상태, 수정된 행동) 쌍을 추가합니다.
- ** 단계 5:** 집합 데이터 세트에 대한 정책을 다시 훈련하십시오. 단계 2에서 반복합니다.
여러 차례가 지나면 훈련 분포는 정책이 실제로 방문하는 국가와 밀접하게 일치하고, 합성 오류가 크게 감소합니다. DAgger는 이론적으로 건전하지만 비용이 많이 들며, 로봇 실행 중에 인적 전문가가 존재하여 실시간으로 행동을 관찰하고 수정하는 것이 필요합니다.
현대 알고리즘: ACT, 전파 정책, IBC
세 가지 알고리즘이 로봇 모방 학습의 현대의 최신 기술을 지배합니다.
- ACT
트랜스포머와 액션 ACT는 각 단계에 단일 액션을 예측하기 보다는,킹: T12 의 미래의 액션을 한 번에 예측합니다 (일반적으로 K=100 50Hz에서, 따라서 2 초의 움직임). 로봇은 을 실행하고, 다시 계획합니다. 이것은 복합 오류 순환을 깨고 오류는 전체 에피소드에서 축적되는 것이 아니라 의 일부 내에서만 축적됩니다. ACT는 CVAE 코더를 사용하여 다모달 디스플레이 데이터를 처리하고 트랜스포머 디코더를 사용하여 액션 시퀀스를 생성합니다. - 방산 정책: 방산 과정을 나타내는 행동 분포를 모델링합니다. 단일 행동을 예측하기보다는, 방산 정책은 유연한 행동 궤도로 무작위적인 소음을 반복적으로 표시하는 것을 배운다. 이것은 자연적으로 multi-modality
를 처리합니다. 주어진 상태에 대해 여러 가지 유효한 행동이 존재하는 경우 (예를 들어, 왼쪽 또는 오른쪽에서 잡는 경우) 단일 BC 네트워크는 이러한 솔루션을 평균하고 무효한 것을 예측할 수 있습니다. - IBC
간접 행동 복제: 직접적인 행동 예측기보다는 에너지 함수T13 을 훈련시킵니다. 인퍼런스는 gradient 하락 또는 MCMC 샘플링을 통해 에너지를 최소화하는 행동을 찾습니다. 다 모달 분포에 견고하지만 추론 시 계산적으로 더 비싸습니다.
알고리즘 비교
| Algorithm | Handles Multi-Modal | Action Horizon | Training Speed | Inference Speed | Best For |
|---|---|---|---|---|---|
| Behavior Cloning | No (averages modes) | Single step | Very fast | Very fast | Short tasks, simple grasps |
| DAgger | No | Single step | Fast per iter | Very fast | Tasks where expert can correct live |
| ACT | Partial (CVAE) | Chunk (K steps) | Fast | Fast | Bimanual, contact-rich tasks |
| Diffusion Policy | Yes | Horizon (T steps) | Slow | Moderate | Complex, multi-modal tasks |
| IBC | Yes | Single step | Moderate | Slow | Research; multi-modal with energy landscape |
시작하는 전문가: 데이터 파이프라인 및 하드웨어 설정을 검증하기 위해 BC를 시작하십시오. 더 긴 지평 또는 접촉이 풍부한 작업을 처리해야 할 때 ACT 또는 디스포지션 정책으로 이동하십시오. ACT와 디스포지션 정책의 선택은 순위 성능보다 작업 구조에 더 달려 있습니다.







