로봇 조작에 대한 RL와 모방 학습: 결정 지침서
로봇 조작 정책 훈련에 대한 강화 학습과 모방 학습을 언제 사용할 것인가
[이미테이션 학습 가이드]
[← 블로그]
RL와 IL의 선택은 어느 것이 더 좋냐는 것이 아니라
신속 한 결정 규칙
상세한 분석 전에: 만약 당신이 원전 조작 시스템으로 작업을 쉽게 증명할 수 있다면, 모방 학습을 사용하십시오. 만약 당신이 그것을 증명할 수 없지만 명확한 스칼라 보상 신호를 정의할 수 있다면, RL를 사용하십시오. 만약 둘 다 적용되지 않는다면, 작업은 너무 복잡합니다.
이 규칙은 실제 조작 시나리오의 80%에 해당하는 것이 사실이고 나머지 20%는 하이브리드 접근 방식이나 아래와 같은 타협의 신중한 분석이 필요합니다.
모방 학습: 강점 과 한계
종종 과부평가되는 IL의 장점은
- ** 빠른 개발 주기는:** 100개의 시범이 이루어집니다.
- 건설에 의해 안전: 정책은 입증된 행동에 가까이 머물도록 학습합니다. RL 탐사선수처럼 위험한 가장자리 사례를 발견하지 않습니다.
- ** 보상 공학이 없습니다:** 정밀 조립에 대한 보상 기능을 정의하는 것은 놀랍도록 어렵습니다. IL는 이것을 완전히 우회합니다.
- ** 예측 가능한 비용:** 성능 향상에 따른 비용은 선형적이고 측정가능합니다
IL 제한:
- ** 시범자 품질에 의해 제한됩니다:** 정책은 시범을 제공한 사업자의 기술력을 초과할 수 없습니다.
- ** 복합 오류:** 행동 복제 과정은 긴 시간 지평선에서 훈련 배포로부터 유도된다.
- ** 명백하지 않은 해결책을 발견할 수 없습니다:** 증명하기 어렵지만 실행하기 쉬운 전략이 있다면 (예를 들어, 대상을 쓰레기통에 던져버리기 위해 역동적 역학을 사용하여) IL는 결코 그것을 찾을 수 없습니다.
강화 된 학습: 강점 과 한계
RL의 장점:
- 인간 성능을 초월할 수 있다: RL는 게임에서 초인적 전략을 발견했으며 특정 물체에 대한 직관적이지 않지만 우수한 포착 전략을 발견했다.
- 무분명할 수 없는 행동을 처리한다: 인간이 로봇을 쉽게 제어할 수 없는 작업 (고속 역학, 복잡한 접촉 순서) 은 자연적인 RL 목표물이다.
- 장거리 계획: 잘 형성된 보상이 있으면, RL는 IL에서 오류가 증가할 가능성이 있는 20-50 단계 작업을 처리할 수 있습니다.
RL 제한은 종종 과소평가됩니다.
- ** 샘플 효율성:** 현대 조작 RL는 간단한 작업에 500K-5M 환경 단계를 필요로 합니다. 10Hz 시뮬레이션에서, 그것은 시뮬레이션 시간 14~140 시간
및 IL보다 큰 규모의 더 많은 데이터입니다. - ** 보상 엔지니어링 난이도는:** 부진 보상 (성공/실패만) 은 신중한 형태를 하지 않고 거의 작동하지 않습니다. 조작에 대한 밀집한 보상 기능은 정확하게 지정하기 어렵다. 잘못된 형태를 가진 보상들은 과제를 해결하기보다는 보상을 이용하는 정책을 만들어냅니다.
- 시프-실천 의존성: 물리적인 로봇에 대한 실제 RL는 가능하지만 느리고 비용이 많이 들기 때문에 RL는 거의 항상 시뮬레이션을 필요로 하며, 이는 sim-to-real 전송을 필요로 한다.
한 편에 한 편 비교
| Dimension | 모방 학습 | Reinforcement Learning |
|---|---|---|
| Sample efficiency | 100-500 demos for most tasks | 500K-5M sim steps (much more data) |
| Reward design needed? | No (demonstrations are the reward) | Yes (hardest part of the pipeline) |
| Simulation required? | No (works on real robot directly) | Practically yes (real-world RL is too slow) |
| Hardware access needed? | Yes (physical robot + teleoperation) | Only for validation (training is in sim) |
| GPU compute cost | $5-50 per policy (2-12 hr training) | $50-500 per policy (8-100 hr training) |
| Performance ceiling | Bounded by demonstrator skill | Can exceed human performance |
| Safety during training | Inherently safe (follows demo distribution) | 탐색 can be dangerous on real hardware |
| Time to first policy | 1-3 days (collect + train) | 1-4 weeks (sim setup + training) |
| Sim-to-real gap? | No (trained on real data) | Yes (major challenge for deployment) |
| Multi-task scaling | Linear cost per task (need demos for each) | Reward re-engineering per task (often harder) |
결정 흐름표
이 일련의 질문을 통해 특정 작업에 대한 올바른 접근법을 찾아내십시오.
- 인간은 텔레오페레이션을 통해 작업을 증명할 수 있습니까? 만약 예라면 IL는 출발점입니다. 만약 그렇지 않다면 (예를 들어, 작업은 초인적 속도, 반응 시간 또는 자유 통제 정도가 필요하다면) 단계 3로 이동하십시오.
- ** 작업은 시범자의 능력 이상으로 정밀함을 요구합니까?** IL 정책이 70-80%의 성공을 달성하지만 95%+가 필요하다면 IL 온실 시작 + RL 정비 (히브리드) 를 사용하십시오. IL만 목표에 도달하면 중지하십시오.
- ** 작업에 대한 스칼라 보상 함수를 정의할 수 있습니까?** 만약 그래, 그리고 시뮬레이션에 액세스 할 수 있다면 RL를 사용하십시오. 보상이 모호하거나 다목적이 있다면 GAIL (상상을 배우기 위해 시범을 사용) 를 고려하거나 더 명확한 보상을 가진 하위 작업으로 작업을 나눌 수 있습니다.
- 시프-실적 전송은 작업에 가능합니까? 작업은 알려진 기하학이 있는 딱딱한 객체를 포함하면, 시프-실적은 일반적으로 가능합니다. 변형 가능한 객체, 유체 또는 복잡한 접촉 동적을 포함하면, 시프 충실성은 충분하지 않을 수 있습니다. 실제 하드웨어에서 IL에 기본 설정됩니다.
- ** 귀하의 계산 예산은 얼마입니까?** A100/H100 GPU에 액세스 할 수 있고 10-100 시간 훈련 시간을 감당할 수 있다면 RL는 실용적입니다. 계산이 제한되어 있다면 ( 단일 RTX 3090 또는 클라우드 스팟 인스턴스) IL는 10-100x 더 계산 효율적입니다.
하이브리드 접근법: 둘 다 가장 좋은 방법
| Approach | Description | Benefit | When to Use |
|---|---|---|---|
| IL warm-start + RL fine-tuning | Train IL policy first, use as RL initialization | 10× more efficient RL | When IL policy is 60-70% and you need 90%+ |
| GAIL | RL with reward from discriminator trained on demos | No reward engineering | When reward is hard to specify |
| DAgger | IL with online data collection from expert | Fixes compounding error | When BC diverges at test time |
| Residual RL | Base IL policy + RL residual corrector | Safe exploration near IL behavior | 정밀도 refinement of IL policies |
비용 및 시간대 비교
기술적 가치 이외에도 RL와 IL 사이의 실질적인 결정은 종종 프로젝트 시간과 예산으로 요약됩니다.
| Resource | IL (ACT, 500 demos) | RL (PPO in Isaac Lab) | Hybrid (IL + Residual RL) |
|---|---|---|---|
| Upfront engineering | 1-2 weeks (pipeline setup) | 2-4 weeks (sim setup + reward eng.) | 3-5 weeks (both pipelines) |
| Data/experience collection | 1-2 weeks (500 demos at 40/hr) | 0 (automated in sim) | 1 week (200 demos) |
| Training time | 3-4 hours (RTX 4090) | 8-24 hours (A100) | 4 hr IL + 8 hr RL |
| GPU compute cost | $5-15 | $30-100 | $35-80 |
| Hardware access cost | $800-2,000 (lease + operator) | $0 (sim only until validation) | $400-1,000 |
| Total timeline | 2-4 weeks | 4-8 weeks | 4-6 weeks |
| Typical success rate | 80-90% | 70-85% (after sim-to-real) | 85-95% |
핵심 점: IL는 대부분의 조작 작업에 더 빠르고 저렴하다. IL가 요구되는 성능 수준에 도달할 수 없을 때, 작업이 입증되지 않을 때 또는 인적 수준의 성능을 초과해야 할 때 RL는 정당하다. 하이브리드 접근 방식은 가장 높은 성공률을 제공하지만 두 파이프 라인 모두에 투자해야합니다.
방법 을 선택 하는 데 있어서 흔히 하는 실수
실점 1: RL를 시작해서 더 정교하게 들리기 때문입니다. ML 배경이 있는 팀들은 RL를 기본으로 선택하기 때문에 기술적으로 더 흥미로운 접근 방식이기 때문입니다. 하지만 대부분의 실용적인 조작 작업에서는 IL가 더 빠른 결과를 만들어냅니다. IL를 시작해서 IL가 명확한 성능 천장을 달성하면만 RL로 전환합니다.
실점 2: 보상 공학에 투자하지 못하다. RL를 선택하면 보상 기능 설계 및 반복에 대한 엔지니어링 시간의 최소 40%를 예산으로 한다. 보상 기능은 RL 파이프라인의 가장 중요한 요소이며, 그것을 올바르게 만드는 데 광범위한 실험이 필요합니다. 부양된 보상은 그 문제를 해결하기보다는 보수를 이용하는 정책을 만들어냅니다. 로봇은 의도된 행동을 하지 않고도 그 숫자를 극대화할 수 있는 창의적인 방법을 찾습니다.
** 오류 3: 시뮬레이션에서 훈련된 RL 정책은 종종 시뮬레이션에서 95% 이상의 성공을 달성하지만 도메인 무작위로 설정되지 않은 실제 로봇에서 40%에서 60%까지 달성합니다. 도메인 무작위로 설정하는 데 예산 시간과 계산, 그리고 항상 성공을 주장하기 전에 실제 하드웨어에서 시뮬레이션 훈련 된 정책을 검증하십시오. 도메인 무작위로 설정하기 위해 [아이자크 연구소 가이드]
실점 4: IL 동안 오류 데이터를 수집하지 않습니다. 운영자는 기본적으로 실패한 시범을 폐기합니다. 그러나 [데이터 품질 지침]
작업 유형 추천
| Task Type | Recommended Approach | Reason |
|---|---|---|
| Pick-and-place (varied poses) | IL (ACT or Diffusion) | Easily demonstrated, contact minimal |
| 정밀도 peg insertion | IL or IL + Residual RL | Demonstrable; RL refines final alignment |
| Dexterous in-hand manipulation | RL (in sim) + IL for initialization | Hard to demonstrate; RL finds solutions |
| Long-horizon assembly (10+ steps) | Hierarchical: task planner + IL per step | Neither alone handles long horizon well |
| Locomotion gait optimization | RL | Non-demonstrable, clear energy reward |
| Tool use (novel tools) | IL for known tools, RL generalization | Few-shot IL + sim RL exploration |
RCSV의 [RL 환경 서비스] (
관련 독서
- NVIDIA 아이작 랩을 시작함 -- GPU 가속화된 RL 훈련의 주요 플랫폼
- LeRobot 가이드 -- ACT 및 전파 정책에 대한 IL 정책 훈련
- 제로샷 vs 몇 번의 샷 로봇 정책 - RL와 IL의 대안으로 기초 모델
- 로봇 데이터 수집 비용
- [Robot Training Data를 좋은게 만드는 것은 무엇입니까?]
- RCSV RL 환경 서비스 -- RL 훈련에 대한 미리 구성된 시뮬레이션
- 데이터 서비스 -- 하이브리드 파이프 라인의 IL 측면에 대한 관리 된 IL 시범 수집
올바른 접근 방법 을 선택 하는 데 도움 이 필요 합니까?
RCSV는 RL 시뮬레이션 환경과 IL 데이터 수집을 모두 제공합니다.
[우리의 서비스를 탐구]







