Blog(으)로 돌아가기

로봇 조작에 대한 RL와 모방 학습: 결정 지침서

로봇 조작 정책 훈련에 대한 강화 학습과 모방 학습을 언제 사용할 것인가

[이미테이션 학습 가이드]

[← 블로그]

RL와 IL의 선택은 어느 것이 더 좋냐는 것이 아니라 특정 한 가지 제한에 따라 어느 것이 적합하느냐에 관한 것입니다.

신속 한 결정 규칙

상세한 분석 전에: 만약 당신이 원전 조작 시스템으로 작업을 쉽게 증명할 수 있다면, 모방 학습을 사용하십시오. 만약 당신이 그것을 증명할 수 없지만 명확한 스칼라 보상 신호를 정의할 수 있다면, RL를 사용하십시오. 만약 둘 다 적용되지 않는다면, 작업은 너무 복잡합니다.

이 규칙은 실제 조작 시나리오의 80%에 해당하는 것이 사실이고 나머지 20%는 하이브리드 접근 방식이나 아래와 같은 타협의 신중한 분석이 필요합니다.

모방 학습: 강점 과 한계

종종 과부평가되는 IL의 장점은

  • ** 빠른 개발 주기는:** 100개의 시범이 이루어집니다.
  • 건설에 의해 안전: 정책은 입증된 행동에 가까이 머물도록 학습합니다. RL 탐사선수처럼 위험한 가장자리 사례를 발견하지 않습니다.
  • ** 보상 공학이 없습니다:** 정밀 조립에 대한 보상 기능을 정의하는 것은 놀랍도록 어렵습니다. IL는 이것을 완전히 우회합니다.
  • ** 예측 가능한 비용:** 성능 향상에 따른 비용은 선형적이고 측정가능합니다

IL 제한:

  • ** 시범자 품질에 의해 제한됩니다:** 정책은 시범을 제공한 사업자의 기술력을 초과할 수 없습니다.
  • ** 복합 오류:** 행동 복제 과정은 긴 시간 지평선에서 훈련 배포로부터 유도된다.
  • ** 명백하지 않은 해결책을 발견할 수 없습니다:** 증명하기 어렵지만 실행하기 쉬운 전략이 있다면 (예를 들어, 대상을 쓰레기통에 던져버리기 위해 역동적 역학을 사용하여) IL는 결코 그것을 찾을 수 없습니다.

강화 된 학습: 강점 과 한계

RL의 장점:

  • 인간 성능을 초월할 수 있다: RL는 게임에서 초인적 전략을 발견했으며 특정 물체에 대한 직관적이지 않지만 우수한 포착 전략을 발견했다.
  • 무분명할 수 없는 행동을 처리한다: 인간이 로봇을 쉽게 제어할 수 없는 작업 (고속 역학, 복잡한 접촉 순서) 은 자연적인 RL 목표물이다.
  • 장거리 계획: 잘 형성된 보상이 있으면, RL는 IL에서 오류가 증가할 가능성이 있는 20-50 단계 작업을 처리할 수 있습니다.

RL 제한은 종종 과소평가됩니다.

  • ** 샘플 효율성:** 현대 조작 RL는 간단한 작업에 500K-5M 환경 단계를 필요로 합니다. 10Hz 시뮬레이션에서, 그것은 시뮬레이션 시간 14~140 시간 및 IL보다 큰 규모의 더 많은 데이터입니다.
  • ** 보상 엔지니어링 난이도는:** 부진 보상 (성공/실패만) 은 신중한 형태를 하지 않고 거의 작동하지 않습니다. 조작에 대한 밀집한 보상 기능은 정확하게 지정하기 어렵다. 잘못된 형태를 가진 보상들은 과제를 해결하기보다는 보상을 이용하는 정책을 만들어냅니다.
  • 시프-실천 의존성: 물리적인 로봇에 대한 실제 RL는 가능하지만 느리고 비용이 많이 들기 때문에 RL는 거의 항상 시뮬레이션을 필요로 하며, 이는 sim-to-real 전송을 필요로 한다.

한 편에 한 편 비교

Dimension 모방 학습 Reinforcement Learning
Sample efficiency 100-500 demos for most tasks 500K-5M sim steps (much more data)
Reward design needed? No (demonstrations are the reward) Yes (hardest part of the pipeline)
Simulation required? No (works on real robot directly) Practically yes (real-world RL is too slow)
Hardware access needed? Yes (physical robot + teleoperation) Only for validation (training is in sim)
GPU compute cost $5-50 per policy (2-12 hr training) $50-500 per policy (8-100 hr training)
Performance ceiling Bounded by demonstrator skill Can exceed human performance
Safety during training Inherently safe (follows demo distribution) 탐색 can be dangerous on real hardware
Time to first policy 1-3 days (collect + train) 1-4 weeks (sim setup + training)
Sim-to-real gap? No (trained on real data) Yes (major challenge for deployment)
Multi-task scaling Linear cost per task (need demos for each) Reward re-engineering per task (often harder)

결정 흐름표

이 일련의 질문을 통해 특정 작업에 대한 올바른 접근법을 찾아내십시오.

  1. 인간은 텔레오페레이션을 통해 작업을 증명할 수 있습니까? 만약 예라면 IL는 출발점입니다. 만약 그렇지 않다면 (예를 들어, 작업은 초인적 속도, 반응 시간 또는 자유 통제 정도가 필요하다면) 단계 3로 이동하십시오.
  2. ** 작업은 시범자의 능력 이상으로 정밀함을 요구합니까?** IL 정책이 70-80%의 성공을 달성하지만 95%+가 필요하다면 IL 온실 시작 + RL 정비 (히브리드) 를 사용하십시오. IL만 목표에 도달하면 중지하십시오.
  3. ** 작업에 대한 스칼라 보상 함수를 정의할 수 있습니까?** 만약 그래, 그리고 시뮬레이션에 액세스 할 수 있다면 RL를 사용하십시오. 보상이 모호하거나 다목적이 있다면 GAIL (상상을 배우기 위해 시범을 사용) 를 고려하거나 더 명확한 보상을 가진 하위 작업으로 작업을 나눌 수 있습니다.
  4. 시프-실적 전송은 작업에 가능합니까? 작업은 알려진 기하학이 있는 딱딱한 객체를 포함하면, 시프-실적은 일반적으로 가능합니다. 변형 가능한 객체, 유체 또는 복잡한 접촉 동적을 포함하면, 시프 충실성은 충분하지 않을 수 있습니다. 실제 하드웨어에서 IL에 기본 설정됩니다.
  5. ** 귀하의 계산 예산은 얼마입니까?** A100/H100 GPU에 액세스 할 수 있고 10-100 시간 훈련 시간을 감당할 수 있다면 RL는 실용적입니다. 계산이 제한되어 있다면 ( 단일 RTX 3090 또는 클라우드 스팟 인스턴스) IL는 10-100x 더 계산 효율적입니다.

하이브리드 접근법: 둘 다 가장 좋은 방법

Approach Description Benefit When to Use
IL warm-start + RL fine-tuning Train IL policy first, use as RL initialization 10× more efficient RL When IL policy is 60-70% and you need 90%+
GAIL RL with reward from discriminator trained on demos No reward engineering When reward is hard to specify
DAgger IL with online data collection from expert Fixes compounding error When BC diverges at test time
Residual RL Base IL policy + RL residual corrector Safe exploration near IL behavior 정밀도 refinement of IL policies

비용 및 시간대 비교

기술적 가치 이외에도 RL와 IL 사이의 실질적인 결정은 종종 프로젝트 시간과 예산으로 요약됩니다.

Resource IL (ACT, 500 demos) RL (PPO in Isaac Lab) Hybrid (IL + Residual RL)
Upfront engineering 1-2 weeks (pipeline setup) 2-4 weeks (sim setup + reward eng.) 3-5 weeks (both pipelines)
Data/experience collection 1-2 weeks (500 demos at 40/hr) 0 (automated in sim) 1 week (200 demos)
Training time 3-4 hours (RTX 4090) 8-24 hours (A100) 4 hr IL + 8 hr RL
GPU compute cost $5-15 $30-100 $35-80
Hardware access cost $800-2,000 (lease + operator) $0 (sim only until validation) $400-1,000
Total timeline 2-4 weeks 4-8 weeks 4-6 weeks
Typical success rate 80-90% 70-85% (after sim-to-real) 85-95%

핵심 점: IL는 대부분의 조작 작업에 더 빠르고 저렴하다. IL가 요구되는 성능 수준에 도달할 수 없을 때, 작업이 입증되지 않을 때 또는 인적 수준의 성능을 초과해야 할 때 RL는 정당하다. 하이브리드 접근 방식은 가장 높은 성공률을 제공하지만 두 파이프 라인 모두에 투자해야합니다.

방법 을 선택 하는 데 있어서 흔히 하는 실수

실점 1: RL를 시작해서 더 정교하게 들리기 때문입니다. ML 배경이 있는 팀들은 RL를 기본으로 선택하기 때문에 기술적으로 더 흥미로운 접근 방식이기 때문입니다. 하지만 대부분의 실용적인 조작 작업에서는 IL가 더 빠른 결과를 만들어냅니다. IL를 시작해서 IL가 명확한 성능 천장을 달성하면만 RL로 전환합니다.

실점 2: 보상 공학에 투자하지 못하다. RL를 선택하면 보상 기능 설계 및 반복에 대한 엔지니어링 시간의 최소 40%를 예산으로 한다. 보상 기능은 RL 파이프라인의 가장 중요한 요소이며, 그것을 올바르게 만드는 데 광범위한 실험이 필요합니다. 부양된 보상은 그 문제를 해결하기보다는 보수를 이용하는 정책을 만들어냅니다. 로봇은 의도된 행동을 하지 않고도 그 숫자를 극대화할 수 있는 창의적인 방법을 찾습니다.

** 오류 3: 시뮬레이션에서 훈련된 RL 정책은 종종 시뮬레이션에서 95% 이상의 성공을 달성하지만 도메인 무작위로 설정되지 않은 실제 로봇에서 40%에서 60%까지 달성합니다. 도메인 무작위로 설정하는 데 예산 시간과 계산, 그리고 항상 성공을 주장하기 전에 실제 하드웨어에서 시뮬레이션 훈련 된 정책을 검증하십시오. 도메인 무작위로 설정하기 위해 [아이자크 연구소 가이드]T2) 를 참조하십시오.

실점 4: IL 동안 오류 데이터를 수집하지 않습니다. 운영자는 기본적으로 실패한 시범을 폐기합니다. 그러나 [데이터 품질 지침]T3에서 논의했듯이, 라벨 된 실패 시범은 복구 행동 및 실패 탐지 훈련에 유용합니다. 적절한 라벨을 사용하여 보존하십시오.

작업 유형 추천

Task Type Recommended Approach Reason
Pick-and-place (varied poses) IL (ACT or Diffusion) Easily demonstrated, contact minimal
정밀도 peg insertion IL or IL + Residual RL Demonstrable; RL refines final alignment
Dexterous in-hand manipulation RL (in sim) + IL for initialization Hard to demonstrate; RL finds solutions
Long-horizon assembly (10+ steps) Hierarchical: task planner + IL per step Neither alone handles long horizon well
Locomotion gait optimization RL Non-demonstrable, clear energy reward
Tool use (novel tools) IL for known tools, RL generalization Few-shot IL + sim RL exploration

RCSV의 [RL 환경 서비스] (T4) 는 RL 훈련에 대한 시뮬레이션 설정을 제공하고, 우리의 [데이터 서비스] (T5) 는 위에서 설명한 하이브리드 접근법에서 종종 조합으로 사용되는 IL 시범 수집을 처리합니다.

관련 독서

올바른 접근 방법 을 선택 하는 데 도움 이 필요 합니까?

RCSV는 RL 시뮬레이션 환경과 IL 데이터 수집을 모두 제공합니다.

[우리의 서비스를 탐구]