Glossary(으)로 돌아가기

후향 경험 재생

Robot LearningRL

목표 조건부 강화학습을 위한 데이터 증강 기법으로, 실패한 궤적을 실제로 도달한 상태를 목표로 재레이블링합니다. 로봇이 블록을 위치 A에 놓으려고 했지만 위치 B에 도달했다면, HER은 B를 목표로 하고 궤적이 성공인 추가 학습 예제를 생성합니다. 이는 희소 보상 목표 도달 작업의 샘플 효율성을 극적으로 향상시킵니다.

Related terms