정책(로봇)
로봇 학습에서 정책(π로 표기)은 관찰을 행동으로 매핑하는 함수입니다: π(o) → a. 정책은 로봇이 매 타임스텝마다 인식한 것을 바탕으로 무엇을 할지 결정하는 학습된 "뇌"입니다. 정책은 신경망(신경 정책), 의사결정 트리, 가우시안 프로세스, 또는 조회 테이블로 표현될 수 있습니다. 결정론적(관찰당 하나의 행동) 또는 확률론적(행동에 대한 분포)일 수 있습니다. 정책 품질은 훈련 시연뿐만 아니라 다양한 조건에서의 작업 성공률로 측정됩니다. 로봇 학습의 핵심 과제는 훈련 분포를 넘어 안정적으로 일반화하는 정책을 훈련하는 것입니다. 실제 적용 사례: 우리의 실제 평가 →







