Glossary(으)로 돌아가기

마르코프 결정 과정

MathRL

불확실성 하에서 순차적 의사결정을 위한 수학적 프레임워크: 상태, 행동, 전이 확률, 보상 함수, 할인 인자의 튜플(S, A, P, R, γ). 강화학습 알고리즘은 MDP에서 기댓값 할인 수익을 최대화하는 제어 정책을 학습한다. 로봇 조작과 이동은 MDP로 모델링되며, 여기서 제어 정책은 상태를 행동으로 매핑한다.

Related terms