가치 함수
주어진 상태(상태 가치 함수 V) 또는 상태-행동 쌍(행동 가치 함수 Q)으로부터의 예상 누적 보상을 추정하는 함수. 가치 함수는 강화학습의 중심이다 — 행동 선택과 제어정책 개선을 안내한다. 심층 강화학습은 신경망을 사용하여 가치 함수를 근사한다. 로봇공학에서 학습된 가치 함수는 계획을 위한 비용-도달 추정값 및 안전 비평가로 사용될 수 있다.
주어진 상태(상태 가치 함수 V) 또는 상태-행동 쌍(행동 가치 함수 Q)으로부터의 예상 누적 보상을 추정하는 함수. 가치 함수는 강화학습의 중심이다 — 행동 선택과 제어정책 개선을 안내한다. 심층 강화학습은 신경망을 사용하여 가치 함수를 근사한다. 로봇공학에서 학습된 가치 함수는 계획을 위한 비용-도달 추정값 및 안전 비평가로 사용될 수 있다.