Glossary(으)로 돌아가기

Q-함수 (행동-가치 함수)

Reinforcement LearningValue Function

Q-함수 Q(s, a)는 에이전트가 상태 s에서 행동 a를 취하고 그 후 주어진 정책을 따를 때 받을 것으로 예상되는 누적 할인 보상을 추정합니다. Q-함수는 DQN(이산 행동)과 SAC, TD3, DDPG(연속 행동)와 같은 강화학습 알고리즘의 중심입니다. 로봇 강화학습에서 장기 조작 작업을 위한 정확한 Q-함수를 학습하는 것은 보상이 희소하고 상태-행동 공간이 고차원이기 때문에 어렵습니다. 오프라인 강화학습(IQL, CQL)의 최근 작업은 Q-함수를 사용하여 온라인 상호작용 없이 고정 데이터셋에서 정책을 추출하며, 모방 학습과 강화학습 사이의 간격을 좁힙니다. 실제로 보기: 우리의 실제 평가 →

Related terms