返回Glossary

Q 函数(动作价值函数)

Reinforcement LearningValue Function

Q 函数 Q(s, a) 估计智能体在状态 s 中采取动作 a 然后遵循给定策略所获得的期望累积折扣奖励。Q 函数是强化学习算法(如 DQN(离散动作)和 SAC、TD3、DDPG(连续动作))的核心。在机器人强化学习中,为长期操作任务学习准确的 Q 函数很具挑战性,因为奖励稀疏且状态-动作空间高维。离线强化学习(IQL、CQL)的最新工作使用 Q 函数从固定数据集中提取策略,无需在线交互,弥合了模仿学习和强化学习之间的差距。 在实践中查看:我们的真实世界评估 →

Related terms