返回Glossary

价值函数

Robot LearningRL

一个函数,用于估计从给定状态(状态价值函数 V)或状态-动作对(动作价值函数 Q)获得的期望累积奖励。价值函数是强化学习的核心 — 它们指导动作选择和策略改进。深度强化学习使用神经网络来近似价值函数。在机器人学中,学习的价值函数可以用作规划的代价到达估计和安全评论家。

Related terms