返回Glossary

探索-利用权衡

Robot LearningRL

强化学习中的基本困境:智能体必须在利用已知的高奖励动作和探索可能产生更高奖励的未知动作之间取得平衡。纯利用会导致局部最优;纯探索效率低下。ε-贪心、UCB、Thompson采样和好奇心驱动探索等方法可以管理这种权衡。在机器人学中,安全探索约束使这种权衡更加困难。

Related terms