返回Glossary

TRPO

RL

信任域策略优化——一种策略梯度强化学习算法,通过信任域(由 KL 散度衡量)约束每次策略更新,以防止大幅破坏性更新。TRPO 提供单调改进保证,但由于约束优化计算成本高。PPO 用更简单的裁剪代理目标近似 TRPO 的优势。

Related terms