返回Glossary

A3C

RL

异步优势演员-评论家(Asynchronous Advantage Actor-Critic)— 一种深度强化学习算法,在多个独立的环境副本上并行训练多个智能体实例,异步更新共享策略网络。A3C 是首批在 Atari 游戏上实现超人类性能的算法之一,证明了并行数据收集可以替代经验回放以实现稳定训练。

Related terms