A3C
非同期優位アクター・クリティック(Asynchronous Advantage Actor-Critic)— 複数のエージェントインスタンスを並列に、別々の環境コピー上で非同期に訓練し、共有ポリシーネットワークを更新する深層強化学習アルゴリズム。A3Cはアタリゲームで人間を超える性能を達成した最初のアルゴリズムの一つであり、経験リプレイの代わりに並列データ収集が安定した訓練を実現できることを実証した。
非同期優位アクター・クリティック(Asynchronous Advantage Actor-Critic)— 複数のエージェントインスタンスを並列に、別々の環境コピー上で非同期に訓練し、共有ポリシーネットワークを更新する深層強化学習アルゴリズム。A3Cはアタリゲームで人間を超える性能を達成した最初のアルゴリズムの一つであり、経験リプレイの代わりに並列データ収集が安定した訓練を実現できることを実証した。