TD3
Twin Delayed DDPG — DDPGの過大評価バイアスに対処するオフポリシーRL アルゴリズム。(1) 2つのQ-ネットワークを使用して最小値を取る、(2) Q-ネットワーク更新に対してポリシー更新を遅延させる、(3) スムーズ化されたターゲットポリシーノイズを追加する。TD3はDDPGより安定しており、連続制御ロボット学習タスクの標準的なベースラインである。
Twin Delayed DDPG — DDPGの過大評価バイアスに対処するオフポリシーRL アルゴリズム。(1) 2つのQ-ネットワークを使用して最小値を取る、(2) Q-ネットワーク更新に対してポリシー更新を遅延させる、(3) スムーズ化されたターゲットポリシーノイズを追加する。TD3はDDPGより安定しており、連続制御ロボット学習タスクの標準的なベースラインである。