Glossaryに戻る

DDPG

RL

Deep Deterministic Policy Gradient — 決定論的制御ポリシーとQ関数を使用する連続アクション空間のためのオフポリシーRL アルゴリズム。決定論的制御ポリシー勾配定理を介して訓練されます。DDPGは経験リプレイとターゲットネットワークを安定性のために使用します。ロボット制御タスクに広く適用されていますが、ハイパーパラメータに敏感である可能性があります。TD3(Twin Delayed DDPG)はその過大評価バイアスに対処します。

Related terms