DDPG
Deep Deterministic Policy Gradient — 결정론적 제어정책과 Q-함수를 사용하는 연속 동작 공간을 위한 오프-정책 강화학습 알고리즘으로, 결정론적 제어정책 그래디언트 정리를 통해 훈련됩니다. DDPG는 안정성을 위해 경험 재생과 목표 네트워크를 사용합니다. 로봇 제어 작업에 광범위하게 적용되었지만 하이퍼파라미터에 민감할 수 있습니다. TD3 (Twin Delayed DDPG)는 과대 추정 편향을 해결합니다.
Deep Deterministic Policy Gradient — 결정론적 제어정책과 Q-함수를 사용하는 연속 동작 공간을 위한 오프-정책 강화학습 알고리즘으로, 결정론적 제어정책 그래디언트 정리를 통해 훈련됩니다. DDPG는 안정성을 위해 경험 재생과 목표 네트워크를 사용합니다. 로봇 제어 작업에 광범위하게 적용되었지만 하이퍼파라미터에 민감할 수 있습니다. TD3 (Twin Delayed DDPG)는 과대 추정 편향을 해결합니다.