TD3
Twin Delayed DDPG — DDPG의 과대평가 편향을 다음과 같이 해결하는 오프폴리시 RL 알고리즘입니다: (1) 두 개의 Q-네트워크를 사용하고 최솟값을 취함, (2) Q-네트워크 업데이트에 상대적으로 제어 정책 업데이트를 지연, (3) 평활화된 목표 제어 정책 노이즈 추가. TD3는 DDPG보다 더 안정적이며 연속 제어 로봇 학습 작업의 표준 기준선입니다.
Twin Delayed DDPG — DDPG의 과대평가 편향을 다음과 같이 해결하는 오프폴리시 RL 알고리즘입니다: (1) 두 개의 Q-네트워크를 사용하고 최솟값을 취함, (2) Q-네트워크 업데이트에 상대적으로 제어 정책 업데이트를 지연, (3) 평활화된 목표 제어 정책 노이즈 추가. TD3는 DDPG보다 더 안정적이며 연속 제어 로봇 학습 작업의 표준 기준선입니다.