연속 제어
연속 제어는 이산 행동 집합에서 선택하는 대신 실수값 행동 벡터(예: 관절 토크, 속도 또는 데카르트 델타)를 출력하는 로봇 제어정책을 의미합니다. 대부분의 물리적 로봇 조작 작업은 연속 제어가 필요합니다. 부드럽고 정밀한 동작은 유한한 행동 메뉴로는 적절히 표현될 수 없기 때문입니다. 연속 제어를 위한 표준 심화 강화학습 알고리즘으로는 DDPG, TD3, SAC가 있으며, 모방 학습에서는 행동 복제와 Diffusion Policy가 연속 행동 공간에서 일반적으로 사용됩니다. 실제 사례를 보세요: 하드웨어 스토어 →







