连续控制
连续控制是指机器人控制策略输出实值动作向量(例如关节扭矩、速度或笛卡尔增量),而不是从离散动作集合中选择。大多数物理机器人操纵任务需要连续控制,因为光滑、精确的运动无法通过有限的动作菜单充分表示。用于连续控制的标准深度强化学习算法包括 DDPG、TD3 和 SAC;对于模仿学习,行为克隆和 Diffusion Policy 通常用于连续动作空间。 在实践中看到这一点:硬件商店 →
连续控制是指机器人控制策略输出实值动作向量(例如关节扭矩、速度或笛卡尔增量),而不是从离散动作集合中选择。大多数物理机器人操纵任务需要连续控制,因为光滑、精确的运动无法通过有限的动作菜单充分表示。用于连续控制的标准深度强化学习算法包括 DDPG、TD3 和 SAC;对于模仿学习,行为克隆和 Diffusion Policy 通常用于连续动作空间。 在实践中看到这一点:硬件商店 →