Contrôle continu
Le contrôle continu fait référence aux politiques de robot qui produisent des vecteurs d'action à valeurs réelles (par exemple, couples articulaires, vitesses ou deltas cartésiens) plutôt que de sélectionner parmi un ensemble discret d'actions. La plupart des tâches de manipulation de robot physique nécessitent un contrôle continu car le mouvement lisse et précis ne peut pas être adéquatement représenté par un menu d'actions fini. Les algorithmes standard d'apprentissage par renforcement profond pour le contrôle continu incluent DDPG, TD3 et SAC ; pour l'apprentissage par imitation, le clonage de comportement et Diffusion Policy sont couramment utilisés dans les espaces d'action continus. Voir cela en pratique : le magasin de matériel →







