Apprentissage par Imitation Hybride RL
Un paradigme d'entraînement qui combine l'apprentissage par imitation (à partir de démonstrations) et l'apprentissage par renforcement (à partir de l'interaction avec l'environnement) pour exploiter l'efficacité d'échantillonnage des démonstrations tout en permettant à l'RL de s'améliorer au-delà de la performance de l'expert. Les méthodes incluent DAPG (démonstrations comme a priori pour le gradient de politique), IRL+RL, et Demo-Augmented PPO.







