Apprentissage par renforcement hors ligne
Apprentissage par renforcement à partir d'un ensemble de données fixe de transitions précédemment collectées, sans interaction supplémentaire en ligne avec l'environnement. Les algorithmes d'apprentissage hors ligne (CQL, IQL, TD3+BC) traitent le décalage de distribution entre la politique de comportement qui a collecté les données et la politique apprise. L'apprentissage hors ligne est attrayant pour la robotique car il évite les préoccupations de sécurité et les coûts de l'exploration en ligne.







