Apprentissage par renforcement hors ligne vers en ligne
Un paradigme d'entraînement qui initialise une politique hors ligne à partir d'un ensemble de données statique, puis l'affine en ligne avec une interaction supplémentaire avec l'environnement. La phase hors ligne fournit une bonne initialisation qui évite l'exploration précoce dangereuse ; la phase en ligne améliore les performances au-delà de celles des données hors ligne. IQL et CQL sont des phases hors ligne courantes pour la manipulation robotique.







