CQL
Conservative Q-Learning — un algorithme d'apprentissage par renforcement hors ligne qui apprend une fonction Q conservative (pessimiste) en ajoutant une pénalité pour les valeurs Q sur les actions hors distribution. Cela prévient le problème de surestimation qui cause aux politiques d'apprentissage par renforcement hors ligne d'exploiter des régions de valeur élevée spurieuses non soutenues par les données. CQL est l'une des méthodes d'apprentissage par renforcement hors ligne les plus largement utilisées pour la manipulation robotique.







