Retour à Glossary

Apprentissage par renforcement inverse

Robot LearningRL

Apprentissage d'une fonction de récompense à partir de démonstrations d'experts, en supposant que l'expert maximise (approximativement) de manière optimale cette récompense. L'ARI évite le besoin d'ingénierie manuelle des fonctions de récompense — au lieu de cela, la récompense est déduite puis utilisée pour entraîner une politique de contrôle via l'apprentissage par renforcement standard. L'ARI à entropie maximale et l'ARI adversarial (AIRL) sont des formulations populaires. L'ARI est étroitement liée à GAIL.

Related terms