Retour à Glossary

Modèle de récompense

MLRL

Un réseau de neurones entraîné pour prédire des valeurs de récompense scalaires à partir de paires état-action ou de segments de trajectoire, généralement entraîné sur des préférences humaines ou des démonstrations d'experts. Les modèles de récompense remplacent les fonctions de récompense conçues manuellement par des fonctions apprises. Ils sont centraux à l'entraînement de style RLHF et sont utilisés en robotique pour spécifier des objectifs de tâche complexes qui sont difficiles à formaliser mathématiquement.

Related terms