Voltar para Glossary

Modelo de Recompensa

MLRL

Uma rede neural treinada para prever valores de recompensa escalar a partir de pares estado-ação ou segmentos de trajetória, tipicamente treinada em preferências humanas ou demonstrações de especialistas. Modelos de recompensa substituem funções de recompensa projetadas manualmente por aprendidas. Eles são centrais para treinamento no estilo RLHF e são usados em robótica para especificar objetivos de tarefa complexos que são difíceis de formalizar matematicamente.

Related terms