Volver a Glossary

Modelo de Recompensa

MLRL

Una red neuronal entrenada para predecir valores de recompensa escalar a partir de pares estado-acción o segmentos de trayectoria, típicamente entrenada en preferencias humanas o demostraciones de expertos. Los modelos de recompensa reemplazan las funciones de recompensa diseñadas manualmente con funciones aprendidas. Son centrales para el entrenamiento de estilo RLHF y se utilizan en robótica para especificar objetivos de tareas complejos que son difíciles de formalizar matemáticamente.

Related terms