Volver a Glossary

Función de Recompensa

Reinforcement LearningCore Concept

La función de recompensa define el objetivo de aprendizaje para un agente de aprendizaje por refuerzo: asigna una señal de recompensa escalar r(s, a, s') a cada transición (estado, acción, estado-siguiente), indicando al agente qué tan buenas o malas son sus acciones. El diseño de la función de recompensa es una de las partes más difíciles de aplicar RL a robótica: las recompensas dispersas (1 en éxito, 0 en otro caso) son limpias pero conducen a aprendizaje lento; las recompensas densas (p. ej., distancia negativa al objetivo) guían el aprendizaje pero pueden ser explotadas de formas inesperadas (explotación de recompensas). Las alternativas incluyen aprendizaje de recompensas a partir de demostraciones (IRL, RLHF), métricas de simulación específicas de tareas y modelos de preferencia aprendidos. El aprendizaje por imitación evita completamente el problema del diseño de recompensas aprendiendo directamente de demostraciones. Véase esto en la práctica: nuestras evaluaciones en el mundo real →

Related terms