Volver a Glossary

Modelado de Recompensas

Robot LearningRL

Modificar la función de recompensa para proporcionar señales de aprendizaje más densas e informativas sin cambiar la política óptima. Por ejemplo, agregar una recompensa de modelado basada en potencial que otorgue crédito parcial por acercarse al objetivo. El modelado de recompensas acelera dramáticamente el entrenamiento con RL en entornos con recompensas dispersas, pero requiere cuidado para evitar introducir óptimos locales no intencionados.

Related terms