Volver a Glossary

Aprendizaje por Preferencias

Robot LearningRL

Aprendizaje a partir de juicios comparativos humanos (p. ej., 'la trayectoria A es mejor que la trayectoria B') en lugar de señales de recompensa explícitas o demostraciones. Se entrena un modelo de recompensa para ser consistente con las preferencias humanas, que luego se utiliza para optimizar la política de control mediante RL. Este enfoque (RLHF aplicado a robótica) evita la necesidad de ingeniería precisa de recompensas escalares y puede capturar la intención humana matizada.

Related terms