Voltar para Glossary

Aprendizado por Preferência

Robot LearningRL

Aprendizado a partir de julgamentos comparativos humanos (p.ex., 'a trajetória A é melhor que a trajetória B') em vez de sinais de recompensa explícitos ou demonstrações. Um modelo de recompensa é treinado para ser consistente com as preferências humanas, então utilizado para otimizar a política de controle via RL. Esta abordagem (RLHF aplicada à robótica) evita a necessidade de engenharia precisa de recompensa escalar e pode capturar intenção humana nuançada.

Related terms