Zurück zu Glossary

Präferenzlernen

Robot LearningRL

Lernen aus menschlichen Vergleichsurteilen (z. B. 'Trajektorie A ist besser als Trajektorie B') anstelle von expliziten Reward-Signalen oder Demonstrationen. Ein Reward-Modell wird trainiert, um mit menschlichen Präferenzen konsistent zu sein, und wird dann verwendet, um die Kontrollpolitik über RL zu optimieren. Dieser Ansatz (RLHF angewendet auf Robotik) vermeidet die Notwendigkeit präziser Reward-Engineering und kann nuancierte menschliche Absichten erfassen.

Related terms