Zurück zu Glossary

Inverse RL

Robot LearningRL

Lernen einer Belohnungsfunktion aus Expertendemonstrationen unter der Annahme, dass der Experte diese Belohnung (näherungsweise) optimal maximiert. IRL vermeidet die Notwendigkeit, Belohnungsfunktionen manuell zu konstruieren — stattdessen wird die Belohnung hergeleitet und dann verwendet, um eine Kontrollpolitik mittels Standard-RL zu trainieren. Maximum-Entropie-IRL und adversariales IRL (AIRL) sind populäre Formulierungen. IRL ist eng mit GAIL verwandt.

Related terms