Aprendizado a partir da Observação
Aprendizado por imitação a partir de demonstrações em vídeo que mostram apenas estados (observações) sem rótulos de ação — o observador vê o que foi feito, mas não como. Algoritmos de LfO devem inferir ações a partir de diferenças de estado usando modelos de dinâmica inversa. Esta configuração permite aprender a partir de vídeos de robôs da internet onde rótulos de ação não estão disponíveis.







