Política (robô)
Em aprendizado de robô, uma política (denotada π) é uma função que mapeia observações para ações: π(o) → a. A política é o "cérebro" aprendido do robô que determina o que fazer a cada passo de tempo dado o que percebe. As políticas podem ser representadas como redes neurais (políticas neurais), árvores de decisão, processos gaussianos ou tabelas de consulta. Podem ser determinísticas (uma ação por observação) ou estocásticas (uma distribuição sobre ações). A qualidade da política é medida pela taxa de sucesso da tarefa em condições diversas, não apenas em demonstrações de treinamento. O desafio central do aprendizado de robô é treinar políticas que generalizem de forma confiável além de sua distribuição de treinamento. Veja isso na prática: nossas avaliações em mundo real →







