Execução de Política
Uma execução de política é um único episódio de execução de uma política treinada no robô (ou em simulação) a partir de um estado inicial até a conclusão da tarefa ou timeout. As execuções são usadas para avaliar o desempenho da política, coletar novos dados para treinamento adicional (como em DAgger ou ajuste fino de RL) e depurar modos de falha. O número de execuções necessárias para estimação confiável de desempenho depende da variabilidade da tarefa — tarefas de alta variância podem exigir 50+ execuções para obter uma estimativa estável de taxa de sucesso. Em pesquisa, as execuções são frequentemente categorizadas por condição inicial (objetos/cenas em distribuição vs. fora de distribuição) para caracterizar generalização. Veja isso na prática: nossas avaliações em mundo real →







