Назад к Glossary

Развертывание политики

EvaluationPolicy

Развертывание политики — это один эпизод выполнения обученной политики на роботе (или в симуляции) от начального состояния до завершения задачи или истечения времени. Развертывания используются для оценки производительности политики, сбора новых данных для дальнейшего обучения (как в DAgger или тонкой настройке обучения с подкреплением) и отладки режимов отказа. Количество развертываний, необходимых для надежной оценки производительности, зависит от вариативности задачи — задачи с высокой дисперсией могут потребовать 50+ развертываний для получения стабильной оценки процента успеха. В исследованиях развертывания часто категоризируются по начальному условию (объекты/сцены в распределении и вне распределения) для характеристики обобщения. Смотрите это на практике: наши оценки в реальном мире →

Related terms