Назад к Glossary

Политика (робот)

Core ConceptDeep Learning

В обучении робота политика (обозначаемая π) — это функция, которая отображает наблюдения в действия: π(o) → a. Политика — это обученный "мозг" робота, который определяет, что делать на каждом временном шаге, учитывая то, что он воспринимает. Политики могут быть представлены как нейронные сети (нейронные политики), деревья решений, гауссовские процессы или таблицы поиска. Они могут быть детерминированными (одно действие на наблюдение) или стохастическими (распределение над действиями). Качество политики измеряется процентом успеха задачи в разнообразных условиях, а не только на демонстрациях обучения. Основная задача обучения робота — обучение политик, которые надежно обобщаются за пределы их распределения обучения. Смотрите это на практике: наши оценки в реальном мире →

Related terms