Назад к Glossary

Стохастическая политика управления

Robot LearningRLPolicy

Политика управления, которая выводит распределение вероятностей над действиями (вместо одного детерминированного действия), позволяя исследование и обработку алеаторической неопределённости. Гауссовские политики (среднее + диагональная ковариация) являются стандартом в методах градиента политики RL. Diffusion Policy и политики нормализующих потоков расширяют возможности до более сложных распределений действий. Стохастические политики необходимы для RL с максимальной энтропией (SAC).

Related terms