Назад к Glossary

Клонирование поведения (BC)

Imitation LearningSupervised Learning

Клонирование поведения — это простейшая форма обучения подражанием: задача контролируемой регрессии, где политика обучается имитировать демонстрации эксперта путем минимизации ошибки предсказания между выходом политики и действием эксперта в каждом наблюдаемом состоянии. BC легко реализуется и хорошо масштабируется с данными, но страдает от сдвига распределения — поскольку она никогда не получает корректирующей обратной связи, небольшие ошибки приводят робота в состояния, отсутствующие в обучающих данных, что может привести к каскадному отказу задачи. Методы, такие как DAgger (Dataset Aggregation) и GAIL, были разработаны специально для решения проблемы накопления ошибок BC. Посмотрите это в действии: наш сервис сбора данных →

Related terms