Условное обучение имитации
Расширение клонирования поведения, где политика управления обусловлена высокоуровневыми командами или целями в дополнение к наблюдениям. Например, политика навигации может принимать целевое изображение или языковую инструкцию в качестве входных данных наряду с текущим кадром камеры. Это позволяет одной политике управления выполнять несколько поведений в зависимости от сигнала обусловливания.







