Назад к Glossary

DINOv2

MLVisionRepresentation Learning

Самоконтролируемая модель vision transformer, обученная Meta на тщательно отобранном наборе данных из 142M изображений с использованием цели самодистилляции. DINOv2 учится мощным визуальным представлениям без каких-либо меток. Её признаки хорошо переносятся на задачи робототехники — политики манипуляции, использующие замороженные кодировщики DINOv2, достигают сильной производительности с минимальной тонкой настройкой на данных робота.

Related terms