DINOv2
Um modelo vision transformer auto-supervisionado treinado pela Meta em um conjunto de dados curado de 142M imagens usando um objetivo de auto-destilação. DINOv2 aprende representações visuais poderosas sem rótulos. Suas características transferem bem para tarefas de robótica — políticas de manipulação usando codificadores DINOv2 congelados alcançam desempenho forte com ajuste fino mínimo em dados de robô.







