DINOv2
Un modelo de transformador de visión autosupervisado entrenado por Meta en un conjunto de datos curado de 142M imágenes usando un objetivo de autodestilación. DINOv2 aprende representaciones visuales poderosas sin etiquetas. Sus características se transfieren bien a tareas de robótica — políticas de manipulación que usan codificadores DINOv2 congelados logran un desempeño sólido con ajuste fino mínimo en datos de robot.







