Retour à Glossary

DINOv2

MLVisionRepresentation Learning

Un modèle de vision transformer auto-supervisé entraîné par Meta sur un ensemble de données organisé de 142M d'images en utilisant un objectif d'auto-distillation. DINOv2 apprend des représentations visuelles puissantes sans aucune étiquette. Ses caractéristiques se transfèrent bien aux tâches de robotique — les politiques de manipulation utilisant des encodeurs DINOv2 gelés obtiennent de bonnes performances avec un ajustement fin minimal sur les données de robot.

Related terms