Zurück zu Glossary

DINOv2

MLVisionRepresentation Learning

Ein selbstüberwachtes Vision-Transformer-Modell, das von Meta auf einem kuratierten Datensatz von 142M Bildern mit einem Selbstdestillationsziel trainiert wurde. DINOv2 lernt leistungsstarke visuelle Darstellungen ohne Beschriftungen. Seine Merkmale übertragen sich gut auf Robotik-Aufgaben — Manipulationspolitiken mit eingefrorenen DINOv2-Encodern erreichen starke Leistung mit minimalem Fine-Tuning auf Roboterdaten.

Related terms