DINOv2
Meta द्वारा प्रशिक्षित एक स्व-पर्यवेक्षित दृष्टि Transformer मॉडल जो 142M छवियों के एक क्यूरेटेड डेटासेट पर स्व-आसवन उद्देश्य का उपयोग करके प्रशिक्षित है। DINOv2 किसी भी लेबल के बिना शक्तिशाली दृश्य प्रतिनिधित्व सीखता है। इसकी विशेषताएं रोबोटिक्स कार्यों में अच्छी तरह से स्थानांतरित होती हैं — जमे हुए DINOv2 एनकोडर का उपयोग करने वाली हेरफेर नीतियां रोबोट डेटा पर न्यूनतम सूक्ष्म-ट्यूनिंग के साथ मजबूत प्रदर्शन प्राप्त करती हैं।







