विजन ट्रांसफॉर्मर
एक छवि वर्गीकरण आर्किटेक्चर जो छवियों को निश्चित आकार के पैच में विभाजित करता है, प्रत्येक पैच को रैखिक रूप से एम्बेड करता है, स्थितीय एन्कोडिंग जोड़ता है, और अनुक्रम को मानक Transformer एन्कोडर के साथ प्रोसेस करता है। ViT बड़े डेटासेट पर पूर्व-प्रशिक्षित होने पर CNNs को पार करते हुए प्रमुख दृश्य बैकबोन बन गया है। ViT वेरिएंट (DeiT, Swin, DINOv2) आधुनिक VLA मॉडल में डिफ़ॉल्ट दृश्य एन्कोडर हैं।







