Glossary पर वापस जाएं

विजन ट्रांसफॉर्मर

MLVisionTransformer

एक छवि वर्गीकरण आर्किटेक्चर जो छवियों को निश्चित आकार के पैच में विभाजित करता है, प्रत्येक पैच को रैखिक रूप से एम्बेड करता है, स्थितीय एन्कोडिंग जोड़ता है, और अनुक्रम को मानक Transformer एन्कोडर के साथ प्रोसेस करता है। ViT बड़े डेटासेट पर पूर्व-प्रशिक्षित होने पर CNNs को पार करते हुए प्रमुख दृश्य बैकबोन बन गया है। ViT वेरिएंट (DeiT, Swin, DINOv2) आधुनिक VLA मॉडल में डिफ़ॉल्ट दृश्य एन्कोडर हैं।

Related terms