Transformer दृश्य बैकबोन
कंप्यूटर दृष्टि पाइपलाइन में सुविधा निष्कर्षण बैकबोन के रूप में Vision Transformer (ViT) का उपयोग करना। CNN बैकबोन की तुलना में, ViT बैकबोन स्व-ध्यान के माध्यम से छवि पैच के बीच दीर्घ-श्रेणी निर्भरता को मॉडल करते हैं, बड़े पैमाने पर डेटासेट पर बेहतर प्रदर्शन प्रदान करते हैं। वे आधुनिक पहचान (DINO-DETR), विभाजन (Mask2Former), और VLA मॉडल में डिफ़ॉल्ट बैकबोन हैं।







