Glossary पर वापस जाएं

Transformer दृश्य बैकबोन

VisionML

कंप्यूटर दृष्टि पाइपलाइन में सुविधा निष्कर्षण बैकबोन के रूप में Vision Transformer (ViT) का उपयोग करना। CNN बैकबोन की तुलना में, ViT बैकबोन स्व-ध्यान के माध्यम से छवि पैच के बीच दीर्घ-श्रेणी निर्भरता को मॉडल करते हैं, बड़े पैमाने पर डेटासेट पर बेहतर प्रदर्शन प्रदान करते हैं। वे आधुनिक पहचान (DINO-DETR), विभाजन (Mask2Former), और VLA मॉडल में डिफ़ॉल्ट बैकबोन हैं।

Related terms