חזרה לGlossary

Vision Transformer

MLVisionTransformer

ארכיטקטורת סיווג תמונות המחלקת תמונות לתיקיות בגודל קבוע, משדרת כל תיקייה באופן ליניארי, מוסיפה קידוד מיקום, ומעבדת את הרצף עם מקודד Transformer סטנדרטי. ViT הפך לעמוד השדרה הוויזואלי הדומיננטי, וחרג מ-CNNs כאשר הוא הוכשר על מערכי נתונים גדולים. וריאנטים של ViT (DeiT, Swin, DINOv2) הם המקודדים הוויזואליים ברירת המחדל בדגמי VLA מודרניים.

Related terms