Vision Transformer
ארכיטקטורת סיווג תמונות המחלקת תמונות לתיקיות בגודל קבוע, משדרת כל תיקייה באופן ליניארי, מוסיפה קידוד מיקום, ומעבדת את הרצף עם מקודד Transformer סטנדרטי. ViT הפך לעמוד השדרה הוויזואלי הדומיננטי, וחרג מ-CNNs כאשר הוא הוכשר על מערכי נתונים גדולים. וריאנטים של ViT (DeiT, Swin, DINOv2) הם המקודדים הוויזואליים ברירת המחדל בדגמי VLA מודרניים.







