Vision Transformer
معمارية تصنيف الصور التي تقسم الصور إلى رقع ذات حجم ثابت، وتضمن كل رقعة خطياً، وتضيف ترميز الموضع، وتعالج التسلسل باستخدام محول ترميز قياسي. أصبح Vision Transformer العمود الفقري البصري السائد، متفوقاً على الشبكات العصبية الالتفافية عند التدريب المسبق على مجموعات بيانات كبيرة. متغيرات Vision Transformer (DeiT و Swin و DINOv2) هي المشفرات البصرية الافتراضية في نماذج VLA الحديثة.







