RT-2
روبوتيكس ترانسفورمر 2 — نموذج VLA من Google DeepMind يقوم بضبط نموذج رؤية-لغة كبير (PaLI-X أو PaLM-E) لإخراج إجراءات الروبوت كرموز نصية. يوضح RT-2 أن التدريب المسبق على نطاق الإنترنت يمكّن الروبوتات من اتباع تعليمات لغوية جديدة والتعميم على الأجسام والسيناريوهات غير المرئية. يمثل نموذج معالجة التنبؤ بإجراء الروبوت كمشكلة نمذجة رؤية-لغة.







