VLA (نموذج الرؤية واللغة والعمل)
نموذج الرؤية واللغة والعمل هو شبكة عصبية تعالج بشكل مشترك الملاحظات البصرية (صور RGB) وتعليمات اللغة الطبيعية والحس الملكي للروبوت لإنتاج مخرجات الإجراء. توسع نماذج VLA نماذج الرؤية واللغة الكبيرة (VLMs مثل PaLM-E و LLaVA أو Gemini) بإضافة رأس عمل — تدريب النموذج على إخراج مواضع المفاصل الروبوتية أو دلتا المؤثر النهائي جنباً إلى جنب مع تنبؤاته اللغوية. تتضمن نماذج VLA البارزة RT-2 (يرمز الإجراءات كرموز نصية ويضبط بدقة VLM) و OpenVLA (مفتوح المصدر، 7 مليارات معامل، مدرب على Open X-Embodiment) و pi0 (VLA لمطابقة التدفق من Physical Intelligence). انظر مقالة VLA و VLM وكتالوج نموذج RCSV. انظر هذا عملياً: تقييماتنا في العالم الحقيقي →







