العودة إلى Glossary

VLA (نموذج الرؤية واللغة والعمل)

Foundation ModelLanguageCore Concept

نموذج الرؤية واللغة والعمل هو شبكة عصبية تعالج بشكل مشترك الملاحظات البصرية (صور RGB) وتعليمات اللغة الطبيعية والحس الملكي للروبوت لإنتاج مخرجات الإجراء. توسع نماذج VLA نماذج الرؤية واللغة الكبيرة (VLMs مثل PaLM-E و LLaVA أو Gemini) بإضافة رأس عمل — تدريب النموذج على إخراج مواضع المفاصل الروبوتية أو دلتا المؤثر النهائي جنباً إلى جنب مع تنبؤاته اللغوية. تتضمن نماذج VLA البارزة RT-2 (يرمز الإجراءات كرموز نصية ويضبط بدقة VLM) و OpenVLA (مفتوح المصدر، 7 مليارات معامل، مدرب على Open X-Embodiment) و pi0 (VLA لمطابقة التدفق من Physical Intelligence). انظر مقالة VLA و VLM وكتالوج نموذج RCSV. انظر هذا عملياً: تقييماتنا في العالم الحقيقي →

Related terms