חזרה לGlossary

VLA (מודל Vision-Language-Action)

Foundation ModelLanguageCore Concept

מודל Vision-Language-Action הוא רשת עצבית המעבדת בו-זמנית תצפיות ויזואליות (תמונות RGB), הוראות בשפה טבעית, וקנייניות רובוט כדי לייצר פלטי פעולה. VLAs מרחיבים מודלי vision-language גדולים (VLMs כמו PaLM-E, LLaVA, או Gemini) על ידי הוספת ראש פעולה — הכשרת המודל לפלט מיקומי מפרקים של רובוט או דלתא של אפקטור קצה לצד חיזויי השפה שלו. VLAs בולטים כוללים RT-2 (מטוקנן פעולות כאסימוני טקסט ומכוונן דק של VLM), OpenVLA (קוד פתוח, 7B פרמטרים, הוכשר על Open X-Embodiment), ו-pi0 (ה-VLA של Physical Intelligence עם flow-matching). ראה את המאמר VLA ו-VLM וקטלוג הדגמים של RCSV. ראה זאת בפועל: ההערכות שלנו בעולם האמיתי →

Related terms