Glossary पर वापस जाएं

VLA (विजन-लैंग्वेज-एक्शन मॉडल)

Foundation ModelLanguageCore Concept

एक विजन-लैंग्वेज-एक्शन मॉडल एक तंत्रिका नेटवर्क है जो दृश्य अवलोकन (RGB छवियों), प्राकृतिक भाषा निर्देशों, और रोबोट प्रोप्रिओसेप्शन को संयुक्त रूप से प्रोसेस करके एक्शन आउटपुट उत्पन्न करता है। VLA बड़े विजन-लैंग्वेज मॉडल (VLM जैसे PaLM-E, LLaVA, या Gemini) को एक्शन हेड जोड़कर विस्तारित करते हैं — मॉडल को अपनी भाषा भविष्यवाणियों के साथ-साथ रोबोट जॉइंट पोजीशन या एंड-इफेक्टर डेल्टा आउटपुट करने के लिए प्रशिक्षित करते हैं। उल्लेखनीय VLA में RT-2 (एक्शन को टेक्स्ट टोकन के रूप में टोकनाइज करता है और VLM को फाइन-ट्यून करता है), OpenVLA (ओपन-सोर्स, 7B पैरामीटर, Open X-Embodiment पर प्रशिक्षित), और pi0 (Physical Intelligence का फ्लो-मैचिंग VLA) शामिल हैं। VLA और VLM लेख और RCSV मॉडल कैटलॉग देखें। व्यावहारिक रूप से देखें: हमारे वास्तविक-विश्व मूल्यांकन →

Related terms