VLA
विजन-लैंग्वेज-एक्शन मॉडल — एक फाउंडेशन मॉडल जो दृश्य अवलोकन और भाषा निर्देशों को इनपुट के रूप में लेता है और सीधे रोबोट एक्शन आउटपुट करता है। VLA दृष्टि, भाषा समझ, और नियंत्रण को एक एकल तंत्रिका नेटवर्क में एकीकृत करते हैं। उदाहरणों में RT-2, OpenVLA, Octo, और π0 शामिल हैं। VLA रोबोटिक्स में सामान्यवादी रोबोट सीखने की वर्तमान सीमांत का प्रतिनिधित्व करते हैं, जिसका लक्ष्य रोबोटिक्स के लिए 'GPT क्षण' होना है।







