Glossary पर वापस जाएं

फाउंडेशन मॉडल

Robot LearningVision-Language

एक बड़े पैमाने पर तंत्रिका नेटवर्क जो व्यापक डेटा (इंटरनेट पाठ, छवियां, वीडियो) पर पूर्व-प्रशिक्षित है जिसे न्यूनतम फाइन-ट्यूनिंग के साथ डाउनस्ट्रीम कार्यों के लिए अनुकूलित किया जा सकता है। रोबोटिक्स में, फाउंडेशन मॉडल दृश्य प्रतिनिधित्व (DINOv2), भाषा ग्राउंडिंग (CLIP, LLMs), विश्व मॉडल (वीडियो भविष्यवाणी), और सीधे रोबोट क्रियाएं आउटपुट करते हैं (VLAs जैसे RT-2, OpenVLA, π0)। वे कार्यों और अवतारों में सीखने की डेटा लागत को परिशोधित करने का वादा करते हैं।

Related terms