फाउंडेशन मॉडल
एक बड़े पैमाने पर तंत्रिका नेटवर्क जो व्यापक डेटा (इंटरनेट पाठ, छवियां, वीडियो) पर पूर्व-प्रशिक्षित है जिसे न्यूनतम फाइन-ट्यूनिंग के साथ डाउनस्ट्रीम कार्यों के लिए अनुकूलित किया जा सकता है। रोबोटिक्स में, फाउंडेशन मॉडल दृश्य प्रतिनिधित्व (DINOv2), भाषा ग्राउंडिंग (CLIP, LLMs), विश्व मॉडल (वीडियो भविष्यवाणी), और सीधे रोबोट क्रियाएं आउटपुट करते हैं (VLAs जैसे RT-2, OpenVLA, π0)। वे कार्यों और अवतारों में सीखने की डेटा लागत को परिशोधित करने का वादा करते हैं।







