CLIP
कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग — OpenAI द्वारा 400M इमेज-टेक्स्ट जोड़ियों पर प्रशिक्षित एक मॉडल जो संरेखित दृश्य और भाषाई प्रतिनिधित्व सीखता है। CLIP एम्बेडिंग्स रोबोटिक्स में खुली-शब्दावली वस्तु पहचान, भाषा-संचालित हेरफेर, और पुरस्कार विनिर्देश के लिए उपयोग की जाती हैं। RT-2 और SayCan जैसे VLA मॉडल भाषा आदेशों को रोबोटिक क्रियाओं में आधार देने के लिए CLIP-शैली दृष्टि-भाषा संरेखण का लाभ उठाते हैं।







