CLIP
التدريب المسبق على التباين بين اللغة والصورة — نموذج تم تدريبه بواسطة OpenAI على 400 مليون زوج صورة-نص لتعلم التمثيلات البصرية واللغوية المتوافقة. يتم استخدام تضمينات CLIP في الروبوتات للكشف عن الأجسام بمفردات مفتوحة والمعالجة المشروطة باللغة وتحديد المكافآت. تستفيد نماذج VLA مثل RT-2 و SayCan من محاذاة رؤية-لغة بأسلوب CLIP لتأسيس أوامر اللغة في الإجراءات الروبوتية.







