返回Glossary

CLIP

Robot LearningVision-Language

对比语言-图像预训练——由 OpenAI 在 400M 图像-文本对上训练的模型,用于学习对齐的视觉和语言表示。CLIP 嵌入在机器人学中用于开放词汇对象检测、语言条件操纵和奖励规范。VLA 模型如 RT-2 和 SayCan 利用 CLIP 风格的视觉-语言对齐来将语言命令接地到机器人动作。

Related terms