Volver a Glossary

CLIP

Robot LearningVision-Language

Contrastive Language-Image Pre-training — un modelo entrenado por OpenAI en 400M pares imagen-texto para aprender representaciones visuales y lingüísticas alineadas. Los embeddings de CLIP se utilizan en robótica para detección de objetos con vocabulario abierto, manipulación condicionada por lenguaje y especificación de recompensas. Los modelos VLA como RT-2 y SayCan aprovechan la alineación visión-lenguaje estilo CLIP para anclar comandos de lenguaje en acciones robóticas.

Related terms