Volver a Glossary

Modelo Fundamental

Robot LearningVision-Language

Una red neuronal a gran escala pre-entrenada en datos amplios (texto de internet, imágenes, videos) que puede adaptarse a tareas posteriores con ajuste fino mínimo. En robótica, los modelos fundamentales proporcionan representaciones visuales (DINOv2), anclaje de lenguaje (CLIP, LLMs), modelos del mundo (predicción de video) y generan directamente acciones de robot (VLAs como RT-2, OpenVLA, π0). Prometen amortizar el costo de datos del aprendizaje entre tareas y encarnaciones.

Related terms