VLA (Modelo Vision-Language-Action)
Un modelo Vision-Language-Action es una red neuronal que procesa conjuntamente observaciones visuales (imágenes RGB), instrucciones en lenguaje natural y propiocepción de robot para producir salidas de acción. Los VLA extienden modelos grandes de visión-lenguaje (VLM como PaLM-E, LLaVA o Gemini) añadiendo una cabeza de acción — entrenando el modelo para producir posiciones de articulaciones de robot o deltas de efector final junto con sus predicciones de lenguaje. Los VLA notables incluyen RT-2 (tokeniza acciones como tokens de texto y ajusta un VLM), OpenVLA (código abierto, 7B parámetros, entrenado en Open X-Embodiment) y pi0 (VLA de flow-matching de Physical Intelligence). Véase el artículo VLA y VLM y el catálogo de modelos RCSV. Véalo en la práctica: nuestras evaluaciones en el mundo real →







