VLA
Modelo Vision-Language-Action — un modelo fundamental que toma observaciones visuales e instrucciones en lenguaje natural como entrada y produce directamente acciones de robot. Los VLA unifican percepción, comprensión del lenguaje y control en una única red neuronal. Los ejemplos incluyen RT-2, OpenVLA, Octo y π0. Los VLA representan la frontera actual del aprendizaje de robots generalistas, con el objetivo de ser el 'momento GPT' para la robótica.







