Retour à Glossary

VLA (Modèle Vision-Langage-Action)

Foundation ModelLanguageCore Concept

Un modèle Vision-Langage-Action est un réseau de neurones qui traite conjointement les observations visuelles (images RGB), les instructions en langage naturel et la proprioception du robot pour produire des sorties d'action. Les VLA étendent les grands modèles vision-langage (VLM tels que PaLM-E, LLaVA ou Gemini) en ajoutant une tête d'action — entraînant le modèle à produire des positions articulaires du robot ou des deltas d'effecteur final aux côtés de ses prédictions de langage. Les VLA notables incluent RT-2 (tokenise les actions comme des jetons de texte et affine un VLM), OpenVLA (open-source, 7B paramètres, entraîné sur Open X-Embodiment) et pi0 (VLA de flow-matching de Physical Intelligence). Voir l'article VLA et VLM et le catalogue de modèles RCSV. Voir cela en pratique : nos évaluations en monde réel →

Related terms