Retour à Glossary

VLA

Robot LearningVLAVision-Language

Modèle Vision-Langage-Action — un modèle de fondation qui prend des observations visuelles et des instructions en langage naturel en entrée et produit directement des actions de robot. Les VLA unifient la perception, la compréhension du langage et le contrôle dans un seul réseau de neurones. Les exemples incluent RT-2, OpenVLA, Octo et π0. Les VLA représentent la frontière actuelle de l'apprentissage robotique généraliste, visant à être le « moment GPT » de la robotique.

Related terms