Zurück zu Glossary

VLA (Vision-Language-Action-Modell)

Foundation ModelLanguageCore Concept

Ein Vision-Language-Action-Modell ist ein neuronales Netzwerk, das visuelle Beobachtungen (RGB-Bilder), natürlichsprachliche Anweisungen und Roboter-Propriozeption gemeinsam verarbeitet, um Aktionsausgaben zu erzeugen. VLAs erweitern große Vision-Language-Modelle (VLMs wie PaLM-E, LLaVA oder Gemini) durch einen Action Head — das Modell wird trainiert, um Roboter-Gelenkpositionen oder End-Effektor-Deltas neben seinen Sprachvorhersagen auszugeben. Bemerkenswerte VLAs sind RT-2 (tokenisiert Aktionen als Texttoken und fine-tuned ein VLM), OpenVLA (Open-Source, 7B Parameter, trainiert auf Open X-Embodiment) und pi0 (Physical Intelligence's Flow-Matching-VLA). Siehe den VLA- und VLM-Artikel und den RCSV-Modellkatalog. Siehe dies in der Praxis: unsere Real-World-Evaluierungen →

Related terms