VLA (Modelo Vision-Language-Action)
Um modelo Vision-Language-Action é uma rede neural que processa conjuntamente observações visuais (imagens RGB), instruções em linguagem natural e propriocepção de robô para produzir saídas de ação. VLAs estendem modelos de visão-linguagem grandes (VLMs como PaLM-E, LLaVA ou Gemini) adicionando uma cabeça de ação — treinando o modelo para produzir posições de juntas de robô ou deltas de efetor final junto com suas previsões de linguagem. VLAs notáveis incluem RT-2 (tokeniza ações como tokens de texto e ajusta um VLM), OpenVLA (código aberto, 7B parâmetros, treinado em Open X-Embodiment) e pi0 (VLA de flow-matching da Physical Intelligence). Veja o artigo VLA e VLM e o catálogo de modelos RCSV. Veja isso na prática: nossas avaliações em mundo real →







