VLA
Modelo Vision-Language-Action — um modelo fundamental que recebe observações visuais e instruções em linguagem natural como entrada e produz diretamente ações de robô. VLAs unificam percepção, compreensão de linguagem e controle em uma única rede neural. Exemplos incluem RT-2, OpenVLA, Octo e π0. VLAs representam a fronteira atual do aprendizado de robôs generalistas, visando ser o 'momento GPT' para robótica.







