返回Glossary

VLA(视觉-语言-动作模型)

Foundation ModelLanguageCore Concept

视觉-语言-动作模型是一种神经网络,联合处理视觉观测(RGB图像)、自然语言指令和机器人本体感受,以产生动作输出。VLA通过添加动作头扩展大型视觉-语言模型(VLM,如PaLM-E、LLaVA或Gemini),训练模型在进行语言预测的同时输出机器人关节位置或末端执行器增量。著名的VLA包括RT-2(将动作标记化为文本令牌并微调VLM)、OpenVLA(开源,7B参数,在Open X-Embodiment上训练)和pi0(Physical Intelligence的流匹配VLA)。参见VLA和VLM文章以及RCSV模型目录。 实际应用:我们的真实世界评估 →

Related terms