Voltar para Glossary

Modelo Fundamental

Robot LearningVision-Language

Uma rede neural em larga escala pré-treinada em dados amplos (texto da internet, imagens, vídeos) que pode ser adaptada a tarefas posteriores com ajuste fino mínimo. Em robótica, modelos fundamentais fornecem representações visuais (DINOv2), ancoragem em linguagem (CLIP, LLMs), modelos de mundo (predição de vídeo) e saída direta de ações de robô (VLAs como RT-2, OpenVLA, π0). Eles prometem amortizar o custo de dados do aprendizado entre tarefas e encarnações.

Related terms