Glossary(으)로 돌아가기

VLA (Vision-Language-Action Model)

Foundation ModelLanguageCore Concept

시각-언어-행동 모델은 시각 관찰(RGB 이미지), 자연어 지시, 로봇 고유감각을 함께 처리하여 행동 출력을 생성하는 신경망입니다. VLA는 대규모 시각-언어 모델(PaLM-E, LLaVA, Gemini 같은 VLM)을 확장하여 행동 헤드를 추가합니다 — 모델이 언어 예측과 함께 로봇 관절 위치 또는 엔드 이펙터 델타를 출력하도록 학습합니다. 주목할 만한 VLA로는 RT-2(행동을 텍스트 토큰으로 토큰화하고 VLM을 미세 조정), OpenVLA(오픈소스, 7B 파라미터, Open X-Embodiment로 학습), pi0(Physical Intelligence의 흐름 매칭 VLA)이 있습니다. VLA와 VLM 문서 및 RCSV 모델 카탈로그를 참조하세요. 실제 사례: 우리의 실제 환경 평가 →

Related terms