인턴VLA-M1
InternVLA-M1: 공간지휘 비전 언어 행동 프레임워크. 상하이 인공지능 연구소, InternRobotics. 71~81% 구글 로봇, 95.9% LIBERO.
[← 모델]
공간지휘 비전 언어 행동 프레임워크 일반주의 로봇 정책
전체적인 설명
InternVLA-M1는 두 단계의 파이프라인을 사용합니다: (1) 2.3M 샘플에 대한 공간 지형 사전 훈련 "무엇을 행동해야 하는가"를 결정하기 위해, (2) "무엇을 행동해야 하는가"에 대한 공간 지향적인 행동 후 훈련.
기준
- ** 구글 로봇** 71.7% (WidowX), 76.0% (VM), 80.7% (VA)
- LIBERO 95.9%의 성공
- +14.6%는 SimplerEnv, +20.6%는 합성 공동 훈련으로 보이지 않는 물체
공식 링크
- internrobotics.github.io/internvla-m1
프로젝트 사이트 - github.com/InternRobotics/InternVLA-M1
코드 (MIT) - [Hugging Face: InternRobotics]
T3 ) 모델과 데이터 세트
인용
BibTeX 및 논문 참조를 위한 프로젝트 사이트 참조.
여기 있는 모든 VLA는 여러분의 직접적인 시위에 맞춰 조정될 수 있습니다.







