VLA Models(으)로 돌아가기

인턴VLA-M1

InternVLA-M1: 공간지휘 비전 언어 행동 프레임워크. 상하이 인공지능 연구소, InternRobotics. 71~81% 구글 로봇, 95.9% LIBERO.

[← 모델]

공간지휘 비전 언어 행동 프레임워크 일반주의 로봇 정책

전체적인 설명

InternVLA-M1는 두 단계의 파이프라인을 사용합니다: (1) 2.3M 샘플에 대한 공간 지형 사전 훈련 "무엇을 행동해야 하는가"를 결정하기 위해, (2) "무엇을 행동해야 하는가"에 대한 공간 지향적인 행동 후 훈련.

기준

  • ** 구글 로봇** 71.7% (WidowX), 76.0% (VM), 80.7% (VA)
  • LIBERO 95.9%의 성공
  • +14.6%는 SimplerEnv, +20.6%는 합성 공동 훈련으로 보이지 않는 물체

공식 링크

인용

BibTeX 및 논문 참조를 위한 프로젝트 사이트 참조.

여기 있는 모든 VLA는 여러분의 직접적인 시위에 맞춰 조정될 수 있습니다.

디모를 수집하라 → 하드웨어가 실행되는 것 → 정책 점수를 →