VLA Models(으)로 돌아가기

최고의 VLA 모델 2026: 완전한 시각 언어 행동 가이드

2026년 로봇기술에 대한 8개의 최고의 비전 언어 행동 모델은 OpenVLA, Octo, pi0, RT-X, 디프루전 정책, ACT

2026년에 실제로 추천하는 8가지 비전 언어 행동 및 모방 학습 모델은 라이선스, 하드웨어 발자국, 언어 충실성, 생산 배포에 대한 정직한 노트와 함께 적합합니다.

업데이트 2026년 4월 8 모델 순위 오픈 웨이트 우선 순위

모든 모델을 탐색 추천을 얻으십시오

TL;DR 2026년 최고의 선택, 순위: 1. OpenVLA (최고의 종합 오픈 웨이트 VLA) · 2. Octo (최고의 컴팩트 디스포지션 정책) · 3. pi0 (최고의 물리 지능 출시) · 4. RT-1-X (최고의 작은 역사 기반) · 5. 디스포지션 정책 (다모달 디모를 위한 가장 좋은 모방 학습 알고리즘) · 6. ACT (다동형 텔레오프에 가장 좋은) · 7. InternVLA-M1 (상위 공간 지형 VLA 상하이 인공지능 연구소) · 8. SmolVLA (레로봇 아래 가장 좋은 가벼운 VLA).

2026년에 VLA 모델이 "최고"가 되는 것은 무엇일까요?

VLA 풍경은 빠르게 성숙되었습니다. 2 년 전, "최고"는 "아무것도 작동하는 모델"을 의미했습니다. 오늘날, OpenVLA, Octo, pi0, InternVLA-M1 및 열두 가지 연구 변종이 모두 개방형 중량을 배포하고 있습니다. 문제는 어떤 모델이 your 배포에 적합합니까? 우리는 5 가지 실용적인 축을 통해 모델을 순위합니다:

  • ** 오픈 웨이트& 라이선스*** 다운로드 받아 정비하고 상업적으로 배송할 수 있나요? MIT와 Apache 2.0는 안전한 라이선스입니다.
  • 하드웨어 발자국 A100, A4090, Edge Box에서 작동하는 것이지요.
  • ** 언어 충실성.** 훈련 시간 문장과 자유형 명령어를 얼마나 잘 따르는가?
  • ** 정교한 조정 비용.** 하루 동안 로봇에 적응할 수 있나요? 아니면 다원형 훈련이 필요합니까?
  • ** 생산 성숙.** 로라 레시피, 양자 변형 및 배가 수정하는 커뮤니티가 있습니까?

2026년 순위

  1. OpenVLA 최고의 오픈 웨이트 기반 VLA

7B 파라마스MITOpen X-EmbodimentA100급 GPU

2026년 기본 VLA. 라마-2 7B 척추, DINOv2 + SigLIP 비전, 디스크레티즈한 액션 토큰, 970K 오픈 X-Embodiment 궤도에 훈련. 7× 적은 매개 변수로 LIBERO에서 RT-2-X를 능가한다. 활발한 커뮤니티 배포 LoRA 어댑터 및 양자 변종. [OpenVLA 모델 페이지] (T2) 또는 [OpenVLA vs Octo 비교] (T3) 참조).

  1. Octo 최고의 콤팩트 디스퍼시션 VLA

27M / 93MMITOpen X-Embodiment소비자 GPU

트랜스포머 전파 정책은 ~800K 오픈 X 궤도에서 처음부터 훈련되었습니다. 단일 RTX 4090에서 2030 Hz에서 실행됩니다. 유연한 액션 공간, 목표 이미지 컨디션 및 간단한 미세 조정. 7B 모델을 감당할 수 없을 때 얇은 대안입니다. [Octo]

  1. pi0 (물리적 지능)

수십억원 일부 공개공개

피시컬 인텔리전스의 대표적인 일반리스트 VLA는 흐름에 맞는 액션 헤드와 숙련된, 긴 지평선 작업에 초점을 맞추는 것을 도입했습니다. 스택과 체크포인트의 일부가 지역 사회에 공개되었습니다. 출판된 데모에서 세탁과 가계급 조작에 강력합니다. 어떤 숙련된 또는 인형 배포를 위해 지켜봐야 할 모델입니다.

  1. RT-1-X 가장 작은 역사적인 기준

~ 35MApache 2.0Open X-Embodiment 단일 GPU

RT-1의 오픈 X-Embodiment 재교육. 작고 빠르고, 크로스-인체. 연구 논문들을 위한 믿을 수 있는 가벼운 기준. 제품 배포를 위해, Octo 을 선호하지만 RT-1-X는 kanonical historical reference로 남아 있다. [RT-X]T5 참조).

  1. 방출 정책 다모달 디모를 위한 최고의 모방 학습

CNN/트랜스포머 척추MITDDPM 액션 헤드

콜롬비아의 퍼포먼스 정책은 전문가 시범이 다모달이 될 때 기본 기준입니다. 출판 시 이전 모방 학습 방법보다 평균 46.9% 향상. 접촉 부적 인 조작 및 평균 전략이 행동 붕괴되는 모든 환경에 자연적으로 적합합니다. [ 퍼포먼스 정책]T6) 또는 우리의 [ 퍼포먼스 정책과 ACT 비교]T7 참조.

  1. ACT 쌍방향 텔레오프에서 가장 좋은 모방 학습

CVAE 트랜스포머MITA 액션 쪼개림

모바일 ALOHA에서. 시간적 집합을 가진 조각된 행동 예측. 단일 GPU에서 분자 내에 열차, 50 개 이상의 시범과 함께 작동하며, 쌍방향 텔레오프 훈련의 지배적인 출발점으로 남아 있습니다. 레로봇에서 참조 정책으로 배포되었습니다. [ACT 정책 설명](T8 참조).

  1. InternVLA-M1 최고의 공간적으로 지형 개방형 VLA

오픈 웨이트SITGrounding + 액션

상하이 AI 연구소의 2단계 VLA는 행동 예측 전에 공간 지형을 중간 표현으로 사용합니다. 구글 로봇에서 7181%와 LIBERO에서 95.9%를보고, 2025년에 발표된 가장 강력한 오픈 웨이트 숫자 중 하나입니다. [InternVLA-M1]T9 참조.

  1. SmolVLA 레로봇 생태계의 가장 가벼운 VLA

450MAPAche 2.0 얼굴

그링 페이스의 컴팩트 VLA는 레로봇 프레임워크에 의해 출시되었습니다. 노트북과 취미급 로봇에서 실행하도록 설계되었으며, 레로봇의 파이프라인을 통해 통합된 데이터 로딩 및 훈련을 통해 실행됩니다. 데이터 센터 GPU 없이 실행되는 VLA를 원한다면 좋은 입점입니다. [레로봇]T10 참조.

편의 간략한 설명

Model Params License Action head Hardware Best for
OpenVLA 7B MIT Discretized tokens A100/H100 Language-grounded manipulation
Octo 27M / 93M MIT Diffusion RTX 4090 Cross-embodiment, high freq
pi0 Multi-B Partial Flow matching Multi-GPU Dexterous long-horizon
RT-1-X ~35M Apache 2.0 Discretized tokens Single GPU Small historical baseline
Diffusion Policy Configurable MIT DDPM chunks Single GPU Multi-modal imitation
ACT Configurable MIT CVAE chunks Single GPU Bimanual teleop
InternVLA-M1 Open MIT Grounded action A100 Spatially precise tasks
SmolVLA 450M Apache 2.0 Chunked Laptop GPU Hobby / edge robots

배포에 대한 선택 방법

솔직한 대답은 2026년 대부분의 팀들이 2 모델을 실행한다는 것입니다. 언어에서 작업에 대한 전면으로 VLA 기반을 운영하고, 정확한 행동 헤드로서 좁은 모방 학습 정책을 수행합니다. OpenVLA + 퍼포시전 정책 또는 Octo + ACT는 일반적인 조합입니다. 작업 유형과 하드웨어에 대한 결정 트리를 위해 [로봇 모델을 선택하는 방법]에 대한 우리의 지침을 참조하십시오.

만약 당신이 여전히 텔레오프 데이터를 수집하고 있다면, 우리의 [텔레오퍼레이션 데이터 서비스] (T12) 데모 형식은 알고리즘 선택보다 더 중요합니다. 이미 예시를 가지고 있다면, 형식을 가지고 우리에게 메모를 남겨주십시오. 그리고 우리는 위의 8가지 모델 중 어느 것을 시작해야 하는지 알려줄 것입니다.

2024년과 2026년 사이에 어떤 변화가 있었을까요?

3가지 변화가 현재의 VLA 풍경을 정의한다. 첫째, ** 오픈 웨이트는 폐쇄적인 웨이트를 잡았다**. 2023년 대화는 RT-2 및 기타 독점적인 딥마인드 모델이 지배했다. 2026년까지 OpenVLA, Octo, pi0 부분 발매, 그리고 InternVLA-M1은 함께 제작팀이 실제로 사용하는 대부분의 기능을 포함합니다. 폐쇄된 모델들은 여전히 국경에서 선두를 달리고 있지만, 배치 가능한 개방된 체크포인트의 격차는 크게 줄어들었다.

둘째, 이미테이션 학습 원시들은 기초 모델 척추가 되었다. 디푸지언 폴리시의 액션 헤드 는 이제 오ક્ટો 안에 있다. ACT의 쪼개고 집합하는 전략은 전 분야에 표준이다. "연구 IL"와 "배포 VLA" 사이의 깨끗한 분단은 각 계층이 아래 계층에서 트릭을 빌려가는 계층 스택으로 흐려졌다.

셋째, 데이터는 병목이 되었다. 이렇게 많은 திறமையான 오픈 모델이 있어서, 차별화는 자신의 텔레오프 코퍼스의 품질과 커버리입니다. 2025년까지 정통한 데이터 수집에 투자한 팀들은 일관된 카메라 배치, 깨끗한 해설, 하위 작업의 합리적인 분류학이 데이터를 후시로 취급한 팀보다 훨씬 더 나은 하류 미세 음을 풀어냈다. 우리의 [자리 수집] (T13) 및 [조명] (T14) 서비스는 바로 실제 레버리지가 살고 있는 곳이기 때문입니다.

명실상부한 모델들은 의도적으로 목록에서 제외되었습니다.

모든 설문 조사에서 몇 가지 모델이 등장하지만 2026 년에는 8 칸의 랭킹을 얻지 못했습니다. 로보 플라밍고와 브리지VLA는 연구 주목을 받고 있지만 위 표보다 배포 범위가 좁습니다. RT-2-X는 다운로드 할 수 없으므로 실제로 사용할 수있는 모델에 비해 순위를 할 수 없습니다. 쌍둥이 로봇 및 다른 딥마인드 후계자는 닫힌다. 여러 상업 연구소에서 제공되는 독점적인 제안은 흥미롭지만 특정 클라우드 엔드포인트에 잠겨 있습니다

이 중 어느 하나 가 우리의 8 개 로서 보다 더 잘 사용 된 경우, 우리는 당신이 순위 한 것 보다 올바른 모델을 선택 하는 것을 선호 합니다. 위의 순위는 median 팀의 필요를 반영 합니다.

자주 묻는 질문

비전 언어 행동 (VLA) 모델은 무엇입니까?

비전 언어 행동 (VLA) 모델은 카메라 이미지 및 자연어 명령어를 흡수하고 로봇 동작 (관동 또는 최종 효과 명령) 을 생성하는 신경 네트워크입니다. 현대 VLA는 일반적으로 Llama-2, PaLI-X와 같은 큰 비전 언어 척추 또는 지속적인 제어 출력을 분비하거나 전파하는 액션 헤드와 전용 트랜스포머를 결합합니다. OpenVLA, Octo, RT-2-X는 정통적인 예입니다.

2026년에 어떤 VLA 모델로 시작해야 할까요?

2026년 대부분의 오픈소스 팀에게는 OpenVLA (7B, MIT 라이선스, 오픈 X-Embodiment에서 훈련) 가 기본 출발점이다. 소비자 하드웨어에 배포하고 있다면, Octo-Base (93M) 는 더 가벼운 대안이다. 텔레오프 데이터에서 순수한 모방 학습을 하고 있다면, 쌍방향 작업에 ACT 또는 다방향 단일 팔 작업에 대한 전파 정책으로 시작하십시오.

OpenVLA를 실행하려면 어떤 하드웨어가 필요할까요?

bfloat16의 OpenVLA는 대략 16 GB의 GPU 메모리가 필요합니다. 실제에서는 팀들이 A100 (40 또는 80 GB), H100 또는 L40S를 510 Hz에서 실시간 추론을 위해 1 개 A100 (40 또는 80 GB), H100 또는 L40S에 배포합니다. 4 비트 양자 변종은 제한된 속도 페널티가있는 24 GB RTX 4090에서 실행될 수 있습니다. 가장자리 배포는 일반적으로 Octo 또는 더 작은 정제 정책을 선호합니다.

RT-X 모델 중량은 사용 가능할까요?

RT-1-X 웨이트는 Apache 2.0 아래 출시되며 Hugging Face에 있습니다. RT-2-X 웨이트는 공개되지 않으며 Google DeepMind 외부에서 사용할 수 없습니다. 이 때문에 RT-2- 클래스 행동을 원하는 대부분의 실용적인 배포는 MIT 라이선스로 공개되어 있는 OpenVLA를 사용합니다.

VLA 모델을 제 데이터에 맞춰 조정할 수 있나요?

네. OpenVLA는 LoRA와 새로운 로봇이나 작업에 몇 시간 내에 정책을 조정하는 완전한 미세조절 레시피를 탑재합니다. Octo는 단일 24 GB GPU에서 완전한 미세조정을 지원합니다. ACT 및 디스푸지언 정책은 일반적으로 50200의 텔레오프 시범에서 처음부터 훈련되어 기초 모델이 전혀 필요하지 않습니다. RCSV의 텔레오퍼레이션 데이터 서비스는 시범 자료를 수집하는 데 도움이 될 수 있습니다.

** 관련 읽기** OpenVLA vs Octo → RT-X vs OpenVLA → 방산 정책 vs ACT → VLA 모델 디렉토리 → 오픈 X-Embodiment 데이터 세트 → LIBERO 벤치마크 → [Teleop 데이터 수집 →]T21)

여기 있는 모든 VLA는 여러분의 직접적인 시위에 맞춰 조정될 수 있습니다.

Demos 수집 → 하드웨어 실행 → 정책 점수를 →