VLA Models(으)로 돌아가기

RT-X vs OpenVLA: 로봇 기술 기반 모델을 비교

구글 딥마인드의 RT-X 가족과 OpenVLA 7B <unk> 아키텍처, Open-X 훈련, 라이선스, 액세스, 하드웨어 발자국, 그리고 어떤 기반 모델을 구축해야 하는지 비교하십시오.

구글 딥마인드의 RT-X 가족들은 로봇 제어의 기초 모델의 현재의 시대를 시작시켰습니다. OpenVLA는 모든 실험실에 접근 가능한 7B VLA를 만든 오픈 웨이트 카운터 리즈입니다. 여러분의 팀은 어떤 모델에 기반을 두어야 할까요?

2026년 4월 업데이트 오픈 웨이트 vs 클로즈드 오픈-X 트레이닝

모든 모델을 탐색 추천을 얻으십시오

TL;DR RT-X (RT-1-X 및 RT-2-X를 포함) 는 오픈 X-Embodiment에 훈련된 구글 딥마인드의 내부 액션 모델 가족이다. RT-1-X 체크포인트는 JAX/TF 코드와 함께 Apache 2.0 아래 출시되었다. RT-2-X 및 후속 모델은 독자적이며 외부 배포에 사용할 수 없습니다. OpenVLA는 RT-2-X가 폐쇄되었기 때문에 커뮤니티에 의해 특별히 구축된 7B MIT 라이선스 후속입니다.

왜 이 비교가 중요 한 이유

"RT-X"는 하나의 모델이 아니라 가족이며, 그 혼란은 많은 구매 대화를 죽인다. RT-1-X는 ~35M 파라미터 변수 정책입니다. 오픈 X-Embodiment의 저자들은 크로스-인체 전송을 입증하기 위해 훈련하고 오픈 소스를 사용했습니다. RT-2-X는 큰 멀티모달 모델이 로봇 제어 0 샷을 할 수 있음을 보여주었던 55B PaLI-X 기반 VLA입니다. RT-2-X는 결코 출시되지 않았고, 이후 딥마인드 모델 (Gemini Robotics, RT-H) 은 구글 내부에 남아 있었다. 만약 당신이 자신의 시스템의 기반으로 "RT-X"를 평가한다면, 당신은 실제로 무게, 코드, 어댑터와 함께 끝에서 끝으로 출판된 OpenVLA에 대한 RT-1-X 에 대해 평가하고 있다.

더 넓은 시선에 대해서는 VLA 모델 디렉토리, RT-X 페이지 또는 OpenVLA 페이지 를 참조하십시오.

눈치채기 위한 비교

Dimension RT-X family OpenVLA
Parameters RT-1-X ~35M · RT-2-X 55B (PaLI-X based) 7B
Backbone RT-1-X: EfficientNet + token learner + transformer. RT-2-X: PaLI-X multimodal LLM Llama-2 7B + DINOv2 + SigLIP
Action head Discretized action tokens (both variants) Discretized action tokens
Training data Open X-Embodiment (22 embodiments, ~970K traj) Open X-Embodiment (~970K traj)
Language conditioning Strong on RT-2-X, moderate on RT-1-X Strong (LLM-native)
Action space End-effector delta, configurable dim 7-DOF end-effector delta (extensible)
Inference hardware RT-1-X: single GPU. RT-2-X: multi-GPU inference cluster Single A100/H100/L40S bf16
Weights available? RT-1-X: yes. RT-2-X: no (proprietary) Yes, on Hugging Face
License RT-1-X: Apache 2.0. RT-2-X: closed MIT
Fine-tuning RT-1-X fine-tune supported. RT-2-X: no external access LoRA, QLoRA, and full fine-tune recipes published
Paper Open X-Embodiment paper (2023), RT-2 (arXiv:2307.15818) Kim et al., CoRL 2024 (arXiv:2406.09246)
Code github.com/google-deepmind/open_x_embodiment github.com/openvla/openvla

RT-X: 이 모든 것을 시작한 가족

RT-1-X 사용 가능한

RT-1-X는 구글의 원래 RT-1 아키텍처의 오픈 X-Embodiment 재교육입니다. 이 프로그램은 EfficientNet 시각 척추, FiLM 언어 컨디셔너, 토큰 학습자 및 미묘한 동작을 내포하는 트랜스포머입니다. 만약 여러분이 프랭카 또는 구글 로봇 팔을 이용한 모바일 조작을 하고 가벼운 기본값을 원한다면, RT-1-X는 2026년에도 믿을 수 있는 출발점으로 남아 있을 것입니다.

RT-2-X 당신이 가질 수 없는

RT-2-X는 구글이 동일한 오픈 X-Embodiment 데이터에 의해 훈련받은 PaLI-X 기반의 55B VLA입니다. 큰 VLM가 로봇 제어 기능을 수행할 수 있다는 논문을 세웠다. 하지만 무게는 결코 공개되지 않았습니다. 블로그 게시물에서 "RT-X 성능"을 읽으면 35M RT-1-X 또는 55B RT-2-X 을 의미하는지 확인하십시오. 두 가지 사이의 격차는 엄청납니다. RT-2-X는 게시된 참조이며, 배포 할 수있는 모델이 아닙니다.

오픈VLA: 오픈 답

오픈VLA는 오픈소스 커뮤니티에 대한 RT-2-X 격차를 해소하기 위해 명시적으로 구축되었습니다. 언어 전자를 캡처하기에 충분한 7B 매개 변수이며, 한 고급 GPU에 서비스하기에 충분히 작습니다. [OpenVLA 종이] (T5) 는 LIBERO-Spatial, LIBERO-Object, LIBERO-Goal, 그리고 BridgeData V2에서 7 × 적은 매개 변수를 사용해도 RT-2-X를 능가한다고 보고합니다. DINOv2 + SigLIP 비전 코더와 함께 Llama-2 7B LLM를 사용하여, 각 차원에 대한 동작을 256 개의 칸으로 분별하고, 동일한 오픈 X-Embodiment corpus RT-X 소리에 훈련됩니다.

건설업자들에겐 더 중요한 것은: OpenVLA는 로라 정비 레시피를 가지고 있습니다. 이 방법은 팀들이 새로운 로봇에 80 GB A100를 몇 시간 대신 몇 일 안에 적용할 수 있게 해줍니다.

허가 및 접근 문제

이것은 보통 결정적인 요소입니다. 아파시 2.0의 RT-1-X는 상업적 수준의이지만 오래되고 작습니다. RT-2-X는 전혀 라이선스 할 수 없습니다. MIT의 OpenVLA는 상업적으로 사용할 수 있는 패키지에 RT-2- 클래스 행동을 얻는 유일한 방법입니다. 2026년에 실제 로봇을 배포하는 팀들 특히 [하우스 배포] (T6) 또는 [랩 자동화] (T7) 은 명시적 권한이 필요한 설치들을 거의 항상 OpenVLA 또는 그 유통물 중 하나에 설치합니다.

하드웨어 발자국

RT-1-X는 단일 GPU에서 실시간 속도로 실행되며, 프랭카에서 구글 로봇까지의 다양한 로봇에서 입증되었습니다. 그것은 가벼운 옵션입니다. OpenVLA는 bfloat16에서 ~16 GB의 VRAM를 필요로하며 일반적으로 A100에서 양자화 없이 510 Hz에서 실행됩니다. 이는 대부분의 조작에 적합하지만 능숙한 제어에 tight입니다. 팀들은 종종 OpenVLA를 액션 킹과 낮은 수준의 임피던스 컨트롤러로 결합하여 필요한 루프 속도를 달성합니다. RT-2-X는 사용 가능하다면, 멀티GPU 추론 서버가 필요합니다.

RT-1-X가 여전히 합리적인 경우

  • 가장 작고 빠른 오픈-X 기본 라인을 원하고 언어에 대한 이해가 필요 없습니다.
  • 연구 논문에서 인체 간 전송을 비교하고 있고 역사적으로 기초한 기준을 원하고 있습니다.
  • 7B 모델이 실행이 불가능한 가장자리 하드웨어에서 실행됩니다.

OpenVLA가 명백한 선택이 될 때

  • RT-2 클래스 언어 행동을 실제로 다운로드 할 수있는 무게와 원하고 있습니다.
  • 상업적 면허가 필요합니다.
  • 지역사회에서 활발한 로라 어댑터, 양자 변종, 배포 레시피를 원해요
  • 당신은 자신의 텔레오프 데이터를 정비할 계획입니다. OpenVLA의 문서들은 하류 사용에 있어서 RT-X보다 실질적으로 더 낫습니다.

정직한 타협

오픈VLA는 RT-2-X보다 엄격히 "더 나은" 것이 아닙니다. DeepMind은 내부 모델을 RT-2-X를 훨씬 넘어 밀어붙이고 있으며, 구글의 생산 로봇 스택은 폐쇄 된 후손을 사용합니다. OpenVLA는 분명 RT-X 계통의 최고의 오픈 웨이트 기반 모델입니다. 당신이 어떤 비용으로 SOTA를 필요로하고 DeepMind과 파트너십을 할 수 있다면, 그것은 다른 대화입니다. 만약 여러분이 제품을 만들고 있다면, OpenVLA의 MIT 무게와 수파베이스에서 호스팅된 데이터 파이프라인과 [텔레오퍼레이션 데이터 수집] (T8) 은 오늘날 현실적인 스택입니다.

벤치마크 및 평가

두 모델 가족 모두 LIBERO, Google Robot, 그리고 RLBench 에 번호를 게시합니다. OpenVLA의 LIBERO 번호는 종이 안에 있으며 재생이 가능합니다. RT-X의 숫자는 변종에 따라 다릅니다. RT-X 행렬을 참고하십시오. 현재 스위트를 위해 벤치마크 디렉토리 를 참조하십시오.

RT-X를 포함하는 벤치마크 주장을 읽을 때 항상 세 가지 질문을하십시오. RT-X 변종 (RT-1-X 또는 RT-2-X), 오픈 X-Embodiment의 실시예 하위집단이 평가에 사용되었는지, 로봇이 구글의 실제 세계 WidowX 또는 외부 재생산인지. 이 선택에 따라 숫자는 20 퍼센트 점으로 변할 수 있습니다. OpenVLA 평가들은 일반적으로 해석하기 쉬워서 문서가 체크포인트, 프로토콜, 데이터셋 분할에 대해 명시적으로 설명하고 있습니다.

정렬 및 배포 요리법

RT-1-X와 일하는 하류 팀은 일반적으로 오픈 X-Embodiment 傘 내에서 좁은 작업 세트를 정렬하여 목표 구현에 관련된 궤도를 선택하고, 그 다음 특정 하드웨어에 정책을 끌어 올리기 위해 짧은 훈련 루프를 실행합니다. RT-1-X 교육 코드는 성숙하지만 생산 지침에 희소하며, 하류 지식의 대부분은 레시피보다는 논문에서 살고 있습니다.

OpenVLA의 정렬 스토리는 상당히 풍부하다. 공식 저장소는 LoRA 정렬 예제, 완전한 정렬 예제, 사용자 지정 RLDS 데이터 데이터 데이터 데이터 세트 변환 도구 및 여러 인기있는 로봇의 참조 구성을 배포합니다. 커뮤니티는 4 비트 양자화, vLLM 서비스 및 [LeRobot]와 통합을 추가했습니다. 한 달도 안 되는 시간 안에 "우리는 텔레오프 데이터를 가지고 있다"에서 "우리는 로봇에 대한 정책을 가지고 있다"로 전환해야 하는 팀에게는 OpenVLA의 도구가 결정적인 장점입니다.

다음으로 DeepMind이 선보이는 것은

구글 딥마인드는 내부적으로 RT-2-X를 반복해 왔습니다. 겐리 로봇과 관련 프로젝트는 더 큰 VLM와 생산 Google 로봇에 더 긴밀하게 결합한 기반 모델-로봇의 논문을 확장합니다. 이러한 체크포인트 중 어느 것도 외부 배포에 사용할 수 없습니다. 따라서 제작자의 관점에서 볼 때 그들은 읽기에 가치가 있지만 구축 가치가 없습니다. 오픈VLA, pi0 및 LeRobot 생태계 모델은 오픈소스 작업의 현실적인 발전 경로입니다.

우리의 권고

오늘날 거의 모든 실용적인 팀에게는 OpenVLA가 답입니다. 그것은 지적적으로 RT-X 계통을 계승하고, 공공 벤치마크에서 RT-2-X와 일치하거나 제치고, MIT에 따라 열린 무게를 가진 배이며, 활성 정렬 생태계를 가지고 있습니다. RT-1-X는 여전히 훌륭한 작은 기본 라인이지만, 당신은 2026 년에 그 역할에 대해 [Octo]T14) 또는 작은 전파 정책을 사용할 가능성이 높습니다. RT-2-X는 종이 참조입니다

** 관련 읽기** OpenVLA vs Octo → 방산 정책 vs ACT → 최고의 VLA 모델 2026 → 오픈 X-Embodiment 데이터 세트 → OpenVLA 모델 페이지 → RT-X 모델 페이지 →

여기 있는 모든 VLA는 여러분의 직접적인 시위에 맞춰 조정될 수 있습니다.

Demos 수집 → 하드웨어 실행 → 정책 점수를 →