RT-X vs OpenVLA: 로봇 기술 기반 모델을 비교
구글 딥마인드의 RT-X 가족과 OpenVLA 7B <unk> 아키텍처, Open-X 훈련, 라이선스, 액세스, 하드웨어 발자국, 그리고 어떤 기반 모델을 구축해야 하는지 비교하십시오.
구글 딥마인드의 RT-X 가족들은 로봇 제어의 기초 모델의 현재의 시대를 시작시켰습니다. OpenVLA는 모든 실험실에 접근 가능한 7B VLA를 만든 오픈 웨이트 카운터 리즈입니다. 여러분의 팀은 어떤 모델에 기반을 두어야 할까요?
2026년 4월 업데이트 오픈 웨이트 vs 클로즈드 오픈-X 트레이닝
TL;DR RT-X (RT-1-X 및 RT-2-X를 포함) 는 오픈 X-Embodiment에 훈련된 구글 딥마인드의 내부 액션 모델 가족이다. RT-1-X 체크포인트는 JAX/TF 코드와 함께 Apache 2.0 아래 출시되었다. RT-2-X 및 후속 모델은 독자적이며 외부 배포에 사용할 수 없습니다. OpenVLA는 RT-2-X가 폐쇄되었기 때문에 커뮤니티에 의해 특별히 구축된 7B MIT 라이선스 후속입니다.
왜 이 비교가 중요 한 이유
"RT-X"는 하나의 모델이 아니라 가족이며, 그 혼란은 많은 구매 대화를 죽인다. RT-1-X는 ~35M 파라미터 변수 정책입니다. 오픈 X-Embodiment의 저자들은 크로스-인체 전송을 입증하기 위해 훈련하고 오픈 소스를 사용했습니다. RT-2-X는 큰 멀티모달 모델이 로봇 제어 0 샷을 할 수 있음을 보여주었던 55B PaLI-X 기반 VLA입니다. RT-2-X는 결코 출시되지 않았고, 이후 딥마인드 모델 (Gemini Robotics, RT-H) 은 구글 내부에 남아 있었다. 만약 당신이 자신의 시스템의 기반으로 "RT-X"를 평가한다면, 당신은 실제로 무게, 코드, 어댑터와 함께 끝에서 끝으로 출판된 OpenVLA에 대한 RT-1-X
더 넓은 시선에 대해서는 VLA 모델 디렉토리, RT-X 페이지 또는 OpenVLA 페이지 를 참조하십시오.
눈치채기 위한 비교
| Dimension | RT-X family | OpenVLA |
|---|---|---|
| Parameters | RT-1-X ~35M · RT-2-X 55B (PaLI-X based) | 7B |
| Backbone | RT-1-X: EfficientNet + token learner + transformer. RT-2-X: PaLI-X multimodal LLM | Llama-2 7B + DINOv2 + SigLIP |
| Action head | Discretized action tokens (both variants) | Discretized action tokens |
| Training data | Open X-Embodiment (22 embodiments, ~970K traj) | Open X-Embodiment (~970K traj) |
| Language conditioning | Strong on RT-2-X, moderate on RT-1-X | Strong (LLM-native) |
| Action space | End-effector delta, configurable dim | 7-DOF end-effector delta (extensible) |
| Inference hardware | RT-1-X: single GPU. RT-2-X: multi-GPU inference cluster | Single A100/H100/L40S bf16 |
| Weights available? | RT-1-X: yes. RT-2-X: no (proprietary) | Yes, on Hugging Face |
| License | RT-1-X: Apache 2.0. RT-2-X: closed | MIT |
| Fine-tuning | RT-1-X fine-tune supported. RT-2-X: no external access | LoRA, QLoRA, and full fine-tune recipes published |
| Paper | Open X-Embodiment paper (2023), RT-2 (arXiv:2307.15818) | Kim et al., CoRL 2024 (arXiv:2406.09246) |
| Code | github.com/google-deepmind/open_x_embodiment | github.com/openvla/openvla |
RT-X: 이 모든 것을 시작한 가족
RT-1-X 사용 가능한
RT-1-X는 구글의 원래 RT-1 아키텍처의 오픈 X-Embodiment 재교육입니다. 이 프로그램은 EfficientNet 시각 척추, FiLM 언어 컨디셔너, 토큰 학습자 및 미묘한 동작을 내포하는 트랜스포머입니다. 만약 여러분이 프랭카 또는 구글 로봇 팔을 이용한 모바일 조작을 하고 가벼운 기본값을 원한다면, RT-1-X는 2026년에도 믿을 수 있는 출발점으로 남아 있을 것입니다.
RT-2-X 당신이 가질 수 없는
RT-2-X는 구글이 동일한 오픈 X-Embodiment 데이터에 의해 훈련받은 PaLI-X 기반의 55B VLA입니다. 큰 VLM가 로봇 제어 기능을 수행할 수 있다는 논문을 세웠다. 하지만 무게는 결코 공개되지 않았습니다. 블로그 게시물에서 "RT-X 성능"을 읽으면 35M RT-1-X 또는 55B RT-2-X
오픈VLA: 오픈 답
오픈VLA는 오픈소스 커뮤니티에 대한 RT-2-X 격차를 해소하기 위해 명시적으로 구축되었습니다. 언어 전자를 캡처하기에 충분한 7B 매개 변수이며, 한 고급 GPU에 서비스하기에 충분히 작습니다. [OpenVLA 종이] (
건설업자들에겐 더 중요한 것은: OpenVLA는 로라 정비 레시피를 가지고 있습니다. 이 방법은 팀들이 새로운 로봇에 80 GB A100를 몇 시간 대신 몇 일 안에 적용할 수 있게 해줍니다.
허가 및 접근 문제
이것은 보통 결정적인 요소입니다. 아파시 2.0의 RT-1-X는 상업적 수준의이지만 오래되고 작습니다. RT-2-X는 전혀 라이선스 할 수 없습니다. MIT의 OpenVLA는 상업적으로 사용할 수 있는 패키지에 RT-2- 클래스 행동을 얻는 유일한 방법입니다. 2026년에 실제 로봇을 배포하는 팀들 특히 [하우스 배포] (T6
하드웨어 발자국
RT-1-X는 단일 GPU에서 실시간 속도로 실행되며, 프랭카에서 구글 로봇까지의 다양한 로봇에서 입증되었습니다. 그것은 가벼운 옵션입니다. OpenVLA는 bfloat16에서 ~16 GB의 VRAM를 필요로하며 일반적으로 A100에서 양자화 없이 5
RT-1-X가 여전히 합리적인 경우
- 가장 작고 빠른 오픈-X 기본 라인을 원하고 언어에 대한 이해가 필요 없습니다.
- 연구 논문에서 인체 간 전송을 비교하고 있고 역사적으로 기초한 기준을 원하고 있습니다.
- 7B 모델이 실행이 불가능한 가장자리 하드웨어에서 실행됩니다.
OpenVLA가 명백한 선택이 될 때
- RT-2 클래스 언어 행동을 실제로 다운로드 할 수있는 무게와 원하고 있습니다.
- 상업적 면허가 필요합니다.
- 지역사회에서 활발한 로라 어댑터, 양자 변종, 배포 레시피를 원해요
- 당신은 자신의 텔레오프 데이터를 정비할 계획입니다. OpenVLA의 문서들은 하류 사용에 있어서 RT-X보다 실질적으로 더 낫습니다.
정직한 타협
오픈VLA는 RT-2-X보다 엄격히 "더 나은" 것이 아닙니다. DeepMind은 내부 모델을 RT-2-X를 훨씬 넘어 밀어붙이고 있으며, 구글의 생산 로봇 스택은 폐쇄 된 후손을 사용합니다. OpenVLA는 분명 RT-X 계통의 최고의 오픈 웨이트 기반 모델입니다. 당신이 어떤 비용으로 SOTA를 필요로하고 DeepMind과 파트너십을 할 수 있다면, 그것은 다른 대화입니다. 만약 여러분이 제품을 만들고 있다면, OpenVLA의 MIT 무게와 수파베이스에서 호스팅된 데이터 파이프라인과 [텔레오퍼레이션 데이터 수집] (T8
벤치마크 및 평가
두 모델 가족 모두 LIBERO, Google Robot, 그리고 RLBench 에 번호를 게시합니다. OpenVLA의 LIBERO 번호는 종이 안에 있으며 재생이 가능합니다. RT-X의 숫자는 변종에 따라 다릅니다. RT-X 행렬을 참고하십시오. 현재 스위트를 위해 벤치마크 디렉토리 를 참조하십시오.
RT-X를 포함하는 벤치마크 주장을 읽을 때 항상 세 가지 질문을하십시오. RT-X 변종 (RT-1-X 또는 RT-2-X), 오픈 X-Embodiment의 실시예 하위집단이 평가에 사용되었는지, 로봇이 구글의 실제 세계 WidowX 또는 외부 재생산인지. 이 선택에 따라 숫자는 20 퍼센트 점으로 변할 수 있습니다. OpenVLA 평가들은 일반적으로 해석하기 쉬워서 문서가 체크포인트, 프로토콜, 데이터셋 분할에 대해 명시적으로 설명하고 있습니다.
정렬 및 배포 요리법
RT-1-X와 일하는 하류 팀은 일반적으로 오픈 X-Embodiment
OpenVLA의 정렬 스토리는 상당히 풍부하다. 공식 저장소는 LoRA 정렬 예제, 완전한 정렬 예제, 사용자 지정 RLDS 데이터 데이터 데이터 데이터 세트 변환 도구 및 여러 인기있는 로봇의 참조 구성을 배포합니다. 커뮤니티는 4 비트 양자화, vLLM 서비스 및 [LeRobot]와 통합을 추가했습니다. 한 달도 안 되는 시간 안에 "우리는 텔레오프 데이터를 가지고 있다"에서 "우리는 로봇에 대한 정책을 가지고 있다"로 전환해야 하는 팀에게는 OpenVLA의 도구가 결정적인 장점입니다.
다음으로 DeepMind이 선보이는 것은
구글 딥마인드는 내부적으로 RT-2-X를 반복해 왔습니다. 겐리 로봇과 관련 프로젝트는 더 큰 VLM와 생산 Google 로봇에 더 긴밀하게 결합한 기반 모델-로봇의 논문을 확장합니다. 이러한 체크포인트 중 어느 것도 외부 배포에 사용할 수 없습니다. 따라서 제작자의 관점에서 볼 때 그들은 읽기에 가치가 있지만 구축 가치가 없습니다. 오픈VLA, pi0 및 LeRobot 생태계 모델은 오픈소스 작업의 현실적인 발전 경로입니다.
우리의 권고
오늘날 거의 모든 실용적인 팀에게는 OpenVLA가 답입니다. 그것은 지적적으로 RT-X 계통을 계승하고, 공공 벤치마크에서 RT-2-X와 일치하거나 제치고, MIT에 따라 열린 무게를 가진 배이며, 활성 정렬 생태계를 가지고 있습니다. RT-1-X는 여전히 훌륭한 작은 기본 라인이지만, 당신은 2026 년에 그 역할에 대해 [Octo]
** 관련 읽기** OpenVLA vs Octo → 방산 정책 vs ACT → 최고의 VLA 모델 2026 → 오픈 X-Embodiment 데이터 세트 → OpenVLA 모델 페이지 → RT-X 모델 페이지 →
여기 있는 모든 VLA는 여러분의 직접적인 시위에 맞춰 조정될 수 있습니다.







