Guides(으)로 돌아가기

VLA 모델 비교 (2026): OpenVLA, π0, SmolVLA, Octo & RT-2

체크포인트 접근, 액션 표현, 계산, 데이터 호환성 및 평가 프로토콜에 따라 VLA 모델을 비교하십시오. OpenVLA, π0, SmolVLA, Octo 및 RT-2를 포함한다.

이 가이드에서 체크포인트 액세스, 액션 표현, 추론 계산, 로봇 데이터 호환성, 그리고 각 보고된 결과를 생성한 평가 프로토콜에 따라 비전 언어-행동 모델을 선택 목록으로 나열합니다.

2026년 7월 26일 업데이트 · RCSV 연구팀

직접적인 답변

로봇 팀이 어떤 VLA 모델을 선택해야 할까요?

보편적 최고의 VLA는 없습니다. 먼저 체크포인트에 액세스하고 정렬할 수 있는지 여부에 따라 선택하고, 그 다음 행동 표현, 지연 예산, 지원되는 로봇 데이터 형식 및 작업 수준 평가에서의 성능에 따라 선택하십시오. 논문의 제목 점수는 이러한 배포 제한을 초과해서는 안됩니다.

증명 표준: 건축 및 접근 사실들은 문서 또는 공식 저장소들에 비해서 검증된다. 다른 데이터 집합, 로봇 실시예, 하드웨어 및 프로토콜에서 출판된 점수는 직접적으로 비교될 수 있는 것으로 취급되지 않는다. 추정 및 사용할 수 없는 측정은 표기된다.

  • [OpenVLA vs Octo]
  • [VLA 모델을 탐색]
  • [환합된 데이터 세트를 찾아라]
  • [표준 프로토콜을 검토]

VLA 모델은 무엇 입니까?

비전 언어 행동 (VLA) 모델은 로봇 동작에 시각적 관찰과 언어 지침을 지도하는 신경 네트워크입니다. 핵심 아이디어는: 미리 훈련된 비전 언어 모델을 ( 이미 이미 이미지와 텍스트를 이해하는) 가져와 로봇을 위해 모터 명령을 생성하는 액션 출력 헤드를 추가합니다. 시각 언어 척추는 의미적 이해를 제공합니다 ("붉은 잔을 들어보세요"), 행동 머리는 그 이해를 물리적 움직임으로 번역합니다 (관절 각 또는 최종 효과자 위치의 순서).

건축물 개요

모든 VLA 모델은 세 가지 구성 요소를 공유하지만 구현은 크게 다릅니다.

  • 비전 코더: 카메라 이미지를 기능 벡터로 변환합니다. 일반적인 선택은 비전 트랜스포머 (ViT) 또는 SigLIP입니다. 비전 코더는 일반적으로 인터넷 규모의 이미지 데이터 세트 (ImageNet, LAION) 에 미리 훈련되어 VLA 훈련 중에 얼거나 약간 정렬됩니다.
  • 언어 척추: 텍스트 명령어를 처리하고 시각적 기능과 통합합니다. 대부분의 VLA는 사전 훈련된 큰 언어 모델을 (LLaMA, Gemma, PaLI) 사용하여 그 추론 및 명령에 따라 기능에 활용합니다.
  • ** 액션 헤드:** 융합된 시각 언어 표현에서 로봇 동작을 생성합니다. VLA 아키텍처가 가장 크게 분할되는 곳입니다.

행동 대표성: 주요 차별성

VLA가 동작을 표현하고 생성하는 방식은 그 성능 특성을 결정한다.

  • ** 디스크릿 토큰 (RT-2, OpenVLA):** 액션은 디스크릿 토큰으로 양자화되어 텍스트 토큰과 마찬가지로 자동 퇴행적으로 생성됩니다. 구현하기 쉽습니다. 그러나 무섭게 한 단계의 행동을 생성합니다.
  • 분자 예측 (SmolVLA): 모델은 ACT에 영감을 받아 미래 행동의 연속을 한 번에 예측합니다 (일반적으로 1050 단계).
  • ** 흐름 일치 (π0):** 액션은 무작위 샘플을 유효한 행동 궤도로 반복적으로 소멸함으로써 생성됩니다. 가장 원활한 동작을 생성하고 다 모달 분포 (다중 유효한 솔루션 작업을) 를 가장 잘 처리하지만 추론 시 여러 개의 소멸 단계를 필요로합니다.
  • ** 분포 (Octo):** 흐름 일치와 비슷하지만 DDPM 스타일의 분포 과정을 사용합니다. 다 모달 동작에 적합하지만 추론에 있어서 쪼개진 예측보다 느립니다.

VLA 모델 비교 테이블

Model Creator Open Source Parameters Action Type Hardware Compatibility
RT-2 Google DeepMind No 55B Discrete tokens Google RT-X robots
OpenVLA Stanford / Berkeley Yes (Apache 2.0) 7.5B Discrete tokens Any
π0 Physical Intelligence No ~3B (est.) Flow matching Any
SmolVLA HuggingFace Yes (Apache 2.0) 450M Chunked (ACT-style) Any
Octo UC Berkeley Yes (MIT) ~93M Diffusion Any
RoboFlamingo Shanghai AI Lab Yes ~9B Autoregressive Any
Helix Figure AI No Undisclosed Undisclosed Figure 02

깊이 다이빙: 각 VLA 모델

RT-2 (Google DeepMind)

** 아키텍처:** RT-2는 PaLI-X (55B 매개 변수) 또는 PaLM-E (12B 매개 변수) 에 기반을 둔다. 시야 코더는 ViT-e (4B 매개 변수) 이며 언어 모델은 시각 토큰과 텍스트 토큰을 모두 처리한다. 액션은 미분별된 공동 위치의 텍스트 문자열로 나타난다 (예를 들어 "1 128 91 241 5 101 127") 그리고 언어 모델에서 자동으로 생성된다.

** 훈련 데이터:** 구글의 RT-X 데이터 세트에서 약 13만 개의 로봇 타입의 시범을 포함하고 있으며, 또한 PaLI-X 척추에서 인터넷 규모의 시각 언어 사전 훈련을 활용합니다.

** 성능:** RT-2는 로봇 훈련 중에 볼 수 없는 개념들을 포함하는 지침을 따서 새로운 의미 개념에 대해 62%의 성공을 거두었으며, 표준 기준에 따르면 RT-1는 32%에 비해 62%의 성공을 거두었다.

** 정비 요구 사항:** 공개되지 않습니다. 구글은 무게나 훈련 코드를 공개하지 않았습니다.

Pros: 가장 강력한 신흥 의미 일반화; VLA 개념이 규모로 작동한다는 첫 번째 증거.

** 단점:** 폐쇄된 소스; 대규모 계산이 필요합니다. 55B 매개 변수는 실시간 추론을 어렵게 만듭니다. 단일 단계 단위 동작은 이 움직이는 것을 만듭니다.

오픈VLA (스탠퍼드 / 버클리)

건축: 프리스마틱 VLM 척추 (Llama-2 7B + SigLIP + DinoV2 비전 코더) 에 기반을 둔. 액션은 한 차원당 256 개의 칸으로 분해되어 토큰으로 자동 퇴행성적으로 예측된다. 이중 비전 코더 (역사적 기능에 대한 SigLIP + 공간적 기능에 대한 DinoV2) 는 오픈VLA에 단일 콥더 디자인보다 더 강한 시각 지지를 제공합니다.

** 훈련 데이터:** 오픈 X-Embodiment 데이터 세트 (~ 22 개의 로봇 실시예에서 970K 궤도) 에 훈련. 정교 조정은 특정 로봇에 대한 새로운 작업에 대해 100~200 개의 시범이 필요합니다.

** 성능:** LIBERO 기준에서, 정교한 OpenVLA는 작업 어려움에 따라 85~95%의 성공을 달성합니다. WidowX 및 Franka 팔을 사용하여 실제 로봇 평가에서, 그것은 보이는 작업에 대한 작업에 대한 작업에 대한 특정 ACT 정책과 일치하거나 초과하고 보이지 않는 작업 변동에 대해 크게 우위를 합니다.

** 정밀 조정 요구 사항:** 완전 정밀 조정용 2x A100 (80 GB) 로 로라 정밀 조정용 1x A100 로 로라 정밀 조정용 훈련시간: 200개의 시범용 824시간 로라 정밀 조정용 2x A100 (80 GB) 로 로 로라 정밀 조정용 1x A100 로 로라 정밀 조정용 200개의 시범용 824시간 로라 정밀 조정용 2x A100 (80 GB) 로 로 로라 정밀 조정용 1x A100 로 로 로라 정밀 조정용 1x A100 로 로 로라 정밀 조정용 1x A100 로 로 로라 정밀 조정용 2x A100 (80 GB) 로 로 로라 정밀 조정용 2x A100 (80 GB) 로 로 로라 정밀 조정용 2x A100 (80 GB) 로 로라 정밀 조정용 1x A100 (70 GB) 로 로라 정밀 조정용 1x A60 (70 GB) 로 로 로라 로라 로라 정밀 조정된 2x A60 (70 GB) 로 로 로라 로라 로라 로라 로라 로라

프로: 우수한 문서와 완전히 오픈소스; 가장 강력한 오픈소스 기본; 큰 커뮤니티 및 활성 개발; 간단한 액션 공간 지도를 가진 모든 로봇에 작동합니다.

** 단점:** 7.5B 매개 변수는 소비자 GPU에 대한 행동 단계당 ~300ms를 의미합니다 (반응 작업에 너무 느리); 디스크리트 토큰은 흐름 일치 또는 조각 예측보다 부드러운 동작을 덜 생산합니다; 정렬을 위해 상당한 VRAM가 필요합니다.

π0 (물리 지능)

** 아키텍처:** π0는 흐름 일치하는 액션 헤드 (Flow matching action head) 을 가진 시각 언어 척추 (Pali-based, details not fully disclosed) 를 사용한다. 흐름 일치하는 것은 학습된 속도 필드를 통해 잡음 샘플을 학습된 속도 궤도로 반복적으로 변환함으로써 행동을 생성한다. 이것은 토큰 기반 접근의 분별 유물 없이 부드럽고 연속적인 궤도를 생성한다.

** 훈련 데이터:** 여러 로봇 플랫폼 (프랑카, UR5, 모바일 조작기, 유능한 손) 에서 수천 시간 동안의 텔레오퍼레이션 데이터의 독자적인 데이터 세트에 훈련되었습니다. 데이터 세트는 오픈 X-Embodiment보다 훨씬 크고 다양합니다.

** 수행:** π0는 하나의 모델에서 다른 로봇 실시예에서 세탁물 접기, 테이블 버싱, 박스 포장 및 montage 작업을 수행하는 모든 로봇 정책의 가장 광범위한 작업 일반화를 보여주었습니다. 양적 기준은 훈련된 작업에서 8095%의 성공과 관련하지만 보이지 않는 작업에서 4060%의 무사점을 보여줍니다.

** 정비 요구 사항:** 공개되지 않습니다. 물리 지능은 선택된 파트너에게 API 접근을 제공합니다.

Pros: 가장 원활한 액션 생성; 가장 광범위한 작업 일반화 입증; 토큰 기반 VLA보다 접촉 부양한 조작을 더 잘 처리; 멀티 인체화 지원.

보편: 폐쇄된 소스; 공개중심은 없습니다. 추론은 여러 개의 단호 단계 (1020) 를 필요로 하며, 지연성을 추가합니다.

스몰블라 (HuggingFace)

건축: SmolVLA는 SmolVLM (Idefics-3) 를 기반으로 한 컴팩트 비전 언어 모델) 를 쪼개진 액션 예측 헤드 (shunked action prediction head) 로 사용한다. 액션 헤드는 ACT의 쪼개진 예측에서 영감을 받아 하나의 앞을 통과하는 미래 행동 (action chunk) 의 연속을 예측한다. 비전 코더는 SigLIP-400M 모델이며, 언어 쪼개지는 500M 매개 변수이다.

** 훈련 데이터:** 오픈 X-Embodiment 과 LeRobot 커뮤니티 데이터 세트 의 큐레이션 하위 세트 에 훈련. 정교 조정 은 50200 개의 시범 작업 을 필요로 한다.

** 성능:** LIBERO 기준에서, SmolVLA는 16배 더 적은 매개 변수를 가지고 있음에도 불구하고 OpenVLA의 5% 내에 8290%의 성공을 달성합니다. 실제 로봇 평가에서, 정교한 SmolVLA는 간단한 작업에서 OpenVLA와 일치하고 복잡한 다 단계 작업에서 약간 저조한 성능을 발휘합니다. 주요 장점은 추론 속도입니다. SmolVLA는 단일 RTX 4090에서 1530 Hz로 실행됩니다. 반응 조작에 충분합니다.

** 정밀 조정 요구 사항:** 1x RTX 4090 (24 GB) 를 통해 정밀 조정; 200 개의 시범을 위해 412 시간 훈련.

프로: 가장 작고 가장 빠른 오픈소스 VLA; 소비자 하드웨어에서 실행됩니다.

보편: 7B+ 모델에 비해 언어 이해에 대한 척추 제한이 작아, 새로운 지침에 대한 강도가 낮아, 조각적인 예측은 매우 긴 지평선 작업에 어려움을 겪을 수 있습니다.

오크토 (UC 버클리)

** 아키텍처:** Octo는 디프루션 액션 헤드 (Defusion Action Head) 을 가진 트랜스포머 척추를 사용합니다. 위의 VLA 모델과 달리, Octo는 사전 훈련된 언어 모델 척추를 사용하지 않습니다. 대신 로봇 데이터에 초등으로 훈련된 작은 트랜스포머를 사용합니다. 선택적인 언어 조건으로. 디프루션 헤드는 반복적 소멸을 통해 액션 궤도를 생성합니다.

** 훈련 데이터:** 오픈 X-Embodiment 데이터 세트 (~800K 궤도) 에 훈련된. 특히 인체 간 전송 및 빠른 미세조정을 위해 설계되었습니다.

** 성능:** SIMPLER 기준에 따르면 Octo-Base는 여러 시뮬레이션 환경에서 50~75%의 성공을 달성합니다.

** 정비 요구 사항:** 1x RTX 3090 이상; 훈련 시간은 30분에서 2시간. 이 비교에서 가장 낮은 계산 요구 사항

프로: 가장 빠른 정렬; 가장 작은 계산 요구 사항; 디스푸전스 헤드 는 다 모달 동작을 잘 처리한다.

보편: 언어 이해가 가장 약한 (LLM 척추가 없다); 복잡한 작업에 있어서 OpenVLA 또는 SmolVLA보다 절대적인 성능이 낮다; 전파 추론은 조각 예측보다 느립니다.

로보 플라밍고 (상하이 인공지능 연구소)

건축: OpenFlamingo (MPT-7B를 기반으로 한 다모달 모델) 를 기반으로 RoboFlamingo는 미리 훈련된 시각 언어 모델에 로봇 행동 예측 헤드를 추가합니다. 이 모델은 다 프레임 시각적 역사를 효율적으로 처리하기 위해 수신자 재 샘플러 모듈을 사용합니다.

** 훈련 데이터:** CALVIN 벤치마크 데이터와 사용자 지정 실제 로봇 시범 데이터 조합을 기반으로 훈련. 100~500 시범 데이터 세트에 의해 정교하게 조정될 수 있습니다.

** 성능:** CALVIN 기준에서, RoboFlamingo는 다단계 긴 지평선 작업에서 최첨단 결과를 달성합니다. 시간적 시각적 추론 (일단 프레임보다는 프레임의 순서 처리를 하는) 는 이전 단계의 기억을 필요로 하는 작업에서 이점을 제공합니다.

** 정밀 조정 요구 사항:** 9B 매개 변수 척추로 인해 완전한 정밀 조정을 위해 2x A100 (80 GB)

프로: 긴 장점 작업 성능; 시간적 시각적 추론; 오픈소스.

편익: 큰 모델 크기가 (9B); 실제 로봇 평가가 제한되어 있습니다.

선택 방법: VLA 결정 프레임워크

올바른 VLA 모델을 선택하는 것은 세 가지 요인에 달려 있습니다. 계산 예산, 데이터 사용 가능성과 작업 요구 사항입니다.

계산 예산

Budget 미세 조정 Hardware Recommended Model Inference Speed
Consumer ($0–$2K GPU) 1x RTX 4090 SmolVLA or Octo 15–30 Hz
Research lab ($5K–$20K) 1–2x A100 OpenVLA (LoRA) or SmolVLA 3–15 Hz
Well-funded lab ($20K+) 4+ A100 or H100 OpenVLA (full) or custom VLA 3–10 Hz
Enterprise Cloud cluster π0 (API) or custom training Varies

작업 유형에 따라

Task Key Requirement Best Model Why
Simple pick-and-place Speed, low compute SmolVLA or Octo Fast inference, minimal data needed
Language-conditioned manipulation Semantic understanding OpenVLA Strongest language backbone among open models
Contact-rich manipulation Smooth, precise actions π0 or SmolVLA Flow matching / chunked actions handle contact better
Multi-step long-horizon Temporal reasoning RoboFlamingo or OpenVLA Multi-frame processing, strong LLM backbone
Rapid prototyping Fast iteration Octo 30-min fine-tuning on 20 demos
Bimanual coordination Multi-arm action space SmolVLA or Octo Flexible action spaces, chunked prediction

데이터 가용성

  • 2050 시범: Octo (최소한 데이터로 빠른 미세조정을 위해 설계)
  • 50200 시범: SmolVLA (중중한 데이터로 좋은 성능) 또는 ACT (VLA가 아닌 기본 기준, 제한된 데이터로 매우 효과적)
  • 200500 시범: OpenVLA (완전 정렬이 이 규모에서 가장 좋은 결과를 얻는다)
  • 500+ 예제: 모든 모델 혜택; OpenVLA를 완전히 정비하거나 사용자 지정 모델을 훈련시키는 것을 고려하십시오

로봇 데이터 에 있는 VLA 를 정렬 하는 것

데이터 형식 요구 사항

모든 주요 VLA 모델들은 두 가지 형식 중 하나에서 훈련 데이터를 기대합니다.

  • RLDS (Reinforcement Learning Datasets): 오픈 X-Embodiment 모델의 표준. Octo, OpenVLA, RT-2에서 사용된다. 각 에피소드는 TFRecord 형식으로 (관측, 행동, 보상) 튜플의 연속으로 저장된다.
  • LeRobot 형식: HuggingFace의 SmolVLA 및 LeRobot 훈련 프레임워크의 형식. 각 에피소드는 동기화 된 이미지 및 액션 열과 함께 JSON 파일과 함께 파킷 파일로 저장됩니다.

RCSV의 데이터 수집 파이프라인에서 양 형식의 출력이 있습니다. 변환 세부 사항은 [데이터 형식 가이드]

GPU 요구 사항 및 훈련 시간

Model Method Min GPU VRAM Time (200 demos)
SmolVLA Full fine-tune 1x RTX 4090 24 GB 4–12 hours
OpenVLA LoRA 1x A100 40 GB 8–16 hours
OpenVLA Full fine-tune 2x A100 80 GB each 12–24 hours
Octo Full fine-tune 1x RTX 3090 24 GB 0.5–2 hours
RoboFlamingo Full fine-tune 2x A100 80 GB each 16–32 hours

로라 와 완전 정렬

로어 랭크 어댑팅 (LoRA) 은 사전 훈련된 무게를 얼어붙이고 작은 어댑터 매트리를 훈련시켜 메모리 요구 사항을 50%~70% 감소시킵니다.

  • ** 완전 정렬:** 7.5B 매개 변수를 모두 업데이트 합니다. A100 (80 GB) 를 2x 가량 요구 합니다. 특히 작업 분포가 사전 훈련 데이터와 크게 다르면 최상의 성능을 달성합니다.
  • LoRA 정렬: ~50M 어댑터 매개 변수를 (랭크 32). 1x A100 (40 GB) 를 필요로 한다. 대부분의 작업에 대한 전체 정렬의 25% 내의 성능. 과잉 계산이 없으면 기본 접근법으로 권장된다.

예제: 레로봇으로 SmolVLA를 정렬

# Install LeRobot
# pip install lerobot

from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
from lerobot.common.policies.smolvla.configuration_smolvla import SmolVLAConfig
from lerobot.common.policies.smolvla.modeling_smolvla import SmolVLAPolicy

# Load your dataset (collected at RCSV or locally)
dataset = LeRobotDataset("your_org/your_dataset")

# Configure the policy
config = SmolVLAConfig(
    input_shapes={
        "observation.images.top": [3, 480, 640],
        "observation.images.wrist": [3, 480, 640],
        "observation.state": [7],  # 6 joints + gripper
    },
    output_shapes={
        "action": [7],
    },
    action_chunk_size=50,
)

# Initialize from pre-trained weights
policy = SmolVLAPolicy(config, dataset_stats=dataset.stats)
policy.load_pretrained("HuggingFaceTB/SmolVLA-base")

# Fine-tune (see LeRobot docs for full training loop)
# python lerobot/scripts/train.py \
#     --policy.type=smolvla \
#     --dataset.repo_id=your_org/your_dataset \
#     --training.num_epochs=100

RCSV 데이터 수집을 미세 조율 파이프라인으로

RCSV의 [데이터 수집 서비스](T6을 사용하는 팀들의 전형적인 작업 흐름:

  1. ** 작업 범위를:** 조작 작업, 객체 변동, 성공 기준을 정의합니다. RCSV의 솔루션 팀은 최소한의 데이터 세트 크기를 결정하는 데 도움이됩니다 (일반적으로 VLA 정렬을 위한 100200 디모).
  2. 집합 시연: RCSV 운영자는 시범 캠페인을: 100 (2,500) 데모 (full campaign): 500 (8,000) 데모 (full campaign): 시범 캠페인을: 500 (full campaign): 500 (full) 데모 (full) 데모 (full) 데모 (full)
  3. 프로맷된 데이터를 수신: 데이터는 HDF5 (ACT/방포정책 호환성) 과 LeRobot (SmolVLA/OpenVLA 호환성) 양식으로 제공된다.
  4. VLA를 정렬하십시오: 제공된 데이터 세트를 사용하여 SmolVLA (소비자 GPU) 또는 OpenVLA (A100) 를 정렬하십시오. RCSV는 클라우드 GPU 설정을 위한 컴퓨팅 액세스 또는 지침을 제공할 수 있습니다.
  5. 평가를 하고 반복: 로봇에 정교한 정책을 적용하세요. 성공률이 목표보다 낮다면 실패 사례에 대한 추가적인 목표적인 시범을 수집하세요.

실제 세계 벤치마크: 정확성 vs 추론 속도

방법론 참고

이 표를 정상화된 순위표로 읽지 마십시오

아래의 값은 다른 모델 출시 및 환경에서 수집된 보고 또는 지표적 결과입니다. 그들은 단편 목록을 구성하는데 유용하지만 작업 정의, 체크포인트, 관찰 공간, 행동 공간, 하드웨어 및 성공 기준이 다르기 때문에 승자를 확립하지는 않습니다.

결정 수준의 비교는 동일한 데이터 세트 버전, 실시예, 작업 부트, 씨드 정책, 추론 하드웨어, 성공 라브리크 및 모든 후보자에게 반복 실행 프로토콜이 필요합니다.

Model LIBERO-Long (5 tasks) SIMPLER (avg) Inference (RTX 4090) Inference (A100)
RT-2 (55B) N/A (closed) N/A (closed) N/A ~1 Hz
OpenVLA (7.5B) 90% 72% ~3 Hz ~8 Hz
π0 N/A (closed) N/A (closed) N/A ~5 Hz (est.)
SmolVLA (450M) 86% 68% ~20 Hz ~30 Hz
Octo (93M) 72% 58% ~10 Hz ~25 Hz
RoboFlamingo (9B) 82% (CALVIN) N/A ~2 Hz ~6 Hz

** 추론 속도 교류:** 반응 작업 (물질을 잡기, 동적 조립) 에 대해서는 ≥10 Hz 제어가 필요합니다. 이것은 소비자 하드웨어에서 SmolVLA 및 Octo에 대한 실용적인 선택권을 제한합니다. 느린 조작 작업 (····································································································································································································· 속도보다 정확성을 필요로 하는 접촉 부가 높은 작업 (insertion, assembly) 에 대해서는, 작업 품질이 높으면 느린 추론이 허용된다.

** 중요 한 경고:** 벤치 마크 숫자는 특정 데이터 집합 및 평가 프로토콜에 의해 측정됩니다. 실제 세계 성능은 특정 작업, 환경 및 로봇에 달려 있습니다. LIBERO에서 90%를 달성하는 모델은 시각 환경 또는 객체 집합이 크게 다르다면 작업의 60%를 달성 할 수 있습니다. 항상 목표 설정에 따라 평가하십시오.

관련 독서

관련: 2026년 물리 인공지능 · 행동 덩어리 변환기 · 데이터 서비스 · 레로봇 프레임워크 가이드 · 스페이스마우스 텔레오퍼레이션 · 하드웨어 카탈로그 · 로봇어 사전