로봇미믹: 로봇 모방 학습 벤치마크 (2026) 의 완전한 가이드
로보미믹은 다음과 같이 설명했습니다. 데이터 세트, BC/offline-RL 알고리즘, 그리고 로봇 조작의 표준 평가 프로토콜 <unk> 합성 데모를 위한 미믹겐.
로봇미믹은 로봇 조작 작업에 대한 모방 학습 및 오프라인 RL 알고리즘을 평가하는 표준 기준입니다. 새로운 정책 학습 방법을 개발하거나 평가하는 경우, 결과는 RoboMimic에 대한 보고가 필요합니다. 이 가이드에는 데이터 세트, 알고리즘, 실험을 실행하는 방법, 그리고 RCSV 하드웨어를 사용하여 새로운 RoboMimic 호환 데이터를 수집하는 방법을 포함합니다.
로보미믹 은 무엇 입니까?
로보미믹은 스탠퍼드 대학교에서 Ajay Mandlekar et al.에 의해 개발되어 CoRL 2021에서 발표된 로봇 학습의 프레임워크와 벤치마크입니다. 하나의 패키지에 3가지 요소를 제공합니다. 다양한 운영자 품질의 디스플레이 데이터 세트의 큐레이션 컬렉션, 모방 학습 및 오프라인 RL 알고리즘 구현의 집합, 그리고 횡단 종이에 대한 비교를 의미있게 만드는 표준화된 평가 프로토콜.
로보미믹 이전에는 모방 학습 논문을 비교하는 것은 어려운 일이었습니다. 왜냐하면 각 그룹은 다른 운영체제, 다른 품질 표준 및 다른 평가 프로토콜과 함께 자체 독자적인 데이터 세트를 수집했기 때문입니다. 80%의 성공률을 주장하는 논문은 전문가들의 쉬운 시범을 사용했을 수도 있고, 60%가 초보자들의 엉뚱한 시범을 사용했다고 주장하는 논문은
로보미믹은 평가용으로 [robosuite] (
로보미믹 데이터 세트
로보미믹은 4개의 작업을 포함하고 있으며, 각각의 작업은 다양한 기술 수준의 운영자로부터 수집된 여러 데이터 세트 변종을 가지고 있습니다. 이 다품질 구조는 벤치마크의 가장 중요한 디자인 결정입니다. 그것은 데이터 세트 품질에 대한 알고리즘의 강도를 테스트 할 수 있습니다. 실제 데이터 수집은 혼합된 품질의 시범을 생성하기 때문에 실제에서 매우 중요합니다.
과제
| Task | Description | Difficulty | Demo Count |
|---|---|---|---|
| Lift | Pick a small cube off a table and raise it above a height threshold | Easy | 200 per variant |
| Can | Pick a soda can from a bin and place it in a designated target region | Medium | 200 per variant |
| Square | Pick a square nut and fit it onto a peg — requires precise insertion alignment | Hard | 200 per variant |
| Transport | Two-arm task: pick a hammer from a closed bin, transfer between arms, place in target bin | Very Hard | 200 per variant |
데이터 세트 변종
각 작업은 서로 다른 수준의 운영자 일관성을 반영하는 데이터 세트 네 가지 변형을 가지고 있습니다.
- PH (Proficient-Human): 모든 실험을 일관하고 부드러운 동작으로 성공적으로 완료한 한 고도로 숙련된 사업자의 시범. 이것은
낮은 변동, 높은 품질에서 가장 쉽게 배울 수 있는 데이터 세트입니다. - MH (Multi-Human): 다양한 기술 수준의 6 명의 사업자로부터의 시사: 1 명의 "더 나쁜" 사업자, 3 명의 "좋아요" 사업자, 2 명의 "더 나은" 사업자 (PH의 능숙한 인간). 사업자들은 서로 다른 전략을 사용하고 성공률이 다르다. 이것은 가장 현실적인 데이터 세트입니다.
- MH 하위 세트: MH의 최악의/좋아/좋은 하위 세트에 대한 별도의 다운로드, 품질 필터가 성능에 미치는 영향을 연구 할 수 있습니다.
- RH (Rendered-Human): 시각적 정책을 평가하기 위해 국가 기반의 관찰보다는 이미지 관측으로 표시된 시범.
대부분의 연구 목적에 있어서 MH 데이터 세트는 가장 정보적 인 기준으로 알고리즘의 노이즈 디스플레이를 필터링하는 능력과 멀티모달 데이터에서 학습하는 능력을 테스트하기 때문입니다. PH에서 높은 점수를 얻지만 MH에서 훨씬 낮은 점수를 얻은 알고리즘은 깨끗한 데이터에 대한 과잉 적합성 문제가 있습니다.
파일 형식 및 다운로드
로보미믹 데이터 세트는 표준 스키마와 함께 HDF5 형식으로 저장됩니다. 각 파일은 작업 및 운영자 품질에 따라 이름 붙여집니다.
# HDF5 파일 구조 단일 로보미믹 데모 파일 리프트_ph__dim.hdf5 /data/ demo_0/ /obs/ robot0_eef_pos # (T, 3) 최종 효과자 위치 로봇0_eef_quat # (T, 4) 최종 효과자 방향 로봇0_gripper_qpos # (T, 2) 괄호의 공동 위치 객체 # (T, 14) 객체 포지 + 다른 env obs /행동 # (T, 7) 델타 EEF pos + ori + gripper / 보너스 # (T,) 단계별 승승 (연방 1.0 에피소드) / 도네스 # (T, 종료 플래그 demo_1/ ... / 마스크 / 기차 # 열차 나열 지표가 유효하다 # 승승 나열에 대한 유효성 #
로보미믹 공식 웹사이트에서 데이터 세트를
알고리즘: BC, BC-RNN, HBC, IRIS
로보미믹은 네 가지 알고리즘을 기준 기준으로 구현합니다. 훈련에 필요한 알고리즘을 선택하기 전에 각각의 작업과 작업 시점에 대해 이해하는 것이 중요합니다.
BC (행동 복제)
가장 간단한 기본 라인: 예측된 행동과 입증된 행동 사이의 MSE를 최소화하는 feedforward MLP 정책. 관찰: 현재 로봇 상태 ( 및/또는 이미지). 행동: 델타 최종 효과자 포즈. 현재 프레임 이외의 시간적 맥락이 없습니다. BC는 리프트 (편한 작업, 낮은 다모달성) 에서 합리적인 성능을 발휘하지만, 최근 궤도 역사의 기억이 없기 때문에 캔과 스퀘어에서 크게 떨어집니다. 그리고 시범 변성을 처리할 수 없습니다.
** 작동하는 경우:** 낮은 변동성 시범, 짧은 지평 (일개의 포착) 과 관련된 작업, 다단계 조정 요구 사항이 없습니다.
** 실패할 때:** 로봇이 방금 했던 일을 기억해야 하는 작업 (다 단계 작업에서 흔히 볼 수 있습니다) 또는 전략에서 시범이 달라지는 작업.
BC-RNN (복귀 네트워크로 행동 클론)
BC는 MLP 대신 LSTM 척추를 가지고 있습니다. LSTM는 시간 단계에 걸쳐 숨겨진 상태를 유지하며 정책 시간 기억을 제공합니다. 이것은 다음으로 무엇을 결정하는 데 필요한 팔 움직임의 역사를 아는 것이 필수적인 경우, 캔 및 운송과 같은 다단계 작업에서 성능을 크게 향상시킵니다. 2층 LSTM (400개의 숨겨진 단위 각 층) 를 가진 BC-RNN는 가장 강력한 표준 BC 기본 라인이며 모방 학습 논문에서 가장 일반적으로 보고된 숫자입니다.
이 작동할 때: 여러 단계 작업, 시간 의존성을 가진 작업, 로봇이 이전 접촉 상태를 기억해야 하는 작업.
실패할 경우: 높은 멀티모다리티 (다중 유효한 전략) 과
HBC (위계행동 클론)
2 차원의 계층적 정책: 고 차원의 "계획자"는 하위 목표 상태를 예측 (예를 들어 로봇의 중간 구성) 하고, 낮은 차원의 "관리자"는 각 하위 목표에 도달하는 것을 학습한다. 계층적 구조는 긴 지평 작업을 돕는 인덕티브 구조를 제공합니다. HBC는 일반적으로 교통 및 광장에서 BC-RNN (장수평선 작업) 를 능가하지만 특히 하위 목표 지평선 길이를 더 신중하게 조정하는 하이퍼파라미터가 필요합니다.
IRIS (하목을 가진 모방에 대한 간접 표현)
IRIS는 HBC를 향상된 하위 목표 표현 학습으로 확장합니다. 원료 로봇 상태 하위 목표 예측 대신, IRIS는 작업 공간 상태의 잠자연 표현을 학습합니다. 이는 계획자가 더 추상적이고 더 쉽게 작업 할 수 있습니다. 그것은 VAE를 사용하여 하위 목표 잠자연 공간을 시범 데이터에서 배우습니다. IRIS는 전체 로보미믹 벤치마크에서 네 개의 참조 알고리즘에서 가장 강력한 결과를 달성합니다. 특히 MH ( 혼합 인간 품질) 데이터 세트에서 그 하위 목표 구조가 시범 변성을 견고하게 만듭니다.
로보미믹에 외부 알고리즘을 추가
로보미믹의 프레임워크는 새로운 "알고" 클래스로 자신의 알고리즘을 추가하는 것을 쉽게 만듭니다. 전파 정책, ACT 및 최신 모방 학습 방법은 로보미믹 데이터 형식 및 평가 프로토콜을 사용하기 위해 적응되었습니다. 주요 통합 요구 사항은 표준화된 관찰 디렉트를 취하고 델타 최종 효과자 동작을 반환하는
로봇 미미 실험 을 수행 하는 방법
# 로보미믹 파이프 설치 로보미믹 # 또는 최신 버전의 기기 클론
리프트 PH 저 진하에 BC-RNN를 훈련시키는 것은 단일 RTX 3090에서 약 30 분 정도 소요된다. 이미지 관측에 대한 훈련은 같은 작업에 4
주요 구성 매개 변수
| Parameter | Default | Notes |
|---|---|---|
train.num_epochs |
2000 | 200 demos × 2000 epochs = ~400k gradient steps; sufficient for low-dim tasks |
train.batch_size |
100 | Increase to 256 or 512 for image tasks if VRAM allows |
algo.rnn.hidden_dim |
400 | For BC-RNN; larger values help on complex tasks but slow training |
observation.encoder.core_kwargs.feature_dim |
64 | For image tasks; feature dimension from ResNet encoder |
experiment.rollout.n |
50 | Number of evaluation rollouts — 50 is the standard; do not reduce below 20 |
참고 기준 결과
다음의 성공률은 원래의 로보미믹 논문 (Mandlekar et al., 2021) 과 그 후의 커뮤니티 업데이트에서 나온다.
| Task / Split | BC | BC-RNN | HBC | IRIS |
|---|---|---|---|---|
| Lift PH (low-dim) | 100% | 100% | 100% | 100% |
| Lift MH (low-dim) | 98% | 100% | 100% | 100% |
| Can PH (low-dim) | 92% | 100% | 100% | 100% |
| Can MH (low-dim) | 12% | 48% | 36% | 74% |
| Square PH (low-dim) | 70% | 80% | 100% | 98% |
| Square MH (low-dim) | 0% | 2% | 10% | 50% |
| Transport PH (low-dim) | 0% | 22% | 88% | 98% |
| Transport MH (low-dim) | 0% | 6% | 22% | 58% |
가장 교훈적인 비교는 CAN MH: BC가 92% (PH) 에서 12% (MH) 로 떨어지고, IRIS는 100%에서 74%로 떨어진다. 이 격차는 "MH 저하"가 주요 벤치마크 신호입니다. MH에서 성능을 유지하는 알고리즘은 낮은 품질의 시범을 필터링하고 멀티모달 데이터를 처리하는 것을 배우고 있습니다. 이는 실제 세계에서 성능을 직접 예측하는 데 있어 운영자의 품질을 보장할 수 없습니다.
RCSV 하드웨어 호환성
로보미믹의 시뮬레이션 작업은 로보시이트에서 프랑카 파ண்டா 팔 (7-DOF) 를 사용합니다. 물리적인 로봇 전송을 위해 RCSV는 [OpenArm Base]
로보미믹에서 물리학과 시뮬레이션 사이의 격차는 잘 이해됩니다. 시뮬레이션된 로보미믹 데이터 전송을 물리 로봇에게 수행하는 정책은 작업에 따라 시뮬레이션 성공률의 약 60~75%에 따라 수행됩니다. 정확성 삽입 작업 (스퀘어) 전송은 최악의; 선택 및 장소 작업 (캔, 리프트) 전송은 가장 좋습니다. RCSV의 접근법은 알고리즘 선택과 하이퍼 파라미터 검색을 위해 RoboMimic sim 실험을 사용하여 최종 배포 정책에 대한 물리적 시범을 수집하는 것입니다.
사용자 지정 로보미믹 호환 데이터 세트를 수집
사용자 지정 작업 (전설 작업 중 하나 아닌) 에 알고리즘을 벤치마크하고 싶다면, RoboMimic의 데이터 수집 프레임워크는 로보수이트에서 새로운 작업을 만들고 스페이스마우스 텔레오퍼레이션을 통해 시범을 수집할 수 있습니다. HDF5 스키마는 문서화되어 있으며 물리 로봇 시범을 로보미크 형식으로 변환할 수도 있습니다.
RCSV의 [데이터 수집 서비스] (
사용자 지정 RoboMimic 작업의 표준 RCSV 데이터 세트 패키지는 다음과 같습니다: 한 훈련된 운영자로부터 200 PH 시범, MH 레벨의 3 개의 운영자로부터 200 MH 시범 (MH 벤치마크를 가능하게 하기 위해) 및 물리적 작업 기하학에 맞는 사용자 지정 로봇 스위트 환경 정의. 회전 기간은 일반적으로 2~3주입니다.
관련 독서
- 방산 정책 가이드
많은 로보미믹 작업에서 IRIS보다 뛰어난 알고리즘 - ACT 정책 설명
ALOHA의 알고리즘; 어댑터로 RoboMimic에서 벤치마킹 할 수 있습니다 - [이미테이션 학습에 가장 좋은 로봇]
T14 ) RoboMimic 호환 하드웨어의 플랫폼 비교 - [OpenArm Base]
T15 ) RoboMimic 물리 실험을 위한 RCSV의 주요 플랫폼 - RCSV 데이터 서비스
사용자 지정 로보미믹 데이터 세트 수집 - RCSV 벤치마크
RCSV 사용자 지정 평가와 함께 로보미믹 결과







