로보미믹: 카노니컬 모방 학습 벤치마크
Robomimic를 탐험하세요: 6개의 작업 스위트, 1000개 이상의 데모가 하나씩, robosuite와 MuJoCo를 기반으로 합니다.
로보미믹에 대한 실무자의 가이드
TL;DR
| Metric | Value |
|---|---|
| Task suites | 6 (Lift, Can, Square, Transport, ToolHang, NutAssembly) |
| Robots | Franka Emika Panda, Rethink Sawyer (simulated in robosuite) |
| Modalities | Low-dim state, RGB (agent + wrist camera), object poses |
| License | MIT |
| Size | ~1,000 demonstrations per task × 3 data qualities (PH, MH, MG) |
| Simulator | robosuite (MuJoCo) |
로보미믹은 무엇입니까?
로보미믹은 스탠퍼드 ARISE Initiative (Ajay Mandlekar, Danfei Xu, Josiah Wong, et al.) 에서 로봇 조작에 대한 모방 학습에서 실제로 작동하는 것에 대한 엄격한 경험적 연구로 도입되었습니다. 연구팀은 각 작업의 시범법 3가지 버전을 수집했다. Proficient-Human (PH), Mixed-Human (MH), and Machine-Generated (MG) 그리고 결과 18개의 (task, data-quality) 조합을 통해 대규모 알고리즘 스파이 (BC, BC-RNN, HBC, IRIS, BCQ, CQL, 그리고 여러 오프라인 RL 기본 라인을) 를 실행했다. 이 논문의 핵심 기여는 역사 조건 BC (BC-RNN) 가 상당히 강한 기본 라인임을 보여주었고, 데이터 품질이 높을 때 오프라인 RL와 모방 학습 사이의 격차가 붕괴된다는 것을 보여주었습니다.
로보미믹은 또한 LIBERO의 직접적인 지적 조상입니다. LIBERO는 로보시이트 장면 형식과 HDF5 컨벤션을 유지하고 평생 학습 교육과정을 통해 확장합니다. 로보미믹을 이해하면 이미 LIBERO 인 수도원 80%를 알고 있습니다.
다운로드 및 로딩 방법
로보미믹은 스탠퍼드 미러에서 가공된 HDF5 파일을 가져오는 한 줄의 다운로드 스크립트를 배포합니다.
# Install the framework
pip install robomimic
# Download all task suites at PH, MH, and MG quality
python -m robomimic.scripts.download_datasets \
--tasks lift can square transport tool_hang nut_assembly \
--dataset_types ph mh mg \
--hdf5_types image low_dim
# Train a Diffusion Policy baseline
python -m robomimic.scripts.train \
--config configs/diffusion_policy.json \
--dataset datasets/square/ph/low_dim_v141.hdf5
# Evaluate the trained checkpoint in robosuite
python -m robomimic.scripts.run_trained_agent \
--agent trained_models/.../model_epoch_2000.pth \
--n_rollouts 50 --video_path eval.mp4
HDF5 형식은 자기 설명합니다. 각 궤도는 관찰, 행동, 보상 및 객체 포즈를 포함합니다. 그래서 당신은 로보미믹 훈련 루프를 완전히 우회하고 10 라인 글러브 코드로 에피소드를 자신의 프레임워크 (레로봇, 옥토, 디푸저) 로 입력할 수 있습니다.
일반적인 사용 사례 및 모델 조화를
- BC 기본 라인. Robomimic에서 BC-RNN 및 BC-Transformer는 모든 새로운 모방 종이 이길 수 있는 가공적인 기본 라인입니다.
- 방산 정책 평가.
치의 방산 정책 논문에서는 로보미믹을 주요 기준으로 사용했으며, 모든 후속 논문에는 동일한 작업 목록이 있습니다. - 오프라인 RL 비교. MG (머신 생성) 스플릿은 오프라인 RL 연구에 특별히 설계된 몇 안 되는 실제 로봇 조작 데이터 세트 중 하나입니다.
- 시민-현실 교육과정. 과제는 MuJoCo 기반이기 때문에 팀은 종종 실제 데이터로 전환하기 전에 Robomimic Lift 또는 Square에서 실제 로봇 프랭카 정책을 따뜻하게 시작합니다.
벤치마크 & 랭킹보드
로보미믹은 작업 당 50 개 이상의 로롤을 평균적으로 수행합니다. 퍼포시전 정책은 PH 분할에서 리프트 및 캔, 95% + 스퀘어, 80% + 교통 및 도구 행에 대해보고합니다. 참조 번호를 위해 [코드 로보미믹 항목을 가진 문서] (
기술 깊은 다이빙: PH vs MH vs MG 데이터
로보미믹의 가장 유용한 설계 결정은 모든 작업이 세 가지 데이터 품질 정제에 배포된다는 것입니다. **Proficient-Human (PH) **는 작업에 대한 광범위한 연습을 가진 단일 전문가 텔레오퍼레이터로부터 200 개의 시범입니다. **Mixed-Human (MH) **는 다양한 기술력을 가진 여섯 개의 텔레오퍼레이터로 나뉘어 300 개의 시범입니다. 이는 궤도 모양, 성공률 및 의 의 의의에 대한 현실적인 이질성을 도입합니다. **Machine-Generated (MG) **는 세 가지 미적 인 SAC 에이전트에서 300 개의 배포입니다. 특히 미적 인 행동 정책 가정하에 따라 오프라인 RL를 연구하는 데 사용됩니다.
CoRL 2021 논문에서 실증적인 점수는 PH 데이터에 대한 BC-RNN가 모든 작업에 대한 테스트된 오프라인 RL 방법을 일치하거나 제치고 있다는 것입니다. MH 데이터에서 격차가 좁지만 BC는 여전히 승리합니다. MG 데이터에서만 오프라인 RL 방법 (특히 CQL 및 IRIS) 가 BC보다 더 나은 성능을 발휘합니다. 이는 BC가 데이터만큼만 좋을 수 있다는 이론적 기대에 부합합니다. 이 때문에 방출 정책과 후속 논문에서는 PH와 MH 숫자가 거의 항상 먼저 보고됩니다.
또 다른 미묘하지만 중요한 세부 사항은
알려진 한계
- ** 시뮬레이션만.** 모든 데이터는 MuJoCo 생성되어 있습니다. Sim-to-real 전송은 직접 지원되지 않으며 귀하의 고유의 무작위 처방이 필요합니다.
- 작은 작업에 대한 커버리지. 200-300 개의 데모는 현대 VLA 표준에 의해 작습니다.
- 언어 지침이 없습니다. 작업은 자연어 아닌 ID로 식별됩니다. 따라서 Robomimic는 언어 조건 정책을 직접 훈련시킬 수 없습니다.
- 프랑카/소이어만. 크로스 인보디먼트 전송은 오픈 X- 인보디먼트 또는 유사한 것을 결합해야 합니다.
FAQ
LIBERO가 존재하면서 Robomimic는 비참한가요? 아니
** 데이터 세트를 사용하지 않고 Robomimic를 훈련 프레임워크로 사용할 수 있습니까?** 예
** 새로운 알고리즘을 기본으로 만드는 가장 빠른 방법은 무엇입니까?** 전송된 구성으로 모든 6 개의 작업에 대해 BC-RNN 및 PH 데이터에 대한 분포 정책을 실행하십시오. 이것은 ~ 2 GPU-일 정도 걸립니다. 그리고 재생 가능한 비교점을 제공합니다.







