Datasets(으)로 돌아가기

ALOHA: 저비용 쌍방향 텔레오퍼레이션 데이터셋

ALOHA 쌍방향 텔레오퍼레이션 데이터 세트: 50+ 디모가 미세한 작업에 따라, 오픈 하드웨어 참조. 30분 안에 ACT/방송 정책을 열 <unk> 지금 다운로드

오픈하드웨어의 쌍용 원전 운영 플랫폼과 가전적 모방 학습 데이터 세트가 액션 킹 (ACT), 모바일 ALOHA, RT-ALOHA를 뒷받침합니다.

TL;DR

Metric Value
Task count ~10 canonical fine-manipulation tasks (plus dozens of LeRobot re-collections)
Robots 2 ViperX-300 follower arms + 2 WidowX leader arms (6-DoF each)
Modalities 14-DoF joint positions, 2x gripper widths, 4x RGB cameras at 50 Hz
License MIT
Size ~50 demos per task, ~5-15 GB per task package
Hardware cost ~$20K to build a full ALOHA cell

ALOHA는 무엇 입니까?

ALOHA (Bimanual 원격조작의 저비용 오픈소스 하드웨어 시스템) 는 토니 자오와 스탠퍼드 대학의 동료들이 ACT (Action Chunking with Transformers) 논문에서 함께 하는 기구와 데이터 세트로 도입했다. 이 혁신은 모방 학습 커뮤니티에 간단하지만 결정적이었다: 6DoF ViperX-300 추종자 팔과 두 WidowX 리더 팔을 결합함으로써 ALOHA는 단일 인간 운영자가 자연 자세와 함께 50 Hz에서 두 가지 수동 미세한 조작을 원격으로 수행 할 수 있게 했다. 그 디자인 선택은 새로운 과제를 열었습니다. 지프 띠를 고, 마감 컵을 열고, 배터리를 고, 커피에 설탕을 고, 단일 팔의 텔레오프 기기들은 반복적으로 실행할 수 없습니다.

공개된 데이터 패크는 일반적으로 동기화 된 관절 상태, 지갑 너비 및 4 개의 RGB 카메라 스트림 (윗, 왼쪽 손목, 오른쪽 손목, 외부) 로 작업 당 50 개의 시범을 포함합니다. HDF5 레이아웃은 쌍방향 모방 학습의 실제 스케마로 자리 잡았고, LeRobot 프로젝트는 Hugging Face의 스트리밍 데이터 로더에 직접 연결되는 파킷 거울을 유지합니다.

ALOHA는 모바일 ALOHA, ALOHA Unleashed, 그리고 ALOHA 2 라인 데이터 세트의 전체를 낳았고, 물리 지능의 π0 미세조음 요리법과 구글의 RT-ALOHA 및 ALOHA-코스모스-포리시 리लीज의 참조 플랫폼입니다. "미세한 쌍방향 조작"에 대한 최첨단 주장을 하는 모든 논문은 ALOHA 형식의 작업에 대해 거의 항상 보고합니다.

다운로드 및 로딩 방법

# Reference hardware / firmware / data
git clone https://github.com/tonyzhaozh/aloha.git
cd aloha && pip install -r requirements.txt

# Download ALOHA static tasks via LeRobot
pip install lerobot
python -c "
from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
d = LeRobotDataset('lerobot/aloha_static_coffee')
print(d[0]['observation.images.top'].shape, d[0]['action'].shape)"

ALOHA 데이터에 대한 ACT 또는 퍼포시 정책 훈련에 대해, 가공된 입문점은 ACT 저장소에서 T1이며, 그것은 HDF5을 직접 읽습니다. VLA 미세 조정을 위해, 레로봇 도구 통한 RLDS로 변환하는 것은 가장 적은 저항의 경로입니다.

일반적인 사용 사례 및 결합

  • ACT 및 퍼포먼스 정책의 기본 라인. 50개의 작업에 대한 시범제도는 행동의 원본이며, ALOHA는 거의 항상 새로운 양행 정책 구조의 첫 번째 기준입니다.
  • VLA 정렬. π0, OpenVLA, RT-2 모두 공개 ALOHA 정렬 레시피를 가지고 있습니다.
  • ** 오픈 하드웨어 재생.** 장비의 재료 및 CAD의 청구서는 열려 있으므로 연구소는 일반적으로 부품들을 구입하여 정확한 장비를 재생하고, 작업 수집을 다시 기여합니다.
  • ** 모바일 조작.** 모바일 ALOHA는 바퀴 기반을 추가합니다. 데이터 세트는 형식 호환적이며 전체 신체의 조정 연구를 할 수 있습니다.

벤치마크 & 랭킹보드

ALOHA는 고정된 스위트보다는 플랫폼이기 때문에 단일 순위표가 없습니다. 각 작업은 자체 성공률에 의해 점수를 받는다. 작업별 헤드라인 결과와 가공적 하드웨어 참조를 위해 [AloHA 코드 입력] (T2) 과 [공식 프로젝트 페이지] (T3) 참조하십시오.