Blog(으)로 돌아가기

알로하 로봇: 그것이 무엇이며, 어떻게 작동하며, 어떻게 시작해야 하는가

ALOHA 로봇 가이드: 스탠퍼드의 두 가지 수동 텔레오퍼레이션 플랫폼, 두 개의 바이퍼X 팔. 전체 BOM, ACT 훈련 설정, 그리고 비용 효율적인 RCSV에서 4,500 달러에 시작됩니다.

ALOHA는 스탠퍼드 대학교의 두 가지 수동형 텔레오퍼레이션 플랫폼으로 처음으로 로봇이 칩 가방을 열거나 케이블을 묶거나 요리하는 것처럼 두 가지 손으로 조작하는 기술을 배울 수 있음을 증명했습니다. 현재는 세계에서 가장 많이 언급되는 두 가지 수동 연구 플랫폼입니다. 이 가이드 에서는 ALOHA가 무엇이며, 어떻게 작동하는지, 그리고 어떻게 사용 시작해야 하는지 설명합니다.

스탠퍼드 원산의 이야기

ALOHA 이중동력 텔레오퍼레이션에 대한 저렴한 오픈소스 하드웨어 시스템 은 스탠퍼드 모바일 조작 연구소에서 개발되었으며, 토니 Z. 자오 등이 2023년 저비용 하드웨어로 정밀화 된 이중동력 조작을 배우는 논문에서 발표하였다. ALOHA는 4개의 ViperX 300 및 WidowX 250 로봇 팔을 사용하였다 (당 측면 2개, 한쪽은 원격 조작의 리더, 한쪽은 추종자) ACT 알고리즘과 결합하여 20만 달러 이하의 총 비용으로 이전에 많은 배가 넘는 사용자 지정 설계 시스템을 필요로 한 작업을 수행하였다.

이 논문은 10개의 쌍방임 작업을 보여주었습니다. 여기에는 과자 조각을 풀어주거나, 슬롯에 배터리를 삽입하고, 구멍을 통해 로프를 하는 것 등이 포함되었습니다. 이 모든 것은 50개의 시범을 사용하여 80% 이상의 성공률을 가지고 있습니다. 이러한 결과는 로봇 커뮤니티를 놀라게 한 것은 작업이 신기 때문이 아니라 비용과 데이터 효율성 때문이었습니다. ALOHA와 ACT은 함께 접근 가능한 유능한 조작 연구의 새로운 기준을 마련했고 오늘날에도 계속되는 후속 작업의 물결을 촉발시켰다.

ALOHA 하드웨어 설계 및 모든 소프트웨어는 완전히 오픈 소스입니다. 재료 청구서, 조립 지침 및 ACT 교육 코드는 GitHub에서 공개되어 있습니다. 이 개방성으로 ALOHA는 사실상의 표준 양동 연구 플랫폼으로 자리 잡았습니다. 전세계 수십 개의 연구 그룹이 원래 설계의 변형을 실행하고 있습니다. RCSV는 데이터 서비스 및 [하드웨어 임대 프로그램](T8을 통해 ALOHA 클래스 플랫폼을 지원합니다.

전체 하드웨어 사양

정확한 하드웨어 구성을 이해하는 것은 중요한 이유는 작은 경각기 다른 팔 모델, 잘못된 카메라, 낮은 동전 세르보 이 참조 ACT 구현과 호환되지 않는 데이터 세트를 생성할 수 있기 때문입니다.

무기: ViperX 300 6DOF (따라자) 및 WidowX 250 6DOF (리더)

Spec ViperX 300 (Follower) WidowX 250 (Leader)
DOF 6 + gripper 6 + gripper
도달 거리 750mm 625mm
적재 하중 750g (at full extension) 250g (at full extension)
반복성 ~1mm ~2mm
Servos DYNAMIXEL XM540 + XM430 DYNAMIXEL XM430 + XL430
Communication USB via U2D2 adapter, 1Mbps USB via U2D2 adapter, 1Mbps
Control rate 50Hz (20ms loop) 50Hz (reads only)
Weight 3.6kg 2.1kg
Price (per arm) ~$5,500 ~$3,200

카메라 시스템

원래의 논문은 3개의 로지텍 C922 웹캠 (손목 장착 + 1 오버헤드) 를 사용하여 480x640 해상도, 50fps로 녹음하였다. ALOHA 2는 이미지 품질 향상 및 선택적 깊이를 위해 인텔 리얼센스 D405 카메라로 업그레이드되었다. RCSV의 ALOHA 스테이션은 이 업그레이드의 배경을 위해 우리의 [카메라 설정 안내]를 참조하십시오.

전체 집회 비용 분할

Component Qty Unit Cost Subtotal
ViperX 300 6DOF arms (follower) 2 $5,500 $11,000
WidowX 250 6DOF arms (leader) 2 $3,200 $6,400
Cameras (RealSense D435i or D405) 3-4 $300 $900-1,200
U2D2 USB adapters 4 $30 $120
Power supplies (12V) 4 $35 $140
Aluminum extrusion frame + brackets 1 set $500 $500
Camera mounts, cable management, misc 1 set $200 $200
Workstation PC (RTX 4090, 32GB RAM) 1 $2,500 $2,500
Total (DIY build) ~$21,800-22,100
Total (with Mobile ALOHA base) + AgileX Tracer ($10,000) ~$32,000

경험 있는 빌더의 집합 시간은 약 20-30시간이다. 첫 번째 빌드에서는 디바그링 다이нами셀 통신 문제, 카메라 캘리브레이션, 소프트웨어 설정을 포함한 40-60시간의 예산을 사용합니다. 가장 일반적인 집합 실패 포인트는: 다이нами셀 다이아시 체인 가이브링 (실반 버스 ID 할당이 팔 세그먼트가 순서대로 반응하지 못하게 만듭니다), 카메라 케이블 라우팅 ( 너무 긴 케이블은 손목 회전을 제한합니다) 및 프레임 딱딱성 (부조한 추출 볼트가 카메라 이미지 품질에 영향을 미치는 진동을 만듭니다).

소프트웨어 설정: 클론에서 첫 번째 데모

ALOHA 소프트웨어 스택은 두 가지 구성 요소를 가지고 있습니다. 텔레오퍼레이션 제어 루프 (읽기 리더, 명령 추종자, 기록 데이터) 및 ACT 훈련 파이프라인.

# ACT 저장소 git clone T27 cd act conda를 생성하고 설치합니다 -n aloha python=3.8.16 -y conda를 활성화하십시오 aloha pip 설치 -r 요구 사항.txt # 팔 제어용 인터보틱스 SDK를 설치합니다 # 따라: T28 sudo apt 설치 ros-humble-interbotix-xsarm-control # 팔 USB 장치를 구성합니다 # 팔마다 /etc/udev/rules.d/의 고유 USB 포트 지도가 필요합니다 # 리더: /dev/ttyDXL_transl_leader _leader 오른쪽 # 리더 오른쪽: /dev/ttyDXL_leader _right # 팔로워 왼쪽: /ttyDXL_testy_left # 팔로워: /dxl\testy_left # 팔로워: /dxl\\Leplower \script \py_leader _key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key_key

녹음 스크립트는 에피소드당 다음과 같은 구조를 가진 HDF5 파일을 생성합니다. T0 (오버헤드), T1, T2, T3 (14 차원 공동 위치: 팔당 7), T4 (14 차원 공동 위치 목표), 및 T5. 각 에피소드는 카메라 해상도와 에피소드 길이에 따라 일반적으로 20-50MB의 자립 HDF5 파일입니다.

ROS2 통합

원래의 ALOHA 코드는 인터보틱 파이썬 SDK를 직접 사용하지만 (ROS가 아닌) 많은 팀은 MoveIt2, 카메라 드라이버 및 시각화와 호환성을 위해 ROS2와 통합합니다. T6 패키지는 ViperX 및 WidowX 팔의 ROS2 노드를 제공합니다. ROS2 ALOHA 설정의 주요 고려 사항은:

  • 50Hz 제어 속도를 유지하기 위해 리더와 추종자 팔의 다이내믹셀 보드 속도를 1Mbps로 설정
  • 4개의 동시 USB 시리즈 연결 사이의 버스 충돌을 피하기 위해 전용 USB 허브 (다이시 체인 허브가 아닌) 를 사용한다
  • 카메라 드라이버를 구성하여 압축된 이미지를 게시하여 대역폭을 줄이도록 설정합니다 1 카메라에 30fps의 원료 640x480 RGB는 27.6 MB/s, 4 카메라에 110 MB/s입니다
  • 카메라 주제의 시간 동기화를 위해 ROS2 메시지 필터를 사용하십시오

하드웨어 아키텍처: 2가지 방식의 리더-따라자 설정

ALOHA 시스템은 각 팔에 한 쌍씩 두 개의 운동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동 리더 팔은 최종 효과자 유용 부하 요구 사항이 없습니다. 왜냐하면 그것은 단지 뒷 운전이 가능하고 운영자에게 토크 피드백을 제공해야 하기 때문입니다.

두 개의 완전한 리더와 추종자 쌍이 두 개의 두 개의 수동 구성으로 인해 ALOHA는 뛰어난 작업에 독특하게 적합합니다. 인간의 손이 자연적으로 두 개의 수동입니다. 한 손이 객체를 잡고 다른 하나는 조작하거나 두 손이 동시에 두 개의 접촉 지점을 필요로하는 작업을 완료하기 위해 협력합니다. 단일 팔 로봇은 단지 복잡한 고정관념이나 순서로 이러한 작업을 근접적으로 처리할 수 있으며, 쌍손 로봇은 직접 처리할 수 있다. ALOHA 형태 요소는 공유 테이블 고정관념에 두 팔이 장착되어 있으며, 운영자가 시스템의 앞에 앉아있는 테이블 표 조작 작업에 최적화된다.

원래의 ALOHA 종이에 있는 카메라 설치는 3개의 카메라를 사용하였다. 하나는 상공 (전공 작업 공간의 조류의 시선), 하나는 왼쪽 손목, 하나는 오른쪽 손목에 사용되었다. 세 개의 카메라 모두 ACT 정책에 대한 시각 관측으로 사용되었다. 이 다방면 시선 설정은 매우 중요합니다. 손목 카메라는 포착 및 접촉 사건의 근접적인 시선을 제공하며, 상면 카메라는 두 손으로 조정하는 글로벌 맥락을 제공합니다. 단일 카메라 ALOHA 변종은 조정 무거운 작업에 대한 정책 성능을 측정 할 수 있게 낮게 보여줍니다.

대체 양동력 설정: RCSV DK1 키트

ALOHA는 두 가지 수동적인 텔레오퍼레이션 연구의 유일한 옵션이 아닙니다. RCSV의 DK1 두 가지 수동 키트는 정확한 ALOHA 호환성에 비해 데이터 수집 처리량을 우선시하는 팀들에게 몇 가지 장점을 제공합니다.

Feature ALOHA (DIY Build) RCSV DK1 Kit
Arms ViperX 300 + WidowX 250 OpenArm 1 leader-follower pairs
Total cost ~$22,000 + assembly $9,000 pre-assembled
Assembly time 20-60 hours 2 hours (unbox + calibrate)
적재 하중 (per arm) 750g 500g
Data format HDF5 (custom schema) HDF5 + LeRobot export
ACT compatibility Native Via format conversion
Community size Largest (100+ labs) Growing (RCSV ecosystem)

DK1는 즉시 데이터를 수집하기 시작해야 하고, 방전 정책이나 VLA (특정 로봇에 대한 건축학적인 비정론적) 으로 훈련할 계획) 을 하는 팀들을 위한 더 좋은 선택이다. ALOHA는 발표된 ACT 결과와 정확한 호환성이 필요한 팀이나 ALOHA 오픈소스 생태계에 기여하고자 하는 팀들을 위한 더 좋은 선택이다. DK1에 대한 자세한 내용은 [하드웨어 카탈로그] (T10) 를 참조하십시오.

알로하 사용 사례: 어떤 것 이 효과적 이며 어떤 것 이 효과적 이 없는 것

알로하가 우수 한 과제

  • ** 테이블 표의 쌍방향 조작:** 컨테이너를 열고 접는 천, 손 간 이동, 두 손으로 조립. 리더와 후속 인터페이스는 운영자에게 자연스러운 쌍방향 제어 기능을 제공합니다.
  • ** 식품 준비 연구:** 부드러운 재료를 섞고, 고, 쏟아부고, 잘라내는 것. 750g의 유용 한 부하 는 대부분의 주방 재료를 처리 한다.
  • ** 케이블 및 변형 가능한 물체 조작:** 밧줄, 포장, 묶음. 손목 카메라는 변형 가능한 접촉 작업에 필요한 근접 조상을 제공합니다.
  • ** 규모의 데이터 수집:** 오픈소스 설계는 여러 개의 동일 방송국을 만들 수 있음을 의미합니다. RCSV는 대량 캠페인을 위해 4 개의 ALOHA 클래스 방송국을 동시에 실행합니다.

알로하가 힘들어 하는 임무

  • 중고 물체 조작: 750g의 유용용 부하 제한 (완전 확장) 은 많은 산업 물체를 제외합니다. 물 병, 책 또는 전력 도구는 안전 처리 봉투를 초과합니다.
  • ** 1mm 이하의 정밀 삽입:** ViperX 세르보의 ~1mm 반복성이 정밀성을 제한합니다. 미 미리미터 미만의 작업에 대해서는 힘 피드백 (기반 ALOHA에 포함되지 않습니다) 또는 더 높은 정밀 팔 플랫폼이 필요합니다.
  • ** 대규모 작업 공간 작업:** 750mm 범위는 작업 공간을 대략 1m x 0.5m의 테이블 표면으로 제한합니다. 부엌 카운터 또는 래프 사이를 이동해야 하는 작업에는 모바일 ALOHA 또는 다른 플랫폼이 필요합니다.
  • 고속 조작: 50Hz 제어 루프는 반응속도를 제한한다. 예상치 못한 방해에 대한 빠른 반사 반응이 필요한 작업 (던져 던진 물체를 잡는 것, 역동적 전달) 은 현재 ALOHA 능력 이외에 있다.

아울러, 알로하의 알고리즘

ACT (Action Chunking with Transformers) 는 ALOHA와 함께 개발되었으며 플랫폼의 주요 학습 알고리즘입니다. ACT는 트랜스포머 기반의 모방 학습 정책으로 향후 공동 위치의 을 예측합니다. 일반적으로 50Hz에서 100 시간 단계, 다음 동작이 아닌 2 초의 움직임을 커버합니다. 이 액션 킹 아키텍처는 순수 행동 복제의 합성 오류 문제를 크게 줄이고 있으며, 각각의 시간 단계에 작은 예측 오류가 작업 과정에서 큰 궤도 경각심을 축적합니다.

ACT 정책 아키텍처는 훈련 중에 CVAE (Conditional Variational 오토인코더) 에코더를 사용하여 각 시위의 잠그림 스타일을 캡처합니다. 기본적으로, 인간이 작업을 수행하는 방식과 작업 결과가 무엇이었는지 구별되는 "어떻게"에 대한 압축된 표현입니다. 이것은 정책이 모드 평균 유물없이 인간 시위의 자연적인 변형을 모델링 할 수 있습니다. 추론 시, 오직 CVAE 디코더만이 실행되며, 현재 관찰과 샘플링된 잠복한 벡터를 기준으로 동작 조각을 생성합니다.

작업당 50개의 시범을 가진 ALOHA 데이터 세트에서 ACT 훈련은 하나의 RTX 3090 GPU에서 24시간을 소요된다. 원래 종이에 출시된 훈련 코드는 표준 ALOHA 작업에 대한 문서화된 하이퍼 파라미터로 실행하기 쉽습니다. 사용자 지정 작업에 있어서 가장 영향력 있는 하이퍼파라미터는 크기의 크기가 (konfig에서 k_중) 이다. 은 예상치 못한 혼란에 대한 반응성 비용으로 시간적 일관성을 향상시킵니다. RCSV의 [플랫폼]T11) 는 ALOHA 형식의 데이터 세트들을 위한 사전 구성된 ACT 훈련 파이프라인을 포함한다.

모바일 알로하: 테이블에서 알로하를 제거

2024년 같은 스탠퍼드 그룹에서 발표한 모바일 ALOHA는 ALOHA 개념을 모바일 기반으로 확장했다. 이중 수동 팔 설정은 AgileX 트래서 모바일 기반에 설치되어, 시스템에서 부엌 카운터에 접근하는 공간 내에서 다른 위치로 이동할 수 있도록 해 주며, 식탁으로 이동하여 통로를 탐색하면서 조작을 위해 ALOHA 팔을 유지했다. 모바일 ALOHA는 오븐에 새우를 요리하고, 접시 세척기를 부착하고, 패키지를 배달하는 등의 작업을 보여줬습니다.

모바일 ALOHA는 전체 신체의 텔레오퍼레이션 개념을 도입했습니다. 운영자는 개별 제어 인터페이스 또는 통합 인터페이스를 통해 이동 기체와 두 팔을 동시에 제어합니다. 모바일 ALOHA의 데이터 수집은 테이블 ALOHA보다 훨씬 복잡합니다. 왜냐하면 정책은 탐색과 조작을 조정하는 법을 배워야 하기 때문에 환경의 공간적 변화와 객체 변이를 다루는 시범이 필요합니다.

모바일 ALOHA는 또한 공동 훈련을 도입했다: 모바일 ALOHA 정책의 공동 훈련은 모바일 조작 시범과 정적 ALOHA 조작 시범에 관한 것이다. 공동 훈련은 모바일 플랫폼에서 조작 성능을 향상시켰으며, 테이블탑 데이터에서 얻은 양동적인 조작 지식이 모바일 맥락으로 유용하게 전달된다는 것을 제안했다. RCSV는 모바일 ALOHA 호환 데이터 세트를 제공하고 샌프란시스코 시설에서 모바일 조작 시범을 수집할 수 있습니다. [자신에 연락하십시오]

ALOHA, ALOHA 2 및 상업적 파생 상품의 차이

2024년 말 발표된 ALOHA 2, 몇 가지 차원에서 원본에 비해 개선되었습니다. 더 나은 반복성을 가진 더 높은 품질의 팔, 향상된 카메라 부착 시스템 및 케이블 라우팅 복잡성을 줄이는 수정된 손목 디자인. 또한 전기 시스템은 다이세이 체인 전력 케이블이 아닌 전용 전력 유통판을 사용하도록 업데이트되었으며, 긴 데이터 수집 세션에서 신뢰성을 향상시킵니다. ALOHA 2는 하드웨어 변동에 대한 일반적인 경고를 적용하여 다른 한쪽에서 평가된 원래의 데이터 세트와 완전한 소프트웨어 호환성을 유지합니다.

몇몇 상업적 공급업체는 현재 ALOHA 호환 플랫폼을 판매합니다. ALOHA 기계 및 소프트웨어 사양을 준수하는 미리 조립된 테스트 된 시스템, 건설자가 부품들을 공급하고 팔을 직접 조립 할 필요 없이. 이러한 상업적 ALOHA 시스템은 DIY 재료 청구서에 비해 비용이 많이 들지만 설치 시간 및 조립 오류의 위험을 크게 줄입니다. RCSV의 하드웨어 카탈로그에는 ALOHA 호환적인 구성이 포함되어 있습니다. 현재 옵션과 가격에 대한 [스토어]T13) 참조.

RCSV 를 통해 ALOHA 를 시작 하는 방법

RCSV는 ALOHA 기반 연구의 모든 단계를 지원합니다. 처음 시작하는 팀에게는 [로봇 리싱 프로그램] (T14) 를 통해 ALOHA 플랫폼 리싱을 제공합니다.

데이터 수집을 위해, 우리의 관리 서비스 는 샌프란시스코 시설에서 시범을 수집할 수 있는 훈련된 ALOHA 운영자를 제공합니다. ACT, 퍼포시전 정책 및 OpenVLA 훈련 파이프라인과 호환되는 RLDS/LeRobot 형식으로 제공되는 데이터 세트. 우리의 운영자는 두 가지 수동 조정 작업에 경험이 있으며 처음 연구자보다 더 깨끗한 데이터 세트를 생성하는 구조화된 품질 프로토콜을 따르고 있습니다. 파일럿 프로그램은 200 개의 시범을 위해 2,500 달러에서 시작됩니다. 작업이 필요하다면 우리는 또한 위치 데이터 수집 캠페인을 위해 귀하의 사이트를 방문 할 수 있습니다.

정책 교육 및 평가에 있어서 [RCSV 플랫폼]T16) 는 ALOHA 정책에 대한 미리 구성된 ACT 교육 파이프라인, 실험 추적 및 평가 도구를 제공합니다. 우리의 [표준표]T17) 에는 ALOHA에 대한 작업 평가들이 포함되어 있어 정책 수행을 참조 구현과 비교할 수 있습니다. 당신이 처음부터 두 가지 수동 조작 연구 프로그램을 구축하거나 기존 시스템의 성능을 밀어 넣을 수 있는지, [RCSV의 팀]T18) 는 올바른 접근 방식을 계획하는 데 도움이 될 수 있습니다.

관련 독서