Guides(으)로 돌아가기

ALOHA 로봇: 스탠퍼드 오픈소스 바이맨્યુઅલ 텔레오퍼레이션 시스템

완전한 ALOHA 로봇 가이드: 그것이 무엇인지, 전체 BOM 및 비용 ($ 17K-$ 32K), ROS2 및 ACT와 설정, 두 가지 수동 작업 훈련, 그리고 비용 효율적인 대안 $ 4,500에서.

[← 가이드]

ALOHA에 대해 알아야 할 모든 것 -- 모든 실험실에서 다중 로봇 학습을 가능하게 한 플랫폼입니다. 건축과 비용, 설비, 훈련, 그리고 대안까지요.

알로하 는 무엇 입니까?

ALOHA는 비용이 낮은 오픈소스 하드웨어 시스템으로, 두 개의 수동 통신을 위한 스탠퍼드 대학교에서 토니 자오, 비카쉬 쿠마르, 세르게이 레바인, 첼시 핀에 의해 개발되었으며, 2023 년 논문 "하비용 하드웨어와 함께 미세한 양형 쌍방향 조작을 배우는 것"에서 ALOHA 데이터와 작동하도록 설계된 모방 학습 알고리즘 ACT (트랜스포머와 액션 킹) 와 함께 소개되었습니다.

ALOHA 이전에는 두 가지 수동 조작 연구가 비용이 많이 드는 산업용 로봇 (Fanka Emika Pandas 2개 8만 달러 + 또는 Baxter 2천만 달러) 와 광범위한 사용자 지정 엔지니어링이 필요했습니다. ALOHA는 리더-따라자 구성의 소비자 수준의 두 개의 로봇 팔이 효과적인 조작 정책을 훈련시키는 고품질의 양동력 시범 데이터를 수집할 수 있다는 것을 보여주었습니다.

이 시스템은 전세계 수십 개의 실험실에서 복제되었으며 여러 변형이 탄생했습니다. 특히 Mobile ALOHA (전체 텔레오퍼레이션에 대한 바퀴 기반을 추가) 및 ALOHA 2 (Google DeepMind의 향상된 버전으로 하드웨어 용납률이 더 높습니다). 원래의 ALOHA 하드웨어 디자인, 소프트웨어 및 훈련 코드는 완전히 오픈 소스입니다.

알로하 의 중요성

ALOHA의 중요성은 하드웨어 자체는 아닙니다. 기본적으로 테이블에 묶인 두 개의 비-레프트 로봇 팔입니다. 그 영향은 세 가지 기여로 인해 발생합니다.

  • 민주화 된 쌍방향 데이터 수집. 리더-후보 설계는 인간 운영자가 프로그래밍 없이 쌍방향 작업을 시범적으로 수행할 수 있게 한다. 운영자는 리더의 팔을 들고 작업을 자연스럽게 수행한다. 후보의 팔은 카메라가 관찰을 기록하는 동안 움직임을 반영한다. 이것은 대학 연구소에 접근 할 수있는 비용으로 최초의 대규모 쌍방향 시범 데이터 세트를 생산했다.
  • **행동 변환기 (ACT) 와 함께 작업중화 (Action Chunking with Transformers, ACT) ** 같은 논문에서 소개된 ACT 알고리즘은 한 번에 한 행동보다는 100 가지의 미래의 행동을 한 번에 예측합니다. 이것은 이전 모방 학습 접근 방식을 괴롭힌 합성 오류를 극적으로 감소시켜, 이전 방법들이 20-40%를 달성한 작업에서 80-90%의 성공률을 달성합니다.
  • ** 오픈소스 재생 가능성.** 모든 구성 요소 - CAD 파일, BOM, ROS2 드라이버, 데이터 기록 스크립트, ACT 훈련 코드, 사전 훈련된 모델 - 는 공개되어 있습니다. 이것은 로봇 커뮤니티 전체에 걸쳐 빠른 채택과 반복을 가능하게 했습니다.

정지형 ALOHA vs 모바일 ALOHA

ALOHA 플랫폼은 두 가지 주요 구성으로 존재한다. 어떤 것을 건설하거나 구매할 것인지 결정하기 전에 그 차이를 이해하는 것이 필수적입니다.

Feature Stationary ALOHA Mobile ALOHA
Base Fixed table mount AgileX Tracer wheeled base
Follower arms 2x ViperX 300 S2 2x ViperX 300 S2
Leader arms 2x WidowX 250 S 2x WidowX 250 S
Action space 14-DOF (7 per arm) 16-DOF (14 arm + 2 base velocity)
Cameras 2 wrist + 1 overhead 2 wrist + 1 overhead + 1 side (optional)
Hardware cost $17,000-22,000 $28,000-35,000
Setup time 2-4 weeks 4-8 weeks
Best for Tabletop bimanual tasks Tasks requiring locomotion + manipulation

대부분의 팀에게는 정지형 ALOHA가 올바른 출발점입니다. 모바일 ALOHA는 이동성 능력에 대한 비용과 상당한 통합 복잡성을 10,000-15,000 달러에 추가합니다. 작업이 하나의 작업장에서 이루어지면 - 조립, 포장, 부엌 준비, 실험실 조작 - 정지형 ALOHA (또는 [OpenArm DK1]T8)) 는 충분합니다.

모바일 변종의 상세한 비용 분포는 [Mobile ALOHA Cost Breakdown](T9 참조).

ALOHA 시스템 아키텍처

ALOHA의 아키텍처를 이해하는 것은 하나 만들거나, 다른 하나를 사거나, 데이터 수집을 완전히 외부에 공급하는지를 평가하는 데 도움이 됩니다.

하드웨어: 리더-따라자 텔레오퍼레이션

ALOHA는 리더-따라자 (또한 마스터-노예) 구성을 사용합니다. 각 팔쌍은 다음과 같습니다.

  • ** 후속 팔 (ViperX 300 S2):** 작업을 수행하고 객체와 상호 작용하는 로봇 팔. 그것은 6 DOF + 지갑 (7 총), Dynamixel XM / XH 시리즈 servos를 사용하며, 전체 확장에서 750g의 유용 부하를 가지고 있습니다. 텔레오퍼레이션 중에, 그것은 50 Hz에서 리더 팔의 관절 위치를 반영합니다.
  • ** 리더 팔 (WidowX 250 S):** 인간 조작자 (Human operator) 가 들고 움직이는 팔. 후속자보다 가볍고 접근성이 짧으며, 장기적인 데이터 수집 세션에서 조작을 편리하게 합니다. 중력 보완을 통해 힘 피드백을 제공합니다.

리더와 후속 팔은 Dynamixel U2D2 어댑터를 통해 USB를 통해 동일한 내장 컴퓨터에 연결된다. 제어 루프는 리더 팔에서 50 Hz에서 공동 위치를 읽고 후속 팔에 일치하는 위치 명령을 전송합니다. 투명한 텔레오퍼레이션을 위해 전체 엔드-투-엔드 지연시간은 10 ms 이하로 유지되어야 합니다 (운전자는 이동과 추종자의 응답 사이에 지연을 느끼지 않아야 합니다).

카메라 시스템

ALOHA는 인텔 리얼센스 깊이 카메라를 세 가지 위치에서 사용합니다.

  • ** 두 개의 손목 카메라 (RealSense D405):** 후속 팔목에 설치되어 조작 작업 공간의 근접적인 경치를 제공합니다. D405의 최소 깊이 범위는 7cm로 잡기 동안 근현지 감지에 적합합니다.
  • 1개의 오버헤드 카메라 (RealSense D435): 작업 공간 위에 설치되어 공간적 맥락을 위 아래로 볼 수 있습니다. 이 카메라는 두 팔과 작업 공간 레이아웃의 상대적 위치를 캡처합니다.

이 카메라들은 모두 기록된 데이터에 대한 효과적인 정책을 훈련시키기 위해 일시적으로 동기화되어야 합니다. 인텔 멀티 카메라 동기화 케이블은 하드웨어 수준의 동기화를 제공합니다. 이 장치 없이는 소프트웨어 타임스테임 조정은 30-60 ms의 기저를 도입하여 훈련 성능을 10-20%로 떨어뜨립니다.

계산 스택

보드 컴퓨터 (일반적으로 인텔 NUC 또는 동등한 미니 PC) 는 동시에 세 가지 작업을 처리합니다.

  1. ** 실시간 제어:** 다이너믹셀 세로버스를 통해 50 Hz에서 리더의 관절 위치와 추종자의 관절 위치를 읽는.
  2. ** 카메라 캡처:** 3개의 카메라에서 30fps로 동기화된 RGB 프레임을 녹음합니다.
  3. ** 데이터 기록:** 후속 훈련에 필요한 HDF5 파일로 모든 센서 데이터 (공동 위치, 속도, 카메라 프레임, 시간표) 를 기록한다.

로봇에 GPU가 필요하지 않습니다. 정책 훈련은 별도의 작업 스테이션 (RTX 4090 또는 클라우드 GPU) 에서 오프라인에서 진행됩니다. 정책 배포 (이하 인퍼런스) 는 ACT 모델의 NUC의 CPU에서 실행될 수 있습니다.

정지형 ALOHA 비용 분할

고정된 ALOHA 구성 ( 이동 기반이 없습니다) 는 훨씬 저렴하고 더 빨리 구축됩니다.

Component Cost Notes
2x ViperX 300 S2 follower arms $9,600 $4,800 each, Dynamixel XM/XH servos
2x WidowX 250 S leader arms $6,200 $3,100 each, lighter weight for operator comfort
2x Custom gripper assemblies $400-800 Parallel-jaw with Dynamixel XL330
3x Intel RealSense cameras $950 2x D405 wrist ($300 ea) + 1x D435 overhead ($350)
Intel NUC 13 Pro (onboard computer) $800-1,200 i7, 32GB RAM, 1TB NVMe
U2D2 adapters, USB hub, cables $350-500 4x U2D2 ($50 ea), powered USB hub, cabling
Mounting hardware, table clamps $200-400 Camera mast, arm base plates, clamps
Stationary ALOHA total $18,500-19,700 Hardware only, before labor
Training workstation (RTX 4090) $2,000-3,000 Separate desktop for offline training
Complete system total $20,500-22,700 Excluding integration labor

이 값은 완전히 기능적인 정지형 ALOHA의 최소 비용을 나타냅니다. 프로 어셈블리용은 2,0005,000달러를 추가하여 빌드를 외부에 공급하는 경우 추가합니다. 모바일 버전에 대해서는 AgileX 기반, 설치 프레임, 추가 배터리 및 통합에 대해 10,00015,000달러를 추가합니다. 전체 모바일 BOM를 위해 [분석한 모바일 ALOHA 비용 분배]T10을 참조하십시오.

소프트웨어 스택

ALOHA 소프트웨어 스택은 네 개의 계층으로 구성되어 있으며, 각 계층은 오픈소스이며 문서화되어 있습니다.

1. ROS2 겸손 (실천 시간 제어)

Ubuntu 22.04에 있는 ROS2 Humble는 통신 계층을 제공합니다.

  • Interbotix ROS2 패키지: ViperX 및 WidowX 팔의 드라이버. 50 Hz에서 공동 상태 출판 및 위치 명령 가입을 제공합니다.
  • RealSense ROS2 팩: 카메라 드라이버 노드에서 RGB 및 깊이 이미지를 30fps로 게시합니다.
  • ** 텔레오퍼레이션 노드:** 리더 팔 관절 위치를 읽고 50 Hz로 팔을 따라하는 팔에 일치하는 명령을 전송합니다.
# Install ROS2 Humble and ALOHA dependencies
sudo apt install ros-humble-desktop python3-colcon-common-extensions

# Install Interbotix arm drivers
curl 'https://raw.githubusercontent.com/Interbotix/interbotix_ros_manipulators/main/interbotix_ros_xsarms/install/amd64/xsarm_amd64_install.sh' > xsarm_install.sh
chmod +x xsarm_install.sh && ./xsarm_install.sh -d humble

# Install RealSense drivers
sudo apt install ros-humble-librealsense2* ros-humble-realsense2-camera

2. ALOHA 저장소 (전용사 및 기록)

공식 ALOHA GitHub 저장소는 리더-후보 텔레오퍼레이션 및 동기화된 데이터 녹화를 위한 스크립트를 제공합니다. 그것은 카메라 프레임 (30 fps) 와 공동 상태 데이터를 (50 Hz) 를 시간표 HDF5 에피소드로 조정하는 중요한 작업을 처리합니다. 각 에피소드는 다음과 같습니다.

  • T2: 모양 (T, 14) -- 지휘관의 관절 위치 (7 팔당)
  • T3: 모양 (T, 14) -- 측정된 관절 위치
  • T4: 모양 (T, 480, 640, 3) - 상공 카메라
  • T5: 모양 (T, 480, 640, 3)
  • T6: 모양 (T, 480, 640, 3)

3. ACT 교육 코드 (오프라인 정책 학습)

ACT (Transformers와 액션 킹) 는 ALOHA 데이터의 기본 훈련 알고리즘입니다. 주요 아키텍처 세부 사항:

  • 코더: ResNet-18 이미지 코더와 공동 상태 MLP를 통해 현재 관측 (공동 위치 + 카메라 이미지) 를 처리합니다.
  • ** 디코더:** CVAE (Conditional Variational 오토인코더) 를 가진 트랜스포머 디코더로 한 번에 100개의 미래의 행동을 예측한다.
  • ** 시간적 집합:** 배포 과정에서, 초복되는 행동 조각은 기하급수적 중량으로 평균되어, 연속적인 예측 사이의 전환을 부드럽게합니다.
# Train ACT policy on ALOHA data using LeRobot
python lerobot/scripts/train.py \
  policy=act \
  dataset_repo_id=your-username/aloha-task \
  env=aloha \
  training.num_epochs=2000 \
  training.batch_size=8 \
  policy.chunk_size=100 \
  policy.kl_weight=10

4. 르로봇 (현대 통합층)

[LeRobot] (T11) 는 ALOHA급 하드웨어의 표준 통합 계층이 되었습니다. 표준화된 데이터 기록, 데이터 세트 관리 (HuggingFace Hub로 밀어넣어), ACT/Diffusion Policy/TDMPC2의 훈련 파이프라인 및 배포 스크립트 등을 제공합니다. 새로운 ALOHA 빌드에서는 원래 ALOHA 저장소 스크립트보다는 처음부터 LeRobot을 사용하는 것을 권장합니다.

설정 안내서 개요

ALOHA 시스템을 구축하고 구성하는 데는 5 단계가 필요합니다. 자세한 단계별 지침은 [Mobile ALOHA Setup Guide] (무동형 및 모바일 구성 모두를 포함하고 있습니다).

1단계: 하드웨어 집합 (3-5일)

테이블 또는 프레임에 팔을 설치하고, 운영자 높이에서 리더 팔을 설치하고, 지갑을 설치하고, 카메라를 설치하고 모든 전자 장치를 연결한다. 중요한 세부 사항: 팔 기판은 1mm 이내에 공동 평면이어야 한다. 카메라 마운팅은 딱딱해야 한다 (어떤 플렉스는 일관성이 없는 데이터를 생성한다). 모든 볼트를 사양에 맞춰 동동이 필요하고 진동에 걸린 관절에 스레드클러를 적용한다.

단계 2: ROS2 설정 및 캘리브레이션 (3-7일)

우분투 22.04, ROS2 Humble, 인터보틱스 드라이버, 리얼센스 드라이버를 설치하십시오. 다이내믹셀 서버 매개 변수를 구성하십시오. baud 속도를 1M로 설정하고 각 관절에 대해 0 위치를 캘리브레이트하고 PID 이득을 설정하고 리더 팔에 중력 보상 설정을 설정하십시오. USB 장치 수열 순서를 확인하십시오.

3단계: 첫 번째 텔레오퍼레이션 테스트 (1~2일)

텔레오퍼레이션 노드를 실행하고 두 팔쌍 모두 올바르게 추적하는지 확인합니다. 확인: 리더에서 추종자 지연 (10 ms 이하여야 합니다), 추적 정확성 ( 추종자가 2도 이내에 리더 위치와 일치해야 합니다), 지잡기 동기화 (오픈 / 폐쇄 상태와 일치) 및 카메라 피드 (삼 카메라 모두 30 fps에서 깨끗한 프레임을 생산합니다). 데이터 수집을 진행하기 전에 모든 문제를 해결합니다.

4단계: 시연 녹음 (가행중)

작업을 정의하고, 녹음 스크립트를 구성하고, 시범을 수집하기 시작합니다. 복잡한 작업에 시간을 투자하기 전에 전체 파이프라인을 확인하기 위해 간단한 검증 작업 (픽 앤 प्लेस) 을 시작하십시오. 검증 작업에 50 개의 시범을 수집하고, 정책을 훈련하고 평가하십시오. 목표: 60%+ 성공률. 40% 이하라면, 더 많은 데이터를 수집하기 전에 하드웨어/계급을 디버깅하십시오.

5단계: 훈련 ACT 정책 (훈련 연주당 4~8시간)

데이터 세트를 HuggingFace Hub (또는 로컬 트레이닝) 로 밀어넣어 ACT 하이퍼파레머를 구성하고 트레이닝. 주요 하이퍼파레머: chunk_size=100, kl_weight=10, batch_size=8, num_epochs=2000. 확인 유효성 손실을 관찰하십시오. 훈련은 200+ 시대 동안 손실 평판을 수행합니다. 훈련된 정책을 평가하기 위해 로봇에 배포하십시오.

성능 기준

이 성공률은 원래 ACT 논문 (Zhao et al., 2023) 과 그 후의 ALOHA 출판물에서 나온다. 하드웨어 기량, 시범의 수, 운영자 기술에 따라 결과가 달라질 것입니다.

Task Success Rate Demos Used Notes
Slot insertion (bimanual) 91% 50 One arm holds socket, other inserts battery
Fork retrieval from pot 82% 50 Requires precise grasp in confined space
Coffee making (multi-step) 62% 50 Long-horizon, 5+ sequential sub-tasks
Table bussing (mobile) 85% 50 mobile + 370 static Mobile ALOHA with co-training
Door opening (mobile) 76% 50 mobile + 370 static Whole-body coordination required
Object handover to human (mobile) 68% 50 mobile + 370 static Requires detecting human presence and timing

** 기준에서 핵심 통찰력:** 공동 훈련은 모바일 작업에 매우 중요합니다. 위의 모바일 작업은 50 개의 모바일 시범을 사용했지만 370 개의 정적 쌍방향 시범과 함께 훈련되었습니다. 공동 훈련 없이는 동일한 50 개의 모바일 시범은 20-40% 더 낮은 성공률을 달성했습니다. 이것은 더 저렴한 고정된 설정에서 대부분의 데이터를 수집하고 모바일 정책을 얻기 위해 약간의 모바일 데이터를 추가할 수 있다는 것을 의미합니다.

ALOHA 대안 비교

여러 시스템은 ALOHA와 같은 두 가지 수동 원격 운용 기능을 다른 가격점과 다른 타협으로 제공합니다.

System Cost Key Advantage Key Limitation
Stationary ALOHA (DIY) $20,500-22,700 Original platform, large community Requires DIY assembly and ROS2 expertise
Mobile ALOHA (DIY) $28,000-35,000 Mobility + bimanual, co-training data Complex build, high total cost
OpenArm DK1 $12,000 Ships assembled, higher-torque servos, warranty Stationary only, smaller community
OpenArm 1 $4,500 Lowest-cost entry to robot learning Single arm only (no bimanual)
ALOHA 2 (Google DeepMind) N/A Improved hardware, better tolerances Not commercially available
UMI (Universal 조작 Interface) $2,000-3,000 No robot needed for data collection Single-arm, camera-only (no depth/force)
RCSV DK1 Lease $2,500/mo No upfront cost, includes maintenance Monthly recurring cost
RCSV Data Services $2,500 pilot No hardware at all, expert operators Limited to RCSV's task environments

ALOHA보다 OpenArm DK1을 고려해야 하는 이유

[OpenArm DK1] (T17) (12,000 달러) 는 DIY 구축 과정을 제거하는 ALOHA 호환 대안으로 특별히 설계되었습니다. 자작업 ALOHA에 대한 주요 장점은:

  • 선들이 집합되고 기량화되었습니다. 4~8주간의 제작시간은 없습니다. 첫날 첫 번째 시범을 수집하세요.
  • ** 더 높은 동력을 가진 세르보.** OpenArm의 사용자 지정 동기는 ViperX 팔의 다이내믹셀 XM430 세르보보다 30% 더 많은 동력을 제공하며, 더 나은 열 관리가 있어 과열과 관련된 정지 시간을 줄인다.
  • ALOHA- 호환형 데이터 형식. ALOHA와 동일한 14DOF 액션 공간과 HDF5 에피소드 형식을 기록합니다. DK1 데이터에 훈련된 정책은 ALOHA 데이터에 미세하게 조정될 수 있습니다.
  • 90일 보증 및 지원. 교체 부품 및 기술 지원이 포함됩니다. DIY ALOHA 빌드에는 보증이 없습니다.
  • ** 44% 더 적은 비용.** 비교적 정지형 ALOHA에 비해 12,000달러와 20,500달러에서 22,700달러

RCSV가 ALOHA 프로젝트 에 어떻게 도움 이 됩니까

ALOHA를 처음부터 만들고, 대안을 찾고 있거나, 단순히 두 개의 수동 데이터를 필요로 하는 경우, RCSV는 결과를 얻기 위해 여러 가지 방법을 제공합니다.

미리 제작된 하드웨어

[OpenArm DK1] (T18) (12,000 달러) 는 완전히 집착 및 캘리버링되어 첫 날 데이터 수집에 준비되어 있습니다. 단일 팔 프로젝트에서 [OpenArm 1] (T19) (4,500 달러) 는 더 낮은 입구점을 제공합니다. 두 시스템은 LeRobot와 통합되어 ALOHA 호환 데이터 형식을 생성합니다.

전문가 사업자 데이터 수집

RCSV의 [데이터 수집 서비스] (T20) 는 전문적으로 수집된 쌍방향 시범 데이터 세트를 제공합니다. 우리의 운영자는 고품질 훈련 데이터를 생산하는 일관된 기술로 ALOHA 스타일의 텔레오퍼레이션에 훈련되어 있습니다. 우리는 ACT, 디스포시전 정책 및 기타 모방 학습 알고리즘과 호환되는 HDF5, LeRobot 또는 RLDS 형식으로 데이터 세트를 제공합니다.

  • ** 파일럿 프로젝트:** 2,500달러 - 한 작업에 50~100개의 시범공연, 2주 안에 전달
  • ** 전 캠페인:** 8,000달러 - 200~500개의 다양한 작업에 대한 시범, 해설과 품질 검증

로봇 임대

RCSV의 [로봇 임대 프로그램] (T21) 는 월간 임대 조건에 따라 완전히 집착하고 캘리버드 된 쌍방향 시스템을 제공합니다. 월당 2,500 달러에 DK1을 임대하고 (관리 및 지원을 포함) 자신의 환경에서 데이터를 수집합니다. 이것은 초기 자본 투자를 제거하고 즉시 시작할 수 있습니다.

연구소 접근

RCSV는 샌프란시스코, CA 및 올스턴, MA에서 장착된 로봇 실험실을 운영합니다. 데이터 수집, 프로토타입 제작 또는 평가에 대한 ALOHA 클래스 하드웨어에 때때로 액세스 할 필요가 있다면, 실험실 액세스 조정을 [자신에 문의하십시오.]

자주 묻는 질문

**ALOHA와 ACT의 차이점은 무엇입니까? **

ALOHA는 하드웨어 플랫폼 (로봇 팔, 카메라, 텔레오퍼레이션 설정) 이다. ACT (Transformers와 액션 킹) 는 ALOHA 데이터에서 조작 정책을 훈련하는 소프트웨어 알고리즘이다. 그들은 같은 논문에서 도입되었지만 독립적입니다. 당신은 ALOHA 데이터를 수집하고 ACT 대신 퍼포션 정책으로 훈련 할 수 있습니다. 또는 당신은 비-ALOHA 하드웨어에서 데이터를 훈련 할 수 있습니다. 알고리즘에 대한 자세한 내용은 [ACT 가이드]T23을 참조하십시오.

** 조작을 넘어서는 작업에 ALOHA를 사용할 수 있습니까? **

ALOHA는 특히 쌍방향 조작을 위해 설계되었습니다. 그 팔은 제한된 유용무로 (750g) 및 도달 (300mm) 를 가지고 있으며, 무거운 업무를 수행하거나 고정밀 조립 (관성 2mm 이상) 또는 세르보의 현재 감지 능력 이상의 힘 제어가 필요한 작업에 적합하지 않습니다. 개별 손가락 제어가 필요한 유능한 조작을 위해 오르카 손 또는 Paxini Gen3 촉각 장갑 를 참조하십시오.

** 얼마나 많은 시연이 필요합니까? **

제한된 변동성 (정부 객체 위치, 단일 접근 전략) 을 가진 간단한 쌍방법 작업에 대해서는: 50개의 시범은 ACT로 60-80%의 성공률을 달성할 수 있다. 높은 변동성 (자발적인 객체 위치, 여러 유효한 접근법) 과목에서는: 견고한 수행을 위해 200-500개의 시범이 필요하다. 다단계 작업 (5+ 연속 하위 과제): 300-1,000개의 시범이 필요하다. 우리의 [비용당 시범 분석] (T26) 는 상세한 지침을 제공합니다.

** 2026년에도 ALOHA가 여전히 유효한가요?**

예. 새로운 플랫폼에도 불구하고, ALOHA는 가장 널리 복제되고 가장 잘 문서화 된 쌍방향 조작 시스템으로 남아 있습니다. 큰 커뮤니티는 다른 옵션보다 더 많은 공유 데이터 세트, 사전 훈련 된 모델 및 문제 해결 자원을 의미합니다. ALOHA 데이터 형식 (14-DOF 공동 위치 + 멀티 뷰 이미지) 은 쌍방향 학습의 실질적인 표준이 되었고, 대부분의 새로운 알고리즘은 ALOHA 작업에 벤치마크를 한다.

** 알로하에 능숙한 손을 더할 수 있나요? **

알로하 는 1DOF 평행 턱이다. 여러 손가락의 손 (예: [오르카 손]T27), 17-DOF) 로 교체하면 액션 공간 차원이 크게 증가하고, 텔레오퍼레이션의 복잡성이 증가한다. 또한 다른 텔레오퍼레이션 인터페이스가 필요합니다. 표준 리더-따라자 접근 방식은 자연스럽게 현명한 손까지 확장되지 않습니다. 장갑 기반의 텔레오퍼레이션 (Paxini Gen3 촉각 장갑을 사용하여)

** ALOHA 데이터 세트를 어디서 찾아서 알고리즘을 테스트할 수 있을까요? **

HuggingFace Hub에서 여러 공개적인 ALOHA 데이터 세트들이 사용 가능합니다. 원래의 ACT 종이 데이터 세트 (슬롯 삽입, 포크 검색, 커피 제조), 모바일 ALOHA 데이터 세트 (탁구버싱, 문 개통), 그리고 다양한 작업에 대한 커뮤니티 기여한 데이터 세트. RCSV는 또한 [데이터 세트 페이지]에 큐레이션 데이터 세트를 유지합니다.

관련 독서

모바일 ALOHA 비용 분할 · 모바일 ALOHA 설정 안내서 · 행동 쪼개림 변환기 (ACT) · 행동 대 전파 정책 · 레로봇 시작 · 이미테이션 학습 안내서 · 데이터 서비스 · 로봇 임대

빌드 없이 ALOHA- 호환성 쌍방향 데이터를 얻으십시오

RCSV는 12,000 달러에서 미리 제작된 양동기 하드웨어를 제공하고 2,500 달러에서 전문적인 데이터 수집, 2,500 달러 / 달에서 시스템 임대 서비스를 제공합니다. DIY 빌드를 건너뛰고 즉시 데이터를 수집하기 시작합니다.

OpenArm DK1 ($12K) 데이터 서비스 ($2.5K)