모바일 ALOHA 설정 가이드: 하드웨어, 소프트웨어 및 첫 번째 작업
모바일 ALOHA 비용은: AgileX 트래서 기반, ViperX 300 팔, 계산 <unk> 총 BOM ~ $ 32K. 더 3 더 저렴한 대안 $ 4,500. ROS2 설정 및 ACT 훈련 걸음마 완료.
[← 블로그]
모바일 ALOHA는 바퀴 기반의 전체 신체 텔레오퍼레이션 플랫폼입니다. 이 가이드는 하드웨어 BOM에서 첫 번째 성공적인 모방 학습 작업까지의 완전한 설정을 다루고 있습니다.
모바일 ALOHA 는 무엇 입니까
스탠퍼드에서 토니 조 등이 개발한 모바일 ALOHA는 원본 ALOHA (비매뉴얼 텔레오퍼레이션에 대한 저비용 오픈소스 하드웨어 시스템) 를 확장하여, 바이매뉴얼 팔 시스템을 모든 방향 이동 기반에 설치합니다. 이것은 전체 신체의 텔레오퍼레이션을 가능하게 합니다. 운영자는 팔과 기지를 동시에 제어하며, 문을 열고, 바퀴를 밀어내는 것, 이동 중 테이블을 청소하는 것, 그리고 방 사이를 이동하는 것 등 조작과 함께 이동이 필요한 작업을 보여줍니다.
모바일 ALOHA의 핵심 연구 기여는 다양한 정적 ALOHA 데이터와 함께 소수의 모바일 시범 (50 에피소드까지) 를 통해 모바일 조작 작업에 놀라울 정도로 잘 일반화되는 정책을 생산한다는 것을 보여줍니다. 이것은 비싼 모바일 시범이 더 저렴한 정적 양동 데이터로 보완되어 접근 방식이 처음에는 보이는 것보다 더 실용화된다는 것을 의미합니다.
모바일 ALOHA는 로봇 학습 분야에서 가장 복제된 연구 플랫폼으로 자리잡았다. 여러 연구소, 회사 및 제작자 그룹이 변형을 구축했으며, 원래의 하드웨어 설계는 완전히 오픈 소스입니다. 그러나, 제작 과정은 논문에서 제안하는 것보다 더 복잡성을 포함하고 있으며, 이 가이드는 학술 출판물이 생략하는 실용적인 세부 사항을 다루고 있습니다.
하드웨어 재료 목록
완전한 모바일 ALOHA 시스템은 4가지 하드웨어 부품을 필요로 합니다. 모바일 기반, 조작 팔 (리더와 후속), 카메라 시스템, 컴퓨팅 스택. 2026 가격에 대한 자세한 BOM는 다음과 같습니다.
** 이동식 기지:**
- AgileX 트래서 차분 드라이브 기본: 구성에 따라 4,500-5,500 달러. 이것은 원래 논문에서 사용되는 플랫폼입니다. 대안은 더 높은 유용 부하를 위해 AgileX 스카우트 미니 ($ 6,800) 또는 연구 수준의 오도메트리를 위해 클레어파트 샤칼 ($ 20,000+) 를 포함합니다. 그러나 트래서는 비용 제한된 빌드을위한 표준 선택입니다.
- 사용자 지정 설치 프레임 (알루미늄 추출 80/20 또는 비슷): 재료 에 대해 300-600 달러, 그리고 가공. 프레임 은 팔 기지를 이동 플랫폼 에 단단 히 연결 하여 카메라 와 계산 상자 에 대한 설치 지점을 제공 해야 한다.
** 후속기 (사업을 수행하는 로봇기):**
- 2x 트로센 로봇 바이퍼X 300 S2 6-DOF 팔: 각각 4,800 달러, 총 9,600 달러. 이것은 ALOHA 빌드용 표준 추종 팔입니다. 그들은 위치, 속도 및 전류 (토크) 피드백을 가진 다이내믹셀 XM / XH 시리즈 서보를 사용합니다. 전체 확장 시 용량은 750g이며, 시스템이 조작 할 수있는 물체의 무게를 제한합니다.
- 2x 사용자 지정 지갑 집합: 각각 200~400달러. 표준 ALOHA 지갑은 Dynamixel XL330 세르보를 가진 간단한 병렬 턱 지갑이다. 3D 프린트 된 손가락 패드는 대부분의 작업에 적합하다.
지도자 팔 (전용전화시장에서 운영자가 들고 있는):
- 2x 트로센 로봇 와이도우X 250 S 6-DOF 팔: 각각 3,100 달러, 총 6,200 달러. 와이도우X는 위퍼X보다 가볍고 (0.53 kg) 가량 짧으며, 앉아 있거나 서있는 운영자가 여러 시간 동안 데이터를 수집하는 세션에서 편안하게 지을 수 있도록합니다. 동일한 다이내믹셀 세로 가족은 투명한 운동 지도를 보장합니다.
- 리더 팔 설치 브래크: $100-200. 이동 플랫폼 프레임에 허리 높이에 설치되어 있어 운영자가 리더 팔을 들고 플랫폼 뒤에서 걸을 수 있습니다.
** 카메라 시스템:**
- 2x 인텔 리얼센스 D405 손목 카메라: 각각 300달러, 총 600달러.
- 1x 인텔 리얼센스 D435 오버헤드 카메라: 350달러.
마스 위에 설치되어 있고, 위에서 아래로 작업 공간을 볼 수 있습니다. - 카메라 장착 및 USB 케이블: 100~150달러
** 계산:**
- 내장 작업장: 인텔 NUC 13 Pro 또는 동등한 미니 PC, i7, 32GB RAM, 1TB NVMe SSD: $ 800-1,200. 이 실시간 원격 제어, 카메라 캡처 및 데이터 녹화를 처리합니다. GPU가 필요하지 않습니다. 훈련은 오프라인에서 이루어집니다.
- 훈련 작업장 (러보트에서 아닌 별도로): ACT/방산 정책 훈련에 대한 NVIDIA RTX 4090 또는 A100을 갖춘 데스크톱 또는 클라우드 인스턴스. 지역 훈련 기계에 대한 예산은 2,000
3,000 달러 또는 클라우드 GPU 인스턴스를 14 달러/시간으로 사용하십시오.
전체 비용 분할
| Category | Cost Range |
|---|---|
| Mobile base (AgileX Tracer) | $4,500-5,500 |
| Follower arms (2x ViperX 300 S2) | $9,600 |
| Leader arms (2x WidowX 250 S) | $6,200 |
| Grippers and mounting | $700-1,200 |
| Camera system (3x RealSense) | $950-1,100 |
| Onboard compute | $800-1,200 |
| Frame, cables, misc hardware | $500-800 |
| Total (robot only) | $23,250-25,600 |
| Training workstation (separate) | $2,000-3,000 |
| Total (complete system) | $25,250-28,600 |
이것은 처음부터 하나의 모바일 ALOHA 시스템을 만드는 전체 비용입니다. 원래 스탠퍼드 논문에서는 특정 구성에 대해 약 32,000 달러를 인용했습니다. 이 차이점은 2026 구성 요소 가격과 고급 구성보다는 기본 트래서 사용을 반영합니다. 참고로, 이에는 데이터 수집을 위한 사업자 노동이 포함되지 않으며, 이는 어떤 모방 학습 프로젝트에서 지배적인 지속적인 비용입니다.
소프트웨어 스택: ROS2, ACT, LeRobot
모바일 ALOHA 소프트웨어 스택은 세 개의 층으로 구성되어 있으며 각 층은 특정 역할을 수행합니다.
** 실시간 제어 계층 (ROS2 Humble Ubuntu 22.04).** 낮은 수준의 제어 시스템은 ROS2 노드로 실행됩니다. 각 팔에 대한 다이내믹셀 드라이버 노드, AgileX 플랫폼에 대한 기본 드라이버 노드, 그리고 각 RealSense 카메라에 대한 카메라 드라이버 노드. 중요한 요구 사항은 모든 노드가 동기화된 시계를 공유하는 것 (Chrony 또는 PTP를 사용) 이며 리더-투-후보 명령 루프는 50 Hz에서 10 ms 미만의 지연으로 실행된다는 것입니다.
** 텔레오퍼레이션 및 녹음 계층.** 녹음 노드는 모든 공동 상태 주제를 및 카메라 이미지 주제를 가입하고 공유된 시계와 시간을 표시하고 HDF5 파일에 동기화 된 에피소드를 작성합니다. 각 에피소드는: 50 Hz에서 14DOF 공동 위치 (7 팔당) , 14DOF 공동 속도, 지갑 열, 30 fps에서 3 카메라 스트림, 기본 속도 명령어 및 에피소드 메타데이터 (task label, 성공 플래그, 운영자 ID) 를 포함합니다. Hugging Face의 LeRobot는 ALOHA 스타일 하드웨어에 대한 표준화된 녹음 스크립트를 제공하여 이러한 동기화를 올바르게 처리합니다.
** 훈련 계층 (프라인을 사용하지 않고, 훈련 작업장에서) ** ACT (Transformers와 액션
처음 배움 과제
이 과제 들 을 어렵게 하기 위해 시작 하십시오. 그 각각은 다음 과목 에 필요한 기술 을 쌓아 올 것입니다.
태스크 1: 정지형 양동력 전달. 로봇은 한 팔로 물체를 들고 다른 팔에 넘겨줍니다. 기지는 정지 상태입니다. 이것은 기본 운동 복잡성을 추가하지 않고 양동력 기정 및 조정을 검증합니다. 목표: 50 개의 시범, 첫 훈련에서 정책 성공률은 60-70%입니다.
** 작업 2: 테이블 버스 ( 테이블을 청소) ** 로봇은 테이블에서 물체를 가져다가 로봇 플랫폼의 쓰레기통에 넣고, 다음으로 드롭-오프 위치로 운전합니다. 이것은 조작과 함께 기본 움직임을 도입합니다. 공동 훈련 기술은 여기서 중요합니다. 목표: 50개의 모바일 시범과 함께 훈련된 데이터, 50-60%의 성공률
** 작업 3: 문 을 열기.** 문 을 가까이 가며 손잡이를 잡으시고, 기저 움직임을 조정 하는 동안 끌어 당기십시오. 이것은 전체 몸의 조정 을 보여주는 가전적 모바일 ALOHA 작업 입니다. 기저 는 문 이 흔들리는 동안 팔과 동기화 되어 움직여야 합니다. 이것은 테이블 버스링 보다 훨씬 더 어렵기 때문 에 접촉 동적 이 궤도 전체 에 걸쳐 변화 합니다. 목표: 100개의 시범, 초기 40-50%의 성공률
** 임무 4: 인간에게 물체 전달.** 로봇은 사람 에게 항해 하고, 팔을 뻗어, 사람이 물체를 잡을 때 풀어 준다. 이 일 은 인간 존재 를 감지 하고, 풀어내는 시간을 파악 하는 것 을 요구 한다. 목표: 사람 의 위치 를 다양 한 75 개 시범, 45~55%의 성공률.
일반적인 설정 오류
이러한 오류는 RCSV가 첫 번째 모바일 ALOHA 시스템을 만드는 실험실에서 가장 자주 볼 수 있습니다.
- Skip leader arm 중력 보완. 중력 보완 없이, 리더 팔은 운영자에게 무거운 것 같습니다. 운영자 피로감이 30분 후 시작되고 데이터 품질은 심각하게 악화됩니다. 중력 보완 모드에서 Dynamixel 전류 제한을 30~50%로 설정하십시오.
- 리더-후배 통신을 위한 와이파이를 사용한다.* * WiFi를 통해 리더-후배 제어 루프를 라우팅하면 20-100 ms의 변수 지연이 도입된다. 시스템은 느려지고 운영자는 과잉 보상하여 거친 시범을 만들어낸다. 내장 컴퓨터에서 직접적인 USB-to-Dynamixel 연결을 사용한다. 리더와 후배 팔은 동일한 물리적 기계에 있어야 한다.
- ** 카메라 동기화를 무시.** 손목 카메라와 오버헤드 카메라가 동기화되지 않으면 기록된 관측은 시간적 오차를 포함합니다. 30fps에서 2 프레임 오차는 66 ms입니다. 이는 빠른 조작에 중요합니다. 하드웨어 트리거 동기화를 사용하십시오 (RealSense 멀티 카메라 동기화 모듈, $50) 또는 데이터 로딩 중에 최소 타임 스탬프 기반의 조화를 사용하십시오.
- 정착 작업 중 기지를 잠금하지 않습니다. 이동 시범을 증진시키기 위해 조작만 하는 데이터를 수집하고 있다면 (동력 훈련 접근법) 기지 모터 브레이크를 작동시키거나 기지의 유동을 막기 위해 소프트웨어 속도 제한을 사용하십시오. 정착 수집 중 기지 유동은 유용한 이동 정보를 제공하지 않고 데이터 세트에 소음을 추가합니다.
- 케이블 관리 부족.** 느슨한 케이블은 가구에 잡히고, 움직임 중에 팔 관절에 잡히고, 때때로 에피소드 중 연결이 끊어진다. 에피소드 중간에 연결이 끊어지는 카메라는 전체 에피소드를 손상시킵니다. 모든 이동 케이블에 케이블 체인이나 나선 밧줄을 사용하며 각 수집 세션 시작에서 케이블 라우팅을 확인합니다.
- 일반적인 작업 정의를 가진 데이터를 수집. "표를 청소하십시오"는 너무 모호하다. "A 위치에서 파란색 잔을 가져와 회색 캔에 넣으십시오"는 충분히 구체적입니다. 작업 라벨 내의 일관성이 없는 시범은 정책을 혼란스럽게 합니다. 한 에피소드를 수집하기 전에 작업 설명서를 작성하십시오.
단계별 집회 가이드
이 섹션에서는 물리적 조립 순서를 다루고 있습니다. 로봇 하드웨어에 경험이 있는 사람이라면 조립에 대한 2-3 일 또는 이것이 첫 번째 빌드라면 4-5 일.
**단계 1: 기본 플랫폼 준비 (24시간) ** AgileX 트래커를 박스 해체하고 모든 구성 요소를 포장 목록에 확인하십시오. 시작하기 전에 배터리를 완전히 충전하십시오 (46시간 동안 비어있는 상태에서). 트래커를 평면 표면에 설치하고 AgileX 진단 도구를 실행하여 모든 방향으로 움직임을 확인합니다. 일반적인 문제는: ROS2 드라이버가 작동하기 전에 업데이트가 필요할 수있는 펌웨어와 함께 트래커가 배에 올라갑니다. 진행하기 전에 AgileX GitHub 저장소에서 최신 펌웨어를 플래시하십시오.
** 2 단계: 설치 프레임 구성 (4-8 시간).** 스탠퍼드 ALOHA CAD 도표에서 명시된 크기에 알루미늄 추출 (80/20 시리즈 10 또는 그 준하는) 를 절단한다. 프레임에는 세 가지 중요한 설치 표면이 있다. 두 팔 기판 (왼쪽, 오른쪽, 중앙에서 중앙까지 40cm 떨어져) 및 상부 카메라에 대한 수직 마스트. 모든 팔 장착 표면은 1mm 이내에 공동 평면으로 있어야합니다. 집착 중에 기계의 수준을 사용하십시오. 모든 프레임 볼트를 8-12 Nm로 동동하십시오. 동동이 미치지 않은 볼트는 팔 움직임 중에 프레임 플렉스를 허용합니다. 이는 데이터 품질을 떨어뜨리는 변동적인 운동적 오프셋을 도입합니다.
** 3 단계: 팔 팔을 설치하는 것 (팔당 3~4 시간).** 각 ViperX 300 S2를 제공된 M6
** 단계 4: 리더 팔 설치 (팔당 23 시간).** 각 WidowX 250 S 를 리더 팔 자지대에 허리 높이로 설치한다. 리더 팔은 운영자가 플랫폼 뒤에 걷는 동안 편안하게 붙잡을 수 있도록 배치되어야 한다. 전형적인 설치 높이는: 지상에서 90100cm. 중력 보완을 위해 현재 기반 위치 모드에서 리더 팔 세르보를 구성한다. 편안한 동작을 위해 전류의 40%를 정해 놓습니다. 각 리더 팔을 다양한 자세로 풀어서 중력 보완을 테스트합니다.
** 5 단계: 지갑 집합 (1~2시간씩 지갑).** 제공된 부품에서 평행 턱 지갑 또는 3D 프린트 사용자 지정 손가락 패드를 집합하십시오. 지갑 세르보 (Dynamixel XL330) 는 팔 세르보와 같은 버스에 연결됩니다. 디나믹셀 위치 단위에서 0 (완전히 닫힌) 에서 1200 (완전히 열린) 까지의 가동 범위 설정. 부드러운 물체에 대한 잡을 수 있도록 TPU ( 유연한 필라멘트) 에서 3D 프린트 손가락 패드. 패드 두께: 2-3 mm는 과도한 변형 없이 좋은 적합성을 제공합니다.
6 단계: 카메라 설치 (2~3 시간). D405의 두 개의 손목 카메라를 제공된 또는 사용자 지정 브래킷을 사용하여 후속 팔 손목에 설치하십시오. D405는 최소 깊이 범위가 7cm로, 가까운 범위에서 조작하기에 적합합니다. 각 손목 카메라를 지갑 평면과 비교하여 30-45도 아래로 지향하여 압축 영역을 최적의 커버리지를 위해 사용하십시오. D435 상부 카메라를 작업 공간 위 80120cm 높이로 기둥에 설치하여 두 팔 작업 공간의 명확한 관점을 위해 4560°로 각도하여 작업 공간을 구부리하십시오. 모든 카메라 USB 케이블을 15-20cm 간격으로 손부리 따라 케이블 클램프로 고정하십시오.
** 단계 7: 계산 설치 (1-2 시간).** 프레임 기본판에 인텔 NUC 또는 그 준하는 것을 설치하여, 반 진동 마운트를 (필요한 - 기본 운동은 USB 연결을 느슨하게 할 수 있는 진동을 전송한다). 모든 USB 장치를 연결: 2x U2D2 (추적 팔), 2x U2D2 (추적 팔), 3x RealSense 카메라, 1x AgileX 기반. 카메라에 USB 3.0 허브를 사용해서 충분한 대역폭을 확보하세요.
ROS2 소프트웨어 스택 설정
소프트웨어 스택은 Ubuntu 22.04와 ROS2 Humble를 필요로 한다. Ubuntu 24.04 또는 ROS2 아이언/자즈지 사용 하지 마십시오. 2026년 이후 더 새로운 버전에서 인터보틱스 패키지는 완전히 검증되지 않았습니다.
기반 운영 체제 설치:
# Install ROS2 Humble (follow official docs, then):
sudo apt install ros-humble-desktop python3-colcon-common-extensions
# Install Interbotix ROS2 packages for arm control
curl 'https://raw.githubusercontent.com/Interbotix/interbotix_ros_manipulators/main/interbotix_ros_xsarms/install/amd64/xsarm_amd64_install.sh' > xsarm_install.sh
chmod +x xsarm_install.sh && ./xsarm_install.sh -d humble
# Install RealSense SDK and ROS2 wrapper
sudo apt install ros-humble-librealsense2* ros-humble-realsense2-camera
# Install AgileX ROS2 driver
cd ~/colcon_ws/src
git clone https://github.com/agilexrobotics/agx_sdk_ros2.git
cd ~/colcon_ws && colcon build --symlink-install
# Install LeRobot for data recording and training
pip install lerobot
구조 및 기량:
- 다이내믹셀 마법사를 사용하여 모든 세르보에서 다이내믹셀 보드 속도를 1M (1000000) 로 설정합니다. 기본 57600 보드는 팔당 7 세르보의 50 Hz 제어에 너무 느립니다.
- 세르보 제로 위치 를 가릴라: 각 팔 을 기계적 홈 위치 로 이동 하여 코더 오프셋 을 기록 한다. 이 오프셋 은 각 팔 에 대한 인터보틱스 YAML 구성 파일 에 들어간다.
- 리더-따라자 지도를 구성하십시오: 각 리더 관절은 해당 후자 관절에 1:1를 지도합니다. 인터보틱스 텔레오퍼레이션 예는 이 지도를 상자 밖으로 제공합니다. 그러나 데이터를 수집하기 전에 모든 7 개의 관절 (그리퍼를 포함하여) 이 올바르게 추적하는지 확인합니다.
- 시간 동기화를 설정: 크로니를 설치하고 모든 노드를 동일한 시스템 시계를 사용하도록 구성합니다. 카메라 시간표는 깨끗한 데이터에서 공동 상태 시간표에서 5 ms 이내에 있어야합니다. 동기화를 확인하기 위해
T4 을 실행하십시오.
카메라 캘리브레이션 절차
카메라 가리브레이션은 선택적이지 않습니다. 가리브레이션되지 않은 카메라는 기록된 데이터에서 공간적 오차를 발생시켜 정책 성능을 10-25%로 떨어뜨립니다.
** 내성 캘리브레이션:** RealSense 카메라는 공장 캘리브레이션으로 전송되지만 이 캘리브레이션은 시간이 지남에 따라 또는 물리적 충격 후에 저하될 수 있습니다. RealSense 자격 캘리브레이션 도구를 실행하여 내성 캘리브레이션을 확인하십시오. 재발표 오류가 0.5 피클스 이상을 초과하면 칩에 있는 캘리브레이션을 다시 실행하십시오. 더 높은 정확성을 위해 9x6 쉐커보드 (25mm 광장) 을 가진
외부 기량 (카메라에서 기지 변환): 각 카메라의 위치와 기지 방향은 로봇 기지 프레임에 비해 정확하게 측정되어야 합니다. 손목 카메라에 대해서는 주로 팔의 앞 기계를 더하여 카메라 설치 오프셋에 의해 결정됩니다. 오버헤드 카메라에 대해 로봇 기반 프레임에 알려진 위치에 배치된 ArUco 마크를 사용하여 PnP 문제를 해결하여 카메라-베이스 변환을 계산하십시오. 팔을 알려진 위치에 명령하여 기계를 확인하고 최종 효과터의 카메라 투사기가 예상된 픽셀 위치와 5 픽셀 이내에 일치하는지 확인합니다.
** 멀티 카메라 동기화:** 인텔 멀티 카메라 동기화 케이블을 사용하여 리얼센스 D435 및 D405 카메라를 연결하십시오 (분별로 사용 가능, 약 $ 50). 한 카메라를 마스터로 구성하고 다른 카메라를 노예로 구성하십시오. 이것은 모든 카메라가 프레임을 동시에 캡처하는 것을 보장하여 카메라 스트림 사이에 30-60 ms의 긴장감을 유발하는 시간적 오차를 제거합니다. 하드웨어 동기화 없이 데이터 로딩 파이프라인에서 타임 스탬프 기반의 조화를 사용해야 하는데, 이는 신뢰도가 낮습니다.
첫 번째 데이터 수집: 검증 작업
실제 연구 작업을 시도하기 전에 전체 파이프라인 작업의 끝에서 끝까지 확인하기 위해 검증 데이터 세트를 수집하십시오.
** 작업 정의:** 테이블 중심을 벗어나 테니스 공을 들고 30cm 오른쪽으로 한 그릇에 넣는다. 이것은 가장 간단한 쌍방법 작업입니다. 한 팔이 공을 들고 다른 팔이 그릇을 안정적으로 유지한다. 50개의 시범으로 시스템에서 이 작업에 80%의 성공을 달성할 수 없다면, 가이드웨어 또는 캘리브레이션 문제가 있습니다.
** 수집 절차:**
- 첫 20 번의 시범 (정착 위치 검증) 에 테니스 공을 같은 위치에 배치하십시오.
- 다음 30개의 시범을 위해 20cm 반경 내에서 공의 위치를 변화시켜야 한다 (지적 다양성).
- 각 시범은 15~30초 동안 활동적인 텔레오퍼레이션을 수행해야 합니다. 공이 떨어지거나, 배치가 그릇을 놓친 경우 또는 조작자가 2초 이상 교정 동작을 하는 경우를 거부하십시오.
- 레로봇의
T6 스크립트를 사용하여 모든 데이터를 기록합니다: T7
** 훈련 및 평가:** 레로봇 기본을 이용한 50 가지 시범을 통해 ACT을 훈련하십시오. 훈련은 하나의 RTX 4090에서 1-2 시간 안에 완료되어야 합니다. 정책을 적용하고 훈련 중에 볼을 볼 수 있는 위치에서 20 가지 평가 실험을 수행하십시오. 목표: 60%+ 성공률. 만약 40% 이하인 경우 더 많은 데이터를 수집하기 전에 다음을 확인하세요: 카메라 캘리브레이션 정확성, 리더-후보 추적 지연시간, 타임스테임 동기화 및 데이터 기록 완전성 (프레임이 떨어지지 않는다).
전동전율 및 안전
압축된 볼트는 알루미늄 추출의 끈을 띠게 한다. 압축된 볼트는 움직임 중에 프레임을 이동시킬 수 있다. 다음의 세부 사항을 따르십시오.
| Connection | Torque (Nm) | Notes |
|---|---|---|
| Frame extrusion joints (M8) | 10-12 | Use threadlocker on vibrating joints |
| Arm base mounting (M6) | 6 | Check monthly for loosening |
| Camera mount (M4) | 2-3 | Easy to strip; use calibrated driver |
| 그리퍼 finger pads (M3) | 1-1.5 | 3D-printed parts; low torque to avoid cracking |
| Base-to-frame (M8) | 12-15 | Critical for base stability; double-check after first drive test |
** 안전 사안:** ViperX 팔은 손상될 만큼 충분한 토크를 가지고 있다. 항상 소프트웨어 관절 제한을 적용하여 (Interbotix YAML 구성에서 설정) 팔이 운영자, 프레임 또는 서로 접촉하지 않도록 한다. 초기 테스트 중에 1.0 rad/s로 속도 제한을 설정하고 충돌 없는 동작을 확인한 후에 1.5 rad/s로 증가한다. 다이내믹셀 전력 공급에 연결된 하드웨어 전자 정지 버튼을 실행하여 즉시 서버 전원을 차단하고, 모든 데이터 수집 세션 전에 전자 정지 장치를 테스트합니다.
유지 관리 및 문제 해결
정기적인 유지 보수로 데이터 수집 정업시간이 발생하지 않습니다. 이 스케줄을 따르십시오.
- ** 각 세션 전에 (5분):** 케이블 연결을 확인하고 카메라 피드 확인하고 3 개의 자세에서 리더와 추종자를 추적하고 배터리 수준을 확인하고 (한 시간 동안 최소 40% 충전)
- ** 주간:** 모든 프레임 볼트를 느슨하게 확인하세요. 미크로섬유 천으로 카메라 렌즈를 깨끗하게 청소하세요. 1시간 동안 실행한 후 세르보 온도가 60C 이하인 것을 확인하세요.
- 매월: 카메라 외부 기계를 재계정 (오버헤드 카메라 마운트가 1개월 동안 1~2mm 정도 움직일 수 있다). 관절에 사용 가능한 다이내믹셀 세로 케이블을 검사한다. 보안 패치가 있는 경우 ROS2 패키지를 업데이트한다.
- ** 일반적인 문제 해결:** 세르보가 세션 중 응답을 중단하면 과열이 발생했을 가능성이 높습니다. 냉각을 10 분 동안 기다립니다. 문제가 지속되면 해당 관절의 TTL 케이블을 확인하십시오. 카메라 프레임이 떨어지면 USB 대역폭을 확인하십시오.
관련 독서
이미테이션 학습 가이드 · 행동과 전파 정책 · 로봇 카메라 설정 · 레로봇 시작 · 디모네스트 분석당 비용 · 데이터 해석 가이드 · 데이터 서비스
데이터 기록 구성
올바른 데이터 기록 구성은 수집된 시범들이 실제로 사용 가능한 정책을 훈련시킬 것인지 여부를 결정합니다. 잘못된 구성으로 기록된 데이터는 검토 중에 괜찮은 데이터를 생성하지만 동기화 오류, 잘못된 행동 공간 또는 실종 모달리 때문에 훈련 중에 실패합니다.
** 녹음 주파수.** 50 Hz (ALOHA 클래스 시스템 표준) 에서 합동 상태를 기록한다. 카메라 프레임은 30 fps. 힘과 동전 센서를 사용한다면 (선택하지만 접촉 부가한 작업에 권장된다) 데이터 로딩 중에 500 Hz에서 기록하고 50 Hz로 샘플을 하하하하하하하하하하하하하하하에 설정할 때 합동 상태 주파수를 일치하도록 기록한다. LeRobot의 녹음 스크립트는 이러한 주파수를 기본으로 처리한다.
행동 공간 구성. ACT는 절대적 공동 위치 목표가 액션으로 예상된다. 각 행동 벡터는 14 차원: 팔당 7 개의 관절 (6 개의 팔 관절 + 1 개의 지갑). 공동 위치는 방사선, 지갑 열은 다이내믹셀 위치 단위 (0-4095, 물리적 범위에 지도되어) 이다. 시간 단계 t에서 기록된 동작은 시간 단계 t에서 추적 팔이 측정된 위치가 아니라 명령받은 공동 위치에 해당하는 것을 확인합니다. 이 구별은 중요합니다. 왜냐하면 세르보 추적 지연은 측정된 위치가 항상 명령된 위치보다 약간 뒤떨어지는 것을 의미합니다.
** 에피소드 메타데이터.** HDF5 에피소드 파일마다 다음 내용이 포함되어야 합니다:
T8 : 모양 (T, 14), d형 float32 -- 각 시간 단계에 관장 공동 위치 T9 : 모양 (T, 14), d형 플롯32 -- 측정된 관절 위치 T10 : 모양 (T, 14), d형 플롯32 -- 측정된 관절 속도는 T11 : 모양 (T, 480, 640, 3), d형 uint8 -- 오버헤드 카메라 T12 : 모양 (T, 480, 640, 3), d형 uint8 T13 : 모양 (T, 480, 640, 3), d형 uint8 T14 : 모양 (T, 14), d형 float32 -- 세로 전류 가수 (선택, 접촉을 인식하는 정책에 유용하다) T15 : 모양 (T, 2), d형 float32 - 기본 선형 및 각형 속도 명령어 - 속성: 작업_명 (줄), 성공 (bool), 운영자_id (줄), 시간표 (ISO 형식)
# Verify a recorded episode for completeness
import h5py
import numpy as np
def verify_episode(filepath):
with h5py.File(filepath, 'r') as f:
T = f['/action'].shape[0]
checks = {
'action_shape': f['/action'].shape == (T, 14),
'qpos_shape': f['/observations/qpos'].shape == (T, 14),
'images_top': f['/observations/images/top'].shape[0] == T,
'images_lwrist': f['/observations/images/left_wrist'].shape[0] == T,
'images_rwrist': f['/observations/images/right_wrist'].shape[0] == T,
'no_nan_actions': not np.any(np.isnan(f['/action'][:])),
'joint_limits': np.all(np.abs(f['/action'][:]) < 3.14),
'episode_length': 50 < T < 3000, # 1-60 sec at 50Hz
}
for check, passed in checks.items():
status = 'PASS' if passed else 'FAIL'
print(f' {check}: {status}')
return all(checks.values())
공개 기록 오류:
- ** 시간표 추동:** 하드웨어 동기화 대신 소프트웨어 시간표를 사용하는 경우 카메라 프레임 시간표와 공동 상태 시간표가 전체 에피소드 전체에서 10 ms 이내에 조화되어 있는지 확인합니다. 파동은 긴 에피소드에서 축적됩니다. 모든 100 에피소드 후에 동기화 검사를 실행하십시오.
- ** 카메라 프레임이 떨어졌기:** USB 대역폭 분쟁은 USB 3.0 허브를 공유하는 3 개의 RealSense 카메라가 프레임이 떨어지는 것을 유발합니다. 카메라 프레임 수치가 예상 수와 같다는 것을 확인하십시오 (episode_duration * 30fps +/- 1 프레임). 프레임이 빠진 경우, HDF5 에피소드는 관찰-행동 쌍이 잘못 조율되어 훈련을 손상시킵니다.
- **지리프 액션 코딩 오류:**지리프 액션은 훈련 파이프라인과 동일한 코딩을 사용해야 한다. ACT는 팔 관절과 같은 좌표 공간에 지리프 위치를 예상한다 (라디언스 동등 또는 정상화 0-1). 녹음과 훈련 코딩 사이의 부합은 "정책이 작동하지만 지리프는 결코 닫지 않는다"는 가장 흔한 원인이다.
첫 번째 정책 을 훈련 시키십시오
검증 데이터 세트를 수집한 후, 레로봇에서 ACT 정책을 훈련시키는 것은 간단한 과정을 거친다.
# Step 1: Push your dataset to HuggingFace Hub (or train locally)
# Assumes data was recorded with LeRobot's record script
python lerobot/scripts/push_dataset_to_hub.py \
--raw-dir data/aloha_validation \
--repo-id your-username/aloha-validation \
--raw-format aloha_hdf5
# Step 2: Train ACT policy
python lerobot/scripts/train.py \
policy=act \
dataset_repo_id=your-username/aloha-validation \
env=aloha \
training.num_epochs=2000 \
training.batch_size=8 \
policy.chunk_size=100 \
policy.kl_weight=10 \
policy.n_obs_steps=1 \
wandb.enable=true
# Step 3: Evaluate on the real robot
python lerobot/scripts/control_robot.py record \
--robot-path lerobot/configs/robot/aloha.yaml \
--fps 50 \
--policy-path outputs/train/act_aloha_validation/checkpoints/last/pretrained_model \
--warmup-time-s 2 \
--episode-time-s 30 \
--num-episodes 20
** 가장 중요한 하이퍼파레머를 훈련시키는 것:**
T16 : 미래 시간 단계 100개를 예측한다 (50Hz에서 2초). 더 큰 조각은 합성 오류를 줄이지만, 작업 궤도가 시범을 통해 일관되게 유지되어야 한다. 100을 시작하여 정책이 흔들리면 50으로 줄일 수 있다. T17 : CVAE 정규화를 제어한다. 더 높은 값 (50-100) 은 더 부드러운 하지만 덜 정확한 동작을 만들어낸다. 더 낮은 값 (1-5) 은 더 날카로운 동작을 만들어내지만 위험 모드 붕괴. 첫 번째 작업에 [1, 5, 10, 50]를 스캔한다. T18 : RTX 4090에서 단일GPU 훈련 표준. 더 빠른 회전을 위해 80 GB VRAM를 가진 A100을 사용하면 16-32로 증가합니다. T19 : ACT는 일반적으로 1000~1500 시대를 중심으로 konverges. 검증 손실을 관찰하십시오. 200+ 시대를 Plateaus에 놓으면 훈련이 완료됩니다.
예산된 훈련 측정: 행동 MSE 손실은 처음 500 시대 동안 ~0.01에서 ~0.001까지 감소하고, 그 다음으로 konvergence로 ~0.0005까지 감소한다. 손실이 0.005 이하로 감소하지 않으면 데이터 품질 문제 (불합동적인 시범, 잘못된 시간표) 를 확인한다. KL 격차 손실은 1-5 nats로 안정되어야 한다. KL 분차가 0에 가까우면 KL 무게를 증가시켜요. CVAE는 단일 모드로 붕괴됩니다.
확장: 검증 과제 에서 연구 과제 까지
일단 검증 작업 (테니스볼 선택 및 장소) 이 60% 이상의 성공을 거두면 더 복잡한 작업으로 자신있게 확장 할 수 있습니다.
- 단지 볼륨이 아닌 다양성을 높여주십시오.** 200개의 시범과 다양한 객체 위치 (5cm의 그리드) 와 3-5개의 다른 객체들이 일정한 위치에서 하나의 객체로 500개의 시범보다 더 나은 정책을 훈련시킬 것입니다. 시작하기 전에 다양성 목표를 중심으로 수집 프로토콜을 설계하십시오.
- ** 모바일 작업에 대한 공동 훈련을 사용하십시오.** 50
100개의 모바일 시범을 수집하고 훈련 중에 200500개의 정적 양동력 시범과 결합하십시오. 정적 데이터는 조작 기술을 가르칩니다. 모바일 데이터는 기본 조정을 가르칩니다. 레로봇은 데이터 집합 목록을 받아들이는T20 매개 변수를 통해 멀티 데이터 세트 교육을 지원합니다. - ** 단계별 성공 모니터링.** 작업이 여러 단계 ( 접근, 잡기, 운송, 장소) 를 갖는 경우, 실패가 발생하는 곳을 추적하십시오. 만약 80%의 실패가 잡기 동안 발생한다면, 전체 에피소드를 다시 수집하는 대신, 잡기 단계에 대한 HG-DAgger 수정 사항을 수집하십시오.
- ** 반복용 예산.** 전형적인 주기는 50개의 디모를 수집하고, 훈련, 평가, 실패 모드를 식별하고, 그 실패를 대상으로 한 50개의 더 많은 디모를 수집하고, 재훈련하는 것입니다. 작업당 3-5개의 수집 훈련 주기를 예산합니다. RCSV의 관리된 데이터 수집 서비스는 이 반복 주기를 가속화 할 수 있습니다. 자세한 내용은 [데이터 서비스] (
T31 ) 페이지를 참조하세요. 파일럿 컬렉션 가격은 2,500달러부터 시작됩니다.
문제 해결 훈련 실패
실제 로봇에 ACT 정책이 작동하지 않는 경우 데이터를 다시 수집하기 전에 이 진단 가이드를 사용하십시오.
| Symptom | Likely Cause | Fix |
|---|---|---|
| Robot does not move | Action normalization mismatch | Verify action stats (mean/std) match between training and deployment config |
| Arms collide with each other | 시연 include a wide range of arm positions; policy interpolates between modes | Add joint limit safety checks in deploy script; increase KL weight to 50 to reduce mode averaging |
| Policy drifts after 2-3 seconds | Control frequency mismatch: training at 50Hz, deploying at 30Hz | Match --fps between record and deploy commands exactly |
| 그리퍼 never closes | 그리퍼 action polarity inverted or normalized incorrectly | Check gripper min/max in the YAML config; verify open=0.0, closed=1.0 convention |
| Works on day 1, fails on day 2 | Camera bumped or lighting changed | Rigidly mount cameras with Loctite; run calibration check at start of each session |
| Jerky, oscillating motion near objects | Inconsistent operator strategies across demonstrations | Use a single operator; filter episodes by trajectory smoothness; increase temporal_agg weight |
이동 기반 통합: 이동 및 조작을 조정
모바일 ALOHA의 "모바일"은 정적 ALOHA에 비해 상당한 복잡성을 추가합니다. AgileX 트래서 베이스 (또는 트래서 미니) 는 전체 신체의 텔레오퍼레이션 중에 두 팔과 조정해야합니다. 주요 통합 세부 사항:
기반 속도 제어. 트래서 기반은 CAN 버스를 통해 50Hz에서 속도 명령 (선형 x, 각형 z) 를 수용한다. 리더 로봇의 기본 위치 (오도메트리 추적) 는 속도 명령으로 지도를 한다. 리더의 현재 위치와 추종자 기반의 위치 사이의 오프셋은 비례적 속도 명령어를 생성한다. 조작 중에 가장 안전한 속도: 0.3 m/s 선형, 0.5 rad/s 각형. 이 범위를 넘으면 팔의 집합을 굽히거나 관절 속도 제한을 초과할 수 있습니다.
조정된 행동 공간. 모바일 ALOHA의 전체 행동 공간은 16차원: 팔당 7개의 관절 (14개 총) + 2개의 기본 속도 명령어. ACT 훈련 중에, 모든 16개의 차원은 공동으로 예측되며, 정책은 전체 신체의 조율된 움직임을 배울 수 있습니다. 그러나, 기본 속도 차원은 합동 위치보다 다르게 정상화되어야 합니다. 왜냐하면 그들의 단위와 범위가 다르기 때문에 - 최대 안전한 속도를 기반으로 기본 속도를 [-1, 1]로 정상화해야 합니다.
- 이동성을 사용할 때.** 모든 작업이 이동성으로부터 혜택을 받지 않는다. 정적 양동력 작업 (탁에 옷을 접고, 고정된 작업장에서 조립) 은 훈련 데이터에 불필요한 기본 운동 소음을 도입하지 않도록 기지를 잠겨두고 수집해야 한다. 작업이 진정으로 필요로 할 때만 이동성을 가능하게 합니다. 다른 위치에서 객체를 가져오거나, 작업장 사이를 탐색하거나, 정적 팔 작업 공간을 넘어 객체를 도달합니다.
관련 독서
이미테이션 학습 가이드 · 행동과 전파 정책 · 레로봇 시작 · 디모네이션 당 비용 · 데이터 해설 · 데이터 서비스 · 로봇 임대
모바일 ALOHA에 대한 카메라 구성
카메라 배치는 모바일 ALOHA 정책 품질에 결정적입니다. 표준 구성은 3-4 개의 카메라를 사용하며, 각 kamera는 정책의 시각적 이해에 특정 역할을 수행합니다.
| Camera | Position | Resolution | Role | Required? |
|---|---|---|---|---|
| Top/overhead | Center of base frame, 40-60cm above workspace | 640x480 @ 30fps | Global workspace awareness, object layout | Yes (primary) |
| Left wrist | Left arm wrist, pointing at gripper | 640x480 @ 30fps | Left arm grasp precision, contact detection | Recommended |
| Right wrist | Right arm wrist, pointing at gripper | 640x480 @ 30fps | Right arm grasp precision, contact detection | Recommended |
| Front-facing | Base frame front, eye-level | 640x480 @ 30fps | Navigation awareness, approach planning | Optional (mobile tasks only) |
USB 대역폭 제한: 640x480 30fps (부동된 YUYV) 3개의 카메라는 대략 1.1 GB/s의 USB 대역폭을 필요로 한다. 하나의 USB 3.0 포트는 5 Gbps (실제적으로: 3.2 Gbps) 를 제공한다. 각 카메라에 별도의 USB 3.0 컨트롤러를 사용한다. 하나의 USB 허브를 공유하는 것은 프레임 하락을 유발한다. Intel RealSense D435와 Logitech C922 카메라 모두 잘 작동한다.
** 카메라 캘리브레이션 체크리스트:** 설치 후 각 카메라의 내적 (OpenCV 체커보드) 와 외부적 요소를 로봇 기본 프레임에 비해 캘리브레이션하십시오. 데이터 세트의 메타 데이터의 일부로 캘리브레이션을 저장하십시오. 설치 스루에 스레드 잠금 화합 (Loctite 222) 을 가진 물리적으로 안전한 카메라 - 3mm 카메라 시체가 해당 시점에 대한 이전에 수집된 모든 데이터를 무효화합니다. 각 수집 세션 시작에서 기계를 확인하여 알려진 팔 구성에서 카메라 시야를 관찰하십시오.
자신 을 건설 하는 방법
모바일 ALOHA 시스템을 구축하는 데는 경험이 풍부한 로봇 전문가에게 2-4주 또는 이전 다이내믹셀 및 ROS2 경험이 없는 팀에게는 6-8주간의 집중적인 노력이 필요합니다. 모바일 조작 데이터를 수집하는 것이 주요 목표가 하드웨어를 이해하는 것이 아니라 이 대안을 고려하십시오.
UMI (Universal 조작 Interface): 다양한 로봇 팔에 배치되는 조작 정책을 훈련시킬 수 있는 UMI 시범법. UMI는 기본 이동 데이터를 캡처할 수 없으므로 작업이 이동을 필요로 하는 경우 모바일 ALOHA를 대체할 수 없지만 조작에만 기반을 둔 데이터 수집을 위한 훌륭한 출발점입니다.
RCSV 관리 데이터 수집: 모바일 조작 데이터를 필요로 하지만 하드웨어를 구축하고 유지보수하지 않으려면 RCSV는 샌프란시스코 시설에서 모바일 ALOHA 시스템 및 다른 양동 플랫폼을 운영합니다. 우리의 운영자는 전체 신체의 텔레오퍼레이션 작업에 훈련되어 있습니다. 작업 사양과 객체 집합을 정의합니다. 우리는 레로봇 또는 RLDS 형식으로 데이터 세트를 수집하고 해설하고 제공합니다. 이것은 하드웨어 빌드를 완전히 제거하고 처음부터 전문적으로 수집된 데이터를 제공합니다. 자세한 사항과 가격을 확인하려면 [데이터 서비스]
** 시스템 임대:** RCSV의 로봇 임대 프로그램 는 월간 임대용에 완전히 집착되고 캘리버드 된 모바일 ALOHA 시스템을 제공할 수 있습니다. 이것은 초기 하드웨어 투자 없이 자신의 환경에서 데이터를 수집 할 수 있습니다. 임대용 사용 가능성과 구성 옵션을 논의하기 위해 저희에게 연락하십시오.
하드웨어 제작을 건너뛰기
RCSV는 관리된 데이터 수집을 위해 모바일 ALOHA 및 다른 쌍방향 시스템을 운영합니다. 작업을 정의하고 데이터 세트를 제공 할 것입니다. 하드웨어 구축이 필요하지 않습니다.
[데이터 서비스를 참조]







