Blog(으)로 돌아가기

ALOHA와 UMI: 어떤 데이터 수집 시스템은 당신에게 적합합니까?

로봇 모방 학습을 위한 ALOHA 및 UMI 데이터 수집 시스템의 심층 비교. 비용, 설정, 데이터 품질, 휴대성, 작업 유형 및 각 시스템을 언제 사용할지 포함합니다.

고품질의 시범 데이터를 수집하는 것은 모방 학습의 병목이다. 두 가지 시스템이 지배적인 접근법으로 등장했다: ALOHA (중편 리더-따라자 텔레오퍼레이션) 및 UMI (우주적 조작 인터페이스, 휴대용 데이터 수집 장치). 그들은 근본적으로 다른 메커니즘을 통해 동일한 문제를 해결합니다. 인간의 조작을 보여주는 것을 캡처합니다. 그리고 올바른 선택은 작업, 팀 크기와 배포 목표, 예산에 달려 있습니다. 이 가이드에서는 결정하는 데 도움이 되는 상세한 기술 비교를 제공합니다.

ALOHA가 어떻게 작동 하는 지

ALOHA leader-follower teleoperation arms

[ALOHA] (Bimanual 원격조작) (비매뉴얼 텔레오퍼레이션에 대한 저비용 오픈소스 하드웨어 시스템) 는 리더-따라자 구성에서 일치하는 로봇 팔 쌍을 사용합니다. 운영자는 리더 팔을 물리적으로 움직이고, 후속 팔은 실시간으로 그 움직임을 반영합니다. 리더와 후속 팔의 공동 코더는 손목 및 상공 카메라 사진과 함께 50Hz에서 동기화된 위치 궤도를 기록합니다.

키 메커니즘: 리더와 추종자 팔은 운동적으로 동일 (두 가지 모두 다이내믹셀 세르보와 ViperX 300 6-DOF 팔입니다). 이 1:1 지도는 리더 팔의 세로 피드백을 통해 팔의 팔의 상호작용을 직접적으로 감지하는 것을 의미합니다. 실제 힘 피드백이 아니라 충분한 위치 결합으로 경험한 조작자가 직관적인 접촉감을 갖게 됩니다.

** 데이터 형식:** ALOHA는 공동 위치 (14 값: 팔당 6 관점 + 1 지잡기), 공동 속도, 카메라 이미지 (일반적으로 480p/30fps에서 2-4 카메라) 및 시간표를 기록합니다. 데이터는 로봇이 원산지입니다. 공동 궤도를 직접 추종자 팔에 재생하거나 리터거팅 단계 없이 정책을 훈련하는 데 사용할 수 있습니다.

** 양동력 장점:** ALOHA의 특징은 양측 텔레오퍼레이션입니다. 양쪽 팔이 동시에 제어됩니다. 이것은 한 팔 시스템으로 증명할 수 없는 양동력 작업 (저를 들고 있는 채 을 열고, 접는 천, 병에서 컵에 붓는) 에 대한 데이터 수집을 가능하게 합니다. ACT 정책 구조는 ALOHA의 두 가지 수동적인 행동 공간을 처리하기 위해 특별히 설계되었습니다.

UMI 의 작동 방식

RCSV UMI handheld data collection device

[UMI (Universal 조작 Interface) ]T4) 는 카메라와 IMU를 장착한 휴대용 지갑이다. 운영자는 UMI를 도구처럼 들고 조작 작업을 직접 수행합니다. 데이터 수집 중에 로봇 팔이 없습니다. 외부 추적 (ArUco 마커 또는 SLAM) 는 환경 속 UMI의 6DOF 자세를 캡처하고, 내장 카메라는 지갑의 시선 관점을 기록하고 손가락 코더는 지갑의 열을 기록합니다.

키 메커니즘: UMI는 로봇 하드웨어에서 데이터 수집을 분리합니다. 운영자는 로봇 운동학, 작업 공간 제한 또는 서버 대역폭에 의해 제한되지 않고 인간의 속도와 기술로 작동합니다. 기록된 궤도는 (시간과 함께 최종 효과자 포지) 는 나중에 역 운동학을 사용하여 배포 로봇으로 다시 목표합니다. 이 재목표 단계로 카르테시아 포즈 궤도를 사용되고 있는 특정 로봇 팔의 관절 각로 변환합니다.

** 데이터 형식:** UMI는 최종 효과자 6-DOF 포지 (지위 + 방향), 지갑 열, 손목 카메라 이미지 및 시간표를 기록합니다. 포지는 세계 프레임에 있으며 로봇의 공동 공간에 없습니다. 훈련 전에 궤도를 목표 로봇으로 다시 표정해야 합니다. 계산적으로 가벼운 단계이지만, IK 근접과 운동적 차이로 인해 2-5mm의 최종 효과자 위치 오류를 도입합니다.

** 휴대성 장점:** UMI는 부엌, 공장 바닥, 사무실, 야외에서 어디서나 사용할 수 있습니다. 운영자는 UMI 장치 및 노트북 이외의 로봇, 작업 스테이션 또는 인프라가 필요하지 않습니다. 이것은 실제 배포 환경에서 데이터 수집을 가능하게 합니다. 실제 조명, 오더러 및 객체 변동으로, 실험실에서만 수집하는 것보다 더 다양한 훈련 데이터를 생성합니다.

덱스-UMI: 덱스터러스 확장

RCSV Dex-UMI dexterous manipulation data collection glove

[Dex-UMI] (T5) 는 UMI를 현명한 조작으로 확장합니다. 평행 턱잡기 대신, Dex-UMI는 개별 손가락 관절 각 (20+ DOF), 손가락 끝 접촉 힘 및 손목 자세를 포착하는 도구 장갑을 사용합니다. 이것은 다 손가락 조정이 필요한 작업에 대한 데이터 수집을 가능하게합니다.

Dex-UMI를 사용할 때: 만약 당신의 배포 로봇이 능숙한 손 (LEAP Hand, Allegro Hand, 또는 유사한 다발자 끝 효과자) 를 가지고 있고, 당신의 작업은 손가락 수준 제어가 필요한 경우, Dex-UMI는 휴대용 데이터 수집 옵션이 유일하다. 표준 UMI는 지갑만 열/ 닫고, ALOHA 리더 팔은 단발자 지갑만 가지고 있다. Dex-UMI는 간단한 지갑 시범과 완전한 현명한 조작 데이터 사이의 격차를 채워줍니다.

** 신속한 결정**

이중 수동이 필요합니까? → ALOHA. 휴대성이 필요합니까? → UMI. 숙련된 것이 필요합니까? → Dex-UMI.

머리 대 머리 비교

Criterion ALOHA UMI Dex-UMI
Cost $3,000-$4,000 (full system) $800 per unit $1,200 per unit
Setup time 2-4 hours (assembly + calibration) 15-30 minutes 30-45 minutes
Operator training 2-4 hours (bimanual coordination) 10-15 minutes 30-60 minutes
Demos per hour 20-60 (single system) 60-100 per operator 40-70 per operator
Parallelizable No (1 operator per system) Yes (N operators = N units) Yes (N operators = N units)
Data quality High (robot-native joints) Medium (retargeting error) Medium (finger retargeting)
Retargeting needed No Yes (IK solve) Yes (finger mapping + IK)
Bimanual support Native (2 arms) Limited (2 UMIs, no sync) No
Portability Low (robot + table + power) High (handheld + laptop) High (glove + laptop)
Dexterous tasks No (1-DOF gripper) No (1-DOF gripper) Yes (20+ DOF fingers)
Environment diversity Low (fixed lab setup) High (any location) High (any location)
Policy frameworks ACT, Diffusion Policy, LeRobot Diffusion Policy, ACT (retargeted), VLA Diffusion Policy, custom

데이터 품질: 중요한 차이

ALOHA는 로봇-자동생 관절 궤도를 생성한다. 운영자가 리더 팔을 X 위치로 옮기는 경우, 후속 팔의 코더는 X 위치로 도달하기 위해 필요한 정확한 관절 각을 기록한다. 이 데이터는 후속 팔에 재생되거나 직접적으로 변화 없이 정책 훈련에 사용될 수 있다. 유일한 소음 원천은 세로 양량화와 반사 반응이며, 이는 작은 (0.1-0.3 °C Dynamixel XM 시리즈에 관절에) 이다.

UMI는 카르테시아 최종 효과자 궤도를 생성하여 배포 로봇으로 다시 목적지화해야 합니다. 재목적 단계는 세 가지 원천에서 오류를 도입합니다: (1) IK 용매 근접 (용수에서 로봇이 자연스럽게 사용하는 정확한 구성은 찾을 수 없습니다), (2) 인간 조작자의 팔과 로봇 팔 사이의 운동적 불합이 (다른 링크 길이가, 관절 제한, 작업 공간 모양) 및 (3) 외부 포즈 추정에서 추적 소음 (ArUco 마크는 거리와 조명에 따라 1-3mm 위치 소음을 가지고 있습니다).

실천적으로: 5mm+ 위치 용납 (대부분의 픽 앤 प्लेस, 붓기, 섞기) 과목에 UMI 리터거팅 오류는 무시할 수 없으며 두 시스템은 동등한 정책 성능을 제공합니다. 정확도가 중요하다면 ALOHA를 사용하거나 미세 조정을 위해 UMI 데이터를 더 작은 로봇 시범시험으로 보충하십시오.

스케일링 데이터 수집: UMI가 승리하는 곳

UMI의 기본 확장 장점은 병렬성이다. 하나의 ALOHA 시스템은 한 번에 한 사업자로부터 데이터를 수집할 수 있다. 10 개의 UMI 장치들은 10 개의 다른 환경에서 10 개의 사업자로부터 데이터를 동시에 수집할 수 있으며, 시간 단위당 데이터 다양성을 10배로 생성한다.

** 시범 비용 비교:**

  • ALOHA: 4,000 달러 시스템, 40 개의 디모/시간, 100 달러/시간 운영자 비용 = 2개 시범 시상식당 2.50 달러 (하드웨어 시상식 제외)
  • UMI (독일): 800 달러 장치, 80 개의 디모/시간, 30 달러/시간 운영자 비용 (전문가 아닌) = 0,38 달러/시간
  • UMI (10 장치, 10 사업자): $8,000 전체 하드웨어, 800 데모/시간, $300/시간 전체 사업자 비용 = $0.39 한 시연, 하지만 20배의 처리량.

수천 개의 시범이 필요한 프로젝트 (VLA 훈련, 다중 작업 데이터 세트, 환경 간 일반화) 에 있어서 UMI의 비용과 처리량 이점은 결정적이다. RCSV의 [데이터 수집 서비스]T6) 는 대규모 캠페인에 UMI 팀을 배치할 수 있습니다.

작업 유형 결정 프레임워크

이 결정 트리를 사용하여 특정 작업에 대해 ALOHA와 UMI를 선택하십시오.

  1. ** 당신의 작업은 동시에 두 팔을 필요로 하는가?** 만약 네: ALOHA. UMI는 동기화 된 양동력 데이터를 캡처할 수 없습니다. 예: 세탁을 접는 것, 창을 열고, 두 손으로 집합하는 것.
  2. ** 당신의 작업은 현명한 손가락 조작이 필요한가?** 만약 예라면: Dex-UMI. ALOHA나 표준 UMI는 다 손가락 데이터를 캡처하지 않습니다. 예: 도구 사용, 손에서 재주류, 펜 조작.
  3. ** 다양한 실제 환경에서 데이터를 필요로 하는가?** 만약 예라면: UMI. 20개의 다른 부엌에서 데이터를 수집하는 것은 한 실험실에서 20배 이상의 데이터를 수집하는 것보다 더 강력한 정책을 만들어냅니다. 예: 가정용 로봇 작업, 다양한 오더러에서 물체를 수집하는 것.
  4. ** 1000개 이상의 시범이 필요하십니까?** 만약 예라면: UMI. 평행 확장으로 인해 큰 데이터 집합이 경제적으로 실현가능합니다. 예: VLA 정렬, 다 작업 훈련, 물체 간 일반화.
  5. ** 당신의 작업은 2mm 이하의 정확성이 필요한가?** 만약 예라면: ALOHA (또는 로봇에서 원격 조작). UMI 데이터의 리터거팅 오류는 정확성 작업을 악화시킵니다. 예: 삽입, 커넥터 결합, 회로 보드 집합.
  6. ** ALOHA 하드웨어에 배포할 것인가?** 만약 예: ALOHA. 0 리터거팅 오류는 이 특정 하드웨어에서 가능한 최선의 정책 성능을 의미합니다.
  7. ** 다른 모든 것:** UMI의 속도와 유연성을 위해 시작하여 정책 성과 평평을 보려면 로봇 시범으로 보완하십시오.

ALOHA와 UMI를 결합한

가장 효과적인 데이터 수집 전략은 두 시스템을 이용한다.

  1. 단계 1 - UMI의 폭 (1~2주): 다양한 환경, 객체 및 운영체에서 500~2,000개의 시범을 수집하기 위해 UMI 장치를 배포한다. 이것은 높은 변동성을 가진 기초 데이터 세트를 구축한다. 자연적인 작업 실행을 캡처하기 위해 전문적이지 않은 운영체 (최소 훈련) 를 사용한다.
  2. ** 2단계 -- 깊이 (주 34) 에 대한 ALOHA:** 1단계에서 확인된 가장 어려운 하위 작업 중 100300개의 고품질의 시범을 수집하기 위해 ALOHA를 사용하세요. 정확한 조작 단계, 양동적 조정 및 UMI 데이터가 충분하지 않은 가장자리 사례에 집중하세요.
  3. ** 3 단계 -- 공동 훈련:** 결합된 데이터 세트에 대한 정책을 훈련시키고, 정확성-비밀 작업 세그먼트들에 대한 ALOHA 시범을 더 높게 중점합니다. Fearless Data Platform 는 시범에 대한 품질 중량을 가진 혼합 출처 데이터 세트를 지원합니다.

이 결합된 접근법은 일반적으로 UMI의 환경 다양성과 ALOHA의 로봇 고유의 정확성을 결합하기 때문에 시스템 하나보다 15-30% 더 나은 정책 성과를 창출합니다.

하드웨어 호환성

ALOHA 및 UMI 데이터 모두 광범위한 로봇 팔에 배치 할 수있는 정책을 훈련시킬 수 있습니다.

Deployment Robot ALOHA Data UMI Data Notes
Mobile ALOHA Native (zero retargeting) Retarget via IK Best results with ALOHA data
OpenArm Retarget (different kinematics) Retarget via IK Both require retargeting; UMI more natural
Franka FR3 Retarget (different kinematics) Retarget via IK 7-DOF IK has more solutions; quality depends on solver
UR5e Retarget (different kinematics) Retarget via IK UR analytical IK gives deterministic retargeting
AgileX Piper Retarget (different kinematics) Retarget via IK Shorter reach may clip some UMI trajectories

카메라 설정 비교

카메라 구성은 두 시스템 사이에 크게 다르며, 이는 정책 훈련에 필요한 시각적 관측에 영향을 미칩니다.

ALOHA 카메라: 일반적으로 3-4 카메라: 팔당 한 손목 카메라 (2 총) 및 1-2 대장/세 번째 사람 카메라. 손목 카메라는 팔과 함께 움직이며, 일관된 지목-눈 시선을 제공합니다. 대장 카메라는 고정됩니다. 모든 카메라는 로봇 기본 프레임에 비해 캘리브레이션되어, 시각 관측과 관절 위치 사이의 일관된 공간 관계를 제공합니다.

UMI 카메라: UMI 장치마다 내장 손목 카메라 한 장, 선택적 외부 카메라. 손목 카메라는 매치에 딱딱하게 부착되어 있으며 ALOHA 손목 카메라와 같은 매치 시선력을 제공합니다. 사용 경우 외부 카메라는 각 수집 세션에 대한 ArUco 마커 프레임에 맞춰 캘리버되어야합니다. 주요 차이점은: UMI의 외부 카메라는 로봇이 아닌 운영자의 손과 팔을 볼 수 있으므로 UMI의 세 번째 사람의 시각에 훈련된 정책은 배치 시 사람의 손 모양에서 로봇 팔 모양으로 일반화되어야합니다.

** 실용적 권고:** 손목 카메라만 사용하는 정책 (손목 시야를 가진 ACT, 손목 시야를 가진 Eye-in-hand Diffusion Policy) 에 대해서는 ALOHA와 UMI가 동등한 시각 데이터를 생성한다. 제3인 시각을 사용하는 정책에 대해서는, 시각적 외모가 배포와 일치하기 때문에 ALOHA 데이터는 바람직하다. UMI를 3인칭 카메라로 사용하는 경우 손목 카메라 조회만 훈련하거나, 외관 격차를 줄이기 위해 도메인 무작위화를 사용하십시오.

데이터 증강 계층으로서 RC G1 터틸 글래브

[RC G1 터틸 글래브] (T14) 는 데이터 수집 작업 흐름에 터틸 센서를 추가합니다. ALOHA 텔레오퍼레이션 중에 착용하면 리더 팔 지갑에 사용자의 손가락 접촉력을 기록합니다. UMI 수집 중에 착용하면 UMI 핸들에서 손가락력을 기록합니다. 이 촉각 데이터는 접촉력에 반응하는 정책들을 훈련시킬 수 있습니다. 미끄러움을 감지하거나, 잡기력을 조절하거나, 물체의 딱딱함을 감지하는 것. 시각에만 적용되는 정책보다 더 많은 능력을 갖출 수 있습니다.

자주 묻는 질문

ALOHA와 UMI의 차이점은 무엇입니까?

ALOHA는 2자리적인 리더-따라자 텔레오퍼레이션 시스템으로, 운영자가 일치하는 로봇 팔을 제어하여 작업을 수행하는 동안 후속 팔이 공동 궤도를 기록합니다. UMI는 운영자가 직접 환경에서 사용하는 휴대용 지갑 장치입니다. 데이터 수집 중에 로봇 팔이 필요하지 않습니다. ALOHA는 로봇과 로봇이 모인 공동 데이터를 캡처하고 UMI는 배치 로봇에 다시 타겟팅해야 하는 작업 공간 궤도를 캡처합니다.

ALOHA 또는 UMI는 데이터 수집에 더 좋습니까?

사용 사례에 따라 달라집니다. ALOHA는 쌍방향 데이터, 로봇과 로보트 네이티브 공동 궤도 또는 ALOHA 하드웨어에 배치될 때 더 좋습니다. UMI는 휴대성이 필요할 때 (로보트가 없는 곳에서 데이터를 수집), 많은 전문적이지 않은 운영체 중 데이터 수집을 병렬화하고, 여러 로봇 플랫폼에 배포할 계획 때 더 좋습니다. UMI 데이터는 재목표 단계가 필요합니다. ALOHA 데이터는 즉시 훈련할 준비가되어 있습니다.

ALOHA와 UMI의 가격은 얼마입니까?

[모바일 ALOHA] (T15) 는 전체 시스템 (2 리더 팔 + 2 추종자 팔 + 모바일 기반) 에 약 4,000 달러 (약 3,000 달러) 를 소요한다. 정지형 ALOHA (기반 없이 4 바이퍼X 팔) 는 약 3,000 달러 (약 3,000 달러) 를 소요한다. [RCSV UMI] (T16) 는 단위당 800 달러 (약 1,600 달러) 를 소요하며, 병렬 데이터 수집을 위해 여러 단위를 동시에 배치할 수 있다. 규모에서 UMI는 수집된 시범별로 훨씬 저렴하다.

ALOHA의 정책을 훈련하기 위해 UMI 데이터를 사용할 수 있습니까?

예, 하지만 궤도 재목표가 필요합니다. UMI는 카르테시아 공간에서 최종 효과자 포즈를 캡처하고, 이는 역동학으로 ALOHA 팔의 관절 각로 변환되어야 합니다. 이 재목표는 약간의 오류를 도입합니다. 일반적으로 2-5mm 최종 효과자 위치 오류) 하지만 대부분의 조작 작업에 적합합니다. 레로봇과 [불경 डेटा 플랫폼]T17) 모두 UMI-to-ALOHA 재목표를 지원합니다.

덱스-UMI는 무엇일까요?

[Dex-UMI] (T18) 는 UMI의 현명한 조작 버전이다. 평행 턱잡기 데이터를 캡처하는 대신, Dex-UMI는 여러 손가락을 보여주는 기기 장갑을 사용하여 캡처합니다. 개별 손가락 위치, 접촉 힘, 손목 자세. Dex-UMI 데이터는 LEAP 손이나 Allegro Hand와 같은 로봇 손의 정책을 훈련시킵니다. 이 시스템은 표준 UMI와 ALOHA가 캡처할 수 없는 유능한 작업 (기구 사용, 수동 재주정) 에 대한 데이터 수집을 가능하게 한다.

ALOHA와 UMI에서 시간당 얼마나 많은 시연을 수집할 수 있습니까?

ALOHA: 시간당 2040개의 쌍방향 시범, 시간당 4060개의 단팔 시범. 리더-후보 설정은 로봇이 물리적으로 존재하고 전원을 공급해야 합니다. UMI: 운영자당 시간당 60~100개의 시범, 그리고 여러 운영자를 동시에 실행할 수 있습니다. UMI 장치들을 가진 5명의 운영자 팀이 시간당 300-500개의 시범을 수집할 수 있으며, 이는 하나의 ALOHA 시스템과 일치하는 것이 불가능하다.

관련: 이미레이션 학습에 대한 최고의 로봇 2026 · ALOHA 로봇 가이드 · 모바일 ALOHA 설정 · 행동 정책 설명 · RCSV 스토어