您需要使用哪个数据收集系统?
详细对 ALOHA 和 UMI 收集机器人模仿学习数据系统进行比较. 涵盖成本,设置,数据质量,可移植性,任务类型以及每一个系统的使用时间.
收集高质量的示范数据是模仿学习的瓶
艾洛哈的作用

[ALOHA] (A Low-cost Open-source Hardware System for Bimanual 遥操作) 使用相对的机器人臂组合,在领导者-跟随者配置中.操作员物理地移动领导者的臂,跟随者的臂部以实时反射这些运动.领导者和跟随者的双臂的联合编码器记录了50Hz的同步位置轨迹,以及手腕和顶部摄像头图像.
关键机制: 领袖和追随手臂是动态相同的 (两者都是ViperX 300 6-DOF手臂和Dynamixel伺服器).当操作员移动领袖手臂关节时,相应的追随手臂关节会移动匹配. 这种 1:1 映射意味着操作员直接感觉到跟随手臂与物体的相互作用, 通过领导手臂的伺服反
数据格式: ALOHA记录了联合位置 (14 值:每臂6 关节+1 抓住器),联合速度,摄像头图像 (通常是4~4 摄像头以480p/30fps) 和时间标签.数据是机器人原生:联合轨迹可以直接在追随者的臂部上播放或使用在没有任何重定向步骤的情况下训练政策.
**双手优势:**ALOHA的定义特点是双边远程操作 - - 双手同时控制.这使得双手任务 (在抱着瓶子时打开瓶子,折叠布,从瓶子里倒入杯子) 无法通过单手系统证明的双手数据收集. 法律政策架构专门为ALOHA的双手动行动空间设计.
如何运行UMI

操作员像工具一样握着UMI,直接执行操作任务 - - 数据收集过程中没有机器人手臂. 外部跟踪 (ArUco标记或SLAM) 捕捉了UMI在环境中的6DOF姿势,而机载摄像头记录了抓住器的视图,指码器记录了抓住器的开口.
关键机制: UMI将数据收集从机器人硬件中脱离.操作员以人类的速度和技巧运作,不受机器人动力学,工作空间限制或伺服带宽的限制.记录的轨迹 (随着时间的推移,最终效应器的姿势) 随后通过反动力学重新定向到部署机器人. 这一步将卡特西亚姿势轨迹转换为用于特定机器人臂的联合角轨迹.
数据格式: UMI记录终端效应器6-DOF姿势 (位置 + 方向),抓紧器开口,手腕摄像头图像和时间
可携带性优势: UMI可在任何地方使用 - 厨房,工厂地板,办公室,户外.操作员不需要机器人,工作站或超出 UMI 设备和笔记本电脑的任何基础设施.这使得实际部署环境中能够收集数据,带有实际的照明,混乱和对象变化,产生比仅在实验室收集更多的多样化的训练数据.
性延伸

德克斯-乌米 (Dex-UMI) 扩展了UMI到巧妙的操纵.而不是平行爪
使用Dex-UMI时: 如果你的部署机器人有一个精巧的手 (LEAP手,Allegro手或类似的多指末效应器) 而你的任务需要指尖水平控制,Dex-UMI是唯一的便携式数据收集选项.标准的UMI只捕捉了抓住器开/关,ALOHA领导手臂只拥有单双DOF抓住器. 简单的抓住器示范和精巧的操纵数据之间的差距.
快速决定
需要双手动? → ALOHA. 需要可移植性? → UMI. 需要精巧的? → 德克斯-UMI.
面对面的比较
| Criterion | ALOHA | UMI | Dex-UMI |
|---|---|---|---|
| Cost | $3,000-$4,000 (full system) | $800 per unit | $1,200 per unit |
| Setup time | 2-4 hours (assembly + calibration) | 15-30 minutes | 30-45 minutes |
| Operator training | 2-4 hours (bimanual coordination) | 10-15 minutes | 30-60 minutes |
| Demos per hour | 20-60 (single system) | 60-100 per operator | 40-70 per operator |
| Parallelizable | No (1 operator per system) | Yes (N operators = N units) | Yes (N operators = N units) |
| Data quality | High (robot-native joints) | Medium (retargeting error) | Medium (finger retargeting) |
| Retargeting needed | No | Yes (IK solve) | Yes (finger mapping + IK) |
| Bimanual support | Native (2 arms) | Limited (2 UMIs, no sync) | No |
| Portability | Low (robot + table + power) | High (handheld + laptop) | High (glove + laptop) |
| Dexterous tasks | No (1-DOF gripper) | No (1-DOF gripper) | Yes (20+ DOF fingers) |
| Environment diversity | Low (fixed lab setup) | High (any location) | High (any location) |
| Policy frameworks | ACT, Diffusion Policy, LeRobot | Diffusion Policy, ACT (retargeted), VLA | Diffusion Policy, custom |
数据质量:关键的区别
ALOHA产生机器人本土的关节轨迹.当运营商将领袖臂移动到X位置时,跟随手臂的编码器记录到X位置的关节角.这些数据可以在跟随手臂上重播或直接用于政策培训,而不会发生任何转变. 唯一的噪音源是伺服量化和反响,这是小 (0.1-0.3度每关节的Dynamixel XM系列).
卡特斯人终端效应轨迹必须重新定向到部署机器人. 转向步骤从三个来源引入错误: (1) IK解决器接近 (解决器可能不会找到机器人自然使用的确切相同的配置), (2) 人体操作员和机器人臂之间的动态不匹配 (不同链接长度,关节界限,工作空间形状),以及 (3) 外部姿势估计的跟踪噪音 (ArUco标记器根据距离和照明具有1-3mm的位置噪音).
**实践中:**对于具有5mm+定位宽容的任务 (大多数取取,倒,
规模数据收集:UMI获胜的地方
基于 UMI 的基本扩展优势是平行性.一个 ALOHA 系统可以一次收集一个运营商的数据.十个 UMI 设备可以同时收集十个运营商的数据,在十个不同的环境中,产生每单位时间的数据多样性十倍.
每次示范成本比较:
- ALOHA: 系统4000美元,每小时40个演示,每小时100美元的操作员成本 =每次演示摊销2.50美元 (不包括硬件摊销).
- **UMI (单一):**800美元设备,80个演示/小时,30美元/小时操作员成本 (非专家) =每次演示0.38美元.
- **UMI (10台设备,10个运营商):**8.000美元的硬件总量,800个演示/小时,300美元/小时的运营商总成本 =0.39美元/演示,但吞吐量是20倍.
对于需要数千次示范的项目 (VLA培训,多任务数据集,跨环境通用化),UMI的成本和吞吐量优势是决定性的.
任务类型决策框架
使用此决策树来选择ALOHA和UMI之间的具体任务:
- **您的任务是否需要同时使用两个手臂?**如果是的:ALOHA.UMI无法捕获同步双手数据.
- **您的任务是否需要精巧的手指操作?**如果是的: Dex-UMI.ALOHA和标准的UMI都不捕获多指指数据.
- 你需要来自不同现实环境的数据吗如果是的:UMI.在20个不同的厨房中收集数据产生了比在一个实验室中收集20倍更多数据更强大的政策.
- 需要1000多个示范吗如果是的:UMI.并行扩展使大型数据集经济可行.
- **您的任务是否需要2mm以下的精度?**如果是的:ALOHA (或机器人电话操作).UMI数据中的重定向错误会降低精度任务.
- **您是否将其部署在ALOHA硬件上?**如果是的:ALOHA.零重定向错误意味着该特定硬件的最佳政策性能.
- 其他所有事情: 首先使用UMI以确保其速度和灵活性,然后补充到机器人上的示范,如果政策性能平原.
结合ALOHA和UMI
最有效的数据收集策略使用了两种系统.
- 第一阶段 - 宽度 UMI (1-2周): 部署 UMI 设备,收集500-2,000 个示范在各种环境,对象和运营商中. 这构建了高变化的基础数据集. 使用非专家运营商 (最小培训) 来捕捉自然的任务执行.
- **第二阶段 - - 深度ALOHA (3-4周):**使用ALOHA收集1阶段所发现的最难的子任务100-300个高质量的示范. 专注于精确的操纵步骤,双手协调和 UMI数据不足的边缘情况.
- 第三阶段 - 联合培训: 培训对综合数据集的政策,对精密关键任务细分进行ALOHA示范的权重更高. [无畏数据平台]
T8 ) 支持混合源数据集,每次示范的质量权重.
这种结合方法通常比单独的系统产生15-30%更好的政策效果,因为它结合了UMI的环境多样性和ALOHA的机器人原生精度.
硬件兼容性
无论是ALOHA数据还是UMI数据都能训练各种机器人武器部署的政策.
| Deployment Robot | ALOHA Data | UMI Data | Notes |
|---|---|---|---|
| Mobile ALOHA | Native (zero retargeting) | Retarget via IK | Best results with ALOHA data |
| OpenArm | Retarget (different kinematics) | Retarget via IK | Both require retargeting; UMI more natural |
| Franka FR3 | Retarget (different kinematics) | Retarget via IK | 7-DOF IK has more solutions; quality depends on solver |
| UR5e | Retarget (different kinematics) | Retarget via IK | UR analytical IK gives deterministic retargeting |
| AgileX Piper | Retarget (different kinematics) | Retarget via IK | Shorter reach may clip some UMI trajectories |
摄像头设置比较
两种系统之间相机配置有明显的差异,这影响了政策培训的可用视觉观测.
**ALOHA摄像头:**通常有3到4部摄像头:每臂每手臂1部摄像头 (2个总数) 和1-2部/第三人摄像头.手腕摄像头与手臂移动,提供一致的抓住眼视图.上部摄像头固定.所有摄像头与机器人基架相对进行校准,提供视觉观测和关节位置之间的一致的空间关系.
**UMI摄像头:**每个UMI设备上有一台内置手腕摄像头,加上可选的外部摄像头.手腕摄像头
**实用建议:**对于只使用手腕摄像头的政策 (ACT与手腕视觉,眼中传播政策),ALOHA和UMI生成相等视觉数据.对于使用第三方视觉的政策,ALOHA数据是最好,因为视觉外观匹配部署. 如果使用第三方摄像头,只使用手腕摄像头视图进行训练,或者使用域名随机化来弥合外观差距.
作为数据增强层的RC G1触摸手套
[RC G1触摸手套]
常见的问题
ALOHA 和 UMI 之间有什么区别?
阿拉哈是一个双边领导者跟随者远程操作系统,操作员控制匹配的机器人手臂来执行任务,而跟随者的手臂记录关联轨迹.UMI是一个手持式抓住器,操作员直接在环境中使用 - 在数据收集过程中不需要机器人手臂.
收集数据的ALOHA或UMI更好吗?
根据您的使用情况,ALOHA是最好的,当您需要双手动数据,机器人本土联合轨迹,或在ALOHA硬件上部署时.UMI是最好的,当您需要便携性 (在无机器人的情况下随地收集数据),想在许多非专家运营商中并行数据收集,或计划部署在多个机器人平台上. UMI数据需要重新定向步骤; ALOHA数据即可进行训练.
和的价格多少?
移动ALOHA (移动ALOHA)
我可以使用UMI数据来培训ALOHA的政策吗?
确实,但需要轨迹重定位.UMI在卡特西亚空间中捕获终端效应器姿势,该姿势必须通过逆动力学转换为ALOHA臂的联合角.这种重定位引入一些错误 (通常是2-5mm的终端效应器位置错误),但适用于大多数操纵任务.LeRobot和[无畏数据平台]
米是什么?
德克斯-乌米 (Dex-UMI) 是UMI的巧妙操纵版本. 取而代之的是捕获平行
通过ALOHAvsUMI,每小时可以收集多少次示范?
机器人:每小时20-40次双手演示,每小时40-60次单臂演示.领导跟随者设置要求机器人在实体上存在并电动.UMI:每小时60-100次演示,你可以同时运行多个操作员. 五个运营商的团队,使用UMI设备,每小时可以收集300-500个示例,这是不可能与单个ALOHA系统匹配的.
相关: 最佳模仿学习机器人2026年 · ALOHA机器人指南 · 移动ALOHA设置 · 行动政策解释 · RCSV商店







