移动ALOHA设置指南:硬件,软件和第一项任务
移动ALOHA成本:AgileX追踪器基,ViperX300臂,计算 <unk>总BOM ~ $32K.加上3种更便宜的替代品从 $4,500. 完成ROS2设置和ACT训练步行.
移动ALOHA是一个全身电话操作平台,基于轮子.本指南涵盖了从硬件BOM到您首次成功的模仿学习任务的完整设置.
移动ALOHA是什么
通过安装双手臂系统在一条全方向移动基础上,在斯坦福大学开发的移动ALOHA扩展了原始的ALOHA (一种低成本的开源硬件系统用于双手电操作). 这使得全身的电话操作能够实现:操作员同时控制双臂和底部,展示需要随着操纵进行移动的任务,如打开门,推车,在移动时清洁桌子,以及在房间之间导航.
移动ALOHA的重要研究贡献表明,在多种静态ALOHA数据上进行联合培训, 这意味着昂贵的移动示范将被更便宜的静态双手动数据补充,使得这种方法比最初的看法更实用.
移动ALOHA已成为机器人学习中最复制的研究平台之一.多个实验室,公司和制造商组已经构建了变体,原始硬件设计完全是开源的.然而,构建过程比论文建议的更复杂,这本指南涵盖了学术出版物遗漏的实际细节.
硬件材料文件
完整的移动ALOHA系统需要四类硬件:移动基础,操纵臂 (领袖和追随者),摄像头系统和计算堆
移动基地:**
- 根据配置,AgileX Tracer差异驱动基:4,500-5,500美元.这是原始论文中使用的平台.替代品包括AgileX Scout Mini ($6,800) 用于更高的有效载荷或Clearpath Jackal ($20,000+) 用于研究级远距离测量,但Tracer是成本限制的构建标准选择.
- 定制安装框架 (
挤出80/20或类似):材料价格300-600美元,加上加工. 框架必须将手臂底部与移动平台紧密地连接,为摄像头和计算盒提供安装点.
跟随手臂 (执行任务的机器人手臂):
- 2xTroossen Robotics ViperX 300 S2 6-DOF臂:每支4800美元,总计9600.这些是ALOHA构建的标准追随手臂.它们使用了Dynamixel XM/XH系列的伺服器,具有位置,速度和电流反
.在完全延伸时,有效载荷为750g,这限制了系统可以操纵的物体的重量. - 双倍定制抓住器组件:每款200-400美元.标准的ALOHA抓住器是简单的平行爪子抓住器,配备了Dynamixel XL330伺服器. 3D打印的指
适合大多数任务.
领袖手臂 (运营商在远程操作期间持有):
- 2xTroossen Robotics WidowX 250 S 6-DOF臂:每只 3,100美元,总计 6,200美元.WidowX比ViperX更轻 (0.53公斤) 和更短的射程,使得坐或站着操作员在多小时的数据收集会议中保持舒适.同样的Dynamixel伺服器家庭确保透明的动态映射.
- 领袖臂安装支架:100-200美元. 挂在腰部高度上移动平台框架,以便操作员在持有领袖臂时走在平台后面.
摄像机系统:
- 两倍的英特尔RealSenseD405手腕摄像头:每枚300美元,总计600美元. 装在后手腕上,可以接近操作视图.
- 印特尔RealSenseD435上空相机:$350. 装在框架
上,可以从上到下看工作空间. - 摄像头和USB电缆:100至150美元.
计算:
- 机器上工作站:英特尔NUC 13 Pro或同等的小型PC,i7,32GB RAM,1TBNVMeSSD:800-1,200美元.它可以实时地控制远程操作,捕捉摄像头和记录数据.它不需要GPU;训练在线进行.
- 训练工作站 (单独,不是机器人):任何具有NVIDIA RTX 4090或A100的桌面或云实例,用于ACT/Diffusion Policy培训.为本地训练机预算2000-3000美元,或使用云GPU实例每小时1-4美元.
总成本分类
| Category | Cost Range |
|---|---|
| Mobile base (AgileX Tracer) | $4,500-5,500 |
| Follower arms (2x ViperX 300 S2) | $9,600 |
| Leader arms (2x WidowX 250 S) | $6,200 |
| Grippers and mounting | $700-1,200 |
| Camera system (3x RealSense) | $950-1,100 |
| Onboard compute | $800-1,200 |
| Frame, cables, misc hardware | $500-800 |
| Total (robot only) | $23,250-25,600 |
| Training workstation (separate) | $2,000-3,000 |
| Total (complete system) | $25,250-28,600 |
这就是从零开始构建一个移动ALOHA系统的总成本.最初的斯坦福论文引用了其特定配置的约32,000美元;差异反映了2026年组件的定价和使用基调追踪器而不是高端配置. 请注意,这不包括数据收集的操作员劳动,这是任何模仿学习项目中的主导持续成本.
软件堆:ROS2,ACT和LeRobot
移动ALOHA软件堆
**实时控制层 (ROS2 Humble on Ubuntu 22.04).**低级控制运行为ROS2节点:每个手臂都有一个Dynamixel驱动节点,AgileX平台有一个基驱动节点,每个RealSense摄像头都有一个摄像头驱动节点. 关键要求是所有节点都需要共享同步的时钟 (使用Chrony或PTP),并且领先到后者命令循环运行在50Hz,延迟不到10ms.Interbotix ROS2驱动程序包提供臂驱动程序;AgileX ROS2包提供基础驱动程序.
**电话操作和录音层.**录音节点会订阅所有联合状态主题和摄像头图像主题,与共享时钟进行时间印记,并将同步的集写入HDF5文件. 每个集包含:50Hz的14DOF联合位置 (7个手臂),14DOF联合速度,抓紧器开口,30fps的三个摄像头流,基速度命令和集中的元数据 (任务标签,成功旗
训练层 (离线,在训练工作站上). ACT(Action Chunking with Transformers) 是ALOHA数据的标准训练算法.ACT预测未来的行动 (通常是100个时间步骤) 从当前的观察,使用一个变体编码器-解码器架构和CVAE (条件变量自动编码器) 来预测行动. 训练需要4-8小时使用单个RTX 4090用于200集数据集.勒罗бот为训练管道提供了ACT,扩散政策和TDMPC2的合理默认设置.
首先要学习的任务
开始这些任务按难度排序.
**任务1:静止双手交.**机器人用一臂拿起物体,把它交给另一臂.基地保持静止.这验证了双手校准和协调,而不会增加基础运动复杂性.目标:50次示范,在第一次训练运行中60-70%的政策成功率.
**任务2:桌子
任务3:打开门. 接近门,抓住手柄,在协调基底运动时拉/推.这是一个可行的移动ALOHA任务,它显示了全身协调:随着门的摆动,基底必须与手臂同步移动.这比桌子
**任务4:物体交给人类.**机器人导航到一个人,伸出一臂,并在人抓住时释放物体.这需要检测人类存在和释放时间.目标:75个示范,有不同的人的位置,45-55%的成功率.
常见的设置错误
这些错误是RCSV在研发第一款移动ALOHA系统的实验室中最常见的.
- ** 跳出领袖臂重力补偿.** 没有重力补偿,领袖臂对操作员感到重.经营者疲劳在30分钟后开始,数据质量严重恶化. 在重力补偿模式下,设置Dynamixel电流限制为30-50%的额定扭矩.通过在各种姿势中保持领袖臂进行测试;它应该感到几乎无重力.
- **WiFi为领导人跟随者通信.**通过WiFi路由领导人跟随者控制循环引入20-100ms的可变延迟.系统感觉缓慢,操作员过度补偿,产生
的示范.使用直播USB到Dynamixel连接在机器上.领导人和跟随者臂必须在同一物理机器上. - ** 忽略摄像头同步.** 如果手腕摄像头和上部摄像头没有同步,记录的观测包含时间错调.在30fps,二摄像头错调是66ms,这对于快速操纵来说是显著的.使用硬件触发器同步 (RealSense多摄像头同步模块,50美元) 或在数据加载期间以最低时间标签为基础的对齐.
- **在静态任务中不锁定基地.***如果您仅收集操纵数据来增强移动示范 (共训方法),请启动基动车
或使用软件速度限制以防止基底漂移.在静态收集期间,基底漂移在数据集中增加噪音,而不会提供有用的移动信息. - 电缆管理不足. 宽松的电缆会被家具抓住,在运动中抓住手臂关节,并在剧集中偶尔断开.在剧集中断开相机损坏整个剧集.在所有移动电缆上使用电缆链或螺旋包裹,并在每次收集会议开始时检查电缆路由.
- ** 收集数据与不一致的任务定义.** "清理表"太模糊了. "从位置A中取出蓝杯,将其放入灰色桶"是足够具体的.任务标签中的不一致的示范使该政策混乱.在收集单个剧集之前,写一个任务规范文.
逐步组建指南
如果您有机器人硬件经验,则预算23天,或者45天,如果这是您的第一次构建.
步骤1:基础平台准备 (2-4小时). 解开AgileX追踪器,并与包装列表检查所有组件. 在继续前将电池充电完整 (4-6小时从空位). 安装追踪器在平面表面上,并通过运行AgileX诊断工具来验证全方位运动. 常见问题:追踪器将带有可能需要更新的固件,ROS2驱动程序之前需要更新. 在继续之前,请点击AgileX GitHub存储库的最新固件.
步骤2:安装框架构建 (4-8小时). 切割
**步骤3:后续臂部安装 (每臂3~4小时).**使用提供的M6螺栓将每款ViperX 300 S2安装到其基板上.扭矩达到6Nm.将U2D2 (USB到Dynamixel适配器) 连接到臂部的
步骤4:领袖臂安装 (每臂2~3小时). 每个WidowX 250 S在领袖臂支架上按腰高度安装.领袖臂必须被定位,以便操作员在行走后方舒适地保持它们.典型的安装高度:90-100厘米.在电流定位模式下配置领袖臂的伺服器,以抵消重力. 设定电流限制为40%,以确保舒适的操作. 通过在不同姿势中释放每个领袖臂来测试重力补偿,它应该保持基本静止,在30秒内漂移不到5度.
**第5步:
**第6步:摄像头安装 (2-3小时).**使用提供的或定制支架将两台D405手腕摄像头安装在后手腕腕上.D405具有最低深度范围7厘米,使其适合近距离操作.将每个手腕摄像头向下30-45度与抓住器平面相比,以最佳地覆盖抓住区. 按工作空间80-120厘米的高度安装D435上空相机.从垂直角度角度45-60度,以清晰地看到两臂工作空间.在臂面上以15-20厘米间隔保护所有相机USB电缆.
第7步:计算安装 (1-2小时). 将Intel NUC或相等级的安装在框架基板上,以防震动安装 (基本 - 基动作传输了可以放松USB连接的振动).连接所有USB设备:2xU2D2 (下臂),2xU2D2 (前臂),3xRealSense摄像头,1xAgileX基. 通过USB 3.0枢纽来确保足够的带宽.
ROS2软件堆设置
软件堆
基础操作系统安装:
# Install ROS2 Humble (follow official docs, then):
sudo apt install ros-humble-desktop python3-colcon-common-extensions
# Install Interbotix ROS2 packages for arm control
curl 'https://raw.githubusercontent.com/Interbotix/interbotix_ros_manipulators/main/interbotix_ros_xsarms/install/amd64/xsarm_amd64_install.sh' > xsarm_install.sh
chmod +x xsarm_install.sh && ./xsarm_install.sh -d humble
# Install RealSense SDK and ROS2 wrapper
sudo apt install ros-humble-librealsense2* ros-humble-realsense2-camera
# Install AgileX ROS2 driver
cd ~/colcon_ws/src
git clone https://github.com/agilexrobotics/agx_sdk_ros2.git
cd ~/colcon_ws && colcon build --symlink-install
# Install LeRobot for data recording and training
pip install lerobot
配置和校准:
- 通过使用Dynamixel Wizard,设置Dynamixel波特速率为1M (1000000) 在所有伺服器上.默认57600波特速度太慢,不能控制每臂7个伺服器的50Hz.
- 校准伺服零位置:将每个手臂移动到其机械主位置,并记录编码器的偏移.这些偏移用于每个手臂的Interbotix YAML配置文件.
- 配置领导者跟随者映射:每个领导联合映射 1:1 对相应的跟随者联合.Interbotix远程操作示例提供了这个映射,但检查所有7个关节 (包括抓住器) 在收集数据之前正确地追踪.
- 设置时间同步:安装Chrony并配置所有节点以使用相同的系统钟.摄像头时间
必须在清洁数据的联合状态时间 内5ms.运行 T4 以验证同步.
摄像头校准程序
摄像头校准不是可选的.未校准摄像头在记录的数据中产生空间错调,从而降低了10-25%的政策性能.
内在校准: 皇冠摄像头运行工厂校准,但这种校准可以随着时间或物理冲击而降低.通过运行皇冠自校准工具来验证内在校准.如果重新
**外观校准 (摄像头到基转换):**每个摄像头的相对机器人基架位置和方向必须准确测量.对于手腕摄像头,这主要由手臂的前进动力学以及摄像头安装偏移决定.用
多摄像头同步: 使用英特尔多摄像头同步电缆连接RealSense D435和D405摄像头 (可分开,约为50美元).配置一个摄像头作为主机,其他的作为奴隶.这确保所有摄像头同时捕捉框架,消除时间错误的调整,否则导致摄像头流之间的30-60 ms动荡. 没有硬件同步,你必须在数据加载管道中使用基于时间标签的排列,
第一数据收集:验证任务
在尝试任何真正的研究任务之前,收集验证数据集,以验证整个管道工作的端到端.
**任务定义:**从桌子中心拿起网球,把它放在一个碗里30厘米向右.这是最简单的双手任务:一只手拿起球,另一只手保持碗稳定.如果你的系统不能在50次演示中实现80%的成功,则必须在继续之前解决硬件或校准问题.
收藏程序:
- 在第20次示范中,将网球放在同一位置 (固定位置验证).
- 在接下来的30次示范中,在半径20厘米内改变球的位置 (位置多样性).
- 每次示范都需要15-30秒的活跃的远程操作. 拒绝放下球,放置失落碗或操作员进行超过2秒的纠正运动的事件.
- 使用LeRobot的
T6 脚本记录所有数据: T7
**训练和评估:**使用LeRobot默认的50个示范训练ACT.训练应在单个RTX 4090上完成1-2小时. 如果低于40%,在收集更多数据之前,请检查以下情况:摄像头校准准度,领导跟踪延迟,时间标签同步和数据记录完整性 (没有丢弃的框架).
扭矩规格和安全性
过
| Connection | Torque (Nm) | Notes |
|---|---|---|
| Frame extrusion joints (M8) | 10-12 | Use threadlocker on vibrating joints |
| Arm base mounting (M6) | 6 | Check monthly for loosening |
| Camera mount (M4) | 2-3 | Easy to strip; use calibrated driver |
| 夹爪 finger pads (M3) | 1-1.5 | 3D-printed parts; low torque to avoid cracking |
| Base-to-frame (M8) | 12-15 | Critical for base stability; double-check after first drive test |
安全考虑因素: 维iperX臂具有足够的扭矩,使其造成损伤. 始终执行软件关节限制 (设置在Interbotix YAML配置中) 防止臂部接触操作员,框架或彼此. 在初步测试期间设定速度限制为1.0rad/s,并在无碰撞操作后增加到1.5rad/s. 执行紧急停止按
维护和故障解决
定期维护可以防止数据收集停机时间.
- 每次会议前 (5 分钟): 检查电缆连接,验证摄像头传输,测试领导者跟踪者在3种姿势上,检查电池水平 (至少为2小时的会议充值40%).
- **每周:**检查所有
子 子是否放松.用微纤维布清洁摄像头镜头.检查1小时运行后的伺服器温度低于60C (通过Dynamixel Wizard检查).将收集的数据备份到第二驱动器. - 检查
米克塞尔伺服电缆,以确定关节上是否会磨损. 如果有安全补丁,请更新ROS2包. - 常见故障解决: 如果服务器在会议中停止响应,它可能过热了.等待10分钟冷却.如果问题持续,请检查该关节的TTL电缆.如果摄像头框架下降,请检查USB带宽 - - 三台RealSense摄像头需要USB3.0,通过USB2.0枢纽运行将导致框架下降.
相关阅读
模仿学习指南 · 行动与传播政策 · 机器人摄像头设置 · 机器人开始 · 每次示范分析的成本 · 数据注释指南 · 数据服务
数据记录配置
错误配置的记录会产生在审查过程中看起来很好的数据,但由于同步错误,错误的操作空间或缺失的模式,在训练过程中失败.
**录制频率.**记录合并状态在50Hz (ALOHA类系统的标准).摄像头框架在30fps.如果使用力扭矩传感器 (可选但建议用于接触丰富的任务),记录在500Hz和下样本50Hz数据加载期间以匹配合并状态频率.LeRobot的录制脚本在配置为ALOHA硬件时默认处理这些频率.
**行动空间配置.**ACT预计作为行动的绝对联合位置目标.每个行动向量是14维:每臂7关节 (6臂关节+1抓住器).关节位置是射线,抓住器的开口是动态
事件元数据. 每个HDF5事件文件都应该包含:
T8 :形状 (T,14),d型浮动32 --每一步都指挥联合位置 T9 :形状 (T,14),d型浮动32 --测量关节位置 T10 :形状 (T,14),d型浮动32 --测量关节速度 T11 :形状 (T, 480, 640, 3),d型 uint8 -- 空头相机 T12 :形状 (T, 480, 640, 3),d类型 T13 :形状 (T, 480, 640, 3),d类型 uint8 T14 :形状 (T,14),d型浮动32--伺服电流读数 (可选,可用于接触意识的政策) T15 :形状 (T, 2),d型浮动32 - 基线和角速度命令 - 属性:任务_名称 (字符串),成功 (bool),操作员_id (字符串),时间标签 (ISO格式)
# Verify a recorded episode for completeness
import h5py
import numpy as np
def verify_episode(filepath):
with h5py.File(filepath, 'r') as f:
T = f['/action'].shape[0]
checks = {
'action_shape': f['/action'].shape == (T, 14),
'qpos_shape': f['/observations/qpos'].shape == (T, 14),
'images_top': f['/observations/images/top'].shape[0] == T,
'images_lwrist': f['/observations/images/left_wrist'].shape[0] == T,
'images_rwrist': f['/observations/images/right_wrist'].shape[0] == T,
'no_nan_actions': not np.any(np.isnan(f['/action'][:])),
'joint_limits': np.all(np.abs(f['/action'][:]) < 3.14),
'episode_length': 50 < T < 3000, # 1-60 sec at 50Hz
}
for check, passed in checks.items():
status = 'PASS' if passed else 'FAIL'
print(f' {check}: {status}')
return all(checks.values())
常见记录错误:
- **时间表漂移:**如果使用软件时间表,而不是硬件同步,请检查相机框架时间表和联合状态时间表在整个集中保持在10 ms内的一致性.漂移在长时间的集中积累.每100集后进行同步检查.
- ** 摄像头
框:** 当三台RealSense摄像头共享USB3.0枢纽时,USB带宽纠纷会导致 框下降. 检查摄像头 框数量是否等于预期数量 (剧集_时间 * 30fps +/- 1个 ).如果没有 框,HDF5剧情将出现错误的观察-行动对,从而破坏了训练. - ** 抓住器操作编码错误:** 抓住器操作必须使用与训练管道相同的编码.ACT预计抓住器的位置与臂关节相同的坐标空间 (射线相当于或正常化为0-1).录音和训练编码之间的不匹配是"政策工作但抓住器永远不会关闭"的唯一最常见原因.
培养自己的第一政策
在收集验证数据集后,在LeRobot中训练ACT政策后,遵循一个简单的过程.
# Step 1: Push your dataset to HuggingFace Hub (or train locally)
# Assumes data was recorded with LeRobot's record script
python lerobot/scripts/push_dataset_to_hub.py \
--raw-dir data/aloha_validation \
--repo-id your-username/aloha-validation \
--raw-format aloha_hdf5
# Step 2: Train ACT policy
python lerobot/scripts/train.py \
policy=act \
dataset_repo_id=your-username/aloha-validation \
env=aloha \
training.num_epochs=2000 \
training.batch_size=8 \
policy.chunk_size=100 \
policy.kl_weight=10 \
policy.n_obs_steps=1 \
wandb.enable=true
# Step 3: Evaluate on the real robot
python lerobot/scripts/control_robot.py record \
--robot-path lerobot/configs/robot/aloha.yaml \
--fps 50 \
--policy-path outputs/train/act_aloha_validation/checkpoints/last/pretrained_model \
--warmup-time-s 2 \
--episode-time-s 30 \
--num-episodes 20
最重要的超参数训练:
T16 :预测未来100个时间步骤 (50Hz时2秒).较大的块减少了组合错误,但需要在演示中任务轨迹一致.从100开始,如果政策波动,将其降至50 T17 :控制CVAE规律化.较高的值 (50-100) 产生更平滑但不太精确的行动.较低的值 (1-5) 产生更敏 的行动,但风险模式崩 .在您的第一项任务上扫除 [1, 5, 10, 50]. T18 :用于RTX 4090的单GPU训练标准. 如果使用A10080GBVRAM,则将其增加到16-32. T19 :ACT通常在1000-1500个时代左右收缩. 观察验证损失 - - 如果它在200多个时代中 平,训练就完成了.
预期培训指标: 行动MSE损失在最初500个时代中应该从0.01降至0.001降至0.001然后逐步降至0.0005的
扩大规模:从验证到研究任务
一旦您的验证任务 (网球选用和放置) 达到60%以上的成功,您可以放心扩展到更复杂的任务.
- 增加多样性,而不仅仅是体积. 200个示例,具有不同物体位置 (5厘米格格在工作空间内) 和 3-5个不同的物体将培养出更好的政策,而不是 500个示例,具有一个固定位置的单个物体.
- 使用联合训练用于移动任务. 收集50-100个移动示范,并在训练期间结合它们与200-500个静态双手动示范.静态数据教导操纵技能;移动数据教导基础协调.LeRobot通过接受数据集列表的
T20 参数支持多数据集训. - **每阶段的成功监测.**当任务有多个阶段 (接近,抓住,运输,位置),请追踪发生失败的地方.如果80%的失败发生在抓住时,请专门收集HG-DAgger纠正,而不是重新收集完整的事件.
- **
代周期的预算.** 典型的周期是:收集50个演示,训练,评估,识别故障模式,收集更多的50个针对这些故障的演示,再训练.每任务的预算3-5个收集训练周期.RCSV的管理数据收集服务可以加速这种 代周期 - 我们的运营商被训练收集基于政策故障分析的目标纠正演示. 详细了解我们的 [数据服务]页面, 试点收藏费从2500美元开始.
解决问题 常见的培训失败
如果您的ACT政策不适用于真实机器人,请在重新收集数据之前使用此诊断指南.
| Symptom | Likely Cause | Fix |
|---|---|---|
| Robot does not move | Action normalization mismatch | Verify action stats (mean/std) match between training and deployment config |
| Arms collide with each other | 示范 include a wide range of arm positions; policy interpolates between modes | Add joint limit safety checks in deploy script; increase KL weight to 50 to reduce mode averaging |
| Policy drifts after 2-3 seconds | Control frequency mismatch: training at 50Hz, deploying at 30Hz | Match --fps between record and deploy commands exactly |
| 夹爪 never closes | 夹爪 action polarity inverted or normalized incorrectly | Check gripper min/max in the YAML config; verify open=0.0, closed=1.0 convention |
| Works on day 1, fails on day 2 | Camera bumped or lighting changed | Rigidly mount cameras with Loctite; run calibration check at start of each session |
| Jerky, oscillating motion near objects | Inconsistent operator strategies across demonstrations | Use a single operator; filter episodes by trajectory smoothness; increase temporal_agg weight |
移动基地集成:协调移动和操纵
移动ALOHA中的"移动"与静态ALOHA相比增加了相当的复杂性.AgileX追踪器基 (或Tracer Mini) 在全身遥操作期间必须与双臂协调.
基速度控制. 追踪器基通过CAN公交通过50Hz接受速度命令 (线性x,角性z).领导机器人的基位置 (通过奥多米特里追踪) 将速度命令映射到速度命令:领导的当前位置和跟随者基位置之间的偏移产生了比例的速度命令.操纵过程中最大安全速度:线性0.3 m/s,角性0.5 rad/s. 超过这些风险会导致臂部的
**协调行动空间.**移动ALOHA的全动行动空间是16维:每臂7关节 (14个总量) +2个基速度命令.在ACT训练中,所有16个维度都被共同预测,这使得政策能够学习协调的全身运动 (例如,在伸手时向前倾斜). 然而,基速度尺寸应该与联合位置不同,因为它们的单位和范围不同 - 根据最大安全速度将基速度正常化为[-1, 1].
使用时移动性. 不是每项任务都能从移动性中获益. 静态双手工任务 (在桌子上折叠衣服,在固定工作站上装配) 应被收集,以避免在训练数据中引入不必要的基动噪音. 只有任务真正需要时才能实现移动:从不同地点获取物体,在工作站之间导航,或超越静态臂工作空间的物体.
相关阅读
模仿学习指南 · 行动与传播政策 · 机器人开始 · 每次示范成本 · 数据注释 · 数据服务 · 机器人租
移动ALOHA摄像头配置
摄像头的放置对于移动ALOHA政策质量至关重要.标准配置使用3到4台摄像头,每个摄像头都在政策视觉理解中发挥着特定的作用.
| Camera | Position | Resolution | Role | Required? |
|---|---|---|---|---|
| Top/overhead | Center of base frame, 40-60cm above workspace | 640x480 @ 30fps | Global workspace awareness, object layout | Yes (primary) |
| Left wrist | Left arm wrist, pointing at gripper | 640x480 @ 30fps | Left arm grasp precision, contact detection | Recommended |
| Right wrist | Right arm wrist, pointing at gripper | 640x480 @ 30fps | Right arm grasp precision, contact detection | Recommended |
| Front-facing | Base frame front, eye-level | 640x480 @ 30fps | Navigation awareness, approach planning | Optional (mobile tasks only) |
USB带宽限制: 3台 640x480 30fps (未压缩的YUYV) 的摄像头需要大约1.1GB/s的USB带宽.一个单个USB 3.0端口提供5Gbps (实际:3.2Gbps).使用每个摄像头的单独USB 3.0控制器 - - 分享一个USB枢纽导致框架下降.英特尔RealSense D435和Logitech C922摄像头都很好工作.
摄像头校准检查列表: 安装后,对每个摄像头的内在 (OpenCV 机器人底架) 和外在进行校准. 存储校准作为数据集的部分. 物理安全的摄像头,安装螺丝
如何建立自己的道路
建立一个移动ALOHA系统需要经验丰富的机器人专业人员的24周的专注努力,或者一个没有以前的Dynamixel和ROS2经验的团队的68周.
**UMI (通用操纵界面):**使用一台GoPro相机的手持抓住器收集示范,而无需任何机器人硬件. UMI示范可以训练各种机器人臂部署的操纵政策. 如果您的任务需要移动,UMI不能捕获基本移动数据,因此它不是替代移动ALOHA,但它是仅用于操纵的数据收集的出发点.
RCSV管理数据收集: 如果您需要移动操作数据,但不想构建和维护硬件,RCSV在旧金山的设施运营移动ALOHA系统和其他双手机平台.我们的运营商接受了全身电操作任务的培训. 您定义任务规范和对象集合;我们收集,注释和提供数据集在LeRobot或RLDS格式中.这完全消除了硬件构建,并从一开始就给您提供专业收集的数据.查看我们的 [数据服务]
**租
跳过硬件构建
您的任务定义,我们将数据集交付,不需要硬件构建.
[查看数据服务]







