机器人操纵的多模特传感:视觉,力和触觉融合
如何结合视觉,力/扭矩和触觉传感,以实现强大的机器人操纵
机器人武器指南
其他模式的故障模式都包括在内,问题是如何在没有复杂性的情况下结合它们.
为什么单模特感觉短暂
只有视觉操纵在接触时失败.一旦机器人手指放在物体上,它们往往会遮住摄像头的接触区.在接近时良好工作的视觉政策在任务的精确接触阶段中崩
只有强力控制 (阻力控制,强力伺服器) 缺乏空间信息.它可以检测接触时和调节接触力,但不能告诉你你是否触摸正确的表面,是否抓住姿势稳定,或者物体是否移动.
触觉传感器本身提供丰富的接触几何信息,但具有有限的空间范围.
结合这三个模式,涵盖了每个模式的故障模式,并产生了比单独的任何一种模式更强大的政策.
传感器模态度比较
| Modality | Range | Bandwidth | Spatial Resolution | Failure Mode | Cost |
|---|---|---|---|---|---|
| RGB camera | 0.3-5m | 30-200 Hz | Sub-pixel (0.1-0.5mm) | Lighting, occlusion, specular | $100-1,200 |
| Depth (structured light) | 0.1-3m | 30-90 Hz | 1-5mm depth error | Transparent, outdoor, multi-cam interference | $200-600 |
| Wrist 6-axis F/T | Contact only | 1,000-7,000 Hz | N/A (single point) | No spatial info, measures sum of contacts | $1,500-8,000 |
| Tactile array | Contact only | 100-500 Hz | 1-3mm per taxel | Limited area, wear, calibration drift | $300-5,000 |
| IMU (wrist-mounted) | Local motion | 200-1,000 Hz | N/A | Drift, bias, limited to acceleration/rotation | $5-50 |
| Audio (contact microphone) | 0-2m | 16-48 kHz | N/A | Background noise, non-contact states | $10-100 |
按模式的硬件建议
视觉 (RGB + 深度)
第三方上空费用: Intel RealSense D435i ($250).桌面操纵研究标准. 30fps深度 640x480 + RGB. 查看我们的 [摄像头设置指南]
近距离手腕摄像头: Intel RealSense D405 ($300) 在5-50cm范围内深度,或FLIR Blackfly S BFS-U3-16S2C ($450) 在全球关闭器 RGB 速度高达226fps. D405 优化于近距离深度
何时添加立体音频: 如果您需要深度在范围 (1-5m) 和结构光干扰是一个问题 (多部摄像头或户外),使用像ZED 2 ($450). 立体音频深度在阳光下工作,不会干扰其他深度摄像头.
强力/扭矩
预算选择: 机器人 FT 300 ($1,500-3,000). 100 Hz, +/-0.1N精度. 足以进行一般操作,抓住力控制和碰撞检测. 直接与万能机器人臂相结合.
研究选项: ATI Mini45 ($5,000-8,000). 7 kHz, +/-0.05N精度.精度插入和组装任务的黄金标准. 要求用于毫米以下宽容的任务.查看我们的 [接触力指南]
**仅基于软件的选项:**来自机器人的动态模型的联合扭矩估计. 免费,始终可用,但仅限于+/-0.5Nm精度. 适用于碰撞检测和粗
触觉
光学触觉 (GelSight Mini): 300-600美元.可提供高分辨率接触图像 (640x480的接触贴片) 在 30-60Hz.最适合:纹理识别,触摸对象识别和细粒度滑动检测.限制:大型形状因素使得难以集成到精英手中.
** 容量阵列 (XELA uSkin):** $1,500-5,000. 每个车辆的3轴力提供100-500Hz. 最适合:滑动检测,接触本地化和实时力分布监测.
**Paxini触觉传感器:**500-1,500美元.分布式正常+切割力在1mm空间分辨率,200Hz.RCSV存储Paxini传感器
国际货币联盟
腕部安装的IMU (BNO055或ICM-42688-P,$5-50) 提供高频加速和导向数据.有用于:在操纵过程中检测撞击事件,在工具使用时测量振动签名,以及提供高频运动反
音频
接口麦克风 (价值10-100美元) 安装在抓住器或手腕上捕捉到接触事件的声信号. 最近的研究 (Gandhi and Pinto, 2020; Clarke et al., 2023) 表明,音频提供了有用的联系信息:从
传感器融合方法
早期融合: 将所有传感器功能向量集成到政策网络中的一个输入. 简单的实现. 要求所有传感器在训练和部署时间都存在.
** 晚融合:** 训练每个模式的独立编码器,然后在操作头前在瓶
跨注意力变压器融合: 将每个传感器的输出视为代币的序列,并使用变压器跨注意力,让模式相互关注.这是最近的基础模型中使用的架构 (OpenVLA 使用视觉代币 + 语言代币与跨注意力).比晚期的融合更具表达性,但需要更多数据才能有效训练.
** 层次融合:** 在任务的不同阶段使用不同的模式. 视觉用于方法规划 (长距离),强力用于接触检测和合规性 (中距离),触觉用于细微操纵 (接触). 这不是神经网络的融合. 执行和调试比学习融合更简单,并且在任务阶段可以明显分离时,通常会超过学习方法.
标题同步
多模系统中最常见的实现挑战是时间同步.传感器运行在不同的频率 (摄像头30Hz,F/T在1kHz,触摸在200Hz) 和不同的延迟.ROS2为近似时间同步提供
编码:自动化\______________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________
关键同步参数:
校准要求
| Sensor | 标定 Type | Frequency | Time Required | Critical Error If Skipped |
|---|---|---|---|---|
| RGB camera (fixed) | Intrinsic + extrinsic (hand-eye) | Monthly or after any adjustment | 15-30 min | 5-20mm position error |
| Wrist camera | Eye-in-hand calibration | Monthly | 20 min | 2-10mm position error |
| Wrist F/T sensor | Bias removal (tare) + tool weight | Daily (tare) / monthly (full) | 2 min (tare) / 15 min (full) | 1-5N force bias error |
| Tactile array | Flat-surface zero + known-force check | Weekly | 10 min | 10-30% force reading error |
| IMU | None required (auto-calibrates) | N/A | 0 min | Minimal (bias drift is auto-corrected) |
电力和体重预算
每个加到机器人臂的传感器都会增加手腕的有效载荷和功率抽取.对于具有有限的有效载荷容量的武器 (例如,OpenArm 1在1公斤的有效载荷,ViperX 300在750克),传感器重量预算是紧张的:
| Component | Weight | Power | Notes |
|---|---|---|---|
| RealSense D405 (wrist) | 52g | 1.5W (USB) | Lightest depth camera for wrist |
| ATI Mini45 F/T | 92g | 2.5W | Plus 50g for cable/connector |
| GelSight Mini | 35g per finger | 1W (USB) | Adds width to finger — check gripper clearance |
| XELA uSkin pad | 15g per pad | 0.5W | Thinnest tactile option |
| Paxini tactile sensor | 20g per pad | 0.5W | Best resolution/weight ratio |
| IMU (BNO055 breakout) | 3g | 0.01W | Negligible weight and power |
| Contact microphone | 5g | 0.01W | Negligible weight and power |
一个全多模式手腕堆
实际实施建议
- 起点
视觉仅: 顶部相机+手腕相机.这种配置足以完成70至80%的操纵任务,不需要任何力或触觉硬件. - 接触丰富的任务: 加入手腕F/T传感器. 6轴旋转钥匙提供了接触检测和控制力,这显著提高了插入和组装任务的性能.
- 外层操纵: 添加触觉传感 (GelSight或容量阵列). 高分辨率接触几何可以在手中重新抓住和发现滑动.
- **全多模特:**视觉+F/T+触觉+IMU+音频. 仅用于多模特学习的研究或每种可用的信号都帮助的任务 (例如自动手术机器人,电子组装).
- 不要先前添加模式: 每种额外的模式都增加了数据收集复杂性 (需要用所有传感器记录进行示范),注释总费和训练复杂性.
培训数据的含义
多模拟政策要求所有传感器模式同时记录的示范.这意味着您的数据收集设置必须在收集时均有所有传感器的校准和记录.将现有仅视力示范的力或触觉数据后调是不可能的.
一个实用策略:使用全套传感器组合收集所有示范,然后训练
RCSV的 [数据收集设置]
相关阅读
,我知道,我在 中 . - 机器人摄像头设置指南
- [机器人训练数据指南]
- [机器人数据注释]
T13 ) 关于"Grasp计划调查"的调查 - [数据服务]
- 其他类型的设备
收集多模拟机器人示范数据
基于RCSV的数据收集基础设施,可支持视觉,深度和力度模式的同步多传感器记录.
[查看数据服务]







