返回Blog

机器人操纵的多模特传感:视觉,力和触觉融合

如何结合视觉,力/扭矩和触觉传感,以实现强大的机器人操纵

机器人武器指南

T3)

其他模式的故障模式都包括在内,问题是如何在没有复杂性的情况下结合它们.

为什么单模特感觉短暂

只有视觉操纵在接触时失败.一旦机器人手指放在物体上,它们往往会遮住摄像头的接触区.在接近时良好工作的视觉政策在任务的精确接触阶段中崩.

只有强力控制 (阻力控制,强力伺服器) 缺乏空间信息.它可以检测接触时和调节接触力,但不能告诉你你是否触摸正确的表面,是否抓住姿势稳定,或者物体是否移动.

触觉传感器本身提供丰富的接触几何信息,但具有有限的空间范围.

结合这三个模式,涵盖了每个模式的故障模式,并产生了比单独的任何一种模式更强大的政策.

传感器模态度比较

Modality Range Bandwidth Spatial Resolution Failure Mode Cost
RGB camera 0.3-5m 30-200 Hz Sub-pixel (0.1-0.5mm) Lighting, occlusion, specular $100-1,200
Depth (structured light) 0.1-3m 30-90 Hz 1-5mm depth error Transparent, outdoor, multi-cam interference $200-600
Wrist 6-axis F/T Contact only 1,000-7,000 Hz N/A (single point) No spatial info, measures sum of contacts $1,500-8,000
Tactile array Contact only 100-500 Hz 1-3mm per taxel Limited area, wear, calibration drift $300-5,000
IMU (wrist-mounted) Local motion 200-1,000 Hz N/A Drift, bias, limited to acceleration/rotation $5-50
Audio (contact microphone) 0-2m 16-48 kHz N/A Background noise, non-contact states $10-100

按模式的硬件建议

视觉 (RGB + 深度)

第三方上空费用: Intel RealSense D435i ($250).桌面操纵研究标准. 30fps深度 640x480 + RGB. 查看我们的 [摄像头设置指南]

近距离手腕摄像头: Intel RealSense D405 ($300) 在5-50cm范围内深度,或FLIR Blackfly S BFS-U3-16S2C ($450) 在全球关闭器 RGB 速度高达226fps. D405 优化于近距离深度 在接近阶段对手眼协调至关重要.

何时添加立体音频: 如果您需要深度在范围 (1-5m) 和结构光干扰是一个问题 (多部摄像头或户外),使用像ZED 2 ($450). 立体音频深度在阳光下工作,不会干扰其他深度摄像头.

强力/扭矩

预算选择: 机器人 FT 300 ($1,500-3,000). 100 Hz, +/-0.1N精度. 足以进行一般操作,抓住力控制和碰撞检测. 直接与万能机器人臂相结合.

研究选项: ATI Mini45 ($5,000-8,000). 7 kHz, +/-0.05N精度.精度插入和组装任务的黄金标准. 要求用于毫米以下宽容的任务.查看我们的 [接触力指南]T5) 控制模式.

**仅基于软件的选项:**来自机器人的动态模型的联合扭矩估计. 免费,始终可用,但仅限于+/-0.5Nm精度. 适用于碰撞检测和粗接触感测.可用于Franka (内置的联合扭矩传感器),UR (外部扭矩估计),以及大多数现代武器.

触觉

光学触觉 (GelSight Mini): 300-600美元.可提供高分辨率接触图像 (640x480的接触贴片) 在 30-60Hz.最适合:纹理识别,触摸对象识别和细粒度滑动检测.限制:大型形状因素使得难以集成到精英手中.

** 容量阵列 (XELA uSkin):** $1,500-5,000. 每个车辆的3轴力提供100-500Hz. 最适合:滑动检测,接触本地化和实时力分布监测.

**Paxini触觉传感器:**500-1,500美元.分布式正常+切割力在1mm空间分辨率,200Hz.RCSV存储Paxini传感器 查看我们的 硬件目录.

国际货币联盟

腕部安装的IMU (BNO055或ICM-42688-P,$5-50) 提供高频加速和导向数据.有用于:在操纵过程中检测撞击事件,在工具使用时测量振动签名,以及提供高频运动反,当摄像头框架速度不够时. IMU 是最便宜的传感器,最容易的集成. 它不需要与其他传感器相比进行校准,并且通过I2C或SPI通信.

音频

接口麦克风 (价值10-100美元) 安装在抓住器或手腕上捕捉到接触事件的声信号. 最近的研究 (Gandhi and Pinto, 2020; Clarke et al., 2023) 表明,音频提供了有用的联系信息:从音声音中区分材料类型 (金属与塑料与木材),检测稳定的抓住闭合时刻,并从点击声音中识别组装成功. 音频是目前操纵系统中最少使用的模式 轻量轻,简单,有惊人的信息性.

传感器融合方法

早期融合: 将所有传感器功能向量集成到政策网络中的一个输入. 简单的实现. 要求所有传感器在训练和部署时间都存在.

** 晚融合:** 训练每个模式的独立编码器,然后在操作头前在瓶层上结合注意力或连锁. 较强于缺失传感器,如果需要,可以掩盖部署过程中一种模式的贡献. 建议用于传感器故障的生产系统.

跨注意力变压器融合: 将每个传感器的输出视为代币的序列,并使用变压器跨注意力,让模式相互关注.这是最近的基础模型中使用的架构 (OpenVLA 使用视觉代币 + 语言代币与跨注意力).比晚期的融合更具表达性,但需要更多数据才能有效训练.

** 层次融合:** 在任务的不同阶段使用不同的模式. 视觉用于方法规划 (长距离),强力用于接触检测和合规性 (中距离),触觉用于细微操纵 (接触). 这不是神经网络的融合. 执行和调试比学习融合更简单,并且在任务阶段可以明显分离时,通常会超过学习方法.

标题同步

多模系统中最常见的实现挑战是时间同步.传感器运行在不同的频率 (摄像头30Hz,F/T在1kHz,触摸在200Hz) 和不同的延迟.ROS2为近似时间同步提供T0:

编码:自动化\______________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________________

关键同步参数: T1参数确定了消息之间的最大允许时间差异.设置为您最慢传感器的时间段 (33ms为30Hz摄像头).为了收集数据,还记录每个传感器的原始时间标志,以便您可以验证同步质量后. 视觉和力量数据之间发生超过10ms的同步错误可能会降低政策培训

校准要求

Sensor 标定 Type Frequency Time Required Critical Error If Skipped
RGB camera (fixed) Intrinsic + extrinsic (hand-eye) Monthly or after any adjustment 15-30 min 5-20mm position error
Wrist camera Eye-in-hand calibration Monthly 20 min 2-10mm position error
Wrist F/T sensor Bias removal (tare) + tool weight Daily (tare) / monthly (full) 2 min (tare) / 15 min (full) 1-5N force bias error
Tactile array Flat-surface zero + known-force check Weekly 10 min 10-30% force reading error
IMU None required (auto-calibrates) N/A 0 min Minimal (bias drift is auto-corrected)

电力和体重预算

每个加到机器人臂的传感器都会增加手腕的有效载荷和功率抽取.对于具有有限的有效载荷容量的武器 (例如,OpenArm 1在1公斤的有效载荷,ViperX 300在750克),传感器重量预算是紧张的:

Component Weight Power Notes
RealSense D405 (wrist) 52g 1.5W (USB) Lightest depth camera for wrist
ATI Mini45 F/T 92g 2.5W Plus 50g for cable/connector
GelSight Mini 35g per finger 1W (USB) Adds width to finger — check gripper clearance
XELA uSkin pad 15g per pad 0.5W Thinnest tactile option
Paxini tactile sensor 20g per pad 0.5W Best resolution/weight ratio
IMU (BNO055 breakout) 3g 0.01W Negligible weight and power
Contact microphone 5g 0.01W Negligible weight and power

一个全多模式手腕堆 (D405 + ATI Mini45 + 2x GelSight Mini) 体重约为265g,并引入7W.这在Franka Research 3 (3kg的有效载荷) 的预算范围内,但在与抓住器结合时超过OpenArm 1 (1kg) 的有效载荷.在选择你的手臂之前,计划你的传感器堆,或者根据抓住器后剩下的手臂的有效载荷选择传感器.

实际实施建议

  • 起点 视觉仅: 顶部相机+手腕相机.这种配置足以完成70至80%的操纵任务,不需要任何力或触觉硬件.
  • 接触丰富的任务: 加入手腕F/T传感器. 6轴旋转钥匙提供了接触检测和控制力,这显著提高了插入和组装任务的性能.
  • 外层操纵: 添加触觉传感 (GelSight或容量阵列). 高分辨率接触几何可以在手中重新抓住和发现滑动.
  • **全多模特:**视觉+F/T+触觉+IMU+音频. 仅用于多模特学习的研究或每种可用的信号都帮助的任务 (例如自动手术机器人,电子组装).
  • 不要先前添加模式: 每种额外的模式都增加了数据收集复杂性 (需要用所有传感器记录进行示范),注释总费和训练复杂性.

培训数据的含义

多模拟政策要求所有传感器模式同时记录的示范.这意味着您的数据收集设置必须在收集时均有所有传感器的校准和记录.将现有仅视力示范的力或触觉数据后调是不可能的.

一个实用策略:使用全套传感器组合收集所有示范,然后训练除模型 (仅视觉,视觉+力量,全多模特) 并评估每一个. 这告诉你每个传感方式的边际价值,为你的具体任务,从而为未来的数据收集投资提供信息.

RCSV的 [数据收集设置]T7) 支持多传感器记录,并加上RGB,深度,手腕摄像头,手腕F/T和触觉传感器的同步时刻.我们的标准工作站配置 (OpenArm 1或DK1双手动) 在50Hz下记录所有模式,并进行10ms以下同步.根据要求可使用自定义传感器集成 (Paxini触觉,GelSight,音频). 试点数据收集费用从2,500美元开始;

相关阅读

  • ,我知道,我在.
  • 机器人摄像头设置指南
  • [机器人训练数据指南]
  • [机器人数据注释]
  • T13) 关于"Grasp计划调查"的调查
  • [数据服务]
  • 其他类型的设备

收集多模拟机器人示范数据

基于RCSV的数据收集基础设施,可支持视觉,深度和力度模式的同步多传感器记录.

[查看数据服务]