Volver a Blog

Detección multimodal para la manipulación de robots: visión, fuerza y fusión táctil

Cómo combinar la visión, la fuerza/torque y la detección táctil para una robusta manipulación robótica <unk> arquitecturas de fusión de sensores y su implementación práctica.

Parte de: [Guía de armas de robots]

[← Blog] T3)

Cada modalidad de detección cubre los modos de falla de los demás.

Por qué el sentido de una sola modalidad se queda corto

La manipulación sólo de la visión falla en el contacto. Una vez que los dedos del robot están en un objeto, a menudo ocultan la zona de contacto de la cámara. Las políticas visuales que funcionan bien durante el enfoque se rompen durante la fase de contacto de precisión de las tareas inserción, agarre estable, superficies seguidas porque la información que necesitan ahora está detrás de la propia mano del robot.

El control solo por fuerza (control de impedancia, servo de fuerza) carece de información espacial. Puede detectar cuando se hace contacto y regular la fuerza de contacto, pero no puede decirle si está tocando la superficie correcta, si la posición de agarre es estable o si el objeto se ha movido.

El sensor táctil por sí solo proporciona una rica información geométrica de contacto pero tiene un alcance espacial limitado.

La combinación de las tres modalidades cubre los modos de falla de cada modalidad y produce políticas que son sustancialmente más sólidas que cualquier modalidad sola.

Comparación de modalidad del sensor

Modality Range Bandwidth Spatial Resolution Failure Mode Cost
RGB camera 0.3-5m 30-200 Hz Sub-pixel (0.1-0.5mm) Lighting, occlusion, specular $100-1,200
Depth (structured light) 0.1-3m 30-90 Hz 1-5mm depth error Transparent, outdoor, multi-cam interference $200-600
Wrist 6-axis F/T Contact only 1,000-7,000 Hz N/A (single point) No spatial info, measures sum of contacts $1,500-8,000
Tactile array Contact only 100-500 Hz 1-3mm per taxel Limited area, wear, calibration drift $300-5,000
IMU (wrist-mounted) Local motion 200-1,000 Hz N/A Drift, bias, limited to acceleration/rotation $5-50
Audio (contact microphone) 0-2m 16-48 kHz N/A Background noise, non-contact states $10-100

Recomendaciones de hardware por modalidad

Visión (RGB + profundidad)

Third-person overhead: Intel RealSense D435i ($250). El estándar para la investigación de manipulación de la mesa. 640x480 a 30fps de profundidad + RGB. Consulte nuestra [guía de configuración de la cámara]T4) para las posiciones de montaje y calibración.

Camera de pulsera de alcance cercano: Intel RealSense D405 ($ 300) para profundidad en rango de 5-50 cm, o FLIR Blackfly S BFS-U3-16S2C ($ 450) para RGB de cierre global a hasta 226 fps.

Cuándo agregar estereo: Si necesita profundidad en el rango (1-5 m) y la interferencia estructurada con la luz es una preocupación (múltiples cámaras o al aire libre), use una cámara estereo como la ZED 2 ($ 450).

Fuerza/torque

** Opción de presupuesto:** Robotiq FT 300 ($ 1,500-3,000). 100 Hz, +/- 0,1 N de precisión. Suficiente para la manipulación general, el control de la fuerza de captura y la detección de colisión.

** Opción de investigación:** ATI Mini45 ($5.000-8.000). 7 kHz, +/-0.05N precisión. El estándar de oro para tareas de inserción y montaje de precisión. Requerido para tareas con tolerancias sub-milimétricas. Ver nuestra guía de fuerzas de contacto)

Sólo para software: Estimativa de par articulado del modelo dinámico del robot. Libre, siempre disponible, pero limitado a +/-0.5Nm de precisión. Útil para la detección de colisiones y la detección de contacto grueso. Disponible en Franka (sensores de par articulados incorporados), UR (estimación de par externo) y la mayoría de los brazos modernos.

Táctil

Táctil óptico (GelSight Mini): $300-600. Proporciona una imagen de contacto de alta resolución (640x480 del parche de contacto) a 30-60 Hz. Mejor para: reconocimiento de textura, identificación de objetos por contacto y detección de deslizamientos de granos finos.

Array capacitivo (XELA uSkin): $1,500-5,000. Proporciona una fuerza de 3 ejes por taxel a 100-500 Hz. Mejor para: detección de deslizamientos, localización de contactos y monitoreo de distribución de fuerza en tiempo real. Mejor factor de forma para una integración de manos destreza.

** Sensor táctil Paxini:** $500-1.500. Distribuido normal + fuerza de corte a una resolución espacial de 1 mm, 200 Hz. RCSV existencias de sensores Paxini ver nuestro [catálogo de hardware] T6). buen equilibrio de resolución, velocidad y factor de forma para la integración de la agarre.

UMI

Un IMU montado en la muñeca (BNO055 o ICM-42688-P, $ 5-50) proporciona datos de aceleración y orientación de alta frecuencia. La UMI es el sensor más barato para agregar y el más fácil de integrar no requiere calibración en relación con otros sensores y se comunica a través de I2C o SPI.

Audio

Los micrófonos de contacto ($ 10-100) montados en el pegamento o la muñeca capturan firmas acústicas de eventos de contacto. Los trabajos recientes (Gandhi y Pinto, 2020; Clarke et al., 2023) han demostrado que el audio proporciona información de contacto útil: distinguir tipos de materiales (metal vs. plástico vs. madera) de los sonidos del grifo, detectar el momento de cierre estable de la agarre e identificar el éxito de ensamblaje de los sonidos de clic. El audio es la modalidad más poco utilizada en los sistemas de manipulación actuales fácil de agregar, ligero y sorprendentemente informativo.

Los enfoques de fusión de sensores

Fusión temprana: Concaten todos los vectores de características de los sensores en una sola entrada de la red de políticas. Sencillo de implementar. Requiere que todos los sensores estén presentes tanto en el tiempo de entrenamiento como en el tiempo de implementación si algún sensor falla o no está disponible, la política no puede funcionar. Apto cuando la disponibilidad del sensor está garantizada y desea la implementación más simple posible.

Fusión tardía: Entrenar codificadores independientes para cada modalidad, luego combinar en una capa de cuello de botella con atención o concatenamiento antes de la cabeza de acción. Más robusto para los sensores faltantes se puede ocultar la contribución de una modalidad durante el despliegue si es necesario. Recomendado para sistemas de producción donde la falla del sensor es una posibilidad real.

Fusión transformer de atención cruzada: Trate la salida de cada sensor como una secuencia de tokens y use la atención transformer cruzada para que las modalidades se atiendan entre sí. Esta es la arquitectura utilizada en los modelos de base recientes (OpenVLA utiliza tokens visuales + tokens de lenguaje con atención cruzada).

** Fusión jerárquica:** Utilice diferentes modalidades en diferentes etapas de la tarea. Visión para la planificación de aproximación (rango largo), fuerza para la detección y cumplimiento de contactos (rango medio), táctil para la manipulación fina (contacto). Más sencillo de implementar y debug que la fusión aprendida, y a menudo supera los enfoques aprendidos cuando las fases de tarea son claramente separables.

ROS2 Sincronización de temas

El desafío de implementación más común en los sistemas multimodal es la sincronización del tiempo. Los sensores funcionan a diferentes frecuencias (cámara a 30 Hz, F/T a 1 kHz, táctil a 200 Hz) y tienen diferentes latencias. ROS2 proporciona T0 para la sincronización aproximada del tiempo:

# ROS2 Python: Sincronizar la cámara, F/T, y los filtros conjuntos de importación de mensajes de estado_filtros de sensor_msgs.msg Imagen de importación, JointState de geometría_msgs.msg importación WrenchStamped class MultimodalSync(Node): def __init___self: super(__init__('multimodal_sync') # Suscriptores para cada modalidad self.cam_sub =_filters.Subscriptor Imagen, '/camera/time/image_messages_app.\\sms.\scrop_sequenc.\scrop_enrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrrr

Parámetros clave de sincronización: el parámetro T1 determina la diferencia de tiempo máxima permitida entre los mensajes. Configúralo en el período de su sensor más lento (33 ms para la cámara de 30 Hz). Para la recopilación de datos, también graba las temporizas primas de cada sensor para que pueda verificar la calidad de la sincronización después del momento. Un error de sincronización mayor a 10 ms entre los datos de visión y fuerza puede degradar la formación de la política la política aprende correlaciones incorrectas entre lo que ve y lo que siente.

Requisitos de calibración

Sensor Calibración Type Frequency Time Required Critical Error If Skipped
RGB camera (fixed) Intrinsic + extrinsic (hand-eye) Monthly or after any adjustment 15-30 min 5-20mm position error
Wrist camera Eye-in-hand calibration Monthly 20 min 2-10mm position error
Wrist F/T sensor Bias removal (tare) + tool weight Daily (tare) / monthly (full) 2 min (tare) / 15 min (full) 1-5N force bias error
Tactile array Flat-surface zero + known-force check Weekly 10 min 10-30% force reading error
IMU None required (auto-calibrates) N/A 0 min Minimal (bias drift is auto-corrected)

Presupuesto de energía y peso

Cada sensor añadido al brazo robótico aumenta la carga útil de la muñeca y el poder de extracción. Para los brazos con capacidad de carga útil limitada (por ejemplo, OpenArm 1 a 1 kg de carga útil, ViperX 300 a 750 g), el presupuesto de peso del sensor es ajustado:

Component Weight Power Notes
RealSense D405 (wrist) 52g 1.5W (USB) Lightest depth camera for wrist
ATI Mini45 F/T 92g 2.5W Plus 50g for cable/connector
GelSight Mini 35g per finger 1W (USB) Adds width to finger — check gripper clearance
XELA uSkin pad 15g per pad 0.5W Thinnest tactile option
Paxini tactile sensor 20g per pad 0.5W Best resolution/weight ratio
IMU (BNO055 breakout) 3g 0.01W Negligible weight and power
Contact microphone 5g 0.01W Negligible weight and power

Una pila de muñecas multimodal completa (D405 + ATI Mini45 + 2x GelSight Mini) pesa aproximadamente 265g y disfruta de 7W. Esto está dentro del presupuesto para una Franka Research 3 (3kg de carga útil) pero excede la carga útil de un OpenArm 1 (1kg) cuando se combina con un agarre. Planifique su pila de sensores antes de seleccionar su brazo, o elija sensores basados en la carga útil que queda de su brazo después del agarre.

Recomendación de aplicación práctica

  • Punto de partida visión solamente: cámara superior + cámara de muñeca. Esta configuración es suficiente para 70-80% de las tareas de manipulación y no requiere fuerza ni hardware táctil.
  • Tarea de contacto: Añadir sensor F/T de muñeca. La llave de 6 ejes proporciona detección de contacto y regulación de la fuerza que mejora dramáticamente el rendimiento de la tarea de inserción y montaje.
  • ** Manipulación externa:** Añadir detección táctil (GelSight o matriz capacitiva). La geometría de contacto de alta resolución permite la re-atracción manual y la detección de deslizamientos.
  • Multimodal completo: Visión + F/T + táctil + IMU + audio. Sólo necesario para la investigación sobre aprendizaje multimodal o para tareas en las que cada señal disponible ayuda (por ejemplo, robótica quirúrgica autónoma, ensamblaje de electrónica).
  • No agregue modalidades preventivamente: Cada modalidad adicional añade complejidad de recopilación de datos (necesita demostraciones con la grabación de todos los sensores), gastos generales de anotación y complejidad de entrenamiento.

Implicaciones de los datos de formación

Las políticas multimodal requieren demostraciones con todas las modalidades de sensor grabadas simultáneamente. Esto significa que su configuración de recopilación de datos debe tener todos los sensores calibrados y registrados sincrónicamente en el momento de la recopilación.

Una estrategia práctica: recoger todas las demostraciones con el conjunto completo de sensores, luego entrenar modelos ablados (solo de visión, visión + fuerza, multimodal completo) y evaluar cada uno. Esto le dice el valor marginal de cada modalidad de detección para su tarea específica, lo que informa las futuras inversiones en la recopilación de datos.

La configuración de nuestra estación de trabajo estándar (OpenArm 1 o DK1 bimanual) registra todas las modalidades a 50 Hz con sincronización de sub-10ms. La recopilación de datos piloto comienza en $2,500; campañas completas en $8,000.

Lectura relacionada

  • [Forzas de contacto en manipulación]
  • [Guía de configuración de la cámara del robot]
  • [Guía de datos de formación de robots]
  • [Annotación de datos de robots]
  • [Modelos de VLA explicados]
  • [Encuesta de planificación de la empresa]
  • [Servicios de datos]
  • [Catálogo de hardware]
  • [Glosario]

Recoger datos de demostración de robots multimodal

La infraestructura de recopilación de datos de RCSV admite la grabación sincronizada de múltiples sensores para las modalidades de visión, profundidad y fuerza.

[Explorar los Servicios de Datos]