Sensores de robots para el aprendizaje de la manipulación: cámaras, codificadores, fuerza y táctil
Guía de los sensores utilizados en el aprendizaje de la manipulación de robots <unk> codificadores conjuntos, cámaras, sensores de fuerza/torque y sensores táctiles con especificaciones.
[← Aprende]
La selección y calidad de los sensores determinan directamente lo que puede aprender una política de robot.
Por qué los sensores son importantes para aprender
Una política de robot es tan buena como sus entradas. La política observa el mundo a través de sensores y debe inferir todo lo que necesita para actuar
Tres propiedades del sensor son las más importantes: resolución (cuánto detalle se captura), ** latencia** (cuán vieja es la información cuando la política la utiliza) y ** sincronización** (si todos los sensores informan el mismo momento en el tiempo).
Los codificadores conjuntos
Los codificadores articulares son los sensores de estado primarios para un brazo robótico
Encoders absolutos son estándar en los cobots modernos. A diferencia de los codificadores incrementales (que solo miden los cambios), los codificadores absolutos informan el ángulo conjunto verdadero desde el momento de la energía en, sin requerir una rutina de orientación.
- Resolución: Normalmente de 19 bits, dando 219 = 524,288 pasos por revolución, o aproximadamente 0,0007° por paso. Esto es más que suficiente para la manipulación
el cumplimiento mecánico en las juntas es el factor limitante. - Rata de muestra: 1 kHz para posición conjunta; la velocidad se calcula generalmente diferenciando la posición con un filtro de bajo paso.
- Latencia: 0,5
2 ms desde el ángulo físico hasta el valor reportado sobre el bus motor (normalmente EtherCAT o CAN). - Rol en el aprendizaje: Los datos de codificación conjunta proporcionan el estado propioceptivo del robot
su propia configuración corporal que siempre se incluye como entrada de política junto con las imágenes de la cámara.
Cámaras RGB
Las cámaras RGB son los sensores más ricos en información para la manipulación. Una única cámara 720p proporciona ~1 millón de píxeles por fotograma, cada uno codificando color y textura.
- Resolución: 640×480 (VGA) es el mínimo para el reconocimiento de objetos; 1280×720 (HD) es estándar; 1920×1080 (FHD) añade detalles para la manipulación de objetos pequeños.
- Rata de fotogramas: 30 fps para la manipulación lenta; 60 fps para tareas rápidas o seguimiento dinámico.
- ** Interfaz:** USB3 es conveniente pero tiene latencia no determinista. GigE Vision (Ethernet) proporciona un tiempo determinista
preferido para configuraciones sincronizadas de múltiples cámaras. - Tipo de obturador: Obturador global captura todos los píxeles simultáneamente (sin distorsión de obturador en movimientos rápidos); crítico para cámaras de pulsera que se mueven rápidamente.
- Configuración típica: 3 cámaras por estación de robot
una en la parte superior, una en el lado/frente, una en la muñeca.
Cámaras de profundidad
Las cámaras de profundidad añaden una medida de distancia a cada píxel, dando a la política una geometría 3D explícita. El modelo más comúnmente utilizado en la investigación de manipulación es el ** Intel RealSense D435** (luz estructurada / estéreo activo).
- Rango: 0,1 m a 3 m; precisión óptima en 0,3
1,5 m. - Rata de fotogramas: 30 fps a una resolución de profundidad de 848×480.
- Limitación: La luz estructurada tiene un mal rendimiento en superficies brillantes, especulares o transparentes (vidrio, metal, agua).Para estos materiales, los sensores táctiles o la retroalimentación de la fuerza proporcionan información de contacto más confiable.
- Cuándo utilizar: Seleccionar la planificación en mesas desordenadas, seleccionar la basura, cualquier tarea en la que la estimación de la altura del objeto importe.
Sensores de fuerza/torque
Un sensor de seis ejes de fuerza/torque de muñeca (F/T) mide las fuerzas y torques que el efecto final ejerce sobre (y recibe de) el entorno.
- ** Medidas:** Fx, Fy, Fz (fuerzas en tres ejes) y Tx, Ty, Tz (torques alrededor de tres ejes).
- Rango típico: ± 200 N de fuerza, ± 10 Nm de par.
- Ancho de banda: 1 kHz, que permite la detección de contactos en tiempo real.
- ** Aplicaciones:** Detección de éxito de la agarre (fuerza por debajo del umbral → objeto deslizado), inserción conforme (pego en agujero mediante búsqueda guiada por la fuerza), contacto humano-robótico seguro (determinación si se detecta una fuerza inesperada), seguimiento de la superficie.
- En las políticas: Las lecturas de F/T pueden incluirse directamente como entradas de políticas
las políticas entrenadas con datos de F/T muestran un rendimiento de tareas significativamente mejorado en relación con el contacto.
Sensores táctiles
Los sensores táctiles miden la información de contacto distribuida a nivel de la punta del dedo
- ** GelSight (MIT):** Una punta de dedo de gel suave con una cámara interna. El contacto deforma el gel, y la cámara imita la deformación, proporcionando una geometría de contacto de alta resolución (~ 400 × 300 píxeles por dedo).
- Array capacitivo: Una red de sensores de presión capacitivos en la superficie del dedo. Peso más ligero que GelSight; resolución más baja pero rápida (> 1 kHz).
- Estado actual: La detección táctil en el aprendizaje robótico es un área de investigación activa
la mayoría de los sistemas de producción utilizan sensores F/T y dependen de cámaras para el resto.
Tarifas de datos de sensores y requisitos de almacenamiento
| Sensor | Sample Rate | Data per Second | Data per 2-min Episodio |
|---|---|---|---|
| Joint encoders (7-DOF) | 1000 Hz | ~56 KB/s | ~6.7 MB |
| RGB camera 720p JPEG (×3) | 30 Hz | ~9 MB/s | ~1.1 GB |
| Depth camera 480p (×1) | 30 Hz | ~28 MB/s raw (lossless) | ~3.4 GB raw |
| Force/torque sensor | 1000 Hz | ~48 KB/s | ~5.8 MB |
| Tactile sensor (GelSight ×2) | 30 Hz | ~6 MB/s | ~720 MB |
| Typical total (3 RGB + joints + F/T) | — | ~9 MB/s | ~1.1 GB |
Sincronización del tiempo
Todos los sensores deben estar marcados en un reloj común.Sin sincronización, un marco de cámara capturado a t=100 ms y un estado conjunto registrado a t=105 ms se emparejarán incorrectamente durante el entrenamiento, añadiendo ruido a cada muestra.
Las mejores prácticas:
- Trigger de hardware: Un impulso GPIO del controlador activa todas las cámaras simultáneamente. Esto logra una sincronización de < 1 ms y es el estándar para configuraciones de recopilación de datos serias.
- Simbol de tiempo del software: Registrar el tiempo del sistema al recibirlo; aplicar compensaciones de latencia fija medidas por sensor. Lleva a una sincronización de 5
20 ms adecuada para las políticas de cámara de 30 fps, marginal para tareas de alta velocidad. - PTP/IEEE 1588: Protocolo de tiempo de red a nivel de hardware para configuraciones de múltiples máquinas.
Para navegar por los sensores y accesorios compatibles para su configuración de manipulación, visite la tienda de equipos RCSV.







