Configuración de la cámara de robot para la recopilación de datos: muñeca, cabeza y estereo
Guía completa de configuración de la cámara robótica para la recopilación de datos: muñeca vs cabeza superior vs colocación lateral, resolución, velocidad de fotogramas, sincronización, cámaras de profundidad, calibración y el estándar multi-cámara de RCSV.
Parte de: [Guía de recogida de datos de robots]
La colocación de la cámara es una de las decisiones más importantes y con mayor frecuencia subespecificadas en la recopilación de datos de robots.
Estrategia de colocación de cámaras
El primer principio de la colocación de las cámaras robóticas es: las cámaras utilizadas para la recopilación de datos deben ser idénticas en posición de montaje a las cámaras utilizadas para el despliegue de políticas. No hay recuperación de esta discrepancia. Definir la configuración de la cámara de despliegue antes de recopilar un solo episodio de datos de entrenamiento.
Las configuraciones más comunes en la investigación de manipulación son: solo de muñeca (una cámara montada en la muñeca del robot, mirando hacia adelante al espacio de trabajo de manipulación); solo de cabeza (una o dos cámaras montadas en un equipo de cabeza fija); y multi-visión (cámara de muñeca más una o dos cámaras externas que proporcionan contexto global del espacio de trabajo). Las configuraciones de visualización múltiple superan consistentemente a la visualización única en el desempeño de las políticas, a costa de una infraestructura de registro más compleja.
Las cámaras de muñeca: ventajas, desventajas y mejores prácticas
Las cámaras de muñeca proporcionan una visión en primera persona de la acción de manipulación
La principal limitación de las cámaras de muñeca es que no ven el espacio de trabajo global. El robot no puede percibir objetos lejos de su posición de agarre actual sin mover el brazo. Esto limita su efectividad para tareas que requieren comprensión a nivel de escena o coordinación bi-manual. Las especificaciones recomendadas: 1080p o una resolución superior, 60 fps y más, obturador global (no obturador rodante) para evitar el desenfoque de movimiento durante movimientos rápidos, y una lente de gran ángulo (90
Cámaras aéreas: configuración y compensación
Las cámaras de trabajo fijas proporcionan vistas estables y consistentes del espacio de trabajo que capturan toda la escena de manipulación. Son menos sensibles al movimiento del brazo y proporcionan un mejor contexto para tareas que requieren múltiples pasos secuenciales en diferentes regiones del espacio de trabajo.
La limitación es el detalle reducido en el punto de contacto de la manipulación. Una cámara aérea a 80 cm de altura mirando hacia abajo a un espacio de trabajo de mesa no puede observar confiablemente la geometría de contacto entre el sujetador y el objeto en objetos pequeños. Esta es la razón por la que las cámaras aéreas se emparejan típicamente con cámaras de muñeca en configuraciones de recopilación de datos de alto rendimiento
Resolución, velocidad de fotogramas y sincronización
Para la recopilación de datos de manipulación, 480p
La sincronización de varias cámaras es crítica y a menudo se descuida. Si las cámaras no están sincronizadas con hardware, se debe implementar cuidadosamente la alineación de timestamp durante la carga de datos. Incluso 33 ms de compensación entre cámaras (un fotograma a 30 fps) puede introducir inestabilidad de entrenamiento para tareas donde la muñeca y las vistas en la cabeza deben ser temporalmente consistentes. Las series Intel RealSense D435 y D455 admiten la sincronización de hardware a través de un cable de sincronización y son la opción preferida de RCSV para configuraciones sincronizadas de múltiples cámaras.
Tipos de cámaras para la robótica: una comparación técnica
Tipo de obturador: Global vs Rolling
Las cámaras de obturación global exponen todos los píxeles simultáneamente. Cada píxel en el marco representa el mismo instante en el tiempo. Las cámaras de obturación en rueda exponen los píxeles fila por fila, creando una sesga temporal en toda la imagen. Para un brazo robótico que se mueve a 0,5 m/s, un obturación en rueda con tiempo de lectura de 33 ms produce ~ 16 mm de distorsión en todo el marco. Esta distorsión es sistemática: los bordes verticales aparecen inclinados, y los objetos en rápido movimiento se manchan.
Para las cámaras montadas en el muñeco (que se mueven con el brazo), el obturador global es preferido. La cámara de muñeca experimenta la velocidad del brazo durante los movimientos de aproximación. Para las cámaras de cabeza fijas que no se mueven, el obturador rodante es aceptable para la mayoría de las tareas de manipulación porque el movimiento de la escena es más lento. La prima de costo para el obturador global es significativa
Tipo de sensor: Mono vs. Estereo vs. RGB-D
| Type | Depth | Cost | Weight | Outdoor Use | Best For |
|---|---|---|---|---|---|
| Monocular RGB | No | $50-400 | 20-80g | Yes | Wrist mount (lightweight), IL policies |
| Stereo | Computed | $300-2,000 | 150-350g | Yes | Outdoor mobile manipulation |
| Structured light RGB-D | Active IR | $200-500 | 70-200g | Poor (IR interference) | Indoor fixed mount, grasp planning |
| ToF RGB-D | Active IR (ToF) | $400-1,500 | 100-300g | Moderate | Long-range depth (1-10m) |
Recomendaciones específicas de las cámaras
| Camera | Type | Resolution | Shutter | Price | Best Use |
|---|---|---|---|---|---|
| Intel RealSense D435i | Stereo RGB-D + IMU | 1920x1080 (RGB), 1280x720 (depth) | Rolling (RGB), Global (IR) | $300 | RCSV default: overhead mount, hardware sync support |
| Intel RealSense D405 | Stereo RGB-D | 1280x720 | Global (all sensors) | $230 | Wrist mount (compact: 42x42x23mm) |
| StereoLabs ZED 2 | Stereo + neural depth | 4416x1242 (2x 2208x1242) | Rolling | $450 | Outdoor/mobile manipulation, long-range depth (20m) |
| FLIR Blackfly S | Mono RGB | Up to 5MP | Global (Sony Pregius) | $400-1,200 | High-quality wrist camera, GigE for long cable runs |
| Arducam OV9281 | Mono (grayscale) | 1280x800 | Global | $50 | Budget wrist camera, Raspberry Pi compatible |
Posiciones de montaje: muñeca vs cabeza sobre la cabeza vs tercera persona
El ojo en la mano (Monte de la Muñeca)
La cámara se mueve con el efecto final del robot, proporcionando una visión en primera persona de la acción de manipulación. Este punto de vista es altamente informativo para las tareas de agarre fina e inserción donde la relación entre el agarre y el objeto debe ser percibida con precisión.
Consideraciones de montaje: mantener la cámara lo más cerca posible del agarre (5-10 cm por encima) para minimizar el brazo de momento que crea vibración. Utilice un soporte rígido
Ojo a mano (por encima de la cabeza/exterior)
Las cámaras aéreas fijas proporcionan vistas estables y consistentes del espacio de trabajo. Montar a 60-80 cm por encima del espacio de trabajo para la manipulación de la mesa
Tercera persona (Visión lateral)
Una cámara de vista lateral a 30-45 grados de vertical proporciona información de profundidad que se pierde en una vista puramente aéreas. Este punto de vista es particularmente útil para tareas que involucran apilamiento vertical o inserción, donde la cámara aéreas no puede distinguir la altura. RCSV utiliza una cámara de tercera persona en el lado opuesto del espacio de trabajo de la cámara aéreas para maximizar la diversidad de puntos de vista.
Procedimientos de calibración
Calibración de los ojos en la mano
Para las cámaras montadas en el muñeco, se necesita la transformación del marco de la cámara al marco de efecto final del robot.
- Montar un objetivo de calibración (tabla de ChArUco recomendada sobre tabla de ajedrez para la robustez) en una posición fija en el espacio de trabajo
- Mover el robot a 15-20 posiciones diferentes donde el objetivo sea visible, grabando la posición del factor final del robot y la visión de la cámara del objetivo en cada posición
- Ejecutar un solvente de calibración de ojos a mano (OpenCV
T0 o el paquete T1 ROS2) para calcular la transformación del efector cámara a final - Valida mediante la orden del robot para tocar un punto conocido en el marco de la cámara
El error de posición debe ser inferior a 3 mm
# Calibración ROS2 ojo en mano con fácil _handeye ros2 lanzamiento fácil _handeye2 calibrate.launch.py \ eye_on_hand:=true \ robot_base_frame:=base_link \ robot_effector_frame:=tool0 \ tracking_base_frame:=camera_link \ tracking_marker_frame:=marker_frame
Calibración de ojo a mano
Para las cámaras fijas, se necesita la transformación del marco de la cámara al marco de base del robot.
- Unir la placa de ChArUco al efecto final del robot
- Mover el robot a 15-20 posiciones donde el objetivo sea visible desde la cámara fija
- Correr
T2 con T3 - Valida colocando un objeto en una posición conocida y comparando las coordenadas estimadas por la cámara y la realidad de la tierra
Recalibra después de cualquier ajuste de la cámara (incluso golpeando la montaje), después del mantenimiento del hardware en el brazo y como un chequeo programado mensual.
Cámaras de profundidad
Las cámaras de profundidad proporcionan mediciones de distancia por píxel además de imágenes RGB, lo que permite la comprensión de escenas en 3D sin reconstrucción estereo explícita. La información de profundidad es valiosa para tareas donde la altura, forma o posición 3D de los objetos es importante para [plan de grifo] (T9
La diferencia: las cámaras de profundidad añaden peso, costo y carga de procesamiento. Utilice profundidad cuando su arquitectura de política se beneficie explícitamente de la entrada 3D, cuando las tareas implican variaciones significativas de profundidad (apilación de objetos de diferentes alturas) o cuando necesite un rendimiento robusto en condiciones de iluminación variables (la profundidad es más invariable en cuanto a la iluminación que en RGB).
Configuración del controlador de cámara ROS2
Para las cámaras RealSense (las más comunes en la investigación de manipulación), el paquete
# Instalar RealSense ROS2 envuelto sudo apt instalar ros-humble-realsense2-camera # Lanzar con las configuraciones recomendadas para la recopilación de datos ros2 lanzar realsense2_camera rs_launch.py \ profundidad_module.profile:=640x480x30 \ rgb_camera.profile:=640x480x30 \ enable_sync:=true \ align_depth.enable:=true \ pointcloud.enable:=false # save bandwidth # For hardware-synchronized multi-camera setup # Camera 1 (master): inter_camera_c_mode:=1 # 2 (esclave): inter_camera\sync_mode\GP: # Connect pinc cameras with camera (c) cable (=5)
Configuración clave para la recopilación de datos: habilita la
Calibración y estándar multi-camera del RCSV
El estándar de recopilación de datos del RCSV utiliza una configuración fija de tres cámaras: una cámara de muñeca por brazo más una cámara calibrada por estación. Las montajes de cámaras físicas forman parte de nuestro diseño de estaciones de trabajo estandarizado, lo que garantiza una colocación consistente en todas nuestras instalaciones. Todos los parámetros de calibración se registran automáticamente e incluyen en las exportaciones de conjuntos de datos. Para los equipos que establecen su propia infraestructura de recopilación de datos, RCSV ofrece consultas de configuración de cámaras y puede suministrar ensambles de cámaras precalibrados
Lectura relacionada
- [Guía de datos de formación de robots]
- [Annotación de datos de robots]
- [Guía de robots de ALOHA]
- [Sensores de robots multimodal]
- [Encuesta de planificación de la empresa en 2025]
- [Forzas de contacto en manipulación]
- [Servicios de datos]
- [Catálogo de hardware]
- [Glosario]







