Volver a Blog

Configuración de la cámara de robot para la recopilación de datos: muñeca, cabeza y estereo

Guía completa de configuración de la cámara robótica para la recopilación de datos: muñeca vs cabeza superior vs colocación lateral, resolución, velocidad de fotogramas, sincronización, cámaras de profundidad, calibración y el estándar multi-cámara de RCSV.

Parte de: [Guía de recogida de datos de robots]

La colocación de la cámara es una de las decisiones más importantes y con mayor frecuencia subespecificadas en la recopilación de datos de robots.

Estrategia de colocación de cámaras

El primer principio de la colocación de las cámaras robóticas es: las cámaras utilizadas para la recopilación de datos deben ser idénticas en posición de montaje a las cámaras utilizadas para el despliegue de políticas. No hay recuperación de esta discrepancia. Definir la configuración de la cámara de despliegue antes de recopilar un solo episodio de datos de entrenamiento.

Las configuraciones más comunes en la investigación de manipulación son: solo de muñeca (una cámara montada en la muñeca del robot, mirando hacia adelante al espacio de trabajo de manipulación); solo de cabeza (una o dos cámaras montadas en un equipo de cabeza fija); y multi-visión (cámara de muñeca más una o dos cámaras externas que proporcionan contexto global del espacio de trabajo). Las configuraciones de visualización múltiple superan consistentemente a la visualización única en el desempeño de las políticas, a costa de una infraestructura de registro más compleja.

Las cámaras de muñeca: ventajas, desventajas y mejores prácticas

Las cámaras de muñeca proporcionan una visión en primera persona de la acción de manipulación el robot ve aproximadamente lo que está haciendo en su efector final. Este punto de vista es altamente informativo para las tareas de apretamiento y inserción finas donde la relación entre el agarre y el objeto debe ser percibida con precisión. Las cámaras de muñeca también siguen automáticamente el agarre a través del espacio de trabajo, asegurando que el objeto objetivo esté siempre en el marco durante la manipulación.

La principal limitación de las cámaras de muñeca es que no ven el espacio de trabajo global. El robot no puede percibir objetos lejos de su posición de agarre actual sin mover el brazo. Esto limita su efectividad para tareas que requieren comprensión a nivel de escena o coordinación bi-manual. Las especificaciones recomendadas: 1080p o una resolución superior, 60 fps y más, obturador global (no obturador rodante) para evitar el desenfoque de movimiento durante movimientos rápidos, y una lente de gran ángulo (90110 grados FOV) para mantener la visión del punto de contacto de agarre a corto alcance.

Cámaras aéreas: configuración y compensación

Las cámaras de trabajo fijas proporcionan vistas estables y consistentes del espacio de trabajo que capturan toda la escena de manipulación. Son menos sensibles al movimiento del brazo y proporcionan un mejor contexto para tareas que requieren múltiples pasos secuenciales en diferentes regiones del espacio de trabajo.

La limitación es el detalle reducido en el punto de contacto de la manipulación. Una cámara aérea a 80 cm de altura mirando hacia abajo a un espacio de trabajo de mesa no puede observar confiablemente la geometría de contacto entre el sujetador y el objeto en objetos pequeños. Esta es la razón por la que las cámaras aéreas se emparejan típicamente con cámaras de muñeca en configuraciones de recopilación de datos de alto rendimiento la vista aéreas proporciona contexto de tarea y posicionamiento grueso, mientras que la vista a la muñeca proporciona detalles de manipulación finos.

Resolución, velocidad de fotogramas y sincronización

Para la recopilación de datos de manipulación, 480p720p por cámara a 30 fps es suficiente para la mayoría de las políticas de aprendizaje de imitación en 2026. Una resolución más alta (1080p) mejora el rendimiento en tareas que requieren una discriminación espacial fina. Las velocidades de fotogramas superiores a 60 fps proporcionan rendimientos disminuyentes para la mayoría de las tareas de manipulación y aumentan significativamente los requisitos de almacenamiento.

La sincronización de varias cámaras es crítica y a menudo se descuida. Si las cámaras no están sincronizadas con hardware, se debe implementar cuidadosamente la alineación de timestamp durante la carga de datos. Incluso 33 ms de compensación entre cámaras (un fotograma a 30 fps) puede introducir inestabilidad de entrenamiento para tareas donde la muñeca y las vistas en la cabeza deben ser temporalmente consistentes. Las series Intel RealSense D435 y D455 admiten la sincronización de hardware a través de un cable de sincronización y son la opción preferida de RCSV para configuraciones sincronizadas de múltiples cámaras.

Tipos de cámaras para la robótica: una comparación técnica

Tipo de obturador: Global vs Rolling

Las cámaras de obturación global exponen todos los píxeles simultáneamente. Cada píxel en el marco representa el mismo instante en el tiempo. Las cámaras de obturación en rueda exponen los píxeles fila por fila, creando una sesga temporal en toda la imagen. Para un brazo robótico que se mueve a 0,5 m/s, un obturación en rueda con tiempo de lectura de 33 ms produce ~ 16 mm de distorsión en todo el marco. Esta distorsión es sistemática: los bordes verticales aparecen inclinados, y los objetos en rápido movimiento se manchan.

Para las cámaras montadas en el muñeco (que se mueven con el brazo), el obturador global es preferido. La cámara de muñeca experimenta la velocidad del brazo durante los movimientos de aproximación. Para las cámaras de cabeza fijas que no se mueven, el obturador rodante es aceptable para la mayoría de las tareas de manipulación porque el movimiento de la escena es más lento. La prima de costo para el obturador global es significativa aproximadamente 2-3x para una resolución equivalente así que usala donde importa (muñeca) y ahorra presupuesto en otros lugares (cargas superiores).

Tipo de sensor: Mono vs. Estereo vs. RGB-D

Type Depth Cost Weight Outdoor Use Best For
Monocular RGB No $50-400 20-80g Yes Wrist mount (lightweight), IL policies
Stereo Computed $300-2,000 150-350g Yes Outdoor mobile manipulation
Structured light RGB-D Active IR $200-500 70-200g Poor (IR interference) Indoor fixed mount, grasp planning
ToF RGB-D Active IR (ToF) $400-1,500 100-300g Moderate Long-range depth (1-10m)

Recomendaciones específicas de las cámaras

Camera Type Resolution Shutter Price Best Use
Intel RealSense D435i Stereo RGB-D + IMU 1920x1080 (RGB), 1280x720 (depth) Rolling (RGB), Global (IR) $300 RCSV default: overhead mount, hardware sync support
Intel RealSense D405 Stereo RGB-D 1280x720 Global (all sensors) $230 Wrist mount (compact: 42x42x23mm)
StereoLabs ZED 2 Stereo + neural depth 4416x1242 (2x 2208x1242) Rolling $450 Outdoor/mobile manipulation, long-range depth (20m)
FLIR Blackfly S Mono RGB Up to 5MP Global (Sony Pregius) $400-1,200 High-quality wrist camera, GigE for long cable runs
Arducam OV9281 Mono (grayscale) 1280x800 Global $50 Budget wrist camera, Raspberry Pi compatible

Posiciones de montaje: muñeca vs cabeza sobre la cabeza vs tercera persona

El ojo en la mano (Monte de la Muñeca)

La cámara se mueve con el efecto final del robot, proporcionando una visión en primera persona de la acción de manipulación. Este punto de vista es altamente informativo para las tareas de agarre fina e inserción donde la relación entre el agarre y el objeto debe ser percibida con precisión.

Consideraciones de montaje: mantener la cámara lo más cerca posible del agarre (5-10 cm por encima) para minimizar el brazo de momento que crea vibración. Utilice un soporte rígido 3D impresos PLA montajes flexionarse bajo aceleración y producir imágenes borrosas. Ruta el cable USB a través de un alivio de tensión a lo largo del brazo para evitar la fatiga del cable en el conector. Presupuesto de peso: mantener el peso total de la cámara + montaje + cable por debajo de 100 g para minimizar el impacto en la dinámica del brazo.

Ojo a mano (por encima de la cabeza/exterior)

Las cámaras aéreas fijas proporcionan vistas estables y consistentes del espacio de trabajo. Montar a 60-80 cm por encima del espacio de trabajo para la manipulación de la mesa esta altura proporciona una cobertura completa del espacio de trabajo a 90 grados FOV mientras se mantiene una resolución suficiente en objetos pequeños.

Tercera persona (Visión lateral)

Una cámara de vista lateral a 30-45 grados de vertical proporciona información de profundidad que se pierde en una vista puramente aéreas. Este punto de vista es particularmente útil para tareas que involucran apilamiento vertical o inserción, donde la cámara aéreas no puede distinguir la altura. RCSV utiliza una cámara de tercera persona en el lado opuesto del espacio de trabajo de la cámara aéreas para maximizar la diversidad de puntos de vista.

Procedimientos de calibración

Calibración de los ojos en la mano

Para las cámaras montadas en el muñeco, se necesita la transformación del marco de la cámara al marco de efecto final del robot.

  1. Montar un objetivo de calibración (tabla de ChArUco recomendada sobre tabla de ajedrez para la robustez) en una posición fija en el espacio de trabajo
  2. Mover el robot a 15-20 posiciones diferentes donde el objetivo sea visible, grabando la posición del factor final del robot y la visión de la cámara del objetivo en cada posición
  3. Ejecutar un solvente de calibración de ojos a mano (OpenCV T0 o el paquete T1 ROS2) para calcular la transformación del efector cámara a final
  4. Valida mediante la orden del robot para tocar un punto conocido en el marco de la cámara El error de posición debe ser inferior a 3 mm

# Calibración ROS2 ojo en mano con fácil _handeye ros2 lanzamiento fácil _handeye2 calibrate.launch.py \ eye_on_hand:=true \ robot_base_frame:=base_link \ robot_effector_frame:=tool0 \ tracking_base_frame:=camera_link \ tracking_marker_frame:=marker_frame

Calibración de ojo a mano

Para las cámaras fijas, se necesita la transformación del marco de la cámara al marco de base del robot.

  1. Unir la placa de ChArUco al efecto final del robot
  2. Mover el robot a 15-20 posiciones donde el objetivo sea visible desde la cámara fija
  3. Correr T2 con T3
  4. Valida colocando un objeto en una posición conocida y comparando las coordenadas estimadas por la cámara y la realidad de la tierra

Recalibra después de cualquier ajuste de la cámara (incluso golpeando la montaje), después del mantenimiento del hardware en el brazo y como un chequeo programado mensual.

Cámaras de profundidad

Las cámaras de profundidad proporcionan mediciones de distancia por píxel además de imágenes RGB, lo que permite la comprensión de escenas en 3D sin reconstrucción estereo explícita. La información de profundidad es valiosa para tareas donde la altura, forma o posición 3D de los objetos es importante para [plan de grifo] (T9), y para políticas que utilizan entradas de nube de punto en lugar de entradas de imagen puras.

La diferencia: las cámaras de profundidad añaden peso, costo y carga de procesamiento. Utilice profundidad cuando su arquitectura de política se beneficie explícitamente de la entrada 3D, cuando las tareas implican variaciones significativas de profundidad (apilación de objetos de diferentes alturas) o cuando necesite un rendimiento robusto en condiciones de iluminación variables (la profundidad es más invariable en cuanto a la iluminación que en RGB).

Configuración del controlador de cámara ROS2

Para las cámaras RealSense (las más comunes en la investigación de manipulación), el paquete T4 ROS2 proporciona un controlador completo:

# Instalar RealSense ROS2 envuelto sudo apt instalar ros-humble-realsense2-camera # Lanzar con las configuraciones recomendadas para la recopilación de datos ros2 lanzar realsense2_camera rs_launch.py \ profundidad_module.profile:=640x480x30 \ rgb_camera.profile:=640x480x30 \ enable_sync:=true \ align_depth.enable:=true \ pointcloud.enable:=false # save bandwidth # For hardware-synchronized multi-camera setup # Camera 1 (master): inter_camera_c_mode:=1 # 2 (esclave): inter_camera\sync_mode\GP: # Connect pinc cameras with camera (c) cable (=5)

Configuración clave para la recopilación de datos: habilita la T5 para sincronizar la profundidad y las corrientes RGB dentro de una cámara. Configure T6 para obtener la profundidad alineada con los píxeles y RGB. Deshable la nube de punto para ahorrar CPU y ancho de banda. Para configuraciones de múltiples cámaras, utilice el modo de sincronización de hardware para garantizar que todas las cámaras capturen los marcos al mismo instante.

Calibración y estándar multi-camera del RCSV

El estándar de recopilación de datos del RCSV utiliza una configuración fija de tres cámaras: una cámara de muñeca por brazo más una cámara calibrada por estación. Las montajes de cámaras físicas forman parte de nuestro diseño de estaciones de trabajo estandarizado, lo que garantiza una colocación consistente en todas nuestras instalaciones. Todos los parámetros de calibración se registran automáticamente e incluyen en las exportaciones de conjuntos de datos. Para los equipos que establecen su propia infraestructura de recopilación de datos, RCSV ofrece consultas de configuración de cámaras y puede suministrar ensambles de cámaras precalibrados [contáctenos]T10) o ver nuestra [página de servicios de datos]T11) para más detalles.

Lectura relacionada

  • [Guía de datos de formación de robots]
  • [Annotación de datos de robots]
  • [Guía de robots de ALOHA]
  • [Sensores de robots multimodal]
  • [Encuesta de planificación de la empresa en 2025]
  • [Forzas de contacto en manipulación]
  • [Servicios de datos]
  • [Catálogo de hardware]
  • [Glosario]