Volver a Research

Cámara de muñeca vs cámara fija para la manipulación de robots: tradeoffs y mejores prácticas

Cuando utilizar cámaras montadas en la muñeca frente a cámaras fijas en la parte superior/lateral para la manipulación de robots <unk> Resolución, oclusión, calibración y implicaciones de datos de entrenamiento.

[← Investigación]

La colocación de la cámara es una de las decisiones de mayor apalancamiento en un sistema de percepción de robots. Aquí hay una comparación sistemática con datos reales de rendimiento.

Por qué es importante colocar las cámaras

Los post mortem de proyectos de aprendizaje de robots fallidos identifican consistentemente la percepción, no el control, como la causa principal de los fallos de las políticas. Y dentro de la percepción, la colocación de la cámara no la calidad de la cámara es la variable más impactante. Una cámara RealSense D435i bien colocada de $200 supera a una cámara industrial de $1,500 mal colocada para tareas de manipulación.

La colocación de la cámara determina: qué información visual recibe la política, si la oclusión del brazo bloquea momentos críticos, cuánto la calibración se deriva con el tiempo y si la política se generaliza a través de posiciones del espacio de trabajo.

Cámara fija: ventajas

  • ** Calibración estable:** Una cámara rígidamente montada mantiene su calibración extrínseca (posición y orientación en relación con la base del robot) indefinidamente, expansión térmica modulo. No se requiere calibración dinámica. Recalibración en la configuración y después de cualquier alteración física.
  • No se maneja el cable: Las cámaras fijas se conectan a través de cables USB 3 o GigE estándar a un PC cercano.
  • Ancho campo de visión: Una cámara montada 6080 cm por encima y ligeramente detrás del espacio de trabajo captura toda la escena relevante objeto, agarre, brazo y entorno proporcionando contexto global para la planificación de tareas y la estimación del estado.
  • ** Configuración fácil de múltiples vistas:** Se pueden añadir múltiples cámaras fijas en diferentes ángulos (a la cabeza, al lado, frente a la altura de la muñeca).
  • ** Mejor para la estimación del estado de tarea global:** Las tareas que requieren una comprensión del espacio de trabajo completo (por ejemplo, "¿dónde debo colocar este objeto dado el arreglo actual?") se benefician de la vista global que solo proporciona una cámara fija.

Cámara fija: Desventajas

  • Oclusión del brazo durante el acercamiento: A medida que el brazo se mueve hacia el objeto, la estructura del brazo y el agarre ocultan la visión de la cámara de la interfaz agarre-objeto precisamente en el momento en que la retroalimentación visual precisa es más crítica. Este es el modo de falla principal para los sistemas de manipulación solo con cámara fija en tareas de precisión.
  • ** Resolución de acercamiento limitada:** A una distancia fija de 6080 cm, 1 píxel de cámara corresponde a aproximadamente 0,51 mm de espacio de trabajo. Para tareas que requieren una precisión de <3 mm, esta resolución es insuficiente para la fase final de contacto.
  • ** Performance dependiente de la posición:** La apariencia de los objetos (tamaño, iluminación, perspectiva) cambia significativamente a medida que el objeto se mueve a través del espacio de trabajo.

La cámara de muñeca: ventajas

  • Sigue el efecto final: La cámara de muñeca mantiene una visión consistente y de cerca del agarre y del objeto cercano independientemente de la configuración del brazo. Este es el análogo humano natural observamos lo que nuestras manos están haciendo durante la manipulación de precisión.
  • No hay oclusión del sujetador-objeto: Desde la perspectiva de la cámara de muñeca, el sujetador está en la escena, pero la interfaz del sujetador-objetario es siempre visible (con una montaje orientada hacia adelante o un ángulo ligeramente hacia abajo).
  • ** Apariencia consistente independientemente de la posición del espacio de trabajo:** Debido a que la cámara se mueve con el brazo, la apariencia de los objetos en la cámara de muñeca es casi idéntica en todas las posiciones del espacio de trabajo (la misma distancia, ángulo similar). Esto reduce dramáticamente la cantidad de datos necesarios para generalizarse en todas las posiciones del espacio de trabajo.
  • Alta resolución efectiva al contacto: A una distancia entre la cámara de pulsera y el objeto de 1020 cm, 1 píxel corresponde a < 0,1 mm. Incluso una cámara de 640×480 a esta distancia proporciona información visual de grado de precisión para la detección de la fase de contacto.

La cámara de muñeca: desventajas

  • ** Calibración dinámica requerida:** La calibración extrínseca de la cámara de muñeca (posición relativa al agarre) debe ser conocida con precisión. La calibración de manos y ojos (utilizando un objetivo de calibración en una posición conocida) se requiere en la configuración y después de cualquier alteración física de la montaje de la muñeca. Esto agrega 3060 minutos de tiempo de configuración por recalibración.
  • Rastreamiento de cable: El cable de la cámara debe ser enrutado desde la muñeca, a lo largo del brazo, a la base del robot y luego al PC. El enrutamiento de cable que no se une o se agrietará durante todo el rango de movimiento del brazo es un verdadero reto de ingeniería.
  • Vibración y choque: Las cámaras montadas en la muñeca experimentan vibraciones mecánicas de los motores del robot, especialmente durante movimientos de alta velocidad o eventos de contacto. Esto puede borrar las imágenes en momentos críticos.
  • ** Contexto global limitado:** La cámara de muñeca muestra solo una pequeña región alrededor del agarre. Para tareas que requieren una conciencia global del espacio de trabajo (posición de múltiples objetos, manipulación secuencial con objetos ampliamente separados), la visión solo de la muñeca es insuficiente.

El estándar RCSV: Sistema de 3 cámaras

Basándose en datos de rendimiento de las políticas en más de 40 tareas de manipulación, la configuración estándar de la cámara de RCSV es un sistema de 3 cámaras: dos cámaras fijas a altura de la muñeca desde diferentes ángulos, más una cámara montada en la muñeca.

  • Cámara 1 (fija, frente-izquierda): Intel RealSense D435i, montada a la altura de la muñeca (6070 cm sobre la mesa) en un ángulo de 3045° desde la parte frontal.
  • Camera 2 (fija, frente derecha): El mismo modelo, colocación simétrica. Junto con la cámara 1, proporciona una reconstrucción de profundidad estéreo y doble cobertura que elimina la mayor parte de la oclusión del brazo desde la perspectiva fija.
  • Camera 3 (montada en la muñeca): OAK-D (OpenCV AI Kit con profundidad) o RealSense D405 (diseñado para el montaje en la muñeca, con un rango de 550 cm optimizado), montado en el agarre hacia adelante hacia abajo a 30° por debajo de la horizontal.

Recomendaciones de la resolución

Camera Position Minimum Resolution Recommended Notes
Fixed (60–80 cm distance) 1280×720 @ 30fps 1920×1080 @ 30fps Higher res important for far-field precision
Wrist (10–20 cm distance) 640×480 @ 30fps 848×480 @ 60fps Higher fps helps with fast gripper motion
Overhead (90–120 cm) 1280×720 @ 30fps 1920×1080 @ 15fps Global context; lower fps acceptable

Sincronización de los disparadores de hardware

Para los sistemas de cámaras múltiples, la sincronización de cuadros es crítica. Sin sincronización de hardware, las cámaras se desplazan en relación entre sí (debido a la variación de tiempo del marco USB), causando datos de entrenamiento con imágenes de vista múltiples no iguales. Esta es una fuente documentada de degradación de la política.

  • Trigger de hardware: Una señal de gatillo GPIO (desde el controlador robot o una caja de sincronización dedicada) dispara todas las cámaras simultáneamente. RealSense D435i admite la sincronización de gatillo de hardware a través de GPIO.
  • Sincronización de software (falloback): Si el gatillo de hardware no está disponible, utilice la sincronización NTP y seleccione los cuadros coincidentes según el sello de tiempo.

El rendimiento de la política: comparación de configuración de la cámara

Camera Setup Success Rate (Precisión Assembly) Success Rate (Pick-and-Place) Notes
Single fixed (overhead) 42% 74% Severe occlusion during approach
Single wrist only 65% 68% Good precision, poor global context
Two fixed (stereo) 58% 81% Better occlusion coverage, still limited close-up
Fixed + wrist (2-camera) 78% 86% Good balance, standard for research
Two fixed + wrist (3-camera) 84% 89% RCSV standard; best overall performance

La configuración de 3 cámaras ofrece una mejora de 19 puntos porcentuales en comparación con una cámara fija única en tareas de ensamblaje de precisión una diferencia que es poco probable que se recupere por cambios en el algoritmo o más datos de una configuración de cámara inferior.

Todas las demostraciones en el programa de recopilación de datos de RCSV se recopilan utilizando la configuración estándar de 3 cámaras, con marcos sincronizados con hardware y extrínsecas calibradas incluidas en el conjunto de datos entregado.

Consulta de configuración de la cámara y recopilación de datos

RCSV proporciona consultoría de configuración de cámara para nuevos programas de robots, y recopila todos los datos de demostración utilizando nuestra configuración validada de 3 cámaras sincronizada con hardware.

Servicios de datos de contacto →