Volver a Blog

Manipulación móvil en 2025: estado de la técnica y implementaciones prácticas

Encuesta de robots de manipulación móvil <unk> plataformas, capacidades, algoritmos y implementaciones en el mundo real que combinan la locomoción y la manipulación de brazos.

Parte de: [Guía de armas de robots]

[← Blog] T1)

El problema más difícil en la robótica también está atrayendo a algunas de las inversiones e investigaciones más activas en 2025.

¿Qué es la manipulación móvil?

La manipulación móvil se refiere a los robots que combinan la locomoción (la capacidad de moverse a través de un entorno) con la manipulación (la capacidad de agarrar, moverse e interactuar con objetos). Esta combinación es lo que le da a un robot utilidad similar a la de un ser humano la capacidad de navegar hacia donde está el trabajo, no solo trabajar en objetos llevados a un lugar fijo.

La combinación también es lo que lo hace difícil. Un brazo de base fija opera en un espacio de trabajo conocido y calibrado. Un manipulador móvil debe agarrar desde una posición de base imprecisa, en una plataforma potencialmente en movimiento, en un entorno que puede diferir de cualquier configuración de entrenamiento. Agarrar desde una base no fija aumenta el error de agarramiento efectivo en 3-5 veces en comparación con la manipulación de base fija.

Taxonomía de la arquitectura: Desacoplado vs. de extremo a extremo

La elección arquitectónica fundamental en la manipulación móvil es tratar la navegación y la manipulación como subsistemas separados o como una política unificada de extremo a extremo.

** Desacoplado (navegación y manipulación):** El enfoque clásico. Un planificador de navegación desplaza la base a una posición precomputada dentro del espacio de trabajo del brazo, luego se hace cargo de una política de manipulación. Este es el enfoque dominante en las implementaciones industriales porque es modular, descomponible y cada componente puede validarse de forma independiente. La limitación: la posición base se calcula sin considerar la tarea de manipulación, lo que puede resultar en configuraciones de enfoque subóptima.

End-to-end (política unificada): Una única red neuronal toma entradas de sensores (cameras, lidar, propriocepción) y saque velocidades de base y comandos conjuntos de brazos. Mobile ALOHA (Zipeng Fu et al., Stanford, 2024) demostró que una política de ACT puede aprender la manipulación móvil bimanual de todo el cuerpo de 50 demostraciones de teleoperación. Los enfoques de extremo a extremo producen movimientos más suaves y coordinados, pero son más difíciles de deshacer, requieren más demostraciones y ofrecen menos garantías de seguridad.

Hierárquico (planificación a nivel de tarea + habilidades aprendidas): Un planificador de alto nivel (potencialmente un modelo de fundación o sistema TAMP) descompone la tarea en una secuencia de habilidades ("navegación a la cocina, "frigorífico abierto, "agarra leche"), y cada habilidad se ejecuta por una política especializada. SayCan (Google, 2022) y TidyBot (Wu et al., Princeton, 2023) utilizan esta arquitectura. Combina la flexibilidad de las políticas aprendidas con la interpretabilidad de la planificación explícita.

Plataformas clave en 2025

Platform Price Type Carga Útil Arms Key Strength
Hello Robot Stretch 3 $28,000 Wheeled + telescoping arm 1.5 kg 1 (4-DOF) ROS2, elder care, affordable
Mobile ALOHA (Stanford) $32K + base Wheeled + bimanual 3 kg each 2 (6-DOF ViperX) Bimanual, open-source, ACT-ready
Spot + Arm (Boston Dynamics) $100,000+ Legged + arm 4 kg 1 (6-DOF) Rough terrain, enterprise support
Unitree G1 $16,000 Humanoid (bipedal) 3 kg each 2 (7-DOF) Lowest cost humanoid, growing ecosystem
Unitree H1 $90,000 Humanoid (bipedal) 5 kg each 2 (7-DOF) Strongest humanoid arms, whole-body control
Fetch Robotics (OTTO) $150,000+ Wheeled + arm 6 kg 1 (7-DOF) Warehouse logistics, enterprise AMR
TIAGo Pro (PAL Robotics) $80,000+ Wheeled + arm 3 kg 1-2 (7-DOF) ROS2 native, RoboCup standard

Documentos y sistemas clave

El uso de la tecnología de la información en el mercado

Mobile ALOHA demostró que el aprendizaje de imitación de extremo a extremo puede producir una manipulación móvil de todo el cuerpo sorprendentemente capaz. El sistema utiliza dos brazos ViperX 300 en una base de ruedas, con un teleoperador humano que camina detrás del robot y controla el movimiento de ambos brazos más la base simultáneamente. La política de ACT (Acción de Chunking con Transformers) entrenada en sólo 50 demostraciones de teleoperación aprendió a cocinar camarones, abrir gabinetes, limpiar los mostradores de la cocina y sillas de empuje tareas que requieren movimiento coordinado de la base del brazo.

La información clave: la capacitación conjunta con conjuntos de datos ALOHA estáticos (desde la base fija ALOHA) mejoró el éxito de la manipulación móvil en un 30-50% a pesar de que los datos estáticos no contienen ningún movimiento de base. La transferencia compartida de habilidades de manipulación y la política aprende a componerlas con movimiento de base solo desde las demostraciones móviles. Esto reduce significativamente la carga real de recopilación de datos.

TidyBot (Princeton, 2023)

TidyBot abordó el problema de limpieza de largo horizonte: dado un cuarto desordenado, recogió todos los objetos extraviados y los puso en sus ubicaciones correctas. Utiliza un LLM (GPT-4) para el razonamiento de alto nivel ("la taza va al estante", "la camisa va al armario") y una política de manipulación aprendida para la selección y colocación real. La contribución clave es demostrar que los modelos de lenguaje pueden proporcionar el razonamiento de sentido común necesario para la planificación de tareas en tareas domésticas de gama abierta, mientras que la ejecución de bajo nivel se maneja con habilidades aprendidas confiables.

SayCan (Google, 2022)

SayCan conectó modelos de lenguaje a las ofertas de robots en tierra. Dado una instrucción de lenguaje natural ("vertí mi bebida, ¿puedes ayudar?"), el LLM propone un plan como una secuencia de habilidades primitivas ("encuentra esponja", "recoge esponja", "navega para vertir", "borra la superficie"). Cada habilidad tiene una probabilidad de éxito asociada estimada a partir de la observación actual del robot. SayCan se ejecutó en un robot diario móvil con un solo brazo de 7 DOF, demostrando que la planificación de tareas basada en el LLM puede manejar la instrucción abierta después de que la manipulación móvil requiere.

Desafíos de coordinación de la navegación y la manipulación

** Coordinación de la base de brazos:** ¿Cuándo debe moverse la base y cuándo debe extenderse el brazo? Optimización de control de todo el cuerpo para plataformas humanoides (H1, G1) trata la base y el brazo como una cadena cinemática unificada. Las plataformas con ruedas suelen utilizar la planificación descoplada navegar por la base hasta dentro del alcance del brazo, luego ejecutar el movimiento del brazo que es más simple pero poco óptimo para las tareas dinámicas.

** Estabilidad dinámica durante la manipulación:** La aplicación de fuerza a través del brazo crea fuerzas de reacción en la base. Un robot de piernas que aplica una fuerza horizontal de 20N a través de su brazo durante una tarea restringida debe ajustar simultáneamente los contactos de los pies para mantener la estabilidad. Esta coordinación de la fuerza de todo el cuerpo es un problema de investigación activo. Las plataformas de ruedas tienen una ventaja aquí: las fuerzas de reacción son absorbidas por la fricción del suelo en las ruedas, lo que es mucho más fácil de modelar y controlar que la dinámica de contacto con los pies.

Estimación de la posición de la base móvil: La percepción desde una base móvil introduce la incertidumbre de localización en la estimación de la posición de la base. Un error de posición de la base de 2 cm se propaga a un error de punto de la posición que puede exceder la tolerancia de la posición para tareas de precisión. Los sistemas de manipulación móvil necesitan una localización de la base de alta precisión o políticas de la posición de la posición de la base que sean sólidas para la incertidumbre de la posición de la base.

El problema de la entrega: En arquitecturas descopladas, el sistema de navegación entrega al robot a una posición "pre-manipulación", luego se entrega al controlador de manipulación. El controlador de manipulación debe poder solicitar la reposicionamiento de la base si la posición de la corriente no es adecuada.

Estimación del estado de largo horizonte: Durante una tarea de manipulación móvil de varios minutos (por ejemplo, limpiar una habitación), la localización basada en SLAM del robot acumula deriva. Si el robot toma un objeto en el minuto 1 y necesita colocarlo en un lugar específico en el minuto 5, el error de localización puede exceder la tolerancia de colocación. El cierre de bucles, la reubicación contra puntos de referencia conocidos y las actualizaciones de odometría visual durante la manipulación son todos necesarios, pero añaden gastos generales computacionales.

Comparación de los enfoques de planificación

Approach Task Horizon Generalización Compute Data Needed Maturity
Whole-body control (WBC) Single skill Low (task-specific) High (1kHz QP) Dynamics model Production-ready for locomotion
Decoupled nav + manip Single skill Moderate Low SLAM map + manip demos Most deployed approach
End-to-end IL (ACT) Multi-step skill High (within task) Moderate (GPU) 50-500 teleop demos Research demos (Mobile ALOHA)
TAMP (Planificación de Tareas y Movimiento) Multi-room High (combinatorial) Very high Domain specification Academic demos, limited production
LLM + skill library (SayCan) Open-ended Very high (language) High (LLM inference) Skill demos + affordance model Emerging (TidyBot, SayCan)
VLA end-to-end (pi0-style) Multi-step Very high Very high (7B+ model) Large-scale diverse demos Early commercial (Physical Intelligence)

Recopilación de datos para la manipulación móvil

La recogida de demostraciones de teleoperación para la manipulación móvil es más difícil que la manipulación de base fija, ya que el operador debe controlar el movimiento de la base y el movimiento del brazo simultáneamente.

  • Teléoperación de marcha atrás (estilo ALOHA móvil): El operador camina detrás del robot, controlando los movimientos del brazo a través de los brazos del líder mientras la base sigue el movimiento de marcha del operador. Lo mejor para tareas en las que la trayectoria de base es importante (por ejemplo, navegar alrededor de los muebles mientras lleva un objeto).
  • Teleoperación VR: El operador utiliza un auricular VR para ver desde la perspectiva del robot y controla la base + brazos a través de controladores y joystick.
  • ** Colección basada en puntos de camino:** Separar la trayectoria de la base de la demostración de manipulación. Primero, conducir manualmente el robot a una posición de pre-manipulación (o utilizar una pila de navegación autónoma). Luego recoger la demostración de manipulación desde la posición de base fija. Ideal para tareas en las que la navegación y la manipulación no se superponen temporalmente.

La infraestructura de recopilación de datos de RCSV admite los tres enfoques. Nuestra instalación de San Francisco tiene más de 800 pies cuadrados de espacio configurable para la recopilación de datos de manipulación móvil, con localización de grado de captura de movimiento para el seguimiento de la base de verdad en tierra. La instalación de Allston admite escenarios de corredor y varias habitaciones.

Ejemplos reales de implementación

  • ** Diligent Robotics Moxi:** Manipulador móvil de ruedas desplegado en las salas de hospitales para la entrega de suministros y el transporte de ropa de cama. Despliegue comercial en más de 20 hospitales de los Estados Unidos a partir de 2025. Utiliza navegación descopilada + manipulación con entornos estructurados (planes de salas conocidos, ubicaciones de almacenamiento etiquetadas).
  • 6 River Systems (Shopify): Sistema de recogida de almacenes basado en AMR que ayuda a los trabajadores humanos. Maneja la recogida estructurada de contenedores, no la manipulación móvil completa. Demuestra que la manipulación móvil limitada (objetos conocidos, ubicaciones conocidas) es comercialmente viable hoy en día.
  • Hello Robot Stretch ensayos clínicos: Universidad de Washington y Georgia Tech ensayos de Stretch para tareas de asistencia a ancianos en el hogar (recoger objetos, abrir puertas). Los resultados publicados muestran un éxito del 65-80% en tareas de la vida diaria.
  • Google DeepMind RT-2 en Robots de Todos los días: El modelo RT-2 VLA fue desplegado en una flota de manipuladores móviles en edificios de oficinas de Google, realizando tareas de limpieza de cocina y de limpieza de escritorio. La columna vertebral de VLA habilitó la instrucción siguiente ("recoger la manzana cerca del monitor y ponerla en la contención de compost") con generalización de tiro cero a nuevos objetos, aunque la precisión de manipulación se limitó a tareas con tolerancia de 5 mm +.

La brecha de datos de manipulación móvil

El mayor cuello de botella para la investigación de la manipulación móvil es la escasez de datos. Los conjuntos de datos de manipulación de base fija (Open X-Embodiment, DROID, BridgeData V2) contienen millones de episodios, pero los conjuntos de datos de manipulación móvil son 10-100 veces más pequeños porque la recopilación es más difícil y lenta. Esta brecha de datos significa que las políticas de manipulación móvil están poco capacitadas en relación con las políticas de base fija, especialmente para tareas de largo horizonte.

Para cerrar esta brecha se requiere una infraestructura de recopilación de datos especialmente diseñada espacios lo suficientemente grandes para la navegación, hardware que captura la odometría de base junto con el estado del brazo y operadores capacitados en teleoperatoria de todo el cuerpo. Los servicios de recopilación de datos de RCSV (RCSV) abordan esta brecha directamente, con protocolos y salidas estandarizados de recopilación de manipulación móvil en formato HDF5/RLDS compatibles con las líneas de regulación de ACT, Política de difusión y VLA. Los proyectos piloto comienzan en $2,500; campañas completas de manipulación móvil en $8,000+.

Lectura relacionada

  • [Guía de robots de ALOHA]
  • [Revisar Unitree G1]
  • [Robots humanoides de código abierto 2025]
  • [Modelos de VLA explicados]
  • [Encuesta de planificación de la empresa]
  • [Por qué Teleop Data Beats Sim]
  • [Servicios de datos]
  • [Robot Leasing]
  • [Glosario]

Soluciones para la manipulación móvil

RCSV proporciona consultoría de hardware, recopilación de datos e integración de sistemas para implementaciones de manipulación móvil.

[Explorar soluciones]