Manipulación móvil en 2025: estado de la técnica y implementaciones prácticas
Encuesta de robots de manipulación móvil <unk> plataformas, capacidades, algoritmos y implementaciones en el mundo real que combinan la locomoción y la manipulación de brazos.
Parte de: [Guía de armas de robots]
[← Blog]
El problema más difícil en la robótica también está atrayendo a algunas de las inversiones e investigaciones más activas en 2025.
¿Qué es la manipulación móvil?
La manipulación móvil se refiere a los robots que combinan la locomoción (la capacidad de moverse a través de un entorno) con la manipulación (la capacidad de agarrar, moverse e interactuar con objetos). Esta combinación es lo que le da a un robot utilidad similar a la de un ser humano la capacidad de navegar hacia donde está el trabajo, no solo trabajar en objetos llevados a un lugar fijo.
La combinación también es lo que lo hace difícil. Un brazo de base fija opera en un espacio de trabajo conocido y calibrado. Un manipulador móvil debe agarrar desde una posición de base imprecisa, en una plataforma potencialmente en movimiento, en un entorno que puede diferir de cualquier configuración de entrenamiento. Agarrar desde una base no fija aumenta el error de agarramiento efectivo en 3-5 veces en comparación con la manipulación de base fija.
Taxonomía de la arquitectura: Desacoplado vs. de extremo a extremo
La elección arquitectónica fundamental en la manipulación móvil es tratar la navegación y la manipulación como subsistemas separados o como una política unificada de extremo a extremo.
** Desacoplado (navegación y manipulación):** El enfoque clásico. Un planificador de navegación desplaza la base a una posición precomputada dentro del espacio de trabajo del brazo, luego se hace cargo de una política de manipulación. Este es el enfoque dominante en las implementaciones industriales porque es modular, descomponible y cada componente puede validarse de forma independiente. La limitación: la posición base se calcula sin considerar la tarea de manipulación, lo que puede resultar en configuraciones de enfoque subóptima.
End-to-end (política unificada): Una única red neuronal toma entradas de sensores (cameras, lidar, propriocepción) y saque velocidades de base y comandos conjuntos de brazos. Mobile ALOHA (Zipeng Fu et al., Stanford, 2024) demostró que una política de ACT puede aprender la manipulación móvil bimanual de todo el cuerpo de 50 demostraciones de teleoperación. Los enfoques de extremo a extremo producen movimientos más suaves y coordinados, pero son más difíciles de deshacer, requieren más demostraciones y ofrecen menos garantías de seguridad.
Hierárquico (planificación a nivel de tarea + habilidades aprendidas): Un planificador de alto nivel (potencialmente un modelo de fundación o sistema TAMP) descompone la tarea en una secuencia de habilidades ("navegación a la cocina, "frigorífico abierto, "agarra leche"), y cada habilidad se ejecuta por una política especializada. SayCan (Google, 2022) y TidyBot (Wu et al., Princeton, 2023) utilizan esta arquitectura. Combina la flexibilidad de las políticas aprendidas con la interpretabilidad de la planificación explícita.
Plataformas clave en 2025
| Platform | Price | Type | Carga Útil | Arms | Key Strength |
|---|---|---|---|---|---|
| Hello Robot Stretch 3 | $28,000 | Wheeled + telescoping arm | 1.5 kg | 1 (4-DOF) | ROS2, elder care, affordable |
| Mobile ALOHA (Stanford) | $32K + base | Wheeled + bimanual | 3 kg each | 2 (6-DOF ViperX) | Bimanual, open-source, ACT-ready |
| Spot + Arm (Boston Dynamics) | $100,000+ | Legged + arm | 4 kg | 1 (6-DOF) | Rough terrain, enterprise support |
| Unitree G1 | $16,000 | Humanoid (bipedal) | 3 kg each | 2 (7-DOF) | Lowest cost humanoid, growing ecosystem |
| Unitree H1 | $90,000 | Humanoid (bipedal) | 5 kg each | 2 (7-DOF) | Strongest humanoid arms, whole-body control |
| Fetch Robotics (OTTO) | $150,000+ | Wheeled + arm | 6 kg | 1 (7-DOF) | Warehouse logistics, enterprise AMR |
| TIAGo Pro (PAL Robotics) | $80,000+ | Wheeled + arm | 3 kg | 1-2 (7-DOF) | ROS2 native, RoboCup standard |
Documentos y sistemas clave
El uso de la tecnología de la información en el mercado
Mobile ALOHA demostró que el aprendizaje de imitación de extremo a extremo puede producir una manipulación móvil de todo el cuerpo sorprendentemente capaz. El sistema utiliza dos brazos ViperX 300 en una base de ruedas, con un teleoperador humano que camina detrás del robot y controla el movimiento de ambos brazos más la base simultáneamente. La política de ACT (Acción de Chunking con Transformers) entrenada en sólo 50 demostraciones de teleoperación aprendió a cocinar camarones, abrir gabinetes, limpiar los mostradores de la cocina y sillas de empuje tareas que requieren movimiento coordinado de la base del brazo.
La información clave: la capacitación conjunta con conjuntos de datos ALOHA estáticos (desde la base fija ALOHA) mejoró el éxito de la manipulación móvil en un 30-50% a pesar de que los datos estáticos no contienen ningún movimiento de base. La transferencia compartida de habilidades de manipulación y la política aprende a componerlas con movimiento de base solo desde las demostraciones móviles. Esto reduce significativamente la carga real de recopilación de datos.
TidyBot (Princeton, 2023)
TidyBot abordó el problema de limpieza de largo horizonte: dado un cuarto desordenado, recogió todos los objetos extraviados y los puso en sus ubicaciones correctas. Utiliza un LLM (GPT-4) para el razonamiento de alto nivel ("la taza va al estante", "la camisa va al armario") y una política de manipulación aprendida para la selección y colocación real. La contribución clave es demostrar que los modelos de lenguaje pueden proporcionar el razonamiento de sentido común necesario para la planificación de tareas en tareas domésticas de gama abierta, mientras que la ejecución de bajo nivel se maneja con habilidades aprendidas confiables.
SayCan (Google, 2022)
SayCan conectó modelos de lenguaje a las ofertas de robots en tierra. Dado una instrucción de lenguaje natural ("vertí mi bebida, ¿puedes ayudar?"), el LLM propone un plan como una secuencia de habilidades primitivas ("encuentra esponja", "recoge esponja", "navega para vertir", "borra la superficie"). Cada habilidad tiene una probabilidad de éxito asociada estimada a partir de la observación actual del robot. SayCan se ejecutó en un robot diario móvil con un solo brazo de 7 DOF, demostrando que la planificación de tareas basada en el LLM puede manejar la instrucción abierta después de que la manipulación móvil requiere.
Desafíos de coordinación de la navegación y la manipulación
** Coordinación de la base de brazos:** ¿Cuándo debe moverse la base y cuándo debe extenderse el brazo? Optimización de control de todo el cuerpo para plataformas humanoides (H1, G1) trata la base y el brazo como una cadena cinemática unificada. Las plataformas con ruedas suelen utilizar la planificación descoplada
** Estabilidad dinámica durante la manipulación:** La aplicación de fuerza a través del brazo crea fuerzas de reacción en la base. Un robot de piernas que aplica una fuerza horizontal de 20N a través de su brazo durante una tarea restringida debe ajustar simultáneamente los contactos de los pies para mantener la estabilidad. Esta coordinación de la fuerza de todo el cuerpo es un problema de investigación activo. Las plataformas de ruedas tienen una ventaja aquí: las fuerzas de reacción son absorbidas por la fricción del suelo en las ruedas, lo que es mucho más fácil de modelar y controlar que la dinámica de contacto con los pies.
Estimación de la posición de la base móvil: La percepción desde una base móvil introduce la incertidumbre de localización en la estimación de la posición de la base. Un error de posición de la base de 2 cm se propaga a un error de punto de la posición que puede exceder la tolerancia de la posición para tareas de precisión. Los sistemas de manipulación móvil necesitan una localización de la base de alta precisión o políticas de la posición de la posición de la base que sean sólidas para la incertidumbre de la posición de la base.
El problema de la entrega: En arquitecturas descopladas, el sistema de navegación entrega al robot a una posición "pre-manipulación", luego se entrega al controlador de manipulación. El controlador de manipulación debe poder solicitar la reposicionamiento de la base si la posición de la corriente no es adecuada.
Estimación del estado de largo horizonte: Durante una tarea de manipulación móvil de varios minutos (por ejemplo, limpiar una habitación), la localización basada en SLAM del robot acumula deriva. Si el robot toma un objeto en el minuto 1 y necesita colocarlo en un lugar específico en el minuto 5, el error de localización puede exceder la tolerancia de colocación. El cierre de bucles, la reubicación contra puntos de referencia conocidos y las actualizaciones de odometría visual durante la manipulación son todos necesarios, pero añaden gastos generales computacionales.
Comparación de los enfoques de planificación
| Approach | Task Horizon | Generalización | Compute | Data Needed | Maturity |
|---|---|---|---|---|---|
| Whole-body control (WBC) | Single skill | Low (task-specific) | High (1kHz QP) | Dynamics model | Production-ready for locomotion |
| Decoupled nav + manip | Single skill | Moderate | Low | SLAM map + manip demos | Most deployed approach |
| End-to-end IL (ACT) | Multi-step skill | High (within task) | Moderate (GPU) | 50-500 teleop demos | Research demos (Mobile ALOHA) |
| TAMP (Planificación de Tareas y Movimiento) | Multi-room | High (combinatorial) | Very high | Domain specification | Academic demos, limited production |
| LLM + skill library (SayCan) | Open-ended | Very high (language) | High (LLM inference) | Skill demos + affordance model | Emerging (TidyBot, SayCan) |
| VLA end-to-end (pi0-style) | Multi-step | Very high | Very high (7B+ model) | Large-scale diverse demos | Early commercial (Physical Intelligence) |
Recopilación de datos para la manipulación móvil
La recogida de demostraciones de teleoperación para la manipulación móvil es más difícil que la manipulación de base fija, ya que el operador debe controlar el movimiento de la base y el movimiento del brazo simultáneamente.
- Teléoperación de marcha atrás (estilo ALOHA móvil): El operador camina detrás del robot, controlando los movimientos del brazo a través de los brazos del líder mientras la base sigue el movimiento de marcha del operador. Lo mejor para tareas en las que la trayectoria de base es importante (por ejemplo, navegar alrededor de los muebles mientras lleva un objeto).
- Teleoperación VR: El operador utiliza un auricular VR para ver desde la perspectiva del robot y controla la base + brazos a través de controladores y joystick.
- ** Colección basada en puntos de camino:** Separar la trayectoria de la base de la demostración de manipulación. Primero, conducir manualmente el robot a una posición de pre-manipulación (o utilizar una pila de navegación autónoma). Luego recoger la demostración de manipulación desde la posición de base fija. Ideal para tareas en las que la navegación y la manipulación no se superponen temporalmente.
La infraestructura de recopilación de datos de RCSV admite los tres enfoques. Nuestra instalación de San Francisco tiene más de 800 pies cuadrados de espacio configurable para la recopilación de datos de manipulación móvil, con localización de grado de captura de movimiento para el seguimiento de la base de verdad en tierra. La instalación de Allston admite escenarios de corredor y varias habitaciones.
Ejemplos reales de implementación
- ** Diligent Robotics Moxi:** Manipulador móvil de ruedas desplegado en las salas de hospitales para la entrega de suministros y el transporte de ropa de cama. Despliegue comercial en más de 20 hospitales de los Estados Unidos a partir de 2025. Utiliza navegación descopilada + manipulación con entornos estructurados (planes de salas conocidos, ubicaciones de almacenamiento etiquetadas).
- 6 River Systems (Shopify): Sistema de recogida de almacenes basado en AMR que ayuda a los trabajadores humanos. Maneja la recogida estructurada de contenedores, no la manipulación móvil completa. Demuestra que la manipulación móvil limitada (objetos conocidos, ubicaciones conocidas) es comercialmente viable hoy en día.
- Hello Robot Stretch ensayos clínicos: Universidad de Washington y Georgia Tech ensayos de Stretch para tareas de asistencia a ancianos en el hogar (recoger objetos, abrir puertas). Los resultados publicados muestran un éxito del 65-80% en tareas de la vida diaria.
- Google DeepMind RT-2 en Robots de Todos los días: El modelo RT-2 VLA fue desplegado en una flota de manipuladores móviles en edificios de oficinas de Google, realizando tareas de limpieza de cocina y de limpieza de escritorio. La columna vertebral de VLA habilitó la instrucción siguiente ("recoger la manzana cerca del monitor y ponerla en la contención de compost") con generalización de tiro cero a nuevos objetos, aunque la precisión de manipulación se limitó a tareas con tolerancia de 5 mm +.
La brecha de datos de manipulación móvil
El mayor cuello de botella para la investigación de la manipulación móvil es la escasez de datos. Los conjuntos de datos de manipulación de base fija (Open X-Embodiment, DROID, BridgeData V2) contienen millones de episodios, pero los conjuntos de datos de manipulación móvil son 10-100 veces más pequeños porque la recopilación es más difícil y lenta. Esta brecha de datos significa que las políticas de manipulación móvil están poco capacitadas en relación con las políticas de base fija, especialmente para tareas de largo horizonte.
Para cerrar esta brecha se requiere una infraestructura de recopilación de datos especialmente diseñada
Lectura relacionada
- [Guía de robots de ALOHA]
- [Revisar Unitree G1]
- [Robots humanoides de código abierto 2025]
- [Modelos de VLA explicados]
- [Encuesta de planificación de la empresa]
- [Por qué Teleop Data Beats Sim]
- [Servicios de datos]
- [Robot Leasing]
- [Glosario]
Soluciones para la manipulación móvil
RCSV proporciona consultoría de hardware, recopilación de datos e integración de sistemas para implementaciones de manipulación móvil.
[Explorar soluciones]







