Volver a Research

Problemas abiertos en el aprendizaje de robots: 10 Direcciones de investigación para 2025-2028

Los problemas abiertos más importantes en el aprendizaje de la manipulación de robots <unk> desde la eficiencia de la muestra hasta la planificación a largo horizonte <unk> y cómo se ve el progreso.

[← Investigación]

El aprendizaje robótico ha logrado un progreso extraordinario desde 2022. Estos son los problemas que aún deben resolverse antes de que los robots trabajen de manera fiable en entornos no estructurados.

El estado del campo en 2025

El aprendizaje de robots formación de políticas neuronales a partir de datos de demostración o interacción con el medio ambiente ha avanzado más en los últimos tres años que en la década anterior.

Pero "posible en un laboratorio" y "confiable en el despliegue" siguen siendo separados por una larga lista de problemas abiertos. Los siguientes diez problemas representan las direcciones de investigación de mayor prioridad para el campo de 2025 a 2028, basadas en la experiencia de despliegue, la síntesis de literatura y las conversaciones con los profesionales.

1. Eficiencia en la recopilación de datos

El cuello de botella: Los datos de demostración de robots del mundo real son caros para recopilar 4 30 dólares por episodio dependiendo de la complejidad de la tarea. El entrenamiento de políticas generalistas de última generación requiere decenas de miles de episodios. Las matemáticas no funcionan a los costos actuales de recopilación para la mayoría de las organizaciones.

Instrucciones de investigación: Aprendizaje activo (recolectar sólo las demostraciones más informativas, no las aleatorias); simulación pre-entrenamiento con la aleatorización de dominios para reducir los requisitos de datos reales; transferencia transversal (entrenar datos del robot A, desplegar en el robot B con un ajuste mínimo); y enfoques semiavigilados que extraen la señal de los videos de robots sin etiquetar.

Sínal de progreso: Una reducción de 10 veces en las demostraciones necesarias para alcanzar una tasa de éxito dada en una tarea de referencia estandarizada, en comparación con las líneas de base de clonación de comportamiento de vainilla.

2. Finalización de las tareas de largo plazo

Estado actual: Las políticas de robots de última generación manejan confiablemente las tareas de 1020 pasos en configuraciones controladas. La manipulación en el mundo real a menudo requiere secuencias de 50200 pasos. Compuestos de error: una tasa de éxito de 95% por paso da sólo 8% de éxito de tarea en 50 pasos.

Direcciones de investigación: Políticas jerárquicas con representaciones explícitas de subobjetivos; integración de la tarea y la planificación de movimiento (TAMP) con componentes aprendidos para las primitivas de manipulación; generación de subobjetivos de modelos de lenguaje grandes combinados con políticas aprendidas de bajo nivel; y abstracción temporal en representaciones de acción.

Signal de progreso: Complementación confiable de más de 50 tareas de manipulación a pasos en entornos no estructurados con tasas de éxito superiores al 70%.

3. Manipulación en mano dexterosa

Estado actual: La mayoría de los trabajos de aprendizaje de robots utilizan agarradores paralelas para realizar agarradas de potencia.

Instrucciones de investigación: Arrays de detección táctil de alta resolución que proporcionan información de contacto comparable a la sensibilidad de la punta del dedo humano; teleoperación manual dexterosa con guantes de datos para la recogida de demostración (RCSV opera un [programa de recogida de datos basado en guantes](T1)); modelos de contacto aprendidos que se generalizan a través de las formas de objetos y las propiedades de superficie.

Signo de progreso: Rotación manual de objetos arbitrarios hacia una orientación especificada con tasas de éxito superiores al 80% en más de 50 nuevos tipos de objetos.

4. Generalización a objetos novedosos

Estado actual: Las políticas entrenadas en un conjunto de objetos suelen lograr un éxito del 6075% en esos objetos.

Direcciones de investigación: Características visuales del modelo de la fundación (CLIP, DINOv2) como codificadores congelados que proporcionan generalización semántica; datos de formación diversos que cubren más de 100 categorías de objetos en lugar de 510; estimación de la posición a nivel de categoría como representación intermedia; y adaptación en el tiempo de prueba utilizando un pequeño número de demostraciones de objetos nuevos.

Sínal de progreso: Caso de éxito de objeto nuevo dentro del 15% del índice de éxito de objeto entrenado en un conjunto de evaluación estandarizada de 50 categorías de objetos retenidos.

5. Comprensión del mundo físico

Estado actual: Las políticas actuales de robots son excelentes para combinar patrones pero carecen de comprensión de las propiedades físicas de los objetos. Un robot entrenado en objetos rígidos no puede adaptar su fuerza de agarre para objetos frágiles. Las políticas no tienen representación de masa, deformabilidad o fragilidad.

Direcciones de investigación: Modelos de física implícita aprendidos a partir de datos de interacción; modelos del mundo táctil que predicen los resultados de contacto a partir de observaciones táctiles; representaciones de propiedades condicionadas por el lenguaje ("maneja esto con cuidado es frágil") integradas en el condicionamiento de la política; y arquitecturas informadas por la física que incorporan restricciones físicas en la estructura de la política.

Signal de progreso: Manipulación exitosa de objetos deformables (telas, espuma, alimentos blandos) con tasas de éxito superiores al 70% sin formación específica de tarea.

6. Colaboración humano-robótico

Estado actual: Las políticas de robots están diseñadas para entornos estáticos. Cuando los humanos están presentes, los movimientos impredecibles invalidan las suposiciones de la política, causando fallas o comportamiento inseguro.

Direcciones de investigación: Previsión de la intención humana en tiempo real a partir de la postura y la mirada; control seguro y conforme que adapta el movimiento del robot en respuesta a la proximidad humana inesperada; políticas de manipulación colaborativa entrenadas en datos de interacción humano-robot; y protocolos de entrega explícitos con tiempo aprendido.

Sínal de progreso: Completar con éxito las tareas de colaboración (manos humanos objetan al robot, el robot continúa la tarea) con modos de fracaso graciosos cuando el comportamiento humano se desvía de la expectativa.

7. Sim-to-Real robusto para tareas de contacto

Estado actual: La transferencia de Sim a realidad funciona bien para el movimiento en el espacio libre (alcanzamiento, enfoque pre-grap). Las tareas de contacto (inserción, montaje, seguimiento de superficie) transferen mal debido a la brecha de sim a realidad en la dinámica de contacto el contacto simulado es fundamentalmente diferente del contacto real.

Instrucciones de investigación: Simulación diferenciable con modelos de contacto aprendidos que se calibran a datos reales de robots; parámetros de contacto aleatorios durante el entrenamiento para crear políticas sólidas; modelos de dinámica residual aprendidos que corregen errores de simulación; y modelos de base ricos en contactos entrenados principalmente en datos reales con simulación para aumento solo.

Signal de progreso: Insertado en agujero de pegamento (0,5 mm de distancia) totalmente entrenado en simulación logrando un éxito de más del 80% en hardware real sin ningún ajuste fino de datos reales.

8. Aprendizaje permanente sin olvidarse

Estado actual: Las políticas de robots implementadas son estáticas no mejoran en relación con la experiencia operativa.Cuando se añaden nuevas tareas o se actualizan las existentes, el enfoque estándar es una reentrenamiento completo desde cero, lo que es costoso y lento.

Instrucciones de investigación: Métodos de aprendizaje continuo que añaden nuevas capacidades de tarea sin sobrescribir las existentes; LoRA y otros métodos de ajuste fino eficientes en parámetros que amplian modularmente las políticas; repetición de experiencias con un amortiguador de memoria seleccionado para evitar el olvido catastrófico; y arquitecturas de políticas modulares donde los módulos específicos de tarea pueden intercambiarse de forma independiente.

Signal de progreso: Una política de robot que aprende 10 nuevas tareas secuencialmente manteniendo un 90% o más del rendimiento original en todas las tareas anteriores, sin una reeducación completa.

9. Aprendizaje eficaz de refuerzo en el mundo real

Estado actual: El aprendizaje de refuerzo en robots reales es demasiado lento y inseguro para la mayoría de las aplicaciones Aprender desde cero requiere miles de interacciones ambientales, muchas de las cuales implican fallos que dañan los equipos o crean riesgos de seguridad.

Direcciones de investigación: RL basado en modelos que aprende un modelo mundial a partir de un pequeño número de interacciones y planes reales dentro de él; métodos de exploración seguros que restringen el espacio de comportamiento del agente durante el aprendizaje; combinando la inicialización de aprendizaje imitativo con el ajuste fino de RL para la brecha de rendimiento final; y métodos de RL fuera de línea que mejoran las políticas de los datos operativos registrados sin ninguna interacción en línea.

Signal de progreso: Alcanzar una tasa de éxito de 85%+ en una tarea de manipulación rica en contactos utilizando solo 2 horas de interacción real de robots (sin simulación), con cero violaciones de seguridad durante el aprendizaje.

10. Normalización de la evaluación

Estado actual: Los trabajos de aprendizaje de robots informan resultados sobre benchmarks incompatibles con diferentes robots, tareas, métricas de éxito y protocolos de evaluación. No hay un benchmark acordado análogo a ImageNet para la visión o MMLU para el lenguaje.

Direcciones de investigación: Convergencia comunitaria en un pequeño conjunto de conjuntos de benchmarks estándar LIBERO, SimplerEnv y RoboFlamingo Benchmark son los candidatos principales; protocolos de evaluación estandarizados (número de ensayos, condiciones de evaluación, definición de éxito); servicios de evaluación de hardware en el ciclo que permiten la verificación de terceros de los resultados reclamados; y una infraestructura de clasificación análoga a Papers With Code.

Signal de progreso: Tres o más centros de aprendizaje de robots importantes (CoRL, ICRA, RSS) que requieren resultados sobre un subconjunto común de referencia para la aceptación de papel.

Cómo contribuye el RCSV a estas direcciones

Los programas de investigación e infraestructura del RCSV abordan directamente los problemas 1 (eficiencia de recopilación de datos), 3 (datos de manipulación dexterosa a través de la recopilación de guantes), 8 (aprendizaje permanente a través de la rueda de control de datos continua) y 10 (evaluación a través de nuestra suite de tareas estandarizada).

Para los investigadores que trabajan en estos problemas abiertos, RCSV proporciona [servicios de recopilación de datos]T2) que producen conjuntos de datos de demostración de calidad de referencia, programas de acceso de robots para la evaluación de hardware en el circuito y contribuciones de conjuntos de datos al formato LeRobot Hub y Open X-Embodiment. Visite nuestra página [programas de investigación]T3) para consultas de colaboración y acceso a conjuntos de datos.

Colaborar en la investigación de aprendizaje robot

El RCSV apoya programas de investigación académica e industrial con recopilación de datos, acceso de robots e infraestructura.

[Vea programas de investigación]