Volver a Research

Aprendizaje de robots multitarea: compartir datos entre tareas para mejorar las políticas

Encuesta de aprendizaje de robots multitarea <unk> Co-entrenamiento en múltiples tareas, condicionamiento de tareas y cuando compartir tareas ayuda frente a perjudicar el rendimiento de las políticas.

[← Investigación]

La capacitación conjunta en múltiples tareas es una de las formas más confiables de mejorar el rendimiento de las políticas de manipulación.

Por qué aprender con múltiples tareas

Las políticas de robots de tarea única tienen una limitación fundamental: entrenan solo en datos de una tarea, desperdiciando el potencial de comprensión visual compartida en todas las tareas relacionadas.

El aprendizaje multitarea aborda esto mediante la formación conjunta en demostraciones de múltiples tareas relacionadas simultáneamente.

  • ** Características visuales compartidas** tareas compartidas en un espacio de trabajo comparten la semántica visual. Una representación entrenada en "copa de selección", "botella de selección" y "bowl de selección" aprende "objeto agarrable" como concepto.
  • Más datos por carrera de formación 10 tareas × 200 demostraciones cada una = 2.000 ejemplos de formación totales, todos contribuyendo a una representación compartida.
  • Mejor base para nuevas tareas una política de tareas múltiples se adapta a tareas realmente nuevas más rápido que una política de tareas únicas, porque la representación ya es más rica.

Los enfoques de la clasificación de tareas

Una política de multitarea debe saber qué tarea realizar.

  • Instrucción de lenguaje más flexible. La política recibe texto como "recoger la taza roja y colocarla en la basura". Utiliza un codificador de lenguaje (T5, codificador de texto CLIP) para producir una incorporación de tarea.
  • ** One-hot task ID** más simple. Política recibe un índice de tareas (tarea 0, tarea 1, ..., tarea N). No se necesita comprensión del idioma. Funciona bien cuando el conjunto de tareas es fijo y pequeño (<20 tareas). Se utiliza en muchos documentos RL fuera de línea.
  • Imagen de objetivo La política recibe una imagen del estado final deseado. No se necesita lenguaje; funciona para tareas difíciles de describir verbalmente. Limitaciones: recopilar imágenes de objetivo es labor intensiva, y la política debe inferir qué acción produce el objetivo, no solo cómo se ve el objetivo.

Beneficios de la Co-entrenamiento: evidencia de la obra publicada

La evidencia empírica para la co-entrenamiento multi-tareas es fuerte:

  • Open X-Embodiment la capacitación en el conjunto de datos completo y diverso (22 realizaciones, 527 tareas) supera consistentemente la capacitación en un solo conjunto de datos, incluso para tareas donde el conjunto de datos de una sola tarea es grande.
  • Tascas bimanual de ALOHA Co-entrenamiento de 25 tareas bimanual (doblaje, empaquetado, montaje) mostró que un codificador compartido mejora el rendimiento en todas las tareas en comparación con modelos por tarea separados. La mejora es mayor para tareas raras con pocas demostraciones: una tarea con 20 demos se desempeña tan bien en el entrenamiento multitarefa como una tarea con 80 demos en el entrenamiento de tarea única.
  • ** Bridge V2 + otros conjuntos de datos** añadir datos de Bridge V2 a la ajuste fino de OpenVLA mejora consistentemente la generalización de nuevos objetos en 1020 puntos porcentuales frente a ajustes finos en solo el conjunto de datos objetivo. Incluso cuando las tareas de Bridge V2 difieren de la tarea objetivo.

Traslado negativo: cuando las tareas compartidas hacen daño

No todas las combinaciones de tareas se benefician del intercambio. ** Transferencia negativa** ocurre cuando la formación en múltiples tareas juntas produce una política peor que cualquier política individual de tarea única.

  • ** Distribuciones de acción conflictivas** "tabla de borrado" (movimientos de barrido anchos) y "objeto de selección" (posicionamiento preciso) tienen distribuciones de acción fundamentalmente diferentes.
  • Representaciones visuales conflictivas tareas que requieren atención a la textura de granos finos (costera, electrónica) se enfrentan a tareas que requieren una comprensión global de la escena (navegación, recogida de contenedores).
  • ** Diferentes configuraciones de hardware** Co-entrenamiento de datos de un agarre paralelo de mandíbula con datos de una mano con varios dedos produce secuencias de acción confusas.
  • Regla de oro: si dos tareas comparten el mismo factor final y operan sobre objetos en el mismo espacio de trabajo, casi siempre se benefician de la co-entrenamiento.

Opciones de arquitectura

  • ** Codificador compartido único + cabezas específicas de tarea** más común. Codificador compartido ResNet o ViT extrae características visuales; cabezas MLP por tarea predicen acciones. Buenas cuando las tareas comparten contexto visual pero difieren en la distribución de la acción.
  • Mixura de expertos N redes de expertos, cada una especializada en un subconjunto de tareas. Una red de gating rutas de entrada al experto apropiado. Reduce la transferencia negativa para tareas contradictorias.
  • ** Hiperreds/generación de peso condicionada a tareas** Meta-aprendizaje enfoque donde una hiperred genera pesas de política específicas de tareas dada una tarea de incorporación.
  • Para la mayoría de los trabajos prácticos de manipulación de múltiples tareas, un codificador ViT compartido con el acondicionamiento de tareas de lenguaje y una cabeza de acción de difusión (como en Octo) es la mejor práctica actual.

Estrategias de mezcla de datos

  • Muestreo proporcional a las tareas muestra cada tarea en proporción al tamaño de su conjunto de datos. Los conjuntos de datos más grandes dominan la formación. Riesgo: tareas raras con pocas demostraciones están subrepresentadas y pueden no mejorar.
  • Tascas raras sobreestimadas Muestreo uniforme de tareas (igual probabilidad por tarea independientemente del tamaño) sobrepeso de tareas raras, evitando que se ahoguen.
  • Mixing Curriculum Comienza con tareas más simples, introduce gradualmente más difíciles. Refleja el aprendizaje humano: las habilidades básicas antes que las habilidades complejas.
  • Muestreo ponderado por dificultad Muestreo de tareas en proporción inversa al desempeño actual de las políticas. Las tareas con bajo desempeño obtienen más datos.

Evaluación de las políticas de múltiples tareas

La generalización de tareas realizadas es el estándar de oro: entrenar en N tareas, evaluar en M tareas no vistas durante la formación.

Resultados publicados sobre la generalización de tareas realizadas: las políticas entrenadas con el condicionamiento del lenguaje en más de 25 tareas generalmente logran un 40 70% de éxito en tareas verdaderamente nuevas con condiciones similares.

Guía práctica

  • Siempre co-entrenar si tiene más de 3 tareas relacionadas y el mismo hardware/efector final.
  • Utilice el condicionamiento del lenguaje incluso si nunca tiene la intención de usar el lenguaje en la implementación obliga a una mejor representación de tareas y simplifica la recopilación de datos (simplemente describa cada tarea verbalmente).
  • Si el rendimiento por tarea es mucho mayor que la generalización entre tareas, se memorizan en lugar de aprender.
  • Los modelos separados solo se justifican cuando las tareas requieren hardware, sensores o modalidades de acción realmente diferentes.

Explore las herramientas de recopilación de datos multitarea en la página [servicios de datos del RCSV]T1, o acceda a conjuntos de datos multitarea pre-recogidos a través de la [plataforma de investigación]T2).

Construir políticas de tareas múltiples con datos de RCSV

Accede a conjuntos de datos de manipulación diversos en más de 30 tareas, puntos de referencia de evaluación estandarizados e infraestructura de capacitación de GPU para el aprendizaje de robots multitarea.

[Explorar los Servicios de Datos]