Volver a Datasets

Datos de los robots multimodal

Una guía para conjuntos de datos de robots multimodal con RGB, profundidad, fuerza, táctil, propriocepción y anotaciones de lenguaje para IA encarnada.

Los conjuntos de datos multimodal conectan la visión, la acción, la propriocepción y el tacto para que los equipos puedan razonar sobre la información que su política realmente necesitará.

Las señales para comparar

  • RGB y profundidadSeguirán siendo el punto de partida para las tareas de manipulación dirigidas por la percepción.
  • Forza y táctilImportante para las transiciones ricas en contacto y la estabilidad de la agarre.
  • Lenguaje y metadatosUtilizantes para la recuperación, las partidas de evaluación y la colocación en tierra de las instrucciones.

Enlaces útiles

  • [Abrir el cuerpo X]
  • ¿Qué es eso?
  • [Modelos VLA para la robótica]

Un ejemplo práctico

Esta página ayuda a los equipos a decidir si necesitan más modalidades, una mejor alineación de los tiempos o metadatos más claros antes de la reentrenamiento.