Volver a Blog

Anotado de datos de robots: Cómo etiquetar las demostraciones de robots para entrenamiento

Cómo anotar los datos de demostración de robots para la formación: señales de éxito, etiquetas de lenguaje, segmentación de tareas, estándares de calidad, herramientas y la línea de anotaciones del RCSV.

Parte de: [Guía de recogida de datos de robots]

La anotación es la parte menos glamorosa del aprendizaje de robots y la más importante. Un conjunto de datos de 500 demostraciones bien anotadas formará una mejor política que las 2.000 mal etiquetadas. Aquí está lo que significa anotación para los datos de robots y cómo hacerlo correctamente.

Qué significa la anotación para los datos de los robots

A diferencia de la clasificación de imágenes, donde la anotación significa dibujar cuadros o hacer clic en etiquetas, la anotación de demostración de robots es más rica y más estructurada. Un episodio de robot típicamente 20-200 segundos de manipulación necesita ser etiquetado en múltiples niveles: si el episodio fue un éxito o un fracaso, qué lenguaje describe la tarea, dónde comienzan y terminan las fases semánticamente distintas, y si hay marcos que deben excluirse del entrenamiento debido a errores de hardware o errores del operador.

La anotación se realiza típicamente por revisores humanos que ven reproducciones de video de episodios grabados junto con gráficos de estados conjuntos y apertura del agarre.

Tipos de anotación: una taxonomía completa

Los datos de demostración de robots admiten una variedad de tipos de anotaciones, cada uno de los cuales sirve para diferentes propósitos en el futuro.

Anotadas de nivel de episodio

Annotation Type Format Required For Cost per Episodio
Binary success/failure Boolean flag All IL training (ACT, Diffusion Policy, VLA) $0.05-0.10
Language instruction Free-text string Language-conditioned policies, VLA fine-tuning $0.10-0.25
Task category ID Integer enum Multi-task policies, dataset organization $0.02-0.05
Demostración quality score 1-5 integer scale Quality-weighted training, dataset curation $0.10-0.20
Object instance IDs List of string IDs Object-centric policies, diversity analysis $0.05-0.10

Anotations de nivel de marco

Annotation Type Format Required For Cost per Frame
Task phase segmentation Timestamped phase boundaries Hierarchical policies, sub-task analysis $0.50-2.00/episode
Contact event labels Timestamped contact start/end Contact-aware policies, force control $0.30-0.80/episode
Object bounding boxes 2D bbox per frame per object Object detection, visual grounding $0.05-0.15/frame
Segmentation masks Per-pixel object mask Semantic segmentation, sim-to-real $0.50-2.50/frame
Keypoint annotations 2D pixel coordinates per keypoint Keypoint-based policies, pose estimation $0.10-0.30/frame
Frame exclusion flags Boolean per frame Removing hardware glitches, operator errors $0.01-0.03/frame

La mayoría de los proyectos de aprendizaje de imitación solo necesitan las dos primeras anotaciones de nivel de episodio (banderada de éxito + instrucción de idioma) y opcionalmente la segmentación de fase de tarea.

Banderas del éxito: la nota más importante

Cada episodio de un conjunto de datos de entrenamiento de robots debe estar etiquetado con una bandera de éxito binaria: ¿completó el robot la tarea con éxito? Esto suena simple, pero los criterios de éxito deben definirse precisamente antes de que comience la anotación. "Poner la taza en el plato" requiere una especificación: ¿necesita la taza estar erguida, importa la orientación del mango, cuánta error de posición es aceptable? Los anotadores que aplican diferentes estándares implícitos al mismo conjunto de datos crean etiquetas ruidosas que degradan el rendimiento del entrenamiento.

Escriba un documento de especificación de éxito de una página antes de que comience la anotación, con imágenes de casos de éxito y fallos. Utilice este documento para calibrar los anotadores. Mide el acuerdo entre los anotadores en un subconjunto compartido de episodios si el acuerdo es inferior al 90%, sus criterios de éxito necesitan aclaración. La línea de anotaciones del RCSV requiere documentos explícitos de criterios de éxito y controles de acuerdo entre los anotadores antes de que cualquier conjunto de datos esté marcado para su preparación.

Clasificación automática del éxito

Para conjuntos de datos de más de 1.000 episodios, el etiquetado manual de éxito se vuelve costoso. Los clasificadores automatizados pueden manejar la mayor parte del etiquetado con revisión humana en casos inciertos.

  • Clasificadores heurísticos: Control basado en reglas utilizando el estado final del agarre, la posición del factor final y las lecturas de fuerza/torque. Ejemplo: para una tarea de pick-place, comprobar si el agarre está abierto (liberado) Y el factor final está a menos de 3 cm de la posición objetivo en el marco final. Cubre el 60-70% de los episodios con una precisión de >95%.
  • Clasificadores aprendidos: Entrenar una CNN ligera (ResNet-18) en los últimos 10 cuadros de la cámara de muñeca para predecir el éxito/fracasos. Requiere más de 200 ejemplos etiquetados manualmente por tarea para entrenar. Maneja los casos ambiguos restantes con una precisión del 85-92%.
  • Revisas humanas: Reserva para el 10-15% de los episodios en los que los clasificadores automatizados son inciertos (confianza entre 0,3 y 0,7).

Etiquetas de idiomas

Las anotaciones de lenguaje adjuntan descripciones de lenguaje natural a los episodios o segmentos de episodios. Estos son necesarios para entrenar políticas condicionadas por el lenguaje políticas que siguen instrucciones como "recoger el bloque rojo" en lugar de tener la tarea codificada en forma dura. Las anotaciones de lenguaje también permiten la compatibilidad con los modelos de visión-lenguaje-acción (VLA) y permiten buscar y filtrar conjuntos de datos por descripción de tarea.

Escriba anotaciones de lenguaje en dos niveles de especificidad: un nombre de tarea corto ("posición de la taza") y una instrucción de lenguaje natural ("recolectar la taza blanca y colocarla en la placa azul"). La instrucción debe describir lo que un observador humano ve sucediendo, no el estado interno del robot. Si su tarea implica variaciones de tareas diferentes objetos, diferentes ubicaciones de destino cada variación debe tener una instrucción correspondiente que la distingue de las demás.

Anotamiento de idiomas Las mejores prácticas para la formación en VLA

Si planeas ajustar modelos VLA como OpenVLA o RT-2, tus anotaciones de idioma necesitan más cuidado que etiquetas de tareas simples:

  • ** Diferente frase:** No copiar y pegar la misma instrucción en todos los episodios. "Coger la taza roja" y "Agarrar la taza roja y levantarla" enseñan al modelo que las diferentes frases mapean acciones similares.
  • ** Incluye expresiones referentes:** "Coge el objeto a la izquierda" en lugar de solo "coge la taza". Esto enseña el razonamiento espacial.
  • Describir toda la acción: "Recabar la taza roja de la mesa y colocarla en la placa azul" es mejor que "taza a placa".
  • Use nombres de objetos consistentes: Decida si es un "copa", "muga" o "vidrio" y manténgase dentro de un conjunto de datos.

Etiquetas de contacto para las políticas de conciencia de la fuerza

Para tareas que involucren fuerzas de contacto significativas inserción, montaje, superficie después de etiquetas de eventos de contacto marcadas por el tiempo proporcionan información crítica que las anotaciones visuales no pueden capturar. Las etiquetas de contacto marcan el marco en el que el robot hace o rompe contacto con un objeto, el tipo de contacto (toque inicial, agarre sostenido, contacto de inserción, liberación) y, opcionalmente, la magnitud de la fuerza de contacto de un sensor F/T de muñeca.

Las etiquetas de contacto pueden automatizarse parcialmente mediante el uso de datos de sensores de fuerza/torque: un detector de umbral de la señal F/T identifica el inicio del contacto (la magnitud de la fuerza supera la 0,5 N del límite de referencia) y la liberación (la fuerza cae por debajo del umbral). Se necesita una revisión humana para clasificar el tipo de contacto (agarramiento intencional frente a la colisión) y para detectar casos en los que el umbral F/T clasifica erróneamente el contacto incidental como relevante para la tarea.

Segmentación de tareas

Para las tareas de largo horizonte que involucran múltiples subtareas secuenciales, las etiquetas de segmentación marcan los límites entre las fases. Una tarea de configuración de tablas puede ser segmentada en: copa de alcance, copa de agarre, copa de transporte, copa de lugar, copa de liberación. La segmentación permite la formación jerárquica de políticas, métricas de éxito a nivel de subtareas y aumento selectivo de datos. También permite el depuración quirúrgica: si una política falla durante el transporte pero tiene éxito durante la captura, las etiquetas de segmentación le permiten medir las tasas de éxito de las subtareas y el esfuerzo de recopilación de datos objetivo donde más se necesita.

La anotación de segmentación es más costosa que la señalización del éxito y no siempre es necesaria. Priorizar la segmentación para tareas con tres o más fases semánticamente distintas, o cuando planee usar una arquitectura de política jerárquica.

Comparación de las herramientas de anotación

Tool License Video Support Time-Series Multi-Camera Sync Best For
Label Studio Apache 2.0 Yes Limited No (single video) General annotation, extensible via templates
V7 (Darwin) Commercial Yes No No Auto-labeling with SAM, managed workforce
CVAT MIT Yes No No Bounding boxes, segmentation masks on video
Custom Gradio/Streamlit Custom Full control Yes Yes (custom build) Robot-specific workflows with joint state plots
RCSV Platform SaaS Yes Yes Yes (native) Purpose-built for robot episodes with all sensors

La principal limitación de las herramientas de anotación de propósito general (Label Studio, CVAT, V7) para los datos de robots es que están diseñadas para anotación de imágenes/vídeo, no para anotación de episodios multimodales sincronizados. La mayoría de los equipos que construyen líneas de anotación serias terminan con una aplicación Gradio o Streamlit personalizada que lee directamente los episodios de HDF5.

Indicadores de referencia de costes de anotación

En base a las operaciones de anotación del RCSV, aquí hay puntos de referencia de costes realistas para diferentes configuraciones de anotación:

Annotation Configuration Cost per Episodio Time per Episodio Suitable For
Success flag only (automated + spot-check) $0.05-0.10 5-10 sec ACT, Diffusion Policy (single-task)
Success + language instruction $0.15-0.35 20-40 sec VLA fine-tuning, multi-task BC
Success + language + phase segmentation $0.50-1.50 2-5 min Hierarchical policies, detailed debugging
Full annotation (all above + bboxes) $2.00-5.00 10-20 min Object detection training, perception research
Segmentation masks (per frame, SAM-assisted) $0.50-2.50/frame 30-120 sec/frame Sim-to-real domain adaptation, visual pre-training

Para un conjunto de datos de 500 episodios anotado con señales de éxito e instrucciones de lenguaje (la configuración más común para el ajuste fino de VLA), el costo total de la anotación es de aproximadamente $ 75-175. Esta es una pequeña fracción del costo de recopilación de datos y nunca debe ser descuidada en el costo marginal de la anotación es mucho menor que el costo de la reeducación en datos mal etiquetados.

Control de calidad: Acuerdo entre los anotadores

El acuerdo entre anotadores (IAA) mide la consistencia con que varios anotadores etiquetan los mismos datos.

Trescos de IAA para los datos de robots:

  • Etiquetas binarias de éxito: kappa > 0,85 (se pueden obtener con un documento de criterios de éxito claros)
  • Fronteras de la fase de tarea: kappa > 0,75 (algunas ambigüedades de las fronteras son inherentes)
  • Puntuaciones de calidad de la demostración: kappa > 0,65 (la calidad es más subjetiva; la kappa ponderada es más adecuada)

Si su AIA cae por debajo de estos umbrales, los criterios de anotación deben refinarse antes de proceder.

  • Contrato de etiqueta de bajo éxito: Añadir ejemplos de fotos de casos de borde al documento de criterios de éxito. Define la tolerancia posicional exacta (por ejemplo, "centro del objeto dentro de 2 cm del centro objetivo").
  • Acuerdo de segmentación baja: Definir las transiciones de fase en términos de eventos físicos observables ("el pegatín se cierra en el objeto" no "la fase de aproximación termina").
  • Acuerdo de puntuación de calidad baja: Reducir la escala de 5 a 3 niveles (bueno/acceptable/rechazado).

Anotado de las normas de calidad

El RCSV aplica una puerta de calidad de tres etapas a todos los conjuntos de datos: auto-anotamiento del operador inmediatamente después de la grabación, revisión secundaria por un anotador capacitado y comprobaciones de consistencia automatizadas que comparan las anotaciones con las estadísticas conjuntas del estado (por ejemplo, los episodios marcados por éxito en los que el pegamento nunca se cierra se marcan para su revisión).

Verificación automática de la coherencia que detecte errores comunes:

  • Episodio etiquetado con éxito en el que el efector final nunca se mueve más de 5 cm de la posición de inicio → bandera
  • Episodio etiquetado con éxito más corto del 50% de la longitud media del episodio → bandera
  • En la instrucción de lenguaje se menciona "izquierda", pero todos los objetos están en el lado derecho del espacio de trabajo → bandera
  • Segmentación de fase en la que cualquier fase sea menor de 0,5 s o mayor de 60 s → bandera
  • Dos episodios adyacentes con instrucciones de idioma idénticas pero diferentes categorías de tareas → bandera

El proyecto de la RCSV

Cuando utiliza los servicios de recogida de datos de RCSV (T3), la anotación es parte del producto entregado. Nuestros operadores anota cada episodio con banderas de éxito y etiquetas de idioma durante la sesión de grabación, y nuestro equipo de anotación realiza una revisión secundaria antes de exportar el conjunto de datos. Recibes un conjunto de datos con anotaciones de alta confianza, puntajes de acuerdo de anotador y un informe completo de calidad.

Para los equipos que aportan sus propios datos recogidos, el RCSV ofrece servicios exclusivamente de anotación en los siguientes niveles:

  • Basic ($0,10/episodio): Verificación de bandera y limpieza de las etiquetas existentes
  • Estándar ($0,30/episodo): Banderas de éxito + instrucciones de idioma + puntaje de calidad
  • **Todo el contenido de la notación incluida la segmentación de fase y las etiquetas de contacto

Podemos procesar conjuntos de datos existentes recogidos en cualquier plataforma de hardware compatible (ALOHA, OpenArm, Franka, UR, Unitree). Los conjuntos de datos deben estar en formato HDF5 o RLDS con vídeos accesibles para su revisión. [Contacta con nosotros]T4) para discutir sus necesidades de anotación de conjunto de datos, o explorar nuestra interfaz de anotación a través de la [Plataforma de datos RCSV]T5).

Lectura relacionada