Cómo recopilar datos de entrenamiento de robots: Guía paso a paso (2026)
Guía paso a paso para recopilar datos de entrenamiento de robots <unk> configuración de hardware, métodos de teleoperación, diseño de episodios, evaluación de calidad y escalación de su conjunto de datos.
[← Guías]
Todo lo que necesita saber sobre la recopilación de datos de demostración de robots de alta calidad
Antes de empezar: lo que necesitas
La recopilación de datos es la base de cada [imitación de aprendizaje] pipeline. Los datos pobres producen políticas pobres sin importar cuán sofisticado sea su algoritmo de entrenamiento. Antes de grabar un solo episodio, verifique que tiene lo siguiente:
Lista de verificación de hardware
- Armo robot con control de posición a 50 Hz: ViperX-300 S2, Koch v1.1, OpenArm, Franka Emika Panda, o similares. El brazo debe aceptar comandos de posición conjunta a 50 Hz o más y reportar las posiciones conjuntas actuales a la misma velocidad.
- Interfaz de teleoperación: brazo del líder-seguidor (más alta calidad de datos), controlador VR (Meta Quest 3, menor costo) o ratón 3D (SpaceMouse, configuración más simple).
- Cámaras: Minimum 2 cámaras
1 montadas en la muñeca (recomendado por Intel RealSense D405) y 1 sobrecargada (RealSense D435 o Logitech C920). - Estación de trabajo: Ubuntu 22.04 o 24.04, NVIDIA GPU (cualquier tarjeta moderna funciona para la recopilación de datos
GPU es para entrenamiento posterior), 500 GB + NVMe SSD para el almacenamiento de episodios. Puertos USB 3.0 para la cámara y las conexiones de brazo. - ** Software de grabación:** LeRobot grabación de pila, ALOHA grabación de guiones, o personalizado ROS2 registrador de datos. Debe emitir archivos HDF5 con datos conjuntos sincronizados (50 Hz) y marcos de cámara (30 fps).
- Objetos de tarea: Los objetos que manipularás durante la recopilación de datos. Tenga múltiples si es posible
querrás variar las instancias de objetos para la generalización. - ** Almacenamiento de respaldo:** SSD externo o NAS para las copias de seguridad nocturnas. Un solo día de recopilación de datos produce 20
50 GB. Perder un día de recopilación por una falla en el disco es costoso.
Elegir el método de teleoperatoria
El método de teleoperación que elija afecta directamente a la calidad de los datos, el rendimiento de recogida y la fatiga del operador.
Árbol de decisión: precisión de tarea a método
- ** Precisión sub-milimétrica requerida** (inserción, fijación, montaje fino) → ** brazo líder-seguidor.** La coincidencia cinemática entre líder y seguidor proporciona la mejor precisión de posición.
- Precisión suficiente a nivel de centímetro (pick-place, clasificación, empaquetado) → VR controller (Meta Quest 3). Movimiento natural de la mano, menor costo ($500), incorporación más rápida del operador.
- 6-DOF control de efecto final con retroalimentación de fuerza (tareas ricas en contacto, seguimiento de superficie) → ** brazo del líder con compensación de gravedad.** El operador siente resistencia a través del brazo del líder, lo que permite demostraciones sensibles a la fuerza.
- ** Manipulación externa de la mano** (agarramiento a nivel del dedo, rotación en la mano) → ** Guantes de exoesqueleto** (SenseGlove Nova 2 o HaptX G1).
- Prototipo rápido, tareas de un solo eje → SpaceMouse o teclado. Barrera de entrada más baja.
Para la mayoría de los equipos que comienzan, la recomendación es: comience con una configuración de seguidores de líderes si puede permitirse, o controller de RV si el presupuesto es limitado. La diferencia de calidad de los datos es medible
Configuración de la cámara y el sensor
La configuración de la cámara es uno de los factores más subestimados en la calidad de la recopilación de datos.
Tipos de cámaras y cuándo usarlas
- Camera de muñeca (montada en el ejector final del robot): Proporciona una visión de cerca del punto de manipulación. Es esencial para tareas de precisión (inserción, apretamiento fino). Se mueve con el robot, por lo que siempre enmarca la acción. Recomendado: Intel RealSense D405 (compacto, obturador global, 640x480 a 30 fps).
- Camera de cabeza (fija, mirando hacia abajo en el espacio de trabajo): Proporciona contexto de escena global. Esencial para tareas de pick-place donde la política necesita localizar objetos en el espacio de trabajo. Montar 120
150 cm sobre la mesa, centrado sobre el espacio de trabajo. Recomendado: Intel RealSense D435 o Logitech C920. - Cámara lateral (fija, a la altura de la mesa): Captura trayectorias de aproximación y perfiles de agarre que están ocultas de la parte superior. Útil para tareas que implican aproximación vertical (estacionamiento, inserción desde arriba).
- ** Configuración de múltiples visualizaciones (3+ cámaras):** El estándar para la recogida de alta calidad. ALOHA utiliza una pila de 3 cámaras: muñeca izquierda, muñeca derecha, cabeza.
Consejos de montaje y calibración
- Utilice extrusión rígida de aluminio o soportes de acero.
- Después de montar, marque la posición de la cámara con un lápiz de pintura o grabado.
- Calibra las partes extrínsecas de la cámara usando una placa ArUco antes de cada campaña de recogida de varios días.
- Configure las cámaras a la exposición manual y el equilibrio de blanco fijo.
- Verifique la sincronización de los cuadros: las cámaras y los datos conjuntos deben estar marcados desde el mismo reloj. Utilice disparadores de hardware (sincronización de múltiples cámaras RealSense) o sincronización de software a través de un reloj NTP compartido.
Diseño de los episodios
Un "episodio" es una demostración única de la tarea de principio a fin.La forma en que diseñas episodios determina la distribución de la que aprende tu política y, por lo tanto, lo que puede y no puede hacer en el momento de su implementación.
Definición de la tarea
Escriba una especificación precisa de la tarea antes de recopilar cualquier dato.
- ** Objetivo de la tarea:** "Recabe el cubo rojo de la mesa y coloca en el tazón azul".
- Criterio de éxito: "El cubo está dentro del tazón, el agarre está abierto y el brazo ha vuelto a su posición de origen". Define el éxito de manera inequívoca para que cada operador y cada revisor de calificación aplique el mismo estándar.
- Estrategias permitidas: "Aproche el cubo desde arriba con una captura de arriba hacia abajo". O explícitamente: "Cualquier enfoque de captura es aceptable". Si se limita la estrategia, se obtienen datos más consistentes (mejor para ACT).
- Duración del episodio: Definir una duración máxima del episodio. Lugar típico de selección de mesa: 5
15 segundos. Si un episodio supera 2 veces la duración media, algo salió mal descartarlo.
Comience la distribución estatal
La distribución del estado de inicio determina la robustez de implementación de su póliza.Si cada demostración comienza con el objeto en la misma posición, la póliza fallará cuando el objeto está a 3 cm a la izquierda.
- Fase 1 (primeras 50 demostraciones): Utilice una pequeña distribución de estado de inicio.
- Fase 2 (demos 51
200): Extensión a la distribución de implementación prevista completa. Diferente posición de objeto en todo el espacio de trabajo accesible. Diferente orientación de objeto si es pertinente. - Fase 3 (demos 200+): Añadir distractores, variantes de objetos, variación de iluminación y cambios de fondo.
Protocolo de restablecimiento
Entre los episodios, debe restablecer la escena a un estado de inicio válido.
- Regresar al robot a su configuración de casa (posiciones conjuntas predefinidas).
- Coloque el objeto de tarea en una nueva posición dentro de la distribución del estado de inicio.
- Verifique si la escena coincide con la especificación de la tarea (objeto visible, sin oclusiones, agarre abierto).
- Espera 1 segundo para que la escena se establezca (sin movimiento residual del objeto).
- Comience a grabar.
Los resets desordenados son la principal fuente de episodios malos. Automatice el reset cuando sea posible
Grabar sus primeros 10 episodios
Los primeros 10 episodios son acerca de validar su pipeline, no recopilar datos de entrenamiento.
Paseo paso a paso
- Lanzar el guión de grabación. Verifique si la salida HDF5 está siendo escrita en el directorio correcto. Compruebe si el tamaño del archivo aumenta durante la grabación (indica que los datos están fluyendo).
- Posicionamiento del operador. El operador debe sentarse o estar cómodo en la interfaz de teleoperación con una visión clara del espacio de trabajo. para el líder-seguidor: manos en los brazos del líder. para VR: auriculares encendidos, controladores en mano con espacio de trabajo visible en modo de paso.
- Registra el episodio 1. Ejecuta la tarea sin problemas. No te apresures.
Los movimientos suaves y deliberados producen mejores políticas que los rápidos y tirantes. Velocidad típica: 50 70% del más rápido que puedes ir. - Deja de grabar y inspeccione el episodio. Abre el archivo HDF5. Verifique:
- Los datos de posición conjunta (
T3 ) tienen el número esperado de pasos temporales (episodios_durada_segundos x 50 Hz). - Las imágenes de la cámara (
T4 ) tienen el número de cuadros esperado (durada x 30 fps). - Los datos de acción (
T5 ) coinciden con las dimensiones de la posición conjunta. - Reproduce las imágenes y verifique que están sincronizadas con los datos conjuntos.
- Registra los episodios 2
10. Variación de las posiciones de inicio ligeramente. - Reactar una prueba de entrenamiento. Introducir estos 10 episodios en su guión de entrenamiento. No espera una buena política
está verificando que el pipeline de entrenamiento acepta su formato de datos sin errores.
Control de calidad para cada episodio
Cada episodio debe pasar esta lista de verificación de calidad de 8 puntos antes de ser añadido al conjunto de datos de entrenamiento.
Lista de control de la calificación de los 8 puntos
- Tarea completada con éxito? El episodio termina con la meta de tarea alcanzada según los criterios de éxito.
- No vacilación del operador > 2 segundos? Las largas pausas en medio de la tarea crean puntos de datos "estacionarios" que confunden la política.
- Traictoria lisa? Reproduzca los datos de posición de las articulaciones. Busque saltos repentinos (fallas de teleoperatorio), oscilaciones (instabilidad del controlador) o cambios de velocidad no naturales.
- Imágenes de la cámara claras? Compruebe si hay borrosidad de movimiento, oclusión del punto de manipulación y exposición correcta.
- Estado de inicio correcto? Verifique que el episodio comienza desde dentro de la distribución de estado de inicio prevista.
- Duración de los episodios dentro de los límites? La duración debe estar dentro de 2 desviaciones estándar de la media.
- Integritad de datos? El archivo HDF5 no está corrompido. Todos los campos de datos esperados están presentes. Las marcas de tiempo están aumentando monótona. No hay valores NaN en los datos conjuntos.
- ** Estrategia consistente?** Si está limitando la estrategia (recomendada para ACT), compruebe que el episodio sigue el enfoque designado.
Errores comunes en la recopilación de datos
1. Posición de la cámara inconsistente entre sesiones
** Lo que sucede:** Recoge 100 episodios el lunes, luego golpea la cámara aérea mientras limpia. Los 100 episodios del martes tienen un punto de vista ligeramente diferente.
Fix: Monta las cámaras rígidamente. Fotografía de las posiciones de la cámara. Al comienzo de cada sesión, verifique el extrínseco de la cámara con una calibración de la placa de referencia ArUco. Si la calibración ha cambiado, vuelva a montar antes de recoger.
2. Fatiga del operador degradación de la calidad de los datos
** Lo que sucede:** Los primeros 50 episodios del día son suaves y precisos. Para el episodio 150, el operador está cansado
Fix: Aplicar pausas de 10 minutos cada 45 minutos. Limitar las sesiones de recogida a 4 horas por operador por día. Seguir las métricas de calidad (tiempo de episodio, fluidez de trayectoria) a lo largo del tiempo y detener la recogida cuando la calidad se degrada.
3. Distribución estrecha del estado de inicio
Qué sucede: Todas las demostraciones comienzan con el objeto en aproximadamente la misma posición.
Fix: Ramplificar sistemáticamente las posiciones de los objetos durante la recopilación. Utilice un patrón de cuadrícula: dividir el espacio de trabajo en una cuadrícula 4x4 y recoger al menos 3 episodios a partir de cada célula de cuadrícula.
4. No validar el tubo de grabación antes de escalar
Qué sucede: Recopiles 500 episodios en una semana, luego descubres que los datos de acción se grabaron a 25 Hz en lugar de 50 Hz debido a un error de configuración.
Fix: Siempre valida con 10 episodios de prueba primero. ejecuta la línea de entrenamiento completa en esos 10 episodios. Verifique las dimensiones de los datos, las frecuencias y la compatibilidad del formato antes de invertir en la recopilación a gran escala.
5. Estrategias mixtas en un conjunto de datos pequeño
Qué sucede: Tres operadores utilizan cada uno un enfoque de captura diferente. Con sólo 150 episodios totales (50 por enfoque), ningún enfoque único tiene datos suficientes. ACT promedia los enfoques y produce una trayectoria media inválida.
Fix: Para conjuntos de datos menores a 300 episodios, estandarice en una sola estrategia. Entrenar a los operadores a utilizar el mismo enfoque. Para conjuntos de datos más grandes (300+), múltiples estrategias son buenas
6. Ignorando la variación de la iluminación
Qué sucede: Todos los datos se recopilan bajo una iluminación de laboratorio consistente.
Fix: Durante la colección de Fases 2 y 3, varía deliberadamente la iluminación. Apague las luces de la cabeza durante algunos episodios. Agregue una lámpara de escritorio desde diferentes ángulos. Cierra/abre persianas de ventana. Esto obliga al codificador visual a aprender características de la iluminación invariables.
Escalación de 50 a 500 episodios
La recopilación de datos a escala introduce desafíos organizacionales que no existen a pequeña escala.
Formación de los operadores
Cuando se añaden nuevos operadores más allá del 1
- Que los nuevos operadores vean 10 episodios ejemplares antes de comenzar.
- Requiere 20 episodios de práctica que pasen QA antes de contar hacia el conjunto de datos.
- En la primera sesión, empareje a los nuevos operadores con un operador experimentado.
- Metricas de calidad de la pista por operador: duración media del episodio, puntuación de fluidez de trayectoria, tasa de rechazo de la calificación.
Programación de turnos
Para la colección a gran escala (500 episodios):
- Programa de 2
3 operadores diarios en turnos de 3 horas con superposición de 30 minutos para la entrega. - Cada turno produce aproximadamente 40
60 episodios (a 3 4 minutos por episodio incluyendo el reset y la QA). - Designe a una persona como "director de datos" que revise las métricas de calidad al final de cada día y señala la degradación.
- Presupuesto: a las tasas RCSV, los operadores profesionales cobran en $15
25 por episodio validado, incluido el QA. Los costos de recolección interna varían, pero generalmente funcionan en $8 15 por episodio cuando se contabilizan el tiempo y los gastos generales del operador.
Detección de la degradación de la calidad
Monitorear diariamente estas métricas durante la recogida a gran escala:
- Duración media del episodio: Debe mantenerse estable (±10%).
- Taxa de rechazo de la CA: Debe mantenerse por debajo del 15%, si sube por encima del 20%, detener la recogida e investigar.
- Listo de trayectoria: Calcule el jerk (tercera derivada de posición) de cada episodio.
- Cobreza de estado de inicio: Posiciones de inicio de tramo en una mapa de calor 2D. Verifique la cobertura uniforme en toda la distribución prevista. Redirecciona a los operadores a regiones con menos muestras.
Almacenamiento y organización de datos
Estructura de carpetas
project-name/
raw/
2026-04-12/
episode_001.hdf5
episode_002.hdf5
...
2026-04-13/
episode_101.hdf5
...
validated/
episode_001.hdf5 # passed QA
episode_002.hdf5
...
rejected/
episode_045.hdf5 # failed QA, kept for reference
...
metadata/
collection_log.csv # operator, date, start_state, duration, QA status
camera_calibration_2026-04-12.json
task_specification.md
training/
train/ # 85-90% of validated episodes
val/ # 10-15% of validated episodes
Nombrar las convenciones
- Archivos de episodios:
T6 (por ejemplo, T7 ). - Incluya metadatos en los atributos del archivo HDF5: ID del operador, fecha de recogida, descripción del estado de inicio, estado de calificación, nombre de la tarea.
- Nunca vuelva a usar los números de los episodios.
Estrategia de respaldo
- Diariamente: sincronizar el directorio/casa prima con un SSD o NAS externo.
- Semanal: cargue el directorio/valor validado al almacenamiento en la nube (AWS S3, Google Cloud Storage).
- Después de cada campaña de recogida: crea un archivo con versión (por ejemplo,
T8 ) y sube al almacenamiento compartido de tu equipo. - Nunca edite archivos HDF5 en su lugar. Si necesita modificar datos (por ejemplo, episodios de cultivo, fijar sellos de tiempo), cree un nuevo archivo y guarde el original en bruto/.
Carga en el oleoducto de formación
Ingestión por LeRobot
Para convertir su conjunto de datos HDF5 en formato LeRobot para la formación con ACT o Política de difusión:
# Convert HDF5 episodes to LeRobot Parquet format
python -m lerobot.scripts.convert_dataset \
--raw-dir ./validated/ \
--repo-id my-org/my-task-v1 \
--raw-format hdf5_aloha
# Verify the converted dataset
python -m lerobot.scripts.visualize_dataset \
--repo-id my-org/my-task-v1 \
--episode-index 0
Verificación de la estructura del HDF5
Antes de convertir, compruebe que los archivos HDF5 contienen la estructura esperada:
# Quick verification script
import h5py
import numpy as np
with h5py.File('episode_0001.hdf5', 'r') as f:
# Check required fields
assert 'observations' in f
assert 'action' in f
qpos = f['observations/qpos'][:]
images = f['observations/images/cam_high'][:]
actions = f['action'][:]
print(f"Joint data: {qpos.shape}") # expect (T, num_joints)
print(f"Images: {images.shape}") # expect (T_img, H, W, 3)
print(f"Actions: {actions.shape}") # expect (T, num_joints)
# Check for NaN values
assert not np.any(np.isnan(qpos)), "NaN in joint data!"
assert not np.any(np.isnan(actions)), "NaN in actions!"
# Check timestamp monotonicity
if 'timestamps' in f:
ts = f['timestamps'][:]
assert np.all(np.diff(ts) > 0), "Non-monotonic timestamps!"
Para obtener especificaciones detalladas de formato y conversión entre los formatos HDF5, RLDS y LeRobot, consulte nuestra guía de formato de datos.
¿Necesita ayuda para recopilar datos?
RCSV gestiona todo el proceso de recopilación de datos
[Vea Servicios de recogida de datos]







