Volver a OpenArm Path

Despliegue y mejore

Unidad 6 de la ruta de aprendizaje OpenArm. ejecuta tu política entrenada en el brazo real, evalúa sistemáticamente y inicia la rueda de vuelo de datos. Meta: 7/10 tasa de éxito autónoma.

Unidad 6 de 6 · Despliegue y mejore · ~ 1,5 horas

Ahora ponlo en el brazo real, evalúalo rigurosamente y entienda cómo mejorarlo. Aquí es donde comienza el volante de datos.

La inferencia en el brazo real

La implementación significa ejecutar su puesto de control entrenado en tiempo real, suministrando cámaras en vivo y observaciones conjuntas a la red y ejecutando las acciones de salida en el brazo físico.

Fuente ~/openarm-env/bin/activar # Asegúrese de que ROS 2 está funcionando (modo hardware real, desde la Unidad 1) python -m lerobot.scripts.eval \ --policy-checkpoint ~/openarm-policies/pick-and-place-v1/checkpoint_XXXXX \ --device cuda \ --num-eval-episodos 10 \ --record-video \ --output-dir ~/openarm-s/v1 \ # Substituir el XXXXX con el mejor número de paso de control de la Unidad 5 # --record-video guarda cada episodio como mp4 para revisión

Para la primera ejecución de implementación, mantenga su mano cerca de la parada E física. Una política recién implementada puede ocasionalmente hacer movimientos inesperados mientras se calienta al entorno de hardware real. Esto es normal para los primeros 23 episodios. Después de eso, el comportamiento debe estabilizarse.

Para obtener una guía completa de despliegue y producción, incluidos los sobres de seguridad y los cronómetros de vigilancia, vea la [Guía de producción OpenArm]T1.

Metodología de evaluación

No evalúe su política de forma informal. Utilice un protocolo estructurado es la única manera de saber si un cambio que haga (más datos, diferentes puntos de control, diferentes marcos de tareas) mejorará realmente el rendimiento:

Protocol Item Specification
Number of episodes per evaluation 10 minimum, 20 for high-confidence results
Object starting position Fixed. Use tape marks. Same position every episode.
Object type Same object as training. Lighting must match training conditions.
What counts as success Object placed within 3cm of target. Arm returns to home. No human intervention during episode.
Failure classification Log failure type: missed grasp / dropped object / wrong target / timeout. This tells you what to fix.
Report metric Success rate = successful episodes / total episodes. Report with episode count (e.g., "7/10 = 70%").

El volante de datos: cómo mejorar

Una política que tenga éxito 7/10 veces es un buen comienzo pero el camino hacia 9/10 o más allá es a través del volante de datos.

1 de la Comisión

Recolección

Registrar las demostraciones, incluyendo los casos de fallas con las que su política actual lucha

2 de la Comisión

Tren

Reentrenar (o ajustar) su conjunto de datos ampliado con las nuevas demostraciones añadidas

3 El

Evaluar

¿Se ha mejorado la tasa de éxito? ¿Qué modos de falla quedan?

4 de la Comisión

Analizar

Mira los videos de fallas, identifica el estado específico en el que la política se rompe, recoge datos específicos allí.

La clave de la rueda de vuelo: ** Los datos dirigidos superan a los datos aleatorios**. En lugar de grabar 50 demostraciones aleatorias más, vea sus videos de fallas e identifique el momento exacto en que las cosas salen mal. Grabe 20 demostraciones que cubren específicamente ese estado difícil (por ejemplo, el agarre en el borde del espacio de trabajo, o el objeto en un ángulo inusual). Tu tasa de éxito mejorará más rápido con 20 demos dirigidos que 50 aleatorios.

Los modos de falla comunes y cómo solucionarlos

  • Arm sobrepasa la posición de agarre: Las piezas de acción de la política son demasiado grandes o sus datos tenían una varianza de alta velocidad. Graba 10 demostraciones más a velocidad lenta cerca del punto de agarre. O reduce T0 de 100 a 50 en la configuración de entrenamiento.
  • Arm tiene éxito en el objeto de entrenamiento pero falla en objetos ligeramente diferentes: Sus datos de entrenamiento carecían de diversidad de posición del objeto.
  • La política congela o produce movimientos repetidos: La variable de estilo CVAE se está derrumbando. Esto a menudo significa que su conjunto de datos tiene demasiada variación el modelo no puede encontrar un estilo consistente. Compruebe si hay demostraciones mixtas (operadores diferentes, marcos de tareas diferentes) y limpie su conjunto de datos.

Unidad 6 completa cuando...

El brazo completa la tarea de pick-and-place de forma autónoma 7 de 10 veces en una evaluación estructurada. Has visto los 3 videos de falla e identificado lo que salió mal. Comprendes el volante de datos lo suficientemente bien como para planificar tu próxima iteración de mejora. Este es el final del camino estructurado pero es el comienzo de tu práctica de aprendizaje robótico.

- Lo hiciste. - ¿Qué?

Se ha pasado de descabar un robot a entrenar y implementar una verdadera política de aprendizaje de imitación. Eso lo pone por delante del 99% de las personas que alguna vez han tocado un brazo robótico. Lo que construyó aquí la configuración de la teleoperación, la tubería de datos, el flujo de trabajo de entrenamiento escalas a cualquier tarea y cualquier hardware.

¿Qué es lo siguiente?

Tienes la base. Aquí es donde ir desde aquí:

¿Qué es esto?

Guía de producción de OpenArm

Envolutos de seguridad, cronometradores de vigilancia, configuraciones de múltiples brazos y patrones de despliegue de larga duración.

](T2) [

Profundizar en la política de difusión

Entrenamiento en tareas multi-modal donde múltiples estrategias son válidas.

](T3) [

DK1 Kit de trabajo manual

Dos brazos sincronizados para tareas bimanual.

](T4) [

Compartir sus resultados

Publica tu tasa de éxito, tu conjunto de datos y tu política en el foro OpenArm. La comunidad aprende de cada resultado.

[T5]

[← Regreso a la visión general del camino]