Despliegue y mejore
Unidad 6 de la ruta de aprendizaje OpenArm. ejecuta tu política entrenada en el brazo real, evalúa sistemáticamente y inicia la rueda de vuelo de datos. Meta: 7/10 tasa de éxito autónoma.
Unidad 6 de 6 · Despliegue y mejore · ~ 1,5 horas
Ahora ponlo en el brazo real, evalúalo rigurosamente y entienda cómo mejorarlo. Aquí es donde comienza el volante de datos.
La inferencia en el brazo real
La implementación significa ejecutar su puesto de control entrenado en tiempo real, suministrando cámaras en vivo y observaciones conjuntas a la red y ejecutando las acciones de salida en el brazo físico.
Fuente ~/openarm-env/bin/activar # Asegúrese de que ROS 2 está funcionando (modo hardware real, desde la Unidad 1) python -m lerobot.scripts.eval \ --policy-checkpoint ~/openarm-policies/pick-and-place-v1/checkpoint_XXXXX \ --device cuda \ --num-eval-episodos 10 \ --record-video \ --output-dir ~/openarm-s/v1 \ # Substituir el XXXXX con el mejor número de paso de control de la Unidad 5 # --record-video guarda cada episodio como mp4 para revisión
Para la primera ejecución de implementación, mantenga su mano cerca de la parada E física. Una política recién implementada puede ocasionalmente hacer movimientos inesperados mientras se calienta al entorno de hardware real. Esto es normal para los primeros 2
Para obtener una guía completa de despliegue y producción, incluidos los sobres de seguridad y los cronómetros de vigilancia, vea la [Guía de producción OpenArm]
Metodología de evaluación
No evalúe su política de forma informal. Utilice un protocolo estructurado
| Protocol Item | Specification |
|---|---|
| Number of episodes per evaluation | 10 minimum, 20 for high-confidence results |
| Object starting position | Fixed. Use tape marks. Same position every episode. |
| Object type | Same object as training. Lighting must match training conditions. |
| What counts as success | Object placed within 3cm of target. Arm returns to home. No human intervention during episode. |
| Failure classification | Log failure type: missed grasp / dropped object / wrong target / timeout. This tells you what to fix. |
| Report metric | Success rate = successful episodes / total episodes. Report with episode count (e.g., "7/10 = 70%"). |
El volante de datos: cómo mejorar
Una política que tenga éxito 7/10 veces es un buen comienzo
1 de la Comisión
Recolección
Registrar las demostraciones, incluyendo los casos de fallas con las que su política actual lucha
2 de la Comisión
Tren
Reentrenar (o ajustar) su conjunto de datos ampliado con las nuevas demostraciones añadidas
3 El
Evaluar
¿Se ha mejorado la tasa de éxito? ¿Qué modos de falla quedan?
4 de la Comisión
Analizar
Mira los videos de fallas, identifica el estado específico en el que la política se rompe, recoge datos específicos allí.
La clave de la rueda de vuelo: ** Los datos dirigidos superan a los datos aleatorios**. En lugar de grabar 50 demostraciones aleatorias más, vea sus videos de fallas e identifique el momento exacto en que las cosas salen mal. Grabe 20 demostraciones que cubren específicamente ese estado difícil (por ejemplo, el agarre en el borde del espacio de trabajo, o el objeto en un ángulo inusual). Tu tasa de éxito mejorará más rápido con 20 demos dirigidos que 50 aleatorios.
Los modos de falla comunes y cómo solucionarlos
- Arm sobrepasa la posición de agarre: Las piezas de acción de la política son demasiado grandes o sus datos tenían una varianza de alta velocidad. Graba 10 demostraciones más a velocidad lenta cerca del punto de agarre. O reduce
T0 de 100 a 50 en la configuración de entrenamiento. - Arm tiene éxito en el objeto de entrenamiento pero falla en objetos ligeramente diferentes: Sus datos de entrenamiento carecían de diversidad de posición del objeto.
- La política congela o produce movimientos repetidos: La variable de estilo CVAE se está derrumbando. Esto a menudo significa que su conjunto de datos tiene demasiada variación
el modelo no puede encontrar un estilo consistente. Compruebe si hay demostraciones mixtas (operadores diferentes, marcos de tareas diferentes) y limpie su conjunto de datos.
Unidad 6 completa cuando...
El brazo completa la tarea de pick-and-place de forma autónoma 7 de 10 veces en una evaluación estructurada. Has visto los 3 videos de falla e identificado lo que salió mal. Comprendes el volante de datos lo suficientemente bien como para planificar tu próxima iteración de mejora. Este es el final del camino estructurado
- Lo hiciste. - ¿Qué?
Se ha pasado de descabar un robot a entrenar y implementar una verdadera política de aprendizaje de imitación. Eso lo pone por delante del 99% de las personas que alguna vez han tocado un brazo robótico. Lo que construyó aquí
¿Qué es lo siguiente?
Tienes la base. Aquí es donde ir desde aquí:
¿Qué es esto?
Guía de producción de OpenArm
Envolutos de seguridad, cronometradores de vigilancia, configuraciones de múltiples brazos y patrones de despliegue de larga duración.
](
Profundizar en la política de difusión
Entrenamiento en tareas multi-modal donde múltiples estrategias son válidas.
](
DK1 Kit de trabajo manual
Dos brazos sincronizados para tareas bimanual.
](
Compartir sus resultados
Publica tu tasa de éxito, tu conjunto de datos y tu política en el foro OpenArm. La comunidad aprende de cada resultado.
[
[← Regreso a la visión general del camino]







