Diseño de un plan de estudios de aprendizaje de robots: secuenciación de tareas y progresión de las dificultades
Cómo diseñar un plan de estudios para el aprendizaje robótico <unk> secuenciación de tareas de simple a complejo, requisitos de demostración y estrategias de transferencia de aprendizaje.
[← Guías]
Un enfoque estructurado de diseño de currículos para el aprendizaje por imitación desde la adquisición de habilidades primitivas hasta la manipulación compleja en múltiples pasos.
Por qué es importante el plan de estudios
Comenzar un programa de aprendizaje de robots con tareas complejas es el error más común y más caro que cometen los equipos. Una política entrenada directamente en una tarea compleja como doblar tela bimanual desde cero no aprenderá nada útil en las primeras 2.000 demostraciones. El espacio de tareas es demasiado grande, la señal de recompensa es demasiado escasa, y la red no tiene habilidades previas para construir.
Un plan de estudios bien diseñado secuencia las tareas desde habilidades primitivas a composiciones complejas, donde cada etapa se basa en las habilidades adquiridas en la etapa anterior. Los equipos que utilizan el aprendizaje curricular en el RCSV han reducido los requisitos totales de demostración en un 40-60% para tareas complejas de manipulación en comparación con la formación directa de extremo a extremo.
El concepto se toma prestado directamente del aprendizaje motor humano. No se enseña a un niño a malabarismar antes de que pueda atrapar. En robótica, la teoría se formaliza como aprendizaje curricular (Bengio et al., 2009): el entrenamiento en ejemplos ordenados por una dificultad creciente produce una mejor generalización que el ordenamiento aleatorio, incluso con datos de entrenamiento totales idénticos.
Currículo Teoría de aprendizaje para la robótica
El aprendizaje curricular en el contexto de la manipulación de robots se basa en tres pilares teóricos, cada uno con implicaciones prácticas para la secuenciación de tareas y la asignación de presupuestos de demostración.
Comando fácil de hacer
El principio fundamental: presentar primero tareas más fáciles, introduciendo progresivamente variantes más difíciles. Para la manipulación, "fácil" significa menos transiciones de contacto, horizonte más corto, menos variación visual y condiciones iniciales más restringidas.
- Posiciones fijas
Objeto siempre en la misma postura, la misma iluminación, el mismo fondo. - Posiciones de captura de posición variable
Posiciones de objetos aleatorias dentro de una región de 20 cm x 20 cm. La política aprende la invarianza de posición. - Granchas de objetos variados
múltiples formas de objetos en posiciones variadas. - ** Manipulación secuencial**
Pick, transport, lugar. - Tascas ricas en contacto
inserción, montaje, operaciones sensibles a la fuerza.
Cada etapa debe alcanzar una tasa de éxito mínima del 90% antes de avanzar a la siguiente.
Métodos de currículo automático
El diseño manual del plan de estudios requiere un juicio humano sobre la dificultad de ordenar las tareas.
| Method | How It Works | Best For | Limitation |
|---|---|---|---|
| Self-paced learning | Up-weight training samples where the policy's loss is low (already learned) or in a "learning zone" (moderate loss) | Large, heterogeneous demonstration datasets | Requires all data upfront; no active collection |
| Competence-based progression | Evaluate policy on current stage every N episodes; advance when success rate > threshold | Active data collection pipelines (RCSV default) | Requires evaluation infrastructure between stages |
| Hindsight relabeling | Failed demonstrations are relabeled as successes for easier goals (e.g., "reach to where the object ended up") | Goal-conditioned policies; RL fine-tuning | Not directly applicable to pure IL without RL component |
| Domain randomization scheduling | Gradually increase visual/physical randomization range during training | Sim-to-real transfer; robustness training | Requires simulation environment |
En la práctica, el RCSV utiliza la progresión basada en competencias para proyectos activos de recopilación de datos: recoger demostraciones en la etapa actual del currículo, entrenar, evaluar y avanzar solo cuando se cumple el umbral de éxito.
Inyección en caso de fallo
Un plan de estudios que sólo contiene demostraciones exitosas produce una política frágil. Cuando la política implementada se encuentra con una situación nueva y fracasa parcialmente, nunca ha visto una trayectoria de recuperación y entra en un estado fuera de distribución que típicamente se desmorona hasta el fracaso completo.
Injección de fallas intencionada se ocupa de esto mediante la inclusión de demostraciones de fallas y recuperación del 10-20% en cada etapa del plan de estudios:
- ** Fallas de agarre:** El operador realiza intencionalmente una debilidad de agarre, detecta el deslizamiento, re-agarra.
- Erros de posicionamiento: El operador se acerca al objeto ligeramente fuera del centro, corrige en medio de la aproximación.
- Terrurbación del objeto: Una segunda persona mueve el objeto durante el acercamiento. El operador replan. La política aprende replanamiento reactivo.
- Completamiento parcial de la tarea: El operador completa el 70% de la tarea, el objeto se desprende, el operador se recupera y completa.
Incluir la inyección de fallos a partir de la etapa L2 del plan de estudios. En L1 (primitivo fijo), los fallos son raros y no son informativos. En L2+, la recuperación de fallos es una habilidad crítica que mejora significativamente la robustez de la producción.
Principios de diseño del currículo
- ** Comience con habilidades primitivas (alcanzar, captar):** Una política de "alcanzar objetos" y una política de "aplicar objetos estables" son la base de prácticamente todas las tareas de manipulación.
- Compone en tareas complejas: Una vez que se entrenan las habilidades primitivas, las tareas complejas se aprenden mucho más rápido porque la política ya tiene las subhabilidades perceptivas y motoras pertinentes. Una tarea de "colocar la taza en bandeja" entrenada después de alcanzar y agarrar las políticas existen sólo necesita 300-500 demostraciones para aprender la composición; entrenarla desde cero requiere 2.000-5.000.
- Reutilización de demostraciones entre las tareas: Las demostraciones de habilidades primitivas pueden reutilizarse como datos de pre-entrenamiento para todas las tareas que requieren esas habilidades.
- Mejore estrictamente la calidad de las habilidades primitivas: Una habilidad primitiva que sólo funciona el 80% del tiempo se compondrá mal en una tarea compuesta.
Estrategias de descomposición de las tareas
Cada tarea de manipulación compleja se puede descomponer en una secuencia de acciones primitivas. La descomposición determina cómo estructuras tu currículo, asignas presupuestos de demostración y compones políticas. Tres estrategias de descomposición, clasificadas por complejidad de implementación:
Estrategia 1: Primitivos secuenciales (más sencillas)
Dividir la tarea en una secuencia fija de primitivas ejecutadas una tras otra con condiciones de entrega explícitas.
- Exemplo
Empillamiento de tazas: REACH(taza_A) → GRASP(taza_A) → TRANSPORT(taza_A, arriba_taza_B) → PLACE(taza_A, en_taza_B) → RELASE - ** Condición de entrega:** Cada primitivo declara una condición de éxito (por ejemplo, el agarre cerrado Y la fuerza del agarre > 2N para GRASP).
- Ventajas: Fácil de deshacer (el fallo se localiza en una primitiva), cada primitiva se puede entrenar de forma independiente, los primitivos son reutilizables.
- Limites: La secuenciación rígida no puede manejar tareas donde el orden es contextualmente dependiente o donde las primitivas se superponen en el tiempo.
Estrategia 2: Política jerárquica (moderada)
Una política de alto nivel selecciona la que es primitiva para ejecutar en base a la observación actual.
- Exemplo
tarea de clasificación: La política de alto nivel observa la escena, identifica el próximo objeto a ordenar y selecciona REACH → GRASP → PLACE_BIN_A o REACH → GRASP → PLACE_BIN_B. - ** Formación:** Pre-entrenar a todos los primitivos de forma independiente (estadios del currículo L1-L2). Luego entrenar la política de alto nivel con demostraciones de la tarea completa de clasificación, donde las acciones de alto nivel son selecciones primitivas, no comandos conjuntos en bruto.
- Ventajas: Maneja tareas de longitud variable y ramificación condicional.
Estrategia 3: Pre-entrenamiento de curriculum de extremo a extremo (más flexible)
Entrenar una única política de extremo a extremo para la tarea completa, pero inicializar el codificador visual y los pesos del decodificador de acción desde la capacitación primitiva de habilidades.
- ** Proceso:** (1) Entrenar primitivos, extraer los pesos de los codificadores visuales. (2) Iniciar la política de tarea completa con el codificador primitivo. (3) Arreglar las demostraciones de la tarea completa.
- Vantajes: No hay condiciones explícitas de entrega; la política aprende transiciones implícitas.
- Limitas: Más difícil de deshacerse cuando se producen fallos. Requiere más demostraciones de tareas completas que la Estrategia 2.
Niveles de dificultad de tarea L1-L5
| Level | Task Description | Examples | Demo Requirement | Key Challenge |
|---|---|---|---|---|
| L1 — Primitive single-step | Top grasp of flat, stationary object in fixed position | Pick flat block, open/close gripper on fixed peg | 50-200 | Precise approach trajectory |
| L2 — Varied grasp | Grasp objects with varied size, position, or orientation | Pick cylinder of varying diameter, grasp in +/-30 deg orientation range | 500-1,000 | Visual generalization |
| L3 — Two-step manipulation | Sequential actions with state dependency | Pick and place, open box lid then insert item | 1,000-5,000 | State estimation between steps |
| L4 — Contact-rich assembly | Precise insertion, assembly under uncertainty | USB plug insertion, snap-fit assembly, nut threading | 5,000-20,000 | Reactive force control |
| L5 — Bimanual deformable | Two arms, deformable objects, long horizons | Fold towel, bag groceries, cut with knife and fork | 20,000+ | Bimanual coordination, deformable state |
Estos rangos asumen arquitecturas modernas de aprendizaje de imitación basadas en transformadores (ACT, Política de difusión). Los métodos de clonación de comportamiento más antiguos requieren 2-5 veces más demostraciones para la misma tarea. Si está utilizando una arquitectura más nueva como pi-0 o un modelo de acción de lenguaje de visión grande pre-entrenado, los requisitos de demostración en L1-L3 pueden ser 3-10 veces menores debido a los antecedentes pre-entrenados.
Escalado de la cuenta de demostración por etapa del currículo
Los presupuestos de demostración deben seguir un patrón de escala no lineal en todas las etapas del plan de estudios.
| Curriculum Stage | Demos (Without Curriculum) | Demos (With Curriculum) | Savings | Success Threshold to Advance |
|---|---|---|---|---|
| L1 — Alcance + grasp (fixed) | 100-200 | 100-200 | 0% (baseline) | 95% |
| L2 — Varied grasp | 500-1,000 | 300-600 | 30-40% | 90% |
| L3 — Pick-place sequence | 2,000-5,000 | 800-2,000 | 50-60% | 85% |
| L4 — Contact assembly | 10,000-20,000 | 4,000-8,000 | 50-60% | 80% |
| L5 — Bimanual deformable | 20,000-50,000 | 8,000-20,000 | 50-60% | 75% |
La idea clave: el porcentaje de ahorro del plan de estudios es más alto en L3-L5, exactamente donde las demostraciones son más caras. A $25-$80 por demostración (precio de los servicios de datos de RCSV)
Curriculum para la manipulación: seleccionar, apilar, insertar
Este ejemplo de trabajo muestra un plan de estudios completo para una tarea de montaje de producción: la inserción de un componente en una vivienda.
Etapa 1: Acceso al componente (L1) - 150 demostraciones
Entrenamiento del brazo para moverse de la posición de la casa a una posición pre-agarrada 3 cm por encima del componente. posición fija del componente, iluminación fija. éxito: efecto final dentro de 5 mm de la posición pre-agarrada objetivo.
- Hardware: OpenArm 1 (6-DOF, 500 g de carga útil) con RealSense D405 montado en la muñeca
- Rate de datos: posiciones articulares de 30 Hz + 60 fps RGB desde la cámara de muñeca
- Formatos de salida: HDF5 con /observaciones/qpos [6], /observaciones/imágenes/cam_muñeca [480x640x3], /acción [6]
- Evaluación: 20 ensayos, objetivo de éxito > 95%
Etapa 2: Componente de la captura (L2) - 400 demostraciones
Se extiende desde el agarre previo al agarre cerrado. La posición de los componentes varía en un rango de 15 cm x 15 cm. Tres tamaños de componentes (pequeño, medio y grande).
- Inicializa el codificador visual desde los pesos de la etapa 1
- Incluir 10% de demostraciones de no captura y agarre
- Evaluación: 50 ensayos en todas las variantes, objetivo de éxito > 90%
Fase 3: Transporte y alineación (L3) - 800 demostraciones
Seleccionar el componente, transportarlo a la carcasa, alinearlo por encima del punto de inserción.
- Iniciar desde los pesos de la etapa 2 (encodificador + decodificador de acción)
- Variación de la posición de la carcasa dentro de los límites de 10 cm x 10 cm
- Incluir 15% de demostraciones de aproximación y corrección fuera del centro
- Evaluación: 50 ensayos, objetivo de éxito > 85%
Etapa 4: Insertar el componente (L4) - 2.000 demostraciones
Insertar completamente con regulación de la fuerza. Agregar datos de los sensores F/T al espacio de observación.
- Iniciar desde los pesos de la etapa 3; añadir la rama de observación F/T a la red
- Recoger con el [sensor F/T de muñeca]
T3 ) a 100 Hz junto con la visión a 30 Hz - Incluye demostraciones de recuperación del 20%: enfoque desalineado, corrección mediante retroalimentación de la fuerza
- Evaluación: 100 ensayos, objetivo de éxito > 80%
Total con plan de estudios: 3,350 demostraciones. Total sin plan de estudios: 10.000-20.000 demostraciones. Ahorro de costos en $40/demo: $266K- $666K ahorrados.
Metricas de evaluación en cada etapa
Cada etapa del plan de estudios requiere métricas de evaluación específicas más allá de un simple éxito/fallo.
| Metric | What It Measures | Target | Stage Applicability |
|---|---|---|---|
| Success rate | Binary task completion | 75-95% (by stage) | All stages |
| Trayectoria smoothness (jerk) | Third derivative of joint positions; lower = smoother | <2x demonstration average | L1-L3 |
| Positional accuracy | End-effector error at target pose | <5 mm for L1-L2, <2 mm for L3-L4 | L1-L4 |
| Episodio duration variance | Consistency of task execution timing | CV < 0.3 | L2-L5 |
| Force regulation error | Deviation from target contact force | +/- 1 N of target | L4-L5 only |
| Bimanual sync error | Timing offset between left and right arm actions | <50 ms | L5 only |
| Generalización gap | Success rate on held-out object positions vs. training positions | <10% drop | L2-L5 |
Cargar todos los datos de evaluación a la [plataforma de datos del RCSV]
Ejemplo de descomposición de habilidades
Consideremos una tarea de apilamiento de tazas (L3): recoger una taza y apilarla en una segunda taza.
- Habilidad de acercamiento: Mover el efector final a menos de 2 cm de la zona de maniobra de la taza, con el ángulo de acercamiento correcto.
- Habilidad de agarre: Aprigue el agarre en la taza desde la posición de alcance, verifique el éxito del agarre a través de la retroalimentación de la posición del agarre.
- ** Habilidad de colocación:** Bajar la copa en la copa objetivo, alinear los centros, liberar el agarre. La nueva habilidad en la pila de copas. Requiere 300-500 demostraciones con alcance + apretamiento previo. Sin previo entrenamiento: 1.500-2.500 demostraciones.
Total con plan de estudios: 450-800 demostraciones. Total sin plan de estudios: 2.000-5.000 demostraciones. El plan de estudios reduce los requisitos de datos en 4-6 veces para esta tarea.
Transfiere el aprendizaje entre las tareas
Las arquitecturas políticas modernas comparten un codificador visual en todo el espacio de observación. Este codificador aprende a extraer características relevantes para tareas de las imágenes. Cuando entrenas al codificador en una variedad de tareas a través del currículo, desarrolla representaciones más ricas que se transfieren más eficazmente a tareas nuevas.
- Codificador visual compartido: Entrenar un único encoder ResNet-18 o ViT-small en todas las tareas del currículo conjuntamente. Este encoder aprende características como " borde de objeto ", " proximidad del pegatín " y " contacto de agarre " que son útiles en muchas tareas.
- 3x eficiencia de muestra con el plan de estudios: Empiricamente, un codificador visual pre-entrenado en el plan de estudios reduce el requisito de demostración para una nueva tarea L3 de 2.000 demostraciones a aproximadamente 600-700 demostraciones
aproximadamente una mejora de 3x en la eficiencia de muestra. - ** Estrategia de ajuste preciso:** Para una nueva tarea, congelar los pesos del codificador del currículo (o utilizar una baja tasa de aprendizaje) y entrenar solo al decodificador de acción en las demostraciones de la nueva tarea. Esto evita el olvido catastrófico de las habilidades anteriores mientras se aprende la nueva tarea.
Cuándo saltar el plan de estudios
El diseño de los planes de estudios toma tiempo y sólo vale la pena realizar tareas complejas.
- Tascas L1-L2: ir directo. Las tareas simples de un solo paso o de múltiples pasos pueden ser entrenadas de extremo a extremo en 100 a 1.000 demostraciones.
- Tascas L3: dependiente de la situación. Si usted tiene una clara descomposición de habilidades y ya tiene datos de habilidades primitivas de otro proyecto, utilice el plan de estudios.
- Tascas L4-L5: el plan de estudios es esencial. Intentar entrenar desde cero tareas de ensamblaje o de ensamblaje bien informados directamente sin plan de estudios es costoso y generalmente no tiene éxito.
- Utilizando VLAs pre-entrenados: Si está ajustando un modelo de acción del lenguaje de visión pre-entrenado (RT-2, Octo, pi-0), el modelo ya tiene conocimientos previos significativos.
Orden de recogida de datos
Recoger datos en orden de currículo
- Recolectar datos L1 primero: Entrenar las políticas L1 a un éxito de >95%. Estas políticas pueden ahora recopilar de forma autónoma las trayectorias de aproximación para la recopilación de datos L2/L3 (el operador corrige cerca de contacto, no el enfoque completo).
- Utilizar políticas formadas para el aumento de datos: Una política de alcance formada puede ejecutar de forma autónoma la fase de aproximación mientras que un operador humano realiza una teleoperación desde la fase de captura en adelante. Esto reduce la carga cognitiva del operador y produce demostraciones más consistentes.
- ** Priorizar la coherencia sobre la velocidad en las primeras etapas:** Las demostraciones L1 y L2 deben ejecutarse lentamente y deliberadamente.
- Entrenamiento y recogida de intercalas: Después de cada 100-200 demostraciones, entrenar un punto de control y evaluar.Si la política se está desestabilizando, recoger demostraciones más diversas (nuevas posiciones de objetos, condiciones de iluminación) en lugar de simplemente más de lo mismo.
Lista de control de diseño del currículo
- Definir con precisión la tarea objetivo final y sus criterios de éxito
- Descompone en 3-5 etapas del plan de estudios desde L1 hasta el nivel objetivo
- Especifique el presupuesto de las demostraciones por etapa (utilice la tabla de escalación anterior)
- Definir las métricas de evaluación y los umbrales de avance para cada etapa
- Inyección de fallas de plan en 10-20% para las etapas L2 y superiores
- Configurar la [plataforma de datos]
T5 ) para el seguimiento por etapa antes de comenzar la recogida - Se asignará el 20% del presupuesto como reserva para las etapas que necesiten más demostraciones de las previstas
- Plan de estrategia de transferencia de peso del codificador (congelamiento vs. ajuste fino) entre etapas
- Formación del operador de horarios sobre los requisitos específicos de las tareas antes de cada etapa
- Establecer una cadencia de revisión: evaluar el punto de control cada 200 demostraciones, no sólo al final de la etapa
Guías relacionados
- [Guía del comprador de servicios de recogida de datos de robots]
T6 ) evaluación de proveedores de datos para proyectos de escala curricular - [Guía de formatos de datos (HDF5/RLDS/LeRobot)
T7 ) garantizar que los datos del plan de estudios se almacenen en formatos compatibles - Configuración de hardware de teleoperación bimanual
hardware para las tareas del currículo L5 - [Recrutación y capacitación de operadores]
T9 ) Construir el equipo para ejecutar su plan de estudios - [Guía de selección de sensores de fuerza/torque]
T10 ) añadir sensores de F/T para las etapas del currículo L4+ - [Cómo establecer un laboratorio de teleoperación]
T11 ) Infraestructura de laboratorio para la recopilación de datos
Trabajar con el RCSV
RCSV proporciona diseño y ejecución de currículos de extremo a extremo para proyectos de aprendizaje robótico.
- Consultamiento del plan de estudios: Revisamos su tarea objetivo, proponemos una estructura del plan de estudios y estimamos los presupuestos de demostración antes de que comience cualquier recopilación de datos.
- ** Ejecución de la recopilación de datos:** Nuestros operadores certificados en las instalaciones [San Francisco, CA] (
T12 ) y [Allston, MA] ( T13 ) recopilan datos de la etapa del plan de estudios en [OpenArm 1] ( T14 ), el bimanual DK1, Unitree G1 y 5+ plataformas de brazo adicionales. - Integración de la plataforma: Todos los datos recogidos se subencargan a la plataforma de datos del RCSV con métricas por etapa, tableros de evaluación y exportación de formato a HDF5/LeRobot/RLDS.
- ** Alquiler de hardware:** ¿Necesita hardware para la ejecución del currículo interno? [Robots de alquiler]
Construye su conjunto de datos de capacitación
RCSV Data Services proporciona infraestructura de recopilación de datos, capacitación de los operadores y análisis de calidad de los conjuntos de datos para los equipos de aprendizaje de robots.
[Explorar los Servicios de Datos] [







