Eficiencia de muestra en el aprendizaje de políticas de robots: ¿Cuántos demos realmente necesitas?
Análisis de la eficiencia de la muestra de demostración en las tareas, algoritmos y tipos de robots <unk> con orientación práctica para presupuestar su recopilación de datos.
[← Investigación]
El error de evaluación de los requisitos de muestras es la causa más común de los programas de aprendizaje robótico fallidos y es completamente prevenible.
El problema de la eficiencia de las muestras
¿Cuántas demostraciones se necesitan para entrenar una política robótica? La respuesta honesta es: depende
Este análisis sintetiza los resultados empíricos de los trabajos publicados sobre aprendizaje de robots y los programas internos de recolección del RCSV para dar orientación práctica sobre el presupuesto de demostración.
Datos empíricos: demos requeridos por algoritmo y tarea
Los siguientes rangos provienen de resultados publicados con protocolos de evaluación estandarizados. "Tasa de éxito" se refiere a la métrica de tarea primaria reportada en cada trabajo.
| Algorithm | Task Type | Demos for ~70% SR | Demos for ~85% SR | Notes |
|---|---|---|---|---|
| Behavioral Cloning (ResNet) | Simple single-object grasp | 50–100 | 150–200 | Plateaus early; limited generalization |
| ACT (Action Chunking) | Bimanual pick-and-place | 50–150 | 200–500 | Strong for precise, short-horizon tasks |
| Diffusion Policy | Precisión assembly | 200–500 | 800–2000 | Best for multi-modal behavior |
| Foundation model fine-tune | Novel grasp variants | 20–100 | 200–500 | Requires pretrained visual encoder |
| OpenVLA fine-tune | Language-conditioned manipulation | 50–200 | 300–800 | Generalizes across objects with diverse data |
| From-scratch VLA | Broad manipulation suite | 20,000+ | 50,000+ | Not practical per-task; amortized across tasks |
El ajuste del modelo de base (desde un VLA o codificador visual preentrenado) es 3
Multiplicadores de las dificultades de tarea
Las cifras anteriores suponen la dificultad de tarea de nivel 1. Las tareas reales casi nunca son de nivel 1. Aplique estos multiplicadores para estimar los requisitos de demostración para su tarea específica:
| Level | Task Description | Demo Multiplier | Example |
|---|---|---|---|
| L1 | Simple, fixed-position, single object | 1× | Pick block from fixed location |
| L2 | Variable position/orientation, single object | 2–5× | Pick block from random position in 10cm radius |
| L3 | Multi-step, 2–3 subtasks | 5–20× | Pick block, place on target, press confirm button |
| L4 | Contact-rich, precision required | 20–100× | Peg insertion, drawer opening, plug connection |
| L5 | Deformable objects or bimanual dexterous | 100×+ | Fold cloth, bimanual tool use |
Una tarea que parece "grabar fácilmente" pero requiere trabajar en 50 tipos de objetos diferentes con una geometría variada es una tarea L2
Comparación de eficiencia del algoritmo
| Algorithm | Relative Eficiencia de Muestreo | Inference Speed | Best For |
|---|---|---|---|
| BC-RNN | Low (1×) | Fast (< 5ms) | Simple tasks, constrained compute |
| ACT | High (5–10×) | Medium (10–20ms) | Precise bimanual, short-horizon |
| Diffusion Policy | Medium (3–7×) | Slow (50–200ms) | Multi-modal, contact-rich |
| π0 / foundation model fine-tune | Very high (10–20×) | Slow (100–500ms) | Broad generalization, novel objects |
| From-scratch CNN-MLP | Very low (0.5×) | Very fast (< 2ms) | Constrained robots, simple tasks only |
Guía práctica de presupuesto
Un enfoque sistemático de la presupuestación de demostraciones antes de comprometerse con un programa de cobro completo:
- ** Paso 1
Colección piloto:** Recoger exactamente 200 demostraciones. Este es el conjunto de datos mínimo viable para cualquier tarea no trivial con un algoritmo moderno. - ** Paso 2
Entrenamiento y medida:** Entrenamiento de su algoritmo objetivo en las 200 demostraciones. Medir la tasa de éxito en un conjunto de evaluación de al menos 50 ensayos. - ** Paso 3
Aprendizaje de la extrapolación de la curva:** Si 200 demos le dan una tasa de éxito de S% y su objetivo es T%, ajuste una curva logarítmica para estimar el total de demos necesarios. - ** Paso 4
Reevaluación del algoritmo:** Si su tasa de éxito de 200 demostraciones es inferior al 40%, considere cambiar los algoritmos o agregar un codificador visual pre-entrenado antes de invertir en más datos. Una señal débil en 200 demostraciones suele indicar una incompatibilidad entre algoritmo y tarea, no un problema de cantidad de datos. - ** Paso 5
Presupuesto para el volante:** Planifique la recolección inicial en 50 60% del requerimiento total estimado. Reserve el presupuesto restante para la recolección dirigida al fracaso después del despliegue inicial. Los datos dirigidos al fracaso son 2 5 veces más eficientes que la recolección aleatoria para cerrar la brecha de rendimiento final.
La disminución de los retornos: la rodilla de la curva de aprendizaje
Cada curva de aprendizaje tiene una " rodilla "
Por debajo de la rodilla, cada nuevo lote de 100 demostraciones produce una mejora del 3
Esto tiene una implicación directa para la gestión del programa: si su tasa de éxito es superior al 85% y su objetivo es del 90%, está operando por encima de la rodilla.
En las tareas en las que se requiere más del 90% (manipulación crítica de la seguridad, montaje de dispositivos médicos), el coste del 5
Los servicios de recopilación de datos de RCSV incluyen la estimación de la curva de aprendizaje como parte de cada inicio de programa. Nuestra plataforma [Fearless Platform]
Obtenga un presupuesto estimado para su tarea
El equipo de ciencia de datos del RCSV proporciona estimaciones de presupuesto gratuitas para nuevas aplicaciones de aprendizaje de robots
[Pedir una estimación de datos]







