Volver a Research

Eficiencia de muestra en el aprendizaje de políticas de robots: ¿Cuántos demos realmente necesitas?

Análisis de la eficiencia de la muestra de demostración en las tareas, algoritmos y tipos de robots <unk> con orientación práctica para presupuestar su recopilación de datos.

[← Investigación]

El error de evaluación de los requisitos de muestras es la causa más común de los programas de aprendizaje robótico fallidos y es completamente prevenible.

El problema de la eficiencia de las muestras

¿Cuántas demostraciones se necesitan para entrenar una política robótica? La respuesta honesta es: depende y el rango abarca cuatro órdenes de magnitud. Si se evalúa incorrectamente esto antes de iniciar un programa de recopilación de datos, se producen dos modos de falla: subrecopilación (la política nunca se converge) o sobrerecopilación (el presupuesto se desperdicia en datos redundantes).

Este análisis sintetiza los resultados empíricos de los trabajos publicados sobre aprendizaje de robots y los programas internos de recolección del RCSV para dar orientación práctica sobre el presupuesto de demostración.

Datos empíricos: demos requeridos por algoritmo y tarea

Los siguientes rangos provienen de resultados publicados con protocolos de evaluación estandarizados. "Tasa de éxito" se refiere a la métrica de tarea primaria reportada en cada trabajo.

Algorithm Task Type Demos for ~70% SR Demos for ~85% SR Notes
Behavioral Cloning (ResNet) Simple single-object grasp 50–100 150–200 Plateaus early; limited generalization
ACT (Action Chunking) Bimanual pick-and-place 50–150 200–500 Strong for precise, short-horizon tasks
Diffusion Policy Precisión assembly 200–500 800–2000 Best for multi-modal behavior
Foundation model fine-tune Novel grasp variants 20–100 200–500 Requires pretrained visual encoder
OpenVLA fine-tune Language-conditioned manipulation 50–200 300–800 Generalizes across objects with diverse data
From-scratch VLA Broad manipulation suite 20,000+ 50,000+ Not practical per-task; amortized across tasks

El ajuste del modelo de base (desde un VLA o codificador visual preentrenado) es 310x más eficiente en la muestra que el entrenamiento desde cero en la misma tarea. Si su tarea tiene alguna similitud visual con las tareas cubiertas por Open X-Embodiment o modelos derivados de OXE, el ajuste fino es casi siempre el punto de partida correcto.

Multiplicadores de las dificultades de tarea

Las cifras anteriores suponen la dificultad de tarea de nivel 1. Las tareas reales casi nunca son de nivel 1. Aplique estos multiplicadores para estimar los requisitos de demostración para su tarea específica:

Level Task Description Demo Multiplier Example
L1 Simple, fixed-position, single object Pick block from fixed location
L2 Variable position/orientation, single object 2–5× Pick block from random position in 10cm radius
L3 Multi-step, 2–3 subtasks 5–20× Pick block, place on target, press confirm button
L4 Contact-rich, precision required 20–100× Peg insertion, drawer opening, plug connection
L5 Deformable objects or bimanual dexterous 100×+ Fold cloth, bimanual tool use

Una tarea que parece "grabar fácilmente" pero requiere trabajar en 50 tipos de objetos diferentes con una geometría variada es una tarea L2L3, no L1. La mayoría de las tareas de manipulación industrial son L2L3.

Comparación de eficiencia del algoritmo

Algorithm Relative Eficiencia de Muestreo Inference Speed Best For
BC-RNN Low (1×) Fast (< 5ms) Simple tasks, constrained compute
ACT High (5–10×) Medium (10–20ms) Precise bimanual, short-horizon
Diffusion Policy Medium (3–7×) Slow (50–200ms) Multi-modal, contact-rich
π0 / foundation model fine-tune Very high (10–20×) Slow (100–500ms) Broad generalization, novel objects
From-scratch CNN-MLP Very low (0.5×) Very fast (< 2ms) Constrained robots, simple tasks only

Guía práctica de presupuesto

Un enfoque sistemático de la presupuestación de demostraciones antes de comprometerse con un programa de cobro completo:

  • ** Paso 1 Colección piloto:** Recoger exactamente 200 demostraciones. Este es el conjunto de datos mínimo viable para cualquier tarea no trivial con un algoritmo moderno.
  • ** Paso 2 Entrenamiento y medida:** Entrenamiento de su algoritmo objetivo en las 200 demostraciones. Medir la tasa de éxito en un conjunto de evaluación de al menos 50 ensayos.
  • ** Paso 3 Aprendizaje de la extrapolación de la curva:** Si 200 demos le dan una tasa de éxito de S% y su objetivo es T%, ajuste una curva logarítmica para estimar el total de demos necesarios.
  • ** Paso 4 Reevaluación del algoritmo:** Si su tasa de éxito de 200 demostraciones es inferior al 40%, considere cambiar los algoritmos o agregar un codificador visual pre-entrenado antes de invertir en más datos. Una señal débil en 200 demostraciones suele indicar una incompatibilidad entre algoritmo y tarea, no un problema de cantidad de datos.
  • ** Paso 5 Presupuesto para el volante:** Planifique la recolección inicial en 5060% del requerimiento total estimado. Reserve el presupuesto restante para la recolección dirigida al fracaso después del despliegue inicial. Los datos dirigidos al fracaso son 25 veces más eficientes que la recolección aleatoria para cerrar la brecha de rendimiento final.

La disminución de los retornos: la rodilla de la curva de aprendizaje

Cada curva de aprendizaje tiene una " rodilla " el punto de inflexión más allá del cual los retornos marginales caen drásticamente. En nuestros datos empíricos en más de 30 programas de recopilación, la rodilla aparece consistentemente en 7080% de la tasa de éxito máxima empírica de la tarea.

Por debajo de la rodilla, cada nuevo lote de 100 demostraciones produce una mejora del 38% en la tasa de éxito.

Esto tiene una implicación directa para la gestión del programa: si su tasa de éxito es superior al 85% y su objetivo es del 90%, está operando por encima de la rodilla.

En las tareas en las que se requiere más del 90% (manipulación crítica de la seguridad, montaje de dispositivos médicos), el coste del 510% final de rendimiento es frecuentemente mayor que el coste de alcanzar el 85%.

Los servicios de recopilación de datos de RCSV incluyen la estimación de la curva de aprendizaje como parte de cada inicio de programa. Nuestra plataforma [Fearless Platform] T2) rastrea su curva de aprendizaje en tiempo real, marcando automáticamente cuando cruza la rodilla y activando el modo de recopilación dirigido al fracaso.

Obtenga un presupuesto estimado para su tarea

El equipo de ciencia de datos del RCSV proporciona estimaciones de presupuesto gratuitas para nuevas aplicaciones de aprendizaje de robots incluyendo recomendaciones de algoritmos y proyecciones de curvas de aprendizaje.

[Pedir una estimación de datos]