Volver a Blog

Políticas de robots con cero disparos versus pocos disparos: establecer expectativas realistas

Una evaluación honesta del rendimiento de la política de robots de cero disparos y pocos disparos en 2025 <unk> lo que es alcanzable, en qué tareas, y lo que todavía es un gran éxito.

[← Blog]

La robótica de tiro cero es real para tareas simples, en condiciones controladas, con objetos en distribución. Aquí está la imagen completa.

Definiciones

Zero-shot significa ejecutar una nueva tarea o manejar un nuevo objeto sin nuevas demostraciones el robot depende enteramente de lo que aprendió durante el entrenamiento previo. Few-shot significa adaptarse a una nueva tarea con 5-50 nuevas demostraciones. Estas son capacidades significativamente diferentes, y la combinación de ellas conduce a una planificación poco realista.

La realidad actual para la toma de cero

Los modelos de base para la manipulación de robots OpenVLA, Octo, RT-2 han demostrado una capacidad genuina de tiro cero en tareas simples dentro de su distribución de capacitación.

  • Detección de objetos de vocabulario abierto + planificación simple de arriba hacia abajo de la captura de trabajo de cero-choque para ~60% de los objetos domésticos comunes presentados en orientación vertical en una superficie clara
  • La navegación con condiciones de lenguaje en entornos explorados previamente funciona con cero impacto con ~75% de éxito en configuraciones estructuradas
  • El pick-and-place con categorías de objetos familiares (mugs, botellas, bloques) logra un éxito de 50-65% con OpenVLA en benchmarks estándar

Cuando el tiro cero no sea fiable: tareas de precisión que requieren una colocación de menos de 5 mm, manipulación hábil, uso de herramientas novedosas, tareas en las que el objeto posee un aspecto no canónico (botellas inclinadas, tazas apiladas) y cualquier tarea que implique objetos deformables no bien representados en los datos de entrenamiento.

La mejor sintonía de pocos disparos: la capacidad más práctica

La mejor ajuste de pocas veces (20-100 demostraciones en una nueva tarea) es donde los modelos de base muestran su valor práctico más claro.

Training Approach Demos Required Typical Success Rate Time to Train
Foundation model, zero-shot 0 30–65% (simple tasks) N/A
Foundation model + 20 demo fine-tune 20 70–80% 30 min GPU
Foundation model + 100 demo fine-tune 100 80–90% 2 hr GPU
Train from scratch (ACT) 500 75–88% 3–4 hr GPU
Train from scratch (Diffusion) 1000 82–92% 8–12 hr GPU

La ventaja del modelo de base es más pronunciada en el régimen de datos bajos (menos de 100 demostraciones). Con 20 demostraciones, un modelo de base ajustado logra tasas de éxito comparables a la formación de ACT desde cero en 500 demostraciones.

Donde el tiro cero realmente funciona hoy

  • Pictura estructurada con detección de objetos clara: Detección de vocabulario abierto de estilo DETIC + GraspNet + planificador de captura simple funciona de forma sin salida para objetos regulares en contenedores organizados.
  • Navigation con lenguaje en espacios conocidos: Los modelos VLN (Vision-Language Navigation) trabajan con cero impacto en espacios que han sido entrenados para entender, con una buena generalización a espacios de la misma disposición en diferentes edificios.
  • Reconocimiento y clasificación de objetos por categoría: La clasificación con condiciones lingüísticas ("poner los elementos rojos en la caja izquierda") funciona de forma zero-shot para las categorías conocidas con clasificación RGB.

Donde no lo hace (aún así)

  • ** Manipulación rica en contactos:** Conectores de agujero, conectores de snap, tejido plegable, tazas de desempalamiento Las tasas de éxito de tiro cero son del 10 al 30% para los modelos de fundación actuales.
  • ** Uso de herramientas novedosas:** El uso de una herramienta desconocida (un abrilledor de lata, un destornillador específico) no es todavía fiable.
  • ** Manipulación externa:** Re-agarrar de la mano, rotación de objetos utilizando el control de dedos fuera de la capacidad de disparos cero de corriente para todos los modelos de producción.

Resultados de referencia del modelo de la Fundación (2025-2026)

Model Provider Zero-Shot (SimplerEnv) 20-Shot Fine-Tune Parameters
OpenVLA Stanford/TRI 48-62% 72-80% 7B
Octo Berkeley 35-55% 65-78% 93M
pi-0 Physical Intelligence 55-70% 78-88% 3B
RT-2-X Google DeepMind 50-65% 75-85% 55B
ACT (from scratch) Stanford N/A 40-55% (20 demos) 12M

Estos números representan el rendimiento en puntos de referencia de manipulación simples (pick-place, apertura de cajón, pulsación de botones) en entornos de laboratorio controlados.

Curvas de eficiencia de datos de pocos disparos

La información más valiosa para los profesionales es cómo se escala el rendimiento con el número de demostraciones de ajuste fino.

  • ** 5 demostraciones:** Los modelos de la fundación muestran una mejora del 5-15% respecto a los de cero disparos. El entrenamiento desde cero produce políticas poco fiables. La ventaja del modelo de la fundación es mayor aquí - aproximadamente 10 veces más eficiente en datos que el entrenamiento desde cero.
  • ** 20 demostraciones:** El punto ideal para el ajuste del modelo de fundación. La mayoría de los modelos alcanzan en este punto el 70-80% de su rendimiento final.
  • 50 demostraciones: Los modelos de la Fundación se acercan a su límite máximo (80-88%). Los modelos de formación de arranque cerran la brecha, alcanzando el 60-75% con datos bien recogidos. La diferencia de costes es significativa: 50 demostraciones cuestan 200-500 dólares a tasas RCSV frente a los meses de cálculo pre-entrenamiento invertidos en el modelo de la Fundación.
  • 100 demostraciones: El ajuste del modelo de base alcanza rendimientos disminuyentes para la mayoría de las tareas. Los modelos entrenados en arranque se adelantan aún más (75-85%).
  • ** 500 demostraciones:** ACT y Política de difusión entrenados a partir de rasguños suelen coincidir o superar los modelos de base ajustados.

Cuándo utilizar cuál enfoque: Matriz de decisión

Scenario Recommendation Why
Quick feasibility test, simple task Zero-shot with OpenVLA/pi-0 No data cost; instant evaluation
New task, limited budget (<$2K data) Foundation model + 20-50 demo fine-tune Maximum performance per dollar
Production deployment, single task ACT/Diffusion from scratch, 300-500 demos Smaller model = faster inference, simpler deployment
Multi-task deployment (10+ tasks) Foundation model + per-task fine-tuning Shared backbone amortizes model cost
Precisión task (sub-2mm tolerance) Scratch Diffusion Policy, 500+ demos Foundation models lack precision for tight tolerances
Edge compute (Jetson, no GPU server) Small model from scratch (ACT 12M params) 7B VLA models cannot run on edge devices

La brecha en el cuerpo: por qué el tiro cero es más duro de lo que parece

El rendimiento de cero disparos en la PNL mejora confiablemente con la escala del modelo: un modelo de lenguaje 70B es consistentemente mejor en tareas de texto de cero disparos que un modelo 7B. La misma relación de escala no se aplica a los modelos de base de robots, y entender por qué es fundamental para establecer expectativas realistas.

El desafío fundamental es la brecha de encarnación: a diferencia del texto (que tiene una tokenización universal), las acciones de los robots son específicas de la encarnación. Un comando de velocidad conjunta de 7 DOF para un Franka Research 3 no tiene sentido para un OpenArm de 6 DOF o un manipulador móvil con una cadena cinemática diferente. Los modelos de base actuales manejan esto a través de la normalización del espacio de acción (mapear a todos los robots a una representación compartida de 7-DOF, que pierde información para los robots con más o menos DOF) o cabezas de salida específicas de la realización (que requieren al menos algunas demostraciones en la realización objetivo para calibrar la cabeza de salida).

Esto significa que "marca cero" en una nueva realización de robot es funcionalmente imposible con las arquitecturas actuales - siempre se necesita al menos un paso de calibración. La capacidad de tiro cero que funciona hoy es tiro cero para ** nuevas tareas en la misma realización** en la que el modelo fue entrenado.

La brecha de percepción es el segundo gran desafío. Los modelos de la base se entrenan en conjuntos de datos recogidos en laboratorios específicos con cámaras, iluminación y fondos específicos. Cuando se despliegan en un nuevo entorno con diferentes condiciones visuales, las representaciones del codificador visual cambian, degradando el rendimiento de las políticas. Es por eso que los números de tiro cero publicados (recolectados en laboratorios similares a los datos de entrenamiento) son de 10-20 puntos porcentuales más altos que los números del mundo real. La aleatorización de dominios durante el entrenamiento y el pre-entrenamiento del lenguaje de visión ayudan ambos, pero ninguno cierra completamente esta brecha hoy.

La brecha de distribución de la acción. Las diferentes tareas tienen distribuciones de acción fundamentalmente diferentes - pick-and-place implica eventos discretos de captura/liberación, mientras que el borrado implica mantenimiento continuo del contacto. Un modelo de base entrenado principalmente en datos de pick-and-place tendrá un rendimiento de cero-shot pobre en tareas ricas en contacto incluso si la comprensión visual se transfiere perfectamente. Es por esto que la diversidad de tareas en los datos pre-entrenamiento es más importante que el tamaño del conjunto de datos para la generalización de captura cero.

Comparación de costes de inferencia y latencia

Un factor que a menudo se pasa por alto en la discusión de disparos cero vs pocos disparos: el costo de inferencia de ejecutar modelos de base en producción. Un modelo VLA de parámetro 7B requiere una GPU dedicada para la inferencia (A10G mínimo, ~ $ 0.75 / hora en la nube) e introduce una latencia de 100-300 ms por acción. Un modelo ACT de parámetro 12M se ejecuta en un Jetson Orin Nano de $ 200 a 5-15 ms por acción.

Para el despliegue a escala (10+ robots), el costo de inferencia de GPU de los modelos de base puede superar los $50,000/año, potencialmente más que el costo de recopilar datos suficientes para entrenar modelos específicos de tareas más pequeñas. Este es el argumento económico contraintuitivo: invertir en la recopilación de datos (un costo único) puede ser más barato que pagar costos de inferencia continuos para los modelos de base.

Guía práctica

Planar 200-500 demostraciones para cualquier nueva tarea, incluso con modelos de base. El rendimiento de cero disparos es una ventaja a medir, no una línea de base a asumir. Si cero disparos logra más del 60% de éxito en su tarea, considere que usted es antes de lo previsto. Si logra el 30%, continúe con su recopilación de datos de ajuste fino planificado.

El equipo de RCSV [servicios de datos]T1 puede evaluar su tarea específica para la viabilidad de la toma cero y recomendar un presupuesto realista de demostración antes de comprometerse con un cronograma de recolección.

Lectura relacionada

  • [Guía de decisión sobre aprendizaje por imitación]T2) -- La decisión de enfoque de formación más amplia que precede la pregunta cero/cualquier tiro
  • Desglose de los costes de la recopilación de datos de robots -- Planificación presupuestaria para las demostraciones que necesitará para la ajuste fina
  • [Guía de LeRobot]T4) -- Formación en el ACT y en la política de difusión para los enfoques de poca velocidad y desde cero
  • [¿Qué hace buenos datos de entrenamiento de robots?] T5) -- Maximizar el valor de cada demostración en regímenes de bajos datos
  • [AI encarnada explicada simplemente] T6) -- Modelos de fundación y su papel en la IA física
  • Plataforma RCSV -- Infraestructura de gestión de conjuntos de datos y formación de modelos
  • [Servicios de datos] T8) -- Recopilar las 20-500 demostraciones que necesita para el ajuste fino

Obtenga un presupuesto realista de datos para su tarea

El RCSV puede evaluar su tarea para determinar la viabilidad de la prueba de cero disparos y de pocos disparos y recomendar el volumen de demostración adecuado.

[Habla con nuestro equipo]