Leyes de escala para el aprendizaje de robots: lo que sabemos en 2026
¿Se aplican las leyes de escalado al aprendizaje robótico? Evidencias de Open X-Embodiment, RT-X, DROID, y implicaciones prácticas para la recopilación de datos, el tamaño del modelo y los presupuestos de computación en 2026.
[← Blog]
El aprendizaje robótico tiene su propia dinámica de escala, y difieren de los modelos de lenguaje en formas que importan en cómo asignas tu presupuesto de recopilación de datos, eliges tu tamaño de modelo y planificas tu infraestructura computacional.
Qué son las leyes de escala y por qué son importantes
Las leyes de escalación describen la relación predecible entre las entradas de recursos (datos, computación, parámetros del modelo) y el rendimiento del modelo. En los modelos de lenguaje grande, el documento de Chinchilla (Hoffmann et al., 2022) estableció que la capacitación óptima requiere la escalación del tamaño del modelo y el tamaño del conjunto de datos en proporción: duplicar los parámetros sin duplicar los datos produce un modelo subóptimo. Este marco ha permitido a los equipos de gestión de recursos de manera de principio asignar presupuestos y predecir el rendimiento antes de comprometerse con los recursos.
El valor práctico de las leyes de escala no es académico. Te dicen si gastar otros $ 100,000 en la recopilación de datos o en un grupo de GPU más grande producirá más mejora de la capacidad. Te dicen cuando tu enfoque actual ha alcanzado un techo y necesita un cambio estructural en lugar de más recursos. Y te dicen si la trayectoria en la que estás alcanzará tu objetivo de rendimiento, o si necesitas un enfoque fundamentalmente diferente.
La pregunta central para la robótica: ¿se aplican leyes similares, y si es así, qué predice? Para 2026, tenemos suficiente evidencia empírica para dar una respuesta matizada pero accionable.
Cómo la escalación de robots difiere de la escalación de modelos de lenguaje
Antes de examinar las pruebas, es importante entender por qué las leyes de escala de aprendizaje robótico no pueden ser una simple copia de la dinámica de escala de LLM. Tres diferencias estructurales cambian fundamentalmente el juego.
La recopilación de datos es costosa y lenta. Los datos de capacitación de LLM (texto de Internet) no cuestan esencialmente nada para adquirir - el cuello de botella es computación. Los datos de demostración de robots cuestan $5-50 por episodio para recoger (tiempo del operador, desgaste de hardware, garantía de calidad), y el rendimiento de la recopilación está limitado por el número de estaciones físicas de robots disponibles. Esto invierte el problema de optimización: para el aprendizaje robótico, la pregunta no es "¿cuánto cálculo podemos permitir?" sino "¿cuánto datos diversos podemos permitirnos recopilar?"
La distribución de datos es multimodal y está vinculada a la física. Los datos del modelo de formación del lenguaje se muestran a partir de una distribución relativamente uniforme (texto en Internet). La política debe aprender a mapear desde este espacio de entrada de alta dimensión a comandos motores que son físicamente válidos. Agregar más texto a un LLM siempre ayuda; agregar más demostraciones a una política de robot sólo ayuda si esas demostraciones cubren nuevas regiones del espacio de entrada.
La evaluación se basa físicamente. El rendimiento del LLM se puede evaluar en referencia de texto en escala. El rendimiento de la política del robot solo se puede evaluar verdaderamente ejecutando la política en hardware físico, que es lento, caro y sujeto a variabilidad de hardware. Esto dificulta la caracterización precisa de las curvas de escala y introduce el ruido en mediciones empíricas.
La evidencia: el cuerpo X abierto y el RT-X
El proyecto Open X-Embodiment (Padalkar et al., 2023) reunió más de 1 millón de episodios de manipulación de robots de 22 diferentes encarnaciones de robots en 33 instituciones de investigación.
El resultado clave fue sorprendente: RT-2-X, capacitado en el conjunto completo de datos de múltiples encarnaciones, superó las políticas de especialistas en robots únicos en aproximadamente un 50% en tareas de generalización prolongadas. Esto demostró que los datos de diferentes tipos de robots no son solo ruido para el modelo; contiene conocimientos de manipulación transferibles que mejoran la generalización a nuevos robots y nuevas tareas. La escala no era suave y predecible como las curvas de escala de LLM, pero la dirección era clara y consistente.
Más específicamente, los resultados de RT-X revelaron una jerarquía de lo que se transfiere. La comprensión de la escena visual se transfiere más fácilmente a través de las realizaciones. Los conceptos de tareas de alto nivel (pick, lugar, abierto, cerrado) se transfieren moderadamente bien. El control motor de bajo nivel (trajectorias conjuntas específicas, tiempo de contacto preciso) se transfiere mal y aún requiere ajuste fino específico de la realización.
La evidencia: DROID y escala de datos
El conjunto de datos DROID (Khazatsky et al., 2024) es el estudio empírico más completo de la escala de datos para la manipulación de robots. Con 76,000 demostraciones recogidas en 86 laboratorios, 22 tipos de robots y 564 entornos distintos, DROID permitió a los investigadores probar cómo el rendimiento de las políticas se escala con la cantidad de datos y la diversidad de datos de forma independiente.
El resultado crítico: La diversidad de datos mide el rendimiento de manera más confiable que el volumen de datos. Cuando los autores entrenaron ACT y la política de difusión en el aumento de subconjuntos de datos DROID, observaron una mejora constante hasta aproximadamente 10.000 demostraciones, disminución de los rendimientos en 30.000, y casi la meseta en 50.000 para el rendimiento dentro de la distribución. Pero la adición de datos diversos (nuevos entornos, nuevas categorías de objetos) continuó mejorando el rendimiento fuera de distribución mucho después de que la adición de más demostraciones de escenarios ya vistos dejó de ayudar.
Este es un cambio estructural fundamental en relación con la escalación de modelos de lenguaje. Más texto web de la misma distribución continúa mejorando los modelos de lenguaje.
Qué es la buena escala en el aprendizaje de los robots
** Calidad de representación visual.** Los codificadores visuales más grandes (DINOv2-Large vs. DINOv2-Base, SigLIP-400M vs. SigLIP-100M) producen constantemente mejores características visuales para políticas de manipulación. La escalación aquí sigue un patrón familiar de la visión por ordenador: los modelos más grandes aprenden representaciones visuales más ricas y generalizables. Esta es la dinámica de escalación más similar a la LLM en el aprendizaje robótico.
La diversidad de tareas en los datos de pre-entrenamiento. Las políticas pre-entrenadas en más categorías de tareas se generalizan mejor a las nuevas tareas. Cada categoría de tareas adicional añadida a la mezcla de pre-entrenamiento mejora el rendimiento de cero disparos en tareas realizadas, con rendimientos disminuidos pero positivos hasta los límites de los conjuntos de datos actuales (cientos de categorías de tareas).
Transferencia transversal. Agregar datos de tipos de robots adicionales al conjunto de entrenamiento previo mejora la generalización a un nuevo robot objetivo, incluso cuando el robot objetivo es cinemáticamente diferente a cualquier otro robot del conjunto de entrenamiento. El mecanismo es que los diversos datos de realización obligan al modelo a aprender representaciones de manipulación agnóstica de la realización en lugar de sobreajustar a la cinemática de un robot.
Diversidad ambiental. Las políticas formadas en demostraciones de entornos más físicos (espacios diferentes, condiciones de iluminación, superficies de mesa) se generalizan mejor a nuevos entornos de despliegue.
Lo que no se mide tan bien
Manipulación precisa y hábil. Las tareas que requieren una precisión de subcentimetro (filamento, inserción, conducción por tornillo) no mejoran de manera previsible con más datos o modelos más grandes. El cuello de botella no es la calidad de la representación visual o el conocimiento de las tareas; es que la dinámica de contacto precisa es sensible a las propiedades específicas de los objetos (fritación, conformidad, geometría) que varían entre instancias de manera que derrotan la generalización.
** Dinámica de contacto.** Las políticas que necesitan modular la fuerza de agarre basadas en las propiedades de los objetos (frágil vs robusto, rígido vs deformable) muestran una mejora limitada solo con la escalación de datos. Los datos de los sensores de fuerza y par ayudan pero introducen sus propios problemas de cambio de distribución.
** Planificación de tareas de largo horizonte.** Para tareas que requieren más de 10 subtareas secuenciales, las tasas de éxito se escalan mal con los datos. El problema del error de composición significa que incluso una política con un éxito de 95% por paso logra solo un 60% de éxito en una tarea de 10 pasos y un 36% en una tarea de 20 pasos. Las políticas jerárquicas (planificador de alto nivel + habilidades de bajo nivel) mitigan esto, pero la dinámica de escala del planificador de alto nivel es menos bien caracterizada que la escalación de nivel de habilidades.
Los parámetros de los modelos en bruto cuentan para las políticas de ajuste fino. A diferencia de los modelos de lenguaje donde el tamaño más grande es consistentemente mejor, la relación entre el tamaño del modelo y el rendimiento de la manipulación después de la ajuste fino específico de la tarea no es monótona. OpenVLA (7B parámetros) supera a Octo (93M) en tareas de tiro cero, pero ofrece una ventaja disminuida después de la ajuste fino en más de 200 demostraciones específicas de la tarea. Para los equipos con presupuestos dedicados de recopilación de datos, un modelo más pequeño bien ajustado es a menudo más práctico que un modelo más grande ligeramente adaptado.
Por qué la industria está compitiendo por recopilar datos de robots
La evidencia de escalación explica por qué cada gran empresa de robótica y laboratorio de investigación en 2026 está invirtiendo fuertemente en la infraestructura de recopilación de datos de robots del mundo real. Si la diversidad es el cuello de botella, y la diversidad requiere la recopilación de datos en muchos entornos con muchos objetos en muchos robots, entonces la ventaja competitiva se acumula en las organizaciones que pueden generar datos de robots diversos a escala.
Physical Intelligence, Google DeepMind, Toyota Research Institute y varias startups bien financiadas están construyendo o han construido instalaciones de recopilación de datos a gran escala con docenas de estaciones de robots, protocolos de tareas estandarizados y operadores profesionales. La lógica es directa: quien tenga los datos de manipulación de robots más diversos entrenará a los mejores modelos de fundación, y los mejores modelos de fundación requerirán el menor ajuste específico para el cliente para implementarlo.
RCSV ocupa un papel específico en este ecosistema. Proporcionamos infraestructura de recopilación de datos y operadores profesionales a equipos que necesitan datos de manipulación diversos y de alta calidad, pero no quieren construir y dotar de personal sus propias instalaciones de recopilación. Nuestros [servicios de datos]
Lo que esto significa para los laboratorios de investigación
Los laboratorios de investigación académica se enfrentan a un desafío de escala que la industria no tiene. Un laboratorio universitario típicamente tiene 1-3 brazos robóticos, una habitación y un presupuesto limitado para la adquisición de objetos y horas de operador.
- Use modelos de base. Los modelos pre-entrenados (Octo, OpenVLA) proporcionan la base de múltiples encarnaciones y múltiples tareas que un solo laboratorio no puede replicar.
- Maksimalise la diversidad de objetos por dólar. Compre 30 objetos diferentes en una tienda de almacenes en lugar de 3 objetos de precisión caros.
- Recolectar en varias habitaciones. Mover su configuración entre un laboratorio, una cocina y una oficina, aunque sea inconveniente, proporciona diversidad ambiental que mejora dramáticamente la robustez de las políticas.
- Contribuir y dibujar a partir de conjuntos de datos abiertos. Open X-Embodiment, DROID y Bridge V2 son de escala libre que puede agregar a su línea de entrenamiento sin recoger una sola demostración adicional.
Qué significa esto para las empresas
Las empresas que construyen sistemas de robots de producción se enfrentan a un desafío de escala diferente. Típicamente tienen un entorno de implementación específico y una cartera de tareas específica.
- Fase 1: Selección del modelo de la Fundación. Comience con el mejor modelo pre-entrenado disponible para su tipo de robot y dominio de tareas. Esto le da el beneficio de la diversidad de datos a escala de la comunidad sin costo de recolección.
- Fase 2: Ajuste específico. Recoge 200-500 demostraciones de tus tareas específicas en tu entorno de implementación específico.
- Fase 3: Mejoramiento continuo. Implemente la política de mejora y utilice los datos de implementación registrados (con etiquetas de éxito/fallo humanos) para identificar los modos de falla. Recoge datos dirigidos para abordar esos fallos. Aquí es donde el principio de diversidad sobre volumen es más importante: no recopiles datos que ya tienes; recoge datos que cubran las lagunas.
- Fase 4: Escala en diferentes sitios. Cada nuevo sitio de implementación proporciona una diversidad ambiental que mejora la política base. Estructura tu tubería de datos de implementación para que los datos fluyan de todos los sitios de vuelta a un grupo central de capacitación. Esto convierte tu escala de implementación en una ventaja de escala de datos.
Cantidad de datos vs tamaño de modelo vs rendimiento: los números
| Configuration | Model Size | Training Data | In-Distribution Success | OOD Success |
|---|---|---|---|---|
| ACT from scratch | ~30M params | 100 demos | 75-85% | 20-35% |
| ACT from scratch | ~30M params | 500 demos | 88-93% | 35-50% |
| Octo (fine-tuned) | 93M params | OXE + 200 task demos | 85-92% | 45-60% |
| OpenVLA (fine-tuned) | 7B params | OXE + 200 task demos | 88-95% | 55-70% |
| OpenVLA (fine-tuned) | 7B params | OXE + 500 task demos | 92-97% | 60-75% |
El resultado clave de estos números: un modelo de base ajustado con 200 demostraciones específicas de tareas suele coincidir o superar un modelo desde cero con 500 demostraciones, tanto en distribución como fuera de distribución. La ventaja del modelo de base es enteramente en la generalización OOD - proporciona una mejora de 20-30 puntos porcentuales en nuevos objetos y entornos. La ventaja en la distribución es menor (5-10 puntos) y a menudo no es estadísticamente significativa con pequeños conjuntos de evaluación.
Proyecciones de costes: recopilación de datos frente a cálculo
| Resource | 100 Demos | 500 Demos | 2,000 Demos | 10,000 Demos |
|---|---|---|---|---|
| Data collection (RCSV rates) | $2,500 | $6,000 | $18,000 | $65,000 |
| Training compute (ACT, single A100) | $5 (2 hrs) | $10 (4 hrs) | $25 (10 hrs) | $60 (24 hrs) |
| Training compute (OpenVLA fine-tune, 4x A100) | $50 (5 hrs) | $100 (10 hrs) | $300 (30 hrs) | $800 (80 hrs) |
| Data-to-compute cost ratio | 50:1 to 500:1 | 60:1 to 600:1 | 60:1 to 720:1 | 80:1 to 1083:1 |
La relación entre los costes de los datos y los datos para el aprendizaje de robots es dramáticamente diferente de la formación de modelos de lenguaje, donde el cálculo es el costo dominante. En el aprendizaje de robots, la recopilación de datos cuesta 50-1000 veces más que el cálculo para entrenar en esos datos. Esto tiene una implicación estratégica directa: cada dólar marginal debe gastarse en mejorar la calidad y la diversidad de datos, no en modelos más grandes o carreras de formación más largas. Un presupuesto de $5,000 produce más mejora de capacidad cuando se gasta en 200 demostraciones diversas que en 10 veces más computación para entrenar en un conjunto de datos menos diverso.
Puntos de datos de la curva de escala: rendimiento empírico vs tamaño del conjunto de datos
La siguiente tabla recopila los puntos de datos de rendimiento de los trabajos publicados y las evaluaciones internas del RCSV, mostrando cómo la tasa de éxito de tareas se escala con el tamaño del conjunto de datos para diferentes arquitecturas.
| Demo Count | ACT (from scratch) | Diffusion Policy | Octo (fine-tuned) | OpenVLA (fine-tuned) |
|---|---|---|---|---|
| 10 | 15-25% | 10-20% | 40-50% | 45-55% |
| 25 | 30-40% | 25-35% | 55-65% | 60-70% |
| 50 | 55-65% | 45-55% | 70-78% | 72-80% |
| 100 | 72-82% | 65-75% | 82-88% | 84-90% |
| 200 | 82-90% | 78-86% | 86-92% | 88-94% |
| 500 | 88-93% | 85-92% | 90-95% | 92-96% |
| 1000 | 90-94% | 88-94% | 91-95% | 93-97% |
| 2000+ | 91-95% | 90-95% | 92-96% | 94-97% |
Las observaciones clave: (1) El ajuste fino del modelo de base (Octo, OpenVLA) proporciona su mayor ventaja en los recuentos de demostraciones bajos (10-100), donde los antecedentes visuales y de comportamiento pre-entrenados compensan los datos específicos de la tarea limitados. (2) En más de 500 demostraciones, los modelos desde cero cerran la brecha significativamente, y la ventaja de los modelos de base se reduce a 2-5 puntos porcentuales. (3) Todas las arquitecturas muestran un rendimiento decreciente por encima de 500 demostraciones de rendimiento en distribución, reforzando el principio de diversidad sobre volumen. (4) ACT alcanza un rendimiento competitivo con menos demostraciones que la Política de difusión, lo que la convierte en la mejor opción para equipos limitados en datos.
Recomendaciones prácticas por equipo
La evidencia de escala se traduce en orientación concreta dependiendo de sus recursos.
** Investigador / aficionado en solitario (orquesta: < $5,000).** Utilice un modelo de base (Octo). Recoge 50-100 demostraciones en una sola tarea. Concentrese en aprender la tubería de recopilación de datos en lugar de optimizar el rendimiento. Resultado esperado: 70-80% de tasa de éxito en condiciones de distribución, 30-40% OOD. Esto es suficiente para un prototipo o demostración de investigación. Hardware: OpenArm 1 ($4,500) o arrendado a través de RCSV.
Larbado de investigación pequeña (presupuesto: $10,000-50,000). Afinar OpenVLA o Octo en 200-500 demostraciones recogidas en 10-20 objetos y 2-3 entornos. Invertir en evaluación sistemática (objetos retenidos, posiciones retenidas). Resultado esperado: 85-92% en distribución, 50-65% OOD. Esto está listo para el despliegue para entornos controlados. El programa piloto de RCSV [$2,500]
Primera creación / empresa (ordenamiento de presupuesto: $50,000-500,000/año). Construir infraestructura de recopilación continua de datos. Recolectar 1,000 a 5,000 demostraciones por tarea en más de 30 objetos y 5 entornos. Implementar redes de capacitación y evaluación automatizadas. Objetivo: 90-95% en distribución, 70-80% OOD. En esta escala, la relación entre los costes de datos y los cálculos significa que su presupuesto debe ser de aproximadamente el 90% de la recopilación de datos y el 10% de la computación.
Entranza grande (ordenamiento de presupuesto: > $500,000/año). Establezca una colección multi-site con protocolos estandarizados. Entrenar modelos de base multi-task en su pool de datos propietario. Cada sitio de implementación alimenta los datos de nuevo a la tubería central de capacitación. En esta escala, la diversidad entre sitios se convierte en su principal ventaja competitiva. Resultado esperado: 95%+ en distribución, 80%+ OOD en entornos de despliegue.
Cuándo escalar datos vs modelo de escala
Un marco de decisión práctico basado en la evidencia de escala:
- ** Datos de escala (más demostraciones) cuando:** Su tasa de éxito en la distribución es inferior al 85%. Su política falla en posiciones o orientaciones objetivas específicas que están subrepresentadas en la formación. Su tarea tiene múltiples estrategias viables y está viendo el colapso del modo (la política converge a una estrategia y falla cuando esa estrategia no es aplicable).
- ** Diversidad de escala (más objetos/ambientes) cuando:** Su tasa de éxito en la distribución es superior al 85% pero el rendimiento de OOD es inferior al 50%. Su política no funciona en objetos nuevos que son funcionalmente similares a los objetos de entrenamiento. Su entorno de despliegue es visualmente diferente de su entorno de entrenamiento.
- Modelo a escala (arquitectura más grande) cuando: Usted tiene abundantes datos diversos (> 2.000 demostraciones en > 10 categorías de objetos) y el rendimiento se ha aplastado. Su tarea requiere comprender relaciones espaciales complejas o planificación de horizonte largo. Usted tiene acceso a pesas de modelos de fundación pre-entrenadas que puede ajustar en lugar de entrenar desde cero.
- Cambiar el enfoque cuando: La tasa de éxito se ha colocado en <70% a pesar de más de 1.000 demostraciones diversas. Su tarea requiere un control preciso de la fuerza que las políticas visuales no pueden aprender solo de las imágenes. Su tarea tiene >10 pasos secuenciales donde el error de composición domina.
Escalado entre los cuerpos: ¿Cuántos robots necesitas?
Los resultados de Open X-Embodiment muestran que agregar datos de tipos de robots adicionales mejora la generalización en un robot objetivo. Pero ¿cuántos ejemplos proporcionan beneficios significativos?
- 1 Realización: Línea de base. Política de especialistas en robots únicos.
- ** 3-5 embodiments:** La región de mejoría más pronunciada. Añadiendo datos de 3-5 tipos de robots distintos (cinemáticas diferentes, diferentes sujetadores) mejora la generalización de OOD en un 15-25% en el robot objetivo.
- ** 5-10 realizaciones:** Mejora continua pero con rendimientos disminuyentes.
- 10+ realizaciones: La mejora marginal por cada encarnación es pequeña (<2%), pero el efecto acumulativo es sustancial.
Para los equipos con un solo robot objetivo, el consejo práctico es claro: utilice un modelo de base pre-entrenado en OXE o DROID (que proporciona la diversidad de cada cuerpo de forma gratuita) y ajuste a la perfección los datos específicos de su tarea.
Alcanzamiento de presupuesto de cálculo: marco práctico
Dado el extremo ratio de costos entre datos y computadoras en el aprendizaje de robots, los equipos necesitan una forma de distribuir su presupuesto total de principios entre la recopilación de datos, el cálculo y el tiempo de ingeniería.
| Project Phase | Data Collection | Compute (Training) | Engineering / Evaluation | Rationale |
|---|---|---|---|---|
| Prototype (0-50 demos) | 40% | 10% | 50% | Focus on pipeline setup; data collection validates hardware and workflow |
| Development (50-500 demos) | 70% | 10% | 20% | Maximize data diversity; compute costs are negligible relative to collection |
| Production (500-5000 demos) | 60% | 15% | 25% | Larger model fine-tuning justified; evaluation and deployment engineering critical |
| Scale (5000+ demos) | 50% | 20% | 30% | Continuous collection from deployments; multi-task training requires more compute |
El mensaje consistente en todas las fases: la recopilación de datos domina el presupuesto. En ninguna etapa el cálculo representa más del 20% del total. Los equipos que asignan presupuestos basados en las intuiciones de formación de LLM (donde el cálculo es el costo mayor) invertirán sistemáticamente menos en datos y invertirán en exceso en computación para proyectos de aprendizaje robótico.
El multiplicador de la diversidad: cuantificar el valor de los datos variados
El resultado práctico más fuerte de la investigación de escala es el multiplicador de diversidad: el aumento de rendimiento extraordinario de datos diversos en comparación con datos homogéneos del mismo volumen.
Para una tarea de selección y ubicación estándar, define la puntuación de diversidad como: D = (número de objetos únicos) x (número de posiciones distintas por objeto) x (número de condiciones de iluminación) x (número de operadores).
- 200 demostraciones con D=200 (10 objetos, 5 posiciones, 2 iluminaciones, 2 operadores) lograron un 85% de éxito OOD.
- 200 demostraciones con D=20 (1 objeto, 5 posiciones, 2 iluminaciones, 2 operadores) lograron un 40% de éxito OOD.
- 1000 demostraciones con D=20 lograron un 55% de éxito OOD - todavía 30 puntos por debajo del conjunto diverso de 200 demostraciones.
Las implicaciones son fuertes: 200 demostraciones diversas superan a 1.000 demostraciones homogéneas para la generalización fuera de distribución. Es por eso que los protocolos de recogida del RCSV se construyen en torno a objetivos de diversidad en lugar de objetivos de volumen. Una campaña de recogida que se dirija a 200 demostraciones con D>150 producirá consistentemente una política más implementable que una dirigida a 500 demostraciones con D<50.
Análisis de los modos de fracaso: por qué las políticas se mantienen en diferentes niveles
Comprender por qué una política de planificación requiere diagnosticar qué componente de la línea de aprendizaje es el cuello de botella.
| Plateau Signature | In-Dist. Rate | OOD Rate | Root Cause | Intervention |
|---|---|---|---|---|
| Low ceiling | <70% | <30% | Data quality issue (inconsistent demonstrations, high noise) | Audit and clean existing data; retrain operators; tighten QA gates |
| High in-dist, low OOD | >90% | <50% | Diversity bottleneck (overfitting to training distribution) | Add diverse environments and objects; use data augmentation; switch to foundation model |
| Mode collapse | 70-85% | 30-50% | Architecture limitation (BC averaging over multimodal demonstrations) | Switch from BC to Diffusion Policy or ACT; add action chunking |
| Precisión failures | 80-90% | 60-75% | Observation gap (task requires force/tactile data not in obs space) | Add F/T sensor; add wrist camera for close-up view; use hybrid classical+learned control |
| Long-horizon decay | 85-95% per step | N/A | Compounding error over 10+ steps | Decompose into sub-policies; add hierarchical planning; use DAgger |
| Random failures | 85-92% | 70-80% | Stochastic environment factors (object slip, lighting flicker) | Add retry mechanisms; increase action frequency; use closed-loop control |
El proceso de diagnóstico: ejecutar 50 episodios de evaluación, categorizar cada falla y identificar si las fallas se agrupan en una fase de tarea específica (aproximación, captura, transporte, colocación) o aparecen distribuidas uniformemente. Las fallas distribuidas de forma uniforme sugieren un problema sistémico (calidad de datos, incompatibilidad de arquitectura o limitación de sensores) que más datos del mismo tipo no solucionarán.
Template de experimento de escala práctica
Para los equipos que quieran caracterizar su propia curva de escala antes de comprometerse con una campaña de recopilación de datos grande, aquí está el protocolo experimental que RCSV utiliza con los clientes.
# Scaling experiment protocol
# Collect demos in batches, train and evaluate after each batch
import json
from pathlib import Path
def run_scaling_experiment(task_name, max_demos=500, batch_size=50):
"""
Protocol:
1. Collect batch_size demos
2. Train policy on cumulative dataset
3. Evaluate on fixed held-out test set (20 episodes)
4. Log results and decide whether to continue
"""
results = []
cumulative_demos = 0
for batch_idx in range(max_demos // batch_size):
cumulative_demos += batch_size
# Train on all demos collected so far
model = train_policy(
dataset_path=f"data/{task_name}",
num_demos=cumulative_demos,
architecture="act", # or "diffusion_policy"
epochs=2000,
)
# Evaluate on fixed test set (same 20 configs every time)
in_dist_rate = evaluate(model, test_set="in_distribution", n=20)
ood_rate = evaluate(model, test_set="out_of_distribution", n=20)
results.append({
"demos": cumulative_demos,
"in_dist": in_dist_rate,
"ood": ood_rate,
"delta_in_dist": in_dist_rate - (results[-1]["in_dist"] if results else 0),
"delta_ood": ood_rate - (results[-1]["ood"] if results else 0),
})
# Stop if both metrics have plateaued (<2% improvement for 2 batches)
if len(results) >= 3:
recent = results[-2:]
if all(r["delta_in_dist"] < 0.02 for r in recent) and \
all(r["delta_ood"] < 0.02 for r in recent):
print(f"Plateau detected at {cumulative_demos} demos")
break
Path(f"results/{task_name}_scaling.json").write_text(json.dumps(results, indent=2))
return results
Este protocolo normalmente requiere de 3-5 ciclos de recopilación-entrenamiento-evaluación (150-250 demostraciones) para identificar la meseta aproximada para una tarea dada. Los resultados clave son: (1) el recuento mínimo de demostraciones para el rendimiento en la distribución de grado de implementación (generalmente 85-90%), (2) el punto de disminución de los rendimientos para el rendimiento OOD, y (3) si el cuello de botella es el volumen de datos, la diversidad de datos o la arquitectura. RCSV ejecuta este protocolo como parte del compromiso piloto de $2,500, proporcionando a los clientes una curva de escalación basada en datos específica para su tarea antes de comprometerse con una campaña de recolección completa.
Escalado de múltiples tareas: cómo el número de tareas afecta a los requisitos de datos por tarea
Un hallazgo importante y contraintuitivo de trabajo reciente: la formación de una política sobre múltiples tareas simultáneamente puede reducir el requisito de datos por tarea. Cuando las tareas comparten primitivas visuales o motoras (todas implican agarrar, todas usan el mismo agarre, todas ocurren en la misma tabla), el aprendizaje compartido entre las tareas proporciona un efecto de regularización que mejora la eficiencia de los datos para cada tarea individual.
Observaciones empíricas de la formación multicapa de RCSV:
- 1 tarea, 200 demostraciones: 85% de éxito en la distribución.
- 5 tareas relacionadas, 200 demostraciones cada una (1.000 en total): 88% de éxito medio en la distribución y 62% de OOD.
- 5 tareas relacionadas, 100 demostraciones cada una (500 en total): 84% de éxito medio en la distribución y 55% de OOD.
- 5 tareas no relacionadas, 200 demostraciones cada una (1.000 en total): 83% de éxito medio en la distribución.
La regla general: si sus tareas comparten al menos el 50% de sus primitivas de movimiento (el mismo espacio de trabajo, el mismo agarre, objetos similares), el entrenamiento multifasco con el acondicionamiento del lenguaje reduce los requisitos de datos por tarea en un 30-50%. Las campañas de recopilación de datos de RCSV para implementaciones multitareas están estructuradas para maximizar las primitivas compartidas entre tareas, reduciendo el costo total de la recopilación en un 20-40% en comparación con las campañas independientes de una sola tarea.
Escalado computacional: cuándo entrenar modelos más grandes vs recopilar más datos
El aprendizaje robótico enfrenta un tradeoff de datos computacionales diferente al de la modelado de lenguaje. En el modelado de lenguaje, la escalación del tamaño del modelo con datos fijos mejora el rendimiento de manera predecible. En el aprendizaje robótico, la evidencia sugiere que la diversidad de datos importa más que el tamaño del modelo para la mayoría de las tareas prácticas.
| Model Size | Architecture Example | Demos for Peak In-Dist | In-Dist Success | OOD Success | Training Cost |
|---|---|---|---|---|---|
| Small (5-20M params) | ACT (ResNet-18 backbone) | 200-300 | 85-92% | 40-55% | $5-15 |
| Medium (50-200M params) | ACT (DINOv2-B backbone) | 300-500 | 88-94% | 55-70% | $50-200 |
| Large (1-7B params) | OpenVLA (Llama-7B backbone) | 100-200 (fine-tune) | 90-96% | 65-80% | $500-3,000 |
El hallazgo clave: los modelos de tamaño medio con datos diversos a menudo coinciden con los modelos grandes con datos menos diversos sobre la evaluación de OOD. Un ACT de parámetro de 100M con DINOv2 con espina dorsal entrenada en 500 demostraciones diversas puede lograr un éxito OOD del 65-70%, comparable a un parámetro OpenVLA de 7B afinado en 150 demostraciones menos diversas. El modelo grande tiene un mayor rendimiento máximo en la distribución, pero la diversidad de los datos de formación es el factor dominante para la generalización.
Regla de asignación del presupuesto: Si el presupuesto total de su proyecto es X, gase el 70% en recopilación de datos (haciendo énfasis en la diversidad), el 20% en computación (formación y evaluación) y el 10% en ingeniería (pipelina, integración).
Escalado con datos de simulación: ¿Cuánto datos reales puede reemplazar Sim?
La simulación de datos se escala a bajo costo pero se transfiere imperfectamente.
- ** Diversidad visual:** Sim puede proporcionar una diversidad visual ilimitada a través de la aleatorización de dominios. Para la generalización visual específicamente (objetos nuevos, iluminación, fondos), los episodios de sim 10K con aleatorización de dominio proporcionan beneficios equivalentes a 500-1000 episodios reales. Este es el caso de uso más fuerte para los datos de sim en un contexto de escala.
- Precisión de control del motor: Los datos de Sim no se transmiten bien para tareas de precisión (inserción sub-mm, manipulación deformable) porque los errores de simulación de física se componen. Para estas tareas, los datos de Sim proporcionan el 0-20% del valor de datos reales equivalentes.
- Ratio de mezcla práctica: El enfoque más eficaz es de 80-90% de datos sim (para la diversidad visual y el comportamiento grosero) más 10-20% de datos reales (para la física de la tierra y la precisión).
- ** Reducción de rendimientos en sim:** Los datos de sim muestran su propia plato en 10K-50K episodios para la mayoría de las tareas. Más allá de los episodios de sim 50K, los datos de sim adicionales proporcionan una mejora insignificante - el cuello de botella se desplaza a la brecha de sim a la realidad, no el volumen de datos. Invertir en una mejor aleatorización de dominio en lugar de más episodios.
RCSV admite las tuberías de datos híbridos de sim-real a través de nuestros [servicios de datos]
Preguntas abiertas y lo que aún no sabemos
En el año 2026, no se han respondido varias preguntas importantes sobre la escalación del aprendizaje robótico. Se debate activamente si los datos transmódales (vídeo de manipulación humana, demostraciones simuladas, descripciones de lenguaje) proporcionan los mismos beneficios de escalación que los datos reales de robots, con evidencia preliminar que sugiere que ayudan a las representaciones visuales pero no al control motor preciso.
Velocidad de recopilación de datos: ¿Qué tan rápido puede escalar?
Incluso con la asignación adecuada del presupuesto, la velocidad de recopilación de datos está limitada por las realidades físicas.
| Configuration | Demos/Hour | Demos/Day (8hr) | Time to 500 Demos |
|---|---|---|---|
| 1 arm, simple pick-place, expert operator | 60-120 | 400-800 | 1 day |
| 1 arm, multi-step assembly, expert | 15-30 | 100-200 | 3-5 days |
| Bimanual (ALOHA), simple task | 30-60 | 200-400 | 2 days |
| Bimanual, complex task, novice operator | 8-15 | 50-100 | 5-10 days |
| Remote teleop (100ms+ latency) | 10-30 | 80-200 | 3-6 days |
** Paralelización:** La forma más rápida de escalar la recopilación de datos es ejecutar varias estaciones de robots simultáneamente. Cada estación adicional proporciona un aumento de rendimiento casi lineal (menos 10-15% de gastos generales de coordinación). RCSV opera 4-8 estaciones de recopilación en paralelo para campañas grandes, logrando 1.000-2.000+ demostraciones por día para tareas simples. El costo de las estaciones adicionales se amortiza a través de las campañas, haciendo que la recogida paralela sea más rentable que la operación de una sola estación por más tiempo.
Estas tarifas asumen una línea de recogida madura sin problemas de hardware. Para las primeras configuraciones, reduzcan las expectativas de rendimiento en un 50% durante la primera semana mientras se desembolsan el operador y la línea de tubería. La instalación de RCSV logra las tarifas de "operador experto" de manera consistente porque nuestros operadores tienen más de 500 horas de experiencia en teleoperación en múltiples categorías de tareas.
El problema de la meseta: cuando más datos dejan de ayudar
Cada equipo llega a un nivel de rendimiento donde agregar más demostraciones produce una mejora insignificante. Reconocer cuándo has alcanzado un nivel de rendimiento - en comparación con cuándo la calidad o la diversidad de datos es el cuello de botella - es fundamental para evitar el esfuerzo de recolección desperdiciado.
Signos de que ha alcanzado una situación real: La tasa de éxito ha estado dentro de +/- 2% durante los últimos 3 ciclos de formación de recogida.
Diferenciar la meseta de volumen de la meseta de diversidad: El error más común es interpretar una meseta de diversidad como una meseta de volumen. Para probar la que está golpeando: recoger 50 demostraciones adicionales con la mayor diversidad (nuevos objetos, nuevas posiciones, nueva iluminación) y comparar la mejora de las políticas con 50 demostraciones adicionales con el mismo perfil de diversidad que los datos existentes. Si el lote diverso mejora el rendimiento y el lote uniforme no, usted tiene un problema de diversidad.
Signos de que la plataforma es artificial (fissable): El rendimiento en la distribución es fuerte (>90%) pero el rendimiento en la OOD es débil (<50%) - esto indica un cuello de botella de diversidad, no un cuello de botella de volumen de datos. La política muestra la media de modo (hésitación entre estrategias) - cambios arquitectónicos (cambio de BC a Política de difusión) o limpieza de datos ayudarán más que más datos.
Cuando se llega a una meseta real, las opciones son: (1) cambiar a un modelo de base con formación previa a la encarnación cruzada, que proporciona una nueva línea de base por encima de la meseta desde cero; (2) añadir modalidades (sensores de F/T, profundidad) que proporcionan información que la política no puede extraer de las observaciones existentes; o (3) descomponer la tarea en subpolíticas, cada una de las cuales puede mejorarse de forma independiente más allá de la meseta de tarea completa.
Puntos de control prácticos: cuándo dejar de recopilar datos
Una de las preguntas más comunes que hacen los equipos es "¿Cuántas demostraciones necesito?" La respuesta honesta depende de tu tarea y de la tasa de éxito de tu objetivo, pero estos puntos de control proporcionan puntos de decisión.
- 50 demostraciones: Punto de control de validación de tuberías. Evalúe una política y evalúe 20 ensayos. Si la tasa de éxito es inferior al 30%, es probable que haya un error de tubería (format de datos, normalización de acción, calibración de la cámara) en lugar de un problema de volumen de datos.
- 100 demostraciones: Punto de control de viabilidad. Si la política logra un 50% o más de éxito en la distribución, la tarea es aprendizaje con su arquitectura actual y la calidad de los datos. Si es inferior al 50% después de la depuración, considere si la tarea requiere modalidades adicionales (sensores de F/T, profundidad) o un algoritmo diferente.
- 200 demostraciones: Punto de control de diversidad. Evaluar en objetos/posiciones retenidos. Si el éxito en la distribución es de 80%+ pero el éxito en la OOD es inferior al 40%, el problema es la diversidad, no el volumen. Aumente la diversidad de los próximos 100 demostraciones en lugar de recoger más del mismo.
- ** 500 demostraciones:** Reducción de los resultados de los controles. Para las tareas de una sola tarea BC en las tareas L2, la mayoría de los equipos ven menos de un 3% de mejora de las demostraciones 300-500. Si no ha alcanzado su tasa de éxito objetivo en 500 demostraciones, el cuello de botella es probablemente arquitectónico (switch to Diffusion Policy, add language conditioning) en lugar de volumen de datos.
- 1,000+ demos: Sólo justificados para tareas L3/L4 (ensamblaje complejo, secuencias de múltiples pasos) o entrenamiento multitarea donde el número total de demos se divide en 5 a 10 tareas.
Tal vez lo más importante: se desconoce si el plano DROID en 50.000 demostraciones refleja un límite fundamental para las arquitecturas actuales, una limitación de los modelos específicos probados (ACT, Política de difusión) o un artefacto del perfil de diversidad del conjunto de datos. Alternativamente, se pueden requerir innovaciones arquitectónicas (mejor representaciones de acción, mejor modelado temporal o uso más efectivo de datos de fuerza-torque) para romper el techo de escala actual.
El RCSV [plataforma de datos]
Lectura relacionada
- [Abrir el cuerpo X: el conjunto de datos del robot que cambió todo]
- [El desafío de generalización: por qué las políticas de robots siguen fracasando en 2026]
- [Aprendizaje robótico: costo por análisis de demostración]
- [Robote Aprendizaje de Video: Estado de la Arte en 2026]
- [Política de ACT vs. Difusión: cuándo usar cuál]
- [Servicios de recogida de datos del RCSV]
Construye un conjunto de datos diverso y de alta calidad
Los servicios de recopilación de datos del RCSV están estructurados para maximizar la diversidad: la dimensión que realmente escala el rendimiento de las políticas de robots.
[Explorar los Servicios de Datos]







