Volver a Research

Bienvenidos a la era de las equivalencias físicas

En el software, evals se convirtió en el cuello de botella <unk> y Mercor y Fireworks están compitiendo para construirlos. En el mundo físico, esa capa aún no existe. ¿Por qué evals del mundo real (RL2) son el foso en la IA física.

[← Investigación]T0) / Serie RL2

En el software, evals se convirtió en el cuello de botella y los equipos más inteligentes en IA están compitiendo para construirlos. En el mundo físico, esa capa aún no existe. Ese es todo el juego.

Jerry Huang · Centro de Robótica del Valle del Silicio · julio 2026

El aprendizaje de refuerzo está saturando todos los puntos de referencia. En el software, que ya ha invertido el cuello de botella: la parte difícil ya no es el modelo está construyendo los evalos y entornos para entrenarlo y juzgarlo.

Es la tesis detrás de Mercor "Evals son el nuevo PRD" y Fireworks "Production RL". Dos de los equipos más inteligentes en IA están compitiendo para construir infraestructura de eval para agentes de software.

Esto es lo que casi nadie dice: En el mundo físico, esa capa aún no existe. Y es un problema mucho más difícil.

Los modelos se comercializan. El ciclo no. El valor en la IA física se acumula a quien cierra el ciclo de aprendizaje del mundo real más rápido y más barato.

¿Por qué es diferente el físico?

  • No se puede clonar una célula de trabajo. El entorno de un agente de software se gira en un recipiente.
  • No se puede clasificar automáticamente una camisa plegada. El código se compie o no lo hace. "¿El robot colocó correctamente la caja?" no tiene prueba de unidad.
  • En el software, el rastro es la verdad de tierra. En el mundo físico, el rastro es un robot que se sobrecalentó a las 4 pm y dejó caer la pieza.

Los modelos de robots saturarán cualquier punto de referencia también. La barrera para poner a los robots a trabajar en toda la economía no es un modelo más grande son ** evaluaciones del mundo real, que apenas existen para tareas físicas.**

RL2: Aprendizaje reforzado en la vida real

Es por eso que construimos el Centro de Robótica en torno a un solo bucle: implanar → capturar fallos → evaluar en función de criterios de aceptación reales → recopilar datos dirigidos → redistribuir. Hardware real, fallos reales, aprendizaje continuo. Dos cosas siguen.

Los criterios de aceptación son el nuevo PRD para robots. Quien codifica lo que significa "trabajar" en una implementación real posee la puerta cada versión del modelo debe pasar.

El bucle, no el modelo, componen. Desarmar manualmente cada falla de implementación es un costo variable que nunca termina.

Donde estamos realmente

Honestamente: nadie tiene una evaluación física de grado de software, totalmente automatizada hoy en día. Es un híbrido de puertas de regresión automatizadas y el juicio operador en el circuito, y la automatización completa es una construcción de varios años. Por eso vale la pena construir y por qué no se puede hacer desde un escritorio. Necesita hardware real, operadores reales y un circuito del mundo real.

Las empresas que sólo usan software no pueden llegar a esta capa. Los laboratorios de modelos no quieren el trabajo sucio físico. Eso deja un asiento abierto: ** la versión del mundo físico de lo que Mercor y Fireworks están construyendo para el software.** Ese es el asiento que estamos tomando.

En el software, la huella es la verdad de la tierra.

Si estás entrenando políticas que funcionan en el laboratorio pero no en la célula de trabajo, ese es el muro en el que trabajamos.

Leer sobre la evaluación es una cosa probar una política sobre hardware real es otra.

Ejecutar una evaluación del mundo real → Datos de evaluación de la Comisión → Hardware para su equipo de evaluación →