Bienvenidos a la era de las equivalencias físicas
En el software, evals se convirtió en el cuello de botella <unk> y Mercor y Fireworks están compitiendo para construirlos. En el mundo físico, esa capa aún no existe. ¿Por qué evals del mundo real (RL2) son el foso en la IA física.
[← Investigación]
En el software, evals se convirtió en el cuello de botella y los equipos más inteligentes en IA están compitiendo para construirlos. En el mundo físico, esa capa aún no existe. Ese es todo el juego.
Jerry Huang · Centro de Robótica del Valle del Silicio · julio 2026
El aprendizaje de refuerzo está saturando todos los puntos de referencia. En el software, que ya ha invertido el cuello de botella: la parte difícil ya no es el modelo
Es la tesis detrás de Mercor "Evals son el nuevo PRD" y Fireworks "Production RL". Dos de los equipos más inteligentes en IA están compitiendo para construir infraestructura de eval para agentes de software.
Esto es lo que casi nadie dice: En el mundo físico, esa capa aún no existe. Y es un problema mucho más difícil.
Los modelos se comercializan. El ciclo no. El valor en la IA física se acumula a quien cierra el ciclo de aprendizaje del mundo real más rápido y más barato.
¿Por qué es diferente el físico?
- No se puede clonar una célula de trabajo. El entorno de un agente de software se gira en un recipiente.
- No se puede clasificar automáticamente una camisa plegada. El código se compie o no lo hace. "¿El robot colocó correctamente la caja?" no tiene prueba de unidad.
- En el software, el rastro es la verdad de tierra. En el mundo físico, el rastro es un robot que se sobrecalentó a las 4 pm y dejó caer la pieza.
Los modelos de robots saturarán cualquier punto de referencia también. La barrera para poner a los robots a trabajar en toda la economía no es un modelo más grande
RL2: Aprendizaje reforzado en la vida real
Es por eso que construimos el Centro de Robótica en torno a un solo bucle: implanar → capturar fallos → evaluar en función de criterios de aceptación reales → recopilar datos dirigidos → redistribuir. Hardware real, fallos reales, aprendizaje continuo. Dos cosas siguen.
Los criterios de aceptación son el nuevo PRD
El bucle, no el modelo, componen. Desarmar manualmente cada falla de implementación es un costo variable que nunca termina.
Donde estamos realmente
Honestamente: nadie tiene una evaluación física de grado de software, totalmente automatizada hoy en día. Es un híbrido de puertas de regresión automatizadas y el juicio operador en el circuito, y la automatización completa es una construcción de varios años. Por eso vale la pena construir
Las empresas que sólo usan software no pueden llegar a esta capa. Los laboratorios de modelos no quieren el trabajo sucio físico. Eso deja un asiento abierto: ** la versión del mundo físico de lo que Mercor y Fireworks están construyendo para el software.** Ese es el asiento que estamos tomando.
En el software, la huella es la verdad de la tierra.
Si estás entrenando políticas que funcionan en el laboratorio pero no en la célula de trabajo, ese es el muro en el que trabajamos.
Leer sobre la evaluación es una cosa
Ejecutar una evaluación del mundo real → Datos de evaluación de la Comisión → Hardware para su equipo de evaluación →







