Willkommen in der Ära der physischen Evalen
In der Software wurden Evalues zum Engpäck <unk> und Mercor und Fireworks sind im Rennen um sie zu bauen. In der physischen Welt existiert diese Schicht noch nicht. Warum sind reale Evalues (RL2) der Schluck in der physischen KI.
← Forschung / RL2 Serie
In der Software wurden Evaluations zum Engpäck und die schärfsten Teams in der KI kämpfen um sie. In der physischen Welt existiert diese Schicht noch nicht. Das ist das ganze Spiel.
Jerry Huang · Robotikzentrum des Silicon Valley · Juli 2026
Das Verstärkungsschulden sättigt alle Benchmarks. In der Software, die bereits den Engpass umgedreht hat: Das schwierige ist nicht mehr das Modell
Das ist die These hinter Mercor's "Evals are the new PRD" und Fireworks' "Production RL". Zwei der schärfsten Teams in der KI sind im Rennen um eine Evaluation-Infrastruktur für Softwareagenten.
Hier ist, was fast niemand sagt: In der physischen Welt existiert diese Schicht noch nicht. Und es ist ein viel schwereres Problem.
Die Kohle wird in der physischen KI von dem, der die Lernschleife am schnellsten und billigsten schließt.
Warum ist körperlich anders
- Eine Arbeitszelle kann man nicht klonen. Die Umgebung eines Softwareagenten dreht sich in einem Behälter.
- ** Man kann ein gefaltetes Hemd nicht automatisch bewerten.** Code kompilliert oder es nicht. "Hat der Roboter die Box richtig platziert?" hat keinen Einheitstest.
- In der Software ist die Spur die Grundwahrheit, in der physischen Welt ist die Spur ein Roboter, der um 16 Uhr überhitzt ist und das Teil fallen lässt.
Die Barriere, um Roboter in die Wirtschaft zu bringen, ist kein größeres Modell
RL2: Verstärkung des Lernens im wirklichen Leben
Deshalb haben wir das Robotikzentrum um einen einzigen Schleife gebaut: deploy → capture failures → evaluate against real acceptance criteria → collect targeted data → redeploy. Real hardware, real failures, continuous learning. Zwei Dinge folgen.
Die Akzeptanzkriterien sind die neue PRD
Die Schleife, nicht das Modell, ist eine Verbindung. Die Handdebug-Verschlagung jedes Ausführungsfehlers ist eine variable Kosten, die nie endet.
Wo wir eigentlich sind
Ehrlich gesagt: Niemand hat heute eine software-fähige, voll automatisierte physische Bewertung. Es ist eine Hybrid-Verschnittung von automatisierten Regressions-Türen und Operator-in-the-Loop-Urteil, und voll automatisiert ist ein mehrjähriges Bauen. Das ist der Grund, warum es sich lohnt, zu bauen
Die Modelllabore wollen nicht die physische schmutzige Arbeit, das lässt einen weit offenen Sitz: die physische Weltversion dessen, was Mercor und Fireworks für Software bauen. Das ist der Sitz, den wir einnehmen.
In der Software ist die Spur die Grundwahrheit.
Wenn Sie Politiken ausbilden, die im Labor funktionieren, aber nicht in der Arbeitszelle, dann ist das die Wand, an der wir arbeiten.
Das Lesen über die Bewertung ist eine Sache
Run a real-world eval → Kommission Evaluation Daten → Hardware für Ihre Evaluation Rig →







