Researchに戻る

物理的 平等 の 時代 に ようこそ

ソフトウェアでは, evals はボトルネックになりました <unk> そして,Mercor と Fireworks はそれらを構築するために競い合っています.物理の世界では,その層はまだ存在しません.なぜ現実世界の evals (RL2) は物理 AI の溝です.

←研究 /RL2シリーズ

ソフトウェアでは, evals はボトルネックになりました. AI の最も鋭いチームはそれらを構築するために競い合っています.物理の世界では,その層はまだ存在しません. それがゲーム全体です.

ジェリー・フアン · シリコンバレーのロボットセンター · 2026年7月

強化学習はあらゆる基準を飽和しています ソフトウェアでは既にボトルネックを逆転させました 難しい部分はもはやモデルではなく 訓練や判断のための eVsと環境を構築しています

ソフトウェアエージェントのための評価インフラを構築するために AIで最も鋭いチーム2人が競っている. 彼らは正しい.

物理の世界では その層はまだ存在しません** そしてこれはもっと難しい問題です

物理 AIの価値は リアル・ワールド学習ループを 最も速く安く 閉じている人に 増えるのです

身体はなぜ違うのか

  • ソフトウェアエージェントの環境はコンテナで回転する. ロボットの環境は実際の細胞です リアルアクチュエーター,フラージュ,着用,単位から単位に差異.
  • "ロボットが箱を正しく置いたのか?"は単位テストがない.
  • ソフトウェアでは,その痕跡は地面の真実です.物理の世界では,その痕跡は午後4時に超熱で部品を落としたロボットです.

ロボットモデルもあらゆる基準を満たすでしょう. 経済の全体でロボットを働かせるための障壁は,より大きなモデルではありません. 物理的な作業ではほとんど存在しない **現実世界の評価です.

RL2: 実生活における強化学習

ロボティクスセンターを ひとつのループで構築した理由です **デプロイ →キャプチャ失敗 → 実質的な受け入れ基準に評価 → ターゲットデータ収集 → 再デプロイ. ** 実質的なハードウェア,実質的な失敗,継続的な学習.

受け入れ基準はロボットのための新しいPRDです. 実用部署で"作業"の意味をコードする者はゲートを所有し,すべてのモデルバージョンが合格しなければならない.

ループではなくモデルが複合する. 各部署失敗を手動でデバッグすることは,決して終わらない変数コストです. 評価ハネスは,それをすべてのバージョンで支払われる固定資産に変換します.

どこにいるのか

完全に自動化された物理的評価は,ソフトウェアグレードの完全自動化によるものです. 自動化されたレグレーションゲートとオペレータ・イン・ザ・ループの判断のハイブリッドであり,完全な自動化は長年にわたる構築です. 開発価値はなぜ? 机から実行できない理由です. リアルなハードウェア,リアルなオペレータ,リアルなループが必要です.

ソフトウェアのみの企業がこの層に到達できない. モデルラボは物理的な汚い作業を望まない. 広い席が残ります. メルコーとファイアワークスがソフトウェアのために構築している物理的な世界のバージョンです.

ソフトウェアでは 痕跡は基礎真理で 物理の世界では 作業細胞です

実験室で働く 作業細胞ではなく 訓練する方針であれば 壁に組み込まれています

評価について読むことは"つ 真のハードウェアに関する政策を証明することは"つ

実世界の評価を実行する → 委員会評価データ → 評価装置のためのハードウェア →