Research(으)로 돌아가기

신체적 평점 시대 에 오신 것을 환영 합니다

소프트웨어에서, evals는 병목이 되었습니다. 그리고 Mercor와 Fireworks는 그것들을 만들기 위해 경쟁하고 있습니다. 물리 세계에서, 그 층은 아직 존재하지 않습니다. 실제 세계 evals (RL2) 는 물리 AI의 해적입니다.

← 연구 / RL2 시리즈

소프트웨어에서, evals는 병목이 되었습니다. AI에서 가장 똑똑한 팀은 그것들을 만들기 위해 경쟁하고 있습니다. 물리적 세계에서, 그 층은 아직 존재하지 않습니다. 그게 전부입니다.

제리 허앙 · 실리콘밸리 로봇 센터 · 2026년 7월

강화 학습은 모든 기준을 포화하고 있습니다. 소프트웨어에서, 그것은 이미 병목을 돌렸습니다. 어려운 부분은 더 이상 모델이 아닙니다. 그것은 훈련과 판단을 위해 ** 에어와 환경을** 구축합니다.

이것이 머커르의 논문입니다. "시대들은 새로운 PRD"와 "화탄소" "생산 RL"의 뒷이야기입니다. 인공지능의 두 가장 똑똑한 팀들은 소프트웨어 에이전트들을 위한 평가 인프라를 구축하기 위해 경쟁하고 있습니다. 그들은 옳습니다.

거의 아무도 말하지 않는 것은 다음과 같습니다. 물리 세계에서, 그 층은 아직 존재하지 않습니다. 그리고 그것은 훨씬 더 어려운 문제입니다.

모델은 상품화됩니다. 루프는 그렇지 않습니다. 물리 인공지능의 가치는 실제 학습 루프를 가장 빠르고 저렴하게 닫는 사람에게 쌓입니다.

신체적 인 것은 왜 다른가?

  • ** 작업세포를 복제할 수 없습니다.** 소프트웨어 에이전트의 환경은 컨테이너에 회전합니다. 로봇의 환경은 실제 세포입니다.
  • 복복을 자동으로 분류할 수 없습니다.* 코드 컴파일 또는 그렇지 않습니다. "로봇이 상자를 올바르게 배치했습니까?"는 단위 테스트가 없습니다.
  • ** 흔적이 로그가 아닙니다.* * 소프트웨어에서 흔적이 지상 진실입니다. 물리 세계에서 흔적이 오후 4시에 과열되어 부품이 떨어지는 로봇입니다.

로봇 모델은 모든 기준을 포화할 것입니다. 경제 전반에 걸쳐 로봇을 작동시키는 장벽은 더 큰 모델이 아닙니다. 실제 세계 평가입니다. 물리적인 작업에 거의 존재하지 않습니다.

RL2: 실생활 에서 강화 된 학습

그래서 우리는 로봇 센터를 하나의 루프에 둘러싸고 만들었습니다. ** 배포 → 캡처 실패 → 실제 수용 기준에 따라 평가 → 목표 데이터를 수집 → 재배포.** 실제 하드웨어, 실제 실패, 지속적인 학습. 두 가지가 다음입니다.

** 수용 기준은 로봇에 대한 새로운 PRD입니다.** 실제 배포에서 "작업"이라는 의미를 암호화하는 사람이 모든 모델 버전이 통과해야 하는 게이트를 소유하고 있습니다.

** 루프, 모델이 아니라 컴포넌스.** 각 배포 실패를 손으로 디버깅하는 것은 끝없는 변수 비용입니다. 평가 배포는 모든 버전에 지불하는 고정 자산으로 변환합니다.

우리가 실제로 있는 곳

솔직히, 오늘날 아무도 소프트웨어 수준의 완전 자동화된 물리적인 평가가 없습니다. 그것은 자동화된 회귀 게이트와 운영자-순환 판단의 하이브리드이며, 완전 자동화는 다년간의 구축입니다. 이것이 왜 을 만드는 것이 가치가 있고 왜 책상에서 수행할 수 없는지입니다. 실제 하드웨어, 실제 운영자, 실제 세계 순환이 필요합니다.

소프트웨어만 사용하는 회사들은 이 층에 도달할 수 없습니다. 모델 연구소는 물리적 더러운 일을 원하지 않습니다. 그것은 넓은 자리를 남겨두고 있습니다. ** 머커와 파이어워크스가 소프트웨어에 대해 만들고 있는 물리적 세계 버전.**

소프트웨어에서는 흔적이 기본 진실이고 물리적인 세계에서 작업세포는 그렇습니다.

실험실에서 작동하는 정책들을 훈련시키고 있지만, 작업세포는 작동하지 않는다면, 우리가 작업하는 벽은 바로 그 벽입니다.

평가에 대해 읽는 것은 한 가지 실제 하드웨어에 대한 정책을 증명하는 것은 다른 것입니다.

실제 평가판을 실행하라 → 위원회 평가 자료가 있는 것 → 당신의 평가판에 대한 하드웨어가 있는 것 →