Blog(으)로 돌아가기

2026년 물리 인공지능: 정의, VLA 모델, 데이터 및 빌드 작업 흐름

2026년 물리 인공지능의 의미는 무엇이며 어떻게 만들어야 하는지: 센서, 로봇 데이터, VLA 정책, 컴퓨팅, 시뮬레이션 및 작업 수준 평가

현재 물리적 AI 스택에 대한 실용적인 가이드: 센서 및 컴퓨팅, 로봇 데이터, VLA 또는 작업 특정 정책, 시뮬레이션, 배포 및 시스템이 연구실 밖에서 작동하는지 여부를 결정하는 평가 루프.

2026년 7월 26일 업데이트 · 제리 허앙

직접적인 답변

물리 인공지능, 한 문장으로

물리 AI는 로봇과 같은 체형화된 시스템을 통해 인식하고 계획하고 행동하는 AI입니다. 실제로는 스택입니다. 센서와 컴퓨팅, 로봇, 구조화된 훈련 데이터, 정책 및 반복 가능한 실제 평가 루프.

** 범주 및 증거:** 이 페이지 는 2026 모델 풍경과 구축 작업 흐름을 보유하고 있습니다. 시간 없는 정의는 기본 지침에 남아 있습니다. 능력 및 벤치마크 주장은 문서 또는 저장소, 버전, 실시예 및 프로토콜을 식별해야합니다. 종이 보고된 결과는 RCSV 측정 된 결과가 아닙니다.

  • [시간이 없는 정의를 읽어보세요]
  • [VLA 모델을 비교]
  • [기획 로봇 데이터 수집]
  • [시뮬레이션 도구를 비교]

물리적인 인공지능이란 무엇인가?

물리 AI는 로봇 구현을 통해 물리적 세계에 작용하고 상호작용하는 인공지능 시스템을 의미합니다. 디지털 AI와 달리 순전히 컴퓨팅 환경에서 텍스트, 이미지 또는 코드를 처리하는 물리 AI는 실제 물체, 표면 및 힘의 연속적이고 고하고 용서를 하지 않는 물리학을 처리해야합니다.

물리적 세계는 디지털 인공지능이 결코 만나지 못하는 도전을 제시하기 때문에 이 구별은 중요합니다. 언어 모델은 밀리초에 세대를 다시 시도할 수 있습니다. 유리창을 떨어뜨리는 로봇 팔은 중력을 해제할 수 없습니다. 행동의 결과는 즉각적이고 돌이킬 수 없으며 소프트웨어 추상화보다는 물리학에 의해 지배됩니다.

근본적 인 문제

큰 언어 모델 들 은 "구들"이라는 단어 를 텍스트 의 통계적 패턴 으로 이해 합니다. 그 들 은 잡을 수 있는 것 을 설명 할 수 있으며, 잡을 수 있는 것 을 계획 하기 위해 코드를 작성 할 수 있으며, 잡을 때 적절 한 것 을 설명 할 수 있습니다. 그들이 할 수 없는 것은 "잡아"라는 개념을 정확한 모터 명령의 순서로 번역하는 것입니다. 로봇이 불규칙하게 모양의 물체를 둘러싸고

이것은 추상 언어 이해와 구체적인 물리적 행동들을 연결하는 지형 문제입니다. 물리 AI는 실제 환경에서 실제 작업을 수행하는 실제 로봇의 레코딩을 구현한 데이터에 훈련함으로써 해결합니다. 모델은 의미적으로 "그랩"이 무엇을 의미하는지뿐만 아니라 관절 각, 힘 및 시각 관측의 궤도로 어떻게 보이는지 배우습니다.

물리 인공지능과 고전 로봇

클래식 로봇은 명시적인 프로그래밍을 통해 조작을 해결합니다. 엔지니어는 팔을 움직이고, 언제 지지를 열고, 각각의 물체를 처리하는 방법을 정확하게 명시하는 코드를 작성합니다. 이것은 구조화된 환경에서 고정된 작업 (카 모음 라인, 반도체 제조) 에서 잘 작동합니다. 같은 움직임이 동일한 부분에서 수백만 번 반복됩니다. 변동이 있는 환경에서는 실패합니다. 다른 객체, 다른 위치, 다른 조명

물리적인 인공지능은 이 접근 방식을 뒤집고 있습니다. 로봇을 명시적인 규칙으로 프로그래밍하는 대신, 당신은 로봇에게 시범을 통해 무엇을 해야 하는지 보여주며, 신경망은 센서 관측에서 운동 행동까지 지도를 학습합니다. 훈련된 정책은 명시적으로 표시되지 않은 변동에 일반화되어 있습니다. 왜냐하면 신경 네트워크는 특정 궤도를 기억하는 것보다 작업의 근본 구조를 학습하기 때문입니다. 고전적 선택과 장소 프로그램은 특정 컵의 좌표를 알고 있습니다. 200개의 다양한 시위에 훈련된 물리적인 인공지능 정책은 본 적이 없는 컵을, 본 적이 없는 위치에 수 있습니다.

타협은 예측가능성이다. 고전적인 프로그램은 항상 같은 입력에 대해 동일한 출력을 생성한다. 신경 네트워크 정책은 매번 약간 다른 궤도를 생성할 수 있으며, 컨트롤러가 해석 가능한 코드보다는 학습된 모델이 될 때 디버깅 실패 모드가 더 어려워진다. 안전성 중요한 응용 프로그램에 있어서, 이러한 예측 불가능성은 중요한 배포 장벽이 된다.

NVIDIA의 "물리적 인공지능" 프레임

NVIDIA는 시장 카테고리로서 "물리 AI"라는 용어를 대중화하는데 중요한 역할을 해 왔으며, 이를 다음 주요 플랫폼 전환으로 생성 AI와 함께 배치했습니다. 그들의 프레임링은 세 가지 축에 초점을 맞추고 있습니다. 시뮬레이션 (Omniverse/Isaac Sim) 은 합성 훈련 데이터를 생성하기 위해, 기초 모델 (인류형 로봇을 위한 프로젝트 GR00T) 와 컴퓨팅 인프라 (Jetson Thor) 는 탑재 로봇 추론을 위해. 이 프레임은 상업적으로 동기부여되어 있습니다. NVIDIA는 이러한 모델을 훈련시키는 GPU를 판매합니다. 하지만 2026년에 해당 분야를 정의하는 대규모 학습, 시뮬레이션 및 구현된 로봇의 공감대를 정확하게 포착합니다.

NVIDIA 프레임링은 물리 인공지능이 단순한 연구 개념이 아니라는 것을 강조하기 때문에 유용합니다. 그것은 특정 컴퓨팅 요구 사항, 데이터 파이프라인 및 배포 제한이있는 엔지니어링 학문입니다. 이는 채봇 또는 이미지 생성기를 훈련하는 것과 근본적으로 다릅니다.

주요 물리 AI 미일스톤 (2023~2026)

2023 년 이후 물리 인공지능의 발전 속도는 급격히 가속화되었습니다. 다음의 한 획은 궤도를 정의합니다.

RT-2 (Google DeepMind, 2023년 7월)

RT-2는 최초의 대규모 비전 언어 행동 (VLA) 모델이다. 구글은 55억 파라미터 모델을 훈련시켰으며, 카메라 이미지 및 자연어 명령어 ("공백 캔을 선택") 를 촬영하고 로봇 모터 명령을 직접 출력할 수 있었다. 이 돌파구는 큰 시각 언어 모델의 의미학적 지식을 "가울 수"라는 것을 이해하는 것, "공허"라는 의미는 이 훈련 중에 로봇이 본 적이 없는 물리적 조작 작업에 전달될 수 있음을 증명했습니다.

기술 메커니즘은 놀랍도록 간단했습니다. 로봇 동작을 텍스트 토큰으로 취급합니다. 7DOF 공동 위치는 문장의 다음 단어를 생성하는 것과 정확히 같은 언어 모델이 생성하는 분별된 숫자의 문자열이 됩니다. 언어 모델 인프라를 재사용함으로써 구글은 기존의 모든 확장 기술을 로봇 행동 영역에 적용할 수 있게 되었습니다.

RT-2의 한계는 규모였습니다. 구글의 독자적인 RT-X 로봇 함대와 대규모 컴퓨팅이 훈련되어야 했습니다. 구글 이외의 사람은 그것을 재생하거나 정렬할 수 없었습니다. 55B 매개 변수 수치는 또한 로봇 연구소가 합리적으로 감당할 수 있는 하드웨어에 실시간 추론을 실용적이지 않았습니다.

오픈VLA (스탠퍼드/버클리, 2024년 6월)

OpenVLA는 VLA 개념을 민주화시켰다. 오픈 X-Embodiment 데이터 세트에 훈련된 7.5 억 매개 변수 오픈소스 모델인 OpenVLA는 VLA 아키텍처가 대학 연구소와 스타트업이 실제로 정렬할 수 있는 규모에서 작동한다는 것을 증명했다. 단일 A100 GPU는 특정 로봇과 작업에 대한 OpenVLA를 24 시간 이내에 정렬할 수 있었다. 이것은 구글에 대한 독점적인 연구 결과로부터 VLA를 더 넓은 로봇 커뮤니티에 대한 실용적인 도구로 전환했습니다.

OpenVLA의 이중 시각 코더 설계 (말론적 기능과 공간적 기능의 DinoV2의 SigLIP) 는 이후의 VLA 아키텍처의 템플릿이되었습니다. SigLIP 코더는 객체가 무엇인지 이해하고, DinoV2 코더는 어디에 있는지 어떻게 지향되는지 이해합니다. 이 보완적 조화는 단일 앵코더 설계의 약점 중 하나를 해결합니다. 코더가 의미 분류에 최적화되었을 때 공간적 정확성이 고통받았습니다.

공개 후 6개월 이내에 OpenVLA는 전 세계 연구 그룹들에 의해 12개 이상의 다양한 로봇 플랫폼에 정비되었다. ResNet이 10년 전 컴퓨터 비전의 기본이 된 것과 마찬가지로 VLA 연구의 실질적인 기본이 되었다.

π0 (물리적 지능, 2024년 10월)

물리 지능의 π0 ("pi-zero") 는 RT-2와 OpenVLA에서 사용하는 디스크리트 토큰 예측을 대체하는 액션 생성 메커니즘으로 흐름 일치를 도입했습니다. 흐름 일치는 접촉 부가 많은 조작 작업, 예를 들어 세탁물 접거나 구성 요소를 조립하는 데 더 적합하는 원활하고 연속적인 동작 궤도를 생성합니다. π0는 지금까지의 모든 로봇 정책의 가장 광범위한 작업 일반화를 보여주며, 하나의 모델에서 여러 로봇 실시예에서 10 개 이상의 다른 조작 작업을 수행했습니다.

π0의 중요성은 기술뿐만 아니라 상업적이었기 때문에, 물리 지능은 일반적 목적으로 로봇 기반 모델을 구축하기 위해 400만 달러 이상을 모았습니다. 하나의 정책이 결국 모든 작업을 수행하는 모든 로봇을 제어할 수 있다고 베팅했습니다. 이 회사의 구글 딥마인드, UC 버클리, 스탠퍼드, CMU 등에서 최고의 연구자들을 모집한 것은 이 분야의 최고의 인재들이 일반적 로봇 정책을 다음 주요 연구 경선으로 간주한다는 신호를 내세웠다.

SmolVLA (HuggingFace, 2025년 3월)

SmolVLA는 VLA 모델들이 수십억 개의 매개 변수가 필요 없다는 것을 증명했다. 450 백만 매개 변수에서 SmolVLA는 단일 소비자 GPU에서 실행되는 동안 표준 벤치마크에서 OpenVLA 성능을 일치하거나 초과한다. SmolVLA는 단일 단계 토큰 예측보다는 쪼개진 액션 예측 헤드를 (ACT에서 영감을 받아) 사용하며, 보다 부드럽고 효율적인 액션 순서를 생성한다. 이 모델은 HuggingFace에서 사용할 수 있는 훈련 코드, 무게 및 평가 스크립트를 가진 완전히 오픈 소스입니다.

SmolVLA의 효율성 돌파구는 두 가지 설계 선택에서 비롯되었습니다. 7B LLM 대신 컴팩트 비전 언어 척추 (SmolVLM, 500M 매개 변수) 를 사용하여, 단 한 행동 대신 액션 덩어리 (50 시간 단계) 를 예측합니다. 덩어리 예측은 SmolVLA가 모든 단계 대신 50 단계마다 신경 네트워크를 호출한다는 것을 의미합니다. 추론 시점에 계산을 50배 감소시킵니다. 이것은 SmolVLA를 RTX 4090에서 소비자 하드웨어에 반응 조작을 위해 충분히 빠른 1530 Hz로 만듭니다.

물리적인 인공지능 연구 커뮤니티에 있어서 SmolVLA의 중요성은 접근성이다. 단일 소비자 GPU를 가진 대학원생은 이제 몇 시간 안에 로봇에 VLA 모델을 정밀하게 조정할 수 있습니다. 18개월 전에 불가능했습니다.

헬릭스 (아인형, 2026년 초)

FIGURE AI의 헬릭스는 인형 로봇을 위해 특별히 설계된 최초의 VLA입니다. 이전 VLA는 주로 테이블톱 조작 팔에 테스트되었지만, 헬릭스는 단일 모델에서 전체 신체 제어 이동, 팔 조작 및 손 기술 조정을 통합합니다. 세부 사항은 제한되어 있습니다 (헬릭스는 오픈소스 버전이 아닙니다), 그러나 FIGURE의 BMW 배포는 스테이지를 걷고 부품을 선택하고 조립 작업을 수행하는 여러 단계의 제조 작업을 보여줍니다.

헬릭스의 전신 접근법은 이전 VLA의 근본적인 한계를 해결합니다. 그들은 정지 기반을 가정하여 팔을 격리적으로 제어했습니다. 인형 로봇에 대해, 이동과 조작이 결합됩니다. 헬릭스는 이동과 조작에 대한 별도의 정책을 가진 계층 구조를 사용한다고 보고되어 있으며, 일반적인 시각 언어 척추를 공유하여 모델이 언제 걷고 언제 도달해야 하는지, 언제 둘 다 할 것인지 결정할 수 있습니다.

더 넓은 마일스톤 패턴

이 걸음돌들을 공동으로 살펴보면 명확한 패턴이 나타난다. 이 분야는 동시에 두 개의 축을 따라 진행되고 있다. 첫 번째 축은 단일 작업 정책 (2022) 에서 다 작업 VLA (2023) 까지, 교차 인체 일반주의 정책 (20242025) 까지, 전체 신체 인형 통제 (2026) 까지의 능력이다. 두 번째 축은 Google 스케일 컴퓨팅 (RT-2) 을 필요로 하는 폐쇄적 소스 55B 모델에서 소비자 GPU (SmolVLA) 에 정렬되는 오픈소스 450M 모델까지 접근성입니다. 두 축은 대략 병렬로 발전하고 있으며, 이는 최신 기술이 동시에 강력하고 접근성이 더 높아지고 있음을 의미합니다.

Year Milestone Parameters Open Source Min Fine-Tune Hardware
2023 RT-2 55B No N/A (closed)
2024 OpenVLA 7.5B Yes 2x A100
2024 Octo 93M Yes 1x RTX 3090
2024 π0 ~3B No N/A (closed)
2025 SmolVLA 450M Yes 1x RTX 4090
2026 Helix Undisclosed No N/A (closed)

물리 인공지능의 핵심인 데이터 문제

모든 물리적 AI 모델은 건축에 관계없이 훈련 데이터에 의해 제한됩니다. 이것은 이 분야의 근본적인 병목입니다. 물리적인 AI 시스템을 만드는 모든 사람에게는 그것을 이해하는 것이 필수적입니다.

물리 인공지능이 LLM보다 더 많은 데이터를 필요로 하는 이유

언어 모델은 수십 년 동안 수십억 명의 인간에 의해 생성된 텍스트의 토큰을 인터넷에서 훈련합니다. 물리 AI는 동등한 데이터 소스를 가지고 있지 않습니다. 모든 로봇 시범은 작업을 통해 로봇을 물리적으로 제어하는 인간 운영자가 수집해야합니다. 전체 오픈 X-Embodiment 데이터 세트 (최대의 공공 로봇 데이터 세트) 는 대략 2 백만 궤도를 포함합니다. GPT-4는 트리లియన్의 토큰에 훈련되어 있습니다. 데이터 격차는 계산 방법에 따라 1,000x에서 1,000,000x 정도입니다.

이 격차는 언어 AI 일반화에 비해 물리 AI 일반화가 왜 뒤떨어지는지를 설명합니다. LLM는 수백만 개의 관련 텍스트를 보았기 때문에 명시적으로 보지 못한 주제에 대한 시를 쓸 수 있습니다. 로봇 정책은 훈련 중에 몇 백 개의 휴지를 만났습니다.

품질과 양: 전문가의 텔레오퍼레이션 데이터

모든 로봇 데이터가 동일하지는 않습니다. 로봇 데이터 세트를 확장하려는 초기 시도는 적은 비용 (비디오 스크래핑, 크라우드 소스 텔레오퍼레이션) 을 사용하여 수천 개의 시범을 빠르게 수집하는 것에 초점을 맞추었습니다. 결과는 실망스럽습니다. 잡음적이고 불일치 않은 데이터에 훈련된 정책은 잡음적이고 불일치 않은 행동을 배웠습니다.

이 분야는 품질 우선 접근방식에 융합되어 있습니다. 고품질 하드웨어의 전문 운영자들에 의해 수집된 시범 사례가 적은 것은 중간 품질의 더 큰 데이터 세트보다 더 나은 정책을 만들어냅니다. 일관된 포착 전략, 원활한 궤도, 그리고 거의 100%의 작업 성공으로 이루어진 200명의 전문가 시범 사례의 데이터 세트에서는 2,000개의 다양한 품질의 데이터 세트를 능가할 수 있습니다. 이 때문에 RCSV의 [데이터 수집 서비스]T5) 는 훈련된 운영자와 표준화된 수집 프로토콜을 강조합니다.

신체 간 전송: 하나의 데이터 세트가 어떤 로봇을 훈련시킬 수 있습니까?

오픈 X-엠보디먼트 프로젝트 (Google DeepMind, 2023) 는 여러 로봇 유형의 데이터에 대한 훈련이 단일 로봇의 데이터에 대한 훈련과 비교하여 일반화를 향상시킨다는 것을 보여주었습니다. 22 개의 다른 로봇의 데이터에 대한 RT-2 모델은 로봇의 데이터에 대한 훈련에 비해 각각의 로봇에 대해 더 나은 성능을 보였다.

그러나, 교차체체 전송은 한계를 가지고 있다. 6DOF 팔과 30DOF 인형 사이의 형태학적 격차는 매우 크다. 현재 모델은 의미적 이해를 전송 (무엇을 잡아야, 어디에 배치해야 한다) 하지만 매우 다른 로봇 신체에 걸쳐 운동 전략을 (관절을 이동하는 방법) 전송하기 위해 어려움을 겪는다. 2026년 가장 실용적인 접근법은 의미 지형에 대한 교차 체형 데이터에 대한 사전 훈련이며, 이후 모터 제어용 타겟 로봇 데이터에 대한 정교 조정입니다.

데이터 형식 표준화 노력은 크로스 인보디먼트 전송을 실용화하는데 매우 중요한 역할을 해 왔습니다. RLDS 형식 (Open X-Embodiment에서 사용) 및 LeRobot 형식 (HuggingFace에서 사용) 은 서로 다른 로봇들 간의 행동 공간을 정상화하는 공통된 스키마를 제공합니다. 이러한 표준화가 없으면 모든 데이터 세트가 VLA 훈련과 호환되는 사용자 지정 사전 처리가 필요합니다. 이는 역사적으로 연구소와 로봇 플랫폼에서 데이터를 통합하는 현장을 막는 마찰입니다.

새로운 데이터를 수집하는 팀들을 위한 실질적인 권고 사항은 처음부터 표준화된 형식으로 기록하는 것입니다. RCSV의 데이터 파이프라인은 RLDS와 LeRobot 양식 양식을 내놓으며, 여러분의 시범이 커지는 크로스-인체체 훈련 데이터 생태계에 기여하고 미래 모델과 호환성을 유지하도록 보장합니다.

RCSV의 역할: 규모로 구조화된 전문가 시연

RCSV는 데이터 병목을 직접 해결합니다. 샌프란시스코와 올스턴 시설은 표준화된 데이터 수집 인프라를 갖춘 여러 로봇 플랫폼 ([OpenArm 1, DK1, Unitree G1](T6)) 을 유지합니다. 우리의 훈련된 운영자는 LeRobot, ACT 및 전파 정책 훈련 파이프라인을 호환하는 HDF5 및 RLDS 형식으로 시범을 생산합니다. 전형적인 데이터 수집 캠페인은 1 과업에 100500명의 전문가들의 시범을 제작하는데, 시범 캠페인을 위한 비용은 [ 파일럿 (100개의 시범) 또는 전체 캠페인을 위한 비용은 $8,000 (500개의 시범) ]

물리 인공지능 연구용 하드웨어 요구 사항

물리적 인공지능 시스템을 구축하는 데는 세 가지 수준에서 특정 하드웨어가 필요합니다. 훈련용 컴퓨팅, 데이터 수집용 로봇 플랫폼, 인식용 센서.

계산: 실제로 필요한 것

Task Minimum Hardware Recommended Cloud Cost (est.)
Fine-tune SmolVLA (450M) 1x RTX 4090 (24 GB) 1x A100 (80 GB) $2–4/hr
Fine-tune OpenVLA (7.5B) 2x A100 (80 GB) 4x A100 (80 GB) $8–16/hr
Train ACT policy from scratch 1x RTX 3090 (24 GB) 1x A100 (40 GB) $1–2/hr
Train Diffusion Policy 1x A100 (40 GB) 2x A100 (80 GB) $4–8/hr
Full VLA pre-training (7B+) 8x H100 (80 GB) 32x H100 $200–800/hr
Real-time VLA inference 1x RTX 4070 (12 GB) NVIDIA Jetson Orin N/A (onboard)

핵심 통찰력: 기존 VLA 모델을 정렬하는 것은 접근 가능하다 (일당 한 A100), 그러나 처음부터 새로운 기초 모델을 미리 훈련시키는 것은 대규모 연구소만이 감당할 수 있는 자원이 필요합니다. 이것이 OpenVLA 및 SmolVLA와 같은 오픈 소스 모델이 매우 중요한 이유입니다. 그들은 작은 팀들에게 가장 비싼 훈련 단계를 건너뛰는 출발점을 제공합니다.

로봇 무기: DOF 요구 사항 및 엔코더 해상도

물리 인공지능 연구에서는 학습하고자 하는 조작 작업을 수행하기 위해 충분한 자유도 (DOF) 와 코더 해상도를 가진 로봇 팔이 필요합니다. 조작 연구의 최소한의 실용적인 구성은 6 DOF (3 위치, 지향 3 개) 과 지잡이입니다. 숙련된 작업에 7+ DOF는 무공간 움직임과 과잉을 허용하는 것이 좋습니다.

Robot Arm DOF 적재 하중 Price Best For
OpenArm 1 6+1 (gripper) 1.5 kg $4,500 Tabletop manipulation, education, data collection
DK1 (bimanual) 2x 6+1 1.5 kg per arm $12,000 Bimanual tasks, ALOHA-style data collection
Franka Emika Panda 7+1 3 kg ~$30,000 Research benchmark standard, torque sensing
ViperX 300 6+1 0.75 kg $6,500 Budget research arm, ALOHA-2 platform
Kinova Gen3 7+1 4 kg ~$35,000 Assistive robotics, mobile manipulation

에코더 해상도는 중요하기 때문에 모방 학습 정책은 기록된 공동 위치의 정확성에 민감하다. ≥14 비트 해상도를 가진 절대적인 에코더 (0.02°) 는 권장된다. 오픈아름 1은 이 임계점을 충족하는 14 비트 자기 에코더를 사용한다.

반복성은 똑같이 중요합니다. 로봇이 미리미터 미만의 정확도로 기록된 위치에 돌아갈 수 없다면 기록된 시범과 정책 명령의 행동 사이의 대응이 깨집니다. 테이블탑 조작 연구를 위해 ≤0.5mm 반복성은 충분합니다. 정밀 조립 작업 (USB 연결 연결 장치, 스레드 스크류 삽입) 에 대해서는 ≤0.1mm가 필요합니다. 이는 연구 팔의 Franka Panda 클래스에 대한 실용적인 옵션을 제한합니다.

센서: 인식 스택

완전한 물리적 AI 데이터 수집 설치는 여러 센서 모다리티를 필요로 합니다.

  • RGB 카메라 (최저 3): 손목 장착 한 장, 각도 다른 각에서 두 개의 제3자 조회. 720p 최소, 30fps. 인텔 리얼센스 D435 또는 유사한. 예산: 카메라 당 $200400.
  • ** 깊이 감지:** 포인트 클라우드 생성용 최소 1개의 RGBD 카메라. 포착 계획 및 장면 재조사용으로 유용하다. 종종 RGB 카메라 중 하나와 결합된다 (RealSense는 둘 다 제공합니다).
  • ** 촉각 감지:** 접촉에 부합한 작업 (입장, 조립, 변형 가능한 물체) 에서, 촉각 피드백은 정책 성능을 크게 향상시킵니다. Paxini Gen3 촉각 장갑 은 능숙한 데이터 수집을 위해 22+ DOF의 힘 피드백을 제공합니다.
  • 프로프리오셉션: 로봇의 코더에서 합동 위치, 속도 및 토크 리딩. 이것은 일반적으로 로봇의 제어 API에서 1001000 Hz에서 제공됩니다.
  • ** 힘/토크럼 감지:** 손목에 있는 6축 F/T 센서는 접촉 작업에 중요한 데이터를 제공합니다. ATI Nano25 또는 OnRobot HEX는 일반적인 선택이다 ($3,000~$8,000).

데이터 수집 인프라 비용 분할

Component Budget Option Recommended Option
Robot arm OpenArm 1 ($4,500) DK1 bimanual ($12,000)
Cameras (3x) Logitech C920 ($60 ea.) Intel RealSense D435 ($350 ea.)
Compute (recording) Laptop with USB3 ($0, existing) Dedicated workstation ($2,000)
원격조작 input SpaceMouse Compact ($200) Paxini Gen3 gloves (contact RCSV)
F/T sensor None OnRobot HEX ($4,000)
Mounting / workspace Table + clamps ($200) T-slot frame ($800)
Total ~$5,200 ~$20,000

데이터 수집 인프라를 구축하고 유지하기를 원하지 않는 팀들을 위해 RCSV의 [데이터 수집 서비스] (T11) 는 파일럿 캠페인에 대한 2,500 달러에서 시작되는 열쇠를 제공합니다.

RCSV에서 물리 인공지능 연구 작업 흐름

다음 작업 흐름은 RCSV 인프라를 사용하여 전형적인 물리적 AI 연구 순환을 나타냅니다.

RCSV의 전형적인 물리 AI 연구 프로젝트는 작업 정의에서 반복적 평가까지 5 단계를 따르고 있습니다. 이 작업 흐름은 작업에 대한 특정 ACT 정책을 훈련하거나 큰 VLA 모델을 정렬하는 데 적용됩니다.

단계 1: 과제를 정의하고 전문가들의 시사 자료를 수집

연구자는 조작 작업을 정의합니다 (예를 들어 " 테이블에서 컵을 들고 쉐일프에 올려 놓습니다"). RCSV 운영자 또는 연구자는 [OpenArm 1]T12) 또는 [DK1]T13) 를 [SpaceMouse]T14) 또는 Paxini Gen3 장갑으로 사용하여 로봇을 작업을 통해 원격으로 작동합니다. 각 시범은 합동 궤도로 기록되며, 관중 위치, 카메라 이미지와 선택적으로 힘/토크 데이터를 포함합니다.

전형적인 수집률: 간단한 선택 및 배치 작업에 대해 시간당 2040 시범, 복잡한 다단계 작업에 대해서는 시간당 1020.

단계 2: RLDS/LeRobot 호환 데이터 세트에 데이터를 포맷

원시 시범 데이터는 표준화된 형식으로 변환됩니다. RCSV의 데이터 파이프라인은 [HDF5 (로보미믹/ACT) 및 RLDS/레로봇 형식] (OpenVLA, SmolVLA 및 Octo) (T15) 양쪽을 모두 출력합니다. 변환 과정은 액션 공간을 정상화하고 카메라 타임스테이머를 정렬하고 각 훈련 프레임워크에 필요한 메타데이터 파일을 생성합니다.

데이터 사전처리는 하류 정책 성과에 상당한 영향을 미치는 몇 가지 중요한 단계를 포함한다. 행동 공간 정상화 (모든 행동 차원을 [-1, 1]로 확장), 이미지 크기와 증강, 외상 필터링 (불정상적으로 긴 기간 또는 비정상적인 궤도를 가진 시범을 제거), 그리고 시간적 조율 (모든 센서 스트림이 공통 시계로 동기화되는 것을 보장합니다). 이러한 단계를 건너뛰거나 제대로 실행하지 않는 것은 AI 연구의 물리적인 훈련 실패의 가장 일반적인 원천 중 하나입니다.

3단계: 정책 을 훈련 시키십시오

목표에 따라 훈련 방법을 선택하세요:

  • ACT (Transformers) (변화기 사용): 작은 데이터 세트 (50100 데모) 에서 학습하기에 가장 좋습니다. 단일 GPU에서 28 시간 동안 열차합니다. 제한된 변동의 특정 작업에 좋습니다. 우리의 [ACT 가이드]를 참조하십시오.
  • 방포 정책: 다모달 액션 배포 (다중 유효한 전략의 작업) 에 대해 ACT보다 낫다. 약간 더 많은 데이터 (100200 데모) 및 계산이 필요합니다.
  • VLA 정렬 (OpenVLA 또는 SmolVLA): 언어 조건 작업이나 변동에 제로샷 일반화를 원하는 경우 가장 좋습니다. 200+ 디모와 적어도 A100 GPU를 필요로 합니다. 우리의 [VLA 모델 비교](T17 참조).

4단계: 로봇에 대한 평가

실제 로봇에 훈련된 정책을 적용하고 평가 실험을 실행하십시오. 표준 평가 프로토콜은 무작위로 초기 조건 (물질 위치, 방향) 을 가진 20 이상의 실험을 실행합니다. 성공률, 완료 시간 및 실패 모드가 기록됩니다. 전형적인 첫 번째 반복 성공률: 4070%. 데이터 세트 정비 및 재교육 후, 잘 정의된 작업에 8095%의 성공률이 달성됩니다.

5단계: 실패 사건 을 반복

평가 단계에서는 체계적인 오류 모드를 나타냅니다. 로봇은 특정 방향에서 객체를 떨어뜨리고, 객체가 작업 공간 경계 근처에있을 때 실패하거나 특정 구성에서 충돌 궤도를 생성합니다. 가장 효과적인 개선 전략은 목표 데이터 수집입니다. 만약 테이블의 왼쪽쪽에 배치된 객체에 대한 정책이 실패한다면, 왼쪽쪽에 배치된 3050개의 더 많은 시범을 수집하십시오. 이러한 목표형 접근법은 작업 분포 전반에 걸쳐 더 많은 데이터를 균일하게 수집하는 것보다 훨씬 효율적입니다.

이 반복- 수집-복습 루프는 일반적으로 잘 정의된 작업에 대한 23 주 cycle 내에서 konverges, 각 주기는 성공률을 1020 퍼센트 포인트로 향상시킵니다. RCSV의 데이터 수집 서비스는 이전 라운드에서 평가 결과를 기반으로 추적 데이터 수집을 대상으로 하는 반복적인 캠페인을 지원합니다.

2026년 물리 인공지능 응용 프로그램

물리 인공지능은 미래 기술이 아닙니다. 오늘날 특정 영역에서 데이터 수집 및 평가 인프라가 신뢰할 수 있는 운영을 지원하기에 충분히 성숙한 분야에서 배포되고 있습니다.

제조 및 조립

제조업은 물리적 인공지능이 생산에 도달한 첫 번째 영역이다. 주요 장점은: 제조 작업은 반복적이며, 이는 중소 데이터 세트 (200500 예제) 가 작업 분포를 포괄적으로 포착 할 수 있음을 의미합니다. VLA 기반의 조립 정책을 사용하는 BMW 및 여러 중국 자동차 제조업체에서 AI의 배포가 선두를 나타냅니다. 작업은 좁습니다 특정 구성 요소를 삽입하고, 미리 정의된 경로를 따라 케이블을 라우팅하지만 학습된 정책은 생산 환경에 필요한 신뢰성에 부합할 수 있음을 보여줍니다.

물류 및 창고

상자나 셰일프에서 다양한 객체를 뽑는 것은 물리적인 인공지능에 자연스럽게 적합합니다. 왜냐하면 객체 다양성 때문에 손으로 프로그래밍 된 솔루션이 실용적이지 않기 때문입니다. 코바리언트 (지금 아마존 로봇의 일부) 및 덱스터리티와 같은 회사는 수천 개의 다른 SKU를 처리하는 창고 선택에 VLA와 유사한 모델을 배포했습니다. 문제는 규모의 신뢰성입니다. 95%의 선택 성공률은 20개의 선택에 1개의 실패를 의미합니다. 이는 창고에서 하루에 100,000개의 선택을 처리하는 경우 인간 개입이 필요한 5,000개의 실패로 번역됩니다.

실험실 자동화

생물학, 화학, 재료 과학 분야의 연구실에서는 반복적인 실험 절차를 위해 물리 AI를 채택하고 있습니다. RCSV는 연구소 자동화 작업에 대한 데이터 수집 캠페인에 여러 학술 및 제약 연구소와 협력했습니다.

실험실 설정에서 물리적 인공지능의 핵심 장점은 적응력이다. 전통적인 실험실 자동화 시스템은 (액 처리 로봇과 같이) 특정 실험실용 장치에 특정 프로토콜을 위해 프로그래밍된다. 새로운 절차의 50100 예시를 수집함으로써 새로운 제어 코드를 작성하지 않고 새로운 프로토콜을 위해 물리 AI 기반 시스템을 재교육할 수 있습니다. 수십 개의 다른 실험 프로토콜을 실행하는 실험실에서는 이러한 유연성이 자동화 장벽을 줄여서 몇 달의 시스템 통합에서 몇 달의 시범 수집까지 줄여줍니다.

식품 서비스 및 농업

식품 취급은 물리적 인공지능에 대한 독특한 도전을 제시합니다. 변형 가능한 물체 (, 빵), 변수 텍스처 및 위생 요구 사항. 초기 배포는 물체 변이가 제한되어있는 샌드위치 조립 또는 과일 분류와 같은 구조화된 작업에 초점을 맞추고 있습니다. 농업 로봇 (결과 채집, 식물 검사) 은 식물 형태학과 조명 조건의 자연적 변형을 처리하는 물리 AI의 능력으로부터 이익을 얻습니다.

촉각 감지은 특히 음식 취급에서 중요하며, 시각적 외모는 성숙성, 확고성 또는 취약성을 신뢰할 수 없습니다. 시각적 및 촉각적 입력을 결합하는 물리 AI 시스템은 데이터 수집을 위해 [Paxini Gen3 촉각 장갑] (T18) 같은 센서를 사용하여 각 물체의 물리적 특성에 적응하는 포착력 모듈션을 배울 수 있습니다. 이 다모달 접근법은 물리 인공지능 연구의 가장 활발한 영역 중 하나이며 식품 가공, 농업 및 부드러운 또는 변형 가능한 물체를 포함하는 모든 영역에서 직접적인 응용이 있습니다.

물리 인공지능이 어디로 가고 있는지

세계 모델: 물리학 을 배우는 것, 단순한 행동 이 아니다

물리 AI의 다음 경계는 실행하기 전에 행동의 물리적 결과를 예측하는 세계 모델 신경 네트워크입니다. 현행 VLA처럼 관찰에서 행동으로 직접 지도를 만드는 대신, 세계 모델은 "만약 내가 F 힘으로 이 물체를 밀어넣으면, 그것은 D 거리를 슬라이드하고 각 R를 회전할 것이다". 이 내부 물리학 시뮬레이션은 계획을 가능하게 한다. 로봇은 한 가지로 전개되기 전에 수천 가지 가능한 행동을 정신적으로 평가할 수 있다.

구글의 지니 2, NVIDIA의 코스모스, 그리고 여러 학술 프로젝트 (UniSim, DayDreamer) 는 이러한 방향을 추구하고 있다. 큰 비디오 데이터 세트에 훈련된 세계 모델은 객체 역학을 예측하는 데 유망한 결과를 보여줍니다. 그러나 정확한 접촉 예측을 생성하는 것은 여전히 해결되지 않았습니다. 예측된 결과와 실제 결과 사이의 격차는 더 많은 데이터로 좁아지고, 이는 다시 대규모 물리적 상호작용 데이터 세트의 중요성을 강화합니다.

시미-투-리얼: 격차를 완화

시뮬레이션은 항상 물리적 인공지능에 매력적이었습니다. 왜냐하면 그것은 무한한 자유로운 데이터를 제공했기 때문입니다. 문제는 시뮬레이션에서 훈련받은 정책이 종종 실패합니다. 실제 로봇에 배치되면 시뮬레이션은 마찰, 변형, 조명 및 센서 소음을 완벽하게 캡처하지 않기 때문입니다. 최근 도메인 무작위화 (현실적 세계 변수를 커버하기 위해 시뮬레이션 매개 변수를 무작위화) 및 광현실적인 렌더링 (현실 카메라와 구별되지 않는 훈련 이미지를 생성하기 위해 신경성 광경 필드를 사용하여) 의 발전은 이 격차를 해소하고 있습니다.

2026 년 에는 하이브리드 훈련 이 실용적 인 접근 방식 이다. 기본 센서 모터 기술 을 위한 시뮬레이션 데이터 를 미리 훈련 시키고, 그 다음 목표 작업 에 대한 작은 실제 데이터 (50100 예제) 를 미세 조정 한다. 이 는 실제 데이터 요구 를 510x 감소 시키고, 배포 성능을 유지 한다.

NVIDIA의 아이작 시ム와 아이작 랩은 GPU 가속화 물리학, 광현실적인 렌더링, 인기 있는 훈련 프레임워크와 내장 통합을 제공하는 물리 인공지능 연구의 표준 시뮬레이션 플랫폼이되었습니다. MuJoCo (Google DeepMind에 의해 인수되었으며 현재 오픈 소스) 는 뛰어난 접촉 물리학 정확성 때문에 접촉 풍부한 조작 연구의 선호하는 시뮬레이터로 남아 있습니다. 시뮬레이터 중 선택은 당신의 작업에 달려 있습니다. 아이작 시미가 시각적 충실성과 대규모 병렬성을 위해, MuJoCo는 접촉 물리학 정확성을 위해.

시미-실적 접근법을 고려하는 팀들에서는 특정 로봇과 작업 환경의 정확한 시뮬레이션 모델을 구축하는 것이 중요한 투자입니다. 일반 시뮬레이션 환경은 특정 실제 세계 설정에 좋지 않은 전송입니다. 고충성 시뮬레이션을 구축하는 비용은 (CAD 모델링, 물리 매개 변수 식별, 시각 도메인 무작위) 일반적으로 엔지니어링 시간에서 $10,000~$50,000를 달리고, 그렇기 때문에 직접적인 실제 데이터 수집 (RCSV (RCSV) 2500달러부터 [T19)) 은 종종 중소 규모의 프로젝트에 더 경제적입니다.

체형 AGI: 긴 지평선

물리 AI는 인공지능의 전제 조건으로 인용된다. 물리 세계와 상호 작용할 수 없는 지능은 현실에서 실험, 구축, 테스트, 반복할 수 없다는 주장이 있습니다. 이 견해 를 지지 않든 지지 않든 실제적 궤도는 분명하다. 물리 인공지능 시스템은 매년 더 일반적이고 더 능력 있고 더 자율적인 시스템으로 발전하고 있다. "특정 한 수건을 접할 수 있다"와 "어떤 수건을 접할 수 있다" 사이의 격차는 좁아지고 있다. "수건을 접할 수 있다"와 "음식할 수 있다" 사이의 격차는 여전히 큰 편이지만 더 이상 명백히 불가결하지 않다.

구체화된 AGI의 핵심 개방적인 질문은 다음과 같습니다: 장평선 계획 (실실 축적 없이 수십 개의 하위 작업을 연쇄), 상식적인 물리적인 추론 (정책이 한 잔을 본 적이 없더라도 기울이면 한 잔의 물이 흘러가게 될 것을 알고) 및 안전한 탐구 (물질을 깨지 않고 사람들을 해치지 않고 새로운 행동을 배우는) 현재 물리적 인공지능 시스템은 이 모든 것을 종합적으로 다루지 않지만, 각각은 측정 가능한 연간 발전을 가진 활발한 연구 영역입니다.

규모 의 문제

물리 인공지능 연구의 지배적인 질문은 확장 법칙이 있는지 여부입니다. 더 많은 데이터에 훈련된 더 큰 모델이 지속적으로 개선되는 경험적 관찰은 언어와 시각에 적용되는 것처럼 로봇에 적용됩니다. RT-2 및 π0에서 초기 증거는 예라고 제안합니다. 더 다양한 훈련 데이터를 가진 더 큰 모델은 새로운 작업과 환경에 더 잘 일반화합니다. 하지만 데이터 수집 병목은 로봇 데이터 세트를 10배로 확장하는 것이 수천이 아닌 수백만 달러가 소요된다는 것을 의미합니다. 물리적 인공지능이 원활한 확장 곡선을 따르거나 현재의 데이터 스케일에서 고평도를 달성하는지 여부는 물리 지능과 인형 인공지능과 같은 회사들의 투자 수익을 결정하는 수십억 달러의 질문입니다.

오늘날 물리적 인공지능 시스템을 구축하는 전문가들에게는 그 의미는 실용적입니다. 데이터가 어떤 모델 아키텍처가 지배적인 것에도 불구하고 데이터가 한계 요소이기 때문에 고품질의 데이터 수집 인프라에 투자하십시오. 모델은 향상될 것입니다. 구조화된 시범을 효율적으로 수집하는 능력은 지속 가능한 경쟁 우위를 차지합니다.

시작: 당신의 첫 번째 물리 인공지능 프로젝트

물리적인 인공지능에 신규인 팀들을 위해 가장 효과적인 출발점은 단일 작업 모방 학습 프로젝트입니다. 이것은 문제를 몇 주가 아닌 몇 달 안에 달성할 수 있는 것으로 확대하고, 모든 물리적인 인공지능 프로젝트에 적용되는 핵심 기술 (데이터 수집, 훈련, 평가) 을 가르칩니다.

추천된 첫 번째 프로젝트

  1. ** 간단한 조작 작업을 선택하세요:** 하나의 객체 타입을 사용하여 픽업 및 배치 (예를 들어, "그리 한 잔을 들고 코스터에 올려 놓는다"). 첫 번째 프로젝트에서 다단계 작업, 변형 가능한 객체 및 정밀 삽입을 피하십시오.
  2. ** 100개의 시범을 수집하세요:** [SpaceMouse] (T20) 또는 리더-따라자 팔을 사용하세요. 간단한 작업에 35시간이 소요됩니다. 적어도 2개의 카메라 조회 및 공동 위치를 기록하세요.
  3. ** ACT 정책을 훈련하십시오:** ACT는 작은 데이터 세트에서 가장 용납하는 알고리즘입니다. 미세 조정은 단일 GPU에서 28 시간을 소요합니다. 가장 간단한 설정 경험을 위해 [LeRobot 프레임워크] (T21) 를 사용하십시오.
  4. 20개의 실험을 통해 평가한다: 컵 위치와 방향성을 무작위로 정렬한다. 각 실험에 성공/실패를 기록한다. 첫 번째 시도의 성공률은 50~70%가 정상적이고 격려적이다.
  5. ** 반복:** 실패 사례를 대상으로 한 3050개의 더 많은 시범을 수집합니다. 재훈련합니다. 한 반복 후 7590%의 성공을 기대합니다.

예제: 최소 물리 인공지능 훈련 스크립트

# Train an ACT policy on your demonstrations using LeRobot
# Assumes data is already collected and formatted

# pip install lerobot
from lerobot.scripts.train import train
from lerobot.common.policies.act.configuration_act import ACTConfig

# Configure ACT for your robot
config = ACTConfig(
    chunk_size=50,           # Predict 50 future actions
    n_obs_steps=1,           # Use 1 observation frame
    input_shapes={
        "observation.images.top": [3, 480, 640],
        "observation.images.wrist": [3, 480, 640],
        "observation.state": [7],
    },
    output_shapes={"action": [7]},
)

# Launch training (or use CLI):
# python lerobot/scripts/train.py \
#     --policy.type=act \
#     --dataset.repo_id=your_org/mug_pick_place \
#     --training.num_epochs=2000 \
#     --training.batch_size=8

첫 번째 프로젝트 비용 및 시간

Component DIY With RCSV Services
Robot hardware OpenArm 1: $4,500 (purchase)
or $800/mo (lease) Included in data service
Data collection (100 demos) 3–5 hours operator time $2,500 (pilot campaign)
Training compute ~$10 cloud GPU or own hardware ~$10 cloud GPU
Timeline 2–4 weeks (including setup) 1–2 weeks
Total cost $4,500–5,500 $2,500–3,300

RCSV에서 물리 AI를 시작하십시오:** 로봇 하드웨어, 전문가 시범 데이터 또는 훈련 파이프라인에 대한 지침이 필요하든, RCSV는 물리 AI 연구에 종전적 지원을 제공합니다. [2,500 달러의 데이터 수집 파일럿] (T22) 또는 [로봇 플랫폼을 임대하십시오] (T23) 월 800 달러에서 시작하십시오. [우리의 솔루션 팀과 연락하십시오] (T24) ] 프로젝트를 확장하기 위해.

주요 취품

  • 물리 AI는 구조화된 환경에서 구체적이고 잘 확장된 조작 작업에 실제적이고 현재도 사용가능하다. 아직은 인간 노동자를 대체하는 일반적 용도로는 아닙니다.
  • 데이터는 모델이 아닌 병목이다. 오픈소스 VLA 모델 (OpenVLA, SmolVLA) 는 대부분의 응용 프로그램에 충분하다. 제한적 인 요소는 항상 작업에 대한 특정 시범 데이터의 양과 품질입니다.
  • 작은 작업을 시작하세요. 100개의 시범, 하나의 로봇 팔, ACT 정책이 있는 단일 작업 프로젝트가 물리적 인공지능 작업 흐름을 배우고 기술이 사용 사례에 적합하는지 여부를 평가하는 가장 좋은 방법입니다.
  • ** 데이터 에 대한 양 보다 더 좋은 질.** 훈련 받은 사업자 들 의 전문가 들 의 시범 은 변수 품질 의 더 큰 데이터 집합 을 지속적으로 우월 한다. 수집 인프라 에 투자 하거나 전문 서비스 를 사용 한다.
  • 이 분야는 빠르게 움직이고 있습니다. 12 개월 전 (OpenVLA) 최첨단 모델은 이제 16배 더 작은 모델 (SmolVLA) 에 의해 우월합니다. 표준화된 데이터 형식은 모델이 개선됨에 따라 귀하의 시범이 여전히 가치있게 유지되도록합니다.
  • ** 하드웨어 비용은 급격히 감소했습니다.** 완전한 물리 AI 연구 설치는 (로봇 + 카메라 + 계산) 3년 전의 100,000달러+에서 5,000~20,000달러에 달한다.
  • 십자체육은 미래입니다. 표준화된 형식 (RLDS, LeRobot) 으로 데이터를 수집하는 것은 모든 참가자에게 유익한 공유 데이터 생태계에 기여합니다.

관련 독서

관련: VLA 모델 비교 · 행동 덩어리 변환기 · 데이터 서비스 · SpaceMouse 텔레오퍼레이션 가이드 · LeRobot 프레임워크 가이드 · 하드웨어 카탈로그 · 로봇 글자리