Blog(으)로 돌아가기

2025 년 모바일 조작: 최신 기술 및 실용적 배치

모바일 조작 로봇의 조사 <unk> 이동과 팔 조작을 결합하는 플랫폼, 능력, 알고리즘 및 실제 세계 배포.

[로봇 무기 가이드]

[← 블로그]

로봇 분야에서 가장 어려운 개방적인 문제는 2025년에 가장 활발한 투자와 연구를 유치하는 것입니다.

이동통신 조작 은 무엇 입니까?

모바일 조작은 이동 (환경을 통해 이동할 수 있는 능력) 과 조작 (물질들을 잡고 움직이고 상호작용할 수 있는 능력) 을 결합한 로봇을 의미한다. 이 조합은 로봇에게 고정된 위치에 가져온 물체에 대한 작업뿐만 아니라 작업의 위치에 이동할 수 있는 능력을 부여한다.

또한 조합이 그것을 어렵게 만듭니다. 고정 기반 팔은 알려진, 캘리브레이션 된 작업 공간에서 작동합니다. 이동 조작자는 잠재적으로 움직이는 플랫폼에서 정확히 알려지지 않은 기본 위치에서 훈련 구성과 다를 수 있는 환경에서 잡아야 합니다. 고정 기반에서 잡는 것은 고정 기반 조작과 비교하면 효과적인 잡기 오류를 3-5배 증가시킵니다.

건축 분류: 분리된 대 끝

이동 조작의 근본적인 건축적 선택은 항해와 조작을 별도의 하위 시스템으로 취급하거나 통합된 엔드-투-엔드 정책으로 취급하는 것입니다.

** 분리된 (navigate-then-manipulate):** 고전적 접근법. 탐색 계획자는 기지를 팔의 작업 공간 내에서 미리 계산된 자세로 이동시키고, 그 다음 조작 정책이 자리를 잡는다. 탐색 모듈과 조작 모듈은 별도의 모델, 별도의 훈련 데이터와 그들 사이의 전달 프로토콜을 가진 별도의 시스템입니다. 이는 산업적 배포에서 지배적인 접근 방식이기 때문에 모듈형이며 디버깅이 가능하며 각 구성 요소는 독립적으로 검증될 수 있습니다. 한계: 기본 자세는 조작 작업을 고려하지 않고 계산되며, 이는 최선 이하의 접근 구성으로 이어질 수 있습니다. 재 위치 설정은 5-15 초에 걸리며 로컬라이징 오류를 도입합니다.

** 엔드-투-엔드 (통일 정책):** 단일 신경 네트워크는 센서 입력 (카메라, 리더, 자체 수용) 을 취하고 기본 속도와 팔 공동 명령 모두 출력합니다. 모바일 ALOHA (Zipeng Fu et al., Stanford, 2024) 는 ACT 정책이 50 개의 텔레오퍼레이션 시범에서 전체 신체의 쌍방향 이동 조작을 배울 수 있음을 입증했습니다. 종결 접근 방식은 보다 원활하고 조정된 움직임을 만들어내는 것이지만 디버깅이 더 어렵고 더 많은 시범이 필요하며 안전 보장도 덜 제공한다.

** 계층적 (사업 수준 계획 + 학습된 기술):** 고급 계획자 (이 경우 기초 모델 또는 TAMP 시스템) 은 작업을 일련의 기술로 ("음원에 탐색", "열갑을 열어, "유를 잡") 분해하고, 각 기술은 전문 정책에 의해 실행됩니다. SayCan (Google, 2022) 및 TidyBot (Wu et al., Princeton, 2023) 이 건축을 사용합니다. 학습된 정책의 유연성과 명시적인 계획의 해석성을 결합합니다.

2025년 주요 플랫폼

Platform Price Type 적재 하중 Arms Key Strength
Hello Robot Stretch 3 $28,000 Wheeled + telescoping arm 1.5 kg 1 (4-DOF) ROS2, elder care, affordable
Mobile ALOHA (Stanford) $32K + base Wheeled + bimanual 3 kg each 2 (6-DOF ViperX) Bimanual, open-source, ACT-ready
Spot + Arm (Boston Dynamics) $100,000+ Legged + arm 4 kg 1 (6-DOF) Rough terrain, enterprise support
Unitree G1 $16,000 Humanoid (bipedal) 3 kg each 2 (7-DOF) Lowest cost humanoid, growing ecosystem
Unitree H1 $90,000 Humanoid (bipedal) 5 kg each 2 (7-DOF) Strongest humanoid arms, whole-body control
Fetch Robotics (OTTO) $150,000+ Wheeled + arm 6 kg 1 (7-DOF) Warehouse logistics, enterprise AMR
TIAGo Pro (PAL Robotics) $80,000+ Wheeled + arm 3 kg 1-2 (7-DOF) ROS2 native, RoboCup standard

주요 문서 및 시스템

모바일 ALOHA (스탠포드, 2024)

모바일 ALOHA는 엔드-투-엔드 모방 학습이 놀랍도록 유능한 전체 신체 이동 조작을 일으킬 수 있음을 보여주었습니다. 시스템은 바퀴 기반에 두 개의 ViperX 300 팔을 사용하며, 로봇 뒤에 걷는 인간 텔레오퍼레이터와 동시에 두 팔과 기초 움직임을 제어합니다. ACT (Transformers와 액션 킹) 정책은 50개의 텔레오퍼레이션 데모에 훈련되어 새우를 요리하고, 캐비닛을 열고, 부엌 카운터를 깨끗하게 하고, 의자를 밀어내는 작업을 배웠습니다.

주요 통찰력: 정적 ALOHA 데이터 세트 (Fixed-base ALOHA) 를 통해 공동 훈련은 정적 데이터에는 기본 움직임이 없어도 30-50%로 모바일 조작 성공을 향상시켰다. 공유된 조작 기술 전송, 정책은 모바일 데모에서만 기본 동작으로 구성하는 것을 배우게 됩니다. 이것은 실제 데이터 수집 부담을 크게 줄여줍니다.

티디봇 (프린스턴, 2023)

티디봇은 긴 지평선 청소 문제를 해결했습니다. 엉뚱한 방을 고려하면 모든 잘못된 물건을 가져다가 올바른 위치에 배치합니다. 그것은 높은 수준의 추론을 위해 LLM (GPT-4) 를 사용합니다 ("컵은 래프에 간다, "셔츠는 옷장에 간다") 그리고 실제 선택과 배치에 대한 학습된 조작 정책을 사용합니다. 탐색은 고전적인 SLAM + 계획 스택을 사용합니다. 핵심적인 기여는 언어 모델이 오픈 엔딩 가정 과제에서 작업 계획에 필요한 상식적 추론을 제공할 수 있다는 것을 보여주며, 낮은 수준의 실행은 신뢰할 수 있는 학습된 기술에 의해 처리됩니다.

SayCan (구글, 2022)

SayCan는 언어 모델을 토지 로봇에 연결할 수 있다. 자연어 명령 ("나는 내 음료를 흘렸어, 당신은 도울 수 있습니까?") 를 감안하면 LLM는 원시 기술 ("스폰지 찾아, "스폰지 모아서, "바람을 흘려서, "물면을 지우") 의 연속으로 계획을 제안한다. 각각의 기술에는 로봇의 현재 관찰에 의해 추정되는 연관된 성공 확률이 있습니다. LLM의 계획 확률과 기술 성공 확률의 산물으로 가장 좋은 행동을 선택합니다. SayCan는 모바일 Everyday Robot에서 단일 7DOF 팔을 가지고 실행되었으며, 모바일 조작이 요구하는 오픈 엔드 명령에 따라 LLM 기반 작업 계획이 처리 할 수 있음을 입증했습니다.

항해 조작 조정 과제

팔-기반 조정: 기반이 언제 움직여야 하며 팔이 언제 확장되어야 하는가? 인형 플랫폼 (H1, G1) 의 전체 체 제어 최적화는 기반과 팔을 통일된 운동 체인으로 취급한다. 바퀴형 플랫폼은 일반적으로 분리된 계획을 사용합니다.

** 조작 중 역학적 안정성:** 팔을 통해 힘을 적용하면 기지에 반응력이 발생한다. 제한된 작업 중 팔을 통해 20N 수평력을 적용하는 다리 로봇은 안정성을 유지하기 위해 동시에 발 접촉을 조정해야 한다. 이 전체 신체 힘 조율은 활발한 연구 문제이다. 바퀴판은 이 부분에서 이점을 가지고 있습니다. 반응력은 바퀴의 지질 마찰에 의해 흡수됩니다. 이는 발 접촉 동적보다 훨씬 더 쉽게 모델링 및 제어 할 수 있습니다.

** 이동 기반에서 Grab 포즈 추정:** 이동 기반에서 인식하는 것은 위치 불확실성을 포지션 추정에 도입합니다. 2cm의 기본 위치 오류는 정확성 작업에 대한 포지션 용납을 초과할 수 있는 포지션 포인트 오류로 퍼집니다. 이동 조작 시스템은 고 정확성 기반 현지화 또는 기본 위치 불확실성에 견고한 포지션 정책이 필요합니다.

수행 문제: 분리된 구조에서, 탐색 시스템은 로봇을 "전처 조작" 자세로 전달하고, 그 다음 조작 컨트롤러에게 넘겨줍니다. 이 수행은 실패점입니다. 기본 자세가 조작 정책의 훈련 분포에 속하지 않으면, 탐색이 성공했을 때에도 불구하고 조작이 실패합니다. 이 전달은 양방향이어야 합니다. 이 전달은 현재 자세가 적합하지 않은 경우 조작 컨트롤러가 기본 재 위치화를 요청할 수 있어야 합니다. 대부분의 현재 시스템에서는 이러한 피드백 루프가 잘 다루지 않습니다.

장거리 지평 상태 추정: 여러 분간 이동 조작 작업 (예를 들어, 방 청소) 에서, 로봇의 SLAM 기반의 위치가 유도적으로 축적됩니다. 로봇이 1 분 내에 물체를 들고 5 분 내에 특정 위치에 배치해야 한다면, 위치 오류는 배치 용납도를 초과할 수 있습니다. 루프 폐쇄, 알려진 랜드마크에 대한 이전, 조작 중에 시각 오도메트리 업데이트는 모두 필요하지만 계산적인 오버헤드를 추가합니다.

계획 방법 비교

Approach Task Horizon 일반화 Compute Data Needed Maturity
Whole-body control (WBC) Single skill Low (task-specific) High (1kHz QP) Dynamics model Production-ready for locomotion
Decoupled nav + manip Single skill Moderate Low SLAM map + manip demos Most deployed approach
End-to-end IL (ACT) Multi-step skill High (within task) Moderate (GPU) 50-500 teleop demos Research demos (Mobile ALOHA)
TAMP (작업 및 동작 계획) Multi-room High (combinatorial) Very high Domain specification Academic demos, limited production
LLM + skill library (SayCan) Open-ended Very high (language) High (LLM inference) Skill demos + affordance model Emerging (TidyBot, SayCan)
VLA end-to-end (pi0-style) Multi-step Very high Very high (7B+ model) Large-scale diverse demos Early commercial (Physical Intelligence)

모바일 조작에 대한 데이터 수집

이동 조작을 위한 텔레오퍼레이션 시범을 수집하는 것은 고정 기반 조작보다 더 어렵기 때문에, 운영자는 동시에 기반 운동과 팔 동작을 제어해야 한다.

  • 보행 뒤의 텔레오퍼레이션 (Mobile ALOHA 스타일): 운영자는 로봇 뒤에 걸어, 지휘자 팔을 통해 팔의 움직임을 제어하며 기둥이 운영자의 걷기 움직임을 따라가며 운영자에게 가장 직관적인데, 큰 물리적 공간을 필요로 하며, 기본 속도를 걷기 속도 (~1.5m/s) 에 제한한다. 기본 궤도가 중요하게 작용하는 작업에 적합합니다 (예를 들어, 물건을 들고 가구를 돌아다니는 경우).
  • VR 텔레오퍼레이션: 운영자는 VR 헤드셋을 사용하여 로봇의 관점에서 볼 수 있으며, 핸드 컨트롤러와 조이스틱을 통해 베이스 + 팔을 제어합니다. 원격 동작을 가능하게하지만, 접촉 작업에 대한 시범 품질을 떨어뜨리는 지연 (네트워크 20-50ms + 10ms 렌더링) 을 추가합니다. 조작 정확도가 중소된 탐색 무거운 작업에 가장 좋습니다.
  • 웨이포인트 기반 수집: 조작 시범법에서 기본 궤도를 분리하십시오. 먼저 로봇을 조작 전 포즈로 수동으로 운전 (또는 자율적인 탐색 스택을 사용) 하다가 고정된 기본 위치에서 조작 시범법을 수집하십시오. 운영자에게 더 간단하지만 조정된 기본 팔 움직임을 캡처하지 않습니다. 탐색과 조작이 시간적으로 겹치지 않는 작업에 가장 좋습니다.

RCSV의 데이터 수집 인프라는 세 가지 접근 방식을 모두 지원합니다. 샌프란시스코 시설은 모바일 조작 데이터 수집을 위해 800+ 평방 피트 이상의 구성 가능한 바닥 공간을 가지고 있습니다. 지상 진실 기반 추적을 위해 모션 캡처 수준의 현지화. 올스턴 시설은 코디도르 및 멀티룸 시나리오를 지원합니다.

실제 배포 사례

  • 실동 로봇 모시: 병원 부서에 공급 공급 및 의류 운송을 위해 배치 된 바퀴 이동 조작기. 2025 년 현재 20 개 이상의 미국 병원에서 상업적으로 배치되었습니다. 구조화된 환경 (ज्ञात 부서의 레이아웃, 라벨 된 저장 장소) 과 분리된 탐색 + 조작을 사용합니다.
  • 6 리버 시스템 (쇼파이파이): AMR 기반의 창고 채용 시스템으로 인간 노동자들에게 도움을 줍니다. 구조화된 쓰레기통 채용을 처리하고, 전체적인 이동통신 조작이 아닙니다. 제한된 이동통신 조작 (알린 물체, 알려진 위치) 이 오늘날 상업적으로 실행 가능한 것을 입증합니다.
  • ** 안녕하세요 로봇 스트레치 임상 시험:** 워싱턴 대학교와 조지아 테크 대학에서 가정에서 노인 진료 보조 작업 (물물을 찾아, 문을 열) 에 대한 스트레치 시험. 발표된 결과는 일상 생활 작업에서 65-80%의 성공을 보여줍니다. 망원경 팔 디자인은 전통적인 6 DOF 팔이 적합하지 않은 가정 환경에 잘 적합합니다.
  • Google DeepMind RT-2 on Everyday Robots: RT-2 VLA 모델은 구글 사무실 건물의 모바일 조작기 파병되어 부엌 청소와 책상 청소 작업을 수행했습니다. VLA 척추는 새로운 객체에 0샷 일반화로 (" 모니터 근처에서 사과를 가져와 콤포스트 버인에 넣으십시오") 다음 지침을 가능하게 했으나 조작 정확도는 5mm+ 용납량으로 제한되었습니다.

모바일 조작 데이터 격차

모바일 조작 연구의 가장 큰 병목은 데이터 부족이다. 고정 기반 조작 데이터 세트 (Open X-Embodiment, DROID, BridgeData V2) 는 수백만 개의 에피소드를 포함하지만, 모바일 조작 데이터 세트들은 수집이 어렵고 느리기 때문에 10-100배 작습니다. 이러한 데이터 격차는 모바일 조작 정책이 고정 기반 정책과 비교해, 특히 장기적인 작업에 대해 잘 훈련되지 않는다는 것을 의미합니다.

이 격차를 해소하기 위해서는 목적에 맞게 구축된 데이터 수집 인프라가 필요하며, 탐색을 위한 공간, 팔 상태와 함께 기초 오도메트리를 캡처하는 하드웨어, 그리고 전체 텔레오퍼레이션에 훈련된 운영자가 필요합니다. RCSV의 [데이터 수집 서비스] (T2) 는 이 격차를 직접 해결하고, 표준화된 모바일 조작 수집 프로토콜과 성과가 ACT, 방급 정책 및 VLA 정비 파이프라인을 호환하는 HDF5/RLDS 형식으로 ACT, Diffusion Policy 및 VLA 정비 파이프라인을 지원합니다. 파일럿 프로젝트는 2,500 달러에서 시작되며, 전체 모바일 조작 캠페인은 8,000 달러 +입니다.

관련 독서

  • [ALOHA 로봇 안내]
  • [Unitree G1 리뷰]
  • [오픈소스 휴마노이드 로봇 2025]
  • [VLA 모델 설명]
  • [Grasp 계획 조사]
  • [Teleop 데이터가 Sim를 왜 이길 수 있는지]
  • [데이터 서비스]
  • [로봇 렌징]
  • [사문]

모바일 조작 솔루션

RCSV는 모바일 조작 배포를 위해 하드웨어 컨설팅, 데이터 수집 및 시스템 통합을 제공합니다.

[해결을 탐구]