로봇 학습과 고전 로봇: 언제 각각을 사용해야 하는가 (2026)
로봇 학습과 고전 로봇: 인식 계획 및 제어 파이프라인을 포함하는 실용적인 의사 결정 프레임워크, 엔드-투-엔드 학습 정책, 하이브리드 아키텍처 및 2026 년 각 접근 방식이 승리할 때
[← 블로그]
논쟁은 어떤 패러다임이 더 좋은지에 대한 것이 아니라 주어진 상황에서 어느 쪽을 추구해야 하는지 알고, 그리고 점점 더, 어떻게 하나의 시스템으로 결합해야 하는지 아는 것에 관한 것입니다.
클래식 로봇: 인식 계획 제어 파이프라인
고전 로봇은 명시적이고 손으로 설계된 파이프라인을 따르고 있다. 인식 알고리즘 (일반적으로 구조화된 포인트 클라우드 처리, CAD 모델 일치 또는 캘리브레이션된 스테레오 비전) 은 기하학적 장면 표현을 생성한다. 계획 계층 (RRT*, CHOMP, 궤도 최적화, 또는 모델 예측 제어) 은 충돌 없는 경로를 목표로 계산한다. 제어 계층 (PID, 임피던스 제어, 컴퓨터 토크 제어) 은 엄격한 실시간 보증으로 계획된 궤도를 추적합니다. 각 단계는 엔지니어들이 검사하고 디버깅하고 공식적으로 확인할 수 있는 명확한 입력, 출력 및 실패 모드를 가지고 있습니다.
이 접근 방식의 강점은 미묘하지 않습니다. 고전 제어기는 결정적인 지연으로 1 kHz 제어 속도에 작동합니다. 그들은 리아푸노프 분석을 통해 공식적인 안정성 보장, 제어 장벽 기능을 통해 안전 제한 및 잘 이해 된 비용 기능을 통해 궤도 최적화를 제공합니다. 그들은 훈련 데이터를 필요로하지 않습니다. 그리고 그들이 실패했을 때, 실패 모드는 일반적으로 해석될 수 있습니다. 인식 오류, 불가능한 계획, 또는 추적 과잉. 규제자가 "로봇이 왜 그렇게 했습니까?"라고 묻는 환경에서 로봇을 배치하는 모든 사람들에게 고전적 제어는 학습된 정책이 할 수 없는 답을 제공합니다.
모든 손으로 설계된 파이프 라인은 설계자가 예상하지 못한 조건에 취약하다. 가시적인 물체에 붓금속 부품에 맞춰진 인식 모듈이 실패한다. 구조화된 작업장에 최적화된 운동 계획기는 엉망이 된다. 딱딱한 잡을 수 있도록 조정된 피판스 컨트롤러는 변형 가능한 물체에 실패한다. 새로운 상황에 고전 시스템을 확장하려면 더 많은 엔지니어링이 필요합니다. 더 많은 데이터가 아니라, 당신이 처리해야 할 가장자리 사례의 수와 함께 비용의 규모가 필요합니다.
클래식 도구 심층 다이빙: IK, 운동 계획, 힘 제어
클래식 스택의 특정 도구를 이해하는 것은 어떤 구성 요소를 학습으로 대체하고 어떤 구성 요소를 유지해야 하는지 평가하는 팀에 필수적입니다.
반반 운동학 (IK). 원하는 최종 효과자 자세를 고려하면 IK는 이를 달성하는 관절 각을 계산한다. 특정 기하학 (공업 팔의 대부분) 을 가진 6DOF 로봇에 대한 분석 IK 솔루션이 존재하며 마이크로초에 실행된다. 7DOF 과잉 팔 (프랑카, 오픈아름, 키노바 제3), KDL, TRAC-IK, 또는 IKFast 계산 솔루션과 같은 수치 IK 솔루션에 대해 1-10ms에 실행한다. IK는 신뢰할 수 있고 빠르고 잘 이해됩니다. 학습된 구성 요소로 대체하는 이유는 거의 없습니다. 완전히 학습된 정책조차도 일반적으로 IK를 통해 공동 명령으로 변환되는 최종 효과 목표물을 생성합니다.
모션 계획. RRT* (빠르게 탐색되는 랜덤 트리, 최적의 변형) 및 그 파생물 (BIT*, CHOMP, STOMP) 는 공동 공간 또는 작업 공간에서 충돌 없는 궤도를 계산한다. 계획 시간은 간단한 환경에서 50ms에서 오더러진 장면에서 2-5초에 달한다. 주요 한계: 계획자는 현장의 정확한 충돌 모델을 필요로 하며, 이는 알려진 객체 기하학 (CAD 모델에서) 또는 실시간 인식이 필요합니다. 혼란스럽고 알려지지 않은 환경에서, 인식 병목은 고전적인 계획에 취약합니다. MoveIt2는 대부분의 연구 분야에 대한 지원으로 표준 오픈 소스 운동 계획 프레임워크입니다.
포스 컨트롤. 임페덴스 및 입입 제어 는 로봇과 그 환경 사이의 기계적 상호 작용을 조절 한다. 임페덴스 제어 는 로봇 이 질량 스프링-담퍼 시스템 처럼 행동 하게 한다. 외부 힘 이 최종 효과자에 작용 할 때, 로봇 은 지정 된 딱딱함과 demp 에 따라 생산 한다. 입구 조절은 이것을 역전화시킵니다. 로봇은 힘과 동전 센서 데이터를 읽고 측정된 힘 오류에 비례한 위치 수정을 생성합니다. 이러한 컨트롤러는 수학적으로 우아하고 조정 가능하며 입증 가능한 안정적입니다. 하지만 로봇의 역학과 접촉 모델 매개 변수를 정확하게 알고 있어야 합니다. 힘 감지 통합에 대한 더 깊은 다이빙을 위해 [F/T 감지 가이드]
** 클래식 인식 파이프라인.** 전형적인 구조화된 인식 스택: RGB-D 카메라는 포인트 클라우드를 캡처합니다. 평면 세그먼트는 테이블을 제거합니다. 유클리드 클러스터링은 개별 객체를 격리합니다. 각 객체 클러스터는 알려진 CAD 모델 라이브러리와 (ICP 또는 PPF 일치) 를 사용하여 6 DOF 포즈를 추정합니다. 이 파이프라인은 빠른 (10~30ms/프레임), 알려진 객체 (sub-mm 포즈 추정) 에 대한 정확성이며, 모델 라이브러리에서 없는 객체에서는 완전히 실패합니다. 모든 새로운 객체에는 새로운 CAD 모델 또는 수동 캘리브레이션 단계가 필요합니다. 이는 연구팀을 학습된 인식으로 이끌 수 있는 엔지니어링 비용입니다.
로봇 학습: 종말부터 종말까지 배운 정책
로봇 학습은 손으로 만든 파이프라인을 데이터 기반 모델로 대체한다. [이미테이션 학습]
학습된 정책의 결정적 장점은 인식 복잡성과 환경적 변형을 간결하게 처리한다는 것입니다. 30 개의 다른 컵, 5 개의 조명 조건 및 다양한 테이블 위치에서 500 개의 "컵을 끌어 올리는" 시범을 통해 훈련된 정책은 명시적인 특징 엔지니어링 없이 31 번째 컵에 일반화되는 표현을 학습합니다. 이 정책에는 인식 모듈, 계획 모듈 및 제어 모듈이 없습니다. 그것은 픽셀과 자체 수용을 공동 명령에 지도하는 단일 모델을 가지고 있으며, 관련 추상화는 엔지니어들에 의해 설계되지 않고 데이터에서 학습됩니다.
이 능력은 비용이 든다. 학습된 정책은 불투명하다: 실패하면, 실패가 인식적, 계획과 관련된 것인지 또는 제어 실행 오류인지 진단하기가 어렵습니다. 그들은 상당한 훈련 데이터를 필요로합니다. 일반적으로 모방 학습을 위한 수백에서 수천 개의 시범 사례 또는 강화 학습을 위한 수백만 개의 시뮬레이션 단계를 제공합니다. 그들은 공식적인 안전 보장은 제공하지 않습니다. 그리고 그들의 행동은 예측할 수 없는 방식으로 변화할 수 있습니다. 배포 환경이 훈련 배포에서 약간이라도 바뀌면 말이죠.
고전적 로봇이 승리 할 때
정밀 조립 및 가공. 알려진 기하학에서 미리미터 미만의 반복성을 필요로 하는 작업. CNC 가공, 반도체 웨이퍼 처리, PCB 부품 삽입 및 정밀 가열은 고전적 컨트롤러들이 일상적으로 달성하고 학습된 정책이 보장할 수 없는 모든 요구 용납이다. 환경이 완전히 정해져 있고 물리학이 잘 모델링되면, 고전적 제어기는 더 빨리 배치되고 더 안정적으로 작동합니다.
** 잘 알려진 구조화된 환경.** 자동차 조립 라인, 의약품 포장 및 제어된 조명, 고정된 물체 위치 및 예측 가능한 물리 시스템을 가진 물류 분류 시스템은 고전적 로봇학의 자연 영역입니다. 모든 사례를 다루는 엔지니어링 투자는 제한적이고 관리 할 수 있습니다. 로봇이 직면할 모든 상황을 처리하는 결정적인 컨트롤러를 작성할 수 있을 때 훈련 데이터를 수집할 이유가 없습니다.
** 안전에 중요한 응용 프로그램.** 수술 로봇, 인간 근처에서 작동하는 협력 로봇 및 규제 인증이 필요한 임의의 배치는 고전적 제어에 사용할 수 있는 공식적인 검증 도구로부터 혜택을 누립니다. 제어 장벽 기능, 접근성 분석 및 최악의 경우 궤도 경계가 고전 시스템들에게 학습된 정책이 아직 달성하지 못한 안전 보장 수준을 제공합니다. 예를 들어 FDA는 현재 종말부터 종말까지 학습된 수술적 통제 정책을 인증하는 경로가 없습니다.
저연속 요구 사항. 고속 픽 앤 플레이스, 균형 또는 접촉 민감한 집합과 같은 미리초 이하 제어 응답을 필요로 하는 응용 프로그램은 고전 제어 루프에서 제공하는 결정적 시기가 필요합니다. 최적화된 하드웨어에서도 신경 네트워크 추론은 500 Hz 이상의 제어 속도에 문제가 되는 변수 지연을 도입합니다.
로봇 학습 이 승리 할 때
** 구조화되지 않은 환경.** 칸의 칸에 혼합된 물건을 분류하고, 혼돈된 집들을 탐색하고, 주방이나 레스토랑에서 객체 레이아웃이 끊임없이 변화하는 작업을 수행하는 것. 수천 개의 SKU 기하급수학에서 칸을 뽑는 클래식 컨트롤러를 작성하는 것은 끝없는 엔지니어링 프로젝트입니다. 다양한 시범에 대한 학습된 정책을 훈련시키는 것은 감소하지만 지속적인 수익률을 가진 데이터 수집 프로젝트입니다.
** 외관 조작.** 손가락 수준 조정, 변형 가능한 물체 취급, 또는 접촉 부적 인 상호 작용을 필요로 하는 작업. 옷 을 접는 것, 노트 를 묶는 것, 유연 한 케이블 을 삽입 하는 것, 그리고 음식 을 준비 하는 것 은 모두 물리학 을 포함 하고 있으며 분석적 으로 모델링 하는 것 은 너무 비싸다. 학습된 정책들은 그들의 행동의 물리적 결과를 관찰하고 훈련 데이터를 통해 암시적으로 적응하는 것이 이러한 작업을 어떤 엔지니어링 컨트롤러보다 훨씬 더 자연스럽게 처리합니다.
- 객체 인스턴스 간 일반화.** 로봇이 특정 인스턴스를 değil, 어떤 컵을 가져야 할 때. 모바일 로봇이 특정 바닥 플랜을 아닌 어떤 사무실을 탐색해야 할 때. 요리 로봇이 어떤 종류의 파스타 박스를 처리해야 할 때. 배치 시급에 새로운 인스턴스를 처리해야 할 때, 다양한 훈련 데이터에서 배운 표현이 필수적입니다. 클래식 인식은 새로운 물체 변종에 대해 재조직이 필요합니다.
** 프로그램 으로 지정 하기 어려운 과제.** "표 를 깨끗 하게 닦아라". "물 을 운송 도중 아무 것 도 변하지 않도록 포장 하라". "꽃 을 매력적 으로 배치 하라". 이 과제 들 은 인간 이 쉽게 평가 할 수 있지만, 수학적 비용 함수 로 표현 하기 어려운 객관적 성공 기준 을 가지고 있다. 모방 학습은 원하는 행동의 시범에서 임시적으로 작업을 학습함으로써 전개 문제를 완전히 회피합니다.
접근방식 비교 테이블
| Dimension | Classical Robotics | Learned Policies | Hybrid |
|---|---|---|---|
| Control frequency | 1 kHz deterministic | 10-50 Hz variable | 100-1000 Hz (classical inner loop) |
| Novel objects | Requires new models | Generalizes from data | Learned perception + classical plan |
| Safety guarantees | Formal verification available | No formal guarantees | Classical safety envelope |
| Setup time | Weeks-months (engineering) | Days-weeks (data collection) | Weeks (both) |
| Debugging | Inspect each module | Black-box, need ablation | Learned modules harder |
| Deformable objects | Very difficult to model | Learns from demonstrations | Learned contact + classical motion |
| Scaling cost | O(edge cases) engineering | O(data diversity) | Both, but reduced |
기존 팀 들 의 도구 비교
| Tool Category | Classical Stack | Learning Stack |
|---|---|---|
| Middleware | ROS2 Humble/Iron | LeRobot, RoboCasa, robomimic |
| Motion planning | MoveIt2, OMPL, Drake | N/A (end-to-end) |
| Perception | PCL, Open3D, FoundationPose | DINOv2, SigLIP (learned backbone) |
| Simulation | Gazebo, Drake | Isaac Sim, MuJoCo, Genesis |
| Control | ros2_control, impedance/admittance | ACT, Diffusion Policy, VLA inference |
| Languages | C++ (real-time), Python (scripts) | Python (PyTorch), C++ (deployment) |
하이브리드 접근법: 학습된 인식 + 고전적 계획 + 학습된 통제
2026년 가장 유능한 로봇 시스템은 하이브리드이며, 지배적인 것으로 나타난 특정 하이브리드 아키텍처는 상세히 이해가 가치가 있습니다.
** 학습된 인식 계층.** 신경 네트워크 (일반적으로 DINOv2 또는 CLIP와 같은 사전 훈련된 시각 기반 모델이 작업에 대한 데이터에 미세하게 조정되어) 는 카메라 이미지를 처리하고 구조화된 장면 표현을 생성합니다. 객체 포즈, 의미 레이블, 표면 정상, 포착 후보. 이것은 클래식 시스템의 허약한 손으로 만든 인식을 빛, 텍스처 및 객체 인스턴스에서 일반화되는 학습된 표현으로 대체합니다. 인식 계층은 10-30 Hz에서 실행되며 구조화된 데이터를 내보내기, 원시 동작이 아닙니다.
** 클래식 계획 계층.** 모델 예측 컨트롤러 (MPC) 또는 샘플링 기반 계획자는 인식된 현상 상태를 취하고 작업 목표를 달성하기 위해 충돌 없는 역동적으로 실행 가능한 궤도를 계산합니다. 이 층은 인식 모듈에서 정해진 기하학적 표현을 기반으로 작동하며, 클래식 기획이 우수한 안전 제한, 관절 제한 및 최적의 기준을 모두 적용합니다. 기획은 10-50 Hz에서 실행됩니다.
연습된 낮은 수준의 제어. 접촉이 풍부한 작업에 대해, 학습된 잔여 정책은 [포스 토크 센서]
이 건축은 두 패러다임의 강점을 포착합니다. 학습된 인식은 시각적 복잡성을 처리합니다. 고전적인 계획자는 안전 보장과 해석 가능한 행동을 제공합니다. 학습된 잔류 컨트롤러는 분석적으로 모델링 할 수없는 접촉 동화를 처리합니다. 구글 딥마인드의 조작 시스템, 생산에 배치된 아마존 창고 로봇 세포, 그리고 여러 수술 로봇 플랫폼은 2026년에 이 건축의 변형을 사용합니다.
기존의 클래식 로봇 팀의 전환 경로
만약 여러분의 팀이 고전적인 로봇 스택을 가지고 있고 학습 능력을 추가하고 싶다면, 위험을 최소화하는 권장되는 단계적 경로를 소개합니다.
- 단계 1: 인식만 교체하십시오. 손으로 만든 객체 탐지 및 포즈 추정을 학습된 모델 (FoundationPose, Grounding DINO, 또는 정비된 DINOv2 탐지) 로 교환하십시오. 클래식 계획자와 컨트롤러를 변경하지 않도록하십시오. 이것은 가장 낮은 위험의 학습 도입이며 일반적으로 가장 큰 즉각적인 개선 (CAD 모델이없는 새로운 객체를 처리합니다). 시간: 통합 작업 2-4 주.
- ** 2 단계: 학습된 포착 계획 을 추가 합니다.** 분석적 포착 계획 을 (만약 그 가 있다) 학습된 포착 품질 예측자 (GraspNet, Contact-GraspNet, 또는 AnyGrasp) 로 교체 하십시오. 학습 된 모델 은 예측 된 성공 에 의해 점수를 얻은 포착 후보 를 제안 합니다. 그리고 고전적 계획자 는 선택 된 포착 궤도를 생성 합니다. 시간 라인: 2-6 주.
- ** 3 단계: 학습된 잔재 제어 기능을 추가.** 클래식 임피던스 컨트롤러가 어려움을 겪는 접촉 부양 작업에 대해, 클래식 출력에 수정 사항을 추가하는 잔재정책을 훈련하십시오. 100
200개의 접촉 단계의 시범을 수집합니다. 전체 작업은 아닙니다. 잔재정책은 클래식 컨트롤이 모델링할 수 없는 "최후 센티미터"를 처리합니다. 시간: 데이터 수집을 포함하여 48주. - **단계 4: 익힌 구성 요소에 대한 경험이 있으면 익힌 종말 정책 (ACT 또는 퍼포먼스 정책) 이 특정 작업에 대한 하이브리드 스택보다 더 나은 여부를 평가하십시오. 일부 작업에 대한 대답은 예입니다. 특히 높은 시각적 복잡성과 적당한 정확성 요구 사항이있는 작업. 정밀 작업에 대해서는 하이브리드 접근 방식이 일반적으로 계속 승리합니다.
RCSV는 [데이터 서비스] (
실용적 인 의사 결정 프레임 워크: 다섯 가지 질문
새로운 로봇 응용 프로그램을 시작할 때, 이 다섯 가지 질문에 답하여 접근 방식을 결정하십시오.
1. 환경은 완전히 정해져 있고 안정적이냐 만약 그래 (공장 라인, 정서실, 구조화된 창고실) 에 있다면, 고전적인 제어로 시작하세요. 학습된 접근 방식보다 더 빠르고 더 안정적으로 배포할 것입니다. 만약 그렇지 않다면 (집, 레스토랑, 구조화되지 않은 창고) 적어도 인식 계층에서 학습이 필요합니다.
2. 새로운 객체 인스턴스를 처리해야 하는가? 로봇이 이전에 보지 못한 객체를 만나게 될 경우, 학습된 인식과 아마도 학습된 정책이 필요합니다. 클래식 인식은 모든 객체의 명시적인 모델을 필요로합니다. 객체 집합이 고정되고 알려져 있다면, 클래식 인식은 구현이 더 빠르고 신뢰할 수 있습니다.
3. 작업은 접촉 부적 인 또는 변형 가능한 물체를 포함합니까? 만약 그렇다면, 제어 계층에서 학습이 필요합니다. 고전적 접촉 모델은 변형 가능한 조작, 식품 취급 또는 직물 작업에 적합하지 않습니다. 학습 된 잔류 컨트롤러 또는 접촉 부적 인 시범에 훈련 된 완전히 학습 된 정책은 실제 길입니다.
4. 공식적인 안전 보장이나 규제 인증이 필요합니까? 만약 그렇다면, 다른 구성 요소가 학습되어 있음에도 불구하고 시스템 아키텍처는 고전적인 안전 계층을 포함해야 합니다. 제어 장벽 기능, 비상 정지 논리 및 작업 공간 경계 집행은 고전적이고 공식적으로 검증되어야 합니다. 학습된 구성 요소는 고전적인 계층에서 정의된 안전 봉투 내에서 작동합니다.
5. 데이터 예산은 무엇입니까? 학습된 정책은 시범 (이미테이션 학습에 대한 수백 가지의 시범) 또는 시뮬레이션 환경 (RL) 을 필요로 합니다. 특정 작업의 200~500개의 수준 높은 시범을 수집할 수 있는 예산이 있다면, 모방 학습은 실용적입니다. 그렇지 않으면, 최소한의 작업 특정 데이터를 가진 고전적 제어 또는 정교한 기본 모델 는 당신의 길입니다. RCSV의 [데이터 수집 서비스] ($2,500 파일럿 / $8,000 캠페인) 는 학습이 올바른 접근 방식이라면 데이터 세트를 효율적으로 구축하는 데 도움이 될 수 있습니다.
분류학 을 배우는 방법: 알고리즘 을 선택 하는 방법
학습 패러다임 내에서 알고리즘의 선택은 데이터 요구 사항, 컴퓨팅 비용 및 배포 특성에 중대한 영향을 미칩니다. 이 분류학은 2026 년부터 풍경을 지도합니다.
| Algorithm | Data Source | 샘플 효율성 | Reward Required? | Best Use Case |
|---|---|---|---|---|
| 행동 복제 (BC) | 50-500 demos | High | No | Short-horizon tasks with consistent strategy |
| ACT (Action Chunking) | 50-200 demos | High | No | Bimanual tasks, long-horizon with action chunks |
| Diffusion Policy | 200-1000 demos | Medium | No | Multimodal tasks with multiple valid strategies |
| VLA Fine-Tune (Octo/OpenVLA) | 20-200 demos | Very High | No | Novel object generalization, language-conditioned tasks |
| PPO (on-policy RL) | 10M-100M sim steps | Low | Yes (dense preferred) | Locomotion, continuous control with clear reward |
| SAC (off-policy RL) | 1M-50M sim steps | Medium | Yes | Dexterous manipulation in sim, sample-efficient RL |
| GAIL / IRL | 10-50 demos + sim | Medium | Learned from demos | Few demonstrations + good simulator available |
| Model-Based RL (Dreamer, MBPO) | 100K-1M steps | High (for RL) | Yes | Data-limited RL where world model can be learned |
2026년 대부분의 조작 팀의 실질적인 결정은: ACT 또는 디스포지션 정책 (이미테이션 학습) 을 시작하여, 객체 또는 언어 조건에 대한 일반화가 필요한 경우 VLA 미세 조정으로 이동하고, 정확한 시뮬레이터와 명확한 보상 기능을 가진 로코모션 또는 경우에 RL를 예약하십시오. GAIL 및 모델 기반 RL는 현재 틈새 역할을 차지합니다.
클래식 파이프라인 실패 모드
고전적 파이프라인들이 어떻게 실패하는지 정확히 이해하는 것은 팀들이 학습으로 대체하고 유지해야 하는 단계를 파악하는 데 도움이 됩니다. 인식 계획-관리 파이프라인의 각 단계는 특정 환경 조건에 따른 특징적인 실패 모드를 가지고 있습니다.
| Pipeline Stage | Failure Mode | Trigger Condition | Impact |
|---|---|---|---|
| Perception | Object not detected | Novel object geometry, transparent/reflective material | Complete task failure (no target) |
| Perception | Pose estimate off by >5mm | Symmetrical objects, partial occlusion, glare | Grasp misalignment, placement error |
| Planning | No feasible path found | Dense clutter, narrow passages, conflicting constraints | Task abort or timeout |
| Planning | Stale scene model | Dynamic environment, objects moved between perception and execution | Collision with moved objects |
| Control | Tracking overshoot | Aggressive trajectories, under-damped PID gains | Impact damage, position error at target |
| Control | Inadequate contact model | Deformable objects, unknown friction, compliant surfaces | Crush damage, slip, grasp failure |
| Integration | Timing desync between modules | High CPU load, ROS2 DDS congestion, GC pauses | Stale data used for planning, jerky execution |
패턴은 분명합니다. 인식 실패는 구조화되지 않은 환경에서 지배하고, 계획 실패는 혼란스러운 장면에서 지배하고, 제어 실패는 접촉 부양한 작업에서 지배합니다. 팀은 특정 배포에서 가장 많은 실패를 일으키는 단계를 학습하는 것으로 대체해야하며, 신뢰할 수 있게 작동하는 단계를 고전적으로 유지해야합니다.
잔여 정책 패턴: 고전적 통제에 학습을 추가
잔재 정책 패턴은 기존의 고전 시스템으로 학습을 도입하는 가장 안전한 방법입니다. 고전 컨트롤러를 대체하는 대신, 학습된 잔재 정책은 고전 출력 위에 수정 사항을 추가합니다. 전체 명령 동작은:
# residual_policy.py -- Classical + learned residual controller
import numpy as np
import torch
class ResidualPolicyController:
"""Adds learned corrections to classical impedance controller."""
def __init__(self, classical_controller, residual_model, max_residual=0.005):
self.classical = classical_controller
self.residual = residual_model # Trained policy network
self.max_residual = max_residual # 5mm max correction
def compute_action(self, obs, ft_reading, target_pose):
# Classical controller: impedance control toward target
a_classical = self.classical.compute(obs["joint_pos"], target_pose, ft_reading)
# Learned residual: correct for contact dynamics
with torch.no_grad():
residual_input = torch.cat([
torch.tensor(obs["joint_pos"]),
torch.tensor(ft_reading), # Force-torque sensor
torch.tensor(obs["wrist_image"]).flatten()
])
a_residual = self.residual(residual_input).numpy()
# Safety clamp: residual cannot exceed max_residual per joint
a_residual = np.clip(a_residual, -self.max_residual, self.max_residual)
return a_classical + a_residual
이 패턴은 삽입 작업 (peg-in-hole, 커넥터 짝짓기) 에서 성공적으로 배치되었으며, 고전 컨트롤러는 접근 궤도를 처리하고 잔여 정책은 피드백을 강요하기 위해 민감성을 필요로 하는 접촉 단계 수정 사항을 처리합니다. 잔여는 100-200 개의 접촉 단계의 시범에서만 훈련되며 데이터 요구 사항을 낮게 유지합니다. RCSV에서는 이러한 패턴을 [OpenArm 1]
계산 요구 사항 비교
각 접근 방식의 인프라 비용은 크게 다릅니다. 팀들은 건축에 대한 헌신이 되기 전에 이러한 요구 사항을 이해해야 합니다.
| Resource | Classical Pipeline | IL (ACT / DP) | VLA Fine-Tune | RL (Sim) |
|---|---|---|---|---|
| Training GPU | None | 1x RTX 3090/4090 | 1-4x A100/H100 | 1-8x A100 (Isaac Sim) |
| Training time | N/A (hand-tuned) | 2-8 hrs | 12-48 hrs | 24-120 hrs |
| Inference GPU | None (CPU only) | 1x RTX 3060+ | 1x A100 or H100 | Same as IL at deploy |
| Inference latency | < 1 ms | 20-100 ms | 200-500 ms | Same as IL at deploy |
| Disk/storage | < 100 MB (URDF, configs) | 50-200 GB (dataset) | 200 GB-2 TB | 50-500 GB (replay buf) |
| Engineering labor | High (weeks-months) | Medium (data + train) | Low-medium (fine-tune) | High (sim engineering) |
| Cloud cost estimate | $0/month | $50-200/train run | $500-3,000/train run | $1,000-10,000/run |
이 비용은 단일 작업 훈련 주기입니다. 다 작업 정책, 하이퍼 파라미터 스와이프 및 반복적인 데이터 수집은 그 결과 숫자를 곱합니다. 좁은 예산이있는 팀은 RCSV의 [데이터 수집 서비스]
실패 모드 분석: 클래식 시스템과 학습된 시스템을 진단
로봇 시스템이 실패할 때 근본 원인을 진단하는 것은 패러다임에 따라 근본적으로 다른 경로를 따르고 있습니다. 이러한 진단 프레임워크를 이해하는 것은 상당한 디버깅 시간을 절약합니다.
기전적인 파이프라인 실패 모드:
- ** 인식 장애.** 포인트 클라우드는 잡음적이거나 객체가 감지되지 않거나 포즈 추정치는 컨트롤러의 용납보다 더 이상 떨어져 있습니다. 진단: 오류 시간 단계에서 포인트 클라우드와 탐지 출력을 시각화하십시오. 수정: 세그먼트 매개 변수를 조정하거나 카메라 관점을 추가하거나 조명을 개선하십시오. 진단 시간: 몇 분에서 몇 시간.
- ** 계획 실패.** 계획자 는 어떤 해결책 을 반환 하지 않거나 (실행 불가능) 시간 을
거나 충돌 을 일으킨다. 진단: RViz2 에서 계획 현상 및 충돌 객체를 시각화 한다. 수정: 계획 시간을 늘리고, 허리 마진을 추가 하거나 충돌 모델을 단순화 한다. 진단 시간: 분. - ** 제어 실패.** 로봇은 목표 를 지나치고 오슬레이션 하거나 접촉을 유지 하지 못한다. 진단: 지표 관절 위치 추적 오류, 속도 프로파일 및 힘-토크 신호. 수정: PID 이득을 재조정, 피동성 매개 변수를 조정, 또는 궤도 속도를 줄일. 진단 시간: 시간.
- ** 통합 실패.** 모듈 간 시간 문제 - 계획자 는 구시된 인식 출력을 사용 하거나 제어기 는 실행 중 궤도 업데이트 를 수신 한다. 진단: ROS2 로그 에 메시지 시간표 를 확인 한다. 수정: 동기화 장벽 을 추가 하거나 반응적 재계획 아키텍처로 전환 한다. 진단 시간: 시간 부터 일 까지.
정책 실패 모드 학습:
- ** 분포 전환.** 객체는 훈련 데이터에 의해 충분히 다루지 않는 위치, 방향 또는 조명 상태입니다. 진단: 실패 관찰을 훈련 분포와 비교하십시오 (예를 들어, 정책의 비전 코더를 사용하여 거리를 내장하여 계산하여). 수정: 실패 사건을 다루는 더 다양한 시범을 수집하십시오. 진단 시간은: 시간에서 며칠.
- ** 모드 평균.** 정책은 두 가지 유효한 전략의 평균을 내놓으며, 둘 다 일치하는 궤도를 생성합니다. 진단: 배포 시각화는 로봇이 두 가지 접근 방식 사이에 의심을 나타내는 것을 보여줍니다. 수정: MSE 손실에서 멀티모달 아키텍처 (방포 정책, CVAE) 로 전환합니다. 진단 시간: 시간.
- ** 컴포넌트 오류.** 정책은 20-30 단계 후에 궤도에서 벗어나 회복할 수 없습니다. 진단: 시간 동안 단계별 행동 오류를 추적하고 가속화되는 분리를 관찰합니다. 수정: 행동 조각의 길이를 늘리고, 시간적 집합을 추가하거나 DAgger 데이터를 수집합니다. 진단 시간: 시간.
- ** 캘리브레이션 불합동.** 카메라 외부 부분은 데이터 수집과 배포 사이에 이동하여 정책적 행동에서 일관된 공간적 오프셋을 초래했습니다. 진단: 데이터 수집 과정에서 사용된 캘리브레이션에 대해 카메라 포즈를 측정합니다. 수정: 카메라를 재 캘리브레이션하거나 관찰 공간에 카메라 포즈를 추가합니다. 진단 시간은: 의심 한 번 분, 며칠.
공연적 함락: 연구팀들은 클래식 인프라 문제로 실제로 발생하는 오류에 대해 학습된 구성 요소를 비난하는 경우가 많습니다 (ROS2에서 고정된 TF 변환, 잘못된 카메라 외부, 잘못된 URDF 관절 제한). 신경 네트워크를 디버깅하기 전에, 클래식 파이프라인이 알려진 테스트 케이스에서 올바른 출력을 생성하는지 확인하십시오. 이 "고전적 정신 건강 검사는 RCSV에서 보고된 학습 시스템 실패의 30-40%를 파악합니다.
핵심 비대칭: 클래식 오류는 일반적으로 검사 가능한 입력과 출력을 가지고 있기 때문에 진단이 더 빨라집니다. 학습된 정책 실패는 훈련 데이터 유통에 대한 추론이 필요합니다. 이는 본질적으로 더 어렵습니다. 하이브리드 아키텍처는 학습된 구성 요소를 분리하여 클래식 진단 도구가 파이프라인 대부분에 적용되도록 부분적으로 해결합니다.
실제 세계 사례 연구
이러한 예는 고전적, 학문적, 그리고 하이브리드 접근 방식의 선택이 실제에서 어떻게 이루어지는지를 보여준다.
**상 1: 전자 연결기 삽입 (고전적 승점) ** 계약 제조업체는 PCB 소켓에 USB-C 연결기를 삽입하기 위해 로봇이 필요했습니다. 용납: +/- 0.15mm. 연결기 기하학은 알려져 있으며, PCB는 고정되어 있으며, 삽입 궤도는 제어된 힘으로 직선입니다. 삽입 지점에서 나선 검색을 하는 고전적 임피던스 컨트롤러는 10,000개의 실험에서 99.2%의 성공을 거두었습니다. 훈련 데이터가 필요하지 않았습니다. IL 접근법은 프로토타입으로 만들어졌으며 500개의 시범 끝에 94%의 성공을 거두었습니다. 더 높은 비용으로 더 나쁜 성능을 얻었습니다.
**상 2: 창고 칸을 뽑는 (학습 승점) ** 전자 상거래 채용 센터는 50개 이상의 SKU 카테고리를 포함하는 칸에서 임의로 물건을 뽑는 로봇이 필요했습니다. 칸은 부드러운 가방에서 딱딱한 상자까지 이상하게 모양의 전자제품까지 다양했습니다. 고전적인 포즈 추정 + 포지 계획 파이프라인은 78%의 선택 성공을 달성했습니다. DINOv2 척추를 가진 학습된 [그래스프 계획자] (Contact-GraspNet) 은 훈련 중에 볼 수 없었던 항목을 포함하여 모든 범주에서 93%의 선택 성공을 거두었습니다. 학습된 시스템은 3 주간의 데이터 수집 (4,000 개의 선택 시범) 을 필요로 했습니다.
** 3 차 경우: 식품 접착 (히브리드 승점) ** 식품 준비 시작은 로봇이 살라트 재료들을 미적 으로 유쾌 한 배열 으로 접착 할 필요가 있었다. 고전적 제어 는 개별 항목 (알은 부분 크기와 캘리브레이션 된 배급 장치) 의 정확한 배치 를 처리 하였다. 학습된 인식 모델 은 상공 카메라 사진 에서 재료 종류와 현재 접시 상태 를 확인 하였다. 숙련된 고급 계획자는 접은 식사들의 훈련 이미지들을 기반으로 구성 레이아웃을 생성하였다. 하이브리드 시스템은 인간 품질 평가자로부터 87%의 수용률을 달성하였다. 완전히 고전적 규칙 기반 시스템에서는 62%와 완전히 숙련된 엔드-투-엔드 정책에서는 79%에 비해.
MoveIt2 + 학습된 인식: 최소 하이브리드 예제
첫 번째 하이브리드 시스템을 구축하려는 팀들에서는 클래식 인식을 대체하는 학습된 객체 탐지기를 사용하여 움직임을 계획하기 위해 MoveIt2를 사용하는 최소한의 통합 패턴을 보여드리겠습니다.
# hybrid_pick.py -- Minimal hybrid: learned perception + classical planning
import rclpy
from moveit2 import MoveIt2
from groundingdino import GroundingDINO
import numpy as np
def hybrid_pick(node, moveit, detector, camera, prompt="the red mug"):
# --- Learned perception layer ---
rgb, depth = camera.capture()
detections = detector.predict(rgb, prompt) # GroundingDINO
best = max(detections, key=lambda d: d.confidence)
# Back-project 2D detection center to 3D using depth
cx, cy = best.center
z = depth[int(cy), int(cx)] / 1000.0 # mm to meters
x = (cx - camera.cx) * z / camera.fx
y = (cy - camera.cy) * z / camera.fy
target_pose = [x, y, z, 0, 0, 0, 1] # position + quaternion
# --- Classical planning layer (MoveIt2) ---
# Pre-grasp: approach from above
pre_grasp = target_pose.copy()
pre_grasp[2] += 0.10 # 10cm above
moveit.move_to_pose(pre_grasp)
# Grasp: descend with impedance control
moveit.move_to_pose(target_pose, velocity_scaling=0.3)
moveit.close_gripper(force=20.0) # 20N grip
# Lift
lift_pose = target_pose.copy()
lift_pose[2] += 0.15
moveit.move_to_pose(lift_pose)
이 25 줄의 예는 하이브리드 패턴의 본질을 담고 있습니다. 학습된 모델 (GroundingDINO) 은 언어 설명에서 임의의 객체를 찾는 인식 복잡성을 처리하고, MoveIt2는 적절한 공동 한계와 속도 제한으로 충돌 없는 궤도 계획을 처리합니다. RCSV에서, 우리의 [OpenArm 1]
데이터 요구 사항 비교
고전적 제어에는 시스템 식별 데이터가 필요합니다. 신중하게 설계된 캘리브레이션 실험에서 합동 위치, 속도, 토크, 그리고 힘-토크 센서 가수. 몇 시간 구조화된 실험은 일반적으로 충분합니다. 데이터는 적은 용량이지만 정확도가 높아야 합니다. 신경 네트워크 훈련이 포함되지 않습니다.
모방 학습은 일반적으로 작업당 200-1,000 개의 시범 에피소드를 필요로 하며, 각각 동기화 된 카메라 이미지 및 30-50 Hz에서 로봇 상태를 포함합니다. 수집 시간은 2 시간 (200 개의 간단한 작업의 디모) 에서 2 주 (1,000 개의 복잡한 작업의 다양한 객체) 까지입니다. 데이터 품질은 양을 지배합니다. 200 개의 깨끗한 시범은 1,000 개의 노이즈한 것을 능가합니다. 수집 비용에 대한 자세한 내용은 [모제 분석 비용]
기초 모델 정렬 (Octo, OpenVLA, RT-2에서 시작) 은 작업 특수한 시범이 훨씬 적은 것을 필요로 합니다. 일반적으로 50-200, 왜냐하면 사전 훈련된 모델은 강력한 시각적 및 행동적 예상을 제공하므로. 학습된 행동을 필요로 하는 제한된 데이터 예산이있는 팀에게는 가장 실용적인 접근 방식입니다. 사전 훈련 된 모델은 [Open X-Embodiment] (
강화 학습은 작업 물리학을 정확하게 모델링하는 시뮬레이션 환경을 필요로 합니다. 그 시뮬레이션을 구축하는 것은 자체적으로 상당한 엔지니어링 노력이지만, 일단 사용 가능하면 RL는 거의 0의 임저 비용으로 수백만 개의 훈련 에피소드를 생성 할 수 있습니다. 문제는 [sim-to-real transfer] (
잔여 정책 학습: 두 세계 중 가장 좋은 것
잔여 정책 학습은 고전적 컨트롤러 위에 학습된 수정을 부착하는 특정 하이브리드 아키텍처입니다. 클래식 컨트롤러는 기본 동작을 제공합니다 (예를 들어, 목표 포즈로 이동, 삽입력을 적용), 그리고 학습된 잔여 네트워크는 클래식 컨트롤러가 할 수 없는 변수를 처리하기 위해 행동을 조정하는 작은 수정 (일반적으로 +/- 5mm 위치에서, +/- 5도 방향에서) 를 내보내게 됩니다.
이 건축은 종결 학습에 비해 몇 가지 구체적인 장점을 가지고 있습니다.
- 건설에 의한 안전. 잔여는 제한되어 있습니다. 학습된 네트워크는 클래식 궤도에서 제한된 양만 벗어날 수 있습니다. 학습된 구성 요소가 완전히 실패할 경우에도 (실을 출력) 클래식 컨트롤러는 여전히 합리적인 행동을 실행합니다.
- ** 샘플 효율.** 잔여 네트워크는 전체 조작 궤도를 배우는 것이 아니라 수정만 해야 합니다. 이것은 많은 작업에 필요한 시범을 200-500 (끝에서 끝) 에서 50-100 ( 잔류 학습) 로 줄입니다.
- ** 해석 가능한 오류 모드.** 시스템 오류가 발생하면, 클래식 컨트롤러를 혼자 실행하고 비교함으로써 클래식 컨트롤러 또는 잔해 수정 오류가 있는지 확인할 수 있습니다.
- ** 증강 배포.** 생산 중인 고전적 컨트롤러를 시작하여 유효한 후에 잔재 수정을 추가하십시오. 제어 스택의 큰 반이 교체되지 않습니다.
# residual_policy.py -- Classical + learned residual
import numpy as np
class ResidualPolicy:
"""Wrap a classical controller with a learned residual correction."""
def __init__(self, classical_controller, residual_network,
max_pos_residual=0.005, max_rot_residual=0.087):
self.classical = classical_controller
self.residual_net = residual_network
self.max_pos = max_pos_residual # 5mm
self.max_rot = max_rot_residual # 5 degrees in radians
def predict_action(self, observation):
# Classical controller produces baseline action
base_action = self.classical.compute_action(observation)
# Learned residual predicts correction from visual observation
raw_residual = self.residual_net(observation['image'])
# Clip residual to safety bounds
pos_residual = np.clip(
raw_residual[:3], -self.max_pos, self.max_pos)
rot_residual = np.clip(
raw_residual[3:6], -self.max_rot, self.max_rot)
# Apply correction to classical action
corrected_action = base_action.copy()
corrected_action[:3] += pos_residual
corrected_action[3:6] += rot_residual
return corrected_action
RCSV 평가에서, 잔재 정책은 훈련 데이터의 25-50%와 함께 끝에서 끝까지의 성능의 90-95%를 지속적으로 달성합니다. 잔재 학습 실험에 이상적인 기반을 제공하는 잔재 학습 실험을 위해 최적의 기반이 되는 MoveIt2 기반의 고전 컨트롤러를 탑재합니다.
이주 경로: 고전적 으로부터 하이브리드 으로부터 학습 된 으로 이동
기존의 고전적인 로봇 시스템을 가진 팀들은 학습된 구성 요소로 이동하는 데 있어 학습의 이점을 파악하면서 위험을 관리하는 단계적 접근 방식을 따르어야 한다.
- **단계 1: 학습된 인식, 클래식적 모든 것 (2
4주) ** 학습된 탐지기 (GroundingDINO, SAM2) 로 고정된 시력 파이프라인을 대체하고 MoveIt2 계획 및 피동력 조절을 유지하십시오. 이것은 일반적으로 새로운 객체를 포함하는 작업에서 안전성 중요한 제어 스택에 변화가 없이 1025%의 성공률을 향상시킵니다. 위험: 낮습니다. - ** 2 단계: 잔재 수정 (4-8 주) 를 추가한다.** 클래식 시스템 이 성공하지만 더 정확하거나 더 많은 객체 변종을 처리 할 수 있는 경우 50-100 개의 시범을 수집한다. 시각적 관찰에 기초하여 클래식 궤도를 수정하는 잔재 정책을 훈련한다. 이것은 객체 변동성이 높은 작업에서 성공률을 또 다른 5-15% 향상시킵니다. 위험: 낮은 (한계 잔재).
- ** 3단계: 클래식 안전 계층 (8
16주) 을 가진 종말부터 종말까지 학습된 정책.* 하이브리드 접근의 성능 천장이 충분하지 않은 작업에 대해 200500개의 시범을 통해 완전한 모방 학습 정책을 훈련시켜, 관절 제한, 속도 제한 및 힘 제한을 부각하는 클래식 안전 계층으로 포장한다. 이 방법은 최대한의 유연성을 제공하지만 더 많은 데이터와 더 신중한 검증을 필요로 합니다. - **단계 4: 기초 모델 정렬 (가행중) ** 기초 모델이 성숙함에 따라, 기초 모델이 개선됨에 따라 위험은: 중간이지만, 기초 모델이 개선됨에 따라 감소한다.
대부분의 RCSV 클라이언트는 1-2 단계에 있습니다. 핵심 원칙은: 학습된 버전이 특정 배포 배포에서 그것을 더 잘 수행하지 않는 한, 작동하는 고전적인 구성 요소를 학습된 것으로 대체하지 마십시오. 학습된 구성 요소는 기능을 추가하지만 실패 모드를 추가합니다.
경향: 학습이 확장 되고, 고전적 은 사라지지 않는다
이 분야의 궤도는 분명하다. 로봇 학습은 기존에 고전적 통제가 지배하던 영역으로 확장되고 있다. 공장 조립, 물류, 품질 검사. 기초 모델은 이전에는 많은 응용 분야에 학습이 불가능했던 데이터 요구 사항을 줄이고 있다. 그리고 하이브리드 아키텍처 패턴은 클래식 시스템에서 학습된 기능을 추가하는 것을 가능하게 하고 있습니다.
하지만 고전적 로봇은 사라지는 것이 아닙니다. 그것은 학습된 능력들이 층층화된 안전과 정확성 기판이 되고 있습니다. 학습을 통해 실제 세계 변동성을 처리하는 2026 년 모든 생산 로봇 시스템에는 또한 학습된 정책이 로봇을 테이블로 몰아넣지 않거나 공동 한계를 초과하거나 위험한 힘을 적용하지 않도록 보장하는 고전적 컨트롤러가 포함되어 있습니다. 학습과 고전 사이의 논쟁은 건축의 문제로 해결되고 있습니다. 어떤 구성 요소가 학습되고, 어떤 구성 요소가 설계되고, 어떻게 상호작용하는지에 대한 것입니다.
하이브리드 시스템 테스트: 평가 프로토콜
하이브리드 시스템을 평가하기 위해서는 각 구성 요소를 독립적으로 테스트하고, 통합 시스템을 테스트해야 합니다. 이 세 단계 평가에서는 구성 요소 수준의 테스트가 놓친 통합 문제를 파악합니다.
- ** 1 차원: 구성원 평가.** 학습된 인식 모듈만 테스트: 100개의 유지된 이미지에 실행하고 탐지 정확성과 위치 오류를 측정합니다. 고전 컨트롤러만 테스트: 기본 진실 객체 포즈를 부여하고, 파악 성공률을 측정합니다. 통합 시스템을 테스트하기 전에 둘 다 개별적으로 90%를 초과해야 합니다.
- ** 2 차원: 통합 평가.** 학습된 인식을 고전적 컨트롤러와 연결하고 50개의 엔드-투-엔드 테스트를 실행한다. 통합된 성공률은 컨트롤러를 통해 인식 오류가 합병되기 때문에 각각의 구성 요소의 개별 비율보다 낮을 것이다. 잘 통합된 시스템은 약한 구성 요소의 독립적인 비율에서 5-15%를 잃는다.
- ** 3 차원: 견고성 평가.** 새로운 물체, 변화된 조명, 카메라 위치 등이 있는 장애물 아래 통합 시스템을 테스트합니다. 이 때 학습된 구성 요소는 완전히 고전적인 시스템을 능가해야 합니다 (감각 장애에 취약하다).
새로운 프로젝트를 시작하는 팀들을 위해 RCSV는 두 가지 패러다임을 지원합니다. 우리의 [데이터 서비스] (
관련 독서
이미테이션 학습 가이드 · 포스 토크 감지 가이드 · 시민-실적 전송 가이드 · 발전 체크리스트 · 팔 비교 · 데이터 서비스 · RCSV 플랫폼
로봇 응용 프로그램 을 구축
프로젝트가 고전적 제어, 학습된 정책 또는 둘의 하이브리드에 필요한지 RCSV는 배포에 필요한 하드웨어, 데이터 및 엔지니어링 지원을 제공합니다.
[데이터 서비스를 참조]







