Guides(으)로 돌아가기

로봇 기술에 대한 기계 학습: 초보자 본격적인 가이드 (2026)

기계 학습이 현대 로봇을 어떻게 지원하는지 알아보세요.

기계 학습은 현대 로봇을 어떻게 지원하는 지 모방 학습과 강화 학습에서 기초 모델까지 실제 하드웨어로 시작하는 실질적인 로드맵

왜 지금 로봇에 기계 학습이 필요한지

수십 년 동안 로봇은 명시적인 지침으로 프로그래밍되었습니다. X의 조정으로 이동, 꽉 잡기, 30mm를 들어 올리기, Y의 조정으로 이동. 이것은 모든 물체가 알려진 위치에있는 구조화된 공장 환경에서 작동했습니다. 그러나 구조화되지 않은 환경에서 재앙적으로 실패했습니다.

기계 학습은 로봇이 손으로 작성한 규칙보다는 데이터에서 행동을 배울 수 있게 함으로써 이 방정식을 바꾸었습니다. 가능한 모든 시나리오를 프로그래밍하는 대신 로봇의 예를 보여줌으로써 일반화하도록 합니다. 이 개념은 새로운 것이 아닙니다.

실용적 인 방법 을 만들어 낸 세 가지 발견

  • 로봇에 적용된 트랜스포머 아키텍처 (2022-2024): 대형 언어 모델을 작동시키는 동일한 관심 메커니즘은 로봇 관측 순서를 처리하는 데 매우 효과적이라는 것을 증명했습니다. 구글의 RT-2, 스탠퍼드의 ACT 및 디스푸이션 정책 작업은 트랜스포머 기반 모델이 비교적 온화한 데이터 세트에서 복잡한 조작 행동을 배울 수 있음을 보여주었습니다. 이것은 수백만 개의 상호작용 샘플을 필요로 하는 이전 접근 방식과 한 단계의 변화였습니다.
  • 기본 모델 및 비전 언어 행동 모델 (2024-2026): OpenVLA, RT-X, Octo와 같은 모델은 사전 훈련된 단일 모델이 다양한 로봇 구현, 작업 및 환경에 걸쳐 일반화 될 수 있음을 보여주었습니다. 새로운 작업에 대한 처음부터 훈련하는 대신 몇 백 개의 시범으로 기초 모델을 정렬합니다. 이것은 수천 개의 에피소드에서 수백 개의 에피소드로 데이터 요구 사항을 줄였습니다. 그래서 실제 로봇 학습은 소규모 팀에 실용화되었습니다.
  • ** 저렴한 용량 있는 하드웨어:** 6DOF 팔, 손목 카메라, 계산을 가진 완전한 로봇 학습 설치는 이제 [OpenArm] (T0) 및 SO-101과 같은 플랫폼으로 5,000 달러 이하의 비용입니다. 5 년 전, 동등한 설치는 5만 달러 이상의 산업 하드웨어가 필요합니다. 비용 절감으로 인해 전까지는 하드웨어를 감당할 수 없었던 대학 연구소, 스타트업 및 개인 전문의들에게 로봇 ML 연구가 개방되었습니다.

그 결과, 2026년, 대학원생이나 스타트업 엔지니어가 로봇을 훈련시켜 50~200개의 시범을 통해 주말에 새로운 조작 작업을 수행할 수 있습니다.

로봇 ML 에 대한 4 가지 주요 방법

로봇 기계 학습은 하나의 기술 이 아닙니다. 각각의 강점, 데이터 요구 사항 및 사용 사례가 다른 네 가지 주요 접근 방식이 있습니다. 각각의 사용 시점을 이해하는 것이 가장 중요한 전략적 결정입니다.

Approach How It Works Data Needed Best For Limitations
모방 학습 Robot learns from human demonstrations (teleoperation recordings) 50-500 demonstrations per task 조작 tasks with clear human strategy: pick-and-place, assembly, tool use Cannot exceed demonstrator skill; struggles with tasks requiring exploration
Reinforcement Learning Robot learns by trial and error, maximizing a reward signal Millions of trials (usually in simulation) Locomotion, dynamic tasks, behaviors that exceed human capability Requires careful reward design; sample-inefficient; sim-to-real gap
시뮬레이션-현실 전이 Train in simulation, transfer learned policy to real robot Unlimited (simulated), plus domain randomization Tasks where simulation is accurate: locomotion, grasping simple shapes, navigation Reality gap for contact-rich manipulation; sim fidelity limits policy quality
Foundation Models / VLAs Large pretrained models fine-tuned for robot control using vision and language 10-100 demonstrations for fine-tuning (pretrained on millions of diverse robot episodes) General-purpose manipulation, language-conditioned tasks, multi-task robots Compute-heavy inference; still maturing; may not match specialist policies on specific tasks

대부분의 초보자들에게 이미테이션 학습은 올바른 출발점입니다. 그것은 입학에 대한 가장 낮은 장벽을 가지고 있으며, 가장 빠른 작업 정책을 생성하고, 어떤 접근법을 전문화하더라도 필요한 데이터 수집 및 평가 기술을 구축합니다.

깊이 잠수: 모방 을 배우기

모방 학습 (도 예시를 통해 학습) 은 로봇이 새로운 조작 작업을 수행하도록 하는 가장 실용적인 접근법입니다. 핵심 아이디어: 인간이 원하는 행동을 통해 로봇을 여러 번 원격으로 작동시키고 로봇은 관찰 (카메라 이미지, 공동 위치) 에서 행동 (공동 속도 또는 위치 명령) 까지 지도를 학습합니다.

행동 복제

가장 간단한 형태의 모방 학습은 행동 복제 (BC) 이다. 문제를 감독된 학습으로 취급한다. 시범 궤도를 수집 (관측-행동 쌍의 순서), 다음 관찰을 받은 행동을 예측하기 위해 신경 네트워크를 훈련한다. 추론 시, 로봇은 현재 상태를 관찰하고 훈련된 네트워크를 통해 먹이고 예측된 행동을 실행한다.

행동 복제법은 구현하기 쉽고 훈련하기 쉽고 빠르게 하지만 근본적인 결점이 있다. 복제 오류이다. 로봇이 증명된 궤도에서 약간 벗어날 경우 (그리고 항상 그렇게 한다) 훈련 중에 보지 못한 관찰을 만나고, 점점 더 나쁜 예측을 초래한다. 이 때문에 순진한 행동 복제제는 종종 긴 지평선 작업에서 실패한다. 아래와 같은 해결책은 이 문제를 해결합니다.

ACT (전환기 사용으로 액션 킹)

2023년 스탠퍼드에서 토니 자오 등이 도입한 ACT는 단일 다음 단계의 행동을 대신 미래의 행동을 단위로 예측함으로써 합성 오류를 해결합니다. 모델은 관찰의 순서를 취하고 한 단계 앞으로의 50-100 시간 단계의 행동을 내보내습니다. 이 "행동 쪼개림"은 로봇이 궤도 세그먼트에 참여하여 예측 오류가 축적되는 주파수를 줄이는 것을 의미합니다.

ACT는 관찰 역사를 처리하기 위해 트랜스포머 코더와 시범의 다모달성을 처리하기 위해 CVAE (Conditional Variational 오토인코더) 를 사용합니다. ACT는 로봇 ML 커뮤니티에서 가장 널리 재생되는 방법 중 하나가되었습니다. 특히 ALOHA 스타일 하드웨어와 쌍방향 조작을 위해.

보다 자세한 내용은 [이미테이션 학습 가이드] (T1) 를 참조하십시오.

전파 정책

2023년 콜롬비아에서 첸그 치 등이 도입한 디푸지언 정책은 로봇 행동 예측에 디푸지언스 디푸지언스 프레임워크 (스태블 디푸지언스 같은 이미지 생성 모델의 핵심 아이디어) 를 적용한다. 직접적인 행동을 예측하는 대신 모델은 현재의 관찰에 따라 조건화된 일관된 궤도로 무작위로 행동 순서들을 반복적으로 디푸지언스하는 것을 배우게 된다.

디푸지온 기반 액션 생성의 장점은 다형 액션 배포를 자연적으로 처리한다는 것입니다. 작업을 수행하는 여러 가지 유효한 방법이있을 때 (왼쪽 또는 오른쪽에서 선택, 위에서 또는 옆에서 접근), 디푸지온 모델은 평균보다는 이 불확실성을 명시적으로 나타냅니다. 이는 더 부드럽고 자연스러운 로봇 행동을 생성합니다. 퍼포시전 정책은 많은 조작 기준에 최첨단 성능을 달성하고, 삽입, 지우 및 접는 등의 접촉 부양 작업에 특히 효과적입니다.

타협은 추론 속도가 있다. 반복적 단호화를 통해 동작을 생성하는 것은 ACT에 대한 단일 전진과 비교하여 5-20개의 앞면을 걸고, 대부분의 조작에 적합하지만 고속 작업에 제한이 있을 수 있는 10-30Hz로 동작한다.

깊이 잠수: 강화 된 학습

강화 학습 (RL) 은 근본적으로 다른 접근 방식을 취합니다. 로봇에게 무엇을 해야 하는지 보여주기 보다는 로봇이 얼마나 잘하고 있는지 측정하는 보상 기능을 정의하고, 실험과 오류를 통해 효과적인 행동을 발견하도록 합니다. 로봇은 행동을 취하고, 결과를 관찰하고, 보상 신호를 받고, 축적 보상을 극대화하기 위해 점차적으로 정책을 개선합니다.

주요 알고리즘: PPO 및 SAC

**PPO (Proximal Policy Optimization) **은 로봇 공학에 가장 널리 사용되는 RL 알고리즘이다. OpenAI에서 개발한 PPO는 재앙적인 성능 하락을 피하기 위해 정책 업데이트를 제한하는 정책 기하 방법이다. 안정적이며 비교적 조정하기가 쉽습니다. 그리고 연속적이고 분별적인 행동 공간 모두에 잘 작동합니다. PPO는 Unitree와 보스턴 다이내믹스 연구팀과 같은 회사에서 인상적인 네발의 모터 시범 (보행, 달리기, 파쿠어) 의 대부분 뒤에 있는 알고리즘입니다.

**SAC (Soft Actor-Critic) **는 정책 이외의 알고리즘으로 정책에서 보상과 엔트로피 (자발성) 을 모두 극대화합니다. 엔트로피 보너스는 탐구에 유도하고 혼란에 견고한 정책을 생성합니다. SAC는 반복 버퍼에서 과거의 경험을 재사용하기 때문에 많은 작업에 대해 PPO보다 샘플 효율적입니다. 특히 시뮬레이션에서 훈련된 조작 작업에 효과적입니다.

RL 를 모방 학습 과 모방 학습 을 사용 하는 시점

RL는 다음 과목에서 우수합니다

  • 최적의 행동은 인간에게 증명하기 어렵다 (동적 던지기, 손으로 재주류, 민첩한 이동)
  • 로봇이 인간의 능력을 뛰어넘는 전략을 발견하기를 원해요
  • 로봇이 수백만 개의 에피소드를 실행할 수 있는 신뢰할 수 있는 시뮬레이션 환경이 있습니다
  • 보상 함수는 정의하기 쉽다 (목적에 도달, 균형을 유지, 거리를 극대화)

RL는 다음과 같은 경우 어려움을 겪습니다.

  • 보상 기능은 정확하게 명시하기 어렵다 (스칼라 보상으로 "복을 깔끔하게 접는 것"은 어떻게 보일까요?)
  • 이 작업은 시뮬레이션 정확도가 낮은 접촉 부가 있는 조작을 필요로 합니다.
  • 빠르게 작동하는 정책이 필요합니다 (RL 훈련은 일반적으로 GPU 시간에서 몇 시간 또는 며칠이 소요됩니다)
  • 당신은 좋은 시뮬레이션 환경을 가지고 있지 않으며 실제 하드웨어에 훈련해야 합니다 (실제 RL의 대부분에 샘플 효율성은 충분하지 않습니다)

시뮬레이션 환경: 아이작 시ム 및 무조코

NVIDIA 아이작 시름은 오omni버스에 기반한 GPU 가속화 된 물리 시뮬레이터입니다. 주요 장점은 거대한 병렬성입니다. 아이작 시름은 단일 GPU에서 수천 개의 로봇 환경을 동시에 실행할 수 있으며, 시간당 수백만 개의 경험 샘플을 생성할 수 있습니다. 이것은 로코모션 및 조작 정책의 RL 훈련을위한 선호하는 플랫폼으로 만듭니다. 아이작 시ムは 또한 리얼 리얼 트레이닝을 위해 아이작 체육관과 네이티브 통합을 위해 시름-실현 시각 전송을 위한 사진현실적인 렌더링을 제공합니다.

**MuJoCo (Multi-Joint dynamics with Contact) **, 현재 DeepMind에서 오픈소스로 사용되고 있으며, 로봇 학습 연구에서 가장 널리 사용되는 물리 엔진입니다. MuJoCo는 빠르고 수치적으로 안정적이며 조작 작업에 대한 정확한 접촉 역학을 생산합니다. CPU (그리고 점점 더 MJX를 통해 GPU) 를 사용하며 모든 주요 RL 프레임워크와 통합되며, 미리 구축된 로봇 모델과 벤치마크 작업의 가장 큰 생태계를 가지고 있습니다. 초보자를 위해 MuJoCo는 광범위한 문서 및 표준화된 벤치마크 작업 (Gymnasium 로봇 환경) 가 제공되기 때문에 종종 쉬운 출발점입니다.

데이터 요구 사항: 얼마나 충분 합니까?

초보자들이 가장 자주 묻는 질문은 "내가 얼마나 많은 시범이 필요합니까?"라는 것입니다. 정직한 대답은 접근 방식, 작업 복잡성과 모델 아키텍처에 달려 있습니다.

모방 학습 데이터 요구 사항

  • 단순한 단팔 픽 앤 플레이 (정착된 물체, 고정된 위치): 20~50개의 시범. ACT와 디스포지션 정책 모두 이 규모에서 80% 이상의 성공률을 달성합니다.
  • 변수 선택 및 장소 (순상적 위치, 다양한 객체): 100-200 시범. 객체 위치 및 유형의 더 많은 변동은 일반화하기 위해 더 많은 데이터를 필요로 한다.
  • ** 접촉 부가한 조작 ( 삽입, 지우, 접):** 200-500 개의 시범 작업. 이 작업들은 작은 오류가 실패를 일으키는 좁은 성공 영역을 가지고 있으며, 더 밀집한 데이터 커버리가 필요합니다.
  • ** 다단계 작업 (조립 순서, 요리 단계):** 300~1,000개의 시범 작업.

좋은 로봇 훈련 자료가 무엇 인가

모든 시범은 동등한 가치가 없습니다. 좋은 [로봇 훈련 데이터]

  • 량차별: 100개의 시범시험에서 객체 위치, 조명 및 접근 각이 다양하며, 모두 같은 모양의 500개의 시범시험보다 더 잘 훈련된다.
  • 일관된 품질: 운영자가 작업 중 오류를 발생시키고 수정한 실패한 시범, 의 تردد 에피소드 및 시범을 제거합니다. 훈련 데이터의 노이즈는 모델을 그 노이즈를 재생하도록 가르칩니다.
  • ** 일치된 분포:** 훈련 데이터 는 로봇이 배치 시 직면 할 조건 에 일치 해야 합니다. 흰 테이블 에 있는 물체 들 을 사용 하여 훈련 을 하지만 나무 표면 에 배치 한다면, 성능 은 떨어질 것 이다. 현실적 조건 에서 데이터를 캡처 하십시오.
  • ** 멀티 카메라 커버리:** 두 또는 세 개의 카메라 각 (목목 + 상면, 또는 손목 + 옆 + 상면) 은 단일 카메라와 비교하여 정책 성능을 크게 향상시킵니다. 모델은 깊이, 접촉 및 공간적 관계를 드러내는 관점에서 작업을 관찰해야합니다.
  • ** 적절한 동기화:** 카메라 프레임, 합동 상태 및 액션 명령어는 일시적으로 조렬되어야 합니다. 50ms의 비동기화도 성능을 떨어뜨립니다. 하드웨어 시간표를 사용하십시오. 소프트웨어 도착 시간표가 아닙니다.

고품질의 로봇 데이터를 수집하는 방법에 대한 자세한 지침은 [로봇 데이터 수집 지침]T3 참조하십시오.

주요 프레임워크 및 도구

모든 것을 처음부터 구축할 필요는 없습니다. 이 프레임워크는 필요한 알고리즘과 인프라의 테스트된 구현을 제공합니다.

레로봇 ( 얼굴)

레로봇은 로봇 모방 학습을 위한 가장 초보자 친화적인 프레임워크입니다. Hugging Face에서 개발한 이 시스템은 엔드-투-엔드 도구를 제공합니다. 일반적인 로봇 팔의 데이터 수집 스크립트, 표준화된 형식을 가진 데이터 세트 관리, ACT 및 디스포지션 정책의 교육 구현 및 평가 유틸리티. 레로봇은 데이터 세트 공유 및 모델 배포를 위해 Hugging Face Hub와 통합됩니다. 첫 번째 로봇 ML 프로젝트를 시작한다면 레로봇은 추천되는 출발점입니다. SO-101, ALOHA 및 커스터마이즈 팔을 지원합니다.

로보미믹 (스탠포드)

로보미믹은 모방 학습 알고리즘을 연구하는 연구 프레임워크이다. 표준화된 시뮬레이션 벤치마크, 여러 BC 알고리즘 구현 (BC-RNN, HBC, IRIS) 및 신중한 평가 프로토콜을 제공합니다. 로보미믹은 실제 로봇 배포에 대한 레로봇보다 손목이 덜하지만 대부분의 모방 학습 논문에서 인용되는 표준 벤치마킹 프레임워크입니다. 알고리즘 변종을 엄격하게 비교하거나 출판된 결과를 재현하려면 RoboMimic를 사용합니다.

ROS2 (로봇 운영 시스템 2)

ROS2는 로봇 소프트웨어의 실질적인 중소 소프트웨어입니다. 그것은 게시-자료 메시지 시스템을 통해 센서, 액추에이터 및 컴퓨팅 노드 사이의 통신을 처리합니다. ROS2는 ML 프레임워크가 아니라 ML 정책을 실제 로봇 하드웨어와 연결하는 접착제입니다. ROS2 (또는 직렬/USB 통신과 같은 더 간단한 대안) 은 모터에 액션 명령어를 보내 카메라와 코더로부터 관찰 데이터를 수신하는 데 필요합니다. Ubuntu 22.04에 있는 ROS2 Humble (LTS) 는 새로운 프로젝트에서 권장되는 버전입니다.

NVIDIA 아이작 시

아이작 시ムは RL 훈련과 합성 데이터 생성 모두에 GPU 가속 시뮬레이션을 제공합니다. 평행 환경 실행은 필요한 규모 (백만 개의 에피소드) 에서 RL 훈련을 실현할 수 있습니다. 아이작 시ムは 또한 도메인 무작위로 조정을 지원합니다. 학습 곡선은 MuJoCo보다 강렬하지만 Isaac Sim는 대규모 RL 훈련이나 사진실현적 합성 데이터가 필요할 때 올바른 선택입니다.

안정된 기준 3

안정적인 베일라인3 (SB3) 은 표준 RL 알고리즘 (PPO, SAC, TD3, A2C, DQN) 의 신뢰할 수 있는 구현을 제공하는 PyTorch 라이브러리입니다. SB3는 사용하기 편리하도록 설계되었습니다. 이 프로그램은 아이작 체육관이나 생산 RL 훈련 rl_game 같은 보다 전문적인 프레임워크로 이전하기 전에 RL 개념을 배우는 데 권장되는 출발점입니다.

시작 하기 위한 하드웨어

로봇 ML를 하기 위해 로봇이 필요합니다. 여기에는 학습과 개발에 대한 입증된 생태계를 갖춘 가격에 3가지 하드웨어 옵션이 있습니다.

오픈아름 (예산: 2,000~4,000 달러)

[OpenArm] (T4) 는 RCSV의 오픈소스 6DOF 로봇 팔입니다. ML 연구와 교육에 특별히 설계되었습니다. 전체 시스템 (팔 + 지갑 + 손목 카메라 + 컨트롤러) 에 대해 4,000 달러 이하의 가격으로, 그것은 실무 로봇 ML에 가장 접근 가능한 입구점입니다. 오픈아름은 레로봇을 원주로 운영하고 있으며, 원격 운영 데이터 수집과 자율 정책 실행을 모두 지원하고, 데이터 세트 및 사전 훈련된 모델을 기여하는 적극적인 커뮤니티를 보유하고 있습니다. 이 팔은 400mm 범위와 500g의 유용 부하를 가진 다이내믹셀 세르보를 사용합니다.

SO-101 (예산: 500~1000달러)

SO-101 (SO-100 및 그 변형으로도 알려져 있습니다) 는 원료 소보모터 및 3D 인쇄된 부품으로 만들어진 초저화 6DOF 팔입니다. 전체 리더-따라자 쌍은 1,000 달러 이하로 비용. SO-101는 저렴한 비용과 Hugging Face의 광범위한 문서로 인해 레로봇 커뮤니티 프로젝트에서 가장 인기있는 팔이되었습니다. 오프너아름이나 상업용 무기들에 비해 더 낮은 정확성, 용량 및 제작 품질이 타협적이다. 첫 번째 프로젝트 또는 교실 설정에 있어서 SO-101는 가격에 이길 수 없습니다.

프랭카 FR3 (예산: 2만 5천~3만 5천 달러)

프랑카 에미카 FR3 (전파) 는 학술 ML 연구실에서 가장 널리 사용되는 연구급 로봇 팔이다. 그것은 우수한 토크 센싱, 미리미터 하위 반복성, ROS2 및 MuJoCo와 네이티브 통합을 제공하는 7-DOF을 제공합니다. FR3는 많은 획기적인 논문 (ACT, 디스포지션 정책, RT-X) 에서 사용되는 팔입니다. 만약 여러분이 대학에 다니거나, 혹은 잘 자금 지원된 스타트업에 다니고, 출판가능한 연구를 하고 있다면, FR3는 표준 플랫폼입니다. 더 높은 비용으로 정확성, 신뢰성, 그리고 출판된 연구 결과들을 직접 재생산할 수 있는 능력을 얻을 수 있습니다.

전체 설치 를 위한 예산 분할

Component Budget Option Mid-Range Option Research-Grade
Robot arm + gripper SO-101 pair: $800 OpenArm: $3,500 Franka FR3: $30,000
Cameras (2-3x) Logitech C920: $150 RealSense D405: $600 RealSense D435i: $900
Compute (training) Cloud GPU rental: $50/mo RTX 4070 workstation: $1,800 RTX 4090 workstation: $3,500
Compute (inference) Laptop with GPU: $0 (existing) Same as training: $0 Dedicated inference PC: $2,000
Total ~$1,000 + cloud ~$6,000 ~$36,000

학습 경로: 0 에서 도입 된 정책

여기 네 단계의 교육과정입니다. 기본부터 실제 하드웨어에 대한 훈련된 정책을 도입하는 과정까지 안내합니다. 각 단계는 이전 단계에 기반을 두고 있습니다.

1단계: 기본 (2~4주)

로봇을 만지기 전에 ML 기반을 세워야 합니다.

  • 파이토르치 기본을 배우십시오: 텐서, 오토그라드, 훈련 루프, 데이터 세트/데이터 로더 패턴. 공식 파이토르치 튜토리얼은 충분합니다.
  • 이미지 처리용 convolutional neural networks (CNNs) 를 이해하세요. 로봇의 카메라가 정책이 처리해야 하는 이미지를 생성합니다.
  • 트랜스포머 아키텍처를 개념적 차원에서 배우십시오. 주의, 위치 코딩, 순서 처리. 트랜스포머를 처음부터 구현할 필요는 없지만, 그 기능을 이해해야합니다.
  • 본 ACT 논문 (Zhao et al., 2023) 과 방산 정책 논문 (Chi et al., 2023) 을 읽어보십시오. 모든 수학 세부 사항이 아닌 문제 형성과 평가 방법론을 이해하는 데 중점을 두십시오.

2단계: 시뮬레이션 (2~4주)

실제 하드웨어에 닿기 전에 시뮬레이션을 연습하세요. 시뮬레이션은 비용이 없습니다. 그리고 자유롭게 실험할 수 있습니다.

  • MuJoCo를 설치하고 표준 체육관 로봇 환경 (FetchReach, FetchPush, FetchPickAndPlace) 을 실행하십시오.
  • FetchReach에서 Stable Baselines3를 사용하여 기본 RL 정책을 훈련하십시오. 이것은 하드웨어 복잡성 없이 RL 훈련 루프를 가르쳐줍니다.
  • 리프트 및 캔 작업에 대한 행동 복제 실험을 실행하기 위해 로보미믹을 사용하십시오. 이것은 데이터 세트 로딩, 모델 훈련, 평가와 같은 모방 학습 파이프라인을 가르쳐줍니다.
  • 하이퍼파라미터: 학습 속도, 배치 크기와 훈련 기간 수, 행동 조각 크기와 함께 실험.

3단계: 실제 하드웨어 (4~8주)

이제 당신의 기술을 물리적인 로봇에 옮길 수 있습니다.

  • 로봇 팔 (OpenArm, SO-101, 또는 접근할 수 있는 모든 것) 을 LeRobot에 연결하세요.
  • 간단한 픽 앤 플레이 작업의 50 개의 텔레오퍼레이션 시범을 수집합니다. 데이터 품질에 집중합니다. 일관된 시범, 좋은 카메라 각, 다양한 객체 위치.
  • 레로봇의 훈련 스크립트를 사용하여 수집된 데이터에 대해 ACT 정책을 훈련하십시오.
  • 실제 로봇에 대한 정책을 평가하고, 20개의 실험에서 성공률을 측정하면 첫 번째 시도에서 40-70%의 성공이 있을 가능성이 높습니다.
  • 반복: 관찰한 실패 모드를 대상으로 더 많은 시범을 수집하고 재 훈련하고 재평가하는 것을 목표로 합니다. 목표는 데이터 수집 → 훈련 → 평가 루프를 깊이 이해하는 것입니다.

4단계: 배포 및 일반화 (가행중)

더 어려운 작업에 진전하고 강력한 배치:

  • 더 복잡한 작업을 시도하십시오. 여러 단계의 집합, 쌍방향 조작, 변수 객체 작업.
  • 방산 정책에 대한 실험을 하고 동일한 작업과 데이터 세트에 대한 ACT과 결과를 비교합니다.
  • 기초 모델 정렬을 탐구: 미리 훈련된 VLA 모델을 사용하여 더 적은 시범으로 작업에 정렬하십시오.
  • 견고성 을 연구 하는 것: 다른 조명 아래, 보이지 않는 물체 들 과 신체적 혼란 이 발생 후 정책 을 시험 하는 것. 통제 된 조건 에서만 일 하는 것 이 아니라 신뢰성 있는 정책 을 적용 하는 것.
  • 배려: Hugging Face에 데이터 세트를 공유하고, 결과를 공개하고, RCSV와 LeRobot 커뮤니티에 참여하십시오.

6 처음 시작 하는 사람 들 이 흔히 하는 실수

우리는 이러한 실수를 반복적으로 볼 수 있습니다. 로봇 ML 여행을 시작하는 팀들로부터. 각각의 실수들은 의식으로 피할 수 있습니다.

1. 데이터 양을 데이터 양으로 넘기기

** 오류:** "더 많은 데이터가 항상 더 낫다"는 이유로 수백 개의 방편한 시범을 수집하는 것입니다.

** 수정:** 무자비하게 관리하십시오. 운영자가 의문을 품고, 실수를 하거나 불합리한 전략을 사용했을 경우 모든 시연을 삭제하십시오. 100개의 깨끗한 시연은 500개의 험난한 시연을 지속적으로 능가합니다.

2· 평가 를 받지 않고 훈련

** 오류:** 정책을 훈련시키고, 로봇에 몇 번 실행하고, 한번 작동하는 것을 보고, 그것을 완료한다고 한다.

** 수정:** 임의의 초기 조건으로 최소 20개의 임시 출범을 통해 모든 정책을 평가합니다. X/20로 성공률을 보고합니다. "이 효과가 있습니다".

3. 카메라 배치를 무시하는 것

** 오류:** 카메라를 가장 유용한 정보를 제공하는 것보다 편리한 곳에 배치하는 것. 체-물질 접촉 지점을 볼 수 없는 카메라는 정책에 가장 중요한 작업 단계에 대한 정보를 제공하지 않습니다.

** 수정:** 손목에 설치된 카메라 ( 조작의 근접적인 시각을 제공합니다) 과 상부 또는 옆 카메라 (전환적 맥락을 제공합니다) 를 사용하십시오. 카메라가 중요한 접촉 단계에서 폐쇄 없이 작업 공간을 명확하게 볼 수 있도록하십시오.

4· 첫 번째 과제를 과장 복잡하게 만드는 것

** 오류:** 첫 번째 프로젝트로서 복잡한 다단계 작업을 배우려고 노력합니다. 정책이 실패할 때 (그리고 실패할 것입니다), 문제는 알고리즘, 데이터, 하드웨어 또는 작업 복잡성인지 진단할 수 없습니다.

** 수정:** 단일 객체의 단일 단계 선택과 배치로 시작하십시오. 이것은 신뢰할 수 있는 작업 (> 90% 성공) 을 수행하십시오. 다음으로 복잡성을 증가적으로 추가하십시오. 여러 객체, 다양한 위치, 더 긴 순서. 각 증가량은 정확히 무엇이 깨진지 알려줍니다.

5. 행동 공간 설계를 무시하는 것

** 오류:** 카르테시아 공간 동작이 더 자연스럽거나 반대로 되는 경우 공동 공간 동작을 사용하는 경우. 델타 (이크레멘탈) 동작이 있을 때 절대적 위치를 사용하는 경우 더 원활한 동작을 만들어 낼 수 있다. 행동 공간 표현은 학습 어려움에 극적인 영향을 미친다.

** 수정:** 대부분의 조작 작업에 있어서 델타 최종 효과자 위치 제어 (카르테시아 dx, dy, dz + 지갑 오픈/크로스) 는 학습하기 가장 쉬운 행동 공간이다. 관절 공간 제어는 특정 팔 구성이 필요한 작업이나 역동적 운동학이 신뢰할 수 없는 경우 더 좋습니다. 둘 다를 실험하고 비교하십시오.

6· 열차와 배치 조건에 맞지 않는

** 오류:** 하나의 조명 조건, 카메라 위치, 테이블 표면으로 훈련 데이터를 수집하고, 다른 환경에서 정책을 배치하고 왜 실패하는지 궁금해합니다.

정책: 훈련된 것과 같은 조건에서 배포하거나 데이터 수집 과정에서 의도적으로 조건을 변경하여 안정성을 구축하십시오. 다른 조건에서 배포해야 할 경우 목표 환경에서 추가적인 시범을 수집하고 훈련에 혼합하십시오.

필수적 인 자원

주요 문서

  • ACT 저비용 하드웨어와 함께 정밀화 된 쌍방향 조작을 학습 (Zhao et al., 2023): 트랜스포머와 ALOHA 하드웨어 플랫폼으로 액션 덩어리를 도입. 현대 모방 학습의 기초 논문.
  • 방산 정책 행동 방산을 통해 시각자동정책 학습 (Chi et al., 2023): 로봇 행동 예측에 디푸시온 모델을 일컫는 응용. 많은 조작 기준에 대한 최첨단 기술.
  • RT-X 오픈 X-Embodiment: 로봇 학습 데이터셋 및 RT-X 모델 (Open X-Embodiment Collaboration, 2024): 22개의 로봇 플랫폼의 데이터를 사용하여 크로스-인체 전송 학습을 입증하였다. 로봇 학습은 언어 모델 스케일링과 유사하게 대규모의 다양한 데이터로부터 이익을 얻었다는 것을 확인하였다.
  • OpenVLA 오픈소스 비전 언어 행동 모델 (Kim et al., 2024): 특정 로봇 작업에 정비될 수 있는 오픈 웨이트 VLA 모델. 사전 훈련된 기초 모델은 작업 당 데이터 요구 사항을 크게 줄이는 것을 입증했다.

교육 과정 및 교육

  • CS 224R: 딥 리포너스 러닝 (스탠포드, 유튜브에서 사용할 수 있습니다): 로봇 기술에 대한 RL의 종합적인 대학원 수준의 커버리지는
  • LeRobot 시작 교과서 (Hugging Face 문서): 레로봇의 첫 번째 정책을 수집하고 훈련시키는 단계적 가이드.
  • ** 딥 RL에 스핀업업 (OpenAI): 명확한 구현을 가진 RL 알고리즘에 대한 훌륭한 독자적인 소개.
  • MuJoCo 교과서 (DeepMind 문서): 로봇 학습 연구용 물리학 시뮬레이션 기초

지역사회

  • RCSV 커뮤니티: [RCSV 아카데미] (T5) 에 참여하여 실습 워크숍, 공유 하드웨어 접근 및 베이 지역의 로봇 ML 전문가 커뮤니티를 제공합니다.
  • LeRobot Discord: LeRobot 사용자들의 데이터 세트, 문제 해결 및 프로젝트 아이디어를 공유하는 활동적인 커뮤니티.
  • ** 로봇 스택 교환:** 기술 로봇 질문들에 대한 질문과 답변

RCSV에서 로봇 ML 여행을 시작하세요

RCSV는 로봇 하드웨어 접근, 실무 훈련, 그리고 학습을 가속화하기 위한 전문가 커뮤니티를 제공합니다. 첫 번째 선택과 장소 정책에서 생산 배포까지, 우리는 도움을 줄 수 있습니다.

[RCSV 아카데미를 탐험]