로봇을 위한 모방 학습: ACT, 전파 정책, VLAs <unk> 실용적인 가이드 (2026)
로봇학에 대한 모방 학습에 대한 완전한 실용적인 가이드 <unk> ACT, 전파 정책, OpenVLA, 데이터 요구 사항, 훈련 파이프라인과 실패 모드 진단.
[← 가이드]
인간 시범에서 로봇을 훈련시키는 전문가의 가이드
모방 학습 은 무엇 입니까?
모방 학습은 로봇의 행동을 보여주는 방법을 통해 훈련합니다. 강화 학습을 위한 궤도나 엔지니어링 보상 기능을 수동으로 프로그래밍하는 대신, 당신은 [텔레오퍼레이션]
핵심 아이디어는 간단합니다. 인간 시범에서 (관측, 행동) 쌍의 데이터 세트를 수집하고, 그 다음 현재의 관측을 고려하여 올바른 행동을 예측하기 위해 신경 네트워크를 훈련시킵니다. 훈련된 네트워크는 로봇의 정책으로 변합니다. 로봇을 자율적으로 제어하기 위해 실시간으로 실행됩니다.
실제에서 모방 학습은 로봇이 2026년에 새로운 조작 작업을 수행하도록 하는 가장 신뢰할 수 있는 방법이다. 강화 학습은 수백만 개의 환경 상호작용과 신중하게 형성된 보상 기능을 필요로 한다. 고전적 운동 계획에는 모든 물체의 명시적인 기하학적 모델이 필요합니다. 모방 학습은 시범만 요구합니다. 그리고 현대적인 건축물에서는 놀랍게도 거의 없습니다.
짧은 역사: 행동적 복제 에서 현대 건축물
**행동 복제 (BC) **는 가장 간단한 형태입니다. 관찰을 직접 행동으로 지도하는 감독 학습. 표준 회귀 손실을 사용하여 (사진, 공동_ 위치) → (다음_행동) 쌍에 신경 네트워크를 훈련하십시오. BC는 시범 데이터가 일관성이있는 경우 잘 작동하며 로봇이 배포 중에 만나는 상태를 배포합니다. 로봇이 증명된 궤도를 벗어나면 실패합니다.
**Dagger (Dataset Aggregation) **, 로스 등이 2011년에 도입한, 로봇이 실제로 방문하는 국가들에서 새로운 시범을 반복적으로 수집함으로써 분배 전환을 해결합니다. 초기 BC 정책을 훈련한 후, 당신은 그것을 배포하고, 그것을 유도하도록 하다가 인간에게 결과 상태들을 수정하도록 한다. 이러한 수정들은 훈련 집합에 추가된다. DAgger은 이론적으로 우아하지만 운영적으로 비싸다
**GAIL (Generative Adversarial 모방 학습) **, 2016년 Ho와 Ermon에 의해 도입된 것은 모방 학습과 모방 훈련을 결합한다. 차별자는 로봇 행동과 인간의 행동을 구별하는 것을 배우고, 정책은 차별자를 속이기 위해 훈련된다. GAIL는 BC보다 멀티모달 디스플레이를 더 잘 처리하지만 온라인 환경 상호작용을 필요로 한다 (일반적으로 시뮬레이션) 그리고 조율하기가 매우 어렵다는 것으로 알려져 있다. 오늘날 실제 로봇 설정에서 제한적인 사용이 있습니다.
2026년 실세계 로봇 조작을 지배하는 세 가지 접근법은 ACT, 디스포지션 정책, VLA 모델이 행동 복제 패러다임에 기반을 둔 것이지만 핵심 한계를 해결하는 건축 혁신을 추가합니다.
왜 모방 학습 이 조작 을 이기게 되었습니까?
2023 년 이전에 대부분의 로봇 연구소는 강화 학습이 결국 조작을 해결할 것이라고 가정했습니다. 이 기대는 접촉 부양한 작업에 실현되지 않았습니다. 이것이 모방 학습이 기본이 된 이유입니다:
- ** 샘플 효율성:** 하나의 날에 수집된 50
500개의 인간 시범을 통해 유용한 모방 학습 정책이 훈련될 수 있습니다. 같은 작업에 대한 RL는 수백만 개의 환경 단계가 필요하며, 실제 하드웨어에서 몇 주 또는 몇 달의 시뮬레이션을 필요로 합니다. - ** 보상 공학이 없습니다:** RL는 "성공"이란 무엇을 의미하는지 정확히 파악하는 보상 기능을 필요로 합니다. 옷을 접거나 구성 요소를 조립하는 것과 같은 조작 작업에 있어서 보상 정의는 매우 어렵습니다. 모방 학습은 문제를 완전히 회피합니다.
- 전용 데이터 는 자연적 이다: 현대적인전용 하드웨어 (리더-포고러 팔, VR 컨트롤러, 외골격 장갑) 는 고품질의 시범을 수집 하는 것을 간편화 한다. 데이터 수집 과정 은 직접 정책 입력 형식에 지도를 합니다.
- 현실적 세계 호환성: RL 트레인은 시뮬레이션에서 가장 잘 수행되지만 접촉에 풍부한 조작을 위한 sim-to-real 전송은 여전히 신뢰할 수 없습니다.
- 기본 모델과 호환성: 사전 훈련된 시각 언어 모델 (SigLIP, DINOv2) 은 모방 학습이 직접 활용할 수 있는 강력한 시각적 표현을 제공합니다. RL는 사전 훈련된 표현을 쉽게 통합할 수 없습니다. 보너스 신호가 전체 네트워크를 통해 흐르게 될 수 있기 때문입니다.
RL는 여전히 이동 (Unitree의 G1, 보스턴 다이내믹스 아틀라스) 와 명확한 보상 신호 (게임 플레이, 내비게이션) 과제를 지배한다. 조작을 위해
ACT: 트랜스포머로 액션 킹
2023년 스탠퍼드에서 토니 자오 등이 도입한 ACT는 테이블탑 조작을 위한 모방 학습의 작업마자이다. 행동 복제에서 발생하는 합성 오류 문제를 직접 해결하는 단일 다음 행동보다는 미래의 행동의 chunk (열차) 를 예측한다.
ACT의 작동 방식
ACT는 트랜스포머 척추를 가진 CVAE (Conditional Variational 오토인코더) 아키텍처를 사용합니다. 코더는 현재 관찰
핵심 통찰은 **
배포 중 ACT는 시간적 집합을 사용한다: 각 시간 단계에서는 새로운 100 단계 행동 조각을 생성하지만 실행된 행동은 현재 조각과 이전 조각의 예측된 행동의 중계 평균입니다. 이것은 궤도를 더 부드럽게 하고 긴장감을 줄입니다.
ACT 을 언제 사용 해야 합니까?
- 1
2 로봇 팔로 테이블탑 조작 (본 ALOHA 사용 케이스) - 상대적으로 결정적인 전략 (
집, 삽입, 조립) 과업 - 50~200개의 시범이 있을 때 그리고 빠른 훈련 파이프라인이 필요할 때
- 소박한 하드웨어에 배포해야 할 때 ( 단일 소비자 GPU에서 실행되며, ~ 15 ms 추론)
ACT에 대한 전형적인 데이터 요구 사항
- 간단한 선택: 50개의 시범
- 양쪽 협조: 100개의 시범대상
- 정확한 삽입 (
구멍, USB): 200개의 시범 - 복잡한 다단계 작업: 400~800개의 시범 작업이 필요
질은 양보다 중요 합니다. 깨끗하고 일관된 50개의 시연은 종종 500개의 험난한 시연보다 더 좋은 성과를 거두는 것입니다.
레로봇으로 ACT 훈련
2026년 ACT를 훈련시키는 가장 접근 가능한 방법은 Hugging Face의 [LeRobot] (
# Install LeRobot
pip install lerobot
# Convert your dataset
python -m lerobot.scripts.convert_dataset \
--raw-dir ./my_episodes/ \
--repo-id my-org/my-task \
--raw-format hdf5_aloha
# Train ACT policy
python -m lerobot.scripts.train \
policy=act \
dataset_repo_id=my-org/my-task \
training.num_epochs=2000 \
training.batch_size=8
훈련은 일반적으로 1200 에피소드의 데이터 세트에서 하나의 RTX 4090에서 28 시간 내에 konverges.
ACT: 장점 과 단점
| Pros | Cons |
|---|---|
| Extremely data-efficient (50 demos for simple tasks) | Struggles with multi-modal action distributions |
| Fast inference (50+ Hz on consumer GPU) | No language conditioning |
| Smooth trajectories via temporal ensembling | Sensitive to demonstration inconsistency |
| Well-supported in LeRobot framework | Single-task only (one policy per task) |
| Low training compute (single GPU, hours) | Temporal ensembling weight requires manual tuning |
전파 정책
전파 정책 이 어떻게 작동 하는 것 입니까?
디스푸지언 폴리시는 직접적인 행동을 예측하는 대신 무작위적인 잡음 벡터를 깨끗한 행동 궤도로 반복적으로 분류하는 것을 학습합니다. 훈련 중에, 그것은 시범에서 깨끗한 행동 궤도를 취하고, 다양한 수준의 가우시안 잡음을 추가하고, 네트워크 (일반적으로 1D U-넷 또는 트랜스포머) 를 훈련시켜 추가 잡음을 예측합니다. 추론 과정에서 순수한 소음으로 시작되고 K 단계 (유례적으로 K=10
중요한 장점은 ** 멀티 모다리티**: 디프루션 모델은 자연적으로 여러 가지 유효한 솔루션을 나타냅니다. 객체를 파악하는 두 가지 똑같이 좋은 방법이 있다면 (왼쪽과 오른쪽 접근) 디프루션 정책은 두 가지 모드를 평균하지 않고 하나의 잘못된 중간 궤도에 표현할 수 있습니다. MSE 손실 평균 모드와 함께 표준 행동 복제, 이는 쌍모형 작업에 재앙입니다.
방출 정책은 또한 예외적으로 부드러운 궤도를 생성합니다. 왜냐하면 비방 과정이 본질적으로 일시적으로 일관된 행동 순서를 생성하기 때문입니다. 이것은 궤도 부드러움이 직접적으로 성공을 영향을 미치는 지면 청소, 붓기 및 표면 추종과 같은 접촉 부양 작업에 적합합니다.
전파 정책 을 언제 사용 해야 합니까?
- 여러 유효한 전략이 있는 작업 (데이터는 동일한 목표에 대한 다른 접근 방식을 포함합니다)
- 정확한 힘 궤도가 중요하게 작용하는 접촉이 풍부한 작업
- 높은 궤도 순도를 필요로 하는 작업 (출출, 도출, 표면 지우)
- 약간 다른 스타일의 여러 운영체제의 데이터를 가지고 있을 때
- 반복적 단호화를 위한 충분한 계산을 가진 GPU가 있는 경우 (30
80 ms 추론)
전파 정책에 대한 전형적인 데이터 요구 사항
- 간단한 단일 모형 작업: 100~200개의 시범
- 다 모달 작업 (다 가지 유효한 전략): 200
500개의 시범 - 복잡한 접촉 부적 인 조작: 500~1,000개의 시범
ACT와 다른 주요 차이점: 퍼포시전 정책은 다중모달 분포를 나타낼 수 있기 때문에 디스플레이 불합동성에 덜 민감합니다. 이것은 여러 사업자가 수집한 데이터에 대해 더 용납합니다.
전파 정책: 장점과 단점
| Pros | Cons |
|---|---|
| Handles multi-modal action distributions natively | Slower inference than ACT (10-30 Hz) |
| Exceptionally smooth trajectories | Needs more data than ACT for simple tasks |
| Robust to operator variation in demonstrations | More hyperparameters (diffusion steps, noise schedule) |
| Strong performance on contact-rich tasks | No language conditioning (without extensions) |
| Supported in LeRobot and robomimic | Higher GPU memory requirements during training |
오픈VLA 및 비전 언어 행동 모델
비전 언어 행동 (VLA) 모델은 2026년 로봇 학습의 한계를 나타냅니다. 그들은 미리 훈련된 비전 언어 모델을 행동 예측과 결합하여 로봇이 자연 언어 지침을 따라 ("붉은 잔을 들고 트레이에 넣으십시오") 그리고 미세조정 과정에서 본 적이 없는 작업과 객체를 일반화 할 수 있습니다.
기초 모델 에 대한 변화
전통적인 모방 학습 (ACT, Diffusion Policy) 은 처음부터 작업에 대한 특정 정책을 훈련시킵니다. 새로운 작업마다 새로운 데이터 세트와 새로운 훈련 실행이 필요합니다. VLA 모델은 이미 시각 장관과 언어를 이해하는 사전 훈련된 표현을 제공함으로써 이 방정식을 변경합니다.
실제적인 결과는: VLA 모델은 작업에 대한 구체적인 시범이 적은 경우 합리적인 성능을 얻을 수 있습니다. 왜냐하면 시각적 이해와 언어 지형에 대한 무거운 작업은 인터넷 규모의 데이터 및 오픈 X-Embodiment (970K+ 에피소드, 22+ 로봇 유형) 같은 대규모 크로스-인체형 로봇 데이터 세트에서 사전 훈련 중에 이루어졌기 때문입니다.
주요 VLA 모델
- OpenVLA (버클리, 2024): 오픈소스 7B 매개 변수 VLA는 Llama 2 + SigLIP에 기반을 둔다. 오픈 X-Embodiment 데이터에 훈련받았다. 100
500 시범을 가진 새로운 로봇에 정교한 조율을 갖췄다. 단일 A100 GPU에서 ~5 Hz로 실행된다. - pi0 (물리적 지능, 2024
2025): 유능한 손들을 포함한 크로스 인체 데이터에 훈련된 소유 VLA. 보이지 않는 작업에 제로샷 전송을 입증했습니다. 물리적인 지능의 API를 통해 사용할 수 있습니다. - ** 10** (버클리, 2024): 가벼운 93M 매개 변수 일반주의 정책. 50
200 시범과 함께 빠른 미세 조정을 위해 설계되었습니다. 오픈 소스, 단일 소비자 GPU에서 실행됩니다. - RT-2 (Google DeepMind, 2023): PaLM-E 기반의 55B 매개 변수 VLA. 최첨단 일반화하지만 대규모 컴퓨팅 (8 TPU v5e 칩) 을 필요로 한다. 공개적으로 사용할 수 없습니다.
정렬과 처음부터 훈련
** 사전 훈련된 VLA를 정렬** (실습 경로): 오픈VLA 또는 Octo 체크포인트에서 시작하십시오. 로봇에 100
VLA를 처음부터 훈련하는 (좋은 재원을 가진 연구소에서만): 다양한 로봇과 작업에 걸쳐 10,000100,000+의 시범을 요구하며, 1001,000+의 GPU 시간까지 요구합니다. 새로운 로봇 구현 클래스에 대한 기초 모델을 구축하거나 기존 VLA에 포함되지 않은 기능이 필요한 경우에만 정당합니다.
VLA 모델: 장단점
| Pros | Cons |
|---|---|
| Language-conditioned task execution | Slow inference (3-10 Hz) |
| Multi-task from a single model | Requires A100-class GPU for 7B+ models |
| Strong generalization to new objects | Fine-tuning is more complex than ACT/DP training |
| Leverages internet-scale pre-training | Larger models are sensitive to prompt formatting |
| Cross-embodiment transfer potential | Still maturing — fewer deployment success stories than ACT/DP |
알고리즘 비교 테이블
| Algorithm | Data Efficiency | 일반화 | Compute (Train) | Compute (Infer) | Ease of Training | Best For |
|---|---|---|---|---|---|---|
| ACT | Very high (50-200) | Low (single task) | 1 GPU, 2-8 hrs | 50+ Hz, 1 GPU | Easy | Single-task tabletop, fast iteration |
| Diffusion Policy | High (100-500) | Medium (multi-strategy) | 1 GPU, 4-16 hrs | 10-30 Hz, 1 GPU | Moderate | Multi-modal tasks, contact-rich |
| Behavioral Cloning | High (50-200) | Very low | 1 GPU, 1-4 hrs | 100+ Hz | Very easy | Prototyping, baselines |
| GAIL | Medium (100-1000) | Medium | Needs sim, days | 50+ Hz | Difficult | Sim-only research, locomotion |
| OpenVLA / Octo | High (50-500 fine-tune) | High (cross-task) | 1-4 A100s, 4-24 hrs | 3-10 Hz, 1 A100 | Moderate-Hard | Multi-task, language-conditioned |
교육 파이프라인: 5 단계
어떤 알고리즘을 선택하든 훈련 파이프라인은 이 단계들을 따라가는데, 각각의 단계에 대한 세부 사항은 최종 정책 수행에 매우 중요합니다.
단계 1: 데이터 수집
[텔레버전] (
이 단계에서 중요한 결정은: 시범의 수 ( 위의 알고리즘 특수한 권고 사항을 참조), 운영자 일관성 (부트스트랩에 대한 1
단계 2: 데이터 포맷 및 사전 처리
무작위 녹음을 훈련 준비된 형식으로 변환:
- ** 이미지 크기를 변경:** 카메라 프레임을 모델의 예상 입력 해상도에 따라 크기를 변경하십시오 (일반적으로 ViT 기반 코더에 224x224 , ResNet에 256x256).
- **행동 정상화:**행동을 [-1, 1] 범위로 정상화하십시오. 훈련 집합에서 평균과 표준차를 계산하십시오. 배포 시 동일한 정상화를 적용하십시오.
- ** 에피소드 필터링:** 실패한 에피소드, 이상 기간 (> 평균에서 표준 deviations 3) 에피소드 및 품질 검토 중에 표시 된 에피소드를 제거하십시오.
- 열차/확인 분할: 확인을 위한 에피소드 중 10~15%를 유지하십시오. 에피소드별로 분할, 프레임별로 분할하지 않습니다.
- ** 형식 변환:** 레로봇 훈련에 있어서 HDF5를
T1 을 사용하여 파켓으로 변환하세요. robomimic에 대해서는 본인 HDF5 로더를 사용하세요. 자세한 내용은 데이터 형식 안내 를 참조하세요.
3단계: 훈련
알고리즘에 의한 전형적인 훈련 구성:
- ACT: 2,000~5,000 시대, 학습률 1e-5 코시네 스케줄, 배트 크기는 8
16. 훈련 시간: 2 8시간, 단일 RTX 4090 - 방산 정책: 500
2,000 시대, 코시노 스케줄로 학습률 1e-4; 훈련용 100개의 방산 단계, 추론용 10 50 단계의 DDIM; 훈련시간: 1개의 RTX 4090에서 4 16시간. - VLA 정렬: 20
100 시대, 학습 속도는 2e-5. 7B+ 모델의 LoRA (랭크 16 64) 또는 sub-1B 모델의 완전한 정렬. 훈련 시간은: 1 4 A100 GPU에서 4 24 시간.
훈련 손실 및 검증 손실을 모니터링 합니다. 검증 손실이 몇 백 개의 시대 후에 훈련 손실과 다른 경우, 당신은 과잉 적립을 합니다.
4단계: 평가
검증 손실은 실무 실적 성능의 약한 예측자입니다. 유일한 신뢰할 수 있는 평가는 실제 로봇에 대한 정책을 배치하고 작업 성공률을 측정하는 것입니다. 통계적으로 의미있는 결과를 얻기 위해 적어도 20 가지 평가 실험을 실행하십시오 (95% 신뢰 간격은 20 가지 실험에서 약 ± 20%이며, 50 가지 실험에서 ± 10%입니다). 실패 분석을 위해 모든 평가 에피소드를 기록하십시오.
두 가지 조건으로 평가하십시오: (1) 명칭
단계 5: 배포
훈련된 모델을 UNNX 또는 TorchScript에 배포하여 배포할 수 있습니다. 로봇의 내장 GPU (이용된 것이 NVIDIA Jetson Orin, 작업장용은 RTX 4060+) 에 추론을 실행하십시오. 추론 초연을 모니터링합니다.
[데이터 플라이휠]
알고리즘에 의한 데이터 요구 사항
| Task Complexity | ACT | Diffusion Policy | OpenVLA (fine-tune) | Octo (fine-tune) | Typical Success Rate |
|---|---|---|---|---|---|
| Simple pick-place | 50 | 100 | 100 | 50 | 80-95% |
| Bimanual coordination | 100 | 200 | 200 | 100 | 70-85% |
| Precise insertion | 200 | 300 | 300 | 150 | 65-80% |
| Multi-step assembly | 500 | 500 | 500 | 300 | 50-70% |
| Multi-task (language-cond.) | N/A | N/A | 500-2000 | 200-1000 | 40-70% |
** 훈련에 필요한 하드웨어 요구 사항:** ACT 및 방출 정책 훈련은 단일 RTX 3060 또는 더 나은 (16 GB VRAM 권장) 로 이루어집니다. OpenVLA 정교 조정에는 적어도 1 A100 (40 GB) 또는 2 RTX 4090s가 필요합니다. 단일 RTX 4090에서 Octo 정교 조정. 모든 알고리즘은 이미지 데이터 세트를 로드하기 위해 빠른 NVMe 저장 장치로부터 혜택을 누립니다.
5 흔히 발생하는 실패 방법 과 그 를 해결 하는 방법
1. 분배 시프트 (합성 오류)
** 증상:** 정책은 처음 몇 초 동안 작동하고, 그 다음 점차 궤도에서 벗어나 실패합니다.
** 근본 원인은:** 작은 예측 오류가 시간이 지남에 따라 합병되어 로봇을 훈련 데이터에 표시되지 않은 상태로 밀어 넣습니다. 정책은 이러한 상태를 본 적이 없으며 점점 잘못된 행동을 만듭니다.
** 수정:** 액션 덩어리를 사용 (ACT는 100 단계 덩어리를 예측하여 오류가 합병할 수 있는 의사 결정 지점 수를 줄인다). 훈련 중에 이미지 증강 (자유 작물, 색채 진동) 을 추가하여 시각 코더를 가볍게 보는 지점 변경까지 견고하게 만듭니다. 복구 시범을 수집하십시오. 정책이 움직일 때까지 실행하고, 그 다음 이동 상태에서 작업 완료까지 원격으로 작동합니다. 이 "DAgger 스타일" 수정들은 당신이 추가할 수 있는 가장 높은 값의 데이터입니다.
2. 다방법 붕괴 (모드 평균)
** 증상:** 로봇은 두 가지 유효한 전략 사이의 위치에 이동하여 어느 쪽에도 도달하지 않습니다. 또는 여러 가지 전략이 동등하게 유효한 결정 지점에서 로봇이 얼어붙습니다.
** 근본 원인은:** 훈련 데이터는 다른 전략 (왼쪽에서 오른쪽으로 접근) 을 보여주는 것을 포함하고 있으며, MSE 손실은 그들을 하나의 잘못된 중간 궤도로 평균합니다.
** 수정:** 다중형 분포를 원본적으로 나타내는 디스포지션 정책으로 전환하십시오. ACT에 머무르면 시범 전략을 표준화하십시오.
3. 행동 예측에서 합성 오류
증상: 로봇은 올바른 모양의 궤도를 생성하지만 시간이 지남에 따라 위치 오류를 축적하여 1
** 근본 원인은:** 훈련과 배포 사이의 행동 정상화 불합동 (다른 평균/std 값) 또는 정책은 긴 궤도에 걸쳐 부동 점 오류를 축적하는 델타 행동을 예측합니다.
정치: 훈련과 배포 과정에서 정확히 동일한 정상화 통계가 (평균, std, min, max) 사용되고 있는지 확인합니다. 가능한 경우 델타 행동보다 절대적 공동 위치 목표를 선호합니다. 델타 행동 정책에서는, 순전히 델타를 통합하는 것보다, 예측된 궤도를 현재 관찰된 상태로 주기적으로 다시 고정합니다.
4. 하드웨어 부합
** 증상:** 원래 데이터 수집 설정에서 잘 작동하는 정책은 다른 테이블, 다른 조명 또는 동일한 로봇 모델의 다른 인스턴스로 이동하면 완전히 실패합니다.
** 근본 원인은:** 카메라 위치가 바뀌었다 (기압 5mm 정도까지), 조명 조건이 변경되었다 (관광 기능에 영향을 미치거나) 또는 로봇 관절 기량 차이는 단위마다 다릅니다.
** 수정:** 매 배포 세션 전에 딱딱한 고정관념을 가진 카메라를 영구적으로 장착하고 외부를 확인하십시오. 카메라 포즈를 확인하기 위해 캘리브레이션 목표 (ArUco 보드) 를 사용하십시오. 다 로봇 배포를 위해 각 로봇 단위에서 작은 캘리브레이션 데이터 세트를 (20
5. 부적절한 리셋
증상: 정책은 낮은 성공률을 보이는 것 같지만, 자세히 살펴보면 많은 실패가 훈련 배급 상태에서 출발한다는 것을 알 수 있습니다.
** 근본 원인:** 평가 프로토콜은 훈련 중 배포 상태의 상황으로 현장을 제대로 재설정하지 않거나 훈련 데이터는 배포 조건과 일치하지 않는 좁은 시작 상태 배포를 가지고 있습니다.
** 수정:** 명시적인 리셋 기준을 정의하십시오. 객체 위치, 로봇 홈 구성 및 장면 배열. 각 평가 에피소드 전에 리셋 품질을 확인하십시오. 데이터 수집 중에 의도된 배포 배포에 걸쳐 시작 상태를 체계적으로 무작위로 분류하십시오. 데이터 집합 메트릭으로 시작 상태 커버리를 추적하십시오.
실체에 대한 시미 평가
실제 로봇에 시뮬레이션 및 배포하는 훈련은 매력적이기 때문에 시뮬레이션 데이터는 기본적으로 무료입니다. 하지만 현실의 격차는 대부분의 조작 작업에 순수한 시미-실현을 신뢰할 수 없게 만듭니다.
시뮬레이션 이 도움 이 되는 경우
- 시프 사전 훈련 + 실제 정렬: 10,000
100,000개의 시뮬레이션 에피소드를 훈련시키고, 50200개의 실제 에피소드를 훈련시켜 정렬한다. 시프 사전 훈련은 강력한 초기화를 제공한다. 실제 정렬은 현실 격차를 다치게 한다. 실제 데이터가 희소할 때 실제 데이터만으로 훈련하는 것이 꾸준히 우월하다. - ** 도메인 무작위화:** 시뮬레이션 훈련 중에 시각적 특성을 (조각, 조명, 카메라 위치) 및 물리학 (토화, 질량, 관절 감축) 를 무작위화하십시오. 정책은 변동에 견고하게하도록 강요합니다. 일부는 실제 세계 변동과 겹쳐집니다. 실제 정렬과 결합하면 가장 효과적입니다.
- ** 이동 및 전체 신체 제어:** Sim-to-real은 이동에 있어서 조작보다 훨씬 더 잘 작동합니다. Unitree의 G1 및 Go2 컨트롤러들은 거의 전적으로 Isaac Lab를 사용하여 시뮬레이션에 훈련되어 있습니다.
- ** 정책 검증 및 디버깅:** 실제 하드웨어에 배치하기 전에 훈련된 정책을 시뮬레이션에서 실행하십시오. 시뮬레이션은 하드웨어 손상 위험을 감수하지 않고 중대한 오류 (실반 행동 공간, 정상화 버그, 제어 주파수 부합) 를 잡습니다.
시뮬레이션 이 도움 이 되지 않는 경우
- ** 접촉이 풍부한 조작을 위한 순수한 시뮬레이션:** 시뮬레이션은 실제 물체의 마찰, 변형 및 접촉 역학을 정확하게 모델링할 수 없습니다. 순전히 시뮬레이션으로 훈련된 정책은 부드러운 물체, 얇은 물체 또는 정밀 삽입 작업에 실패합니다.
- 시뮬레이션 카메라 이미지는 훈련 데이터로: 광현실적인 렌더링의 발전에도 불구하고, 시뮬레이션 이미지에만 훈련된 정책은 실제 카메라에서 30~50%의 성공률을 떨어뜨리는 것을 보여줍니다. 신경 렌더링 (NeRF 기반) 은 개선되고 있지만 아직 정책 훈련에 준비가되어 있지 않습니다.
- ** 변형 가능한 물체를 포함하는 작업:** 옷, 로프, 식품은 매우 정확하게 시뮬레이션하기 어렵다. 변형 가능한 조작을 위한 시프 훈련된 정책은 광범위한 실제 데이터 없이 거의 실제 하드웨어로 전송되지 않습니다.
체크리스트 시작
0에서 배제 학습 정책으로 이동하기 위해 이 10가지 단계를 따르십시오.
- ** 로봇 하드웨어를 선택하세요.** 첫 번째 프로젝트: ViperX-300 S2, Koch v1.1, 또는 [OpenArm]
T9 . 예산: 2,000$~8,000$ 팔에. 50Hz 최소에서 위치 제어가 필요합니다. - ** 텔레오퍼레이션을 설정하세요.** 최고 데이터 품질을 위해 리더-따라자 팔 또는 VR 컨트롤러 (Meta Quest 3) 를 저렴한 비용으로 설정하세요. [텔레오퍼레이션 가이드]
- ** 마운트 카메라.** 최소: 1 손목 카메라 (인텔 리얼센스 D405) + 1 대장 카메라 (리얼센스 D435). 딱딱한 마운트를 사용하십시오.
- ** 녹음 소프트웨어를 설치하세요.** 레로봇의 데이터 녹음 도구 또는 ALOHA 녹음 스택을 사용하세요. HDF5 출력을 확인하는 것은 올바른 주파수에서 이미지와 관중 위치, 동작을 포함한다.
- ** 첫 번째 작업을 정의하세요.** 간단한 시작: 일정한 위치에서 하나의 객체를 선택하고 목표 구역에 배치합니다. 복잡성을 추가하기 전에 이것을 마스터하십시오.
- ** 50개의 시범을 수집하세요.** 일관된 운영자, 일관된 전략. 데이터 품질을 확인하기 위해 20개의 에피소드마다 10분 시간을 할애하세요. 나쁜 에피소드를 즉시 거부하고 다시 녹화하세요.
- ** 첫 번째 ACT 정책을 훈련하십시오.** 기본 하이퍼파레머를 가진 레로봇의 훈련 스크립트를 사용하세요. 훈련은 하나의 GPU에서 2~4시간 안에 완료되어야 합니다.
- 20개의 평가 실험을 실행하세요. 각 실험 전에 같은 장면을 다시 설정하세요. 성공/실패를 기록하고 실패 분석을 위해 각 실험의 비디오를 저장하세요.
- 실점을 진단하고 목표 데이터 수집. 가장 흔한 실패 모드를 확인하세요. 그 오류를 특별히 목표로 하는 20~30개의 시범을 수집하세요. 재훈련하세요.
- ** 80% 이상의 성공률을 달성할 때까지 반복.** 대부분의 팀은 간단한 작업에 대한 2
3개의 수집 훈련 주기에 80%+를 달성합니다.
자주 묻는 질문
몇번의 시연이 필요해요?
간단한 선택 및 장소 작업에 대한 ACT: 50%의 시범은 80% 이상의 성공률을 위해 충분합니다. 방전 정책: 100
ACT vs. 방급 정책 어느 쪽을 선택해야 할까요?
작업이 하나의 명확한 전략을 가지고 있고 가장 빠른 배포 경로를 원한다면 ACT을 사용하십시오. 데이터에는 동일한 작업에 대한 여러 가지 유효한 접근 방법이 포함되어 있다면 (다중 운영체, 모호한 포착 전략) 확산 정책을 사용하십시오. 언어 조건으로 복수 작업 실행이 필요한 경우 VLA를 사용하십시오. 의심의 여지없이 ACT를 시작하세요. 그것은 더 빠른 훈련을 하고 더 복잡한 모델에 투자하기 전에 데이터 수집 파이프라인을 검증할 수 있습니다.
시뮬레이션 데이터를 사용할 수 있나요?
시뮬레이션 데이터는 접촉 풍부한 조작에 대한 신뢰도가 떨어집니다. 가장 효과적인 방법은 시뮬레이션 사전 훈련 + 실제 정렬입니다. 10,000+ 시뮬레이션 에피소드에서 훈련하고, 50
어떤 로봇 하드웨어가 필요해요?
최소: 50 Hz (ViperX-300, Koch v1.1, OpenArm, 또는 유사한) 의 위치 제어 기능을 갖춘 로봇 팔, 원전 인터페이스 (리더 팔 또는 VR 컨트롤러), 2
모방 학습 과 강화 학습 사이의 차이 는 무엇 입니까?
인간 시범에서 모방 학습 트레인
훈련은 얼마나 오래 걸립니다?
200 에피소드 ACT: 1 RTX 4090에서 2
어떤 데이터 형식을 사용해야 할까요?
HDF5는 로봇 시범 데이터의 표준 형식이다. 각 에피소드 파일 내의 개별 데이터 세트로서 공동 위치 (qpos), 속도 (qvel), 카메라 이미지 및 동작을 저장하십시오. 레로봇과 훈련하려면 파켓 형식으로 변환하십시오. 자세한 사양을 위해 [데이터 형식 가이드]
모방 학습이 모바일 조작에 효과가 있을까요?
예, 하지만 그것은 현저하게 더 많은 데이터를 필요로 합니다 (500
RCSV 전문가 들 이 훈련 자료 를 수집 하십시오
RCSV는 종결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결결







