Research(으)로 돌아가기

ACT 와 퍼포먼스 정책: 어떤 로봇 학습 알고리즘을 사용해야 하는가? (2025)

ACT vs 디스포지션 정책: 아키텍처 심층 다이빙, 벤치마크 숫자, 구현 코드, 그리고 로봇 학습 작업에 대한 트랜스포머와 액션 <unk>킹과 디스포지션 정책 사이의 선택의 명확한 프레임워크.

[이미테이션 학습 가이드]

[← 연구]

연구자와 ML 엔지니어들이 모방 학습을 위해 트랜스포머와 액션 킹과 디스포지션 정책을 선택하는 데 대한 깊은 비교.

두 알고리즘은 시범에서 학습합니다

디모스 정책 로봇

ACT (Transformers와 액션 킹) 와 디프루전 정책은 2025년 기준으로 로봇 조작 연구에서 가장 많이 사용되는 모방 학습 알고리즘이다. 두 가지 모두 생산 연구실과 실제 하드웨어에 배포되었습니다. 이 두 가지 중 하나를 선택 하는 것은 보편적으로 더 나은 것 이 아닙니다. 그것은 작업 구조, 데이터 예산, 추론 제한 및 얼마나 많은 구현 복잡성을 흡수 할 수 있는지에 달려 있습니다. 이 기사 는 그 호출을 하기 위해 충분한 정확성을 갖춘 차이점을 제시합니다.

ACT (역사 변환기) 는 무엇 입니까?

ACT는 스탠퍼드에서 토니 자오 등이 발표한 논문 "저비용 하드웨어로 정밀화 된 쌍방향 조작을 배우는 것" (RSS 2023). 핵심 통찰력은 ** 액션 덩어리**: 한 번에 한 행동을 예측하는 대신 정책은 미래의 행동의 짧은 순서 (일반적으로 50100 시간 단계 50 Hz) 를 예측합니다. 이것은 효과적인 의사결정 빈도를 감소시키고 단일 단계 예측에서 발생하는 합성 오류를 완화합니다.

ACT는 CVAE (Conditional Variational 오토인코더) 아키텍처를 사용합니다. 훈련 중에, 코더는 전체적으로 입증된 액션 순서를 스타일 잠그림 T3로 지도합니다. 트랜스포머 디코더는 다음 현재의 이미지 관찰 및 T4에 따라 조건화된 액션 조각을 예측합니다. 추론에서, T5는 전 (가우스 단위) 에서 샘플링됩니다. 시간적 집합 중복된 쪼개리 예측을 평균하는 추가로 실행을 원활하게 합니다.

ACT 건축물

  • 백본: ResNet-18 또는 ResNet-50 이미지 코딩; 표준 트랜스퍼머 코더-덱도더
  • 행동 표현: 연속적인 관절 위치, 길이가 k_의 조각으로 예측된다 (전기: 100 50 Hz = 2초)
  • ** 손실:** L1 회귀 액션 덩어리 + KL 격차
  • 이퍼런스 속도: 빠른 한 번 앞을 지나면 전체 조각을 생산한다.
  • 변수: ~85M (ResNet-50+ 변압기를 가진 ACT)

전파 정책 은 무엇 입니까?

디푸지언 정책은 "디푸지언 정책: 액션 디푸지언을 통해 시각자동력 정책 학습" (RSS 2023) 에서 콜롬비아와 MIT에서 Chi et al.에 의해 도입되었습니다. 모델 U-Net 또는 트랜스포머 이 이 과정을 역전시키는 법을 배우게 됩니다. 음한 행동과 현재 관찰을 고려하면 깨끗한 행동을 예측합니다.

추론에서, 동작은 가우스 소음에서 시작하여 반복적으로 T 단계 (특히 DDPM와 10100 단계 또는 DDIM 가속으로 110 단계) 를 갱신하여 샘플링된다. 이것은 각 호출에서 완전한 동작 예측 지평을 (특히 816 단계) 생성한다. 전파 과정의 다중형적 특성상 정책은 동일한 관찰에서 작업을 완료하는 여러 가지 유효한 방법을 나타낼 수 있습니다.

확산 정책 구조

  • Backbone: CNN 이미지 코더; 잡음 예측 네트워크는 액션 시퀀스 중 U-넷 또는 트랜스포머 (DiT 스타일) 이다
  • 행동 표현: 예측 지평선 (H_) 에서 연속적인 공동 위치 또는 최종 효과자 포지 (End-effector poses) (일반적으로 816 단계)
  • ** 손실:** 점수 일치 (소음 예측에 대한 MSE) 를 부정하는
  • 공유 속도: ACT보다 느리 각 동작 질의에 따라 단계들을 표시하는 T_가 필요합니다. DDIM는 이것을 크게 줄여줍니다 (10 단계의 추론 실무)
  • 변수: ~70300M 척추 선택에 따라

머리 대 머리 비교

Dimension ACT Diffusion Policy
Core mechanism CVAE + transformer, predicts action chunk directly Conditional denoising diffusion over action horizon
Multimodal action distributions Limited — CVAE latent provides some coverage but collapses on complex distributions Excellent — diffusion naturally represents multimodal distributions
Data efficiency High — works well with 50–200 demos Moderate — typically needs 100–500 demos; benefits more from scale
Inference speed Fast — single forward pass, chunk reuse; ~5ms/query on A100 Slower — 10–100 denoising steps; ~50–200ms with DDPM, ~15ms with DDIM on A100
Real-time control Excellent — designed for 50 Hz with temporal ensemble Feasible with DDIM + action horizon receding; requires tuning
Task types where it wins Bimanual manipulation, ALOHA-style tasks, precise assembly, long-horizon tasks with clear structure Dexterous grasping, contact-rich tasks, tasks with multiple valid execution modes
Hardware requirements Single GPU (RTX 3090 sufficient); ~8GB VRAM for inference Single GPU; DDPM needs ~16GB, DDIM feasible on RTX 3090; more latency-sensitive
Implementation complexity Moderate — well-documented, LeRobot reference implementation Higher — denoising schedule tuning, inference step count tradeoffs
Training time (100 demos) ~4–8 hours on a single RTX 4090 ~6–12 hours on a single RTX 4090
Hyperparameter sensitivity Moderate — chunk size and KL weight matter High — noise schedule, diffusion steps, and horizon are all critical
Open-source maturity Very high — original codebase + LeRobot High — original codebase + LeRobot + multiple reproductions

벤치마크 번호

다음 숫자는 논문 및 재생가능성 연구에서 보고된 결과에서 나온다. 작업 성공률은 데모 품질, 카메라 설정 및 로봇 캘리브레이션에 따라 크게 다릅니다.

LIBERO 벤치마크 (Chi et al. reproductions, 2024)

Suite ACT Success Rate Diffusion Policy Success Rate
LIBERO-Spatial (10 tasks) 84.7% 78.2%
LIBERO-Object (10 tasks) 90.1% 82.4%
LIBERO-Goal (10 tasks) 71.6% 68.9%
LIBERO-Long (10 tasks) 53.8% 48.1%

ALOHA 부동문 작업 (본 ACT 문서, Zhao et al. 2023)

Task ACT (50 demos) BC-Transformer (50 demos) Diffusion Policy (50 demos)
Slot insertion 62% 24% 38%
Cup unstacking 98% 72% 84%
Bag transfer 100% 44% 58%

RLBench (방산 정책 논문, Chi et al. 2023)

멀티모달 액션 배포 (예를 들어, 여러 유효 접근 방향 중 선택) 과 관련된 작업에 있어서, 디프루션 정책은 표준 ACT를 포함한 회귀 기반 정책에 비해 강한 장점을 나타냅니다: +1525%의 성공률 "추추기" 및 "오픈 드래프트"와 같은 작업에 있어서 접근 각이 모호하다. ACT는 평균으로 되돌아가고 그 중에도 실패하고, 방산 정책은 모드를 샘플링하고,

언제 행동 을 선택 해야 합니까?

  • 중동 조작: ACT는 ALOHA중동 설정으로 설계되었으며, 시크로네이션된 양 팔의 조율을 우수합니다.
  • ** 정확한 조립 작업:** 삽입, 뚜 배치, 플러그 삽입. 쪼개기 메커니즘은 복합 위치 오류를 줄인다.
  • ** 낮은 디모 예산:** 100 개 이상의 디모네스트를 가지고 있다면 ACT는 일반적으로 더 안정적으로 공감합니다. CVAE 잠자는 전파 다수를 채우기 위해 수천 개의 예제가 필요하지 않고 충분한 표현력을 제공합니다.
  • ** 속도 감수적 배포:** 당신이 소박한 하드웨어 (예를 들어, 로컬 워크스테이션 GPU) 에서 50 Hz에서 실행해야 한다면, ACT의 싱글 패스 추론은 DDPM 전파보다 훨씬 더 쉽게 처리된다.
  • ** 명확한 구조를 가진 긴 지평선 작업:** ACT의 2초의 조각은 각 단계마다 낮은 단계 내 차이는 있는 단계 (reach, grasp, place) 로 분해되는 작업에 잘 적합합니다.

전파 정책 을 언제 선택 해야 합니까?

  • ** 접촉 불확실성 있는 외관 조작:** 접근 각, 잡기 방향 또는 손가락 배치에 여러 가지 유효한 옵션이 있을 때, 전파는 자연적으로 전체 분포를 나타냅니다.
  • 불명확한 전문가 증명과 함께 하는 작업: 만약 당신의 텔레오퍼레이션 데이터가 동일한 작업 시작 상태에 대한 여러 가지 다른 전략을 포함한다면, 디프루전 정책은 회귀 기반의 방법처럼 나쁜 정책으로 그들을 평균하지 않을 것이다.
  • ** 높은 DOF 유능한 손:** 손가락 궤도 계획에는 높은 본질적인 다 모형성이 있습니다. 방전 정책은 ACT보다 DEXMV 스타일의 작업에서 더 잘 수행합니다.
  • ** 규모의 더 큰 데이터 예산:** CVAE KL 정규화가 규모를 줄일 수 있는 방식으로 비정목적은 비정형적 인 표현을 무너뜨리지 않기 때문에 방급 정책의 성능은 데이터 집합 크기에 따라 더 잘 확장됩니다.
  • ** 국가 기반 (비주얼) 정책:** 독자적 인식 상태에서만 운영될 때, 유-네트 전파 정책의 척추는 특히 효율적이고 잘 연구되어 있습니다.

두 편의 사건: ACT 승소

쌍방향 조작에 있어서 ALOHA, DK1 및 유사한 플랫폼에서 정의된 작업 클래스 (task class) 는 체계적인 장점을 가지고 있다. 액션 덩어리는 예측 목표에서 직접 좌익과 오른팔 동작 사이의 시간 관계를 암호화한다. 로봇은 전체 부분을 실행합니다. 즉, 조정은 두 가지 별도로 요구되는 정책에서 나오기보다는 예측된 궤도에 "조동"됩니다.

방출 정책은 양 팔의 행동 공간을 연결하여 양 수동 사용에 적응할 수 있지만, 차원적 증가로 인해 해명 문제가 더 어려워지고 데이터 요구 사항이 크게 증가합니다. 실제적으로, 양 수동 연구를 수행하는 연구소 (스탠포드 ALOHA 그룹, UMass, CMU) 는 이러한 이유로 ACT 또는 ACT+ 변종에 기본이 있습니다.

구현: 레로봇 코드 스니펫

두 알고리즘 모두 [HuggingFace LeRobot] (T14) 에서 사용 가능합니다. 아래는 최소한의 훈련 호출입니다.

레로봇으로 ACT 훈련

python lerobot/scripts/train.py \
  policy=act \
  env=aloha \
  dataset_repo_id=lerobot/aloha_sim_insertion_human \
  hydra.run.dir=outputs/train/act_insertion \
  training.num_workers=4 \
  training.batch_size=8 \
  training.num_epochs=2000 \
  policy.chunk_size=100 \
  policy.n_action_steps=100 \
  policy.temporal_ensemble_momentum=0.01

ACT의 주요 하이퍼파라메트르를 조정:

  • T6: 전진 패스당 예측되는 시간 단계의 수. 50 Hz에서 기본 100 = 2 초. 더 빠른 작업에 50으로 줄여주십시오.
  • T7: 공격적으로 겹치는 조각이 얼마나 혼합되는지를 제어합니다. 낮은 = 부드럽지만 더 뒤떨어진.
  • T8: CVAE KL 용어에 대한 무게. 기본 10.0. 간단한 작업에 있어서 정책 모드가 붕괴되면 증가한다.

레로봇의 교육 전파 정책

python lerobot/scripts/train.py \
  policy=diffusion \
  env=pusht \
  dataset_repo_id=lerobot/pusht \
  hydra.run.dir=outputs/train/diffusion_pusht \
  training.num_workers=4 \
  training.batch_size=64 \
  training.num_epochs=2000 \
  policy.n_action_steps=8 \
  policy.horizon=16 \
  policy.num_inference_steps=100 \
  policy.num_train_timesteps=100

조율할 수 있는 주요 방전 정책 하이퍼파라미터:

  • T9: 추론 시 DDIM를 통한 단계. 기본 100 (DDPM). 실시간 사용에 1020로 설정 (DDIM 스케줄러).
  • T10: 전개 창. 더 높은 = 더 부드러운 궤도; 더 낮은 = 더 반응. 16는 테이블 위에서 작업에 좋은 출발점입니다.
  • T11: 다시 쿼리하기 전에 실제로 실행해야 하는 지평선에서 몇 개의 동작이 있습니다. 일반적으로 지평선/2

스케줄러들 사이 전환 (DDPM vs DDIM)

# In your config or Python override:
# Use DDIM for fast inference (10 steps instead of 100)
policy.noise_scheduler._target_=diffusers.DDIMScheduler
policy.num_inference_steps=10

# DDIM produces near-identical quality at 10x faster inference
# Benchmark: 100-step DDPM ~180ms → 10-step DDIM ~18ms on RTX 3090

ACT+ 및 알 수 있는 변형

ACT+ (ALOHA Unleashed, 2024) 는 ACT을 추가적인 훈련 트릭으로 확장합니다. 더 큰 ResNet 척추, 향상된 데이터 증강 및 공동 위치 + 속도 목표. 같은 ALOHA 작업에 대해 바닐라 ACT보다 ~ 15% 더 높은 성공률을 달성합니다. ALOHA 또는 DK1 하드웨어로 새로운 프로젝트를 시작한다면 바닐라 ACT보다 ACT+를 선호하십시오.

**방산 정책 변환기 (DP-T) **는 U-Net 노이즈 예측기를 변환기로 대체하여 더 나은 장거리 시간 모델링과 확장 기능을 제공합니다. 복잡한 작업 (30+ 2nd 에피소드) 에서 DP-T는 CNN 기반 변이를 ~ 8%의 성공률로 우월하지만 더 많은 계산과 데이터를 필요로합니다.

결론: 결정 나무

이 결정 절차를 따르십시오.

  1. 중동 조작 → ACT (또는 ACT+)
  2. 만약 100개 이상의 데모를 내면
  3. 가 필요하다면 < 10ms 추론 → ACT
  4. task가 멀티모달 액션 배포를 가지고 있다면 (다중 유효한 포착, 접근 각) → 방전 정책
  5. 만약 한 손 제어 (5+ 손가락 DoF) → 방전 정책
  6. ** 대용량 데이터 세트 (>500 데모) ** 및 확장
  7. 만약 불확실하다면 → 50개의 예제 파일럿을 모두 훈련시켜 나눌 수 있고 비교할 수 있다.

데이터 수집 고려 사항

두 알고리즘 모두에서, 디스플레이 품질은 작은 데이터 레지엄 (<200 데모) 에 대한 알고리즘 선택보다 더 중요합니다. 일관된 텔레오페레이션 속도, 부드러운 궤도, 좋은 카메라 커버리가 지배적이다. 우리는 전체 수집 파이프라인을 구축하지 않고 빠르게 반복하려는 팀들을 위해 [데이터 수집 서비스] (T15) 텔레오페레이션, HDF5/LeRobot 포맷, QA 을 제공합니다.

하드웨어: ACT는 ALOHA (저비용 쌍방향) 를 중심으로 설계되었습니다. 디스푸지언 정책은 하드웨어 비관성입니다. 두 가지 모두 LeRobot SDK와 함께 OpenArm 1 및 DK1에서 실행됩니다.

ACT 모델 페이지 → 방산 정책 모델 페이지 → VLA 모델 비교 →

평가에 대해 읽는 것은 한 가지 실제 하드웨어에 대한 정책을 증명하는 것은 다른 것입니다.

실제 세계 평가를 실행하라 → 위원회 평가 자료 → 당신의 평가 장비에 대한 하드웨어 →