ACT 와 퍼포먼스 정책: 어떤 로봇 학습 알고리즘을 사용해야 하는가? (2025)
ACT vs 디스포지션 정책: 아키텍처 심층 다이빙, 벤치마크 숫자, 구현 코드, 그리고 로봇 학습 작업에 대한 트랜스포머와 액션 <unk>킹과 디스포지션 정책 사이의 선택의 명확한 프레임워크.
[이미테이션 학습 가이드]
[← 연구]
연구자와 ML 엔지니어들이 모방 학습을 위해 트랜스포머와 액션
두 알고리즘은 시범에서 학습합니다
디모스 정책 로봇
ACT (Transformers와 액션
ACT (역사 변환기) 는 무엇 입니까?
ACT는 스탠퍼드에서 토니 자오 등이 발표한 논문 "저비용 하드웨어로 정밀화 된 쌍방향 조작을 배우는 것" (RSS 2023). 핵심 통찰력은 ** 액션 덩어리**: 한 번에 한 행동을 예측하는 대신 정책은 미래의 행동의 짧은 순서 (일반적으로 50
ACT는 CVAE (Conditional Variational 오토인코더) 아키텍처를 사용합니다. 훈련 중에, 코더는 전체적으로 입증된 액션 순서를 스타일 잠그림
ACT 건축물
- 백본: ResNet-18 또는 ResNet-50 이미지 코딩; 표준 트랜스퍼머 코더-덱도더
- 행동 표현: 연속적인 관절 위치, 길이가 k_의 조각으로 예측된다 (전기: 100 50 Hz = 2초)
- ** 손실:** L1 회귀 액션 덩어리 + KL 격차
- 이퍼런스 속도: 빠른
한 번 앞을 지나면 전체 조각을 생산한다. - 변수: ~85M (ResNet-50+ 변압기를 가진 ACT)
전파 정책 은 무엇 입니까?
디푸지언 정책은 "디푸지언 정책: 액션 디푸지언을 통해 시각자동력 정책 학습" (RSS 2023) 에서 콜롬비아와 MIT에서 Chi et al.에 의해 도입되었습니다. 모델
추론에서, 동작은 가우스 소음에서 시작하여 반복적으로 T 단계 (특히 DDPM와 10
확산 정책 구조
- Backbone: CNN 이미지 코더; 잡음 예측 네트워크는 액션 시퀀스 중 U-넷 또는 트랜스포머 (DiT 스타일) 이다
- 행동 표현: 예측 지평선 (H_) 에서 연속적인 공동 위치 또는 최종 효과자 포지 (End-effector poses) (일반적으로 8
16 단계) - ** 손실:** 점수 일치 (소음 예측에 대한 MSE) 를 부정하는
- 공유 속도: ACT보다 느리
각 동작 질의에 따라 단계들을 표시하는 T_가 필요합니다. DDIM는 이것을 크게 줄여줍니다 (10 단계의 추론 실무) - 변수: ~70
300M 척추 선택에 따라
머리 대 머리 비교
| Dimension | ACT | Diffusion Policy |
|---|---|---|
| Core mechanism | CVAE + transformer, predicts action chunk directly | Conditional denoising diffusion over action horizon |
| Multimodal action distributions | Limited — CVAE latent provides some coverage but collapses on complex distributions | Excellent — diffusion naturally represents multimodal distributions |
| Data efficiency | High — works well with 50–200 demos | Moderate — typically needs 100–500 demos; benefits more from scale |
| Inference speed | Fast — single forward pass, chunk reuse; ~5ms/query on A100 | Slower — 10–100 denoising steps; ~50–200ms with DDPM, ~15ms with DDIM on A100 |
| Real-time control | Excellent — designed for 50 Hz with temporal ensemble | Feasible with DDIM + action horizon receding; requires tuning |
| Task types where it wins | Bimanual manipulation, ALOHA-style tasks, precise assembly, long-horizon tasks with clear structure | Dexterous grasping, contact-rich tasks, tasks with multiple valid execution modes |
| Hardware requirements | Single GPU (RTX 3090 sufficient); ~8GB VRAM for inference | Single GPU; DDPM needs ~16GB, DDIM feasible on RTX 3090; more latency-sensitive |
| Implementation complexity | Moderate — well-documented, LeRobot reference implementation | Higher — denoising schedule tuning, inference step count tradeoffs |
| Training time (100 demos) | ~4–8 hours on a single RTX 4090 | ~6–12 hours on a single RTX 4090 |
| Hyperparameter sensitivity | Moderate — chunk size and KL weight matter | High — noise schedule, diffusion steps, and horizon are all critical |
| Open-source maturity | Very high — original codebase + LeRobot | High — original codebase + LeRobot + multiple reproductions |
벤치마크 번호
다음 숫자는 논문 및 재생가능성 연구에서 보고된 결과에서 나온다. 작업 성공률은 데모 품질, 카메라 설정 및 로봇 캘리브레이션에 따라 크게 다릅니다.
LIBERO 벤치마크 (Chi et al. reproductions, 2024)
| Suite | ACT Success Rate | Diffusion Policy Success Rate |
|---|---|---|
| LIBERO-Spatial (10 tasks) | 84.7% | 78.2% |
| LIBERO-Object (10 tasks) | 90.1% | 82.4% |
| LIBERO-Goal (10 tasks) | 71.6% | 68.9% |
| LIBERO-Long (10 tasks) | 53.8% | 48.1% |
ALOHA 부동문 작업 (본 ACT 문서, Zhao et al. 2023)
| Task | ACT (50 demos) | BC-Transformer (50 demos) | Diffusion Policy (50 demos) |
|---|---|---|---|
| Slot insertion | 62% | 24% | 38% |
| Cup unstacking | 98% | 72% | 84% |
| Bag transfer | 100% | 44% | 58% |
RLBench (방산 정책 논문, Chi et al. 2023)
멀티모달 액션 배포 (예를 들어, 여러 유효 접근 방향 중 선택) 과 관련된 작업에 있어서, 디프루션 정책은 표준 ACT를 포함한 회귀 기반 정책에 비해 강한 장점을 나타냅니다: +15
언제 행동 을 선택 해야 합니까?
- 중동 조작: ACT는 ALOHA중동 설정으로 설계되었으며, 시크로네이션된 양 팔의 조율을 우수합니다.
- ** 정확한 조립 작업:**
삽입, 뚜 배치, 플러그 삽입. 쪼개기 메커니즘은 복합 위치 오류를 줄인다. - ** 낮은 디모 예산:** 100 개 이상의 디모네스트를 가지고 있다면 ACT는 일반적으로 더 안정적으로 공감합니다. CVAE 잠자는 전파 다수를 채우기 위해 수천 개의 예제가 필요하지 않고 충분한 표현력을 제공합니다.
- ** 속도 감수적 배포:** 당신이 소박한 하드웨어 (예를 들어, 로컬 워크스테이션 GPU) 에서 50 Hz에서 실행해야 한다면, ACT의 싱글 패스 추론은 DDPM 전파보다 훨씬 더 쉽게 처리된다.
- ** 명확한 구조를 가진 긴 지평선 작업:** ACT의 2초의 조각은 각 단계마다 낮은 단계 내 차이는 있는 단계 (reach, grasp, place) 로 분해되는 작업에 잘 적합합니다.
전파 정책 을 언제 선택 해야 합니까?
- ** 접촉 불확실성 있는 외관 조작:** 접근 각, 잡기 방향 또는 손가락 배치에 여러 가지 유효한 옵션이 있을 때, 전파는 자연적으로 전체 분포를 나타냅니다.
- 불명확한 전문가 증명과 함께 하는 작업: 만약 당신의 텔레오퍼레이션 데이터가 동일한 작업 시작 상태에 대한 여러 가지 다른 전략을 포함한다면, 디프루전 정책은 회귀 기반의 방법처럼 나쁜 정책으로 그들을 평균하지 않을 것이다.
- ** 높은 DOF 유능한 손:** 손가락 궤도 계획에는 높은 본질적인 다 모형성이 있습니다. 방전 정책은 ACT보다 DEXMV 스타일의 작업에서 더 잘 수행합니다.
- ** 규모의 더 큰 데이터 예산:** CVAE KL 정규화가 규모를 줄일 수 있는 방식으로 비정목적은 비정형적 인 표현을 무너뜨리지 않기 때문에 방급 정책의 성능은 데이터 집합 크기에 따라 더 잘 확장됩니다.
- ** 국가 기반 (비주얼) 정책:** 독자적 인식 상태에서만 운영될 때, 유-네트 전파 정책의 척추는 특히 효율적이고 잘 연구되어 있습니다.
두 편의 사건: ACT 승소
쌍방향 조작에 있어서 ALOHA, DK1 및 유사한 플랫폼에서 정의된 작업 클래스 (task class) 는 체계적인 장점을 가지고 있다. 액션 덩어리는 예측 목표에서 직접 좌익과 오른팔 동작 사이의 시간 관계를 암호화한다. 로봇은 전체 부분을 실행합니다. 즉, 조정은 두 가지 별도로 요구되는 정책에서 나오기보다는 예측된 궤도에 "조동"됩니다.
방출 정책은 양 팔의 행동 공간을 연결하여 양 수동 사용에 적응할 수 있지만, 차원적 증가로 인해 해명 문제가 더 어려워지고 데이터 요구 사항이 크게 증가합니다. 실제적으로, 양 수동 연구를 수행하는 연구소 (스탠포드 ALOHA 그룹, UMass, CMU) 는 이러한 이유로 ACT 또는 ACT+ 변종에 기본이 있습니다.
구현: 레로봇 코드 스니펫
두 알고리즘 모두 [HuggingFace LeRobot] (
레로봇으로 ACT 훈련
python lerobot/scripts/train.py \
policy=act \
env=aloha \
dataset_repo_id=lerobot/aloha_sim_insertion_human \
hydra.run.dir=outputs/train/act_insertion \
training.num_workers=4 \
training.batch_size=8 \
training.num_epochs=2000 \
policy.chunk_size=100 \
policy.n_action_steps=100 \
policy.temporal_ensemble_momentum=0.01
ACT의 주요 하이퍼파라메트르를 조정:
T6 : 전진 패스당 예측되는 시간 단계의 수. 50 Hz에서 기본 100 = 2 초. 더 빠른 작업에 50으로 줄여주십시오. T7 : 공격적으로 겹치는 조각이 얼마나 혼합되는지를 제어합니다. 낮은 = 부드럽지만 더 뒤떨어진. T8 : CVAE KL 용어에 대한 무게. 기본 10.0. 간단한 작업에 있어서 정책 모드가 붕괴되면 증가한다.
레로봇의 교육 전파 정책
python lerobot/scripts/train.py \
policy=diffusion \
env=pusht \
dataset_repo_id=lerobot/pusht \
hydra.run.dir=outputs/train/diffusion_pusht \
training.num_workers=4 \
training.batch_size=64 \
training.num_epochs=2000 \
policy.n_action_steps=8 \
policy.horizon=16 \
policy.num_inference_steps=100 \
policy.num_train_timesteps=100
조율할 수 있는 주요 방전 정책 하이퍼파라미터:
T9 : 추론 시 DDIM를 통한 단계. 기본 100 (DDPM). 실시간 사용에 10 20로 설정 (DDIM 스케줄러). T10 : 전개 창. 더 높은 = 더 부드러운 궤도; 더 낮은 = 더 반응. 16는 테이블 위에서 작업에 좋은 출발점입니다. T11 : 다시 쿼리하기 전에 실제로 실행해야 하는 지평선에서 몇 개의 동작이 있습니다. 일반적으로 지평선/2
스케줄러들 사이 전환 (DDPM vs DDIM)
# In your config or Python override:
# Use DDIM for fast inference (10 steps instead of 100)
policy.noise_scheduler._target_=diffusers.DDIMScheduler
policy.num_inference_steps=10
# DDIM produces near-identical quality at 10x faster inference
# Benchmark: 100-step DDPM ~180ms → 10-step DDIM ~18ms on RTX 3090
ACT+ 및 알 수 있는 변형
ACT+ (ALOHA Unleashed, 2024) 는 ACT을 추가적인 훈련 트릭으로 확장합니다. 더 큰 ResNet 척추, 향상된 데이터 증강 및 공동 위치 + 속도 목표. 같은 ALOHA 작업에 대해 바닐라 ACT보다 ~ 15% 더 높은 성공률을 달성합니다. ALOHA 또는 DK1 하드웨어로 새로운 프로젝트를 시작한다면 바닐라 ACT보다 ACT+를 선호하십시오.
**방산 정책 변환기 (DP-T) **는 U-Net 노이즈 예측기를 변환기로 대체하여 더 나은 장거리 시간 모델링과 확장 기능을 제공합니다. 복잡한 작업 (30+ 2nd 에피소드) 에서 DP-T는 CNN 기반 변이를 ~ 8%의 성공률로 우월하지만 더 많은 계산과 데이터를 필요로합니다.
결론: 결정 나무
이 결정 절차를 따르십시오.
- 중동 조작 → ACT (또는 ACT+)
- 만약 100개 이상의 데모를 내면
- 가 필요하다면 < 10ms 추론 → ACT
- task가 멀티모달 액션 배포를 가지고 있다면 (다중 유효한 포착, 접근 각) → 방전 정책
- 만약
한 손 제어 (5+ 손가락 DoF) → 방전 정책 - ** 대용량 데이터 세트 (>500 데모) ** 및 확장
- 만약 불확실하다면 → 50개의 예제 파일럿을 모두 훈련시켜 나눌 수 있고 비교할 수 있다.
데이터 수집 고려 사항
두 알고리즘 모두에서, 디스플레이 품질은 작은 데이터 레지엄 (<200 데모) 에 대한 알고리즘 선택보다 더 중요합니다. 일관된 텔레오페레이션 속도, 부드러운 궤도, 좋은 카메라 커버리가 지배적이다. 우리는 전체 수집 파이프라인을 구축하지 않고 빠르게 반복하려는 팀들을 위해 [데이터 수집 서비스] (
하드웨어: ACT는 ALOHA (저비용 쌍방향) 를 중심으로 설계되었습니다. 디스푸지언 정책은 하드웨어 비관성입니다. 두 가지 모두 LeRobot SDK와 함께 OpenArm 1 및 DK1에서 실행됩니다.
ACT 모델 페이지 → 방산 정책 모델 페이지 → VLA 모델 비교 →
평가에 대해 읽는 것은 한 가지







