VLA Models(으)로 돌아가기

방산 정책과 ACT: 어떤 모방 학습 알고리즘을 선택해야 하는가?

방출 정책 (DDPM 액션 <unk>킹) 을 ACT (모바일 ALOHA에서 CVAE 트랜스포머) <unk> 다 모달 캡처, 데이터 필요, 추론 속도, 양동력 적합성과 비교하십시오.

현대 로봇 분야에서 가장 많이 사용된 모방 학습 알고리즘 중 하나는 전파를 부정하는 데 기반하고 다른 하나는 모바일 ALOHA 프로젝트의 CVAE 트랜스포머에 기반하고 있습니다.

업데이트된 2026년 4월 MIT 라이센스

[모든 모델을 탐색] [T0] [Demo 데이터를 수집] [T1]

TL;DR 방산 정책은 DDPM를 통해 전문가 행동의 다모달 분포를 모델로 하여 금 표준을 부정합니다. 시범이 "다 가지 유효한 방법을" 보여주면 작업을 수행합니다. ** Mobile ALOHA에서 ACT** (Action Chunking Transformer) 는 학습된 잠자연 퍼포시전 정책은 다모달 강도에 승리하고, ACT는 단순함, 훈련 속도, 그리고 양동력적 적합성에 승리합니다.

왜 이 비교가 중요 한 이유

[OpenArm] (T2), [ALOHA] (T3), 또는 [Unitree G1] (T4) 에서 자신의 텔레오프 시연을 수집하면, 당신은 재단 VLA를 만지기 훨씬 전에 방전 정책이나 ACT를 훈련시킬 것입니다. 이 두 구조는 순수한 모방 학습의 현재 기본 방식을 정의합니다: 둘 다 액션 킹을 사용하며 MIT 라이선스에 의해 허가되어 있으며 둘 다 [LeRobot] (T5) 에서 참조 구현을 가지고 있으며, 둘 다 20242026 로봇 학습 논문에서 기본 라인으로 정기적으로 인용됩니다.

하지만 그들은 매우 다른 인덕티브 편향을 가지고 있습니다. 만약 당신이 당신의 시범 배포에 대해 잘못된 것을 선택한다면, 당신의 정책은 중량 (악) 으로 붕괴되거나 디모를 기억 (또한 나쁜) 할 것입니다. 이 페이지는 각각의 빛나는 때, 각각의 실패는 어디에, 어떻게 선택해야하는지 통과합니다.

눈치채기 위한 비교

Dimension Diffusion Policy ACT (Action Chunking Transformer)
Origin Chi et al., Columbia, RSS 2023 Zhao et al., Stanford (Mobile ALOHA), RSS 2023
Architecture CNN or transformer backbone + conditional diffusion (DDPM) action head ResNet visual encoder + transformer encoder-decoder with CVAE latent
Action representation Chunk of future actions denoised from Gaussian noise Chunk of future actions decoded autoregressively (or in parallel)
Training objective Denoising score matching / DDPM loss Reconstruction + KL regularizer (CVAE)
Typical chunk size 8–16 steps 50–100 steps (aggressive chunking)
Multi-modal capture Strong — native to the diffusion formulation Partial — latent captures some multi-modality but can mode-collapse
Data needed ~50–200 demos for narrow tasks; more helps ~50 demos often enough for bimanual teleop tasks
Training time Slower (diffusion steps increase wall-clock) Fast — minutes to hours on a single GPU
Inference speed Needs iterative denoising; DDIM or consistency models help Fast single forward pass; chunked execution amortizes
Best-known wins Push-T, real-world manipulation with multi-modal demos (+46.9% vs prior methods) Mobile ALOHA bimanual tasks, dexterous bimanual manipulation
License MIT MIT
Code github.com/real-stanford/diffusion_policy github.com/tonyzhaozh/act

분포 정책: 분포를 모델링하고 평균을 모델링하는 것이 아닙니다

퍼포션 정책의 통찰은 전문가들의 시범이 거의 항상 다모달적이라는 것입니다. 한 컵을 잡는 인간 텔레오퍼레이터는 다른 실험에서 부면 잡거나 최고 잡을 수 있습니다. 이러한 데이터에 훈련된 고전적인 MSE 또는 크로스 엔트로피 정책은 두 가지 평균을 만들지 않을 것입니다. 디푸지언 폴리시에서는 디푸지언스 확률 모델 (DDPM) 를 통해 행동의 배포를 모델링함으로써 이를 회피합니다. 추론 시, 당신은 소음 벡터를 샘플링하고 시각 관측에 따라 조건화된 행동 조각으로 반복적으로 디푸지언스합니다.

[본방식방포 정책 논문]T6) 는 15개의 작업에서 이전 최고의 모방 학습 방법보다 평균 46.9%의 향상을 보고했으며, 건축은 [Octo]T7) 및 3D 방포 정책과 같은 하류 작업에 대한 척추가되었습니다. 비용은 추론입니다. 순진한 구현은 조각당 K 방포 단계를 실행하며 제어 루프를 10 Hz 이하로 밀어 넣을 수 있습니다. 대부분의 생산 배포는 실시간 제어를 얻기 위해 510 단계 또는 일관성 디스틸 된 변형을 가진 DDIM를 사용합니다.

전파 정책 이 밝을 때

  • 시범은 여러 가지 유효한 전략을 포함합니다 (잡기 유형, 접근 방향, 전달 변동).
  • 작은 행동 방해가 결합되는 접촉 부가적인 조작 참조 접촉 부가적인 조작 안내서.
  • 당신은 혼란에 대한 강도를 중요시하고 반복적 인 추론을 부정하는 예산이 있습니다.
  • 정책은 고작화보다는 더 많은 데이터를 가지고 확장하기를 원해요.

ACT: 2개 수록 크로나를 훔친 단순한 트랜스포머

ACT는 모바일 ALOHA와 ALOHA 쌍방향 하드웨어와 함께 참고 모방 학습 스택으로 도입되었습니다. 구조는 의도적으로 간단합니다. 레스넷은 각 카메라 뷰를 암호화하고, 트랜스포머 앵코더는 프로피오셉션과 결합하고, 트랜스포머 디코더는 학습된 CVAE 잠자리에 따라 50100의 미래의 동작을 출력합니다. 추론 시, 당신은 시간적 집합 (평균적 초복 예측) 으로 조각을 실행합니다. 이는 출력을 부드럽게 하고 합성 오류를 줄입니다.

ACT의 마법은 조각 길이가 그리고 집합입니다. 먼 미래의 행동을 예측함으로써, 그것은 단계별 모방 학습의 고전적인 "합성 오류" 문제를 피합니다. 겹치는 조각을 집합함으로써, 높은 주파수 소음을 평균합니다. 결과는: 쌍방향 텔레오프 작업 (컵 스택, 벨크로 띠, 배터리 삽입) 에서 ACT는 정기적으로 50 개의 시범으로 성공하지만 표준 행동 복제 기본은 수천이 필요합니다. ACT는 기본 [ALOHA 기장기 시작 정책]T9이며 LeRobot 프레임워크는 정통 ACT 구현을 배포합니다.

ACT가 빛나는 순간

  • 이중 수동전용 데이터 ACT는 이를 위해 설계되었으며,
  • 퍼포먼스가 공감하기 전에 작업 설계에 대해 빠르게 훈련하고 반복해야 합니다.
  • 주파수 조절은 중요하고 반복적인 소용을 원하지 않습니다.
  • 시범은 비교적 일관성 ( 단일 선호 전략) 이다.

데이터 요구 사항

양 아키텍처 모두 현대 VLA 표준에 따라 데이터 효율적입니다. 7B 모델을 정비하지 않고 좁은 작업에 초등에서 훈련을 받고 있습니다. 실제에서 50 개의 시범은 ACT를 양동 조작 작업에 합리적인 성공률로 만들 것이고, 디스포지션 정책은 일반적으로 100200 개의 시범이 ACT와 일치하는 멀티모달 작업에 필요합니다. 아직 데이터를 수집하지 않은 경우, [RCSV의 텔레오퍼레이션 서비스] (T10) 는 두 건축물 모두 예상하는 2050 Hz 쌍방향 녹음을 캡처하고, 우리의 [ALOHA 데이터 세트 페이지] (T11) 는 준비 된 시작 코퍼스를 가지고 있습니다.

인퍼런스 및 배포

ACT의 단일 전진 패스는 더 쉬운 배포 목표가 된다. 시간적 집합으로 조각 실행은 노트북 GPU에서 3050 Hz에서 편안하게 실행된다. 디푸지언 정책의 반복적 소명은 더 어려운 경우이지만 커뮤니티는 510 단계 또는 일관성 디스틸 된 변종으로 DDIM에 접어들었다. 가장자리 장치에 배치하는 경우 ACT 쪽으로 기울어보세요. 4090 또는 더 나은 작업장에서 실행하는 경우, 둘 다 괜찮습니다.

정직한 타협

ACT의 우아성은 또한 그 한계입니다. 진정한 다 모달 디스플레이를 가진 작업에서 ACT의 CVAE는 평균 전략으로 모드-콜라블을 할 수 있으며, 당황하거나 불의한 행동을 생성합니다. 방산 정책의 분포 모델링은 이것을 우아하게 처리하지만 추론 복잡성과 훈련 시간을 추가합니다. 유용한 유리스틱: 만약 당신의 시범이 일관성 있는 경우 ACT로 시작하세요; 만약 당신의 시범이 다양하다면, 방전 정책으로 시작하세요. 첫 번째 통과가 실망한다면 항상 다른 사람과 재교육을 할 수 있습니다.

두 알고리즘은 또한 "정상" 모방 학습입니다. 그들은 VLA의 기초와 같이 실시예들 사이에서 일반화되지 않습니다. 만약 당신이 크로스 로봇 전송이 필요한 경우, 이 중 하나를 [OpenVLA]T12) 또는 [Octo]T13) 로 결합하고, 실시예에 대한 특정 행동 헤드로서 ACT/Diffusion Policy를 사용하십시오.

컨설팅 할 수 있는 기준

두 건축물 모두 [LIBERO]T14) 과 Push-T/Robomimic 스위트에서 나타난다. [ACT vs Diffusion Policy 결정 지침]T15) 는 우리 블로그에서 스위트 수준의 비교에 더 깊이 들어가 있습니다.

실제로 중요한 실행 세부 사항

두 알고리즘은 대부분의 VLA 논문에서 제안하는 것보다 더 간단하지만 성공이나 실패를 결정하는 세부 사항은 추상적으로 종종 사라집니다. ** 디푸지언 정책**에서 가장 일반적인 3 가지 함정은 다음과 같습니다: (1) 디푸지언을 미흡 훈련시키는 팀들은 200K가 일상적으로 필요한 경우 50K 단계로 멈추고, (2) 행동 정상화를 잘못 조정하는 것, 특히 행동에는 위치와 지잡기 비트 모두 포함되며, (3) 추론에서 EMA 무게를 사용하지 않는 것. 이 세 가지를 올바르게 해 보시면 디푸지언 정책은 놀라운 범위의 작업에 "작정"합니다.

ACT에 있어서, 중요한 단추는 덩어리 길이가 있고 시간적 집합이 증가한다. 짧은 덩어리 (20 단계 이하) 는 ACT를 바닐라 행동 클론과 같은 행동을 하게 하고 복합 오류를 다시 도입한다. 매우 긴 덩어리 (200개 이상) 는 정책이 혼란에 취약하게 한다. 기하급수적으로 중량된 집합을 가진 100 단계의 ALOHA 기본은 강력한 출발점입니다.

두 가지를 기초 VLA로 결합

2026년, 증가하는 수의 생산 스택은 ACT 또는 only Diffusion Policy를 선택하지 않습니다. 그들은 VLA의 기초 뒤에 낮은 수준의 행동 헤드로서 하나를 사용합니다. 패턴: [OpenVLA] (T16) 같은 VLA는 자연어 명령어를 현상 인식한 하위 목표로 분석하고, ACT 또는 Diffusion Policy 헤드에서는 미세한 동작을 실행합니다. 2025년 가장 좋은 성과를 낸 칼빈과 리베로 제출의 대부분은 이렇게 구성되어 있고, 이 분야에서의 노동분할이 성장하고 있음을 반영합니다. 언어와 추상학에 대한 기초 모델, 능숙한 실행에 대한 모방 학습 정책.

비용 및 엔지니어링 노력

현대 표준에 따르면 두 알고리즘 모두 비싸지 않습니다. 단일 24 GB GPU (RTX 4090 또는 A6000) 는 50 개의 데모 데이터 세트에 ACT 또는 디스푸시 정책을 하루 내량으로 훈련시킬 것입니다. ACT는 일반적으로 벽 시계 용어에서 더 빨리 공렴합니다. 왜냐하면 각 단계는 단일 트랜스포머로 앞으로 뒤로 이동하기 때문입니다. 디스푸시 정책의 다 단계 손실은 더 무거운 것이지만 적은 시대를 따라 공렴합니다. 좁은 작업에 대한 인간다운 정책에 대해 412시간의 총 교육 시간을 기대하십시오.

우리의 권고

두 가지 수동 텔레오프 작업은 특히 ALOHA 또는 G1 스타일 하드웨어에서 ACT로 시작됩니다. 당신은 오후에 실행 될 것이고 50 개의 데모로 기본 라인을 이길 수 없습니다. 다양한 시범 또는 접촉 풍부한 작업으로 단일 팔 조작을 위해 ** 디스포시 정책**로 시작하십시오. 의심의 여지가 있을 때, 두 가지 모두 훈련합니다. 그들은 평행적으로 실행하기에 충분히 저렴합니다. 두 가지 모두 성공하거나 두 가지 모두 실패하는 것을 보는 것은 데이터 세트에 대해 중요한 것을 알려줍니다.

** 관련 읽기** OpenVLA vs Octo → RT-X vs OpenVLA → 최고의 VLA 모델 2026 → 방산 정책 모델 페이지 → ALOHA 데이터 세트 → Teleop 데이터 수집 →

여기 있는 모든 VLA는 여러분의 직접적인 시위에 맞춰 조정될 수 있습니다.

Demo를 수집하라 → 하드웨어가 실행되는 것 → 정책 점수를 →