Blog(으)로 돌아가기

로봇 학습의 전파 정책: 어떻게 작동하며 언제 사용해야 하는가 (2026)

로봇 조작에 대한 전파 정책: 비방이 어떻게 행동을 예측하는지, CNN와 트랜스포머, 그리고 ACT와 행동 복제보다 언제 이길 수 있는지. 2026 가이드

디스푸지언 정책은 접촉 부가하고 능숙한 로봇 조작 작업에 대한 선도적인 모방 학습 알고리즘입니다. 그것은 표준 행동 복제 을 지속적으로 우월하고 멀티모달 디스플레이 작업에서 ACT 을 종종 이기고 있습니다. 이 가이드에서는 그것이 어떻게 작동하는지, 어떤 하이퍼 파라미터가 가장 중요하고 RCSV에서 어떤 하드웨어로 결합해야하는지 설명합니다.

전파 정책 은 무엇 입니까?

2023년 컬럼비아 대학교에서 Chi et al.가 도입한 디프러시온 정책은 이미지 생성 디프러시온 모델 (DDPM, DDIM) 에서 로봇 행동 예측에 점수를 맞추는 프레임워크를 적용한다. 관찰에서 단일 다음 행동 또는 짧은 행동 순서기를 예측하는 대신 정책은 무작위로 무작위 행동 궤도를 일관성 있고 고품질의 운동 계획으로 표시하는 것을 배우게 된다. 그 결과, 실제적으로, 고전적 행동 복제보다 인간 시범 데이터의 다형적 성격을 처리하는 데 훨씬 더 나은 행동 정책이 나타났습니다.

핵심 통찰력은 간단합니다. 인간 운영자로부터 로봇 시범을 수집할 때, 다른 운영자는 종종 동일한 작업을 질적으로 다른 방식으로 수행합니다. 그들은 왼쪽 또는 오른쪽에서 객체에 접근하거나 끌어당기 전에 밀어 넣거나 옆에서 꽉 잡을 수 있습니다. 이 모든 것은 유효하고 작업을 완료하는 행동입니다. 평균 제곱 오류를 훈련받은 표준 행동 복제 모델은 이러한 모드를 통해 평균하여 두 가지 유효한 행동 사이에 있는 행동을 생성합니다. 일반적으로 그 자체는 무효입니다. 방산 정책은 관찰을 받은 행동의 완전한 조건부 분포를 모델링하기 때문에 각 모드에서 독립적으로 표현하고 샘플을 만들 수 있습니다.

이 논문에서는 12개의 시뮬레이션 및 실제 로봇 조작 작업에 대한 전파 정책을 보여줬으며, 11개 작업에서 최첨단 결과를 달성했다. 실제 로봇 작업에는 T 모양의 블록을 밀어내는 것, 토르틸라에 양동식 퍼뜨리는 소스, 그리고 1mm 배치 용당성을 가진 정밀 도구 선택 작업이 포함되었다.

전파 정책 이 어떻게 작동 하는 것 입니까?

전파 정책에 대한 교육과 추론은 DDPM의 표준 비명 프레임워크를 따르며, 이미지를 대신 액션 시퀀스에 적응된다.

교육

훈련 중에, 청정 행동 궤도 T0 (실제 데이터 세트에서 샘플링) 는 잡음 스케줄에 따라 T 시간단 (일반적으로 T=100) 에서 가우스 소음을 추가함으로써 점차 손상됩니다. 신경망 (Nural network) 은 1D 시간적 CNN 또는 트랜스포머 (transformer) 를 통해 각 단계에 추가된 잡음을 예측할 수 있는 훈련이 이루어져 있으며, 잡음적인 행동, 소용 단계 지표, 그리고 현재 로봇 관찰 ( 이미지 + 자기 인식) 을 고려할 수 있다. 이것은 표준 점수 일치 목표이다. 네트워크는 예측된 잡음 (소음 행동, 시간 단계, 관찰) →에서 지도를 학습하고, 예측된 잡음과 실제 잡음 사이의 MSE는 모든 훈련 쌍에서 최소화됩니다.

인퍼런스

추론 시, 모델은 액션 시퀀스와 같은 차원의 순수한 노이즈 벡터에서 시작됩니다. 그 다음, 현재 관찰에 의해 시끄러운 구성 요소를 예측하고 추출하기 위해 신경 네트워크를 호출하는 각 단계를 (DDIM에 K=10, DDPM에 K=100) 로 실행합니다. K 단계 이후, 결과는 전체 액션 순서 (일반적으로 10Hz에서 1632 단계 앞당겨 또는 50100 단계 50Hz) 이 현재 상태를 원활하게 계속하는 것을 나타냅니다.

관찰 조건은 주요 건축 선택입니다. 방산 정책은 두 가지 코더 옵션을 지원합니다.

  • CNN 기반 (DP-C): ResNet-18 또는 ResNet-34 척추는 이미지 관측을 특징 벡터로 암호화하고, 그 다음 자체 수용 상태와 결합하여 비호하는 CNN를 조건화하는 데 사용됩니다. 훈련 및 추론을 더 빨리 수행하고, 단일 카메라 설정에 더 좋습니다.
  • ** 트랜스포머 기반 (DP-T):** ViT 스타일의 트랜스포머는 이미지 토큰을 암호화하고 proprioception 토큰과 결합한다. 다 카메라 설정에 더 표현력이 있고, 추론이 느려 (RTX 3090에서 120ms와 40ms)

지평선 통제를 중단

중요한 구현 세부 사항: 퍼포션 정책은 후퇴 지평방법으로 접근한다. 정책은 길이 Tp (예를 들어 16 단계) 의 행동 순서를 예측하지만 재계획 전에 첫 번째 Ta 단계를 (예를 들어 8 단계) 수행한다. 이것은 시간적 일관성 (장기 Tp = 부드러운 움직임) 과 반응성 (단기 Ta = 예기치 않은 변화에 더 빠른 반응) 사이의 균형을 만듭니다. Tp/Ta = 2 비율은 표준 기본값이며 대부분의 조작 작업에 잘 작동합니다.

전파 정책과 ACT: 실용적인 비교

Property Diffusion Policy ACT (Action Chunking Transformers)
Multimodal action distributions Excellent — models full distribution Good — CVAE captures variance but can mode-average
Inference latency (RTX 3090) 40–120ms (DDIM K=10 to K=100) ~10ms (single forward pass)
Training time (50 demos, RTX 3090) 4–8 hours (CNN), 8–16 hours (Transformer) 2–4 hours
Temporal consistency High — denoising produces smooth trajectories High — action chunking provides consistency
Bimanual coordination Good with transformer variant Excellent — natively designed for ALOHA bimanual
Dexterous hand control (20+ DOF) Excellent — handles high-dim action spaces well Moderate — chunk size tuning needed for high DOF
Open-source reference implementation Yes — diffusion_policy repo (Columbia) Yes — act repo (Stanford)
LeRobot integration Yes — native support Yes — native support

제목 비교: ACT는 추론을 더 빠르고 훈련이 더 쉬워, 이는 제한된 컴퓨팅을 가진 시간적 중요한 시스템과 팀에 더 좋습니다. 방산 정책은 다형 시범을 더 자연스럽게 처리하고 능숙한 손과 같은 고차원 행동 공간에 더 잘 확장합니다. 실제 로, 50200개의 깨끗한 시범 과목 을 가진 대부분의 테이블 표 조작 작업 에 있어서 성능 은 비교적 좋다. 시범 과목 은 자연적으로 다양 한 경우 또는 활동 공간 은 14DOF를 초과 할 때 전파 정책 을 선택 하십시오.

퍼포시션 정책과 표준 행동 클론

표준 행동 복제 (BC) 는 예측된 행동과 입증된 행동 사이의 MSE를 최소화합니다. 이것은 시범 데이터 세트가 유모달이 될 때 작동합니다. 모든 운영자가 작업을 동일한 방식으로 수행 할 때. 문제는 인간 시범이 거의 결코 그렇지 않다는 것입니다. BC 정책은 두 가지 다른 후속 행동으로 나타난 시사에서 나타난 관찰을 볼 때, 그것을 평균하여 두 경우 모두 잘못된 움직임을 생성합니다. 이것을 모드 평균 문제라고합니다.

방산 정책은 모드 평균을 피합니다. 왜냐하면 그것은 단지 조건부 평균 E (행동 관찰) 보다 전체 조건부 분포를 모델링하기 때문입니다. 같은 모호한 관찰을 고려하면 방산 정책은 한 모드 또는 다른 모드에서 일관되게 샘플을 결코 평균하지 않습니다. 그래서 본 논문에서는 가장 높은 시범차를 가진 작업에 대해 BC보다 가장 큰 개선이 나타났는데, 이는: 추진 작업 (운동가들은 블록을 다른 각에서 밀어 넣었다) 와 쌍방향 퍼뜨리 작업 (운동가들은 서로 다른 조정 전략을 사용했다).

실질적으로, 작업의 변동은 입증된 궤도에서 5% 미만일 경우 (즉, 모든 운영자는 정확히 같은 일을 수행한다) BC는 좋은 척추를 가진 경우 전파 정책과 일치 할 수 있습니다. 작업의 자연적인 변동이 있다면 그리고 대부분의 실제 작업이 전파 정책은 추가 교육 시간을 가치가 있습니다.

전파 정책 을 언제 선택 해야 합니까?

다음 각 호의 경우 전파 정책을 선택하십시오

  • 당신의 시범은 다중형입니다. 다른 사업자가 의미있는 다른 운동 전략으로 작업을 완료하면, 방급 정책은 ACT 또는 BC보다 더 잘 처리합니다.
  • 당신은 높은 DOF 행동 공간을 가지고 있습니다. Dexterous hands (1620+ DOF) 는 ACT의 고정된 조각 기반 접근 방식보다 전체 행동 차원에서 퍼포먼스 정책의 공동 상관관계를 모델링하는 능력에서 더 많은 혜택을 누립니다.
  • 정확한 최종점 위치가 필요합니다. 원래 논문에서는 디프루전 정책이 디노싱 중에 반복적인 정밀화로 인해 정밀한 삽입 작업에서 2mm 이하의 배치 정확성을 달성한다는 것을 보여주었습니다.
  • 당신은 발표된 결과들에 대한 벤치마킹을 하고 있습니다. 최근 많은 논문 (2024~2026) 은 전파 정책을 기본으로 보고하고 있습니다. 이러한 숫자를 재현하는 것은 ACT로 전환하는 것보다 전파 정책으로 더 쉽습니다.
  • ** 훈련에 더 많은 GPU 예산이 있습니다.** 여러 GPU를 가지고 있다면, 전파 정책 훈련은 잘 병행되며 트랜스포머 변종은 더 많은 계산으로 더 나은 결과를 달성합니다.

다음 각 호의 경우

  • 유추성 늦도는 중요하다. 유추성 단계마다 10ms에서 ACT는 소박한 하드웨어에서 100Hz에서 실행될 수 있습니다. 40120ms에서 방출 정책은 K=10100에 825Hz에서 종료됩니다.
  • ** ALOHA 형식에서 두 개의 수동 데이터를 사용 중입니다.** ACT는 ALOHA를 위해 설계되었으며 참조 구현은 형식 변환이 필요하지 않습니다.
  • ** 훈련 계산은 제한적입니다.** 2시간 ACT 훈련은 방전 정책 문제에서 48시간에 비해 작업 설계에 빠르게 반복을 할 때 진행됩니다.
  • 당신은 특정 이전 결과와 일치합니다. 스탠퍼드의 ACT 숫자를 정확하게 복제해야 한다면 ACT를 사용하십시오.

방산 정책의 주요 하이퍼파라메트르

이 매개 변수는 실제로 바늘을 움직이고 있는데, 대략적으로 중요성이 떨어지는 순서로

Parameter Default Effect of Increasing
pred_horizon (Tp) 16 Smoother trajectories; slower re-planning; more memory
action_horizon (Ta) 8 Fewer inference calls; less reactive to perturbations
obs_horizon 2 More temporal context; helps with tasks requiring memory of recent motion
num_diffusion_iters (K) 10 (DDIM), 100 (DDPM) Higher quality actions; slower inference
noise_scheduler DDIM DDPM is higher quality but 10x slower; DDIM preferred for real-time use
vision_encoder ResNet-18 ResNet-34 / ViT improves performance; requires more compute
n_obs_steps 2 Stacking more observation frames helps tasks with motion-based cues (sliding, rotating)

가장 흔한 오류: T8을 너무 길고 T9을 너무 짧게 설정합니다. 이것은 계획된 궤도에 과도하게 헌신하고 접촉 사건에 반응하지 못하는 정책을 생성합니다. 능숙한 조작을 위해 권장되는 출발점은 Tp=16, Ta=8 입니다. 그리고 당신이 관찰하는 작업 실패 모드를 기반으로 조정합니다.

# 디스포션 정책 (Columbia 참조 구현) git clone T24 cd diffusion_policy conda env를 설치하여 -f conda_environment.yaml conda를 활성화 로보디프 # Push-T 데이터 세트에서 CNN 버라이어트를 설치합니다. python train.py --config-name=train_diffusion_unet_lowdim_push_t_work space # git clone T24 cd diffusion_policy conda env -config-name=train_diffusion\unet_hybrid_work space \ task.dataset\path=/to/your/lerobot_dat_task._actionhorizon=16 \on._horizon_task.\horizon_task.\2\o_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top_top

전파 정책에 잘 맞는 데이터 세트

퍼포션 정책은 다음과 같은 특징을 가진 데이터 세트에 가장 잘 수행합니다.

  • ** 부드럽고 연속적인 궤도:** 디노이징 프로세스가 부드러운 출력을 생성하기 때문에, 거나 끊이지 않는 움직임으로 하는 시범은 모델의 인덕티브 편향과 훈련 데이터 사이의 부합을 만들어냅니다.
  • 결국 효과자 상태 기록: 표준 CNN 변종의 방전 정책은 관절 각이 아닌 최종 효과자 위치+지향+잡기 기능을 사용한다. 데이터 세트가 관절 각을 기록한다면, 앞으로의 운동학층이 필요하거나 관절 공간 변종을 훈련시킬 필요가 있다.
  • ** 사용 가능한 경우 여러 개의 조회:** 트랜스포머 변종 (DP-T) 은 23 카메라 조회를 토큰으로 사용할 수 있습니다. 다중 조회 설정은 잠금 또는 깊이 모호한 작업에서 일관되게 단일 조회보다 더 나은 성능을 발휘합니다.

퍼포먼스 정책과 호환되는 출판 벤치마크 데이터셋

Dataset Tasks Notes
Push-T (Columbia) T-block pushing Reference benchmark; highly multimodal; download from diffusion_policy repo
RoboMimic Can, Lift, Square, Transport Standard benchmark; MH (multi-human) subset tests multimodal handling best
ALOHA / ACT datasets Bimanual tabletop tasks Requires joint-space conversion; diffusion policy-T performs comparably to ACT
DROID (Google) 76,000 diverse robot episodes Large-scale; good for fine-tuning pretrained diffusion models
RCSV custom datasets Varies by project Delivered in LeRobot format; compatible with diffusion_policy repo out of the box

방급 정책에 대한 RCSV 하드웨어 권고

우지 손

손가락 수준 실력 (指水平技巧) 을 필요로 하는 작업에 있어서 [Wuji Hand] (T11) 은 RCSV에서 전파 정책에 가장 강력한 플랫폼이다. 손가락 끝에 20 개의 활성 DOF 및 768 점의 촉각 감지 기능을 통해, 전파 정책의 트랜스포머 변이가 완전히 활용할 수 있는 풍부한 행동 공간과 풍부한 관찰 공간을 제공합니다. 우리의 내부 벤치마크에서, 유지 핸드에서 퍼포먼스 정책-T는 접촉 부가적인 손가락 상호작용의 작업에 대한 ACT보다 성공률에서 1825 퍼센트 점수를 우월합니다.

768 포인트 터틸 배열은 768 차원 관찰 벡터를 수동으로 생성합니다. DP-T 트랜스포머에 대해 평평하고 표지화합니다. 순수한 시각 정책에 비해 훈련 시간은 약 40% 증가하지만, 핀 삽입, 케이블 라우팅 및 표면 검사와 같은 접촉 민감한 작업에서 성공률은 크게 향상됩니다.

테이블탑 조작: 오픈아름 베이스

표준 테이블톱 픽앤플레이, 어셈블리 및 도구 사용 작업에 있어서, [OpenArm Base] (T12) 은 전파 정책 작업에 가장 경제적인 플랫폼이다. 50Hz의 공동 위치 제어로 실행되며, 전파 정책의 참조 구현 목표가 되는 표준 6DOF + 지갑 동작 공간을 지원하며, 데이터를 레로봇 형식으로 원산적으로 수출한다. CNN의 방출 정책 변종은 100개의 시연의 OpenArm 데이터 세트를 사용하여 단일 RTX 4090에서 46시간에 열차합니다.

쌍방향 오픈아름 설정 (공유 설치 프레임에 두 팔) 에, 트랜스포머 변종이 권장됩니다. 양 팔의 합동 상태 벡터에서 추가적인 간접주의는 CNN 변종이 놓친 쌍방향 조정 패턴을 캡처합니다.

계산 요구 사항

Configuration Minimum Recommended
DP-C (CNN, single camera) RTX 3060 12GB, 32GB RAM RTX 3090 24GB, 64GB RAM
DP-T (Transformer, 3 cameras) RTX 4080 16GB, 64GB RAM RTX 4090 24GB or A100 40GB
DP-T + Wuji tactile (768D obs) RTX 4090 24GB, 128GB RAM A100 80GB or 2x RTX 4090

RCSV의 데이터 서비스 는 지역 컴퓨팅 용량을 초과하는 전파 정책 실행에 대한 A100 훈련 노드에 액세스 할 수 있습니다. 관리 된 훈련 작업은 요구에 따라 계획됩니다.

자주 묻는 질문

로봇 분야에서 전파 정책은 무엇입니까?

디푸지언 정책은 행동 예측을 부정하는 디푸지언 프로세스로 취급하는 모방 학습 알고리즘이다. 추론 시에는 무작위 가우시안 소음에서 시작하여 현재의 로봇 관측에 따라 조건화된 일관된 행동 순서로 반복적으로 정비한다. 이 접근법은 멀티모달 액션 배포를 나타낼 수 있습니다. 표준 행동 복제 및 심지어 ACT가 어려움을 겪는 작업을 완료하는 여러 유효한 방법.

ACT 대신 전파 정책을 언제 사용해야 할까요?

디스푸시전 정책은 작업이 멀티모달 디스플레이를 (운전자가 동일한 작업을 의미있는 다른 방식으로 수행) 할 때, 정확한 최종 포인트 제어가 필요할 때 또는 디스플레이가 높은 변동이 있을 때 더 좋은 선택입니다. ACT는 추론을 더 빨리 수행하고 훈련에 대한 계산이 덜 필요하므로 지연 제한된 응용 프로그램 및 제한된 GPU 리소스를 가진 팀에 더 좋습니다. 50200개의 시범을 가진 대부분의 테이블탑 조작 작업에 대해, ACT와 전파 정책은 비교적 잘 수행된다. 자세한 분열을 위해 [ACT와 전파 정책 가이드] (T14) 를 참조하십시오.

전파 정책 훈련에 얼마나 걸리나요?

표준 테이블톱 데이터 세트 (50200 에피소드) 에 CNN 기반의 전파 정책을 훈련하는 것은 단일 RTX 3090 또는 RTX 4090에서 48시간을 소요합니다. 트랜스포머 기반의 변종은 동일한 데이터 세트 크기에 816시간을 소요합니다. 훈련 시간은 데이터 세트 크기와 대략 선형적으로 확장됩니다. RCSV의 플랫폼은 미리 구성된 훈련 파이프라인을 제공합니다. 이는 설정 시간을 30분 이하로 줄여줍니다.

어떤 하드웨어는 전파 정책에 가장 잘 작동합니까?

퍼포시전 정책은 원래 정확하고 부드러운 궤도를 필요로 하는 작업에 벤치마킹되었습니다. 밀어 넣고, 삽입하고, 픽업. 현명한 손가락 수준 작업에 대해, [Wuji Hand] (T15) (20 DOF, 768 포인트 터틸) 와 결합된 퍼포시전 정책은 접촉 풍부한 조작 작업을위한 작업에서 ACT를 우월합니다. 테이블 팔 작업에 대해, [OpenArm Base] (T16) 은 가장 비용 효율적인 플랫폼입니다. RCSV는 관리된 데이터 수집 및 훈련 파이프라인으로 두 구성 모두 지원합니다.

관련 독서

  • [행위 정책 설명]T17) 트랜스포머와 깊이 잠수하는 액션
  • [ALOHA 로봇 가이드]T18) ACT 및 전파 정책의 두 가지 플랫폼
  • [로보미믹 가이드]T19) 전파 정책과 호환되는 벤치마크 데이터 집합
  • [이미레이션 학습을 위한 최고의 로봇]T20) 플랫폼 비교
  • [RCSV에서 우지 손] T21) 20 DOF 전파 정책에 능숙한 손
  • [OpenArm Base]T22) 전파 정책 교육에 대한 테이블탑 팔
  • RCSV 데이터 서비스 관리된 데이터 수집 + 교육 파이프라인