로봇 학습에 대한 전파 정책: 그것이 무엇이며 어떻게 사용해야 하는가
로봇에 대한 전파 정책은 무엇입니까? 전파 모델이 행동 복제보다 어떻게 우수한가를 알아보십시오. 어떤 데이터가 필요하며, 어떻게 훈련해야 하는지, 그리고 RCSV 데이터 서비스가 전파 정책 프로젝트를 어떻게 지원하는지 알아보십시오.
[이미테이션 학습 가이드]
2023년 Chi et al.가 도입한 퍼포션 정책은 로봇 제어에 대한 생성 모델링 혁명을 가져왔다. 행동 생성을 비방적인 문제로 취급함으로써, 단순화된 행동 복제 알고리즘이 할 수 없는 방식으로 조작 행동의 다형적이고 고차원적 성격을 처리합니다.
전파 정책 은 무엇 입니까?
디푸지언 정책은 디푸지언 확률 모델 (DDPM) 를 규명하는 데 기초한 로봇 제어 정책의 한 클래스이다. 액션 공간의 순수한 가우스 잡음에서 출발하여, 모델은 반복적으로 현상의 시각 관측 및 로봇 상태에 따라 조건화되어 10
핵심 통찰력은 전파 모델은 단일 최고의 행동을 예측하는 것보다 행동에 대한 완전한 확률 분포를 학습한다는 것입니다. 로봇학에서는 이것은 중요합니다. 동일한 작업의 인간 시범은 자연적으로 다형적입니다. 사람이 미묘한 맥락 신호에 따라 왼쪽 또는 오른쪽에서 컵을 잡을 수 있습니다. 이 분포를 하나의 예측으로 붕괴시켜야 하는 모델은 한 모드에 종속되어 다른 절반의 시간을 실패하거나, 모드를 평균하여 항상 실패하는 이상한 중간 궤도를 생성합니다.
점수 일치 이론: 전파 모델이 행동을 배우는 방법
디프루전 정책의 수학적 기초는 점수 일치 (score matching) 이 데이터 배포의 로그 확률 밀도의 기하를 학습하는 것입니다. 앞으로의 과정에서는 T 시간 단계를 따라 시범 데이터 세트에서 행동 궤도에 가우스 소음이 점차적으로 추가됩니다. 단계 T에서 소음이 된 궤도는 대략 표준 가우스 소음입니다. 신경망은 이 과정을 역전시키기 위해 훈련되어 있습니다. 잡음적인 행동 궤도와 현재 관측을 고려하면 추가된 잡음을 예측합니다 (또는 동등하게 "점수"
훈련 목표는 속박하게 간단합니다: 예측되는 잡음과 앞으로의 과정에 추가되는 실제 잡음 사이의 평균 사각형 오류 손실. 공식적으로, 관찰에 조건화된 잡음 예측 네트워크 epsilon_theta:
L = E[이치에이치에이치에이치 - 에프실론_이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치
a_0는 청정 행동 궤도이고, epsilon는 가우스 소음 샘플, alpha_t는 시간 단계 t에서 잡음 일정 매개 변수이며, 기대는 모든 훈련 예제, 잡음 샘플 및 시간 단계에 대한 것입니다. 이 목표는 각 시간 단계에서 잡음 분포에 대한 점수 일치와 동등합니다. 네트워크는 모든 잡음 상태에서 "향" 청정 데이터를 학습합니다.
로봇에 있어서 이 작업은 조건화 메커니즘으로 이루어집니다. 일반적으로 CNN 또는 ViT 코더에서 이미지 특징을 관찰하고, 자기 수용 상태가
U-넷 vs 트랜스포머 아키텍처
원래의 전파 정책 논문 (Chi et al., 2023) 은 디노이징 네트워크의 두 가지 척추 구조를 평가했다. 프로젝트의 올바른 변형을 선택하는 데는 타협을 이해하는 것이 필수적입니다.
CNN U-Net (방송 정책-C)
U-Net 척추는 액션 시퀀스를 1D 신호로 취급하고 점프 연결을 가진 convolutional 아키텍처를 적용합니다. 이 구조는 이미지 전파 모델에서 사용되는 것과 같지만 공간적인 차원보다는 시간적 차원에서 작동합니다. 관찰 기능은 각 U-Net 블록에서 FiLM (Feature-wise Linear Modulation) 컨디션을 통해 주입됩니다.
- 변수: ~25M 표준 구성
- ** 훈련 시간:** RTX 3090에서 4~8시간 200회
- 유명 (DDPM, 100 단계): ~ 900ms 각 액션 조각
- 유명 (DDIM, 10 단계): ~15ms 각 액션 조각
- ** 강점:** 빠른 추론, GPU 메모리가 낮아, 단일 작업 정책에 잘 적합합니다
- ** 약점:** 다중 작업 또는 언어 조건 설정에 제한된 용량
트랜스포머 척추 (방산 정책-T)
트랜스포머 척추는 각 행동 시간 단계를 토큰으로 취급하며, 관찰 토큰과 전파 시간 단계 임베디션을 순서에 추가합니다. 전체 순서 전체에 대한 자기주의는 행동 의존성의 더 풍부한 시간 모델링을 가능하게합니다.
- 변수:
60100M, 구성에 따라 - ** 훈련 시간:** RTX 3090에서 8~16시간 200회
- 유출 (DDPM, 100 단계): ~ 2.5s
- 유명 (DDIM, 10 단계): ~45ms 각 액션 조각
- ** 강점:** 더 높은 용량, 더 나은 다중 작업 확장, 간접 주의를 통해 자연어 조절
- ** 약점:** 느린 추론, GPU 메모리 높이는 (16GB+ VRAM가 필요하며, 조정하기가 더 어렵습니다
** 실용적 권고:** 단 작업 정책에 U-Net 척추를 사용하십시오. 추론 속도 (실천 시간 제어 10Hz+) 는 중요합니다. 다 작업 정책, 언어 조건 설정 또는 500+ 개의 시범이 있고 더 큰 모델에서 혜택을 받을 수 있는 용량을 사용할 때 트랜스포머 척추를 사용하십시오. U-Net 변종은 80%의 프로젝트의 올바른 출발점입니다.
추출 시간: DDPM vs DDIM vs 일관성 증류
디스푸지언 정책의 추론 시간 비용은 그 주요 실용적 한계입니다. 단호 과정에는 네트워크에 걸쳐 여러 가지 전진이 필요하며, 각각 약간 덜 잡음적인 행동 궤도를 생성합니다. 단계의 수는 추론 지연성과 행동 품질을 직접적으로 결정합니다.
| Scheduler | Steps | 지연시간 (U-Net, RTX 3090) | Quality vs DDPM-100 | Notes |
|---|---|---|---|---|
| DDPM | 100 | ~900ms | Baseline (100%) | Too slow for most real-time control |
| DDIM | 25 | ~40ms | 98-99% | Good default for deployment |
| DDIM | 10 | ~15ms | 95-98% | Recommended for 10Hz+ control |
| Consistency Distillation | 1-3 | ~3-5ms | 90-95% | Best for high-frequency control, requires additional training |
액션
왜 전파 정책 은 표준 행동 복제 를 능가 하는 이유
표준 행동 복제 (BC) 는 관장된 회귀 문제로서 정책을 훈련시킵니다. 관찰을 통해, 행동을 예측합니다. 이것은 관찰에서 행동으로의 지도가 결정적이고 유모달이 될 때 작동합니다. 실제에서 조작 작업은 거의 없습니다. 테이블에서 블록을 뽑는 것과 같은 "단순" 작업은 여러 유효한 접근 각, 포지 포지 및 프라-프라시 구성이 포함됩니다. 이이브 BC는 결정 지점에서 의문을 품고, 타협적인 움직임 선택을 하거나, 테스트 분포가 훈련과 약간 다르면 완전히 실패하는 정책을 만들어냅니다.
퍼포시전 정책은 벤치마킹 조작 스위트에서 BC 기준선을 지속적으로 우월합니다. 원래 논문에서는 Robomimic 벤치마커의 12 가지 작업 중 11 가지에서 최신 결과를 달성했으며, 높은 행동 다모달성을 가진 작업에 특히 큰 지표가 있습니다. 실제 로봇 평가에서, 디프루션 정책은 더 강력한 복구 행동을 보여주었습니다. 로봇이 약간 잘못된 중간 상태를 달성했을 때, 정책은 결정적인 경로를 따르기보다는 광범위한 배포에서 샘플을 채취했기 때문에 복구 할 수있었습니다.
벤치마킹 결과: Robomimic 및 RoboSuite
| Task (Robomimic) | BC (MLP) | BC-RNN | ACT | Diffusion Policy |
|---|---|---|---|---|
| Lift | 78% | 96% | 98% | 100% |
| Can | 54% | 82% | 90% | 96% |
| Square (bimanual) | 18% | 56% | 72% | 88% |
| Transport (long-horizon) | 6% | 24% | 48% | 62% |
다모달 작업 (스퀘어, 교통) 에서 여러 가지 유효한 전략이 존재하는 경우 가장 큰 지표가 있습니다. 일모달 작업 (리프트) 에서, 모든 기본 라인은 단일 올바른 전략을 찾을 수 있기 때문에 이점은 작습니다.
전파 정책 을 ACT 과 비교 할 때
ACT (Transformers와 액션
| Choose Diffusion Policy When | Choose ACT When |
|---|---|
| Multiple valid grasp strategies exist for each scene | Task has a single dominant strategy |
| You have 300+ demonstrations and want to leverage data scale | You have 50-150 demonstrations and need fast iteration |
| Recovery from perturbations is important | Temporal consistency over long horizons matters more |
| Control rate of 10Hz is sufficient | You need 50Hz+ control frequency |
| Single-arm manipulation with variable approach | Bimanual coordination requiring tight temporal sync |
실제적으로 두 알고리즘 모두 데이터 세트의 품질과 양이 정책 아키텍처 선택보다 더 중요하다는 만큼 경쟁력이 높습니다. 어떤 것을 사용하는지 확실하지 않다면 반복 속도에 대해 먼저 ACT를 시도하고, 평균 모드 오류를 관찰하면 디스푸지언 정책을 시도하십시오.
전파 정책에 대한 데이터 요구 사항
퍼포시전 정책은 ACT보다 더 많은 데이터에서 이익을 얻는데, 주로 디노이징 네트워크는 더 많은 매개 변수와 더 풍부한 모델링 목표를 가지고 있기 때문입니다. 통제된 조건에서 단일 작업에 대한 실질적인 최소는 100-200 개의 시범입니다. 강력한 배포 성능을 달성하기 위해 객체 위치 변동, 조명 변경 및 때때로 센서 노이즈를 처리하기 위해 작업당 300-500 개의 시범을 예산을 예산을 합니다. ACT와 달리, 디스포지션 정책은 상당히 큰 데이터 세트 크기로 추가 데이터로 계속 개선되는 경향이 있습니다. 대규모 데이터 수집 노력에 투자할 계획이라면 더 나은 선택이 됩니다.
데이터 다양성은 볼륨만큼이나 중요합니다. 디스플레이는 배포에서 기대하는 객체 위치, 지향 및 장면 구성의 범위를 뻗어 나가야 합니다. 객체들이 항상 정확히 같은 장소에 있는 긴밀한 디스플레이 클러스터는 객체가 몇 센티미터로 이동할 때 실패하는 정책을 생성합니다. RCSV의 [관리된 데이터 수집 서비스]
관찰 표현 또한 중요한 의미를 갖는다. ResNet 이미지 코더를 종착순으로 훈련한 디스푸시 정책은 일반적으로 좁은 작업 배포에 대한 얼어붙은 사전 훈련된 코더를 사용하는 정책을 능가하지만, 사전 훈련된 코더 (R3M, MVP, DINO) 는 테스트 조건이 훈련과 다르면 더 나은 일반화를 제공합니다. 대부분의 실용적인 프로젝트에서는 데이터 세트의 가치를 극대화하기 위해 미리 훈련된 코더로 시작하고, 500개 이상의 시범과 안정적인 환경이 있으면만 엔드-투-엔드 훈련으로 전환하십시오.
교육 설정 및 컴퓨팅 요구 사항
디스푸지언 정책의 참조 구현 (컬럼비아 로봇 연구소 GitHub에서 사용할 수 있습니다) 은 UNet 척추 (더 빠른 추론, 더 낮은 용량) 또는 트랜스포머 척추 (더 느린 추론, 더 높은 용량) 를 갖춘 훈련입니다. 대부분의 단일 작업 프로젝트에서 UNet 변종은 올바른 출발점입니다. 단일 RTX 3090 또는 4090에 대한 훈련은 관찰 해상도와 행동 지평 길이에 따라 200 에피소드 데이터 세트에 대해 4-12 시간 소요됩니다.
올바른 설정에 필요한 주요 하이퍼 파라미터: 행동 지평 (표면 작업에 대해 예측할 수 있는 미래의 단계의 수
빠른 시작 훈련 명령
실제 로봇에서 추론을 하기 위해, 100 단계의 DDPM는 일반적으로 높은 주파수 제어에 너무 느립니다. 10-25 단계의 DDIM 스케줄러를 사용하세요. 이는 버퍼로 10Hz 제어에 적합한 RTX 3090
전파 정책에 대한 RCSV 데이터 서비스를 이용
RCSV의 [데이터 서비스 파이프라인]
우리의 수집 서비스는 [RCSV 텔레오퍼레이션 플랫폼]
[OpenArm 1]
관련 독서
- VLA 모델 설명 - 방출 정책 대신 VLA를 언제 사용할 것인가
- ALOHA 로봇 가이드 -- ALOHA 하드웨어에 대한 ACT vs 디스포지션 정책
- [로봇 훈련 데이터란 무엇인가?]
- 로봇 데이터 해상 - 전파 정책 데이터 집합에 대한 표기
- RCSV 데이터 서비스 - 방급 정책에 대한 ZARR 형식 데이터 집합
- 공공 데이터 세트 -- 훈련 준비된 조작 데이터 세트
- [표준]
T14 ) - 과제들 간의 정책 성과를 비교







