Blog(으)로 돌아가기

로봇 학습에 대한 전파 정책: 그것이 무엇이며 어떻게 사용해야 하는가

로봇에 대한 전파 정책은 무엇입니까? 전파 모델이 행동 복제보다 어떻게 우수한가를 알아보십시오. 어떤 데이터가 필요하며, 어떻게 훈련해야 하는지, 그리고 RCSV 데이터 서비스가 전파 정책 프로젝트를 어떻게 지원하는지 알아보십시오.

[이미테이션 학습 가이드]

2023년 Chi et al.가 도입한 퍼포션 정책은 로봇 제어에 대한 생성 모델링 혁명을 가져왔다. 행동 생성을 비방적인 문제로 취급함으로써, 단순화된 행동 복제 알고리즘이 할 수 없는 방식으로 조작 행동의 다형적이고 고차원적 성격을 처리합니다.

전파 정책 은 무엇 입니까?

디푸지언 정책은 디푸지언 확률 모델 (DDPM) 를 규명하는 데 기초한 로봇 제어 정책의 한 클래스이다. 액션 공간의 순수한 가우스 잡음에서 출발하여, 모델은 반복적으로 현상의 시각 관측 및 로봇 상태에 따라 조건화되어 10100 단계의 디노싱 후에 일관된 고품질의 액션 순서를 생성합니다.

핵심 통찰력은 전파 모델은 단일 최고의 행동을 예측하는 것보다 행동에 대한 완전한 확률 분포를 학습한다는 것입니다. 로봇학에서는 이것은 중요합니다. 동일한 작업의 인간 시범은 자연적으로 다형적입니다. 사람이 미묘한 맥락 신호에 따라 왼쪽 또는 오른쪽에서 컵을 잡을 수 있습니다. 이 분포를 하나의 예측으로 붕괴시켜야 하는 모델은 한 모드에 종속되어 다른 절반의 시간을 실패하거나, 모드를 평균하여 항상 실패하는 이상한 중간 궤도를 생성합니다.

점수 일치 이론: 전파 모델이 행동을 배우는 방법

디프루전 정책의 수학적 기초는 점수 일치 (score matching) 이 데이터 배포의 로그 확률 밀도의 기하를 학습하는 것입니다. 앞으로의 과정에서는 T 시간 단계를 따라 시범 데이터 세트에서 행동 궤도에 가우스 소음이 점차적으로 추가됩니다. 단계 T에서 소음이 된 궤도는 대략 표준 가우스 소음입니다. 신경망은 이 과정을 역전시키기 위해 훈련되어 있습니다. 잡음적인 행동 궤도와 현재 관측을 고려하면 추가된 잡음을 예측합니다 (또는 동등하게 "점수" 로그 밀도의 기하).

훈련 목표는 속박하게 간단합니다: 예측되는 잡음과 앞으로의 과정에 추가되는 실제 잡음 사이의 평균 사각형 오류 손실. 공식적으로, 관찰에 조건화된 잡음 예측 네트워크 epsilon_theta:

L = E[이치에이치에이치에이치 - 에프실론_이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치에이치

a_0는 청정 행동 궤도이고, epsilon는 가우스 소음 샘플, alpha_t는 시간 단계 t에서 잡음 일정 매개 변수이며, 기대는 모든 훈련 예제, 잡음 샘플 및 시간 단계에 대한 것입니다. 이 목표는 각 시간 단계에서 잡음 분포에 대한 점수 일치와 동등합니다. 네트워크는 모든 잡음 상태에서 "향" 청정 데이터를 학습합니다.

로봇에 있어서 이 작업은 조건화 메커니즘으로 이루어집니다. 일반적으로 CNN 또는 ViT 코더에서 이미지 특징을 관찰하고, 자기 수용 상태가 이 현 현상에 적합한 행동 궤도에 대한 편향을 나타냅니다. 동일한 비명 네트워크는 다른 관찰에 대해 근본적으로 다른 궤도를 생성할 수 있습니다. 왜냐하면 관찰 기능은 학습된 행동 분포의 다른 영역을 통해 비명 과정을 지시하기 때문입니다.

U-넷 vs 트랜스포머 아키텍처

원래의 전파 정책 논문 (Chi et al., 2023) 은 디노이징 네트워크의 두 가지 척추 구조를 평가했다. 프로젝트의 올바른 변형을 선택하는 데는 타협을 이해하는 것이 필수적입니다.

CNN U-Net (방송 정책-C)

U-Net 척추는 액션 시퀀스를 1D 신호로 취급하고 점프 연결을 가진 convolutional 아키텍처를 적용합니다. 이 구조는 이미지 전파 모델에서 사용되는 것과 같지만 공간적인 차원보다는 시간적 차원에서 작동합니다. 관찰 기능은 각 U-Net 블록에서 FiLM (Feature-wise Linear Modulation) 컨디션을 통해 주입됩니다.

  • 변수: ~25M 표준 구성
  • ** 훈련 시간:** RTX 3090에서 4~8시간 200회
  • 유명 (DDPM, 100 단계): ~ 900ms 각 액션 조각
  • 유명 (DDIM, 10 단계): ~15ms 각 액션 조각
  • ** 강점:** 빠른 추론, GPU 메모리가 낮아, 단일 작업 정책에 잘 적합합니다
  • ** 약점:** 다중 작업 또는 언어 조건 설정에 제한된 용량

트랜스포머 척추 (방산 정책-T)

트랜스포머 척추는 각 행동 시간 단계를 토큰으로 취급하며, 관찰 토큰과 전파 시간 단계 임베디션을 순서에 추가합니다. 전체 순서 전체에 대한 자기주의는 행동 의존성의 더 풍부한 시간 모델링을 가능하게합니다.

  • 변수: 60100M, 구성에 따라
  • ** 훈련 시간:** RTX 3090에서 8~16시간 200회
  • 유출 (DDPM, 100 단계): ~ 2.5s
  • 유명 (DDIM, 10 단계): ~45ms 각 액션 조각
  • ** 강점:** 더 높은 용량, 더 나은 다중 작업 확장, 간접 주의를 통해 자연어 조절
  • ** 약점:** 느린 추론, GPU 메모리 높이는 (16GB+ VRAM가 필요하며, 조정하기가 더 어렵습니다

** 실용적 권고:** 단 작업 정책에 U-Net 척추를 사용하십시오. 추론 속도 (실천 시간 제어 10Hz+) 는 중요합니다. 다 작업 정책, 언어 조건 설정 또는 500+ 개의 시범이 있고 더 큰 모델에서 혜택을 받을 수 있는 용량을 사용할 때 트랜스포머 척추를 사용하십시오. U-Net 변종은 80%의 프로젝트의 올바른 출발점입니다.

추출 시간: DDPM vs DDIM vs 일관성 증류

디스푸지언 정책의 추론 시간 비용은 그 주요 실용적 한계입니다. 단호 과정에는 네트워크에 걸쳐 여러 가지 전진이 필요하며, 각각 약간 덜 잡음적인 행동 궤도를 생성합니다. 단계의 수는 추론 지연성과 행동 품질을 직접적으로 결정합니다.

Scheduler Steps 지연시간 (U-Net, RTX 3090) Quality vs DDPM-100 Notes
DDPM 100 ~900ms Baseline (100%) Too slow for most real-time control
DDIM 25 ~40ms 98-99% Good default for deployment
DDIM 10 ~15ms 95-98% Recommended for 10Hz+ control
Consistency Distillation 1-3 ~3-5ms 90-95% Best for high-frequency control, requires additional training

액션 싱 메커니즘은 지연 문제를 완화합니다. 디푸지언 정책은 단일 디노이징 패스에서 16-32 개의 미래의 동작의 일부를 예측합니다. 로봇은 다음 조각이 계산되는 동안 제어 주파수 (예를 들어 10Hz) 에서 조각에서 첫 8 개의 동작을 실행합니다. 이 초복된 실행은 유효 제어 속도가 현재의 조각이 끝나기 전에 denoising이 완료되는 한 를 제외하는 시간으로 제한되는 것을 의미합니다.

왜 전파 정책 은 표준 행동 복제 를 능가 하는 이유

표준 행동 복제 (BC) 는 관장된 회귀 문제로서 정책을 훈련시킵니다. 관찰을 통해, 행동을 예측합니다. 이것은 관찰에서 행동으로의 지도가 결정적이고 유모달이 될 때 작동합니다. 실제에서 조작 작업은 거의 없습니다. 테이블에서 블록을 뽑는 것과 같은 "단순" 작업은 여러 유효한 접근 각, 포지 포지 및 프라-프라시 구성이 포함됩니다. 이이브 BC는 결정 지점에서 의문을 품고, 타협적인 움직임 선택을 하거나, 테스트 분포가 훈련과 약간 다르면 완전히 실패하는 정책을 만들어냅니다.

퍼포시전 정책은 벤치마킹 조작 스위트에서 BC 기준선을 지속적으로 우월합니다. 원래 논문에서는 Robomimic 벤치마커의 12 가지 작업 중 11 가지에서 최신 결과를 달성했으며, 높은 행동 다모달성을 가진 작업에 특히 큰 지표가 있습니다. 실제 로봇 평가에서, 디프루션 정책은 더 강력한 복구 행동을 보여주었습니다. 로봇이 약간 잘못된 중간 상태를 달성했을 때, 정책은 결정적인 경로를 따르기보다는 광범위한 배포에서 샘플을 채취했기 때문에 복구 할 수있었습니다.

벤치마킹 결과: Robomimic 및 RoboSuite

Task (Robomimic) BC (MLP) BC-RNN ACT Diffusion Policy
Lift 78% 96% 98% 100%
Can 54% 82% 90% 96%
Square (bimanual) 18% 56% 72% 88%
Transport (long-horizon) 6% 24% 48% 62%

다모달 작업 (스퀘어, 교통) 에서 여러 가지 유효한 전략이 존재하는 경우 가장 큰 지표가 있습니다. 일모달 작업 (리프트) 에서, 모든 기본 라인은 단일 올바른 전략을 찾을 수 있기 때문에 이점은 작습니다.

전파 정책 을 ACT 과 비교 할 때

ACT (Transformers와 액션 킹) 과 비교하면, 디스포지션 정책은 일반적으로 강력한 다모다리티가 있는 작업에 더 잘 수행되며, ACT의 킹 예측이 빛나는 장 장면을 의존하는 작업에 더 나쁘게 수행됩니다.

Choose Diffusion Policy When Choose ACT When
Multiple valid grasp strategies exist for each scene Task has a single dominant strategy
You have 300+ demonstrations and want to leverage data scale You have 50-150 demonstrations and need fast iteration
Recovery from perturbations is important Temporal consistency over long horizons matters more
Control rate of 10Hz is sufficient You need 50Hz+ control frequency
Single-arm manipulation with variable approach Bimanual coordination requiring tight temporal sync

실제적으로 두 알고리즘 모두 데이터 세트의 품질과 양이 정책 아키텍처 선택보다 더 중요하다는 만큼 경쟁력이 높습니다. 어떤 것을 사용하는지 확실하지 않다면 반복 속도에 대해 먼저 ACT를 시도하고, 평균 모드 오류를 관찰하면 디스푸지언 정책을 시도하십시오.

전파 정책에 대한 데이터 요구 사항

퍼포시전 정책은 ACT보다 더 많은 데이터에서 이익을 얻는데, 주로 디노이징 네트워크는 더 많은 매개 변수와 더 풍부한 모델링 목표를 가지고 있기 때문입니다. 통제된 조건에서 단일 작업에 대한 실질적인 최소는 100-200 개의 시범입니다. 강력한 배포 성능을 달성하기 위해 객체 위치 변동, 조명 변경 및 때때로 센서 노이즈를 처리하기 위해 작업당 300-500 개의 시범을 예산을 예산을 합니다. ACT와 달리, 디스포지션 정책은 상당히 큰 데이터 세트 크기로 추가 데이터로 계속 개선되는 경향이 있습니다. 대규모 데이터 수집 노력에 투자할 계획이라면 더 나은 선택이 됩니다.

데이터 다양성은 볼륨만큼이나 중요합니다. 디스플레이는 배포에서 기대하는 객체 위치, 지향 및 장면 구성의 범위를 뻗어 나가야 합니다. 객체들이 항상 정확히 같은 장소에 있는 긴밀한 디스플레이 클러스터는 객체가 몇 센티미터로 이동할 때 실패하는 정책을 생성합니다. RCSV의 [관리된 데이터 수집 서비스]T1) 는 구조화된 변동 프로토콜을 따르며, 일반화 가능한 정책을 생성하는 데이터 세트를 보장하기 위해 객체 위치, 조명 조건 및 운영자 잡기 스타일을 체계적으로 무작위로 분류합니다.

관찰 표현 또한 중요한 의미를 갖는다. ResNet 이미지 코더를 종착순으로 훈련한 디스푸시 정책은 일반적으로 좁은 작업 배포에 대한 얼어붙은 사전 훈련된 코더를 사용하는 정책을 능가하지만, 사전 훈련된 코더 (R3M, MVP, DINO) 는 테스트 조건이 훈련과 다르면 더 나은 일반화를 제공합니다. 대부분의 실용적인 프로젝트에서는 데이터 세트의 가치를 극대화하기 위해 미리 훈련된 코더로 시작하고, 500개 이상의 시범과 안정적인 환경이 있으면만 엔드-투-엔드 훈련으로 전환하십시오.

교육 설정 및 컴퓨팅 요구 사항

디스푸지언 정책의 참조 구현 (컬럼비아 로봇 연구소 GitHub에서 사용할 수 있습니다) 은 UNet 척추 (더 빠른 추론, 더 낮은 용량) 또는 트랜스포머 척추 (더 느린 추론, 더 높은 용량) 를 갖춘 훈련입니다. 대부분의 단일 작업 프로젝트에서 UNet 변종은 올바른 출발점입니다. 단일 RTX 3090 또는 4090에 대한 훈련은 관찰 해상도와 행동 지평 길이에 따라 200 에피소드 데이터 세트에 대해 4-12 시간 소요됩니다.

올바른 설정에 필요한 주요 하이퍼 파라미터: 행동 지평 (표면 작업에 대해 예측할 수 있는 미래의 단계의 수 은 일반적으로 16-32), 전파 단계의 수 (100 DDPM, DDIM에 대해 10-25), 관찰 창 (이번 프레임에는 일반적으로 2 이 포함되어야하는 수) 정책 성과를 개선하기 위한 가장 영향력 있는 변화는 일반적으로 데이터 세트의 크기를 늘리는 것이 아니라 건축 하이퍼파레머를 조정하는 것입니다.

빠른 시작 훈련 명령

T15 cd 퍼포션_policy pip clone -e . # U-Net 변형을 데이터 세트 (ZARR 형식) 에 트레이닝 python train.py --config-dir=. --config-name=image_pusht_diffusion_policy_cnn \ task.dataset_path=/path/to/your/dataset.zarr \ training.num_epochs=3000 \ policy.noise_scheduler.num_train_timesteps= \100_steps.horizon=16 \ policy.n_obs_steps=2 #DDIM 결론을 평가하는.py_conalu=. --config-name=DDIM_fig_policy\no_diff_policy\_scheduler.num\\n_steps.\\sfn_policy\sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn_sfn

실제 로봇에서 추론을 하기 위해, 100 단계의 DDPM는 일반적으로 높은 주파수 제어에 너무 느립니다. 10-25 단계의 DDIM 스케줄러를 사용하세요. 이는 버퍼로 10Hz 제어에 적합한 RTX 3090 에서 ~20Hz에서 실행됩니다. 대체로, 일관성 정책 추산은 1-3 단계 추론을 달성할 수 있습니다. 간단한 작업에 대한 최소한의 성능 저하와 함께.

전파 정책에 대한 RCSV 데이터 서비스를 이용

RCSV의 [데이터 서비스 파이프라인]T2) 는 방출 정책 참조 구현 및 HuggingFace LeRobot 프레임워크로 직접 사용에 맞게 포맷된 데이터 세트를 생성합니다. 에피소드는 동기화 된 이미지 스트림, 자체 수용 상태 및 50Hz에서 동작을 가진 ZARR 아카이브로 저장됩니다. 품질 필터링은 작업이 성공적으로 완료되지 않은, 로봇이 환경에 충돌하거나 운영자의 주저로 비대표적인 궤도를 생성한 에피소드를 제거합니다.

우리의 수집 서비스는 [RCSV 텔레오퍼레이션 플랫폼]T3) 를 사용하며, 두 팔이 가능한 리더-발자 제어, 손목 장착 및 상부 카메라 및 선택적 인 전력 토크 로그링을 제공합니다. 멀티태스 퍼포시온 정책 훈련에 있어서 하나의 정책이 작업 아이디 또는 언어에 따라 조건화된 여러 작업을 학습할 때 우리는 같은 캠페인 내에서 작업 변종들을 수집하고 통일된 데이터 세트를 제공할 수 있습니다. 파일럿 프로그램은 200개의 시연에 대해 2,500달러에서 시작되며, 500개 이상의 시연에 대한 완전한 캠페인은 8,000달러에서 시작됩니다.

[OpenArm 1]T4 (4,500 달러) 또는 [ALOHA]T5) 하드웨어 플랫폼과 일하는 팀은 네이티브 하드웨어 지원을 받습니다. 주문형 하드웨어 통합은 요청에 따라 사용할 수 있습니다. 데이터 수집에 투자하기 전에 퍼포시전 정책을 평가하려는 팀들을 위해, 우리의 [공공적인 데이터 세트] (T6) 는 ZARR 형식으로 몇 백 에피소드 조작 데이터 세트를 준비하고 있습니다.

관련 독서