ACT 정책 설명: 로봇 학습을 위한 트랜스포머와 행동
ACT 정책은 무엇입니까? 2026년 트랜스포머와 액션 <unk>킹에 깊이 깊이 뛰어들: 건축, CVAE 훈련, 하이퍼파라미터 가이드, 디스포지션 정책과 비교, 추론 기준, 그리고 RCSV 데이터로 ACT를 훈련하는 방법.
[이미테이션 학습 가이드]
ACT
ACT 는 무엇 입니까?
ACT는 로봇이 시각적 관측에 기초하여 부드럽고 조정된 움직임을 수행해야 하는 미세한 조작 작업에 설계된 모방 학습 알고리즘이다. 추론 시 ACT는 로봇의 카메라와 현재의 공동 상태에서 일련의 이미지를 취하고, 향후 동작의 일부를 내보내기 위해
ACT는 ALOHA의 양동력 조작 시스템에서 도입되었으며, 이전에 모방 학습에 접근할 수 없다고 여겨졌던 작업에 성공한 것으로 입증되었습니다. 배터리를 썰어, 지플록 가방을 열고, 바늘을 엮었다.
행동 덩어리 가 어떻게 작용 하는 것 입니까?
표준 행동 복제 (BC) 는 현재 관찰을 고려하여 다음 단일 행동을 예측하기 위해 정책을 훈련시킵니다. 추론 시, 예측 오류가 축적됩니다. 각각의 작은 오류는 로봇의 상태를 약간 변화시키고, 정책을 훈련하지 않은 분포에 넣으며 다음 예측이 더 악화되는 원인이 됩니다. 이 합성 오류는 미세한 조작 작업에 있어서 순수한 BC의 중앙 실패 모드이다. 200 단계의 조작 궤도에서는, 단계별 1%의 오류율이 합성되어도 단계별로 200 단계의 시범 분배에서 벗어날 확률이 ~87%에 달한다.
액션
일시적 집합
실제 ACT는 재검색 전에 전체 조각을 실행하지 않습니다. 대신 m 단계마다 (m < k) 를 재검색하여 상호 겹치는 행동 조각을 생성합니다. 미래의 시간 단계마다 여러 조각이 예측을 제공합니다. 이러한 예측은 기하급수적으로 붕괴되는 무게 (최근 조각이 더 높은 무게를 가진) 로 평균됩니다. 이 시간적 집합은 실행을 더 부드럽게 하고 덩어리 사이의 경계에 있는 긴장감을 줄인다.
집합중력 일정은 기하급수적 붕괴를 사용합니다. t 단계 전에 생성된 조각에서 예측하기 위해, 무게는
** 왜 단지 조각 크기를 증가시키지 않는가?** 더 큰 조각은 의사 결정 포인트의 수를 의미하지만 환경 변화에 대한 반응성도 감소합니다 (물질이 이동, 장애물이 나타났습니다). 최적의 조각 크기는 반응성과 부드러움을 균형을 맞추습니다. 대부분의 테이블 표 조작에 대해 k=50
ACT 건축: 전체 그림
ACT는 트랜스포머 척추를 가진 CVAE (Conditional Variational 오토인코더) 아키텍처를 사용합니다. 아키텍처를 이해하는 것은 세 가지 구성 요소를 이해해야합니다. CVAE 코딩 (일반 훈련), 트랜스포머 디코딩 (훈련 및 추론) 및 시력 척추.
CVAE 코도더 (훈련만)
훈련 중에, 코더는 전체 시범 궤도를 처리합니다
코더는 전체 액션 순서 (부문에서 모든 k 기본 진실 액션) 과 현재 관측을 수행하는 변환기입니다. 그것은 가우스 분포를 매개 변수를 나타내는 평균 및 로그 변수를 내포하고, z는 재변경 트릭을 통해 샘플을 취합니다. KL 분화 손실 용어 (베타로 중량, 일반적으로 10
추론 시 z는 0 (사전의 평균) 로 설정되어 있어 관측을 고려하여 정책 결정적이라고 할 수 있다. 이것은 의도적인 설계 선택이다. 배포 시, 학습된 스타일 배포에서 무작위로 샘플링하는 것이 아니라 일관된 예측 가능한 행동을 원한다. CVAE 구조는 순전히 모드 붕괴를 방지하는 훈련 보조기입니다.
트랜스포머 디코더 (훈련 + 인퍼런스)
디코더는 3가지 입력값을 사용합니다. 잠자연 z (또는 추론에서 0), 현재 관찰 토큰 (비전 척추 + proprioception) 과 k 학습 가능한 위치 질의 집합 (부동의 한 동작에 한 개) 이다. 디코더는 표준 트랜스포머 간접주의를 사용합니다. 위치 질의들은 관찰 토큰과 z에 관중하여, 병렬로 k 행동 예측을 생성합니다.
원래 구현된 건축물 세부 사항:
- ** 트랜스포머 레이어:** 4 개의 코더 레이어, 7 개의 디코더 레이어 (故意不对称)
- ** 숨겨진 크기는:** 512
- ** 주의력:** 8
- 전용 차원: 2048
- 총 매개 변수: ~40M (관광 척추를 제외한)
시력 척추
시각 척추는 일반적으로 ResNet-18가 카메라 각 조사를 독립적으로 처리한다. 각 카메라 이미지는 (480×640 RGB) 는 ResNet을 통해 기능 지도 (15×20×512) 를 생성하여 처리된다. 이는 카메라당 300 개의 토큰으로 평평화된다. 2
여러 카메라
교육법: CVAE 목표
훈련 손실은 두 가지 요소를 가지고 있습니다.
# ACT training loss (simplified PyTorch)
def act_loss(model, batch):
images = batch["images"] # (B, n_cameras, 3, H, W)
joint_states = batch["qpos"] # (B, n_joints)
actions = batch["actions"] # (B, chunk_size, action_dim)
# Encoder: process full trajectory -> latent z
z_mean, z_logvar = model.encoder(images, joint_states, actions)
z = reparameterize(z_mean, z_logvar) # (B, latent_dim)
# Decoder: predict action chunk from observation + z
predicted_actions = model.decoder(images, joint_states, z) # (B, chunk_size, action_dim)
# Reconstruction loss: L1 on predicted actions
reconstruction = F.l1_loss(predicted_actions, actions)
# KL divergence: regularize z toward N(0, I)
kl_div = -0.5 * torch.mean(
1 + z_logvar - z_mean.pow(2) - z_logvar.exp()
)
# Total loss
beta = 10.0 # KL weight - tune this carefully
total_loss = reconstruction + beta * kl_div
return total_loss, {"recon": reconstruction.item(), "kl": kl_div.item()}
베타 하이퍼파라메터는 재구성 정확성과 잠잠한 공간 규칙성 사이의 균형을 조절한다. 너무 낮 (베타 < 1): 모델은 시범을 기억하지만 z는 무의미하게 되고, z=0의 추론은 쓰레기를 생성한다. 너무 높 (베타 > 100): 모델은 z를 완전히 무시하여 다모달 시범을 처리 할 수 없게 된다. 대부분의 조작 작업에 있어서 달콤한 점은 베타 = 10
하이퍼파라미터 가이드라인
ACT는 대부분의 깊은 RL 알고리즘보다 더 적은 하이퍼파레머를 가지고 있지만, 그 중 중요한 요소는 있습니다. RCSV에서 20개 이상의 조작 작업에 대한 ACT의 경험을 통해 얻은 지침은 다음과 같습니다:
| Hyperparameter | Default | Range to Search | Effect of Increasing | When to Increase |
|---|---|---|---|---|
| Chunk size (k) | 100 | 20–200 | Smoother trajectories, less reactive | Smooth tasks (wiping, pouring); decrease for reactive tasks |
| Latent dim (z) | 32 | 16–64 | More expressive style capture | High demonstration variance (different operators, strategies) |
| KL weight (beta) | 10 | 1–100 | Stronger regularization, less memorization | Small datasets (<50 demos) to prevent overfitting |
| Learning rate | 1e-5 | 5e-6–5e-5 | Faster convergence, risk of instability | Large datasets (>200 demos); use warmup |
| Temporal ensemble temp | 10 | 5–50 | Slower blending, more inertia | Smoother tasks; decrease for faster reactivity |
| Number of cameras | 2 | 1–4 | Richer spatial information, more compute | 3D reasoning tasks (stacking, insertion) |
| Backbone | ResNet-18 | ResNet-18/34/50 | Better visual features, more compute | Visually complex scenes (cluttered, varying lighting) |
| Training epochs | 3000 | 1000–8000 | Better fit, risk of overfitting | More demos or more complex tasks |
** 쪼개리 크기는 가장 중요한 과다 매개 변수입니다.** 한 가지만 조정하면 쪼개리 크기를 조정하십시오. 작업에 너무 큰 쪼개리 크기는 로봇이 실행을 완료할 때 이미 구시 된 계획에 "집약"하도록 만듭니다. 너무 작은 쪼개리 크기는 부드러운 장점을 잃습니다. 새로운 작업에 k=50에서 시작해서 조정합니다. 로봇이
ACT와 방산 정책: 상세한 비교
원래의 ALOHA 작업에 대해 ACT는 동일한 데이터에 대한 표준 BC에 대한 20
| Dimension | ACT | Diffusion Policy | Verdict |
|---|---|---|---|
| Inference latency (50Hz control) | 2–5ms per chunk | 50–200ms per chunk (DDPM); 10–30ms (DDIM) | ACT wins by 5–10x |
| Multi-modality handling | CVAE latent (limited) | Full diffusion (excellent) | Diffusion wins |
| Data efficiency (<50 demos) | Good | Moderate | ACT slightly better |
| Data efficiency (>200 demos) | Good | Excellent | Diffusion slightly better |
| Training time (same data) | ~8 hours (A100) | ~12 hours (A100) | ACT faster |
| 궤적 smoothness | Excellent (temporal ensembling) | Very good | ACT slightly better |
| 정밀도 tasks (<1mm tolerance) | Good | Excellent | Diffusion wins |
| Bimanual coordination | Excellent (designed for ALOHA) | Good | ACT wins |
| Model size | ~40M params | ~80M params | ACT smaller |
| Edge deployment (Jetson AGX Orin) | ~25 Hz | ~5 Hz (DDPM); ~12 Hz (DDIM) | ACT much better |
| Open-source implementations | LeRobot, original repo | LeRobot, original repo | Tie |
** ACT를 언제 사용해야 하는가:** 추론 속도가 중요할 때 (엣지 배포, 높은 제어율), 제한된 데이터가 있을 때 (<100 데모), 두 가지 수동 작업에 대해, 또는 가능한 가장 간단한 훈련 파이프라인을 필요로 할 때.
방포 정책을 언제 사용해야 하는가: 당신의 시범이 중요한 다 모다성을 ( 같은 작업에 대해 여러 가지 유효한 전략) 를 가지고 있거나 미리미터 미만의 정확성이 중요시되는 정밀 조립 작업에 대해 또는 풍부한 데이터가 (>200 개의 시범) 있고 훈련과 추론 계산을 감당할 수 있을 때. 확산 정책의 유효한 행동의 전체 분포를 표현할 수 있는 능력 (CVAE를 통해 평균으로 붕괴하는 대신) 은 실제로 여러 가지 올바른 접근 방식이 있는 작업에 우위를 점합니다.
인퍼런스 속도 벤치마크
우리는 로봇 배포에 관련된 하드웨어 플랫폼에서 ACT 추론을 비교했습니다. 모든 측정은 표준 ACT 아키텍처 (ResNet-18 척추, 2 카메라, 7-DOF 액션 공간, 픽스 크기가 50):
| Hardware | ACT Inference (ms) | ACT Throughput (Hz) | DP-DDIM Inference (ms) | DP-DDIM Throughput (Hz) | Notes |
|---|---|---|---|---|---|
| NVIDIA A100 (80GB) | 1.8 | 555 | 12 | 83 | Datacenter training/inference |
| NVIDIA RTX 4090 | 2.5 | 400 | 15 | 67 | Desktop workstation |
| NVIDIA RTX 4070 | 4.2 | 238 | 25 | 40 | Budget desktop |
| Jetson AGX Orin (64GB) | 12 | 83 | 45 | 22 | Onboard robot compute |
| Jetson Orin Nano (8GB) | 40 | 25 | 180 | 5.5 | Min viable edge |
| Jetson Orin NX (16GB) | 22 | 45 | 85 | 12 | Mid-range edge |
| Apple M3 Pro (18GB) | 8 | 125 | 35 | 28 | Development laptop |
실시간 조작 제어의 중요한 임기는 20 Hz (50ms/결과) 이다. ACT는 가장 낮은 수준의 Jetson 구성을 제외하고 우리가 테스트 한 모든 플랫폼에서 이 임무를 수행합니다. (Orin Nano는 여전히 25 Hz를 관리합니다). DDIM 샘플링을 가진 전파 정책은 데스크톱 GPU와 AGX Orin의 임기를 충족하지만 Orin Nano 및 NX에서 그 이하로 떨어집니다. 가장자리 하드웨어에 배치하는 팀에게는 ACT는 명확한 선택입니다.
데이터 요구 사항 및 좋은 데이터의 구성
ACT는 대부분의 발표된 결과에서 작업당 50~200개의 시범을 통해 잘 작동합니다. 그러나 데이터 품질은 양보다 더 중요합니다. RCSV에서 25,000개 이상의 시범을 수집하여 데이터 품질에 대해 배운 것은 다음과 같습니다:
작업 복잡성별로 가능한 최소 데이터 세트
- ** 간단한 선택 및 장소 (하나의 객체, 고정된 위치):** 20
30 디모. ACT는 최소한의 데이터로 이것을 신뢰성 있게 학습합니다. - ** 포즈 변동 (자발적인 객체 위치) 을 가진 선택 및 장소:** 50
80 디모. 작업 공간을 커버해야 합니다. - ** 다단계 조작 (
, 운송, 정밀 장소):** 100~150개의 디모. 각 단계에 대한 충분한 커버리가 필요합니다. - 중동 조정 (두 팔, 의존적인 움직임): 150~250개의 디모.
- ** 접촉 부가적인 조립 (입기, 나
기, 기):** 200 400 디모. 힘에 민감한 단계들은 밀집한 커버리가 필요합니다.
품질 요구 사항
시범은 원활하고 목적이 있어야 합니다. ACT 정책은 의문의 경우, 수정, 그리고 최저 접근을 포함하여 데이터의 움직임 패턴을 학습합니다. RCSV의 [데이터 수집 표준]
- ** 중단 없이:** 시위가 지속적으로 흐르도록 한다. 긴 중단 (>0.5s의 움직임 없이) 는 행동의 덩어리를 혼란스럽게 한다.
- 일반적 속도: 사업자들은 일관된 속도로 실행해야 한다. 같은 데이터 세트 내에서 빠른 과 느린 시범을 혼합하는 것은 CVAE가 작업에 관련된 변화 대신 잠자연 용량 모델링 속도 변이를 낭비하도록 강요한다.
- ** 깨끗한 시작/말:** 각 에피소드는 비슷한 중립적인 자세에서 시작하여 최종 구성에서 명확하게 지갑을 끝낼 수 있습니다. 찢어진 에피소드 경계는 훈련 유물을 만듭니다.
- ** 성공만:** 모든 실패한 시범을 제거합니다. 실패로부터 배울 수 있는 일부 RL 접근 방식과 달리 ACT는 모든 훈련 데이터를 전문가의 시범으로 따라가게 합니다.
카메라의 일관성 또한 중요합니다. 녹음 세션 사이에 카메라 배치가 변경되면, 정책에 따라 학습된 시각적 기능은 더 이상 배포 설정과 일치하지 않습니다. 유연한 팔 대신 물리적 마운트를 사용하며 각 데이터 세트와 함께 카메라 캘리브레이션 매개 변수를 기록하십시오. RCSV의 멀티 카메라 녹음 파이프라인은 자동으로 이를 시행합니다.
훈련 절차 단계
RCSV에서 새로운 ACT 정책에 대해 사용하는 종결부터 종결까지의 교육 절차는 다음과 같습니다.
- ** 데이터 수집:** 리더-따라자 설정으로 [텔레오퍼레이션] (
T5 ) 을 사용하여 시범을 기록합니다. 50 Hz 제어 속도, 2 3 카메라, 동기화 녹음. LeRobot HDF5 형식으로 수출합니다. - 데이터 검증: RCSV 데이터 품질 검사를 실행: 에피소드 길이가 서로 2x 이내에 있는지 확인하고, 카메라 프레임이 떨어지지 않고, 제한 내에서 공동 위치, 성공 레이블이 확인됩니다.
- 분할: 90/10 배/발 분할, 적용될 경우 객체 구성에 따라 분할되어 있습니다. 실제 로봇 평가 (훈련 중에 볼 수 없는) 50 에피소드를 진행합니다.
- ** 훈련:** 위의 표에서 나온 하이퍼파레미터들을 이용한 LeRobot ACT 훈련 스크립트를 사용하세요. 재구성 손실, KL 분차 및 검증 손실을 모니터링하세요. 훈련은 일반적으로 2,000~5,000 시대를 합치죠.
- ** 체크포인트 선택:** 최종 체크포인트 사용 하지 마십시오. 가장 낮은 검증 손실을 가진 체크포인트를 선택하세요. 과장착은 훈련과 검증 손실 곡선의 차이로 나타납니다. 일반적으로 데이터 세트의 크기에 따라 3,000~5,000의 시대를 지나면 나타납니다.
- 시프 평가 (가용 경우): 선택된 체크포인트로 시뮬레이션 100 에피소드를 실행하세요. 성공률이 < 60%라면 하이퍼파레머를 재조정하세요 (분자 크기가 먼저, 베타가 다음 학습률).
- ** 실제 평가:** 실제 하드웨어에서 20 에피소드를 실행하세요. 시미 평가와 비교하세요. 20% 이상의 격차는 카메라 캘리브레이션 부합 또는 액션 공간 확장 문제로 나타납니다.
# Full ACT training command via LeRobot
python lerobot/scripts/train.py \
--policy.name=act \
--dataset.repo_id=svrc/openarm_pick_place \
--policy.chunk_size=50 \
--policy.n_obs_steps=1 \
--policy.dim_model=512 \
--policy.n_heads=8 \
--policy.n_encoder_layers=4 \
--policy.n_decoder_layers=7 \
--policy.latent_dim=32 \
--policy.kl_weight=10.0 \
--training.learning_rate=1e-5 \
--training.batch_size=8 \
--training.num_epochs=5000 \
--training.eval_freq=500 \
--training.save_freq=1000 \
--device=cuda \
--output_dir=outputs/act_openarm_pick_place/
일반적인 훈련 실패 와 해결
- ** 정책 출력 0/ ثابت 행동:** KL 무게 (베타) 는 너무 높다. 모델은 관찰을 무시하고 평균 동작을 출력한다. 베타를 5
10x로 줄여라. - ** 덩어리 경계에서
키 실행:** 시간적 집합 온도는 너무 낮다 (미화도 너무 날카롭다). 온도를 10에서 20 30로 높여서 실행 루프가 겹치는 덩어리를 올바르게 구현하는지 확인합니다. - 좋은 훈련 손실, 실제 실적 성적: 카메라 훈련과 배포 사이의 부합. 검사: 이미지가 같은 크기로 변경되는지? 카메라 FOV가 동일합니까? 작물 지역이 일관합니까?
- ** 첫 2 초 동안 작동하고, 그 다음 이동:** 작업 동력에 비해 덩어리 크기는 너무 크다. 정책은 실행 종료에 의해 구시된 계획을 약속합니다. 덩어리 크기를 50% 줄입니다.
- ** 경주 사이 불합동성:** 충분한 시범이 없습니다. <30 시범으로 ACT의 성능은 열차/발 분할에 매우 민감합니다. 더 많은 데이터를 수집합니다.
- KL 분차가 0으로 붕괴: 베타가 너무 낮습니다. 코더는 z로 모든 정보를 코딩하고 있으며 디코더는 관찰을 무시하는 것을 배우습니다. KL가 0.5
5.0로 안정될 때까지 베타를 증가시킵니다.
ACT 변형 및 확장
본래 ACT 논문 이후, 여러 확장 프로그램이 등장했습니다.
- ACT+ (LeRobot): 관찰에 자기 수용성 역사를 (최후 2
5개의 관절 상태) 추가하여 명시적인 속도 계산 없이 속도 추정을 개선합니다. - Act with Diffusion (ACT-DP): CVAE를 디프루션 액션 헤드로 대체하고, 쪼개진 예측 구조를 유지한다. ACT의 매끄러움을 디프루션 정책의 멀티 모다리티 처리와 결합한다. 훈련은 50% 느리지만 멀티 모다럴 시범을 더 잘 처리한다.
- Act with Language (ACT-L): 관찰 토큰에 언어 임베디션을 (Clip 또는 T5) 추가하여 언어 조건으로 작업 지정을 가능하게 합니다. "Red cup up" vs. "Blue cup up"는 하나의 정책으로 처리 할 수 있습니다.
- ** 모바일 ALOHA ACT:** 이동식 기지를 (2D 속도) 그리고 두 팔을 (2 x 7-DOF) 공동 제어할 수 있도록 ACT을 확장하여 총 16DOF의 동작 공간을 제공합니다. 이동성 구성 요소가 장애물에 대한 반응성을 유지하기 위해 조각 크기는 일반적으로 20
30으로 줄여집니다.
RCSV 데이터로 ACT 훈련
RCSV의 데이터 플랫폼 는 레로봇 호환성 HDF5 형식으로 데이터 세트를 수출합니다. 이는 오픈소스 ACT 훈련 코드 표준 입력 형식입니다. 데이터 세트를 다운로드 한 후, 기본 ACT 정책을 훈련하려면 최소 16 GB VRAM 및 단일 작업에 대해 약 8 시간 훈련이 필요한 GPU가 필요합니다. RCSV 엔지니어링 지원은 팀들이 훈련 라인을 구성하고, 덩어리 크기와 학습률을 조정하고, 정책 성과를 평가하는 데 도움이 됩니다.
GPU 인프라가 없는 팀들을 위해, RCSV는 A100 하드웨어에서 관리된 훈련 실행을 제공합니다. 당신은 데이터 세트를 제공하지만, 우리는 평가 매개 변수를 가진 훈련된 체크포인트를 반환합니다. 회전 시간은 일반적으로 24
하드웨어를 통해 자신의 데이터를 수집하려면 [ 하드웨어 카탈로그]
관련 독서
관련: 레로봇 가이드 · 모바일 ALOHA 설정 · 이미테이션 학습에서 일반적인 오류 · 체육 훈련 · 전체 수술을 시작 · 로봇어 사전







