Guides(으)로 돌아가기

액션 <unk>킹 트랜스포머 (ACT): 로봇 모방 학습에 대한 완전한 가이드 (2026)

마스터 ACT (Action Chunking Transformers): 건축, 실제 로봇 데이터 훈련, 덩어리 크기의 조정, 오픈아름 및 모바일 ALOHA에 배포. PyTorch 코드, 하이퍼 파라미터 가이드, 데이터셋 형식 사양을 포함합니다.

[← 가이드]

로봇 조작을 위한 가장 효율적인 데이터 모방 학습 알고리즘인 ACT에 깊이 들어가서 아키텍처, CVAE 컨디션, 덩어리 크기의 조정, PyTorch 및 LeRobot와 훈련, 하이퍼 파라미터 최적화, 하드웨어 선택, 실패 모드 및 배포 전략 등을 포함합니다.

행동 의 은 무엇 이며, 그 의 중요 함 은 무엇 입니까?

표준 행동 복제법은 현재 관찰에서 다음 동작을 예측한다. 이것은 이론적으로 작동하지만 실제에서 분해된다: 시간이 지남에 따라 작은 예측 오류가 축적되어 로봇이 훈련 중에 볼 수 없는 상태로 이동하게 됩니다. 이 compounding error 문제는 순진한 행동 복제의 근본적인 한계입니다.

** 액션 킹**은 일반적으로 50~100 시간 단계의 미래의 행동을 한 번에 예측함으로써 문제를 해결합니다. "robot이 지금 무엇을 해야 하는가?"라는 질문에 대신 모델은 "robot이 다음 두 초 동안 무엇을 해야 하는가?"라고 답합니다. 이것은 네트워크가 소란한 단계별 예측보다는 일관된, 시간적으로 일관된 궤도를 생성하도록 강요합니다.

직관적 인 것은 간단하다: 당신이 컵을 향해 갈 때, 당신은 독립적으로 모든 밀리초를 결정하지 않습니다. 당신은 단일 단위로 부드러운 도달 운동을 계획합니다. 액션 은 모델에 동일한 구조를 제공합니다. 중요한 것은, 초복된 조각들이 시간적 집합을 통해 혼합되어 있으며, 이는 옆 조각에서 예측을 평균하여 궤도를 더 부드럽게 하고 조각 경계에서 기저를 줄이는 것입니다.

ACT (Tonny Zhao et al.이 2023년 스탠퍼드에서 도입한 ACT (Action Chunking with Transformers) 는 CVAE (Conditional Variational 오토인코더) 트랜스포머 아키텍처와 이 액션 덩어리 아이디어를 결합했다. 결과는 가장 효율적인 데이터 모방 학습 알고리즘이었습니다.

일시적 추론: 효과적인 지평선을 줄이는 것

50 Hz 제어에서 일반적인 조작 작업은 510 초 작업에 대한 250500 개별 행동 예측이 필요합니다. 표준 BC와 함께, 각 예측 화합물은 오류를 발생시킵니다. 100의 조각 크기로 동일한 작업에는 35 조각 예측이 필요합니다. 효과적인 의사 결정 지평은 2050x로 줄어들게되어 학습 문제를 극적으로 쉽게 만듭니다.

ACT는 이렇게 적은 시범을 통해 작동하는 이유이기도 합니다. 학습 문제는 더 간단합니다. 관찰에서 7DOF 동작 (정상적인 로봇 팔) 으로 한 번의 지도를 배우는 대신, 모델은 관찰에서 100×7 동작 궤도에 대한 지도를 학습합니다. 궤도 구조는 강력한 자기 감독을 제공합니다.

ACT 아키텍처 심층 다이빙

ACT는 트랜스포머 코더-디코더 척추와 함께 조건형 변동자동화코더 (CVAE) 를 사용합니다. 이 아키텍처를 이해하는 것은 효과적인 훈련과 디버깅에 필수적입니다.

CVAE 프레임워크

CVAE는 표준 코더-독독 파이프라인에 잠그다 변수 _z_를 추가합니다. 훈련 중에, 코더는 현재 상태와 ground truth action 순서을 모두 관찰하고, _z_에 대한 분포로 압축합니다. 디코더는 이 분포와 현재 관찰을 더하여 샘플을 가져와 액션 순서 구조를 재구성합니다.

추론 과정에서 코딩기는 폐기된다. 디코더는 이전 (표준적 정상적인 분포) 에서 샘플을 받고, 그 다음 액션 조각을 생성한다. KL 손실의 분배 용어는 후속이 전과 가까이 유지되도록 보장하므로 테스트 시점에서 전과 샘플을 채취하면 합리적인 액션 순서를 생성한다.

CVAE 구조는 중요한 목적을 수행합니다. 그것은 intra-demonstration variability를 캡처합니다. 단 하나의 작업에서도 정확한 궤도는 시범들 사이에 차이가 있습니다 (조금 다른 포착 각, 시간, 접근 경로). 잠수 변수 _z_는 이 변화를 캡처하여 디코더가 다양하지만 유효한 궤도를 생성 할 수 있습니다.

코더 아키텍처

ACT 코더는 다모달 입력들을 처리한다.

  • ** 카메라 이미지**: 시각 척추를 통해 전달된다 (전설적으로 ResNet-18, ViT 선택). 여러 카메라 조회 (목목 + 상부) 는 독립적으로 처리되고, 연결된다.
  • **공동 위치 (qpos) **: 현재 로봇공동 각, 일반적으로 팔당 67 DOF + 지탱 상태.
  • **행동 순서 (훈련만) **: CVAE 코더가 후속 분포를 계산하기 위해 사용하는 k 미래의 행동의 기본 진실 조각.

입력값은 토큰화되어 트랜스포머 코더에 입력된다. 출력은 후속 배포의 평균과 변동에 투영되는 잠정 표현이다.

디코더 아키텍처

디코더는 학습 가능한 액션 쿼리를 가진 표준 트랜스포머 디코더입니다. 쿼리는 k (분자에서 시간 단계마다 하나) 이며, 각각 학습된 임베딩으로 초기화됩니다. 디코더는 암호화된 관찰 토큰과 샘플링된 잠잠한 _z_를 가로질러 관람하고, 선형 투명 헤드를 통해 k 액션 벡터를 내보내게 됩니다.

예측된 각 동작은 공동 위치 목표 (67 DOF 한 팔) 과 지갑 오픈/클로스 명령어를 포함하는 벡터이다. 손실은 예측된 과 지상 진실 동작 사이의 L1 (평균 절대 오류) 이며, β로 중량된 KL 분차 용어를 더한다.

손실 기능

# ACT loss computation (simplified)
L_reconstruction = L1_loss(predicted_actions, target_actions)  # [batch, chunk_size, action_dim]
L_kl = KL_divergence(posterior_mean, posterior_logvar, prior)  # regularize latent space
L_total = L_reconstruction + beta * L_kl                       # beta typically 10-20

KL 용어에서의 β 무게는 재구성 정확성과 잠자연 공간 규칙성 사이의 타협을 제어한다. 너무 낮: 모델은 이전을 무시하고 테스트 시간에 불합리한 행동을 생성한다. 너무 높습니다: 모델은 평균 행동으로 붕괴되고 표현력을 잃습니다.

수학 직관: 조각 크기의 선택

덩어리 크기는 ACT에서 가장 중요한 단일 하이퍼파라미터입니다. 모델이 각 단계에서 얼마나 많은 미래의 행동을 예측하는지 결정합니다.

제어 주파수 관계

50 Hz 제어 (አብዛኞቹ 로봇 팔의 표준) 에서, 덩어리 크기의 지도는 예측 지평으로 직접합니다.

Chunk Size Prediction Horizon Best For
25 0.5 seconds Very fast reactive tasks, contact transitions
50 1.0 second Quick pick-and-place, single-arm tasks under 3 seconds
100 2.0 seconds Default — most tabletop manipulation tasks
150 3.0 seconds Slow precision tasks (insertion, assembly)
200 4.0 seconds Long-horizon smooth motions (pouring, wiping)

이상적인 조각 크기는 대략 하나의 완전한 하위 동작을 포함해야 한다. 선택과 장소 작업에 있어서: 도달-잡기 동작은 ~1.5초를 걸립니다. 따라서 chunk_size=75100는 전체 접근 방식을 캡처합니다. 조각이 너무 짧으면 모델은 완전한 동작을 계획할 수 없습니다. 너무 길다면 모델은 어떻게든 다음 조각이 우월하게 될 먼 미래의 행동을 예측하는 용량을 낭비합니다.

일시적 집합

배포 중 ACT는 모든 시간 단계 (또는 몇 시간 단계) 에 새로운 조각을 생성합니다. 각 제어 단계에서는 실행된 동작은 중계된 조각 예측의 중계 평균입니다.

# Temporal ensembling (exponential weighting)
# w controls the blending — lower w gives more weight to recent predictions
w = 0.01  # default temporal ensembling weight
for t in range(episode_length):
    new_chunk = policy.predict(observation_t)  # shape: [chunk_size, action_dim]
    for i in range(chunk_size):
        all_predictions[t + i].append(new_chunk[i])

    # Weighted average with exponential decay
    weights = [np.exp(-w * j) for j in range(len(all_predictions[t]))]
    action_t = np.average(all_predictions[t], weights=weights, axis=0)

시간적 집합중도는 (특히 0.01) 오래된 예측이 얼마나 빨리 붕괴되는지를 제어합니다. 작은 _w_는 오래된 예측에 더 많은 무게를 부여합니다 (더 부드럽지만 반응하는 데 느리지만). 큰 _w_는 가장 최근의 예측을 선호합니다 (더 반응적이지만 잠재적으로 긴장됩니다).

ACT에 대한 데이터 수집 요구 사항

ACT는 매우 효율적인 데이터이지만 데이터 품질은 무엇보다 중요합니다. 쓰레기 들어와 쓰레기 밖으로 많이 적용됩니다.

최소 에피소드 수

Task Category Episodes Needed Expected Success Rate Collection Time
Simple pick-and-place 50–100 85%+ 2–4 hours
Bimanual coordination 100–200 80%+ 4–8 hours
정밀도 insertion (peg-in-hole) 200–400 70%+ 1–2 days
Complex multi-step tasks 500+ 60%+ 2–5 days
Dexterous manipulation 500–1,000 50%+ 1–2 weeks

데이터 품질 확인 목록

  • 일관된 시범: 하나의 운영체 (또는 매우 유사한 스타일의 운영체) 를 사용한다. ACT는 일모달적 행동 분포를 가정한다.
  • ** 고정된 객체 배치 구역**: 객체들은 대략 같은 영역에서 시작되어야 합니다 (~ 5cm의 차이는 있습니다). ACT는 명시적으로 훈련되지 않는 한 큰 공간적 전환에 잘 일반화되지 않습니다.
  • 정화한 시작/말 상태: 각 에피소드는 같은 홈 위치에서 시작하여 깨끗하게 끝낼 수 있습니다 (물질에 대한 포착 장치 또는 목표에 배치된 물체). 단축 또는 실패한 에피소드는 배제되어야 합니다.
  • 일관된 시간: 시범대상에서도 동일한 속도로 작업을 수행하려고 노력합니다. 큰 시간차가 행동 분포에 모호함을 만듭니다.
  • ** 카메라 안정**: 카메라가 딱딱하게 장착되어야 합니다. 에피소드 간 카메라의 이동은 성능을 크게 떨어뜨립니다.

HDF5 데이터 형식

RCSV는 수집된 모든 데이터를 ACT 훈련의 표준인 HDF5 형식으로 제공합니다. 각 에피소드는 다음과 같은 구조를 가진 단일 HDF5 파일로 저장됩니다.

# HDF5 episode structure for ACT training
episode_0.hdf5
├── observations/
│   ├── qpos          # [T, 7] — joint positions (6 DOF + gripper)
│   ├── qvel          # [T, 7] — joint velocities
│   ├── images/
│   │   ├── cam_high  # [T, 480, 640, 3] — overhead camera
│   │   └── cam_wrist # [T, 480, 640, 3] — wrist camera
│   └── effort        # [T, 7] — joint torques (optional)
├── action            # [T, 7] — target joint positions
└── attrs/
    ├── sim           # False (real robot data)
    ├── compress      # True
    └── num_timesteps # T

ACT 준비된 데이터 수집 서비스를 위해 [RCSV 데이터 서비스]T7 참조하십시오. 우리는 HDF5 또는 LeRobot Parquet 형식으로 캘리브레이트 된 멀티 카메라 설정, 훈련된 운영자, 품질 관리 및 배달을 제공합니다.

카메라 설치 권고

ACT 성능은 카메라 구성에 크게 달려 있습니다. 원래의 ALOHA 설정은 3 개의 카메라를 사용합니다.

  • **오버헤드 카메라 (필요한) **: 작업 공간 위 0.81.2m 위를 달고, 직진으로 향한다. 현상 및 객체 위치의 전면적 인 관점을 제공합니다. 해상도: 최소 640×480.
  • ** 손목 카메라 (강히 추천) **: 로봇의 손목이나 팔꿈치에 설치되어 있습니다. 잡기 및 삽입 중에 근접적인 시선을 제공합니다. 위장 카메라가 미세한 세부 사항을 해결할 수 없는 정밀 작업에 중요합니다.
  • ** 옆 카메라 (선택) **: 위쪽 및 손목 관측에서 놓칠 수 있는 깊이 정보를 제공합니다. 수직 겹치거나 높이 감수적 배치에 관한 작업에 가장 유용합니다.

USB 3.0 카메라 (Logitech C920 또는 Intel RealSense D405) 를 사용하여 고정된 노출과 화이트 균형이 있습니다. 자동 노출은 에피소드 간 불일치 않은 이미지 밝기를 유발하여 훈련을 저하시킨다.

훈련 을 통해

이 섹션에서는 레로봇 프레임워크와 직접 PyTorch 구현을 사용하여 ACT 정책을 훈련합니다.

레로봇 (고래 추천) 에 대한 훈련

Hugging Face의 [LeRobot] (T8) 는 2026년 ACT 훈련에 가장 접근 가능한 프레임워크입니다. 데이터 로딩, 증강 및 판정을 처리합니다.

# Step 1: Install LeRobot
pip install lerobot

# Step 2: Convert HDF5 data to LeRobot format
python -m lerobot.scripts.convert_dataset \
  --raw-dir ./my_episodes/ \
  --repo-id my-org/pick-place-task \
  --raw-format hdf5_aloha

# Step 3: Train ACT policy
python -m lerobot.scripts.train \
  policy=act \
  dataset_repo_id=my-org/pick-place-task \
  training.num_epochs=2000 \
  training.batch_size=8 \
  policy.chunk_size=100 \
  policy.n_action_steps=100 \
  policy.dim_model=512

# Step 4: Evaluate
python -m lerobot.scripts.eval \
  --pretrained-policy-name-or-path outputs/train/act_pick-place-task/checkpoints/last/pretrained_model \
  --env-name real_world \
  --n-episodes 20

훈련은 일반적으로 110000 에피소드 동안 RTX 4090에서 28 시간 동안 konverges.

직접 PyTorch 훈련 구성

훈련 루프에 대한 더 많은 통제가 필요한 팀 또는 ACT를 사용자 정의 파이프라인에 통합하려는 팀:

# ACT training configuration — direct PyTorch implementation
import torch
from act.policy import ACTPolicy
from act.train import train_bc

config = {
    # Architecture
    'chunk_size': 100,          # action chunk length (timesteps)
    'hidden_dim': 512,          # transformer hidden dimension
    'dim_feedforward': 3200,    # feedforward network dimension
    'num_encoder_layers': 4,    # transformer encoder layers
    'num_decoder_layers': 7,    # transformer decoder layers
    'nheads': 8,                # attention heads
    'latent_dim': 32,           # CVAE latent dimension

    # Training
    'lr': 1e-5,                 # learning rate (Adam)
    'weight_decay': 1e-4,       # L2 regularization
    'num_epochs': 2000,         # total training epochs
    'batch_size': 8,            # batch size (8 fits on 24 GB VRAM)
    'kl_weight': 10,            # beta for KL divergence term
    'seed': 42,

    # Data
    'camera_names': ['cam_high', 'cam_wrist'],
    'image_size': [480, 640],   # H, W
    'action_dim': 7,            # 6 DOF + gripper
    'state_dim': 7,             # joint positions

    # Augmentation
    'color_jitter': True,       # random brightness/contrast
    'random_crop': True,        # spatial augmentation
}

# Initialize and train
policy = ACTPolicy(config)
optimizer = torch.optim.AdamW(policy.parameters(), lr=config['lr'], weight_decay=config['weight_decay'])
train_bc(policy, optimizer, dataloader, config)

훈련 팁

  • 학습률: 1e-5에서 시작하십시오. ACT는 학습률에 민감합니다.
  • 배치 크기는: 24 GB VRAM (RTX 4090) 에 8을 사용한다. 12 GB VRAM (RTX 3060) 에 4으로 줄일 수 있다. A100에 더 큰 배치 (1632) 는 안정성을 향상시킨다.
  • Epochs: 2000년대 에파크 최소의 열차. ACT는 종종 긴 고원지대에 따라 1000~1500년대 에파크에 대한 갑작스러운 개선이 나타난다.
  • ** 체크포인팅**: 500개의 시대를 절약합니다. 저장된 모든 체크포인트를 평가합니다.
  • 행동 정상화: 데이터셋 통계를 사용하여 행사를 [-1, 1]로 정상화 합니다. 관절 원인 훈련 실패에 따라 다른 스케일과 비정상화 된 행사는

하이퍼파라미터 조율 가이드

ACT는 디스포지션 정책보다 더 적은 하이퍼파레머를 가지고 있지만, 세 가지 파라미터는 각 새로운 작업에 대해 신중하게 조정해야 합니다.

덩어리 크기는

가장 영향력 있는 매개 변수는 다음과 같은 결정 과정을 따르십시오.

  1. 작업에서 하나의 하위 움직임의 평균 수명을 측정하십시오 (예를 들어, 객체에 도달하는 경우: 1.5s).
  2. 제어 주파수로 곱하면: 1.5 s × 50 Hz = 75 시간 단계.
  3. 가장 가까운 25으로 습니다.
  4. 작업이 매우 다른 단계 (reach, grasp, retract) 를 가지고 있다면, 부분은 적어도 하나의 전체 단계를 다루어야 합니다.

그림의 크기가 틀렸다는 신호:

  • 너무 작습니다. 로봇은 전환에 의문을 품고, 움직이지 않고, 중동에 갇혀 있습니다.
  • 너무 큰 로봇은 과다 예측을 하고, 과장된 움직임을 하고, 불필요한 미래 예측에 대한 훈련 능력을 낭비합니다.

KL 무게 (kl_중/ β)

CVAE 정규화를 제어합니다. 기본은 10입니다.

  • β = 0: CVAE 정규화 가 없습니다. 모델은 표준 행동 복제 (실동 변수 가 없습니다.) 로 퇴행합니다. 이것을 기본 라인으로 사용하지만 더 나쁜 성능을 기대합니다.
  • β = 10 (전설): 대부분의 작업에 좋은 균형. 잠잠한 공간은 붕괴 없이 시범 변동성을 캡처합니다.
  • β = 2050: 더 강한 규칙화, 더 일관된 (변수 덜) 궤도를 생성한다. 이미 매우 일관된 시범이 있을 때 유용하다.
  • β > 100: 너무 강. 모델은 데이터를 무시하고 평균 행동을 만들어냅니다. 피하십시오.

질문 수 (수_수)

원래 ACT에서 num_queries는 chunk_size (시간 단계마다 한 개의 질구가) 에 해당한다. 일부 구현에서는 이러한 질서가 더 적은 쿼리를 사용하여 쿼리를 분리할 수 있습니다. 이 변경에 대한 구체적인 이유가 없으면 num_queries = chunk_size를 유지하십시오.

시각 척추

ResNet-18는 기본 설정이며 대부분의 작업에 잘 작동합니다.

  • **ViT (DINOv2) **: 미세한 시각적 이해가 필요한 작업에 더 좋습니다 (etikett을 읽는 것, 정확한 조율). 훈련 시간을 23배 증가시킵니다.
  • ResNet-50: 대부분의 조작 작업에 있어서 ResNet-18보다 소외적인 개선이지만 메모리 사용량을 두 배로 늘립니다.
  • EfficientNet: 제한된 컴퓨팅을 가진 모바일 배포에 좋은 타협.

하드웨어 권고

ACT는 다양한 로봇 플랫폼에서 검증되었습니다. RCSV를 통해 사용할 수 있는 최고의 옵션은 다음과 같습니다:

Robot Platform Price Configuration Best ACT Use Case Lease from RCSV
OpenArm 1 $4,500 6-DOF, leader-follower, open-source Single-arm ACT research, entry-level imitation learning from $800/mo
DK1 Bimanual $12,000 Dual 6-DOF arms, ALOHA-compatible Bimanual ACT (original ALOHA workflow), folding, assembly from $1,500/mo
Unitree G1 $16,000 23-DOF humanoid, dual arms + locomotion Whole-body ACT, mobile manipulation, loco-manipulation from $2,500/mo
Unitree Go2 $2,800 사족 로봇, arm attachment option Locomotion + arm manipulation, outdoor tasks from $800/mo

계산 요구 사항

GPU VRAM Max 배치 크기 Training Time (200 eps) Inference 지연시간
RTX 3060 12 GB 4 8–16 hours ~20 ms
RTX 4090 24 GB 8 2–8 hours ~12 ms
A100 40/80 GB 16–32 1–3 hours ~8 ms
H100 80 GB 32–64 <1 hour ~5 ms

ACT는 가장 컴퓨팅 효율적인 모방 학습 알고리즘 중 하나입니다. 소비자 RTX 3060은 훈련 및 실시간 배포에 충분하며, 소규모 연구소 및 개별 연구자에게 액세스 할 수 있습니다.

일반적인 실패 모드와 해결 방법

ACT 훈련은 비교적 간단하지만, 배포 실패는 흔하다. 가장 흔한 문제와 그 해결책은 다음과 같습니다.

1 로봇은 임무 중 궤도를 벗어납니다

유러미: 충분한 시범 또는 불합리한 시범 품질.

** 수정**: 추동이 일어나는 정확한 지역에 초점을 맞추고 50개의 더 많은 시범을 수집하십시오. 모든 시범이 동일한 전략을 따르도록 하십시오. 카메라 위치가 변하지 않았는지 확인하십시오.

2. 거나 흔들리는 움직임

** 원인**: 시간적 무늬가 너무 높거나 크기가 너무 작습니다.

** 수정**: 시간적 집합중량을 줄이십시오 (0.01) 대신 0.005을 시도하십시오. 덩어리 크기를 2550로 증가하십시오. 동작 정상화 통계가 올바르게 계산되었는지 확인하십시오.

3· 로봇은 포착/방해 전환 시 냉각된다

** 원인**: 시범 데이터에서 모호한 지갑 명령어. 일부 디모는 일찍, 다른 사람들은 늦게 잡습니다.

** 수정**: 일관된 잡기 시기를 가지고 다시 시범을 수집하십시오. 대안적으로, 연속적인 잡기 위치 대신 바이너리 잡기 명령어를 사용하십시오.

훈련 손실 평야 하지만 성능은 좋지 않습니다

** 원인**: KL 무게가 너무 높다 (β > 50), 후부 붕괴를 일으킨다. 모델은 잠복 변수를 무시하고 평균 행동을 예측합니다.

정치: kl_중량을 10개 이상으로 줄여서 KL 손실을 별도로 모니터링 합니다.

5. 훈련 대상에서 작업하지만 새로운 대상에서 실패

유러: ACT는 기본적으로 새로운 객체에 일반화되지 않습니다. 그것은 단일 작업 알고리즘입니다.

** 수정**: 다양한 객체 (다양한 색상, 크기와 모양) 을 가진 시범을 수집하십시오. 이미지 증강 (색의 진동, 무작위 작식) 을 사용하십시오. 실제 객체 일반화를 위해서는 VLA 모델로 전환하는 것을 고려하십시오 (우리의 [이미레이션 학습 안내서를 참조하십시오]

6· 2차 협의가 끊어질

무기는 독립적으로 예측되며, 조정 시기를 잃습니다.

** 수정**: 두 팔의 동작이 동일한 동작 벡터 (팔당 14-DOF: 7) 에 있는지 확인 하십시오. 팔당 별도의 정책을 훈련하지 마십시오. 전체 조정된 동작을 커버하기 위해 덩어리 크기를 늘려 보세요.

ACT vs. 방출 정책: 언제 어떤 것을 사용해야 하는가

Dimension ACT Diffusion Policy
Data efficiency 50–200 demos 100–500 demos
Multi-modal actions Limited (CVAE helps but not fully multimodal) Excellent (denoising naturally captures multiple modes)
Inference speed 50+ Hz (single forward pass) 10–30 Hz (iterative denoising)
궤적 smoothness Good (temporal ensembling) Excellent (inherent to diffusion process)
Training time 2–8 hours (RTX 4090) 4–16 hours (RTX 4090)
Hyperparameter sensitivity Low (mainly chunk_size and kl_weight) Medium (noise schedule, denoising steps, network architecture)
Language conditioning Not supported natively Not supported natively (extensions exist)
Framework support LeRobot, robomimic LeRobot, robomimic, diffusion_policy repo
Best for Fast prototyping, single-strategy tasks, limited data budgets Multi-strategy tasks, contact-rich manipulation, diverse operator data

** 엄지손가락 규칙**: ACT를 시작하세요. 그것은 더 빨리 훈련하고, 데이터를 덜 필요로 하며, 데이터 수집 파이프라인을 빠르게 검증할 수 있습니다. 다모달 실패 (두 전략 사이의 로봇 평균) 를 관찰하거나 접촉이 풍부한 작업에 더 매끄러운 궤도가 필요한 경우에만 방전 정책으로 전환하십시오.

실제 로봇에 배치

훈련된 후에는 ACT 정책을 배포하는 것은 모델을 로드하고 제어 루프에서 실행하는 것을 포함한다. 다음은 최소 배포 스크립트입니다.

# ACT deployment on real robot (pseudocode)
import torch
import numpy as np
from act.policy import ACTPolicy

# Load trained policy
policy = ACTPolicy.load("checkpoints/act_epoch_2000.pt")
policy.eval()
policy.cuda()

# Initialize robot and cameras
robot = RobotInterface(port="/dev/ttyUSB0", hz=50)
cameras = CameraInterface(names=["cam_high", "cam_wrist"])

# Action buffer for temporal ensembling
all_actions = {}
temporal_weight = 0.01

for t in range(max_steps):
    # Get observation
    images = cameras.get_images()   # dict of [H, W, 3] arrays
    qpos = robot.get_joint_positions()  # [7]

    # Predict action chunk
    with torch.no_grad():
        obs = preprocess(images, qpos)   # normalize, resize, to_tensor
        action_chunk = policy(obs)       # [chunk_size, action_dim]
        action_chunk = action_chunk.cpu().numpy()

    # Temporal ensembling
    for i in range(len(action_chunk)):
        if (t + i) not in all_actions:
            all_actions[t + i] = []
        all_actions[t + i].append(action_chunk[i])

    if t in all_actions:
        preds = np.array(all_actions[t])
        weights = np.exp(-temporal_weight * np.arange(len(preds)))[::-1]
        action = np.average(preds, weights=weights, axis=0)
    else:
        action = action_chunk[0]

    # Execute action
    robot.set_joint_positions(action[:6])
    robot.set_gripper(action[6])
    robot.step()

robot.go_home()

고급 주제

VLA 사전 훈련과 함께 ACT

최근 연구 (20252026) 는 ACT의 액션 킹과 VLA 사전 훈련을 결합한다. 아이디어는: 미리 훈련된 시각 언어 모델을 시각 커드로 사용하고, ACT의 화된 액션 디코더를 첨부한다. 이것은 ACT의 데이터 효율성과 추론 속도와 기초 모델의 일반화 기능을 제공합니다. VLA 모델에 대한 자세한 내용은 [이미레이션 학습 가이드] (T18) 를 참조하십시오.

성적 인 조작 에 대한 행위

ACT를 능숙한 손에 적용하는 데 (예컨대 17 DOF의 [오르카 손]T19) 는 다음과 같은 조정이 필요합니다.

  • 동작을 _dim를 증가시켜 손 DOF와 일치한다 (예를 들어, 6DOF 팔 + 17DOF 손 23).
  • 200 크기를 높여서 숙련된 조작 동작은 느리고 복잡합니다.
  • 손목 카메라를 주요 시각 입력으로 사용하십시오.
  • 500개 이상의 시범을 수집합니다. 더 높은 차원의 행동 공간은 더 많은 데이터가 필요합니다.

다중 작업 ACT

표준 ACT는 단일 작업입니다. 다중 작업 운영에 대해서는 두 가지 접근법이 실제로 작동합니다.

  1. ** 작업 조건 ACT**: 코더 입력에 임베디션 작업 (일 열 또는 학습) 을 추가하십시오. 여러 작업에서 혼합된 데이터를 훈련하십시오. 35 관련 작업에 사용됩니다.
  2. 어 조건 ACT: 과제를 임베디드 한 언어 명령어로 대체하여 냉동 CLIP 또는 SigLIP 모델로 코딩한다. 보다 유연하지만 작업에 대한 데이터가 더 필요합니다. 구현을 위해 [LeRobot]T20) 및 [robomimic]T21) 같은 도구를 참조하십시오.

자주 묻는 질문

트랜스포머 (ACT) 로 액션 킹이란 무엇인가?

ACT는 2023년 스탠퍼드에서 토니 자오 등이 도입한 로봇 모방 학습 알고리즘이다. 이 알고리즘은 일반적으로 50 Hz에서 100 시간 단계의 시퀀스를 예측하여 다음 동작 대신 2 초의 움직임을 커버한다. 이것은 복합 오류를 줄이고 50 개 이상의 인간 시범에서 원활하고 일시적으로 일관된 로봇 궤도를 생성한다.

ACT가 얼마나 많은 시위를 해야 할까요?

간단한 픽 앤 플레이에 50100, 쌍방향 조정에 100200, 정밀 삽입에 200400, 복잡한 다단계 또는 능숙한 작업에 500+입니다. 품질은 양보다 더 중요합니다.

어떤 크기를 사용해야 할까요?

50 Hz (2초) 에서 100을 시작하십시오. 3초 이하의 빠른 작업에 대해 50으로 줄이십시오. 느린 정확성 작업에 대해서는 150200으로 증가하십시오.

ACT는 여러 가지 유효한 전략을 처리할 수 있습니까?

ACT의 CVAE 잠잠 변수는 일부 멀티 모다리티를 제공하지만, 기본적으로 유모달 액션 배포에 설계되었습니다. 작업이 진정으로 다른 유효한 전략을 가지고 있다면 (예를 들어, 왼쪽에서 오른쪽으로 잡는 것) ACT는 그들을 평균하여 실패한 중간 궤도를 생성합니다. 멀티 모달 작업에 [방포 정책]T22) 을 사용하십시오.

ACT는 어떤 데이터 형식을 기대하고 있습니까?

HDF5는 표준 형식이다. 각 에피소드는 공동 위치 (qpos), 공동 속도 (qvel), 카메라 이미지 및 목표 행동들을 포함합니다. RCSV의 데이터 수집 서비스 는 훈련에 준비된 이 형식에서 데이터를 제공합니다. 자세한 사양을 위해 우리의 [데이터 형식 가이드] (T24) 를 참조하십시오.

2,500 달러에서 ACT 준비 훈련 데이터를 수집합니다

RCSV는 ACT 훈련에 대한 종합 데이터 수집을 제공합니다. 가산된 멀티 카메라 설정, 훈련된 텔레오퍼레이터, 품질 관리 및 HDF5 또는 LeRobot Parquet 형식으로 전달. 파일럿 프로젝트는 100 에피소드 당 2,500 달러에서 시작되며, 전체 캠페인은 500 에피소드 이상 $ 8,000에서 시작됩니다.

데이터 수집 서비스 당신의 조종사용 하드웨어를 임대