Guides(으)로 돌아가기

액션 <unk>킹 트랜스포머 (ACT): ACT 정책의 훈련 및 배포에 대한 완전한 가이드 (2026)

완전한 ACT 가이드: 액션 <unk>싱을 이해하고, 로봇 데이터에 대한 ACT 정책을 훈련하고, OpenArm 또는 모바일 ALOHA에 배포합니다. 시간적 집합, <unk> 크기의 조정 및 LeRobot 통합을 포함합니다. 2026 업데이트.

[← 가이드]

시속 순조로움 이론과 CVAE 훈련, LeRobot 및 ACT+ 훈련 파이프라인을 통해, 시속 합계 추론으로 OpenArm 및 Mobile ALOHA에서 실제 하드웨어 배포에 이르기까지

1. 액션 킹이란 무엇인가?

액션 킹은 모방 학습의 기술입니다. 정책은 단일 다음 동작보다는 미래의 행동의 연속을 예측합니다. 로봇은 이 부분의 일부를 실행하고, 새로운 초복된 부분으로 정책을 다시 요청합니다. 그 결과, 단일 단계 행동 복제 (BC) 를 괴롭히는 합성 오류 문제를 저항하는 더 부드럽고 시간적으로 일관된 궤도입니다.

표준 BC에서, 정책은 제어 단계마다 한 동작을 예측한다. 각 예측 오류는 로봇을 정책이 본 적이 없는 상태로 이동시켜 다음 예측이 더 악화되는 등으로 한다. 50 Hz (4 초 조작) 에서 200 단계 궤도를 넘어서면, 심지어 1%의 단계 오류가 시범 분포에서 벗어나기 확률이 ~87%에 이르게 된다. 액션 쪼개는 k_단계 계획 (일반적으로 50 Hz에서 50100, 12 초의 움직임에 해당하는) 에 의해 이것을 줄이고, 독립적인 결정 포인트의 수를 200에서 200/k 로 줄이고 24까지 줄입니다.

조각 크기는 가장 중요한 과다분야

덩어리 크기는 _k_로 궤도 매끄러움과 환경 반응성 사이의 교류를 결정한다. 더 큰 덩어리들은 매끄러움의 장점을 잃어 버리고, 다시 합성 오류를 도입할 수 있다.

작업 유형별로 권장 출발점:

  • ** 테이블탑 픽 앤 팟:** k=50100 (12초) 환경은 정적 이고, 부드러움이 반응성보다 더 가치 있다.
  • 집단 및 삽입: k=3060. 접촉이 풍부한 단계들은 조율 오류를 조정하기 위해 더 자주 재계획이 필요합니다.
  • ** 양쪽의 조정:** k=5080. 두 팔은 조정된 조각이 필요하지만 너무 짧은 조각은 조정이 끊어진다.
  • ** 이동 조작:** k=2040의 기틀, k=5080의 팔. 기틀은 더 빠른 장애물 반응이 필요합니다.
  • ** 역동적 과제 (잡기, 피하는):** k=1020. 반응성 은 중요 합니다. 약간의 부드러운 손실을 받아 들인다.

왜 행동 킹이 효과가 있습니까? 일시적 부드러운 주장

단일 단계 BC 정책은 각 단계에 대해 독립적으로 처리합니다. 모델이 조건부 분포를 완벽하게 캡처하더라도, 단계 간 독립은 궤도가 시간적 일관성이 부족하다는 것을 의미합니다.

k 단계를 동시에 예측함으로써 모델은 내부적으로 일관된 궤도 세그먼트를 생성해야 합니다. 훈련 손실은 전체 조각을 공동으로 처벌하여 네트워크가 격리된 프레임-프레임 예측보다는 부드러운 운동 원시들을 배울 수 있도록 강요합니다. 이것은 언어 모델이 여러 토큰을 동시에 생성하는 데 비해 한 번에 하나의 토큰을 샘플링하는 데 비해 더 일관된 텍스트를 생성하는 것과 유사합니다.

2. ACT 건축

ACT는 트랜스포머 척추와 함께 조건형 변동자동화코더 (CVAE) 를 사용합니다. 아키텍처는 세 가지 주요 구성 요소를 가지고 있습니다. CVAE 코더 (훈련 중에만 사용되며), 트랜스포머 디코더 (훈련과 추론 과정에서 사용되며), 그리고 시력 척추.

CVAE 엔코더 (훈련만)

훈련 중에, 코더는 전체 시범 이미지, 공동 상태, 기초 진실 행동 을 처리하고 시범 특유의 변수를 캡처하는 잠수형 스타일 변수 z (차원 32) 을 생성합니다. 다른 운영자는 다른 각 또는 속도에서 동일한 작업을 접근 할 수 있습니다. z는 이 변이를 코딩합니다.

코더는 전체 액션 순서와 현재 관측에 참여하는 트랜스포머입니다. 그것은 가우스 변수를 매정하는 평균 및 로그 변수를 내보내는데, z는 재변리화 트릭을 통해 샘플을 취합니다. KL 분차 용어 (베타로 중량, 일반적으로 10100) 는 표준 전 정상 N 0, I로 z를 정규화합니다.

결론적으로, z는 0 (사래의 평균) 로 설정되어 정책 결정적 역할을 한다. CVAE 구조는 순전히 훈련 보조제입니다. 그것 없이는 모델은 시범 스타일들 간의 평균을 만들어 모든 접근 방식의 평균을 만들어내고 따라서 그 중 어느 것도 (모드 평균) 이다. CVAE를 사용하면 모델은 각 스타일을 개별적으로 해독하는 것을 배우고, 추론에서 0-중소 z는 가장 "유형"의 실행을 생산합니다.

트랜스포머 디코더 (훈련 + 인퍼런스)

디코더는 3개의 입력값을 사용합니다. latenz z (또는 0), 시력 척추 + proprioception에서 관찰 토큰, 그리고 k 학습 가능한 위치 질의 (부문에서 한 동작에 한 번) 이다. 표준 트랜스포머 간접 관심은 위치 질의가 관찰 토큰에 참석하여 k 행동 예측을 병렬로 생성하도록 한다.

원래 ACT 구현에서 아키텍처 세부 사항:

  • 코더 계층: 4 (관측 프로세스 + z 컨텍스트 토큰으로)
  • ** 디코더 계층:** 7 (더 심해지기 때문에 더 많은 작업을 수행합니다: 전체 액션 조각을 생성합니다)
  • ** 숨겨진 크기는:** 512
  • ** 주의력:** 8
  • 전용방면: 2,048
  • 총 매개 변수: ~40M (관광 척추를 제외한)
  • 행동 출력: k 공동 위치 목표 (예를 들어, k=100 단계 x 14 관절의 양동 ALOHA)

시력 척추

각 카메라 뷰는 ResNet-18를 통해 독립적으로 처리되며, 480x640 입력에서 기능 지도 (15x20x512) 를 생성하여 카메라당 300 개의 토큰으로 평평화됩니다. 24 카메라로 디코더는 6001,200 개의 시각 토큰을 수신합니다.

최소 실행 가능한 카메라 설정은 2 개의 시야: 손목 장착 카메라 (밀착 조작 세부 사항) 및 상장 카메라 (공간 컨텍스트) 이다. 세 카메라 (1 손목 + 2 다른 각에서 세 번째 사람) 는 RCSV 표준이며 2 카메라 설정에 비해 정확성 작업에서 515%의 성공률을 지속적으로 향상시킵니다.

3· 데이터 요구 사항

ACT는 동기화된 (관측, 행동) 쌍으로 저장된 인간 텔레오퍼레이션 시범들에서 학습한다. 데이터 품질은 양보다 더 중요합니다. 50개의 깨끗한 시범은 500개의 노이즈 시범보다 더 좋은 성능을 발휘한다.

작업 복잡성별로 최소 데이터 세트 크기는

Task Type 시연 Needed Approx. Collection Time Notes
Simple pick-and-place (fixed location) 20–30 30 minutes Lowest bar for proof-of-concept
Pick-and-place with pose variation 50–80 1–2 hours Must cover workspace uniformly
Multi-step manipulation 100–150 3–4 hours Each phase needs coverage
Bimanual coordination 150–250 5–8 hours Coordination patterns require more examples
Contact-rich assembly (insertion, screwing) 200–400 8–16 hours Force-sensitive phases need dense coverage

데이터 품질 확인 목록

  • ** 중단 없이:** 시위가 지속적으로 흐르도록 한다. <0.5s>의 중단은 정책에 "아무것도 하지"는 것을 예측하는 것을 가르친다.
  • 일반적 속도: 빠른 과 느린 시범을 혼합하면 속도 변동에 대한 CVAE의 잠실 용량을 낭비한다.
  • ** 순수한 시작/말:** 각 에피소드는 비슷한 중립적인 자세에서 시작되어 명확하게 끝납니다.
  • ** 성공만:** 모든 실패한 시범을 제거합니다. ACT는 모든 훈련 데이터를 전문가 시범으로 취급합니다.
  • ** 카메라 일관성:** 딱딱한 마운트를 사용하세요. 세션 사이 카메라의 5mm 이동도 포착 정확성을 떨어뜨립니다.

데이터 형식: HDF5 및 RLDS

ACT 훈련 데이터의 표준 형식은 HDF5이며, 각 에피소드는 이미지 (n__kamera x H x W x 3, uint8), 공동 위치 (qpos, float64), 공동 속도 (qvel, float64), 그리고 동작 (float64) 의 데이터 세트를 포함하는 그룹으로 저장됩니다.

플랫폼 간 호환성을 위해, 구글의 오픈 X-Embodiment에서 사용되는 RLDS (Reinforcement Learning Datasets) 형식은 을 표준화된 스케마를 가진 TFRecord 파일로 저장합니다. LeRobot은 HDF5, RLDS, 그리고 네이티브 파켓 형식 사이의 변환 유틸리티를 제공합니다. 자세한 변환 지침을 위해 [데이터 형식 안내]T13을 참조하십시오.

# HDF5 episode structure for ACT training
import h5py
import numpy as np

with h5py.File("episode_0042.hdf5", "r") as f:
    # Camera images: (T, H, W, 3) uint8
    cam_high = f["/observations/images/cam_high"][:]   # overhead camera
    cam_wrist = f["/observations/images/cam_wrist"][:] # wrist camera

    # Joint state: (T, n_joints) float64
    qpos = f["/observations/qpos"][:]    # joint positions (radians)
    qvel = f["/observations/qvel"][:]    # joint velocities (rad/s)

    # Actions: (T, action_dim) float64
    actions = f["/action"][:]            # target joint positions

    print(f"Episode length: {len(qpos)} steps")
    print(f"Control frequency: {f.attrs['control_freq']} Hz")
    print(f"Camera resolution: {cam_high.shape[1]}x{cam_high.shape[2]}")
    # Typical output:
    # Episode length: 400 steps
    # Control frequency: 50 Hz
    # Camera resolution: 480x640

4. 레로봇과 ACT 훈련

[LeRobot] (T14) (Hugging Face) 는 ACT 정책 훈련을위한 가장 적극적으로 유지되는 오픈소스 프레임워크입니다. ALOHA, Koch v1.1, OpenArm 등 일반적인 로봇 플랫폼에 표준화된 데이터 로딩, 훈련 루프, 평가 스크립트 및 미리 구축된 구성 기능을 제공합니다.

설치

# Clone and install LeRobot
git clone https://github.com/huggingface/lerobot.git
cd lerobot
pip install -e ".[act]"

# Verify GPU is available
python -c "import torch; print(f'CUDA: {torch.cuda.is_available()}, Device: {torch.cuda.get_device_name(0)}')"

훈련 지휘

# Full ACT training command
python lerobot/scripts/train.py \
  --policy.name=act \
  --dataset.repo_id=svrc/openarm_pick_place \
  --policy.chunk_size=50 \
  --policy.n_obs_steps=1 \
  --policy.dim_model=512 \
  --policy.n_heads=8 \
  --policy.n_encoder_layers=4 \
  --policy.n_decoder_layers=7 \
  --policy.latent_dim=32 \
  --policy.kl_weight=10.0 \
  --training.learning_rate=1e-5 \
  --training.batch_size=8 \
  --training.num_epochs=5000 \
  --training.eval_freq=500 \
  --training.save_freq=1000 \
  --device=cuda \
  --output_dir=outputs/act_openarm_pick_place/

하이퍼파라메터 참조

Hyperparameter Default Search Range Effect of Increasing When to Increase
chunk_size (k) 100 20–200 Smoother trajectories, less reactive Smooth tasks (wiping, pouring)
latent_dim (z) 32 16–64 More expressive style capture High demonstration variance
kl_weight (beta) 10 1–100 Stronger regularization Small datasets (<50 demos)
learning_rate 1e-5 5e-6–5e-5 Faster convergence, instability risk Large datasets (>200 demos)
temporal_ensemble_temp 10 5–50 Slower blending, more inertia Smoother tasks
n_cameras 2 1–4 Richer spatial info, more compute 3D reasoning tasks
backbone ResNet-18 ResNet-18/34/50 Better visual features Cluttered or varying-light scenes
num_epochs 3000 1000–8000 Better fit, overfitting risk More demos or complex tasks

GPU 요구 사항

  • ** 최소:** 16 GB VRAM (RTX 4060 Ti, RTX 3090). 배트 크기는 48. 훈련 시간은: 200 에피소드 동안 48 시간.
  • ** 추천:** 24 GB VRAM (RTX 4090). 배트 크기 16. 훈련 시간: 24 시간 200 에피소드.
  • ** 빠른 반복:** 4080 GB (A100, H100). 배트 크기는 3264. 훈련 시간: 3090 분. 빠른 하이퍼 파라미터 스래프를 가능하게 합니다.

5. ACT+ (원래 저장소) 를 통해 ACT+를 훈련시키는

토니 자오의 저장소에서 원래 ACT 구현 ([tonyzhaozh/act](T15)) 은 특히 ALOHA 하드웨어 스택을 이미 사용하는 팀들에 대한 유효한 훈련 경로가 남아있다. ACT+는 더 나은 속도 추정을 위해 고유 수용력 역사 (최후 25 관절 상태가 입력) 를 가진 원본을 확장합니다.

# Training with the original ACT repo
git clone https://github.com/tonyzhaozh/act.git
cd act
pip install -r requirements.txt

# Train on custom data
python train.py \
  --task_name openarm_pick_place \
  --ckpt_dir checkpoints/openarm_pp \
  --policy_class ACT \
  --kl_weight 10 \
  --chunk_size 50 \
  --hidden_dim 512 \
  --batch_size 8 \
  --dim_feedforward 2048 \
  --num_epochs 5000 \
  --lr 1e-5 \
  --seed 0 \
  --num_steps 400 \
  --camera_names cam_high cam_wrist

** 레로봇 대 원래 레포:** 레로봇은 더 잘 유지되고 (활동적인 커뮤니티, 정기적인 업데이트, 다정책 지원) 그리고 데이터 로딩 및 평가를 자동으로 처리합니다. 원래 레포는 더 직접적인 통제를 제공하고 연구 실험을 위해 수정하기가 더 쉽습니다. 생산 배포를 위해 레로봇을 추천합니다. 연구 포크를 위해 원래 레포는 해킹이 더 쉽습니다.

6. 실제 하드웨어에 배치

ACT 정책을 도입하는 것은 실시간 제어 제한을 충족시키는 것이 필요합니다. 추론 루프는 카메라 이미지 처리 및 액션 덩어리를 계산하는 동안 로봇의 제어 주파수 (일반적으로 50 Hz = 20ms 한 주기로) 에서 실행되어야합니다.

인퍼런스 루프 아키텍처

import torch
import numpy as np
from collections import deque

class ACTInferenceLoop:
    def __init__(self, policy, chunk_size=50, temporal_temp=10.0, query_freq=5):
        self.policy = policy
        self.chunk_size = chunk_size
        self.temporal_temp = temporal_temp
        self.query_freq = query_freq  # re-query every N steps
        self.action_queue = deque(maxlen=chunk_size)
        self.step_count = 0

    def get_action(self, images, qpos):
        """Returns a single action with temporal ensembling."""
        if self.step_count % self.query_freq == 0:
            # Get new action chunk from policy
            with torch.no_grad():
                obs = {
                    "images": torch.tensor(images).unsqueeze(0).cuda(),
                    "qpos": torch.tensor(qpos).unsqueeze(0).cuda(),
                }
                chunk = self.policy(obs)  # (1, chunk_size, action_dim)
                chunk = chunk.squeeze(0).cpu().numpy()
            self.action_queue.append({
                "actions": chunk,
                "generated_at": self.step_count
            })

        # Temporal ensembling: blend overlapping chunks
        action = np.zeros_like(self.action_queue[0]["actions"][0])
        total_weight = 0.0

        for entry in self.action_queue:
            offset = self.step_count - entry["generated_at"]
            if offset < self.chunk_size:
                weight = np.exp(-offset / self.temporal_temp)
                action += weight * entry["actions"][offset]
                total_weight += weight

        action /= total_weight
        self.step_count += 1
        return action

50 Hz에서 지연성 예산

50 Hz 제어에서, 각 사이클은 20ms 예산이 있습니다. 전형적인 분해:

  • 카메라 캡처 + 사전 처리: 25ms (USB3 카메라, 480x640)
  • ACT 추론: 212ms (GPU에 따라 달라지, 아래 기준표 참조)
  • 행동 중계 + 명령 전송: 12ms
  • ** 안전 검사:** 1ms
  • 마진: 014ms

플랫폼별 인퍼런스 벤치마크

Hardware ACT Inference (ms) Max Control Rate (Hz) Suitable For
NVIDIA A100 (80GB) 1.8 555 Cloud/datacenter inference
NVIDIA RTX 4090 2.5 400 Desktop workstation
NVIDIA RTX 4070 4.2 238 Budget desktop
Jetson AGX Orin 64GB 12 83 Onboard robot compute
Jetson Orin NX 16GB 22 45 Mid-range edge
Jetson Orin Nano 8GB 40 25 Minimum viable edge
Apple M3 Pro 18GB 8 125 Development/prototyping

임시 집합 구현 세부 사항

시간 집합은 기하급수적 붕괴 중량을 사용합니다: t 단계 전에 생성된 조각에서 예측하기 위해, 무게는 T7입니다. 50 Hz에서 기본 온도가 10인 경우, 현재 조각의 예측은 ~ 1.0 가 중화되며, 20 단계 전에 생성된 조각의 예측은 ~ 0.14 가 중화됩니다. 이것은 연속적인 덩어리 예측들 사이의 부드러운 혼합을 생성하고, 순수적인 순서적 실행으로 덩어리 경계에서 발생하는 긴장감을 제거합니다.

비평적 배포 팁: 생산에서 항상 시간적 집합을 사용하십시오. 그 없이는 로봇은 k/query_freq 단계마다 조각 한계에 가시적인 긴장감을 나타냅니다. 로봇은 갑자기 새로운 계획으로 이동합니다. 집합과 함께 전환은 부드럽고 눈에 띄지 않습니다. 계산 대가 미미합니다.

7. OpenArm 1 + ACT: 특정 설정 단계

OpenArm 1 ($4,500 단팔, $9,000 쌍방향 리더-따라자 역) 은 모방 학습 데이터 수집 및 ACT 배포를 위해 설계되었습니다. 여기 전체 설정 경로가 있습니다:

하드웨어 설정

  1. ** 카메라 설치:** 손목 카메라 (인텔 리얼센스 D405) 를 오픈아름 손목 구비에 부착한다. 제공된 게트리에 상장 카메라 (리얼센스 D435) 를 제공된 게트리에 60cm 이상으로 설치한다. 선택적으로: 더 나은 공간 커버리를 위해 세 번째 카메라를 45도로 설치한다.
  2. ** 연결서보:** OpenArm는 Feetech STS3215서보 (ALOHA와 동일) 를 사용합니다. U2D2 시리즈 인터페이스를 통해 연결하십시오. 모든 6 개의 관절이 응답하는 것을 확인하십시오.
  3. 관절 한계를 기량: T9을 실행하여 관절 0 위치와 부드러운 한계를 기록합니다. 이 경우 T10를 작성합니다.
  4. ** 테스트 텔레오퍼레이션:** 리더 팔이 연결되면 T11를 실행하십시오. 추종자는 50 Hz에서 리더의 움직임을 실시간으로 반영해야합니다.

ACT에 대한 데이터 수집

# Record demonstrations on OpenArm
python lerobot/scripts/control_robot.py record \
  --robot-path lerobot/configs/robot/openarm.yaml \
  --fps 50 \
  --repo-id svrc/openarm_pick_place \
  --num-episodes 50 \
  --warmup-time-s 3 \
  --episode-time-s 15 \
  --reset-time-s 10 \
  --push-to-hub 1

OpenArm에서 ACT를 배포한다

# Deploy trained policy
python lerobot/scripts/control_robot.py replay \
  --robot-path lerobot/configs/robot/openarm.yaml \
  --policy-path outputs/act_openarm_pick_place/checkpoints/best/ \
  --fps 50 \
  --num-episodes 20

8· 일반적인 오류 및 수정

우리는 RCSV에서 20개 이상의 조작 작업에 대해 ACT 정책을 훈련하고 배포했습니다. 우리가 가장 자주 볼 수 있는 실패 패턴과 그 해결책은 다음과 같습니다.

Symptom Root Cause Fix
Policy outputs zero or constant actions KL weight (beta) too high. Model ignores observations and outputs the mean action. Reduce beta by 5–10x. Monitor KL divergence: it should stabilize at 0.5–5.0 nats, not near zero.
Jerky execution at chunk boundaries Temporal ensemble temperature too low, or ensemble not implemented Increase temperature from 10 to 20–30. Verify overlapping chunk execution in your control loop.
Good training loss, poor real-world performance Camera mismatch between training and deployment Check image resize pipeline, camera FOV, crop regions. Use identical camera mount positions.
Works for 2 seconds then drifts Chunk size too large for task dynamics Reduce chunk size by 50%. The policy is committing to outdated plans.
Inconsistent between evaluation runs Too few demonstrations (<30) Collect more data. With small datasets, performance is highly sensitive to train/val split.
KL divergence collapses to zero Beta too low. 엔코더 encodes everything in z; decoder ignores observations. Increase beta until KL stabilizes at 0.5–5.0 nats.
Mode averaging: robot moves to "average" of multiple strategies Multi-modal demonstrations with single-mode CVAE Standardize demonstration strategy, remove minority approaches, or switch to Diffusion Policy.
Sim-to-real gap: policy works in sim but fails on real robot Contact dynamics, friction, and visual domain mismatch Fine-tune on 50–100 real demonstrations. Apply domain randomization during sim training.

9. 기준: ACT vs 방산 정책 vs 행동 복제

다음 기준은 ALOHA 및 OpenArm 플랫폼을 이용한 표준화된 조작 작업에 대한 RCSV에서 발표된 결과와 우리의 평가에서 나온다.

Dimension ACT Diffusion Policy Behavioral Cloning (MLP)
Success rate (50 demos, pick-place) 82–90% 75–85% 40–60%
Success rate (200 demos, pick-place) 90–95% 92–97% 65–80%
Success rate (bimanual insertion) 80–88% 72–82% 15–30%
Inference latency (RTX 4090) 2.5ms 15ms (DDIM) 0.5ms
Inference latency (Jetson Orin Nano) 40ms (25 Hz) 180ms (5.5 Hz) 5ms (200 Hz)
Training time (200 episodes, A100) ~4 hours ~8 hours ~1 hour
Model size ~40M params ~80M params ~5M params
Multi-modal handling Limited (CVAE) Excellent (diffusion) None (mode averaging)
궤적 smoothness Excellent Very good Poor (jerky)
Data efficiency (<50 demos) Good Moderate Poor
Edge deployment feasibility Excellent Challenging Trivial

10· ACT 을 다른 방법 에 대 한 사용 할 때

다음 경우 ACT을 사용하십시오

  • 50~200개의 시위가 있고, 빠른 발사가 필요합니다.
  • 당신의 임무는 비교적 결정적인 전략 (그 일을 할 수있는 한 가지 명확한 방법) 을 가지고 있습니다.
  • 당신은 추론 속도가 중요했던 가장자리 하드웨어 (제트슨) 에 배치하고 있습니다.
  • 당신은 양동동 조작을 하고 있습니다 (ACT는 ALOHA를 위해 설계되었습니다).
  • 최소한의 하이퍼파라미터 조정을 통해 가능한 가장 간단한 훈련 파이프라인을 원해요.
  • 컴퓨터 제한된 플랫폼에서 50Hz 실시간 제어가 필요합니다.

다음 경우 분포 정책을 사용하십시오

  • 당신의 시범에는 동일한 작업에 대한 여러 가지 유효한 전략이 포함되어 있습니다 (다양한 운영체, 모호한 포착).
  • 집합이나 삽입 작업에 미리미터 이하의 정확도가 필요합니다.
  • 여러분은 풍부한 데이터를 (200+개 이상의 시범) 그리고 계산 예산을 가지고 있습니다.
  • 더 높은 추론 지연 (클라우드 추론 또는 데스크톱 GPU) 를 용납할 수 있습니다.

VLA (OpenVLA, pi0) 를 사용 하려면:

  • 언어 조건으로 복수 작업을 실행하는 것이 필요합니다 ("붉은 잔을 선택하세요", "নীଳା 블록을 쌓아주세요").
  • 일반화를 위해 미리 훈련된 시각 언어 표현을 활용하고 싶습니다.
  • 당신은 큰 국가 공간에 이동 조작을 하고 있습니다.
  • 여러 GPU 훈련 인프라 (48 A100s) 에 액세스 할 수 있습니다.

다음 각 호의 경우 Simple BC를 이용하십시오

  • 여러분은 프로토타입을 만들고 있으며 가능한 한 빠른 훈련 반복을 원합니다.
  • 작업은 매우 짧습니다 (<20 단계) 합성 오류가 문제가 되지 않는 경우.
  • 당신은 극히 제한된 하드웨어 (미크로 컨트롤러 클래스) 에 배치하고 있습니다.

RCSV에서 ACT- 호환 가능한 로봇 데이터를 수집

RCSV는 ACT 훈련에 대한 종결 데이터 수집을 제공합니다. 가산화된 리더-따라자 하드웨어, 훈련된 운영자, 품질 관리 및 LeRobot HDF5 형식으로 전달합니다. 2,500 달러의 파일럿 (50 개의 작업에 대한 시범) 또는 8,000 달러의 완전한 데이터 캠페인으로 확장합니다.

데이터 수집 서비스 2,500 달러 파일럿 당신의 개인 수집을 위한 하드웨어를 임대