행동 <unk>킹 과 전체 궤도 모방: 실용적 인 비교
액션 <unk>킹 (ACT) 을 사용해야 할 때 vs. 전체 궤도 행동 클론링.
[← 연구]
행동 덩어리와 전체 궤도를 예측할 때 이해
순진 한 행동 의 복제 문제
표준 행동 복제 (BC) 는 현재 관찰을 고려하여 다음 행동을 예측하기 위해 정책 π a
첫째, ** 합성 오류**: 작은 예측 오류는 로봇을 약간 익숙하지 않은 상태로 이동시켜 더 큰 오류를 유발하여 작업을 완료하기 전에 더 큰 재앙의 실패로 이어집니다. 이것은 고전적인 DAgger 문제입니다. 실제적으로, 테이블 위에 있는 작업에 대한 BC 정책은 종종 80%의 성공률을 훈련 배포 기간 동안 (유통에 유지되는) 하지만 같은 작업에 배치되는 경우 40%~50%의 실패를 나타냅니다.
둘째, ** 모드 평균**: 같은 작업에 대해 여러 가지 유효한 전략이 존재할 때 (예를 들어, 왼쪽 또는 오른쪽에서 객체를 잡는 경우), 유모드 BC 정책은 시범을 평균하여 어느 전략도 성공적으로 실행하지 않는 중간 궤도를 생성합니다.
행동 덩어리 는 무엇 입니까?
ACT 논문 (Zhao et al., 2023) 에서 소개된 액션
정책 π(a_{t:t+H}
- 부작 크기는 H: 단일 쿼리에서 예측되는 미래의 시간 단계의 수. 50 Hz에서 테이블탑 조작을 위해, H=100 (2초) 는 표준 ACT 구성입니다. 더 큰 H는 작업의 더 많은 부분을 다루지만 정책에 예상치 못한 상태에 반응할 수있는 기회를 줄입니다.
- ** 재계획 주파수 k:** 정책에 다시 문의하기 전에 실행된 동작의 수. ACT에서 k=H/4에서 H (재계획 없이 전체 부분 실행)
- CVAE 코더: ACT는 조건형 변동자동식 코더를 사용하여 전체 시범의 스타일/모드를 코딩하여 정책이 평균보다는 하나의 전략에 헌신하도록 허용합니다. 이것은 다 모달 시범을 처리하는 주요 메커니즘입니다.
퍼포먼스 정책: 디네이징을 통해 쪼개
퍼포션 정책 (Chi et al., 2023) 은 다른 메커니즘을 통해 유사한 다 모다리티 처리 기능을 달성합니다. 행동 분포를 행동의 일부에 대한 퍼포션 프로세스로 모델링합니다. 정책은 현재 관찰에 따라 조건화된 잡음적인 행동 순서를 일컫습니다.
- U-Net 전파: convolutional U-Net는 액션 덩어리를 뜻한다. 변환기 기반 전파보다 더 빠른 추론 (GPU에서 ~ 10
50 ms) 이다. 구조화되고 반복적인 동작을 하는 작업에 선호된다. - ** 변환기 전파:** 액션 시퀀스에서 장거리 의존성을 캡처하는 데 더 잘합니다. 느리죠 (~ 100~300 ms). 복잡한 쌍방향 또는 다단계 작업에 더 적합합니다.
- ** 전형적인 조각 크기는:** H=8
16 10 Hz 제어 정책; H=32 64 50 Hz 정책. 방급 정책은 기본적으로 모든 조각을 재계획합니다.
작업 지평 분석
올바른 조각 크기와 재계획 빈도는 작업 지평에 크게 달려 있습니다.
- ** 단시간 작업 (<3초):** 간단한 선택 및 장소, 컵 스택. BC는 종종 적절하게 작동합니다. ACT를 사용하면 H=50
100 50 Hz에서 전체 작업을 하나 또는 두 개의 쿼리에 포함합니다. H=16 32의 방산도 효과적입니다. - ** 중간 지평선 작업 (3
15초):** 삽입, 케이블 라우팅, 음식 집합. 이것은 ACT의 달콤한 점입니다. H=100는 2초를 차지합니다. 25 50 단계 (0.5 1초) 마다 재계획하면 정책이 반응합니다. 시간적 집합이 권장됩니다. - 장시간 작업 (>30초): 전체 요리의 작업 흐름, 다중 드래프트 집합, 방 조직. 단일 레벨 쪼개는 여기서 실패합니다.
쪼개는 전체 작업을 다루지 못하지만, 긴 쪼개는 반응성을 잃습니다. 계층적 접근 방식 (고급 작업 계획 + 낮은 수준의 쪼개 εκτε는) 는 필요합니다. RT-2 또는 OpenVLA와 같은 VLM는 높은 수준의 작업 분해를 처리하고, ACT 또는 디푸지션은 낮은 수준의 실행을 처리합니다.
교육 데이터 요구 사항
- ** 시간적 일관성 요구 사항:** 행동 쪼개는 시범에서의 연속적인 시간 단계가 일관된 계획의 일부라는 가정이다. 시범 내에서 의박, 수정 및 후퇴는 쪼개기 예측자를 혼란스럽게 한다. 잡음적인 작업에 있어서, 행동 쪼개는 동일한 성능을 달성하기 위해 BC보다 약 2배 더 많은 데이터가 필요하므로, 더 큰 비중의 디모가 높은 품질이어야 한다.
- ** 다 모달 커버리지:** ACT CVAE는 깨끗한 잠복 모드를 배우기 위해 각 전략의 적어도 20
30의 시범이 필요합니다. 만약 당신의 작업이 유효한 3 가지 전략을 가지고 있다면, 일반적인 정책 품질을 하기 전에 모드 커버리지를 위해 60 90의 시범이 필요합니다. - ** 에피소드 길이의 정상화:** 변수 길이의 에피소드는 고정된 조각 예측에 도전을 야기합니다. 표준 길이로 포장 에피소드를 고려하거나 훈련 중에 조각 마스크를 사용하십시오.
성능 기준
| Algorithm | ALOHA Insertion | ALOHA Transfer Cube | ALOHA Slot Battery | Inference 지연시간 |
|---|---|---|---|---|
| 행동 복제 | 45% | 62% | 30% | 2–5 ms |
| ACT (H=100) | 80% | 92% | 65% | 15–30 ms |
| Diffusion Policy (U-Net) | 76% | 88% | 60% | 10–50 ms |
| Diffusion Policy (Transformer) | 82% | 91% | 68% | 100–300 ms |
| ACT + temporal ensemble | 83% | 94% | 70% | 20–40 ms |
ALOHA의 양동력 조작 기준에 대한 원래 ACT 논문 (Zhao et al., 2023) 및 Chi et al. (2023) 에서 얻은 결과. 작업, 데이터 품질 및 하드웨어에 따라 결과가 달라질 것입니다.
알고리즘이 당신의 작업과 데이터 상황에 맞게 되는 권고 사항은 RCSV 교육 플랫폼 또는 기본 모델 조사 를 참조하십시오.
작업 유형별 추천
| Task Type | Recommended Algorithm | Chunk Size | Notes |
|---|---|---|---|
| Simple pick-and-place | BC or ACT | N/A or H=50 | BC sufficient if single strategy |
| 정밀도 insertion | ACT or Diffusion-T | H=100 | Multi-modality in approach angle |
| Bimanual coordination | ACT | H=100–200 | Joint state space required |
| Long-horizon (>30s) | Hierarchical (VLM + ACT) | H=50–100 per subtask | Subtask decomposition required |
| Deformable objects | Diffusion Policy | H=32–64 | Diffusion handles uncertainty better |
| High-speed (>5 Hz query) | BC or U-Net Diffusion | H=8–16 | Transformer diffusion too slow |
RCSV 플랫폼에서 정책 을 훈련 시키십시오
RCSV 훈련 플랫폼은 자동 하이퍼파라미터 검색으로 BC, ACT, 전파 정책 및 OpenVLA 정렬을 지원합니다. 데이터 세트를 연결하고 몇 분 안에 훈련 실행을 시작합니다.
[플랫폼을 탐험해 보세요]







