Research(으)로 돌아가기

행동 <unk>킹 과 전체 궤도 모방: 실용적 인 비교

액션 <unk>킹 (ACT) 을 사용해야 할 때 vs. 전체 궤도 행동 클론링.

[← 연구]

행동 덩어리와 전체 궤도를 예측할 때 이해 그리고 선택이 로봇 성능, 훈련 비용 및 배포 지연에 어떻게 영향을 미치는지 이해

순진 한 행동 의 복제 문제

표준 행동 복제 (BC) 는 현재 관찰을 고려하여 다음 행동을 예측하기 위해 정책 π a 을 훈련시킵니다. 이것은 짧고 낮은 변동성 작업에 잘 작동하지만 작업 복잡성이 증가함에 따라 두 가지 중요한 방식으로 분해됩니다.

첫째, ** 합성 오류**: 작은 예측 오류는 로봇을 약간 익숙하지 않은 상태로 이동시켜 더 큰 오류를 유발하여 작업을 완료하기 전에 더 큰 재앙의 실패로 이어집니다. 이것은 고전적인 DAgger 문제입니다. 실제적으로, 테이블 위에 있는 작업에 대한 BC 정책은 종종 80%의 성공률을 훈련 배포 기간 동안 (유통에 유지되는) 하지만 같은 작업에 배치되는 경우 40%~50%의 실패를 나타냅니다.

둘째, ** 모드 평균**: 같은 작업에 대해 여러 가지 유효한 전략이 존재할 때 (예를 들어, 왼쪽 또는 오른쪽에서 객체를 잡는 경우), 유모드 BC 정책은 시범을 평균하여 어느 전략도 성공적으로 실행하지 않는 중간 궤도를 생성합니다.

행동 덩어리 는 무엇 입니까?

ACT 논문 (Zhao et al., 2023) 에서 소개된 액션 킹은 현재 관찰에서 H의 미래의 행동을 예측함으로써 컴포넌트 오류를 해결하고, 정책에 다시 문의하기 전에 첫 번째 k 행동을 실행합니다.

정책 π(a_{t:t+H} s_t) 는 한 번에 H 동작의 일부를 내보내기 위해 사용된다. H=100의 50 Hz 제어로, 하나의 질의는 2 초의 움직임을 커버합니다. 핵심 통찰은: 정책은 단 한 단계보다는 짧은 지평 계획을 예측함으로써, 시간적 맥락을 활용하여 일관된 전략을 수행하고 평균 문제를 피합니다.

  • 부작 크기는 H: 단일 쿼리에서 예측되는 미래의 시간 단계의 수. 50 Hz에서 테이블탑 조작을 위해, H=100 (2초) 는 표준 ACT 구성입니다. 더 큰 H는 작업의 더 많은 부분을 다루지만 정책에 예상치 못한 상태에 반응할 수있는 기회를 줄입니다.
  • ** 재계획 주파수 k:** 정책에 다시 문의하기 전에 실행된 동작의 수. ACT에서 k=H/4에서 H (재계획 없이 전체 부분 실행)
  • CVAE 코더: ACT는 조건형 변동자동식 코더를 사용하여 전체 시범의 스타일/모드를 코딩하여 정책이 평균보다는 하나의 전략에 헌신하도록 허용합니다. 이것은 다 모달 시범을 처리하는 주요 메커니즘입니다.

퍼포먼스 정책: 디네이징을 통해 쪼개

퍼포션 정책 (Chi et al., 2023) 은 다른 메커니즘을 통해 유사한 다 모다리티 처리 기능을 달성합니다. 행동 분포를 행동의 일부에 대한 퍼포션 프로세스로 모델링합니다. 정책은 현재 관찰에 따라 조건화된 잡음적인 행동 순서를 일컫습니다.

  • U-Net 전파: convolutional U-Net는 액션 덩어리를 뜻한다. 변환기 기반 전파보다 더 빠른 추론 (GPU에서 ~ 1050 ms) 이다. 구조화되고 반복적인 동작을 하는 작업에 선호된다.
  • ** 변환기 전파:** 액션 시퀀스에서 장거리 의존성을 캡처하는 데 더 잘합니다. 느리죠 (~ 100~300 ms). 복잡한 쌍방향 또는 다단계 작업에 더 적합합니다.
  • ** 전형적인 조각 크기는:** H=816 10 Hz 제어 정책; H=3264 50 Hz 정책. 방급 정책은 기본적으로 모든 조각을 재계획합니다.

작업 지평 분석

올바른 조각 크기와 재계획 빈도는 작업 지평에 크게 달려 있습니다.

  • ** 단시간 작업 (<3초):** 간단한 선택 및 장소, 컵 스택. BC는 종종 적절하게 작동합니다. ACT를 사용하면 H=50100 50 Hz에서 전체 작업을 하나 또는 두 개의 쿼리에 포함합니다. H=1632의 방산도 효과적입니다.
  • ** 중간 지평선 작업 (315초):** 삽입, 케이블 라우팅, 음식 집합. 이것은 ACT의 달콤한 점입니다. H=100는 2초를 차지합니다. 2550 단계 (0.51초) 마다 재계획하면 정책이 반응합니다. 시간적 집합이 권장됩니다.
  • 장시간 작업 (>30초): 전체 요리의 작업 흐름, 다중 드래프트 집합, 방 조직. 단일 레벨 쪼개는 여기서 실패합니다. 쪼개는 전체 작업을 다루지 못하지만, 긴 쪼개는 반응성을 잃습니다. 계층적 접근 방식 (고급 작업 계획 + 낮은 수준의 쪼개 εκτε는) 는 필요합니다. RT-2 또는 OpenVLA와 같은 VLM는 높은 수준의 작업 분해를 처리하고, ACT 또는 디푸지션은 낮은 수준의 실행을 처리합니다.

교육 데이터 요구 사항

킹은 미묘한 방법으로 데이터 요구사항을 변경합니다.

  • ** 시간적 일관성 요구 사항:** 행동 쪼개는 시범에서의 연속적인 시간 단계가 일관된 계획의 일부라는 가정이다. 시범 내에서 의박, 수정 및 후퇴는 쪼개기 예측자를 혼란스럽게 한다. 잡음적인 작업에 있어서, 행동 쪼개는 동일한 성능을 달성하기 위해 BC보다 약 2배 더 많은 데이터가 필요하므로, 더 큰 비중의 디모가 높은 품질이어야 한다.
  • ** 다 모달 커버리지:** ACT CVAE는 깨끗한 잠복 모드를 배우기 위해 각 전략의 적어도 2030의 시범이 필요합니다. 만약 당신의 작업이 유효한 3 가지 전략을 가지고 있다면, 일반적인 정책 품질을 하기 전에 모드 커버리지를 위해 6090의 시범이 필요합니다.
  • ** 에피소드 길이의 정상화:** 변수 길이의 에피소드는 고정된 조각 예측에 도전을 야기합니다. 표준 길이로 포장 에피소드를 고려하거나 훈련 중에 조각 마스크를 사용하십시오.

성능 기준

Algorithm ALOHA Insertion ALOHA Transfer Cube ALOHA Slot Battery Inference 지연시간
행동 복제 45% 62% 30% 2–5 ms
ACT (H=100) 80% 92% 65% 15–30 ms
Diffusion Policy (U-Net) 76% 88% 60% 10–50 ms
Diffusion Policy (Transformer) 82% 91% 68% 100–300 ms
ACT + temporal ensemble 83% 94% 70% 20–40 ms

ALOHA의 양동력 조작 기준에 대한 원래 ACT 논문 (Zhao et al., 2023) 및 Chi et al. (2023) 에서 얻은 결과. 작업, 데이터 품질 및 하드웨어에 따라 결과가 달라질 것입니다.

알고리즘이 당신의 작업과 데이터 상황에 맞게 되는 권고 사항은 RCSV 교육 플랫폼 또는 기본 모델 조사 를 참조하십시오.

작업 유형별 추천

Task Type Recommended Algorithm Chunk Size Notes
Simple pick-and-place BC or ACT N/A or H=50 BC sufficient if single strategy
정밀도 insertion ACT or Diffusion-T H=100 Multi-modality in approach angle
Bimanual coordination ACT H=100–200 Joint state space required
Long-horizon (>30s) Hierarchical (VLM + ACT) H=50–100 per subtask Subtask decomposition required
Deformable objects Diffusion Policy H=32–64 Diffusion handles uncertainty better
High-speed (>5 Hz query) BC or U-Net Diffusion H=8–16 Transformer diffusion too slow

RCSV 플랫폼에서 정책 을 훈련 시키십시오

RCSV 훈련 플랫폼은 자동 하이퍼파라미터 검색으로 BC, ACT, 전파 정책 및 OpenVLA 정렬을 지원합니다. 데이터 세트를 연결하고 몇 분 안에 훈련 실행을 시작합니다.

[플랫폼을 탐험해 보세요]