Learn(으)로 돌아가기

로봇 학습에서의 궤도 표현: 공동 공간, 작업 공간, 델타

로봇 궤도가 학습 알고리즘에서 저장되고 표현되는 방법 <unk> 합동 각, 카르테시아적 자세, 델타 동작 및 상대적 표현.

[← 배우기]

로봇 궤도를 표현하는 방식은 정책이 무엇을 배울 수 있는지 그리고 얼마나 잘 일반화하는지 결정합니다.

로봇 궤도 는 무엇 입니까?

로봇 궤도는 로봇 동작의 한 에피소드 동안 기록된 상태와 동작의 순서이다. 형식적으로: T0, T1는 시간 단계에서의 전체 센서 관측입니다.

교육에 있어서, 정책이 재현하는 것을 배워야 할 행동 순서입니다. 그러나 "행동"은 단일 보편적인 형식이 아닙니다.

공동 우주 대표

가장 직접적인 표현: 동작 T4은 절대 관절 각의 T5의 벡터입니다. 로봇 컨트롤러는 관절 각의 목표를 수신하고 각 관절을 명령된 위치에로 몰고 있습니다.

  • ** 장점:** IK가 필요하지 않습니다. 각은 직접 모터 컨트롤러로 이동합니다. 결정적: 동일한 동작은 항상 동일한 공동 구성을 생성합니다. 빠른 실행 중간 계산이 없습니다.
  • ** 단점:** 팔 특수한. 6DOF 팔에 훈련된 정책은 같은 작업에 대해서도 재훈련 없이 7DOF 팔에 이전할 수 없습니다. 직관적이지 않습니다. 각 값은 의미있는 작업 개념에 해당하지 않습니다.
  • ** 표준 사용:** ALOHA와 ACT는 절대적인 공동 공간을 주요 행동 표현으로 사용합니다. 고정된 작업 공간, 단일 팔 작업에서는 잘 작동합니다.

카르테시아 작업 공간

T6의 동작은 원하는 최종 효과자 자세를 나타냅니다. T7 는 세 개의 위치 구성 요소와 방향성 위한 사각형입니다.

  • ** 장점:** 직관적 액션은 최종 효과자 위치를 직접적으로 명시한다. 서로 다른 공동 구성이 있지만 유사한 작업 공간의 로봇들 사이에서 더 전송가능하다.
  • ** 단점:** IK가 공동 명령으로 변환하는 것을 요구합니다 지연 및 독자성 위험을 추가합니다. 회전 표현은 복잡합니다. 유일러 각은 기말 로크 (이를 피하십시오), 사각형은 콤팩트하지만 독특하지 않습니다 (SO(3) 의 두 배 덮개).
  • ** 회전 표현 참고:** 항상 코드에서 사각형 (유러 각이 아닌) 를 사용하십시오. 신경 네트워크 출력에서 6D 회전 표현을 고려하십시오.

델타 활동

절대적인 목표 대신, 델타 액션은 현재 상태에서 _변화를 지정합니다: T8 (관절 각의 변화) 또는 T9 (카르테시아 자세의 변화).

  • **Delta가 배우는 것이 왜 더 쉬워지는지:**Delta의 동작의 크기는 작고 궤도 전체에 약적으로 일정하다. 네트워크는 작업 공간 위치에 따라 달라지는 큰 절대 좌표보다 작은, 제한된 값을 더 쉽게 예측하는 것을 배우게 됩니다.
  • 간접적인 안전: 최대 규모로 델타 동작을 절단하면 로봇의 속도
  • ** 표준 사용:** 방산 정책, RT-1, Octo, 그리고 대부분의 VLA 모델은 카르테시아 델타 동작을 주요 동작 공간으로 사용합니다.

절대적 대 객체 관련 표현

근본적인 일반화 질문: 로봇의 작업 공간 프레임에서 행동들이 표현되어야 하는가, 아니면 조작되는 객체에 관계되어야 하는가?

  • ** 절대 (워크스페이스 프레임):** 작업 값은 작업 공간에서 객체가 어디에 있는지에 따라 달라집니다. 테이블이 10cm로 이동되면 정책이 실패합니다. 고정된 설정에 적합하지만 배포 일반화에 좋지 않습니다.
  • ** 객체 관계:** 동작은 감지된 객체 포즈에서 오프셋으로 표현된다. 정책은 " 객체보다 5cm 높게 잡을 수 있다"는 것을 " (0.3, -0.1, 0.15) 으로 이동한다"는 대신 학습한다.

궤도 길기와

작업 기간은 다양합니다. 간단한 포착은 2초 (100단계 50Hz에서) 소요될 수 있고, 다단계 조립은 30초 (1500단계) 소요될 수 있습니다. 이것은 대량 훈련에 실질적인 도전을 만듭니다.

  • ** 이 있는 고정 길이는:** 특별한 "no-op" 액션 토큰을 사용하여 최대 길이를 가진 짧은 에피소드를 이십시오. 트랜스포머 기반 정책에서 주의를 마스크하는 것을 사용하여 네트워크는 이있는 토큰을 무시합니다. 구현하기 쉽습니다.
  • ** 마스크링으로 변하는 길이:** 각 에피소드를 자연 길이에 처리한다. 신중한 배팅이 필요하다 (연형 길이를 그룹 또는 동적 을 사용한다).
  • ** 액션 덩어리:** ACT 스타일: 궤도를 고정 길이의 덩어리 (예를 들어, 100 단계) 로 분할하고 덩어리들에 독립적으로 훈련합니다. 고정 크기의 모델 입력을 유지하면서 자연스럽게 변하는 에피소드 길이를 처리합니다.

대표성 비교

Representation Intuitive Generalizable IK Needed Used In
Absolute joint angles No Low No ALOHA, ACT, RoboAgent
Absolute Cartesian pose Yes Moderate Yes Classic manipulation research
Cartesian delta actions Yes High Yes (incremental) Diffusion Policy, RT-1, Octo
Object-relative Cartesian Yes Very High Yes Generalizable grasping research
웨이포인트 sequences Yes High Yes Long-horizon task planning

궤도 표현은 로봇 학습 시스템에서 가장 영향력 있는 설계 결정 중 하나입니다. 대규모 데이터 수집에 투자하기 전에 이 선택에 시간을 투자하십시오.