로봇 학습에서의 궤도 표현: 공동 공간, 작업 공간, 델타
로봇 궤도가 학습 알고리즘에서 저장되고 표현되는 방법 <unk> 합동 각, 카르테시아적 자세, 델타 동작 및 상대적 표현.
[← 배우기]
로봇 궤도를 표현하는 방식은 정책이 무엇을 배울 수 있는지 그리고 얼마나 잘 일반화하는지 결정합니다.
로봇 궤도 는 무엇 입니까?
로봇 궤도는 로봇 동작의 한 에피소드 동안 기록된 상태와 동작의 순서이다. 형식적으로:
교육에 있어서, 정책이 재현하는 것을 배워야 할 행동 순서입니다. 그러나 "행동"은 단일 보편적인 형식이 아닙니다.
공동 우주 대표
가장 직접적인 표현: 동작
- ** 장점:** IK가 필요하지 않습니다.
각은 직접 모터 컨트롤러로 이동합니다. 결정적: 동일한 동작은 항상 동일한 공동 구성을 생성합니다. 빠른 실행 중간 계산이 없습니다. - ** 단점:** 팔 특수한. 6DOF 팔에 훈련된 정책은 같은 작업에 대해서도 재훈련 없이 7DOF 팔에 이전할 수 없습니다. 직관적이지 않습니다. 각 값은 의미있는 작업 개념에 해당하지 않습니다.
- ** 표준 사용:** ALOHA와 ACT는 절대적인 공동 공간을 주요 행동 표현으로 사용합니다. 고정된 작업 공간, 단일 팔 작업에서는 잘 작동합니다.
카르테시아 작업 공간
- ** 장점:** 직관적
액션은 최종 효과자 위치를 직접적으로 명시한다. 서로 다른 공동 구성이 있지만 유사한 작업 공간의 로봇들 사이에서 더 전송가능하다. - ** 단점:** IK가 공동 명령으로 변환하는 것을 요구합니다
지연 및 독자성 위험을 추가합니다. 회전 표현은 복잡합니다. 유일러 각은 기말 로크 (이를 피하십시오), 사각형은 콤팩트하지만 독특하지 않습니다 (SO(3) 의 두 배 덮개). - ** 회전 표현 참고:** 항상 코드에서 사각형 (유러 각이 아닌) 를 사용하십시오. 신경 네트워크 출력에서 6D 회전 표현을 고려하십시오.
델타 활동
절대적인 목표 대신, 델타 액션은 현재 상태에서 _변화를 지정합니다:
- **Delta가 배우는 것이 왜 더 쉬워지는지:**Delta의 동작의 크기는 작고 궤도 전체에 약적으로 일정하다. 네트워크는 작업 공간 위치에 따라 달라지는 큰 절대 좌표보다 작은, 제한된 값을 더 쉽게 예측하는 것을 배우게 됩니다.
- 간접적인 안전: 최대 규모로 델타 동작을 절단하면 로봇의 속도
- ** 표준 사용:** 방산 정책, RT-1, Octo, 그리고 대부분의 VLA 모델은 카르테시아 델타 동작을 주요 동작 공간으로 사용합니다.
절대적 대 객체 관련 표현
근본적인 일반화 질문: 로봇의 작업 공간 프레임에서 행동들이 표현되어야 하는가, 아니면 조작되는 객체에 관계되어야 하는가?
- ** 절대 (워크스페이스 프레임):** 작업 값은 작업 공간에서 객체가 어디에 있는지에 따라 달라집니다. 테이블이 10cm로 이동되면 정책이 실패합니다. 고정된 설정에 적합하지만 배포 일반화에 좋지 않습니다.
- ** 객체 관계:** 동작은 감지된 객체 포즈에서 오프셋으로 표현된다. 정책은 " 객체보다 5cm 높게 잡을 수 있다"는 것을 " (0.3, -0.1, 0.15) 으로 이동한다"는 대신 학습한다.
궤도 길기와
작업 기간은 다양합니다. 간단한 포착은 2초 (100단계 50Hz에서) 소요될 수 있고, 다단계 조립은 30초 (1500단계) 소요될 수 있습니다. 이것은 대량 훈련에 실질적인 도전을 만듭니다.
- **
이 있는 고정 길이는:** 특별한 "no-op" 액션 토큰을 사용하여 최대 길이를 가진 짧은 에피소드를 이십시오. 트랜스포머 기반 정책에서 주의를 마스크하는 것을 사용하여 네트워크는 이있는 토큰을 무시합니다. 구현하기 쉽습니다. - ** 마스크링으로 변하는 길이:** 각 에피소드를 자연 길이에 처리한다. 신중한 배팅이 필요하다 (연형 길이를 그룹 또는 동적
을 사용한다). - ** 액션 덩어리:** ACT 스타일: 궤도를 고정 길이의 덩어리 (예를 들어, 100 단계) 로 분할하고 덩어리들에 독립적으로 훈련합니다. 고정 크기의 모델 입력을 유지하면서 자연스럽게 변하는 에피소드 길이를 처리합니다.
대표성 비교
| Representation | Intuitive | Generalizable | IK Needed | Used In |
|---|---|---|---|---|
| Absolute joint angles | No | Low | No | ALOHA, ACT, RoboAgent |
| Absolute Cartesian pose | Yes | Moderate | Yes | Classic manipulation research |
| Cartesian delta actions | Yes | High | Yes (incremental) | Diffusion Policy, RT-1, Octo |
| Object-relative Cartesian | Yes | Very High | Yes | Generalizable grasping research |
| 웨이포인트 sequences | Yes | High | Yes | Long-horizon task planning |
궤도 표현은 로봇 학습 시스템에서 가장 영향력 있는 설계 결정 중 하나입니다. 대규모 데이터 수집에 투자하기 전에 이 선택에 시간을 투자하십시오.







