Learn(으)로 돌아가기

로봇 학습 방언자리: 60개의 핵심 용어

로봇 학습, 텔레오퍼레이션, 조작 용어 <unk>의 종합적인 글자사, 행동 복제에서 VLA까지, 연습생에게 명확하게 정의되어 있습니다.

[← 배우기]

로봇 전문의들을 위한 모방 학습, 정책 구조, 데이터 수집, 하드웨어 및 평가 용어를 포함하는 참조 글자리.

이 가사서는 로봇 학습, 원격 조작, 조작에 사용되는 여섯 가지 범주에서 사용되는 60 가지 주요 용어를 다루고 있습니다. 각 정의는 연습생들을 위해 작성되어 있습니다.

모방 학습 용어

  • 행동 복제 (BC): 가장 간단한 모방 학습 알고리즘은 감독된 모델을 훈련시켜 주어진 상태에서 전문가의 행동을 예측하여 회귀 문제로 취급합니다.
  • DAgger (데이터셋 집합): 전문가가 학습된 정책의 행동을 정책이 실제로 방문하는 국가들에서 수정함으로써 분배 전환을 수정하는 반복적인 IL 알고리즘.
  • 행동 킹: 각 단계에 한 가지행동이 아닌 K 연속적인 미래의 행동을 한 번에 예측하는 것. ACT (K=100) 에서 사용된다. _ 예제: 정책은 2 초의 미래의 팔 동작을 한 번에 내보내고, 다시 계획합니다.
  • ** 분포 변화:** 훈련 (시험) 도중 관찰된 상태 분포와 시험 시간에 방문한 분포 사이의 불합동성 (robot execution).
  • 차원 Shift: 입력 분포 ( 상태) 가 변화하지만 조건부 출력 분포 (수행이 주어진 상태) 가 변하지 않는 특정 유형의 분포 전환.
  • 공합 오류: 작은 단계별 예측 오류가 시간 내에 기하학적으로 축적되어, 지평선 T에 O (T2ε) 와 단계별 오류 ε로 증가하는 현상. _ 예제: 단계별 오류 0.5%는 50 단계 후에 25%의 누적 오류를 발생시킨다._
  • 다 모다리티: 여러 개의 다른 동작이 같은 상태에서 유효한 시범 데이터 세트의 특성. _ 예제: 빨간 블록은 왼쪽 또는 오른쪽에서 잡을 수 있습니다 둘 다 정확하지만 단일 모드 모델은 그들을 나쁜 중간 잡음으로 평균합니다._
  • 방면: 로봇이 배워야 할 작업을 수행하는 인간 전문가의 단 하나의 기록된 사례.
  • ** 에피소드:** 모든 센서 데이터를 포함해 처음부터 끝까지 작업을 한 번 완료하는 시도. 성공하거나 실패할 수 있습니다.
  • 공개: 학습된 정책 (인간이 아닌) 에 의해 생성된 에피소드. 평가 및 때로는 추가적인 훈련 데이터를 수집하는 데 사용됩니다.

정책 구조 조건

  • ** 트랜스포머 정책:** 트랜스포머 신경 네트워크로 구현된 정책 시간단계 또는 이미지 패치 간 공간적 의존성을 모델링하는 데 자ശ്രദ്ധ을 이용한다. _ 예제: ACT는 시각적 관찰에 의해 조건화된 액션 순서를 생성하기 위해 트랜스포머 디코더를 사용합니다._
  • CVAE (Conditional Variational 오토인코더): 관찰된 변수에 따라 유연한 분포를 학습하는 생성 모델. ACT에서 시범의 다 모다성을 스타일 변수에 암호화하는 데 사용됩니다. _ 예제: ACT의 CVAE 코더는 전체 액션 순서를 유연한 코드 z로 압축하여 디코더가 일관된 액션 조각을 생성 할 수 있습니다._
  • 방산 정책: 방산 과정을 나타내는 행동 분포를 모델링하는 정책 반복적으로 방산 과정을 나타내는 우연한 잡음으로 관찰에 따라 조건화된 유연한 행동 궤도로의 변화를 나타냅니다. _ 예제: Chi et al. 2023는 여러 가지 유효한 포착을 동시에 표현함으로써 방산 정책이 다 모달 작업에서 BC를 능가한다는 것을 입증했습니다._
  • ** 에너지 기반 모델 (EBM):** 각 ( 상태, 행동) 쌍에 스케라어 "에너지"를 부여하는 모델; 추론은 행동을 최소화하는 에너지를 찾습니다.
  • ** 흐름 일치:** 간단한 분포에서 복잡한 목표 분포로 샘플을 이동시키는 것을 배우는 생성 모델링 기술.
  • 예측 지평: 정책에서 한 번에 예측되는 미래 시간 단계의 수. 더 긴 지평은 더 부드럽고 더 조정된 움직임을 가능하게 하지만 더 정확한 모델을 필요로 한다.
  • ** 쪼개리 크기는:** 한 예측 쪼개리에서 행동 단계의 수가 (ACT형 정책에서 예측 지평과 동일합니다). _ 예제: ACT는 50 Hz에서 쪼개리 크기를 K=100으로 사용합니다. 따라서 팔은 동시에 2 초의 움직임을 계획합니다._
  • ** 액션 헤드:** 정책 네트워크의 출력 모듈이, 숨겨진 특징을 액션 값으로 매핑합니다.

데이터 및 수집 조건

  • ** 텔레오퍼레이션:** 로봇의 원격 인터페이스에서 인간 제어 조작, 일반적으로 시범 데이터를 수집하는 데 사용됩니다.
  • 키네스틱 교육: 작업을 보여주기 위해 운영자가 로봇 팔을 물리적으로 잡고 움직인 데이터 수집 방법 (중력 보완, 뒤로 운전 가능한 모드)
  • ** 리더- 팔로워:** 운영자가 가벼운 복제 팔 (리더) 를 움직이고 로봇 팔 (리더) 은 실시간으로 움직임을 반영하는 텔레오페레이션 아키텍처.
  • HDF5 (하이러직 데이터 포맷 5): 쪼개져 압축된 배열으로 큰 수학적 데이터 세트를 저장하는 바이너리 파일 형식. 로봇 에피소드 데이터의 표준 저장 형식. _ 예제: /이미즈, /joint_states, /action, /metadata를 포함하는 에피소드 당 한 HDF5 파일._
  • RLDS (Reinforcement Learning Datasets): 로봇 학습 데이터, 에피소드 및 단계 구조 표준화를 위한 TensorFlow 데이터셋 기반 형식. Octo, Open X-Embodiment에서 사용된다.
  • LeRobot: 거페이스 기반의 로봇 학습 프레임워크 및 데이터 세트 형식, 파킷 파일 및 표준화된 스키마를 이용합니다. _ 예제: 커뮤니티와 공유하기 위해 데이터 세트를 LeRobot 형식으로 HuggingFace Hub에 게시합니다._
  • 데이터 증강: 정책 일반화를 개선하기 위해 훈련 데이터에 무작위 변환을 적용합니다.
  • ** 성공률:** 정책이 업무를 성공적으로 수행하는 평가 배포의 분자. 조작 정책의 주요 평가 측정. _ 예제: 18/20 성공률 = 90% 성공률._
  • ** 거절률:** 품질 필터링 과정에서 폐기된 수집된 에피소드의 분수는.
  • ** 에피소드 길이는:** 한 에피소드의 길이는 (시간 단계 또는 초)

로봇 하드웨어 용어

  • DOF (자유의 정도): 로봇 팔의 독립적인 운동 축의 수. 6 DOF는 임의의 최종 효과자 포즈의 최소입니다. 7 DOF는 과잉을 추가합니다.
  • 용무: 로봇 팔이 최종 효과자에서 운반할 수 있는 최대 질량은, 명칭 성능을 유지하면서.
  • ** 도달 거리:** 최종 효과자에서 로봇 기하에서 달성할 수 있는 최대 반경. 연결 길이의 합으로 결정된다.
  • ** 반복가능성:** 반복된 시도에서 팔이 동일한 명령 위치로 돌아오는 정확성, ±X mm로 측정된다.
  • 엔드 이펙터: 로봇 팔 끝에 설치된 장치가 물체와 상호작용한다 "손". _ 예제: 평행 턱잡기, 빨아주기 컵 매리 또는 다발기 능숙한 손._
  • 잡기: 기력을 적용하여 물건을 잡는 특정 유형의 최종 효과. 평행 턱잡기 는 픽 앤 팟에서 가장 흔하다. _ 예제: Robotiq 2F-85는 85mm로 열리고 최대 235N의 힘으로 닫는다._
  • ** 힘/토르크 (F/T) 센서:** 최종 효과자에서 손목의 6축 센서 (Fx, Fy, Fz) 와 동력을 측정하는.
  • 터틸 센서: 손가락 끝 수준에서 분산 접촉 압력 또는 기하학을 측정하는 센서. _ 예제: GelSight는 손가락 접촉 기하학의 고해상도 이미지를 생성하여 슬립 감지 및 잡기 품질 평가를 가능하게 합니다._
  • 공동코더: 로봇공동의 각을 측정하는 센서. 절대코더는 로밍 없이 실제 각을 보고한다.
  • 서보: 로봇 분야에서, 위치, 속도 또는 토크 명령을 받아들이는 자립 모터+코더+컨트롤러 단위.

학습 패러다임

  • 강력 학습 (RL): 에이전트가 행동을 취하고 스칼라 보상 신호를 받아 학습하는 학습 패러다임
  • RL: 사전 수집된 경험의 고정된 데이터 세트에서 RL를 제거하고, 추가 환경 상호작용을 하지 않습니다.
  • ** 온라인 RL:** 활발한 환경 상호작용을 가진 RL 정책은 새로운 데이터를 수집하고 즉시 학습합니다.
  • **시뮬레이션에서 실제를 위한 정책 훈련 및 실제 로봇에 적용. 핵심 과제는 "실상성 격차"입니다.
  • ** 도메인 무작위화:** 시뮬레이션 매개 변수 (토부, 조명, 질량, 질감) 를 무작위화 하는 시뮬레이션 기술, 따라서 정책은 이러한 변동에 견고하게 학습한다. _ 예제: 훈련 중에 0.30.9 사이의 무작위적으로 변하는 테이블 마찰, 따라서 정책은 알려지지 않은 마찰을 가진 실제 테이블에서 작동한다._
  • 기본 모델: 특정 작업에 정비될 수 있는 광범위한 데이터 (인터넷 규모 또는 크로스 로봇 데이터 세트) 에 미리 훈련된 대규모 신경 네트워크.
  • VLA (Vision-Language-Action Model): 시각적 관찰과 자연어 지침을 입력 및 로봇 동작으로 내리는 모델.
  • ** 정비:** 작은 작업별 데이터 세트에서 계속적인 훈련을 통해 미리 훈련된 모델을 새로운 작업 또는 환경에 적응시키는 것.
  • 제로샷: 어떤 작업에 대한 훈련 없이 새로운 작업이나 환경에 훈련된 모델을 적용하는 것. _ 예제: 많은 작업에 대한 훈련받은 VLA는 훈련 중에 특정 지침을 본 적이 없이 새로운 명령에 성공합니다.
  • Few-Shot: 작은 숫자의 예제를 이용해서 새로운 작업에 적응하는 것 (일반적으로 120).

평가 조건

  • ** 성공률:** 정책이 업무를 완료하는 평가 실험의 분자. 표준 기본 측정. _ 예제: 16/20 = 실제 로봇 평가 실험 20개에서 80%의 성공률._
  • ** 배급 밖 (OOD):** 훈련 배급과는 다른 입력 훈련 중에 볼 수 없는 새로운 물체 색상, 위치 또는 환경.
  • ** 일반화 격차:** 분배 및 분배 밖의 성공률의 차이. 큰 격차는 훈련 조건에 과도하게 적합함을 나타냅니다.
  • ** 벤치마크:** 알고리즘을 공정하게 비교하기 위한 표준화된 작업, 객체 및 평가 프로토콜 집합.
  • 현실적 평가: 물리적인 로봇에 대한 정책 평가 (시뮬레이션이 아닙니다). 금 표준으로 간주됩니다. 시뮬레이션 매트릭은 종종 전송되지 않습니다.
  • Ablation Study: 시스템의 한 구성요소를 제거하거나 수정하여 그 기여를 측정하는 실험.
  • Held-Out Set: 훈련과 완전히 분리되어 최종 평가에만 사용되는 데이터 하위 집합. 평가 매트릭이 과잉 부풀어지지 않도록 보장합니다.

이 글자재에서 어떤 개념에 대한 완전한 설명은 [RCSV 글자재]T2) 를 검색하거나 위의 로봇 도서관 문서를 탐구하십시오. 이 참조는 이 분야에서 새로운 기술이 등장함에 따라 업데이트됩니다.