로봇 조작 에 대한 소개: 핵심 개념 과 시작
로봇 조작에 대한 초보 가이드 <unk> 로봇이 물체를 잡고 움직일 수 있는 의미, 핵심 하드웨어, 그리고 로봇이 어떻게 배우는지
[← 배우기]
로봇의 무기, 최종 효과자, 자유의 정도, 그리고 현대 조작 시스템을 작동시키는 학습 접근법을 이해하십시오.
로봇 조작 은 무엇 입니까?
로봇 조작은 로봇 시스템의 환경의 물체와 물리적으로 상호작용하는 능력이다. 이동 (이 장소에서 장소로 이동하는 것과 달리), 조작은 팔 또는 유사한 메커니즘을 사용하여 ** 잡기, 이동, 조립, 분류, 삽입,** 또는 다른 방법으로 세계의 물체의 상태를 변경하는 데 초점을 맞추고 있습니다.
가정의 예 는 커피 컵 을 카운터 에서 가져다가 시프 로 붓고 내려 놓는 것 은 조작 과제 이다. 산업적 예 는 회로 보드 구성 요소 를 0,1mm 정확 으로 배치 하거나 무게 로 패키지를 배열 하는 것 이다. 두 경우 모두 로봇은 세상을 인식하고 움직임을 계획하고 신체적 접촉을 잘 수행해야 합니다
조작은 탐색과 다르는데, 그것은 _연결력_을 포함하고 있기 때문입니다. 물체를 만지는 것은 인식만으로는 예측할 수 없는 방식으로 세계의 상태를 변화시킵니다. 이것이 바로 조작이 로봇 분야에서 가장 도전적인 영역 중 하나로 간주되는 이유입니다.
하드웨어 구성 요소
조작 시스템은 일반적으로 네 가지 주요 하드웨어 요소를 가지고 있습니다.
- ** 로봇 팔:** 모터리 결합으로 연결된 딱딱한 연결망. 각 결합은 한 정도 자유를 추가한다. 팔 구조는 로봇이 얼마나 멀리 도달할 수 있고 얼마나 많은 무게를 (용무) 를 수반할 수 있는지 결정한다. 공동 협력 팔 (코봇) 의 용무는 3kg에서 20kg까지 다양하다.
- ** 최종 효과:** 물체와 접촉하는 팔 끝의 "손"이. 가장 일반적인 유형은 동립 턱잡기 (개발 및 닫는 두 손가락), 흡수 컵 (백백기로 기반, 평면 표면을 위해 빠르다) 및 dexterous hand (복합적인 손 조작을 위해 여러 손가락) 이다. 선택은 전적으로 작업에 달려 있습니다.
- ** 센서:** RGB 카메라는 시각적 인식을 제공합니다. 깊이 카메라는 기하학을 추가합니다. 손목에 설치된 힘/토크 (F/T) 센서는 손목에 설치된 힘/토크 (F/T) 센서가
안전 접촉 및 잡을 수 있는 필수적인 힘과 동력을 측정합니다. - ** 컨트롤러:** 센서 데이터를 읽고 모터 명령을 보내는 실시간 제어 루프를 실행하는 컴퓨터. 현대 코봇은 ROS2 또는 독자적인 SDK를 통해 이것을 노출합니다.
주요 개념: DOF, 작업 공간 및 반복성
세 숫자는 로봇 팔의 능력을 요약합니다.
- ** 자유의 정도 (DOF):** 독립된 관절 축의 수. 3D 공간에서 임의의 위치와 지향을 달성하기 위해 최소 6 DOF가 필요합니다. 7-DOF 팔은 불필요한 관절을 추가하여 로봇에게 장애물이나 특색을 피하기 위한 유연성을 제공합니다.
- ** 작업 공간:** 최종 효과자 가 물리적으로 도달 할 수 있는 3D 볼륨. 작업 공간 은 링크 길기와 관절 각 제한에 의해 결정된다. 대부분의 코봇 은 전체 팔 길이를 가진 반경적 작업 공간 을 가지고 있다. 접근 가능한 작업 공간 은 ≠ 유능한 작업 공간 (모든 방향성 이 가능한 곳) 이다.
- ** 반복 가능성:** 반복된 명령에 따라 팔이 동일한 합동 구성으로 얼마나 정확하게 돌아갑니다. 산업 팔은 ±0.02mm, 코봇은 일반적으로 ±0.05mm를 달성합니다. 반복 가능성은 절대 정확성과 동일하지 않습니다 (외적으로 지정된 지점을 타는 것), 이는 캘리브레이션 없이 보장하기가 더 어렵습니다.
로봇 이 조작 을 어떻게 배우는가
로봇 을 객체 를 강력 히 조작 할 수 있게 가르치는 것 은 개방적 인 연구 문제 이다. 오늘날 에는 크게 세 가지 접근 방법 이 사용 되고 있다.
- ** 텔레오퍼레이션 (디모네스트레이션 수집):** 모든 센서 데이터가 기록되는 동안 인간 운영자는 로봇을 제어하여 작업을 수행합니다. 로봇은 아직 배우지 않습니다.
- ** 모방 학습 (IL):** 로봇은 기록된 시범을 모방함으로써 정책을 학습합니다. 명시적인 보상 기능이 필요하지 않습니다. 행동 클론, ACT, 방전 정책과 같은 알고리즘은 이 범주에 속합니다.
- 강화 학습 (RL): 로봇은 동작을 시도하고 보너스 신호를 수신 (예를 들어, 성공적인 포착을 위해 +1) 하고, 많은 실험에 대한 정책을 개선합니다. RL는 인간 시범 품질을 초과할 수 있지만 많은 시도를 필요로 합니다.
8 주 의 시작 경로
로봇 조작에 새로운 사람이라면, 여기 실제 하드웨어에서 처음 배운 정책을 실행하는 데 0에서 실행하는 실용적인 진행입니다.
- ** 1
2 주 하드웨어 오리엔테이션:** OpenArm 1 튜토리얼 를 완료하십시오. - 주 3
4 ROS2 Humble를 설치하고, 팔 드라이버를 시작하여, RViz에서 URDF를 시각화하고, MoveIt2 디모 플래너를 실행합니다.소프트웨어 환경: - ** 5~6주
첫 번째 텔레오퍼레이션:** 리더-따라자 텔레오퍼레이션 세션을 설정하고 RCSV 데이터 수집 도구를 사용하여 간단한 선택 및 장소 작업의 20 에피소드를 수집합니다. - 7주8주
첫 번째 정책: 20회에 걸쳐 행동 클론 정책을 훈련시키고, 10회 실제 실험에서 평가하고, 성공률을 측정합니다. 전형적인 첫 번째 정책 성공률: 작업 어려움에 따라 30~60%
조작은 어렵고 첫 번째 결과는 종종 겸손합니다. 이것은 정상입니다. 이 분야는 지난 3 년 동안 급격히 발전했습니다. 바로 실무자들이 데이터를 공유하고 실패로부터 배운 것이기 때문입니다. 간단한







