로봇 조작을 위한 멀티모달 감지: 시력, 힘, 촉각 합성
강력한 로봇 조작을 위해 시력, 힘/토크, 촉각 감지 등을 결합하는 방법
[로봇 무기 가이드]
[← 블로그]
각 감지 방식은 다른 방식의 실패 방식을 다루고 있습니다. 문제는 복잡함 없이 어떻게 결합할 수 있는지입니다.
단일 모다리티 감지 기능 이 왜 짧지 않는지
시각만 조작하는 것은 접촉에 실패한다. 로봇의 손가락이 물체에 있는 한, 그들은 종종 카메라로부터 접촉 영역을 차단한다. 접근 중에 잘 작동하는 시각 정책은 작업의 정밀 접촉 단계에서 붕괴됩니다.
힘만 제어 (제약 제어, 힘 세르보) 는 공간 정보가 부족합니다. 접촉이 이루어질 때 감지하고 접촉력을 조절할 수 있지만, 올바른 표면을 만지고 있는지, 잡기 자세가 안정적인지, 물체가 움직여 있는지 알 수 없습니다.
터틸 센싱은 그 자체로 풍부한 접촉 기하학 정보를 제공하지만 제한된 공간 범위를 가지고 있습니다.
세 가지의 조합은 각 모다리트의 실패 모드를 커버하고 단일 모다리보다 실질적으로 더 강력한 정책을 만들어냅니다.
센서 모다리티 비교
| Modality | Range | Bandwidth | Spatial Resolution | Failure Mode | Cost |
|---|---|---|---|---|---|
| RGB camera | 0.3-5m | 30-200 Hz | Sub-pixel (0.1-0.5mm) | Lighting, occlusion, specular | $100-1,200 |
| Depth (structured light) | 0.1-3m | 30-90 Hz | 1-5mm depth error | Transparent, outdoor, multi-cam interference | $200-600 |
| Wrist 6-axis F/T | Contact only | 1,000-7,000 Hz | N/A (single point) | No spatial info, measures sum of contacts | $1,500-8,000 |
| Tactile array | Contact only | 100-500 Hz | 1-3mm per taxel | Limited area, wear, calibration drift | $300-5,000 |
| IMU (wrist-mounted) | Local motion | 200-1,000 Hz | N/A | Drift, bias, limited to acceleration/rotation | $5-50 |
| Audio (contact microphone) | 0-2m | 16-48 kHz | N/A | Background noise, non-contact states | $10-100 |
모다리티별 하드웨어 추천
시력 (RGB + 깊이)
** 세 번째 사람 오버헤드:** Intel RealSense D435i ($250). 테이블톱 조작 연구 표준. 30fps 깊이 + RGB에서 640x480 .
** 근접 범위 손목 카메라:** 인텔 리얼센스 D405 ($300) 은 5-50cm 범위에서 깊이, 또는 FLIR 블랙플래크 S BFS-U3-16S2C ($450) 은 최대 226fps의 글로벌 셔터 RGB에 대해. D405는 근접 범위 깊이에 최적화되어 있습니다. 접근 단계에서 손-눈 조정에 중요합니다.
** 스테레오를 추가할 때:** 만약 범위 (1-5m) 에서 깊이가 필요하고 구조화된 빛의 간섭이 문제가 된다면 (다중 카메라 또는 야외) ZED 2 ($450) 와 같은 스테레오 카메라를 사용하십시오.
힘/토크
** 예산 옵션:** Robotiq FT 300 ($ 1,500-3,000). 100 Hz, +/- 0.1N 정밀성. 일반 조작, 포지력 제어 및 충돌 탐지에 충분합니다. 유니버설 로봇 팔과 직접 통합됩니다.
연구 옵션: ATI Mini45 ($5,000~8,000). 7 kHz, +/-0.05N 정밀성. 정밀 삽입 및 조립 작업의 금 표준. 미리미터 미만의 용납량 과제에 필요한. 제어 모드를 위해 [연결군 지침]
** 소프트웨어 옵션만:** 로봇의 동적 모델에서 공동 동적 추정. 무료, 항상 사용 가능하지만 +/-0.5Nm 정밀도에 제한됩니다. 충돌 감지 및 거친 접촉 감지에 유용합니다. 프랑카 (이안부 결합 동적 센서), UR (외부 동적 추정) 및 대부분의 현대 무기에서 사용할 수 있습니다.
촉각
** 광학 촉각 (GelSight Mini):** 300600달러. 3060Hz에서 고해상도 접촉 이미지를 제공합니다. 텍스처 인식, 촉각으로 물체 식별, 미세한 곡물 슬립 탐지. 제한: 거액의 형태 요소는 현명한 손에 통합하기가 어렵습니다.
** 용량 배열 (XELA uSkin):** $1,500-5,000. 100-500 Hz에서 한 taxel에 3 축의 힘을 제공합니다. 슬라이드 감지, 접촉 현지화 및 실시간 힘 분포 모니터링에 가장 좋습니다. 능숙한 손 통합을 위해 더 나은 형태 요소.
Paxini 터틸 센서: $500-1,500. 분산된 정상 + 썰기 힘 1mm 공간 해상도, 200 Hz. RCSV 주식 Paxini 센서
IMU
손목에 설치된 IMU (BNO055 또는 ICM-42688-P, $ 5-50) 은 높은 주파수 가속 및 방향 데이터를 제공합니다. 조작 중에 충돌 사건을 감지하고, 도구를 사용 중 진동 서명을 측정하고, 카메라 프레임 속도 부족할 때 높은 주파수 운동 피드백을 제공합니다. IMU는 추가 할 수있는 가장 저렴한 센서이며 통합 할 수있는 가장 쉬운 것입니다
음향
지갑이나 손목에 설치된 접촉 마이크 (10-100 달러) 는 접촉 사건의 음향 서명을 캡처한다. 최근 연구 (Gandhi and Pinto, 2020; Clarke et al., 2023) 는 오디오가 유용한 접촉 정보를 제공한다는 것을 보여주었다. 오디오는 현재 조작 시스템에서 가장 잘 사용하지 않는 방식입니다. 추가하기 쉽고 가볍고 놀랍게도 정보적입니다.
센서 융합 접근법
** 초기 융합:** 모든 센서 기능 벡터를 정책 네트워크에 하나의 입력으로 연결합니다. 구현하기 쉽습니다. 모든 센서가 훈련과 배포 시간에 모두 존재해야 합니다.
** 늦은 합성:** 각 모달리티에 대한 독립적인 코더를 훈련시키고, 그 다음 액션 헤드 전에 주의 또는 협연으로 병목층을 결합합니다. 실종 센서보다 견고합니다.
차중주의 트랜스포머 융합: 각 센서의 출력을 토큰의 연속으로 취급하고 트랜스포머 융합주의를 사용하여 모달리티가 서로 응시하도록 한다. 이것은 최근의 기초 모델에서 사용되는 건축물이다 (OpenVLA는 시각 토큰 + 언어 토큰을 융합주의로 사용합니다). 늦은 융합보다 더 표현적이지만 효과적으로 훈련하기 위해 더 많은 데이터가 필요합니다.
** 순위적 융합:** 작업의 다른 단계에서 다른 모다리들을 사용한다. 접근 계획 (장거리), 접촉 탐지 및 준수 (중거리), 미세한 조작 (접촉) 을 위한 힘 (타클리). 이것은 신경 네트워크의 의미에서 융합이 아니다. 학습된 융합보다 구현하고 디버깅하는 것이 더 간단하며 작업 단계가 명확하게 분리될 때 학습된 접근 방식을 능가하는 경우가 많습니다.
ROS2 주제 동기화
멀티모달 시스템에서 가장 일반적인 구현 도전은 시간 동기화입니다. 센서는 서로 다른 주파수 (카메라가 30 Hz, F/T가 1 kHz, 촉각은 200 Hz) 에서 작동하며 지연이 다릅니다. ROS2는 대략적인 시간 동기화를 위해
# ROS2 파이썬: 카메라, F/T, 그리고 공동 상태 수입 메시지_필터들을 센서_msgs.msg 수입 이미지, JointState, 기하학_msgs.msg 수입 WrenchStamped 클래스 MultimodalSync(노드): def __init___(자력: super(__init__('multimodal_sync') # 각 모달의 가입자 self.cam_sub =_filters.SubscriberImage, '/camera/time/image_ms_sym_app.gms.gms.gms.gms.gms.gms.gms_sym_linked_message.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gms.gmm.g.g.g.g.g.m.g.g.m.g.g.m.g.g.m.g.m.g.g.g.m.g.m.g.g.m.g.m.g.g.m.g.m.g.m.g.g.m.g.m.g.g.m.g.m.g.m.g.
주요 동기화 매개 변수:
캘리브레이션 요구 사항
| Sensor | 캘리브레이션 Type | Frequency | Time Required | Critical Error If Skipped |
|---|---|---|---|---|
| RGB camera (fixed) | Intrinsic + extrinsic (hand-eye) | Monthly or after any adjustment | 15-30 min | 5-20mm position error |
| Wrist camera | Eye-in-hand calibration | Monthly | 20 min | 2-10mm position error |
| Wrist F/T sensor | Bias removal (tare) + tool weight | Daily (tare) / monthly (full) | 2 min (tare) / 15 min (full) | 1-5N force bias error |
| Tactile array | Flat-surface zero + known-force check | Weekly | 10 min | 10-30% force reading error |
| IMU | None required (auto-calibrates) | N/A | 0 min | Minimal (bias drift is auto-corrected) |
힘 과 무게 예산
로봇 팔에 추가된 모든 센서는 손목의 유용무용 부하와 전력 끌어당기는 효과를 높인다. 제한된 유용무용 부하 용량을 가진 팔 (예를 들어, 1kg 유용무용 부하에 OpenArm 1, 750g에 ViperX 300) 에 있어서 센서 무게 예산은 좁습니다.
| Component | Weight | Power | Notes |
|---|---|---|---|
| RealSense D405 (wrist) | 52g | 1.5W (USB) | Lightest depth camera for wrist |
| ATI Mini45 F/T | 92g | 2.5W | Plus 50g for cable/connector |
| GelSight Mini | 35g per finger | 1W (USB) | Adds width to finger — check gripper clearance |
| XELA uSkin pad | 15g per pad | 0.5W | Thinnest tactile option |
| Paxini tactile sensor | 20g per pad | 0.5W | Best resolution/weight ratio |
| IMU (BNO055 breakout) | 3g | 0.01W | Negligible weight and power |
| Contact microphone | 5g | 0.01W | Negligible weight and power |
전체 멀티모달 손목 스택 (D405 + ATI Mini45 + 2x GelSight Mini) 은 약 265g의 무게를 가지고 7W를 지낸다. 이것은 Franka Research 3 (3kg의 유용무용 부하) 의 예산 내에 있지만, 괄호와 결합하면 OpenArm 1 (1kg) 의 유용무용 부하를 초과합니다. 팔을 선택하기 전에 센서 스택을 계획하거나 손목 이후 남은 유용무용 부하에 따라 센서를 선택하십시오.
실용적인 시행 권고
- ** 출발점
시각만:** 상면 카메라 + 손목 카메라. 이 구성은 조작 작업의 70-80%에 충분하며 힘이나 촉각 하드웨어가 필요하지 않습니다. - ** 접촉 부가 있는 작업:** 손목 F/T 센서를 추가 합니다. 6 축 톱니 키는 접촉 감지 및 세력 조절을 제공하여 삽입 및 조립 작업 성능을 크게 향상시킵니다.
- 외부 조작: 촉각 감지 (GelSight 또는 용량 매리) 를 추가합니다. 고 해상도 접촉 기하학은 손으로 다시 잡을 수 있고 슬라이드 감지 할 수 있습니다.
- ** 완전 다형:** 시력 + F/T + 촉각 + IMU + 오디오. 다형 학습 연구나 모든 가능한 신호가 도움이 되는 작업 (예를 들어, 자율적인 수술 로봇, 전자 집합) 에 필요한 것 만이다.
- 방방법들을 선제적으로 추가하지 마십시오: 각 추가 방식은 데이터 수집 복잡성을 추가합니다 (모든 센서 녹음과 함께 시범이 필요합니다), 해설 과장 및 훈련 복잡성을 추가합니다. 특정 오류 모드를 입력하면 센서를 추가합니다.
교육 데이터의 영향
다모달 정책은 모든 센서 모다리들이 동시에 기록되는 시범을 요구한다. 즉, 데이터 수집 설정을 통해 모든 센서가 수집 시점에 동기화되고 기록되어야 한다. 기존의 시각만 시범을 위한 힘이나 촉각 데이터를 재시설하는 것은 불가능하다.
하나의 실용적인 전략은 전체 센서 스위트와 함께 모든 시범을 수집하고, 그 다음, 배열된 모델을 훈련 (비전 전용, 비전+포스, 풀 멀티모달) 하고 각각을 평가하는 것입니다. 이것은 특정 작업에 대한 각 센서 모달리의 소재 가치를 알려줍니다. 이는 미래의 데이터 수집 투자에 정보를 제공합니다.
RCSV의 [데이터 수집 설정] (
관련 독서
- [연계군 조작]
- [로봇 카메라 설정 안내]
- [로봇 훈련 데이터 가이드]
- [로봇 데이터 해상]
- [VLA 모델 설명]
- [그라스프 계획 조사]
- [데이터 서비스]
- [하드웨어 카탈로그]
- [사사]
멀티모달 로봇 시범 데이터를 수집
RCSV의 데이터 수집 인프라는 시그노화된 멀티 센서 기록을 지원하여 시야, 깊이 및 힘 모다티를 제공합니다.
[데이터 서비스를 탐구]







