Blog(으)로 돌아가기

2025 년 로봇 기획: 지질적 방법 에서 학습 된 정책

로봇 포착 계획 조사 <unk> GQ-CNN, GraspNet, AnyGrasp, 그리고 응용 프로그램에 학습된 방법과 기하학적 방법을 언제 사용할지

[← 블로그]

석사 계획은 고전적인 기하학적 분석에서 학습된 종말에서 종말까지의 시스템으로 변했습니다. 여기서는 사용 가능한 방법과 각각의 접근 방식을 언제 사용할지에 대한 실용적인 가이드입니다.

'그라프' 계획 문제

장면을 RGB-D로 관찰한 결과, 목표물에 대한 안정적인 포착을 생성하는 6-DOF 지갑 포즈를 예측합니다. 이 속임수적으로 간단한 문제 진술은 상당한 복잡성을 숨깁니다. 가능한 지갑 포즈의 공간이 연속적이고 고차원적이며 대부분의 포즈가 실패할 것이고, 지갑 포즈 전 포즈와 지갑 성공 사이의 관계는 하나의 RGB-D 프레임에서 완전히 보이지 않는 접촉 메커니즘에 달려 있습니다.

문제는 대략 두 가지 방식으로 나뉘어 있습니다. 위-하에 잡는 (2.5D 접근 축을 중심으로 지갑 회전을 무시하고, 위에서 잡는) 이는 고전적인 방법들에 대한 문제를 충분히 단순화하고, 그리고 신뢰할 수 있는 일반화를 위해 학습된 방법을 필요로 하는 6-DOF 잡는 (완전 포즈 예측) 이다.

잡지 탐지 방법: 분류학

이 분야는 세 세 세대의 접근 방식을 통해 발전해 왔으며, 각 분야는 여전히 다른 사용 사례에 적용됩니다.

** 1세대 지리학/분석 방법:** epsilon 품질 측정 (잡이 수 있는 가장 큰 톱니 키) 또는 강제 폐쇄 분석과 같은 매트릭을 사용하여 객체의 지리 모델에서 포착 품질을 계산하십시오. 이러한 방법은 알려진 객체 매치와 정확한 포즈 추정이 필요합니다. 그들은 결정적이고 해석 가능하며 빠르고 그러나 새로운 객체를 처리 할 수 없습니다. 여전히 산업용 쓰레기통을 수집하는 데 사용되며 객체 카탈로그가 알려져 있고 고정되어 있습니다.

** 2세대 후보자의 포착에 대한 학습 점수:** 후보자의 샘플 포착 포지 (자발적으로 또는 기하학적 유리스틱을 사용하여) 를 통해 학습된 신경 네트워크로 각 후보자를 점수합니다. GPD, GQ-CNN, 그리고 GraspNet-1Billion은 이 범주에 속합니다. 1세대에서 핵심적인 차이점은 점수 함수는 데이터에서 학습되어 분석적으로 계산되는 것이 아니라 새로운 객체에 일반화를 가능하게 한다는 것입니다.

** 3세대 직속 6DOF 포지 회귀:** 명시적인 후보 샘플링 없이 포인트 클라우드에서 직접 포지 포지 예측. 샘플 및 점수 방법보다 빠르고 정확합니다. 네트워크는 샘플을 통일하는 후보자를 평가하는 대신 포인트 클라우드의 유망한 지역에 집중하는 것을 배우기 때문입니다.

고전적 방법

  • GPD (파지 포즈 Detection): 포인트 클라우드 기반의 6-DOF 포지 포지 포지 검출. 샘플 후보 포지 포지 포지 punkt 클라우드 표면에 위치하고, 학습된 바이너리 분류기를 사용하여 각각을 평가합니다. 현대 작업장에서 약 5 Hz로 실행됩니다. 깨끗하고 정확한 포인트 클라우드에 신뢰할 수 있습니다.
  • GQ-CNN (버클리 오토라브): 깊이 이미지 패치에서 작동하는 CNN 품질을 파악하십시오. 직접적인 상공 관점에서 상하층 포착을 위해 빠르고 정확합니다. 제한: 상하층 접근 방향에 제한됩니다.
  • **PointNetGPD:**PointNet 기반의 포인트 클라우드 코딩과 GPD의 후보 샘플링을 결합합니다. 소음화된 표현보다는 원료 포인트 클라우드에서 직접 기능을 파악합니다. 포인트 클라우드 품질이 불균형한 혼란스러운 장면에서 GPD를 향상시킵니다. 오픈 소스, 그러나 GraspNet보다 덜 적극적으로 유지됩니다.

학습된 6DOF 방법: 상세한 비교

Method Input Novel Objects Speed Training Data Availability
GraspNet-1Billion Point cloud Good (ShapeNet) 10 Hz 1.2B grasps, 97 objects Open source
Contact-GraspNet Point cloud Good (handles occlusion) 8 Hz Acronym dataset, 8K objects Open source
AnyGrasp Point cloud Best (open-set) 15 Hz GraspNet-1B + augmented Commercial API + SDK
FoundationGrasp RGB-D + language Best (language-guided) 3 Hz Multi-modal pre-training Research (code released)
GraspNeRF Multi-view RGB Good (NeRF reconstruction) 0.5 Hz NeRF + grasp labels Research only

그라스프넷 1비ಲಿಯನ್ 및 콘택트 그라스프넷: 오픈소스 작업마

GraspNet-1Billion (Fang et al., CVPR 2020) 는 가장 큰 포착 데이터 세트와 표준 평가로 된 표준 평가판을 도입했습니다. 데이터 세트는 97 개의 일상 물체에서 1.2 억 개의 포착 해설을 포함하고 있으며, 전체 3D 메시에서 분석 포착 품질 매트릭을 사용하여 생성되었습니다. 이 모델은 포인트 클라우드를 코딩하기 위해 포인트넷++를 사용하며 품질 점수를 가진 포인트별 포지 포즈를 예측한다. 핵심 혁신은 접근 수준 실린더 그룹화로 포지 포지 예측을 가능한 접근 방향으로 제한하여 잘못된 긍정적 인 결과를 크게 줄인다.

Contact-GraspNet (Sundermeyer et al., ICRA 2021) 는 무거운 오더러와 부분적인 폐쇄 속에서 잡는 어려운 문제를 해결합니다. 이는 세그먼트 오류에 대한 견고한 것을 주요한 실용적 장점으로 만듭니다. 왜냐하면 혼돈된 장면에서 객체 세그먼트는 그 자체로 신뢰할 수 없기 때문입니다. 모델은 ACRONYM 데이터 세트 (8K 객체, 17.7M 포착) 에 훈련되어 있으며 그라스넷 벤치마크에서 90% 이상의 성공을 달성합니다.

AnyGrasp: 제로 샷 표준

그라스프 (AnyGrasp) 는 그라스프넷-1비리언과 같은 그룹에서 개발한 최신의 방법으로 훈련 중에 보이지 않는 새로운 객체를 포착합니다. 그라스프넷-1비리언 데이터 세트에 (600K+ 훈련 97 개 객체 범주에서 포착합니다) 를 통해 훈련된 그라스프 (AnyGrasp) 는 표준 벤치마크에서 90%+의 포착 성공률을 가진 오픈 세트 객체로 일반화합니다.

엔그라스프는 대부분의 팀에 실용적인 선택으로 만들어지는 것은 0 샷 성능입니다. 특정 객체에 정교하게 조정할 필요가 없습니다. 이 "작정 작동" 속성은 로봇 인식에서 희귀하며 AnyGrasp를 새로운 포착 계획 배포에 권장되는 출발점으로 만드는 것입니다.

상업 API (Graspnet.net에서 사용할 수 있습니다) 는 파이썬 클라이언트 라이브러리로 인프레를 유지하지 않고 AnyGrasp를 사용하려는 팀에 유용하게 사용할 수있는 서비스로서 인프레를 제공합니다. 장치에서 인프레를 필요로하는 팀에 대해서는 SDK는 8-12 Hz에서 Jetson AGX Orin 배포를 지원합니다.

훌륭 한 숙련 계획

지금까지 논의된 모든 방법은 평행 턱잡이를 가정합니다. 가장 간단하고 가장 일반적인 최종 효과입니다. 손 (3-5 손가락, 10-20+ DOF) 은 접촉 구성 공간이 훨씬 더 크기 때문에 근본적으로 다른 잡기 계획이 필요합니다.

DexGraspNet (Wang et al., 2023) 는 최적화 기반의 포착 합성을 사용하여 대규모 유능한 포착 데이터 세트를 생성합니다. 무작위 초기 손 구성에서 시작하여, 세력 폐쇄에 최적화하기 위해 차별화 가능한 물리 시뮬레이션을 사용합니다. 결과 데이터 세트 (1.3M 포착 5K 객체) 는 새로운 객체로 일반화되는 유능한 포착 계획자를 훈련시키는 데 도움이됩니다.

UniDexGrasp (Xu et al., CVPR 2023) 는 강화 학습 접근 방식을 취하고 있습니다. 시뮬레이션에서 임의의 객체를 능숙한 손으로 잡기 위해 정책을 훈련시키고, 실제 하드웨어로 전송합니다. 정책은 포인트 클라우드와 손 자체 수용을 관찰하고, 관절 위치 명령에 대한 출력을 제공합니다. 유니덱스 그라스프는 시뮬레이션에서 새로운 객체에서 85%+의 성공을 달성하지만, 시미-트리얼 전송은 여전히 도전입니다.

** 실용적인 권고:** 평행 턱잡이를 사용하는 경우 AnyGrasp를 시작하십시오. 숙련한 손 (오르카 손, 알레그로 손, LEAP 손) 을 사용하는 경우 데이터 생성을 위해 DexGraspNet을 시작하여 생성된 손잡이에 대한 정책을 훈련하십시오. RCSV는 [오르카 손 및 호환 가능한 숙련된 손] (T4) 를 저장하고 숙련된 손잡기 계획 파이프라인을 통합 지원합니다.

포인트 클라우드 vs. 깊이 이미지 방법

실용적인 질문: 당신의 포착 기획기는 원시 깊이 이미지나 3D 포인트 클라우드에서 작동해야 하는가?

Criterion 포인트 클라우드 Methods Depth Image Methods
Multi-view fusion Natural (register and concatenate) Requires volumetric fusion (TSDF)
Inference speed 8-15 Hz (PointNet++ backbone) 20-50 Hz (CNN backbone)
6-DOF grasp support Native (3D coordinates) Requires projection/back-projection
Clutter handling Better (3D reasoning) Struggles with overlapping objects
Pre-processing Downsampling, normal estimation Minimal (resize, normalize)
Best method AnyGrasp, Contact-GraspNet GQ-CNN (top-down only)

6DOF를 잡는 경우, 붐비는 환경에서 포인트 클라우드 방법은 엄격히 더 좋습니다. 고정된 오버헤드 카메라로 상하층 버진을 선택하려면, 깊이 이미지 방법 (GQ-CNN) 은 더 빠르고 충분합니다. 대부분의 팀은 속도 요구가 깊이 이미지 접근을 요구하지 않는 한 기본적으로 포인트 클라우드 방법을 사용해야합니다.

통합 파이프라인

ROS2 + MoveIt2 스택과 표준 통합:

# 단계 1: RealSense ros2에서 점 점 클라우드를 캡처합니다 realsense2_camera rs_launch.py \ enable_pointcloud:=true align_depth.enable:=true # 단계 2: 어떤그라스프에서 grip 플래너 (AnyGrasp 예제) 를 실행합니다 AnyGraspDetector = AnyGraspDetector (AnyGraspDetector) 를 수입합니다.

주요 구현 세부 사항: 항상 작업 공간의 한계로 지원자를 필터링합니다 ( 테이블과 충돌하거나 팔의 범위에 있지 않은 포착을 배제합니다), 품질 점수 임대점을 설정합니다 (0.7는 좋은 출발점입니다), 그리고 위치 오류를 처리하기 위해 접근의 마지막 5cm에서 임피던스 제어 기능을 사용합니다. 접근 거리에 위치 제어에서 막대기 제어로 전환하는 것은 신뢰성 있는 잡기 위해 중요합니다.

MoveIt2 통합: 전체 파이프라인 아키텍처

학습된 포착 계획자를 생산 MoveIt2 스택에 통합하는 것은 계획자를 호출하고 실행하는 것 이상의 것을 포함합니다. 견고한 파이프라인에는 충돌에 대한 계획, 포착 필터링, 접근/퇴근 궤도 생성 및 후퇴 논리가 필요합니다. 자세한 아키텍처는 다음과 같습니다:

파이프라인 노드 (ROS2 파이썬) 를 파악

# grasp_pipeline.py -- Full MoveIt2 + AnyGrasp 파이프라인 수입 rclpy에서 rclpy.node 수입 Node에서 moveit2 수입 MoveIt2에서 기하학_msgs.msg 수입 Pose_msgs.msg 수입 PointCloud2 수입 numpy np 클래스 마스터 파이프라인Node: ____(((((((: 슈퍼) _______(_'grasp_pipeline') self.moveit = MoveIt2(node=self, joint_names=ARM_JOINTS, base_base_link=ray_link', end_link=gripper_distreat_link') .detews = AnyGasp_distreat_link) ◎ (~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 0.0~ 크로프에서 작업 공간 마스크 = np.all((Cloud[:,:3] >= self.ws_min) & (cloud[:,:3] <= self.ws_max), 축=1) cloud_ws = cloud[mask] # 2. 랩 탐지 탐지 탐지 실행, 점수 = self.detector.get_grasps(cloud_ws, top_k=50, 적용_nms=True) # 3. 스코어 로그 (s) 를 필터링하면 유효한 점수 = [(g, s) 는 zip에 있는 g, s에 대한 s, s에 대한 s >= self.score_thresh] 유효하지 않은 경우: self.get_logger().warn('No valid grasps above threshold') 는 반환 거짓 # 4. 점수로 분류하여 각각 valid.sort(key=lambda x: x[1], reverse=True) 를 파악하기 위해 유효한 점수를 얻습니다. 리프터너스 포즈 (복귀 접근 축을 따라) 접근방식_vec = 포지. 회전[:, 2] # z-축 = 접근방식 pre_grasp = 포지.복본() pre_grasp.translation -= 접근방식_vec * self.dist 접근방식_dist # 4b. 두 가지 포즈의 IK 실현 가능성을 확인한다. 계획 및 실행 접근 self.moveit.open_gripper() 성공 = self.moveit.plan_and_execute(pre_graasp, 속도_scaling=0.5) 성공이 아니라면 계속 # 4d. 포지 (카르테시아 경로) 포지 (포지) 포지 (카르테시아 경로) 포지 = self.moveit.compute_cartesian_path([pre_grasp, grip], max_step=0.005) 를 포지.프랙션 < 0.95: 계속 # path 너무 불완전한 self.moveit.execute(waypoints.trajectory, velocity_scaling=0.2) # 4e. 포지 (griper) 를 힘 제어로 닫는다.moveit.close_grip(perforce=15.0, 너비=0.0) # 4f. 철수 (직으로 올라) 철수_포지 = 잡기.복제() 철수_포지.번역[2] += 자기.연수_거리를 자기.운동.계획_그리고_집행(연수_포지, 속도_스컬링=0.3) 복귀 참정 self.get_logger().실점('모든 포지 후보가 실패') 복귀 거짓

이 파이프라인에서 주요 건축 결정:

  • ** 탐지 전에 작업 공간을 채굴하는 것은 배경 표면에서 거짓 긍정을 줄이고 점수를 줄임으로써 추론 시간을 30-40% 감소시킵니다.
  • ** 계획 전에 미리 확인 ** 가 가 닿지 않는 잡을 수 있는 비싼 운동 계획 요청을 피합니다. 통화 한 번에 IK 체크 (0.1ms) 는 전체 계획 (10-50ms) 보다 100배 더 저렴합니다.
  • ** 최종 접근을 위한 카르테시아 경로는** 포지션 포지션에 직선 접근을 보장합니다. 이는 마지막 몇 센티미터 동안 충돌을 피하기 위해 중요합니다. 자유 공간의 움직임 계획은 가까운 물체를 뜯어가는 곡선 경로를 생성할 수 있습니다.
  • 힘 제어 닫는이 취약한 물체를 부서지는 것을 방지합니다. 포착기: 식품/전자품에 대해 5-10N, 딱딱한 물체에 대해서는 15-30N, 산업 부품에 대해서는 50N+를 설정합니다.
  • Top-10 fallback loop는 가장 높은 점수를 받은 포착이 도달할 수 없는 경우를 처리합니다.

램프 기획을 위한 카메라 캘리브레이션

랩프 계획 정확도는 카메라에서 로봇에 대한 캘리브레이션 (손-눈 캘리브레이션) 에 결정적으로 달려 있습니다. 5mm 캘리브레이션 오류는 직접적으로 5mm 랩프 포즈 오류로 번역됩니다. 작은 물체에서 실패를 일으킬 수 있을 만큼입니다. 캘리브레이션 파이프라인:

  1. ** 기량 데이터를 수집:** ArUco 보드 또는 체커보드 (눈에서 손) 에 설치된 최종 효과자 또는 작업 공간에 설치된 ArUco 보드 또는 체커보드 (손에서 눈) 을 관찰하는 동안 로봇을 15-20 개의 자세로 이동하십시오. 각 구성에 대한 로봇 FK 포스와 감지 된 보드 포즈를 기록하십시오.
  2. AX=XB를 해결하세요: Tsai-Lenz 또는 Park 방법과 함께 OpenCV의 T0을 사용하세요. 이것은 카메라-기반 변환 (눈-손) 또는 카메라-끝-효과 변환 (눈-손) 을 제공합니다.
  3. ** 유효성:** 카메라 프레임의 알려진 지점을 만지는 것을 명령하십시오. 오류를 측정합니다. 작업 공간 전체에서 10 점 동안 반복하십시오. 목표: <2mm 평균 오류, <4mm 최대 오류.
  4. ** 주기적으로 재계급:** 카메라 마운팅 조정, 로봇 기지 이동 또는 상당한 온도 변화 (열 확장으로 카메라 위치가 10C에 최대 1mm로 변경됩니다).

RCSV는 리얼센스 D435i 및 D405에 대한 미리 캘리브된 카메라 마운트를 제공하여 1.5mm의 캘리브레이션 정확도를 유지합니다. 사용자 지정 마운트를 사용하는 팀에 대한 데이터 서비스는 하드웨어 설정 패키지의 일부로 손-눈 캘리브레이션을 포함합니다.

하드웨어 플랫폼에 따라 플래너 FPS를 파악하십시오

이 숫자는 실제 포인트 클라우드 (실공 공간 작물 후 20K-40K 포인트) 에서 배트 크기로 1을 측정했습니다.

Method RTX 4090 RTX 3060 Jetson Orin Jetson Xavier CPU (i7-13700)
GQ-CNN (top-down) 60 Hz 45 Hz 25 Hz 12 Hz 8 Hz
GraspNet-1Billion 18 Hz 10 Hz 5 Hz 2 Hz 0.8 Hz
Contact-GraspNet 15 Hz 8 Hz 4 Hz 1.5 Hz 0.5 Hz
AnyGrasp 22 Hz 15 Hz 8 Hz 3 Hz 1.2 Hz
FoundationGrasp 5 Hz 3 Hz 1.2 Hz 0.4 Hz N/A
GPD 8 Hz 5 Hz 2.5 Hz 1 Hz 0.6 Hz

** 실용적인 단말기:** Jetson Orin (모바일 로봇의 표준 엣지 계산) 에서, 8 Hz에서 AnyGrasp는 반응형 포착을 위한 유일한 6-DOF 방법이다. 데스크톱 RTX 3060에서, 모든 방법은 당신이 계획하고 실행하는 한 번 픽플레이 작업에 용납 가능한 속도로 실행됩니다. 20+ 픽/분으로 컨베이어 벨트 포착을 위해, 당신은 데스크톱 GPU 또는 Jetson에서 GQ-CNN (상 아래 포착만) 를 필요로 합니다.

객체 범주별로 성공률을 파악

실제 세계 포착 성공은 객체 속성에 크게 달려 있습니다. 이 숫자는 Robotiq 2F-85 포착기와 함께 OpenArm 1에서 여러 개의 출판된 평가와 RCSV 내부 테스트에서 합쳐진 결과입니다.

Object Category AnyGrasp Contact-GraspNet GQ-CNN Notes
Rigid boxes/cans 95% 93% 90% Easiest category
Irregular shapes (toys, tools) 88% 85% 72% GQ-CNN limited to top-down
Small objects (<3cm) 78% 72% 65% Depth noise dominates
Transparent (glass, clear plastic) 35% 30% 25% Depth sensor failure
Deformable (bags, cloth) 55% 50% 40% Shape changes on contact
Heavy clutter (>15 objects) 75% 80% 58% Contact-GraspNet excels here
Flat objects (books, plates) 82% 78% 70% Side grasps often needed

언어적 조작을 위한 마스터 계획

최신 세대 포착 계획자는 언어 컨디션을 통합하여 "붉은 잔을 들어보세요" 또는 "왼쪽 가장 큰 병을 들어보세요"와 같은 명령을 허용합니다. 이것은 포착 계획 (어떤 포착 자세가 안정적입니까?) 와 작업 계획 (어떤 객체를 잡아야합니까?) 사이의 격차를 다치게합니다.

건축 패턴: 언어 조건의 전형적인 포착 파이프라인 체인은 세 가지 구성 요소를 포함한다: (1) 문장 개체 탐지기 (GroundingDINO, OWLv2) 는 텍스트 쿼리에서 대상 객체를 현지화, (2) 대상 객체에 마스크를 생성하는 세그먼트 모델 (SAM, Segment Anything) 및 (3) 마스크 포인트 클라우드에서 작동하는 포착 계획기. 이 모듈 방식은 각각의 구성 요소를 독립적으로 교환할 수 있습니다.

# 언어_grasp.py -- 언어 조건으로 된 포착 파이프라인에서 groundingdino.util.inference 수입 예측 gd_predict segment_anything 수입 SamPredictor 수입 numpy np def 언어_grasp(rgb, 깊이, 프롬프트, 포착_디렉터, sam, 카메라_K): """<unk>T1.""###############################################################################################################################################################################################################################################################################################

이 파이프라인은 탐지 및 세그먼팅 (RTX 3060) 에 80-150ms의 지연을 추가하지만, 그레이프 플래너가 대상 객체를만 고려하여 방해 요소에 대한 잡을 수 있으므로 작업 수준 성공을 극적으로 향상시킵니다. VLA 기반 조작 시스템을 구축하는 팀에서는 언어 조건으로 잡는 것이 표준 인식을 전면으로합니다.

개방형 벤치마크

GraspNet 벤치마크: 학습된 6DOF 포착을 위한 표준 평가. 88개의 객체 (보인/ 유사/ 신작 카테고리로 나뉘어) 를 가진 190 장면을 사용한다. 매트릭스: AP (다양한 품질 문턱에서 평균 정확성) 및 다른 마찰 계수에서 성공률. 모든 주요 방법들은 이 벤치마크에 대한 결과를 보고하여 십법 비교를 간편하게 한다.

YCB 포착 벤치마크: 표준화된 카메라 설정 및 평가 프로토콜을 가진 YCB 객체 집합 (77개의 일반적인 가정용 객체) 을 사용한다.

OCRTOC (Open Cloud Robot Table Organization Challenge): 한 구성 요소로서 포착 기획을 포함하는 테이블탑 조작을 위한 온라인 벤치마크.

실패 방법 과 완화 방법

  • ** 투명 물체 (글라스, 투명 플라스틱):** 투명한 표면에서 깊이 센서가 실패합니다 구조화된 빛과 ToF 모두 표면 반사력이 필요합니다. 완화: 촉각 검색을 사용하십시오 (지착기를 추정 접촉 지점으로 이동하십시오, 낮은 힘을 가진 탐사), 표면 가시성을 높이기 위해 양극화된 조명을 추가하거나 깊이가 필요하지 않은 RGB 기반 방법을 사용하십시오 (FoundationGrasp).
  • 중고 물체 사용 부하 제한 근처: 잡기 계획에는 사용 부하 제한이 포함되지 않습니다. 팔 사용 부하 제한 근처의 물체를 잘못된 각에서 잡으면 잡기는 성공할 수 있지만 토크 제한으로 들어올리지 못할 수 있습니다. 완화: 잡기 선택 필터에 사용 부하 추정치를 추가하십시오 (알은 물체의 무게 또는 초기 접촉 후 손목 F / T 감지에서).
  • ** 얇은 물체 <3mm:** 하드웨어 수정 없이 표준 평행 턱잡이가 <3mm에 가까워질 수 없습니다. 표준 물체에 훈련된 턱잡이가 신용 카드, 종이 시트 또는 얇은 판에 대한 유효하지 않은 턱잡이를 생성합니다. 완화: 특수 턱잡기 기하학, 진공 기반 턱잡기, 또는 턱 및 흡수 모드 모두와 하이브리드 턱잡기.
  • ** 매우 혼란스러운 장면 (>20 개):** 점 구름의 품질은 대 객체 간 폐쇄로 인해 밀집한 혼란에서 악화됩니다. 콘택트-그라스프넷은 객체 세그먼트가 필요하지 않기 때문에 그라스프넷-1빌리언보다 더 잘 처리합니다. 그러나 콘택트-그라스프넷은 15 개 이상의 정확성 저하 15-20%를 보여줍니다. 완화: 디클러스터링 전략을 사용 먼저 쉬운 물건을 잡고 제거하고, 그 다음 어려운 물건을 위해 다시 현장을 관찰하십시오.
  • ** 변형 가능한 물체 (봉자, 천체, 부드러운 음식):** 현재 모든 방법은 딱딱한 물체로 가정한다. 변형 가능한 물체는 접촉 중에 모양을 변경하여 접촉 이전의 관찰에서 예측된 포지션을 무효화한다. 완화: 보수적인 포착력을 사용하거나 [연결력 피드백] (T5) 를 기반으로 반응적 재 포착을 구현하거나 변형 가능한 조작 전략을 포착하는 작업에 대한 구체적인 시범 데이터를 수집합니다.

RCSV는 조작에 최적화된 RealSense D435i 및 D405 카메라와 함께, 그라스넷과 애니그라스프의 사전 구축된 ROS2 캡처 계획 노드와 함께 보유하고 있습니다. 데이터 서비스 는 맞춤형 캡처 정책을 훈련하는 팀들을 위한 캡처 시범 컬렉션을 포함합니다. 하드웨어 카탈로그를 방문하십시오 플랫폼 문서 통합 가이드에 대한 파일럿 데이터 수집은 2,500 달러에서 시작합니다.

관련 독서

  • [로봇 카메라 설정 안내]
  • [연계군 조작]
  • [다형 로봇 감지]
  • [시민에서 실제로 전송]
  • [로봇의 분포 정책]
  • [데이터 서비스]
  • [하드웨어 카탈로그]
  • [사사]

인식 하드웨어 및 통합

RCSV는 깊이 카메라, 포착 계획 노드 및 조작 인식 파이프라인을 위한 통합 지원을 제공합니다.

[점 인식 하드웨어]