2025 年 ロボット 機械 設計: ジオメトリック 方法 から 学習 政策 に 移行
機械の把握計画調査 <unk> GQ-CNN,GraspNet,AnyGrasp,そして,学習対幾何学的方法を使用するときにあなたのアプリケーション.
[←ブログ]
グラスプランニングは古典的な幾何分析から 学習された端から端までのシステムへと変わりました
計画 課題
シーンのRGB-D観測を考慮すると,目標物体に安定した把握を生む6DOFグリッパーポーズ (位置 +方向) を予測する. この誤った単純な問題説明は,大きな複雑さを隠しています. 可能なグリッパーポーズの空間は連続で高次元で,ほとんどのポーズは失敗し,プリ・グリップポーズとグリップ成功の関係は,RGB-Dフレームから完全に見えていない接触メカニズムに依存します.
この問題は大概2つの režimeに分かれます. 上から下へと把握する (2.5D
グラップ検出方法:分類
この分野は3世代ものアプローチによって進化し,それぞれが依然として異なる使用事例に関連している.
世代1
2世代 候補者の握り付けで学習したスコア: 候補者の握り付けポーズサンプル (ランダムまたは幾何学術を用いて),その後学習された神経ネットワークを持つ各候補者をスコアする.GPD,GQ-CNN,GraspNet-1Billionはこのカテゴリーに属している. 世代1の重要な違いは,スコア付け機能は分析的に計算するのではなくデータから学習され,新しいオブジェクトに一般化が可能であるということです.
第3世代
クラシック の 方法
- **GPD (把握姿勢 Detection):**ポイント雲ベースの6DOFキャップポーズ検出.サンプル候補キャップはポイント雲表面にポーズし,それぞれを学習したバイナリー分類器 (Grasp品質) で評価する.近代的な作業台で約5Hzで動作する.清潔で正確なポイント雲に信頼性がある. 遮蔽とセンサーノイズと闘う. オープンソース (MITライセンス).
- GQ-CNN (バークレー AUTOLAB): 深度画像パッチで動作するグレープ品質のCNN.直接のオーバーヘッド視野からトップダウングレープを高速 (50ms推論) と正確にする.制限:上下アプローチ方向に限定される. 側グレープや正確な6DOFポーズを予測することはできません.オーバーヘッドカメラでビンピックリングシナリオに最適です. 訓練前のモデルを備えたオープンソースが利用可能.
- PointNetGPD: PointNetベースのポイントクラウドコーディングをGPDの候補サンプルと組み合わせます. ヴォクセライズされた表示よりも原点クラウドから直接特性を把握します. ポイントクラウドの質が不均等な混乱したシーンでGPDを改善します. オープンソースですが,GraspNetよりも積極的に維持されていません.
学習された6DOF方法:詳細な比較
| Method | Input | Novel Objects | Speed | Training Data | Availability |
|---|---|---|---|---|---|
| GraspNet-1Billion | Point cloud | Good (ShapeNet) | 10 Hz | 1.2B grasps, 97 objects | Open source |
| Contact-GraspNet | Point cloud | Good (handles occlusion) | 8 Hz | Acronym dataset, 8K objects | Open source |
| AnyGrasp | Point cloud | Best (open-set) | 15 Hz | GraspNet-1B + augmented | Commercial API + SDK |
| FoundationGrasp | RGB-D + language | Best (language-guided) | 3 Hz | Multi-modal pre-training | Research (code released) |
| GraspNeRF | Multi-view RGB | Good (NeRF reconstruction) | 0.5 Hz | NeRF + grasp labels | Research only |
オープンソースのワーカーホース
GraspNet-1Billion (Fang et al., CVPR 2020) は,最大規模の把握データセットと標準評価となったベンチマークを導入した.このデータセットには,完全な3Dマッシュで分析的な把握品質メトリックを使用して生成された97つの日常オブジェクトで1,200億の把握注釈が含まれています. このモデルはPointNet++を使用してポイントクラウドをコードし,品質スコアでポイントごとに把握ポーズを予測する.主要な革新は,アプローチレベルシリンダーグループ化で,把握予測を実行可能なアプローチ方向に制限し,誤ったポジティブを大幅に削減する.
コンタクト・グラスプネット (Sundermeyer et al., ICRA 2021) は,重量の混雑と部分的な遮蔽で把握する難題に対処する.孤立したオブジェクトセグメントの把握姿勢を予測する代わりに,コンタクト・グラスプネットは,どのオブジェクトに属しているものに関係なく,シーン内の可視な接触点ごとに把握を予測する. 模様はACRONYMデータセット (8Kオブジェクト, 17.7Mキャプチャ) で訓練され,GraspNet基準で90%以上の成功を達成しています.
ゼロショット標準
訓練中に見られなかった新しいオブジェクトを把握するための最先端の方法であるGraspは,GraspNet-1Billionと同グループによって開発された.GraspNet-1Billionデータセット (600K+のトレーニングが97つのオブジェクトカテゴリーを把握する) と追加拡張により訓練されたAnyGraspは,標準基準で90%+の把握成功率を持つオープンセットオブジェクトに一般化します.
AnyGrasp はほとんどのチームにとって実用的な選択の理由として,ゼロショット性能を挙げています. 特定の物体に細かく調整する必要はありません. 訓練前のモデルでは,家庭用品,工業部品,食品品,不規則な形状を追加訓練なしで処理します. この"ちょうど機能する"特性がロボット認識において稀であり,新しい把握計画部署の推奨出発点となるものとなる.
商業的なAPI (Graspnet.net から利用可能) は,Python クライアントライブラリで推論を提供します. 推論インフラストラクチャを維持せずにAnyGrasp を使用したいチームにとって有用です. デバイス上の推論を必要とするチームにとって,SDKは 8-12 Hz で Jetson AGX Orin 展開をサポートします.
優れた 計画
これまで議論されたすべての方法では,平行爪のグリッパーが最もシンプルで最も一般的なエンドエフェクターである. 精巧な手 (3-5 指, 10-20+ DOF) は,接触配置空間が大きくなるため,基本的に異なる把握計画を必要とする.
DexGraspNet (Wang et al., 2023) は,最適化ベースの把握合成を使用して大規模な巧妙な把握データセットを生成します.ランダムな初期手構成から,フォースの閉塞に向けて最適化するために可変な物理シミュレーションを使用します.結果データセット (1.3Mが5Kオブジェクトを把握する) は,新しいオブジェクトに一般化する学習した巧妙な把握プランナーを訓練できるようにします.
UniDexGrasp (Xu et al., CVPR 2023) は強化学習アプローチを採用し,シミュレーションで任意のオブジェクトを巧妙な手で把握するためのポリシーを訓練し,実際のハードウェアに移行します.ポリシーはポイントクラウドと手プロピオセプションを観察し,関節位置コマンドを出力します. UniDexGrasp は,シミュレーションにおける新型オブジェクトの 85%+ の成功を達成していますが,シム-トゥ-リアル転送は依然として課題です.
実用的な推奨事項: 縦爪のグリッパーを使用している場合は,AnyGrasp を使用し始めます. 巧妙な手 (Orca Hand, Allegro Hand, LEAP Hand) を使用している場合は,データ生成のために DexGraspNet を使用し,生成されたグリッパーに関するポリシーを訓練します. RCSV は Orca Hand と互換性のある巧妙な手 を保有し,巧妙なグリッパー計画パイプラインの統合サポートを提供します.
ポイントクラウド対深度画像方法
グラッププランナーが 原深画像や3Dポイントクラウドで動作すべきか?
| Criterion | 点群 Methods | Depth Image Methods |
|---|---|---|
| Multi-view fusion | Natural (register and concatenate) | Requires volumetric fusion (TSDF) |
| Inference speed | 8-15 Hz (PointNet++ backbone) | 20-50 Hz (CNN backbone) |
| 6-DOF grasp support | Native (3D coordinates) | Requires projection/back-projection |
| Clutter handling | Better (3D reasoning) | Struggles with overlapping objects |
| Pre-processing | Downsampling, normal estimation | Minimal (resize, normalize) |
| Best method | AnyGrasp, Contact-GraspNet | GQ-CNN (top-down only) |
混雑した環境で6DOFを捕捉するには,ポイントクラウドの方法が厳格に優れている.固定オーバーヘッドカメラで上下のビニピックリングの場合,深度画像方法 (GQ-CNN) は速く,十分である.スピード要求が深度画像のアプローチを要求しない限り,ほとんどのチームが標準的にポイントクラウドの方法を使用する必要があります.
統合パイプライン
ROS2 + MoveIt2スタックとの標準統合:
ステップ 2: AnyGrasp例: AnyGrasp 輸入 AnyGraspDetector検出器 = AnyGraspDetector (), 検出器.ロード_モデル"チェックポイント_デテクション.tar") # ポイントクラウドを通過して,把握候補者の把握,スコア = 検出器.get_grasps.
実施の主要な詳細:常に作業場の境界線によって候補者をフィルタリングする (テーブルに衝突するまたは腕の範囲外にある把握を排除する),品質スコアの限界を設定する (0.7は良い出発点) そして位置エラーを処理するために最後の5cmのアプローチで阻害制御を使用する. 位置制御から接近距離の阻害制御への切り替えは,信頼性の高い把握のために不可欠です
MoveIt2 統合: 完全なパイプライン 建築
学習したハププランナーを生産のMoveIt2スタックに統合することは,プランナーを呼び出して実行する以上のことを意味します.強力なパイプラインには衝突意識の計画,ハプフィルタリング,接近/撤退軌道の生成,およびバックバック論理が必要です.詳細なアーキテクチャは以下です:
管道ノード (ROS2 Python) を把握する
# grasp_pipeline.py -- Full MoveIt2 + AnyGrasp pipeline import rclpy from rclpy.node import Node from moveit2 import MoveIt2 from geometry_msgs.msg import Pose_msgs.msg import PointCloud2 import numpy as np class GraspPipelineNode: _____((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((( クラップ・トゥ・ワークスペースマスク = np.all((Cloud[:,:3] >= self.ws_min) & (cloud[:,:3] <= self.ws_max),軸=1) cloud_ws = cloud[mask] # 2. 把握検出把握を実行,スコア = self.detector.get_grasps(cloud_ws,top_k=50,適用_nms=True) # 3. フィルターでスコアを絞る 値値値 = [(g, s) g,s in zip(grasps,sores) s >= self.score_thresh] if not valid: self.get_logger().warn('No valid grasps above threshold') return False # 4. 値別に分類して,それぞれを有効に試す.sort(key=lambda x: x[1], reverse=True) for grasp, score in valid[:10]: # try top 10 # 4a. 計算する前 (grip) ポーズ (近付軸に沿って戻る) 方法_vec = grasp.rotation[:, 2] # z-axis =近付前_grasp = grasp.copy() pre_grasp.translation -=近付_vec * self.dist 方法_approach # 4b.両ポーズにおけるIK実行可能性を確認する.self.moveit.check_ik(pre_grasp):継続する.self.moveit.check_ik(grasp):継続する # 4c. 計画と実行方法 self.moveit.open_gripper() 成功 = self.moveit.plan_and_execute(pre_grasp,速度_scaling=0.5) もし成功でないなら:#4dを継続する. 線形アプローチで姿勢を把握する (カーテジアン経路) 路線点 = self.moveit.compute_cartesian_path([pre_grasp,grap],max_step=0.005) if waypoints.fraction <0.95: continue # path too incomplete self.moveit.execute(waypoints.trajectory, velocity_scaling=0.2) # 4e.フォース制御で握手を閉じる.moveit.close_grip(perforce=15.0, width=0.0) # 4f. 撤退 (直升) 撤退_pose = grasp.get_logger() 撤退_pose.translation[2] += self.retreat_dist self.moveit.plan_and_execute(撤退_pose,速度_scaling=0.3) 返信 True self.get_logger().error('All grasp candidates failed') 返信 偽
このパイプラインにおける主要な建築決定:
- 検出前に作業場を切り開くは,背景表面から偽陽性値を減少させ,ポイント数を減少させることで,推論時間を30%~40%削減します.
- 計画前に前チェックは,不可及なハプチャのための高価な動き計画要求を回避します.
- 最終的な接近のためのカーテジアン経路は,握り姿勢に直線的なアプローチを保証します.この経路は,最後の数センチメートル間に衝突を避けるために不可欠です.自由空間運動計画では,近付近の物体を囲む曲線な経路が生成されます.
- 握り具の基準を設定する:食品/電子機器では5〜10N,硬い物件では15〜30N,工業部品では50N+
- トップ10のバックループは,最も高いスコアを得られた握り手が到達できないか衝突した場合の一般的なケースを扱います.実際,最初の到達可能な握り手は通常トップ5の範囲内です.
グラップ計画のためのカメラ校正
グラップ計画精度はカメラからロボットへの校正 (手眼校正) に決定的に依存する. 5mmの校正誤りは,直接 5mmの把握ポーズ誤りに翻訳される.
- 校正データを収集する: 終効果器に (目対手) 搭載された ArUcoボードやチェッカーボードを観察しながら,ロボットを 15-20 のポーズに移動する. 各構成でロボット FK ポーズと検出されたボードポーズを記録する.
- AX=XBを解決する: ツイレンズまたはパーク方法でOpenCVの
T0 を使用します.これはカメラからベースへの変換 (目から手) またはカメラから端のエフェクターへの変換 (目から手) を提供します. - ** 検証:** ロボットにカメラフレームの既知の点に触るように命令する.エラーを測定する. 作業空間全体で10点繰り返す. ターゲット: <2mm平均エラー, <4mm最大エラー.
- 定期的に再校定: カメラマウントの調整,ロボットベースの動き,または気温の大きな変化 (熱拡張は10Cあたり最大1mmまでカメラの位置を変化させる) 後に.
RCSVはRealSense D435iとD405用のキャラマウントをプリキャリブレットして,キャリブレーション精度を <1.5mmを維持しています.カスタムマウントを使用するチームでは,当社のデータサービスにはハードウェアセットアップパッケージの一部として手目キャリブレーションが含まれます.
ハードウェアプラットフォームによるGrap Planner FPS
導入ハードウェアによってインフェレンスの速度が劇的に変化します.これらの数字は,実際のポイントクラウド (ワークスペースの収穫後20K-40Kポイント) でバッチサイズ1で測定されました.
| Method | RTX 4090 | RTX 3060 | Jetson Orin | Jetson Xavier | CPU (i7-13700) |
|---|---|---|---|---|---|
| GQ-CNN (top-down) | 60 Hz | 45 Hz | 25 Hz | 12 Hz | 8 Hz |
| GraspNet-1Billion | 18 Hz | 10 Hz | 5 Hz | 2 Hz | 0.8 Hz |
| Contact-GraspNet | 15 Hz | 8 Hz | 4 Hz | 1.5 Hz | 0.5 Hz |
| AnyGrasp | 22 Hz | 15 Hz | 8 Hz | 3 Hz | 1.2 Hz |
| FoundationGrasp | 5 Hz | 3 Hz | 1.2 Hz | 0.4 Hz | N/A |
| GPD | 8 Hz | 5 Hz | 2.5 Hz | 1 Hz | 0.6 Hz |
実用的な取材: Jetson Orin (モバイルロボットのための標準のエッジ計算) では,AnyGrasp は 8 Hz で反応性把握のための唯一の6DOF 方法です.デスクトップ RTX 3060 では,すべての方法が一度計画して実行するピックプレスタスクで受け入れられる速度で実行されます. 20+ピック/分でコンベイヤーベルトをピックアップするには,デスクトップGPU または Jetson で GQ-CNN (トップダウングリップのみ) が必要です.
対象カテゴリーによる成功率を把握する
リアルワールドの把握の成功は,物体特性に依存する.これらの数字は,Robotiq 2F-85グリッパーでOpenArm 1で複数の公開評価とRCSV内部テストの結果を集計する.
| Object Category | AnyGrasp | Contact-GraspNet | GQ-CNN | Notes |
|---|---|---|---|---|
| Rigid boxes/cans | 95% | 93% | 90% | Easiest category |
| Irregular shapes (toys, tools) | 88% | 85% | 72% | GQ-CNN limited to top-down |
| Small objects (<3cm) | 78% | 72% | 65% | Depth noise dominates |
| Transparent (glass, clear plastic) | 35% | 30% | 25% | Depth sensor failure |
| Deformable (bags, cloth) | 55% | 50% | 40% | Shape changes on contact |
| Heavy clutter (>15 objects) | 75% | 80% | 58% | Contact-GraspNet excels here |
| Flat objects (books, plates) | 82% | 78% | 70% | Side grasps often needed |
言語による操作のためのマスタープランニング
最新世代のハププランナーは言語のコンディショニングを統合し",赤いカップを拾い上げ"や"最も左側のボトルを握る"のようなコマンドを可能にします. これはハププランニング (どのハプポーズが安定している?) とタスクプランニング (どのオブジェクトを握るべきか?) の間のギャップを埋める.
建築パターン: 典型的な言語条件付きの把握パイプラインは3つの要素を連結している. (1) 対象対象対象をテキストクエリから本地化するオープン語彙オブジェクト検出器 (GroundingDINO, OWLv2) (2) 対象対象対象の対象対象対象対象のマスクを生成する分割モデル (SAM, Segment Anything) (3) 対象対象対象対象のマスクを操作する把握プランナー. 部品をそれぞれ独立して交換できる.
#言語_grasp.py -- "語に条件付けられた把握パイプラインを groundingdino.util.inferenceから輸入する gd_predict_anything import SamPredictor import numpy を np def言語_grasp\rgb,深度,プロンプト,把握_デテクター, sam, camera_K) として輸入する. """<unk>T1
このパイプラインは,検出とセグメントのための遅延を80-150ms (RTX 3060) に追加しますが,キャッププランナーは対象対象対象のみを考慮し,ディストリラクターへのキャップを排除するため,タスクレベルでの成功を劇的に改善します.VLAベースの操作システムを構築するチームにとって,言語条件付きキャップは標準的な認識フロントエンドです.
オープンベンチマーク
GraspNet Benchmark: 6DOFの学習の標準評価.88個のオブジェクトを含む190シーンを使用する (見た/類似/小説カテゴリーに分けられる).メトリック:AP (異なる品質のしきい値で平均精度) と異なる摩擦系数での成功率.すべての主要な方法はこの基準で結果を報告し,クロスメソッド比較を簡単にする.
YCB 把握基準: 標準化されたカメラ設定と評価プロトコルを持つYCB オブジェクトセット (77 件の一般的な家庭用オブジェクト) を使用する.GraspNetよりも6DOF方法に焦点を当てていないが,異なるグリッパータイプ間の把握成功を比較するのに有用です.
OCRTOC (Open Cloud Robot Table Organization Challenge): テーブルの操作のためのオンラインベンチマークで,グラッププランニングを構成する. 単独でグラッププランニングではなく,完全なピックプレスパイプラインを評価するのに役立ちます.
失敗 方法 と 緩和 方法
- **透明物体 (ガラス,透明プラスチック):**透明な表面で深度センサーが故障します 構造光とTofの両方には表面反射力が必要である.緩和:触覚検索 (グリッパーを推定接触点に移動する,低力探査機),表面の可視性を高めるために偏光照明を追加する,または深度を必要としないRGBベースの方法 (FoundationGrasp) を使用する.
- 重量物体 付属荷の限界近く: 握手計画では,用荷の限界は考慮されません.腕の用荷の限界に近い物体を間違った角度から握ると,握手が成功するが,トークの限界により引き上げられなくなります. 緩和:握手選択フィルターに用荷の推定を加え (既知の物体の重量からか,最初の接触後に腕のF/Tセンサーからか).
- 薄い物体 <3mm: 標準的な平行爪柄柄はハードウェアの変更なしでは <3mmに近づくことはできません.標準的な物体で訓練されたグリッププランナーはクレジットカード,紙のシート,または薄いプレートに無効なグリップを生成します.緩和:特殊なグリップの幾何学,真空ベースのグリップ,またはハンドと吸いモードの両方のハイブリッドグリップ.
- **高度な混雑したシーン (>20オブジェクト):**点雲の質は物体間の遮蔽により密集な混雑の中で劣化します.Contact-GraspNetは物体セグメントを必要としないため,GraspNet-1Billionよりもこれをうまく処理します.しかし,Contact-GraspNetでさえ15オブジェクト以上の15%の精度低下を示しています. 緩和: 解散策略を使用します 簡単な物体を最初に把握して取り除く. その後,残った難しい物体のために再び現場を観察します.
- 変形可能な物体 (袋,布,軟食): 現在のすべての方法では硬い物体と仮定します. 変形可能な物体は接触時に形を変え,接触前の観測から予測された握り姿勢を無効にする. 緩和:保守的な把握力を用い, [接触力反射]
T5 に基づいて反応性再把握を実行するか,歪み可能な操作戦略を捕捉するタスク特有の示範データを収集する.
RCSVは,操作のために最適化されたRealSense D435iとD405カメラを備えています.また,GraspNetとAnyGrasp用のROS2キャッププランニングノードも備えています. [データサービス](
関連 読書
- [ロボットカメラの設置ガイド]
- [操縦中の連絡部隊]
- [マルチモダルのロボットセンサー]
- [シムからリアルへの転送]
- [ロボットに関する拡散政策]
- [データサービス]
- コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータ
- [語彙]
T16
認識ハードウェアと統合
RCSVは深度カメラ,把握計画ノード,操作感管道への統合サポートを提供しています.
超高級の機械の 製造機







