ロボット操作のための多モダルのセンサー:視力,力,触覚融合
強力なロボット操作のための視力/トルク,触覚センサーを組み合わせる方法 センサー融合アーキテクチャと実践的実装
部分: [ロボット兵器ガイド]
[←ブログ]
センサーの各形態は他の機能の故障をカバーする.問題なのは,複雑性のない組み合わせ方法です.
なぜ 単一 形態 の 感知 が 短く 衰える の です か
視覚のみによる操作は接触に失敗する.ロボットが物体に指をつけると,カメラから接触ゾーンを遮断する.接近中にうまく動作する視覚的ポリシーは,作業の精密接触段階中に分解する.
フォースのみ制御 (阻害制御,フォースセルボ) は空間情報がない.接触が起こるときを検出し,接触力を調整できるが,正しい表面に触っているか,握り姿勢が安定しているか,物体が移動しているかなど,分からない.
タクチルセンサーだけでは,接触幾何学情報が豊富に提供されますが,空間範囲は限られています. 接触点には既に存在する必要があります.
これら3つの組み合わせは,各形態の失敗モードをカバーし,単一の形態よりも実質的に強力な政策を生み出します.
センサー モダリティ比較
| Modality | Range | Bandwidth | Spatial Resolution | Failure Mode | Cost |
|---|---|---|---|---|---|
| RGB camera | 0.3-5m | 30-200 Hz | Sub-pixel (0.1-0.5mm) | Lighting, occlusion, specular | $100-1,200 |
| Depth (structured light) | 0.1-3m | 30-90 Hz | 1-5mm depth error | Transparent, outdoor, multi-cam interference | $200-600 |
| Wrist 6-axis F/T | Contact only | 1,000-7,000 Hz | N/A (single point) | No spatial info, measures sum of contacts | $1,500-8,000 |
| Tactile array | Contact only | 100-500 Hz | 1-3mm per taxel | Limited area, wear, calibration drift | $300-5,000 |
| IMU (wrist-mounted) | Local motion | 200-1,000 Hz | N/A | Drift, bias, limited to acceleration/rotation | $5-50 |
| Audio (contact microphone) | 0-2m | 16-48 kHz | N/A | Background noise, non-contact states | $10-100 |
機種別によるハードウェア推奨
視力 (RGB + 深さ)
第三者オーバーヘッド: Intel RealSense D435i ($250). テーブルタップ操作研究のための標準. 30fps深さ + RGB で 640x480 . 座標位置と校正については,私たちの [カメラ設定ガイド] (
近距離腕時計カメラ: Intel RealSense D405 ($300) 〜50cm範囲の深さ,またはFLIR Blackfly S BFS-U3-16S2C ($450) 全球シャッター RGB 最大226fpsで. D405は近距離深さのために最適化されています 接近段階の手と目調整にとって重要です.
ステレオを追加する時: 範囲内 (1-5m) の深さが必要で,構造的な照明の干渉が懸念される場合 (複数のカメラまたは屋外),ZED 2のようなステレオカメラ (450ドル) を使用してください.ステレオ深さは太陽光で動作し,他の深さカメラに干渉しません.
力/トーク
予算オプション: ロボティク FT 300 ($1,500-3,000). 100 Hz, +/-0.1N精度. 一般的な操作,握力制御,衝突検出に十分な.ユニバーサルロボット腕と直接統合される.
研究オプション: ATI Mini45 ($5,000~8,000). 7 kHz, +/-0.05N精度.精度挿入および組み立て作業のための黄金標準. サブミリメートル許容量のある作業に必須.制御モードについては,当社の [連絡力ガイド]
ソフトウェアのみオプション: ロボットのダイナミックモデルからのコイント・トルク推定.無料,常に利用可能だが,精度が +/-0.5Nm に限られている.衝突検出と粗い接触感知に使用可能.フランカ (内蔵コイント・トルクセンサー),UR (外部トルク推定) とほとんどの近代兵器で利用可能.
触覚
**オプティカルタクチル (GelSight Mini):**300600ドル.3060Hzで高解像度接触画像 (640x480点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点点
容量マレイ (XELA uSkin):$1,500~5,000. 100-500 Hz で 1 タクセルあたり3軸の力を提供します. スリップ検出,接触局所化,リアルタイムフォース分布モニタリングに最適です. 巧妙な手配合のためによりよい形状因子です.
Paxini触感センサー: $500-1,500. 1mm空間解像度で分布した正常 +切断力, 200 Hz. RCSV 備蓄 パキシニセンサー
IMU
手首に搭載されたIMU (BNO055またはICM-42688-P,$5-50) は高周波加速と方向性データを提供します.操作中に衝撃事件を検出し,道具の使用中に振動サインを測定し,カメラフレーム速度は不足しているときに高周波運動フィードバックを提供するために有用です. IMUは追加できる最も安価で統合できる最も簡単なセンサーです
音声
接着器や腕に搭載された接触マイク (約10~100ドル) は接触イベントの音声サインを捕捉します.最近の研究 (ガンディ&ピント,2020;クラーク等,2023) では,オーディオは有用な接触情報を提供していることが示されています. 音声は現在の操作システムの中で最もあまり使われていない手法です 追加しやすい,軽量で驚くほど情報提供的です
センサー融合の方法
早期融合: センサー機能ベクトルをポリシーのネットワークに単一の入力に結合する.実装は簡単.訓練と部署時間の両方ですべてのセンサーが存在することを要求します.
遅い融合: 各モードの独立エンコーダーを訓練し,後には,アクションヘッドの前に注意力またはコンカネーションをボトルネック層に組み合わせます. 欠けているセンサーに対してより堅固です. 必要な場合,デプロイメント中にモードの貢献を隠すことができます.センサー故障が現実的な可能性のある生産システムに推奨されます.
クロスアトテンショントランスフォーマー融合: 各センサーの出力をトークン配列として扱って,トランスフォーマークロスアトテンションを使用して,モダリティが互いに関わるようにします.これは最近の基礎モデルで使用されたアーキテクチャです (OpenVLAは視覚トークン +言語トークンとクロスアトテンションを使用します).遅い融合よりも表現力が高いが,効果的に訓練するためにより多くのデータが必要です.
階層融合: 作業の異なる段階では異なる方法を使用します.アプローチ計画 (長距離),接触検出とコンプライアンス (中距離),微妙な操作 (接触) のタクティルの力.これは神経ネットワークの意味での融合ではありません. 学習融合よりも実装しデバッグすることが簡単で,作業段階が明確に分離できる場合,学習されたアプローチを上回る.
ROS2 テーマ同期化
マルチモダルのシステムにおける最も一般的な実装課題は時間同期です.センサーは異なる周波数で動作します (カメラは30Hz,F/Tは1kHz,タクチルは200Hz) そして異なる遅延率を持っています.
# ROS2 Python:カメラ,F/T,および共同状態輸入メッセージ_フィルター_フィルターをセンサー_msgs.msg輸入画像,JointStateから幾何学_msgs.msg輸入 WrenchStampedクラスマルチモダルのシンク(ノード): def __init___self: super(__init___('マルチモダルの_シンク') #各モードのサブスクリプション self.cam_sub =_filters.SubscriberImage, '/camera/time/image_messages_App.gms_message_rench_joints.Subscriberwrench_joints.subscriberwrench_force: 'sub_wrench_force/sub_wrench_Hz: '\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\
通信の最大限許容時間差を決定する.最も遅いセンサーの期間 (33ms 30 Hz カメラ) に設定する.データ収集のために,各センサーの原始タイムスタンプを記録する. 視力と力データ間の10ms以上の同期エラーが政策訓練を悪化させる
カリブレーション要件
| Sensor | キャリブレーション Type | Frequency | Time Required | Critical Error If Skipped |
|---|---|---|---|---|
| RGB camera (fixed) | Intrinsic + extrinsic (hand-eye) | Monthly or after any adjustment | 15-30 min | 5-20mm position error |
| Wrist camera | Eye-in-hand calibration | Monthly | 20 min | 2-10mm position error |
| Wrist F/T sensor | Bias removal (tare) + tool weight | Daily (tare) / monthly (full) | 2 min (tare) / 15 min (full) | 1-5N force bias error |
| Tactile array | Flat-surface zero + known-force check | Weekly | 10 min | 10-30% force reading error |
| IMU | None required (auto-calibrates) | N/A | 0 min | Minimal (bias drift is auto-corrected) |
電力と重量予算
ロボット腕に追加されたすべてのセンサーは,腕の有用荷とパワー引き金を増加させる.有用荷容量が限られた腕 (例えば,OpenArm 1 1の有用荷で1kg,ViperX 300の 750g) において,センサーの重量予算は狭い.
| Component | Weight | Power | Notes |
|---|---|---|---|
| RealSense D405 (wrist) | 52g | 1.5W (USB) | Lightest depth camera for wrist |
| ATI Mini45 F/T | 92g | 2.5W | Plus 50g for cable/connector |
| GelSight Mini | 35g per finger | 1W (USB) | Adds width to finger — check gripper clearance |
| XELA uSkin pad | 15g per pad | 0.5W | Thinnest tactile option |
| Paxini tactile sensor | 20g per pad | 0.5W | Best resolution/weight ratio |
| IMU (BNO055 breakout) | 3g | 0.01W | Negligible weight and power |
| Contact microphone | 5g | 0.01W | Negligible weight and power |
完全なマルチモダルの腕首のスタック (D405 + ATI Mini45 + 2x GelSight Mini) は約265gで7Wを抽出する.これはフランカ・リサーチ3 (3kgの有用荷) の予算内にあり,グリッパーと組み合わせるとOpenArm1 (1kg) の有用荷を上回ります.腕を選択する前にセンサースタックを計画するか,グリッパーの後残った有用荷に基づいてセンサーを選択します.
実践的な実施勧告
- スタートポイント 視力のみ: オーバーヘッドカメラ + 腕カメラ.この設定は,操作作業の70~80%に十分で,力や触覚ハードウェアを必要としません.
- 接触型タスク: 手首F/Tセンサーを追加する. 6軸のウィークルにより接触検出と力調整ができるようになり,挿入と組み立て作業の性能が劇的に向上します.
- **外部の操作:**触覚センサー (GelSightまたは容量マレイ) を追加する.高解像度接触幾何学により,手による再握りしめと滑り検出が可能になります.
- **フルマルチモダルの:**ビジョン+F/T+タクティル+IMU+オーディオ.マルチモダルの学習に関する研究またはあらゆる可能な信号が役立つ作業 (例えば,自動手術ロボット工学,電子機器の組み立て) にのみ必要である.
- 先駆的なモードを追加しないでください: 各追加モードは,データ収集の複雑性 (すべてのセンサーの記録による示例が必要),注釈オーバーヘッド,トレーニングの複雑性を追加します.特定の故障モードを入力するとセンサーを追加します.
訓練データへの影響
マルチモダルのポリシーでは,すべてのセンサーモードが同時に記録されるデモが必要です.つまり,データ収集セットアップには,すべてのセンサーが収集時に同期にキャリブラし,ログ付けする必要があります.既存の視覚のみのデモにフォースまたはタクシルのデータをリートロープすることは不可能です.
実践的な戦略は,すべてのデモを全センサーセットで収集し,その後,アボレーションモデル (ビジョンのみ,ビジョン+フォース,フルマルチモダルの) を訓練し,それぞれを評価する.これは,特定の作業のための各センサーモードの限界値を教えて,将来のデータ収集投資を情報化します.
RCSVの [データ収集設定] (
関連 読書
- [操縦中の連絡部隊]
- [ロボットカメラの設置ガイド]
- [ロボット訓練データガイド]
- [ロボットデータ注釈]
- [VLAモデル説明]
- [Grasp計画調査]
- [データサービス]
- コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータの コンピュータ
- [語彙]
T16
マルチモダルのロボットデモデータを収集する
RCSVのデータ収集インフラストラクチャは,視力,深さ,力モードのための同期された多センサー記録をサポートします.
[データサービスを探求]







