Researchに戻る

ロボット時間: なぜ タイムラインナップが ロボット学習の隠れた瓶頸なのか

カメラ,コイントステート,モーターコマンドの間の時間的な不一致は,構造化されたラベルノイズとしてロボットデモを損なう.RCSVのハードウェア同期データインフラストラクチャは,データ要求を2-3倍削減します.

[←研究]

ロボット学習コミュニティは示範を拡大しています しかしそのデータのほとんどは一時的に汚染されています フィールドはデータ量の問題として扱っていますが 実際にはデータ品質の問題です

13フレーム

タイムラインの誤り = 23x 以上の示しが必要

課題: 構造化されたラベルノイズとして 時間の誤った配列

行動クローンでは,訓練サンプルごとにペア (ot, at) があると考えられる.時間 (t_) の観測と時間 (t_) のアクションがペアされる.実際,ほとんどの収集システムは実際に記録するものは (ot−δo, at+δa), δo と δa が未知である,カメラパイプラインによって導入された変数遅延,OSスケジューリング,バス遅延,制御ループのタイミングである.

これはランダムな騒音ではなく,システムの物理状態と関連している構造化されたラベル騒音です. タイムマスの誤配の大きさはエンドエフェクター速度とともに増加し,接触移行で変化し,制御周波数によって変化し,カメラの曝光時間に依存します. 政策学習にとって 最も重要な瞬間において 迅速な動き,接触イベント,正確な調整において 時間の誤差が最悪です

計算は簡単です.30 fpsで,オフセットの1フレームは33 msです.0.5 m/sで動くロボット腕はフレームあたり16.5 mmを移動します.精度操作作業では,ピグインホール挿入,ケーブルルーティング,接続器配合 16.5 mmの位置曖昧さによって壊滅的です.ポリシーは,一時的に不一致する観測行動ペア間で平均を学んで,タスクの模糊なバージョンを学習します. 適切な調整されたデータで 短期間で得られる成功率に収束するには 2~3倍以上の示範が必要です

研究コミュニティで広く使用されているシステム (ALOHA,UMI,標準USBカメラセットアップなど) は,カメラフレームと関節状態のリドバックの間には20~80 msの測定されていないタイムタイムジッターが示されています.このジッターはほとんど報告されず,ほとんど測定されず,ほとんど修正されていません.

なぜ ソフトウェア の 時刻 標識 が 修正 さ れ ない か

感覚的な反応は,すべての時間を刻むことです.ほとんどの収集コードベースは,各センサーの読み出しにT0またはT1を呼び,問題が解決したと仮定します.それはありません.

ホスト側タイムスタンプは,物理的な出来事が起きたときではなく,オペレーティングシステムがデータを受信したときに測定する.センサーに衝突した光子と記録されたタイムスタンプの間に,複数の変数遅延源が蓄積する.

  • USB投票遅延: USB 2.0 投票は1 ms間隔で; USB 3.0 は125 μs で.しかし実際の転送はホストコントローラーによって予定され,バス紛争によって遅延される可能性があります.測定されたジートル: 110 ms.
  • OSスケジューリング: カーネルは USB インターフェース・ハンドラーをスケジューリングし,その後ユーザスペース コールバックをします.RT でない Linux カーネルで,スケジューリングジッターが 150 ms から行きます. Python プロセスでは,GIL 論争を上部に追加します.
  • カメラローリングシャッター: ローリングシャッターセンサーは,通常1533msの範囲で,異なる時間帯で上下行と上行を暴露します.フレームの"タイムスタンプ"は曖昧です.
  • ネットワークバッファリング: センサーがイーサネット (RealSense USB,ROSトピック DDS,EtherCATモータードライブ) で通信する場合,ネットワークスタックバッファリングは別の変数遅延層を追加します.
  • ** 連続バス遅延:** CAN バス,シリアル UART,およびEtherCATはそれぞれ独自の読み込み遅延を持っています. 8 結合を持つ 1 Mbps の CAN バスでは ~ 1 ms のシリアライゼーション遅延が導入されます. 115200 baud のシリアル UART はより悪い. 結合状態は連続的に読み取られ,したがって,関数 1 と関数 6 は同時にありません.

これらの遅延は個別に小さいが,集団的に変動する.さらに悪いことに,それらは恒常ではない. システム負荷,USBトポロジー,ネットワークトラフィック,そして環境温度 (結晶振動器漂移に影響する) に変化する.ソフトウェアのタイムスタンプは,観測できない遅延を削除することはできません.

ロボット の 時間の 調整 の 4 層

タイムラインを固定するには 4 つの異なる層を扱う必要があります 各層はその下の層の上に建っています

4 について

データセット認証

タイムインチティビティ テンプルインチティビティ テンプルインチティビティ テンプルインチティビティ テンプルインチティビティ テンプルインチティビティ テンプルインチティビティ テンプルインチティビティ テンプルインチティビティ テンプルインチティビティ テンプルインチティビティ テンプルインチティビティ テンプルインチティビティ テンプルインチティビティ テンプルインチティビティ テンプレートインチティビティ テンプレートインチビティ テンプレートインチビティビティ テンプレートインチビティビティ テンプレートインチビティビティ テンプレートインチビティビティビティ テンプレートインチビティビティビティビティ テンプレートインチビティビティビティ

3 について

センサー-アクチュエーター 結合

カメラフレーム 共同状態 モーターコマンド エンコードリードバック 訓練サンプルのあらゆるモードは,同じ物理的な瞬間に縛られている.

2 について

硬件トリガー

シャッターカメラは 外部触発線で 視点を合わせる シャッターがスムーズに 動き回る 時計が 離れている

1 年間

時計同期

PTP (IEEE 1588) またはすべてのデバイスで共有された時計源.すべてのセンサー,アクチュエーター,および計算ノードはミリ秒ではなくマイクロ秒で何時間かを一致します.

ロボット学習の設定の多くはこれらの層を実装しません.一部は部分的に層1を実装します (NTPではなくPTP).ほとんど誰も層24を実装しません.結果として,トレーニングデータの時間配列は不明です.研究者は,基本的な品質が測定されていないデータでアーキテクチャとハイパーパラメータを最適化します.

RCSVのアプローチ:ハードウェアベースの一時的なインフラストラクチャ

RCSVのデータ収集インフラストラクチャは,追加ではなく,デフォルトとして,時間調整の4層をすべて実装します.

  • <5 ms の同期化がすべてのストリームに広がる. ハードウェアで触発されたグローバルシャッターカメラは,共同状態リドバックと同じ触発線で発射します.カメラの曝光,共同エンコーダーロック,およびモーターコマンドタイムスタンプは独立したソフトウェアの投票ループではなく,共有の時計の辺に結びついています.
  • LED + PRBS 段階解読で,実際のキャプチャ遅延測定を行う. 偽ランダムバイナリーシーケンス (PRBS) によって駆動されるLED マレイは,カメラの視野で可視です.キャプチャされた画像のPRBS パターンを解読することによって,カメラファームウェアが導入するパイプライン遅延を含むトリガーからピクセルキャプチャまでの実際のエンドツエンド遅延を測定します. これは校正のステップではなく 連続で実行されます
  • **RCSVが提供するすべてのデータセットの健康測定値のタイミング.**RCSVが提供するすべてのデータセットには,エピソードごとにタイムレポートが含まれます. 最大のジット,平均同期オフセット,減少したフレーム数,および完全なジットヒストグラム.下流消費者は時間質によってサンプルをフィルタまたは体重をフィルタリングすることができます.
  • 結果: 23倍も少ないデモが必要である. 対応した作業 (ピック・プレス,ペグ挿入,ケーブルルーティング) では,ハードウェア同期RCSVデータで訓練されたポリシーがソフトウェアでタイムスタンプされたUSBカメラセットアップで収集された同じ作業と比較して 23倍も少ないデモで,相当の成功率に達します. 操作者がよりよいので示範は良くありません 観測行動のペアが実際に同じ物理的な瞬間に対応しているので

関連 作業

タイムロータ校正は多センサーシステムにおいて長い歴史がありますが,特にロボット学習データ収集コミュニティでは,驚くほどほとんど注目されていません.

  • **Furgale et al., "マルチセンサーシステムのための統一時間および空間校正" (IROS 2013) ** カリブルフレームワークはカメラ-IMUシステムのための共同時間および空間校正を導入した.数ミリ秒の時間偏移は視覚-惰性オドメトリを大幅に低下させることを示した.
  • **Qin & Shen, "モノキュラービジュアル・イネルティアル・システムのためのオンラインタイムカリブレーション" (2018) ** ビデオカメラ-IMU時間のオフセットは,VIO操作中にオンラインで推定され,オフラインカリブレーションの必要性を排除することが示された.
  • **Tschopp et al., "VersaVIS: An Open Versatile Multi-Camera Visual-Inertial Sensor Suite" (2019) ** 硬件触発されたマルチカメラ+IMUシステム,サブミリ秒同期.ロボット学習データ収集に必要な最も近い前駆体,操作ではなくSLAMのために設計されています.
  • **Zhao et al., "低コストハードウェアで精細な二手操作を学ぶこと" (2023) ** ALOHA システムは,USBカメラとDynamixel シリアルバスでソフトウェアタイムスタンプを使用します.タイムラインメントは紙に特徴付けられていないが,複製設定で測定された震動は2050 msです.
  • **Khazatsky et al., "DROID: A Large-Scale In-The-Wild Robot マニピュレーション Dataset" (2024) ** 564シーンで76Kエピソード. ホストサイドタイムスタンプを持つRealSenseカメラを使用します.分布式収集サイトにおける時間調整は標準化されていません.
  • ** Chi et al., "Universal マニピュレーション Interface" (2024) ** UMI は,SLAMベースのポーズ推定とインターポレーションアクションラベルを搭載したGoProカメラを使用しています.インターポレーションステップは,間隔の誤差を暗黙に平滑させるが,それを排除しません.
  • **F2F-AP: "Flow-to-Future Asynchronous Policy" (2026) 異同期観測行動流の学習補償を提案する. 算法的なアプローチでさえ,基礎的真実のタイミングを知ることで利益を得ることを示しています.

シンクベンチ

RCSVはSyncBenchを開発している.時間調整条件が政策業績に影響を与える方法を直接測定する基準である.実験プロトコルはシンプルだが,我々の知る限り,体系的に公表されていない.

  • 同じタスク,同じポリシーアーキテクチャ,異なるタイミング. 3つの条件: (1) ソフトウェアタイムスタンプのみ, (2) 完全同期性のないハードウェアで触発されたカメラ, (3) 上記のように完全な4層のタイムラインニング.
  • タスクスペクトル* 臨時的に許容可能 (ビンピック,ブロックスタッキング) から臨時的に要求可能 ( 0.5 mm 耐容量でペグ挿入,ケーブル糸,USB接続器配合)
  • メトリック*条件:ジッター分布 (p50/p95/p99),政策成功率50/100/200/500の示例,最低の示例で80%の成功を達成し,故障モードの破局 (過失,接触ミス,握り滑り,衝突)

SyncBenchが示すことを期待する. タイムラインニングは,接触豊富なタスクのための建築の選択よりもサンプル効率の予測力が高い. 確認された場合,この分野がインフラ投資とアルゴリズム研究を優先する方法に重要な影響がある.

ハードウェア同期データ収集

RCSVは,サンプルごとにタイムシグネーションを証明する時間調整された示例データを提供します.示例数が少なく,政策の成功率は高くなります.

[我々のチームと話す] [データサービスについて学ぶ] [T3]