Researchに戻る

ロボットデータ フライホイール 実用:実世界の事例研究

機械データフライホイールは 政策のパフォーマンスを <unk> 500回のブートストラップデモから リアルメトリックで 継続的に改善するパイプラインに 変える方法

[←研究]

初期コレクションよりも53%少ないデモを利用して 72%から93%の成功率を上げました

ロボット データ フライホイールとは

ロボットデータフライホイールは,複合的なフィードバックループです. デモンストレーションを収集し,ポリシーを訓練し,展開し,失敗を収集し,再訓練し,繰り返します.各サイクルでは,最後のよりも限界的な努力が少ないので,すべての可能なロボット行動からランダムにサンプルを抽出するのではなく,現在のポリシーが示している失敗モードを正確にターゲットにしているからです.

ステップ4は連続的に繰り返されます: (1) ** 目標任務のために人間の示範データを収集する ** 目標任務のために人間の示範データを収集する (2) ** 訓練する ** 収集されたデータに関するポリシーを訓練または調整する (3) ** 実施する ** リアルまたは半リアル環境でポリシーを実行し,すべてのエピソードを記録する (4) ** 鉱山失敗** どのエピソードが失敗したか確認し,修正的な示範を収集し,トレーニングに戻ります.

このケーススタディは,フライホイルの5つの段階を経由する実際のピックアンドプレイスタスクを記録しています.ロボット:平行爪柄のグリッパー付きの6DOF腕.タスク:固定位置から小さな泡ブロックを拾い,40cm離れた箱に入れておく.オブジェクトの配置は10cm半径内で変化しました.すべてのデータはRCSVのテレオペレーションインフラストラクチャを通じて収集されました.

ステージ1 スタートラップ: 500 デモ,ベースライン 72%

放送局は3人のオペレーターによって2日間にわたって 遠隔操作された 500 件のデモを始めました 平均8秒のエピソードです

評価プロトコル: 許容された半径内にランダムにサンプルを採取した100件の試用物体配置による試用.ブロックが完全にビンの内側に置かれた場合にのみ,試用が成功する.

Phase Total Demos New Demos Added Success Rate
Phase 1 — Bootstrap 500 500 72%
Phase 3 — Failure Retrain 640 140 88%
Phase 5 — Active Learning Retrain 940 300 93%

簡単なピックアンド・プレイスタスクで72%の成功率は低いようです.実態では現実的な出発点です.実在環境には照明変異,グリッパー磨損,シミュレーション前訓練が捉えていないオブジェクト表面変異があります.

ステージ2 失敗鉱山: 140話,2種類の失敗

テスト環境で1週間 (自動展開,人間はいない) に1期間のポリシーが導入された後,記録された500話のうち28%は,結果分類によって失敗として分類された. わずか200本の手書きラベル付きのフレームで訓練されたCNNは",binでブロック"と"binでではない"を検出した.

140回の失敗のうち,質的レビューの後,2つのクラスタが生まれました

  • **近失 (80話):**ロボットがブロックを掴んでゴミ箱に向かって移動したが,早すぎるか間違った角度で放出し,ブロックが跳ね出させた.グリッパー開いているタイミングが根本原因だった.
  • **完全欠陥 (60話):**ロボットが全く把握できなかった 指の配置は35mmで中心から離れている.

操作者はRCSVの人間のレビューキューを通じて140回の失敗エピソードをレビューした.各回の失敗の場合,オペレーターは失敗エピソードを観察し,同じ初期オブジェクト位置から始まる修正デモを記録した.これは政策の最も弱い点を直接扱った140個のターゲットデモを生産した.

ステージ3 ブートストラップのリトレーニング +失敗: 88%の成功率

合計640のデモデータセット (オリジナル500 + 140の失敗目標) で再訓練することで,成功率は88%に上昇し,140の新しいデモで16点の改善となりました.比較としては,第1段階から88%を達成するには,観察された学習曲線傾斜に基づいて約400のランダムに収集された追加デモが必要になると推定しました.

失敗を目標としたアプローチは,ランダムな収集よりも約2.9倍ほどサンプル効率が高く, 72%から88%までのギャップを埋めるために使用された.

ステージ4 積極的な学習:不確実性旗の集合

流通政策は集団の意見の不一致によって暗黙の不確実性を生む. 騒音予測頭部と標識されたエピソードを3つの小さな組を追加しました. 予測された行動軌道の間の意見の不一致が限界を超えた場合.

1,000 以上の自動展開で,20% (200 件) が高い不確実性として標識された.オペレーターは標識されたセットをレビューし,さらに200 件のために修正示例を収集した.アクティブ学習基準は,これらのデモが実際の分布差をカバーすることを保証した.

5 段階 最終訓練: 93% の成功率

940のデモ (500のブートストラップ + 140の失敗目標 + 200のアクティブ学習) で再訓練は93%の成功率を達成しました.学習曲線は経験的に目に見えるように平ら化しました.この作業は,不減な環境騒音 (ライトの閃き,時間とともにグリッパー磨損) のせいで95%に近い天井に達しているようです.

飛行車 を 運ぶ ため に 必要 な インフラ

滑走車は純粋にML問題ではなく,インフラ問題です.ループを信頼に適した方法で閉じるには以下のコンポーネントが必要です.

  • 部署記録: ロボットエピソードはすべて,RGB,プロピオセプション,および結果メタデータで同期的に記録する必要があります.完全なログがなければ,故障マイニングは不可能です.
  • 結果分類器: 自動でエピソードを成功または失敗として標識する迅速で信頼できる分類器. 規模で手動に標識付けすることは瓶頸である. 数百のラベル付きフレームで訓練された単純なCNNでさえ多くの作業に十分である.
  • 人間レビューキュー: 操作者が失敗したエピソードを視聴し,修正デモを記録するためのUI. キューは操作者に修正デモを起動する初期状態を表示する必要があります. RCSVの データ収集プラットフォーム は標準機能としてこのキューを含む.
  • 自動訓練トリガー: 排列に十分な数の新しいデモが蓄積された場合,訓練は自動的に起動する必要があります. 手動オーケストレーションはループのカデンスを壊します.
  • ロールバック付きのモデルレジスタ: 新たに導入されたチェックポイントは,プロモーション前にバージョン化され,以前の展開と比較されなければなりません 成功率の低下は自動ロールバックを誘発します.

メトリック:デモ効率曲線

このタスクタイプでは,合計デモと成功率の間の経験的関係がロガリズム曲線に従います. の"膝"は,限界収益が急激に低下するの円柱が,簡単なピックアンドプレイスのために600800の円柱に現れる.膝の向こうでは,5%の追加改善により,前5%の改善に比べて35xの多くのデモが必要になります.

滑走車はこの曲線の形を変えることはありません. 滑走車はそのようにします 冗長な簡単な示範で新しいデータを稀化するのではなく,故障モードを直接ターゲットにすることで,曲線の最もった部分で常に動作することを保証します.

ローイン比: フライホイール vs アップフロント コレクション

学習曲線からの抽出は,約2000回のデモが必要だと示唆しています. フライホイールアプローチは93%に達し,合計940回のデモで53%より効率的です**

RCSVの標準的な収集率は,デモごとに48ドル (タスクの複雑さに依存して) で,単一のタスクで節約される金額は4,240$8,480です. 10つの異なるロボット行動を展開する組織では,フライホイルのアプローチは,フライホイルの展開後生成する継続的な改善を考慮する前に,ポリシー生成ごとに$42K$85Kのデータ収集コストを節約します.

自動管理データパイプラインのデータフライホイールを RCSVがどのように実装できるのかを調査します [データ収集サービス] (T3) または [Fearless Platform] (T4)

データを動かす

RCSVは,初期デモ収集から自動故障採掘および再訓練パイプラインまで,エンドツーエンドデータフライホイールインフラストラクチャを提供します.

[データサービスを探求]