人 の 循環 の ファースト クラス の 学習 信号
なぜ人間の修正や介入,操作者の行動が リアルなロボットシステムにおける 一流の学習信号として扱われるべきか
[←研究]
なぜオペレーター修正,回復,介入が 現代のロボットデータパイプラインの設計を 形作るべきか
人々の貢献が監督になる
介入 回復電車
ロボット学習システムは,人材を一時的なエスカファルトとして扱う.初期に示範を収集するのに役立つが,訓練中に政策が実行されるとほとんど無視される.実際,それは間違った抽象である.人間の行動は単なるブートストラップツールではありません.作業の意図,失敗の境界線,回復戦略を理解するために利用可能な最も豊かな信号の一つである.
信号 の 住み
価値は成功の示範に限らず,休憩,軌道中修正,グリップ調整,再試行動,操作者が作業が失敗すると気づき,ロボットが間違った行動に踏み込む前に戦略を変更する瞬間に現れる.
データ 設計 に 関する 重要 な 理由
チームが最終的な成功軌道を保存するだけで,成功の達成方法を説明する大きな構造を捨て去る.欠落した瞬間は,政策がより堅固になるのに役立つものなのです. 漂流からどのように回復するか,接触前にどのようにゆっくりするか,部分的な失敗の後,どのように再接近するか,そして,政府の推定が少し間違えるとどのように反応するか.
捕まえるもの
- 介入
人間が任務を逆転させたり,その方向に押し戻す時 - 修正
専門家による判断を反映する姿勢,力,または順序の小さな変化 - ** 退出** 失敗したまたは部分的な試みで,課題の真の困難を明らかにします.
- タスクメタデータ 操作者の身分,難易度タグ,背景が選択変更の理由を説明する.
実践 的 な 結論
リアルロボットシステムを構築するチームは,人間の入力を"真の"自律走行軌跡の周りの騒音として扱うのをやめなければならない.これは,実際に望む政策行動の最も明確な表現である.良いデータセットは,信号を単純化された成功のみの再生に崩すよりも保存する.
ベストプラクティス
[デモを集める方法] (T1
よりよい人間主導のデータループを設計する
操作者のワークフローや 遠隔操作ループや 介入意識のあるデータセットを 構築している場合は パイプラインを構造化するのに役立ちます
[要求データ]







