Blogに戻る

ロボットデータ解析:訓練のためのロボットデモをラベル付けする方法

訓練のためのロボットデモデータを注釈する方法:成功の旗,言語標籤,タスクセグメント,品質基準,ツール,RCSVの注釈パイプライン

[ロボットデータ収集ガイド]

機械学習における最も魅力的でない部分であり,最も影響力のある部分です. 500件のよく記されたデモのデータセットは,2000件以上の誤記されたデモよりもより良い方針を訓練します. ロボットデータにとって注釈の意味とそれを正しく行う方法はこちらです.

ロボットデータ に 関する 注記 意味

画像分類とは異なり,注釈は図面の絵やタベルをクリックする意味を持つ場合,ロボット示範注釈はより豊かで構造化されています. 単一のロボットエピソード 通常 20-200秒の操作 は複数のレベルでラベル付けする必要があります:エピソードが成功か失敗か,どの言語でタスクを記述するか,意味的に異なる段階がどこで始まり,どこで終わるのか,ハードウェアエラーやオペレーターエラーのためにトレーニングから除外されるべきフレームはありますか.

記号は,通常,人間のレビュー者が,関節状態とグリッパー開口のプロットとともに録音されたエピソードのビデオを再現を眺めている.良い記号ツールでは複数のカメラから同時に同期されたビデオを表示し,ロボットのカメラがはっきりと捉えていない視点から成功を判断しやすくします.

記号類型: 完全な分類

ロボットデモデータは,各々のノートタイプをサポートし,それぞれ異なる下流目的に対応しています.ノート予算とタイムラインを管理するために,どのノートが必要か,どのノートが必要か理解することが重要です.

エピソードレベルの注釈

Annotation Type Format Required For Cost per エピソード
Binary success/failure Boolean flag All IL training (ACT, Diffusion Policy, VLA) $0.05-0.10
Language instruction Free-text string Language-conditioned policies, VLA fine-tuning $0.10-0.25
Task category ID Integer enum Multi-task policies, dataset organization $0.02-0.05
デモンストレーション quality score 1-5 integer scale Quality-weighted training, dataset curation $0.10-0.20
Object instance IDs List of string IDs Object-centric policies, diversity analysis $0.05-0.10

フレームレベルの注記

Annotation Type Format Required For Cost per Frame
Task phase segmentation Timestamped phase boundaries Hierarchical policies, sub-task analysis $0.50-2.00/episode
Contact event labels Timestamped contact start/end Contact-aware policies, force control $0.30-0.80/episode
Object bounding boxes 2D bbox per frame per object Object detection, visual grounding $0.05-0.15/frame
Segmentation masks Per-pixel object mask Semantic segmentation, sim-to-real $0.50-2.50/frame
Keypoint annotations 2D pixel coordinates per keypoint Keypoint-based policies, pose estimation $0.10-0.30/frame
Frame exclusion flags Boolean per frame Removing hardware glitches, operator errors $0.01-0.03/frame

ほとんどの模倣学習プロジェクトには,最初の2つのエピソードレベルの注釈 (成功フラグ +言語指導) とオプションのタスクフェーズセグメントのみが必要です.セグメントマスクやキーポイントなどのフレームレベルの注釈は,特定のポリシーアーキテクチャまたは認識前訓練のために必要です.

成功 の 旗: 最も 重要 な 記号

ロボット訓練データセットの各エピソードには,バイナリー成功フラグを記して記せなければなりません. ロボットが任務を成功に完了したかという点です.これはシンプルですが,成功基準は注釈開始前に正確に定義する必要があります. "グラフをプレートに配置する"は,グラフが直直立する必要があるか,ハンドルの方向が重要か,何度位置エラーが許容されるかという点について,仕様が必要です. 同じデータセットに異なる暗示基準を適用する記記者は,トレーニングパフォーマンスを低下させる騒音なラベルを作成します.

記号開始前に,成功と失敗の事例の画像を含む1ページの成功仕様文書を書きなさい.記号を校準するためにこの文書を使用してください. 共有されたエピソードサブセットの記号者間の合意を測定します 合意が90%未満であれば,成功基準は明確化する必要があります. RCSVの注釈パイプラインには,いかなるデータセットも訓練準備が整った前に,明示的な成功基準文書と注釈者間の合意のチェックが必要です.

自動化された成功分類

1,000+エピソード以上のデータセットでは,手動成功ラベル付けが高価になります.自動分類器は,不確実なケースで人間のレビューでラベル付けの大部分を処理することができます.標準アプローチは:

  • ヘーリスティック分類: ルールに基づくチェックは,グリッパー最終状態,エンドエフェクター位置,およびフォース/トークの読み値を使用します.例:ピックプレスタスクではグリッパーが開いているか (解放されているか) を確認し,エンドエフェクターが最終フレームでの目標位置から3cm以内にあるか確認します. 精度>95%で,エピソードの60〜70%をカバーします.
  • 学習した分類器: 手首カメラの最後の10フレームで軽量なCNN (ResNet-18) を訓練して成功/失敗を予測する.訓練のためにタスクごとに200以上の手動でラベル付けされた例が必要です.残りの曖昧なケースを85-92%の精度で処理します.
  • **人間レビュー:**自動分類器が不確実である10〜15%のエピソードを預け (0.3〜0.7の信頼度) このハイブリッドアプローチは,完全な手動ラベル付けと比較して注釈コストを5-8倍削減します.

言語ラベル

言語注釈は,エピソードやエピソードセグメントに自然言語説明を添付する.これらの部分は,タスクがハードコードされるよりも",赤いブロックを拾い上げ"のような指示に従う言語条件のポリシーを訓練するために必要である. 言語注釈は,視覚言語行動 (VLA) モデルとの互換性を可能にし,タスク説明によってデータセットを検索しフィルタリングすることも可能である.

言語の注釈を2つのレベルで書きなさい.短いタスク名 ("カップの配置") と自然言語の指示 ("白いカップを拾って青いプレートに置く") この指示は,ロボットの中身状態ではなく,人間の観察者が見ていることを記述すべきである. 異なる対象の場所 異なる目標の場所 異なる対象の場所 異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる異なる

VLA訓練のための言語記号 最良の実践

OpenVLAやRT-2のような [VLAモデル]の調整を計画している場合は,簡単なタスクラベルよりも言語の注釈は注意が必要です.

  • ** 異なる表現:** すべてのエピソードで同じ指示をコピー・ペーストしないでください. "赤いカップを拾い上げ"と"赤いカップを掴んでそれを上げ"は,異なる表現が類似したアクションに映し出することをモデルに教えてくれます.タスクごとに5〜10の指示変数を目指します.
  • ** 引用式 を 含め て い ます.** "左 に 置いた 物 を 拾い上げ" と いう 代わりに"杯 を 拾い上げ" と いう 表現 を 含め て い ます.
  • 完全な動作を記述する"テーブルから赤いカップを拾って青いプレートに放す"は"カップからプレート"より良い.
  • 一致するオブジェクト名を使用する: "カップ", "mug", "glas"か判断し,データセット内にそれを保持する.不一致な命名は言語エンコードを混乱させる.

強制意識政策の連絡標識

重要な接触力を含む作業では 挿入,組み立て,時間印記された接触イベントのラベルが後に続く表面は,視覚的な注釈で捉えられない重要な情報を提供します. 接触標識は,ロボットが物体と接触するまたは接触を断ち切る枠,接触の種類 (初期接触,持続的な握り,挿入接触,解放) と,手首F/Tセンサーからの接触力大小をマークします.

接触ラベルは力/トークセンサーデータを使用して部分的に自動化できます.F/T信号の限界検出器は接触開始 (力強度が基線より0.5Nを超えている) と解放 (力強度が限界を下回る) を識別します. 人によるレビューは,接触型 (意図的な握り対衝突) を分類し,F/Tの限界値が偶然接触を任務関連であると誤って分類するケースを捕まえることが必要です.

任務分別

連続的な複数のサブタスクを含む長方程の作業では,セグメントラベルは段階間の境界をマークします.テーブル設定タスクは,リーチカップ,グレープカップ,トランスポートカップ,プレイスカップ,リリーズカップに分類することができます.セグメントは階層的な政策訓練,サブタスクレベルの成功メトリック,そして選択的なデータ増強を可能にします. また,手術上のデバッグも可能になります. 輸送中にポリシーが失敗しても,把握中に成功した場合,セグメントラベルはサブタスクの成功率を測定し,最も必要とされるデータ収集の努力をターゲットにします.

分割注釈は成功マークよりも高価で必ずしも必要ではない. 分割を優先する場合は,三つ以上の意味的に異なる段階を持つタスクや階層的なポリシーアーキテクチャを使用する場合は優先してください.

記号 工具 比較

Tool License Video Support Time-Series Multi-Camera Sync Best For
Label Studio Apache 2.0 Yes Limited No (single video) General annotation, extensible via templates
V7 (Darwin) Commercial Yes No No Auto-labeling with SAM, managed workforce
CVAT MIT Yes No No Bounding boxes, segmentation masks on video
Custom Gradio/Streamlit Custom Full control Yes Yes (custom build) Robot-specific workflows with joint state plots
RCSV Platform SaaS Yes Yes Yes (native) Purpose-built for robot episodes with all sensors

ロボットデータのための一般用途の注釈ツール (Label Studio, CVAT, V7) の主な制限は,画像/ビデオ注釈のために設計されていること,同期式多モダルのエピソード注釈ではなく. ロボットデモのレビューには,2~4のカメラストリームとコイントステートタイムシリーズとフォース/トークスプロットが同時に表示され,すべて時間同期される必要がある. 重要な注釈パイプラインを構築するチームのほとんどは,HDF5エピソードを直接読み取れるカスタムなGradioまたは Streamlitアプリで終わります.RCSVの [データプラットフォーム]T2) は,データ収集パイプラインと統合されたウェブベースのインターフェースとして提供します.

記号コスト基準

RCSVの注釈操作に基づいて,以下の各注釈構成の現実的なコスト基準があります.

Annotation Configuration Cost per エピソード Time per エピソード Suitable For
Success flag only (automated + spot-check) $0.05-0.10 5-10 sec ACT, Diffusion Policy (single-task)
Success + language instruction $0.15-0.35 20-40 sec VLA fine-tuning, multi-task BC
Success + language + phase segmentation $0.50-1.50 2-5 min Hierarchical policies, detailed debugging
Full annotation (all above + bboxes) $2.00-5.00 10-20 min Object detection training, perception research
Segmentation masks (per frame, SAM-assisted) $0.50-2.50/frame 30-120 sec/frame Sim-to-real domain adaptation, visual pre-training

順位標識と言語指示 (VLA 細節調整の最も一般的な設定) と注釈された500エピソードデータセットでは,総注釈コストは約75~175ドルです. これはデータ収集コストの小分数であり,決してスキンプすべきではありません.

品質管理: 記者間協定

ロボットデータについては,関連するメトリックはコーエンカパ (二人のアノタータ) またはフレイズのカパ (三個以上) である.

ロボットデータに対するIAAの目標の限界値:

  • バイナリー成功ラベル: kappa > 0.85 (明確な成功基準文書で達成可能)
  • 作業段階の境界線: kappa > 0.75 (境界線の曖昧さは固有である)
  • 証明品質スコア: kappa > 0.65 (質はより主観的で,重量化された kappaはより適切)

基準がこれらの限界値を下回る場合,再開前に注釈基準を改良する必要があります.

  • 低成功ラベル合意: 成功基準文書にエッジケースの写真例を追加する.正確な位置容認を定義する (例えば",対象中心から2cm以内にあるオブジェクトセンター").
  • 低段落合意: 観測可能な物理的な出来事 (griper close on object) において段階の移行を定義する. "approach phase ends"ではなく"gripper close on object"です.
  • 質の低いスコア合意: レベルを5から3レベルに減らします (良い/受け入れられる/拒否される).

注記 品質基準

RCSVはすべてのデータセットに3段階の品質ゲートを適用します. 記録後すぐに操作者の自己注記,訓練を受けた注記者による次次回審査,および共同状態統計と比較した注記を比較する自動一貫性チェック (例えば,グリッパーが閉まっていないエピソードが成功した場合は再審査のためにマークされます).

常見な誤りを検出する自動一致性チェック

  • 終効果がスタート位置から5cm以上移動しない成功ラベルで表示されたエピソード →フラッグ
  • 成功したラベルでラベルを付けられたエピソードは,中期エピソード長さの50%未満 →フラッグ
  • 言語指示では"左"が記載されていますが,すべてのオブジェクトはワークスペースの右側にある →フラグ
  • 段階の分割,どの段階も 0.5sより短く 60sより長くなると
  • 言語指示が同じがタスクカテゴリーが異なる2つの隣接したエピソード →フラグ

RCSVの注釈パイプライン

RCSVの [データ収集サービス] (T3) を使用すると,注釈は配信の一部です.当社のオペレーターは,録音セッション中に成功の旗と言語ラベルで各エピソードを注釈し,注釈チームはデータセット輸出前に次回レビューを行います.高度な信頼性のある注釈,注釈者合意スコア,完全な品質レポートを持つデータセットを受け取ります.

独自の収集されたデータを提示するチームについては,RCSVは以下のレベルでの注釈のみサービスを提供します.

  • 基本 (0.10ドル/エピソード): 既存のラベルのフラッグチェックと清掃が成功しました
  • 標準 ($0.30/エピソード): 成功を収めるフラグ + 言語指示 + 品質スコア
  • Full ($1.50/episode): ステージセグメントと接触ラベルを含むすべての注釈

サポートされているハードウェアプラットフォーム (ALOHA, OpenArm, Franka, UR, Unitree) で収集された既存のデータセットを処理することができます.データセットは,レビューのためにアクセス可能なビデオストリームを持つHDF5またはRLDS形式でなければなりません. 私たちと連絡してください あなたのデータセットの注釈ニーズについて議論するために,または [RCSVデータプラットフォーム](T5を通じて私たちの注釈インターフェースを探索します.

関連 読書