Blogに戻る

ゼロショット対少数のショットロボット政策:現実的な期待を設定

2025年のゼロショットと少ショットロボット政策の実績を正直な評価します 達成可能なこと,どの課題について,そしてまだ話題になっていること

[←ブログ]

ゼロショットロボティクスとは 単純な作業で 制御条件で 対象が分布しているものです

定義

ゼロショットとは,新しい作業を実行したり,新しいデモなしで新しいオブジェクトを操作したりするということです. ロボットは,訓練前学習の過程で学んだことに完全に依存します. Few-shotは,新しい作業に適応し,新しいデモを5〜50回とします.これらは,意义ある異なる能力であり,それらを組み合わせることで不現実的な計画が生じる.

ゼロショット の 現状

ロボット操作のための基礎モデル OpenVLA, Octo, RT-2 は,トレーニング配分内の単純な作業で本物のゼロショット能力を示しています.複数のラボで検証され再現された結果は:

  • オープンな語彙の物体検出 + シンプルな上から下へ把握計画作業 清潔な表面に直向で提示されている一般的な家庭用物体の約60%のゼロショット
  • 以前に調査された環境における言語条件付きナビゲーションは構造化された設定で75%の成功率でゼロショットで動作します
  • 既知のオブジェクトカテゴリー (mugs,ボトル,ブロック) を選択して置くことは,標準基準で OpenVLA で 50-65%の成功を達成します.

ゼロショットが信頼に適さない場合:精度作業で5mm以下の配置,巧妙な操作,新しいツールの使用,オブジェクトが非定規 (傾いたボトル,積み重ねられたカップ) の存在を伴う作業,および訓練データで十分に表現されていない変形可能なオブジェクトを含む作業.

短縮 調整: より 実践 的 な 能力

基礎モデルが最も明確な実用的な価値を示すのは,短縮された微調整 (20~100回の新しい作業の示例) です.

Training Approach Demos Required Typical Success Rate Time to Train
Foundation model, zero-shot 0 30–65% (simple tasks) N/A
Foundation model + 20 demo fine-tune 20 70–80% 30 min GPU
Foundation model + 100 demo fine-tune 100 80–90% 2 hr GPU
Train from scratch (ACT) 500 75–88% 3–4 hr GPU
Train from scratch (Diffusion) 1000 82–92% 8–12 hr GPU

基礎モデルの優位性は,データ低 (100件未満) の制度で最も顕著である.20件以上のデモで,精細な基礎モデルが,ACTをゼロから訓練する500件以上のデモで達成できる成功率を達成する.これは25倍以上のデータ効率の向上です.

今日 ゼロ ショット が 効く

  • ** 構造化物品の収集と明確な物品検出:** DETIC + GraspNet 式のオープン語彙検出 + シンプルな把握プランナーは,組織化されたゴミ箱の通常の物品に対してゼロショットで動作します.これは今日電子商取引と物流のために生産準備が整っています.
  • **Vision-Language Navigation (VLN) モデルは,理解するよう訓練された空間でゼロショットで動作し,異なる建物における同じレイアウト空間に良好な一般化を行います.
  • カテゴリー別物認識と分類: RGB分類による言語条件の分類 ("赤の項目を左の箱に入れ") は既知のカテゴリーではゼロショットで動作します.

できない場所 (それでも)

  • 接触型操作: 穴内ペグ,スナップコネクタ,折りたたみ布,脱落カップ ゼロショット成功率は現在の基礎モデルでは10~30%です.生産では信頼性がない.
  • 新作ツールの使用: 未知のツール (缶開機,特定のスクラウドライバー) を使用すると,ゼロショットはまだ信頼性がない.少ショット (20-50 デモ) は機能する.
  • **外部の操作:**すべての生産モデルでは,手で再握り,指制御を用いたオブジェクトの回転

財団モデル基準結果 (2025-2026)

Model Provider Zero-Shot (SimplerEnv) 20-Shot Fine-Tune Parameters
OpenVLA Stanford/TRI 48-62% 72-80% 7B
Octo Berkeley 35-55% 65-78% 93M
pi-0 Physical Intelligence 55-70% 78-88% 3B
RT-2-X Google DeepMind 50-65% 75-85% 55B
ACT (from scratch) Stanford N/A 40-55% (20 demos) 12M

これらの数字は,制御されたラボ環境における単純な操作基準 (ピック・プレス,ドラフト開き,ボタンを押す) の性能を表しています.実際の展開数は,通常照明変異,背景乱雑,オブジェクト多様性によって基準条件で表現されないため,10〜20パーセントポイント低くなります.

数ショットデータ効率曲線

実践者にとって最も価値のある洞察は, 精細調整示例の数とパフォーマンスがどのようにスケールされるかです. 公開された結果とRCSVの内部評価に基づいて:

  • 5 示例: 基礎モデルではゼロショットよりも5~15%の改善を示しています.ゼロからトレーニングは信頼性の低い政策を生み出します. 基礎モデルの利点はここでは最大です.
  • 20の示例: 基礎モデルの細かな調整の理想点.ほとんどのモデルはこの時点で最終的なパフォーマンスの7080%を達成します.ゼロからACTは通常4055%に達します.前訓練とゼロの間の差は20~30%パーセントポイントです.
  • 50のデモ: 基礎モデルが天井に近づく (8088%). スクラッチ訓練モデルが差を縮小し,よく収集されたデータで6075%に達する.コストの差は大きい.50のデモは200~500ドルでRCSVの料金で,基礎モデルに投資した数ヶ月前の計算と比べて費用が大きい.
  • 100例示例: 基礎モデルの微調整は,ほとんどの作業で減少する収益に達します. スクラッチ訓練のモデルがさらに追いつく (75-85%). 実用的な問題は,残ったパフォーマンスギャップが推論のために3-7Bパラメータモデルを使用する複雑さを正当化するのかという問題になります.
  • 500の示例: スクラッチ訓練されたACTと拡散政策は,通常,精細調整された基礎モデルに一致するまたは超えます.このデータ量では,単作業部署では,プレトレーニングの利点が最小です.複数の作業の通用化では,基礎モデルが優位性を保持します.

決定マトリックス

Scenario Recommendation Why
Quick feasibility test, simple task Zero-shot with OpenVLA/pi-0 No data cost; instant evaluation
New task, limited budget (<$2K data) Foundation model + 20-50 demo fine-tune Maximum performance per dollar
Production deployment, single task ACT/Diffusion from scratch, 300-500 demos Smaller model = faster inference, simpler deployment
Multi-task deployment (10+ tasks) Foundation model + per-task fine-tuning Shared backbone amortizes model cost
精度(再現性) task (sub-2mm tolerance) Scratch Diffusion Policy, 500+ demos Foundation models lack precision for tight tolerances
Edge compute (Jetson, no GPU server) Small model from scratch (ACT 12M params) 7B VLA models cannot run on edge devices

身体体格差: なぜ ゼロショット が 見た目より 難しい の です か

NLPにおけるゼロショット性能はモデルスケールによって信頼性が向上します.70B言語モデルは7Bモデルよりもゼロショットテキストタスクで一貫して優れている.同じスケーリング関係はロボット基盤モデルには当てはまらない.そしてなぜ現実的な期待を設定するのに重要なのかを理解することは重要です.

基本的な課題は体現格差です.テキスト (普遍的なトークナઇઝેશનがある) と異なり,ロボットアクションは体現格特異的です.フランカ・リサーチ3用の7DOFの共同速度コマンドは6DOFのOpenArmまたは異なる運動連鎖を持つモバイル操作器にとって意味がありません. 現在の基礎モデルは,アクションスペースの正常化 (すべてのロボットを共有7DOF表示にマッピングし,多または少なかれDOFを持つロボットの情報を失う) または実施形態特有の出力ヘッド (出力ヘッドを校準するために目標実施形態の少なくともいくつかの示範を必要とする) によって処理します.

これは,新しいロボット実施形態では"ゼロショット"が機能的に不可能であることを意味します. 既存のアーキテクチャでは常に少なくとも校正ステップが必要になります. 今日機能するゼロショット機能は,モデルが訓練された同じ実施形態の 新しい作業にゼロショットです. 新しい実施形態への移行は常に最小限で少ない.

認識差は第2の大きな課題である. 基礎モデルは特定のカメラ,照明,背景を持つ特定の研究室で収集されたデータセットで訓練されます. 異なる視覚条件を持つ新しい環境で展開された場合,視覚エンコーダーの表現は変化し,政策のパフォーマンスを低下させます. 訓練データに似た研究室で収集されているゼロショット番号は,現実世界番号よりも10~20パーセントポイント高い.訓練中のドメインランダム化と視力言語前訓練の両方が助けになるが,今日ではこの差を完全に埋めるものではありません.

アクション分布差. 異なるタスクには基本的に異なるアクション分布があります.ピックアンドプレイスは,離散的な把握/リリースイベントを伴うが,拭きは連続的な接触維持を伴う.ピックアンドプレイスデータに主に訓練された基礎モデルは,視覚的理解が完璧に転送されても,接触豊富なタスクでゼロショットパフォーマンスの低下を伴う. 訓練前のデータにおけるタスク多様性は,ゼロショット通用化におけるデータセットサイズよりも重要である.

線路コストと遅延の比較

ゼロショット対少ショット議論ではしばしば見過ごされる要因は,生産中の基礎モデルを実行する推論コストである. 7Bパラメータ VLA モデルには推論のために専用GPUが必要です (クラウド上で最低 A10G, ~$0.75/時間) そして,アクション દીઠ100-300ms遅延を導入します. 12Mパラメータ ACT モデルは,200$のジェットソン オリンナノで動作します.

規模展開 (10+ロボット) において,基礎モデルのGPU推論コストは年間5万ドルを超えることが可能で,より小さなタスク特有のモデルを訓練するための十分なデータを収集するコストよりも高い.これは反直感的な経済論である.データ収集に投資する (一度のコスト) は,基礎モデルのための継続的な推論コストの支払いを上回るより安価である可能性があります.

実践 的 な 導き

基礎モデルでも新しいタスクの **200-500 のデモを計画する.ゼロショットパフォーマンスは,測定すべきボーナスであり,仮定すべきベースラインではありません.ゼロショットがタスクの60%以上の成功を達成した場合,予定より早めに自らを考慮してください.30%を達成した場合,計画された微調整データ収集を進めます.

RCSV [データサービス]T1) チームは,収集の時間軸にコミットする前に,あなたの特定の課題をゼロショット可行性について評価し,現実的な示範予算を推奨することができます.

関連 読書

  • RL vs.模倣学習決定ガイド - ゼロ/少数の質問に先立つより広範なトレーニングアプローチ決定
  • ロボットデータ収集コストの割れ - 精細調整に必要なデモの予算計画
  • LeRobotガイド -- ショット・ショットとゼロからのアプローチのためのACTと拡散政策のトレーニング
  • [ロボット訓練データに何が良いのか?] T5) - 低データシステムにおけるすべての示範の価値を最大化する
  • 基礎モデルと物理的なAIにおける役割
  • RCSVプラットフォーム --データセット管理とモデルトレーニングインフラストラクチャ
  • [データサービス] T8] - 精細調整のために必要な20-500のデモを収集する

作業 に 適した データ 予算 を 設定 する

RCSVは,ゼロショットと少ショットの実行可能性について,あなたの作業を評価し,適切な示範量を推奨することができます.

[我々のチームと話]