化身AIが説明され:何なのか,なぜ重要なのか,そしてどこに向かっているのか
なぜ世界との物理的な相互作用が AIにとって次の境界線であり 現代のロボットチームにとって意味を明らかにする
[←ブログ]
言語モデルは情報を変革します 身体的なAIは物理的な作業を変革します インフラストラクチャの課題は根本的に異なります
人工知能とは何か?
身体化AIは,物理的な体を通して物理の世界を認識し行動する人工知能システムを指す. 単離してテキストや画像を処理するだけでなく,物理的な体を通して行動する. ロボット,自動運転車,義肢,物理空間と相互作用する拡張現実システムはすべてこの定義に該当する.
"体現"の区別は問題の中心的な制約を変化させるため重要である.言語モデルは,明確に定義された,逆転可能な領域内の分断トークンで動作する. 身体化されたAIシステムは連続的な物理状態で動作します 動作は逆転できない (落下されたオブジェクトは"undropped"することはできません), 部分的な観測可能性は避けられない (カメラはオブジェクトの後ろを見ることができない) そして遅延要求はリアルタイムです (2秒間の推論遅延はロボットが壁に駆動する原因です).
具体的には,GPT-4は500msでプロンプトを処理することができ,ユーザはほとんど気づかない. 10Hz制御周波数でピックアンドプレイスタスクを実行するロボット腕は決定サイクルごとに100msを持っています. 神経ネットワークの推論が80msと残りの20msがセンサー読み取りとモーターコマンド送信によって消費されれば,ネットワーク遅延,ゴミ収集の休憩,または予想外の計算ピークの差がゼロになります.このリアルタイム制約はモデルサイズからデプロイメントハードウェアまで,体現されたAIのあらゆる建築決定を形作ります.
肉身の仮説
ロドニー・ブルックス氏は1980年代に知性を世界との物理的な相互作用から分離することはできないと主張した.最も豊かな認知能力は抽象的なシンボル操作ではなく,感覚運動経験から生まれる.これは議論の余地のある主張であったが,過去3年間のAI開発は,そのバージョンに対する間接的な証拠を提供している.
テキストのみに訓練された大きな言語モデルは物理的推論における一貫した欠陥を示します ブロックの積み重ねが落ちるか否かを信頼できる予測したり,スイッチを絞るのに伴う力を記述したり,正しい空間関係を持つ物理的な行動の配列を計画したりすることはできません. GPT-4 は"堆積ブロック"の安定性テストに失敗し,18ヶ月のヒトにとって驚くような速度で失敗する.
最近のGoogle DeepMind (RT-2, 2023) の研究で,最も直接的な証拠が示されている.視覚言語モデルがインターネットスケールでテキスト/画像データとロボットインタラクションデータの両方で共同訓練されたとき,データ源だけでは生成できない物理的な推論能力が発達します. 比較的小さなスケールでも ロボット相互作用データによって 物理,物体の永続性,空間関係に関するモデルが 認識できるのは 消極的な観測ができないからです
組み込み AI ハードウェアスタック
身体化されたAIシステムは3層のハードウェアスタックに構築されています 世界を認識するセンサー,認識処理とアクションを生成するコンピューティング,そして物理的に実行するアクチュエーターです.このスタックを理解することは,身体化されたAIシステムを構築または評価するすべてにとって不可欠です.
センサー: ロボット が 見る と 感じる 方法
ビジョン (RGB カメラ): ほとんどの操作作業の主要な感知モードです.標準設定では2-3台のカメラを使用します.手首に搭載されたカメラは,近距離操作ビュー (Intel RealSense D405,300ドル),作業場コンテキストのオーバーヘッドカメラ (Basler acA1920,800ドル),選択的に深度解明のためのサイドビューカメラです. 解析度が640x480で30fpsで,政策訓練の現在の甘い点です 解析度が高く,ほとんどの作業に比例して利益のないデータ量を増やします.
**深度感知:**ステレオ深度カメラ (RealSense D435i) や構造化された光センサーは,物体形や姿について幾何学的推論を可能にする3D点雲を提供している.RGBのみが曖昧である透明または反射性のある物体を含む作業では深度が不可欠である. RealSense D435i は 1280x720 の解像度で深さを提供し, 2m 範囲で0.2% の深さ精度が テーブルタップ操作に十分である.
プロピオセプティブ (関節エンコード): ロボット関節には位置 (そしてしばしば速度とトーク) を報告するエンコードがある.このプロピオセプティブストリームは,ロボットの自己モデルの基礎である.宇宙で自分の体がどこにいるかを知ること.関節あたり14-16ビット (回転あたり16,384-65,536のカウント) のエンコード解析は,研究級の腕で標準です.
力・トルクセンサー: 6軸力・トルクセンサー (ATI Mini45,$3,500) が,操縦中に腕に設置され,接触力測定する.接触力のある作業には不可欠である. F/Tセンサーなしでは,ロボットは"物体を軽く触る"と"物体を粉砕する"の区別を視力によるもの以外はできない.
触覚センサー: 進化する境界.ゲルサイート (指先あたり200500ドル) とパクシニ触覚手袋のような触覚センサーは,触覚の点での接触幾何学と圧力の分布を提供します.MIT (アグラワールラボ) とMetaの研究により,操作政策に触覚センサーを追加することで,形形形や脆弱な物体での触覚成功率は1525%向上することが示されています. RCSVは [店舗]
計算: 端末処理
組み込まれたAIコンピューティングは2つの競合要求の交差点に位置する:モデルがタスクを一般化するのに十分な大きさでなければならないが,推論はリアルタイム制御のために十分な速度でなければならない.
| Compute Platform | Inference レイテンシ (10M param policy) | Power | Price | Use Case |
|---|---|---|---|---|
| NVIDIA Jetson AGX Orin | 5-15ms | 15-60W | $1,999 | On-robot deployment |
| RTX 4090 workstation | 2-8ms | 450W | $8,000-12,000 | Lab research, training + inference |
| Intel NUC (CPU only) | 50-200ms | 28W | $800-1,200 | Simple policies, classical control |
| A100 80GB (cloud/cluster) | 1-5ms | 300W | $15,000+ | Training, large model inference |
傾向は明らかである.ジェットソン級ハードウェアで生産のために,GPUワークステーションを開発および訓練のために展開する.クラウド推論は 20-100msのネットワーク遅延を加え,リアルタイム操作制御には受け入れがたいが,高レベルのタスク計画には受け入れられる.ハイブリッドアーキテクチャ 計画のためのクラウド,制御のためのエッジは標準化されています.
動力: 物事 を 動かす
動力装置は電気信号を物理的運動に変換する.動力装置の技術を選ぶことで,ロボットの速度,精度,力出力,および適合性 (意外な接触力を安全に吸収する能力) が決定されます.
Servoモーター (ダイナミクセル,フィテック):$2,000~10,000の範囲の研究腕のデフォルト.Dynamixel XM430伺服器は4.1Nmトーク,12ビット位置解像度,およびシリアルバスでアクセス可能な内蔵PIDコントローラを提供します.全OpenArmプラットフォームはDynamixel servosで動作します.詳細については,当社の [ハードウェアページ]
ブラシレスDCモーター +ハーモニックドライブ: 商業コボット (UR,Franka,Kinova) に使用される.趣味のサーボよりも高トーク密度,低反響,より優れたトークセンサーを提供します.フランカ・リサーチ3の各コイントのトークセンサー (0.05 Nm解像度) は,接触力豊富な作業で優れた阻害制御を可能にします.
近直駆動 (QDD): Unitree G1の人形といくつかの新しい研究プラットフォームで使用される新興アクチュアートアーキテクチャ.QDDは,本質的にバックドバイブルな低比ギアボックス (6:1〜9:1対100:1のハーモニックドライブ) を使用し,ギア列を損傷せずにロボットの関節を外部勢力が押し付けることができる. この特性は,人間とロボットとの安全な相互作用や,従順な操作行動学習に不可欠です.
訓練データ要件:人工知能とLLM
言語モデルとは根本的に異なるもので,この違いを理解することは,人工知能を組み立てたプロジェクトを計画する人にとって不可欠です.
| Dimension | LLM Training Data | 身体化されたAI Training Data |
|---|---|---|
| Source | Web crawl (passive) | Physical teleoperation (active) |
| Cost per unit | ~$0.001/token | $3-80/demonstration |
| Collection speed | Millions of tokens/second | 30-60 demos/hour/operator |
| Largest dataset (2026) | 15+ trillion tokens | ~1M episodes (Open X-Embodiment) |
| Data reusability | Universal (text is text) | Embodiment-specific (data from one robot has limited transfer to another) |
| Quality bottleneck | Filtering web noise | Operator skill + consistency |
言語モデル革命を推進したデータフライホイールは物理的な世界のために 意図的に設計されなければなりません パーソナル的にパシブなインターネットデータから生じるものではありません これはRCSVが解決するために存在する構造的な問題です [データ収集インフラストラクチャ] (T3
重要 な 研究 グループ が フィールド を 駆動 する
機械機械の研究は,強力な ML 能力と活発なロボットハードウェアラボを組み合わせる数々の機関に集中しています.誰が何をしているのかを理解することで,チームは潜在的協力者を特定し,自身の仕事を基準に設定し,その分野がどこへ行くのか予測することができます.
**スタンフォード (IRIS Lab, SVL):**チェルシー・フィンンのIRIS Labは,ロボット適応のためのメタ学習に関する ALOHA (双手通信, 2023),モバイル ALOHA (2024) と基礎的な研究を制作した.フェイ・フェイ・リの SVLは,家庭用作業のための BEHAVIOR基準套路を開発した.ドルサ・サディッヒのグループは人間とロボットとの相互作用と優先順位フィードバックから学習に取り組んでいます. スタンフォード大学の集団生産は 他のどの機関よりも 現在のITワークフローを 定義している可能性が高い.
UC バークレー (BAIR): ピーター・アビルのグループ (Cofounder.ai/Physical Intelligence) は早期政策学習を制作した.セルゲイ・ルヴィンのグループは,SAC,AWAC,Bridge Data V2を含む基本的なRL-for-robotics研究を推進した. Octo財団モデルはバークレー・スタンフォード・CMUの協力から生まれた.
**CMU (ロボット研究所):**ディーパック・パタックのグループは好奇心に基づく探査と交代体移植に取り組んでいます.デイヴィッド・ヘルドのグループは変形可能なオブジェクト操作に焦点を当てています.CMUの強みは,限られたデータから学習し,シミュレーションと現実との間の転送にあります.HomeRobotのベンチマークといくつかの重要なシム-トゥ-リアル技術がここで起源です.
MIT (CSAIL): Pulkit AgrawalのImprobable AI Labは触覚操作と接触豊富な作業に取り組んでいます.Russ Tedrakeのグループは Drake (シミュレーションと最適化フレームワーク) を開発し,操作のための全体の計画に取り組んでいます.Daniela Rusの分散ロボットグループでは多エージェントの連携を探求しています. 物理を基礎とした学習を補完するために物理的理解を用いた操作の物理を基礎としたアプローチです
Google DeepMind Robotics: RT-1, RT-2, RT-Xシリーズがビジョン言語行動 (VLA) モデルパラダイムを定義した.Open X-Embodimentプロジェクトでは22の機関から約1Mのロボットエピソードを最大規模のクロス-エンボディメントデータセットに統合した. ディープマインドの利点は 規模です 数百のロボット腕を複数のサイトで操作し 学術研究室が 匹敵できないデータ量を生成します
物理知能 (Pi): スタンフォード/ベルケルキーロボット学部 (チェルシー・フィン,セルゲイ・ルヴィーン,カロル・ハウスマン,ブライアン・イッチャー) によって設立. Piは,多様な操作データに訓練された一般主義的なロボット政策を Pi-0を開発した.彼らのアプローチは,異なったデータ源の予備訓練と特定のタスクのための微調整を強調する.
現在 の 能力: 実際 に 2026 年 に 機能 する もの
真の能力を 試作品から分離するには 複数のラボで 再現可能な結果を見なければなりません 単一の現場での示範ではなくです
操作 (武器 + 握手)
- 構造化ピックアンド・プレイス: 90~98%の成功率は,既知のポーズで既知の物体で.これはアマゾン,バークシャー・グレイなどで商業的に展開されています. "構造化"資格は重荷を担っているという警告で解決されています.
- オープン語彙把握: 60~75%の成功は,言語を特定した目標を持つ新型オブジェクトで ("赤の杯を拾い上げ") です.OpenVLA,Octo,RT-2はすべてこの能力を示しています.研究デモには十分良いが,監督なしで展開するにはまだ信頼性がない.
- コンタクトに富んだ組み立て: 課題特有の政策で成功は70
90%です. 課題ごとに2001,000回のデモで訓練されています. ACTと拡散政策は支配的なアプローチです. 課題特有のデータ収集が必要です ゼロショット組み立てはまだありません. - 変形可能なオブジェクト操作: 折りたたむタオル,手袋,ケーブルルーティングなどの作業で40~70%の成功.変形可能なオブジェクトは,認識し予測することが難しい無限次元状態空間があるため,操作における最も困難な境界線であり続けています.
移動
- **四重動力:**平坦で穏健な地形に対応する.Unitree Go2,Boston Dynamics Spot,および ANYmalは,信頼性の高い横断階段,砂岩,斜めをすべて使用します.RL訓練された動力政策 (アイザックラボ/Gymで訓練された) は,信頼性の>95%で実際のハードウェアに移行します.
- 双脚歩行: 制御された環境で信頼性がある.Unitree G1とFigure 02は平地で1.5〜2.0m/sで歩いている.荒れ果てた地形と動的な障害回避は依然として活発な研究である.RCSVのサンフランシスコ研究所で利用可能である
- ヒト体全体制御: 特定の作業 (椅子から立ち上がり,歩いている間に物体を運ぶ) に目的とした特定の場所での示例. まだ一般化できない
自動運転車
- **Waymo:**はフェニックス,サンフランシスコ,ロサンゼルスで700以上の自動運転車を運営し,測定されたメトリックでは人間の運転手よりも安全性が高い.約2Mの有料乗車が完了しました.
- **テスラFSD:**高速道路や構造道路における自律の監督. 艦隊から数十億マイルもの人間の運転データを訓練. まだ完全に自律的ではない.
ビジネス の 応用 が 新たに 登場 し て いる
実施されたAIは単なる研究分野ではなく,現在特定の垂直領域で商業的価値を生み出しています.現在,どのアプリケーションが商業的に実行可能か,研究段階に残っているかを理解することで,チームが正常に優先順位を設定するのに役立ちます.
倉庫自動化 (NOW): 現在,現役AIの最大の商業用途である.アマゾンは,完成ネットワーク全体で750,000以上のロボットを運営している.倉庫ロボットへのアドレッシング可能市場は2028年までに15億ドルの推定である.主な課題は,物資対人輸送,パレット化,パレット化,現行のグリッパーが処理できるSKUの60〜80%のパーツピックリング. [倉庫 ROI分析]
**農業収穫 (NOW):**AgrobotとAppHarvestのような企業は,草
医療物流 (NOW): Diligent Roboticsの Moxiロボットは,米国10以上の病院で配送のために部署されています.その核心機能はナビゲーション +シンプルなオブジェクト輸送です.
**建設・検査 (EMERGING):**ボストン・ダイナミックス・スポットは建設現場に進行監視と危険検出のために部署されています.危険環境におけるバルブを回すことやライトスイッチを操作するような作業のために操作能力 (スポット+アーム) が試行されています.
**食品調理 (研究):**いくつかの企業 (ミソロボット,シェフロボット) は単作業の食品調理ロボット (バーガーを折りたたみ,トッピングを配達) を展開している.一般化料理は研究段階に固執している.スタンフォード大学のミミキジェーンとロボカサ基準はこれを前進させている.
実施されたAIインフラにおけるRCSVの役割
身体化されたAIは,物理的なデータ収集,ハードウェアアクセス,統合専門知識といった明確なインフラストラクチャのボトルネックを持っています. RCSVはこれらのそれぞれに対応します.
ハードウェアアクセス: サンフランシスコとオールストン施設は,OpenArm 1 ($4,500,オープンソース 6-DOF),DK1双手システム,Unitree G1ヒューマノイド,および専門プラットフォームを含む20以上のロボットにアクセスできます.チームには,月額800ドルから [ハードウェア]
データ収集サービス: 訓練を受けたオペレーター,標準化されたプロトコル,自動化された品質パイプラインによるプロフェッショナル示範収集. 価格はパイロット (50 示範) に 2,500 ドル,標準キャンペーン (500 示範) に 8,000 ドルから開始. HDF5, RLDS,または LeRobot 形式で配信されたデータ.現在の価格とタスクカタログについては [データサービス]
プラットフォーム: RCSVデータプラットフォーム はデータセット管理,エピソードビジュアライゼーション,品質スコア付け,標準トレーニングフォーマットへの輸出を提供する.LeRobot,Octo,OpenVLAトレーニングパイプラインと統合するように設計されています.
訓練インフラ: 標準と優先順位列のオプションを持つ政策訓練のために8x A100 80GB GPUクラスターが利用可能.典型的なターンアウト:標準政策サイズでは4-12時間 (ACTは200デモ,ディフュージョン政策は500デモ).
実践 的 な 時計
| Timeframe | 身体化されたAI Milestone | Key Enablers |
|---|---|---|
| 2025-2027 | Specialized task robots deployed at scale in logistics | Mature grasping policies, falling hardware costs |
| 2026-2029 | General-purpose manipulation in semi-structured environments | Foundation models for manipulation, large-scale data |
| 2028-2032 | Generalist mobile manipulation in unstructured home environments | Sim-to-real at scale, tactile sensing maturity |
| 2030-2035 | Humanoid robots performing non-trivial physical labor | Whole-body control, dexterous manipulation breakthroughs |
| 2035+ | Broad humanoid deployment across manufacturing, services, elder care | Cost reduction, regulatory frameworks, social acceptance |
現在,AIシステムを組み立てているチームは,この曲線の最も初期の部分で最も利活的な部分に取り組んでいます.現在構築されているデータインフラストラクチャ,オペレーターパイプライン,評価フレームワークは,全領域の軌道を定義します.RCSVの [プラットフォーム]
身体化AI を 始める
組み立てられたAIプロジェクトを検討しているチームなら, 実践的なチェックリストです
- あなたの任務を正確に定義する. "一般用途のロボットアシスタント"は任務ではありません. "コンベッダーベルトからボトルを取り出してパッケージボックスに置く"は任務です.特異性によりデータ収集の計画が可能になります.
- あなたの作業に合致するハードウェアを選択してください. $4,500 のOpenArm が処理できる作業のために5万ドルの腕を買わないでください. 7-DOF を必要とする作業のために6DOF の腕を買わないでください. [ロボット腕の購入ガイド]
- データ収集予算. 課題特定政策のための200
1,000のデモ,または基礎モデルを細かく調整するための20100のデモを計画する. 標準データ収集キャンペーンのための予算は3,000~15,000ドル. [コスト分別] - 模倣学習から始めましょう. ILは,リテート・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・アップ・・アップ・アップ・・アップ・・・アップ・・・アップ・・・・・アップ・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・・
- 厳格な評価. 部署に期待される条件の全範囲で少なくとも50回の政策評価試験を実施する.訓練環境で90%の成功を達成する政策は,略微異なる部署環境で60%を達成する可能性があります.
関連 読書
- 物理的なAIがソフトウェア AIとどのように異なるか
- 質の枠組み
- [2026年のロボットデータ収集コスト]
T15 ) 完全コストモデル - 抱きしめて顔のロボット学習図書館を始めました
- ゼロショット対少数のロボット政策
T17 リアルな期待 - RCSVデータサービス
専門的なデータ収集 - 機械と部品
組み込みAIのための適切なインフラストラクチャを構築する
RCSVは,次世代の物理AIを構築するチームのためにデータ収集,ロボットハードウェア,トレーニングプラットフォームを提供しています. 2,500ドルでパイロットまたは月800ドルからリースハードウェアを開始します.
[データサービスを探求] (T20







