Blogに戻る

ロボット学習と古典ロボット:どれを使うか (2026)

ロボット学習対古典ロボット:認識計画制御パイプライン,端から端まで学習された政策,ハイブリッドアーキテクチャ,そして2026年に各アプローチが勝利するときにカバーする実用的な意思決定枠組み

[←ブログ]

議論はどちらのパラダイムが良いかではなく,ある状況においてどちらを目指すべきか,そして,ますます,それらを一つのシステムにどのように組み合わせるかを知ることについてです.

クラシックロボット:認識計画制御パイプライン

クラシックロボット工学は,明示的で手工によるパイプラインに従います.認識アルゴリズム (しばしば構造化された点雲処理,CADモデルマッチング,または校正されたステレオビジョン) は,幾何学的シーン表示を生成します.計画層 (RRT*,CHOMP,軌道の最適化,またはモデル予測制御) は,衝突のない目標への経路を計算します. 制御層 (PID,インペダンスの制御,またはコンピュータ・トーク制御) は,緊密なリアルタイム保証で計画された軌道を追跡する.各段階には,エンジニアが検査し,デバッグし,公式に検証できる明確な入力,出力,故障モードがあります.

このアプローチの強さは微妙ではない.古典的なコントローラは,決定性遅延で1kHzの制御速度で動作する.彼らは,ライパノフ分析を通じて公式な安定性保証,制御障壁機能を通じて安全制約,そしてよく理解されたコスト機能を通じて軌道最適性を提供する.彼らは訓練データを必要としない. 失敗すると 失敗モードは 解釈可能で 認識エラー 実行できないプラン 追跡過失です 規制者が"なぜロボットがそうしたのか"と尋ねる環境で ロボットを部署する人なら誰でも 学習された政策ができない答えを クラシック制御が提供します

限界は同様に明らかです.手工製のパイプラインは,設計者が予想しなかった条件に脆弱です. 透明な物体では,刷り込み金属部品に調節された感知モジュールが失敗します. 構造化された作業所のために最適化された運動計画器は混乱に失敗します. 硬い握り付けに調節された阻害制御器は,変形可能な物体では失敗します. クラシックシステムを新型状況に拡張するには より多くの技術が必要であり データではなく 費用の規模が 処理する必要がある 限界ケースの数と一致します

クラシックツール 深層ダイビング: IK,運動計画,力制御

クラシックスタックにおける特定のツールを理解することは,どの部品を学習に置き換えるか,どの部品を保持するか,チームにとって不可欠です.

逆動力学 (IK). 望ましいエンドエフェクターポーズを考慮すると,IKはそれを達成する関節角を計算する.特定の幾何学 (ほとんどの工業腕) の6DOFロボットには分析的なIKソリューションが存在し,マイクロ秒で実行する.7DOF冗長腕 (フランカ,OpenArm,Kinova Gen3) のために,KDL,TRAC-IK,またはIKFast計算ソリューションのような数値IKソリューションは1-10msで実行する. IKは信頼性があり,高速でよく理解されています. 学習したコンポーネントに置き換える理由はほとんどありません. 完全に学習したポリシーでさえも,通常 IKを通じて共同コマンドに変換されるエンドエフェクター目標を生成します.

** 運動計画.** RRT* (ラピッド・エクプローティング・ランダム・ツリー,最適変数) とその衍生品 (BIT*,CHOMP,STOMP) は,共同空間またはタスク空間における衝突のない軌道を計算する. 計画時間は,単純な環境では50msから混雑したシーンでは2-5秒までです. 重要な制限:プランナーは正確な衝突モデルが必要で,既知のオブジェクト幾何学 (CADモデルから) またはリアルタイム認識が必要である.混乱した未知の環境では,認識ボトルネックがクラシックな計画に脆くする.MoveIt2は,ほとんどの研究部門のサポートで標準的なオープンソースの動き計画フレームワークである.

フォースコントロール. 阻害と入門制御は,ロボットとその環境の間の機械的相互作用を調節する.阻害制御により,ロボットが質量噴泉ダッパーシステムのように振る舞う.外部力がエンドエフェクターに作用する際,ロボットが指定された硬さとダッパーに応じて生産する. 受け入れ率制御はこれを逆転させます ロボットは力・トルクセンサーデータを読み取って 測定力誤差に比例する位置修正を生成します これらのコントローラは数学的に優雅で調節可能で 証明可能な安定性がありますが ロボットの動力学と接触モデルパラメータを正確に理解する必要があります フォースセンサー統合について詳しくは, [F/Tセンサーガイド]T6 を参照してください.

**クラシック知覚パイプライン.**典型的な構造化知覚スタック:RGB-Dカメラは点雲を捕捉します.平面分割は表を削除します.ユークリッドクラスタリングは個々のオブジェクトを隔離します.各オブジェクトクラスタは,知られたCADモデルライブラリ (ICPまたはPPFマッチングを使用して) に匹配して6DOFポーズを推定します. このパイプラインは,既知の物体 (サブミリメートルポーズ推定) に正確で,モデルライブラリにない物体では完全に失敗します.新しい物体ごとに新しいCADモデルまたは手動の校准ステップが必要です. 学習の認識に向かってチームを駆動するエンジニアリングコストです.

ロボット学習: 終末から終末まで 学習された政策

ロボット学習は,手工によるパイプラインをデータ駆動モデルに置き換えます. [模倣学習] (T7) では,神経ネットワークは人間のデモ (カメラ画像とロボット関節状態) を観察し,観察から行動への直接マッピングを学習します.強化学習では,エージェントはシミュレーションまたは現実世界における試行錯誤を通じて学習します. 視言語行動 (VLA) パラダイムでは,大型訓練前のモデルは自然言語のタスク指示と視覚観測を入力として取り,出力としてモーターコマンドを生成します.

学習された政策の決定的な利点は,知覚的な複雑性と環境の変動を暗示的に処理することです.30種類のカップ,5つの照明条件,およびさまざまなテーブルポジションで500回の"カップを拾い上げ"の示しで訓練された政策は,明示的な特徴エンジニアリングなしで31番目のカップに一般化する表現を学ぶ. このポリシーには認識モジュール,計画モジュール,制御モジュールなどありません. ピクセルとプロピオセプションを共同コマンドにマッピングする単一モデルがあり,関連する抽象はエンジニアによって設計されたデータから学ぶのではなく,データから学ばれます.

この能力はコストを伴う.学習された政策は不透明である:失敗すると,障害が認識的,計画関連,または制御実行エラーかどうかを診断することは困難である.彼らは,通常,模倣学習のための数百から数千の示例,または強化学習のための数百万のシミュレーションステップなどの実質的なトレーニングデータを要求する.彼らは正式な安全保証を提供していない. 訓練の分布から ほんの少しだけ 転移する際には 予測不能な方法で 行動が変化します

クラシック ロボット が 勝利 する 時

精密組成と加工. 既知の幾何学でミリメートル以下の重複性を要求する作業.CNC加工,半導体ウェーファー処理,PCB部品挿入,精密溶接は,古典的なコントローラが日常的に達成し,学問的な政策が保証できないすべての Tolerances要求です. 環境が完全に指定され,物理がよくモデル化された場合,クラシック制御は部署速度が速く,操作が信頼性が高くなります.

既知の構造環境. 制御された照明,固定物体の位置,予測可能な物理を備えた自動車の組み立てライン,医薬品パッケージング,物流分別システム等は,古典的なロボット学の自然領域です.すべてのケースをカバーする技術投資は有限で管理可能です. 機械が直面するあらゆる状況を処理する 決定的なコントローラを作成できるのに 訓練データを収集する理由はありません

安全性・重要なアプリケーション. 臨床制御に利用可能な公式の検証ツールから,手術ロボット,人間近くで働く協力ロボット,および規制認証を必要とするあらゆる部署が恩恵を受けます. 制御障壁機能,アクセス可能性分析,最悪の状況の軌跡境界は,古典的なシステムに学問された政策がまだ達成していない安全保証レベルを与えます.例えば,FDAは現在,学問された手術制御政策をエンドツエンド認証する経路がありません.

低遅延要求* 高速ピックアンドプレス,バランス,または接触敏感な組み立てなどのミリ秒未満の制御応答を必要とするアプリケーションは,古典的な制御ループが提供する決定的なタイミングを必要とします. ニューラルネットワーク推論は,最適化されたハードウェアでも,制御速度は500 Hz 以上で問題となる変数遅延を導入します.

ロボット の 学習 が 勝利 する 時

構造化されていない環境. 倉庫の缶詰に混合物を分類し,混雑した家の中を移動し,食堂やレストランで作業する物体レイアウトが絶えず変化する.何千もの SKU ジオメトリを介して缶詰を拾うための古典的なコントローラを書くことは,終わりのないエンジニアリングプロジェクトです. 異なるデモに関する学習された政策を訓練することは,減少するが継続的な収益率を持つデータ収集プロジェクトです.

外部の操作** 指のレベル調整,変形可能な物体の操作,または接触力のある相互作用を必要とする作業.洗濯物を折り畳み,結び目をつなぎ,柔軟なケーブルを挿入し,食品を調理する作業は,分析的にモデル化するのに非常に高価な物理を伴う. 訓練データを通じて 暗黙に適応し,行動の物理的な結果を観察する学習された政策は,どんなエンジニアリングコントローラーよりも,これらの作業をはるかに自然に処理します.

** 対象例を一般化する.** 特定のカップではなく,どんなカップでも拾い取る必要があるとき. 特定の床地図ではなく,どんなオフィスでも移動する必要があるとき. 料理ロボットがどんなパスタ箱でも扱う必要があるとき. 部署がカテゴリー内の新しいインスタンスを扱う必要があるとき,さまざまなトレーニングデータから学んだ表現は不可欠になります. クラシック知覚は 新しい物体変異ごとに 再設計が必要になります

"テーブルをきれいに 拭いなさい". "物品を 運送する 途中で 変化 を 起こさない よう に 包装 し て ください". "花 を 魅力 的 に 整理 し て ください". 模倣学習は,望ましい行動の示範から暗黙に作業を学習することによって,仕様の問題を完全に回避します.

比較表

Dimension Classical Robotics Learned Policies Hybrid
Control frequency 1 kHz deterministic 10-50 Hz variable 100-1000 Hz (classical inner loop)
Novel objects Requires new models Generalizes from data Learned perception + classical plan
Safety guarantees Formal verification available No formal guarantees Classical safety envelope
Setup time Weeks-months (engineering) Days-weeks (data collection) Weeks (both)
Debugging Inspect each module Black-box, need ablation Learned modules harder
Deformable objects Very difficult to model Learns from demonstrations Learned contact + classical motion
Scaling cost O(edge cases) engineering O(data diversity) Both, but reduced

既存のチーム の ツール 比較

Tool Category Classical Stack Learning Stack
Middleware ROS2 Humble/Iron LeRobot, RoboCasa, robomimic
Motion planning MoveIt2, OMPL, Drake N/A (end-to-end)
Perception PCL, Open3D, FoundationPose DINOv2, SigLIP (learned backbone)
Simulation Gazebo, Drake Isaac Sim, MuJoCo, Genesis
Control ros2_control, impedance/admittance ACT, Diffusion Policy, VLA inference
Languages C++ (real-time), Python (scripts) Python (PyTorch), C++ (deployment)

ハイブリッドアプローチ:学識ある認識 +古典的な計画 +学識ある制御

2026年に最も効率的なロボットシステムがハイブリッドであり,支配的な構造として現れた特定のハイブリッド構造は詳細に理解に値する.

学習感知層. 神経ネットワーク (しばしばDINOv2や CLIPのような訓練前の視覚基盤モデルで,タスク特有のデータに細かく調整されている) はカメラ画像を処理し,構造化されたシーン表示を生成します. 物体ポーズ,意味的なラベル,表面の正常値,把握候補. これは,クラシックシステムの壊れやすい手工による認識を,照明,テクスチャ,オブジェクトインスタンスの間で一般化する学習された表現に置き換えています.認識層は10-30Hzで実行され,構造化されたデータを出力します.

**クラシック計画層.**モデル予測制御器 (MPC) またはサンプリングベースのプランナーは,認識されたシーン状態を把握し,衝突のない動的に実行可能な軌道を計算して,タスク目標を達成します. この層は感知モジュールからの清潔な幾何学的な表現で動作し,クラシック計画が優れているすべての安全制約,関節制限,最適度基準を適用します.計画は10-50Hzで実行されます.

**低レベルの学習制御.**接触型作業では,学習された残留ポリシーは, [フォース・トーク・センサ] (T8) のフィードバックと接触の視覚観測に基づいて,実際の時間で古典的なコントローラのコマンドを調整します. この装置は,古典的な制御モデルが故障する形形形形物と接触動力学のケースを処理し,古典的な制御装置は,全体的な軌跡構造と安全包みを提供します.残留政策は100-500 Hzで実行され,古典的な制御出力に修正を加えます.

このアーキテクチャは,両方のパラダイムの強さを捉えます.学んできた知覚は視覚的複雑さを処理します.クラシックプランナーは安全保証と解釈可能な行動を提供します.学んできた残留コントローラーは分析的にモデル化できない接触動態を処理します. グーグル・ディープマインドの操作システムや数々の生産部署されたアマゾン倉庫ロボット細胞,および複数の外科ロボットプラットフォームは2026年にこの建築の変異を使用します.

既存のクラシックロボットチームへの移行経路

学習能力を増やしたいと 提案するステップは以下です

  1. 第1段階:認識のみを交換する. 手工によるオブジェクト検出とポーズ推定を学習モデル (FoundationPose, Grounding DINO,または精細調整されたDINOv2検出器) に交換する.あなたのクラシックプランナーとコントローラを変化させないようにしてください.これは最も低リスクの学習導入であり,通常は最大の即時改善を提供します (CADモデルなしで新しいオブジェクトを扱う). タイムライン:統合作業の2~4週間
  2. **第2段階:学習の把握計画を追加する.**分析の把握計画 (もしあるなら) を学習の把握品質予測器 (GraspNet, Contact-GraspNet,または AnyGrasp) に置き換える.学習モデルでは,予測成功によって得点を獲得した把握候補者を提案し,クラシックプランナーは選択した把握への軌道を生成します.時間軸: 2-6週間.
  3. フェーズ3:学んできた残留制御を追加する. クラシックインペダンシーコントローラが苦戦している接触型作業では,クラシック輸出に修正を加える残留ポリシーを訓練する. 100-200 回の接触段階の示範のみを収集する (完全な作業ではない).残留ポリシーでは,クラシック制御がモデル化できない"最後のセンチメートル"を処理する. タイムライン:データ収集を含む4~8週間
  4. 4段階:エンドツーエンド評価. 学習されたコンポーネントの経験がある後は,学習されたエンドツーエンドポリシー (ACTまたは拡散ポリシー) が特定のタスクでハイブリッドスタックを上回るか評価してください.一部のタスクでは,答えはイエスです.特に視覚的複雑性と適度な精度要求の高いタスク. 精密作業では,ハイブリッドアプローチは通常,勝利を続けます.

RCSVは, [データサービス] (T9) を介してこれらの各段階のデータ収集を提供することができ,エンジニアリングチームはハイブリッドアーキテクチャ設計について助言します. [RCSVプラットフォーム] (T10) は,ROS2ベースのクラシックワークフローとPyTorchベースの学習ワークフローの両方をサポートします.

実践 的 な 決定 枠組み: 5 件 の 疑問

新しいロボットアプリケーションを起動する際には この5つの質問に答えることで アプローチを決定できます

1.環境は完全に指定され安定しているか もしそうなら (工場ライン,清潔室,構造化倉庫細胞) クラシック制御から始めましょう. 学習された方法よりも速く,信頼性が高く展開します. もしそうでないなら (家,レストラン,構造化されていない倉庫) 少なくとも認識層で学習が必要です.

**2. 機械がこれまで見たことのない物体に出会う場合,学習した認識と,おそらく学習した方針が必要. クラシック的な認識は,すべての物体の明示的なモデルを必要とします. 物体集合が固定され,知られれば,クラシック的な認識は実装し,より信頼性が高くなります.

3.タスクは接触に富んでいるか,または変形可能な物体を含んでいるか もしそうなら,制御層で学習する必要があります. クラシックな接触モデルは変形可能な操作,食品処理,または繊維作業に不十分です. 学習された残留制御器または接触に富んだ示範で訓練された完全に学習された政策は,実践的な道です.

4. 公式の安全保証や規制認証が必要ですか もしそうなら,他のコンポーネントが学習されている場合でも,システムアーキテクチャには古典的な安全層が含まれなければならない.制御バリア機能,緊急停止論理,作業場境界の執行は古典的で公式に検証されるべきである.学習されたコンポーネントは古典的な層によって定義された安全封筒内で動作する.

**5.データ予算はどれか.**学習された政策は示範 (模倣学習のための数百もの) 〜シミュレーション環境 (RLのための) を要求する.特定の作業の200-500件の高品質の示範を収集する予算がある場合は,模倣学習は実用的です.そうでない場合,最小限の作業特有のデータを持つ古典的な制御または精細な 基礎モデル はあなたの道です. [データ収集サービス] (RCSVの2500ドル/8,000ドルキャンペーン) は,学習が正しいアプローチである場合,データセットを効率的に構築するのに役立ちます.

学習方法 分類: アルゴリズムを選択する

学習パラダイムの中で,アルゴリズムの選択はデータ要件,計算コスト,展開特性に劇的な影響を与える.この分類は2026年からの景観を映し出します.

Algorithm Data Source サンプル効率 Reward Required? Best Use Case
動作のクローン作成(BC) 50-500 demos High No Short-horizon tasks with consistent strategy
ACT (Action Chunking) 50-200 demos High No Bimanual tasks, long-horizon with action chunks
Diffusion Policy 200-1000 demos Medium No Multimodal tasks with multiple valid strategies
VLA Fine-Tune (Octo/OpenVLA) 20-200 demos Very High No Novel object generalization, language-conditioned tasks
PPO (on-policy RL) 10M-100M sim steps Low Yes (dense preferred) Locomotion, continuous control with clear reward
SAC (off-policy RL) 1M-50M sim steps Medium Yes Dexterous manipulation in sim, sample-efficient RL
GAIL / IRL 10-50 demos + sim Medium Learned from demos Few demonstrations + good simulator available
Model-Based RL (Dreamer, MBPO) 100K-1M steps High (for RL) Yes Data-limited RL where world model can be learned

2026年にほとんどの操作チームにとって実践的な決定は:ACTまたは拡散政策 (模倣学習) を開始し,オブジェクトや言語条件を一般化する必要がある場合,VLAの微調整に移行し,正確なシミュレーターと明確な報酬機能がある場合,ローコモーションまたはケースのためにRLを予約する. GAILとモデルベースのRLは,現在,ニッチの役割を担っています.

クラシックパイプライン故障モード

クラシックパイプラインの失敗を正確に理解することで,チームがどの段階を学習で置き換え,どの段階を維持すべきかを特定できる.認識計画制御パイプラインの各段階には,特定の環境条件に結びついている特徴的な失敗モードがあります.

Pipeline Stage Failure Mode Trigger Condition Impact
Perception Object not detected Novel object geometry, transparent/reflective material Complete task failure (no target)
Perception Pose estimate off by >5mm Symmetrical objects, partial occlusion, glare Grasp misalignment, placement error
Planning No feasible path found Dense clutter, narrow passages, conflicting constraints Task abort or timeout
Planning Stale scene model Dynamic environment, objects moved between perception and execution Collision with moved objects
Control Tracking overshoot Aggressive trajectories, under-damped PID gains Impact damage, position error at target
Control Inadequate contact model Deformable objects, unknown friction, compliant surfaces Crush damage, slip, grasp failure
Integration Timing desync between modules High CPU load, ROS2 DDS congestion, GC pauses Stale data used for planning, jerky execution

認識障害が非構造環境で支配され,計画障害が混雑したシーンで支配され,制御障害が接触豊富な作業で支配されるパターンは明らかです.チームは,特定の部署で最も多くの失敗を引き起こす段階を学習することで置き換え,信頼性の高い作業をしている段階を古典的なものに保つべきです.

余剰政策パターン: クラシック制御への学習の追加

余剰政策パターンは,既存の古典システムに学習を導入する最も安全な方法である.古典的なコントローラを置き換えることなく,学習された余剰政策は古典的な出力に修正を加える.総命令のアクションは: T3,ここで T4は小さな範囲に制限される (通常 +/- 5mm位置,時間ステップごとに +/- 2度方向性).

# residual_policy.py -- Classical + learned residual controller
import numpy as np
import torch

class ResidualPolicyController:
    """Adds learned corrections to classical impedance controller."""

    def __init__(self, classical_controller, residual_model, max_residual=0.005):
        self.classical = classical_controller
        self.residual = residual_model  # Trained policy network
        self.max_residual = max_residual  # 5mm max correction

    def compute_action(self, obs, ft_reading, target_pose):
        # Classical controller: impedance control toward target
        a_classical = self.classical.compute(obs["joint_pos"], target_pose, ft_reading)

        # Learned residual: correct for contact dynamics
        with torch.no_grad():
            residual_input = torch.cat([
                torch.tensor(obs["joint_pos"]),
                torch.tensor(ft_reading),         # Force-torque sensor
                torch.tensor(obs["wrist_image"]).flatten()
            ])
            a_residual = self.residual(residual_input).numpy()

        # Safety clamp: residual cannot exceed max_residual per joint
        a_residual = np.clip(a_residual, -self.max_residual, self.max_residual)

        return a_classical + a_residual

このパターンは挿入作業 (ペグイン・ホール,コネクタペアリング) で成功に導入され,従来のコントローラが接近軌道を処理し,残留政策は反射を強めるための敏感性を要求する接触相修正を処理する.残留は,接触相の100~200回の示例のみで訓練され,データ要求が低い. クラシック制御だけで 85%の成功を達成し 残留政策は96%に押し上げられるような精度組み立て作業では [OpenArm 1]T14) とこのパターンを使用します

計算要件比較

各アプローチのインフラストラクチャコストは大きく異なります 建築にコミットする前にチームはこれらの要件を理解する必要があります

Resource Classical Pipeline IL (ACT / DP) VLA Fine-Tune RL (Sim)
Training GPU None 1x RTX 3090/4090 1-4x A100/H100 1-8x A100 (Isaac Sim)
Training time N/A (hand-tuned) 2-8 hrs 12-48 hrs 24-120 hrs
Inference GPU None (CPU only) 1x RTX 3060+ 1x A100 or H100 Same as IL at deploy
Inference latency < 1 ms 20-100 ms 200-500 ms Same as IL at deploy
Disk/storage < 100 MB (URDF, configs) 50-200 GB (dataset) 200 GB-2 TB 50-500 GB (replay buf)
Engineering labor High (weeks-months) Medium (data + train) Low-medium (fine-tune) High (sim engineering)
Cloud cost estimate $0/month $50-200/train run $500-3,000/train run $1,000-10,000/run

これらのコストは単作業訓練サイクルである.多作業政策,超パラメータスイープ,および再帰的なデータ収集は,その数値を次々に倍にする.予算が狭いチームは,複数のプロジェクトでハードウェアとオペレーターコストを減額するRCSVの [データ収集サービス]T15]を検討すべきである.

失敗モード解析:古典と学習されたシステムに対する診断

ロボットシステムが失敗すると,根本原因の診断はパラダイムによって根本的に異なる経路を追跡します. これらの診断枠組みを理解することで,デバッグの時間が大幅に節約されます.

従来のパイプライン故障モード:

  • 認識障害. ポイントクラウドは騒音で,オブジェクトが検出されないか,ポーズ推定はコントローラの許容量を超えている.診断:故障時刻でポイントクラウドと検出出力を視覚化します.修正:セグメントパラメータを調節し,カメラビューポイントを追加するか,または照明を改善します.診断時間は:分から時間.
  • 計画失敗. 計画者は解決法 (実行不可能) を返さない,時を停止したり衝突を起こさない.診断: RViz2 の計画現場と衝突物体を視覚化する.修正:計画時間を増加させ,クリアランスを追加したり,衝突モデルを簡素化する.診断時間:分.
  • 診断: グラフ関節位置追跡誤り,速度プロファイル,力・トルク信号.修正: PID 獲得を再調,阻害パラメータを調整,または軌道を速縮させる.診断時間:時間.
  • 統合障害. モジュール間のタイミング問題 - プランナーが古い認識輸出を使用するか,制御器は実行中途半端の軌道の更新を受け取ります.診断: ROS2 ログのメッセージタイムスタンプを確認します.修正:同期障害を追加するか,反応的再計画アーキテクチャに切り替える.診断時間:時間から日.

政策失敗の学習モード:

  • 分布シフト. 対象は,訓練データによって十分に覆われていない位置,方向,または照明状態にある.診断:障害観測を訓練分布と比較する (例えば,ポリシーの視力エンコードを使用した距離を組み込み計算することによって).修正:故障事例をカバーするより多様な示例を収集する.診断時間:数時間から数日.
  • モード平均化. このポリシーでは,2つの有効戦略の平均を出すことで,どちらも一致しない軌道を生成する.診断:展開可視化では,ロボットが2つのアプローチの間を躊躇していることが示されています.修正:MSE損失から多型構造 (分散政策,CVAE) に切り替える.診断する時間:時間.
  • ** 複合誤り.** 政策は20~30歩後に軌道を外れ,回復できない.診断:時間とともにステップごとに行動誤りを追跡し,加速する差異を観察する.修正:行動の部分長さを増加させ,時間的な組み立てを追加するか,DAggerデータを収集する.診断時間:時間.
  • 校正不一致. データ収集と部署の間にはカメラの外側が移動し,政策行動に一貫した空間的オフセットを引き起こした.診断:データ収集中に使用された校正に対してカメラの姿勢を測定する.修正:カメラを校正する.観測空間にカメラの姿勢を追加する.診断時間:疑われる1回数分,疑わない場合は数日.

一般的な罠: チームは,クラシックなインフラストラクチャの問題によって実際に発生する故障に学習されたコンポーネントを責めることが多い (ROS2でステイTF変換,誤ったカメラ外部の,誤った URDF関節制限). 神経ネットワークをデバッグする前に,クラシックパイプラインが既知のテストケースで正しい出力を生み出すことを確認してください. この"古典的な健康診断"では RCSVで報告された学習システム障害の30~40%を検出します

重要な不対称性:クラシック障害は,各モジュールに検査可能な入力と出力があるため,診断は一般的に速くなります.学習された政策の失敗は,訓練データ分布について推論を必要とするが,本質的により難しい.ハイブリッドアーキテクチャは,学習されたコンポーネントを孤立させることで部分的にこれを解決します.したがって,クラシック診断ツールがパイプラインの大半に適用されます.

現実世界 の ケース 解析

クラシック,学問,ハイブリッドの方法の選択が実用的にどのように行われているかを示しています

第1例:電子コネクタ挿入 (古典的な勝利). 契約制造商はPCBソケットにUSB-Cコネクタ挿入するためにロボットが必要でした.耐性: +/-0.15mm.コネクタの幾何学は知られている,PCBは固定されており,挿入軌道は制御力のある直線です. 挿入点での螺旋式検索による古典的な阻害制御は1万回の試験で99.2%の成功を達成しました.トレーニングデータは必要ありませんでした.ILアプローチはプロトタイプされ,500回のデモで94%の成功を達成しました.より高いコストで性能が悪い.

**ケース2:倉庫のゴミ箱の取れ (学習勝利) **電子商取引の完成センターは,50以上の SKUカテゴリを含むゴミ箱から任意のアイテムを採取するためにロボットを必要としました.アイテムは柔らかい袋から硬い箱まで,奇妙な形状の電子機器まで行われました.古典的なポーズ推定 +把握計画パイプラインは,新しい物体や反射物体での認識障害によって制限された78%の取れ成功を達成しました. DINOv2のバックボーンを持つ学習した [grasp planner] (Contact-GraspNet) は,訓練中に見たことのないアイテムを含むすべてのカテゴリーで93%のピック成功を達成しました.学習したシステムには,3週間ものデータ収集 (4,000のピックデモ) がかかり,古典的なシステムでは4ヶ月のエンジニアリングと比べて.

**例3:食品のプレート (ハイブリッド・ウィーンズ) **食品のプレートを作るスタートアップは,エステティックに快適な配列でサラダの成分をプレートするロボットが必要でした.クラシック制御は,個々のアイテムの正確な配置 (既知の部分サイズ,校正された配送器) を扱った.学習された認識モデルでは,オーバーヘッドカメラ画像から成分類とプレート状態を特定しました. 知識のある高レベルのプランナーが,プレートマスクのトレーニング画像に基づいて構成布局を作成した.ハイブリッドシステムは,人間の品質評価者による受け入れ率の87%を達成した.完全に古典的なルールに基づくシステムでは62%と完全に学習されたエンドツーエンド政策では79%と比べて.

MoveIt2 + 学んだ知覚:最小のハイブリッド例

クラシック知覚を置き換える学習されたオブジェクト検出器を使って 運動計画のために MoveIt2 を使用する最小の統合パターンを 開発するチームです

# hybrid_pick.py -- Minimal hybrid: learned perception + classical planning
import rclpy
from moveit2 import MoveIt2
from groundingdino import GroundingDINO
import numpy as np

def hybrid_pick(node, moveit, detector, camera, prompt="the red mug"):
    # --- Learned perception layer ---
    rgb, depth = camera.capture()
    detections = detector.predict(rgb, prompt)  # GroundingDINO
    best = max(detections, key=lambda d: d.confidence)
    # Back-project 2D detection center to 3D using depth
    cx, cy = best.center
    z = depth[int(cy), int(cx)] / 1000.0  # mm to meters
    x = (cx - camera.cx) * z / camera.fx
    y = (cy - camera.cy) * z / camera.fy
    target_pose = [x, y, z, 0, 0, 0, 1]  # position + quaternion

    # --- Classical planning layer (MoveIt2) ---
    # Pre-grasp: approach from above
    pre_grasp = target_pose.copy()
    pre_grasp[2] += 0.10  # 10cm above
    moveit.move_to_pose(pre_grasp)
    # Grasp: descend with impedance control
    moveit.move_to_pose(target_pose, velocity_scaling=0.3)
    moveit.close_gripper(force=20.0)  # 20N grip
    # Lift
    lift_pose = target_pose.copy()
    lift_pose[2] += 0.15
    moveit.move_to_pose(lift_pose)

この25行例はハイブリッドパターンの本質を把握しています 学習モデル (GroundingDINO) は言語説明から任意のオブジェクトを見つける認識の複雑さを処理し, MoveIt2 は適切な関節制限と速度制限で衝突のない軌道の計画を行います. RCSVでは [OpenArm 1]T17) は MoveIt2の設定パッケージと RealSenseカメラドライバーの統合を搭載し,このタイプのハイブリッドシステムを午後中に展開できます.

データ要求の比較

クラシック制御には,システム識別データが必要である.注意深く設計された校正実験による関節位置,速度,トーク,フォーストークセンサーの読み取り. 構造実験の数時間通常十分である.データは小量であるが,高度な精度である必要があります.神経ネットワークの訓練には関与しません.

模倣学習には,タスクごとに200〜1,000のデモエピソードが必要で,それぞれに同期カメラ画像と30〜50Hzのロボット状態が含まれます.収集時間は2時間 (200回の簡単なタスクのデモ) から2週間 (1000回の複雑なタスクのデモ) までです. 多様なオブジェクトのデータ品質は量を支配します.200回のクリーンデモは1000回の騒音のデモを上回ります. 収集コストの詳細については, [示例分析費用]T18 を参照してください.

基礎モデルの細かな調整 (Octo, OpenVLA,または RT-2 から開始) は,通常50-200のタスク特有の示範をはるかに少なくする必要があります.なぜなら,訓練前のモデルは,強力な視覚的および行動的な先駆けを提供しています.学習行動を必要とするデータ予算が限られているチームにとって,これは最も実践的なアプローチです.訓練前のモデルは,Open X-Embodiment (Open X-Embodiment) システム (T19) を通じて利用できます.

強化学習には,タスク物理を正確にモデル化するシミュレーション環境が必要です.そのシミュレーションを構築することは,本体で重要な技術的な努力ですが,RLが利用可能な限り,ほぼゼロの限界コストで何百万人ものトレーニングエピソードを生成することができます. 課題は [sim-to-real transfer] (T20): 物理モデル化の不正確さにより,シミュレーションに訓練されたポリシーが実際のハードウェアで失敗する.

残留政策学習: 両世界の最高の

余剰政策学習は,クラシックコントローラの上に学習された修正を重ねる特定のハイブリッドアーキテクチャです. クラシックコントローラはベースラインの動作 (例えば,ターゲットポーズに移動し,挿入力を使う) を提供し,学習された残留ネットワークは,クラシックコントローラができない変異性を扱うために動作を適応させる小さな修正 (通常 +/- 5mm の位置, +/- 5 度 の方向) を出します.

この建築は,エンドツーエンド学習に比べていくつかの具体的な利点があります.

  • ** 構造による安全性.** 残りは限られている - 学習されたネットワークは,クラシック軌道を限られた数量しか離れない.学習されたコンポーネントが完全に失敗しても (輸出はゼロ) クラシックコントローラは依然として合理的な行動を実行します.
  • サンプル効率* 残留ネットワークは,操作経路全体ではなく,修正のみを学ぶ必要がある.これは多くの作業に必要な示範を200-500 (端から端) から50-100 (残留学習) に減らします.
  • 解釈可能な故障モード. システムが故障すると,クラシックコントローラを単独で実行して比較することで,クラシックコントローラまたは残留修正が故障かどうかを確認できます.
  • 増殖部署. 生産中の古典的なコントローラから始め,検証された後に残留修正を加え.制御スタックをビッグバンで置き換えることはありません.
# residual_policy.py -- Classical + learned residual
import numpy as np

class ResidualPolicy:
    """Wrap a classical controller with a learned residual correction."""

    def __init__(self, classical_controller, residual_network,
                 max_pos_residual=0.005, max_rot_residual=0.087):
        self.classical = classical_controller
        self.residual_net = residual_network
        self.max_pos = max_pos_residual  # 5mm
        self.max_rot = max_rot_residual  # 5 degrees in radians

    def predict_action(self, observation):
        # Classical controller produces baseline action
        base_action = self.classical.compute_action(observation)

        # Learned residual predicts correction from visual observation
        raw_residual = self.residual_net(observation['image'])

        # Clip residual to safety bounds
        pos_residual = np.clip(
            raw_residual[:3], -self.max_pos, self.max_pos)
        rot_residual = np.clip(
            raw_residual[3:6], -self.max_rot, self.max_rot)

        # Apply correction to classical action
        corrected_action = base_action.copy()
        corrected_action[:3] += pos_residual
        corrected_action[3:6] += rot_residual
        return corrected_action

RCSVの評価では,残留政策は25-50%のトレーニングデータでエンドツーエンドパフォーマンスで90-95%を達成しています.粗い行動が知られている (オブジェクトに移動,挿入,場所) の作業では優れているが,オブジェクト変性のために細かな調整が必要である.OpenArm 1はMoveIt2ベースの古典的なコントローラで動作し,残留学習実験の理想的な基盤として機能します.

移住経路: 古典からハイブリッドへ 学習へ

既存の古典的なロボットシステムを持つチームでは,学習の利点を把握しながらリスクを管理する段階的なアプローチを踏まえて学習された部品への移行を進めなければなりません.

  1. **第1段階:学習した知覚,古典的なすべてのもの (24週間) ** 学習した検出器 (GroundingDINO, SAM2) で固定した視力パイプライン (セグメント,ポーズ推定) を置き換える. MoveIt2 の計画と阻害制御を維持する.これは単独で,通常,安全性的に重要な制御スタックに変更がないことにより,新しい物体を含む作業で成功率を1025%向上させる.リスク:低い.
  2. 第2段階:残留修正を加える (4~8週間). クラシックシステムが成功する50100例の示例を収集する.しかし,より精密なものやより多くのオブジェクト変数を処理できる.視覚観測に基づいてクラシック軌道を修正する残留政策を訓練する.これはオブジェクト変異性が高い課題で成功率をさらに515%向上させる.リスク:低 (残留量制限).
  3. 第3段階: クラシック安全層 (8~16週) との端から端まで学習されたポリシー ハイブリッドアプローチのパフォーマンス上限が不足している作業では,200~500回のデモで完全な模倣学習ポリシーを訓練します. 結合制限,速度制限,力制限を強制するクラシック安全層で包み込む. これは最大限の柔軟性を与えますが,より多くのデータとより慎重な検証が必要です.
  4. **第4段階:基礎モデルの細かな調整 (継続) **基礎モデルが成熟するにつれて,基礎モデルが改善するにつれて,標準的な安全層を使用します.

RCSV のクライアントの多くは 1-2 段階にあります. 重要な原則は,学習されたバージョンが特定の展開分布でそれを明らかに上回らない限り,従来のクラシックコンポーネントを学習されたコンポーネントに置き換えるべきではありません.学習されたコンポーネントは能力を追加しますが,失敗モードも追加します.

傾向: 学習 は 拡大 し て い ます.古典 的 な 言語 は 消え て い ない

機械学習は,以前は古典的な制御が支配していた分野に拡大している.工場の組み立て,物流,品質検査. 基礎モデルでは,以前は学習を多くのアプリケーションに不実用にしたデータ要件を削減している. クラシックシステムに 学習した能力を クラシックな安全・制御インフラストラクチャを 置き換えることなく 追加することが可能になります

しかし,古典的なロボット技術は消えていない.学習能力が層次に積み重なっている安全と精度基質になっている.学習を通じて現実世界の変動を扱う2026年の各生産ロボットシステムには,学習された方針がロボットをテーブルに押しつけない,共同の限界を超えない,危険な力を適用しないようにする古典的なコントローラーも含まれています. 学習と古典との間の議論は建築の問題へと解決しています どの構成要素が学習され,どの構成要素が設計され,どのように接点があるかです

ハイブリッドシステムの試験:評価プロトコル

ハイブリッドシステムの評価には,各コンポーネントを独立してテストし,統合システムをテストする必要があります.この3段階の評価では,コンポーネントレベルのテストが欠けている統合問題を捉えます.

  1. レベル1:コンポーネント評価. 学習した認識モジュールのみをテスト: 100 枚の保存された画像で実行し,検出精度とローカライゼーションエラーを測定する. クラシックコントローラのみをテスト: 基礎真実物体のポーズを与え,把握率を測定する.統合システムをテストする前に,どちらも個別に90%を超えなければならない.
  2. レベル2:統合評価. 学習された認識を古典的なコントローラに接続して50回のエンドツーエンド試験を実行します.統合された成功率は,コントローラを通じて認識エラーが複合するため,いずれのコンポーネントの個別率よりも低いでしょう.統合されたシステムでは,弱いコンポーネントの独立した率から5-15%を失います.
  3. レベル3: 頑丈性評価. 統合システムを乱射下でテストする:新しい物体,照明の変更,カメラの位置の変更.ここで学んだコンポーネントは完全に古典的なシステム (感知乱に対して脆弱) を上回る必要があります.

新しいプロジェクトを開始するチームでは,RCSVは両方のパラダイムをサポートします.私たちの [データサービス] (T21) は模倣学習に必要な示範を提供します.私たちの [ハードウェアカタログ] (T22) は,古典的なおよび学習された制御スタックの両方に互換性のある腕とセンサーを含みます.そして私たちのエンジニアリングチームは,両方のアプローチを組み合わせるハイブリッドシステムのための建築決定について助言することができます.

関連 読書

模倣学習ガイド · 力・トルク感知ガイド · シミュレーション・トゥ・リアル転移 Guide · 部署チェックリスト · 腕の比較 · データサービス · RCSVプラットフォーム

ロボット アプリケーション を 構築 する

プロジェクトに古典的な制御,学習されたポリシー,または両者の混合物が必要かどうか, RCSVは 部署にあなたを導くためのハードウェア,データ,エンジニアリングサポートを提供します.

[データサービスを見る]