返回Blog

机器人学习与古典机器人:每一个机器人何时使用 (2026)

机器人学习与经典机器人:涵盖感知规划控制管道,端到端学习政策,混合架构以及2026年每个方法的获胜时的实际决策框架.

T5)

辩论不是关于哪个范式更好,而是关于知道在特定情况下要追求哪个范式,以及越来越多地,如何将它们结合到一个系统中.

经典机器人:感知规划控制管道

经典机器人遵循明确的手工工程管道.感知算法 (通常是结构化的点云处理,CAD模型匹配或校准的立体视觉) 生成了几何场景表示.一个规划层 (RRT*,CHOMP,轨道优化或模型预测控制) 计算到目标的无碰撞路径. 控制层 (PID,阻力控制或计算扭矩控制) 通过严格的实时保证来跟踪计划轨迹.每个阶段都有明确的输入,输出和故障模式,工程师可以检查,调试和正式验证.

传统控制器在1kHz的控制速度上运行,具有确定性延迟.它们通过莱普诺夫分析提供了正式的稳定性保证,通过控制屏障函数提供了安全限制,通过已知成本函数提供了轨迹最佳性.它们不需要培训数据. 当它们失败时,失败模式通常可以解释:一种感知错误,一个不可行的计划或跟踪过度.对于任何部署机器人在监管机构问"机器人为什么这样做",经典控制提供了学习的政策无法回答的答案.

任何手工管道都会受到设计者不预期的条件的破坏.对透明物体上设置为磨金属零件的感知模块失败.为结构化工作站优化的运动规划器失败.对硬体抓住的阻抗控制器失败于可变形物体. 扩展古典系统到新型情况需要更多的工程,而不是更多的数据,

经典工具 深度潜水: IK,运动规划,力量控制

对于评估哪些组件要用学习取代,哪些组件要保留,理解经典堆中的具体工具至关重要.

反向动力学 (IK). 鉴于所需的终端效应器姿势,IK计算实现这一目标的关节角.对于具有特定几何 (大多数工业臂) 的6DOF机器人,分析IK解决方案存在,并且运行在微秒内.对于7DOF冗余臂 (Franka,OpenArm,Kinova Gen3),数量IK解决方案如KDL,TRAC-IK或IKFast计算解决方案在1-10ms内. 即使是完全学习的政策也通常会产生最终效果目标,这些目标通过IK转换为联合命令.

运动规划. RRT* (快速探索随机树,最佳变体) 和其衍生品 (BIT*,CHOMP,STOMP) 在联合空间或任务空间计算无碰撞轨迹.规划时间在简单环境中从50ms到2-5秒的混场景. 设计人员需要一个精确的碰撞模型,需要既已知对象几何 (从CAD模型) 或实时感知.在混乱,未知的环境中,感知瓶使经典规划脆弱. MoveIt2是标准的开源运动规划框架,支持大多数研究部门.

**强力控制.**阻力和入口控制调节机器人与其环境之间的机械相互作用.阻力控制使机器人表现得像一个大体弹系统:当外部力量对最终效应器作用时,机器人根据所规定的度和缩产生产量. 接入控制逆转了这一点:机器人读取了强力扭矩传感器数据,并产生了与测量的强力错误相比例的位置纠正.这些控制器是数学上优雅的,可调整的,可证明的稳定,但它们需要对机器人的动态和接触模型参数的准确知识. 对于强力感知集成的更深入了解,请参阅我们的 [F/T感知指南]T6.

**经典感知管道.**典型的结构化感知堆:RGB-D摄像头捕捉到一个点云.平面细分取消表.尤克利德集群隔离单个对象.每个对象集群与已知CAD模型库 (使用ICP或PPF匹配) 匹配,以估计6DOF姿势. 这种管道是快速的 (10-30ms每一个框架),对已知物体 (分毫米外观估计),并且完全失败于不存在模型库中的物体.每一个新物体都需要一个新的CAD模型或手动校准步骤 - 这种工程成本使团队走向学习的感知.

机器人学习:从一开始到一开始的学习

机器人学习取代了手工工程的管道,用数据驱动的模型.在[模拟学习]T7中,神经网络观察人类的示范 (摄像头图像加上机器人联合状态) 并学习从观察到行动的直接映射.在强化学习中,代理通过模拟或现实世界中的试错学习. 在新兴的视觉语言行动 (VLA) 范式中,大型预训练模型将自然语言任务指令和视觉观测作为输入,并作为输出产生动机命令.

经过500次"杯"演示,在30个不同的杯子,5个照明条件和各种桌面位置上进行训练,学习了一个表现,在没有任何明确的特征工程的情况下将其通用到第31杯. 该政策没有感知模块,规划模块和控制模块. 它有一个单一的模型,将像素和自觉感知映射到联合命令中,相关抽象信息来自数据而不是由工程师设计.

学习的政策是不透明的:当它们失败时,诊断是否是感知性,与规划相关的,或是控制执行错误很难.它们需要大量的培训数据,通常需要数百到数千次模仿学习示范,或者数百万次模拟步骤来加强学习.它们没有正式的安全保证. 他们的行为可能以不可预测的方式改变,

经典机器人技术的胜利

精密组装和加工. 需要在已知几何中重复小毫米的任务.CNC加工,半导体晶圆处理,PCB组件插入和精密接,所有要求是经典控制器经常实现的,而已学习的政策不能保证的容忍度. 环境完全规范,物理模型也很好,经典控制既更快地部署,更可靠地运行.

已知,结构化的环境. 汽车组装线,药品包装和物流分类系统,有控制照明,固定物体位置和可预测的物理是古典机器人自然领域. 没有理由收集训练数据, 当你能写一个确定性控制器,

安全关键的应用. 科研机器人,在人类附近运行的协作机器人以及需要监管认证的任何部署都从可用于经典控制的正式验证工具中获益. 控制屏障功能,可达性分析和最坏的轨道界限为经典系统提供了安全保证水平,而已知政策尚未实现.例如,FDA目前没有证实了全面的已知手术控制政策的途径.

**低延迟要求.**需要分秒以下的控制响应的应用,如高速的选择和放置,平衡或接触敏感组件,需要经典控制循环提供的确定性时间.即使在优化的硬件上,神经网络推断也引入了可变的延迟,在500Hz以上的控制速度上是有问题的.

机器人学习获胜

无结构环境. 排序混合物品在仓库桶里,在乱的房屋中导航,在厨房或餐厅中运营,物体布局不断变化.编写一个用于千千万个 SKU 几何体积中收集垃圾的经典控制器是一个无休止的工程项目. 培训对多种示范的学习政策是一个数据收集项目,但回报率不断减少.

**外层操纵.**需要指尖水平协调,可变形物体处理或接触丰富的交互.折叠衣服,结结,插入灵活的电缆,以及食品制备都涉及到物理,分析模型成本极高. 通过培训数据,观察其行动的物理结果并隐含地适应的学习政策比任何工程控制器更自然地处理这些任务.

** 对于对象实例来说,一般化.**当你的机器人需要拿起任何杯子,而不是特定的杯子时.当你的移动机器人需要导航任何办公室,而不是特定的地图时.当你的厨房机器人需要处理任何品牌的面包盒时.当你的部署需要处理一个类别内的新实例时,从各种培训数据中学习的表示变得至关重要. 对于每一个新物体变体, 经典的感知需要重新设计.

** 任务是很难编程地指定的.** "把表擦拭到它看起来很清洁. " " 包装物品,在运输过程中没有任何变化. " " 让花朵有吸引力. " 这些任务具有客观的成功标准,人类可以轻松评估,但很难用数学成本函数表达. 模仿学习完全回避规范问题,通过从所需行为示范中暗示学习任务.

方法比较表

Dimension Classical Robotics Learned Policies Hybrid
Control frequency 1 kHz deterministic 10-50 Hz variable 100-1000 Hz (classical inner loop)
Novel objects Requires new models Generalizes from data Learned perception + classical plan
Safety guarantees Formal verification available No formal guarantees Classical safety envelope
Setup time Weeks-months (engineering) Days-weeks (data collection) Weeks (both)
Debugging Inspect each module Black-box, need ablation Learned modules harder
Deformable objects Very difficult to model Learns from demonstrations Learned contact + classical motion
Scaling cost O(edge cases) engineering O(data diversity) Both, but reduced

现有团队的工具比较

Tool Category Classical Stack Learning Stack
Middleware ROS2 Humble/Iron LeRobot, RoboCasa, robomimic
Motion planning MoveIt2, OMPL, Drake N/A (end-to-end)
Perception PCL, Open3D, FoundationPose DINOv2, SigLIP (learned backbone)
Simulation Gazebo, Drake Isaac Sim, MuJoCo, Genesis
Control ros2_control, impedance/admittance ACT, Diffusion Policy, VLA inference
Languages C++ (real-time), Python (scripts) Python (PyTorch), C++ (deployment)

混合方法:学会的感知+经典规划+学会的控制

2026年最具能力的机器人系统是混合动力,而已成为主导的特定混合动力架构值得详细了解.

学习感知层. 神经网络 (通常是DINOv2或CLIP等预训练的视觉基础模型,根据任务特定数据进行细节调整) 处理摄像头图像并产生结构化的场景表示:对象姿势,语义标签,表面正常,抓取候选人. 这取代了经典系统的手工感知,以学习的表示,这些表示在照明,纹理和物体实例中普遍化.感知层运行在10-30Hz,并输出结构化数据,而不是原始行动.

经典规划层. 模型预测控制器 (MPC) 或基于样本的规划器取出所感知的场景状态,并计算一个无碰撞的,动态可行轨迹,以实现任务目标. 这一层基于感知模块的清洁几何表示,并应用了所有经典规划优越的安全限制,关节限制和优质标准.规划在10-50Hz上运行.

**学习低级控制.**对于接触丰富的任务,学习的残留政策基于[强力矩传感器]T8) 反和接触的视觉观察,实时调整了经典控制器的命令. 这处理了可变的对象和接触动力学情况,其中经典控制模型会破裂,而经典控制器提供了整体轨迹结构和安全包裹.残留政策在100-500Hz上运行,增加了对经典控制输出的校正.

这种架构捕捉到两种范式的优势.学习的感知处理视觉复杂性.经典规划器提供安全保证和可解释的行为.学习的残留控制器处理无法分析模型的接触动态. 谷歌DeepMind的操纵系统,一些生产部署的亚马逊仓库机器人细胞,以及多个手术机器人平台在2026年使用了这种架构的变体.

现有古典机器人团队的过渡路径

如果你的团队有一个工作的经典机器人堆,

  1. **第一阶段:只取代感知.***用学习模型 (FoundationPose, Grounding DINO或精细调整的DINOv2探测器) 换取手工对象检测和定位估计.保持您的经典规划器和控制器不变.这是最低风险的学习介绍,通常提供最大的即时改进 (处理新型对象而不是CAD模型). 时间:2~4周的集成工作.
  2. ** 第二阶段:添加学习把握计划.**用学习把握质量预测器 (GraspNet, Contact-GraspNet或 AnyGrasp) 取代分析把握计划器 (如果有的话).学习模型提出预测成功的把握候选人,而你的经典规划器生成了选择的把握轨迹.时间线:2-6周.
  3. **阶段3:添加学到的残留控制.**对于您的经典阻抗控制器在处理困难的接触式任务,训练一个残留控制器,将修改了经典输出.只收集100-200个接触式阶段的示范 (而不是全部任务).残留控制器处理了经典控制无法模拟的"最后一厘米". 时间:包括数据收集的4-8周.
  4. **第四阶段:评估端到端.**一旦你有了学习组件的经验,评估一项学习的端到端政策 (ACT或扩散政策) 在特定任务上是否超过了你的混合堆.对于某些任务,答案将是肯定的 - - 特别是具有高视觉复杂性和适度精度要求的任务. 在精密任务方面,混合方法通常继续获胜.

通过我们的 [数据服务]T9,RCSV可以提供这些阶段的数据收集,我们的工程团队提供混合架构设计的建议. [RCSV平台]T10) 支持基于ROS2的经典工作流程和基于PyTorch的学习工作流程.

实际决策框架:五个问题

答复这五个问题,以确定你的方法.

**1.环境是否完全规范和稳定?**如果是的 (工厂线,清洁室,结构化仓库细胞),则从经典控制开始.您将比任何学到的方法更快,更可靠地部署.如果没有 (房屋,餐厅,非结构化仓库),则至少需要在感知层中学习.

2.你需要处理新型对象实例吗如果机器人会遇到它以前从未见过的对象,你需要学习的感知,可能是学习的政策.经典感知需要对每个对象的明确模型.如果对象集合是固定的和已知的,经典感知更快实现和更可靠.

**3.任务是否涉及接触或涉及可变形的物体?**如果是,则需要在控制层中学习.经典的接触模型对于可变形的操纵,食品处理或织任务不够.学习的残留控制器或完全学习的政策,训练在接触式示范上是实际的途径.

**4.您是否需要正式的安全保障或监管认证?**如果是的,您的系统架构必须包含一个经典的安全层,即使其他组件都已学习.控制屏障功能,紧急停止逻辑和工作场所边界的执行应是经典的,正式验证.学习的组件在经典层所定义的安全包裹内运行.

**5.您的数据预算是什么?**学习政策需要示范 ([模仿学习]T11) 或模拟环境 (RL).如果您有预算收集200-500个高质量的示范,模仿学习是实用的.如果没有,经典控制或精细调整的[基础模型]T12) 具有最小的任务特定数据是您的路径. 如果学习是正确的方法,RCSV的 [数据收集服务] (试点活动为2,500美元/8,000美元) 可以帮助您有效地构建数据集.

学习方法:选择算法

在学习范式中,算法的选择对数据需求,计算成本和部署特性产生了显著影响.该类别将2026年起的景观映射.

Algorithm Data Source 样本效率 Reward Required? Best Use Case
行为克隆(BC) 50-500 demos High No Short-horizon tasks with consistent strategy
ACT (Action Chunking) 50-200 demos High No Bimanual tasks, long-horizon with action chunks
Diffusion Policy 200-1000 demos Medium No Multimodal tasks with multiple valid strategies
VLA Fine-Tune (Octo/OpenVLA) 20-200 demos Very High No Novel object generalization, language-conditioned tasks
PPO (on-policy RL) 10M-100M sim steps Low Yes (dense preferred) Locomotion, continuous control with clear reward
SAC (off-policy RL) 1M-50M sim steps Medium Yes Dexterous manipulation in sim, sample-efficient RL
GAIL / IRL 10-50 demos + sim Medium Learned from demos Few demonstrations + good simulator available
Model-Based RL (Dreamer, MBPO) 100K-1M steps High (for RL) Yes Data-limited RL where world model can be learned

2026年大多数操纵团队的实际决定是:从ACT或扩散政策 (模仿学习) 开始,如果需要对象或语言条件的通用化,转向VLA细节调整,并为移动或有准确模拟器和明确奖励功能的案例保留RL. GAIL和基于模型的RL目前占据了位.

传统管道失败模式按阶段

了解经典管道如何失败,有助于团队确定哪些阶段可以用学习来取代,哪些要保持.

Pipeline Stage Failure Mode Trigger Condition Impact
Perception Object not detected Novel object geometry, transparent/reflective material Complete task failure (no target)
Perception Pose estimate off by >5mm Symmetrical objects, partial occlusion, glare Grasp misalignment, placement error
Planning No feasible path found Dense clutter, narrow passages, conflicting constraints Task abort or timeout
Planning Stale scene model Dynamic environment, objects moved between perception and execution Collision with moved objects
Control Tracking overshoot Aggressive trajectories, under-damped PID gains Impact damage, position error at target
Control Inadequate contact model Deformable objects, unknown friction, compliant surfaces Crush damage, slip, grasp failure
Integration Timing desync between modules High CPU load, ROS2 DDS congestion, GC pauses Stale data used for planning, jerky execution

模式很清楚:在非结构化环境中,感知失败占主导地位,在混乱场景中,规划失败占主导地位,在接触丰富的任务中,控制失败占主导地位.团队应该通过学习在特定部署中导致最多失败的阶段来取代,并保持可靠的工作阶段的经典性.

剩余政策模式:将学习添加到经典控制

剩余政策模式是将学习引入现有经典系统的最安全方式.而不是取代经典控制器,学习的剩余政策在经典输出之上添加了纠正.总命令的操作是:T3,其中T4被限制在一个小范围 (通常是+/- 5mm位置,每时间步骤的方向+/- 2度).

# residual_policy.py -- Classical + learned residual controller
import numpy as np
import torch

class ResidualPolicyController:
    """Adds learned corrections to classical impedance controller."""

    def __init__(self, classical_controller, residual_model, max_residual=0.005):
        self.classical = classical_controller
        self.residual = residual_model  # Trained policy network
        self.max_residual = max_residual  # 5mm max correction

    def compute_action(self, obs, ft_reading, target_pose):
        # Classical controller: impedance control toward target
        a_classical = self.classical.compute(obs["joint_pos"], target_pose, ft_reading)

        # Learned residual: correct for contact dynamics
        with torch.no_grad():
            residual_input = torch.cat([
                torch.tensor(obs["joint_pos"]),
                torch.tensor(ft_reading),         # Force-torque sensor
                torch.tensor(obs["wrist_image"]).flatten()
            ])
            a_residual = self.residual(residual_input).numpy()

        # Safety clamp: residual cannot exceed max_residual per joint
        a_residual = np.clip(a_residual, -self.max_residual, self.max_residual)

        return a_classical + a_residual

这种模式在插入任务 (插孔,连接器交配) 中成功部署,其中经典控制器处理接近轨迹,残留政策处理需要敏感的接触相修正,以强加反.残留只在100-200次接触相示范中训练,保持数据要求低. 在RCSV,我们使用[OpenArm 1]T14) 的这种模式,用于精密组装任务,其中单独的经典控制达到85%的成功,而残留政策将其推向96%.

计算要求的比较

基础设施成本在每个方法上都很大不同.

Resource Classical Pipeline IL (ACT / DP) VLA Fine-Tune RL (Sim)
Training GPU None 1x RTX 3090/4090 1-4x A100/H100 1-8x A100 (Isaac Sim)
Training time N/A (hand-tuned) 2-8 hrs 12-48 hrs 24-120 hrs
Inference GPU None (CPU only) 1x RTX 3060+ 1x A100 or H100 Same as IL at deploy
Inference latency < 1 ms 20-100 ms 200-500 ms Same as IL at deploy
Disk/storage < 100 MB (URDF, configs) 50-200 GB (dataset) 200 GB-2 TB 50-500 GB (replay buf)
Engineering labor High (weeks-months) Medium (data + train) Low-medium (fine-tune) High (sim engineering)
Cloud cost estimate $0/month $50-200/train run $500-3,000/train run $1,000-10,000/run

这些成本是单任务培训周期.多任务政策,超参数扫描和反复数据收集相应地乘以数字.预算紧张的团队应该考虑RCSV的 [数据收集服务]T15),该项目的硬件和运营成本在多个项目中减免.

失败模式分析:诊断经典与学术系统

机器人系统失败时,诊断根本原因根据范式基本上遵循不同的途径.

经典的管道故障模式:

  • 感知失误. 点云有噪音,对象无法检测,或者姿势估计不符合控制器的耐受性.诊断:在失误时间步骤中可视化点云和检测输出.
  • **规划失败.**规划器不会返回任何解决方案 (不可行),时间停止,或产生碰撞.诊断:在RViz2中可视化规划场景和碰撞物体.
  • 检测:图片关节位置跟踪错误,速度配置,力矩信号.修复:重调PID增长,调整阻力参数,或降低轨迹速度.诊断时间:小时.
  • ** 集成失败.** 模块之间的时间问题 - 规划器使用过时的感知输出,或者控制器在执行中收到轨迹更新.诊断:检查ROS2日志中的消息时间标签. 解决:添加同步障碍或转换到反应性重组架构.诊断时间:小时至几天.

学会的政策失败模式:

  • 分布转移. 对象处于一个位置,方向或照明状态,训练数据不充分覆盖.诊断:将故障观察与训练分布进行比较 (例如,通过使用政策的视觉编码器计算嵌入距离). 解决:收集覆盖故障情况的更多多样性示范.诊断时间:小时至几天.
  • 模式平均化. 该政策输出了两个有效的战略的平均值,产生了一个与两种战略相匹配的轨迹.诊断:部署视觉化显示机器人在两个方法之间犹.修复:从MSE损失转向多模式架构 (分散政策,CVAE).诊断时间:小时.
  • ** 组合错误.** 政策在20-30步后偏离轨迹,无法恢复.诊断:随着时间的推移跟踪每步骤的行动错误,观察加速的分离.修复:增加行动部分长度,增加时间组合或收集DAgger数据.诊断时间:小时.
  • **校准不匹配.**摄像头外观在数据收集和部署之间转移,导致政策行动中持续的空间抵消.诊断:测量摄像头姿势与数据收集过程中使用的校准.纠正:重新校准摄像头或添加摄像头姿势到观察空间.诊断时间:一旦怀疑,几天.

常见的陷: 团队经常将学到的组件归咎于实际原因是经典基础设施问题 (ROS2中固态TF转换,相机外层错误校准,URDF关节界限错误). 在调试神经网络之前,请检查经典管道在已知测试案中产生正确输出. 这种"经典智能检查"检测到RCSV报告的学习系统失败中30-40%.

关键不对称性:经典故障通常更快地诊断,因为每个模块都有可检查的输入和输出.学习的政策故障需要推断培训数据分布,这本质上更困难.混合架构部分解决了这一问题,通过隔离学到的组件,使经典诊断工具适用于大部分管道.

现实情况研究

这些例子说明了经典,学术和混合方法之间的选择在实践中如何发挥作用.

**第1个案例:电子连接器插入 (经典获胜).**一个合同制造商需要机器人,以插入USB-C连接器到PCB插座中.耐受性:+/-0.15mm.连接器的几何已知,PCB固定,插入轨迹是直线,有控制力. 通过在插入点进行螺旋式搜索的经典阻力控制器在1万次试验中取得了99.2%的成功.没有需要训练数据.一个IL方法被原型化,在500次示范后取得了94%的成功.

**案例2:仓库垃圾桶选 (学习获胜).**电子商务完成中心需要机器人从包含50多类 SKU 类的垃圾桶中选取任意的物品.物品范围从软袋到硬盒到奇怪的电子形状.一个经典的姿势估计 + 抓住计划管道实现了78%的选取成功,受到新型和反射物体的感知失败限制. 经过学习的 [Grasp计划器] (T16) (联系-GraspNet) 具有DINOv2脊柱,在所有类别中取得了93%的选择成功,包括在训练中未见过的项目.经过学习的系统需要3周的数据收集 (4,000个选择示范) 与经典系统的4个月的工程.

情况3:食品料 (混合制品获胜). 一家食品制备公司需要机器人以美观的方式料沙拉成分.经典控制处理了个别物品的精确放置 (已知分量大小,校准分量器).一个学习的感知模型从空头摄像头图像中确定了成分类型和现状. 混合系统获得了87%的人类质量评估者接受率,而完全基于经典的规则系统的接受率为62%和完全学习的端到端政策的79%.

移动IT2 +学习感知:最小混合型例子

对于希望建立第一套混合系统的团队来说,以下是使用MoveIt2进行运动规划的最小集成模式,

# hybrid_pick.py -- Minimal hybrid: learned perception + classical planning
import rclpy
from moveit2 import MoveIt2
from groundingdino import GroundingDINO
import numpy as np

def hybrid_pick(node, moveit, detector, camera, prompt="the red mug"):
    # --- Learned perception layer ---
    rgb, depth = camera.capture()
    detections = detector.predict(rgb, prompt)  # GroundingDINO
    best = max(detections, key=lambda d: d.confidence)
    # Back-project 2D detection center to 3D using depth
    cx, cy = best.center
    z = depth[int(cy), int(cx)] / 1000.0  # mm to meters
    x = (cx - camera.cx) * z / camera.fx
    y = (cy - camera.cy) * z / camera.fy
    target_pose = [x, y, z, 0, 0, 0, 1]  # position + quaternion

    # --- Classical planning layer (MoveIt2) ---
    # Pre-grasp: approach from above
    pre_grasp = target_pose.copy()
    pre_grasp[2] += 0.10  # 10cm above
    moveit.move_to_pose(pre_grasp)
    # Grasp: descend with impedance control
    moveit.move_to_pose(target_pose, velocity_scaling=0.3)
    moveit.close_gripper(force=20.0)  # 20N grip
    # Lift
    lift_pose = target_pose.copy()
    lift_pose[2] += 0.15
    moveit.move_to_pose(lift_pose)

这一25行例表现出混合模式的本质:一个学习模型 (GroundingDINO) 处理了从语言描述中找到任意物体的感知复杂性,而MoveIt2则处理了无碰撞的轨道规划,具有适当的联合限制和速度限制. 在RCSV,我们的 [OpenArm 1]T17) 运输了MoveIt2配置包和RealSense摄像头驱动程序集成,

数据要求的比较

经典控制需要系统识别数据:由精心设计的校准实验的关节位置,速度,扭矩和扭矩传感器读数.几小时的结构实验通常足够.数据量低,但必须精确.不需要神经网络培训.

模拟学习通常需要每项任务进行200-1,000个示范集,每个集包含同步的摄像头图像和30-50Hz的机器人状态.收集时间从2小时 (200个简单任务的示范) 到2周 (1,000个复杂任务的示范) 之间.数据质量占据了多量的地位:200个清洁的示范比1000个有噪音的示范更高. 查看我们的 [每次示范分析成本]T18.

基础模型细节调整 (从Octo,OpenVLA或RT-2开始) 需要更少的任务具体示范,通常是50-200,因为预训练模型提供了强大的视觉和行为前景.这是需要学习行为的有限数据预算的团队最实用的方法.预训练模型可通过 [Open X-Embodiment]T19) 生态系统获得.

强化学习需要一个模拟环境,准确地模拟任务物理.构建这种模拟本身是一个显著的工程努力,但一旦可用,RL可以以接近零的边际成本产生数百万次训练. 挑战是[sim-to-real transfer]T20):在实验中训练有素的政策通常由于物理模型不准确而失败在实验硬件上.

剩余政策学习:两世界最好

剩余政策学习是一种特定的混合架构,它在经典控制器上层出了学习的纠正. 经典控制器提供了基线行为 (例如,移动到目标姿势,应用插入力),而学习的残留网络输出了小的纠正 (通常在位置上+/- 5mm,方向上+/- 5度) 适应这种行为来处理经典控制器无法的变化.

这种架构对端到端学习有几个具体优势:

  • ** 通过构建的安全性.** 剩余的值是有限的 - - 学习网络只能从经典轨迹中偏离有限.即使学习组件完全失败 (输出零),经典控制器仍然执行合理的行为.
  • 样本效率. 剩余网络只需要学习纠正,而不是整个操纵轨迹. 这使得需要的示范从200-500 (端到端) 降至50-100 (剩余学习) 许多任务.
  • **可解释故障模式.**当系统故障时,你可以通过单独运行经典控制器并进行比较来检查经典控制器或残留纠正是否有错误.
  • 增强部署. 开始生产中的经典控制器,然后在验证后添加残留校正.
# residual_policy.py -- Classical + learned residual
import numpy as np

class ResidualPolicy:
    """Wrap a classical controller with a learned residual correction."""

    def __init__(self, classical_controller, residual_network,
                 max_pos_residual=0.005, max_rot_residual=0.087):
        self.classical = classical_controller
        self.residual_net = residual_network
        self.max_pos = max_pos_residual  # 5mm
        self.max_rot = max_rot_residual  # 5 degrees in radians

    def predict_action(self, observation):
        # Classical controller produces baseline action
        base_action = self.classical.compute_action(observation)

        # Learned residual predicts correction from visual observation
        raw_residual = self.residual_net(observation['image'])

        # Clip residual to safety bounds
        pos_residual = np.clip(
            raw_residual[:3], -self.max_pos, self.max_pos)
        rot_residual = np.clip(
            raw_residual[3:6], -self.max_rot, self.max_rot)

        # Apply correction to classical action
        corrected_action = base_action.copy()
        corrected_action[:3] += pos_residual
        corrected_action[3:6] += rot_residual
        return corrected_action

在RCSV评估中,残留政策始终实现90-95%的端到端性能,占训练数据的25-50%.它们在已知粗行为 (移动到对象,插入,放置) 的任务上优越,但对对象可变性需要微妙的调整.OpenArm 1配备基于MoveIt2的经典控制器,作为残留学习实验的理想基础.

迁徙路径:从古典到混合动力转变到学会

对于现有经典机器人系统的团队,迁移到学习组件应采用阶段式方法,同时管理风险,同时捕获学习的好处.

  1. 第一阶段:学习感知,经典的其他一切 (2-4周). 通过学习探测器 (GroundingDINO, SAM2) 取代固定视觉管道 (细分,姿势估计) 同时保持MoveIt2规划和阻力控制.这通常在涉及新物件的任务上提高了10-25%的成功率,没有改变安全关键的控制堆.风险:低.
  2. **第二阶段:添加残留修正 (4-8周).**收集50-100个示范,其中经典系统成功,但可能更精确或处理更多对象变体.训练一个基于视觉观测的残留政策,以纠正经典轨迹.这提高了具有高对象可变性的任务的成功率5-15%;风险:低 (限量残留).
  3. **第三阶段:使用经典安全层 (8-16周) 进行端到端学习政策.**对于混合方法的性能上限不足的任务,在200-500次示范中训练一套完整的模仿学习政策.用一个强制执行关节限制,速度限制和力限制的经典安全层包装. 风险:适度. 风险:适度.
  4. 第四阶段:基础模型细节调整 (正在进行). 基础模型成熟后,将Octo或OpenVLA细节调整到您的任务特定数据上,以实现最大的通用化,并尽量收集新的数据. 使用从第三阶段的经典安全层.风险:适度,但随着基础模型的改善而减少.

大多数RCSV客户端都处于1-2阶段.关键原则:除非学习版本在您的特定部署分布上明显超过它,否则永远不要用学习的经典组件取代工作的组件.学习的组件增加了功能,但也增加了故障模式 - 交换必须是积极的.

趋势:学习正在扩大,古典学不会消失

机器人学习正在扩展到以前由经典控制主导的领域:工厂装配,物流,质量检查.基础模型正在减少以前使学习不实用的数据需求. 混合架构模式使得可以逐步增加学到的功能,

但古典机器人技术并没有消失.它正在成为学习能力的安全和精度基层. 2026 年通过学习来处理现实世界变化的每个生产机器人系统都包含了一个经典的控制器,确保学习的政策不会把机器人推进一个桌子,超越联合界限或施加危险的力量. 学习与古典之间的辩论正在解决一个建筑问题:哪些组件被学习,哪些组件被设计,以及它们如何交互.

混合系统测试:评估协议

评估混合系统需要独立测试每个组件,然后测试集成系统. 这三级评估捕获了组件级测试错过的集成问题.

  1. 第1级:组件评估. 单独测试学习的感知模块:使用100张持久的图像运行,测量检测精度和定位错误.单独测试经典控制器:给它实实实物姿势,测量把握成功率.
  2. **第二级:整合评估.**将学习的感知连接到经典控制器,并进行50次端到端试验.整合的成功率将低于任何组件的个人速度,因为感知错误通过控制器复合.一个完整的系统损失5-15%的弱组件的独立率.
  3. 第三级:强度评估. 测试集成系统在扰乱下:新物体,改变照明,移动摄像头位置. 这就是所学到的组件应该比完全经典系统 (对感知扰乱很脆弱) 优化的地方.

对于启动新项目的团队,RCSV支持两种范式.我们的 [数据服务]T21) 提供了模仿学习所需的示范.我们的 [硬件目录]T22) 包括与经典和学习控制堆兼容的武器和传感器.我们的工程团队可以为混合系统提供建议,结合两种方法的最佳结构.

相关阅读

模仿学习指南 · 力扭矩感知指南 · Sim-to-Real 转移指南 · 部署检查清单 · 武器比较 · 数据服务 · RCSV平台

建立你的机器人应用程序

无论您的项目需要经典控制,学习的政策,还是两者兼而有之,RCSV提供硬件,数据和工程支持,

[查看数据服务]