返回Blog

2025年移动操纵:技术的最新现象和实用部署

移动操纵机器人的调查 <unk>平台,能力,算法和实际部署,结合移动和手臂操纵.

机器人武器指南

[←博客]

机器人领域最难的开放问题也在2025年吸引了一些最活跃的投资和研究.

移动操纵是什么?

移动操纵是指将机器人 (移动环境中移动的能力) 与操纵 (抓住,移动和与物体交互的能力) 结合在一起的机器人.这种组合为机器人提供了类似人类的实用性.

移动操纵器必须从一个不准确的基础位置,在一个潜在的移动平台上,在环境中抓住,可能与任何训练配置不同.从一个不固定的基础抓住提高了有效的抓错误3-5倍与固定的基础操纵相比.

建筑类别:脱与结尾

移动操纵的基本架构选择是将导航和操纵视为单独的子系统,还是作为统一的端到端政策.

**脱 (导航然后操纵):**经典方法.导航规划器将基座移动到手臂工作空间内预先计算的姿势,然后接管操作策略.导航模块和操纵模块是单独的系统,有单独的模型,单独的训练数据,它们之间有一个转移协议. 由于它是模块化,可调试,每个组件都可以独立验证,因此这是工业部署的主要方法. 限制:基层姿势是没有考虑操纵任务的计算,这可能导致不理想的方法配置.重新定位成本每次尝试5-15秒,并引入定位错误.

端到端 (统一政策): 一个单个神经网络采集传感器输入 (摄像头,雷达,自感) 并输出了基速度和臂部联合命令.移动ALOHA (Zipeng Fu等人,斯坦福,2024) 证明了ACT政策可以从50次远程操作示范中学习全身双手动操纵. 结合的方法会使运动更加顺利,更协调,但更难进行调试,需要更多的示范,并提供更少的安全保证.

层次的 (任务级规划 + 学习技能): 一位高级规划师 (可能是基础模型或TAMP系统) 将任务分解成一系列技能 ("导航到厨房","开放冰箱","抓奶"),每个技能都通过专门的政策执行.SayCan (Google, 2022) 和TidyBot (Wu et al.,Princeton, 2023) 使用这种架构. 它结合了学习政策的灵活性和明确规划的解释性.

2025年关键平台

Platform Price Type 负载 Arms Key Strength
Hello Robot Stretch 3 $28,000 Wheeled + telescoping arm 1.5 kg 1 (4-DOF) ROS2, elder care, affordable
Mobile ALOHA (Stanford) $32K + base Wheeled + bimanual 3 kg each 2 (6-DOF ViperX) Bimanual, open-source, ACT-ready
Spot + Arm (Boston Dynamics) $100,000+ Legged + arm 4 kg 1 (6-DOF) Rough terrain, enterprise support
Unitree G1 $16,000 Humanoid (bipedal) 3 kg each 2 (7-DOF) Lowest cost humanoid, growing ecosystem
Unitree H1 $90,000 Humanoid (bipedal) 5 kg each 2 (7-DOF) Strongest humanoid arms, whole-body control
Fetch Robotics (OTTO) $150,000+ Wheeled + arm 6 kg 1 (7-DOF) Warehouse logistics, enterprise AMR
TIAGo Pro (PAL Robotics) $80,000+ Wheeled + arm 3 kg 1-2 (7-DOF) ROS2 native, RoboCup standard

关键文件和系统

移动ALOHA (斯坦福, 2024)

移动ALOHA证明,端到端模仿学习可以产生惊人的能力的全身移动操纵.该系统使用两个ViperX 300手臂在轮子底部,一个人类远程操作员在机器人后面行走,同时控制双臂加上底部运动. 通过仅50个远程操作演示, ACT(Action Chunking with Transformers) 政策学习了制,开放柜子,清洁厨房柜台和推椅

关键见解:与静态ALOHA数据集 (从固定基 ALOHA) 的联合培训提高了移动操纵成功率30%-50%,尽管静态数据没有基动.共享操纵技能转移,政策学会了仅从移动演示中构建它们.这显著减少了实际数据收集负担.

鱼 (普林斯顿,2023年)

蒂迪波特解决了长视野清洁问题:由于一个混乱的房间,取出所有失落的物体并将它们放在正确的位置.它使用LLM (GPT-4)用于高层次的推理 ("杯子上架,"衫上衣柜") 和学习的操纵政策. 关键贡献是表明语言模型可以提供对开放式家庭任务的任务规划所需的常识推理,而低级执行则由可靠的学习技能来处理.

果,2022年

根据自然语言指导 ("我倒了我的饮料,你能帮助吗?"),LLM提出了一个计划作为一系列原始技能 ("找到海绵","拾海绵","航行流出","擦拭表面").每个技能都有相关的成功概率,根据机器人的当前观察估计. 基于LLM计划概率和技能成功概率的结果,SayCan运行在一个移动的每日机器人上,使用一个7DOF臂,证明基于LLM的任务规划可以处理移动操作所需的开放式指令.

导航操纵协调挑战

**臂基协调:**什么时候应该移动基础,什么时候应该伸展臂?对人体平台 (H1,G1) 的全身控制优化处理基础和臂作为统一的动态链.轮子平台通常使用离合规划 导航基础到臂射程内,然后执行臂运动 ,这更简单但对动态任务不理想.

**操纵过程中的动态稳定性:**通过手臂施加力会在基部产生反应力.在一个被限制任务中,一只双腿的机器人在手臂上施加20N水平力,必须同时调整脚部接触,以保持稳定性.这种全身力协调是积极的研究问题. 轮子平台在这里具有优势:反应力通过轮子的地面摩擦被吸收,比脚接触动态更容易进行模拟和控制.

**从移动基地的抓住位置估计:**从移动基地的感知引入了定位不确定性到抓住估计. 2cm的基位置错误扩散到一个抓住点错误,可能超过了抓住容忍度的精确任务.移动操纵系统需要高精度的基位置定位或抓住政策,是强大的基位置不确定性.

交付问题: 在离合架构中,导航系统将机器人交付到"预操纵"姿势,然后交给操纵控制器. 操作控制器应在当前姿势不合适的情况下能够要求基底重新定位.大多数当前系统中,这种反循环不适用于.

**长视野状态估计:**在多分钟的移动操纵任务 (例如清理房间) 上,机器人基于SLAM的定位积累漂移.如果机器人在1分钟接取物体,并在5分钟需要将其放置在特定位置,定位错误可能超过定位容忍度. 操作过程中,循环关闭,与已知地标进行重新定位,以及视觉远距离测量更新都是必要的,但增加了计算费用.

规划方法的比较

Approach Task Horizon 泛化能力 Compute Data Needed Maturity
Whole-body control (WBC) Single skill Low (task-specific) High (1kHz QP) Dynamics model Production-ready for locomotion
Decoupled nav + manip Single skill Moderate Low SLAM map + manip demos Most deployed approach
End-to-end IL (ACT) Multi-step skill High (within task) Moderate (GPU) 50-500 teleop demos Research demos (Mobile ALOHA)
TAMP (任务与运动规划) Multi-room High (combinatorial) Very high Domain specification Academic demos, limited production
LLM + skill library (SayCan) Open-ended Very high (language) High (LLM inference) Skill demos + affordance model Emerging (TidyBot, SayCan)
VLA end-to-end (pi0-style) Multi-step Very high Very high (7B+ model) Large-scale diverse demos Early commercial (Physical Intelligence)

移动操作数据收集

移动操作的远程操作示范收集比固定基操作更难,因为操作员必须同时控制基底运动和臂臂运动.

  • **走后面的遥控操作 (移动ALOHA风格):**操作员在机器人后面行走,通过领袖臂控制手臂的运动,而基部则跟随操作员的行走运动.对操作员来说,这对操作员来说是最直观的,但需要大量的物理空间,并限制了基本速度到步行速度 (~1.5m/s). 适用于基本轨迹重要任务 (例如,在携带物体时在家具周围导航).
  • **VR远程操作:**操作员使用VR耳机从机器人的视角来查看,并通过手控器和插座控制基 + 臂. 允许远程操作,但增加延迟 (20-50ms网络 + 10ms 转化),从而降低了接触任务的示范质量.
  • 基于路线点的收集: 分离基路轨迹和操纵演示.首先,手动地将机器人驾驶到操纵前姿势 (或使用自动导航堆).然后从固定基路位置收集操纵演示.操作员更简单,但不捕捉协调的基臂运动. 适用于导航和操纵不过于时间重叠的任务.

据悉,RCSV的数据收集基础设施支持三种方法.我们的旧金山设施拥有800多平方英尺的可配置地板空间,用于移动操纵数据收集,并用于地面真相基础跟踪的运动捕捉级本地化.

实际部署的例子

  • 勤奋机器人模拟器: 车轮移动操纵器用于医院病房供应和布料运输. 商业部署在20多个美国医院到2025年. 使用离合导航+操纵结构化环境 (已知病房布局,标签存储地点).
  • **6河流系统 (Shopify):**基于AMR的仓库采集系统,帮助人类工人.处理结构化的垃圾选,而不是完全的移动操纵.证明限制的移动操纵 (已知物体,已知地点) 是商业上可行的.
  • **Hello机器人伸展临床试验:**华盛顿大学和乔治亚科技大学对家庭老人护理工作 (搜索物体,打开门) 的伸展试验.公布的结果显示,在日常生活任务中取得了65-80%的成功.望远镜臂设计适合传统的6DOF臂不适合家庭环境.
  • **Google DeepMind RT-2 在日常机器人上:**RT-2 VLA模型被部署在谷歌办公楼的移动操纵器机队上,执行厨房清洁和办公桌清洁任务. 维拉脊柱能够按照"在监视器附近取果并将其放入堆肥桶"的指示,以零射击对新物体进行通用化,尽管操纵精度仅限于5mm+耐受性任务.

移动操作数据差距

移动操纵研究最大的瓶是数据短缺.固定基层操纵数据集 (Open X-Embodiment,DROID,BridgeData V2) 包含数百万集,但移动操纵数据集是10-100倍小的,因为收集更难和更慢. 这种数据差距意味着移动操纵政策与固定基础政策相比,特别是在长远任务中,缺乏训练.

关闭这一差距需要专门的数据收集基础设施 空间足够大,可用于导航,硬件可以捕捉与臂状况一起的基距离,以及训练有素的整个身体电话操作操作操作人员. 通过标准化的移动操纵收集协议和HDF5/RLDS格式的输出,与ACT,扩散政策和VLA细节调整管道兼容.试点项目从2,500美元开始;完整的移动操纵活动从8,000美元以上.

相关阅读

  • ,我知道你是个.
  • ,我认为这是一个非常重要的问题.
  • T7) 关于"普计划调查"
  • [为什么Teleop数据比Sim]
  • [数据服务]
  • 公司的公司
  • T11

移动操纵解决方案

提供硬件咨询,数据收集和系统集成,用于移动操纵部署.

T12)