返回Blog

化身人工智能解释了它是什么,为什么重要,以及它向哪里迈进

对于人工智能的下一个界限,以及它对今天的机器人团队构建意味着什么.

[←博客]

语言模型将信息转化.体现的AI将改变物理工作,但基础设施挑战基本不同.

机器人是什么?

实体人工智能指通过物理身体感知和行动在物理世界中的人工智能系统,而不是仅仅单独处理文字或图像.机器人,自动驾驶汽车,假肢和与物理空间互动的增强现实系统都属于这个定义.

语言模型运行在一个明确的,可逆的领域中,使用分离的代币. 嵌入式AI系统在连续的物理状态上运行,其中行动是不可逆转的 (丢弃的对象不能"不被扣"),部分可观测性是不可避免的 (摄像头无法看到对象后面),延迟要求是实时的 (二秒推断延迟导致机器人进入墙壁).

具体来说:GPT-4可以在500ms内处理提示,用户几乎没有注意到.在10Hz控制频率执行选择和位置任务的机器人臂每决策周期有100ms. 如果神经网络推断需要80ms,剩余20ms由传感器阅读和动机命令传输消耗,则网络延迟,垃圾收集暂停或意想不到的计算峰值的差距为零.这种实时限制塑造了人工智能体现中的每个架构决定,从模型大小到部署硬件.

化身假设

罗德尼布鲁克斯在20世纪80年代认为,智能不能与世界的物理互动分开. 理智能力最丰富的源自感觉运动体验,而不是抽象符号操纵.这是一个有争议的说法,但过去三年的人工智能发展提供了对其版本的间接证据.

仅基于文本训练的大型语言模型显示了物理推理的一致缺陷,它们无法可靠地预测一堆块是否会掉下来,描述螺旋紧缩所涉及的力量,或规划一个连续的物理行动,具有正确的空间关系. 由于GPT-4在"堆积块"稳定测试中失败,这对18个月的人类来说是惊人的.

最近的谷歌深度思维 (RT-2, 2023) 项研究提供了迄今为止最直接的证据:当视觉语言模型在互联网规模的文本/图像数据和机器人互动数据上进行联合训练时,它会发展出任何数据源本身都无法产生的物理推理能力. 机器人互动数据,即使在比较小的规模,也使模型对物理,物体永久性和空间关系的理解以一种被动观测无法的方式建立基础.

实体化人工智能硬件堆

每个体现的AI系统都建立在一个三层硬件堆上:感应器可以感知世界,计算能够处理感知并产生行动,以及执行这些行动的执行器.

传感器:机器人如何看到和感觉

**视觉 (RGB 摄像头):**大多数操作任务的主要感觉模式.标准配置使用2-3台摄像头:手腕安装摄像头用于近距离操作视图 (Intel RealSense D405,300美元),对工作场合背景的空头摄像头 (Basler acA1920,800美元),并可选使用侧视图摄像头进行深度分歧. 对于政策培训而言,目前的解决方案是640x480分钟30fps的解决方案.

深度传感: 静电深度摄像头 (RealSense D435i) 或结构化的光传感器提供3D点云,使对物体形状和姿势的几何推理成为可能. 雷尔森斯D435i提供了深度在1280x720分辨率,在2m范围内提供了0.2%的深度精度.

**自觉 (联合编码器):**每个机器人关节都有一个编码器,报告位置 (通常是速度和扭矩).这种自觉流是机器人的自我模型的基础. 知道自己的身体在空间中的位置.每个关节的编码器分辨率为14-16位 (16,384-65,536次计算每转换) 是研究级臂的标准.

强力矩感知器: 6轴强力矩感知器 (ATI Mini45,$3,500) 安装在手腕测量操纵过程中接触力.对于接触丰富的任务至关重要:插,组装,可变形物体处理. 没有F/T感觉,机器人除了视觉外,无法区分"轻轻触对象"和"粉碎对象",这对于力估计是不可靠的.

**触觉感知:**新兴边界.像GelSight (每指尖200-500美元) 和Paxini触觉手套这样的触觉感知器提供接触几何学和压力分布在抓取点.MIT (Agrawal实验室) 和Meta的研究表明,将触觉感觉添加到操纵政策,可以提高15-25%的抓取成功率. 通过我们的商店,RCSV通过我们的"T1"存储了Paxini触觉感测硬件.

计算:边缘处理

实体人工智能计算位于两个竞争要求的交叉点:模型需要足够大,以便在任务中通用,但推断必须足够快,以实现实时控制.

Compute Platform Inference 延迟 (10M param policy) Power Price Use Case
NVIDIA Jetson AGX Orin 5-15ms 15-60W $1,999 On-robot deployment
RTX 4090 workstation 2-8ms 450W $8,000-12,000 Lab research, training + inference
Intel NUC (CPU only) 50-200ms 28W $800-1,200 Simple policies, classical control
A100 80GB (cloud/cluster) 1-5ms 300W $15,000+ Training, large model inference

趋势很明显:在Jetson级硬件上部署边缘用于生产,GPU工作站用于开发和培训.云推断增加了20-100ms的网络延迟,这对于实时操纵控制是不可接受的,但对于高层次任务规划是可接受的.混合架构 云用于规划,边缘用于控制 正在成为标准.

动力:使物动

动机将电信号转化为物理运动.动机技术的选择决定了机器人的速度,精度,力输出和合规性 (能够安全地吸收意想不到的接触力).

** 伺服电机 (Dynamixel, Feetech):** 默认的研究臂在 $2,000-10,000 范围. 迪纳米克斯 XM430 伺服器提供4.1 Nm扭矩,12位位置分辨率,以及通过连续巴士可访问内置的 PID 控制器.整个OpenArm 平台运行在迪纳米克斯尔伺服器.

**无刷直流电动机 + 协调驱动器:**用于商业同步机 (UR,Franka,Kinova).提供更高的扭矩密度,较低的反响,比爱好服务器更好的扭矩感知.Franka Research 3的每一个关节的扭矩传感器 (0.05Nm分辨率) 能够实现阻力控制,使其在接触丰富的任务中出色.

** 接近直驱 (QDD):** 采用在Unitree G1的人类型和几种新研究平台中使用的新兴动力架构.QDD使用低比率的变速箱 (6:1至 9:1对100:1对和驱动) 具有固有的倒车性,这意味着机器人的关节可以被外部力量推进,而不会损坏变速箱. 这种特性对于安全的人类机器人互动和学习合规操纵行为至关重要.

培训数据要求:体现的AI与LLM

实体人工智能的数据经济学与语言模型基本不同,理解这种差异对于任何计划实体人工智能项目的人来说都是必不可少的.

Dimension LLM Training Data 体现人工智能 Training Data
Source Web crawl (passive) Physical teleoperation (active)
Cost per unit ~$0.001/token $3-80/demonstration
Collection speed Millions of tokens/second 30-60 demos/hour/operator
Largest dataset (2026) 15+ trillion tokens ~1M episodes (Open X-Embodiment)
Data reusability Universal (text is text) Embodiment-specific (data from one robot has limited transfer to another)
Quality bottleneck Filtering web noise Operator skill + consistency

这3000-80,000倍的成本差异每数据单位意味着使语言模型革命的数据飞轮必须是故意为物理世界设计的. 建立数据收集基础设施,运营商网络和质量管道,使物理世界人工智能训练数据在规模上具有经济可行性.

主要研究小组在开展领域

实体人工智能研究集中在少数机构中,这些机构结合了强大的 ML 能力和活跃的机器人硬件实验室.了解谁正在做什么帮助团队识别潜在的合作者,将自己的工作进行基准,并预测该领域的方向.

**斯坦福 (IRIS实验室,SVL):**切尔西芬尼的IRIS实验室生产了ALOHA (双手机电话操作,2023),移动ALOHA (2024),以及对机器人适应的元学习的基础工作.Fei-Fei Li的SVL开发了家庭任务的 BEHAVIOR基准套件.多萨萨迪希的团队研究了人与机器人互动和从偏好反中学习. 斯坦福的集体产量可能比任何其他单一机构都定义了更多的当前的IL工作流程.

**UC伯克利 (BAIR):**皮埃特·阿贝尔的小组 (与联合创始人ai/Physical Intelligence) 制作了早期的政策学习工作.塞尔盖·莱文的小组推动了包括SAC,AWAC和桥梁数据V在内的基础RL-for-robotics研究. 据悉,这项研究的成果是来自伯克利-斯坦福大学-CMU合作.

**CMU (机器人研究所):**迪帕克·帕塔克的小组致力于好奇心驱动的探索和跨体现物传输.戴维·赫尔德的小组专注于可变形物体操纵.CMU的实力在于从有限的数据中学习,并从模拟和现实之间传输.HomeRobot基准和几个关键的真实到真实技术起源于这里.

**MIT (CSAIL):**普尔基特·阿格拉瓦尔的不太可能的AI实验室在触摸操纵和接触丰富的任务上工作.拉斯·特德雷克的团队开发了Drace (模拟和优化框架) 并在操纵的整个身体规划上工作.丹尼拉·鲁斯的分布式机器人组合研究了多代理协调. 麻省理工学院的特别强大处于物理知识为操作的方法 使用物理理解来补充数据驱动的学习.

**谷歌深思机器人:**RT-1,RT-2和RT-X系列论文定义了视觉语言行动 (VLA) 模型范式. 深思维的优势是规模:它们在多个网站上运行数百个机器人臂,

物理智能 (Pi):** 由斯坦福/伯克利机器人学院 (切尔西芬,塞尔盖·莱文,卡罗尔·豪斯曼,布莱恩·伊切尔) 创立.Pi开发了 pi-0,一个基于各种操纵数据训练的一般主义机器人政策.他们的方法强调在异质数据来源上进行预训练,并为特定任务进行细节调整.

目前的能力:2026年实际上能实现的

想要从实验室中进行复制性研究,而不是单个实验室的演示,需要从实验室中进行复制性研究.

操纵 (武器+抓手)

  • 结构化选择和位置: 90-98%的成功率在已知物体中已知姿势.这是商业部署在亚马逊,伯克希尔灰,和其他.解决,警告"结构化"资格是做重力.
  • 开放词汇捕获: 60-75%的成功在新物体上具有语言规定的目标 ("挑选红杯").OpenVLA,Octo和RT-2都证明了这一能力.足够好用于研究演示,但还不够可靠用于未监督部署.
  • 接触丰富的组装: 70-90%的成功与任务特定政策训练每任务200-1,000个示范.ACT和传播政策是主导的方法. 需要任务特定数据收集尚未进行零射组装.
  • 可变化的物体操纵: 折叠毛巾,处理袋和电缆路线等任务中40-70%的成功.这是操纵最困难的边界,因为可变化的物体具有无限维度的状态空间,难以感知和预测.

交通

  • 四面部车辆: 解决平坦和中等粗的地形.Unitree Go2,波士顿动力点和ANYmal所有可靠的跨越楼梯,石灰岩和坡道.RL训练的车辆 (训练于Isaac Lab/Gym) 转移到真实硬件,可靠性为95%.
  • **双脚步行:**可靠在受控环境中.G1号树和图2号号树在平面地面上以1.5-2.0米/秒的速度行走.粗的地形和动态的障碍回避仍然是活跃的研究.可在RCSV的旧金山实验室提供 [租可用]T4).
  • 全身控制: 针对特定任务 (站起,从椅子上抬物而行走) 在特定地点进行示范.

自动驾驶汽车

  • Waymo:尼克斯,旧金山和洛杉矶运营700多辆自动驾驶汽车,在测量量量度上,其安全记录超过了人类驾驶员.
  • 特斯拉FSD: 监督高速公路和结构道路的自主化. 训练在车队的数十亿英里的人类驾驶数据. 尚未完全自主化 需要人间监督.

现在出现的商业应用

实体化人工智能不仅仅是一个研究领域.它在特定垂直领域产生商业价值.了解哪些应用程序现在具有商业可行性,而哪些仍然处于研究阶段,有助于团队正确地优先考虑.

**仓库自动化 (现在):**目前最大的商业应用体现的AI.亚马逊在其交付网络中运营了75万+机器人.到2028年,仓库机器人可地址市场估计为15亿美元.关键任务是货物人对货物运输,片,片,目前抓住器可以处理的60至80%的SKU的零件采集. 查看我们的 [仓库 ROI分析]

农业收获 (现在): Agrobot和AppHarvest等公司在草和番茄收获方面部署操纵机器人.挑战是感知 (识别成熟产品) 和温和的操纵 (不伤害水果).由于农业收获劳动力短缺严重,草采集的成功率为85%至90%是商业上可行的.

**医疗物流 (现在):**勤奋机器人的Moxi机器人部署在美国10多个医院供应.核心能力是导航+简单的物体运输不是巧妙的操纵.今天收入正.

** 施工和检查 (EMERGING):** 波士顿动力系统Spot用于施工现场的进展监测和危险检测.

**食品制备 (研究):**多家公司 (Miso Robotics,Chef Robotics) 正在部署单任务食品制备机器人 (翻汉堡,配送补丁).通用仍然在研究阶段.斯坦福的MimicGen和RoboCasa基准推进这一点.

基于人工智能基础设施的RCSV作用

实体人工智能有一个明确的基础设施瓶:物理数据收集,硬件访问和集成专业知识.

**硬件访问:**我们的旧金山和奥尔斯顿设施提供了20多台机器人,包括OpenArm 1 ($4,500,开源6-DOF),DK1双手系统,Unitree G1人形和专业平台.团队可以从800美元/月开始 [租用硬件]T6) 或使用我们的设施进行现场数据收集.

数据收集服务: 专业的示范收集,包括训练有素的运营商,标准化协议和自动化质量管道.试点 (50 示范) 的价格从2,500美元开始,标准活动 (500 示范) 的价格从8,000美元开始.数据提供在 HDF5,RLDS或LeRobot格式.查看[数据服务]T7) 关于当前的价格和任务目录.

平台: RCSV数据平台 提供数据集管理,事件可视化,质量评分和出口到标准培训格式.

培训基础设施: 8x A100 80GB GPU 集群可用于政策培训,标准和优先排列选项.典型的转型时间:4-12小时用于标准政策尺寸 (ACT为200个演示,传播政策为500个演示).

实际的时间表

Timeframe 体现人工智能 Milestone Key Enablers
2025-2027 Specialized task robots deployed at scale in logistics Mature grasping policies, falling hardware costs
2026-2029 General-purpose manipulation in semi-structured environments Foundation models for manipulation, large-scale data
2028-2032 Generalist mobile manipulation in unstructured home environments Sim-to-real at scale, tactile sensing maturity
2030-2035 Humanoid robots performing non-trivial physical labor Whole-body control, dexterous manipulation breakthroughs
2035+ Broad humanoid deployment across manufacturing, services, elder care Cost reduction, regulatory frameworks, social acceptance

现在,构建体现的人工智能系统的团队正在这个曲线的最早和最受惠的部分工作.目前正在建成的数据基础设施,运营商管道和评估框架将定义整个领域的轨迹.RCSV的 [平台]T9) 设计为该基础设施的一部分.

开始使用人工智能

如果您是考虑实施人工智能项目的团队,以下是实用的开始检查列表:

  1. 精确定义您的任务."一般用途机器人助理"不是任务. "从输送带中取瓶子,放入包装盒"是一个任务.具体性使得数据收集规划成为可能.
  2. 选择适合您的任务的硬件. 不要为一个$4,500的OpenArm可以处理的任务购买5万美元的手臂.不要为需要7DOF的任务购买6DOF手臂.请参阅我们的 机器人手臂购买指南.
  3. 数据收集预算. 计划为具体任务政策进行200-1000次示范,或为基础模型进行20-100次示范. 预算为标准数据收集活动为3,000-15,000美元. 查看我们的 成本分类.
  4. **从模仿学习开始.**IL更快地进行代,更安全地开发,比RL更可预测的成本.
  5. 严格评估. 执行至少50次政策评估试验,以满足部署预期的条件.在培训环境中取得90%的成功的政策在稍微不同的部署环境中可能达到60%的成功.

相关阅读

  • 物理人工智能与软件人工智能是如何不同的
  • [什么是好机器人训练数据?]
  • [2026年机器人数据收集成本]
  • 开始使用"抱脸"的机器人学习库
  • T17) 现实的期望
  • RCSV数据服务 专业数据收集
  • [硬件目录]T19) 机器人和组件

建立适合人工智能的基础设施

对于构建下一代物理人工智能的团队,RCSV提供了数据收集,机器人硬件和培训平台.

根据"数据服务"的规定,