返回Blog

物理人工智能是什么?定义,例子和如何开始 (2026)

物理人工智能定义:通过机器人体现来学习和在物理世界中行动的AI. 它如何工作,实际例子 (OpenArm + Wuji Glove,Unitree G1),以及如何使用LeRobot开始您的第一个物理人工智能项目.

物理人工智能是通过机器人体来在物理世界中作用的人工智能系统的术语.它不是特定的算法或产品.它是一个从机器人手臂学习到选择和放置物体到人形机器人学习步行和导航家园的人工智能研究和部署类别. 这本指南解释了物理人工智能是什么,它从技术上与其他人工智能有什么不同,整个基础设施堆是什么样子,

内容

  1. 物理人工智能:定义
  2. [物理人工智能如何工作:学习循环]
  3. [物理人工智能系统的关键组成部分]
  4. 示例:开臂+武吉手套,单树G1
  5. [RCSV在物理人工智能基础设施中的作用]
  6. [如何开始:租一台机器人,收集50个示范,与乐机器人一起训练]
  7. ,我很高兴能看到你.

物理人工智能:定义

物理人工智能指AI系统,通过机器人体现感知,考虑和在物理世界中行动.定义的属性是基地:AI的输入是真实传感器数据 (摄像头,力传感器,编码器) 其输出是真实执行器命令 (动力扭矩,抓住器位置) 改变现实世界中的物理对象状态.

这与纯数字人工智能 (AI) 形成对比. 它们是处理和输出数字代币的大型语言模型,图像分类器,推系统. 只有在数字领域才存在ChatGPT响应;一个物理人工智能机器人手臂从桌子上拿出杯子,已物理改变了世界状况. 物理地定是使物理人工智能作为工程和研究问题从根本上不同.

"物理人工智能"这个术语于2024年被NVIDIA普及,并被机器人行业迅速采用. 詹森·黄将其描述为"AI理解和与物理世界互动".实践中,研究人员和工程师在这个领域工作已经在几十年来一直在研究"机器人学习","体现的AI",和"操纵"等名字下,

物理人工智能系统主要基于三个学习范式:模仿学习 (机器人通过观看和复制人类示范学习),强化学习 (机器人通过模拟或现实世界中的试错学习) 和视觉语言行动模型 (机器人从一个大型预训练模型中进行精细调并用自然语言进行指导). 大多数生产级物理AI系统使用仿真学习作为主要数据收集方法,RL用于精炼和通用化.

物理人工智能如何工作:学习循环

物理人工智能系统通过执行一个循环来学习,反映了人类如何学习物理技能:观察,尝试,收到反,改进.实际上,该循环的工程实施涉及几个明确的阶段.

阶段1:通过电话操作收集数据

物理人工智能数据收集最常见的方法是远程操作:人类操作员通过目标任务手动控制机器人,同时记录所有传感器数据.录制捕获了关节位置,终端效应器状态,摄像头图像 (通常是2-4摄像头),以及可选的力扭矩传感器数据. 结果是一个示范数据集:一个展示人类如何完成任务的轨迹集.

双手机远程操作系统ALOHA,武吉手套和VR远程操作设置都是物理人工智能数据收集的远程操作基础设施的例子.RCSV的DK1数据收集套件专门为此阶段设计.它提供了一个完整的预校准的远程操作设置,记录在LeRobot格式中的示范.

第二阶段:政策培训

演示数据集用于训练一个政策一个神经网络,从观察到行动.鉴于当前的摄像头图像和机器人状态,该政策输出了机器人执行的下一步行动.训练目标是行为克隆:使该政策的预测行动与人类对训练数据的示范行动相匹配.

现代物理人工智能政策使用变体架构.ACT(Action Chunking with Transformers) 预测未来的行动块,而不是单个步骤,从而减少了复合错误.扩散政策使用了扩散模型来生成行动轨迹,从而改善了多模式行为处理任务的能力. 像OpenVLA和pi0这样的VLA使用在互联网数据上预训练的大型视觉语言模型作为脊柱,然后在机器人示范上进行细节调整,以受益于预训练模型的广泛世界知识.

阶段3:部署和评估

训练有素的政策在机器人上实时运行:在每个控制步骤 (通常是20-50ms),该政策阅读了当前的相机框架和联合状态,计算了下一步的操作,并将该操作发送给机器人的控制器.这种推理循环必须比现代硬件 (RTX 4090,Apple M2 Ultra) 的控制频率更快运行,这对于大多数政策架构来说是可行的.

评估测量了该政策在目标任务中取得成功率,通常在测试的多个实验中具有不同的对象位置,以测试通用化.在50个示范中进行训练有素的模仿学习政策通常在分发场景中实现70到90%的成功率,并在训练中未见到的对象或位置中达到30-60%.

阶段4: 精炼和持续改进

通过数据飞行车效应,物理人工智能系统得到改善.每次部署都会产生新的数据成功完成和失败可以添加到培训集中.在增强数据集上重新训练的政策显示了改善的成功率和更好的通用化. 长期目标是一个闭环,机器人通过自主操作生成自身的改进数据,只能在机器人的现有能力之外的情况下进行人类干预.

这种持续改进循环是使物理AI从经典自动化根本上不同之处:一个经典机器人达到其编程所定义的性能上限;物理AI系统原则上没有这样的上限,只有在当前的数据和计算状态下.

物理人工智能系统的关键组成部分

机器人硬件

机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机器人机 人类平台 (Unitree G1,敏捷卡西)用于机动和全体研究.

摄像头和传感器

物理人工智能政策主要基于视觉:它们将摄像头图像作为主要的观察输入.典型的设置使用2-4摄像头一个上层 (全球工作空间视图),一个或两个手腕安装的摄像头 (最终效果器和对象的近距离视图),并可选使用前面摄像头进行导航. 摄像头时间和同步问题:无同步的多摄像头设置带来时间不一致性,从而减少细节任务的政策性能.

除了摄像头之外,强力扭矩传感器和触觉传感器提供了摄像头无法提供的联系信息.对于接触丰富的任务 (螺丝,插入,组装),这些传感器显著提高了政策成功率.RCSV的硬件目录包括同步的摄像头套件和为普通物理人工智能设置配置的强力扭矩传感器.

电操作接口

收集良好的远程操作数据需要一个控制界面,可以自然地映射人类运动到机器人运动.领导跟踪系统 (如ALOHA) 使用与控制器相同的机器人臂.手套系统 (Wuji Glove, Rokoko) 捕捉手指运动. VR控制器用于更具沉浸式的设置,操作员可以看到现场摄像头传输,并远程控制机器人.

接口决定了数据质量,就像操作员的技能一样.设计不好的接口产生了噪音,不一致的示范,而学习难以.RCSV的操作员始终生产清洁的数据,因为我们的设置是校准的,我们的操作员在特定的接口上受过培训.

数据存储和管理

机器人示范数据集很大:一个单个集中4台摄像头以30fps和100Hz联合数据为30秒的数据大约是80-200MB,取决于分辨率.一个1000个示范数据集是80-200GB. 主要的格式是HDF5 (ALOHA标准) 和LeRobot格式 (Parquet +视频文件,拥抱面孔兼容). 选择与您的培训框架兼容的格式是重要的.

RCSV的 [数据平台]T7) 管理数据集存储,版本化,注释和出口,以LeRobot和HDF5格式.通过我们的管理服务收集的所有数据都立即可通过平台API进行培训.

政策培训计算

在50个示例上培训一个散政策或ACT政策需要2-6小时在单个RTX 3090/4090上.在1000个示例上调整VLA需要8-24小时在 2-4A100上.计算要求规模与数据集规模和政策架构复杂性. 对于大多数研究项目来说,一个本地GPU工作站足够用于初步实验;当扩展到数千个示范或训练大型VLA时,云训练成为必要的.

模拟环境

模拟用于规模化政策评估 (在模拟中运行1000个评估推广比硬件更快,更安全),通过域名随机化生成合成训练数据,以及强化学习,在物理奖励信号难以指定的情况下.MuJoCo,Isaac Sim和Genesis是主要的模拟平台. 大多数研究小组使用模拟进行代,硬件进行最终验证.

举例:OpenArm + 武吉手套和G1单元

操纵例:开臂1 + 武吉手套模仿学习

具体的物理人工智能设置用于桌面操作:一个OpenArm1 6-DOF臂,最终效果器是Wuji Hand,由穿着Wuji手套的操作员控制.手套捕捉操作员的手和手指位置并无线向机器人控制器传输它们,该手套在实时反映了操作员在机器人上的运动. 工作空间的记录是由3台RealSense摄像头 (上头+两个手腕安装) 进行的.

在一个典型的数据收集会议中,一个运营商每小时收集10-15个示范.50个示范时间需要一个长时间或两个短时间的会议.原始数据在RCSV平台上存储在LeRobot格式中,并立即准备好进行传播政策或ACT培训.培训在RTX 4090上需要3-4小时. 结果的政策在同一GPU上以25-50Hz推断,并在分发中获得75-85%的成功.

对于客户数据收集程序和我们自己的研究,RCSV在旧金山实验室运行了这个准确的设置.从硬件设置到首次实施政策的终端周期为新任务的4-6周,或者在使用我们的管理服务时2-3周.查看[武吉手机电操作指南]T8) 设置详情.

机动机型:全身物理AI的G1人体型单元树

对于机动和全身控制,G1是2026年最可访问的人类型平台之一.G1拥有43个DOF,机载计算,并为所有关联状态和传感器数据发布ROS2主题. 物理人工智能用于移动操作与操纵不同:而不是从远程操作学习模仿,大多数移动研究使用在模拟中加强学习 (Isaac Lab或MuJoCo) 与真实转移的sim.

一个典型的移动物理人工智能项目:定义模拟中的奖励函数 (前进速度 +稳定处罚 +能量处罚),训练一个政策与PPO或SAC为10-50万模拟步骤 (8-24小时4A100),应用域名随机化来关闭真实与真实差距,然后部署在真实G1. 基本的交通任务 (平面地步,跨越障碍) 的成功率现在超过90%的精心设计的模拟到真实的管道.

整体操纵同时使用机器人的运动和它的臂臂是物理人工智能研究的下一个界限.挑战是协调高DOF行动空间 (43关节) 与复杂的多步骤任务.移动ALOHA和类似平台是该问题的当前研究领导者.

物理人工智能基础设施中RCSV的作用

我们提供了研究人员和公司需要构建物理人工智能系统的六层堆:

Layer RCSV Offering Link
1. Hardware Robot arms, grippers, humanoids, sensors — buy or lease Store, Leasing
2. 遥操作 DK1 kit, managed operators, on-site collection Data Services
3. Data Storage & Management LeRobot/HDF5 format, episode browser, versioning, annotation Platform
4. Policy Training Pre-configured ACT, Diffusion Policy, OpenVLA pipelines Platform, AI Models
5. Simulation MuJoCo and Isaac environments, sim-to-real transfer support RL Environments
6. Deploy & Evaluate Benchmarks, real-robot evaluation, deployment tooling Benchmarks

大多数物理人工智能项目停滞不前,不是因为算法是错误的,而是因为基础设施缺失或碎片化.数据是以一种格式收集的,培训框架预期另一个格式,评估设置不符合部署环境,并且在硬件变化时,整个管道需要重建. 为了使该基础设施可靠,研究人员和企业可以专注于实际困难问题,

如何开始:租一台机器人,收集50个示范,与乐机器人一起训练

如果您想从零开始运行您的第一个物理人工智能实验,以下是最快的可信路径.

步骤1:获得硬件 (第一个星期)

机器人臂通过RCSV的 [租计划]T17) 而不是直接购买.租的OpenArm 1或ViperX 300预先校准并准备运行.从零开始购买和组装硬件增加了 2-4周;租让你收集数据在几天内.月租费通常是硬件购买价格的 3-5%,而对于5,000-10,000美元的手臂为150-500美元/月.

您还需要摄像头.三台RealSense D435i摄像头 (每台300美元) 覆盖大多数桌面设置.为工作场所环境安装一个上层费用,一个在左手腕上,一个在右手腕上.RCSV的摄像头安装设计可在我们每个手臂模型的硬件目录页面上找到.

步骤 2:设置远程手术 (1-2周)

对于领导者跟随者电操作,配置一个手臂作为领导者 (运营商物理地移动它) 和一个作为追随者 (反映领导者的联合位置).ACT和LeRobot存储库包括用于共同的手臂平台的参考电操作脚本. 设置USB设备的号,以便每个臂的串行端口在重启中被一致分配 如果端口分配错误,Dynamixel Daisy-chain通信默默失败.

在记录数据之前,试试设置5个练习节目. 寻找:领导和追随者之间的延迟 (应该是 <50ms),摄像头同步 (检查时间标签),和关节限制 (确保任务期间臂不能自动碰撞). 在收集生产数据之前解决这些问题.

步骤3:收集50个示范 (2周)

选择一个具体任务,收集50个示例. "具体"问题:"取红杯"是一个任务;"取物从桌子上"不是.每个示例都应该涵盖从开始 (手臂在家位置,物体在定义区) 到结束 (物体放在目标位置,手臂回家). 始终条件是关键的.

五十个演示足以获得简单任务的工作政策 (单个对象的选择和放置,推力).对于接触丰富的任务 (插,盖螺丝),预算150-300个演示.RCSV的 [管理数据收集服务]T18) 可以在经过训练的操作员的时间内收集50-200个演示,数据以LeRobot格式交付,准备好进行培训.

步骤4:与勒罗伯特一起训练 (第三周)

莱罗波 (来自 Hugging Face) 是新物理人工智能项目推的培训框架.它支持了扩散政策和ACT,有良好的文档,并使用了与RCSV的数据平台兼容的标准数据集格式.安装它,配置数据集路径,并运行培训:

系统安装pyr lerobot # 在数据集中列车传播政策 python lerobot/scripts/train.py \ policy=diffusion \ env=your_task \ dataset_repo_id=your-username/your-dataset \ training.num_epochs=100 # 在机器人 python lerobot/scripts/eval.py \ --pre-trained-policy-name-or-path输出/train/last_checkpoint \ --env your_task

训练100个时代50集需要3-6小时的RTX4090. 监视训练损失曲线它应该在第30-50个时代和高原中稳步减少.如果损失高原早 (在20个时代之前),你可能会遇到数据质量问题:检查不一致的启动状态,缺失摄像头框架或编码器噪音. 查看 [LeRobot开始指南]T19) 详细的配置选项.

步骤5:评估,再重复 (三至四周)

运行20-50项评估试验.将对象放置在任务区内的不同位置 (开始训练位置 ±5厘米内) 并测量成功率.如果成功率低于50%,常见原因是:示范过少,训练数据不一致,摄像头校准漂移或操作空间中的任务模糊性. 如果在分销中工作的成功率超过80%,但在分销之外工作的成功率急剧下降,则需要更多样化的培训数据,涵盖更广泛的工作空间.

每个代周期收集更多数据,重训,评估在基础设施设置后需要1-2天.在努力的物理人工智能项目通常需要更多数据,而不是不同的算法.在尝试更复杂的政策架构之前,尽量利用更多示范和更好的数据质量获得的收益. 查看我们的 [常见模仿学习错误指南]T20) 查看失败模式和修复的完整列表.

常见的问题

物理人工智能是什么?

物理人工智能指通过机器人体现来学习和在物理世界中行动的人工智能系统.与处理数字数据的语言模型或图像分类器不同,物理人工智能系统必须通过摄像头和传感器感知真实环境,实时做出决策,并通过机器人执行器人执行行动. 定义特征是AI的输入和输出基于物理现实重力,摩擦,接触力以及实际物体的状态.

物理人工智能与传统机器人技术有什么区别?

传统机器人技术依赖于手编码的运动计划,明确的感知算法和预定义的任务序列.物理人工智能使用机器学习,通常是模仿学习或强化学习,以从数据中 rather than 明确的编程中获得行为. 关键区别是通用化:传统机器人需要对每项新任务或对象变化进行重新编程;如果在充分的多元数据上训练,物理AI系统可以通用到新情况.

物理人工智能基础设施堆是什么?

完整的物理人工智能基础设施堆包括: (1) 机器人硬件 (臂,抓住器,传感器,摄像头); (2) 收集人类示范的远程操作系统; (3) 数据存储和管理 (通常是HDF5或LeRobot格式); (4) 政策培训计算 (GPU工作站或云); (5) 在实时部署之前测试的模拟环境; (6) 部署和评估工具. 通过我们的硬件商店,数据服务,平台和计算资源,

我如何开始一个物理人工智能项目?

运行物理人工智能系统的最快途径: (1) 租借或购买一个平行抓住器的机器人臂 OpenArm 1或ViperX 300是好的起点; (2) 使用领导跟踪器或手套接口设置远程操作; (3) 收集50个目标任务的示范; (4) 在这些示范上使用LeRobot训练一个传播政策或ACT政策; (5) 在机器人上评估. 预算为第一个端到端周期的4-8周.RCSV的 数据服务 可以通过管理数据收集将这一时间缩小到2周.

更多资源

  • 机器人手臂,抓住器,传感器和人形
  • [机器人租]T23) 月份免除资本承诺的访问
  • [数据服务]T24) 管理的远程运营数据收集
  • T26) 训练你的第一个物理人工智能政策
  • T27) 算法深入潜水
  • 双手机远程操作平台用于物理AI
  • [机器人模仿学习]T29) 完整的方法指南
  • [常见模仿学习错误]T30) 如何解决低成功率
  • RCSV的VLA模型 OpenVLA, pi0,以及细调服务