返回Blog

机器人学习创业技术堆<unk>:2025年关键决策

机器人初创公司的技术决策 <unk>ROS2与定制中件,模拟选择,云与边缘推断和数据平台战略.

[←博客]

未来三年将限制您的建筑的四个基础设施决策以及如何在每个资金阶段得到正确的解决方案.

决定1:ROS2vs定制中件

这是所有机器人创业公司都在讨论的问题,大多数人会因为过度工程而错误.ROS2让你更快地运行机器人,让你获得了大量的驾驶员和工具生态系统, 酒吧/子架构处理多节点系统的复杂性,以及像MoveIt2,Nav2和ros2_control这样的包处理问题,从零开始实施需要数月的时间.

定制中介软件提供了两个真正的优势:低于5ms的延迟 (ROS2的DDS上限使得这几乎不可能) 和免费许可问题,如果您的商业部署模式涉及重新分配修改的中介软件层.

实际规则:使用ROS2除非你在B系列或更晚的运输产品中, 并且已经证明了实质性延迟限制. 中级软件的提前优化是机器人创业公司最昂贵的错误之一 - - 6个月重建DDS的机会成本在早期阶段是巨大的. 如果延迟成为后来的真正限制, 您总是可以更换运输层,同时保持ROS2接口.

选择ROS2 DDS供应商

如果您选择ROS2,DDS供应商比大多数团队意识到的更重要.默认CycloneDDS对于大多数应用程序都是一个坚实的选择.FastDDS (前一个默认) 在大型多机器设置中更好地发现,但内存上成本更高. 对于实时控制循环,CycloneDDS与iceoryx共享内存运输 (零拷贝) 消除了使标准DDS太慢于内部循环控制的序列化上层费用.

在RCSV支持的初创公司中,一个常见模式是:运行CycloneDDS用于所有非实时节点 (感知,规划,记录),并使用轻量化的定制运输 (原始UDP或共享内存) 用于政策推理节点和电动控制器之间的500Hz+内部控制循环. 这种混合方法可以让你获得95%的ROS2生态系统,

# Example: ROS2 + zero-copy shared memory via iceoryx
# In your ros2 workspace, set the middleware:
export RMW_IMPLEMENTATION=rmw_cyclonedds_cpp

# cyclonedds.xml -- enable iceoryx shared memory transport
# <CycloneDDS>
#   <Domain>
#     <SharedMemory>
#       <Enable>true</Enable>
#       <LogLevel>warning</LogLevel>
#     </SharedMemory>
#   </Domain>
# </CycloneDDS>

export CYCLONEDDS_URI=file://$(pwd)/cyclonedds.xml

决策2:模拟平台

模拟选择塑造了你的训练循环多年.

Simulator Parallel Envs Contact Physics License Best For GPU Required
Isaac Lab 4,096+ on A100 Adequate MIT (BSD-3 for Sim) GPU-parallel RL, locomotion Yes (RTX 3090+)
MuJoCo ~1,000 (MJX on GPU) Excellent Apache 2.0 Contact-rich manipulation, dexterous hands No (CPU OK; GPU for MJX)
Genesis 10,000+ on A100 Good (MPM for soft body) Apache 2.0 Soft body, deformables, fluids Yes
Gazebo (Ignition) 1-10 (CPU only) Adequate Apache 2.0 ROS2 integration testing, sensor sim No

NVIDIA Isaac Lab: 如果使用GPU加速RL训练,最好的选择是您的主要使用情况. 4,096+ 个A100上的平行环境,紧密的 Isaac Sim 集成,MIT 许可证,包括 Unitree G1 和 Franka 在内的不断增长的模型动物园. 物理X后端是快速的,但使用基于罚款的接触,可以允许在高时间尺寸的透.

MuJoCo: 任何一般用途模拟器中的最佳接触物理.基于限制的动态,高合规性稳定的接触处理.选择这项技术来进行精明的手术研究,接触丰富的操纵,或任何任务,接触精确性比并行性更重要. 通过JAX实现GPU加速,达到1000个平行环境,不像Isaac Lab那么快,但足以实现大多数操作RL.

基因斯:** 最新参与者,在涉及变形物体,液体和软体的任务中获得快速采用.基因斯使用材料点方法 (MPM) 来进行软体物理,该方法优于MuJoCo和Isaac Lab来模拟布料,食物和人体组织.如果您的初创公司在食品处理,织物操纵或手术机器人领域工作,基因斯值得认真评估. 强硬体任务的吞吐量比伊萨克实验室高.

**加塞博 (发火):**只要深度ROS2集成是一个艰难的要求,请选择 - - Gazebo是官方ROS2模拟器,并且具有最紧密的工具链集成.物理比GPU加速替代品更弱.可用于导航,传感器模拟和集成测试.由于仅使用CPU执行,RL训练不适用.

政策架构:ACT与扩散政策与OpenVLA

您的政策架构选择与您的模拟和数据战略密切相关.

Architecture Paradigm Data Needed Inference Speed Best For
ACT IL (CVAE + Transformer) 50-200 demos/task ~5ms (fast) Precise bimanual manipulation
Diffusion Policy IL (DDPM denoising) 100-500 demos/task ~100-200ms (slow) Multi-modal tasks, diverse strategies
OpenVLA / RT-2 VLA (vision-language-action) Fine-tune: 20-100 demos + pre-trained backbone ~200-500ms (very slow) Language-conditioned, multi-task
PPO/SAC (RL) RL (reward-driven) 0 demos (sim only) ~1-5ms (very fast) Locomotion, tasks with clear rewards

** 实际指导:** 如果您收集远程操作数据,需要快速代,请从ACT开始. ACT在单个GPU上运行数小时,并且推断足以实现实时控制. 如果您发现您的任务具有多个有效的策略 (例如,从左或右侧的方法) - ACT的单模态CVAE与多模态示范斗争,而分散政策则自然处理它们.只使用OpenVLA/RT-2如果您需要语言调节 (执行自然语言指令) 或是从预训练的基础模型中进行细节调节. 基于VLA的推断速度 (200-500ms) 限制了它们在反应时间不关键的任务.

决定3:云与边缘推理

推理延迟决定了您的模型运行地点.门约为150ms回路:在此下,来自一个共处数据中心的云推理对于大多数应用程序都是可行的.超过150ms在远程操作中引入了可见的延迟,并导致了闭环操纵控制器的不稳定性.

边缘计算:当前硬件景观

Device TOPS Price ACT Inference Diffusion Policy OpenVLA 7B
Jetson Orin Nano (8GB) 40 $249 ~15ms ~300ms Not feasible
Jetson AGX Orin (64GB) 275 $1,999 ~5ms ~120ms ~800ms (quantized)
Jetson Thor (expected 2025-26) ~800 ~$2,500 est. ~2ms ~40ms ~200ms (feasible)

云推断是有意义的,当:机器人连接可靠 (实验室或工厂用纤维),延迟超过150ms是可接受的应用,模型尺寸超过了边缘硬件的服务.混合方法很好 - - 运行设备上的快速低延迟反应控制器,放弃缓度的规划和感知到云.

云培训:成本指标

根据政策架构和数据集规模,培训成本有很大的不同.

  • ACT (单任务,200个演示): ~8个小时在1xA100 (40GB).成本: ~16美元在Lambda云 ($2/小时). ~24美元在AWS p4d实例.
  • ** 散政策 (单任务,500个演示):** ~24小时在1xA100上. 成本: ~48美元在Lambda上. 图像观测3摄像头大约三次训练时间与低光度观测.
  • OpenVLA精细调 (7B,100个演示): ~12小时在4xA100 (LoRA) 上. 成本: ~96美元在兰布达上. 完全精细调需要8倍A100和 ~200美元+.
  • PPO机动 (Isaac Lab, 4096 envs): ~4个小时在1x RTX 4090上.

决定4:数据平台战略

建立数据基础设施的决定比看起来更简单. 只有在员工中有一个专业的 ML基础设施工程师,其主要工作是数据工具,而不是一个负责维护工具的研究人员,一个专业的基础设施工程师.否则,维护负担将会对您最昂贵的人造成重大持续的税收.

数据平台必须做什么

您需要的核心功能:版本存储,快速检索的元数据索引,QA的可视化,数据集分类和出口到训练格式 (HDF5/Zarr/RLDS),以及多操作员环境的访问控制.从零开始构建这项系统需要3-6个月,需要持续维护.

数据集管理工具的比较

Tool Type Robot-Specific Collection Tools Training Integration
RCSV Platform Managed service Yes (teleop, annotation, QA) Full (hardware + software) HDF5/RLDS/LeRobot export
HuggingFace LeRobot Open-source lib Yes (robot datasets) Recording scripts ACT, DP, TDMPC built-in
Weights & Biases Managed service No (general ML) Experiment tracking only Any framework
DVC + MinIO Open-source stack No (general ML) Version control only Any framework

基本原则应该指导每一个选择: 购买基础设施,构建差异化. 竞争优势是你的机器人硬件,任务专业知识和政策架构 - - 而不是你的节目存储系统.

提供完整的数据基础设施堆 - - 收集,存储,注释,培训管道 - - 作为一个管理服务,

建议阶段按阶段

Stage Middleware Sim Policy Inference Data Platform
Pre-seed / Seed ROS2 Humble MuJoCo or Isaac Lab ACT (fast iteration) Edge (Orin Nano) RCSV or LeRobot
Series A ROS2 + custom control Isaac Lab + MuJoCo Diffusion Policy or VLA fine-tune Hybrid edge+cloud RCSV or build if infra hire
Series B+ Custom if proven need Custom + one of above Custom architecture Custom serving (TRT) Build if 2+ infra eng

相关阅读

需要数据基础设施吗?

斯威尔士特雷斯基平台处理节目存储,注释,可视化,以及训练输出,

查看平台 与工程师谈话