返回Blog

开始使用NVIDIA艾萨克实验室进行机器人政策培训

实用的艾萨克实验室设置指南 <unk>安装,内置环境,RL训练步行,性能提示和真实导出.

[←博客]

艾萨克实验室是最快的途径, 让我们在2025年获得 GPU平行化的机器人政策培训.

艾萨克实验室是什么?

艾萨克实验室是NVIDIA的GPU加速机器人模拟和学习框架,基于艾萨克Sim 4.0 (基于Omniverse).它支持在单个A100上多达4,000个平行环境,使RL政策培训能够在CPU基于模拟器上花费数周的时间完成. 没有限制商业使用, 具有比其他竞争平台的优势.

艾萨克实验室不是主要一个物理模拟器.它将模拟权力委托给艾萨克西姆的PhysX后端.它是一个培训框架:它管理环境向量化,观察/行动空间定义,奖励计算和训练循环接口与标准RL库 (RSL-RL,RL-游戏,稳定基线3).

装备

要求:Ubuntu 22.04,CUDA 12.1+,NVIDIA驱动器 ≥530. 最低的GPU:RTX 3090 (24GBVRAM)用于小型实验;A100 80GB用于生产训练运行.

  • **步骤1:**通过 pip 安装Isaac Sim 4.0.0 **pip 安装 isaacsim==4.0.0 --extra-index-url T12 这将大约15GB的包装. 预计快速连接20~30分钟.
  • 步骤2: 克隆艾萨克实验室并运行安装器: git clone T13 && cd IsaacLab && ./isaaclab.sh --install. 这会创建一个虚拟环境,所有依赖性,并运行验证测试.
  • 步骤3: 用无头测试验证: ./isaaclab.sh -p源/独立/教程/00_sim/create_empty.py --headless. 总设置时间:大约3045分钟,在一个新鲜的机器上使用快速互联网.

建筑环境概况

Category Environment Robot Task
操纵 Isaac-工作范围-Franka-v0 Franka Research 3 End-effector reach to target pose
操纵 Isaac-Lift-Cube-Franka-v0 Franka Research 3 Grasp and lift cube
操纵 Isaac-Open-Drawer-Franka-v0 Franka Research 3 Pull drawer open to target position
Locomotion Isaac-Velocity-Rough-Anymal-C-v0 ANYmal C Velocity tracking on rough terrain
Locomotion Isaac-Walk-Unitree-G1-v0 Unitree G1 Forward walking velocity tracking
Navigation Isaac-Navigation-Flat-v0 Generic diff-drive Goal-conditioned navigation

炼的过程

在2,048个平行环境中,从零开始训练起重立方政策:

  • 命令:****./isaaclab.sh -p源/独立/工作流/rsl_rl/train.py --任务伊萨克-升降-立方-弗兰卡-v0 --num_envs 2048 --无头**
  • 预期运行时间: 单个A10080GB上约8个小时,达到80%的成功率.RTX4090 (24GB) 上,将数量减少到512小时,预期20~30小时.
  • **观看什么:**监测事件的平均值 (应该在500万步后单调增加),成功率 (出口前目标 > 70%) 和价值损失 (应该稳定;如果出现差异,则减少学习率).

关键的超参数

Parameter Default Value Effect of Increasing
num_envs 2048 Better gradient estimates, higher GPU memory use
learning_rate 1e-3 Faster early learning, instability risk
gamma (discount) 0.99 Longer horizon planning, slower propagation
clip_param (PPO) 0.2 Less conservative updates, instability risk
num_mini_batches 4 Smaller batches, noisier gradients

进口自己的机器人 (URDF/USD)

艾萨克实验室支持在URDF (世界机器人描述格式) 或USD (世界场景描述) 格式中导入自定义机器人模型.对于大多数团队来说,工作流程是:从CAD工具或ROS包中导出URDF,转换为USD,并注册为艾萨克实验室资产.

# Convert URDF to USD using Isaac Sim's converter
./isaaclab.sh -p source/standalone/tools/convert_urdf.py \
  --input_path /path/to/your_robot.urdf \
  --output_path /path/to/your_robot.usd \
  --fix_base  # Set True for fixed-base arms, False for mobile robots

# Verify the import visually
./isaaclab.sh -p source/standalone/tutorials/00_sim/spawn_usd.py \
  --asset_path /path/to/your_robot.usd

在 URDF 进口中常见的陷:网格尺度不匹配 (URDF 使用计量器,一些CAD 工具出口在毫米),不正确的关节限制 (PhysX 严格执行关节限制 - - 确保它们匹配您的真正机器人),以及缺失的碰撞网格 (Isaac Lab 需要与视觉几何学分离的碰撞几何学进行物理模拟). 瑞士广播公司团队已经验证了OpenArm,UR5e,Franka FR3,Kinova Gen3和Unitree G1的URDF进口.

域名随机配置

域名随机化是桥梁的首要技术,即将模拟到真实的差距.通过随机化视觉和物理属性在训练期间,该政策学习到它将遇到的变化.艾萨克实验室提供了一个内置的随机化框架,每个参数都有可配置的分布.

随机化的主要参数及其推范围:

Parameter Range Distribution Impact on Transfer
Object mass 0.5x-2x nominal Log-uniform High
Friction coefficient 0.3-1.2 Uniform High (contact tasks)
Joint damping 0.8x-1.5x nominal Uniform Medium
执行器 strength 0.7x-1.3x nominal Uniform High (locomotion)
Observation noise Gaussian, sigma 0.01-0.05 Gaussian Medium
Action delay 0-3 timesteps Uniform integer High (real-time control)
Gravity direction +/- 5 degrees from vertical Uniform Low-medium

开始使用保守的随机化范围,并逐渐扩大它们.过度攻击性随机化使训练变得更难,而不改善转移.一个好的论:如果你的随机化政策在随机化启用时取得不到60%的成功,则范围太宽.将它们减少到随机性能达到80%+,然后在监测现实世界性能时逐渐扩大.

GPU 性能:A100vsRTX 4090vsRTX 3090

GPU VRAM Max Envs (6-DOF arm) Steps/sec (PPO) Time to 80% (Lift-Cube) Cloud Cost/hr
A100 80GB 80 GB 4,096 ~180K 6-8 hr $3.50-4.50
RTX 4090 24 GB 1,024 ~120K 16-22 hr $1.00-1.50
RTX 3090 24 GB 512 ~65K 28-36 hr $0.60-0.80
H100 80GB 80 GB 4,096+ ~250K 4-6 hr $5.00-8.00

成本效益的甜点取决于您的代速度要求.对于频繁的超参数扫描的研究,A100或H100云实例节省了日历时间,尽管每小时成本更高.对于您知道配置运行的生产训练运行,RTX 4090为每次训练运行提供了最佳成本. 对于大规模培训的价格,请联系我们.

艾萨克实验室与其他模拟框架

Feature Isaac Lab MuJoCo + Gymnasium RoboCasa (AI2)
GPU parallelism Native (4000+ envs) MJX (limited), CPU otherwise Limited (MuJoCo backend)
Rendering quality RTX path tracing Basic OpenGL MuJoCo renderer
Contact physics PhysX (fast, approximate) MuJoCo (accurate, slower) MuJoCo
License MIT Apache 2.0 MIT
RL integration RSL-RL, RL-Games, SB3 SB3, CleanRL, any Gym-compatible SB3, robosuite API
Best for High-speed RL training, sim-to-real Contact-rich tasks, research Home/kitchen environments

艾萨克实验室是当训练速度是瓶时的正确选择 - - 这对于大多数基于RL的操纵和移动任务都是如此. MuJoCo是当接触物理精度至关重要时最好选择的 (可变形的对象,紧密插入任务) 和数据集尺寸在CPU上可管理时. 对于需要两者都的团队,RCSV建议在MuJoCo (奖励设计的更快代) 中进行原型奖励功能,并向艾萨克实验室进行生产培训 (更快的墙钟融合).

产品出口

艾萨克实验室支持 ONNX 导出训练式政策: ./isaaclab.sh -p source/standalone/workflows/rsl_rl/export.py --task Isaac-Lift-Cube-Franka-v0 --checkpoint path/to/model.pth. 导出的 ONNX 模型可以通过 TensorRT 的 trtexec 工具转换为 TensorRT,用于 Jetson AGX Orin.

在TensorRT转换后,Jetson AGX Orin的典型推断延迟:为高达10M参数的政策,515ms 在实时控制要求内.对于具有图像观测的政策 (ResNet编码器 + 多层感知器政策),根据图像分辨率预期3080ms.

性能比较

Simulator Max Parallel Envs (A100 80GB) Physics Accuracy RL Training Speed
Isaac Lab (PhysX) 4,000+ Medium-high Fastest
MuJoCo (CPU) 50–100 High (contact) Slowest
PyBullet 10–20 Medium Slow
IsaacGym (legacy) 8,192 Medium Fast (deprecated)

作为我们模拟服务的一部分,RCSV为定制操作任务提供预配置的艾萨克实验室环境.

相关阅读

预先配置的RL环境

根据"国际实验室"的规定,