Blogに戻る

ロボット政策訓練のためのNVIDIAアイザックラボをはじめました

実践的なアイザックラボの設定ガイド 設置,内蔵環境,RLトレーニングウォークスルー,パフォーマンスヒント,シム・トゥ・リアル輸出

[←ブログ]

機械の訓練を GPUに並べて 2025年に 機械の政策を訓練する最速の方法です

イザック・ラボとは何か?

Isaac Labは,NVIDIAのGPU加速ロボットシミュレーションと学習フレームワークである.これは Isaac Sim 4.0 (オムニバースベースの) に基づいている.これは,単一のA100で4000以上の平行環境をサポートし,CPUベースのシミュレーターでは数時間で完了するのに数週間かかるRLポリシートレーニングを可能にします. 商業用使用に制限がない意味です 競合するプラットフォームに比べて 重要な利点があります

イザック・ラボは主に物理シミュレーターではなく,イザック・シムのPhysXバックエンドにシミュレーションを委託する.これはトレーニングフレームワークである.環境ベクトライゼーション,観測/アクションスペース定義,報酬計算,標準RLライブラリ (RSL-RL,RL-Games,Stable Baselines3) とのトレーニングループインターフェースを管理する.

設置

必須条件:Ubuntu 22.04,CUDA 12.1+,NVIDIAドライバー ≥530.最小GPU:RTX 3090 (24GB VRAM) 小規模実験;A100 80GB 生産訓練実行.

  • ステップ1: Pip を介して Isaac Sim 4.0 をインストールする: **pip isaacsim==4.0.0 --extra-index-url T12 これは約15GB のパッケージを引っ張ります. 速い接続で20~30分を待機してください.
  • ステップ2: Isaac Labをクローンしてインストーラを実行します: git clone T13 && cd IsaacLab && ./isaaclab.sh --install. これはすべての依存関係を持つ仮想環境を作成し,検証テストを実行します.
  • **ステップ3:**ヘッドレステストで確認: ./isaaclab.sh -p source/standalone/tutorials/00_sim/create_empty.py --headless. セットアップ総時間は:高速インターネットを搭載した新機で約30~45分.

組み込み環境の概要

Category Environment Robot Task
マニピュレーション Isaac-リーチ-Franka-v0 Franka Research 3 End-effector reach to target pose
マニピュレーション Isaac-Lift-Cube-Franka-v0 Franka Research 3 Grasp and lift cube
マニピュレーション Isaac-Open-Drawer-Franka-v0 Franka Research 3 Pull drawer open to target position
Locomotion Isaac-Velocity-Rough-Anymal-C-v0 ANYmal C Velocity tracking on rough terrain
Locomotion Isaac-Walk-Unitree-G1-v0 Unitree G1 Forward walking velocity tracking
Navigation Isaac-Navigation-Flat-v0 Generic diff-drive Goal-conditioned navigation

RL訓練の進行

2,048 の平行環境で PPO でリフトキューブ ポリシーをゼロから訓練する:

  • コマンド:****./isaaclab.sh -p ソース/スタンドアロン/ワークフロー/rsl_rl/train.py --タスク イザック-リフト-キューブ-フランカ-v0 --num_envs 2048 --headless
  • 期待される実行時間: A100 80GBで約8時間で80%の成功率に達する. RTX 4090 (24GB) では,数_envsを512に減らして20~30時間を期待する.
  • 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 内容: 視聴する内容: 視聴する内容: 内容: 内容: 内容: 内容: 内容: 内容の内容: 内容内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容が一致に

キーハイパーパラメータ

Parameter Default Value Effect of Increasing
num_envs 2048 Better gradient estimates, higher GPU memory use
learning_rate 1e-3 Faster early learning, instability risk
gamma (discount) 0.99 Longer horizon planning, slower propagation
clip_param (PPO) 0.2 Less conservative updates, instability risk
num_mini_batches 4 Smaller batches, noisier gradients

独自のロボットを輸入する (URDF/USD)

Isaac Lab は URDF (ユニバーサル ロボット説明形式) または USD (ユニバーサルシーン説明) 形式でカスタムロボットモデルを輸入することをサポートします.ほとんどのチームにとって,ワークフローは:CADツールまたはROSパッケージから URDFを輸出し,USDに変換し,Isaac Lab資産として登録します.

# Convert URDF to USD using Isaac Sim's converter
./isaaclab.sh -p source/standalone/tools/convert_urdf.py \
  --input_path /path/to/your_robot.urdf \
  --output_path /path/to/your_robot.usd \
  --fix_base  # Set True for fixed-base arms, False for mobile robots

# Verify the import visually
./isaaclab.sh -p source/standalone/tutorials/00_sim/spawn_usd.py \
  --asset_path /path/to/your_robot.usd

URDF輸入の常識の誤り:マッシュスケール不一致 (URDF はメーターを使用し,一部のCAD ツールがミリメートルで輸出する) 誤った関節制限 (PhysX は関節制限を厳格に強制します - リアルロボットに一致することを確認してください) と欠落した衝突網 (Isaac Lab は物理シミュレーションのために視覚ジオメトリから分離した衝突ジオメトリーを必要とします). RCSVチームは OpenArm, UR5e, Franka FR3, Kinova Gen3および Unitree G1の URDF輸入を検証しました これらのプラットフォームのために USD資産を事前に設定する必要がある場合は,私達に連絡してください.

ドメインのランダム化設定

ドメインランダム化とは, simからリアルまでのギャップを埋める主な技術である.訓練中に視覚的および物理的性質をランダム化することで,ポリシーは実際のロボットに遭遇する変化に堅固であることを学んでいます.アイザックラボは,各パラメータの構成可能な分布を持つ組み込みランダム化フレームワークを提供します.

ランダム化する主要なパラメータとその推奨範囲:

Parameter Range Distribution Impact on Transfer
Object mass 0.5x-2x nominal Log-uniform High
Friction coefficient 0.3-1.2 Uniform High (contact tasks)
Joint damping 0.8x-1.5x nominal Uniform Medium
アクチュエータ strength 0.7x-1.3x nominal Uniform High (locomotion)
Observation noise Gaussian, sigma 0.01-0.05 Gaussian Medium
Action delay 0-3 timesteps Uniform integer High (real-time control)
Gravity direction +/- 5 degrees from vertical Uniform Low-medium

ランダム化範囲を保守的に開始し,徐々に拡大する.過度に攻撃的なランダム化により,転送を改善せずにトレーニングが難しくなります.良いヒューリスティック:ランダム化が有効に Sim ポリシーが 60%未満の成功を達成した場合,範囲はあまりにも広い. Sim 性能が 80%+に達するまでそれらを減らして,実際のパフォーマンスを監視しながら徐々に拡大します.

GPU性能: A100 vs RTX 4090 vs RTX 3090

GPU VRAM Max Envs (6-DOF arm) Steps/sec (PPO) Time to 80% (Lift-Cube) Cloud Cost/hr
A100 80GB 80 GB 4,096 ~180K 6-8 hr $3.50-4.50
RTX 4090 24 GB 1,024 ~120K 16-22 hr $1.00-1.50
RTX 3090 24 GB 512 ~65K 28-36 hr $0.60-0.80
H100 80GB 80 GB 4,096+ ~250K 4-6 hr $5.00-8.00

費用効率の良い点は,あなたの繰り返す速度要求に依存します.頻繁な超パラメータースイープを使用する研究では, A100または H100クラウドインスタンスは時間費が高くてもカレンダー時間を節約します.設定が動作している生産トレーニングランの場合は,RTX 4090はトレーニングランごとに最高のコストを提供します. RCSVの [RL環境サービス] GPU計算を含む - 集積訓練の価格については,私達に連絡してください.

イザック・ラボ vs.他のシミュレーションフレームワーク

Feature Isaac Lab MuJoCo + Gymnasium RoboCasa (AI2)
GPU parallelism Native (4000+ envs) MJX (limited), CPU otherwise Limited (MuJoCo backend)
Rendering quality RTX path tracing Basic OpenGL MuJoCo renderer
Contact physics PhysX (fast, approximate) MuJoCo (accurate, slower) MuJoCo
License MIT Apache 2.0 MIT
RL integration RSL-RL, RL-Games, SB3 SB3, CleanRL, any Gym-compatible SB3, robosuite API
Best for High-speed RL training, sim-to-real Contact-rich tasks, research Home/kitchen environments

Isaac Labは,トレーニング速度がボトルネックである場合の正しい選択です.RLベースの操作と移動作業のほとんどはそうです.接触物理の精度が重要なとき (変形可能なオブジェクト,狭い挿入作業) とデータセットのサイズはCPUで管理可能である場合のMuJoCoは好ましい. 両方が必要とするチームには,RCSVはMuJoCo (報酬設計のより速い再演) で報酬機能のプロトタイプを作成し,生産訓練のためにIsaac Lab (より速いウォールクロック収束) にスケールすることを推奨します.

シム対リアル輸出

Isaac Lab は訓練されたポリシーのために ONNX 輸出をサポートします: ./isaaclab.sh -p source/standalone/workflows/rsl_rl/export.py --task Isaac-Lift-Cube-Franka-v0 --checkpoint path/to/model.pth.輸出された ONNX モデルはTensorRT の trtexec ツールを使用して Jetson AGX Orin に展開するために TensorRT に変換できます.

Jetson AGX Orin での典型的な推論遅延は,TensorRT変換後: 10Mパラメータまでのポリシーでは515ms リアルタイム制御要件内で良好です.画像観測 (ResNetエンコーダー + MLPポリシー) のポリシーでは,画像解像度に応じて3080ms を期待してください.

性能比較

Simulator Max Parallel Envs (A100 80GB) Physics Accuracy RL Training Speed
Isaac Lab (PhysX) 4,000+ Medium-high Fastest
MuJoCo (CPU) 50–100 High (contact) Slowest
PyBullet 10–20 Medium Slow
IsaacGym (legacy) 8,192 Medium Fast (deprecated)

RCSVは,シミュレーションサービスの一環として,カスタム操作作業のために,Isaac Labの設定前の環境を提供しています.利用可能な構成については,RL環境ドキュメント (RL環境ドキュメント) 参照.

関連 読書

プリコンフィギュレーションされた RL 環境

RCSVは,認証された報酬機能を持つカスタム操作タスクのために,先設定されたアイザックラボ環境を提供します.

[RL環境を調査する]