ロボット政策訓練のためのNVIDIAアイザックラボをはじめました
実践的なアイザックラボの設定ガイド 設置,内蔵環境,RLトレーニングウォークスルー,パフォーマンスヒント,シム・トゥ・リアル輸出
[←ブログ]
機械の訓練を GPUに並べて 2025年に 機械の政策を訓練する最速の方法です
イザック・ラボとは何か?
Isaac Labは,NVIDIAのGPU加速ロボットシミュレーションと学習フレームワークである.これは Isaac Sim 4.0 (オムニバースベースの) に基づいている.これは,単一のA100で4000以上の平行環境をサポートし,CPUベースのシミュレーターでは数時間で完了するのに数週間かかるRLポリシートレーニングを可能にします. 商業用使用に制限がない意味です 競合するプラットフォームに比べて 重要な利点があります
イザック・ラボは主に物理シミュレーターではなく,イザック・シムのPhysXバックエンドにシミュレーションを委託する.これはトレーニングフレームワークである.環境ベクトライゼーション,観測/アクションスペース定義,報酬計算,標準RLライブラリ (RSL-RL,RL-Games,Stable Baselines3) とのトレーニングループインターフェースを管理する.
設置
必須条件:Ubuntu 22.04,CUDA 12.1+,NVIDIAドライバー ≥530.最小GPU:RTX 3090 (24GB VRAM) 小規模実験;A100 80GB 生産訓練実行.
- ステップ1: Pip を介して Isaac Sim 4.0 をインストールする: **pip isaacsim==4.0.0 --extra-index-url
T12 これは約15GB のパッケージを引っ張ります. 速い接続で20~30分を待機してください. - ステップ2: Isaac Labをクローンしてインストーラを実行します: git clone
T13 . これはすべての依存関係を持つ仮想環境を作成し,検証テストを実行します.&& cd IsaacLab && ./isaaclab.sh --install - **ステップ3:**ヘッドレステストで確認: ./isaaclab.sh -p source/standalone/tutorials/00_sim/create_empty.py --headless. セットアップ総時間は:高速インターネットを搭載した新機で約30~45分.
組み込み環境の概要
| Category | Environment | Robot | Task |
|---|---|---|---|
| マニピュレーション | Isaac-リーチ-Franka-v0 | Franka Research 3 | End-effector reach to target pose |
| マニピュレーション | Isaac-Lift-Cube-Franka-v0 | Franka Research 3 | Grasp and lift cube |
| マニピュレーション | Isaac-Open-Drawer-Franka-v0 | Franka Research 3 | Pull drawer open to target position |
| Locomotion | Isaac-Velocity-Rough-Anymal-C-v0 | ANYmal C | Velocity tracking on rough terrain |
| Locomotion | Isaac-Walk-Unitree-G1-v0 | Unitree G1 | Forward walking velocity tracking |
| Navigation | Isaac-Navigation-Flat-v0 | Generic diff-drive | Goal-conditioned navigation |
RL訓練の進行
2,048 の平行環境で PPO でリフトキューブ ポリシーをゼロから訓練する:
- コマンド:****./isaaclab.sh -p ソース/スタンドアロン/ワークフロー/rsl_rl/train.py --タスク イザック-リフト-キューブ-フランカ-v0 --num_envs 2048 --headless
- 期待される実行時間: A100 80GBで約8時間で80%の成功率に達する. RTX 4090 (24GB) では,数_envsを512に減らして20~30時間を期待する.
- 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 視聴する内容: 内容: 視聴する内容: 視聴する内容: 内容: 内容: 内容: 内容: 内容: 内容の内容: 内容内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容の内容が一致に
キーハイパーパラメータ
| Parameter | Default Value | Effect of Increasing |
|---|---|---|
| num_envs | 2048 | Better gradient estimates, higher GPU memory use |
| learning_rate | 1e-3 | Faster early learning, instability risk |
| gamma (discount) | 0.99 | Longer horizon planning, slower propagation |
| clip_param (PPO) | 0.2 | Less conservative updates, instability risk |
| num_mini_batches | 4 | Smaller batches, noisier gradients |
独自のロボットを輸入する (URDF/USD)
Isaac Lab は URDF (ユニバーサル ロボット説明形式) または USD (ユニバーサルシーン説明) 形式でカスタムロボットモデルを輸入することをサポートします.ほとんどのチームにとって,ワークフローは:CADツールまたはROSパッケージから URDFを輸出し,USDに変換し,Isaac Lab資産として登録します.
# Convert URDF to USD using Isaac Sim's converter
./isaaclab.sh -p source/standalone/tools/convert_urdf.py \
--input_path /path/to/your_robot.urdf \
--output_path /path/to/your_robot.usd \
--fix_base # Set True for fixed-base arms, False for mobile robots
# Verify the import visually
./isaaclab.sh -p source/standalone/tutorials/00_sim/spawn_usd.py \
--asset_path /path/to/your_robot.usd
URDF輸入の常識の誤り:マッシュスケール不一致 (URDF はメーターを使用し,一部のCAD ツールがミリメートルで輸出する) 誤った関節制限 (PhysX は関節制限を厳格に強制します - リアルロボットに一致することを確認してください) と欠落した衝突網 (Isaac Lab は物理シミュレーションのために視覚ジオメトリから分離した衝突ジオメトリーを必要とします). RCSVチームは OpenArm, UR5e, Franka FR3, Kinova Gen3および Unitree G1の URDF輸入を検証しました これらのプラットフォームのために USD資産を事前に設定する必要がある場合は,私達に連絡してください.
ドメインのランダム化設定
ドメインランダム化とは, simからリアルまでのギャップを埋める主な技術である.訓練中に視覚的および物理的性質をランダム化することで,ポリシーは実際のロボットに遭遇する変化に堅固であることを学んでいます.アイザックラボは,各パラメータの構成可能な分布を持つ組み込みランダム化フレームワークを提供します.
ランダム化する主要なパラメータとその推奨範囲:
| Parameter | Range | Distribution | Impact on Transfer |
|---|---|---|---|
| Object mass | 0.5x-2x nominal | Log-uniform | High |
| Friction coefficient | 0.3-1.2 | Uniform | High (contact tasks) |
| Joint damping | 0.8x-1.5x nominal | Uniform | Medium |
| アクチュエータ strength | 0.7x-1.3x nominal | Uniform | High (locomotion) |
| Observation noise | Gaussian, sigma 0.01-0.05 | Gaussian | Medium |
| Action delay | 0-3 timesteps | Uniform integer | High (real-time control) |
| Gravity direction | +/- 5 degrees from vertical | Uniform | Low-medium |
ランダム化範囲を保守的に開始し,徐々に拡大する.過度に攻撃的なランダム化により,転送を改善せずにトレーニングが難しくなります.良いヒューリスティック:ランダム化が有効に Sim ポリシーが 60%未満の成功を達成した場合,範囲はあまりにも広い. Sim 性能が 80%+に達するまでそれらを減らして,実際のパフォーマンスを監視しながら徐々に拡大します.
GPU性能: A100 vs RTX 4090 vs RTX 3090
| GPU | VRAM | Max Envs (6-DOF arm) | Steps/sec (PPO) | Time to 80% (Lift-Cube) | Cloud Cost/hr |
|---|---|---|---|---|---|
| A100 80GB | 80 GB | 4,096 | ~180K | 6-8 hr | $3.50-4.50 |
| RTX 4090 | 24 GB | 1,024 | ~120K | 16-22 hr | $1.00-1.50 |
| RTX 3090 | 24 GB | 512 | ~65K | 28-36 hr | $0.60-0.80 |
| H100 80GB | 80 GB | 4,096+ | ~250K | 4-6 hr | $5.00-8.00 |
費用効率の良い点は,あなたの繰り返す速度要求に依存します.頻繁な超パラメータースイープを使用する研究では, A100または H100クラウドインスタンスは時間費が高くてもカレンダー時間を節約します.設定が動作している生産トレーニングランの場合は,RTX 4090はトレーニングランごとに最高のコストを提供します. RCSVの [RL環境サービス] GPU計算を含む - 集積訓練の価格については,私達に連絡してください.
イザック・ラボ vs.他のシミュレーションフレームワーク
| Feature | Isaac Lab | MuJoCo + Gymnasium | RoboCasa (AI2) |
|---|---|---|---|
| GPU parallelism | Native (4000+ envs) | MJX (limited), CPU otherwise | Limited (MuJoCo backend) |
| Rendering quality | RTX path tracing | Basic OpenGL | MuJoCo renderer |
| Contact physics | PhysX (fast, approximate) | MuJoCo (accurate, slower) | MuJoCo |
| License | MIT | Apache 2.0 | MIT |
| RL integration | RSL-RL, RL-Games, SB3 | SB3, CleanRL, any Gym-compatible | SB3, robosuite API |
| Best for | High-speed RL training, sim-to-real | Contact-rich tasks, research | Home/kitchen environments |
Isaac Labは,トレーニング速度がボトルネックである場合の正しい選択です.RLベースの操作と移動作業のほとんどはそうです.接触物理の精度が重要なとき (変形可能なオブジェクト,狭い挿入作業) とデータセットのサイズはCPUで管理可能である場合のMuJoCoは好ましい. 両方が必要とするチームには,RCSVはMuJoCo (報酬設計のより速い再演) で報酬機能のプロトタイプを作成し,生産訓練のためにIsaac Lab (より速いウォールクロック収束) にスケールすることを推奨します.
シム対リアル輸出
Isaac Lab は訓練されたポリシーのために ONNX 輸出をサポートします: ./isaaclab.sh -p source/standalone/workflows/rsl_rl/export.py --task Isaac-Lift-Cube-Franka-v0 --checkpoint path/to/model.pth.輸出された ONNX モデルはTensorRT の trtexec ツールを使用して Jetson AGX Orin に展開するために TensorRT に変換できます.
Jetson AGX Orin での典型的な推論遅延は,TensorRT変換後: 10Mパラメータまでのポリシーでは5
性能比較
| Simulator | Max Parallel Envs (A100 80GB) | Physics Accuracy | RL Training Speed |
|---|---|---|---|
| Isaac Lab (PhysX) | 4,000+ | Medium-high | Fastest |
| MuJoCo (CPU) | 50–100 | High (contact) | Slowest |
| PyBullet | 10–20 | Medium | Slow |
| IsaacGym (legacy) | 8,192 | Medium | Fast (deprecated) |
RCSVは,シミュレーションサービスの一環として,カスタム操作作業のために,Isaac Labの設定前の環境を提供しています.利用可能な構成については,RL環境ドキュメント (RL環境ドキュメント) 参照.
関連 読書
- RL vs.模倣学習決定ガイド --Isaac Lab (RL) vs.データ収集 (IL) の使用時期
- ゼロショット対少数のショットロボット政策 - シン RL の代替として 基礎モデルの微調整
- [LeRobotガイド]
T6 ) -- 実体示例データに関するIL政策の訓練 - ロボットアーム購入ガイド2026 -- 検証されたアイザックラボ URDFモデルを持つハードウェアプラットフォーム
- OpenArm設定ガイド --OpenArmハードウェアにシムトレーニングのポリシーを導入する
- RCSV RL環境サービス -- GPU計算で,先編設定された Isaac Lab環境
- RCSVプラットフォーム --モデル管理と展開インフラストラクチャ
プリコンフィギュレーションされた RL 環境
RCSVは,認証された報酬機能を持つカスタム操作タスクのために,先設定されたアイザックラボ環境を提供します.
[RL環境を調査する]







