로봇 정책 훈련에 대한 NVIDIA 아이작 연구소 시작
실용적인 아이작 연구소 설정 안내서 <unk> 설치, 내장 환경, RL 훈련 통행, 성능 팁, 그리고 실제 수출 시.
[← 블로그]
아이작 연구소는 2025년 GPU를 병행한 로봇 정책 훈련에 가장 빠른 길입니다.
아이작 연구소 는 무엇 입니까?
아이작 랩은 아이작 시మ్ 4.0 (오omni버스 기반) 에 기반을 둔 NVIDIA의 GPU 가속화된 로봇 시뮬레이션 및 학습 프레임워크입니다. 단일 A100에서 최대 4,000+ 개의 병렬 환경을 지원하여 CPU 기반 시뮬레이터에서 몇 시간 안에 완료되는 RL 정책 교육을 가능하게합니다. MIT 라이선스, 즉 상업적 사용에 대한 제한이 없습니다. 경쟁 플랫폼에 비해 상당한 장점이 있습니다.
아이작 랩은 주로 물리 시뮬레이터가 아닙니다. 아이작 시ムの PhysX 백엔드에 시뮬레이션을 위임합니다. 그것은 훈련 프레임워크입니다. 환경 벡터화, 관찰/행동 공간 정의, 보상 계산, 표준 RL 라이브러리와 훈련 루프 인터페이스를 관리합니다.
설치
전제조건: 우분투 22.04, CUDA 12.1+, NVIDIA 드라이버 ≥530. 최소 GPU: RTX 3090 (24GB VRAM) 소규모 실험에 대한; A100 80GB 생산 훈련 실행에 대한.
- ** 단계 1:** 파이프 를 통해 아이작 시ಮ್ 4.0 을 설치 하십시오: ** 피프 이작시ಮ್ ==4.0.0 --엑스트라-인덱스-유럴
T12 이 약 15GB의 패키지를 끌어당깁니다. 빠른 연결에 20~30 분 동안 기다립니다. - ** 단계 2:** 아이작 랩을 복제하고 설치 프로그램을 실행: git clone
T13 . 이것은 모든 의존성들을 가진 가상 환경을 생성하고 검증 테스트를 실행합니다.&& cd 아이작 랩 && ./isaaclab.sh --install - ** 단계 3:** 헤드리스 테스트를 통해 확인: ./isaaclab.sh -p 소스/standalone/tutorials/00_sim/create_empty.py --headless. 전체 설정 시간은: 빠른 인터넷이 있는 신선한 기계에서 약 30~45분.
내장 환경 개요
| Category | Environment | Robot | Task |
|---|---|---|---|
| 조작 | Isaac-도달 거리-Franka-v0 | Franka Research 3 | End-effector reach to target pose |
| 조작 | Isaac-Lift-Cube-Franka-v0 | Franka Research 3 | Grasp and lift cube |
| 조작 | Isaac-Open-Drawer-Franka-v0 | Franka Research 3 | Pull drawer open to target position |
| Locomotion | Isaac-Velocity-Rough-Anymal-C-v0 | ANYmal C | Velocity tracking on rough terrain |
| Locomotion | Isaac-Walk-Unitree-G1-v0 | Unitree G1 | Forward walking velocity tracking |
| Navigation | Isaac-Navigation-Flat-v0 | Generic diff-drive | Goal-conditioned navigation |
RL 훈련 통행
2,048개의 평행 환경에서 PPO를 사용하여 리프트 큐브 정책을 처음부터 훈련:
- ** 명령:** ./isaaclab.sh -p 출처/독립/작업 흐름/rsl_rl/train.py --task Isaac-Lift-Cube-Franka-v0 --num_envs 2048 --headless
- ** 예상 실행 시간:** 단일 A100 80GB에서 약 8시간을 사용해서 80%의 성공률을 달성합니다. RTX 4090 (24GB) 에서, 512으로 숫자를 줄이고 20~30시간을 기대합니다.
- ** 시청할 것:** 시청 에피소드
_rew _mean (500K 단계 후 단조적으로 증가해야 한다), 성공률 (수산 이전 목표 > 70%), 그리고 가치 손실 (정착해야 한다; 차이가 있을 경우 학습률을 줄여야 한다).
핵심 하이퍼파라미터
| Parameter | Default Value | Effect of Increasing |
|---|---|---|
| num_envs | 2048 | Better gradient estimates, higher GPU memory use |
| learning_rate | 1e-3 | Faster early learning, instability risk |
| gamma (discount) | 0.99 | Longer horizon planning, slower propagation |
| clip_param (PPO) | 0.2 | Less conservative updates, instability risk |
| num_mini_batches | 4 | Smaller batches, noisier gradients |
자신의 로봇을 수입하는 것 (URDF/USD)
아이작랩은 URDF (유니버설 로봇 설명 형식) 또는 USD (유니버설 장면 설명) 형식으로 사용자 지정 로봇 모델을 수입하는 것을 지원합니다. 대부분의 팀의 작업 흐름은 다음과 같습니다: CAD 도구 또는 ROS 패키지에서 URDF를 수출하고 USD로 변환하고 아이작랩 자산으로 등록하십시오.
# Convert URDF to USD using Isaac Sim's converter
./isaaclab.sh -p source/standalone/tools/convert_urdf.py \
--input_path /path/to/your_robot.urdf \
--output_path /path/to/your_robot.usd \
--fix_base # Set True for fixed-base arms, False for mobile robots
# Verify the import visually
./isaaclab.sh -p source/standalone/tutorials/00_sim/spawn_usd.py \
--asset_path /path/to/your_robot.usd
URDF 수입에서 흔히 발생하는 함정이 있는데, 매시 스케일 부합 (URDF는 미터, 일부 CAD 도구는 밀리미터로 수출) 과 잘못된 관절 제한 (PhysX는 관절 제한을 엄격히 시행합니다. 실제 로봇과 일치하는지 확인하십시오.) 그리고 결실된 충돌 매시 (Isaac Lab는 물리 시뮬레이션에 있어서 시각 기하학과 분리된 충돌 기하학이 필요합니다). RCSV 팀은 OpenArm, UR5e, Franka FR3, Kinova Gen3 및 Unitree G1에 대한 URDF 수입을 확인했습니다. 이 플랫폼에 대한 미리 구성된 USD 자산이 필요한 경우 저희에게 연락하십시오.
도메인 무작위 설정
도메인 무작위화는 sim-to-real 격차를 줄이는 주요 기술이다. 훈련 중에 시각적 및 물리적 특성을 무작위화함으로써, 정책은 실제 로봇에서 발견되는 변동에 견고하게 될 것을 배우게됩니다. 아이작 연구소는 모든 매개 변수에 대한 구성 가능한 배포를 갖춘 내장된 무작위화 프레임워크를 제공합니다.
무작위적으로 분류할 수 있는 주요 매개 변수 및 그 권장 범위:
| Parameter | Range | Distribution | Impact on Transfer |
|---|---|---|---|
| Object mass | 0.5x-2x nominal | Log-uniform | High |
| Friction coefficient | 0.3-1.2 | Uniform | High (contact tasks) |
| Joint damping | 0.8x-1.5x nominal | Uniform | Medium |
| 액추에이터 strength | 0.7x-1.3x nominal | Uniform | High (locomotion) |
| Observation noise | Gaussian, sigma 0.01-0.05 | Gaussian | Medium |
| Action delay | 0-3 timesteps | Uniform integer | High (real-time control) |
| Gravity direction | +/- 5 degrees from vertical | Uniform | Low-medium |
보수적인 무작위 범위를 시작하여 점차 확대하십시오. 과도한 공격적인 무작위화는 전송을 개선하지 않고 훈련이 더 어려워집니다. 좋은 유리스틱: 무작위화 기능을 활성화하면 sim 정책이 60% 미만의 성공을 달성하면 범위를 너무 넓게합니다. sim 성능이 80%+에 도달할 때까지 그들을 줄여서 실제 세계 성능을 모니터링하는 동안 점차 확대하십시오.
GPU 성능: A100 vs RTX 4090 vs RTX 3090
| GPU | VRAM | Max Envs (6-DOF arm) | Steps/sec (PPO) | Time to 80% (Lift-Cube) | Cloud Cost/hr |
|---|---|---|---|---|---|
| A100 80GB | 80 GB | 4,096 | ~180K | 6-8 hr | $3.50-4.50 |
| RTX 4090 | 24 GB | 1,024 | ~120K | 16-22 hr | $1.00-1.50 |
| RTX 3090 | 24 GB | 512 | ~65K | 28-36 hr | $0.60-0.80 |
| H100 80GB | 80 GB | 4,096+ | ~250K | 4-6 hr | $5.00-8.00 |
비용 효율성 단점은 반복 속도 요구 사항에 달려 있습니다. 자주 하이퍼파라미터 스웨이프를 사용하는 연구에서는 A100 또는 H100 클라우드 인스턴스가 시간적 비용이 높음에도 불구하고 캘린더 시간을 절약합니다. 구성이 작동하는 생산 훈련 실행에 대해 알고있는 RTX 4090는 훈련 실행에 가장 좋은 비용을 제공합니다. RCSV의 [RL 환경 서비스] (
아이작 연구소 vs. 다른 시뮬레이션 프레임워크
| Feature | Isaac Lab | MuJoCo + Gymnasium | RoboCasa (AI2) |
|---|---|---|---|
| GPU parallelism | Native (4000+ envs) | MJX (limited), CPU otherwise | Limited (MuJoCo backend) |
| Rendering quality | RTX path tracing | Basic OpenGL | MuJoCo renderer |
| Contact physics | PhysX (fast, approximate) | MuJoCo (accurate, slower) | MuJoCo |
| License | MIT | Apache 2.0 | MIT |
| RL integration | RSL-RL, RL-Games, SB3 | SB3, CleanRL, any Gym-compatible | SB3, robosuite API |
| Best for | High-speed RL training, sim-to-real | Contact-rich tasks, research | Home/kitchen environments |
아이작랩은 훈련 속도가 bottleneck이 될 때 올바른 선택입니다. RL 기반 조작 및 이동 작업의 경우 대부분입니다. 접촉 물리 정확도가 중요할 때 MuJoCo는 선호됩니다 (변형 가능한 객체, 좁은 삽입 작업) 그리고 데이터 세트 크기는 CPU에서 관리 할 수 있습니다. 둘 다 필요한 팀들을 위해, RCSV는 MuJoCo (상품 설계에 대한 더 빠른 반복) 에서 보상 기능을 프로토타입화하고 생산 훈련 (더 빠른 벽 시계 공렴) 을 위해 아이작 연구소에 확장하는 것을 권장합니다.
시미어리얼 수출
아이작 랩은 훈련된 정책에 대한 ONNX 수출을 지원합니다: ./isaaclab.sh -p 소스/standalone/workflows/rsl_rl/export.py --task Isaac-Lift-Cube-Franka-v0 --checkpoint path/to/model.pth. 수출된 ONNX 모델은 TensorRT의 trtexec 도구를 사용하여 Jetson AGX Orin에 배포할 수 있는 TensorRT로 변환될 수 있습니다.
성능 비교
| Simulator | Max Parallel Envs (A100 80GB) | Physics Accuracy | RL Training Speed |
|---|---|---|---|
| Isaac Lab (PhysX) | 4,000+ | Medium-high | Fastest |
| MuJoCo (CPU) | 50–100 | High (contact) | Slowest |
| PyBullet | 10–20 | Medium | Slow |
| IsaacGym (legacy) | 8,192 | Medium | Fast (deprecated) |
RCSV는 우리의 시뮬레이션 서비스의 일환으로 사용자 지정 조작 작업에 미리 구성된 아이작 랩 환경을 제공합니다. 사용 가능한 구성에 대해 [RL 환경 문서]
관련 독서
- RL vs. 모방 학습 결정 지침 -- 아이작 랩 (RL) 와 데이터 수집 (IL) 을 언제 사용할 것인가
- 제로샷 vs Few-Shot 로봇 정책 - SIM RL의 대안으로 기초 모델 정비
- LeRobot 가이드 -- 실제 시범 데이터에 대한 IL 정책 훈련
- 로봇 팔 구매 안내서 2026 -- Isaac Lab URDF 모델의 검증된 하드웨어 플랫폼
- OpenArm 설정 안내서 -- OpenArm 하드웨어에 sim 훈련 정책을 배포하는
- RCSV RL 환경 서비스 -- GPU 계산으로 미리 구성된 아이작 연구소 환경
- RCSV 플랫폼 -- 모델 관리 및 배포 인프라
미리 구성된 RL 환경
RCSV는 검증된 보상 기능을 가진 사용자 지정 조작 작업에 미리 구성된 아이작 연구소 환경을 제공합니다.
[RL 환경을 탐구]







