Blog(으)로 돌아가기

로봇 정책 훈련에 대한 NVIDIA 아이작 연구소 시작

실용적인 아이작 연구소 설정 안내서 <unk> 설치, 내장 환경, RL 훈련 통행, 성능 팁, 그리고 실제 수출 시.

[← 블로그]

아이작 연구소는 2025년 GPU를 병행한 로봇 정책 훈련에 가장 빠른 길입니다.

아이작 연구소 는 무엇 입니까?

아이작 랩은 아이작 시మ్ 4.0 (오omni버스 기반) 에 기반을 둔 NVIDIA의 GPU 가속화된 로봇 시뮬레이션 및 학습 프레임워크입니다. 단일 A100에서 최대 4,000+ 개의 병렬 환경을 지원하여 CPU 기반 시뮬레이터에서 몇 시간 안에 완료되는 RL 정책 교육을 가능하게합니다. MIT 라이선스, 즉 상업적 사용에 대한 제한이 없습니다. 경쟁 플랫폼에 비해 상당한 장점이 있습니다.

아이작 랩은 주로 물리 시뮬레이터가 아닙니다. 아이작 시ムの PhysX 백엔드에 시뮬레이션을 위임합니다. 그것은 훈련 프레임워크입니다. 환경 벡터화, 관찰/행동 공간 정의, 보상 계산, 표준 RL 라이브러리와 훈련 루프 인터페이스를 관리합니다.

설치

전제조건: 우분투 22.04, CUDA 12.1+, NVIDIA 드라이버 ≥530. 최소 GPU: RTX 3090 (24GB VRAM) 소규모 실험에 대한; A100 80GB 생산 훈련 실행에 대한.

  • ** 단계 1:** 파이프 를 통해 아이작 시ಮ್ 4.0 을 설치 하십시오: ** 피프 이작시ಮ್ ==4.0.0 --엑스트라-인덱스-유럴 T12 이 약 15GB의 패키지를 끌어당깁니다. 빠른 연결에 20~30 분 동안 기다립니다.
  • ** 단계 2:** 아이작 랩을 복제하고 설치 프로그램을 실행: git clone T13 && cd 아이작 랩 && ./isaaclab.sh --install. 이것은 모든 의존성들을 가진 가상 환경을 생성하고 검증 테스트를 실행합니다.
  • ** 단계 3:** 헤드리스 테스트를 통해 확인: ./isaaclab.sh -p 소스/standalone/tutorials/00_sim/create_empty.py --headless. 전체 설정 시간은: 빠른 인터넷이 있는 신선한 기계에서 약 30~45분.

내장 환경 개요

Category Environment Robot Task
조작 Isaac-도달 거리-Franka-v0 Franka Research 3 End-effector reach to target pose
조작 Isaac-Lift-Cube-Franka-v0 Franka Research 3 Grasp and lift cube
조작 Isaac-Open-Drawer-Franka-v0 Franka Research 3 Pull drawer open to target position
Locomotion Isaac-Velocity-Rough-Anymal-C-v0 ANYmal C Velocity tracking on rough terrain
Locomotion Isaac-Walk-Unitree-G1-v0 Unitree G1 Forward walking velocity tracking
Navigation Isaac-Navigation-Flat-v0 Generic diff-drive Goal-conditioned navigation

RL 훈련 통행

2,048개의 평행 환경에서 PPO를 사용하여 리프트 큐브 정책을 처음부터 훈련:

  • ** 명령:** ./isaaclab.sh -p 출처/독립/작업 흐름/rsl_rl/train.py --task Isaac-Lift-Cube-Franka-v0 --num_envs 2048 --headless
  • ** 예상 실행 시간:** 단일 A100 80GB에서 약 8시간을 사용해서 80%의 성공률을 달성합니다. RTX 4090 (24GB) 에서, 512으로 숫자를 줄이고 20~30시간을 기대합니다.
  • ** 시청할 것:** 시청 에피소드 _rew _mean (500K 단계 후 단조적으로 증가해야 한다), 성공률 (수산 이전 목표 > 70%), 그리고 가치 손실 (정착해야 한다; 차이가 있을 경우 학습률을 줄여야 한다).

핵심 하이퍼파라미터

Parameter Default Value Effect of Increasing
num_envs 2048 Better gradient estimates, higher GPU memory use
learning_rate 1e-3 Faster early learning, instability risk
gamma (discount) 0.99 Longer horizon planning, slower propagation
clip_param (PPO) 0.2 Less conservative updates, instability risk
num_mini_batches 4 Smaller batches, noisier gradients

자신의 로봇을 수입하는 것 (URDF/USD)

아이작랩은 URDF (유니버설 로봇 설명 형식) 또는 USD (유니버설 장면 설명) 형식으로 사용자 지정 로봇 모델을 수입하는 것을 지원합니다. 대부분의 팀의 작업 흐름은 다음과 같습니다: CAD 도구 또는 ROS 패키지에서 URDF를 수출하고 USD로 변환하고 아이작랩 자산으로 등록하십시오.

# Convert URDF to USD using Isaac Sim's converter
./isaaclab.sh -p source/standalone/tools/convert_urdf.py \
  --input_path /path/to/your_robot.urdf \
  --output_path /path/to/your_robot.usd \
  --fix_base  # Set True for fixed-base arms, False for mobile robots

# Verify the import visually
./isaaclab.sh -p source/standalone/tutorials/00_sim/spawn_usd.py \
  --asset_path /path/to/your_robot.usd

URDF 수입에서 흔히 발생하는 함정이 있는데, 매시 스케일 부합 (URDF는 미터, 일부 CAD 도구는 밀리미터로 수출) 과 잘못된 관절 제한 (PhysX는 관절 제한을 엄격히 시행합니다. 실제 로봇과 일치하는지 확인하십시오.) 그리고 결실된 충돌 매시 (Isaac Lab는 물리 시뮬레이션에 있어서 시각 기하학과 분리된 충돌 기하학이 필요합니다). RCSV 팀은 OpenArm, UR5e, Franka FR3, Kinova Gen3 및 Unitree G1에 대한 URDF 수입을 확인했습니다. 이 플랫폼에 대한 미리 구성된 USD 자산이 필요한 경우 저희에게 연락하십시오.

도메인 무작위 설정

도메인 무작위화는 sim-to-real 격차를 줄이는 주요 기술이다. 훈련 중에 시각적 및 물리적 특성을 무작위화함으로써, 정책은 실제 로봇에서 발견되는 변동에 견고하게 될 것을 배우게됩니다. 아이작 연구소는 모든 매개 변수에 대한 구성 가능한 배포를 갖춘 내장된 무작위화 프레임워크를 제공합니다.

무작위적으로 분류할 수 있는 주요 매개 변수 및 그 권장 범위:

Parameter Range Distribution Impact on Transfer
Object mass 0.5x-2x nominal Log-uniform High
Friction coefficient 0.3-1.2 Uniform High (contact tasks)
Joint damping 0.8x-1.5x nominal Uniform Medium
액추에이터 strength 0.7x-1.3x nominal Uniform High (locomotion)
Observation noise Gaussian, sigma 0.01-0.05 Gaussian Medium
Action delay 0-3 timesteps Uniform integer High (real-time control)
Gravity direction +/- 5 degrees from vertical Uniform Low-medium

보수적인 무작위 범위를 시작하여 점차 확대하십시오. 과도한 공격적인 무작위화는 전송을 개선하지 않고 훈련이 더 어려워집니다. 좋은 유리스틱: 무작위화 기능을 활성화하면 sim 정책이 60% 미만의 성공을 달성하면 범위를 너무 넓게합니다. sim 성능이 80%+에 도달할 때까지 그들을 줄여서 실제 세계 성능을 모니터링하는 동안 점차 확대하십시오.

GPU 성능: A100 vs RTX 4090 vs RTX 3090

GPU VRAM Max Envs (6-DOF arm) Steps/sec (PPO) Time to 80% (Lift-Cube) Cloud Cost/hr
A100 80GB 80 GB 4,096 ~180K 6-8 hr $3.50-4.50
RTX 4090 24 GB 1,024 ~120K 16-22 hr $1.00-1.50
RTX 3090 24 GB 512 ~65K 28-36 hr $0.60-0.80
H100 80GB 80 GB 4,096+ ~250K 4-6 hr $5.00-8.00

비용 효율성 단점은 반복 속도 요구 사항에 달려 있습니다. 자주 하이퍼파라미터 스웨이프를 사용하는 연구에서는 A100 또는 H100 클라우드 인스턴스가 시간적 비용이 높음에도 불구하고 캘린더 시간을 절약합니다. 구성이 작동하는 생산 훈련 실행에 대해 알고있는 RTX 4090는 훈련 실행에 가장 좋은 비용을 제공합니다. RCSV의 [RL 환경 서비스] (T2) 는 GPU 계산을 포함합니다. 대량 훈련 가격에 연락하세요.

아이작 연구소 vs. 다른 시뮬레이션 프레임워크

Feature Isaac Lab MuJoCo + Gymnasium RoboCasa (AI2)
GPU parallelism Native (4000+ envs) MJX (limited), CPU otherwise Limited (MuJoCo backend)
Rendering quality RTX path tracing Basic OpenGL MuJoCo renderer
Contact physics PhysX (fast, approximate) MuJoCo (accurate, slower) MuJoCo
License MIT Apache 2.0 MIT
RL integration RSL-RL, RL-Games, SB3 SB3, CleanRL, any Gym-compatible SB3, robosuite API
Best for High-speed RL training, sim-to-real Contact-rich tasks, research Home/kitchen environments

아이작랩은 훈련 속도가 bottleneck이 될 때 올바른 선택입니다. RL 기반 조작 및 이동 작업의 경우 대부분입니다. 접촉 물리 정확도가 중요할 때 MuJoCo는 선호됩니다 (변형 가능한 객체, 좁은 삽입 작업) 그리고 데이터 세트 크기는 CPU에서 관리 할 수 있습니다. 둘 다 필요한 팀들을 위해, RCSV는 MuJoCo (상품 설계에 대한 더 빠른 반복) 에서 보상 기능을 프로토타입화하고 생산 훈련 (더 빠른 벽 시계 공렴) 을 위해 아이작 연구소에 확장하는 것을 권장합니다.

시미어리얼 수출

아이작 랩은 훈련된 정책에 대한 ONNX 수출을 지원합니다: ./isaaclab.sh -p 소스/standalone/workflows/rsl_rl/export.py --task Isaac-Lift-Cube-Franka-v0 --checkpoint path/to/model.pth. 수출된 ONNX 모델은 TensorRT의 trtexec 도구를 사용하여 Jetson AGX Orin에 배포할 수 있는 TensorRT로 변환될 수 있습니다.

소RT 변환 후 제트슨 AGX 오린에서 전형적인 추론 지연시간: 10M 매개 변수까지의 정책에 대해 515ms. 실시간 제어 요구 사항 내에서 잘합니다. 이미지 관측 (ResNet 코더 + MLP 정책) 을 가진 정책에 대해서는 이미지 해상도에 따라 3080ms를 기대하십시오.

성능 비교

Simulator Max Parallel Envs (A100 80GB) Physics Accuracy RL Training Speed
Isaac Lab (PhysX) 4,000+ Medium-high Fastest
MuJoCo (CPU) 50–100 High (contact) Slowest
PyBullet 10–20 Medium Slow
IsaacGym (legacy) 8,192 Medium Fast (deprecated)

RCSV는 우리의 시뮬레이션 서비스의 일환으로 사용자 지정 조작 작업에 미리 구성된 아이작 랩 환경을 제공합니다. 사용 가능한 구성에 대해 [RL 환경 문서]T3) 를 참조하십시오.

관련 독서

미리 구성된 RL 환경

RCSV는 검증된 보상 기능을 가진 사용자 지정 조작 작업에 미리 구성된 아이작 연구소 환경을 제공합니다.

[RL 환경을 탐구]