로봇 을 모방 하는 학습: 실용적 인 지침서
로봇을 위한 모방 학습에 대한 실용적인 가이드: 그것이 무엇인지, ACT, 방산 정책, VLA가 어떻게 비교되는지, 데이터 요구사항, 하드웨어, 그리고 RCSV가 IL 연구를 어떻게 지원하는지.
[이미테이션 학습 가이드]
모방 학습은 로봇에게 능숙한 조작 기술을 가르치는 지배적 패러다임으로 등장했습니다. 손으로 보상 기능을 만드는 것 또는 운동 계획을 작성하는 대신 로봇에게 무엇을 해야 하는지 간단하게 알려줍니다. 이 가이드에서는 어떻게 작동하는지, 어떤 알고리즘을 사용해야 하는지, 어떤 인프라가 결과를 얻기 위해 필요한지 설명합니다.
모방 학습 은 무엇 입니까?
시범 학습 (IL) 은 인간 운영자로부터 촬영된 행동을 복제하는 정책을 훈련시킵니다. 데이터 수집 과정에서 숙련된 시범자는 로봇을 목표 작업을 통해 원격으로 작동시키며 센서는 관절 위치, 최종 효과자 포지, 카메라 프레임 및 기타 관련 상태를 기록합니다. 기록된 데이터는 신경망 정책의 훈련 세트가 됩니다.
강화 학습에 대한 IL의 호소력은 실용적입니다. 당신은 보상 신호를 설계하거나 수백만 개의 시뮬레이션 배포를 실행하거나 희소한 보상 탐사 문제를 해결 할 필요가 없습니다. 사람이 작업을 수행 할 수 있다면 로봇은 몇 백에서 몇 천 개의 시범에서 배울 수 있습니다. 문제는 일반화입니다. 좁은 시범을 통해 훈련된 정책은 객체 위치, 조명 또는 작업의 변형이 훈련 분포와 다르면 실패할 수 있습니다.
현대 IL 연구는 더 나은 아키텍처, 더 크고 다양한 데이터 세트 및 사전 훈련된 시각 표현을 통해 이를 해결합니다. 이 분야는 2023 년 이후 빠르게 발전했으며, 생산 품질의 모방 학습은 이제 로봇 박사 과정에 액세스하지 않은 팀의 손이 닿습니다.
IL 알고리즘 분류: BC, DAgger, HG-DAgger
**행동 복제 (BC) **는 가장 간단한 모방 학습 형태입니다. 당신은 시범에서 (관측, 행동) 쌍의 정적 데이터 세트를 수집하고, 감독 학습을 통해 관찰에서 행동을 예측하기 위해 신경 네트워크를 훈련합니다. BC는 구현하기 쉽고 훈련하기 쉽습니다. 온라인 상호 작용이 필요하지 않습니다. 그 근본적인 약점은
합성 오류 문제는 궤도 길이를 따라 확장됩니다. epsilon의 각 단계 오류 비율에 대해, Ross and Bagnell (2010) 의 최악의 사례 분석에 따르면 T 단계에 대한 예상되는 전체 오류는 O(epsilon * T^2) 로 증가합니다. 실제적으로, 이것은 BC가 짧은 작업에 잘 작동한다는 것을 의미합니다 (통제 주파수에서 30 단계 이하) 하지만 액션 덩어리 같은 완화 전략 없이 더 긴 지평선에서 빠르게 저하됩니다.
**DAgger (데이터셋 집합) **는 온라인 데이터 수집을 통해 합성 오류를 해결합니다. 초기 BC 단계 후에 학습된 정책이 배치되고, 전문가가 정책이 실제로 방문한 국가에서 취해야 할 조치를 표시합니다. 이 새로운 데이터는 교육 세트에 추가되며 정책이 재교육됩니다. 이 과정을 반복하는 것은 한계 전문가와 마찬가지로 성과가 좋은 정책으로 연결되는 것으로 입증됩니다. 실질적인 비용은 DAgger가 훈련 중에 전문가에게 반복적인 접근을 필요로 한다는 것입니다. 전문가는 정책 실행을 실시간으로 관찰하고 오류를 수정해야합니다.
**HG-DAgger (Human-Gated DAgger) **는 로봇 학습의 보다 실용적인 변형이다. 방문한 모든 상태를 전문가에게 표시하도록 요구하기 보다는, HG-DAgger는 정책이 실패할 때만 인간에게 개입할 수 있게 한다. 운영자는 로봇이 학습된 정책을 실행하는 것을 보고 필요하면 통제권을 취한다. 데이터 세트에 개입 궤도 (정책의 특정 실패 상태에서 수정적인 시범을 나타냅니다) 를 추가합니다. 이 접근법은 표준 DAgger보다 3-5배 더 효율적입니다. 왜냐하면 인간만이 가장 필요한 곳에서 시범을 제공합니다.
RCSV에서 대부분의 실용적인 로봇 학습 프로젝트에서, 우리는 BC를 사용하여 액션
모방 학습에 대한 데이터 세트 크기의 확장 법칙
실제로 얼마나 많은 시범이 필요합니까? 답은 작업 복잡성과 알고리즘, 그리고 얼마나 많은 일반화가 필요한지에 달려 있습니다. 발표된 결과와 RCSV의 내부 평가 데이터에 기초하여, 여기 경험적 확장 행동입니다.
| Dataset Size | Typical Result (single task, ACT) | When to Stop Adding Data |
|---|---|---|
| 10-25 demos | 20-40% success; policy captures gross motion but misses details | Never -- this is only useful for sanity checks |
| 50-100 demos | 60-80% success on in-distribution objects/positions | Acceptable for a research prototype with fixed conditions |
| 200-500 demos | 80-92% success; handles moderate position/object variation | Sufficient for most single-task deployments |
| 500-2000 demos | 88-95% success; robust to diverse objects, positions, lighting | Diminishing returns unless adding diversity, not volume |
[스칼링 법칙 연구] (
국가 대표 선택
정책에 공급된 관찰 공간은 학습 효율성과 일반화에 크게 영향을 미칩니다.
공동각 + 이미지 (상담 기본). 각 시간 단계에서의 관찰은 하나의 카메라 이미지 (일반적으로 224x224 또는 256x256 RGB) 과 결합된 로봇공동 위치 (7DF 팔에 7차원,
끝효과자 포지 + 이미지.* 관측은 관절각 대신 로봇의 기본 프레임에 있는 끝효과자 위치 (x, y, z) 와 방향 (쿼터니온 또는 회전 매트릭스) 를 포함한다. 이 표현은 더 콤팩트하며 직결 관련 공간 정보를 암호화합니다. 이 정책은 최종 효과자 운동만을 제어해야 할 경우 잘 작동합니다. 특정 공동 구성에 비해. 단점은: 최종 효과자 표현은 여러 공동 구성이 동일한 최종 효과자 포즈를 생성하는 과잉 조작기에서 모호함을 만들 수 있습니다.
만 관절각 (영상 없음). 알려진 객체 위치 (예를 들어, 고정된 부품과 함께 공장 조립) 를 가진 고정 환경 작업에 있어서, 관절각각에만 훈련된 순수한 자기 수용 정책은 매우 적은 시범 (약 20~50) 으로 높은 성공률을 달성할 수 있다. 정책은 시각모터 지도보다는 관절 공간 궤도를 학습한다. 이 접근법은 훈련이 빠르고, 쉽게 구현되고, 매우 신뢰할 수 있습니다. 하지만 시각적 변화에 대한 일반화는 제로입니다.
액션 공간 디자인: 절대 vs. 델타
행동들이 어떻게 표현되는지는 대부분의 연습자들이 깨닫는 것보다 더 중요합니다. 두 가지 주요 선택은
완벽한 공동 지점. 각 행동은 다음 시간 단계의 목표 공동 각 벡터입니다. 이점은: 행동들은 해석 가능하고 공동 한계에 의해 제한됩니다. 단점은: 정책은 관찰에서 절대적 공동 지점까지 전체 지도를 배워야하며, 작은 관찰 변경은 큰 행동 변경이 필요할 수 있습니다 (완벽한 목표가 현재 위치에서 멀리 떨어져있을 수 있기 때문에). ACT는 기본적으로 절대 공동 목표치를 사용합니다.
델타 (상대) 행동. 각 행동은 현재 상태에서 관절 각 또는 최종 효과자 포즈의 변화입니다. 이점은: 델타 행동들은 자연적으로 작아서 정확하게 예측하기 쉬워지고 훈련 중에 볼 수 없는 시작 상태에 더 잘 일반화되기 때문입니다 (정책은 절대적인 목표보다는 상대적인 움직임을 배우기 때문입니다). 단점은: 디플타 액션은 절대적인 참조 수정이 없으면 긴 궤도에서 파동이 축적될 수 있습니다. 디플루션 정책은 일반적으로 디플타 최종 효과자 액션을 사용합니다.
실용적인 권고: 10-20 Hz 제어에서 100 단계 이하의 작업에 있어서, 때때로 절대적인 방정점을 가진 델타 최종 효과자 동작은 일반화와 정확성의 가장 좋은 조합을 제공합니다. 공동 조정의 문제가 있는 쌍방향 작업에 대해서는, 절대적 공동 목표 (ACT와 같이) 는 델타 동작이 두 팔 사이에 생성할 수 있는 동기화 문제를 피합니다.
ACT: 트랜스포머로 액션 킹
스탠퍼드에서 도입된 ALOHA 쌍방향 로봇 플랫폼과 함께 도입된 ACT는 로봇 제어를 순서 예측 문제로 다루고 있습니다. 정책은 다음 단계의 한 가지 행동보다는 미래의 행동의 일부를 예측합니다. 일반적으로 50-100 시간 단계입니다. 이 액션 덩어리는 컴포넌스 오류를 줄이고, 이는 작은 예측 오류가 궤도에 축적되는 순수 행동 복제의 주요 실패 모드입니다.
ACT는 훈련 중에 CVAE (Conditional Variational 오토인코더) 를 사용하여 인간의 시범의 다 모형성을 캡처합니다. 종종 작업을 완료하는 데 한 가지 이상의 올바른 방법이 있습니다. 추론 시, 디코더는 현재 카메라 관측 및 공동 상태에 따라 조건화된 액션 순서를 생성합니다. 그 결과, 인간에 의해 입증된 작업의 자연적인 변수를 처리하는 정책이 이루어집니다.
성능에 영향을 미치는 주요 구현 세부 사항: CVAE 손실의 KL 분량은 재구성 정확성과 잠실 공간 정규화 사이의 교류를 제어합니다. 무게 10에서 시작하여
ACT는 쌍방향 조작 작업에 강력한 출발점이다. 비교적 소박한 데이터 볼륨 (50-200 개의 작업당 시범) 을 필요로 하며, 2-4 시간 동안 단일 GPU에 열차를 필요로 한다. ALOHA 하드웨어 또는 유사한 쌍방향 설정으로 작업하는 경우 ACT는 시도하는 첫 번째 알고리즘이어야 한다. RCSV의 데이터 서비스 는 ALOHA 클래스 플랫폼에서 수집된 사전 처리된 ACT 호환 데이터 세트를 포함한다.
전파 정책: 다모달적 행동 배포를 처리
확산 정책은 스코어 일치하는 확산 모델을 적용합니다. 이미지들을 위한 안정적인 확산을 지원하는 동일한 모델 클래스입니다. 로봇 행동 공간에 적용합니다. 단일 최선의 행동을 예측하는 대신 정책은 인간 시위자가 취할 수 있는 행동의 완전한 분포를 학습합니다. 추론 시점에서는 그 분포로부터 고품질의 행동을 샘플링하기 위해 단호화 과정을 실행합니다.
ACT에 비해 핵심적인 장점은 다형 과제를 처리하는 방식입니다. 인간이 좌우 또는 오른편에서 물체를 잡거나 여러 유효한 각에서 목표물을 접근할 수 있는 시나리오입니다. 표준 행동 복제제는 이러한 모드를 함께 평균하여 중간으로 내려가 실패하는 정책을 생성합니다. 현재 맥락을 고려하여 올바른 모드에서 방전 정책 샘플을 통해 모호한 작업에 더 강력한 행동을 생성합니다.
트레이드 오프스는 추론 속도이다. UNet 척추와 함께 퍼포션 정책은 기본 추론 (DDPM) 에서 약 500ms를 필요로 합니다. 이는 RTX 3090에서 너무 느리죠. 실시간 제어에 너무 느리죠. DDIM 샘플러는 이것을 10 단계 (~200ms) 로 줄이고, 일관성 디스틸레이션 변종은 단일 단계 생성 (~50ms) 를 달성합니다. 추론 시기와 각 변종을 언제 사용할 것인지에 대한 자세한 비교를 위해 [행동방송 정책과 방급 정책 결정 지침]
퍼포시전 정책은 일반적으로 ACT보다 더 많은 시범이 적용되지만 원본량보다 데이터 집합 다양성을 보상합니다. 실용적인 규칙은: 200개 이상의 시범이 있을 때 퍼포시전 정책을 사용하며, 정책이 처리하기를 원하는 여러 유효한 전략이 있을 때 사용하십시오.
시각 언어 행동 모델: IL 규모
OpenVLA, pi0, RT-2와 같은 VLA는 로봇 시범을 정비하기 전에 인터넷 규모의 시각적 및 언어 데이터에 사전 훈련을 통해 모방 학습을 확장합니다. 사전 훈련된 척추는 객체, 장면 및 관계의 풍부한 표현을 제공합니다. 정렬은 처음부터 훈련보다 훨씬 적은 시범이 필요합니다. 때로는 10~50개의 작업별 예제까지요.
이해해야 할 실용적인 타협: VLA는 훈련과 추론을 위해 훨씬 더 많은 계산을 필요로 한다. OpenVLA (7B 매개 변수) 는 정렬을 위해 A100 또는 H100 GPU를 필요로 하고 약 3 Hz에서 추론을 실행한다. 느린 조작에 적합하지만 반응 작업에는 적합하지 않습니다. 작은 추출 변종이 등장하지만 전체 모델보다 덜 능력적입니다. 컴퓨팅 및 라이선스 요구 사항을 감당할 수 있는 팀들에서는 VLA는 IL 성능의 현재의 경계를 나타냅니다. 그들은 새로운 객체, 새로운 환경 및 언어에 의해 지정된 작업 변동에 더 잘 일반화됩니다.
RCSV는 주요 VLA 훈련 파이프라인에서 예상되는 데이터 형식과 호환되는 정교한 데이터 세트 및 [텔레오퍼레이션 인프라] (
BC를 넘어: GAIL, IBC, 그리고 역강화학습
행동 복제와 DAgger는 실제 로봇 IL를 지배하지만, 다른 여러 방법은 특정 시나리오에 대한 관심을 받을 수 있습니다.
GAIL (Generative Adversarial 모방 학습). GAIL는 전문가들의 시범과 학습된 정책의 배포를 구별할 수 있는 차별자를 훈련시키고, 그 다음 차별자의 출력을 강화 학습에 대한 보상 신호로 사용합니다. 결과 는 전문가 의 개별 행동 에 비해 _state-action 분포 에 맞추어 있는 정책 이 되고, 시범 데이터 세트가 작다 (50 에피소드 이하) 에 BC 보다 더 나은 일반화를 제공 합니다. 비용: GAIL 은 환경 (시뮬레이션 또는 실제) 에서 온라인 로 로 로 로 로 로 로 로 로 로 로 로 로 로 로 로 로 로 로 로 로 로 로 로 로 로 요구 하며, BC 보다 10-100배 더 많은 계산 비용 을 제공합니다. 실용적인 사용 사례: 매우 적은 시뮬레이션 (10-20) 을 할 수 있지만 좋은 시뮬레이터 (예를 들어, MuJoCo가 물리학을 정확하게 모델링하는 톱니 삽입) 를 사용할 수 있는 작업.
IBC (간접적인 행동 복제). IBC는 정책을 명시적인 행동 예측기보다는 에너지 기반 모델 (EBM) 으로 나타냅니다. 단일 행동을 출력하는 대신 모델은 각 후보 (관측, 행동) 쌍에 에너지 점수를 부여합니다. 추론에서 정책은 gradient 기반 최적화 또는 Langevin 역학 샘플링을 통해 에너지를 최소화하는 행동을 찾습니다. 이점: IBC는 자연적으로 방전 모델 또는 CVAEs의 건축적 복잡성 없이 다형 행동 분포를 처리합니다. 단점은: 추론은 모든 시간 단계에서 반복적인 최적화가 필요하기 때문에 RTX 3090에 한 단계 (100-500ms) 느립니다. IBC는 가시하고 잘 분리된 동작 분포 방식이 있는 정확한 접촉 부가 있는 작업 (insertion, fitting) 에서 강력한 결과를 보여주었다.
반복 RL (IRL). IRL는 직접적인 행동을 학습하는 대신 전문가가 간접적으로 최적화하고 있던 보상 기능을 복구하고, 그 후 복원된 보상을 사용하여 RL를 통해 정책을 훈련시킵니다. 이 접근법은 BC보다 새로운 초기 조건으로 더 잘 일반화됩니다. 왜냐하면 정책은 고정된 지도가 아닌 근본적인 목표를 학습하기 때문입니다. 실용적인 장벽: IRL는 내부 루프에서 반복적인 RL 훈련을 필요로 하며, 이는 계산적으로 비용이 많이 들며 시뮬레이터 또는 광범위한 실제 세계 상호 작용이 필요합니다. 시뮬레이션이 성숙하고 보너스 사양이 진정으로 어려운 자율주행 및 탐색 작업에 IRL는 가장 실용적입니다. 조작에 있어서, 현대적인 건축물이 일반적으로 충분합니다.
IL 정책의 실패 분석 프레임워크
실제 로봇에서 훈련된 정책이 실패하면 체계적인 실패 분석은 시행착오 디버깅의 일기를 절약합니다. 이 5단계 프레임워크를 사용하여 정책 실패를 진단하고 수정하십시오.
단계 1: 실패 모드를 분류한다. 10+의 실패 에피소드를 보고 다음 유형 중 하나에 분류한다:
- _ 접근 실패:_ 로봇은 객체 쪽으로 올바르게 움직이지 않습니다 (잘못된 방향, 너무 빠르고 느리거나, 짧게 멈추습니다).
- grap 실패: 로봇은 물체를 도달하지만 그것을 잡지 못한다 (불정렬된 손가락, 충분한 힘, 잘못된 각).
- 교통 실패: 로봇은 성공적으로 잡지만 운송 중에 물체를 떨어뜨립니다 (잡기 느슨화, 장애물 충돌).
- 위치는 실패: 로봇은 성공적으로 운송하지만 최종 배치에 실패 (실반 방향, 위치 오버스라이트).
- 복귀 실패: 로봇은 궤도 밖 상태에 들어가 (예를 들어, 부분적인 포착 후) 회복할 수 없습니다.
** 2 단계: 캘리브레이션 및 하드웨어 문제 확인.** 정책에 대한 비난을 하기 전에 카메라가 캘리브레이션 위치 (표표표에 대한 롤러로 측정), 관절 코더가 유동되지 않는 것을 확인하고 (팔을 알려진 자세로 명령하고 시각적으로 확인) 그리고 그리퍼가 예상 너비로 가까워지는 것을 확인합니다. 정책 실패로 변신하는 하드웨어 문제는 낭비되는 디버깅 시간의 일반적인 원천입니다.
** 3 단계: 실패 관찰을 훈련 배포와 비교하십시오.** 실패 시 카메라 프레임을 추출하고 훈련 데이터와 시각적으로 비교하십시오. 정책이 본 적이 없는 위치에 있는 물체는 있습니까? 조명도 크게 다르습니까? 훈련 중에 보이지 않는 폐쇄적인 물체는 있습니까?
** 4 단계: 모드 평균을 확인하세요.** 로봇이 유효한 두 가지 목표 사이의 지점으로 이동한다면 (예를 들어, 두 개의 객체 사이에서 하나를 선택해야 할 때) 정책은 시범 데이터의 모드 중 평균을 나타냅니다. 멀티모달 아키텍처 (CVAE를 활성화한 디스포이션 정책 또는 ACT) 로 전환하거나 일관된 전략 선택을 시행하기 위해 시범을 청소하십시오.
** 단계 5: 시간당 행동 오류를 계획.** 정책이 잘 시작되지만 20-40 단계 후에 악화되면 합성 오류가 주요 문제입니다. 행동 조각 크기를 증가 시키거나 시간적 집합을 추가하거나 특정 실패 상태에서 HG-DAgger 데이터를 수집하십시오.
파이썬 훈련 스니펫: 레로봇과 ACT
여기 Hugging Face LeRobot 프레임워크를 사용하여 ACT에 대한 최소한의 작업 훈련 스크립트입니다. 주요 구성 결정과 함께 해고합니다.
# train_act.py -- Minimal ACT training with LeRobot
from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
from lerobot.common.policies.act.modeling_act import ACTPolicy
from lerobot.common.policies.act.configuration_act import ACTConfig
import torch
# 1. Load dataset (HDF5 format, collected via LeRobot record)
dataset = LeRobotDataset("svrc/openarm-pick-place-v1")
print(f"Episodes: {dataset.num_episodes}, Steps: {len(dataset)}")
# 2. Configure ACT policy
config = ACTConfig(
chunk_size=100, # Predict 100 future actions per step
kl_weight=10.0, # CVAE KL divergence weight; sweep [1, 5, 10, 50]
dim_model=512, # Transformer hidden dimension
n_heads=8, # Multi-head attention heads
n_encoder_layers=4, # Visual encoder depth
n_decoder_layers=7, # Action decoder depth
input_shapes={
"observation.images.top": [3, 480, 640],
"observation.state": [14], # 7 joints x 2 arms (bimanual)
},
output_shapes={
"action": [14], # Joint position targets
},
)
# 3. Train
policy = ACTConfig(config)
optimizer = torch.optim.AdamW(policy.parameters(), lr=1e-5, weight_decay=1e-4)
for epoch in range(2000):
for batch in torch.utils.data.DataLoader(dataset, batch_size=8, shuffle=True):
loss = policy.forward(batch) # Returns dict with "loss" key
loss["loss"].backward()
optimizer.step()
optimizer.zero_grad()
if epoch % 100 == 0:
print(f"Epoch {epoch}: loss={loss['loss'].item():.4f}")
# 4. Export for deployment
policy.save_pretrained("checkpoints/act-pick-place-v1")
이 스크립트는 레로봇의
일반적인 데이터 품질 문제 및 해결 방법
| Symptom | Likely Cause | Fix |
|---|---|---|
| Policy jerky, oscillates near grasp | Inconsistent operator technique across demos | Use single operator; filter demos by trajectory smoothness |
| High train loss, low success | Misaligned camera timestamps (>50ms offset) | Re-record with hardware sync; check USB bandwidth |
| Overfit: 95% train, 30% eval | Insufficient pose/lighting diversity | Add color jitter + random crop augmentation; collect 50+ demos with varied object positions |
| Policy ignores one camera | Redundant viewpoints; model shortcuts to easier camera | Random camera dropout during training (p=0.1-0.3) |
| 그리퍼 never closes / always closed | 그리퍼 action normalization error | Verify gripper action range matches hardware limits; check open/close polarity |
| Works day 1, fails day 2 | Camera or arm bumped; lighting changed | Add daily calibration check to deployment routine; mount cameras rigidly |
과제 성공 측정: 정책 품질을 측정
훈련된 정책의 질은 비공식적인 관찰이 아닌 구조화된 평가 프로토콜을 통해 측정되어야 합니다.
- ** 작업 성공률.** 주요 매개 변수는: 정책이 전체 작업을 성공적으로 수행하는 평가 실험의 얼마나 많은 분자입니까? 조건마다 최소 20 개의 평가 실험을 실행하십시오. 95% 신뢰 간격을 보고하십시오. 20 개의 실험으로 간격은 넓습니다 (약 +/- 15%), 그래서 작은 차이를 과장해석하지 마십시오.
- ** 부분 완공률.** 다 단계 작업에 있어서, 전체 작업이 실패할 때에도 어떤 하위 작업이 완료되었는지 추적하십시오. 객체에 지속적으로 도달하지만 파악하지 못하는 정책은 접근 단계에서 실패하는 것과 다른 실패 모드를 가지고 있습니다.
- ** 분배 및 분배 밖의 성능.** 항상 훈련 중에 보이는 조건과 훈련 중에 볼 수 없는 조건 (제물, 위치 또는 환경) 에 대한 성공률을 분리적으로 보고하십시오. 90% 분배 및 40% 분배 밖의 정책은 80%/70%를 달성하는 정책보다 근본적으로 다른 배치 준비도를 가지고 있습니다. 평가 프로토콜을 위해 [정책 일반화 가이드] (
T10 ) 를 참조하십시오. - ** 궤도 품질 측정값.** 바이너리 성공/실패를 넘어: 평균
(순순성), 경로 길이의 효율성 (실적 경로 길이가 가능한 가장 짧은 경로와 비교) 및 실행 시간 전문가 시범과 비교. 기술적으로 성공한 정책은 시간이 지남에 따라 하드웨어를 깨고 추가 수집에 사용되면 더 나쁜 데이터를 생성합니다.
훈련 모니터링: 검증 손실 패턴을 관찰
정책 훈련 중에 이러한 신호를 모니터링하여 문제를 조기에 진단하십시오.
** 검증 손실 평판.** 훈련 손실이 계속 감소하는 동안 검증 손실이 감소하는 것을 멈추면, 당신은 훈련 세트에 과도하게 적합합니다. 표준 수정: 데이터 증강 (색의 기저, 무작위 작물) 를 추가하거나 더 다양한 시범을 수집합니다.
**확인 손실 오스컬레이션.**확인 손실의 큰 변동은 불안정한 훈련 구성을 나타냅니다. 학습 속도를 2-5x로 줄여주십시오. 방전 정책에 있어서, 또한 잡음 스케줄 변이가 너무 공격적이지 않은지 확인하십시오.
KL 분할 붕괴 (ACT만). ACT의 손실에서 KL 용어는 훈련 초기 0으로 떨어지면, CVAE 잠실 공간이 붕괴되고 정책은 잠실 변수를 무시합니다. KL 무게를 증가하거나 훈련의 첫 20% 동안 체중을 점차적으로 증가시키는 KL 온도 스케줄을 사용하십시오.
행동 예측 오류 시간 단계. 행동 부분 전체에 대한 시간 단계 예측 오류를 일괄적으로 그려보십시오. 나중에 시간 단계 (예를 들어, 100 단계 부분에서 60+ 단계) 에서 오류가 급격히 증가하면, 조각 길이를 줄이십시오. 오류가 균등하게 높으면 모델 용량이 충분하지 않을 수 있습니다. 트랜스포머의 숨겨진 차원이나 주의 헤드 수를 증가시킵니다.
인퍼런스 배포: 훈련 받은 모델에서 실제 로봇으로
실제 하드웨어에 대한 훈련된 IL 정책을 도입하는 것은 훈련 파이프라인이 노출하지 않는 실질적인 도전을 제시합니다.
** 카메라 캘리브레이션 드래프트.** 카메라가 훈련 데이터 수집과 배포 사이에 부딪히거나 다시 설치되면 2-3cm의 시기가 있어도 정책 성능이 10-20% 감소할 수 있습니다. 항상 캘리브레이션 절차를 사용하여 배포 전에 카메라 위치를 확인하십시오. 배포 체크리스트의 일부로 카메라 내적 및 외부를 로그하십시오 (우리의 [ 배포 체크리스트]를 참조하십시오.
** 제어 주파수 일치.** 정책은 시범이 수집된 것과 같은 제어 주파수에서 실행되어야 합니다. 시범이 50 Hz에서 수집되었지만 추론 파이프라인은 20 Hz에서 실행되면 (GPU가 따라가지 못하기 때문에) 정책의 행동 예측은 일시적으로 잘못 조정됩니다. 훈련 데이터를 분산 제어 주파수와 일치하도록 적시하거나 추론 하드웨어가 충분히 빠르다는 것을 확인합니다. RTX 3090에서 ACT는 단일 카메라로 약 20 Hz를 달성합니다. 두 번째 카메라를 추가하면 출력이 약 15 Hz로 떨어집니다.
행동 연소 및 안전 제한. 원료 정책 출력은 로봇에 전송되기 전에 안전 계층을 통해 필터링되어야 합니다. 관절 제한에 대한 클램프 동작, 속도 제한을 적용 (일반적으로 관절당 1.0-1.5 rad/s) 및 낮은 통과 필터를 사용하십시오 (5-10 Hz 절감) 고 주파수 예측 소음을 제거하기 위해. 이것은 1-2 프레임의 지연을 추가하지만 필터링되지 않은 정책 출력으로 인해 발생할 수 있는 하드웨어 손상을 방지합니다.
모방 학습 에 대한 데이터 요구 사항
단일 조작 작업에 필요한 최소한의 실행 가능한 데이터 세트는 일반적으로 ACT에 50개의 시범, 방전 정책에 100-200개, VLA 정렬에 20~50개이다. 이것은 유리한 조건에서 바닥 추정 - 일관된 조명, 고정된 카메라 관점, 예측 가능한 위치에서 객체입니다. 실제 세계 배포는 3-5배 더 많은 데이터를 필요로 합니다.
데이터 품질은 양만큼 중요 합니다. 숙련된 사업자들이 일관하고 깨끗하게 업무를 수행하는 데서 증명을 수집해야 합니다. 실패한 시도, 의 의 의, 그리고 교육 세트에 성공으로 표시된 수정은 정책 성과를 떨어뜨릴 것입니다. RCSV의 [관리된 데이터 수집 서비스] (T12
센서 다양성 또한 중요합니다. 단일 손목 카메라에 훈련된 정책은 종종 카메라가 잠겨있을 때 실패합니다. 가장 좋은 관행은 적어도 두 개의 카메라 관점 - 고정된 상부 또는 측면 관점 및 손목 장착된 한 개 -에서 수집하고 시각 관측과 함께 proprioceptive 상태 (관동 각 및 속도) 를 포함합니다.
IL 연구용 하드웨어 및 인프라
모방 학습 연구 프로젝트의 최소한의 하드웨어 스택은 다음과 같습니다: 작업에 충분한 자유도를 가진 로봇 팔 (전반 조작을 위해 적어도 6-DOF), 데이터 수집을 위한 리더-따라자 또는 VR 기반의 텔레오퍼레이션 시스템, 두 개 이상의 카메라 및 적어도 하나의 NVIDIA GPU를 가진 작업 스테이션 (ACT/방산 정책에 대한 RTX 3090 또는 더 나은; VLA 미세 조정에 대한 A100 또는 H100 권장).
RCSV의 [하드웨어 카탈로그] (
하드웨어에 투자하기 전에 데이터를 시작하려는 팀들을 위해 RCSV는 샌프란시스코 시설에서 수집된 큐레이션된 멀티 작업 디스플레이 데이터 세트에 액세스 할 수 있습니다. 이 데이터 세트는 일반적인 조작 원시들을 포함합니다. 픽업, 배치, 붓기, 접기, 집합. 그리고 ACT, 퍼포시션 정책, 그리고 Hugging Face [LeRobot]와 직접 사용하도록 포맷되었습니다.
알고리즘 비교 테이블: 어떤 IL 방법, 어떤 시나리오
| Method | Min Demos | Multimodal? | Inference Speed | GPU Required | Best For |
|---|---|---|---|---|---|
| BC (MLP/ResNet) | 50 | No | ~1ms | RTX 3060+ | Simple short-horizon tasks, proprioception-only |
| ACT | 50 | Yes (CVAE) | ~50ms | RTX 3090+ | Bimanual, long-horizon, ALOHA-class hardware |
| Diffusion Policy | 200 | Yes (diffusion) | ~200ms (DDIM) | RTX 3090+ | Multi-strategy tasks, diverse demonstrations |
| VLA (OpenVLA) | 20 | Yes (language) | ~300ms | A100/H100 | Novel object generalization, language-conditioned tasks |
| GAIL | 10 | N/A (RL-based) | ~1ms | A100 (training) | Few demos + good sim (e.g., peg insertion in MuJoCo) |
| IBC | 100 | Yes (EBM) | ~200ms | RTX 3090+ | Contact-rich precision tasks with sharp modes |
대부분의 팀의 결정 흐름 차트: 200개 이상의 데모를 가지고 있는 쌍방향 하드웨어 또는 긴 지평 작업을 가지고 있다면 ACT를 시작하십시오. 200개 이상의 데모를 가지고 있고 작업이 여러 유효한 전략을 가지고 있다면 디스포시전 정책을 사용하십시오. 언어 조건화 또는 최소한의 작업 특정 데이터로 새로운 객체 일반화가 필요한 경우 VLA 미세 조정을 사용하십시오. BC는 가장 간단하고 짧은 작업이나 진단 기준으로만 적합합니다.
다중 과제 인 IL: 다중 과제 를 위한 한 가지 교육 정책
여러 조작 작업을 처리하기 위한 단일 정책을 훈련시키는 것은 현대 건축물에서 점점 더 실용화되고 있습니다.
언어 컨디션은 다 작업에 필수적입니다. 언어 지침이 없으면 정책은 어떤 작업을 수행해야 하는지 알 수 없습니다. 언어 컨디션 정책은 "붉은 잔을 들어보세요" 또는 "최고의 드래스터를 열십시오"와 그에 따라 라우팅 동작과 같은 지침을 받아 들인다. ACT 및 디스포지션 정책은 두 가지 모두 추가 코더 헤드를 통해 언어 컨디션을 지원합니다.
** 작업 간 데이터 균형.** 만약 당신이 500 개의 픽플레이스 데모를 수집하지만 50 개의 픽플레이스 데모를 수집한다면, 정책은 픽플레이스 행동에 큰 호응을 줄 것입니다. 작업 빈도를 균형 잡기 위해 훈련 중에 중량 샘플링을 사용하거나 작업별 데이터 세트 크기에 반대의 비율로 작업 샘플링 확률을 명시적으로 설정합니다.
** 다 작업 훈련은 일반화로 이바지한다.** 100 개의 데모를 가진 5 개의 작업에 대한 훈련은 100 개의 데모를 가진 1 작업에 대한 훈련보다 종종 더 나은 작업 수행을 제공합니다. 다 작업 훈련은 암시적인 규칙화로 작용하여 시각 코딩자가 작업에 대한 특정 시각 단축키를 기억하는 대신 작업에 대한 관련있는 특징을 배울 수 있도록 강요합니다. [오픈 X- 임보디먼트 결과]
** 예상되는 오버하드.** 다 작업 훈련은 단일 작업 훈련보다 2-5배 더 많은 계산을 필요로 합니다 (더 많은 데이터, 안정성을 위해 더 큰 배트 크기가 있습니다). 인퍼런스 속도도 변하지 않습니다. RCSV의 데이터 서비스 는 운영자가 하나의 수집 세션 내에서 여러 작업 정의를 통해 순환하는 다 작업 수집 캠페인을 지원합니다.
초차원적 감수성: 사실 중요 한 것
IL 실무자들은 중요하지 않은 과다 매개 변수를 조정하는 데 너무 많은 시간을 보내고, 중요 한 매개 변수에 너무 적은 시간을 투자합니다. RCSV의 경험에 기초하여 ACT 및 방산 정책의 수백 가지 정책을 훈련합니다. 여기서는 순위 감수성 분석입니다.
| Hyperparameter | Sensitivity | Recommended Default | When to Tune |
|---|---|---|---|
| Action chunk size (ACT) | Very High | 100 steps | Reduce to 20-50 for reactive tasks; increase to 150-200 for slow, smooth tasks |
| KL weight (ACT) | High | 10.0 | Increase (50-100) if multimodal demos; decrease (1-5) if all demos use same strategy |
| Noise schedule (Diffusion) | High | Cosine schedule, 100 diffusion steps | Reduce diffusion steps to 10-20 with DDIM for faster inference |
| Learning rate | Medium | 1e-5 (ACT), 3e-4 (Diffusion) | If training diverges, reduce 5x; if too slow, increase 2x |
| Batch size | Low | 8 (single GPU) | Increase to 16-32 if GPU memory allows for more stable training |
| Number of epochs | Low | 2000 | Use early stopping on validation loss; 2000 is typically sufficient for 200 demos |
| Image resolution | Low | 224x224 or 480x640 | Only increase if task requires fine visual detail (text reading, small object ID) |
** 상호작용 효과:** 액션 조각 크기와 KL 무게는 ACT에서 강하게 상호 작용한다. 큰 조각 크기가 (150+) 는 낮은 KL 무게 (<5) 를 가지고 지나치게 부드럽고 정확한 움직임을 놓치는 평균 궤도를 생성한다. 높은 KL 무게 (50+) 는 큰 조각 크기가 날카롭고 다른 동작 모드를 생성하지만 작업 중간에 모드 사이가 흔들릴 수 있다. 기본 조립 (chunk=100, KL=10) 는 대부분의 작업에 효과가 있다. 단지 함께 조정: 당신이 조각 크기를 증가하면, 각 조각 내에서 행동 다양성을 유지하기 위해 KL 무게를 비례적으로 증가.
실용적인 의미는: 당신의 정책이 미흡한 성과를 거두는 경우, 행동 조각 크기와 KL 무게 (ACT) 또는 노이즈 스케줄 (방산 정책) 을 먼저 조정하십시오. 이 모든 것들이 성공률에 10-20%의 영향을 미칩니다. 학습 속도와 배치 크기는 2-5%의 영향을 미칩니다. 이미지 해상도 및 시대 수가 <2%의 영향을 미칩니다. 기본 라인이 심각하게 잘못 구성되지 않는 한.
DAgger과 HG-DAgger: BC가 충분하지 않을 때
행동 복제에는 합성 오류가 있습니다. 작은 예측 오류는 시간이 지남에 따라 축적됩니다. 정책의 만남은 그것이 훈련되지 않았다고 명시하기 때문입니다 (정책의 오류는 전문가의 입증된 궤도를 밀어냅니다). DAgger (데이터셋 집합) 과 인간으로 인도되는 변종 HG-DAgger는 학습된 정책의 자체 국가 배포로부터 데이터를 반복적으로 수집함으로써 문제를 해결합니다.
** 표준 DAgger 프로토콜:**
- 시범 데이터 세트에 초기 BC 정책을 훈련하십시오.
- 정책의 실행과 자율적인 운영을 허용하는 인간 전문가들은 각 단계에 어떤 행동을 취했을지를 관찰하고 기록합니다 (정책의 궤도를 전문가 행동으로 다시 표시합니다).
- 다시 표시된 궤도를 훈련 세트에 추가하고 다시 훈련하십시오.
- 정책의 궤도가 전문가와 일치할 때까지 3-5번 반복을 반복하십시오.
**HG-DAgger (Human-Gated DAgger) **는 실제 로봇 학습의 실용적인 변형입니다. 전문가가 모든 시간 단계를 다시 표시하는 대신, 인간은 정책 실행을 지켜보고 정책이 실패할 때만 개입합니다. 인간이 업무를 맡을 때 (가팅) 시스템은 인간의 수정 사항을 기록하고 복구 완료되면 정책으로 전환합니다. 이것은 표준 DAgger보다 3-5배 더 빨라서 전문가가 비중적 실패 상태에서만 행동하기 때문입니다.
예상되는 영향: HG-DAgger는 3 번의 수정 라운드 (당이 2050개의 수정 궤도를 추가) 를 통해 일반적으로 순수 BC보다 1525%의 긴 지평선 작업 성공률을 향상시킵니다.
임시 집합 및 행동 쪼개: 구현 세부 사항
BC 성능을 제한하는 합성 오류를 줄이기 위해 두 가지 기술이 중요합니다. 액션 덩어리 (일꺼번에 여러 가지 미래의 행동을 예측) 및 시간적 집합 (평균적 중복된 행동 예측) 이 좋은 결과를 얻는 데 핵심입니다.
행동중절은 각 관찰에서 다음 K 동작 (부작 크기가 K) 를 예측합니다. 로봇은 정책을 다시 요청하기 전에 모든 K 동작을 실행합니다. 이것은 T (피소드 길이가) 에서 T/K로 정책 질문 수를 줄이므로 정책은 K 배로 더 적은 실수를 할 수 있습니다. 전형적인 조각 크기는: ACT에서 K=50-100 (50 Hz에서 미래 동작을 예측하는 1-2 초) 이다. 더 큰 조각은 더 부드러운 움직임을 만들어지만 예상치 못한 사건에 더 느리게 반응한다. 더 작은 조각은 더 반응적이지만 더 합성 오류에 취약하다.
** 시간적 집합**은 여러 개의 초복된 단위에서 예측되는 평균을 나타냅니다. 시간 단계 t에서는 정책이 현재 단위 및 이전 초복된 단위에서 이 시간 단계에 대한 예측을 만들었습니다. 이러한 예측의 기하급수적 중량 평균은 더 부드럽고 일관된 궤도를 생성합니다. 시간적 집합중량은 (ACT의 기본 구성에서 w=0.01) 는 최근 예측이 이전 예측에 비해 얼마나 많은 무게를 얻는지를 제어합니다. 낮은 w 값은 더 부드러운 움직임을 생성합니다. 더 높은 값은 정책을 더 반응하게합니다.
** 조각 크기를 선택:** 최적의 조각 크기는 작업의 시간 구조에 달려 있습니다. 다른 단계 ( 접근, 잡기, 승강, 위치) 를 가진 작업에 대해서는 조각 크기는 적어도 한 단계를 덮을 수 있을 만큼 길어야 합니다. 일반적으로 50 Hz (1-2 초) 에서 50-100 단계입니다. 정책이 200ms 이내에 환경 변화에 대응해야 하는 반응적 작업 (동 động 잡기, 힘으로 제어된 삽입) 에 대해서는 조각 크기를 10-20 단계로 줄이십시오. 간단한 유리스틱: 시범 데이터 세트의 가장 짧은 작업 단계의 평균 기간에 조각 크기를 설정하십시오.
비평적인 구현 세부 사항: 임시 집합은 로봇에 동작을 보내기 전에 적용되어야 하며, 그 후에 적용되지 않습니다. 일부 구현은 잘못 실행된 동작을 후진적으로 평균하여 아무런 혜택을 제공하지 않습니다. 올바른 구현은 모든 활성 부하에서 대기 중인 예측된 동작의 버퍼를 유지하며 로봇을 지휘하기 전에 각 시간 단계에서 중계 평균을 계산합니다.
RCSV의 데이터 수집 운영자는 표준 텔레오퍼레이션과 HG-DAgger 수정 프로토콜 모두에 대해 훈련받습니다. 이미 정책을 훈련하고 있으며 완전히 새로운 시범을 수집하는 대신 목표형 수정으로 개선하고자 하는 팀들을 위해, HG-DAgger 데이터 수집은 우리의 [데이터 서비스]의 일부로 사용할 수 있습니다.
다중 작업 모방 학습: 건축 및 데이터 고려 사항
여러 작업을 수행하기 위해 단일 정책을 훈련시키는 것은 개별 정책을 훈련하는 것보다 샘플 효율성이 높지만 특정 건축 및 데이터 설계 선택이 필요합니다.
** 작업 조건.** 정책은 어떤 작업을 수행해야 하는지 알아야 합니다.
- ** 언어 조건:** 정책에 입력된 자연어 지침 ("붉은 잔을 선택") 을 제공하십시오. 명령은 얼어붙은 언어 모델 (CLIP 텍스트 코드 또는 문장-BERT) 로 암호화되어 시각적 기능으로 연결됩니다. 이것은 가장 유연한 접근 방식입니다. 정책은 알려진 개념을 결합하는 새로운 언어 지침으로 일반화 할 수 있습니다. 교육 데이터에 언어 해설이 필요합니다.
- ** 작업 ID 임베디션:** 각 작업에 학습 가능한 임베디션 벡터를 할당하십시오. 언어 조건화보다 간단하며 작업 집합이 고정되면 작동합니다. 재교육 없이는 새로운 작업에 일반화되지 않습니다.
- ** 목표 이미지 조건:** 추가 입력으로 원하는 목표 상태의 이미지를 제공하십시오. 정책은 현재 관찰을 목표와 일치하도록 학습합니다. 추론 시 목표 이미지를 필요로하지만 훈련 중에 언어 해설이 필요하지 않습니다.
** 작업 간 데이터 균형.** 작업 A가 500 개의 시범과 작업 B가 50 개라면, 정책은 작업 A에 대해 크게 편향됩니다. 훈련 중에 온도중심 샘플링을 사용하십시오: 각 작업의 확률이 N_demos^1/T에 비례하는 샘플을 선택하십시오. 심각한 불균형 (10x+) 에 대해서는 미흡한 대상에 대한 더 많은 데이터를 수집하십시오. 샘플링 트릭은 부족한 다양성을 완전히 보완할 수 없습니다.
흔히 일어나는 훈련 에 대한 함정 과 그 해결책
| Symptom | Likely Cause | Diagnostic | Fix |
|---|---|---|---|
| Robot moves to average of two positions | Mode averaging from MSE loss | Check if demos have multimodal actions for same observation | Switch to Diffusion Policy or increase ACT KL weight |
| Low validation loss but low success rate | Compounding error (policy drifts off-distribution) | Plot per-step error over rollout; look for divergence after step 20-30 | Increase chunk size, add temporal ensembling, or collect DAgger data |
| Training loss plateaus at high value | Noisy or inconsistent demonstrations | Visualize 20 random demos; check for strategy inconsistency | Filter demos by smoothness; retrain on clean subset |
| Robot overshoots targets consistently | Action space mismatch (delta vs absolute) | Check if demo actions are delta-position or absolute-position | Ensure training and inference use identical action representation |
| Works on one camera but not another | Camera extrinsics changed between collection and deployment | Compare camera mount position to training-time calibration | Recalibrate camera to match training position; or add camera pose to observation |
| Policy freezes mid-task | Observation out of training distribution | Log the observation embedding distance from training mean | Collect more demos in the OOD region; or add data augmentation |
실공 작업 흐름을 디버깅하는 것: 실제 로봇에 대한 훈련된 정책이 실패할 경우, 모델이 좋지 않거나 데이터가 충분하지 않은 것으로 결론 내리기 전에 이 진단 순서를 따르십시오:
- 훈련 구성 및 배포 구성 사이의 동작 정상화 통계에 일치하는 것을 확인합니다.
- 검사 카메라 위치는 데이터 수집 이후 움직이지 않았습니다 (비디오 상복을 참조 이미지와 비교하십시오).
- "회전 모드"에서 미리 녹음된 평가 에피소드 정책을 실행하여 액션 출력들이 예상된 값과 일치하는지 확인합니다.
- 현재 관찰에 대한 정책의 관심 지도 또는 중간 활성화를 시각화하십시오. 관심은 작업에 관련된 객체보다는 배경에 있다면, 시각 입력은 손상되거나 잘못 조율될 수 있습니다.
- 이 모든 것이 지나면, 문제는 데이터 품질이나 양입니다. 재 훈련 전에 특히 실패 모드를 목표로 한 20~50개의 더 많은 시범을 추가하십시오.
이 시퀀스는 실제 로봇 배포 실패의 80%를 1-2 시간 이내에 해결하여 조기 데이터 회수 방지합니다.
초보자에게 가장 흔한 함정이 액션 공간 부합입니다. 정책은 델타 위치 동작 (오른쪽으로 5mm 이동) 에 훈련되지만 절대 위치 모드 (x=0.35) 에 배치됩니다. 또는 반대로. 이것은 파손된 모델처럼 보이지만 실제로 구성 오류가 되는 극적인 실패 (overhooting 또는 거의 움직이지 않는) 를 발생시킵니다. 모델 디버깅을 하기 전에 항상 액션 공간 컨벤션을 확인하세요.
첫 번째 IL 프로젝트의 빠른 시작 체크리스트
- ** 시작하기 전에 명확한 성공 기준을 설정하세요.** 어떤 데이터를 수집하기 전에 측정 가능한 용어로 "성공"이란 어떤 것을 의미하는지 정의하세요. 픽 앤 포지션: "물질은 목표 위치에서 2cm 이내에 있고, 1초 동안 안정적으로 (부러지거나 떨어지지 않는) " (
기 후) 삽입: "peg는 30N 힘을 초과하지 않고 완전히 삽입된다. " (목적 깊이의 1mm 내에서) 모든 사업자와 해설자들이 참조하는 공유 문서에 성공 기준을 작성하십시오. - ** 당신의 작업을 선택하세요.** 단일 팔, 단일 객체 선택 및 배치 작업을 시작하세요. 이것은 모방 학습의 "안녕하세요 세계"입니다. 더 어려운 문제를 해결하기 전에 모든 통합 문제를 드러낼 것입니다.
- ** 하드웨어를 설치하세요.** 어떤 데이터를 수집하기 전에 팔을 설치하고 카메라를 (내부 + 외부) 가 정렬하고, 원격 조작 제어 작업을 끝에서 끝으로 확인하세요.
- 50개의 시범을 수집하세요. 일관된 작업 설정을 사용하세요. 실패한 시도를 거부하세요. 이 초기 데이터 세트는 배포 가능한 정책이 아닌 훈련 파이프라인을 검증하기 위한 것입니다.
- ** 트레이닝 ACT.** 기본 하이퍼파레미터 (hyperparameters) 을 가진 [LeRobot]
T22 ) 트레이닝 스크립트를 사용하세요. 100 시대 동안 검증 손실을 모니터링하세요. 단일 GPU에서 훈련이 2-4시간을 걸릴 것으로 예상하세요. - ** 평가.** 실제 로봇에 대한 20개의 실험을 훈련 위치에서 있는 객체로 실행하세요. 목표: 60%+의 성공률. 40% 이하의 경우 더 많은 데이터를 수집하기 전에 데이터 품질을 디버깅하세요.
- ** 다양성을 추가.** 다양한 객체 위치, 2-3 개 객체 인스턴스 및 소규모 조명 변경으로 100~200개의 더 많은 시범을 수집하고, 재훈련하고 평가하십시오.
- Iterate. 구조화된 평가를 통해 실패 모드를 식별하고, 그 모드를 다루는 목표 데이터를 수집하고, 배포 준비가 될 때까지 반복한다.
관련 독서
행동과 전파 정책 결정 지침 · VLA 모델 설명 · 정책 일반화 지침 · 레로봇 시작 · 연제 분석에 따른 비용 · 로봇 학습의 확장 법칙 · 데이터 서비스
본격적 인 모범적 학습 과제 를 시작 하십시오
RCSV는 전체 스택을 제공합니다: OpenArm 1 하드웨어 ($4,500), 관리된 데이터 수집 ($2,500 파일럿) 및 플랫폼 도구 데이터 세트 관리 및 정책 교육. 프로토타입을 위한 50개의 시범이나 생산에 필요한 2,000개의 시범이 필요하든 샌프란시스코 시설과 훈련된 사업자들은 인프라를 자체적으로 구축하는 것보다 더 빠르게 작동 정책을 만들 수 있습니다.
[기업을 시작하기 위해 저희에게 연락하십시오]







