일반화 도전: 2026 년에도 로봇 정책이 여전히 실패하는 이유
로봇 정책이 일반화되지 않는 이유에 대한 깊은 기술적 치료: 분배 전환, 재난적 잊기, 구성성 실패, 그리고 2026 년 실질적인 완화 전략
[← 블로그]
훈련 대상에서 95%의 성공을 달성하는 정책은 새로운 대상에서 완전히 실패할 수 있습니다. 이 기사에서는 왜, 그리고 그 분야가 그것에 대해 무엇을 하고 있는지에 대한 깊은 기술적 처리를 제공합니다.
일반화 전략에 대한 더 넓은 개요를 위해 [로봇 정책 일반화: 왜 당신의 로봇이 새로운 객체에서 실패]
문제 의 규모
일반화 실패는 로봇 학습 연구 데모와 생산 배포 사이의 가장 큰 격차입니다. 5개의 빨간 컵을 사용하여 300개의 "컵을
문제는 벤치마크 수치에서 나타나는 것보다 더 심각하다. 대부분의 출판된 평가들은 좁은 대역 내에서 일반화를 테스트합니다. 같은 객체 카테고리와 다른 색상, 같은 테이블과 다른 위치, 같은 방과 다른 조명. 실제 세계 배포는 이러한 모든 축을 동시에 일반화하고 실패 모드가 합쳐집니다. 새로운 색상과 새로운 위치를 분리하여 잘 처리하는 정책은 새로운 위치에 새로운 색상을 조합하는 데 실패할 수 있습니다. 왜냐하면 표현은 이러한 차원을 독립적으로 요소로 배워 있지 않기 때문입니다.
분배 변화: 기본 메커니즘
수학적인 차원에서 일반화 실패는 분배 시위 문제이다. 정책은 P_train (연구) 분배에 손실을 최소화하기 위해 훈련된 함수 추대기이다. P_train와 P_deploy 사이의 초복이 관련 특징 차원에서 작을 때, 정책의 출력은 인터폴레이션보다는 추출이며 신경 네트워크는 신뢰할 수 없을 정도로 추출됩니다.
로봇 학습의 분배 변화는 컴퓨터 비전 분류보다 더 심각하다. 그 결과는 시간이 지남에 따라 복잡해진다. 비디오의 한 프레임을 잘못 식별하는 분류기는 로컬 오류를 가지고 있다. 한 관찰을 잘못 식별하는 정책은 잘못된 행동을 발생시켜 다음 관찰을 변경합니다. 이는 훈련 배포로부터 더 멀리 떨어져있을 수 있으며, 캐스케이드 오류를 발생시킵니다. 이 합성 오류 동적은 작은 배포 바뀐 경우도 완전한 작업 실패를 유발할 수 있습니다.
세 가지 구체적인 메커니즘은 로봇 조작에서 분배 전환을 촉진합니다.
- 비주얼 분포 전환: 새로운 객체 모양 (색, 질감, 투명성, 반사성) 은 코더가 보지 못한 시각적 특징을 생성합니다. 가장 위험한 경우는 투명하고 반사적인 객체입니다. 이는 대부분의 훈련 데이터 세트를 지배하는 불투명한 매트 객체와 근본적으로 다른 픽셀 패턴을 생성합니다. 또한 투명 물체에서도 깊이 센서가 실패하여 일부 정책들이 의존하는 깊이 기반의 역전도를 제거합니다.
- 형질 분포 전환: 새로운 객체 모양은 정책이 배우지 않은 다른 포착 구성이 필요합니다. 실린드릭 컵에 훈련된 정책은 직사각형 상자를 제시하면 실린더에 적합한 접근 벡터를 생성 할 수 있습니다. 왜냐하면 훈련 데이터에서 실린드릭 기하학과 밀접하게 결합된 포착 전략을 배웠기 때문입니다.
- 역학적 분포 전환: 새로운 물체 질량, 마찰 계수 및 준수는 조작 과정에서 접촉 동력을 변화시킵니다. 딱딱한 플라스틱 물체에 훈련된 정책은 딱딱한 플라스틱에 대한 가동력을 생성합니다. 부드러운 폼 물체를 제시하고 정책은 그것을 꺾습니다 ( 과도한 힘) 또는 떨어뜨립니다 (충분하지 않은 마찰). 이 변화는 시각적 수준에서 보이지 않으며 시각적 데이터 증강만으로 해결할 수 없습니다.
계속적인 학습 에서 재앙적 인 잊음
일반화 실패에 대한 자연스러운 반응은 더 많은 데이터를 수집하고 재교육입니다. 그러나 순진한 재교육은 두 번째 실패 모드를 도입합니다. 재앙적인 잊음. 새로운 객체 범주에 정책이 정교하게 조정되면 이전 mastered 범주에 대한 성능을 잃습니다. 이전 데이터를 재교육 집합에 혼합하지 않는 한. 근본적인 이유는 뉴런 네트워크 매개 변수 업데이트가 새로운 데이터에 최적화되어 오래된 기능을 암호화한 표현을 덮어쓰는 것입니다.
로봇 학습에 있어서 재앙적인 잊는 것은 특히 속임수적 인 문제입니다. 데이터 수집은 비싸고 훈련-발전-재생 과정은 느리기 때문입니다. 이 정책은 이제 투명적인 객체를 처리하지만 이전에 마스터했던 불투명한 객체에 대해 15%를 떨어뜨렸다. 그들은 오래된 데이터를 추가하고 다시 훈련합니다. 그러나 이제 모델은 더 많은 용량 또는 더 신중한 학습 속도 스케줄링이 필요합니다. 이 주기는 배포에서 발견 된 모든 새로운 실패 모드에서 반복됩니다.
현재 완화 전략은 경험 재현 (재교육 과정에서 오래된 데이터와 새로운 데이터를 혼합), 탄력적 무게 통합 (옛 작업에 중요한 매개 변수의 변화를 처벌) 및 진보적인 신경 네트워크 (새로운 작업에 새로운 네트워크 용량을 할당) 를 포함한다. 이 중 어느 것도 문제를 완전히 해결하지 않습니다. 2026년 가장 실용적인 접근법은 종합적인 데이터 풀을 유지하고 주기적으로 처음부터 재교육을 하는 것이며, 신뢰할 수 있는 다급 성능에 대환하여 계산 비용을 받아 들여야 합니다.
구성성: 가장 어려운 일반화
구성 일반화는 익숙한 요소의 새로운 조합을 수행하는 것을 의미합니다. " 테이블의 왼쪽에서 잔을 뽑아"와 " 테이블의 오른쪽에서 그릇을 뽑아"를 훈련시키는 정책은 또한 " 테이블의 오른쪽에서 잔을 뽑아"를 처리해야합니다. 이것은 정책이 객체 정체성과 공간 위치에 대한 독립적인 표현을 배웠습니다.
실제 로보트 정책들은 대부분 복잡하게 얽힌 표현을 학습한다. 그들은 "무엇"과 "어디"를 별도로 표현하지 않는다. 그들은 단일 패턴으로 "왼쪽 위치에서 적색 컵"의 결합된 표현을 학습한다. 이것은 구성 일반화는 일반적으로 가능한 요소 조합의 조합 공간을 커버하기 위해 기하급수적으로 더 많은 훈련 데이터를 필요로 한다. 10개의 객체 카테고리, 5개의 위치, 3개의 조명 조건이 있는 작업에 있어서, 명시적인 요소 표현 없이 구성 일반화를 달성하기 위해서는 모든 150개의 조합의 상당 부분을 포함하는 시범이 필요할 수 있다.
언어 조건 정책 (VLA) 은 언어 명령이 정책이 따라갈 수 있는 구성 구조를 제공하기 때문에 부분적인 해소를 제공합니다. "붉은 잔을 들어라"와 "নীল 그릇을 들어라"는 동사와 문법 구조를 공유하고, 모델이 객체 정체성이 행동과 별도의 변수라는 것을 배우는 것을 권장합니다. 그러나 VLA에서 구성 일반화는 특정 객체 기하학에 따라 액션 순서가 크게 의존하는 정확한 조작 작업에 취약하다.
일반화 격차 측정: 엄격한 프로토콜
일반화는 각 축을 따라 명시적으로 그리고 별도로 평가되어야 합니다. 단일 "대일화" 숫자를 보고하는 것은 무엇이 변했는지, 무엇이 일정했는지 명시하지 않고 의미가 없습니다.
| 일반화 Axis | Test Protocol | Typical Gap (2026) |
|---|---|---|
| Novel objects (same category) | 10 held-out objects, same task setup | 15-40% drop |
| Novel positions | Uniform random across full workspace | 10-25% drop |
| Novel backgrounds/lighting | Different room, table surface, ambient light | 25-50% drop |
| Novel object category | Different object type, same task verb | 40-70% drop |
| Compositional (object + position) | New combination of seen object and seen position | 20-45% drop |
실제 도움 이 되는 것: 영향 에 따라 순위
공개된 배제와 RCSV의 자체 평가 자료를 바탕으로, 배포된 정책에 따른 개입은 배포되지 않은 일반화에 미치는 영향에 따라 순위된다.
- ** 훈련 데이터의 객체 다양성 (최고의 영향력) ** 작업 범주별로 15개 이상의 실제 다른 객체에 대한 훈련은 일관되게 가장 큰 일반화 개선을 가져옵니다. 같은 잔의 15가지 색상 변형이 아니라, 다양한 모양, 재료, 크기와 시각적 특성을 가진 15가지 다른 객체입니다. 각각의 추가적인 별개의 객체는 일반화 격차를 2
5퍼센트 포인트로 줄여서 대략 2530개의 객체까지 감소합니다. 이 중 가장 비싼 개입과 가장 효과적입니다. - ** 사전 훈련된 시각적 코더.** 처음부터 훈련하는 대신 DINOv2 또는 SigLIP를 시각적 척추로 사용하는 것은 이미 수천 개의 객체 범주에 일반화된 시각적 특징을 제공합니다. 이러한 코더를 조작 데이터에 정교하게 조정하면서 광범위한 표현을 유지하면서 새로운 객체에서 처음부터 코더보다 10-20% 더 꾸준히 수행합니다.
- ** 공격적인 시각 증강.** 무작위 색상 기저 (hue +/-0.4), 무작위 크기의 (85-100%의 이미지 영역, 원본으로 변경), 무작위 밝기와 대조, 훈련 중에 적용된 가우스 미러. 이러한 증강은 무료 ( 추가 데이터 수집 비용) 이며, 새로운 객체 및 새로운 환경 평가에서 8-15%의 개선을 지속적으로 제공합니다. 그것들은 실제 물체 다양성을 대체하지는 않지만 강력한 보완입니다.
- 언어 조건화. 작업 ID가 아닌 작업 설명 (" 컨테이너를 선택") 정책에 대한 조건화는 모델이 시각 패턴보다는 의미적 의미에서 행동하도록 강요합니다. 이것은 객체 카테고리 일반화에 가장 도움이되며 정확한 기하 일반화에 가장 적게 도움이 됩니다.
- ** 훈련 데이터의 위치 다양성.** 각 방향에 40cm 이상 범위에서 개체 시작 위치를 다양화, 방향도 포함. 비용은 중소 (이런 개체, 각 에피소드마다 다른 배치) 이며 위치 일반화에 미치는 영향은 상당한: 일반적으로 15-25% 향상.
- 다환경 데이터 수집. 3개 이상의 다른 물리적 환경에서 (다양한 테이블, 배경, 조명) 시연 분포 전환에 대한 주요 방어 수단은 시연 분포 전환에 대한 시연 수집입니다. 이것은 물체 다양성에 비해 물적적으로 더 어렵습니다. 왜냐하면 그것은 설정을 물리적으로 이동시키는 것이 필요하기 때문입니다.
일반화 격차의 수학적 공식
일반화 격차는 분포 및 분포 외부 예상 손실의 차이로 공식화 될 수 있습니다. L
경험적으로, G는 D_트레인과 D_deploy 사이의 분포 거리와 함께 확장되지만 관계는 매우 비선형이다. 작은 전환 ( 같은 객체 카테고리, 다른 색) 는 G의 5-15%를 생성한다. 중소 전환 ( 같은 카테고리, 다른 모양) 는 G의 20-40%를 생성한다. 큰 전환 ( 다른 카테고리, 동일한 작업 동역) 는 G의 40-70%를 생성한다. 그리고 중요한 것은 G가 절벽 행동을 나타낼 수 있습니다. 성능은 분포 거리의 문턱까지 부드럽게 떨어지고, 갑자기 붕괴됩니다. 이 절벽 효과는 일반적으로 정확한 조작 작업에서 훈련 분포에서 위치 오프셋 10cm 정도, 그리고 포착 작업에서 오프셋 오프셋 20-30도 정도에서 관찰됩니다.
클립 효과는 기계적 설명이 있다. 정책의 시각적 앵코더는 훈련 관찰의 공간적 주파수에 맞춰 수용적 필드 패턴을 학습한다. 객체가 충분히 멀리 이동하면 관련 기능이 학습된 수용 필드 활성화 이외에 떨어질 때, 코딩의 출력은 정책 헤드가 훈련 신호가 없는 기능 공간 영역에 들어가고 예측된 동작은 본질적으로 무작위로됩니다. 이것은 점진적 퇴화가 아니라 단계적 전환입니다.
재단 모델 및 비료: 현재 상태
로봇 기술 (Octo, OpenVLA, pi0, RT-2-X) 의 기초 모델은 다양한 데이터에 미리 훈련된 시각적 및 의미적 표현을 제공함으로써 일반화를 해결합니다. 실질적인 질문은 그들이 얼마나 많은 일반화를 개선하고 어떤 비용으로 제공하는지입니다.
제로샷 일반화: 기초 모델은 숙련된 범주 내에서 새로운 객체에 대해 작업에 대한 정밀 조정 없이 2540%의 성공률을 달성합니다. 이는 처음부터 정책에 대한 515%에 비해 크다. 이것은 의미 있는 개선이지만 대부분의 응용 프로그램에 적용될 준비가 되지 않습니다.
**50100개의 작업별 시범을 통해, 정교한 기초 모델은 일반적으로 300500개의 시범에서 훈련된 처음부터 정책과 일치하거나 이른다. 샘플 효율성 향상은 3-5배로 증가하여 직접적으로 데이터 수집 비용을 감소시킵니다.
** 디스틸링 접근법:** 대규모 기반 모델에서 작은 배치 준비된 모델까지의 지식 디스틸링은 활동적인 영역입니다. 표준 접근법: 대규모 데이터 세트에 대한 행동 레이블을 생성하기 위해 큰 모델을 (OpenVLA 7B 매개 변수) 을 사용하고 이 사이부 레이블된 데이터에 대한 컴팩트 학생 모델을 (50-200M 매개 변수) 훈련합니다. 디스틸된 학생들은 일반적으로 교사의 일반화 성능의 80-90%를 10~50배 더 낮은 추론 비용으로 유지합니다. 이것은 가장자리 하드웨어에 배치하는 것을 실현 가능하게 만듭니다. 디스틸된 정책은 제트슨 오린에서 20Hz에서 실행되지만 교사의 모델은 A100 GPU가 필요합니다.
기초 모델 기반 일반화의 한계는: 시각 및 의미 일반화에 가장 잘 작동합니다 (다른 모양이 있지만 비슷한 기능을 하는 새로운 객체) 그리고 기하학적 및 동적 일반화에 가장 나쁘습니다 (기본적으로 다른 조작 전략을 필요로 하는 새로운 객체). 1,000 개의 다른 컵을 본 기초 모델은 1,001 번째 컵에 잘 일반화합니다. 그것은 비운 비누로 잘 일반화되지 않습니다. 왜냐하면 미끄러울 수 있는 변형 가능한 물체의 조작 전략은 딱딱한 컨테이너의 전략과 근본적으로 다르기 때문에 훈련 전 데이터의 시각적 다양성은 그 차이를 가르치지 않습니다.
클립 효과: 경험적 인 증거
클립 효과 (정책 성과가 한계까지 순조롭게 떨어지고 갑자기 붕괴되는 경우) 는 여러 설정에서 양적으로 기록되었습니다. 그 경계를 이해하는 것은 팀들이 배치에 대한 현실적인 기대를 설정하는 데 도움이 됩니다.
| Perturbation Type | Graceful Degradation Range | Cliff Threshold | Post-Cliff Performance |
|---|---|---|---|
| Object position offset (tabletop pick) | 0-8 cm: 85-92% success | ~10 cm from training centroid | < 20% success |
| Object orientation (grasp tasks) | 0-15 deg: 80-90% | ~25-30 deg from training orientations | < 25% success |
| Camera displacement | 0-3 cm: 75-90% | ~5 cm from calibrated position | < 30% success |
| Lighting intensity change | +/- 30% lux: 80-90% | +/- 60% lux change | < 40% success |
| Background scene change | Minor changes: 85-90% | Complete scene change (new room) | < 35% success |
| Object mass change (pour/place) | +/- 50g: 80-90% | +/- 200g from training objects | < 30% success |
이러한 임대値は 대략적이고 정책 구조와 교육 데이터 다양성에 따라 달라진다. 보다 다양한 데이터에 훈련된 정책들은 더 넓은 유아한 퇴화 범위와 더 높은 절벽 임대점을 나타낸다. 배치 계획의 핵심 통찰력: 배치 환경에서 발생할 가능성이 높은 혼란 범위를 파악하고, 그 범위를 최소 120%까지 차지하는 훈련 데이터를 확보하여 진벽 문턱을 초과하여 매진을 유지하십시오.
SOTA 일반화 점표 (2026년 4월)
다음 표는 표준화된 평가 프로토콜에 대한 주요 정책 구조에서 가장 잘 보고된 일반화 결과를 집계합니다. 결과는 출판된 논문 및 재현된 평가에서 따집니다. 모든 숫자는 수직된 테스트 조건에서 성공률입니다.
| Model | Novel Objects (same cat.) | Novel Positions | Novel Environment | Training Demos |
|---|---|---|---|---|
| ACT (from scratch) | 52% | 68% | 35% | 200 |
| ACT + DINOv2 backbone | 67% | 75% | 52% | 200 |
| Diffusion Policy | 58% | 72% | 40% | 300 |
| Octo (zero-shot) | 35% | 42% | 28% | 0 (pre-trained) |
| Octo (fine-tuned, 100 demos) | 68% | 76% | 55% | 100 |
| OpenVLA (fine-tuned, 100 demos) | 72% | 78% | 58% | 100 |
| pi0 (fine-tuned, 50 demos) | 75% | 80% | 60% | 50 |
| RoboAgent (diverse data) | 82% | 85% | 62% | 800 (diverse) |
주요 단점은 (1) 기초 모델 정렬은 3-5배 더 적은 디모를 통해 처음부터 훈련과 비교할 수 있는 일반화를 달성합니다. (2) 데이터 다양성 (로보 에이전트) 은 여전히 디모에 따라 측정 할 때 모델 규모를 능가합니다. (3) 새로운 환경 일반화는 모든 아키텍처에서 가장 어려운 축으로 남아 있으며 표준화된 평가에서 62%를 초과하는 방법은 없습니다. (4) 기초 모델의 척추 + 다양한 정렬 데이터 (pi0 + 목표 수집) 의 조합은 현재 실용적인 최적을 나타냅니다.
팀 크기에 따라 실질적인 완화 전략
적절한 완화 전략은 팀의 자원에 달려 있습니다. 여기 규모별로 실행 가능한 권고 사항이 있습니다.
** 단독 연구자 / 1-2 인 팀.** 출발점으로 기초 모델을 (Octo 또는 OpenVLA) 사용하십시오. 적어도 10 가지의 다른 객체와 3+의 조명 조건으로 특정 작업에 대한 50-100 가지 다양한 시범을 수집하십시오. 공격적인 시각 증강 (색의 진동, 무작위 작물, 가우스 미러) 을 적용하십시오. 예상 일반화: 같은 범주 신작 객체에서 60-70% 예산: 2,000~5,000달러 계산 + 데이터 수집 시간
** 작은 연구소 / 3-10 인 팀.** 15 개 이상의 객체, 3 개 이상의 환경 및 언어 교육 레이블을 통해 수집된 200-500 개의 시범 사례에 기초 모델을 정렬하십시오. 각 축을 따라 수행된 테스트 세트를 사용하여 체계적인 평가를 실시하십시오. 특정 오류 모드를 목표로 DAgger 스타일의 데이터 수집을 사용하십시오. 예상 일반화: 신규 객체에서 70-80% 예산: 하드웨어 시간 및 계산을 포함해 10,000~30,000 달러. RCSV의 [2,500 달러 파일럿] (
** 회사 / 생산 팀.** 연속적인 데이터 수집 파이프라인을 구축하십시오. 다양한 객체 라이브러리를 유지하십시오. 목표 범주에서 50 개 이상의 객체). 단순히 실험실 설정뿐만 아니라 생산 환경에서 수집하십시오. 새로운 데이터가 축적됨에 따라 매주 또는 매달 재훈련하십시오. 모든 모델 버전에서 실행되는 자동 평가 스위트를 구현하십시오. 목표: 배포 관련 조건에 대한 85%+ 일반화. 예산: 데이터 운영에 대해 연간 5만~200만 달러. RCSV의 [$8,000 캠페인]
일반화 위한 평가 프로토콜
엄격한 일반화 평가에는 각 축을 따라 구조화된 수직 테스트 세트가 필요합니다. 최소한 다음과 같은 프로토콜이 권장됩니다.
- 분할 프로토콜: 훈련에 사용되지 않는 수습 객체로 객체 집합의 20%를 예약하십시오. 작업 공간의 위치의 20%를 수습 시험 위치로 예약하십시오. 가장 강력한 일반화 테스트를 위해 시험 위치에서 시험 객체의 교차 결과물을 평가하십시오.
- ** 최소 시험 수:** 통계적 중요성을 달성하기 위해 시험 조건마다 최소 20 개의 실험을 실행하십시오. 95% 신뢰 간격으로 성공률을보고하십시오.
- ** 체계적인 혼란:** 무작위적으로 진행된 평가 이외에 특정 혼란 축을 개별적으로 테스트하십시오. 카메라를 훈련 위치에서 5cm 떨어진 곳으로 이동하십시오. 테이블 표면을 변경하십시오. (탁막을 추가하고 색을 변경하십시오.) 배경을 변경하십시오. ( 작업 공간 뒤에 있는 객체를 추가/ 제거하십시오.) 조명을 변경하십시오. (광선으로 LED, 창문 빛의 소스를 추가/ 제거하십시오). 이것은 정책이 가장 민감하게 반응하는 장애를 보여줍니다.
- 축별 결과 보고: 일반화 결과를 하나의 숫자로 집계하지 마십시오. 새로운 객체 성공, 새로운 위치 성공, 새로운 환경 성공, 작곡 성공을 별도로 보고하십시오. 90%의 새로운 위치 일반화와 30%의 새로운 객체 일반화 정책은 포지션 다양성이 아닌 훈련에서 객체 다양성을 요구합니다.
2026 년 국경: 개선 되고 있지 않은 것
로봇 기술 (Octo, OpenVLA, pi0) 의 기초 모델은 익숙한 범주 내에서 새로운 객체에 대한 제로샷 일반화를 지속적으로 개선하고 있다. 정교한 기초 모델과 신규 객체 평가에 대한 처음부터 정책 사이의 격차는 2024 년 약 15%에서 2026 년 25-30%로 확대되었습니다. 즉 기초 모델은 일반화 기준에 앞서고 있습니다.
더 빠르게 개선되지 않는 것은: 정확한 기하학적 일반화 (다른 포착 전략을 필요로 하는 진정으로 신기한 객체 모양을 처리하는), 동적 일반화 (신기적인 물리적 특성을 가진 객체를 처리하는), 그리고 다단계 구성 일반화 (신기적인 기술들의 새로운 순서를 실행하는) 이다. 이러한 문제는 아직 데이터 스케일과 모델 스케일의 해결되지 않은 어려운 문제입니다.
RCSV의 [데이터 수집 서비스] (
관련 독서
- [로봇 정책 일반화: 왜 로봇이 새로운 물체에서 실패하는 지]
- [로봇 학습의 확장 법칙: 우리가 2026년에 알고 있는 것]
- [로봇의 모방 학습: 시위에서 배치까지]
- [오픈 엑스 인체: 모든 것을 변화시킨 로봇 데이터 세트]
- [행동과 방전 정책: 언제 어떤 것을 사용해야 하는가]
- [RCSV 데이터 수집 서비스]
일반화 를 위해 고안 된 데이터 수집
RCSV는 다양한 객체, 다양한 환경, 그리고 수납된 테스트 세트와 체계적인 평가로 정책 일반화를 극대화하기 위해 데이터 수집을 구성합니다.
[데이터 서비스를 탐구]







