로봇 정책 일반화: 왜 어렵고 2026년에 어떻게 작동하는지
로봇 정책이 왜 일반화하지 못하는지: 분배 전환의 종류, 데이터 증강에서 기초 모델까지의 해결책, 실제로 2026년에 일반화되는 것은 무엇이며 어떻게 측정할 수 있는지
여러분의 정책은 훈련 객체에서 90%의 성공을 달성합니다. 새로운 컵을 도입하고, 조명을 바꾸고, 테이블을 왼쪽으로 6인치로 이동하면 성능이 30%로 떨어집니다. 이것이 일반화 문제이고, 실험실에서 로봇 학습과 실제 세계에서 로봇 학습 사이의 핵심적인 도전이 남아 있습니다.
일반화 하는 것 은 실제로 무슨 의미 입니까?
로봇 정책은 훈련 데이터에 존재하지 않는 조건에서 성공적으로 작업을 수행할 때 일반화됩니다. 이것은 기본적으로 특정 시각 입력에 연결된 특정 운동 순서를 재생하는 메모리와 다릅니다. 일반화 정책은 작업 개념을 배웠어요. 컨테이너를 들고 액체를 뿌리고 톱니가 삽입해서 그 개념을 물체의 외모, 위치, 조명, 심지어 작업 구성의 차이는 따라 실행할 수 있습니다.
일반화는 바이너리적이지 않습니다. 스펙트럼에서 존재하며, 일반화의 다른 축은 다양한 수준의 어려움을 나타냅니다. 정책은 객체 색상 (이소) 에서 잘 일반화 할 수 있지만 객체 모양 (힘) 에서 실패 할 수 있습니다. 훈련 작업 공간 내에서 새로운 위치를 처리 할 수 있습니다 (중소) 그러나 새로운 방에서 완전히 실패 할 수 있습니다 (매우 어렵습니다). 어떤 일반화 축이 당신의 배포 시나리오에 중요하다는 것을 이해하는 것은 그것들을 다루는 데이터 수집 전략을 설계하는 첫 번째 단계입니다.
분배 시프트의 종류
** 시각 배포 전환**는 배포 환경의 시각적 외모가 훈련과 다르면 발생합니다. 여기에는 조명 (온한 상류 대 추운 낮빛 대 혼합) 의 변화, 객체의 외모 (다른 종류의 컵, 다른 색상, 다른 물질 반사), 배경 오더러 (깨끗한 작업 공간 대 오더러있는 책상) 및 카메라 특성이 (지 위치, 노출, 백색 균형의 약간의 차이) 가 포함됩니다. 시각적 전환은 비전 기반 정책에서 일반화 실패의 가장 일반적인 원인이며 데이터 측면 솔루션에 가장 적합합니다.
물리적 분포 변화는 물체나 환경의 물리적 특성들이 훈련과 다르면 발생한다. 단단한 플라스틱 컵에 훈련된 정책은 부드러운 종이 컵에 실패할 수 있습니다. 잡기 역학이 다르기 때문에. 부드러운 테이블 표면에 훈련된 정책은 질감있는 테이블 천장에 실패할 수 있습니다. 마찰 계수 변화 때문에. 물리적 변화는 데이터 증강만으로 해결하기 어렵기 때문에 정책은 다른 시각 패턴을 인식하는 것이 아니라 다른 물리적 전략을 배우는 것이 필요합니다.
** 작업의 변화**는 작업의 목표 또는 구조가 변경될 때 발생합니다. 특정 목표 위치에 객체를 배치하도록 훈련된 정책은 언어 또는 동작으로 지정된 임의 장소에서 객체를 배치하는 데 일반화되지 않을 수 있습니다. 단일 객체 선택과 장소에 훈련된 정책은 순서 결정이 필요한 여러 객체를 가진 장면을 처리하도록 요청되면 실패할 수 있습니다. 작업 변수는 일반화의 가장 어려운 형태이며 일반적으로 언어 조건화 또는 명시적인 작업 분해 구조가 필요합니다.
효과적 인 해결책: 데이터 측면 접근 방법
**자유적인 데이터 세트 다양화는 일반화를 개선하는 가장 신뢰할 수 있는 방법이다. 객체 다양성을 위해, 각 대상 객체 카테고리, 크기와 색상, 재료 및 브랜드의 적어도 10-20 개의 다른 사례를 포함하는 시범을 수집하십시오. 위치 다양성을 위해, 30-40cm 그리드에서 시작 위치를 다양하게 변경하고 다른 객체 지향을 포함하십시오. 환경 다양성 때문에 수집 세션 중 조명 조건 (최소 3 개의 다른 설정), 테이블 표면 및 배경 오더먼트 수준을 변경하십시오.
** 데이터 증강**은 합성적으로 생성된 변종으로 실제 다양성을 보완합니다. 표준 시각 증강 (색의 진동, 무작위 작식, 밝기 및 대조 변동, 가우스 미더) 은 조명 및 카메라 변동에 대한 강도를 향상시킵니다. 새로운 텍스처를 객체에 붙여넣거나 배경을 변경하는 생성 모델을 사용하는 더 진보된 증강은 추가적인 시범을 수집하지 않고 데이터 세트의 효과적인 다양성을 확장 할 수 있습니다. 그러나 증강은 객체 기하학, 포착 전략 또는 물리적 역학에서의 다양성을 대체할 수 없습니다. 시각 다양성을 확장하기 위해 증강을 사용하세요. 다양한 물체와 수집을 피하기 위해서 아닙니다.
** 도메인 무작위**은 데이터 다양화의 시뮬레이션 측면 아날로그이다. [sim-to-real training] (Sim-to-Real training) 에 비주얼 및 물리적 매개 변수를 무작위적으로 분류함으로써, 정책은 특정 시뮬레이션 구성에 변하지 않는 특징을 학습하고 따라서 실제 하드웨어로 전송되면 더 견고합니다. 효과적인 도메인 무작위로 분류하는 것은 올바른 매개 변수를 올바른 범위에서 무작위로 분류하는 것을 요구합니다. 미만 무작위로 분류하는 것은 현실 세계가 활용하는 격차를 남깁니다. 과도한 무작위로 분류하는 것은 학습 문제를 불필요하게 어렵게 만듭니다.
효과적 인 해결책: 건축적 인 접근법
언어 조건은 자연어 명령어를 입력으로 받아 작업 변종을 통일하는 정책을 가능하게 한다. "붉은 잔을 뽑아"와 "고색 그릇을 뽑아"를 훈련시키는 언어 조건 정책은 종종 "녹색 병을 뽑아"로 일반화 될 수 있습니다. 훈련 중에 녹색 병이 보이지 않았더라도요. 왜냐하면 시각 언어의 지형은 무엇을 찾아야 하는지 의미적으로 이해하는 것을 제공하기 때문입니다. [RT-2, OpenVLA, 그리고 Octo]
기본 모델의 척추는 인터넷 규모의 데이터에 훈련된 시각적 및 의미적 표현을 제공하여 정책에 어떤 로봇 데이터 세트가 제공할 수 있는 것보다 훨씬 더 많은 시각적 지식을 제공합니다. [비디오-프레트레이닝 시각 코더] (R3M, SPA, DINOv2) 또는 미리 훈련된 시각 언어 모델 (CLIP, SigLIP) 을 정책 척추로 사용하여 척추는 이미 수천 개의 객체 범주를 인식하는 것을 배웠기 때문에 새로운 객체에 대한 일반화를 지속적으로 향상시킵니다. 정책 정렬은 시각 인식이 아닌 조작 특수한 지도를 배우는 데만 필요합니다.
방산 정책 아키텍처는 행동 분포를 비방하는 퍼포션 프로세스로 모델링하고, 이는 자연스럽게 다형 행동 분포를 처리합니다. 같은 관찰은 여러 가지 유효한 행동을 초래할 수 있습니다. 이 건축 선택은 일반화를 향상시킵니다. 정책은 단일 행동 전략에 대한 약속을 강요하지 않기 때문에 동일한 작업에 대한 다양한 접근 방식을 나타낼 수 있습니다. 확산 정책은 여러 가지 포착 전략이 유효한 작업에 특히 강한 일반화를 보여 주었다.
사실 잘 일반화 되는 것 (그리고 그렇지 않은 것)
**동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동동 도메인 무작위화와 시뮬레이션에서 훈련된 다리 이동 정책은 실제 하드웨어에서 거의 시뮬레이션 성능을 지속적으로 달성합니다.
** 기본 포착은 비교적 잘 일반화됩니다.** 명확한 포착 할 수 있는 단단한 물체 (컵, 상자, 도구) 를 위한 선택 및 배치 정책은 훈련된 범주 내에서 새로운 물체 인스턴스에 일반화 될 수 있습니다. 특히 기초 모델 척추를 사용하는 경우. 핵심 요구 사항은 훈련에서 충분한 객체 다양성입니다. 한 범주마다 10 개 이상의 사례는 일반화가 신뢰할 수 있는 실용적인 임대입니다.
**
장수평선 작업은 잘 일반화되지 않습니다. 여러 순서 단계로 구성된 작업은 합성 일반화 오류를 발생시킵니다. 단계별 실패 확률은 5%로 10 단계에 걸쳐 40%의 작업 실패로 이어집니다. 장수평선 일반화는 작업을 독립적으로 일반화하는 부분 정책으로 분해하거나 개별 단계 실패에서 회복할 수 있는 계획 수준의 추상화를 사용하여 작업이 필요합니다.
일반화 를 측정 하는 것: 올바르게 하는 것
일반화는 구조화된 평가 프로토콜을 통해 명시적으로 측정되어야 하며, 유통 내 성능에서 추론되지 않는다. 표준 접근법은 수납된 테스트 세트를 사용합니다.
- **
어 놓은 객체:** 훈련 중에 사용하지 않는 객체 인스턴스 5~10개의 객체를 한 범주에 저장하십시오. 이러한 객체들은 배포에서 예상되는 시각 및 기하학적 변이의 범위를 어야 합니다. - 수용된 위치: 훈련 배급에 포함되지 않은 객체 시작 위치에서 평가, 작업 공간의 가장자리에 위치 및 훈련에서 희귀한 방향 등.
- 수용된 환경: 가능하면 훈련 설정과 다른 물리적 설정에서 평가하십시오. 다른 테이블, 다른 조명, 다른 배경.
분포 및 분포 밖의 성공률을 별도로 보고하십시오. 분포 내 85%를 달성하지만 분포 밖의 40%를 달성하는 정책은 일반화가 제한되어 있으며 보다 다양한 교육 데이터 또는 더 강력한 척추가 필요합니다. 분포 내 80%와 분포 밖의 70%를 달성하는 정책은 강력한 일반화를 가지고 있으며 배치될 가능성이 높습니다.
일반화 를 평가 하는 일반적인 실수를 피 하 고 훈련과 같은 배포 를 통해 무작위 에피소드를 진행 한다. 이것은 일반화 를 측정 하지 않고 인터폴레이션을 측정 한다. 진정한 일반화 테스트 는 배치 시 정책 이 처리 하고 싶은 요소들을 체계적으로 변화 시키기 를 요구 한다.
일반화 분류: 네 개의 축
로봇 학습의 일반화는 하나의 능력이 아닙니다. 그것은 서로 다른 난이도 수준과 다른 데이터 요구 사항이 있는 네 가지 다른 축으로 분해됩니다.
| Axis | What Varies | Difficulty | Primary Mitigation |
|---|---|---|---|
| Object generalization | Color, shape, size, material within a category | Moderate | 15+ diverse object instances in training |
| Scene generalization | Lighting, background, table surface, camera angle | Moderate-Hard | 3+ environments + aggressive augmentation |
| Task generalization | Novel task instructions, new goal configurations | Hard | Language conditioning + multi-task training |
| Robot generalization | Different robot embodiment, kinematics, gripper type | Very Hard | Cross-embodiment pretraining (OXE) |
대부분의 실용적인 배포는 동시에 객체와 장면의 일반화를 필요로 합니다. 작업과 로봇의 일반화는 주로 2026년에 연구의 한계입니다. 기초 모델이 해결하지만 작업에 대한 정밀 조정이 없으면 생산에 충분히 신뢰할 수 없습니다.
정책이 일반화 되지 않는 이유: 변동적 변화와 분배 불합동
일반화 실패의 수학적인 설명은 코바리아트 전환입니다. 분포에 훈련된 정책은 분포에서 분포를 만나게 됩니다. 분포 환경의 이미지를 활성화하면 신경 네트워크 기능이 훈련 이미지보다 다른 방식으로 작동합니다. 심지어 미묘하게도 정책의 행동 예측은 신뢰할 수 없게됩니다. 이 실패는 침묵하는 위험성입니다. 정책은 자신있게 행동하고 잘못된 행동을 만들어냅니다. 내부 신호가 없다는 것은 그것이 추출되는 것을 나타냅니다.
세 가지 구체적인 메커니즘은 로봇 학습에서 표준 컴퓨터 비전보다 코바리이트 전환을 악화시킵니다.
- ** 복합 오류.** 한 이미지를 고립적으로 잘못 표시하는 분류기는 한정된 오류를 가지고 있습니다. 한 가지 잘못된 행동을 일으키는 정책은 다음 관찰을 변경하여 훈련 배포에서 더 멀리 밀어 넣을 수 있습니다. 오류는 궤도에 따라 기하학적으로 복합됩니다.
- 행동 분포의 복잡성. 정책은 "무엇을 해야 하는가"뿐만 아니라 "이 특정 시각적 맥락에서 무엇을 해야 하는가"를 배우게 됩니다.
- 저 데이터 체제. 로봇 데이터 세트는 컴퓨터 비전 데이터 세트보다 규모가 작습니다. 500개의 시범을 통해 훈련된 정책은 이미지넷으로 훈련된 분류자가 이미지를 보는 것보다 훨씬 적은 시각적 맥락을 보았습니다.
벤치마킹 결과: 로보 에이전트 및 RT-2-X
두 가지 기준은 2026년 일반화에서 작동하는 것에 대한 최고의 양적 증거를 제공합니다.
**RoboAgent (Bharadhwaj et al., 2024)**는 공격적인 데이터 증강 (물질 텍스처를 대체하기 위해 이미지 생성 모델을 사용하여 의미 증강) 을 이용한 12 가지 다양한 작업에 훈련된 단일 정책이 완전히 새로운 객체에서 68%의 성공과 새로운 환경에서 55%의 성공을 달성했다고 보여주었습니다. 핵심 발견: 생성 증강을 통해 시각 다양성을 합성적으로 확장하는 것은 추가 환경으로부터 실제 데이터를 수집하는 것과 거의 효과적입니다.
RT-2-X (Open X-Embodiment] (
기술: 데이터 증강 및 도메인 무작위화
조작 정책 훈련에 대한 실용적인 증강 스택 (이 증강은 훈련 중에 적용되며 데이터 수집이 아닙니다):
# PyTorch augmentation pipeline for robot policy training
import torchvision.transforms as T
train_transform = T.Compose([
T.RandomResizedCrop(224, scale=(0.85, 1.0)), # position invariance
T.ColorJitter(
brightness=0.3,
contrast=0.3,
saturation=0.3,
hue=0.1 # conservative hue -- too much breaks object ID
),
T.GaussianBlur(kernel_size=5, sigma=(0.1, 2.0)),
T.RandomAdjustSharpness(sharpness_factor=2, p=0.3),
T.ToTensor(),
T.Normalize(mean=[0.485, 0.456, 0.406],
std=[0.229, 0.224, 0.225]),
])
이 증강 스택에서 예상되는 개선: 신규 객체 평가에서 8-15%, 신규 환경 평가에서 10-20%, 추가 데이터 수집 비용으로 제로. 이 숫자는 ACT, 방급 정책 및 VLA 미세 조정에서 일관합니다.
기술: 기초 모델 정렬
사전 훈련된 기초 모델 (Octo, OpenVLA, pi0) 을 정비하는 것은 2026년 일반화를 개선하기 위한 가장 효과적인 건축 선택이다. 사전 훈련된 척추는 수천 개의 객체 범주, 조명 조건 및 환경을 아우르는 수백만 개의 이미지에서 시각적 표현을 배웠다. 작업에 대한 정렬 데이터를 통해서 시각적 이해가 아니라 행동 지도를 배울 수 있습니다.
실제 정렬 방식: 훈련시대의 첫 50% 동안 시각적 인코더를 얼어붙여 (전 훈련된 표현을 보존하기 위해), 나머지시대 동안 낮은 학습률 (1/10% 정책의 머리 학습률) 으로 탈결합니다. 이 "단계 정렬"은 정렬 데이터의 일반화를 제공하는 광범위한 시각적 특징을 덮어쓰지 못하게합니다.
건축에 의한 양적 일반화 결과
각 기술 은 얼마나 많은 일반화 개선 을 제공 합니까? 다음 표 는 표준화된 선택 및 장소 기준 (10개 훈련 대상, 10개 개최 대상, 200개 훈련 디모) 에 따라 출판 된 논문 및 RCSV 평가 결과 를 집계 한다.
| Method | In-Distribution | Novel Objects | Novel Scene | Novel Object + Scene |
|---|---|---|---|---|
| ACT (ResNet, no augmentation) | 85% | 42% | 35% | 22% |
| ACT + augmentation | 83% | 55% | 48% | 35% |
| ACT + DINOv2 backbone | 88% | 65% | 55% | 45% |
| Diffusion Policy + augmentation | 86% | 58% | 50% | 38% |
| Octo (fine-tuned, 200 demos) | 87% | 68% | 58% | 48% |
| OpenVLA (fine-tuned, 200 demos) | 90% | 72% | 60% | 52% |
| RoboAgent (semantic aug + 12 tasks) | 88% | 75% | 62% | 55% |
주요 요점은 (1) 데이터 증강은 새로운 객체에서 0% 수집 비용으로 10-15%의 개선이 제공됩니다. 모든 팀이 그것을 사용해야합니다. (2) 기초 모델 척추 (DINOv2, Octo, OpenVLA) 는 증강에 추가로 10-15%의 개선이 제공됩니다. (3) 의미 증강 (로보 에이전트 접근) 을 통해 멀티 작업 훈련은 가장 좋은 전반적인 일반화를 달성합니다. (4) 가장 어려운 축 - 새로운 장면을 결합한 새로운 물체 - 모든 방법에서 55% 이하로 남아 있어 문제의 근본적인 어려움을 강조합니다.
OOD 탐지기로서 거리를 삽입
배치 관찰이 분포되지 않은 경우 탐지하는 실용적인 기술: 관찰의 시각적 임베디션과 훈련 임베디션의 중추점 사이의 코시노 거리를 계산합니다. 거리가 임계점을 초과하면 관찰은 OOD가 될 가능성이 높으며 정책의 행동이 신뢰할 수 없습니다.
# ood_detector.py -- Detect out-of-distribution observations
import torch
import numpy as np
from scipy.spatial.distance import cosine
class OODDetector:
"""Flag observations that are far from the training distribution."""
def __init__(self, encoder, training_embeddings, threshold_percentile=95):
self.encoder = encoder
# Compute centroid and distances for threshold calibration
self.centroid = training_embeddings.mean(axis=0)
train_distances = [cosine(e, self.centroid) for e in training_embeddings]
self.threshold = np.percentile(train_distances, threshold_percentile)
def is_ood(self, observation_image):
with torch.no_grad():
embedding = self.encoder(observation_image).cpu().numpy()
distance = cosine(embedding, self.centroid)
return distance > self.threshold, distance
def get_confidence(self, observation_image):
"""Return 0-1 confidence score (1 = in-distribution)."""
_, distance = self.is_ood(observation_image)
return max(0.0, 1.0 - distance / (2 * self.threshold))
실제에서, 이 탐지기는 일반화 실패의 70-85%를 발생하기 전에 잡습니다. OOD 플래그를 올릴 때, 시스템은 일시 중지하거나 인간의 지침을 요청하거나 보수적인 고전 컨트롤러로 되돌아 갈 수 있습니다. 이것은 특히 조용한 실패가 비용이 많이 드는 생산 배포에서 가치가 있습니다.
체육 간 이식: OXE가 가르쳐 준 것
[오픈 X-Embodiment] (
이 메커니즘은 모델이 22 개의 로봇을 동시에 제어하는 것을 배우는 것이 아닙니다. 오히려, 크로스 인보디먼트 훈련은 시각 코더가 하나의 로봇의 카메라 관점이나 팔 기하학에 특화된 특징보다는 일반적으로 조작 작업에 관련된 특징을 배우도록 강요합니다. 이러한 일반적인 시각적 기능은 새로운 로봇에 전송됩니다. 왜냐하면 그들은 작업에 관련된 구조를 암호화하기 때문입니다.
22 개의 로봇에 접근할 수 없는 팀들에 대한 실용적인 영향: 크로스 인체체체육 전 훈련 모델 (Octo, OpenVLA) 에서 정밀 조정이 이 이점을 대부분 포착합니다. 목표 로봇에서 100-200 개의 작업 특정 시범을 통해, Octo에서 정밀 조정은 5배 더 많은 데이터와 처음부터 훈련과 비교할 수있는 일반화를 달성합니다. 사전 훈련된 모델은 실제로 당신이 수집하지 않은 실시예에서 "자유" 데이터 다양성을 제공합니다.
공간 일반화: 위치 및 방향성 변함
객체 위치 일반화는 종종 실패한 첫 번째 일반화 축이며 수정하기가 가장 쉽습니다. "빈상 일반화"에 의한 IL 실패 대부분은 실제로 훈련 데이터의 공간적 커버리지 실패입니다.
** 작업 공간의 커버링 요구 사항.** 일반적인 40cm x 40cm 테이블톱 작업 공간에서 훈련 시범은 최소 5cm의 거리가 있는 그리드를 커버해야 합니다. 즉, 목표 객체의 최소 64개의 다른 시작 위치입니다. 시범 시범이 중심에 집합되면 (운전자가 객체를 편리하게 배치할 때 자연스럽게하는 것처럼), 작업 공간 경계에 있어서 정책이 실패합니다. RCSV의 수집 프로토콜은 일정한 공간 커버리를 보장하기 위해 표시된 격자 위치를 사용합니다.
** 방향 다양성.** 회전 비대칭을 가진 물체 (기구, 라벨을 가진 병, 전자 부품) 에 위치마다 최소 8개의 방향이 포함된다 (직축 축을 둘러싼 45도마다). 대칭 물체 (배, 구구) 에 대해서는 4개의 방향이 충분하다. 지향을 다루지 않는 것은 가장 일반적인 데이터 수집 오류이며 "연활한" 지향을 작동하고 다른 지향에 완전히 실패하는 정책을 생성합니다.
높이 변수.* 만약 당신의 배포에 다양한 높이의 객체 (다음으로 쌓인 아이템, 래프) 들이 포함된다면, 훈련에 높이의 변수를 포함하십시오. 하나의 테이블 높이에 훈련된 정책은 객체의 시각적 규모가 변화하고 필요한 접근 궤도가 변화하기 때문에 테이블이 2cm 이상 또는 낮을 때 실패할 것입니다.
인체 간 일반화: 로봇들 사이에 전송
일반화의 특별한 사례는 하나의 로봇 실시예에서 다른 로봇에 훈련된 정책을 배치하는 것입니다. 이것은 Octo 및 OpenVLA와 같은 기초 모델의 약속이며, 그것이 얼마나 작동하는지에 따라 원천과 목표 실시예 사이의 유사성에 달려 있습니다.
| Transfer Scenario | Source | Target | 제로샷 전송 | 50-Demo Fine-Tune |
|---|---|---|---|---|
| Same class, same gripper | WidowX 250 | ViperX 300 | 35-50% | 75-85% |
| Same class, different gripper | Franka + parallel jaw | Franka + Robotiq 2F | 15-25% | 65-78% |
| Different class, same action space | Franka | OpenArm 1 | 10-20% | 60-75% |
| Different action space | 6-DOF arm | Bimanual (ALOHA) | 0-5% | 40-55% |
** RCSV 클라이언트들에 대한 실용적 의미:** 당신이 하나의 로봇 플랫폼에서 다른 플랫폼으로 전환하는 경우 (예를 들어, WidowX에서 OpenArm 1로 업그레이드하는 경우), 기존 데이터가 낭비되지 않습니다. WidowX 데이터에 훈련된 시각적 앵코더는 여전히 유용한 객체와 장면 이해를 제공합니다. 새로운 플랫폼에서 50-100 개의 시범을 수집하고 시각적 앵코더를 얼어붙이는 동안 액션 헤드를 정렬하십시오. 이것은 일반적으로 최소한의 새로운 데이터 수집으로 원래 정책의 성능의 70-85%를 회복하고, 동일한 50-100 데모에서 처음부터 훈련하는 경우 40-55%에 비해.
핵심 통찰력: 시각적 표현은 구현체들 사이에 잘 전달된다 (예련된 시각적 앵코더는 로봇에 관계없이 동일한 객체를 볼 수 있다), 그러나 행동 공간이 다르면 행동 정책은 잘 전달되지 않는다. 실제 배치에 있어서 거의 항상 50-100개의 목표체체체 시범으로 정밀 조정이 필요하다. 크로스 인체체 사전 훈련의 시각적 코딩은 일반화 혜택을 제공합니다.
일반적인 실패 패턴 및 목표 고치는 방법
디버깅 일반화 오류가 발생하면 특정 오류 패턴을 식별하면 올바른 수정점을 나타냅니다.
- ** 패턴: 정책은 새로운 객체에 접근하지만 놓치고 있습니다.** 시각적 코더는 객체를 인식하지만 새로운 기하학에 대한 포착 전략은 잘못됩니다. 수정: 기하학적으로 더 다양한 객체 (양형 다양성에 초점을 맞추기, 색 다양성에만 초점을 맞추기) 를 사용하여 시범을 수집하십시오.
- 패턴: 정책은 새로운 환경에서 객체를 완전히 무시합니다. 배경 시각적 특징이 지배하고 정책은 객체 기능보다는 배경 신호와 작업 행동을 연관시키는 것을 배웠습니다. 수정: 훈련 중에 공격적인 배경 증강을 적용하고 3+ 시각적으로 구별되는 환경에서 수집합니다.
- 패턴: 정책은 아침에는 작동하지만 오후에는 실패합니다. 정책은 조명 변화에 민감합니다 (창의 빛 각은 하루 동안 변합니다). 수정: 밝기와 대조 증강을 추가하십시오. 하루의 여러 시간 동안 데모를 수집하십시오. 색상이 작업에 관련이 없는 경우 깊이 입력만을 고려하십시오.
- 패턴: 정책은 80%의 수직된 객체에 대해 작동하지만 투명/반사적인 객체에서는 일관되게 실패합니다. 투명 및 반사적인 객체들은 불투명 객체와 근본적으로 다른 시각적 특징을 생성합니다. 수정: 훈련 데이터에 투명 객체를 포함하십시오 (최저 3 가지 예제); RGB와 함께 깊이 입력 (도심 센서는 RGB보다 투명 객체를 더 잘 처리합니다).
- 패턴: 정책은 작업 공간의 중심에서 성공하지만 가장자리에 실패합니다. 위치 일반화는 제한적입니다. 수정: 훈련 시범이 경계에 초점을 맞추고 전체 작업 공간을 뻗어 있는지 확인합니다. 훈련 중에 겉으로 보이는 객체의 위치를 변경하기 위해 무작위 작물 증강을 사용합니다.
데이터 증대와 실제 다양성: 비용-이익 분석
데이터 증강은 무료 (컴퓨터 비용만). 실제 다양성은 추가 데이터 수집을 필요로 합니다. 언제 증강과 수집을 해야 합니까?
| 일반화 Axis | Augmentation Effective? | Real Diversity Needed? | Recommendation |
|---|---|---|---|
| Lighting variation | Yes (brightness, contrast jitter) | Helpful but not required | Augment first; collect in 2-3 lighting setups if augment insufficient |
| Object color/texture | Partially (color jitter helps) | Yes, for material changes | Augment for color; collect for material/texture variation |
| Object shape/geometry | No | Yes, essential | Collect with 15+ geometrically diverse objects |
| Object position | Partially (random crop) | Yes, for workspace coverage | Collect with full workspace grid; augment for sub-grid interpolation |
| Background/environment | Partially (background randomization) | Yes, for real robustness | Augment + collect in 3+ environments |
| Grasp strategy variation | No | Yes, essential | Collect with diverse objects that require different grasp approaches |
엄지손가락 규칙: 증강은 시각적 변이를 (빛, 색, 카메라 각) 효과적으로 처리합니다. 물리적 변이를 위해 실제 데이터 수집이 필요합니다 (물질 기하학, 포착 전략, 접촉 동화). 200개의 다양한 데모의 잘 증강된 데이터 세트는 시각 일반화에 대한 500개의 비 증강된 데이터 세트를 능가하지만 물리적 객체 다양성에 대한 증강 대체량은 없습니다.
분배 전환 아래 일반화: 실제 사례 연구
특정 유형의 분배 전환에 따라 정책이 실패하는 방법을 이해하는 것은 팀들이 데이터 수집 및 증강 전략을 우선적으로 설정하는 데 도움이 됩니다.
| Scenario | Training Conditions | Deployment Change | Success Rate Drop | Fix Applied |
|---|---|---|---|---|
| Warehouse bin picking | Lab with fluorescent lighting, 15 SKUs | Warehouse with skylights (variable sunlight), 50 SKUs | 92% to 54% | Aggressive color jitter augmentation + 100 on-site demos restored to 82% |
| Lab sample handling | Standard test tubes, white background | Colored reagent tubes, patterned rack | 88% to 41% | DINOv2 backbone (replacing ResNet) + 50 tube demos restored to 79% |
| Kitchen manipulation | RCSV facility kitchen, 20 utensils | Customer kitchen, different counter color, different utensil set | 85% to 62% | Multi-environment training (3 kitchens) during initial collection restored to 78% |
| Electronics assembly | Rev A board design, fixed fixture | Rev B board (shifted connector position by 3mm) | 91% to 12% | 30 new demos on Rev B + random position offset augmentation restored to 87% |
| Retail shelf stocking | Mock shelf, 10 product types | Real store shelf with price tags, adjacent products | 83% to 55% | Background randomization + OpenVLA fine-tune (language conditioning) restored to 76% |
이러한 경우의 패턴: 각 배포는 분포 전환을 포함합니다. 성능 감소의 규모는 배포 조건이 훈련과 얼마나 다르느냐에 따라 달라지며, 고정은 항상 (1) 더 나은 시각적 표현 (기본 모델 척추), (2) 특정 변동 축에 대한 데이터 증강 및 (3) 목표형 현장 데이터 수집의 조합을 포함합니다. 배포 계획을 세우는 팀은 처음부터 -- 초기 컬렉션에 다양성을 구축함으로써 -- 더 작은 감소와 더 빠른 회복을 경험합니다.
일반화 측정: 성공률 이 너머
바이너리 성공률은 표준 일반화 메트릭이지만 정책 강도의 모든 측면을 포착하지는 않습니다. 생산 배포에 대해 다음 추가 메트릭을 추적하십시오:
- 자유적 인 붕괴율. 정책이 실패할 때, 정책은 안전 (정지, 귀국) 또는 위험 (표에서 물체를 때리고 장애물에 충돌) 으로 실패합니까? 70%의 성공과 25%의 우아적 인 실패가 있는 정책은 80%의 성공과 15%의 위험한 실패보다 더 많이 배치됩니다. "안전"과 "안전하지 않은" 실패의 분수를 추적하십시오.
- 회복 성공률.* 실패 후 시스템 재설정 및 재실험이 되면 두 번째 시도의 성공률은 얼마일까요? 첫 번째 시도의 실패가 높지만 재실험 성공률이 높은 정책 (실패가 시스템을 복구 가능한 상태로 남겨두기 때문에) 은 매트릭이 제안하는 것보다 더 많이 배포될 수 있습니다.
- ** 신뢰성 기량.** OOD 탐지기를 배치하면 (이하에 삽입 거리 접근법을 참조) 신뢰성 점수가 실제 성공과 얼마나 잘 상관관계를 맺는지 측정합니다. 잘 기량화된 시스템은 불확실한 상황을 인간 검토로 표시하여 일반화 실패를 침묵의 오류가 아닌 인간-이-loop 개입으로 전환시킬 수 있습니다.
- 시행성 붕괴. 주간 또는 월간 성공률을 추적하십시오. 점진적 퇴화 (계절과 함께 조명 변화, 하드웨어 가용, 물체 배트 변동) 는 가장 일반적인 생산 실패 모드이며 주기적인 데이터 업데이트가 필요합니다.
최대 일반화를 위한 기초 모델 선택
다양한 기초 모델은 다양한 일반화 프로필을 제공합니다. 선택은 일반화의 어떤 축이 가장 배치에 중요하다는 것에 달려 있습니다.
| 기초 모델 | Novel Object 일반화 | Novel Environment 일반화 | Language 일반화 | Compute Requirement |
|---|---|---|---|---|
| Octo (93M) | Good (+20% over ACT) | Moderate (+15%) | Basic | 1x A100 (fine-tune) |
| OpenVLA (7B) | Strong (+30% over ACT) | Strong (+25%) | Strong | 4x A100 (fine-tune) |
| ACT + DINOv2 backbone | Good (+23% over ACT) | Good (+20%) | None | 1x RTX 4090 |
| ACT + R3M backbone | Moderate (+15% over ACT) | Moderate (+12%) | None | 1x RTX 3090 |
제한된 컴퓨팅 (1 GPU, RTX 3090/4090) 을 가진 팀에게는 DINOv2 백본을 가진 ACT가 가장 좋은 일반화를 제공한다. A100 액세스 및 언어 조건화 요구 사항이 있는 팀에게는 OpenVLA 미세조정이 가장 강력한 전반적인 일반화를 제공합니다. Octo는 중간 지점을 차지한다. [프레인딩 비디오 가이드]
일반화 영향에 따라 순위화된 데이터 증강 기술
데이터 증강은 일반화를 개선하는 가장 저렴한 방법이지만 모든 증강은 똑같이 효과적이지 않습니다. 여기 12 개의 테이블탑 조작 작업에 대한 RCSV 압축 연구에 기초한 순위가 있습니다.
| Augmentation | OOD Improvement | In-Dist Impact | Compute Cost | Implementation Difficulty |
|---|---|---|---|---|
| Random crop (224 from 256) | +8-15% | -1 to +2% | Near zero | Trivial (2 lines of code) |
| Color jitter (brightness, contrast, saturation) | +5-12% | -2 to +1% | Near zero | Trivial |
| Background randomization (paste object on random bg) | +10-20% | -3 to 0% | Low | Moderate (needs segmentation mask) |
| Gaussian noise (sigma=0.02) | +2-5% | -1 to 0% | Near zero | Trivial |
| Random erasing (cutout 10-20% of image) | +3-8% | -2 to +1% | Near zero | Trivial |
| Spatial action perturbation (+/- 2mm noise on demo actions) | +5-10% | -1 to +3% | Near zero | Easy (add noise to action labels) |
상위 3가지 증강 (자유 작물, 색상 기저, 배경 추종) 은 계산 비용에서 거의 자유이며 결합될 수 있습니다. 함께 그들은 일반적으로 분배 성능에 최소한의 영향을 미치며 15-30%로 OOD 일반화를 향상시킵니다. 모든 훈련 실행에서 기본으로 세 가지 적용하십시오. 배경 무작위화는 객체 세그먼트 마스크를 필요로 하며, 각 에피소드의 첫 프레임에 SAM (Segment Anything Model) 를 사용하여 자동으로 생성될 수 있습니다.
행동 증강은 미흡하게 사용된 기술입니다. 훈련 중에 시범행동 라벨에 작은 공간 소음 (1-3mm) 을 추가하는 것은 정책이 정확한 궤도를 기억하지 못하게 하는 조절자로서 작용합니다. 정책이 작은 경각심을 회복해야 하는 DAgger 방식의 훈련에서 이것은 특히 효과적입니다.
배포 모니터링: 생산의 일반화 변동을 감지
정책이 도입되면, 일반화 실패는 배포 환경이 변화함에 따라 점차적으로 나타납니다. 효과적인 모니터링은 이러한 실패가 생산 신뢰성에 영향을 미치기 전에 일찍 파악됩니다.
- ** 임베디언 드래프트 모니터링.** 정책의 시각적 인코더를 사용하여 생산 관찰의 임베디언 평균을 계산하고 훈련 집합의 평균 임베디언과 비교하십시오. L2 거리가 훈련 집합 분포의 2 가지 표준 경각심을 초과하면 운영팀을 알리십시오. 이것은 성공률이 떨어지기 전에 시각적 분포 변화를 (빛의 변화, 새로운 물체, 카메라의 오차) 포착합니다.
- ** 통계적 프로세스 제어로 성공률 추적.** 이동 평균으로부터 3개의 표준차로 상위 및 하위 제어 제한을 설정한 제어 차트에 매일 성공률을 표시하십시오. 하위 제한 이하의 한 날 은 조사를 유발합니다. 2 일 연속으로 자동으로 인체-이-loop 모드로 회전합니다. 이 접근법은 갑작스러운 오류 (하드웨어 문제) 와 점진적인 해상 (환경 유동) 를 모두 감지합니다.
- 실실 분류. 시각적 인코더 임베디션으로 실패 에피소드를 로그하고 실패 를 클러스터 로 나열 합니다. 새로운 실패 클러스터가 등장하면 (알아들인 훈련 배포와 일치하지 않는 실패) 는 새로운 OOD 조건을 나타냅니다. 특정 실패 모드 (10-30 데모) 에 대한 목표 데이터 수집은 일반적으로 완전한 재교육 없이 격차를 수정하기에 충분합니다.
- ** 주기적인 재평가.** 월간 전체 일반화 평가 프로토콜 (제재된 객체,제재된 조건) 을 실행하세요. 이전 배포 기준과 결과를 비교하세요. 어떤 축에 5% 이상 감소하면 데이터 업데이트 주기가 발생합니다. 이 재평가에 대한 예산은 매달 2-4 시간입니다.
2026 년 에 대한 실용적 일반화 전략
2026년에 조작 정책을 구축하는 팀들을 위해, 여기서는 가장 좋은 일반화 결과를 지속적으로 생산하는 접근법입니다.
- 기본 모델 척추를 시작하세요. 비디오 전 훈련 또는 VLM 전 훈련의 시각 코더 (DINOv2, SigLIP, 또는 R3M) 를 정책의 시각 척추로 사용하세요. 이것은 첫 날부터 광범위한 시각 일반화를 제공합니다.
- ** 다양하고 큰 것이 아니라 다양한 시범을 수집하세요.** 15개의 객체 인스턴스, 3개의 조명 설정, 3개의 운영체제에서 200개의 시범이 하나의 객체로 2000개 이상의 시범을 일반화할 수 있습니다.
- 언어 조건화를 사용하세요. 만약 당신의 배포에 작업의 변형이 필요하다면, 언어 지침에 대한 정책을 조건화하세요. 이것은 구성 일반화를 해제합니다.
- ** 공격적 으로 증강.** 훈련 도중 색 튀기, 무작위 작물, 밝기 변화, 배경 증강 을 적용 하십시오. 이것은 시각 분포 변화 에 대한 저렴한 보험 입니다.
- ** 일반화를 명시적으로 측정하십시오.** 객체와 조건을 정해 놓습니다. OOD 매트릭을 보고하십시오. 일반화를 측정하지 않은 정책을 전송하지 마십시오.
일반화 평가 체크리스트
- 훈련 중에 사용하지 않는 카테고리별 5~10개의 객체 인스턴스를 예약한다
- 훈련 배급에 포함되지 않은 3+ 작업 공간에서 테스트
- 훈련 중에 보이지 않는 적어도 2 개의 조명 조건에서 평가
- 통계적 중요성을 위해 조건마다 최소 20개의 평가 실험을 수행한다.
- 분배 및 분배 밖의 성공률을 개별적으로 보고한다
- 트랙 각 축에 대한 일반화 (물질, 위치, 조명) 독립적으로
- 정확한 수확 집합을 문서화하여 결과는 재생될 수 있습니다
- 평가 실행 전에 통과/실패 문턱을 정의하고, 평가 후에 아닙니다.
일반화 테스트 프로토콜: 완전한 템플릿
이 템플릿을 사용하여 훈련된 조작 정책에 대한 표준화된 일반화 평가를 실행하십시오. 프로토콜은 실행하는데 2-3시간이 소요되며 출판 가능한 일반화 메트릭을 생성합니다.
- ** 테스트 매트릭스를 정의.** 평가 조건의 격자 를 생성: 분포 중 5 개 x 분포 중 3 개 = 분포 중 15 개. 수직 중 5 개 x 수직 중 3 개 = 15 개 OOD 조건. 2 대안 조명 조건 x 5 개 = 10 개 조명 전환 조건. 총: 40 개.
- ** 조건마다 3개의 실험을 실행하세요.** 각 조건에 따라 3번의 정책을 실행하세요. 성공/실패, 완료 시간 및 필요한 개입을 기록하세요. 총 120개의 실험 (회복을 포함하여 1번 시험에 약 2-3시간, 1-2분)
- ** 계산 측정값.** 분포 성공률 (중앙 및 95% CI 45 실험 이상) OOD 성공률 (중앙 및 95% CI 45 실험 이상) 조명 강도 (초선에서 대체 조명으로의 성공률 감소) 일반화 격차 (분포율 미소 OOD 비율)
- 보고 형식. 신뢰 간격으로 네 가지 매트릭을 모두 보고한다. 15% 이하의 일반화 격차는 좋은 일반화를 나타냅니다. 30% 이상의 격차는 교육 배포에 상당한 부합이 있으며 더 많은 다양성 또는 증강이 필요하다는 것을 나타냅니다.
RCSV의 [데이터 서비스] (
관련 독서
Deep Dive: The 일반화 Challenge · Open X-Embodiment Dataset · 로봇 학습의 확장 법칙 · 시프-투-리얼 전송 팁 · 비디오에서 학습 · 이미테이션 학습 가이드 · 데이터 서비스
일반적 인 정책 을 구축 하십시오
RCSV의 데이터 수집 프로토콜은 일반화를 극대화하는 다양성 목표를 중심으로 설계되었습니다. 우리의 표준 패키지 ($ 2,500 파일럿 / $ 8,000 캠페인) 에는 다중 객체, 다중 환경, 다중 운영자 다양성이 있으며, 우리의 평가 파이프라인에는 새로운 객체 및 조건에 대한 상용화 테스트가 포함되어 있습니다.
[전반화 요구사항을 논의하세요]







