Blog(으)로 돌아가기

로봇 비디오에서 배우는 것: 2026년 최첨단 기술

2026년 비디오에서 로봇 학습에 대한 종합적인 조사: 시각 사전 훈련 (R3M, MVP), 비디오 언어 행동 모델, 무엇이 작동하는지, 무엇이 작동하지 않는지, 그리고 데이터 수집에 대한 실질적인 영향.

[← 블로그]

인터넷에는 수십억 시간의 인간 조작 비디오가 있습니다. 로봇을 가르치기 위해 데이터를 사용하는 약속은 현실입니다. 하지만 실제로 작동하는 메커니즘은 대부분의 사람들이 기대하는 것과 다르며, 비디오가 제공하는 것과 로봇이 필요로 하는 것 사이의 격차는 여전히 중요합니다.

로봇 학습 에 있어서 비디오 이 매우 매력적 인 이유

[원격조작] (T5) 를 통해 로봇 시범 데이터를 수집하는 것은 시간당 30120개의 에피소드를 생산한다. 하루에 8시간씩 운영되는 하나의 로봇 스테이션을 가진 연구팀은 하루에 대략 5001,000개의 에피소드를 수집한다. 한편, 유튜브만만만 한 분당 500시간 이상의 동영상을 수신한다. 요리 교과서, 목재 시범, 공장 조립 영상, 수술 절차, 인터넷은 로봇이 수행하도록 요청할 수 있는 모든 물리적 작업에 대한 시범을 포함하고 있습니다. 로봇이 모은 데이터 수집이 맞지 않는 규모로 말이죠.

로봇이 이 비디오에서 직접 학습할 수 있다면 물리적 인공지능을 제한하는 데이터 병목이 크게 사라질 것입니다. 특정 하드웨어에 대한 작업 특정 시범을 수집하는 데 몇 달을 투자하는 대신, 팀은 단순히 인터넷 비디오의 관련 하위 집합에 모델을 가리키고 일반적 조작 정책을 훈련시킬 수 있습니다.

2026년 현실은 더 뉘앙스되어 있습니다. 비디오는 로봇 학습에 매우 유용하다는 것을 증명했습니다. 하지만 단순한 이야기에서 제시하는 방식은 아닙니다. 비디오에서 로봇 행동으로 가는 길은 특정 기술 접근 방식을 통해 진행됩니다. 각각의 강점과 어려운 한계를 가지고 있습니다.

세 가지 근본적 문제

행동은 표시되지 않습니다. 비디오는 어떤 일이 일어나는지 보여줍니다. 한 손이 한 잔을 잡고, 그것을 들어 올리며, 물을 흘리는 것, 하지만 그 동작을 일으킨 모터 명령어를 기록하지 않습니다. 로봇 정책은 관찰을 행동으로 지도해야합니다. 관절 속도, 최종 효과의 이동, 지갑 명령어. 비디오는 관찰 측면을 제공하지만 행동 측면을 제공하지 않습니다. 비디오에서 동작을 복구하는 것은 근본적으로 미분명한 역전문제를 해결하는 것을 필요로 합니다.

  • 몸체 부합.** 인간 손 은 27도 의 자유 를 가지고 있으며, 부적 인 촉각 피드백 을 제공하는 튼튼 한 피부 를 가지고 있으며, 로봇 지갑 에 비해 크게 다른 힘 능력 을 가지고 있다. 인간 물 을 붓는 물 은 손가락 압력, 손목 토크, 액체 운동 신호 를 통해 자기 수용적 피드백 을 사용 한다. 이 시키는 물 은 7DOF 팔 에 설치 된 평행 턱 지갑 에 직접적 인 인 인 analog이 없는 것 이다. 비디오에서 완벽한 액션 레이블을 추출할 수 있다면, 그 액션들은 로봇이 아닌 인간의 운동 명령어를 묘사합니다.

뷰포인트 불합리. 인간 비디오는 로봇 카메라 배치와 거의 일치하지 않는 첫 번째 사람 (자만주의) 또는 세 번째 사람 관점에서 촬영됩니다. 로봇은 일반적으로 손목 카메라와 하나 이상의 고정된 상부 카메라를 가지고 있습니다. 인간 관점 비디오에서 배운 시각적 특징은 로봇 관점 관측에서 올바르게 활성화되지 않을 수 있으므로 시각적 정책을 직접 전송하는 것을 제한합니다.

실제 효과: 시각적 표현 을 미리 훈련 시키기

비디오 기반 로봇 학습의 가장 강력한 검증된 결과는 시각적 표현 사전 훈련입니다. 접근법은: 인간 조작 비디오의 큰 양에 시각적 인코더를 훈련시킵니다. 어떤 행동 레이블도 없이요. 이것은 로봇 학습의 샘플 효율성을 15~40%까지 지속적으로 향상시킵니다.

R3M (Nair et al., 2022) 는 언어 조화를 결합한 시간적 견제 학습 목표를 사용하여 메타의 자존심적 인간 비디오의 Ego4D 데이터 세트에 ResNet를 미리 훈련시켰다. 결과 시각 코더는 프랭카 조작 정책을 초기화 할 때 여러 벤치마크 작업에서 ImageNet 사전 훈련에 비해 샘플 효율성을 15-40% 향상시켰다. R3M는 로봇 학습 연구에서 가장 널리 사용되는 비디오 사전 훈련된 코더 중 하나입니다.

MVP (Masked Visual 사전 훈련, Xiao et al., 2022) 는 이기심적인 비디오와 ImageNet 데이터의 조합에 마스크된 자동코딩을 사용했다. 학습된 표현은 로봇 제어 작업에 잘 전달되어 조작 관련 비디오에 대한 자율 감독 사전 훈련이 로봇 정책 학습을 위한 ImageNet 기능을 감독하는 것을 입증했다.

SPA (Zhu et al., 2024) 는 공간 인식 목표와 함께 사전 훈련 패러다임을 확장하여 더 나은 3D 공간적 추론을 가진 표현을 생산했습니다. SPA는 R3M보다 비교적 또는 더 나은 하류 로봇 성능을 보여주면서도 더 해석 가능한 공간적 특징을 제공했습니다.

이러한 결과의 기법은 잘 이해됩니다. 인간 조작 비디오는 객체 제공에 대한 엄청난 양의 정보를 포함합니다. 물체가 어떻게 보이는지, 밀어 넣거나 잡을 때 어떻게 움직이는지, 안정적인 구성을 구성하는 것입니다. 명시적인 행동 레이블이 없어도, 이 정보는 시각적 특징에 암호화되어 로봇 인식에 직접 전달됩니다. 수천 시간 동안 인간이 컵을 잡는 것을 본 시각적 코딩은 손잡이 컵이 어떻게 생겼는지 알고 있습니다. 바로 로봇이 컵을 잡는 데 필요한 표현입니다.

비디오 언어 행동 모델: 새로운 국경

큰 시각 언어 모델 (VLM) 의 등장으로 비디오-로봇 전송에 새로운 경로가 열렸다. 비디오-언어-행동 (VLA) 모델은 비디오-예련된 시각 코더와 언어 이해와 행동 예측을 단일 아키텍처에서 결합합니다. 핵심 통찰력: 언어는 비디오의 의미적 내용과 로봇이 실행해야 할 특정 행동 사이의 다리를 제공합니다.

RT-2 (Brohan et al., 2023) 는 인터넷 규모의 이미지 텍스트 데이터에 미리 훈련된 VLM가 로봇 동작을 직접적으로 출력하도록 정비될 수 있음을 보여주었다. 광경 사전 훈련 - 광범위한 비디오 데이터를 포함 - 는 RT-2에 강력한 시각적 이해를 제공하여 로봇 조작으로 전송되었다. RT-2는 로봇 데이터 수집 과정에서 볼 수 없는 신규 객체와 지침에 의미있는 제로샷 일반화를 보여주었습니다.

SuSIE (Black et al., 2023) 는 비디오 생성 모델을 하위 목표 생성자로 사용하였다. 현재 관찰과 언어 명령이 주어지면 목표 상태를 보여주는 유력한 미래 이미지를 생성하고, 낮은 수준의 정책은 생성된 하위 목표에 도달하기 위해 행동을 실행합니다. 이 접근법은 인터넷 비디오에서 훈련된 비디오 예측 기능을 활용하여 로봇에 시각적 계획을 수립합니다.

UniSim (Yang et al., 2023) 는 비디오 데이터에서 시각 세계가 행동에 반응하여 어떻게 진화하는지 예측할 수 있는 보편적 시뮬레이터를 훈련시켜 더 나아가게 되었습니다. 이 학습된 세계 모델은 모델 예측 제어 기능을 제공합니다. 로봇은 비디오 예측 모델을 통해 후보 행동의 결과를 실행하여 예측 결과를 가장 잘 예측하는 액션 순서기를 선택합니다.

이러한 접근법은 진정한 발전을 나타냅니다. 하지만 중요한 한계가 있습니다. VLA 모델들은 신뢰할 수 있는 동작을 만들기 위해 상당한 로봇 특수한 정렬 데이터를 필요로 합니다. 비디오 사전 훈련은 시각적 이해와 의미적 지형을 제공합니다. 정확한 모터 제어가 아닙니다. SuSIE와 UniSim은 구조화된 환경에서 작동하지만 아직 정밀 작업에 생산 배치하기에 충분한 강도가 없습니다.

아직 작동하지 않는 것: 인터넷 비디오에서 직접 정책 학습

인터넷 비디오에서 로봇 정책의 종결-종결 교육을 실시하는 꿈은 2026년에 실현되지 않고 있습니다. 여러 연구 분야에서는 이런 시도가 있었습니다.

  • 반반 역역학 모델은 연속 프레임 사이의 동작을 예측함으로써 비디오를 가짜 동작으로 표시하려고 한다. 이것은 인간의 포즈 추정치를 미세 센티미터 정확도로 해결하고, 인간의 관절 각을 로봇 운동학으로 다시 목표하고, 실시예 격차를 처리하는 것을 요구합니다. 현재 리터거팅 파이프라인은 무리한 팔 움직임을 위해 작동하지만 로봇 학습에 가장 가치있는 미세한 손가락 조작에 실패합니다.
  • **DMP 궤도 **는 포즈 추정을 사용하여 비디오에서 손 궤도를 추출하고 동적 운동 원시들을 그 안에 니다. 이것은 대략적인 도달 움직임을 전송하지만 정확한 포착, 삽입 또는 접촉 동적이 중요한 작업에 실패합니다.
  • ** 비디오 시범을 입력으로 받아들이고 로봇 동작을 생성하는 직접 비디오 컨디션 정책은 제어된 설정에서 간단한 작업에 대한 약속을 보여주었지만 아직 일반 배포에 충분한 견적, 구현 및 물리 격차를 잘 다루지 않습니다.

근본적인 문제는 비디오가 로봇 정책에 필요한 행동 감독 신호가 부족하다는 것입니다. 시각적 표현은 잘 전달됩니다. 왜냐하면 인식은 대부분 구현에 의존하지 않기 때문입니다. 한 잔은 사람이나 로봇이 그것을 바라보는 것과 상관없이 컵처럼 보입니다. 하지만 운동 제어는 구현에 크게 의존하고 있으며, 비디오는 그 격차를 다룰 데 필요한 정보를 포함하지 않습니다.

시각적 예습 전 모델 들 을 비교

다음 표는 2026년 초부터 로봇 정책 초기화에 사용할 수 있는 주요 비디오 사전 훈련된 시각 코더를 비교합니다. 모든 숫자는 출판된 하류 조작 기준을 반영합니다.

Model 사전 학습 Data Backbone 샘플 효율성 Gain Novel Object Improvement Params
R3M Ego4D (egocentric video) ResNet-50 15-40% +12-18% 25M
MVP Ego4D + ImageNet ViT-B/16 20-35% +10-16% 86M
SPA Ego4D + spatial tasks ViT-B/16 25-40% +14-20% 86M
DINOv2 LVD-142M (curated images) ViT-L/14 20-35% +15-25% 300M
SigLIP WebLI (image-text pairs) ViT-L/16 15-30% +12-22% 300M
VC-1 Ego4D + ImageNet + robot video ViT-L/16 25-45% +15-22% 300M
ImageNet ResNet (baseline) ImageNet-1K (classification) ResNet-50 Baseline (0%) Baseline (0%) 25M

주요 연구결과: DINOv2와 VC-1는 2026년에 가장 강력한 전반적인 결과를 제공하지만, 추론 속도 (300M 매개 변수) 에 영향을 미치는 가장 큰 모델이기도 합니다. 추론 지연이 중요할 때 R3M는 여전히 강력한 선택으로 남아 있습니다. CPU에서 실행되는 25M 매개 변수). SPA는 정확한 배치 작업에 중요한 최고의 공간적 추론을 제공합니다. SigLIP는 나중에 VLA 파이프라인에 세밀하게 조정할 계획이라면 유용한 언어 조화를 제공합니다.

선질 조정 가이드: 사전 훈련 된 에코더 에서 로봇 정책

비디오 전 훈련된 코더를 정책 훈련 파이프라인에 통합하려면 얼마나 많은 코더를 얼어붙여야 하는지, 어떻게 행동 예측과 결합해야 하는지, 그리고 학습 속도 일정을 관리해야 하는지에 대한 신중한 결정이 필요합니다.

단계 1: 코더를 선택하세요. 대부분의 테이블탑 조작 작업에 있어서 DINOv2 ViT-B/14 (86M 매개 변수) 는 표현 품질과 추론 속도 사이의 가장 좋은 타협을 제공합니다. 지연 감수 응용 프로그램 (> 20 Hz 제어) 에 R3M ResNet-50 (25M 매개 변수) 를 사용하십시오. VLA 호환 파이프라인에 대해서는 SigLIP를 사용하십시오.

단계 2: 어떤 것을 얼어붙여야 하는지 결정하세요. 가장 보수적인 것부터 가장 보수적인 것까지 세 가지 전략:

  • 모든 코더 계층을 얼어붙이십시오. 미리 훈련된 코더를 고정된 기능 추출기로서 사용하세요. 작업 데이터에 있어서 정책 헤드 (행동 예측 네트워크) 를만 훈련하세요. 100개 이상의 시범이 있을 때 가장 잘 작동합니다. 훈련 시간은: 단일 GPU에서 1-2시간.
  • _ 초기 계층을 얼어붙이고 후기 계층을 정렬한다._ 코더의 첫 75%를 얼어붙이고 (이코더는 일반적인 시각적 특징을 포착한다) 마지막 25%를 정책 헤드와 함께 정렬한다. 이것은 코더가 카메라의 특정 시점과 조명에 적응할 수 있도록 해, 넓은 시각적 지식을 유지하면서도 좋습니다. 100-500 개의 시범을 위해 좋습니다.
  • Fine-tune 모든 것을 낮은 학습률로. 코더에 대한 학습률이 정책 헤드보다 10-100배 낮을 전체 모델을 훈련하십시오 (예를 들어, 코더 LR = 1e-6, 정책 헤드 LR = 1e-4). 이것은 가장 유연하지만 코더를 과잉 부착하지 않도록 300+의 시범이 필요합니다.

** 3 단계: 해상도 불합성을 처리하십시오.** 대부분의 사전 훈련된 코더들은 224x224 또는 384x384 입력값을 기대합니다. 로봇 카메라는 종종 더 높은 해상도 (640x480, 1280x720) 에서 캡처합니다. 엔코더의 예상 해상도에 맞게 입력값을 다시 크게 조정하십시오. 엔코더의 패치 크기와 위치 코딩을 변경하지 마십시오. 이것은 사전 훈련된 정보를 버림합니다. 작업에 있어서 고해상도의 세부사항이 필요하다면 (예를 들어, 패키지에 작은 텍스트를 읽는 것) 여러 작물에서 특징을 추출하는 것을 고려하고, 축소하는 것이 아니라

# Example: Using DINOv2 as a frozen encoder for ACT-style policy
import torch
from transformers import AutoModel, AutoImageProcessor

# Load pre-trained DINOv2
encoder = AutoModel.from_pretrained("facebook/dinov2-base")
processor = AutoImageProcessor.from_pretrained("facebook/dinov2-base")

# Freeze encoder weights
for param in encoder.parameters():
    param.requires_grad = False

# Extract features from a robot camera image
image = camera.capture_rgb()  # (480, 640, 3) numpy array
inputs = processor(images=image, return_tensors="pt")
with torch.no_grad():
    features = encoder(**inputs).last_hidden_state  # (1, 257, 768)
    cls_token = features[:, 0, :]  # (1, 768) -- global image feature

# Feed cls_token + proprioception to your action prediction head
obs = torch.cat([cls_token, joint_state], dim=-1)  # (1, 768+7)
action = policy_head(obs)  # (1, chunk_size, action_dim)

표현 기준: 어떤 작업에 대한 어떤 엔코더가 있습니까?

사전 훈련된 모든 코더가 작업 유형에 걸쳐 동일한 성능을 발휘하지는 않습니다. 출판된 압축과 내부 RCSV 평가에 기초하여, 다음은 작업에 대한 특정 권고 사항입니다.

  • ** 테이블탑 픽 앤 팟 (강한 물체):** DINOv2 ViT-B는 가장 강력한 성능을 제공합니다. 자율 감독 사전 훈련은 직접 조작에 전달되는 객체 수준의 기능을 캡처합니다. 이미지넷 기본보다 18-25% 향상.
  • ** 변형 가능한 객체 조작 (무늬, 식품):** R3M 또는 VC-1는 변형 가능한 작업에서 DINOv2를 능가합니다. 비디오 사전 훈련의 시간적 대조적 목표는 정적 이미지 사전 훈련에서 놓친 객체 역학을 캡처하기 때문입니다. 20-30% 향상.
  • ** 언어 조건 조작:** SigLIP는 사전 훈련된 언어-비전 조율이 시각적 특징에 있어서 정책 기반 언어 지침을 돕는 가장 강력한 전송을 제공합니다. 15-25%의 개선.
  • ** 접촉 풍부한 삽입 작업:** 모든 시각 코더는 최소한의 이익을 제공합니다 (< 10% 향상) 왜냐하면 이러한 작업들은 시각적 기능이 아닌 자기 수용 및 힘 피드백이 지배되기 때문입니다. 더 큰 시각 코더 대신 [force-torque sensor]T6) 데이터를 추가하는 것을 고려하십시오.
  • ** 다중 환경 일반화:** DINOv2 및 VC-1는 다양한 사전 훈련 데이터에 광범위한 시각적 다양성이 포함되어 있기 때문에 가장 큰 OOD 개선 (20-30%) 를 제공합니다. R3M의 이기심적인 비디오 데이터 세트는 좁고 환경 변화에 대해 덜 잘 전달됩니다.

데이터 파이프라인 통합: 비디오 엔코더에서 정책 교육

기존의 모방 학습 파이프라인에 비디오 사전 훈련된 코더를 통합하려면 특정 데이터 처리 및 훈련 변경이 필요합니다. 여기는 엔드-투-엔드 파이프라인 구성입니다.

# video_encoder_pipeline.py -- Integrate pre-trained encoder into IL training
import torch
from torchvision import transforms

class VideoPretrainedPipeline:
    """Pipeline for using video-pretrained encoders in IL training."""

    def __init__(self, encoder_name="dinov2_vitb14", freeze=True):
        self.encoder = torch.hub.load('facebookresearch/dinov2', encoder_name)
        self.freeze = freeze
        if freeze:
            for param in self.encoder.parameters():
                param.requires_grad = False

        # Normalization must match pre-training distribution
        self.transform = transforms.Compose([
            transforms.Resize(224),
            transforms.CenterCrop(224),
            transforms.Normalize(
                mean=[0.485, 0.456, 0.406],
                std=[0.229, 0.224, 0.225]),
        ])

    def extract_features(self, image_tensor):
        """Extract features from a single camera image.
        Args: image_tensor: (B, 3, H, W) in [0, 1]
        Returns: (B, 768) feature vector for ViT-B
        """
        x = self.transform(image_tensor)
        with torch.no_grad() if self.freeze else torch.enable_grad():
            features = self.encoder(x)  # CLS token: (B, 768)
        return features

    def build_observation(self, image, proprioception):
        """Combine visual and proprioceptive features.
        Args:
            image: (B, 3, H, W) camera image
            proprioception: (B, D) joint angles, gripper state
        Returns: (B, 768 + D) combined observation
        """
        vis_features = self.extract_features(image)
        return torch.cat([vis_features, proprioception], dim=-1)

비평적인 구현 세부 사항: 정상화 매개 변수 (평균, std) 는 코더의 사전 훈련 중에 사용된 값과 정확히 일치해야 한다. 잘못된 정상화 사용은 코더가 배포되지 않은 입력값을 수신하기 때문에 성능을 10-30%로 떨어뜨린다. DINOv2와 R3M 모두 ImageNet 정상화 값을 사용합니다. SigLIP는 다른 정상화를 사용합니다. 통합하기 전에 모델 카드를 확인합니다.

멀티 카메라 설정에서는 카메라 뷰당 한 개의 코더를 인스턴티 (instantiate) 하거나 뷰 (weight sharing) 에서 하나의 코더를 공유한다. 뷰 (weight sharing) 에서 뷰 (weight sharing) 를 공유하는 것이 좋습니다. 뷰 (GPU) 를 최대한 활용하기 위해 팩트 앞 패스를 사용하여 카메라를 병렬로 처리합니다.

주목할 만한 문서 와 체계

비디오 기반 로봇 학습을 기반으로 하는 팀들을 위해 2026년 초에 다음과 같은 주요 참조들이 있습니다.

  • R3M (Meta, 2022): 로봇 조작 표현을 위한 이기심적인 비디오 사전 훈련. 시각적 사전 훈련에 대한 기본 라인.
  • MVP (2022): 비디오 및 이미지 데이터를 결합한 마스크된 시각 사전 훈련. 다른 훈련 방법론으로 R3M에 강력한 대안.
  • SuSIE (2023): 로봇 조작의 하위 목표 계획으로서 비디오 생성. 비디오 예측 모델이 로봇 행동을 어떻게 안내할 수 있는지 보여줍니다.
  • UniSim (2023): 비디오에서 학습된 보편적 시뮬레이터. 비디오 훈련된 세계 모델이 모델 예측 제어 기능을 지원할 수 있음을 보여줍니다.
  • RT-2 (Google DeepMind, 2023): 로봇 동작을 위해 정비된 시각 언어 모델. 현재 연구를 지배하는 VLA 패러다임을 구축했다.
  • GR-2 (ByteDance, 2024): 로봇 정책 학습을 위해 적응된 비디오 생성 모델, 더 큰 규모로 SuSIE 접근 방식을 확장합니다.
  • Octo (2024): 비디오 전력으로 훈련된 시각 척추를 가진 오픈소스 일반주의 로봇 정책. VLA 아키텍처를 구축하려는 팀의 실용적인 출발점.

현재 제한: 비디오 는 로봇 에게 무엇 을 가르칠 수 없는 것 입니까?

비디오 기반 학습의 어려운 한계를 이해하는 것은 팀들이 그들의 특정 작업에 효과가 없을 접근방식에 과도하게 투자하는 것을 방지합니다.

  • ** 힘 조절.** 비디오는 잡기 힘, 삽입 힘, 또는 접촉 압력에 대한 정보를 제공하지 않습니다. 인간으로 물을 에서 쏟아내는 것은 무게 변화, 손목 모크럼 및 액체 흐름 동력에 따라 잡기 힘을 조정합니다. 이 중 어느 것도 비디오에서 복구 할 수 없습니다. 힘 민감한 작업 정책은 [힘 모크럼 감지] (T7) 로 로봇이 내재한 시범을 필요로합니다.
  • 프로피오시프티브 피드백 루프. 인간들은 초기 시각 가이드 후 눈을 감고 많은 조작 작업을 수행합니다. 운동 제어는 프로피오시프티브입니다. 비디오는 비주얼 결과만을 캡처합니다. 프로피오시프티브 제어 루프는 아닙니다. 관절 토크 피드백, 촉각 접촉 감지, 또는 운동 기억 (눈먼 삽입, 목표 토크에 스크류를 단단히 붙이는) 에 의존하는 작업은 비디오 사전 훈련에서 아무런 이익을 얻지 못합니다.
  • ** 시간 및 속도 프로파일.** 비디오 프레임 속도는 (일반적으로 24-30fps) 빠른 조작 작업의 시간적 역학을 과시합니다. 0.8 초 동안 빠른 픽 앤 플레이 사이클은 30fps에서 20-24 프레임에 불과합니다.
  • 중동 조정 시기는. 중동 작업 에서 왼쪽과 오른쪽 팔의 조정 시기는 매우 중요하며 비디오에서 복구할 수 없습니다. 비디오에서 두 팔이 동시에 움직인 것처럼 보일 수 있지만 실제 모터 명령어에서 충돌을 피하거나 적절한 순서화를 달성하기 위해 50-100ms 시간적 오프셋이 필요합니다.

비디오 사전 훈련 시행 체크리스트

비디오 사전 훈련을 자신의 파이프라인에 통합할 준비가 된 팀들을 위해, 이 실용적인 체크리스트를 따르십시오.

  1. ** 작업 유형에 따라 코더를 선택하세요** ( 위의 표현 기준을 참조하십시오). 기본 추천: 일반 조작을 위해 DINOv2 ViT-B; 지연 민감한 응용 프로그램에서 R3M.
  2. ** 미리 훈련된 무게를 다운로드 합니다.** 모든 권장 코더는 Hugging Face: T2, T3 또는 원래의 종이 저장소에서 사용할 수 있습니다.
  3. ** 입력 해상도를 일치시켜주기.** 로봇 카메라 이미지를 크기를 조정하여 엔코더의 예상 입력과 일치하도록 한다 (224x224 대부분의 ViT 모델, 224x224 R3M ResNet).
  4. ** 벤치마크 얼음 대 정렬된 코더.** 얼음 코더 (최고, 가장 안전한) 를 시작하십시오. 50개 이상의 디모를 통해 성능이 충분하지 않으면 마지막 25%의 부분 정렬로 전환하십시오.
  5. ** 모니터 기능 품질.** 로봇 카메라 이미지에서 코더의 관심지도 (ViT) 또는 활성화지도 (ResNet) 를 시각화하십시오. 코더가 작업에 관련된 객체보다는 배경에 주로 관심을 기울이면 유용한 기능이 제공되지 않으며 다른 사전 훈련 소스 또는 더 공격적인 미세조정이 필요할 수 있습니다.
  6. ** 제어된 압축을 실행하세요.** 보다 복잡한 파이프라인에 참여하기 전에 특정 작업에 대한 실제 이익을 수치화하기 위해 항상 ImageNet 기본 라인과 비교하십시오.

데이터 수집 팀 들 에게 실용적 인 영향

2026년 현장의 상황을 고려하면, 데이터 수집 결정을 하는 팀들에 대한 연구 결과는 다음과 같습니다.

** 비디오 사전 훈련된 시각 코더를 사용하세요.** R3M, SPA, MVP 또는 이미지넷 무게보다는 비디오 사전 훈련된 비전 트랜스포머로 정책의 시각 척추를 초기화하십시오. 이것은 추가 데이터 수집이 필요하지 않은 무료 15-30% 샘플 효율성 향상입니다. 모든 팀이 이것을 수행해야합니다.

행동 학습을 위한 로봇 네이티브 시범을 수집할 수 있습니다. 비디오는 시각적 표현을 제공합니다. 로봇 텔레오페라션은 액션 레이블 된 훈련 데이터를 제공합니다. 이것들은 대체가 아니라 보완적입니다. 고품질의 텔레오페라 데이터 수집에 투자하고 비디오 재교육된 코더를 사용하는 팀은 두 가지 접근 방식을 전적으로 의존하는 팀을 능가합니다.

** 비디오 사전 훈련과 데이터 증강을 결합하십시오.** 비디오 사전 훈련 코더와 데이터 증강은 대체가 아니라 보완적입니다. 비디오 사전 훈련은 일반적인 시각적 표현을 제공합니다. 데이터 증강은 특정 배포 변동에 대한 견고한 표현을 만듭니다. 비디오 사전 훈련 코더를 사용할 때에도 색상의 진동, 무작위 작식 및 밝기 증강을 적용하십시오. RCSV 압축에서, DINOv2 사전 훈련과 표준 증강의 조합은 증강 없이 이미지넷 기본보다 OOD 성공률을 25-35% 향상시킵니다. 이 두 가지 기술이 제공하는 것보다 더 많은 것입니다. 각각 15-20%.

** 데이터 수집에서 언어 지침을 사용하십시오.** VLA 패러다임은 언어 조건적 행동에 의존합니다. 관련된 자연어 지침 ("붉은 잔을 뽑아, "홀에 볼트를 넣") 을 가진 시범을 수집하면, 데이터는 비디오 훈련된 언어-비जुअल 조화를 활용하는 VLA 정렬 파이프라인과 직접 호환됩니다. 언어 표지판이 없는 시위를 수집하면 이 연결이 사라집니다.

** 영역별 비디오 큐레이션을 고려하세요.** 목표 작업 영역이 풍부한 비디오가 있다면 - 요리, 포장, 전자 집합과 같은 - 시각 큐레이터를 미리 훈련시키기 위해 영역별 비디오 데이터 세트를 큐레이트하는 것은 일반적인 사전 훈련을 능가 할 수 있습니다. 요리 비디오에서 배운 시각적 특징은 일반 인터넷 비디오에서 배운 특징보다 부엌 조작 작업에 더 중요합니다.

** 사전 계산 및 캐시 코더 기능.** 1,000 에피소드 이하의 데이터 세트에서 각 프레임에 대한 시각 코더 기능을 미리 계산하고 원료 이미지와 함께 저장하십시오. 이것은 훈련 중에 코더를 전진시키는 것을 제거합니다 (냉장고 코더에 대한 훈련 시간의 50-80%를 절약합니다) 그리고 시각 코더를 다시 실행하지 않고 액션 예측 아키텍처에 대한 빠른 반복을 허용합니다. 캐시 파일은 일반적으로 ViT-B 기능에 대해 에피소드당 10-50 MB (768 차원 한 프레임 30 fps 30 초) 이다.

** 비디오 전용 훈련이 작동하기를 기다리지 마십시오.** 비디오 전용 및 비디오 더로봇 데이터 접근 방식 사이의 격차는 여전히 크다. 비디오 전용 방법의 성숙기를 기다리는 데이터 수집을 지연시키는 팀은 전략적 실수를 하고 있습니다. 실제 로봇 데이터를 지금 수집하고, 비디오 전용 훈련을 사용하여 그 가치를 증폭시키고, 비디오 기반의 더 나은 방법을 사용할 수 있게 함으로써 통합합니다.

실용적 인 평가: 비디오 훈련 전 이득 을 측정 하는 방법

비디오 사전 훈련을 채택하는 팀은 그 영향력을 도움이 된다고 가정하기보다는 엄격하게 측정해야 합니다.

  • ** 제어 된 추축:** 작업 데이터에 동일한 두 가지 정책 구조를 훈련하십시오. 하나는 비디오 사전 훈련된 시각 척추 (R3M, SPA, 또는 DINOv2), 하나는 이미지넷 사전 훈련된 척추입니다. 동일한 수행된 테스트 세트에 평가하십시오. 성공률의 차이점은 특정 작업에 대한 비디오 사전 훈련의 특성상의 이익입니다.
  • ** 샘플 효율력 곡선:** 양 변수를 훈련 데이터의 25%, 50%, 75%, 그리고 100%에 훈련시켜라. 각 데이터 분자에 대한 성공률과 데이터 분자에 대한 성공률을 일괄적으로 훈련시켜라. 비디오 사전 훈련은 데이터 분자 (25-50%) 보다 낮은 경우 100%에 비해 더 큰 장점을 보여야 한다.
  • OOD 평가: 두 가지 변수를 모두 유지된 객체와 환경에서 테스트합니다. 비디오 사전 훈련된 코더는 일반적으로 분포된 객체보다 분포되지 않은 평가 (15-30% 향상) 에서 가장 큰 장점을 나타냅니다.

발표된 및 RCSV 내부 평가에 기초한 예상된 결과: 100-300 개의 시범과 함께 테이블탑 조작 작업에 있어서 비디오 사전 훈련은 샘플 효율성 향상을 15-25% (이러한 성능을 달성하기 위해 15-25% 더 적은 시범이 필요하다는 것을 의미합니다) 및 신규 객체 일반화에 대한 절대적인 향상을 10-20% 제공합니다. 풍부한 데이터 (1,000+개 시범) 과목에서는 개선이 5-10%로 줄어들게 됩니다.

인체적 격차: 비디오 액션 이 직접 전송 되지 않는 이유

실시예 격차는 인터넷 비디오로부터 직접적인 정책 학습이 실현되지 않은 근본적인 이유입니다. 그 구체적인 차원을 이해하는 것은 기술적으로 가능하고 그렇지 않은 것을 명확히합니다.

  • 영화적 불합리.** 인간 팔은 7개의 주요 DOF ( 어깨 3, 팔꿈치 1, 손목 3) 과 27개의 DOF를 손에 가지고 있다. 전형적인 로봇 팔은 1DOF 평행 턱잡이를 가진 6-7개의 DOF를 가지고 있다. 인간과 로봇이 수행하는 동일한 작업은 운동 구조가 다르기 때문에 근본적으로 다른 관절 궤도를 사용합니다. 완벽한 인간 손 추적은 로봇이 수행할 수 있는 궤도를 생성하지 않는다.

** 치 전략 부합.** 인간 은 손가락 끝 치, 힘 치, 치, 그리고 수십 가지 다른 손 구성 을 상호 교환 하게 사용 한다. 병렬 턱 치 는 정확히 한 가지 치 모드를 가지고 있다. 턱 을 닫는다. 인간의 치 를 병렬 턱 치 로 옮기는 데는 새로운 치 전략을 발명 하는 것 이 필요 합니다. 단지 관절 각 을 다시 표적 하는 것 이 아닙니다.

  • 힘과 준수 불합리.** 인간 조작은 피부와 근육 조직의 자연적 일치에 크게 의존하고, 이는 수동적 인 힘 적응을 제공한다. 로봇 지갑은 딱딱하다 (또는 제한적 인 엔지니어링 준수) 인간 은 부드러운 압축으로 종이 컵을 들고 컵의 준수에 자동으로 조정한다. 로봇은 동일한 효과를 얻기 위해 명시적인 힘 제어가 필요합니다. 그리고 비디오 데이터의 양은 로봇에게 자신의 힘 동력에 대해 가르치지 않습니다.

** 규모의 의미.** 이러한 불합리는 비디오가 유용한 시각적 표현 지식을 제공한다는 것을 의미합니다 (물질이 어떻게 생겼는지, 어디에 있는지, 어떤 용량을 가지고 있는지) 하지만 유용한 운동 제어 지식을 제공하지 않습니다 (관절을 어떻게 움직여야 하는지, 얼마나 많은 힘을 적용해야 하는지, 시간을 조정하는 방법을). 로봇 학습에 대한 비디오의 기여에 대한 실질적인 천장은 이 분할에 의해 설정됩니다: 비디오는 조작의 "무엇"과 "어디"에 도움이되지만 "어떻게"에 도움이되지 않습니다.

로봇 학습을 위한 멀티 카메라 비디오 퓨전

2026년 연구의 증가하는 영역은 로봇 학습을 향상시키기 위해 여러 비디오 관점을 동시에 사용하고 있습니다. 대부분의 비디오 사전 훈련은 단일 관점 데이터를 사용하지만, 실제로 로봇은 여러 카메라 (목목, 상부, 측면) 를 가지고 있습니다. 도전은 이러한 관점들을 통해 표현을 조정하는 것입니다. 따라서 사전 훈련된 기능은 카메라 배치에 관계없이 유용하게 유지됩니다.

** 크로스뷰 대조 학습**은 코더를 동일한 장면의 다양한 카메라 조회에 대해 유사한 임베디션을 생성하도록 훈련시킵니다. 이것은 비디오 사전 훈련과 결합되면 특히 효과적입니다. 일반 시각 기능에 대한 단일 조회 인터넷 비디오에서 사전 훈련, 그리고 멀티 카메라 로봇 데이터에 대한 크로스뷰 대조적 목표와 미세 조정. 그 결과, 인터넷 규모의 시각적 지식을 전송하는 시각적 코더가 됩니다. 동시에 로봇의 특정 카메라 배열에 안정적으로 적용됩니다.

Camera Configuration Typical Resolution Frame Rate Primary Use for Policy Video 사전 학습 Benefit
Overhead (third-person) 640x480 30 fps Spatial layout, object positions High (matches internet video perspectives)
Wrist-mounted (eye-in-hand) 640x480 30 fps Grasp precision, contact detection Moderate (egocentric video data helps)
Side-angle (45-degree) 640x480 30 fps Depth disambiguation, approach angle High (common in cooking/tutorial videos)
Depth camera (RealSense) 640x480 + depth 30 fps 3D geometry, height estimation Low (no depth in internet video)

실용적인 지침: 비디오 전용 앵코더 (최고의 혜택) 를 사용하여 상장 카메라를 사용하고, 손목 카메라를 별도의, 더 작은 앵코더 또는 동일한 앵코더의 정밀 조정된 버전으로 처리하고, 결과물 특징 벡터를 정책 헤드 전에 연결하십시오. 이 쌍용 앵코더 접근법은 최소 지연 시간을 추가합니다 (평행 앞으로 통과) 카메라 시각에서 비디오 사전 훈련의 이익을 극대화하는 동시에 가장 도움이 됩니다.

도메인별 비디오 큐레이션: 단계별 프로토콜

배포 영역이 풍부한 인터넷 비디오 (음식, 포장, 전자 장치 집합, 실험실 작업) 를 가진 팀들에서는 코더 사전 훈련을 위해 영역별 비디오 데이터 세트를 큐레이션하면 일반 모델을 10-15% 더 능가 할 수 있습니다. 여기 RCSV가 영역별 비디오 큐레이션에 사용하는 프로토콜입니다.

  1. ** 작업에 관련된 비디오 범주를 정의하십시오.** 부엌 조작 배포에 있어서, 관련 범주로는: 요리 교과서, 음식 준비, 부엌 청소, 그릇 씻기기 기계 로딩, 식료품 풀기 등이 있습니다. 구체적으로 말씀드리자면 "음식"은 너무 넓습니다. "단판에 채소를 잘라내는 것"은 올바른 미분성입니다.
  2. ** 유튜브, Ego4D 및 도메인 특정 플랫폼에서 비디오 소스를 다운로드하십시오.** 관련 재생 목록을 다운로드하기 위해 yt-dlp를 사용하십시오 (허락 준수 보장). Ego4D에 대해서는 활동 레이블에 따라 필터링하십시오. 도메인 특정 비디오의 500~2,000시간을 목표로합니다. 사전 훈련에 더 많은 것이 좋습니다. 그러나 대부분의 도메인에서 2,000 시간 동안 설정 된 수익률이 감소합니다.
    • 조작 관련 세그먼트를 위한 필터.** 요리 비디오의 모든 프레임에는 조작이 표시되지 않는다. 수면으로 만든 손 탐지 모델을 (MediaPipe Hands 또는 정비된 YOLO) 사용하여 손이 눈에 띄고 물체와 접촉하는 세그먼트를만 추출한다. 이것은 일반적으로 조작 관련 시각적 콘텐츠를 집중시키면서 전체 영상을 60-70% 감소시킨다.
  3. ** 시간-대립 학습을 이용한 사전 훈련.** 시간-대립 + 언어 조화를 위한 R3M 교육목적을 코어된 도메인 비디오에 사용하십시오. 4x A100 GPU에서 훈련은 1,000 시간 비디오에 대한 ResNet-50 척추에 24-72시간을 걸립니다. ViT-B에 대한 예산은 48-96시간입니다.
  4. ** 일반 코더에 비해 평가한다.** 목표 작업에서 50 개의 로봇 시범을 가진 작은 세트에서 DINOv2 및 R3M에 대한 도메인 특수한 코더를 비교하십시오. 도메인 특수한 사전 훈련이 적어도 5% 이상의 성공률을 향상시키지 않으면, 일반 코더는 충분하고 유지보수가 더 쉽습니다.

RCSV 내부 평가에서 예상된 결과: 800 시간 동안 요리 비디오에 대한 영역별 사전 훈련은 일반 R3M와 비교하여 28%로 부엌 조작 정책 샘플 효율성을 향상시켰으며, DINOv2와 비교하여 12%로 향상되었습니다. 새로운 객체 범주 (로봇 훈련 세트에 포함되지 않은 음식물) 에서 가장 큰 개선이 이루어졌으며, 이는 특정 영역에 대한 비디오가 특히 강력한 객체 제공 지식을 제공하는 것을 시사합니다.

실시간 배포에 대한 늦체 고려 사항

비디오 사전 훈련된 코더는 추론 속도에서 크게 차이가 있으며, 이는 실시간 로봇 제어에 중요합니다. 10 Hz에서 실행되는 정책은 제어 주기에 100ms를 가지고 있습니다. 시각 코더는 행동 예측 및 통신 오버헤드에 시간을 남겨두고 이 예산 내에서 앞으로 통과해야합니다.

엔코더 Params RTX 4090 (ms) Jetson Orin (ms) CPU Only (ms) Max Control Freq
R3M (ResNet-50) 25M 3-5 8-12 25-40 25+ Hz (all platforms)
DINOv2 ViT-B/14 86M 6-10 18-25 60-90 15+ Hz (GPU required)
DINOv2 ViT-L/14 300M 15-22 40-60 180-250 10 Hz (desktop GPU only)
SigLIP ViT-L/16 300M 14-20 38-55 170-240 10 Hz (desktop GPU only)
VC-1 ViT-L/16 300M 15-22 42-58 185-260 10 Hz (desktop GPU only)

핵심 통찰력: R3M는 Jetson Orin에서 20Hz 이상으로 실행할 수 있는 유일한 코더이며, 데스크톱 GPU 없이 가장자리에 배치된 로봇을 위한 실질적인 선택이 된다. 배포 하드웨어는 RTX 4090 또는 이에 준하는 하드웨어를 포함한다면, DINOv2 ViT-B는 최고의 품질 속도 트레이드오프를 제공합니다. ViT-L 모델 (DINOv2-L, SigLIP-L, VC-1) 은 일반적으로 데스크톱 GPU 이외의 다른 모든 데스크톱 GPU에 실시간 제어하기 위해 느리거나 오프라인 평가 또는 대량 처리에 더 적합합니다.

가장자리 추론 속도에서 큰 코더의 품질을 필요로 하는 팀들에서는 ** 지식 디스틸레이션**이 실행 가능한 길입니다. 작은 학생 코더 (ResNet-50 또는 ViT-S) 를 훈련시켜 큰 교사의 (DINOv2 ViT-L) 출력을 로봇 카메라 데이터에 맞추도록 훈련하십시오. 이것은 추론 속도에서 3-5배로 큰 모델의 표현 품질의 70-85%의 컴팩트 코더를 생성합니다. 디스틸레이션 과정에는 로봇 카메라 데이터 세트가 필요합니다. (최저 1000개 이상의 프레임) 그리고 4~8시간의 GPU 훈련이 필요합니다.

시간대 표현 학습: 프레임 레벨 vs 클립 레벨 기능

비디오 사전 훈련된 코더를 사용하는 중요한 건축적 결정은 개별 프레임 또는 짧은 비디오 클립에서 기능을 추출하는 것이 있습니다. 이 선택은 성능과 컴퓨팅 비용 모두에 중요한 영향을 미칩니다.

** 프레임 레벨 기능**은 각 카메라 이미지를 코더를 통해 독립적으로 처리합니다. 이것은 가장 간단한 통합입니다. 정책은 현재 프레임에서 특징 벡터를 수신합니다. (선택적으로 이전 1-3 프레임은 짧은 역사로). 2026 년 대부분의 배포 된 시스템은 모든 이미지 코더와 호환되기 때문에 프레임 레벨 기능을 사용합니다. 그리고 시간 계산 대비를 추가하지 않습니다. R3M, DINOv2 및 SigLIP 모두 프레임 레벨 기능을 생산합니다.

** 클립 레벨 기능**는 시간적 역학을 캡처하는 비디오 코더를 통해 짧은 프레임 순서 (일반적으로 4-16 프레임 5-15 fps) 를 처리합니다. VideoMAE, TimeSformer, Hiera 같은 모델은 물체가 움직이는 방향, 조작 동작의 단계 또는 접촉에 대한 접근 속도와 같은 동작 정보를 코딩하는 기능을 생성합니다. 클립 레벨 기능은 특히 역동적인 상호작용을 포함하는 작업에 유용합니다. 던진 물체를 잡거나, 움직이는 천을 접거나 접근 궤도가 중요한 곳에 연결기를 삽입합니다.

트레이드 오프스는 구체적입니다. 클립 레벨 앵코더는 1 퍼스트 패스당 4-16배 더 많은 계산을 필요로 합니다. 이는 최대 제어 주파수를 감소시킵니다. RTX 4090에서 8 프레임을 처리하는 ViT-B 비디오 앵코더는 40-60ms를 걸립니다. 제어량은 15 Hz로 제한됩니다. 프레임 레벨 DINOv2 ViT-B는 동일한 하드웨어에서 6-10ms를 소요하며, 50+ Hz 제어 기능을 제공하여 액션 예측을 할 수 있습니다.

** 실용적인 권고:** 프레임 레벨 기능들을 기본으로 사용하세요. 작업이 객체의 속도와 궤도가 결정적으로 중요한 동적 물체 운동에 관한 경우에만 클립 레벨 기능으로 전환하세요. 대부분의 테이블 조작에 있어서 - 선택 장소, 삽입, 겹치기 - 3 프레임 프로피오시셉티브 역사와 프레임 레벨 기능들은 충분한 시간적 맥락을 제공합니다.

전송 학습 전략: 냉동과 정렬된 코더

비디오 전 훈련 된 코더를 선택 한 후에는 정책 훈련 중에 코더 무게를 얼어붙이거나 로봇 데이터에 미세하게 조정하도록 결정해야 합니다. 두 가지 접근 방식 모두 뛰어난 정리가 있습니다.

Strategy Robot Demos Training Time In-Distribution OOD 일반화 Best When
Fully frozen encoder 50-200 1-2 hours 75-85% 60-75% Limited data, need fast iteration
Frozen + linear probe, then unfreeze last 2 layers 100-300 4-8 hours 82-90% 65-80% Moderate data, balanced in-dist/OOD
Full fine-tuning (low LR) 300-1000 12-48 hours 88-95% 55-70% Abundant data, maximum in-dist performance
LoRA fine-tuning (rank 4-16) 100-500 3-6 hours 84-92% 62-78% Good in-dist with OOD preservation

RCSV 평가에서 얻은 핵심 통찰력: 로봇 데이터 제한이 있을 때 얼어붙은 코더에 비해 완전한 미세조정은 종종 OOD 일반화를 훼손합니다 (<200 데모). 코더는 훈련 카메라 관점과 객체 인스턴스에 과도하게 오프셋하여 비디오 사전 훈련에서 얻은 광범위한 시각적 이해를 잃습니다. 4-16 순위와 LoRA 미세 조정은 대부분의 실용적인 시나리오에 가장 좋은 균형을 제공합니다. 그것은 일반적인 시각적 표현을 재앙적으로 잊지 않고 로봇에 특화된 시각적 특징에 코더를 조정합니다.

** 2 단계 훈련 프로토콜:** 200개 이상의 시범을 가진 팀들에 대해 2 단계 접근법을 사용하십시오. 1단계: 강력한 행동 예측 기본을 설정하기 위해 100개의 시대 동안 얼어붙은 코딩코더로 정책 수반을 훈련하십시오. 2단계: 마지막 2-4개의 코딩 계층을 해제하고 50~100개의 시대 동안 10배 더 낮은 학습률을 가지고 훈련을 계속하십시오. 이 프로토콜은 사전 훈련된 특징을 손상시키는 것을 방지하고 동시에 작업에 대한 적응을 허용합니다. 이 프로토콜은 RCSV 기준에서 완전히 얼어붙은 및 완전히 정비된 접근 방식을 3-8%로 지속적으로 우월합니다.

인코더를 벤치마크 하는 것: 실용적인 평가 프로토콜

생산 파이프라인에 대한 특정 코더에 대한 약속을 하기 전에, 데이터 기반의 결정을 내리기 위해 이러한 구조화된 평가를 실행하십시오.

  1. ** 캘리브레이션 데이터 세트를 수집.** 5개의 어 있는 객체 인스턴스 (훈련에서 사용되지 않았다) 로 목표 작업의 50개의 시범을 수행합니다. 이것은 나쁜 코더 선택을 방지함으로써 스스로 보상되는 일회적인 비용입니다.
  2. 3개의 코더 후보를 실행하세요. 동일한 정책 구조 ( 같은 액션 헤드, 동일한 하이퍼파라미터) 를 세 가지 코더 변종으로 훈련하세요: (a) ImageNet ResNet-50 (기본선), (b) R3M ResNet-50, (c) DINOv2 ViT-B. 분포 성공률 (20개 시험) 및 OOD 성공률을 측정합니다.
  3. 컴퓨터 표현 품질 측정값. 100개의 훈련 이미지와 계산에 대한 코더 기능을 추출 (a) 기능 변동 (더 높은 = 더 정보적), (b) 객체 정체성 (더 높은 = 더 나은 객체 이해) 위해 가장 가까운 이웃 검색 정확성, (c) 작업 관련 속성 ( 객체 위치, 지갑 상태) 위해 선형 탐사 정확성.
  4. ** 추론 지연을 측정하십시오.** 배치를 위한 하드웨어 (훈련 GPU가 아닌) 를 배치를 위한 더로 전달하는 시간을 측정합니다.
  5. ** 결정하세요.** 비디오 전실 훈련된 엔코더 (R3M 또는 DINOv2) 는 OOD 평가에서 적어도 5% 이상 ImageNet 기본선을 이겨내지 못한다면, 보다 간단한 ImageNet 엔코더는 배포의 단순성을 위해 바람직할 수 있습니다.

새로운 방식: 세계적 모델 로 된 비디오

로봇 학습에서 비디오의 가장 미래 지향적인 사용은 표현 전 훈련에서 세계 모델링까지 넘어갑니다. 인터넷 규모 데이터에 훈련된 비디오 예측 모델은 시각 세계가 시간이 지남에 따라 어떻게 진화하는지 생성 모델을 학습합니다. 행동 (또는 언어적 설명) 에 따라 조건화되면, 이러한 모델들은 다음으로 일어날 일을 예측할 수 있습니다. 효과적으로 학습된 물리 시뮬레이터를 제공합니다.

2026년에 로봇 학습에 대한 구체적인 응용은 세 가지입니다.

  • ** 데이터 증강:** 실제 데이터에 존재하지 않는 객체 구성에 대한 유의미한 시각 궤도를 합성하기 위해 비디오 생성 모델을 사용하십시오. 생성된 궤도는 정확한 행동 레이블을 제공하지는 않지만 훈련 데이터의 시각 다양성을 증강시킬 수 있습니다. 초기 실험은 비디오 생성 증강에서 5-10%의 일반화 개선을 보여줍니다.
  • ** 계획:** 모델 예측 제어에서 비디오 예측 모델을 앞모델로 사용하십시오. 후보 행동 순서들을 위해 예측된 시각적 미래를 생성하고 목표 이미지 또는 언어 설명에 따라 점수를 제공합니다. 이것은 명시적인 물리 모델이없는 계획을 가능하게합니다. 비록 현재 비디오 예측 모델은 빠른 작업에 대한 실시간 MPC에 너무 느리지만 (예측당 초)
  • 상상 학습: RL에 대한 보상 신호로서 비디오 예측 품질을 사용하십시오. 로봇의 행동이 비디오 예측 모델이 높은 확률을 부여하는 관찰을 생성하면, 행동은 물리적으로 유연할 수 있습니다. 이것은 비디오 모델에 내장된 "물리학 직관"에서 파생된 밀집한 보상 신호를 제공합니다.

소라 및 비디오 생성 모델. 대규모 비디오 생성 모델 (OpenAI Sora, Runway Gen-3, Google Veo) 은 텍스트 설명에서 물리적으로 유연한 조작 순서를 생성 할 수 있습니다. 생성 된 비디오는 액션 레이블 추출에 대한 정확도가 충분하지 않지만 시각 엔코더에 대한 추가 사전 훈련 데이터로 사용될 수 있습니다. RCSV에서 실시된 예비 실험은 실제 로봇 비디오와 소라에서 생성된 조작 비디오의 혼합에 DINOv2를 정렬하는 것이 하류 정책 평가에서 시각적 표현 품질을 3-7%로 향상시킨다는 것을 보여줍니다. 아마도 생성된 비디오는 사전 훈련 데이터에서 객체 외모와 상호 작용 유형의 다양성을 증가시키기 때문입니다.

이러한 접근법은 2026년에 연구 단계에 이르고 생산에 준비가 되지 않습니다. 하지만 그들은 현장의 방향을 나타내고 있으며, 오늘날 데이터 인프라를 구축하는 팀은 미래 지향적인 설계 기준으로 비디오 컨디션 모델과 호환성을 고려해야 합니다.

두 가지 방법 에서 가장 좋은 방법 을 사용 하십시오

RCSV의 [데이터 수집 서비스] (T9) 및 [데이터 플랫폼] (T10) 는 연구에서 지원하는 하이브리드 접근 방식을 중심으로 구축되어 있습니다. 우리의 수집 파이프라인은 Octo, OpenVLA 및 RT-2형 모델을 포함한 주요 VLA 아키텍처와 호환되는 형식으로 데이터를 수출하고 있으며, 기본으로 언어 명령어 레이블이 포함되어 있습니다.

로봇 학습 프로젝트를 시작하고 처음부터 샘플 효율성을 극대화하고 싶다면, 비디오 사전 훈련을 실제 데이터 수집과 결합하는 단계별 접근을 위해 [이미레이션 학습 가이드] (T11) 를 살펴보십시오.

관련 독서

  • [오픈 엑스 인체: 모든 것을 변화시킨 로봇 데이터 세트]
  • [로봇의 모방 학습: 시범 시범부터 배포까지]
  • [로봇 학습의 확장 법칙: 우리가 2026년에 알고 있는 것]
  • [행동과 방전 정책: 언제 어떤 것을 사용해야 하는가]
  • [로봇 정책 일반화: 왜 로봇이 새로운 객체에서 실패하는 지]
  • [RCSV 데이터 수집 서비스]

비디오 사전 훈련 과 고품질의 시연 을 결합 하십시오

RCSV의 플랫폼은 최고 샘플 효율을 위해 고품질의 텔레오퍼레이션 데이터로 비디오 전 훈련된 코더를 지원합니다.

[이미레이션 학습 가이드 를 읽어 보십시오.]