로봇 시간 팩트리: 왜 시간적 조정은 로봇 학습의 숨겨진 병목이 되는가
카메라, 관절 상태 및 모터 명령 사이의 시간적 오차는 구조화된 레이블 소음으로 로봇 시범을 손상시킵니다. RCSV의 하드웨어 동기화된 데이터 인프라는 데이터 요구 사항을 2-3x로 감소시킵니다.
[← 연구]
로봇 학습 커뮤니티는 시범을 확장하고 있습니다. 하지만 대부분의 데이터는 일시적으로 오염되어 있습니다.
1
시간적 오차 = ** 2
문제: 구조화된 레이블 소음으로 시간적 오차
행동 복제에서, 각 훈련 샘플은 _t_에 대한 관찰과 _t_에 대한 행동과 결합된 쌍 (ot, at)
이것은 무작위적인 소음이 아닙니다. 그것은 시스템의 물리적 상태에 상관관계가 있는 ** 구조화된 레이블 소음**입니다. 시간적 오차의 크기는 최종 효과자 속도와 함께 증가하고, 접촉 전환에 따라 변화하며, 제어 주파수와 따라 달라지며, 카메라 노출 시간에 따라 달라집니다. 정책 학습에 가장 중요한 정확한 순간들 중에
계산은 간단하다. 30fps에서 한 프레임 오프셋은 33 ms이다. 0.5m/s로 움직이는 로봇 팔은 프레임당 16.5mm를 이동시킨다. 정밀 조작 작업에 있어서
연구 커뮤니티에서 널리 사용되는 시스템들, ALOHA, UMI, 표준 USB 카메라 설정을 포함한 시스템은 카메라 프레임과 공동 상태 리드백 사이에 20
왜 소프트웨어 타임스테이플이 수정 되지 않는지
본능적인 반응은 모든 것을 시간표로 표시하는 것입니다. 대부분의 수집 코드베이스는 각 센서 읽기에서
호스트 측 시간표는 물리적 사건이 발생했을 때 아니라 운영 체제가 데이터를 수신했을 때 측정합니다. 센서에 닿는 광자와 기록되는 시간표 사이에 여러 가지 변수 지연의 원천이 축적됩니다.
- USB 투표 지연시간: 1 ms 간격으로 USB 2.0 투표, 125 μs에서 USB 3.0 투표. 그러나 실제 전송은 호스트 컨트롤러에 의해 계획되며 버스 분쟁으로 지연될 수 있습니다. 측정된 기저: 1
10 ms. - ** OS 스케줄링:** 커널은 USB 인터럽트 핸들러를 스케줄링하고, 이후 사용자 공간 콜백을 합니다. NT 리눅스 커널에서 로드 하에 스케줄링
터는 1 50 ms에서 달린다. 파이썬 프로세스는 위쪽에 GIL 분쟁을 추가합니다. - ** 카메라 롤링 셔터:** 롤링 셔터 센서는 상위와 하위 라인을 다른 시간에 노출시켜, 일반적으로 15
33 ms를 뻗어있다. 프레임의 "시간표"는 모호하다. - ** 네트워크 버퍼링:** 센서가 이더넷 (RealSense USB, ROS 주제는 DDS, EtherCAT 모터 드라이브) 를 통해 통신하는 경우, 네트워크 스택 버퍼링은 또 다른 변수 지연층을 추가합니다.
- ** 공동 상태 버스 지연시간:** CAN 버스, 일련 UART, EtherCAT 각각 각자의 읽기 지연시간을 가지고 있습니다. 8 관절의 1 Mbps에 있는 CAN 버스에서는 ~1 ms의 일련화 지연이 도입됩니다. 115200 바드에서 일련 UART는 더 나쁘습니다. 합동 상태는 순차적으로 읽혀지기 때문에 1 관절과 6 관절은 동시에 없습니다.
이 지연은 개별적으로 작지만 집단적으로 변동적입니다. 더 나쁜 것은, 그들은 일정하지 않습니다. 시스템 부하, USB 토폴로지, 네트워크 트래픽, 심지어 환경 온도 (크리스탈 오스틸레이터 파동에 영향을 미치) 와 함께 변화합니다. 소프트웨어 타임스테일은 관찰할 수 없는 지연을 제거 할 수 없습니다.
로봇 시간적 조율 의 네 층
시간적 조화를 고정하려면 네 개의 다른 층을 다루어야 합니다. 각 층은 그 아래의 층에 쌓여 있습니다.
4
데이터셋 인증
샘플별 시점 불확실성, 기동 히스토그램, 떨어진 프레임 지도. 모든 데이터 세트는 시간적 건강 보고서를 가지고 있습니다. 그래서 하류 소비자들은 그들이 무엇을 훈련하고 있는지 알고 있습니다.
3
센서-액추레이터 결합
카메라 프레임
2
하드웨어 트리거
외부 트리거 라인, 모든 시점에서 시크로네이션 노출, 롤링 셔터 스매어, 자유로이 실행되는 프레임 클럭이 없습니다.
1
시계 동기화
PTP (IEEE 1588) 또는 모든 장치에서 공유된 시계 소스. 모든 센서, 액추에이터 및 컴퓨팅 노드는 밀리초가 아닌 마이크로초 내에 어떤 시간인지에 동의합니다.
대부분의 로봇 학습 설정은 이러한 계층 중 어느 것도 구현하지 않습니다. 일부에서는 계층 1을 부분적으로 구현합니다. 거의 아무도 계층 2
RCSV의 접근 방식: 하드웨어 기반의 시간적 인프라
RCSV의 데이터 수집 인프라는 시간적 조율의 네 가지 계층을 기본으로 구현하고, 추가 기능이 아닙니다.
- <5ms 모든 스트림에서 동기화. 하드웨어 트리거된 글로벌 셔터 카메라는 공동 상태 리드백과 같은 트리거 라인에 발사한다. 카메라 노출, 공동 코더 잠금, 모터 명령 시간표는 독립적인 소프트웨어 투표 루프에 연결되지 않고 공유 시계 가장자리에 연결됩니다.
- LED + PRBS 단계 디코딩은 실제 캡처 지연 측정을 위해 사용된다. 카메라 시야에서 사이부랜덤 바이너리 순서 (PRBS) 가 주도하는 LED 배열이 보인다. 캡처된 이미지의 PRBS 패턴을 디코딩함으로써 카메라 펌웨어가 도입하는 파이프라인 지연을 포함하여 트리거에서 픽셀 캡처까지의 실제 엔드-투-엔드 지연을 측정합니다. 이것은 기량 단계가 아니라 연속적으로 실행됩니다.
- ** 각 데이터 세트에서 건강 측정 시간을 측정.** RCSV가 제공하는 모든 데이터 세트에는 각 에피소드별 시간 보고가 포함되어 있습니다. 최대 jitter, 평균 동기화 오프셋, 떨어진 프레임 카운트 및 전체 jitter histogram. 하류 소비자들은 시간적 품질에 따라 샘플을 필터링하거나 무게를 할 수 있습니다.
- 결과: 2
3배 더 적은 시범이 필요함. 일치된 작업 (픽플레이스, 핑크 삽입, 케이블 라우팅) 에서 하드웨어 동기화된 RCSV 데이터에 훈련된 정책은 소프트웨어로 시표된 USB 카메라 설정에서 수집된 동일한 작업에 비해 23배 더 적은 시범이 있는 동등한 성공률을 달성합니다. 시범은 더 나은 것이 아니기 때문에 운영자들이 더 나은 것이 아니기 때문에
관련 업무
시간적 캘리브레이션은 멀티 센서 시스템에서 오랜 역사를 가지고 있지만 로봇 학습 데이터 수집 커뮤니티에서 특히 주목받지 못했습니다.
- **Furgale et al., "Multi-sensor systems for Unified Temporal and Spatial 캘리브레이션" (IROS 2013) ** ?? Kalibr 프레임워크는 카메라-IMU 시스템에서 공동의 시간적 및 공간적 캘리브레이션을 도입했다. 몇 밀리초의 시간적 오프셋은 시각-무동성 오도메트리를 크게 저하한다는 것을 보여주었다.
- Qin & Shen, "Monocular Visual-Inertial Systems for Online Temporal 캘리브레이션" (2018)
카메라-IMU 시간 오프셋은 VIO 운영 중 온라인으로 추정될 수 있음을 증명하여 오프라인 캘리브레이션의 필요성을 제거하였다. - **Tschopp et al., "VersaVIS: An Open Versatile Multi-Camera Visual-Inertial Sensor Suite" (2019) **
하드웨어 트리거드된 멀티 카메라 + IMU 시스템, 미리초 초반 동기화. 로봇 학습 데이터 수집이 필요로 하는 가장 가까운 전초, 조작보다는 SLAM를 위해 설계되었습니다. - **
및 다른, "저비용 하드웨어와 함께 정밀화 된 쌍방향 조작을 배우는 것" (2023) ** ALOHA 시스템은 USB 카메라 및 다이내믹셀 시리즈 버스에서 소프트웨어 시간표를 사용합니다. 시간적 조정은 종이에 특징이 없지만 복제된 설정에서 측정된 기동은 20 50 ms입니다. - **Khazatsky et al., "DROID: A Large-Scale In-The-Wild Robot 조작 Dataset" (2024) ** 564 장의 76K 에피소드. 호스트 측 시간표가 있는 RealSense 카메라를 사용합니다. 분산 수집 사이트의 시간적 조정은 표준화되지 않습니다.
- ** Chi et al., "Universal 조작 Interface" (2024) **
UMI는 SLAM 기반의 포즈 추정 및 인터폴레이션 액션 레이블을 가진 GoPro 카메라를 사용합니다. 인터폴레이션 단계는 임시 오차를 부드럽게 하지만 제거하지 않습니다. - **F2F-AP: "Flow-to-Future Asynchronous Policy" (2026)
아시크로노스 관찰 행동 흐름에 대한 학습된 보상 제안. 알고리즘 접근법조차도 기초적 진실 시기를 아는 것이 교육 데이터의 배포를 상쇄하는 혜택을 누리라는 것을 보여줍니다.
다음으로: 시크벤치
RCSV는 시인크 벤치**를 개발하고 있습니다. 시적 조율 조건이 정책 성과에 미치는 영향을 직접적으로 측정하는 기준입니다. 실험 프로토콜은 간단하지만, 우리가 아는 한, 체계적으로 출판된 적이 없습니다.
- ** 같은 작업, 동일한 정책 구조, 다른 시간.** 3가지 조건: (1) 소프트웨어 시간표만, (2) 하드웨어로 작동하는 카메라가 완전한 동기화 없이, (3) 위에서 설명한 바와 같이 완전한 네 층 시간적 조율.
- ** 작업 스펙트럼.** 일시적으로 용납 (빈 선택, 블록 스택) 에서 일시적으로 요구 ( 0.5 mm 용납량에서 톱니 삽입, 케이블 스레드, USB 커넥터 짝짓기) 까지.
- ** 메트릭.** 조건:
분포 (p50/p95/p99), 정책 성공률 50/100/200/500 시범, 80%의 성공률을 달성하기 위한 최소 시범, 실패 모드 분해 (오버스라이드, 접촉 실패, 잡기 슬립, 충돌)
우리는 시크벤치가 접촉 부가적인 작업에 대한 건축 선택보다 시상적 조정이 샘플 효율성의 강렬한 예측 요소임을 보여줄 것으로 기대합니다. 확인되면 이 분야가 인프라 투자와 알고리즘 연구에 우선 순위를 어떻게 부여하는지에 중요한 영향을 미친다.
하드웨어 동기화된 데이터 수집
RCSV는 시범 시점 인증과 함께 시간적으로 조정된 시범 데이터를 제공합니다. 시범 사례가 적어 정책 성공률이 높습니다.
[우리 팀과 이야기] [T3







