로봇 학습의 개방적 문제: 2025~2028년 10가지 연구 방향
로봇 조작 학습에서 가장 중요한 개방된 문제들 <unk> 샘플 효율성에서 장기 계획까지 <unk> 그리고 발전이 어떻게 보이는지
[← 연구]
로봇 학습은 2022년 이후 비정상적인 발전을 이루었습니다. 로봇이 구조화되지 않은 환경에서 안정적으로 작동하기 전에 여전히 해결해야 할 문제입니다.
2025 년 현장 상태
로봇 학습은 시범 데이터 또는 환경 상호작용에서 신경정책을 훈련시키는 데 있어서 지난 3년 동안 전년보다 더 발전해 왔습니다.
그러나 "실험실에서 가능"과 "실용에 신뢰할 수 있는"는 긴 공개 문제 목록으로 분리되어 있다. 다음 10 가지 문제는 2025년부터 2028년까지의 분야에 대한 가장 우선순위적인 연구 방향을 나타냅니다.
1. 데이터 수집을 효율적으로 확장
** 병목:** 실제 세계 로봇 시범 데이터 수집은 작업 복잡성에 따라 에피소드당
** 연구 방향:** 액티브 학습 (최고의 정보적 시범을 수집하고 무작위적인 것을 수집하지 않습니다); 실제 데이터 요구 사항을 줄이기 위해 도메인 무작위화와 함께 시뮬레이션 사전 훈련; 크로스 인보디먼트 전송 (로봇 A에서 데이터를 훈련, 최소한의 미세 조율을 사용하여 로봇 B에 배포); 그리고 라벨되지 않은 로봇 비디오에서 신호를 추출하는 반 감독 된 접근법.
** 진보 신호:** 반닐라 행동 복제 기준과 비교하여 표준화된 벤치마크 작업에서 주어진 성공률을 달성하기 위해 필요한 시범의 10배 감소.
2· 장기적 과제 완공
현재 상태: 최첨단 로봇 정책은 제어된 설정에서 1020 단계 작업을 안정적으로 처리합니다. 실제 세계에서 조작하는 경우 50200 단계 순서가 필요합니다. 오류 화합물: 95% 단계별 성공률은 50 단계 이상 작업 성공률의 8%에 불과합니다.
** 연구 방향:** 명시적인 하위 목표 표현을 가진 계층적 정책; 조작 원시용에 대한 학습된 구성 요소와 작업 및 운동 계획 (TAMP) 의 통합; 낮은 수준의 학습된 정책과 결합된 대규모 언어 모델 하위 목표 생성; 그리고 행동 표현에 대한 시간 추상.
진보 신호: 구조화되지 않은 환경에서 50% 이상의 단계 조작 작업을 안정적으로 수행하고 70% 이상의 성공률을 기록합니다.
3· 악성적인 손 조작
** 현재 상태:** 대부분의 로봇 학습 작업은 힘 잡을 수 있는 평행 턱잡이를 사용합니다. 손에서
** 연구 방향:** 인간 손가락 끝의 민감성과 비교할 수 있는 접촉 정보를 제공하는 고해상도 촉각 감지 매시; 시범 데이터 수집을 위한 데이터 장갑을 사용하는 현명한 손전형 텔레오퍼레이션 (RCSV는 [손갑 기반 데이터 수집 프로그램을 운영한다](
진보 신호: 50가지 이상의 새로운 객체 유형에서 80% 이상의 성공률을 가진 특정 지향으로 임의 객체의 임의 회전.
4· 신작 객체에 일반화
** 현재 상태:** 객체 집합에 대한 훈련 정책은 일반적으로 그 객체에서 6075%의 성공을 달성합니다. 새로운 객체 (훈련 중에 보이지 않는) 은 2540%의 성공으로 떨어집니다.
** 연구 방향:** 기초 모델 시각적 특징 (CLIP, DINOv2) 은 의미 일반화를 제공하는 얼어붙은 코더로서; 5
** 진보 신호:** 50개의 유지된 객체 범주의 표준화된 평가 집합에서 훈련된 객체 성공률의 15% 내에 있는 새로운 객체 성공률.
5· 물리적 세계 의 이해
현재 상태: 현대의 로봇 정책은 훌륭한 패턴 일치이지만 물리적 물체 특성에 대한 이해가 부족합니다. 딱딱한 물체에 훈련받은 로봇은 취약한 물체에 대한 포착력을 조정할 수 없습니다. 정책은 질량, 변형성 또는 취약성의 표현이 없습니다.
** 연구 방향:** 상호작용 데이터에서 학습된 간결한 물리학 모델; 촉각적 세계 모델, 촉각 관측에서 접촉 결과를 예측하는; 정책 조건에 통합된 언어 조건화된 재산 표현 ("이걸 부드럽게 처리하라
성장 신호: 위형상품 (복, 후기, 부드러운 식품) 의 성공적인 조작, 작업에 대한 특수한 훈련 없이 70% 이상의 성공률을 기록한다.
6· 인간과 로봇 협업
** 현재 상태:** 로봇 정책은 정적 환경으로 설계되었습니다. 인간이 존재할 때 예측할 수 없는 움직임은 정책의 가정들을 무효화하여 실패 또는 안전하지 않은 행동을 유발합니다.
** 연구 방향:** 자세와 시선을 통해 실시간 인간 의 의도를 예측하는 것; 예상치 못한 인간 근접에 대응하여 로봇의 움직임을 적응시키는 안전한 컴플라이언스 제어; 인간과 로봇 상호 작용 데이터에 훈련된 협업 조작 정책; 학습된 시기를 가진 명시적인 전달 프로토콜.
진보 신호: 인간 행동이 기대에서 벗어날 때 우아한 실패 모드로 협력 작업의 성공적인 완료 (인간 손이 로봇에 반발하고 로봇이 작업을 계속한다).
7. 접촉 작업에 대한 강력한 시미-트리얼
현재 상태: 시미-실적 전송은 자유 공간의 움직임 (체취, 프라스트프 접근) 에 잘 작동한다. 접촉 작업 (insertion, assembly, surface following) 은 접촉 역학에서 sim-실적 격차로 인해 전송이 좋지 않습니다.
** 연구 방향:** 실제 로봇 데이터로 기급된 학습된 접촉 모델로 구분 가능한 시뮬레이션; 강력한 정책을 만들기 위해 훈련 중에 무작위로 구성된 접촉 매개 변수; 시뮬레이션 오류를 수정하는 학습된 잔여 동학 모델; 그리고 실제 데이터로 훈련된 접촉 부가한 기초 모델, 증강을 위한 시뮬레이션으로만 훈련된다.
진보 신호: 페그-인-홀 삽입 (0.5mm 클리어닝) 은 실제 데이터 정비 없이 실제 하드웨어에서 80% 이상의 성공을 달성하는 시뮬레이션에 전적으로 훈련되어 있습니다.
8· 잊지 않고 평생 학습
** 현재 상태:** 도입된 로봇 정책은 정적
** 연구 방향:** 기존의 기능을 과잉하지 않고 새로운 작업 기능을 추가하는 지속적인 학습 방법; 정책들을 모듈로 확장하는 LoRA 및 다른 매개 변수 효율적인 정렬 방법; 재난적 잊을 것을 방지하기 위해 큐레이션된 메모리 버퍼로 경험 재 재생; 작업에 대한 특정 모듈을 독립적으로 교환할 수 있는 모듈형 정책 아키텍처.
** 진보 신호:** 전작 작업의 90% 이상 수행을 유지하면서 10 가지 새로운 작업을 연속적으로 학습하는 로봇 정책, 완전한 재교육이 없습니다.
9· 실세계에서의 효율적 인 강화 학습
** 현재 상태:** 실제 로봇에서 강화 학습은 대부분의 응용 프로그램에 너무 느리고 안전하지 않습니다.
** 연구 방향:** 모델 기반 RL는 작은 수의 실제 상호 작용과 계획에서 세계 모델을 학습합니다. 학습 중에 에이전트의 행동 공간을 제한하는 안전한 탐구 방법; 최종 성능 격차를 위해 RL 정비와 모방 학습 초기화를 결합하는; 온라인 상호 작용 없이 기록된 운영 데이터에서 정책을 개선하는 오프라인 RL 방법.
** 진전 신호:** 실제 로봇 상호 작용 (시뮬레이션이 없) 을 2 시간만 사용하여 접촉이 풍부한 조작 작업에서 85% 이상의 성공률을 달성하고 학습 중에 안전 위반이 없습니다.
10. 평가 표준화
** 현재 상태:** 로봇 학습 논문에서는 서로 다른 로봇, 작업, 성공 측정표 및 평가 프로토콜과 호환되지 않는 벤치마크에 대한 결과를 보고합니다. 시각에 대한 이미지넷이나 언어에 대한 MMLU와 유사한 합의된 벤치마크는 없습니다. 논문 간의 방법을 비교하는 것은 거의 불가능합니다.
** 연구 방향:** 표준 벤치마크 스위트 소수의 커뮤니티 컨버전스
** 진보 신호:** 논문을 수용하기 위해 공통의 벤치마크 하위 집합에 대한 결과를 요구하는 세 가지 또는 그 이상의 주요 로봇 학습 장소 (CoRL, ICRA, RSS).
RCSV가 이 지침에 어떻게 기여하고 있는가
RCSV의 연구 및 인프라 프로그램은 직접적으로 문제 1 (데이터 수집 효율성), 3 (전갑 수집을 통해 유독한 조작 데이터), 8 ( 연속적인 데이터 플라이휠을 통해 평생 학습) 및 10 (우리의 표준화된 작업 부트를 통해 평가) 를 다루고 있습니다.
이러한 개방적인 문제들에 연구하는 연구자들에게 RCSV는 벤치마크 품질의 시범 데이터 세트, 하드웨어-인-loop 평가에 대한 로봇 액세스 프로그램 및 LeRobot Hub 및 오픈 X-Embodiment 형식에 데이터 세트 기여를 생산하는 [데이터 수집 서비스] (
로봇 학습 연구 에 협력
RCSV는 데이터 수집, 로봇 접근 및 인프라로 학술 및 산업 연구 프로그램을 지원합니다. 연구 협업을 논의하기 위해 저희에게 연락하십시오.
[연구 프로그램을 참조]







