Research(으)로 돌아가기

멀티태스 로봇 학습: 더 나은 정책을 위해 작업 중 데이터를 공유

다중 작업 로봇 학습에 대한 조사 <unk> 여러 작업, 작업 조건화 및 작업 공유가 정책 성과에 도움이되는 것과 영향을 미치는 경우의 공동 훈련.

[← 연구]

여러 가지 과제에서 공동 훈련은 조작 정책 성과를 향상시키는 가장 신뢰할 수있는 방법 중 하나입니다. 이 설문 조사에는 구조, 데이터 혼합 및 언제 분리 vs 공유를 포함합니다.

여러 과제 를 다룬 학습 의 이유

단일 작업 로봇 정책은 근본적인 한계를 가지고 있습니다. 그들은 하나의 작업에서 데이터를만 훈련시켜 관련 작업 중 공유된 시각적 이해를 할 수있는 잠재력을 낭비합니다. 빨간 잔을 뽑기 위해 훈련받은 정책은 ""는 파란색 컵, 녹색 병 및 금속 캔에 적용되는 일반적인 기술이라는 것을 결코 배우지 않습니다.

다중 작업 학습은 여러 관련 작업의 시범을 동시에 공동 훈련함으로써 이를 해결합니다. 이 혜택은 다음과 같습니다.

  • ** 공유된 시각적 특징** 작업 공간을 공유하는 작업은 시각적 의미론을 공유합니다. "픽컵", "픽 병", "픽 보울"에 훈련된 표현은 개념으로 "잡을 수 있는 객체"을 학습합니다. 단일 작업 훈련은 "컵"만을 학습합니다.
  • 교육 연수당 더 많은 자료 10개의 작업 × 200개의 디모 = 2,000개의 훈련 예제 총, 모두 공유된 표현에 기여합니다. 각 개별 작업은 기능 학습을 위한 모든 2,000개의 예제에 효과적으로 접근할 수 있습니다.
  • 새로운 작업에 더 좋은 기반 다중 작업 정책은 단일 작업 정책보다 더 빨리 진정한 새로운 작업에 적응합니다.

과제 조건화 방법

다중 작업 정책은 어떤 작업을 수행해야 하는지 알아야 합니다.

  • ** 언어 명령어** 가장 유연하다. 정책은 "붉은 잔을 들고 버진에 넣는다"와 같은 텍스트를 수신한다. 작업 임베디션을 생성하기 위해 언어 코더 (T5, CLIP 텍스트 코더) 를 사용합니다. 새로운 명령어에 제로샷 일반화를 가능하게 한다. OpenVLA, RT-2, SayCan에서 사용된다.
  • ** 한 열 작업 ID** 가장 간단합니다. 정책은 작업 인덱스를 수신합니다 (task 0, task 1, ..., task N). 언어 이해가 필요하지 않습니다. 작업 집합이 고정되어 작을 때 잘 작동합니다 (<20 작업). 많은 오프라인 RL 문서에서 사용됩니다.
  • ** 목표 이미지** 정책은 원하는 최종 상태의 이미지를 수신합니다. 언어가 필요하지 않습니다. 구사적으로 설명하기 어려운 작업에 작동합니다. 제한 사항: 목표 이미지를 수집하는 것은 노동력이 많은 것이며 정책은 목표가 어떻게 보이는지 아닌 어떤 행동을 통해 목표를 생성하는지 추론해야합니다.

공동 훈련 이점: 출판 된 일 에서 얻은 증거

다중 작업 공동 훈련에 대한 경험적 증거는 강력합니다.

  • ** 오픈 X-Embodiment** 전체 다양한 데이터 세트 (22 실시예, 527 작업) 에 대한 훈련은 단일 데이터 세트에서 훈련보다 꾸준히 우월합니다. 단일 작업 데이터 세트가 큰 작업에서도요. 다양한 작업 → 더 나은 일반화. 주요 발견: 더 다양한 작업은 더 좋습니다. 많은 작업이 서로 관련이 없는 것처럼 보이더라도.
  • ALOHA 쌍방임 과제 25개의 쌍방임 과제를 공동 훈련 (복, 포장, 조립) 은 개별 과제 모델에 비해 공유된 코더가 모든 과제에서 성능을 향상시킨다는 것을 보여주었습니다. 드문 과제들에 대한 개선은 거의 증명되지 않은 데 가장 크다. 20개의 디모가 있는 과제는 멀티태스크 훈련에서 80개의 디모가 있는 과제처럼 멀티태스크 훈련에서도 잘 수행된다.
  • ** 브리지 V2 + 다른 데이터 세트** OpenVLA의 정형 조정에 브리지 V2 데이터를 추가하면 목표 데이터 세트에서만 정형 조정과 비교하여 1020 퍼센트 점으로 신규 객체 일반화를 지속적으로 향상시킵니다. 심지어는 브리지 V2 작업이 목표 작업과 다르더라도.

부정적 인 이전: 과제 공유가 고통 을 당할 때

모든 작업 조합은 공유의 혜택을 받지 못한다. ** 부정적 전송**은 여러 작업에 대한 훈련이 함께 이루어져 개별적인 단일 작업 정책보다 더 나쁜 정책을 만들어낼 때 발생합니다.

  • ** 충돌하는 행동 분포** "위프 테이블" (宽扫运动) 와 "픽 오브젝트" (精确定位) 은 근본적으로 다른 행동 분포를 가지고 있습니다. 공유 정책 수반자는 이 둘 중 어느 쪽에도 좋은 궤도를 생성하여 이를 평균하려고합니다.
  • 충돌하는 시각적 표현 미세한 질서에 관심을 필요로 하는 작업 (, 전자) 은 세계적 현상 이해가 필요한 작업 (나비게이션, 쓰레기통을 뽑는) 과 충돌한다.
  • ** 다른 하드웨어 설정** 평행 턱잡기에서 데이터를 여러 손가락의 손에서 데이터를 함께 훈련하는 것은 혼란스러운 동작 순서를 생성합니다. 하드웨어별 데이터를 분리하십시오.
  • 엄지손가락 규칙: 두 작업이 동일한 최종 효과를 공유하고 같은 작업 공간의 객체에서 작동한다면, 그들은 거의 항상 공동 훈련의 혜택을 누릴 수 있습니다. 근본적으로 다른 움직임이나 센서가 필요한 경우, 신중하게 평가하십시오.

건축 선택

  • ** 단일 공유 코더 + 작업별 헤드** 가장 흔하다. 공유 레스넷 또는 ViT 코더는 시각적 특징을 추출하고, 작업 당 MLP 헤드들은 행동을 예측한다. 작업이 시각적 맥락을 공유하지만 행동 분포에 차이가 있을 때 좋습니다.
  • ** 전문가들의 혼합** 각 분야에 특화된 N 전문가 네트워크. 게팅 네트워크는 적절한 전문가에게 입력 경로를 전달한다. 모순적인 작업에 대한 부정적인 전송을 감소시킨다. 일부 멀티태스 RL 작업에서 사용됩니다.
  • ** 하이퍼네트워크/타크 조건형 중량 생성** 하이퍼네트워크가 작업 임베디션을 고려하여 작업에 대한 정책 중량을 생성하는 메타 학습 접근법.
  • 대부분의 실용적인 다중 작업 조작 작업에 있어서 언어 작업 조건과 퍼포션 액션 헤드 (Octo와 같이) 를 가진 공유 ViT 코더는 현재 최고의 관행이다.

데이터 혼합 전략

  • ** 작업 비례적인 샘플링** 데이터 세트의 크기에 비례하여 각 작업에 샘플링. 가장 큰 데이터 세트는 훈련에 지배적이다. 위험: 드물게 드물게 드모가 있는 작업은 미흡한 대상이 되고 개선되지 않을 수 있습니다.
  • 유례가 적지 않은 과제 일정한 과제 샘플링 (사용 크기를 고려하지 않고 과제 당 확률이 동일) 은 희귀 과제를 과중화하여, 그 과제를 익사시키는 것을 방지합니다.
  • ** 교육과정 혼합** 보다 간단한 과제부터 시작하여 점차 더 어려운 과제를 도입한다. 인간의 학습을 반영한다. 복잡한 기술보다 기초적인 기술. 특히 작업의 어려움이 광범위한 범위에서 유용하다.
  • ** 어려움 중량 샘플링** 현재 정책 성과와 반대의 비율로 샘플 작업. 미흡한 성과 작업은 더 많은 데이터를 얻습니다. 적응적이고 공감대를 향상시킬 수 있지만 온라인 성과 추정치가 필요합니다.

다중 과제 정책의 평가

수행 과제 일반화는 금 표준: N 과제에 대한 훈련, 훈련 중에 보이지 않는 M 과제에 대한 평가.

수행된 작업 일반화에 대한 발표된 결과: 25개 이상의 작업에 대한 언어 조건화 교육을 받은 정책은 일반적으로 비슷한 비용으로 진정으로 새로운 작업에 40%~70%의 성공을 달성합니다. 단일 작업 정책은 동일한 새로운 작업에 대해 거의 0을 달성합니다. 격차는 다 작업 훈련의 가치를 나타냅니다.

실용적 인 지침

  • 항상 3가지 이상의 관련 과제와 동일한 하드웨어/엔드-에펙터를 가지고 있으면 함께 훈련하세요.
  • 배포 시 언어를 사용하지 않으려고 할 경우에도 언어 조건화를 사용하십시오. 그것은 더 나은 작업 표현을 강요하고 데이터 수집을 단순화합니다 (모든 작업을 구사적으로 설명하십시오).
  • 처음부터 지어진 객체를 평가합니다. 작업당 성능이 크로스-타스 일반화보다 훨씬 높으면 학습보다는 기억을 하고 있습니다.
  • 별도의 모델은 작업이 진정으로 다른 하드웨어, 센서 또는 동작 방식이 필요한 경우에만 정당화됩니다.

[RCSV 데이터 서비스] (T1) 페이지에서 멀티태스크 데이터 수집 도구를 탐구하거나 [연구 플랫폼] (T2) 를 통해 미리 수집된 멀티태스크 데이터 세트를 액세스하십시오.

RCSV 데이터로 멀티태스 정책을 구축

30가지 이상의 작업, 표준화된 평가 벤치마크 및 멀티태스크 로봇 학습을 위한 GPU 훈련 인프라를 통해 다양한 조작 데이터 세트를 액세스할 수 있습니다.

[데이터 서비스를 탐구]