Research(으)로 돌아가기

인간 은 첫 번째 계급 의 학습 신호 로

왜 인간의 교정, 개입, 그리고 운영자 행동들이 실제 로봇 시스템에서 1급 학습 신호로 취급되어야 하는지에

[← 연구]

왜 운영자 수정, 복구, 개입이 현대 로봇 데이터 파이프라인을 설계하는 방식을 형성해야 하는지에 대한 설명입니다.

인간의 입력이 감독이 되는 곳

개입을 보여줘

많은 로봇 학습 시스템은 여전히 사람들을 일시적인 기판으로 취급합니다. 초기에는 시범을 수집하는 데 유용하지만, 훈련에 있어서 정책이 이루어지면 대부분 무시됩니다. 실제로는 잘못된 추상화입니다. 인간의 행동은 단순히 부트스트랩 도구가 아닙니다. 작업 의도를 이해하는 데 가장 풍부한 신호 중 하나입니다. 실패 경계가, 복구 전략.

신호가 사는 곳

이 값은 성공적인 시범에만 국한되지 않습니다. 그것은 휴식, 경로 중 수정, 잡기 조정, 재시행 및 운영자가 작업이 실패할 것을 감지하고 로봇이 잘못된 행동을 하기 전에 전략을 변경하는 순간에서 나타납니다.

데이터 디자인 에 있어서 이 점 이 중요 한 이유

만약 팀들이 최종 성공 궤도를 저장한다면, 그들은 성공이 어떻게 이루어졌는지 설명하는 많은 구조를 버립니다. 그 부족한 순간들은 종종 정책이 더욱 견고하게 되는 데 도움이 되는 것입니다.

무슨 점 을 잡아야 합니까?

  • ** 개입** 인간 이 과제를 과장하거나 다시 방향을 잡을 때
  • 정치 전문가의 판단을 반영하는 자세, 힘 또는 순서에서의 작은 변화.
  • ** 퇴역** 과제의 진정한 난이도를 드러내는 실패 또는 부분적인 시도.
  • ** 메타데이터 작업** 운영자 정체성, 어려움 태그 및 선택의 변경 이유를 설명하는 컨텍스트.

실용적 인 교훈

실제 로봇 시스템을 구축하는 팀은 인간의 입력을 '실천' 자율 궤도를 둘러싼 소음으로 취급하는 것을 중단해야 합니다. 이것은 실제로 원하는 정책 행동의 가장 명확한 표현입니다. 좋은 데이터 세트는 그 신호를 단순화된 성공적 재생으로 붕괴하는 대신 보존합니다.

최고의 실습 인간 수정 및 복구 작업은 시범 작업과 함께 기록한다. 그들은 종종 명칭 경로보다 더 유익합니다.

연제 수집 방법 데이터 수집 가이드 ← 연구로 돌아가

인간 가이드 된 더 나은 데이터 루프를 설계

만약 당신이 운영자 작업 흐름, 텔레오퍼레이션 루프, 또는 개입에 대한 데이터 세트를 만들고 있다면 우리는 파이프라인을 구조화하는데 도움을 줄 수 있습니다.

[신청 데이터] [T4] [우리와 연락하십시오] [T5] [하드웨어 탐구] [T6]