인간 은 첫 번째 계급 의 학습 신호 로
왜 인간의 교정, 개입, 그리고 운영자 행동들이 실제 로봇 시스템에서 1급 학습 신호로 취급되어야 하는지에
[← 연구]
왜 운영자 수정, 복구, 개입이 현대 로봇 데이터 파이프라인을 설계하는 방식을 형성해야 하는지에 대한 설명입니다.
인간의 입력이 감독이 되는 곳
개입을 보여줘
많은 로봇 학습 시스템은 여전히 사람들을 일시적인 기판으로 취급합니다. 초기에는 시범을 수집하는 데 유용하지만, 훈련에 있어서 정책이 이루어지면 대부분 무시됩니다. 실제로는 잘못된 추상화입니다. 인간의 행동은 단순히 부트스트랩 도구가 아닙니다. 작업 의도를 이해하는 데 가장 풍부한 신호 중 하나입니다. 실패 경계가, 복구 전략.
신호가 사는 곳
이 값은 성공적인 시범에만 국한되지 않습니다. 그것은 휴식, 경로 중 수정, 잡기 조정, 재시행 및 운영자가 작업이 실패할 것을 감지하고 로봇이 잘못된 행동을 하기 전에 전략을 변경하는 순간에서 나타납니다.
데이터 디자인 에 있어서 이 점 이 중요 한 이유
만약 팀들이 최종 성공 궤도를 저장한다면, 그들은 성공이 어떻게 이루어졌는지 설명하는 많은 구조를 버립니다. 그 부족한 순간들은 종종 정책이 더욱 견고하게 되는 데 도움이 되는 것입니다.
무슨 점 을 잡아야 합니까?
- ** 개입**
인간 이 과제를 과장하거나 다시 방향을 잡을 때 - 정치
전문가의 판단을 반영하는 자세, 힘 또는 순서에서의 작은 변화. - ** 퇴역**
과제의 진정한 난이도를 드러내는 실패 또는 부분적인 시도. - ** 메타데이터 작업**
운영자 정체성, 어려움 태그 및 선택의 변경 이유를 설명하는 컨텍스트.
실용적 인 교훈
실제 로봇 시스템을 구축하는 팀은 인간의 입력을 '실천' 자율 궤도를 둘러싼 소음으로 취급하는 것을 중단해야 합니다. 이것은 실제로 원하는 정책 행동의 가장 명확한 표현입니다. 좋은 데이터 세트는 그 신호를 단순화된 성공적 재생으로 붕괴하는 대신 보존합니다.
최고의 실습
인간 가이드 된 더 나은 데이터 루프를 설계
만약 당신이 운영자 작업 흐름, 텔레오퍼레이션 루프, 또는 개입에 대한 데이터 세트를 만들고 있다면 우리는 파이프라인을 구조화하는데 도움을 줄 수 있습니다.
[신청 데이터] [T4







