학습된 보상
수작업으로 설계된 것이 아니라 데이터(인간 선호도, 시연, 언어 설명)에서 학습된 보상 함수입니다. 보상 학습 방법에는 역강화학습, 인간 비교로부터의 보상 모델링(RLHF 스타일), VLM 기반 보상 점수 매기기(CLIP 유사도 또는 LLM 평가 사용)가 포함됩니다. 학습된 보상은 복잡한 조작 작업에 대해 잘 설계된 수동 보상 함수를 지정하기 어렵다는 과제를 해결합니다.
수작업으로 설계된 것이 아니라 데이터(인간 선호도, 시연, 언어 설명)에서 학습된 보상 함수입니다. 보상 학습 방법에는 역강화학습, 인간 비교로부터의 보상 모델링(RLHF 스타일), VLM 기반 보상 점수 매기기(CLIP 유사도 또는 LLM 평가 사용)가 포함됩니다. 학습된 보상은 복잡한 조작 작업에 대해 잘 설계된 수동 보상 함수를 지정하기 어렵다는 과제를 해결합니다.