자기 대전
에이전트가 자신의 복사본과 경쟁하거나 협력하여 개선되는 훈련 패러다임으로, 자신의 상호작용을 통해 훈련 데이터를 생성합니다. 로봇공학에서 자기 대전은 다중 에이전트 작업(경쟁적 물체 조작, 적대적 견고성)과 다양한 행동 전략 생성에 사용됩니다. 훈련 상대가 지속적으로 개선되기 때문에 에이전트는 견고한 제어 정책을 학습합니다.
에이전트가 자신의 복사본과 경쟁하거나 협력하여 개선되는 훈련 패러다임으로, 자신의 상호작용을 통해 훈련 데이터를 생성합니다. 로봇공학에서 자기 대전은 다중 에이전트 작업(경쟁적 물체 조작, 적대적 견고성)과 다양한 행동 전략 생성에 사용됩니다. 훈련 상대가 지속적으로 개선되기 때문에 에이전트는 견고한 제어 정책을 학습합니다.