العودة إلى Glossary

تعلم التفضيلات

Robot LearningRL

التعلم من الأحكام المقارنة البشرية (مثل 'المسار أ أفضل من المسار ب') بدلاً من إشارات المكافأة الصريحة أو العروض التوضيحية. يتم تدريب نموذج المكافأة ليكون متسقاً مع تفضيلات الإنسان، ثم يُستخدم لتحسين سياسة التحكم عبر التعلم المعزز. يتجنب هذا النهج (RLHF المطبق على الروبوتات) الحاجة إلى هندسة مكافأة عددية دقيقة ويمكنه التقاط النوايا البشرية الدقيقة.

Related terms