تعلم التفضيلات
التعلم من الأحكام المقارنة البشرية (مثل 'المسار أ أفضل من المسار ب') بدلاً من إشارات المكافأة الصريحة أو العروض التوضيحية. يتم تدريب نموذج المكافأة ليكون متسقاً مع تفضيلات الإنسان، ثم يُستخدم لتحسين سياسة التحكم عبر التعلم المعزز. يتجنب هذا النهج (RLHF المطبق على الروبوتات) الحاجة إلى هندسة مكافأة عددية دقيقة ويمكنه التقاط النوايا البشرية الدقيقة.







