التعلم العكسي بالتعزيز
تعلم دالة المكافأة من عروض الخبراء، بافتراض أن الخبير يعظم تلك المكافأة بشكل أمثل (تقريباً). يتجنب التعلم العكسي بالتعزيز الحاجة إلى هندسة دوال المكافأة يدويًا — بدلاً من ذلك، يتم استنتاج المكافأة ثم استخدامها لتدريب سياسة تحكم عبر التعلم بالتعزيز القياسي. يعتبر التعلم العكسي بالإنتروبيا القصوى والتعلم العكسي الخصومي (AIRL) من الصيغ الشهيرة. يرتبط التعلم العكسي بالتعزيز ارتباطاً وثيقاً بـ GAIL.







