العودة إلى Glossary

التعلم العكسي بالتعزيز

Robot LearningRL

تعلم دالة المكافأة من عروض الخبراء، بافتراض أن الخبير يعظم تلك المكافأة بشكل أمثل (تقريباً). يتجنب التعلم العكسي بالتعزيز الحاجة إلى هندسة دوال المكافأة يدويًا — بدلاً من ذلك، يتم استنتاج المكافأة ثم استخدامها لتدريب سياسة تحكم عبر التعلم بالتعزيز القياسي. يعتبر التعلم العكسي بالإنتروبيا القصوى والتعلم العكسي الخصومي (AIRL) من الصيغ الشهيرة. يرتبط التعلم العكسي بالتعزيز ارتباطاً وثيقاً بـ GAIL.

Related terms