دالة Q (دالة قيمة العمل)
تقدر دالة Q Q(s, a) المكافأة المتراكمة المخصومة المتوقعة التي سيحصل عليها الوكيل بأخذ العمل a في الحالة s ثم اتباع سياسة معينة بعد ذلك. دوال Q مركزية في خوارزميات التعلم المعزز مثل DQN (الأفعال المنفصلة) و SAC و TD3 و DDPG (الأفعال المستمرة). في RL للروبوتات، يعتبر تعلم دوال Q دقيقة لمهام المعالجة طويلة الأفق أمراً صعباً لأن المكافآت نادرة والفضاء الحالة-العمل عالي الأبعاد. يستخدم العمل الحديث في RL غير المتصل (IQL و CQL) دوال Q لاستخراج السياسات من مجموعات بيانات ثابتة دون تفاعل متصل، مما يسد الفجوة بين التعلم بالمحاكاة والتعلم المعزز. انظر هذا عملياً: تقييماتنا في العالم الحقيقي →







