دالة القيمة
دالة تقدّر المكافأة التراكمية المتوقعة من حالة معينة (دالة قيمة الحالة V) أو زوج حالة-إجراء (دالة قيمة الإجراء Q). دوال القيمة محورية في التعلم المعزز — فهي توجه اختيار الإجراء وتحسين السياسة. يستخدم التعلم العميق المعزز الشبكات العصبية لتقريب دوال القيمة. في الروبوتات، يمكن لدوال القيمة المتعلمة أن تخدم كتقديرات التكلفة المتبقية للتخطيط وكنقاد السلامة.







