التعلم المعزز غير المتصل
التعلم المعزز من مجموعة بيانات ثابتة من الانتقالات المجمعة مسبقاً، دون أي تفاعل إضافي متصل مع البيئة. تعالج خوارزميات التعلم المعزز غير المتصل (CQL و IQL و TD3+BC) تحول التوزيع بين سياسة السلوك التي جمعت البيانات والسياسة المتعلمة. يعتبر التعلم المعزز غير المتصل جذاباً للروبوتات لأنه يتجنب مخاوف السلامة وتكاليف الاستكشاف المتصل.







