السياسة (روبوت)
في تعلم الروبوت، السياسة (يُرمز إليها بـ π) هي دالة تربط الملاحظات بالإجراءات: π(o) → a. السياسة هي "الدماغ" المتعلم للروبوت الذي يحدد ما يجب فعله في كل خطوة زمنية بناءً على ما يدركه. يمكن تمثيل السياسات كشبكات عصبية (سياسات عصبية)، أشجار القرار، عمليات غاوسية، أو جداول البحث. يمكن أن تكون حتمية (إجراء واحد لكل ملاحظة) أو عشوائية (توزيع على الإجراءات). يُقاس جودة السياسة بمعدل نجاح المهمة عبر ظروف متنوعة، وليس فقط على البيانات التدريبية. التحدي الأساسي لتعلم الروبوت هو تدريب السياسات التي تعمم بشكل موثوق خارج توزيعها التدريبي. انظر هذا عملياً: تقييماتنا في العالم الحقيقي →







