تنفيذ السياسة
تنفيذ السياسة هو حلقة واحدة من تنفيذ سياسة مدربة على الروبوت (أو في المحاكاة) من حالة ابتدائية إلى إكمال المهمة أو انتهاء المهلة الزمنية. يُستخدم التنفيذ لتقييم أداء السياسة، وجمع بيانات جديدة للتدريب الإضافي (كما في DAgger أو ضبط التعلم المعزز)، وتصحيح أخطاء الفشل. يعتمد عدد التنفيذات المطلوبة لتقدير أداء موثوق على تنوع المهمة — قد تتطلب المهام عالية التباين 50+ تنفيذ للحصول على تقدير معدل نجاح مستقر. في البحث، غالباً ما يتم تصنيف التنفيذات حسب الشرط الابتدائي (الأشياء/المشاهد الموزعة بشكل موزع مقابل خارج التوزيع) لتوصيف التعميم. انظر هذا عملياً: تقييماتنا في العالم الحقيقي →







