التعلم المعزز الآمن بالقيود
التعلم المعزز المقيد الذي يحسّن العائد مع الالتزام بقيود السلامة (مثل احتمالية الاصطدام < 0.01، حدود عزم المفصل). تعتبر تحسين السياسة المقيدة (CPO) والطرق اللاغرانجية ودوال حواجز التحكم من الأساليب الشائعة. يعتبر التعلم المعزز الآمن حاسماً لنشر الروبوت في العالم الحقيقي حيث يمكن لانتهاكات القيود أن تلحق الضرر بالأجهزة أو تؤذي الأشخاص.







