TRPO
Trust Region Policy Optimization — एक नीति प्रवणता RL एल्गोरिथ्म जो प्रत्येक नीति अपडेट को एक विश्वास क्षेत्र (KL विचलन द्वारा मापा जाता है) तक सीमित करता है ताकि बड़े, विनाशकारी अपडेट को रोका जा सके। TRPO एकरस सुधार की गारंटी प्रदान करता है लेकिन विवश अनुकूलन के कारण कम्प्यूटेशनल रूप से महंगा है। PPO एक सरल क्लिप किए गए सरोगेट उद्देश्य के साथ TRPO के लाभों का अनुमान लगाता है।







