Glossary पर वापस जाएं

अस्थायी समूह

Robot LearningPolicy

एक अनुमान-समय तकनीक जिसका उपयोग एक्शन-चंकिंग नीतियों (जैसे ACT) के साथ किया जाता है जहाँ क्रमिक समय-चरणों से अतिव्यापी एक्शन भविष्यवाणियों को औसत किया जाता है ताकि चिकनी, अधिक सुसंगत गति उत्पन्न हो सके। यदि नीति प्रत्येक चरण पर 50 भविष्य की क्रियाओं की भविष्यवाणी करती है, और चरण 40 क्रियाओं से अतिव्यापी होते हैं, तो 40 अतिव्यापी भविष्यवाणियों को घातांकीय रूप से भारित और औसत किया जाता है। यह कंपन को कम करता है और निष्पादन गुणवत्ता में सुधार करता है।

Related terms