सीखने की दर
ग्रेडिएंट डिसेंट द्वारा मॉडल पैरामीटर को अपडेट करने के लिए उपयोग किया जाने वाला चरण आकार। बहुत अधिक विचलन का कारण बनता है; बहुत कम धीमे अभिसरण का कारण बनता है। सीखने की दर शेड्यूलिंग (वार्मअप + क्षय) स्थिर प्रशिक्षण के लिए महत्वपूर्ण है। विशिष्ट प्रारंभिक सीखने की दरें: पूर्व-प्रशिक्षित मॉडल को फाइन-ट्यून करने के लिए 1e-4, Adam के साथ स्क्रैच से प्रशिक्षण के लिए 3e-4। सीखने की दर अक्सर ट्यून करने के लिए सबसे महत्वपूर्ण हाइपरपैरामीटर होती है।







