क्रॉस-एंट्रॉपी हानि
एक हानि फंक्शन जो अनुमानित संभाव्यता वितरण और सत्य लेबल के बीच अंतर को मापता है। वर्गीकरण के लिए, यह सही वर्ग की नकारात्मक लॉग-संभाव्यता है। रोबोट लर्निंग में, क्रॉस-एंट्रॉपी का उपयोग असतत एक्शन भविष्यवाणी, VLA मॉडल्स में टोकन जनरेशन, और भाषा-कंडीशन्ड नीतियों के प्रशिक्षण के लिए किया जाता है जहां एक्शन स्पेस असतत है।







