लाभ:
- कार्य के उद्देश्य के अनुसार वर्गीकरण और प्रतिगमन मेट्रिक्स (भ्रम मैट्रिक्स, सटीक/रिकॉल/एफ1, एमएई/आरएमएसई/आर²) का चयन और व्याख्या करने की क्षमता
- प्रशिक्षण और परीक्षण स्कोर की तुलना करके अतिशिक्षण का पता लगाने और क्रॉस-सत्यापन के साथ विश्वसनीय प्रदर्शन प्राप्त करने की क्षमता
- यह मूल्यांकन करने की क्षमता कि प्रत्येक मॉडल आधार रेखा के साथ तुलना करके वास्तविक मूल्य जोड़ता है या नहीं
मॉडल स्थापित करना आसान है; यह ईमानदारी से मापना मुश्किल है कि यह वास्तव में काम करता है या नहीं। इस इकाई का विषय एक डेटा वैज्ञानिक का सबसे महत्वपूर्ण कौशल है: सही मेट्रिक्स के साथ मॉडल का मूल्यांकन करना, विश्वसनीय पूर्वानुमानित प्रदर्शन प्राप्त करना, और सबसे घातक जाल को पकड़ना: ओवरलर्निंग (याद रखना)। एआई मेट्रिक्स की गणना, व्याख्या और तुलना करता है; लेकिन यह तय करना मानव पर निर्भर है कि आपके व्यवसाय के लिए कौन सा मीट्रिक सही है और क्या कोई मॉडल "काफी अच्छा" है। गलत मीट्रिक को देखने वाली एक टीम कई महीनों तक खराब मॉडल को "सफलता" मानने की गलती कर सकती है।
सटीकता पर्याप्त क्यों नहीं है: भ्रम मैट्रिक्स
वर्गीकरण में दिमाग में आने वाली पहली मीट्रिक सटीकता (सटीकता - सही भविष्यवाणियों का कुल अनुपात) है। लेकिन जैसा कि हमने इकाई 6 में देखा, असंतुलित डेटा के साथ सटीकता भ्रामक है। एक बेहतर शुरुआत कन्फ्यूजन मैट्रिक्स है - एक तालिका जो भविष्यवाणियों को चार डिब्बों में विभाजित करती है:
- सच्चा सकारात्मक (टीपी): हमने उसे नकली कहा जो वास्तव में नकली है। (अच्छा)
- सच्चा नकारात्मक (टीएन): हमने कहा वास्तव में साफ। (अच्छा)
- गलत सकारात्मक (एफपी): हमने गलती से कहा कि साफ वाला नकली था। (झूठा अलार्म)
- गलत नकारात्मक (एफएन): हमने नकली को नजरअंदाज कर दिया और इसे साफ कहा। (चूकी गई धमकी)
इन चार बक्सों से दो प्रमुख मेट्रिक्स प्राप्त होते हैं। परिशुद्धता: "जिसे मैं नकली कहता हूं उसमें से वास्तव में कितना नकली है?" - यदि गलत अलार्म की लागत अधिक है तो यह महत्वपूर्ण है। संवेदनशीलता (अंग्रेजी में याद करें): "मैंने कितने असली नकली पकड़े?" — महत्वपूर्ण है जब किसी खतरे को चूकना महंगा हो। दोनों अक्सर एक-दूसरे के विरोधी होते हैं: यदि आप सीमा कम करते हैं और अधिक "नकली" कहते हैं, तो याददाश्त बढ़ जाती है लेकिन सटीकता कम हो जाती है। F1 स्कोर इन दोनों का संतुलित औसत (हार्मोनिक माध्य) है।
ध्यान दें: "कौन सा मीट्रिक महत्वपूर्ण है" प्रश्न का उत्तर एक व्यावसायिक निर्णय है, तकनीकी नहीं। कैंसर स्क्रीनिंग में कोई केस छूट जाना (कम याद रखना) विनाशकारी है; स्पैम फ़िल्टर में एक महत्वपूर्ण ईमेल को स्पैम (कम परिशुद्धता) में भेजना कष्टप्रद है। लागत मीट्रिक निर्धारित करती है.
प्रतिगमन मेट्रिक्स
यदि आउटपुट संख्या है, तो विभिन्न मैट्रिक्स का उपयोग किया जाता है। एमएई (मीन एब्सोल्यूट एरर): एक ही इकाई में अनुमान वास्तविक औसत से कितना विचलित होता है (उदाहरण के लिए "हम औसतन 4,200 टीएल गलत हैं")। आरएमएसई (रूट मीन स्क्वैर्ड एरर): प्रमुख त्रुटियों को अधिक गंभीर रूप से दंडित करता है और आउटलेर्स के प्रति संवेदनशील है। आर² (आर-वर्ग - निर्धारण का गुणांक): मॉडल लक्ष्य में कितनी परिवर्तनशीलता बताता है (1 के करीब अच्छा है, 0 माध्य की भविष्यवाणी करने जितना बुरा है, नकारात्मक और भी बदतर है)।
सबसे कपटपूर्ण जाल: अत्यधिक सीखना
ओवरफिटिंग - जहां मॉडल प्रशिक्षण डेटा को याद रखता है लेकिन नए डेटा पर विफल रहता है - डेटा विज्ञान में सबसे आम गलती है। लक्षण स्पष्ट है: मॉडल प्रशिक्षण सेट (98%) पर अच्छा है, परीक्षण सेट (72%) पर खराब है। मॉडल ने उस विशेष नमूने के शोर को याद किया है, न कि डेटा में वास्तविक पैटर्न को। इसके विपरीत भी है: अंडरफिटिंग-मॉडल प्रशिक्षण और परीक्षण दोनों में खराब है क्योंकि पैटर्न को पकड़ना बहुत आसान है।
ओवरलर्निंग से निपटने के तरीके: मॉडल को सरल बनाना, अधिक डेटा, नियमितीकरण - गणितीय ब्रेक जो मॉडल को बहुत जटिल होने से बचाता है - और सबसे महत्वपूर्ण, क्रॉस-सत्यापन।
क्रॉस-सत्यापन: एकल फलक पर भरोसा न करें
एक एकल प्रशिक्षण/परीक्षण पॉड भाग्यशाली या अशुभ हो सकता है; आप परीक्षण सेट के लिए उच्च अंक केवल इसलिए प्राप्त कर सकते हैं क्योंकि वह नमूना आसान है। क्रॉस-वैलिडेशन (संक्षेप में सीवी) इसका समाधान करता है। सबसे आम रूप के-फ़ोल्ड सीवी है: डेटा को के भागों में विभाजित किया गया है (जैसे 5); प्रत्येक दौर में, एक भाग परीक्षण है और शेष भाग प्रशिक्षण है; यह 5 बार रोल करता है और 5 अंक औसत होते हैं। तो आप देखेंगे कि प्रदर्शन कई विभाजनों के औसत पर आधारित है, न कि एक भाग्यशाली विभाजन पर। स्कोर का वितरण भी जानकारीपूर्ण है: बहुत अस्थिर स्कोर (एक मंजिल पर 85%, दूसरे पर 62%) इंगित करता है कि मॉडल अस्थिर है।
सामान्य के-फ़ोल्ड का उपयोग समय श्रृंखला में नहीं किया जाता है (भविष्य को लीक करता है); इसके बजाय, आप "फॉरवर्ड चेनिंग" (समय श्रृंखला विभाजन) करते हैं: हमेशा अतीत के साथ प्रशिक्षण और भविष्य का परीक्षण करते हैं।
मीट्रिक
समस्या का प्रकार
इससे कब फर्क पड़ता है?
सटीकता
वर्गीकरण
यदि कक्षाएं संतुलित हैं
परिशुद्धता
वर्गीकरण
झूठा अलार्म महंगा है
संवेदनशीलता (याद रखें)
वर्गीकरण
यदि चूकना महँगा है
एफ1
वर्गीकरण
यदि संतुलन की आवश्यकता है
एम.ए.ई
प्रतिगमन
व्याख्या करने योग्य त्रुटि
आरएमएसई
प्रतिगमन
अगर बड़ी गलतियाँ गंभीर हैं
आर²
प्रतिगमन
व्याख्यात्मक शक्ति
तीन मिनी मामले
केस 1 - उच्च सटीकता का भ्रम। एक धोखाधड़ी मॉडल ने 99.2% सटीकता दिखाई और टीम ने जश्न मनाया। भ्रम मैट्रिक्स को देखते हुए, डेटा में वास्तविक: नकली दर 0.8% थी; मॉडल ने लगभग कोई नकली चीज़ नहीं पकड़ी, केवल "सब साफ़" कहा। रिकॉल 6% था. सबक: मेट्रिक्स को देखें, सटीकता को नहीं।
केस 2 - अव्यक्त अधिगम। एक टीम ने प्रशिक्षण सेट पर XGBoost को 97% तक बढ़ाया और बढ़ाया। परीक्षण सेट 69% था, लेकिन किसी ने नहीं देखा। मॉडल उत्पादन में ध्वस्त हो गया। यदि क्रॉस-वैलिडेशन किया गया होता, तो फोल्ड (ओवरलर्निंग) के बीच बड़ा अंतर शुरू से ही दिखाई देता। पाठ: सीवी और टेस्ट स्कोर पर भरोसा करें, शिक्षा स्कोर पर नहीं।
केस 3 - लकी स्प्लिट। एक विश्लेषक एक ही विभाजन में 88% प्राप्त करके प्रसन्न हुआ। जब उनके सहकर्मी ने 5-गुना सीवी बनाया, तो स्कोर 88%, 71%, 83%, 64%, 79% थे - औसत 77% है, लेकिन यह बहुत अस्थिर है। मॉडल अस्थिर था; एकल डिब्बा भ्रामक था. पाठ: सीवी माध्य और वितरण को देखें, व्यक्तिगत बिन को नहीं।
चार प्रतिलिपि योग्य टेम्पलेट
1) पूर्ण वर्गीकरण रिपोर्ट:
मेरे पास प्रशिक्षित मॉडल और परीक्षण सेट है। उत्पन्न करें: भ्रम मैट्रिक्स, सटीकता, रिकॉल, F1 (प्रत्येक वर्ग के लिए) और समर्थन गणना। मैं अनुमान लगा रहा हूं, लेकिन यह मुझ पर निर्भर है: मैं आपको बताऊंगा कि कौन सा मीट्रिक महत्वपूर्ण है। ध्यान दें कि असंतुलित डेटा के साथ सटीकता भ्रामक हो सकती है।
2) अधिगम नियंत्रण:
मेरे मॉडल के स्कोर को प्रशिक्षण और परीक्षण दोनों सेटों में एक साथ प्रिंट करें। उनके बीच के अंतर की गणना करें और चेतावनी दें कि बड़ा अंतर अधिक सीखने का संकेत है। यदि अंतर बड़ा है तो नियमितीकरण या सरलीकरण का सुझाव दें।
3) क्रॉस सत्यापन:
5-गुना क्रॉस-सत्यापन करें (स्तरीकृत, वर्गीकरण के लिए)। प्रत्येक तह का स्कोर, माध्य और मानक विचलन प्रिंट करें। यदि स्कोर बहुत अस्थिर (उच्च एसटीडी) हैं, तो इंगित करें कि मॉडल अस्थिर है। पाइपलाइनों का उपयोग करें ताकि परिवर्तन केवल प्रत्येक परत पर प्रशिक्षण भाग से सीखे जा सकें।
4) बेसलाइन तुलना:
मेरे मॉडल की मीट्रिक को DummyClassifier बेसलाइन के साथ-साथ रखें। क्या मॉडल बेसलाइन को महत्वपूर्ण रूप से मात देता है? यदि यह पास नहीं होता है, तो यह स्पष्ट कर दें कि मॉडल कोई वास्तविक मूल्य नहीं जोड़ता है।
कमजोर संकेत/मजबूत संकेत
कमजोर संकेत:
क्या मेरा मॉडल अच्छा है?
"अच्छा" अपरिभाषित है; यह स्पष्ट नहीं है कि कौन सी मीट्रिक, कौन सी सीमा, कौन सी आधार रेखा। एआई एक सटीकता संख्या दे सकता है और गुमराह कर सकता है।
शक्तिशाली संकेत:
आपकी भूमिका: मूल्यांकन सहायक। वर्गीकरण, असंतुलित डेटा (12% सकारात्मक)। प्राथमिकता: याद दिलाना (सकारात्मकता को न खोना)। कार्य: (1) भ्रम मैट्रिक्स, (2) सटीक/रिकॉल/एफ1, (3) 5-गुना स्तरीकृत सीवी माध्य और एसटीडी, (4) डमीक्लासिफायर बेसलाइन तुलना। रिकॉल और बेसलाइन अंतर पर ध्यान दें, सटीकता पर नहीं। टिप्पणी करें, लेकिन अंतिम निर्णय मैं करूँगा।
यहां, मीट्रिक प्राथमिकता, सीवी और आधारभूत स्थिति स्पष्ट है।
सामान्य गलतियाँ
- असंतुलित डेटा में सटीकता पर भरोसा करना। 99% सटीकता अल्पसंख्यक वर्ग पर बिल्कुल भी कब्जा नहीं कर सकती है; भ्रम मैट्रिक्स को देखो.
- बस आपके शिक्षा स्कोर को देख रहा हूँ। उच्च शिक्षा, कम टेस्ट स्कोर ओवरलर्निंग है; हमेशा दो अंकों की तुलना करें.
- एक डिब्बे पर निर्भर. भाग्यशाली विभाजन भ्रामक है; क्रॉस-सत्यापन के साथ माध्य और वितरण को देखें।
- बेसलाइन से तुलना नहीं. आप यह जाने बिना "अच्छा" नहीं कह सकते कि मॉडल एक मूर्ख भविष्यवक्ता को मात देता है या नहीं।
- समय श्रृंखला पर सामान्य k-फोल्ड का उपयोग करना। यह भविष्य को लीक करता है; समय श्रृंखला विभाजन आवश्यक है.
युक्ति: प्रत्येक मॉडल के आगे तीन संख्याएँ लिखें: प्रशिक्षण स्कोर, क्रॉस-सत्यापन औसत और बेसलाइन स्कोर। यह तिकड़ी एक नज़र में अधिक सीखने (प्रशिक्षण >> सीवी) और कम मूल्यांकन (सीवी ≈ बेसलाइन) का खुलासा करती है।
संक्षेप में
एक मॉडल बनाना आसान है, लेकिन उसका ईमानदारी से मूल्यांकन करना कठिन है। वर्गीकरण में, भ्रम मैट्रिक्स, सटीकता और स्मरण सटीकता की तुलना में बहुत अधिक जानकारीपूर्ण हैं; कार्य की लागत यह निर्धारित करती है कि कौन सा कार्य महत्वपूर्ण है। MAE, RMSE और R² का उपयोग प्रतिगमन में किया जाता है। सबसे कपटपूर्ण जाल अति-सीखना है: हमेशा प्रशिक्षण और परीक्षण स्कोर की तुलना करें। क्रॉस-वैलिडेशन के माध्य और वितरण पर भरोसा करें, एक भी विभाजन पर नहीं; हर चीज़ की तुलना आधार रेखा से करें. एआई इन सभी की गणना करता है, लेकिन यह मानव पर निर्भर है कि वह किस मीट्रिक का उपयोग करे।
आवेदन कार्य
एक वर्गीकरण मॉडल के लिए भ्रम मैट्रिक्स, परिशुद्धता, रिकॉल और एफ 1 निकालें; फिर 5-गुना क्रॉस-सत्यापन करें और सभी तहों में स्कोर वितरण देखें। अंत में, प्रशिक्षण स्कोर, सीवी औसत और बेसलाइन स्कोर को एक साथ लिखें। एक वाक्य में टिप्पणी करें कि क्या आपका मॉडल अधिक सीख रहा है और बेसलाइन पास कर रहा है।
जांच सूची
- [ ] क्या मैंने सटीकता के बजाय कार्य की वास्तविक मीट्रिक (परिशुद्धता/रिकॉल/एफ1 आदि) पर ध्यान दिया है?
- [ ] क्या मैंने भ्रम मैट्रिक्स की जांच की है?
- [ ] क्या मैंने प्रशिक्षण और परीक्षण स्कोर की तुलना की है और अधिक सीखने की जाँच की है?
- [ ] क्या मैंने क्रॉस-वैलिडेशन के साथ माध्य और वितरण को देखा है?
- [ ] क्या मैंने मॉडल की तुलना आधार रेखा से की है?