नफा:
- समस्या प्रकार आणि व्यवसाय संदर्भासाठी योग्य मेट्रिक निवडण्याची क्षमता (पीआर-एयूसी/असंतुलित डेटामध्ये रिकॉल, एमएई/आरएमएसई रिग्रेशनमध्ये) आणि ओव्हर/अंडर लर्निंग ओळखणे
- प्रत्येक मेट्रिकचा आधाररेखा विरुद्ध अर्थ लावण्याची आणि विचलन मोजण्याची क्षमता आणि क्रॉस-व्हॅलिडेशनसह प्रगतीपासून वेगळे आवाज
- व्हॅलिडेशन सेटसह हायपरपॅरामीटर्स ट्यून करून आणि फक्त शेवटी चाचणी सेट वापरून आशावादी नसलेल्या परिणामांची तक्रार करण्याची क्षमता
मॉडेल प्रशिक्षण (प्रशिक्षण: डेटामधून नमुने शिकण्याची प्रक्रिया) ही एमएल अभियांत्रिकीची सर्वात दृश्यमान परंतु सर्वात दिशाभूल करणारी पायरी आहे. असे दिसते कारण ते "अचूकता 95%" सारखी समाधानकारक संख्या तयार करते. दिशाभूल करणारी कारण ती संख्या अनेकदा चुकीच्या प्रश्नाचे योग्य उत्तर असते. या घटकामध्ये अभियांत्रिकी शाखेसह शिक्षण आणि मूल्यमापनाची चर्चा केली जाते; आम्ही प्रायोगिक डिझाईनमध्ये भागीदार म्हणून आर्टिफिशियल इंटेलिजेंसचा वापर करतो आणि मापनावर निर्णय घेतो.
प्रशिक्षण चक्राचे तर्कशास्त्र
मॉडेल नुकसान फंक्शन कमी करून डेटामधील पॅटर्न शिकतो: एक फंक्शन जे मॉडेलच्या त्रुटीचे मोजमाप करते. ऑप्टिमायझेशन अल्गोरिदम (उदा. ग्रेडियंट डिसेंट) टप्प्याटप्प्याने पॅरामीटर्स समायोजित करून नुकसान कमी करते. प्रशिक्षण डेटा लक्षात ठेवणे हे उद्दिष्ट नाही, परंतु अभूतपूर्व डेटामध्ये सामान्यीकरण करणे आहे.
दोन मुख्य धोके:
- ओव्हरफिटिंग: मॉडेल प्रशिक्षण डेटा लक्षात ठेवते आणि नवीन डेटावर अपयशी ठरते. प्रशिक्षण यश जास्त आहे, सत्यापन यश कमी आहे.
- अंडरफिटिंग: मॉडेल नमुना कॅप्चर करू शकत नाही; प्रशिक्षण आणि प्रमाणीकरण यश दोन्ही कमी आहेत.
शिल्लक शोधणे ही शिक्षणाची कला आहे. या शिल्लकचे निरीक्षण करण्यासाठी प्रमाणीकरण संच आहे: प्रशिक्षण यश वाढत असताना प्रमाणीकरण यश कमी होण्यास सुरुवात झाली, तर अतिशिक्षण सुरू झाले आहे.
टीप: प्रत्येक टप्प्यावर प्रशिक्षण आणि प्रमाणीकरण नुकसान एकत्रितपणे प्लॉट करा. ज्या बिंदूवर दोन वक्र वेगळे होऊ लागतात तेथून अत्याधिक शिक्षण सुरू होते आणि "लवकर थांबण्यासाठी" योग्य क्षण आहे.
मेट्रिक निवड: सर्वात गंभीर निर्णय
चुकीच्या मेट्रिकमुळे चांगले मॉडेल खराब दिसते आणि वाईट मॉडेल चांगले दिसते. समस्या मेट्रिक निर्धारित करते:
- असंतुलित वर्गीकरण (एक वर्ग अत्यंत दुर्मिळ आहे, उदा. फसवणूक): अचूकता दिशाभूल करणारी आहे. "कॉल एव्हरीथिंग नॉर्मल" म्हणणाऱ्या मॉडेलला ९९% अचूकता मिळेल पण एकही फसवणूक होणार नाही. त्याऐवजी, अचूकता (मी जे पकडले त्यातील किती सकारात्मक आहे), रिकॉल (मी जे पकडले त्यातील किती खरे सकारात्मक आहे) आणि त्यांचे शिल्लक F1 किंवा PR-AUC वापरले जातात.
- संतुलित वर्गीकरण: अचूकता आणि ROC-AUC योग्य असू शकतात.
- प्रतिगमन (संख्या अंदाज): MAE (म्हणजे परिपूर्ण त्रुटी), RMSE (मोठ्या त्रुटींना दंडित करते), MAPE (टक्केवारी त्रुटी).
- रँकिंग/शिफारस: NDCG, MRR, Recall@K.
तंतोतंत किंवा स्मरण महत्त्वाचे आहे की नाही हे व्यवसायाच्या संदर्भावर अवलंबून असते. कॅन्सर स्क्रीनिंगमध्ये रिकॉल (कोणतेही रुग्ण गहाळ नाही) हे प्राधान्य आहे; स्पॅम फिल्टरमध्ये अचूकता (स्पॅमला महत्त्वाचे ई-मेल न पाठवणे) महत्त्वाचे आहे. हा एक व्यावसायिक निर्णय आहे, तांत्रिक नाही आणि अभियंता आणि मालक यांनी एकत्रितपणे घेतलेला आहे.
कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट
कमकुवत प्रॉम्प्ट: "माझ्या मॉडेलच्या कार्यक्षमतेचे मूल्यांकन करा, अचूकता 0.97."
शक्तिशाली प्रॉम्प्ट: "माझ्याकडे फसवणूक शोध मॉडेल आहे; सकारात्मक वर्ग दर 1.5% आहे. अचूकता 0.97 म्हणून नोंदवली गेली आहे. हे मेट्रिक दिशाभूल करणारे का असू शकते ते स्पष्ट करा, मला कोणते मेट्रिक्स (सुस्पष्टता, रिकॉल, PR-AUC) प्राधान्य द्यावे आणि का ते मला सांगा. तसेच 'कॉललाइन मॉडेल' वर किती अचूक आहे याची गणना करा, त्यामुळे या मॉडेलवर प्रत्येक गोष्ट नकारात्मक दिसेल.
फरक: शक्तिशाली प्रॉम्प्ट वर्ग गुणोत्तर आणि व्यवसाय संदर्भ देते; हे बेसलाइन मॉडेल तुलना देखील विचारते — मेट्रिक अर्थपूर्ण आहे की नाही यासाठी हे सर्वात महत्वाचे अँकर आहे.
बेसलाइन: तुलना न करता मेट्रिक अर्थहीन आहे
मेट्रिक स्वतःच चांगला किंवा वाईट नसतो; मूलभूत मॉडेलनुसार ते चांगले किंवा वाईट आहे. मूळ मॉडेल हा सर्वात सोपा उपाय आहे जो मनात येतो: "नेहमी बहुसंख्य वर्गाला सांगा", "गेल्या आठवड्याच्या मूल्याची पुनरावृत्ती करा", "मीन अंदाज लावा". जर तुमचे मॉडेल हे सोपे उपाय स्पष्टपणे पार करू शकत नसेल, तर सर्व जटिलता व्यर्थ आहे.
खबरदारी: "माझे मॉडेल 85% अचूक आहे" हे वाक्य स्वतःच काहीही सांगत नाही. जर बेस मॉडेलला आधीपासूनच 84% मिळाले, तर तुमचे मॉडेल जवळजवळ नालायक आहे; बेस मॉडेलला ५०% मिळाले तर, तुमचे मॉडेल परिपूर्ण आहे. नेहमी मूलभूत मॉडेलच्या संदर्भात बोला.
क्रॉस-प्रमाणीकरण आणि विश्वास
एकच प्रशिक्षण/चाचणी विभाजन संधीमुळे असू शकते. क्रॉस-व्हॅलिडेशन: डेटाचे k भागांमध्ये विभागणी करणे आणि प्रत्येक भागाची अनुक्रमे चाचणी केल्याने कामगिरी किती स्थिर आहे हे दिसून येते. 5-पट क्रॉस व्हॅलिडेशनमध्ये तुम्हाला पाच वेगवेगळे स्कोअर मिळतात; त्यांचे सरासरी आणि मानक विचलन महत्वाचे आहेत. जर सरासरी 80% असेल परंतु विचलन ±12% असेल, तर तुमचे मॉडेल अस्थिर आहे — ते डेटाच्या पुढील बॅचमध्ये अगदी वेगळ्या पद्धतीने वागू शकते.
हे "दोन मॉडेल तुलना" साठी देखील गंभीर आहे. जर मॉडेल A ला 81% आणि मॉडेल B ला 82% मिळाले, तर B खरोखर चांगले आहे का? विचलन ±3% असल्यास, हा फरक आवाज असू शकतो. निर्णय घेण्यापूर्वी फरक महत्त्वपूर्ण आहे की नाही याचा विचार करा.
हायपरपॅरामीटर ट्यूनिंग: प्रमाणीकरणासह, चाचणी नाही
हायपरपॅरामीटर्स (प्रशिक्षणापूर्वी व्यक्तिचलितपणे निर्धारित केलेल्या सेटिंग्ज-शिक्षण दर, झाडाची खोली इ.) प्रमाणीकरण सेटसह सेट केले जातात. चाचणी संच फक्त एकदाच शेवटी वापरला जातो. तुम्ही चाचणी संच पाहून हायपरपॅरामीटर्स निवडल्यास, चाचणी संच दूषित होईल आणि तुम्ही नोंदवलेली कामगिरी आशावादी असेल जी प्रत्यक्षात तशी नाही.
हायपरपॅरामीटर शोध जागा डिझाइन करण्यात आणि शोध कोड (ग्रिड शोध, यादृच्छिक शोध, बायेसियन ऑप्टिमायझेशन) लिहिण्यासाठी कृत्रिम बुद्धिमत्ता एक चांगला मदतनीस आहे. पण तरीही तुम्ही ठरवा "आम्ही कोणते मेट्रिक ऑप्टिमाइझ करू?"
तीन लहान प्रकरणे
केस 1 - अचूकता सापळा. वैद्यकीय संघाला एका मॉडेलचा अभिमान होता ज्याने एक दुर्मिळ आजार शोधला: 98% अचूकता. जेव्हा मूळ मॉडेलची तुलना केली गेली तेव्हा सत्य समोर आले: रोगाचा दर 2% असल्याने, "सर्वांना निरोगी कॉल करा" असे म्हणणारे मॉडेल देखील 98% मिळाले. मॉडेलचे रिकॉल फक्त 11% होते - बहुतेक रुग्ण गहाळ होते. एकदा मेट्रिकचे PR-AUC मध्ये रूपांतर झाल्यानंतर, वास्तविक कार्यप्रदर्शन मोजले गेले आणि मॉडेल पुन्हा डिझाइन केले गेले.
केस 2 - प्रगतीसाठी चुकीचा आवाज. एका संघाने मॉडेल 86.2% वरून 86.9% पर्यंत सुधारण्यासाठी महिने घालवले. क्रॉस-व्हॅलिडेशनने दर्शविले की पूर्वाग्रह ±1.4% होता — म्हणून 0.7 पॉइंट "सुधारणा" हा सांख्यिकीय आवाज होता. संघाने अवास्तव कमाईसाठी तीन आठवडे वाया घालवले. धडा: सुधारणा विचलनापेक्षा मोठी आहे हे सत्यापित केल्याशिवाय विजय घोषित करू नका.
केस 3 - चाचणी संचाची दूषितता. सर्वोत्तम हायपरपॅरामीटर्स निवडण्यासाठी अभियंता वारंवार चाचणी संच पाहतो. 91% ते उत्पादनात 83% पर्यंत घसरले. का: त्याने नकळतपणे चाचणी संच (चाचणी संचावर अधिक शिक्षण) पाहून त्यानुसार मॉडेल निवडले होते. जेव्हा वेगळा प्रमाणीकरण संच वापरला गेला तेव्हा रिपोर्ट केलेले आणि वास्तविक कार्यप्रदर्शन ओव्हरलॅप झाले.
कॉपी करण्यायोग्य टेम्पलेट्स
या वर्गीकरण समस्येसाठी योग्य मेट्रिक निवडण्यात मला मदत करा. समस्या: [काय अंदाज आहे] वर्ग वितरण: [सकारात्मक दर
खालील दोन मॉडेल्सच्या तुलनेचे मूल्यमापन करा. मॉडेल A क्रॉस-व्हॅलिडेशन: [स्कोअरची सूची] मॉडेल बी क्रॉस-व्हॅलिडेशन: [स्कोअरची सूची] सरासरी आणि मानक विचलनाची गणना करा. फरक सांख्यिकीयदृष्ट्या महत्त्वपूर्ण आहे किंवा तो फक्त विचलनातील आवाज आहे? मी कोणते निवडण्याची शिफारस कराल आणि का?
खालील गोष्टींसाठी हा प्रशिक्षण कोड तपासा: 1) चाचणी संच किंवा प्रमाणीकरण सेटसह हायपरपॅरामीटर्स निवडले आहेत का? 2) योग्य सेटसह लवकर थांबण्याचे परीक्षण केले जाते का? 3) अतिशिक्षण (प्रशिक्षण/प्रमाणीकरण नुकसान फरक) ची काही चिन्हे आहेत का? कोड: [कोड]
या रीग्रेशन समस्येसाठी मी MAE, RMSE आणि MAPE पैकी कोणता अहवाल द्यावा? लक्ष्य व्हेरिएबलचे स्केल: [श्रेणी] मोठ्या त्रुटी असमानतेने वाईट आहेत (RMSE), किंवा त्या सर्व समान आहेत (MAE)? शून्याच्या जवळ मूल्ये आहेत (ते MAPE विकृत करतात)? थोडक्यात समर्थनासह सुचवा.
मेट्रिक निवड सारणी
समस्या प्रकार
योग्य मेट्रिक
टाळायचे
का
असंतुलित वर्गीकरण
PR-AUC, F1, रिकॉल
अचूकता
बहुसंख्य वर्ग मेट्रिक वाढवतो
संतुलित वर्गीकरण
अचूकता, ROC-AUC
-
संतुलित डेटामध्ये विश्वासार्ह
प्रतिगमन (महत्त्वपूर्ण आउटलायर)
RMSE
MAPE (शून्य असल्यास)
मोठ्या चुकांची शिक्षा देतो
प्रतिगमन (समान वजन)
MAE
-
अर्थ लावणे सोपे
रँकिंग/शिफारस
NDCG, Recall@K
अचूकता
ऑर्डर महत्वाची आहे
सामान्य चुका
- असंतुलित डेटावर अचूकता वापरणे. सर्वात सामान्य मेट्रिक त्रुटी.
- बेस मॉडेलची तुलना करत नाही. हे मेट्रिकचा अर्थ गमावते.
- हायपरपॅरामीटरसाठी चाचणी संच पहात आहे. आशावादी, अवास्तव परिणाम.
- एकाच डब्यावर विसंबून. क्रॉस-व्हॅलिडेशनशिवाय तुम्हाला पूर्वाग्रह दिसणार नाही.
- प्रगतीसाठी चुकीचा आवाज. विचलन पासून लहान "सुधारणा" बहुतेक नशीब आहेत.
- व्यवसायाच्या संदर्भाकडे दुर्लक्ष करणे. अचूकता/रिकॉल बॅलन्स हा व्यवसायाचा निर्णय आहे.
सारांशात
मॉडेल प्रशिक्षणातील खरे कौशल्य म्हणजे जास्त संख्या निर्माण करणे नव्हे, तर त्या संख्येचा अर्थ काय हे जाणून घेणे. समस्या आणि व्यवसाय संदर्भ योग्य मेट्रिक निर्धारित करतात; बेसलाइन मॉडेलनुसार प्रत्येक मेट्रिकचा अर्थ लावा; क्रॉस-व्हॅलिडेशनसह पूर्वाग्रह मोजा आणि प्रगतीसाठी आवाज चुकवू नका; चाचणी संच फक्त शेवटी, एकदाच वापरा. AI हा तुमचा प्रयोग डिझाइनमधील भागीदार आहे, परंतु "पुरेसे चांगले" चा निर्णय तुमच्यावर आणि तुमच्यावर अवलंबून आहे.
अर्ज कार्य
वर्गीकरण मॉडेलसाठी: (१) वर्ग वितरण लिहा, (२) योग्य आधार मॉडेल तयार करा आणि त्याचा स्कोअर मोजा, (३) तुमच्या मॉडेलचे ५ पट क्रॉस व्हॅलिडेशनसह मूल्यांकन करा आणि सरासरी आणि मानक विचलनाचा अहवाल द्या, (४) अचूकतेऐवजी समस्येसाठी योग्य मेट्रिकची गणना करा (उदा. PR-AUC). तुमचे मॉडेल पूर्वाग्रहाशिवाय मोठ्या फरकाने बेसलाइन मॉडेलला मागे टाकते की नाही ते लिहा.
चेकलिस्ट
- मी समस्या प्रकार आणि व्यवसाय संदर्भावर आधारित मेट्रिक निवडले.
- मी बेस मॉडेल तयार केले आणि त्याच्याशी तुलना केली.
- [ ] मी क्रॉस-व्हॅलिडेशनसह सरासरी आणि विचलन नोंदवले.
- [ ] मी पुष्टी केली की सुधारणा विचलनापेक्षा मोठी आहे.
- [ ] मी प्रमाणीकरण सेटसह हायपरपॅरामीटर्स निवडले.
- [ ] मी फक्त एकदाच चाचणी संच वापरला, अगदी शेवटी.