इकाइयाँ
1. एमएल इंजीनियरिंग में आर्टिफिशियल इंटेलिजेंस: भूमिका, सीमाएं, मान्यता और जिम्मेदारी 2. डेटा पाइपलाइन: संग्रहण, सफ़ाई, टैगिंग और संस्करणीकरण 3. मॉडल प्रशिक्षण और मूल्यांकन: सटीक मेट्रिक्स, ईमानदार बेंचमार्किंग 4. एलएलएम आवेदन: आरएजी के साथ आपके अपने डेटा के आधार पर उत्तर 5. एलएलएम एप्लीकेशन: एजेंट, टूलींग और सुरक्षित स्वचालन 6. फाइन-ट्यूनिंग आधार: कब, कैसे और किस जोखिम के साथ 7. एमएलओपीएस और परिनियोजन: मॉडल को लैब से उत्पादन तक ले जाना 8. मूल्यांकन और निगरानी: यह जानना कि मॉडल वास्तव में उत्पादन में क्या करता है 9. सुरक्षा और गोपनीयता: एआई सिस्टम का बचाव 10. पूर्वाग्रह, नैतिकता और लागत: जिम्मेदार और टिकाऊ एआई इंजीनियरिंग 11. प्रतिलिपि प्रस्तुत करने योग्यता और अंत-से-अंत परियोजना: हर चीज़ का संयोजन
इकाई 3 / 11

मॉडल प्रशिक्षण और मूल्यांकन: सटीक मेट्रिक्स, ईमानदार बेंचमार्किंग

लाभ:

  • समस्या के प्रकार और व्यावसायिक संदर्भ के लिए उपयुक्त मीट्रिक चुनने की क्षमता (असंतुलित डेटा में पीआर-एयूसी/रिकॉल, प्रतिगमन में एमएई/आरएमएसई) और अधिक/कम सीखने की पहचान करना
  • आधार रेखा के विरुद्ध प्रत्येक मीट्रिक की व्याख्या करने और क्रॉस-सत्यापन के साथ विचलन को मापने और प्रगति से शोर को अलग करने की क्षमता
  • सत्यापन सेट के साथ हाइपरपैरामीटर को ट्यून करके और केवल अंत में परीक्षण सेट का उपयोग करके गैर-आशावादी परिणामों की रिपोर्ट करने की क्षमता

मॉडल प्रशिक्षण (प्रशिक्षण: डेटा से पैटर्न सीखने की प्रक्रिया) एमएल इंजीनियरिंग का सबसे दृश्यमान लेकिन सबसे भ्रामक कदम है। ऐसा प्रतीत होता है क्योंकि यह "सटीकता 95%" जैसी संतोषजनक संख्या उत्पन्न करता है। भ्रामक क्योंकि वह संख्या अक्सर गलत प्रश्न का सही उत्तर होती है। इस इकाई में, इंजीनियरिंग अनुशासन के साथ शिक्षा और मूल्यांकन पर चर्चा की गई है; हम प्रायोगिक डिजाइन में एक भागीदार के रूप में कृत्रिम बुद्धिमत्ता का उपयोग करते हैं और माप के आधार पर निर्णय लेते हैं।

प्रशिक्षण चक्र का तर्क

एक मॉडल हानि फ़ंक्शन को कम करके डेटा में पैटर्न सीखता है: एक फ़ंक्शन जो संख्यात्मक रूप से मॉडल की त्रुटि को मापता है। अनुकूलन एल्गोरिथ्म (जैसे ग्रेडिएंट डिसेंट) चरण दर चरण मापदंडों को समायोजित करके नुकसान को कम करता है। इसका उद्देश्य प्रशिक्षण डेटा को याद रखना नहीं है, बल्कि इसे अभूतपूर्व डेटा के रूप में सामान्यीकृत करना है।

दो मुख्य खतरे:

  • ओवरफिटिंग: मॉडल प्रशिक्षण डेटा को याद रखता है और नए डेटा पर विफल रहता है। प्रशिक्षण की सफलता अधिक है, सत्यापन की सफलता कम है।
  • अंडरफ़िटिंग: मॉडल पैटर्न को कैप्चर नहीं कर सकता; प्रशिक्षण और सत्यापन दोनों की सफलता कम है।

संतुलन ढूँढना शिक्षा की कला है। इस संतुलन की निगरानी के लिए सत्यापन सेट मौजूद है: यदि प्रशिक्षण की सफलता बढ़ने के साथ-साथ सत्यापन की सफलता कम होने लगती है, तो ओवरलर्निंग शुरू हो गई है।

युक्ति: प्रत्येक चरण में प्रशिक्षण और सत्यापन हानि को एक साथ प्लॉट करें। वह बिंदु जिस पर दोनों वक्र अलग-अलग होने लगते हैं, वहीं से अधिक सीखना शुरू होता है और यह "जल्दी रुकने" का सही समय है।

मीट्रिक चयन: सबसे महत्वपूर्ण निर्णय

गलत मीट्रिक एक अच्छे मॉडल को ख़राब और एक ख़राब मॉडल को अच्छा बनाती है। समस्या मीट्रिक निर्धारित करती है:

  • असंतुलित वर्गीकरण (एक वर्ग बहुत दुर्लभ है, उदाहरण के लिए धोखाधड़ी): सटीकता भ्रामक है। एक मॉडल जो कहता है कि "सब कुछ सामान्य कहें" तो उसे 99% सटीकता मिलेगी लेकिन एक भी धोखाधड़ी नहीं पकड़ी जाएगी। इसके बजाय, परिशुद्धता (मैंने जो पकड़ा उसमें से कितना वास्तव में सकारात्मक है), याद रखें (मैंने जो पकड़ा उसमें से कितना वास्तविक सकारात्मक है) और उनके संतुलन एफ 1 या पीआर-एयूसी का उपयोग किया जाता है।
  • संतुलित वर्गीकरण: सटीकता और आरओसी-एयूसी उपयुक्त हो सकते हैं।
  • प्रतिगमन (संख्या अनुमान): एमएई (मतलब पूर्ण त्रुटि), आरएमएसई (बड़ी त्रुटियों को दंडित करता है), एमएपीई (प्रतिशत त्रुटि)।
  • रैंकिंग/सिफारिश: एनडीसीजी, एमआरआर, रिकॉल@के।

परिशुद्धता या स्मरण महत्वपूर्ण है या नहीं यह व्यावसायिक संदर्भ पर निर्भर करता है। कैंसर की जांच में रिकॉल (किसी भी मरीज को न छोड़ना) एक प्राथमिकता है; स्पैम फ़िल्टर में परिशुद्धता (महत्वपूर्ण ई-मेल को स्पैम में न भेजना) महत्वपूर्ण है। यह एक व्यावसायिक निर्णय है, तकनीकी नहीं, और इंजीनियर और मालिक द्वारा मिलकर लिया गया है।

कमजोर संकेत/मजबूत संकेत

कमजोर संकेत: "मेरे मॉडल के प्रदर्शन का मूल्यांकन करें, सटीकता 0.97।"

शक्तिशाली संकेत: "मेरे पास एक धोखाधड़ी का पता लगाने वाला मॉडल है; सकारात्मक वर्ग दर 1.5% है। सटीकता 0.97 बताई गई है। बताएं कि यह मीट्रिक भ्रामक क्यों हो सकता है, मुझे बताएं कि मुझे कौन से मीट्रिक (सटीक, रिकॉल, पीआर-एयूसी) पसंद करना चाहिए और क्यों। यह भी गणना करें कि इस डेटा पर 'कॉल एवरीथिंग नेगेटिव' बेसलाइन मॉडल कितना सटीक होगा, ताकि मैं वास्तविक जोड़ा गया मूल्य देख सकूं।"

अंतर: शक्तिशाली संकेत वर्ग अनुपात और व्यावसायिक संदर्भ देता है; यह बेसलाइन मॉडल तुलना के लिए भी पूछता है - यह एक मीट्रिक सार्थक है या नहीं, इसके लिए सबसे महत्वपूर्ण एंकर है।

आधार रेखा: तुलना के बिना मीट्रिक अर्थहीन है

कोई मीट्रिक अपने आप में अच्छी या बुरी नहीं होती; बुनियादी मॉडल के अनुसार यह अच्छा या बुरा है। मूल मॉडल सबसे सरल समाधान है जो दिमाग में आता है: "हमेशा बहुसंख्यक वर्ग को बताएं", "पिछले सप्ताह के मूल्य को दोहराएं", "माध्य का अनुमान लगाएं"। यदि आपका मॉडल इस सरल समाधान को स्पष्ट रूप से पारित नहीं कर सकता है, तो सारी जटिलता व्यर्थ है।

सावधानी: वाक्य "मेरा मॉडल 85% सटीक है" अपने आप में कुछ नहीं कहता है। यदि बेस मॉडल पहले से ही 84% प्राप्त करता है, तो आपका मॉडल लगभग बेकार है; यदि बेस मॉडल को 50% मिलता है, तो आपका मॉडल एकदम सही है। हमेशा बुनियादी मॉडल के संदर्भ में बोलें।

क्रॉस-सत्यापन और विश्वास

एकल प्रशिक्षण/परीक्षण विभाजन संयोगवश हो सकता है। क्रॉस-वैलिडेशन: डेटा को k भागों में विभाजित करना और प्रत्येक भाग का क्रमिक रूप से परीक्षण करना दिखाता है कि प्रदर्शन कितना स्थिर है। 5-गुना क्रॉस सत्यापन में आपको पांच अलग-अलग स्कोर मिलते हैं; उनका माध्य और मानक विचलन महत्वपूर्ण हैं। यदि औसत 80% है लेकिन विचलन ±12% है, तो आपका मॉडल अस्थिर है - यह डेटा के अगले बैच में बहुत अलग व्यवहार कर सकता है।

यह "दो मॉडल तुलना" के लिए भी महत्वपूर्ण है। यदि मॉडल ए को 81% और मॉडल बी को 82% अंक मिले हैं, तो क्या बी वास्तव में बेहतर है? यदि विचलन ±3% है, तो यह अंतर शोर हो सकता है। निर्णय लेने से पहले विचार करें कि क्या अंतर महत्वपूर्ण है।

हाइपरपैरामीटर ट्यूनिंग: सत्यापन के साथ, परीक्षण के साथ नहीं

हाइपरपैरामीटर (प्रशिक्षण से पहले मैन्युअल रूप से निर्धारित सेटिंग्स-सीखने की दर, पेड़ की गहराई, आदि) सत्यापन सेट के साथ सेट किए जाते हैं। परीक्षण सेट का उपयोग अंत में केवल एक बार किया जाता है। यदि आप परीक्षण सेट को देखकर हाइपरपैरामीटर का चयन करते हैं, तो परीक्षण सेट दूषित हो जाएगा और आपके द्वारा रिपोर्ट किया गया प्रदर्शन आशावादी होगा जो वास्तव में ऐसा नहीं है।

हाइपरपैरामीटर खोज स्थान को डिज़ाइन करने और खोज कोड (ग्रिड खोज, यादृच्छिक खोज, बायेसियन अनुकूलन) लिखने में कृत्रिम बुद्धिमत्ता एक अच्छी सहायक है। लेकिन आप अभी भी तय करते हैं कि "हम किस मीट्रिक को अनुकूलित करेंगे?"

तीन मिनी मामले

केस 1 - सटीकता का जाल। एक मेडिकल टीम को उस मॉडल पर गर्व था जिसने एक दुर्लभ बीमारी का पता लगाया: 98% सटीकता। जब बुनियादी मॉडल की तुलना की गई, तो सच्चाई सामने आई: चूंकि बीमारी की दर 2% थी, इसलिए "सभी को स्वस्थ कहें" कहने वाले मॉडल को भी 98% प्राप्त हुआ। मॉडल का रिकॉल केवल 11% था - अधिकांश मरीज़ गायब थे। एक बार जब मीट्रिक को पीआर-एयूसी में बदल दिया गया, तो वास्तविक प्रदर्शन को मापा गया और मॉडल को फिर से डिजाइन किया गया।

केस 2 - शोर को प्रगति समझ लेना। एक टीम ने मॉडल को 86.2% से 86.9% तक सुधारने में कई महीने लगाए। क्रॉस-सत्यापन से पता चला कि पूर्वाग्रह ±1.4% था - इसलिए 0.7 अंक "सुधार" सांख्यिकीय शोर था। टीम ने अवास्तविक कमाई पर तीन सप्ताह बर्बाद कर दिए थे। सबक: यह पुष्टि किए बिना जीत की घोषणा न करें कि सुधार विचलन से बड़ा है।

केस 3 - परीक्षण सेट का संदूषण। सर्वोत्तम हाइपरपैरामीटर चुनने के लिए एक इंजीनियर ने बार-बार परीक्षण सेट को देखा। इसके अनुसार 91% उत्पादन घटकर 83% रह गया। क्यों: उसने टेस्ट सेट को बार-बार देखकर (टेस्ट सेट पर ओवरलर्निंग) अनजाने में उसके अनुसार मॉडल का चयन कर लिया था। जब एक अलग सत्यापन सेट का उपयोग किया गया तो रिपोर्ट किया गया और वास्तविक प्रदर्शन ओवरलैप हो गया।

कॉपी करने योग्य टेम्पलेट

इस वर्गीकरण समस्या के लिए सही मीट्रिक चुनने में मेरी सहायता करें। समस्या: [क्या भविष्यवाणी की गई है] वर्ग वितरण: [सकारात्मक दर

निम्नलिखित दो मॉडलों की तुलना का मूल्यांकन करें। मॉडल ए क्रॉस-सत्यापन: [स्कोर की सूची] मॉडल बी क्रॉस-सत्यापन: [स्कोर की सूची] माध्य और मानक विचलन की गणना करें। क्या अंतर सांख्यिकीय रूप से महत्वपूर्ण है या यह विचलन के भीतर सिर्फ शोर है? आप इनमें से किसे चुनने की अनुशंसा करेंगे और क्यों?

निम्नलिखित के लिए इस प्रशिक्षण कोड की जाँच करें: 1) क्या हाइपरपैरामीटर परीक्षण सेट या सत्यापन सेट के साथ चुने गए हैं? 2) क्या जल्दी रुकने की निगरानी सही सेट के साथ की गई है? 3) क्या ओवरलर्निंग (प्रशिक्षण/सत्यापन हानि अंतर) के कोई संकेत हैं? कोड: [कोड]

इस प्रतिगमन समस्या के लिए मुझे एमएई, आरएमएसई और एमएपीई में से किसकी रिपोर्ट करनी चाहिए? लक्ष्य चर का पैमाना: [श्रेणी] क्या बड़ी त्रुटियां असमान रूप से खराब हैं (आरएमएसई), या क्या वे सभी समान हैं (एमएई)? क्या शून्य के करीब मूल्य हैं (क्या वे एमएपीई को विकृत करते हैं)? संक्षिप्त औचित्य के साथ सुझाव दें।

मीट्रिक चयन तालिका

समस्या का प्रकार

उपयुक्त मीट्रिक

बचना होगा

क्यों

असंतुलित वर्गीकरण

पीआर-एयूसी, एफ1, रिकॉल

सटीकता

बहुसंख्यक वर्ग मीट्रिक को बढ़ाता है

संतुलित वर्गीकरण

सटीकता, आरओसी-एयूसी

संतुलित डेटा में विश्वसनीय

प्रतिगमन (महत्वपूर्ण बाह्य)

आरएमएसई

एमएपीई (यदि शून्य)

बड़ी गलतियों की सजा देता है

प्रतिगमन (समान वजन)

एम.ए.ई

व्याख्या करना आसान है

रैंकिंग/सिफारिश

एनडीसीजी, रिकॉल@के

सटीकता

आदेश महत्वपूर्ण है

सामान्य गलतियाँ

  • असंतुलित डेटा पर सटीकता का उपयोग करना। सबसे आम मीट्रिक त्रुटि.
  • आधार मॉडल की तुलना नहीं करना। इससे मीट्रिक अपना अर्थ खो देता है।
  • हाइपरपैरामीटर के लिए परीक्षण सेट को देख रहे हैं। आशावादी, अवास्तविक परिणाम.
  • एक डिब्बे पर निर्भर. क्रॉस-वैलिडेशन के बिना आपको पूर्वाग्रह नहीं दिखेगा।
  • शोर को प्रगति समझ लेना। विचलन से छोटे "सुधार" अधिकतर भाग्य होते हैं।
  • व्यावसायिक सन्दर्भ को नजरअंदाज करना। परिशुद्धता/रिकॉल बैलेंस एक व्यावसायिक निर्णय है।

संक्षेप में

मॉडल प्रशिक्षण में वास्तविक कौशल उच्च संख्या उत्पन्न करना नहीं है, बल्कि यह जानना है कि उस संख्या का क्या अर्थ है। समस्या और व्यावसायिक संदर्भ सही मीट्रिक निर्धारित करते हैं; बेसलाइन मॉडल के अनुसार प्रत्येक मीट्रिक की व्याख्या करें; क्रॉस-वैलिडेशन के साथ पूर्वाग्रह को मापें और शोर को प्रगति समझने की गलती न करें; परीक्षण सेट का उपयोग केवल अंत में, एक बार करें। प्रयोग डिजाइन में एआई आपका भागीदार है, लेकिन "काफी अच्छा" का निर्णय आप पर निर्भर है।

आवेदन कार्य

वर्गीकरण मॉडल के लिए: (1) वर्ग वितरण लिखें, (2) एक उपयुक्त आधार मॉडल बनाएं और उसके स्कोर को मापें, (3) 5-गुना क्रॉस सत्यापन के साथ अपने मॉडल का मूल्यांकन करें और माध्य और मानक विचलन की रिपोर्ट करें, (4) सटीकता के बजाय समस्या के लिए उपयुक्त मीट्रिक की गणना करें (जैसे पीआर-एयूसी)। लिखें कि क्या आपका मॉडल बिना किसी पूर्वाग्रह के बेसलाइन मॉडल को बड़े अंतर से हराता है।

चेकलिस्ट

  • [ ] मैंने समस्या के प्रकार और व्यावसायिक संदर्भ के आधार पर मीट्रिक चुना।
  • [ ] मैंने एक बेस मॉडल बनाया और उसकी तुलना की।
  • [ ] मैंने क्रॉस-वैलिडेशन के साथ माध्य और विचलन की सूचना दी।
  • [ ] मैंने पुष्टि की कि सुधार विचलन से अधिक है।
  • [ ] मैंने सत्यापन सेट के साथ हाइपरपैरामीटर का चयन किया।
  • [ ] मैंने परीक्षण सेट का उपयोग अंत में केवल एक बार किया।