नफा:
- MLOps टप्पे समजून घेण्याची क्षमता (रिलीझ, तैनाती, देखरेख, पुन्हा प्रशिक्षण, रोलबॅक) आणि मॉडेल ड्रिफ्ट आणि देखरेख केलेल्या तैनातीची योजना
- आदर्श निष्पक्षता, पारदर्शकता आणि जबाबदारीची तत्त्वे लागू करण्याची क्षमता आणि नैतिक स्वीकार्यतेपासून सांख्यिकीय अचूकता वेगळे करण्याची क्षमता
- केव्हीकेके/जीडीपीआर तत्त्वांसह वैयक्तिक डेटाचे संरक्षण करण्याची क्षमता आणि उच्च-प्रभावी निर्णयांमध्ये मानवाला अंतिम जबाबदारी सोपविण्याची क्षमता
मॉडेलला प्रशिक्षण देणे आणि उच्च गुण मिळवणे हा शेवट नसून मध्यम आहे. वास्तविक मूल्य तेव्हा येते जेव्हा मॉडेलचे उत्पादन केले जाते आणि विश्वासार्हपणे कार्य करते, कालांतराने खराब न होता त्याचे परीक्षण केले जाते आणि संपूर्ण प्रक्रिया नैतिक आणि कायदेशीर सीमांमध्ये पार पाडली जाते. हे क्लोजिंग युनिट तीन विषय एकत्र करते: MLOps (लाइव्ह जाण्याची, मॉडेल्सची देखरेख आणि देखरेख करण्याची शिस्त), नैतिकता (न्याय, पारदर्शकता, गैर-दुर्भाव) आणि गोपनीयता (वैयक्तिक डेटाचे संरक्षण). AI या भागात कोड, चेकलिस्ट आणि ब्लूप्रिंट तयार करते; पण एखादे मॉडेल लाइव्ह होते की नाही, कोणावर परिणाम होईल आणि कोणता डेटा वापरता येईल हे मानव ठरवतात. हे निर्णय तांत्रिक नसून जबाबदारीचे निर्णय आहेत.
MLOps: मॉडेल एखाद्या उत्पादनासारखे जगते
MLOps (मशीन लर्निंग ऑपरेशन्स - उत्पादनामध्ये मशीन लर्निंग मॉडेल्स चालवणे, देखरेख करणे आणि अपडेट करण्याचा सराव) हे सॉफ्टवेअर डेव्हलपमेंटमधील DevOps चे डेटा सायन्समध्ये रुपांतर आहे. मूळ कल्पना: मॉडेल ही फाईल नाही जी एकदा प्रशिक्षित केली जाते आणि विसरली जाते, परंतु एक जिवंत उत्पादन आहे ज्यासाठी सतत देखभाल आवश्यक असते. प्रमुख टप्पे:
1. आवृत्तीकरण: कोड (गिट), डेटा आणि मॉडेल एकत्रितपणे आवृत्ती केले जातात; कोणते मॉडेल कोणत्या डेटा आणि कोडसह तयार केले गेले याची नोंद केली जाते.
2. उपयोजन: मॉडेल API किंवा बॅच जॉब म्हणून थेट ठेवले जाते. हे सहसा लहान प्रेक्षकांना दिले जाते (छाया/कॅनरी वितरण).
3. मॉनिटरिंग: मॉडेल आणि इनपुट डेटाचे कार्यप्रदर्शन सतत निरीक्षण केले जाते.
4. पुन: प्रशिक्षण: जेव्हा कार्यप्रदर्शन कमी होते, तेव्हा मॉडेलला अद्यतनित डेटासह पुन्हा प्रशिक्षण दिले जाते.
नमुना शिफ्ट: मूक विकृती
उत्पादनातील सर्वात मोठा धोका म्हणजे मॉडेल ड्रिफ्ट (मॉडेल ड्रिफ्ट / डेटा ड्रिफ्ट). जग बदलते; ज्या अटींवर तुम्ही तुमचे मॉडेल प्रशिक्षित केले (ग्राहक वर्तन, किंमती, हंगाम, कायदा) कालांतराने बदलतात आणि मॉडेल अप्रचलित होऊ लागते. उदाहरणार्थ, साथीच्या आजारापूर्वी प्रशिक्षित केलेले मागणी मॉडेल साथीच्या आजाराच्या काळात पूर्णपणे चुकीचे आहे. ड्रिफ्ट दोन प्रकारात उद्भवते: डेटा ड्रिफ्ट (इनपुट डेटा बदलांचे वितरण) आणि संकल्पना ड्रिफ्ट (इनपुट आणि लक्ष्य बदलांमधील संबंध). हे कॅप्चर करण्याचा मार्ग म्हणजे निरीक्षण: इनपुट वितरण, अंदाज वितरण आणि (शक्य असल्यास) वास्तविक परिणामाच्या तुलनेत कामगिरीचा सतत मागोवा घ्या.
खबरदारी: उत्पादनात ठेवलेले मॉडेल स्वतःच खराब होईल; हा "जर" नसून "केव्हा" चा मुद्दा आहे. मॉनिटरिंग सेट न करता मॉडेल्स तैनात करणे म्हणजे कारचे इंजिन नियंत्रित न करता चालविण्यासारखे आहे; एक दिवस तो तिथेच शांतपणे बसतो आणि तुमच्या लक्षात येत नाही.
MLOps घटक
उद्देश
दुर्लक्ष केले तर
आवृत्ती तयार करणे
काय निर्माण होते हे जाणून घेणे
पुनरुत्पादित न करण्यायोग्य, शोधण्यायोग्य नाही
देखरेख
स्लिप लवकर पाहून
मॉडेल शांतपणे खाली मोडते
पुन्हा प्रशिक्षण
अद्ययावत रहा
अंदाज जुने होतात
रोलबॅक
वाईट मॉडेलवर परत या
सदोष मॉडेल थेट राहते
दस्तऐवजीकरण
पारदर्शकता, उलाढाल
माहिती एका व्यक्तीमध्ये अडकते
नैतिकता: मॉडेल निर्णय लोकांवर परिणाम करतात
लोकांच्या जीवनावर परिणाम करणाऱ्या निर्णयांमध्ये डेटा मॉडेल्सचा वापर वाढत्या प्रमाणात होत आहे: क्रेडिट, नोकरी, विमा, न्याय. या शक्तीने जबाबदारी येते. प्रमुख नैतिक धोके:
पक्षपात आणि भेदभाव: मॉडेल ऐतिहासिक डेटामध्ये अन्याय शिकू शकतो आणि कायम ठेवू शकतो. जर एखाद्या विशिष्ट गटाला भूतकाळात कमी क्रेडिट दिले गेले असेल, तर मॉडेल गृहीत धरते की हा एक "नियम" आहे आणि भेदभाव स्वयंचलित करतो. म्हणूनच निष्पक्षता विश्लेषण — मॉडेल वेगवेगळ्या गटांसाठी (लिंग, वय, प्रदेश) समान कार्य करते की नाही हे तपासणे — आवश्यक आहे.
पारदर्शकता आणि स्पष्टीकरणक्षमता: मॉडेलने एखाद्या व्यक्तीला का नाकारले हे स्पष्ट करण्यास सक्षम असावे. "ब्लॅक बॉक्सने असे म्हटले" नैतिकदृष्ट्या आणि अनेकदा कायदेशीररित्या अस्वीकार्य आहे. म्हणूनच स्पष्टीकरण साधने (वैशिष्ट्य महत्त्व, SHAP मूल्ये) मौल्यवान आहेत.
जबाबदारी: मॉडेलने चुकीचा निर्णय घेतल्यास जबाबदार कोण? उत्तर नेहमीच व्यक्ती/संस्था असते, मॉडेल नसते. मानवी निरीक्षण (ह्युमन-इन-द-लूप — अंतिम निर्णयाला मान्यता देणारा मानव) उच्च-प्रभावी निर्णयांमध्ये जतन केला पाहिजे.
खबरदारी: मॉडेल सांख्यिकीयदृष्ट्या "योग्य" असू शकते परंतु नैतिकदृष्ट्या अस्वीकार्य आहे. एक अत्यंत अचूक मॉडेल जे पद्धतशीरपणे एका गटाचे नुकसान करते ते चांगले मॉडेल नाही. न्यायासाठी प्रामाणिकपणाला पर्याय नाही.
गोपनीयता: वैयक्तिक डेटा काळजीपूर्वक संरक्षित आहे
डेटा सायन्सचा कच्चा माल बहुतेकदा वैयक्तिक डेटा असतो आणि हा डेटा कायद्याद्वारे संरक्षित केला जातो: तुर्कीमध्ये KVKK, युरोपमधील GDPR. मूलभूत तत्त्वे आहेत: उद्देश मर्यादा (डेटा ज्या उद्देशासाठी संकलित केला गेला होता त्याशिवाय इतर हेतूंसाठी वापरला जात नाही), डेटा कमी करणे (आवश्यकतेपेक्षा जास्त डेटा संकलित / ठेवला जात नाही), निनावीकरण (ओळखणे माहिती काढून टाकली आहे) आणि सुरक्षा (डेटा एन्क्रिप्ट केलेला आहे आणि प्रवेश प्रतिबंधित आहे). एआय टूल्ससह काम करताना गंभीर नियम: सार्वजनिक एआय टूलमध्ये वास्तविक वैयक्तिक डेटा कधीही पेस्ट करू नका. बहुतेक वेळा, आकृती आणि निनावी/सिंथेटिक नमुना विश्लेषणासाठी पुरेसा असतो.
माहिती सुरक्षिततेच्या संदर्भात अतिरिक्त भर: केवळ डेटा आणि सिस्टमवर डेटा सायन्स टूल्स आणि तंत्रांचा वापर करा ज्यासाठी तुम्हाला अधिकार आहे, बचावात्मक आणि कायदेशीर विश्लेषणाच्या हेतूंसाठी. दुसऱ्याच्या डेटावर अनधिकृत प्रवेश, व्यक्तींची पुन्हा ओळख (अनामित डेटामधून ओळख काढणे) किंवा अनधिकृत प्रोफाइलिंग बेकायदेशीर आणि अनैतिक दोन्ही आहे.
तीन लहान प्रकरणे
केस 1 - ट्रॅक न केलेले संकुचित. एक ई-कॉमर्स कंपनी तिच्या शिफारस मॉडेलसह थेट झाली आणि ट्रॅकिंग सेट केले नाही. 4 महिन्यांनंतर उत्पादन कॅटलॉग मोठ्या प्रमाणात बदलले आहे; मॉडेलने कालबाह्य उत्पादनांची शिफारस करणे सुरू ठेवले आणि रूपांतरण दर शांतपणे 30% ने घसरला. महिनोन्महिने कोणाचीच दखल घेतली नाही. धडा: देखरेखीशिवाय तैनात करणे अंधुक होत आहे.
केस 2 - छुपा भेदभाव. कामावर घेतलेल्या स्क्रीनिंग मॉडेलने ऐतिहासिक डेटामधील लैंगिक असमतोल आणि पद्धतशीरपणे कमी दर्जाच्या महिला उमेदवारांबद्दल शिकले. निष्पक्ष विश्लेषण नसल्याने ते लक्षात आले नाही; एका ऑडिटमध्ये हे उघड झाले आणि संस्थेला गंभीर प्रतिष्ठेचा/कायदेशीर जोखमीचा सामना करावा लागला. धडा: उच्च-प्रभाव मॉडेलमध्ये गट-आधारित निष्पक्षता नियंत्रण आवश्यक आहे.
केस 3 - गोपनीयतेचा भंग. एका विश्लेषकाने सार्वजनिक एआय टूलमध्ये वास्तविक ग्राहक ईमेल आणि खरेदी इतिहास असलेली फाइल लोड केली आणि म्हटले, "सेगमेंट्सचा सारांश द्या." वैयक्तिक डेटा संस्था सोडला आहे; KVKK प्रक्रिया सुरू झाली आहे. ओळख फील्ड काढणे आणि फक्त निनावी गुणधर्म सामायिक करणे हा योग्य मार्ग होता. धडा: वास्तविक वैयक्तिक डेटा ओपन टूलमध्ये प्रवेश करत नाही.
चार कॉपी करण्यायोग्य टेम्पलेट्स
1) प्री-डिप्लॉयमेंट चेकलिस्ट:
तुमची भूमिका: MLOps सल्लागार. उत्पादनामध्ये मॉडेल टाकण्यापूर्वी मला तपासण्यासाठी आवश्यक असलेल्या गोष्टींची यादी करा: व्हर्जनिंग, मॉनिटरिंग मेट्रिक्स, रोलबॅक प्लॅन, परफॉर्मन्स थ्रेशोल्ड, डेटा ड्रिफ्ट अलर्ट, जबाबदार व्यक्ती. प्रत्येक आयटमसाठी "हे महत्त्वाचे का आहे" स्पष्टीकरण एक-वाक्य जोडा. मी ठरवेन.
२) मॉडेल शिफ्ट ट्रॅकिंग डिझाइन:
उत्पादनातील वर्गीकरण मॉडेलसाठी ड्रिफ्ट मॉनिटरिंग योजना सुचवा: (1) मी कोणत्या इनपुट वितरणांचे निरीक्षण करावे, (2) अंदाज वितरणासाठी कोणता अलार्म, (3) वास्तविक परिणाम आल्यावर कामगिरीची तुलना कशी करावी, (4) कोणत्या उंबरठ्यावर पुन्हा प्रशिक्षण सुरू केले जावे. कोड सांगाडा देखील प्रदान करा.
3) निष्पक्षता नियंत्रण:
वेगवेगळ्या गटांसाठी माझ्या मॉडेलच्या कामगिरीची तुलना करणारा कोड लिहा (उदा. वयाचा बँड, प्रदेश): प्रत्येक गटासाठी रिकॉल/सुस्पष्टता आणि सकारात्मक निर्णय दर. गटांमध्ये लक्षणीय फरक असल्यास चेतावणी द्या. कारण/राजकीय अर्थ लावणे; फक्त मला मतभेद दाखवा आणि मी निर्णयावर विचार करेन.
4) गोपनीयता पूर्व-तपासणी:
एआय टूलला डेटा देण्यापूर्वी, तपासा: खालील कॉलम सूचीमध्ये वैयक्तिक/ओळख डेटा (नाव, ईमेल, आयडी, फोन, पत्ता, आयपी) आहे का? तसे असल्यास, कोणते काढून टाकावे किंवा निनावी असावे याची यादी करा. स्तंभ: [सूची]. उद्देश: फक्त निनावी स्कीमा शेअर करणे.
कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट
कमकुवत प्रॉम्प्ट:
माझे मॉडेल तयार आहे, थेट जा.
तैनाती एक पाऊल नाही; देखरेख, रोलबॅक, निष्पक्षता आणि गोपनीयता नियंत्रणाशिवाय थेट जाणे हे आपत्तीला मूक आमंत्रण आहे.
शक्तिशाली सूचना:
तुमची भूमिका: जबाबदार MLOps सल्लागार. माझे मॉडेल प्रशिक्षित झाले आहे, मला थेट जाण्यापूर्वी पूर्ण तयारी हवी आहे. व्युत्पन्न करा: (१) प्री-डिप्लॉयमेंट चेकलिस्ट, (२) ड्रिफ्ट मॉनिटरिंग प्लॅन, (३) ग्रुप-आधारित फेअरनेस चेक कोड, (४) प्रायव्हसी चेक (वैयक्तिक डेटा आहे का). उच्च-प्रभावी निर्णयांमध्ये मानवी संमतीचे संरक्षण कसे करावे हे देखील सुचवा. अंतिम निर्णय माझे आहेत.
येथे वितरण, देखरेख, निष्पक्षता आणि गोपनीयता ही एकच जबाबदार प्रक्रिया मानली जाते.
सामान्य चुका
- मॉनिटरिंग सेट न करता मॉडेल तैनात करणे. मॉडेल शांतपणे सरकते आणि विकृत होते; लक्षात येण्यासाठी काही महिने लागू शकतात.
- न्याय तपासणी बायपास. उच्च-विश्वासदर्शक मॉडेल एखाद्या गटाचे पद्धतशीरपणे नुकसान करू शकते.
- एक अस्पष्टीकृत ब्लॅक बॉक्स निर्णय घेणे. उच्च-प्रभाव निर्णय स्पष्टीकरणयोग्य असणे आवश्यक आहे; "मॉडेलने असे म्हटले" पुरेसे नाही.
- एआय टूल उघडण्यासाठी वास्तविक वैयक्तिक डेटा देणे. KVKK/GDPR उल्लंघन; आकृती आणि निनावी उदाहरण पुरेसे आहेत.
- मॉडेलला निर्णय सोपवत आहे. जबाबदारी नेहमी माणसावर असते; उच्च प्रभाव मानवी पाळत ठेवली जाते.
टीप: तुम्ही प्रत्येक मॉडेलसोबत लाइव्ह जाण्यापूर्वी, एक प्रश्न मोठ्याने विचारा: "जर हे मॉडेल उद्या शांतपणे तोडले किंवा एखाद्या गटाला अन्यायकारकपणे दंड ठोठावला, तर मी ते कसे लक्षात घेईन आणि परत कसे आणू?" आपल्याकडे या प्रश्नाचे स्पष्ट उत्तर नसल्यास, मॉडेल अद्याप उत्पादनासाठी तयार नाही.
सारांशात
मॉडेलचे काम उच्च स्कोअरने संपत नाही, परंतु उत्पादनात विश्वासार्ह आणि जबाबदारीने काम करून. MLOps म्हणजे लाइव्ह जाणे, ड्रिफ्टचे निरीक्षण करणे, पुन्हा प्रशिक्षण देणे आणि मॉडेल परत आणणे; ट्रॅकिंगशिवाय तैनात करणे शांत संकुचित आहे. नैतिकतेसाठी मॉडेलची निष्पक्षता, पारदर्शकता आणि जबाबदारी आवश्यक आहे; सांख्यिकीय अचूकता नैतिक स्वीकार्यतेला पर्याय नाही. गोपनीयता म्हणजे KVKK/GDPR तत्त्वांसह वैयक्तिक डेटाचे संरक्षण करणे आणि वास्तविक डेटा खुल्या साधनांपासून दूर ठेवणे. हे सर्व निर्णय तांत्रिक नसून जबाबदारीचे निर्णय आहेत आणि नेहमीच माणसाचे असतात.
अर्ज कार्य
तुम्ही तयार केलेले मॉडेल (किंवा काल्पनिक) उत्पादनामध्ये ठेवणार आहात असा विचार करा आणि चार याद्या भरा: (1) प्री-डिप्लॉयमेंट चेकलिस्ट, (2) ड्रिफ्ट मेट्रिक्स तुम्ही ट्रॅक कराल, (3) गट-आधारित निष्पक्षता नियंत्रण योजना, (4) गोपनीयता नियंत्रण. मग प्रश्नाचे ठोस उत्तर लिहा "उद्या जर ते शांतपणे तोडले आणि ते परत मिळवले तर मला कसे लक्षात येईल?"
चेकलिस्ट
- [ ] मी मॉनिटरिंग (स्लिप अलर्ट) आणि रोलबॅक योजनेसह मॉडेल तैनात करत आहे?
- [ ] मी वेगवेगळ्या गटांसाठी निष्पक्षता/कार्यक्षमतेतील अंतर तपासले आहे का?
- [ ] मी उच्च-प्रभावी निर्णयांवर मानवी-इन-द-लूप राखले आहे का?
- मी KVKK/GDPR तत्त्वांसह वैयक्तिक डेटा संरक्षित केला आहे आणि त्यांना खुल्या साधनांपासून दूर ठेवले आहे का?
- [ ] मी अंतिम जबाबदारी माणसावर टाकली आहे, मॉडेलवर नाही?
मॉड्यूल परीक्षा
1. एक डेटा वैज्ञानिक कृत्रिम बुद्धिमत्तेला विचारतो, "या डेटावर यादृच्छिक जंगल किती अचूक आहे?" मॉडेलला अजिबात प्रशिक्षण न देता, आणि थेट "89%" चे उत्तर सादरीकरणात ठेवते. या दृष्टिकोनातील मूलभूत चूक काय आहे?
- अ) कृत्रिम बुद्धिमत्तेला डेटा आणि मॉडेल न देता मेट्रिक्सची प्रतीक्षा करणे; तो तयार केलेला नंबर खोटा आहे आणि खरा मेट्रिक केवळ प्रशिक्षण आणि चाचणीद्वारेच शोधला जाऊ शकतो याकडे दुर्लक्ष करून ✔
- ब) यादृच्छिक जंगलाऐवजी लॉजिस्टिक रिग्रेशन वापरणे आवश्यक आहे
- क) अचूकता दर नेहमी 90% च्या वर असणे आवश्यक आहे.
- ड) सादरीकरणामध्ये मेट्रिक्स समाविष्ट करण्यास सक्त मनाई आहे
स्पष्टीकरण: कृत्रिम बुद्धिमत्ता मॉडेल आणि डेटामध्ये प्रवेश केल्याशिवाय मेट्रिक तयार करू शकत नाही; त्याने दिलेला क्रमांक हा भ्रम (बनावट) आहे. मॉडेलचे प्रशिक्षण आणि चाचणी केल्यानंतरच डेटा सायंटिस्टच्या स्वतःच्या गणनेद्वारे मेट्रिक प्राप्त केले जाते. असत्यापित आउटपुट स्वाक्षरी न केलेल्या अहवालासारखे आहे.
2. मंथन अंदाजासाठी डेटा गोळा करताना 'खाते बंद होण्याचे कारण' स्तंभ समाविष्ट केला जातो; ग्राहक गेल्यानंतरच हा कॉलम भरला जातो. मॉडेल चाचणी सेटवर 97% देते, परंतु उत्पादनात कार्य करत नाही. या स्थितीचे नाव आणि कारण काय आहे?
- अ) जास्त शिकणे; मॉडेल खूप गुंतागुंतीचे आहे
- ब) डेटा लीक; ✔ माहिती वापरणे जी भविष्यवाणीच्या वेळी उपलब्ध होणार नाही, परंतु एक वैशिष्ट्य म्हणून लक्ष्याचा परिणाम आहे
- क) अपुरे शिक्षण; मॉडेल खूप सोपे आहे
- ड) निवड पूर्वाग्रह; लहान नमुना आकार
स्पष्टीकरण: हा एक उत्कृष्ट डेटा लीक आहे: 'क्लोजिंग कारण' हे लक्ष्याचा परिणाम आहे आणि भविष्यवाणीच्या वेळी अद्याप रिक्त आहे. मॉडेल या भविष्यातील ज्ञानासह युक्ती करते, ते चाचणी सेटवर छान दिसते परंतु उत्पादनात क्रॅश होते कारण तो स्तंभ रिक्त आहे. प्रत्येक कॉलमला 'माझ्याकडे ते अंदाजाच्या वेळी आहे का' हा प्रश्न विचारला जावा.
3. एक विश्लेषक महसूल स्तंभातील गहाळ मूल्ये सरासरीसह भरतो; परंतु हरवलेले लोक प्रत्यक्षात कमी उत्पन्न असलेल्या विभागातील आहेत ज्यांनी कधीही उत्पन्न घोषित केले नाही (पद्धतशीरपणे गहाळ). हे भरणे चुकीचे का आहे?
- अ) माध्य नेहमी मध्यकापेक्षा मोठा असतो, म्हणून तो चुकीचा आहे
- ब) गहाळ मूल्ये कधीही भरू नयेत, ती नेहमी हटवली पाहिजेत
- क) सरासरीने पद्धतशीर अंतर भरल्याने त्या गटाचे कृत्रिमरित्या प्रतिनिधित्व करून डेटा विकृत होतो; 'रिक्त का आहे?', असा प्रश्न न विचारता भरणे झाले. ✔
- ड) सरासरीची गणना केल्याने कार्यप्रदर्शन समस्या निर्माण होते कारण ते खूप मंद आहे
स्पष्टीकरण: कमतरतेचे कारण उपाय ठरवते. जेव्हा पद्धतशीर गहाळ (विशिष्ट गटामध्ये केंद्रित अंतर) सरासरीने भरले जाते, तेव्हा तो गट कृत्रिमरित्या 'सरासरी उत्पन्न' बनतो आणि डेटा विकृत होतो. ते भरण्यापूर्वी 'ते रिकामे का आहे' हा प्रश्न विचारला पाहिजे; पद्धतशीर/महत्त्वपूर्ण गहाळ सरासरी भरू नये.
4. एका संघाला 'जाहिरात खर्च' आणि 'विक्री' यांच्यात 0.78 सहसंबंध सापडतो आणि बजेट दुप्पट होते; तथापि, प्रत्यक्षात दोन्ही हंगामी मोहिमा ट्रिगर करतात. आकडेवारीमधील कोणते तत्व या त्रुटीचे स्पष्टीकरण देते?
- अ) सहसंबंध हे कार्यकारणभाव नाही; लपलेले तिसरे व्हेरिएबल दोन्ही व्हेरिएबल्सवर परिणाम करत असेल ✔
- ब) 0.78 चा सहसंबंध खूप कमी असल्याने, संबंध दुर्लक्षित केले पाहिजे
- क) सहसंबंध नेहमीच कार्यकारणभाव सिद्ध करतो, संघाने ते बरोबर केले
- ड) जाहिरात आणि विक्री यांच्यातील परस्परसंबंध गणिताने मोजता येत नाहीत.
स्पष्टीकरण: सहसंबंध म्हणजे कार्यकारणभाव नाही. दोन व्हेरिएबल्स एकत्रितपणे कार्य करू शकतात कारण लपलेले तिसरे व्हेरिएबल (येथे हंगामी मोहिमा) त्या दोघांवर परिणाम करतात. एक कारण दुसरे कारणीभूत ठरते हा निष्कर्ष केवळ प्रयोग आणि क्षेत्रीय ज्ञानाद्वारे स्थापित केला जाऊ शकतो; केवळ सहसंबंधांची संख्या कार्यकारणभावाचा पुरावा नाही.
5. फसवणूक शोधण्याचे मॉडेल 99.2% अचूकता दाखवते आणि संघ साजरा करतो; तथापि, डेटामधील बनावट व्यवहार दर केवळ 0.8% आहे आणि मॉडेलचे रिकॉल 6% आहे. हे टेबल काय दाखवते?
- अ) मॉडेल परिपूर्ण आहे कारण अचूकता 99% पेक्षा जास्त आहे
- ब) असंतुलित डेटासह अचूकता दिशाभूल करणारी आहे; मॉडेल जवळजवळ सर्व बनावट (कमी रिकॉल) चुकते, योग्य मेट्रिक ✔ कडे पाहिले पाहिजे
- क) मॉडेलचे रिकॉल जास्त असल्याने कोणतीही अडचण नाही
- ड) बनावट दर कमी असल्याने मॉडेल तयार करण्याची गरज नव्हती
स्पष्टीकरण: असंतुलित डेटामध्ये 'अचूकता' दिशाभूल करणारी आहे. जेव्हा मॉडेल जवळजवळ प्रत्येक व्यवहाराला 'स्वच्छ' म्हणतो, तेव्हा त्याला उच्च अचूकता मिळते कारण बनावट फारच कमी असतात, परंतु ते बनावट पकडण्यात अयशस्वी होते, हा त्याचा मुख्य उद्देश आहे (6% लक्षात ठेवा). त्यामुळे, असंतुलित समस्यांमध्ये, अचूकतेवर लक्ष केंद्रित केले जात नाही, परंतु कामाच्या उद्देशासाठी योग्य असलेल्या गोंधळ मॅट्रिक्स आणि मेट्रिक्सवर, जसे की रिकॉल/सुस्पष्टता.
6. मागणी अंदाज प्रकल्पामध्ये, वेळेवर अवलंबून असलेला डेटा यादृच्छिकपणे प्रशिक्षण/चाचणीमध्ये विभागला जातो. मॉडेल 93% अचूकता देते परंतु उत्पादनात क्रॅश होते. योग्य विभाजन दृष्टीकोन काय असावा?
- अ) चाचणी संच मोठा करणे, उदा. विभाजन ५०%/५०%
- ब) अधिक जटिल मॉडेल वापरणे
- क) विभाजन पूर्णपणे काढून टाका आणि सर्व डेटासह ट्रेन करा
- ड) कालक्रमानुसार विभाजन: जुन्या कालावधीसह प्रशिक्षण आणि नवीन कालावधीसह चाचणी, अशा प्रकारे मॉडेलला भविष्य पाहण्यापासून प्रतिबंधित करते ✔
स्पष्टीकरण: वेळेच्या मालिकेतील डेटामध्ये यादृच्छिक विभागणी केली असल्यास, मॉडेल भविष्य पाहतो आणि प्रशिक्षणात भूतकाळाचा अंदाज लावतो; हे गळती आहे आणि प्रत्यक्षात अस्तित्वात नसलेले यश निर्माण करते. योग्य दृष्टीकोन कालक्रमानुसार विभाजन आहे: जुन्या कालावधीसह प्रशिक्षण आणि नवीन कालावधीसह चाचणी, उत्पादनातील वास्तविक परिस्थितीचे अनुकरण करणे (भूतकाळापासून भविष्यात अंदाज लावणे).
7. वैशिष्ट्य अभियांत्रिकीमध्ये स्केलिंग (StandardScaler) पॅरामीटर्सची गणना कोणत्या डेटावरून करावी आणि ते कसे लागू केले जावे?
- अ) ते सर्व डेटावरून (प्रशिक्षण + चाचणी एकत्र) मोजले जावे जेणेकरून ते अधिक अचूक असेल
- ब) प्रत्येक पंक्तीसाठी, त्या पंक्तीच्या स्वतःच्या मूल्यावरून ते स्वतंत्रपणे मोजले जावे
- क) केवळ चाचणी डेटावरून मोजले जावे
- ड) हे केवळ प्रशिक्षण डेटावरून मोजले जावे, त्यानंतर चाचणी डेटावर समान पॅरामीटर्स लागू केले जावे; अन्यथा ते लीक होईल ✔
स्पष्टीकरण: स्केलिंग, एन्कोडिंग आणि पॅडिंग सारख्या सर्व परिवर्तनांचे मापदंड (अर्थ, मानक विचलन इ.) फक्त प्रशिक्षण डेटावरून शिकले पाहिजेत, नंतर ते चाचणी डेटावर लागू केले जावे. चाचणी डेटा विचारात घेतल्याने चाचणी माहिती प्रशिक्षणात व्यत्यय आणते, म्हणजेच गळती होते आणि ते मॉडेल आहे त्यापेक्षा चांगले दिसते. पाइपलाइन वापरल्याने याची खात्री होते.
8. एक मॉडेल प्रशिक्षण सेटवर 98% अचूकता आणि चाचणी सेटवर 72% अचूकता देते. हे लक्षण काय सूचित करते आणि काय केले पाहिजे?
- अ) अपुरे शिक्षण; मॉडेल अधिक जटिल केले पाहिजे
- ब) डेटा लीक; चाचणी संच बदलणे आवश्यक आहे
- सी) ओव्हरफिटिंग; मॉडेल सरलीकृत केले पाहिजे, नियमितीकरण आणि क्रॉस-व्हॅलिडेशन लागू केले जावे ✔
- ड) एक सामान्य परिस्थिती; तरीही शिक्षणाचा स्कोअर नेहमीच जास्त असतो, खबरदारी अनावश्यक असते
स्पष्टीकरण: प्रशिक्षणात खूप उच्च गुण आणि चाचणीमध्ये लक्षणीय कमी गुण हे ओव्हरफिटिंगचे उत्कृष्ट लक्षण आहे: मॉडेलने वास्तविक नमुना ऐवजी प्रशिक्षण डेटाचा आवाज लक्षात ठेवला आहे. सोल्यूशन्समध्ये मॉडेल सुलभ करणे, अधिक डेटा, नियमितीकरण आणि क्रॉस-व्हॅलिडेशनसह राज्य सत्यापित करणे समाविष्ट आहे. केवळ शैक्षणिक गुणांवर विसंबून राहणे ही अडचण लपवते.
9. मॅनेजमेंट प्रेझेंटेशनमध्ये, बार चार्टचा y-अक्ष ज्यामध्ये 1,000 वरून 1,020 पर्यंत विक्री वाढते ती वाढ प्रचंड दिसण्यासाठी 980 पासून सुरू केली जाते. वास्तविक वाढ 2% आहे. हा एक नैतिक मुद्दा का आहे?
- अ) एक कापलेला y-अक्ष दृष्यदृष्ट्या एक लहान फरक अतिशयोक्ती करतो आणि दर्शकांची दिशाभूल करतो; निष्पक्षतेसाठी, तुलना पट्ट्यांमधील अक्ष ० ✔ पासून सुरू झाला पाहिजे
- ब) बार चार्ट विक्री डेटासाठी कधीही वापरले जाऊ शकत नाहीत
- क) कोणतीही अडचण नाही; चार्ट प्रभावी दिसणे केव्हाही चांगले
- ड) Y-अक्ष नेहमी डेटाच्या सर्वात मोठ्या मूल्यापासून सुरू झाला पाहिजे
स्पष्टीकरण: तुलनात्मक हेतूंसाठी बार चार्ट्समध्ये, y-अक्ष साधारणपणे 0 पासून सुरू व्हायला हवा. अक्ष कापून 980 पासून सुरू केल्याने 2% लहान फरक दृश्यदृष्ट्या मोठा वाटतो आणि दर्शकांची दिशाभूल करतो. डेटा प्रोफेशनलची नैतिक जबाबदारी म्हणजे प्रामाणिक आलेख काढणे जे डेटाचे अतिरेकी किंवा कमी लेखत नाहीत.
10. उत्पादन सारणीसह ऑर्डरमध्ये सामील झाल्यानंतर विश्लेषक एकूण उलाढाल 3 वेळा शोधतो; ओळींची संख्या 240 हजारांवरून 690 हजारांपर्यंत वाढली. ही मूक त्रुटी टाळण्यासाठी काय करायला हवे होते?
- अ) एकूण उलाढाल 3 ने विभाजित करा
- ब) नेहमी JOIN ऐवजी स्वतंत्र क्वेरी वापरा
- क) उत्पादन सारणी पूर्णपणे हटवणे
- ड) विलीन/सामील झाल्यानंतर पंक्तींची संख्या तपासणे आणि त्या योग्य की द्वारे जोडल्या गेल्याची पडताळणी करणे; प्रतिकृती लवकर पकडणे ✔
स्पष्टीकरण: जेव्हा उत्पादन सारणीमध्ये प्रत्येक उत्पादनासाठी अनेक पंक्ती असतात (उदाहरणार्थ भिन्न रंग), तेव्हा चुकीच्या कीद्वारे सामील होणे प्रत्येक ऑर्डरची डुप्लिकेट करेल आणि बेरीज वाढवेल. कोड त्रुटींशिवाय चालतो परंतु परिणाम चुकीचा आहे. हे टाळण्याचा मार्ग म्हणजे प्रत्येक विलीन/सामील झाल्यानंतर पंक्तींची संख्या तपासणे आणि योग्य की सह विलीन करणे.
11. कामावर घेणारे स्क्रिनिंग मॉडेल ऐतिहासिक डेटामधील लिंग असमतोल आणि पद्धतशीरपणे स्कोअर महिला उमेदवारांबद्दल शिकते, परंतु त्याची एकूण अचूकता जास्त आहे. याचा अर्थ काय?
- अ) कोणतीही अडचण नाही कारण मॉडेलमध्ये उच्च अचूकता आहे
- ब) सांख्यिकीय अचूकता नैतिक स्वीकार्यतेचा पर्याय नाही; मॉडेलने मागील भेदभावाबद्दल शिकले आहे, गट-आधारित निष्पक्षता तपासणी आवश्यक आहे ✔
- क) मॉडेलची अचूकता आणखी वाढवल्याने समस्या सुटते
- ड) निष्पक्षता डेटा विज्ञानाच्या कक्षेबाहेर आहे
स्पष्टीकरण: जरी एखादे मॉडेल सांख्यिकीयदृष्ट्या योग्य असले तरी ते नैतिकदृष्ट्या अस्वीकार्य असू शकते. मॉडेल मागील डेटामधील अन्याय शिकते आणि भेदभाव स्वयंचलित करते. उच्च सचोटीला न्यायासाठी पर्याय नाही; उच्च-प्रभाव मॉडेलमध्ये, निष्पक्षता नियंत्रण, जे वेगवेगळ्या गटांसाठी कार्यप्रदर्शन/निर्णय फरक मोजते, आवश्यक आहे आणि अंतिम जबाबदारी मानवावर आहे.
12. एक कर्मचारी सार्वजनिक AI टूलमध्ये वास्तविक ग्राहक ईमेल आणि खरेदी इतिहास असलेली फाइल अपलोड करतो आणि 'सेगमेंट्सचा सारांश' म्हणतो. ही एक गंभीर चूक का आहे आणि योग्य मार्ग कोणता आहे?
- अ) कोणतीही अडचण नाही; AI टूल्स कधीही डेटा साठवत नाहीत
- ब) त्रुटी अशी आहे की फाइल खूप मोठी आहे; कमी करायला हवे होते
- क) खुल्या साधनाला वास्तविक वैयक्तिक डेटा प्रदान करणे हे KVKK/GDPR चे उल्लंघन आहे; ओळख फील्ड काढून टाकली पाहिजे आणि फक्त निनावी स्कीमा/मालमत्ता शेअर केली गेली असावी ✔
- ड) फक्त Excel ऐवजी CSV वापरायला हवे होते
स्पष्टीकरण: जेव्हा वास्तविक वैयक्तिक डेटा (जसे की ई-मेल, नाव इ.) सार्वजनिकरित्या उपलब्ध कृत्रिम बुद्धिमत्ता साधनाला दिले जाते, तेव्हा KVKK/GDPR च्या कार्यक्षेत्रात गोपनीयतेचे उल्लंघन होईल; डेटा संस्थेतून बाहेर पडतो. बहुतेक वेळा, आकृती आणि निनावी/सिंथेटिक नमुना विश्लेषणासाठी पुरेसा असतो. योग्य मार्ग म्हणजे ओळख फील्ड काढून टाकणे आणि केवळ निनावी गुणधर्म सामायिक करणे.
13. एक शिफारस मॉडेल उत्पादनात ठेवले जाते परंतु ट्रॅकिंग स्थापित केले जात नाही; जेव्हा उत्पादन कॅटलॉग 4 महिन्यांनंतर बदलतो, तेव्हा मॉडेल जुन्या उत्पादनांची शिफारस करत राहते आणि रूपांतरण दर शांतपणे 30% ने कमी होतो. या घटनेचे नाव काय आहे?
- अ) जास्त शिकणे; मॉडेल प्रशिक्षण संच लक्षात ठेवते
- ब) मॉडेल वाहून नेणे; जसजसे जग बदलत जाते, तसतसे मॉडेल शांतपणे अप्रचलित होते, लक्ष न दिले जाते कारण निरीक्षण स्थापित केले जात नाही ✔
- सी) निवड पूर्वाग्रह; नमुना पूर्वाग्रह
- ड) डेटा मिनिमायझेशन उल्लंघन
स्पष्टीकरण: हे मॉडेल ड्रिफ्ट (मॉडेल/डेटा ड्रिफ्ट) आहे: जेव्हा जग बदलते (कॅटलॉग, वर्तन, हंगाम) ज्या परिस्थितीत मॉडेलला प्रशिक्षण दिले गेले होते आणि मॉडेल शांतपणे खंडित होते. उत्पादनात ठेवलेले मॉडेल स्वतःच खराब होते; 'कधी' ही बाब आहे. निरीक्षणाशिवाय तैनाती (इनपुट आणि कार्यप्रदर्शनाचा मागोवा घेणे) ऱ्हास शोधणे अशक्य करते.
14. एका प्रशिक्षण/चाचणी विभाजनामध्ये 88% अचूकता मिळविणाऱ्या मॉडेलमध्ये 88%, 71%, 83%, 64%, 79% असे 5 पट क्रॉस-व्हॅलिडेशन स्कोअर आहेत. हे काय सूचित करते आणि क्रॉस-व्हॅलिडेशन का महत्त्वाचे आहे?
- अ) मॉडेल स्थिर आहे; 88% वास्तविक कामगिरी आहे
- ब) क्रॉस-प्रमाणीकरण अनावश्यक आहे; एक कंपार्टमेंट पुरेसे आहे
- क) स्कोअरची मोठी अस्थिरता दर्शवते की मॉडेल अस्थिर आहे; क्रॉस-व्हॅलिडेशन बेस्स कामगिरी सरासरी आणि एकाधिक डब्यांच्या वितरणावर, एक लकी बिन नाही ✔
- ड) सर्वोच्च स्कोअर (88%) नोंदवणे सर्वोत्तम आहे
स्पष्टीकरण: एकच डबा भाग्यवान किंवा अशुभ असू शकतो; 88% फक्त त्या सहज विभाजनाचा परिणाम होता. क्रॉस-व्हॅलिडेशन डेटाचे अनेक वेळा विभाजन करते, सरासरी (येथे ~77%) कामगिरीवर आधारित आणि स्कोअरची अस्थिरता दर्शवते. येथे उच्च अस्थिरता सूचित करते की मॉडेल अस्थिर आहे; एकाच डब्यावर अवलंबून राहणे दिशाभूल करणारे आहे.