एकाइहरू
1. डाटा विज्ञान र विश्लेषणमा कृत्रिम बुद्धिमत्ताको परिचय: कार्यप्रवाह, भूमिका, सीमा, प्रमाणीकरण र नैतिकता 2. डाटा सङ्कलन र स्रोत बुझाइ: योजना, नमूना, गुणस्तर र चुहावट जागरूकता 3. डाटा क्लिनिङ र प्रिप्रोसेसिङ: छुटेको मान, आउटलियर र प्रकार रूपान्तरण 4. अन्वेषण डेटा विश्लेषण (EDA): वितरण, सम्बन्ध, र प्रारम्भिक अन्तर्दृष्टि 5. सुविधा ईन्जिनियरिङ्: भेरिएन्टहरू उत्पन्न गर्दै, कोडिङ, स्केलिङ, र चुहावट बेवास्ता गर्दै 6. मोडेल निर्माण: समस्या परिभाषा, एल्गोरिथ्म चयन, र प्रशिक्षण/परीक्षण विभाजन 7. मोडेल मूल्याङ्कन: मेट्रिक्स, क्रस-प्रमाणीकरण, र चरम शिक्षा 8. भिजुअलाइजेशन र स्टोरीटेलिङ: सटीक ग्राफिक्स, इमानदार ग्राफिक्स 9. कोड जेनेरेसन: पाइथन (पान्डा) र SQL को साथ एआई-सहायता विश्लेषण 10. डाटा चुहावट र पुन: उत्पादनशीलता: मौन आपदा र अनुशासन 11. MLOps फाउन्डेशन, नैतिकता, गोपनीयता र जिम्मेवार विश्लेषण
एकाइ 11 / 11

MLOps फाउन्डेशन, नैतिकता, गोपनीयता र जिम्मेवार विश्लेषण

लाभ:

  • MLOps चरणहरू (रिलिज, तैनाती, अनुगमन, पुन: प्रशिक्षण, रोलब्याक) र मोडेल बहाव बुझ्ने क्षमता र अनुगमन गरिएको तैनाती योजना
  • मोडेल निष्पक्षता, पारदर्शिता र जवाफदेहिताका सिद्धान्तहरू लागू गर्ने क्षमता र नैतिक स्वीकार्यताबाट सांख्यिकीय शुद्धता छुट्याउन सक्ने क्षमता
  • KVKK/GDPR सिद्धान्तहरूको साथ व्यक्तिगत डाटा सुरक्षित गर्न र उच्च प्रभाव निर्णयहरूमा मानवलाई अन्तिम जिम्मेवारी तोक्ने क्षमता

मोडेललाई तालिम दिनु र उच्च अंक प्राप्त गर्नु अन्त्य होइन, मध्य हो। वास्तविक मूल्य तब आउँछ जब मोडेल उत्पादनमा राखिन्छ र भरपर्दो रूपमा काम गर्दछ, समयको साथ बिना खराबी अनुगमन गरिन्छ, र सम्पूर्ण प्रक्रिया नैतिक र कानुनी सीमा भित्र गरिन्छ। यो समापन इकाईले तीनवटा विषयहरूलाई संयोजन गर्दछ: MLOps (प्रत्यक्ष हुने अनुशासन, मोडेलहरू अनुगमन र मर्मत गर्ने), नैतिकता (निष्पक्षता, पारदर्शिता, गैर-दुर्भाव) र गोपनीयता (व्यक्तिगत डेटाको सुरक्षा)। AI ले यी क्षेत्रहरूमा कोड, चेकलिस्ट र ब्लुप्रिन्टहरू उत्पादन गर्दछ; तर मानिसले निर्णय गर्छ कि मोडेल लाइभ हुन्छ कि हुँदैन, कसलाई असर पर्छ, र कुन डाटा प्रयोग गर्न सकिन्छ। यी निर्णयहरू प्राविधिक होइन, तर जिम्मेवारी निर्णयहरू हुन्।

MLOps: मोडेल एक उत्पादन जस्तै रहन्छ

MLOps (मेशिन लर्निङ अपरेसनहरू - उत्पादनमा मेसिन लर्निङ मोडेलहरू चलाउने, अनुगमन गर्ने र अद्यावधिक गर्ने अभ्यास) सफ्टवेयर विकासमा डाटा विज्ञानमा DevOps को रूपान्तरण हो। आधारभूत विचार: एक मोडेल एक पटक प्रशिक्षित र बिर्सिएको फाइल होइन, तर एक जीवित उत्पादन जसलाई निरन्तर मर्मत आवश्यक छ। प्रमुख चरणहरू:

1. संस्करण: कोड (Git), डाटा र मोडेल सँगै संस्करण गरिएको छ; कुन मोडेल कुन डाटा र कोडको साथ उत्पादन गरिएको थियो रेकर्ड गरिएको छ।

2. तैनाती: मोडेललाई API वा ब्याच कार्यको रूपमा लाइभ राखिएको छ। यो सामान्यतया पहिले सानो दर्शकहरूलाई दिइन्छ (छाया/क्यानरी वितरण)।

3. निगरानी: मोडेल र इनपुट डेटा को प्रदर्शन लगातार निगरानी गरिन्छ।

४. पुन: तालिम: जब कार्यसम्पादन घट्छ, मोडेललाई अपडेट गरिएको डाटाको साथ पुन: प्रशिक्षित गरिन्छ।

ढाँचा परिवर्तन: मौन विकृति

उत्पादन मा सबैभन्दा ठूलो खतरा मोडेल बहाव (मोडल बहाव / डाटा बहाव) हो। संसार परिवर्तन हुन्छ; तपाईंले आफ्नो मोडेललाई तालिम दिनुभएका सर्तहरू (ग्राहक व्यवहार, मूल्य, सिजन, कानून) समयसँगै परिवर्तन हुन्छन् र मोडेल अप्रचलित हुन थाल्छ। उदाहरणका लागि, महामारी अघि प्रशिक्षित एक माग मोडेल महामारीको समयमा पूर्ण रूपमा गलत छ। बहाव दुई रूपहरूमा हुन्छ: डेटा बहाव (इनपुट डेटा परिवर्तनहरूको वितरण) र अवधारणा बहाव (इनपुट र लक्ष्य परिवर्तनहरू बीचको सम्बन्ध)। यी क्याप्चर गर्ने तरिका भनेको निगरानी हो: निरन्तर रूपमा इनपुट वितरण, भविष्यवाणी वितरण, र (यदि सम्भव भए) वास्तविक परिणामको तुलनामा प्रदर्शन ट्र्याक गर्नुहोस्।

सावधानी: उत्पादनमा राखिएको मोडेल आफैं बिग्रन्छ; यो "यदि" तर "कहिले" को कुरा हो। मोनिटरिङ सेट अप नगरीकन मोडेलहरू प्रयोग गर्नु भनेको कारको इन्जिन नियन्त्रण नगरी चलाउनु जस्तै हो; एक दिन यो चुपचाप त्यहाँ बस्छ र तपाईंले याद गर्नुहुन्न।

MLOps तत्व

उद्देश्य

बेवास्ता भएमा

संस्करण

के उत्पादन हुन्छ थाहा हुन्छ

पुन: उत्पादन गर्न नसकिने, पत्ता लगाउन नसकिने

अनुगमन

चाँडै पर्ची देखे

मोडेल चुपचाप टुट्छ

पुन: प्रशिक्षण

अद्यावधिक रहनुहोस्

भविष्यवाणी पुरानो हुन्छ

रोलब्याक

खराब मोडेलमा फर्कनुहोस्

त्रुटिपूर्ण मोडेल लाइभ रहन्छ

कागजात

पारदर्शिता, कारोबार

जानकारी एक व्यक्तिमा अड्किन्छ

नैतिकता: मोडेल निर्णयहरूले मानिसहरूलाई असर गर्छ

डेटा मोडेलहरू मानिसहरूको जीवनलाई असर गर्ने निर्णयहरूमा बढ्दो रूपमा प्रयोग गरिन्छ: क्रेडिट, भर्ती, बीमा, न्याय। यो शक्ति संग जिम्मेवारी आउँछ। प्रमुख नैतिक जोखिमहरू:

पूर्वाग्रह र भेदभाव: मोडेलले ऐतिहासिक डेटामा अन्यायहरू सिक्न र निरन्तरता दिन सक्छ। यदि एक निश्चित समूहलाई विगतमा कम क्रेडिट दिइएको छ भने, मोडेलले यो "नियम" हो र भेदभावलाई स्वचालित बनाउँछ। यसैले निष्पक्षता विश्लेषण - मोडेलले विभिन्न समूहहरू (लिङ्ग, उमेर, क्षेत्र) को लागि समान कार्य गर्दछ कि भनेर जाँच गर्न - आवश्यक छ।

पारदर्शिता र व्याख्यायोग्यता: तपाईंले एक मोडेलले व्यक्तिलाई किन अस्वीकार गर्नुभयो भनेर व्याख्या गर्न सक्षम हुनुपर्दछ। "ब्ल्याक बक्सले त्यसो भन्यो" नैतिक रूपमा र प्रायः कानुनी रूपमा अस्वीकार्य छ। त्यसकारण व्याख्यायोग्य उपकरणहरू (विशेषताको महत्त्व, SHAP मानहरू) मूल्यवान छन्।

जवाफदेहिता: मोडेलले गलत निर्णय गरेमा को जिम्मेवार हुन्छ? जवाफ सधैं एक व्यक्ति / संस्था हो, एक मोडेल होइन। मानव निरीक्षण (मानव-इन-द-लूप - अन्तिम निर्णयलाई अनुमोदन गर्ने मानव) उच्च-प्रभावपूर्ण निर्णयहरूमा सुरक्षित हुनुपर्छ।

सावधानी: एक मोडेल सांख्यिकीय रूपमा "सही" हुन सक्छ तर नैतिक रूपमा अस्वीकार्य। एक अत्यधिक सटीक मोडेल जसले व्यवस्थित रूपमा एक समूहलाई हानि पुर्‍याउँछ राम्रो मोडेल होइन। इमानदारी न्यायको विकल्प होइन।

गोपनीयता: व्यक्तिगत डाटा सावधानीपूर्वक सुरक्षित गरिएको छ

डाटा विज्ञानको कच्चा माल प्राय: व्यक्तिगत डाटा हो, र यो डाटा कानून द्वारा सुरक्षित छ: Türkiye मा KVKK, युरोप मा GDPR। आधारभूत सिद्धान्तहरू हुन्: उद्देश्य सीमितता (डेटा जुन उद्देश्यका लागि सङ्कलन गरिएको थियो बाहेक अन्य उद्देश्यका लागि प्रयोग गरिँदैन), डाटा न्यूनीकरण (आवश्यकभन्दा बढी डाटा सङ्कलन/राखिएको छैन), बेनामीकरण (पहिचान जानकारी हटाइएको छ) र सुरक्षा (डेटा इन्क्रिप्टेड राखिएको छ र पहुँच प्रतिबन्धित छ)। AI उपकरणहरूसँग काम गर्दा महत्वपूर्ण नियम: सार्वजनिक AI उपकरणमा वास्तविक व्यक्तिगत डेटा कहिल्यै टाँस्नुहोस्। अधिकांश समय, एक रेखाचित्र र एक बेनामी/सिंथेटिक नमूना विश्लेषणको लागि पर्याप्त छन्।

सूचना सुरक्षाको सन्दर्भमा थप जोड: रक्षात्मक र वैधानिक विश्लेषण उद्देश्यका लागि तपाईंसँग अधिकार भएका डाटा र प्रणालीहरूमा मात्र डाटा विज्ञान उपकरण र प्रविधिहरू प्रयोग गर्नुहोस्। कसैको डेटामा अनधिकृत पहुँच, व्यक्तिहरूको पुन: पहिचान (अज्ञात डेटाबाट पहिचान निकाल्ने) वा अनाधिकृत प्रोफाइलिङ दुवै अवैध र अनैतिक हो।

तीन मिनी केसहरू

केस १ - ट्र्याक नगरिएको पतन। एउटा ई-कमर्स कम्पनीले आफ्नो सिफारिस मोडेलको साथ लाइभ गयो र ट्र्याकिङ सेटअप गरेन। 4 महिना पछि उत्पादन सूची धेरै परिवर्तन भएको छ; मोडेलले पुरानो उत्पादनहरू सिफारिस गर्न जारी राख्यो, र रूपान्तरण दर चुपचाप 30% ले घट्यो। महिनौंसम्म कसैले ध्यान दिएनन् । पाठ: अनुगमन बिना तैनाती अन्धो हुँदैछ।

केस २ - लुकेको भेदभाव। एक भर्ती स्क्रिनिङ मोडेलले ऐतिहासिक डेटामा लैङ्गिक असन्तुलन र व्यवस्थित रूपमा महिला उम्मेद्वारहरूको बारेमा सिके। निष्पक्ष विश्लेषण नभएको कारणले यो ध्यान दिइएन; यो लेखापरीक्षणमा प्रकट भएको थियो र संस्थाले गम्भीर प्रतिष्ठा/कानूनी जोखिमको सामना गर्यो। पाठ: समूह-आधारित निष्पक्षता नियन्त्रण उच्च-प्रभाव मोडेलहरूमा आवश्यक छ।

केस 3 - गोपनीयताको उल्लङ्घन। एक विश्लेषकले सार्वजनिक एआई उपकरणमा वास्तविक ग्राहक इमेलहरू र खरिद इतिहास समावेश भएको फाइल लोड गरे र भने, "खण्डहरू संक्षेप गर्नुहोस्।" व्यक्तिगत डेटाले संस्था छोडेको छ; KVKK प्रक्रिया सुरु भएको छ। सही तरिका पहिचान क्षेत्रहरू हटाउन र केवल बेनामी गुणहरू साझेदारी गर्न थियो। पाठ: वास्तविक व्यक्तिगत डेटा खुला उपकरणमा प्रवेश गर्दैन।

चार प्रतिलिपि गर्न मिल्ने टेम्प्लेटहरू

1) पूर्व तैनाती चेकलिस्ट:

तपाईंको भूमिका: MLOps सल्लाहकार। उत्पादनमा मोडेल राख्नु अघि मैले जाँच गर्न आवश्यक चीजहरूको सूची बनाउनुहोस्: संस्करण, निगरानी मेट्रिक्स, रोलब्याक योजना, कार्यसम्पादन थ्रेसहोल्ड, डेटा बहाव अलर्ट, जिम्मेवार व्यक्ति। प्रत्येक वस्तुको लागि एक-वाक्य "किन यो महत्त्वपूर्ण छ" व्याख्या थप्नुहोस्। म निर्णय गर्नेछु।

2) मोडेल शिफ्ट ट्र्याकिङ डिजाइन:

उत्पादनमा वर्गीकरण मोडेलको लागि बहाव अनुगमन योजना सुझाव दिनुहोस्: (1) मैले कुन इनपुट वितरणहरू निगरानी गर्नुपर्छ, (2) भविष्यवाणी वितरणको लागि कस्तो अलार्म, (3) वास्तविक परिणाम आउँदा प्रदर्शन कसरी तुलना गर्ने, (4) कुन थ्रेसहोल्ड पुन: प्रशिक्षण ट्रिगर गर्नुपर्छ। कोड कंकाल पनि प्रदान गर्नुहोस्।

3) निष्पक्ष नियन्त्रण:

मेरो मोडेलको कार्यसम्पादनलाई विभिन्न समूहहरूको लागि तुलना गर्ने कोड लेख्नुहोस् (जस्तै उमेर ब्यान्ड, क्षेत्र): प्रत्येक समूहको लागि सम्झना/परिशुद्धता र सकारात्मक निर्णय दर। यदि समूहहरू बीच महत्त्वपूर्ण भिन्नता छ भने चेतावनी दिनुहोस्। कारण/राजनीतिक व्याख्या गर्ने; केवल मलाई भिन्नताहरू देखाउनुहोस् र म निर्णयलाई विचार गर्नेछु।

4) गोपनीयता पूर्व-जाँच:

एआई उपकरणमा डाटा दिनु अघि, जाँच गर्नुहोस्: तलको स्तम्भ सूचीमा व्यक्तिगत/पहिचान डाटा (नाम, इमेल, आईडी, फोन, ठेगाना, आईपी) छ? यदि त्यसो हो भने, कुनलाई हटाउनुपर्छ वा गुमनाम राख्नुपर्छ। स्तम्भहरू: [सूची]। उद्देश्य: बेनामी स्कीमा मात्र साझेदारी गर्न।

कमजोर प्रम्प्ट / बलियो प्रम्प्ट

कमजोर प्रम्प्ट:

मेरो मोडेल तयार छ, लाइभ जानुहोस्।

तैनाती एक कदम होइन; अनुगमन, रोलब्याक, निष्पक्षता र गोपनीयता नियन्त्रण बिना लाइभ हुनु विपत्तिको लागि मौन निमन्त्रणा हो।

शक्तिशाली प्रम्प्ट:

तपाईंको भूमिका: जिम्मेवार MLOps सल्लाहकार। मेरो मोडललाई तालिम दिइएको छ, म लाइभ हुनुअघि पूर्ण तयारी चाहन्छु। उत्पन्न गर्नुहोस्: (१) पूर्व तैनाती चेकलिस्ट, (२) बहाव अनुगमन योजना, (३) समूह-आधारित निष्पक्षता जाँच कोड, (४) गोपनीयता जाँच (व्यक्तिगत डेटा छ)। उच्च प्रभावकारी निर्णयहरूमा मानव सहमति कसरी सुरक्षित गर्ने भनेर पनि सुझाव दिनुहोस्। अन्तिम निर्णय मेरो हो।

यहाँ वितरण, अनुगमन, निष्पक्षता र गोपनीयतालाई एकल जिम्मेवार प्रक्रियाको रूपमा व्यवहार गरिन्छ।

सामान्य गल्तीहरू

  • अनुगमन सेट अप नगरिकन मोडेल तैनाथ गर्दै। मोडेल चुपचाप स्लिप र विकृत; यो नोटिस गर्न महिनौं लाग्न सक्छ।
  • न्याय जाँच बाइपास गर्दै। उच्च निष्ठा मोडेलले व्यवस्थित रूपमा समूहलाई हानि पुर्‍याउन सक्छ।
  • एक अस्पष्ट ब्ल्याक बक्स निर्णय गर्दै। उच्च-प्रभाव निर्णयहरू व्याख्यायोग्य हुनुपर्छ; "मोडलले त्यसो भने" पर्याप्त छैन।
  • AI उपकरण खोल्न वास्तविक व्यक्तिगत डाटा दिँदै। KVKK/GDPR उल्लङ्घन; रेखाचित्र र बेनामी उदाहरण पर्याप्त छन्।
  • मोडेललाई निर्णय सुम्पदै। जिम्मेवारी सधैं एक व्यक्तिको साथ हुन्छ; उच्च प्रभाव मानव निगरानी राखिएको छ।
सुझाव: तपाइँ प्रत्येक मोडेलसँग लाइभ हुनु अघि, ठूलो स्वरमा एउटा प्रश्न सोध्नुहोस्: "यदि यो मोडेलले भोलि चुपचाप तोड्यो वा अनुचित रूपमा समूहलाई दण्ड दियो भने, म कसरी ध्यान दिनेछु र यसलाई फिर्ता गर्नेछु?" यदि तपाइँसँग यो प्रश्नको स्पष्ट जवाफ छैन भने, मोडेल उत्पादनको लागि तयार छैन।

संक्षेपमा

मोडेलको काम उच्च स्कोरमा समाप्त हुँदैन, तर उत्पादनमा विश्वसनीय र जिम्मेवारीपूर्वक काम गरेर। MLOps प्रत्यक्ष जाने, बहावको लागि अनुगमन, पुन: तालिम, र मोडेल फिर्ता गर्ने अनुशासन हो; ट्र्याकिङ बिना तैनाती मौन पतन हो। नैतिकतालाई मोडेलको निष्पक्षता, पारदर्शिता र जवाफदेहिता चाहिन्छ; सांख्यिकीय शुद्धता नैतिक स्वीकार्यताको लागि कुनै विकल्प छैन। गोपनीयता भनेको KVKK/GDPR सिद्धान्तहरूसँग व्यक्तिगत डेटाको सुरक्षा गर्नु र वास्तविक डेटालाई खुला उपकरणहरूबाट टाढा राख्नु हो। यी सबै निर्णयहरू प्राविधिक होइन तर जिम्मेवारी निर्णयहरू हुन् र सधैं मानवसँग सम्बन्धित छन्।

आवेदन कार्य

तपाईंले निर्माण गरेको (वा काल्पनिक) मोडेललाई उत्पादनमा राख्ने र चारवटा सूचीहरू भर्न जाँदै हुनुहुन्छ भनेर सोच्नुहोस्: (१) पूर्व-तैयापन चेकलिस्ट, (२) तपाईंले ट्र्याक गर्ने मेट्रिक्स, (३) समूह-आधारित निष्पक्षता नियन्त्रण योजना, (४) गोपनीयता नियन्त्रण। त्यसपछि प्रश्नको ठोस जवाफ लेख्नुहोस् "यदि यो भोलि चुपचाप तोडियो र यसलाई फिर्ता लिनुहोस् भने म कसरी ध्यान दिनेछु?"

चेकलिस्ट

  • के म अनुगमन (स्लिप अलर्ट) र रोलब्याक योजनाको साथ मोडेल तैनात गर्दैछु?
  • के मैले विभिन्न समूहहरूको निष्पक्षता/कार्यसम्पादन अन्तर जाँच गरेको छु?
  • [ ] के मैले उच्च प्रभाव पार्ने निर्णयहरूमा मानव-इन-द-लूप कायम गरेको छु?
  • के मैले KVKK/GDPR सिद्धान्तहरूद्वारा व्यक्तिगत डाटा सुरक्षित गरेको छु र तिनीहरूलाई खुला उपकरणहरूबाट टाढा राखेको छु?
  • [ ] के मैले मोडेललाई होइन मानवलाई अन्तिम जिम्मेवारी दिएको छु ?

मोड्युल परीक्षा

१. एक डाटा वैज्ञानिकले कृत्रिम बुद्धिमत्तालाई सोध्छन्, "यस डाटामा अनियमित वन कति सही छ?" कुनै पनि मोडेललाई प्रशिक्षण बिना, र प्रत्यक्ष रूपमा प्रस्तुतीकरणमा "89%" को जवाफ राख्छ। यस दृष्टिकोणमा आधारभूत त्रुटि के हो?

  • A) कृत्रिम बुद्धिमत्तालाई डाटा र मोडेलहरू नदिई मेट्रिक्सको लागि पर्खँदै; यसले उत्पादन गरेको नम्बर नक्कली हो र वास्तविक मेट्रिक प्रशिक्षण र परीक्षण मार्फत मात्र फेला पार्न सकिन्छ भन्ने कुरालाई बेवास्ता गर्दै ✔
  • ख) अनियमित वनको सट्टा लजिस्टिक रिग्रेसन प्रयोग गर्नुपर्छ
  • C) शुद्धता दर सधैं 90% भन्दा माथि हुनुपर्छ।
  • D) प्रस्तुतिमा मेट्रिकहरू समावेश गर्न कडा रूपमा निषेध गरिएको छ

स्पष्टीकरण: कृत्रिम बुद्धिमत्ताले मोडेल र डाटा पहुँच नगरी मेट्रिक उत्पादन गर्न सक्दैन; उसले दिएको नम्बर एक भ्रम (बनाईएको) हो। मेट्रिक तथ्याङ्क वैज्ञानिकको आफ्नै गणनाले मोडेललाई तालिम र परीक्षण गरिसकेपछि मात्र प्राप्त हुन्छ। अप्रमाणित आउटपुट एक हस्ताक्षर नगरिएको रिपोर्ट जस्तै हो।

2. एक मन्थन पूर्वानुमानको लागि डाटा सङ्कलन गर्दा 'खाता बन्दको कारण' स्तम्भ समावेश गरिएको छ; ग्राहक गएपछि मात्र यो स्तम्भ भरिन्छ। मोडेलले परीक्षण सेटमा 97% दिन्छ, तर उत्पादनमा काम गर्दैन। यो अवस्था को नाम र कारण के हो?

  • क) अत्याधिक शिक्षा; मोडेल धेरै जटिल छ
  • ख) डाटा चुहावट; ✔ जानकारी प्रयोग गर्दै जुन भविष्यवाणीको समयमा उपलब्ध हुनेछैन, तर लक्ष्यको परिणाम हो, सुविधाको रूपमा
  • सी) अपर्याप्त शिक्षा; मोडेल धेरै सरल छ
  • घ) चयन पूर्वाग्रह; सानो नमूना आकार

स्पष्टीकरण: यो एक क्लासिक डाटा चुहावट हो: 'समापन कारण' लक्ष्यको परिणाम हो र भविष्यवाणीको समयमा अझै पनि खाली छ। मोडेलले यो भविष्यको ज्ञानको साथ चाल गर्छ, यो परीक्षण सेटमा राम्रो देखिन्छ तर उत्पादनमा क्र्यास हुन्छ किनभने त्यो स्तम्भ खाली छ। प्रत्येक स्तम्भमा 'के मसँग यो भविष्यवाणीको समयमा छ' भन्ने प्रश्न सोध्नु पर्छ।

3. एक विश्लेषकले राजस्व स्तम्भमा हराइरहेको मानहरू औसतको साथ भर्छ; तर बेपत्ता व्यक्तिहरू वास्तवमा कम आय भएका वर्गका हुन् जसले कहिल्यै आय (व्यवस्थित हराएको) घोषणा गरेका छैनन्। यो भराई किन गलत छ?

  • A) माध्य सधैं माध्य भन्दा ठूलो हुन्छ, त्यसैले यो गलत छ
  • ख) छुटेका मानहरू कहिल्यै भर्नु हुँदैन, तिनीहरू सधैं मेटाइनुपर्छ
  • C) माध्यको साथ व्यवस्थित खाली ठाउँ भर्दा त्यो समूहलाई कृत्रिम रूपमा प्रतिनिधित्व गरेर डेटा विकृत हुन्छ; 'किन खाली छ' भन्ने प्रश्न नगरी भर्ना गरियो। ✔
  • D) औसत गणना गर्दा प्रदर्शन समस्या सिर्जना हुन्छ किनभने यो धेरै ढिलो छ

स्पष्टीकरण: कमीको कारणले समाधान निर्धारण गर्दछ। जब व्यवस्थित हराएको (एक निश्चित समूहमा केन्द्रित अन्तर) औसत भरिन्छ, त्यो समूह कृत्रिम रूपमा 'औसत आय' हुन्छ र डाटा विकृत हुन्छ। भर्नु अघि, 'किन खाली छ' भन्ने प्रश्न सोध्नु पर्छ; व्यवस्थित/महत्वपूर्ण हराएको मतलब भर्नु हुँदैन।

4. एउटा टोलीले 'विज्ञापन खर्च' र 'बिक्री' बीचको ०.७८ सम्बन्ध फेला पार्छ र बजेट दोब्बर गर्छ; जे होस्, वास्तवमा के ट्रिगर गर्दछ दुबै मौसमी अभियानहरू हुन्। तथ्याङ्कको कुन सिद्धान्तले यो त्रुटिलाई व्याख्या गर्छ?

  • क) सहसंबंध कारण होइन; लुकेको तेस्रो चरले दुबै चरहरूलाई असर गरिरहेको हुन सक्छ ✔
  • B) 0.78 को सहसंबंध धेरै कम भएकोले, सम्बन्धलाई बेवास्ता गर्नुपर्छ
  • C) सहसंबंध जहिले पनि कारण साबित हुन्छ, टोलीले यसलाई सही गर्यो
  • घ) विज्ञापन र बिक्री बीचको सम्बन्ध गणितीय हिसाबले गणना गर्न सकिँदैन।

स्पष्टीकरण: सहसंबंध कारण होइन। दुई चरहरू सँगै काम गर्न सक्छन् किनभने लुकेको तेस्रो चर (यहाँ मौसमी अभियानहरू) तिनीहरू दुवैलाई असर गर्छ। एउटाले अर्को कारण बनाउँछ भन्ने निष्कर्ष प्रयोग र क्षेत्रीय ज्ञानबाट मात्र स्थापित गर्न सकिन्छ; सहसंबंधको संख्या मात्र कारणको प्रमाण होइन।

5. धोखाधडी पत्ता लगाउने मोडेलले 99.2% शुद्धता देखाउँछ र टोलीले उत्सव मनाउँछ; तर, डाटामा नक्कली कारोबार दर ०.८% मात्र छ र मोडलको रिकॉल ६% छ। यो तालिकाले के देखाउँछ?

  • A) मोडेल एकदम सही छ किनभने शुद्धता 99% भन्दा बढी छ
  • ख) असन्तुलित डाटाको साथ शुद्धता भ्रामक छ; मोडेलले लगभग सबै नक्कली (कम सम्झना) छुटेको छ, उपयुक्त मेट्रिक ✔ मा हेर्नु पर्छ
  • C) मोडेलको रिकॉल उच्च भएकोले कुनै समस्या छैन
  • घ) नक्कली दर कम भएकाले मोडल बनाउन आवश्यक थिएन

स्पष्टीकरण: असन्तुलित डाटामा 'शुद्धता' भ्रामक छ। जब मोडेलले लगभग हरेक लेनदेनलाई 'क्लिन' भनिन्छ, यसले उच्च शुद्धता प्राप्त गर्दछ किनभने नक्कली धेरै थोरै हुन्छन्, तर यो नक्कली समात्न असफल हुन्छ, जुन यसको मुख्य उद्देश्य हो (6% सम्झनुहोस्)। तसर्थ, असंतुलित समस्याहरूमा, फोकस सटीकतामा होइन, तर कामको उद्देश्यका लागि उपयुक्त मेट्रिक्स र मेट्रिक्स, जस्तै सम्झना/परिशुद्धतामा केन्द्रित हुन्छ।

6. माग पूर्वानुमान परियोजनामा, समय-निर्भर डेटा अनियमित रूपमा प्रशिक्षण/परीक्षणमा विभाजित हुन्छ। मोडेलले 93% शुद्धता दिन्छ तर उत्पादनमा क्र्यास हुन्छ। सही विभाजन दृष्टिकोण के हुनुपर्छ?

  • A) परीक्षण सेटलाई विस्तार गर्दै, उदाहरणका लागि विभाजन 50%/50%
  • ख) थप जटिल मोडेल प्रयोग गर्दै
  • C) पूर्ण रूपमा विभाजन हटाउनुहोस् र सबै डेटाको साथ ट्रेन गर्नुहोस्
  • घ) कालानुक्रमिक विभाजन: पुरानो अवधि संग प्रशिक्षण र नयाँ अवधि संग परीक्षण, यसरी भविष्य हेर्न को लागी मोडेल रोक्न ✔

स्पष्टीकरण: यदि अनियमित विभाजन समय श्रृंखला डेटामा गरिन्छ भने, मोडेलले भविष्य देख्छ र प्रशिक्षणमा विगतको भविष्यवाणी गर्छ; यो एक चुहावट हो र वास्तवमा अवस्थित छैन कि सफलता उत्पादन गर्दछ। सही दृष्टिकोण कालानुक्रमिक विभाजन हो: पुरानो अवधि संग प्रशिक्षण र नयाँ अवधि संग परीक्षण, उत्पादन मा वास्तविक स्थिति को नक्कल (विगत देखि भविष्य को भविष्यवाणी)।

7. फिचर इन्जिनियरिङमा कुन डाटाबाट स्केलिंग (StandardScaler) प्यारामिटरहरू गणना गर्नुपर्छ र तिनीहरूलाई कसरी लागू गर्नुपर्छ?

  • A) यो सबै डेटा (प्रशिक्षण + परीक्षण सँगै) बाट गणना गरिनु पर्छ ताकि यो अधिक सटीक होस्।
  • ख) यो पङ्क्तिको आफ्नै मानबाट, प्रत्येक पङ्क्तिको लागि छुट्टै हिसाब गर्नुपर्छ
  • ग) परीक्षण डाटाबाट मात्र गणना गर्नुपर्छ
  • D) यो प्रशिक्षण डेटाबाट मात्र गणना गरिनु पर्छ, त्यसपछि समान प्यारामिटरहरू परीक्षण डेटामा लागू गरिनु पर्छ; अन्यथा यो लीक हुनेछ ✔

स्पष्टीकरण: सबै रूपान्तरणका मापदण्डहरू (माध्यम, मानक विचलन, आदि) जस्तै स्केलिंग, एन्कोडिङ र प्याडिङहरू प्रशिक्षण डेटाबाट मात्र सिक्नुपर्छ, त्यसपछि परीक्षण डेटामा पनि लागू गर्नुपर्छ। परीक्षण डेटालाई खातामा लिनुले पनि परीक्षण जानकारीलाई प्रशिक्षणमा हस्तक्षेप गर्दछ, अर्थात्, चुहावट, र मोडेललाई यो भन्दा राम्रो देखिन्छ। पाइपलाइन प्रयोग गर्दा यो सुनिश्चित हुन्छ।

8. एक मोडेलले प्रशिक्षण सेटमा 98% सटीकता र परीक्षण सेटमा 72% शुद्धता दिन्छ। यो लक्षणले के संकेत गर्छ र के गर्नुपर्छ?

  • क) अपर्याप्त शिक्षा; मोडललाई थप जटिल बनाउनुपर्छ
  • ख) डाटा चुहावट; परीक्षण सेट परिवर्तन गर्नुपर्छ
  • सी) ओभरफिटिंग; मोडेललाई सरलीकृत गरिनुपर्छ, नियमितीकरण र क्रस-भ्यालिडेसन लागू गरिनुपर्छ ✔
  • घ) एक सामान्य अवस्था; शिक्षाको स्कोर जहिले पनि उच्च छ, सावधानीहरू अनावश्यक छन्

स्पष्टीकरण: प्रशिक्षणमा धेरै उच्च स्कोर र परीक्षणमा उल्लेखनीय रूपमा कम स्कोर ओभरफिटिंगको एक क्लासिक लक्षण हो: मोडेलले वास्तविक ढाँचाको सट्टा प्रशिक्षण डेटाको आवाज याद गरेको छ। समाधानहरू मोडेललाई सरल बनाउने, थप डाटा, नियमितीकरण, र क्रस-प्रमाणीकरणको साथ राज्य प्रमाणीकरण समावेश गर्दछ। शिक्षा स्कोरमा मात्र भर पर्दा यो समस्या लुकाउँछ।

9. व्यवस्थापन प्रस्तुतीकरणमा, 1,000 बाट 1,020 सम्म बिक्री बढेको बार चार्टको y-अक्षलाई 980 मा सुरु गरिएको छ ताकि वृद्धि ठूलो देखिन्छ। वास्तविक वृद्धि २% हो। किन यो नैतिक मुद्दा हो?

  • A) एक काटिएको y-अक्षले नेत्रहीन रूपमा सानो भिन्नता बढाइचढाइ गर्दछ र दर्शकलाई बहकाउँछ; निष्पक्षताको लागि, तुलना बारहरूमा अक्ष ० बाट सुरु हुनुपर्छ ✔
  • B) बार चार्टहरू बिक्री डेटाको लागि प्रयोग गर्न सकिँदैन
  • C) कुनै समस्या छैन; चार्टलाई प्रभावशाली बनाउन सधैं राम्रो हुन्छ
  • D) Y-अक्ष सधैं डाटाको सबैभन्दा ठूलो मानबाट सुरु हुनुपर्छ

स्पष्टीकरण: तुलनात्मक उद्देश्यका लागि बार चार्टहरूमा, y-अक्ष सामान्यतया ० मा सुरु हुनुपर्छ। अक्षलाई काटेर 980 मा सुरु गर्दा सानो 2% भिन्नता दृश्यात्मक रूपमा ठूलो देखिन्छ र दर्शकलाई बहकाउँछ। डाटा प्रोफेशनलको नैतिक जिम्मेवारी भनेको इमानदार ग्राफहरू कोर्नु हो जसले डाटालाई ओभरस्टेट वा कम आंकलन गर्दैन।

10. एक विश्लेषकले उत्पादन तालिकासँग अर्डरहरू जोडेपछि कुल कारोबार ३ पटक फेला पार्छ; लाइनहरूको संख्या 240 हजार 690 हजार बाट बढ्यो। यो मौन त्रुटि रोक्न के गर्नुपर्थ्यो?

  • A) कुल कारोबारलाई 3 ले भाग गर्नुहोस्
  • B) सधैं JOIN को सट्टा छुट्टै प्रश्नहरू प्रयोग गर्नुहोस्
  • C) उत्पादन तालिका पूर्ण रूपमा मेटाउने
  • घ) मर्ज/जोइन पछि पङ्क्तिहरूको संख्या जाँच गर्दै र तिनीहरू सही कुञ्जी मार्फत जोडिएका छन् भनेर प्रमाणित गर्दै; छिट्टै प्रतिकृति समात्दै ✔

स्पष्टीकरण: जब उत्पादन तालिकामा प्रत्येक उत्पादनका लागि धेरै पङ्क्तिहरू छन् (उदाहरणका लागि, फरक रङ), गलत कुञ्जी मार्फत सामेल हुनाले प्रत्येक अर्डरको नक्कल हुनेछ र योगफल बढ्नेछ। कोड त्रुटि बिना चल्छ तर परिणाम गलत छ। यसबाट बच्ने उपाय भनेको प्रत्येक मर्ज/जोइन पछि पङ्क्तिहरूको संख्या जाँच गर्नु र सही कुञ्जीसँग मर्ज गर्नु हो।

11. एक भर्ती स्क्रिनिङ मोडेलले ऐतिहासिक डेटामा लिङ्ग असन्तुलन र व्यवस्थित रूपमा महिला उम्मेद्वारहरूको स्कोर अन्तर्गत सिक्छ, तर यसको समग्र शुद्धता उच्च छ। यसको मतलब के हो?

  • A) त्यहाँ कुनै समस्या छैन किनभने मोडेल उच्च सटीकता छ
  • ख) सांख्यिकीय शुद्धता नैतिक स्वीकार्यताको विकल्प होइन; मोडेलले विगतको भेदभावको बारेमा सिकेको छ, समूहमा आधारित निष्पक्षता जाँच आवश्यक छ ✔
  • C) मोडेलको शुद्धता थप बढाउँदा समस्या समाधान हुन्छ
  • D) निष्पक्षता डेटा विज्ञानको दायरा बाहिर छ

स्पष्टीकरण: यदि एक मोडेल सांख्यिकीय रूपमा सही छ भने, यो नैतिक रूपमा अस्वीकार्य हुन सक्छ। मोडेलले विगतको डेटामा अन्याय सिकाउँछ र भेदभावलाई स्वचालित बनाउँछ। उच्च निष्ठा न्यायको विकल्प होइन; उच्च-प्रभाव मोडेलहरूमा, निष्पक्षता नियन्त्रण, जसले विभिन्न समूहहरूको लागि कार्यसम्पादन/निर्णय भिन्नता मापन गर्दछ, आवश्यक छ र अन्तिम जिम्मेवारी मानवमा हुन्छ।

12. एक कर्मचारीले सार्वजनिक AI उपकरणमा वास्तविक ग्राहक इमेलहरू र खरिद इतिहास समावेश भएको फाइल अपलोड गर्दछ र 'सेगमेन्टहरू संक्षेप गर्नुहोस्' भन्छ। यो किन गम्भीर गल्ती हो र सही तरिका के हो?

  • क) कुनै समस्या छैन; एआई उपकरणहरूले कहिल्यै डाटा भण्डार गर्दैन
  • B) त्रुटि यो हो कि फाइल धेरै ठूलो छ; घटाउनुपर्थ्यो
  • C) खुला उपकरणमा वास्तविक व्यक्तिगत डेटा उपलब्ध गराउनु KVKK/GDPR को उल्लङ्घन हो; पहिचान क्षेत्रहरू हटाइएको हुनुपर्छ र केवल बेनामी स्कीमा/सम्पत्ति साझा गरिएको हुनुपर्छ ✔
  • D) CSV मात्र Excel को सट्टा प्रयोग गरिएको हुनुपर्छ

स्पष्टीकरण: जब वास्तविक व्यक्तिगत डेटा (जस्तै इ-मेल, नाम, आदि) सार्वजनिक रूपमा उपलब्ध कृत्रिम बुद्धिमत्ता उपकरणलाई दिइन्छ, त्यहाँ KVKK / GDPR को दायरा भित्र गोपनीयता उल्लङ्घन हुनेछ; डाटा संगठन छोड्छ। अधिकांश समय, एक रेखाचित्र र एक बेनामी/सिंथेटिक नमूना विश्लेषणको लागि पर्याप्त छन्। सही तरिका पहिचान क्षेत्रहरू हटाउन र केवल बेनामी गुणहरू साझेदारी गर्न हो।

13. एक सिफारिस मोडेल उत्पादन मा राखिएको छ तर ट्र्याकिङ स्थापित छैन; जब उत्पादन सूची 4 महिना पछि परिवर्तन हुन्छ, मोडेलले पुराना उत्पादनहरू सिफारिस गर्न जारी राख्छ र रूपान्तरण दर चुपचाप 30% ले घट्छ। यो घटना को नाम के हो?

  • क) अत्याधिक शिक्षा; मोडेलले प्रशिक्षण सेट सम्झन्छ
  • बी) मोडेल बहाव; संसार परिवर्तन हुँदा, मोडेल चुपचाप अप्रचलित हुन्छ, ध्यान नदिईएको कारण अनुगमन स्थापित छैन ✔
  • सी) चयन पूर्वाग्रह; नमूना पूर्वाग्रह
  • D) डाटा न्यूनीकरण उल्लङ्घन

स्पष्टीकरण: यो मोडेल ड्रिफ्ट (मोडेल/डेटा ड्रिफ्ट) हो: जब संसार परिवर्तन हुन्छ (क्याटलग, व्यवहार, सिजन) मोडेललाई प्रशिक्षित शिफ्टको अवस्था र मोडेल चुपचाप बिच्छेद हुन्छ। उत्पादनमा राखिएको मोडेल आफैं बिग्रन्छ; यो 'कहिले' को कुरा हो। अनुगमन बिना तैनाती (ट्र्याकिङ इनपुट र प्रदर्शन) ले गिरावट पत्ता लगाउन असम्भव बनाउँछ।

14. एकल प्रशिक्षण/परीक्षण विभाजनमा 88% सटीकता प्राप्त गर्ने मोडेलको 88%, 71%, 83%, 64%, 79% को 5-गुणा क्रस-प्रमाणीकरण स्कोरहरू छन्। यसले के संकेत गर्छ र क्रस-प्रमाणीकरण किन महत्त्वपूर्ण छ?

  • ए) मोडेल स्थिर छ; 88% वास्तविक प्रदर्शन हो
  • ख) क्रस-प्रमाणीकरण अनावश्यक छ; एक डिब्बा पर्याप्त छ
  • C) स्कोरको ठूलो अस्थिरताले मोडेल अस्थिर छ भनेर संकेत गर्छ; एकल लक्की बिन होइन ✔
  • D) उच्चतम स्कोर (८८%) रिपोर्ट गर्नु राम्रो हुन्छ

स्पष्टीकरण: एकल डिब्बा भाग्यशाली वा अशुभ हुन सक्छ; ८८% त्यो सजिलो विभाजनको नतिजा मात्र थियो। क्रस-प्रमाणीकरणले डेटालाई धेरै पटक विभाजित गर्दछ, औसत (यहाँ ~ 77%) मा आधारित प्रदर्शन र स्कोरको अस्थिरता देखाउँदै। उच्च अस्थिरता यहाँ सुझाव दिन्छ कि मोडेल अस्थिर छ; एउटै कम्पार्टमेन्टमा भर पर्नु भ्रामक हो।