एकाइहरू
1. डाटा विज्ञान र विश्लेषणमा कृत्रिम बुद्धिमत्ताको परिचय: कार्यप्रवाह, भूमिका, सीमा, प्रमाणीकरण र नैतिकता 2. डाटा सङ्कलन र स्रोत बुझाइ: योजना, नमूना, गुणस्तर र चुहावट जागरूकता 3. डाटा क्लिनिङ र प्रिप्रोसेसिङ: छुटेको मान, आउटलियर र प्रकार रूपान्तरण 4. अन्वेषण डेटा विश्लेषण (EDA): वितरण, सम्बन्ध, र प्रारम्भिक अन्तर्दृष्टि 5. सुविधा ईन्जिनियरिङ्: भेरिएन्टहरू उत्पन्न गर्दै, कोडिङ, स्केलिङ, र चुहावट बेवास्ता गर्दै 6. मोडेल निर्माण: समस्या परिभाषा, एल्गोरिथ्म चयन, र प्रशिक्षण/परीक्षण विभाजन 7. मोडेल मूल्याङ्कन: मेट्रिक्स, क्रस-प्रमाणीकरण, र चरम शिक्षा 8. भिजुअलाइजेशन र स्टोरीटेलिङ: सटीक ग्राफिक्स, इमानदार ग्राफिक्स 9. कोड जेनेरेसन: पाइथन (पान्डा) र SQL को साथ एआई-सहायता विश्लेषण 10. डाटा चुहावट र पुन: उत्पादनशीलता: मौन आपदा र अनुशासन 11. MLOps फाउन्डेशन, नैतिकता, गोपनीयता र जिम्मेवार विश्लेषण
एकाइ 1 / 11

डाटा विज्ञान र विश्लेषणमा कृत्रिम बुद्धिमत्ताको परिचय: कार्यप्रवाह, भूमिका, सीमा, प्रमाणीकरण र नैतिकता

लाभ:

  • डेटा विज्ञानको छ-चरण कार्यप्रवाह छुट्याउन सक्ने क्षमता (समस्या परिभाषा, सङ्कलन, सफाई, आविष्कार, मोडेलिङ, सञ्चार) र प्रत्येक चरणमा कृत्रिम बुद्धिमत्ताले काम गर्ने अधिकार, कार्य जोखिम स्तर अनुसार।
  • अनुशासन लागू गर्ने क्षमता जसले प्रत्येक कृत्रिम बुद्धिमत्ता आउटपुटलाई स्रोतमा जडान गरेर, यसलाई चलाएर र तुलना गरेर, र विशेषज्ञ फिल्टरिङ मार्फत पारित गरेर प्रमाणित गर्दछ।
  • पुन: उत्पादनशीलता र गोपनीयता सिद्धान्तहरू (कोडमा लेख्ने, गुमनामकरण) लाई पहिलो दिनदेखि नै विश्लेषण गर्ने बानीमा परिणत गर्ने क्षमता

कच्चा, गन्दा, र प्रायः "झूटो" डाटा डेटा वैज्ञानिकको डेस्कमा हरेक दिन अवतरण हुन्छ। बिक्री तालिकामा, मिति स्तम्भ तीन फरक ढाँचामा लेखिएको छ; ग्राहक नम्बरहरू केही लाइनहरूमा खाली छन्; स्तम्भको नाम "आय" हो, तर यसले TL र USD दुवै मानहरू समावेश गर्दछ। डाटा विज्ञानको काम यस अराजकताबाट भरपर्दो निर्णय लिनु हो: डाटा सङ्कलन गर्नुहोस्, यसलाई सफा गर्नुहोस्, यसलाई अन्वेषण गर्नुहोस्, मोडेल निर्माण गर्नुहोस्, परिणाम प्रमाणित गर्नुहोस्, र यसलाई कथामा परिणत गर्नुहोस्। आर्टिफिसियल इन्टेलिजेन्स (एआई, वा छोटो कम्प्युटर प्रणालीका लागि एआई जसले पाठ र कोड उत्पन्न गर्न, ढाँचाहरू पहिचान गर्न, संक्षेप गर्न र भविष्यवाणीहरू गर्न सक्छ) यस चेनमा प्रत्येक लिङ्कलाई छुन सक्छ: मिनेटमा क्लिनअप कोड लेख्न, अन्वेषण विश्लेषणको लागि ग्राफहरू सिफारिस गर्ने, मोडेलको मेट्रिकको व्याख्या गर्ने, SQL क्वेरी सच्याउने। तर एउटै AI ले तपाईंलाई कहिल्यै नदेखेको डाटाको लागि "सहसंबंध ०.७२" जस्ता आत्मविश्वासपूर्ण बनावट पनि दिन सक्छ।

यो पहिलो एकाइ पुस्तकालय परिचय होइन। यसको उद्देश्य डाटा विज्ञान कार्यप्रवाहमा AI लाई कहाँ राख्ने र कहाँ कहिले नराख्ने भन्ने स्पष्ट पार्नु हो। सुरुदेखि नै आधारभूत सिद्धान्त राखौं: एआई सहायक हो, डाटा वैज्ञानिक होइन। कुन डेटा सङ्कलन गर्ने, कुन मेट्रिकमा निर्णय गर्ने, उत्पादनमा मोडल राख्ने वा नराख्ने, र नैतिक सीमाहरू कहाँ तान्ने भन्ने निर्णय सक्षम विशेषज्ञको हातमा हुन्छ। एक अप्रमाणित एआई आउटपुट जोखिमपूर्ण छ, जस्तै एक हस्ताक्षर नगरिएको विश्लेषण रिपोर्ट हो।

डाटा विज्ञान कार्यप्रवाह: अन्त-देखि-अन्त नक्शा

डेटा परियोजना बुझ्न, यसलाई छ चरणहरूमा विभाजन गर्न उपयोगी छ। यो सम्पूर्ण मोड्युलले यो नक्सालाई पछ्याउँछ।

1. समस्या परिभाषा: कुन निर्णयलाई समर्थन गर्न हामी के मापन गर्छौं, किन? यो चरण AI लाई प्रत्यायोजित गरिएको छैन; यो काम परिभाषित गर्ने व्यक्ति हो।

२. डाटा सङ्कलन: स्रोतहरू पहिचान गर्ने, डाटा निकाल्ने, नमूना लिने। (इकाइ २)

3. डाटा क्लिनिङ र प्रिप्रोसेसिङ: छुटेको मान, आउटलियर, प्रकार रूपान्तरण। (एकाइ ३)

4. अन्वेषण डेटा विश्लेषण (EDA - अन्वेषण डेटा विश्लेषण, "आँखा द्वारा" डेटाको वितरण र सम्बन्धहरू पहिचान गर्ने चरण): (इकाई 4)

5. सुविधा ईन्जिनियरिङ् र मोडेलिङ: चल उत्पादन, एल्गोरिथ्म चयन, प्रशिक्षण, मूल्याङ्कन। (एकाइ ५, ६, ७)

6. संचार र उत्पादन: भिजुअलाइजेशन, कथा, MLOps (मोडल लाई लाइभ लिने र अनुगमन गर्ने अनुशासन)। (इकाइ ८, ११)

AI यी छ वटा चरणहरू मध्ये प्रत्येकमा फरक अख्तियारसँग काम गर्दछ। तलको तालिकाले अख्तियारको यस वितरणलाई संक्षेप गर्दछ; यो मोड्युलको सबैभन्दा महत्त्वपूर्ण तालिका हो।

स्टेज

AI को भूमिका

जोखिम स्तर

कसले अनुमोदन गर्छ

समस्या परिभाषा

दिमागी साझेदार

कम

डाटा वैज्ञानिक + सरोकारवाला

सफाई कोड लेख्नुहोस्

कोड स्केच जेनरेटर

मध्यम

डाटा वैज्ञानिक (कोड पढ्छ)

EDA टिप्पणी

ढाँचा सल्लाहकार

मध्यम

डाटा वैज्ञानिक

सुविधा पुस्ता

आइडिया र कोड जनरेटर

मध्यम-उच्च

चुहावट नियन्त्रण आवश्यक छ

मोडेल चयन/मेट्रिक

सल्लाहकार

उच्च

डाटा वैज्ञानिक

उत्पादनमा ल्याउने निर्णय गरेको छ

सहायक इनपुट

धेरै उच्च

टोली + व्यवसाय मालिक

नैतिकता/गोपनीयता अनुमोदन

उत्तेजक

धेरै उच्च

मानव, सधैं

यस चार्टको एउटा वाक्यलाई ध्यानमा राख्नुहोस्: दांव बढ्दै जाँदा, AI को भूमिका कम हुँदै जान्छ र मानव अनुमोदन बढ्दै जान्छ।

किन प्रमाणीकरण यस व्यवसायको मुटु हो

एआई भाषा मोडेलहरू निश्चित देखिन्छन्, तर तिनीहरू निश्चित नहुन सक्छन्। प्राविधिक भाषामा, यसलाई भ्रम भनिन्छ: यो एक धाराप्रवाह वाक्यमा अवस्थित नभएको जानकारीको मोडेलको बनावट हो जस्तो कि यो सत्य हो। डाटा विज्ञान मा, यो तीन रूप मा आउँछ। पहिलो नक्कली नम्बर हो: यदि तपाइँ मोडेललाई कुनै डेटा नदिई "औसत अर्डर रकम के हो" सोध्नुहुन्छ भने, यसले तपाइँको डेटा कहिल्यै नदेखे तापनि तपाइँलाई निश्चित रूपमा नम्बर बताउनेछ। दोस्रो एक प्रकार्य हो जुन अवस्थित छैन: मोडेलले कुनै प्रकार्य सुझाव दिन सक्छ जुन अवस्थित छैन, जस्तै pandas.read_excel_fast()। तेस्रो, गलत सांख्यिकीय व्याख्या: मोडेलले "p-value 0.04 छ, त्यसैले परिकल्पना 96% सही छ" जस्ता क्लासिक सांख्यिकीय त्रुटिलाई सजिलै दोहोर्याउन सक्छ।

प्रमाणीकरण अनुशासनमा तीन चरणहरू हुन्छन्:

  1. स्रोतको लिङ्क: प्रत्येक नम्बर, दर, र प्रवृत्ति तपाईंको डाटाबाट आउनु पर्छ, AI को मेमोरीबाट होइन। डाटामा काम गर्ने कोडका लागि AI प्रयोग गर्नुहोस्, डेटा सम्झनका लागि होइन।
  2. चलाउनुहोस् र तुलना गर्नुहोस्: AI आफैले दिएको कोडको प्रत्येक टुक्रा चलाउनुहोस्; यसले उत्पादन गरेको प्रत्येक मेट्रिकलाई स्वतन्त्र आधार रेखासँग तुलना गर्नुहोस्।
  3. विशेषज्ञ फिल्टर: आउटपुट तथ्याङ्क र डोमेन ज्ञानको विरोधाभास हो कि होइन आफैलाई जाँच गर्नुहोस्।
सावधानी: एआई द्वारा लेखिएको विश्लेषणलाई ननकाईकन प्रस्तुतीकरणमा राख्नु र यसलाई पढेर हस्ताक्षर नगरी प्रतिवेदन प्रस्तुत गर्नु जस्तै हो। कोडले काम गरेकोले यो सही छ भन्ने होइन; गलत स्तम्भको योगफल दिने कोडले पनि त्रुटिविना काम गर्छ।

पुन: उत्पादनशीलता: एउटै परिणाम दुई पटक उत्पादन गर्न सक्षम हुनु

डेटा विज्ञानको मौन तर महत्वपूर्ण सिद्धान्त प्रजनन क्षमता हो: जब तपाइँ छ महिना पछि वा फरक कम्प्युटरमा विश्लेषण गर्नुहुन्छ, तपाइँले समान परिणाम प्राप्त गर्नुहुन्छ। AI सँग काम गर्दा यो जोखिम बढ्छ, किनभने जब तपाईंले AI लाई "यो ग्राफ बनाउन" र यसलाई म्यानुअल रूपमा प्ले गर्न भन्नुहुन्छ, चरणहरू गायब हुन्छन्। नियम: प्रत्येक चरण कोड र संस्करण नियन्त्रणमा दर्ता हुनुपर्छ (जस्तै Git); अनियमितता समावेश चरणहरूमा, अनियमित बीज (यादृच्छिक संख्या जनरेटरको प्रारम्भिक मान; यदि निश्चित छ भने, परिणाम दोहोर्याउन सकिनेछ) निश्चित हुनुपर्छ। हामी यो विषयलाई एकाइ १० मा गहिरो पार्नेछौं; अहिलेको लागि, यो बानीमा जानुहोस्: "हातले क्लिक नगर्नुहोस्, कोडमा लेख्नुहोस्।"

तीन मिनी केसहरू

केस १ - सुरक्षित प्रवेग। एक ई-वाणिज्य विश्लेषकले सामान्यतया 240 हजार पङ्क्तिहरूको अर्डर तालिका खाली गर्न आधा दिन खर्च गर्नेछ। उनले एआईलाई स्तम्भको नाम र पहिलो 5 पङ्क्तिहरू (व्यक्तिगत डेटा बिना) दिए र पाण्डा सफाई कोड मागे। एआईले 8 सेकेन्डमा ड्राफ्ट उत्पादन गर्‍यो; विश्लेषकले लाइनद्वारा कोड लाइन पढे, मिति पार्सिङमा त्रुटि फिक्स गर्यो, र यसलाई चलायो। अवधि: 4 घण्टाको सट्टा 35 मिनेट। एआई कोड प्रदान गरियो, प्रमाणिकरण मानवसँग रह्यो।

केस २ - बनेको मेट्रिक जाल। एक इन्टर्नले एआईलाई सोधे, "यस डाटामा अनियमित वन कत्तिको सही छ?" कुनै पनि मोडेल प्रशिक्षण बिना। "लगभग 89%," एआईले भन्यो। इन्टर्नले यसलाई प्रस्तुतीकरणमा राख्यो; जब वास्तविक मोडेल प्रशिक्षित गरिएको थियो, शुद्धता 71% थियो। गल्ती: AI लाई डेटा र मोडेलहरू नदिई मेट्रिक्सको लागि पर्खँदै।

केस 3 - मौन चुहावट। एउटा टोलीले कुनै प्रश्न नगरी "लक्ष्य भ्यारीएबलको मतलबलाई सुविधाको रूपमा थप्नुहोस्" को AI-सुझाव गरिएको विचार कार्यान्वयन गर्‍यो। मोडेलले परीक्षण सेटमा 98% प्रदर्शन गर्‍यो तर उत्पादनमा क्र्यास भयो किनभने सुविधाले भविष्यको जानकारी लीक गरिरहेको थियो (डेटा चुहावट, इकाई 10)। गल्ती: सांख्यिकीय रूपमा एआई सिफारिस फिल्टर गर्दैन।

कमजोर प्रम्प्ट / बलियो प्रम्प्ट

कमजोर प्रम्प्ट:

यो बिक्री डेटा विश्लेषण गर्नुहोस् र मलाई औसत राजस्व बताउनुहोस्।

यो दाबी त्रुटिपूर्ण छ: AI लाई डेटा दिइएको थिएन, त्यसैले "औसत आय" मात्र बनाउन सकिन्छ। न त स्तम्भहरू, न अवधि, न मुद्रा स्पष्ट छन्।

शक्तिशाली प्रम्प्ट:

तपाईंको भूमिका: डाटा वैज्ञानिकलाई सहयोग गर्ने सहायक। मसँग पाण्डा डाटाफ्रेम छ: df। स्तम्भहरू:- order_date (पाठ, ढाँचामा "२०२४-०३-०१")- amount_tl (दशमलव, केही पङ्क्तिहरूमा NaN) - ग्राहक_आईडी (पूर्णांक) कार्य: (१) औसत रकम गणना गर्ने पाण्डा कोड लेख्नुहोस्, (२) यसले NaN मानहरूलाई कसरी ह्यान्डल गर्छ भनेर वर्णन गर्नुहोस्, (३) कोडले अनुमानहरू सूची बनाउँछ। डाटा सामग्री बनाउन नगर्नुहोस्; केवल कोड उत्पन्न गर्नुहोस् र म चलाउनेछु र परिणाम प्रमाणित गर्नेछु।

यस अनुरोधमा, योजना, अपेक्षा र "बनावट निषेध" स्पष्ट छ। तपाईं अझै पनि चलाउनुहोस् र आउटपुट आफै प्रमाणित गर्नुहोस्।

नैतिकता र गोपनीयता को शुरुवात

डाटा विज्ञान अक्सर व्यक्तिगत डेटा संग काम गर्दछ: ग्राहक, बिरामी, कर्मचारी रेकर्ड। Türkiye मा KVKK (व्यक्तिगत डेटा संरक्षण कानून) र युरोपमा GDPR ले यो डेटा सुरक्षित गर्दछ। सार्वजनिक एआई उपकरणमा आफ्नो वास्तविक नाम, आईडी, इमेल वा ठेगाना टाँस्नु उल्लङ्घन हो। नियम: साझेदारी गर्नु अघि डेटा अज्ञात गर्नुहोस्, आवश्यक भएमा स्किमा (स्तम्भ नाम, प्रकारहरू) र डमी उदाहरण पङ्क्ति मात्र प्रदान गर्नुहोस्। हामी एकाइ 11 मा नैतिकताको विषयलाई गहिरो बनाउनेछौं; सुरुदेखि नै सिद्धान्त राखौं: डाटा बुझ्नको लागि, यसको संरचना साझा गर्नु, सामग्री होइन, प्रायः पर्याप्त हुन्छ।

सामान्य गल्तीहरू

  • AI लाई डेटा नदिई संख्या/मेट्रिक्सको लागि पर्खँदै। मोडेल डाटा पहुँच गर्न सक्दैन; उनले दिएको नम्बर नक्कली हो । सँधै नतिजा गणना गर्नुहोस् र चलाउनुहोस्।
  • काम गर्ने कोड सही छ भन्ने सोच्दै। गलत स्तम्भ हेरफेर गर्ने कोड पनि त्रुटि बिना चल्छ; तर्क पढे बिना विश्वास नगर्नुहोस्।
  • खुला उपकरणमा वास्तविक व्यक्तिगत डाटा टाँस्दै। नाम, आईडी नम्बर, इ-मेल कहिल्यै साझेदारी गरिएको छैन; रेखाचित्र काफी छ।
  • चरणहरू म्यानुअल रूपमा गर्दै र तिनीहरूलाई कोडमा नलेख्ने। पुन: उत्पादन गर्न नसकिने विश्लेषण अविश्वसनीय छ।
  • बिना प्रश्नको तथ्याङ्कको एआईको व्याख्या स्वीकार गर्दै। AI ले p-value र correlation जस्ता अवधारणाहरूमा क्लासिक गल्तीहरू दोहोर्याउन सक्छ।
सुझाव: तपाईंको प्रत्येक एआई सत्रहरूमा छोटो "नियम रेखा" समावेश गर्नुहोस्: "डेटा सामग्री नबनाउनुहोस्; केवल कोड/विश्लेषण उत्पन्न गर्नुहोस् र म नतिजा चलाएर प्रमाणित गर्नेछु; जहाँ तपाईं अनिश्चित हुनुहुन्छ 'निश्चित छैन' संकेत गर्नुहोस्।" यो एकल वाक्यले भ्रमको जोखिमलाई उल्लेखनीय रूपमा कम गर्छ।

संक्षेपमा

AI डाटा विज्ञानमा एक शक्तिशाली सहायक हो: यसले सफाई कोड, EDA व्याख्या, मोडेल सिफारिस र दृश्यलाई गति दिन्छ। तर समस्याको परिभाषा, मेट्रिक छनोट, उत्पादन निर्णय र नैतिक सीमाहरू मानवमा छन्। कार्यप्रवाहमा छवटा चरणहरू छन्, र जोखिम बढ्दै जाँदा AI को भूमिका सानो हुन्छ। तीन बानीहरू सबै चीजको आधार हुन्: स्रोत लिङ्किङ (मान्यता), पुन: उत्पादनशीलता (कोडिङ), र अज्ञातता (गोपनीयता)। एकचोटि तपाईंले यी तीनलाई आन्तरिक बनाउनुभयो भने, बाँकी मोड्युलमा प्रत्येक उपकरण तपाईंको लागि सुरक्षित गतिवर्धक हुन्छ।

आवेदन कार्य

तपाईंसँग भएको सानो तालिकाको स्कीमा बनाउनुहोस् (वा काल्पनिक एउटा): स्तम्भको नाम, प्रकार, र २-३ डमी उदाहरण पङ्क्तिहरू (वास्तविक व्यक्तिगत डेटा बिना)। माथिको "शक्तिशाली प्रम्प्ट" टेम्प्लेट प्रयोग गरेर सारांश तथ्याङ्क कोडको लागि AI लाई सोध्नुहोस्। कोड चलाउनुहोस्, आउटपुटलाई म्यानुअल मानसँग तुलना गर्नुहोस्, कुनै पनि गलत अनुमानहरू जाँच गर्नुहोस्, र 5 बुलेट बिन्दुहरूमा तपाईंको निष्कर्षहरू नोट गर्नुहोस्।

चेकलिस्ट

  • के मैले वास्तविक व्यक्तिगत डाटाको सट्टा एआईलाई स्किमा र नक्कली नमूना मात्र दिएँ?
  • [ ] के मैले यसलाई पङ्क्तिबद्ध रूपमा उत्पादन गरेको कोड पढेर चलाएको छु?
  • के मैले आउटपुटमा प्रत्येक नम्बरलाई स्वतन्त्र रूपमा प्रमाणित गरेको छु?
  • के मैले विश्लेषणको प्रत्येक चरण कोडमा लेखेको छु र यसलाई दोहोर्याउन योग्य बनाएको छु?
  • के मैले मिशनको जोखिम स्तर निर्धारण गरेको छु र मानवलाई अन्तिम निर्णय दिएको छु?