युनिट्स
1. डेटा विज्ञान आणि विश्लेषणातील कृत्रिम बुद्धिमत्तेचा परिचय: कार्यप्रवाह, भूमिका, सीमा, प्रमाणीकरण आणि नीतिशास्त्र 2. डेटा संकलन आणि स्त्रोत समजून घेणे: स्कीमा, सॅम्पलिंग, गुणवत्ता आणि लीक जागरूकता 3. डेटा क्लीनिंग आणि प्रीप्रोसेसिंग: गहाळ मूल्य, बाह्य आणि प्रकार रूपांतरण 4. एक्सप्लोरेटरी डेटा ॲनालिसिस (EDA): वितरण, संबंध आणि प्रारंभिक अंतर्दृष्टी 5. वैशिष्ट्य अभियांत्रिकी: रूपे निर्माण करणे, कोडिंग, स्केलिंग आणि गळती टाळणे 6. मॉडेल बिल्डिंग: समस्या व्याख्या, अल्गोरिदम निवड आणि प्रशिक्षण/चाचणी विभाजन 7. मॉडेल मूल्यांकन: मेट्रिक्स, क्रॉस-व्हॅलिडेशन आणि एक्सट्रीम लर्निंग 8. व्हिज्युअलायझेशन आणि स्टोरीटेलिंग: अचूक ग्राफिक्स, प्रामाणिक ग्राफिक्स 9. कोड जनरेशन: पायथन (पांडा) आणि SQL सह AI-सहाय्यित विश्लेषण 10. डेटा लीकेज आणि पुनरुत्पादनक्षमता: मूक आपत्ती आणि शिस्त 11. MLOps फाउंडेशन, नैतिकता, गोपनीयता आणि जबाबदार विश्लेषण
युनिट 1 / 11

डेटा विज्ञान आणि विश्लेषणातील कृत्रिम बुद्धिमत्तेचा परिचय: कार्यप्रवाह, भूमिका, सीमा, प्रमाणीकरण आणि नीतिशास्त्र

नफा:

  • डेटा विज्ञान (समस्या व्याख्या, संकलन, साफसफाई, शोध, मॉडेलिंग, संप्रेषण) आणि कार्य जोखीम पातळीनुसार प्रत्येक टप्प्यावर कृत्रिम बुद्धिमत्ता ज्या अधिकाराखाली कार्य करते त्या सहा-स्टेज वर्कफ्लोमध्ये फरक करण्याची क्षमता
  • एक शिस्त लागू करण्याची क्षमता जी प्रत्येक कृत्रिम बुद्धिमत्ता आउटपुटला स्त्रोताशी कनेक्ट करून, चालवून आणि त्याची तुलना करून आणि तज्ञ फिल्टरिंगद्वारे पास करून सत्यापित करते.
  • पुनरुत्पादकता आणि गोपनीयता तत्त्वे (कोडमध्ये लिहिणे, निनावीकरण) पहिल्या दिवसापासून विश्लेषणाच्या सवयींमध्ये बदलण्याची क्षमता

कच्चा, गोंधळलेला आणि बऱ्याचदा “खोटे” डेटा डेटा सायंटिस्टच्या डेस्कवर दररोज येतो. विक्री सारणीमध्ये, तारीख स्तंभ तीन वेगवेगळ्या स्वरूपात लिहिलेला आहे; काही ओळींमध्ये ग्राहक क्रमांक रिक्त आहेत; स्तंभाचे नाव "उत्पन्न" आहे, परंतु त्यात TL आणि USD दोन्ही मूल्ये आहेत. या गोंधळातून विश्वासार्ह निर्णय घेणे हे डेटा सायन्सचे कार्य आहे: डेटा गोळा करणे, तो स्वच्छ करणे, ते एक्सप्लोर करणे, मॉडेल तयार करणे, निकाल सत्यापित करणे आणि त्यास एका कथेत बदलणे. आर्टिफिशियल इंटेलिजन्स (एआय, किंवा लघु संगणक प्रणाली जी मजकूर आणि कोड तयार करू शकते, नमुने ओळखू शकते, सारांश बनवू शकते आणि अंदाज लावू शकते) या साखळीतील प्रत्येक दुव्याला स्पर्श करू शकते: काही मिनिटांत क्लीनअप कोड लिहिणे, एक्सप्लोरेटरी विश्लेषणासाठी आलेखांची शिफारस करणे, मॉडेलच्या मेट्रिकचा अर्थ लावणे, SQL क्वेरी दुरुस्त करणे. परंतु तेच AI तुम्हाला कधीही न पाहिलेल्या डेटासाठी "सहसंबंध 0.72" सारखे आत्मविश्वासपूर्ण बनावट देखील देऊ शकते.

हे पहिले युनिट म्हणजे ग्रंथालयाचा परिचय नाही. डेटा सायन्स वर्कफ्लोमध्ये AI कुठे ठेवायचे आणि कुठे ठेवू नये हे स्पष्ट करणे हा त्याचा उद्देश आहे. चला सुरुवातीपासून मूलभूत तत्त्व मांडू: एआय एक सहाय्यक आहे, डेटा वैज्ञानिक नाही. कोणता डेटा संकलित करायचा, कोणत्या मेट्रिकवर निर्णय घ्यायचा, उत्पादनात मॉडेल ठेवायचे की नाही आणि नैतिक सीमा कोठे काढायची याचा निर्णय सक्षम तज्ञांवर अवलंबून असतो. अप्रमाणित AI आउटपुट धोकादायक आहे, जसे की स्वाक्षरी न केलेले विश्लेषण अहवाल आहे.

डेटा सायन्स वर्कफ्लो: एंड-टू-एंड नकाशा

डेटा प्रकल्प समजून घेण्यासाठी, ते सहा टप्प्यांत विभागणे उपयुक्त आहे. हे संपूर्ण मॉड्यूल या नकाशाचे अनुसरण करते.

1. समस्येची व्याख्या: कोणत्या निर्णयाचे समर्थन करण्यासाठी आपण काय मोजतो, का करतो? हा टप्पा AI ला सुपूर्द केलेला नाही; ती व्यक्ती आहे जी नोकरीची व्याख्या करते.

2. डेटा संकलन: स्त्रोत ओळखणे, डेटा काढणे, नमुना घेणे. (युनिट 2)

3. डेटा क्लीनिंग आणि प्रीप्रोसेसिंग: गहाळ मूल्य, बाह्य, प्रकार रूपांतरण. (युनिट 3)

4. एक्सप्लोरेटरी डेटा ॲनालिसिस (EDA - एक्सप्लोरेटरी डेटा ॲनालिसिस, "डोळ्याद्वारे" डेटाचे वितरण आणि संबंध ओळखण्याचा टप्पा): (युनिट 4)

5. वैशिष्ट्य अभियांत्रिकी आणि मॉडेलिंग: व्हेरिएबल जनरेशन, अल्गोरिदम निवड, प्रशिक्षण, मूल्यांकन. (एकक ५, ६, ७)

6. संप्रेषण आणि उत्पादन: व्हिज्युअलायझेशन, कथा, MLOps (मॉडेल थेट घेण्याची आणि त्याचे निरीक्षण करण्याची शिस्त). (एकक 8, 11)

AI या सहा टप्प्यांपैकी प्रत्येकामध्ये वेगळ्या अधिकाराने कार्य करते. खालील तक्ता अधिकाराच्या या वितरणाचा सारांश देतो; हे मॉड्यूलचे सर्वात महत्वाचे सारणी आहे.

स्टेज

AI ची भूमिका

जोखीम पातळी

कोण मंजूर करतो

समस्येची व्याख्या

विचारमंथन करणारा भागीदार

कमी

डेटा वैज्ञानिक + भागधारक

क्लीनअप कोड लिहा

कोड स्केच जनरेटर

मध्यम

डेटा सायंटिस्ट (कोड वाचतो)

EDA टिप्पणी

नमुना सूचक

मध्यम

डेटा वैज्ञानिक

वैशिष्ट्य निर्मिती

कल्पना आणि कोड जनरेटर

मध्यम-उच्च

गळती नियंत्रण आवश्यक आहे

मॉडेल निवड/मेट्रिक

सल्लागार

उच्च

डेटा वैज्ञानिक

उत्पादनात टाकण्याचा निर्णय

सहाय्यक इनपुट

खूप उच्च

संघ + व्यवसाय मालक

नैतिकता/गोपनीयतेची मान्यता

उत्तेजक

खूप उच्च

मनुष्य, नेहमी

या तक्त्यातील एक वाक्य लक्षात ठेवा: जसजसे स्टेक्स वाढत जातात, तसतशी AI ची भूमिका कमी होत जाते आणि मानवी मान्यता वाढते.

सत्यापन हे या व्यवसायाचे हृदय का आहे

एआय भाषेचे मॉडेल खात्रीपूर्वक दिसत आहेत, परंतु ते निश्चित नसतील. तांत्रिक भाषेत, याला मतिभ्रम म्हणतात: अस्खलित वाक्यात अस्तित्त्वात नसलेली माहिती खरी असल्याप्रमाणे तयार करणे हे मॉडेलचे बनावट आहे. डेटा सायन्समध्ये, हे तीन प्रकारात येते. पहिला बनावट क्रमांक आहे: जर तुम्ही मॉडेलला कोणताही डेटा न देता "ऑर्डरची सरासरी रक्कम काय आहे" असे विचारले, तर तो तुमचा डेटा कधीही पाहिला नसला तरीही तो तुम्हाला एक नंबर सांगेल. दुसरे असे फंक्शन आहे जे अस्तित्वात नाही: मॉडेल अजिबात अस्तित्वात नसलेले फंक्शन सुचवू शकते, जसे की pandas.read_excel_fast(). तिसरे, चुकीचे सांख्यिकीय व्याख्या: मॉडेल सहजतेने क्लासिक सांख्यिकीय त्रुटीची पुनरावृत्ती करू शकते जसे की "p-मूल्य 0.04 आहे, त्यामुळे गृहितक 96% बरोबर आहे".

पडताळणी शिस्तीत तीन पायऱ्या असतात:

  1. स्त्रोताशी दुवा: प्रत्येक क्रमांक, दर आणि कल तुमच्या डेटामधून आला पाहिजे, AI च्या मेमरीमधून नाही. डेटा लक्षात ठेवण्यासाठी नव्हे तर डेटावर ऑपरेट करणाऱ्या कोडसाठी AI वापरा.
  2. चालवा आणि तुलना करा: एआयने दिलेल्या कोडचा प्रत्येक तुकडा स्वतः चालवा; ते तयार करत असलेल्या प्रत्येक मेट्रिकची स्वतंत्र बेसलाइनशी तुलना करा.
  3. तज्ञ फिल्टर: आउटपुट आकडेवारी आणि डोमेन ज्ञानाचा विरोध करते की नाही हे स्वतःसाठी तपासा.
खबरदारी: एआयने लिहिलेले विश्लेषण न चालवता प्रेझेंटेशनमध्ये ठेवणे आणि ते वाचणे म्हणजे स्वाक्षरी नसलेला अहवाल सादर करण्यासारखे आहे. फक्त कोड काम करत आहे याचा अर्थ ते बरोबर आहे असे नाही; चुकीच्या स्तंभाची बेरीज करणारा कोड देखील त्रुटींशिवाय कार्य करतो.

पुनरुत्पादनक्षमता: समान परिणाम दोनदा देण्यास सक्षम असणे

डेटा सायन्सचे मूक परंतु गंभीर तत्त्व म्हणजे पुनरुत्पादनक्षमता: जेव्हा तुम्ही सहा महिन्यांनंतर किंवा वेगळ्या संगणकावर पुन्हा विश्लेषण करता तेव्हा तुम्हाला समान परिणाम मिळतात. AI सोबत काम करताना हा धोका वाढतो, कारण जेव्हा तुम्ही AI ला "हा आलेख बनवायला" आणि तो स्वहस्ते प्ले करायला सांगता तेव्हा पायऱ्या गायब होतात. नियम: प्रत्येक पायरी कोड आणि आवृत्ती नियंत्रण (जसे Git) मध्ये नोंदणीकृत असणे आवश्यक आहे; यादृच्छिकतेचा समावेश असलेल्या चरणांमध्ये, यादृच्छिक बियाणे (यादृच्छिक संख्या जनरेटरचे प्रारंभिक मूल्य; निश्चित केले असल्यास, परिणाम पुनरावृत्ती करण्यायोग्य असेल) निश्चित केले पाहिजे. आम्ही युनिट 10 मध्ये हा विषय सखोल करू; आत्तासाठी, ही सवय लावा: "हाताने क्लिक करू नका, कोडमध्ये लिहा."

तीन लहान प्रकरणे

केस 1 - सुरक्षित प्रवेग. ई-कॉमर्स विश्लेषक साधारणपणे 240 हजार पंक्तींचे ऑर्डर टेबल साफ करण्यात अर्धा दिवस घालवतात. त्याने एआयला कॉलमची नावे आणि पहिल्या 5 पंक्ती (वैयक्तिक डेटाशिवाय) दिल्या आणि पांडा क्लिनिंग कोड मागितला. एआयने 8 सेकंदात मसुदा तयार केला; विश्लेषकाने कोड लाइन ओळीने वाचली, तारीख पार्सिंगमध्ये त्रुटी निश्चित केली आणि ती चालवली. कालावधी: 4 तासांऐवजी 35 मिनिटे. एआयने कोड दिला, पडताळणी माणसाकडेच राहिली.

केस 2 - बनवलेला मेट्रिक ट्रॅप. एका इंटर्नने एआयला विचारले, "या डेटावर यादृच्छिक जंगल किती अचूक आहे?" मॉडेलला अजिबात प्रशिक्षण न देता. "सुमारे 89%," एआय म्हणाला. इंटर्नने हे सादरीकरणात ठेवले; जेव्हा वास्तविक मॉडेल प्रशिक्षित होते, तेव्हा अचूकता 71% होती. चूक: AI ला डेटा आणि मॉडेल न देता मेट्रिक्सची वाट पाहत आहे.

केस 3 - मूक गळती. एका टीमने AI-सुचवलेली कल्पना "लक्ष्य व्हेरिएबलचे वैशिष्टय़ म्हणून मध्यभागी जोडा" याची कोणतीही शंका न घेता अंमलात आणली. मॉडेलने चाचणी सेटवर 98% कामगिरी केली परंतु उत्पादनात क्रॅश झाले कारण वैशिष्ट्य भविष्यातील माहिती लीक करत होते (डेटा लीक, युनिट 10). चूक: सांख्यिकीयदृष्ट्या AI शिफारस फिल्टर करत नाही.

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत प्रॉम्प्ट:

या विक्री डेटाचे विश्लेषण करा आणि मला सरासरी कमाई सांगा.

हा दावा सदोष आहे: AI ला डेटा दिला गेला नाही, म्हणून "सरासरी उत्पन्न" फक्त केले जाऊ शकते. स्तंभ, कालावधी किंवा चलन स्पष्ट नाही.

शक्तिशाली सूचना:

तुमची भूमिका: डेटा सायंटिस्टला मदत करणारा सहाय्यक. माझ्याकडे पांडा डेटाफ्रेम आहे: df. स्तंभ:- order_date (मजकूर, फॉरमॅट "2024-03-01") - amount_tl (दशांश, काही पंक्तींमध्ये NaN)- customer_id (पूर्णांक) कार्य: (1) सरासरी रकमेची गणना करणारा पांडा कोड लिहा, (2) ते NaN मूल्ये कशी हाताळतात हे स्पष्ट करा, (3) कोड गृहीतकांची सूची बनवते. डेटा सामग्री बनवू नका; फक्त कोड व्युत्पन्न करा आणि मी रन करेन आणि परिणाम सत्यापित करेन.

या विनंतीमध्ये, योजना, अपेक्षा आणि "बनावटीची बंदी" स्पष्ट आहे. तुम्ही अजूनही चालवा आणि आउटपुट स्वतः सत्यापित करा.

नैतिकता आणि गोपनीयतेची सुरुवात

डेटा विज्ञान सहसा वैयक्तिक डेटासह कार्य करते: ग्राहक, रुग्ण, कर्मचारी रेकॉर्ड. Türkiye मधील KVKK (वैयक्तिक डेटा संरक्षण कायदा) आणि युरोपमधील GDPR या डेटाचे संरक्षण करतात. सार्वजनिक एआय टूलमध्ये तुमचे खरे नाव, आयडी, ईमेल किंवा पत्ता पेस्ट करणे हे उल्लंघन आहे. नियम: शेअर करण्यापूर्वी डेटा अनामित करा, आवश्यक असल्यास फक्त स्कीमा (स्तंभ नावे, प्रकार) आणि डमी उदाहरण पंक्ती प्रदान करा. आम्ही युनिट 11 मध्ये नैतिकतेचा विषय सखोल करू; चला सुरुवातीपासून तत्त्व ठेवूया: डेटा समजून घेण्यासाठी, त्याची रचना सामायिक करणे, त्याची सामग्री नव्हे, बरेचदा पुरेसे असते.

सामान्य चुका

  • AI ला डेटा न देता संख्या/मेट्रिक्सची वाट पाहत आहे. मॉडेल डेटामध्ये प्रवेश करू शकत नाही; त्याने दिलेला नंबर खोटा आहे. नेहमी निकालाची गणना करा आणि चालवा.
  • कार्य संहिता योग्य आहे असा विचार करणे. चुकीच्या कॉलममध्ये फेरफार करणारा कोड देखील त्रुटींशिवाय चालतो; तर्कशास्त्र वाचल्याशिवाय विश्वास ठेवू नका.
  • ओपन टूलमध्ये वास्तविक वैयक्तिक डेटा पेस्ट करणे. नाव, आयडी क्रमांक, ई-मेल कधीही शेअर केला जात नाही; आकृती पुरेशी आहे.
  • स्टेप्स मॅन्युअली करा आणि कोडमध्ये लिहू नका. पुनरुत्पादक नसलेले विश्लेषण अविश्वसनीय आहे.
  • AI चे सांख्यिकीचे विवेचन प्रश्नाशिवाय स्वीकारणे. पी-व्हॅल्यू आणि सहसंबंध यासारख्या संकल्पनांमध्ये AI क्लासिक चुका पुन्हा करू शकते.
टीप: तुमच्या प्रत्येक AI सत्रात एक लहान "नियम रेषा" समाविष्ट करा: "डेटा सामग्री तयार करू नका; फक्त कोड/विश्लेषण तयार करा आणि मी रन करून निकालाची पडताळणी करेन; तुम्हाला खात्री नसेल तिथे 'खात्री नाही' सूचित करा." हे एक वाक्य भ्रम होण्याचा धोका लक्षणीयरीत्या कमी करते.

सारांशात

AI डेटा सायन्समध्ये एक शक्तिशाली सहाय्यक आहे: ते क्लिनिंग कोड, EDA व्याख्या, मॉडेल शिफारस आणि व्हिज्युअलायझेशनला गती देते. परंतु समस्येची व्याख्या, मेट्रिक निवड, उत्पादन निर्णय आणि नैतिक सीमा मानवाच्याच आहेत. वर्कफ्लोमध्ये सहा टप्पे असतात आणि जोखीम वाढल्याने AI ची भूमिका लहान होते. तीन सवयी प्रत्येक गोष्टीचा पाया आहेत: स्त्रोत लिंकिंग (प्रमाणीकरण), पुनरुत्पादकता (कोडिंग), आणि निनावीकरण (गोपनीयता). एकदा तुम्ही या तिघांना आंतरीक केले की, उर्वरित मॉड्यूलमधील प्रत्येक साधन तुमच्यासाठी सुरक्षित प्रवेगक बनते.

अर्ज कार्य

फक्त तुमच्याकडे असलेल्या एका लहान टेबलचा (किंवा काल्पनिक) स्कीमा बनवा: स्तंभांची नावे, प्रकार आणि 2-3 डमी उदाहरण पंक्ती (वास्तविक वैयक्तिक डेटाशिवाय). वरील "पॉवरफुल प्रॉम्प्ट" टेम्प्लेट वापरून सारांश आकडेवारी कोडसाठी AI ला विचारा. कोड चालवा, मॅन्युअल मूल्याशी आउटपुटची तुलना करा, कोणतीही खोटी गृहितके तपासा आणि 5 बुलेट पॉइंट्समध्ये तुमचे निष्कर्ष लक्षात घ्या.

चेकलिस्ट

  • [ ] मी खऱ्या वैयक्तिक डेटाऐवजी AI ला स्कीमा आणि बनावट नमुना दिला आहे का?
  • [ ] मी ओळीने तयार केलेला कोड वाचला आणि चालवला का?
  • मी आउटपुटमधील प्रत्येक क्रमांकाची स्वतंत्रपणे पडताळणी केली आहे का?
  • [ ] मी विश्लेषणाची प्रत्येक पायरी कोडमध्ये लिहून ती पुनरावृत्ती करण्यायोग्य बनवली आहे का?
  • मी मिशनची जोखीम पातळी निश्चित केली आहे आणि अंतिम निर्णय माणसाला सोपवला आहे का?