युनिट्स
1. डेटा विज्ञान आणि विश्लेषणातील कृत्रिम बुद्धिमत्तेचा परिचय: कार्यप्रवाह, भूमिका, सीमा, प्रमाणीकरण आणि नीतिशास्त्र 2. डेटा संकलन आणि स्त्रोत समजून घेणे: स्कीमा, सॅम्पलिंग, गुणवत्ता आणि लीक जागरूकता 3. डेटा क्लीनिंग आणि प्रीप्रोसेसिंग: गहाळ मूल्य, बाह्य आणि प्रकार रूपांतरण 4. एक्सप्लोरेटरी डेटा ॲनालिसिस (EDA): वितरण, संबंध आणि प्रारंभिक अंतर्दृष्टी 5. वैशिष्ट्य अभियांत्रिकी: रूपे निर्माण करणे, कोडिंग, स्केलिंग आणि गळती टाळणे 6. मॉडेल बिल्डिंग: समस्या व्याख्या, अल्गोरिदम निवड आणि प्रशिक्षण/चाचणी विभाजन 7. मॉडेल मूल्यांकन: मेट्रिक्स, क्रॉस-व्हॅलिडेशन आणि एक्सट्रीम लर्निंग 8. व्हिज्युअलायझेशन आणि स्टोरीटेलिंग: अचूक ग्राफिक्स, प्रामाणिक ग्राफिक्स 9. कोड जनरेशन: पायथन (पांडा) आणि SQL सह AI-सहाय्यित विश्लेषण 10. डेटा लीकेज आणि पुनरुत्पादनक्षमता: मूक आपत्ती आणि शिस्त 11. MLOps फाउंडेशन, नैतिकता, गोपनीयता आणि जबाबदार विश्लेषण
युनिट 2 / 11

डेटा संकलन आणि स्त्रोत समजून घेणे: स्कीमा, सॅम्पलिंग, गुणवत्ता आणि लीक जागरूकता

नफा:

  • विविध डेटा स्रोत (डेटाबेस, API, फाइल, वेब स्क्रॅपिंग) आणि प्रत्येकाचे तोटे ओळखण्याची आणि स्कीमा योग्यरित्या समजून घेण्याची क्षमता
  • नमुना लोकसंख्या आणि निवड पूर्वाग्रह दर्शवितो की नाही याचे मूल्यांकन करून पुनरावृत्ती करण्यायोग्य नमुना घेण्याची क्षमता
  • संकलनाच्या टप्प्यावर डेटा लीकेज दूर करण्याची क्षमता आणि प्रत्येक स्तंभात 'माझ्याकडे ते भविष्य सांगण्याच्या वेळी असेल का' असा प्रश्न विचारून कायदेशीर/नैतिक सीमा पाळण्याची क्षमता?

प्रत्येक विश्लेषण तुम्ही संकलित करत असलेल्या डेटाच्या गुणवत्तेइतकेच चांगले असते. जगातील सर्वात प्रगत मॉडेल देखील चुकीच्या पद्धतीने संकलित केलेल्या, पक्षपातीपणे नमुना घेतलेल्या किंवा भविष्याविषयी माहिती असलेल्या डेटासह कार्य करत असल्यास अविश्वसनीय परिणाम देईल. कॉम्प्युटर सायन्समध्ये, या तत्त्वाचा सारांश "कचरा आत, कचरा बाहेर" (कचरा आत, कचरा बाहेर) म्हणून दिला जातो. या युनिटमध्ये, आम्ही डेटा संकलनाचा टप्पा समाविष्ट करू: स्त्रोत समजून घेणे, नमुना घेणे, दर्जेदार प्रश्न विचारणे आणि पहिल्या दिवसापासून डेटा लीक होण्याच्या जोखमीबद्दल सतर्क राहणे. या टप्प्यावर कृत्रिम बुद्धिमत्ता ही एक शक्तिशाली मदत आहे; SQL क्वेरी लिहितो, API दस्तऐवजाचा सारांश देतो, डेटा कराराचा मसुदा तयार करतो. परंतु आपण कोणता डेटा संकलित करतो आणि तो डेटा आपले प्रतिनिधित्व करतो की नाही हे माणूस ठरवतो.

डेटा स्रोत जाणून घेणे

डेटा वेगवेगळ्या ठिकाणांहून येतो आणि प्रत्येक स्त्रोताचे स्वतःचे नुकसान आहेत. डेटाबेस (टेबलमध्ये संग्रहित केलेला संरचित डेटा, सामान्यत: SQL सह क्वेरी केला जातो) हा सर्वात सामान्य स्त्रोत आहे; हे विश्वसनीय आहे, परंतु त्याची योजना चांगल्या प्रकारे समजून घेणे आवश्यक आहे. API (ऍप्लिकेशन प्रोग्रामिंग इंटरफेस) थेट डेटा प्रदान करते परंतु वेग मर्यादा आणि स्वरूपातील बदलांचा धोका असतो. फायली (CSV, Excel, JSON) लवचिक आहेत परंतु फॉरमॅट विसंगतीसाठी प्रवण आहेत. वेब स्क्रॅपिंग शक्तिशाली आहे, परंतु त्याला कायदेशीर आणि नैतिक मर्यादा आहेत; प्रत्येक साइट स्क्रॅप केली जाऊ शकत नाही.

लक्ष द्या: वेब स्क्रॅपिंग आणि स्वयंचलित डेटा संकलनासाठी, साइटच्या वापराच्या अटी, robots.txt फाइल आणि KVKK/GDPR यांचे पालन करा. अनधिकृत डेटा संकलन कायदेशीर दायित्व निर्माण करते. माहितीच्या सुरक्षेच्या संदर्भात, डेटा संकलन साधने वापरा ज्या सिस्टमसाठी तुम्ही अधिकृत आहात आणि संरक्षण/विश्लेषण हेतूंसाठी; अनधिकृत प्रवेश किंवा स्क्रॅपिंग प्रतिबंधित आहे.

स्कीमा समजून घेणे: डेटाशी परिचित होणे

डेटा संच गोळा करण्यापूर्वी, तुम्ही त्याचा स्कीमा (स्तंभांची नावे, त्यांचा डेटा प्रकार, त्यांचे अर्थ आणि त्यांचे एकमेकांशी असलेले नाते) समजून घेतले पाहिजे. AI येथे "डेटा शब्दकोश" तयार करण्यासाठी खूप उपयुक्त आहे — प्रत्येक स्तंभाचा अर्थ काय आहे हे स्पष्ट करणारी एक सारणी. परंतु एआय जे स्पष्टीकरण तयार करते ते अंदाज आहेत; डेटा तयार करणाऱ्या टीमसह प्रत्येक स्तंभाच्या खऱ्या अर्थाची पुष्टी करा. उदाहरणार्थ, "स्थिती" नावाच्या स्तंभात 0/1/2 असू शकते; हे "प्रलंबित/मंजूर/रद्द केलेले" आहेत की आणखी काही हे केवळ मूळ संघालाच माहीत आहे.

खालील सारणी मूलभूत संसाधन प्रकार आणि सावधगिरीचा सारांश देते:

स्त्रोत

मजबूत बिंदू

सापळा

AI कशी मदत करते

SQL डेटाबेस

स्ट्रक्चरल, विश्वासार्ह

जटिल सामील

एक प्रश्न मसुदा लिहितो

API

थेट डेटा

गती मर्यादा, आकार बदल

दस्तऐवज सारांश, पुल कोड

CSV/Excel

लवचिक, जलद

स्वरूप विसंगती

कोड वाचा/विश्लेषण करा

वेब स्क्रॅपिंग

विस्तृत पोहोच

कायदेशीर/नैतिक मर्यादा

मसुदा पार्सिंग (अधिकारात)

लॉग/इव्हेंट डेटा

तपशीलवार

प्रचंड खंड

फिल्टरिंग क्वेरी

उदाहरण: भाग संपूर्ण प्रतिनिधित्व करतो का?

बऱ्याच वेळा, तुम्ही संपूर्ण डेटा ऐवजी नमुना (लोकसंख्येतून निवडलेला उपसंच) सह कार्य करता. गंभीर प्रश्न आहे: हा नमुना लोकसंख्येचे प्रतिनिधित्व करतो का? निवड पूर्वाग्रह हा सर्वात सामान्य सापळा आहे. उदाहरणार्थ, जर तुम्ही फक्त मोबाईल ॲपवरून वापरकर्त्यांचा नमुना घेतला तर तुम्हाला वेब वापरकर्ते दिसणार नाहीत आणि तुमचे परिणाम दिशाभूल करणारे असतील. यादृच्छिक नमुने (प्रत्येक रेकॉर्डला निवडले जाण्याची समान संधी असते) बहुतेक प्रकरणांमध्ये सर्वात सुरक्षित असते; परंतु टाइम सीरिज डेटामध्ये, स्प्लिटिंग यादृच्छिकपणे न करता कालक्रमानुसार केले जाते (आपण हे युनिट 7 आणि 10 मध्ये पाहू).

पहिल्या दिवसापासून लीक जागरूकता

डेटा लीकेज हे बहुतेक आपत्तींचे स्त्रोत आहे आणि सहसा डेटा संकलनाच्या टप्प्यात उद्भवते. उदाहरण: "ते रद्द केले होते" असे भाकीत करताना, तुम्ही डेटामध्ये "रद्द करण्याची तारीख" स्तंभ जोडल्यास, मॉडेल भविष्याकडे पाहते. मेळाव्याच्या टप्प्यात, प्रत्येक स्तंभासाठी एक प्रश्न विचारा: "मी भाकीत करत असताना ही माहिती माझ्याकडे असेल का?" जर उत्तर नाही असेल, तर तो स्तंभ लीक होत आहे. आम्ही हा विषय युनिट 10 मध्ये सखोलपणे कव्हर करू; पण जनजागृती पहिल्या दिवसापासून सुरू झाली पाहिजे.

तीन लहान प्रकरणे

केस 1 - प्रतिनिधित्वाची समस्या. एका बँकेने तिच्या क्रेडिट जोखीम मॉडेलसाठी (18,500 रेकॉर्ड) फक्त मंजूर कर्जावरील डेटा गोळा केला. नकार डेटामध्ये नव्हता. वास्तविक जगात मॉडेल चुकीचे होते कारण नकार देणारे कसे वागतील हे त्याने कधीही पाहिले नाही. धडा: नमुना संपूर्ण लोकसंख्येचा प्रतिनिधी असावा ज्यावरून तुम्ही तुमचा निर्णय घेत आहात.

केस 2 - मूक फॉर्म बदल. एक टीम दररोज API वरून किंमत डेटा काढत होती. एके दिवशी, API प्रदात्याने चलन USD वरून EUR मध्ये बदलले, परंतु डोमेन नाव तेच राहिले. 12 दिवसांसाठी चुकीच्या युनिटमध्ये डेटा गोळा केला गेला; 3,200 लाईन्स खराब झाल्या होत्या. धडा: API डेटामधील व्हॉल्यूम आणि फॉरमॅट सातत्य नियमितपणे तपासा.

केस 3 - लवकर गळती. एका विश्लेषकाने "मंथन" अंदाजासाठी डेटा गोळा करताना "खाते बंद होण्याचे कारण" स्तंभ समाविष्ट केला. ग्राहक गेल्यानंतरच हा कॉलम भरला गेला. चाचणी सेटवर मॉडेलने 97% अचूकता दिली; तो प्रॉडक्शनमध्ये काम करत नाही कारण तो कॉलम अंदाजाच्या वेळी रिकामा होता. धडा: प्रत्येक स्तंभाला प्रश्न विचारा "माझ्याकडे भविष्यवाणीच्या वेळी आहे का?"

चार कॉपी करण्यायोग्य टेम्पलेट्स

1) डेटा शब्दकोश काढणे:

तुमची भूमिका: डेटा सायंटिस्ट असिस्टंट. खाली टेबलची स्तंभ नावे आणि नमुना (अनामित) मूल्ये आहेत. प्रत्येक स्तंभासाठी, त्याचा अंदाजे अर्थ, डेटाटाइप आणि संभाव्य गुणवत्तेचे धोके टेबलमध्ये सूचीबद्ध करा. तुम्हाला खात्री नसलेले स्तंभ "पुष्टीकरण आवश्यक" म्हणून चिन्हांकित करा; म्हणजे मेकिंग. कॉलम: [येथे पेस्ट करा]

2) नमुना कोड (यादृच्छिक, पुनरावृत्ती करण्यायोग्य):

माझ्याकडे पांडा डीएफ आहेत. 200,000 पंक्तींमधून प्रतिनिधी 5% यादृच्छिक नमुना काढणारा कोड लिहा. random_state=42 (पुनरुत्पादनासाठी) वापरा. नमुन्याचे वर्ग वितरण लोकसंख्येप्रमाणे आहे हे तपासण्यासाठी कोड जोडा.

3) लीक स्कॅनिंग प्रश्न:

मी तुम्हाला ही स्तंभांची यादी देईन. माझे ध्येय "ते रद्द झाले आहे" (0/1) अंदाज करणे आहे. प्रत्येक स्तंभासाठी, भविष्यवाणीच्या वेळी ते माझ्याकडे असेल की नाही याचे मूल्यमापन करा आणि ते "सुरक्षित/संशयास्पद/गळती" म्हणून चिन्हांकित करा. तुमचे तर्क एका वाक्यात लिहा. स्तंभ: [सूची]

4) SQL पुल क्वेरी मसुदा:

माझ्याकडे PostgreSQL मध्ये "ऑर्डर" आणि "ग्राहक" सारण्या आहेत. एक JOIN क्वेरी लिहा जी ग्राहक शहरासह मागील 90 दिवसांची ऑर्डर एकत्रित करते आणि प्रत्येक शहरासाठी एकूण रक्कम आणि ऑर्डरची संख्या परत करते. तारीख फिल्टर आणि NULL शहरे कशी हाताळली जातात ते स्पष्ट करा. मी क्वेरी चालवीन आणि सत्यापित करेन.

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत प्रॉम्प्ट:

या डेटाबेसमधून मला चांगला नमुना डेटा घ्या.

"चांगले" अस्पष्ट आहे; कोणती पेंटिंग, कोणता कालावधी, कोणता आकार, कोणता हेतू स्पष्ट नाही. AI फक्त एक सामान्य, शक्यतो चुकीची क्वेरी तयार करेल.

शक्तिशाली सूचना:

तुमची भूमिका: SQL सहाय्यक. माझ्याकडे "व्यवहार" सारणी आहे: स्तंभ आयडी, ग्राहक_आयडी, तारीख (टाइमस्टॅम्प), रक्कम (संख्यात्मक), चॅनेल (मजकूर: 'वेब'/'मोबाइल'). कार्य: 2024 वर्षासाठी प्रत्येक चॅनेलवरून 10,000 प्रतिनिधी पंक्ती परत करणारी पुनरावृत्ती करण्यायोग्य (ORDER BY सह निर्धारक) क्वेरी लिहा. उद्देश: चॅनेल तुलनात्मक विश्लेषण. तुमच्या क्वेरीच्या गृहितकांची यादी करा.

येथे टेबल, उद्देश, आकार आणि पुनरावृत्ती स्पष्ट आहे.

सामान्य चुका

  • नमुन्याच्या प्रतिनिधीत्वावर शंका घेत नाही. सहज उपलब्ध डेटा हा अचूक डेटा नाही; निवड पूर्वाग्रह परिणाम विकृत करते.
  • स्तंभाचा अर्थ AI शी जुळवून घेणे. स्त्रोत संघाला अर्थ माहित आहे; AI अंदाज पुष्टी केल्याशिवाय वापरू नका.
  • API स्वरूप/युनिट बदलाचा मागोवा घेत नाही. मूक बदल दिवसांसाठी भ्रष्ट डेटा गोळा करतो.
  • संकलन टप्प्यावर गळतीकडे दुर्लक्ष करणे. जर "माझ्याकडे भविष्यवाणीच्या वेळी आहे का" हा प्रश्न लवकर विचारला गेला नाही तर मॉडेल खोटे यश देईल.
  • अनधिकृत किंवा बेकायदेशीर डेटा गोळा करणे. robots.txt, वापराच्या अटी आणि KVKK चे उल्लंघन हा गंभीर धोका आहे.
टीप: प्रत्येक नवीन डेटा स्रोतासाठी एक पृष्ठ “डेटा कार्ड” ठेवा: स्त्रोत, पुल तारीख, पंक्तींची संख्या, ज्ञात सीमा आणि गळतीचा धोका असलेले स्तंभ. हे कार्ड "हा डेटा काय होता" प्रश्न आणि काही महिन्यांनंतर पुनरुत्पादनक्षमता जतन करते.

सारांशात

संकलित केलेल्या डेटाच्या गुणवत्तेनुसार विश्लेषणाची गुणवत्ता मर्यादित आहे. स्त्रोत (डेटाबेस, API, फाइल, स्क्रॅप) आणि स्कीमा चांगल्या प्रकारे जाणून घ्या; नमुना लोकसंख्येचा प्रतिनिधी असल्याची खात्री करा; पहिल्या दिवसापासून प्रत्येक स्तंभाला विचारून गळती दूर करा “माझ्याकडे अंदाजाच्या वेळी आहे का?” AI क्वेरी आणि दस्तऐवजाच्या कामासाठी एक उत्तम प्रवेगक आहे, परंतु कोणता डेटा गोळा करायचा आणि त्याचे प्रतिनिधीत्व मानव ठरवतात. अधिकार, कायदा आणि गोपनीयतेच्या मर्यादा नेहमी प्रथम येतात.

अर्ज कार्य

डेटा स्रोत निवडा (तुमच्या स्वतःच्या व्यवसायातून किंवा काल्पनिक). वरील "डेटा डिक्शनरी एक्स्ट्रॅक्शन" टेम्प्लेटसह AI वरून डेटा डिक्शनरीचा मसुदा मिळवा; नंतर तो लीक झाला आहे की नाही हे पाहण्यासाठी प्रत्येक स्तंभाचे व्यक्तिचलितपणे मूल्यांकन करा. किमान एक संशयास्पद/गळती स्तंभ शोधण्याचा प्रयत्न करा आणि ते धोकादायक का आहे ते एका वाक्यात लिहा.

चेकलिस्ट

  • [ ] मी स्त्रोत संघासह डेटा स्रोत आणि स्कीमाची पुष्टी केली आहे का?
  • नमुना लोकसंख्येचा प्रतिनिधी आहे हे मी तपासले आहे का?
  • [ ] मी प्रत्येक स्तंभाला "अंदाजाच्या वेळी माझ्याकडे असेल का?" असा प्रश्न विचारला आहे का?
  • [ ] मी सॅम्पलिंग रिपीट करण्यायोग्य (निश्चित बियाणे) केले आहे का?
  • [ ] मी संग्रहाच्या कायदेशीर/नैतिक (अधिकृत, robots.txt, KVKK) मर्यादा तपासल्या आहेत का?