नफा:
- विविध डेटा स्रोत (डेटाबेस, API, फाइल, वेब स्क्रॅपिंग) आणि प्रत्येकाचे तोटे ओळखण्याची आणि स्कीमा योग्यरित्या समजून घेण्याची क्षमता
- नमुना लोकसंख्या आणि निवड पूर्वाग्रह दर्शवितो की नाही याचे मूल्यांकन करून पुनरावृत्ती करण्यायोग्य नमुना घेण्याची क्षमता
- संकलनाच्या टप्प्यावर डेटा लीकेज दूर करण्याची क्षमता आणि प्रत्येक स्तंभात 'माझ्याकडे ते भविष्य सांगण्याच्या वेळी असेल का' असा प्रश्न विचारून कायदेशीर/नैतिक सीमा पाळण्याची क्षमता?
प्रत्येक विश्लेषण तुम्ही संकलित करत असलेल्या डेटाच्या गुणवत्तेइतकेच चांगले असते. जगातील सर्वात प्रगत मॉडेल देखील चुकीच्या पद्धतीने संकलित केलेल्या, पक्षपातीपणे नमुना घेतलेल्या किंवा भविष्याविषयी माहिती असलेल्या डेटासह कार्य करत असल्यास अविश्वसनीय परिणाम देईल. कॉम्प्युटर सायन्समध्ये, या तत्त्वाचा सारांश "कचरा आत, कचरा बाहेर" (कचरा आत, कचरा बाहेर) म्हणून दिला जातो. या युनिटमध्ये, आम्ही डेटा संकलनाचा टप्पा समाविष्ट करू: स्त्रोत समजून घेणे, नमुना घेणे, दर्जेदार प्रश्न विचारणे आणि पहिल्या दिवसापासून डेटा लीक होण्याच्या जोखमीबद्दल सतर्क राहणे. या टप्प्यावर कृत्रिम बुद्धिमत्ता ही एक शक्तिशाली मदत आहे; SQL क्वेरी लिहितो, API दस्तऐवजाचा सारांश देतो, डेटा कराराचा मसुदा तयार करतो. परंतु आपण कोणता डेटा संकलित करतो आणि तो डेटा आपले प्रतिनिधित्व करतो की नाही हे माणूस ठरवतो.
डेटा स्रोत जाणून घेणे
डेटा वेगवेगळ्या ठिकाणांहून येतो आणि प्रत्येक स्त्रोताचे स्वतःचे नुकसान आहेत. डेटाबेस (टेबलमध्ये संग्रहित केलेला संरचित डेटा, सामान्यत: SQL सह क्वेरी केला जातो) हा सर्वात सामान्य स्त्रोत आहे; हे विश्वसनीय आहे, परंतु त्याची योजना चांगल्या प्रकारे समजून घेणे आवश्यक आहे. API (ऍप्लिकेशन प्रोग्रामिंग इंटरफेस) थेट डेटा प्रदान करते परंतु वेग मर्यादा आणि स्वरूपातील बदलांचा धोका असतो. फायली (CSV, Excel, JSON) लवचिक आहेत परंतु फॉरमॅट विसंगतीसाठी प्रवण आहेत. वेब स्क्रॅपिंग शक्तिशाली आहे, परंतु त्याला कायदेशीर आणि नैतिक मर्यादा आहेत; प्रत्येक साइट स्क्रॅप केली जाऊ शकत नाही.
लक्ष द्या: वेब स्क्रॅपिंग आणि स्वयंचलित डेटा संकलनासाठी, साइटच्या वापराच्या अटी, robots.txt फाइल आणि KVKK/GDPR यांचे पालन करा. अनधिकृत डेटा संकलन कायदेशीर दायित्व निर्माण करते. माहितीच्या सुरक्षेच्या संदर्भात, डेटा संकलन साधने वापरा ज्या सिस्टमसाठी तुम्ही अधिकृत आहात आणि संरक्षण/विश्लेषण हेतूंसाठी; अनधिकृत प्रवेश किंवा स्क्रॅपिंग प्रतिबंधित आहे.
स्कीमा समजून घेणे: डेटाशी परिचित होणे
डेटा संच गोळा करण्यापूर्वी, तुम्ही त्याचा स्कीमा (स्तंभांची नावे, त्यांचा डेटा प्रकार, त्यांचे अर्थ आणि त्यांचे एकमेकांशी असलेले नाते) समजून घेतले पाहिजे. AI येथे "डेटा शब्दकोश" तयार करण्यासाठी खूप उपयुक्त आहे — प्रत्येक स्तंभाचा अर्थ काय आहे हे स्पष्ट करणारी एक सारणी. परंतु एआय जे स्पष्टीकरण तयार करते ते अंदाज आहेत; डेटा तयार करणाऱ्या टीमसह प्रत्येक स्तंभाच्या खऱ्या अर्थाची पुष्टी करा. उदाहरणार्थ, "स्थिती" नावाच्या स्तंभात 0/1/2 असू शकते; हे "प्रलंबित/मंजूर/रद्द केलेले" आहेत की आणखी काही हे केवळ मूळ संघालाच माहीत आहे.
खालील सारणी मूलभूत संसाधन प्रकार आणि सावधगिरीचा सारांश देते:
स्त्रोत
मजबूत बिंदू
सापळा
AI कशी मदत करते
SQL डेटाबेस
स्ट्रक्चरल, विश्वासार्ह
जटिल सामील
एक प्रश्न मसुदा लिहितो
API
थेट डेटा
गती मर्यादा, आकार बदल
दस्तऐवज सारांश, पुल कोड
CSV/Excel
लवचिक, जलद
स्वरूप विसंगती
कोड वाचा/विश्लेषण करा
वेब स्क्रॅपिंग
विस्तृत पोहोच
कायदेशीर/नैतिक मर्यादा
मसुदा पार्सिंग (अधिकारात)
लॉग/इव्हेंट डेटा
तपशीलवार
प्रचंड खंड
फिल्टरिंग क्वेरी
उदाहरण: भाग संपूर्ण प्रतिनिधित्व करतो का?
बऱ्याच वेळा, तुम्ही संपूर्ण डेटा ऐवजी नमुना (लोकसंख्येतून निवडलेला उपसंच) सह कार्य करता. गंभीर प्रश्न आहे: हा नमुना लोकसंख्येचे प्रतिनिधित्व करतो का? निवड पूर्वाग्रह हा सर्वात सामान्य सापळा आहे. उदाहरणार्थ, जर तुम्ही फक्त मोबाईल ॲपवरून वापरकर्त्यांचा नमुना घेतला तर तुम्हाला वेब वापरकर्ते दिसणार नाहीत आणि तुमचे परिणाम दिशाभूल करणारे असतील. यादृच्छिक नमुने (प्रत्येक रेकॉर्डला निवडले जाण्याची समान संधी असते) बहुतेक प्रकरणांमध्ये सर्वात सुरक्षित असते; परंतु टाइम सीरिज डेटामध्ये, स्प्लिटिंग यादृच्छिकपणे न करता कालक्रमानुसार केले जाते (आपण हे युनिट 7 आणि 10 मध्ये पाहू).
पहिल्या दिवसापासून लीक जागरूकता
डेटा लीकेज हे बहुतेक आपत्तींचे स्त्रोत आहे आणि सहसा डेटा संकलनाच्या टप्प्यात उद्भवते. उदाहरण: "ते रद्द केले होते" असे भाकीत करताना, तुम्ही डेटामध्ये "रद्द करण्याची तारीख" स्तंभ जोडल्यास, मॉडेल भविष्याकडे पाहते. मेळाव्याच्या टप्प्यात, प्रत्येक स्तंभासाठी एक प्रश्न विचारा: "मी भाकीत करत असताना ही माहिती माझ्याकडे असेल का?" जर उत्तर नाही असेल, तर तो स्तंभ लीक होत आहे. आम्ही हा विषय युनिट 10 मध्ये सखोलपणे कव्हर करू; पण जनजागृती पहिल्या दिवसापासून सुरू झाली पाहिजे.
तीन लहान प्रकरणे
केस 1 - प्रतिनिधित्वाची समस्या. एका बँकेने तिच्या क्रेडिट जोखीम मॉडेलसाठी (18,500 रेकॉर्ड) फक्त मंजूर कर्जावरील डेटा गोळा केला. नकार डेटामध्ये नव्हता. वास्तविक जगात मॉडेल चुकीचे होते कारण नकार देणारे कसे वागतील हे त्याने कधीही पाहिले नाही. धडा: नमुना संपूर्ण लोकसंख्येचा प्रतिनिधी असावा ज्यावरून तुम्ही तुमचा निर्णय घेत आहात.
केस 2 - मूक फॉर्म बदल. एक टीम दररोज API वरून किंमत डेटा काढत होती. एके दिवशी, API प्रदात्याने चलन USD वरून EUR मध्ये बदलले, परंतु डोमेन नाव तेच राहिले. 12 दिवसांसाठी चुकीच्या युनिटमध्ये डेटा गोळा केला गेला; 3,200 लाईन्स खराब झाल्या होत्या. धडा: API डेटामधील व्हॉल्यूम आणि फॉरमॅट सातत्य नियमितपणे तपासा.
केस 3 - लवकर गळती. एका विश्लेषकाने "मंथन" अंदाजासाठी डेटा गोळा करताना "खाते बंद होण्याचे कारण" स्तंभ समाविष्ट केला. ग्राहक गेल्यानंतरच हा कॉलम भरला गेला. चाचणी सेटवर मॉडेलने 97% अचूकता दिली; तो प्रॉडक्शनमध्ये काम करत नाही कारण तो कॉलम अंदाजाच्या वेळी रिकामा होता. धडा: प्रत्येक स्तंभाला प्रश्न विचारा "माझ्याकडे भविष्यवाणीच्या वेळी आहे का?"
चार कॉपी करण्यायोग्य टेम्पलेट्स
1) डेटा शब्दकोश काढणे:
तुमची भूमिका: डेटा सायंटिस्ट असिस्टंट. खाली टेबलची स्तंभ नावे आणि नमुना (अनामित) मूल्ये आहेत. प्रत्येक स्तंभासाठी, त्याचा अंदाजे अर्थ, डेटाटाइप आणि संभाव्य गुणवत्तेचे धोके टेबलमध्ये सूचीबद्ध करा. तुम्हाला खात्री नसलेले स्तंभ "पुष्टीकरण आवश्यक" म्हणून चिन्हांकित करा; म्हणजे मेकिंग. कॉलम: [येथे पेस्ट करा]
2) नमुना कोड (यादृच्छिक, पुनरावृत्ती करण्यायोग्य):
माझ्याकडे पांडा डीएफ आहेत. 200,000 पंक्तींमधून प्रतिनिधी 5% यादृच्छिक नमुना काढणारा कोड लिहा. random_state=42 (पुनरुत्पादनासाठी) वापरा. नमुन्याचे वर्ग वितरण लोकसंख्येप्रमाणे आहे हे तपासण्यासाठी कोड जोडा.
3) लीक स्कॅनिंग प्रश्न:
मी तुम्हाला ही स्तंभांची यादी देईन. माझे ध्येय "ते रद्द झाले आहे" (0/1) अंदाज करणे आहे. प्रत्येक स्तंभासाठी, भविष्यवाणीच्या वेळी ते माझ्याकडे असेल की नाही याचे मूल्यमापन करा आणि ते "सुरक्षित/संशयास्पद/गळती" म्हणून चिन्हांकित करा. तुमचे तर्क एका वाक्यात लिहा. स्तंभ: [सूची]
4) SQL पुल क्वेरी मसुदा:
माझ्याकडे PostgreSQL मध्ये "ऑर्डर" आणि "ग्राहक" सारण्या आहेत. एक JOIN क्वेरी लिहा जी ग्राहक शहरासह मागील 90 दिवसांची ऑर्डर एकत्रित करते आणि प्रत्येक शहरासाठी एकूण रक्कम आणि ऑर्डरची संख्या परत करते. तारीख फिल्टर आणि NULL शहरे कशी हाताळली जातात ते स्पष्ट करा. मी क्वेरी चालवीन आणि सत्यापित करेन.
कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट
कमकुवत प्रॉम्प्ट:
या डेटाबेसमधून मला चांगला नमुना डेटा घ्या.
"चांगले" अस्पष्ट आहे; कोणती पेंटिंग, कोणता कालावधी, कोणता आकार, कोणता हेतू स्पष्ट नाही. AI फक्त एक सामान्य, शक्यतो चुकीची क्वेरी तयार करेल.
शक्तिशाली सूचना:
तुमची भूमिका: SQL सहाय्यक. माझ्याकडे "व्यवहार" सारणी आहे: स्तंभ आयडी, ग्राहक_आयडी, तारीख (टाइमस्टॅम्प), रक्कम (संख्यात्मक), चॅनेल (मजकूर: 'वेब'/'मोबाइल'). कार्य: 2024 वर्षासाठी प्रत्येक चॅनेलवरून 10,000 प्रतिनिधी पंक्ती परत करणारी पुनरावृत्ती करण्यायोग्य (ORDER BY सह निर्धारक) क्वेरी लिहा. उद्देश: चॅनेल तुलनात्मक विश्लेषण. तुमच्या क्वेरीच्या गृहितकांची यादी करा.
येथे टेबल, उद्देश, आकार आणि पुनरावृत्ती स्पष्ट आहे.
सामान्य चुका
- नमुन्याच्या प्रतिनिधीत्वावर शंका घेत नाही. सहज उपलब्ध डेटा हा अचूक डेटा नाही; निवड पूर्वाग्रह परिणाम विकृत करते.
- स्तंभाचा अर्थ AI शी जुळवून घेणे. स्त्रोत संघाला अर्थ माहित आहे; AI अंदाज पुष्टी केल्याशिवाय वापरू नका.
- API स्वरूप/युनिट बदलाचा मागोवा घेत नाही. मूक बदल दिवसांसाठी भ्रष्ट डेटा गोळा करतो.
- संकलन टप्प्यावर गळतीकडे दुर्लक्ष करणे. जर "माझ्याकडे भविष्यवाणीच्या वेळी आहे का" हा प्रश्न लवकर विचारला गेला नाही तर मॉडेल खोटे यश देईल.
- अनधिकृत किंवा बेकायदेशीर डेटा गोळा करणे. robots.txt, वापराच्या अटी आणि KVKK चे उल्लंघन हा गंभीर धोका आहे.
टीप: प्रत्येक नवीन डेटा स्रोतासाठी एक पृष्ठ “डेटा कार्ड” ठेवा: स्त्रोत, पुल तारीख, पंक्तींची संख्या, ज्ञात सीमा आणि गळतीचा धोका असलेले स्तंभ. हे कार्ड "हा डेटा काय होता" प्रश्न आणि काही महिन्यांनंतर पुनरुत्पादनक्षमता जतन करते.
सारांशात
संकलित केलेल्या डेटाच्या गुणवत्तेनुसार विश्लेषणाची गुणवत्ता मर्यादित आहे. स्त्रोत (डेटाबेस, API, फाइल, स्क्रॅप) आणि स्कीमा चांगल्या प्रकारे जाणून घ्या; नमुना लोकसंख्येचा प्रतिनिधी असल्याची खात्री करा; पहिल्या दिवसापासून प्रत्येक स्तंभाला विचारून गळती दूर करा “माझ्याकडे अंदाजाच्या वेळी आहे का?” AI क्वेरी आणि दस्तऐवजाच्या कामासाठी एक उत्तम प्रवेगक आहे, परंतु कोणता डेटा गोळा करायचा आणि त्याचे प्रतिनिधीत्व मानव ठरवतात. अधिकार, कायदा आणि गोपनीयतेच्या मर्यादा नेहमी प्रथम येतात.
अर्ज कार्य
डेटा स्रोत निवडा (तुमच्या स्वतःच्या व्यवसायातून किंवा काल्पनिक). वरील "डेटा डिक्शनरी एक्स्ट्रॅक्शन" टेम्प्लेटसह AI वरून डेटा डिक्शनरीचा मसुदा मिळवा; नंतर तो लीक झाला आहे की नाही हे पाहण्यासाठी प्रत्येक स्तंभाचे व्यक्तिचलितपणे मूल्यांकन करा. किमान एक संशयास्पद/गळती स्तंभ शोधण्याचा प्रयत्न करा आणि ते धोकादायक का आहे ते एका वाक्यात लिहा.
चेकलिस्ट
- [ ] मी स्त्रोत संघासह डेटा स्रोत आणि स्कीमाची पुष्टी केली आहे का?
- नमुना लोकसंख्येचा प्रतिनिधी आहे हे मी तपासले आहे का?
- [ ] मी प्रत्येक स्तंभाला "अंदाजाच्या वेळी माझ्याकडे असेल का?" असा प्रश्न विचारला आहे का?
- [ ] मी सॅम्पलिंग रिपीट करण्यायोग्य (निश्चित बियाणे) केले आहे का?
- [ ] मी संग्रहाच्या कायदेशीर/नैतिक (अधिकृत, robots.txt, KVKK) मर्यादा तपासल्या आहेत का?