इकाइयाँ
1. डेटा साइंस और एनालिटिक्स में आर्टिफिशियल इंटेलिजेंस का परिचय: वर्कफ़्लो, भूमिकाएँ, सीमाएँ, मान्यता और नैतिकता 2. डेटा संग्रह और स्रोत समझ: स्कीमा, नमूनाकरण, गुणवत्ता और रिसाव जागरूकता 3. डेटा सफ़ाई और प्रीप्रोसेसिंग: गुम मूल्य, बाहरी और प्रकार रूपांतरण 4. खोजपूर्ण डेटा विश्लेषण (ईडीए): वितरण, संबंध और प्रारंभिक अंतर्दृष्टि 5. फ़ीचर इंजीनियरिंग: वेरिएंट तैयार करना, कोडिंग, स्केलिंग और रिसाव से बचना 6. मॉडल निर्माण: समस्या परिभाषा, एल्गोरिथम चयन, और प्रशिक्षण/परीक्षण विभाजन 7. मॉडल मूल्यांकन: मेट्रिक्स, क्रॉस-वैलिडेशन और एक्सट्रीम लर्निंग 8. विज़ुअलाइज़ेशन और कहानी सुनाना: सटीक ग्राफ़िक्स, ईमानदार ग्राफ़िक्स 9. कोड जनरेशन: पायथन (पांडा) और एसक्यूएल के साथ एआई-सहायता प्राप्त विश्लेषण 10. डेटा रिसाव और प्रतिलिपि प्रस्तुत करने योग्यता: मूक आपदाएँ और अनुशासन 11. एमएलओपीएस फाउंडेशन, नैतिकता, गोपनीयता और जिम्मेदार विश्लेषण
इकाई 2 / 11

डेटा संग्रह और स्रोत समझ: स्कीमा, नमूनाकरण, गुणवत्ता और रिसाव जागरूकता

लाभ:

  • विभिन्न डेटा स्रोतों (डेटाबेस, एपीआई, फ़ाइल, वेब स्क्रैपिंग) और प्रत्येक के नुकसान को पहचानने और स्कीमा को सही ढंग से समझने की क्षमता
  • नमूना जनसंख्या और चयन पूर्वाग्रह का प्रतिनिधित्व करता है या नहीं, इसका मूल्यांकन करके दोहराए जाने योग्य नमूनाकरण करने की क्षमता
  • संग्रह चरण में डेटा रिसाव को खत्म करने और प्रत्येक कॉलम में 'क्या भविष्यवाणी के समय यह मेरे पास होगा' प्रश्न पूछकर कानूनी/नैतिक सीमाओं का पालन करने की क्षमता?

प्रत्येक विश्लेषण आपके द्वारा एकत्र किए गए डेटा की गुणवत्ता जितनी अच्छी होती है। यहां तक ​​कि दुनिया का सबसे उन्नत मॉडल भी अविश्वसनीय परिणाम देगा यदि वह गलत तरीके से एकत्र किए गए, पक्षपातपूर्ण तरीके से नमूने लिए गए या भविष्य के बारे में जानकारी वाले डेटा के साथ काम करता है। कंप्यूटर विज्ञान में, इस सिद्धांत को "कचरा अंदर, कचरा बाहर" (कचरा अंदर, कचरा बाहर) के रूप में संक्षेपित किया गया है। इस इकाई में, हम डेटा संग्रह चरण को कवर करेंगे: स्रोत को समझना, नमूना लेना, गुणवत्ता वाले प्रश्न पूछना और पहले दिन से डेटा रिसाव के जोखिम के प्रति सतर्क रहना। इस स्तर पर कृत्रिम बुद्धिमत्ता एक शक्तिशाली सहायता है; SQL क्वेरी लिखता है, API दस्तावेज़ का सारांश देता है, डेटा अनुबंध का मसौदा तैयार करता है। लेकिन यह इंसान ही है जो यह तय करता है कि आप कौन सा डेटा एकत्र करते हैं और क्या वह डेटा आपका प्रतिनिधित्व करता है।

डेटा स्रोतों को जानना

डेटा विभिन्न स्थानों से आता है, और प्रत्येक स्रोत के अपने नुकसान होते हैं। डेटाबेस (तालिका में संग्रहीत संरचित डेटा, आमतौर पर एसक्यूएल के साथ पूछताछ की जाती है) सबसे आम स्रोत है; यह विश्वसनीय तो है, लेकिन इसकी स्कीम को अच्छे से समझना जरूरी है। एपीआई (एप्लिकेशन प्रोग्रामिंग इंटरफ़ेस) लाइव डेटा प्रदान करता है लेकिन गति सीमा और प्रारूप परिवर्तन का जोखिम रखता है। फ़ाइलें (CSV, Excel, JSON) लचीली होती हैं लेकिन प्रारूप असंगति की संभावना होती है। वेब स्क्रैपिंग शक्तिशाली है, लेकिन इसकी कानूनी और नैतिक सीमाएँ हैं; हर साइट को स्क्रैप नहीं किया जा सकता.

ध्यान दें: वेब स्क्रैपिंग और स्वचालित डेटा संग्रह के लिए, साइट की उपयोग की शर्तों, robots.txt फ़ाइल और KVKK/GDPR का अनुपालन करें। अनधिकृत डेटा संग्रह कानूनी दायित्व बनाता है। सूचना सुरक्षा के संदर्भ में, डेटा संग्रह टूल का उपयोग केवल उन प्रणालियों पर करें जिनके लिए आप अधिकृत हैं और रक्षा/विश्लेषण उद्देश्यों के लिए; अनधिकृत पहुंच या स्क्रैपिंग निषिद्ध है।

स्कीम को समझना: डेटा से परिचित होना

डेटा सेट एकत्र करने से पहले, आपको इसकी स्कीमा (कॉलम के नाम, उनके डेटा प्रकार, उनके अर्थ और एक दूसरे के साथ उनके संबंध) को समझना चाहिए। एआई यहां "डेटा डिक्शनरी" बनाने में बहुत उपयोगी है - एक तालिका जो बताती है कि प्रत्येक कॉलम का क्या मतलब है। लेकिन एआई जो स्पष्टीकरण उत्पन्न करता है वह भविष्यवाणियां हैं; डेटा तैयार करने वाली टीम के साथ प्रत्येक कॉलम के सही अर्थ की पुष्टि करें। उदाहरण के लिए, "स्थिति" नामक कॉलम में 0/1/2 हो सकता है; केवल मूल टीम ही जानती है कि ये "लंबित/अनुमोदित/रद्द" हैं या कुछ और।

निम्न तालिका बुनियादी संसाधन प्रकारों और सावधानियों का सारांश प्रस्तुत करती है:

स्रोत

मजबूत बिंदु

जाल

एआई कैसे मदद करता है

एसक्यूएल डेटाबेस

संरचनात्मक, विश्वसनीय

जटिल जोड़

एक क्वेरी ड्राफ्ट लिखता है

एपीआई

लाइव डेटा

गति सीमा, आकार परिवर्तन

दस्तावेज़ सारांश, पुल कोड

सीएसवी/एक्सेल

लचीला, तेज़

प्रारूप असंगति

कोड पढ़ें/पार्स करें

वेब स्क्रैपिंग

व्यापक पहुंच

कानूनी/नैतिक सीमा

पार्सिंग ड्राफ्ट (प्राधिकरण के भीतर)

लॉग/इवेंट डेटा

विस्तृत

विशाल मात्रा

फ़िल्टरिंग क्वेरी

चित्रण: क्या भाग संपूर्ण का प्रतिनिधित्व करता है?

अधिकांश समय, आप संपूर्ण डेटा के बजाय एक नमूने (जनसंख्या से चयनित एक उपसमूह) के साथ काम करते हैं। महत्वपूर्ण प्रश्न यह है: क्या यह नमूना जनसंख्या का प्रतिनिधित्व करता है? चयन पूर्वाग्रह सबसे आम जाल है। उदाहरण के लिए, यदि आप केवल मोबाइल ऐप से उपयोगकर्ताओं का नमूना लेते हैं, तो आपको वेब उपयोगकर्ता नहीं दिखेंगे और आपके परिणाम भ्रामक होंगे। अधिकांश मामलों में यादृच्छिक नमूनाकरण (प्रत्येक रिकॉर्ड के चुने जाने की समान संभावना होती है) सबसे सुरक्षित है; लेकिन समय श्रृंखला डेटा में, विभाजन यादृच्छिक रूप से नहीं बल्कि कालानुक्रमिक रूप से किया जाता है (हम इसे इकाई 7 और 10 में देखेंगे)।

पहले दिन से ही जागरूकता का रिसाव

डेटा रिसाव अधिकांश आपदाओं का स्रोत है और आमतौर पर डेटा संग्रह चरण के दौरान उत्पन्न होता है। उदाहरण: "क्या इसे रद्द किया गया" की भविष्यवाणी करते समय, यदि आप डेटा में "रद्दीकरण तिथि" कॉलम जोड़ते हैं, तो मॉडल भविष्य को देखता है। एकत्रण चरण के दौरान, प्रत्येक कॉलम के लिए एक प्रश्न पूछें: "क्या भविष्यवाणी करते समय मेरे पास वास्तव में यह जानकारी होगी?" यदि उत्तर नहीं है, तो वह कॉलम लीक हो रहा है। हम इस विषय को इकाई 10 में गहराई से कवर करेंगे; लेकिन जागरूकता पहले दिन से शुरू होनी चाहिए।

तीन मिनी मामले

केस 1 - प्रतिनिधित्व की समस्या। एक बैंक ने अपने क्रेडिट जोखिम मॉडल (18,500 रिकॉर्ड) के लिए केवल स्वीकृत ऋणों पर डेटा एकत्र किया। अस्वीकरण डेटा में नहीं थे. यह मॉडल वास्तविक दुनिया में गलत था क्योंकि इसमें कभी नहीं देखा गया कि अस्वीकृत लोग कैसा व्यवहार करेंगे। पाठ: नमूना उस संपूर्ण जनसंख्या का प्रतिनिधि होना चाहिए जिससे आप अपना निर्णय ले रहे हैं।

केस 2 - मूक रूप परिवर्तन। एक टीम हर दिन एक एपीआई से मूल्य डेटा निकाल रही थी। एक दिन, एपीआई प्रदाता ने मुद्रा को USD से EUR में बदल दिया, लेकिन डोमेन नाम वही रहा। 12 दिनों तक डेटा गलत इकाई में एकत्र किया गया था; 3,200 लाइनें खराब हो गईं। पाठ: एपीआई डेटा में वॉल्यूम और प्रारूप की स्थिरता की नियमित जांच करें।

केस 3 - प्रारंभिक रिसाव। एक विश्लेषक ने "मंथन" अनुमान के लिए डेटा एकत्र करते समय "खाता बंद करने का कारण" कॉलम शामिल किया। यह कॉलम ग्राहक के जाने के बाद ही भरा जाता था। मॉडल ने परीक्षण सेट पर 97% सटीकता प्राप्त की; यह उत्पादन में काम नहीं आया क्योंकि भविष्यवाणी के समय वह कॉलम खाली था। पाठ: प्रत्येक कॉलम में यह प्रश्न पूछें "क्या भविष्यवाणी के समय यह मेरे पास था?"

चार प्रतिलिपि योग्य टेम्पलेट

1) डेटा डिक्शनरी निष्कर्षण:

आपकी भूमिका: डेटा वैज्ञानिक सहायक। नीचे किसी तालिका के कॉलम नाम और नमूना (अनाम) मान दिए गए हैं। प्रत्येक कॉलम के लिए, उसके अनुमानित अर्थ, डेटा प्रकार और संभावित गुणवत्ता जोखिमों को एक तालिका में सूचीबद्ध करें। जिन स्तंभों के बारे में आप निश्चित नहीं हैं उन्हें "पुष्टि आवश्यक" के रूप में चिह्नित करें; अर्थ बनाना.कॉलम: [यहाँ चिपकाएँ]

2) नमूनाकरण कोड (यादृच्छिक, दोहराने योग्य):

मेरे पास पांडा डीएफ हैं। कोड लिखें जो 200,000 पंक्तियों से प्रतिनिधि 5% यादृच्छिक नमूना निकालता है। रैंडम_स्टेट=42 (पुनरुत्पादन के लिए) का उपयोग करें। यह जांचने के लिए कोड जोड़ें कि नमूने का वर्ग वितरण जनसंख्या के समान है।

3) लीक स्कैनिंग प्रश्न:

मैं आपको स्तंभों की यह सूची दूंगा। मेरा लक्ष्य यह भविष्यवाणी करना है कि "क्या यह रद्द हो गया है" (0/1)। प्रत्येक कॉलम के लिए, मूल्यांकन करें कि भविष्यवाणी के समय यह वास्तव में मेरे पास होगा या नहीं और इसे "सुरक्षित/संदिग्ध/लीक" के रूप में चिह्नित करें। अपना तर्क एक वाक्य में लिखिए। कॉलम: [सूची]

4) एसक्यूएल पुल क्वेरी ड्राफ्ट:

मेरे पास PostgreSQL में "ऑर्डर" और "ग्राहक" टेबल हैं। एक जॉइन क्वेरी लिखें जो पिछले 90 दिनों के ऑर्डर को ग्राहक शहर के साथ जोड़ती है और प्रति शहर कुल राशि और ऑर्डर की संख्या लौटाती है। दिनांक फ़िल्टर समझाएँ और NULL शहरों को कैसे प्रबंधित किया जाता है। मैं क्वेरी चलाऊंगा और इसे सत्यापित करूंगा।

कमजोर संकेत/मजबूत संकेत

कमजोर संकेत:

इस डेटाबेस से मेरे लिए एक अच्छा नमूना डेटा खींचिए।

"अच्छा" अस्पष्ट है; कौन सी पेंटिंग, कौन सा काल, कौन सा आकार, कौन सा उद्देश्य स्पष्ट नहीं है। एआई केवल एक सामान्य, संभवतः गलत क्वेरी उत्पन्न करेगा।

शक्तिशाली संकेत:

आपकी भूमिका: SQL सहायक. मेरे पास एक "लेन-देन" तालिका है: कॉलम आईडी, ग्राहक_आईडी, दिनांक (टाइमस्टैम्प), राशि (संख्यात्मक), चैनल (पाठ: 'वेब'/'मोबाइल')। कार्य: एक दोहराने योग्य (ऑर्डर बाय के साथ नियतात्मक) क्वेरी लिखें जो वर्ष 2024 के लिए प्रत्येक चैनल से 10,000 प्रतिनिधि पंक्तियाँ लौटाती है। उद्देश्य: चैनल तुलनात्मक विश्लेषण। अपनी क्वेरी की मान्यताओं को सूचीबद्ध करें।

यहां तालिका, उद्देश्य, आकार और दोहराव स्पष्ट हैं।

सामान्य गलतियाँ

  • नमूने की प्रतिनिधित्वशीलता पर सवाल नहीं उठाया जा रहा है। आसानी से पहुंच योग्य डेटा सटीक डेटा नहीं है; चयन पूर्वाग्रह परिणाम को विकृत करता है।
  • एआई के लिए कॉलम अर्थों को अपनाना। स्रोत टीम इसका अर्थ जानती है; इसकी पुष्टि किए बिना एआई भविष्यवाणी का प्रयोग न करें।
  • एपीआई प्रारूप/इकाई परिवर्तन को ट्रैक नहीं किया जा रहा है। मौन परिवर्तन कई दिनों तक भ्रष्ट डेटा एकत्र करता है।
  • संग्रहण चरण में रिसाव को नज़रअंदाज़ करना. यदि प्रश्न "क्या भविष्यवाणी के समय मेरे पास यह था" जल्दी नहीं पूछा गया, तो मॉडल झूठी सफलता देगा।
  • अनधिकृत या अवैध डेटा एकत्र करना। robots.txt, उपयोग की शर्तों और KVKK का उल्लंघन एक गंभीर जोखिम है।
युक्ति: प्रत्येक नए डेटा स्रोत के लिए एक पेज का "डेटा कार्ड" रखें: स्रोत, खींचने की तारीख, पंक्तियों की संख्या, ज्ञात सीमाएँ, और रिसाव के जोखिम वाले कॉलम। यह कार्ड महीनों बाद "यह डेटा क्या था" प्रश्न और पुनरुत्पादन को सहेजता है।

संक्षेप में

विश्लेषण की गुणवत्ता एकत्र किए गए डेटा की गुणवत्ता से सीमित होती है। स्रोत (डेटाबेस, एपीआई, फ़ाइल, स्क्रैप) और स्कीमा को अच्छी तरह से जानें; सुनिश्चित करें कि नमूना जनसंख्या का प्रतिनिधि है; प्रत्येक कॉलम से पूछकर पहले दिन से रिसाव को समाप्त करें "क्या भविष्यवाणी के समय मेरे पास यह था?" एआई क्वेरी और दस्तावेज़ कार्य के लिए एक महान त्वरक है, लेकिन मनुष्य तय करते हैं कि कौन सा डेटा एकत्र करना है और इसकी प्रतिनिधित्वशीलता क्या है। अधिकार, कानून और गोपनीयता की सीमाएं हमेशा पहले आती हैं।

आवेदन कार्य

एक डेटा स्रोत चुनें (अपने स्वयं के व्यवसाय से या काल्पनिक)। ऊपर दिए गए "डेटा डिक्शनरी निष्कर्षण" टेम्पलेट के साथ एआई से डेटा डिक्शनरी का ड्राफ्ट प्राप्त करें; फिर यह देखने के लिए प्रत्येक कॉलम का मैन्युअल रूप से मूल्यांकन करें कि क्या यह लीक हुआ है। कम से कम एक संदिग्ध/लीक कॉलम ढूंढने का प्रयास करें और एक वाक्य में लिखें कि यह जोखिम भरा क्यों है।

चेकलिस्ट

  • [ ] क्या मैंने स्रोत टीम के साथ डेटा स्रोत और स्कीमा की पुष्टि की है?
  • [ ] क्या मैंने जाँच की है कि नमूना जनसंख्या का प्रतिनिधि है?
  • [ ] क्या मैंने प्रत्येक कॉलम में यह प्रश्न पूछा है "क्या अनुमान के समय यह मेरे पास होगा?"
  • [ ] क्या मैंने नमूने को दोहराने योग्य (निश्चित बीज) बना दिया है?
  • [ ] क्या मैंने संग्रह की कानूनी/नैतिक (प्राधिकरण, robots.txt, KVKK) सीमाओं की जाँच की है?