इकाइयाँ
1. एमआईएस में आर्टिफिशियल इंटेलिजेंस और बिजनेस-आईटी ब्रिज 2. आवश्यकताएँ विश्लेषण और हितधारक आवश्यकताओं का विश्लेषण 3. डेटा मॉडलिंग, डेटा डिक्शनरी और एंटरप्राइज डेटा आर्किटेक्चर 4. बिजनेस इंटेलिजेंस (बीआई), रिपोर्टिंग और मेट्रिक्स डिजाइन 5. प्रक्रिया स्वचालन: आरपीए और आर्टिफिशियल इंटेलिजेंस का संयोजन 6. ईआरपी एकीकरण और कॉर्पोरेट प्रक्रियाओं में कृत्रिम बुद्धिमत्ता 7. सीआरएम, ग्राहक डेटा और एनालिटिक्स 8. डैशबोर्ड डिज़ाइन और डेटा विज़ुअलाइज़ेशन 9. नो-कोड/लो-कोड प्लेटफ़ॉर्म और आर्टिफिशियल इंटेलिजेंस 10. डेटा गवर्नेंस, गुणवत्ता और मास्टर डेटा प्रबंधन 11. डेटा सुरक्षा, गोपनीयता, नैतिकता और जिम्मेदार अभ्यास
इकाई 3 / 11

डेटा मॉडलिंग, डेटा डिक्शनरी और एंटरप्राइज डेटा आर्किटेक्चर

लाभ:

  • वैचारिक, तार्किक और भौतिक डेटा मॉडल और सामान्यीकरण अवधारणाओं को समझाने और कृत्रिम बुद्धिमत्ता के समर्थन से इकाई-संबंध ड्राफ्ट तैयार करने की क्षमता
  • संरचित संकेतों के साथ डेटा शब्दकोश, व्यावसायिक नियम और तालिका संबंधों का मसौदा तैयार करने और उन्हें वास्तविक प्रणाली के विरुद्ध सत्यापित करने की क्षमता
  • अखंडता, विलक्षणता और व्यावसायिक नियम अनुपालन के संदर्भ में एआई-जनरेटेड स्कीमा सुझावों का गंभीर रूप से मूल्यांकन करने की क्षमता।

एक सूचना प्रणाली मूलतः एक संरचना है जो डेटा को व्यवस्थित रखती है। डेटा मॉडलिंग किसी व्यवसाय के तथ्यों (ग्राहक, ऑर्डर, उत्पाद, चालान) और उनके एक दूसरे से संबंध को संरचित तरीके से डिजाइन करने का कार्य है। एक अच्छा डेटा मॉडल सटीक रिपोर्टिंग, तेज़ क्वेरी और सुसंगत डेटा की नींव है; एक ख़राब मॉडल वर्षों की असंगति और दोहराव वाले सुधार कार्य का स्रोत है। अधिकांश समय, एमआईएस पेशेवर मॉडल को शुरू से कोड नहीं करता है, लेकिन यह सत्यापित करता है कि मॉडल व्यावसायिक नियमों का अनुपालन करता है और मॉडल को व्यवसाय इकाई और आईटी के बीच अनुवादित करता है।

डेटा मॉडलिंग अमूर्तता के तीन स्तरों पर आगे बढ़ती है। वैचारिक मॉडल (अंग्रेजी वैचारिक) उच्चतम स्तर है: कौन सी मुख्य इकाइयाँ मौजूद हैं और वे कैसे संबंधित हैं? "ग्राहक एक ऑर्डर देता है, ऑर्डर में उत्पाद शामिल होता है।" कोई तकनीकी विवरण नहीं हैं. तार्किक मॉडल प्रत्येक इकाई की विशेषताओं (फ़ील्ड), कुंजियों और संबंध प्रकारों को परिभाषित करता है; लेकिन यह अभी भी किसी विशिष्ट डेटाबेस उत्पाद से बंधा नहीं है। भौतिक मॉडल (अंग्रेजी भौतिक) एक विशिष्ट डेटाबेस (जैसे SQL सर्वर, PostgreSQL) में तालिकाओं, डेटा प्रकारों और अनुक्रमितों का ठोस संस्करण है। ये तीन स्तर एक ही विचार के उत्तरोत्तर विस्तृत संस्करण हैं।

इकाई-संबंध और कुंजियाँ

डेटा मॉडल की मूल भाषा एंटिटी-रिलेशनशिप (ईआर) मॉडल है। इकाई को एक तालिका के रूप में सोचा जा सकता है: ग्राहक, ऑर्डर। विशेषता तालिका का कॉलम है: नाम, ईमेल, राशि। संबंध यह है कि इकाइयां कैसे जुड़ी हुई हैं: एक ग्राहक के पास कई ऑर्डर (एक-से-अनेक संबंध) हो सकते हैं।

दो महत्वपूर्ण प्रमुख अवधारणाएँ हैं। प्राथमिक कुंजी वह फ़ील्ड है जो तालिका में प्रत्येक पंक्ति को विशिष्ट रूप से पहचानती है; उदाहरण के लिए ग्राहक आईडी। एक विदेशी कुंजी एक तालिका में एक फ़ील्ड है जो किसी अन्य तालिका की प्राथमिक कुंजी को इंगित करती है; ऑर्डर तालिका में CustomerID यह जोड़ता है कि यह किस ग्राहक का ऑर्डर है। ये कनेक्शन संदर्भात्मक अखंडता सुनिश्चित करते हैं: ऐसे ग्राहक के लिए ऑर्डर नहीं दिया जा सकता जो मौजूद नहीं है।

युक्ति: जब AI एक ER ड्राफ्ट तैयार करता है, तो प्रत्येक तालिका के लिए प्राथमिक कुंजी और प्रत्येक संबंध के लिए विदेशी कुंजी का स्पष्ट रूप से अनुरोध करना आसान हो जाता है। लेकिन मॉडल द्वारा सुझाई गई प्रत्येक विदेशी कुंजी को वास्तविक व्यावसायिक नियम के विरुद्ध सत्यापित करें: कभी-कभी आप जिस रिश्ते को "एक-से-अनेक" मानते हैं, वह वास्तव में "अनेक-से-अनेक" होता है।

सामान्यीकरण: पुनरावृत्ति को रोकना

सामान्यीकरण डेटा को तार्किक तालिकाओं में विभाजित करके अतिरेक को कम करने और अखंडता को संरक्षित करने की प्रक्रिया है। लक्ष्य समान जानकारी को एक स्थान पर रखना है। उदाहरण के लिए, प्रत्येक ऑर्डर लाइन में ग्राहक का पता बार-बार टाइप करने के बजाय, आप पते को ग्राहक तालिका में एक बार रखते हैं और इसे ऑर्डर से एक विदेशी कुंजी के साथ लिंक करते हैं। इस तरह, जब पता बदलता है, तो आप उसे एक ही स्थान पर अपडेट कर देते हैं; अन्यथा, सैकड़ों ऑर्डर के अलग-अलग पते होंगे। इसे अद्यतन विसंगति कहा जाता है.

सामान्यीकरण के विपरीत असामान्यीकरण है: रिपोर्टिंग गति के लिए जानबूझकर कुछ पुनरावृत्ति की अनुमति देना। बिजनेस सिस्टम (ऑपरेशनल डेटाबेस) में, सामान्यीकरण को आम तौर पर प्राथमिकता दी जाती है, और रिपोर्टिंग सिस्टम (डेटा वेयरहाउस) में, डीनॉर्मलाइजेशन को अक्सर प्राथमिकता दी जाती है। तो "सामान्यीकरण हमेशा अच्छा नहीं होता"; उद्देश्य के अनुसार निर्णय लिया जाता है।

डेटा डिक्शनरी: सामान्य भाषा

डेटा डिक्शनरी एक दस्तावेज़ है जो परिभाषित करता है कि प्रत्येक फ़ील्ड का क्या अर्थ है, उसका प्रकार, बाधाएं और व्यावसायिक नियम क्या हैं। "स्थिति" फ़ील्ड का क्या अर्थ है? यह कौन से मान ले सकता है (लंबित, स्वीकृत, रद्द)? क्या यह अनिवार्य है? इस दस्तावेज़ के बिना, एक ही फ़ील्ड की अलग-अलग टीमों द्वारा अलग-अलग व्याख्या की जाएगी और रिपोर्ट विकृत हो जाएगी। डेटा डिक्शनरी संगठन की भाषा है और एमआईएस पेशेवर के सबसे मूल्यवान डिलिवरेबल्स में से एक है। एआई मौजूदा तालिका संरचना से प्रारंभिक डेटा डिक्शनरी ड्राफ्ट को तुरंत निकाल सकता है; लेकिन केवल उस डेटा का उपयोग करने वाली इकाई ही प्रत्येक क्षेत्र के वास्तविक व्यावसायिक अर्थ की पुष्टि करती है।

तीन मिनी मामले: संख्याओं द्वारा

केस 1 - पुनरावृत्ति की लागत। एक वितरण कंपनी में, ऑर्डर और इनवॉइस तालिका दोनों में ग्राहक का पता अलग-अलग रखा जाता था। जब कोई ग्राहक स्थानांतरित होता था, तो पता केवल एक तालिका में अद्यतन किया जाता था; 1,400 चालान पुराने पते पर गए और वापस कर दिए गए। यदि पता एक ही तालिका में सामान्यीकृत किया गया था, तो एक ही अद्यतन पर्याप्त होगा। निवारण परियोजना की लागत 2 सप्ताह है।

केस 2 - गलत प्रकार का रिश्ता। एक शैक्षणिक संस्थान में एक एमआईएस विशेषज्ञ ने एआई जनित मॉडल में (एक-से-कई) संबंध "छात्र एक वर्ग का है" को स्वीकार किया। हालाँकि, छात्र एक से अधिक वैकल्पिक कक्षाओं में दाखिला ले सकते हैं; संबंध वास्तव में अनेक-से-अनेक था और एक मध्यवर्ती तालिका (रिकॉर्ड) की आवश्यकता थी। गलती का खुलासा तब हुआ जब एक छात्र दूसरी कक्षा में दाखिला लेने से चूक गया। यदि एआई के सुझाव की पुष्टि की गई होती, तो इसे शुरू से ही पकड़ लिया गया होता।

केस 3 - डेटा डिक्शनरी का मूल्य। यह निर्धारित किया गया था कि एक बीमा कंपनी में "पॉलिसी_स्टेटस" फ़ील्ड की 5 अलग-अलग टीमों द्वारा अलग-अलग व्याख्या की गई थी, इसलिए एक ही KPI ने रिपोर्ट में 3 अलग-अलग परिणाम दिए। एआई-संचालित डेटा डिक्शनरी का मसौदा तैयार करने और व्यावसायिक इकाई के साथ एक समान समझौता प्राप्त करने से, रिपोर्ट असंगतता समाप्त हो गई और मासिक सुलह बैठक का समय 60% कम हो गया।

कमजोर संकेत/मजबूत संकेत

कमजोर संकेत:

एक ई-कॉमर्स डेटाबेस डिज़ाइन करें।

शक्तिशाली संकेत:

आपकी भूमिका: आप एक अनुभवी डेटा मॉडलर हैं। निम्नलिखित व्यावसायिक नियमों के अनुसार एक तार्किक डेटा मॉडल तैयार करें। नियम: - प्रत्येक इकाई के लिए: फ़ील्ड, प्राथमिक कुंजी, आवश्यक फ़ील्ड। - प्रत्येक रिश्ते के लिए: प्रकार (एक-से-अनेक / अनेक-से-अनेक) और विदेशी कुंजी। - अनेक-से-अनेक संबंधों में मध्यवर्ती तालिका प्रस्तावित करें। - तीसरे सामान्य रूप तक सामान्यीकृत करें; यदि आप जानबूझकर असामान्यीकरण की अनुशंसा करते हैं, तो तर्क लिखें। - लेबल [पुष्टि आवश्यक] कोई भी व्यावसायिक नियम जिसके बारे में आप अनिश्चित हैं। व्यावसायिक नियम: - ग्राहक कई ऑर्डर दे सकता है। - एक ऑर्डर में कई उत्पाद होते हैं; एक उत्पाद कई ऑर्डरों में होता है। - उत्पादों की श्रेणियां होती हैं। [अन्य नियम...]

शक्तिशाली संकेत मॉडल स्तर (तार्किक), कुंजी और संबंध नियम, सामान्यीकरण लक्ष्य और पुष्टि की आवश्यकता वाले बिंदुओं को स्पष्ट करता है।

चार प्रतिलिपि योग्य टेम्पलेट

1) डेटा डिक्शनरी ड्राफ्ट:

डेटा शब्दकोश की रूपरेखा तालिका परिभाषा से अनुसरण करती है। प्रत्येक फ़ील्ड के लिए: नाम, प्रकार, क्या यह अनिवार्य है, संभावित मान, व्यावसायिक अर्थ (लेबल[भविष्यवाणी] यदि यह एक भविष्यवाणी है)। तालिका: [डीडीएल या फ़ील्ड सूची]

2) सामान्यीकरण समीक्षा:

क्या नीचे दी गई तालिका संरचना में डुप्लिकेट डेटा, अद्यतन विसंगति और सामान्यीकरण के अवसर का कोई जोखिम है? प्रत्येक खोज के लिए, यह लिखें कि यह किस सामान्य रूप का उल्लंघन करता है और आपका सुझाव क्या है। संरचना: [पाठ]

3) बिजनेस रूल से ईआर ड्राफ्ट:

निम्नलिखित व्यावसायिक नियमों का संस्थाओं, विशेषताओं और संबंधों में अनुवाद करें। प्रत्येक संबंध का प्रकार निर्दिष्ट करें (1-1, 1-एन, एन-एन) और यदि एन-एन है, तो एक मध्यवर्ती तालिका सुझाएं। अस्पष्ट नियम चिह्नित करें. नियम: [पाठ]

4) संबंध प्रकार सत्यापन प्रश्न:

नीचे दिए गए डेटा मॉडल में प्रत्येक संबंध के लिए, एक "हां/नहीं" व्यावसायिक प्रश्न बनाएं जो उसके प्रकार की शुद्धता का परीक्षण करेगा (उदाहरण के लिए, "क्या एक छात्र को एक ही समय में एक से अधिक कक्षाओं में नामांकित किया जा सकता है?")। मॉडल: [पाठ]

तुलना चार्ट: मॉडल स्तर

सुविधा

वैचारिक

तार्किक

शारीरिक

विवरण

कम से कम

मध्यम

सबसे

कुंजी/संबंध

मुख्य संपत्ति

कुंजियाँ परिभाषित

सूचकांक/प्रकार सहित

डेटाबेस पर निर्भर करता है

नहीं

नहीं

हाँ

लक्षित दर्शक

व्यवसाय इकाई

विश्लेषक

डेवलपर/डीबीए

एआई का योगदान

ड्राफ्ट

मजबूत मसौदा

ड्राफ्ट, डीबीए पुष्टिकरण

सामान्य गलतियाँ

  • अनेक-से-अनेक संबंध को एक-से-अनेक के रूप में सोचना। यह सबसे आम मॉडलिंग त्रुटि है; यदि मध्यवर्ती तालिका भूल जाती है, तो सिस्टम वास्तविक स्थिति नहीं रख सकता है।
  • सब कुछ एक टेबल पर रखना. "सरलता" के लिए सभी फ़ील्ड को एक तालिका में एकत्रित करने से दोहराव और अद्यतन विसंगतियाँ उत्पन्न होती हैं।
  • डेटा डिक्शनरी नहीं लिख रहा. फ़ील्ड का अर्थ दिमाग में रहने पर एक ही KPI अलग-अलग परिणाम देता है।
  • डेटा प्रकारों और बाधाओं के बारे में AI की अनुशंसा पर आँख मूँद कर भरोसा करना। मॉडल "पर्याप्त बड़े" क्षेत्र का सुझाव दे सकता है; व्यवसाय नियम वास्तविक सीमाएं निर्धारित करता है (जैसे टीआर आईडी 11 अंक)।
  • पूर्णतः सामान्यीकरण। रिपोर्टिंग स्तर पर अत्यधिक सामान्यीकरण क्वेरी को धीमा कर देता है; उद्देश्य संदर्भ के आधार पर भिन्न होता है।
सावधानी: कृत्रिम बुद्धिमत्ता ऐसे मॉडल तैयार कर सकती है जो देखने में तो अच्छे लगते हैं लेकिन व्यावसायिक नियमों का उल्लंघन करते हैं। मॉडल द्वारा सुझाए गए प्रत्येक रिश्ते के लिए, प्रश्न "क्या यह वास्तव में ऐसा है?" एक व्यावसायिक प्रश्न पूछें. डेटा मॉडल सिस्टम का कंकाल है; कंकाल में फ्रैक्चर को बाद में ठीक करना बहुत मुश्किल होता है।

संक्षेप में

डेटा मॉडलिंग व्यावसायिक तथ्यों को संस्थाओं, विशेषताओं और रिश्तों के साथ संरचित करने और वैचारिक, तार्किक और भौतिक स्तरों पर आगे बढ़ने की प्रक्रिया है। प्राथमिक और विदेशी कुंजियाँ संदर्भात्मक अखंडता सुनिश्चित करती हैं; सामान्यीकरण पुनरावृत्ति को कम करता है, लेकिन उद्देश्य के आधार पर असामान्यीकरण भी वैध है। डेटा डिक्शनरी संगठन की आम भाषा है। एआई ईआर ड्राफ्ट, डेटा शब्दकोश और सामान्यीकरण समीक्षा तैयार करने में महत्वपूर्ण गति प्रदान करता है; हालाँकि, वास्तविक व्यावसायिक नियम के विरुद्ध संबंध प्रकार, डेटा प्रकार और व्यावसायिक शब्दार्थ की पुष्टि की जानी चाहिए। सिर्फ इसलिए कि मॉडल अच्छा दिखता है इसका मतलब यह नहीं है कि यह सही है।

आवेदन कार्य

"पुस्तकालय ऋण प्रणाली" पर विचार करें: सदस्य, पुस्तकें, ऋण रिकॉर्ड। (1) शक्तिशाली प्रॉम्प्ट द्वारा निर्मित एक तार्किक मॉडल ड्राफ्ट रखें। (2) मॉडल द्वारा सुझाए गए प्रत्येक संबंध के प्रकार का परीक्षण करें (विशेष रूप से, "क्या एक सदस्य के पास एक ही पुस्तक की एक से अधिक प्रतियां हो सकती हैं?") एक व्यावसायिक प्रश्न के साथ। (3) कम से कम एक अनेक-से-अनेक संबंध खोजें और एक मध्यवर्ती तालिका परिभाषित करें। (4) कम से कम 4 फ़ील्ड (नाम, प्रकार, अनिवार्य, व्यावसायिक अर्थ) के लिए डेटा डिक्शनरी पंक्तियाँ लिखें। (5) उस बाधा को उजागर करें जो मॉडल में फिट हो सकती है और बताएं कि आप इसे कैसे सत्यापित करेंगे।

चेकलिस्ट

  • [ ] प्रत्येक तालिका की प्राथमिक कुंजी परिभाषित है।
  • [ ] मैंने व्यावसायिक प्रश्न के साथ प्रत्येक संबंध के प्रकार का सत्यापन किया।
  • [ ] मैंने अनेक-से-अनेक संबंधों के लिए एक मध्यवर्ती तालिका परिभाषित की है।
  • [ ] मैंने डुप्लिकेट डेटा के असामान्यकरण को सामान्यीकृत या उचित ठहराया।
  • [ ] मैंने महत्वपूर्ण क्षेत्रों के लिए एक डेटा डिक्शनरी लाइन लिखी।
  • [ ] मैंने व्यावसायिक नियम के विरुद्ध एआई के डेटा प्रकार/बाधा सुझावों की पुष्टि की।