इकाइयाँ
1. लाइब्रेरियनशिप और सूचना प्रबंधन में आर्टिफिशियल इंटेलिजेंस का परिचय: भूमिकाएँ, सीमाएँ, प्रमाणीकरण, गोपनीयता और नैतिकता 2. कैटलॉगिंग और मेटाडेटा जेनरेशन में आर्टिफिशियल इंटेलिजेंस 3. विषय विश्लेषण, वर्गीकरण और स्वचालित अनुक्रमण 4. सिमेंटिक सर्च और डिस्कवरी सिस्टम 5. अनुशंसा प्रणाली और वैयक्तिकृत संसाधन अनुशंसा 6. डिजिटल पुरालेख, डिजिटलीकरण, ओसीआर और दीर्घकालिक संरक्षण 7. उपयोगकर्ता सेवाएँ, द्वारपाल और चैट बॉट 8. ग्रंथ सूची, उद्धरण विश्लेषण और अनुसंधान प्रभाव आकलन 9. आरएजी के साथ उद्यम सूचना प्रबंधन 10. स्रोत सत्यापन, मतिभ्रम, और सूचना साक्षरता 11. कॉपीराइट, गोपनीयता, नैतिकता और शासन
इकाई 2 / 11

कैटलॉगिंग और मेटाडेटा जेनरेशन में आर्टिफिशियल इंटेलिजेंस

लाभ:

  • वास्तविक छाप जानकारी से एमएआरसी और डबलिन कोर जैसे मानकों के अनुसार ड्राफ्ट मेटाडेटा तैयार करके कैटलॉगिंग समय को कम करने की क्षमता
  • निर्माण के उच्च जोखिम वाले क्षेत्रों को सत्यापित करने की क्षमता, जैसे प्रकाशन वर्ष, आईएसबीएन, लेखक का नाम, मूल स्रोत के साथ और नियंत्रित शब्दावली से विषय शर्तों को मैप करने की क्षमता
  • प्राधिकरण नियंत्रण के साथ लेखक और विषय प्रारूपों को एकल-अनुमोदित बनाने और कैटलॉग स्थिरता बनाए रखने की क्षमता

कैटलॉगिंग लाइब्रेरियनशिप का अदृश्य लेकिन सबसे बुनियादी काम है। किसी संसाधन (पुस्तक, लेख, मानचित्र, ध्वनि रिकॉर्डिंग, डिजिटल फ़ाइल) की खोज सही मेटाडेटा से संभव है। मेटाडेटा का अर्थ है "डेटा के बारे में डेटा": संरचित जानकारी जो संसाधन के शीर्षक, लेखक, प्रकाशन का वर्ष, विषय, भाषा और भौतिक विशेषताओं का वर्णन करती है। यदि मेटाडेटा अच्छा है, तो उपयोगकर्ता संसाधन ढूंढ लेता है; यदि यह खराब या अपूर्ण है, तो संसाधन मौजूद होने पर भी नष्ट हो जाता है। इस इकाई में आप सीखेंगे कि ड्राफ्ट मेटाडेटा निर्माण में कृत्रिम बुद्धिमत्ता का उपयोग कैसे करें, लेकिन मानकों का अनुपालन और सटीकता कैसे सुनिश्चित करें।

आइए पहले दो अवधारणाओं को परिभाषित करें। MARC (मशीन-पठनीय कैटलॉगिंग) एक रिकॉर्ड प्रारूप है जिसे पुस्तकालयों ने दशकों से उपयोग किया है जो जानकारी के प्रत्येक टुकड़े को क्रमांकित क्षेत्रों में रखता है; उदाहरण के लिए, फ़ील्ड 245 में शीर्षक है और फ़ील्ड 100 में मुख्य लेखक है। डबलिन कोर डिजिटल संसाधनों के लिए एक सरलीकृत मेटाडेटा मानक है, जिसमें 15 बुनियादी क्षेत्र (शीर्षक, निर्माता, विषय, तिथि, शैली, आदि) शामिल हैं। ये मानक सुनिश्चित करते हैं कि विभिन्न पुस्तकालयों के रिकॉर्ड एक-दूसरे से बात कर सकें।

चरण दर चरण: कृत्रिम बुद्धिमत्ता के साथ ड्राफ्ट मेटाडेटा तैयार करना

1. स्रोत की पहचान संबंधी जानकारी एकत्रित करें। पुस्तक का कवर, शीर्षक पृष्ठ, सामग्री या डिजिटल फ़ाइल का पाठ। एआई केवल आपके द्वारा दी गई जानकारी से काम करता है; यदि आप अधूरी जानकारी प्रदान करते हैं, तो यह अधूरा या मनगढ़ंत मेटाडेटा उत्पन्न करता है।

2. लक्ष्य मानक निर्दिष्ट करें. AI को एक स्पष्ट लक्ष्य दें, जैसे "डबलिन कोर फ़ील्ड्स द्वारा" या "MARC 245, 100, 260, 650 फ़ील्ड्स द्वारा।" यदि आप कोई मानक निर्दिष्ट नहीं करते हैं, तो यह एक मनमाना प्रारूप तैयार करता है।

3. ड्राफ्ट तैयार करें. एआई आपके द्वारा प्रदान की गई जानकारी से शीर्षक, जिम्मेदारी विवरण, प्रकाशन जानकारी और विषय प्रस्ताव का मसौदा तैयार करता है।

4. प्राधिकार नियंत्रण का प्रयोग करें. एक आधिकारिक रिकॉर्ड वह होता है जो किसी लेखक के नाम, संस्था या विषय का एकल, मानक रूप स्थापित करता है (उदाहरण के लिए, "अतातुर्क, मुस्तफा केमल, 1881-1938")। AI विभिन्न तरीकों से नाम लिख सकता है; आप अनुमोदित प्राधिकारी प्रारूप की जाँच करें और सही करें।

5. सत्यापित करें और पुष्टि करें. प्रत्येक फ़ील्ड की तुलना मूल स्रोत से करें. विशेष रूप से, प्रकाशन वर्ष, आईएसबीएन और लेखक का नाम जैसी सटीक जानकारी एआई द्वारा जाली होने की बहुत अधिक संभावना है।

संकेत: एआई को स्रोत के वास्तविक क्रेडिट पृष्ठ का एक फोटो या टेक्स्ट दें; यह मत कहो कि "पुस्तक के नाम का अनुमान लगाओ"। पूर्वानुमानित मेटाडेटा कैटलॉग की विश्वसनीयता को कमजोर करता है। भविष्यवाणियाँ करते समय एआई आत्मविश्वास से लिखता है, और यह आपको गुमराह करेगा।

नियंत्रित शब्दावली और निरंतरता

कैटलॉगिंग में संगति ही सब कुछ है। यदि एक ही विषय को दो अलग-अलग रिकॉर्ड में दो अलग-अलग शब्दों के साथ लिखा गया है, तो उपयोगकर्ता एक को ढूंढेगा और दूसरे को मिस कर देगा। इसीलिए पुस्तकालय नियंत्रित शब्दावली का उपयोग करते हैं - शब्दों की एक अनुमोदित, मानक सूची। मुक्त पाठ से शब्दों का सुझाव देते समय, एआई इस सूची में आधिकारिक शब्द के बजाय इसके बोलचाल के समकक्ष को चुन सकता है। उदाहरण के लिए, AI "दिल का दौरा" लिख सकता है; जबकि स्वीकृत शब्द "मायोकार्डियल इन्फ्रक्शन" हो सकता है।

समाधान यह है कि एआई को नियंत्रित शब्दावली दी जाए और कहा जाए "बस इस सूची से चयन करें"। इसलिए स्वतंत्र रूप से शर्तें बनाने के बजाय, एआई अनुमोदित सूची में से सबसे उपयुक्त से मेल खाता है।

सावधानी: यदि एआई द्वारा सुझाया गया कोई विषय शब्द नियंत्रित शब्दावली में नहीं है, तो उस शब्द को कैटलॉग में न जोड़ें। नई शर्तें जोड़ने का निर्णय प्राधिकरण प्रबंधन के लिए जिम्मेदार विशेषज्ञ पर निर्भर है; मनमाने शब्द जोड़ने से कैटलॉग की निरंतरता बाधित होती है।

तीन मिनी मामले

केस 1 - दान संग्रहण में तेजी आई। एक सार्वजनिक पुस्तकालय को 1,200 पुस्तकों का दान मिला। कैटलॉगिंग विशेषज्ञ ने एआई से प्रत्येक पुस्तक के छाप पृष्ठ को पढ़ा और डबलिन कोर का एक मसौदा तैयार किया; प्रति रिकॉर्डिंग का समय 9 मिनट से घटकर 3.5 मिनट हो गया। विशेषज्ञ ने शेष समय प्राधिकारी जाँच और सत्यापन के लिए समर्पित किया; कुल समय लगभग 55% कम हो गया, लेकिन कोई भी रिकॉर्ड सत्यापित किए बिना सिस्टम में दर्ज नहीं हुआ।

केस 2- फर्जी आईएसबीएन पकड़ा गया। एक विशेषज्ञ ने एआई से 30 पुस्तकों के ड्राफ्ट तैयार कराए। जांच के दौरान, उन्होंने पाया कि 4 रिकॉर्ड में आईएसबीएन नकली था: एआई ने 13 अंकों की संख्या लिखी थी जो उचित लगती थी, भले ही उन्हें पुस्तक की वास्तविक संख्या नहीं पता थी। सत्यापन चरण ने चार गलत आईएसबीएन को कैटलॉग में लगातार बने रहने से रोका।

केस 3 - प्राधिकरण असंगति को ठीक किया गया। एक पुस्तकालय को कुछ अभिलेखों में "जे. स्मिथ", अन्य में "जॉन स्मिथ", अन्य में "स्मिथ, जॉन" के रूप में एक लेखक मिला। एआई का प्राधिकरण फ़ाइल से मिलान किया गया, जिससे सभी रिकॉर्ड एक ही अनुमोदित प्रारूप में आ गए ("स्मिथ, जॉन, 1965-"); यदि यह काम मैन्युअल रूप से किया जाता, तो इसमें कई दिन लग जाते, लेकिन एआई के सुझाव के साथ, इसे कुछ घंटों तक कम कर दिया गया, लेकिन प्रत्येक मैच को विशेषज्ञ द्वारा अनुमोदित किया गया था।

पूर्वव्यापी रूपांतरण और पुराने रिकॉर्ड

कई पुस्तकालयों में अधूरे या पुराने रिकॉर्ड हैं जो वर्षों पहले विभिन्न नियमों के साथ दर्ज किए गए थे। इन्हें वर्तमान मानक पर ले जाना पूर्वव्यापी रूपांतरण कहलाता है और मैन्युअल रूप से किए जाने पर यह बहुत श्रमसाध्य होता है। एआई एक पुराने रिकॉर्ड को पढ़ सकता है और इसे वर्तमान फ़ील्ड संरचना में ले जाने के लिए एक ड्राफ्ट तैयार कर सकता है: उदाहरण के लिए, यह एक फ्री-टेक्स्ट उद्धरण को पार्स कर सकता है और इसे सही फ़ील्ड में वितरित कर सकता है। हालाँकि, यहाँ दो खतरे हैं। सबसे पहले, एआई गुम हुई जानकारी को "बना सकता है"; दूसरा, यह पुराने रिकॉर्ड में किसी त्रुटि को सुधारने के बजाय उसे नए प्रारूप में कॉपी करके उसे कायम रख सकता है। इसलिए, पूर्वव्यापी परिवर्तन में, एआई के आउटपुट को नमूनाकरण द्वारा नहीं, बल्कि महत्वपूर्ण क्षेत्रों (लेखक, वर्ष, पहचान संख्या) द्वारा व्यवस्थित रूप से जांचा जाना चाहिए। एक अच्छा अभ्यास यह है कि रूपांतरण से पहले और बाद के रिकॉर्ड को साथ-साथ प्रदर्शित किया जाए, जिससे प्रत्येक परिवर्तन दिखाई दे; इसलिए विशेषज्ञ एक नज़र में देख सकता है कि क्या स्थानांतरित किया गया है, क्या बदला गया है और क्या बनाया गया है।

ध्यान दें: एआई द्वारा उत्पादित ड्राफ्ट मेटाडेटा को एक-एक करके समीक्षा किए बिना बैच के रूप में सिस्टम में स्थानांतरित नहीं किया जाना चाहिए। एक सामूहिक त्रुटि एक साथ सैकड़ों रिकॉर्ड को दूषित कर देती है, और पुनर्प्राप्त करना उत्पादन से कहीं अधिक परेशानी भरा होता है। छोटे बैचों में उत्पादन और सत्यापन करना सबसे सुरक्षित है।

चार प्रतिलिपि योग्य टेम्पलेट

1) डबलिन कोर रूपरेखा:

आपकी भूमिका: सहायक कैटलॉगर. निम्नलिखित बायलाइन टेक्स्ट से डबलिन कोर फ़ील्ड भरें: शीर्षक, निर्माता, विषय, विवरण, प्रकाशक, तिथि, शैली, प्रारूप, भाषा। केवल वही जानकारी उपयोग करें जो पाठ में स्पष्ट हो; लुप्त फ़ील्ड "[कोई जानकारी नहीं]" छोड़ दें, अनुमान न लगाएं। छाप पाठ: [यहाँ]

2) एमएआरसी क्षेत्र की रूपरेखा:

नीचे दी गई पुस्तक जानकारी से निम्नलिखित एमएआरसी क्षेत्रों की रूपरेखा प्रस्तावित करें: 245 (शीर्षक/क्रेडिट), 100 (मुख्य लेखक), 260/264 (प्रकाशन), 300 (भौतिक विवरण), 650 (विषय)। जिस भी फ़ील्ड के बारे में आप अनिश्चित हैं उसे "[सत्यापन की आवश्यकता है]" के रूप में चिह्नित करें। जानकारी: [यहाँ]

3) नियंत्रित शब्दावली से विषय मिलान:

नीचे स्रोत का सारांश और स्वीकृत विषय शर्तों की सूची दी गई है। सूची से केवल 3-5 सबसे उपयुक्त शब्दों का स्रोत से मिलान करें। यदि सूची में कोई उपयुक्त पद नहीं है, तो "सूची में कोई उपयुक्त पद नहीं" लिखें, नये पद न बनायें। सारांश: [यहाँ] / शब्द सूची: [यहाँ]

4) प्राधिकरण प्रपत्र नियंत्रण:

नीचे दिए गए लेखक के नामों का मेरे द्वारा प्रदान की गई प्राधिकार सूची में स्वीकृत प्रपत्रों से मिलान करें। प्रत्येक नाम के लिए: रिकॉर्ड में प्रारूप -> अनुमोदित प्रारूप। यदि सूची में कोई समकक्ष नहीं है, तो "कोई प्राधिकारी रिकॉर्ड नहीं" लिखें। नाम: [यहां] / प्राधिकरण सूची: [यहां]

कमजोर संकेत/मजबूत संकेत

कमजोर संकेत:

निम्नलिखित पुस्तक के लिए कैटलॉगिंग जानकारी निकालें: "कृत्रिम बुद्धिमत्ता और समाज"।

केवल शीर्षक दिया गया है; एआई को लेखक, वर्ष, प्रकाशक और आईएसबीएन बनाने के लिए मजबूर किया जाता है। कोई लक्ष्य मानक नहीं है. परिणाम: एक विश्वसनीय लेकिन संभवतः ग़लत रिकॉर्ड।

शक्तिशाली संकेत:

आपकी भूमिका: सहायक कैटलॉगर. पुस्तक के छाप पृष्ठ का पूरा पाठ नीचे दिया गया है। इसमें से डबलिन कोर फ़ील्ड भरें। केवल वही जानकारी उपयोग करें जो पाठ में स्पष्ट रूप से बताई गई है; गैर-पाठ फ़ील्ड को खाली छोड़ दें और "[कोई जानकारी नहीं]" लिखें। कोई दिनांक, नाम या आईएसबीएन नहीं बनाया गया है। छाप पाठ: [पूरा पाठ यहां]

शक्तिशाली प्रॉम्प्ट एआई को वास्तविक बायलाइन जानकारी तक सीमित कर देता है और इसे बनाने के बजाय ईमानदारी से रिक्त स्थान छोड़ने के लिए मजबूर करता है।

मेटाडेटा फ़ील्ड और सत्यापन तालिका

क्षेत्र

निर्माण का जोखिम

सत्यापन कैसे करें

शीर्षक

कम

छाप पृष्ठ से तुलना करें

लेखक/प्राधिकरण प्रारूप

मध्यम

प्राधिकरण फ़ाइल में खोजें

प्रकाशन का वर्ष

उच्च

छाप/कॉलोफोन से पुष्टि करें

आईएसबीएन

बहुत ऊँचा

बारकोड/स्रोत के साथ एक-से-एक नियंत्रण

विषय शब्द

उच्च

नियंत्रित शब्दावली में मिलान करें

सामान्य गलतियाँ

  • बस शीर्षक से मेटाडेटा का अनुरोध कर रहा हूँ। अधूरी जानकारी एआई को बातें बनाने के लिए प्रेरित करती है।
  • लक्ष्य मानक निर्दिष्ट नहीं किया जा रहा है. मनमाना स्वरूपण अभिलेखों के सामंजस्य को बाधित करता है।
  • आईएसबीएन और वर्ष को सत्यापित किए बिना स्वीकार करना। इन क्षेत्रों में निर्माण का सबसे अधिक जोखिम होता है।
  • नियंत्रित शब्दावली के बाहर से विषय शब्द लेना। संगति और उपलब्धता से समझौता किया गया है।
  • प्राधिकरण नियंत्रण को दरकिनार करना। एक ही लेखक विभिन्न स्वरूपों में बिखर जाता है, उपयोगकर्ता स्रोत से चूक जाता है।

संक्षेप में

मेटाडेटा निर्माण में, एआई एक शक्तिशाली सहायक है जो प्रिंट जानकारी को तुरंत निकालता है और कैटलॉगिंग समय को काफी कम कर देता है। लेकिन उत्पादकता की कीमत निर्माण के जोखिमों के खिलाफ कठोर सत्यापन है: लक्ष्य मानक (एमएआरसी, डबलिन कोर) को स्पष्ट करें, एआई को केवल वास्तविक बायवर्ड ज्ञान के साथ चलाएं, नियंत्रित शब्दावलियों से विषय शर्तों को मैप करें, और प्राधिकरण रूपों को मान्य करें। कमियों को पूरा करने के बजाय, एआई को ईमानदारी से इसे खाली छोड़ देना चाहिए; आप अंतिम अनुमोदन रखें.

आवेदन कार्य

आपके पास मौजूद किसी वास्तविक पुस्तक के छाप पृष्ठ का पाठ "डबलिन कोर ड्राफ्ट" टेम्पलेट के साथ एआई को दें और एक ड्राफ्ट प्राप्त करें। फिर उसी पुस्तक को केवल शीर्षक ("कमजोर संकेत") के साथ तैयार करें और दो आउटपुट की तुलना करें: कौन से फ़ील्ड गढ़े गए थे? फिर, "नियंत्रित शब्दावली से विषय मानचित्रण" टेम्पलेट के साथ, विषय का मिलान करने के लिए स्वीकृत शब्दों की एक छोटी सूची दें और जांचें कि क्या एआई सूची से बाहर है।

चेकलिस्ट

  • [ ] मैंने एआई को स्रोत की वास्तविक पहचान की जानकारी दी, मैंने इसे अनुमान लगाने पर नहीं छोड़ा।
  • [ ] मैंने लक्ष्य मेटाडेटा मानक (एमएआरसी/डबलिन कोर) को स्पष्ट रूप से निर्दिष्ट किया है।
  • [ ] मैंने प्रकाशन वर्ष और आईएसबीएन को मूल स्रोत से शब्दशः सत्यापित कर लिया है।
  • [ ] मैंने नियंत्रित शब्दावली से विषय के शब्दों को मैप किया।
  • [ ] मैंने अनुमोदित रिकॉर्ड के साथ प्राधिकार के प्रपत्रों की पुष्टि कर दी है।