लाभ:
- कृत्रिम बुद्धिमत्ता के साथ आईएसएडी (जी) या डबलिन कोर जैसे मानकों के अनुसार मेटाडेटा ड्राफ्ट तैयार करने की क्षमता
- मतिभ्रम को रोकने और खाली अनुमति के साथ विषय शर्तों को नियंत्रित शब्दावली में मैप करने की क्षमता
- यह अंतर करने की क्षमता कि किन क्षेत्रों, जैसे दिनांक, व्यक्ति का नाम और संदर्भ कोड के लिए मानव अनुमोदन की आवश्यकता है और किसे केवल संस्थान द्वारा सौंपा जाना चाहिए
कोई भी संग्रह या पुस्तकालय, चाहे वह कितना भी समृद्ध क्यों न हो, तब तक नहीं पाया जा सकता जब तक कि वह अच्छी तरह से परिभाषित न हो। किसी दस्तावेज़ को "खोजने योग्य" बनाने वाली चीज़ उसके बारे में वर्णनात्मक जानकारी है: इसे किसने लिखा, कब, कहाँ, इसका विषय क्या है, यह किस संग्रह से संबंधित है। इस जानकारी को मेटाडेटा कहा जाता है (मेटाडेटा - किसी दस्तावेज़ के बारे में वर्णनात्मक डेटा; "डेटा के बारे में डेटा")। कैटलॉगिंग इस मेटाडेटा के साथ दस्तावेजों की पहचान करने और उन्हें खोजने योग्य प्रणाली में सहेजने की प्रक्रिया है। वर्गीकरण का तात्पर्य दस्तावेजों को विषय, प्रकार या उत्पत्ति जैसे मानदंडों के अनुसार व्यवस्थित करना है।
मेटाडेटा उत्पन्न करना अत्यधिक समय लेने वाला है; बड़े संग्रहों में हजारों दस्तावेजों के लिए व्यक्तिगत रूप से तारीख, विषय, व्यक्ति और स्थान की जानकारी दर्ज करने में वर्षों लग सकते हैं। इस व्यवसाय में AI एक मजबूत ड्राफ्ट जनरेटर है। इस इकाई में, हम देखेंगे कि एआई के साथ मेटाडेटा कैसे उत्पन्न किया जाए, मानकों (आईएसएडी (जी), डबलिन कोर) के अनुसार कैटलॉगिंग, और स्वचालित वर्गीकरण की शक्ति और नुकसान दोनों।
अभिलेखीय मानक: उनकी आवश्यकता क्यों है
मेटाडेटा यादृच्छिक रूप से दर्ज नहीं किया गया है; अंतर्राष्ट्रीय मानक हैं ताकि विभिन्न संस्थानों के रिकॉर्ड एक-दूसरे से बात कर सकें:
- आईएसएडी (जी) (सामान्य अंतर्राष्ट्रीय मानक अभिलेखीय विवरण): अभिलेखीय सामग्री को श्रेणीबद्ध रूप से (फंड, श्रृंखला, फ़ाइल, दस्तावेज़ स्तर पर) वर्णित करने के नियम। इसमें संदर्भ कोड, शीर्षक, तिथि, दायरा, निर्माता जैसे फ़ील्ड शामिल हैं।
- डबलिन कोर: डिजिटल संसाधनों (शीर्षक, निर्माता, विषय, तिथि, शैली, प्रारूप, स्रोत, भाषा, आदि) का वर्णन करने के लिए 15 मुख्य क्षेत्रों से युक्त एक सामान्य मानक।
- शौकीन: किसी एक व्यक्ति, परिवार या संस्था की गतिविधियों के परिणामस्वरूप स्वाभाविक रूप से बनने वाले अभिलेखों का एक समूह। यह संग्रह की मूल आयोजन इकाई है।
- उद्गम (उत्पत्ति): यह जानकारी कि कोई दस्तावेज़ किससे आया है और वह किस हाथ से होकर गुजरा है। संग्रहण में दस्तावेज़ों को उनकी उत्पत्ति के अनुसार एक साथ रखा जाता है।
एआई उत्पादन मेटाडेटा होने पर लक्ष्य मानक को स्पष्ट रूप से निर्दिष्ट करना यह सुनिश्चित करता है कि आउटपुट सीधे उद्यम में इनपुट करने योग्य है।
एक अन्य प्रमुख अवधारणा प्राधिकरण रिकॉर्ड है - एक रिकॉर्ड जो किसी व्यक्ति, स्थान या संस्था के नाम के एकल, मानक, अनुमोदित रूप को परिभाषित करता है। ऐतिहासिक दस्तावेज़ों में, एक ही व्यक्ति या स्थान अलग-अलग वर्तनी के साथ प्रकट हो सकता है; प्राधिकरण रिकॉर्ड उन सभी को एक ही स्वीकृत प्रारूप में बांधता है ताकि वे खोज में बिखर न जाएं। एआई किसी दस्तावेज़ से नाम सुझाता है; लेकिन इस नाम को प्राधिकरण रिकॉर्ड में मानक रूप में मैप करना मानवीय कार्य है। संस्था के प्राधिकारी रिकॉर्ड में एआई जो "अहमद" कहता है उसे "अहमद बे (1840-1912)" से जोड़ने से कैटलॉग की स्थिरता बरकरार रहती है।
वर्कफ़्लो: चरण दर चरण
1. स्रोत तैयार करें. दस्तावेज़ की प्रतिलेख या छवि और किसी भी संदर्भ की जानकारी एकत्र करें।
2. मानक और क्षेत्रों की पहचान करें. AI को बताएं कि यह किस मानक (ISAD(G), डबलिन कोर) और किन क्षेत्रों के अनुसार आउटपुट देगा।
3. ड्राफ्ट मेटाडेटा उत्पन्न करें। एआई उन क्षेत्रों को भरता है जिन्हें दस्तावेज़ से निकाला जा सकता है (दिनांक, व्यक्ति, स्थान, विषय, भाषा, शैली); यह उन क्षेत्रों को खाली छोड़ देता है जिन्हें यह हटा नहीं सकता।
4. नियंत्रित शब्दावली का मानचित्र। अधिकांश संस्थानों में विषय और स्थान के नाम मुफ़्त नहीं हैं, बल्कि एक पूर्वनिर्धारित सूची (नियंत्रित शब्दावली / थिसॉरस) से बंधे हैं। एआई द्वारा सुझाए गए विषय शर्तों को इस सूची में मैप करें।
5. सत्यापित करें और पुष्टि करें. प्रत्येक क्षेत्र, विशेष रूप से दिनांक, नाम और विषय की तुलना मनुष्यों द्वारा प्राधिकरण के दस्तावेजों और अभिलेखों से की जाती है।
युक्ति: एआई को स्पष्ट रूप से "खाली छोड़ने" की अनुमति दें। अन्यथा, यह उस दिनांक या निर्माता को "अनुमान" लगाएगा जो दस्तावेज़ में नहीं है और आपके कैटलॉग में नकली मेटाडेटा डाल देगा। निर्देश "यदि यह दस्तावेज़ में नहीं है तो इस फ़ील्ड को खाली छोड़ दें" मतिभ्रम के खिलाफ सबसे मजबूत ढाल है।
तालिका में फ़ील्ड और विश्वास स्तर
मेटाडेटा फ़ील्ड
AI कितना विश्वसनीय है?
सत्यापन
भाषा
उच्च
नमूना
दस्तावेज़ प्रकार
मध्यम-उच्च
नियंत्रण
व्यक्ति/स्थान के नाम
मध्यम (पढ़ने में त्रुटि)
अनिवार्य
दिनांक
निम्न-मध्यम (निर्माण का जोखिम)
अनिवार्य
विषय शर्तें
मध्यम (मुक्त उत्पादन)
चेकलिस्ट के लिए मानचित्र
दायरा/सारांश
मध्यम-उच्च
स्रोत से तुलना करें
संदर्भ कोड
कोई नहीं (संस्था देती है)
मानव फेंकता है
सारांश: एआई भाषा और शैली जैसे क्षेत्रों में तेज़ और विश्वसनीय है; दिनांक, नाम और विषय जैसे क्षेत्रों में ड्राफ्ट तैयार करता है, लेकिन मानव अनुमोदन की आवश्यकता होती है; एआई कभी भी संदर्भ कोड जैसे संस्थागत क्षेत्र तैयार नहीं करता है।
तीन मिनी मामले
केस 1 - 8,000 फ़ोटो के लिए ड्राफ्ट मेटाडेटा। शहर का एक संग्रह 8,000 ऐतिहासिक तस्वीरों को सूचीबद्ध कर रहा था। प्रत्येक तस्वीर के पीछे के नोट्स को प्रतिलेखित किया गया और एआई को दिया गया; एआई द्वारा निर्मित तिथि, स्थान और विषय की रूपरेखा। मानव टीम ने इसे फ़ील्ड दर फ़ील्ड सत्यापित किया और इसे नियंत्रित सूची में मैप किया। अनुमानित 10 महीने की नौकरी को घटाकर 3 महीने कर दिया गया; लेकिन हर तारीख और स्थान का नाम दृष्टिगत रूप से जांचा गया।
केस 2 - बना-बनाया इतिहास। एक पुरालेखपाल के पास एआई कैटलॉग में एक अदिनांकित पत्र था। YZ ने पत्र की सामग्री को देखा और सटीक तारीख "1912" लिखी। हालाँकि, दस्तावेज़ में कोई तारीख नहीं थी; एआई ने भविष्यवाणी की. यदि पुरालेखपाल ने "दस्तावेज़ में नहीं है तो खाली छोड़ें" निर्देश नहीं जोड़ा होता, तो कैटलॉग एक बनी-बनाई तारीख से भर गया होता। पाठ: रिक्त अनुमति अनिवार्य है.
केस 3 - मुक्त विषय शर्तों ने भ्रम पैदा किया। एआई ने समान दस्तावेज़ों को "आव्रजन", "आव्रजन", "निपटान" जैसे समान लेकिन अलग-अलग निःशुल्क शब्द निर्दिष्ट किए हैं। जब इसे नियंत्रित शब्दावली में मैप नहीं किया गया, तो एक ही विषय को तीन अलग-अलग शब्दों के साथ टैग किया गया और खोज में बिखेर दिया गया। शर्तों को एकल प्राधिकरण सूची में मैप करके स्थिरता हासिल की गई थी। पाठ: विषय शब्द जारी नहीं किए गए हैं, वे सूची से जुड़े हुए हैं।
चार प्रतिलिपि योग्य टेम्पलेट
1) डबलिन कोर रूपरेखा:
नीचे दिए गए दस्तावेज़ प्रतिलेखन से डबलिन कोर मेटाडेटा ड्राफ्ट निकालें। फ़ील्ड: शीर्षक, निर्माता, विषय, विवरण, दिनांक, शैली, भाषा, दायरा (स्थान/अवधि)। नियम: (1) पाठ में केवल स्पष्ट रूप से जानकारी का उपयोग करें। (2) जो फ़ील्ड टेक्स्ट में नहीं है उसे खाली छोड़ दें, अनुमान न लगाएं। (3) जिस मान के बारे में आप निश्चित नहीं हैं उसे [?] से चिह्नित करें। प्रतिलेखन: [यहाँ]
2) आईएसएडी(जी) मसौदा परिभाषा:
आईएसएडी (जी) फ़ील्ड में निम्नलिखित दस्तावेज़ के लिए ड्राफ्ट तैयार करें: शीर्षक, दिनांक, विवरण स्तर (दस्तावेज़/फ़ाइल), दायरा और सामग्री (संक्षिप्त सारांश), निर्माता, भाषा। संदर्भ कोड खाली छोड़ दें (संस्थान इसे उपलब्ध कराएगा)। ऐसी कोई भी जानकारी न जोड़ें जो पाठ में नहीं है; गैर-मौजूद फ़ील्ड को खाली छोड़ दें. दस्तावेज़: [यहाँ]
3) विषय शब्द सुझाव (नियंत्रित):
नीचे दिए गए दस्तावेज़ के लिए उपयुक्त 3-5 विषय शब्द सुझाएँ। सबसे पहले, दस्तावेज़ में तथ्यों पर भरोसा करें। नीचे हमारी संस्था की नियंत्रित शब्दावली सूची है; सबसे पहले, इसे इस सूची से चुनें, यदि यह सूची में नहीं है, तो अपने नए शब्द सुझाव को अलग से चिह्नित करें। सूची: [शर्तें]। दस्तावेज़: [यहाँ]
4) थोक स्थिरता जांच:
नीचे उसी संग्रह से दस्तावेज़ों के मेटाडेटा रिकॉर्ड हैं। ध्वज विसंगतियाँ: एक ही स्थान/व्यक्ति की अलग-अलग वर्तनी वाले रिकॉर्ड, अलग-अलग तिथि प्रारूप, एक ही विषय के लिए अलग-अलग शब्द। सुधार अधिरोपण; मानव की समीक्षा के लिए बस विसंगतियों की एक सूची तैयार करें। अभिलेख: [यहाँ]
कमजोर संकेत/मजबूत संकेत
कमज़ोर:
इस दस्तावेज़ के लिए एक संपूर्ण कैटलॉग रिकॉर्ड बनाएं.
"पूर्ण" निर्देश एआई को हर स्थान को भरने के लिए प्रेरित करता है, यानी, इतिहास और उन रचनाकारों का आविष्कार करने के लिए जो मौजूद नहीं हैं।
मजबूत:
इस दस्तावेज़ के लिए डबलिन कोर का मसौदा तैयार किया गया है। केवल प्रतिलेखन में स्पष्ट रूप से शामिल जानकारी का उपयोग करें; गैर-मौजूद फ़ील्ड को खाली छोड़ दें, अनुमान न लगाएं। इस नियंत्रित सूची से विषय शब्द चुनें: [सूची]। दिनांक और व्यक्ति के नाम को [?] से चिह्नित करें ताकि मैं इसे दस्तावेज़ के साथ सत्यापित कर सकूं। प्रतिलेखन: [यहाँ]
अंतर: "पूर्ण" संस्करण के बजाय "खाली छोड़ें" अनुमति, नियंत्रित सूची पालन और सत्यापन चिह्न कैटलॉग को निर्माण से बचाते हैं।
सामान्य गलतियाँ
- इसका मतलब है "इसे पूरी तरह भरें"। इससे गैर-मौजूद फ़ील्ड फ़िट हो जाते हैं; "खाली छोड़ें" की अनुमति दी जानी चाहिए।
- विषय शर्तें जारी करना. जो शब्द नियंत्रित शब्दावली से मेल नहीं खाते, वे खोज को विचलित कर देंगे।
- एआई के होने से इतिहास की भविष्यवाणी होती है। किसी अदिनांकित दस्तावेज़ में काल्पनिक तारीख दर्ज करने से कैटलॉग प्रदूषित होता है।
- एआई द्वारा उत्पन्न संदर्भ कोड होना। यह एक कॉर्पोरेट, अद्वितीय स्थान है; लोग फेंक देते हैं.
- मानक निर्दिष्ट नहीं कर रहा. यदि मानक का उल्लेख नहीं किया गया है, तो आउटपुट एक गड़बड़ मसौदा होगा जिसे संस्थान में दर्ज नहीं किया जा सकता है।
सारांश
मेटाडेटा और कैटलॉगिंग अदृश्य बुनियादी ढाँचा है जो शोधकर्ता के लिए संग्रह को खोलता है, और इसके लिए बहुत प्रयास की आवश्यकता होती है। प्रतिलेखन से, एआई दिनांक, व्यक्ति, स्थान, विषय और शैली जैसे क्षेत्रों के लिए एक त्वरित रूपरेखा तैयार करता है; यह ISAD(G) या डबलिन कोर जैसे मानकों के अनुसार काम कर सकता है। लेकिन "पूरी तरह से भरने" का दबाव एआई को चीजें बनाने के लिए प्रेरित करता है; "खाली छोड़ें" अनुमति, नियंत्रित शब्दावली का मानचित्रण, और तिथियों/नामों की मानव पुष्टि कैटलॉग को भरोसेमंद बनाए रखती है। एआई मसौदा तैयार करता है; कैटलॉग की सटीकता के लिए आप जिम्मेदार हैं।
आवेदन कार्य
दस्तावेज़ प्रतिलेखन लें और "डबलिन कोर ड्राफ्ट" टेम्पलेट के साथ एआई से मेटाडेटा का अनुरोध करें; जांचें कि यह रिक्त फ़ील्ड छोड़ता है जो मौजूद नहीं हैं। फिर अपनी स्वयं की (या नमूना) चेकलिस्ट के साथ "विषय शब्द सुझाव" टेम्पलेट चलाएँ। अंत में, "थोक स्थिरता जांच" के साथ कुछ रिकॉर्ड का परीक्षण करें। ध्यान दें कि एआई कितने क्षेत्रों को भविष्यवाणी से भरने का प्रयास करता है और कितने विषय शब्दों को सूची में मैप करने की आवश्यकता है।
चेकलिस्ट
- [ ] मैंने लक्ष्य मानक (आईएसएडी(जी)/डबलिन कोर) स्पष्ट रूप से बताया है।
- [ ] मैंने "रिक्त क्षेत्र को खाली छोड़ें" की अनुमति दी।
- [ ] मैंने विषय शर्तों को नियंत्रित सूची में मैप किया।
- [ ] मैंने दस्तावेज़/प्राधिकरण रिकॉर्ड के साथ तारीख और व्यक्ति के नाम सत्यापित किए।
- [ ] मैंने संदर्भ कोड संस्थान पर छोड़ा है, एआई पर नहीं।