युनिट्स
1. इतिहास आणि संग्रहणातील कृत्रिम बुद्धिमत्तेचा परिचय: भूमिका, सीमा, प्रमाणीकरण आणि नीतिशास्त्र 2. दस्तऐवज डिजिटायझेशन आणि ओसीआर: मुद्रित मजकूर मशीन टेक्स्टमध्ये रूपांतरित करणे 3. लिप्यंतरण: ऑट्टोमन तुर्की आणि हस्तलिखिते 4. मेटाडेटा, कॅटलॉगिंग आणि वर्गीकरण 5. स्रोत स्कॅनिंग, शोध आणि सारांश 6. ऐतिहासिक भाषांतर आणि सरलीकरण 7. स्त्रोत पडताळणी, अनाक्रोनिझम आणि भ्रम 8. सामग्री विश्लेषण आणि नमुना शोध 9. संग्रहण प्रवेश, वर्णन आणि वापरकर्ता सेवा 10. संरक्षण, जीर्णोद्धार आणि डिजिटल संरक्षण 11. नैतिकता, कॉपीराइट, गोपनीयता आणि सांस्कृतिक संवेदनशीलता 12. एंड-टू-एंड प्रोजेक्ट: आर्टिफिशियल इंटेलिजन्ससह संग्रहण संग्रहावर प्रक्रिया करणे
युनिट 4 / 12

मेटाडेटा, कॅटलॉगिंग आणि वर्गीकरण

नफा:

  • कृत्रिम बुद्धिमत्तेसह ISAD(G) किंवा Dublin Core सारख्या मानकांनुसार मेटाडेटा मसुदे तयार करण्याची क्षमता
  • रजा-रिक्त परवानगीने नियंत्रित शब्दसंग्रहावर भ्रमनिरास रोखण्याची क्षमता आणि नकाशा विषय संज्ञा
  • तारीख, व्यक्तीचे नाव आणि संदर्भ कोड यासारख्या कोणत्या फील्ड्समध्ये फरक करण्याची क्षमता, मानवी मंजुरीची आवश्यकता आहे आणि जे फक्त संस्थेद्वारे नियुक्त केले जावे

एखादे संग्रहण किंवा ग्रंथालय, ते कितीही समृद्ध असले तरी, त्याची व्याख्या केल्याशिवाय सापडत नाही. दस्तऐवज "शोधण्यायोग्य" बनवते ती त्याबद्दलची वर्णनात्मक माहिती: ते कोणी लिहिले, केव्हा, कुठे, त्याचा विषय काय आहे, तो कोणत्या संग्रहाचा आहे. या माहितीला मेटाडेटा म्हणतात (मेटाडेटा — दस्तऐवजाबद्दल वर्णनात्मक डेटा; "डेटा बद्दल डेटा"). कॅटलॉगिंग ही या मेटाडेटासह दस्तऐवज ओळखण्याची आणि त्यांना शोधण्यायोग्य प्रणालीमध्ये जतन करण्याची प्रक्रिया आहे. वर्गीकरण म्हणजे विषय, प्रकार किंवा मूळ यासारख्या निकषांनुसार कागदपत्रे व्यवस्थित करणे.

मेटाडेटा तयार करणे अत्यंत वेळखाऊ आहे; मोठ्या संग्रहातील हजारो दस्तऐवजांसाठी तारीख, विषय, व्यक्ती आणि ठिकाणाची माहिती वैयक्तिकरित्या प्रविष्ट करण्यासाठी अनेक वर्षे लागू शकतात. या व्यवसायात AI हा एक मजबूत मसुदा जनरेटर आहे. या युनिटमध्ये, आपण AI सह मेटाडेटा कसा निर्माण करायचा ते पाहू, मानकांनुसार (ISAD(G), Dublin Core) कॅटलॉगिंग आणि स्वयंचलित वर्गीकरणाची शक्ती आणि तोटे दोन्ही.

अभिलेख मानक: त्यांची आवश्यकता का आहे

मेटाडेटा यादृच्छिकपणे प्रविष्ट केलेला नाही; आंतरराष्ट्रीय मानके आहेत जेणेकरुन विविध संस्थांचे रेकॉर्ड एकमेकांशी बोलू शकतील:

  • ISAD(G) (जनरल इंटरनॅशनल स्टँडर्ड आर्काइव्हल वर्णन): अभिलेखीय सामग्रीचे श्रेणीबद्ध वर्णन करण्याचे नियम (निधी, मालिका, फाइल, दस्तऐवज स्तरावर). त्यात संदर्भ कोड, शीर्षक, तारीख, व्याप्ती, निर्माता यासारख्या फील्ड आहेत.
  • डब्लिन कोर: डिजिटल संसाधने (शीर्षक, निर्माता, विषय, तारीख, शैली, स्वरूप, स्त्रोत, भाषा, इ.) वर्णन करण्यासाठी 15 मुख्य फील्डचा समावेश असलेले एक सामान्य मानक.
  • आवड: एकल व्यक्ती, कुटुंब किंवा संस्थेच्या क्रियाकलापांच्या परिणामी नैसर्गिकरित्या तयार केलेल्या नोंदींचा संच. हे संग्रहणाचे मूलभूत आयोजन एकक आहे.
  • उद्गम (मूळ): दस्तऐवज कोणाकडून आला आणि तो कोणत्या हातातून गेला याची माहिती. संग्रहणात, दस्तऐवज त्यांच्या उत्पत्तीनुसार एकत्र ठेवले जातात.

AI उत्पादन मेटाडेटा असताना लक्ष्य मानक स्पष्टपणे निर्दिष्ट करणे हे सुनिश्चित करते की आउटपुट थेट एंटरप्राइझमध्ये इनपुट करण्यायोग्य आहे.

आणखी एक महत्त्वाची संकल्पना म्हणजे प्राधिकरण रेकॉर्ड—एक रेकॉर्ड जी व्यक्ती, ठिकाण किंवा संस्थेच्या नावाचे एकल, प्रमाणित, मंजूर स्वरूप परिभाषित करते. ऐतिहासिक दस्तऐवजांमध्ये, एकच व्यक्ती किंवा ठिकाण वेगवेगळ्या स्पेलिंगसह दिसू शकते; ऑथॉरिटी रेकॉर्ड त्या सर्वांना एकाच मान्यताप्राप्त फॉरमॅटमध्ये बांधते जेणेकरून ते शोधात विखुरले जाणार नाहीत. एआय दस्तऐवजातून नावे सुचवते; परंतु हे नाव प्राधिकरणाच्या नोंदीतील मानक स्वरूपात मॅप करणे हे मानवी काम आहे. संस्थेच्या अधिकृत नोंदीमध्ये AI "अहमद" ला "अहमद बे (1840-1912)" म्हणते ते जोडणे कॅटलॉगची सुसंगतता राखते.

कार्यप्रवाह: चरण-दर-चरण

1. स्त्रोत तयार करा. दस्तऐवजाचा उतारा किंवा प्रतिमा आणि कोणतीही संदर्भ माहिती गोळा करा.

2. मानक आणि क्षेत्रे ओळखा. AI ला सांगा की कोणते मानक (ISAD(G), Dublin Core) आणि कोणत्या फील्डनुसार ते आउटपुट तयार करेल.

3. मसुदा मेटाडेटा व्युत्पन्न करा. AI दस्तऐवजातून काढता येणारी फील्ड भरते (तारीख, व्यक्ती, ठिकाण, विषय, भाषा, शैली); ते काढू शकत नाही अशा क्षेत्रांना ते रिक्त ठेवते.

4. नियंत्रित शब्दसंग्रहाचा नकाशा. विषय आणि ठिकाणांची नावे बहुतेक संस्थांमध्ये विनामूल्य नाहीत, परंतु पूर्वनिर्धारित सूचीमध्ये (नियंत्रित शब्दसंग्रह / कोश) बद्ध आहेत. या सूचीमध्ये AI ने सुचवलेल्या विषयाच्या अटींचा नकाशा तयार करा.

5. सत्यापित करा आणि पुष्टी करा. प्रत्येक फील्ड, विशेषत: तारीख, नाव आणि विषय यांची मानवाकडून कागदपत्रे आणि अधिकाराच्या नोंदींशी तुलना केली जाते.

टीप: स्पष्टपणे AI ला "रिक्त सोडण्याची" परवानगी द्या. अन्यथा, ते दस्तऐवजात नसलेली तारीख किंवा निर्माता "अंदाज" भरेल आणि तुमच्या कॅटलॉगमध्ये बनावट मेटाडेटा समाविष्ट करेल. "हे फील्ड जर कागदपत्रात नसेल तर ते रिकामे सोडा" ही सूचना भ्रम विरुद्ध सर्वात मजबूत कवच आहे.

टेबलमधील फील्ड आणि विश्वास पातळी

मेटाडेटा फील्ड

एआय किती विश्वासार्ह आहे?

पडताळणी

भाषा

उच्च

नमुना

दस्तऐवज प्रकार

मध्यम-उच्च

नियंत्रण

व्यक्ती/स्थळांची नावे

मध्यम (वाचन त्रुटी)

अनिवार्य

तारीख

कमी-मध्यम (फॅब्रिकेशनचा धोका)

अनिवार्य

विषयाच्या अटी

मध्यम (विनामूल्य निर्मिती)

चेकलिस्टसाठी नकाशा

व्याप्ती/सारांश

मध्यम-उच्च

स्त्रोताशी तुलना करा

संदर्भ कोड

काहीही नाही (संस्था देत नाही)

मानवी फेकणे

सारांश: भाषा आणि शैली यासारख्या क्षेत्रांमध्ये AI जलद आणि विश्वासार्ह आहे; तारीख, नाव आणि विषय यांसारख्या फील्डमध्ये मसुदे व्युत्पन्न करते, परंतु मानवी मान्यता आवश्यक आहे; एआय कधीही संस्थात्मक फील्ड तयार करत नाही जसे की संदर्भ कोड.

तीन लहान प्रकरणे

केस 1 - 8,000 फोटोंसाठी मेटाडेटा मसुदा. एक शहर संग्रहण 8,000 ऐतिहासिक छायाचित्रे कॅटलॉग करत होते. प्रत्येक फोटोच्या पाठीमागील नोट्स लिप्यंतरण करून AI ला दिल्या होत्या; AI व्युत्पन्न तारीख, स्थान आणि विषय बाह्यरेखा. मानवी संघाने ते फील्डनुसार सत्यापित केले आणि नियंत्रित सूचीमध्ये मॅप केले. अंदाजे 10 महिन्यांची नोकरी 3 महिन्यांपर्यंत कमी केली गेली; परंतु प्रत्येक तारीख आणि ठिकाणाचे नाव दृष्यदृष्ट्या तपासले गेले.

केस 2 - तयार केलेला इतिहास. एका आर्किव्हिस्टकडे AI कॅटलॉग एक न केलेले पत्र होते. YZ ने पत्रातील मजकूर पाहिला आणि "1912" ही तारीख तंतोतंत लिहिली. मात्र, कागदपत्रात तारीख नव्हती; एआयने भाकीत केले. जर आर्किव्हिस्टने "दस्तऐवजात नसल्यास रिक्त सोडा" ही सूचना जोडली नसती, तर कॅटलॉग तयार केलेल्या तारखेने भरला गेला असता. धडा: रिक्त परवानगी अनिवार्य आहे.

प्रकरण 3 - विनामूल्य विषय संज्ञांनी गोंधळ निर्माण केला. AI ने समान दस्तऐवजांना "इमिग्रेशन", "इमिग्रेशन", "सेटलमेंट" यासारख्या समान परंतु भिन्न विनामूल्य अटी नियुक्त केल्या आहेत. जेव्हा ते नियंत्रित शब्दसंग्रहात मॅप केलेले नव्हते, तेव्हा तोच विषय तीन वेगवेगळ्या संज्ञांसह टॅग केला गेला आणि शोधात विखुरला गेला. एकल प्राधिकरण सूचीमध्ये अटी मॅप करून सुसंगतता प्राप्त झाली. धडा: विषयाच्या अटी सोडल्या जात नाहीत, त्या सूचीशी जोडलेल्या आहेत.

चार कॉपी करण्यायोग्य टेम्पलेट्स

1) डब्लिन कोर बाह्यरेखा:

खालील दस्तऐवज प्रतिलेखनातून डब्लिन कोर मेटाडेटा मसुदा काढा. फील्ड: शीर्षक, निर्माता, विषय, वर्णन, तारीख, शैली, भाषा, व्याप्ती (स्थान/कालावधी). नियम: (१) केवळ मजकुरात स्पष्टपणे माहिती वापरा. (2) मजकुरात नसलेले फील्ड रिक्त सोडा, अंदाज लावू नका. (३) तुम्हाला खात्री नसलेले मूल्य चिन्हांकित करा [?]. लिप्यंतरण: [येथे]

2) ISAD(G) मसुदा व्याख्या:

ISAD(G) फील्डमध्ये खालील दस्तऐवजासाठी मसुदा तयार करा: शीर्षक, तारीख(चे), वर्णन स्तर (दस्तऐवज/फाइल), व्याप्ती आणि सामग्री (लहान सारांश), निर्माता, भाषा. संदर्भ कोड रिक्त सोडा (संस्था प्रदान करेल). मजकुरात नसलेली कोणतीही माहिती जोडू नका; अस्तित्वात नसलेले फील्ड रिक्त सोडा. दस्तऐवज: [येथे]

3) विषय शब्द सूचना (नियंत्रित):

खालील दस्तऐवजासाठी योग्य 3-5 विषय अटी सुचवा. प्रथम, दस्तऐवजातील तथ्यांवर अवलंबून रहा. खाली आमच्या संस्थेची नियंत्रित शब्दावली यादी आहे; प्रथम, या सूचीमधून ते निवडा, जर ते सूचीमध्ये नसेल तर, तुमची नवीन संज्ञा स्वतंत्रपणे चिन्हांकित करा. सूची: [अटी]. दस्तऐवज: [येथे]

4) मोठ्या प्रमाणात सातत्य तपासणी:

खाली समान संग्रहातील दस्तऐवजांसाठी मेटाडेटा रेकॉर्ड आहेत. ध्वजांकित विसंगती: एकच ठिकाण/व्यक्तीचे स्पेलिंग वेगळे, भिन्न तारीख स्वरूप, एकाच विषयासाठी भिन्न संज्ञा. सुधारणा IMPOSITION; मानवाने पुनरावलोकन करण्यासाठी फक्त विसंगतींची सूची तयार करा. रेकॉर्ड: [येथे]

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत:

या दस्तऐवजासाठी संपूर्ण कॅटलॉग रेकॉर्ड तयार करा.

“पूर्ण” सूचना AI ला प्रत्येक जागा भरण्यासाठी, म्हणजे, इतिहास आणि अस्तित्वात नसलेल्या निर्मात्यांचा शोध घेण्यास प्रवृत्त करते.

मजबूत:

या दस्तऐवजासाठी डब्लिन कोर मसुदा तयार केला आहे. ट्रान्सक्रिप्शनमध्ये स्पष्टपणे समाविष्ट केलेली केवळ माहिती वापरा; अस्तित्वात नसलेले फील्ड रिक्त सोडा, अंदाज लावू नका. या नियंत्रित सूचीमधून विषय संज्ञा निवडा: [सूची]. तारीख आणि व्यक्तीची नावे [?] ने चिन्हांकित करा म्हणजे मी दस्तऐवजासह ते सत्यापित करू शकेन. लिप्यंतरण: [येथे]

फरक: "पूर्ण" आवृत्तीऐवजी "रिक्त सोडा" परवानगी, नियंत्रित सूची पालन आणि सत्यापन चिन्हे कॅटलॉगला बनावटीपासून संरक्षण देतात.

सामान्य चुका

  • याचा अर्थ "ते पूर्णपणे भरा". यामुळे अस्तित्वात नसलेली फील्ड फिट होते; "रिक्त सोडा" परवानगी दिली पाहिजे.
  • विषय अटी सोडत आहे. नियंत्रित शब्दसंग्रहाला मॅप न करणाऱ्या अटी शोध विचलित करतील.
  • AI अंदाज इतिहास असणे. न केलेल्या दस्तऐवजात काल्पनिक तारीख टाकल्याने कॅटलॉग दूषित होतो.
  • AI द्वारे व्युत्पन्न केलेला संदर्भ कोड असणे. ही एक कॉर्पोरेट, अद्वितीय जागा आहे; लोक फेकतात.
  • मानक निर्दिष्ट करत नाही. मानक नमूद न केल्यास, आउटपुट एक गोंधळलेला मसुदा असेल जो संस्थेमध्ये प्रवेश केला जाऊ शकत नाही.

सारांशात

मेटाडेटा आणि कॅटलॉगिंग ही अदृश्य पायाभूत सुविधा आहे जी संशोधकासाठी संग्रह उघडते आणि त्यासाठी खूप प्रयत्न करावे लागतात. ट्रान्सक्रिप्शनमधून, AI तारीख, व्यक्ती, ठिकाण, विषय आणि शैली यासारख्या फील्डसाठी एक जलद रूपरेषा तयार करते; हे ISAD(G) किंवा Dublin Core सारख्या मानकांनुसार कार्य करू शकते. परंतु "पूर्णपणे भरा" चा दबाव एआयला गोष्टी तयार करण्यासाठी ढकलतो; "रिक्त सोडा" परवानगी, नियंत्रित शब्दसंग्रहाचे मॅपिंग आणि तारखा/नावांची मानवी पुष्टी कॅटलॉग विश्वासार्ह ठेवते. एआय मसुदा तयार करते; कॅटलॉगच्या अचूकतेसाठी तुम्ही जबाबदार आहात.

अर्ज कार्य

दस्तऐवज ट्रान्सक्रिप्शन घ्या आणि “डब्लिन कोअर ड्राफ्ट” टेम्प्लेटसह AI कडून मेटाडेटाची विनंती करा; ते अस्तित्वात नसलेली रिक्त फील्ड सोडते हे तपासा. नंतर तुमच्या स्वतःच्या (किंवा नमुना) चेकलिस्टसह "विषय संज्ञा सूचना" टेम्पलेट चालवा. शेवटी, "मोठ्या प्रमाणात सातत्य तपासणी" सह काही रेकॉर्डची चाचणी घ्या. AI अंदाजानुसार किती फील्ड पॉप्युलेट करण्याचा प्रयत्न करते आणि सूचीमध्ये किती विषयांचे शब्द मॅप करणे आवश्यक आहे ते लक्षात घ्या.

चेकलिस्ट

  • [ ] मी स्पष्टपणे लक्ष्य मानक (ISAD(G)/Dublin Core) सांगितले आहे.
  • [ ] मी "रिक्त क्षेत्र रिक्त सोडा" परवानगी दिली.
  • [ ] मी विषयाच्या संज्ञा नियंत्रित सूचीमध्ये मॅप केल्या आहेत.
  • मी दस्तऐवज/अधिकारी रेकॉर्डसह तारीख आणि व्यक्तींच्या नावांची पडताळणी केली.
  • [ ] मी संदर्भ कोड संस्थेकडे सोडला आहे, AI ला नाही.