युनिट्स
1. ग्रंथपाल आणि माहिती व्यवस्थापनातील कृत्रिम बुद्धिमत्तेचा परिचय: भूमिका, सीमा, प्रमाणीकरण, गोपनीयता आणि नैतिकता 2. कॅटलॉगिंग आणि मेटाडेटा जनरेशनमध्ये कृत्रिम बुद्धिमत्ता 3. विषय विश्लेषण, वर्गीकरण आणि स्वयंचलित अनुक्रमणिका 4. सिमेंटिक शोध आणि शोध प्रणाली 5. शिफारस प्रणाली आणि वैयक्तिकृत संसाधन शिफारस 6. डिजिटल आर्काइव्ह, डिजिटायझेशन, ओसीआर आणि दीर्घकालीन संरक्षण 7. वापरकर्ता सेवा, द्वारपाल आणि चॅट बॉट्स 8. बिब्लियोमेट्रिक्स, उद्धरण विश्लेषण आणि संशोधन प्रभाव मूल्यांकन 9. RAG सह एंटरप्राइझ माहिती व्यवस्थापन 10. स्त्रोत सत्यापन, भ्रम आणि माहिती साक्षरता 11. कॉपीराइट, गोपनीयता, नैतिकता आणि शासन
युनिट 2 / 11

कॅटलॉगिंग आणि मेटाडेटा जनरेशनमध्ये कृत्रिम बुद्धिमत्ता

नफा:

  • वास्तविक छाप माहितीवरून MARC आणि Dublin Core सारख्या मानकांनुसार मसुदा मेटाडेटा तयार करून कॅटलॉगिंग वेळ कमी करण्याची क्षमता
  • बनावटीच्या उच्च जोखमीसह फील्ड सत्यापित करण्याची क्षमता, जसे की प्रकाशन वर्ष, ISBN, लेखकाचे नाव, मूळ स्त्रोतासह आणि नियंत्रित शब्दसंग्रहातून नकाशा विषय अटी
  • प्राधिकरण नियंत्रणासह लेखक आणि विषयाचे स्वरूप एकल-मंजूर करण्याची आणि कॅटलॉग सुसंगतता राखण्याची क्षमता

कॅटलॉगिंग हे ग्रंथपालपदाचे अदृश्य पण सर्वात मूलभूत काम आहे. योग्य मेटाडेटासह संसाधनाचा शोध (पुस्तक, लेख, नकाशा, ध्वनी रेकॉर्डिंग, डिजिटल फाइल) शक्य आहे. मेटाडेटा म्हणजे "डेटा बद्दल डेटा": संरचित माहिती जी संसाधनाचे शीर्षक, लेखक, प्रकाशन वर्ष, विषय, भाषा आणि भौतिक गुणधर्मांचे वर्णन करते. मेटाडेटा चांगला असल्यास, वापरकर्त्याला संसाधन सापडते; जर ते खराब किंवा अपूर्ण असेल तर, संसाधन अस्तित्वात असले तरीही ते गमावले जाते. या युनिटमध्ये तुम्ही ड्राफ्ट मेटाडेटा निर्मितीमध्ये कृत्रिम बुद्धिमत्ता कसा वापरावा, परंतु मानकांचे पालन आणि अचूकता कशी सुनिश्चित करावी हे शिकाल.

प्रथम दोन संकल्पना परिभाषित करूया. MARC (मशीन-रिडेबल कॅटलॉगिंग) हे एक रेकॉर्ड स्वरूप आहे जे लायब्ररींनी दशकांपासून वापरले आहे जे प्रत्येक माहितीचा भाग क्रमांकित फील्डमध्ये ठेवते; उदाहरणार्थ, फील्ड 245 मध्ये शीर्षक आहे आणि फील्ड 100 मध्ये मुख्य लेखक आहे. डब्लिन कोर हे डिजिटल संसाधनांसाठी एक सरलीकृत मेटाडेटा मानक आहे, ज्यामध्ये 15 मूलभूत फील्ड (शीर्षक, निर्माता, विषय, तारीख, शैली इ.) असतात. ही मानके हे सुनिश्चित करतात की वेगवेगळ्या लायब्ररीतील रेकॉर्ड एकमेकांशी बोलू शकतात.

स्टेप बाय स्टेप: आर्टिफिशियल इंटेलिजन्ससह ड्राफ्ट मेटाडेटा तयार करणे

1. स्त्रोताची ओळख माहिती गोळा करा. पुस्तकाचे मुखपृष्ठ, शीर्षक पृष्ठ, सामग्री किंवा डिजिटल फाइलचा मजकूर. AI फक्त तुम्ही दिलेल्या माहितीवरून कार्य करते; आपण अपूर्ण माहिती प्रदान केल्यास, ती अपूर्ण किंवा बनावट मेटाडेटा तयार करते.

2. लक्ष्य मानक निर्दिष्ट करा. AI ला स्पष्ट लक्ष्य द्या, जसे की "डब्लिन कोर फील्डद्वारे" किंवा "MARC 245, 100, 260, 650 फील्डद्वारे." आपण मानक निर्दिष्ट न केल्यास, ते एक अनियंत्रित स्वरूप तयार करते.

3. मसुदा तयार करा. AI तुम्ही प्रदान केलेल्या माहितीवरून शीर्षक, जबाबदारीचे विधान, प्रकाशन माहिती आणि विषय प्रस्तावाचा मसुदा तयार करते.

4. अधिकार नियंत्रण व्यायाम. अधिकृत रेकॉर्ड म्हणजे लेखकाचे नाव, संस्था किंवा विषय (उदा., "अतातुर्क, मुस्तफा केमाल, 1881-1938") यांचे एकल, मानक स्वरूप स्थापित करते. AI वेगवेगळ्या प्रकारे नाव लिहू शकते; तुम्ही मान्यताप्राप्त प्राधिकरणाचे स्वरूप तपासा आणि दुरुस्त करा.

5. सत्यापित करा आणि पुष्टी करा. प्रत्येक फील्डची मूळ स्त्रोताशी तुलना करा. विशेषतः, प्रकाशन वर्ष, ISBN आणि लेखकाचे नाव यासारखी अचूक माहिती AI द्वारे बनावट असण्याची शक्यता असते.

इशारा: AI ला स्त्रोताच्या वास्तविक क्रेडिट पृष्ठाचा फोटो किंवा मजकूर द्या; "पुस्तकाच्या नावाचा अंदाज लावा" असे म्हणू नका. भविष्यसूचक मेटाडेटा कॅटलॉगची विश्वासार्हता कमी करते. AI अंदाज बांधताना आत्मविश्वासाने लिहिते आणि यामुळे तुमची दिशाभूल होईल.

नियंत्रित शब्दसंग्रह आणि सातत्य

सुसंगतता कॅटलॉगिंगमध्ये सर्वकाही आहे. जर समान विषय दोन भिन्न शब्दांसह दोन भिन्न रेकॉर्डमध्ये लिहिला असेल तर वापरकर्त्याला एक सापडेल आणि दुसरी चुकेल. म्हणूनच लायब्ररी नियंत्रित शब्दसंग्रह वापरतात — मान्यताप्राप्त, अटींची मानक सूची. विनामूल्य मजकूरातून अटी सुचवताना, AI या सूचीतील अधिकृत संज्ञाऐवजी त्याचे बोलचाल समतुल्य निवडू शकते. उदाहरणार्थ, एआय कदाचित "हृदयविकाराचा झटका" लिहू शकेल; तर मंजूर शब्द "मायोकार्डियल इन्फेक्शन" असू शकतो.

AI ला नियंत्रित शब्दसंग्रह देणे आणि "या सूचीमधून फक्त निवडा" असे म्हणणे हा उपाय आहे. त्यामुळे मोकळेपणाने अटी बनवण्याऐवजी, AI मान्यताप्राप्त यादीतील सर्वात योग्यतेशी जुळते.

खबरदारी: AI द्वारे सुचविलेले विषय हे नियंत्रित शब्दसंग्रहात नसल्यास, तो शब्द कॅटलॉगमध्ये जोडू नका. नवीन अटी जोडण्याचा निर्णय प्राधिकरण व्यवस्थापनासाठी जबाबदार असलेल्या तज्ञावर अवलंबून आहे; अनियंत्रित अटी जोडल्याने कॅटलॉगची सुसंगतता बाधित होते.

तीन लहान प्रकरणे

प्रकरण 1 — देणगी संकलनाला वेग आला. सार्वजनिक वाचनालयाला 1,200 पुस्तकांची देणगी मिळाली. कॅटलॉगिंग तज्ञाने एआयने प्रत्येक पुस्तकाचे छाप पृष्ठ वाचले आणि डब्लिन कोरचा मसुदा तयार केला; प्रति रेकॉर्डिंग वेळ 9 मिनिटांपासून 3.5 मिनिटांपर्यंत कमी झाला. तज्ञाने उर्वरित वेळ अधिकार तपासणी आणि पडताळणीसाठी समर्पित केला; एकूण वेळ अंदाजे 55% ने कमी करण्यात आला, परंतु कोणत्याही रेकॉर्डची पडताळणी केल्याशिवाय सिस्टममध्ये प्रवेश केला नाही.

प्रकरण 2 - बनावट ISBN पकडला गेला. एका तज्ञाने AI ने 30 पुस्तकांचे मसुदे तयार केले होते. तपासणी दरम्यान, त्याला आढळले की 4 रेकॉर्डमधील ISBN बनावट आहे: AI ने 13-अंकी क्रमांक लिहिला होता जो वाजवी वाटत होता, जरी त्याला पुस्तकाचा खरा क्रमांक माहित नसला तरीही. सत्यापन चरणाने कॅटलॉगमध्ये चार चुकीच्या ISBN ला कायम राहण्यापासून प्रतिबंधित केले.

प्रकरण 3 — प्राधिकरणाची विसंगती दुरुस्त केली. एका लायब्ररीला काही रेकॉर्डमध्ये "जे. स्मिथ", इतरांमध्ये "जॉन स्मिथ", इतरांमध्ये "स्मिथ, जॉन" असे लेखक आढळले. AI अधिकृत फाइलशी जुळले, सर्व रेकॉर्ड एकाच मंजूर स्वरूपात आणले ("स्मिथ, जॉन, 1965-"); जर हे काम मॅन्युअली केले गेले तर यास दिवस लागतील, परंतु एआयच्या सूचनेमुळे ते काही तासांवर कमी केले गेले, परंतु प्रत्येक सामन्याला तज्ञांनी मान्यता दिली.

पूर्वलक्षी रूपांतरण आणि जुन्या नोंदी

बऱ्याच लायब्ररींमध्ये अपूर्ण किंवा कालबाह्य नोंदी आहेत ज्या वेगवेगळ्या नियमांसह वर्षापूर्वी प्रविष्ट केल्या गेल्या होत्या. याला सध्याच्या मानकांमध्ये हलवण्याला पूर्वलक्ष्यी रूपांतरण म्हणतात आणि ते स्वहस्ते केले जाते तेव्हा ते खूप कष्टदायक असते. एआय जुने रेकॉर्ड वाचू शकते आणि सध्याच्या फील्ड स्ट्रक्चरमध्ये हलविण्यासाठी मसुदा तयार करू शकते: उदाहरणार्थ, ते फ्री-टेक्स्ट उद्धरण पार्स करू शकते आणि योग्य फील्डमध्ये वितरित करू शकते. तथापि, येथे दोन धोके आहेत. प्रथम, एआय "मेक अप" करण्यासाठी गहाळ माहिती तयार करू शकते; दुसरे, जुन्या रेकॉर्डमध्ये त्रुटी सुधारण्याऐवजी नवीन फॉरमॅटमध्ये कॉपी करून ती कायम ठेवू शकते. म्हणून, पूर्वलक्ष्यी परिवर्तनामध्ये, AI चे आउटपुट पद्धतशीरपणे तपासले पाहिजे, नमुनेद्वारे नव्हे, तर गंभीर फील्ड (लेखक, वर्ष, संख्या ओळखणे). एक चांगला सराव म्हणजे रूपांतरणपूर्व आणि नंतरचे रेकॉर्ड शेजारी शेजारी प्रदर्शित करणे, प्रत्येक बदल दृश्यमान करणे; त्यामुळे काय हलवले गेले आहे, काय बदलले आहे आणि काय बनवले गेले आहे हे तज्ञ एका दृष्टीक्षेपात पाहू शकतो.

लक्ष द्या: एआयने तयार केलेला मसुदा मेटाडेटा एकामागून एक पुनरावलोकन केल्याशिवाय बॅच म्हणून सिस्टममध्ये हस्तांतरित केला जाऊ नये. मोठ्या प्रमाणातील त्रुटी एकाच वेळी शेकडो रेकॉर्ड दूषित करते आणि पुनर्प्राप्त करणे उत्पादनापेक्षा जास्त त्रासदायक आहे. लहान बॅचमध्ये उत्पादन करणे आणि सत्यापित करणे सर्वात सुरक्षित आहे.

चार कॉपी करण्यायोग्य टेम्पलेट्स

1) डब्लिन कोर बाह्यरेखा:

तुमची भूमिका: सहाय्यक कॅटलॉगर. खालील बायलाइन मजकूरातून डब्लिन कोर फील्ड भरा: शीर्षक, निर्माता, विषय, वर्णन, प्रकाशक, तारीख, शैली, स्वरूप, भाषा. केवळ मजकूरात स्पष्ट असलेली माहिती वापरा; गहाळ फील्ड "[माहिती नाही]" सोडा, अंदाज लावू नका. छाप मजकूर: [येथे]

2) MARC फील्ड बाह्यरेखा:

खालील पुस्तकाच्या माहितीवरून खालील MARC फील्डसाठी रूपरेषा प्रस्तावित करा: 245 (शीर्षक/श्रेय), 100 (मुख्य लेखक), 260/264 (प्रकाशन), 300 (भौतिक वर्णन), 650 (विषय). तुम्हाला खात्री नसलेली कोणतीही फील्ड "[सत्यापनाची आवश्यकता आहे]" म्हणून चिन्हांकित करा. माहिती: [येथे]

3) नियंत्रित शब्दसंग्रहातून विषय जुळणे:

खाली स्त्रोताचा सारांश आणि मंजूर विषयाच्या अटींची सूची आहे. सूचीमधून स्त्रोतापर्यंत फक्त 3-5 सर्वात योग्य अटी जुळवा. सूचीमध्ये कोणतीही योग्य संज्ञा नसल्यास, "यादीत योग्य संज्ञा नाही" असे लिहा, नवीन संज्ञा बनवू नका. सारांश: [येथे] / टर्म सूची: [येथे]

4) प्राधिकरण फॉर्म नियंत्रण:

मी प्रदान केलेल्या प्राधिकरणाच्या यादीतील मंजूर फॉर्मसह खालील लेखकांची नावे जुळवा. प्रत्येक नावासाठी: रेकॉर्डमधील स्वरूप -> मंजूर स्वरूप. सूचीमध्ये समतुल्य नसल्यास, "नो ऑथॉरिटी रेकॉर्ड" लिहा. नावे: [येथे] / प्राधिकरण यादी: [येथे]

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत प्रॉम्प्ट:

खालील पुस्तकासाठी कॅटलॉगिंग माहिती काढा: "कृत्रिम बुद्धिमत्ता आणि समाज".

फक्त शीर्षक दिले आहे; AI ला लेखक, वर्ष, प्रकाशक आणि ISBN बनवण्याची सक्ती केली जाते. कोणतेही लक्ष्य मानक नाही. परिणाम: एक खात्रीशीर परंतु कदाचित खोटे रेकॉर्ड.

शक्तिशाली सूचना:

तुमची भूमिका: सहाय्यक कॅटलॉगर. खाली पुस्तकाच्या छाप पानाचा संपूर्ण मजकूर आहे. यावरून डब्लिन कोर फील्ड भरा. केवळ मजकूरात स्पष्टपणे नमूद केलेली माहिती वापरा; मजकूर नसलेले फील्ड रिक्त सोडा आणि "[माहिती नाही]" लिहा. कोणत्याही तारखा, नावे किंवा ISBN बनलेले नाहीत. छाप मजकूर: [संपूर्ण मजकूर येथे]

शक्तिशाली प्रॉम्प्ट AI ला वास्तविक बायलाइन माहितीपर्यंत मर्यादित करते आणि ते तयार करण्याऐवजी प्रामाणिकपणे रिक्त सोडण्यास भाग पाडते.

मेटाडेटा फील्ड आणि प्रमाणीकरण सारणी

क्षेत्र

फॅब्रिकेशनचा धोका

कसे सत्यापित करावे

शीर्षक

कमी

छाप पृष्ठाशी तुलना करा

लेखक/अधिकारी स्वरूप

मध्यम

प्राधिकरण फाइलमध्ये शोधा

प्रकाशन वर्ष

उच्च

छाप/कोलोफोनसह पुष्टी करा

ISBN

खूप उच्च

बारकोड/स्रोत सह वन-टू-वन नियंत्रण

विषय पद

उच्च

नियंत्रित शब्दसंग्रहात जुळवा

सामान्य चुका

  • फक्त शीर्षकावरून मेटाडेटाची विनंती करत आहे. अपूर्ण माहिती AI ला गोष्टी तयार करण्यास प्रवृत्त करते.
  • लक्ष्य मानक निर्दिष्ट करत नाही. अनियंत्रित स्वरूपन रेकॉर्डच्या सुसंवादात व्यत्यय आणते.
  • ISBN आणि वर्षाची पडताळणी न करता स्वीकारणे. या भागात फॅब्रिकेशनचा सर्वाधिक धोका असतो.
  • नियंत्रित शब्दसंग्रहाच्या बाहेरून विषय संज्ञा घेणे. सुसंगतता आणि उपलब्धता तडजोड केली आहे.
  • प्राधिकरण नियंत्रण बायपास करणे. समान लेखक वेगवेगळ्या स्वरूपात पसरतो, वापरकर्ता स्त्रोत गमावतो.

सारांशात

मेटाडेटा जनरेशनमध्ये, AI हा एक शक्तिशाली सहाय्यक आहे जो त्वरीत छाप माहिती काढतो आणि कॅटलॉगिंग वेळ लक्षणीयरीत्या कमी करतो. परंतु उत्पादकतेची किंमत ही बनावटीच्या जोखमींविरूद्ध कठोर प्रमाणीकरण आहे: लक्ष्य मानक (MARC, Dublin Core) स्पष्ट करा, AI फक्त वास्तविक उपशब्द ज्ञानाने चालवा, नियंत्रित शब्दसंग्रहांमधून विषयाच्या अटींचा नकाशा तयार करा आणि अधिकृत फॉर्म प्रमाणित करा. अंतर निर्माण करण्याऐवजी, एआयने प्रामाणिकपणे ते रिक्त सोडले पाहिजे; आपण अंतिम मान्यता ठेवा.

अर्ज कार्य

तुमच्याकडे असलेल्या वास्तविक पुस्तकाच्या छाप पृष्ठाचा मजकूर AI ला "डब्लिन कोअर ड्राफ्ट" टेम्प्लेटसह द्या आणि मसुदा मिळवा. मग तेच पुस्तक फक्त शीर्षकासह तयार केले आहे ("कमकुवत प्रॉम्प्ट") आणि दोन आउटपुटची तुलना करा: कोणती फील्ड फॅब्रिकेटेड होती? त्यानंतर, "नियंत्रित शब्दसंग्रहातून विषयाचे मॅपिंग" टेम्पलेटसह, विषय जुळण्यासाठी मंजूर पदांची एक छोटी यादी द्या आणि AI सूचीमधून बाहेर पडतो का ते तपासा.

चेकलिस्ट

  • [ ] मी AI ला स्त्रोताची खरी ओळख माहिती दिली, मी ती अंदाज लावण्यावर सोडली नाही.
  • [ ] मी लक्ष्य मेटाडेटा मानक (MARC/Dublin Core) स्पष्टपणे नमूद केले आहे.
  • [ ] मी मूळ स्त्रोतासह प्रकाशन वर्ष आणि ISBN शब्दशः पडताळले आहे.
  • [ ] मी नियंत्रित शब्दसंग्रहातून विषयाच्या संज्ञा मॅप केल्या आहेत.
  • [ ] मी मान्यताप्राप्त रेकॉर्डसह प्राधिकरणाच्या स्वरूपाची पुष्टी केली आहे.