युनिट्स
1. ग्रंथपाल आणि माहिती व्यवस्थापनातील कृत्रिम बुद्धिमत्तेचा परिचय: भूमिका, सीमा, प्रमाणीकरण, गोपनीयता आणि नैतिकता 2. कॅटलॉगिंग आणि मेटाडेटा जनरेशनमध्ये कृत्रिम बुद्धिमत्ता 3. विषय विश्लेषण, वर्गीकरण आणि स्वयंचलित अनुक्रमणिका 4. सिमेंटिक शोध आणि शोध प्रणाली 5. शिफारस प्रणाली आणि वैयक्तिकृत संसाधन शिफारस 6. डिजिटल आर्काइव्ह, डिजिटायझेशन, ओसीआर आणि दीर्घकालीन संरक्षण 7. वापरकर्ता सेवा, द्वारपाल आणि चॅट बॉट्स 8. बिब्लियोमेट्रिक्स, उद्धरण विश्लेषण आणि संशोधन प्रभाव मूल्यांकन 9. RAG सह एंटरप्राइझ माहिती व्यवस्थापन 10. स्त्रोत सत्यापन, भ्रम आणि माहिती साक्षरता 11. कॉपीराइट, गोपनीयता, नैतिकता आणि शासन
युनिट 6 / 11

डिजिटल आर्काइव्ह, डिजिटायझेशन, ओसीआर आणि दीर्घकालीन संरक्षण

नफा:

  • स्कॅन केलेले दस्तऐवज ओसीआर आणि एचटीआरसह मजकूरात रूपांतरित करून आणि आउटपुटची वास्तविक प्रतिमेशी तुलना करून दुरुस्त करण्याची क्षमता
  • संग्रहण दस्तऐवजाची मौलिकता आणि अखंडता जतन करण्याची क्षमता आणि AI ला सामग्री बदलण्यापासून आणि बनावट पुनर्संचयित करण्यापासून प्रतिबंधित करण्याची क्षमता
  • मूळ माहिती आणि टिकाऊ स्वरूपांसह दीर्घकालीन डिजिटल संरक्षणाची योजना करण्याची क्षमता

पन्नास वर्षे जुने वृत्तपत्र खंड, हस्तलिखीत पत्रे किंवा जुनी छायाचित्रे भविष्यात घेऊन जाण्याचे काम आर्किव्हिस्टला दिले जाते. ही कागदपत्रे कालांतराने झिजतात; दोन्ही जतन करण्यासाठी आणि त्यांना प्रवेशयोग्य बनवण्यासाठी, डिजिटायझेशन केले जाते: भौतिक दस्तऐवज स्कॅन करणे आणि डिजिटल कॉपीमध्ये रूपांतरित करणे. पण केवळ स्क्रीनिंग पुरेसे नाही; डिजिटल ऑब्जेक्ट शोधण्यायोग्य, वाचनीय आणि दीर्घकालीन देखभाल करण्यायोग्य असणे आवश्यक आहे. या युनिटमध्ये, तुम्ही डिजिटायझेशन, ट्रान्सक्रिप्शन आणि डिजिटल प्रिझर्वेशन वर्कफ्लोमध्ये आर्टिफिशियल इंटेलिजेंसचा वापर कसा करावा हे शिकाल; परंतु मौलिकता आणि अचूकतेची जबाबदारी तुम्ही का घ्याल हे तुम्ही शिकाल.

काही संकल्पना. OCR (ऑप्टिकल कॅरेक्टर रिकग्निशन) हे तंत्रज्ञान आहे जे दस्तऐवजाच्या प्रतिमेतील मजकूर मशीन-संपादन करण्यायोग्य मजकूरात रूपांतरित करते. HTR (हस्तलिखित मजकूर ओळख) हस्तलिखित दस्तऐवजांसाठी समान कार्य करते आणि ते अधिक कठीण आहे. फाईल फॉरमॅट अप्रचलित होत असताना आणि सॉफ्टवेअर बदलत असतानाही डिजिटल वस्तू दशकांपर्यंत वाचनीय राहतील याची खात्री करण्यासाठी डिजिटल संरक्षण हा नियोजित प्रयत्न आहे. AI तीनही क्षेत्रांमध्ये एक शक्तिशाली परंतु सदोष सहाय्यक आहे.

टप्प्याटप्प्याने: डिजिटायझेशनपासून संरक्षणापर्यंत

1. प्राधान्य द्या. तुम्ही एकाच वेळी सर्व काही डिजीटल करू शकत नाही. सर्वात नाजूक, सर्वाधिक विनंती केलेले आणि सर्वात अद्वितीय दस्तऐवज प्रथम ठेवले जातात. हा न्यायालयीन निर्णय आहे; AI सूची संपादनात मदत करते, परंतु संस्था प्राधान्य ठरवते.

2. स्कॅन करा आणि OCR/HTR लागू करा. उच्च रिझोल्यूशनवर दस्तऐवज स्कॅन करा, नंतर मजकूर काढण्यासाठी OCR किंवा HTR वापरा. AI-आधारित साधने येथे अधिक चांगली होत आहेत, अगदी जुन्या आणि कठीण मजकुरासह.

3. मजकूर दुरुस्त करा आणि सत्यापित करा. OCR/HTR आउटपुट कधीही परिपूर्ण नसते. त्रुटी सामान्य आहेत, विशेषत: जुने लेखन, डाग असलेली पृष्ठे किंवा हस्तलिखित असल्यास. आउटपुटची वास्तविक प्रतिमेशी तुलना करणे आणि ते दुरुस्त करणे आवश्यक आहे.

4. मेटाडेटा आणि संरक्षण माहिती जोडा. डिजिटल ऑब्जेक्टमध्ये त्याचे मूळ, स्कॅनिंग अटी, स्वरूप माहिती आणि उद्गम - जोडा - दस्तऐवज कोठून आला आणि त्यावर प्रक्रिया कशी केली गेली. ही माहिती भविष्यातील पडताळणी आणि संरक्षणासाठी महत्त्वपूर्ण आहे.

5. दीर्घकालीन संरक्षणाची योजना करा. उघडे, सामान्य आणि टिकाऊ फाइल स्वरूप निवडा; बॅक अप; फॉरमॅट अप्रचलित झाल्यास स्थलांतर योजना बनवा.

टीप: OCR आउटपुट "क्लीअर टेक्स्ट" म्हणून स्वीकारू नका. जर शोध प्रणाली या मजकूराद्वारे कार्य करत असेल, तर चुकीच्या पद्धतीने ओळखले जाणारे शब्द स्त्रोत सापडणार नाहीत. गंभीर संग्रहांसाठी, मानवी डोळ्यासाठी ओसीआर आउटपुट दुरुस्त केल्याने त्यानंतरच्या सर्व प्रवेशाची गुणवत्ता निर्धारित केली जाते.

डिजिटल ऑब्जेक्टची सत्यता आणि अखंडता

अभिलेखीय कार्याच्या केंद्रस्थानी सत्यता आणि अखंडता आहे: दस्तऐवज खरोखर दावा केलेल्या स्त्रोताकडून आला आहे आणि त्यातील सामग्री बदलली गेली नाही याची खात्री. या टप्प्यावर, AI एक द्वि-पक्षीय धोका निर्माण करतो. प्रथम, OCR/HTR सुधारणा किंवा “वर्धन” दरम्यान, AI शांतपणे मजकूर सुधारू शकतो; "सुधारणा" नावाखाली अस्तित्वात नसलेला शब्द जोडू शकतो. दुसरे, AI सह प्रतिमा "दुरुस्ती" किंवा "पुनर्स्थापना" केली असल्यास, मूळ नसलेले तपशील तयार केले जाऊ शकतात.

आर्काइव्हिस्टचा नियम स्पष्ट आहे: डिजिटल प्रीझर्व्हेशन कॉपी मूळशी विश्वासू असणे आवश्यक आहे. AI सह केलेल्या प्रत्येक सुधारणांचे दस्तऐवजीकरण केले जावे आणि वास्तविक (कच्चे) स्कॅन नेहमी जतन केले जावे. दस्तऐवज "सुशोभित करणे" त्याचे ऐतिहासिक पुरावे मूल्य नष्ट करू शकते.

खबरदारी: AI सह जुना फोटो किंवा दस्तऐवज "सुधारणा" करण्याचा मोह होऊ शकतो; पण AI गहाळ भाग तयार करून भरते. अभिलेखीय दस्तऐवजात, याचा अर्थ खोटा ऐतिहासिक पुरावा तयार करणे. पुनर्संचयित आउटपुट कधीही मूळ स्त्रोताची जागा घेत नाही; वेगळे, स्पष्टपणे लेबल केलेले प्रकार म्हणून संग्रहित केले आहे.

तीन लहान प्रकरणे

प्रकरण 1 - वृत्तपत्र संग्रहण शोधण्यायोग्य झाले. एका लायब्ररीने स्थानिक वर्तमानपत्रांचा 30 वर्षांचा संग्रह डिजीटल केला आहे. OCR सह, 90,000 पृष्ठे लिप्यंतरित केली गेली आणि शोधण्यायोग्य केली गेली; विषय शोध ज्याला पूर्वी दिवस लागत होते ते आता सेकंदात कमी केले आहे. तथापि, संघाच्या लक्षात आले की जुन्या आणि डागलेल्या पृष्ठांवर OCR अचूकता 80% पर्यंत घसरली आणि मानवी डोळ्यांसह शीर्ष वर्ष दुरुस्त करण्यास प्राधान्य दिले.

केस 2 - HTR ने हस्तलिखित उघडले. एका संग्रहाने 19व्या शतकातील वाचण्यास कठीण पत्रांच्या संग्रहावर HTR लागू केले. तज्ञांच्या वाचनाच्या महिन्यांनुसार प्रणालीला प्रचंड गती मिळाली; परंतु प्रिंटआउटच्या प्रत्येक पानाची तुलना तज्ञ पॅलिओग्राफरने (प्राचीन लेखनातील तज्ञ) मूळशी केली कारण लोकांच्या आणि ठिकाणांच्या नावांमध्ये त्रुटी होत्या.

केस 3 - बनावट "पुनर्स्थापना" नाकारली. एका टीमने AI सह फाटलेल्या ऐतिहासिक छायाचित्राची "दुरुस्ती" करण्याचा विचार केला. AI ने चेहऱ्याचे हरवलेले भाग फिट करून पूर्ण केले. या बनावट तपशिलांमुळे ऐतिहासिक पुराव्यांचा विपर्यास होईल हे आर्काइव्हिस्टच्या लक्षात आले; दुरुस्त केलेली प्रतिमा मूळच्या बाजूने स्वतंत्रपणे संग्रहित केली गेली होती, फक्त स्पष्टपणे "AI व्युत्पन्न" असे लेबल केलेले.

प्रवेश प्रत, जतन कॉपी आणि स्वरूप निर्णय

डिजिटायझेशनचा एक चांगला सराव म्हणजे एकाच वस्तूच्या प्रती वेगवेगळ्या उद्देशांसाठी वेगळ्या करणे. प्रिझर्वेशन मास्टर ही वास्तविक डिजिटल ऑब्जेक्ट आहे जी भविष्यात नेली जाणार आहे, उच्च रिझोल्यूशनमध्ये, असंपीडित किंवा लॉसलेस फॉरमॅटमध्ये संग्रहित केली जाते; त्याला क्वचितच स्पर्श केला जातो. प्रवेश प्रत वापरकर्त्याला सादर केलेली एक लहान, सहज उघडता येणारी आवृत्ती आहे. हा फरक महत्त्वाचा आहे कारण वापरासाठी व्यावहारिक स्वरूपाचे स्वरूप (लहान, संकुचित) दीर्घकालीन संरक्षणासाठी योग्य असू शकत नाही; जतन करण्यासाठी आदर्श स्वरूप (मोठे, दोषरहित) दैनंदिन वापरासाठी अवजड आहे. या वर्कफ्लोमध्ये, AI फायलींची यादी तयार करण्यात, गहाळ रूपे शोधण्यात आणि मेटाडेटा दोन प्रतींमध्ये सुसंगत ठेवण्यात मदत करू शकते. तथापि, फॉरमॅटची निवड हा एक संरक्षणाचा निर्णय आहे: खुले, व्यापकपणे दस्तऐवजीकरण केलेले आणि टिकाऊ स्वरूपनास प्राधान्य दिले पाहिजे (मालकीच्या, बंद स्वरूपांच्या ऐवजी), आणि स्वरूपन कालांतराने अप्रचलित झाल्यास एक स्थलांतर योजना तयार ठेवावी. जरी AI ने स्वरूप सुचवले तरी, संस्थेच्या दीर्घकालीन संरक्षण धोरणाला अंतिम म्हणणे आहे.

टीप: प्रत्येक डिजिटल ऑब्जेक्टसाठी, "मूळ स्त्रोत कोठे आहे, प्रीझर्व्हेशन कॉपी कोणत्या फॉरमॅटमध्ये आहे, ऍक्सेस कॉपी कोणत्या फॉरमॅटमध्ये आहे आणि वापरकर्त्याला कोणती उपलब्ध करून दिली आहे?" या प्रश्नांची उत्तरे देणारी एक संक्षिप्त नोंद ठेवा. या तीन स्तरांचे मिश्रण केल्याने हे स्पष्ट होत नाही की कोणती फाईल विश्वासू मास्टर आहे.

चार कॉपी करण्यायोग्य टेम्पलेट्स

1) OCR आउटपुट सुधारणा मदत:

खाली एक OCR मजकूर आणि वास्तविक पृष्ठाचे वर्णन आहे. फक्त ओपनओसीआर त्रुटी (खराब वर्ण, मिश्र/विभाजित शब्द) दुरुस्त करा. सामग्री बदलू नका, शब्द जोडा किंवा काढू नका. तुम्हाला खात्री नसल्यास, "[?]" ने चिन्हांकित करा. OCR मजकूर: [येथे]

२) मजकूर-प्रतिमा सुसंगतता तपासणी:

खालील दुरुस्त केलेल्या मजकुरात मूळ दस्तऐवजात (जे कदाचित तयार केले गेले असावे) अपेक्षित नव्हते असे काही जोडले आहेत का? प्रत्येक संशयास्पद भाग चिन्हांकित करा आणि तो का संशयास्पद आहे ते लिहा. मजकूर: [येथे]

3) संरक्षण मेटाडेटा मसुदा:

खालील डिजीटाइज्ड ऑब्जेक्टसाठी परिरक्षण मेटाडेटा बाह्यरेखा व्युत्पन्न करा: स्त्रोत, मूळ, स्कॅन तारीख/रिझोल्यूशन, फाइल स्वरूप, व्यवहार इतिहास. फक्त मी दिलेली माहिती वापरा, गहाळ फील्ड रिक्त सोडा. माहिती: [येथे]

4) प्राधान्य मदत:

खाली डिजिटायझेशनच्या प्रतीक्षेत असलेल्या संग्रहांची यादी आहे; नाजूकपणा, मागणी आणि विशिष्टतेच्या आधारे प्राधान्य देण्यात मदत करा. प्रत्येक संसाधनासाठी संक्षिप्त औचित्य द्या; अंतिम निर्णय माझ्यावर सोडा. यादी: [येथे]

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत प्रॉम्प्ट:

हा स्कॅन केलेला मजकूर दुरुस्त करा आणि सुशोभित करा.

“सुशोभित करा” एआयला सामग्री बदलण्यासाठी, चुकांची पूर्तता करण्यासाठी आमंत्रित करते; संग्रहण दस्तऐवजाची मौलिकता खराब झाली आहे.

शक्तिशाली सूचना:

तुमची भूमिका: डिजिटायझेशन संपादक सहाय्यक. खालील OCR मजकूरात, केवळ स्पष्ट ओळख त्रुटी (खराब वर्ण, चुकीचा शब्द विभाजित) दुरुस्त करा. कोणतेही शब्द जोडू नका, काढू नका किंवा बदलू नका. जिथे तुम्हाला खात्री नसेल तिथे "[?]" सोडा. तुम्ही केलेली प्रत्येक सुधारणा वेगळ्या सूचीमध्ये दाखवा. मजकूर: [येथे]

शक्तिशाली प्रॉम्प्ट AI ला फक्त त्रुटी ओळखण्यापुरते मर्यादित करते, सामग्रीला स्पर्श करण्यापासून प्रतिबंधित करते आणि सुधारणा शोधण्यायोग्य बनवते.

कार्यप्रवाह आणि जोखीम सारणी

स्टेज

AI चे योगदान

मुख्य धोका

संरक्षण उपाय

स्कॅन

-

खराब गुणवत्ता

उच्च रिझोल्यूशन

OCR/HTR

मजकूरात रूपांतरित करा

ओळख त्रुटी

मानवी सुधारणा

सुधारणा

त्रुटी सूचना

सामग्री बदलत आहे

मूळ सह तुलना

जीर्णोद्धार

प्रतिमा व्युत्पन्न

समर्पक तपशील

कच्चे मूळ ठेवा, लेबल करा

संरक्षण

मेटाडेटा मसुदा

उत्पत्तीचे नुकसान

उद्गम रेकॉर्ड

सामान्य चुका

  • सुधारणा न करता OCR आउटपुट स्वीकारणे. त्रुटी शोध आणि प्रवेशामध्ये व्यत्यय आणतात.
  • एआयला "सुंदर बनवा" असे म्हणणे. ते सामग्री बदलते आणि मौलिकता नष्ट करते.
  • वास्तविक पुराव्यासाठी AI पुनर्संचयित करणे. बनावट तपशील खोटा इतिहास तयार करतात.
  • कच्चा स्कॅन संचयित करत नाही. मूळ शिवाय कोणतीही दुरुस्ती तपासली जाऊ शकत नाही.
  • मूळ माहिती वगळणे. दस्तऐवजाची विश्वासार्हता सापडत नाही.

सारांशात

डिजिटल आर्काइव्ह आणि डिजिटायझेशनमध्ये एआय; ही एक मौल्यवान मदत आहे जी OCR/HTR ट्रान्सक्रिप्शन, मेटाडेटा ड्राफ्टिंग आणि प्राधान्यक्रमाला गती देते. परंतु अभिलेखीय कार्याचे सार हे सत्यता आणि अखंडता आहे: OCR आउटपुट मानवी डोळ्याद्वारे दुरुस्त केले पाहिजे, AI ने कधीही शांतपणे सामग्री बदलू नये, पुनर्संचयित डेरिव्हेटिव्ह्जने मूळ पुराव्याची जागा घेऊ नये आणि कच्ची स्कॅनिंग आणि मूळ माहिती नेहमी जतन केली पाहिजे. एआय एक साधन म्हणून वापरा जे दस्तऐवज "सुधारणा" करत नाही, परंतु त्यामध्ये सत्य राहून ते प्रवेशयोग्य बनवते.

अर्ज कार्य

OCR आउटपुटचा एक छोटा नमुना मिळवा (एकतर तुमचे स्वतःचे उत्पादन किंवा प्रत्यक्ष स्कॅनमधून). "OCR आउटपुट सुधारणा मदत" टेम्प्लेटसह फक्त ओळख त्रुटी दुरुस्त करा, नंतर AI ने "मजकूर-प्रतिमा सुसंगतता तपासणी" टेम्पलेटसह सामग्री जोडली आहे का ते तपासा. नंतर "प्रिझर्वेशन मेटाडेटा मसुदा" टेम्प्लेटसह ऑब्जेक्टसाठी मूळ आणि स्वरूप माहितीसह रेकॉर्ड तयार करा.

चेकलिस्ट

  • [ ] मी OCR/HTR आउटपुटची वास्तविक प्रतिमेशी तुलना केली आणि ती दुरुस्त केली.
  • [] मी तपासले आहे की AI सामग्री जोडत/बदलत नाही.
  • [ ] मी कच्चे (मास्टर) स्कॅन वेगळे आणि न बदललेले ठेवले.
  • [ ] मी मेटाडेटामध्ये मूळ आणि स्वरूप माहिती जोडली आहे.
  • [ ] मी पुनर्संचयित प्रकारांना "AI व्युत्पन्न" असे स्पष्टपणे लेबल केले आहे.