इकाइयाँ
1. इतिहास और पुरालेख में कृत्रिम बुद्धिमत्ता का परिचय: भूमिकाएँ, सीमाएँ, मान्यता और नैतिकता 2. दस्तावेज़ डिजिटलीकरण और ओसीआर: मुद्रित पाठ को मशीन पाठ में परिवर्तित करना 3. प्रतिलेखन: तुर्क तुर्की और पांडुलिपियाँ 4. मेटाडेटा, कैटलॉगिंग और वर्गीकरण 5. स्रोत स्कैनिंग, खोज और सारांशीकरण 6. ऐतिहासिक अनुवाद और सरलीकरण 7. स्रोत सत्यापन, कालानुक्रमिकता, और मतिभ्रम 8. सामग्री विश्लेषण और पैटर्न खोज 9. पुरालेख पहुंच, विवरण और उपयोगकर्ता सेवाएँ 10. संरक्षण, पुनर्स्थापन और डिजिटल संरक्षण 11. नैतिकता, कॉपीराइट, गोपनीयता और सांस्कृतिक संवेदनशीलता 12. एंड-टू-एंड प्रोजेक्ट: आर्टिफिशियल इंटेलिजेंस के साथ एक पुरालेख संग्रह का प्रसंस्करण
इकाई 2 / 12

दस्तावेज़ डिजिटलीकरण और ओसीआर: मुद्रित पाठ को मशीन पाठ में परिवर्तित करना

लाभ:

  • चरण दर चरण डिजिटलीकरण और ओसीआर वर्कफ़्लो (स्कैनिंग, प्री-प्रोसेसिंग, पहचान, सुधार, सत्यापन) स्थापित करने की क्षमता
  • संदर्भ के साथ ओसीआर त्रुटियों को ठीक करने के लिए एआई का उपयोग करने की क्षमता, सुधार को बनाए रखने और लाइन को फिर से लिखने और अस्पष्टता को [?] के साथ चिह्नित करने की क्षमता
  • समझें कि संख्याओं, तिथियों और उचित नामों को दृष्टिगत रूप से सत्यापित क्यों किया जाना चाहिए और गुणवत्ता नियंत्रण की भूमिका क्या है।

किसी संग्रह या पुस्तकालय की भौतिक अलमारियों पर लाखों पृष्ठ वास्तव में शोधकर्ता के लिए तभी खुलते हैं जब वे डिजिटलीकृत और खोजने योग्य हो जाते हैं। डिजिटलीकरण एक भौतिक दस्तावेज़ को स्कैन या फोटो खींचकर डिजिटल छवि में परिवर्तित करना है। लेकिन किसी पृष्ठ की तस्वीर अभी तक "पाठ" नहीं है; कंप्यूटर के लिए यह अभी भी एक छवि है, आप इसमें खोज नहीं सकते। यहीं पर OCR काम आता है।

ओसीआर (ऑप्टिकल कैरेक्टर रिकॉग्निशन) एक ऐसी तकनीक है जो दस्तावेज़ छवि में मुद्रित अक्षरों को पहचानती है और उन्हें मशीन-पठनीय, खोजने योग्य पाठ में परिवर्तित करती है। इस इकाई में, आप सीखेंगे कि ओसीआर के साथ ऐतिहासिक मुद्रित दस्तावेजों को डिजिटल कैसे बनाया जाए, एआई इस प्रक्रिया में ओसीआर त्रुटियों को ठीक करने में कैसे मदद करता है, और मानव आंख कहां आवश्यक है। (हस्तलिखित ग्रंथों के लिए एक अलग तकनीक की आवश्यकता होती है; हम इसे अगली इकाई में कवर करेंगे।)

डिजिटलीकरण वर्कफ़्लो: चरण दर चरण

1. तैयारी और स्क्रीनिंग. दस्तावेज़ को यथासंभव उच्चतम गुणवत्ता पर स्कैन करें। ऐतिहासिक शोध के लिए सामान्य नियम कम से कम 300-400 डीपीआई (डॉट्स प्रति इंच) का रिज़ॉल्यूशन है। कम रिज़ॉल्यूशन बाद के ओसीआर चरण में त्रुटि दर को आसमान छूता है।

2. छवि प्रीप्रोसेसिंग। ओसीआर से पहले छवि में सुधार करने से सफलता काफी बढ़ जाती है: स्कैन किए गए पृष्ठ को डेस्क-क्यू करना, दोषों को हटाना, कंट्रास्ट बढ़ाना, काले और सफेद में परिवर्तित करना। आधुनिक एआई-आधारित उपकरण इस चरण को स्वचालित कर सकते हैं।

3. ओसीआर आवेदन। आप छवि को OCR इंजन में फ़ीड करते हैं; इंजन अक्षरों को पहचानता है और टेक्स्ट उत्पन्न करता है। आउटपुट में आमतौर पर दो परतें होती हैं: दृश्यमान दस्तावेज़ छवि और नीचे एक "खोज योग्य छिपी हुई पाठ परत"।

4. सुधार (सुधार के बाद)। रॉ ओसीआर आउटपुट कभी भी सही नहीं होता है। पुराने फॉन्ट, पीले कागज, स्याही का धब्बा और स्कैनिंग त्रुटियों के कारण अक्षर गलत ढंग से पढ़े जाते हैं। यहीं पर एआई एक शक्तिशाली सहायक है: यह संदर्भ का उपयोग करके ओसीआर त्रुटियों का सुझाव देता है और उन्हें ठीक करता है।

5. सत्यापन और गुणवत्ता नियंत्रण। संशोधित पाठ को मानव द्वारा नमूना आधार पर या पूरी तरह से जांचा जाता है। विशेष रूप से महत्वपूर्ण क्षेत्र जैसे नाम, दिनांक और संख्या को दृष्टिगत रूप से सत्यापित किया जाना चाहिए।

OCR गलतियाँ क्यों करता है, AI कैसे मदद करता है

विशिष्ट समस्याएं जो ऐतिहासिक दस्तावेज़ों में ओसीआर को चुनौती देती हैं: पुराने और फैंसी फ़ॉन्ट, अप्रचलित अक्षर प्रारूप जैसे लंबे "एस" (ſ), दो-स्तंभ पृष्ठ लेआउट, फ़ुटनोट, हस्तलिखित आवेषण, मुहरें, और फीकी स्याही। क्योंकि एक ओसीआर इंजन अक्षरों को एक-एक करके "देखता" है, यह अक्सर बाइनरी "आरएन" को "एम", अक्षर "एल" को संख्या "1" के रूप में, और अक्षर "ओ" को "0" के रूप में भ्रमित करता है।

एआई भाषा मॉडल यहां एक अलग शक्ति प्रदान करते हैं: वे संदर्भ को समझते हैं। यदि OCR इंजन ने "1stanbu1" लिखा है, तो AI इस संदर्भ से अनुमान लगा सकता है कि यह "इस्तांबुल" होना चाहिए। लेकिन यहां एक बड़ा खतरा है: एआई को "सही" करने पर टेक्स्ट भी बदल सकता है। वह किसी गैर-मौजूद शब्द को "मैंने ठीक कर दिया" जोड़ सकता है या किसी अस्पष्ट स्थान को अपने अनुमान से भर सकता है। इससे प्रतिलेखन की निष्ठा बाधित होती है।

सावधानी: ओसीआर सुधार में सुनहरा नियम यह है: एआई को केवल स्पष्ट पहचान त्रुटियों को ठीक करना चाहिए, पाठ की सामग्री की व्याख्या या पूरक नहीं करना चाहिए। "1stanbu1 → इस्तांबुल" वैध है; यह किसी अपठनीय शब्द को अनुमानों से भरने के बारे में नहीं है। अनिश्चित स्थानों को [?] से चिह्नित किया जाना चाहिए और नहीं बनाया जाना चाहिए।

ओसीआर त्रुटि प्रकार और तालिका के साथ दृष्टिकोण

त्रुटि प्रकार

उदाहरण

क्या AI इसे ठीक कर सकता है?

मानव नियंत्रण

चरित्र मिश्रण

rn↔m, l↔1, O↔0

हाँ, यह सुरक्षित है

नमूना

पुराना पत्र प्रपत्र

लंबा ſ → एस

हाँ, यह सुरक्षित है

नमूना

फीका/अपठनीय शब्द

"का___एन"

नहीं, लगाना चाहिए [?]

अनिवार्य

उचित नाम/स्थान का नाम

"कॉन्स्टेंटिनीये"

सावधान

अनिवार्य

क्रमांक/तारीख

"1867" बनाम "1857"

जोखिम भरा

अनिवार्य

पेज लेआउट (कॉलम/फुटनोट)

मिश्रित प्रवाह

आंशिक रूप से

अनिवार्य

चित्र को एक वाक्य में संक्षेप में प्रस्तुत करने के लिए: एआई सामान्य चरित्र त्रुटियों को विश्वसनीय रूप से साफ़ करता है; परन्तु विशेष नामों, अंकों, तिथियों तथा अपठनीय स्थानों के लिए मनुष्य की आँखों की आवश्यकता होती है।

तीन मिनी मामले

केस 1 - समाचार पत्र पुरालेख खोजने योग्य हो गए। एक विश्वविद्यालय पुस्तकालय ने 1930 के दशक के स्थानीय समाचार पत्रों के 12,000 पृष्ठों को डिजिटल कर दिया है। रॉ ओसीआर सटीकता अनुमानित 82% थी (प्रत्येक 100 वर्णों में से 18 गलत थे)। एआई-आधारित सुधार ने अखबार की भाषा-उपयुक्त शब्दकोश और संदर्भ के साथ सटीकता को 96% तक बढ़ा दिया। शेष त्रुटियों के लिए, पूर्ण पाठ के बजाय एक नमूना जाँच की गई; यह संग्रह 3 सप्ताह में खोजने योग्य हो गया।

केस 2 - एआई ने "सही" किया और इतिहास को विकृत किया। एक पुरालेखपाल ने एआई से ओसीआर प्रिंटआउट पर "1863" तारीख को सही कर दिया था। एआई ने संदर्भ में एक अन्य घटना को देखकर तारीख को "सही" करके "1868" कर दिया - भले ही दस्तावेज़ में स्पष्ट रूप से 1863 कहा गया हो। यदि पुरालेखपाल ने मूल छवि को नहीं देखा होता, तो कैटलॉग गलत तारीख के साथ दर्ज हुआ होता। पाठ: संख्याओं और तारीखों को कभी भी एआई पर नहीं छोड़ा जाता है, उन्हें छवि से सत्यापित किया जाता है।

केस 3 - दो कॉलम वाला पेज भ्रमित। 19वीं सदी की सालाना किताब के दो-स्तंभ वाले पन्नों को ओसीआर में एक ही धारा में मिला दिया गया और वाक्यों को आपस में जोड़ दिया गया। कच्चा आउटपुट अपठनीय था. जब मैंने पहली बार पृष्ठ लेआउट को क्षेत्रों (विभाजन) में विभाजित किया और प्रत्येक कॉलम को अलग से संसाधित किया तो पाठ में सुधार हुआ। पाठ: जटिल पृष्ठ लेआउट में, संरचना पहले, पाठ दूसरा।

चार प्रतिलिपि योग्य टेम्पलेट

1) सुरक्षित ओसीआर सुधार:

नीचे एक ऐतिहासिक दस्तावेज़ का कच्चा OCR आउटपुट दिया गया है। आपका कार्य केवल स्पष्ट ऑप्टिकल पहचान त्रुटियों को ठीक करना है (उदाहरण के लिए rn→m,1→l, 0→O, long ſ→s)। नियम: (1) पाठ का अर्थ स्पष्ट करें। (2) अपठनीय/अस्पष्ट शब्दों को ठीक करें, ज्यों का त्यों छोड़ें तथा [?] से चिह्नित करें। (3) वाक्यों को जोड़ना, हटाना या पूरा करना नहीं। (4) संख्याएँ और तारीखें बदलें; संदेह होने पर [नंबर?] चिह्नित करें। रॉ ओसीआर: [यहां]

2) ओसीआर गुणवत्ता रिपोर्ट:

नीचे ओसीआर आउटपुट की जांच करें और एक गुणवत्ता रिपोर्ट तैयार करें: (1) संभावित पहचान त्रुटियों वाले शब्दों की सूची बनाएं, (2) उन क्षेत्रों को चिह्नित करें जो अपठनीय/अस्पष्ट दिखाई देते हैं, (3) विशिष्ट नामों, तिथियों और संख्याओं की सूची बनाएं जिन्हें मानव जांच की आवश्यकता है। सही मत करो; केवल चेकलिस्ट बनाएं। पाठ: [यहां]

3) कॉलम/संरचना पार्सिंग सहायता:

चूँकि नीचे दिया गया ओसीआर पाठ दो-स्तंभ वाले पृष्ठ से आता है, इसलिए प्रवाह भ्रमित हो सकता है। पाठ को तार्किक अनुच्छेदों में पुनर्व्यवस्थित करें लेकिन कोई भी शब्द न बदलें, न जोड़ें या हटाएँ। बस आदेश ठीक करें. जिस ऑर्डर के बारे में आप निश्चित नहीं हैं उसे [ऑर्डर?] से चिह्नित करें। पाठ: [यहाँ]

4) मानक भाषा में सामान्यीकरण (वैकल्पिक, अलग परत):

नीचे दिए गए संशोधित ऐतिहासिक पाठ के ऊपर, एक अलग कॉलम में, आज की वर्तनी में एक सरलीकृत पठन संस्करण तैयार करें। मूल पाठ में कभी भी परिवर्तन न करें; सरलीकरण को एक अलग परत होने दें। बिना अर्थ जोड़े बस वर्तनी/उच्चारण अपडेट करें। मूल: [यहां]

कमजोर संकेत/मजबूत संकेत

कमज़ोर:

इस ओसीआर टेक्स्ट को सही और सुशोभित करें।

"सुंदरीकरण" एआई को पाठ को फिर से लिखने, चूक करने और सामग्री की व्याख्या करने की अनुमति देता है; वफ़ादारी तोड़ता है.

मजबूत:

इस कच्चे OCR आउटपुट में केवल ऑप्टिकल पहचान त्रुटियों को ठीक करें। अर्थ की व्याख्या न करें, शब्दों को जोड़ें/हटाएं, अपठनीय भागों को [?] के साथ छोड़ें, संख्याओं और तिथियों को बदलें। आपके द्वारा किए गए प्रत्येक सुधार को "मूल → सुधार" प्रारूप में एक अलग सूची में दिखाएं ताकि मैं इसे सत्यापित कर सकूं। पाठ: [यहाँ]

अंतर: बंधी हुई ड्यूटी, निर्माण पर रोक, अस्पष्टता को चिह्नित करना और सुधारों की पता लगाने योग्य सूची आउटपुट को ऑडिट योग्य बनाती है।

सामान्य गलतियाँ

  • कम रिज़ॉल्यूशन पर स्कैनिंग. अधिकांश OCR त्रुटियाँ ख़राब छवियों के कारण होती हैं; गुणवत्तापूर्ण स्कैनिंग सबसे सस्ता निवेश है।
  • एआई को "सुंदर बनाओ" कहना। इससे निष्ठा के बजाय प्रवाह उत्पन्न होता है; दस्तावेज़ पुनः लिखा गया है.
  • संख्याओं और तारीखों को एआई पर छोड़ रहा हूं। संदर्भ से "सही" करने पर ये चुपचाप भ्रष्ट हो जाते हैं; छवि द्वारा सत्यापित किया जाना चाहिए.
  • अपठनीय क्षेत्र को अनुमान से भरना। इसे अनिश्चितता से संरक्षित किया जाना चाहिए [?], बना हुआ नहीं।
  • सैंपलिंग के बजाय बिल्कुल भी नियंत्रण नहीं किया जा रहा है। यहां तक ​​कि 96% सटीकता का मतलब 12,000 पृष्ठों में हजारों त्रुटियां हैं; महत्वपूर्ण क्षेत्रों को स्कैन किया जाता है।

संक्षेप में

ओसीआर मुद्रित ऐतिहासिक दस्तावेजों को खोजने योग्य पाठ में परिवर्तित करके शोधकर्ताओं के लिए अभिलेखागार खोलता है। एआई संदर्भ के साथ कच्चे ओसीआर आउटपुट में चरित्र त्रुटियों को ठीक करने में एक शक्तिशाली सहायता है; लेकिन आपको संपादन और पुनर्लेखन के बीच एक रेखा खींचनी होगी। उच्च गुणवत्ता वाली स्कैनिंग, सुरक्षित सुधार निर्देश, [?] के साथ अस्पष्टता का संरक्षण, और नामों/दिनांकों/संख्याओं का मानव-आंख से सत्यापन डिजिटलीकरण को तेज़ और विश्वसनीय दोनों बनाता है। एआई टेक्स्ट साफ़ करता है; आप निष्ठा के संरक्षक हैं.

आवेदन कार्य

एक मुद्रित ऐतिहासिक दस्तावेज़ (पुराना समाचार पत्र, आधिकारिक पत्र, पुस्तक पृष्ठ) को स्कैन करें या ओसीआर प्रिंटआउट लें। पाठ को "सुरक्षित ओसीआर सुधार" टेम्पलेट के साथ ठीक करें और "मूल → सुधार" सूची के माध्यम से सुधार का अनुरोध करें। फिर, "ओसीआर गुणवत्ता रिपोर्ट" से उन क्षेत्रों को हटा दें जिनके लिए मानव नियंत्रण की आवश्यकता है। सूची में प्रत्येक दिनांक और उचित नाम की वास्तविक छवि से तुलना करें; ध्यान दें कि कितने गलत तरीके से "सही" किए गए थे।

चेकलिस्ट

  • [ ] मैंने दस्तावेज़ को कम से कम 300 डीपीआई और अच्छे कंट्रास्ट के साथ स्कैन किया।
  • [ ] मैंने एआई से केवल ऑप्टिकल त्रुटि सुधार के लिए कहा था, पुनर्लेखन के लिए नहीं।
  • [ ] मैंने अपठनीय भागों को [?] से सुरक्षित किया।
  • [ ] मैंने छवि के साथ सभी संख्याओं, तिथियों और उचित नामों को सत्यापित किया।
  • [ ] मैंने महत्वपूर्ण क्षेत्रों में एक नमूना या पूर्ण जांच की।