लाभ:
- चरण दर चरण डिजिटलीकरण और ओसीआर वर्कफ़्लो (स्कैनिंग, प्री-प्रोसेसिंग, पहचान, सुधार, सत्यापन) स्थापित करने की क्षमता
- संदर्भ के साथ ओसीआर त्रुटियों को ठीक करने के लिए एआई का उपयोग करने की क्षमता, सुधार को बनाए रखने और लाइन को फिर से लिखने और अस्पष्टता को [?] के साथ चिह्नित करने की क्षमता
- समझें कि संख्याओं, तिथियों और उचित नामों को दृष्टिगत रूप से सत्यापित क्यों किया जाना चाहिए और गुणवत्ता नियंत्रण की भूमिका क्या है।
किसी संग्रह या पुस्तकालय की भौतिक अलमारियों पर लाखों पृष्ठ वास्तव में शोधकर्ता के लिए तभी खुलते हैं जब वे डिजिटलीकृत और खोजने योग्य हो जाते हैं। डिजिटलीकरण एक भौतिक दस्तावेज़ को स्कैन या फोटो खींचकर डिजिटल छवि में परिवर्तित करना है। लेकिन किसी पृष्ठ की तस्वीर अभी तक "पाठ" नहीं है; कंप्यूटर के लिए यह अभी भी एक छवि है, आप इसमें खोज नहीं सकते। यहीं पर OCR काम आता है।
ओसीआर (ऑप्टिकल कैरेक्टर रिकॉग्निशन) एक ऐसी तकनीक है जो दस्तावेज़ छवि में मुद्रित अक्षरों को पहचानती है और उन्हें मशीन-पठनीय, खोजने योग्य पाठ में परिवर्तित करती है। इस इकाई में, आप सीखेंगे कि ओसीआर के साथ ऐतिहासिक मुद्रित दस्तावेजों को डिजिटल कैसे बनाया जाए, एआई इस प्रक्रिया में ओसीआर त्रुटियों को ठीक करने में कैसे मदद करता है, और मानव आंख कहां आवश्यक है। (हस्तलिखित ग्रंथों के लिए एक अलग तकनीक की आवश्यकता होती है; हम इसे अगली इकाई में कवर करेंगे।)
डिजिटलीकरण वर्कफ़्लो: चरण दर चरण
1. तैयारी और स्क्रीनिंग. दस्तावेज़ को यथासंभव उच्चतम गुणवत्ता पर स्कैन करें। ऐतिहासिक शोध के लिए सामान्य नियम कम से कम 300-400 डीपीआई (डॉट्स प्रति इंच) का रिज़ॉल्यूशन है। कम रिज़ॉल्यूशन बाद के ओसीआर चरण में त्रुटि दर को आसमान छूता है।
2. छवि प्रीप्रोसेसिंग। ओसीआर से पहले छवि में सुधार करने से सफलता काफी बढ़ जाती है: स्कैन किए गए पृष्ठ को डेस्क-क्यू करना, दोषों को हटाना, कंट्रास्ट बढ़ाना, काले और सफेद में परिवर्तित करना। आधुनिक एआई-आधारित उपकरण इस चरण को स्वचालित कर सकते हैं।
3. ओसीआर आवेदन। आप छवि को OCR इंजन में फ़ीड करते हैं; इंजन अक्षरों को पहचानता है और टेक्स्ट उत्पन्न करता है। आउटपुट में आमतौर पर दो परतें होती हैं: दृश्यमान दस्तावेज़ छवि और नीचे एक "खोज योग्य छिपी हुई पाठ परत"।
4. सुधार (सुधार के बाद)। रॉ ओसीआर आउटपुट कभी भी सही नहीं होता है। पुराने फॉन्ट, पीले कागज, स्याही का धब्बा और स्कैनिंग त्रुटियों के कारण अक्षर गलत ढंग से पढ़े जाते हैं। यहीं पर एआई एक शक्तिशाली सहायक है: यह संदर्भ का उपयोग करके ओसीआर त्रुटियों का सुझाव देता है और उन्हें ठीक करता है।
5. सत्यापन और गुणवत्ता नियंत्रण। संशोधित पाठ को मानव द्वारा नमूना आधार पर या पूरी तरह से जांचा जाता है। विशेष रूप से महत्वपूर्ण क्षेत्र जैसे नाम, दिनांक और संख्या को दृष्टिगत रूप से सत्यापित किया जाना चाहिए।
OCR गलतियाँ क्यों करता है, AI कैसे मदद करता है
विशिष्ट समस्याएं जो ऐतिहासिक दस्तावेज़ों में ओसीआर को चुनौती देती हैं: पुराने और फैंसी फ़ॉन्ट, अप्रचलित अक्षर प्रारूप जैसे लंबे "एस" (ſ), दो-स्तंभ पृष्ठ लेआउट, फ़ुटनोट, हस्तलिखित आवेषण, मुहरें, और फीकी स्याही। क्योंकि एक ओसीआर इंजन अक्षरों को एक-एक करके "देखता" है, यह अक्सर बाइनरी "आरएन" को "एम", अक्षर "एल" को संख्या "1" के रूप में, और अक्षर "ओ" को "0" के रूप में भ्रमित करता है।
एआई भाषा मॉडल यहां एक अलग शक्ति प्रदान करते हैं: वे संदर्भ को समझते हैं। यदि OCR इंजन ने "1stanbu1" लिखा है, तो AI इस संदर्भ से अनुमान लगा सकता है कि यह "इस्तांबुल" होना चाहिए। लेकिन यहां एक बड़ा खतरा है: एआई को "सही" करने पर टेक्स्ट भी बदल सकता है। वह किसी गैर-मौजूद शब्द को "मैंने ठीक कर दिया" जोड़ सकता है या किसी अस्पष्ट स्थान को अपने अनुमान से भर सकता है। इससे प्रतिलेखन की निष्ठा बाधित होती है।
सावधानी: ओसीआर सुधार में सुनहरा नियम यह है: एआई को केवल स्पष्ट पहचान त्रुटियों को ठीक करना चाहिए, पाठ की सामग्री की व्याख्या या पूरक नहीं करना चाहिए। "1stanbu1 → इस्तांबुल" वैध है; यह किसी अपठनीय शब्द को अनुमानों से भरने के बारे में नहीं है। अनिश्चित स्थानों को [?] से चिह्नित किया जाना चाहिए और नहीं बनाया जाना चाहिए।
ओसीआर त्रुटि प्रकार और तालिका के साथ दृष्टिकोण
त्रुटि प्रकार
उदाहरण
क्या AI इसे ठीक कर सकता है?
मानव नियंत्रण
चरित्र मिश्रण
rn↔m, l↔1, O↔0
हाँ, यह सुरक्षित है
नमूना
पुराना पत्र प्रपत्र
लंबा ſ → एस
हाँ, यह सुरक्षित है
नमूना
फीका/अपठनीय शब्द
"का___एन"
नहीं, लगाना चाहिए [?]
अनिवार्य
उचित नाम/स्थान का नाम
"कॉन्स्टेंटिनीये"
सावधान
अनिवार्य
क्रमांक/तारीख
"1867" बनाम "1857"
जोखिम भरा
अनिवार्य
पेज लेआउट (कॉलम/फुटनोट)
मिश्रित प्रवाह
आंशिक रूप से
अनिवार्य
चित्र को एक वाक्य में संक्षेप में प्रस्तुत करने के लिए: एआई सामान्य चरित्र त्रुटियों को विश्वसनीय रूप से साफ़ करता है; परन्तु विशेष नामों, अंकों, तिथियों तथा अपठनीय स्थानों के लिए मनुष्य की आँखों की आवश्यकता होती है।
तीन मिनी मामले
केस 1 - समाचार पत्र पुरालेख खोजने योग्य हो गए। एक विश्वविद्यालय पुस्तकालय ने 1930 के दशक के स्थानीय समाचार पत्रों के 12,000 पृष्ठों को डिजिटल कर दिया है। रॉ ओसीआर सटीकता अनुमानित 82% थी (प्रत्येक 100 वर्णों में से 18 गलत थे)। एआई-आधारित सुधार ने अखबार की भाषा-उपयुक्त शब्दकोश और संदर्भ के साथ सटीकता को 96% तक बढ़ा दिया। शेष त्रुटियों के लिए, पूर्ण पाठ के बजाय एक नमूना जाँच की गई; यह संग्रह 3 सप्ताह में खोजने योग्य हो गया।
केस 2 - एआई ने "सही" किया और इतिहास को विकृत किया। एक पुरालेखपाल ने एआई से ओसीआर प्रिंटआउट पर "1863" तारीख को सही कर दिया था। एआई ने संदर्भ में एक अन्य घटना को देखकर तारीख को "सही" करके "1868" कर दिया - भले ही दस्तावेज़ में स्पष्ट रूप से 1863 कहा गया हो। यदि पुरालेखपाल ने मूल छवि को नहीं देखा होता, तो कैटलॉग गलत तारीख के साथ दर्ज हुआ होता। पाठ: संख्याओं और तारीखों को कभी भी एआई पर नहीं छोड़ा जाता है, उन्हें छवि से सत्यापित किया जाता है।
केस 3 - दो कॉलम वाला पेज भ्रमित। 19वीं सदी की सालाना किताब के दो-स्तंभ वाले पन्नों को ओसीआर में एक ही धारा में मिला दिया गया और वाक्यों को आपस में जोड़ दिया गया। कच्चा आउटपुट अपठनीय था. जब मैंने पहली बार पृष्ठ लेआउट को क्षेत्रों (विभाजन) में विभाजित किया और प्रत्येक कॉलम को अलग से संसाधित किया तो पाठ में सुधार हुआ। पाठ: जटिल पृष्ठ लेआउट में, संरचना पहले, पाठ दूसरा।
चार प्रतिलिपि योग्य टेम्पलेट
1) सुरक्षित ओसीआर सुधार:
नीचे एक ऐतिहासिक दस्तावेज़ का कच्चा OCR आउटपुट दिया गया है। आपका कार्य केवल स्पष्ट ऑप्टिकल पहचान त्रुटियों को ठीक करना है (उदाहरण के लिए rn→m,1→l, 0→O, long ſ→s)। नियम: (1) पाठ का अर्थ स्पष्ट करें। (2) अपठनीय/अस्पष्ट शब्दों को ठीक करें, ज्यों का त्यों छोड़ें तथा [?] से चिह्नित करें। (3) वाक्यों को जोड़ना, हटाना या पूरा करना नहीं। (4) संख्याएँ और तारीखें बदलें; संदेह होने पर [नंबर?] चिह्नित करें। रॉ ओसीआर: [यहां]
2) ओसीआर गुणवत्ता रिपोर्ट:
नीचे ओसीआर आउटपुट की जांच करें और एक गुणवत्ता रिपोर्ट तैयार करें: (1) संभावित पहचान त्रुटियों वाले शब्दों की सूची बनाएं, (2) उन क्षेत्रों को चिह्नित करें जो अपठनीय/अस्पष्ट दिखाई देते हैं, (3) विशिष्ट नामों, तिथियों और संख्याओं की सूची बनाएं जिन्हें मानव जांच की आवश्यकता है। सही मत करो; केवल चेकलिस्ट बनाएं। पाठ: [यहां]
3) कॉलम/संरचना पार्सिंग सहायता:
चूँकि नीचे दिया गया ओसीआर पाठ दो-स्तंभ वाले पृष्ठ से आता है, इसलिए प्रवाह भ्रमित हो सकता है। पाठ को तार्किक अनुच्छेदों में पुनर्व्यवस्थित करें लेकिन कोई भी शब्द न बदलें, न जोड़ें या हटाएँ। बस आदेश ठीक करें. जिस ऑर्डर के बारे में आप निश्चित नहीं हैं उसे [ऑर्डर?] से चिह्नित करें। पाठ: [यहाँ]
4) मानक भाषा में सामान्यीकरण (वैकल्पिक, अलग परत):
नीचे दिए गए संशोधित ऐतिहासिक पाठ के ऊपर, एक अलग कॉलम में, आज की वर्तनी में एक सरलीकृत पठन संस्करण तैयार करें। मूल पाठ में कभी भी परिवर्तन न करें; सरलीकरण को एक अलग परत होने दें। बिना अर्थ जोड़े बस वर्तनी/उच्चारण अपडेट करें। मूल: [यहां]
कमजोर संकेत/मजबूत संकेत
कमज़ोर:
इस ओसीआर टेक्स्ट को सही और सुशोभित करें।
"सुंदरीकरण" एआई को पाठ को फिर से लिखने, चूक करने और सामग्री की व्याख्या करने की अनुमति देता है; वफ़ादारी तोड़ता है.
मजबूत:
इस कच्चे OCR आउटपुट में केवल ऑप्टिकल पहचान त्रुटियों को ठीक करें। अर्थ की व्याख्या न करें, शब्दों को जोड़ें/हटाएं, अपठनीय भागों को [?] के साथ छोड़ें, संख्याओं और तिथियों को बदलें। आपके द्वारा किए गए प्रत्येक सुधार को "मूल → सुधार" प्रारूप में एक अलग सूची में दिखाएं ताकि मैं इसे सत्यापित कर सकूं। पाठ: [यहाँ]
अंतर: बंधी हुई ड्यूटी, निर्माण पर रोक, अस्पष्टता को चिह्नित करना और सुधारों की पता लगाने योग्य सूची आउटपुट को ऑडिट योग्य बनाती है।
सामान्य गलतियाँ
- कम रिज़ॉल्यूशन पर स्कैनिंग. अधिकांश OCR त्रुटियाँ ख़राब छवियों के कारण होती हैं; गुणवत्तापूर्ण स्कैनिंग सबसे सस्ता निवेश है।
- एआई को "सुंदर बनाओ" कहना। इससे निष्ठा के बजाय प्रवाह उत्पन्न होता है; दस्तावेज़ पुनः लिखा गया है.
- संख्याओं और तारीखों को एआई पर छोड़ रहा हूं। संदर्भ से "सही" करने पर ये चुपचाप भ्रष्ट हो जाते हैं; छवि द्वारा सत्यापित किया जाना चाहिए.
- अपठनीय क्षेत्र को अनुमान से भरना। इसे अनिश्चितता से संरक्षित किया जाना चाहिए [?], बना हुआ नहीं।
- सैंपलिंग के बजाय बिल्कुल भी नियंत्रण नहीं किया जा रहा है। यहां तक कि 96% सटीकता का मतलब 12,000 पृष्ठों में हजारों त्रुटियां हैं; महत्वपूर्ण क्षेत्रों को स्कैन किया जाता है।
संक्षेप में
ओसीआर मुद्रित ऐतिहासिक दस्तावेजों को खोजने योग्य पाठ में परिवर्तित करके शोधकर्ताओं के लिए अभिलेखागार खोलता है। एआई संदर्भ के साथ कच्चे ओसीआर आउटपुट में चरित्र त्रुटियों को ठीक करने में एक शक्तिशाली सहायता है; लेकिन आपको संपादन और पुनर्लेखन के बीच एक रेखा खींचनी होगी। उच्च गुणवत्ता वाली स्कैनिंग, सुरक्षित सुधार निर्देश, [?] के साथ अस्पष्टता का संरक्षण, और नामों/दिनांकों/संख्याओं का मानव-आंख से सत्यापन डिजिटलीकरण को तेज़ और विश्वसनीय दोनों बनाता है। एआई टेक्स्ट साफ़ करता है; आप निष्ठा के संरक्षक हैं.
आवेदन कार्य
एक मुद्रित ऐतिहासिक दस्तावेज़ (पुराना समाचार पत्र, आधिकारिक पत्र, पुस्तक पृष्ठ) को स्कैन करें या ओसीआर प्रिंटआउट लें। पाठ को "सुरक्षित ओसीआर सुधार" टेम्पलेट के साथ ठीक करें और "मूल → सुधार" सूची के माध्यम से सुधार का अनुरोध करें। फिर, "ओसीआर गुणवत्ता रिपोर्ट" से उन क्षेत्रों को हटा दें जिनके लिए मानव नियंत्रण की आवश्यकता है। सूची में प्रत्येक दिनांक और उचित नाम की वास्तविक छवि से तुलना करें; ध्यान दें कि कितने गलत तरीके से "सही" किए गए थे।
चेकलिस्ट
- [ ] मैंने दस्तावेज़ को कम से कम 300 डीपीआई और अच्छे कंट्रास्ट के साथ स्कैन किया।
- [ ] मैंने एआई से केवल ऑप्टिकल त्रुटि सुधार के लिए कहा था, पुनर्लेखन के लिए नहीं।
- [ ] मैंने अपठनीय भागों को [?] से सुरक्षित किया।
- [ ] मैंने छवि के साथ सभी संख्याओं, तिथियों और उचित नामों को सत्यापित किया।
- [ ] मैंने महत्वपूर्ण क्षेत्रों में एक नमूना या पूर्ण जांच की।