युनिट्स
1. इतिहास आणि संग्रहणातील कृत्रिम बुद्धिमत्तेचा परिचय: भूमिका, सीमा, प्रमाणीकरण आणि नीतिशास्त्र 2. दस्तऐवज डिजिटायझेशन आणि ओसीआर: मुद्रित मजकूर मशीन टेक्स्टमध्ये रूपांतरित करणे 3. लिप्यंतरण: ऑट्टोमन तुर्की आणि हस्तलिखिते 4. मेटाडेटा, कॅटलॉगिंग आणि वर्गीकरण 5. स्रोत स्कॅनिंग, शोध आणि सारांश 6. ऐतिहासिक भाषांतर आणि सरलीकरण 7. स्त्रोत पडताळणी, अनाक्रोनिझम आणि भ्रम 8. सामग्री विश्लेषण आणि नमुना शोध 9. संग्रहण प्रवेश, वर्णन आणि वापरकर्ता सेवा 10. संरक्षण, जीर्णोद्धार आणि डिजिटल संरक्षण 11. नैतिकता, कॉपीराइट, गोपनीयता आणि सांस्कृतिक संवेदनशीलता 12. एंड-टू-एंड प्रोजेक्ट: आर्टिफिशियल इंटेलिजन्ससह संग्रहण संग्रहावर प्रक्रिया करणे
युनिट 2 / 12

दस्तऐवज डिजिटायझेशन आणि ओसीआर: मुद्रित मजकूर मशीन टेक्स्टमध्ये रूपांतरित करणे

नफा:

  • डिजिटायझेशन आणि ओसीआर वर्कफ्लो (स्कॅनिंग, प्री-प्रोसेसिंग, ओळख, दुरुस्ती, पडताळणी) टप्प्याटप्प्याने सेट करण्याची क्षमता
  • संदर्भासह ओसीआर त्रुटी सुधारण्यासाठी AI वापरण्याची क्षमता सुधारणे आणि पुनर्लेखन ओळ आणि [?] सह अस्पष्टता चिन्हांकित करणे.
  • संख्या, तारखा आणि योग्य नावे का दृष्यदृष्ट्या सत्यापित करणे आवश्यक आहे आणि गुणवत्ता नियंत्रणाची भूमिका समजून घ्या.

संग्रहण किंवा लायब्ररीच्या भौतिक शेल्फ् 'चे अव रुप असलेली लाखो पाने संशोधकासाठी तेव्हाच उघडली जातात जेव्हा ती डिजीटल आणि शोधण्यायोग्य होतात. डिजिटायझेशन म्हणजे एखाद्या भौतिक दस्तऐवजाचे स्कॅनिंग किंवा छायाचित्रण करून डिजिटल प्रतिमेत रूपांतर करणे. पण एका पानाचे छायाचित्र अद्याप "मजकूर" नाही; संगणकावर ती अजूनही एक प्रतिमा आहे, तुम्ही त्यात शोधू शकत नाही. इथेच ओसीआर लागू होतो.

OCR (ऑप्टिकल कॅरेक्टर रिकग्निशन) हे तंत्रज्ञान आहे जे दस्तऐवजाच्या प्रतिमेतील मुद्रित अक्षरे ओळखते आणि त्यांना मशीन-वाचण्यायोग्य, शोधण्यायोग्य मजकुरात रूपांतरित करते. या युनिटमध्ये, तुम्ही OCR सह ऐतिहासिक मुद्रित दस्तऐवजांचे डिजिटायझेशन कसे करावे, AI या प्रक्रियेत OCR त्रुटी सुधारण्यात कशी मदत करते आणि मानवी डोळा कोठे आवश्यक आहे हे शिकू शकाल. (हस्तलिखित मजकुरासाठी वेगळ्या तंत्रज्ञानाची आवश्यकता आहे; आम्ही पुढील युनिटमध्ये ते समाविष्ट करू.)

डिजिटायझेशन वर्कफ्लो: स्टेप बाय स्टेप

1. तयारी आणि स्क्रीनिंग. दस्तऐवज शक्य तितक्या उच्च गुणवत्तेवर स्कॅन करा. ऐतिहासिक संशोधनासाठी एक सामान्य नियम म्हणजे किमान 300-400 डीपीआय (डॉट्स प्रति इंच) चे रिझोल्यूशन. कमी रिझोल्यूशन पुढील OCR टप्प्यात त्रुटी दर वाढवते.

2. इमेज प्रीप्रोसेसिंग. OCR च्या आधी प्रतिमा सुधारणे यशामध्ये मोठ्या प्रमाणात वाढ करते: स्कॅन केलेले पृष्ठ स्पष्ट करणे, डाग काढून टाकणे, कॉन्ट्रास्ट वाढवणे, काळ्या आणि पांढर्यामध्ये रूपांतरित करणे. आधुनिक एआय-आधारित साधने ही पायरी स्वयंचलित करू शकतात.

3. OCR अर्ज. तुम्ही OCR इंजिनला इमेज फीड करता; इंजिन अक्षरे ओळखते आणि मजकूर तयार करते. आउटपुटमध्ये सहसा दोन स्तर असतात: दृश्यमान दस्तऐवज प्रतिमा आणि खाली "शोधण्यायोग्य छुपा मजकूर स्तर".

4. सुधारणा (सुधारणा नंतर). कच्चा OCR आउटपुट कधीही परिपूर्ण नसतो. जुने फॉन्ट, पिवळे कागद, शाईचे डाग आणि स्कॅनिंग त्रुटींमुळे अक्षरे चुकीच्या पद्धतीने वाचली जातात. येथे AI एक शक्तिशाली मदतनीस आहे: ते संदर्भ वापरून OCR त्रुटी सुचवते आणि सुधारते.

5. पडताळणी आणि गुणवत्ता नियंत्रण. दुरुस्त केलेला मजकूर मानवाद्वारे नमुना आधारावर किंवा पूर्णपणे तपासला जातो. विशेषतः गंभीर क्षेत्रे जसे की नावे, तारखा आणि संख्या दृष्यदृष्ट्या सत्यापित करणे आवश्यक आहे.

OCR चुका का करते, AI कशी मदत करते

ऐतिहासिक दस्तऐवजांमध्ये ओसीआरला आव्हान देणारी ठराविक समस्या: जुने आणि फॅन्सी फॉन्ट, अप्रचलित अक्षरे जसे की लांब "s" (ſ), दोन-स्तंभ पृष्ठ लेआउट, तळटीप, हस्तलिखित दाखल, सील आणि फिकट शाई. कारण OCR इंजिन एक-एक अक्षरे "पाहते", ते वारंवार बायनरी "rn" ला "m" म्हणून, अक्षर "l" ला "1" आणि अक्षर "O" ला "0" म्हणून गोंधळात टाकते.

AI भाषा मॉडेल येथे एक वेगळी शक्ती देतात: त्यांना संदर्भ समजतात. जर एखाद्या OCR इंजिनने "1stanbu1" लिहिले असेल, तर AI संदर्भावरून अनुमान काढू शकते की ते "इस्तंबूल" असावे. परंतु येथे एक मोठा धोका आहे: "दुरुस्त" करताना AI मजकूर देखील बदलू शकतो. तो अस्तित्वात नसलेला शब्द "मी दुरुस्त केला" जोडू शकतो किंवा स्वतःच्या अंदाजाने अस्पष्ट जागा भरू शकतो. यामुळे प्रतिलेखनाची निष्ठा बाधित होते.

खबरदारी: OCR सुधारणेचा सुवर्ण नियम हा आहे: AI ने केवळ स्पष्ट ओळख त्रुटी सुधारल्या पाहिजेत, मजकूराच्या मजकुराचा अर्थ लावू नये किंवा त्याला पूरक करू नये. "1stanbu1 → इस्तंबूल" कायदेशीर आहे; हे अंदाजाने न वाचता येणारा शब्द भरण्याबद्दल नाही. अनिश्चित ठिकाणे [?] ने चिन्हांकित केली पाहिजेत आणि बनवू नयेत.

ओसीआर त्रुटी प्रकार आणि टेबलसह दृष्टीकोन

त्रुटी प्रकार

उदाहरण

AI ते दुरुस्त करू शकतो का?

मानवी नियंत्रण

वर्ण मिश्रण

rn↔m, l↔1, O↔0

होय, ते सुरक्षित आहे

नमुना

जुने पत्र

लांब ſ → s

होय, ते सुरक्षित आहे

नमुना

अस्पष्ट/वाचता न येणारा शब्द

"ka___n"

नाही, लावावे [?]

अनिवार्य

योग्य नाव/ ठिकाणाचे नाव

"कॉन्स्टँटिनिये"

सावध

अनिवार्य

क्रमांक/तारीख

"1867" विरुद्ध "1857"

धोकादायक

अनिवार्य

पृष्ठ लेआउट (स्तंभ/तळटीप)

मिश्र प्रवाह

अंशतः

अनिवार्य

एका वाक्यात चित्राचा सारांश देण्यासाठी: एआय विश्वासार्हपणे सामान्य वर्ण त्रुटी साफ करते; परंतु विशेष नावे, संख्या, तारखा आणि न वाचता येणारी ठिकाणे यासाठी मानवी डोळ्यांची आवश्यकता असते.

तीन लहान प्रकरणे

प्रकरण 1 - वृत्तपत्र संग्रहण शोधण्यायोग्य झाले. विद्यापीठाच्या लायब्ररीने 1930 च्या दशकातील स्थानिक वर्तमानपत्रांच्या 12,000 पृष्ठांचे डिजिटायझेशन केले आहे. रॉ OCR अचूकता अंदाजे 82% होती (प्रत्येक 100 पैकी 18 अक्षरे चुकीची होती). AI-आधारित सुधारणेने वृत्तपत्र भाषा-योग्य शब्दकोष आणि संदर्भासह अचूकता 96% पर्यंत वाढवली. उर्वरित त्रुटींसाठी, संपूर्ण मजकुराऐवजी नमुना तपासणी केली गेली; संग्रह 3 आठवड्यांत शोधण्यायोग्य झाला.

केस 2 - AI "दुरुस्त" आणि विकृत इतिहास. एका आर्किव्हिस्टने AI ने OCR प्रिंटआउटवर "1863" तारीख दुरुस्त केली होती. AI ने संदर्भातील दुसरी घटना पाहून "1868" तारीख "दुरुस्त" केली - जरी दस्तऐवजात स्पष्टपणे 1863 असे म्हटले आहे. जर आर्किव्हिस्टने मूळ प्रतिमा पाहिली नसती, तर कॅटलॉग चुकीच्या तारखेसह प्रविष्ट केला असता. धडा: संख्या आणि तारखा कधीही AI वर सोडल्या जात नाहीत, ते प्रतिमेसह सत्यापित केले जातात.

केस 3 - दोन-स्तंभ पृष्ठ गोंधळलेले. 19व्या शतकातील वार्षिक पुस्तकाची दोन स्तंभांची पाने ओसीआरमध्ये एकाच प्रवाहात मिसळली गेली आणि वाक्ये एकमेकांत गुंफली गेली. कच्चे आउटपुट वाचण्यायोग्य नव्हते. जेव्हा मी प्रथम पृष्ठ लेआउटला प्रदेशांमध्ये (विभाजन) विभाजित केले आणि प्रत्येक स्तंभावर स्वतंत्रपणे प्रक्रिया केली तेव्हा मजकूर सुधारला. धडा: जटिल पृष्ठ लेआउटमध्ये, रचना प्रथम, मजकूर दुसरा.

चार कॉपी करण्यायोग्य टेम्पलेट्स

1) सुरक्षित OCR सुधारणा:

खाली ऐतिहासिक दस्तऐवजाचे कच्चे OCR आउटपुट आहे. तुमचे कार्य फक्त स्पष्ट ऑप्टिकल ओळख त्रुटी सुधारणे आहे (उदा. rn→m,1→l, 0→O, long ſ→s). नियम: (१) मजकुराचा अर्थ लावा. (२) न वाचलेले/अस्पष्ट शब्द दुरुस्त करा, जसे आहे तसे सोडा आणि [?] ने चिन्हांकित करा. (3) वाक्य जोडणे, काढणे किंवा पूर्ण करणे नाही. (४) क्रमांक आणि तारखा बदला; शंका असल्यास [संख्या?] चिन्हांकित करा. रॉ OCR: [येथे]

2) OCR गुणवत्ता अहवाल:

खालील OCR आउटपुटचे परीक्षण करा आणि गुणवत्ता अहवाल तयार करा: (1) संभाव्य ओळख त्रुटींसह शब्दांची यादी करा, (2) न वाचता येणारे/अस्पष्ट दिसणारे क्षेत्र चिन्हांकित करा, (3) विशिष्ट नावे, तारखा आणि संख्यांची यादी करा ज्यांना मानवी तपासणी आवश्यक आहे. दुरुस्त करू नका; फक्त चेकलिस्ट तयार करा. मजकूर: [येथे]

3) स्तंभ/संरचना पार्सिंग मदत:

खालील OCR मजकूर दोन-स्तंभ पृष्ठावरून येत असल्यामुळे, प्रवाह गोंधळलेला असू शकतो. तार्किक परिच्छेदांमध्ये मजकूराची पुनर्रचना करा परंतु कोणतेही शब्द बदलू, जोडू किंवा हटवू नका. फक्त ऑर्डर दुरुस्त करा. तुम्हाला खात्री नसलेल्या ऑर्डरवर [ऑर्डर?] चिन्हांकित करा. मजकूर: [येथे]

4) मानक भाषेचे सामान्यीकरण (पर्यायी, स्वतंत्र स्तर):

खालील दुरुस्त केलेल्या ऐतिहासिक मजकुराच्या वर, वेगळ्या स्तंभात, आजच्या शुद्धलेखनात एक सरलीकृत वाचन आवृत्ती तयार करा. मूळ मजकूर कधीही बदलू नका; सरलीकरण एक स्वतंत्र स्तर असू द्या. अर्थ न जोडता फक्त स्पेलिंग/उच्चार अपडेट करा. मूळ: [येथे]

कमकुवत प्रॉम्प्ट / मजबूत प्रॉम्प्ट

कमकुवत:

हा OCR मजकूर दुरुस्त करा आणि सुशोभित करा.

“सुशोभित करा” AI ला मजकूर पुन्हा लिहिण्याची, वगळण्याची आणि सामग्रीचा अर्थ लावण्याची परवानगी देते; निष्ठा तोडते.

मजबूत:

या कच्च्या OCR आउटपुटमध्ये केवळ ऑप्टिकल ओळख त्रुटींचे निराकरण करा. अर्थ लावू नका, शब्द जोडा/हटवा, [?] सह न वाचता येणारे भाग सोडा, संख्या आणि तारखा बदला. तुम्ही करत असलेली प्रत्येक सुधारणा "मूळ → सुधारणा" फॉरमॅटमध्ये वेगळ्या सूचीमध्ये दाखवा जेणेकरून मी ते सत्यापित करू शकेन. मजकूर: [येथे]

फरक: बंधनकारक ड्युटी, फॅब्रिकेशनवर प्रतिबंध, चिन्हांकित अस्पष्टता आणि सुधारणांची शोधण्यायोग्य यादी आउटपुट ऑडिट करण्यायोग्य बनवते.

सामान्य चुका

  • कमी रिझोल्यूशनवर स्कॅनिंग. बहुतेक OCR त्रुटी खराब प्रतिमांमुळे होतात; गुणवत्ता स्कॅनिंग ही सर्वात स्वस्त गुंतवणूक आहे.
  • एआयला "सुंदर बनवा" असे म्हणणे. यामुळे निष्ठा ऐवजी प्रवाहीपणा निर्माण होतो; दस्तऐवज पुन्हा लिहिला आहे.
  • संख्या आणि तारखा AI वर सोडत आहे. संदर्भातून "दुरुस्त" केल्यावर हे शांतपणे दूषित होतात; प्रतिमेद्वारे सत्यापित करणे आवश्यक आहे.
  • अंदाजाने न वाचता येणारी जागा भरणे. ते अनिश्चिततेने संरक्षित केले पाहिजे [?], बनलेले नाही.
  • नमुने घेण्याऐवजी अजिबात नियंत्रण नाही. अगदी 96% अचूकता म्हणजे 12,000 पृष्ठांमध्ये हजारो त्रुटी; गंभीर क्षेत्रे स्कॅन केली जातात.

सारांशात

OCR मुद्रित ऐतिहासिक दस्तऐवजांना शोधण्यायोग्य मजकुरात रूपांतरित करून संशोधकांसाठी संग्रह उघडते. संदर्भासह रॉ OCR आउटपुटमधील वर्ण त्रुटी सुधारण्यासाठी AI एक शक्तिशाली मदत आहे; परंतु तुम्ही संपादन आणि पुनर्लेखन यांच्यातील रेषा काढली पाहिजे. उच्च-गुणवत्तेचे स्कॅनिंग, सुरक्षित सुधारणा सूचना, [?] सह संदिग्धता जतन करणे आणि नावे/तारीख/संख्या यांचे मानवी-डोळे पडताळणे डिजिटायझेशन जलद आणि विश्वासार्ह बनवते. एआय मजकूर साफ करते; तुम्ही निष्ठेचे रक्षक आहात.

अर्ज कार्य

मुद्रित ऐतिहासिक दस्तऐवज स्कॅन करा (जुने वर्तमानपत्र, अधिकृत पत्र, पुस्तक पृष्ठ) किंवा OCR प्रिंटआउट घ्या. "सुरक्षित OCR सुधारणा" टेम्प्लेटसह मजकूर दुरुस्त करा आणि "मूळ → सुधारणा" सूचीद्वारे दुरुस्तीची विनंती करा. त्यानंतर, "OCR गुणवत्ता अहवाल" सह मानवी नियंत्रणाची आवश्यकता असलेले क्षेत्र काढून टाका. सूचीतील प्रत्येक तारीख आणि योग्य नावाची वास्तविक प्रतिमेशी तुलना करा; किती चुकीच्या पद्धतीने "दुरुस्त" केले गेले ते लक्षात घ्या.

चेकलिस्ट

  • मी किमान 300 DPI आणि चांगल्या कॉन्ट्रास्टसह दस्तऐवज स्कॅन केले.
  • [ ] मी केवळ AI ला ऑप्टिकल त्रुटी सुधारण्यासाठी विचारले, पुनर्लेखन नाही.
  • [ ] मी न वाचता येणारे भाग [?] सह संरक्षित केले.
  • [ ] मी प्रतिमेसह सर्व क्रमांक, तारखा आणि योग्य नावे सत्यापित केली.
  • [ ] मी गंभीर भागात नमुना किंवा पूर्ण तपासणी केली.