യൂണിറ്റുകൾ
1. ചരിത്രത്തിലും ആർക്കൈവിംഗിലും ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസിൻ്റെ ആമുഖം: റോളുകൾ, അതിരുകൾ, മൂല്യനിർണ്ണയം, ധാർമ്മികത 2. ഡോക്യുമെൻ്റ് ഡിജിറ്റൈസേഷനും OCR: അച്ചടിച്ച ടെക്‌സ്‌റ്റിനെ മെഷീൻ ടെക്‌സ്‌റ്റാക്കി മാറ്റുന്നു 3. ട്രാൻസ്ക്രിപ്ഷൻ: ഓട്ടോമൻ ടർക്കിഷ്, കയ്യെഴുത്തുപ്രതികൾ 4. മെറ്റാഡാറ്റ, കാറ്റലോഗിംഗ്, വർഗ്ഗീകരണം 5. ഉറവിട സ്കാനിംഗ്, കണ്ടെത്തൽ, സംഗ്രഹം 6. ചരിത്രപരമായ വിവർത്തനവും ലളിതവൽക്കരണവും 7. ഉറവിട പരിശോധന, അനാക്രോണിസം, ഹാലുസിനേഷൻ 8. ഉള്ളടക്ക വിശകലനവും പാറ്റേൺ കണ്ടെത്തലും 9. ആർക്കൈവ് ആക്സസ്, വിവരണം, ഉപയോക്തൃ സേവനങ്ങൾ 10. സംരക്ഷണം, പുനഃസ്ഥാപനം, ഡിജിറ്റൽ സംരക്ഷണം 11. ധാർമ്മികത, പകർപ്പവകാശം, സ്വകാര്യത, സാംസ്കാരിക സംവേദനക്ഷമത 12. എൻഡ്-ടു-എൻഡ് പ്രോജക്റ്റ്: ആർട്ടിഫിഷ്യൽ ഇൻ്റലിജൻസ് ഉപയോഗിച്ച് ഒരു ആർക്കൈവ് ശേഖരം പ്രോസസ്സ് ചെയ്യുന്നു
യൂണിറ്റ് 2 / 12

ഡോക്യുമെൻ്റ് ഡിജിറ്റൈസേഷനും OCR: അച്ചടിച്ച ടെക്‌സ്‌റ്റിനെ മെഷീൻ ടെക്‌സ്‌റ്റാക്കി മാറ്റുന്നു

നേട്ടങ്ങൾ:

  • ഘട്ടം ഘട്ടമായി ഡിജിറ്റൈസേഷനും OCR വർക്ക്ഫ്ലോയും (സ്കാനിംഗ്, പ്രീ-പ്രോസസ്സിംഗ്, തിരിച്ചറിയൽ, തിരുത്തൽ, സ്ഥിരീകരണം) സജ്ജീകരിക്കാനുള്ള കഴിവ്
  • തിരുത്തൽ നിലനിർത്തിക്കൊണ്ട് OCR പിശകുകൾ തിരുത്താൻ AI ഉപയോഗിക്കാനുള്ള കഴിവ്, തിരുത്തൽ നിലനിർത്തുകയും ലൈൻ മാറ്റിയെഴുതുകയും [?] ഉപയോഗിച്ച് അവ്യക്തത അടയാളപ്പെടുത്തുകയും ചെയ്യുന്നു.
  • അക്കങ്ങളും തീയതികളും ശരിയായ പേരുകളും ദൃശ്യപരമായി പരിശോധിച്ചുറപ്പിക്കേണ്ടത് എന്തുകൊണ്ടാണെന്നും ഗുണനിലവാര നിയന്ത്രണത്തിൻ്റെ പങ്ക് എന്താണെന്നും മനസ്സിലാക്കുക.

ഒരു ആർക്കൈവിൻ്റെയോ ലൈബ്രറിയുടെയോ ഫിസിക്കൽ ഷെൽഫുകളിലെ ദശലക്ഷക്കണക്കിന് പേജുകൾ ഡിജിറ്റൈസ് ചെയ്യപ്പെടുകയും തിരയാൻ കഴിയുകയും ചെയ്യുമ്പോൾ മാത്രമേ ഗവേഷകർക്ക് യഥാർത്ഥത്തിൽ തുറക്കൂ. ഒരു ഫിസിക്കൽ ഡോക്യുമെൻ്റിനെ സ്കാൻ ചെയ്യുകയോ ഫോട്ടോ എടുക്കുകയോ ചെയ്തുകൊണ്ട് ഡിജിറ്റൽ ഇമേജാക്കി മാറ്റുന്നതാണ് ഡിജിറ്റൈസേഷൻ. എന്നാൽ ഒരു പേജിൻ്റെ ഫോട്ടോ ഇതുവരെ "ടെക്സ്റ്റ്" അല്ല; കമ്പ്യൂട്ടറിൽ ഇത് ഇപ്പോഴും ഒരു ചിത്രമാണ്, നിങ്ങൾക്ക് അതിൽ തിരയാൻ കഴിയില്ല. ഇവിടെയാണ് OCR പ്രവർത്തിക്കുന്നത്.

OCR (ഒപ്റ്റിക്കൽ ക്യാരക്ടർ റെക്കഗ്നിഷൻ) ഒരു ഡോക്യുമെൻ്റ് ഇമേജിലെ അച്ചടിച്ച അക്ഷരങ്ങൾ തിരിച്ചറിയുകയും അവയെ മെഷീൻ-റീഡബിൾ, സെർച്ച് ചെയ്യാവുന്ന ടെക്സ്റ്റാക്കി മാറ്റുകയും ചെയ്യുന്ന ഒരു സാങ്കേതികവിദ്യയാണ്. ഈ യൂണിറ്റിൽ, OCR ഉപയോഗിച്ച് ചരിത്രപരമായ അച്ചടിച്ച ഡോക്യുമെൻ്റുകൾ എങ്ങനെ ഡിജിറ്റൈസ് ചെയ്യാം, ഈ പ്രക്രിയയിലെ OCR പിശകുകൾ തിരുത്താൻ AI എങ്ങനെ സഹായിക്കുന്നു, മനുഷ്യൻ്റെ കണ്ണ് അത്യാവശ്യമായിരിക്കുന്നത് എങ്ങനെയെന്ന് നിങ്ങൾ പഠിക്കും. (കൈയ്യെഴുത്ത് എഴുത്തുകൾക്ക് മറ്റൊരു സാങ്കേതികവിദ്യ ആവശ്യമാണ്; ഞങ്ങൾ അത് അടുത്ത യൂണിറ്റിൽ ഉൾപ്പെടുത്തും.)

ഡിജിറ്റൈസേഷൻ വർക്ക്ഫ്ലോ: ഘട്ടം ഘട്ടമായി

1. തയ്യാറാക്കലും സ്ക്രീനിംഗും. സാധ്യമായ ഏറ്റവും ഉയർന്ന നിലവാരത്തിൽ പ്രമാണം സ്കാൻ ചെയ്യുക. കുറഞ്ഞത് 300-400 DPI (ഒരു ഇഞ്ചിന് ഡോട്ടുകൾ) റെസലൂഷൻ ആണ് ചരിത്ര ഗവേഷണത്തിനുള്ള പൊതുനിയമം. കുറഞ്ഞ റെസല്യൂഷൻ തുടർന്നുള്ള OCR ഘട്ടത്തിൽ പിശക് നിരക്ക് വർദ്ധിപ്പിക്കുന്നു.

2. ഇമേജ് പ്രീപ്രോസസിംഗ്. OCR-ന് മുമ്പുള്ള ചിത്രം മെച്ചപ്പെടുത്തുന്നത് വിജയത്തെ വളരെയധികം വർദ്ധിപ്പിക്കുന്നു: സ്കാൻ ചെയ്ത പേജ് ഡെസ്‌കെയിംഗ്, കളങ്കങ്ങൾ നീക്കം ചെയ്യുക, ദൃശ്യതീവ്രത വർദ്ധിപ്പിക്കുക, കറുപ്പും വെളുപ്പും ആയി പരിവർത്തനം ചെയ്യുക. ആധുനിക AI- അധിഷ്ഠിത ഉപകരണങ്ങൾക്ക് ഈ ഘട്ടം ഓട്ടോമേറ്റ് ചെയ്യാൻ കഴിയും.

3. OCR ആപ്ലിക്കേഷൻ. നിങ്ങൾ ചിത്രം OCR എഞ്ചിനിലേക്ക് നൽകുന്നു; എഞ്ചിൻ അക്ഷരങ്ങൾ തിരിച്ചറിയുകയും വാചകം നിർമ്മിക്കുകയും ചെയ്യുന്നു. ഔട്ട്‌പുട്ടിൽ സാധാരണയായി രണ്ട് ലെയറുകൾ അടങ്ങിയിരിക്കുന്നു: ദൃശ്യമായ ഡോക്യുമെൻ്റ് ഇമേജും ചുവടെയുള്ള "തിരയാൻ കഴിയുന്ന മറഞ്ഞിരിക്കുന്ന ടെക്സ്റ്റ് ലെയറും".

4. തിരുത്തൽ (പോസ്റ്റ്-തിരുത്തൽ). അസംസ്‌കൃത OCR ഔട്ട്‌പുട്ട് ഒരിക്കലും തികഞ്ഞതല്ല. പഴയ ഫോണ്ടുകൾ, മഞ്ഞ പേപ്പറുകൾ, മഷി പുരട്ടൽ, സ്കാനിംഗ് പിശകുകൾ എന്നിവ കാരണം അക്ഷരങ്ങൾ തെറ്റായി വായിക്കപ്പെടുന്നു. ഇവിടെയാണ് AI ഒരു ശക്തമായ സഹായി: ഇത് സന്ദർഭം ഉപയോഗിച്ച് OCR പിശകുകൾ നിർദ്ദേശിക്കുകയും തിരുത്തുകയും ചെയ്യുന്നു.

5. പരിശോധനയും ഗുണനിലവാര നിയന്ത്രണവും. തിരുത്തിയ വാചകം സാമ്പിൾ അടിസ്ഥാനത്തിലോ പൂർണ്ണമായോ മനുഷ്യൻ പരിശോധിക്കുന്നു. പേരുകൾ, തീയതികൾ, അക്കങ്ങൾ എന്നിവ പോലുള്ള നിർണ്ണായക മേഖലകൾ ദൃശ്യപരമായി പരിശോധിച്ചുറപ്പിച്ചിരിക്കണം.

എന്തുകൊണ്ടാണ് OCR തെറ്റുകൾ വരുത്തുന്നത്, AI എങ്ങനെ സഹായിക്കുന്നു

ചരിത്ര രേഖകളിൽ OCR-നെ വെല്ലുവിളിക്കുന്ന സാധാരണ പ്രശ്നങ്ങൾ: പഴയതും മനോഹരവുമായ ഫോണ്ടുകൾ, നീണ്ട "s" (ſ), രണ്ട് കോളം പേജ് ലേഔട്ട്, അടിക്കുറിപ്പുകൾ, കൈയെഴുത്ത് ഉൾപ്പെടുത്തലുകൾ, മുദ്രകൾ, മങ്ങിയ മഷി തുടങ്ങിയ കാലഹരണപ്പെട്ട അക്ഷരരൂപങ്ങൾ. ഒരു OCR എഞ്ചിൻ അക്ഷരങ്ങൾ ഓരോന്നായി "കാണുന്നു" എന്നതിനാൽ, അത് ബൈനറി "rn" നെ "m" ആയും "l" എന്ന അക്ഷരത്തെ "1" ആയും "O" എന്ന അക്ഷരത്തെ "0" ആയും ആശയക്കുഴപ്പത്തിലാക്കുന്നു.

AI ഭാഷാ മോഡലുകൾ ഇവിടെ മറ്റൊരു ശക്തി വാഗ്ദാനം ചെയ്യുന്നു: അവ സന്ദർഭം മനസ്സിലാക്കുന്നു. ഒരു OCR എഞ്ചിൻ "1stanbu1" എന്ന് എഴുതിയാൽ, അത് "ഇസ്താംബുൾ" ആയിരിക്കണമെന്ന് AI-ക്ക് സന്ദർഭത്തിൽ നിന്ന് അനുമാനിക്കാം. എന്നാൽ ഇവിടെ ഒരു വലിയ അപകടമുണ്ട്: "തിരുത്തുമ്പോൾ" AI- യ്ക്ക് വാചകം മാറ്റാനും കഴിയും. നിലവിലില്ലാത്ത ഒരു വാക്ക് "ഞാൻ തിരുത്തി" എന്ന് ചേർക്കുകയോ വ്യക്തമല്ലാത്ത ഒരു സ്ഥലത്ത് സ്വന്തം ഊഹം കൊണ്ട് പൂരിപ്പിക്കുകയോ ചെയ്യാം. ഇത് ട്രാൻസ്ക്രിപ്ഷൻ്റെ വിശ്വസ്തതയെ തടസ്സപ്പെടുത്തുന്നു.

മുന്നറിയിപ്പ്: OCR തിരുത്തലിലെ സുവർണ്ണ നിയമം ഇതാണ്: AI വ്യക്തമായ തിരിച്ചറിയൽ പിശകുകൾ മാത്രമേ തിരുത്താവൂ, ടെക്സ്റ്റിൻ്റെ ഉള്ളടക്കം വ്യാഖ്യാനിക്കുകയോ അനുബന്ധമായി നൽകുകയോ ചെയ്യരുത്. "1stanbu1 → ഇസ്താംബുൾ" നിയമാനുസൃതമാണ്; വായിക്കാൻ പറ്റാത്ത ഒരു വാക്ക് ഊഹങ്ങൾ കൊണ്ട് നിറയ്ക്കുകയല്ല. അനിശ്ചിത സ്ഥലങ്ങൾ [?] ഉപയോഗിച്ച് അടയാളപ്പെടുത്തണം, അവ നിർമ്മിക്കരുത്.

OCR പിശക് തരങ്ങളും ഒരു പട്ടികയുമായുള്ള സമീപനവും

പിശക് തരം

ഉദാഹരണം

അത് പരിഹരിക്കാൻ AI-ന് കഴിയുമോ?

മനുഷ്യ നിയന്ത്രണം

കഥാപാത്ര മിശ്രണം

rn↔m, l↔1, O↔0

അതെ, സുരക്ഷിതമാണ്

സാമ്പിൾ

പഴയ അക്ഷരരൂപം

നീളം ſ → സെ

അതെ, സുരക്ഷിതമാണ്

സാമ്പിൾ

മങ്ങിയ/വായിക്കാനാകാത്ത വാക്ക്

"ka___n"

ഇല്ല, [?] ഇടണം

നിർബന്ധമാണ്

ശരിയായ പേര് / സ്ഥലപ്പേര്

"കോൺസ്റ്റാൻ്റിനിയേ"

ശ്രദ്ധയോടെ

നിർബന്ധമാണ്

നമ്പർ/തീയതി

"1867" vs "1857"

അപകടകരമായ

നിർബന്ധമാണ്

പേജ് ലേഔട്ട് (നിര/അടിക്കുറിപ്പ്)

മിശ്രിതമായ ഒഴുക്ക്

ഭാഗികമായി

നിർബന്ധമാണ്

ചിത്രത്തെ ഒരു വാചകത്തിൽ സംഗ്രഹിക്കാൻ: AI സാധാരണ പ്രതീക പിശകുകൾ വിശ്വസനീയമായി വൃത്തിയാക്കുന്നു; എന്നാൽ പ്രത്യേക പേരുകൾ, അക്കങ്ങൾ, തീയതികൾ, വായിക്കാൻ കഴിയാത്ത സ്ഥലങ്ങൾ എന്നിവയ്ക്ക് മനുഷ്യൻ്റെ കണ്ണുകൾ ആവശ്യമാണ്.

മൂന്ന് മിനി കേസുകൾ

കേസ് 1 - ന്യൂസ്‌പേപ്പർ ആർക്കൈവുകൾ തിരയാൻ കഴിയും. ഒരു യൂണിവേഴ്സിറ്റി ലൈബ്രറി 1930 മുതൽ പ്രാദേശിക പത്രങ്ങളുടെ 12,000 പേജുകൾ ഡിജിറ്റൈസ് ചെയ്തിട്ടുണ്ട്. അസംസ്കൃത OCR കൃത്യത 82% ആയിരുന്നു (ഓരോ 100 അക്ഷരങ്ങളിൽ 18 എണ്ണവും തെറ്റാണ്). AI-അധിഷ്ഠിത തിരുത്തൽ, ഒരു പത്രഭാഷ-അനുയോജ്യമായ നിഘണ്ടുവും സന്ദർഭവും ഉപയോഗിച്ച് കൃത്യത 96% ആയി വർദ്ധിപ്പിച്ചു. ശേഷിക്കുന്ന പിശകുകൾക്കായി, പൂർണ്ണ വാചകത്തിന് പകരം ഒരു സാമ്പിൾ പരിശോധന നടത്തി; ശേഖരം 3 ആഴ്‌ചയ്‌ക്കുള്ളിൽ തിരയാൻ കഴിഞ്ഞു.

കേസ് 2 - AI "തിരുത്തുകയും" വികലമാക്കിയ ചരിത്രം. ഒരു ആർക്കൈവിസ്റ്റ് OCR പ്രിൻ്റൗട്ടിൽ "1863" എന്ന തീയതി AI ശരിയാക്കിയിരുന്നു. സന്ദർഭത്തിൽ മറ്റൊരു ഇവൻ്റ് നോക്കി AI "1868" എന്ന തീയതി "തിരുത്തിച്ചു" - ഡോക്യുമെൻ്റിൽ 1863 എന്ന് വ്യക്തമായി പറഞ്ഞിട്ടുണ്ടെങ്കിലും. ആർക്കൈവിസ്റ്റ് യഥാർത്ഥ ചിത്രം നോക്കിയിരുന്നില്ലെങ്കിൽ, കാറ്റലോഗ് തെറ്റായ തീയതിയിൽ നൽകുമായിരുന്നു. പാഠം: നമ്പറുകളും തീയതികളും ഒരിക്കലും AI-ക്ക് വിട്ടുകൊടുക്കില്ല, അവ ചിത്രം ഉപയോഗിച്ച് പരിശോധിച്ചുറപ്പിച്ചിരിക്കുന്നു.

കേസ് 3 - രണ്ട് കോളം പേജ് ആശയക്കുഴപ്പത്തിലായി. പത്തൊൻപതാം നൂറ്റാണ്ടിലെ ഒരു വാർഷിക പുസ്തകത്തിൻ്റെ രണ്ട് കോളം പേജുകൾ OCR-ൽ ഒരൊറ്റ സ്ട്രീമിൽ കലർത്തി, വാക്യങ്ങൾ പരസ്പരം ബന്ധപ്പെട്ടിരിക്കുന്നു. അസംസ്‌കൃത ഔട്ട്‌പുട്ട് വായിക്കാൻ പറ്റാത്തതായിരുന്നു. ഞാൻ ആദ്യം പേജ് ലേഔട്ട് മേഖലകളായി (സെഗ്മെൻ്റേഷൻ) വിഭജിക്കുകയും ഓരോ നിരയും പ്രത്യേകം പ്രോസസ്സ് ചെയ്യുകയും ചെയ്തപ്പോൾ ടെക്സ്റ്റ് മെച്ചപ്പെട്ടു. പാഠം: സങ്കീർണ്ണമായ പേജ് ലേഔട്ടിൽ, ഘടന ആദ്യം, വാചകം രണ്ടാമത്തേത്.

പകർത്താവുന്ന നാല് ടെംപ്ലേറ്റുകൾ

1) സുരക്ഷിതമായ OCR തിരുത്തൽ:

ഒരു ചരിത്ര രേഖയുടെ റോ OCR ഔട്ട്‌പുട്ട് ചുവടെയുണ്ട്. വ്യക്തമായ ഒപ്റ്റിക്കൽ തിരിച്ചറിയൽ പിശകുകൾ മാത്രം ശരിയാക്കുക എന്നതാണ് നിങ്ങളുടെ ചുമതല (ഉദാ. rn→m,1→l, 0→O, നീണ്ട ſ→s). നിയമങ്ങൾ: (1) വാചകത്തിൻ്റെ അർത്ഥം വ്യാഖ്യാനിക്കുക. (2) വായിക്കാൻ കഴിയാത്ത/അവ്യക്തമായ വാക്കുകൾ ശരിയാക്കുക, അതേപടി വിട്ട് [?] എന്ന് അടയാളപ്പെടുത്തുക. (3) വാക്യങ്ങൾ കൂട്ടിച്ചേർക്കുകയോ നീക്കം ചെയ്യുകയോ പൂർത്തിയാക്കുകയോ ചെയ്യരുത്. (4) നമ്പറുകളും തീയതികളും മാറ്റുക; സംശയമുണ്ടെങ്കിൽ [നമ്പർ?] അടയാളപ്പെടുത്തുക. റോ OCR: [ഇവിടെ]

2) OCR ഗുണനിലവാര റിപ്പോർട്ട്:

ചുവടെയുള്ള OCR ഔട്ട്‌പുട്ട് പരിശോധിച്ച് ഒരു ഗുണനിലവാര റിപ്പോർട്ട് തയ്യാറാക്കുക: (1) സാധ്യമായ തിരിച്ചറിയൽ പിശകുകളുള്ള വാക്കുകൾ പട്ടികപ്പെടുത്തുക, (2) വായിക്കാൻ കഴിയാത്ത/വ്യക്തമല്ലാത്തതായി തോന്നുന്ന പ്രദേശങ്ങൾ അടയാളപ്പെടുത്തുക, (3) മനുഷ്യ പരിശോധന ആവശ്യമായ നിർദ്ദിഷ്ട പേരുകൾ, തീയതികൾ, നമ്പറുകൾ എന്നിവ പട്ടികപ്പെടുത്തുക. ശരിയാക്കരുത്; ചെക്ക്‌ലിസ്റ്റ് മാത്രം സൃഷ്‌ടിക്കുക. വാചകം: [ഇവിടെ]

3) നിര/ഘടന പാഴ്‌സിംഗ് സഹായം:

താഴെയുള്ള OCR ടെക്‌സ്‌റ്റ് രണ്ട് കോളങ്ങളുള്ള പേജിൽ നിന്നാണ് വരുന്നതെന്നതിനാൽ, ഒഴുക്ക് ആശയക്കുഴപ്പത്തിലായേക്കാം. വാചകം ലോജിക്കൽ പാരഗ്രാഫുകളായി പുനഃക്രമീകരിക്കുക എന്നാൽ വാക്കുകളൊന്നും മാറ്റുകയോ ചേർക്കുകയോ ഇല്ലാതാക്കുകയോ ചെയ്യരുത്. ഓർഡർ ശരിയാക്കുക. നിങ്ങൾക്ക് ഉറപ്പില്ലാത്ത ക്രമം [ഓർഡർ?] ഉപയോഗിച്ച് അടയാളപ്പെടുത്തുക. വാചകം: [ഇവിടെ]

4) സാധാരണ ഭാഷയിലേക്ക് നോർമലൈസേഷൻ (ഓപ്ഷണൽ, പ്രത്യേക ലെയർ):

ഇന്നത്തെ അക്ഷരവിന്യാസത്തിൽ ലളിതമായ ഒരു വായനാ പതിപ്പ് നിർമ്മിക്കുക, ഒരു പ്രത്യേക കോളത്തിൽ, ചുവടെയുള്ള തിരുത്തിയ ചരിത്ര വാചകത്തിന് മുകളിൽ. ഒറിജിനൽ വാചകം ഒരിക്കലും മാറ്റരുത്; ലളിതവൽക്കരണം ഒരു പ്രത്യേക പാളിയായിരിക്കട്ടെ. അർത്ഥം ചേർക്കാതെ സ്പെല്ലിംഗ്/ഉച്ചാരണം അപ്ഡേറ്റ് ചെയ്യുക. യഥാർത്ഥം: [ഇവിടെ]

ദുർബലമായ പ്രോംപ്റ്റ് / ശക്തമായ പ്രോംപ്റ്റ്

ദുർബല:

ഈ OCR ടെക്‌സ്‌റ്റ് ശരിയാക്കി മനോഹരമാക്കുക.

"ബ്യൂട്ടിഫൈ" ടെക്‌സ്‌റ്റ് മാറ്റിയെഴുതാനും ഒഴിവാക്കലുകൾ വരുത്താനും ഉള്ളടക്കം വ്യാഖ്യാനിക്കാനും AI-യെ അനുവദിക്കുന്നു; വിശ്വസ്തത തകർക്കുന്നു.

ശക്തമായ:

ഈ അസംസ്‌കൃത OCR ഔട്ട്‌പുട്ടിൽ ഒപ്റ്റിക്കൽ തിരിച്ചറിയൽ പിശകുകൾ മാത്രം പരിഹരിക്കുക. അർത്ഥം വ്യാഖ്യാനിക്കരുത്, വാക്കുകൾ ചേർക്കുക/ഇല്ലാതാക്കുക, വായിക്കാൻ കഴിയാത്ത ഭാഗങ്ങൾ [?] ഉപയോഗിച്ച് വിടുക, നമ്പറുകളും തീയതികളും മാറ്റരുത്. നിങ്ങൾ ചെയ്യുന്ന ഓരോ തിരുത്തലും "ഒറിജിനൽ → തിരുത്തൽ" എന്ന ഫോർമാറ്റിൽ ഒരു പ്രത്യേക ലിസ്റ്റിൽ കാണിക്കുക, അതുവഴി എനിക്ക് അത് പരിശോധിക്കാനാകും. വാചകം: [ഇവിടെ]

വ്യത്യാസം: ബൗണ്ടഡ് ഡ്യൂട്ടി, ഫാബ്രിക്കേഷൻ നിരോധനം, അവ്യക്തത അടയാളപ്പെടുത്തൽ, തിരുത്തലുകളുടെ കണ്ടെത്താവുന്ന പട്ടിക എന്നിവ ഔട്ട്‌പുട്ടിനെ ഓഡിറ്റബിൾ ആക്കുന്നു.

സാധാരണ തെറ്റുകൾ

  • കുറഞ്ഞ റെസല്യൂഷനിൽ സ്കാൻ ചെയ്യുന്നു. മിക്ക OCR പിശകുകളും മോശമായ ചിത്രങ്ങൾ കാരണമാണ്; ഗുണനിലവാരമുള്ള സ്കാനിംഗ് ആണ് ഏറ്റവും വിലകുറഞ്ഞ നിക്ഷേപം.
  • AI-യെ "മനോഹരമാക്കുക" എന്ന് വിളിക്കുന്നു. ഇത് വിശ്വസ്തതയെക്കാൾ ഒഴുക്ക് ഉണ്ടാക്കുന്നു; പ്രമാണം മാറ്റിയെഴുതിയിരിക്കുന്നു.
  • നമ്പറുകളും തീയതികളും AI-ക്ക് വിടുന്നു. സന്ദർഭത്തിൽ നിന്ന് "തിരുത്തുമ്പോൾ" ഇവ നിശബ്ദമായി കേടാകുന്നു; ചിത്രം പരിശോധിച്ചുറപ്പിക്കേണ്ടതാണ്.
  • വായിക്കാൻ പറ്റാത്ത ഇടം ഊഹത്തോടെ പൂരിപ്പിക്കുന്നു. ഇത് അനിശ്ചിതത്വത്താൽ സംരക്ഷിക്കപ്പെടണം [?], ഉണ്ടാക്കിയതല്ല.
  • സാമ്പിൾ ചെയ്യുന്നതിനുപകരം ഒട്ടും നിയന്ത്രിക്കുന്നില്ല. 96% കൃത്യത എന്നതിനർത്ഥം 12,000 പേജുകളിൽ ആയിരക്കണക്കിന് പിശകുകൾ; നിർണായക മേഖലകൾ സ്കാൻ ചെയ്യുന്നു.

ചുരുക്കത്തിൽ

അച്ചടിച്ച ചരിത്ര രേഖകളെ തിരയാനാകുന്ന വാചകമാക്കി മാറ്റിക്കൊണ്ട് OCR ഗവേഷകർക്ക് ആർക്കൈവുകൾ തുറക്കുന്നു. അസംസ്‌കൃത OCR ഔട്ട്‌പുട്ടിലെ പ്രതീക പിശകുകൾ സന്ദർഭത്തിനനുസരിച്ച് ശരിയാക്കുന്നതിനുള്ള ശക്തമായ സഹായമാണ് AI; എന്നാൽ എഡിറ്റിംഗും റീറൈറ്റിംഗും തമ്മിലുള്ള രേഖ നിങ്ങൾ വരയ്ക്കണം. ഉയർന്ന നിലവാരമുള്ള സ്കാനിംഗ്, സുരക്ഷിതമായ തിരുത്തൽ നിർദ്ദേശം, [?] ഉപയോഗിച്ച് അവ്യക്തത സംരക്ഷിക്കൽ, പേരുകൾ/തീയതികൾ/നമ്പറുകൾ എന്നിവയുടെ മനുഷ്യ നേത്ര പരിശോധന എന്നിവ ഡിജിറ്റൈസേഷനെ വേഗത്തിലും വിശ്വസനീയവുമാക്കുന്നു. AI ടെക്സ്റ്റ് വൃത്തിയാക്കുന്നു; നിങ്ങൾ വിശ്വസ്തതയുടെ കാവൽക്കാരനാണ്.

ആപ്ലിക്കേഷൻ ടാസ്ക്

അച്ചടിച്ച ചരിത്രരേഖ (പഴയ പത്രം, ഔദ്യോഗിക കത്ത്, പുസ്തക പേജ്) സ്കാൻ ചെയ്യുക അല്ലെങ്കിൽ OCR പ്രിൻ്റൗട്ട് എടുക്കുക. "സുരക്ഷിത OCR തിരുത്തൽ" ടെംപ്ലേറ്റ് ഉപയോഗിച്ച് ടെക്സ്റ്റ് ശരിയാക്കുകയും "യഥാർത്ഥ → തിരുത്തൽ" ലിസ്റ്റ് വഴി തിരുത്തലുകൾ ആവശ്യപ്പെടുകയും ചെയ്യുക. തുടർന്ന്, "OCR ഗുണനിലവാര റിപ്പോർട്ട്" ഉപയോഗിച്ച് മനുഷ്യ നിയന്ത്രണം ആവശ്യമായ പ്രദേശങ്ങൾ നീക്കം ചെയ്യുക. പട്ടികയിലെ ഓരോ തീയതിയും ശരിയായ പേരും യഥാർത്ഥ ചിത്രവുമായി താരതമ്യം ചെയ്യുക; എത്രയെണ്ണം തെറ്റായി "തിരുത്തപ്പെട്ടു" എന്ന് ശ്രദ്ധിക്കുക.

ചെക്ക്ലിസ്റ്റ്

  • [ ] കുറഞ്ഞത് 300 ഡിപിഐയും നല്ല കോൺട്രാസ്റ്റും ഉപയോഗിച്ച് ഞാൻ ഡോക്യുമെൻ്റ് സ്കാൻ ചെയ്തു.
  • [ ] ഞാൻ AI യോട് ഒപ്റ്റിക്കൽ പിശക് തിരുത്താൻ മാത്രമാണ് ആവശ്യപ്പെട്ടത്, തിരുത്തിയെഴുതാനല്ല.
  • [?] വായിക്കാൻ കഴിയാത്ത ഭാഗങ്ങൾ ഞാൻ സംരക്ഷിച്ചു.
  • [ ] ചിത്രത്തിനൊപ്പം എല്ലാ നമ്പറുകളും തീയതികളും ശരിയായ പേരുകളും ഞാൻ പരിശോധിച്ചു.
  • [ ] ഞാൻ നിർണായക മേഖലകളിൽ ഒരു സാമ്പിൾ അല്ലെങ്കിൽ പൂർണ്ണ പരിശോധന നടത്തി.