ඒකක
1. ඉතිහාසය සහ ලේඛනාගාරයේ කෘතිම බුද්ධිය හැඳින්වීම: භූමිකාවන්, සීමාවන්, වලංගුකරණය සහ ආචාර ධර්ම 2. ලේඛන ඩිජිටල්කරණය සහ OCR: මුද්‍රිත පෙළ යන්ත්‍ර පෙළ බවට පරිවර්තනය කිරීම 3. පිටපත: ඔටෝමන් තුර්කි සහ අත්පිටපත් 4. පාරදත්ත, නාමාවලිය සහ වර්ගීකරණය 5. මූලාශ්‍ර පරිලෝකනය, සොයාගැනීම සහ සාරාංශගත කිරීම 6. ඓතිහාසික පරිවර්තනය සහ සරල කිරීම 7. මූලාශ්‍ර සත්‍යාපනය, අනාත්මවාදය සහ මායාව 8. අන්තර්ගත විශ්ලේෂණය සහ රටා සොයාගැනීම 9. සංරක්ෂිත ප්රවේශය, විස්තරය සහ පරිශීලක සේවා 10. සංරක්ෂණය, ප්‍රතිසංස්කරණය සහ ඩිජිටල් සංරක්ෂණය 11. ආචාර ධර්ම, ප්‍රකාශන හිමිකම, පෞද්ගලිකත්වය සහ සංස්කෘතික සංවේදීතාව 12. අන්තයේ සිට අවසානය දක්වා ව්‍යාපෘතිය: කෘතිම බුද්ධිය සමඟ සංරක්ෂිත එකතුවක් සැකසීම
ඒකකය 2 / 12

ලේඛන ඩිජිටල්කරණය සහ OCR: මුද්‍රිත පෙළ යන්ත්‍ර පෙළ බවට පරිවර්තනය කිරීම

ලාභ:

  • ඩිජිටල්කරණය සහ OCR කාර්ය ප්‍රවාහය (ස්කෑන් කිරීම, පෙර-සැකසීම, හඳුනාගැනීම, නිවැරදි කිරීම, සත්‍යාපනය) පියවරෙන් පියවර සැකසීමේ හැකියාව
  • නිවැරදි කිරීම සහ රේඛාව නැවත ලිවීම සහ [?] සමඟ අපැහැදිලි බව සලකුණු කිරීම පවත්වා ගනිමින් සන්දර්භය සමඟ OCR දෝෂ නිවැරදි කිරීමට AI භාවිතා කිරීමේ හැකියාව
  • අංක, දිනයන් සහ නිසි නම් දෘශ්‍යමය වශයෙන් සත්‍යාපනය කළ යුත්තේ මන්දැයි සහ තත්ත්ව පාලනයේ කාර්යභාරය තේරුම් ගන්න.

ලේඛනාගාරයක හෝ පුස්තකාලයක භෞතික රාක්කවල ඇති පිටු මිලියන ගණනක් පර්යේෂකයාට සැබවින්ම විවෘත වන්නේ ඒවා ඩිජිටල්කරණය වී සෙවිය හැකි වූ විට පමණි. ඩිජිටල්කරණය යනු භෞතික ලේඛනයක් ස්කෑන් කිරීම හෝ ඡායාරූපගත කිරීම මගින් ඩිජිටල් රූපයක් බවට පරිවර්තනය කිරීමයි. නමුත් පිටුවක ඡායාරූපයක් තවමත් "පෙළ" නොවේ; පරිගණකයට එය තවමත් රූපයකි, ඔබට එහි සෙවිය නොහැක. OCR ක්‍රියාත්මක වන්නේ මෙහිදීය.

OCR (Optical Character Recognition) යනු ලේඛන රූපයක මුද්‍රිත අකුරු හඳුනාගෙන ඒවා යන්ත්‍රයෙන් කියවිය හැකි, සෙවිය හැකි පෙළ බවට පරිවර්තනය කරන තාක්ෂණයකි. මෙම ඒකකයේදී, OCR සමඟින් ඓතිහාසික මුද්‍රිත ලේඛන ඩිජිටල්කරණය කරන්නේ කෙසේද, මෙම ක්‍රියාවලියේදී OCR දෝෂ නිවැරදි කිරීමට AI උදව් කරන්නේ කෙසේද සහ මිනිස් ඇස අත්‍යවශ්‍ය වන්නේ කෙසේද යන්න ඉගෙන ගනු ඇත. (අතින් අකුරු සඳහා වෙනත් තාක්ෂණයක් අවශ්‍ය වේ; අපි එය ඊළඟ ඒකකයෙන් ආවරණය කරන්නෙමු.)

ඩිජිටල්කරණ කාර්ය ප්රවාහය: පියවරෙන් පියවර

1. සකස් කිරීම සහ පිරික්සීම. හැකි ඉහළම ගුණාත්මක භාවයෙන් ලේඛනය පරිලෝකනය කරන්න. ඓතිහාසික පර්යේෂණ සඳහා සාමාන්ය රීතියක් වන්නේ අවම වශයෙන් 300-400 DPI (අඟලකට තිත්) විභේදනයකි. අඩු විභේදනය ඊළඟ OCR අදියරේදී දෝෂ අනුපාතය අහස උසට නැඟේ.

2. රූප පෙර සැකසුම්. OCR ට පෙර රූපය වැඩි දියුණු කිරීම සාර්ථකත්වය බෙහෙවින් වැඩි කරයි: ස්කෑන් කළ පිටුව deskewing, කැළැල් ඉවත් කිරීම, වෙනස වැඩි කිරීම, කළු සහ සුදු බවට පරිවර්තනය කිරීම. නවීන AI මත පදනම් වූ මෙවලම් මෙම පියවර ස්වයංක්‍රීය කළ හැක.

3. OCR යෙදුම. ඔබ OCR එන්ජිමට රූපය පෝෂණය කරන්න; එන්ජිම අකුරු හඳුනාගෙන පෙළ නිපදවයි. ප්‍රතිදානය සාමාන්‍යයෙන් ස්ථර දෙකකින් සමන්විත වේ: දෘශ්‍ය ලේඛන රූපය සහ "සෙවිය හැකි සැඟවුණු පෙළ ස්ථරයක්" යටින්.

4. නිවැරදි කිරීම (පශ්චාත් නිවැරදි කිරීම). අමු OCR ප්‍රතිදානය කිසි විටෙකත් පරිපූර්ණ නොවේ. පැරණි අකුරු, කහ පැහැති කඩදාසි, තීන්ත ආලේප කිරීම සහ ස්කෑන් කිරීමේ දෝෂ හේතුවෙන් අක්ෂර වැරදි ලෙස කියවනු ලැබේ. AI ප්‍රබල සහායකයෙකු වන්නේ මෙහිදීය: එය සන්දර්භය භාවිතයෙන් OCR දෝෂ යෝජනා කරයි සහ නිවැරදි කරයි.

5. සත්‍යාපනය සහ තත්ත්ව පාලනය. නිවැරදි කරන ලද පෙළ මිනිසා විසින් නියැදි පදනමක් මත හෝ සම්පූර්ණයෙන්ම පරීක්ෂා කරනු ලැබේ. විශේෂයෙන් නම්, දින සහ අංක වැනි තීරණාත්මක ක්ෂේත්‍ර දෘශ්‍යමය වශයෙන් සත්‍යාපනය කළ යුතුය.

OCR වැරදි කරන්නේ ඇයි, AI උදව් කරන්නේ කෙසේද?

ඓතිහාසික ලේඛනවල OCR වලට අභියෝග කරන සාමාන්‍ය ගැටළු: පැරණි සහ විසිතුරු අකුරු, දිගු "s" (ſ), තීරු දෙකක පිටු සැකැස්ම, පාද සටහන්, අතින් ලියන ලද ඇතුල් කිරීම්, මුද්‍රා සහ වියැකී ගිය තීන්ත වැනි යල්පැන ගිය අකුරු. OCR එන්ජිමක් අකුරු එකින් එක "බලන" නිසා, එය ද්විමය "rn" "m" ලෙසත්, "l" අකුර "1" ලෙසත්, "O" අකුර "0" ලෙසත් ව්‍යාකූල කරයි.

AI භාෂා ආකෘති මෙහි වෙනස් බලයක් ලබා දෙයි: ඔවුන් සන්දර්භය තේරුම් ගනී. OCR එන්ජිමක් "1stanbu1" ලිව්වේ නම්, එය "Istanbul" විය යුතු බව සන්දර්භය අනුව AI හට අනුමාන කළ හැක. නමුත් මෙහි විශාල අනතුරක් තිබේ: "නිවැරදි කිරීමේදී" AI හට පෙළ වෙනස් කළ හැකිය. ඔහුට නොපවතින වචනයක් "මම නිවැරදි කළෙමි" එක් කිරීමට හෝ ඔහුගේම අනුමානයෙන් අපැහැදිලි ස්ථානයක් පුරවා ගත හැකිය. මෙය පිටපත් කිරීමේ විශ්වාසවන්තභාවයට බාධා කරයි.

අවවාදයයි: OCR නිවැරදි කිරීමේ ස්වර්ණමය රීතිය මෙයයි: AI නිවැරදි කළ යුත්තේ පැහැදිලි හඳුනාගැනීමේ දෝෂ පමණි, පෙළෙහි අන්තර්ගතය අර්ථ නිරූපණය කිරීම හෝ අතිරේක කිරීම නොවේ. "1stanbu1 → ඉස්තාන්බුල්" නීත්‍යානුකූලයි; කියවිය නොහැකි වචනයක් අනුමානවලින් පිරවීම නොවේ. අවිනිශ්චිත ස්ථාන [?] ලෙස සලකුණු කළ යුතු අතර ඒවා සෑදිය යුතු නොවේ.

OCR දෝෂ වර්ග සහ වගුවක් සමඟ ප්‍රවේශය

දෝෂ වර්ගය

උදාහරණයක්

AI එය නිවැරදි කළ හැකිද?

මානව පාලනය

චරිත මිශ්ර කිරීම

rn↔m, l↔1, O↔0

ඔව්, එය ආරක්ෂිතයි

නියැදිය

පැරණි අකුරු ආකෘතිය

දිගු ſ → s

ඔව්, එය ආරක්ෂිතයි

නියැදිය

වියැකී ගිය / කියවිය නොහැකි වචනය

"ka___n"

නැත, තැබිය යුතුය [?]

අනිවාර්යය

නිසි නම / ස්ථානයේ නම

"කොන්ස්ටන්ටිනියේ"

පරිස්සමෙන්

අනිවාර්යය

අංකය/දිනය

"1867" එදිරිව "1857"

අවදානම් සහිතයි

අනිවාර්යය

පිටු පිරිසැලසුම (තීරුව/පාද සටහන)

මිශ්ර ප්රවාහය

අර්ධ වශයෙන්

අනිවාර්යය

පින්තූරය එක් වාක්‍යයකින් සාරාංශ කිරීමට: AI සාමාන්‍ය අක්ෂර දෝෂ විශ්වාසදායක ලෙස පිරිසිදු කරයි; නමුත් විශේෂ නම්, අංක, දින සහ කියවිය නොහැකි ස්ථාන සඳහා මිනිස් ඇස් අවශ්‍ය වේ.

කුඩා නඩු තුනක්

නඩුව 1 - පුවත්පත් ලේඛනාගාරය සෙවිය හැකි විය. විශ්වවිද්‍යාල පුස්තකාලයක් 1930 ගණන්වල සිට දේශීය පුවත්පත් පිටු 12,000ක් ඩිජිටල්කරණය කර ඇත. අමු OCR නිරවද්‍යතාවය ඇස්තමේන්තුගත 82% (සෑම අක්ෂර 100 න් 18ක්ම වැරදියි). AI මත පදනම් වූ නිවැරදි කිරීම පුවත්පත් භාෂාවට සුදුසු ශබ්දකෝෂයක් සහ සන්දර්භය සමඟ නිරවද්‍යතාව 96% දක්වා වැඩි කළේය. ඉතිරි දෝෂ සඳහා, සම්පූර්ණ පාඨයට වඩා නියැදි පරීක්ෂාවක් සිදු කරන ලදී; එකතුව සති 3කින් සෙවිය හැකි විය.

නඩුව 2 - AI "නිවැරදි" සහ විකෘති ඉතිහාසය. ලේඛනාගාරයක් විසින් OCR මුද්‍රණයේ "1863" දිනය නිවැරදි කර ඇත. AI විසින් සන්දර්භය තුළ වෙනත් සිදුවීමක් දෙස බැලීමෙන් "1868" දිනය "නිවැරදි කර ඇත" - ලේඛනයේ පැහැදිලිව 1863 ලෙස සඳහන් වුවද. ලේඛනාගාරය මුල් රූපය දෙස නොබැලුවේ නම්, නාමාවලිය වැරදි දිනයක් ඇතුළත් කිරීමට ඉඩ තිබුණි. පාඩම: අංක සහ දින AI වෙත කිසිදා ඉතිරි නොවේ, ඒවා රූපය සමඟින් සත්‍යාපනය කෙරේ.

3 වන අවස්ථාව - තීරු දෙකක පිටුව ව්‍යාකූල වී ඇත. 19 වැනි සියවසේ වාර්ෂික පොතක තීරු දෙකකින් යුත් පිටු OCR හි තනි ප්‍රවාහයකට මිශ්‍ර කර වාක්‍ය එකිනෙකට බැඳී ඇත. අමු ප්‍රතිදානය කියවිය නොහැකි විය. මම මුලින්ම පිටු පිරිසැලසුම කලාපවලට (ඛණ්ඩනය) බෙදා එක් එක් තීරුව වෙන වෙනම සකසන විට පෙළ වැඩිදියුණු විය. පාඩම: සංකීර්ණ පිටු සැකැස්ම තුළ, ව්‍යුහය පළමුව, පෙළ දෙවනුව.

පිටපත් කළ හැකි සැකිලි හතරක්

1) ආරක්ෂිත OCR නිවැරදි කිරීම:

පහත දැක්වෙන්නේ ඓතිහාසික ලේඛනයක අමු OCR ප්‍රතිදානයයි. ඔබේ කාර්යය වන්නේ පැහැදිලි දෘශ්‍ය හඳුනාගැනීමේ දෝෂ නිවැරදි කිරීම පමණි (උදා: rn→m,1→l, 0→O, long ſ→s). රීති: (1) පාඨයේ තේරුම අර්ථකථනය කරන්න. (2) කියවිය නොහැකි/අපැහැදිලි වචන නිවැරදි කරන්න, එලෙසම තබා [?] සමඟ ලකුණු කරන්න. (3) වාක්‍ය එකතු කිරීම, ඉවත් කිරීම හෝ සම්පූර්ණ කිරීම නැත. (4) අංක සහ දිනයන් වෙනස් කරන්න; සැකයක් ඇත්නම් [අංකය?] සලකුණු කරන්න. අමු OCR: [මෙහි]

2) OCR තත්ත්ව වාර්තාව:

පහත OCR ප්‍රතිදානය පරීක්‍ෂා කර තත්ත්ව වාර්තාවක් ඉදිරිපත් කරන්න: (1) හැකි හඳුනාගැනීමේ දෝෂ සහිත වචන ලැයිස්තුගත කරන්න, (2) කියවිය නොහැකි/පැහැදිලි ලෙස පෙනෙන ප්‍රදේශ සලකුණු කරන්න, (3) මානව පරීක්ෂාව අවශ්‍ය නිශ්චිත නම්, දින සහ අංක ලැයිස්තුගත කරන්න. නිවැරදි නොකරන්න; පිරික්සුම් ලැයිස්තුව පමණක් උත්පාදනය කරන්න.පෙළ: [මෙහි]

3) තීරු/ව්‍යුහ විග්‍රහ කිරීමේ උදවු:

පහත OCR පෙළ තීරු දෙකක පිටුවකින් එන නිසා, ප්‍රවාහය ව්‍යාකූල විය හැක. පෙළ තාර්කික ඡේදවලට නැවත සකසන්න නමුත් වචන කිසිවක් වෙනස් නොකරන්න, එකතු කරන්න හෝ මකන්න එපා. ඇණවුම නිවැරදි කරන්න. ඔබට විශ්වාස නැති ඇණවුම [ඇණවුම?] සමඟ ලකුණු කරන්න. පෙළ: [මෙහි]

4) සම්මත භාෂාවට සාමාන්‍යකරණය (විකල්ප, වෙනම ස්ථරය):

පහත නිවැරදි කළ ඉතිහාස පාඨයට ඉහළින්, වෙනම තීරුවක, අද අක්ෂර වින්‍යාසය තුළ සරල කියවීමේ අනුවාදයක් නිෂ්පාදනය කරන්න. කිසිවිටක මුල් පෙළ වෙනස් නොකරන්න; සරල කිරීම වෙනම ස්ථරයක් වීමට ඉඩ දෙන්න. තේරුම එකතු නොකර අක්ෂර වින්‍යාසය/උච්චාරණය යාවත්කාලීන කරන්න. මුල් පිටපත: [මෙහි]

දුර්වල ක්ෂණික / ශක්තිමත් විමසුම

දුර්වල:

මෙම OCR පෙළ නිවැරදි කර අලංකාර කරන්න.

"අලංකාර කිරීම" AI හට පෙළ නැවත ලිවීමට, අතපසුවීම් සෑදීමට සහ අන්තර්ගතය අර්ථ නිරූපණය කිරීමට ඉඩ දෙයි; පක්ෂපාතීත්වය බිඳ දමයි.

ශක්තිමත්:

මෙම අමු OCR ප්‍රතිදානයේ දෘශ්‍ය හඳුනාගැනීමේ දෝෂ පමණක් නිවැරදි කරන්න. තේරුම අර්ථකථනය නොකරන්න, වචන එකතු කරන්න/මකන්න, [?] සමඟ කියවිය නොහැකි කොටස් තබන්න, අංක සහ දින වෙනස් කරන්න. ඔබ කරන සෑම නිවැරදි කිරීමක්ම "මුල් → නිවැරදි කිරීම" ආකෘතියෙන් වෙනම ලැයිස්තුවක පෙන්වන්න එවිට මට එය සත්‍යාපනය කළ හැක. පෙළ: [මෙහි]

වෙනස: සීමා සහිත රාජකාරිය, ප්‍රබන්ධ කිරීම තහනම් කිරීම, අපැහැදිලි බව සලකුණු කිරීම සහ සොයා ගත හැකි නිවැරදි කිරීම් ලැයිස්තුව ප්‍රතිදානය විගණනය කළ හැකි කරයි.

පොදු වැරදි

  • අඩු විභේදනයකින් ස්කෑන් කිරීම. බොහෝ OCR දෝෂ ඇති වන්නේ නරක රූප නිසා ය; ගුණාත්මක ස්කෑනිං යනු ලාභම ආයෝජනයයි.
  • AI ඇමතීම "ලස්සන කරන්න" මෙය විශ්වාසවන්තභාවයට වඩා චතුර ලෙස නිපදවයි; ලේඛනය නැවත ලියා ඇත.
  • අංක සහ දිනයන් AI වෙත තැබීම. සන්දර්භයෙන් "නිවැරදි" කළ විට මේවා නිහඬව දූෂිත වේ; රූපය මගින් තහවුරු කළ යුතුය.
  • අනුමානයකින් කියවිය නොහැකි ප්‍රදේශය පිරවීම. එය සෑදිය යුතු නොව අවිනිශ්චිතතාවයෙන් [?] ආරක්ෂා කළ යුතුය.
  • නියැදීම වෙනුවට කිසිසේත් පාලනය නොවේ. 96% නිරවද්‍යතාවයක් යනු පිටු 12,000 ක වැරදි දහස් ගණනක් ඇත; විවේචනාත්මක ප්රදේශ ස්කෑන් කරනු ලැබේ.

සාරාංශයක් ලෙස

OCR විසින් මුද්‍රිත ඓතිහාසික ලේඛන සෙවිය හැකි පෙළ බවට පරිවර්තනය කිරීමෙන් පර්යේෂකයන්ට ලේඛනාගාර විවෘත කරයි. AI යනු සන්දර්භය සමඟ අමු OCR ප්‍රතිදානයේ අක්ෂර දෝෂ නිවැරදි කිරීමේ ප්‍රබල උපකාරයකි; නමුත් ඔබ සංස්කරණය සහ නැවත ලිවීම අතර රේඛාව ඇඳිය ​​යුතුය. උසස් තත්ත්වයේ ස්කෑන් කිරීම, ආරක්ෂිත නිවැරදි කිරීම් උපදෙස්, [?] සමඟ අපැහැදිලි බව ආරක්ෂා කිරීම, සහ නම්/දිනයන්/අංකවල මානව ඇසින් සත්‍යාපනය කිරීම ඩිජිටල්කරණය වේගවත් සහ විශ්වාසදායක කරයි. AI පෙළ පිරිසිදු කරයි; විශ්වාසවන්තභාවයේ භාරකරු ඔබයි.

යෙදුම් කාර්යය

මුද්‍රිත ඓතිහාසික ලේඛනයක් පරිලෝකනය කරන්න (පැරණි පුවත්පත, නිල ලිපිය, පොත් පිටුව) හෝ OCR මුද්‍රණයක් ගන්න. “ආරක්ෂිත OCR නිවැරදි කිරීම්” අච්චුව සමඟ පෙළ නිවැරදි කර “මුල් → නිවැරදි කිරීම්” ලැයිස්තුව හරහා නිවැරදි කිරීම් ඉල්ලා සිටින්න. ඉන්පසුව, "OCR තත්ත්ව වාර්තාව" සමඟ මානව පාලනය අවශ්‍ය ප්‍රදේශ ඉවත් කරන්න. ලැයිස්තුවේ එක් එක් දිනය සහ නියම නම සැබෑ රූපයට සසඳන්න; කොපමණ සංඛ්‍යාවක් වැරදි ලෙස "නිවැරදි කර ඇත" යන්න සටහන් කරන්න.

පිරික්සුම් ලැයිස්තුව

  • [ ] මම ලේඛනය අවම වශයෙන් DPI 300ක් සහ හොඳ ප්‍රතිවිරුද්ධතාවකින් ස්කෑන් කළෙමි.
  • [ ] මම AI ගෙන් ඉල්ලා සිටියේ දෘශ්‍ය දෝෂ නිවැරදි කිරීම සඳහා මිස නැවත ලිවීමක් නොවේ.
  • [ ] මම කියවිය නොහැකි කොටස් [?] සමඟ ආරක්ෂා කළෙමි.
  • [ ] මම රූපය සමඟ සියලුම අංක, දින සහ නියම නම් සත්‍යාපනය කළෙමි.
  • [ ] මම තීරණාත්මක ප්‍රදේශවල නියැදියක් හෝ සම්පූර්ණ පරීක්‍ෂණයක් කළා.