ክፍል 2 / 12

ሰነድ ዲጂታይዜሽን እና OCR፡ የታተመ ጽሑፍን ወደ ማሽን ጽሑፍ መለወጥ

ትርፍ፡

  • የዲጂታይዜሽን እና የ OCR የስራ ፍሰት (መቃኘት, ቅድመ-ሂደት, እውቅና, እርማት, ማረጋገጫ) ደረጃ በደረጃ የማዘጋጀት ችሎታ.
  • እርማቱን ጠብቀው እና መስመርን እንደገና በመፃፍ እና ግልጽነትን በ [?] ላይ ምልክት በማድረግ የ OCR ስህተቶችን ከአውድ ጋር ለማስተካከል AI የመጠቀም ችሎታ።
  • ቁጥሮች ፣ ቀናት እና ትክክለኛ ስሞች ለምን በምስል መረጋገጥ እንዳለባቸው እና የጥራት ቁጥጥር ሚናን ይረዱ።

በማህደር ወይም በቤተመፃህፍት አካላዊ መደርደሪያዎች ላይ ያሉት በሚሊዮን የሚቆጠሩ ገፆች ለተመራማሪው በእውነት የተከፈቱት ዲጂታይዝድ ሲሆኑ እና ሊፈለጉ የሚችሉ ሲሆኑ ብቻ ነው። ዲጂታል ማድረግ አካላዊ ሰነድን በመቃኘት ወይም ፎቶግራፍ በማንሳት ወደ ዲጂታል ምስል መለወጥ ነው። ግን የአንድ ገጽ ፎቶግራፍ ገና "ጽሑፍ" አይደለም; ለኮምፒዩተሩ አሁንም ምስል ነው, በእሱ ውስጥ መፈለግ አይችሉም. OCR የሚሠራበት ቦታ ይህ ነው።

OCR (Optical Character Recognition) በሰነድ ምስል ውስጥ የታተሙ ፊደላትን የሚያውቅ እና በማሽን የሚነበብ ወደሚፈለግ ጽሑፍ የሚቀይር ቴክኖሎጂ ነው። በዚህ ክፍል ውስጥ ታሪካዊ የታተሙ ሰነዶችን በ OCR እንዴት ዲጂታል ማድረግ እንደሚችሉ፣ AI በዚህ ሂደት ውስጥ የ OCR ስህተቶችን እንዴት እንደሚያስተካክል እና የሰው ዓይን አስፈላጊ በሚሆንበት ቦታ ላይ ይማራሉ ። (በእጅ የተጻፉ ጽሑፎች የተለየ ቴክኖሎጂ ይፈልጋሉ፤ ያንን በሚቀጥለው ክፍል እንሸፍናለን።)

የዲጂታል ስራ ሂደት: ደረጃ በደረጃ

1. ዝግጅት እና ማጣሪያ. ሰነዱን በተቻለ መጠን ከፍተኛ ጥራት ይቃኙ። ለታሪካዊ ምርምር አጠቃላይ መመሪያ ቢያንስ ከ300-400 ዲፒአይ (ነጥቦች በአንድ ኢንች) መፍትሄ ነው። ዝቅተኛ ጥራት በሚቀጥለው የ OCR ደረጃ የስህተት መጠኑን ከፍ ያደርገዋል።

2. የምስል ቅድመ ሂደት. ከኦሲአር በፊት ምስሉን ማሻሻል ስኬትን በእጅጉ ይጨምራል፡ የተቃኘውን ገጽ መሰረዝ፣ ጉድለቶችን ማስወገድ፣ ንፅፅርን መጨመር፣ ወደ ጥቁር እና ነጭ መለወጥ። ዘመናዊ AI ላይ የተመሰረቱ መሳሪያዎች ይህንን ደረጃ በራስ-ሰር ሊያደርጉት ይችላሉ.

3. OCR መተግበሪያ. ምስሉን ወደ OCR ሞተር ይመገባሉ; ሞተሩ ፊደላትን ይገነዘባል እና ጽሑፍ ይሠራል. ውጤቱ ብዙውን ጊዜ ሁለት ንብርብሮችን ያቀፈ ነው-የሚታየው የሰነድ ምስል እና ከስር "የሚፈለግ የተደበቀ የጽሑፍ ንብርብር"።

4. እርማት (ከእርማት በኋላ). የጥሬ OCR ውፅዓት ፍፁም አይደለም። በአሮጌ ቅርጸ-ቁምፊዎች፣ ቢጫ ቀለም በተቀባ ወረቀት፣ በቀለም መቀባት እና በመቃኘት ምክንያት ገጸ-ባህሪያት በስህተት ይነበባሉ። ይህ AI ኃይለኛ ረዳት የሆነበት ነው፡ አውድ በመጠቀም የ OCR ስህተቶችን ይጠቁማል እና ያርማል።

5. የማረጋገጫ እና የጥራት ቁጥጥር. የተስተካከለው ጽሑፍ በሰዎች የሚመረመረው በናሙና ወይም ሙሉ በሙሉ ነው። በተለይ ወሳኝ ቦታዎች እንደ ስሞች፣ ቀናት እና ቁጥሮች በምስል መረጋገጥ አለባቸው።

ለምን OCR ስህተቶችን ያደርጋል፣ AI እንዴት ይረዳል

በታሪካዊ ሰነዶች ውስጥ OCRን የሚፈታተኑ የተለመዱ ችግሮች፡ ያረጁ እና የሚያማምሩ ቅርጸ-ቁምፊዎች፣ ጊዜ ያለፈባቸው ፊደሎች እንደ ረጅም "s" (ſ)፣ ባለ ሁለት አምድ ገጽ አቀማመጥ፣ የግርጌ ማስታወሻዎች፣ በእጅ የተጻፈ ማስገቢያዎች፣ ማህተሞች እና የደበዘዘ ቀለም። ምክንያቱም የOCR ሞተር ፊደላትን አንድ በአንድ "ያያል" ሁለትዮሽ "rn" እንደ "m"፣ "l" የሚለው ፊደል "1" እና "O" የሚለውን ፊደል "0" በማለት በተደጋጋሚ ያደናግራቸዋል።

የ AI ቋንቋ ሞዴሎች እዚህ የተለየ ኃይል ይሰጣሉ: አውድ ይገነዘባሉ. አንድ የOCR ሞተር “1stanbu1” ከፃፈ፣ AI ከዐውደ-ጽሑፉ “ኢስታንቡል” መሆን እንዳለበት ሊገነዘብ ይችላል። ግን እዚህ ትልቅ አደጋ አለ: "ሲስተካከል" AI ጽሑፉን ሊለውጠው ይችላል. እሱ "አረምኩ" የማይለውን ቃል መጨመር ወይም ግልጽ ያልሆነ ቦታ በራሱ ግምት መሙላት ይችላል። ይህ የጽሑፍ ቅጂውን ታማኝነት ይረብሸዋል.

ጥንቃቄ፡ በ OCR እርማት ውስጥ ያለው ወርቃማ ህግ ይህ ነው፡ AI ግልጽ የሆኑ የማወቂያ ስህተቶችን ብቻ ማረም አለበት እንጂ የጽሑፉን ይዘት መተርጎም ወይም መሙላት የለበትም። "1stanbu1 → ኢስታንቡል" ህጋዊ ነው; የማይነበብ ቃል በግምቶች መሙላት አይደለም። እርግጠኛ ያልሆኑ ቦታዎች በ [?] ምልክት መደረግ አለባቸው እና መደረግ የለባቸውም።

የ OCR ስህተት ዓይነቶች እና አቀራረብ ከጠረጴዛ ጋር

የስህተት አይነት

ምሳሌ

AI ማስተካከል ይችላል?

የሰው ቁጥጥር

የቁምፊ ቅልቅል

rn↔m፣ l↔1፣ O↔0

አዎ ደህና ነው።

ናሙና

የድሮው ፊደል

ረጅም ſ → s

አዎ ደህና ነው።

ናሙና

የደበዘዘ/የማይነበብ ቃል

"ka__n"

አይ፣ ማስቀመጥ አለበት [?]

የግዴታ

ትክክለኛ ስም/የቦታ ስም

"ቆስጠንጢኒዬ"

ጥንቃቄ

የግዴታ

ቁጥር/ቀን

"1867" vs "1857"

አደገኛ

የግዴታ

የገጽ አቀማመጥ (አምድ/የግርጌ ማስታወሻ)

ድብልቅ ፍሰት

በከፊል

የግዴታ

ስዕሉን በአንድ ዓረፍተ ነገር ለማጠቃለል: AI በአስተማማኝ ሁኔታ የተለመዱ የቁምፊ ስህተቶችን ያጸዳል; ነገር ግን የሰው ዓይኖች ለየት ያሉ ስሞች, ቁጥሮች, ቀኖች እና የማይነበብ ቦታዎች ይፈለጋሉ.

ሶስት ጥቃቅን ጉዳዮች

ጉዳይ 1 — የጋዜጣ መዛግብት ሊፈለጉ የሚችሉ ሆኑ። የዩኒቨርሲቲ ቤተ መፃህፍት ከ1930ዎቹ ጀምሮ 12,000 የሀገር ውስጥ ጋዜጦችን ዲጂታል አድርጓል። የጥሬ OCR ትክክለኛነት 82% ይገመታል (ከ100 ቁምፊዎች 18ቱ የተሳሳቱ ናቸው)። AI ላይ የተመሠረተ እርማት ከጋዜጣ ቋንቋ ተስማሚ መዝገበ ቃላት እና አውድ ጋር ወደ 96% ጨምሯል። ለተቀሩት ስህተቶች, ከሙሉ ጽሑፍ ይልቅ የናሙና ፍተሻ ተካሂዷል; ክምችቱ በ3 ሳምንታት ውስጥ መፈለግ የሚቻል ሆኗል።

ጉዳይ 2 - AI "የታረመ" እና የተዛባ ታሪክ. አንድ አርኪቪስት በ OCR ህትመት ላይ "1863" የሚለውን ቀን AI አስተካክሏል. በዐውደ-ጽሑፉ ውስጥ ሌላ ክስተት በመመልከት AI ቀኑን ወደ "1868" "ያርመዋል" - ምንም እንኳን ሰነዱ በ 1863 በግልጽ ቢናገርም. የመዝገብ ቤቱ ባለሙያ ዋናውን ምስል ባይመለከት ኖሮ ካታሎግ ከተሳሳተ ቀን ጋር ያስገባ ነበር. ትምህርት: ቁጥሮች እና ቀናቶች ለኤአይኤ አይተዉም, በምስሉ የተረጋገጡ ናቸው.

ጉዳይ 3 - ባለ ሁለት አምድ ገጽ ግራ ተጋብቷል. የ19ኛው ክፍለ ዘመን የዓመት መጽሐፍ ባለ ሁለት አምድ ገፆች በOCR ውስጥ ወደ አንድ ዥረት ተደባልቀው እና ዓረፍተ ነገሩ እርስ በርስ የተያያዙ ነበሩ። የጥሬው ምርት ሊነበብ አልቻለም። የገጹን አቀማመጥ መጀመሪያ ወደ ክልሎች (ክፍልፋይ) ስከፋፍል እና እያንዳንዱን አምድ ለየብቻ ስሰራ ጽሑፉ ተሻሽሏል። ትምህርት: ውስብስብ የገጽ አቀማመጥ, መዋቅር መጀመሪያ, ጽሑፍ ሁለተኛ.

አራት ሊገለበጡ የሚችሉ አብነቶች

1) ደህንነቱ የተጠበቀ የ OCR እርማት;

ከታች ያለው የታሪካዊ ሰነድ ጥሬ OCR ውጤት ነው። የእርስዎ ተግባር ግልጽ የሆኑ የኦፕቲካል ማወቂያ ስህተቶችን ማረም ብቻ ነው (ለምሳሌ rn→m,1→l, 0→O, long ſ→s)። ሕጎች፡ (1) የጽሑፉን ትርጉም መተርጎም። (2) የማይነበብ/አሻሚ ቃላትን አስተካክል፣ እንዳለ ትተህ በ[?] ምልክት አድርግ። (3) ዓረፍተ ነገሮችን መጨመር፣ ማስወገድ ወይም ማጠናቀቅ የለም። (4) ቁጥሮችን እና ቀኖችን መለወጥ; ከተጠራጠሩ [ቁጥር?] ምልክት ያድርጉ። ጥሬ OCR፡ [እዚህ]

2) የ OCR ጥራት ሪፖርት;

ከዚህ በታች ያለውን የ OCR ውፅዓት ይመርምሩ እና የጥራት ሪፖርት ያቅርቡ፡ (1) የመለየት ስህተት ያለባቸውን ቃላት ይዘርዝሩ፣ (2) የማይነበቡ/ግልጽ ያልሆኑ የሚመስሉ ቦታዎችን ምልክት ያድርጉ፣ (3) የሰውን ፍተሻ የሚጠይቁ የተወሰኑ ስሞችን፣ ቀኖችን እና ቁጥሮችን ይዘርዝሩ። አታርም; የፍተሻ ዝርዝር ብቻ ይፍጠሩ። ጽሑፍ፡ [እዚህ]

3) አምድ/አወቃቀር የመተንተን እገዛ፡-

ከታች ያለው የOCR ጽሁፍ ከሁለት አምዶች ገጽ የመጣ ስለሆነ ፍሰቱ ግራ ሊጋባ ይችላል። ጽሑፉን ወደ አመክንዮአዊ አንቀጾች ያስተካክሉት ነገር ግን ምንም ቃላትን አይቀይሩ, አይጨምሩ ወይም አይሰርዙ. ትዕዛዙን ብቻ አስተካክል። እርግጠኛ ያልሆኑበትን ቅደም ተከተል በ[ትዕዛዝ?] ምልክት ያድርጉበት። ጽሑፍ: [እዚህ]

4) ወደ መደበኛ ቋንቋ ማመጣጠን (አማራጭ ፣ የተለየ ንብርብር)

ቀለል ያለ የንባብ እትም በዛሬው የፊደል አጻጻፍ፣ በተለየ አምድ፣ ከታች ከታረመው ታሪካዊ ጽሑፍ በላይ አዘጋጅ። ዋናውን ጽሑፍ በጭራሽ አይቀይሩት; ማቅለሉ የተለየ ንብርብር ይሁን. ትርጉሙን ሳትጨምር የፊደል አጻጻፍ/አጠራርን ብቻ አዘምን። የመጀመሪያው፡ [እዚህ]

ደካማ ጥያቄ / ጠንካራ ጥያቄ

ደካማ፡

ይህን የOCR ጽሁፍ አስተካክል እና አስውበው።

"ውበት" AI ጽሑፉን እንደገና እንዲጽፍ, የተሳሳቱ ነገሮችን እንዲያካሂድ እና ይዘቱን እንዲተረጉም ያስችለዋል; ታማኝነትን ያፈርሳል።

ጠንካራ፡

በዚህ ጥሬ የOCR ውፅዓት ውስጥ ያሉ የጨረር ማወቂያ ስህተቶችን ብቻ ያስተካክሉ። ትርጉም አትተረጎም፣ ቃላትን አትጨምር/ሰርዝ፣ የማይነበብ ክፍሎችን በ[?] ይተው፣ ቁጥሮችን እና ቀኖችን ይቀይሩ። እያንዳንዷን እርማት በተለየ ዝርዝር ውስጥ "ኦሪጅናል → እርማት" በሚለው ቅርፀት አሳየኝ እና ማረጋገጥ እንድችል። ጽሑፍ: [እዚህ]

ልዩነቱ፡ የተገደበ ግዴታ፣ በፋብሪካ ላይ መከልከል፣ ግልጽነት የጎደለው መሆኑን እና ሊታዩ የሚችሉ የማስተካከያ ዝርዝሮች ውጤቱን ኦዲት ያደርገዋል።

የተለመዱ ስህተቶች

  • በዝቅተኛ ጥራት በመቃኘት ላይ። አብዛኛዎቹ የ OCR ስህተቶች በመጥፎ ምስሎች የተከሰቱ ናቸው; የጥራት ቅኝት በጣም ርካሹ ኢንቨስትመንት ነው።
  • AI “አምር” በማለት በመጥራት። ይህ ከታማኝነት ይልቅ ቅልጥፍናን ያመጣል; ሰነዱ እንደገና ተጽፏል.
  • ቁጥሮቹን እና ቀኖቹን ወደ AI በመተው ላይ። እነዚህ ከዐውደ-ጽሑፉ "ሲታረሙ" በፀጥታ የተበላሹ ናቸው; በምስል መረጋገጥ አለበት።
  • የማይነበብበትን ቦታ በግምት መሙላት። በጥርጣሬ [?] ሊጠበቅ ይገባል እንጂ አልተሰራም።
  • ከናሙና ይልቅ ጨርሶ አለመቆጣጠር። የ 96% ትክክለኛነት እንኳን በ 12,000 ገጾች ውስጥ በሺዎች የሚቆጠሩ ስህተቶች ማለት ነው; ወሳኝ ቦታዎች ይቃኛሉ.

በማጠቃለያው

OCR የታተሙ ታሪካዊ ሰነዶችን ወደ ተፈላጊ ጽሑፍ በመቀየር ለተመራማሪዎች ማህደሮችን ይከፍታል። AI በጥሬው የ OCR ውፅዓት ከዐውደ-ጽሑፉ ጋር የቁምፊ ስህተቶችን ለማስተካከል ኃይለኛ እርዳታ ነው። ነገር ግን በአርትዖት እና በድጋሚ በመፃፍ መካከል ያለውን መስመር መሳል አለብዎት. ከፍተኛ ጥራት ያለው ቅኝት፣ አስተማማኝ የእርምት መመሪያ፣ አሻሚነትን በ [?] መጠበቅ፣ እና የሰው ዓይንን የስም/የቀናት/ቁጥሮችን ማረጋገጥ ዲጂታይዜሽን ፈጣን እና አስተማማኝ ያደርገዋል። AI ጽሑፍን ያጸዳል; አንተ የታማኝነት ጠባቂ ነህ።

የመተግበሪያ ተግባር

የታተመ ታሪካዊ ሰነድ (የድሮ ጋዜጣ፣ ኦፊሴላዊ ደብዳቤ፣ የመፅሃፍ ገጽ) ይቃኙ ወይም የ OCR ህትመት ይውሰዱ። ጽሑፉ በ"Secure OCR ማስተካከያ" አብነት እንዲታረም ያድርጉ እና በ"የመጀመሪያው → እርማት" ዝርዝር በኩል እርማቶችን ይጠይቁ። ከዚያም የሰው ቁጥጥር የሚጠይቁትን ቦታዎች በ "OCR የጥራት ሪፖርት" ያስወግዱ. በዝርዝሩ ውስጥ ያለውን እያንዳንዱን ቀን እና ትክክለኛ ስም ከእውነተኛው ምስል ጋር ያወዳድሩ; ስንቶቹ በስህተት "እንደታረሙ" ልብ ይበሉ።

የማረጋገጫ ዝርዝር

  • [ ] ሰነዱን ቢያንስ በ300 ዲፒአይ እና በጥሩ ንፅፅር ቃኘሁት።
  • [] AI ን የጠየቅኩት የጨረር ስህተት እንዲስተካከል እንጂ እንደገና ለመፃፍ አይደለም።
  • [] የማይነበብባቸውን ክፍሎች በ[?] ጠብቄአለሁ።
  • [ ] ሁሉንም ቁጥሮች፣ ቀኖች እና ትክክለኛ ስሞች በምስሉ አረጋግጫለሁ።
  • [] ወሳኝ በሆኑ ቦታዎች ላይ ናሙና ወይም ሙሉ ቼክ አደረግሁ።