Njësia 2 / 12

Dixhitalizimi i dokumenteve dhe OCR: Konvertimi i tekstit të printuar në tekst të makinës

Fitimet:

  • Aftësia për të vendosur dixhitalizimin dhe rrjedhën e punës OCR (skanim, përpunim paraprak, njohje, korrigjim, verifikim) hap pas hapi
  • Aftësia për të përdorur AI për të korrigjuar gabimet OCR me kontekstin duke ruajtur linjën e korrigjimit dhe rishkrimit dhe duke shënuar paqartësitë me [?]
  • Kuptoni pse numrat, datat dhe emrat e duhur duhet të verifikohen vizualisht dhe rolin e kontrollit të cilësisë.

Miliona faqe në raftet fizike të një arkivi ose biblioteke i hapen vërtet studiuesit vetëm kur ato bëhen të dixhitalizuara dhe të kërkueshme. Dixhitalizimi është konvertimi i një dokumenti fizik në një imazh dixhital duke e skanuar ose fotografuar atë. Por një fotografi e një faqeje nuk është ende "tekst"; Për kompjuterin është ende një imazh, nuk mund të kërkosh në të. Këtu hyn në lojë OCR.

OCR (Optical Character Recognition) është një teknologji që njeh shkronjat e printuara në një imazh dokumenti dhe i konverton ato në tekst të lexueshëm dhe të kërkueshëm nga makina. Në këtë njësi, do të mësoni se si të dixhitalizoni dokumentet e printuara historike me OCR, se si AI ndihmon në korrigjimin e gabimeve OCR në këtë proces dhe ku syri i njeriut është thelbësor. (Tekstet e shkruara me dorë kërkojnë një teknologji tjetër; ne do ta mbulojmë atë në njësinë tjetër.)

Rrjedha e punës e dixhitalizimit: hap pas hapi

1. Përgatitja dhe shqyrtimi. Skanoni dokumentin me cilësinë më të lartë të mundshme. Një rregull i përgjithshëm për kërkimin historik është një rezolucion prej të paktën 300-400 DPI (pika për inç). Rezolucioni i ulët e rrit shkallën e gabimit në fazën pasuese të OCR.

2. Parapërpunimi i imazhit. Përmirësimi i imazhit përpara OCR rrit shumë suksesin: heqja e faqes së skanuar, heqja e defekteve, rritja e kontrastit, konvertimi në bardh e zi. Mjetet moderne të bazuara në AI mund ta automatizojnë këtë hap.

3. Aplikimi OCR. Ju ushqeni imazhin në motorin OCR; Motori njeh shkronjat dhe prodhon tekst. Dalja zakonisht përbëhet nga dy shtresa: imazhi i dukshëm i dokumentit dhe një "shtresë teksti e fshehur e kërkueshme" poshtë.

4. Korrigjim (pas korrigjimit). Prodhimi i papërpunuar OCR nuk është kurrë i përsosur. Karakteret lexohen gabimisht për shkak të shkronjave të vjetra, letrës së zverdhur, njollosjes së bojës dhe gabimeve në skanim. Këtu AI është një ndihmës i fuqishëm: sugjeron dhe korrigjon gabimet OCR duke përdorur kontekstin.

5. Verifikimi dhe kontrolli i cilësisë. Teksti i korrigjuar kontrollohet nga njeriu në bazë të mostrës ose plotësisht. Veçanërisht zonat kritike si emrat, datat dhe numrat duhet të verifikohen vizualisht.

Pse OCR bën gabime, si ndihmon AI

Probleme tipike që sfidojnë OCR-në në dokumentet historike: fontet e vjetra dhe të zbukuruara, shkronjat e vjetruara si "s" (ſ), paraqitjen e faqeve me dy kolona, fusnotat, futjet e shkruara me dorë, vulat dhe bojën e zbehur. Për shkak se një motor OCR "i sheh" shkronjat një nga një, ai shpesh ngatërron "rn" binare si "m", shkronjën "l" si numrin "1" dhe shkronjën "O" si "0".

Modelet e gjuhës së AI ofrojnë një fuqi të ndryshme këtu: ata kuptojnë kontekstin. Nëse një motor OCR shkruante "1stanbu1", AI mund të nxirrte nga konteksti se duhet të ishte "Stamboll". Por këtu ekziston një rrezik i madh: kur "korrigjimi" AI mund të ndryshojë edhe tekstin. Ai mund të shtojë "Kam korrigjuar" një fjalë që nuk ekziston ose të plotësojë një vend të paqartë me supozimin e tij. Kjo prish besnikërinë e transkriptimit.

Kujdes: Rregulli i artë në korrigjimin e OCR është ky: AI duhet të korrigjojë vetëm gabimet e dukshme të njohjes, jo të interpretojë ose plotësojë përmbajtjen e tekstit. "1stanbu1 → Stamboll" është legjitime; Nuk bëhet fjalë për të mbushur një fjalë të palexueshme me hamendje. Vendet e pasigurta duhet të shënohen me [?] dhe nuk duhet të ndërtohen.

Llojet e gabimit OCR dhe qasja me një tabelë

Lloji i gabimit

shembull

A mund ta rregullojë AI?

kontrolli njerëzor

përzierjen e karaktereve

rn↔m, l↔1, O↔0

Po, është e sigurt

mostër

shkronja e vjetër

e gjatë ſ → s

Po, është e sigurt

mostër

Fjalë e zbehur/e palexueshme

"ka___n"

Jo, duhet të vendoset [?]

të detyrueshme

emri i duhur/emri i vendit

"Constantiniyye"

të kujdesshëm

të detyrueshme

Numri/data

"1867" vs "1857"

e rrezikshme

të detyrueshme

Paraqitja e faqes (kolona/fusnota)

rrjedhje e përzier

pjesërisht

të detyrueshme

Për ta përmbledhur figurën në një fjali: AI pastron në mënyrë të besueshme gabimet e zakonshme të karaktereve; Por sytë e njeriut kërkohen për emra të veçantë, numra, data dhe vende të palexueshme.

tre mini kuti

Rasti 1 - Arkivat e gazetave u bënë të kërkueshme. Një bibliotekë universitare ka dixhitalizuar 12,000 faqe gazeta lokale të viteve 1930. Saktësia e papërpunuar OCR ishte rreth 82% (18 nga çdo 100 karaktere ishin të pasakta). Korrigjimi i bazuar në AI e rriti saktësinë në 96% me një fjalor dhe kontekst të përshtatshëm për gjuhën e gazetës. Për gabimet e mbetura, u krye një kontroll mostër në vend të tekstit të plotë; Koleksioni u bë i kërkueshëm në 3 javë.

Rasti 2 - AI "korrigjoi" dhe shtrembëroi historinë. Një arkivist kërkoi që AI të korrigjonte datën "1863" në printimin e OCR. AI "korrigjoi" datën e "1868" duke parë një ngjarje tjetër në kontekst - edhe pse dokumenti thoshte qartë 1863. Nëse arkivisti nuk do të kishte parë imazhin origjinal, katalogu do të kishte hyrë me datën e gabuar. Mësimi: numrat dhe datat nuk i lihen kurrë AI, ato verifikohen me imazhin.

Rasti 3 - Faqja me dy kolona e ngatërruar. Faqet me dy kolona të një libri vjetor të shekullit të 19-të u përzien në një rrjedhë të vetme në OCR dhe fjalitë u ndërthurën. Prodhimi i papërpunuar ishte i palexueshëm. Teksti u përmirësua kur ndava për herë të parë paraqitjen e faqes në rajone (segmentim) dhe përpunova secilën kolonë veç e veç. Mësimi: në paraqitjen komplekse të faqeve, struktura së pari, teksti së dyti.

Katër shabllone të kopjueshëm

1) Korrigjim i sigurt OCR:

Më poshtë është prodhimi i papërpunuar OCR i një dokumenti historik. Detyra juaj është të korrigjoni VETËM gabimet e dukshme të njohjes optike (p.sh. rn→m,1→l, 0→O, të gjata ſ→s). Rregullat: (1) Interpretoni kuptimin e tekstit. (2) Korrigjoni fjalët e palexueshme/të paqarta, lërini siç janë dhe shënoni me [?]. (3) JO shtimi, heqja ose plotësimi i fjalive. (4) NDRYSHO numrat dhe datat; shënoni [numrin?] nëse keni dyshime. OCR e papërpunuar: [këtu]

2) Raporti i cilësisë OCR:

Ekzaminoni daljen OCR më poshtë dhe krijoni një raport cilësor: (1) Rendisni fjalët me gabime të mundshme njohjeje, (2) Shënoni zonat që duken të palexueshme/të paqarta, (3) Listoni emra, data dhe numra specifikë që kërkojnë kontroll njerëzor. MOS korrigjoni; gjeneroni vetëm listën e kontrollit. Teksti: [këtu]

3) Ndihmë për analizimin e kolonës/strukturës:

Për shkak se teksti OCR më poshtë vjen nga një faqe me dy kolona, rrjedha mund të ngatërrohet. Riorganizoni tekstin në paragrafë logjikë POR mos ndryshoni, shtoni ose fshini asnjë fjalë. Thjesht korrigjoni rendin. Shënoni me [porosi?] rendin për të cilin nuk jeni të sigurt. Teksti: [këtu]

4) Normalizimi në gjuhën standarde (opsionale, shtresa e veçantë):

Prodhoni një version të thjeshtuar leximi në drejtshkrimin e sotëm, në një kolonë të veçantë, MBI tekstin e korrigjuar historik më poshtë. KURRË mos e ndryshoni tekstin ORIGJINAL; Le të jetë thjeshtimi një shtresë më vete. Thjesht përditësoni drejtshkrimin/shqiptimin pa shtuar kuptimin. Origjinali: [këtu]

Prompt i dobët / Prompt i fortë

I dobët:

Korrigjoni dhe zbukurojeni këtë tekst OCR.

"Beautify" lejon AI të rishkruajë tekstin, të bëjë lëshime dhe të interpretojë përmbajtjen; thyen besnikërinë.

E fortë:

Rregulloni VETËM gabimet e njohjes optike në këtë dalje të papërpunuar OCR. Mos interpretoni kuptimin, shtoni/fshini fjalë, lini pjesë të palexueshme me [?], ndryshoni numrat dhe datat. Shfaqni çdo korrigjim që bëni në një listë të veçantë në formatin "origjinal → korrigjim" në mënyrë që unë të mund ta verifikoj. Teksti: [këtu]

Dallimi: detyrimi i kufizuar, ndalimi i fabrikimit, paqartësia e shënimit dhe lista e korrigjimeve e gjurmueshme e bëjnë produktin të auditueshëm.

Gabimet e zakonshme

  • Skanimi me rezolucion të ulët. Shumica e gabimeve OCR shkaktohen nga imazhe të këqija; Skanimi cilësor është investimi më i lirë.
  • Duke e quajtur AI "bëhu i bukur". Kjo prodhon rrjedhshmëri dhe jo besnikëri; Dokumenti rishkruhet.
  • Duke i lënë numrat dhe datat tek AI. Këto korruptohen në heshtje kur "korrigjohen" nga konteksti; duhet të verifikohet me imazh.
  • Plotësimi i zonës së palexueshme me një supozim. Ajo duhet të mbrohet nga pasiguria [?], jo e sajuar.
  • Nuk kontrollohet fare në vend të kampionimit. Edhe 96% saktësi nënkupton mijëra gabime në 12,000 faqe; zonat kritike skanohen.

Në përmbledhje

OCR hap arkivat për studiuesit duke i kthyer dokumentet historike të printuara në tekst të kërkueshëm. AI është një ndihmë e fuqishme në korrigjimin e gabimeve të karaktereve në daljen e papërpunuar të OCR me kontekst; Por ju duhet të vizatoni kufirin midis redaktimit dhe rishkrimit. Skanimi me cilësi të lartë, udhëzimet për korrigjim të sigurt, ruajtja e paqartësisë me [?] dhe verifikimi me sy të njeriut të emrave/datave/numrave e bëjnë dixhitalizimin të shpejtë dhe të besueshëm. AI pastron tekstin; Ju jeni rojtari i besnikërisë.

Detyra e aplikimit

Skanoni një dokument historik të printuar (gazetë e vjetër, letër zyrtare, faqe libri) ose merrni një printim OCR. Korrigjoni tekstin me shabllonin "Secure OCR correction" dhe kërkoni korrigjime nëpërmjet listës "origjinale → korrigjim". Më pas, hiqni zonat që kërkojnë kontroll njerëzor me "raportin e cilësisë OCR". Krahasoni secilën datë dhe emrin e duhur në listë me imazhin aktual; Vini re se sa janë "korrigjuar" gabimisht.

listë kontrolli

  • [ ] E skanova dokumentin me të paktën 300 DPI dhe kontrast të mirë.
  • [ ] Unë i kërkova vetëm AI korrigjimin e gabimit optik, jo rishkrim.
  • [ ] I mbrojta pjesët e palexueshme me [?].
  • [ ] Kam verifikuar të gjithë numrat, datat dhe emrat e duhur me imazhin.
  • [ ] Kam bërë një mostër ose kontroll të plotë në zonat kritike.