Jednotka 2 / 12

Digitalizácia dokumentu a OCR: Konverzia tlačeného textu na strojový text

zisky:

  • Schopnosť nastaviť pracovný postup digitalizácie a OCR (skenovanie, predspracovanie, rozpoznávanie, oprava, verifikácia) krok za krokom
  • Schopnosť použiť AI na opravu chýb OCR s kontextom pri zachovaní opravy a prepísania riadku a označenia nejednoznačnosti pomocou [?]
  • Pochopte, prečo čísla, dátumy a vlastné mená musia byť vizuálne overené a úlohu kontroly kvality.

Milióny stránok na fyzických policiach archívu alebo knižnice sa bádateľovi skutočne otvoria až vtedy, keď sa digitalizujú a dajú sa vyhľadávať. Digitalizácia je prevod fyzického dokumentu na digitálny obraz jeho skenovaním alebo fotografovaním. Ale fotografia stránky ešte nie je „text“; Pre počítač je to stále obrázok, nedá sa v ňom hľadať. Tu vstupuje do hry OCR.

OCR (Optical Character Recognition) je technológia, ktorá rozpoznáva tlačené písmená v obraze dokumentu a konvertuje ich na strojovo čitateľný text s možnosťou vyhľadávania. V tejto lekcii sa naučíte, ako digitalizovať historické tlačené dokumenty pomocou OCR, ako AI pomáha opraviť chyby OCR v tomto procese a kde je ľudské oko nevyhnutné. (Ručne písané texty vyžadujú inú technológiu; tým sa budeme zaoberať v ďalšej časti.)

Pracovný postup digitalizácie: krok za krokom

1. Príprava a skríning. Naskenujte dokument v najvyššej možnej kvalite. Všeobecné pravidlo pre historický výskum je rozlíšenie aspoň 300-400 DPI (bodov na palec). Nízke rozlíšenie prudko zvyšuje chybovosť v následnej fáze OCR.

2. Predspracovanie obrazu. Zlepšenie obrazu pred OCR výrazne zvyšuje úspech: vyrovnanie naskenovanej strany, odstránenie škvŕn, zvýšenie kontrastu, konverzia na čiernobielu. Moderné nástroje založené na AI dokážu tento krok automatizovať.

3. Aplikácia OCR. Vložíte obrázok do nástroja OCR; Motor rozpoznáva písmená a vytvára text. Výstup zvyčajne pozostáva z dvoch vrstiev: viditeľného obrázka dokumentu a „prehľadateľnej vrstvy skrytého textu“ pod ňou.

4. Korekcia (postkorekcia). Surový výstup OCR nie je nikdy dokonalý. Znaky sa čítajú nesprávne v dôsledku starých písiem, zažltnutého papiera, rozmazania atramentu a chýb pri skenovaní. Tu je AI silným pomocníkom: navrhuje a opravuje chyby OCR pomocou kontextu.

5. Overovanie a kontrola kvality. Opravený text je kontrolovaný človekom na vzorke alebo úplne. Obzvlášť kritické oblasti, ako sú mená, dátumy a čísla, musia byť overené vizuálne.

Prečo OCR robí chyby, ako pomáha AI

Typické problémy, ktoré spochybňujú OCR v historických dokumentoch: staré a ozdobné písma, zastarané tvary písmen, ako napríklad dlhé „s“ (ſ), rozloženie strany s dvoma stĺpcami, poznámky pod čiarou, ručne písané vložky, pečate a vyblednutý atrament. Pretože nástroj OCR „vidí“ písmená jedno po druhom, často si zamieňa binárne „rn“ za „m“, písmeno „l“ za číslo „1“ a písmeno „O“ za „0“.

Jazykové modely AI tu ponúkajú inú silu: chápu kontext. Ak OCR engine napísal „1stanbu1“, AI ​​by mohla z kontextu vyvodiť, že by to malo byť „Istanbul“. Je tu však veľké nebezpečenstvo: pri „opravách“ môže AI tiež zmeniť text. Môže doplniť „opravil som“ neexistujúce slovo alebo doplniť nejasné miesto vlastným odhadom. To narúša vernosť prepisu.

Pozor: Zlaté pravidlo pri opravách OCR znie: AI by mala opravovať iba zjavné chyby v rozpoznávaní, nie interpretovať ani dopĺňať obsah textu. „1stanbu1 → Istanbul“ je legitímne; Nejde o vyplnenie nečitateľného slova hádaním. Neisté miesta by mali byť označené [?] a nemali by sa vymýšľať.

Typy chýb OCR a prístup pomocou tabuľky

Typ chyby

príklad

Dokáže to AI opraviť?

ľudská kontrola

miešanie postáv

rn↔m, l↔1, O↔0

Áno, je to bezpečné

vzorka

starý listový formulár

dlhé ſ → s

Áno, je to bezpečné

vzorka

Vyblednuté/nečitateľné slovo

"ka___n"

Nie, treba zadať [?]

povinné

vlastné meno/miesto

"Constantiniye"

opatrný

povinné

Číslo/dátum

"1867" vs "1857"

riskantné

povinné

Rozloženie stránky (stĺpec/poznámka pod čiarou)

zmiešaný tok

čiastočne

povinné

Aby sme to zhrnuli do jednej vety: AI spoľahlivo vyčistí bežné chyby postáv; Ale ľudské oči sú potrebné pre špeciálne mená, čísla, dátumy a nečitateľné miesta.

tri mini prípady

Prípad 1 – Archívy novín bolo možné vyhľadávať. Univerzitná knižnica zdigitalizovala 12 000 strán miestnych novín z 30. rokov minulého storočia. Hrubá presnosť OCR bola odhadovaná na 82 % (18 z každých 100 znakov bolo nesprávnych). Korekcia založená na AI zvýšila presnosť na 96 % pomocou slovníka a kontextu vhodného pre jazyk novín. V prípade zostávajúcich chýb sa namiesto úplného znenia vykonala kontrola vzorky; Zbierka sa stala vyhľadávateľnou za 3 týždne.

Prípad 2 – AI „opravená“ a skreslená história. Archivár nechal AI opraviť dátum „1863“ na výtlačku OCR. AI ​​ „opravila“ dátum na „1868“ pohľadom na inú udalosť v kontexte – aj keď dokument jasne hovoril o roku 1863. Ak by sa archivár nepozrel na pôvodný obrázok, do katalógu by bol vložený nesprávny dátum. Poučenie: čísla a dátumy sa nikdy nenechajú na AI, overujú sa pomocou obrázka.

Prípad 3 – Zmätená stránka s dvomi stĺpcami. Dvojstĺpcové strany ročenky z 19. storočia boli v OCR zmiešané do jedného prúdu a vety boli prepletené. Surový výstup bol nečitateľný. Text sa zlepšil, keď som najprv rozdelil rozloženie stránky na regióny (segmentáciu) a spracoval každý stĺpec samostatne. Lekcia: v komplexnom rozložení stránky, najprv štruktúra, až potom text.

Štyri kopírovateľné šablóny

1) Bezpečná oprava OCR:

Nižšie je uvedený nespracovaný výstup OCR historického dokumentu. Vašou úlohou je opraviť LEN zjavné chyby optického rozpoznávania (napr. rn→m,1→l, 0→O, dlhé ſ→s). Pravidlá: (1) Interpretujte význam textu. (2) Opravte nečitateľné/nejednoznačné slová, nechajte ich tak, ako sú, a označte [?]. (3) NIE pridávanie, odstraňovanie alebo dopĺňanie viet. (4) ZMENA čísiel a dátumov; v prípade pochybností označte [číslo?].Nespracované OCR: [tu]

2) Správa o kvalite OCR:

Preskúmajte výstup OCR nižšie a vytvorte správu o kvalite: (1) uveďte slová s možnými chybami v rozpoznávaní, (2) označte oblasti, ktoré sa zdajú byť nečitateľné/nezrozumiteľné, (3) uveďte konkrétne mená, dátumy a čísla, ktoré vyžadujú ľudskú kontrolu. NEOPRAVUJTE; vygenerovať iba kontrolný zoznam.Text: [tu]

3) Pomoc pri analýze stĺpcov/štruktúr:

Keďže text OCR nižšie pochádza zo strany s dvoma stĺpcami, tok môže byť zmätený. Usporiadajte text do logických odsekov, ALE nemeňte, nepridávajte ani neodstraňujte žiadne slová. Stačí opraviť objednávku. Objednávku, ktorou si nie ste istí, označte pomocou [objednávka?]. Text: [tu]

4) Normalizácia na štandardný jazyk (voliteľné, samostatná vrstva):

Vytvorte zjednodušenú verziu na čítanie v dnešnom pravopise v samostatnom stĺpci NAD opraveným historickým textom nižšie. NIKDY nemeňte ORIGINÁLNY text; Nech je zjednodušenie samostatnou vrstvou. Stačí aktualizovať pravopis/výslovnosť bez pridania významu. Originál: [tu]

Slabá výzva / Silná výzva

slabé:

Opravte a skrášlite tento text OCR.

„Skrášliť“ umožňuje AI prepísať text, doplniť opomenutia a interpretovať obsah; narúša lojalitu.

Silný:

Opravte LEN chyby optického rozpoznávania v tomto nespracovanom výstupe OCR. Neinterpretujte význam, nepridávajte/neodstraňujte slová, nenechávajte nečitateľné časti s [?], nemeňte čísla a dátumy. Každú vykonanú opravu zobrazte v samostatnom zozname vo formáte "originál → oprava", aby som si ju mohol overiť. Text: [tu]

Rozdiel: obmedzená povinnosť, zákaz výroby, nejednoznačnosť označovania a vysledovateľný zoznam opráv robia výstup kontrolovateľným.

Časté chyby

  • Skenovanie pri nízkom rozlíšení. Väčšina chýb OCR je spôsobená zlými obrázkami; Kvalitné skenovanie je najlacnejšia investícia.
  • Volanie AI „urobte krásnu“. To vytvára skôr plynulosť ako vernosť; Dokument je prepísaný.
  • Ponechanie čísel a dátumov na AI. Tieto sú potichu poškodené, keď sú „opravené“ z kontextu; musí byť overené obrázkom.
  • Vyplnenie nečitateľnej oblasti odhadom. Mala by byť chránená neistotou [?], nie vymyslená.
  • Namiesto vzorkovania vôbec nekontrolovať. Dokonca aj 96 % presnosť znamená tisíce chýb na 12 000 stranách; kritické oblasti sa skenujú.

V súhrne

OCR otvára archívy bádateľom prevedením tlačených historických dokumentov na text s možnosťou vyhľadávania. AI je mocnou pomôckou pri oprave chýb znakov v surovom výstupe OCR s kontextom; Musíte však nakresliť hranicu medzi úpravou a prepisovaním. Vďaka vysokokvalitnému skenovaniu, bezpečnej korekcii, zachovaniu nejednoznačnosti pomocou [?] a overeniu mien/dátumov/čísel ľudským okom je digitalizácia rýchla a spoľahlivá. AI vyčistí text; Ste strážcom vernosti.

Aplikačná úloha

Naskenujte vytlačený historický dokument (staré noviny, úradný list, stranu knihy) alebo urobte výtlačok OCR. Nechajte si text opraviť pomocou šablóny „Zabezpečená oprava OCR“ a vyžiadajte si opravy prostredníctvom zoznamu „originál → oprava“. Potom odstráňte oblasti, ktoré vyžadujú ľudskú kontrolu, pomocou „správy o kvalite OCR“. Porovnajte každý dátum a vlastné meno v zozname so skutočným obrázkom; Všimnite si, koľko bolo „opravených“ nesprávne.

kontrolný zoznam

  • [ ] Naskenoval som dokument s rozlíšením aspoň 300 DPI a dobrým kontrastom.
  • [ ] Požiadal som AI iba o opravu optickej chyby, nie o prepísanie.
  • [ ] Nečitateľné časti som chránil pomocou [?].
  • [ ] Overil som všetky čísla, dátumy a vlastné mená s obrázkom.
  • [ ] Urobil som vzorku alebo úplnú kontrolu v kritických oblastiach.