Jedinica 2 / 12

Digitalizacija dokumenata i OCR: Pretvaranje ispisanog teksta u strojni tekst

Dobici:

  • Sposobnost postavljanja tijeka rada digitalizacije i OCR-a (skeniranje, prethodna obrada, prepoznavanje, ispravak, verifikacija) korak po korak
  • Sposobnost korištenja umjetne inteligencije za ispravljanje OCR pogrešaka s kontekstom uz zadržavanje ispravka i retka za ponovno pisanje i označavanje dvosmislenosti s [?]
  • Razumjeti zašto se brojevi, datumi i vlastita imena moraju vizualno provjeriti i ulogu kontrole kvalitete.

Milijuni stranica na fizičkim policama arhiva ili knjižnica istinski se otvaraju istraživaču tek kada postanu digitalizirane i pretražive. Digitalizacija je pretvaranje fizičkog dokumenta u digitalnu sliku skeniranjem ili fotografiranjem. Ali fotografija stranice još nije "tekst"; Za računalo je to još uvijek slika, ne možete je pretraživati. Ovdje OCR stupa na scenu.

OCR (Optical Character Recognition) je tehnologija koja prepoznaje tiskana slova na slici dokumenta i pretvara ih u strojno čitljiv tekst koji se može pretraživati. U ovoj ćete jedinici naučiti kako digitalizirati povijesne tiskane dokumente s OCR-om, kako umjetna inteligencija pomaže ispraviti OCR pogreške u ovom procesu i gdje je ljudsko oko ključno. (Rukom pisani tekstovi zahtijevaju drugačiju tehnologiju; to ćemo obraditi u sljedećoj jedinici.)

Tijek rada digitalizacije: korak po korak

1. Priprema i probir. Skenirajte dokument u najvišoj mogućoj kvaliteti. Opće pravilo za povijesna istraživanja je razlučivost od najmanje 300-400 DPI (točaka po inču). Niska razlučivost naglo povećava stopu pogrešaka u sljedećoj fazi OCR-a.

2. Predobrada slike. Poboljšanje slike prije OCR-a uvelike povećava uspjeh: iskrivljenje skenirane stranice, uklanjanje mrlja, povećanje kontrasta, pretvaranje u crno-bijelo. Moderni alati temeljeni na umjetnoj inteligenciji mogu automatizirati ovaj korak.

3. OCR aplikacija. Vi unosite sliku u OCR mehanizam; Motor prepoznaje slova i proizvodi tekst. Ispis se obično sastoji od dva sloja: vidljive slike dokumenta i "pretraživog skrivenog tekstualnog sloja" ispod.

4. Ispravak (naknadni ispravak). Sirovi OCR izlaz nikada nije savršen. Znakovi se neispravno čitaju zbog starih fontova, požutjelog papira, razmazivanja tinte i pogrešaka pri skeniranju. Ovdje je AI moćan pomoćnik: predlaže i ispravlja OCR pogreške pomoću konteksta.

5. Provjera i kontrola kvalitete. Ispravljeni tekst provjerava čovjek na bazi uzorka ili u cijelosti. Osobito kritična područja kao što su imena, datumi i brojevi moraju se vizualno provjeriti.

Zašto OCR čini pogreške, kako AI pomaže

Tipični problemi koji izazivaju OCR u povijesnim dokumentima: stari i otmjeni fontovi, zastarjeli oblici slova kao što je dugo "s" (ſ), raspored stranica u dva stupca, fusnote, rukom pisani umetci, pečati i izblijedjela tinta. Budući da OCR mehanizam "vidi" slova jedno po jedno, često brka binarni "rn" kao "m", slovo "l" kao broj "1" i slovo "O" kao "0".

AI jezični modeli ovdje nude drugačiju moć: oni razumiju kontekst. Ako je OCR mehanizam napisao "1stanbu1", AI bi iz konteksta mogao zaključiti da bi to trebao biti "Istanbul". Ali ovdje postoji velika opasnost: prilikom "ispravljanja" AI može promijeniti i tekst. Može dodati "ispravio sam" nepostojeću riječ ili popuniti nejasno mjesto vlastitom pretpostavkom. To narušava vjernost transkripcije.

Oprez: Zlatno pravilo u OCR ispravljanju je sljedeće: umjetna inteligencija bi trebala ispravljati samo očite pogreške prepoznavanja, a ne tumačiti ili dopunjavati sadržaj teksta. "1stanbu1 → Istanbul" je legitiman; Ne radi se o ispunjavanju nečitljive riječi nagađanjima. Nesigurna mjesta treba označiti sa [?] i ne smiju se izmišljati.

OCR vrste grešaka i pristup s tablicom

Vrsta greške

primjer

Može li AI to popraviti?

ljudska kontrola

miješanje karaktera

rn↔m, l↔1, O↔0

Da, sigurno je

uzorak

stari oblik slova

dugo ſ → s

Da, sigurno je

uzorak

Izblijedjela/nečitka riječ

"ka___n"

Ne, treba staviti [?]

obavezna

vlastito ime/naziv mjesta

"Konstantinije"

oprezan

obavezna

Broj/datum

"1867" protiv "1857"

riskantno

obavezna

Izgled stranice (stupac/fusnota)

mješoviti tok

djelomično

obavezna

Da rezimiramo sliku u jednoj rečenici: AI pouzdano čisti obične pogreške znakova; Ali za posebna imena, brojeve, datume i nečitljiva mjesta potrebne su ljudske oči.

tri mini kućišta

Slučaj 1 — Arhive novina postale su pretražive. Sveučilišna knjižnica digitalizirala je 12.000 stranica lokalnih novina iz 1930-ih. Preciznost sirovog OCR-a bila je procijenjena na 82% (18 od svakih 100 znakova bilo je netočno). Ispravak temeljen na umjetnoj inteligenciji povećao je točnost na 96% s rječnikom i kontekstom primjerenim novinskom jeziku. Za preostale pogreške izvršena je provjera uzorka umjesto cijelog teksta; Zbirka je postala pretraživa za 3 tjedna.

Slučaj 2 — AI je "ispravio" i iskrivio povijest. Arhivar je dao umjetnoj inteligenciji da ispravi datum "1863" na OCR ispisu. AI je "ispravio" datum na "1868" gledajući drugi događaj u kontekstu - iako je dokument jasno rekao 1863. Da arhivar nije pogledao originalnu sliku, katalog bi ušao s krivim datumom. Lekcija: brojevi i datumi nikada nisu prepušteni umjetnoj inteligenciji, oni se provjeravaju slikom.

Slučaj 3 — stranica s dva stupca zbunjena. Stranice od dva stupca godišnjaka iz 19. stoljeća bile su pomiješane u jedan tok u OCR-u, a rečenice su bile isprepletene. Neobrađeni izlaz bio je nečitljiv. Tekst se poboljšao kada sam prvi put podijelio izgled stranice u regije (segmentacija) i obradio svaki stupac zasebno. Lekcija: u složenom izgledu stranice, prvo struktura, zatim tekst.

Četiri predloška za kopiranje

1) Sigurno OCR ispravljanje:

Ispod je neobrađeni OCR izlaz povijesnog dokumenta. Vaš zadatak je ispraviti SAMO očite pogreške optičkog prepoznavanja (npr. rn→m,1→l, 0→O, dugo ſ→s). Pravila: (1) Protumačite značenje teksta. (2) Ispravite nečitljive/dvosmislene riječi, ostavite kakve jesu i označite s [?]. (3) NE dodavanje, uklanjanje ili dopunjavanje rečenica. (4) PROMIJENITE brojeve i datume; označite [broj?] ako ste u nedoumici.Raw OCR: [ovdje]

2) OCR izvješće o kvaliteti:

Pregledajte OCR izlaz u nastavku i izradite izvješće o kvaliteti: (1) Navedite riječi s mogućim pogreškama prepoznavanja, (2) Označite područja koja se čine nečitljivima/nejasno, (3) Navedite određena imena, datume i brojeve koji zahtijevaju ljudsku provjeru. NE ispravljati; generiraj samo kontrolni popis.Tekst: [ovdje]

3) Pomoć za analizu stupca/strukture:

Budući da OCR tekst u nastavku dolazi sa stranice s dva stupca, tijek bi mogao biti zbunjujući. Preuredite tekst u logične odlomke, ALI nemojte mijenjati, dodavati ili brisati riječi. Samo ispravi redoslijed. Označite narudžbu za koju niste sigurni s [narudžba?]. Tekst: [ovdje]

4) Normalizacija na standardni jezik (izborno, zasebni sloj):

Napravite pojednostavljenu verziju čitanja u današnjem pravopisu, u posebnom stupcu, IZNAD ispravljenog povijesnog teksta ispod. NIKADA ne mijenjajte IZVORNI tekst; Neka pojednostavljenje bude zaseban sloj. Samo ažurirajte pravopis/izgovor bez dodavanja značenja. Izvornik: [ovdje]

Slab upit / Jak upit

Slabo:

Ispravite i uljepšajte ovaj OCR tekst.

“Beautify” omogućuje umjetnoj inteligenciji da prepiše tekst, nadoknadi propuste i interpretira sadržaj; prekida lojalnost.

Jako:

Ispravite SAMO pogreške optičkog prepoznavanja u ovom neobrađenom OCR izlazu. Nemojte tumačiti značenje, dodavati/brisati riječi, ostavljati nečitljive dijelove s [?], mijenjati brojeve i datume. Prikaži svaki ispravak koji napraviš na posebnom popisu u formatu "izvornik → ispravak" tako da ga mogu provjeriti. Tekst: [ovdje]

Razlika: ograničena dužnost, zabrana izrade, dvosmislenost označavanja i sljedivi popis ispravaka čine izlaz revizijskim.

Uobičajene greške

  • Skeniranje u niskoj rezoluciji. Većina OCR pogrešaka uzrokovana je lošim slikama; Kvalitetno skeniranje je najjeftinija investicija.
  • Pozivanje umjetne inteligencije "učini lijepim". Ovo proizvodi tečnost, a ne vjernost; Dokument je prepisan.
  • Ostavljajući brojeve i datume AI-ju. Oni su tiho oštećeni kada se "isprave" iz konteksta; mora se provjeriti slikom.
  • Popunjavanje nečitljivog područja nagađanjem. Trebalo bi biti zaštićeno neizvjesnošću [?], a ne izmišljeno.
  • Uopće se ne kontrolira umjesto uzorkovanja. Čak i 96% točnosti znači tisuće grešaka na 12.000 stranica; kritična područja se skeniraju.

Ukratko

OCR otvara arhive istraživačima pretvarajući ispisane povijesne dokumente u tekst koji se može pretraživati. AI je moćna pomoć u ispravljanju pogrešaka znakova u sirovom OCR izlazu s kontekstom; Ali morate povući granicu između uređivanja i prepisivanja. Visokokvalitetno skeniranje, sigurne upute za ispravljanje, očuvanje dvosmislenosti s [?] i provjera imena/datuma/brojeva ljudskim okom čine digitalizaciju brzom i pouzdanom. AI čisti tekst; Ti si čuvar vjernosti.

Zadatak aplikacije

Skenirajte ispisani povijesni dokument (stare novine, službeno pismo, stranicu knjige) ili uzmite OCR ispis. Dajte ispraviti tekst pomoću predloška “Sigurni OCR ispravak” i zatražite ispravke putem popisa “original → ispravak”. Zatim uklonite područja koja zahtijevaju ljudsku kontrolu pomoću "OCR izvješća o kvaliteti". Usporedite svaki datum i vlastito ime na popisu sa stvarnom slikom; Zabilježite koliko ih je netočno "ispravljeno".

popis za provjeru

  • [ ] Skenirao sam dokument s najmanje 300 DPI i dobrim kontrastom.
  • [ ] Tražio sam od umjetne inteligencije samo optičku korekciju pogreške, a ne ponovno pisanje.
  • [ ] Zaštitio sam nečitljive dijelove s [?].
  • [ ] Provjerio sam sve brojeve, datume i vlastita imena sa slikom.
  • [ ] Napravio sam uzorak ili punu provjeru u kritičnim područjima.