Jedinica 2 / 12

Digitalizacija dokumenta i OCR: Pretvaranje štampanog teksta u mašinski tekst

Dobici:

  • Mogućnost podešavanja procesa digitalizacije i OCR (skeniranje, prethodna obrada, prepoznavanje, ispravka, verifikacija) korak po korak
  • Sposobnost korištenja AI za ispravljanje OCR grešaka s kontekstom uz održavanje reda ispravke i ponovnog pisanja i označavanje dvosmislenosti sa [?]
  • Shvatite zašto brojevi, datumi i vlastita imena moraju biti vizuelno verifikovani i ulogu kontrole kvaliteta.

Milioni stranica na fizičkim policama arhiva ili biblioteke istinski se otvaraju istraživaču tek kada se digitaliziraju i mogu pretraživati. Digitalizacija je pretvaranje fizičkog dokumenta u digitalnu sliku skeniranjem ili fotografisanjem. Ali fotografija stranice još nije "tekst"; Za računar je to i dalje slika, ne možete pretraživati ​​u njoj. Ovdje na scenu stupa OCR.

OCR (Optical Character Recognition) je tehnologija koja prepoznaje štampana slova na slici dokumenta i pretvara ih u mašinski čitljiv tekst koji se može pretraživati. U ovoj jedinici naučit ćete kako digitalizirati historijske štampane dokumente pomoću OCR-a, kako AI pomaže u ispravljanju OCR grešaka u ovom procesu i gdje je ljudsko oko bitno. (Rukopisni tekstovi zahtijevaju drugačiju tehnologiju; to ćemo pokriti u sljedećoj jedinici.)

Proces digitalizacije: korak po korak

1. Priprema i skrining. Skenirajte dokument u najvišoj mogućoj kvaliteti. Opšte pravilo za istorijsko istraživanje je rezolucija od najmanje 300-400 DPI (tačaka po inču). Niska rezolucija vrtoglavo povećava stopu greške u narednoj OCR fazi.

2. Predobrada slike. Poboljšanje slike prije OCR-a uvelike povećava uspjeh: uklanjanje iskosa skenirane stranice, uklanjanje mrlja, povećanje kontrasta, pretvaranje u crno-bijelo. Moderni alati zasnovani na umjetnoj inteligenciji mogu automatizirati ovaj korak.

3. OCR aplikacija. Ubacite sliku u OCR motor; Motor prepoznaje slova i proizvodi tekst. Izlaz se obično sastoji od dva sloja: vidljive slike dokumenta i "pretraživog sloja skrivenog teksta" ispod.

4. Korekcija (post-korekcija). Sirovi OCR izlaz nikada nije savršen. Znakovi se pogrešno čitaju zbog starih fontova, požutjelog papira, razmazivanja tinte i grešaka pri skeniranju. Ovdje je AI moćan pomoćnik: predlaže i ispravlja OCR greške koristeći kontekst.

5. Verifikacija i kontrola kvaliteta. Ispravljeni tekst čovjek provjerava na uzorku ili u potpunosti. Posebno kritična područja kao što su imena, datumi i brojevi moraju se vizualno provjeriti.

Zašto OCR griješi, kako AI pomaže

Tipični problemi koji izazivaju OCR u istorijskim dokumentima: stari i otmjeni fontovi, zastarjeli oblici slova kao što je dugačko "s" (ſ), izgled stranice u dvije kolone, fusnote, rukom pisani umetci, pečati i izblijedjelo mastilo. Budući da OCR mašina "vidi" slova jedno po jedno, često brka binarno "rn" kao "m", slovo "l" kao broj "1", a slovo "O" kao "0".

Modeli AI jezika ovdje nude drugačiju moć: razumiju kontekst. Ako je OCR motor napisao "1stanbu1", AI bi iz konteksta mogao zaključiti da bi to trebalo biti "Istanbul". Ali ovdje postoji velika opasnost: prilikom "ispravljanja" AI također može promijeniti tekst. Može dodati "ispravio sam" nepostojeću riječ ili popuniti nejasno mjesto svojim nagađanjem. To narušava vjernost transkripcije.

Oprez: Zlatno pravilo u OCR korekciji je sljedeće: AI treba da ispravlja samo očigledne greške u prepoznavanju, a ne da tumači ili dopunjuje sadržaj teksta. "1stanbu1 → Istanbul" je legitiman; Ne radi se o popunjavanju nečitljive riječi nagađanjima. Nesigurna mjesta treba označiti sa [?] i ne treba ih izmišljati.

Vrste OCR grešaka i pristup sa tabelom

Vrsta greške

primjer

Može li AI to popraviti?

ljudska kontrola

mešanje karaktera

rn↔m, l↔1, O↔0

Da, sigurno je

uzorak

stari oblik pisma

dugo ſ → s

Da, sigurno je

uzorak

Izblijedjela/nečitka riječ

"ka___n"

Ne, treba staviti [?]

obavezno

pravo ime/ime mjesta

"Constantiniyye"

oprezno

obavezno

Broj/datum

"1867" protiv "1857"

rizično

obavezno

Izgled stranice (kolona/fusnota)

mješoviti tok

djelomično

obavezno

Da rezimiramo sliku u jednoj rečenici: AI pouzdano čisti obične greške karaktera; Ali ljudske oči su potrebne za posebna imena, brojeve, datume i nečitljiva mjesta.

tri mini kofera

Slučaj 1 — Arhive novina su postale pretražive. Univerzitetska biblioteka je digitalizirala 12.000 stranica lokalnih novina iz 1930-ih. Raw OCR tačnost je procenjena na 82% (18 od svakih 100 znakova je bilo netačno). Korekcija zasnovana na veštačkoj inteligenciji povećala je preciznost na 96% sa rečnikom i kontekstom koji je prikladan za novinski jezik. Za preostale greške, izvršena je provjera uzorka umjesto cijelog teksta; Kolekcija je postala pretraživa za 3 sedmice.

Slučaj 2 — AI „ispravljena“ i iskrivljena istorija. Arhivar je dao AI da ispravi datum "1863" na OCR ispisu. AI je "ispravio" datum u "1868" gledajući drugi događaj u kontekstu - iako je dokument jasno rekao 1863. Da arhivar nije pogledao originalnu sliku, katalog bi ušao s pogrešnim datumom. Pouka: brojevi i datumi nikada nisu prepušteni AI, oni se verificiraju sa slikom.

Slučaj 3 — Zbrkana stranica sa dvije kolone. Stranice od dvije kolone godišnjaka iz 19. stoljeća pomiješane su u jedan tok u OCR-u, a rečenice su bile isprepletene. Sirovi izlaz je bio nečitljiv. Tekst se poboljšao kada sam prvi put podijelio izgled stranice na regije (segmentacija) i obradio svaku kolonu posebno. Lekcija: u složenom izgledu stranice, struktura prvo, tekst drugi.

Četiri šablona za kopiranje

1) Sigurna OCR korekcija:

Ispod je sirovi OCR izlaz istorijskog dokumenta. Vaš zadatak je da ispravite SAMO očigledne greške optičkog prepoznavanja (npr. rn→m,1→l, 0→O, duge ſ→s). Pravila: (1) Tumačiti značenje teksta. (2) Ispravite nečitljive/dvosmislene riječi, ostavite kako jeste i označite sa [?]. (3) BEZ dodavanja, uklanjanja ili dovršavanja rečenica. (4) PROMIJENITE brojeve i datume; označite [broj?] ako ste u nedoumici. Raw OCR: [ovdje]

2) OCR izvještaj o kvaliteti:

Pregledajte OCR izlaz u nastavku i napravite izvještaj o kvalitetu: (1) Navedite riječi s mogućim greškama u prepoznavanju, (2) Označite područja koja se čine nečitljivima/nejasnima, (3) Navedite specifična imena, datume i brojeve koji zahtijevaju provjeru od strane ljudi. NE ispravljajte; generiraj samo kontrolnu listu. Tekst: [ovdje]

3) Pomoć pri raščlanjivanju kolone/strukture:

Budući da OCR tekst u nastavku dolazi sa stranice sa dvije kolone, tok može biti zbunjen. Preuredite tekst u logične pasuse ALI nemojte mijenjati, dodavati ili brisati nijednu riječ. Samo ispravite redosled. Označite narudžbu u koju niste sigurni sa [red?]. Tekst: [ovdje]

4) Normalizacija na standardni jezik (opciono, poseban sloj):

Napravite pojednostavljenu verziju čitanja u današnjem pravopisu, u posebnoj koloni, IZNAD ispravljenog istorijskog teksta ispod. NIKADA ne mijenjajte ORIGINALNI tekst; Neka pojednostavljenje bude poseban sloj. Samo ažurirajte pravopis/izgovor bez dodavanja značenja.Original: [ovdje]

Slaba prompt / Jaka prompt

slaba:

Ispravite i uljepšajte ovaj OCR tekst.

„Uljepšaj“ omogućava AI da prepiše tekst, nadoknadi propuste i interpretira sadržaj; razbija lojalnost.

Jaka:

Popravi SAMO greške optičkog prepoznavanja u ovom sirovom OCR izlazu. Nemojte tumačiti značenje, dodavati/brisati riječi, ostavljati nečitljive dijelove sa [?], mijenjati brojeve i datume. Pokažite svaku ispravku koju napravite u posebnoj listi u formatu "original → ispravka" kako bih je mogao provjeriti. Tekst: [ovdje]

Razlika: ograničena obaveza, zabrana izrade, dvosmislenost označavanja i lista ispravki koja se može pratiti čine izlaz podložnim reviziji.

Uobičajene greške

  • Skeniranje u niskoj rezoluciji. Većina OCR grešaka je uzrokovana lošim slikama; Kvalitetno skeniranje je najjeftinija investicija.
  • Nazivanje AI "učini lijepim". Ovo proizvodi tečnost, a ne vjernost; Dokument je prepisan.
  • Ostavljamo brojeve i datume AI. Oni se tiho kvare kada se "ispravljaju" iz konteksta; mora biti potvrđeno slikom.
  • Popunjavanje nečitljivog područja nagađanjem. Trebalo bi da bude zaštićeno neizvesnošću [?], a ne izmišljeno.
  • Uopšte ne kontrolira umjesto uzorkovanja. Čak 96% tačnosti znači hiljade grešaka na 12.000 stranica; kritična područja se skeniraju.

Ukratko

OCR otvara arhive istraživačima pretvaranjem štampanih istorijskih dokumenata u tekst koji se može pretraživati. AI je moćna pomoć u ispravljanju grešaka karaktera u sirovom OCR izlazu sa kontekstom; Ali morate povući granicu između uređivanja i ponovnog pisanja. Visokokvalitetno skeniranje, instrukcije za sigurno ispravljanje, očuvanje dvosmislenosti sa [?] i provjera imena/datuma/brojeva ljudskim okom čine digitalizaciju brzom i pouzdanom. AI čisti tekst; Ti si čuvar vjernosti.

Zadatak aplikacije

Skenirajte štampani istorijski dokument (stare novine, službeno pismo, stranicu knjige) ili uzmite OCR ispis. Neka se tekst ispravi pomoću predloška “Secure OCR correction” i zatraži ispravke putem liste “original → correction”. Zatim uklonite područja koja zahtijevaju ljudsku kontrolu pomoću "OCR izvještaja o kvaliteti". Uporedite svaki datum i pravo ime na listi sa stvarnom slikom; Obratite pažnju koliko ih je pogrešno "ispravljeno".

kontrolna lista

  • [ ] Skenirao sam dokument sa najmanje 300 DPI i dobrim kontrastom.
  • [ ] Tražio sam od AI samo optičku korekciju grešaka, a ne ponovno pisanje.
  • [ ] Nečitljive dijelove sam zaštitio sa [?].
  • [ ] Provjerio sam sve brojeve, datume i vlastita imena sa slikom.
  • [ ] Napravio sam uzorak ili punu provjeru u kritičnim područjima.