Dobički:
- Sposobnost nastavitve digitalizacije in poteka dela OCR (skeniranje, predprocesiranje, prepoznavanje, popravljanje, preverjanje) korak za korakom
- Sposobnost uporabe umetne inteligence za popravljanje napak OCR s kontekstom ob ohranjanju vrstice popravkov in prepisovanja ter označevanja dvoumnosti z [?]
- Razumeti, zakaj je treba številke, datume in lastna imena vizualno preveriti, ter vlogo nadzora kakovosti.
Milijoni strani na fizičnih policah arhiva ali knjižnice se zares odprejo raziskovalcu šele, ko postanejo digitalizirane in po njih je mogoče iskati. Digitalizacija je pretvorba fizičnega dokumenta v digitalno sliko s skeniranjem ali fotografiranjem. Toda fotografija strani še ni "besedilo"; Za računalnik je to še vedno slika, po njej ne morete iskati. Tukaj nastopi OCR.
OCR (Optical Character Recognition) je tehnologija, ki prepozna natisnjene črke na sliki dokumenta in jih pretvori v strojno berljivo besedilo, ki ga je mogoče iskati. V tej enoti se boste naučili, kako digitalizirati zgodovinske natisnjene dokumente z OCR, kako AI pomaga popraviti napake OCR v tem procesu in kje je človeško oko bistvenega pomena. (Rokopisna besedila zahtevajo drugačno tehnologijo; to bomo obravnavali v naslednji enoti.)
Potek dela digitalizacije: korak za korakom
1. Priprava in presejanje. Skenirajte dokument v najvišji možni kakovosti. Splošno pravilo za zgodovinske raziskave je ločljivost vsaj 300–400 DPI (pik na palec). Nizka ločljivost močno poveča stopnjo napak v naslednji fazi OCR.
2. Predobdelava slike. Izboljšanje slike pred OCR močno poveča uspeh: poravnava optično prebrane strani, odstranjevanje madežev, povečanje kontrasta, pretvorba v črno-belo. Sodobna orodja, ki temeljijo na AI, lahko avtomatizirajo ta korak.
3. Aplikacija OCR. Sliko vnesete v mehanizem OCR; Motor prepozna črke in ustvari besedilo. Izpis je običajno sestavljen iz dveh plasti: vidne slike dokumenta in "iskalne skrite besedilne plasti" pod njo.
4. Popravek (naknadni popravek). Surovi izhod OCR ni nikoli popoln. Znaki se ne berejo pravilno zaradi starih pisav, porumenelega papirja, razmazanja črnila in napak pri skeniranju. Tu je umetna inteligenca močan pomočnik: predlaga in popravlja napake OCR z uporabo konteksta.
5. Preverjanje in kontrola kakovosti. Popravljeno besedilo vzorčno ali v celoti preveri človek. Zlasti kritična področja, kot so imena, datumi in številke, je treba vizualno preveriti.
Zakaj OCR dela napake, kako AI pomaga
Tipične težave, ki izzivajo OCR v zgodovinskih dokumentih: stare in modne pisave, zastarele oblike črk, kot so dolgi "s" (ſ), postavitev strani v dveh stolpcih, sprotne opombe, ročno napisani vstavki, pečati in obledelo črnilo. Ker mehanizem OCR "vidi" črke eno za drugo, pogosto zamenjuje dvojiški "rn" kot "m", črko "l" kot številko "1" in črko "O" kot "0".
Jezikovni modeli umetne inteligence tukaj ponujajo drugačno moč: razumejo kontekst. Če bi motor OCR napisal "1stanbu1", bi lahko AI iz konteksta sklepal, da bi moralo biti "Istanbul". Toda tu obstaja velika nevarnost: pri "popravljanju" lahko AI spremeni tudi besedilo. Doda lahko neobstoječo besedo »popravil sem« ali zapolni nejasno mesto s svojim ugibanjem. To moti zvestobo prepisa.
Pozor: Zlato pravilo pri popravljanju OCR je naslednje: umetna inteligenca naj popravlja samo očitne napake pri prepoznavanju, ne pa razlagati ali dopolnjevati vsebine besedila. "1stanbu1 → Istanbul" je legitimen; Ne gre za polnjenje neberljive besede z ugibanji. Negotova mesta naj bodo označena z [?] in naj se ne izmišljujejo.
Vrste napak OCR in pristop s tabelo
Vrsta napake
primer
Ali lahko AI to popravi?
človeški nadzor
mešanje znakov
rn↔m, l↔1, O↔0
Ja, varno je
vzorec
stara črka
dolgo ſ → s
Ja, varno je
vzorec
Obledela/neberljiva beseda
"ka___n"
Ne, bi moral dati [?]
obvezno
lastno ime/krajevno ime
"Konstantinije"
previden
obvezno
Številka/datum
"1867" proti "1857"
tvegano
obvezno
Postavitev strani (stolpec/opomba)
mešani tok
delno
obvezno
Če povzamem sliko v enem stavku: umetna inteligenca zanesljivo počisti običajne napake znakov; Toda za posebna imena, številke, datume in neberljiva mesta so potrebne človeške oči.
trije mini kovčki
Primer 1 – Časopisni arhivi so postali iskalni. Univerzitetna knjižnica je digitalizirala 12.000 strani lokalnih časopisov iz tridesetih let prejšnjega stoletja. Natančnost neobdelanega OCR je bila ocenjena na 82 % (18 od vsakih 100 znakov je bilo napačnih). Popravek na osnovi umetne inteligence je povečal natančnost na 96 % s slovarjem in kontekstom, ki ustreza jeziku časopisa. Za preostale napake je bil izveden vzorčni pregled namesto celotnega besedila; Po zbirki je bilo mogoče iskati v 3 tednih.
Primer 2 – AI je »popravil« in popačil zgodovino. Arhivar je dal AI popraviti datum "1863" na izpisu OCR. Umetna inteligenca je datum "popravila" na "1868", tako da je pogledala drug dogodek v kontekstu - čeprav je dokument jasno pisal 1863. Če arhivar ne bi pogledal izvirne slike, bi katalog vnesel napačen datum. Nauk: številke in datumi niso nikoli prepuščeni AI, preverjajo se s sliko.
3. primer – zmedena stran z dvema stolpcema. Strani v dveh stolpcih letopisa iz 19. stoletja so bile v OCR pomešane v en sam tok in stavki so bili prepleteni. Neobdelani izpis je bil neberljiv. Besedilo se je izboljšalo, ko sem postavitev strani prvič razdelil na regije (segmentacija) in obdelal vsak stolpec posebej. Lekcija: pri zapleteni postavitvi strani, najprej struktura, nato besedilo.
Štiri predloge za kopiranje
1) Varen popravek OCR:
Spodaj je neobdelani izpis OCR zgodovinskega dokumenta. Vaša naloga je SAMO popraviti očitne napake optičnega prepoznavanja (npr. rn→m,1→l, 0→O, dolgi ſ→s). Pravila: (1) Interpretirajte pomen besedila. (2) Popravite neberljive/dvoumne besede, pustite, kot je, in označite z [?]. (3) NI dodajanja, odstranjevanja ali dopolnjevanja stavkov. (4) SPREMEMBA številk in datumov; označite [številko?], če ste v dvomih. Surovi OCR: [tukaj]
2) Poročilo o kakovosti OCR:
Preglejte spodnji izpis OCR in pripravite poročilo o kakovosti: (1) Navedite besede z možnimi napakami pri prepoznavanju, (2) Označite področja, ki se zdijo neberljiva/nejasna, (3) Navedite določena imena, datume in številke, ki zahtevajo človeško preverjanje. NE popravljaj; ustvari samo kontrolni seznam. Besedilo: [tukaj]
3) Pomoč pri razčlenjevanju stolpca/strukture:
Ker spodnje besedilo OCR izvira iz strani z dvema stolpcema, je potek lahko zmeden. Besedilo preuredite v logične odstavke, VENDAR ne spreminjajte, dodajajte ali brišite besed. Samo popravi vrstni red. Naročilo, za katerega niste prepričani, označite z [naročilo?]. Besedilo: [tukaj]
4) Normalizacija v standardni jezik (neobvezno, ločen sloj):
Naredite poenostavljeno različico za branje v današnjem črkovanju, v ločenem stolpcu, NAD popravljenim zgodovinskim besedilom spodaj. NIKOLI ne spreminjajte ORIGINALNEGA besedila; Naj bo poenostavitev ločena plast. Samo posodobite črkovanje/izgovarjavo brez dodajanja pomena. Izvirnik: [tukaj]
Šibek poziv/močan poziv
Šibko:
Popravite in polepšajte to OCR besedilo.
»Beautify« omogoča umetni inteligenci, da prepiše besedilo, popravi opustitve in interpretira vsebino; zlomi zvestobo.
Močno:
Popravi SAMO napake optičnega prepoznavanja v tem neobdelanem izhodu OCR. Ne razlagajte pomena, dodajte/brišite besede, pustite neberljive dele z [?], spreminjajte številke in datume. Vsak popravek, ki ga naredite, pokažite na ločenem seznamu v obliki »izvirnik → popravek«, da ga lahko preverim. Besedilo: [tukaj]
Razlika: omejena dajatev, prepoved izdelave, dvoumnost označevanja in sledljiv seznam popravkov omogočajo revizijo izhoda.
Pogoste napake
- Skeniranje pri nizki ločljivosti. Večino napak OCR povzročajo slabe slike; Kakovostno skeniranje je najcenejša naložba.
- Klicanje AI "naredi lepo". To proizvede bolj tekoče kot zvestobo; Dokument je prepisan.
- Prepuščanje številk in datumov AI. Ti so tiho poškodovani, ko so "popravljeni" iz konteksta; mora biti preverjeno s sliko.
- Zapolnjevanje neberljivega območja z ugibanjem. Moral bi biti zaščiten z negotovostjo [?], ne pa izmišljen.
- Sploh brez nadzora namesto vzorčenja. Tudi 96-odstotna natančnost pomeni na tisoče napak na 12.000 straneh; skenirajo se kritična področja.
Če povzamem
OCR odpira arhive raziskovalcem s pretvorbo natisnjenih zgodovinskih dokumentov v besedilo po iskanju. AI je močan pripomoček pri popravljanju znakovnih napak v neobdelanem OCR izpisu s kontekstom; Vendar morate potegniti mejo med urejanjem in prepisovanjem. Visokokakovostno skeniranje, navodila za varno popravljanje, ohranjanje dvoumnosti z [?] in preverjanje imen/datumov/številk s človeškim očesom omogočajo hitro in zanesljivo digitalizacijo. AI čisti besedilo; Vi ste varuh zvestobe.
Aplikacijska naloga
Skenirajte natisnjen zgodovinski dokument (star časopis, uradno pismo, stran knjige) ali naredite izpis OCR. Popravite besedilo s predlogo »Varni popravek OCR« in zahtevajte popravke prek seznama »izvirnik → popravek«. Nato odstranite področja, ki zahtevajo človeški nadzor s »poročilom o kakovosti OCR«. Primerjajte vsak datum in lastno ime na seznamu z dejansko sliko; Upoštevajte, koliko je bilo "popravljenih" napačno.
kontrolni seznam
- [ ] Dokument sem skeniral z vsaj 300 DPI in dobrim kontrastom.
- [ ] Umetno inteligenco sem prosil le za optično popravljanje napak, ne pa za ponovno pisanje.
- [ ] Neberljive dele sem zaščitil z [?].
- [ ] Vse številke, datume in lastna imena sem preveril s sliko.
- [ ] Opravil sem vzorec ali popoln pregled na kritičnih območjih.