Üksus 2 / 12

Dokumendi digiteerimine ja OCR: prinditud teksti teisendamine masintekstiks

Kasu:

  • Võimalus seadistada digiteerimise ja OCR-i töövoogu (skaneerimine, eeltöötlus, tuvastamine, parandamine, kontrollimine) samm-sammult
  • Võimalus kasutada AI-d OCR-i vigade parandamiseks kontekstiga, säilitades samal ajal parandus- ja ümberkirjutusrea ning märkides ebaselguse [?]
  • Mõista, miks tuleb numbreid, kuupäevi ja pärisnimesid visuaalselt kontrollida, ning kvaliteedikontrolli rolli.

Arhiivi või raamatukogu füüsilistel riiulitel olevad miljonid leheküljed avanevad uurijale tõeliselt alles siis, kui need digiteeritakse ja otsitavad. Digiteerimine on füüsilise dokumendi skannimise või pildistamise teel digitaalkujutiseks teisendamine. Kuid lehe foto ei ole veel "tekst"; Arvuti jaoks on see ikkagi pilt, sealt otsida ei saa. Siin tuleb mängu OCR.

OCR (Optical Character Recognition) on tehnoloogia, mis tuvastab dokumendipildil trükitud tähed ja teisendab need masinloetavaks otsitavaks tekstiks. Selles üksuses saate teada, kuidas digiteerida ajaloolisi trükitud dokumente OCR-iga, kuidas AI aitab selles protsessis OCR-i vigu parandada ja kus on inimsilm oluline. (Käsitsi kirjutatud tekstid nõuavad teistsugust tehnoloogiat; seda käsitleme järgmises üksuses.)

Digitaliseerimise töövoog: samm-sammult

1. Ettevalmistus ja sõelumine. Skannige dokument kõrgeima võimaliku kvaliteediga. Ajaloouuringute üldreegliks on eraldusvõime vähemalt 300–400 DPI (dots per inch). Madal eraldusvõime suurendab järgmises OCR-etapis veamäära hüppeliselt.

2. Pildi eeltöötlus. Pildi täiustamine enne OCR-i suurendab oluliselt edukust: skannitud lehe kallutamine, plekkide eemaldamine, kontrastsuse suurendamine, mustvalgeks teisendamine. Kaasaegsed AI-põhised tööriistad suudavad seda sammu automatiseerida.

3. OCR-rakendus. Toidate pildi OCR-mootorisse; Mootor tunneb ära tähed ja loob teksti. Väljund koosneb tavaliselt kahest kihist: nähtavast dokumendipildist ja selle all olevast "otsitavast peidetud tekstikihist".

4. Korrigeerimine (järelparandus). Toores OCR-väljund pole kunagi täiuslik. Tähemärgid loetakse valesti vanade fondide, kolletunud paberi, tindi määrdumise ja skannimisvigade tõttu. Siin on AI võimas abimees: see soovitab ja parandab konteksti kasutades OCR-i vigu.

5. Kontrollimine ja kvaliteedikontroll. Parandatud teksti kontrollib inimene kas proovi alusel või täielikult. Eriti kriitilisi kohti, nagu nimed, kuupäevad ja numbrid, tuleb visuaalselt kontrollida.

Miks OCR teeb vigu, kuidas AI aitab

Tüüpilised probleemid, mis ajaloolistes dokumentides OCR-i proovile panevad: vanad ja uhked fondid, vananenud tähevormid, nagu pikad "s" (ſ), kaheveeruline lehepaigutus, joonealused märkused, käsitsi kirjutatud lisad, pitsatid ja pleekinud tint. Kuna OCR-mootor "näeb" tähti ükshaaval, ajab see sageli kahendkoodi "rn" segamini kui "m", tähe "l" kui numbrit "1" ja tähe "O" kui "0".

AI keelemudelid pakuvad siin teistsugust jõudu: nad mõistavad konteksti. Kui OCR-mootor kirjutas "1stanbu1", võis AI kontekstist järeldada, et see peaks olema "Istanbul". Kuid siin on suur oht: "parandamisel" võib AI muuta ka teksti. Ta võib lisada "Parandasin" olematu sõna või täita ebaselge koha oma oletusega. See häirib transkriptsiooni täpsust.

Ettevaatust: OCR-i korrigeerimise kuldreegel on järgmine: AI peaks parandama ainult ilmseid tuvastamisvigu, mitte tõlgendama ega täiendama teksti sisu. "1stanbu1 → Istanbul" on legitiimne; See ei tähenda loetamatu sõna täitmist oletustega. Ebakindlad kohad tuleks märgistada [?]-ga ja neid ei tohi välja mõelda.

OCR-i veatüübid ja lähenemine tabeliga

Vea tüüp

näide

Kas AI saab seda parandada?

inimese kontroll

tegelaste segamine

rn↔m, l↔1, O↔0

Jah, see on ohutu

näidis

vana kirjavorm

pikk ſ → s

Jah, see on ohutu

näidis

Pleekinud/loematu sõna

"ka___n"

Ei, peaks panema [?]

kohustuslik

pärisnimi/kohanimi

"Constantiniyye"

ettevaatlik

kohustuslik

Number/kuupäev

"1867" vs "1857"

riskantne

kohustuslik

Lehekülje paigutus (veerg/joonealune märkus)

segavool

osaliselt

kohustuslik

Pildi kokkuvõtteks ühe lausega: AI puhastab usaldusväärselt tavalised märgivead; Inimese silmi on aga vaja eriliste nimede, numbrite, kuupäevade ja loetamatute kohtade jaoks.

kolm minikarpi

Juhtum 1 – ajalehtede arhiivid muutusid otsitavaks. Ülikooli raamatukogu on digiteerinud 12 000 lehekülge 1930. aastatest pärit kohalikke ajalehti. Toores OCR-i täpsus oli hinnanguliselt 82% (18 märgist 100-st olid valed). AI-põhine parandus suurendas ajalehekeelele vastava sõnastiku ja konteksti abil täpsust 96%-ni. Ülejäänud vigade puhul viidi läbi näidiskontroll, mitte täistekst; Kollektsioon muutus otsitavaks 3 nädalaga.

Juhtum 2 – AI “parandatud” ja moonutatud ajalugu. Arhivaar lasi tehisintellektil OCR-i väljatrükil korrigeerida kuupäeva "1863". Tehisintellekt "parandas" kuupäeva "1868", vaadates kontekstis teist sündmust – kuigi dokumendis oli selgelt kirjas 1863. Kui arhivaar poleks originaalpilti vaadanud, oleks kataloog sisestatud vale kuupäevaga. Õppetund: numbreid ja kuupäevi ei jäeta kunagi tehisintellektile, need kontrollitakse pildiga.

Juhtum 3 – kaheveeruline leht on segaduses. 19. sajandi aastaraamatu kaheveerulised leheküljed segati OCR-is ühtseks vooluks ja laused põimuti. Toorväljund oli loetamatu. Tekst paranes, kui jagasin lehe paigutuse esimest korda piirkondadeks (segmenteerimine) ja töötlesin iga veergu eraldi. Õppetund: lehekülje keerukas paigutuses, kõigepealt struktuur, teiseks tekst.

Neli kopeeritavat malli

1) Turvaline OCR-parandus:

Allpool on ajaloolise dokumendi töötlemata OCR-väljund. Teie ülesanne on parandada AINULT ilmsed optilised tuvastusvead (nt rn→m,1→l, 0→O, long ſ→s). Reeglid: (1) Tõlgenda teksti tähendust. (2) Paranda loetamatud/mitmetähenduslikud sõnad, jäta nii nagu on ja märgi [?]-ga. (3) EI lisa, eemalda ega lõpeta lauseid. (4) MUUDA numbreid ja kuupäevi; kahtluse korral märkige [number?]. Toores OCR: [siin]

2) OCR-i kvaliteediaruanne:

Uurige allolevat optilise tekstituvastuse väljundit ja koostage kvaliteediaruanne: (1) loetlege võimalike tuvastamisvigadega sõnad, (2) märkige alad, mis tunduvad loetamatud/ebaselged, (3) loetlege konkreetsed nimed, kuupäevad ja numbrid, mis nõuavad inimese kontrolli. ÄRGE parandage; loo ainult kontrollnimekiri.Tekst: [siin]

3) Veergude/struktuuride sõelumise abi:

Kuna allolev OCR-tekst pärineb kaheveeruliselt lehelt, võib voog olla segaduses. Korraldage tekst ümber loogilisteks lõikudeks, KUID ärge muutke, lisage ega kustutage ühtegi sõna. Parandage lihtsalt järjekord. Märkige tellimus, milles te pole kindel, [tellimus?] abil. Tekst: [siin]

4) Normaliseerimine standardkeeleks (valikuline, eraldi kiht):

Koostage lihtsustatud lugemisversioon tänases kirjapildis, eraldi veerus, alloleva parandatud ajalooteksti ÜLAL. ÄRGE KUNAGI muutke ORIGINAALteksti; Lihtsustamine olgu omaette kiht. Lihtsalt värskendage õigekirja/hääldust ilma tähendust lisamata. Originaal: [siin]

Nõrk viip / Tugev viip

Nõrk:

Parandage ja kaunistage seda OCR-teksti.

"Ilustamine" võimaldab AI-l teksti ümber kirjutada, teha väljajätmisi ja tõlgendada sisu; rikub lojaalsust.

Tugev:

Parandage selles töötlemata OCR-väljundis AINULT optilise tuvastamise vead. Ärge tõlgendage tähendust, lisage/kustutage sõnu, jätke loetamatuid osi [?]-ga, muutke numbreid ja kuupäevi. Näidake iga tehtud parandust eraldi loendis vormingus "originaal → parandus", et saaksin seda kontrollida. Tekst: [siin]

Erinevus: piiratud kohustus, valmistamise keeld, märgistuse ebaselgus ja jälgitav paranduste loend muudavad väljundi auditeeritavaks.

Levinud vead

  • Skannimine madala eraldusvõimega. Enamik OCR-i vigu on põhjustatud halbadest piltidest; Kvaliteetne skaneerimine on odavaim investeering.
  • AI kutsumine kauniks muutmiseks. See tekitab pigem sujuvust kui truudust; Dokument kirjutatakse ümber.
  • Numbrite ja kuupäevade jätmine tehisintellektile. Need on vaikselt rikutud, kui neid kontekstist "parandatakse"; tuleb pildi järgi kontrollida.
  • Lugematu ala täitmine arvamisega. Seda peaks kaitsma ebakindlus [?], mitte väljamõeldud.
  • Ei kontrolli üldse proovivõtu asemel. Isegi 96% täpsus tähendab tuhandeid vigu 12 000 leheküljel; kriitilised alad skannitakse.

Kokkuvõttes

OCR avab arhiivid teadlastele, teisendades trükitud ajaloodokumendid otsitavaks tekstiks. AI on võimas abivahend märgivigade parandamiseks toores OCR-väljundis koos kontekstiga; Kuid peate tõmbama piiri toimetamise ja ümberkirjutamise vahele. Kvaliteetne skaneerimine, ohutu parandusjuhend, mitmetähenduslikkuse säilitamine [?]-ga ja nimede/kuupäevade/numbrite inimsilma kontrollimine muudavad digiteerimise nii kiireks kui ka usaldusväärseks. AI puhastab teksti; Sa oled truuduse valvur.

Rakenduse ülesanne

Skannige trükitud ajalooline dokument (vana ajaleht, ametlik kiri, raamatu leht) või tehke optilise tekstituvastuse väljatrükk. Laske tekst parandada malliga „Turvaline OCR-parandus” ja taotlege parandusi loendi „Originaal → parandus” kaudu. Seejärel eemaldage OCR-i kvaliteediaruandega alad, mis nõuavad inimkontrolli. Võrrelge loendis iga kuupäeva ja pärisnime tegeliku pildiga; Pange tähele, kui palju "parandati" valesti.

kontrollnimekiri

  • [ ] Skaneerisin dokumendi vähemalt 300 DPI ja hea kontrastiga.
  • [ ] Palusin AI-lt ainult optiliste vigade parandamist, mitte ümberkirjutamist.
  • [ ] Kaitsesin loetamatud osad [?]-ga.
  • [ ] Kontrollisin pildiga kõiki numbreid, kuupäevi ja pärisnimesid.
  • [ ] Tegin proovi või täieliku kontrolli kriitilistes piirkondades.