Enhet 2 / 12

Dokumentdigitalisering och OCR: Konvertera utskriven text till maskintext

Vinster:

  • Möjlighet att ställa in digitaliseringen och OCR-arbetsflödet (skanning, förbearbetning, igenkänning, korrigering, verifiering) steg för steg
  • Möjlighet att använda AI för att korrigera OCR-fel med sammanhang samtidigt som korrigerings- och omskrivningsraden bibehålls och tvetydighet markeras med [?]
  • Förstå varför siffror, datum och egennamn måste verifieras visuellt och vilken roll kvalitetskontroll spelar.

De miljontals sidorna på de fysiska hyllorna i ett arkiv eller bibliotek öppnas på riktigt för forskaren först när de blir digitaliserade och sökbara. Digitalisering är att konvertera ett fysiskt dokument till en digital bild genom att skanna eller fotografera det. Men ett fotografi av en sida är ännu inte "text"; För datorn är det fortfarande en bild, du kan inte söka i den. Det är här OCR kommer in i bilden.

OCR (Optical Character Recognition) är en teknik som känner igen tryckta bokstäver i en dokumentbild och omvandlar dem till maskinläsbar, sökbar text. I den här enheten kommer du att lära dig hur du digitaliserar historiska tryckta dokument med OCR, hur AI hjälper till att korrigera OCR-fel i denna process och var det mänskliga ögat är viktigt. (Handskrivna texter kräver en annan teknik, vi tar upp det i nästa enhet.)

Arbetsflöde för digitalisering: steg för steg

1. Förberedelse och screening. Skanna dokumentet med högsta möjliga kvalitet. En allmän tumregel för historisk forskning är en upplösning på minst 300-400 DPI (dots per inch). Låg upplösning skjuter i höjden felfrekvensen i det efterföljande OCR-steget.

2. Bildförbehandling. Att förbättra bilden före OCR ökar framgången avsevärt: sänka den skannade sidan, ta bort fläckar, öka kontrasten, konvertera till svartvitt. Moderna AI-baserade verktyg kan automatisera detta steg.

3. OCR-applikation. Du matar bilden till OCR-motorn; Motorn känner igen bokstäver och producerar text. Utdatan består vanligtvis av två lager: den synliga dokumentbilden och ett "sökbart dold textlager" under.

4. Rättelse (efterkorrigering). Rå OCR-utgång är aldrig perfekt. Tecken läses felaktigt på grund av gamla teckensnitt, gulnat papper, utsmetande bläck och skanningsfel. Det är här AI är en kraftfull hjälpare: den föreslår och korrigerar OCR-fel med hjälp av sammanhang.

5. Verifiering och kvalitetskontroll. Den korrigerade texten kontrolleras av människan på prov eller helt. Särskilt kritiska områden som namn, datum och nummer måste verifieras visuellt.

Varför OCR gör misstag, hur AI hjälper

Typiska problem som utmanar OCR i historiska dokument: gamla och snygga typsnitt, föråldrade bokstavsformer som långa "s" (ſ), sidlayout med två kolumner, fotnoter, handskrivna inlägg, sigill och blekt bläck. Eftersom en OCR-motor "ser" bokstäver en efter en, förväxlar den ofta det binära "rn" som "m", bokstaven "l" som siffran "1" och bokstaven "O" som "0".

AI-språkmodeller erbjuder en annan kraft här: de förstår sammanhang. Om en OCR-motor skrev "1stanbu1", skulle AI:n kunna dra slutsatsen från sammanhanget att det borde vara "Istanbul". Men det finns en stor fara här: när du "korrigerar" kan AI även ändra texten. Han kan lägga till "jag rättade" ett obefintligt ord eller fylla i en otydlig plats med sin egen gissning. Detta stör transkriptionens trohet.

Varning: Den gyllene regeln i OCR-korrigering är denna: AI bör endast korrigera uppenbara igenkänningsfel, inte tolka eller komplettera innehållet i texten. "1stanbu1 → Istanbul" är legitimt; Det handlar inte om att fylla ett oläsligt ord med gissningar. Osäkra platser ska markeras med [?] och ska inte göras upp.

OCR-feltyper och tillvägagångssätt med en tabell

Typ av fel

exempel

Kan AI fixa det?

mänsklig kontroll

karaktärsblandning

rn↔m, l↔1, O↔0

Ja, det är säkert

prov

gammal bokstavsform

lång ſ → s

Ja, det är säkert

prov

Blekt/oläsligt ord

"ka___n"

Nej, borde sätta [?]

obligatorisk

egennamn/ortnamn

"Constantiniyye"

försiktig

obligatorisk

Nummer/datum

"1867" vs "1857"

riskabelt

obligatorisk

Sidlayout (kolumn/fotnot)

blandat flöde

delvis

obligatorisk

För att sammanfatta bilden i en mening: AI rensar på ett tillförlitligt sätt upp vanliga teckenfel; Men mänskliga ögon krävs för speciella namn, siffror, datum och oläsbara platser.

tre minifodral

Fall 1 — Tidningsarkiv blev sökbara. Ett universitetsbibliotek har digitaliserat 12 000 sidor lokaltidningar från 1930-talet. Rå OCR-noggrannhet var uppskattningsvis 82 % (18 av 100 tecken var felaktiga). AI-baserad korrigering ökade noggrannheten till 96 % med en tidningsspråklämplig ordbok och sammanhang. För återstående fel utfördes en provkontroll i stället för hela texten; Samlingen blev sökbar på 3 veckor.

Fall 2 — AI "korrigerad" och förvrängd historia. En arkivarie lät AI korrigera datumet "1863" på OCR-utskriften. AI:n "korrigerade" datumet till "1868" genom att titta på en annan händelse i sammanhanget - även om det tydligt stod 1863 i dokumentet. Om arkivarien inte hade tittat på originalbilden skulle katalogen ha kommit in med fel datum. Lektion: siffror och datum lämnas aldrig till AI, de verifieras med bilden.

Fall 3 — Tvåspaltssida förvirrad. De två kolumnsidorna i en 1800-talsårsbok blandades till en enda ström i OCR och meningarna flätades samman. Råutgången var oläsbar. Texten förbättrades när jag först delade upp sidlayouten i regioner (segmentering) och bearbetade varje kolumn separat. Lektion: i komplex sidlayout, struktur först, text sedan.

Fyra kopierbara mallar

1) Säker OCR-korrigering:

Nedan är den råa OCR-utdata från ett historiskt dokument. Din uppgift är att ENDAST korrigera uppenbara optiska igenkänningsfel (t.ex. rn→m,1→l, 0→O, långa ſ→s). Regler: (1) Tolka innebörden av texten. (2) Rätta oläsliga/tvetydiga ord, lämna som de är och markera med [?]. (3) INTE lägga till, ta bort eller komplettera meningar. (4) ÄNDRA nummer och datum; markera [nummer?] om du är osäker. Rå OCR: [här]

2) OCR-kvalitetsrapport:

Granska OCR-utgången nedan och skapa en kvalitetsrapport: (1) Lista ord med möjliga igenkänningsfel, (2) Markera områden som verkar oläsliga/otydliga, (3) Lista specifika namn, datum och nummer som kräver mänsklig kontroll. RÄTTA INTE; generera endast checklista.Text: [här]

3) Hjälp för kolumn/strukturanalys:

Eftersom OCR-texten nedan kommer från en sida med två kolumner kan flödet vara förvirrat. Ordna om texten till logiska stycken MEN ändra, lägg inte till eller ta bort några ord. Rätta bara till ordningen. Markera den beställning du inte är säker på med [beställning?]. Text: [här]

4) Normalisering till standardspråk (valfritt, separat lager):

Ta fram en förenklad läsversion i dagens stavning, i en separat kolumn, OVAN den korrigerade historiska texten nedan. Ändra ALDRIG ORIGINALtexten; Låt förenklingen vara ett separat lager. Uppdatera bara stavning/uttal utan att lägga till betydelse.Original: [här]

Svag prompt / Stark prompt

Svag:

Korrigera och försköna denna OCR-text.

"Beautify" tillåter AI att skriva om texten, hitta på utelämnanden och tolka innehållet; bryter lojaliteten.

Stark:

Åtgärda ENDAST optiska igenkänningsfel i denna rå OCR-utgång. Tolka inte betydelse, lägg till/ta bort ord, lämna oläsbara delar med [?], ändra siffror och datum. Visa varje rättelse du gör i en separat lista i formatet "original → korrigering" så att jag kan verifiera den. Text: [här]

Skillnaden: begränsad tull, tillverkningsförbud, märkningsambiguitet och spårbar lista över korrigeringar gör resultatet granskbart.

Vanliga misstag

  • Skannar med låg upplösning. De flesta OCR-fel orsakas av dåliga bilder; Kvalitetsskanning är den billigaste investeringen.
  • Kallar AI "gör vacker". Detta producerar flyt snarare än trohet; Dokumentet skrivs om.
  • Lämna siffrorna och datumen till AI. Dessa korrumperas tyst när de "korrigeras" från sammanhanget; måste verifieras med bild.
  • Fyller i det oläsbara området med en gissning. Det ska skyddas av osäkerhet [?], inte påhittat.
  • Inte kontrollerar alls istället för provtagning. Även 96 % noggrannhet innebär tusentals fel på 12 000 sidor; kritiska områden skannas.

Sammanfattningsvis

OCR öppnar arkiv för forskare genom att konvertera tryckta historiska dokument till sökbar text. AI är ett kraftfullt hjälpmedel för att korrigera teckenfel i rå OCR-utdata med sammanhang; Men du måste dra gränsen mellan redigering och omskrivning. Högkvalitativ skanning, säker korrigeringsinstruktion, bevarande av tvetydighet med [?] och verifiering av namn/datum/nummer med mänskliga ögon gör digitaliseringen både snabb och tillförlitlig. AI rensar upp text; Du är trohetens väktare.

Applikationsuppgift

Skanna ett tryckt historiskt dokument (gammal tidning, officiellt brev, boksida) eller ta en OCR-utskrift. Låt texten korrigeras med mallen "Secure OCR correction" och begär korrigeringar via listan "original → correction". Ta sedan bort de områden som kräver mänsklig kontroll med "OCR-kvalitetsrapporten". Jämför varje datum och egennamn i listan med den faktiska bilden; Notera hur många som "rättades" felaktigt.

checklista

  • [ ] Jag skannade dokumentet med minst 300 DPI och bra kontrast.
  • [ ] Jag bad bara AI om optisk felkorrigering, inte en omskrivning.
  • [ ] Jag skyddade de oläsbara delarna med [?].
  • [ ] Jag verifierade alla siffror, datum och egennamn med bilden.
  • [ ] Jag gjorde ett prov eller en fullständig kontroll i kritiska områden.