Enhet 2 / 12

Dokumentdigitalisering og OCR: Konvertering av trykt tekst til maskintekst

Gevinster:

  • Evne til å sette opp digitalisering og OCR arbeidsflyt (skanning, forhåndsbehandling, gjenkjenning, korrigering, verifisering) trinn for trinn
  • Evne til å bruke AI for å korrigere OCR-feil med kontekst mens du opprettholder korrigerings- og omskrivingslinjen og markerer tvetydighet med [?]
  • Forstå hvorfor tall, datoer og egennavn må verifiseres visuelt og hvilken rolle kvalitetskontroll spiller.

Millioner av sider på de fysiske hyllene til et arkiv eller bibliotek åpnes først virkelig for forskeren når de blir digitaliserte og søkbare. Digitalisering er å konvertere et fysisk dokument til et digitalt bilde ved å skanne eller fotografere det. Men et fotografi av en side er ennå ikke "tekst"; For datamaskinen er det fortsatt et bilde, du kan ikke søke i det. Det er her OCR kommer inn i bildet.

OCR (Optical Character Recognition) er en teknologi som gjenkjenner trykte bokstaver i et dokumentbilde og konverterer dem til maskinlesbar, søkbar tekst. I denne enheten lærer du hvordan du digitaliserer historiske trykte dokumenter med OCR, hvordan AI hjelper til med å korrigere OCR-feil i denne prosessen, og hvor det menneskelige øyet er essensielt. (Håndskrevne tekster krever en annen teknologi; vi tar opp det i neste enhet.)

Arbeidsflyt for digitalisering: trinn for trinn

1. Forberedelse og screening. Skann dokumentet med høyest mulig kvalitet. En generell tommelfingerregel for historisk forskning er en oppløsning på minst 300-400 DPI (dots per inch). Lav oppløsning skyter feilraten i været i det påfølgende OCR-stadiet.

2. Bildeforbehandling. Å forbedre bildet før OCR øker suksessen betraktelig: fjerne skjevheter på den skannede siden, fjerne flekker, øke kontrasten, konvertere til svart-hvitt. Moderne AI-baserte verktøy kan automatisere dette trinnet.

3. OCR-applikasjon. Du mater bildet til OCR-motoren; Motoren gjenkjenner bokstaver og produserer tekst. Utdataene består vanligvis av to lag: det synlige dokumentbildet og et "søkbart skjult tekstlag" under.

4. Rettelse (etterkorreksjon). Rå OCR-utgang er aldri perfekt. Tegn leses feil på grunn av gamle fonter, gulnet papir, blekkflekker og skannefeil. Det er her AI er en kraftig hjelper: den foreslår og korrigerer OCR-feil ved å bruke kontekst.

5. Verifikasjon og kvalitetskontroll. Den korrigerte teksten kontrolleres av mennesket på prøvebasis eller fullstendig. Spesielt kritiske områder som navn, datoer og tall må verifiseres visuelt.

Hvorfor OCR gjør feil, hvordan AI hjelper

Typiske problemer som utfordrer OCR i historiske dokumenter: gamle og fancy fonter, utdaterte bokstavformer som lange "s" (ſ), sideoppsett med to spalter, fotnoter, håndskrevne innlegg, segl og falmet blekk. Fordi en OCR-motor "ser" bokstaver én etter én, forveksler den ofte det binære "rn" som "m", bokstaven "l" som tallet "1" og bokstaven "O" som "0".

AI-språkmodeller tilbyr en annen kraft her: de forstår kontekst. Hvis en OCR-motor skrev "1stanbu1", kunne AI utledet fra konteksten at det skulle være "Istanbul". Men det er en stor fare her: når du "korrigerer" kan AI også endre teksten. Han kan legge til «jeg korrigerte» et ikke-eksisterende ord eller fylle ut et uklart sted med sin egen gjetning. Dette forstyrrer troskapen til transkripsjonen.

Forsiktig: Den gyldne regelen i OCR-korreksjon er denne: AI skal kun korrigere åpenbare gjenkjenningsfeil, ikke tolke eller supplere innholdet i teksten. "1stanbu1 → Istanbul" er legitim; Det handler ikke om å fylle et uleselig ord med gjetninger. Usikre steder skal merkes med [?] og skal ikke gjøres opp.

OCR-feiltyper og tilnærming med en tabell

Feiltype

eksempel

Kan AI fikse det?

menneskelig kontroll

karakterblanding

rn↔m, l↔1, O↔0

Ja, det er trygt

prøve

gammel bokstavform

lang ſ → s

Ja, det er trygt

prøve

Falmet/uleselig ord

"ka___n"

Nei, bør sette [?]

obligatorisk

egennavn/stedsnavn

"Constantiniyye"

forsiktig

obligatorisk

Antall/dato

"1867" vs "1857"

risikabelt

obligatorisk

Sidelayout (kolonne/fotnote)

blandet flyt

delvis

obligatorisk

For å oppsummere bildet i én setning: AI rydder pålitelig opp i vanlige tegnfeil; Men menneskelige øyne kreves for spesielle navn, tall, datoer og uleselige steder.

tre minisaker

Sak 1 - Avisarkiver ble søkbare. Et universitetsbibliotek har digitalisert 12 000 sider med lokalaviser fra 1930-tallet. Rå OCR-nøyaktighet var anslagsvis 82 % (18 av 100 tegn var feil). AI-basert korreksjon økte nøyaktigheten til 96 % med en avisspråklig ordbok og kontekst. For gjenværende feil ble det utført en prøvesjekk i stedet for hele teksten; Samlingen ble søkbar på 3 uker.

Tilfelle 2 - AI "korrigert" og forvrengt historie. En arkivar fikk AI til å korrigere datoen "1863" på OCR-utskriften. AI "korrigerte" datoen til "1868" ved å se på en annen hendelse i sammenhengen - selv om dokumentet tydelig sa 1863. Hvis arkivaren ikke hadde sett på originalbildet, ville katalogen ha kommet inn med feil dato. Leksjon: tall og datoer overlates aldri til AI, de bekreftes med bildet.

Tilfelle 3 - To-kolonne side forvirret. De to-kolonne sidene i en årbok fra 1800-tallet ble blandet til en enkelt strøm i OCR og setningene ble flettet sammen. Råutgangen var uleselig. Teksten ble bedre da jeg først delte sideoppsettet inn i regioner (segmentering) og behandlet hver kolonne separat. Leksjon: i kompleks sidelayout, struktur først, tekst deretter.

Fire kopierbare maler

1) Sikker OCR-korrigering:

Nedenfor er den rå OCR-utgangen til et historisk dokument. Din oppgave er BARE å korrigere åpenbare optiske gjenkjenningsfeil (f.eks. rn→m,1→l, 0→O, lange ſ→s). Regler: (1) Tolk betydningen av teksten. (2) Rett uleselige/tvetydige ord, la være som de er og merk med [?]. (3) IKKE legge til, fjerne eller fullføre setninger. (4) ENDRE tall og datoer; merk [nummer?] hvis du er i tvil. Rå OCR: [her]

2) OCR-kvalitetsrapport:

Undersøk OCR-utdataene nedenfor og lag en kvalitetsrapport: (1) List opp ord med mulige gjenkjennelsesfeil, (2) Merk områder som virker uleselige/uklare, (3) List opp spesifikke navn, datoer og tall som krever menneskelig kontroll. IKKE korriger; generer kun sjekkliste. Tekst: [her]

3) Hjelp til å analysere kolonne/struktur:

Fordi OCR-teksten nedenfor kommer fra en to-kolonne side, kan flyten bli forvirret. Omorganiser teksten til logiske avsnitt, MEN ikke endre, legg til eller slett noen ord. Bare korriger rekkefølgen. Merk bestillingen du ikke er sikker på med [ordre?]. Tekst: [her]

4) Normalisering til standardspråk (valgfritt, separat lag):

Lag en forenklet leseversjon i dagens rettskrivning, i egen spalte, OVER den korrigerte historiske teksten nedenfor. ALDRI endre den ORIGINALE teksten; La forenklingen være et eget lag. Bare oppdater stavemåte/uttale uten å legge til mening.Original: [her]

Svak forespørsel / Sterk forespørsel

Svak:

Korriger og forskjønn denne OCR-teksten.

"Beautify" lar AI-en skrive om teksten, gjøre opp utelatelser og tolke innholdet; bryter lojaliteten.

Sterk:

Reparer KUN optiske gjenkjenningsfeil i denne rå OCR-utgangen. Ikke tolk mening, legg til/slett ord, la uleselige deler være med [?], endre tall og datoer. Vis hver rettelse du gjør i en egen liste i formatet "original → rettelse" slik at jeg kan verifisere den. Tekst: [her]

Forskjellen: begrenset plikt, forbud mot fabrikasjon, markering av tvetydighet og sporbar liste over korrigeringer gjør resultatet revidert.

Vanlige feil

  • Skanner med lav oppløsning. De fleste OCR-feil er forårsaket av dårlige bilder; Kvalitetsskanning er den billigste investeringen.
  • Å kalle AI "gjør vakker." Dette produserer flyt i stedet for troskap; Dokumentet skrives om.
  • Overlater tallene og datoene til AI. Disse blir i det stille ødelagt når de "korrigeres" fra konteksten; må verifiseres med bilde.
  • Fyller ut det uleselige området med en gjetning. Det skal være beskyttet av usikkerhet [?], ikke gjort opp.
  • Ikke kontrollerende i det hele tatt i stedet for prøvetaking. Selv 96 % nøyaktighet betyr tusenvis av feil på 12 000 sider; kritiske områder skannes.

Oppsummert

OCR åpner arkiver for forskere ved å konvertere trykte historiske dokumenter til søkbar tekst. AI er et kraftig hjelpemiddel for å korrigere tegnfeil i rå OCR-utdata med kontekst; Men du må trekke grensen mellom redigering og omskriving. Skanning av høy kvalitet, sikker korreksjonsinstruksjon, bevaring av tvetydighet med [?] og verifisering av navn/datoer/nummer med menneskelig øye gjør digitaliseringen både rask og pålitelig. AI rydder opp i tekst; Du er troskapens vokter.

Søknadsoppgave

Skann et trykt historisk dokument (gammel avis, offisielt brev, bokside) eller ta en OCR-utskrift. Få teksten korrigert med malen "Secure OCR correction" og be om rettelser via "original → correction"-listen. Fjern deretter områdene som krever menneskelig kontroll med "OCR-kvalitetsrapporten". Sammenlign hver dato og egennavn i listen med det faktiske bildet; Legg merke til hvor mange som ble "korrigert" feil.

sjekkliste

  • [ ] Jeg skannet dokumentet med minst 300 DPI og god kontrast.
  • [ ] Jeg spurte bare AI om optisk feilretting, ikke en omskriving.
  • [ ] Jeg beskyttet de ulesbare delene med [?].
  • [ ] Jeg bekreftet alle tall, datoer og egennavn med bildet.
  • [ ] Jeg foretok en prøve eller full sjekk på kritiske områder.