Enhed 2 / 12

Dokumentdigitalisering og OCR: Konvertering af udskrevet tekst til maskintekst

Gevinster:

  • Mulighed for at opsætte digitalisering og OCR-workflow (scanning, forbehandling, genkendelse, korrektion, verifikation) trin for trin
  • Evne til at bruge AI til at rette OCR-fejl med kontekst, samtidig med at rettelses- og omskrivningslinjen bevares og tvetydighed markeres med [?]
  • Forstå hvorfor tal, datoer og egennavne skal verificeres visuelt og hvilken rolle kvalitetskontrol spiller.

De millioner af sider på de fysiske hylder i et arkiv eller et bibliotek bliver først for alvor åbnet for forskeren, når de bliver digitaliserede og søgbare. Digitalisering er at konvertere et fysisk dokument til et digitalt billede ved at scanne eller fotografere det. Men et fotografi af en side er endnu ikke "tekst"; For computeren er det stadig et billede, du kan ikke søge i det. Det er her OCR kommer ind i billedet.

OCR (Optical Character Recognition) er en teknologi, der genkender trykte bogstaver i et dokumentbillede og konverterer dem til maskinlæsbar, søgbar tekst. I denne enhed lærer du, hvordan du digitaliserer historiske trykte dokumenter med OCR, hvordan AI hjælper med at rette OCR-fejl i denne proces, og hvor det menneskelige øje er essentielt. (Håndskrevne tekster kræver en anden teknologi; det dækker vi i næste enhed.)

Digitaliseringsarbejdsgang: trin for trin

1. Forberedelse og screening. Scan dokumentet i den højest mulige kvalitet. En generel tommelfingerregel for historisk forskning er en opløsning på mindst 300-400 DPI (dots per inch). Lav opløsning skyrocker fejlprocenten i det efterfølgende OCR-stadium.

2. Billedforbehandling. Forbedring af billedet før OCR øger succesen markant: fjernelse af den scannede side, fjernelse af pletter, øget kontrast, konvertering til sort/hvid. Moderne AI-baserede værktøjer kan automatisere dette trin.

3. OCR-applikation. Du sender billedet til OCR-motoren; Motoren genkender bogstaver og producerer tekst. Outputtet består normalt af to lag: det synlige dokumentbillede og et "søgbart skjult tekstlag" nedenunder.

4. Rettelse (efterkorrektion). Rå OCR-output er aldrig perfekt. Tegn læses forkert på grund af gamle skrifttyper, gulnet papir, blækudtværing og scanningsfejl. Det er her AI er en stærk hjælper: den foreslår og retter OCR-fejl ved hjælp af kontekst.

5. Verifikation og kvalitetskontrol. Den rettede tekst kontrolleres af mennesket på prøvebasis eller fuldstændigt. Især kritiske områder som navne, datoer og tal skal verificeres visuelt.

Hvorfor OCR laver fejl, hvordan hjælper AI

Typiske problemer, der udfordrer OCR i historiske dokumenter: gamle og smarte skrifttyper, forældede bogstaver såsom lange "s" (ſ), sidelayout med to spalter, fodnoter, håndskrevne indlæg, segl og falmet blæk. Fordi en OCR-motor "ser" bogstaver et efter et, forveksler den ofte det binære "rn" som "m", bogstavet "l" som tallet "1" og bogstavet "O" som "0".

AI-sprogmodeller tilbyder en anden kraft her: de forstår kontekst. Hvis en OCR-motor skrev "1stanbu1", kunne AI udlede af konteksten, at det skulle være "Istanbul". Men der er en stor fare her: når du "retter" kan AI også ændre teksten. Han kan tilføje "Jeg rettede" et ikke-eksisterende ord eller udfylde et uklart sted med sit eget gæt. Dette forstyrrer transskriptionens troskab.

Forsigtig: Den gyldne regel i OCR-korrektion er denne: AI bør kun rette åbenlyse genkendelsesfejl, ikke fortolke eller supplere tekstens indhold. "1stanbu1 → Istanbul" er legitim; Det handler ikke om at fylde et ulæseligt ord med gæt. Usikre steder skal markeres med [?] og bør ikke gøres op.

OCR fejltyper og tilgang med en tabel

Fejltype

eksempel

Kan AI ordne det?

menneskelig kontrol

karakterblanding

rn↔m, l↔1, O↔0

Ja, det er sikkert

prøve

gammel bogstavform

lang ſ → s

Ja, det er sikkert

prøve

Faldet/ulæseligt ord

"ka___n"

Nej, skal sætte [?]

obligatorisk

egennavn/stednavn

"Constantiniyye"

forsigtig

obligatorisk

Nummer/dato

"1867" mod "1857"

risikabelt

obligatorisk

Sidelayout (kolonne/fodnote)

blandet flow

delvist

obligatorisk

For at opsummere billedet i én sætning: AI rydder pålideligt op i almindelige tegnfejl; Men menneskelige øjne er påkrævet for specielle navne, tal, datoer og ulæselige steder.

tre minisager

Sag 1 - Avisarkiver blev søgbare. Et universitetsbibliotek har digitaliseret 12.000 sider med lokalaviser fra 1930'erne. Rå OCR-nøjagtighed var anslået 82 % (18 ud af hver 100 tegn var forkerte). AI-baseret korrektion øgede nøjagtigheden til 96 % med en ordbog og kontekst, der passer til avissprog. For resterende fejl blev der udført en prøvekontrol i stedet for den fulde tekst; Samlingen blev søgbar på 3 uger.

Tilfælde 2 — AI "korrigeret" og forvrænget historie. En arkivar fik AI til at rette datoen "1863" på OCR-udskriften. AI'en "korrigerede" datoen til "1868" ved at se på en anden begivenhed i sammenhængen - selvom dokumentet tydeligt sagde 1863. Hvis arkivaren ikke havde set på det originale billede, ville kataloget være kommet ind med den forkerte dato. Lektion: tal og datoer overlades aldrig til AI, de bekræftes med billedet.

Case 3 — To-spaltet side forvirret. De to-spaltesider i en årbog fra det 19. århundrede blev blandet til en enkelt strøm i OCR, og sætningerne blev flettet sammen. Det rå output var ulæseligt. Teksten blev forbedret, da jeg først opdelte sidelayoutet i regioner (segmentering) og behandlede hver kolonne separat. Lektion: i kompleks sidelayout, struktur først, tekst derefter.

Fire kopierbare skabeloner

1) Sikker OCR-korrektion:

Nedenfor er det rå OCR-output af et historisk dokument. Din opgave er KUN at rette åbenlyse optiske genkendelsesfejl (f.eks. rn→m,1→l, 0→O, lange ſ→s). Regler: (1) Fortolk tekstens betydning. (2) Ret ulæselige/tvetydige ord, lad være som de er og marker med [?]. (3) INGEN tilføjelse, fjernelse eller fuldførelse af sætninger. (4) SKIFT numre og datoer; marker [nummer?], hvis du er i tvivl. Rå OCR: [her]

2) OCR-kvalitetsrapport:

Undersøg OCR-outputtet nedenfor og lav en kvalitetsrapport: (1) Angiv ord med mulige genkendelsesfejl, (2) Marker områder, der forekommer ulæselige/uklare, (3) Angiv specifikke navne, datoer og numre, der kræver menneskelig kontrol. RET IKKE; generer kun tjekliste.Tekst: [her]

3) Hjælp til parsing af kolonne/struktur:

Da OCR-teksten nedenfor kommer fra en side med to spalter, kan flowet være forvirret. Omarranger teksten til logiske afsnit, MEN du må ikke ændre, tilføje eller slette ord. Bare ret rækkefølgen. Marker den ordre, du ikke er sikker på, med [ordre?]. Tekst: [her]

4) Normalisering til standardsprog (valgfrit, separat lag):

Fremstil en forenklet læseversion i dagens stavemåde, i en separat spalte, OVER den rettede historiske tekst nedenfor. Ændre ALDRIG den ORIGINALE tekst; Lad forenklingen være et separat lag. Bare opdater stavning/udtale uden at tilføje betydning.Original: [her]

Svag prompt / Stærk prompt

Svag:

Ret og forskønne denne OCR-tekst.

"Beautify" giver AI'en mulighed for at omskrive teksten, finde på udeladelser og fortolke indholdet; bryder loyaliteten.

Stærk:

Ret KUN optiske genkendelsesfejl i denne rå OCR-output. Fortolk ikke betydning, tilføj/slet ord, lad ulæselige dele være med [?], skift tal og datoer. Vis hver rettelse du laver på en separat liste i formatet "original → rettelse", så jeg kan verificere den. Tekst: [her]

Forskellen: afgrænset pligt, forbud mod fremstilling, mærkningsuklarhed og sporbar liste over rettelser gør output revideret.

Almindelige fejl

  • Scanner ved lav opløsning. De fleste OCR-fejl er forårsaget af dårlige billeder; Kvalitetsscanning er den billigste investering.
  • Kalder AI "gør smuk." Dette producerer flydende snarere end troskab; Dokumentet er omskrevet.
  • Overlader tallene og datoerne til AI. Disse forvanskes lydløst, når de "korrigeres" fra konteksten; skal verificeres med billede.
  • At udfylde det ulæselige område med et gæt. Det skal være beskyttet af usikkerhed [?], ikke gjort op.
  • Slet ikke kontrollerende i stedet for prøveudtagning. Selv 96 % nøjagtighed betyder tusindvis af fejl på 12.000 sider; kritiske områder scannes.

Sammenfattende

OCR åbner arkiver for forskere ved at konvertere trykte historiske dokumenter til søgbar tekst. AI er en kraftfuld hjælp til at korrigere tegnfejl i rå OCR-output med kontekst; Men du skal trække grænsen mellem redigering og omskrivning. Scanning af høj kvalitet, sikker korrektionsinstruktion, bevarelse af tvetydighed med [?] og menneskeøje-verifikation af navne/datoer/numre gør digitaliseringen både hurtig og pålidelig. AI rydder op i tekst; Du er troskabens vogter.

Ansøgningsopgave

Scan et trykt historisk dokument (gammel avis, officielt brev, bogside) eller tag en OCR-udskrift. Få teksten rettet med skabelonen "Sikker OCR-korrektion" og anmod om rettelser via listen "original → rettelse". Fjern derefter de områder, der kræver menneskelig kontrol med "OCR-kvalitetsrapporten". Sammenlign hver dato og egennavn på listen med det faktiske billede; Bemærk hvor mange der blev "rettet" forkert.

tjekliste

  • [ ] Jeg scannede dokumentet med mindst 300 DPI og god kontrast.
  • [ ] Jeg bad kun AI om optisk fejlkorrektion, ikke en omskrivning.
  • [ ] Jeg beskyttede de ulæselige dele med [?].
  • [ ] Jeg bekræftede alle tal, datoer og egennavne med billedet.
  • [ ] Jeg foretog en prøve eller fuld kontrol i kritiske områder.