Winst:
- Mogelijkheid om de digitaliserings- en OCR-workflow (scannen, voorbewerken, herkenning, correctie, verificatie) stap voor stap in te richten
- Mogelijkheid om AI te gebruiken om OCR-fouten met context te corrigeren, terwijl de correctie- en herschrijfregel behouden blijft en dubbelzinnigheid wordt gemarkeerd met [?]
- Begrijp waarom cijfers, data en eigennamen visueel moeten worden geverifieerd en wat de rol van kwaliteitscontrole is.
De miljoenen pagina's op de fysieke planken van een archief of bibliotheek worden pas echt toegankelijk voor de onderzoeker wanneer ze gedigitaliseerd en doorzoekbaar worden. Digitalisering is het omzetten van een fysiek document in een digitaal beeld door het te scannen of te fotograferen. Maar een foto van een pagina is nog geen "tekst"; Voor de computer is het nog steeds een afbeelding, je kunt er niet in zoeken. Dit is waar OCR in het spel komt.
OCR (Optical Character Recognition) is een technologie die gedrukte letters in een documentafbeelding herkent en deze omzet in machinaal leesbare, doorzoekbare tekst. In deze unit leer je hoe je historische gedrukte documenten kunt digitaliseren met OCR, hoe AI helpt bij het corrigeren van OCR-fouten in dit proces en waar het menselijk oog essentieel is. (Handgeschreven teksten vereisen een andere technologie; dat bespreken we in de volgende unit.)
Digitaliseringsworkflow: stap voor stap
1. Voorbereiding en screening. Scan het document met de hoogst mogelijke kwaliteit. Een algemene vuistregel voor historisch onderzoek is een resolutie van minimaal 300-400 DPI (dots per inch). Een lage resolutie verhoogt het foutenpercentage in de daaropvolgende OCR-fase.
2. Voorbewerking van afbeeldingen. Het verbeteren van de afbeelding vóór OCR vergroot het succes enorm: het rechtzetten van de gescande pagina, het verwijderen van oneffenheden, het verhogen van het contrast, het converteren naar zwart-wit. Moderne op AI gebaseerde tools kunnen deze stap automatiseren.
3. OCR-toepassing. Je stuurt de afbeelding naar de OCR-engine; De engine herkent letters en produceert tekst. De uitvoer bestaat doorgaans uit twee lagen: de zichtbare documentafbeelding en een "doorzoekbare verborgen tekstlaag" daaronder.
4. Correctie (nacorrectie). Ruwe OCR-uitvoer is nooit perfect. Tekens worden verkeerd gelezen vanwege oude lettertypen, vergeeld papier, inktvlekken en scanfouten. Dit is waar AI een krachtige hulp is: het suggereert en corrigeert OCR-fouten met behulp van context.
5. Verificatie en kwaliteitscontrole. De gecorrigeerde tekst wordt steekproefsgewijs of volledig door de mens gecontroleerd. Vooral kritische gebieden zoals namen, data en nummers moeten visueel worden geverifieerd.
Waarom OCR fouten maakt, hoe AI helpt
Typische problemen die OCR in historische documenten op de proef stellen: oude en mooie lettertypen, verouderde lettervormen zoals lange "s" (ſ), pagina-indeling met twee kolommen, voetnoten, handgeschreven invoegingen, zegels en vervaagde inkt. Omdat een OCR-engine letters één voor één "ziet", verwart hij vaak de binaire "rn" met "m", de letter "l" met het cijfer "1" en de letter "O" met "0".
AI-taalmodellen bieden hier een andere kracht: ze begrijpen de context. Als een OCR-engine "1stanbu1" zou schrijven, zou de AI uit de context kunnen afleiden dat dit "Istanbul" zou moeten zijn. Maar hier schuilt een groot gevaar: bij het ‘corrigeren’ kan de AI ook de tekst veranderen. Hij kan een niet-bestaand woord toevoegen met 'Ik heb het gecorrigeerd' of een onduidelijke plek invullen met zijn eigen gok. Dit verstoort de betrouwbaarheid van de transcriptie.
Let op: De gouden regel bij OCR-correctie is deze: AI mag alleen duidelijke herkenningsfouten corrigeren en de inhoud van de tekst niet interpreteren of aanvullen. "1stanbu1 → Istanboel" is legitiem; Het gaat niet om het vullen van een onleesbaar woord met gissingen. Onzekere plaatsen moeten worden gemarkeerd met [?] en mogen niet worden opgemaakt.
OCR-fouttypen en aanpak met een tabel
Fouttype
voorbeeld
Kan AI dit oplossen?
menselijke controle
karakter mixen
rn↔m, l↔1, O↔0
Ja, het is veilig
monster
oude lettervorm
lang ſ → s
Ja, het is veilig
monster
Vervaagd/onleesbaar woord
"ka___n"
Nee, moet [?]
verplicht
eigennaam/plaatsnaam
"Constantiniyye"
voorzichtig
verplicht
Nummer/datum
"1867" versus "1857"
riskant
verplicht
Pagina-indeling (kolom/voetnoot)
gemengde stroom
gedeeltelijk
verplicht
Om het beeld in één zin samen te vatten: AI ruimt op betrouwbare wijze gewone karakterfouten op; Maar voor bijzondere namen, cijfers, data en onleesbare plaatsen zijn menselijke ogen nodig.
drie minikoffers
Geval 1 – Krantenarchieven werden doorzoekbaar. Een universiteitsbibliotheek heeft 12.000 pagina's lokale kranten uit de jaren dertig gedigitaliseerd. De ruwe OCR-nauwkeurigheid bedroeg naar schatting 82% (18 van de 100 tekens waren onjuist). Op AI gebaseerde correctie verhoogde de nauwkeurigheid tot 96% met een woordenboek en context die geschikt waren voor de krant. Voor resterende fouten werd een steekproefcontrole uitgevoerd in plaats van de volledige tekst; Binnen 3 weken was de collectie doorzoekbaar.
Geval 2 – AI heeft de geschiedenis ‘gecorrigeerd’ en verdraaid. Een archivaris liet AI de datum "1863" op de OCR-afdruk corrigeren. De AI ‘corrigeerde’ de datum naar ‘1868’ door naar een andere gebeurtenis in de context te kijken – ook al vermeldde het document duidelijk 1863. Als de archivaris niet naar de originele afbeelding had gekeken, zou de catalogus met de verkeerde datum zijn binnengekomen. Les: cijfers en datums worden nooit aan de AI overgelaten, ze worden geverifieerd met de afbeelding.
Geval 3 – Pagina met twee kolommen in de war. De pagina's met twee kolommen van een 19e-eeuws jaarboek werden in OCR samengevoegd tot één stroom en de zinnen werden met elkaar verweven. De onbewerkte uitvoer was onleesbaar. De tekst verbeterde toen ik de pagina-indeling eerst in gebieden verdeelde (segmentatie) en elke kolom afzonderlijk verwerkte. Les: bij complexe pagina-indeling eerst structuur, daarna tekst.
Vier kopieerbare sjablonen
1) Veilige OCR-correctie:
Hieronder vindt u de onbewerkte OCR-uitvoer van een historisch document. Het is uw taak ALLEEN duidelijke optische herkenningsfouten te corrigeren (bijvoorbeeld rn→m,1→l, 0→O, long ſ→s). Regels: (1) Interpreteer de betekenis van de tekst. (2) Corrigeer onleesbare/dubbelzinnige woorden, laat ze zoals ze zijn en markeer ze met [?]. (3) GEEN zinnen toevoegen, verwijderen of aanvullen. (4) WIJZIG cijfers en datums; markeer [nummer?] bij twijfel. Ruwe OCR: [hier]
2) OCR-kwaliteitsrapport:
Bestudeer de OCR-uitvoer hieronder en maak een kwaliteitsrapport: (1) Maak een lijst van woorden met mogelijke herkenningsfouten, (2) Markeer gebieden die onleesbaar/onduidelijk lijken, (3) Maak een lijst van specifieke namen, datums en nummers die menselijke controle vereisen. NIET corrigeren; genereer alleen een checklist.Tekst: [hier]
3) Hulp bij het ontleden van kolommen/structuren:
Omdat de onderstaande OCR-tekst afkomstig is van een pagina met twee kolommen, kan de stroom verward zijn. Herschik de tekst in logische alinea's MAAR verander, voeg geen woorden toe of verwijder geen woorden. Corrigeer gewoon de bestelling. Markeer de bestelling waarvan u niet zeker bent met [bestelling?]. Tekst: [hier]
4) Normalisatie naar standaardtaal (optioneel, aparte laag):
Maak een vereenvoudigde leesversie in de spelling van vandaag, in een aparte kolom, BOVEN de gecorrigeerde historische tekst hieronder. Wijzig NOOIT de ORIGINELE tekst; Laat de vereenvoudiging een aparte laag zijn. Update gewoon de spelling/uitspraak zonder betekenis toe te voegen. Origineel: [hier]
Zwakke prompt/sterke prompt
Zwak:
Corrigeer en verfraai deze OCR-tekst.
Met “Verfraaien” kan de AI de tekst herschrijven, weglatingen goedmaken en de inhoud interpreteren; breekt loyaliteit.
Sterk:
Repareer ALLEEN optische herkenningsfouten in deze onbewerkte OCR-uitvoer. De betekenis niet interpreteren, woorden toevoegen/verwijderen, onleesbare delen achterlaten met [?], cijfers en datums wijzigen. Toon elke correctie die u aanbrengt in een aparte lijst in het formaat "origineel → correctie", zodat ik deze kan verifiëren. Tekst: [hier]
Het verschil: een begrensd recht, een verbod op fabricage, het markeren van dubbelzinnigheid en een traceerbare lijst met correcties maken de output controleerbaar.
Veel voorkomende fouten
- Scannen met lage resolutie. De meeste OCR-fouten worden veroorzaakt door slechte afbeeldingen; Kwaliteitsscannen is de goedkoopste investering.
- AI noemen we ‘mooi maken’. Dit levert eerder vloeiendheid dan trouw op; Het document wordt herschreven.
- Ik laat de cijfers en datums over aan de AI. Deze worden stilletjes gecorrumpeerd wanneer ze vanuit de context worden "gecorrigeerd"; moet per afbeelding worden geverifieerd.
- Het onleesbare gebied invullen met een gok. Het moet beschermd worden door onzekerheid [?], en niet verzonnen.
- Helemaal niet controleren in plaats van bemonsteren. Zelfs een nauwkeurigheid van 96% betekent duizenden fouten op 12.000 pagina's; kritieke gebieden worden gescand.
Samengevat
OCR opent archieven voor onderzoekers door gedrukte historische documenten om te zetten in doorzoekbare tekst. AI is een krachtig hulpmiddel bij het corrigeren van tekenfouten in onbewerkte OCR-uitvoer met context; Maar je moet de grens trekken tussen bewerken en herschrijven. Hoogwaardig scannen, veilige correctie-instructies, behoud van dubbelzinnigheid met [?] en verificatie door het menselijk oog van namen/data/nummers maken de digitalisering zowel snel als betrouwbaar. AI ruimt tekst op; Jij bent de bewaker van trouw.
Applicatie taak
Scan een gedrukt historisch document (oude krant, officiële brief, boekpagina) of maak een OCR-afdruk. Laat de tekst corrigeren met het sjabloon “Veilige OCR-correctie” en vraag correcties aan via de lijst “Origineel → Correctie”. Verwijder vervolgens de gebieden die menselijke controle vereisen met het "OCR-kwaliteitsrapport". Vergelijk elke datum en eigennaam in de lijst met de daadwerkelijke afbeelding; Merk op hoeveel er verkeerd werden "gecorrigeerd".
controlelijst
- [ ] Ik heb het document gescand met minimaal 300 DPI en goed contrast.
- [ ] Ik heb de AI alleen om optische foutcorrectie gevraagd, niet om een herschrijving.
- [ ] De onleesbare delen heb ik beveiligd met [?].
- [ ] Ik heb alle cijfers, data en eigennamen geverifieerd met de afbeelding.
- [ ] Ik heb een monster of volledige controle uitgevoerd op kritieke gebieden.