Eenheid 6 / 11

Digitaal archief, digitalisering, OCR en langetermijnbewaring

Winst:

  • Mogelijkheid om gescande documenten te corrigeren door ze naar tekst te converteren met OCR en HTR en de uitvoer te vergelijken met de daadwerkelijke afbeelding
  • Mogelijkheid om de originaliteit en integriteit van het archiefdocument te behouden en te voorkomen dat AI de inhoud verandert en verzonnen restauraties uitvoert
  • Mogelijkheid om digitale bewaring op lange termijn te plannen met herkomstinformatie en duurzame formaten

Een archivaris heeft de taak om vijftig jaar oude krantendelen, handgeschreven brieven of oude foto's naar de toekomst te brengen. Deze documenten verslijten na verloop van tijd; Om ze zowel te behouden als toegankelijk te maken, wordt aan digitalisering gedaan: het scannen van een fysiek document en het omzetten ervan in een digitale kopie. Maar screening alleen is niet genoeg; Het digitale object moet op de lange termijn vindbaar, leesbaar en onderhoudbaar zijn. In deze unit leer je hoe je kunstmatige intelligentie kunt gebruiken in de workflow voor digitalisering, transcriptie en digitale bewaring; maar u zult leren waarom u de verantwoordelijkheid voor originaliteit en nauwkeurigheid draagt.

Een paar concepten. OCR (Optical Character Recognition) is een technologie die de tekst in de afbeelding van een document omzet in machinaal bewerkbare tekst. HTR (Handgeschreven tekstherkenning) doet hetzelfde voor handgeschreven documenten en is veel moeilijker. Digitale bewaring is een geplande poging om ervoor te zorgen dat digitale objecten tientallen jaren leesbaar blijven, zelfs als bestandsformaten verouderd raken en software verandert. AI is een krachtige maar gebrekkige assistent op alle drie de gebieden.

Stap voor stap: van digitalisering naar conservering

1. Geef prioriteit. Je kunt niet alles in één keer digitaliseren. De meest kwetsbare, meest gevraagde en meest unieke documenten komen op de eerste plaats. Dit is een rechterlijke beslissing; AI helpt bij het bewerken van de lijst, maar de instelling bepaalt de prioriteit.

2. Scan en pas OCR/HTR toe. Scan het document met hoge resolutie en gebruik vervolgens OCR of HTR om de tekst te extraheren. Op AI gebaseerde tools worden hier steeds beter, zelfs met oude en moeilijke teksten.

3. Corrigeer en verifieer de tekst. OCR/HTR-uitvoer is nooit perfect. Fouten komen vaak voor, vooral als het gaat om oud schrift, verkleurde pagina's of een manuscript. Het is essentieel om de uitvoer te vergelijken met het daadwerkelijke beeld en deze te corrigeren.

4. Voeg metagegevens en beveiligingsinformatie toe. Voeg aan het digitale object de herkomst, scanomstandigheden, formaatinformatie en herkomst toe: waar het document vandaan komt en hoe het is verwerkt. Deze informatie is van cruciaal belang voor toekomstige verificatie en bescherming.

5. Plan voor langdurige bescherming. Kies bestandsformaten die open, gangbaar en duurzaam zijn; een back-up maken; Maak een migratieplan voor het geval formaten verouderd raken.

Tip: Accepteer de OCR-uitvoer niet als 'duidelijke tekst'. Als een zoeksysteem deze tekst zou doorzoeken, zouden verkeerd herkende woorden ervoor zorgen dat de bron niet gevonden wordt. Voor kritische collecties bepaalt het corrigeren van de OCR-uitvoer voor het menselijk oog de kwaliteit van alle daaropvolgende toegang.

Authenticiteit en integriteit van het digitale object

Authenticiteit en integriteit vormen de kern van archiefwerk: de zekerheid dat een document werkelijk afkomstig is van de geclaimde bron en dat de inhoud ervan niet is gewijzigd. Op dit punt creëert AI een tweeledige dreiging. Ten eerste kan de AI tijdens OCR/HTR-correctie of ‘verbetering’ de tekst in stilte aanpassen; kan een woord toevoegen dat niet bestaat onder de naam "correctie". Ten tweede: als het beeld wordt "reparatie" of "hersteld" met AI, kunnen er niet-originele details worden geproduceerd.

De regel van de archivaris is duidelijk: de digitale bewaarkopie moet trouw zijn aan het origineel. Elke verbetering die met AI wordt doorgevoerd, moet worden gedocumenteerd en de daadwerkelijke (ruwe) scan moet altijd bewaard blijven. Het ‘verfraaien’ van een document kan de historische bewijskracht ervan vernietigen.

Let op: het kan verleidelijk zijn om een ​​oude foto of document met AI te ‘verbeteren’; maar AI vult de ontbrekende delen in door ze te verzinnen. In een archiefdocument betekent dit het creëren van vals historisch bewijsmateriaal. De restauratie-uitvoer vervangt nooit de oorspronkelijke bron; wordt opgeslagen als een aparte, duidelijk gelabelde variant.

drie minikoffers

Geval 1 – Krantenarchieven werden doorzoekbaar. Een bibliotheek heeft haar 30 jaar oude collectie lokale kranten gedigitaliseerd. Met OCR werden 90.000 pagina's getranscribeerd en doorzoekbaar gemaakt; Een zoeken op onderwerp dat voorheen dagen in beslag nam, is nu teruggebracht tot seconden. Het team merkte echter dat de OCR-nauwkeurigheid daalde tot 80% op oude en bevlekte pagina's en gaf prioriteit aan het corrigeren van de bovenste jaren met het menselijk oog.

Geval 2: HTR opende het manuscript. Een archief paste HTR toe op een verzameling moeilijk leesbare 19e-eeuwse brieven. Het systeem is enorm snel geworden na maanden van lezen door experts; Maar elke pagina van de afdruk werd door een deskundige paleograaf (een expert op het gebied van oude schriften) met het origineel vergeleken, omdat er fouten in de namen van mensen en plaatsen zaten.

Zaak 3 – Valse ‘restauratie’ afgewezen. Eén team overwoog een gescheurde historische foto te ‘repareren’ met AI. AI voltooide de ontbrekende gezichtsdelen door ze aan te passen. De archivaris realiseerde zich dat deze verzonnen details het historische bewijsmateriaal zouden verdraaien; De gerepareerde afbeelding werd afzonderlijk opgeslagen naast het origineel, alleen met het duidelijke label "AI-derivaat".

Toegangskopie, bewaringskopie en formaatbeslissing

Een goede praktijk bij digitalisering is het scheiden van kopieën van hetzelfde object voor verschillende doeleinden. Een preservatiemaster is het daadwerkelijke digitale object dat de toekomst in gaat, opgeslagen in de hoogste resolutie, ongecomprimeerd of verliesvrij formaat; het wordt zelden aangeraakt. Access-exemplaar is een kleinere, gemakkelijk te openen variant die aan de gebruiker wordt gepresenteerd. Dit onderscheid is belangrijk omdat het formaat dat praktisch is voor gebruik (klein, gecomprimeerd) mogelijk niet geschikt is voor langdurige bewaring; Het ideale formaat voor conservering (groot, verliesvrij) is lastig voor dagelijks gebruik. In deze workflow kan AI helpen bij het inventariseren van bestanden, het detecteren van ontbrekende varianten en het consistent houden van metadata tussen twee kopieën. De keuze van het formaat is echter een besluit over het behoud: open, breed gedocumenteerde en duurzame formaten verdienen de voorkeur (in plaats van propriëtaire, gesloten formaten), en er moet een migratieplan gereed worden gehouden voor het geval de formaten na verloop van tijd verouderd raken. Zelfs als AI een format voorstelt, heeft het langetermijnbewaringsbeleid van de instelling het laatste woord.

Tip: Houd voor elk digitaal object een kort verslag bij dat antwoord geeft op de vragen "waar is de originele bron, in welk formaat is de bewaarkopie, in welk formaat is de toegangskopie en welke wordt ter beschikking gesteld aan de gebruiker?" Door deze drie lagen te combineren, wordt het onduidelijk welk bestand in de toekomst de vertrouwde master is.

Vier kopieerbare sjablonen

1) Hulp voor OCR-uitvoercorrectie:

Hieronder vindt u een OCR-tekst en een beschrijving van de daadwerkelijke pagina. Repareer alleen openOCR-fouten (slechte karakters, samengestelde/gesplitste woorden). Wijzig de inhoud niet, voeg geen woorden toe of verwijder geen woorden. Als u het niet zeker weet, markeer dan met "[?]". OCR-tekst: [hier]

2) Consistentiecontrole tekst-afbeelding:

Zijn er toevoegingen in de gecorrigeerde tekst hieronder die naar verwachting niet in het originele document (dat mogelijk verzonnen is) voorkomen? Markeer elk verdacht onderdeel en schrijf op waarom het verdacht is. Tekst: [hier]

3) Ontwerp van metagegevens voor bescherming:

Genereer het overzicht van de bewaringsmetadata voor het volgende gedigitaliseerde object: bron, herkomst, scandatum/resolutie, bestandsformaat, transactiegeschiedenis. Gebruik gewoon de informatie die ik heb verstrekt en laat het ontbrekende veld leeg. Informatie: [hier]

4) Hulp bij het stellen van prioriteiten:

Hieronder vindt u de lijst met collecties die wachten op digitalisering; Helpen bij het stellen van prioriteiten op basis van kwetsbaarheid, vraag en uniciteit. Geef een korte rechtvaardiging voor elke hulpbron; Laat de uiteindelijke beslissing aan mij over.Lijst: [hier]

Zwakke prompt/sterke prompt

Zwakke prompt:

Corrigeer en verfraai deze gescande tekst.

“Beautify” nodigt AI uit om de inhoud te veranderen en de omissies goed te maken; De originaliteit van het archiefdocument is aangetast.

Krachtige prompt:

Jouw rol: assistent digitaliseringsredacteur. In de volgende OCR-tekst corrigeert u ALLEEN expliciete herkenningsfouten (slecht karakter, onjuist gesplitst woord). Voeg geen woorden toe, verwijder of verander geen woorden. Laat "[?]" achter als u het niet zeker weet. Toon elke correctie die u heeft aangebracht in een aparte lijst. Tekst: [hier]

De krachtige prompt beperkt de AI tot het alleen herkennen van fouten, verbiedt het aanraken van inhoud en maakt correcties traceerbaar.

Workflow- en risicotabel

Stadium

Bijdrage van AI

Belangrijkste risico

beschermingsmaatregel

scannen

slechte kwaliteit

hoge resolutie

OCR/HTR

Converteren naar tekst

Herkenningsfouten

menselijke correctie

correctie

Foutsuggestie

Inhoud wijzigen

Vergelijking met origineel

restauratie

Afgeleide afbeelding

passend detail

Bewaar het rauwe origineel en label het

bescherming

Metagegevensconcept

verlies van oorsprong

Herkomst record

Veel voorkomende fouten

  • De OCR-uitvoer accepteren zonder correctie. Fouten verstoren het zoeken en toegang.
  • AI noemen we ‘mooi maken’. Het verandert de inhoud en vernietigt de originaliteit.
  • Vervanging van AI-herstel door feitelijk bewijsmateriaal. Verzonnen details creëren een valse geschiedenis.
  • De onbewerkte scan wordt niet opgeslagen. Geen enkele correctie kan worden geverifieerd zonder het origineel.
  • Het weglaten van herkomstinformatie. De betrouwbaarheid van het document wordt onvindbaar.

Samengevat

AI in digitale archieven en digitalisering; Het is een waardevol hulpmiddel dat de OCR/HTR-transcriptie, het opstellen van metadata en het stellen van prioriteiten versnelt. Maar de essentie van archiefwerk is authenticiteit en integriteit: OCR-uitvoer moet door het menselijk oog worden gecorrigeerd, AI mag nooit stilletjes de inhoud vervangen, restauratiederivaten mogen het originele bewijsmateriaal niet vervangen, en ruwe scan- en herkomstinformatie moet altijd behouden blijven. Gebruik AI als een hulpmiddel dat het document niet ‘verbetert’, maar het toegankelijk maakt en er tegelijkertijd trouw aan blijft.

Applicatie taak

Ontvang een kort voorbeeld van de OCR-uitvoer (uw eigen productie of een daadwerkelijke scan). Laat alleen de herkenningsfouten corrigeren met de sjabloon "OCR output correction help", controleer vervolgens of de AI inhoud heeft toegevoegd met de sjabloon "Tekst-beeldconsistentiecontrole". Maak vervolgens een record aan met de herkomst- en formaatinformatie van het object met het sjabloon ‘Conservatie metadata concept’.

controlelijst

  • [ ] Ik heb de OCR/HTR-uitvoer vergeleken met het werkelijke beeld en gecorrigeerd.
  • [ ] Ik heb gecontroleerd of de AI geen inhoud toevoegt/wijzigt.
  • [ ] De onbewerkte (master)scan heb ik apart en ongewijzigd bewaard.
  • [ ] Ik heb herkomst- en formaatinformatie aan de metadata toegevoegd.
  • [ ] Ik heb restauratievarianten duidelijk bestempeld als "AI-derivaat".