Gevinster:
- Mulighed for at rette scannede dokumenter ved at konvertere dem til tekst med OCR og HTR og sammenligne output med det faktiske billede
- Evne til at bevare originaliteten og integriteten af arkivdokumentet og forhindre AI i at ændre indholdet og fremstillet restaurering
- Evne til at planlægge langsigtet digital bevaring med herkomstinformation og holdbare formater
En arkivar har til opgave at føre halvtreds år gamle avisbind, håndskrevne breve eller gamle fotografier ind i fremtiden. Disse dokumenter slides over tid; For både at bevare og gøre dem tilgængelige, foretages digitalisering: handlingen med at scanne et fysisk dokument og konvertere det til en digital kopi. Men screening alene er ikke nok; Det digitale objekt skal være let at finde, læse og vedligeholde på længere sigt. I denne enhed lærer du at bruge kunstig intelligens i digitaliserings-, transskriptions- og digital bevaringsarbejdsgangen; men du vil lære, hvorfor du vil bære ansvaret for originalitet og nøjagtighed.
Et par begreber. OCR (Optical Character Recognition) er en teknologi, der konverterer teksten i billedet af et dokument til maskinredigerbar tekst. HTR (Handwritten Text Recognition) gør det samme arbejde for håndskrevne dokumenter og er meget vanskeligere. Digital bevaring er en planlagt indsats for at sikre, at digitale objekter forbliver læsbare i årtier, selv når filformater bliver forældede og softwareændringer. AI er en kraftfuld, men mangelfuld assistent på alle tre områder.
Trin for trin: fra digitalisering til bevaring
1. Prioriter. Man kan ikke digitalisere alt på én gang. De mest skrøbelige, mest efterspurgte og mest unikke dokumenter sættes først. Dette er en retsafgørelse; AI hjælper med listeredigering, men institutionen bestemmer prioriteringen.
2. Scan og anvend OCR/HTR. Scan dokumentet i høj opløsning, og brug derefter OCR eller HTR til at udtrække teksten. AI-baserede værktøjer bliver bedre og bedre her, selv med gamle og svære tekster.
3. Ret og bekræft teksten. OCR/HTR output er aldrig perfekt. Fejl er almindelige, især hvis der er gammel skrift, farvede sider eller et manuskript. Det er vigtigt at sammenligne outputtet med det faktiske billede og rette det.
4. Tilføj metadata og beskyttelsesoplysninger. Tilføj til det digitale objekt dets herkomst, scanningsbetingelser, formatoplysninger og herkomst - hvor dokumentet kom fra, og hvordan det blev behandlet. Disse oplysninger er afgørende for fremtidig verifikation og beskyttelse.
5. Plan for langsigtet beskyttelse. Vælg filformater, der er åbne, almindelige og holdbare; sikkerhedskopiere; Lav en migreringsplan i tilfælde af, at formater bliver forældede.
Tip: Accepter ikke OCR-output som "klar tekst". Hvis et søgesystem skulle arbejde gennem denne tekst, ville forkert genkendte ord medføre, at kilden ikke blev fundet. For kritiske samlinger bestemmer korrigering af OCR-output til det menneskelige øje kvaliteten af al efterfølgende adgang.
Autenticitet og integritet af det digitale objekt
Kernen i arkivarbejdet er autenticitet og integritet: forsikringen om, at et dokument virkelig kommer fra den påståede kilde, og at dets indhold ikke er blevet ændret. På dette tidspunkt skaber AI en tostrenget trussel. For det første, under OCR/HTR-korrektion eller "forbedring", kan AI lydløst ændre teksten; kan tilføje et ord, der ikke findes under navnet "rettelse". For det andet, hvis billedet "reparation" eller "gendannelse" udføres med AI, kan ikke-originale detaljer produceres.
Arkivarens regel er klar: Den digitale bevaringskopi skal være tro mod originalen. Enhver forbedring foretaget med AI bør dokumenteres, og den faktiske (rå) scanning bør altid bevares. At "forskønne" et dokument kan ødelægge dets historiske bevisværdi.
Forsigtig: Det kan være fristende at "forbedre" et gammelt foto eller dokument med AI; men AI udfylder de manglende dele ved at gøre dem op. I et arkivdokument betyder det at skabe falske historiske beviser. Gendannelsesoutput erstatter aldrig den originale kilde; opbevares som en separat, tydeligt mærket variant.
tre minisager
Sag 1 - Avisarkiver blev søgbare. Et bibliotek har digitaliseret sin 30 år gamle samling af lokalaviser. Med OCR blev 90.000 sider transskriberet og gjort søgbare; En emnesøgning, der tidligere tog dage, er nu reduceret til sekunder. Holdet bemærkede dog, at OCR-nøjagtigheden faldt til 80 % på gamle og plettede sider og prioriterede at korrigere de bedste år med det menneskelige øje.
Sag 2 — HTR åbnede manuskriptet. Et arkiv anvendte HTR på en samling svære at læse breve fra det 19. århundrede. Systemet fik stor hastighed ifølge måneders læsning af eksperter; Men hver side af udskriften blev sammenlignet med originalen af en ekspert palæograf (en ekspert i gammel skrift), fordi der var fejl i navnene på personer og steder.
Sag 3 — Falsk "genopretning" afvist. Et hold overvejede at "reparere" et revet historisk fotografi med kunstig intelligens. AI fuldendte de manglende ansigtsdele ved at montere dem. Arkivaren indså, at disse opdigtede detaljer ville fordreje de historiske beviser; Det reparerede billede blev opbevaret separat sammen med originalen, kun tydeligt mærket "AI-derivat".
Adgangskopi, bevarelseskopi og formatbeslutning
En god praksis i digitalisering er at adskille kopier af det samme objekt til forskellige formål. En konserveringsmaster er det faktiske digitale objekt, der skal transporteres ind i fremtiden, lagret i den højeste opløsning, ukomprimeret eller tabsfrit format; det er sjældent rørt. Access copy er en mindre, letåbnet variant, der præsenteres for brugeren. Denne skelnen er vigtig, fordi det format, der er praktisk at bruge (lille, komprimeret) muligvis ikke er egnet til langtidsbevaring; Det ideelle format til konservering (stort, tabsfrit) er besværligt til daglig brug. I denne workflow kan AI hjælpe med at opgøre filer, opdage manglende varianter og holde metadata konsistente mellem to kopier. Valget af format er dog en bevarelsesbeslutning: Åbne, bredt dokumenterede og holdbare formater bør foretrækkes (frem for proprietære, lukkede formater), og en migreringsplan bør holdes klar i tilfælde af, at formaterne bliver forældede med tiden. Selvom AI foreslår et format, har institutionens langsigtede bevaringspolitik det sidste ord.
Tip: For hvert digitalt objekt skal du føre en kort registrering, der besvarer spørgsmålene "hvor er den originale kilde, i hvilket format er bevarelseskopien, i hvilket format er adgangskopien, og hvilken er tilgængelig for brugeren?" Blanding af disse tre lag gør det uklart, hvilken fil der er den betroede master fremover.
Fire kopierbare skabeloner
1) Hjælp til OCR-outputkorrektion:
Nedenfor er en OCR-tekst og beskrivelse af den aktuelle side. Ret kun openOCR-fejl (dårlige tegn, sammensatte/opdelte ord). Du må ikke ændre indhold, tilføje eller fjerne ord. Hvis du ikke er sikker, skal du markere med "[?]". OCR-tekst: [her]
2) Kontrol af tekst-billede konsistens:
Er der tilføjelser i den rettede tekst nedenfor, som ikke forventedes at være i det originale dokument (som muligvis er opdigtet)? Markér hver mistænkelig del, og skriv, hvorfor den er mistænkelig. Tekst: [her]
3) Udkast til beskyttelsesmetadata:
Generer bevaringsmetadataskitsen for følgende digitaliserede objekt: kilde, herkomst, scanningsdato/opløsning, filformat, transaktionshistorik. Brug blot de oplysninger, jeg har givet, lad det manglende felt stå tomt. Information: [her]
4) Hjælp til prioritering:
Nedenfor er listen over samlinger, der afventer digitalisering; Hjælp med at prioritere ud fra skrøbelighed, efterspørgsel og unikhed. Giv en kort begrundelse for hver ressource; Overlad den endelige beslutning til mig. Liste: [her]
Svag prompt / Stærk prompt
Svag prompt:
Ret og forskønne denne scannede tekst.
"Beautify" inviterer AI til at ændre indholdet, kompensere for udeladelserne; Originaliteten af arkivdokumentet er beskadiget.
Kraftig prompt:
Din rolle: digitaliseringsredaktørassistent. I den følgende OCR-tekst skal du KUN rette eksplicitte genkendelsesfejl (dårligt tegn, forkert opdelt ord). Du må ikke tilføje, fjerne eller ændre ord. Efterlad "[?]", hvor du ikke er sikker. Vis hver rettelse, du har foretaget, på en separat liste. Tekst: [her]
Den kraftfulde prompt begrænser AI til kun at genkende fejl, forbyder den i at røre ved indhold og gør rettelser sporbare.
Arbejdsgang og risikotabel
Scene
Bidrag af AI
Hovedrisiko
beskyttelsesforanstaltning
scanning
—
dårlig kvalitet
høj opløsning
OCR/HTR
Konverter til tekst
Genkendelsesfejl
menneskelig korrektion
rettelse
Fejlforslag
Ændring af indhold
Sammenligning med original
restaurering
Billedafledt
passende detalje
Behold den rå original, mærk den
beskyttelse
Metadata kladde
tab af oprindelse
Herkomstoptegnelse
Almindelige fejl
- Accept af OCR-output uden korrektion. Fejl forstyrrer søgning og adgang.
- Kalder AI "gør smuk." Det ændrer indholdet og ødelægger originaliteten.
- At erstatte AI-gendannelse med faktiske beviser. Fremstillede detaljer skaber falsk historie.
- Ikke gemmer den rå scanning. Ingen rettelse kan verificeres uden originalen.
- Udeladelse af herkomstoplysninger. Dokumentets pålidelighed bliver ikke sporbar.
Sammenfattende
AI i digitale arkiver og digitalisering; Det er et værdifuldt hjælpemiddel, der fremskynder OCR/HTR-transskription, metadataudformning og prioritering. Men essensen af arkivarbejde er ægthed og integritet: OCR-output skal korrigeres af det menneskelige øje, AI bør aldrig stille erstatte indhold, restaureringsderivater bør ikke erstatte det originale bevis, og rå scannings- og herkomstoplysninger bør altid bevares. Brug AI som et værktøj, der ikke "forbedrer" dokumentet, men derimod gør det tilgængeligt, mens du forbliver tro mod det.
Ansøgningsopgave
Få en kort prøve af OCR-output (enten din egen produktion eller fra en faktisk scanning). Få kun genkendelsesfejlene rettet med skabelonen "OCR output correction help"-skabelonen, og tjek derefter, om AI'en har tilføjet indhold med skabelonen "Tekst-image-konsistenstjek". Opret derefter en post med oprindelses- og formatoplysninger for objektet med skabelonen "Bevarelse af metadataudkast".
tjekliste
- [ ] Jeg sammenlignede OCR/HTR-outputtet med det faktiske billede og korrigerede det.
- [ ] Jeg har kontrolleret, at AI ikke tilføjer/ændrer indhold.
- [ ] Jeg beholdt den rå (master) scanning separat og uændret.
- [ ] Jeg tilføjede herkomst- og formatoplysninger til metadataene.
- [ ] Jeg har tydeligt mærket restaureringsvarianter som "AI-derivat".