Gevinster:
- Evne til å korrigere skannede dokumenter ved å konvertere dem til tekst med OCR og HTR og sammenligne utdataene med det faktiske bildet
- Evne til å bevare originaliteten og integriteten til arkivdokumentet og forhindre AI fra å endre innholdet og fabrikkert restaurering
- Evne til å planlegge langsiktig digital bevaring med herkomstinformasjon og holdbare formater
En arkivar har i oppgave å bære femti år gamle avisbind, håndskrevne brev eller gamle fotografier inn i fremtiden. Disse dokumentene slites ut over tid; For å både bevare og gjøre dem tilgjengelige, gjøres digitalisering: handlingen med å skanne et fysisk dokument og konvertere det til en digital kopi. Men screening alene er ikke nok; Det digitale objektet skal være finnbart, lesbart og vedlikeholdbart på lang sikt. I denne enheten lærer du hvordan du bruker kunstig intelligens i arbeidsflyten for digitalisering, transkripsjon og digital bevaring; men du vil lære hvorfor du vil ha ansvaret for originalitet og nøyaktighet.
Noen få konsepter. OCR (Optical Character Recognition) er en teknologi som konverterer teksten i bildet av et dokument til maskinredigerbar tekst. HTR (Handwritten Text Recognition) gjør den samme jobben for håndskrevne dokumenter og er mye vanskeligere. Digital bevaring er en planlagt innsats for å sikre at digitale objekter forblir lesbare i flere tiår, selv når filformater blir foreldet og programvaren endres. AI er en kraftig, men mangelfull assistent på alle tre områdene.
Steg for steg: fra digitalisering til bevaring
1. Prioriter. Du kan ikke digitalisere alt på en gang. De mest skjøre, mest etterspurte og mest unike dokumentene settes først. Dette er en rettslig avgjørelse; AI hjelper til med listeredigering, men institusjonen bestemmer prioriteringen.
2. Skann og bruk OCR/HTR. Skann dokumentet med høy oppløsning, og bruk deretter OCR eller HTR for å trekke ut teksten. AI-baserte verktøy blir bedre og bedre her, selv med gamle og vanskelige tekster.
3. Korriger og bekreft teksten. OCR/HTR-utgang er aldri perfekt. Feil er vanlig, spesielt hvis det er gammel skrift, flekkete sider eller et manuskript. Det er viktig å sammenligne resultatet med det faktiske bildet og korrigere det.
4. Legg til metadata og beskyttelsesinformasjon. Legg til det digitale objektet dets herkomst, skanneforhold, formatinformasjon og herkomst – hvor dokumentet kom fra og hvordan det ble behandlet. Denne informasjonen er avgjørende for fremtidig verifisering og beskyttelse.
5. Plan for langsiktig vern. Velg filformater som er åpne, vanlige og holdbare; sikkerhetskopiere; Lag en migreringsplan i tilfelle formater blir foreldet.
Tips: Ikke godta OCR-utdata som "klar tekst". Hvis et søkesystem skulle jobbe gjennom denne teksten, ville feil gjenkjente ord føre til at kilden ikke ble funnet. For kritiske samlinger bestemmer korrigering av OCR-utdata til det menneskelige øyet kvaliteten på all påfølgende tilgang.
Autentisitet og integritet til det digitale objektet
I hjertet av arkivarbeid er autentisitet og integritet: forsikringen om at et dokument virkelig kommer fra den påståtte kilden og at innholdet ikke har blitt endret. På dette tidspunktet skaper AI en todelt trussel. For det første, under OCR/HTR-korrigering eller "forbedring", kan AI-en stille endre teksten; kan legge til et ord som ikke finnes under navnet "retting". For det andre, hvis bilde "reparasjon" eller "restaurering" gjøres med AI, kan ikke-originale detaljer produseres.
Arkivarens regel er klar: Den digitale bevaringskopien skal være tro mot originalen. Hver forbedring som gjøres med AI bør dokumenteres og den faktiske (rå) skanningen bør alltid bevares. Å «forskjønne» et dokument kan ødelegge dets historiske bevisverdi.
Forsiktig: Det kan være fristende å "forbedre" et gammelt bilde eller dokument med AI; men AI fyller ut de manglende delene ved å gjøre dem opp. I et arkivdokument betyr dette å skape falske historiske bevis. Gjenopprettingsutgangen erstatter aldri den originale kilden; lagres som en egen, tydelig merket variant.
tre minisaker
Sak 1 - Avisarkiver ble søkbare. Et bibliotek har digitalisert sin 30 år gamle samling av lokalaviser. Med OCR ble 90 000 sider transkribert og gjort søkbare; Et emnesøk som tidligere tok dager er nå redusert til sekunder. Imidlertid la teamet merke til at OCR-nøyaktigheten falt til 80 % på gamle og flekkete sider og prioriterte å korrigere de beste årene med det menneskelige øyet.
Sak 2 - HTR åpnet manuskriptet. Et arkiv brukte HTR på en samling vanskelig-leste brev fra 1800-tallet. Systemet fikk stor fart etter måneders lesing av eksperter; Men hver side av utskriften ble sammenlignet med originalen av en ekspert paleograf (en ekspert på gammel skrift), fordi det var feil i navnene på personer og steder.
Sak 3 - Falsk "restaurering" avvist. Ett team vurderte å "reparere" et revet historisk fotografi med AI. AI fullførte de manglende ansiktsdelene ved å tilpasse dem. Arkivaren innså at disse fabrikkerte detaljene ville forvrenge de historiske bevisene; Det reparerte bildet ble lagret separat sammen med originalen, bare tydelig merket "AI-derivat".
Tilgangskopi, bevaringskopi og formatbeslutning
En god praksis innen digitalisering er å skille kopier av samme objekt for ulike formål. En bevaringsmaster er det faktiske digitale objektet som skal bæres inn i fremtiden, lagret i høyeste oppløsning, ukomprimert eller tapsfritt format; det er sjelden berørt. Access copy er en mindre, lettåpnet variant presentert for brukeren. Denne forskjellen er viktig fordi formatet som er praktisk å bruke (liten, komprimert) kanskje ikke er egnet for langtidskonservering; Det ideelle formatet for konservering (stort, tapsfritt) er tungvint for daglig bruk. I denne arbeidsflyten kan AI hjelpe med å inventere filer, oppdage manglende varianter og holde metadata konsistente mellom to kopier. Valget av format er imidlertid en bevaringsavgjørelse: åpne, vidt dokumenterte og holdbare formater bør foretrekkes (i stedet for proprietære, lukkede formater), og en migreringsplan bør holdes klar i tilfelle formatene blir foreldet over tid. Selv om AI foreslår et format, har institusjonens langsiktige bevaringspolitikk det siste ordet.
Tips: For hvert digitalt objekt, hold en kort oversikt som svarer på spørsmålene "hvor er den opprinnelige kilden, i hvilket format er bevaringskopien, i hvilket format er tilgangskopien, og som er gjort tilgjengelig for brukeren?" Å blande disse tre lagene gjør det uklart hvilken fil som er den pålitelige masteren fremover.
Fire kopierbare maler
1) Hjelp for OCR-utgangskorreksjon:
Nedenfor er en OCR-tekst og beskrivelse av selve siden. Rett bare openOCR-feil (dårlige tegn, sammensatte/delte ord). Ikke endre innhold, legg til eller fjern ord. Hvis du ikke er sikker, merk med "[?]". OCR-tekst: [her]
2) Tekst-bilde-konsistenssjekk:
Er det noen tillegg i den korrigerte teksten nedenfor som ikke var forventet å være i originaldokumentet (som kan ha blitt gjort opp)? Merk hver mistenkelig del og skriv hvorfor den er mistenkelig. Tekst: [her]
3) Utkast til beskyttelsesmetadata:
Generer bevaringsmetadataoversikten for følgende digitaliserte objekt: kilde, herkomst, skannedato/oppløsning, filformat, transaksjonshistorikk. Bare bruk informasjonen jeg ga, la det manglende feltet stå tomt. Informasjon: [her]
4) Prioriteringshjelp:
Nedenfor er listen over samlinger som venter på digitalisering; Bistå med å prioritere basert på skjørhet, etterspørsel og unikhet. Gi en kort begrunnelse for hver ressurs; Overlat den endelige avgjørelsen til meg. Liste: [her]
Svak forespørsel / Sterk forespørsel
Svak melding:
Korriger og forskjønn denne skannede teksten.
«Beautify» inviterer AI til å endre innholdet, gjøre opp for utelatelsene; Originaliteten til arkivdokumentet er skadet.
Kraftig ledetekst:
Din rolle: digitaliseringsredaktørassistent. I den følgende OCR-teksten, fiks KUN eksplisitte gjenkjenningsfeil (dårlig tegn, feil delt ord). Ikke legg til, fjern eller endre noen ord. La "[?]" stå der du ikke er sikker. Vis hver rettelse du har gjort i en egen liste. Tekst: [her]
Den kraftige ledeteksten begrenser AI til bare å gjenkjenne feil, forbyr den fra å berøre innhold og gjør rettelser sporbare.
Arbeidsflyt og risikotabell
Scene
Bidrag av AI
Hovedrisiko
beskyttelsestiltak
skanning
—
dårlig kvalitet
høy oppløsning
OCR/HTR
Konverter til tekst
Gjenkjennelsesfeil
menneskelig korreksjon
korrigering
Feilforslag
Endring av innhold
Sammenligning med original
restaurering
Bildeavledet
passende detalj
Behold den rå originalen, merk den
beskyttelse
Metadatautkast
tap av opprinnelse
Opprinnelsesrekord
Vanlige feil
- Godta OCR-utdata uten korrigering. Feil forstyrrer søk og tilgang.
- Å kalle AI "gjør vakker." Det endrer innholdet og ødelegger originaliteten.
- Å erstatte AI-restaurering med faktiske bevis. Fabriserte detaljer skaper falsk historie.
- Lagrer ikke råskanningen. Ingen rettelse kan verifiseres uten originalen.
- Utelat herkomstinformasjon. Påliteligheten til dokumentet blir usporbar.
Oppsummert
AI i digitale arkiver og digitalisering; Det er et verdifullt hjelpemiddel som fremskynder OCR/HTR-transkripsjon, metadatautforming og prioritering. Men essensen av arkivarbeid er autentisitet og integritet: OCR-utdata bør korrigeres av det menneskelige øyet, AI skal aldri stille erstatte innhold, restaureringsderivater skal ikke erstatte det originale beviset, og rå skanning og herkomstinformasjon bør alltid bevares. Bruk AI som et verktøy som ikke "forbedrer" dokumentet, men som gjør det tilgjengelig samtidig som du er tro mot det.
Søknadsoppgave
Få et kort utvalg av OCR-utdata (enten din egen produksjon eller fra en faktisk skanning). Få bare gjenkjenningsfeilene rettet med malen "OCR output correction help" og sjekk om AI har lagt til innhold med malen "Text-image konsistenssjekk". Opprett deretter en post med herkomst- og formatinformasjon for objektet med malen "Bevaring metadatautkast".
sjekkliste
- [ ] Jeg sammenlignet OCR/HTR-utgangen med det faktiske bildet og korrigerte det.
- [ ] Jeg har sjekket at AI ikke legger til/endrer innhold.
- [ ] Jeg beholdt den rå (master) skanningen separat og uendret.
- [ ] Jeg la til herkomst- og formatinformasjon til metadataene.
- [ ] Jeg har tydelig merket restaureringsvarianter som "AI-derivat".