Enhet 6 / 11

Digitalarkiv, Digitalisering, OCR och Långtidsbevarande

Vinster:

  • Möjlighet att korrigera skannade dokument genom att konvertera dem till text med OCR och HTR och jämföra resultatet med den faktiska bilden
  • Förmåga att bevara originaliteten och integriteten hos arkivdokumentet och förhindra AI från att ändra innehållet och tillverkad restaurering
  • Förmåga att planera långsiktigt digitalt bevarande med härkomstinformation och hållbara format

En arkivarie har i uppdrag att bära in femtio år gamla tidningsvolymer, handskrivna brev eller gamla fotografier in i framtiden. Dessa dokument slits ut med tiden; För att både bevara och göra dem tillgängliga görs digitalisering: handlingen att skanna ett fysiskt dokument och konvertera det till en digital kopia. Men enbart screening räcker inte; Det digitala objektet ska vara lätt att hitta, läsa och underhålla på lång sikt. I den här enheten får du lära dig hur du använder artificiell intelligens i arbetsflödet för digitalisering, transkription och digitalt bevarande; men du kommer att lära dig varför du bär ansvaret för originalitet och noggrannhet.

Några få begrepp. OCR (Optical Character Recognition) är en teknik som konverterar texten i bilden av ett dokument till maskinredigerbar text. HTR (Handwritten Text Recognition) gör samma jobb för handskrivna dokument och är mycket svårare. Digitalt bevarande är en planerad satsning för att säkerställa att digitala objekt förblir läsbara i årtionden, även när filformat blir föråldrade och mjukvaruförändringar. AI är en kraftfull men bristfällig assistent inom alla tre områden.

Steg för steg: från digitalisering till bevarande

1. Prioritera. Man kan inte digitalisera allt på en gång. De mest ömtåliga, mest efterfrågade och mest unika dokumenten sätts först. Detta är ett rättsligt beslut; AI hjälper till med listredigering, men institutionen bestämmer prioritet.

2. Skanna och tillämpa OCR/HTR. Skanna dokumentet med hög upplösning och använd sedan OCR eller HTR för att extrahera texten. AI-baserade verktyg blir bättre och bättre här, även med gamla och svåra texter.

3. Korrigera och verifiera texten. OCR/HTR-utgång är aldrig perfekt. Fel är vanliga, särskilt om det finns gammal skrift, färgade sidor eller ett manuskript. Det är viktigt att jämföra resultatet med den faktiska bilden och korrigera den.

4. Lägg till metadata och skyddsinformation. Lägg till det digitala objektet dess ursprung, skanningsvillkor, formatinformation och härkomst – varifrån dokumentet kom och hur det bearbetades. Denna information är avgörande för framtida verifiering och skydd.

5. Planera för långsiktigt skydd. Välj filformat som är öppna, vanliga och hållbara; backa upp; Gör en migreringsplan om format blir föråldrade.

Tips: Acceptera inte OCR-utdata som "klar text". Om ett söksystem skulle arbeta igenom denna text, skulle felaktigt igenkända ord göra att källan inte kunde hittas. För kritiska samlingar avgör korrigering av OCR-utdata till det mänskliga ögat kvaliteten på all efterföljande åtkomst.

Det digitala objektets äkthet och integritet

Kärnan i arkivarbetet är autenticitet och integritet: försäkran om att ett dokument verkligen kommer från den påstådda källan och att dess innehåll inte har ändrats. Vid denna tidpunkt skapar AI ett tvådelat hot. Först, under OCR/HTR-korrigering eller "förbättring", kan AI tyst modifiera texten; kan lägga till ett ord som inte finns under namnet "korrigering". För det andra, om bild "reparation" eller "restaurering" görs med AI, kan icke-originaldetaljer produceras.

Arkivariens regel är tydlig: den digitala bevarandekopian ska vara originaltrogen. Varje förbättring som görs med AI bör dokumenteras och den faktiska (rå) skanningen ska alltid bevaras. Att "försköna" ett dokument kan förstöra dess historiska bevisvärde.

Varning: Det kan vara frestande att "förbättra" ett gammalt foto eller dokument med AI; men AI fyller i de saknade delarna genom att ta igen dem. I ett arkivdokument innebär det att man skapar falska historiska bevis. Återställningsutgången ersätter aldrig den ursprungliga källan; lagras som en separat tydligt märkt variant.

tre minifodral

Fall 1 — Tidningsarkiv blev sökbara. Ett bibliotek har digitaliserat sin 30-åriga samling av lokaltidningar. Med OCR transkriberades 90 000 sidor och gjordes sökbara; En ämnessökning som tidigare tog dagar har nu reducerats till sekunder. Teamet märkte dock att OCR-noggrannheten sjönk till 80 % på gamla och fläckade sidor och prioriterade att korrigera de bästa åren med det mänskliga ögat.

Fall 2 — HTR öppnade manuskriptet. Ett arkiv tillämpade HTR på en samling svårlästa 1800-talsbrev. Systemet fick stor hastighet enligt månaders läsning av experter; Men varje sida i utskriften jämfördes med originalet av en expert paleograf (en expert på forntida skrift), eftersom det fanns fel i namnen på personer och platser.

Fall 3 – Falsk "restaurering" avvisades. Ett team övervägde att "reparera" ett trasigt historiskt fotografi med AI. AI kompletterade de saknade ansiktsdelarna genom att montera dem. Arkivarien insåg att dessa påhittade detaljer skulle förvränga de historiska bevisen; Den reparerade bilden lagrades separat tillsammans med originalet, endast tydligt märkt "AI-derivat".

Åtkomstkopia, bevarandekopia och formatbeslut

En god praxis inom digitalisering är att separera kopior av samma objekt för olika ändamål. En bevarandemaster är det faktiska digitala objektet som ska bäras in i framtiden, lagras i högsta upplösning, okomprimerat eller förlustfritt format; det rörs sällan. Access copy är en mindre, lättöppnad variant som presenteras för användaren. Denna distinktion är viktig eftersom formatet som är praktiskt att använda (litet, komprimerat) kanske inte är lämpligt för långtidsbevarande; Det idealiska formatet för konservering (stort, förlustfritt) är besvärligt för dagligt bruk. I det här arbetsflödet kan AI hjälpa till att inventera filer, upptäcka saknade varianter och hålla metadata konsekvent mellan två kopior. Valet av format är dock ett bevarandebeslut: öppna, brett dokumenterade och hållbara format bör föredras (snarare än proprietära, slutna format), och en migreringsplan bör hållas redo om formaten blir föråldrade med tiden. Även om AI föreslår ett format, har institutionens långsiktiga bevarandepolicy sista ordet.

Tips: För varje digitalt objekt, håll ett kort register som svarar på frågorna "var finns originalkällan, i vilket format är bevarandekopian, i vilket format är åtkomstkopian och vilken görs tillgänglig för användaren?" Att blanda dessa tre lager gör det oklart vilken fil som är den betrodda mastern framöver.

Fyra kopierbara mallar

1) OCR-utgångskorrigeringshjälp:

Nedan finns en OCR-text och beskrivning av den faktiska sidan. Åtgärda endast openOCR-fel (dåliga tecken, sammansatta/delade ord). Ändra inte innehåll, lägg till eller ta bort ord. Om du inte är säker, markera med "[?]". OCR-text: [här]

2) Konsistenskontroll av text-bild:

Finns det några tillägg i den korrigerade texten nedan som inte förväntades finnas i originaldokumentet (som kan ha gjorts upp)? Markera varje misstänkt del och skriv varför den är misstänkt. Text: [här]

3) Skyddsmetadatautkast:

Generera bevarandemetadatakonturen för följande digitaliserade objekt: källa, härkomst, skanningsdatum/upplösning, filformat, transaktionshistorik. Använd bara informationen jag angav, lämna det saknade fältet tomt. Information: [här]

4) Prioriteringshjälp:

Nedan finns listan över samlingar som väntar på digitalisering; Hjälp till att prioritera utifrån skörhet, efterfrågan och unikhet. Ge en kort motivering för varje resurs; Lämna det slutliga beslutet till mig. Lista: [här]

Svag prompt / Stark prompt

Svag uppmaning:

Korrigera och försköna denna skannade text.

"Beautify" uppmanar AI att ändra innehållet, kompensera för utelämnanden; Arkivdokumentets originalitet är skadad.

Kraftfull uppmaning:

Din roll: digitaliseringsredaktörsassistent. I följande OCR-text, fixa ENDAST explicita igenkänningsfel (dåligt tecken, felaktigt delat ord). Lägg inte till, ta bort eller ändra några ord. Lämna "[?]" där du inte är säker. Visa varje korrigering du gjort i en separat lista. Text: [här]

Den kraftfulla uppmaningen begränsar AI till att bara känna igen fel, förbjuder den från att röra innehåll och gör korrigeringar spårbara.

Arbetsflöde och risktabell

Scen

Bidrag av AI

Huvudrisken

skyddsåtgärd

skanna

dålig kvalitet

hög upplösning

OCR/HTR

Konvertera till text

Identifieringsfel

mänsklig korrigering

korrigering

Felförslag

Ändra innehåll

Jämförelse med original

restaurering

Bildderivat

passande detalj

Behåll det råoriginal, märk det

skydd

Metadatautkast

förlust av ursprung

Ursprungsrekord

Vanliga misstag

  • Accepterar OCR-utgången utan korrigering. Fel stör sökning och åtkomst.
  • Kallar AI "gör vacker". Det förändrar innehållet och förstör originaliteten.
  • Ersätter faktiska bevis med AI-restaurering. Tillverkade detaljer skapar falsk historia.
  • Lagrar inte råskanningen. Ingen rättelse kan verifieras utan originalet.
  • Utelämna härkomstinformation. Dokumentets tillförlitlighet blir ospårbar.

Sammanfattningsvis

AI i digitala arkiv och digitalisering; Det är ett värdefullt hjälpmedel som påskyndar OCR/HTR-transkription, metadatautformning och prioritering. Men kärnan i arkivarbete är äkthet och integritet: OCR-utdata bör korrigeras av det mänskliga ögat, AI bör aldrig tyst ersätta innehåll, restaureringsderivat bör inte ersätta det ursprungliga beviset, och rå skannings- och härkomstinformation ska alltid bevaras. Använd AI som ett verktyg som inte "förbättrar" dokumentet, utan snarare gör det tillgängligt samtidigt som du förblir trogen det.

Applikationsuppgift

Få ett kort prov på OCR-utdata (antingen din egen produktion eller från en faktisk skanning). Låt bara igenkänningsfelen korrigera med mallen "OCR output correction help" och kontrollera sedan om AI har lagt till innehåll med mallen "Text-image konsistenskontroll". Skapa sedan en post med härkomst och formatinformation för objektet med mallen "Bevarande metadatautkast".

checklista

  • [ ] Jag jämförde OCR/HTR-utgången med den faktiska bilden och korrigerade den.
  • [ ] Jag har kontrollerat att AI:n inte lägger till/ändrar innehåll.
  • [ ] Jag behöll den råa (master) skanningen separat och oförändrad.
  • [ ] Jag lade till härkomst och formatinformation till metadata.
  • [ ] Jag har tydligt märkt restaureringsvarianter som "AI-derivat".