Enota 6 / 11

Digitalni arhiv, digitalizacija, OCR in dolgoročna hramba

Dobički:

  • Možnost popravljanja skeniranih dokumentov tako, da jih pretvorite v besedilo z OCR in HTR ter primerjate izpis z dejansko sliko
  • Sposobnost ohraniti izvirnost in celovitost arhivskega dokumenta ter preprečiti, da bi AI spreminjal vsebino in izdeloval restavriranje
  • Sposobnost načrtovanja dolgoročne digitalne hrambe s podatki o poreklu in trajnimi formati

Arhivar ima nalogo, da petdeset let stare časopisne letnike, ročno napisana pisma ali stare fotografije prenese v prihodnost. Ti dokumenti se sčasoma obrabijo; Da bi jih ohranili in naredili dostopne, se izvaja digitalizacija: dejanje skeniranja fizičnega dokumenta in njegove pretvorbe v digitalno kopijo. Vendar samo presejanje ni dovolj; Digitalni objekt mora biti dolgoročno najden, berljiv in vzdrževan. V tej enoti se boste naučili uporabljati umetno inteligenco v poteku dela digitalizacije, prepisovanja in digitalnega ohranjanja; vendar boste izvedeli, zakaj boste nosili odgovornost za izvirnost in točnost.

Nekaj ​​konceptov. OCR (Optical Character Recognition) je tehnologija, ki pretvori besedilo na sliki dokumenta v besedilo, ki ga je mogoče strojno urejati. HTR (Handwritten Text Recognition) opravlja enako nalogo za ročno napisane dokumente, vendar je veliko težje. Digitalno ohranjanje je načrtovano prizadevanje za zagotovitev, da digitalni predmeti ostanejo berljivi desetletja, tudi ko formati datotek postanejo zastareli in se programska oprema spremeni. AI je močan, a pomanjkljiv pomočnik na vseh treh področjih.

Korak za korakom: od digitalizacije do hrambe

1. Določite prednost. Vsega naenkrat ne moreš digitalizirati. Najbolj lomljivi, najbolj zahtevani in najbolj edinstveni dokumenti so na prvem mestu. To je sodna odločitev; Umetna inteligenca pomaga pri urejanju seznama, vendar institucija določi prioriteto.

2. Skenirajte in uporabite OCR/HTR. Optično preberite dokument v visoki ločljivosti, nato uporabite OCR ali HTR, da izvlečete besedilo. Orodja, ki temeljijo na AI, postajajo vedno boljša, tudi pri starih in težkih besedilih.

3. Popravi in ​​preveri besedilo. Izpis OCR/HTR ni nikoli popoln. Napake so pogoste, zlasti če gre za staro pisanje, umazane strani ali rokopis. Bistveno je primerjati rezultat z dejansko sliko in jo popraviti.

4. Dodajte metapodatke in informacije o zaščiti. Digitalnemu predmetu dodajte njegov izvor, pogoje skeniranja, podatke o formatu in izvor — od kod izvira dokument in kako je bil obdelan. Te informacije so ključne za prihodnje preverjanje in zaščito.

5. Načrtujte dolgoročno zaščito. Izberite oblike datotek, ki so odprte, pogoste in trajne; varnostno kopiranje; Naredite načrt selitve v primeru, da bodo formati zastareli.

Namig: Ne sprejmite izpisa OCR kot "čisto besedilo". Če bi iskalni sistem deloval po tem besedilu, nepravilno prepoznane besede povzročijo, da vira ne bi našli. Pri kritičnih zbirkah popravljanje izhoda OCR človeškemu očesu določa kakovost vseh nadaljnjih dostopov.

Avtentičnost in celovitost digitalnega objekta

V središču arhivskega dela sta avtentičnost in celovitost: zagotovilo, da dokument resnično izvira iz zatrjevanega vira in da njegova vsebina ni bila spremenjena. Na tej točki AI ustvari dvostransko grožnjo. Prvič, med popravkom OCR/HTR ali »izboljšavo« lahko AI tiho spremeni besedilo; lahko pod imenom "popravek" doda besedo, ki ne obstaja. Drugič, če se "popravilo" ali "restavriranje" slike izvaja z AI, lahko nastanejo neoriginalne podrobnosti.

Pravilo arhivarja je jasno: digitalna ohranjena kopija mora biti zvesta izvirniku. Vsako izboljšavo, narejeno z AI, je treba dokumentirati in dejanski (neobdelani) pregled vedno ohraniti. »Olepševanje« dokumenta lahko uniči njegovo zgodovinsko dokazno vrednost.

Pozor: morda je skušnjava "izboljšati" staro fotografijo ali dokument z AI; vendar AI zapolni manjkajoče dele tako, da jih sestavi. V arhivskem dokumentu to pomeni ustvarjanje lažnih zgodovinskih dokazov. Rezultat obnove nikoli ne nadomesti izvirnega vira; je shranjena kot ločena, jasno označena različica.

trije mini kovčki

Primer 1 – Časopisni arhivi so postali iskalni. Knjižnica je digitalizirala svojo 30 let staro zbirko lokalnih časopisov. Z OCR je bilo prepisanih 90.000 strani in omogočeno iskanje; Iskanje po temah, ki je prej trajalo nekaj dni, je zdaj skrajšano na sekunde. Vendar pa je ekipa opazila, da je natančnost OCR padla na 80 % na starih in umazanih straneh in dala prednost popravku najvišjih letnic s človeškim očesom.

Primer 2 – HTR je odprl rokopis. Arhiv je uporabil HTR za zbirko težko berljivih pisem iz 19. stoletja. Sistem je po mesecih branja strokovnjakov pridobil veliko hitrost; Toda vsako stran izpisa je strokovnjak paleograf (strokovnjak za starodavno pisavo) primerjal z izvirnikom, ker so bile napake v imenih ljudi in krajev.

Primer 3 – Lažna "obnova" zavrnjena. Ena ekipa je razmišljala o "popravilu" raztrgane zgodovinske fotografije z AI. AI je dopolnil manjkajoče dele obraza tako, da jih je namestil. Arhivist je spoznal, da bodo te izmišljene podrobnosti popačile zgodovinske dokaze; Popravljena slika je bila shranjena ločeno poleg izvirnika, samo z jasno oznako "izpeljanka AI".

Kopija za dostop, kopija za ohranitev in odločitev o formatu

Dobra praksa pri digitalizaciji je ločevanje kopij istega predmeta za različne namene. Master za shranjevanje je dejanski digitalni objekt, ki ga je treba prenesti v prihodnost, shranjen v najvišji ločljivosti, nestisnjenem ali brezizgubnem formatu; redko se ga dotika. Access kopija je manjša različica, ki jo lahko odpre uporabnik. To razlikovanje je pomembno, ker oblika, ki je praktična za uporabo (majhna, stisnjena), morda ni primerna za dolgoročno hrambo; Idealen format za shranjevanje (velik, brez izgub) je okoren za vsakodnevno uporabo. V tem delovnem procesu lahko umetna inteligenca pomaga pri popisovanju datotek, odkrivanju manjkajočih različic in ohranjanju skladnosti metapodatkov med dvema kopijama. Vendar pa je izbira formata odločitev o ohranjanju: prednost bi morali imeti odprti, obsežno dokumentirani in trajni formati (namesto lastniških, zaprtih formatov) in načrt selitve bi moral biti pripravljen, če bi formati sčasoma zastareli. Tudi če umetna inteligenca predlaga obliko, ima zadnjo besedo politika dolgoročne hrambe institucije.

Nasvet: Za vsak digitalni predmet vodite kratek zapis, ki odgovarja na vprašanja "kje je izvirni vir, v kakšnem formatu je ohranjena kopija, v kakšnem formatu je kopija za dostop in katera je na voljo uporabniku?" Če pomešate te tri plasti, ni jasno, katera datoteka je v prihodnje zaupanja vredna glavna.

Štiri predloge za kopiranje

1) Pomoč pri popravku izpisa OCR:

Spodaj je besedilo OCR in opis dejanske strani. Popravi samo napake openOCR (slabi znaki, sestavljenke/razdeljene besede). Ne spreminjajte vsebine, ne dodajajte ali odstranjujte besed. Če niste prepričani, označite z "[?]". OCR besedilo: [tukaj]

2) Preverjanje skladnosti besedila in slike:

Ali so v popravljenem besedilu spodaj kakršni koli dodatki, ki niso bili pričakovani v izvirnem dokumentu (ki je bil morda izmišljen)? Označite vsak sumljiv del in napišite, zakaj je sumljiv. Besedilo: [tukaj]

3) Osnutek metapodatkov o zaščiti:

Ustvarite oris metapodatkov o hrambi za naslednji digitaliziran predmet: vir, poreklo, datum/ločljivost skeniranja, oblika datoteke, zgodovina transakcij. Samo uporabite podatke, ki sem jih posredoval, manjkajoče polje pustite prazno. Informacije: [tukaj]

4) Pomoč pri določanju prednosti:

Spodaj je seznam zbirk, ki čakajo na digitalizacijo; Pomagajte pri določanju prednosti na podlagi krhkosti, povpraševanja in edinstvenosti. Podajte kratko utemeljitev za vsak vir; Končno odločitev prepustite meni. Seznam: [tukaj]

Šibek poziv/močan poziv

Šibek poziv:

Popravite in polepšajte to skenirano besedilo.

»Beautify« vabi AI, da spremeni vsebino, nadomesti opustitve; Izvirnost arhivskega dokumenta je poškodovana.

Močan poziv:

Vaša vloga: pomočnik urednika digitalizacije. V naslednjem besedilu OCR popravite SAMO eksplicitne napake pri prepoznavanju (slab znak, nepravilno razdeljena beseda). Ne dodajajte, odstranjujte ali spreminjajte besed. Pustite »[?]« tam, kjer niste prepričani. Pokažite vsak popravek, ki ste ga naredili, na ločenem seznamu. Besedilo: [tukaj]

Zmogljiv poziv omejuje AI samo na prepoznavanje napak, prepoveduje dotikanje vsebine in omogoča sledljivost popravkov.

Tabela poteka dela in tveganja

Oder

Prispevek AI

Glavno tveganje

zaščitni ukrep

skeniranje

slabe kakovosti

visoka ločljivost

OCR/HTR

Pretvori v besedilo

Napake pri prepoznavanju

človeški popravek

popravek

Predlog za napako

Spreminjanje vsebine

Primerjava z originalom

obnova

Izpeljanka slike

prilegajoči detajl

Neobdelani izvirnik hranite, označite

zaščito

Osnutek metapodatkov

izguba izvora

Zapis o poreklu

Pogoste napake

  • Sprejemanje izhoda OCR brez popravka. Napake motijo ​​iskanje in dostop.
  • Klicanje AI "naredi lepo". Spreminja vsebino in uničuje izvirnost.
  • Zamenjava AI obnove za dejanske dokaze. Izmišljene podrobnosti ustvarjajo lažno zgodovino.
  • Neshranjevanje neobdelanega skeniranja. Nobenega popravka ni mogoče preveriti brez originala.
  • Izpuščanje podatkov o poreklu. Zanesljivost dokumenta postane neizsledljiva.

Če povzamem

AI v digitalnih arhivih in digitalizaciji; Je dragocena pomoč, ki pospeši prepisovanje OCR/HTR, pripravo metapodatkov in določanje prednosti. Toda bistvo arhivskega dela je avtentičnost in celovitost: izhod OCR mora popraviti človeško oko, umetna inteligenca ne sme nikoli tiho nadomestiti vsebine, restavratorske izpeljanke ne smejo nadomestiti izvirnih dokazov, neobdelane informacije o skeniranju in poreklu pa je treba vedno ohraniti. Uporabite umetno inteligenco kot orodje, ki ne "izboljša" dokumenta, temveč ga naredi dostopnega in mu pri tem ostane zvest.

Aplikacijska naloga

Pridobite kratek vzorec izpisa OCR (bodisi lastne produkcije bodisi iz dejanskega skeniranja). Popravite samo napake pri prepoznavanju s predlogo »OCR output correction help«, nato preverite, ali je AI dodal vsebino s predlogo »Text-image consistency check«. Nato ustvarite zapis z informacijami o poreklu in formatu za predmet s predlogo »Osnutek metapodatkov za shranjevanje«.

kontrolni seznam

  • [ ] Izhod OCR/HTR sem primerjal z dejansko sliko in jo popravil.
  • [ ] Preveril sem, da AI ​​ne dodaja/spreminja vsebine.
  • [ ] Neobdelano (glavno) skeniranje sem ohranil ločeno in nespremenjeno.
  • [ ] Metapodatkom sem dodal informacije o poreklu in obliki.
  • [ ] Različice obnove sem jasno označil kot "izpeljanka AI".