Egység 6 / 11

Digitális archívum, digitalizálás, OCR és hosszú távú megőrzés

Nyereség:

  • A beolvasott dokumentumok kijavítása OCR és HTR segítségével szöveggé konvertálva, és a kimenet összehasonlítása a tényleges képpel
  • Képes megőrizni az archív dokumentum eredetiségét és integritását, és megakadályozni, hogy a mesterséges intelligencia megváltoztassa a tartalmat és a gyári helyreállítást
  • Hosszú távú digitális megőrzés tervezésének képessége származási információkkal és tartós formátumokkal

Egy levéltáros feladata, hogy ötven éves újságköteteket, kézzel írott leveleket vagy régi fényképeket vigyen a jövőbe. Ezek a dokumentumok idővel elhasználódnak; Megőrzésük és hozzáférhetővé tételük érdekében a digitalizálás megtörténik: egy fizikai dokumentum szkennelése és digitális másolattá alakítása. De a szűrés önmagában nem elég; A digitális objektumnak hosszú távon megtalálhatónak, olvashatónak és karbantarthatónak kell lennie. Ebben az egységben megtudhatja, hogyan használhatja a mesterséges intelligenciát a digitalizálás, az átírás és a digitális megőrzés munkafolyamatában; de megtudod, miért vállalod a felelősséget az eredetiségért és a pontosságért.

Néhány fogalom. Az OCR (Optical Character Recognition) egy olyan technológia, amely a dokumentum képében lévő szöveget gépi szerkeszthető szöveggé alakítja. A HTR (Kézzel írt szövegfelismerés) ugyanezt a munkát végzi el a kézzel írt dokumentumoknál, és sokkal nehezebb. A digitális megőrzés egy tervezett erőfeszítés annak biztosítására, hogy a digitális objektumok évtizedeken át olvashatók maradjanak, még akkor is, ha a fájlformátumok elavulnak és a szoftver megváltozik. Az AI egy erőteljes, de hibás asszisztens mindhárom területen.

Lépésről lépésre: a digitalizálástól a megőrzésig

1. A prioritások meghatározása. Nem lehet mindent egyszerre digitalizálni. A legsérülékenyebb, legkeresettebb és legegyedibb dokumentumok kerülnek előtérbe. Ez bírósági határozat; A mesterséges intelligencia segít a listaszerkesztésben, de az intézmény határozza meg a prioritást.

2. Szkennelje be és alkalmazza az OCR/HTR-t. Szkennelje be a dokumentumot nagy felbontásban, majd használja az OCR-t vagy a HTR-t a szöveg kibontásához. Az AI-alapú eszközök itt is egyre jobbak, még a régi és nehéz szövegekkel is.

3. Javítsa ki és ellenőrizze a szöveget. Az OCR/HTR kimenet soha nem tökéletes. Gyakoriak a hibák, különösen, ha régi írások, foltos oldalak vagy kézirat található. Elengedhetetlen, hogy a kimenetet összehasonlítsuk a tényleges képpel és javítsuk azt.

4. Adjon hozzá metaadatokat és védelmi információkat. Adja hozzá a digitális objektum eredetét, szkennelési feltételeit, formátuminformációit és eredetét – honnan származik a dokumentum és hogyan dolgozták fel. Ezek az információk kritikusak a jövőbeni ellenőrzés és védelem szempontjából.

5. Tervezze meg a hosszú távú védelmet. Válasszon nyílt, általános és tartós fájlformátumokat; vissza; Készítsen áttelepítési tervet arra az esetre, ha a formátumok elavulnak.

Tipp: Ne fogadja el az OCR kimenetet "tiszta szövegként". Ha egy keresőrendszer átdolgozná ezt a szöveget, a helytelenül felismert szavak miatt a forrás nem található. A kritikus gyűjtemények esetében az OCR-kimenet emberi szemre való kijavítása határozza meg az összes későbbi hozzáférés minőségét.

A digitális objektum hitelessége és integritása

A levéltári munka középpontjában a hitelesség és a sértetlenség áll: annak biztosítéka, hogy a dokumentum valóban az állítólagos forrásból származik, és a tartalma nem változott meg. Ezen a ponton az AI kétirányú fenyegetést hoz létre. Először is, az OCR/HTR korrekció vagy „javítás” során az AI csendben módosíthatja a szöveget; "javítás" néven nem létező szót adhat hozzá. Másodszor, ha a kép "javítása" vagy "helyreállítása" mesterséges intelligencia segítségével történik, nem eredeti részletek is előállíthatók.

A levéltáros szabálya egyértelmű: a digitális megőrzési példánynak hűnek kell lennie az eredetihez. Az AI-val végzett minden fejlesztést dokumentálni kell, és a tényleges (nyers) vizsgálatot mindig meg kell őrizni. Egy dokumentum "szépítése" tönkreteheti annak történelmi bizonyító értékét.

Figyelem: Csábító lehet egy régi fénykép vagy dokumentum „javítása” mesterséges intelligencia segítségével; de a mesterséges intelligencia a hiányzó részeket kitalálva pótolja. Egy levéltári dokumentumban ez hamis történelmi bizonyíték létrehozását jelenti. A helyreállítási kimenet soha nem helyettesíti az eredeti forrást; külön, egyértelműen címkézett változatként tárolják.

három mini tok

1. eset – Az újságok archívumai kereshetővé váltak. Egy könyvtár digitalizálta 30 éves helyi újsággyűjteményét. Az OCR segítségével 90 000 oldalt írtak át és tettek kereshetővé; A korábban napokig tartó témakeresés most másodpercekre csökkent. A csapat azonban észrevette, hogy az OCR-pontosság 80%-ra esett vissza a régi és foltos oldalakon, és prioritásként kezelte a legjobb évek emberi szemmel történő korrigálását.

2. eset – A HTR kinyitotta a kéziratot. Egy archívum a HTR-t egy nehezen olvasható 19. századi levelek gyűjteményére alkalmazta. A rendszer nagy sebességre tett szert a szakértők több hónapos olvasása alapján; De a nyomat minden oldalát egy szakértő paleográfus (az ókori írás szakértője) összehasonlította az eredetivel, mert az emberek és a helyek elnevezésében tévedések voltak.

3. eset – A hamis „helyreállítás” elutasítva. Egy csapat azt fontolgatta, hogy mesterséges intelligencia segítségével "megjavít" egy elszakadt történelmi fényképet. Az AI kiegészítette a hiányzó arcrészeket illesztéssel. A levéltáros rájött, hogy ezek a kitalált részletek eltorzítják a történelmi bizonyítékokat; A javított képet az eredeti mellett külön tárolták, csak egyértelműen "AI származék" felirattal.

Hozzáférési másolat, megőrzési másolat és formázási döntés

A digitalizálás során bevált gyakorlat, hogy ugyanazon objektum másolatait különböző célokra szétválasztják. A megőrzési mester az a tényleges digitális objektum, amelyet a jövőbe kell vinni, a legnagyobb felbontásban, tömörítetlen vagy veszteségmentes formátumban tárolva; ritkán érintik. A hozzáférési másolat egy kisebb, könnyen megnyitható változat, amelyet a felhasználó elé tárnak. Ez a megkülönböztetés azért fontos, mert a használható formátum (kicsi, tömörített) nem biztos, hogy alkalmas hosszú távú megőrzésre; Az ideális tartósítási formátum (nagy, veszteségmentes) nehézkes a napi használat során. Ebben a munkafolyamatban az AI segíthet a fájlok leltározásában, a hiányzó változatok felderítésében és a metaadatok konzisztens megőrzésében két másolat között. A formátum megválasztása azonban megőrzési döntés: előnyben kell részesíteni a nyílt, széles körben dokumentált és tartós formátumokat (nem pedig a védett, zárt formátumokat), és készen kell tartani egy migrációs tervet arra az esetre, ha a formátumok idővel elavulnak. Még ha a mesterséges intelligencia formátumot javasol is, az intézmény hosszú távú megőrzési politikája mondja ki a végső szót.

Tipp: Minden digitális objektumról készítsen egy rövid feljegyzést, amely megválaszolja a "hol van az eredeti forrás, milyen formátumban a megőrzési másolat, milyen formátumban a hozzáférési másolat, és melyiket teszik elérhetővé a felhasználó számára?" kérdésekre. A három réteg keverése miatt nem világos, hogy melyik fájl lesz a megbízható mester a továbbiakban.

Négy másolható sablon

1) OCR kimenet korrekciós súgó:

Az alábbiakban egy OCR-szöveg és az aktuális oldal leírása található. Csak az openOCR hibákat (rossz karakterek, összetett/osztott szavak) javítsa. Ne módosítsa a tartalmat, ne adjon hozzá vagy távolítson el szavakat. Ha nem biztos benne, jelölje be a „[?]”-vel. OCR szöveg: [itt]

2) Szöveg-kép konzisztencia ellenőrzése:

Vannak-e olyan kiegészítések az alábbi javított szövegben, amelyek várhatóan nem szerepelnek az eredeti dokumentumban (amelyet kitalálhattak)? Jelölje meg az egyes gyanús részeket, és írja le, hogy miért gyanús. Szöveg: [itt]

3) Védelmi metaadat-tervezet:

Állítsa elő a megőrzési metaadat vázlatot a következő digitalizált objektumhoz: forrás, származás, szkennelés dátuma/felbontása, fájlformátum, tranzakciós előzmények. Csak használja az általam megadott információkat, hagyja üresen a hiányzó mezőt. Információ: [itt]

4) Prioritási segítség:

Az alábbiakban a digitalizálásra váró gyűjtemények listája található; Segítsen a prioritások meghatározásában törékenység, kereslet és egyediség alapján. Adjon rövid indoklást minden erőforráshoz; A végső döntést bízd rám. Lista: [itt]

Gyenge felszólítás / Erős felszólítás

Gyenge felszólítás:

Javítsa és szépítse ezt a beolvasott szöveget.

A „Beautify” felkéri az AI-t a tartalom megváltoztatására, a kihagyások pótlására; Az archív dokumentum eredetisége sérült.

Erőteljes felszólítás:

Az Ön feladata: digitalizálási szerkesztő asszisztens. A következő OCR-szövegben CSAK az explicit felismerési hibákat javítsa (rossz karakter, helytelenül felosztott szó). Ne adjon hozzá, ne távolítson el vagy módosítson szavakat. Hagyja a „[?]”-t ott, ahol nem vagy biztos benne. Minden elvégzett javítást külön listában jelenítsen meg. Szöveg: [itt]

A hatékony felszólítás arra korlátozza az AI-t, hogy csak a hibákat ismerje fel, megtiltja, hogy hozzáérjen a tartalomhoz, és nyomon követhetővé teszi a javításokat.

Munkafolyamat és kockázati táblázat

Színpad

Az AI hozzájárulása

Fő kockázat

védelmi intézkedés

szkennelés

rossz minőségű

nagy felbontású

OCR/HTR

Konvertálás szöveggé

Felismerési hibák

emberi korrekció

korrekció

Hibajavaslat

A tartalom megváltoztatása

Összehasonlítás az eredetivel

helyreállítása

Kép származéka

illeszkedő részlet

Őrizze meg a nyers eredetit, címkézze fel

védelmet

Metaadat-vázlat

eredetvesztés

Származási rekord

Gyakori hibák

  • Az OCR kimenet elfogadása javítás nélkül. A hibák megzavarják a keresést és a hozzáférést.
  • A mesterséges intelligencia „szépít” elnevezése. Megváltoztatja a tartalmat és lerombolja az eredetiséget.
  • A mesterséges intelligencia helyreállításának helyettesítése a tényleges bizonyítékokkal. A kitalált részletek hamis történelmet hoznak létre.
  • Nem tárolja a nyers szkennelést. Az eredeti hiányában a javítás nem ellenőrizhető.
  • A származási adatok elhagyása. A dokumentum megbízhatósága követhetetlenné válik.

Összefoglalva

AI a digitális archívumokban és a digitalizálásban; Ez egy értékes segédeszköz, amely felgyorsítja az OCR/HTR átírást, a metaadat-rajzolást és a prioritások meghatározását. De az archiválási munka lényege a hitelesség és az integritás: az OCR kimenetet az emberi szemnek kell korrigálnia, az AI soha ne cserélje le csendben a tartalmat, a helyreállítási származékok ne helyettesítsék az eredeti bizonyítékot, és mindig meg kell őrizni a nyers szkennelési és származási információkat. Használja az AI-t olyan eszközként, amely nem "javítja" a dokumentumot, hanem elérhetővé teszi, miközben hű marad hozzá.

Pályázati feladat

Szerezzen be egy rövid mintát az OCR-kimenetből (akár a saját gyártásából, akár egy tényleges szkennelésből). Csak a felismerési hibákat javítsa ki az „OCR kimenet-javítási súgó” sablonnal, majd ellenőrizze, hogy a mesterséges intelligencia hozzáadott-e tartalmat a „Szöveg-kép konzisztencia ellenőrzése” sablonnal. Ezután hozzon létre egy rekordot az objektum származási és formátuminformációival a „Metaadat megőrzési vázlat” sablonnal.

ellenőrző lista

  • [ ] Összehasonlítottam az OCR/HTR kimenetet a tényleges képpel és javítottam.
  • [ ] Ellenőriztem, hogy az AI nem ad hozzá/módosít tartalmat.
  • [ ] A nyers (master) szkennelést külön és változatlanul megtartottam.
  • [ ] Származási és formátuminformációkat adtam a metaadatokhoz.
  • [ ] A helyreállítási változatokat egyértelműen "AI származékként" jelöltem meg.