Nyereség:
- A beolvasott dokumentumok kijavítása OCR és HTR segítségével szöveggé konvertálva, és a kimenet összehasonlítása a tényleges képpel
- Képes megőrizni az archív dokumentum eredetiségét és integritását, és megakadályozni, hogy a mesterséges intelligencia megváltoztassa a tartalmat és a gyári helyreállítást
- Hosszú távú digitális megőrzés tervezésének képessége származási információkkal és tartós formátumokkal
Egy levéltáros feladata, hogy ötven éves újságköteteket, kézzel írott leveleket vagy régi fényképeket vigyen a jövőbe. Ezek a dokumentumok idővel elhasználódnak; Megőrzésük és hozzáférhetővé tételük érdekében a digitalizálás megtörténik: egy fizikai dokumentum szkennelése és digitális másolattá alakítása. De a szűrés önmagában nem elég; A digitális objektumnak hosszú távon megtalálhatónak, olvashatónak és karbantarthatónak kell lennie. Ebben az egységben megtudhatja, hogyan használhatja a mesterséges intelligenciát a digitalizálás, az átírás és a digitális megőrzés munkafolyamatában; de megtudod, miért vállalod a felelősséget az eredetiségért és a pontosságért.
Néhány fogalom. Az OCR (Optical Character Recognition) egy olyan technológia, amely a dokumentum képében lévő szöveget gépi szerkeszthető szöveggé alakítja. A HTR (Kézzel írt szövegfelismerés) ugyanezt a munkát végzi el a kézzel írt dokumentumoknál, és sokkal nehezebb. A digitális megőrzés egy tervezett erőfeszítés annak biztosítására, hogy a digitális objektumok évtizedeken át olvashatók maradjanak, még akkor is, ha a fájlformátumok elavulnak és a szoftver megváltozik. Az AI egy erőteljes, de hibás asszisztens mindhárom területen.
Lépésről lépésre: a digitalizálástól a megőrzésig
1. A prioritások meghatározása. Nem lehet mindent egyszerre digitalizálni. A legsérülékenyebb, legkeresettebb és legegyedibb dokumentumok kerülnek előtérbe. Ez bírósági határozat; A mesterséges intelligencia segít a listaszerkesztésben, de az intézmény határozza meg a prioritást.
2. Szkennelje be és alkalmazza az OCR/HTR-t. Szkennelje be a dokumentumot nagy felbontásban, majd használja az OCR-t vagy a HTR-t a szöveg kibontásához. Az AI-alapú eszközök itt is egyre jobbak, még a régi és nehéz szövegekkel is.
3. Javítsa ki és ellenőrizze a szöveget. Az OCR/HTR kimenet soha nem tökéletes. Gyakoriak a hibák, különösen, ha régi írások, foltos oldalak vagy kézirat található. Elengedhetetlen, hogy a kimenetet összehasonlítsuk a tényleges képpel és javítsuk azt.
4. Adjon hozzá metaadatokat és védelmi információkat. Adja hozzá a digitális objektum eredetét, szkennelési feltételeit, formátuminformációit és eredetét – honnan származik a dokumentum és hogyan dolgozták fel. Ezek az információk kritikusak a jövőbeni ellenőrzés és védelem szempontjából.
5. Tervezze meg a hosszú távú védelmet. Válasszon nyílt, általános és tartós fájlformátumokat; vissza; Készítsen áttelepítési tervet arra az esetre, ha a formátumok elavulnak.
Tipp: Ne fogadja el az OCR kimenetet "tiszta szövegként". Ha egy keresőrendszer átdolgozná ezt a szöveget, a helytelenül felismert szavak miatt a forrás nem található. A kritikus gyűjtemények esetében az OCR-kimenet emberi szemre való kijavítása határozza meg az összes későbbi hozzáférés minőségét.
A digitális objektum hitelessége és integritása
A levéltári munka középpontjában a hitelesség és a sértetlenség áll: annak biztosítéka, hogy a dokumentum valóban az állítólagos forrásból származik, és a tartalma nem változott meg. Ezen a ponton az AI kétirányú fenyegetést hoz létre. Először is, az OCR/HTR korrekció vagy „javítás” során az AI csendben módosíthatja a szöveget; "javítás" néven nem létező szót adhat hozzá. Másodszor, ha a kép "javítása" vagy "helyreállítása" mesterséges intelligencia segítségével történik, nem eredeti részletek is előállíthatók.
A levéltáros szabálya egyértelmű: a digitális megőrzési példánynak hűnek kell lennie az eredetihez. Az AI-val végzett minden fejlesztést dokumentálni kell, és a tényleges (nyers) vizsgálatot mindig meg kell őrizni. Egy dokumentum "szépítése" tönkreteheti annak történelmi bizonyító értékét.
Figyelem: Csábító lehet egy régi fénykép vagy dokumentum „javítása” mesterséges intelligencia segítségével; de a mesterséges intelligencia a hiányzó részeket kitalálva pótolja. Egy levéltári dokumentumban ez hamis történelmi bizonyíték létrehozását jelenti. A helyreállítási kimenet soha nem helyettesíti az eredeti forrást; külön, egyértelműen címkézett változatként tárolják.
három mini tok
1. eset – Az újságok archívumai kereshetővé váltak. Egy könyvtár digitalizálta 30 éves helyi újsággyűjteményét. Az OCR segítségével 90 000 oldalt írtak át és tettek kereshetővé; A korábban napokig tartó témakeresés most másodpercekre csökkent. A csapat azonban észrevette, hogy az OCR-pontosság 80%-ra esett vissza a régi és foltos oldalakon, és prioritásként kezelte a legjobb évek emberi szemmel történő korrigálását.
2. eset – A HTR kinyitotta a kéziratot. Egy archívum a HTR-t egy nehezen olvasható 19. századi levelek gyűjteményére alkalmazta. A rendszer nagy sebességre tett szert a szakértők több hónapos olvasása alapján; De a nyomat minden oldalát egy szakértő paleográfus (az ókori írás szakértője) összehasonlította az eredetivel, mert az emberek és a helyek elnevezésében tévedések voltak.
3. eset – A hamis „helyreállítás” elutasítva. Egy csapat azt fontolgatta, hogy mesterséges intelligencia segítségével "megjavít" egy elszakadt történelmi fényképet. Az AI kiegészítette a hiányzó arcrészeket illesztéssel. A levéltáros rájött, hogy ezek a kitalált részletek eltorzítják a történelmi bizonyítékokat; A javított képet az eredeti mellett külön tárolták, csak egyértelműen "AI származék" felirattal.
Hozzáférési másolat, megőrzési másolat és formázási döntés
A digitalizálás során bevált gyakorlat, hogy ugyanazon objektum másolatait különböző célokra szétválasztják. A megőrzési mester az a tényleges digitális objektum, amelyet a jövőbe kell vinni, a legnagyobb felbontásban, tömörítetlen vagy veszteségmentes formátumban tárolva; ritkán érintik. A hozzáférési másolat egy kisebb, könnyen megnyitható változat, amelyet a felhasználó elé tárnak. Ez a megkülönböztetés azért fontos, mert a használható formátum (kicsi, tömörített) nem biztos, hogy alkalmas hosszú távú megőrzésre; Az ideális tartósítási formátum (nagy, veszteségmentes) nehézkes a napi használat során. Ebben a munkafolyamatban az AI segíthet a fájlok leltározásában, a hiányzó változatok felderítésében és a metaadatok konzisztens megőrzésében két másolat között. A formátum megválasztása azonban megőrzési döntés: előnyben kell részesíteni a nyílt, széles körben dokumentált és tartós formátumokat (nem pedig a védett, zárt formátumokat), és készen kell tartani egy migrációs tervet arra az esetre, ha a formátumok idővel elavulnak. Még ha a mesterséges intelligencia formátumot javasol is, az intézmény hosszú távú megőrzési politikája mondja ki a végső szót.
Tipp: Minden digitális objektumról készítsen egy rövid feljegyzést, amely megválaszolja a "hol van az eredeti forrás, milyen formátumban a megőrzési másolat, milyen formátumban a hozzáférési másolat, és melyiket teszik elérhetővé a felhasználó számára?" kérdésekre. A három réteg keverése miatt nem világos, hogy melyik fájl lesz a megbízható mester a továbbiakban.
Négy másolható sablon
1) OCR kimenet korrekciós súgó:
Az alábbiakban egy OCR-szöveg és az aktuális oldal leírása található. Csak az openOCR hibákat (rossz karakterek, összetett/osztott szavak) javítsa. Ne módosítsa a tartalmat, ne adjon hozzá vagy távolítson el szavakat. Ha nem biztos benne, jelölje be a „[?]”-vel. OCR szöveg: [itt]
2) Szöveg-kép konzisztencia ellenőrzése:
Vannak-e olyan kiegészítések az alábbi javított szövegben, amelyek várhatóan nem szerepelnek az eredeti dokumentumban (amelyet kitalálhattak)? Jelölje meg az egyes gyanús részeket, és írja le, hogy miért gyanús. Szöveg: [itt]
3) Védelmi metaadat-tervezet:
Állítsa elő a megőrzési metaadat vázlatot a következő digitalizált objektumhoz: forrás, származás, szkennelés dátuma/felbontása, fájlformátum, tranzakciós előzmények. Csak használja az általam megadott információkat, hagyja üresen a hiányzó mezőt. Információ: [itt]
4) Prioritási segítség:
Az alábbiakban a digitalizálásra váró gyűjtemények listája található; Segítsen a prioritások meghatározásában törékenység, kereslet és egyediség alapján. Adjon rövid indoklást minden erőforráshoz; A végső döntést bízd rám. Lista: [itt]
Gyenge felszólítás / Erős felszólítás
Gyenge felszólítás:
Javítsa és szépítse ezt a beolvasott szöveget.
A „Beautify” felkéri az AI-t a tartalom megváltoztatására, a kihagyások pótlására; Az archív dokumentum eredetisége sérült.
Erőteljes felszólítás:
Az Ön feladata: digitalizálási szerkesztő asszisztens. A következő OCR-szövegben CSAK az explicit felismerési hibákat javítsa (rossz karakter, helytelenül felosztott szó). Ne adjon hozzá, ne távolítson el vagy módosítson szavakat. Hagyja a „[?]”-t ott, ahol nem vagy biztos benne. Minden elvégzett javítást külön listában jelenítsen meg. Szöveg: [itt]
A hatékony felszólítás arra korlátozza az AI-t, hogy csak a hibákat ismerje fel, megtiltja, hogy hozzáérjen a tartalomhoz, és nyomon követhetővé teszi a javításokat.
Munkafolyamat és kockázati táblázat
Színpad
Az AI hozzájárulása
Fő kockázat
védelmi intézkedés
szkennelés
—
rossz minőségű
nagy felbontású
OCR/HTR
Konvertálás szöveggé
Felismerési hibák
emberi korrekció
korrekció
Hibajavaslat
A tartalom megváltoztatása
Összehasonlítás az eredetivel
helyreállítása
Kép származéka
illeszkedő részlet
Őrizze meg a nyers eredetit, címkézze fel
védelmet
Metaadat-vázlat
eredetvesztés
Származási rekord
Gyakori hibák
- Az OCR kimenet elfogadása javítás nélkül. A hibák megzavarják a keresést és a hozzáférést.
- A mesterséges intelligencia „szépít” elnevezése. Megváltoztatja a tartalmat és lerombolja az eredetiséget.
- A mesterséges intelligencia helyreállításának helyettesítése a tényleges bizonyítékokkal. A kitalált részletek hamis történelmet hoznak létre.
- Nem tárolja a nyers szkennelést. Az eredeti hiányában a javítás nem ellenőrizhető.
- A származási adatok elhagyása. A dokumentum megbízhatósága követhetetlenné válik.
Összefoglalva
AI a digitális archívumokban és a digitalizálásban; Ez egy értékes segédeszköz, amely felgyorsítja az OCR/HTR átírást, a metaadat-rajzolást és a prioritások meghatározását. De az archiválási munka lényege a hitelesség és az integritás: az OCR kimenetet az emberi szemnek kell korrigálnia, az AI soha ne cserélje le csendben a tartalmat, a helyreállítási származékok ne helyettesítsék az eredeti bizonyítékot, és mindig meg kell őrizni a nyers szkennelési és származási információkat. Használja az AI-t olyan eszközként, amely nem "javítja" a dokumentumot, hanem elérhetővé teszi, miközben hű marad hozzá.
Pályázati feladat
Szerezzen be egy rövid mintát az OCR-kimenetből (akár a saját gyártásából, akár egy tényleges szkennelésből). Csak a felismerési hibákat javítsa ki az „OCR kimenet-javítási súgó” sablonnal, majd ellenőrizze, hogy a mesterséges intelligencia hozzáadott-e tartalmat a „Szöveg-kép konzisztencia ellenőrzése” sablonnal. Ezután hozzon létre egy rekordot az objektum származási és formátuminformációival a „Metaadat megőrzési vázlat” sablonnal.
ellenőrző lista
- [ ] Összehasonlítottam az OCR/HTR kimenetet a tényleges képpel és javítottam.
- [ ] Ellenőriztem, hogy az AI nem ad hozzá/módosít tartalmat.
- [ ] A nyers (master) szkennelést külön és változatlanul megtartottam.
- [ ] Származási és formátuminformációkat adtam a metaadatokhoz.
- [ ] A helyreállítási változatokat egyértelműen "AI származékként" jelöltem meg.