zisky:
- Schopnost opravit naskenované dokumenty jejich převodem na text pomocí OCR a HTR a porovnáním výstupu se skutečným obrázkem
- Schopnost zachovat originalitu a integritu archivního dokumentu a zabránit AI ve změně obsahu a zhotoveném restaurování
- Schopnost plánovat dlouhodobé digitální uchovávání s informacemi o původu a trvalými formáty
Archivář má za úkol přenést do budoucnosti padesát let staré svazky novin, ručně psané dopisy nebo staré fotografie. Tyto dokumenty se časem opotřebovávají; Aby byly zachovány a zpřístupněny, provádí se digitalizace: akt skenování fyzického dokumentu a jeho převedení na digitální kopii. Samotný screening však nestačí; Digitální objekt musí být dohledatelný, čitelný a dlouhodobě udržovatelný. V této lekci se naučíte používat umělou inteligenci v pracovním postupu digitalizace, přepisu a digitálního uchovávání; ale dozvíte se, proč budete nést odpovědnost za originalitu a přesnost.
Několik konceptů. OCR (Optical Character Recognition) je technologie, která převádí text v obrázku dokumentu na strojově upravitelný text. HTR (Handwritten Text Recognition) dělá stejnou práci pro ručně psané dokumenty a je mnohem obtížnější. Digitální ochrana je plánovaná snaha zajistit, aby digitální objekty zůstaly čitelné po celá desetiletí, i když formáty souborů zastarají a dojde ke změnám softwaru. Umělá inteligence je výkonný, ale chybný pomocník ve všech třech oblastech.
Krok za krokem: od digitalizace k uchování
1. Upřednostněte. Nelze digitalizovat vše najednou. Nejkřehčí, nejžádanější a nejunikátnější dokumenty jsou na prvním místě. Toto je soudní rozhodnutí; AI pomáhá s úpravou seznamu, ale prioritu určuje instituce.
2. Naskenujte a použijte OCR/HTR. Naskenujte dokument ve vysokém rozlišení a poté pomocí OCR nebo HTR extrahujte text. Nástroje založené na AI jsou zde stále lepší a lepší, a to i u starých a obtížných textů.
3. Opravte a ověřte text. OCR/HTR výstup není nikdy dokonalý. Chyby jsou běžné, zvláště pokud je tam staré písmo, potřísněné stránky nebo rukopis. Je nezbytné porovnat výstup se skutečným obrázkem a opravit jej.
4. Přidejte metadata a informace o ochraně. Přidejte k digitálnímu objektu jeho původ, podmínky skenování, informace o formátu a původ – odkud dokument pochází a jak byl zpracován. Tyto informace jsou důležité pro budoucí ověření a ochranu.
5. Naplánujte si dlouhodobou ochranu. Vyberte formáty souborů, které jsou otevřené, běžné a odolné; zálohovat; Vytvořte plán migrace pro případ, že se formáty stanou zastaralými.
Tip: Neakceptujte výstup OCR jako „čistý text“. Pokud by vyhledávací systém prošel tímto textem, nesprávně rozpoznaná slova by způsobila, že zdroj nebude nalezen. U kritických sbírek určuje kvalitu veškerého následného přístupu korekce výstupu OCR na lidské oko.
Autenticita a integrita digitálního objektu
Základem archivní práce je autenticita a integrita: ujištění, že dokument skutečně pochází z uváděného zdroje a že jeho obsah nebyl pozměněn. V tomto okamžiku AI vytváří dvojí hrozbu. Za prvé, během opravy OCR/HTR nebo „vylepšení“ může umělá inteligence tiše upravit text; může pod názvem "oprava" přidat slovo, které neexistuje. Za druhé, pokud se „oprava“ nebo „obnovení“ obrazu provádí pomocí AI, mohou být vytvořeny nepůvodní detaily.
Pravidlo archiváře je jasné: kopie musí být věrná originálu. Každé vylepšení provedené pomocí AI by mělo být zdokumentováno a skutečný (surový) sken by měl být vždy zachován. „Zkrášlování“ dokumentu může zničit jeho historickou důkazní hodnotu.
Pozor: Může být lákavé „vylepšit“ starou fotku nebo dokument pomocí AI; ale AI doplňuje chybějící části tím, že je vymýšlí. V archivním dokumentu to znamená vytvářet falešné historické důkazy. Výstup obnovy nikdy nenahradí původní zdroj; je uložena jako samostatná, jasně označená varianta.
tři mini pouzdra
Případ 1 — Archivy novin se staly prohledávatelnými. Knihovna digitalizovala svou 30 let starou sbírku místních novin. S OCR bylo přepsáno 90 000 stran a bylo možné v nich vyhledávat; Vyhledávání témat, které dříve trvalo dny, se nyní zkrátilo na sekundy. Tým si však všiml, že přesnost OCR klesla na 80 % na starých a poskvrněných stránkách a upřednostnil opravu horních let lidským okem.
Případ 2 – HTR otevřel rukopis. Archiv aplikoval HTR na sbírku obtížně čitelných dopisů z 19. století. Systém získal velkou rychlost podle měsíců čtení odborníky; Ale každá stránka výtisku byla porovnána s originálem odborným paleografem (odborníkem na starověké písmo), protože ve jménech osob a míst byly chyby.
Případ 3 – Falešné „restaurování“ zamítnuto. Jeden tým zvažoval „opravu“ roztrhané historické fotografie pomocí AI. AI doplnila chybějící části obličeje jejich přizpůsobením. Archivář si uvědomil, že tyto smyšlené detaily by zkreslily historické důkazy; Opravený snímek byl uložen odděleně vedle originálu, pouze jasně označený jako „derivát AI“.
Přístup ke kopii, uchování kopie a rozhodnutí o formátu
Osvědčeným postupem při digitalizaci je oddělovat kopie stejného objektu pro různé účely. Předloha pro uchování je skutečný digitální objekt, který má být přenesen do budoucnosti, uložený v nejvyšším rozlišení, nekomprimovaném nebo bezztrátovém formátu; málokdy se ho dotýká. Přístupová kopie je menší, snadno otevíratelná varianta prezentovaná uživateli. Toto rozlišení je důležité, protože formát, který je praktický pro použití (malý, komprimovaný), nemusí být vhodný pro dlouhodobé uchovávání; Ideální formát pro uchování (velký, bezztrátový) je pro každodenní použití těžkopádný. V tomto pracovním postupu může umělá inteligence pomoci při inventarizaci souborů, zjišťování chybějících variant a udržování konzistentních metadat mezi dvěma kopiemi. Volba formátu je však rozhodnutím o uchování: měly by být upřednostňovány otevřené, široce dokumentované a trvalé formáty (spíše než proprietární uzavřené formáty) a měl by být připraven plán migrace pro případ, že formáty časem zastarají. I když AI navrhne formát, konečné slovo má politika dlouhodobého uchovávání.
Tip: U každého digitálního objektu veďte stručný záznam, který odpovídá na otázky „kde je původní zdroj, v jakém formátu je zachovaná kopie, v jakém formátu je přístupová kopie a která je zpřístupněna uživateli?“ Smícháním těchto tří vrstev není jasné, který soubor je do budoucna důvěryhodným hlavním souborem.
Čtyři kopírovatelné šablony
1) Nápověda pro korekci výstupu OCR:
Níže je text OCR a popis skutečné stránky. Opravte pouze chyby openOCR (špatné znaky, složená/rozdělená slova). Neměňte obsah, nepřidávejte ani neodstraňujte slova. Pokud si nejste jisti, označte pomocí „[?]“. Text OCR: [zde]
2) Kontrola konzistence textu a obrázku:
Jsou v opraveném textu níže nějaké doplňky, které se neočekávaly v původním dokumentu (který mohl být vymyšlený)? Označte každou podezřelou část a napište, proč je podezřelá. Text: [zde]
3) Návrh metadat ochrany:
Vygenerujte obrys metadat uchování pro následující digitalizovaný objekt: zdroj, původ, datum/rozlišení skenování, formát souboru, historie transakcí. Stačí použít informace, které jsem uvedl, chybějící pole ponechte prázdné. Informace: [zde]
4) Nápověda ke stanovení priorit:
Níže je uveden seznam sbírek čekajících na digitalizaci; Pomozte při stanovování priorit na základě křehkosti, poptávky a jedinečnosti. Uveďte stručné odůvodnění každého zdroje; Konečné rozhodnutí nechte na mně. Seznam: [zde]
Slabá výzva / Silná výzva
Slabá výzva:
Opravte a zkrášlete tento naskenovaný text.
„Beautify“ vyzývá AI, aby změnila obsah a nahradila opomenutí; Originalita archivního dokumentu je poškozena.
Výkonná výzva:
Vaše role: asistent editora digitalizace. V následujícím textu OCR opravujte POUZE explicitní chyby rozpoznávání (špatný znak, nesprávně rozdělené slovo). Nepřidávejte, neodstraňujte ani neměňte žádná slova. Pokud si nejste jisti, ponechte „[?]“. Ukažte každou opravu, kterou jste provedli, v samostatném seznamu. Text: [zde]
Výkonná výzva omezuje AI pouze na rozpoznání chyb, zakazuje jí dotýkat se obsahu a umožňuje dohledat opravy.
Pracovní postup a tabulka rizik
Jeviště
Příspěvek AI
Hlavní riziko
ochranné opatření
skenovat
—
špatná kvalita
vysoké rozlišení
OCR/HTR
Převést na text
Chyby v rozpoznávání
lidská náprava
korekce
Návrh chyby
Změna obsahu
Srovnání s originálem
restaurování
Obrazová derivace
padnoucí detail
Surový originál si ponechte, označte jej
ochranu
Koncept metadat
ztráta původu
Záznam o provenienci
Časté chyby
- Přijetí výstupu OCR bez korekce. Chyby narušují vyhledávání a přístup.
- Volání umělé inteligence „udělej krásné“. Mění obsah a ničí originalitu.
- Nahrazení skutečného důkazu obnovou AI. Vymyšlený detail vytváří falešnou historii.
- Neukládá se nezpracovaný sken. Bez originálu nelze žádnou opravu ověřit.
- Vynechání údajů o původu. Spolehlivost dokumentu se stává nevysledovatelnou.
V souhrnu
AI v digitálních archivech a digitalizaci; Je to cenná pomůcka, která urychluje přepis OCR/HTR, navrhování metadat a stanovení priorit. Podstatou archivní práce je ale autenticita a integrita: výstup OCR by měl být korigován lidským okem, umělá inteligence by nikdy neměla tiše nahrazovat obsah, restaurátorské deriváty by neměly nahrazovat původní důkazy a vždy by měly být zachovány nezpracované informace o skenování a původu. Použijte AI jako nástroj, který dokument „nevylepšuje“, ale spíše jej zpřístupňuje a přitom mu zůstává věrný.
Aplikační úkol
Získejte krátkou ukázku výstupu OCR (buď z vlastní produkce nebo ze skutečného skenování). Nechte opravit pouze chyby rozpoznávání pomocí šablony „Nápověda k opravě výstupu OCR“ a poté zkontrolujte, zda AI přidal obsah pomocí šablony „Kontrola konzistence textu a obrázku“. Poté vytvořte záznam s informacemi o původu a formátu objektu pomocí šablony „Koncept metadat zachování“.
kontrolní seznam
- [ ] Porovnal jsem výstup OCR/HTR se skutečným obrázkem a opravil.
- [ ] Zkontroloval jsem, že AI nepřidává/nemění obsah.
- [ ] Surový (hlavní) sken jsem ponechal odděleně a beze změny.
- [ ] Do metadat jsem přidal informace o původu a formátu.
- [ ] Varianty restaurování jsem jasně označil jako „derivát AI“.