zisky:
- Schopnost zpracovat sbírku v 7stupňovém pracovním postupu, od etického prověřování po zveřejnění, s lidským kontrolním bodem v každé fázi
- Pochopte, jak včasné kontrolní body zabraňují šíření chyby (nesprávné datum/název) v řetězci
- Schopnost aplikovat principy zachování hlavního souboru, nešetřit na ověřování a deklarovat použití AI v holistickém projektu
Předchozí jednotky pokrývaly jednotlivé dovednosti: digitalizaci, přepis, metadata, skenování, překlad, ověřování, analýzu vzorů, vyhledávání, uchovávání a etiku. Tato závěrečná jednotka to vše spojuje. Skutečný archivní projekt neprožívá tyto kroky samostatně, ale jako vzájemně propojený pracovní postup. Zde uvidíme, jak můžete zpracovat sbírku od začátku do konce pomocí procesu podporovaného umělou inteligencí, ale kontrolovaného člověkem, krok za krokem a pomocí kontrolního řetězce.
Cílem je umístit AI jako partnera, který „urychluje každý krok, ale nemá konečné slovo v žádném kroku“. Když dokončíte tuto jednotku, zůstane vám holistická metoda, která přemění špinavou hromadu dokumentů na eticky čistou sbírku připravenou k výzkumu, ověřenou a ověřenou.
Scénář: co máme
Řekněme, že obdržíte sbírku 250 dokumentů: některé tištěné (tištěná korespondence, inzeráty), některé rukopisné (dopisy, sešity), z různých dat, některé obsahující citlivé osobní údaje. Cíl: digitalizovat, přepisovat, katalogizovat a zpřístupnit tuto sbírku badatelům. Pojďme si tento proces rozdělit do sedmi fází.
Pracovní postup v sedmi krocích
Fáze 1 – Hodnocení a etické prověřování. Nejprve se seznamte s kolekcí. Které dokumenty obsahují citlivé osobní údaje? Jaký je stav autorských práv? Existuje kulturní citlivost? Toto skenování určuje, které dokumenty mohou být poskytnuty cloudovým nástrojům AI a které budou zpracovány pouze v uzavřeném/schváleném prostředí. Pokud je tato fáze přeskočena, je celý projekt v etickém riziku.
Fáze 2 – Digitalizace. Skenujte dokumenty ve vysokém rozlišení (alespoň 300-400 DPI, dobrý kontrast). Udržujte původní (hlavní) soubory nedotčené; Veškeré zpracování bude provedeno na kopiích.
Fáze 3 – Extrakce textu. Použijte OCR pro tištěné dokumenty a HTR pro rukopis. Nechte AI vyčistit nezpracovaný výstup pomocí instrukce „bezpečné korektury“ – pouze optické/rozpoznávací chyby, žádný komentář k obsahu, nečitelná místa [?]. Alternativní čtení a paleografická kontrola pro osmanský/rukopis.
Fáze 4 – Metadata a katalogizace. Nechte si pro každý dokument vypracovat standardní metadata (Dublin Core/ISAD(G)); S povolením od "neexistující pole nechte prázdné". Mapujte termíny tématu do kontrolovaného seznamu. Ověřte data a jména pomocí dokumentace.
Fáze 5 – Obohacování a vzorování. Extrahujte entity (osobu/místo/organizaci), normalizujte, vytvořte obrysy vztahů a časové osy. Ověřte každý vzor v dokumentu; Neexistují žádné vymyšlené souvislosti a žádná chronologie.
Fáze 6 – Přístup k nástrojům. Vytvořte osnovu pomoci pro hledání pro sběr; Sekci historie založte pouze na ověřených poznámkách. Jasně označte omezení přístupu (ochrana soukromí/autorská práva).
Fáze 7 – Ověření, prohlášení a zveřejnění. Naposledy ověřte kritická pole (datum, jméno, citát, reference). Deklarujte použití AI. Expert dává konečný souhlas; Sbírka je otevřena pro výzkum.
Tip: Umístěte „lidský kontrolní bod“ do každé fáze: Expert ověří výstup AI, než přejde k další fázi. Bez těchto kontrolních bodů se chyba v první fázi (chybně přečtené datum) rozšíří celým řetězcem a nakonec pronikne do katalogu, vzoru a průvodce.
Ovládací řetězový stůl
Jeviště
Práce AI
lidský kontrolní bod
1. Etický screening
Značení citlivých údajů
Rozhodnutí o instalaci
2. Digitalizace
(Vylepšení obrazu)
Kvalita, mistrovská ochrana
3. Extrakce textu
OCR/HTR + bezpečná korekce
Ověření jména/datum/přečtení
4. Metadata
standardní návrh
Potvrzení pole, párování termínu
5. Vzor
entita, vztah, časová osa
Ověření v dokumentu
6. Přístupový nástroj
Hledání návrhu pomoci
Historie a schvalování omezení
7. Uvolněte
—
Konečné schválení, prohlášení
tři mini pouzdra
Případ 1 – Chyba řetězu zachycena. V jednom projektu ve fázi 3 bylo datum dokumentu „1868“ místo „1888“. Pokud by kontrolní bod fáze 3 tuto chybu nezachytil, datum by bylo rozloženo v katalogu (4), časové ose (5) a průvodci (6). Díky kontrolnímu bodu byla chyba opravena na jednom místě. Ponaučení: Včasná kontrola zabraňuje šíření chyby v řetězci.
Případ 2 – Etický screening zachránil projekt. 18 z 250 dokumentů obsahovalo citlivé údaje žijících osob. Etický screening ve fázi 1 je označil; těchto 18 dokumentů bylo zpracováno v uzavřeném prostředí, zbytek standardními nástroji. Bylo by vážné porušení, kdyby bylo skenování přeskočeno a vše bylo nahráno do cloudu. Ponaučení: etické prověřování je prvním krokem, nikoli opravou přidanou později.
Případ 3 – Čas a úsilí. Při použití tradiční metody by úplné zpracování sbírky 250 dokumentů trvalo přibližně 8–10 měsíců. S pracovním postupem kontrolních bodů s podporou AI se proces zkrátil přibližně na 3 měsíce. Úspory však nepocházejí z toho, že „AI dělala všechno“, ale „AI dělala mechanickou práci zaměřenou na ověřování člověkem“. Čas věnovaný ověřování se nezkrátil; Zkrátil se čas věnovaný mechanické práci.
Čtyři kopírovatelné šablony
1) Počáteční plán projektu:
Mám sbírku [číslo] dokumentů: [mix tisk/rukopis], [období], z nichž některé mohou obsahovat citlivá data. Vytvořte plán pracovního postupu v 7 krocích pro digitalizaci a katalogizaci této kolekce: určete úkol AI a kontrolní bod HUMAN v každé fázi. Dejte na první místo etický screening.
2) Kontrolní seznam přechodu fáze:
Dokončil jsem etapu [jméno scény]. Vytvořte kontrolní seznam kritických bodů, které musím ověřit, než přejdu k další fázi: jaké skutečnosti (datum/název/odkaz) je třeba ověřit, jaké chyby se mohou šířit v řetězci? Mám konečný souhlas; Dáte mi kontrolní seznam.
3) Komplexní kontrola kvality:
Níže jsou uvedeny všechny vrstvy zpracovávaného dokumentu: přepis, metadata, extrahovaná aktiva. KONCEPCE OBRÁZKŮ mezi vrstvami: shoduje se datum v přepisu s metadaty, existují entity skutečně v textu? Uložení opravy; Vytvořte seznam nesrovnalostí. Vrstvy: [zde]
4) Uzavření projektu a prohlášení:
V tomto projektu kolekce jsem použil AI v následujících fázích: [seznam]. Pro projektovou dokumentaci: (1) jaká podpora umělé inteligence byla v které fázi použita, (2) jak bylo provedeno ověření člověkem, (3) jaké limity/omezení existují – napište čestnou závěrečnou poznámku a návrh prohlášení o použití umělé inteligence, které je obsahuje.
Slabá výzva / Silná výzva
slabé:
Zpracujte tuto sbírku důkladně pomocí AI a připravte ji na výzkum.
Jediný pokyn „udělej cokoliv“ obchází etické prověřování, kontrolní body a ověřování; chyby se šíří v řetězci.
Silný:
Nastavte pro tuto kolekci 7fázový pracovní postup s lidským kontrolním bodem v každé fázi. Nechť je 1. fází kontrola etiky/ochrany soukromí. Výstup produkovaný AI v každé fázi bude ověřen před přechodem do další fáze; označte kritická fakta (datum/jméno/odkaz). V žádné fázi nemá AI poslední slovo.
Rozdíl: fázová struktura, etická priorita, kontrolní body a princip „lidé mají poslední slovo“ činí celý projekt bezpečným a obhajitelným.
Časté chyby
- Etický screening si necháme na konec. Skenování soukromí/autorských práv je prvním krokem; Pokud se přidá později, k porušení již došlo.
- Obcházení kontrolních bodů. Chyba, která není ověřena, se šíří celým řetězcem.
- Nechrání hlavní soubor. Pokud originál nezůstane nedotčený, nebude možné jej vrátit.
- Úspora na ověření. AI zkracuje mechanickou práci; Pokud se doba ověření zkrátí, kvalita se sníží.
- Nedeklarování použití AI. Transparentnost je součástí vědecké důvěryhodnosti sbírky.
V souhrnu
Projekt komplexního archivu propojuje jednotlivé dovednosti do řetězce kontroly: etické skenování, digitalizace, extrakce textu, metadata, vzory, vyhledávací nástroj a publikace. V každé fázi AI urychluje mechanickou práci; V každé fázi má poslední slovo lidský kontrolní bod. Etický screening je první fází, hlavní soubor je chráněn, chyby jsou zachyceny včas, aby se nerozšířily v řetězci, a použití AI je čestně deklarováno. Úspory nepocházejí z toho, že AI dělá všechno, ale z lidské bytosti osvobozené od mechanické práce a zaměření na ověřování. AI zrychluje; Člověk zajišťuje přesnost a integritu historie.
Aplikační úkol
Vyberte malou sbírku (10–20 dokumentů; váš vlastní materiál nebo vzorová sada). Vytvořte pracovní postup v 7 krocích pomocí šablony „plán spuštění projektu“. Spusťte tímto tokem alespoň dva dokumenty: etické skenování, extrakce textu, metadata a vrstva vzorů. Ověřte každou fázi pomocí „kontrolního seznamu přechodu fáze“. Nakonec zdokumentujte své používání AI pomocí šablony „uzavření a prohlášení projektu“. Všimněte si, které chyby byly zachyceny v časných kontrolních bodech.
kontrolní seznam
- [ ] V první fázi jsem provedl kontrolu etiky/ochrany soukromí.
- [ ] Hlavní soubory jsem ponechal nedotčené.
- [ ] V každé fázi jsem umístil lidský kontrolní bod.
- [ ] Ověřil jsem kritická fakta, než byla propagována v řetězci.
- [ ] Použití AI jsem deklaroval při uzavření projektu.
Modulová zkouška
1. Jaké je nejvhodnější umístění pro umělou inteligenci v historii a archivnictví?
- A) AI je souhrnný, editační a kreslící nástroj; Komentář, kritika zdroje a konečná odpovědnost náleží odborníkovi ✔
- B) Umělá inteligence může rozhodnout o pravosti a smyslu dokumentu sama, jako historik
- C) Umělá inteligence funguje pouze pro překlad textu, s ostatními archivními úkoly nemá nic společného
- D) Vzhledem k tomu, že umělá inteligence je vždy nestrannější než lidé, měl by být historický výklad ponechán na ní.
Popis: Umělá inteligence; Je to asistent, který upravuje, skenuje, překládá a vytváří návrhy textu. Kritika zdroje, interpretace, zjištění příčiny a následku a konečné rozhodnutí náleží odborníkovi; Neověřený výstup může vést k vymyšlenému zdroji, falešnému datu nebo anachronismu.
2. Jaké halucinace produkuje umělá inteligence v historickém výzkumu?
- A) Umělá inteligence zpracovává dokument velmi pomalu
- B) Umělá inteligence vykonstruuje neexistující zdroj, citát nebo událost jako skutečné ✔
- C) Dokument je fyzicky poškozen
- D) Archivní katalog není aktuální
Vysvětlení: Halucinace je stav, kdy umělá inteligence s jistotou vymýšlí informace, zdroje, citace nebo události, které ve skutečnosti neexistují. Ačkoli se jeho forma jeví jako dokonalá, její obsah není skutečný; Proto musí být v každém referenčním katalogu každá citace ověřena u původního zdroje.
3. Jaký je nejlepší přístup ke korekci výstupu OCR umělou inteligencí?
- A) Požádejte, aby byl text plynulý a krásný a aby logicky doplnil chybějící části.
- B) Umožňuje opravit všechna čísla a data na základě kontextu
- C) Požádejte ho, aby opravil pouze chyby optického rozpoznávání, ponechal nečitelné oblasti [?] a neměnil čísla/data ✔
- D) Požádejte studenta, aby doplnil nečitelná slova nejpravděpodobnějším odhadem.
Vysvětlení: Zlatým pravidlem při korekci OCR je opravit pouze zjevné chyby optického rozpoznávání (jako je rn na m, l na 1); neinterpretování nebo doplnění obsahu textu. Nečitelné oblasti jsou označeny [?]; Čísla a data se nemění, jsou ověřeny s obrázkem.
4. Co by se mělo od umělé inteligence žádat, pokud jde o čtení slova, jehož samohláska není napsána v osmanském textu?
- A) Poskytněte jediné přesné čtení, čímž urychlíte práci
- B) Výběr slova, jehož význam bude nejplynulejší, a vyplnění mezer
- C) Doplnění nečitelných částí z vlastních obecných znalostí.
- D) Nabízení možných alternativ čtení a označování nejednoznačných oblastí namísto vnucování definitivního čtení ✔
Vysvětlení: V osmanské turečtině se krátké samohlásky většinou nepíší; Jediný rozdíl mezi samohláskou a písmenem (abul a kábul, wali a vali) zcela mění význam. Místo uložení definitivního čtení by se proto mělo ptát na možné alternativy, nečitelné oblasti by měly být zachovány a konečné rozhodnutí by mělo být ponecháno na paleografovi.
5. Jaký je nejúčinnější způsob, jak zabránit halucinacím, když AI vytvoří návrh metadat (katalogový záznam)?
- A) Explicitně udělte povolení ponechat toto pole prázdné, pokud není zahrnuto v dokumentu ✔
- B) Požadavek, aby byla všechna pole vyplněna a nezůstala neúplná.
- C) Odhad data na základě obsahu nedatovaných dokumentů
- D) Umožnění umělé inteligenci generovat referenční kód
Popis: Vyplňovací tlak nutí AI sestavit dokument uhodnutím data nebo autora, který v dokumentu není. Nejsilnějším štítem proti tomu je výslovně udělit povolení ponechat pole prázdné, pokud není v dokumentu; Kromě toho jsou termíny tématu mapovány do řízené slovní zásoby.
6. Jak by měl být souhrn dokumentů vytvořený umělou inteligencí umístěn v historickém výzkumu?
- A) Jako spolehlivý důkaz, který lze přímo citovat
- B) Jako vyhledávací mapu, která vás nasměruje ke skutečnému dokumentu; Důkaz je převzat z původního dokumentu ✔
- C) Jako adekvátní zdroj, který může nahradit samotný dokument
- D) Jako text, který lze použít ve studii, aniž byste se kdy vraceli k dokumentu
Popis: Souhrn je mapa objevů, nikoli důkaz. V tomto dokumentu je něco takového, říká jdi a podívej se; Neříká přesně to, co je uvedeno v dokumentu. Pokud má být do studie zahrnuta událost, citace nebo údaje, musí být doslovně převzaty z původního dokumentu.
7. Jaký je správný způsob, jak se vyhnout anachronismům při překladu historického dokumentu k publikaci?
- A) Nahrazení všech dobových termínů dnešním nejbližším ekvivalentem
- B) Předat text co nejplynuleji a moderně
- C) Ponechte jedinečné názvy období a názvy institucí a přidejte vysvětlení ✔
- D) Přizpůsobení vlastních jmen jejich aktuálnímu použití
Vysvětlení: Anachronismus je nesprávný přenos prvků z jednoho období do druhého. Změna dobových názvů, jmen institucí a osobních jmen na dnešní termíny přenese čtenáře do světa, který do doby nepatří. Správný způsob je ponechat termín období a přidat k němu vysvětlení.
8. Jak zajistit, aby odkaz na archiv (název fondu, číslo souboru) poskytnutý umělou inteligencí byl skutečný?
- A) Důvěřovat odkazu, protože jeho formát se zdá být správný
- B) Opětovným dotazem AI, zda je reference správná
- C) Přijmout odkaz jako pravdivý, protože je přesvědčivý a podrobný
- D) Osobním vyhledáním a ověřením reference v archivním katalogu nebo důvěryhodném zdroji ✔
Popis: Umělá inteligence může vytvářet reference, které jsou dokonalé ve formě, ale ve skutečnosti neexistují; Fiktivní reference je ve stejné podobě jako skutečná reference. Jediný způsob, jak dokázat, že reference existuje, je najít ji tam, kde se nachází původní zdroj (archivní katalog, knihovna).
9. Jak by měl být vyhodnocen vzor nalezený při provádění analýzy vzorů (NER, síť, časová osa) s umělou inteligencí?
- A) Jako hypotézu, kterou je třeba v dokumentu ověřit; výchozí bod, nikoli výsledek ✔
- B) Jako definitivní nález, který nevyžaduje ověření
- C) Je to nesporný objektivní fakt, protože je číselný.
- D) Jako výsledek, který může být uveden do přímého studia, protože našel umělou inteligenci
Vysvětlení: Každý vzor je hypotéza, nikoli důkaz. Entity by měly být spojeny se zdrojem, různé pravopisy (stejné osoby/místa) by měly být normalizovány se souhlasem člověka, čísla by měla být zpochybněna kvůli chybějícím údajům a zkreslení vzorku a nedatované události by neměly být chronologizovány.
10. Proč vyžaduje část biografické/institucionální historie v pomůcce pro hledání zvláštní pozornost?
- A) Tato sekce je nedůležitá a může být zveřejněna bez ověření
- B) Vzhledem k tomu, že umělá inteligence může do této sekce přidávat vymyšlené události, falešná data a názvy, měla by se spoléhat pouze na ověřené zdroje ✔
- C) Umělou inteligenci lze bezpečně používat, protože nedělá žádné chyby při psaní historie.
- D) Tuto rubriku vyplňují pouze badatelé, archiváře nezajímá
Popis: V sekci historie se nejčastěji vkrádají halucinace: AI dokáže vkládat neexistující události, falešná data a vymyšlené názvy, zatímco píše plynulý text z obecných informací o osobě nebo instituci. Tato část by měla vycházet pouze z ověřených zdrojů.
11. Jak by měla umělá inteligence odpovědět na faktickou otázku výzkumníka v referenční (konzultační) službě?
- A) Odpověď na otázku by měla být dána přímo a jako určitá skutečnost.
- B) Musí předložit věrohodné datum nebo jméno a sdělit je výzkumníkovi.
- C) Místo přímého uvádění faktů by měl výzkumníka nasměrovat na příslušnou sbírku a zdroj ✔
- D) Měl by poskytnout úplnou odpověď, aby výzkumník nemusel jít ke zdroji.
Vysvětlení: V referenční službě by umělá inteligence neměla dávat přímou faktickou odpověď, ale měla by nasměrovat výzkumníka ke zdroji. Protože přímá faktická odpověď daná umělou inteligencí může být vymyšlená a výzkumník ji může zaměnit za zdroj. Místo slova „Odpověď je toto“, by mělo říci „Podívejte se na tyto dokumenty v této sbírce“.
12. Které operace jsou přijatelné a nežádoucí při zpracování obrazu poškozeného dokumentu pomocí umělé inteligence?
- A) Všechny druhy operací jsou zdarma, včetně doplnění chybějících částí.
- B) Nesmí být prováděna žádná akce, nikdy by se nemělo dotýkat obrazu
- C) Doplnění chybějících oddílů je nejcennější akcí, protože dokument doplňuje.
- D) Manipulace s čitelností, jako je kontrast/šum, jsou přijatelné; Je nepohodlné doplňovat chybějící části odhady ✔
Vysvětlení: Procesy, které zlepšují čitelnost (kontrast, osvětlení, redukce šumu), jsou přijatelné, protože nemění obsah; Doplňování chybějících/nečitelných částí odhadem je však rizikem produkovat to, co v dokumentu není, tedy historický padělek. Originál je zachován, transakce jsou evidovány.
13. Co je třeba udělat před zpracováním archivního dokumentu obsahujícího citlivé osobní údaje?
- A) Kontrola soukromí a anonymizace v případě potřeby nebo pomocí uzavřeného/schváleného nástroje ✔
- B) Nahrání dokumentu přímo do veřejného vozidla, aniž byste o tom přemýšleli
- C) Ignorování obav o soukromí kvůli efektivitě
- D) Překonání omezení přístupu z důvodu efektivity
Zveřejnění: Nahrávání dokumentů obsahujících citlivá data identifikující žijící osoby (zdraví, náboženství, etnická příslušnost, adresa) do veřejných cloudových nástrojů může být vážným porušením soukromí. Nejprve by měla být provedena kontrola soukromí, v případě potřeby by měla být použita anonymizace nebo uzavřený/schválený nástroj.
14. Jaký je hlavní účel lidského kontrolního bodu v projektu end-to-end archivu?
- A) Zpomalení práce umělé inteligence a zdržení projektu
- B) Aby se zabránilo řetězení chyby (nesprávné datum/název) v jedné fázi do všech následujících fází ✔
- C) Zvýšení lidské práce a úplné opuštění automatizace
- D) Zajistit, aby poslední slovo měla umělá inteligence
Popis: Lidský kontrolní bod v každé fázi zajišťuje ověření výstupu AI před přechodem do další fáze. Bez toho by se chyba v první fázi (špatně přečtené datum) šířila v řetězci katalogem, vzorem a průvodcem. Včasná kontrola zajistí, že chyba bude opravena na jednom místě.
15. Co vyžaduje transparentnost a autentičnost při využívání umělé inteligence v humanitních a společenských vědách?
- A) Udržování používání umělé inteligence v tajnosti, zajištění toho, aby to nikdo nevěděl
- B) Prezentovat každý text vytvořený umělou inteligencí jako vlastní originální nápad
- C) Čestně deklarovat použití umělé inteligence a neprezentovat její výstup jako vlastní originální dílo ✔
- D) Sdílení pouze výsledků bez vysvětlení metod
Popis: Transparentnost zahrnuje záznam, že přepis, metadata nebo překlad byly vytvořeny pomocí umělé inteligence; Originalita vyžaduje neprezentovat komentář vytvořený umělou inteligencí jako vlastní originální nápad. To je nezbytné pro ověření následnými výzkumníky a pro akademickou integritu.