zisky:
- Schopnosť spracovať kolekciu v 7-stupňovom pracovnom toku, od etického preverovania až po zverejnenie, s ľudským kontrolným bodom v každej fáze
- Pochopte, ako včasné kontrolné body zabraňujú šíreniu chyby (nesprávny dátum/názov) v reťazci
- Schopnosť aplikovať princípy uchovávania hlavného súboru, nešetriť na overovaní a deklarovať použitie AI v holistickom projekte
Predchádzajúce jednotky pokrývali jednotlivé zručnosti: digitalizáciu, prepis, metadáta, skenovanie, preklad, overovanie, analýzu vzorov, vyhľadávanie, uchovávanie a etiku. Táto záverečná jednotka to všetko spája. Skutočný archívny projekt neprežíva tieto kroky oddelene, ale ako vzájomne prepojený pracovný postup. Tu uvidíme, ako môžete spracovať kolekciu od začiatku do konca pomocou procesu podporovaného AI, ale kontrolovaného človekom, krok za krokom a pomocou riadiaceho reťazca.
Cieľom je postaviť AI ako partnera, ktorý „zrýchľuje každý krok, ale nemá konečné slovo v žiadnom kroku“. Keď dokončíte túto jednotku, zostane vám holistická metóda, ktorá premení neusporiadanú hromadu dokumentov na zbierku pripravenú na výskum, overenú a eticky čistú.
Scenár: čo máme
Povedzme, že dostanete zbierku 250 dokumentov: niektoré tlačené (tlačená korešpondencia, inzeráty), niektoré rukopisné (listy, zošity), z rôznych dátumov, niektoré obsahujú citlivé osobné údaje. Cieľ: digitalizovať, prepísať, katalogizovať a sprístupniť túto zbierku bádateľom. Rozdeľme si proces do siedmich etáp.
Pracovný postup v siedmich krokoch
Fáza 1 – Hodnotenie a etický skríning. Najprv sa zoznámte s kolekciou. Ktoré dokumenty obsahujú citlivé osobné údaje? Aký je stav autorských práv? Existuje kultúrna citlivosť? Toto skenovanie určuje, ktoré dokumenty môžu byť poskytnuté cloudovým nástrojom AI a ktoré budú spracované iba v uzavretom/schválenom prostredí. Ak sa táto fáza preskočí, celý projekt je vystavený etickému riziku.
2. fáza – Digitalizácia. Skenujte dokumenty vo vysokom rozlíšení (aspoň 300-400 DPI, dobrý kontrast). Ponechajte pôvodné (hlavné) súbory nedotknuté; Všetko spracovanie sa uskutoční na kópiách.
3. fáza – extrakcia textu. Použite OCR pre papierové dokumenty a HTR pre rukopis. Nechajte AI vyčistiť nespracovaný výstup pomocou inštrukcie „bezpečnej korektúry“ – iba optické chyby/chyby rozpoznávania, bez komentára k obsahu, nečitateľné miesta [?]. Alternatívne čítanie a paleografická kontrola pre osmanský/rukopis.
Fáza 4 – Metaúdaje a katalogizácia. Nechajte si pre každý dokument vypracovať štandardné metadáta (Dublin Core/ISAD(G)); S povolením od "neexistujúce pole nechajte prázdne". Mapujte výrazy témy do kontrolovaného zoznamu. Overte dátumy a mená s dokumentáciou.
Fáza 5 – Obohacovanie a vytváranie vzorov. Extrahujte entity (osobu/miesto/organizáciu), normalizujte, vytvorte vzťah a obrysy časovej osi. Overte každý vzor v dokumente; Neexistujú žiadne vymyslené súvislosti a žiadna chronológia.
Fáza 6 – Prístup k nástrojom. Vytvorte náčrt pomoci pri hľadaní na zber; Sekciu histórie založte len na overených poznámkach. Jasne označte obmedzenia prístupu (súkromie/autorské práva).
Etapa 7 – Overenie, vyhlásenie a uverejnenie. Poslednýkrát skontrolujte kritické polia (dátum, meno, citát, referencia). Deklarujte používanie AI. Expert dáva konečný súhlas; Zbierka je otvorená na výskum.
Tip: Umiestnite „ľudský kontrolný bod“ do každej fázy: Expert overí výstup AI pred prechodom na ďalšiu fázu. Bez týchto kontrolných bodov sa chyba v prvej fáze (nesprávne prečítaný dátum) rozšíri v reťazci a nakoniec prenikne do katalógu, vzoru a sprievodcu.
Riadiaci reťazový stôl
Etapa
Práca AI
ľudský kontrolný bod
1. Etický skríning
Značenie citlivých údajov
Rozhodnutie o inštalácii
2. Digitalizácia
(Vylepšenie obrazu)
Kvalita, majstrovská ochrana
3. Extrakcia textu
OCR/HTR + bezpečná korekcia
Meno/dátum/overenie čítania
4. Metadáta
štandardný návrh
Potvrdenie poľa, párovanie termínov
5. Vzor
entita, vzťah, časová os
Overenie v dokumente
6. Prístupový nástroj
Hľadanie návrhu pomoci
História a schválenie obmedzenia
7. Uvoľnite
—
Konečné schválenie, vyhlásenie
tri mini prípady
Prípad 1 – Zachytená chyba reťaze. V jednom projekte vo fáze 3 bol dátum dokumentu „1868“ namiesto „1888“. Ak by kontrolný bod 3. fázy túto chybu nezachytil, dátum by bol rozložený v katalógu (4), časovej osi (5) a sprievodcovi (6). Vďaka kontrolnému bodu bola chyba opravená na jednom mieste. Ponaučenie: skorá kontrola zabráni šíreniu chyby v reťazci.
Prípad 2 – Etický skríning zachránil projekt. 18 z 250 dokumentov obsahovalo citlivé údaje žijúcich osôb. Etický skríning vo fáze 1 ich označil; týchto 18 dokumentov bolo spracovaných v uzavretom prostredí, zvyšok štandardnými nástrojmi. Ak by sa skenovanie preskočilo a všetko by sa nahralo do cloudu, bolo by to vážne porušenie. Ponaučenie: etický skríning je prvým krokom, nie opravou pridanou neskôr.
Prípad 3 – Čas a úsilie. Pri použití tradičnej metódy by úplné spracovanie zbierky 250 dokumentov trvalo približne 8-10 mesiacov. Vďaka pracovnému postupu kontrolných bodov s podporou AI sa proces skrátil na približne 3 mesiace. Úspory však nepriniesli „AI urobila všetko“, ale „AI urobila mechanickú prácu zameranú na overenie človekom“. Čas venovaný overovaniu sa neskrátil; Čas venovaný mechanickej práci sa znížil.
Štyri kopírovateľné šablóny
1) Počiatočný plán projektu:
Mám zbierku [počet] dokumentov: [mix tlače/rukopis], [obdobie], z ktorých niektoré môžu obsahovať citlivé údaje. Vytvorte 7-krokový plán pracovného postupu na digitalizáciu a katalogizáciu tejto kolekcie: špecifikujte úlohu AI a kontrolný bod HUMAN v každej fáze. Na prvé miesto dajte etický skríning.
2) Kontrolný zoznam prechodu fázy:
Skončil som etapu [meno scény]. Vytvorte kontrolný zoznam kritických bodov, ktoré musím overiť, kým prejdem do ďalšej fázy: aké fakty (dátum/meno/odkaz) je potrebné overiť, aké chyby sa môžu šíriť v reťazci? Mám konečný súhlas; Dáš mi kontrolný zoznam.
3) Komplexná kontrola kvality:
Nižšie sú uvedené všetky vrstvy spracovaného dokumentu: prepis, metadáta, extrahované aktíva. KONCEPTY OBRÁZKOV medzi vrstvami: zhoduje sa dátum v prepise s metadátami, existujú entity skutočne v texte? Uloženie korekcie; Vytvorte zoznam nezrovnalostí. Vrstvy: [tu]
4) Ukončenie projektu a vyhlásenie:
V tomto projekte zbierky som použil AI v nasledujúcich fázach: [zoznam]. Pre projektovú dokumentáciu: (1) aká podpora AI sa použila v ktorej fáze, (2) ako sa vykonalo overenie človekom, (3) aké limity/obmedzenia existujú – napíšte čestnú záverečnú poznámku a návrh vyhlásenia o používaní AI, ktorý ich obsahuje.
Slabá výzva / Silná výzva
slabé:
Dôkladne spracujte túto zbierku pomocou AI a pripravte ju na výskum.
Jediný pokyn „urobte čokoľvek“ obchádza etické preverovanie, kontrolné body a overovanie; chyby sa šíria pozdĺž reťazca.
Silný:
Nastavte pre túto kolekciu 7-stupňový pracovný postup s ľudským kontrolným bodom v každej fáze. 1. stupeň nech je etický/ochranný skríning. Výstup produkovaný AI v každej fáze bude overený pred prechodom do ďalšej fázy; označte kritické skutočnosti (dátum/meno/odkaz). V žiadnej fáze nemá AI posledné slovo.
Rozdiel: fázová štruktúra, etická priorita, kontrolné body a princíp „ľudia majú posledné slovo“ robia celý projekt bezpečným a obhájiteľným.
Časté chyby
- Etické preverovanie si necháme na koniec. Skenovanie ochrany osobných údajov/autorských práv je prvým krokom; Ak sa pridá neskôr, k porušeniu už došlo.
- Obchádzanie kontrolných bodov. Chyba, ktorá nie je overená, sa šíri v celom reťazci.
- Nechráni hlavný súbor. Ak originál nezostane nedotknutý, vrátenie je nemožné.
- Úspora pri overovaní. AI skracuje mechanickú prácu; Ak sa čas overenia skráti, kvalita sa zníži.
- Nedeklarovanie používania AI. Transparentnosť je súčasťou vedeckej dôveryhodnosti zbierky.
V súhrne
Projekt komplexného archívu spája jednotlivé zručnosti do reťazca kontroly: etické skenovanie, digitalizácia, extrakcia textu, metaúdaje, vzor, nástroj na vyhľadávanie a publikovanie. V každej fáze AI urýchľuje mechanickú prácu; V každej fáze má posledné slovo ľudský kontrolný bod. Etický skríning je prvou fázou, hlavný súbor je chránený, chyby sa zachytávajú včas, aby sa nerozšírili v reťazci, a používanie AI je čestne deklarované. Úspory nepochádzajú z toho, že AI robí všetko, ale z ľudskej bytosti oslobodenej od mechanickej práce a zamerania sa na overovanie. AI zrýchľuje; Človek zabezpečuje presnosť a integritu histórie.
Aplikačná úloha
Vyberte si malú kolekciu (10 – 20 dokumentov; váš vlastný materiál alebo vzorová sada). Vytvorte 7-krokový pracovný postup pomocou šablóny „plán spustenia projektu“. Spustite týmto tokom aspoň dva dokumenty: etické skenovanie, extrakciu textu, metadáta a vrstvu vzorov. Overte každú fázu pomocou „kontrolného zoznamu prechodu fáz“. Nakoniec zdokumentujte svoje používanie AI pomocou šablóny „uzavretie projektu a vyhlásenie“. Všimnite si, ktoré chyby boli zachytené pri skorých kontrolných bodoch.
kontrolný zoznam
- [ ] V prvej fáze som vykonal previerku etiky/ochrany súkromia.
- [ ] Ponechal som hlavné súbory nedotknuté.
- [ ] V každej fáze som umiestnil ľudský kontrolný bod.
- [ ] Kritické fakty som overil skôr, ako boli propagované v reťazci.
- [ ] Použitie AI som deklaroval pri uzávierke projektu.
Modulová skúška
1. Aké je najvhodnejšie umiestnenie umelej inteligencie v histórii a archívnictve?
- A) AI je nástroj na zhrnutie, úpravu a navrhovanie; Komentár, kritika zdroja a konečná zodpovednosť patrí odborníkovi ✔
- B) Umelá inteligencia môže rozhodnúť o pravosti a význame dokumentu sama, ako historik
- C) Umelá inteligencia funguje len na preklad textu, nemá nič spoločné s inými archívnymi úlohami
- D) Keďže umelá inteligencia je vždy nestrannejšia ako ľudia, historickú interpretáciu treba nechať na ňu.
Popis: Umelá inteligencia; Je to asistent, ktorý upravuje, skenuje, prekladá a vytvára návrhy textu. Kritika zdroja, interpretácia, určenie príčiny a následku a konečné rozhodnutie patrí odborníkovi; Neoverený výstup môže viesť k vymyslenému zdroju, nesprávnemu dátumu alebo anachronizmu.
2. Akú halucináciu produkuje umelá inteligencia v historickom výskume?
- A) Umelá inteligencia spracováva dokument veľmi pomaly
- B) Umelá inteligencia vyrobí neexistujúci zdroj, citát alebo udalosť ako skutočné ✔
- C) Dokument je fyzicky poškodený
- D) Archívny katalóg nie je aktuálny
Vysvetlenie: Halucinácia je, keď umelá inteligencia s istotou vymýšľa informácie, zdroje, citáty alebo udalosti, ktoré v skutočnosti neexistujú. Hoci sa jeho forma javí ako dokonalá, jej obsah nie je skutočný; Preto v každom referenčnom katalógu musí byť každá citácia overená v pôvodnom zdroji.
3. Aký je najlepší prístup k tomu, aby OCR výstup korigoval umelá inteligencia?
- A) Požiadajte, aby bol text plynulý a krásny a aby logicky doplnil chýbajúce časti.
- B) Umožňuje opraviť všetky čísla a dátumy na základe kontextu
- C) Požiadajte ho, aby opravoval iba chyby optického rozpoznávania, ponechal nečitateľné oblasti [?] a nemenil čísla/dátumy ✔
- D) Požiadajte študenta, aby doplnil nečitateľné slová s najpravdepodobnejším odhadom.
Vysvetlenie: Zlatým pravidlom pri korekcii OCR je opravovať iba zjavné chyby optického rozpoznávania (napríklad rn na m, l na 1); neinterpretovanie alebo dotváranie obsahu textu. Nečitateľné oblasti sú označené [?]; Čísla a dátumy sa nemenia, overujú sa s obrázkom.
4. Čo treba žiadať od umelej inteligencie pri čítaní slova, ktorého samohláska nie je napísaná v osmanskom texte?
- A) Poskytnite jediné presné čítanie, čím urýchlite prácu
- B) Výber slova, ktorého význam bude najplynulejší, a vyplnenie prázdnych miest
- C) Doplnenie nečitateľných častí z vlastných všeobecných vedomostí.
- D) Ponúkanie možných alternatív čítania a označovanie nejednoznačných oblastí namiesto vnucovania definitívneho čítania ✔
Vysvetlenie: V osmanskej turečtine sa krátke samohlásky väčšinou nepíšu; Jediný rozdiel medzi samohláskou a písmenom (abul a kábul, wali a vali) úplne mení význam. Preto namiesto uloženia definitívneho čítania sa treba pýtať na možné alternatívy, zachovať nečitateľné oblasti a konečné rozhodnutie ponechať na paleografa.
5. Aký je najefektívnejší spôsob, ako zabrániť halucináciám, keď AI vytvorí návrh metadát (katalógový záznam)?
- A) Explicitne udeľte povolenie ponechať toto pole prázdne, ak nie je zahrnuté v dokumente ✔
- B) Žiadosť, aby bolo vyplnené každé pole a aby nebolo ponechané neúplné.
- C) Odhad dátumu na základe obsahu nedatovaných dokumentov
- D) Umožnenie umelej inteligencii vygenerovať referenčný kód
Popis: Tlak na vyplnenie núti AI, aby vytvorila dokument uhádnutím dátumu alebo tvorcu, ktorý sa v dokumente nenachádza. Najsilnejším štítom proti tomu je výslovne udeliť povolenie ponechať pole prázdne, ak nie je v dokumente; Okrem toho sú tematické pojmy mapované do riadenej slovnej zásoby.
6. Ako by mal byť súhrn dokumentov vytvorený umelou inteligenciou umiestnený v historickom výskume?
- A) Ako spoľahlivý dôkaz, ktorý možno priamo citovať
- B) Ako objaviteľskú mapu, ktorá vás nasmeruje na skutočný dokument; Dôkaz je prevzatý z pôvodného dokumentu ✔
- C) Ako adekvátny zdroj, ktorý môže nahradiť samotný dokument
- D) Ako text, ktorý je možné použiť v štúdii bez toho, aby ste sa k dokumentu niekedy vracali
Popis: Súhrn je objaviteľská mapa, nie dôkaz. V tomto dokumente je niečo také, hovorí choď a pozri sa; Nepíše sa presne to, čo sa píše v dokumente. Ak má byť do štúdie zahrnutá udalosť, citát alebo údaje, musia byť doslovne prevzaté z pôvodného dokumentu.
7. Aký je správny spôsob, ako sa vyhnúť anachronizmom pri preklade historického dokumentu na zverejnenie?
- A) Nahradenie všetkých termínov z obdobia dnešným najbližším ekvivalentom
- B) Preniesť text čo najplynulejšie a najmodernejšie
- C) Ponechajte názvy období a názvy inštitúcií jedinečné a pridajte vysvetlenie ✔
- D) Prispôsobenie vlastných mien ich súčasnému používaniu
Vysvetlenie: Anachronizmus je nesprávny prenos prvkov z jedného obdobia do druhého. Zmena dobových názvov, názvov inštitúcií a osobných mien na dnešné výrazy prenesie čitateľa do sveta, ktorý do doby nepatrí. Správny spôsob je ponechať termín obdobia a pridať k nemu vysvetlenie.
8. Ako sa uistiť, že referencia archívu (názov fondu, číslo súboru) poskytnutá umelou inteligenciou je skutočná?
- A) Dôverovať referencii, pretože jej formát sa zdá byť správny
- B) Opätovným opýtaním sa AI, či je referencia správna
- C) Prijať odkaz ako pravdivý, pretože je presvedčivý a podrobný
- D) Osobným nájdením a overením referencie v archívnom katalógu alebo dôveryhodnom zdroji ✔
Popis: Umelá inteligencia môže produkovať odkazy, ktoré sú dokonalé vo forme, ale v skutočnosti neexistujú; Fiktívny odkaz je v rovnakej forme ako skutočný odkaz. Jediný spôsob, ako dokázať, že referencia existuje, je nájsť ju tam, kde sa nachádza pôvodný zdroj (archívny katalóg, knižnica).
9. Ako by sa mal vyhodnotiť vzor nájdený pri vykonávaní analýzy vzorov (NER, sieť, časová os) s umelou inteligenciou?
- A) Ako hypotéza, ktorú je potrebné v dokumente overiť; východiskový bod, nie výsledok ✔
- B) Ako definitívne zistenie, ktoré si nevyžaduje overenie
- C) Je to nesporný objektívny fakt, pretože je číselný.
- D) Ako výsledok, ktorý možno dať do priamej štúdie, pretože sa zistila umelá inteligencia
Vysvetlenie: Každý vzor je hypotéza, nie dôkaz. Entity by mali byť prepojené so zdrojom, rôzne hláskovanie (rovnakej osoby/miesta) by sa malo normalizovať so súhlasom človeka, čísla by sa mali spochybniť kvôli chýbajúcim údajom a skresleniu vzorky a udalosti bez dátumu by sa nemali chronologizovať.
10. Prečo si biografická/inštitucionálna história v pomôcke pri hľadaní vyžaduje osobitnú pozornosť?
- A) Táto časť je nedôležitá a môže byť zverejnená bez overenia
- B) Keďže umelá inteligencia môže do tejto sekcie pridávať vymyslené udalosti, nepravdivé dátumy a názvy, mala by sa spoliehať iba na overené zdroje ✔
- C) Umelá inteligencia sa dá bezpečne používať, pretože pri písaní histórie nerobí žiadne chyby.
- D) Túto rubriku vypĺňajú len bádatelia, archivára to nezaujíma
Popis: V sekcii histórie sa najčastejšie vkrádajú halucinácie: AI dokáže pri písaní plynulého textu zo všeobecných informácií o osobe alebo inštitúcii vložiť neexistujúce udalosti, falošné dátumy a vymyslené názvy. Táto časť by mala byť založená len na overených zdrojoch.
11. Ako by mala umelá inteligencia odpovedať na faktickú otázku výskumníka v referenčnej (konzultačnej) službe?
- A) Odpoveď na otázku by mala byť daná priamo a ako jednoznačná skutočnosť.
- B) Musí uviesť vierohodný dátum alebo meno a oznámiť ho výskumníkovi.
- C) Namiesto priameho uvádzania faktov by mal výskumníka nasmerovať na príslušnú zbierku a zdroj ✔
- D) Mala by poskytnúť úplnú odpoveď, aby výskumník nemusel ísť k zdroju.
Vysvetlenie: V referenčnej službe by umelá inteligencia nemala dávať priamu faktickú odpoveď, ale mala by nasmerovať výskumníka k zdroju. Pretože priama faktická odpoveď poskytnutá umelou inteligenciou môže byť vymyslená a výskumník si ju môže pomýliť so zdrojom. Namiesto „Odpoveď je toto“ by malo povedať „Pozrite sa na tieto dokumenty v tejto zbierke“.
12. Ktoré operácie sú prijateľné a nežiaduce pri spracovaní obrazu poškodeného dokumentu pomocou umelej inteligencie?
- A) Všetky druhy operácií sú bezplatné, vrátane dopĺňania chýbajúcich častí.
- B) Nemali by ste podnikať žiadne kroky, nikdy by ste sa nemali dotýkať obrázka
- C) Doplnenie chýbajúcich oddielov je najhodnotnejšou činnosťou, pretože dokument dopĺňa.
- D) Manipulácie s čitateľnosťou, ako je kontrast/šum, sú prijateľné; Je nepohodlné dopĺňať chýbajúce časti hádaním ✔
Vysvetlenie: Procesy, ktoré zlepšujú čitateľnosť (kontrast, osvetlenie, redukcia šumu), sú prijateľné, pretože nemenia obsah; Dopĺňanie chýbajúcich/nečitateľných častí hádaním je však rizikom výroby toho, čo v dokumente nie je, teda historického falzifikátu. Originál je zachovaný, transakcie sú zaznamenávané.
13. Čo je potrebné urobiť pred spracovaním archívneho dokumentu obsahujúceho citlivé osobné údaje?
- A) Kontrola súkromia a anonymizácia v prípade potreby alebo pomocou uzavretého/schváleného nástroja ✔
- B) Nahranie dokumentu priamo do verejného vozidla bez toho, aby ste o tom premýšľali
- C) Ignorovanie obáv o súkromie z hľadiska efektívnosti
- D) Prekonanie obmedzení prístupu z dôvodu efektívnosti
Zverejnenie: Nahrávanie dokumentov obsahujúcich citlivé údaje identifikujúce žijúce osoby (zdravie, náboženstvo, etnická príslušnosť, adresa) do verejných cloudových nástrojov môže byť vážnym porušením súkromia. Najprv by sa malo vykonať preverenie súkromia, v prípade potreby by sa mala použiť anonymizácia alebo uzavretý/schválený nástroj.
14. Aký je hlavný účel ľudského kontrolného bodu v projekte end-to-end archívu?
- A) Spomalenie práce umelej inteligencie a oddialenie projektu
- B) Aby sa zabránilo reťazeniu chyby (nesprávny dátum/meno) v jednej fáze do všetkých nasledujúcich fáz ✔
- C) Zvýšenie ľudskej práce a úplné vzdanie sa automatizácie
- D) Zabezpečiť, aby posledné slovo mala umelá inteligencia
Popis: Kontrolný bod človeka v každej fáze zaisťuje, že výstup AI je overený pred prechodom na ďalšiu fázu. Bez toho by sa chyba v prvej fáze (nesprávne prečítaný dátum) šírila v reťazci cez katalóg, vzor a sprievodcu. Včasná kontrola zabezpečí, že chyba bude opravená na jednom mieste.
15. Čo si vyžaduje transparentnosť a autentickosť pri využívaní umelej inteligencie v humanitných a spoločenských vedách?
- A) Udržiavanie používania umelej inteligencie v tajnosti a zabezpečenie toho, aby o tom nikto nevedel
- B) Prezentovať každý text vytvorený umelou inteligenciou ako svoj vlastný originálny nápad
- C) Čestne deklarovať používanie umelej inteligencie a neprezentovať jej výstup ako vlastnú originálnu prácu ✔
- D) Zdieľanie iba výsledkov bez vysvetľovania metód
Popis: Transparentnosť zahŕňa zaznamenanie toho, že prepis, metadáta alebo preklad boli vytvorené pomocou umelej inteligencie; Originalita si vyžaduje neprezentovať komentár vyprodukovaný umelou inteligenciou ako vlastný originálny nápad. Je to nevyhnutné pre overenie nasledujúcimi výskumníkmi a pre akademickú integritu.