Dobički:
- Sposobnost obdelave zbirke v 7-stopenjskem delovnem procesu, od etičnega pregleda do objave, s človeško kontrolno točko na vsaki stopnji
- Razumeti, kako zgodnje kontrolne točke preprečujejo, da bi se napaka (napačen datum/ime) razširila po celotni verigi
- Sposobnost uporabe načel ohranjanja glavne datoteke, ne varčevanja pri preverjanju in prijave uporabe AI v celovitem projektu
Prejšnje enote so pokrivale posamezne veščine: digitalizacijo, prepisovanje, metapodatke, skeniranje, prevajanje, preverjanje, analizo vzorcev, iskanje, ohranjanje in etiko. Ta zadnja enota združuje vse. Pravi arhivski projekt ne doživlja teh korakov ločeno, temveč kot medsebojno povezan potek dela. Tukaj bomo videli, kako lahko obdelate zbirko od začetka do konca s postopkom, ki ga podpira AI, vendar ga nadzoruje človek, korak za korakom in z nadzorno verigo.
Cilj je postaviti AI kot partnerja, ki "pospeši vsak korak, vendar nima zadnje besede pri nobenem koraku." Ko končate to enoto, vam bo ostala celostna metoda, ki neurejen kup dokumentov spremeni v za raziskave pripravljeno, preverjeno in etično čisto zbirko.
Scenarij: kar imamo
Recimo, da prejmete zbirko 250 dokumentov: nekaj natisnjenih (tiskana korespondenca, oglasi), nekaj rokopisov (pisma, zvezki), iz različnih datumov, nekateri vsebujejo občutljive osebne podatke. Cilj: digitalizirati, prepisati, katalogizirati in dati to zbirko na voljo raziskovalcem. Razčlenimo postopek na sedem stopenj.
Potek dela v sedmih korakih
1. faza – Ocena in etični pregled. Najprej spoznajte zbirko. Kateri dokumenti vsebujejo občutljive osebne podatke? Kakšen je status avtorskih pravic? Ali obstaja kulturna občutljivost? To skeniranje določa, kateri dokumenti se lahko dajo orodjem AI v oblaku in kateri bodo obdelani samo v zaprtem/odobrenem okolju. Če se ta stopnja preskoči, je celoten projekt v etični nevarnosti.
Faza 2 — Digitalizacija. Skenirajte dokumente v visoki ločljivosti (vsaj 300-400 DPI, dober kontrast). Ohranite izvirne (master) datoteke nedotaknjene; Vsa obdelava bo opravljena na kopijah.
Faza 3 — Ekstrakcija besedila. Uporabite OCR za tiskane dokumente in HTR za rokopis. Umetna inteligenca naj počisti neobdelane izpise z navodili za »varno lektoriranje« — samo optične napake/napake pri prepoznavanju, brez komentarja vsebine, neberljiva mesta [?]. Alternativno branje in paleografski nadzor za otomanski/rokopis.
Faza 4 – Metapodatki in katalogizacija. Za vsak dokument pripraviti standardne (Dublin Core/ISAD(G)) metapodatke; Z dovoljenjem "pusti neobstoječe polje prazno". Preslikajte izraze tem na nadzorovani seznam. Preverite datume in imena z dokumentacijo.
Stopnja 5 — Obogatitev in vzorčenje. Ekstrahiraj entitete (oseba/kraj/organizacija), normaliziraj, izdelaj odnose in orise časovnice. Preverite vsak vzorec v dokumentu; Ni izmišljenih povezav in kronologije.
Faza 6 — Orodja za dostop. Izdelajte osnutek pomoči pri iskanju za zbiranje; Razdelek o zgodovini temelji samo na preverjenih zapiskih. Jasno označite omejitve dostopa (zasebnost/avtorske pravice).
Faza 7 – Preverjanje, izjava in objava. Še zadnjič preverite kritična polja (datum, ime, citat, referenca). Prijavite uporabo AI. Strokovnjak poda končno odobritev; Zbirka je odprta za raziskovanje.
Namig: na vsako stopnjo postavite "človeško kontrolno točko": strokovnjak potrdi izhod umetne inteligence, preden preide na naslednjo stopnjo. Brez teh kontrolnih točk se bo napaka na prvi stopnji (napačno prebran datum) razširila po celotni verigi in sčasoma ušla v katalog, vzorec in vodnik.
Tabela krmilne verige
Oder
delo AI
človeška kontrolna točka
1. Etično preverjanje
Označevanje občutljivih podatkov
Odločitev o namestitvi
2. Digitalizacija
(izboljšava slike)
Kakovost, mojstrska zaščita
3. Ekstrakcija besedila
OCR/HTR + varen popravek
Ime/datum/preverjanje branja
4. Metapodatki
standardni osnutek
Potrditev polja, ujemanje izrazov
5. Vzorec
entiteta, razmerje, časovnica
Validacija v dokumentu
6. Orodje za dostop
Iskanje osnutka pomoči
Zgodovina in odobritev omejitev
7. Sprostitev
—
Končna odobritev, izjava
trije mini kovčki
1. primer – Ulovljena napaka v verigi. V enem projektu, v fazi 3, se je datum dokumenta glasil "1868" namesto "1888". Če kontrolna točka stopnje 3 ne bi odkrila te napake, bi bil datum razporejen po katalogu (4), časovnici (5) in vodniku (6). Zahvaljujoč kontrolni točki je bila napaka odpravljena na enem mestu. Nauk: zgodnje preverjanje prepreči širjenje napake po verigi navzgor.
Primer 2 – Etični pregled je rešil projekt. 18 od 250 dokumentov je vsebovalo občutljive podatke živih oseb. Etično preverjanje v fazi 1 je to označilo; teh 18 dokumentov je bilo obdelanih v zaprtem okolju, ostali s standardnimi orodji. Če bi bilo skeniranje preskočeno in bi bilo vse naloženo v oblak, bi bila resna kršitev. Lekcija: etični pregled je prvi korak, ne popravek, ki je dodan pozneje.
Primer 3 – Čas in trud. Z uporabo tradicionalne metode bi trajalo približno 8-10 mesecev, da bi v celoti obdelali zbirko 250 dokumentov. S potekom dela kontrolnih točk, ki ga podpira umetna inteligenca, je bil postopek skrajšan na približno 3 mesece. Toda prihranki niso nastali zaradi tega, ker je "umetna inteligenca naredila vse", ampak ker je "umetna inteligenca opravila mehansko delo, osredotočeno na človeško preverjanje." Čas, namenjen preverjanju, se ni zmanjšal; Čas, namenjen mehanskemu delu, se je zmanjšal.
Štiri predloge za kopiranje
1) Začetni načrt projekta:
Imam zbirko [število] dokumentov: [mešanica tiska/rokopisa], [obdobje], od katerih nekateri morda vsebujejo občutljive podatke. Ustvarite načrt poteka dela v 7 korakih za digitalizacijo in katalogizacijo te zbirke: na vsaki stopnji določite nalogo AI in kontrolno točko ČLOVEK. Na prvo mesto postavite etični pregled.
2) Kontrolni seznam za prehod med stopnjami:
Končal sem stopnjo [stage name]. Izdelajte kontrolni seznam kritičnih točk, ki jih moram preveriti, preden preidem na naslednjo stopnjo: katera dejstva (datum/ime/referenca) je treba preveriti, katere napake se lahko širijo po verigi navzgor? Imam končno odobritev; Daš mi kontrolni seznam.
3) Kontrola kakovosti od konca do konca:
Spodaj so vse plasti obdelanega dokumenta: prepis, metapodatki, ekstrahirana sredstva. NEPOJMOVI SLIK med plastmi: ali se datum v prepisu ujema z metapodatki, ali entitete dejansko obstajajo v besedilu? Uvedba popravka; Ustvarite seznam nedoslednosti. Sloji: [tukaj]
4) Zaključek projekta in izjava:
V tem zbirateljskem projektu sem uporabil AI v naslednjih fazah: [seznam]. Za projektno dokumentacijo: (1) katera podpora umetne inteligence je bila uporabljena na kateri stopnji, (2) kako je bilo opravljeno človeško preverjanje, (3) kakšne so omejitve/omejitve – napišite iskreno zaključno opombo in osnutek izjave o uporabi umetne inteligence, ki to vključuje.
Šibek poziv/močan poziv
Šibko:
To zbirko temeljito obdelajte z AI in jo pripravite za raziskovanje.
Eno samo navodilo »naredi karkoli« obide etični pregled, kontrolne točke in preverjanje; napake se širijo po verigi.
Močno:
Nastavite 7-stopenjski potek dela za to zbirko, s človeško kontrolno točko na vsaki stopnji. Naj bo prva stopnja pregled etike/zasebnosti. Izhod, ki ga ustvari AI na vsaki stopnji, bo preverjen pred prehodom na naslednjo stopnjo; označi kritična dejstva (datum/ime/referenca). V nobeni fazi nima AI zadnje besede.
Razlika: postopna struktura, etična prednost, kontrolne točke in načelo »ljudje imajo zadnjo besedo« naredijo celoten projekt varen in branljiv.
Pogoste napake
- Pustimo etično preverjanje za konec. Pregled zasebnosti/avtorskih pravic je prvi korak; Če je dodan pozneje, je do kršitve že prišlo.
- Mimo kontrolnih točk. Napaka, ki ostane nepreverjena, se širi po celotni verigi.
- Ne ščiti glavne datoteke. Če izvirnik ne ostane nedotaknjen, postane vračilo nemogoče.
- Prihranek pri preverjanju. AI skrajša mehansko delo; Če se čas preverjanja skrajša, se kakovost zmanjša.
- Brez izjave o uporabi AI. Preglednost je del znanstvene verodostojnosti zbirke.
Če povzamem
Projekt arhiviranja od konca do konca povezuje posamezne veščine v verigo nadzora: etično skeniranje, digitalizacija, ekstrakcija besedila, metapodatki, vzorec, orodje za iskanje in objava. Na vsaki stopnji AI pospeši mehansko delo; Na vsaki stopnji ima zadnjo besedo človeška kontrolna točka. Etično preverjanje je prva stopnja, glavna datoteka je zaščitena, napake se odkrijejo zgodaj, da se ne razširijo po verigi, uporaba umetne inteligence pa je pošteno objavljena. Prihranki ne izvirajo iz umetne inteligence, ki naredi vse, ampak iz tega, da je človek osvobojen mehanskega dela in se osredotoča na preverjanje. AI pospešuje; Človek zagotavlja točnost in celovitost zgodovine.
Aplikacijska naloga
Izberite majhno zbirko (10-20 dokumentov; lastno gradivo ali vzorčni komplet). Ustvarite potek dela v 7 korakih s predlogo »zagonski načrt projekta«. Skozi ta tok poženite vsaj dva dokumenta: etično skeniranje, ekstrakcijo besedila, metapodatke in plast vzorca. Vsako stopnjo preverite s »kontrolnim seznamom prehodov med stopnjami«. Na koncu dokumentirajte svojo uporabo umetne inteligence s predlogo »zaključek projekta in izjava«. Upoštevajte, katere napake so bile odkrite na zgodnjih kontrolnih točkah.
kontrolni seznam
- [ ] Na prvi stopnji sem opravil pregled etike/zasebnosti.
- [ ] Glavne datoteke sem ohranil nedotaknjene.
- [ ] Na vsako stopnjo sem postavil človeško kontrolno točko.
- [ ] Preveril sem kritična dejstva, preden so bila razširjena po verigi.
- [ ] Ob zaključku projekta sem prijavil uporabo AI.
Modulni izpit
1. Kakšno je najprimernejše pozicioniranje umetne inteligence v zgodovini in arhiviranju?
- A) AI je orodje za povzetke, urejanje in pisanje; Komentar, kritika vira in končna odgovornost pripada strokovnjaku ✔
- B) Umetna inteligenca lahko sama odloča o pristnosti in pomenu dokumenta, kot zgodovinar
- C) Umetna inteligenca deluje le pri prevajanju besedila, nima nobene zveze z drugimi arhivskimi nalogami
- D) Ker je umetna inteligenca vedno bolj nepristranska od ljudi, je treba zgodovinsko interpretacijo prepustiti njej.
Opis: Umetna inteligenca; Je pomočnik, ki ureja, skenira, prevaja in izdeluje osnutke besedila. Kritika vira, interpretacija, vzročno-posledična ugotovitev in končna odločitev so v pristojnosti strokovnjaka; Nepreverjen rezultat lahko vodi do izmišljenega vira, napačnega datuma ali anahronizma.
2. Kaj je halucinacija, ki jo ustvari umetna inteligenca v zgodovinskih raziskavah?
- A) Umetna inteligenca zelo počasi obdela dokument
- B) Umetna inteligenca si izmisli neobstoječ vir, citat ali dogodek kot resničnega ✔
- C) Dokument je fizično poškodovan
- D) Arhivski katalog ni posodobljen
Pojasnilo: Halucinacija je, ko umetna inteligenca samozavestno izmišlja informacije, vire, citate ali dogodke, ki dejansko ne obstajajo. Čeprav je njegova oblika videti popolna, njegova vsebina ni resnična; Zato mora biti v vsakem referenčnem katalogu vsak citat preverjen pri izvornem viru.
3. Kateri je najboljši pristop, da umetna inteligenca popravi izpis OCR?
- A) Zahteva, da je besedilo tekoče in lepo ter da logično dopolni manjkajoče dele.
- B) Omogoča, da popravi vse številke in datume glede na kontekst
- C) Prosite ga, naj popravi samo napake pri optičnem prepoznavanju, pusti neberljiva področja [?] in ne spremeni številk/datumov ✔
- D) Učenca prosite, naj neberljive besede zapolni z najverjetnejšo ugibanje.
Pojasnilo: Zlato pravilo pri popravljanju OCR je popravljanje samo očitnih napak pri optičnem prepoznavanju (kot je rn v m, l v 1); netolmačenje ali dopolnjevanje vsebine besedila. Neberljiva območja so označena z [?]; Številke in datumi se ne spreminjajo, preverjajo se s sliko.
4. Kaj bi morali zahtevati od umetne inteligence, ko gre za branje besede, katere samoglasnik ni zapisan v otomanskem besedilu?
- A) Daj eno samo natančno branje in tako pospeši delo
- B) Izbira besede, ki bo najbolj tekoče pomen in zapolnitev praznin
- C) Dopolnjevanje neberljivih delov iz lastnega splošnega znanja.
- D) Ponudba možnih alternativ branja in označevanje dvoumnih področij namesto vsiljevanja dokončnega branja ✔
Pojasnilo: V osmanski turščini se kratki samoglasniki večinoma ne pišejo; En sam samoglasnik/črka (abul in kabul, wali in vali) popolnoma spremeni pomen. Zato je treba namesto vsiljevanja dokončnega branja vprašati o možnih alternativah, ohraniti neberljiva območja in končno odločitev prepustiti paleografu.
5. Kateri je najučinkovitejši način za preprečevanje halucinacij, če AI ustvari osnutek metapodatkov (kataloški zapis)?
- A) Izrecno dovolite, da pustite to polje prazno, če ni vključeno v dokument ✔
- B) Zahteva, da se vsako polje izpolni in ne sme ostati nepopolno.
- C) Ocenjevanje datuma na podlagi vsebine nedatiranih dokumentov
- D) Omogočanje umetni inteligenci, da ustvari referenčno kodo
Opis: pritisk prisili AI, da sestavi dokument tako, da ugiba datum ali ustvarjalca, ki ni v dokumentu. Najmočnejši ščit proti temu je izrecna odobritev dovoljenja, da pustite polje prazno, če ga ni v dokumentu; Poleg tega so tematski izrazi preslikani v nadzorovani besednjak.
6. Kako naj se povzetek dokumenta, ki ga izdela umetna inteligenca, umesti v zgodovinsko raziskavo?
- A) Kot zanesljiv dokaz, ki ga je mogoče neposredno navesti
- B) Kot zemljevid odkrivanja, ki vas usmeri do dejanskega dokumenta; Dokazi so povzeti iz originalnega dokumenta ✔
- C) Kot ustrezen vir, ki lahko nadomesti sam dokument
- D) Kot besedilo, ki ga je mogoče uporabiti v študiji, ne da bi se kdaj vrnili k dokumentu
Opis: Povzetek je zemljevid odkritja, ne dokaz. Nekaj takega je v tem dokumentu, piše pojdi in poglej; Ne piše točno tega, kar piše v dokumentu. Če želimo dogodek, citat ali podatke vključiti v študijo, jih je treba vzeti dobesedno iz izvirnega dokumenta.
7. Kakšen je pravi način, da se izognemo anahronizmom pri prevajanju zgodovinskega dokumenta za objavo?
- A) Zamenjava vseh izrazov obdobja z današnjim najbližjim ekvivalentom
- B) Besedilo posredovati čim bolj tekoče in sodobno
- C) Pustite naslove obdobij in imena ustanov edinstvene ter dodajte razlago ✔
- D) Prilagajanje lastnih imen njihovi trenutni rabi
Pojasnilo: anahronizem je napačen prenos elementov iz enega obdobja v drugo obdobje. Spreminjanje naslovov obdobij, imen ustanov in osebnih imen z današnjimi izrazi bralca popelje v svet, ki ne pripada temu obdobju. Pravilen način je, da izraz obdobja obdržite in zraven dodate razlago.
8. Kako se prepričati, da je arhivska referenca (ime fonda, številka datoteke), ki jo poda umetna inteligenca, resnična?
- A) Zaupanje sklicu, ker se njegova oblika zdi pravilna
- B) S ponovnim vprašanjem AI, če je sklic pravilen
- C) Sprejemanje reference kot resnične, ker je prepričljiva in podrobna
- D) Z osebnim iskanjem in preverjanjem reference v arhivskem katalogu ali zanesljivem viru ✔
Opis: Umetna inteligenca lahko ustvari reference, ki so po obliki popolne, a dejansko ne obstajajo; Fiktivna referenca je v enaki obliki kot prava referenca. Edini način, da dokažete, da referenca obstaja, je, da jo poiščete tam, kjer se nahaja izvirni vir (arhivski katalog, knjižnica).
9. Kako je treba ovrednotiti vzorec, najden pri izvajanju analize vzorcev (NER, omrežje, časovnica) z umetno inteligenco?
- A) Kot hipoteza, ki jo je treba preveriti v dokumentu; izhodišče, ne rezultat ✔
- B) Kot dokončna ugotovitev, ki ne zahteva preverjanja
- C) Je nesporno objektivno dejstvo, ker je številčno.
- D) Kot rezultat, ki ga je mogoče vključiti v neposredno študijo, ker je našel umetno inteligenco
Pojasnilo: Vsak vzorec je hipoteza, ne dokaz. Entitete je treba povezati z virom, različno črkovanje (iste osebe/kraja) je treba normalizirati s človeško odobritvijo, številke je treba dvomiti glede manjkajočih podatkov in pristranskosti vzorčenja, nedatiranih dogodkov pa ne bi smeli kronologizirati.
10. Zakaj oddelek z biografsko/institucionalno zgodovino v iskalniku zahteva posebno pozornost?
- A) Ta razdelek je nepomemben in se lahko objavi brez preverjanja
- B) Ker lahko umetna inteligenca v ta razdelek doda izmišljene dogodke, lažne datume in naslove, se mora zanašati samo na preverjene vire ✔
- C) Umetno inteligenco lahko varno uporabljamo, ker ne dela napak pri pisanju zgodovine.
- D) To rubriko polnijo samo raziskovalci, arhivarja ne zanima
Opis: Oddelek z zgodovino je kraj, kjer se najpogosteje prikradejo halucinacije: AI lahko med pisanjem tekočega besedila iz splošnih informacij o osebi ali ustanovi vstavi neobstoječe dogodke, lažne datume in izmišljene naslove. Ta razdelek mora temeljiti samo na preverjenih virih.
11. Kako naj umetna inteligenca odgovori raziskovalcu na vprašanje o dejstvih v referenčni (svetovalni) službi?
- A) Odgovor na vprašanje naj bo podan neposredno in kot dokončno dejstvo.
- B) Navesti mora verjeten datum ali ime in ga posredovati raziskovalcu.
- C) Namesto neposrednega podajanja dejstev bi moralo raziskovalca usmeriti k ustrezni zbirki in viru ✔
- D) Zagotoviti mora popoln odgovor, tako da raziskovalcu ni treba iti do vira.
Pojasnilo: V referenčni službi umetna inteligenca ne bi smela dajati neposrednega odgovora na dejstva, ampak bi morala raziskovalca usmeriti k viru. Ker je neposredni dejanski odgovor, ki ga poda umetna inteligenca, lahko izmišljen in ga raziskovalec lahko zamenja za vir. Namesto "Odgovor je to", bi moralo biti "Oglejte si te dokumente v tej zbirki".
12. Katere operacije so sprejemljive in katere sporne pri obdelavi poškodovane slike dokumenta z umetno inteligenco?
- A) Vse vrste operacij so brezplačne, vključno z izpolnjevanjem manjkajočih delov.
- B) Ne ukrepajte, slike se ne dotikajte
- C) Izpolnjevanje manjkajočih razdelkov je najbolj dragoceno dejanje, saj dopolni dokument.
- D) Sprejemljive so manipulacije berljivosti, kot je kontrast/šum; Manjkajoče dele je neprijetno dopolnjevati z ugibanji ✔
Pojasnilo: Postopki, ki izboljšajo berljivost (kontrast, osvetlitev, zmanjšanje šuma), so sprejemljivi, ker ne spremenijo vsebine; Vendar pa je zapolnjevanje manjkajočih/neberljivih delov z ugibanjem tveganje, da nastane tisto, česar v dokumentu ni, to je zgodovinsko ponarejanje. Original je ohranjen, transakcije evidentirane.
13. Kaj je potrebno narediti pred obdelavo arhivskega dokumenta, ki vsebuje občutljive osebne podatke?
- A) Pregledovanje zasebnosti in anonimizacija, če je potrebno ali uporaba zaprtega/odobrenega orodja ✔
- B) Nalaganje dokumenta neposredno v javno vozilo, ne da bi o tem sploh razmišljali
- C) Ignoriranje skrbi glede zasebnosti zaradi učinkovitosti
- D) Premagovanje omejitev dostopa zaradi učinkovitosti
Razkritje: nalaganje dokumentov, ki vsebujejo občutljive podatke, ki identificirajo živeče osebe (zdravje, vera, etnična pripadnost, naslov), v javna orodja v oblaku je lahko resna kršitev zasebnosti. Najprej je treba opraviti pregled zasebnosti, po potrebi uporabiti anonimizacijo ali zaprto/odobreno orodje.
14. Kaj je glavni namen človeške kontrolne točke v projektu arhiviranja od konca do konca?
- A) Upočasnjevanje dela umetne inteligence in zavlačevanje projekta
- B) Preprečiti, da bi se napaka (napačen datum/ime) v eni stopnji verižila na vse naslednje stopnje ✔
- C) Povečanje človeškega dela in popolna opustitev avtomatizacije
- D) Zagotavljanje, da ima umetna inteligenca zadnjo besedo
Opis: Človeška kontrolna točka na vsaki stopnji zagotavlja, da je izhod umetne inteligence preverjen, preden se premaknete na naslednjo stopnjo. Brez tega bi se napaka na prvi stopnji (napačno prebran datum) širila po verigi navzgor po katalogu, vzorcu in vodniku. Zgodnje preverjanje zagotavlja, da se napaka odpravi na enem mestu.
15. Kaj zahtevata preglednost in avtentičnost pri uporabi umetne inteligence v humanistiki in družboslovju?
- A) Ohranjanje uporabe umetne inteligence v tajnosti in zagotavljanje, da nihče ne ve
- B) Vsako besedilo, ki ga ustvari umetna inteligenca, predstaviti kot lastno izvirno idejo
- C) Iskreno izjaviti uporabo umetne inteligence in ne predstavljati njenih rezultatov kot lastno izvirno delo ✔
- D) Delitev le rezultatov brez razlage metod
Opis: Preglednost vključuje zapis, da je bil prepis, metapodatek ali prevod izdelan s pomočjo umetne inteligence; Izvirnost zahteva, da komentarja, ki ga je ustvarila umetna inteligenca, ne predstavljamo kot lastno izvirno idejo. To je bistveno za preverjanje s strani nadaljnjih raziskovalcev in za akademsko integriteto.