Enota 1 / 12

Uvod v umetno inteligenco v zgodovini in arhiviranju: vloge, meje, validacija in etika

Dobički:

  • Znati razlikovati, kje umetna inteligenca prihrani čas pri zgodovinskem in arhivskem delu (prepis, urejanje, skeniranje, osnutek) in kje so interpretacija, kritika vira in končna odločitev prepuščeni strokovnjaku, odvisno od stopnje tveganja.
  • Sposobnost uporabe discipline preverjanja proti halucinacijam s povezovanjem vsakega izhoda z virom, navzkrižno potrditvijo in filtriranjem za anahronizem.
  • Razumeti, zakaj je treba zaupnost, avtorske pravice in kulturno občutljivost upoštevati v zgodovinskem in arhivskem gradivu že od samega začetka.

Ko zgodovinar ali arhivar sede za svojo mizo, je pred njim pogosto gromozanski kup: porumeneli zvezki, mikrofilmani časopisi, na tisoče digitalnih fotografij, ročno napisana pisma, uradna korespondenca, zemljiški izpisi. Branje, organiziranje, definiranje in osmišljanje tega kupa je delo, ki traja leta. Umetna inteligenca (na kratko AI; računalniški sistemi, ki se učijo vzorcev, ustvarjajo in razvrščajo besedilo iz velikih množic besedila in slik) lahko dramatično pospeši mehanski in ponavljajoči se del tega dela. Toda ravno na področju, kot sta zgodovina in arhiviranje, ki temelji na dokazih, virih in točnosti, je treba že od začetka vedeti, kje je umetna inteligenca koristna in kje nevarna.

Ta enota je kompas celotnega modula. Tukaj bomo razpravljali o tem, kje umetna inteligenca prihrani čas pri zgodovinskem in arhivskem delu, kje je presoja človeškega strokovnjaka nepogrešljiva, zakaj je treba vsak rezultat preveriti in kakšne so posebne etične meje tega področja.

Pravilno pozicioniranje AI: pomočnik, ne odločevalec

Najosnovnejše pravilo je naslednje: AI je pomočnik, ne zgodovinar ali arhivar. AI; Je hiter pomočnik, ki prepisuje dokument, povzema zbirko, prevaja besedilo, predlaga metapodatke za zbirko in označuje vzorce. Toda odločitve, ki zahtevajo presojo, razlago in odgovornost, kot so "ali je ta dokument resničen", "kaj ta dogodek pomeni", "ali je ta vir zanesljiv", "kako naj bo ta zbirka organizirana", pripadajo strokovnjaku.

Pojasnimo to razlikovanje s tabelo:

poslovni tip

Je AI močan?

Čigava odgovornost?

Pretvarjanje tiskanega besedila v strojno besedilo (OCR)

Da, zelo hitro

človeška bitja pravilna

Osnutek prepisa rokopisa

Delno je stopnja napake visoka

Ljudje bodo to zagotovo popravili

Povzemite/skenirajte na tisoče dokumentov

ja

Človek se spusti k izviru

Oris metapodatkov (datum, lokacija, zadeva).

ja

človek odobri

Odločanje o verodostojnosti dokumenta

št

Samo strokovnjak

Zgodovinska interpretacija in ugotavljanje vzroka in posledice

št

samo zgodovinar

Ocenite verodostojnost vira

št

Samo strokovnjak

Če povzamem to sliko v enem stavku: AI pripravi podatke, strokovnjak jih razume in sprejme odločitev.

Zakaj je preverjanje nujno: halucinacija in anahronizem

Največja nevarnost uporabe AI v humanistiki in družboslovju so halucinacije. Halucinacija je, ko AI samozavestno izmisli informacijo, vir ali citat, ki dejansko ne obstaja. Namesto da bi rekel "ne vem", AI skuša zapolniti praznino z izmišljenim odgovorom, ki se zdi verjeten. V zgodovini je to usodno: sklicevanje na neobstoječi dokument, zlagana zgodovina, dejansko neizgovorjena beseda, dogodek, ki se ni zgodil.

Druga velika nevarnost je anahronizem. Anahronizem je napačna umestitev elementa enega obdobja (besede, institucije, tehnologije, koncepta) v drugo obdobje. Ker je umetna inteligenca usposobljena za današnji jezik in koncepte, je nagnjena k razlagi preteklosti skozi današnje leče in prenašanju neobstoječih institucij ali izrazov v preteklost. Na primer, ko povzema dokument iz 16. stoletja, lahko uporabi naslov ali upravno enoto, ki takrat še ni obstajala.

Pozor: vsak datum, ime, številka, citat in vir, ki ga ustvari AI, je trditev in ne dejstvo, dokler tega neodvisno preverite. "AI je tako rekel" ni vir v zgodovinopisju; je le namig, ki vas usmeri do pravega vira.

Disciplina preverjanja: trije koraki

Predlagajmo navado preverjanja, ki jo bomo ponavljali v tem modulu:

1. Povežite se z virom. Vsako večjo trditev o AI temelji na izvirnem dokumentu, arhivski referenci ali zanesljivi publikaciji. Ne uporabljajte trditve, ki nima vira.

2. Navzkrižna potrditev. Za kritično dejstvo (datum, ime, dogodek) se obrnite na vsaj dva neodvisna vira. Ali je povzetek AI enak tistemu, kar pravi dejanski dokument?

3. Filtrirajte skozi anahronizem in doslednost. Ali obstaja izraz, ki ne ustreza obdobju, nemogoč datum, nedosledno ime v izpisu? Vprašajte "Ali ustreza temu obdobju?" s strokovnega vidika.

trije mini kovčki

Primer 1 – Izdelana arhivska referenca. Podiplomski študent je prosil AI za "arhivske vire" o temi. YZ je vrnil 6 arhivskih referenc, katerih oblika se je zdela popolna: ime sklada, številka datoteke, datum. Ko je študent brskal po arhivskem katalogu, je ugotovil, da 4 od 6 referenc sploh ne obstajajo. Preostala 2 sta imela napačne številke. Lekcija: Nobene reference, ki jo ustvari AI, ni mogoče uporabiti brez preverjanja v katalogu.

Primer 2 – OCR zmanjšan s 40 ur na 6 ur. Občinski arhiv je digitaliziral 3200 strani natisnjenih svetniških zapisnikov med letoma 1950 in 1970. Ročno prepisovanje je bilo ocenjeno na 40 delovnih dni. Z OCR je neobdelano besedilo izšlo v nekaj minutah; Uslužbenec je besedilo popravil in preveril v 6 delovnih dneh. Umetna inteligenca je zmanjšala mehansko delo za 85 %, vendar je končno branje in urejanje ostalo pri človeku.

Primer 3 – Anahronistični povzetek. Arhivist je YZ naročil, da povzame zapis o ustanovitvi iz 18. stoletja. Povzetek je bil tekoč, vendar je uporabil sodoben administrativni izraz, ki ga v dokumentu ni in ne sodi v obdobje. Če se arhivar ne bi spustil do izvirnega dokumenta, bi bil ta anahronizem zapisan v kataloškem zapisu. Nauk: povzetek vedno primerjamo z glavnim dokumentom.

Štiri predloge za kopiranje

1) Odpiranje, ki določa vloge in meje:

Vaša vloga: pomočnik pri delu v zgodovini in arhivih. Vaše naloge vključujejo urejanje besedila, ustvarjanje obrisov in označevanje vzorcev. Stroga pravila: (1) Zanašajte se samo na besedilo, ki sem vam ga dal, ne dodajajte dejstev, datumov ali virov iz lastnega "spomina". (2) Če niste prepričani, napišite "negotovo", ne izmišljujte si. (3) Ne postavljajte trditev, ki nimajo vira. Potrdite, če razumete, potem bom dal besedilo.

2) Navodilo proti halucinacijam:

Povzemite spodnje besedilo. Pravila: ne dodajajte imen, datumov, krajev ali številk, ki niso JASNO omenjene v besedilu. Nikar ne dodajajte "verjetno" informacij, ki jih v besedilu ni. Če informacija ni vključena v besedilo, napišite "ni navedena v besedilu". Besedilo: [tukaj]

3) Preverjanje anahronizma:

Preglejte spodnji osnutek povzetka [seminarskega] dela. Označite izraze, institucije, naslove in koncepte, ki morda ne spadajo v to obdobje. Za vsako na kratko napišite, zakaj je sumljiva. Ne dajajte končne sodbe; Naštejte samo točke, ki jih mora preveriti človeški strokovnjak. Osnutek: [tukaj]

4) Razčlenjevalnik izvornih trditev:

Vsak stavek v naslednjem besedilu razdelite na dve kategoriji: (A) Dejstvo, zapisano neposredno v viru, (B) Razlaga/sklepanje. Vsako izjavo, katere vir ni jasen, označite tudi kot "potrebno preverjanje". Besedilo: [tukaj]

Šibek poziv/močan poziv

Šibko:

Povej mi o tem otomanskem dokumentu.

Ta poziv vabi AI, da spregovori iz lastnega "spomina", doda izmišljene podrobnosti in anahronizem.

Močno:

Vaša vloga je pomočnik zgodovine. SAMO na podlagi dokumenta sem prilepil spodnji prepis: (1) navedite osebe, kraje in datume, omenjene v dokumentu, (2) uganite vrsto dokumenta, vendar lahko rečete "Nisem prepričan", (3) dodajte vse informacije, ki jih ni v besedilu, (4) označite sumljiva/neberljiva področja z [?]. Dokument: [tukaj]

Razlika je jasna: vloga, odvisnost od enega vira, prepoved izdelave, dovoljenje za označevanje dvoumnosti in jasna izhodna struktura naredijo izhod zanesljiv.

Etika, zasebnost in kulturna občutljivost

Zgodovinsko in arhivsko gradivo ni nedolžen kup besedila. Vsebuje lahko osebne podatke ljudi (civilne evidence, zdravstvene kartoteke, sodne dokumente), občutljive spomine skupnosti, avtorsko zaščitena dela in kulturno občutljivo gradivo. Nekaj načel:

  • Zasebnost: nalaganje občutljivih dokumentov, ki omogočajo identifikacijo živih oseb (osebnih podatkov), v javna orodja AI bi lahko pomenilo pravno in etično kršitev. Upoštevajte politiko podatkov vaše ustanove in ustrezno zakonodajo.
  • Avtorske pravice: ni vsak dokument, ki ga digitalizirate, v javni domeni. Upoštevajte pravice, preden jih daste AI.
  • Kulturna občutljivost: Nekatere skupnosti imajo besedo pri uporabi njihovega zgodovinskega gradiva. "Učinkovit" predlog AI ne more prezreti občutljivosti skupnosti.
  • Transparentnost: zabeležite, da je bil prepis ali metapodatki, ustvarjeni z umetno inteligenco, izdelani s pomočjo umetne inteligence. To je potrebno, da lahko nadaljnji raziskovalci preverijo.
Namig: Preden naložite dokument v orodje AI v oblaku, postavite eno vprašanje: "Komu bi škodilo, če bi se vsebina tega dokumenta pojavila na internetu?" Če je odgovor "nihče", najprej poiščite odobritev podjetja in varna orodja.

Pogoste napake

  • Zamenjujem AI z zgodovinarjem. AI ne razlaga ali odloča; so pripravljeni. Smisel in odgovornost sta na tebi.
  • Uporaba izhoda brez preverjanja. Vsak datum, ime, citat in sklic je trditev; To ni dejstvo, dokler ga ne potrdi vir.
  • Zanašanje na izmišljene vire. AI lahko ustvari verodostojne, a neobstoječe reference; Poiščite v katalogu.
  • Spregleda anahronizem. Filtrirajte rezultate, ki opisujejo preteklost v današnjem jeziku s perspektivo obdobja.
  • Naključno nalaganje občutljivih dokumentov. Že od začetka upoštevajte osebne podatke, avtorske pravice in kulturno občutljivost.

Če povzamem

V zgodovini in arhiviranju je AI močan pomočnik, ki izjemno pospeši mehansko in ponavljajoče se delo (prepisovanje, urejanje, skeniranje, priprava metapodatkov). Toda ravno na tem področju dokazov sta halucinacije in anahronizem resnični nevarnosti. Povežite vsak izhod z virom, navzkrižno preverjanje, periodični filter; Razlago, odločitev in končno odgovornost vedno zadrži zase. Upoštevajte zasebnost, avtorske pravice in kulturno občutljivost že od prvega dne. S to disciplino postane umetna inteligenca orodje, ki pospešuje zgodovinske raziskave, ne pa jih upočasnjuje.

Aplikacijska naloga

Izberite zgodovinski dokument, ki ga imate, tiskan ali digitalen. Najprej postavite AI s predlogo »Odprta nastavitev vloge in meje«. Nato uporabite "navodilo proti halucinacijam", ko imate povzetek dokumenta. Označite izhod z "source-claim parser" in primerjajte vsako izjavo z oznako "must be verified" z dejanskim dokumentom. Upoštevajte, koliko točk je dodal ali popačil AI.

kontrolni seznam

  • [ ] AI sem postavil kot pomočnika, ne kot odločevalca.
  • [ ] Hotel sem samo, da temelji na viru, ki sem ga navedel.
  • [ ] Neodvisno sem preveril vsak datum, ime in sklic.
  • [ ] Izhod sem filtriral zaradi anahronizmov.
  • [ ] Pri občutljivih dokumentih sem opazil zaupnost, avtorske pravice in kulturno občutljivost.