Vienība 1 / 12

Ievads mākslīgajā intelektā vēsturē un arhivēšanā: lomas, robežas, apstiprināšana un ētika

Ieguvumi:

  • Spēja atšķirt, kur mākslīgais intelekts ietaupa laiku vēstures un arhīva darbā (transkripcija, rediģēšana, skenēšana, melnraksts) un kur interpretācija, avotu kritika un galīgais lēmums ir atstāts eksperta ziņā atkarībā no riska līmeņa.
  • Spēja piemērot pārbaudes disciplīnu pret halucinācijām, savienojot katru izvadi ar avotu, savstarpēji apstiprinot to un filtrējot to anahronismam.
  • Lai saprastu, kāpēc jau no paša sākuma vēstures un arhīvu materiālos būtu jāņem vērā konfidencialitāte, autortiesības un kultūras sensitivitāte.

Kad vēsturnieks vai arhivārs sēž pie rakstāmgalda, viņa priekšā bieži vien ir milzīga kaudze: nodzeltējušas piezīmju grāmatiņas, mikrofilmētas avīzes, tūkstošiem digitālo fotogrāfiju, ar roku rakstītas vēstules, oficiāla sarakste, zemes ieraksti. Šīs kaudzes lasīšana, organizēšana, definēšana un jēgas radīšana ir darbs, kas prasa gadiem. Mākslīgais intelekts (saīsināti AI; datorsistēmas, kas apgūst modeļus, ģenerē un klasificē tekstu no lielām teksta un attēlu masām) var ievērojami paātrināt šī darba mehānisko un atkārtoto daļu. Bet tieši tādā jomā kā vēsture un arhivēšana, kas balstās uz pierādījumiem, avotiem un precizitāti, jums jau no paša sākuma ir jāzina, kur AI ir noderīgs un kur tas ir bīstams.

Šī ierīce ir visa moduļa kompass. Šeit mēs apspriedīsim, kur mākslīgais intelekts ietaupa laiku vēsturē un arhīvu darbā, kur cilvēka eksperta spriedums ir neaizstājams, kāpēc katrs rezultāts ir jāpārbauda, ​​un šīs jomas īpašās ētiskās robežas.

Pareiza AI pozicionēšana: palīgs, nevis lēmumu pieņēmējs

Visvienkāršākais noteikums ir šāds: AI ir palīgs, nevis vēsturnieks vai arhivārs. AI; Tas ir ātrs palīgs, kas pārraksta dokumentu, apkopo kolekciju, tulko tekstu, iesaka kolekcijas metadatus un atzīmē modeļus. Bet lēmumi, kas prasa spriedumu, interpretāciju un atbildību, piemēram, "vai šis dokuments ir īsts", "ko šis notikums nozīmē", "vai šis avots ir uzticams", "kā šī kolekcija jāorganizē" pieder ekspertam.

Noskaidrosim šo atšķirību ar tabulu:

biznesa veids

Vai AI ir spēcīgs?

Kura atbildība?

Drukāta teksta konvertēšana mašīnas tekstā (OCR)

Jā, ļoti ātri

cilvēkiem ir taisnība

Manuskripta transkripcijas melnraksts

Daļēji kļūdas robeža ir augsta

Cilvēki noteikti to salabos

Apkopojiet/skenējiet tūkstošiem dokumentu

Cilvēks nonāk līdz avotam

Metadatu (datums, atrašanās vieta, tēma) izklāsts

cilvēks apstiprina

Lēmuma pieņemšana par dokumenta autentiskumu

Tikai eksperts

Vēsturiskā interpretācija un cēloņu un seku noteikšana

tikai vēsturnieks

Novērtējiet avota uzticamību

Tikai eksperts

Apkopojot šo attēlu vienā teikumā: AI sagatavo datus, ekspertam ir jēga un viņš pieņem lēmumu.

Kāpēc pārbaude ir būtiska: halucinācijas un anakronisms

Lielākais drauds AI lietošanai humanitārajās un sociālajās zinātnēs ir halucinācijas. Halucinācijas ir tad, kad AI pārliecinoši izdomā informāciju, avotu vai citātu, kas patiesībā neeksistē. Tā vietā, lai teiktu “Es nezinu”, AI mēdz aizpildīt tukšo vietu ar izdomātu atbildi, kas šķiet ticama. Vēsturē tas ir liktenīgs: atsauce uz neesošu dokumentu, safabricēta vēsture, faktiski neizrunāts vārds, notikums, kas nenotika.

Otrs lielais apdraudējums ir anahronisms. Anahronisms ir viena perioda elementa (vārda, institūcijas, tehnoloģijas, jēdziena) nepareiza izvietošana citā periodā. Tā kā mākslīgais intelekts ir apmācīts, izmantojot mūsdienu valodu un jēdzienus, tas mēdz izskaidrot pagātni, izmantojot šodienas objektīvus, un pārnest neeksistējošas institūcijas vai terminus uz pagātni. Piemēram, apkopojot 16. gadsimta dokumentu, viņš var izmantot titulu vai administratīvo vienību, kas tajā laikā nepastāvēja.

Uzmanību! Katrs AI norādītais datums, nosaukums, numurs, citāts un avots ir apgalvojums, nevis fakts, kamēr jūs to nepārbaudāt neatkarīgi. “AI teica tā” nav avots historiogrāfijā; tas ir tikai pavediens, kas novirza jūs uz patieso avotu.

Pārbaudes disciplīna: trīs soļi

Iesakām validācijas ieradumu, ko atkārtosim visā šajā modulī:

1. Izveidojiet savienojumu ar avotu. Pamatojiet visas galvenās AI pretenzijas uz oriģinālo dokumentu, arhīva atsauci vai uzticamu publikāciju. Neizmantojiet apgalvojumu, kam nav avota.

2. Savstarpēji apstiprināt. Par kritisku faktu (datumu, vārdu, notikumu) meklējiet vismaz divus neatkarīgus avotus. Vai AI kopsavilkums ir tāds pats kā faktiskais dokuments?

3. Filtrējiet caur anahronismu un konsekvenci. Vai izvadā ir kāds termins, kas neatbilst periodam, neiespējams datums, nekonsekvents nosaukums? Jautājiet "Vai tas ir piemērots šim periodam?" no eksperta viedokļa.

trīs mini futrāļi

1. gadījums — izdomāta arhīva atsauce. Kāds maģistrants lūdza AI sniegt "arhīvu avotus" par tēmu. YZ atgrieza 6 arhīva atsauces, kuru formāts šķita ideāls: fonda nosaukums, faila numurs, datums. Students, pārmeklējot arhīva katalogu, atklāja, ka 4 no 6 atsaucēm vispār nepastāv. Atlikušajiem 2 bija nepareizi numuri. Nodarbība: nevienu AI ģenerētu atsauci nevar izmantot bez pārbaudes katalogā.

2. gadījums — OCR samazināts 40 stundas līdz 6 stundām. Pašvaldības arhīvs no 1950. līdz 1970. gadam ir digitalizējis 3200 drukātu domes protokolu lappuses. Manuāla pārrakstīšana tika lēsta 40 darbadienas. Izmantojot OCR, neapstrādāts teksts parādījās dažu minūšu laikā; Darbinieks laboja un pārbaudīja tekstu 6 darbadienu laikā. AI samazināja mehānisko darbu par 85%, bet galīgā lasīšana un rediģēšana palika cilvēka ziņā.

3. gadījums — Anahronistisks kopsavilkums. Kāds arhivārs lika YZ apkopot 18. gadsimta dibināšanas ierakstu. Kopsavilkums bija raiti, taču tajā tika izmantots mūsdienīgs administratīvais termins, kas dokumentā neparādās un nepieder pie perioda. Ja arhivārs nebūtu pievērsies dokumenta oriģinālam, šis anakronisms būtu ierakstīts kataloga ierakstā. Nodarbība: kopsavilkumu vienmēr salīdzina ar galveno dokumentu.

Četras kopējamas veidnes

1) Atvērums, kas nosaka lomas un robežas:

Jūsu loma: asistents, kas strādā vēsturē un arhīvos. Jūsu uzdevumos ietilpst teksta rediģēšana, kontūru veidošana un rakstu iezīmēšana. Stingri noteikumi: (1) Paļaujieties tikai uz manis sniegto tekstu, nepievienojiet faktus, datumus vai avotus no savas "atmiņas". (2) Ja neesat pārliecināts, rakstiet "neskaidrs", neizdomājiet. (3) Neizmantojiet nekādus apgalvojumus, kuriem nav avota. Apstiprini, ja saproti, tad iedošu tekstu.

2) Prethalucinācijas instrukcija:

Apkopojiet zemāk esošo tekstu. Noteikumi: nepievienojiet vārdus, datumus, vietas vai ciparus, kas tekstā nav SKAIDRI minēti. Pat nepievienojiet "iespējams" informāciju, kas nav tekstā. Ja kāda informācija tekstā nav iekļauta, raksta "tekstā nav norādīts". Teksts: [šeit]

3) Anahronisma pārbaude:

Pārskatiet tālāk [kursa] darba kopsavilkuma projektu. Atzīmējiet terminus, iestādes, nosaukumus un jēdzienus, kas var nepiederēt šim periodam. Katram īsi uzrakstiet, kāpēc tas ir aizdomīgi. Nepieņemiet galīgo spriedumu; Uzskaitiet tikai tos punktus, kas cilvēku ekspertam jāpārbauda. Melnraksts: [šeit]

4) Avota pretenzijas analizētājs:

Sadaliet katru teikumu šādā tekstā divās kategorijās: (A) Fakts, kas ierakstīts tieši avotā, (B) Interpretācija/secinājums. Tāpat atzīmējiet katru apgalvojumu, kura avots ir neskaidrs, kā "nepieciešama pārbaude". Teksts: [šeit]

Vāja uzvedne / spēcīga uzvedne

Vāji:

Pastāstiet man par šo Osmaņu dokumentu.

Šī uzvedne aicina AI runāt no savas “atmiņas”, pievienojot izdomātas detaļas un anahronismu.

Spēcīgs:

Jūsu loma ir vēstures palīgs. Pamatojoties TIKAI uz dokumentu, ko esmu ielīmējis zemāk esošo atšifrējumu: (1) uzskaitiet dokumentā minētās personas, vietas un datumus, (2) uzminiet dokumenta veidu, bet varat teikt "Es neesmu pārliecināts", (3) pievienojiet jebkādu informāciju, kas nav tekstā, (4) atzīmējiet aizdomīgās/nesalasāmās vietas ar [?]. Dokuments: [šeit]

Atšķirība ir skaidra: loma, atkarība no viena avota, izgatavošanas aizliegums, atļauja atzīmēt neskaidrības un skaidra izvades struktūra padara produkciju uzticamu.

Ētika, privātums un kultūras jutīgums

Vēsture un arhīva materiāli nav nevainīga tekstu kaudze. Tajā var būt ietverti cilvēku personas dati (civillietas, veselības lietas, tiesas dokumenti), sensitīvas kopienas atmiņas, ar autortiesībām aizsargāti darbi un kultūras ziņā sensitīvi materiāli. Daži principi:

  • Privātums: sensitīvu dokumentu, kas padara dzīvas personas identificējamas (personas datus), augšupielāde publiskos AI rīkos var būt gan juridisks, gan ētisks pārkāpums. Ievērojiet savas iestādes datu politiku un attiecīgos tiesību aktus.
  • Autortiesības: ne katrs jūsu digitalizētais dokuments var būt publiskajā īpašumā. Apsveriet tiesības, pirms tās piešķirat AI.
  • Kultūras jutīgums: dažām kopienām ir tiesības ietekmēt to vēsturisko materiālu izmantošanu. AI "efektīvajā" priekšlikumā nevar ignorēt kopienas jutīgumu.
  • Pārredzamība: reģistrējiet, ka ar AI palīdzību tika izveidota AI ģenerēta transkripcija vai metadati. Tas ir nepieciešams, lai nākamie pētnieki varētu pārbaudīt.
Padoms. Pirms dokumenta augšupielādes mākoņa AI rīkā, uzdodiet vienu jautājumu: "Kam nodarītu kaitējumu, ja šī dokumenta saturs parādītos internetā?" Ja atbilde ir “neviens”, vispirms meklējiet uzņēmuma apstiprinājumu un drošus rīkus.

Biežas kļūdas

  • AI sajaukt ar vēsturnieku. AI neinterpretē un neizlemj; viņi ir gatavi. Jēga un atbildība gulstas uz jums.
  • Izvades izmantošana bez apstiprināšanas. Katrs datums, vārds, citāts un atsauce ir pretenzija; Tas nav fakts, kamēr to nav apstiprinājis avots.
  • Paļaujoties uz izdomātiem avotiem. AI var radīt ticamas, bet neesošas atsauces; Meklēt katalogā.
  • Skats uz anahronismu. Filtrējiet rezultātus, kas apraksta pagātni mūsdienu valodā, izmantojot perioda perspektīvu.
  • Sensitīvu dokumentu nejauša augšupielāde. No sākuma apsveriet personas datus, autortiesības un kultūras jutīgumu.

Rezumējot

Vēsturē un arhivēšanā AI ir spēcīgs palīgs, kas ārkārtīgi paātrina mehānisku un atkārtotu darbu (transkribēšanu, rediģēšanu, skenēšanu, metadatu noformēšanu). Bet tieši šajā pierādījumu laukā halucinācijas un anakronisms ir reālas briesmas. Saistiet katru izvadi ar avotu, savstarpēju validāciju, perioda filtru; Interpretāciju, lēmumu un galīgo atbildību vienmēr paturiet sev. Ievērojiet privātumu, autortiesības un kultūras jutīgumu jau no pirmās dienas. Ar šo disciplīnu AI kļūst par rīku, kas paātrina vēstures izpēti, nevis palēnina to.

Lietojumprogrammas uzdevums

Atlasiet vēsturisku dokumentu, drukātu vai digitālu. Vispirms novietojiet AI ar veidni “Atvēršanas iestatījuma loma un robeža”. Pēc tam, apkopojot dokumentu, izmantojiet "prethalucinācijas instrukciju". Atzīmējiet izvadi ar "avota pretenzijas parsētājs" un salīdziniet katru paziņojumu ar atzīmi "jāpārbauda" ar faktisko dokumentu. Ņemiet vērā, cik punktu AI ir pievienojis vai izkropļojis.

kontrolsaraksts

  • [ ] Es pozicionēju AI kā palīgu, nevis kā lēmumu pieņēmēju.
  • [ ] Es tikai gribēju, lai tas būtu balstīts uz manis norādīto avotu.
  • [ ] Esmu neatkarīgi pārbaudījis katru datumu, vārdu un atsauci.
  • [ ] Es filtrēju izvadi anahronismiem.
  • [ ] Sensitīvos dokumentos esmu ievērojis konfidencialitāti, autortiesības un kultūras jutīgumu.