Üksus 1 / 12

Sissejuhatus tehisintellekti ajaloos ja arhiveerimises: rollid, piirid, valideerimine ja eetika

Kasu:

  • Oskus teha vahet, kus tehisintellekt säästab ajaloo- ja arhiivitöös aega (transkriptsioon, toimetamine, skaneerimine, mustand) ning kus tõlgendamine, allikakriitika ja lõplik otsus jääb olenevalt riskitasemest eksperdi teha.
  • Võime rakendada kontrollimise distsipliini hallutsinatsioonide vastu, ühendades iga väljundi allikaga, ristkinnitades selle ja filtreerides selle anakronismi suhtes.
  • Mõistmaks, miks peaks ajaloos ja arhiivimaterjalides algusest peale arvestama konfidentsiaalsust, autoriõigust ja kultuuritundlikkust.

Kui ajaloolane või arhivaar istub oma töölaua taha, on tema ees sageli tohutu hunnik: koltunud märkmikud, mikrofilmitud ajalehed, tuhanded digifotod, käsitsi kirjutatud kirjad, ametlik kirjavahetus, maaregistrid. Selle hunniku lugemine, korrastamine, määratlemine ja mõtestamine on töö, mis võtab aastaid. Tehisintellekt (lühidalt tehisintellekt; arvutisüsteemid, mis õpivad mustreid, genereerivad ja klassifitseerivad teksti suurtest teksti- ja kujutismassidest) võivad selle töö mehaanilist ja korduvat osa märkimisväärselt kiirendada. Kuid just sellises valdkonnas nagu ajalugu ja arhiveerimine, mis tugineb tõenditele, allikatele ja täpsusele, peate algusest peale teadma, kus tehisintellekt on kasulik ja kus ohtlik.

See seade on kogu mooduli kompass. Siin räägime sellest, kus AI säästab aega ajaloos ja arhiivitöös, kus on inimeksperdi hinnang hädavajalik, miks peab iga väljund olema kontrollitud ja millised on selle valdkonna konkreetsed eetilised piirid.

AI õige positsioneerimine: assistent, mitte otsustaja

Kõige elementaarsem reegel on järgmine: AI on assistent, mitte ajaloolane või arhivaar. AI; See on kiire abimees, mis transkribeerib dokumendi, teeb kogust kokkuvõtte, tõlgib teksti, soovitab kogu jaoks metaandmeid ja märgistab mustreid. Kuid otsused, tõlgendust ja vastutust nõudvad otsused, nagu "kas see dokument on tõeline", "mida see sündmus tähendab", "kas see allikas on usaldusväärne", "kuidas seda kogumist korraldada", kuuluvad eksperdile.

Selgitame seda vahet tabeli abil:

äri tüüp

Kas AI on võimas?

Kelle vastutus?

Prinditud teksti teisendamine masintekstiks (OCR)

Jah, väga kiiresti

inimestel on õigus

Käsikirja transkriptsiooni mustand

Osaliselt on veamarginaal kõrge

Inimesed teevad selle kindlasti korda

Tehke kokkuvõte/skannige tuhandeid dokumente

Jah

Inimene taandub allikale

Metaandmete (kuupäev, asukoht, teema) ülevaade

Jah

inimene kiidab heaks

Dokumendi autentsuse üle otsustamine

ei

Ainult ekspert

Ajalooline tõlgendus ning põhjuse ja tagajärje kindlakstegemine

ei

ainult ajaloolane

Hinnake allika usaldusväärsust

ei

Ainult ekspert

Selle pildi kokkuvõtteks ühe lausega: AI valmistab andmed ette, ekspert teeb mõtte ja teeb otsuse.

Miks on kontrollimine hädavajalik: hallutsinatsioonid ja anakronism

Humanitaar- ja sotsiaalteadustes tehisintellekti kasutamise suurim oht on hallutsinatsioonid. Hallutsinatsioon on see, kui tehisintellekt loob enesekindlalt teavet, allika või tsitaadi, mida tegelikult ei eksisteeri. Selle asemel, et öelda "Ma ei tea", kipub tehisintellekt täitma lünka väljamõeldud vastusega, mis tundub usutav. Ajaloos on see saatuslik: viide olematule dokumendile, väljamõeldud ajaloole, sõnale, mida tegelikult ei öeldud, sündmus, mis ei juhtunud.

Teine suur oht on anakronism. Anakronism on ühe perioodi elemendi (sõna, institutsiooni, tehnoloogia, kontseptsiooni) ümberpaigutamine teise perioodi. Kuna tehisintellekti koolitatakse tänapäeva keele ja kontseptsioonidega, on see kalduvus seletama minevikku läbi tänapäevaste objektiivide ja kandma olematuid institutsioone või termineid minevikku. Näiteks 16. sajandi dokumendi kokkuvõtte tegemisel võib ta kasutada pealkirja või haldusüksust, mida tol ajal ei eksisteerinud.

Ettevaatust. Iga AI poolt välja antud kuupäev, nimi, number, tsitaat ja allikas on väide, mitte fakt, kuni te seda iseseisvalt kinnitate. "AI ütles nii" ei ole ajalookirjutuse allikas; see on lihtsalt vihje, mis juhatab teid tõelise allika juurde.

Kontrollimise distsipliin: kolm sammu

Soovitame valideerimisharjumuse, mida kordame kogu selle mooduli jooksul:

1. Ühendage allikaga. Tuginege iga AI suuremate väidete algdokumendile, arhiiviviidetele või usaldusväärsele väljaandele. Ärge kasutage väidet, millel pole allikat.

2. Ristkinnitage. Kriitilise fakti (kuupäev, nimi, sündmus) jaoks konsulteerige vähemalt kahe sõltumatu allikaga. Kas tehisintellekti kokkuvõte on sama, mis tegelik dokument ütleb?

3. Filtreerige läbi anakronismi ja järjepidevuse. Kas väljundis on termin, mis ei sobi perioodiga, võimatu kuupäev, ebaühtlane nimi? Küsige "Kas see sobib selle perioodiga?" asjatundja vaatenurgast.

kolm minikarpi

Juhtum 1 – väljatöötatud arhiiviviide. Üks magistrant küsis tehisintellektil teema kohta "arhiiviallikaid". YZ tagastas 6 arhiiviviidet, mille formaat näis olevat täiuslik: fondi nimi, faili number, kuupäev. Kui õpilane arhiivikataloogi otsis, leidis ta, et 6 viitest 4 ei eksisteeri üldse. Ülejäänud kahel olid valed numbrid. Õppetund: tehisintellekti loodud viiteid ei saa kasutada ilma kataloogis kontrollimiseta.

Juhtum 2 – OCR vähendati 40 tunnilt 6 tunnini. Vallaarhiivis on aastatel 1950–1970 digiteeritud 3200 lehekülge trükitud volikogu protokolle. Käsitsi ümberkirjutamiseks kulus hinnanguliselt 40 tööpäeva. OCR-iga tuli toortekst välja minutitega; Töötaja parandas ja kontrollis teksti 6 tööpäeva jooksul. AI vähendas mehaanilist tööd 85%, kuid lõplik lugemine ja toimetamine jäid inimesele.

3. juhtum – anakronistlik kokkuvõte. Arhiivitöötaja lasi YZ-l teha kokkuvõtte 18. sajandist pärit vundamendist. Kokkuvõte oli ladus, kuid kasutas tänapäevast haldusterminit, mida dokumendis ei esine ja mis ei kuulu perioodi. Kui arhivaar poleks läinud algdokumendi juurde, oleks see anakronism kataloogikirjesse kirja pandud. Õppetund: abstrakti võrreldakse alati põhidokumendiga.

Neli kopeeritavat malli

1) Ava, mis määrab rollid ja piirid:

Sinu roll: assistent, kes töötab ajaloos ja arhiivis. Teie ülesannete hulka kuulub teksti redigeerimine, piirjoonte loomine ja mustrite märgistamine. Ranged reeglid: (1) Toetuge ainult minu poolt antud tekstile, ärge lisage fakte, kuupäevi ega allikaid enda "mälust". (2) Kui te pole kindel, kirjutage "ebakindel", ärge tehke seda välja. (3) Ärge esitage väiteid, millel pole allikat. Kinnitage, kui saate aru, siis annan teksti.

2) Hallutsinatsioonivastased juhised:

Tehke allolevast tekstist kokkuvõte. Reeglid: ära lisa nimesid, kuupäevi, kohti ega numbreid, mida tekstis SELGELT mainitud ei ole. Ärge isegi lisage "tõenäoliselt" teavet, mida tekstis pole. Kui tekstis pole teavet, kirjutage "tekstis pole täpsustatud". Tekst: [siin]

3) anakronismi kontroll:

Vaadake allolevat [termi]töö kokkuvõtte mustandit. Märgistage terminid, institutsioonid, pealkirjad ja mõisted, mis ei pruugi sellesse perioodi kuuluda. Kirjutage igaühe kohta lühidalt, miks see kahtlane on. Ärge tehke lõplikku otsust; Loetlege ainult need punktid, mida inimekspert peaks kontrollima. Mustand: [siin]

4) Allikanõude parser:

Jagage järgmise teksti iga lause kahte kategooriasse: (A) otse allikasse kirjutatud fakt, (B) tõlgendus/järeldus. Samuti märkige iga väide, mille allikas on ebaselge, kui "vajab kontrollimist". Tekst: [siin]

Nõrk viip / Tugev viip

Nõrk:

Räägi mulle sellest Ottomani dokumendist.

See viip kutsub AI-d rääkima oma "mälust", lisades väljamõeldud detaile ja anakronismi.

Tugev:

Teie roll on ajaloo assistent. AINULT dokumendi põhjal, mille olen kleepinud alloleva ärakirja: (1) loetlege dokumendis mainitud inimesed, kohad ja kuupäevad, (2) arvake ära dokumendi tüüp, kuid võite öelda "Ma pole kindel", (3) lisage teave, mida tekstis pole, (4) märgi kahtlased/loetamatud alad tähega [?]. Dokument: [siin]

Erinevus on selge: roll, sõltuvus ühest allikast, valmistamise keeld, mitmetähenduslikkuse märgistamise luba ja selge väljundstruktuur muudavad väljundi usaldusväärseks.

Eetika, privaatsus ja kultuuriline tundlikkus

Ajalugu ja arhiivimaterjal ei ole süütu tekstihunnik. See võib sisaldada inimeste isikuandmeid (tsiviildokumendid, tervisetoimikud, kohtudokumendid), kogukonna tundlikke mälestusi, autoriõigustega kaitstud teoseid ja kultuuriliselt tundlikke materjale. Mõned põhimõtted:

  • Privaatsus: tundlike dokumentide, mis muudavad elusaid inimesi tuvastatavaks (isikuandmed) avalikesse tehisintellekti tööriistadesse, üleslaadimine võib olla nii juriidiline kui ka eetiline rikkumine. Järgige oma asutuse andmepoliitikat ja asjakohaseid õigusakte.
  • Autoriõigus: mitte kõik teie digiteeritavad dokumendid ei pruugi olla üldkasutatavad. Mõelge õigustele enne nende andmist tehisintellektile.
  • Kultuuriline tundlikkus: mõned kogukonnad saavad oma ajalooliste materjalide kasutamise osas kaasa rääkida. AI "tõhus" ettepanek ei saa ignoreerida kogukonna tundlikkust.
  • Läbipaistvus: registreerige, et tehisintellekti loodud transkriptsioon või metaandmed loodi AI abil. See on vajalik selleks, et järgmised uurijad saaksid seda kontrollida.
Näpunäide: Enne dokumendi üleslaadimist pilvepõhisesse tehisintellekti tööriista, esitage üks küsimus: "Kes saaks kahju, kui selle dokumendi sisu ilmuks Internetti?" Kui vastus on "mitte keegi", otsige kõigepealt ettevõtte heakskiitu ja ohutuid tööriistu.

Levinud vead

  • Segib tehisintellekti ajaloolasega. AI ei tõlgenda ega otsusta; nad on valmis. Mõte ja vastutus on sinul.
  • Väljundi kasutamine ilma seda kinnitamata. Iga kuupäev, nimi, tsitaat ja viide on väide; See pole fakt enne, kui allikas seda kinnitab.
  • Tuginedes väljamõeldud allikatele. AI suudab toota usaldusväärseid, kuid olematuid viiteid; Otsi kataloogist.
  • Vaade anakronismile. Filtreerige väljundid, mis kirjeldavad minevikku tänapäeva keeles perioodi perspektiiviga.
  • Tundlike dokumentide juhuslik üleslaadimine. Arvestage algusest peale isikuandmete, autoriõiguste ja kultuurilise tundlikkusega.

Kokkuvõttes

Ajaloos ja arhiveerimises on AI võimas abimees, mis kiirendab tohutult mehaanilist ja korduvat tööd (transkribeerimine, redigeerimine, skannimine, metaandmete koostamine). Kuid just selles tõendite valdkonnas on hallutsinatsioonid ja anakronism tõelised ohud. Seo iga väljund allikaga, ristvalideerimine, perioodifilter; Jätke tõlgendus, otsus ja lõplik vastutus alati endale. Jälgige privaatsust, autoriõigusi ja kultuurilist tundlikkust esimesest päevast peale. Selle distsipliiniga saab tehisintellektist tööriist, mis kiirendab ajaloouuringuid, mitte ei aeglustab seda.

Rakenduse ülesanne

Valige oma ajalooline dokument, kas prinditud või digitaalne. Esmalt asetage tehisintellekt malliga „Avamise seadistusroll ja piir”. Seejärel kasutage dokumendist kokkuvõtet tehes "hallutsinatsioonivastaseid juhiseid". Märgistage väljund "allikanõude parser" ja võrrelge iga väidet, mis on märgitud "tuleb kontrollida", tegeliku dokumendiga. Pange tähele, kui palju punkte on tehisintellekt lisanud või moonutanud.

kontrollnimekiri

  • [ ] Positsioneerisin tehisintellekti assistendiks, mitte otsustajaks.
  • [ ] Tahtsin lihtsalt, et see põhineks minu antud allikal.
  • [ ] Olen iga kuupäeva, nime ja viite sõltumatult kontrollinud.
  • [ ] Filtreerisin väljundi anakronismide jaoks.
  • [ ] Olen tundlike dokumentide puhul täheldanud konfidentsiaalsust, autoriõigusi ja kultuurilist tundlikkust.