Üksus 4 / 12

Metaandmed, kataloogimine ja klassifitseerimine

Kasu:

  • Võimalus koostada metaandmete mustandeid vastavalt sellistele standarditele nagu ISAD(G) või tehisintellektiga Dublin Core
  • Võimalus ennetada hallutsinatsioone ja kaardistada teematerminid kontrollitud sõnavaraga tühjaks jätmise loal
  • Võimalus eristada, millised väljad, nagu kuupäev, isiku nimi ja viitekood, vajavad inimese nõusolekut ja millised peaks määrama ainult asutus

Arhiivi või raamatukogu, olenemata sellest, kui rikkalik see on, ei leia, kui see pole täpselt määratletud. Dokumendi teeb leitavaks selle kirjeldav teave: kes selle kirjutas, millal, kus, mis on selle teema, millisesse kogusse see kuulub. Seda teavet nimetatakse metaandmeteks (metadata – kirjeldavad andmed dokumendi kohta; „andmed andmete kohta”). Kataloogi koostamine on protsess, mille käigus tuvastatakse nende metaandmetega dokumendid ja salvestatakse need otsitavasse süsteemi. Klassifitseerimine on dokumentide korraldamine selliste kriteeriumide alusel nagu teema, tüüp või päritolu.

Metaandmete genereerimine on äärmiselt aeganõudev; Kuupäeva, teema, isiku ja koha teabe eraldi sisestamine tuhandete dokumentide jaoks suurtes kogudes võib võtta aastaid. AI on selles äris tugev tõmbegeneraator. Selles üksuses näeme, kuidas luua metaandmeid tehisintellektiga, kataloogides vastavalt standarditele (ISAD(G), Dublin Core) ning automaatse klassifitseerimise võimsust ja lõkse.

Arhiivistandardid: miks neid vaja on

Metaandmeid ei sisestata juhuslikult; On olemas rahvusvahelised standardid, et erinevate asutuste kirjed saaksid omavahel rääkida:

  • ISAD(G) (General International Standard Archival Description): Arhiivimaterjali hierarhilise kirjeldamise reeglid (fondi, seeria, faili, dokumendi tasandil). See sisaldab selliseid välju nagu viitekood, pealkiri, kuupäev, ulatus, looja.
  • Dublin Core: Ühine standard, mis koosneb 15 põhiväljast digitaalsete ressursside kirjeldamiseks (pealkiri, looja, teema, kuupäev, žanr, formaat, allikas, keel jne).
  • Fondid: üksikisiku, perekonna või asutuse tegevuse tulemusena loomulikult tekkinud rekordite kogum. See on arhiveerimise põhiline organiseerimisüksus.
  • Päritolu (päritolu): teave selle kohta, kellelt dokument pärineb ja millise käe kaudu see edastati. Arhiveerimisel hoitakse dokumente koos nende päritolu järgi.

Sihtstandardi selgesõnaline täpsustamine, kui tehisintellekt tootma metaandmeid, tagab väljundi otse ettevõttesse sisestamise.

Teine võtmemõiste on autoriteet – kirje, mis määratleb isiku, koha või asutuse nime ühtse, standardse kinnitatud vormi. Ajaloodokumentides võib sama isik või koht esineda erineva kirjapildiga; Autoriteedikirje seob need kõik ühte heakskiidetud vormingusse, et nad ei läheks otsingus laiali. AI soovitab dokumendist nimesid; kuid selle nime vastendamine autoriteetikirje standardvormile on inimtöö. Tehisintellekti sõnade "Ahmed" sidumine asutuse autoriteedikirjes "Ahmed Beyga (1840-1912)" säilitab kataloogi järjepidevuse.

Töövoog: samm-sammult

1. Valmistage allikas ette. Koguge dokumendi ärakiri või pilt ja mis tahes kontekstiteave.

2. Tehke kindlaks standard ja valdkonnad. Öelge tehisintellektile, milline standard (ISAD(G), Dublin Core) ja milliste väljade järgi see väljundit toodab.

3. Looge metaandmete mustand. AI täidab väljad, mida saab dokumendist välja võtta (kuupäev, isik, koht, teema, keel, žanr); See jätab tühjaks alad, mida ei saa eemaldada.

4. Kaart kontrollitud sõnavarale. Teema- ja kohanimed ei ole enamikus asutustes vabad, vaid on seotud etteantud loendiga (kontrollitud sõnavara / tesaurus). Kaardistage tehisintellekti soovitatud teematerminid sellesse loendisse.

5. Kontrollige ja kinnitage. Inimesed võrdlevad iga välja, eriti kuupäeva, nime ja teemat dokumentide ja volituste dokumentidega.

Näpunäide: andke AI-le selgesõnaliselt luba "jäta tühjaks". Vastasel juhul sisestab see kuupäeva või looja, mida dokumendis pole, ja lisab teie kataloogi võltsitud metaandmed. Juhend "Jäta see väli tühjaks, kui seda dokumendis pole" on kõige tugevam kaitse hallutsinatsioonide vastu.

Väljad ja usaldustase tabelis

Metaandmete väli

Kui usaldusväärne on AI?

kontrollimine

keel

kõrge

näidis

Dokumendi tüüp

keskmine-kõrge

kontrolli

Isiku-/kohanimed

Keskmine (lugemisviga)

kohustuslik

kuupäeva

Madal-keskmine (valmistamise oht)

kohustuslik

Teema tingimused

Keskmine (vaba genereeriv)

Kaart kontrollnimekirja

Ulatus/kokkuvõte

keskmine-kõrge

Võrdle allikaga

Viitekood

Puudub (asutus annab)

inimvisked

Kokkuvõte: AI on kiire ja usaldusväärne sellistes valdkondades nagu keel ja žanr; genereerib mustandeid sellistes väljades nagu kuupäev, nimi ja teema, kuid nõutav on inimese heakskiit; AI ei tooda kunagi institutsionaalseid välju, näiteks viitekoodi.

kolm minikarpi

1. juhtum – 8000 foto metaandmete mustand. Linnaarhiivis kataloogis 8000 ajaloolist fotot. Iga foto tagaküljel olevad märkmed transkribeeriti ja anti tehisintellektile; AI loodud kuupäev, asukoht ja teema ülevaade. Inimmeeskond kontrollis seda väljade kaupa ja kaardistas selle kontrollitud loendisse. Hinnanguliselt 10-kuuline tööaeg vähenes 3 kuuni; kuid iga kuupäev ja kohanimi kontrolliti visuaalselt.

Juhtum 2 – väljamõeldud ajalugu. Ühel arhiivitöötajal oli tehisintellekti kataloogis kuupäevata kiri. YZ vaatas kirja sisu ja kirjutas täpselt kuupäeva "1912". Dokumendis ei olnud aga kuupäeva; AI ennustas. Kui arhivaar poleks lisanud juhendit "jätke tühjaks, kui dokumendis pole", oleks kataloog täidetud väljamõeldud kuupäevaga. Õppetund: tühi luba on kohustuslik.

Juhtum 3 – vabad teematerminid tekitasid segadust. AI määras sarnastele dokumentidele sarnased, kuid erinevad vabad mõisted nagu "immigratsioon", "immigratsioon", "asundus". Kui seda ei kaardistatud kontrollitud sõnavaraga, märgistati sama teema kolme erineva terminiga ja hajutati otsingus. Järjepidevus saavutati terminite kaardistamisega ühtsesse volituste loendisse. Õppetund: teematermineid ei avaldata, need on lingitud nimekirjaga.

Neli kopeeritavat malli

1) Dublin Core'i ülevaade:

Ekstraktige Dublin Core'i metaandmete mustand allolevast dokumendi transkriptsioonist. Väljad: pealkiri, looja, teema, kirjeldus, kuupäev, žanr, keel, ulatus (asukoht/periood). Reeglid: (1) Kasutage tekstis teavet ainult SELGELT. (2) Väli, mida tekstis ei ole, jätke TÜHJA, ära arva. (3) Märkige väärtus, milles te pole kindel, märgiga [?]. Transkriptsioon: [siin]

2) ISAD(G) määratluse eelnõu:

Looge järgmise dokumendi mustand ISAD(G) väljadel: pealkiri, kuupäev(ad), kirjelduse tase (dokument/fail), ulatus ja sisu (lühikokkuvõte), looja, keel. Jäta viitekood TÜHJA (asutus annab selle). Ärge lisage teavet, mida tekstis pole; Jäta olematu väli tühjaks. Dokument: [siin]

3) Teematerminite soovitus (kontrollitud):

Soovitage 3–5 teematerminit, mis sobivad alloleva dokumendiga. Esiteks tuginege dokumendis sisalduvatele faktidele. Allpool on meie asutuse kontrollitud terminite loend; ESITEKS vali see siit nimekirjast, kui seda nimekirjas pole, märgi oma uue termini ettepanek eraldi. Loend: [tingimused]. Dokument: [siin]

4) Konsistentsi hulgikontroll:

Allpool on sama kogu dokumentide metaandmete kirjed. Lipu vastuolud: salvestab sama koha/isiku erineva kirjapildi, erinevad kuupäevavormingud, erinevad terminid sama teema kohta. parandus KINNITAMINE; Lihtsalt koostage loend ebakõladest, mida inimene saab üle vaadata. Rekordid: [siin]

Nõrk viip / Tugev viip

Nõrk:

Looge selle dokumendi jaoks täielik kataloogikirje.

"Täielik" juhis sunnib AI-d täitma iga ruumi, st leiutama ajalugu ja loojaid, keda pole olemas.

Tugev:

Selle dokumendi jaoks on koostatud Dublin Core. Kasutage ainult transkriptsioonis SELGELT sisalduvat teavet; jätke olematu väli tühjaks, ärge arvake.Valige teematerminid sellest kontrollitud loendist: [loend]. Märkige kuupäev ja isikute nimed [?]-ga, et saaksin seda dokumendiga kontrollida. Transkriptsioon: [siin]

Erinevus: "täieliku" väljaande asemel "jätke tühjaks" luba, kontrollitud loendi järgimine ja kontrollmärgid kaitsevad kataloogi valmistamise eest.

Levinud vead

  • See tähendab "täitke see täielikult". See viib olematute väljade sobitamiseni; "jätke tühjaks" luba tuleks anda.
  • Teematingimuste avaldamine. Terminid, mis ei vasta kontrollitud sõnavarale, segavad otsingut.
  • AI ennustamine ajalugu. Fiktiivse kuupäeva sisestamine dateerimata dokumenti saastab kataloogi.
  • AI poolt genereeritud viitekood. See on ettevõtte ainulaadne ruum; inimesed viskavad.
  • Standardit ei täpsusta. Kui standardit ei mainita, on väljundiks sassis mustand, mida ei saa asutusse sisestada.

Kokkuvõttes

Metaandmed ja kataloogimine on see nähtamatu infrastruktuur, mis arhiivi uurijale avab, ja see nõuab palju pingutust. Transkriptsiooni põhjal loob AI kiire ülevaate sellistest väljadest nagu kuupäev, isik, koht, teema ja žanr; See võib töötada vastavalt standarditele nagu ISAD(G) või Dublin Core. Kuid surve "täielikult täita" sunnib AI-d asju välja mõtlema; "Jäta tühjaks" luba, kaardistamine kontrollitud sõnavaraga ja kuupäevade/nimede inimeste kinnitus hoiavad kataloogi usaldusväärsena. AI valmistab ette mustandi; Teie vastutate kataloogi õigsuse eest.

Rakenduse ülesanne

Tehke dokumendi transkriptsioon ja taotlege AI-st metaandmeid malliga „Dublin Core draft”; Kontrollige, kas see jätab tühjad väljad, mida pole olemas. Seejärel käivitage oma (või näidis) kontroll-loendiga mall „teematerminite soovitus”. Lõpuks testige mõnda kirjet "hulgijärjepidevuse kontrolliga". Pange tähele, kui palju välju AI proovib ennustusega täita ja kui palju teematermineid tuleb loendisse vastendada.

kontrollnimekiri

  • [ ] Olen selgelt välja öelnud sihtstandardi (ISAD(G)/Dublin Core).
  • [ ] Andsin loa "Jäta väli tühjaks".
  • [ ] Vastasin teematerminid kontrollitud loendisse.
  • [ ] Kontrollisin kuupäeva ja isikute nimesid dokumendi/volituse kirjega.
  • [ ] Viitekoodi jätsin asutusele, mitte tehisintellektile.