Dobički:
- Sposobnost izdelave osnutkov metapodatkov v skladu s standardi, kot sta ISAD(G) ali Dublin Core z umetno inteligenco
- Sposobnost preprečevanja halucinacij in preslikave predmetnih izrazov v nadzorovani besednjak z dovoljenjem, da pustite prazno
- Sposobnost razlikovanja, katera polja, kot so datum, ime osebe in referenčna koda, zahtevajo človeško odobritev in katera mora dodeliti samo institucija
Arhiva ali knjižnice, ne glede na to, kako bogata je, ni mogoče najti, če ni dobro definirana. Tisto, zaradi česar je dokument "najdljiv", so opisne informacije o njem: kdo ga je napisal, kdaj, kje, kaj je njegov predmet, kateri zbirki pripada. Te informacije imenujemo metapodatki (metapodatki — opisni podatki o dokumentu; »podatki o podatkih«). Katalogizacija je postopek identifikacije dokumentov s temi metapodatki in njihovega shranjevanja v sistemu, ki omogoča iskanje. Razvrščanje je organiziranje dokumentov glede na merila, kot so tema, vrsta ali izvor.
Generiranje metapodatkov je izjemno zamudno; Posamezno vnašanje podatkov o datumu, predmetu, osebi in kraju za tisoče dokumentov v velikih zbirkah lahko traja leta. AI je močan generator osnutka v tem poslu. V tej enoti bomo videli, kako ustvariti metapodatke z umetno inteligenco, katalogizirati v skladu s standardi (ISAD(G), Dublin Core) ter si ogledati moč in pasti samodejnega razvrščanja.
Arhivski standardi: zakaj so potrebni
Metapodatki se ne vnašajo naključno; Obstajajo mednarodni standardi, ki omogočajo, da se zapisi različnih institucij med seboj pogovarjajo:
- ISAD(G) (Splošni mednarodni standardni arhivski opis): Pravila za hierarhično opisovanje arhivskega gradiva (na ravni fonda, serije, spisa, dokumenta). Vsebuje polja, kot so referenčna koda, naslov, datum, obseg, ustvarjalec.
- Dublin Core: Skupni standard, sestavljen iz 15 osnovnih polj za opisovanje digitalnih virov (naslov, ustvarjalec, zadeva, datum, žanr, oblika, vir, jezik itd.).
- Fondi: Niz dokumentov, ki so naravno nastali kot rezultat dejavnosti posamezne osebe, družine ali ustanove. Je osnovna organizacijska enota arhivistike.
- Izvor (izvor): Podatki o tem, od koga izvira dokument in skozi katero roko je šel. Dokumenti se v arhivstvu hranijo skupaj glede na izvor.
Eksplicitna določitev ciljnega standarda, ko AI proizvaja metapodatke, zagotavlja, da je izhod mogoče neposredno vnesti v podjetje.
Drugi ključni koncept je normativni zapis – zapis, ki definira enotno, standardno, odobreno obliko imena osebe, kraja ali ustanove. V zgodovinskih dokumentih se ista oseba ali kraj lahko pojavi z različnim črkovanjem; Normativni zapis jih vse poveže v en odobren format, tako da se pri iskanju ne razpršijo. AI predlaga imena iz dokumenta; vendar je preslikava tega imena v standardno obliko v normativnem zapisu človeško delo. Povezovanje tega, kar AI pravi "Ahmed" z "Ahmed Bey (1840-1912)" v avtoritetnem zapisu institucije ohranja doslednost kataloga.
Potek dela: korak za korakom
1. Pripravite vir. Zberite prepis ali sliko dokumenta in vse informacije o kontekstu.
2. Določite standard in področja. Povejte AI, kateri standard (ISAD(G), Dublin Core) in glede na katera polja bo ustvaril izhod.
3. Ustvarite osnutke metapodatkov. AI izpolni polja, ki jih je mogoče izvleči iz dokumenta (datum, oseba, kraj, zadeva, jezik, žanr); Področja, ki jih ni mogoče odstraniti, pusti prazna.
4. Preslikava v kontrolirani besednjak. Predmetna in krajevna imena v večini ustanov niso brezplačna, ampak so vezana na vnaprej določen seznam (nadzorovani besednjak / tezaver). Preslikajte predmetne izraze, ki jih predlaga AI na ta seznam.
5. Preverite in potrdite. Vsako polje, zlasti datum, ime in predmet, ljudje primerjajo z dokumenti in zapisi avtoritete.
Nasvet: AI izrecno dovolite, da "pusti prazno". V nasprotnem primeru bo "ugibal" vnos datuma ali ustvarjalca, ki ni v dokumentu, in v vaš katalog vstavil lažne metapodatke. Navodilo »Pustite to polje prazno, če ga ni v dokumentu« je najmočnejši ščit pred halucinacijami.
Polja in stopnja zaupanja v tabeli
Polje metapodatkov
Kako zanesljiv je AI?
preverjanje
jezik
visoka
vzorec
Vrsta dokumenta
srednje visoka
nadzor
Imena oseb/krajev
Srednje (napaka pri branju)
obvezno
datum
Nizko-srednje (nevarnost izdelave)
obvezno
Predmetni izrazi
Srednje (prosto ustvarjanje)
Zemljevid na kontrolni seznam
Obseg/povzetek
srednje visoka
Primerjaj z virom
Referenčna koda
Brez (ustanova daje)
človeški meti
Povzetek: AI je hiter in zanesljiv na področjih, kot sta jezik in žanr; ustvari osnutke v poljih, kot so datum, ime in zadeva, vendar je potrebna človeška odobritev; AI nikoli ne ustvari institucionalnih polj, kot je referenčna koda.
trije mini kovčki
Primer 1 — Osnutek metapodatkov za 8.000 fotografij. Mestni arhiv je katalogiziral 8000 zgodovinskih fotografij. Opombe na zadnji strani vsake fotografije so bile prepisane in posredovane AI; AI je ustvaril datum, lokacijo in oris teme. Človeška ekipa je preverjala polje za poljem in ga preslikala na nadzorovani seznam. Ocenjeno 10-mesečno delo je bilo skrajšano na 3 mesece; vendar je bil vsak datum in ime kraja vizualno preverjen.
Primer 2 – Izmišljena zgodovina. Arhivar je dal AI katalogizirati nedatirano pismo. YZ je pogledal vsebino pisma in natančno zapisal datum "1912". Vendar v listini ni bilo datuma; AI je napovedal. Če arhivar ne bi dodal navodila »pusti prazno, če ni v dokumentu«, bi bil katalog zapolnjen z dodelanim datumom. Lekcija: prazno dovoljenje je obvezno.
Primer 3 – izrazi brezplačne teme so povzročili zmedo. AI je podobnim dokumentom dodelil podobne, vendar različne proste izraze, kot so "imigracija", "imigracija", "naselitev". Ko ni bila preslikana v nadzorovani besednjak, je bila ista tema označena s tremi različnimi izrazi in razpršena med iskanjem. Doslednost je bila dosežena s preslikavo izrazov v en sam avtoritetni seznam. Lekcija: termini teme niso objavljeni, povezani so s seznamom.
Štiri predloge za kopiranje
1) Oris Dublinskega jedra:
Izvlecite osnutek metapodatkov Dublin Core iz spodnjega prepisa dokumenta. Polja: Naslov, Ustvarjalec, Zadeva, Opis, Datum, Žanr, Jezik, Obseg (lokacija/obdobje). Pravila: (1) V besedilu uporabljajte le informacije JASNO. (2) Polje, ki ni v besedilu, pustite PRAZNO, ne ugibajte. (3) Označite vrednost, za katero niste prepričani, z [?]. Prepis: [tukaj]
2) Osnutek definicije ISAD(G):
Ustvarite osnutek za naslednji dokument v poljih ISAD(G): Naslov, Datum(i), Raven opisa (dokument/datoteka), Obseg in vsebina (kratek povzetek), Ustvarjalec, Jezik. Referenčno kodo pustite PRAZNO (priskrbi jo zavod). Ne dodajajte informacij, ki niso v besedilu; Neobstoječe polje pustite prazno. Dokument: [tukaj]
3) Predlog pojma teme (nadzorovano):
Predlagajte 3-5 tematskih izrazov, ki ustrezajo spodnjemu dokumentu. Najprej se zanesite na dejstva v dokumentu. Spodaj je seznam kontrolirane terminologije naše ustanove; NAJPREJ ga izberite s tega seznama, če ga ni na seznamu, posebej označite nov predlog termina. Seznam: [izrazi]. Dokument: [tukaj]
4) Preverjanje doslednosti v razsutem stanju:
Spodaj so metapodatkovni zapisi za dokumente iz iste zbirke. Nedoslednosti zastavic: zapisi, ki različno črkujejo isti kraj/osebo, različni formati datumov, različni izrazi za isto temo. Popravek NAMESTITEV; Pripravite le seznam neskladij, ki jih mora človek pregledati. Zapisi: [tukaj]
Šibek poziv/močan poziv
Šibko:
Ustvarite celoten kataloški zapis za ta dokument.
"Popolno" navodilo potisne AI da zapolni vsak prostor, tj. da izumi zgodovino in ustvarjalce, ki ne obstajajo.
Močno:
Dublinsko jedro je pripravljeno za ta dokument. Uporabljajte le informacije, ki so JASNO vključene v prepis; pustite neobstoječe polje prazno, ne ugibajte. Izberite izraze teme s tega nadzorovanega seznama: [seznam]. Označite datum in imena oseb z [?], da jih lahko preverim z dokumentom. Prepis: [tukaj]
Razlika: dovoljenje "pusti prazno" namesto "popolna" izdaja, nadzorovano spoštovanje seznama in oznake za preverjanje ščitijo katalog pred izdelavo.
Pogoste napake
- Pomeni "popolnoma napolni". To vodi do prilagajanja neobstoječih polj; dati je treba dovoljenje "pusti prazno".
- Sprostitev predmetnih pogojev. Izrazi, ki se ne preslikavajo v nadzorovani besednjak, bodo motili iskanje.
- Z AI napovedati zgodovino. Vnos izmišljenega datuma v dokument brez datuma onesnažuje katalog.
- Imeti referenčno kodo, ki jo ustvari AI. To je korporativni, edinstveni prostor; ljudje mečejo.
- Brez navedbe standarda. Če standard ni omenjen, bo rezultat neurejen osnutek, ki ga ni mogoče vnesti v institucijo.
Če povzamem
Metapodatki in katalogizacija sta tista nevidna infrastruktura, ki odpira arhiv raziskovalcu in zahteva veliko truda. Iz transkripcije AI ustvari hiter oris za polja, kot so datum, oseba, kraj, predmet in žanr; Lahko deluje v skladu s standardi, kot sta ISAD(G) ali Dublin Core. Toda pritisk, da se »popolnoma izpolni«, prisili AI, da stvari popravi; Dovoljenje »pusti prazno«, preslikava v nadzorovani besednjak in človeška potrditev datumov/imen ohranjajo katalog vreden zaupanja. AI pripravi osnutek; Za točnost kataloga odgovarjate sami.
Aplikacijska naloga
Naredite prepis dokumenta in zahtevajte metapodatke iz umetne inteligence s predlogo »Dublin Core osnutek«; Preverite, ali pušča prazna polja, ki ne obstajajo. Nato zaženite predlogo »predlog izraza teme« s svojim (ali vzorčnim) kontrolnim seznamom. Nazadnje preizkusite nekaj zapisov s »preverjanjem množične skladnosti«. Upoštevajte, koliko polj poskuša umetna inteligenca zapolniti z napovedjo in koliko predmetnih izrazov je treba preslikati na seznam.
kontrolni seznam
- [ ] Jasno sem navedel ciljni standard (ISAD(G)/Dublin Core).
- [ ] Dal sem dovoljenje »Pusti prazno polje prazno«.
- [ ] Izraze teme sem preslikal na nadzorovani seznam.
- [ ] Datum in imena oseb sem preveril z dokumentom/zapisom organa.
- [ ] Referenčno kodo sem prepustil instituciji, ne AI.