Jedinica 4 / 12

Metapodaci, katalogizacija i klasifikacija

Dobici:

  • Sposobnost izrade nacrta metapodataka u skladu sa standardima kao što su ISAD(G) ili Dublin Core s umjetnom inteligencijom
  • Sposobnost sprječavanja halucinacija i preslikavanja predmetnih izraza u kontrolirani vokabular s dopuštenjem da ostane prazno
  • Sposobnost razlikovanja koja polja, kao što su datum, ime osobe i referentni kod, zahtijevaju ljudsko odobrenje, a koja bi trebala dodijeliti samo institucija

Arhiva ili knjižnica, koliko god bila bogata, ne može se pronaći ako nije dobro definirana. Ono što dokument čini “pronaćivim” su opisne informacije o njemu: tko ga je napisao, kada, gdje, koja mu je tema, kojoj zbirci pripada. Te se informacije nazivaju metapodaci (metapodaci — opisni podaci o dokumentu; “podaci o podacima”). Katalogizacija je proces identificiranja dokumenata s ovim metapodacima i njihovo spremanje u sustavu koji se može pretraživati. Klasifikacija je organiziranje dokumenata prema kriterijima kao što su predmet, vrsta ili podrijetlo.

Generiranje metapodataka je izuzetno dugotrajno; Pojedinačno unošenje informacija o datumu, predmetu, osobi i mjestu za tisuće dokumenata u velikim zbirkama može trajati godinama. AI je snažan generator nacrta u ovom poslu. U ovoj jedinici vidjet ćemo kako generirati metapodatke pomoću umjetne inteligencije, katalogizirati u skladu sa standardima (ISAD(G), Dublin Core), te moći i zamke automatske klasifikacije.

Arhivski standardi: zašto su potrebni

Metapodaci se ne unose nasumično; Postoje međunarodni standardi kako bi zapisi iz različitih institucija mogli međusobno komunicirati:

  • ISAD(G) (General International Standard Archival Description): Pravila za hijerarhijski opis arhivskoga gradiva (na razini fonda, serije, spisa, dokumenta). Sadrži polja kao što su referentni kod, naslov, datum, opseg, kreator.
  • Dublin Core: Zajednički standard koji se sastoji od 15 ključnih polja za opisivanje digitalnih izvora (naslov, kreator, predmet, datum, žanr, format, izvor, jezik itd.).
  • Fondovi: skup zapisa koji su prirodno nastali kao rezultat aktivnosti jedne osobe, obitelji ili institucije. Osnovna je organizacijska jedinica arhivistike.
  • Provenencija (podrijetlo): Podaci o tome od koga dokument potječe i kroz koju je ruku prošao. Dokumenti se u arhivistici čuvaju zajedno prema podrijetlu.

Eksplicitno određivanje ciljnog standarda kada AI proizvodi metapodatke osigurava da se izlaz može izravno unijeti u poduzeće.

Još jedan ključni koncept je normativni zapis—zapis koji definira jedan, standardni, odobreni oblik imena osobe, mjesta ili institucije. U povijesnim dokumentima, ista osoba ili mjesto mogu se pojaviti s različitim načinima pisanja; Ovjereni zapis povezuje ih sve u jedan odobreni format kako se ne bi raspršili u pretraživanju. AI predlaže imena iz dokumenta; ali preslikavanje ovog imena u standardni oblik u normativnom zapisu ljudski je posao. Povezivanje onoga što AI kaže "Ahmed" s "Ahmed Bey (1840-1912)" u autoritetnom zapisu institucije čuva dosljednost kataloga.

Tijek rada: korak po korak

1. Pripremite izvor. Prikupite prijepis ili sliku dokumenta i sve informacije o kontekstu.

2. Identificirajte standard i područja. Recite AI-u koji će standard (ISAD(G), Dublin Core) i prema kojim poljima proizvesti izlaz.

3. Generirajte nacrt metapodataka. AI ispunjava polja koja se mogu izdvojiti iz dokumenta (datum, osoba, mjesto, predmet, jezik, žanr); Ostavlja prazna područja koja ne može ukloniti.

4. Mapirajte kontrolirani vokabular. Nazivi predmeta i mjesta nisu besplatni u većini institucija, već su vezani uz unaprijed definirani popis (kontrolirani vokabular / tezaurus). Preslikajte pojmove predmeta koje je AI predložio na ovaj popis.

5. Provjerite i potvrdite. Svako polje, posebno datum, ime i predmet, ljudska bića uspoređuju s dokumentima i zapisima autoriteta.

Savjet: izričito dajte AI dopuštenje da "ostavi prazno". Inače će "pogoditi" ispuniti datum ili kreatora koji nije u dokumentu i umetnuti lažne metapodatke u vaš katalog. Uputa "Ostavite ovo polje praznim ako ga nema u dokumentu" najjači je štit protiv halucinacija.

Polja i razina povjerenja u tablici

Polje metapodataka

Koliko je AI pouzdan?

provjera

jeziku

visoka

uzorak

Vrsta dokumenta

srednje-visoka

kontrola

Imena osoba/mjesta

Srednje (pogreška čitanja)

obavezna

datum

Nizak-srednji (rizik od fabrikacije)

obavezna

Predmetni pojmovi

Srednje (slobodno generiranje)

Karta na kontrolni popis

Opseg/sažetak

srednje-visoka

Usporedi s izvorom

Referentni kod

Ništa (institucija daje)

ljudska bacanja

Sažetak: AI je brz i pouzdan u područjima kao što su jezik i žanr; generira nacrte u poljima kao što su datum, ime i predmet, ali potrebno je ljudsko odobrenje; AI nikada ne proizvodi institucionalna polja kao što je referentni kod.

tri mini kućišta

Slučaj 1 — Nacrt metapodataka za 8000 fotografija. Gradski arhiv katalogizirao je 8000 povijesnih fotografija. Bilješke na poleđini svake fotografije su prepisane i predane AI; AI generirao datum, mjesto i pregled teme. Ljudski tim to je potvrdio polje po polje i preslikao na kontrolirani popis. Procijenjeni 10-mjesečni posao smanjen je na 3 mjeseca; ali svaki datum i ime mjesta bili su vizualno provjereni.

Slučaj 2 — Izmišljena povijest. Arhivist je dao umjetnoj inteligenciji da katalogizira nedatirano pismo. YZ je pogledao sadržaj pisma i precizno napisao datum "1912". Međutim, u dokumentu nije bilo datuma; AI je predvidio. Da arhivist nije dodao uputu "ostaviti prazno ako nije u dokumentu", katalog bi bio popunjen s izmišljenim datumom. Lekcija: prazno dopuštenje je obavezno.

Slučaj 3 — Izrazi slobodnih tema stvorili su zabunu. AI je sličnim dokumentima dodijelio slične, ali različite slobodne termine kao što su "imigracija", "imigracija", "naseljavanje". Kad nije preslikana u kontrolirani vokabular, ista je tema označena s tri različita pojma i razbacana u pretraživanju. Dosljednost je postignuta preslikavanjem pojmova u jedinstveni popis autoriteta. Lekcija: pojmovi tema nisu objavljeni, povezani su s popisom.

Četiri predloška za kopiranje

1) Pregled Dublin Corea:

Ekstrahirajte nacrt metapodataka Dublin Corea iz transkripcije dokumenta u nastavku. Polja: Naslov, Kreator, Predmet, Opis, Datum, Žanr, Jezik, Opseg (mjesto/razdoblje). Pravila: (1) U tekstu koristite samo JASNE informacije. (2) Polje koje nije u tekstu ostavite PRAZNO, ne pogađajte. (3) Označite vrijednost u koju niste sigurni s [?]. Prijepis: [ovdje]

2) ISAD(G) nacrt definicije:

Generirajte nacrt za sljedeći dokument u poljima ISAD(G): Naslov, Datum(i), Razina opisa (dokument/datoteka), Opseg i sadržaj (kratki sažetak), Kreator, Jezik. Referentnu šifru ostavite PRAZNU (dostavit će je ustanova). Nemojte dodavati informacije koje nisu u tekstu; Nepostojeće polje ostavite prazno. Dokument: [ovdje]

3) Prijedlog pojma teme (kontrolirano):

Predložite 3-5 pojmova teme koji odgovaraju dokumentu u nastavku. Prvo, oslonite se na činjenice U dokumentu. Ispod je popis kontrolirane terminologije naše ustanove; PRVO ga odaberite s ovog popisa, ako ga nema na popisu, označite svoj novi prijedlog pojma zasebno. Popis: [pojmovi]. Dokument: [ovdje]

4) Skupna provjera dosljednosti:

Ispod su zapisi metapodataka za dokumente iz iste zbirke. Nedosljednosti zastavica: zapisi koji različito pišu isto mjesto/osobu, različiti formati datuma, različiti izrazi za istu temu. Ispravak NAMETANJE; Samo napravite popis nedosljednosti koje će čovjek pregledati. Zapisi: [ovdje]

Slab upit / Jak upit

Slabo:

Izradite potpuni kataloški zapis za ovaj dokument.

"Potpuna" uputa tjera AI da ispuni svaki prostor, tj. da izmisli povijest i kreatore koji ne postoje.

Jako:

Dublinska jezgra izrađena je za ovaj dokument. Koristite samo podatke koji su JASNO uključeni u prijepis; ostavite nepostojeće polje prazno, nemojte pogađati. Odaberite pojmove teme s ovog kontroliranog popisa: [popis]. Označite datum i imena osoba s [?] kako bih to mogao potvrditi s dokumentom. Prijepis: [ovdje]

Razlika: dopuštenje "ostavi prazno" umjesto "potpuno" izdanje, kontrolirano pridržavanje popisa i oznake provjere štite katalog od izmišljanja.

Uobičajene greške

  • To znači "potpuno ispuniti". To dovodi do uklapanja nepostojećih polja; treba dati dopuštenje "ostavi prazno".
  • Otpuštanje uvjeta predmeta. Pojmovi koji se ne preslikavaju u kontrolirani vokabular ometat će pretraživanje.
  • AI predviđa povijest. Unošenje fiktivnog datuma u dokument bez datuma zagađuje katalog.
  • Imati referentni kod koji je generirao AI. Ovo je korporativni, jedinstveni prostor; ljudi bacaju.
  • Ne navodeći standard. Ako standard nije spomenut, rezultat će biti neuredan nacrt koji se ne može unijeti u instituciju.

Ukratko

Metapodaci i katalogizacija su nevidljiva infrastruktura koja otvara arhivu istraživaču, a zahtijeva puno truda. Iz transkripcije AI proizvodi brzi nacrt za polja kao što su datum, osoba, mjesto, predmet i žanr; Može raditi prema standardima kao što su ISAD(G) ili Dublin Core. Ali pritisak da se "potpuno ispuni" tjera AI da nadoknadi stvari; Dopuštenje "ostavi prazno", preslikavanje u kontrolirani vokabular i ljudska potvrda datuma/imena održavaju katalog pouzdanim. AI priprema nacrt; Vi ste odgovorni za točnost kataloga.

Zadatak aplikacije

Napravite transkripciju dokumenta i zatražite metapodatke od AI s predloškom "Dublin Core draft"; Provjerite ostavlja li prazna polja koja ne postoje. Zatim pokrenite predložak "prijedlog pojma teme" s vlastitim (ili oglednim) popisom za provjeru. Konačno, testirajte nekoliko zapisa s "skupnom provjerom dosljednosti". Zabilježite koliko polja umjetna inteligencija pokušava popuniti predviđanjem i koliko predmetnih izraza treba preslikati na popis.

popis za provjeru

  • [ ] Jasno sam naveo ciljni standard (ISAD(G)/Dublin Core).
  • [ ] Dao sam dopuštenje "Ostavi prazno polje praznim".
  • [ ] Preslikao sam pojmove teme na kontrolirani popis.
  • [ ] Ovjerio sam datum i imena osoba s dokumentom/nadležnim zapisom.
  • [ ] Referentni kod sam ostavio instituciji, a ne umjetnoj inteligenciji.