Dobici:
- Sposobnost izrade nacrta metapodataka u skladu sa standardima kao što su ISAD(G) ili Dublin Core s umjetnom inteligencijom
- Sposobnost sprječavanja halucinacija i preslikavanja predmetnih izraza u kontrolirani vokabular s dopuštenjem da ostane prazno
- Sposobnost razlikovanja koja polja, kao što su datum, ime osobe i referentni kod, zahtijevaju ljudsko odobrenje, a koja bi trebala dodijeliti samo institucija
Arhiva ili knjižnica, koliko god bila bogata, ne može se pronaći ako nije dobro definirana. Ono što dokument čini “pronaćivim” su opisne informacije o njemu: tko ga je napisao, kada, gdje, koja mu je tema, kojoj zbirci pripada. Te se informacije nazivaju metapodaci (metapodaci — opisni podaci o dokumentu; “podaci o podacima”). Katalogizacija je proces identificiranja dokumenata s ovim metapodacima i njihovo spremanje u sustavu koji se može pretraživati. Klasifikacija je organiziranje dokumenata prema kriterijima kao što su predmet, vrsta ili podrijetlo.
Generiranje metapodataka je izuzetno dugotrajno; Pojedinačno unošenje informacija o datumu, predmetu, osobi i mjestu za tisuće dokumenata u velikim zbirkama može trajati godinama. AI je snažan generator nacrta u ovom poslu. U ovoj jedinici vidjet ćemo kako generirati metapodatke pomoću umjetne inteligencije, katalogizirati u skladu sa standardima (ISAD(G), Dublin Core), te moći i zamke automatske klasifikacije.
Arhivski standardi: zašto su potrebni
Metapodaci se ne unose nasumično; Postoje međunarodni standardi kako bi zapisi iz različitih institucija mogli međusobno komunicirati:
- ISAD(G) (General International Standard Archival Description): Pravila za hijerarhijski opis arhivskoga gradiva (na razini fonda, serije, spisa, dokumenta). Sadrži polja kao što su referentni kod, naslov, datum, opseg, kreator.
- Dublin Core: Zajednički standard koji se sastoji od 15 ključnih polja za opisivanje digitalnih izvora (naslov, kreator, predmet, datum, žanr, format, izvor, jezik itd.).
- Fondovi: skup zapisa koji su prirodno nastali kao rezultat aktivnosti jedne osobe, obitelji ili institucije. Osnovna je organizacijska jedinica arhivistike.
- Provenencija (podrijetlo): Podaci o tome od koga dokument potječe i kroz koju je ruku prošao. Dokumenti se u arhivistici čuvaju zajedno prema podrijetlu.
Eksplicitno određivanje ciljnog standarda kada AI proizvodi metapodatke osigurava da se izlaz može izravno unijeti u poduzeće.
Još jedan ključni koncept je normativni zapis—zapis koji definira jedan, standardni, odobreni oblik imena osobe, mjesta ili institucije. U povijesnim dokumentima, ista osoba ili mjesto mogu se pojaviti s različitim načinima pisanja; Ovjereni zapis povezuje ih sve u jedan odobreni format kako se ne bi raspršili u pretraživanju. AI predlaže imena iz dokumenta; ali preslikavanje ovog imena u standardni oblik u normativnom zapisu ljudski je posao. Povezivanje onoga što AI kaže "Ahmed" s "Ahmed Bey (1840-1912)" u autoritetnom zapisu institucije čuva dosljednost kataloga.
Tijek rada: korak po korak
1. Pripremite izvor. Prikupite prijepis ili sliku dokumenta i sve informacije o kontekstu.
2. Identificirajte standard i područja. Recite AI-u koji će standard (ISAD(G), Dublin Core) i prema kojim poljima proizvesti izlaz.
3. Generirajte nacrt metapodataka. AI ispunjava polja koja se mogu izdvojiti iz dokumenta (datum, osoba, mjesto, predmet, jezik, žanr); Ostavlja prazna područja koja ne može ukloniti.
4. Mapirajte kontrolirani vokabular. Nazivi predmeta i mjesta nisu besplatni u većini institucija, već su vezani uz unaprijed definirani popis (kontrolirani vokabular / tezaurus). Preslikajte pojmove predmeta koje je AI predložio na ovaj popis.
5. Provjerite i potvrdite. Svako polje, posebno datum, ime i predmet, ljudska bića uspoređuju s dokumentima i zapisima autoriteta.
Savjet: izričito dajte AI dopuštenje da "ostavi prazno". Inače će "pogoditi" ispuniti datum ili kreatora koji nije u dokumentu i umetnuti lažne metapodatke u vaš katalog. Uputa "Ostavite ovo polje praznim ako ga nema u dokumentu" najjači je štit protiv halucinacija.
Polja i razina povjerenja u tablici
Polje metapodataka
Koliko je AI pouzdan?
provjera
jeziku
visoka
uzorak
Vrsta dokumenta
srednje-visoka
kontrola
Imena osoba/mjesta
Srednje (pogreška čitanja)
obavezna
datum
Nizak-srednji (rizik od fabrikacije)
obavezna
Predmetni pojmovi
Srednje (slobodno generiranje)
Karta na kontrolni popis
Opseg/sažetak
srednje-visoka
Usporedi s izvorom
Referentni kod
Ništa (institucija daje)
ljudska bacanja
Sažetak: AI je brz i pouzdan u područjima kao što su jezik i žanr; generira nacrte u poljima kao što su datum, ime i predmet, ali potrebno je ljudsko odobrenje; AI nikada ne proizvodi institucionalna polja kao što je referentni kod.
tri mini kućišta
Slučaj 1 — Nacrt metapodataka za 8000 fotografija. Gradski arhiv katalogizirao je 8000 povijesnih fotografija. Bilješke na poleđini svake fotografije su prepisane i predane AI; AI generirao datum, mjesto i pregled teme. Ljudski tim to je potvrdio polje po polje i preslikao na kontrolirani popis. Procijenjeni 10-mjesečni posao smanjen je na 3 mjeseca; ali svaki datum i ime mjesta bili su vizualno provjereni.
Slučaj 2 — Izmišljena povijest. Arhivist je dao umjetnoj inteligenciji da katalogizira nedatirano pismo. YZ je pogledao sadržaj pisma i precizno napisao datum "1912". Međutim, u dokumentu nije bilo datuma; AI je predvidio. Da arhivist nije dodao uputu "ostaviti prazno ako nije u dokumentu", katalog bi bio popunjen s izmišljenim datumom. Lekcija: prazno dopuštenje je obavezno.
Slučaj 3 — Izrazi slobodnih tema stvorili su zabunu. AI je sličnim dokumentima dodijelio slične, ali različite slobodne termine kao što su "imigracija", "imigracija", "naseljavanje". Kad nije preslikana u kontrolirani vokabular, ista je tema označena s tri različita pojma i razbacana u pretraživanju. Dosljednost je postignuta preslikavanjem pojmova u jedinstveni popis autoriteta. Lekcija: pojmovi tema nisu objavljeni, povezani su s popisom.
Četiri predloška za kopiranje
1) Pregled Dublin Corea:
Ekstrahirajte nacrt metapodataka Dublin Corea iz transkripcije dokumenta u nastavku. Polja: Naslov, Kreator, Predmet, Opis, Datum, Žanr, Jezik, Opseg (mjesto/razdoblje). Pravila: (1) U tekstu koristite samo JASNE informacije. (2) Polje koje nije u tekstu ostavite PRAZNO, ne pogađajte. (3) Označite vrijednost u koju niste sigurni s [?]. Prijepis: [ovdje]
2) ISAD(G) nacrt definicije:
Generirajte nacrt za sljedeći dokument u poljima ISAD(G): Naslov, Datum(i), Razina opisa (dokument/datoteka), Opseg i sadržaj (kratki sažetak), Kreator, Jezik. Referentnu šifru ostavite PRAZNU (dostavit će je ustanova). Nemojte dodavati informacije koje nisu u tekstu; Nepostojeće polje ostavite prazno. Dokument: [ovdje]
3) Prijedlog pojma teme (kontrolirano):
Predložite 3-5 pojmova teme koji odgovaraju dokumentu u nastavku. Prvo, oslonite se na činjenice U dokumentu. Ispod je popis kontrolirane terminologije naše ustanove; PRVO ga odaberite s ovog popisa, ako ga nema na popisu, označite svoj novi prijedlog pojma zasebno. Popis: [pojmovi]. Dokument: [ovdje]
4) Skupna provjera dosljednosti:
Ispod su zapisi metapodataka za dokumente iz iste zbirke. Nedosljednosti zastavica: zapisi koji različito pišu isto mjesto/osobu, različiti formati datuma, različiti izrazi za istu temu. Ispravak NAMETANJE; Samo napravite popis nedosljednosti koje će čovjek pregledati. Zapisi: [ovdje]
Slab upit / Jak upit
Slabo:
Izradite potpuni kataloški zapis za ovaj dokument.
"Potpuna" uputa tjera AI da ispuni svaki prostor, tj. da izmisli povijest i kreatore koji ne postoje.
Jako:
Dublinska jezgra izrađena je za ovaj dokument. Koristite samo podatke koji su JASNO uključeni u prijepis; ostavite nepostojeće polje prazno, nemojte pogađati. Odaberite pojmove teme s ovog kontroliranog popisa: [popis]. Označite datum i imena osoba s [?] kako bih to mogao potvrditi s dokumentom. Prijepis: [ovdje]
Razlika: dopuštenje "ostavi prazno" umjesto "potpuno" izdanje, kontrolirano pridržavanje popisa i oznake provjere štite katalog od izmišljanja.
Uobičajene greške
- To znači "potpuno ispuniti". To dovodi do uklapanja nepostojećih polja; treba dati dopuštenje "ostavi prazno".
- Otpuštanje uvjeta predmeta. Pojmovi koji se ne preslikavaju u kontrolirani vokabular ometat će pretraživanje.
- AI predviđa povijest. Unošenje fiktivnog datuma u dokument bez datuma zagađuje katalog.
- Imati referentni kod koji je generirao AI. Ovo je korporativni, jedinstveni prostor; ljudi bacaju.
- Ne navodeći standard. Ako standard nije spomenut, rezultat će biti neuredan nacrt koji se ne može unijeti u instituciju.
Ukratko
Metapodaci i katalogizacija su nevidljiva infrastruktura koja otvara arhivu istraživaču, a zahtijeva puno truda. Iz transkripcije AI proizvodi brzi nacrt za polja kao što su datum, osoba, mjesto, predmet i žanr; Može raditi prema standardima kao što su ISAD(G) ili Dublin Core. Ali pritisak da se "potpuno ispuni" tjera AI da nadoknadi stvari; Dopuštenje "ostavi prazno", preslikavanje u kontrolirani vokabular i ljudska potvrda datuma/imena održavaju katalog pouzdanim. AI priprema nacrt; Vi ste odgovorni za točnost kataloga.
Zadatak aplikacije
Napravite transkripciju dokumenta i zatražite metapodatke od AI s predloškom "Dublin Core draft"; Provjerite ostavlja li prazna polja koja ne postoje. Zatim pokrenite predložak "prijedlog pojma teme" s vlastitim (ili oglednim) popisom za provjeru. Konačno, testirajte nekoliko zapisa s "skupnom provjerom dosljednosti". Zabilježite koliko polja umjetna inteligencija pokušava popuniti predviđanjem i koliko predmetnih izraza treba preslikati na popis.
popis za provjeru
- [ ] Jasno sam naveo ciljni standard (ISAD(G)/Dublin Core).
- [ ] Dao sam dopuštenje "Ostavi prazno polje praznim".
- [ ] Preslikao sam pojmove teme na kontrolirani popis.
- [ ] Ovjerio sam datum i imena osoba s dokumentom/nadležnim zapisom.
- [ ] Referentni kod sam ostavio instituciji, a ne umjetnoj inteligenciji.