Dobici:
- Sposobnost izrade nacrta metapodataka u skladu sa standardima kao što su ISAD(G) ili Dublin Core sa umjetnom inteligencijom
- Sposobnost sprečavanja halucinacija i mapiranja predmetnih termina u kontrolirani vokabular uz dopuštenje ostave prazno
- Sposobnost razlikovanja koja polja, kao što su datum, ime osobe i referentni kod, zahtijevaju ljudsko odobrenje i koja bi trebala dodijeliti samo institucija
Arhiva ili biblioteka, koliko god da su bogati, ne mogu se pronaći ako nisu dobro definisani. Ono što dokument čini „pronaćivim“ su deskriptivne informacije o njemu: ko ga je napisao, kada, gdje, šta mu je predmet, kojoj zbirci pripada. Ove informacije se nazivaju metapodaci (metapodaci — deskriptivni podaci o dokumentu; „podaci o podacima“). Katalogizacija je proces identifikacije dokumenata sa ovim metapodacima i njihovo spremanje u sistem za pretraživanje. Klasifikacija je organizovanje dokumenata prema kriterijumima kao što su predmet, vrsta ili poreklo.
Generisanje metapodataka je izuzetno dugotrajno; Unošenje podataka o datumu, predmetu, osobi i mjestu pojedinačno za hiljade dokumenata u velikim zbirkama može potrajati godinama. AI je snažan generator propuha u ovom poslu. U ovoj jedinici ćemo vidjeti kako generirati metapodatke pomoću AI, katalogizirati u skladu sa standardima (ISAD(G), Dublin Core) i moći i zamke automatske klasifikacije.
Arhivski standardi: zašto su potrebni
Metapodaci se ne unose nasumično; Postoje međunarodni standardi da zapisi različitih institucija mogu međusobno razgovarati:
- ISAD(G) (Opšti međunarodni standardni arhivski opis): Pravila za hijerarhijski opisivanje arhivske građe (na nivou fonda, serije, dosijea, dokumenta). Sadrži polja kao što su referentni kod, naslov, datum, opseg, kreator.
- Dublin Core: Uobičajeni standard koji se sastoji od 15 osnovnih polja za opisivanje digitalnih resursa (naslov, kreator, tema, datum, žanr, format, izvor, jezik, itd.).
- Fondovi: Skup podataka koji je prirodno formiran kao rezultat aktivnosti jedne osobe, porodice ili institucije. To je osnovna organizaciona jedinica arhivske građe.
- Poreklo (poreklo): Informacija o tome od koga dolazi dokument i kroz koju ruku je prošao. U arhivi se dokumenti čuvaju zajedno prema porijeklu.
Eksplicitno specificiranje ciljnog standarda kada AI proizvodi metapodatke osigurava da se izlaz može direktno uneti u poduzeće.
Drugi ključni koncept je mjerodavni zapis – zapis koji definira jedinstveni, standardni, odobreni oblik imena osobe, mjesta ili institucije. U istorijskim dokumentima, ista osoba ili mjesto može se pojaviti s različitim načinima pisanja; Autoritetni zapis ih sve povezuje u jedan odobreni format kako se ne bi raspršili u pretraživanju. AI predlaže imena iz dokumenta; ali mapiranje ovog imena u standardni obrazac u mjerodavnom zapisu je ljudski rad. Povezivanje onoga što AI kaže "Ahmed" sa "Ahmed Beyom (1840-1912)" u nadležnom zapisu institucije čuva konzistentnost kataloga.
Tok rada: korak po korak
1. Pripremite izvor. Prikupite transkript ili sliku dokumenta i sve informacije o kontekstu.
2. Identifikujte standard i oblasti. Recite AI-u koji standard (ISAD(G), Dublin Core) i prema kojim poljima će proizvoditi izlaz.
3. Generirajte nacrt metapodataka. AI popunjava polja koja se mogu izdvojiti iz dokumenta (datum, osoba, mjesto, predmet, jezik, žanr); Ostavlja praznim područja koja ne može ukloniti.
4. Mapirajte kontrolirani vokabular. Nazivi predmeta i mesta nisu besplatni u većini institucija, već su vezani za unapred definisanu listu (kontrolisani rečnik/tezaurus). Mapirajte termine predmeta koje je predložila AI na ovu listu.
5. Potvrdite i potvrdite. Svako polje, posebno datum, ime i predmet, ljudska bića upoređuju sa dokumentima i evidencijama ovlaštenja.
Savjet: Eksplicitno dajte AI dozvolu da "ostavi prazno". U suprotnom će "pogoditi" popuniti datum ili kreator koji nije u dokumentu i umetnuti lažne metapodatke u vaš katalog. Instrukcija "Ostavite ovo polje prazno ako ga nema u dokumentu" je najjači štit od halucinacija.
Polja i nivo povjerenja u tabeli
Polje metapodataka
Koliko je AI pouzdan?
verifikacija
jezik
visoko
uzorak
Vrsta dokumenta
srednje visok
kontrolu
Imena osoba/mesta
Srednje (greška u čitanju)
obavezno
datum
Nisko-srednje (rizik od izrade)
obavezno
Predmetni uslovi
Srednji (besplatno generiranje)
Mapa do kontrolne liste
Obim/sažetak
srednje visok
Uporedite sa izvorom
Referentni kod
Nema (institucija daje)
ljudska bacanja
Sažetak: AI je brz i pouzdan u oblastima kao što su jezik i žanr; generiše nacrte u poljima kao što su datum, ime i predmet, ali je potrebno ljudsko odobrenje; AI nikada ne proizvodi institucionalna polja kao što je referentni kod.
tri mini kofera
Slučaj 1 — Nacrt metapodataka za 8.000 fotografija. Gradski arhiv je katalogizirao 8.000 istorijskih fotografija. Bilješke na poleđini svake fotografije su transkribovane i date AI; AI generiran datum, lokacija i nacrt teme. Ljudski tim ga je verificirao polje po polje i mapirao na kontroliranu listu. Procijenjeni 10-mjesečni posao smanjen je na 3 mjeseca; ali svaki datum i naziv mjesta su vizualno provjereni.
Slučaj 2 — Izmišljena istorija. Jedan arhivar je imao u katalogu AI pismo bez datuma. YZ je pogledao sadržaj pisma i precizno napisao datum "1912". Međutim, u dokumentu nije bilo datuma; AI predvidio. Da arhivar nije dodao instrukciju "ostaviti prazno ako nije u dokumentu", katalog bi bio popunjen sa dopunjenim datumom. Pouka: prazna dozvola je obavezna.
Slučaj 3 — Slobodni predmetni termini su stvorili zabunu. AI je sličnim dokumentima dodijelio slične, ali različite slobodne termine kao što su "imigracija", "imigracija", "naseljavanje". Kada nije mapirana u kontrolirani vokabular, ista tema je bila označena s tri različita pojma i raspršena u pretraživanju. Dosljednost je postignuta mapiranjem termina u jedinstvenu listu ovlaštenja. Lekcija: pojmovi teme nisu objavljeni, oni su povezani sa listom.
Četiri šablona za kopiranje
1) Pregled Dublinskog jezgra:
Izvucite nacrt metapodataka Dublin Core iz transkripcije dokumenta ispod. Polja: Naslov, Kreator, Predmet, Opis, Datum, Žanr, Jezik, Obim (lokacija/period). Pravila: (1) Koristite samo informacije JASNO u tekstu. (2) Ostavite polje koje nije u tekstu PRAZNO, ne pogađajte. (3) Označite vrijednost u koju niste sigurni sa [?]. Transkripcija: [ovdje]
2) ISAD(G) nacrt definicije:
Generirajte nacrt za sljedeći dokument u ISAD(G) poljima: Naslov, Datum(i), Nivo opisa (dokument/fajl), Obim i sadržaj (kratak sažetak), Kreator, Jezik. Referentni kod ostavite PRAZNIM (institucija će ga dati). Nemojte dodavati informacije koje nisu u tekstu; Nepostojeće polje ostavite praznim. Dokument: [ovdje]
3) Prijedlog termina teme (kontrolisano):
Predložite 3-5 termina za temu koji odgovaraju dokumentu u nastavku. Prvo, oslonite se na činjenice u dokumentu. Ispod je lista kontrolisane terminologije naše institucije; PRVO, izaberite ga sa ove liste, ako ga nema na listi, posebno označite svoj predlog novog termina. Lista: [uslovi]. Dokument: [ovdje]
4) Provjera konzistencije na veliko:
Ispod su zapisi metapodataka za dokumente iz iste zbirke. Označite nedosljednosti: zapisi u kojima se različito piše isto mjesto/osoba, različiti formati datuma, različiti termini za isti predmet. Correction IMPOSITION; Samo napravite listu nedosljednosti koju čovjek može pregledati. Zapisi: [ovdje]
Slaba prompt / Jaka prompt
slaba:
Kreirajte kompletan kataloški zapis za ovaj dokument.
“Kompletna” instrukcija tjera AI da popuni svaki prostor, odnosno da izmisli povijest i kreatore koji ne postoje.
Jaka:
Dublinsko jezgro je izrađeno za ovaj dokument. Koristite samo informacije JASNO uključene u transkripciju; ostavite nepostojeće polje praznim, nemojte pogađati. Odaberite pojmove teme sa ove kontrolisane liste: [list]. Označite datum i imena osoba sa [?] kako bih to mogao provjeriti u dokumentu. Transkripcija: [ovdje]
Razlika: dozvola "ostavi prazno" umjesto "kompletnog" izdanja, kontrolirano pridržavanje liste i oznake verifikacije štite katalog od fabrikacije.
Uobičajene greške
- To znači "ispuniti u potpunosti". Ovo dovodi do uklapanja nepostojećih polja; treba dati dozvolu "ostavi prazno".
- Objavljivanje termina predmeta. Termini koji se ne uklapaju u kontrolirani vokabular će odvratiti pretragu.
- Imati AI predviđanje istorije. Unošenje fiktivnog datuma u dokument bez datuma zagađuje katalog.
- Imati referentni kod generiran od strane AI. Ovo je korporativni, jedinstveni prostor; ljudi bacaju.
- Ne navodi standard. Ako standard nije spomenut, rezultat će biti neuredan nacrt koji se ne može unijeti u instituciju.
Ukratko
Metapodaci i katalogizacija su nevidljiva infrastruktura koja otvara arhiv istraživaču i zahtijeva mnogo truda. Iz transkripcije, AI proizvodi brzi pregled polja kao što su datum, osoba, mjesto, predmet i žanr; Može raditi u skladu sa standardima kao što su ISAD(G) ili Dublin Core. Ali pritisak da se „potpuno popuni“ gura AI da izmisli stvari; Dozvola „ostavite prazno“, mapiranje u kontrolirani vokabular i ljudska potvrda datuma/imena održavaju katalog pouzdanim. AI priprema nacrt; Vi ste odgovorni za tačnost kataloga.
Zadatak aplikacije
Uzmite transkripciju dokumenta i zatražite metapodatke od AI pomoću šablona „Dublin Core draft“; Provjerite ostavlja li prazna polja koja ne postoje. Zatim pokrenite predložak „predlog termina teme“ sa svojom (ili uzorkom) kontrolnom listom. Konačno, testirajte nekoliko zapisa s "provjerom konzistentnosti". Zabilježite koliko polja AI pokušava popuniti predviđanjem i koliko pojmova predmeta treba mapirati na listu.
kontrolna lista
- [ ] Jasno sam naveo ciljni standard (ISAD(G)/Dublin Core).
- [ ] Dao sam dozvolu "Ostavi prazno polje prazno".
- [ ] Mapirao sam pojmove teme u kontrolisanu listu.
- [ ] Provjerio sam datum i imena osoba sa dokumentom/ovlaštenom evidencijom.
- [ ] Referentni kod sam ostavio instituciji, a ne AI.