Jedinica 2 / 11

Umjetna inteligencija u katalogizaciji i generiranju metapodataka

Dobici:

  • Sposobnost skraćivanja vremena katalogizacije izradom nacrta metapodataka u skladu sa standardima kao što su MARC i Dublin Core iz stvarnih informacija o otisku
  • Sposobnost provjere polja s visokim rizikom od izmišljanja, kao što su godina izdanja, ISBN, ime autora, sa izvornim izvorom i terminima teme mape iz kontroliranog rječnika
  • Sposobnost da se autorski i predmetni formati postave jednokratno odobreni uz kontrolu ovlaštenja i održavanje konzistentnosti kataloga

Katalogizacija je nevidljivi, ali najosnovniji posao bibliotekarstva. Otkrivanje izvora (knjiga, članak, mapa, zvučni zapis, digitalni fajl) moguće je uz ispravne metapodatke. Metapodaci znače “podaci o podacima”: strukturirane informacije koje opisuju naslov izvora, autora, godinu izdanja, predmet, jezik i fizičke atribute. Ako su metapodaci dobri, korisnik pronalazi resurs; Ako je loš ili nepotpun, resurs se gubi čak i ako postoji. U ovoj ćete jedinici naučiti kako koristiti umjetnu inteligenciju u generiranju nacrta metapodataka, ali kako osigurati usklađenost i tačnost standarda.

Hajde da prvo definišemo dva koncepta. MARC (Machine-Readable Cataloging) je format zapisa koji biblioteke koriste decenijama i koji stavlja svaku informaciju u numerisana polja; Na primjer, polje 245 sadrži naslov, a polje 100 glavnog autora. Dublin Core je pojednostavljeni standard metapodataka za digitalne resurse, koji se sastoji od 15 osnovnih polja (naslov, kreator, tema, datum, žanr, itd.). Ovi standardi osiguravaju da zapisi iz različitih biblioteka mogu međusobno razgovarati.

Korak po korak: generiranje nacrta metapodataka pomoću umjetne inteligencije

1. Prikupite podatke o identitetu izvora. Korice knjige, naslovna strana, sadržaj ili tekst digitalne datoteke. AI radi samo na osnovu informacija koje mu date; Ako date nepotpune informacije, to proizvodi nepotpune ili izmišljene metapodatke.

2. Odredite ciljni standard. Dajte AI jasnu metu, kao što je "po poljima Dublin Core" ili "po MARC 245, 100, 260, 650 polja". Ako ne navedete standard, on proizvodi proizvoljan format.

3. Napravite nacrt. AI izrađuje naslov, izjavu o odgovornosti, informacije o publikaciji i prijedlog teme iz informacija koje date.

4. Vršiti kontrolu ovlaštenja. Mjerodavni zapis je onaj koji uspostavlja jedinstveni, standardni oblik imena autora, institucije ili subjekta (npr. "Ataturk, Mustafa Kemal, 1881-1938"). AI može napisati ime na različite načine; Provjeravate i ispravljate odobreni format ovlaštenja.

5. Potvrdite i potvrdite. Uporedite svako polje sa originalnim izvorom. Konkretno, precizne informacije kao što su godina izdanja, ISBN i ime autora su veoma podložne krivotvorenju od strane AI.

Savjet: dajte AI-u fotografiju ili tekst stvarne kreditne stranice izvora; Nemojte reći "pogodi naziv knjige". Prediktivni metapodaci potkopavaju pouzdanost kataloga. AI piše samouvjereno kada predviđa predviđanja, a to će vas dovesti u zabludu.

Kontrolirani vokabular i dosljednost

Dosljednost je sve u katalogizaciji. Ako je ista tema napisana sa dva različita pojma u dva različita zapisa, korisnik će pronaći jedan, a propustiti drugi. Zato biblioteke koriste kontrolisani rečnik — odobrenu, standardnu ​​listu termina. Kada predlaže termine iz slobodnog teksta, AI može izabrati njegov kolokvijalni ekvivalent umjesto službenog termina na ovoj listi. Na primjer, AI bi mogao napisati "srčani udar"; dok odobreni termin može biti "infarkt miokarda".

Rješenje je dati AI kontrolirani vokabular i reći "samo izaberi s ove liste". Dakle, umjesto da slobodno izmišlja uslove, AI odgovara najprikladnijem sa odobrene liste.

Oprez: Ako predmetni termin koji je predložila AI nije u kontrolisanom rečniku, nemojte dodavati taj termin u katalog. Odluka o dodavanju novih termina je na stručnjaku odgovornom za upravljanje ovlaštenjima; Dodavanje proizvoljnih termina narušava konzistentnost kataloga.

tri mini kofera

Slučaj 1 — Ubrzano prikupljanje donacija. Narodna biblioteka dobila je donaciju od 1.200 knjiga. Specijalista za katalogizaciju je dao AI da pročita stranicu otiska svake knjige i izradi nacrt Dublinskog jezgra; Vrijeme po snimanju smanjeno je sa 9 minuta na 3,5 minuta. Vještak je preostalo vrijeme posvetio provjeravanju i verifikaciji ovlaštenja; Ukupno vrijeme je smanjeno za otprilike 55%, ali nijedan zapis nije ušao u sistem bez provjere.

Slučaj 2 — Lažni ISBN uhvaćen. Stručnjak je dao AI izraditi nacrte 30 knjiga. Tokom provere, otkrio je da je ISBN u 4 zapisa lažan: AI je napisao 13-cifreni broj koji se činio razumnim, iako nije znao pravi broj knjige. Korak verifikacije spriječio je da četiri pogrešna ISBN-a postanu trajna u katalogu.

Slučaj 3 — Nedosljednost ovlaštenja ispravljena. Biblioteka je pronašla autora kao "J. Smith" u nekim zapisima, "John Smith" u drugim, "Smith, John" u drugim. AI je uparen sa autoritetnom datotekom, dovodeći sve zapise u jedan odobreni format ("Smith, John, 1965-"); Kada bi se ovaj posao obavljao ručno, trajalo bi danima, ali uz sugestiju AI, to je smanjeno na nekoliko sati, ali je svaki meč odobren od strane stručnjaka.

Retrospektivna konverzija i stari zapisi

Mnoge biblioteke imaju nepotpune ili zastarjele zapise koji su uneseni prije nekoliko godina po drugačijim pravilima. Premještanje ovih na trenutni standard naziva se retrospektivna konverzija i vrlo je naporno kada se radi ručno. AI može pročitati stari zapis i generirati nacrt kako bi ga premjestio u trenutnu strukturu polja: na primjer, može raščlaniti citat slobodnog teksta i distribuirati ga u ispravna polja. Međutim, ovdje postoje dvije opasnosti. Prvo, AI može nadoknaditi informacije koje nedostaju da bi ih “nadoknadio”; drugo, može produžiti grešku u starom zapisu tako što će ga kopirati u novi format umjesto da ga ispravlja. Stoga, u retrospektivnoj transformaciji, izlaz AI treba sistematski provjeravati, ne uzorkovanjem, već kritičnim poljima (autor, godina, identifikacioni brojevi). Dobra praksa je da se zapisi prije i nakon konverzije prikazuju jedan pored drugog, čineći svaku promjenu vidljivom; tako da stručnjak može na prvi pogled da vidi šta je pomereno, šta se promenilo i šta je možda izmišljeno.

Pažnja: Nacrt metapodataka proizveden od strane AI ne bi trebalo da se prenosi u sistem kao grupa bez pregleda jednog po jednog. Masovna greška kvari stotine zapisa odjednom, a vraćanje je mnogo problematičnije od proizvodnje. Najsigurnije je proizvoditi i verificirati u malim serijama.

Četiri šablona za kopiranje

1) Pregled Dublinskog jezgra:

Vaša uloga: pomoćnik katalogizatora. Popunite polja Dublin Core iz sljedećeg teksta autora: Naslov, Kreator, Predmet, Opis, Izdavač, Datum, Žanr, Format, Jezik. Koristite samo informacije koje su jasne u tekstu; Ostavite polje koje nedostaje "[bez informacija]", nemojte pogađati. Tekst impresuma: [ovdje]

2) MARC okvir polja:

Predložite okvire za sljedeća MARC polja iz informacija o knjizi: 245 (naslov/kredit), 100 (glavni autor), 260/264 (publikacija), 300 (fizički opis), 650 (predmet). Označite polje za koje niste sigurni kao "[potrebna je provjera]". Informacije: [ovdje]

3) Podudaranje tema iz kontrolisanog rečnika:

Ispod je sažetak izvora i lista odobrenih termina teme. Spojite samo 3-5 najprikladnijih pojmova sa liste sa izvorom. Ako na listi nema odgovarajućeg pojma, napišite "nema odgovarajućeg pojma na listi", nemojte izmišljati nove pojmove. Sažetak: [ovdje] / Lista termina: [ovdje]

4) Kontrola obrasca ovlaštenja:

Usporedite imena autora ispod sa odobrenim obrascima na listi ovlaštenja koju sam dao. Za svako ime: format u zapisu -> odobreni format. Ako na listi nema ekvivalenta, napišite "bez ovlaštenog zapisa". Imena: [ovdje] / Lista ovlaštenja: [ovdje]

Slaba prompt / Jaka prompt

Slab upit:

Izdvojite kataloške informacije za sljedeću knjigu: "Vještačka inteligencija i društvo".

Dat je samo naslov; AI je prisiljen da izmisli autora, godinu, izdavača i ISBN. Ne postoji ciljni standard. Rezultat: uvjerljiv, ali vjerovatno lažan zapis.

Snažan upit:

Vaša uloga: pomoćnik katalogizatora. Ispod je cijeli tekst stranice impresuma knjige. Popunite polja Dublin Core iz ovoga. Koristite samo informacije koje su jasno navedene u tekstu; Ostavite polje koje nije tekstualno prazno i ​​napišite "[bez informacija]". Nisu izmišljeni datumi, imena ili ISBN-ovi. Tekst impresuma: [ceo tekst ovde]

Snažan prompt ograničava AI na stvarne informacije o autorskim linijama i prisiljava ga da iskreno ostavi praznine umjesto da ih izmišlja.

Polje metapodataka i tabela validacije

području

Rizik od fabrikacije

Kako provjeriti

Naslov

nisko

Uporedite sa stranicom otiska

Format autora/autoriteta

srednje

Traži u ovlaštenom fajlu

Godina izdanja

visoko

Potvrdite otiskom/kolofonom

ISBN

veoma visoko

Kontrola jedan na jedan sa bar kodom/izvorom

Predmetni termin

visoko

Podudaranje u kontrolisanom rečniku

Uobičajene greške

  • Samo tražim metapodatke iz naslova. Nepotpune informacije tjeraju AI da izmisli stvari.
  • Ne navodi se ciljni standard. Proizvoljno formatiranje narušava harmoniju zapisa.
  • Prihvatanje ISBN i godine bez verifikacije. Ova područja nose najveći rizik od fabrikacije.
  • Preuzimanje predmetnog termina izvan kontrolisanog rečnika. Dosljednost i dostupnost su ugroženi.
  • Zaobilazeći kontrolu autoriteta. Isti autor se raspršuje u različitim formatima, korisniku nedostaje izvor.

Ukratko

U generiranju metapodataka, AI je moćan asistent koji brzo izdvaja informacije o otiscima i značajno skraćuje vrijeme katalogizacije. Ali cijena produktivnosti je stroga validacija u odnosu na rizike izmišljotine: učinite ciljni standard (MARC, Dublin Core) jasnim, pokrenite AI samo sa stvarnim poznavanjem riječi, mapirajte termine predmeta iz kontroliranih rječnika i potvrdite obrasce ovlaštenja. Umjesto da nadoknađuje praznine, AI bi ga trebao iskreno ostaviti praznim; Zadržavate konačno odobrenje.

Zadatak aplikacije

Dajte tekst stranice za otisak prave knjige koju imate AI sa šablonom "Dublin Core draft" i dobijte nacrt. Zatim napravite istu knjigu samo sa naslovom ("Slab upit") i uporedite dva rezultata: koja su polja izmišljena? Zatim, uz predložak "Mapiranje tema iz kontroliranog rječnika", dajte kratku listu odobrenih pojmova kako biste dobili podudaranje teme i provjerite da li AI nestaje s liste.

kontrolna lista

  • [ ] Dao sam prave podatke o identitetu izvora AI, nisam ostavio to na nagađanje.
  • [ ] Jasno sam specificirao ciljni standard metapodataka (MARC/Dublin Core).
  • [ ] Provjerio sam godinu izdanja i ISBN doslovno sa originalnim izvorom.
  • [ ] Mapirao sam termine teme iz kontrolisanog rečnika.
  • [ ] Potvrdio sam oblike ovlaštenja odobrenim zapisnikom.