Jedinica 2 / 11

Umjetna inteligencija u katalogizaciji i generiranju metapodataka

Dobici:

  • Sposobnost skraćivanja vremena katalogizacije izradom nacrta metapodataka u skladu sa standardima kao što su MARC i Dublin Core iz stvarnih informacija o impresumu
  • Sposobnost provjere polja s visokim rizikom krivotvorenja, kao što su godina izdanja, ISBN, ime autora, s izvornim izvorom i kartografskim terminima iz kontroliranog rječnika
  • Sposobnost da se autorski i predmetni formati jednokratno odobre uz kontrolu autoriteta i održavanje dosljednosti kataloga

Katalogizacija je nevidljiv, ali najosnovniji posao knjižničarstva. Otkrivanje izvora (knjiga, članak, karta, zvučna snimka, digitalna datoteka) moguće je uz točne metapodatke. Metapodaci znače "podatke o podacima": strukturirane informacije koje opisuju naslov izvora, autora, godinu izdanja, temu, jezik i fizičke atribute. Ako su metapodaci dobri, korisnik pronalazi izvor; Ako je loš ili nepotpun, resurs se gubi čak i ako postoji. U ovoj ćete jedinici naučiti kako koristiti umjetnu inteligenciju u generiranju nacrta metapodataka, ali i kako osigurati usklađenost sa standardima i točnost.

Najprije definirajmo dva pojma. MARC (Machine-Readable Cataloging) je format zapisa koji knjižnice koriste desetljećima i koji svaki podatak stavlja u numerirana polja; Na primjer, polje 245 sadrži naslov, a polje 100 sadrži glavnog autora. Dublin Core je pojednostavljeni standard metapodataka za digitalne izvore koji se sastoji od 15 osnovnih polja (naslov, kreator, predmet, datum, žanr itd.). Ovi standardi osiguravaju da zapisi iz različitih knjižnica mogu međusobno komunicirati.

Korak po korak: generiranje nacrta metapodataka s umjetnom inteligencijom

1. Prikupite informacije o identitetu izvora. Naslovnica knjige, naslovna stranica, sadržaj ili tekst digitalne datoteke. AI radi samo na temelju informacija koje mu date; Ako pružite nepotpune informacije, to proizvodi nepotpune ili izmišljene metapodatke.

2. Navedite ciljani standard. Dajte AI-u jasan cilj, kao što je "prema poljima Dublin Corea" ili "prema poljima MARC 245, 100, 260, 650." Ako ne navedete standard, proizvodi se proizvoljni format.

3. Napravite nacrt. AI izrađuje naslov, izjavu o odgovornosti, informacije o publikaciji i prijedlog teme na temelju informacija koje date.

4. Obavljajte kontrolu autoriteta. Mjerodavni zapis je onaj koji uspostavlja jedan, standardni oblik imena autora, institucije ili teme (npr. "Atatürk, Mustafa Kemal, 1881-1938"). AI može napisati ime na različite načine; Provjeravate i ispravljate odobreni format ovlaštenja.

5. Provjerite i potvrdite. Usporedite svako polje s izvornim izvorom. Konkretno, precizne informacije kao što su godina izdanja, ISBN i ime autora vrlo su osjetljive na krivotvorenje pomoću umjetne inteligencije.

Savjet: dajte umjetnoj inteligenciji fotografiju ili tekst stvarne kreditne stranice izvora; Nemojte reći "pogodi ime knjige". Prediktivni metapodaci potkopavaju pouzdanost kataloga. AI piše samouvjereno kada daje predviđanja, a to će vas dovesti u zabludu.

Kontrolirani vokabular i dosljednost

Dosljednost je sve u katalogizaciji. Ako je ista tema napisana s dva različita pojma u dva različita zapisa, korisnik će pronaći jedan, a propustiti drugi. Zato knjižnice koriste kontrolirani vokabular — odobreni, standardni popis pojmova. Kada predlaže pojmove iz slobodnog teksta, umjetna inteligencija može izabrati njegov kolokvijalni ekvivalent umjesto službenog izraza na ovom popisu. Na primjer, AI bi mogao napisati "srčani udar"; dok odobreni termin može biti "infarkt miokarda".

Rješenje je dati AI-u kontrolirani vokabular i reći "samo odaberite s ovog popisa". Dakle, umjesto da slobodno izmišlja uvjete, AI pronalazi najprikladnije s odobrenog popisa.

Oprez: Ako predmetni pojam koji je predložio AI nije u kontroliranom vokabularu, nemojte dodavati taj pojam u katalog. Odluka o dodavanju novih pojmova je na stručnjaku odgovornom za upravljanje autoritetom; Dodavanje proizvoljnih pojmova narušava dosljednost kataloga.

tri mini kućišta

Slučaj 1 — Ubrzano prikupljanje donacija. Narodna knjižnica dobila je donaciju od 1200 knjiga. Stručnjak za katalogizaciju dao je umjetnoj inteligenciji da pročita stranicu impresuma svake knjige i izradi nacrt Dublinske jezgre; Vrijeme snimanja smanjeno je s 9 minuta na 3,5 minute. Preostalo vrijeme vještak je posvetio autoritetnoj provjeri i provjeri; Ukupno vrijeme smanjeno je za otprilike 55%, ali niti jedan zapis nije ušao u sustav bez provjere.

Slučaj 2 — Uhvaćen lažni ISBN. Stručnjak je dao umjetnoj inteligenciji da izradi nacrte 30 knjiga. Tijekom provjere otkrio je da je ISBN u 4 zapisa lažan: AI je napisao 13-znamenkasti broj koji se činio razumnim, iako nije znao pravi broj knjige. Korak provjere spriječio je da četiri netočna ISBN-a postanu postojana u katalogu.

Slučaj 3 — Ispravljena nedosljednost ovlaštenja. Knjižnica je pronašla autora kao "J. Smith" u nekim zapisima, "John Smith" u drugima, "Smith, John" u trećima. AI je usklađen s normativnom datotekom, dovodeći sve zapise u jedan odobreni format ("Smith, John, 1965-"); Kada bi se ovaj posao radio ručno, trajao bi danima, ali uz AI sugestiju sveo se na nekoliko sati, ali je svaki meč odobren od strane stručnjaka.

Retrospektivna konverzija i stari zapisi

Mnoge knjižnice imaju nepotpune ili zastarjele zapise koji su uneseni prije nekoliko godina prema drugačijim pravilima. Njihovo premještanje na trenutni standard naziva se retrospektivna konverzija i vrlo je naporno kada se radi ručno. AI može pročitati stari zapis i generirati nacrt kako bi ga premjestio u trenutnu strukturu polja: na primjer, može analizirati citat slobodnog teksta i distribuirati ga u ispravna polja. Međutim, ovdje postoje dvije opasnosti. Prvo, AI može nadoknaditi informacije koje nedostaju da bi se "nadoknadile"; drugo, može ovjekovječiti pogrešku u starom zapisu kopiranjem u novi format umjesto da ga ispravlja. Stoga, u retrospektivnoj transformaciji, izlaz AI treba sustavno provjeravati, ne uzorkovanjem, već kritičnim poljima (autor, godina, identifikacijski brojevi). Dobra praksa je prikazati zapise prije i nakon konverzije jedan pored drugog, čineći svaku promjenu vidljivom; tako da stručnjak može na prvi pogled vidjeti što je pomaknuto, što je promijenjeno, a što je možda izmišljeno.

Pažnja: Nacrti metapodataka koje proizvodi AI ne bi se trebali prenijeti u sustav kao serija bez pregledavanja jednog po jednog. Masovna pogreška kvari stotine zapisa odjednom, a dohvaćanje je mnogo problematičnije od proizvodnje. Najsigurnije je proizvoditi i ovjeravati u malim serijama.

Četiri predloška za kopiranje

1) Pregled Dublin Corea:

Vaša uloga: pomoćni katalogizator. Ispunite polja Dublin Corea iz sljedećeg autorskog teksta: Naslov, Kreator, Predmet, Opis, Izdavač, Datum, Žanr, Format, Jezik. Koristite samo informacije koje su jasne u tekstu; Ostavite polje koje nedostaje "[bez informacija]", nemojte nagađati. Tekst impresuma: [ovdje]

2) Pregled MARC polja:

Predložite nacrte za sljedeća MARC polja iz informacija o knjizi u nastavku: 245 (naslov/zasluge), 100 (glavni autor), 260/264 (publikacija), 300 (fizički opis), 650 (predmet). Označite svako polje za koje niste sigurni kao "[potrebna je provjera]". Informacije: [ovdje]

3) Spajanje tema iz kontroliranog vokabulara:

Ispod je sažetak izvora i popis odobrenih pojmova za teme. Povežite samo 3-5 najprikladnijih pojmova s ​​popisa s izvorom. Ako u popisu nema odgovarajućeg pojma, napišite "nema odgovarajućeg pojma u popisu", nemojte izmišljati nove pojmove. Sažetak: [ovdje] / Popis pojmova: [ovdje]

4) Kontrola oblika ovlaštenja:

Spojite imena autora u nastavku s odobrenim obrascima na popisu autoriteta koji sam dao. Za svaki naziv: format u zapisu -> odobreni format. Ako na popisu nema ekvivalenta, napišite "bez normativnog zapisa". Imena: [ovdje] / Popis autoriteta: [ovdje]

Slab upit / Jak upit

Slab upit:

Izdvojite kataloške informacije za sljedeću knjigu: "Umjetna inteligencija i društvo".

Naveden je samo naslov; AI je prisiljen izmisliti autora, godinu, izdavača i ISBN. Ne postoji ciljni standard. Rezultat: uvjerljiv, ali vjerojatno lažan zapis.

Snažan upit:

Vaša uloga: pomoćni katalogizator. Ispod je cijeli tekst impresum stranice knjige. Ispunite Dublin Core polja iz ovoga. Koristite samo informacije koje su jasno navedene u tekstu; Ostavite polje koje nije tekst prazno i ​​napišite "[bez informacija]". Nema izmišljenih datuma, imena ili ISBN-a. Tekst impresuma: [cijeli tekst ovdje]

Snažni prompt ograničava AI na stvarne podatke o autoru i tjera ga da iskreno ostavi praznine umjesto da ih izmišlja.

Polje metapodataka i validacijska tablica

područje

Rizik od fabrikacije

Kako provjeriti

Naslov

nizak

Usporedi sa impresum stranicom

Format autora/autoriteta

srednji

Traži u autoritetnoj datoteci

Godina izdanja

visoka

Potvrdite impresumom/kolofonom

ISBN

vrlo visoko

Kontrola jedan na jedan s barkodom/izvorom

Predmetni pojam

visoka

Podudaranje u kontroliranom vokabularu

Uobičajene greške

  • Samo tražim metapodatke iz naslova. Nepotpune informacije tjeraju umjetnu inteligenciju da izmišlja stvari.
  • Ne navodeći ciljani standard. Proizvoljno oblikovanje narušava sklad zapisa.
  • Prihvaćanje ISBN-a i godine bez provjere. Ova područja nose najveći rizik od pretvorbe.
  • Uzimanje predmetnog pojma izvan kontroliranog vokabulara. Dosljednost i dostupnost su ugroženi.
  • Zaobilazeći kontrolu autoriteta. Isti autor raspršuje se u različitim formatima, korisniku nedostaje izvor.

Ukratko

U generiranju metapodataka, umjetna inteligencija je moćan pomoćnik koji brzo izvlači informacije o impresumu i značajno skraćuje vrijeme katalogizacije. Ali cijena produktivnosti je stroga provjera valjanosti u odnosu na rizike izmišljanja: učinite ciljni standard (MARC, Dublin Core) jasnim, pokrenite AI samo sa stvarnim znanjem riječi, mapirajte predmetne termine iz kontroliranih rječnika i potvrdite autoritete. Umjesto da nadoknađuje praznine, AI bi ga iskreno trebao ostaviti praznim; Vi zadržavate konačno odobrenje.

Zadatak aplikacije

Dajte tekst stranice impresuma prave knjige koju imate AI-u s predloškom "Dublin Core draft" i dobijte nacrt. Zatim napravite istu knjigu samo s naslovom ("Slab upit") i usporedite dva rezultata: koja su polja izmišljena? Zatim, uz predložak "Mapiranje teme iz kontroliranog vokabulara", dajte kratak popis odobrenih izraza kako bi se tema podudarala i provjerite nestaje li AI s popisa.

popis za provjeru

  • [ ] AI-ju sam dao prave podatke o identitetu izvora, nisam ih prepustio nagađanju.
  • [ ] Jasno sam odredio ciljni standard metapodataka (MARC/Dublin Core).
  • [ ] Provjerio sam godinu izdanja i ISBN doslovno s izvornim izvorom.
  • [ ] Mapirao sam pojmove teme iz kontroliranog vokabulara.
  • [ ] Potvrdio sam obrasce ovlaštenja s odobrenim zapisnikom.