Enota 2 / 11

Umetna inteligenca pri katalogizaciji in generiranju metapodatkov

Dobički:

  • Sposobnost skrajšanja časa katalogizacije z izdelavo osnutkov metapodatkov v skladu s standardi, kot sta MARC in Dublin Core, iz resničnih informacij o odtisu
  • Sposobnost preverjanja polj z velikim tveganjem izdelave, kot so leto izdaje, ISBN, ime avtorja, z izvirnim virom in preslikavo predmetnih izrazov iz nadzorovanega besednjaka
  • Sposobnost, da formate avtorjev in predmetov odobrite z enim samim nadzorom avtoritete in ohranite doslednost kataloga

Katalogizacija je nevidno, a najbolj temeljno delo knjižničarstva. Odkritje vira (knjige, članka, zemljevida, zvočnega posnetka, digitalne datoteke) je mogoče s pravilnimi metapodatki. Metapodatki pomenijo »podatke o podatkih«: strukturirane informacije, ki opisujejo naslov vira, avtorja, leto izdaje, predmet, jezik in fizične lastnosti. Če so metapodatki dobri, uporabnik najde vir; Če je slab ali nepopoln, je vir izgubljen, tudi če obstaja. V tej enoti se boste naučili, kako uporabiti umetno inteligenco pri ustvarjanju osnutkov metapodatkov, in kako zagotoviti skladnost s standardi in točnost.

Najprej opredelimo oba pojma. MARC (strojno berljiva katalogizacija) je zapisni format, ki ga knjižnice uporabljajo že desetletja in ki vsako informacijo postavi v oštevilčena polja; Na primer, polje 245 vsebuje naslov, polje 100 pa glavnega avtorja. Dublin Core je poenostavljen metapodatkovni standard za digitalne vire, sestavljen iz 15 osnovnih polj (naslov, ustvarjalec, zadeva, datum, žanr itd.). Ti standardi zagotavljajo, da se lahko zapisi iz različnih knjižnic pogovarjajo med seboj.

Korak za korakom: ustvarjanje osnutkov metapodatkov z umetno inteligenco

1. Zberite podatke o identiteti vira. Naslovnica knjige, naslovna stran, vsebina ali besedilo digitalne datoteke. Umetna inteligenca deluje le na podlagi informacij, ki ji jih posredujete; Če posredujete nepopolne informacije, ustvari nepopolne ali izmišljene metapodatke.

2. Določite ciljni standard. Dajte AI jasen cilj, na primer »po poljih Dublin Core« ali »po poljih MARC 245, 100, 260, 650«. Če ne določite standarda, ustvari poljubno obliko.

3. Izdelajte osnutek. AI pripravi naslov, izjavo o odgovornosti, informacije o objavi in ​​predlog teme iz informacij, ki jih posredujete.

4. Izvajajte oblastni nadzor. Verodostojen zapis je tisti, ki določa enotno, standardno obliko avtorjevega imena, ustanove ali teme (npr. "Atatürk, Mustafa Kemal, 1881-1938"). AI lahko zapiše ime na različne načine; Preverite in popravite odobreno obliko pooblastila.

5. Preverite in potrdite. Vsako polje primerjajte z izvirnim virom. Zlasti natančne informacije, kot so leto izdaje, ISBN in ime avtorja, so zelo dovzetne za ponarejanje s strani umetne inteligence.

Namig: Umetni inteligenci dajte fotografijo ali besedilo dejanske kreditne strani vira; Ne recite "ugani ime knjige". Napovedni metapodatki spodkopavajo zanesljivost kataloga. AI pri napovedovanju piše samozavestno, kar vas bo zavedlo.

Kontroliran besedni zaklad in doslednost

Doslednost je vse v katalogizaciji. Če je ista tema zapisana z dvema različnima izrazoma v dveh različnih zapisih, bo uporabnik našel enega in spregledal drugega. Zato knjižnice uporabljajo nadzorovan besednjak – odobren, standardni seznam izrazov. Ko predlaga izraze iz prostega besedila, lahko AI izbere njegov pogovorni ekvivalent namesto uradnega izraza na tem seznamu. Na primer, AI lahko napiše "srčni napad"; medtem ko je lahko odobren izraz "miokardni infarkt".

Rešitev je, da daste AI nadzorovan besednjak in rečete "samo izberite s tega seznama". Torej, namesto da bi si prosto izmislil pogoje, AI ujema najustreznejšega z odobrenega seznama.

Pozor: če predmetni izraz, ki ga predlaga AI, ni v nadzorovanem besednjaku, tega izraza ne dodajte v katalog. Odločitev o dodajanju novih izrazov je v pristojnosti strokovnjaka, odgovornega za vodenje organa; Dodajanje poljubnih izrazov poruši konsistentnost kataloga.

trije mini kovčki

1. primer – pospešeno zbiranje donacij. Splošna knjižnica je prejela donacijo 1200 knjig. Strokovnjak za katalogizacijo je dal AI prebrati stran z odtisom vsake knjige in izdelati osnutek Dublinskega jedra; Čas na snemanje se je zmanjšal z 9 minut na 3,5 minute. Preostali čas je strokovnjak posvetil avtoriteti in preverjanju; Skupni čas se je skrajšal za približno 55 %, vendar noben zapis ni vstopil v sistem brez preverjanja.

Primer 2 – Ujet lažni ISBN. Strokovnjak je dal AI izdelati osnutke 30 knjig. Med preverjanjem je ugotovil, da je ISBN v 4 zapisih lažen: AI je napisal 13-mestno številko, ki se je zdela razumna, čeprav ni poznal prave številke knjige. Korak preverjanja je preprečil, da bi štiri nepravilne oznake ISBN postale obstojne v katalogu.

Primer 3 – Popravljena nedoslednost organa. Knjižnica je v nekaterih zapisih našla avtorja kot "J. Smith", v drugih "John Smith", v tretjih "Smith, John". Umetna inteligenca je bila usklajena z avtoritetno datoteko, s čimer so bili vsi zapisi združeni v en odobren format ("Smith, John, 1965-"); Če bi to delo opravili ročno, bi trajalo dneve, s predlogom AI pa se je skrajšalo na nekaj ur, vendar je vsako ujemanje odobril strokovnjak.

Pretvorba za nazaj in stari zapisi

Številne knjižnice imajo nepopolne ali zastarele evidence, ki so bile vnesene pred leti z drugačnimi pravili. Premikanje teh na trenutni standard se imenuje retrospektivna pretvorba in je zelo težavno, če se izvaja ročno. Umetna inteligenca lahko prebere stari zapis in ustvari osnutek, da ga premakne v trenutno strukturo polja: na primer lahko razčleni citat v prostem besedilu in ga razdeli v pravilna polja. Vendar tu obstajata dve nevarnosti. Prvič, umetna inteligenca lahko nadoknadi manjkajoče informacije za »nadoknado«; drugič, lahko ohrani napako v starem zapisu tako, da ga kopira v novo obliko, namesto da bi ga popravil. Zato je treba pri retrospektivni transformaciji izhod umetne inteligence preverjati sistematično, ne z vzorčenjem, temveč po kritičnih poljih (avtor, leto, identifikacijske številke). Dobra praksa je prikazati zapise pred in po pretvorbi enega ob drugem, tako da je vsaka sprememba vidna; tako lahko strokovnjak na prvi pogled vidi, kaj je bilo premaknjeno, kaj spremenjeno in kaj je bilo morda izdelano.

Pozor: Osnutki metapodatkov, ki jih ustvari AI, se ne smejo prenesti v sistem kot serija, ne da bi jih pregledali enega za drugim. Množična napaka pokvari na stotine zapisov hkrati, priklic pa je veliko bolj težaven kot izdelava. Najbolj varno je proizvajati in preverjati v majhnih serijah.

Štiri predloge za kopiranje

1) Oris Dublinskega jedra:

Vaša vloga: pomočnik katalogizatorja. Izpolnite polja Dublin Core iz naslednjega avtorskega besedila: naslov, ustvarjalec, zadeva, opis, založnik, datum, žanr, oblika, jezik. Uporabljajte le informacije, ki so jasne v besedilu; Pustite manjkajoče polje "[brez informacij]", ne ugibajte. Besedilo odtisa: [tukaj]

2) Oris polja MARC:

Predlagajte osnutke za naslednja polja MARC iz spodnjih informacij o knjigi: 245 (naslov/zasluge), 100 (glavni avtor), 260/264 (objava), 300 (fizični opis), 650 (predmet). Vsa polja, za katera niste prepričani, označite kot »[potrebno preverjanje]«. Informacije: [tukaj]

3) Ujemanje tem iz kontroliranega besedišča:

Spodaj je povzetek vira in seznam odobrenih izrazov teme. Povežite le 3-5 najprimernejših izrazov s seznama z virom. Če na seznamu ni ustreznega termina, napišite "ni primernega termina na seznamu", novih terminov ne izmišljujte. Povzetek: [tukaj] / Seznam izrazov: [tukaj]

4) Nadzor obrazca pooblastila:

Povežite spodnja imena avtorjev z odobrenimi obrazci na seznamu organov, ki sem ga posredoval. Za vsako ime: oblika v zapisu -> odobrena oblika. Če na seznamu ni ekvivalenta, napišite "ni normativnega zapisa". Imena: [tukaj] / Seznam organov: [tukaj]

Šibek poziv/močan poziv

Šibek poziv:

Izvlecite podatke o katalogu za naslednjo knjigo: "Umetna inteligenca in družba".

Podan je le naslov; AI je prisiljen sestaviti avtorja, leto, založnika in ISBN. Ni ciljnega standarda. Rezultat: prepričljiv, a verjetno lažen zapis.

Močan poziv:

Vaša vloga: pomočnik katalogizatorja. Spodaj je celotno besedilo naslovne strani knjige. Izpolnite polja Dublin Core iz tega. Uporabljajte le informacije, ki so jasno navedene v besedilu; Polje brez besedila pustite prazno in napišite "[ni podatkov]". Nobeni datumi, imena ali ISBN niso izmišljeni. Besedilo impresuma: [celotno besedilo tukaj]

Zmogljiv poziv omeji umetno inteligenco na resnične podatke o avtorski vrstici in jo prisili, da pošteno pusti prazne, namesto da si jih izmisli.

Polje metapodatkov in validacijska tabela

območje

Nevarnost izdelave

Kako preveriti

Naslov

nizka

Primerjaj s stranjo za odtis

Oblika avtorja/organa

srednje

Iskanje v avtoritetni datoteki

Leto izdaje

visoka

Potrdite z odtisom/kolofonom

ISBN

zelo visoko

Nadzor ena proti ena s črtno kodo/virom

Predmetni izraz

visoka

Ujemanje v kontroliranem besednjaku

Pogoste napake

  • Samo zahtevam metapodatke iz naslova. Nepopolne informacije ženejo AI, da si stvari izmisli.
  • Brez navedbe ciljnega standarda. Poljubno oblikovanje poruši harmonijo zapisov.
  • Sprejemanje ISBN in letnice brez preverjanja. Ta področja predstavljajo največje tveganje za izdelavo.
  • Jemanje predmetnega izraza izven nadzorovanega besedišča. Doslednost in razpoložljivost sta ogroženi.
  • Mimo nadzora oblasti. Isti avtor razprši v različne formate, uporabnik zgreši vir.

Če povzamem

Pri ustvarjanju metapodatkov je umetna inteligenca zmogljiv pomočnik, ki hitro izvleče informacije o odtisu in bistveno skrajša čas katalogizacije. Toda cena produktivnosti je stroga validacija pred tveganji izdelave: razjasnite ciljni standard (MARC, Dublin Core), zaženite AI samo z resničnim znanjem besed, preslikajte predmetne izraze iz nadzorovanih besednjakov in potrdite avtoritete. Namesto da nadomesti vrzeli, bi moral AI pošteno pustiti prazno; Vi obdržite končno odobritev.

Aplikacijska naloga

Dajte besedilo strani za impresum prave knjige, ki jo imate, AI ​​s predlogo »Dublin Core osnutek« in pridobite osnutek. Nato ustvarite isto knjigo samo z naslovom ("Šibek poziv") in primerjajte oba rezultata: katera polja so bila izdelana? Nato s predlogo »Preslikava tem iz nadzorovanega besedišča« podajte kratek seznam odobrenih izrazov, da se tema ujema, in preverite, ali je umetna inteligenca umaknjena s seznama.

kontrolni seznam

  • [ ] Umetni inteligenci sem dal podatke o pravi identiteti vira, nisem prepustil ugibanju.
  • [ ] Jasno sem določil ciljni standard metapodatkov (MARC/Dublin Core).
  • [ ] Letnico izdaje in ISBN sem dobesedno preveril z izvirnim virom.
  • [ ] Tematske izraze sem preslikal iz kontroliranega besedišča.
  • [ ] Pooblastila sem potrdil s potrjenim zapisnikom.