Üksus 2 / 11

Tehisintellekt kataloogimisel ja metaandmete genereerimisel

Kasu:

  • Võimalus lühendada kataloogimisaega, koostades tõelise trükiinfo põhjal metaandmete mustandit vastavalt standarditele, nagu MARC ja Dublin Core
  • Võimalus kontrollida suure väljatöötamisriskiga välju, nagu avaldamisaasta, ISBN, autori nimi, algallika ja kaardi teematerminid kontrollitud sõnavarast
  • Võimalus muuta autori- ja teemavormingud volitatud kontrolliga ühekordseks heakskiiduks ja säilitada kataloogi järjepidevus

Kataloogi koostamine on raamatukogunduse nähtamatu, kuid kõige põhilisem töö. Ressursi (raamat, artikkel, kaart, helisalvestis, digifail) avastamine on võimalik õigete metaandmetega. Metaandmed tähendavad "andmeid andmete kohta": struktureeritud teave, mis kirjeldab ressursi pealkirja, autorit, avaldamisaastat, teemat, keelt ja füüsilisi atribuute. Kui metaandmed on head, leiab kasutaja ressursi üles; Kui see on halb või puudulik, läheb ressurss kaotsi, isegi kui see on olemas. Selles üksuses saate teada, kuidas kasutada tehisintellekti metaandmete mustandi genereerimisel, kuid kuidas tagada standarditele vastavus ja täpsus.

Esmalt defineerime need kaks mõistet. MARC (Machine-Readable Cataloging) on ​​kirjevorming, mida raamatukogud on aastakümneid kasutanud ja mis paigutab iga teabe nummerdatud väljadele; Näiteks väljal 245 on pealkiri ja väljal 100 põhiautor. Dublin Core on digiressursside lihtsustatud metaandmete standard, mis koosneb 15 põhiväljast (pealkiri, looja, teema, kuupäev, žanr jne). Need standardid tagavad, et eri teekide kirjed saavad omavahel rääkida.

Samm-sammult: tehisintellektiga metaandmete mustandi genereerimine

1. Koguge allika isikuandmed. Raamatu kaas, tiitelleht, sisu või digifaili tekst. AI töötab ainult teie poolt antud teabe põhjal; Kui esitate mittetäieliku teabe, toodab see mittetäielikke või väljamõeldud metaandmeid.

2. Määrake sihtstandard. Andke tehisintellektile selge sihtmärk, näiteks "Dublin Core'i väljade järgi" või "MARC 245, 100, 260, 650 väljade järgi". Kui te standardit ei määra, loob see suvalise vormingu.

3. Koostage mustand. AI koostab teie esitatud teabe põhjal pealkirja, vastutuse avalduse, väljaande teabe ja teema ettepaneku.

4. Kasutage volituste kontrolli. Autoriteetne kirje on dokument, mis määrab kindlaks autori nime, institutsiooni või subjekti ühtse standardvormi (nt "Atatürk, Mustafa Kemal, 1881-1938"). AI võib nime kirjutada erineval viisil; Kontrollite ja parandate kinnitatud volituse vormingut.

5. Kontrollige ja kinnitage. Võrrelge iga välja algallikaga. Eelkõige võib tehisintellekt võltsida täpset teavet, nagu avaldamisaasta, ISBN ja autori nimi.

Vihje: andke tehisintellektile foto või tekst allika tegelikust krediidilehest; Ärge öelge "arva ära raamatu nimi". Ennustavad metaandmed õõnestavad kataloogi usaldusväärsust. AI kirjutab ennustuste tegemisel enesekindlalt ja see eksitab teid.

Kontrollitud sõnavara ja järjepidevus

Järjepidevus on kataloogimisel kõik. Kui sama teema on kirjutatud kahe erineva terminiga kahes erinevas kirjes, leiab kasutaja ühe ja jätab teise märkamata. Sellepärast kasutavad raamatukogud kontrollitud sõnavara – heakskiidetud standardset terminite loendit. Vabatekstist termineid soovitades saab tehisintellekt valida selle loendi ametliku termini asemel selle kõnekeelse ekvivalendi. Näiteks võib AI kirjutada "südameatakk"; kusjuures heakskiidetud termin võib olla "müokardiinfarkt".

Lahendus on anda AI-le kontrollitud sõnavara ja öelda "lihtsalt valige sellest loendist". Nii et selle asemel, et tingimusi vabalt välja mõelda, sobib AI heakskiidetud loendist kõige sobivamaga.

Ettevaatust. Kui AI soovitatud teematerminit ei ole kontrollitud sõnavaras, ärge lisage seda terminit kataloogi. Uute tingimuste lisamise otsustab ametiasutuse juhtimise eest vastutav ekspert; Suvaliste terminite lisamine rikub kataloogi järjepidevust.

kolm minikarpi

Juhtum 1 – annetuste kogumine kiirenes. Rahvaraamatukogu sai annetusena 1200 raamatut. Kataloogimise spetsialist lasi tehisintellektil lugeda iga raamatu trükilehe ja koostada Dublin Core'i mustand; Salvestusaeg vähenes 9 minutilt 3,5 minutile. Ülejäänud aja pühendas ekspert asutuste kontrollimisele ja kontrollimisele; Koguaeg vähenes ligikaudu 55%, kuid ükski kirje ei sisenenud süsteemi ilma kontrollimata.

Juhtum 2 – tabati võltsitud ISBN. Ekspert lasi tehisintellektil koostada 30 raamatu mustandid. Kontrollimise käigus avastas ta, et 4 kirje ISBN oli võlts: AI oli kirjutanud 13-kohalise numbri, mis tundus mõistlik, kuigi ta ei teadnud raamatu tegelikku numbrit. Kontrollimise samm vältis nelja vale ISBN-i muutumist kataloogis püsivaks.

Juhtum 3 – ametiasutuse vastuolu parandatud. Raamatukogu leidis mõnelt plaadilt autori nimega "J. Smith", teistelt "John Smith", teistelt "Smith, John". AI sobitati autoriteedifailiga, viies kõik kirjed ühte kinnitatud vormingusse ("Smith, John, 1965-"); Kui seda tööd tehti käsitsi, kuluks see päevi, kuid tehisintellekti soovitusel vähenes see mõne tunnini, kuid ekspert kiitis iga vaste heaks.

Retrospektiivne teisendus ja vanad kirjed

Paljudes raamatukogudes on puudulikud või aegunud kirjed, mis sisestati aastaid tagasi erinevate reeglitega. Nende üleviimist praegusele standardile nimetatakse retrospektiivseks teisendamiseks ja see on käsitsi tehes väga töömahukas. Tehisintellekt suudab lugeda vana kirjet ja genereerida selle praegusesse väljastruktuuri teisaldamiseks mustandi: näiteks saab see parsida vabatekstilist tsitaati ja levitada selle õigetele väljadele. Siin on aga kaks ohtu. Esiteks võib tehisintellekt korvata puuduoleva teabe, et "kompenseerida"; teiseks võib see vanas kirjes viga säilitada, kopeerides selle uude vormingusse, mitte seda parandama. Seetõttu tuleks retrospektiivsel teisendusel AI väljundit süstemaatiliselt kontrollida mitte valimi, vaid kriitiliste väljade (autor, aasta, identifitseerimisnumbrid) järgi. Hea tava on kuvada konversioonieelsed ja -järgsed kirjed kõrvuti, muutes iga muudatuse nähtavaks; nii saab ekspert ühe pilguga näha, mida on liigutatud, mis on muutunud ja mis võib olla välja mõeldud.

Tähelepanu: tehisintellekti loodud metaandmete mustandit ei tohiks süsteemi partiidena üle kanda ilma neid ükshaaval üle vaatamata. Massiline viga rikub korraga sadu kirjeid ja allalaadimine on palju tülikam kui tootmine. Kõige ohutum on toota ja kontrollida väikeste partiidena.

Neli kopeeritavat malli

1) Dublin Core'i ülevaade:

Sinu roll: kataloogija assistent. Täitke Dublin Core'i väljad järgmisest rea tekstist: Pealkiri, Looja, Teema, Kirjeldus, Väljaandja, Kuupäev, Žanr, Formaat, Keel. Kasutage ainult teavet, mis on tekstis selge; Jätke puuduv väli "[teave puudub]", ärge arvake. Trüki tekst: [siin]

2) MARC-välja ülevaade:

Pakkuge allolevast raamatuteabest välja järgmiste MARC-väljade kontuurid: 245 (pealkiri/tiitrid), 100 (peaautor), 260/264 (väljaanne), 300 (füüsiline kirjeldus), 650 (teema). Märgistage mis tahes väli, milles te pole kindel, kui "[vajab kinnitamist]". Info: [siin]

3) Teema sobitamine kontrollitud sõnavarast:

Allpool on allika kokkuvõte ja heakskiidetud teematerminite loend. Sobitage ainult 3–5 sobivaimat terminit loendist allikaga. Kui loendis pole sobivat terminit, kirjutage "nimekirjas pole sobivat terminit", ärge tehke uusi termineid. Kokkuvõte: [siin] / Terminite loend: [siin]

4) Volitusvormi kontroll:

Sobitage allolevad autorite nimed kinnitatud vormidega minu esitatud volituste loendis. Iga nime puhul: vorming kirjes -> kinnitatud formaat. Kui loendis pole samaväärset, kirjutage "pole autoriteeti". Nimed: [siin] / Volituste nimekiri: [siin]

Nõrk viip / Tugev viip

Nõrk viip:

Võtke välja järgmise raamatu kataloogiteave: "Tehisintellekt ja ühiskond".

Antakse ainult pealkiri; AI on sunnitud moodustama autori, aasta, väljaandja ja ISBN-i. Sihtstandardit pole. Tulemus: veenev, kuid tõenäoliselt vale rekord.

Võimas viip:

Sinu roll: kataloogija assistent. Allpool on raamatu trükilehe täistekst. Täitke sellelt Dublin Core'i väljad. Kasutage ainult tekstis selgelt välja toodud teavet; Jätke mittetekstiväli tühjaks ja kirjutage "[teave puudub]". Kuupäevi, nimesid ega ISBN-e ei ole välja mõeldud. Trüki tekst: [täistekst siin]

Võimas viip piirab tehisintellekti tõelise lisateabega ja sunnib seda ausalt lünki jätma, selle asemel, et neid välja mõelda.

Metaandmete väli ja valideerimistabel

ala

Valmistamise oht

Kuidas kontrollida

Pealkiri

madal

Võrdle trükilehega

Autori/asutuse vorming

keskmine

Otsige volituste failist

Ilmumisaasta

kõrge

Kinnitage jäljendiga/kolofoniga

ISBN

väga kõrge

Üks-ühele juhtimine vöötkoodi/allikaga

Teema termin

kõrge

Vastake kontrollitud sõnavarale

Levinud vead

  • Lihtsalt küsin pealkirja metaandmeid. Mittetäielik teave sunnib tehisintellekti asju välja mõtlema.
  • Sihtstandardit ei täpsustata. Suvaline vormindamine rikub plaatide harmooniat.
  • ISBN-i ja aastaarvu aktsepteerimine ilma seda kinnitamata. Nendel aladel on suurim valmistamise oht.
  • Ainetermini võtmine väljastpoolt kontrollitud sõnavara. Järjepidevus ja kättesaadavus on ohus.
  • Mööda asutuste kontrollist. Sama autor hajub erinevates formaatides, kasutajal jääb allikast puudust tundma.

Kokkuvõttes

Metaandmete genereerimisel on AI võimas abiline, mis eraldab kiiresti jäljenditeabe ja lühendab oluliselt kataloogimise aega. Tootlikkuse hind on aga range valideerimine valmistamisriskide vastu: tehke sihtstandard (MARC, Dublin Core) selgeks, käitage tehisintellekti ainult tõeliste sõnateadmistega, kaardistage kontrollitud sõnavaradest teematerminid ja kinnitage volitusvormid. Lünkade täitmise asemel peaks tehisintellekt selle ausalt tühjaks jätma; Jätate lõpliku heakskiidu alles.

Rakenduse ülesanne

Andke tõelise raamatu trükilehe tekst AI-le malliga "Dublin Core draft" ja hankige mustand. Seejärel laske sama raamat koostada ainult pealkirjaga ("Nõrk viip") ja võrrelge kahte väljundit: millised väljad valmistati? Seejärel esitage malliga "Teema kaardistamine kontrollitud sõnavarast" lühike loend heakskiidetud terminitest, et saada teema sobitamiseks ja kontrollida, kas tehisintellekt kaob loendist.

kontrollnimekiri

  • [ ] Andsin tehisintellektile allika tegeliku identiteediinfo, ei jätnud seda oletamise hooleks.
  • [ ] Olen selgelt määratlenud sihtmärgi metaandmete standardi (MARC/Dublin Core).
  • [ ] Kontrollisin avaldamisaastat ja ISBN-i sõna-sõnalt algallikaga.
  • [ ] Kaardistasin teematerminid kontrollitud sõnavarast.
  • [ ] Olen kinnitanud volituste vormid kinnitatud kirjega.