Njësia 2 / 11

Inteligjenca artificiale në katalogimin dhe gjenerimin e meta të dhënave

Fitimet:

  • Aftësia për të shkurtuar kohën e katalogimit duke prodhuar draft metadata në përputhje me standardet si MARC dhe Dublin Core nga informacioni real i printimit
  • Aftësia për të verifikuar fushat me rrezik të lartë fabrikimi, si viti i botimit, ISBN, emri i autorit, me burimin origjinal dhe termat e temës së hartës nga fjalori i kontrolluar
  • Aftësia për të bërë formatet e autorit dhe subjektit të miratuara vetëm me kontroll të autoritetit dhe për të ruajtur konsistencën e katalogut

Katalogimi është puna e padukshme, por më themelore e bibliotekarisë. Zbulimi i një burimi (libër, artikull, hartë, regjistrim zëri, skedar dixhital) është i mundur me meta të dhënat e sakta. Metadata do të thotë "të dhëna rreth të dhënave": informacion i strukturuar që përshkruan titullin e burimit, autorin, vitin e botimit, subjektin, gjuhën dhe atributet fizike. Nëse meta të dhënat janë të mira, përdoruesi gjen burimin; Nëse është i keq ose i paplotë, burimi humbet edhe nëse ekziston. Në këtë njësi do të mësoni se si të përdorni inteligjencën artificiale në gjenerimin e draftit të meta të dhënave, por si të siguroni përputhjen dhe saktësinë e standardeve.

Le të përcaktojmë së pari dy konceptet. MARC (Machine-Readable Cataloging) është një format regjistrimi që bibliotekat e kanë përdorur për dekada që vendos çdo pjesë të informacionit në fusha të numëruara; Për shembull, fusha 245 mban titullin dhe fusha 100 mban autorin kryesor. Dublin Core është një standard i thjeshtuar i meta të dhënave për burimet dixhitale, i përbërë nga 15 fusha bazë (titulli, krijuesi, subjekti, data, zhanri, etj.). Këto standarde sigurojnë që regjistrimet nga biblioteka të ndryshme të mund të bisedojnë me njëri-tjetrin.

Hap pas hapi: gjenerimi i meta të dhënave me inteligjencë artificiale

1. Mblidhni informacionin e identitetit të burimit. Kopertina e librit, faqja e titullit, përmbajtja ose teksti i një skedari dixhital. AI funksionon vetëm nga informacioni që ju i jepni; Nëse jep informacion jo të plotë, ai prodhon meta të dhëna jo të plota ose të fabrikuara.

2. Specifikoni standardin e synuar. Jepini AI një objektiv të qartë, si p.sh. "nga fushat e Dublin Core" ose "nga fushat MARC 245, 100, 260, 650". Nëse nuk specifikoni një standard, ai prodhon një format arbitrar.

3. Përgatitni draftin. AI harton titullin, deklaratën e përgjegjësisë, informacionin e publikimit dhe propozimin e temës nga informacioni që jepni.

4. Ushtroni kontrollin e autoritetit. Një regjistrim autoritar është ai që përcakton formën e vetme, standarde të emrit, institucionit ose subjektit të një autori (p.sh., "Atatürk, Mustafa Kemal, 1881-1938"). AI mund të shkruajë një emër në mënyra të ndryshme; Ju kontrolloni dhe korrigjoni formatin e autoritetit të miratuar.

5. Verifiko dhe konfirmo. Krahasoni secilën fushë me burimin origjinal. Në veçanti, informacioni i saktë si viti i botimit, ISBN dhe emri i autorit janë shumë të ndjeshëm ndaj falsifikimit nga AI.

Këshillë: Jepini AI një foto ose tekst të faqes aktuale të kreditit të burimit; Mos thoni "mendoni emrin e librit". Meta të dhënat parashikuese minojnë besueshmërinë e katalogut. AI shkruan me siguri kur bën parashikime dhe kjo do t'ju mashtrojë.

Fjalori dhe qëndrueshmëria e kontrolluar

Konsistenca është gjithçka në katalogim. Nëse e njëjta temë shkruhet me dy terma të ndryshëm në dy regjistrime të ndryshme, përdoruesi do të gjejë njërin dhe do të humbasë tjetrin. Kjo është arsyeja pse bibliotekat përdorin një fjalor të kontrolluar - një listë të miratuar, standarde të termave. Kur sugjeron terma nga teksti i lirë, AI mund të zgjedhë ekuivalentin e saj bisedor dhe jo termin zyrtar në këtë listë. Për shembull, AI mund të shkruajë "sulm në zemër"; kurse termi i miratuar mund të jetë “infarkt miokardi”.

Zgjidhja është t'i jepni AI fjalorin e kontrolluar dhe të thoni "thjesht zgjidhni nga kjo listë". Pra, në vend që të krijojë terma lirisht, AI përputhet me atë më të përshtatshmen nga lista e miratuar.

Kujdes: Nëse një term lëndor i sugjeruar nga AI nuk është në fjalorin e kontrolluar, mos e shtoni atë term në katalog. Vendimi për shtimin e kushteve të reja i takon ekspertit përgjegjës për menaxhimin e autoritetit; Shtimi i termave arbitrare prish konsistencën e katalogut.

tre mini kuti

Rasti 1 — Mbledhja e donacioneve u përshpejtua. Një bibliotekë publike mori një donacion prej 1200 librash. Specialisti i katalogimit kërkoi që AI të lexonte faqen e printimit të çdo libri dhe të prodhonte një draft të Dublinit Core; Koha për regjistrim u ul nga 9 minuta në 3.5 minuta. Eksperti ia kushtoi kohën e mbetur kontrollit dhe verifikimit të autoritetit; Koha totale u reduktua me rreth 55%, por asnjë regjistrim nuk hyri në sistem pa u verifikuar.

Rasti 2 — Kapet ISBN e rreme. Një ekspert i kërkoi AI të prodhonte drafte të 30 librave. Gjatë kontrollit, ai zbuloi se ISBN-ja në 4 regjistrime ishte false: AI kishte shkruar një numër 13-shifror që i dukej i arsyeshëm, edhe pse nuk e dinte numrin e vërtetë të librit. Hapi i verifikimit parandaloi që katër ISBN të pasakta të bëheshin të qëndrueshme në katalog.

Rasti 3 - Korrigjohet mospërputhja e autoritetit. Një bibliotekë gjeti një autor si "J. Smith" në disa regjistrime, "John Smith" në të tjera, "Smith, John" në të tjera. AI u përputh me skedarin e autoritetit, duke i sjellë të gjitha të dhënat në një format të vetëm të miratuar ("Smith, John, 1965-"); Nëse kjo punë do të bëhej me dorë, do të duheshin ditë të tëra, por me sugjerimin e AI u reduktua në disa orë, por çdo ndeshje miratohej nga eksperti.

Konvertimi retrospektiv dhe regjistrimet e vjetra

Shumë biblioteka kanë regjistrime të paplota ose të vjetruara që janë futur vite më parë me rregulla të ndryshme. Zhvendosja e tyre në standardin aktual quhet konvertim retrospektiv dhe është shumë i mundimshëm kur bëhet me dorë. AI mund të lexojë një rekord të vjetër dhe të gjenerojë një draft për ta zhvendosur atë në strukturën aktuale të fushës: për shembull, mund të analizojë një citim të tekstit të lirë dhe ta shpërndajë atë në fushat e duhura. Megjithatë, këtu ka dy rreziqe. Së pari, AI mund të plotësojë informacionin e munguar për të "përbërë"; së dyti, mund të përjetësojë një gabim në regjistrimin e vjetër duke e kopjuar atë në një format të ri në vend që ta korrigjojë. Prandaj, në transformimin retrospektiv, prodhimi i AI duhet të kontrollohet sistematikisht, jo me kampionim, por nga fusha kritike (autori, viti, numrat identifikues). Një praktikë e mirë është të shfaqen të dhënat para dhe pas konvertimit krah për krah, duke e bërë çdo ndryshim të dukshëm; kështu që eksperti mund të shohë me një shikim se çfarë është zhvendosur, çfarë ka ndryshuar dhe çfarë mund të jetë fabrikuar.

Kujdes: Drafti i meta të dhënave të prodhuara nga AI nuk duhet të transferohet në sistem si grup pa i shqyrtuar ato një nga një. Një gabim masiv korrupton qindra regjistrime në të njëjtën kohë, dhe rikuperimi është shumë më i mundimshëm sesa prodhimi. Është më e sigurta të prodhohet dhe verifikohet në tufa të vogla.

Katër shabllone të kopjueshëm

1) Skica e Dublinit Core:

Roli juaj: ndihmës katalogues. Plotësoni fushat Dublin Core nga teksti vijues: Titulli, Krijuesi, Subjekti, Përshkrimi, Botuesi, Data, Zhanri, Formati, Gjuha. Përdorni vetëm informacione që janë të qarta në tekst; Lëreni fushën që mungon "[pa informacion]", mos e merrni me mend. Teksti i shtypur: [këtu]

2) Skica e fushës MARC:

Propozoni skica për fushat e mëposhtme MARC nga informacioni i librit më poshtë: 245 (titulli/kredi), 100 (autori kryesor), 260/264 (publikimi), 300 (përshkrimi fizik), 650 (lënda). Shënoni çdo fushë për të cilën nuk jeni të sigurt si "[ka nevojë për verifikim]". Informacion: [këtu]

3) Përputhja e temës nga fjalori i kontrolluar:

Më poshtë është një përmbledhje e burimit dhe një listë e termave të miratuara të temës. Përputhni vetëm 3-5 termat më të përshtatshëm nga lista me burimin. Nëse nuk ka term të përshtatshëm në listë, shkruani "nuk ka term të përshtatshëm në listë", mos krijoni terma të rinj. Përmbledhje: [këtu] / Lista e termave: [këtu]

4) Kontrolli i formës së autoritetit:

Përputhni emrat e autorëve më poshtë me formularët e miratuar në listën e autoriteteve që kam dhënë. Për secilin emër: formati në regjistrim -> formati i miratuar. Nëse nuk ka asnjë ekuivalent në listë, shkruani "pa regjistrim autoriteti". Emrat: [këtu] / Lista e autoriteteve: [këtu]

Prompt i dobët / Prompt i fortë

Njoftim i dobët:

Nxjerr informacionin e katalogimit për librin e mëposhtëm: "Inteligjenca Artificiale dhe Shoqëria".

Jepet vetëm titulli; UA detyrohet të përbëjë autorin, vitin, botuesin dhe ISBN-në. Nuk ka asnjë standard të synuar. Rezultati: një rekord bindës, por ndoshta i rremë.

Njoftim i fuqishëm:

Roli juaj: ndihmës katalogues. Më poshtë është teksti i plotë i faqes së printimit të librit. Plotësoni fushat Dublin Core nga kjo. Përdorni vetëm informacionin që shprehet qartë në tekst; Lëreni bosh fushën pa tekst dhe shkruani "[pa informacion]". Nuk janë krijuar data, emra apo ISBN. Teksti i shtypur: [teksti i plotë këtu]

Kërkesa e fuqishme e kufizon AI në informacionin e vërtetë të linjës dhe e detyron atë të lërë me ndershmëri bosh në vend që t'i krijojë ato.

Fusha e meta të dhënave dhe tabela e vlefshmërisë

zonë

Rreziku i fabrikimit

Si të verifikoni

Titulli

të ulëta

Krahasoni me faqen e printimit

Formati i autorit/autoritetit

e mesme

Kërkoni në dosjen e autoritetit

Viti i botimit

lartë

Konfirmo me print/kolofon

ISBN

shumë e lartë

Kontroll një-për-një me barkod/burim

Termi lëndor

lartë

Përputhja në fjalorin e kontrolluar

Gabimet e zakonshme

  • Vetëm duke kërkuar meta të dhëna nga titulli. Informacioni i paplotë e shtyn AI të krijojë gjërat.
  • Duke mos specifikuar standardin e synuar. Formatimi arbitrar prish harmoninë e të dhënave.
  • Pranimi i ISBN-së dhe viti pa e verifikuar atë. Këto zona kanë rrezikun më të lartë të fabrikimit.
  • Marrja e termit të lëndës nga jashtë fjalorit të kontrolluar. Konsistenca dhe disponueshmëria janë në rrezik.
  • Anashkalimi i kontrollit të autoritetit. I njëjti autor shpërndahet në formate të ndryshme, përdoruesi humbet burimin.

Në përmbledhje

Në gjenerimin e meta të dhënave, AI është një asistent i fuqishëm që nxjerr shpejt informacionin e printuar dhe shkurton ndjeshëm kohën e katalogimit. Por çmimi i produktivitetit është vërtetim i rreptë kundrejt rreziqeve të fabrikimit: bëjeni të qartë standardin e synuar (MARC, Dublin Core), ekzekutoni AI vetëm me njohuri të vërteta të fjalëve, hartoni termat e lëndëve nga fjalorët e kontrolluar dhe vërtetoni format e autoritetit. Në vend që të plotësojë boshllëqet, AI duhet sinqerisht ta lërë atë bosh; Ju mbani miratimin përfundimtar.

Detyra e aplikimit

Jepni tekstin e faqes së printimit të një libri të vërtetë që keni në AI me shabllonin "Dublin Core draft" dhe merrni një draft. Më pas duhet të prodhohet i njëjti libër vetëm me titullin ("Prompt i dobët") dhe të krahasohen dy rezultatet: cilat fusha janë fabrikuar? Më pas, me shabllonin "Hartëzimi i temës nga fjalori i kontrolluar", jepni një listë të shkurtër të termave të miratuar për të përputhur temën dhe kontrolloni nëse AI del nga lista.

listë kontrolli

  • [ ] I dhashë AI informacionin e vërtetë të identitetit të burimit, nuk e lashë në hamendje.
  • [ ] Unë kam specifikuar qartë standardin e meta të dhënave të synuara (MARC/Dublin Core).
  • [ ] Kam verifikuar vitin e botimit dhe ISBN fjalë për fjalë me burimin origjinal.
  • [ ] Kam vënë në hartë termat e temës nga fjalori i kontrolluar.
  • [ ] Unë i kam konfirmuar format e autoritetit me procesverbalin e miratuar.