Enhet 3 / 11

Emneanalyse, klassifisering og automatisk indeksering

Gevinster:

  • Evne til å trekke ut emneutdrag fra faktisk innhold og kartlegge primære og sekundære emner fra godkjent emneliste
  • Å kunne akseptere hovedklassen av klassifiseringsforslag som Dewey og verifisere undernivåene med den offisielle tabellen.
  • Evne til å forstå den dømmende og representative karakteren til klassifisering og kontrollere forslag mot utdaterte og ekskluderende vilkår.

Å bestemme hva en ressurs handler om er en av bibliotekarets mest dømmende oppgaver. Dette kalles emneanalyse: lese innholdet i et dokument og matche det med riktige emneoverskrifter og riktig klassifikasjonsnummer. Hvis en bruker kan finne relaterte bøker side om side i hyllen eller får nøyaktige resultater når de søker etter et emne i katalogen, ligger det en god emneanalyse bak. I denne enheten lærer du hvordan du bruker kunstig intelligens i emneanbefaling, klassifisering og automatisk indeksering; men du vil lære hvorfor mennesket bør ta den endelige fagavgjørelsen.

La oss definere noen få begreper. Klassifikasjonssystemet er et system som nummererer kilder etter emne; de vanligste er Dewey Decimal Classification (DDC) og Library of Congress Classification (LCC). For eksempel, i Dewey indikerer 500 naturvitenskap, 900 indikerer historie og geografi. Indeksering er oppgaven med å tildele nøkkeltermer til et dokument som gjør det finnbart. Automatisk indeksering er når programvaren foreslår denne jobben. AI produserer forslag i alle tre oppgavene, men eksperten har det siste ordet i hver enkelt.

Trinn for trinn: emneanalyse med kunstig intelligens

1. Gi innholdet i dokumentet til AI. Fulltekst, abstrakt, innholdsfortegnelse eller introduksjon. Temaanalyse er basert på kontekst; Hvis du gir AI bare tittelen, får du en overfladisk og misvisende anbefaling.

2. Be om et innholdssammendrag fra AI. Først, "hva handler dette dokumentet hovedsakelig om?" spørre. Dette både hjelper deg å forstå raskt og viser om AI har grepet emnet riktig.

3. Match med kontrollerte emner. Gi AI-en din liste over godkjente emner og si "foreslå bare de mest passende emnene fra denne listen." Ikke la det produsere gratis terminologi.

4. Foreslå klassifiseringsnummer. Du kan spørre AI "hvilken hovedklasse faller dette dokumentet inn i i Dewey?" men sørg for å bekrefte de nøyaktige sifrene i nummeret med det offisielle klassifiseringsdiagrammet. AI kan produsere rimelige, men unøyaktige tall.

5. Ta avgjørelsen og begrunn den. Gjennomgå AIs forslag, velg dem i lys av institusjonens retningslinjer og brukerbase, og avvis dem når det er nødvendig. Den endelige fagavgjørelsen og klassifiseringen bærer din signatur.

Tips: Et dokument kan gis flere emner. Fra AI "hva er hovedemnet i dette dokumentet, hva er dets sekundære emner?" Spør separat. Riktig valg av primæremnet sikrer at ressursen havner på rett plass på hyllen; sekundære emner gir ekstra tilgangspunkter i katalogen.

Klassifiseringens rettslige karakter

Klassifisering fremstår som nøytral, men det er den ikke. Om du skal sette et dokument under "kvinnestudier" eller "sosiologi", eller til og med under hvilken geografi du vil klassifisere en historisk hendelse, er beslutninger som involverer perspektiv. Klassifikasjonssystemer bærer antagelser fra bestemte perioder og kulturer; Noen vilkår blir foreldet eller ekskluderende over tid. AI arver disse skjevhetene ordrett fra dataene den er trent på og kan til og med forsterke dem.

Derfor er emneanalyse et spørsmål om vurdering som ikke kan overlates til AI. AI indikerer hvilke titler som er "sannsynlige"; Men avgjørelsen om hvilken tittel som representerer kilden mest nøyaktig og rettferdig tilhører eksperten som kjenner verdiene til institusjonen og dens brukerbase.

Forsiktig: Sørg for at et emne foreslått av AI ikke gir en feilaktig fremstilling eller ekskluderer kilden. Sammenlign AI-genererte termer med institusjonens nåværende og inkluderende vokabular, spesielt om sensitive temaer som identitet, etnisitet, religion og kjønn.

tre minisaker

Sak 1 - Masseemneforslag. Et bibliotek vil tildele emner til en digital samling på 800 artikler. Eksperten ga sammendraget av hver artikkel til AI og ba om en match fra den godkjente tittellisten. AI-anbefalinger fanget korrekt et gjennomsnitt på 2 av 3 kvalifiserte titler per artikkel; eksperten la til en tredje og luket ut feil forslag. Jobben ble fullført omtrent 40 % raskere enn om den ble utført helt for hånd.

Sak 2 — Feil klassifiseringsnummer. En ekspert ba om et Dewey-nummer fra AI for en medisinsk historiebok. YZ foreslo "610 (medisin)"; Boken handlet imidlertid hovedsakelig om medisinens historie og det korrekte stedet var "610.9 (medisinhistorie)". Eksperten så på den offisielle Dewey-tabellen og korrigerte den; AI fant hovedklassen, men bommet på sub-breaket.

Sak 3 — Foreldet begrep fanget. AI foreslo et utdatert og nå ansett som ekskluderende fagbegrep for en sosiologibok; fordi denne gamle termen var vanlig i treningsdataene. Eksperten valgte riktig begrep fra institusjonens gjeldende inkluderende vokabular. Dette var et konkret eksempel på at AI bærer fortidens skjevhet.

Dybde og konsistens: hvor spesifikt skal det være?

En vanlig beslutning i emneanalyse er spesifisitetsnivået til begrepet som skal tildeles. Hvis du gir en ressurs en tittel som er for generell ("Dato"), vil brukeren som søker etter emnet drukne i hundrevis av irrelevante resultater. Hvis du gir en tittel som er for smal, vil en bruker som leter etter en bredere kilde ikke kunne finne den. Regelen er å velge det begrepet som mest spesifikt, men fullt ut dekker kilden: hvis en kilde kun omhandler Seljuk-periodens arkitektur, er "seljuk-arkitektur" og ikke "Arkitektur" det riktige nivået. AI savner ofte denne balansen; Det gir forslag som enten er for generelle eller for spredte. Derfor er det nødvendig å gi klare instruksjoner til AI som "foreslå det mest spesifikke emnet som dekkes av kilden, og ikke legg til underemner som kilden faktisk ikke berører." I tillegg er konsekvent merking av ressurser om samme emne over tid like viktig for integriteten til katalogen som spesifisitet; Å si «seljuksk arkitektur» den ene dagen og «seljukske tidsbygninger» dagen etter deler brukeren.

Tips: Når du gir flere titler til en ressurs, må du ikke stable termer som er undersett av hverandre unødvendig. Å gi både «ottomansk historie» og «historie» gjør sistnevnte unødvendig; velg den mest spesifikke og inkluderer bare titler som virkelig gir en annen rekkevidde.

Fire kopierbare maler

1) Emneutvinning:

Skriv hovedemnet i dokumentet nedenfor i én setning og de sekundære emnene i 3 punkter. Legge til et emne som ikke er i teksten, kun basert på teksten. Dokument/sammendrag: [her]

2) Samsvar fra godkjent overskrift:

Nedenfor er et dokumentsammendrag og liste over godkjente emneoverskrifter. Match bare de 3-5 overskriftene fra listen som passer best for dokumentet, og start med den mest passende. Skriv en begrunnelse med én setning for hvert valg. Hvis det ikke er en passende tittel i listen, spesifiser den. Sammendrag: [her] / Liste: [her]

3) Klassifisering mesterklasse forslag:

For det følgende dokumentet, foreslå en mulig hovedklasse (3 sifre) i Dewey Desimal Classification og forklar hvorfor du valgte den. Merk de nederste sifrene som "må verifiseres fra den offisielle tabellen", ikke oppgi eksakte tall. Dokument: [her]

4) Bias og valutakontroll:

Er det noen termer som kan være utdaterte, ekskluderende eller ensidige blant emneforslagene nedenfor? Merk det i så fall og forklar hvorfor det kan være problematisk. Forslag: [her]

Svak forespørsel / Sterk forespørsel

Svak melding:

Gi temaene i denne boken: "Handel i det osmanske riket".

Arbeider utelukkende fra tittelen, utgjør AI generelle termer uten å kjenne konteksten og ignorerer det kontrollerte vokabularet. Resultat: inkonsekvente, kanskje feilaktige titler.

Kraftig ledetekst:

Din rolle: assisterende faganalytiker. Nedenfor er innledningen og innholdet i boken; Jeg ga også en liste over godkjente emner. (1) Oppsummer hovedemnet i boken i én setning. (2) Match bare de 3-5 mest passende titlene fra listen med begrunnelsen. (3) Ikke gå av listen, ikke lag vilkår. Tekst: [her] /Godkjent liste: [her]

Den sterke ledeteksten begrenser AI til ekte innhold og kontrollert vokabular; opprettholder både nøyaktighet og konsistens.

Oppgavediagram for emneanalyse

Quest

Rollen til AI

mannens avgjørelse

Innholdssammendrag

raskt utkast

nøyaktighetssjekk

Tittelforslag

Match fra liste

Endelig valg, begrunnelse

Klassifikasjonsnummer

Mesterklasse forslag

Inndelingsbekreftelse

Bias sjekk

merking

Inkluderende terminbeslutning

Vanlige feil

  • Bare ber om et emne fra tittelen. Temaanalyse er basert på kontekst; Tittelen er misvisende.
  • Godta klassifiseringsnummeret uten å bekrefte det. Selv om AI finner hovedklassen, savner den subbreaket.
  • Hopp over kontrollert vokabular. Fritermin pauser konsistens.
  • Ignorerer fordommer. AI kan overføre utdaterte, ekskluderende vilkår fra fortiden.
  • Overlater avgjørelsen helt til AI. Representasjon og rettferdighet krever dømmekraft; Avgjørelsen er opp til personen.

Oppsummert

I emneanalyse og klassifisering er AI en rask assistent som trekker ut innholdssammendrag, matcher emner fra den godkjente listen og foreslår klassifiseringsmesterklasse. Men emneanalyse er i hovedsak et spørsmål om vurdering og representasjon: det er opp til eksperten å avgjøre hvilken tittel som mest nøyaktig og rettferdig beskriver kilden, de eksakte sifrene i klassifiseringsnummeret og valutaen til begrepene. Kjør AI med ekte innhold og kontrollert vokabular, verifiser klassifiseringstall med den offisielle tabellen, og vær oppmerksom på skjevhet.

Søknadsoppgave

Forbered en introduksjon til en kilde du har og en kort liste over godkjente emner. Få AI-forslag med malene «Temauttrekking» og «Godkjent emnetilpasning». Sammenlign deretter forslagene med den offisielle klassifiseringstabellen og institusjonens gjeldende vokabular: hvor mange forslag var riktige, hvor mange korrigerte du? Sjekk anbefalingene for utdaterte vilkår med malen «Sjekk og nylig sjekk».

sjekkliste

  • [ ] Jeg fikk utført emneanalysen fra det faktiske innholdet, ikke tittelen.
  • [ ] Jeg kartla titlene fra det kontrollerte vokabularet.
  • [ ] Jeg bekreftet de nedre sifrene i klassifiseringsnummeret med den offisielle tabellen.
  • [ ] Jeg har sjekket forslag mot utdaterte og ekskluderende vilkår.
  • [ ] Jeg tok den endelige fag- og klassifiseringsavgjørelsen etter eget skjønn.