Gevinster:
- Evne til å forkorte katalogiseringstiden ved å produsere utkast til metadata i samsvar med standarder som MARC og Dublin Core fra ekte forlagsinformasjon
- Evne til å verifisere felt med høy risiko for fabrikasjon, for eksempel publiseringsår, ISBN, forfatternavn, med originalkilden og kartlegge emneord fra det kontrollerte vokabularet
- Evne til å gjøre forfatter- og emneformater enkeltgodkjent med autoritetskontroll og opprettholde katalogkonsistens
Katalogisering er bibliotekarets usynlige, men mest grunnleggende jobb. Oppdagelsen av en ressurs (bok, artikkel, kart, lydopptak, digital fil) er mulig med riktige metadata. Metadata betyr "data om data": strukturert informasjon som beskriver en ressurss tittel, forfatter, publiseringsår, emne, språk og fysiske egenskaper. Hvis metadataene er gode, finner brukeren ressursen; Hvis den er dårlig eller ufullstendig, går ressursen tapt selv om den eksisterer. I denne enheten vil du lære hvordan du bruker kunstig intelligens i utkast til metadatagenerering, men hvordan du sikrer standardoverholdelse og nøyaktighet.
La oss først definere de to konseptene. MARC (Machine-Readable Cataloging) er et postformat som biblioteker har brukt i flere tiår som plasserer hver informasjonsbit i nummererte felt; For eksempel har felt 245 tittelen og felt 100 inneholder hovedforfatteren. Dublin Core er en forenklet metadatastandard for digitale ressurser, bestående av 15 grunnleggende felt (tittel, skaper, emne, dato, sjanger osv.). Disse standardene sikrer at poster fra ulike biblioteker kan snakke med hverandre.
Trinn for trinn: generere utkast til metadata med kunstig intelligens
1. Samle inn kildens identitetsinformasjon. Bokens omslag, tittelsiden, innholdet eller teksten til en digital fil. AI fungerer bare fra informasjonen du gir den; Hvis du oppgir ufullstendig informasjon, produserer det ufullstendige eller fabrikkerte metadata.
2. Spesifiser målstandarden. Gi AI et tydelig mål, for eksempel "ved Dublin Core-felt" eller "av MARC 245, 100, 260, 650 felt." Hvis du ikke spesifiserer en standard, produserer den et vilkårlig format.
3. Lag utkastet. AI utarbeider tittel, ansvarserklæring, publikasjonsinformasjon og emneforslag fra informasjonen du oppgir.
4. Utøve myndighetskontroll. En autoritativ post er en som etablerer den enkle standardformen for en forfatters navn, institusjon eller emne (f.eks. "Atatürk, Mustafa Kemal, 1881-1938"). AI kan skrive et navn på forskjellige måter; Du kontrollerer og korrigerer godkjent myndighetsformat.
5. Bekreft og bekreft. Sammenlign hvert felt med den opprinnelige kilden. Spesielt presis informasjon som publiseringsår, ISBN og forfatternavn er svært utsatt for å bli forfalsket av AI.
Hint: Gi AI et bilde eller tekst av kildens faktiske kredittside; Ikke si "gjett navnet på boken". Prediktive metadata undergraver påliteligheten til katalogen. AI skriver selvsikkert når du lager spådommer, og dette vil villede deg.
Kontrollert ordforråd og konsistens
Konsistens er alt i katalogisering. Hvis samme emne er skrevet med to forskjellige termer i to forskjellige poster, vil brukeren finne det ene og savne det andre. Det er derfor biblioteker bruker et kontrollert vokabular – en godkjent, standard liste over termer. Når du foreslår termer fra fritekst, kan AI velge dets ekvivalent i dagligtale i stedet for den offisielle termen i denne listen. For eksempel kan AI skrive "hjerteinfarkt"; mens den godkjente betegnelsen kan være "hjerteinfarkt".
Løsningen er å gi AI det kontrollerte vokabularet og si "bare velg fra denne listen". Så i stedet for å gjøre opp vilkår fritt, matcher AI den mest passende fra den godkjente listen.
Forsiktig: Hvis et emneord foreslått av AI ikke finnes i det kontrollerte vokabularet, må du ikke legge det til i katalogen. Beslutningen om å legge til nye vilkår er opp til den sakkyndige som er ansvarlig for myndighetsforvaltningen; Å legge til vilkårlige termer forstyrrer konsistensen i katalogen.
tre minisaker
Sak 1 – Innsamling av donasjoner akselerert. Et folkebibliotek mottok en donasjon på 1200 bøker. Katalogeringsspesialisten fikk AI til å lese forlaget til hver bok og produsere et utkast av Dublin Core; Tiden per opptak gikk ned fra 9 minutter til 3,5 minutter. Eksperten brukte den resterende tiden til myndighetskontroll og verifikasjon; Den totale tiden ble redusert med ca. 55 %, men ingen poster kom inn i systemet uten å ha blitt verifisert.
Sak 2 – Falsk ISBN fanget. En ekspert lot AI produsere utkast til 30 bøker. Under sjekken fant han ut at ISBN i 4 poster var falsk: AI hadde skrevet et 13-sifret nummer som virket rimelig, selv om han ikke visste det virkelige nummeret på boken. Bekreftelsestrinnet forhindret fire feil ISBN-numre fra å bli vedvarende i katalogen.
Sak 3 — Myndighetsinkonsekvens korrigert. Et bibliotek fant en forfatter som "J. Smith" i noen poster, "John Smith" i andre, "Smith, John" i andre. AI ble matchet med autoritetsfilen, og brakte alle poster i et enkelt godkjent format ("Smith, John, 1965-"); Hvis denne jobben ble gjort manuelt, ville det ta dager, men med AI-forslaget ble det redusert til noen få timer, men hver kamp ble godkjent av eksperten.
Retrospektiv konvertering og gamle poster
Mange biblioteker har ufullstendige eller utdaterte poster som ble lagt inn for år siden med forskjellige regler. Å flytte disse til gjeldende standard kalles retrospektiv konvertering og er svært arbeidskrevende når det gjøres manuelt. AI kan lese en gammel post og generere et utkast for å flytte den til gjeldende feltstruktur: den kan for eksempel analysere en fritekstsitering og distribuere den til de riktige feltene. Det er imidlertid to farer her. For det første kan AI gjøre opp manglende informasjon for å "ta igjen"; for det andre kan det opprettholde en feil i den gamle posten ved å kopiere den til et nytt format i stedet for å rette den. Derfor, i retrospektiv transformasjon, bør produksjonen av AI kontrolleres systematisk, ikke ved prøvetaking, men av kritiske felt (forfatter, år, identifiserende tall). En god praksis er å vise poster før og etter konvertering side ved side, slik at hver endring blir synlig. slik at eksperten på et øyeblikk kan se hva som har blitt flyttet, hva som har endret seg og hva som kan ha blitt fabrikkert.
Oppmerksomhet: Utkastet til metadata produsert av AI skal ikke overføres til systemet som en batch uten å gjennomgå det én etter én. En massefeil ødelegger hundrevis av poster samtidig, og gjenfinning er mye mer plagsomt enn å produsere. Det er tryggest å produsere og verifisere i små partier.
Fire kopierbare maler
1) Dublin Core disposisjon:
Din rolle: assistentkataloger. Fyll ut Dublin Core-feltene fra følgende byline-tekst: Tittel, Skaper, Emne, Beskrivelse, Utgiver, Dato, Sjanger, Format, Språk. Bruk kun informasjon som er tydelig i teksten; La det manglende feltet "[ingen informasjon]", ikke gjett. Forlagstekst: [her]
2) MARC-feltoversikt:
Foreslå skisser for følgende MARC-felt fra bokinformasjonen nedenfor: 245 (tittel/kreditt), 100 (hovedforfatter), 260/264 (publikasjon), 300 (fysisk beskrivelse), 650 (emne). Merk ethvert felt du er usikker på som "[trenger bekreftelse]". Informasjon: [her]
3) Emnetilpasning fra kontrollert vokabular:
Nedenfor er et sammendrag av kilden og en liste over godkjente emneord. Match bare de 3-5 mest passende termene fra listen til kilden. Hvis det ikke er et passende begrep i listen, skriv "ingen egnet begrep i listen", ikke lag nye begreper. Sammendrag: [her] / Terminliste: [her]
4) Myndighetsskjemakontroll:
Match forfatternavnene nedenfor med de godkjente skjemaene i autorisasjonslisten jeg ga. For hvert navn: format i post -> godkjent format. Hvis det ikke er tilsvarende i listen, skriv "ingen myndighetspost". Navn: [her] / Autoritetsliste: [her]
Svak forespørsel / Sterk forespørsel
Svak melding:
Trekk ut katalogiseringsinformasjonen for følgende bok: "Artificial Intelligence and Society".
Bare tittelen er gitt; AI er tvunget til å utgjøre forfatter, år, utgiver og ISBN. Det er ingen målstandard. Resultat: en overbevisende, men sannsynligvis falsk rekord.
Kraftig ledetekst:
Din rolle: assistentkataloger. Nedenfor er hele teksten til bokens forlagsside. Fyll ut Dublin Core-feltene fra denne. Bruk kun informasjon som er tydelig angitt i teksten; La ikke-tekstfeltet stå tomt og skriv "[ingen informasjon]". Ingen datoer, navn eller ISBN-nummer er laget. Forlagstekst: [fulltekst her]
Den kraftige ledeteksten begrenser AI til ekte byline-informasjon og tvinger den til å være ærlig i stedet for å finne på dem.
Metadatafelt og valideringstabell
område
Fare for fabrikasjon
Hvordan verifisere
Tittel
lav
Sammenlign med forlagsside
Forfatter/autoritetsformat
medium
Søk i autoritetsfil
Utgivelsesår
høy
Bekreft med avtrykk/kolofon
ISBN
veldig høy
En-til-en kontroll med strekkode/kilde
Fagbegrep
høy
Match i kontrollert vokabular
Vanlige feil
- Bare ber om metadata fra tittelen. Ufullstendig informasjon driver AI til å finne på ting.
- Spesifiserer ikke målstandarden. Vilkårlig formatering forstyrrer harmonien i postene.
- Godta ISBN og årstall uten å bekrefte det. Disse områdene har høyest risiko for fabrikasjon.
- Å ta fagtermen fra utenfor det kontrollerte vokabularet. Konsistens og tilgjengelighet er kompromittert.
- Omgå myndighetskontroll. Den samme forfatteren sprer seg i forskjellige formater, brukeren savner kilden.
Oppsummert
I metadatagenerering er AI en kraftig assistent som raskt trekker ut forlagsinformasjon og reduserer katalogiseringstiden betydelig. Men prisen på produktivitet er streng validering mot risikoen ved fabrikasjon: gjør målstandarden (MARC, Dublin Core) klar, kjør kun AI med ekte ordkunnskap, kartlegg emneord fra kontrollerte vokabularer og valider autoritetsskjemaer. I stedet for å gjøre opp hullene, bør AI ærlig la det stå tomt; Du beholder den endelige godkjenningen.
Søknadsoppgave
Gi teksten på forlaget til en ekte bok du har til AI med malen "Dublin Core draft" og få et utkast. Få så den samme boken produsert med bare tittelen ("Svak ledetekst") og sammenlign de to utgangene: hvilke felt ble fabrikkert? Deretter, med "Temakartlegging fra kontrollert vokabular"-malen, gi en kort liste over godkjente termer for å få emnet matchet og sjekk om AI-en forsvinner fra listen.
sjekkliste
- [ ] Jeg ga den virkelige identitetsinformasjonen til kilden til AI, jeg overlot det ikke til å gjette.
- [ ] Jeg har tydelig spesifisert målmetadatastandarden (MARC/Dublin Core).
- [ ] Jeg har bekreftet publiseringsåret og ISBN ordrett med originalkilden.
- [ ] Jeg kartla emnebegrepene fra det kontrollerte vokabularet.
- [ ] Jeg har bekreftet fullmaktsformene med den godkjente posten.