Winst:
- Mogelijkheid om de catalogiseringstijd te verkorten door concept-metagegevens te produceren in overeenstemming met standaarden zoals MARC en Dublin Core op basis van echte imprint-informatie
- Mogelijkheid om velden met een hoog risico op verzinsel te verifiëren, zoals publicatiejaar, ISBN, naam van de auteur, met de originele bron en onderwerptermen uit de gecontroleerde woordenschat in kaart te brengen
- Mogelijkheid om auteurs- en onderwerpformaten afzonderlijk te laten goedkeuren met autoriteitscontrole en de consistentie van de catalogus te behouden
Catalogiseren is de onzichtbare maar meest fundamentele taak van het bibliotheekwezen. Het ontdekken van een bron (boek, artikel, kaart, geluidsopname, digitaal bestand) is mogelijk met de juiste metadata. Metadata betekent “gegevens over data”: gestructureerde informatie die de titel, auteur, jaar van publicatie, onderwerp, taal en fysieke kenmerken van een bron beschrijft. Als de metadata goed zijn, vindt de gebruiker de bron; Als het slecht of onvolledig is, gaat de hulpbron verloren, zelfs als deze bestaat. In dit onderdeel leert u hoe u kunstmatige intelligentie kunt gebruiken bij het genereren van concept-metagegevens, maar ook hoe u ervoor kunt zorgen dat de normen worden nageleefd en nauwkeurig zijn.
Laten we eerst de twee concepten definiëren. MARC (Machine-Readable Cataloging) is een recordformaat dat bibliotheken al tientallen jaren gebruiken en waarbij elk stukje informatie in genummerde velden wordt geplaatst; Veld 245 bevat bijvoorbeeld de titel en veld 100 bevat de hoofdauteur. Dublin Core is een vereenvoudigde metadatastandaard voor digitale bronnen, bestaande uit 15 basisvelden (titel, maker, onderwerp, datum, genre, etc.). Deze standaarden zorgen ervoor dat archiefstukken uit verschillende bibliotheken met elkaar kunnen praten.
Stap voor stap: concept-metadata genereren met kunstmatige intelligentie
1. Verzamel de identiteitsgegevens van de bron. De omslag van het boek, de titelpagina, de inhoud of de tekst van een digitaal bestand. AI werkt alleen op basis van de informatie die jij eraan geeft; Als u onvolledige informatie verstrekt, levert dit onvolledige of verzonnen metadata op.
2. Specificeer de doelstandaard. Geef de AI een duidelijk doel, zoals ‘door Dublin Core-velden’ of ‘door MARC 245, 100, 260, 650 velden.’ Als u geen standaard opgeeft, ontstaat er een willekeurig formaat.
3. Maak het concept. AI stelt de titel, verantwoordelijkheidsverklaring, publicatie-informatie en onderwerpvoorstel op op basis van de informatie die u verstrekt.
4. Oefen gezagscontrole uit. Een gezaghebbend document is een document dat de enige standaardvorm van de naam, het instituut of het onderwerp van een auteur vastlegt (bijvoorbeeld "Atatürk, Mustafa Kemal, 1881-1938"). AI kan een naam op verschillende manieren schrijven; Je controleert en corrigeert het goedgekeurde machtigingsformaat.
5. Controleer en bevestig. Vergelijk elk veld met de oorspronkelijke bron. Met name precieze informatie zoals publicatiejaar, ISBN en auteursnaam zijn zeer vatbaar voor vervalsing door AI.
Tip: Geef de AI een foto of tekst van de daadwerkelijke creditpagina van de bron; Zeg niet "raad de naam van het boek". Voorspellende metadata ondermijnen de betrouwbaarheid van de catalogus. AI schrijft zelfverzekerd bij het doen van voorspellingen, en dit zal u misleiden.
Gecontroleerde woordenschat en consistentie
Consistentie is alles bij het catalogiseren. Als hetzelfde onderwerp met twee verschillende termen in twee verschillende records wordt geschreven, zal de gebruiker de ene vinden en de andere missen. Daarom gebruiken bibliotheken een gecontroleerde woordenschat: een goedgekeurde, standaardlijst met termen. Bij het voorstellen van termen uit vrije tekst kan AI het informele equivalent kiezen in plaats van de officiële term in deze lijst. De AI zou bijvoorbeeld ‘hartaanval’ kunnen schrijven; terwijl de goedgekeurde term "hartinfarct" kan zijn.
De oplossing is om de AI de gecontroleerde woordenschat te geven en te zeggen "selecteer gewoon uit deze lijst". Dus in plaats van vrijelijk termen te verzinnen, matcht de AI de meest geschikte uit de goedgekeurde lijst.
Let op: Als een door AI voorgestelde onderwerpterm niet in de gecontroleerde woordenschat voorkomt, voeg die term dan niet toe aan de catalogus. De beslissing om nieuwe termen toe te voegen ligt bij de deskundige die verantwoordelijk is voor het gezagsbeheer; Het toevoegen van willekeurige termen verstoort de consistentie van de catalogus.
drie minikoffers
Geval 1 — Het inzamelen van donaties is versneld. Een openbare bibliotheek ontving een donatie van 1.200 boeken. De catalogiseringsspecialist liet de AI de afdrukpagina van elk boek lezen en een concept van de Dublin Core maken; De tijd per opname daalde van 9 minuten naar 3,5 minuten. De deskundige besteedde de resterende tijd aan controle en verificatie van de autoriteit; De totale tijd werd met ongeveer 55% verkort, maar er kwamen geen gegevens in het systeem terecht zonder te zijn geverifieerd.
Geval 2 – Vals ISBN-nummer ontdekt. Een expert liet AI concepten maken van 30 boeken. Tijdens de controle ontdekte hij dat het ISBN-nummer in vier records vals was: AI had een 13-cijferig nummer geschreven dat redelijk leek, ook al kende hij het echte nummer van het boek niet. De verificatiestap voorkwam dat vier onjuiste ISBN's persistent werden in de catalogus.
Geval 3 — Inconsequentie van de autoriteit gecorrigeerd. Een bibliotheek vond een auteur als "J. Smith" in sommige documenten, "John Smith" in andere, "Smith, John" in andere. AI werd gekoppeld aan het autoriteitsbestand, waardoor alle records in één goedgekeurd formaat werden gebracht ("Smith, John, 1965-"); Als deze klus handmatig zou worden gedaan, zou het dagen duren, maar met de AI-suggestie werd dit teruggebracht tot een paar uur, maar elke match werd goedgekeurd door de expert.
Retrospectieve conversie en oude records
Veel bibliotheken beschikken over onvolledige of verouderde documenten die jaren geleden met andere regels zijn ingevoerd. Het verplaatsen hiervan naar de huidige standaard wordt retrospectieve conversie genoemd en is zeer bewerkelijk als dit handmatig wordt gedaan. De AI kan een oud record lezen en een concept genereren om dit naar de huidige veldstructuur te verplaatsen: het kan bijvoorbeeld een vrije-tekstcitaat ontleden en naar de juiste velden distribueren. Er schuilen hier echter twee gevaren. Ten eerste kan AI ontbrekende informatie ‘goedmaken’; ten tweede kan het een fout in het oude document laten voortduren door het naar een nieuw formaat te kopiëren in plaats van het te corrigeren. Daarom moet bij retrospectieve transformatie de output van AI systematisch worden gecontroleerd, niet door middel van steekproeven, maar op basis van kritische velden (auteur, jaar, identificatienummers). Het is een goede gewoonte om records vóór en na de conversie naast elkaar weer te geven, zodat elke wijziging zichtbaar wordt; zodat de deskundige in één oogopslag kan zien wat er is verplaatst, wat er is veranderd en wat er mogelijk is verzonnen.
Let op: De concept-metagegevens die door de AI worden geproduceerd, mogen niet als batch naar het systeem worden overgedragen zonder deze één voor één te bekijken. Een massafout corrumpeert honderden records tegelijk, en het ophalen is veel lastiger dan het produceren ervan. Het is het veiligst om in kleine batches te produceren en te verifiëren.
Vier kopieerbare sjablonen
1) Dublin Core-overzicht:
Jouw rol: assistent catalogiseerder. Vul de Dublin Core-velden in uit de volgende naamregeltekst: Titel, Maker, Onderwerp, Beschrijving, Uitgever, Datum, Genre, Formaat, Taal. Gebruik alleen informatie die duidelijk in de tekst staat; Laat het ontbrekende veld "[geen informatie]" staan, gok niet. Impressumtekst: [hier]
2) MARC-veldoverzicht:
Stel schetsen voor de volgende MARC-velden voor uit de onderstaande boekinformatie: 245 (titel/credit), 100 (hoofdauteur), 260/264 (publicatie), 300 (fysieke beschrijving), 650 (onderwerp). Markeer elk veld waarvan u niet zeker bent als "[verificatie vereist]". Informatie: [hier]
3) Onderwerpmatching vanuit gecontroleerde woordenschat:
Hieronder vindt u een samenvatting van de bron en een lijst met goedgekeurde onderwerptermen. Match alleen de 3-5 meest geschikte termen uit de lijst met de bron. Als er geen geschikte term in de lijst staat, schrijf dan "geen geschikte term in de lijst", verzin geen nieuwe termen. Samenvatting: [hier] / Termenlijst: [hier]
4) Controle van autoriteitsformulieren:
Zorg ervoor dat de onderstaande auteursnamen overeenkomen met de goedgekeurde formulieren in de lijst met autoriteiten die ik heb verstrekt. Voor elke naam: formaat in record -> goedgekeurd formaat. Als er geen equivalent in de lijst staat, schrijf dan "geen autoriteitsrecord". Namen: [hier] / Lijst van autoriteiten: [hier]
Zwakke prompt/sterke prompt
Zwakke prompt:
Pak de catalogiseringsinformatie uit voor het volgende boek: "Artificial Intelligence and Society".
Alleen de titel wordt gegeven; De AI wordt gedwongen de auteur, het jaartal, de uitgever en het ISBN-nummer op te geven. Er is geen doelnorm. Resultaat: een overtuigend maar waarschijnlijk vals record.
Krachtige prompt:
Jouw rol: assistent catalogiseerder. Hieronder vindt u de volledige tekst van de afdrukpagina van het boek. Vul hieruit de Dublin Core-velden in. Gebruik alleen informatie die duidelijk in de tekst vermeld staat; Laat het niet-tekstveld leeg en schrijf "[geen informatie]". Er zijn geen data, namen of ISBN's verzonnen. Impressumtekst: [volledige tekst hier]
De krachtige prompt beperkt de AI tot echte naamregelinformatie en dwingt hem om eerlijk lege plekken achter te laten in plaats van ze te verzinnen.
Metagegevensveld en validatietabel
gebied
Risico van fabricage
Hoe te verifiëren
Titel
laag
Vergelijk met impressumpagina
Auteur/autoriteit-formaat
middelmatig
Zoeken in autoriteitsbestand
Jaar van publicatie
hoog
Bevestig met impressum/colofon
ISBN-nummer
zeer hoog
Eén-op-één controle met barcode/bron
Onderwerp term
hoog
Match in gecontroleerde woordenschat
Veel voorkomende fouten
- Ik vraag alleen metadata uit de titel. Onvolledige informatie zorgt ervoor dat AI dingen verzint.
- Het niet specificeren van de doelstandaard. Willekeurige opmaak verstoort de harmonie van de records.
- Het ISBN en jaartal accepteren zonder het te verifiëren. Deze gebieden brengen het grootste risico op fabricage met zich mee.
- De onderwerpterm van buiten de gecontroleerde woordenschat halen. Consistentie en beschikbaarheid komen in gevaar.
- Het omzeilen van autoriteitscontrole. Dezelfde auteur verspreidt zich in verschillende formaten, de gebruiker mist de bron.
Samengevat
Bij het genereren van metadata is AI een krachtige assistent die snel afdrukinformatie extraheert en de catalogiseringstijd aanzienlijk verkort. Maar de prijs van de productiviteit is een strenge validatie tegen de risico’s van fabricage: maak de doelstandaard (MARC, Dublin Core) duidelijk, voer de AI alleen uit met echte kennis van woordwoorden, breng onderwerptermen uit gecontroleerde vocabulaires in kaart en valideer autoriteitsformulieren. In plaats van de gaten op te vullen, zou de AI het eerlijk open moeten laten; U behoudt de definitieve goedkeuring.
Applicatie taak
Geef de tekst van de imprintpagina van een echt boek dat je hebt aan de AI met het sjabloon "Dublin Core draft" en ontvang een concept. Laat vervolgens hetzelfde boek produceren met alleen de titel ("Zwakke prompt") en vergelijk de twee resultaten: welke velden zijn verzonnen? Geef vervolgens met de sjabloon 'Onderwerptoewijzing vanuit gecontroleerde woordenschat' een korte lijst met goedgekeurde termen om het onderwerp op elkaar af te stemmen en controleer of de AI van de lijst verdwijnt.
controlelijst
- [ ] De echte identiteitsgegevens van de bron heb ik aan de AI gegeven, ik heb het niet aan het raden overgelaten.
- [ ] Ik heb de beoogde metadatastandaard (MARC/Dublin Core) duidelijk gespecificeerd.
- [ ] Ik heb het publicatiejaar en het ISBN woordelijk geverifieerd met de originele bron.
- [ ] Ik heb de onderwerptermen uit de gecontroleerde woordenschat in kaart gebracht.
- [ ] Ik heb de vormen van autoriteit bevestigd met het goedgekeurde document.