Enhed 2 / 11

Kunstig intelligens i katalogisering og generering af metadata

Gevinster:

  • Evne til at forkorte katalogiseringstiden ved at producere udkast til metadata i overensstemmelse med standarder som MARC og Dublin Core fra reelle forlagsoplysninger
  • Evne til at verificere felter med høj risiko for fremstilling, såsom udgivelsesår, ISBN, forfatternavn, med den originale kilde og kort emneudtryk fra det kontrollerede ordforråd
  • Evne til at gøre forfatter- og emneformater enkeltgodkendte med myndighedskontrol og opretholde katalogkonsistens

Katalogisering er bibliotekarets usynlige, men mest grundlæggende job. Opdagelsen af ​​en ressource (bog, artikel, kort, lydoptagelse, digital fil) er mulig med de korrekte metadata. Metadata betyder "data om data": struktureret information, der beskriver en ressources titel, forfatter, udgivelsesår, emne, sprog og fysiske egenskaber. Hvis metadataene er gode, finder brugeren ressourcen; Hvis den er dårlig eller ufuldstændig, går ressourcen tabt, selvom den eksisterer. I denne enhed lærer du, hvordan du bruger kunstig intelligens i udkast til metadatagenerering, men hvordan du sikrer overholdelse af standarder og nøjagtighed.

Lad os først definere de to begreber. MARC (Machine-Readable Cataloging) er et postformat, som biblioteker har brugt i årtier, der placerer hver enkelt information i nummererede felter; F.eks. har felt 245 titlen, og felt 100 har hovedforfatteren. Dublin Core er en forenklet metadatastandard for digitale ressourcer, bestående af 15 grundlæggende felter (titel, skaber, emne, dato, genre osv.). Disse standarder sikrer, at optegnelser fra forskellige biblioteker kan tale med hinanden.

Trin for trin: generering af udkast til metadata med kunstig intelligens

1. Indsaml kildens identitetsoplysninger. Bogens omslag, titelbladet, indholdet eller teksten i en digital fil. AI fungerer kun ud fra de oplysninger, du giver den; Hvis du giver ufuldstændige oplysninger, producerer det ufuldstændige eller fremstillede metadata.

2. Angiv målstandarden. Giv AI et klart mål, såsom "ved Dublin Core fields" eller "af MARC 245, 100, 260, 650 felter." Hvis du ikke angiver en standard, producerer den et vilkårligt format.

3. Fremstil udkastet. AI udarbejder titlen, ansvarserklæringen, publikationsoplysningerne og emneforslaget ud fra de oplysninger, du giver.

4. Udøve myndighedskontrol. En autoritativ optegnelse er en, der etablerer den enkelte standardform for en forfatters navn, institution eller emne (f.eks. "Atatürk, Mustafa Kemal, 1881-1938"). AI kan skrive et navn på forskellige måder; Du kontrollerer og retter det godkendte myndighedsformat.

5. Bekræft og bekræft. Sammenlign hvert felt med den originale kilde. Især præcise oplysninger såsom udgivelsesår, ISBN og forfatternavn er meget modtagelige for at blive forfalsket af AI.

Tip: Giv AI et billede eller tekst af kildens faktiske kreditside; Sig ikke "gæt navnet på bogen". Forudsigende metadata underminerer katalogets pålidelighed. AI skriver selvsikkert, når du laver forudsigelser, og dette vil vildlede dig.

Kontrolleret ordforråd og konsistens

Konsistens er alt i katalogisering. Hvis det samme emne er skrevet med to forskellige udtryk i to forskellige poster, vil brugeren finde det ene og savne det andet. Det er derfor, biblioteker bruger et kontrolleret ordforråd - en godkendt standardliste over termer. Når du foreslår termer fra fri tekst, kan AI vælge dets daglige ækvivalent i stedet for det officielle udtryk på denne liste. For eksempel kan AI’en skrive "hjerteanfald"; hvorimod det godkendte udtryk kan være "myokardieinfarkt".

Løsningen er at give AI det kontrollerede ordforråd og sige "bare vælg fra denne liste". Så i stedet for at finde på vilkår frit, matcher AI den mest passende fra den godkendte liste.

Forsigtig: Hvis et emneudtryk foreslået af AI ikke er i det kontrollerede ordforråd, skal du ikke tilføje dette udtryk til kataloget. Beslutningen om at tilføje nye vilkår er op til den ekspert, der er ansvarlig for myndighedsstyring; Tilføjelse af vilkårlige termer forstyrrer katalogets konsistens.

tre minisager

Case 1 – Donationsindsamling fremskyndet. Et folkebibliotek modtog en donation på 1.200 bøger. Katalogeringsspecialisten fik AI'en til at læse forlaget for hver bog og producere et udkast til Dublin Core; Tiden pr. optagelse faldt fra 9 minutter til 3,5 minutter. Eksperten brugte den resterende tid på myndighedskontrol og verifikation; Den samlede tid blev reduceret med ca. 55 %, men ingen registreringer kom ind i systemet uden at blive verificeret.

Sag 2 - Falsk ISBN fanget. En ekspert fik AI til at fremstille udkast til 30 bøger. Under kontrollen fandt han ud af, at ISBN i 4 poster var falsk: AI havde skrevet et 13-cifret tal, der virkede rimeligt, selvom han ikke kendte bogens rigtige nummer. Verifikationstrinnet forhindrede fire forkerte ISBN'er i at blive vedvarende i kataloget.

Sag 3 — Myndighedsinkonsekvens rettet. Et bibliotek fandt en forfatter som "J. Smith" i nogle optegnelser, "John Smith" i andre, "Smith, John" i andre. AI blev matchet med myndighedsfilen, hvilket bragte alle optegnelser i et enkelt godkendt format ("Smith, John, 1965-"); Hvis dette job blev udført manuelt, ville det tage dage, men med AI-forslaget blev det reduceret til et par timer, men hver kamp blev godkendt af eksperten.

Retrospektiv konvertering og gamle optegnelser

Mange biblioteker har ufuldstændige eller forældede poster, der blev indtastet for år siden med forskellige regler. At flytte disse til den nuværende standard kaldes retrospektiv konvertering og er meget besværligt, når det gøres manuelt. AI kan læse en gammel post og generere et udkast for at flytte den til den aktuelle feltstruktur: for eksempel kan den parse en fritekst-citation og distribuere den til de korrekte felter. Der er dog to farer her. For det første kan AI kompensere for manglende information for at "finde op"; for det andet kan den fortsætte en fejl i den gamle post ved at kopiere den til et nyt format i stedet for at rette den. Derfor, i retrospektiv transformation, bør output af AI kontrolleres systematisk, ikke ved stikprøvetagning, men ved kritiske felter (forfatter, årstal, identifikationsnumre). En god praksis er at vise før- og efterkonverteringsposter side om side, hvilket gør hver ændring synlig; så eksperten med et øjeblik kan se, hvad der er blevet flyttet, hvad der er ændret, og hvad der kan være fabrikeret.

Bemærk: Udkastet til metadata, der er produceret af AI, bør ikke overføres til systemet som en batch uden at gennemgå det én efter én. En massefejl ødelægger hundredvis af poster på én gang, og genfinding er meget mere besværligt end at producere. Det er sikrest at producere og verificere i små partier.

Fire kopierbare skabeloner

1) Dublin Core disposition:

Din rolle: assisterende katalogfører. Udfyld Dublin Core-felterne fra følgende byline-tekst: Titel, Skaber, Emne, Beskrivelse, Udgiver, Dato, Genre, Format, Sprog. Brug kun information, der er tydelig i teksten; Efterlad det manglende felt "[ingen information]", gæt ikke. Forlagstekst: [her]

2) MARC-feltoversigt:

Foreslå skitser for følgende MARC-felter fra boginformationen nedenfor: 245 (titel/kredit), 100 (hovedforfatter), 260/264 (publikation), 300 (fysisk beskrivelse), 650 (emne). Marker ethvert felt, du er usikker på, som "[behov for verifikation]". Information: [her]

3) Emnematching fra kontrolleret ordforråd:

Nedenfor er et resumé af kilden og en liste over godkendte emneudtryk. Match kun de 3-5 bedst egnede udtryk fra listen til kilden. Hvis der ikke er et passende udtryk på listen, skriv "ingen passende term på listen", lad være med at opfinde nye termer. Resumé: [her] / Termliste: [her]

4) Myndighedsformkontrol:

Match forfatternavnene nedenfor med de godkendte formularer i den autorisationsliste, jeg har opgivet. For hvert navn: format i post -> godkendt format. Hvis der ikke er tilsvarende på listen, skriv "ingen myndighedsjournal". Navne: [her] / Myndighedsliste: [her]

Svag prompt / Stærk prompt

Svag prompt:

Uddrag katalogiseringsoplysningerne for følgende bog: "Kunstig intelligens og samfund".

Kun titlen er givet; AI er tvunget til at udgøre forfatter, årstal, udgiver og ISBN. Der er ingen målstandard. Resultat: en overbevisende, men sandsynligvis falsk rekord.

Kraftig prompt:

Din rolle: assisterende katalogfører. Nedenfor er den fulde tekst på bogens forlagsside. Udfyld Dublin Core-felterne herfra. Brug kun oplysninger, der er tydeligt angivet i teksten; Lad ikke-tekstfeltet stå tomt, og skriv "[ingen information]". Der er ingen datoer, navne eller ISBN'er. Forlagstekst: [fuld tekst her]

Den kraftfulde prompt begrænser AI til ægte byline-information og tvinger den til ærligt at efterlade tomrum i stedet for at finde på dem.

Metadatafelt og valideringstabel

område

Risiko for fremstilling

Sådan verificeres

Titel

lav

Sammenlign med forlagsside

Forfatter/autoritetsformat

medium

Søg i myndighedsmappen

Udgivelsesår

høj

Bekræft med påtryk/kolofon

ISBN

meget høj

En-til-en kontrol med stregkode/kilde

Fagterm

høj

Match i kontrolleret ordforråd

Almindelige fejl

  • Bare anmode om metadata fra titlen. Ufuldstændig information får AI til at finde på tingene.
  • Angiver ikke målstandarden. Vilkårlig formatering forstyrrer harmonien i posterne.
  • Accepterer ISBN og årstal uden at bekræfte det. Disse områder har den højeste risiko for fremstilling.
  • At tage fagudtrykket uden for det kontrollerede ordforråd. Konsistens og tilgængelighed er kompromitteret.
  • Omgå myndighedskontrol. Den samme forfatter spreder sig i forskellige formater, brugeren savner kilden.

Sammenfattende

I metadatagenerering er AI en kraftfuld assistent, der hurtigt udtrækker aftryksinformation og forkorter katalogiseringstiden markant. Men prisen på produktivitet er stringent validering i forhold til risiciene ved fremstilling: Gør målstandarden (MARC, Dublin Core) klar, kør kun AI med reel viden om ordord, kortlæg emneudtryk fra kontrollerede ordforråd og valider autoritetsformer. I stedet for at udfylde hullerne, bør AI ærligt lade det være tomt; Du beholder den endelige godkendelse.

Ansøgningsopgave

Giv teksten på aftrykssiden til en rigtig bog, du har, til AI med skabelonen "Dublin Core draft" og få et udkast. Få derefter produceret den samme bog med kun titlen ("Svag prompt") og sammenlign de to output: hvilke felter blev fremstillet? Med skabelonen "Temakortlægning fra kontrolleret ordforråd" skal du derefter give en kort liste over godkendte termer for at få emnet matchet og kontrollere, om AI’en forsvinder fra listen.

tjekliste

  • [ ] Jeg gav kildens reelle identitetsoplysninger til AI, jeg overlod det ikke til at gætte.
  • [ ] Jeg har klart specificeret målmetadatastandarden (MARC/Dublin Core).
  • [ ] Jeg har verificeret udgivelsesåret og ISBN ordret med den originale kilde.
  • [ ] Jeg kortlagde emnetermerne fra det kontrollerede ordforråd.
  • [ ] Jeg har bekræftet autorisationsformerne med den godkendte journal.