Unité 2 / 11

Intelligence artificielle dans le catalogage et la génération de métadonnées

Gains :

  • Possibilité de réduire le temps de catalogage en produisant des projets de métadonnées conformément aux normes telles que MARC et Dublin Core à partir d'informations d'empreinte réelles
  • Capacité à vérifier les champs présentant un risque élevé de fabrication, tels que l'année de publication, l'ISBN, le nom de l'auteur, avec la source originale et les termes du sujet du vocabulaire contrôlé
  • Possibilité de rendre les formats d'auteur et de sujet approuvés de manière unique avec contrôle d'autorité et de maintenir la cohérence du catalogue

Le catalogage est la tâche invisible mais la plus fondamentale de la bibliothéconomie. La découverte d'une ressource (livre, article, carte, enregistrement sonore, fichier numérique) est possible avec les bonnes métadonnées. Les métadonnées désignent des « données sur les données » : des informations structurées qui décrivent le titre d'une ressource, l'auteur, l'année de publication, le sujet, la langue et les attributs physiques. Si les métadonnées sont bonnes, l'utilisateur trouve la ressource ; Si elle est mauvaise ou incomplète, la ressource est perdue même si elle existe. Dans cette unité, vous apprendrez comment utiliser l'intelligence artificielle dans la génération de projets de métadonnées, mais aussi comment garantir la conformité et l'exactitude des normes.

Définissons d'abord les deux concepts. MARC (Machine-Readable Cataloging) est un format d'enregistrement que les bibliothèques utilisent depuis des décennies et qui place chaque élément d'information dans des champs numérotés ; Par exemple, le champ 245 contient le titre et le champ 100 contient l'auteur principal. Dublin Core est une norme de métadonnées simplifiée pour les ressources numériques, composée de 15 champs de base (titre, créateur, sujet, date, genre, etc.). Ces normes garantissent que les documents de différentes bibliothèques peuvent communiquer entre eux.

Pas à pas : générer des projets de métadonnées avec l'intelligence artificielle

1. Collectez les informations d'identité de la source. La couverture du livre, la page de titre, le contenu ou le texte d'un fichier numérique. L'IA ne fonctionne qu'à partir des informations que vous lui fournissez ; Si vous fournissez des informations incomplètes, cela produit des métadonnées incomplètes ou fabriquées.

2. Spécifiez la norme cible. Donnez à l'IA un objectif clair, tel que « par champs Dublin Core » ou « par champs MARC 245, 100, 260, 650 ». Si vous ne spécifiez pas de norme, cela produit un format arbitraire.

3. Produisez le brouillon. AI rédige le titre, la déclaration de responsabilité, les informations de publication et la proposition de sujet à partir des informations que vous fournissez.

4. Exercer un contrôle d’autorité. Un document faisant autorité est celui qui établit la forme unique et standard du nom, de l'institution ou du sujet d'un auteur (par exemple, « Atatürk, Mustafa Kemal, 1881-1938 »). L'IA peut écrire un nom de différentes manières ; Vous vérifiez et corrigez le format d'autorité approuvé.

5. Vérifiez et confirmez. Comparez chaque champ à la source originale. En particulier, des informations précises telles que l’année de publication, l’ISBN et le nom de l’auteur sont très susceptibles d’être falsifiées par l’IA.

Astuce : donnez à l'IA une photo ou un texte de la page de crédit réelle de la source ; Ne dites pas « devinez le nom du livre ». Les métadonnées prédictives nuisent à la fiabilité du catalogue. L'IA écrit avec confiance lorsqu'elle fait des prédictions, ce qui vous induira en erreur.

Vocabulaire et cohérence contrôlés

La cohérence est primordiale dans le catalogage. Si le même sujet est écrit avec deux termes différents dans deux enregistrements différents, l'utilisateur trouvera l'un et manquera l'autre. C'est pourquoi les bibliothèques utilisent un vocabulaire contrôlé – une liste de termes standard approuvés. Lorsqu’elle suggère des termes à partir d’un texte libre, l’IA peut choisir son équivalent familier plutôt que le terme officiel dans cette liste. Par exemple, l’IA pourrait écrire « crise cardiaque » ; alors que le terme approuvé pourrait être « infarctus du myocarde ».

La solution est de donner à l'IA le vocabulaire contrôlé et de dire « il suffit de sélectionner dans cette liste ». Ainsi, au lieu d’inventer librement des termes, l’IA fait correspondre celui qui est le plus approprié dans la liste approuvée.

Attention : Si un terme suggéré par l'IA ne figure pas dans le vocabulaire contrôlé, n'ajoutez pas ce terme au catalogue. La décision d'ajouter de nouveaux termes appartient à l'expert responsable de la gestion de l'autorité ; L'ajout de termes arbitraires perturbe la cohérence du catalogue.

trois mini-cases

Cas 1 — La collecte des dons est accélérée. Une bibliothèque publique a reçu un don de 1 200 livres. Le spécialiste du catalogage a demandé à l'IA de lire la page d'impression de chaque livre et de produire une ébauche du Dublin Core ; La durée par enregistrement est passée de 9 minutes à 3,5 minutes. L'expert a consacré le temps restant au contrôle et à la vérification de l'autorité ; Le temps total a été réduit d'environ 55 %, mais aucun enregistrement n'est entré dans le système sans avoir été vérifié.

Cas 2 – Faux ISBN détecté. Un expert a demandé à AI de produire des brouillons de 30 livres. Lors du contrôle, il a constaté que l'ISBN de 4 enregistrements était faux : AI avait écrit un numéro à 13 chiffres qui semblait raisonnable, même s'il ne connaissait pas le numéro réel du livre. L’étape de vérification a permis d’éviter que quatre ISBN incorrects ne persistent dans le catalogue.

Cas 3 — Incohérence d’autorité corrigée. Une bibliothèque a trouvé un auteur sous le nom de « J. Smith » dans certains documents, « John Smith » dans d'autres, « Smith, John » dans d'autres. L'IA a été mise en correspondance avec le fichier d'autorité, regroupant tous les documents dans un seul format approuvé (« Smith, John, 1965- ») ; Si ce travail était effectué manuellement, cela prendrait des jours, mais avec la suggestion de l'IA, il a été réduit à quelques heures, mais chaque correspondance a été approuvée par l'expert.

Conversion rétrospective et anciens enregistrements

De nombreuses bibliothèques possèdent des notices incomplètes ou périmées qui ont été saisies il y a des années selon des règles différentes. Les déplacer vers la norme actuelle est appelé conversion rétrospective et est très laborieux lorsqu'il est effectué manuellement. L'IA peut lire un ancien enregistrement et générer un brouillon pour le déplacer vers la structure de champs actuelle : par exemple, elle peut analyser une citation en texte libre et la distribuer dans les champs appropriés. Cependant, il existe ici deux dangers. Premièrement, l’IA peut rattraper les informations manquantes pour « rattraper » ; Deuxièmement, cela peut perpétuer une erreur dans l'ancien document en le copiant dans un nouveau format plutôt qu'en le corrigeant. Par conséquent, lors d’une transformation rétrospective, les résultats de l’IA doivent être vérifiés systématiquement, non pas par échantillonnage, mais par champs critiques (auteur, année, numéros d’identification). Une bonne pratique consiste à afficher côte à côte les enregistrements pré- et post-conversion, rendant chaque modification visible ; Ainsi, l'expert peut voir d'un seul coup d'œil ce qui a été déplacé, ce qui a changé et ce qui a pu être fabriqué.

Attention : les projets de métadonnées produits par l'IA ne doivent pas être transférés au système par lots sans les examiner un par un. Une erreur massive corrompt des centaines d’enregistrements à la fois, et la récupération est bien plus problématique que la production. Il est plus sûr de produire et de vérifier en petits lots.

Quatre modèles copiables

1) Aperçu du Dublin Core :

Votre rôle : assistant catalogueur. Remplissez les champs Dublin Core à partir du texte de signature suivant : Titre, Créateur, Sujet, Description, Éditeur, Date, Genre, Format, Langue. Utilisez uniquement les informations claires dans le texte ; Laissez le champ manquant "[aucune information]", ne devinez pas. Texte d'impression : [ici]

2) Aperçu du champ MARC :

Proposez des contours pour les champs MARC suivants à partir des informations du livre ci-dessous : 245 (titre/crédit), 100 (auteur principal), 260/264 (publication), 300 (description physique), 650 (sujet). Marquez tout champ dont vous n'êtes pas sûr comme "[nécessite une vérification]". Informations : [ici]

3) Correspondance de sujets à partir d'un vocabulaire contrôlé :

Vous trouverez ci-dessous un résumé de la source et une liste des termes de sujet approuvés. Faites correspondre uniquement les 3 à 5 termes les plus appropriés de la liste à la source. S'il n'y a pas de terme approprié dans la liste, écrivez « aucun terme approprié dans la liste », n'inventez pas de nouveaux termes. Résumé : [ici] / Liste de termes : [ici]

4) Contrôle du formulaire d'autorité :

Faites correspondre les noms des auteurs ci-dessous avec les formulaires approuvés dans la liste d'autorités que j'ai fournie. Pour chaque nom : format en notice -> format approuvé. S'il n'y a pas d'équivalent dans la liste, écrivez « aucune notice d'autorité ». Noms : [ici] / Liste d'autorités : [ici]

Invite faible/Invite forte

Invite faible :

Extrayez les informations de catalogage du livre suivant : "Intelligence artificielle et société".

Seul le titre est donné ; L'IA est obligée de renseigner l'auteur, l'année, l'éditeur et l'ISBN. Il n’y a pas de norme cible. Résultat : un bilan convaincant mais probablement faux.

Invite puissante :

Votre rôle : assistant catalogueur. Vous trouverez ci-dessous le texte intégral de la page d'impression du livre. Remplissez les champs Dublin Core à partir de là. Utilisez uniquement les informations clairement indiquées dans le texte ; Laissez le champ non textuel vide et écrivez « [aucune information] ». Aucune date, nom ou ISBN n'est inventé. Texte d'impression : [texte intégral ici]

L'invite puissante limite l'IA aux informations réelles et l'oblige à laisser honnêtement des blancs au lieu de les inventer.

Champ de métadonnées et table de validation

zone

Risque de fabrication

Comment vérifier

Titre

faible

Comparer avec la page d'impression

Format auteur/autorité

moyen

Rechercher dans le fichier d'autorité

Année de parution

haut

Confirmer avec empreinte/colophone

ISBN

très élevé

Contrôle individuel avec code-barres/source

Terme du sujet

haut

Correspondance dans un vocabulaire contrôlé

Erreurs courantes

  • Je demande simplement des métadonnées au titre. Des informations incomplètes poussent l’IA à inventer des choses.
  • Ne pas préciser la norme cible. Un formatage arbitraire perturbe l'harmonie des enregistrements.
  • Accepter l'ISBN et l'année sans le vérifier. Ces zones comportent le risque de fabrication le plus élevé.
  • Prendre le terme sujet en dehors du vocabulaire contrôlé. La cohérence et la disponibilité sont compromises.
  • Contourner le contrôle de l’autorité. Le même auteur se disperse dans différents formats, l'utilisateur manque la source.

En résumé

Dans la génération de métadonnées, l’IA est un assistant puissant qui extrait rapidement les informations d’empreinte et réduit considérablement le temps de catalogage. Mais le prix de la productivité est une validation rigoureuse contre les risques de fabrication : clarifier la norme cible (MARC, Dublin Core), exécuter l'IA uniquement avec une véritable connaissance des mots clés, cartographier les termes du sujet à partir de vocabulaires contrôlés et valider les formes d'autorité. Au lieu de combler les lacunes, l’IA devrait honnêtement le laisser vide ; Vous conservez l'approbation finale.

Tâche de candidature

Donnez le texte de la page d'impression d'un vrai livre que vous possédez à l'IA avec le modèle "Dublin Core draft" et obtenez un brouillon. Faites ensuite produire le même livre avec juste le titre (« Invite faible ») et comparez les deux résultats : quels champs ont été fabriqués ? Ensuite, avec le modèle « Mappage de sujets à partir d'un vocabulaire contrôlé », donnez une courte liste de termes approuvés pour faire correspondre le sujet et vérifiez si l'IA sort de la liste.

liste de contrôle

  • [ ] J'ai donné les véritables informations d'identité de la source à l'IA, je ne les ai pas laissées deviner.
  • [ ] J'ai clairement précisé le standard de métadonnées cible (MARC/Dublin Core).
  • [ ] J'ai vérifié l'année de publication et l'ISBN textuellement avec la source originale.
  • [ ] J'ai cartographié les termes du sujet à partir du vocabulaire contrôlé.
  • [ ] J'ai confirmé les formes d'autorité avec le dossier approuvé.