Gains :
- Capacité à produire des projets de métadonnées conformément à des normes telles que ISAD(G) ou Dublin Core avec intelligence artificielle
- Capacité à prévenir les hallucinations et à mapper les termes du sujet à un vocabulaire contrôlé avec une autorisation laissée en blanc
- Possibilité de distinguer quels champs, tels que la date, le nom de la personne et le code de référence, nécessitent une approbation humaine et lesquels ne doivent être attribués que par l'institution.
Une archive ou une bibliothèque, aussi riche soit-elle, ne peut être trouvée que si elle est bien définie. Ce qui rend un document « trouvable », ce sont les informations descriptives le concernant : qui l’a écrit, quand, où, quel est son sujet, à quelle collection il appartient. Ces informations sont appelées métadonnées (métadonnées — données descriptives sur un document ; « données sur les données »). Le catalogage est le processus d'identification des documents avec ces métadonnées et de leur enregistrement dans un système consultable. La classification consiste à organiser les documents selon des critères tels que le sujet, le type ou l'origine.
La génération de métadonnées prend extrêmement de temps ; La saisie individuelle des informations sur la date, le sujet, la personne et le lieu pour des milliers de documents appartenant à de grandes collections peut prendre des années. L’IA est un puissant générateur de projets dans ce secteur. Dans cette unité, nous verrons comment générer des métadonnées avec l'IA, un catalogage conforme aux normes (ISAD(G), Dublin Core), ainsi que la puissance et les pièges de la classification automatique.
Normes archivistiques : pourquoi elles sont nécessaires
Les métadonnées ne sont pas saisies au hasard ; Il existe des standards internationaux pour que les dossiers de différentes institutions puissent communiquer entre eux :
- ISAD(G) (General International Standard Archival Description) : Règles de description hiérarchique des documents d'archives (au niveau du fonds, de la série, du dossier, du document). Il contient des champs tels que le code de référence, le titre, la date, la portée, le créateur.
- Dublin Core : norme commune composée de 15 champs principaux pour décrire les ressources numériques (titre, créateur, sujet, date, genre, format, source, langue, etc.).
- Fonds : Ensemble de documents naturellement formés à la suite des activités d'une seule personne, famille ou institution. C'est l'unité organisatrice de base de l'archivage.
- Provenance (origine) : informations sur l'origine d'un document et par quelle main il est passé. En archivage, les documents sont conservés ensemble selon leur origine.
Spécifier explicitement la norme cible lorsque l'IA produit des métadonnées garantit que la sortie peut être directement saisie dans l'entreprise.
Un autre concept clé est la notice d'autorité, une notice qui définit une forme unique, standard et approuvée du nom d'une personne, d'un lieu ou d'une institution. Dans les documents historiques, la même personne ou le même lieu peut apparaître avec des orthographes différentes ; La notice d'autorité les lie toutes dans un seul format approuvé afin qu'elles ne soient pas dispersées dans la recherche. L'IA suggère des noms à partir d'un document ; mais mapper ce nom sur la forme standard de la notice d'autorité est un travail humain. Relier ce que l'IA dit « Ahmed » à « Ahmed Bey (1840-1912) » dans la notice d'autorité de l'institution préserve la cohérence du catalogue.
Flux de travail : étape par étape
1. Préparez la source. Collectez une transcription ou une image du document et toute information contextuelle.
2. Identifiez la norme et les domaines. Indiquez à l'IA quelle norme (ISAD(G), Dublin Core) et selon quels domaines elle produira une sortie.
3. Générez un brouillon de métadonnées. L'IA remplit des champs pouvant être extraits du document (date, personne, lieu, sujet, langue, genre) ; Il laisse vides les zones qu'il ne peut pas supprimer.
4. Cartographiez le vocabulaire contrôlé. Les noms de sujets et de lieux ne sont pas libres dans la plupart des établissements, mais sont liés à une liste prédéfinie (vocabulaire / thésaurus contrôlé). Mappez les termes de sujet suggérés par l'IA sur cette liste.
5. Vérifiez et confirmez. Chaque champ, en particulier la date, le nom et le sujet, est comparé par des êtres humains avec des documents et des registres d'autorité.
Astuce : donnez explicitement à l'IA la permission de "laisser vide". Sinon, il « devinera » une date ou un créateur qui ne figure pas dans le document et insérera de fausses métadonnées dans votre catalogue. La consigne « Laissez ce champ vide s’il ne figure pas dans le document » constitue le bouclier le plus puissant contre les hallucinations.
Champs et niveau de confiance dans une table
Champ de métadonnées
Quelle est la fiabilité de l’IA ?
vérification
langue
haut
échantillon
Type de document
moyen-élevé
contrôle
Noms de personnes/lieux
Moyen (erreur de lecture)
obligatoire
rendez-vous
Faible-moyen (risque de fabrication)
obligatoire
Termes du sujet
Moyen (génération gratuite)
Carte vers la liste de contrôle
Portée/résumé
moyen-élevé
Comparer avec la source
Code de référence
Aucun (l'établissement donne)
lancers humains
Résumé : L'IA est rapide et fiable dans des domaines tels que la langue et le genre ; génère des brouillons dans des champs tels que la date, le nom et le sujet, mais l'approbation humaine est requise ; L’IA ne produit jamais de champs institutionnels tels que le code de référence.
trois mini-cases
Cas 1 — Projet de métadonnées pour 8 000 photos. Les archives municipales cataloguaient 8 000 photographies historiques. Les notes au dos de chaque photo ont été transcrites et remises à l’IA ; Date, lieu et aperçu du sujet générés par l'IA. L’équipe humaine l’a vérifié champ par champ et l’a mappé à la liste contrôlée. Un travail estimé à 10 mois a été réduit à 3 mois ; mais chaque date et chaque nom de lieu ont été vérifiés visuellement.
Cas 2 — Histoire inventée. Un archiviste a fait cataloguer à AI une lettre non datée. YZ a regardé le contenu de la lettre et a écrit la date « 1912 » avec précision. Cependant, il n'y avait aucune date dans le document ; L’IA l’a prédit. Si l'archiviste n'avait pas ajouté la consigne « laisser vide si ce n'est pas dans le document », le catalogue aurait été rempli d'une date inventée. Leçon : une autorisation vierge est obligatoire.
Cas 3 — Les termes d'objet libres ont créé de la confusion. AI a attribué des termes libres similaires mais différents, tels que « immigration », « immigration », « établissement » à des documents similaires. Lorsqu’il n’était pas mappé au vocabulaire contrôlé, le même sujet était étiqueté avec trois termes différents et dispersé dans la recherche. La cohérence a été obtenue en mappant les termes dans une seule liste d’autorités. Leçon : les termes du sujet ne sont pas publiés, ils sont liés à la liste.
Quatre modèles copiables
1) Aperçu du Dublin Core :
Extrayez le projet de métadonnées Dublin Core de la transcription du document ci-dessous. Champs : Titre, Créateur, Sujet, Description, Date, Genre, Langue, Portée (lieu/période). Règles : (1) Utilisez uniquement les informations CLAIREMENT dans le texte. (2) Laissez le champ qui n'est pas dans le texte VIDE, ne devinez pas. (3) Marquez la valeur dont vous n'êtes pas sûr avec [?]. Transcription : [ici]
2) Projet de définition ISAD(G) :
Générez un brouillon pour le document suivant dans les champs ISAD(G) : Titre, Date(s), Niveau de description (document/fichier), Portée et contenu (bref résumé), Créateur, Langue. Laissez le code de référence VIERGE (l'établissement le fournira). N'ajoutez aucune information qui ne figure pas dans le texte ; Laissez le champ inexistant vide. Document : [ici]
3) Suggestion de terme de sujet (contrôlée) :
Suggérez 3 à 5 termes de sujet appropriés au document ci-dessous. Tout d’abord, fiez-vous aux faits contenus dans le document. Vous trouverez ci-dessous la liste de terminologie contrôlée de notre institution ; D’ABORD, choisissez-le dans cette liste, s’il n’y figure pas, marquez votre nouvelle suggestion de terme séparément. Liste : [termes]. Document : [ici]
4) Vérification de cohérence globale :
Vous trouverez ci-dessous les enregistrements de métadonnées pour les documents de la même collection. Signaler les incohérences : enregistrements épelant différemment le même lieu/la même personne, différents formats de date, différents termes pour le même sujet. Correction IMPOSITION; Produisez simplement une liste d’incohérences que l’humain pourra examiner. Dossiers : [ici]
Invite faible/Invite forte
Faible :
Créez une notice de catalogue complète pour ce document.
La consigne « complète » pousse l’IA à remplir tous les espaces, c’est-à-dire à inventer une histoire et des créateurs qui n’existent pas.
Fort :
Le Dublin Core est rédigé pour ce document. Utilisez uniquement les informations CLAIREMENT incluses dans la transcription ; laissez le champ inexistant vide, ne devinez pas. Sélectionnez les termes du sujet dans cette liste contrôlée : [liste]. Marquez la date et les noms des personnes avec [?] afin que je puisse les vérifier avec le document. Transcription : [ici]
Différence : autorisation « laisser vide » au lieu d'édition « complète », adhésion à la liste contrôlée et marques de vérification protègent le catalogue de la fabrication.
Erreurs courantes
- Cela signifie « remplissez-le complètement ». Cela conduit à ajuster des champs inexistants ; L'autorisation « laisser vide » doit être accordée.
- Publication des termes du sujet. Les termes qui ne correspondent pas au vocabulaire contrôlé détourneront la recherche.
- Demander à l’IA de prédire l’histoire. Inscrire une date fictive dans un document non daté pollue le catalogue.
- Avoir le code de référence généré par l'IA. Il s'agit d'un espace corporatif unique; les gens jettent.
- Sans préciser la norme. Si la norme n’est pas mentionnée, le résultat sera un brouillon désordonné qui ne pourra pas être saisi dans l’institution.
En résumé
Les métadonnées et le catalogage constituent l’infrastructure invisible qui ouvre les archives au chercheur, et cela demande beaucoup d’efforts. À partir de la transcription, l’IA produit un aperçu rapide de champs tels que la date, la personne, le lieu, le sujet et le genre ; Il peut fonctionner selon des normes telles que ISAD(G) ou Dublin Core. Mais la pression de « remplir complètement » pousse l’IA à inventer des choses ; L'autorisation « laisser vide », le mappage à un vocabulaire contrôlé et la confirmation humaine des dates/noms garantissent la fiabilité du catalogue. AI prépare le projet ; Vous êtes responsable de l’exactitude du catalogue.
Tâche de candidature
Prendre une transcription de document et demander des métadonnées à l'IA avec le modèle « Dublin Core draft » ; Vérifiez qu'il laisse des champs vides qui n'existent pas. Ensuite, exécutez le modèle « suggestion de terme de sujet » avec votre propre liste de contrôle (ou un exemple). Enfin, testez quelques enregistrements avec une « vérification de cohérence globale ». Notez combien de champs l'IA essaie de remplir avec la prédiction et combien de termes de sujet doivent être mappés à la liste.
liste de contrôle
- [ ] J'ai clairement indiqué la norme cible (ISAD(G)/Dublin Core).
- [ ] J'ai donné l'autorisation "Laisser le champ vide".
- [ ] J'ai mappé les termes du sujet sur la liste contrôlée.
- [ ] J'ai vérifié la date et les noms des personnes avec le document/enregistrement d'autorité.
- [ ] J'ai laissé le code de référence à l'institution, pas à AI.