Unité 8 / 12

Analyse de contenu et découverte de modèles

Gains :

  • Capacité à extraire des modèles à partir de grands ensembles de textes à l'aide de techniques telles que le NER, l'extraction de relations, la chronologie et l'analyse de réseau.
  • Être capable de voir le modèle comme une hypothèse plutôt que comme une preuve, reliant les entités à la source et les normalisant avec l'approbation humaine
  • Capacité à comprendre comment les chiffres peuvent être trompeurs en raison de données manquantes et de biais d’échantillonnage, et à éviter les relations et chronologies artificielles.

La recherche historique ne consiste pas seulement à lire des documents individuels ; recherchant souvent des modèles dans de grands ensembles de documents. Dans quels contextes un nom particulier apparaît-il au fil des années ? Quelles personnes sont associées à une colonie ? Comment un sujet évolue-t-il au fil du temps ? Qui correspond avec qui ? De telles questions nécessitent d’examiner non pas un seul document, mais des centaines de documents collectivement. C’est ce qu’on appelle souvent les humanités numériques – l’application de méthodes informatiques à des domaines tels que l’histoire et la littérature.

L’IA est puissante pour extraire des informations structurées à partir de grands ensembles de textes. Dans cette unité, vous apprendrez la NER (reconnaissance d'entités nommées), l'extraction de modèles et de relations, la logique de modélisation de sujets et la création de chronologies ; mais nous aborderons également l’écueil le plus dangereux de ces techniques : l’IA se présentant comme ayant « trouvé » un modèle qui n’existe pas.

Techniques de base

  • NER (Named Entity Recognition) : Extraction automatique d'entités telles que personne, lieu, institution, date à partir du texte. Il produit une liste du type « Tous les noms de lieux mentionnés dans ces 500 documents » en quelques minutes.
  • Inférence relationnelle : Marquage des liens entre entités (« Personne X à la place Y », « A correspond à B »).
  • Modélisation de sujets : recherche statistique de groupes de sujets récurrents dans un large ensemble de textes. Il montre quels thèmes sont concentrés sur quelle période.
  • Inférence chronologique : classement des événements datés dans des documents dans un ordre chronologique.
  • Analyse de réseau : Visualiser les relations interpersonnelles/institutionnelles comme un réseau (qui est le centre, qui est le point de connexion).

L'objectif commun de tous est de révéler des structures qui n'apparaissent pas dans un seul document mais qui apparaissent dans toute la collection. Ces techniques créent des motifs visibles qui ne seraient jamais visibles par la seule lecture. Mais chacun d’eux est un « signe », non une « preuve » ; Il est essentiel de vérifier ce qui se trouve dans le document original.

Un concept fréquemment utilisé dans ce domaine est la distinction entre lecture rapprochée (lecture d'un texte en profondeur, ligne par ligne) et lecture distante (regarder des centaines/milliers de textes collectivement, statistiquement). L’IA permet de lire à distance : vous voyez des modèles dans un corpus suffisamment grand pour durer une seule vie humaine. Mais lorsque la lecture lointaine révèle une tendance, il est nécessaire de revenir à la lecture rapprochée, c’est-à-dire au document original, pour lui donner un sens. Les deux méthodes ne sont pas interchangeables ; L’un montre le motif, l’autre donne sa signification. Les recherches les plus robustes utilisent les deux ensemble.

Astuce : utilisez l’analyse de modèles comme générateur d’hypothèses : « L’IA a repéré un modèle ici, est-il réel ? Vérifiez ensuite ce modèle dans les documents un par un. Le modèle est le point de départ de votre recherche, pas le résultat.

Flux de travail : étape par étape

1. Clarifiez la question. « Quelles personnes apparaissent le plus souvent ensemble dans cette collection ? » Une question de modèle claire comme.

2. Préparez et étiquetez les données. Organisez le texte avec des références à la source afin que tous les éléments trouvés puissent être liés au document.

3. L'entité/le modèle apparaît. Générez un NER, une relation ou un aperçu de la chronologie avec l'IA.

4. Normalisez. Combinez différentes orthographes de la même personne/lieu (« Istanbul / Istanbul / Kostantiniyye » le même endroit ?). Cette étape est cruciale ; S'il est omis, le motif s'effondrera.

5. Vérifiez dans le document. Vérifiez les documents réels pour détecter tout modèle significatif signalé. Assurez-vous que l'IA n'ajoute pas de lien inventé.

6. Commentaire. Ce que signifie le modèle, c'est le jugement de l'historien ; L’IA marque simplement le modèle.

Piège des chiffres et des statistiques

L'analyse des formes produit souvent des chiffres : « le nom X apparaît 47 fois », « ce thème est présent dans 30 % des documents ». Ces chiffres semblent objectifs mais peuvent être trompeurs :

  • Données manquantes : Si la collection est déjà incomplète (des documents ont été perdus, un groupe n'a jamais été enregistré), le nombre reflète les documents survivants et non la réalité.
  • Erreur de normalisation : Si la même personne est orthographiée différemment et comptée séparément, le nombre sera incorrect.
  • Perte de contexte : « se produit 47 fois » ne dit rien ; La manière dont il est transmis (positif/négatif, sujet/objet) est importante.

sortie de motif

sens apparent

risque réel

"X apparaît 47 fois"

personne importante

Collection incomplète, variation orthographique

"Thème 30%"

sujet dominant

biais d'échantillonnage

"A-B souvent ensemble"

relation intime

Coïncidence, contexte manquant

"chronologie"

chronologie exacte

Documents non datés, commande fabriquée

trois mini-cases

Cas 1 — L'analyse du réseau a révélé un intermédiaire caché. Un chercheur a examiné une collection de correspondance de 800 lettres. Avec l’IA, on déterminait qui écrivait à qui et un réseau était créé. Le réseau a montré qu’une personne apparemment insignifiante à première vue était en réalité le point de contact clé entre les deux groupes. Le chercheur s'est concentré sur les lettres de cette personne et est parvenu à une nouvelle découverte. Mais j’ai d’abord vérifié tous les liens dans les documents.

Cas 2 — Une erreur de normalisation a corrompu le numéro. Un élève leur a fait compter le nombre de fois qu'un lieu figurait dans les documents. Étant donné que l'IA a compté séparément trois orthographes différentes du même lieu, le nombre s'est avéré être un tiers du nombre réel. Lorsque les orthographes ont été combinées, place était en fait à la troisième position la plus fréquente. Leçon : sans normalisation, le numéro n'est pas fiable.

Cas 3 — Chronologie inventée. Un chercheur a créé une chronologie à partir de documents non datés. L'IA a classé les événements inconnus dans un ordre « logique » et a présenté une chronologie précise. Or, cette séquence ne figurait pas dans les documents, AI l’avait inventée. Leçon : la chronologie est construite uniquement à partir d'événements qui ont une date dans le document ; le reste reste "sans date".

Quatre modèles copiables

1) NER (inférence d'entité) :

Les personnes, lieux, institutions et dates mentionnés dans les documents ci-dessous apparaissent sous forme de listes SÉPARÉES. Indiquez dans quel document (référence) chaque entité est mentionnée. Ne prenez que ce qui est CLAIREMENT indiqué dans le texte ; ajouter par supposition. Marquez [?] si vous n'êtes pas sûr de la prononciation. Documents : [ici]

2) Normalisation d'entité :

Dans la liste d'entités ci-dessous, regroupez différentes orthographes qui pourraient être la même personne/lieu (par exemple "Istanbul / Kostantiniyye"). Proposer un format commun possible pour chaque groupe MAIS n'imposer pas la combinaison exacte ; Ajoutez une note "peut-être la même chose, laissez les gens vérifier". Laissez-le tranquille si vous n'êtes pas sûr. Liste : [ici]

3) Aperçu de la relation/réseau :

Extrayez les liens « qui est lié à qui » ​​de l'ensemble de correspondances/documents suivant. Pour chaque lien, indiquez sur quel document (référence) il est basé. A FAIT une relation qui n'est pas CLAIREMENT dans le document. Marquer les liens ambigus [indistincts]. Documentation : [ici]

4) Chronologie datée :

Lister par ordre chronologique uniquement les événements CLAIREMENT énoncés dans les documents suivants ; Liez chaque événement à sa source. Répertoriez séparément les événements dont les dates sont incertaines sous la rubrique « non daté », NE les mettez PAS dans l'ordre. NE rattrapez PAS la date estimée. Documentation : [ici]

Invite faible/Invite forte

Faible :

Analysez ces documents et extrayez les modèles, relations et délais importants.

« Extraire des modèles importants » pousse l’IA à inventer des connexions inexistantes et des chronologies précises, présentant des chiffres sans normalisation.

Fort:

Extrait les entités personne/lieu/institution des documents suivants en connectant chacun à la référence du document. Marquez les différentes orthographes qui peuvent être identiques à « peut être fusionné », mais ne fusionnez pas. Les relations qui ne sont pas clairement énoncées dans le document et les événements aux dates incertaines NE FAUX PAS ; gardez ceux sans dates séparés. Documentation : [ici]

La différence : l’attribution à la source, le fait de laisser la normalisation aux humains, l’interdiction des liens/histoires fictives et la séparation des événements non datés rendent le modèle défendable.

Erreurs courantes

  • Prendre le modèle pour une preuve. Le modèle est l’hypothèse ; est vérifié dans le document.
  • Sauter la normalisation. Différentes orthographes d’une même entité déforment le numéro et le réseau.
  • Une confiance aveugle dans les chiffres. Une collecte incomplète et un biais d’échantillonnage rendent ce chiffre trompeur.
  • Chronologie inventée. Les événements non datés ne sont pas inclus dans la chronologie.
  • Ignorer le contexte. Ce n’est pas « combien de fois il a été adopté », mais « comment il a été adopté » qui est important.

En résumé

L'analyse de contenu et la découverte de modèles sont un domaine puissant dans lequel l'IA rend visibles des structures qui ne seraient pas visibles par la seule lecture : extraction d'entités, réseaux de relations, groupes de sujets, chronologies. Mais chaque modèle est une hypothèse et non une preuve. Reliez les actifs à la source, normalisez soigneusement et avec une validation humaine, recherchez les numéros pour les données manquantes et les biais, évitez les relations et les chronologies artificielles. L’IA marque le modèle ; Ce que cela signifie et si c'est vrai dépend du jugement de l'historien.

Tâche de candidature

Rassemblez au moins 15 pièces de documentation (avec références). Extrayez les entités de personnes et de lieux avec le modèle "NER". Regroupez ensuite les différentes orthographes avec "normalisation d'entité" et vérifiez vous-même les groupes. Enfin, exécutez le modèle « chronologie datée » et voyez combien d'événements restent « non datés ». Comparez le nombre de liens ou de chronologies concoctés que l'IA produirait avec de mauvaises incitations.

liste de contrôle

  • [ ] J'ai clairement défini ma question type.
  • [ ] J'ai chaque entité liée à la référence du document.
  • [ ] J'ai normalisé le typage des entités et je l'ai combiné avec l'approbation humaine.
  • [ ] J'ai remis en question les chiffres en raison de données manquantes et de biais.
  • [ ] Je n'ai pas mis les événements non datés dans une chronologie, je les ai conservés séparément.