Unité 3 / 11

Linguistique et analyse de corpus : lecture de vocabulaire avec des chiffres

Gains :

  • Capacité à rédiger des mesures de corpus telles que la fréquence des mots, la collocation, la richesse du vocabulaire et les mots-clés avec l'intelligence artificielle
  • Sachant que l'intelligence artificielle n'est pas fiable dans le comptage exact et étant capable de vérifier chaque comptage avec un outil distinct
  • Capacité à comprendre qu'un nombre ne dit rien à lui seul et que l'interprétation linguistique qui en établit le sens appartient à l'humain.

La littérature et les études linguistiques ne sont pas seulement des « commentaires » ; Il a également un aspect mesurable et dénombrable. Combien de mots différents un auteur utilise, quels mots il aime utiliser avec quels mots, quels mots deviennent courants à une époque donnée - tout cela est étudié par la linguistique (la science qui étudie le son, la structure, la signification et l'utilisation du langage) et surtout par la linguistique de corpus. Un corpus est un ensemble de textes, comme les œuvres complètes d'un auteur, les archives annuelles d'un journal ou les poèmes d'une époque. L'analyse de corpus recherche des modèles numériques dans ce morceau.

Dans cette unité, nous apprendrons à utiliser l'IA comme assistant d'analyse de corpus : extraire rapidement des métriques telles que la fréquence des mots (le nombre de fois qu'un mot apparaît dans le texte), la collocation (les paires de mots qui apparaissent fréquemment ensemble, par exemple "noir" + "ma fortune"), la richesse du vocabulaire et les variations saisonnières. Mais un avertissement dès le début : l’IA peut faire des erreurs en comptant seule ; Des outils spéciaux sont nécessaires pour des décomptes importants et précis, et vous êtes le linguiste qui établit la signification de chaque nombre.

Où l’IA est-elle forte et où est-elle faible dans l’analyse de corpus ?

Ses points forts sont : Reconnaître des modèles dans des textes petits et moyens, générer des hypothèses sur le vocabulaire d'un texte, suggérer des candidats à des collocations, interpréter un résultat, décrire une méthodologie. AI demande « quelles phrases ressortent chez cet auteur ? » Cela donne un début rapide à la question.

Faiblesse : Comptage précis. L'IA est un modèle de langage, pas une calculatrice ; peut donner une réponse approximative et parfois incorrecte à la question « combien de fois cela s'est-il produit » dans un long texte. Pour une fréquence précise, des statistiques de colocation exactes ou une analyse de grands corpus de milliers de mots, un logiciel spécialisé (par exemple des outils de corpus tels qu'AntConc ou une feuille de calcul) est utilisé. L’IA est précieuse pour interpréter les résultats de ces outils ; Mais ne lui faites pas faire le décompte aveuglément.

Astuce : Si vous avez besoin d'un nombre exact, utilisez deux manières : demandez à un outil de compter en petit texte et demandez à l'IA de l'interpréter ; Ou demandez à l'IA de compter et de le vérifier d'une autre manière. N'utilisez jamais la phrase « AI a dit que cela se produisait 47 fois » sans confirmation.

Une étude de corpus étape par étape

  1. Posez une question. « Comment les mots de couleur sont-ils distribués chez ce poète ? Compter n’a aucun sens sans une question claire comme :
  2. Définir le corpus. Quels textes ? Quelle édition ? Quelle période ? La frontière doit être claire.
  3. Sélectionnez la mesure. Fréquence, collocation, richesse du vocabulaire ?
  4. Mesurez et vérifiez. Faites le décompte, puis confirmez d'une seconde manière.
  5. Commentaire. Le numéro seul ne dit rien ; C’est votre commentaire qui donne du sens à la conclusion selon laquelle « les mots de couleur ont doublé au cours de la deuxième période ».

Une mesure fréquemment utilisée de la richesse du vocabulaire est le rapport entre le nombre de mots différents et le nombre total de mots (rapport type/jeton). Si ce rapport est élevé, le texte est une variété de mots, et s'il est faible, cela signifie qu'il est répétitif. Mais ce rapport est affecté par la longueur du texte ; Soyez prudent lorsque vous comparez directement des textes courts et longs.

trois mini-cases

Cas 1 — La colocalisation a démontré un style. Un chercheur a examiné les paires adjectif-nom dans 3 romans d'un romancier. AI a suggéré que le mot « pâle » correspond à 5 noms différents ; Le chercheur a vérifié 4 des textes et en a éliminé 1 comme étant fabriqué. Le modèle confirmé est devenu un énoncé de thèse sur le style descriptif de l'auteur.

Cas 2 — Erreur de comptage détectée. Un étudiant a demandé à AI combien de fois le mot « nuit » apparaissait dans un texte de 2 000 mots ; L'IA a dit "23". Lorsque l'étudiant a jeté le texte dans une feuille de calcul et l'a fait compter, le nombre réel était de 17. Il est devenu clair que le décompte brut de l'IA n'est pas fiable.

Cas 3 — Les changements périodiques ont suscité une controverse. Un groupe a comparé la proportion de mots abstraits dans les premiers et les derniers poèmes d'un poète. La première version d’IA suggérait une tendance ; Lorsque le groupe est revenu au texte et a vérifié le décompte, la tendance s'est avérée réelle, mais les « causes » suggérées par l'IA étaient des spéculations invérifiables et ont été éliminées.

Quatre modèles copiables

1) Aperçu de la fréquence des mots (avec vérification) :

Énumérez les 15 mots de contenu les plus fréquents (excluez les mots fonctionnels tels que les conjonctions et les prépositions) dans le texte ci-dessous, avec leurs fréquences approximatives. AVERTISSEMENT : Notez que les décomptes PEUVENT NE PAS être précis et notez "pour être précis, ils doivent être vérifiés avec un outil de comptage séparé". Texte : [coller le texte ici]

2) Candidats à la colocation :

Suggérez des paires de mots (collocations) qui apparaissent fréquemment ensemble dans le texte ci-dessous. Donnez au moins une citation du texte pour chaque paire. Double fabrication qui n'a pas d'équivalent dans le texte ; Si vous n'êtes pas sûr, marquez-le comme « à vérifier ». Texte : [coller le texte]

3) Comparaison de vocabulaire :

Je vais vous donner deux textes. Pour chacun : nombre total approximatif de mots, observations sur différentes variétés de mots et domaines de mots importants (par exemple, couleur, nature, émotion). Précisez que les chiffres sont approximatifs. Laissez l'interprétation de la comparaison à ma vérification. Texte A : [...] Texte B : [...]

4) Interprétation des résultats :

J'ai obtenu les résultats suivants à partir d'un outil de comptage : [coller les résultats]. Générez 2 à 3 hypothèses sur ce que ces nombres pourraient signifier linguistiquement. Marquez chaque hypothèse comme « nécessite des preuves » et dites-moi comment je peux la tester. Évitez les commentaires excessifs.

Invite faible/Invite forte

Faible : « Quel mot apparaît le plus dans ce texte ? »

Fort : "Énumérez les mots de contenu les plus fréquents dans ce texte avec leur fréquence approximative ; excluez les mots de fonction. Expliquez clairement que les nombres ne sont pas exacts et doivent être vérifiés avec un outil distinct. Donnez un exemple de phrase pour chaque mot."

L'invite puissante oblige l'IA à accepter la limite de nombre et vous indique d'emblée qu'une vérification est requise. Dans l'invite faible, l'IA donne un seul numéro et vous ne savez pas que cela pourrait être faux.

Tableau de mesure et de fiabilité

mesure

Ce qui montre

L'IA seule

bonne façon

fréquence des mots

mots fréquents

À propos, risqué

Compteur + commentaire IA

colocation

ceux qui sont passés ensemble

Produit des candidats

Confirmation du texte

Rapport type/jeton

Diversité verbale

Peut être trompeur

Compte avec outil

changement saisonnier

Tendance au fil du temps

génère des hypothèses

Mesurer et vérifier

Commentaire final

Signification

Puissant mais exagère

jugement humain

Concepts de mots-clés et de n-grammes

Deux concepts facilitent votre travail en analyse de corpus. Le premier est le mot-clé (mot-clé en anglais - le mot qui apparaît dans un texte ou un auteur beaucoup plus souvent que prévu par rapport à la langue générale, donnant à ce texte son « caractère »). Les mots-clés d'un auteur révèlent ses intérêts et son style ; Par exemple, si « mer » et « séparation » surviennent plus fréquemment que prévu chez un poète, cette saillie statistique devient le point de départ d'une interprétation. Pour identifier des mots-clés, il est nécessaire de comparer les fréquences d’un texte avec les fréquences d’un corpus de référence (un grand corpus de texte général utilisé à des fins de comparaison) ; Cette comparaison est un travail d’outil définitif, c’est un calcul que l’IA ne peut pas faire de manière fiable à elle seule.

Le second est n-gramme (une séquence de n mots consécutifs dans un texte ; une séquence de deux mots est appelée « bigramme », une séquence de trois mots est appelée « trigramme »). L'analyse N-gram révèle les expressions formelles d'un auteur et les phrases fréquemment utilisées. Par exemple, si un écrivain utilise extrêmement fréquemment des expressions telles que « en quelque sorte » ou « cependant », cela indique son habitude de faire des phrases. L'IA peut suggérer ces phrases comme candidates ; mais pour obtenir une fréquence réelle et une signification statistique, il est nécessaire de revenir à l'outil de comptage.

Astuce : dites à l'IA : « Citez les expressions notables (deux ou trois mots) de ce texte comme candidates et donnez un exemple tiré du texte pour chacune d'entre elles. » Prenez la liste des candidats et mesurez la fréquence réelle avec un outil séparé. Positionnez l’IA comme « observateur », l’agent comme « compteur » et vous-même comme « interprète ».

Erreurs courantes

  • S'appuyer sur le décompte brut de l'IA. L'IA n'est pas une calculatrice ; Vérifiez le nombre exact à l’aide d’un outil séparé.
  • Présentation du numéro sans commentaire. « Réussi 47 fois » ne dit rien ; Vous créez le sens.
  • Ignorer la longueur du texte. Les taux de diversité des paroles sont sensibles à la longueur.
  • Faire une thèse sans vérifier la collocation. Les couples non-IA peuvent suggérer : Confirmez à partir du texte.
  • Commentaire extrême. N'acceptez pas les « raisons » suggérées par l'IA sans preuves.

En résumé

L'analyse de corpus ouvre la facette dénombrable de la littérature : fréquence, collocation, vocabulaire, changement périodique. L’IA est puissante dans ce domaine pour reconnaître des modèles et interpréter les résultats ; mais il n'est pas fiable en comptage absolu. Vérifiez le numéro avec l'outil séparé, confirmez les collocations à partir du texte et établissez vous-même la signification de chaque numéro. Le nombre n’est pas une preuve, c’est la porte vers la preuve.

Tâche de candidature

Choisissez un texte court (500-1000 mots). Identifiez un mot de contenu (par exemple « nuit » ou « route »). Tout d’abord, comptez-vous dans le texte. Ensuite, demandez à l'IA de le compter. Comparez les deux résultats ; S’il y a une différence, recherchez-en la raison. Ensuite, écrivez un commentaire d'un paragraphe sur la fonction de ce mot dans le texte – donnant au nombre un sens.

liste de contrôle

  • [ ] J'ai posé une question linguistique claire.
  • [ ] J'ai défini les limites du corpus (texte, édition, période).
  • [ ] J'ai vérifié le décompte de l'IA d'une deuxième manière.
  • [ ] J'ai confirmé les collocations du texte.
  • [ ] Je n'ai pas laissé le numéro sans commentaire ; J'ai créé le sens moi-même.