Eenheid 3 / 11

Taalkunde en corpusanalyse: woordenschat lezen met cijfers

Winst:

  • Mogelijkheid om corpusmetingen op te stellen, zoals woordfrequentie, collocatie, woordenschatrijkdom en trefwoorden met kunstmatige intelligentie
  • Weten dat kunstmatige intelligentie onbetrouwbaar is in het exact tellen en het kunnen verifiëren van elke telling met een aparte tool
  • Vermogen om te begrijpen dat een getal op zichzelf niets zegt en dat de taalkundige interpretatie die de betekenis vaststelt, aan de mens toebehoort.

Literatuur- en taalstudies zijn niet slechts ‘commentaar’; Het heeft ook een meetbaar en telbaar aspect. Hoeveel verschillende woorden een auteur gebruikt, welke woorden hij graag bij welke woorden gebruikt, welke woorden in een bepaalde periode gemeengoed worden - dit wordt onderzocht via de taalkunde (de wetenschap die de klank, structuur, betekenis en gebruik van taal bestudeert) en vooral de corpuslinguïstiek. Een corpus is een verzameling teksten, zoals het volledige oeuvre van een auteur, het jaararchief van een krant of de gedichten van een periode. Corpusanalyse zoekt naar numerieke patronen in dit deel.

In deze unit leren we AI te gebruiken als assistent voor corpusanalyse: snel gegevens extraheren zoals woordfrequentie (het aantal keren dat een woord in de tekst voorkomt), collocatie (woordparen die vaak samen voorkomen, bijvoorbeeld 'zwart' + 'mijn fortuin'), woordenschatrijkdom en seizoensvariatie. Maar een waarschuwing vanaf het begin: AI kan fouten maken als hij alleen telt; Voor grote en nauwkeurige tellingen zijn speciale hulpmiddelen nodig, en jij bent de taalkundige die de betekenis van elk getal vaststelt.

Waar is AI sterk en waar is het zwak in corpusanalyse?

De sterke punten zijn: het herkennen van patronen in kleine en middelgrote teksten, het genereren van hypothesen over de woordenschat van een tekst, het voorstellen van kandidaten voor collocaties, het interpreteren van een resultaat, het beschrijven van een methodologie. AI vraagt: “Welke zinnen vallen op in deze auteur?” Het geeft een snelle start van de vraag.

Zwakte: Nauwkeurig tellen. AI is een taalmodel, geen rekenmachine; kan in een lange tekst een benaderend en soms onjuist antwoord geven op de vraag "hoe vaak is het voorgekomen". Voor nauwkeurige frequentie, exacte colocatiestatistieken of het scannen van grote corpus's van duizenden woorden wordt gespecialiseerde software (bijvoorbeeld corpustools zoals AntConc of een spreadsheet) gebruikt. AI is waardevol bij het interpreteren van de output van deze tools; Maar laat hem niet blindelings de ruwe telling doen.

Tip: Als je een exact getal nodig hebt, gebruik dan twee manieren: laat een tool het tellen in kleine letters doen en laat de AI het interpreteren; Of laat de AI tellen en verifieer deze op een andere manier. Gebruik nooit de zin "AI zei dat het 47 keer voorkomt" zonder bevestiging.

Een stapsgewijze corpusstudie

  1. Stel een vraag. "Hoe worden kleurwoorden verdeeld in deze dichter?" Tellen is zinloos zonder een duidelijke vraag als:
  2. Definieer het corpus. Welke teksten? Welke editie? Welke periode? De grens moet duidelijk zijn.
  3. Selecteer de meting. Frequentie, collocatie, rijkdom aan woordenschat?
  4. Meten en verifiëren. Voer de telling uit en bevestig vervolgens een tweede manier.
  5. Opmerking. Het getal alleen zegt niets; Het is uw commentaar dat de bevinding dat “de kleurenwoorden verdubbelden in de tweede periode” betekenisvol maakt.

Een veelgebruikte maatstaf voor de woordenschatrijkdom is de verhouding tussen het aantal verschillende woorden en het totaal aantal woorden (type/token ratio). Als deze verhouding hoog is, is de tekst woordvariëteit, en als deze laag is, betekent dit dat deze repetitief is. Maar deze verhouding wordt beïnvloed door de tekstlengte; Wees voorzichtig bij het rechtstreeks vergelijken van korte en lange teksten.

drie minikoffers

Geval 1 — Collocatie demonstreerde een stijl. Een onderzoeker onderzocht de combinatie van bijvoeglijk naamwoord en zelfstandig naamwoord in drie romans van een romanschrijver. AI suggereerde dat het woord “bleek” overeenkomt met 5 verschillende zelfstandige naamwoorden; De onderzoeker verifieerde vier van de teksten en elimineerde er één als verzonnen. Het bevestigde patroon werd een thesisverklaring over de beschrijvende stijl van de auteur.

Geval 2 — Er is een telfout geconstateerd. Een student vroeg AI hoe vaak het woord ‘nacht’ voorkwam in een tekst van 2000 woorden; De AI zei "23". Toen de leerling de tekst in een spreadsheet gooide en liet tellen, was het werkelijke aantal 17. Het is duidelijk geworden dat de ruwe telling van AI onbetrouwbaar is.

Casus 3 – Periodieke veranderingen leidden tot controverse. Eén groep vergeleek het aandeel abstracte woorden in de vroege en late gedichten van een dichter. De eerste versie van AI suggereerde een trend; Toen de groep terugging naar de tekst en de telling verifieerde, bleek de trend reëel te zijn, maar de door de AI gesuggereerde ‘oorzaken’ waren niet-verifieerbare speculaties en werden geëlimineerd.

Vier kopieerbare sjablonen

1) Overzicht woordfrequentie (met verificatie):

Noem de 15 meest voorkomende inhoudswoorden (exclusief functiewoorden zoals voegwoorden en voorzetsels) in de onderstaande tekst, met hun geschatte frequentie. WAARSCHUWING: Houd er rekening mee dat de tellingen MOGELIJK NIET accuraat zijn en let op: "om accuraat te zijn, moeten ze worden geverifieerd met een afzonderlijk telhulpmiddel." Tekst: [plak hier tekst]

2) Colocatiekandidaten:

Stel woordparen (collocaties) voor die vaak samen voorkomen in de onderstaande tekst. Geef voor elk tweetal minimaal één citaat uit de tekst. Dubbele verzinsel die geen equivalent kent in de tekst; Als je het niet zeker weet, markeer het dan als 'verificatie vereist'. Tekst: [plak tekst]

3) Woordenschatvergelijking:

Ik zal je twee teksten geven. Voor elk: geschat totaal aantal woorden, observaties over verschillende woordvariëteiten en prominente woorddomeinen (bijv. kleur, natuur, emotie). Geef aan dat de cijfers bij benadering zijn. Laat de interpretatie van de vergelijking over aan mijn verificatie. Tekst A: [...] Tekst B: [...]

4) Resultaatinterpretatie:

Ik kreeg de volgende resultaten van een telhulpmiddel: [resultaten plakken]. Genereer 2-3 hypothesen over wat deze getallen taalkundig zouden kunnen betekenen. Markeer elke hypothese als 'bewijs vereist' en vertel me hoe ik deze kan testen. Vermijd overdreven commentaar.

Zwakke prompt/sterke prompt

Zwak: "Welk woord komt het meest voor in deze tekst?"

Strong: "Maak een lijst van de meest voorkomende inhoudswoorden in deze tekst met hun geschatte frequentie; sluit functiewoorden uit. Maak duidelijk dat de cijfers niet exact zijn en moeten worden geverifieerd met een aparte tool. Geef voor elk woord een voorbeeldzin."

De krachtige prompt zorgt ervoor dat de AI de tellimiet accepteert en vertelt u vooraf dat verificatie vereist is. Bij de zwakke prompt geeft de AI een enkel getal en je weet niet dat dit verkeerd kan zijn.

Meet- en betrouwbaarheidstabel

meting

Wat blijkt

AI alleen

juiste manier

woord frequentie

frequente woorden

Ongeveer, riskant

Teller + AI-commentaar

colocatie

degenen die samen zijn overgegaan

Produceert kandidaten

Bevestiging uit de tekst

Type/token-verhouding

Verbale diversiteit

Kan misleidend zijn

Rekening met gereedschap

seizoensverandering

Trend in de tijd

genereert hypothesen

Meten en verifiëren

Afsluitende opmerking

Betekenis

Krachtig maar overdrijft

menselijk oordeel

Trefwoord- en n-gram-concepten

Twee concepten maken uw werk gemakkelijker bij corpusanalyse. De eerste is het trefwoord (trefwoord in het Engels - het woord dat in een tekst of auteur veel vaker voorkomt dan verwacht in vergelijking met de algemene taal, waardoor die tekst zijn "karakter" krijgt). De trefwoorden van een auteur onthullen zijn interesses en stijl; Als bijvoorbeeld ‘zee’ en ‘scheiding’ vaker voorkomen dan verwacht bij een dichter, wordt dit statistische uitsteeksel het startpunt voor een interpretatie. Om trefwoorden te identificeren, is het noodzakelijk om de frequenties van een tekst te vergelijken met de frequenties van een referentiecorpus (een algemene, grote hoeveelheid tekst die ter vergelijking wordt gebruikt); Deze vergelijking is een definitieve tooljob, het is een berekening die AI niet op eigen kracht betrouwbaar kan maken.

De tweede is n-gram (een reeks van n opeenvolgende woorden in een tekst; een reeks van twee woorden wordt "bigram" genoemd, een reeks van drie woorden wordt "trigram" genoemd). N-gram-analyse onthult de formule-uitdrukkingen en vaak gebruikte zinnen van een auteur. Als een schrijver bijvoorbeeld extreem vaak uitdrukkingen als 'soort van' of 'hoe dan ook' gebruikt, duidt dit op zijn gewoonte om zinnen te maken. De AI kan deze zinnen als kandidaten voorstellen; maar voor de werkelijke frequentie en statistische significantie is het noodzakelijk terug te keren naar het telinstrument.

Tip: Zeg tegen de AI: "Maak een lijst van de opvallende zinsneden (twee of drie woorden) in deze tekst als kandidaten, en geef voor elk een voorbeeld uit de tekst." Neem de kandidatenlijst en meet de werkelijke frequentie met een aparte tool. Positioneer de AI als de ‘opmerker’, de agent als de ‘teller’ en uzelf als de ‘tolk’.

Veel voorkomende fouten

  • Vertrouwend op de ruwe telling van de AI. AI is geen rekenmachine; Controleer het exacte aantal met een afzonderlijk hulpmiddel.
  • Het nummer presenteren zonder commentaar. "47 keer geslaagd" zegt niets; Jij creëert de betekenis.
  • Tekstlengte negeren. De songtekstdiversiteitspercentages zijn lengtegevoelig.
  • Proefschrift maken zonder de collocatie te verifiëren. Niet-AI-paren kunnen voorstellen; Bevestig vanuit de tekst.
  • Extreme opmerking. Accepteer de ‘redenen’ die door de AI worden voorgesteld niet zonder bewijs.

Samengevat

Corpusanalyse opent het telbare facet van de literatuur: frequentie, collocatie, woordenschat, periodieke verandering. AI is op dit gebied krachtig in het herkennen van patronen en het interpreteren van resultaten; maar het is onbetrouwbaar bij absolute tellingen. Verifieer het nummer met de aparte tool, bevestig collocaties uit de tekst en stel zelf de betekenis van elk nummer vast. Nummer is geen bewijs, het is de deur naar bewijs.

Applicatie taak

Kies een korte tekst (500-1000 woorden). Identificeer een inhoudswoord (bijvoorbeeld 'nacht' of 'weg'). Tel eerst jezelf in de tekst. Laat de AI het dan tellen. Vergelijk de twee resultaten; Als er een verschil is, onderzoek dan de reden. Schrijf vervolgens een commentaar van één alinea over de functie van dat woord in de tekst, waarbij u het getal omzet in betekenis.

controlelijst

  • [ ] Ik heb een duidelijke taalkundige vraag gesteld.
  • [ ] Ik heb de grenzen van het corpus gedefinieerd (tekst, editie, periode).
  • [ ] Ik heb de telling van de AI op een tweede manier geverifieerd.
  • [ ] Ik heb de collocaties uit de tekst bevestigd.
  • [ ] Ik heb het nummer niet zonder commentaar achtergelaten; De betekenis heb ik zelf gecreëerd.