Enhed 3 / 11

Lingvistik og korpusanalyse: Læsning af ordforråd med tal

Gevinster:

  • Evne til at udarbejde korpusmålinger såsom ordfrekvens, samlokalisering, ordforrådsrigdom og nøgleord med kunstig intelligens
  • At vide, at kunstig intelligens er upålidelig i nøjagtig optælling og være i stand til at verificere hver optælling med et separat værktøj
  • Evne til at forstå, at et tal ikke siger noget i sig selv, og at den sproglige fortolkning, der fastslår betydningen, tilhører mennesker.

Litteratur- og sprogstudier er ikke kun "kommentarer"; Det har også et målbart og tælleligt aspekt. Hvor mange forskellige ord en forfatter bruger, hvilke ord han ynder at bruge med hvilke ord, hvilke ord bliver almindelige i en periode – disse undersøges gennem lingvistik (videnskaben, der studerer sprogets lyd, struktur, betydning og brug) og især korpuslingvistik. Et korpus er en samling af tekster, såsom en forfatters samlede værker, en avis årlige arkiv eller digte fra en periode. Korpusanalyse leder efter numeriske mønstre i denne del.

I denne enhed lærer vi at bruge AI som en korpusanalyseassistent: hurtigt at udtrække målinger såsom ordfrekvens (antallet af gange et ord forekommer i teksten), samlokalisering (ordpar, der forekommer hyppigt sammen, f.eks. "sort" + "min formue"), ordforrådsrigdom og årstidsvariation. Men en advarsel fra begyndelsen: AI kan lave fejl, når man tæller alene; Der er brug for specielle værktøjer til store og præcise tal, og du er sprogforskeren, der fastslår betydningen af ​​hvert tal.

Hvor er AI stærk, og hvor er den svag i korpusanalyse?

Dens styrker er: At genkende mønstre i små og mellemstore tekster, generere hypoteser om en teksts ordforråd, foreslå kandidater til kollokationer, fortolke et resultat, beskrive en metode. AI spørger "hvilke sætninger skiller sig ud i denne forfatter?" Det giver en hurtig start på spørgsmålet.

Svaghed: Nøjagtig optælling. AI er en sprogmodel, ikke en lommeregner; kan give et omtrentligt og til tider forkert svar på spørgsmålet "hvor mange gange er det forekommet" i en lang tekst. Til præcis frekvens, nøjagtig samlokaliseringsstatistik eller stor korpusscanning af tusindvis af ord, bruges specialiseret software (f.eks. korpusværktøjer såsom AntConc eller et regneark). AI er værdifuld til at fortolke outputtet af disse værktøjer; Men lad ham ikke tælle i blinde.

Tip: Hvis du har brug for et nøjagtigt tal, så brug to måder: få et værktøj til at tælle i lille tekst og få AI’en til at fortolke det; Eller få AI-en til at tælle og verificere den på en anden måde. Brug aldrig sætningen "AI sagde det forekommer 47 gange" uden bekræftelse.

En trin-for-trin-korpusundersøgelse

  1. Stil et spørgsmål. "Hvordan er farveord fordelt i denne digter?" At tælle er meningsløst uden et klart spørgsmål som:
  2. Definer korpus. Hvilke tekster? Hvilken udgave? Hvilken periode? Grænsen skal være klar.
  3. Vælg målingen. Frekvens, samlokalisering, rigdom af ordforråd?
  4. Mål og verificer. Foretag optællingen, og bekræft derefter en anden vej.
  5. Kommentar. Tallet alene siger ikke noget; Det er din kommentar, der gør konstateringen af, at "farveord blev fordoblet i anden periode" meningsfuldt.

Et hyppigt anvendt mål for ordforrådsrigdom er forholdet mellem antallet af forskellige ord og det samlede antal ord (type/token-forhold). Hvis dette forhold er højt, er teksten ord-variation, og hvis den er lav, betyder det, at den er gentagen. Men dette forhold påvirkes af tekstlængden; Vær forsigtig, når du sammenligner korte og lange tekster direkte.

tre minisager

Case 1 — Samlokalisering demonstrerede en stil. En forsker undersøgte adjektiv-navneord-parringer i 3 romaner af en romanforfatter. AI foreslog, at ordet "bleg" matcher 5 forskellige navneord; Forskeren verificerede 4 af teksterne og eliminerede 1 som opdigtet. Det bekræftede mønster blev en afhandlingserklæring om forfatterens beskrivende stil.

Tilfælde 2 — Tællefejl fanget. En studerende spurgte AI, hvor mange gange ordet "nat" optrådte i en tekst på 2.000 ord; AI sagde "23". Da eleven smed teksten ind i et regneark og fik den talt, var det faktiske tal 17. Det er blevet tydeligt, at AI's råtal er upålidelig.

Sag 3 - Periodiske ændringer udløste kontrovers. En gruppe sammenlignede andelen af ​​abstrakte ord i en digters tidlige og sene digte. Det første udkast til kunstig intelligens antydede en tendens; Da gruppen gik tilbage til teksten og bekræftede optællingen, viste tendensen sig at være reel, men "årsagerne" foreslået af AI var uverificerbare spekulationer og blev elimineret.

Fire kopierbare skabeloner

1) Ordfrekvensoversigt (med bekræftelse):

Angiv de 15 hyppigst forekommende indholdsord (ekskluder funktionsord såsom konjunktioner og præpositioner) i teksten nedenfor med deres omtrentlige frekvenser. ADVARSEL: Bemærk, at tællinger MÅSKE IKKE er nøjagtige, og bemærk "for at være nøjagtige skal de verificeres med et separat tælleværktøj." Tekst: [indsæt tekst her]

2) Colocation kandidater:

Foreslå ordpar (kollokationer), der ofte forekommer sammen i teksten nedenfor. Giv mindst et citat fra teksten for hvert par. Dobbelt fabrikation, der ikke har nogen ækvivalent i teksten; Hvis du ikke er sikker, så marker det som "kræver verifikation". Tekst: [indsæt tekst]

3) Ordforrådssammenligning:

Jeg vil give dig to tekster. For hver: omtrentlige samlede ord, observationer om forskellige ordvarianter og fremtrædende orddomæner (f.eks. farve, natur, følelser). Angiv, at tallene er omtrentlige. Overlad fortolkningen af ​​sammenligningen til min verifikation. Tekst A: [...] Tekst B: [...]

4) Resultatfortolkning:

Jeg fik følgende resultater fra et tælleværktøj: [indsæt resultater]. Generer 2-3 hypoteser om, hvad disse tal kan betyde sprogligt. Marker hver hypotese som "kræver bevis" og fortæl mig, hvordan jeg kan teste den. Undgå overdrevne kommentarer.

Svag prompt / Stærk prompt

Svag: "Hvilket ord forekommer mest i denne tekst?"

Stærk: "Angiv de mest hyppige indholdsord i denne tekst med deres omtrentlige frekvens; udelad funktionsord. Gør det klart, at tallene ikke er nøjagtige og skal verificeres med et separat værktøj. Giv en eksempelsætning for hvert ord."

Den kraftfulde prompt får AI til at acceptere tællegrænsen og fortæller dig på forhånd, at verifikation er påkrævet. I den svage prompt giver AI et enkelt tal, og du ved ikke, at det kan være forkert.

Måling og pålidelighed tabel

måling

Hvad viser

AI alene

rigtige måde

ord frekvens

hyppige ord

Om, risikabelt

tæller + AI kommentar

colocation

dem, der gik sammen

Fremstiller kandidater

Bekræftelse fra teksten

Type/token-forhold

Verbal mangfoldighed

Kan være vildledende

Konto med værktøj

sæsonbestemt ændring

Trend over tid

genererer hypoteser

Mål og verificer

Afsluttende kommentar

Betydning

Kraftig, men overdriver

menneskelig dømmekraft

Nøgleord og n-gram begreber

To koncepter gør dit arbejde lettere inden for korpusanalyse. Det første er nøgleordet (søgeord på engelsk - det ord, der forekommer i en tekst eller forfatter meget oftere end forventet sammenlignet med det generelle sprog, hvilket giver den tekst dens "karakter"). En forfatters nøgleord afslører hans interesser og stil; For eksempel, hvis "hav" og "adskillelse" forekommer hyppigere end forventet hos en digter, bliver dette statistiske fremspring udgangspunktet for en fortolkning. For at identificere nøgleord er det nødvendigt at sammenligne frekvenserne af en tekst med frekvenserne af et referencekorpus (en generel, stor tekstmængde, der bruges til sammenligning); Denne sammenligning er et endegyldigt værktøjsjob, det er en beregning, som AI ikke kan foretage pålideligt alene.

Den anden er n-gram (en sekvens af n på hinanden følgende ord i en tekst; en sekvens af to ord kaldes "bigram", en sekvens på tre ord kaldes "trigram"). N-gram analyse afslører en forfatters formeludtryk og ofte brugte sætninger. For eksempel, hvis en forfatter bruger sætninger som "slags" eller "dog" ekstremt ofte, indikerer dette hans vane med at lave sætninger. AI kan foreslå disse sætninger som kandidater; men for sand frekvens og statistisk signifikans er det nødvendigt at vende tilbage til tælleværktøjet.

Tip: Fortæl AI'en: "Angiv de bemærkelsesværdige sætninger (to eller tre ord) i denne tekst som kandidater, og giv et eksempel fra teksten for hver." Tag kandidatlisten og mål den faktiske frekvens med et separat værktøj. Placer AI'en som "bemærkeren", agenten som "tælleren" og dig selv som "tolken".

Almindelige fejl

  • Stoler på AI'ens råtæller. AI er ikke en lommeregner; Bekræft det nøjagtige antal med separat værktøj.
  • Præsenterer nummeret uden kommentarer. "Bestået 47 gange" siger ikke noget; Du skaber meningen.
  • Ignorerer tekstlængde. Lyriske diversitetsrater er længdefølsomme.
  • Udarbejdelse af speciale uden at verificere samlokaliseringen. Ikke-AI-par kan foreslå; Bekræft fra teksten.
  • Ekstrem kommentar. Accepter ikke "årsagerne" foreslået af AI uden beviser.

Sammenfattende

Korpusanalyse åbner op for litteraturens tællelige facet: frekvens, samlokalisering, ordforråd, periodisk forandring. AI er stærk på dette område til at genkende mønstre og fortolke resultater; men den er upålidelig i absolut optælling. Bekræft nummeret med det separate værktøj, bekræft kollokationer fra teksten, og find selv betydningen af ​​hvert nummer. Tal er ikke bevis, det er døren til bevis.

Ansøgningsopgave

Vælg en kort tekst (500-1000 ord). Identificer et indholdsord (f.eks. "nat" eller "vej"). Tæl først dig selv i teksten. Så få AI'en til at tælle det. Sammenlign de to resultater; Hvis der er en forskel, så undersøg årsagen. Skriv derefter en kommentar i et afsnit om funktionen af ​​det ord i teksten - forvandl tallet til en betydning.

tjekliste

  • [ ] Jeg stiller et klart sprogligt spørgsmål.
  • [ ] Jeg definerede korpusets grænser (tekst, udgave, punktum).
  • [ ] Jeg bekræftede AI's optælling en anden vej.
  • [ ] Jeg bekræftede kollokationerne fra teksten.
  • [ ] Jeg efterlod ikke nummeret uden kommentarer; Jeg har selv skabt meningen.