Gevinster:
- Evne til å utarbeide korpusmålinger som ordfrekvens, samlokalisering, ordforrådsrikdom og nøkkelord med kunstig intelligens
- Å vite at kunstig intelligens er upålitelig i nøyaktig telling og å kunne verifisere hver telling med et eget verktøy
- Evne til å forstå at et tall ikke sier noe alene og at den språklige tolkningen som fastslår betydningen tilhører mennesker.
Litteratur og språkstudier er ikke bare «kommentarer»; Den har også et målbart og tellbart aspekt. Hvor mange ulike ord en forfatter bruker, hvilke ord han liker å bruke med hvilke ord, hvilke ord som blir vanlige i en periode – disse undersøkes gjennom lingvistikk (vitenskapen som studerer språkets lyd, struktur, betydning og bruk) og spesielt korpuslingvistikk. Et korpus er en samling tekster, for eksempel en forfatters komplette verk, årsarkivet til en avis eller diktene fra en periode. Korpusanalyse ser etter numeriske mønstre i denne delen.
I denne enheten skal vi lære å bruke AI som en korpusanalyseassistent: raskt trekke ut beregninger som ordfrekvens (antall ganger et ord forekommer i teksten), samlokalisering (ordpar som forekommer ofte sammen, f.eks. "svart" + "min formue"), ordforrådsrikdom og sesongvariasjon. Men en advarsel fra begynnelsen: AI kan gjøre feil når man teller alene; Spesialverktøy er nødvendig for store og presise tellinger, og du er lingvisten som fastslår betydningen av hvert tall.
Hvor er AI sterk og hvor er den svak i korpusanalyse?
Dens styrker er: Gjenkjenne mønstre i små og mellomstore tekster, generere hypoteser om vokabularet til en tekst, foreslå kandidater for samlokaliseringer, tolke et resultat, beskrive en metodikk. AI spør "hvilke setninger skiller seg ut i denne forfatteren?" Det gir en rask start på spørsmålet.
Svakhet: Nøyaktig telling. AI er en språkmodell, ikke en kalkulator; kan gi et omtrentlig og noen ganger feil svar på spørsmålet "hvor mange ganger har det skjedd" i en lang tekst. For presis frekvens, eksakt samlokaliseringsstatistikk eller stor korpusskanning av tusenvis av ord, brukes spesialisert programvare (f.eks. korpusverktøy som AntConc eller et regneark). AI er verdifull for å tolke resultatet av disse verktøyene; Men ikke få ham til å regne i blinde.
Tips: Hvis du trenger et nøyaktig tall, bruk to måter: få et verktøy til å telle i liten tekst og la AI tolke det; Eller få AI-tellingen og bekrefte den på en annen måte. Bruk aldri setningen "AI sa det forekommer 47 ganger" uten bekreftelse.
En trinnvis korpusstudie
- Still et spørsmål. "Hvordan er fargeord fordelt i denne dikteren?" Å telle er meningsløst uten et klart spørsmål som:
- Definer korpus. Hvilke tekster? Hvilken utgave? Hvilken periode? Grensen må være klar.
- Velg målingen. Frekvens, samlokalisering, rikdom av ordforråd?
- Mål og verifiser. Gjør tellingen, og bekreft deretter en annen vei.
- Kommentar. Tallet alene sier ingenting; Det er kommentaren din som gjør funnet om at "fargeord doblet seg i andre periode" meningsfylt.
Et ofte brukt mål på ordforrådsrikdom er forholdet mellom antall forskjellige ord og det totale antallet ord (type/token ratio). Hvis dette forholdet er høyt, er teksten ordvariasjon, og hvis den er lav, betyr det at den er repeterende. Men dette forholdet påvirkes av tekstlengden; Vær forsiktig når du sammenligner korte og lange tekster direkte.
tre minisaker
Sak 1 - Samlokalisering demonstrerte en stil. En forsker undersøkte adjektiv-substantiv-sammenkoblinger i 3 romaner av en forfatter. AI foreslo at ordet "blek" matcher 5 forskjellige substantiv; Forskeren bekreftet 4 av tekstene og eliminerte 1 som fabrikkert. Det bekreftede mønsteret ble en avhandlingsuttalelse om forfatterens beskrivende stil.
Tilfelle 2 — Tellefeil fanget. En student spurte AI hvor mange ganger ordet "natt" dukket opp i en tekst på 2000 ord; AI sa "23". Da eleven kastet teksten inn i et regneark og fikk den talt, var det faktiske tallet 17. Det har blitt klart at AIs råtelling er upålitelig.
Sak 3 - Periodisk endring utløste kontrovers. En gruppe sammenlignet andelen abstrakte ord i en dikters tidlige og sene dikt. Det første utkastet til AI antydet en trend; Da gruppen gikk tilbake til teksten og bekreftet tellingen, viste trenden seg å være reell, men "årsakene" antydet av AI var ukontrollerbare spekulasjoner og ble eliminert.
Fire kopierbare maler
1) Ordfrekvensoversikt (med bekreftelse):
List de 15 hyppigst forekommende innholdsordene (ekskluder funksjonsord som konjunksjoner og preposisjoner) i teksten nedenfor, med deres omtrentlige frekvenser. ADVARSEL: Merk at tellinger KANSKJE IKKE er nøyaktige, og merk at "for å være nøyaktige, må de verifiseres med et separat telleverktøy." Tekst: [lim inn tekst her]
2) Samlokaliseringskandidater:
Foreslå ordpar (kollokasjoner) som forekommer ofte sammen i teksten nedenfor. Gi minst ett sitat fra teksten for hvert par. Dobbel fabrikasjon som ikke har tilsvarende i teksten; Hvis du ikke er sikker, merk den som "trenger bekreftelse". Tekst: [lim inn tekst]
3) Sammenligning av ordforråd:
Jeg vil gi deg to tekster. For hver: omtrentlig totalt antall ord, observasjoner om forskjellige ordvarianter og fremtredende orddomener (f.eks. farge, natur, følelser). Oppgi at tallene er omtrentlige. Overlat tolkningen av sammenligningen til min verifisering. Tekst A: [...] Tekst B: [...]
4) Resultattolkning:
Jeg fikk følgende resultater fra et telleverktøy: [lim inn resultater]. Generer 2-3 hypoteser om hva disse tallene kan bety språklig. Merk hver hypotese som "krever bevis" og fortell meg hvordan jeg kan teste den. Unngå overdreven kommentarer.
Svak forespørsel / Sterk forespørsel
Svak: "Hvilket ord forekommer mest i denne teksten?"
Sterk: "List opp de vanligste innholdsordene i denne teksten med deres omtrentlige frekvens; ekskluder funksjonsord. Gjør det klart at tallene ikke er nøyaktige og må verifiseres med et eget verktøy. Gi en eksempelsetning for hvert ord."
Den kraftige meldingen får AI til å akseptere tellegrensen og forteller deg på forhånd at verifisering er nødvendig. I den svake ledeteksten gir AI et enkelt tall, og du vet ikke at det kan være feil.
Måle- og pålitelighetstabell
måling
Hva viser
AI alene
riktig måte
ord frekvens
hyppige ord
Omtrent, risikabelt
Counter + AI-kommentar
samlokalisering
de som gikk sammen
Produserer kandidater
Bekreftelse fra teksten
Type/token-forhold
Verbalt mangfold
Kan være misvisende
Konto med verktøy
sesongmessig endring
Trend over tid
genererer hypoteser
Mål og verifiser
Avsluttende kommentar
Mening
Kraftig, men overdriver
menneskelig dømmekraft
Nøkkelord og n-gram konsepter
To konsepter gjør arbeidet ditt enklere i korpusanalyse. Det første er nøkkelordet (søkeord på engelsk - ordet som forekommer i en tekst eller forfatter mye oftere enn forventet sammenlignet med det generelle språket, noe som gir teksten sin "karakter"). En forfatters nøkkelord avslører hans interesser og stil; For eksempel, hvis "hav" og "separasjon" forekommer hyppigere enn forventet hos en poet, blir dette statistiske fremspringet utgangspunktet for en tolkning. For å identifisere nøkkelord er det nødvendig å sammenligne frekvensene til en tekst med frekvensene til et referansekorpus (en generell, stor tekst som brukes til sammenligning); Denne sammenligningen er en definitiv verktøyjobb, det er en beregning som AI ikke kan gjøre pålitelig alene.
Den andre er n-gram (en sekvens av n påfølgende ord i en tekst; en sekvens av to ord kalles "bigram", en sekvens av tre ord kalles "trigram"). N-gram-analyse avslører en forfatters formeluttrykk og ofte brukte fraser. For eksempel, hvis en forfatter bruker setninger som "slags" eller "men" ekstremt ofte, indikerer dette hans vane med å lage setninger. AI kan foreslå disse setningene som kandidater; men for sann frekvens og statistisk signifikans er det nødvendig å gå tilbake til telleverktøyet.
Hint: Fortell AI: "List opp de bemerkelsesverdige setningene (to eller tre ord) i denne teksten som kandidater, og gi et eksempel fra teksten for hver." Ta kandidatlisten og mål den faktiske frekvensen med et eget verktøy. Plasser AI som «notiser», agenten som «counter» og deg selv som «tolk».
Vanlige feil
- Stoler på AIs råtall. AI er ikke en kalkulator; Verifiser det nøyaktige tallet med eget verktøy.
- Presenterer nummeret uten kommentar. "Bestått 47 ganger" sier ingenting; Du skaper meningen.
- Ignorerer tekstlengde. Lyriske mangfoldsrater er lengdesensitive.
- Lage oppgave uten å verifisere samlokaliseringen. Ikke-AI-par kan foreslå; Bekreft fra teksten.
- Ekstrem kommentar. Ikke godta "grunnene" foreslått av AI uten bevis.
Oppsummert
Korpusanalyse åpner for litteraturens tellbare faset: frekvens, samlokalisering, vokabular, periodisk endring. AI er kraftig på dette området til å gjenkjenne mønstre og tolke resultater; men det er upålitelig i absolutt telling. Bekreft nummeret med det separate verktøyet, bekreft kollokasjoner fra teksten, og finn betydningen av hvert tall selv. Tall er ikke bevis, det er døren til bevis.
Søknadsoppgave
Velg en kort tekst (500-1000 ord). Identifiser et innholdsord (f.eks. "natt" eller "vei"). Først teller du deg selv i teksten. Få så AI til å telle det. Sammenlign de to resultatene; Hvis det er en forskjell, undersøk årsaken. Skriv deretter en kommentar på ett avsnitt om funksjonen til det ordet i teksten – gjør tallet til en mening.
sjekkliste
- [ ] Jeg stiller et klart språklig spørsmål.
- [ ] Jeg definerte grensene for korpuset (tekst, utgave, punktum).
- [ ] Jeg bekreftet AI-tellingen en annen vei.
- [ ] Jeg bekreftet kollokasjonene fra teksten.
- [ ] Jeg la ikke nummeret uten kommentarer; Jeg skapte meningen selv.