Vinster:
- Förmåga att rita korpusmätningar som ordfrekvens, samlokalisering, ordförrådsrikedom och nyckelord med artificiell intelligens
- Att veta att artificiell intelligens är opålitlig i exakt räkning och att kunna verifiera varje räkning med ett separat verktyg
- Förmåga att förstå att en siffra inte säger något på egen hand och att den språkliga tolkning som fastställer innebörden tillhör människor.
Litteratur- och språkstudier är inte bara "kommentarer"; Den har också en mätbar och räknbar aspekt. Hur många olika ord en författare använder, vilka ord han gillar att använda med vilka ord, vilka ord som blir vanliga under en period – dessa undersöks genom lingvistik (vetenskapen som studerar språkets ljud, struktur, betydelse och användning) och särskilt korpuslingvistik. En korpus är en samling texter, till exempel en författares fullständiga verk, en tidnings årliga arkiv eller dikter från en period. Korpusanalys letar efter numeriska mönster i denna bit.
I den här enheten kommer vi att lära oss att använda AI som en korpusanalysassistent: snabbt extrahera mått som ordfrekvens (antal gånger ett ord förekommer i texten), samlokalisering (ordpar som förekommer ofta tillsammans, t.ex. "svart" + "min förmögenhet"), ordförrådsrikedom och årstidsvariation. Men en varning från början: AI kan göra misstag när man räknar ensam; Specialverktyg behövs för stora och exakta räkningar, och du är lingvisten som fastställer betydelsen av varje nummer.
Var är AI stark och var är den svag i korpusanalys?
Dess styrkor är: Att känna igen mönster i små och medelstora texter, generera hypoteser om en texts vokabulär, föreslå kandidater för samlokaliseringar, tolka ett resultat, beskriva en metodik. AI frågar "vilka fraser sticker ut i den här författaren?" Det ger en snabb start på frågan.
Svaghet: Noggrann räkning. AI är en språkmodell, inte en kalkylator; kan ge ett ungefärligt och ibland felaktigt svar på frågan "hur många gånger har det förekommit" i en lång text. För exakt frekvens, exakt samlokaliseringsstatistik eller stor korpusskanning av tusentals ord, används specialiserad programvara (t.ex. korpusverktyg som AntConc eller ett kalkylblad). AI är värdefullt för att tolka resultatet av dessa verktyg; Men låt honom inte räkna i blindo.
Tips: Om du behöver ett exakt nummer, använd två sätt: låt ett verktyg räkna i liten text och låt AI tolka det; Eller få AI att räkna och verifiera den på annat sätt. Använd aldrig meningen "AI sa att det förekommer 47 gånger" utan bekräftelse.
En korpusstudie steg för steg
- Ställ en fråga. "Hur fördelas färgord i denna poet?" Att räkna är meningslöst utan en tydlig fråga som:
- Definiera korpusen. Vilka texter? Vilken utgåva? Vilken period? Gränsen måste vara tydlig.
- Välj måtten. Frekvens, samlokalisering, ordförråd?
- Mät och verifiera. Gör räkningen och bekräfta sedan ett andra sätt.
- Kommentar. Bara siffran säger ingenting; Det är din kommentar som gör upptäckten att "färgord fördubblades under den andra perioden" meningsfullt.
Ett ofta använt mått på ordförrådsrikedom är förhållandet mellan antalet olika ord och det totala antalet ord (typ/token-förhållande). Om detta förhållande är högt är texten ordvariation, och om den är låg betyder det att den är repetitiv. Men detta förhållande påverkas av textlängden; Var försiktig när du jämför korta och långa texter direkt.
tre minifodral
Fall 1 – Samlokalisering visade en stil. En forskare undersökte adjektiv-substantivparningar i 3 romaner av en romanförfattare. AI föreslog att ordet "blek" matchar 5 olika substantiv; Forskaren verifierade 4 av texterna och eliminerade 1 som tillverkad. Det bekräftade mönstret blev ett avhandlingsuttalande om författarens beskrivande stil.
Fall 2 — Räknefel har upptäckts. En elev frågade AI hur många gånger ordet "natt" förekom i en text på 2 000 ord; AI sa "23". När eleven slängde in texten i ett kalkylblad och fick den räknad var den faktiska siffran 17. Det har blivit tydligt att AI:s råräkning är opålitlig.
Fall 3 – Periodiska förändringar utlöste kontroverser. En grupp jämförde andelen abstrakta ord i en poets tidiga och sena dikter. Det första utkastet till AI antydde en trend; När gruppen gick tillbaka till texten och verifierade räkningen visade sig trenden vara verklig, men "orsakerna" som föreslogs av AI var obekräftade spekulationer och eliminerades.
Fyra kopierbara mallar
1) Ordfrekvensöversikt (med verifiering):
Lista de 15 vanligast förekommande innehållsorden (uteslut funktionsord som konjunktioner och prepositioner) i texten nedan, med deras ungefärliga frekvenser. VARNING: Observera att räkningar KANSKE INTE är korrekta och notera "för att vara korrekta måste de verifieras med ett separat räkneverktyg." Text: [klistra in text här]
2) Samlokaliseringskandidater:
Föreslå ordpar (kollokationer) som förekommer ofta tillsammans i texten nedan. Ge minst ett citat från texten för varje par. Dubbeltillverkning som inte har någon motsvarighet i texten; Om du inte är säker, markera det som "behöver verifiering". Text: [klistra in text]
3) Ordförrådsjämförelse:
Jag ska ge dig två texter. För varje: ungefärligt totalt antal ord, observationer om olika ordvarianter och framträdande orddomäner (t.ex. färg, natur, känsla). Ange att siffrorna är ungefärliga. Lämna tolkningen av jämförelsen till min verifiering. Text A: [...] Text B: [...]
4) Resultattolkning:
Jag fick följande resultat från ett räkneverktyg: [klistra in resultat]. Generera 2-3 hypoteser om vad dessa siffror kan betyda språkligt. Markera varje hypotes som "kräver bevis" och berätta hur jag kan testa den. Undvik överdrivna kommentarer.
Svag prompt / Stark prompt
Svag: "Vilket ord förekommer mest i den här texten?"
Stark: "Lista de vanligaste innehållsorden i denna text med deras ungefärliga frekvens; exkludera funktionsord. Gör det klart att siffrorna inte är exakta och behöver verifieras med ett separat verktyg. Ge en exempelmening för varje ord."
Den kraftfulla uppmaningen får AI:n att acceptera räknegränsen och talar om för dig i förväg att verifiering krävs. I den svaga prompten ger AI:n ett enda nummer och du vet inte att det kan vara fel.
Mät- och tillförlitlighetstabell
mätning
Vad visar
AI ensam
rätt sätt
ord frekvens
vanliga ord
Om, riskabelt
Counter + AI-kommentar
samlokalisering
de som gick tillsammans
Tar fram kandidater
Bekräftelse från texten
Typ/token-förhållande
Verbal mångfald
Kan vara vilseledande
Konto med verktyg
säsongsmässig förändring
Trend över tid
genererar hypoteser
Mät och verifiera
Avslutande kommentar
Mening
Kraftfull men överdriver
mänskligt omdöme
Nyckelord och n-gram begrepp
Två koncept underlättar ditt arbete i korpusanalys. Det första är nyckelordet (sökord på engelska - ordet som förekommer i en text eller författare mycket oftare än förväntat jämfört med det allmänna språket, vilket ger den texten dess "karaktär"). En författares nyckelord avslöjar hans intressen och stil; Till exempel, om "hav" och "separation" förekommer oftare än förväntat hos en poet, blir detta statistiska utsprång utgångspunkten för en tolkning. För att identifiera nyckelord är det nödvändigt att jämföra frekvenserna för en text med frekvenserna för en referenskorpus (en allmän, stor text som används för jämförelse); Denna jämförelse är ett definitivt verktygsjobb, det är en beräkning som AI inte kan göra tillförlitligt på egen hand.
Den andra är n-gram (en sekvens av n på varandra följande ord i en text; en sekvens av två ord kallas "bigram", en sekvens av tre ord kallas "trigram"). N-gram-analys avslöjar en författares formulerade uttryck och ofta använda fraser. Till exempel, om en författare använder fraser som "typ av" eller "dock" extremt ofta, indikerar detta hans vana att göra meningar. AI kan föreslå dessa fraser som kandidater; men för sann frekvens och statistisk signifikans är det nödvändigt att återgå till räkneverktyget.
Tips: Säg till AI:n, "Skriv upp de anmärkningsvärda fraserna (två eller tre ord) i denna text som kandidater, och ge ett exempel från texten för var och en." Ta kandidatlistan och mät den faktiska frekvensen med ett separat verktyg. Placera AI som "notiser", agenten som "räknare" och dig själv som "tolk".
Vanliga misstag
- Förlitar sig på AI:s råa antal. AI är inte en miniräknare; Verifiera det exakta antalet med separat verktyg.
- Presenterar numret utan kommentar. "Godkänd 47 gånger" säger ingenting; Du skapar meningen.
- Ignorerar textlängden. Lyrisk mångfaldsfrekvens är längdkänslig.
- Gör avhandling utan att verifiera samlokaliseringen. Icke-AI-par kan föreslå; Bekräfta från texten.
- Extrem kommentar. Acceptera inte "skälen" som föreslås av AI utan bevis.
Sammanfattningsvis
Korpusanalys öppnar upp litteraturens räknebara aspekt: frekvens, samlokalisering, ordförråd, periodisk förändring. AI är kraftfull inom detta område när det gäller att känna igen mönster och tolka resultat; men det är opålitligt i absolut räkning. Verifiera numret med det separata verktyget, bekräfta samlokaliseringar från texten och fastställa betydelsen av varje nummer själv. Antal är inte bevis, det är dörren till bevis.
Applikationsuppgift
Välj en kort text (500-1000 ord). Identifiera ett innehållsord (t.ex. "natt" eller "väg"). Räkna först in dig själv i texten. Låt sedan AI räkna det. Jämför de två resultaten; Om det finns en skillnad, undersök orsaken. Skriv sedan en kommentar i ett stycke om funktionen av det ordet i texten — förvandla siffran till betydelse.
checklista
- [ ] Jag ställde en tydlig språklig fråga.
- [ ] Jag definierade gränserna för korpusen (text, upplaga, punkt).
- [ ] Jag verifierade AI:s räkning ett andra sätt.
- [ ] Jag bekräftade samlokaliseringarna från texten.
- [ ] Jag lämnade inte numret utan kommentarer; Jag skapade meningen själv.