Jedinica 3 / 11

Lingvistika i analiza korpusa: čitanje vokabulara s brojevima

Dobici:

  • Sposobnost izrade korpusnih mjerenja kao što su učestalost riječi, kolokacija, bogatstvo vokabulara i ključne riječi s umjetnom inteligencijom
  • Znajući da je umjetna inteligencija nepouzdana u točnom brojanju i mogućnost provjere svakog brojanja posebnim alatom
  • Sposobnost razumijevanja da broj sam po sebi ništa ne govori i da jezična interpretacija koja utvrđuje značenje pripada ljudima.

Studij književnosti i jezika nisu samo "komentari"; Također ima mjerljiv i prebrojiv aspekt. Koliko različitih riječi neki autor koristi, koje riječi uz koje riječi voli koristiti, koje se riječi u nekom razdoblju uvriježe - istražuje lingvistika (znanost koja proučava zvuk, strukturu, značenje i uporabu jezika) i posebno korpusna lingvistika. Korpus je zbirka tekstova, kao što su cjelovita djela nekog autora, godišnja arhiva novina ili pjesme nekog razdoblja. Analiza korpusa traži numeričke uzorke u ovom dijelu.

U ovoj jedinici naučit ćemo koristiti AI kao pomoćnika za analizu korpusa: brzo izdvajanje metrika kao što su učestalost riječi (broj puta kada se riječ pojavljuje u tekstu), kolokacija (parovi riječi koji se često pojavljuju zajedno, npr. "crno" + "moje bogatstvo"), bogatstvo rječnika i sezonske varijacije. Ali upozorenje od početka: umjetna inteligencija može pogriješiti kada broji sama; Za velika i precizna brojanja potrebni su posebni alati, a vi ste lingvist koji utvrđuje značenje svakog broja.

Gdje je AI jaka, a gdje slaba u analizi korpusa?

Njegove prednosti su: prepoznavanje obrazaca u malim i srednjim tekstovima, generiranje hipoteza o vokabularu teksta, predlaganje kandidata za kolokacije, tumačenje rezultata, opisivanje metodologije. AI pita "koje se fraze ističu kod ovog autora?" Daje brzi početak pitanja.

Slabost: Precizno brojanje. AI je jezični model, a ne kalkulator; može dati približan, a ponekad i netočan odgovor na pitanje "koliko puta se to dogodilo" u dugom tekstu. Za preciznu učestalost, točnu statistiku kolokacije ili veliko skeniranje korpusa od tisuća riječi koristi se specijalizirani softver (npr. alati za korpus kao što je AntConc ili proračunska tablica). AI je vrijedan u tumačenju rezultata ovih alata; Ali nemojte ga tjerati da naslijepo prebrojava.

Savjet: Ako trebate točan broj, upotrijebite dva načina: neka alat prebroji mali tekst i neka ga umjetna inteligencija protumači; Ili prebrojite AI i provjerite ga na drugi način. Nikada nemojte koristiti rečenicu "AI je rekao da se pojavljuje 47 puta" bez potvrde.

Studija korpusa korak po korak

  1. Postavite pitanje. “Kako su riječi u boji raspoređene kod ovog pjesnika?” Brojanje je besmisleno bez jasnog pitanja poput:
  2. Definirajte korpus. Koji tekstovi? Koje izdanje? Koje razdoblje? Granica mora biti jasna.
  3. Odaberite mjerenje. Učestalost, kolokacija, bogatstvo vokabulara?
  4. Izmjerite i provjerite. Napravite brojanje, a zatim potvrdite na drugi način.
  5. Komentar. Sam broj ne govori ništa; Vaš komentar čini smislenim nalaz da su se "riječi u boji udvostručile u drugoj periodi".

Često korištena mjera bogatstva vokabulara je omjer broja različitih riječi prema ukupnom broju riječi (omjer tip/token). Ako je taj omjer visok, tekst je raznolik, a ako je nizak, znači da se ponavlja. Ali na ovaj omjer utječe duljina teksta; Budite oprezni kad izravno uspoređujete kratke i duge tekstove.

tri mini kućišta

Slučaj 1 — Kolokacija je pokazala stil. Istraživač je ispitivao parove pridjeva i imenica u 3 romana jednog romanopisca. AI je predložio da riječ "blijedo" odgovara 5 različitih imenica; Istraživač je potvrdio 4 teksta i eliminirao 1 kao izmišljen. Potvrđeni obrazac postao je teza o autorovom deskriptivnom stilu.

Slučaj 2 — Uočena je pogreška u brojanju. Student je pitao AI koliko se puta riječ "noć" pojavila u tekstu od 2000 riječi; AI je rekao "23". Kad je student bacio tekst u proračunsku tablicu i dao ga prebrojati, stvarni broj je bio 17. Postalo je jasno da je sirovo brojanje umjetne inteligencije nepouzdano.

Slučaj 3 — Periodične promjene izazvale su kontroverze. Jedna je skupina usporedila udio apstraktnih riječi u pjesnikovim ranim i kasnim pjesmama. Prvi nacrt umjetne inteligencije sugerirao je trend; Kada se grupa vratila na tekst i potvrdila brojanje, trend se pokazao stvarnim, ali "uzroci" koje je predložila AI bili su neprovjerljive spekulacije i eliminirani su.

Četiri predloška za kopiranje

1) Pregled učestalosti riječi (uz provjeru):

Navedite 15 riječi sadržaja koje se najčešće pojavljuju (isključite funkcijske riječi kao što su veznici i prijedlozi) u donjem tekstu, s njihovom približnom učestalošću. UPOZORENJE: imajte na umu da brojevi NE MOŽDA budu točni i imajte na umu "da bi bili točni, moraju se potvrditi posebnim alatom za brojanje." Tekst: [ovdje zalijepite tekst]

2) Kandidati za kolokaciju:

Predložite parove riječi (kolokacije) koje se često pojavljuju zajedno u donjem tekstu. Za svaki par navedite barem jedan citat iz teksta. Dvostruka izmišljotina koja nema ekvivalent u tekstu; Ako niste sigurni, označite to kao "potrebna je provjera".Tekst: [zalijepite tekst]

3) Usporedba rječnika:

Dat ću vam dva teksta. Za svaku: približan ukupan broj riječi, zapažanja o različitim varijantama riječi i istaknute domene riječi (npr. boja, priroda, emocija). Navedite da su brojke približne. Tumačenje usporedbe prepustite mojoj provjeri. Tekst A: [...] Tekst B: [...]

4) Tumačenje rezultata:

Dobio sam sljedeće rezultate iz alata za brojanje: [zalijepi rezultate].Generiraj 2-3 hipoteze o tome što bi ti brojevi mogli lingvistički značiti. Označite svaku hipotezu kao "zahtijeva dokaze" i recite mi kako je mogu testirati. Izbjegavajte pretjerane komentare.

Slab upit / Jak upit

Slab: "Koja se riječ najčešće pojavljuje u ovom tekstu?"

Jako: "Navedite najčešće riječi sadržaja u ovom tekstu s njihovom približnom učestalošću; isključite funkcijske riječi. Jasno navedite da brojevi nisu točni i da ih treba provjeriti posebnim alatom. Navedite primjer rečenice za svaku riječ."

Moćni upit tjera AI da prihvati ograničenje brojanja i unaprijed vam govori da je potrebna provjera. U slabom upitu, AI ​​daje jedan broj, a vi ne znate da bi mogao biti pogrešan.

Tablica mjerenja i pouzdanosti

mjerenje

Što pokazuje

AI sama

pravi put

učestalost riječi

česte riječi

Otprilike, riskantno

Brojač + AI komentar

kolokacija

oni koji su prošli zajedno

Proizvodi kandidate

Potvrda iz teksta

Omjer tip/žeton

Verbalna raznolikost

Može dovesti u zabludu

Račun s alatom

sezonska promjena

Trend tijekom vremena

stvara hipoteze

Izmjerite i provjerite

Zaključni komentar

Značenje

Moćan, ali pretjeruje

ljudski sud

Koncepti ključnih riječi i n-grama

Dva koncepta olakšavaju vam rad u analizi korpusa. Prva je ključna riječ (ključna riječ na engleskom – riječ koja se u tekstu ili autoru pojavljuje puno češće nego što se očekivalo u usporedbi s općim jezikom, dajući tom tekstu njegov “karakter”). Autorove ključne riječi otkrivaju njegove interese i stil; Na primjer, ako se "more" i "razdvojenost" kod pjesnika pojavljuju češće nego što se očekuje, ta statistička izbočina postaje polazištem za tumačenje. Da bi se identificirale ključne riječi, potrebno je usporediti učestalosti teksta s učestalostima referentnog korpusa (opći, veliki tekst koji se koristi za usporedbu); Ova usporedba je konačan posao alata, to je izračun koji umjetna inteligencija ne može sama pouzdano napraviti.

Drugi je n-gram (niz od n uzastopnih riječi u tekstu; niz od dvije riječi naziva se "bigram", niz od tri riječi naziva se "trigram"). Analiza N-grama otkriva autorove formulacijske izraze i često korištene fraze. Na primjer, ako pisac iznimno često koristi izraze poput "nekako" ili "međutim", to ukazuje na njegovu naviku sastavljanja rečenica. AI može predložiti ove fraze kao kandidate; ali za pravu učestalost i statističku značajnost potrebno je vratiti se alatu za brojanje.

Savjet: Recite umjetnoj inteligenciji: "Navedite značajne fraze (dvije ili tri riječi) u ovom tekstu kao kandidate i dajte primjer iz teksta za svaku." Uzmite popis kandidata i izmjerite stvarnu frekvenciju posebnim alatom. Postavite AI kao "primjećivača", agenta kao "brojača", a sebe kao "tumača".

Uobičajene greške

  • Oslanjajući se na sirovi broj AI-ja. AI nije kalkulator; Provjerite točan broj posebnim alatom.
  • Iznos broja bez komentara. "Prošao 47 puta" ne govori ništa; Vi stvarate značenje.
  • Ignoriranje duljine teksta. Stope raznolikosti stihova ovise o duljini.
  • Izrada diplomskog rada bez provjere kolokacije. Parovi koji nemaju AI mogu predložiti; Potvrdite iz teksta.
  • Ekstreman komentar. Ne prihvaćajte "razloge" koje predlaže AI bez dokaza.

Ukratko

Analiza korpusa otvara brojivi aspekt književnosti: učestalost, kolokacija, vokabular, periodična promjena. AI je moćna u ovom području u prepoznavanju uzoraka i tumačenju rezultata; ali je nepouzdan u apsolutnom brojanju. Provjerite broj posebnim alatom, potvrdite kolokacije iz teksta i sami utvrdite značenje svakog broja. Broj nije dokaz, to su vrata do dokaza.

Zadatak aplikacije

Odaberite kratak tekst (500-1000 riječi). Prepoznajte riječ sadržaja (npr. "noć" ili "cesta"). Prvo se ubrojite u tekst. Onda neka AI prebroji. Usporedite dva rezultata; Ako postoji razlika, istražite razlog. Zatim napišite komentar u jednom odlomku o funkciji te riječi u tekstu — pretvaranje broja u značenje.

popis za provjeru

  • [ ] Postavio sam jasno lingvističko pitanje.
  • [ ] Definirao sam granice korpusa (tekst, izdanje, razdoblje).
  • [ ] Provjerio sam broj AI-a na drugi način.
  • [ ] Potvrdio sam kolokacije iz teksta.
  • [ ] Broj nisam ostavio bez komentara; Sam sam stvorio smisao.