Dobički:
- Sposobnost priprave meritev korpusa, kot so pogostost besed, kolokacija, bogastvo besedišča in ključne besede z umetno inteligenco
- Zavedanje, da je umetna inteligenca nezanesljiva pri natančnem štetju, in možnost preverjanja vsakega štetja z ločenim orodjem
- Sposobnost razumeti, da število samo po sebi ne pove ničesar in da je jezikovna razlaga, ki ugotavlja pomen, last ljudi.
Študije književnosti in jezika niso le »komentarji«; Ima tudi merljiv in števen vidik. Koliko različnih besed uporablja avtor, katere besede h katerim besedam najraje uporablja, katere besede v nekem obdobju postanejo običajne – to raziskuje jezikoslovje (veda, ki preučuje zvok, strukturo, pomen in rabo jezika) in predvsem korpusno jezikoslovje. Korpus je zbirka besedil, kot so celotna dela avtorja, letni arhiv časopisa ali pesmi nekega obdobja. Analiza korpusa išče numerične vzorce v tem delu.
V tej enoti se bomo naučili uporabljati umetno inteligenco kot pomočnika pri analizi korpusa: hitro ekstrahiranje metrik, kot so pogostost besed (število krat, ko se beseda pojavi v besedilu), kolokacija (besedni pari, ki se pogosto pojavljajo skupaj, npr. "črn" + "moja sreča"), bogastvo besedišča in sezonske razlike. Toda opozorilo že na začetku: umetna inteligenca lahko dela napake, ko šteje sama; Za velika in natančna štetja so potrebna posebna orodja, vi pa ste jezikoslovec, ki določi pomen vsake številke.
Kje je umetna inteligenca pri analizi korpusa močna in kje šibka?
Njegove prednosti so: prepoznavanje vzorcev v majhnih in srednje velikih besedilih, generiranje hipotez o besedišču besedila, predlaganje kandidatov za kolokacije, interpretacija rezultata, opis metodologije. AI sprašuje, "kateri izrazi izstopajo pri tem avtorju?" Omogoča hiter začetek vprašanja.
Slabost: Natančno štetje. AI je jezikovni model, ne kalkulator; lahko da približen in včasih napačen odgovor na vprašanje "kolikokrat se je pojavilo" v dolgem besedilu. Za natančno frekvenco, natančno statistiko kolokacij ali obsežno skeniranje korpusa na tisoče besed se uporablja specializirana programska oprema (npr. orodja za korpus, kot je AntConc ali preglednica). Umetna inteligenca je dragocena pri interpretaciji rezultatov teh orodij; Toda ne prisilite ga, da na slepo začne surovo štetje.
Namig: če potrebujete natančno številko, uporabite dva načina: orodje naj izvede štetje v majhnem besedilu in naj ga AI interpretira; Ali pa zahtevajte štetje AI in ga preverite na drug način. Nikoli ne uporabite stavka "AI je rekel, da se pojavi 47-krat" brez potrditve.
Študija korpusa po korakih
- Postavite vprašanje. "Kako so barvne besede porazdeljene pri tem pesniku?" Štetje je nesmiselno brez jasnega vprašanja, kot je:
- Določite korpus. Katera besedila? Katera izdaja? Katero obdobje? Meja mora biti jasna.
- Izberite meritev. Pogostost, kolokacija, bogastvo besedišča?
- Izmeri in preveri. Izvedite štetje, nato potrdite na drugi način.
- Komentiraj. Številka sama po sebi ne pove ničesar; Prav vaš komentar daje smisel ugotovitvi, da so se "barvne besede podvojile v drugi periodi".
Pogosto uporabljeno merilo bogastva besedišča je razmerje med številom različnih besed in skupnim številom besed (razmerje vrsta/žeton). Če je to razmerje visoko, je besedilo besedno raznoliko, če je nizko, pa pomeni, da se ponavlja. Toda na to razmerje vpliva dolžina besedila; Bodite previdni, ko neposredno primerjate kratka in dolga besedila.
trije mini kovčki
1. primer – kolokacija je pokazala slog. Raziskovalec je preučil pridevniške samostalniške pare v 3 romanih romanopisca. AI je predlagal, da se beseda "bled" ujema s 5 različnimi samostalniki; Raziskovalec je preveril 4 besedila in eno izločil kot izmišljeno. Potrjeni vzorec je postal teza o avtorjevem opisnem slogu.
Primer 2 – Ugotovljena napaka pri štetju. Študent je vprašal AI, kolikokrat se je beseda "noč" pojavila v besedilu z 2000 besedami; AI je rekel "23". Ko je študent vrgel besedilo v preglednico in ga dal prešteti, je bila dejanska številka 17. Postalo je jasno, da je neobdelano štetje AI nezanesljivo.
Primer 3 – Periodične spremembe so sprožile polemiko. Ena skupina je primerjala delež abstraktnih besed v pesnikovih zgodnjih in poznih pesmih. Prvi osnutek AI je predlagal trend; Ko se je skupina vrnila k besedilu in preverila štetje, se je izkazalo, da je trend resničen, vendar so bili "vzroki", ki jih je predlagala umetna inteligenca, nepreverljive špekulacije in so bili odpravljeni.
Štiri predloge za kopiranje
1) Oris pogostosti besed (s preverjanjem):
V spodnjem besedilu naštejte 15 najpogosteje pojavljajočih se vsebinskih besed (izključite funkcijske besede, kot so vezniki in predlogi) z njihovo približno pogostostjo. OPOZORILO: Upoštevajte, da štetja MORDA NISO točna, in upoštevajte, "če želite biti točni, jih je treba preveriti z ločenim orodjem za štetje." Besedilo: [sem prilepite besedilo]
2) Kandidati za kolokacijo:
Predlagajte pare besed (kolokacije), ki se pogosto pojavljajo skupaj v spodnjem besedilu. Za vsak par navedite vsaj en citat iz besedila. Dvojna izmišljotina, ki nima ekvivalenta v besedilu; Če niste prepričani, označite kot »potrebuje preverjanje«. Besedilo: [prilepite besedilo]
3) Primerjava besedišča:
Dal vam bom dve besedili. Za vsako: približno skupno število besed, opažanja o različnih besednih različicah in pomembne domene besed (npr. barva, narava, čustva). Navedite, da so številke približne. Interpretacijo primerjave prepustite mojemu preverjanju. Besedilo A: [...] Besedilo B: [...]
4) Razlaga rezultata:
Iz orodja za štetje sem dobil naslednje rezultate: [prilepite rezultate]. Ustvarite 2-3 hipoteze o tem, kaj bi lahko te številke pomenile jezikovno. Vsako hipotezo označite kot "zahteva dokaze" in mi povejte, kako jo lahko preizkusim. Izogibajte se pretiranim komentarjem.
Šibek poziv/močan poziv
Slab: "Katera beseda se najpogosteje pojavlja v tem besedilu?"
Močno: "Navedite najpogostejše vsebinske besede v tem besedilu z njihovo približno pogostostjo; izključite funkcijske besede. Pojasnite, da številke niso točne in jih je treba preveriti z ločenim orodjem. Za vsako besedo navedite primer stavka."
Zaradi zmogljivega poziva AI sprejme omejitev števila in vam vnaprej pove, da je potrebno preverjanje. V šibkem pozivu AI da eno samo številko in ne veste, da je lahko napačna.
Tabela meritev in zanesljivosti
merjenje
Kaj kaže
AI sam
prava pot
pogostost besede
pogoste besede
O, tvegano
Komentar števca + AI
kolokacija
tisti, ki so šli skupaj
Izdeluje kandidate
Potrditev iz besedila
Razmerje vrsta/žeton
Besedna raznolikost
Lahko je zavajajoče
Račun z orodjem
sezonska sprememba
Trend skozi čas
ustvarja hipoteze
Izmeri in preveri
Zaključni komentar
Pomen
Močan, a pretirava
človeška presoja
Koncepti ključnih besed in n-gramov
Dva koncepta vam olajšata delo pri analizi korpusa. Prva je ključna beseda (ključna beseda v angleščini - beseda, ki se v besedilu ali avtorju pojavlja veliko pogosteje, kot je bilo pričakovano, v primerjavi s splošnim jezikom, kar daje temu besedilu "značaj"). Ključne besede avtorja razkrivajo njegove interese in slog; Če se na primer pri pesniku »morje« in »ločitev« pojavljata pogosteje, kot je bilo pričakovano, ta statistična štrlina postane izhodišče za interpretacijo. Za identifikacijo ključnih besed je potrebno primerjati frekvence besedila s frekvencami referenčnega korpusa (splošno, veliko besedilo, uporabljeno za primerjavo); Ta primerjava je dokončno opravilo orodja, je izračun, ki ga AI ne more zanesljivo narediti sam.
Drugi je n-gram (zaporedje n zaporednih besed v besedilu; zaporedje dveh besed se imenuje "bigram", zaporedje treh besed se imenuje "trigram"). Analiza N-gramov razkrije avtorjeve formulacijske izraze in pogosto uporabljene fraze. Na primer, če pisatelj izredno pogosto uporablja fraze, kot sta "nekako" ali "vendar", to kaže na njegovo navado sestavljanja stavkov. AI lahko predlaga te fraze kot kandidate; toda za pravo pogostost in statistično pomembnost se je treba vrniti k orodju za štetje.
Namig: Povejte AI: "Naštej opazne fraze (dve ali tri besede) v tem besedilu kot kandidate in za vsako navedi primer iz besedila." Vzemite seznam kandidatov in izmerite dejansko frekvenco z ločenim orodjem. Postavite AI kot »opaznika«, agenta kot »števec« in sebe kot »tolmača«.
Pogoste napake
- Zanašanje na neobdelano število AI. AI ni kalkulator; Preverite natančno število z ločenim orodjem.
- Predstavitev številke brez komentarja. "Pretekel 47-krat" ne pove ničesar; Vi ustvarjate pomen.
- Ignoriranje dolžine besedila. Stopnje raznolikosti besedila so občutljive na dolžino.
- Izdelava diplomske naloge brez preverjanja kolokacije. Pari, ki niso AI, lahko predlagajo; Potrdite iz besedila.
- Ekstremen komentar. Ne sprejmite "razlogov", ki jih predlaga AI brez dokazov.
Če povzamem
Korpusna analiza odpira števen vidik literature: pogostost, kolokacija, besedišče, periodične spremembe. Umetna inteligenca je na tem področju močna pri prepoznavanju vzorcev in razlagi rezultatov; vendar je pri absolutnem štetju nezanesljiv. Preverite številko z ločenim orodjem, potrdite kolokacije iz besedila in sami ugotovite pomen posamezne številke. Število ni dokaz, so vrata do dokazov.
Aplikacijska naloga
Izberite kratko besedilo (500-1000 besed). Prepoznajte vsebinsko besedo (npr. "noč" ali "cesta"). Najprej se vštejte v besedilo. Nato naj to prešteje AI. Primerjajte oba rezultata; Če obstaja razlika, raziščite razlog. Nato napišite komentar v enem odstavku o funkciji te besede v besedilu – spremenite število v pomen.
kontrolni seznam
- [ ] Postavil sem jasno jezikovno vprašanje.
- [ ] Določila sem meje korpusa (besedilo, izdaja, obdobje).
- [ ] Štetje AI sem preveril na drugi način.
- [ ] Potrdil sem kolokacije iz besedila.
- [ ] Številke nisem pustil brez komentarja; Sam sem ustvaril pomen.