Ieguvumi:
- Spēja izveidot korpusa mērījumus, piemēram, vārdu biežumu, kolokāciju, vārdu krājuma bagātību un atslēgvārdus ar mākslīgo intelektu
- Zinot, ka mākslīgais intelekts ir neuzticams precīzā skaitīšanā, un spēja pārbaudīt katru skaitu ar atsevišķu rīku
- Spēja saprast, ka skaitlis pats par sevi neko neizsaka un lingvistiskā interpretācija, kas nosaka nozīmi, pieder cilvēkam.
Literatūras un valodu studijas nav tikai "komentāri"; Tam ir arī izmērāms un saskaitāms aspekts. Cik dažādu vārdu autors lieto, kādus vārdus viņam patīk lietot kopā ar kādiem vārdiem, kādi vārdi kādā laika posmā kļūst izplatīti - tos pēta valodniecība (zinātne, kas pēta valodas skaņu, struktūru, nozīmi un lietojumu) un īpaši korpuslingvistika. Korpuss ir tekstu kopums, piemēram, pilni autora darbi, laikraksta gada arhīvs vai perioda dzejoļi. Korpusa analīze šajā daļā meklē skaitliskus modeļus.
Šajā nodaļā mēs iemācīsimies izmantot AI kā korpusa analīzes palīgu: ātri izgūt tādus rādītājus kā vārdu biežums (cik reižu vārds parādās tekstā), kolokācija (vārdu pāri, kas bieži sastopami kopā, piemēram, "melns" + "mana laime"), vārdu krājuma bagātība un sezonālās izmaiņas. Taču brīdinājums jau no paša sākuma: AI var kļūdīties, rēķinot vienatnē; Lieliem un precīziem skaitļiem ir nepieciešami īpaši rīki, un jūs esat valodnieks, kurš nosaka katra skaitļa nozīmi.
Kur AI ir spēcīgs un kur vājš korpusa analīzē?
Tās stiprās puses ir: modeļu atpazīšana mazos un vidējos tekstos, hipotēžu ģenerēšana par teksta vārdu krājumu, kolokāciju kandidātu ierosināšana, rezultāta interpretācija, metodoloģijas aprakstīšana. AI jautā: "Kādas frāzes izceļas šajā autorā?" Tas dod ātru jautājuma sākumu.
Vājums: precīza skaitīšana. AI ir valodas modelis, nevis kalkulators; var sniegt aptuvenu un dažkārt nepareizu atbildi uz jautājumu "cik reizes tas ir noticis" garā tekstā. Lai iegūtu precīzu biežumu, precīzu izvietošanas statistiku vai tūkstošiem vārdu lielu korpusa skenēšanu, tiek izmantota specializēta programmatūra (piemēram, korpusa rīki, piemēram, AntConc vai izklājlapa). AI ir vērtīgs šo rīku rezultātu interpretācijā; Bet nelieciet viņam akli rēķināt.
Padoms. Ja nepieciešams precīzs skaitlis, izmantojiet divus veidus: ļaujiet rīkam veikt skaitīšanu mazā tekstā un AI interpretē to; Vai arī noskaidrojiet AI un pārbaudiet to citā veidā. Nekad neizmantojiet teikumu "AI teica, ka tas notiek 47 reizes" bez apstiprinājuma.
Soli pa solim korpusa pētījums
- Uzdod jautājumu. "Kā šajā dzejniekā tiek izplatīti krāsu vārdi?" Skaitīšana ir bezjēdzīga bez tāda skaidra jautājuma kā:
- Definējiet korpusu. Kādi teksti? Kurš izdevums? Kurš periods? Robežai jābūt skaidrai.
- Izvēlieties mērījumu. Biežums, kolokācija, vārdu krājuma bagātība?
- Izmēriet un pārbaudiet. Veiciet skaitīšanu, pēc tam apstipriniet otru veidu.
- komentēt. Skaitlis vien neko neizsaka; Tieši jūsu komentārs padara jēgpilnu secinājumu, ka "krāsu vārdi otrajā periodā dubultojās".
Bieži lietots vārdu krājuma bagātības mērs ir dažādu vārdu skaita attiecība pret kopējo vārdu skaitu (tipa/žetona attiecība). Ja šī attiecība ir augsta, teksts ir vārdu daudzveidība, un, ja tas ir zems, tas nozīmē, ka tas atkārtojas. Taču šo attiecību ietekmē teksta garums; Esiet piesardzīgs, tieši salīdzinot īsus un garus tekstus.
trīs mini futrāļi
1. gadījums — izvietošana demonstrēja stilu. Pētnieks pētīja īpašības vārdu un lietvārdu pārus 3 romānu rakstnieka romānos. AI ierosināja, ka vārds “bāls” atbilst 5 dažādiem lietvārdiem; Pētnieks pārbaudīja 4 no tekstiem un 1 izslēdza kā izdomātus. Apstiprinātais modelis kļuva par tēzes apgalvojumu par autora aprakstošo stilu.
2. gadījums — konstatēta skaitīšanas kļūda. Students jautāja AI, cik reižu vārds “nakts” ir figurējis 2000 vārdu garā tekstā; AI teica "23". Kad students iemeta tekstu izklājlapā un lika to saskaitīt, patiesais skaitlis bija 17. Ir kļuvis skaidrs, ka mākslīgā intelekta neapstrādātais skaits nav uzticams.
3. gadījums — periodiskas izmaiņas izraisīja strīdus. Viena grupa salīdzināja abstrakto vārdu proporciju dzejnieka agrīnajos un vēlīnās dzejoļos. Pirmais AI projekts ierosināja tendenci; Kad grupa atgriezās pie teksta un pārbaudīja skaitu, tendence izrādījās reāla, taču AI ieteiktie "cēloņi" bija nepārbaudāmi spekulācijas un tika novērsti.
Četras kopējamas veidnes
1) Vārdu biežuma kontūra (ar verifikāciju):
Tālāk tekstā uzskaitiet 15 visbiežāk sastopamos satura vārdus (izslēdziet funkciju vārdus, piemēram, saikļus un prievārdus), norādot to aptuveno biežumu. BRĪDINĀJUMS. Ņemiet vērā, ka skaitļi VAR NAV precīzi, un atzīmējiet: "Lai tie būtu precīzi, tie ir jāpārbauda ar atsevišķu skaitīšanas rīku." Teksts: [ielīmējiet tekstu šeit]
2) Izvietošanas kandidāti:
Tālāk esošajā tekstā iesakiet vārdu pārus (kolokācijas), kas bieži sastopami kopā. Katram pārim sniedziet vismaz vienu citātu no teksta. Dubultā izdomājums, kam tekstā nav ekvivalenta; Ja neesat pārliecināts, atzīmējiet to kā "nepieciešama pārbaude".Teksts: [ielīmēt tekstu]
3) Vārdu krājuma salīdzinājums:
Es jums iedošu divus tekstus. Katram: aptuvens vārdu kopskaits, novērojumi par dažādām vārdu šķirnēm un ievērojamas vārdu jomas (piemēram, krāsa, daba, emocijas). Norādiet, ka skaitļi ir aptuveni. Atstājiet salīdzinājuma interpretāciju manai pārbaudei. Teksts A: [...] Teksts B: [...]
4) Rezultāta interpretācija:
Es saņēmu šādus rezultātus no skaitīšanas rīka: [ielīmēt rezultātus]. Izveidojiet 2–3 hipotēzes par to, ko šie skaitļi varētu nozīmēt lingvistiski. Atzīmējiet katru hipotēzi kā "nepieciešami pierādījumi" un pastāstiet man, kā es varu to pārbaudīt. Izvairieties no pārmērīgiem komentāriem.
Vāja uzvedne / spēcīga uzvedne
Vāji: "Kurš vārds šajā tekstā sastopams visvairāk?"
Spēcīgs: "Norādiet šajā tekstā visbiežāk sastopamos satura vārdus ar to aptuveno biežumu; izslēdziet funkciju vārdus. Skaidrojiet, ka skaitļi nav precīzi un tie ir jāpārbauda ar atsevišķu rīku. Katram vārdam sniedziet teikuma piemēru."
Spēcīgā uzvedne liek AI pieņemt skaita ierobežojumu un jau iepriekš informē, ka ir nepieciešama pārbaude. Vājajā uzvednē AI dod vienu skaitli, un jūs nezināt, ka tas varētu būt nepareizi.
Mērījumu un uzticamības tabula
mērīšana
Kas liecina
AI vienatnē
pareizais ceļš
vārdu biežums
bieži vārdi
Apmēram, riskanti
Skaitītājs + AI komentāri
izvietošana
tie, kas gāja kopā
Ražo kandidātus
Apstiprinājums no teksta
Veida/marķiera attiecība
Verbālā daudzveidība
Var būt maldinoši
Konts ar rīku
sezonas maiņa
Tendence laika gaitā
ģenerē hipotēzes
Izmēriet un pārbaudiet
Noslēguma komentārs
Nozīme
Spēcīgi, bet pārspīlē
cilvēka spriedums
Atslēgvārdu un n-gramu jēdzieni
Divas koncepcijas atvieglo darbu korpusa analīzē. Pirmais ir atslēgvārds (atslēgvārds angļu valodā – vārds, kas tekstā vai autorā sastopams daudz biežāk, nekā paredzēts, salīdzinot ar vispārējo valodu, piešķirot šim tekstam savu "rakstu"). Autora atslēgvārdi atklāj viņa intereses un stilu; Piemēram, ja dzejniekam "jūra" un "atdalīšana" notiek biežāk, nekā gaidīts, šis statistiskais izvirzījums kļūst par interpretācijas sākumpunktu. Lai identificētu atslēgvārdus, ir jāsalīdzina teksta frekvences ar atsauces korpusa (vispārējs, liels teksta kopums, ko izmanto salīdzināšanai) frekvencēm; Šis salīdzinājums ir galīgs rīka darbs, tas ir aprēķins, ko AI nevar uzticami veikt viens pats.
Otrais ir n-gramma (n secīgu vārdu secība tekstā; divu vārdu secību sauc par "bigramu", trīs vārdu secību sauc par "trigramu"). N-gramu analīze atklāj autora formulu izteiksmes un bieži lietotās frāzes. Piemēram, ja rakstnieks ārkārtīgi bieži lieto tādas frāzes kā "veids" vai "tomēr", tas norāda uz viņa ieradumu veidot teikumus. AI var ieteikt šīs frāzes kā kandidātus; bet patiesajam biežumam un statistiskajam nozīmīgumam ir jāatgriežas pie skaitīšanas rīka.
Padoms: Pastāstiet AI: "Norādiet šajā tekstā kā kandidātus ievērojamās frāzes (divus vai trīs vārdus) un sniedziet piemēru no teksta katrai." Paņemiet kandidātu sarakstu un izmēra faktisko biežumu ar atsevišķu rīku. Novietojiet AI kā “pamanītāju”, aģentu kā “skaitītāju” un sevi kā “tulku”.
Biežas kļūdas
- Paļaujoties uz mākslīgā intelekta neapstrādāto skaitu. AI nav kalkulators; Pārbaudiet precīzu skaitu, izmantojot atsevišķu rīku.
- Uzrādot numuru bez komentāriem. "Nokārtots 47 reizes" neko neizsaka; Jūs radāt nozīmi.
- Teksta garuma ignorēšana. Lirikas daudzveidības rādītāji ir jutīgi pret garumu.
- Diplomdarba veidošana bez kolokācijas pārbaudes. Pāri, kas nav AI, var ieteikt; Apstipriniet no teksta.
- Ekstrēms komentārs. Nepieņemiet AI ieteiktos "iemeslus" bez pierādījumiem.
Rezumējot
Korpusa analīze paver saskaitāmu literatūras šķautni: biežumu, kolokāciju, vārdu krājumu, periodiskas izmaiņas. AI šajā jomā ir spēcīgs, atpazīstot modeļus un interpretējot rezultātus; bet tas ir neuzticams absolūtajā skaitīšanā. Pārbaudiet numuru ar atsevišķu rīku, apstipriniet kolokācijas no teksta un pats nosakiet katra skaitļa nozīmi. Skaitlis nav pierādījums, tās ir durvis uz pierādījumiem.
Lietojumprogrammas uzdevums
Izvēlieties īsu tekstu (500-1000 vārdu). Identificējiet satura vārdu (piemēram, "nakts" vai "ceļš"). Pirmkārt, ieskaitiet sevi tekstā. Pēc tam lieciet AI to saskaitīt. Salīdziniet abus rezultātus; Ja ir atšķirība, izpētiet iemeslu. Pēc tam uzrakstiet vienas rindkopas komentāru par šī vārda funkciju tekstā — skaitļa pārvēršanu nozīmē.
kontrolsaraksts
- [ ] Es uzdevu skaidru lingvistisku jautājumu.
- [ ] Noteicu korpusa robežas (teksts, izdevums, periods).
- [ ] Es pārbaudīju AI skaitu otrā veidā.
- [ ] Es apstiprināju kolokācijas no teksta.
- [ ] Es neatstāju numuru bez komentāriem; Es pats radīju jēgu.