Câștiguri:
- Abilitatea de a elabora măsurători de corpus, cum ar fi frecvența cuvintelor, alocarea, bogăția de vocabular și cuvinte cheie cu inteligență artificială
- Știind că inteligența artificială nu este de încredere în numărarea exactă și posibilitatea de a verifica fiecare numărare cu un instrument separat
- Capacitatea de a înțelege că un număr nu spune nimic de la sine și că interpretarea lingvistică care stabilește sensul aparține oamenilor.
Literatura și studiile de limbă nu sunt doar „comentari”; Are, de asemenea, un aspect măsurabil și numărabil. Câte cuvinte diferite folosește un autor, ce cuvinte îi place să folosească cu ce cuvinte, ce cuvinte devin comune într-o perioadă - acestea sunt investigate prin lingvistică (știința care studiază sunetul, structura, sensul și utilizarea limbajului) și mai ales lingvistica corpus. Un corpus este o colecție de texte, cum ar fi lucrările complete ale unui autor, arhiva anuală a unui ziar sau poeziile unei perioade. Analiza corpus caută modele numerice în această bucată.
În această unitate, vom învăța să folosim AI ca asistent de analiză a corpusului: extragerea rapidă a unor valori precum frecvența cuvintelor (de câte ori apare un cuvânt în text), alocarea (perechile de cuvinte care apar frecvent împreună, de exemplu „negru” + „averea mea”), bogăția de vocabular și variația sezonieră. Dar un avertisment de la început: AI poate face greșeli când numără singur; Sunt necesare instrumente speciale pentru numărări mari și precise, iar tu ești lingvistul care stabilește semnificația fiecărui număr.
Unde este IA puternică și unde este slabă în analiza corpusului?
Punctele sale forte sunt: Recunoașterea tiparelor în textele mici și mijlocii, generarea de ipoteze despre vocabularul unui text, sugerarea candidaților pentru colocații, interpretarea unui rezultat, descrierea unei metodologii. AI întreabă „ce fraze ies în evidență la acest autor?” Oferă un început rapid întrebării.
Puncte slabe: numărare precisă. AI este un model de limbaj, nu un calculator; poate da un răspuns aproximativ și uneori incorect la întrebarea „de câte ori s-a întâmplat” într-un text lung. Pentru frecvența precisă, statistici exacte de colocare sau scanarea unui corpus mare de mii de cuvinte, se utilizează software specializat (de exemplu, instrumente pentru corpus, cum ar fi AntConc sau o foaie de calcul). AI este valoroasă în interpretarea rezultatelor acestor instrumente; Dar nu-l pune să facă numărătoarea brută orbește.
Sfat: Dacă aveți nevoie de un număr exact, utilizați două moduri: puneți un instrument să facă numărarea în text mic și puneți AI-ul să îl interpreteze; Sau contează AI și verifică-l într-un alt mod. Nu folosiți niciodată propoziția „AI a spus că apare de 47 de ori” fără confirmare.
Un studiu de corpus pas cu pas
- Pune o întrebare. „Cum sunt distribuite cuvintele colorate în acest poet?” Numărarea este lipsită de sens fără o întrebare clară precum:
- Definiți corpus. Ce texte? Care editie? Care perioada? Granița trebuie să fie clară.
- Selectați măsurarea. Frecvența, alocarea, bogăția de vocabular?
- Măsurați și verificați. Faceți numărătoarea, apoi confirmați o a doua cale.
- Comentariu. Numărul singur nu spune nimic; Comentariul tău este cel care face să fie semnificativă constatarea că „cuvintele de culoare s-au dublat în a doua perioadă”.
O măsură frecvent utilizată a bogăției vocabularului este raportul dintre numărul de cuvinte diferite și numărul total de cuvinte (raportul tip/semnal). Dacă acest raport este mare, textul este o varietate de cuvinte, iar dacă este scăzut, înseamnă că este repetitiv. Dar acest raport este afectat de lungimea textului; Fiți atenți când comparați direct texte scurte și lungi.
trei mini cutii
Cazul 1 – Colocarea a demonstrat un stil. Un cercetător a examinat perechile adjectiv-substantiv în 3 romane ale unui romancier. AI a sugerat că cuvântul „palid” se potrivește cu 5 substantive diferite; Cercetătorul a verificat 4 dintre texte și a eliminat 1 ca fiind fabricat. Modelul confirmat a devenit o declarație de teză despre stilul descriptiv al autorului.
Cazul 2 — Eroare de numărare prinsă. Un student a întrebat AI de câte ori a apărut cuvântul „noapte” într-un text de 2.000 de cuvinte; AI a spus „23”. Când studentul a aruncat textul într-o foaie de calcul și l-a numărat, numărul real a fost 17. A devenit clar că numărul brut al AI nu este de încredere.
Cazul 3 – Schimbarea periodică a stârnit controverse. Un grup a comparat proporția de cuvinte abstracte din poeziile timpurii și cele târzii ale unui poet. Prima schiță de IA a sugerat o tendință; Când grupul a revenit la text și a verificat numărul, tendința s-a dovedit a fi reală, dar „cauzele” sugerate de AI au fost speculații neverificabile și au fost eliminate.
Patru șabloane copiabile
1) Schița de frecvență a cuvintelor (cu verificare):
Enumerați cele 15 cuvinte de conținut cele mai frecvente (excludeți cuvintele funcționale, cum ar fi conjuncțiile și prepozițiile) în textul de mai jos, cu frecvențele lor aproximative. AVERTISMENT: Rețineți că numărătoarea POATE NU fie exactă și rețineți că „pentru a fi exacte, acestea trebuie verificate cu un instrument de numărare separat”. Text: [inserați textul aici]
2) Candidați pentru locație:
Sugerați perechi de cuvinte (colocații) care apar frecvent împreună în textul de mai jos. Dați cel puțin un citat din text pentru fiecare pereche. Fabricare dublă care nu are echivalent în text; Dacă nu sunteți sigur, marcați-l ca „necesită verificare”.Text: [inserați text]
3) Comparație de vocabular:
Vă dau două texte. Pentru fiecare: aproximativ totalul de cuvinte, observații despre diferite soiuri de cuvinte și domenii proeminente ale cuvintelor (de exemplu, culoare, natură, emoție). Precizați că numerele sunt aproximative. Lasă interpretarea comparației pe seama verificării mele. Textul A: [...] Textul B: [...]
4) Interpretarea rezultatelor:
Am obținut următoarele rezultate dintr-un instrument de numărare: [paste results].Generează 2-3 ipoteze despre ce ar putea însemna aceste numere din punct de vedere lingvistic. Marcați fiecare ipoteză ca „necesită dovezi” și spuneți-mi cum o pot testa. Evitați comentariile excesive.
Prompt slab / Prompt puternic
Slab: „Care cuvânt apare cel mai mult în acest text?”
Puternic: „Enumerați cele mai frecvente cuvinte de conținut din acest text cu frecvența lor aproximativă; excludeți cuvintele funcționale. Asigurați-vă că numerele nu sunt exacte și trebuie verificate cu un instrument separat. Dați un exemplu de propoziție pentru fiecare cuvânt.”
Solicitarea puternică face ca AI să accepte limita de numărare și vă spune din timp că este necesară verificarea. În promptul slab, AI-ul oferă un singur număr și nu știi că ar putea fi greșit.
Tabel de măsurare și fiabilitate
măsurare
Ce arată
AI singur
calea corectă
frecvența cuvintelor
cuvinte frecvente
Despre, riscant
Contor + comentariu AI
colocare
cei care au trecut împreună
Produce candidați
Confirmare din text
Raport tip/jeton
Diversitatea verbală
Poate induce in eroare
Cont cu instrument
schimbare sezonieră
Tendință în timp
generează ipoteze
Măsurați și verificați
Comentariu de încheiere
Înțeles
Puternic, dar exagerează
judecata umana
Concepte de cuvinte cheie și n-grame
Două concepte vă fac munca mai ușoară în analiza corpusului. Primul este cuvântul cheie (cuvânt cheie în limba engleză – cuvântul care apare într-un text sau autor mult mai des decât se aștepta în comparație cu limbajul general, dând textului „caracterul”). Cuvintele cheie ale unui autor dezvăluie interesele și stilul său; De exemplu, dacă „marea” și „separarea” apar mai frecvent decât se aștepta la un poet, această proeminență statistică devine punctul de plecare pentru o interpretare. Pentru a identifica cuvintele cheie, este necesar să se compare frecvențele unui text cu frecvențele unui corpus de referință (un corp de text general, mare, folosit pentru comparație); Această comparație este un instrument definitiv, este un calcul pe care AI nu îl poate face în mod fiabil de unul singur.
Al doilea este n-gram (o secvență de n cuvinte consecutive într-un text; o secvență de două cuvinte se numește „bigramă”, o secvență de trei cuvinte se numește „trigramă”). Analiza N-gramelor dezvăluie expresiile formulate ale autorului și expresiile utilizate frecvent. De exemplu, dacă un scriitor folosește extrem de frecvent expresii precum „un fel de” sau „oricum”, acest lucru indică obiceiul său de a face propoziții. AI poate sugera aceste fraze ca candidați; dar pentru frecvența adevărată și semnificația statistică este necesar să revenim la instrumentul de numărare.
Sugestie: Spuneți AI: „Enumerați frazele notabile (două sau trei cuvinte) din acest text ca candidați și dați un exemplu din text pentru fiecare”. Luați lista de candidați și măsurați frecvența reală cu un instrument separat. Poziționați AI ca „observator”, agentul ca „contor” și pe tine însuți ca „interpret”.
Greșeli comune
- Bazându-se pe numărul brut al AI. AI nu este un calculator; Verificați numărul exact cu un instrument separat.
- Prezentarea numărului fără comentarii. „A trecut de 47 de ori” nu spune nimic; Tu creezi sensul.
- Se ignoră lungimea textului. Ratele de diversitate lirică sunt sensibile la lungime.
- Realizarea tezei fără a verifica alocarea. Cuplurile non-AI pot sugera; Confirmați din text.
- Comentariu extrem. Nu acceptați „motivele” sugerate de AI fără dovezi.
Pe scurt
Analiza corpus deschide fața numărabilă a literaturii: frecvența, alocarea, vocabularul, schimbarea periodică. AI este puternică în acest domeniu în recunoașterea tiparelor și interpretarea rezultatelor; dar nu este de încredere în numărarea absolută. Verificați numărul cu instrumentul separat, confirmați alocările din text și stabiliți singur semnificația fiecărui număr. Numărul nu este o dovadă, este ușa către dovezi.
Sarcina de aplicare
Alegeți un text scurt (500-1000 de cuvinte). Identificați un cuvânt de conținut (de exemplu, „noapte” sau „drum”). În primul rând, numără-te în text. Apoi pune AI să-l numere. Comparați cele două rezultate; Dacă există o diferență, investigați motivul. Apoi scrieți un comentariu de un paragraf despre funcția cuvântului respectiv în text - transformând numărul în sens.
lista de verificare
- [ ] Am pus o întrebare lingvistică clară.
- [ ] Am definit limitele corpusului (text, ediție, punct).
- [ ] Am verificat numărul AI-ului într-o a doua modalitate.
- [ ] Am confirmat colocările din text.
- [ ] Nu am lăsat numărul fără comentarii; Eu însumi am creat sensul.