Kasu:
- Võimalus koostada tehisintellektiga korpuse mõõtmisi, nagu sõnade sagedus, kollokatsioon, sõnavara rikkus ja märksõnad
- Teades, et tehisintellekt on täpses loendamises ebausaldusväärne ja suutma iga loendust eraldi tööriistaga kontrollida
- Oskus aru saada, et arv ei ütle iseenesest midagi ja tähendust kehtestav keeleline tõlgendus kuulub inimesele.
Kirjandus- ja keeleõpe ei ole ainult "kommentaar"; Sellel on ka mõõdetav ja loendatav aspekt. Kui palju erinevaid sõnu autor kasutab, milliseid sõnu ta milliste sõnadega kasutada meeldib, millised sõnad muutuvad teatud ajajärgul tavaliseks – neid uuritakse läbi lingvistika (teadus, mis uurib keele kõla, struktuuri, tähendust ja kasutust) ja eelkõige korpuslingvistika. Korpus on tekstide kogum, näiteks autori terviklikud teosed, ajalehe aastaarhiiv või perioodi luuletused. Korpusanalüüs otsib selles tükis arvulisi mustreid.
Selles õppetükis õpime kasutama tehisintellekti korpuse analüüsi assistendina: kiiresti eraldama mõõdikuid, nagu sõnade sagedus (sõna tekstis esinemiskordade arv), kollokatsioon (sageli koos esinevad sõnapaarid, nt "must" + "minu õnn"), sõnavara rikkus ja hooajaline varieeruvus. Aga hoiatus algusest peale: tehisintellekt võib üksi loendades vigu teha; Suurte ja täpsete loenduste jaoks on vaja spetsiaalseid tööriistu ning teie olete keeleteadlane, kes määrab iga numbri tähenduse.
Kus on AI korpusanalüüsis tugev ja kus nõrk?
Selle tugevad küljed on: mustrite äratundmine väikestes ja keskmistes tekstides, hüpoteeside genereerimine teksti sõnavara kohta, kollokatsioonikandidaatide väljapakkumine, tulemuse tõlgendamine, metoodika kirjeldamine. AI küsib: "Millised fraasid sellel autoril silma paistavad?" See annab küsimusele kiire alguse.
Nõrkus: täpne loendamine. AI on keelemudel, mitte kalkulaator; oskab anda umbkaudse ja kohati ka ebaõige vastuse küsimusele "mitu korda see on toimunud" pikas tekstis. Täpse sageduse, täpse asukohastatistika või tuhandete sõnade mahuka korpuse skannimiseks kasutatakse spetsiaalset tarkvara (nt korpuse tööriistu, nagu AntConc või arvutustabelit). AI on väärtuslik nende tööriistade väljundi tõlgendamisel; Kuid ärge pange teda pimesi toorarvestust tegema.
Näpunäide. Kui vajate täpset arvu, kasutage kahte võimalust: laske tööriistal väikese tekstina loendada ja tehisintellektil seda tõlgendada; Või laske tehisintellekti lugeda ja kontrollige seda muul viisil. Ärge kunagi kasutage ilma kinnituseta lauset "AI ütles, et seda esineb 47 korda".
Korpuse samm-sammult uuring
- Esita küsimus. "Kuidas värvisõnad selles luuletajas jaotuvad?" Loendamine on mõttetu ilma selge küsimuseta, näiteks:
- Defineeri korpus. Millised tekstid? Milline väljaanne? Mis periood? Piir peab olema selge.
- Valige mõõtmine. Sagedus, kollokatsioon, sõnavara rikkus?
- Mõõtke ja kontrollige. Tehke loendus, seejärel kinnitage teine viis.
- Kommenteeri. Arv üksi ei ütle midagi; Just teie kommentaar muudab mõttekaks järelduse, et "värvisõnad kahekordistusid teisel perioodil".
Sageli kasutatav sõnavara rikkuse mõõt on erinevate sõnade arvu ja sõnade koguarvu suhe (tüübi/märgi suhe). Kui see suhtarv on kõrge, on tekst sõnaerinev, ja kui see on madal, tähendab see, et see on korduv. Kuid seda suhet mõjutab teksti pikkus; Olge lühikeste ja pikkade tekstide otsesel võrdlemisel ettevaatlik.
kolm minikarpi
Juhtum 1 – Kollokatsioon näitas stiili. Teadlane uuris omadussõna-nimisõna paariseid ühe romaanikirjaniku kolmes romaanis. AI soovitas, et sõna “kahvatu” sobiks 5 erineva nimisõnaga; Teadlane kontrollis 4 teksti ja kõrvaldas 1 väljamõelduna. Kinnitatud muster sai väitekirjaks autori kirjeldava stiili kohta.
Juhtum 2 – tabatud loendusviga. Üliõpilane küsis tehisintellektil, mitu korda esines sõna "öö" 2000-sõnalises tekstis; AI ütles "23". Kui õpilane viskas teksti tabelisse ja lasi selle üle lugeda, oli tegelik arv 17. On selgunud, et tehisintellekti toorloendus ei ole usaldusväärne.
Juhtum 3 – perioodiline muutmine tekitas poleemikat. Üks rühm võrdles abstraktsete sõnade osakaalu luuletaja varastes ja hilistes luuletustes. Tehisintellekti esimene mustand viitas suundumusele; Kui rühm pöördus tagasi teksti juurde ja kontrollis arvu, osutus trend tõeliseks, kuid tehisintellekti pakutud "põhjused" olid kontrollimatud spekulatsioonid ja need kõrvaldati.
Neli kopeeritavat malli
1) Sõnade sageduse ülevaade (koos kontrolliga):
Loetlege allolevas tekstis 15 kõige sagedamini esinevat sisusõna (välja arvatud funktsioonisõnad, nagu sidesõnad ja eessõnad) koos nende ligikaudse sagedusega. HOIATUS. Pange tähele, et loendused EI TOHI olla täpsed, ja märkige, et "täpsemaks muutmiseks tuleb neid kontrollida eraldi loendustööriistaga." Tekst: [kleebi tekst siia]
2) Asukoha kandidaadid:
Soovitage allolevas tekstis sageli koos esinevaid sõnapaare (kollokatsioone). Esitage iga paari kohta vähemalt üks tsitaat tekstist. Kahekordne väljamõeldis, millel pole tekstis vastet; Kui te pole kindel, märkige see kui "vajab kinnitamist".Tekst: [kleebi tekst]
3) Sõnavara võrdlus:
Ma annan teile kaks teksti. Igaühe kohta: ligikaudne sõnade koguarv, tähelepanekud erinevate sõnavariantide kohta ja silmapaistvad sõnavaldkonnad (nt värv, olemus, emotsioon). Öelge, et arvud on ligikaudsed. Jäta võrdluse tõlgendamine minu kontrolli alla. Tekst A: [...] Tekst B: [...]
4) Tulemuse tõlgendamine:
Sain loendustööriistaga järgmised tulemused: [kleebi tulemused]. Loo 2–3 hüpoteesi selle kohta, mida need numbrid keeleliselt tähendada võivad. Märkige iga hüpotees kui "vajab tõendeid" ja öelge mulle, kuidas ma saan seda testida. Vältige liigseid kommentaare.
Nõrk viip / Tugev viip
Nõrk: "Milline sõna esineb selles tekstis kõige rohkem?"
Tugev: "Loetlege selles tekstis kõige sagedasemad sisusõnad koos nende ligikaudse sagedusega; jätke funktsioonisõnad välja. Tehke selgeks, et arvud pole täpsed ja neid tuleb eraldi tööriistaga kontrollida. Tooge iga sõna kohta näide lause."
Võimas viip paneb tehisintellekti loenduspiiranguga nõustuma ja annab teile teada, et kinnitamine on vajalik. Nõrga viipa korral annab AI ühe numbri ja te ei tea, et see võib olla vale.
Mõõte- ja töökindlustabel
mõõtmine
Mis näitab
AI üksi
õige tee
sõna sagedus
sagedased sõnad
Umbes, riskantne
Loendur + AI kommentaar
kolokatsioon
need, kes koos läbisid
Toodab kandidaate
Kinnitus tekstist
Tüübi/märgi suhe
Verbaalne mitmekesisus
Võib olla eksitav
Konto koos tööriistaga
hooajaline muutus
Trend ajas
loob hüpoteese
Mõõtke ja kontrollige
Lõppkommentaar
Tähendus
Võimas, aga liialdab
inimlik otsustusvõime
Märksõna ja n-grammi mõisted
Kaks kontseptsiooni muudavad teie töö korpuse analüüsis lihtsamaks. Esimene on märksõna (inglise keeles märksõna – sõna, mis esineb tekstis või autoris üldkeelega võrreldes oodatust palju sagedamini, andes sellele tekstile oma "iseloomu"). Autori märksõnad paljastavad tema huvid ja stiili; Näiteks kui "meri" ja "eraldumine" esinevad luuletaja puhul oodatust sagedamini, saab sellest statistilisest eendist tõlgenduse lähtepunkt. Märksõnade tuvastamiseks on vaja võrrelda teksti sagedusi võrdluskorpuse (võrdluseks kasutatav üldine, suur tekstikogu) sagedustega; See võrdlus on lõplik tööriistatöö, see on arvutus, mida AI üksinda usaldusväärselt teha ei saa.
Teine on n-gramm (n järjestikusest sõnast koosnev jada tekstis; kahest sõnast koosnevat jada nimetatakse "bigrammiks", kolmest sõnast koosnevat jada "trigrammiks"). N-grammi analüüs paljastab autori vormelväljendid ja sageli kasutatavad fraasid. Näiteks kui kirjanik kasutab väga sageli selliseid fraase nagu "liik" või "aga", näitab see tema harjumust lauseid teha. AI saab neid fraase kandidaatidena soovitada; kuid tõelise sageduse ja statistilise olulisuse jaoks on vaja naasta loendusriista juurde.
Vihje: Öelge tehisintellektile: "Loetlege kandidaatidena selles tekstis olevad märkimisväärsed fraasid (kaks või kolm sõna) ja tooge igaühe jaoks tekstist näide." Võtke kandidaatide nimekiri ja mõõtke tegelik sagedus eraldi tööriistaga. Positsioneerige tehisintellekt "märkajaks", agent "loenduriks" ja ennast "tõlgiks".
Levinud vead
- Tuginedes tehisintellekti toorarvule. AI ei ole kalkulaator; Kontrollige täpset arvu eraldi tööriistaga.
- Numbri esitamine ilma kommentaarideta. "47 korda läbitud" ei ütle midagi; Te loote tähenduse.
- Teksti pikkuse ignoreerimine. Lüürika mitmekesisuse määrad on pikkuse suhtes tundlikud.
- Lõputöö tegemine ilma kollokatsiooni kontrollimata. Mitte-AI paarid võivad soovitada; Kinnitage tekstist.
- Äärmuslik kommentaar. Ärge nõustuge AI soovitatud "põhjustega" ilma tõenditeta.
Kokkuvõttes
Korpusanalüüs avab kirjanduse loendatava tahu: sagedus, kollokatsioon, sõnavara, perioodiline muutumine. AI on selles valdkonnas võimas mustrite äratundmisel ja tulemuste tõlgendamisel; kuid see on absoluutarvestuses ebausaldusväärne. Kontrollige numbrit eraldi tööriistaga, kinnitage tekstist kollokatsioonid ja määrake ise iga numbri tähendus. Arv ei ole tõend, see on uks tõenditeni.
Rakenduse ülesanne
Valige lühike tekst (500-1000 sõna). Määrake sisusõna (nt "öö" või "tee"). Esiteks loe end tekstis kokku. Seejärel laske tehisintellektil see üle lugeda. Võrrelge kahte tulemust; Kui on erinevusi, uurige põhjust. Seejärel kirjutage ühe lõigu pikkune kommentaar selle sõna funktsiooni kohta tekstis — arvu muutmine tähenduseks.
kontrollnimekiri
- [ ] Esitasin selge keelelise küsimuse.
- [ ] Määrasin korpuse piirid (tekst, väljaanne, periood).
- [ ] Kontrollisin tehisintellekti arvu teisel viisil.
- [ ] Kollokatsioonid kinnitasin tekstist.
- [ ] Ma ei jätnud numbrit kommentaarideta; Ma lõin tähenduse ise.