zisky:
- Schopnost navrhovat korpusová měření, jako je frekvence slov, kolokace, bohatost slovní zásoby a klíčová slova s umělou inteligencí
- Vědomí, že umělá inteligence je nespolehlivá v přesném počítání a možnost ověřit každý počet samostatným nástrojem
- Schopnost pochopit, že číslo samo o sobě nic neříká a že jazykový výklad, který určuje význam, patří lidem.
Literatura a studium jazyků nejsou jen „komentáře“; Má také měřitelný a počitatelný aspekt. Kolik různých slov autor používá, která slova s jakými slovy nejraději používá, která slova se v určitém období stávají běžnými – to zkoumá lingvistika (věda, která studuje zvuk, strukturu, význam a použití jazyka) a především korpusová lingvistika. Korpus je sbírka textů, jako jsou kompletní díla autora, výroční archiv novin nebo básně určitého období. Korpusová analýza hledá v tomto bloku číselné vzory.
V této lekci se naučíme používat umělou inteligenci jako asistenta korpusové analýzy: rychle extrahovat metriky, jako je frekvence slov (počet výskytů slova v textu), kolokace (dvojice slov, které se často vyskytují společně, např. „černá“ + „moje štěstí“), bohatost slovní zásoby a sezónní variace. Ale varování hned na začátku: AI může dělat chyby při samotném počítání; Pro velké a přesné počty jsou potřeba speciální nástroje a vy jste lingvista, kdo určuje význam každého čísla.
Kde je AI silná a kde slabá v korpusové analýze?
Jeho přednostmi jsou: Rozpoznávání vzorců v malých a středních textech, generování hypotéz o slovní zásobě textu, navrhování kandidátů na kolokace, interpretace výsledku, popis metodologie. Umělá inteligence se ptá: „Jaké fráze u tohoto autora vynikají?“ Poskytuje rychlý začátek otázky.
Slabé stránky: Přesné počítání. AI je jazykový model, nikoli kalkulačka; dokáže dát přibližnou a někdy nesprávnou odpověď na otázku „kolikrát se to stalo“ v dlouhém textu. Pro přesnou frekvenci, přesnou statistiku kolokace nebo skenování velkých korpusů o tisících slov se používá specializovaný software (např. korpusové nástroje jako AntConc nebo tabulkový procesor). AI je cenná při interpretaci výstupu těchto nástrojů; Ale nenuťte ho, aby počítal naslepo.
Tip: Pokud potřebujete přesné číslo, použijte dva způsoby: nechte nástroj počítání v malém textu a nechejte jej interpretovat AI; Nebo si nechte spočítat AI a ověřte to jiným způsobem. Nikdy nepoužívejte větu „AI řekla, že se to vyskytuje 47krát“ bez potvrzení.
Studie korpusu krok za krokem
- Položte otázku. "Jak jsou u tohoto básníka distribuována barevná slova?" Počítání nemá smysl bez jasné otázky jako:
- Definujte korpus. Které texty? Které vydání? Které období? Hranice musí být jasná.
- Vyberte měření. Frekvence, kolokace, bohatost slovní zásoby?
- Změřte a ověřte. Počítejte a poté potvrďte druhý způsob.
- Komentář. Samotné číslo nic neříká; Je to váš komentář, díky kterému je zjištění, že „barevná slova se ve druhém období zdvojnásobila“, smysluplné.
Často používaným měřítkem bohatosti slovní zásoby je poměr počtu různých slov k celkovému počtu slov (poměr typ/token). Pokud je tento poměr vysoký, text je rozmanitý, a pokud je nízký, znamená to, že se opakuje. Ale tento poměr je ovlivněn délkou textu; Při přímém porovnávání krátkých a dlouhých textů buďte opatrní.
tři mini pouzdra
Případ 1 – Kolokace demonstrovala styl. Výzkumník zkoumal páry přídavných jmen a podstatných jmen ve 3 románech romanopisce. AI navrhla, že slovo „bledý“ odpovídá 5 různým podstatným jménům; Výzkumník ověřil 4 z textů a 1 vyloučil jako smyšlený. Potvrzený vzor se stal tezí výpovědí o autorově popisném stylu.
Případ 2 – Chyba při počítání. Student se zeptal AI, kolikrát se slovo „noc“ objevilo v textu o 2 000 slovech; AI řekla „23“. Když student hodil text do tabulky a nechal ho spočítat, skutečný počet byl 17. Ukázalo se, že hrubý počet AI je nespolehlivý.
Případ 3 – Pravidelná změna vyvolala kontroverzi. Jedna skupina porovnávala podíl abstraktních slov v básníkových raných a pozdních básních. První návrh AI navrhoval trend; Když se skupina vrátila k textu a ověřila počet, trend se ukázal jako skutečný, ale „příčiny“ navržené AI byly neověřitelné spekulace a byly odstraněny.
Čtyři kopírovatelné šablony
1) Přehled četnosti slov (s ověřením):
V níže uvedeném textu uveďte 15 nejčastěji se vyskytujících slov obsahu (vylučte funkční slova, jako jsou spojky a předložky) s jejich přibližnou frekvencí. VAROVÁNÍ: Mějte na paměti, že počty NEMUSÍ být přesné a poznamenejte si, že „aby byly přesné, musí být ověřeny pomocí samostatného počítacího nástroje“. Text: [sem vložte text]
2) Kandidáti na kolokaci:
Navrhněte dvojice slov (kolokací), která se v níže uvedeném textu často vyskytují společně. Ke každé dvojici uveďte alespoň jeden citát z textu. Dvojitá výroba, která nemá v textu ekvivalent; Pokud si nejste jisti, označte jej jako „potřebuje ověření“. Text: [paste text]
3) Porovnání slovní zásoby:
Dám vám dva texty. U každého: přibližný celkový počet slov, pozorování různých slovních druhů a významné slovní domény (např. barva, povaha, emoce). Uveďte, že čísla jsou přibližná. Interpretaci srovnání nechte na mém ověření. Text A: [...] Text B: [...]
4) Interpretace výsledků:
Z nástroje pro počítání jsem získal následující výsledky: [vložit výsledky]. Vytvořte 2–3 hypotézy o tom, co by tato čísla mohla znamenat lingvisticky. Označte každou hypotézu jako „vyžaduje důkaz“ a řekněte mi, jak ji mohu otestovat. Vyhněte se přehnaným komentářům.
Slabá výzva / Silná výzva
Slabé: "Které slovo se v tomto textu vyskytuje nejčastěji?"
Strong: "Uveďte nejčastější obsahová slova v tomto textu s jejich přibližnou frekvencí; vylučte funkční slova. Ujasněte si, že čísla nejsou přesná a je třeba je ověřit pomocí samostatného nástroje. Ke každému slovu uveďte příklad věty."
Výkonná výzva umožňuje AI přijmout limit počtu a předem vám sdělí, že je vyžadováno ověření. Ve slabé výzvě vám AI dá jediné číslo a vy nevíte, že by to mohlo být špatně.
Tabulka měření a spolehlivosti
měření
Co ukazuje
AI sama
správným způsobem
frekvence slov
častá slova
Asi, riskantní
Counter + AI komentář
kolokace
kteří spolu prošli
Produkuje kandidáty
Potvrzení z textu
Poměr typ/token
Verbální rozmanitost
Může být zavádějící
Účet s nástrojem
sezónní změna
Trend v čase
vytváří hypotézy
Změřte a ověřte
Závěrečný komentář
Význam
Silný, ale přehání
lidský soud
Koncepty klíčových slov a n-gramů
Práci v korpusové analýze vám usnadní dva koncepty. Prvním z nich je klíčové slovo (klíčové slovo v angličtině – slovo, které se v textu nebo autorovi vyskytuje mnohem častěji, než se očekávalo v porovnání s obecným jazykem, což tomuto textu dodává jeho „charakter“). Klíčová slova autora odhalují jeho zájmy a styl; Pokud se například „moře“ a „separace“ vyskytují častěji, než se u básníka očekává, stává se tento statistický výstupek výchozím bodem pro interpretaci. Pro identifikaci klíčových slov je nutné porovnat četnosti textu s četnostmi referenčního korpusu (obecný, velký text používaný pro srovnání); Toto srovnání je definitivní nástroj, je to výpočet, který umělá inteligence nedokáže sama spolehlivě provést.
Druhým je n-gram (sekvence n po sobě jdoucích slov v textu; posloupnost dvou slov se nazývá „bigram“, posloupnost tří slov se nazývá „trigram“). N-gramová analýza odhaluje autorovy formulaické výrazy a často používané fráze. Pokud například autor používá fráze jako „druh“ nebo „nicméně“ extrémně často, naznačuje to jeho zvyk vytvářet věty. AI může navrhnout tyto fráze jako kandidáty; ale pro skutečnou četnost a statistickou významnost je nutné se vrátit k počítacímu nástroji.
Nápověda: Řekněte AI: "Uveďte v tomto textu pozoruhodné fráze (dvě nebo tři slova) jako kandidáty a pro každou uveďte příklad z textu." Vezměte seznam kandidátů a změřte skutečnou frekvenci pomocí samostatného nástroje. Umístěte AI jako „pozorovatele“, agenta jako „počítače“ a sebe jako „tlumočníka“.
Časté chyby
- Spoléhání se na hrubý počet AI. AI není kalkulačka; Ověřte přesné číslo samostatným nástrojem.
- Uvedení čísla bez komentáře. "Prošel 47krát" nic neříká; Vy tvoříte význam.
- Ignorování délky textu. Míry lyrické diverzity jsou citlivé na délku.
- Vypracování diplomové práce bez ověření kolokace. Páry bez AI mohou navrhovat; Potvrďte z textu.
- Extrémní komentář. Nepřijímejte „důvody“ navržené AI bez důkazů.
V souhrnu
Korpusová analýza otevírá početný aspekt literatury: frekvence, kolokace, slovní zásoba, periodické změny. AI je v této oblasti mocná při rozpoznávání vzorů a interpretaci výsledků; ale v absolutním počítání je nespolehlivé. Ověřte číslo pomocí samostatného nástroje, potvrďte kolokace z textu a sami určete význam každého čísla. Číslo není důkaz, je to brána k důkazu.
Aplikační úkol
Vyberte krátký text (500-1000 slov). Identifikujte obsahové slovo (např. „noc“ nebo „silnice“). Nejprve počítejte v textu sami se sebou. Pak to nechejte AI spočítat. Porovnejte dva výsledky; Pokud existuje rozdíl, prozkoumejte důvod. Poté napište jednoodstavcový komentář k funkci tohoto slova v textu – přeměňte číslo na význam.
kontrolní seznam
- [ ] Položil jsem jasnou lingvistickou otázku.
- [ ] Vymezil jsem hranice korpusu (text, vydání, období).
- [ ] Ověřil jsem počet AI druhým způsobem.
- [ ] Potvrdil jsem kolokace z textu.
- [ ] Číslo jsem nenechal bez komentáře; Smysl jsem si vytvořil sám.