Jednotka 3 / 11

Lingvistika a korpusová analýza: čtení slovní zásoby s čísly

zisky:

  • Schopnost navrhovat korpusová měření, jako je frekvence slov, kolokace, bohatost slovní zásoby a klíčová slova s umělou inteligencí
  • Vědomí, že umělá inteligence je nespolehlivá v přesném počítání a možnost ověřit každý počet samostatným nástrojem
  • Schopnost pochopit, že číslo samo o sobě nic neříká a že jazykový výklad, který určuje význam, patří lidem.

Literatura a studium jazyků nejsou jen „komentáře“; Má také měřitelný a počitatelný aspekt. Kolik různých slov autor používá, která slova s ​​jakými slovy nejraději používá, která slova se v určitém období stávají běžnými – to zkoumá lingvistika (věda, která studuje zvuk, strukturu, význam a použití jazyka) a především korpusová lingvistika. Korpus je sbírka textů, jako jsou kompletní díla autora, výroční archiv novin nebo básně určitého období. Korpusová analýza hledá v tomto bloku číselné vzory.

V této lekci se naučíme používat umělou inteligenci jako asistenta korpusové analýzy: rychle extrahovat metriky, jako je frekvence slov (počet výskytů slova v textu), kolokace (dvojice slov, které se často vyskytují společně, např. „černá“ + „moje štěstí“), bohatost slovní zásoby a sezónní variace. Ale varování hned na začátku: AI může dělat chyby při samotném počítání; Pro velké a přesné počty jsou potřeba speciální nástroje a vy jste lingvista, kdo určuje význam každého čísla.

Kde je AI silná a kde slabá v korpusové analýze?

Jeho přednostmi jsou: Rozpoznávání vzorců v malých a středních textech, generování hypotéz o slovní zásobě textu, navrhování kandidátů na kolokace, interpretace výsledku, popis metodologie. Umělá inteligence se ptá: „Jaké fráze u tohoto autora vynikají?“ Poskytuje rychlý začátek otázky.

Slabé stránky: Přesné počítání. AI je jazykový model, nikoli kalkulačka; dokáže dát přibližnou a někdy nesprávnou odpověď na otázku „kolikrát se to stalo“ v dlouhém textu. Pro přesnou frekvenci, přesnou statistiku kolokace nebo skenování velkých korpusů o tisících slov se používá specializovaný software (např. korpusové nástroje jako AntConc nebo tabulkový procesor). AI je cenná při interpretaci výstupu těchto nástrojů; Ale nenuťte ho, aby počítal naslepo.

Tip: Pokud potřebujete přesné číslo, použijte dva způsoby: nechte nástroj počítání v malém textu a nechejte jej interpretovat AI; Nebo si nechte spočítat AI a ověřte to jiným způsobem. Nikdy nepoužívejte větu „AI řekla, že se to vyskytuje 47krát“ bez potvrzení.

Studie korpusu krok za krokem

  1. Položte otázku. "Jak jsou u tohoto básníka distribuována barevná slova?" Počítání nemá smysl bez jasné otázky jako:
  2. Definujte korpus. Které texty? Které vydání? Které období? Hranice musí být jasná.
  3. Vyberte měření. Frekvence, kolokace, bohatost slovní zásoby?
  4. Změřte a ověřte. Počítejte a poté potvrďte druhý způsob.
  5. Komentář. Samotné číslo nic neříká; Je to váš komentář, díky kterému je zjištění, že „barevná slova se ve druhém období zdvojnásobila“, smysluplné.

Často používaným měřítkem bohatosti slovní zásoby je poměr počtu různých slov k celkovému počtu slov (poměr typ/token). Pokud je tento poměr vysoký, text je rozmanitý, a pokud je nízký, znamená to, že se opakuje. Ale tento poměr je ovlivněn délkou textu; Při přímém porovnávání krátkých a dlouhých textů buďte opatrní.

tři mini pouzdra

Případ 1 – Kolokace demonstrovala styl. Výzkumník zkoumal páry přídavných jmen a podstatných jmen ve 3 románech romanopisce. AI navrhla, že slovo „bledý“ odpovídá 5 různým podstatným jménům; Výzkumník ověřil 4 z textů a 1 vyloučil jako smyšlený. Potvrzený vzor se stal tezí výpovědí o autorově popisném stylu.

Případ 2 – Chyba při počítání. Student se zeptal AI, kolikrát se slovo „noc“ objevilo v textu o 2 000 slovech; AI řekla „23“. Když student hodil text do tabulky a nechal ho spočítat, skutečný počet byl 17. Ukázalo se, že hrubý počet AI je nespolehlivý.

Případ 3 – Pravidelná změna vyvolala kontroverzi. Jedna skupina porovnávala podíl abstraktních slov v básníkových raných a pozdních básních. První návrh AI navrhoval trend; Když se skupina vrátila k textu a ověřila počet, trend se ukázal jako skutečný, ale „příčiny“ navržené AI byly neověřitelné spekulace a byly odstraněny.

Čtyři kopírovatelné šablony

1) Přehled četnosti slov (s ověřením):

V níže uvedeném textu uveďte 15 nejčastěji se vyskytujících slov obsahu (vylučte funkční slova, jako jsou spojky a předložky) s jejich přibližnou frekvencí. VAROVÁNÍ: Mějte na paměti, že počty NEMUSÍ být přesné a poznamenejte si, že „aby byly přesné, musí být ověřeny pomocí samostatného počítacího nástroje“. Text: [sem vložte text]

2) Kandidáti na kolokaci:

Navrhněte dvojice slov (kolokací), která se v níže uvedeném textu často vyskytují společně. Ke každé dvojici uveďte alespoň jeden citát z textu. Dvojitá výroba, která nemá v textu ekvivalent; Pokud si nejste jisti, označte jej jako „potřebuje ověření“. Text: [paste text]

3) Porovnání slovní zásoby:

Dám vám dva texty. U každého: přibližný celkový počet slov, pozorování různých slovních druhů a významné slovní domény (např. barva, povaha, emoce). Uveďte, že čísla jsou přibližná. Interpretaci srovnání nechte na mém ověření. Text A: [...] Text B: [...]

4) Interpretace výsledků:

Z nástroje pro počítání jsem získal následující výsledky: [vložit výsledky]. Vytvořte 2–3 hypotézy o tom, co by tato čísla mohla znamenat lingvisticky. Označte každou hypotézu jako „vyžaduje důkaz“ a řekněte mi, jak ji mohu otestovat. Vyhněte se přehnaným komentářům.

Slabá výzva / Silná výzva

Slabé: "Které slovo se v tomto textu vyskytuje nejčastěji?"

Strong: "Uveďte nejčastější obsahová slova v tomto textu s jejich přibližnou frekvencí; vylučte funkční slova. Ujasněte si, že čísla nejsou přesná a je třeba je ověřit pomocí samostatného nástroje. Ke každému slovu uveďte příklad věty."

Výkonná výzva umožňuje AI přijmout limit počtu a předem vám sdělí, že je vyžadováno ověření. Ve slabé výzvě vám AI dá jediné číslo a vy nevíte, že by to mohlo být špatně.

Tabulka měření a spolehlivosti

měření

Co ukazuje

AI sama

správným způsobem

frekvence slov

častá slova

Asi, riskantní

Counter + AI komentář

kolokace

kteří spolu prošli

Produkuje kandidáty

Potvrzení z textu

Poměr typ/token

Verbální rozmanitost

Může být zavádějící

Účet s nástrojem

sezónní změna

Trend v čase

vytváří hypotézy

Změřte a ověřte

Závěrečný komentář

Význam

Silný, ale přehání

lidský soud

Koncepty klíčových slov a n-gramů

Práci v korpusové analýze vám usnadní dva koncepty. Prvním z nich je klíčové slovo (klíčové slovo v angličtině – slovo, které se v textu nebo autorovi vyskytuje mnohem častěji, než se očekávalo v porovnání s obecným jazykem, což tomuto textu dodává jeho „charakter“). Klíčová slova autora odhalují jeho zájmy a styl; Pokud se například „moře“ a „separace“ vyskytují častěji, než se u básníka očekává, stává se tento statistický výstupek výchozím bodem pro interpretaci. Pro identifikaci klíčových slov je nutné porovnat četnosti textu s četnostmi referenčního korpusu (obecný, velký text používaný pro srovnání); Toto srovnání je definitivní nástroj, je to výpočet, který umělá inteligence nedokáže sama spolehlivě provést.

Druhým je n-gram (sekvence n po sobě jdoucích slov v textu; posloupnost dvou slov se nazývá „bigram“, posloupnost tří slov se nazývá „trigram“). N-gramová analýza odhaluje autorovy formulaické výrazy a často používané fráze. Pokud například autor používá fráze jako „druh“ nebo „nicméně“ extrémně často, naznačuje to jeho zvyk vytvářet věty. AI může navrhnout tyto fráze jako kandidáty; ale pro skutečnou četnost a statistickou významnost je nutné se vrátit k počítacímu nástroji.

Nápověda: Řekněte AI: "Uveďte v tomto textu pozoruhodné fráze (dvě nebo tři slova) jako kandidáty a pro každou uveďte příklad z textu." Vezměte seznam kandidátů a změřte skutečnou frekvenci pomocí samostatného nástroje. Umístěte AI jako „pozorovatele“, agenta jako „počítače“ a sebe jako „tlumočníka“.

Časté chyby

  • Spoléhání se na hrubý počet AI. AI není kalkulačka; Ověřte přesné číslo samostatným nástrojem.
  • Uvedení čísla bez komentáře. "Prošel 47krát" nic neříká; Vy tvoříte význam.
  • Ignorování délky textu. Míry lyrické diverzity jsou citlivé na délku.
  • Vypracování diplomové práce bez ověření kolokace. Páry bez AI mohou navrhovat; Potvrďte z textu.
  • Extrémní komentář. Nepřijímejte „důvody“ navržené AI bez důkazů.

V souhrnu

Korpusová analýza otevírá početný aspekt literatury: frekvence, kolokace, slovní zásoba, periodické změny. AI je v této oblasti mocná při rozpoznávání vzorů a interpretaci výsledků; ale v absolutním počítání je nespolehlivé. Ověřte číslo pomocí samostatného nástroje, potvrďte kolokace z textu a sami určete význam každého čísla. Číslo není důkaz, je to brána k důkazu.

Aplikační úkol

Vyberte krátký text (500-1000 slov). Identifikujte obsahové slovo (např. „noc“ nebo „silnice“). Nejprve počítejte v textu sami se sebou. Pak to nechejte AI spočítat. Porovnejte dva výsledky; Pokud existuje rozdíl, prozkoumejte důvod. Poté napište jednoodstavcový komentář k funkci tohoto slova v textu – přeměňte číslo na význam.

kontrolní seznam

  • [ ] Položil jsem jasnou lingvistickou otázku.
  • [ ] Vymezil jsem hranice korpusu (text, vydání, období).
  • [ ] Ověřil jsem počet AI druhým způsobem.
  • [ ] Potvrdil jsem kolokace z textu.
  • [ ] Číslo jsem nenechal bez komentáře; Smysl jsem si vytvořil sám.