Единици
1. Вовед во вештачката интелигенција во турскиот јазик и литература: улоги, граници, верификација, автентичност и етика 2. Анализа на текст и внимателно читање: анализа на поезија, расказ и роман со вештачка интелигенција 3. Лингвистика и анализа на корпус: Читање вокабулар со броеви 4. Антички текстови, поедноставување и транслитерација: Работа со отомански и дивански текстови 5. Материјали на курсот и наставен дизајн: исход, ефективност и мерење 6. Книжевна историја и истражување: Преглед на литература, синтеза и верификација 7. Уредување, лекторирање и типување: Подготовка на текстот за објавување 8. Соработка меѓу човекот и вештачката интелигенција во креативното пишување и продукција 9. Оценување на оригиналност, плагијат и текстови напишани со вештачка интелигенција 10. Потврда на изворот, халуцинација и дисциплина на атрибути 11. Човекот во книжевната интерпретација: естетски суд, етика, доверливост и граници
Единица 3 / 11

Лингвистика и анализа на корпус: Читање вокабулар со броеви

Добивки:

  • Способност да се нацртаат мерења на корпус како што се фреквенција на зборови, колокација, богатство на речник и клучни зборови со вештачка интелигенција
  • Знаејќи дека вештачката интелигенција е неверодостојна во точното броење и можноста да го потврдите секое броење со посебна алатка
  • Способност да се разбере дека некој број сам не кажува ништо и дека лингвистичкото толкување кое го утврдува значењето им припаѓа на луѓето.

Студиите за литература и јазик не се само „коментари“; Има и мерлив и броив аспект. Колку различни зборови користи авторот, кои зборови сака да ги употребува со кои зборови, кои зборови стануваат вообичаени во еден период - тоа се истражува преку лингвистиката (науката што го проучува звукот, структурата, значењето и употребата на јазикот) и особено корпусната лингвистика. Корпус е збирка на текстови, како што се целосните дела на авторот, годишната архива на весникот или песните на одреден период. Анализата на корпус бара нумерички обрасци во овој дел.

Во оваа единица, ќе научиме да користиме вештачка интелигенција како асистент за анализа на корпус: брзо извлекување на метрика како што се зачестеноста на зборовите (бројот на пати зборот се појавува во текстот), колокацијата (парови на зборови кои често се појавуваат заедно, на пр. „црно“ + „моето богатство“), богатство на речник и сезонски варијации. Но, предупредување од почеток: вештачката интелигенција може да направи грешки кога брои сама; Потребни се специјални алатки за големи и прецизни брои, а вие сте лингвистот кој го утврдува значењето на секој број.

Каде е силна вештачката интелигенција, а каде слаба во анализата на корпус?

Неговите силни страни се: Препознавање шеми во мали и средни текстови, генерирање хипотези за вокабуларот на текстот, предлагање кандидати за колокации, толкување на резултат, опишување методологија. Вештачката интелигенција прашува „кои фрази се издвојуваат кај овој автор? Тоа дава брз почеток на прашањето.

Слабост: прецизно броење. ВИ е јазичен модел, а не калкулатор; може да даде приближен, а понекогаш и неточен одговор на прашањето „колку пати се случило“ во подолг текст. За прецизна фреквенција, точна статистика за колокација или скенирање на голем корпус на илјадници зборови, се користи специјализиран софтвер (на пр. корпус алатки како AntConc или табеларни пресметки). Вештачката интелигенција е важна во толкувањето на излезот од овие алатки; Но, не го терајте слепо да го прави суровото броење.

Совет: Ако ви треба точен број, користете два начини: нека алатка го прави броењето во мал текст и вештачката интелигенција нека го протолкува; Или имајте го броењето на вештачката интелигенција и потврдете го на друг начин. Никогаш не користете ја реченицата „АИ рече дека се случува 47 пати“ без потврда.

Студија на корпус чекор-по-чекор

  1. Поставете прашање. „Како се дистрибуираат зборовите во боја кај овој поет? Броењето е бесмислено без јасно прашање како:
  2. Дефинирајте го корпусот. Кои текстови? Кое издание? Кој период? Границата мора да биде јасна.
  3. Изберете го мерењето. Фреквенција, колокација, богатство на вокабулар?
  4. Измерете и проверете. Направете броење, а потоа потврдете го вториот начин.
  5. Коментар. Самата бројка не кажува ништо; Твојот коментар го прави значајно констатацијата дека „зборовите во боја се удвоија во вториот период“.

Често употребувана мерка за богатството на вокабуларот е односот на бројот на различни зборови со вкупниот број зборови (однос тип/токен). Ако овој сооднос е висок, текстот е збор-разновидност, а ако е низок, значи дека се повторува. Но, овој сооднос е под влијание на должината на текстот; Бидете внимателни кога директно споредувате кратки и долги текстови.

три мини футроли

Случај 1 - Колокацијата покажа стил. Истражувач испитувал спарување придавки-именка во 3 романи на романсиер. АИ предложи зборот „бледо“ да одговара на 5 различни именки; Истражувачот потврдил 4 од текстовите и елиминирал 1 како фабрикуван. Потврдената шема стана изјава за тезата за описниот стил на авторот.

Случај 2 - Утврдена грешка при броење. Еден студент ја прашал вештачката интелигенција колку пати зборот „ноќ“ се појавува во текст од 2.000 зборови; Вештачката интелигенција рече „23“. Кога ученикот го фрлил текстот во табела и го преброил, вистинскиот број бил 17. Стана јасно дека необработеното броење на вештачката интелигенција е несигурно.

Случај 3 - Периодични промени предизвикаа контроверзии. Една група го спореди процентот на апстрактни зборови во раните и доцните песни на поетот. Првиот нацрт на вештачката интелигенција предложи тренд; Кога групата се врати на текстот и го потврди броењето, трендот се покажа како реален, но „причините“ предложени од вештачката интелигенција беа непроверливи шпекулации и беа елиминирани.

Четири шаблони за копирање

1) Преглед на фреквенцијата на зборовите (со верификација):

Наведете ги 15-те најчесто појавувани содржински зборови (исклучете ги функционалните зборови како што се сврзниците и предлозите) во текстот подолу, со нивната приближна фреквенција. ПРЕДУПРЕДУВАЊЕ: Имајте предвид дека броењето МОЖЕ НЕ да биде точно и забележете „за да бидат точни, тие мора да се проверат со посебна алатка за броење“. Текст: [залепете текст овде]

2) Кандидати за колокација:

Предложете парови зборови (колокации) кои често се појавуваат заедно во текстот подолу. Наведете барем еден цитат од текстот за секој пар. Двојна измислица која нема еквивалент во текстот; Ако не сте сигурни, означете го како „потребна е потврда“. Текст: [залепи текст]

3) Споредба на вокабулар:

Ќе ви дадам два текста. За секој: приближно вкупни зборови, набљудувања за различни видови зборови и истакнати домени на зборови (на пр. боја, природа, емоции). Наведете дека бројките се приближни. Толкувањето на споредбата оставете го на мојата верификација. Текст А: [...] Текст Б: [...]

4) Толкување на резултатот:

Ги добив следниве резултати од алатка за броење: [залепи резултати]. Создадете 2-3 хипотези за тоа што би можеле да значат овие бројки лингвистички. Означете ја секоја хипотеза како „потребен е доказ“ и кажете ми како можам да ја тестирам. Избегнувајте прекумерни коментари.

Слаб промпт / Силен промпт

Слаб: „Кој збор најмногу се појавува во овој текст?

Силно: "Наведете ги најчестите зборови со содржина во овој текст со нивната приближна фреквенција; исклучете ги функционалните зборови. Обезбедете јасно дека бројките не се точни и треба да се потврдат со посебна алатка. Наведете пример реченица за секој збор."

Моќниот потсетник ја тера вештачката интелигенција да го прифати ограничувањето на броењето и однапред ви кажува дека е потребна потврда. Во слабиот промпт, вештачката интелигенција дава единствен број и не знаете дека може да биде погрешно.

Табела за мерење и доверливост

мерење

Што покажува

Сама вештачка интелигенција

правилен начин

фреквенција на зборови

чести зборови

За, ризично

Бројач + коментар за вештачка интелигенција

колокација

оние кои поминале заедно

Произведува кандидати

Потврда од текстот

Сооднос тип/токен

Вербална разновидност

Може да доведе до заблуда

Сметка со алатка

сезонска промена

Тренд со текот на времето

генерира хипотези

Измерете и проверете

Завршен коментар

Значење

Моќен, но претерува

човечко расудување

Клучен збор и n-грам концепти

Два концепта ја олеснуваат вашата работа во анализата на корпус. Првиот е клучниот збор (клучен збор на англиски - зборот што се појавува во текст или автор многу почесто од очекуваното во споредба со општиот јазик, давајќи му на тој текст својот „карактер“). Клучните зборови на авторот ги откриваат неговите интереси и стил; На пример, ако „море“ и „разделба“ се случуваат почесто од очекуваното кај поетот, оваа статистичка испакнатост станува почетна точка за толкување. За да се идентификуваат клучни зборови, неопходно е да се споредат фреквенциите на текстот со фреквенциите на референтниот корпус (општ, голем дел од текст што се користи за споредба); Оваа споредба е конечна работа со алатката, тоа е пресметка што вештачката интелигенција не може да ја направи веродостојно сама по себе.

Вториот е n-грам (низа од n последователни зборови во текстот; низа од два збора се нарекува „биграм“, низа од три збора се нарекува „триграм“). Анализата на N-грам ги открива формулираните изрази на авторот и често користените фрази. На пример, ако писателот исклучително често користи фрази како што се „вид“ или „сепак“, тоа укажува на неговата навика да прави реченици. ВИ може да ги предложи овие фрази како кандидати; но за вистинска фреквенција и статистичка значајност потребно е да се вратиме на алатката за броење.

Совет: Кажете ѝ на вештачката интелигенција: „Наведете ги значајните фрази (два или три збора) во овој текст како кандидати и дајте пример од текстот за секоја од нив“. Земете ја листата со кандидати и измерете ја вистинската фреквенција со посебна алатка. Поставете ја вештачката интелигенција како „забележувач“, агентот како „шалтер“ и себе си како „преведувач“.

Вообичаени грешки

  • Потпирајќи се на суровиот број на вештачката интелигенција. ВИ не е калкулатор; Потврдете го точниот број со посебна алатка.
  • Презентирање на бројот без коментар. „Помина 47 пати“ не кажува ништо; Вие го создавате значењето.
  • Игнорирање на должината на текстот. Стапките на лирска разновидност се чувствителни на должина.
  • Изработка на теза без проверка на колокацијата. Паровите кои не се АИ може да предложат; Потврдете од текстот.
  • Екстремен коментар. Не прифаќајте ги „причините“ предложени од вештачката интелигенција без докази.

Сумирано

Анализата на корпус го отвора броивиот аспект на литературата: фреквенција, колокација, речник, периодични промени. Вештачката интелигенција е моќна во оваа област во препознавање на обрасци и толкување на резултатите; но тоа е несигурно во апсолутно броење. Потврдете го бројот со посебната алатка, потврдете ги колокациите од текстот и сами утврдете го значењето на секој број. Бројот не е доказ, тој е вратата на доказите.

Задача за апликација

Изберете краток текст (500-1000 зборови). Идентификувајте збор со содржина (на пр. „ноќ“ или „пат“). Прво, пребројте се во текстот. Потоа нека ве брои вештачката интелигенција. Споредете ги двата резултати; Ако има разлика, истражете ја причината. Потоа напишете коментар од еден параграф за функцијата на тој збор во текстот — претворајќи го бројот во значење.

листа за проверка

  • [ ] Поставив јасно лингвистичко прашање.
  • [ ] Ги дефинирав границите на корпусот (текст, издание, точка).
  • [ ] Го потврдив броењето на вештачката интелигенција на втор начин.
  • [ ] Ги потврдив колокациите од текстот.
  • [ ] Не го оставив бројот без коментар; Сам го создадов значењето.