одиниці
1. Вступ до штучного інтелекту в турецькій мові та літературі: ролі, межі, перевірка, автентичність та етика 2. Аналіз тексту та уважне читання: аналіз поезії, оповідання та роману за допомогою ШІ 3. Лінгвістика та корпусний аналіз: Читання словника з числами 4. Стародавні тексти, спрощення та транслітерація: робота з османськими текстами та текстами диванів 5. Матеріали курсу та навчальний дизайн: результат, ефективність та вимірювання 6. Літературознавство та дослідження: Огляд, узагальнення та верифікація літератури 7. Редагування, коректура та набір: підготовка тексту до публікації 8. Співпраця людини та штучного інтелекту в творчому написанні та виробництві 9. Оцінка оригінальності, плагіату та текстів, написаних за допомогою ШІ 10. Дисципліна перевірки джерела, галюцинації та атрибуції 11. Людина в літературній інтерпретації: естетичне судження, етика, конфіденційність і кордони
одиниця 3 / 11

Лінгвістика та корпусний аналіз: Читання словника з числами

Прибуток:

  • Можливість створювати вимірювання корпусу, такі як частота слів, колокація, багатство словника та ключові слова за допомогою штучного інтелекту
  • Знаючи, що штучний інтелект ненадійний у точному підрахунку, і можливість перевірити кожен підрахунок за допомогою окремого інструменту
  • Здатність розуміти, що число само по собі нічого не говорить і що лінгвістична інтерпретація, яка встановлює значення, належить людям.

Літературознавство та вивчення мови — це не просто «коментар»; Він також має аспект вимірювання та підрахунку. Скільки різних слів використовує автор, які слова він любить використовувати з якими словами, які слова стають загальними в період - це досліджується за допомогою лінгвістики (науки, що вивчає звук, структуру, значення та використання мови) і особливо корпусної лінгвістики. Корпус — це збірка текстів, наприклад, повне зібрання творів автора, річний архів газети або вірші певного періоду. Аналіз корпусу шукає числові шаблони в цій частині.

У цьому розділі ми навчимося використовувати штучний інтелект як помічника в аналізі корпусу: швидко отримувати такі показники, як частота слів (кількість разів, коли слово зустрічається в тексті), співрозміщення (пари слів, які часто зустрічаються разом, наприклад, «чорний» + «моє багатство»), багатство словника та сезонні зміни. Але попередження з самого початку: штучний інтелект може робити помилки, коли рахує сам; Для великих і точних підрахунків потрібні спеціальні інструменти, а ви – лінгвіст, який визначає значення кожного числа.

Де ШІ сильний, а де слабкий в аналізі корпусу?

Його сильними сторонами є: розпізнавання шаблонів у невеликих і середніх текстах, генерація гіпотез щодо лексики тексту, пропонування кандидатів на слова, інтерпретація результату, опис методології. AI запитує: «Які фрази виділяються у цього автора?» Це дає швидкий початок запитання.

Слабкість: точний підрахунок. ШІ — це модель мови, а не калькулятор; може дати приблизну, а часом і невірну відповідь на запитання «скільки разів це повторювалося» у великому тексті. Для точної частоти, точної статистики спільного розташування або сканування великого корпусу з тисяч слів використовується спеціалізоване програмне забезпечення (наприклад, інструменти корпусу, такі як AntConc або електронна таблиця). ШІ є цінним для інтерпретації результатів цих інструментів; Але не змушуйте його рахувати наосліп.

Порада. Якщо вам потрібна точна цифра, скористайтеся двома способами: попросіть інструмент зробити підрахунок дрібним текстом і попросіть ШІ інтерпретувати його; Або отримати підрахунок ШІ та перевірити його іншим способом. Ніколи не використовуйте речення «ШІ сказав, що це повторюється 47 разів» без підтвердження.

Поетапне вивчення корпусу

  1. Поставте запитання. «Як у цього поета розподілені кольорові слова?» Підрахунок не має сенсу без чіткого запитання на зразок:
  2. Дайте визначення корпусу. Які тексти? Яке видання? який період? Кордон має бути чітким.
  3. Виберіть вимірювання. Частотність, словосполучення, багатство словника?
  4. Виміряйте та перевірте. Зробіть підрахунок, а потім підтвердьте другий спосіб.
  5. коментар. Сама по собі цифра нічого не говорить; Саме ваш коментар робить висновок про те, що «колірні слова подвоєні у другому періоді» має значення.

Часто використовуваним показником насиченості словника є відношення кількості різних слів до загальної кількості слів (співвідношення тип/лексема). Якщо цей коефіцієнт високий, текст багатослівний, а якщо низький, то він повторюється. Але на це співвідношення впливає довжина тексту; Будьте обережні, безпосередньо порівнюючи короткі та довгі тексти.

три міні-чохла

Випадок 1 — Колокація продемонструвала стиль. Дослідник розглянув прикметниково-іменникові пари у 3 романах прозаїка. ШІ припустив, що слово «блідий» відповідає 5 різним іменникам; Дослідник перевірив 4 тексти та виключив 1 як сфабрикований. Утвердженою закономірністю стала теза про манеру опису автора.

Випадок 2 — Виявлено помилку підрахунку. Студент запитав ШІ, скільки разів слово «ніч» з’явилося в тексті з 2000 слів; ШІ сказав «23». Коли студент перекинув текст в електронну таблицю і порахував його, фактичне число було 17. Стало зрозуміло, що необроблений підрахунок ШІ є ненадійним.

Випадок 3 — Періодичні зміни викликали суперечки. Одна група порівнювала частку абстрактних слів у ранніх і пізніх віршах поета. Перший проект ШІ запропонував тенденцію; Коли група повернулася до тексту та перевірила підрахунок, тенденція виявилася реальною, але «причини», запропоновані штучним інтелектом, були спекуляціями, які неможливо перевірити, і їх було усунено.

Чотири шаблони, які можна копіювати

1) Схема частоти слів (з перевіркою):

Перелічіть 15 слів змісту, які найчастіше зустрічаються (за винятком службових слів, таких як сполучники та прийменники) у тексті нижче, з їхньою приблизною частотою. ПОПЕРЕДЖЕННЯ. Зауважте, що підрахунки МОЖУТЬ НЕ бути точними, і зауважте, що "щоб бути точними, їх потрібно перевірити за допомогою окремого підрахунку". Текст: [вставте текст тут]

2) Кандидати на розміщення:

Запропонуйте пари слів (сполучення), які часто зустрічаються разом у наведеному нижче тексті. До кожної пари наведіть хоча б одну цитату з тексту. Подвійна фабрикація, яка не має відповідника в тексті; Якщо ви не впевнені, позначте це як «потребує перевірки». Текст: [вставити текст]

3) Порівняння лексики:

Я дам вам два тексти. Для кожного: приблизна загальна кількість слів, спостереження щодо різних різновидів слів і визначні домени слів (наприклад, колір, природа, емоції). Зазначте, що цифри приблизні. Інтерпретацію порівняння залиште на мою перевірку. Текст A: [...] Текст B: [...]

4) Інтерпретація результату:

Я отримав такі результати від інструменту підрахунку: [вставити результати]. Сформулюйте 2-3 гіпотези про те, що ці числа можуть означати мовно. Позначте кожну гіпотезу як «потребує доказів» і скажіть, як я можу її перевірити. Уникайте надмірних коментарів.

Слабка підказка / Сильна підказка

Слабкий: "Яке слово найчастіше зустрічається в цьому тексті?"

Сильно: «Перелічіть слова, які найчастіше зустрічаються в цьому тексті, із їхньою приблизною частотою; виключіть службові слова. Поясніть, що цифри не точні та потребують перевірки за допомогою окремого інструменту. Наведіть приклад речення для кожного слова».

Потужна підказка змушує штучний інтелект прийняти обмеження на кількість і заздалегідь повідомляє вам, що потрібна перевірка. У слабкій підказці AI видає одне число, і ви не знаєте, що воно може бути неправильним.

Таблиця вимірювань і надійності

вимірювання

Що показує

AI один

правильний шлях

частота слів

часті слова

О, ризиковано

Лічильник + коментар ШІ

колокація

ті, що пройшли разом

Готує кандидатів

Підтвердження з тексту

Співвідношення тип/токен

Вербальне різноманіття

Може ввести в оману

Обліковий запис з інструментом

сезонна зміна

Тенденція з часом

генерує гіпотези

Виміряйте та перевірте

Заключний коментар

Значення

Потужний, але перебільшує

людське судження

Поняття ключового слова та n-грами

Дві концепції полегшують вашу роботу в аналізі корпусу. Перше — це ключове слово (ключове слово англійською мовою — слово, яке зустрічається в тексті або авторі набагато частіше, ніж очікувалося, порівняно із загальною мовою, надаючи цьому тексту його «характер»). Ключові слова автора розкривають його інтереси та стиль; Наприклад, якщо «море» і «розлука» трапляються у поета частіше, ніж очікувалося, цей статистичний виступ стає відправною точкою для інтерпретації. Щоб ідентифікувати ключові слова, необхідно порівняти частоти тексту з частотами еталонного корпусу (загальний великий текст, який використовується для порівняння); Це порівняння — це остаточна робота інструменту, це обчислення, які ШІ не може зробити надійно самостійно.

Друга — n-грама (послідовність із n послідовних слів у тексті; послідовність із двох слів називається «біграмою», послідовність із трьох слів — «триграмою»). N-грамний аналіз виявляє авторські шаблонні вислови та часто вживані фрази. Наприклад, якщо письменник дуже часто вживає такі фрази, як «начебто» або «проте», це свідчить про його звичку складати речення. AI може запропонувати ці фрази як кандидати; але для справжньої частоти та статистичної значущості необхідно повернутися до інструменту підрахунку.

Підказка: скажіть ШІ: «Перелічіть помітні фрази (два-три слова) у цьому тексті як кандидати та наведіть приклад із тексту для кожної». Візьміть список кандидатів і виміряйте фактичну частоту за допомогою окремого інструменту. Розташуйте ШІ як «помітника», агента як «лічильника», а себе як «інтерпретатора».

Поширені помилки

  • Покладаючись на вихідний підрахунок штучного інтелекту. AI не є калькулятором; Перевірте точне число за допомогою окремого інструменту.
  • Надаю номер без коментарів. «Пройшов 47 разів» нічого не говорить; Ви створюєте сенс.
  • Ігнорування довжини тексту. Швидкість різноманітності тексту залежить від тривалості.
  • Оформлення дипломної роботи без перевірки словосполучення. Пари без ШІ можуть запропонувати; Підтвердьте з тексту.
  • Екстремальний коментар. Не приймайте «причини», запропоновані ШІ без доказів.

Підсумовуючи

Корпусний аналіз відкриває лічильну грань літератури: частотність, словосполучення, лексику, періодичну зміну. ШІ є потужним у цій галузі, розпізнаючи закономірності та інтерпретуючи результати; але це ненадійно в абсолютному підрахунку. Перевірте число окремим інструментом, підтвердьте словосполучення з тексту та самостійно встановіть значення кожного числа. Число - це не доказ, це двері до доказів.

Аплікаційне завдання

Виберіть короткий текст (500-1000 слів). Визначте слово змісту (наприклад, «ніч» або «дорога»). По-перше, порахуйте себе в тексті. Потім попросіть ШІ підрахувати це. Порівняйте два результати; Якщо є різниця, дослідіть причину. Потім напишіть коментар з одного абзацу про функцію цього слова в тексті — перетворення числа на значення.

контрольний список

  • [ ] Я поставив чітке лінгвістичне запитання.
  • [ ] Я визначила межі корпусу (текст, видання, період).
  • [ ] Я перевірив підрахунок ШІ другим способом.
  • [ ] Я підтвердив словосполучення з тексту.
  • [ ] Я не залишив номер без коментарів; Сенс створив я сам.