Единицы
1. Введение в искусственный интеллект в турецком языке и литературе: роли, границы, проверка, подлинность и этика 2. Анализ текста и внимательное чтение: анализ поэзии, рассказа и романа с помощью ИИ 3. Лингвистика и корпусный анализ: чтение словарного запаса с помощью чисел 4. Древние тексты, упрощение и транслитерация: работа с османскими и диванными текстами 5. Материалы курса и дизайн обучения: результат, эффективность и измерение 6. История литературы и исследования: обзор литературы, синтез и проверка 7. Редактирование, корректура и верстка: подготовка текста к публикации 8. Сотрудничество человека и искусственного интеллекта в писательстве и производстве 9. Оценка оригинальности, плагиата и текстов, написанных с помощью ИИ 10. Проверка источника, дисциплина галлюцинаций и атрибуции 11. Человек в литературной интерпретации: эстетическое суждение, этика, конфиденциальность и границы
Единица 3 / 11

Лингвистика и корпусный анализ: чтение словарного запаса с помощью чисел

Прибыль:

  • Способность составлять измерения корпуса, такие как частота слов, словосочетание, богатство словарного запаса и ключевые слова, с помощью искусственного интеллекта.
  • Зная, что искусственный интеллект ненадежен в точном подсчете и возможности проверять каждый подсчет с помощью отдельного инструмента
  • Способность понимать, что число само по себе ничего не говорит и что лингвистическая интерпретация, устанавливающая значение, принадлежит людям.

Литература и языкознание — это не просто «комментарии»; Оно также имеет измеримый и исчисляемый аспект. Сколько разных слов использует автор, какие слова с какими словами он любит употреблять, какие слова становятся общими в определенный период – это исследуется посредством лингвистики (науки, изучающей звучание, структуру, значение и употребление языка) и особенно корпусной лингвистики. Корпус — это собрание текстов, например полное собрание сочинений автора, годовой архив газеты или стихи определенного периода. Корпусный анализ ищет числовые закономерности в этом фрагменте.

В этом модуле мы научимся использовать ИИ в качестве помощника по корпусному анализу: быстро извлекать такие показатели, как частота слов (количество раз слово встречается в тексте), словосочетание (пары слов, которые часто встречаются вместе, например, «черный» + «моя удача»), богатство словарного запаса и сезонные вариации. Но предупреждение с самого начала: ИИ может ошибаться при счете в одиночку; Для больших и точных подсчетов необходимы специальные инструменты, и вы — лингвист, который устанавливает значение каждого числа.

В чем силен ИИ, а где слаб в корпусном анализе?

Его сильные стороны: распознавание закономерностей в текстах небольшого и среднего размера, выработка гипотез о словарном запасе текста, предложение кандидатов на словосочетания, интерпретация результата, описание методологии. ИИ спрашивает: «Какие фразы выделяются у этого автора?» Это дает быстрое начало вопроса.

Слабость: Точный подсчет. ИИ — это языковая модель, а не калькулятор; может дать приблизительный, а иногда и неверный ответ на вопрос «сколько раз это происходило» в длинном тексте. Для точной частоты, точной статистики колокации или сканирования большого корпуса из тысяч слов используется специализированное программное обеспечение (например, инструменты для корпуса, такие как AntConc или электронные таблицы). ИИ полезен для интерпретации результатов этих инструментов; Но не заставляйте его делать необработанный подсчет вслепую.

Совет: если вам нужно точное число, воспользуйтесь двумя способами: попросите инструмент выполнить подсчет мелким текстом, а ИИ интерпретирует его; Или пусть ИИ посчитает и проверит другим способом. Никогда не используйте предложение «ИИ сказал, что это встречается 47 раз» без подтверждения.

Пошаговое корпусное исследование

  1. Задайте вопрос. «Как распределены цветные слова у этого поэта?» Подсчет бессмысленен без четкого вопроса типа:
  2. Дайте определение корпусу. Какие тексты? Какое издание? Какой период? Граница должна быть четкой.
  3. Выберите измерение. Частота, словосочетание, богатство словарного запаса?
  4. Измерьте и проверьте. Сделайте подсчет, а затем подтвердите второй способ.
  5. Комментарий. Одно только число ничего не говорит; Именно ваш комментарий придает смысл выводу о том, что «цветные слова удвоились во втором периоде».

Часто используемым показателем богатства словарного запаса является отношение количества различных слов к общему количеству слов (соотношение тип/токен). Если это соотношение высокое, текст многословный, а если низкое, то он повторяющийся. Но на это соотношение влияет длина текста; Будьте осторожны при прямом сравнении коротких и длинных текстов.

три мини-кейса

Случай 1. Коллокация продемонстрировала стиль. Исследователь изучил пары прилагательное-существительное в трех романах писателя. ИИ предположил, что слову «бледный» соответствует 5 разных существительных; Исследователь проверил 4 текста и исключил 1 как сфабрикованный. Подтвержденная закономерность стала тезисом об изобразительном стиле автора.

Случай 2 — Обнаружена ошибка подсчета. Студент спросил AI, сколько раз слово «ночь» встречается в тексте из 2000 слов; ИИ сказал «23». Когда студент занес текст в электронную таблицу и посчитал, фактическое число составило 17. Стало ясно, что необработанный подсчет ИИ ненадежен.

Случай 3. Периодические изменения вызвали споры. Одна группа сравнила долю абстрактных слов в ранних и поздних стихах поэта. Первый проект ИИ предполагал наличие тенденции; Когда группа вернулась к тексту и проверила подсчеты, тенденция оказалась реальной, но «причины», предложенные ИИ, были непроверяемыми предположениями и были устранены.

Четыре копируемых шаблона

1) Схема частотности слов (с проверкой):

Перечислите 15 наиболее часто встречающихся содержательных слов (исключая служебные слова, такие как союзы и предлоги) в тексте ниже, указав их приблизительную частоту. ВНИМАНИЕ: Обратите внимание, что подсчеты МОГУТ НЕ быть точными, и обратите внимание: «чтобы быть точными, их необходимо проверять с помощью отдельного инструмента подсчета». Текст: [вставьте текст сюда]

2) Кандидаты на колокейшн:

Предложите пары слов (сочетаний), которые часто встречаются вместе в тексте ниже. Приведите хотя бы одну цитату из текста для каждой пары. Двойная выдумка, не имеющая аналогов в тексте; Если вы не уверены, отметьте его как «требует проверки». Текст: [вставить текст]

3) Словарное сравнение:

Я дам вам два текста. Для каждого: приблизительное общее количество слов, наблюдения по поводу различных разновидностей слов и известных словесных областей (например, цвет, природа, эмоции). Уточните, что цифры приблизительные. Оставьте интерпретацию сравнения моей проверке. Текст А: [...] Текст Б: [...]

4) Интерпретация результатов:

Я получил следующие результаты с помощью инструмента подсчета: [вставить результаты]. Выскажите 2–3 гипотезы о том, что эти цифры могут означать с лингвистической точки зрения. Отметьте каждую гипотезу как «требует доказательств» и скажите мне, как я могу ее проверить. Избегайте чрезмерных комментариев.

Слабая подсказка / Сильная подсказка

Слабый: «Какое слово чаще всего встречается в этом тексте?»

Сильный: «Перечислите наиболее часто встречающиеся содержательные слова в этом тексте с указанием их приблизительной частоты; исключите служебные слова. Дайте понять, что цифры не точны и их необходимо проверить с помощью отдельного инструмента. Приведите пример предложения для каждого слова».

Мощная подсказка заставляет ИИ принять ограничение количества и заранее сообщает вам, что требуется проверка. В слабой подсказке ИИ дает одно число и вы не знаете, что оно может быть неправильным.

Таблица измерений и надежности

измерение

Что показывает

только ИИ

правильный путь

частота слов

частые слова

О, рискованно

Счетчик + комментарий AI

колокейшн

те, кто прошли вместе

Подготавливает кандидатов

Подтверждение из текста

Соотношение тип/токен

Вербальное разнообразие

Может вводить в заблуждение

Аккаунт с инструментом

сезонное изменение

Тенденция с течением времени

генерирует гипотезы

Измерьте и проверьте

Заключительный комментарий

Значение

Мощно, но преувеличивает

человеческое суждение

Концепции ключевых слов и n-грамм

Две концепции облегчают вашу работу при корпусном анализе. Первый — это ключевое слово (ключевое слово в английском языке — слово, которое встречается в тексте или у автора гораздо чаще, чем ожидалось, по сравнению с общим языком, придавая этому тексту «характер»). Ключевые слова автора раскрывают его интересы и стиль; Например, если «море» и «разлука» встречаются у поэта чаще, чем ожидалось, этот статистический выступ становится отправной точкой интерпретации. Для выявления ключевых слов необходимо сравнить частоты текста с частотами эталонного корпуса (общего большого массива текста, используемого для сравнения); Это сравнение — окончательная инструментальная работа, это расчет, который ИИ не может выполнить самостоятельно.

Второй — n-грамма (последовательность из n последовательных слов в тексте; последовательность из двух слов называется «биграммой», последовательность из трех слов — «триграммой»). N-граммный анализ выявляет шаблонные выражения и часто употребляемые фразы автора. Например, если писатель очень часто использует такие фразы, как «вид» или «однако», это указывает на его привычку составлять предложения. ИИ может предложить эти фразы в качестве кандидатов; но для истинной частоты и статистической значимости необходимо вернуться к инструменту подсчета.

Подсказка: скажите ИИ: «Перечислите примечательные фразы (два или три слова) в этом тексте в качестве кандидатов и приведите для каждой пример из текста». Возьмите список кандидатов и измерьте фактическую частоту с помощью отдельного инструмента. Позиционируйте ИИ как «наблюдателя», агента как «счетчика», а себя как «интерпретатора».

Распространенные ошибки

  • Опираясь на необработанные данные ИИ. ИИ — это не калькулятор; Проверьте точное число с помощью отдельного инструмента.
  • Представляем цифру без комментариев. «Прошел 47 раз» ни о чем не говорит; Вы создаете смысл.
  • Игнорирование длины текста. Уровень лирического разнообразия чувствителен к длине.
  • Выполнение тезиса без проверки словосочетания. Пары, не страдающие искусственным интеллектом, могут предложить; Подтвердите из текста.
  • Экстремальный комментарий. Не принимайте бездоказательные «причины», предложенные ИИ.

В заключение

Корпусный анализ открывает счетную грань литературы: частотность, словосочетание, словарный запас, периодическое изменение. ИИ обладает мощными возможностями в этой области в распознавании закономерностей и интерпретации результатов; но это ненадежно при абсолютном подсчете. Проверьте число с помощью отдельного инструмента, подтвердите словосочетания из текста и сами установите значение каждого числа. Число — это не доказательство, это дверь к доказательствам.

Задача приложения

Выберите короткий текст (500-1000 слов). Определите содержательное слово (например, «ночь» или «дорога»). Сначала посчитайте себя в тексте. Затем пусть ИИ посчитает это. Сравните два результата; Если есть разница, выясните причину. Затем напишите комментарий в один абзац о функции этого слова в тексте — превращении числа в значение.

контрольный список

  • [ ] Я поставил четкий лингвистический вопрос.
  • [ ] Я определил границы корпуса (текст, издание, период).
  • [ ] Я проверил подсчет ИИ вторым способом.
  • [ ] Я подтвердил словосочетания из текста.
  • [ ] Номер я не оставил без комментария; Смысл я создал сам.