Единица 8 / 12

Контент-анализ и обнаружение шаблонов

Прибыль:

  • Способность извлекать шаблоны из больших наборов текста, используя такие методы, как NER, извлечение взаимосвязей, временную шкалу и сетевой анализ.
  • Способность рассматривать закономерность как гипотезу, а не как доказательство, связывая объекты с источником и нормализуя их с одобрения человека.
  • Способность понимать, как цифры могут вводить в заблуждение из-за отсутствия данных и систематической ошибки выборки, а также избегать надуманных связей и хронологий.

Исторические исследования – это не просто чтение отдельных документов; часто ищет закономерности в больших наборах документов. В каких контекстах то или иное имя появляется на протяжении многих лет? Какие люди связаны с поселением? Как тема меняется со временем? Кто с кем переписывается? Такие вопросы требуют рассмотрения не одного документа, а сотен документов в совокупности. Это часто называют цифровыми гуманитарными науками — применением вычислительных методов в таких областях, как история и литература.

ИИ способен извлекать структурированную информацию из больших наборов текста. В этом модуле вы изучите NER (распознавание именованных объектов), извлечение шаблонов и связей, логику тематического моделирования и создание временной шкалы; но мы также обсудим самую опасную ловушку этих методов — ИИ, представляющий себя «нашедшим» несуществующую закономерность.

Основные техники

  • NER (распознавание именованных объектов): автоматическое извлечение из текста таких объектов, как человек, место, учреждение, дата. Он создает список типа «Все географические названия, упомянутые в этих 500 документах» за считанные минуты.
  • Вывод об отношениях: Маркировка связей между сущностями («Человек X в месте Y», «А соответствует Б»).
  • Тематическое моделирование: статистический поиск кластеров повторяющихся тем в большом наборе текста. Он показывает, какие темы в какой период сконцентрированы.
  • Вывод временной шкалы: расположение датированных событий в документах в хронологическом порядке.
  • Сетевой анализ: визуализация межличностных/институциональных отношений как сети (кто является центром, кто является точкой соединения).

Общая цель всего этого — выявить структуры, которые встречаются не в одном документе, а во всей коллекции. Эти методы создают видимые закономерности, которые невозможно увидеть при простом чтении. Но каждое из них есть «знак», а не «доказательство»; Очень важно проверить то, что содержится в исходном документе.

Часто используемым понятием в этой области является различие между чтением вблизи (глубокое чтение текста, строка за строкой) и чтением на расстоянии (рассмотрение сотен/тысяч текстов коллективно, статистически). ИИ позволяет читать удаленно: вы видите закономерности в корпусе, достаточно большом, чтобы его хватило на одну человеческую жизнь. Но когда дистанционное чтение указывает на закономерность, необходимо вернуться к внимательному чтению, то есть к исходному документу, чтобы разобраться в нем. Эти два метода не являются взаимозаменяемыми; Один показывает узор, другой дает его значение. Наиболее надежные исследования используют оба вместе.

Совет: используйте анализ закономерностей в качестве генератора гипотез: «ИИ заметил здесь закономерность, она реальна?» Затем проверьте этот шаблон в документах один за другим. Модель — это отправная точка вашего исследования, а не результат.

Рабочий процесс: шаг за шагом

1. Уточните вопрос. «Какие люди чаще всего появляются вместе в этом сборнике?» Четкий шаблонный вопрос вроде.

2. Подготовьте и маркируйте данные. Организуйте текст со ссылками на источники, чтобы любые найденные ресурсы можно было связать с документом.

3. Появится объект/шаблон. Создайте NER, схему отношений или временную шкалу с помощью ИИ.

4. Нормализовать. Комбинируйте разные варианты написания одного и того же человека/места («Стамбул/Стамбул/Константинийе» – одно и то же место?). Этот шаг имеет решающее значение; Если его опустить, узор развалится.

5. Проверьте документ. Проверьте фактические документы на наличие отмеченных существенных закономерностей. Убедитесь, что ИИ не добавляет вымышленную ссылку.

6. Комментарий. Образец означает суждение историка; ИИ просто отмечает шаблон.

Ловушка чисел и статистики

Анализ шаблонов часто дает цифры: «имя X встречается 47 раз», «эта тема присутствует в 30% документов». Эти цифры кажутся объективными, но могут вводить в заблуждение:

  • Отсутствующие данные: Если коллекция уже неполная (документы утеряны, группа никогда не фиксировалась), количество отражает сохранившиеся документы, а не реальность.
  • Ошибка нормализации: если одно и то же лицо пишется по-разному и учитывается отдельно, число будет неправильным.
  • Потеря контекста: «происходит 47 раз» ни о чем не говорит; Важно то, как оно передается (положительное/негативное, субъект/объект).

вывод шаблона

очевидное значение

реальный риск

«X встречается 47 раз»

важный человек

Неполный сборник, вариант написания.

«Тема 30%»

доминирующая тема

смещение выборки

«А-Б часто вместе»

интимные отношения

Совпадение, отсутствие контекста

"хронология"

точная хронология

Недатированные документы, сфабрикованный приказ

три мини-кейса

Случай 1. Сетевой анализ выявил скрытого посредника. Исследователь изучил коллекцию корреспонденции из 800 писем. С ИИ определялось кто кому писал и создавалась сеть. Сеть показала, что кажущийся на первый взгляд незначительным человек на самом деле был ключевой точкой соприкосновения между двумя группами. Исследователь сосредоточился на письмах этого человека и пришел к новому выводу. Но сначала проверил все ссылки в документах.

Случай 2 — ошибка нормализации повредила число. Студент попросил их посчитать, сколько раз то или иное место встречается в документах. Поскольку ИИ посчитал три разных написания одного и того же места отдельно, число оказалось равным трети реального числа. Когда написания были объединены, место фактически оказалось на третьей наиболее часто встречающейся позиции. Урок: без нормализации числу нельзя доверять.

Случай 3 — Выдуманный график. Исследователь создал временную шкалу на основе недатированных документов. ИИ расположил неизвестные события в «логическом» порядке и представил точную хронологию. Однако в документах этой последовательности не было, ее придумал ИИ. Урок: таймлайн строится только из событий, имеющих дату в документе; остальное остается «недатированным».

Четыре копируемых шаблона

1) NER (вывод сущности):

Лица, места, учреждения и даты, упомянутые в документах ниже, представлены в виде ОТДЕЛЬНЫХ списков. Укажите, в каком документе (справке) упоминается каждый субъект. Берите только то, что ПОНЯТНО указано в тексте; добавить наугад. Отметьте [?], если не уверены в произношении. Документы: [здесь]

2) Нормализация сущности:

В приведенном ниже списке объектов сгруппируйте различные варианты написания, которые могут относиться к одному и тому же человеку/месту (например, «Стамбул / Константинийе»). Предложите возможный общий формат для каждой группы, НО не навязывайте точную комбинацию; Добавить пометку «Может быть то же самое, пусть люди проверят». Оставьте это в покое, если вы не уверены. Список: [здесь]

3) Схема взаимоотношений/сети:

Извлеките ссылки «кто с кем связан» из следующего набора переписки/документов. Для каждой ссылки укажите, на каком документе (ссылке) она основана. СОСТАВИЛИ взаимосвязь, которая НЕ ЯВНО отражена в документе. Отметьте неоднозначные ссылки [неразборчиво]. Документация: [здесь]

4) Датированный график:

Перечисляйте в хронологическом порядке только события, ЧЕТКО изложенные в следующих документах; Свяжите каждое событие с его источником. Перечислите события с неопределенными датами отдельно под заголовком «без даты», НЕ располагайте их по порядку. НЕ выдумывайте предполагаемую дату. Документация: [здесь]

Слабая подсказка / Сильная подсказка

Слабый:

Проанализируйте эти документы и выделите важные закономерности, взаимосвязи и сроки.

«Извлечение важных закономерностей» подталкивает ИИ изобретать несуществующие связи и точные хронологии, представляя числа без нормализации.

Сильный:

Извлекает сущности человека/места/учреждения из следующих документов, соединяя каждую из них со ссылкой на документ. Отметьте разные варианты написания, которые могут совпадать со словом «может быть объединено», но не объединяйте их. Взаимоотношения, которые четко не указаны в документе, и события с неопределенными датами НЕ ПОДДЕЛЫВАЙТЕ; храните те, у кого нет дат, отдельно. Документация: [здесь]

Разница: отнесение к источнику, оставление нормализации на усмотрение людей, запрет на вымышленные связи/историю и разделение недатированных событий делают эту модель оправданной.

Распространенные ошибки

  • Принятие образца за доказательство. Модель — это гипотеза; подтверждается документом.
  • Пропуск нормализации. Разное написание одной и той же сущности искажает число и сеть.
  • Слепое доверие цифрам. Неполный сбор и систематическая ошибка выборки приводят к тому, что цифры вводят в заблуждение.
  • Выдуманная временная шкала. Недатированные события не включаются в хронологию.
  • Игнорирование контекста. Важно не «сколько раз это было принято», а «как это было принято».

В итоге

Контент-анализ и обнаружение шаблонов — это мощная область, в которой ИИ создает видимые структуры, которые невозможно увидеть при простом чтении: извлечение сущностей, сети отношений, тематические кластеры, временные шкалы. Но каждая закономерность — это гипотеза, а не доказательство. Связывайте ресурсы с источником, тщательно нормализуйте и проверяйте людьми, запрашивайте цифры на предмет отсутствующих данных и предвзятости, избегайте надуманных связей и хронологий. ИИ отмечает узор; Что это значит и правдиво ли это – судить историка.

Задача приложения

Соберите не менее 15 документов (со ссылками). Извлеките человека и поместите сущности с помощью шаблона «NER». Затем сгруппируйте различные варианты написания с помощью «нормализации сущностей» и проверьте группы самостоятельно. Наконец, запустите шаблон «датированной временной шкалы» и посмотрите, сколько событий осталось «недатированными». Сравните, сколько придуманных ссылок или хронологий выдал бы ИИ при плохой подсказке.

контрольный список

  • [ ] Я четко определил свой шаблонный вопрос.
  • [ ] У меня есть каждая сущность, связанная со ссылкой на документ.
  • [ ] Я нормализовал типизацию сущностей и объединил ее с одобрением человека.
  • [ ] Я усомнился в цифрах из-за отсутствия данных и предвзятости.
  • [ ] Я не раскладывал недатированные события в хронологию, хранил их отдельно.