одиниця 8 / 12

Аналіз вмісту та виявлення шаблонів

Прибуток:

  • Можливість витягувати шаблони з великих наборів тексту за допомогою таких методів, як NER, вилучення взаємозв’язків, хронологія та аналіз мережі
  • Можливість розглядати шаблон як гіпотезу, а не доказ, пов’язувати сутності з джерелом і нормалізувати їх із схвалення людини
  • Здатність зрозуміти, як числа можуть вводити в оману через відсутність даних і зміщення вибірки, а також уникати надуманих зв’язків і хронологій.

Історичне дослідження полягає не лише в читанні окремих документів; часто шукають шаблони у великих наборах документів. У яких контекстах певне ім’я з’являється протягом багатьох років? Які люди пов’язані з поселенням? Як тема змінюється з часом? Хто з ким листується? Такі питання вимагають перегляду не одного документа, а сотень документів разом. Це часто називають цифровими гуманітарними науками — застосування обчислювальних методів до таких галузей, як історія та література.

AI є потужним інструментом для отримання структурованої інформації з великих наборів тексту. У цьому розділі ви дізнаєтесь про NER (розпізнавання іменованих об’єктів), вилучення шаблонів і зв’язків, логіку моделювання теми та створення шкали часу; але ми також обговоримо найнебезпечніший підводний камінь цих методів — штучний інтелект представляє себе таким, що «знайшов» шаблон, якого не існує.

Основні прийоми

  • NER (Named Entity Recognition): автоматичне виділення з тексту таких сутностей, як особа, місце, установа, дата. Він за лічені хвилини створює список на зразок «Усі назви місць, згадані в цих 500 документах».
  • Висновок про зв’язок: позначення зв’язків між сутностями («Особа X на місці Y», «A відповідає B»).
  • Моделювання тем: статистичний пошук кластерів повторюваних тем у великому наборі тексту. Він показує, які теми зосереджені в якому періоді.
  • Висновок на шкалі часу: упорядкування датованих подій у документах у хронологічному порядку.
  • Аналіз мережі: Візуалізація міжлюдських/інституційних відносин як мережі (хто є центром, хто є точкою зв’язку).

Загальна мета всіх них полягає в тому, щоб виявити структури, які не з’являються в одному документі, але з’являються в усій колекції. Ці методи створюють видимі візерунки, які ніколи не можна було б побачити, лише читаючи. Але кожна з них є «знаком», а не «доказом»; Важливо перевірити те, що міститься в оригінальному документі.

Часто вживаним поняттям у цій галузі є розрізнення між уважним читанням (поглиблене читання тексту, рядок за рядком) і віддаленим читанням (перегляд сотень/тисяч текстів разом, статистично). ШІ дає змогу дистанційно читати: ви бачите шаблони в корпусі, достатньо великому, щоб вистачило на одне людське життя. Але коли дистанційне читання вказує на шаблон, необхідно повернутися до близького читання, тобто до оригінального документа, щоб осмислити його. Ці два методи не є взаємозамінними; Один показує візерунок, інший дає його значення. Найнадійніше дослідження використовує обидва разом.

Порада. Використовуйте аналіз шаблонів як генератор гіпотез: «ШІ помітив тут шаблон, це реально?» Потім перевірте цей шаблон у документах один за іншим. Зразок є відправною точкою вашого дослідження, а не результатом.

Хід роботи: крок за кроком

1. Уточніть питання. «Які люди найчастіше з’являються разом у цій колекції?» Питання з чітким шаблоном, наприклад.

2. Підготуйте та позначте дані. Упорядкуйте текст із посиланнями на джерело, щоб будь-які знайдені ресурси можна було зв’язати з документом.

3. З’являється сутність/шаблон. Створюйте NER, стосунки або графік за допомогою ШІ.

4. Нормалізувати. Поєднайте різні варіанти написання однієї особи/місця («Стамбул / Стамбул / Костантинії» те саме місце?). Цей крок є критичним; Якщо його опустити, візерунок розпадеться.

5. Перевірте в документі. Перевірте фактичні документи на наявність позначених значущих шаблонів. Переконайтеся, що ШІ не додає вигадане посилання.

6. Прокоментуйте. Що означає шаблон, це судження історика; ШІ лише позначає шаблон.

Пастка чисел і статистики

Аналіз шаблонів часто дає цифри: «ім’я X зустрічається 47 разів», «ця тема присутня в 30% документів». Ці цифри здаються об’єктивними, але можуть ввести в оману:

  • Відсутні дані: якщо колекція вже неповна (документи втрачено, група ніколи не була записана), число відображає збережені документи, а не реальність.
  • Помилка нормалізації: якщо одна й та сама особа пишеться по-різному та рахується окремо, число буде неправильним.
  • Втрата контексту: «зустрічається 47 разів» нічого не говорить; Важливо те, як воно передається (позитив/негатив, суб’єкт/об’єкт).

вихід шаблону

явне значення

реальний ризик

"X зустрічається 47 разів"

важлива особа

Неповне зібрання, варіація написання

"Тема 30%"

домінуюча тема

зміщення вибірки

«А-Б часто разом»

інтимні стосунки

Збіг, відсутність контексту

"хронологія"

точна хронологія

Недатовані документи, сфабриковане замовлення

три міні-чохла

Випадок 1. Аналіз мережі виявив прихованого посередника. Дослідник оглянув колекцію листування з 800 листів. З ШІ визначали, хто кому писав і створювали мережу. Мережа показала, що на перший погляд незначна особа насправді була ключовою точкою контакту між двома групами. Дослідник зосередився на листах цієї людини і дійшов нового висновку. Але спочатку перевірив усі посилання в документах.

Випадок 2 — помилка нормалізації пошкодила номер. Студент попросив їх порахувати, скільки разів місце з’явилося в документах. Оскільки штучний інтелект підрахував три різні варіанти написання одного і того ж місця окремо, число виявилося третиною від реального числа. Коли варіанти написання були об’єднані, місце було фактично на третій позиції, яка найчастіше зустрічається. Урок: без нормалізації числу не можна довіряти.

Випадок 3 — Складений графік. Дослідник створив хронологію з недатованих документів. ШІ розташував невідомі події в «логічному» порядку та представив точну хронологію. Однак цієї послідовності не було в документах, її вигадав ШІ. Урок: шкала часу будується лише з подій, які мають дату в документі; решта залишається «без дати».

Чотири шаблони, які можна копіювати

1) NER (виведення сутності):

Особи, місця, установи та дати, згадані в документах нижче, представлені ОКРЕМИМИ списками. Вкажіть, у якому документі (довідці) йдеться про кожну юридичну особу. Беріть лише те, що ЧІТКО зазначено в тексті; додати відгадку. Позначте [?], якщо ви не впевнені у вимові. Документи: [тут]

2) Нормалізація сутності:

У наведеному нижче списку об’єктів згрупуйте різні варіанти написання, які можуть означати ту саму особу/місце (наприклад, «Стамбул / Костянтинії»). Запропонуйте можливий спільний формат для кожної групи, АЛЕ не нав’язуйте точну комбінацію; Додайте примітку "можливо те саме, нехай люди перевірять". Залиште це, якщо ви не впевнені. Список: [тут]

3) Схема стосунків/мережі:

Витягніть посилання «хто з ким пов’язаний» із наведеного нижче набору листування/документів. Для кожного посилання вкажіть, на основі якого документа (довідки) воно створено. ВИГОДУВАЛИ зв’язок, якого ЧІТКО не вказано в документі. Позначити неоднозначні посилання [нечіткі]. Документація: [тут]

4) Датована хронологія:

Перелічіть у хронологічному порядку лише події, ЧІТКО викладені в наведених нижче документах; Пов’яжіть кожну подію з її джерелом. Події з невизначеними датами перелічіть окремо під заголовком «без дати», НЕ розташовуйте їх по порядку. НЕ придумуйте орієнтовну дату. Документація: [тут]

Слабка підказка / Сильна підказка

Слабкий:

Проаналізуйте ці документи та виділіть важливі шаблони, зв’язки та часові рамки.

«Вилучення важливих закономірностей» спонукає ШІ винаходити неіснуючі зв’язки та точні хронології, представляючи числа без нормалізації.

Сильний:

Витягує сутності особи/місця/установи з наведених нижче документів, підключаючи кожен до посилання на документ. Позначте різні варіанти написання, які можуть збігатися з «може бути злито», але не зливайте. Взаємовідносини, які нечітко прописані в документі, і події з невизначеними датами НЕ ФЕЙКУЮТЬСЯ; тримайте ті без дат окремо. Документація: [тут]

Різниця: приписування джерелу, залишення нормалізації для людей, заборона на фіктивні зв’язки/історію та відокремлення недатованих подій роблять шаблон виправданим.

Поширені помилки

  • Приймаючи шаблон за доказ. Шаблон - це гіпотеза; підтверджується в документі.
  • Пропуск нормалізації. Різне написання однієї і тієї ж сутності спотворює число та мережу.
  • Сліпа довіра цифрам. Неповний збір і зміщення вибірки роблять число оманливим.
  • Вигадана шкала часу. Недатовані події не включаються в хронологію.
  • Ігнорування контексту. Важливо не «скільки разів проходив», а «як проходив».

Підсумовуючи

Аналіз вмісту та виявлення шаблонів є потужним полем, у якому штучний інтелект робить видимими структури, які неможливо було б побачити лише при читанні: вилучення сутностей, мережі зв’язків, тематичні кластери, часові шкали. Але кожна закономірність є гіпотезою, а не доказом. Пов’яжіть активи з джерелом, ретельно нормалізуйте та перевіряйте людиною, запитуйте номери для відсутніх даних і упередженості, уникайте надуманих зв’язків і хронологій. ШІ позначає шаблон; Що це означає і чи відповідає дійсності – судити історикам.

Аплікаційне завдання

Зберіть не менше 15 документів (з довідками). Витягніть людину та розмістіть сутності за допомогою шаблону "NER". Потім згрупуйте різні варіанти написання за допомогою «нормалізації сутності» та перевірте групи самостійно. Нарешті, запустіть шаблон «датована шкала часу» та подивіться, скільки подій залишилося «недатованими». Порівняйте, скільки надуманих посилань або хронологій створив би ШІ за поганих підказок.

контрольний список

  • [ ] Я чітко визначив своє шаблонне питання.
  • [ ] Кожна сутність пов’язана з посиланням на документ.
  • [ ] Я нормалізував тип сутності та поєднав його з людським схваленням.
  • [ ] Я ставив під сумнів цифри через відсутність даних і упередженість.
  • [ ] Недатовані події я не ставив у хронологію, тримав їх окремо.