Јединица 8 / 12

Анализа садржаја и откривање образаца

Добици:

  • Способност издвајања образаца из великих скупова текста користећи технике као што су НЕР, издвајање односа, временска линија и анализа мреже
  • Бити у стању да види образац као хипотезу, а не као доказ, повезује ентитете са извором и нормализује их уз људско одобрење
  • Способност да се разуме како бројеви могу да доведу у заблуду због недостајућих података и пристрасности узорковања, као и да се избегну измишљени односи и хронологије.

Историјско истраживање није само читање појединачних докумената; често траже обрасце у великим скуповима докумената. У ком контексту се одређено име појављује током година? Који људи су повезани са насељем? Како се тема мења током времена? Ко се са ким дописује? Таква питања захтевају да се посматра не један документ, већ стотине докумената заједно. Ово се често назива дигиталним хуманистичким наукама—примена рачунарских метода у областима као што су историја и књижевност.

АИ је моћан у издвајању структурираних информација из великих скупова текста. У овој јединици ћете научити НЕР (препознавање именованих ентитета), издвајање образаца и односа, логику моделирања тема и креирање временске линије; али ћемо такође разговарати о најопаснијој замци ових техника – АИ која се представља као да је „пронашла“ образац који не постоји.

Основне технике

  • НЕР (Намед Ентити Рецогнитион): Аутоматско издвајање ентитета као што су особа, место, институција, датум из текста. Он производи листу попут „Сва имена места која се помињу у ових 500 докумената“ за неколико минута.
  • Закључак о односу: Обележавање веза између ентитета („Особа Кс на месту И“, „А одговара са Б“).
  • Моделирање тема: Статистичко проналажење група тема које се понављају у великом скупу текста. Показује које су теме концентрисане у ком периоду.
  • Закључак о временској линији: Распоређивање датумских догађаја у документима хронолошким редоследом.
  • Анализа мреже: Визуелизација међуљудских/институционалних односа као мреже (ко је центар, ко је тачка везе).

Заједнички циљ свих ових је да се открију структуре које се не појављују у једном документу већ се појављују у целој колекцији. Ове технике чине видљиве обрасце који никада не би били видљиви само читањем. Али сваки од њих је „знак“, а не „доказ“; Неопходно је проверити шта се налази у оригиналном документу.

Често коришћен концепт у овој области је разлика између читања изблиза (читање текста у дубину, ред по ред) и читања на даљину (гледање на стотине/хиљаде текстова заједно, статистички). АИ омогућава читање на даљину: видите обрасце у корпусу довољно великом да траје један људски живот. Али када читање на даљину указује на образац, потребно је да се вратимо читању изблиза, односно оригиналном документу, да бисмо га схватили. Ове две методе нису заменљиве; Један показује образац, други даје његово значење. Најснажније истраживање користи оба заједно.

Савет: Користите анализу образаца као генератор хипотеза: „АИ је овде уочио образац, да ли је стваран?“ Затим проверите тај образац у документима један по један. Образац је почетна тачка вашег истраживања, а не резултат.

Ток рада: корак по корак

1. Разјасните питање. „Који се људи најчешће појављују заједно у овој колекцији?“ Јасно питање шаблона као.

2. Припремите и означите податке. Организујте текст са изворним референцама тако да се сва пронађена средства могу повезати са документом.

3. Појављује се ентитет/образац. Генеришите НЕР, везу или временску линију са АИ.

4. Нормализујте. Комбинујте различите написе исте особе/места („Истанбул / Истанбул / Костантинииие“ исто место?). Овај корак је критичан; Ако се изостави, образац ће се распасти.

5. Потврдите у документу. Проверите стварне документе за све значајне обрасце који су означени. Уверите се да АИ не додаје измишљену везу.

6. Коментар. Оно што образац значи је суд историчара; АИ само обележава образац.

Број и статистичка замка

Анализа образаца често производи бројеве: „име Кс се појављује 47 пута“, „ова тема је присутна у 30% докумената“. Ови бројеви изгледају објективно, али могу да доведу у заблуду:

  • Недостају подаци: Ако је збирка већ некомплетна (документи су изгубљени, група никада није забележена), број одражава преживеле документе, а не стварност.
  • Грешка нормализације: Ако се иста особа напише другачије и рачуна се одвојено, број ће бити нетачан.
  • Губитак контекста: „јавља се 47 пута“ ништа не говори; Важно је како се преноси (позитивно/негативно, субјект/објекат).

излаз узорка

привидно значење

стварни ризик

„Кс се јавља 47 пута“

важна особа

Непотпуна збирка, правописна варијација

„Тема 30%“

доминантна тема

пристрасност узорковања

"А-Б често заједно"

интимни однос

Случајност, недостатак контекста

"временска линија"

тачна хронологија

Недатирани документи, измишљена наредба

три мини кофера

Случај 1 — Анализа мреже открила је скривеног посредника. Истраживач је прегледао збирку преписке од 800 писама. Са АИ је утврђено ко је коме писао и створена је мрежа. Мрежа је показала да је на први поглед наизглед безначајна особа заправо била кључна тачка контакта између две групе. Истраживач се фокусирао на писма ове особе и дошао до новог налаза. Али прво проверите све везе у документима.

Случај 2 — Грешка нормализације је оштетила број. Ученик их је натерао да преброје колико се пута неко место појављује у документима. Пошто је АИ одвојено пребројао три различита правописа истог места, испоставило се да је тај број једна трећина стварног броја. Када су се правописи комбиновали, место је заправо било на трећем месту које се најчешће појављује. Поука: без нормализације броју се не може веровати.

Случај 3 — Израђена временска линија. Истраживач је направио временску линију од докумената без датума. АИ је поређао непознате догађаје "логичним" редоследом и представио прецизну хронологију. Међутим, овај низ није био у документима, АИ га је измислила. Лекција: временска линија се конструише само од догађаја који имају датум у документу; остало остаје „недатирано“.

Четири шаблона за копирање

1) НЕР (закључивање ентитета):

Особе, места, институције и датуми поменути у документима у наставку се појављују као ПОСЕБНЕ листе. Наведите у ком документу (референци) се помиње сваки ентитет. Узмите само оно што је ЈАСНО речено у тексту; додај нагађањем. Означите [?] ако нисте сигурни у изговор. Документи: [овде]

2) Нормализација ентитета:

На листи ентитета у наставку групишите различите написе који би могли бити иста особа/место (нпр. „Истанбул / Костантинииие“). Предложите могући заједнички формат за сваку групу АЛИ немојте наметати тачну комбинацију; Додајте напомену "можда исто, нека људи провере". Оставите то на миру ако нисте сигурни. Листа: [овде]

3) Нацрт односа/мреже:

Издвојите везе „ко је с ким повезан“ из следећег скупа преписке/докумената. За сваку везу наведите на ком документу (референци) се заснива. ИЗМИСЛИО однос који није ЈАСНО у документу. Означите двосмислене везе [нејасно]. Документација: [овде]

4) Временски оквир са датумом:

Наведите хронолошким редом само догађаје који су ЈАСНО наведени у следећим документима; Повежите сваки догађај са његовим извором. Догађаје са неизвесним датумима наведите посебно под насловом „недатирано“, НЕМОЈТЕ их редом. НЕ измишљајте предвиђени датум. Документација: [овде]

Слаби промпт / Јаки промпт

слаба:

Анализирајте ове документе и издвојите важне обрасце, односе и временске оквире.

„Издвоји важне обрасце“ гура АИ да измисли непостојеће везе и прецизне хронологије, представљајући бројеве без нормализације.

Јака:

Издваја ентитете особе/места/институције из следећих докумената повезујући сваки са референцом документа. Означите различите правописе који могу бити исти као „може бити спојено“, али немојте спајати. Односи који нису јасно наведени у документу и догађаји са неизвесним датумима НЕ ЛАЖЕ; држати оне без датума одвојено. Документација: [овде]

Разлика: приписивање извору, препуштање нормализације људима, забрана фиктивних веза/историје и одвајање недатираних догађаја чине образац одбрањивим.

Уобичајене грешке

  • Погрешио образац за доказ. Образац је хипотеза; је верификован у документу.
  • Прескакање нормализације. Различити начини писања истог ентитета искривљују број и мрежу.
  • Слепо поверење у бројке. Непотпуно прикупљање и пристрасност узорковања чине број погрешним.
  • Израђена временска линија. Недатирани догађаји нису укључени у хронологију.
  • Игнорисање контекста. Није важно „колико је пута донето“, већ „како је донето“.

Укратко

Анализа садржаја и откривање образаца је моћно поље где АИ чини видљиве структуре које не би биле видљиве само читањем: издвајање ентитета, мреже односа, кластере тема, временске линије. Али сваки образац је хипотеза, а не доказ. Повежите средства са извором, пажљиво нормализујте и са људском валидацијом, тражите бројеве упита за недостајуће податке и пристрасност, избегавајте измишљене односе и хронологије. АИ означава образац; Шта то значи и да ли је тачно, то је суд историчара.

Задатак апликације

Прикупити најмање 15 комада документације (са референцама). Издвојите особе и ентитете места помоћу шаблона „НЕР“. Затим групишите различите правописе са "нормализацијом ентитета" и сами проверите групе. На крају, покрените шаблон „датирана временска линија“ и видите колико догађаја је остало „недатирано“. Упоредите колико би измишљених веза или хронологија АИ произвела са лошим подстицањем.

контролна листа

  • [ ] Јасно сам дефинисао свој образац питања.
  • [ ] Сваки ентитет је повезан са референцом документа.
  • [ ] Нормализовао сам куцање ентитета и комбиновао га са људским одобрењем.
  • [ ] Довео сам у питање бројеве због недостајућих података и пристрасности.
  • [ ] Нисам ставио недатиране догађаје у хронологију, чувао сам их одвојено.