Единица 8 / 12

Анализа на содржина и откривање на модели

Добивки:

  • Способност да се извлечат обрасци од големи групи на текст користејќи техники како што се NER, екстракција на врски, временска линија и мрежна анализа
  • Можност да се види шемата како хипотеза наместо доказ, поврзување на ентитетите со изворот и нивно нормализирање со човечко одобрување
  • Способност да се разбере како броевите можат да бидат погрешни поради исчезнатите податоци и пристрасноста при земање примероци и да се избегнат измислени врски и хронологии.

Историското истражување не е само за читање поединечни документи; често бараат обрасци во големи групи документи. Во кои контексти се појавува одредено име со текот на годините? Кои луѓе се поврзани со населба? Како се менува темата со текот на времето? Кој со кого се допишува? Ваквите прашања бараат да се погледне не еден документ, туку стотици документи колективно. Ова често се нарекува дигитални хуманитарни науки - примена на пресметковни методи во области како што се историјата и литературата.

ВИ е моќна во извлекувањето структурирани информации од големи групи на текст. Во оваа единица, ќе научите NER (препознавање со име ентитет), екстракција на шаблони и врски, логика за моделирање на теми и креирање временска линија; но, исто така, ќе разговараме за најопасната замка на овие техники - вештачката интелигенција се претставува како „нашла“ шема што не постои.

Основни техники

  • NER (Named Entity Recognition): Автоматско извлекување на ентитети како личност, место, институција, датум од текстот. Таа произведува листа како „Сите имиња на места споменати во овие 500 документи“ за неколку минути.
  • Заклучок за врската: Обележување врски меѓу ентитетите („Лицето X на местото Y“, „А кореспондира со Б“).
  • Моделирање на теми: статистички наоѓање кластери на теми кои се повторуваат во голем сет на текст. Тоа покажува кои теми се концентрирани во кој период.
  • Заклучок за временска рамка: Подредување датуми на настани во документите по хронолошки редослед.
  • Мрежна анализа: Визуелизирање на односите меѓу лица/институционални како мрежа (кој е центар, кој е точката за поврзување).

Заедничката цел на сите овие е да се откријат структури кои не се појавуваат во еден документ, туку се појавуваат низ целата колекција. Овие техники прават видливи обрасци кои никогаш не би биле видливи само преку читање. Но, секој од нив е „знак“, а не „доказ“; Неопходно е да се потврди што се наоѓа во оригиналниот документ.

Често користен концепт на ова поле е разликата помеѓу читање одблизу (продлабочено читање текст, ред по ред) и читање од далечина (збирно гледање на стотици/илјадници текстови, статистички). Вештачката интелигенција овозможува читање од далечина: гледате обрасци во корпус доволно голем за да трае еден човечки живот. Но, кога далечното читање упатува на шема, неопходно е да се вратиме на блиското читање, односно на оригиналниот документ, за да има смисла. Двата методи не се заменливи; Едниот го покажува моделот, другиот го дава своето значење. Најсилното истражување ги користи и двете заедно.

Совет: Користете ја анализата на шаблоните како генератор на хипотези: „Вештачката интелигенција забележала шема овде, дали е реална? Потоа проверете ја таа шема во документите еден по еден. Моделот е почетна точка на вашето истражување, а не резултат.

Работен тек: чекор по чекор

1. Појасни го прашањето. „Кои луѓе најчесто се појавуваат заедно во оваа колекција? Јасна шема прашање како.

2. Подгответе ги и означете ги податоците. Организирајте го текстот со референци на изворот, така што сите пронајдени средства може да се поврзат назад со документот.

3. Се појавува ентитетот/шемата. Генерирајте NER, врска или преглед на временската линија со вештачка интелигенција.

4. Нормализирај. Комбинирајте различни правописи на исто лице/место („Истанбул / Истанбул / Kostantiniyye“ на истото место?). Овој чекор е критичен; Ако се испушти, шаблонот ќе се распадне.

5. Потврдете во документот. Проверете ги вистинските документи за какви било значајни обрасци што се означени. Погрижете се вештачката интелигенција да не додаде измислена врска.

6. Коментар. Она што значи моделот е судот на историчарот; ВИ само ја означува шемата.

Замка за број и статистика

Анализата на моделот често произведува бројки: „името X се појавува 47 пати“, „оваа тема е присутна во 30% од документите“. Овие бројки изгледаат објективни, но можат да бидат погрешни:

  • Недостасуваат податоци: Ако колекцијата е веќе нецелосна (документите се изгубени, група никогаш не била снимена), бројот ги одразува преживеаните документи, а не реалноста.
  • Грешка при нормализацијата: ако истото лице се пишува поинаку и се брои одделно, бројот ќе биде неточен.
  • Губење на контекстот: „се јавува 47 пати“ не кажува ништо; Важно е како се поминува (позитивно/негативно, предмет/објект).

излез на шема

привидно значење

реален ризик

„Х се јавува 47 пати“

важна личност

Нецелосна збирка, правописна варијација

„Тема 30%“

доминантна тема

пристрасност при земање примероци

„А-Б често заедно“

интимна врска

Случајност, недостаток на контекст

„временска линија“

точна хронологија

Недатирани документи, фабрикувана нарачка

три мини футроли

Случај 1 — Анализата на мрежата откри скриен посредник. Истражувач испитувал збирка кореспонденција од 800 писма. Со вештачка интелигенција, кој на кого му пиша се утврди и се создаде мрежа. Мрежата покажа дека една навидум безначајна личност на прв поглед всушност била клучната точка на контакт меѓу двете групи. Истражувачот се фокусирал на писмата на оваа личност и дошол до ново откритие. Но, прво ги потврди сите врски во документите.

Случај 2 - Грешката во нормализацијата го оштети бројот. Еден студент ги навел да избројат колку пати се појавило место во документите. Бидејќи вештачката интелигенција броела три различни правописи на исто место одделно, бројот се покажа како една третина од реалниот број. Кога се комбинираа правописите, местото всушност беше на третата најчесто појавувана позиција. Лекција: без нормализација на бројот не може да му се верува.

Случај 3 - Составен времеплов. Истражувач создаде временска рамка од документи без датум. АИ ги подреди непознатите настани по „логичен“ редослед и претстави прецизна хронологија. Сепак, оваа низа ја немаше во документите, вештачката интелигенција ја измислила. Лекција: временската линија е изградена само од настани кои имаат датум во документот; остатокот останува „недатиран“.

Четири шаблони за копирање

1) NER (заклучок за ентитет):

Лицата, местата, институциите и датумите споменати во документите подолу се појавуваат како ПОСЕБНИ списоци. Наведете во кој документ (референца) се споменува секој ентитет. Земете само она што е ЈАСНО наведено во текстот; додај со погодување. Означете [?] ако не сте сигурни за изговорот. Документи: [тука]

2) Нормализација на ентитет:

Во списокот со ентитети подолу, групирајте различни правописи што би можеле да бидат исто лице/место (на пр. „Истанбул / Костантинје“). Предложете го можниот заеднички формат за секоја група НО не наметнувајте ја точната комбинација; Додадете белешка „можеби истото, оставете ги луѓето да проверат“. Оставете го на мира ако не сте сигурни. Список: [тука]

3) Преглед на врската/мрежата:

Извлечете ги врските „кој со кого е поврзан“ од следниот сет на кореспонденција/документи. За секоја врска, наведете на кој документ (референца) се заснова. Направил врска што не е ЈАСНО во документот. Обележете двосмислени врски [неразлично]. Документација: [тука]

4) Датиран времеплов:

Наведете по хронолошки редослед само настаните ЈАСНО наведени во следните документи; Поврзете го секој настан со неговиот извор. Наведете ги настаните со неизвесни датуми посебно под насловот „без датум“, НЕ поставувајте ги во ред. НЕ го надополнувајте проценетиот датум. Документација: [тука]

Слаб промпт / Силен промпт

Слаб:

Анализирајте ги овие документи и извлечете важни обрасци, врски и временски рокови.

„Извлечете важни обрасци“ ја турка вештачката интелигенција да измисли непостоечки врски и прецизни хронологии, прикажувајќи бројки без нормализација.

Силно:

Го извлекува лицето/местото/институцијата од следните документи со поврзување на секој со референцата на документот. Означете различни правописи кои можеби се исти како „може да се спојат“, но не се спојуваат. Односите кои не се јасно наведени во документот и настаните со неизвесни датуми НЕ СЕ ФАЛЖИРААТ; чувајте ги одделно оние без датуми. Документација: [тука]

Разликата: припишувањето на изворот, препуштањето на нормализацијата на луѓето, забраната за фиктивни врски/историја и одвојувањето на настаните без датум го прават моделот одбранлив.

Вообичаени грешки

  • Погрешување на шемата за доказ. Моделот е хипотезата; е потврдена во документот.
  • Прескокнување на нормализацијата. Различни правописи на ист ентитет го искривуваат бројот и мрежата.
  • Слепа доверба во бројките. Нецелосното собирање и пристрасноста кон земање примероци го прават бројот погрешен.
  • Составен времеплов. Настаните без датум не се вклучени во хронологијата.
  • Игнорирање на контекстот. Не е важно „колку пати е донесено“, туку „како е донесено“.

Сумирано

Анализата на содржината и откривањето шаблони е моќно поле каде што вештачката интелигенција прави видливи структури кои не би биле видливи само преку читање: екстракција на ентитети, мрежи на врски, кластери за теми, временски линии. Но, секоја шема е хипотеза, а не доказ. Поврзете ги средствата со изворот, нормализирајте ги внимателно и со човечка валидација, побарајте броеви за исчезнати податоци и пристрасност, избегнувајте измислени врски и хронологии. ВИ ја означува шемата; Што значи тоа и дали е вистина е судот на историчарот.

Задача за апликација

Соберете најмалку 15 парчиња документација (со референци). Извлечете лице и поставете ентитети со шаблонот „NER“. Потоа групирајте ги различните правописи со „нормализација на ентитетите“ и самите проверете ги групите. Конечно, стартувајте го шаблонот „временска линија со датум“ и видете колку настани остануваат „недатирани“. Споредете колку смислени врски или хронологии ќе произведе вештачката интелигенција со лошо поттикнување.

листа за проверка

  • [ ] Јасно го дефинирав моето прашање за моделот.
  • [ ] Го имам секој ентитет поврзан со референцата на документот.
  • [ ] Го нормализирав пишувањето на ентитетите и го комбинирав со човечко одобрување.
  • [ ] Ги преиспитав бројките за исчезнати податоци и пристрасност.
  • [ ] Не ги ставив во хронологија настаните без датум, ги чував посебно.