Yunit 8 / 12

Pagsusuri ng Nilalaman at Pagtuklas ng Pattern

Mga nadagdag:

  • Kakayahang mag-extract ng mga pattern mula sa malalaking set ng text gamit ang mga technique gaya ng NER, relationship extraction, timeline at network analysis
  • Ang kakayahang makita ang pattern bilang isang hypothesis sa halip na ebidensya, nag-uugnay sa mga entity sa pinagmulan at gawing normal ang mga ito nang may pag-apruba ng tao
  • Kakayahang maunawaan kung paano maaaring mapanlinlang ang mga numero dahil sa nawawalang data at sampling bias, at upang maiwasan ang mga gawa-gawang relasyon at kronolohiya.

Ang makasaysayang pananaliksik ay hindi lamang tungkol sa pagbabasa ng mga indibidwal na dokumento; madalas na naghahanap ng mga pattern sa malalaking hanay ng mga dokumento. Sa anong mga konteksto lumilitaw ang isang partikular na pangalan sa paglipas ng mga taon? Aling mga tao ang nauugnay sa isang paninirahan? Paano nagbabago ang isang paksa sa paglipas ng panahon? Sino ang nakikipag-ugnayan sa kanino? Ang ganitong mga tanong ay nangangailangan ng pagtingin sa hindi isang solong dokumento, ngunit daan-daang mga dokumento nang sama-sama. Ito ay madalas na tinatawag na digital humanities—ang paglalapat ng mga pamamaraan ng computational sa mga larangan tulad ng kasaysayan at panitikan.

Ang AI ay mahusay sa pagkuha ng structured na impormasyon mula sa malalaking set ng text. Sa unit na ito, matututunan mo ang NER (pinangalanang entity recognition), pattern at relationship extraction, topic modelling logic at paggawa ng timeline; ngunit tatalakayin din natin ang pinaka-mapanganib na pitfall ng mga diskarteng ito-ang AI ay nagpapakita ng sarili bilang may "nahanap" ang isang pattern na wala.

Mga pangunahing pamamaraan

  • NER (Named Entity Recognition): Awtomatikong pagkuha ng mga entity tulad ng tao, lugar, institusyon, petsa mula sa text. Gumagawa ito ng listahan tulad ng "Lahat ng pangalan ng lugar na binanggit sa 500 dokumentong ito" sa ilang minuto.
  • Hinuha ng relasyon: Pagmamarka ng mga ugnayan sa pagitan ng mga entity ("Tao X sa lugar Y", "A ay tumutugma sa B").
  • Pagmomodelo ng paksa: Istatistikong paghahanap ng mga kumpol ng mga umuulit na paksa sa isang malaking hanay ng teksto. Ipinapakita nito kung aling mga tema ang nakatuon sa kung aling panahon.
  • Inference ng timeline: Pag-aayos ng mga may petsang kaganapan sa mga dokumento sa isang magkakasunod na pagkakasunud-sunod.
  • Pagsusuri sa network: Pag-visualize sa mga relasyon sa pagitan ng mga tao/institusyon bilang isang network (sino ang sentro, sino ang punto ng koneksyon).

Ang karaniwang layunin ng lahat ng ito ay upang ipakita ang mga istruktura na hindi lumilitaw sa isang dokumento ngunit lumilitaw sa buong koleksyon. Ang mga diskarteng ito ay gumagawa ng mga nakikitang pattern na hindi kailanman makikita sa pamamagitan ng pagbabasa lamang. Ngunit ang bawat isa sa kanila ay isang "tanda", hindi isang "ebidensya"; Mahalagang i-verify kung ano ang matatagpuan sa orihinal na dokumento.

Ang isang madalas na ginagamit na konsepto sa larangang ito ay ang pagkakaiba sa pagitan ng malapit na pagbasa (pagbasa ng isang teksto nang malalim, linya sa linya) at malayong pagbabasa (pagtingin sa daan-daang/libo-libong mga teksto nang sama-sama, ayon sa istatistika). Ginagawang posible ng AI na magbasa nang malayuan: nakikita mo ang mga pattern sa isang corpus na sapat na malaki upang tumagal ng isang buhay ng tao. Ngunit kapag ang malayong pagbabasa ay tumuturo sa isang pattern, ito ay kinakailangan upang bumalik sa malapit na pagbabasa, iyon ay, sa orihinal na dokumento, upang magkaroon ng kahulugan nito. Ang dalawang pamamaraan ay hindi maaaring palitan; Ang isa ay nagpapakita ng pattern, ang isa ay nagbibigay ng kahulugan nito. Ang pinaka-matatag na pananaliksik ay gumagamit ng pareho nang magkasama.

Tip: Gamitin ang pattern analysis bilang hypothesis generator: "Nakakita ng pattern ang AI dito, totoo ba ito?" Pagkatapos ay suriin ang pattern na iyon sa mga dokumento nang paisa-isa. Ang pattern ay ang panimulang punto ng iyong pananaliksik, hindi ang resulta.

Daloy ng Trabaho: hakbang-hakbang

1. Linawin ang tanong. "Aling mga tao ang madalas na lumilitaw na magkasama sa koleksyong ito?" Isang malinaw na tanong ng pattern tulad ng.

2. Ihanda at lagyan ng label ang datos. Ayusin ang text gamit ang mga source reference para ang anumang asset na makikita ay mai-link pabalik sa dokumento.

3. Lumilitaw ang entity/pattern. Bumuo ng NER, relasyon o timeline outline gamit ang AI.

4. Normalize. Pagsamahin ang iba't ibang mga spelling ng parehong tao/lugar (“Istanbul / Istanbul / Kostantiniyye” sa parehong lugar?). Ang hakbang na ito ay kritikal; Kung ito ay aalisin, ang pattern ay babagsak.

5. I-verify sa dokumento. Suriin ang aktwal na mga dokumento para sa anumang makabuluhang pattern na na-flag. Siguraduhin na ang AI ay hindi nagdaragdag ng isang ginawang link.

6. Puna. Ang ibig sabihin ng pattern ay ang paghatol ng mananalaysay; Minamarkahan lang ng AI ang pattern.

Bitag ng numero at istatistika

Ang pagsusuri ng pattern ay madalas na gumagawa ng mga numero: "naganap ang pangalan X nang 47 beses", "naroroon ang temang ito sa 30% ng mga dokumento". Ang mga numerong ito ay tila layunin ngunit maaaring mapanlinlang:

  • Nawawalang data: Kung ang koleksyon ay hindi pa kumpleto (mga dokumento ay nawala, isang grupo ay hindi kailanman naitala), ang numero ay sumasalamin sa mga natitirang dokumento, hindi katotohanan.
  • Error sa pag-normalize: Kung iba ang spelling at hiwalay na binibilang ang parehong tao, magiging mali ang numero.
  • Pagkawala ng konteksto: "naganap 47 beses" ay walang sinasabi; Kung paano ito naipasa (positibo/negatibo, paksa/bagay) ay mahalaga.

pattern na output

maliwanag na kahulugan

tunay na panganib

"X ay nangyayari nang 47 beses"

mahalagang tao

Hindi kumpletong koleksyon, pagkakaiba-iba ng spelling

"Tema 30%"

nangingibabaw na paksa

sampling bias

"Madalas magkasama si A-B"

matalik na relasyon

Nagkataon, nawawalang konteksto

"timeline"

eksaktong kronolohiya

Mga dokumentong walang petsa, gawa-gawang order

tatlong mini case

Kaso 1 — Ang pagtatasa ng network ay nagsiwalat ng isang nakatagong tagapamagitan. Sinuri ng isang mananaliksik ang isang koleksyon ng mga sulat na may 800 liham. Gamit ang AI, na sumulat kung kanino natukoy at nilikha ang isang network. Ipinakita ng network na ang isang tila hindi gaanong kahalagahan sa unang tingin ay talagang ang pangunahing punto ng pakikipag-ugnayan sa pagitan ng dalawang grupo. Nakatuon ang mananaliksik sa mga liham ng taong ito at nakarating sa isang bagong natuklasan. Ngunit na-verify muna ang lahat ng mga link sa mga dokumento.

Case 2 — Nasira ng error sa normalization ang numero. Pinabilang sila ng isang estudyante kung ilang beses lumabas ang isang lugar sa mga dokumento. Dahil ang AI ay nagbilang ng tatlong magkakaibang mga spelling ng parehong lugar nang hiwalay, ang numero ay naging isang third ng tunay na numero. Kapag pinagsama-sama ang mga spelling, ang lugar ay talagang nasa ikatlong pinakamadalas na posisyon. Aral: kung walang normalisasyon ang numero ay hindi mapagkakatiwalaan.

Kaso 3 — Ginawang timeline. Gumawa ang isang mananaliksik ng timeline mula sa mga walang petsang dokumento. Inayos ng AI ang hindi kilalang mga kaganapan sa isang "lohikal" na pagkakasunud-sunod at ipinakita ang isang tumpak na kronolohiya. Gayunpaman, ang pagkakasunud-sunod na ito ay wala sa mga dokumento, ginawa ito ng AI. Aralin: ang timeline ay binuo lamang mula sa mga kaganapan na may petsa sa dokumento; ang iba ay nananatiling "walang petsa".

Apat na maaaring kopyahin na mga template

1) NER (inference ng entity):

Ang mga tao, lugar, institusyon at petsa na binanggit sa mga dokumento sa ibaba ay lalabas bilang HIWALAY na listahan. Ipahiwatig kung saang dokumento (sanggunian) binanggit ang bawat entity. Kunin lamang ang MALINAW na nakasaad sa teksto; idagdag sa pamamagitan ng hula. Markahan [?] kung hindi ka sigurado sa pagbigkas. Mga Dokumento: [dito]

2) Pag-normalize ng entity:

Sa listahan ng entity sa ibaba, pagpangkatin ang iba't ibang spelling na maaaring iisang tao/lugar (hal. "Istanbul / Kostantiniyye"). Imungkahi ang posibleng karaniwang format para sa bawat grupo NGUNIT huwag ipataw ang eksaktong kumbinasyon; Magdagdag ng tala "maaaring pareho, hayaan ang mga tao na mag-verify". Iwanan ito kung hindi ka sigurado. Listahan: [dito]

3) Outline ng relasyon/network:

I-extract ang mga link na "sino ang nauugnay kanino" mula sa sumusunod na hanay ng mga sulat/dokumento. Para sa bawat link, ipahiwatig kung saang dokumento (reference) ito batay. GINAWA ang isang relasyon na hindi MALINAW sa dokumento. Markahan ang hindi maliwanag na mga link [hindi malinaw]. Dokumentasyon: [dito]

4) May petsang timeline:

Ilista sa sunud-sunod na pagkakasunud-sunod lamang ang mga kaganapang MALINAW na nakasaad sa mga sumusunod na dokumento; I-link ang bawat kaganapan sa pinagmulan nito. Ilista ang mga kaganapang may hindi tiyak na petsa nang hiwalay sa ilalim ng pamagat na "walang petsa", HUWAG ilagay ang mga ito sa pagkakasunud-sunod. HUWAG gawin ang tinantyang petsa. Dokumentasyon: [dito]

Mahinang prompt / Malakas na prompt

mahina:

Suriin ang mga dokumentong ito at kunin ang mahahalagang pattern, relasyon, at timeline.

"I-extract ang mahahalagang pattern" ay nagtutulak sa AI na mag-imbento ng mga hindi umiiral na koneksyon at tumpak na mga kronolohiya, na nagpapakita ng mga numero nang walang normalisasyon.

malakas:

Kinukuha ang mga entity ng tao/lugar/institusyon mula sa mga sumusunod na dokumento sa pamamagitan ng pagkonekta sa bawat isa sa sanggunian ng dokumento. Markahan ang iba't ibang spelling na maaaring kapareho ng "maaaring pagsamahin", ngunit huwag pagsamahin. Ang mga relasyon na hindi malinaw na nakasaad sa dokumento at mga kaganapan na may hindi tiyak na petsa AY HINDI PEKE; panatilihing hiwalay ang mga walang petsa. Dokumentasyon: [dito]

Ang pagkakaiba: pagpapatungkol sa pinagmulan, pag-iwan ng normalisasyon sa mga tao, pagbabawal sa mga kathang-isip na ugnayan/kasaysayan, at paghihiwalay ng mga hindi napetsahan na kaganapan ay ginagawang mapagtatanggol ang pattern.

Mga karaniwang pagkakamali

  • Pagkakamali sa pattern para sa ebidensya. Ang pattern ay ang hypothesis; ay napatunayan sa dokumento.
  • Nilaktawan ang normalisasyon. Ang iba't ibang mga spelling ng parehong entity ay sumisira sa numero at sa network.
  • Bulag na pagtitiwala sa mga numero. Ang hindi kumpletong pagkolekta at pag-sample ng bias ay ginagawang mapanlinlang ang numero.
  • Ginawang timeline. Hindi kasama sa kronolohiya ang mga hindi napetsahan na kaganapan.
  • Hindi pinapansin ang konteksto. Ito ay hindi "kung gaano karaming beses ito naipasa", ngunit "kung paano ito naipasa" ang mahalaga.

Sa buod

Ang pagsusuri ng nilalaman at pagtuklas ng pattern ay isang mahusay na larangan kung saan gumagawa ang AI ng mga nakikitang istruktura na hindi makikita sa pamamagitan ng pagbabasa lamang: pagkuha ng entity, mga network ng relasyon, mga cluster ng paksa, mga timeline. Ngunit ang bawat pattern ay isang hypothesis, hindi ebidensya. I-link ang mga asset sa pinagmulan, maingat na gawing normal at may pagpapatunay ng tao, mga numero ng query para sa nawawalang data at bias, iwasan ang mga gawa-gawang relasyon at kronolohiya. Minarkahan ng AI ang pattern; Ano ang ibig sabihin nito at kung ito ay totoo ay ang hatol ng mananalaysay.

Gawain ng aplikasyon

Mangolekta ng hindi bababa sa 15 piraso ng dokumentasyon (na may mga sanggunian). I-extract ang mga entity ng tao at lugar gamit ang template na "NER". Pagkatapos ay pangkatin ang iba't ibang mga spelling na may "normalization ng entity" at i-verify ang mga pangkat mismo. Panghuli, patakbuhin ang template na "may petsang timeline" at tingnan kung gaano karaming mga kaganapan ang nananatiling "walang petsa." Ihambing kung gaano karaming mga pinagsama-samang link o kronolohiya ang bubuo ng AI na may mahinang pag-udyok.

checklist

  • [ ] Malinaw kong tinukoy ang aking pattern na tanong.
  • [ ] Mayroon akong bawat entity na naka-link sa sanggunian ng dokumento.
  • [ ] Na-normalize ko ang pag-type ng entity at pinagsama ito sa pag-apruba ng tao.
  • [ ] Tinanong ko ang mga numero para sa nawawalang data at bias.
  • [ ] Hindi ko inilagay ang mga walang petsang kaganapan sa kronolohiya, itinago ko ang mga ito nang hiwalay.