Jednotka 8 / 12

Analýza obsahu a zisťovanie vzorov

zisky:

  • Schopnosť extrahovať vzory z veľkých súborov textu pomocou techník ako NER, extrakcia vzťahov, časová os a sieťová analýza
  • Byť schopný vidieť vzor skôr ako hypotézu než dôkaz, spájať entity so zdrojom a normalizovať ich s ľudským súhlasom
  • Schopnosť pochopiť, ako môžu byť čísla zavádzajúce v dôsledku chýbajúcich údajov a skreslenia vzoriek, a vyhnúť sa vymysleným vzťahom a chronológiám.

Historický výskum nie je len o čítaní jednotlivých dokumentov; často hľadajú vzory vo veľkých súboroch dokumentov. V akých súvislostiach sa v priebehu rokov objavuje konkrétne meno? Ktorí ľudia sú spojení s osadou? Ako sa téma mení v priebehu času? Kto si s kým korešponduje? Takéto otázky si vyžadujú pozrieť sa nie na jeden dokument, ale na stovky dokumentov spoločne. Toto sa často nazýva digitálne humanitné vedy – aplikácia výpočtových metód v oblastiach, ako je história a literatúra.

Umelá inteligencia je účinná pri získavaní štruktúrovaných informácií z veľkých súborov textu. V tejto lekcii sa naučíte NER (rozpoznávanie pomenovaných entít), extrakciu vzorov a vzťahov, logiku modelovania tém a vytváranie časovej osi; ale budeme diskutovať aj o najnebezpečnejšom úskalí týchto techník – o tom, že AI sa prezentuje tak, že „našla“ vzorec, ktorý neexistuje.

Základné techniky

  • NER (Named Entity Recognition): Automatická extrakcia entít, ako je osoba, miesto, inštitúcia, dátum z textu. V priebehu niekoľkých minút vytvorí zoznam ako „Všetky názvy miest uvedené v týchto 500 dokumentoch“.
  • Vyvodenie vzťahu: Označenie väzieb medzi entitami („Osoba X na mieste Y“, „A zodpovedá B“).
  • Modelovanie tém: Štatistické vyhľadávanie zhlukov opakujúcich sa tém vo veľkom súbore textu. Ukazuje, ktoré témy sú sústredené v ktorom období.
  • Vyvodenie časovej osi: Usporiadanie datovaných udalostí v dokumentoch do chronologického poradia.
  • Analýza siete: Vizualizácia medziľudských/inštitucionálnych vzťahov ako siete (kto je centrom, kto je spojovacím bodom).

Spoločným cieľom všetkých je odhaliť štruktúry, ktoré sa nevyskytujú v jedinom dokumente, ale vyskytujú sa v celej zbierke. Tieto techniky zviditeľňujú vzory, ktoré by nikdy neboli viditeľné iba pri čítaní. Ale každý z nich je „znamenie“, nie „dôkaz“; Je nevyhnutné overiť, čo sa nachádza v originálnom dokumente.

Často používaným pojmom v tejto oblasti je rozlíšenie medzi blízkym čítaním (čítanie textu do hĺbky, riadok po riadku) a diaľkovým čítaním (prezeranie stoviek/tisícov textov kolektívne, štatisticky). Umelá inteligencia umožňuje čítanie na diaľku: v korpuse vidíte vzory dostatočne veľké na to, aby vydržali jeden ľudský život. Ale keď čítanie na diaľku ukazuje na vzor, ​​je potrebné vrátiť sa k čítaniu zblízka, teda k pôvodnému dokumentu, aby mu dal zmysel. Tieto dve metódy nie sú zameniteľné; Jeden ukazuje vzor, ​​druhý dáva jeho význam. Najrobustnejší výskum používa oboje spolu.

Tip: Použite analýzu vzorov ako generátor hypotéz: „Umelá inteligencia tu objavila vzor, ​​je skutočný?“ Potom skontrolujte tento vzor v dokumentoch jeden po druhom. Vzor je východiskovým bodom vášho výskumu, nie výsledkom.

Pracovný postup: krok za krokom

1. Objasnite otázku. "Ktorí ľudia sa v tejto kolekcii najčastejšie objavujú?" Jasná vzorová otázka ako.

2. Pripravte a označte údaje. Usporiadajte text s odkazmi na zdroj tak, aby sa všetky nájdené aktíva dali prepojiť späť s dokumentom.

3. Objaví sa entita/vzor. Generujte NER, vzťah alebo obrys časovej osi pomocou AI.

4. Normalizovať. Skombinujte rôzne hláskovanie tej istej osoby/miesta („Istanbul / Istanbul / Kostantiniyye“ to isté miesto?). Tento krok je kritický; Ak sa vynechá, vzor sa rozpadne.

5. Overte v dokumente. Skontrolujte skutočné dokumenty, či neobsahujú významné vzory, ktoré sú označené príznakom. Uistite sa, že AI nepridáva vymyslený odkaz.

6. Komentujte. Čo vzor znamená, je úsudok historika; AI len označuje vzor.

Pasca na čísla a štatistiky

Analýza vzorov často vytvára čísla: „meno X sa vyskytuje 47-krát“, „táto téma je prítomná v 30 % dokumentov“. Tieto čísla sa zdajú byť objektívne, ale môžu byť zavádzajúce:

  • Chýbajúce údaje: Ak je zbierka už neúplná (dokumenty sa stratili, skupina nebola nikdy zaznamenaná), počet odráža zachované dokumenty, nie skutočnosť.
  • Chyba normalizácie: Ak je tá istá osoba napísaná inak a počítaná oddelene, číslo bude nesprávne.
  • Strata kontextu: „vyskytuje sa 47-krát“ nič nehovorí; Dôležité je, ako sa odovzdáva (pozitívne/negatívne, predmet/predmet).

výstup vzoru

zdanlivý význam

skutočné riziko

"X sa vyskytuje 47-krát"

dôležitá osoba

Neúplná zbierka, pravopisná variácia

"Téma 30 %"

dominantná téma

skreslenie vzorky

"A-B často spolu"

intímny vzťah

Náhoda, chýbajúci kontext

"časová os"

presná chronológia

Nedatované dokumenty, vymyslená objednávka

tri mini prípady

Prípad 1 – Analýza siete odhalila skrytého sprostredkovateľa. Výskumník preskúmal zbierku korešpondencie 800 listov. S AI sa určilo, kto komu písal a vytvorila sa sieť. Sieť ukázala, že na prvý pohľad zdanlivo bezvýznamná osoba bola v skutočnosti kľúčovým bodom kontaktu medzi týmito dvoma skupinami. Výskumník sa zameral na listy tejto osoby a dospel k novému zisteniu. Najprv však overte všetky odkazy v dokumentoch.

Prípad 2 – Chyba normalizácie poškodila číslo. Študent im dal spočítať, koľkokrát sa miesto objavilo v dokumentoch. Keďže AI ​​počítala tri rôzne hláskovanie na tom istom mieste oddelene, číslo sa ukázalo ako tretina skutočného počtu. Keď sa pravopisy spojili, miesto bolo v skutočnosti na tretej najčastejšie sa vyskytujúcej pozícii. Poučenie: Bez normalizácie sa číslu nedá dôverovať.

Prípad 3 – Vytvorená časová os. Výskumník vytvoril časovú os z nedatovaných dokumentov. AI usporiadala neznáme udalosti v „logickom“ poradí a predstavila presnú chronológiu. Táto sekvencia však v dokumentoch nebola, AI si ju vymyslela. Lekcia: časová os je vytvorená len z udalostí, ktoré majú v dokumente dátum; zvyšok zostáva „nedatovaný“.

Štyri kopírovateľné šablóny

1) NER (odvodenie entity):

Osoby, miesta, inštitúcie a dátumy uvedené v dokumentoch nižšie sa zobrazujú ako SAMOSTATNÉ zoznamy. Uveďte, v ktorom dokumente (odkaze) je každý subjekt uvedený. Berte len to, čo je JASNE uvedené v texte; pridať hádam. Označte [?], ak si nie ste istí výslovnosťou. Dokumenty: [tu]

2) Normalizácia entity:

V nižšie uvedenom zozname entít zoskupte rôzne hláskovanie, ktoré by mohlo predstavovať rovnakú osobu alebo miesto (napr. „Istanbul / Kostantiniyye“). Navrhnite možný spoločný formát pre každú skupinu, ALE neuvádzajte presnú kombináciu; Pridajte poznámku „možno to isté, nech ľudia overia“. Nechajte to tak, ak si nie ste istí. Zoznam: [tu]

3) Náčrt vzťahu/siete:

Extrahujte odkazy „kto je s kým príbuzný“ z nasledujúceho súboru korešpondencie/dokumentov. Pri každom odkaze uveďte, z ktorého dokumentu (odkazu) vychádza. VYTVORIL si vzťah, ktorý v dokumente JASNE nie je. Označte nejednoznačné odkazy [nezreteľné]. Dokumentácia: [tu]

4) Datovaná časová os:

Uveďte v chronologickom poradí iba udalosti JASNE uvedené v nasledujúcich dokumentoch; Prepojte každú udalosť s jej zdrojom. Udalosti s neistým dátumom uveďte samostatne pod nadpisom „nedatované“, NEZADAJTE ich v poradí. NEDOPRAVUJTE odhadovaný dátum. Dokumentácia: [tu]

Slabá výzva / Silná výzva

slabé:

Analyzujte tieto dokumenty a extrahujte dôležité vzorce, vzťahy a časové línie.

„Extrahovať dôležité vzory“ núti AI vynájsť neexistujúce spojenia a presné chronológie, ktoré predstavujú čísla bez normalizácie.

Silný:

Vyberie entity osoby/miesta/inštitúcie z nasledujúcich dokumentov tak, že ich pripojí k odkazu na dokument. Označte rôzne pravopisy, ktoré môžu byť rovnaké ako „môže byť zlúčené“, ale nespájajte. Vzťahy, ktoré nie sú jasne uvedené v dokumente a udalosti s neistým dátumom NEFALŠUJÚ; tie bez dátumov uchovávajte oddelene. Dokumentácia: [tu]

Rozdiel: pripisovanie zdroju, ponechanie normalizácie na ľudí, zákaz fiktívnych väzieb/histórie a oddelenie nedatovaných udalostí robia tento vzor obhájiteľným.

Časté chyby

  • Zámena vzoru za dôkaz. Vzor je hypotéza; je overené v dokumente.
  • Preskočenie normalizácie. Rôzne hláskovanie tej istej entity skresľuje číslo a sieť.
  • Slepá dôvera v čísla. Neúplný zber a skreslenie vzoriek spôsobuje, že číslo je zavádzajúce.
  • Vymyslená časová os. Nedatované udalosti nie sú zahrnuté v chronológii.
  • Ignorovanie kontextu. Nie je dôležité „koľkokrát to bolo odovzdané“, ale „ako to bolo odovzdané“.

V súhrne

Analýza obsahu a zisťovanie vzorov je výkonná oblasť, v ktorej AI zviditeľňuje štruktúry, ktoré by neboli viditeľné pri samotnom čítaní: extrakcia entít, siete vzťahov, zoskupenia tém, časové osy. Ale každý vzor je hypotéza, nie dôkaz. Prepojte aktíva so zdrojom, normalizujte opatrne a s ľudskou validáciou, hľadajte čísla na chýbajúce údaje a zaujatosti, vyhýbajte sa vykonštruovaným vzťahom a chronológiám. AI označuje vzor; Čo to znamená a či je to pravda, je úsudok historika.

Aplikačná úloha

Zhromaždite aspoň 15 kusov dokumentácie (s referenciami). Extrahujte osobu a umiestnite entity pomocou šablóny „NER“. Potom zoskupte rôzne pravopisy pomocou „normalizácie entít“ a sami overte skupiny. Nakoniec spustite šablónu „časovej osi s dátumom“ a zistite, koľko udalostí zostáva „nedatovaných“. Porovnajte, koľko vymyslených odkazov alebo chronológií by AI ​​vytvorila so slabým nabádaním.

kontrolný zoznam

  • [ ] Jasne som definoval svoju vzorovú otázku.
  • [ ] Mám každú entitu prepojenú s odkazom na dokument.
  • [ ] Normalizoval som písanie entít a skombinoval som ho s ľudským súhlasom.
  • [ ] Spochybnil som čísla kvôli chýbajúcim údajom a zaujatosti.
  • [ ] Nedatované udalosti som nezaradil do chronológie, viedol som ich oddelene.