zisky:
- Schopnosť extrahovať vzory z veľkých súborov textu pomocou techník ako NER, extrakcia vzťahov, časová os a sieťová analýza
- Byť schopný vidieť vzor skôr ako hypotézu než dôkaz, spájať entity so zdrojom a normalizovať ich s ľudským súhlasom
- Schopnosť pochopiť, ako môžu byť čísla zavádzajúce v dôsledku chýbajúcich údajov a skreslenia vzoriek, a vyhnúť sa vymysleným vzťahom a chronológiám.
Historický výskum nie je len o čítaní jednotlivých dokumentov; často hľadajú vzory vo veľkých súboroch dokumentov. V akých súvislostiach sa v priebehu rokov objavuje konkrétne meno? Ktorí ľudia sú spojení s osadou? Ako sa téma mení v priebehu času? Kto si s kým korešponduje? Takéto otázky si vyžadujú pozrieť sa nie na jeden dokument, ale na stovky dokumentov spoločne. Toto sa často nazýva digitálne humanitné vedy – aplikácia výpočtových metód v oblastiach, ako je história a literatúra.
Umelá inteligencia je účinná pri získavaní štruktúrovaných informácií z veľkých súborov textu. V tejto lekcii sa naučíte NER (rozpoznávanie pomenovaných entít), extrakciu vzorov a vzťahov, logiku modelovania tém a vytváranie časovej osi; ale budeme diskutovať aj o najnebezpečnejšom úskalí týchto techník – o tom, že AI sa prezentuje tak, že „našla“ vzorec, ktorý neexistuje.
Základné techniky
- NER (Named Entity Recognition): Automatická extrakcia entít, ako je osoba, miesto, inštitúcia, dátum z textu. V priebehu niekoľkých minút vytvorí zoznam ako „Všetky názvy miest uvedené v týchto 500 dokumentoch“.
- Vyvodenie vzťahu: Označenie väzieb medzi entitami („Osoba X na mieste Y“, „A zodpovedá B“).
- Modelovanie tém: Štatistické vyhľadávanie zhlukov opakujúcich sa tém vo veľkom súbore textu. Ukazuje, ktoré témy sú sústredené v ktorom období.
- Vyvodenie časovej osi: Usporiadanie datovaných udalostí v dokumentoch do chronologického poradia.
- Analýza siete: Vizualizácia medziľudských/inštitucionálnych vzťahov ako siete (kto je centrom, kto je spojovacím bodom).
Spoločným cieľom všetkých je odhaliť štruktúry, ktoré sa nevyskytujú v jedinom dokumente, ale vyskytujú sa v celej zbierke. Tieto techniky zviditeľňujú vzory, ktoré by nikdy neboli viditeľné iba pri čítaní. Ale každý z nich je „znamenie“, nie „dôkaz“; Je nevyhnutné overiť, čo sa nachádza v originálnom dokumente.
Často používaným pojmom v tejto oblasti je rozlíšenie medzi blízkym čítaním (čítanie textu do hĺbky, riadok po riadku) a diaľkovým čítaním (prezeranie stoviek/tisícov textov kolektívne, štatisticky). Umelá inteligencia umožňuje čítanie na diaľku: v korpuse vidíte vzory dostatočne veľké na to, aby vydržali jeden ľudský život. Ale keď čítanie na diaľku ukazuje na vzor, je potrebné vrátiť sa k čítaniu zblízka, teda k pôvodnému dokumentu, aby mu dal zmysel. Tieto dve metódy nie sú zameniteľné; Jeden ukazuje vzor, druhý dáva jeho význam. Najrobustnejší výskum používa oboje spolu.
Tip: Použite analýzu vzorov ako generátor hypotéz: „Umelá inteligencia tu objavila vzor, je skutočný?“ Potom skontrolujte tento vzor v dokumentoch jeden po druhom. Vzor je východiskovým bodom vášho výskumu, nie výsledkom.
Pracovný postup: krok za krokom
1. Objasnite otázku. "Ktorí ľudia sa v tejto kolekcii najčastejšie objavujú?" Jasná vzorová otázka ako.
2. Pripravte a označte údaje. Usporiadajte text s odkazmi na zdroj tak, aby sa všetky nájdené aktíva dali prepojiť späť s dokumentom.
3. Objaví sa entita/vzor. Generujte NER, vzťah alebo obrys časovej osi pomocou AI.
4. Normalizovať. Skombinujte rôzne hláskovanie tej istej osoby/miesta („Istanbul / Istanbul / Kostantiniyye“ to isté miesto?). Tento krok je kritický; Ak sa vynechá, vzor sa rozpadne.
5. Overte v dokumente. Skontrolujte skutočné dokumenty, či neobsahujú významné vzory, ktoré sú označené príznakom. Uistite sa, že AI nepridáva vymyslený odkaz.
6. Komentujte. Čo vzor znamená, je úsudok historika; AI len označuje vzor.
Pasca na čísla a štatistiky
Analýza vzorov často vytvára čísla: „meno X sa vyskytuje 47-krát“, „táto téma je prítomná v 30 % dokumentov“. Tieto čísla sa zdajú byť objektívne, ale môžu byť zavádzajúce:
- Chýbajúce údaje: Ak je zbierka už neúplná (dokumenty sa stratili, skupina nebola nikdy zaznamenaná), počet odráža zachované dokumenty, nie skutočnosť.
- Chyba normalizácie: Ak je tá istá osoba napísaná inak a počítaná oddelene, číslo bude nesprávne.
- Strata kontextu: „vyskytuje sa 47-krát“ nič nehovorí; Dôležité je, ako sa odovzdáva (pozitívne/negatívne, predmet/predmet).
výstup vzoru
zdanlivý význam
skutočné riziko
"X sa vyskytuje 47-krát"
dôležitá osoba
Neúplná zbierka, pravopisná variácia
"Téma 30 %"
dominantná téma
skreslenie vzorky
"A-B často spolu"
intímny vzťah
Náhoda, chýbajúci kontext
"časová os"
presná chronológia
Nedatované dokumenty, vymyslená objednávka
tri mini prípady
Prípad 1 – Analýza siete odhalila skrytého sprostredkovateľa. Výskumník preskúmal zbierku korešpondencie 800 listov. S AI sa určilo, kto komu písal a vytvorila sa sieť. Sieť ukázala, že na prvý pohľad zdanlivo bezvýznamná osoba bola v skutočnosti kľúčovým bodom kontaktu medzi týmito dvoma skupinami. Výskumník sa zameral na listy tejto osoby a dospel k novému zisteniu. Najprv však overte všetky odkazy v dokumentoch.
Prípad 2 – Chyba normalizácie poškodila číslo. Študent im dal spočítať, koľkokrát sa miesto objavilo v dokumentoch. Keďže AI počítala tri rôzne hláskovanie na tom istom mieste oddelene, číslo sa ukázalo ako tretina skutočného počtu. Keď sa pravopisy spojili, miesto bolo v skutočnosti na tretej najčastejšie sa vyskytujúcej pozícii. Poučenie: Bez normalizácie sa číslu nedá dôverovať.
Prípad 3 – Vytvorená časová os. Výskumník vytvoril časovú os z nedatovaných dokumentov. AI usporiadala neznáme udalosti v „logickom“ poradí a predstavila presnú chronológiu. Táto sekvencia však v dokumentoch nebola, AI si ju vymyslela. Lekcia: časová os je vytvorená len z udalostí, ktoré majú v dokumente dátum; zvyšok zostáva „nedatovaný“.
Štyri kopírovateľné šablóny
1) NER (odvodenie entity):
Osoby, miesta, inštitúcie a dátumy uvedené v dokumentoch nižšie sa zobrazujú ako SAMOSTATNÉ zoznamy. Uveďte, v ktorom dokumente (odkaze) je každý subjekt uvedený. Berte len to, čo je JASNE uvedené v texte; pridať hádam. Označte [?], ak si nie ste istí výslovnosťou. Dokumenty: [tu]
2) Normalizácia entity:
V nižšie uvedenom zozname entít zoskupte rôzne hláskovanie, ktoré by mohlo predstavovať rovnakú osobu alebo miesto (napr. „Istanbul / Kostantiniyye“). Navrhnite možný spoločný formát pre každú skupinu, ALE neuvádzajte presnú kombináciu; Pridajte poznámku „možno to isté, nech ľudia overia“. Nechajte to tak, ak si nie ste istí. Zoznam: [tu]
3) Náčrt vzťahu/siete:
Extrahujte odkazy „kto je s kým príbuzný“ z nasledujúceho súboru korešpondencie/dokumentov. Pri každom odkaze uveďte, z ktorého dokumentu (odkazu) vychádza. VYTVORIL si vzťah, ktorý v dokumente JASNE nie je. Označte nejednoznačné odkazy [nezreteľné]. Dokumentácia: [tu]
4) Datovaná časová os:
Uveďte v chronologickom poradí iba udalosti JASNE uvedené v nasledujúcich dokumentoch; Prepojte každú udalosť s jej zdrojom. Udalosti s neistým dátumom uveďte samostatne pod nadpisom „nedatované“, NEZADAJTE ich v poradí. NEDOPRAVUJTE odhadovaný dátum. Dokumentácia: [tu]
Slabá výzva / Silná výzva
slabé:
Analyzujte tieto dokumenty a extrahujte dôležité vzorce, vzťahy a časové línie.
„Extrahovať dôležité vzory“ núti AI vynájsť neexistujúce spojenia a presné chronológie, ktoré predstavujú čísla bez normalizácie.
Silný:
Vyberie entity osoby/miesta/inštitúcie z nasledujúcich dokumentov tak, že ich pripojí k odkazu na dokument. Označte rôzne pravopisy, ktoré môžu byť rovnaké ako „môže byť zlúčené“, ale nespájajte. Vzťahy, ktoré nie sú jasne uvedené v dokumente a udalosti s neistým dátumom NEFALŠUJÚ; tie bez dátumov uchovávajte oddelene. Dokumentácia: [tu]
Rozdiel: pripisovanie zdroju, ponechanie normalizácie na ľudí, zákaz fiktívnych väzieb/histórie a oddelenie nedatovaných udalostí robia tento vzor obhájiteľným.
Časté chyby
- Zámena vzoru za dôkaz. Vzor je hypotéza; je overené v dokumente.
- Preskočenie normalizácie. Rôzne hláskovanie tej istej entity skresľuje číslo a sieť.
- Slepá dôvera v čísla. Neúplný zber a skreslenie vzoriek spôsobuje, že číslo je zavádzajúce.
- Vymyslená časová os. Nedatované udalosti nie sú zahrnuté v chronológii.
- Ignorovanie kontextu. Nie je dôležité „koľkokrát to bolo odovzdané“, ale „ako to bolo odovzdané“.
V súhrne
Analýza obsahu a zisťovanie vzorov je výkonná oblasť, v ktorej AI zviditeľňuje štruktúry, ktoré by neboli viditeľné pri samotnom čítaní: extrakcia entít, siete vzťahov, zoskupenia tém, časové osy. Ale každý vzor je hypotéza, nie dôkaz. Prepojte aktíva so zdrojom, normalizujte opatrne a s ľudskou validáciou, hľadajte čísla na chýbajúce údaje a zaujatosti, vyhýbajte sa vykonštruovaným vzťahom a chronológiám. AI označuje vzor; Čo to znamená a či je to pravda, je úsudok historika.
Aplikačná úloha
Zhromaždite aspoň 15 kusov dokumentácie (s referenciami). Extrahujte osobu a umiestnite entity pomocou šablóny „NER“. Potom zoskupte rôzne pravopisy pomocou „normalizácie entít“ a sami overte skupiny. Nakoniec spustite šablónu „časovej osi s dátumom“ a zistite, koľko udalostí zostáva „nedatovaných“. Porovnajte, koľko vymyslených odkazov alebo chronológií by AI vytvorila so slabým nabádaním.
kontrolný zoznam
- [ ] Jasne som definoval svoju vzorovú otázku.
- [ ] Mám každú entitu prepojenú s odkazom na dokument.
- [ ] Normalizoval som písanie entít a skombinoval som ho s ľudským súhlasom.
- [ ] Spochybnil som čísla kvôli chýbajúcim údajom a zaujatosti.
- [ ] Nedatované udalosti som nezaradil do chronológie, viedol som ich oddelene.