zisky:
- Schopnost extrahovat vzory z velkých sad textu pomocí technik, jako je NER, extrakce vztahů, časová osa a síťová analýza
- Být schopen vidět vzor spíše jako hypotézu než důkaz, spojovat entity se zdrojem a normalizovat je s lidským souhlasem
- Schopnost porozumět tomu, jak mohou být čísla zavádějící kvůli chybějícím datům a vzorkování, a vyhnout se vykonstruovaným vztahům a chronologiím.
Historický výzkum není jen o čtení jednotlivých dokumentů; často hledají vzory ve velkých souborech dokumentů. V jakých kontextech se konkrétní jméno v průběhu let objevuje? Kteří lidé jsou spojeni s osadou? Jak se téma v průběhu času mění? Kdo si s kým dopisuje? Takové otázky vyžadují podívat se ne na jeden dokument, ale na stovky dokumentů společně. To se často nazývá digitální humanitní vědy – aplikace výpočetních metod v oborech, jako je historie a literatura.
Umělá inteligence je výkonná při získávání strukturovaných informací z velkých sad textu. V této jednotce se naučíte NER (rozpoznávání pojmenovaných entit), extrakci vzorů a vztahů, logiku modelování témat a tvorbu časové osy; ale probereme také nejnebezpečnější úskalí těchto technik – umělá inteligence, která se prezentuje tak, že „našla“ vzorec, který neexistuje.
Základní techniky
- NER (Named Entity Recognition): Automatická extrakce entit, jako je osoba, místo, instituce, datum z textu. Během několika minut vytvoří seznam jako „Všechny názvy míst uvedené v těchto 500 dokumentech“.
- Vyvození vztahu: Označení vazeb mezi entitami („Osoba X na místě Y“, „A odpovídá B“).
- Modelování témat: Statistické vyhledávání shluků opakujících se témat ve velkém souboru textu. Ukazuje, jaká témata jsou soustředěna do kterého období.
- Odvozování časové osy: Uspořádání datovaných událostí v dokumentech do chronologického pořadí.
- Síťová analýza: Vizualizace mezilidských/institucionálních vztahů jako sítě (kdo je střed, kdo je spojovací bod).
Společným cílem všech těchto je odhalit struktury, které se nevyskytují v jediném dokumentu, ale objevují se v celém souboru. Tyto techniky zviditelní vzory, které by nikdy nebyly viditelné pouhým čtením. Ale každý z nich je „znamením“, nikoli „důkazem“; Je nezbytné ověřit, co se nachází v původním dokumentu.
Často používaným pojmem v této oblasti je rozlišení mezi čtením zblízka (čtení textu do hloubky, řádek po řádku) a čtením na dálku (prohlížení stovek/tisíců textů souhrnně, statisticky). Umělá inteligence umožňuje číst na dálku: vidíte vzory v korpusu dostatečně velkém na to, aby vydržel jeden lidský život. Ale když vzdálené čtení ukazuje na vzor, je nutné se vrátit k blízkému čtení, tedy k původnímu dokumentu, aby mu dal smysl. Tyto dvě metody nejsou zaměnitelné; Jeden ukazuje vzor, druhý dává jeho význam. Nejrobustnější výzkum používá obojí společně.
Tip: Použijte analýzu vzorů jako generátor hypotéz: „Umělá inteligence zde objevila vzor, je skutečný?“ Poté jeden po druhém zkontrolujte vzor v dokumentech. Vzor je výchozím bodem vašeho výzkumu, nikoli výsledkem.
Pracovní postup: krok za krokem
1. Vyjasněte otázku. "Kteří lidé se v této sbírce nejčastěji objevují?" Jasná vzorová otázka jako.
2. Připravte a označte data. Uspořádejte text s odkazy na zdroj tak, aby bylo možné veškerá nalezená aktiva propojit zpět s dokumentem.
3. Objeví se entita/vzor. Generujte NER, vztah nebo časovou osu pomocí AI.
4. Normalizovat. Kombinujte různé hláskování stejné osoby/místa („Istanbul / Istanbul / Kostantiniyye“ stejné místo?). Tento krok je kritický; Pokud je vynechán, vzor se rozpadne.
5. Ověřte v dokumentu. Zkontrolujte skutečné dokumenty, zda neobsahují významné vzory, které jsou označeny příznakem. Ujistěte se, že AI nepřidává vymyšlený odkaz.
6. Komentář. Co vzor znamená, je úsudek historika; AI pouze označuje vzor.
Past čísel a statistik
Analýza vzorů často produkuje čísla: „jméno X se vyskytuje 47krát“, „toto téma je přítomno ve 30 % dokumentů“. Tato čísla se zdají objektivní, ale mohou být zavádějící:
- Chybějící údaje: Pokud je sbírka již neúplná (dokumenty byly ztraceny, skupina nebyla nikdy zaznamenána), počet odráží dochované dokumenty, nikoli skutečnost.
- Chyba normalizace: Pokud je stejná osoba napsána jinak a počítána samostatně, číslo bude nesprávné.
- Ztráta kontextu: „vyskytuje se 47krát“ nic neříká; Důležité je, jak je předáváno (pozitivní/negativní, předmět/objekt).
výstup vzoru
zdánlivý význam
skutečné riziko
"X se vyskytuje 47krát"
důležitá osoba
Neúplná sbírka, pravopisná variace
"Téma 30 %"
dominantní téma
vzorkovací zkreslení
"A-B často spolu"
intimní vztah
Náhoda, chybějící kontext
"časová osa"
přesná chronologie
Nedatované dokumenty, vymyšlená objednávka
tři mini pouzdra
Případ 1 – Analýza sítě odhalila skrytého prostředníka. Výzkumník zkoumal sbírku korespondence 800 dopisů. S AI bylo určeno, kdo komu psal a byla vytvořena síť. Síť ukázala, že na první pohled zdánlivě bezvýznamná osoba byla ve skutečnosti klíčovým styčným bodem mezi oběma skupinami. Výzkumník se zaměřil na dopisy této osoby a dospěl k novému zjištění. Nejprve ale ověřil všechny odkazy v dokumentech.
Případ 2 — Chyba normalizace poškodila číslo. Student je nechal spočítat, kolikrát se místo objevilo v dokumentech. Vzhledem k tomu, že AI počítala tři různá hláskování na stejném místě samostatně, ukázalo se, že číslo je jedna třetina skutečného čísla. Když se pravopisy spojily, místo bylo ve skutečnosti na třetí nejčastěji se vyskytující pozici. Poučení: Bez normalizace nelze číslu věřit.
Případ 3 – Sestavená časová osa. Výzkumník vytvořil časovou osu z nedatovaných dokumentů. AI seřadila neznámé události v „logickém“ pořadí a předložila přesnou chronologii. Tato sekvence však v dokumentech nebyla, AI si ji vymyslela. Lekce: časová osa je vytvořena pouze z událostí, které mají v dokumentu datum; zbytek zůstává "nedatovaný".
Čtyři kopírovatelné šablony
1) NER (odvozování entity):
Osoby, místa, instituce a data uvedená v níže uvedených dokumentech se zobrazují jako SAMOSTATNÉ seznamy. Uveďte, ve kterém dokumentu (odkazu) je každá entita zmíněna. Berte jen to, co je JASNĚ uvedeno v textu; přidat odhadem. Označte [?], pokud si nejste jisti výslovností. Dokumenty: [zde]
2) Normalizace entit:
V níže uvedeném seznamu entit seskupte různé hláskování, které mohou být stejné osoby/místa (např. „Istanbul / Kostantiniyye“). Navrhněte možný společný formát pro každou skupinu, ALE neuvádějte přesnou kombinaci; Přidejte poznámku „možná to samé, nechte lidi ověřit“. Nechte to být, pokud si nejste jisti. Seznam: [zde]
3) Přehled vztahu/sítě:
Extrahujte odkazy „kdo je s kým příbuzný“ z následující sady korespondence/dokumentů. U každého odkazu uveďte, z jakého dokumentu (odkazu) vychází. VYTVOŘIL vztah, který v dokumentu JASNĚ NENÍ. Označte nejednoznačné odkazy [nezřetelné]. Dokumentace: [zde]
4) Datovaná časová osa:
Uveďte v chronologickém pořadí pouze události JASNĚ uvedené v následujících dokumentech; Propojte každou událost s jejím zdrojem. Události s nejistým datem uveďte samostatně pod nadpisem „nedatováno“, NEŘAĎTE je. NEDOVOLUJTE odhadované datum. Dokumentace: [zde]
Slabá výzva / Silná výzva
slabé:
Analyzujte tyto dokumenty a extrahujte důležité vzorce, vztahy a časové osy.
„Extrahovat důležité vzorce“ nutí umělou inteligenci k vymýšlení neexistujících spojení a přesných chronologií, které představují čísla bez normalizace.
Silný:
Extrahuje entity osoby/místa/instituce z následujících dokumentů tak, že je připojí k odkazu na dokument. Označte různé pravopisy, které mohou být stejné jako "může být sloučeny", ale neslučujte. Vztahy, které nejsou v dokumentu jasně uvedeny, a události s nejistým datem NEFALŠÍ; ty bez dat uchovávejte odděleně. Dokumentace: [zde]
Rozdíl: připisování zdroji, ponechání normalizace lidem, zákaz fiktivních vazeb/historie a oddělení nedatovaných událostí činí vzor obhajitelným.
Časté chyby
- Záměna vzoru za důkaz. Vzor je hypotéza; je ověřeno v dokumentu.
- Přeskočení normalizace. Různé hláskování stejné entity zkresluje číslo a síť.
- Slepá důvěra v čísla. Neúplný sběr a zkreslení vzorků činí toto číslo zavádějící.
- Sestavená časová osa. Nedatované události nejsou zahrnuty v chronologii.
- Ignorování kontextu. Není důležité „kolikrát to bylo předáno“, ale „jak to bylo předáno“.
V souhrnu
Analýza obsahu a zjišťování vzorů je mocná oblast, kde umělá inteligence zviditelní struktury, které by při samotném čtení nebyly viditelné: extrakce entit, sítě vztahů, seskupení témat, časové osy. Ale každý vzorec je hypotéza, ne důkaz. Propojte aktiva se zdrojem, normalizujte pečlivě as lidskou validací, dotazujte se na čísla pro chybějící data a zkreslení, vyhněte se vykonstruovaným vztahům a chronologiím. AI označí vzor; Co to znamená a zda je to pravda, je úsudek historika.
Aplikační úkol
Nasbírejte alespoň 15 kusů dokumentace (s referencemi). Extrahujte osobu a umístěte entity pomocí šablony "NER". Poté seskupte různé pravopisy pomocí „normalizace entit“ a ověřte skupiny sami. Nakonec spusťte šablonu „datovaná časová osa“ a podívejte se, kolik událostí zůstává „nedatováno“. Porovnejte, kolik vymyšlených odkazů nebo chronologií by umělá inteligence vytvořila při špatném nabádání.
kontrolní seznam
- [ ] Jasně jsem definoval svou vzorovou otázku.
- [ ] Mám každou entitu spojenou s odkazem na dokument.
- [ ] Normalizoval jsem psaní entit a spojil jsem je s lidským souhlasem.
- [ ] Zpochybnil jsem čísla kvůli chybějícím údajům a zkreslení.
- [ ] Nedatované události jsem nezařadil do chronologie, vedl jsem je odděleně.