Egység 8 / 12

Tartalomelemzés és mintafelfedezés

Nyereség:

  • Képes mintákat kinyerni nagy szövegkészletekből olyan technikák segítségével, mint a NER, kapcsolatkivonás, idővonal és hálózati elemzés
  • Képes a mintát hipotézisnek tekinteni, nem pedig bizonyítéknak, az entitásokat a forráshoz kapcsolni, és emberi jóváhagyással normalizálni
  • Képes megérteni, hogy a számok miként lehetnek félrevezetőek a hiányzó adatok és a mintavételi torzítás miatt, valamint hogy elkerülje a kitalált kapcsolatokat és kronológiákat.

A történeti kutatás nem csupán az egyes dokumentumok olvasását jelenti; gyakran keres mintákat nagy dokumentumkészletekben. Milyen összefüggésekben jelenik meg egy adott név az évek során? Mely emberek kötődnek egy településhez? Hogyan változik egy téma az idő múlásával? Ki kivel levelez? Az ilyen kérdésekhez nem egyetlen dokumentumot, hanem több száz dokumentumot együttesen kell megvizsgálni. Ezt gyakran digitális humán tudományoknak nevezik – a számítási módszerek alkalmazása olyan területeken, mint a történelem és az irodalom.

Az AI hatékonyan képes strukturált információkat kinyerni nagy szövegkészletekből. Ebben az egységben elsajátíthatja a NER-t (elnevezett entitásfelismerés), a minták és kapcsolatok kivonását, a témamodellezési logikát és az idővonal létrehozását; de megvitatjuk e technikák legveszélyesebb buktatóját is – a mesterséges intelligencia önmagát úgy mutatja be, hogy „talált” egy nem létező mintát.

Alapvető technikák

  • NER (Named Entity Recognition): Az entitások, például személy, hely, intézmény, dátum automatikus kinyerése a szövegből. Percek alatt létrehoz egy listát, mint például "Az 500 dokumentumban említett összes helynév".
  • Kapcsolati következtetés: Az entitások közötti kapcsolatok megjelölése („X személy Y helyen”, „A megfelel B-nek”).
  • Témamodellezés: Statisztikailag ismétlődő témák klasztereinek keresése nagy szövegkészletben. Megmutatja, hogy mely témák melyik időszakban koncentrálódnak.
  • Idővonal-következtetés: A dokumentumokban dátumozott események időrendi sorrendbe rendezése.
  • Hálózatelemzés: A személyek közötti/intézményi kapcsolatok hálózatként való megjelenítése (ki a központ, ki a kapcsolódási pont).

Mindezek közös célja olyan struktúrák feltárása, amelyek nem egy dokumentumban, hanem a gyűjteményben jelennek meg. Ezek a technikák olyan látható mintákat tesznek láthatóvá, amelyek soha nem lennének láthatóak pusztán olvasással. De mindegyik „jel”, nem „bizonyíték”; Fontos ellenőrizni, hogy mi található az eredeti dokumentumban.

Ezen a területen gyakran használt fogalom a közeli olvasás (szöveg mélyreható, soronkénti olvasása) és a távoli olvasás (több száz/ezer szöveg együttes, statisztikai vizsgálata) megkülönböztetése. A mesterséges intelligencia lehetővé teszi a távoli olvasást: olyan mintákat látunk egy korpuszban, amely elég nagy ahhoz, hogy egyetlen emberi életen át kitartson. De amikor a távoli olvasás egy mintára mutat, vissza kell térni a szoros olvasáshoz, vagyis az eredeti dokumentumhoz, hogy megértsük azt. A két módszer nem cserélhető fel egymással; Az egyik a mintát mutatja, a másik a jelentését. A legerősebb kutatás mindkettőt együtt használja.

Tipp: Használjon mintaelemzést hipotézisgenerátorként: "Az AI itt észlelt egy mintát, ez valós?" Ezután egyenként ellenőrizze a mintát a dokumentumokban. A minta a kutatás kiindulópontja, nem az eredménye.

Munkafolyamat: lépésről lépésre

1. Tisztázd a kérdést. "Mely emberek jelennek meg leggyakrabban együtt ebben a gyűjteményben?" Egy világos mintás kérdés, mint pl.

2. Készítse elő és címkézze fel az adatokat. Rendszerezze a szöveget a forráshivatkozásokkal úgy, hogy a talált eszközöket vissza lehessen kapcsolni a dokumentumhoz.

3. Megjelenik az entitás/minta. NER, kapcsolat vagy idővonal vázlat létrehozása az AI segítségével.

4. Normalizálja. Kombináld ugyanannak a személynek/helynek különböző írásmódjait ("Isztambul / Isztambul / Kostantiniyye" ugyanaz a hely?). Ez a lépés kritikus; Ha kimarad, a minta szétesik.

5. Ellenőrizze a dokumentumban. Ellenőrizze a tényleges dokumentumokat, hogy vannak-e megjelölt jelentős minták. Győződjön meg arról, hogy az AI nem ad hozzá kitalált linket.

6. Megjegyzés. Mit jelent a minta, az a történész ítélete; Az AI csak a mintát jelöli.

Szám- és statisztikai csapda

A mintaelemzés gyakran ad számokat: „X név 47-szer fordul elő”, „ez a téma a dokumentumok 30%-ában van jelen”. Ezek a számok objektívnek tűnnek, de félrevezetőek lehetnek:

  • Hiányzó adatok: Ha a gyűjtemény már hiányos (dokumentumok elvesztek, csoport még soha nem került rögzítésre), a szám a fennmaradt dokumentumokat tükrözi, nem a valóságot.
  • Normalizálási hiba: Ha ugyanazt a személyt másképp írják, és külön számolják, a szám hibás lesz.
  • Kontextusvesztés: "47-szer fordul elő" nem mond semmit; Az átadás módja (pozitív/negatív, alany/tárgy) fontos.

minta kimenet

látszólagos jelentése

valós kockázat

"X 47-szer fordul elő"

fontos személy

Hiányos gyűjtemény, helyesírási variáció

"30% téma"

domináns téma

mintavételi torzítás

"A-B gyakran együtt"

intim kapcsolat

Véletlen egybeesés, hiányzó kontextus

"idővonal"

pontos kronológia

Keltezés nélküli dokumentumok, koholt rendelés

három mini tok

1. eset – A hálózatelemzés rejtett közvetítőt tárt fel. Egy kutató egy 800 levélből álló levelezési gyűjteményt vizsgált meg. Az AI-val, hogy ki kinek írt, elhatározták, és hálózat jött létre. A hálózat kimutatta, hogy egy első pillantásra jelentéktelennek tűnő személy valójában a legfontosabb érintkezési pont a két csoport között. A kutató ennek a személynek a leveleire összpontosított, és új megállapításra jutott. De először ellenőrizte az összes hivatkozást a dokumentumokban.

2. eset – Normalizálási hiba megsértette a számot. Egy diák megszámolta, hányszor jelent meg egy hely a dokumentumokban. Mivel a mesterséges intelligencia ugyanannak a helynek három különböző írásmódját külön-külön megszámolta, a szám a valós szám egyharmadának bizonyult. Az írásmódok kombinálásakor a hely valójában a harmadik leggyakrabban előforduló pozícióban volt. Tanulság: normalizálás nélkül a számban nem lehet megbízni.

3. eset – Kidolgozott idővonal. Egy kutató dátum nélküli dokumentumokból készített egy idővonalat. A mesterséges intelligencia "logikus" sorrendbe rendezte az ismeretlen eseményeket, és pontos időrendet mutatott be. Ez a sorrend azonban nem szerepelt a dokumentumokban, az AI kitalálta. Tanulság: az idővonal csak olyan eseményekből épül fel, amelyeknek dátuma van a dokumentumban; a többi marad "időpont".

Négy másolható sablon

1) NER (entitásra vonatkozó következtetés):

Az alábbi dokumentumokban szereplő személyek, helyek, intézmények és időpontok KÜLÖN listákként jelennek meg. Jelölje meg, hogy az egyes entitások melyik dokumentumban (hivatkozásban) szerepelnek. Csak azt vegyük, ami a szövegben egyértelműen szerepel; találgatással add hozzá. Jelölje be [?], ha nem biztos a kiejtésben. Dokumentumok: [itt]

2) Entitásnormalizálás:

Az alábbi entitáslistában csoportosítsa a különböző írásmódokat, amelyek ugyanazt a személyt/helyet jelenthetik (pl. „Isztambul / Kostantiniyye”). Javasoljon egy lehetséges közös formátumot minden csoporthoz, DE ne írja elő a pontos kombinációt; Megjegyzés hozzáadása "talán ugyanaz, hagyd, hogy az emberek ellenőrizzék". Hagyja békén, ha nem biztos benne. Lista: [itt]

3) A kapcsolat/hálózat vázlata:

Vonja ki a "ki kivel áll kapcsolatban" hivatkozásokat a következő levelezésből/dokumentumokból. Minden hivatkozásnál jelezze, hogy melyik dokumentumon (hivatkozáson) alapul. Olyan kapcsolatot épített ki, amely nem szerepel VILÁGOSAN a dokumentumban. Jelölje meg a kétértelmű hivatkozásokat [nem egyértelmű]. Dokumentáció: [itt]

4) Dátumozott idővonal:

Csak azokat az eseményeket sorolja fel időrendi sorrendben, amelyek az alábbi dokumentumokban EGYÉRTELMŰEN megfogalmazottak; Minden eseményt csatoljon a forrásához. A bizonytalan dátumú eseményeket külön sorolja fel a „dátumozás” címszó alatt, NE tegyük sorba. NE állítsa be a becsült dátumot. Dokumentáció: [itt]

Gyenge felszólítás / Erős felszólítás

Gyenge:

Elemezze ezeket a dokumentumokat, és bontsa ki a fontos mintákat, kapcsolatokat és idővonalakat.

A „Fontos minták kibontása” arra készteti a mesterséges intelligenciát, hogy találjon ki nem létező kapcsolatokat és pontos kronológiákat, amelyek normalizálás nélkül mutatják be a számokat.

Erős:

Kivonja a személy/hely/intézmény entitásokat a következő dokumentumokból úgy, hogy mindegyiket a dokumentumhivatkozáshoz kapcsolja. Jelölje meg a különböző írásmódokat, amelyek megegyezhetnek a "összevonva" kifejezéssel, de ne egyesítse őket. A dokumentumban nem egyértelműen feltüntetett kapcsolatok és bizonytalan dátumú események NEM HAMISÍTJÁK; a dátum nélkülieket tartsa külön. Dokumentáció: [itt]

A különbség: a forráshoz való hozzárendelés, a normalizálás emberre hagyása, a fiktív kapcsolatok/történelem tilalma és a dátum nélküli események elkülönítése teszi a mintát védhetővé.

Gyakori hibák

  • A bizonyíték mintájának összetévesztése. A minta a hipotézis; a dokumentumban igazolják.
  • Normalizálás kihagyása. Ugyanazon entitás különböző írásmódjai torzítják a számot és a hálózatot.
  • Vak bizalom a számokban. A hiányos adatgyűjtés és a mintavételi torzítás félrevezetővé teszi a számot.
  • Kidolgozott idővonal. A dátum nélküli események nem szerepelnek a kronológiában.
  • A kontextus figyelmen kívül hagyása. Nem az a fontos, hogy "hányszor adták át", hanem az, hogy "hogyan ment át".

Összefoglalva

A tartalomelemzés és a mintázatok felfedezése egy olyan hatékony terület, ahol az AI olyan látható struktúrákat tesz lehetővé, amelyek nem lennének láthatóak pusztán olvasás során: entitáskivonás, kapcsolati hálózatok, témacsoportok, idővonalak. De minden minta hipotézis, nem bizonyíték. Kapcsolja össze az eszközöket a forrással, normalizálja gondosan és emberi ellenőrzéssel, kérdezze le a számokat a hiányzó adatok és torzítások miatt, kerülje a kitalált kapcsolatokat és kronológiákat. Az AI kijelöli a mintát; Hogy ez mit jelent és igaz-e, az a történész ítélete.

Pályázati feladat

Gyűjts össze legalább 15 db dokumentációt (hivatkozásokkal). A „NER” sablon segítségével bontsa ki a személyeket és helyezze el az entitásokat. Ezután csoportosítsa a különböző írásmódokat az „entitás normalizálásával”, és ellenőrizze saját maga a csoportokat. Végül futtassa a „dátumozott idővonal” sablont, és nézze meg, hány esemény marad „kelletlen”. Hasonlítsa össze, hány kitalált linket vagy kronológiát hozna létre az AI rossz felszólítással.

ellenőrző lista

  • [ ] Világosan megfogalmaztam a mintakérdésemet.
  • [ ] Minden entitást csatoltam a dokumentumhivatkozáshoz.
  • [ ] Normalizáltam az entitások beírását, és emberi jóváhagyással kombináltam.
  • [ ] Megkérdőjeleztem a számokat a hiányzó adatok és a torzítás miatt.
  • [ ] A dátum nélküli eseményeket nem tettem kronológiába, külön-külön tartottam.