Jednotka 4 / 12

Metadáta, katalogizácia a klasifikácia

zisky:

  • Schopnosť vytvárať návrhy metadát v súlade so štandardmi ako ISAD(G) alebo Dublin Core s umelou inteligenciou
  • Schopnosť predchádzať halucináciám a mapovať predmetné výrazy do kontrolovanej slovnej zásoby s povolením nechať prázdne
  • Schopnosť rozlíšiť, ktoré polia, ako je dátum, meno osoby a referenčný kód, vyžadujú súhlas človeka a ktoré by mala prideliť iba inštitúcia

Archív alebo knižnicu, bez ohľadu na to, aké sú bohaté, nemožno nájsť, pokiaľ nie sú dobre definované. To, čo robí dokument „nájdeteľným“, sú popisné informácie o ňom: kto ho napísal, kedy, kde, aký je jeho predmet, do akej zbierky patrí. Tieto informácie sa nazývajú metadáta (metaúdaje — popisné údaje o dokumente; „údaje o údajoch“). Katalogizácia je proces identifikácie dokumentov s týmito metaúdajmi a ich uloženie do vyhľadávacieho systému. Klasifikácia znamená organizovať dokumenty podľa kritérií, ako je predmet, typ alebo pôvod.

Generovanie metadát je mimoriadne časovo náročné; Individuálne zadávanie údajov o dátume, predmete, osobe a mieste pre tisíce dokumentov vo veľkých zbierkach môže trvať roky. AI je v tomto odvetví silným generátorom návrhov. V tejto časti uvidíme, ako generovať metadáta pomocou AI, katalogizáciu v súlade so štandardmi (ISAD(G), Dublin Core) a ukážeme si silu a úskalia automatickej klasifikácie.

Archívne normy: prečo sú potrebné

Metadáta sa nezadávajú náhodne; Existujú medzinárodné štandardy, aby sa záznamy z rôznych inštitúcií mohli navzájom rozprávať:

  • ISAD(G) (General International Standard Archival Description): Pravidlá pre hierarchický popis archívneho materiálu (na úrovni fondu, série, spisu, dokumentu). Obsahuje polia ako referenčný kód, názov, dátum, rozsah, tvorca.
  • Dublin Core: Spoločný štandard pozostávajúci z 15 základných polí na popis digitálnych zdrojov (názov, tvorca, predmet, dátum, žáner, formát, zdroj, jazyk atď.).
  • Fondy: Súbor záznamov, ktoré sa prirodzene vytvorili ako výsledok aktivít jednej osoby, rodiny alebo inštitúcie. Je základnou organizačnou jednotkou archívnictva.
  • Proveniencia (pôvod): Informácie o tom, od koho dokument pochádza a ktorou rukou prešiel. V archívnictve sa dokumenty vedú spolu podľa pôvodu.

Explicitné špecifikovanie cieľového štandardu pri vytváraní metaúdajov AI zaisťuje, že výstup je možné priamo vložiť do podniku.

Ďalším kľúčovým konceptom je autoritatívny záznam – záznam, ktorý definuje jedinú, štandardnú, schválenú formu mena osoby, miesta alebo inštitúcie. V historických dokumentoch sa môže tá istá osoba alebo miesto vyskytovať s rôznym pravopisom; Autoritatívny záznam ich všetky spája do jedného schváleného formátu, aby sa pri hľadaní nerozptýlili. AI navrhuje mená z dokumentu; ale mapovanie tohto mena na štandardný tvar v autoritatívnom zázname je ľudská práca. Prepojenie toho, čo AI ​​hovorí „Ahmed“ s „Ahmedom Beyom (1840-1912)“ v autoritatívnom zázname inštitúcie, zachováva konzistentnosť katalógu.

Pracovný postup: krok za krokom

1. Pripravte zdroj. Zhromaždite prepis alebo obrázok dokumentu a všetky kontextové informácie.

2. Identifikujte štandard a oblasti. Povedzte AI, ktorý štandard (ISAD(G), Dublin Core) a podľa akých polí bude produkovať výstup.

3. Vytvorte koncept metadát. AI vyplní polia, ktoré možno z dokumentu extrahovať (dátum, osoba, miesto, predmet, jazyk, žáner); Ponecháva prázdne oblasti, ktoré nemôže odstrániť.

4. Mapa do riadenej slovnej zásoby. Názvy predmetov a miest nie sú vo väčšine inštitúcií voľné, ale sú viazané na vopred definovaný zoznam (riadená slovná zásoba / tezaurus). Mapujte predmetné výrazy navrhnuté AI do tohto zoznamu.

5. Overte a potvrďte. Každé pole, najmä dátum, meno a predmet, ľudia porovnávajú s dokumentmi a záznamami autority.

Tip: Explicitne dajte AI povolenie „nechať prázdne“. V opačnom prípade „uhádne“ dátum alebo tvorcu, ktorý v dokumente nie je, a do vášho katalógu vloží falošné metadáta. Pokyn „Nechajte toto pole prázdne, ak nie je v dokumente“ je najsilnejším štítom proti halucináciám.

Polia a úroveň dôveryhodnosti v tabuľke

Pole metadát

Aká spoľahlivá je AI?

overenie

jazyk

vysoká

vzorka

Typ dokumentu

stredne vysoká

ovládanie

Názvy osôb/miest

Stredné (chyba čítania)

povinné

dátum

Nízke stredné (riziko výroby)

povinné

Predmetné podmienky

Stredné (bezplatné generovanie)

Mapa do kontrolného zoznamu

Rozsah/zhrnutie

stredne vysoká

Porovnaj so zdrojom

Referenčný kód

Žiadne (poskytuje inštitúcia)

ľudské hody

Zhrnutie: AI je rýchla a spoľahlivá v oblastiach ako jazyk a žáner; generuje koncepty v poliach ako dátum, meno a predmet, ale vyžaduje sa súhlas človeka; AI nikdy nevytvára inštitucionálne polia, ako napríklad referenčný kód.

tri mini prípady

Prípad 1 – Návrh metadát pre 8 000 fotografií. Mestský archív katalogizoval 8000 historických fotografií. Poznámky na zadnej strane každej fotografie boli prepísané a odovzdané AI; Dátum, miesto a prehľad témy vygenerovaný AI. Ľudský tím to pole po poli overil a namapoval do kontrolovaného zoznamu. Odhadovaný 10-mesačný pracovný pomer sa skrátil na 3 mesiace; ale každý dátum a názov miesta boli vizuálne skontrolované.

Prípad 2 – Vymyslená história. Archivár mal v katalógu AI nedatovaný list. YZ sa pozrel na obsah listu a presne napísal dátum „1912“. V dokumente však nebol žiadny dátum; AI predpovedala. Ak by archivár nepridal pokyn „ponechajte prázdne, ak nie v dokumente“, katalóg by bol vyplnený vyhotoveným dátumom. Lekcia: Nevyplnené povolenie je povinné.

Prípad 3 – Voľný predmet spôsobil zmätok. AI priradila podobným dokumentom podobné, ale odlišné voľné termíny ako „imigrácia“, „imigrácia“, „vysporiadanie“. Keď nebola zmapovaná do kontrolovanej slovnej zásoby, tá istá téma bola označená tromi rôznymi výrazmi a rozptýlená vo vyhľadávaní. Konzistencia bola dosiahnutá mapovaním výrazov do jedného zoznamu autorít. Lekcia: termíny témy nie sú uvoľnené, sú prepojené so zoznamom.

Štyri kopírovateľné šablóny

1) Prehľad Dublin Core:

Extrahujte koncept metadát Dublin Core z prepisu dokumentu nižšie. Polia: Názov, Autor, Predmet, Popis, Dátum, Žáner, Jazyk, Rozsah (miesto/obdobie). Pravidlá: (1) V texte používajte iba JASNE informácie. (2) Pole, ktoré nie je v texte, nechajte prázdne, nehádajte. (3) Označte hodnotu, ktorou si nie ste istí, pomocou [?]. Prepis: [tu]

2) Definícia návrhu ISAD(G):

Vytvorte koncept pre nasledujúci dokument v poliach ISAD(G): Názov, Dátum(y), Úroveň popisu (dokument/súbor), Rozsah a obsah (krátke zhrnutie), Autor, Jazyk. Referenčný kód ponechajte PRÁZDNÝ (poskytne ho inštitúcia). Nepridávajte žiadne informácie, ktoré nie sú v texte; Neexistujúce pole nechajte prázdne. Dokument: [tu]

3) Návrh tematického výrazu (kontrolovaný):

Navrhnite 3-5 tematických výrazov vhodných pre dokument nižšie. Najprv sa spoliehajte na fakty V dokumente. Nižšie je uvedený zoznam kontrolovanej terminológie našej inštitúcie; NAJPRV si ho vyberte z tohto zoznamu, ak v zozname nie je, označte svoj nový návrh výrazu samostatne. Zoznam: [termíny]. Dokument: [tu]

4) Hromadná kontrola konzistencie:

Nižšie sú uvedené záznamy metadát pre dokumenty z tej istej kolekcie. Nezrovnalosti nahlásenia: záznamy s odlišným pravopisom toho istého miesta/osoby, rôzne formáty dátumu, rôzne výrazy pre rovnaký predmet. Oprava IMPOSITION; Stačí vytvoriť zoznam nezrovnalostí, ktoré si môže človek preštudovať. Záznamy: [tu]

Slabá výzva / Silná výzva

slabé:

Vytvorte úplný katalógový záznam pre tento dokument.

„Úplná“ inštrukcia tlačí AI, aby zaplnila každý priestor, t. j. vymyslela históriu a tvorcov, ktorí neexistujú.

Silný:

Pre tento dokument je navrhnutý Dublin Core. Používajte iba informácie JASNE zahrnuté v prepise; ponechajte neexistujúce pole prázdne, nehádajte.Vyberte pojmy témy z tohto kontrolovaného zoznamu: [zoznam]. Označte dátum a mená osôb pomocou [?], aby som to mohol overiť v dokumente. Prepis: [tu]

Rozdiel: povolenie „nechať prázdne“ namiesto „kompletného“ vydania, kontrolované dodržiavanie zoznamu a overovacie značky chránia katalóg pred zhotovením.

Časté chyby

  • Znamená to „úplne naplniť“. To vedie k prispôsobeniu neexistujúcich polí; malo by sa udeliť povolenie „nechať prázdne“.
  • Uvoľnenie predmetných podmienok. Výrazy, ktoré nezodpovedajú kontrolovanej slovnej zásobe, rozptyľujú vyhľadávanie.
  • Umelá inteligencia predpovedá históriu. Zadanie fiktívneho dátumu do nedatovaného dokumentu znečisťuje katalóg.
  • Referenčný kód vygenerovaný AI. Toto je firemný, jedinečný priestor; ľudia hádžu.
  • Bez špecifikácie normy. Ak norma nie je uvedená, výstupom bude neusporiadaný návrh, ktorý sa nedá vložiť do inštitúcie.

V súhrne

Metadáta a katalogizácia sú neviditeľnou infraštruktúrou, ktorá otvára archív pre bádateľa, a vyžaduje si to veľa úsilia. Z prepisu AI vytvorí rýchly prehľad pre polia, ako je dátum, osoba, miesto, predmet a žáner; Môže pracovať podľa štandardov ako ISAD(G) alebo Dublin Core. Ale tlak na „úplné vyplnenie“ tlačí AI, aby veci vymyslela; Povolenie „nechať prázdne“, mapovanie na kontrolovanú slovnú zásobu a ľudské potvrdenie dátumov/mien udržujú katalóg dôveryhodný. AI pripraví návrh; Za správnosť katalógu zodpovedáte vy.

Aplikačná úloha

Vykonajte prepis dokumentu a vyžiadajte si metadáta od AI ​​pomocou šablóny „Dublin Core draft“; Skontrolujte, či ponecháva prázdne polia, ktoré neexistujú. Potom spustite šablónu „návrhu pojmov témy“ s vlastným (alebo vzorovým) kontrolným zoznamom. Nakoniec otestujte niekoľko záznamov pomocou „hromadnej kontroly konzistencie“. Všimnite si, koľko polí sa AI ​​snaží vyplniť predikciou a koľko predmetových výrazov je potrebné namapovať do zoznamu.

kontrolný zoznam

  • [ ] Jasne som uviedol cieľový štandard (ISAD(G)/Dublin Core).
  • [ ] Dal som povolenie "Nechajte prázdne pole prázdne".
  • [ ] Namapoval som pojmy témy do kontrolovaného zoznamu.
  • [ ] Overil som dátum a mená osôb v dokumente/zázname autority.
  • [ ] Referenčný kód som nechal na inštitúciu, nie na AI.