Jednotka 4 / 12

Metadata, katalogizace a klasifikace

zisky:

  • Schopnost vytvářet návrhy metadat v souladu se standardy jako ISAD(G) nebo Dublin Core s umělou inteligencí
  • Schopnost předcházet halucinacím a mapovat předmětné výrazy do řízené slovní zásoby s povolením ponechání prázdné
  • Schopnost rozlišit, která pole, jako je datum, jméno osoby a referenční kód, vyžadují schválení člověkem a která by měla přidělovat pouze instituce

Archiv nebo knihovna, bez ohledu na to, jak je bohatá, nelze najít, pokud není dobře definována. To, co dělá dokument „nalezitelným“, jsou popisné informace o něm: kdo jej napsal, kdy, kde, jaký je jeho předmět, do jaké sbírky patří. Tyto informace se nazývají metadata (metadata — popisná data o dokumentu; „data o datech“). Katalogizace je proces identifikace dokumentů s těmito metadaty a jejich uložení do prohledávatelného systému. Klasifikace spočívá v uspořádání dokumentů podle kritérií, jako je předmět, typ nebo původ.

Generování metadat je extrémně časově náročné; Individuální zadání data, předmětu, osoby a místa pro tisíce dokumentů ve velkých sbírkách může trvat roky. AI je v tomto oboru silným generátorem návrhů. V této lekci uvidíme, jak generovat metadata pomocí AI, katalogizaci v souladu se standardy (ISAD(G), Dublin Core) a jak sílu, tak úskalí automatické klasifikace.

Archivní standardy: proč jsou potřebné

Metadata nejsou zadávána náhodně; Existují mezinárodní standardy, takže záznamy z různých institucí spolu mohou mluvit:

  • ISAD(G) (General International Standard Archival Description): Pravidla pro hierarchické popisování archiválií (na úrovni fondu, edice, spisu, dokumentu). Obsahuje pole jako referenční kód, název, datum, rozsah, tvůrce.
  • Dublin Core: Společný standard sestávající z 15 základních polí pro popis digitálních zdrojů (název, tvůrce, předmět, datum, žánr, formát, zdroj, jazyk atd.).
  • Fonds: Soubor záznamů přirozeně vytvořených jako výsledek činnosti jedné osoby, rodiny nebo instituce. Je základní organizační jednotkou archivnictví.
  • Provenience (původ): Informace o tom, od koho dokument pochází a kterou rukou prošel. V archivnictví se dokumenty uchovávají pohromadě podle původu.

Explicitní zadání cílového standardu, když AI vytváří metadata, zajišťuje, že výstup lze přímo zadávat do podniku.

Dalším klíčovým konceptem je autoritní záznam – záznam, který definuje jedinou, standardní, schválenou formu jména osoby, místa nebo instituce. V historických dokumentech se může stejná osoba nebo místo objevit s různými pravopisy; Autoritní záznam je všechny sváže do jediného schváleného formátu, aby se při hledání nerozházely. AI navrhuje jména z dokumentu; ale mapování tohoto jména na standardní formu v autoritním záznamu je lidská práce. Propojení toho, co AI ​​říká „Ahmed“ a „Ahmed Bey (1840-1912)“ v autoritním záznamu instituce, zachovává konzistenci katalogu.

Pracovní postup: krok za krokem

1. Připravte zdroj. Shromážděte přepis nebo obrázek dokumentu a veškeré kontextové informace.

2. Identifikujte standard a oblasti. Řekněte AI, který standard (ISAD(G), Dublin Core) a podle jakých polí bude produkovat výstup.

3. Vygenerujte metadata návrhu. AI vyplňuje pole, která lze z dokumentu extrahovat (datum, osoba, místo, předmět, jazyk, žánr); Ponechává prázdné oblasti, které nelze odstranit.

4. Mapa do řízené slovní zásoby. Názvy předmětů a míst nejsou ve většině institucí volné, ale jsou vázány na předem definovaný seznam (řízená slovní zásoba / tezaurus). Mapujte předmětné termíny navržené AI do tohoto seznamu.

5. Ověřte a potvrďte. Každé pole, zejména datum, jméno a předmět, lidé porovnávají s dokumenty a záznamy autority.

Tip: Explicitně dejte AI povolení „nechat prázdné“. V opačném případě „uhádne“ vyplní datum nebo autora, který v dokumentu není, a vloží do vašeho katalogu falešná metadata. Pokyn „Nechte toto pole prázdné, pokud není v dokumentu“ je nejsilnějším štítem proti halucinacím.

Pole a úroveň důvěryhodnosti v tabulce

Pole metadat

Jak spolehlivá je AI?

ověření

jazyk

vysoká

vzorek

Typ dokumentu

středně vysoká

ovládání

Jména osob/míst

Střední (chyba čtení)

povinné

datum

Nízké střední (riziko výroby)

povinné

Předmětové podmínky

Střední (volné generování)

Mapa ke kontrolnímu seznamu

Rozsah/shrnutí

středně vysoká

Porovnej se zdrojem

Referenční kód

Žádný (poskytuje instituce)

lidské hody

Shrnutí: AI je rychlá a spolehlivá v oblastech, jako je jazyk a žánr; generuje koncepty v polích, jako je datum, jméno a předmět, ale je vyžadován lidský souhlas; AI nikdy nevytváří institucionální pole, jako je referenční kód.

tři mini pouzdra

Případ 1 — Návrh metadat pro 8 000 fotografií. Městský archiv katalogizoval 8 000 historických fotografií. Poznámky na zadní straně každé fotografie byly přepsány a předány AI; AI vygenerovala datum, místo a osnovu tématu. Lidský tým to ověřil pole po poli a namapoval do kontrolovaného seznamu. Odhadovaná 10měsíční pracovní doba byla zkrácena na 3 měsíce; ale každé datum a název místa byly vizuálně zkontrolovány.

Případ 2 – Vymyšlená historie. Archivář měl AI katalog nedatovaného dopisu. YZ se podíval na obsah dopisu a přesně napsal datum „1912“. V dokumentu však nebylo žádné datum; AI předpověděla. Pokud by archivář nedoplnil pokyn „nechat prázdné, pokud není v dokumentu“, byl by katalog vyplněn sestrojeným datem. Lekce: Prázdné oprávnění je povinné.

Případ 3 – Volný předmět způsobil zmatek. AI přiřadila podobným dokumentům podobné, ale odlišné volné termíny jako „imigrace“, „přistěhovalectví“, „vyrovnání“. Když nebylo namapováno do kontrolované slovní zásoby, bylo stejné téma označeno třemi různými termíny a rozptýleno ve vyhledávání. Konzistence bylo dosaženo mapováním pojmů do jednoho seznamu autorit. Lekce: termíny tématu nejsou uvolněny, jsou propojeny se seznamem.

Čtyři kopírovatelné šablony

1) Přehled Dublin Core:

Extrahujte koncept metadat Dublin Core z přepisu dokumentu níže. Pole: Název, Tvůrce, Předmět, Popis, Datum, Žánr, Jazyk, Rozsah (místo/období). Pravidla: (1) V textu používejte pouze JASNĚ informace. (2) Ponechte pole, které není v textu prázdné, nehádejte. (3) Označte hodnotu, kterou si nejste jisti, pomocí [?]. Přepis: [zde]

2) Definice návrhu ISAD(G):

Vygenerujte koncept pro následující dokument v polích ISAD(G): Název, Datum(a), Úroveň popisu (dokument/soubor), Rozsah a obsah (krátké shrnutí), Tvůrce, Jazyk. Referenční kód ponechte PRÁZDNÝ (poskytne jej instituce). Nepřidávejte žádné informace, které nejsou v textu; Ponechte neexistující pole prázdné. Dokument: [zde]

3) Návrh tématu tématu (kontrolovaný):

Navrhněte 3–5 tematických termínů vhodných pro níže uvedený dokument. Nejprve se opřete o fakta V dokumentu. Níže je uveden seznam kontrolované terminologie naší instituce; NEJPRVE jej vyberte z tohoto seznamu, pokud v seznamu není, označte svůj nový návrh termínu samostatně. Seznam: [termíny]. Dokument: [zde]

4) Hromadná kontrola konzistence:

Níže jsou uvedeny metadatové záznamy pro dokumenty ze stejné kolekce. Nekonzistence příznaků: záznamy hláskující stejné místo/osobu odlišně, různé formáty data, různé výrazy pro stejný předmět. Oprava IMPOSITION; Stačí vytvořit seznam nesrovnalostí, aby si je mohl člověk prohlédnout. Záznamy: [zde]

Slabá výzva / Silná výzva

slabé:

Vytvořte úplný katalogový záznam pro tento dokument.

„Kompletní“ instrukce tlačí AI k vyplnění každého prostoru, tedy k vymýšlení historie a tvůrců, kteří neexistují.

Silný:

Pro tento dokument je navržen Dublin Core. Používejte pouze informace JASNĚ zahrnuté v přepisu; ponechte neexistující pole prázdné, nehádejte.Vyberte termíny tématu z tohoto kontrolovaného seznamu: [seznam]. Označte datum a jména osob pomocí [?], abych to mohl ověřit pomocí dokumentu. Přepis: [zde]

Rozdíl: povolení "nechat prázdné" místo "kompletního" vydání, kontrolované dodržování seznamu a ověřovací značky chrání katalog před zhotovením.

Časté chyby

  • Znamená to „naplnit úplně“. To vede k přizpůsobení neexistujících polí; mělo by být uděleno povolení „nechat prázdné“.
  • Uvolnění předmětových podmínek. Výrazy, které se nemapují do kontrolované slovní zásoby, budou rozptylovat hledání.
  • Umělá inteligence předpovídá historii. Zadání fiktivního data do nedatovaného dokumentu znečišťuje katalog.
  • Mít referenční kód vygenerovaný AI. Jedná se o firemní, jedinečný prostor; lidé házejí.
  • Bez specifikace standardu. Není-li standard uveden, výstupem bude zpackaný koncept, který nelze do instituce zadat.

V souhrnu

Metadata a katalogizace jsou neviditelnou infrastrukturou, která otevírá archiv badateli, a vyžaduje hodně úsilí. Z přepisu vytváří AI rychlý přehled pro pole, jako je datum, osoba, místo, předmět a žánr; Může pracovat podle standardů jako ISAD(G) nebo Dublin Core. Ale tlak na „úplné vyplnění“ tlačí AI, aby věci vymyslela; Povolení „nechat prázdné“, mapování do kontrolované slovní zásoby a lidské potvrzování dat/jmén udržuje katalog důvěryhodný. AI připraví návrh; Jste odpovědní za správnost katalogu.

Aplikační úkol

Vezměte si přepis dokumentu a vyžádejte si metadata od AI ​​pomocí šablony „Dublin Core draft“; Zkontrolujte, zda ponechává prázdná pole, která neexistují. Poté spusťte šablonu „návrhu tématu tématu“ s vlastním (nebo vzorovým) kontrolním seznamem. Nakonec otestujte několik záznamů pomocí „hromadné kontroly konzistence“. Všimněte si, kolik polí se AI ​​pokouší naplnit predikcí a kolik předmětových termínů je třeba namapovat do seznamu.

kontrolní seznam

  • [ ] Jasně jsem uvedl cílový standard (ISAD(G)/Dublin Core).
  • [ ] Dal jsem povolení "Nechte prázdné pole prázdné".
  • [ ] Namapoval jsem termíny tématu do kontrolovaného seznamu.
  • [ ] Ověřil jsem datum a jména osob se záznamem dokumentu/úřadu.
  • [ ] Referenční kód jsem nechal na instituci, ne na AI.