zisky:
- Schopnost zkrátit dobu katalogizace vytvářením návrhů metadat v souladu se standardy jako MARC a Dublin Core ze skutečných informací o tiráži
- Schopnost ověřit pole s vysokým rizikem falšování, jako je rok vydání, ISBN, jméno autora, s původním zdrojem a mapovými předmětovými termíny z kontrolované slovní zásoby
- Schopnost zajistit, aby formáty autora a předmětu byly jednou schváleny s kontrolou autority a zachováním konzistence katalogu
Katalogizace je neviditelná, ale nejzákladnější práce knihovnictví. Objevení zdroje (knihy, článku, mapy, zvukové nahrávky, digitálního souboru) je možné se správnými metadaty. Metadata znamenají „data o datech“: strukturované informace, které popisují název zdroje, autora, rok vydání, předmět, jazyk a fyzické atributy. Pokud jsou metadata dobrá, uživatel najde zdroj; Pokud je špatný nebo neúplný, zdroj je ztracen, i když existuje. V této lekci se naučíte, jak používat umělou inteligenci při generování metadat, ale jak zajistit soulad a přesnost standardů.
Nejprve si definujme dva pojmy. MARC (Machine-Readable Cataloging) je formát záznamů, který knihovny používají po desetiletí, který umísťuje každou informaci do očíslovaných polí; Například pole 245 obsahuje název a pole 100 hlavního autora. Dublin Core je zjednodušený standard metadat pro digitální zdroje, který se skládá z 15 základních polí (název, tvůrce, předmět, datum, žánr atd.). Tyto standardy zajišťují, že záznamy z různých knihoven mohou spolu komunikovat.
Krok za krokem: generování návrhů metadat pomocí umělé inteligence
1. Shromážděte informace o identitě zdroje. Obálka knihy, titulní strana, obsah nebo text digitálního souboru. AI funguje pouze na základě informací, které jí poskytnete; Pokud poskytnete neúplné informace, vytvoří se neúplná nebo smyšlená metadata.
2. Zadejte cílový standard. Dejte AI jasný cíl, například „podle polí Dublin Core“ nebo „podle MARC 245, 100, 260, 650 polí“. Pokud neurčíte standard, vytvoří se libovolný formát.
3. Vytvořte návrh. AI navrhne název, prohlášení o odpovědnosti, informace o publikaci a návrh tématu z informací, které poskytnete.
4. Uplatňovat kontrolu autority. Autoritativní záznam je záznam, který stanoví jednotnou standardní formu jména autora, instituce nebo předmětu (např. „Atatürk, Mustafa Kemal, 1881-1938“). AI může napsat jméno různými způsoby; Zkontrolujete a opravíte formát schváleného oprávnění.
5. Ověřte a potvrďte. Porovnejte každé pole s původním zdrojem. Zejména přesné informace, jako je rok vydání, ISBN a jméno autora, jsou velmi náchylné na padělání AI.
Tip: Dejte AI fotku nebo text skutečné kreditní stránky zdroje; Neříkejte „hádejte název knihy“. Prediktivní metadata podkopávají spolehlivost katalogu. Umělá inteligence při předpovědích píše sebevědomě a to vás vyvede z omylu.
Kontrolovaná slovní zásoba a důslednost
Důslednost je v katalogizaci vším. Pokud je stejné téma napsáno se dvěma různými termíny ve dvou různých záznamech, uživatel najde jeden a druhý mu bude chybět. Proto knihovny používají řízenou slovní zásobu – schválený standardní seznam termínů. Při navrhování výrazů z volného textu může umělá inteligence zvolit spíše jeho hovorový ekvivalent než oficiální výraz v tomto seznamu. Umělá inteligence může například napsat „infarkt“; zatímco schválený termín může být "infarkt myokardu".
Řešením je dát AI řízený slovník a říct „vyber si z tohoto seznamu“. Takže namísto volného vymýšlení termínů AI odpovídá tomu nejvhodnějšímu ze schváleného seznamu.
Upozornění: Pokud předmětový termín navržený AI není v kontrolovaném slovníku, nepřidávejte tento termín do katalogu. Rozhodnutí o přidání nových termínů je na odborníkovi odpovědném za správu autority; Přidávání libovolných výrazů narušuje konzistenci katalogu.
tři mini pouzdra
Případ 1 – Zrychlení sbírání darů. Veřejná knihovna obdržela dar 1200 knih. Specialista na katalogizaci nechal AI přečíst tirážovou stránku každé knihy a vytvořit návrh Dublin Core; Čas na záznam se snížil z 9 minut na 3,5 minuty. Zbývající čas expert věnoval kontrole a ověřování autority; Celkový čas se zkrátil přibližně o 55 %, ale do systému nevstoupily žádné záznamy bez ověření.
Případ 2 – Bylo zachyceno falešné ISBN. Expert nechal AI vytvořit návrhy 30 knih. Při kontrole zjistil, že ISBN ve 4 záznamech bylo falešné: AI napsala 13místné číslo, které se zdálo rozumné, i když neznal skutečné číslo knihy. Krok ověření zabránil tomu, aby čtyři nesprávná čísla ISBN zůstala v katalogu trvalá.
Případ 3 – Opravena nedůslednost úřadu. Knihovna našla autora jako "J. Smith" v některých záznamech, "John Smith" v jiných, "Smith, John" v jiných. Umělá inteligence byla spárována se souborem autorit a všechny záznamy byly převedeny do jediného schváleného formátu ("Smith, John, 1965-"); Pokud by se tato práce dělala ručně, trvalo by to dny, ale s návrhem AI se to zkrátilo na několik hodin, ale každý zápas byl schválen odborníkem.
Retrospektivní konverze a staré záznamy
Mnoho knihoven má neúplné nebo zastaralé záznamy, které byly zadány před lety s jinými pravidly. Přesun těchto na současný standard se nazývá retrospektivní konverze a je velmi pracný, když se provádí ručně. Umělá inteligence dokáže přečíst starý záznam a vygenerovat koncept, který jej přesune do aktuální struktury pole: například může analyzovat citaci s volným textem a distribuovat ji do správných polí. Jsou zde však dvě nebezpečí. Za prvé, umělá inteligence může doplnit chybějící informace, aby je „doplnila“; za druhé, může zachovat chybu ve starém záznamu tím, že jej zkopíruje do nového formátu, místo aby jej opravoval. Proto by při retrospektivní transformaci měl být výstup AI kontrolován systematicky, nikoli vzorkováním, ale kritickými poli (autor, rok, identifikační čísla). Osvědčeným postupem je zobrazovat záznamy před a po konverzi vedle sebe, aby byla každá změna viditelná; takže odborník na první pohled vidí, co bylo přemístěno, co se změnilo a co mohlo být vyrobeno.
Upozornění: Koncept metadat vytvořený AI by se neměl přenášet do systému jako dávka, aniž byste je zkontrolovali jeden po druhém. Hromadná chyba poškodí stovky záznamů najednou a načítání je mnohem obtížnější než vytváření. Nejbezpečnější je vyrábět a ověřovat v malých sériích.
Čtyři kopírovatelné šablony
1) Přehled Dublin Core:
Vaše role: asistentka katalogizátora. Vyplňte pole Dublin Core z následujícího textu: Název, Tvůrce, Předmět, Popis, Vydavatel, Datum, Žánr, Formát, Jazyk. Používejte pouze informace, které jsou v textu jasné; Nechte chybějící pole „[no information]“, nehádejte. Text v tiráži: [zde]
2) Obrys pole MARC:
Navrhněte obrysy pro následující pole MARC z níže uvedených informací o knize: 245 (název/poděkování), 100 (hlavní autor), 260/264 (publikace), 300 (fyzický popis), 650 (předmět). Jakékoli pole, kterým si nejste jisti, označte jako „[potřebuje ověření]“. Informace: [zde]
3) Shoda témat z řízené slovní zásoby:
Níže je uveden souhrn zdroje a seznam schválených termínů tématu. Přiřaďte pouze 3–5 nejvhodnějších výrazů ze seznamu ke zdroji. Pokud v seznamu není vhodný termín, napište "v seznamu není vhodný termín", nevymýšlejte nové termíny. Shrnutí: [zde] / Seznam termínů: [zde]
4) Kontrola formuláře oprávnění:
Přiřaďte níže uvedená jména autorů ke schváleným formulářům v seznamu autorit, který jsem poskytl. Pro každé jméno: formát v záznamu -> schválený formát. Pokud v seznamu není ekvivalent, napište "žádný autoritní záznam". Jména: [zde] / Seznam autorit: [zde]
Slabá výzva / Silná výzva
Slabá výzva:
Extrahujte katalogizační informace pro následující knihu: "Umělá inteligence a společnost".
Je uveden pouze název; AI je nucena sestavit autora, rok, vydavatele a ISBN. Neexistuje žádný cílový standard. Výsledek: přesvědčivý, ale pravděpodobně falešný záznam.
Výkonná výzva:
Vaše role: asistentka katalogizátora. Níže je celý text tirážní stránky knihy. Z toho vyplňte pole Dublin Core. Používejte pouze informace, které jsou jasně uvedeny v textu; Ponechte netextové pole prázdné a napište "[žádné informace]". Nejsou vymyšlena žádná data, jména ani čísla ISBN. Text v tiráži: [celý text zde]
Výkonná výzva omezuje AI na skutečné vedlejší informace a nutí ji, aby místo vymýšlení poctivě nechávala mezery.
Pole metadat a tabulka ověření
oblast
Riziko výroby
Jak ověřit
Název
nízká
Porovnejte s otiskem stránky
Formát autor/autorita
střední
Hledejte v souboru autorit
Rok vydání
vysoká
Potvrďte otiskem / kolofonem
ISBN
velmi vysoká
Individuální ovládání s čárovým kódem/zdrojem
Předmětový termín
vysoká
Shoda v řízené slovní zásobě
Časté chyby
- Stačí si vyžádat metadata z názvu. Neúplné informace nutí umělou inteligenci k vymýšlení.
- Bez určení cílového standardu. Svévolné formátování narušuje harmonii záznamů.
- Přijetí čísla ISBN a roku bez jeho ověření. Tyto oblasti nesou nejvyšší riziko výroby.
- Převzetí předmětu z oblasti mimo kontrolovanou slovní zásobu. Konzistence a dostupnost jsou ohroženy.
- Obcházení kontroly autority. Stejný autor se rozptyluje v různých formátech, uživatel postrádá zdroj.
V souhrnu
Při generování metadat je umělá inteligence výkonným pomocníkem, který rychle extrahuje informace o tiráži a výrazně zkracuje dobu katalogizace. Cenou produktivity je však přísné ověřování proti rizikům výroby: ujasněte si cílový standard (MARC, Dublin Core), spouštějte AI pouze se skutečnými znalostmi klíčových slov, mapujte předmětové termíny z kontrolovaných slovníků a ověřujte autoritní formuláře. Místo doplnění mezer by to AI měla upřímně nechat prázdné; Konečné schválení si ponecháte.
Aplikační úkol
Předejte text stránky s potiskem skutečné knihy, kterou máte, AI pomocí šablony „Dublin Core draft“ a získejte koncept. Pak nechte vyrobit stejnou knihu pouze s názvem („Slabá výzva“) a porovnejte dva výstupy: která pole byla vyrobena? Poté pomocí šablony „Mapování tématu z kontrolovaného slovníku“ poskytněte krátký seznam schválených výrazů, aby se téma shodovalo, a zkontrolujte, zda AI neodchází ze seznamu.
kontrolní seznam
- [ ] Skutečnou identitu zdroje jsem předal AI, nenechal jsem to na hádání.
- [ ] Jasně jsem specifikoval cílový standard metadat (MARC/Dublin Core).
- [ ] Rok vydání a ISBN jsem ověřil doslovně s původním zdrojem.
- [ ] Tématické pojmy jsem zmapoval z řízené slovní zásoby.
- [ ] Potvrdil jsem formy oprávnění se schváleným záznamem.