Nyereség:
- Képesség metaadat-vázlatok előállítására olyan szabványok szerint, mint az ISAD(G) vagy a Dublin Core mesterséges intelligenciával
- Képes a hallucinációk megelőzésére és a tárgykifejezések ellenőrzött szókincsbe történő leképezésére üresen hagyott engedéllyel
- Meg tudja különböztetni, hogy mely mezőkhöz (például dátum, személynév és hivatkozási kód) van szükség emberi jóváhagyásra, és melyeket csak az intézmény rendelhet hozzá
Egy archívumot vagy könyvtárat, akármilyen gazdag is, nem lehet megtalálni, hacsak nincs jól meghatározott. Egy dokumentumot „kereshetővé” tesz a róla szóló leíró információ: ki írta, mikor, hol, mi a tárgya, milyen gyűjteményhez tartozik. Ezt az információt metaadatoknak nevezik (metaadatok – leíró adatok egy dokumentumról; „adatok az adatokról”). A katalogizálás az a folyamat, amelynek során a metaadatokkal rendelkező dokumentumokat azonosítják, és elmentik egy kereshető rendszerbe. Az osztályozás célja a dokumentumok olyan kritériumok szerinti rendszerezése, mint a tárgy, típus vagy származás.
A metaadatok előállítása rendkívül időigényes; A dátum, a téma, a személy és a hely információinak egyenkénti megadása több ezer dokumentumhoz nagy gyűjteményben évekbe telhet. Az AI erős huzatgenerátor ebben az üzletben. Ebben az egységben látni fogjuk, hogyan generálhatunk metaadatokat mesterséges intelligencia segítségével, a szabványok szerinti katalogizálással (ISAD(G), Dublin Core), valamint az automatikus osztályozás erejét és buktatóit.
Levéltári szabványok: miért van szükség rájuk
A metaadatok bevitele nem véletlenszerűen történik; Léteznek nemzetközi szabványok, amelyek lehetővé teszik, hogy a különböző intézmények iratai beszélhessenek egymással:
- ISAD(G) (General International Standard Archival Description): Az irattári anyagok hierarchikus leírásának szabályai (alap, sorozat, dosszié, dokumentum szinten). Olyan mezőket tartalmaz, mint a hivatkozási kód, cím, dátum, hatókör, alkotó.
- Dublin Core: Egy közös szabvány, amely 15 alapvető mezőből áll a digitális források leírására (cím, alkotó, tárgy, dátum, műfaj, formátum, forrás, nyelv stb.).
- Fonds: Egyetlen személy, család vagy intézmény tevékenységének eredményeként természetesen létrejött iratok összessége. Ez az archiválás alapvető szervező egysége.
- Származási hely (eredet): Információ arról, hogy egy dokumentum kitől származik, és melyik kézen ment át. Az archiválás során az iratokat származásuk szerint együtt tárolják.
A célszabvány kifejezett meghatározása, amikor az AI metaadatokat állít elő, biztosítja, hogy a kimenet közvetlenül bevihető a vállalatba.
Egy másik kulcsfogalom a jogosultsági rekord – olyan rekord, amely egy személy, hely vagy intézmény nevének egyetlen, szabványos, jóváhagyott formáját határozza meg. A történelmi dokumentumokban ugyanaz a személy vagy hely eltérő írásmóddal is előfordulhat; A jogosultsági rekord mindegyiket egyetlen jóváhagyott formátumba köti, hogy ne szóródjanak szét a keresésben. Az AI neveket javasol egy dokumentumból; de ennek a névnek a szabványos formára való leképezése a jogosultsági rekordban emberi munka. Az AI „Ahmed” és „Ahmed Bey (1840-1912)” szövegének összekapcsolása az intézmény hatósági nyilvántartásában megőrzi a katalógus konzisztenciáját.
Munkafolyamat: lépésről lépésre
1. Készítse elő a forrást. Gyűjtsd össze a dokumentum átiratát vagy képét és a környezeti információkat.
2. Határozza meg a szabványt és a területeket. Mondja meg az AI-nak, hogy melyik szabvány (ISAD(G), Dublin Core) és mely mezők szerint fog kimenni.
3. Készítsen metaadatok vázlatát. Az AI kitölti a dokumentumból kinyerhető mezőket (dátum, személy, hely, tárgy, nyelv, műfaj); Üresen hagyja azokat a területeket, amelyeket nem tud eltávolítani.
4. Térkép az ellenőrzött szókincshez. A tantárgy- és helynevek a legtöbb intézményben nem ingyenesek, hanem egy előre meghatározott listához (ellenőrzött szókincs / tezaurusz) vannak kötve. Az AI által javasolt tárgykifejezéseket társítsa ehhez a listához.
5. Ellenőrizze és erősítse meg. Minden mezőt, különösen a dátumot, nevet és tárgyat, az emberi lények összehasonlítják dokumentumokkal és hatósági nyilvántartásokkal.
Tipp: Explicit módon adja meg az AI engedélyt az „üresen hagyni”. Ellenkező esetben "kitalál" olyan dátumot vagy alkotót, amely nem szerepel a dokumentumban, és hamis metaadatokat illeszt be a katalógusába. A „Hagyja üresen ezt a mezőt, ha nem szerepel a dokumentumban” utasítás a legerősebb pajzs a hallucináció ellen.
Mezők és megbízhatósági szint egy táblázatban
Metaadat mező
Mennyire megbízható az AI?
ellenőrzése
nyelvet
magas
minta
Dokumentum típusa
középmagas
irányítani
Személy-/helynevek
Közepes (olvasási hiba)
kötelező
dátum
Alacsony-közepes (gyártás veszélye)
kötelező
Tárgyi feltételek
Közepes (szabad generálás)
Térkép az ellenőrzőlistához
Hatály/összefoglaló
középmagas
Hasonlítsa össze a forrással
Hivatkozási kód
Nincs (az intézmény ad)
emberi dobások
Összegzés: A mesterséges intelligencia gyors és megbízható olyan területeken, mint a nyelv és a műfaj; piszkozatokat hoz létre olyan mezőkben, mint a dátum, név és tárgy, de emberi jóváhagyás szükséges; Az AI soha nem hoz létre intézményi mezőket, például referenciakódot.
három mini tok
1. eset – 8000 fénykép metaadat-vázlata. Egy városi archívum 8000 történelmi fényképet katalogizált. Az egyes fényképek hátoldalán található jegyzeteket átírták és átadták az MI-nek; AI által generált dátum, hely és témavázlat. Az emberi csapat mezőről mezőre ellenőrizte és felvette az ellenőrzött listára. A becslések szerint 10 hónapos munkaidőt 3 hónapra csökkentették; de minden dátumot és helynevet szemrevételezéssel ellenőriztek.
2. eset – Kitalált előzmények. Egy levéltárosnak volt egy MI-katalógusa egy dátum nélküli levelet. YZ megnézte a levél tartalmát, és pontosan ráírta a dátumot: „1912”. A dokumentumban azonban nem volt dátum; Az AI megjósolta. Ha a levéltáros nem adta volna hozzá a „hagyja üresen, ha nincs a dokumentumban” utasítást, akkor a katalógus egy elkészített dátummal lett volna kitöltve. Tanulság: üres engedély kötelező.
3. eset – A szabad tárgykifejezések zavart keltettek. A mesterséges intelligencia hasonló, de eltérő szabad kifejezéseket, például „bevándorlás”, „bevándorlás”, „település” rendelt a hasonló dokumentumokhoz. Amikor nem volt hozzárendelve a szabályozott szókincshez, ugyanazt a témát három különböző kifejezéssel jelölték meg, és szétszórták a keresésben. A konzisztenciát úgy sikerült elérni, hogy a kifejezéseket egyetlen hatósági listába leképezték. Tanulság: a témakifejezések nem kerülnek kiadásra, a listához kapcsolódnak.
Négy másolható sablon
1) A Dublin Core vázlata:
Bontsa ki a Dublin Core metaadat-vázlatot az alábbi dokumentumátiratból. Mezők: Cím, Alkotó, Tárgy, Leírás, Dátum, Műfaj, Nyelv, Hatáskör (hely/időszak). Szabályok: (1) Csak a szövegben szereplő információkat használjon EGYÉRTELMŰEN. (2) A szövegben nem szereplő mezőt hagyja ÜRES, ne találgasson. (3) Jelölje [?]-vel azt az értéket, amelyben nem biztos. Átírás: [itt]
2) ISAD(G) definíciótervezet:
Készítsen vázlatot a következő dokumentumhoz az ISAD(G) mezőkben: Cím, dátum(ok), Leírás szintje (dokumentum/fájl), Hatály és tartalom (rövid összefoglaló), Alkotó, Nyelv. A hivatkozási kódot hagyja ÜRESEN (az intézmény megadja). Ne adjon hozzá olyan információt, amely nem szerepel a szövegben; Hagyja üresen a nem létező mezőt. Dokumentum: [itt]
3) Témakifejezés-javaslat (ellenőrzött):
Javasoljon 3-5 témakifejezést, amely megfelel az alábbi dokumentumnak. Először is támaszkodjon a dokumentumban szereplő tényekre. Az alábbiakban intézményünk ellenőrzött terminológiai listája található; ELŐSZÖR ebből a listából válassza ki, ha nincs a listában, jelölje meg külön az új kifejezésjavaslatot. Lista: [kifejezések]. Dokumentum: [itt]
4) Tömeges konzisztencia ellenőrzése:
Az alábbiakban ugyanabból a gyűjteményből származó dokumentumok metaadatrekordjai láthatók. Jelölő inkonzisztenciák: ugyanazt a helyet/személyt eltérően írják, eltérő dátumformátumok, eltérő kifejezések ugyanarra a tárgyra. Javítás BEHELYEZÉS; Csak készítsen egy listát az inkonzisztenciákról, hogy az ember áttekinthesse. Feljegyzések: [itt]
Gyenge felszólítás / Erős felszólítás
Gyenge:
Hozzon létre egy teljes katalógusrekordot ehhez a dokumentumhoz.
A „teljes” utasítás arra készteti az AI-t, hogy minden helyet kitöltsen, vagyis olyan történelmet és nem létező alkotókat találjon ki.
Erős:
A Dublin Core ehhez a dokumentumhoz készült. Csak olyan információkat használjon, amelyek egyértelműen szerepelnek az átírásban; hagyja üresen a nem létező mezőt, ne találgasson.Válasszon témakifejezéseket ebből a szabályozott listából: [lista]. Jelölje meg a dátumot és a személyek nevét [?]-vel, hogy a dokumentummal ellenőrizhessem. Átírás: [itt]
Különbség: a "teljes" kiadás helyett "üresen hagyja" engedély, az ellenőrzött listatartás és az ellenőrző jelek védik a katalógust a gyártástól.
Gyakori hibák
- Azt jelenti, hogy "töltsd ki teljesen". Ez nem létező mezők illesztéséhez vezet; "üresen hagyja" engedélyt kell adni.
- Tárgyi feltételek kiadása. Azok a kifejezések, amelyek nem illeszkednek a szabályozott szókészlethez, elvonják a keresést.
- A mesterséges intelligencia előrejelzése a történelemről. A fiktív dátum beírása egy dátum nélküli dokumentumba szennyezi a katalógust.
- Az AI által generált referenciakóddal. Ez egy céges, egyedi tér; az emberek dobnak.
- Nem határozza meg a szabványt. Ha a szabványt nem említik, akkor a kimenet egy rendetlen tervezet lesz, amelyet nem lehet bevinni az intézménybe.
Összefoglalva
A metaadatok és a katalogizálás az a láthatatlan infrastruktúra, amely megnyitja az archívumot a kutató előtt, és ez sok erőfeszítést igényel. Az átírásból a mesterséges intelligencia gyors vázlatot készít olyan mezőkről, mint a dátum, személy, hely, téma és műfaj; Működhet olyan szabványok szerint, mint az ISAD(G) vagy a Dublin Core. De a „teljes kitöltésre” irányuló nyomás arra készteti az AI-t, hogy kitalálja a dolgokat; Az „üresen hagyni” engedély, az ellenőrzött szókészlethez való hozzárendelés és a dátumok/nevek emberi megerősítése megőrzi a katalógus megbízhatóságát. A mesterséges intelligencia elkészíti a tervezetet; Ön felelős a katalógus pontosságáért.
Pályázati feladat
Készítsen dokumentumátírást, és kérjen metaadatokat az AI-tól a „Dublin Core draft” sablonnal; Ellenőrizze, hogy nem hagy-e üresen olyan mezőket, amelyek nem léteznek. Ezután futtassa a „témakifejezés-javaslat” sablont saját (vagy minta) ellenőrzőlistájával. Végül teszteljen néhány rekordot „tömeges konzisztencia-ellenőrzéssel”. Jegyezze meg, hogy a mesterséges intelligencia hány mezőt próbál kitölteni előrejelzéssel, és hány tárgykifejezést kell hozzárendelni a listához.
ellenőrző lista
- [ ] Világosan megadtam a célszabványt (ISAD(G)/Dublin Core).
- [ ] Megadtam az "Üres mező üresen hagyása" engedélyt.
- [ ] A témakifejezéseket leképeztem a kontrollált listára.
- [ ] A dátumot és a személyneveket az okirattal/hatósági jegyzőkönyvvel igazoltam.
- [ ] A hivatkozási kódot az intézményre hagytam, nem az AI-ra.