Enhet 4 / 12

Metadata, katalogisering och klassificering

Vinster:

  • Förmåga att producera metadatautkast i enlighet med standarder som ISAD(G) eller Dublin Core med artificiell intelligens
  • Förmåga att förhindra hallucinationer och kartlägga ämnestermer till kontrollerat ordförråd med lämna tomt tillstånd
  • Förmåga att särskilja vilka fält, såsom datum, personnamn och referenskod, som kräver mänskligt godkännande och vilka endast bör tilldelas av institutionen

Ett arkiv eller bibliotek, oavsett hur rikt det är, kan inte hittas om det inte är väl definierat. Det som gör ett dokument "finnbart" är den beskrivande informationen om det: vem skrev det, när, var, vad är dess ämne, vilken samling det tillhör. Denna information kallas metadata (metadata — beskrivande data om ett dokument; ”data om data”). Katalogisering är processen att identifiera dokument med denna metadata och spara dem i ett sökbart system. Klassificering är att organisera dokument efter kriterier som ämne, typ eller ursprung.

Att generera metadata är extremt tidskrävande; Att ange datum, ämne, person och platsinformation individuellt för tusentals dokument i stora samlingar kan ta år. AI är en stark draggenerator i den här branschen. I den här enheten kommer vi att se hur man genererar metadata med AI, katalogisering i enlighet med standarder (ISAD(G), Dublin Core), och både kraften och fallgroparna med automatisk klassificering.

Arkivstandarder: varför de behövs

Metadata läggs inte in slumpmässigt; Det finns internationella standarder så att register från olika institutioner kan prata med varandra:

  • ISAD(G) (General International Standard Archival Description): Regler för att beskriva arkivmaterial hierarkiskt (på fond-, serie-, fil-, dokumentnivå). Den innehåller fält som referenskod, titel, datum, omfattning, skapare.
  • Dublin Core: En gemensam standard som består av 15 kärnfält för att beskriva digitala resurser (titel, skapare, ämne, datum, genre, format, källa, språk, etc.).
  • Fond: En uppsättning register som naturligt bildas som ett resultat av en enskild persons, familjs eller institutions aktiviteter. Det är den grundläggande organiserande enheten för arkivering.
  • Härkomst (ursprung): Information om vem en handling kommer ifrån och vilken hand den passerat. Vid arkivering hålls handlingar samman efter deras ursprung.

Att explicit specificera målstandarden när AI:n producerar metadata säkerställer att resultatet är direkt inmatningsbart i företaget.

Ett annat nyckelbegrepp är auktoritetspost – en post som definierar en enda, standard, godkänd form av namnet på en person, plats eller institution. I historiska dokument kan samma person eller plats förekomma med olika stavningar; Myndighetsposten binder dem alla till ett enda godkänt format så att de inte blir utspridda i sökningen. AI föreslår namn från ett dokument; men att kartlägga detta namn till standardformuläret i myndighetsprotokollet är mänskligt arbete. Att länka vad AI säger "Ahmed" till "Ahmed Bey (1840-1912)" i institutionens auktoritetsregister bevarar konsistensen i katalogen.

Arbetsflöde: steg för steg

1. Förbered källan. Samla in en utskrift eller bild av dokumentet och all sammanhangsinformation.

2. Identifiera standarden och områdena. Berätta för AI vilken standard (ISAD(G), Dublin Core) och enligt vilka fält den kommer att producera utdata.

3. Skapa utkast till metadata. AI fyller i fält som kan extraheras från dokumentet (datum, person, plats, ämne, språk, genre); Den lämnar tomma områden som den inte kan ta bort.

4. Karta till kontrollerat ordförråd. Ämnes- och ortnamn är inte gratis i de flesta institutioner, utan är knutna till en fördefinierad lista (kontrollerad vokabulär / synonymordbok). Kartlägg ämnestermerna som föreslagits av AI till den här listan.

5. Verifiera och bekräfta. Varje fält, särskilt datum, namn och ämne, jämförs av människor med dokument och auktoriteter.

Tips: Ge uttryckligen AI-tillståndet att "lämna tomt". Annars kommer den att "gissa" att fylla i ett datum eller skapare som inte finns i dokumentet och infoga falsk metadata i din katalog. Instruktionen "Lämna detta fält tomt om det inte finns i dokumentet" är den starkaste skölden mot hallucinationer.

Fält och förtroendenivå i en tabell

Metadatafält

Hur pålitlig är AI?

verifiering

språk

hög

prov

Dokumenttyp

medelhög

kontroll

Person-/ortnamn

Medium (läsfel)

obligatorisk

datum

Låg-medel (risk för tillverkning)

obligatorisk

Ämnesvillkor

Medium (fri generering)

Karta till checklista

Omfattning/sammanfattning

medelhög

Jämför med källan

Referenskod

Ingen (institutionen ger)

mänskliga kast

Sammanfattning: AI är snabb och pålitlig inom områden som språk och genre; genererar utkast i fält som datum, namn och ämne, men mänskligt godkännande krävs; AI producerar aldrig institutionella fält som referenskod.

tre minifodral

Fall 1 — Utkast till metadata för 8 000 foton. Ett stadsarkiv katalogiserade 8 000 historiska fotografier. Anteckningarna på baksidan av varje foto transkriberades och gavs till AI; AI-genererad datum, plats och ämnesöversikt. Det mänskliga teamet verifierade det fält för fält och mappade det till den kontrollerade listan. Uppskattningsvis 10 månaders jobb reducerades till 3 månader; men varje datum och platsnamn kontrollerades visuellt.

Fall 2 — Sammanfattad historia. En arkivarie hade AI-katalogen ett odaterat brev. YZ tittade på innehållet i brevet och skrev datumet "1912" exakt. Det fanns dock inget datum i dokumentet; AI förutspådde. Om arkivarien inte hade lagt till instruktionen "lämna tomt om inte i dokumentet" hade katalogen fyllts med ett påhittat datum. Lektion: tomt tillstånd är obligatoriskt.

Fall 3 – Fria ämnestermer skapade förvirring. AI tilldelade liknande men olika fria termer som "immigration", "immigration", "bosättning" till liknande dokument. När det inte var mappat till det kontrollerade ordförrådet taggades samma ämne med tre olika termer och spreds i sökningen. Överensstämmelse uppnåddes genom att kartlägga termerna till en enda myndighetslista. Lektion: ämnestermer släpps inte, de är länkade till listan.

Fyra kopierbara mallar

1) Dublin Core-översikt:

Extrahera Dublin Core-metadatautkastet från dokumenttranskriptionen nedan. Fält: Titel, Skapare, Ämne, Beskrivning, Datum, Genre, Språk, Omfattning (plats/period). Regler: (1) Använd endast information TYDLIGT i texten. (2) Lämna fältet som inte står i texten BLANKT, gissa inte. (3) Markera det värde du inte är säker på med [?]. Transkription: [här]

2) ISAD(G) utkast till definition:

Generera utkast för följande dokument i ISAD(G)-fält: Titel, Datum(n), Beskrivningsnivå (dokument/fil), Omfattning och innehåll (kort sammanfattning), Skapare, Språk. Lämna referenskoden BLANK (institutionen tillhandahåller den). Lägg inte till någon information som inte finns i texten; Lämna det obefintliga fältet tomt. Dokument: [här]

3) Ämnestermförslag (kontrollerat):

Föreslå 3-5 ämnestermer som är lämpliga för dokumentet nedan. Förlita dig först på fakta I dokumentet. Nedan är vår institutions kontrollerade terminologilista; Först, välj det från den här listan, om det inte finns i listan, markera ditt nya termförslag separat. Lista: [villkor]. Dokument: [här]

4) Bulkkonsistenskontroll:

Nedan finns metadataposter för dokument från samma samling. Flagga inkonsekvenser: poster som stavar samma plats/person på olika sätt, olika datumformat, olika termer för samma ämne. Rättelse IMPOSITION; Gör bara en lista över inkonsekvenser som människan kan granska. Rekord: [här]

Svag prompt / Stark prompt

Svag:

Skapa en komplett katalogpost för detta dokument.

Den "fullständiga" instruktionen pressar AI:n att fylla i varje utrymme, d.v.s. att uppfinna historia och skapare som inte existerar.

Stark:

Dublin Core är utarbetad för detta dokument. Använd endast information som TYDLIGT ingår i transkriptionen; lämna det obefintliga fältet tomt, gissa inte. Välj ämnestermer från denna kontrollerade lista: [lista]. Markera datum och personnamn med [?] så att jag kan verifiera det med dokumentet. Transkription: [här]

Skillnad: "lämna tomt"-tillstånd istället för "fullständig" utgåva, kontrollerad listavidhäftning och verifieringsmärken skyddar katalogen från tillverkning.

Vanliga misstag

  • Det betyder "fyll det helt". Detta leder till passande icke-existerande fält; "lämna tomt"-tillstånd bör ges.
  • Släpp ämnesvillkor. Termer som inte ansluter till det kontrollerade ordförrådet kommer att distrahera sökningen.
  • Att ha AI förutsäg historia. Att skriva in ett fiktivt datum i ett odaterat dokument förorenar katalogen.
  • Att ha referenskoden genererad av AI. Detta är ett unikt företagsutrymme; folk kastar.
  • Specificerar inte standarden. Om standarden inte nämns blir resultatet ett rörigt utkast som inte kan föras in i institutionen.

Sammanfattningsvis

Metadata och katalogisering är den osynliga infrastrukturen som öppnar arkivet för forskaren, och det kräver mycket ansträngning. Från transkriptionen producerar AI en snabb disposition för fält som datum, person, plats, ämne och genre; Det kan fungera enligt standarder som ISAD(G) eller Dublin Core. Men trycket att "fylla i helt" driver AI att hitta på saker; "lämna tomt"-tillstånd, kartläggning till kontrollerat ordförråd och mänsklig bekräftelse av datum/namn håller katalogen trovärdig. AI förbereder utkastet; Du ansvarar för att katalogen är korrekt.

Applikationsuppgift

Ta en dokumenttranskription och begär metadata från AI med mallen "Dublin Core draft"; Kontrollera att det lämnar tomma fält som inte finns. Kör sedan mallen "förslag på ämnestermer" med din egen (eller exempel) checklista. Testa slutligen några poster med en "bulkkonsistenskontroll." Notera hur många fält AI:n försöker fylla med förutsägelse och hur många ämnestermer som behöver mappas till listan.

checklista

  • [ ] Jag har tydligt angett målstandarden (ISAD(G)/Dublin Core).
  • [ ] Jag gav tillståndet "Lämna tomt fält tomt".
  • [ ] Jag mappade ämnestermerna till den kontrollerade listan.
  • [ ] Jag verifierade datum och personnamn med dokumentet/myndighetsposten.
  • [ ] Jag lämnade referenskoden till institutionen, inte till AI.