Enhed 4 / 12

Metadata, katalogisering og klassificering

Gevinster:

  • Evne til at producere metadata-udkast i overensstemmelse med standarder som ISAD(G) eller Dublin Core med kunstig intelligens
  • Evne til at forhindre hallucinationer og kortlægge emneord til kontrolleret ordforråd med tilladelse
  • Evne til at skelne hvilke felter, såsom dato, personnavn og referencekode, der kræver menneskelig godkendelse, og hvilke der kun bør tildeles af institutionen

Et arkiv eller bibliotek, uanset hvor rigt det er, kan ikke findes, medmindre det er veldefineret. Det, der gør et dokument "findeligt", er den beskrivende information om det: hvem skrev det, hvornår, hvor, hvad dets emne er, hvilken samling det tilhører. Disse oplysninger kaldes metadata (metadata — beskrivende data om et dokument; “data om data”). Katalogisering er processen med at identificere dokumenter med disse metadata og gemme dem i et søgbart system. Klassificering er at organisere dokumenter efter kriterier som emne, type eller oprindelse.

Generering af metadata er ekstremt tidskrævende; Indtastning af dato, emne, person og sted individuelt for tusindvis af dokumenter i store samlinger kan tage år. AI er en stærk trækgenerator i denne branche. I denne enhed vil vi se, hvordan man genererer metadata med AI, katalogisering i overensstemmelse med standarder (ISAD(G), Dublin Core), og både kraften og faldgruberne ved automatisk klassificering.

Arkivstandarder: hvorfor de er nødvendige

Metadata indtastes ikke tilfældigt; Der er internationale standarder, så optegnelser fra forskellige institutioner kan tale med hinanden:

  • ISAD(G) (General International Standard Archival Description): Regler for hierarkisk beskrivelse af arkivmateriale (på fond-, serie-, fil-, dokumentniveau). Den indeholder felter som referencekode, titel, dato, omfang, skaber.
  • Dublin Core: En fælles standard bestående af 15 kernefelter til beskrivelse af digitale ressourcer (titel, skaber, emne, dato, genre, format, kilde, sprog osv.).
  • Fonds: Et sæt optegnelser, der naturligt er dannet som følge af en enkelt persons, families eller institutions aktiviteter. Det er den grundlæggende organiserende enhed for arkivering.
  • Herkomst (oprindelse): Oplysninger om, hvem et dokument kommer fra, og hvilken hånd det har passeret. Ved arkivering opbevares dokumenter efter deres oprindelse.

Eksplicit specificering af målstandarden, når AI'en skal producere metadata, sikrer det, at outputtet kan indtastes direkte i virksomheden.

Et andet nøglebegreb er myndighedsregistrering - en post, der definerer en enkelt, standard, godkendt form af navnet på en person, et sted eller en institution. I historiske dokumenter kan samme person eller sted optræde med forskellige stavemåder; Autoritetsposten binder dem alle til et enkelt godkendt format, så de ikke bliver spredt i søgningen. AI foreslår navne fra et dokument; men at kortlægge dette navn til standardformularen i myndighedsjournalen er menneskeligt arbejde. Sammenkædning af, hvad AI siger "Ahmed" til "Ahmed Bey (1840-1912)" i institutionens autoritetsregistrering bevarer katalogets konsistens.

Workflow: trin for trin

1. Forbered kilden. Indsaml et udskrift eller billede af dokumentet og enhver kontekstinformation.

2. Identificer standarden og områderne. Fortæl AI hvilken standard (ISAD(G), Dublin Core) og i henhold til hvilke felter den vil producere output.

3. Generer udkast til metadata. AI udfylder felter, der kan udtrækkes fra dokumentet (dato, person, sted, emne, sprog, genre); Den efterlader de områder, den ikke kan fjerne, tomme.

4. Kort til kontrolleret ordforråd. Emne- og stednavne er ikke gratis i de fleste institutioner, men er knyttet til en foruddefineret liste (kontrolleret ordforråd / synonymordbog). Tilknyt emnetermerne foreslået af AI til denne liste.

5. Bekræft og bekræft. Hvert felt, især dato, navn og emne, sammenlignes af mennesker med dokumenter og autoriteter.

Tip: Giv eksplicit AI'en tilladelse til at "lade tom". Ellers vil den "gætte" udfylde en dato eller skaber, der ikke er i dokumentet, og indsætte falske metadata i dit katalog. Instruktionen "Lad dette felt stå tomt, hvis det ikke er i dokumentet" er det stærkeste skjold mod hallucinationer.

Felter og tillidsniveau i en tabel

Metadata felt

Hvor pålidelig er AI?

verifikation

sprog

høj

prøve

Dokumenttype

medium-høj

kontrol

Person-/stednavne

Medium (læsefejl)

obligatorisk

dato

Lav-medium (risiko for fremstilling)

obligatorisk

Fagvilkår

Medium (fri generering)

Kort til tjekliste

Omfang/resumé

medium-høj

Sammenlign med kilden

Referencekode

Ingen (institutionen giver)

menneskelige kast

Resumé: AI er hurtig og pålidelig inden for områder som sprog og genre; genererer udkast i felter som dato, navn og emne, men menneskelig godkendelse er påkrævet; AI producerer aldrig institutionelle felter som referencekode.

tre minisager

Case 1 — Udkast til metadata for 8.000 billeder. Et byarkiv katalogiserede 8.000 historiske fotografier. Noterne på bagsiden af ​​hvert foto blev transskriberet og givet til AI; AI genereret dato, placering og emneoversigt. Det menneskelige team verificerede det felt for felt og tilknyttede det til den kontrollerede liste. Et anslået 10-måneders job blev reduceret til 3 måneder; men hver dato og stednavn blev visuelt kontrolleret.

Case 2 — Opdigtet historie. En arkivar havde AI-kataloget et udateret brev. YZ så på indholdet af brevet og skrev datoen "1912" præcist. Der var dog ingen dato i dokumentet; AI forudsagt. Hvis arkivaren ikke havde tilføjet instruktionen "lad tom hvis ikke i dokumentet", ville kataloget være blevet udfyldt med en opdigtet dato. Lektion: blank tilladelse er obligatorisk.

Case 3 – Frie emneord skabte forvirring. AI tildelte lignende, men forskellige frie termer såsom "immigration", "immigration", "bolig" til lignende dokumenter. Når det ikke var knyttet til det kontrollerede ordforråd, blev det samme emne tagget med tre forskellige termer og spredt i søgningen. Konsistens blev opnået ved at kortlægge vilkårene til en enkelt myndighedsliste. Lektion: Emneudtryk frigives ikke, de er knyttet til listen.

Fire kopierbare skabeloner

1) Dublin Core disposition:

Uddrag Dublin Core-metadataudkastet fra dokumenttransskriptionen nedenfor. Felter: Titel, Skaber, Emne, Beskrivelse, Dato, Genre, Sprog, Omfang (sted/periode). Regler: (1) Brug kun information TYDELIGT i teksten. (2) Lad det felt, der ikke er i teksten BLANK, ikke gætte. (3) Marker den værdi, du ikke er sikker på, med [?]. Transskription: [her]

2) ISAD(G) udkast til definition:

Generer udkast til følgende dokument i ISAD(G)-felter: Titel, Dato(r), Beskrivelsesniveau (dokument/fil), Omfang og indhold (kort resumé), Opretter, Sprog. Efterlad referencekoden BLANK (institutionen giver den). Tilføj ikke oplysninger, der ikke er i teksten; Lad det ikke-eksisterende felt stå tomt. Dokument: [her]

3) Emneudtryksforslag (kontrolleret):

Foreslå 3-5 emneudtryk, der passer til nedenstående dokument. Stol først på fakta I dokumentet. Nedenfor er vores institutions kontrollerede terminologiliste; FØRST skal du vælge det fra denne liste, hvis det ikke er på listen, marker dit nye termforslag separat. Liste: [vilkår]. Dokument: [her]

4) Kontrol af massekonsistens:

Nedenfor er metadataposter for dokumenter fra samme samling. Flag uoverensstemmelser: registreringer staver det samme sted/personen forskelligt, forskellige datoformater, forskellige udtryk for det samme emne. Rettelse IMPOSITION; Bare lav en liste over uoverensstemmelser, som mennesket kan gennemgå. Optegnelser: [her]

Svag prompt / Stærk prompt

Svag:

Opret en komplet katalogpost for dette dokument.

Den "komplette" instruktion skubber AI til at udfylde hvert rum, dvs. at opfinde historie og skabere, der ikke eksisterer.

Stærk:

Dublin Core er udarbejdet til dette dokument. Brug kun oplysninger, der Tydeligt er inkluderet i transskriptionen; lad det ikke-eksisterende felt stå tomt, lad være med at gætte. Vælg emneord fra denne kontrollerede liste: [liste]. Marker dato og personnavne med [?], så jeg kan bekræfte det med dokumentet. Transskription: [her]

Forskel: "lad tom" tilladelse i stedet for "komplet" udgave, kontrolleret listeoverholdelse og verifikationsmærker beskytter kataloget mod fremstilling.

Almindelige fejl

  • Det betyder "fyld det helt". Dette fører til passende ikke-eksisterende felter; "lad blank" tilladelse skal gives.
  • Frigivelse af emnevilkår. Udtryk, der ikke er knyttet til det kontrollerede ordforråd, vil distrahere søgningen.
  • At have AI til at forudsige historie. Indtastning af en fiktiv dato i et udateret dokument forurener kataloget.
  • At have referencekoden genereret af AI. Dette er et unikt firmarum; folk kaster.
  • Angiver ikke standarden. Hvis standarden ikke er nævnt, vil output være en rodet kladde, der ikke kan indtastes i institutionen.

Sammenfattende

Metadata og katalogisering er den usynlige infrastruktur, der åbner arkivet for forskeren, og det kræver en stor indsats. Ud fra transskriptionen producerer AI en hurtig disposition for felter som dato, person, sted, emne og genre; Det kan arbejde i henhold til standarder som ISAD(G) eller Dublin Core. Men presset for at "fylde helt ud" presser AI til at finde på tingene; "lad tom"-tilladelse, tilknytning til kontrolleret ordforråd og menneskelig bekræftelse af datoer/navne holder kataloget troværdigt. AI forbereder udkastet; Du er ansvarlig for katalogets nøjagtighed.

Ansøgningsopgave

Tag en dokumenttransskription og anmod om metadata fra AI med "Dublin Core draft" skabelonen; Tjek, at den efterlader tomme felter, der ikke findes. Kør derefter skabelonen "emnetermforslag" med din egen (eller eksempel) tjekliste. Til sidst skal du teste et par poster med et "bulk-konsistenstjek." Bemærk, hvor mange felter AI forsøger at udfylde med forudsigelse, og hvor mange emnetermer, der skal tilknyttes listen.

tjekliste

  • [ ] Jeg har klart angivet målstandarden (ISAD(G)/Dublin Core).
  • [ ] Jeg gav tilladelsen "Lad et tomt felt stå tomt".
  • [ ] Jeg kortlagde emnetermerne til den kontrollerede liste.
  • [ ] Jeg bekræftede datoen og personnavnene med dokument-/myndighedsposten.
  • [ ] Jeg overlod referencekoden til institutionen, ikke til AI.