Winst:
- Mogelijkheid om metadata-concepten te produceren in overeenstemming met standaarden zoals ISAD(G) of Dublin Core met kunstmatige intelligentie
- Mogelijkheid om hallucinaties te voorkomen en onderwerptermen toe te wijzen aan gecontroleerde woordenschat met blanco toestemming
- Mogelijkheid om te onderscheiden welke velden, zoals datum, persoonsnaam en referentiecode, menselijke goedkeuring vereisen en welke alleen door de instelling mogen worden toegewezen
Een archief of bibliotheek, hoe rijk deze ook is, kan niet gevonden worden tenzij deze goed gedefinieerd is. Wat een document ‘vindbaar’ maakt, is de beschrijvende informatie erover: wie het heeft geschreven, wanneer, waar, wat het onderwerp is, tot welke collectie het behoort. Deze informatie wordt metadata genoemd (metadata – beschrijvende gegevens over een document; “gegevens over gegevens”). Catalogiseren is het proces waarbij documenten met deze metadata worden geïdentificeerd en opgeslagen in een doorzoekbaar systeem. Classificatie is het ordenen van documenten op basis van criteria zoals onderwerp, type of herkomst.
Het genereren van metadata is extreem tijdrovend; Het individueel invoeren van datum-, onderwerp-, persoons- en plaatsinformatie voor duizenden documenten in grote collecties kan jaren duren. AI is een sterke trekgenerator in deze branche. In deze unit zullen we zien hoe je met AI metadata kunt genereren, catalogiseren in overeenstemming met standaarden (ISAD(G), Dublin Core), en zowel de kracht als de valkuilen van automatische classificatie.
Archiefstandaarden: waarom ze nodig zijn
Metadata worden niet willekeurig ingevoerd; Er zijn internationale standaarden zodat documenten van verschillende instellingen met elkaar kunnen praten:
- ISAD(G) (General International Standard Archival Description): Regels voor het hiërarchisch beschrijven van archiefmateriaal (op fonds-, serie-, dossier-, documentniveau). Het bevat velden zoals referentiecode, titel, datum, bereik, maker.
- Dublin Core: Een gemeenschappelijke standaard bestaande uit 15 kernvelden voor het beschrijven van digitale bronnen (titel, maker, onderwerp, datum, genre, formaat, bron, taal, etc.).
- Fonds: Een reeks documenten die op natuurlijke wijze zijn gevormd als gevolg van de activiteiten van één persoon, familie of instelling. Het is de fundamentele organisatie-eenheid van archivering.
- Herkomst (oorsprong): Informatie over van wie een document afkomstig is en door welke hand het is gepasseerd. Bij archivering worden documenten bij elkaar gehouden op basis van hun herkomst.
Het expliciet specificeren van de doelstandaard bij het laten produceren van metadata door de AI zorgt ervoor dat de output direct in de onderneming kan worden ingevoerd.
Een ander belangrijk concept is autoriteitsrecord: een record dat één enkele, standaard, goedgekeurde vorm van de naam van een persoon, plaats of instelling definieert. In historische documenten kan dezelfde persoon of plaats met verschillende spellingen voorkomen; Het autoriteitsrecord bundelt ze allemaal in één goedgekeurd formaat, zodat ze niet verspreid raken tijdens de zoekopdracht. AI suggereert namen uit een document; maar het koppelen van deze naam aan het standaardformulier in het autoriteitsdossier is mensenwerk. Door wat de AI zegt ‘Ahmed’ te koppelen aan ‘Ahmed Bey (1840-1912)’ in het autoriteitsdossier van de instelling, blijft de consistentie van de catalogus behouden.
Werkstroom: stap voor stap
1. Bereid de bron voor. Verzamel een transcriptie of afbeelding van het document en eventuele contextinformatie.
2. Identificeer de norm en gebieden. Vertel de AI welke standaard (ISAD(G), Dublin Core) en volgens welke velden hij output gaat produceren.
3. Genereer concept-metagegevens. AI vult velden in die uit het document kunnen worden gehaald (datum, persoon, plaats, onderwerp, taal, genre); Het laat de gebieden leeg die het niet kan verwijderen.
4. Kaart naar gecontroleerde woordenschat. Onderwerp- en plaatsnamen zijn in de meeste instellingen niet vrij, maar zijn gebonden aan een vooraf gedefinieerde lijst (gecontroleerde woordenschat / thesaurus). Wijs de door de AI voorgestelde onderwerptermen toe aan deze lijst.
5. Controleer en bevestig. Elk veld, vooral datum, naam en onderwerp, wordt door mensen vergeleken met documenten en archieven van autoriteit.
Tip: Geef de AI expliciet toestemming om ‘leeg te laten’. Anders zal het "raden" een datum of maker in te vullen die niet in het document staat en valse metagegevens in uw catalogus invoegen. De instructie ‘Laat dit veld leeg als het niet in het document staat’ is het sterkste schild tegen hallucinaties.
Velden en vertrouwensniveau in een tabel
Metagegevensveld
Hoe betrouwbaar is AI?
verificatie
taal
hoog
monster
Documenttype
middelhoog
controle
Persoons-/plaatsnamen
Gemiddeld (leesfout)
verplicht
datum
Laag-medium (risico op fabricage)
verplicht
Onderwerpvoorwaarden
Medium (gratis genereren)
Kaart naar checklist
Reikwijdte/samenvatting
middelhoog
Vergelijk met bron
Referentiecode
Geen (instelling geeft)
menselijke worpen
Samenvatting: AI is snel en betrouwbaar op gebieden als taal en genre; genereert concepten in velden zoals datum, naam en onderwerp, maar menselijke goedkeuring is vereist; AI produceert nooit institutionele velden zoals referentiecode.
drie minikoffers
Geval 1 — Stel metadata op voor 8.000 foto's. Een stadsarchief catalogiseerde 8.000 historische foto's. De aantekeningen op de achterkant van elke foto werden getranscribeerd en aan de AI gegeven; AI gegenereerde datum, locatie en onderwerpoverzicht. Het menselijke team heeft het veld voor veld geverifieerd en aan de gecontroleerde lijst toegevoegd. Een geschatte baan van 10 maanden werd teruggebracht tot 3 maanden; maar elke datum en plaatsnaam werd visueel gecontroleerd.
Geval 2 – Verzonnen geschiedenis. Een archivaris liet AI een ongedateerde brief catalogiseren. YZ keek naar de inhoud van de brief en schreef de datum "1912" nauwkeurig. Er stond echter geen datum in het document; AI voorspeld. Als de archivaris de instructie "leeg laten indien niet in het document" niet had toegevoegd, zou de catalogus gevuld zijn geweest met een verzonnen datum. Les: blanco toestemming is verplicht.
Geval 3 – Vrije onderwerptermen zorgden voor verwarring. AI kende vergelijkbare, maar verschillende vrije termen toe, zoals "immigratie", "immigratie", "nederzetting" aan soortgelijke documenten. Wanneer het niet werd toegewezen aan de gecontroleerde woordenschat, werd hetzelfde onderwerp getagd met drie verschillende termen en verspreid in de zoekopdracht. Consistentie werd bereikt door de termen in één enkele autoriteitslijst in kaart te brengen. Les: onderwerptermen worden niet vrijgegeven, ze zijn gekoppeld aan de lijst.
Vier kopieerbare sjablonen
1) Dublin Core-overzicht:
Haal het Dublin Core-metadataconcept uit de onderstaande documenttranscriptie. Velden: Titel, Maker, Onderwerp, Beschrijving, Datum, Genre, Taal, Omvang (locatie/periode). Regels: (1) Gebruik informatie alleen DUIDELIJK in de tekst. (2) Laat het veld dat niet in de tekst staat BLANK, gok niet. (3) Markeer de waarde waarvan u niet zeker bent met [?]. Transcriptie: [hier]
2) ISAD(G) ontwerpdefinitie:
Genereer een concept voor het volgende document in ISAD(G)-velden: Titel, Datum(en), Beschrijvingsniveau (document/bestand), Reikwijdte en inhoud (korte samenvatting), Maker, Taal. Laat de referentiecode BLANK (de instelling zal deze verstrekken). Voeg geen informatie toe die niet in de tekst staat; Laat het niet-bestaande veld leeg. Document: [hier]
3) Onderwerptermsuggestie (gecontroleerd):
Stel 3 tot 5 onderwerptermen voor die passen bij het onderstaande document. Vertrouw eerst op de feiten IN het document. Hieronder vindt u de gecontroleerde terminologielijst van onze instelling; Kies het EERST uit deze lijst. Als het niet in de lijst staat, markeer dan uw nieuwe termsuggestie apart. Lijst: [voorwaarden]. Document: [hier]
4) Bulkconsistentiecontrole:
Hieronder vindt u metadatarecords voor documenten uit dezelfde collectie. Inconsistenties met vlaggen: records die dezelfde plaats/persoon anders spellen, verschillende datumnotaties, verschillende termen voor hetzelfde onderwerp. Correctie IMPOSITIE; Maak gewoon een lijst met inconsistenties die de mens kan beoordelen. Gegevens: [hier]
Zwakke prompt/sterke prompt
Zwak:
Maak een compleet catalogusrecord voor dit document.
De ‘volledige’ instructie dwingt de AI om elke ruimte in te vullen, dat wil zeggen om geschiedenis en makers te verzinnen die niet bestaan.
Sterk:
Voor dit document is de Dublin Core opgesteld. Gebruik alleen informatie die DUIDELIJK in de transcriptie is opgenomen; laat het niet-bestaande veld leeg, gok niet. Selecteer onderwerptermen uit deze gecontroleerde lijst: [lijst]. Markeer de datum en persoonsnamen met [?], zodat ik dit kan verifiëren met het document. Transcriptie: [hier]
Verschil: toestemming voor "leeg laten" in plaats van "volledige" editie, gecontroleerde naleving van de lijst en controletekens beschermen de catalogus tegen verzinsels.
Veel voorkomende fouten
- Het betekent "volledig vullen". Dit leidt tot het aanpassen van niet-bestaande velden; Er moet toestemming voor ‘leeg laten’ worden gegeven.
- Onderwerptermen vrijgeven. Termen die niet in het gecontroleerde vocabulaire passen, leiden de zoekopdracht af.
- AI de geschiedenis laten voorspellen. Het invoeren van een fictieve datum in een ongedateerd document vervuilt de catalogus.
- De referentiecode laten genereren door AI. Dit is een zakelijke, unieke ruimte; mensen gooien.
- Het niet specificeren van de standaard. Als de standaard niet wordt vermeld, zal de output een rommelig concept zijn dat niet in de instelling kan worden ingevoerd.
Samengevat
Metadata en catalogisering vormen de onzichtbare infrastructuur die het archief toegankelijk maakt voor de onderzoeker, en dat vergt veel inspanning. Uit de transcriptie produceert AI een snel overzicht voor velden als datum, persoon, plaats, onderwerp en genre; Het kan werken volgens standaarden als ISAD(G) of Dublin Core. Maar de druk om ‘volledig in te vullen’ dwingt de AI om dingen goed te maken; 'Leve blanco'-toestemming, toewijzing aan gecontroleerde woordenschat en menselijke bevestiging van datums/namen zorgen ervoor dat de catalogus betrouwbaar blijft. AI bereidt het ontwerp voor; U bent verantwoordelijk voor de juistheid van de catalogus.
Applicatie taak
Maak een documenttranscriptie en vraag metadata op bij de AI met de template “Dublin Core draft”; Controleer of er lege velden achterblijven die niet bestaan. Voer vervolgens het sjabloon 'Onderwerptermsuggestie' uit met uw eigen (of voorbeeld) checklist. Test ten slotte een paar records met een ‘bulkconsistentiecontrole’. Merk op hoeveel velden de AI probeert te vullen met voorspellingen en hoeveel onderwerptermen aan de lijst moeten worden toegewezen.
controlelijst
- [ ] Ik heb de doelstandaard (ISAD(G)/Dublin Core) duidelijk aangegeven.
- [ ] Ik heb de toestemming "Leeg veld leeg laten" gegeven.
- [ ] Ik heb de onderwerptermen toegewezen aan de gecontroleerde lijst.
- [ ] Ik heb de datum en persoonsnamen geverifieerd met het document/autoriteitsrecord.
- [ ] Ik heb de referentiecode aan de instelling overgelaten, niet aan AI.