Câștiguri:
- Abilitatea de a produce proiecte de metadate în conformitate cu standarde precum ISAD(G) sau Dublin Core cu inteligență artificială
- Abilitatea de a preveni halucinațiile și de a mapa termenii subiectului cu un vocabular controlat cu permisiunea de a lăsa necompletat
- Capacitatea de a distinge care câmpuri, cum ar fi data, numele persoanei și codul de referință, necesită aprobare umană și care ar trebui să fie atribuite numai de instituție
O arhivă sau o bibliotecă, oricât de bogată ar fi, nu poate fi găsită decât dacă este bine definită. Ceea ce face ca un document să fie „găsibil” sunt informațiile descriptive despre el: cine l-a scris, când, unde, care este subiectul său, cărei colecție îi aparține. Aceste informații se numesc metadate (metadate — date descriptive despre un document; „date despre date”). Catalogarea este procesul de identificare a documentelor cu aceste metadate și salvarea lor într-un sistem de căutare. Clasificarea constă în organizarea documentelor în funcție de criterii precum subiectul, tipul sau originea.
Generarea metadatelor este extrem de consumatoare de timp; Introducerea individuală a informațiilor despre dată, subiect, persoană și loc pentru mii de documente din colecții mari poate dura ani. AI este un puternic generator de curent în această afacere. În această unitate, vom vedea cum să generăm metadate cu AI, catalogarea în conformitate cu standardele (ISAD(G), Dublin Core) și atât puterea, cât și capcanele clasificării automate.
Standarde de arhivă: de ce sunt necesare
Metadatele nu sunt introduse aleatoriu; Există standarde internaționale, astfel încât înregistrările de la diferite instituții să poată vorbi între ele:
- ISAD(G) (General International Standard Archival Description): Reguli pentru descrierea ierarhică a materialului de arhivă (la nivel de fond, serie, dosar, document). Conține câmpuri precum codul de referință, titlul, data, domeniul de aplicare, creatorul.
- Dublin Core: un standard comun format din 15 câmpuri de bază pentru descrierea resurselor digitale (titlu, creator, subiect, dată, gen, format, sursă, limbă etc.).
- Fond: Un set de înregistrări format în mod natural ca urmare a activităților unei singure persoane, familie sau instituție. Este unitatea organizatorică de bază a arhivării.
- Proveniență (origine): informații despre cine provine un document și prin ce mână a trecut. În arhivare, documentele se păstrează împreună în funcție de proveniența lor.
Specificarea explicită a standardului țintă atunci când AI produce metadate asigură că rezultatul poate fi introdus direct în întreprindere.
Un alt concept cheie este înregistrarea autorității – o înregistrare care definește o formă unică, standard, aprobată a numelui unei persoane, loc sau instituție. În documentele istorice, aceeași persoană sau loc poate apărea cu ortografii diferite; Înregistrarea de autoritate le leagă pe toate într-un singur format aprobat, astfel încât să nu fie împrăștiate în căutare. AI sugerează nume dintr-un document; dar maparea acestui nume cu forma standard din înregistrarea de autoritate este muncă umană. Legarea a ceea ce AI spune „Ahmed” cu „Ahmed Bey (1840-1912)” în evidența de autoritate a instituției păstrează consistența catalogului.
Flux de lucru: pas cu pas
1. Pregătiți sursa. Colectați o transcriere sau o imagine a documentului și orice informații de context.
2. Identificați standardul și zonele. Spuneți AI care standard (ISAD(G), Dublin Core) și în funcție de ce câmpuri va produce rezultate.
3. Generați metadate nefinalizate. AI completează câmpurile care pot fi extrase din document (data, persoană, loc, subiect, limbă, gen); Lasa goale zonele pe care nu le poate elimina.
4. Hartă la vocabular controlat. Numele subiectelor și locurilor nu sunt gratuite în majoritatea instituțiilor, dar sunt legate de o listă predefinită (vocabular controlat / tezaur). Mapați termenii subiectului sugerați de AI la această listă.
5. Verificați și confirmați. Fiecare domeniu, în special data, numele și subiectul, este comparat de ființele umane cu documentele și înregistrările de autoritate.
Sfat: dați explicit permisiunea AI de a „lasa necompletat”. În caz contrar, va „ghici” o dată sau un creator care nu se află în document și va introduce metadate false în catalogul dvs. Instrucțiunea „Lăsați acest câmp necompletat dacă nu este în document” este cel mai puternic scut împotriva halucinațiilor.
Câmpuri și nivelul de încredere într-un tabel
Câmp de metadate
Cât de fiabilă este AI?
verificarea
limbaj
înalt
probă
Tip document
mediu-înalt
control
Nume de persoane/locuri
Medie (eroare de citire)
obligatoriu
data
Scăzut-mediu (risc de fabricație)
obligatoriu
Termenii subiectului
Mediu (generare gratuită)
Hartă către lista de verificare
Domeniul de aplicare/rezumat
mediu-înalt
Comparați cu sursa
Cod de referință
Niciuna (instituția oferă)
aruncări umane
Rezumat: AI este rapidă și fiabilă în domenii precum limbajul și genul; generează schițe în câmpuri precum data, numele și subiectul, dar este necesară aprobarea umană; AI nu produce niciodată câmpuri instituționale, cum ar fi codul de referință.
trei mini cutii
Cazul 1 — Schiță de metadate pentru 8.000 de fotografii. O arhivă a orașului cataloga 8.000 de fotografii istorice. Notele de pe spatele fiecărei fotografii au fost transcrise și date AI; Data, locația și schița subiectului generate de AI. Echipa umană l-a verificat câmp cu câmp și l-a mapat pe lista controlată. Un loc de muncă estimat la 10 luni a fost redus la 3 luni; dar fiecare dată și nume de loc au fost verificate vizual.
Cazul 2 — Istoricul inventat. Un arhivar a catalogat AI o scrisoare nedatată. YZ s-a uitat la conținutul scrisorii și a scris exact data „1912”. Cu toate acestea, în document nu era o dată; AI a prezis. Daca arhivarul nu ar fi adaugat instructiunea „lasati necompletat daca nu in document”, catalogul ar fi fost completat cu data intocmita. Lecție: permisiunea în alb este obligatorie.
Cazul 3 – Termenii de subiect liber au creat confuzie. AI a atribuit unor documente similare termeni liberi similari, dar diferiți, cum ar fi „imigrare”, „imigrare”, „așezare”. Când nu a fost mapat la vocabularul controlat, același subiect a fost etichetat cu trei termeni diferiți și împrăștiat în căutare. Consecvența a fost obținută prin maparea termenilor într-o singură listă de autorități. Lecție: termenii subiectului nu sunt eliberați, sunt legați de listă.
Patru șabloane copiabile
1) Structura Dublin Core:
Extrageți schița de metadate Dublin Core din transcrierea documentului de mai jos. Câmpuri: Titlu, Creator, Subiect, Descriere, Data, Gen, Limbă, Domeniu (locație/perioada). Reguli: (1) Folosiți doar informațiile CLAR din text. (2) Lăsați câmpul care nu este în text GOL, nu ghiciți. (3) Marcați valoarea de care nu sunteți sigur cu [?]. Transcriere: [aici]
2) Proiect de definiție ISAD(G):
Generați schiță pentru următorul document în câmpurile ISAD(G): Titlu, Dată(e), Nivel de descriere (document/fișier), Domeniu și conținut (rezumat), Creator, Limbă. Lăsați codul de referință GOL (instituția îl va furniza). Nu adăugați nicio informație care nu este în text; Lăsați câmpul inexistent necompletat. Document: [aici]
3) Sugestie de termeni de subiect (controlat):
Sugerați 3-5 termeni de subiect corespunzători documentului de mai jos. În primul rând, bazați-vă pe faptele din document. Mai jos este lista terminologică controlată a instituției noastre; ÎNTÂI, alegeți-l din această listă, dacă nu este în listă, marcați noua sugestie de termen separat. Lista: [termeni]. Document: [aici]
4) Verificarea consistenței în vrac:
Mai jos sunt înregistrările de metadate pentru documente din aceeași colecție. Inconsecvențe de semnalizare: înregistrează ortografie diferită a aceluiași loc/persoană, formate diferite de date, termeni diferiți pentru același subiect. Corectare IMPOZIȚIE; Produceți doar o listă de inconsecvențe pe care oamenii să le revizuiască. Înregistrări: [aici]
Prompt slab / Prompt puternic
slab:
Creați o înregistrare completă a catalogului pentru acest document.
Instrucțiunea „completă” împinge AI să umple fiecare spațiu, adică să inventeze istorie și creatori care nu există.
Puternic:
Dublin Core este elaborat pentru acest document. Utilizați numai informațiile CLAR incluse în transcriere; lăsați câmpul inexistent necompletat, nu ghiciți.Selectați termenii subiectului din această listă controlată: [listă]. Marcați data și numele persoanelor cu [?], astfel încât să le pot verifica cu documentul. Transcriere: [aici]
Diferență: permisiunea „lăsați necompletat” în loc de ediția „completă”, aderarea controlată a listei și marcajele de verificare protejează catalogul de fabricare.
Greșeli comune
- Înseamnă „umple-l complet”. Acest lucru duce la potrivirea câmpurilor inexistente; Ar trebui să se acorde permisiunea „lasă necompletat”.
- Eliberarea termenilor subiectului. Termenii care nu se potrivesc cu vocabularul controlat vor distrage atenția căutării.
- Având AI prezice istoria. Introducerea unei date fictive într-un document nedatat poluează catalogul.
- Având codul de referință generat de AI. Acesta este un spațiu corporativ, unic; oamenii aruncă.
- Nu se specifică standardul. Dacă standardul nu este menționat, rezultatul va fi un proiect dezordonat care nu poate fi introdus în instituție.
În concluzie
Metadatele și catalogarea sunt infrastructura invizibilă care deschide arhiva pentru cercetător și necesită mult efort. Din transcriere, AI produce o schiță rapidă pentru câmpuri precum data, persoana, locul, subiectul și genul; Poate funcționa conform standardelor precum ISAD(G) sau Dublin Core. Dar presiunea de a „completa complet” împinge AI să inventeze lucrurile; Permisiunea de „lasare necompletată”, maparea la vocabular controlat și confirmarea umană a datelor/numelor păstrează catalogul de încredere. AI pregătește proiectul; Sunteți responsabil pentru acuratețea catalogului.
Sarcina de aplicare
Luați o transcriere a documentului și solicitați metadate de la IA cu șablonul „Dublin Core draft”; Verificați dacă lasă câmpuri goale care nu există. Apoi rulați șablonul „sugestie de termeni de subiect” cu propria dvs. listă de verificare (sau eșantion). În cele din urmă, testați câteva înregistrări cu o „verificare a coerenței în bloc”. Observați câte câmpuri AI încearcă să completeze cu predicții și câți termeni de subiect trebuie mapați la listă.
lista de verificare
- [ ] Am precizat clar standardul țintă (ISAD(G)/Dublin Core).
- [ ] Am dat permisiunea „Lăsați câmpul necompletat”.
- [ ] Am mapat termenii subiectului în lista controlată.
- [ ] Am verificat data și numele persoanelor cu documentul/registrul de autoritate.
- [ ] Am lăsat codul de referință instituției, nu AI.