Njësia 4 / 12

Metadata, Katalogimi dhe Klasifikimi

Fitimet:

  • Aftësia për të prodhuar drafte të meta të dhënave në përputhje me standardet si ISAD(G) ose Dublin Core me inteligjencë artificiale
  • Aftësia për të parandaluar halucinacionet dhe për të hartuar termat e lëndës në fjalorin e kontrolluar me leje të lënë bosh
  • Aftësia për të dalluar se cilat fusha, si data, emri i personit dhe kodi i referencës, kërkojnë miratim njerëzor dhe cilat duhet të caktohen vetëm nga institucioni

Një arkiv apo bibliotekë, sado e pasur të jetë, nuk mund të gjendet nëse nuk është e përcaktuar mirë. Ajo që e bën një dokument të “gjetshëm” është informacioni përshkrues rreth tij: kush e ka shkruar atë, kur, ku, cili është subjekti i tij, cilit koleksion i përket. Ky informacion quhet metadata (metadata - të dhëna përshkruese për një dokument; "të dhëna për të dhënat"). Katalogimi është procesi i identifikimit të dokumenteve me këto meta të dhëna dhe ruajtjes së tyre në një sistem të kërkueshëm. Klasifikimi është organizimi i dokumenteve sipas kritereve si lënda, lloji ose origjina.

Gjenerimi i meta të dhënave kërkon shumë kohë; Futja e datës, subjektit, personit dhe informacionit të vendit individualisht për mijëra dokumente në koleksione të mëdha mund të zgjasë me vite. Inteligjenca artificiale është një gjenerues i fuqishëm i rrymës në këtë biznes. Në këtë njësi, ne do të shohim se si të gjenerojmë meta të dhëna me AI, katalogimin në përputhje me standardet (ISAD(G), Dublin Core), si dhe fuqinë dhe kurthet e klasifikimit automatik.

Standardet arkivore: pse janë të nevojshme

Metadatat nuk futen rastësisht; Ekzistojnë standarde ndërkombëtare në mënyrë që të dhënat nga institucione të ndryshme të mund të flasin me njëri-tjetrin:

  • ISAD(G) (Përshkrim i Përgjithshëm i Standardeve Ndërkombëtare të Arkivit): Rregulla për përshkrimin e materialit arkivor në mënyrë hierarkike (në nivel fondi, seri, skedari, dokumenti). Ai përmban fusha të tilla si kodi i referencës, titulli, data, fushëveprimi, krijuesi.
  • Dublin Core: Një standard i përbashkët i përbërë nga 15 fusha thelbësore për përshkrimin e burimeve dixhitale (titulli, krijuesi, subjekti, data, zhanri, formati, burimi, gjuha, etj.).
  • Fonds: Një grup regjistrimesh të formuara natyrshëm si rezultat i aktiviteteve të një personi, familjeje ose institucioni të vetëm. Është njësia bazë organizative e arkivimit.
  • Prejardhja (origjina): Informacion se nga kush vjen një dokument dhe në cilën dorë ka kaluar. Në arkivim dokumentet mbahen së bashku sipas origjinës së tyre.

Specifikimi i qartë i standardit të synuar kur AI prodhon metadata siguron që produkti të jetë drejtpërdrejt i futshëm në ndërmarrje.

Një koncept tjetër kyç është regjistrimi i autoritetit - një regjistrim që përcakton një formë të vetme, standarde, të miratuar të emrit të një personi, vendi ose institucioni. Në dokumentet historike, i njëjti person ose vend mund të shfaqet me drejtshkrime të ndryshme; Regjistrimi i autoritetit i lidh të gjitha në një format të vetëm të miratuar në mënyrë që të mos shpërndahen në kërkim. AI sugjeron emra nga një dokument; por vendosja e këtij emri në formën standarde në regjistrin e autoritetit është punë njerëzore. Lidhja e asaj që AI thotë "Ahmed" me "Ahmed Beu (1840-1912)" në të dhënat e autoritetit të institucionit ruan konsistencën e katalogut.

Rrjedha e punës: hap pas hapi

1. Përgatitni burimin. Mblidhni një transkript ose imazh të dokumentit dhe çdo informacion rreth kontekstit.

2. Identifikoni standardin dhe fushat. Tregoji AI-së se cili standard (ISAD(G), Dublin Core) dhe sipas cilave fusha do të prodhojë rezultat.

3. Gjeneroni draft meta të dhëna. AI plotëson fushat që mund të nxirren nga dokumenti (data, personi, vendi, lënda, gjuha, zhanri); I lë bosh zonat që nuk mund t'i heqë.

4. Harto me fjalorin e kontrolluar. Emrat e lëndëve dhe vendeve nuk janë të lira në shumicën e institucioneve, por janë të lidhur me një listë të paracaktuar (fjalor/tezaur të kontrolluar). Harto termat e subjektit të sugjeruara nga AI në këtë listë.

5. Verifiko dhe konfirmo. Çdo fushë, veçanërisht data, emri dhe subjekti, krahasohen nga qeniet njerëzore me dokumente dhe regjistrime të autoritetit.

Këshillë: Jepni në mënyrë të qartë lejen e AI-së për të "lënë bosh". Përndryshe, ai do të "mendojë" plotësojë një datë ose krijues që nuk është në dokument dhe do të futë meta të dhëna të rreme në katalogun tuaj. Udhëzimi "Lëreni këtë fushë bosh nëse nuk është në dokument" është mburoja më e fortë kundër halucinacioneve.

Fushat dhe niveli i besimit në një tabelë

Fusha e meta të dhënave

Sa e besueshme është AI?

verifikimi

gjuha

lartë

mostër

Lloji i dokumentit

mesatar-i lartë

kontrollin

Emrat e personave/vendeve

Mesatare (gabim leximi)

të detyrueshme

datë

E ulët e mesme (rreziku i fabrikimit)

të detyrueshme

Termat e lëndës

E mesme (prodhohet falas)

Harta në listën e kontrollit

Fushëveprimi/përmbledhja

mesatar-i lartë

Krahasoni me burimin

Kodi i referencës

Asnjë (institucioni jep)

gjuajtjet njerëzore

Përmbledhje: AI është i shpejtë dhe i besueshëm në fusha të tilla si gjuha dhe zhanri; gjeneron drafte në fusha të tilla si data, emri dhe lënda, por kërkohet miratimi njerëzor; AI kurrë nuk prodhon fusha institucionale siç është kodi i referencës.

tre mini kuti

Rasti 1 - Draft meta të dhëna për 8000 foto. Një arkiv i qytetit po katalogonte 8000 fotografi historike. Shënimet në anën e pasme të secilës fotografi u transkriptuan dhe iu dhanë AI; Data e krijuar nga AI, vendndodhja dhe skica e temës. Ekipi njerëzor e verifikoi atë fushë për fushë dhe e vendosi në listën e kontrolluar. Një punë 10-mujore e vlerësuar u reduktua në 3 muaj; por çdo datë dhe emër vendi kontrollohej vizualisht.

Rasti 2 - Historia e krijuar. Një arkivist kishte katalogun e AI një letër pa datë. YZ shikoi përmbajtjen e letrës dhe shkruante saktësisht datën "1912". Megjithatë, nuk kishte asnjë datë në dokument; AI parashikoi. Nëse arkivisti nuk do të kishte shtuar udhëzimin "lëre bosh nëse jo në dokument", katalogu do të ishte mbushur me një datë të sajuar. Mësimi: Leja bosh është e detyrueshme.

Rasti 3 - Termat e lirë të lëndës krijuan konfuzion. AI caktoi terma të ngjashëm por të ndryshëm falas si "imigrim", "imigrim", "vendbanim" për dokumente të ngjashme. Kur nuk u shënua me fjalorin e kontrolluar, e njëjta temë u etiketua me tre terma të ndryshëm dhe u shpërnda në kërkim. Konsistenca u arrit duke vendosur termat në një listë të vetme autoriteti. Mësimi: termat e temës nuk publikohen, ato janë të lidhura me listën.

Katër shabllone të kopjueshëm

1) Skica e Dublinit Core:

Nxirrni draftin e meta të dhënave të Dublin Core nga transkriptimi i dokumentit më poshtë. Fushat: Titulli, Krijuesi, Tema, Përshkrimi, Data, Zhanri, Gjuha, Shtrirja (vendndodhja/periudha). Rregullat: (1) Përdorni vetëm informacionin në mënyrë të qartë në tekst. (2) Lëreni fushën që nuk është në tekst BASHK, mos e merrni me mend. (3) Shënoni vlerën për të cilën nuk jeni të sigurt me [?]. Transkriptimi: [këtu]

2) draft përkufizimi ISAD(G):

Krijo draft për dokumentin e mëposhtëm në fushat ISAD(G): Titulli, Data(at), Niveli i përshkrimit (dokumenti/Skedari), Objekti dhe përmbajtja (përmbledhje e shkurtër), Krijuesi, Gjuha. Lëreni kodin e referencës BASHK (institucioni do ta japë atë). Mos shtoni asnjë informacion që nuk është në tekst; Lëreni bosh fushën që nuk ekziston. Dokumenti: [këtu]

3) Sugjerimi i termit të temës (i kontrolluar):

Sugjeroni 3-5 terma tematikë të përshtatshëm për dokumentin e mëposhtëm. Së pari, mbështetuni në faktet në dokument. Më poshtë është lista e terminologjisë së kontrolluar të institucionit tonë; SË pari, zgjidhni atë nga kjo listë, nëse nuk është në listë, shënoni veçmas sugjerimin tuaj të termit të ri. Lista: [kushtet]. Dokumenti: [këtu]

4) Kontrolli i konsistencës në masë:

Më poshtë janë të dhënat e meta të dhënave për dokumentet nga i njëjti koleksion. Mospërputhjet e flamurit: regjistrime duke shkruar ndryshe të njëjtin vend/person, formate të ndryshme datash, terma të ndryshëm për të njëjtën temë. Korrigjim IMPOZIME; Thjesht krijoni një listë mospërputhjesh që njeriu ta shqyrtojë. Regjistrimet: [këtu]

Prompt i dobët / Prompt i fortë

I dobët:

Krijo një regjistrim të plotë të katalogut për këtë dokument.

Udhëzimi "i plotë" e shtyn AI të plotësojë çdo hapësirë, d.m.th., të shpikë historinë dhe krijuesit që nuk ekzistojnë.

E fortë:

Për këtë dokument është hartuar Bërthama e Dublinit. Përdorni vetëm informacionin e përfshirë QARTËT në transkriptim; lëre bosh fushën që nuk ekziston, mos e merr me mend. Zgjidh termat e temës nga kjo listë e kontrolluar: [lista]. Shënoni datën dhe emrat e personave me [?] që të mund ta verifikoj me dokumentin. Transkriptimi: [këtu]

Dallimi: leja "lëre bosh" në vend të botimit "të plotë", respektimi i kontrolluar i listës dhe shenjat e verifikimit mbrojnë katalogun nga fabrikimi.

Gabimet e zakonshme

  • Do të thotë "mbushni plotësisht". Kjo çon në përshtatjen e fushave inekzistente; Duhet të jepet leja "lëre bosh".
  • Lirimi i termave të lëndës. Termat që nuk përshtaten me fjalorin e kontrolluar do ta shpërqendrojnë kërkimin.
  • Të kesh AI të parashikojë historinë. Futja e një date fiktive në një dokument pa datë e ndot katalogun.
  • Duke pasur kodin e referencës të krijuar nga AI. Kjo është një hapësirë ​​korporative, unike; njerëzit hedhin.
  • Duke mos specifikuar standardin. Nëse standardi nuk përmendet, rezultati do të jetë një draft i çrregullt që nuk mund të futet në institucion.

Në përmbledhje

Meta të dhënat dhe katalogimi janë infrastruktura e padukshme që hap arkivin për studiuesin dhe kërkon shumë përpjekje. Nga transkriptimi, AI prodhon një skicë të shpejtë për fusha të tilla si data, personi, vendi, lënda dhe zhanri; Mund të funksionojë sipas standardeve të tilla si ISAD(G) ose Dublin Core. Por presioni për t'u "mbushur plotësisht" e shtyn AI të bëjë gjërat; Leja "lëre bosh", hartëzimi me fjalorin e kontrolluar dhe konfirmimi njerëzor i datave/emrave e mbajnë katalogun të besueshëm. UA përgatit draftin; Ju jeni përgjegjës për saktësinë e katalogut.

Detyra e aplikimit

Merrni një transkriptim dokumenti dhe kërkoni meta të dhëna nga AI me shabllonin "Dublin Core draft"; Kontrolloni nëse lë fusha bosh që nuk ekzistojnë. Pastaj ekzekutoni shabllonin "Sugjerimi i termit të temës" me listën tuaj të kontrollit (ose mostër). Më në fund, provoni disa regjistrime me një "kontroll të konsistencës në masë". Vini re se sa fusha AI përpiqet të plotësojë me parashikime dhe sa terma lëndësh duhet të vendosen në listë.

listë kontrolli

  • [ ] Unë kam deklaruar qartë standardin e synuar (ISAD(G)/Dublin Core).
  • [ ] I dhashë lejen "Lëre fushën bosh bosh".
  • [ ] I vendosa termat e temës në listën e kontrolluar.
  • [ ] Kam verifikuar datën dhe emrat e personave me dokumentin/rekordin e autoritetit.
  • [ ] Kodin e referencës ia lashë institucionit, jo AI.