Yunit 4 / 12

Metadata, Cataloging at Classification

Mga nadagdag:

  • Kakayahang gumawa ng mga draft ng metadata alinsunod sa mga pamantayan tulad ng ISAD(G) o Dublin Core na may artificial intelligence
  • Kakayahang maiwasan ang guni-guni at imapa ang mga tuntunin ng paksa sa kinokontrol na bokabularyo na may pahintulot na iwanang blangko
  • Kakayahang makilala kung aling mga field, tulad ng petsa, pangalan ng tao at reference code, ang nangangailangan ng pag-apruba ng tao at kung alin ang dapat italaga lamang ng institusyon

Ang isang archive o library, gaano man ito kayaman, ay hindi mahahanap maliban kung ito ay mahusay na tinukoy. Ang dahilan kung bakit "mahanap" ang isang dokumento ay ang naglalarawang impormasyon tungkol dito: sino ang sumulat nito, kailan, saan, ano ang paksa nito, kung saang koleksyon ito kabilang. Ang impormasyong ito ay tinatawag na metadata (metadata — mapaglarawang data tungkol sa isang dokumento; "data tungkol sa data"). Ang pag-catalog ay ang proseso ng pagtukoy ng mga dokumento gamit ang metadata na ito at pag-save ng mga ito sa isang mahahanap na sistema. Ang pag-uuri ay upang ayusin ang mga dokumento ayon sa pamantayan tulad ng paksa, uri o pinagmulan.

Ang pagbuo ng metadata ay lubhang nakakaubos ng oras; Ang pagpasok ng petsa, paksa, tao at impormasyon ng lugar nang paisa-isa para sa libu-libong mga dokumento sa malalaking koleksyon ay maaaring tumagal ng mga taon. Ang AI ay isang malakas na draft generator sa negosyong ito. Sa unit na ito, makikita natin kung paano bumuo ng metadata gamit ang AI, pag-cataloging alinsunod sa mga pamantayan (ISAD(G), Dublin Core), at parehong kapangyarihan at mga pitfalls ng awtomatikong pag-uuri.

Mga pamantayan sa archival: bakit kailangan ang mga ito

Ang metadata ay hindi random na ipinasok; Mayroong mga internasyonal na pamantayan upang ang mga rekord mula sa iba't ibang institusyon ay makapag-usap sa isa't isa:

  • ISAD(G) (General International Standard Archival Description): Mga panuntunan para sa paglalarawan ng archival material sa hierarchical (sa antas ng pondo, serye, file, dokumento). Naglalaman ito ng mga field tulad ng reference code, pamagat, petsa, saklaw, tagalikha.
  • Dublin Core: Isang karaniwang pamantayan na binubuo ng 15 pangunahing field para sa paglalarawan ng mga digital na mapagkukunan (pamagat, tagalikha, paksa, petsa, genre, format, pinagmulan, wika, atbp.).
  • Fonds: Isang set ng mga record na natural na nabuo bilang resulta ng mga aktibidad ng isang solong tao, pamilya o institusyon. Ito ang pangunahing organizing unit ng archive.
  • Provenance (pinagmulan): Impormasyon tungkol sa kung kanino nagmula ang isang dokumento at kung saang kamay ito dumaan. Sa pag-archive, ang mga dokumento ay pinananatiling magkasama ayon sa kanilang pinagmulan.

Ang tahasang pagtukoy sa target na pamantayan kapag ang pagkakaroon ng AI ay gumagawa ng metadata ay nagsisiguro na ang output ay direktang naipasok sa enterprise.

Ang isa pang pangunahing konsepto ay ang rekord ng awtoridad—isang talaan na tumutukoy sa isang solong, pamantayan, naaprubahang anyo ng pangalan ng isang tao, lugar, o institusyon. Sa mga makasaysayang dokumento, ang parehong tao o lugar ay maaaring lumitaw na may iba't ibang mga spelling; Ang rekord ng awtoridad ay nagbubuklod sa kanilang lahat sa isang naaprubahang format para hindi sila nakakalat sa paghahanap. Ang AI ay nagmumungkahi ng mga pangalan mula sa isang dokumento; ngunit ang pagmamapa ng pangalang ito sa karaniwang anyo sa rekord ng awtoridad ay gawa ng tao. Ang pag-uugnay sa sinasabi ng AI na "Ahmed" sa "Ahmed Bey (1840-1912)" sa rekord ng awtoridad ng institusyon ay nagpapanatili ng pagkakapare-pareho ng katalogo.

Daloy ng Trabaho: hakbang-hakbang

1. Ihanda ang pinagmulan. Mangolekta ng transcript o larawan ng dokumento at anumang impormasyon sa konteksto.

2. Tukuyin ang pamantayan at mga lugar. Sabihin sa AI kung aling pamantayan (ISAD(G), Dublin Core) at ayon sa kung aling mga field ang lalabas nito.

3. Bumuo ng draft metadata. Pinupuno ng AI ang mga patlang na maaaring makuha mula sa dokumento (petsa, tao, lugar, paksa, wika, genre); Iniiwan nitong blangko ang mga lugar na hindi nito maalis.

4. Mapa sa kinokontrol na bokabularyo. Ang mga pangalan ng paksa at lugar ay hindi libre sa karamihan ng mga institusyon, ngunit nakatali sa isang paunang natukoy na listahan (kontroladong bokabularyo / thesaurus). Imapa ang mga tuntunin ng paksa na iminungkahi ng AI sa listahang ito.

5. I-verify at kumpirmahin. Ang bawat larangan, lalo na ang petsa, pangalan at paksa, ay inihahambing ng mga tao na may mga dokumento at mga talaan ng awtoridad.

Tip: Tahasang bigyan ang AI ng pahintulot na "iwang blangko". Kung hindi, ito ay "hulaan" na punan ang isang petsa o tagalikha na wala sa dokumento at maglalagay ng pekeng metadata sa iyong catalog. Ang pagtuturo na "Iwanang blangko ang patlang na ito kung wala ito sa dokumento" ay ang pinakamatibay na kalasag laban sa guni-guni.

Mga field at antas ng tiwala sa isang talahanayan

Patlang ng metadata

Gaano ka maaasahan ang AI?

pagpapatunay

wika

mataas

sample

Uri ng dokumento

katamtaman-mataas

kontrol

Mga pangalan ng tao/lugar

Katamtaman (error sa pagbasa)

sapilitan

petsa

Low-medium (panganib ng paggawa)

sapilitan

Mga termino ng paksa

Katamtaman (libreng pagbuo)

Mapa sa checklist

Saklaw/buod

katamtaman-mataas

Ihambing sa pinagmulan

reference code

Wala (nagbibigay ang institusyon)

mga itinapon ng tao

Buod: Ang AI ay mabilis at maaasahan sa mga lugar tulad ng wika at genre; bumubuo ng mga draft sa mga patlang tulad ng petsa, pangalan at paksa, ngunit kailangan ng pag-apruba ng tao; Ang AI ay hindi kailanman gumagawa ng mga institusyonal na larangan tulad ng reference code.

tatlong mini case

Case 1 — Draft metadata para sa 8,000 larawan. Ang archive ng lungsod ay nag-catalog ng 8,000 makasaysayang litrato. Ang mga tala sa likod ng bawat larawan ay na-transcribe at ibinigay sa AI; Binuo ng AI ang petsa, lokasyon at balangkas ng paksa. Na-verify ito ng pangkat ng tao sa bawat field at na-map ito sa kinokontrol na listahan. Ang tinatayang 10 buwang trabaho ay binawasan ng 3 buwan; ngunit ang bawat petsa at pangalan ng lugar ay biswal na nasuri.

Kaso 2 — Ginawang kasaysayan. Ang isang archivist ay mayroong AI catalog ng isang walang petsang sulat. Tiningnan ni YZ ang nilalaman ng liham at eksaktong isinulat ang petsang "1912". Gayunpaman, walang petsa sa dokumento; Hinulaan ng AI. Kung hindi idinagdag ng archivist ang pagtuturo na "iwang blangko kung wala sa dokumento", ang catalog ay mapupunan na ng isang ginawang petsa. Aralin: ang blangko na pahintulot ay sapilitan.

Case 3 — Ang mga tuntunin ng libreng paksa ay lumikha ng kalituhan. Nagtalaga ang AI ng magkatulad ngunit magkaibang mga libreng termino gaya ng "immigration", "immigration", "settlement" sa mga katulad na dokumento. Kapag hindi ito nakamapa sa kinokontrol na bokabularyo, ang parehong paksa ay na-tag ng tatlong magkakaibang termino at nakakalat sa paghahanap. Nakamit ang pagkakapare-pareho sa pamamagitan ng pagmamapa ng mga tuntunin sa isang listahan ng awtoridad. Aralin: ang mga tuntunin ng paksa ay hindi inilabas, sila ay naka-link sa listahan.

Apat na maaaring kopyahin na mga template

1) Dublin Core outline:

I-extract ang Dublin Core metadata draft mula sa transkripsyon ng dokumento sa ibaba. Mga Field: Pamagat, Tagalikha, Paksa, Paglalarawan, Petsa, Genre, Wika, Saklaw (lokasyon/panahon). Panuntunan: (1) Gumamit lamang ng impormasyon nang MALINAW sa teksto. (2) Iwanan ang field na wala sa text na BLANK, huwag hulaan. (3) Markahan ang halaga na hindi ka sigurado ng [?]. Transkripsyon: [dito]

2) ISAD(G) draft na kahulugan:

Bumuo ng draft para sa sumusunod na dokumento sa mga field ng ISAD(G): Pamagat, (Mga) Petsa, antas ng Paglalarawan (dokumento/file), Saklaw at nilalaman (maikling buod), Tagalikha, Wika. Iwanang BLANK ang reference code (ibibigay ito ng institusyon). Huwag magdagdag ng anumang impormasyon na wala sa teksto; Iwanang blangko ang hindi umiiral na field. Dokumento: [dito]

3) Suhestiyon sa termino ng paksa (kinokontrol):

Magmungkahi ng 3-5 paksa na mga tuntunin na angkop sa dokumento sa ibaba. Una, umasa sa mga katotohanan SA dokumento. Nasa ibaba ang listahan ng kinokontrol na terminolohiya ng aming institusyon; MUNA, piliin ito mula sa listahang ito, kung wala ito sa listahan, markahan nang hiwalay ang iyong mungkahi sa bagong termino. Listahan: [mga tuntunin]. Dokumento: [dito]

4) Bulk consistency check:

Nasa ibaba ang mga talaan ng metadata para sa mga dokumento mula sa parehong koleksyon. Mga hindi pagkakapare-pareho ng flag: mga talaan ang pagbabaybay sa parehong lugar/tao na naiiba, iba't ibang mga format ng petsa, iba't ibang mga termino para sa parehong paksa. Pagwawasto IMPOSITION; Gumawa lang ng listahan ng mga hindi pagkakapare-pareho para suriin ng tao. Mga Tala: [dito]

Mahinang prompt / Malakas na prompt

mahina:

Gumawa ng kumpletong tala ng katalogo para sa dokumentong ito.

Ang "kumpleto" na pagtuturo ay nagtutulak sa AI na punan ang bawat espasyo, ibig sabihin, upang mag-imbento ng kasaysayan at mga tagalikha na wala.

malakas:

Ang Dublin Core ay binuo para sa dokumentong ito. Gamitin lamang ang impormasyong MALINAW na kasama sa transkripsyon; iwanang blangko ang hindi umiiral na field, huwag hulaan. Pumili ng mga tuntunin ng paksa mula sa kinokontrol na listahang ito: [listahan]. Markahan ang petsa at mga pangalan ng tao ng [?] para ma-verify ko ito gamit ang dokumento. Transkripsyon: [dito]

Pagkakaiba: "iwanang blangko" na pahintulot sa halip na "kumpleto" na edisyon, ang kinokontrol na pagsunod sa listahan at mga marka ng pag-verify ay nagpoprotekta sa catalog mula sa katha.

Mga karaniwang pagkakamali

  • Ibig sabihin ay "punan ito ng buo". Ito ay humahantong sa angkop na mga hindi umiiral na mga patlang; "Iwanang blangko" ang pahintulot.
  • Pagpapalabas ng mga tuntunin ng paksa. Ang mga terminong hindi namamapa sa kinokontrol na bokabularyo ay makakaabala sa paghahanap.
  • Ang pagkakaroon ng AI predict history. Ang pagpasok ng isang kathang-isip na petsa sa isang walang petsang dokumento ay nagpaparumi sa katalogo.
  • Ang pagkakaroon ng reference code na nabuo ng AI. Ito ay isang corporate, natatanging espasyo; itinapon ng mga tao.
  • Hindi tinukoy ang pamantayan. Kung ang pamantayan ay hindi binanggit, ang output ay magiging isang magulo na draft na hindi maaaring ipasok sa institusyon.

Sa buod

Ang metadata at pag-cataloging ay ang hindi nakikitang imprastraktura na nagbubukas ng archive sa mananaliksik, at nangangailangan ito ng maraming pagsisikap. Mula sa transkripsyon, gumagawa ang AI ng mabilis na balangkas para sa mga field gaya ng petsa, tao, lugar, paksa, at genre; Maaari itong gumana ayon sa mga pamantayan tulad ng ISAD(G) o Dublin Core. Ngunit ang presyur na "punan nang lubusan" ang nagtutulak sa AI na gumawa ng mga bagay; "iwanang blangko" ang pahintulot, pagmamapa sa kinokontrol na bokabularyo, at pagkumpirma ng tao ng mga petsa/pangalan ay nagpapanatili sa katalogo na mapagkakatiwalaan. Inihahanda ng AI ang draft; Ikaw ang may pananagutan para sa katumpakan ng katalogo.

Gawain ng aplikasyon

Kumuha ng transkripsyon ng dokumento at humiling ng metadata mula sa AI na may template na "Dublin Core draft"; Suriin na nag-iiwan ito ng mga blangkong field na hindi umiiral. Pagkatapos ay patakbuhin ang template na "mungkahi ng termino sa paksa" gamit ang iyong sariling (o sample) na checklist. Panghuli, subukan ang ilang mga tala na may "bulk consistency check." Tandaan kung gaano karaming mga patlang ang sinusubukang punan ng AI ng hula at kung gaano karaming mga termino ng paksa ang kailangang imapa sa listahan.

checklist

  • [ ] Malinaw kong sinabi ang target na pamantayan (ISAD(G)/Dublin Core).
  • [ ] Binigyan ko ang pahintulot na "Iwanang blangko ang field."
  • [ ] Na-map ko ang mga tuntunin ng paksa sa kinokontrol na listahan.
  • [ ] Na-verify ko ang petsa at mga pangalan ng tao gamit ang rekord ng dokumento/awtoridad.
  • [ ] Iniwan ko ang reference code sa institusyon, hindi sa AI.