Unit 4 / 12

Metadata, Pengkatalogan dan Pengelasan

Keuntungan:

  • Keupayaan untuk menghasilkan draf metadata mengikut piawaian seperti ISAD(G) atau Dublin Core dengan kecerdasan buatan
  • Keupayaan untuk mencegah halusinasi dan memetakan istilah subjek kepada perbendaharaan kata terkawal dengan kebenaran kosong
  • Keupayaan untuk membezakan medan, seperti tarikh, nama orang dan kod rujukan, memerlukan kelulusan manusia dan yang hanya perlu diberikan oleh institusi

Sebuah arkib atau perpustakaan, tidak kira betapa kayanya ia, tidak boleh ditemui melainkan ia ditakrifkan dengan baik. Perkara yang menjadikan dokumen "boleh ditemui" ialah maklumat deskriptif mengenainya: siapa yang menulisnya, bila, di mana, subjeknya, koleksi apa yang dimilikinya. Maklumat ini dipanggil metadata (metadata — data deskriptif tentang dokumen; "data tentang data"). Pengkatalogan ialah proses mengenal pasti dokumen dengan metadata ini dan menyimpannya dalam sistem yang boleh dicari. Klasifikasi adalah untuk menyusun dokumen mengikut kriteria seperti subjek, jenis atau asal.

Menjana metadata sangat memakan masa; Memasukkan maklumat tarikh, subjek, orang dan tempat secara individu untuk beribu-ribu dokumen dalam koleksi besar boleh mengambil masa bertahun-tahun. AI ialah penjana draf yang kuat dalam perniagaan ini. Dalam unit ini, kita akan melihat cara menjana metadata dengan AI, pengkatalogan mengikut piawaian (ISAD(G), Dublin Core), dan kedua-dua kuasa dan perangkap pengelasan automatik.

Piawaian arkib: mengapa ia diperlukan

Metadata tidak dimasukkan secara rawak; Terdapat piawaian antarabangsa supaya rekod daripada institusi yang berbeza boleh bercakap antara satu sama lain:

  • ISAD(G) (Penerangan Arkib Piawai Antarabangsa Umum): Peraturan untuk menerangkan bahan arkib secara hierarki (di peringkat dana, siri, fail, dokumen). Ia mengandungi medan seperti kod rujukan, tajuk, tarikh, skop, pencipta.
  • Teras Dublin: Standard biasa yang terdiri daripada 15 medan teras untuk menerangkan sumber digital (tajuk, pencipta, subjek, tarikh, genre, format, sumber, bahasa, dll.).
  • Fonds: Satu set rekod yang terbentuk secara semula jadi hasil daripada aktiviti seseorang, keluarga atau institusi. Ia adalah unit pengarsipan asas.
  • Asal (asal): Maklumat tentang siapa dokumen itu berasal dan tangan mana dokumen itu dilalui. Dalam arkib, dokumen disimpan bersama mengikut asalnya.

Menentukan standard sasaran dengan jelas apabila AI menghasilkan metadata memastikan bahawa output boleh dimasukkan terus ke dalam perusahaan.

Satu lagi konsep utama ialah rekod pihak berkuasa—rekod yang mentakrifkan satu, bentuk standard, yang diluluskan bagi nama seseorang, tempat atau institusi. Dalam dokumen sejarah, orang atau tempat yang sama mungkin muncul dengan ejaan yang berbeza; Rekod pihak berkuasa mengikat mereka semua ke dalam satu format yang diluluskan supaya mereka tidak berselerak dalam carian. AI mencadangkan nama daripada dokumen; tetapi pemetaan nama ini kepada bentuk standard dalam rekod pihak berkuasa adalah kerja manusia. Mengaitkan apa yang AI ​​katakan "Ahmed" kepada "Ahmed Bey (1840-1912)" dalam rekod pihak berkuasa institusi mengekalkan ketekalan katalog.

Aliran kerja: langkah demi langkah

1. Sediakan sumber. Kumpulkan transkrip atau imej dokumen dan sebarang maklumat konteks.

2. Kenal pasti standard dan kawasan. Beritahu AI yang mana standard (ISAD(G), Dublin Core) dan mengikut bidang mana ia akan menghasilkan output.

3. Hasilkan draf metadata. AI mengisi medan yang boleh diekstrak daripada dokumen (tarikh, orang, tempat, subjek, bahasa, genre); Ia meninggalkan kosong kawasan yang tidak boleh dialihkannya.

4. Peta kepada perbendaharaan kata terkawal. Nama subjek dan tempat tidak percuma di kebanyakan institusi, tetapi terikat pada senarai yang telah ditetapkan (perbendaharaan kata terkawal / tesaurus). Petakan istilah subjek yang dicadangkan oleh AI ke senarai ini.

5. Sahkan dan sahkan. Setiap medan, terutamanya tarikh, nama dan subjek, dibandingkan oleh manusia dengan dokumen dan rekod kuasa.

Petua: Berikan kebenaran AI secara eksplisit untuk "biar kosong". Jika tidak, ia akan "teka" mengisi tarikh atau pencipta yang tiada dalam dokumen dan memasukkan metadata palsu ke dalam katalog anda. Arahan "Biarkan medan ini kosong jika tiada dalam dokumen" adalah perisai paling kuat terhadap halusinasi.

Medan dan tahap kepercayaan dalam jadual

Medan metadata

Sejauh manakah AI boleh dipercayai?

pengesahan

bahasa

tinggi

sampel

Jenis dokumen

sederhana tinggi

kawalan

Nama orang/tempat

Sederhana (ralat membaca)

wajib

tarikh

Sederhana rendah (risiko fabrikasi)

wajib

Istilah subjek

Sederhana (penjanaan percuma)

Peta ke senarai semak

Skop/ringkasan

sederhana tinggi

Bandingkan dengan sumber

Kod rujukan

Tiada (institusi memberi)

lontaran manusia

Ringkasan: AI adalah pantas dan boleh dipercayai dalam bidang seperti bahasa dan genre; menjana draf dalam medan seperti tarikh, nama dan subjek, tetapi kelulusan manusia diperlukan; AI tidak pernah menghasilkan medan institusi seperti kod rujukan.

tiga kes mini

Kes 1 — Draf metadata untuk 8,000 foto. Sebuah arkib bandar mengkatalogkan 8,000 gambar bersejarah. Nota di belakang setiap foto telah ditranskripsi dan diberikan kepada AI; Tarikh, lokasi dan rangka topik yang dijana AI. Pasukan manusia mengesahkannya bidang demi medan dan memetakannya ke senarai terkawal. Anggaran kerja 10 bulan dikurangkan kepada 3 bulan; tetapi setiap tarikh dan nama tempat telah disemak secara visual.

Kes 2 — Sejarah rekaan. Seorang arkivis mempunyai katalog AI surat tidak bertarikh. YZ melihat kandungan surat itu dan menulis tarikh "1912" dengan tepat. Bagaimanapun, tiada tarikh dalam dokumen itu; AI meramalkan. Jika arkivis tidak menambah arahan "biarkan kosong jika tiada dalam dokumen", katalog itu akan diisi dengan tarikh yang dibuat. Pengajaran: kebenaran kosong adalah wajib.

Kes 3 — Istilah subjek percuma mencipta kekeliruan. AI memberikan syarat percuma yang serupa tetapi berbeza seperti "imigrasi", "imigrasi", "penyelesaian" kepada dokumen yang serupa. Apabila ia tidak dipetakan ke perbendaharaan kata terkawal, topik yang sama telah ditandakan dengan tiga istilah berbeza dan bertaburan dalam carian. Konsistensi dicapai dengan memetakan syarat ke dalam senarai kuasa tunggal. Pelajaran: istilah topik tidak dikeluarkan, ia dipautkan ke senarai.

Empat templat yang boleh disalin

1) Garis besar Teras Dublin:

Ekstrak draf metadata Teras Dublin daripada transkripsi dokumen di bawah. Medan: Tajuk, Pencipta, Subjek, Penerangan, Tarikh, Genre, Bahasa, Skop (lokasi/tempoh). Peraturan: (1) Hanya gunakan maklumat dengan JELAS dalam teks. (2) Biarkan ruangan yang tiada dalam teks itu KOSONG, jangan meneka. (3) Tandakan nilai yang anda tidak pasti dengan [?]. Transkripsi: [di sini]

2) Definisi draf ISAD(G):

Hasilkan draf untuk dokumen berikut dalam medan ISAD(G): Tajuk, Tarikh, Tahap Penerangan (dokumen/fail), Skop dan kandungan (ringkasan ringkas), Pencipta, Bahasa. Biarkan kod rujukan KOSONG (institusi akan memberikannya). Jangan tambah sebarang maklumat yang tiada dalam teks; Biarkan medan yang tidak wujud kosong. Dokumen: [di sini]

3) Cadangan istilah topik (terkawal):

Cadangkan 3-5 istilah topik yang sesuai dengan dokumen di bawah. Pertama, bergantung pada fakta DALAM dokumen. Di bawah ialah senarai istilah terkawal institusi kami; PERTAMA, pilih daripada senarai ini, jika ia tiada dalam senarai, tandai cadangan istilah baharu anda secara berasingan. Senarai: [syarat]. Dokumen: [di sini]

4) Semakan konsistensi pukal:

Di bawah ialah rekod metadata untuk dokumen daripada koleksi yang sama. Ketidakkonsistenan bendera: merekodkan ejaan tempat/orang yang sama secara berbeza, format tarikh berbeza, istilah berbeza untuk subjek yang sama. Pembetulan IMPOSISI; Hanya menghasilkan senarai ketidakkonsistenan untuk disemak oleh manusia. Rekod: [di sini]

Gesaan lemah / Gesaan kuat

lemah:

Buat rekod katalog lengkap untuk dokumen ini.

Arahan "lengkap" mendorong AI untuk mengisi setiap ruang, iaitu, untuk mencipta sejarah dan pencipta yang tidak wujud.

kuat:

Teras Dublin dirangka untuk dokumen ini. Gunakan hanya maklumat dengan JELAS yang disertakan dalam transkripsi; biarkan medan yang tidak wujud kosong, jangan meneka. Pilih istilah topik daripada senarai terkawal ini: [senarai]. Tandakan tarikh dan nama orang dengan [?] supaya saya boleh mengesahkannya dengan dokumen. Transkripsi: [di sini]

Perbezaan: kebenaran "biarkan kosong" dan bukannya edisi "lengkap", pematuhan senarai terkawal dan tanda pengesahan melindungi katalog daripada fabrikasi.

Kesilapan biasa

  • Ia bermaksud "isi sepenuhnya". Ini membawa kepada pemasangan medan yang tidak wujud; "biarkan kosong" kebenaran harus diberikan.
  • Melepaskan istilah subjek. Istilah yang tidak dipetakan kepada perbendaharaan kata terkawal akan mengalih perhatian carian.
  • Mempunyai sejarah ramalan AI. Memasukkan tarikh rekaan ke dalam dokumen tidak bertarikh mencemarkan katalog.
  • Mempunyai kod rujukan yang dihasilkan oleh AI. Ini adalah ruang korporat yang unik; orang membuang.
  • Tidak menyatakan standard. Jika standard tidak disebut, output akan menjadi draf yang tidak kemas yang tidak boleh dimasukkan ke dalam institusi.

Secara ringkasnya

Metadata dan pengkatalogan ialah infrastruktur halimunan yang membuka arkib kepada penyelidik, dan ia memerlukan banyak usaha. Daripada transkripsi, AI menghasilkan garis besar pantas untuk medan seperti tarikh, orang, tempat, subjek dan genre; Ia boleh berfungsi mengikut piawaian seperti ISAD(G) atau Dublin Core. Tetapi tekanan untuk "mengisi sepenuhnya" mendorong AI untuk membuat sesuatu; "biarkan kosong" kebenaran, pemetaan kepada perbendaharaan kata terkawal dan pengesahan manusia tarikh/nama memastikan katalog boleh dipercayai. AI menyediakan draf; Anda bertanggungjawab ke atas ketepatan katalog.

Tugasan permohonan

Ambil transkripsi dokumen dan minta metadata daripada AI dengan templat "Draf Teras Dublin"; Semak bahawa ia meninggalkan medan kosong yang tidak wujud. Kemudian jalankan templat "cadangan istilah topik" dengan senarai semak (atau sampel) anda sendiri. Akhir sekali, uji beberapa rekod dengan "semakan konsistensi pukal". Perhatikan berapa banyak medan yang cuba diisi oleh AI dengan ramalan dan berapa banyak istilah subjek yang perlu dipetakan ke senarai.

senarai semak

  • [ ] Saya telah menyatakan dengan jelas standard sasaran (ISAD(G)/Dublin Core).
  • [ ] Saya memberi kebenaran "Biarkan medan kosong".
  • [ ] Saya memetakan istilah topik ke senarai terkawal.
  • [ ] Saya mengesahkan tarikh dan nama orang dengan dokumen/rekod kuasa.
  • [ ] Saya meninggalkan kod rujukan kepada institusi, bukan kepada AI.