Qazanclar:
- ISAD(G) və ya süni intellektlə Dublin Core kimi standartlara uyğun olaraq metadata layihələri hazırlamaq bacarığı
- Halüsinasiyanın qarşısını almaq və mövzu terminlərini boş icazə ilə idarə olunan lüğətə xəritələşdirmək bacarığı
- Tarix, şəxsin adı və istinad kodu kimi hansı sahələrin insan təsdiqini tələb etdiyini və hansı sahələrin yalnız qurum tərəfindən təyin edilməli olduğunu ayırd etmək bacarığı
Arxiv və ya kitabxana nə qədər zəngin olsa da, yaxşı müəyyən edilmədikcə onu tapmaq mümkün deyil. Sənədi “tapılan” edən onun haqqında təsviri məlumatdır: onu kim yazıb, nə vaxt, harada, nə mövzudur, hansı topluya aiddir. Bu məlumat metadata adlanır (metadata — sənəd haqqında təsviri məlumat; “məlumat haqqında məlumat”). Kataloqlaşdırma bu metadata ilə sənədlərin eyniləşdirilməsi və axtarış sistemində saxlanması prosesidir. Təsnifat sənədləri mövzu, növ və ya mənşə kimi meyarlara görə təşkil etməkdir.
Metaməlumatların yaradılması çox vaxt aparır; Böyük kolleksiyalarda minlərlə sənəd üçün tarix, mövzu, şəxs və yer məlumatlarının ayrı-ayrılıqda daxil edilməsi illər çəkə bilər. AI bu işdə güclü bir layihə generatorudur. Bu bölmədə biz AI ilə metaməlumatların necə yaradılacağını, standartlara (ISAD(G), Dublin Core) uyğun kataloqlaşdırmanı və avtomatik təsnifatın həm gücünü, həm də tələlərini görəcəyik.
Arxiv standartları: nə üçün lazımdır
Metadata təsadüfi daxil edilmir; Müxtəlif qurumların qeydlərinin bir-biri ilə danışa bilməsi üçün beynəlxalq standartlar var:
- ISAD(G) (Ümumi Beynəlxalq Standart Arxiv Təsviri): Arxiv materialının iyerarxik (fond, seriya, fayl, sənəd səviyyəsində) təsviri qaydaları. O, istinad kodu, başlıq, tarix, əhatə dairəsi, yaradıcı kimi sahələri ehtiva edir.
- Dublin Core: Rəqəmsal resursları (başlıq, yaradıcı, mövzu, tarix, janr, format, mənbə, dil və s.) təsvir etmək üçün 15 əsas sahədən ibarət ümumi standart.
- Fondlar: Bir şəxsin, ailənin və ya qurumun fəaliyyəti nəticəsində təbii olaraq formalaşan qeydlər toplusu. Arxiv işinin əsas təşkili vahididir.
- Mənşə (mənşə): Sənədin kimdən gəldiyi və hansı tərəfdən keçdiyi barədə məlumat. Arxiv işində sənədlər mənşəyinə görə bir yerdə saxlanılır.
Süni intellekt metadata istehsal edərkən hədəf standartın açıq şəkildə müəyyən edilməsi çıxışın birbaşa müəssisəyə daxil edilməsini təmin edir.
Başqa bir əsas anlayış səlahiyyət qeydidir - şəxsin, yerin və ya qurumun adının vahid, standart, təsdiq edilmiş formasını müəyyən edən qeyd. Tarixi sənədlərdə eyni şəxs və ya yer müxtəlif yazılışlarla görünə bilər; Səlahiyyət qeydi onların hamısını vahid təsdiq edilmiş formatda birləşdirir ki, axtarışda səpələnməsinlər. AI sənəddən adlar təklif edir; lakin bu adın səlahiyyət qeydindəki standart formaya uyğunlaşdırılması insan işidir. AI-nin "Əhməd" dediklərinin "Əhməd Bəy (1840-1912)" ilə qurumun səlahiyyətli qeydlərində əlaqələndirilməsi kataloqun ardıcıllığını qoruyur.
İş axını: addım-addım
1. Mənbəni hazırlayın. Sənədin transkriptini və ya şəklini və istənilən kontekst məlumatını toplayın.
2. Standartı və sahələri müəyyən edin. Süni intellektə hansı standartı (ISAD(G), Dublin Core) və hansı sahələrə uyğun olaraq məhsul çıxaracağını deyin.
3. Qaralama metadata yaradın. AI sənəddən çıxarıla bilən sahələri doldurur (tarix, şəxs, yer, mövzu, dil, janr); O, silə bilmədiyi yerləri boş qoyur.
4. Nəzarət olunan lüğətin xəritəsi. Mövzu və yer adları əksər qurumlarda pulsuz deyil, lakin əvvəlcədən müəyyən edilmiş siyahıya (nəzarət olunan lüğət/tezaurus) bağlıdır. AI tərəfindən təklif olunan mövzu şərtlərini bu siyahıya uyğunlaşdırın.
5. Yoxlayın və təsdiq edin. Hər bir sahə, xüsusilə tarix, ad və mövzu, insanlar tərəfindən sənədlər və səlahiyyət qeydləri ilə müqayisə edilir.
İpucu: AI-yə açıq şəkildə "boş buraxmaq" icazəsi verin. Əks halda, o, sənəddə olmayan tarixi və ya yaradıcını "təxmin edəcək" və kataloqunuza saxta metadata daxil edəcək. “Sənəddə yoxdursa, bu sahəni boş buraxın” göstərişi hallüsinasiyaya qarşı ən güclü qalxandır.
Cədvəldəki sahələr və etibar səviyyəsi
Metadata sahəsi
AI nə qədər etibarlıdır?
yoxlama
dil
yüksək
nümunə
Sənəd növü
orta-yüksək
nəzarət
Şəxs/yer adları
Orta (oxumaq xətası)
məcburi
tarix
Aşağı-orta (istehsal riski)
məcburi
Mövzu şərtləri
Orta (pulsuz istehsal)
Yoxlama siyahısı üçün xəritə
Əhatə dairəsi/xülasə
orta-yüksək
Mənbə ilə müqayisə edin
İstinad kodu
Yoxdur (qurum verir)
insan atır
Xülasə: AI dil və janr kimi sahələrdə sürətli və etibarlıdır; tarix, ad və mövzu kimi sahələrdə qaralamalar yaradır, lakin insan təsdiqi tələb olunur; AI heç vaxt istinad kodu kimi institusional sahələr istehsal etmir.
üç mini qutu
Case 1 — 8000 fotoşəkil üçün qaralama metadata. Şəhər arxivi 8000 tarixi fotoşəkili kataloqa salırdı. Hər bir fotoşəkilin arxasındakı qeydlər transkripsiya edildi və AI-yə verildi; AI tərəfindən yaradılan tarix, yer və mövzu konturları. İnsan komandası onu sahə üzrə yoxladı və nəzarət edilən siyahıya uyğunlaşdırdı. Təxmini 10 aylıq iş 3 aya endirildi; lakin hər bir tarix və yer adı vizual olaraq yoxlanılırdı.
2-ci hal - Uydurma tarixçəsi. Bir arxivçinin AI kataloqu tarixsiz bir məktuba sahib idi. Y.Z. məktubun məzmununa baxıb “1912” tarixini dəqiq yazıb. Lakin sənəddə tarix yox idi; AI proqnozlaşdırdı. Əgər arxiv işçisi “sənəddə yoxdursa, boş buraxın” göstərişini əlavə etməsəydi, kataloq tərtib edilmiş tarixlə doldurulacaqdı. Dərs: boş icazə məcburidir.
Case 3 — Sərbəst mövzu terminləri çaşqınlıq yaratdı. AI oxşar sənədlərə "immiqrasiya", "immiqrasiya", "məskunlaşma" kimi oxşar, lakin fərqli pulsuz terminlər təyin etdi. Nəzarət olunan lüğətə uyğunlaşdırılmadıqda, eyni mövzu üç fərqli terminlə işarələnmiş və axtarışda səpələnmişdir. Ardıcıllığa şərtləri vahid səlahiyyət siyahısına yerləşdirməklə nail olunub. Dərs: mövzu şərtləri açıqlanmır, siyahı ilə əlaqələndirilir.
Dörd kopyalana bilən şablon
1) Dublin Core konturları:
Aşağıdakı sənəd transkripsiyasından Dublin Core metadata layihəsini çıxarın. Sahələr: Başlıq, Yaradıcı, Mövzu, Təsvir, Tarix, Janr, Dil, Əhatə dairəsi (yer/dövr). Qaydalar: (1) Mətndə yalnız məlumatı AÇIQ istifadə edin. (2) BLANK mətnində olmayan sahəni boş buraxın, təxmin etməyin. (3) Əmin olmadığınız dəyəri [?] ilə qeyd edin. Transkripsiya: [burada]
2) ISAD(G) layihəsinin tərifi:
ISAD(G) sahələrində aşağıdakı sənəd üçün qaralama yaradın: Başlıq, Tarix(lər), Təsvir səviyyəsi (sənəd/fayl), Əhatə və məzmun (qısa xülasə), Yaradıcı, Dil. İstinad kodunu BOŞ buraxın (qurum onu təmin edəcək). Mətndə olmayan hər hansı məlumatı əlavə etməyin; Mövcud olmayan sahəni boş buraxın. Sənəd: [burada]
3) Mövzu termini təklifi (nəzarət olunur):
Aşağıdakı sənədə uyğun 3-5 mövzu termini təklif edin. Birincisi, sənəddəki faktlara etibar edin. Aşağıda qurumumuzun idarə olunan terminologiya siyahısı verilmişdir; İLK, onu bu siyahıdan seçin, siyahıda yoxdursa, yeni termin təklifinizi ayrıca qeyd edin. Siyahı: [şərtlər]. Sənəd: [burada]
4) Toplu ardıcıllıq yoxlanışı:
Aşağıda eyni kolleksiyadan sənədlər üçün metadata qeydləri var. Bayraq uyğunsuzluqları: eyni yeri/şəxsi fərqli yazan qeydlər, fərqli tarix formatları, eyni mövzu üçün fərqli terminlər. Düzəltmə IMPOSITION; Sadəcə insanın nəzərdən keçirməsi üçün uyğunsuzluqların siyahısını hazırlayın. Qeydlər: [burada]
Zəif məlumat / Güclü göstəriş
Zəif:
Bu sənəd üçün tam kataloq qeydi yaradın.
"Tam" təlimat süni intellektni hər yeri doldurmağa, yəni mövcud olmayan tarixi və yaradıcıları icad etməyə sövq edir.
Güclü:
Dublin Core bu sənəd üçün hazırlanmışdır. Yalnız transkripsiyaya AÇIQ daxil olan məlumatlardan istifadə edin; mövcud olmayan sahəni boş qoyun, təxmin etməyin. Bu idarə olunan siyahıdan mövzu şərtlərini seçin: [siyahı]. Tarixi və şəxs adlarını [?] ilə qeyd edin ki, mən bunu sənədlə yoxlaya bilim. Transkripsiya: [burada]
Fərq: "Tam" nəşr əvəzinə "boş buraxın" icazəsi, nəzarət edilən siyahıya uyğunluq və yoxlama işarələri kataloqu uydurmadan qoruyur.
Ümumi səhvlər
- Bu, "tamamilə doldurmaq" deməkdir. Bu, mövcud olmayan sahələrin uyğunlaşmasına gətirib çıxarır; "boş buraxmaq" icazəsi verilməlidir.
- Mövzu şərtlərinin buraxılması. Nəzarət olunan lüğətə uyğun gəlməyən terminlər axtarışı yayındıracaq.
- Süni intellektə sahib olmaq tarixi proqnozlaşdırır. Tarixi olmayan sənədə uydurma tarixin daxil edilməsi kataloqu çirkləndirir.
- AI tərəfindən yaradılan istinad koduna sahib olmaq. Bu, korporativ, unikal məkandır; insanlar atırlar.
- Standartın göstərilməməsi. Əgər standart qeyd olunmazsa, nəticə quruma daxil edilə bilməyən qarışıq bir layihə olacaq.
Xülasə
Metaməlumatlar və kataloqlaşdırma tədqiqatçının üzünə arxivi açan görünməz infrastrukturdur və bu, çox səy tələb edir. Transkripsiyadan AI tarix, şəxs, yer, mövzu və janr kimi sahələr üçün sürətli kontur yaradır; O, ISAD(G) və ya Dublin Core kimi standartlara uyğun işləyə bilər. Ancaq "tamamilə doldurmaq" təzyiqi AI-ni hər şeyi düzəltməyə sövq edir; “Boş buraxın” icazəsi, idarə olunan lüğətə xəritəçəkmə və tarixlərin/adların insan tərəfindən təsdiqlənməsi kataloqu etibarlı saxlayır. AI layihəni hazırlayır; Kataloqun düzgünlüyünə görə məsuliyyət daşıyırsınız.
Tətbiq tapşırığı
Sənədin transkripsiyasını götürün və “Dublin Core layihəsi” şablonu ilə AI-dən metadata tələb edin; Mövcud olmayan boş sahələri buraxdığını yoxlayın. Sonra öz (və ya nümunə) yoxlama siyahınızla “mövzu termini təklifi” şablonunu işlədin. Nəhayət, "toplu ardıcıllıq yoxlanışı" ilə bir neçə qeydi sınayın. Süni intellektin neçə sahəni proqnozlaşdırma ilə doldurmağa çalışdığına və siyahıya neçə mövzu termininin uyğunlaşdırılması lazım olduğuna diqqət yetirin.
yoxlama siyahısı
- [ ] Mən hədəf standartını (ISAD(G)/Dublin Core) açıq şəkildə ifadə etmişəm.
- [ ] "Boş sahəni boş buraxın" icazəsi verdim.
- [ ] Mövzu şərtlərini idarə olunan siyahıya uyğunlaşdırdım.
- [ ] Tarix və şəxs adlarını sənəd/səlahiyyət qeydi ilə təsdiqlədim.
- [ ] İstinad kodunu AI-ya deyil, quruma buraxdım.