Qazanclar:
- Skan edilmiş sənədləri OCR və HTR ilə mətnə çevirərək və çıxışı faktiki görüntü ilə müqayisə edərək düzəltmək imkanı
- Arxiv sənədinin orijinallığını və bütövlüyünü qorumaq və AI-nin məzmunu dəyişdirməsinin və uydurma bərpanın qarşısını almaq bacarığı
- Mənbə məlumatları və davamlı formatlarla uzunmüddətli rəqəmsal qorunmanı planlaşdırmaq bacarığı
Arxiv işçisinin vəzifəsi əlli illik qəzet cildlərini, əlyazma məktubları və ya köhnə fotoşəkilləri gələcəyə aparmaqdır. Bu sənədlər zamanla köhnəlir; Onları qorumaq və əlçatan etmək üçün rəqəmsallaşdırma aparılır: fiziki sənədin skan edilməsi və rəqəmsal surətə çevrilməsi. Ancaq təkcə skrininq kifayət deyil; Rəqəmsal obyekt uzun müddət ərzində tapıla bilən, oxuna bilən və saxlanıla bilən olmalıdır. Bu bölmədə siz rəqəmsallaşdırma, transkripsiya və rəqəmsal qorunma iş prosesində süni intellektdən necə istifadə etməyi öyrənəcəksiniz; ancaq orijinallıq və dəqiqlik üçün niyə məsuliyyət daşıyacağınızı öyrənəcəksiniz.
Bir neçə anlayış. OCR (Optik Character Recognition) sənədin təsvirindəki mətni maşın tərəfindən redaktə edilə bilən mətnə çevirən texnologiyadır. HTR (Handwritten Text Recognition) əl ilə yazılmış sənədlər üçün eyni işi görür və daha çətindir. Rəqəmsal qorunma rəqəmsal obyektlərin onilliklər ərzində oxunaqlı qalmasını təmin etmək üçün planlaşdırılmış səydir, hətta fayl formatları köhnəlsə və proqram təminatı dəyişsə belə. Süni intellekt hər üç sahədə güclü, lakin qüsurlu köməkçidir.
Addım-addım: rəqəmsallaşdırmadan qorunmağa qədər
1. Prioritet verin. Hər şeyi bir anda rəqəmləşdirə bilməzsiniz. Ən kövrək, ən çox tələb olunan və ən unikal sənədlər birinci yerə qoyulur. Bu məhkəmə qərarıdır; Süni intellekt siyahının redaktə edilməsində kömək edir, lakin prioriteti qurum müəyyən edir.
2. OCR/HTR-ni skan edin və tətbiq edin. Sənədi yüksək qətnamə ilə skan edin, sonra mətni çıxarmaq üçün OCR və ya HTR istifadə edin. Süni intellektə əsaslanan alətlər hətta köhnə və çətin mətnlərlə belə burada getdikcə daha yaxşı olur.
3. Mətni düzəldin və yoxlayın. OCR/HTR çıxışı heç vaxt mükəmməl olmur. Xüsusən köhnə yazı, ləkələnmiş səhifələr və ya əlyazma varsa, səhvlər çox olur. Çıxışı faktiki görüntü ilə müqayisə etmək və onu düzəltmək vacibdir.
4. Metadata və qoruma məlumatı əlavə edin. Rəqəmsal obyektə onun mənşəyini, skan etmə şərtlərini, format məlumatını və mənşəyi — sənədin haradan gəldiyini və necə işləndiyini əlavə edin. Bu məlumat gələcək yoxlama və qorunma üçün vacibdir.
5. Uzunmüddətli mühafizə planı. Açıq, ümumi və davamlı fayl formatlarını seçin; ehtiyat nüsxə; Formatların köhnəlməsi halında miqrasiya planı hazırlayın.
İpucu: OCR çıxışını "aydın mətn" kimi qəbul etməyin. Əgər axtarış sistemi bu mətn üzərində işləsəydi, səhv tanınan sözlər mənbənin tapılmamasına səbəb olardı. Kritik kolleksiyalar üçün OCR çıxışının insan gözünə düzəldilməsi bütün sonrakı girişlərin keyfiyyətini müəyyən edir.
Rəqəmsal obyektin həqiqiliyi və bütövlüyü
Arxiv işinin mərkəzində həqiqilik və bütövlük dayanır: sənədin həqiqətən iddia edilən mənbədən gəldiyinə və onun məzmununun dəyişdirilməməsinə əminlik. Bu nöqtədə AI iki istiqamətli təhlükə yaradır. Birincisi, OCR/HTR korreksiyası və ya “təkmilləşdirmə” zamanı AI mətni səssizcə dəyişdirə bilər; "düzəlmə" adı altında mövcud olmayan sözü əlavə edə bilər. İkincisi, əgər təsvirin "təmiri" və ya "bərpası" AI ilə aparılırsa, orijinal olmayan detallar istehsal oluna bilər.
Arxivin qaydası aydındır: rəqəmsal qorunma nüsxəsi orijinala sadiq olmalıdır. AI ilə edilən hər bir təkmilləşdirmə sənədləşdirilməli və faktiki (xam) skan həmişə qorunmalıdır. Sənədi “gözəlləşdirmək” onun tarixi sübut dəyərini məhv edə bilər.
Diqqət: Köhnə fotoşəkili və ya sənədi AI ilə "təkmilləşdirmək" cazibədar ola bilər; lakin AI çatışmayan hissələri düzəldərək doldurur. Arxiv sənədində bu, saxta tarixi sübut yaratmaq deməkdir. Bərpa çıxışı heç vaxt orijinal mənbəni əvəz etmir; ayrıca, aydın etiketlənmiş variant kimi saxlanılır.
üç mini qutu
1-ci hal - Qəzet arxivləri axtarıla bilən oldu. Kitabxana 30 illik yerli qəzet kolleksiyasını rəqəmsallaşdırıb. OCR ilə 90.000 səhifə transkripsiya edildi və axtarış edilə bilən hala gətirildi; Əvvəllər günlər çəkən mövzu axtarışı indi saniyələrə endirilib. Bununla belə, komanda köhnə və ləkələnmiş səhifələrdə OCR dəqiqliyinin 80%-ə düşdüyünü və insan gözü ilə üst illərin düzəldilməsinə üstünlük verdiyini qeyd etdi.
Case 2 - HTR əlyazmanı açdı. Arxiv 19-cu əsrin çətin oxunan məktublar toplusuna HTR tətbiq etdi. Mütəxəssislərin aylarla oxuduqlarına görə sistem böyük sürət qazandı; Amma çap olunanın hər vərəqi orijinalı ilə ekspert paleoqraf (qədim yazı üzrə mütəxəssis) tərəfindən müqayisə edilib, çünki adam və yer adlarında səhvlər olub.
İş 3 - Saxta "bərpa" rədd edildi. Bir komanda AI ilə cırılmış tarixi fotoşəkili "təmir etməyi" düşündü. AI çatışmayan üz hissələrini uyğunlaşdıraraq tamamladı. Arxiv işçisi başa düşdü ki, bu uydurma detallar tarixi sübutları təhrif edəcək; Təmir edilmiş şəkil orijinal ilə yanaşı ayrıca saxlanıldı, yalnız "AI törəməsi" ilə aydın şəkildə etiketləndi.
Kopya, qorunma nüsxəsi və format qərarına daxil olun
Rəqəmsallaşdırmada yaxşı təcrübə eyni obyektin nüsxələrini müxtəlif məqsədlər üçün ayırmaqdır. Qoruma ustası, gələcəkdə daşınacaq, ən yüksək ayırdetmə qabiliyyəti, sıxılmamış və ya itkisiz formatda saxlanılan faktiki rəqəmsal obyektdir; nadir hallarda toxunur. Giriş nüsxəsi istifadəçiyə təqdim edilən daha kiçik, asanlıqla açılan variantdır. Bu fərq vacibdir, çünki istifadə üçün praktiki olan format (kiçik, sıxılmış) uzunmüddətli saxlama üçün uyğun olmaya bilər; Konservasiya üçün ideal format (böyük, itkisiz) gündəlik istifadə üçün çətin olur. Bu iş prosesində AI faylların inventarlaşdırılmasında, çatışmayan variantların aşkarlanmasında və metadatanın iki nüsxə arasında ardıcıl saxlanmasında kömək edə bilər. Bununla belə, format seçimi qorunma qərarıdır: açıq, geniş sənədləşdirilmiş və davamlı formatlara üstünlük verilməlidir (mülkiyyət, qapalı formatlardan daha çox) və formatların zamanla köhnəlməsi halında miqrasiya planı hazır saxlanılmalıdır. Süni intellekt bir format təklif etsə belə, son söz qurumun uzunmüddətli qorunma siyasətidir.
İpucu: Hər bir rəqəmsal obyekt üçün “orijinal mənbə haradadır, qorunma nüsxəsi hansı formatdadır, giriş nüsxəsi hansı formatdadır və hansı istifadəçiyə təqdim olunur?” suallarına cavab verən qısa qeyd aparın. Bu üç təbəqənin qarışdırılması hansı faylın etibarlı master olduğunu aydın etmir.
Dörd kopyalana bilən şablon
1) OCR çıxış korreksiyası yardımı:
Aşağıda OCR mətni və faktiki səhifənin təsviri verilmişdir. Yalnız openOCR səhvlərini düzəldin (pis simvollar, mürəkkəb/parçalanmış sözlər). Məzmunu dəyişdirməyin, sözləri əlavə etməyin və ya silməyin. Əmin deyilsinizsə, "[?]" ilə işarələyin. OCR mətni: [burada]
2) Mətn-şəklin uyğunluğunun yoxlanılması:
Aşağıdakı düzəliş edilmiş mətndə orijinal sənəddə olması gözlənilməyən hər hansı əlavələr varmı? Hər bir şübhəli hissəni qeyd edin və niyə şübhəli olduğunu yazın. Mətn: [burada]
3) Qoruma metadata layihəsi:
Aşağıdakı rəqəmsal obyekt üçün qorunma metadata konturunu yaradın: mənbə, mənşə, skan tarixi/qətnamə, fayl formatı, əməliyyat tarixçəsi. Sadəcə verdiyim məlumatlardan istifadə edin, çatışmayan sahəni boş qoyun. Məlumat: [burada]
4) Prioritetləşdirmə yardımı:
Aşağıda rəqəmsallaşmanı gözləyən kolleksiyaların siyahısı verilmişdir; Kövrəkliyə, tələbata və unikallığa əsaslanaraq prioritetləşdirməyə kömək edin. Hər bir resurs üçün qısa əsaslandırma verin; Son qərarı mənə buraxın. Siyahı: [burada]
Zəif məlumat / Güclü göstəriş
Zəif çağırış:
Bu skan edilmiş mətni düzəldin və gözəlləşdirin.
"Gözəlləşdirin" süni intellektə məzmunu dəyişməyə, buraxılmış çatışmazlıqları düzəltməyə dəvət edir; Arxiv sənədinin orijinallığı pozulub.
Güclü göstəriş:
Rolunuz: rəqəmsallaşdırma redaktoru köməkçisi. Aşağıdakı OCR mətnində YALNIZ açıq-aşkar tanınma xətalarını (pis xarakter, səhv bölünmüş söz) düzəldin. Heç bir söz əlavə etməyin, silməyin və ya dəyişdirməyin. Əmin olmadığınız yerdə "[?]" yazın. Etdiyiniz hər bir düzəlişi ayrıca siyahıda göstərin. Mətn: [burada]
Güclü göstəriş AI-ni yalnız səhvləri tanımaqla məhdudlaşdırır, məzmuna toxunmağı qadağan edir və düzəlişləri izlənilə bilən edir.
İş axını və risk cədvəli
Mərhələ
AI-nin töhfəsi
Əsas risk
mühafizə tədbiri
skan edin
—
keyfiyyətsiz
yüksək qətnamə
OCR/HTR
Mətnə çevirin
Tanınma səhvləri
insan korreksiyası
korreksiya
Səhv təklifi
Məzmunun dəyişdirilməsi
Orijinal ilə müqayisə
bərpa
Şəkil törəməsi
uyğun detal
Xam orijinalı saxlayın, etiketləyin
müdafiə
Metadata layihəsi
mənşə itkisi
Mənşə rekordu
Ümumi səhvlər
- OCR çıxışının düzəliş etmədən qəbul edilməsi. Səhvlər axtarış və girişi pozur.
- Süni intellektə “gözəlləşdir” deyə müraciət etmək. Məzmunu dəyişir və orijinallığı məhv edir.
- Həqiqi sübut üçün AI bərpasını əvəz etmək. Uydurma təfərrüat saxta tarix yaradır.
- Xam tarama saxlanmır. Orijinal olmadan heç bir düzəliş yoxlanıla bilməz.
- Mənbə məlumatının buraxılması. Sənədin etibarlılığı izlənilməz olur.
Xülasə
Rəqəmsal arxivlərdə və rəqəmsallaşdırmada AI; OCR/HTR transkripsiyasını, metadata tərtibini və prioritetləşdirməni sürətləndirən dəyərli yardımdır. Lakin arxiv işinin mahiyyəti həqiqilik və bütövlükdür: OCR çıxışı insan gözü ilə düzəldilməlidir, AI heç vaxt məzmunu səssizcə əvəz etməməlidir, bərpa törəmələri orijinal sübutları əvəz etməməlidir və xam skan və mənşə məlumatları həmişə qorunmalıdır. Süni intellektdən sənədi “təkmilləşdirməyən”, əksinə, ona sadiq qalaraq əlçatan edən bir alət kimi istifadə edin.
Tətbiq tapşırığı
OCR çıxışının qısa bir nümunəsini əldə edin (ya öz istehsalınızdan, ya da faktiki skandan). Yalnız tanınma xətalarını "OCR çıxışının düzəldilməsi yardımı" şablonu ilə düzəldin, sonra AI-nin "Mətn-şəklin uyğunluğunun yoxlanılması" şablonu ilə məzmun əlavə edib-etmədiyini yoxlayın. Sonra "Mühafizə metadata layihəsi" şablonu ilə obyekt üçün mənşə və format məlumatı ilə qeyd yaradın.
yoxlama siyahısı
- [ ] OCR/HTR çıxışını faktiki görüntü ilə müqayisə etdim və onu düzəltdim.
- [ ] AI-nin məzmun əlavə etmədiyini/dəyişmədiyini yoxladım.
- [ ] Mən xam (master) skanını ayrıca və dəyişməz saxladım.
- [ ] Mən metadataya mənşə və format məlumatı əlavə etdim.
- [ ] Mən bərpa variantlarını aydın şəkildə "AI törəməsi" kimi qeyd etmişəm.