Qazanclar:
- Rəqəmsallaşdırma və OCR iş axını (skan, ilkin emal, tanınma, korreksiya, yoxlama) addım-addım qurmaq imkanı
- Düzəliş və yenidən yazma xəttini qoruyarkən və [?] ilə qeyri-müəyyənliyi qeyd edərkən kontekstlə OCR səhvlərini düzəltmək üçün AI-dən istifadə etmək bacarığı
- Rəqəmlərin, tarixlərin və müvafiq adların niyə vizual olaraq yoxlanılmalı olduğunu və keyfiyyətə nəzarətin rolunu anlayın.
Arxiv və ya kitabxananın fiziki rəflərindəki milyonlarla səhifə yalnız rəqəmsallaşdırıldıqda və axtarış aparıldıqda tədqiqatçı üçün həqiqətən açılır. Rəqəmsallaşdırma fiziki sənədi skan edərək və ya fotoşəkil çəkərək rəqəmsal təsvirə çevirməkdir. Ancaq bir səhifənin fotoşəkili hələ "mətn" deyil; Kompüter üçün bu, hələ də bir şəkildir, onda axtarış edə bilməzsiniz. OCR oyuna girdiyi yerdir.
OCR (Optik Character Recognition) sənəd təsvirində çap edilmiş hərfləri tanıyan və onları maşın tərəfindən oxuna bilən, axtarılan mətnə çevirən texnologiyadır. Bu bölmədə siz tarixi çap sənədlərini OCR ilə necə rəqəmləşdirəcəyinizi, AI-nin bu prosesdə OCR səhvlərini düzəltməyə necə kömək etdiyini və insan gözünün harada vacib olduğunu öyrənəcəksiniz. (Əl ilə yazılmış mətnlər fərqli texnologiya tələb edir; biz bunu növbəti bölmədə əhatə edəcəyik.)
Rəqəmsallaşdırma iş axını: addım-addım
1. Hazırlıq və seçim. Sənədi mümkün olan ən yüksək keyfiyyətdə skan edin. Tarixi tədqiqatlar üçün ümumi qayda ən azı 300-400 DPI (bir düymdə nöqtə) qətnamədir. Aşağı ayırdetmə, sonrakı OCR mərhələsində səhv nisbətini yüksəldir.
2. Şəklin əvvəlcədən işlənməsi. OCR-dən əvvəl təsvirin təkmilləşdirilməsi uğuru xeyli artırır: skan edilmiş səhifənin əyriliyini aradan qaldırmaq, ləkələri aradan qaldırmaq, kontrastı artırmaq, qara və ağa çevirmək. Müasir AI əsaslı alətlər bu addımı avtomatlaşdıra bilər.
3. OCR tətbiqi. Siz təsviri OCR mühərrikinə qidalandırırsınız; Mühərrik hərfləri tanıyır və mətn yaradır. Çıxış adətən iki təbəqədən ibarətdir: görünən sənəd şəkli və altında "axtarılan gizli mətn təbəqəsi".
4. Düzəltmə (korreksiyadan sonrakı). Raw OCR çıxışı heç vaxt mükəmməl olmur. Köhnə şriftlər, saralmış kağız, mürəkkəb bulaşması və skan etmə xətaları səbəbindən simvollar səhv oxunur. Bu, AI-nin güclü köməkçi olduğu yerdir: kontekstdən istifadə edərək OCR səhvlərini təklif edir və düzəldir.
5. Yoxlama və keyfiyyətə nəzarət. Düzəliş edilmiş mətn nümunə əsasında və ya tamamilə insan tərəfindən yoxlanılır. Xüsusilə adlar, tarixlər və nömrələr kimi kritik sahələr vizual olaraq yoxlanılmalıdır.
Niyə OCR səhv edir, AI necə kömək edir
Tarixi sənədlərdə OCR-yə meydan oxuyan tipik problemlər: köhnə və dəbdəbəli şriftlər, uzun "s" (ſ) kimi köhnəlmiş hərf formaları, iki sütunlu səhifə tərtibatı, alt qeydlər, əlyazma əlavələri, möhürlər və solğun mürəkkəb. OCR mühərriki hərfləri bir-bir "gördüyü" üçün tez-tez ikili "rn" hərfini "m", "l" hərfini "1" rəqəmi və "O" hərfini "0" kimi qarışdırır.
AI dil modelləri burada fərqli bir güc təklif edir: konteksti başa düşürlər. Bir OCR mühərriki "1stanbu1" yazsaydı, AI kontekstdən bunun "İstanbul" olması lazım olduğu qənaətinə gələ bilər. Ancaq burada böyük bir təhlükə var: AI "düzəliş edərkən" mətni də dəyişə bilər. Mövcud olmayan sözü “mən düzəltdim” əlavə edə və ya öz təxminləri ilə aydın olmayan yeri doldura bilər. Bu, transkripsiyanın sədaqətini pozur.
Diqqət: OCR korreksiyasında qızıl qayda budur: AI yalnız aşkar tanınma səhvlərini düzəltməlidir, mətnin məzmununu şərh etməməli və ya əlavə etməməlidir. "1stanbu1 → İstanbul" qanunidir; Söhbət oxunmayan sözü təxminlərlə doldurmaqdan getmir. Qeyri-müəyyən yerlər [?] ilə qeyd edilməli və düzəldilməməlidir.
OCR xəta növləri və cədvəllə yanaşma
Səhv növü
misal
AI bunu düzəldə bilərmi?
insan nəzarəti
xarakter qarışığı
rn↔m, l↔1, O↔0
Bəli, təhlükəsizdir
nümunə
köhnə məktub forması
uzun ſ → s
Bəli, təhlükəsizdir
nümunə
Solğun/oxunmaz söz
"ka___n"
Xeyr, qoymalıdır [?]
məcburi
uyğun ad/yer adı
"Konstantiniyye"
ehtiyatlı
məcburi
Nömrə/tarix
"1867" vs "1857"
riskli
məcburi
Səhifənin tərtibatı (sütun/haşiyə)
qarışıq axın
qismən
məcburi
Şəkli bir cümlə ilə ümumiləşdirmək üçün: AI adi xarakter səhvlərini etibarlı şəkildə təmizləyir; Ancaq xüsusi adlar, nömrələr, tarixlər və oxunmayan yerlər üçün insan gözü tələb olunur.
üç mini qutu
1-ci hal - Qəzet arxivləri axtarıla bilən oldu. Universitet kitabxanası 1930-cu illərə aid 12.000 səhifə yerli qəzetləri rəqəmsallaşdırıb. Raw OCR dəqiqliyi təxmini 82% təşkil edirdi (hər 100 simvoldan 18-i səhv idi). Süni intellektə əsaslanan korreksiya qəzet dilinə uyğun lüğət və kontekstlə dəqiqliyi 96%-ə qədər artırdı. Qalan səhvlər üçün tam mətn yox, nümunə yoxlanılıb; Kolleksiya 3 həftə ərzində axtarıla bilər.
2-ci hal - AI "düzəliş etdi" və təhrif edilmiş tarix. Arxiv işçisi süni intellektlə OCR çapında "1863" tarixini düzəltməyi tapşırdı. Süni intellekt kontekstdə başqa bir hadisəyə baxaraq tarixi “1868” olaraq “düzəldirdi” – baxmayaraq ki, sənəddə aydın şəkildə 1863-cü il yazılıb. Arxiv işçisi orijinal şəkilə baxmasaydı, kataloq yanlış tarixlə daxil olardı. Dərs: nömrələr və tarixlər heç vaxt süni intellektə buraxılmır, onlar görüntü ilə təsdiqlənir.
Case 3 - İki sütunlu səhifə qarışıqdır. 19-cu əsrin illik məcmuəsinin iki sütunlu səhifələri OCR-də vahid axına qarışdırılmış və cümlələr bir-birinə qarışmışdı. Xam çıxış oxunmaz idi. Səhifənin tərtibatını ilk dəfə bölgələrə böləndə (seqmentləşdirmə) və hər sütunu ayrıca emal edəndə mətn yaxşılaşdı. Dərs: mürəkkəb səhifə tərtibatında, birinci quruluş, ikinci mətn.
Dörd kopyalana bilən şablon
1) Təhlükəsiz OCR korreksiyası:
Aşağıda tarixi sənədin xam OCR çıxışı verilmişdir. Tapşırıq YALNIZ açıq-aydın optik tanınma xətalarını düzəltməkdir (məsələn, rn→m,1→l, 0→O, uzun ſ→s). Qaydalar: (1) Mətnin mənasını şərh edin. (2) Oxunmayan/birmənalı sözləri düzəldin, olduğu kimi buraxın və [?] ilə işarələyin. (3) Cümlələri əlavə etmək, çıxarmaq və ya tamamlamaq YOXDUR. (4) Nömrələri və tarixləri DƏYİŞMƏK; şübhəniz varsa [nömrə?] işarələyin.Raw OCR: [burada]
2) OCR keyfiyyət hesabatı:
Aşağıdakı OCR çıxışını nəzərdən keçirin və keyfiyyətli hesabat hazırlayın: (1) Mümkün tanınma xətaları olan sözləri sadalayın, (2) Oxunmaz/ aydın görünməyən sahələri qeyd edin, (3) İnsanların yoxlanılmasını tələb edən xüsusi adları, tarixləri və nömrələri sadalayın. düzəltməyin; yalnız yoxlama siyahısını yaradın. Mətn: [burada]
3) Sütun/struktur təhlili yardımı:
Aşağıdakı OCR mətni iki sütunlu səhifədən gəldiyi üçün axın qarışıq ola bilər. Mətni məntiqi abzaslara çevirin, AMMA heç bir sözü dəyişdirməyin, əlavə etməyin və ya silməyin. Sadəcə sifarişi düzəldin. Əmin olmadığınız sifarişi [sifariş?] ilə qeyd edin. Mətn: [burada]
4) Standart dilə normallaşdırma (isteğe bağlı, ayrıca təbəqə):
Aşağıdakı düzəldilmiş tarixi mətnin YUXARINDA, ayrıca sütunda, bugünkü orfoqrafiya ilə sadələşdirilmiş oxu versiyasını hazırlayın. ORİJİNAL mətni heç vaxt dəyişməyin; Sadələşdirmə ayrı bir təbəqə olsun. Məna əlavə etmədən sadəcə yazı/tələffüzü yeniləyin.Orijinal: [burada]
Zəif məlumat / Güclü göstəriş
Zəif:
Bu OCR mətnini düzəldin və gözəlləşdirin.
"Gözəlləşdirmək" süni intellektə mətni yenidən yazmağa, boşluqları düzəltməyə və məzmunu şərh etməyə imkan verir; sədaqəti pozur.
Güclü:
Bu xam OCR çıxışında YALNIZ optik tanınma xətalarını düzəldin. Mənanı şərh etməyin, sözlər əlavə etməyin/silməyin, oxunmayan hissələri [?] ilə tərk etməyin, nömrələri və tarixi dəyişməyin. Etdiyiniz hər bir düzəlişi "orijinal → düzəliş" formatında ayrıca siyahıda göstərin ki, yoxlaya bilim. Mətn: [burada]
Fərq: məhdud rüsum, istehsala qadağa, işarələmə qeyri-müəyyənliyi və izlənilə bilən düzəlişlər siyahısı çıxışı yoxlanıla bilir.
Ümumi səhvlər
- Aşağı qətnamə ilə skan edilir. Əksər OCR xətaları pis şəkillərdən qaynaqlanır; Keyfiyyətli tarama ən ucuz investisiyadır.
- Süni intellektə “gözəlləşdir” deyə müraciət etmək. Bu, sədaqətdən daha çox axıcılıq yaradır; Sənəd yenidən yazılır.
- Rəqəmləri və tarixləri AI-ya buraxın. Bunlar kontekstdən “düzəliş” edildikdə səssizcə pozulur; şəkil ilə təsdiqlənməlidir.
- Oxunmayan sahəni təxminlə doldurmaq. O, qeyri-müəyyənliklə [?] qorunmalıdır, uydurma deyil.
- Nümunə götürmək əvəzinə heç nəzarət etməmək. Hətta 96% dəqiqlik 12.000 səhifədə minlərlə səhv deməkdir; kritik sahələr skan edilir.
Xülasə
OCR, çap olunmuş tarixi sənədləri axtarış edilə bilən mətnə çevirməklə tədqiqatçılara arxiv açır. AI kontekstlə xam OCR çıxışında xarakter səhvlərini düzəltmək üçün güclü köməkçidir; Ancaq redaktə və yenidən yazmaq arasında sərhəd çəkməlisiniz. Yüksək keyfiyyətli skan, təhlükəsiz korreksiya təlimatı, [?] ilə qeyri-müəyyənliyin qorunması və adların/tarixlərin/rəqəmlərin insan gözü ilə yoxlanılması rəqəmsallaşdırmanı həm sürətli, həm də etibarlı edir. AI mətni təmizləyir; Sən vəfanın keşikçisisən.
Tətbiq tapşırığı
Çap edilmiş tarixi sənədi (köhnə qəzet, rəsmi məktub, kitab səhifəsi) skan edin və ya OCR çapını götürün. Mətni “Təhlükəsiz OCR korreksiyası” şablonu ilə düzəldin və “orijinal → düzəliş” siyahısı vasitəsilə düzəlişlər tələb edin. Sonra, "OCR keyfiyyət hesabatı" ilə insan nəzarəti tələb edən sahələri silin. Siyahıdakı hər bir tarixi və müvafiq adı faktiki təsvirlə müqayisə edin; Nə qədər səhv "düzəliş" edildiyinə diqqət yetirin.
yoxlama siyahısı
- [ ] Sənədi ən azı 300 DPI və yaxşı kontrastla skan etdim.
- [ ] Mən süni intellektdən yalnız optik xətanın düzəldilməsi üçün xahiş etdim, yenidən yazmağı yox.
- [ ] Oxunmayan hissələri [?] ilə qorudum.
- [ ] Şəkillə bütün nömrələri, tarixləri və müvafiq adları təsdiqlədim.
- [ ] Mən kritik sahələrdə nümunə və ya tam yoxlama etdim.