Birlik 2 / 12

Hujjatlarni raqamlashtirish va OCR: bosilgan matnni mashina matniga aylantirish

Daromadlar:

  • Raqamlashtirish va OCR ish jarayonini bosqichma-bosqich sozlash qobiliyati (skanerlash, dastlabki ishlov berish, tanib olish, tuzatish, tekshirish)
  • Tuzatish va qayta yozish satrini saqlab, noaniqlikni [?] bilan belgilashda kontekst bilan OCR xatolarini tuzatish uchun AIdan foydalanish qobiliyati
  • Nima uchun raqamlar, sanalar va tegishli nomlar vizual tarzda tekshirilishi kerakligini va sifat nazoratining rolini tushuning.

Arxiv yoki kutubxonaning jismoniy javonlaridagi millionlab sahifalar raqamlashtirilgan va qidirish mumkin bo'lgandagina tadqiqotchi uchun haqiqatan ham ochiladi. Raqamlashtirish bu jismoniy hujjatni skanerlash yoki suratga olish orqali raqamli tasvirga aylantirishdir. Lekin sahifaning fotosurati hali "matn" emas; Kompyuter uchun bu hali ham rasm, uni qidirib bo'lmaydi. Bu erda OCR o'ynaydi.

OCR (Optik belgilarni aniqlash) bu hujjat tasviridagi bosilgan harflarni taniydigan va ularni mashinada oʻqiladigan, qidiriladigan matnga aylantiruvchi texnologiya. Ushbu bo'limda siz OCR yordamida tarixiy bosma hujjatlarni qanday raqamlashtirishni, AI bu jarayonda OCR xatolarini tuzatishga qanday yordam berishini va inson ko'zi qayerda muhimligini bilib olasiz. (Qo'lda yozilgan matnlar boshqa texnologiyani talab qiladi; biz buni keyingi bo'limda ko'rib chiqamiz.)

Raqamlashtirish ish jarayoni: bosqichma-bosqich

1. Tayyorlash va saralash. Hujjatni eng yuqori sifatda skanerlang. Tarixiy tadqiqotlar uchun umumiy qoida - bu kamida 300-400 DPI (dyuymdagi nuqta). Past aniqlik keyingi OCR bosqichida xatolik darajasini oshiradi.

2. Tasvirga oldindan ishlov berish. OCR dan oldin tasvirni yaxshilash muvaffaqiyatni sezilarli darajada oshiradi: skanerlangan sahifaning chizmalarini yo'qotish, dog'larni olib tashlash, kontrastni oshirish, qora va oq rangga aylantirish. AIga asoslangan zamonaviy vositalar bu bosqichni avtomatlashtirishi mumkin.

3. OCR ilovasi. Siz tasvirni OCR dvigateliga berasiz; Dvigatel harflarni taniydi va matn ishlab chiqaradi. Chiqish odatda ikkita qatlamdan iborat: ko'rinadigan hujjat tasviri va uning ostida "qidiriladigan yashirin matn qatlami".

4. Tuzatish (tuzatishdan keyingi). Raw OCR chiqishi hech qachon mukammal bo'lmaydi. Belgilar eski shriftlar, sarg'aygan qog'oz, siyoh bulg'anishi va skanerlash xatolari tufayli noto'g'ri o'qiladi. Bu erda AI kuchli yordamchidir: kontekstdan foydalangan holda OCR xatolarini taklif qiladi va tuzatadi.

5. Tekshirish va sifat nazorati. Tuzatilgan matn namuna asosida yoki to'liq odam tomonidan tekshiriladi. Ayniqsa, ismlar, sanalar va raqamlar kabi muhim joylar vizual tarzda tekshirilishi kerak.

Nima uchun OCR xato qiladi, AI qanday yordam beradi

Tarixiy hujjatlarda OCRga qarshi turadigan odatiy muammolar: eski va chiroyli shriftlar, uzun "s" (ſ) kabi eskirgan harf shakllari, ikki ustunli sahifa tartibi, izohlar, qo'lda yozilgan qo'shimchalar, muhrlar va xira siyoh. OCR dvigateli harflarni birma-bir "ko'radi", chunki u tez-tez ikkilik "rn"ni "m", "l" harfini "1" raqami va "O" harfini "0" bilan aralashtirib yuboradi.

AI til modellari bu erda boshqa kuchni taklif qiladi: ular kontekstni tushunishadi. Agar OCR dvigateli "1stanbu1" deb yozgan bo'lsa, AI kontekstdan "Istanbul" bo'lishi kerak degan xulosaga kelishi mumkin. Ammo bu erda katta xavf bor: "tuzatish" paytida AI matnni ham o'zgartirishi mumkin. U mavjud bo'lmagan so'zni "Men tuzatdim" qo'shishi yoki noaniq joyni o'z taxmini bilan to'ldirishi mumkin. Bu transkripsiyaning ishonchliligini buzadi.

Diqqat: OCR tuzatishdagi oltin qoida bu: AI faqat aniq tanib olish xatolarini tuzatishi kerak, matn mazmunini sharhlamasligi yoki to'ldirmasligi kerak. "1stanbu1 → Istanbul" qonuniy; Bu o'qilmaydigan so'zni taxminlar bilan to'ldirish haqida emas. Noaniq joylar [?] bilan belgilanishi va ularni tuzatmasligi kerak.

OCR xatosi turlari va jadval bilan yondashuv

Xato turi

misol

AI buni tuzata oladimi?

inson nazorati

belgilarni aralashtirish

rn↔m, l↔1, O↔0

Ha, bu xavfsiz

namuna

eski harf shakli

long ſ → s

Ha, bu xavfsiz

namuna

Xiralashgan/o‘qib bo‘lmaydigan so‘z

"ka___n"

Yo'q, [?] qo'yish kerak

majburiy

tegishli ism/joy nomi

"Konstantiniyye"

ehtiyotkor

majburiy

Raqam/sana

"1867" va "1857"

xavfli

majburiy

Sahifa tartibi (ustun/izoh)

aralash oqim

qisman

majburiy

Tasvirni bir jumla bilan umumlashtirish uchun: AI oddiy belgilar xatolarini ishonchli tarzda tozalaydi; Lekin inson ko'zlari maxsus nomlar, raqamlar, sanalar va o'qilmaydigan joylar uchun talab qilinadi.

uchta mini holat

1-holat - Gazeta arxivlarini qidirish mumkin bo'ldi. Universitet kutubxonasi 1930-yillardagi mahalliy gazetalarning 12000 sahifasini raqamlashtirdi. Raw OCR aniqligi taxminiy 82% ni tashkil etdi (har 100 ta belgidan 18 tasi noto'g'ri edi). AIga asoslangan tuzatish gazeta tiliga mos lug'at va kontekst yordamida aniqlikni 96% ga oshirdi. Qolgan xatolar uchun to'liq matn emas, balki namunaviy tekshirish amalga oshirildi; To'plamni 3 hafta ichida qidirish mumkin bo'ldi.

2-holat - AI "tuzatilgan" va buzilgan tarix. Arxivchi AI OCR nashrida "1863" sanasini tuzatdi. AI kontekstdagi boshqa voqeaga qarab sanani “1868” deb “tuzatdi” — garchi hujjatda aniq 1863 yil deb yozilgan bo‘lsa ham. Agar arxivchi asl rasmga qaramaganida, katalog noto‘g‘ri sana bilan kiritilgan bo‘lar edi. Dars: raqamlar va sanalar hech qachon AIga qoldirilmaydi, ular rasm bilan tasdiqlanadi.

3-holat - Ikki ustunli sahifa chalkashib ketgan. 19-asr yilnomasining ikki ustunli sahifalari OCRda bitta oqimga aralashib ketgan va jumlalar bir-biriga bog'langan. Xom chiqishni o'qib bo'lmaydi. Men sahifa tartibini birinchi marta hududlarga (segmentatsiya) ajratganimda va har bir ustunni alohida qayta ishlaganimda matn yaxshilandi. Dars: murakkab sahifa tartibida, birinchi navbatda struktura, ikkinchidan matn.

To'rt nusxa ko'chirish shablonlari

1) Xavfsiz OCR tuzatish:

Quyida tarixiy hujjatning xom OCR chiqishi keltirilgan. Sizning vazifangiz FAQAT aniq optik tanib olish xatolarini tuzatishdir (masalan, rn→m,1→l, 0→O, long ſ→s). Qoidalar: (1) Matnning ma'nosini izohlang. (2) O'qilmaydigan/noaniq so'zlarni tuzating, avvalgidek qoldiring va [?] bilan belgilang. (3) jumlalarni qo'shish, olib tashlash yoki to'ldirish YO'Q. (4) raqamlar va sanalarni O'ZGARTIRISh; Agar shubhangiz bo'lsa [raqam?] belgilang.Raw OCR: [bu yerda]

2) OCR sifati hisoboti:

Quyidagi OCR chiqishini ko‘rib chiqing va sifatli hisobot tayyorlang: (1) Tanib olishda mumkin bo‘lgan xatoliklari bo‘lgan so‘zlarni sanab o‘ting, (2) O‘qib bo‘lmaydigan/aniq bo‘lmagan joylarni belgilang, (3) Odam tomonidan tekshirilishi kerak bo‘lgan aniq nomlar, sanalar va raqamlarni sanab o‘ting. TUZATMAGAN; faqat nazorat roʻyxatini yarating.Matn: [bu yerda]

3) Ustun/tuzilmani tahlil qilish bo'yicha yordam:

Quyidagi OCR matni ikki ustunli sahifadan olinganligi sababli, oqim chalkash bo'lishi mumkin. Matnni mantiqiy paragraflarga o'zgartiring, LEKIN hech qanday so'zni o'zgartirmang, qo'shmang yoki o'chirmang. Faqat tartibni to'g'rilang. Siz ishonchingiz komil boʻlmagan tartibni [buyurtma?] bilan belgilang. Matn: [bu yerda]

4) Standart tilga normallashtirish (ixtiyoriy, alohida qatlam):

Quyidagi tuzatilgan tarixiy matndan YUQORI Alohida ustunda bugungi imlo bo'yicha soddalashtirilgan o'qish versiyasini yarating. HECH QACHON ORIGINAL matnni o‘zgartirmang; Soddalashtirish alohida qatlam bo'lsin. Shunchaki imlo/talaffuzni maʼno qoʻshmasdan yangilang. Asl: [bu yerda]

Zaif taklif / Kuchli taklif

Zaif:

Ushbu OCR matnini to'g'rilang va chiroylilang.

"Gozallashtirish" AIga matnni qayta yozish, kamchiliklarni tuzatish va mazmunni sharhlash imkonini beradi; sodiqlikni buzadi.

Kuchli:

Ushbu xom OCR chiqishidagi FAQAT optik tanib olish xatolarini tuzating. Maʼnoni izohlamang, soʻzlarni qoʻshmang/oʻchirmang, oʻqilmaydigan qismlarni [?] bilan qoldirmang, raqamlar va sanalarni oʻzgartirmang. Tekshirishim uchun har bir tuzatishingizni "original → tuzatish" formatida alohida ro'yxatda ko'rsating. Matn: [bu yerda]

Farqi: cheklangan bojxona, ishlab chiqarishni taqiqlash, belgilash noaniqligi va tuzatishlarning kuzatilishi mumkin bo'lgan ro'yxati chiqishni tekshirilishi mumkin.

Umumiy xatolar

  • Past aniqlikda skanerlash. Aksariyat OCR xatolar yomon tasvirlardan kelib chiqadi; Sifatli skanerlash eng arzon sarmoyadir.
  • AIni "chiroyli qilish" deb atash. Bu sodiqlikdan ko'ra ravonlikni keltirib chiqaradi; Hujjat qayta yoziladi.
  • Raqamlar va sanalarni AIga qoldirish. Bular kontekstdan "tuzatilganda" jimgina buziladi; rasm bilan tasdiqlanishi kerak.
  • O'qilmaydigan joyni taxmin bilan to'ldirish. U noaniqlik bilan himoyalangan bo'lishi kerak [?], o'ylab emas.
  • Namuna olish o'rniga umuman nazorat qilmaslik. Hatto 96% aniqlik 12000 sahifada minglab xatolarni bildiradi; muhim joylar skanerlanadi.

Xulosa

OCR bosilgan tarixiy hujjatlarni qidiriladigan matnga aylantirish orqali tadqiqotchilarga arxivlarni ochadi. AI kontekst bilan xom OCR chiqishidagi belgilar xatolarini tuzatishda kuchli yordamdir; Lekin siz tahrirlash va qayta yozish o'rtasidagi chiziqni chizishingiz kerak. Yuqori sifatli skanerlash, xavfsiz tuzatish bo'yicha ko'rsatmalar, [?] bilan noaniqlikni saqlash va ismlar/sanalar/raqamlarni inson ko'zi bilan tekshirish raqamlashtirishni tez va ishonchli qiladi. AI matnni tozalaydi; Siz sodiqlik qo'riqchisisiz.

Ilova vazifasi

Chop etilgan tarixiy hujjatni (eski gazeta, rasmiy xat, kitob sahifasi) skanerlang yoki OCR nusxasini oling. Matnni “Xavfsiz OCR tuzatish” shablonidan foydalanib tuzating va “original → tuzatish” roʻyxati orqali tuzatishlar soʻrang. Keyin, "OCR sifati hisoboti" bilan inson nazoratini talab qiladigan joylarni olib tashlang. Ro'yxatdagi har bir sana va tegishli nomni haqiqiy tasvir bilan solishtiring; E'tibor bering, qanchasi noto'g'ri "tuzatilgan".

nazorat ro'yxati

  • [ ] Hujjatni kamida 300 DPI va yaxshi kontrast bilan skanerladim.
  • [ ] Men AIdan qayta yozishni emas, balki faqat optik xatolarni tuzatishni so'radim.
  • [ ] Men o'qib bo'lmaydigan qismlarni [?] bilan himoya qildim.
  • [ ] Rasm bilan barcha raqamlar, sanalar va tegishli nomlarni tasdiqladim.
  • [ ] Men muhim sohalarda namuna yoki to'liq tekshirish qildim.