Kazanimlar:
- Dijitalleştirme ve OCR iş akışını (tarama, ön işleme, tanıma, düzeltme, doğrulama) adım adım kurabilme
- Yapay zekayı OCR hatalarını bağlamla düzeltmek için kullanırken düzeltme ile yeniden yazma çizgisini koruyup belirsizliği [?] ile işaretleyebilme
- Sayı, tarih ve özel isimlerin neden mutlaka görüntüyle doğrulanması gerektiğini ve kalite kontrolün rolünü kavrayabilme
Bir arşivin ya da kütüphanenin fiziksel raflarındaki milyonlarca sayfa, ancak dijitalleşip aranabilir hâle geldiğinde araştırmacıya gerçekten açılır. Dijitalleştirme, fiziksel bir belgeyi tarayarak ya da fotoğraflayarak dijital bir görüntüye dönüştürmektir. Ama bir sayfanın fotoğrafı henüz "metin" değildir; bilgisayar için o hâlâ bir resimdir, içinde arama yapamazsınız. İşte burada OCR devreye girer.
OCR (Optical Character Recognition — optik karakter tanıma), bir belge görüntüsündeki matbu (basılı) harfleri tanıyıp makine tarafından okunabilir, aranabilir metne çeviren teknolojidir. Bu ünitede, tarihsel matbu belgeleri OCR ile nasıl dijitalleştireceğinizi, YZ'nin bu süreçte OCR hatalarını düzeltmede nasıl yardımcı olduğunu ve nerede insan gözünün şart olduğunu öğreneceksiniz. (El yazması metinler farklı bir teknoloji gerektirir; onu bir sonraki ünitede ele alacağız.)
Dijitalleştirme iş akışı: adım adım
1. Hazırlık ve tarama. Belgeyi mümkün olan en yüksek kalitede tarayın. Tarih araştırması için genel bir kural, en az 300-400 DPI (dots per inch — inç başına nokta; görüntü çözünürlüğü ölçüsü) çözünürlüktür. Düşük çözünürlük, sonraki OCR aşamasında hata oranını fırlatır.
2. Görüntü ön işleme. OCR'den önce görüntüyü iyileştirmek başarıyı büyük ölçüde artırır: eğri taranmış sayfayı düzeltme (deskew), lekeleri temizleme, kontrastı artırma, siyah-beyaza çevirme. Modern YZ tabanlı araçlar bu adımı otomatik yapabilir.
3. OCR uygulaması. Görüntüyü OCR motoruna verirsiniz; motor harfleri tanıyıp metin üretir. Çıktı genellikle iki katmandan oluşur: gözle görünen belge görüntüsü ve altında "arama yapılabilen gizli metin katmanı".
4. Düzeltme (post-correction). Ham OCR çıktısı asla kusursuz değildir. Eski yazı tipleri, sararmış kâğıt, mürekkep dağılması ve tarama hataları yüzünden karakterler yanlış okunur. İşte YZ burada güçlü bir yardımcıdır: bağlamdan yararlanarak OCR hatalarını önerir ve düzeltir.
5. Doğrulama ve kalite kontrol. Düzeltilmiş metin, insan tarafından örneklem üzerinden ya da tamamen kontrol edilir. Özellikle isimler, tarihler ve sayılar gibi kritik alanlar mutlaka gözle doğrulanır.
OCR neden hata yapar, YZ nasıl yardım eder
Tarihsel belgelerde OCR'yi zorlayan tipik sorunlar: eski ve süslü yazı tipleri, uzun "s" (ſ) gibi bugün kullanılmayan harf biçimleri, iki sütunlu sayfa düzeni, dipnotlar, el yazısı ekler, mühürler ve solmuş mürekkep. Bir OCR motoru harfleri tek tek "gördüğü" için, "rn" ikilisini "m" olarak, "l" harfini "1" rakamı olarak, "O" harfini "0" olarak sıkça karıştırır.
YZ dil modelleri burada farklı bir güç sunar: bağlamı anlarlar. Bir OCR motoru "1stanbu1" yazmışsa, YZ bunun "İstanbul" olması gerektiğini bağlamdan çıkarabilir. Ancak burada büyük bir tehlike vardır: YZ "düzeltirken" aynı zamanda metni değiştirebilir. Var olmayan bir kelimeyi "düzelttim" diye ekleyebilir, belirsiz bir yeri kendi tahminiyle doldurabilir. Bu, transkripsiyonun sadakatini bozar.
Dikkat: OCR düzeltmesinde altın kural şudur: YZ yalnızca bariz tanıma hatalarını düzeltmeli, metnin içeriğini yorumlamamalı ya da tamamlamamalıdır. "1stanbu1 → İstanbul" meşrudur; okunamayan bir kelimeyi tahminle doldurmak değildir. Belirsiz yerler [?] ile işaretlenmeli, uydurulmamalıdır.
Bir tabloyla OCR hata türleri ve yaklaşım
Hata türü
Örnek
YZ düzeltebilir mi?
İnsan kontrolü
Karakter karışması
rn↔m, l↔1, O↔0
Evet, güvenli
Örneklem
Eski harf biçimi
uzun ſ → s
Evet, güvenli
Örneklem
Solmuş/okunamaz kelime
"ka___n"
Hayır, [?] koymalı
Zorunlu
Özel isim/yer adı
"Kostantiniyye"
Dikkatli
Zorunlu
Sayı/tarih
"1867" vs "1857"
Riskli
Zorunlu
Sayfa düzeni (sütun/dipnot)
karışık akış
Kısmen
Zorunlu
Tabloyu bir cümlede özetlersek: YZ sıradan karakter hatalarını güvenle temizler; ama özel isim, sayı, tarih ve okunamayan yerlerde insan gözü şarttır.
Üç mini vaka
Vaka 1 — Gazete arşivi aranabilir oldu. Bir üniversite kütüphanesi, 1930'lara ait 12.000 sayfalık yerel gazeteyi dijitalleştirdi. Ham OCR doğruluğu tahminen %82'ydi (her 100 karakterden 18'i hatalı). YZ tabanlı düzeltme, gazete diline uygun bir sözlük ve bağlamla doğruluğu %96'ya çıkardı. Kalan hatalar için tam metin yerine örneklem kontrolü yapıldı; koleksiyon 3 haftada aranabilir hâle geldi.
Vaka 2 — YZ tarihi "düzeltti" ve bozdu. Bir arşivci, OCR çıktısındaki "1863" tarihini YZ'ye düzelttirdi. YZ, bağlamdaki başka bir olaya bakarak tarihi "1868" olarak "düzeltti" — oysa belgede açıkça 1863 yazıyordu. Arşivci asıl görüntüye bakmasaydı katalog yanlış tarihle girecekti. Ders: sayı ve tarihler asla YZ'ye bırakılmaz, görüntüyle doğrulanır.
Vaka 3 — İki sütunlu sayfa karıştı. 19. yüzyıl bir salnamenin (yıllık) iki sütunlu sayfaları OCR'de tek akışa karışıp cümleler iç içe geçti. Ham çıktı okunamazdı. Sayfa düzenini önce bölgelere ayırıp (segmentasyon) her sütunu ayrı işleyince metin düzeldi. Ders: karmaşık sayfa düzeninde önce yapı, sonra metin.
Dört kopyalanabilir şablon
1) Güvenli OCR düzeltme:
Aşağıda bir tarihsel belgenin ham OCR çıktısı var. GörevinYALNIZCA bariz optik tanıma hatalarını düzeltmek (ör. rn→m,1→l, 0→O, uzun ſ→s). Kurallar: (1) Metnin anlamını yorumlama.(2) Okunamayan/belirsiz kelimeleri düzeltme, olduğu gibi bırakve [?] ile işaretle. (3) Cümle ekleme, çıkarma, tamamlama YOK.(4) Sayı ve tarihleri DEĞİŞTİRME; şüpheliyse [sayı?] işaretle.Ham OCR: [buraya]
2) OCR kalite raporu:
Aşağıdaki OCR çıktısını incele ve bir kalite raporu çıkar:(1) Muhtemel tanıma hatası içeren kelimeleri listele,(2) Okunamaz/belirsiz görünen yerleri işaretle,(3) İnsan kontrolü gereken özel isim, tarih ve sayıları ayrılistele. Düzeltme YAPMA; yalnızca kontrol listesi üret.Metin: [buraya]
3) Sütun/yapı ayrıştırma yardımı:
Aşağıdaki OCR metni iki sütunlu bir sayfadan geldiği içinakış karışmış olabilir. Metni mantıklı paragraflara yenidendüzenle AMA hiçbir kelimeyi değiştirme, ekleme ya da silme.Yalnızca sırayı düzelt. Emin olmadığın sıralamayı [sıra?] ileişaretle. Metin: [buraya]
4) Standart dile normalleştirme (isteğe bağlı, ayrı katman):
Aşağıdaki düzeltilmiş tarihsel metnin YANINDA, ayrı bir sütunda,bugünün imlasına göre sadeleştirilmiş bir okuma sürümü üret.ORİJİNAL metni ASLA değiştirme; sadeleştirme ayrı bir katmanolsun. Anlam eklemeden yalnızca imla/okunuşu güncelle.Orijinal: [buraya]
Zayıf prompt / Güçlü prompt
Zayıf:
Bu OCR metnini düzelt ve güzelleştir.
"Güzelleştir" YZ'ye metni yeniden yazma, eksikleri uydurma ve içeriği yorumlama izni verir; sadakati bozar.
Güçlü:
Bu ham OCR çıktısında YALNIZCA optik tanıma hatalarını düzelt.Anlamı yorumlama, kelime ekleme/silme yapma, okunamayan yerleri[?] ile bırak, sayı ve tarihleri değiştirme. Yaptığın herdüzeltmeyi "orijinal → düzeltme" biçiminde ayrı bir listedegöster ki doğrulayabileyim. Metin: [buraya]
Fark: sınırlanmış görev, uydurma yasağı, belirsizliği işaretleme ve düzeltmelerin izlenebilir listesi, çıktıyı denetlenebilir kılar.
Sık yapılan hatalar
- Düşük çözünürlükle taramak. OCR hatalarının çoğu kötü görüntüden doğar; kaliteli tarama en ucuz yatırımdır.
- YZ'ye "güzelleştir" demek. Bu, sadakat yerine akıcılık üretir; belge yeniden yazılır.
- Sayı ve tarihleri YZ'ye bırakmak. Bunlar bağlamdan "düzeltilince" sessizce bozulur; görüntüyle doğrulanmalı.
- Okunamayan yeri tahminle doldurtmak. Belirsizlik [?] ile korunmalı, uydurulmamalı.
- Örneklem yerine hiç kontrol etmemek. %96 doğruluk bile 12.000 sayfada binlerce hata demektir; kritik alanlar taranır.
Özetle
OCR, matbu tarihsel belgeleri aranabilir metne çevirerek arşivleri araştırmacıya açar. YZ, ham OCR çıktısındaki karakter hatalarını bağlamla düzeltmede güçlü bir yardımcıdır; ama düzeltme ile yeniden yazma arasındaki çizgiyi siz çizmelisiniz. Yüksek kaliteli tarama, güvenli düzeltme talimatı, belirsizliğin [?] ile korunması ve isim/tarih/sayıların insan gözüyle doğrulanması, dijitalleştirmeyi hem hızlı hem güvenilir kılar. YZ metni temizler; sadakatin bekçisi sizsiniz.
Uygulama görevi
Bir matbu tarihsel belge (eski gazete, resmî yazı, kitap sayfası) tarayın ya da elinizdeki bir OCR çıktısını alın. "Güvenli OCR düzeltme" şablonuyla metni düzelttirin ve düzeltmeleri "orijinal → düzeltme" listesiyle isteyin. Ardından "OCR kalite raporu" ile insan kontrolü gereken alanları çıkartın. Listedeki her tarih ve özel ismi asıl görüntüyle karşılaştırın; kaç tanesinin yanlış "düzeltildiğini" not edin.
Kontrol listesi
- [ ] Belgeyi en az 300 DPI ve iyi kontrastla taradım.
- [ ] YZ'den yalnızca optik hata düzeltmesi istedim, yeniden yazım değil.
- [ ] Okunamayan yerleri [?] ile koruttum.
- [ ] Tüm sayı, tarih ve özel isimleri görüntüyle doğruladım.
- [ ] Kritik alanlarda örneklem ya da tam kontrol yaptım.