Keuntungan:
- Keupayaan untuk menyediakan pendigitalan dan aliran kerja OCR (pengimbasan, pra-pemprosesan, pengecaman, pembetulan, pengesahan) langkah demi langkah
- Keupayaan untuk menggunakan AI untuk membetulkan ralat OCR dengan konteks sambil mengekalkan pembetulan dan menulis semula baris dan menandakan kesamaran dengan [?]
- Fahami sebab nombor, tarikh dan nama yang betul mesti disahkan secara visual dan peranan kawalan kualiti.
Berjuta-juta halaman pada rak fizikal arkib atau perpustakaan hanya benar-benar dibuka kepada penyelidik apabila ia menjadi digital dan boleh dicari. Pendigitalan ialah menukar dokumen fizikal kepada imej digital dengan mengimbas atau memotretnya. Tetapi gambar halaman belum lagi "teks"; Bagi komputer ia masih merupakan imej, anda tidak boleh mencari di dalamnya. Di sinilah OCR memainkan peranan.
OCR (Pengecaman Aksara Optik) ialah teknologi yang mengecam huruf bercetak dalam imej dokumen dan menukarnya menjadi teks yang boleh dibaca mesin dan boleh dicari. Dalam unit ini, anda akan belajar cara mendigitalkan dokumen bercetak sejarah dengan OCR, cara AI membantu membetulkan ralat OCR dalam proses ini dan di mana mata manusia adalah penting. (Teks tulisan tangan memerlukan teknologi yang berbeza; kami akan membincangkannya dalam unit seterusnya.)
Aliran kerja pendigitalan: langkah demi langkah
1. Penyediaan dan saringan. Imbas dokumen pada kualiti tertinggi yang mungkin. Peraturan am untuk penyelidikan sejarah ialah resolusi sekurang-kurangnya 300-400 DPI (titik per inci). Peleraian rendah meroketkan kadar ralat dalam peringkat OCR berikutnya.
2. Prapemprosesan imej. Memperbaik imej sebelum OCR sangat meningkatkan kejayaan: mengetuk halaman yang diimbas, menghilangkan cela, meningkatkan kontras, menukar kepada hitam dan putih. Alat berasaskan AI moden boleh mengautomasikan langkah ini.
3. Aplikasi OCR. Anda menyuap imej ke enjin OCR; Enjin mengecam huruf dan menghasilkan teks. Output biasanya terdiri daripada dua lapisan: imej dokumen yang boleh dilihat dan "lapisan teks tersembunyi yang boleh dicari" di bawahnya.
4. Pembetulan (post-correction). Output OCR mentah tidak pernah sempurna. Aksara dibaca secara salah disebabkan oleh fon lama, kertas kekuningan, calitan dakwat dan ralat pengimbasan. Di sinilah AI adalah pembantu yang berkuasa: ia mencadangkan dan membetulkan ralat OCR menggunakan konteks.
5. Pengesahan dan kawalan kualiti. Teks yang diperbetulkan disemak oleh manusia berdasarkan sampel atau sepenuhnya. Terutamanya kawasan kritikal seperti nama, tarikh dan nombor mesti disahkan secara visual.
Mengapa OCR membuat kesilapan, cara AI membantu
Masalah biasa yang mencabar OCR dalam dokumen sejarah: fon lama dan mewah, bentuk huruf usang seperti "s" (ſ), reka letak halaman dua lajur, nota kaki, sisipan tulisan tangan, pengedap dan dakwat pudar. Kerana enjin OCR "melihat" huruf satu demi satu, ia sering mengelirukan "rn" binari sebagai "m", huruf "l" sebagai nombor "1", dan huruf "O" sebagai "0".
Model bahasa AI menawarkan kuasa yang berbeza di sini: mereka memahami konteks. Jika enjin OCR menulis "1stanbu1", AI boleh membuat kesimpulan daripada konteks bahawa ia sepatutnya "Istanbul". Tetapi terdapat bahaya besar di sini: apabila "membetulkan" AI juga boleh menukar teks. Dia boleh menambah "Saya membetulkan" perkataan yang tidak wujud atau mengisi tempat yang tidak jelas dengan tekaannya sendiri. Ini mengganggu kesetiaan transkripsi.
Awas: Peraturan emas dalam pembetulan OCR ialah: AI hanya perlu membetulkan ralat pengecaman yang jelas, bukan mentafsir atau menambah kandungan teks. "1stanbu1 → Istanbul" adalah sah; Ia bukan tentang mengisi perkataan yang tidak boleh dibaca dengan tekaan. Tempat yang tidak pasti hendaklah ditandakan dengan [?] dan tidak boleh dibuat-buat.
Jenis dan pendekatan ralat OCR dengan jadual
Jenis ralat
contoh
Bolehkah AI membetulkannya?
kawalan manusia
percampuran watak
rn↔m, l↔1, O↔0
Ya, ia selamat
sampel
bentuk surat lama
panjang ſ → s
Ya, ia selamat
sampel
Perkataan pudar/tidak boleh dibaca
"ka___n"
Tidak, harus meletakkan [?]
wajib
nama/nama tempat yang betul
"Constantiniyye"
berhati-hati
wajib
Nombor/tarikh
"1867" lwn "1857"
berisiko
wajib
Reka letak halaman (lajur/nota kaki)
aliran bercampur
sebahagiannya
wajib
Untuk meringkaskan gambar dalam satu ayat: AI membersihkan ralat aksara biasa dengan pasti; Tetapi mata manusia diperlukan untuk nama khas, nombor, tarikh dan tempat yang tidak boleh dibaca.
tiga kes mini
Kes 1 — Arkib akhbar menjadi boleh dicari. Sebuah perpustakaan universiti telah mendigitalkan 12,000 muka surat akhbar tempatan dari tahun 1930-an. Ketepatan OCR mentah adalah dianggarkan 82% (18 daripada setiap 100 aksara adalah salah). Pembetulan berasaskan AI meningkatkan ketepatan kepada 96% dengan kamus dan konteks yang sesuai dengan bahasa akhbar. Untuk ralat yang tinggal, semakan sampel dilakukan dan bukannya teks penuh; Koleksi boleh dicari dalam masa 3 minggu.
Kes 2 — AI "diperbetulkan" dan sejarah diputarbelitkan. Seorang arkivis mempunyai AI membetulkan tarikh "1863" pada cetakan OCR. AI "membetulkan" tarikh kepada "1868" dengan melihat peristiwa lain dalam konteks — walaupun dokumen itu dengan jelas menyatakan 1863. Jika arkivis tidak melihat imej asal, katalog akan masuk dengan tarikh yang salah. Pelajaran: nombor dan tarikh tidak pernah diserahkan kepada AI, ia disahkan dengan imej.
Kes 3 — Halaman dua lajur keliru. Halaman dua lajur buku tahunan abad ke-19 dicampurkan ke dalam satu aliran dalam OCR dan ayat-ayat itu saling berkait. Keluaran mentah tidak boleh dibaca. Teks bertambah baik apabila saya mula-mula membahagikan reka letak halaman kepada wilayah (segmentasi) dan memproses setiap lajur secara berasingan. Pelajaran: dalam susun atur halaman kompleks, struktur pertama, teks kedua.
Empat templat yang boleh disalin
1) Pembetulan OCR selamat:
Di bawah ialah output OCR mentah bagi dokumen sejarah. Tugas anda adalah untuk membetulkan ralat pengecaman optik yang jelas SAHAJA (cth. rn→m,1→l, 0→O, long ſ→s). Peraturan: (1) Mentafsir maksud teks. (2) Betulkan perkataan yang tidak boleh dibaca/kabur, biarkan seperti sedia ada dan tandakan dengan [?]. (3) TIDAK menambah, membuang atau melengkapkan ayat. (4) TUKAR nombor dan tarikh; tandakan [nombor?] jika ragu-ragu. OCR mentah: [di sini]
2) Laporan kualiti OCR:
Periksa output OCR di bawah dan hasilkan laporan kualiti: (1) Senaraikan perkataan dengan kemungkinan ralat pengecaman, (2) Tandakan kawasan yang kelihatan tidak boleh dibaca/tidak jelas, (3) Senaraikan nama, tarikh dan nombor tertentu yang memerlukan pemeriksaan manusia. JANGAN betulkan; hasilkan senarai semak sahaja.Teks: [di sini]
3) Bantuan penghuraian lajur/struktur:
Oleh kerana teks OCR di bawah berasal dari halaman dua lajur, aliran mungkin keliru. Susun semula teks menjadi perenggan logik TETAPI jangan ubah, tambah atau padam sebarang perkataan. Cuma betulkan pesanan. Tandai pesanan yang anda tidak pasti dengan [pesanan?]. Teks: [di sini]
4) Normalisasi kepada bahasa standard (pilihan, lapisan berasingan):
Hasilkan versi bacaan yang dipermudahkan dalam ejaan hari ini, dalam lajur berasingan, DI ATAS teks sejarah yang diperbetulkan di bawah. JANGAN sesekali mengubah teks ASAL; Biarkan pemudahan menjadi lapisan yang berasingan. Hanya kemas kini ejaan/sebutan tanpa menambah makna.Asal: [di sini]
Gesaan lemah / Gesaan kuat
lemah:
Betulkan dan cantikkan teks OCR ini.
"Beautify" membolehkan AI menulis semula teks, membuat peninggalan, dan mentafsir kandungan; memecahkan kesetiaan.
kuat:
Betulkan SAHAJA ralat pengecaman optik dalam output OCR mentah ini. Jangan tafsir makna, tambah/padam perkataan, tinggalkan bahagian yang tidak boleh dibaca dengan [?], tukar nombor dan tarikh. Tunjukkan setiap pembetulan yang anda buat dalam senarai berasingan dalam format "original → correction" supaya saya boleh mengesahkannya. Teks: [di sini]
Perbezaannya: kewajipan terhad, larangan ke atas fabrikasi, kekaburan penandaan, dan senarai pembetulan yang boleh dikesan menjadikan output boleh diaudit.
Kesilapan biasa
- Mengimbas pada resolusi rendah. Kebanyakan ralat OCR disebabkan oleh imej yang buruk; Pengimbasan berkualiti adalah pelaburan termurah.
- Memanggil AI "buat cantik." Ini menghasilkan kefasihan dan bukannya kesetiaan; Dokumen itu ditulis semula.
- Meninggalkan nombor dan tarikh kepada AI. Ini rosak secara senyap apabila "diperbetulkan" dari konteks; mesti disahkan oleh imej.
- Mengisi kawasan yang tidak boleh dibaca dengan tekaan. Ia harus dilindungi oleh ketidakpastian [?], bukan dibuat-buat.
- Tidak mengawal langsung dan bukannya pensampelan. Malah 96% ketepatan bermakna beribu-ribu ralat dalam 12,000 halaman; kawasan kritikal diimbas.
Secara ringkasnya
OCR membuka arkib kepada penyelidik dengan menukar dokumen sejarah yang dicetak kepada teks yang boleh dicari. AI ialah bantuan yang berkuasa dalam membetulkan ralat aksara dalam output OCR mentah dengan konteks; Tetapi anda mesti membuat garis antara penyuntingan dan penulisan semula. Pengimbasan berkualiti tinggi, arahan pembetulan selamat, pemeliharaan kesamaran dengan [?], dan pengesahan mata manusia bagi nama/tarikh/nombor menjadikan pendigitalan pantas dan boleh dipercayai. AI membersihkan teks; Anda adalah penjaga kesetiaan.
Tugasan permohonan
Imbas dokumen sejarah bercetak (akhbar lama, surat rasmi, halaman buku) atau ambil cetakan OCR. Minta teks diperbetulkan dengan templat "Pembetulan OCR selamat" dan minta pembetulan melalui senarai "pembetulan → asal". Kemudian, alih keluar kawasan yang memerlukan kawalan manusia dengan "laporan kualiti OCR". Bandingkan setiap tarikh dan nama yang betul dalam senarai dengan imej sebenar; Perhatikan bilangan yang "diperbetulkan" secara salah.
senarai semak
- [ ] Saya mengimbas dokumen dengan sekurang-kurangnya 300 DPI dan kontras yang baik.
- [ ] Saya hanya meminta AI untuk pembetulan ralat optik, bukan penulisan semula.
- [ ] Saya melindungi bahagian yang tidak boleh dibaca dengan [?].
- [ ] Saya mengesahkan semua nombor, tarikh dan nama yang betul dengan imej itu.
- [ ] Saya membuat sampel atau semakan penuh di kawasan kritikal.