Keuntungan:
- Keupayaan untuk menyediakan aliran kerja HTR dan transliterasi dan menerangkan sebab draf mentah memerlukan pemeriksaan pakar baris demi baris
- Keupayaan untuk melindungi kawasan yang tidak boleh dibaca dengan meminta alternatif dan bukannya mengenakan bacaan yang tepat sekiranya terdapat kesamaran vokal/huruf dalam bahasa Turki Uthmaniyyah
- Keupayaan untuk memisahkan transliterasi asal daripada lapisan penyederhanaan yang berasingan, mengekalkan tanggungjawab saintifik terakhir dengan ahli paleograf
Mungkin bahagian yang paling menuntut dalam penyelidikan sejarah ialah menyalin manuskrip dan dokumen bertulis lama ke dalam teks yang boleh dibaca. Surat, buku nota, rekod mahkamah atau dokumen Uthmaniyyah hanya boleh dicari selepas ia ditranskripsikan. Transkripsi ialah tindakan memindahkan kandungan dokumen (paling kerap tulisan tangan atau skrip kuno) ke dalam teks bertulis yang boleh dibaca. Dalam kes Uthmaniyyah, ini selalunya disertai dengan transliterasi: memindahkan teks dalam huruf Arab ke dalam abjad Latin dengan huruf demi huruf yang setara.
Kami menggunakan OCR untuk teks bercetak; Tulisan tangan memerlukan teknologi yang berbeza: HTR (Handwritten Text Recognition). HTR ialah teknologi yang serupa dengan OCR tetapi lebih mencabar yang menukarkan dokumen tulisan tangan kepada teks mesin. Dalam unit ini kita akan melihat cara menggunakan HTR dan AI dalam transkripsi Uthmaniyyah dan manuskrip, margin ralat dan sebab pengesahan adalah lebih kritikal di sini.
Mengapa tulisan tangan begitu sukar?
Tulisan tangan jauh lebih berubah daripada teks bercetak: setiap penulis mempunyai tangan yang unik, huruf disambungkan bersama, singkatan dan tanda khas digunakan, dakwat berdarah, kertas haus. Dalam bahasa Turki Uthmaniyyah kesukarannya digandakan:
- Bentuk huruf kontekstual: Huruf yang sama ditulis secara berbeza di awal, tengah dan akhir perkataan.
- Tidak menulis vokal: Vokal pendek selalunya tidak ditulis; pembaca melengkapkan daripada konteks. Ini mewujudkan kekaburan seperti "penerimaan atau penolakan?"
- Gaya tulisan yang berbeza: Terdapat gaya tulisan tangan yang berbeza seperti rik'a, divani, ta'lik; Masing-masing memerlukan kepakaran membaca yang berbeza.
- Kosa kata Uthmaniyyah: Perkataan daripada bahasa Arab dan Parsi yang tidak wujud dalam bahasa Turki hari ini.
Oleh itu, HTR dan AI berfungsi dengan margin ralat yang jauh lebih tinggi dalam bahasa Turki Uthmaniyyah berbanding cetakan OCR. Mata ahli paleografi pakar (paleografi - ilmu membaca tulisan kuno) bukanlah alat di sini, tetapi satu keperluan.
Aliran kerja: langkah demi langkah
1. Sediakan kualiti dokumen. Seperti OCR, resolusi tinggi dan kontras yang baik adalah penting. Ini lebih kritikal dalam tulisan tangan.
2. Pilih model HTR. Model Uthmaniyyah, tulisan tangan Arab atau HTR yang dilatih khusus untuk tempoh tertentu adalah lebih berjaya daripada model umum. Uji model mana yang berfungsi dengan baik untuk tempoh dan gaya penulisan.
3. Hasilkan transkripsi mentah. Model HTR menghasilkan garis besar. Dalam bahasa Turki Uthmaniyyah, draf ini adalah permulaan yang penuh dengan kesilapan yang mesti diperiksa dengan teliti oleh mata yang berpengalaman.
4. Penambahbaikan kontekstual dengan AI. Anda boleh mempunyai ketidakkonsistenan bendera AI, kemungkinan alternatif bacaan, dan lokasi yang mencurigakan dalam output mentah. Tetapi "pembetulan" AI sangat berisiko di sini: ia boleh mencadangkan bacaan yang direka-reka.
5. Transliterasi dan penyederhanaan (berlapis). Transliterasi teks dalam huruf Arab ke dalam huruf Latin, diikuti dengan bacaan ringkasnya ke dalam bahasa Turki hari ini, dihasilkan sebagai lapisan yang berasingan. Asal tidak pernah pecah.
6. Pengesahan pakar. Transkripsi akhir diluluskan oleh pakar dengan pengetahuan paleografi dan tempoh dengan membandingkannya dengan dokumen.
Perhatian: Dalam bahasa Turki Uthmaniyyah, apabila "meneka" perkataan dengan vokal tidak bertulis dari konteks, AI boleh menghasilkan bacaan yang salah sepenuhnya dan menyampaikannya dalam bahasa yang yakin. Perbezaan huruf, seperti "kabul" bukannya "kabil" atau "alem" bukannya "alim", sama sekali mengubah makna. Setiap bacaan yang tidak pasti harus dibentangkan dengan alternatif, dan tiada bacaan muktamad tunggal harus dikenakan.
Lapisan dan tanggungjawab dengan meja
lapisan
kandungan
Peranan AI
Peranan pakar
Imej
dokumen asal
—
Sumber
Draf HTR
Pembacaan mesin mentah
menghasilkan
Kawalan dari awal hingga akhir
transliterasi
transposisi huruf Latin
draf mencadangkan
Betulkan, betulkan
Nota ketidakpastian
[?] dan alternatif
tanda-tanda
memutuskan
Penyederhanaan
Bahasa Turki hari ini
draf mencadangkan
Kelulusan
penerbitan ilmiah
Teks akhir + nota
—
Pakar sahaja
tiga kes mini
Kes 1 — HTR mempercepatkan draf pertama sebanyak 5x. Seorang pelajar kedoktoran akan menyalin buku nota Uthmaniyyah 200 muka surat. Transkripsi manual penuh dianggarkan pada 60 hari perniagaan. Dengan model HTR yang dilatih untuk tempoh tersebut, draf mentah keluar dalam beberapa jam; Pelajar membetulkan draf ini dan mengurangkan kerja kepada 12 hari bekerja. Tetapi dia terpaksa membandingkan setiap halaman dengan dokumen, baris demi baris; Kira-kira 30% daripada draf adalah salah.
Kes 2 — Satu huruf, satu makna. Seorang penyelidik bergantung pada perkataan yang dibaca AI sebagai "gabenor." Di bawah kawalan pakar, difahamkan bahawa perkataan itu sebenarnya adalah "penjaga" (bertanggungjawab untuk kanak-kanak/orang), dan kerana vokal itu tidak ditanda, AI telah menekanya salah. Makna undang-undang dokumen itu berubah sepenuhnya. Pengajaran: Dalam bahasa Turki Uthmaniyyah, perbezaan satu huruf/vokal menyebabkan dokumen itu ditafsirkan dari awal; pakar diperlukan.
Kes 3 — Penyiapan yang direka-reka. Dalam baris yang dakwatnya telah habis dan satu perkataan tidak boleh dibaca, AI mengisi jurang dengan perkataan "logik". Pakar itu menyedari bahawa jurang itu sebenarnya adalah nama tempat dan AI telah menciptanya. Ruang dibiarkan sebagai [tidak boleh dibaca]. Pengajaran: ruang yang tidak boleh dibaca tidak diisi, ia ditanda.
Empat templat yang boleh disalin
1) Alih huruf yang mengekalkan kekaburan:
Di bawah ialah output mentah HTR/transliterasi dokumen Uthmaniyyah. Tugas anda ialah menyemak teks dan membenderakan kemungkinan ralat membaca. Peraturan: (1) Tawarkan 2-3 alternatif bacaan yang mungkin untuk setiap perkataan yang anda tidak pasti, jangan mengenakan satu. (2) Biarkan [illegible] di kawasan yang tidak boleh dibaca, jangan penuhkan. (3) MENAMBAH perkataan yang tidak wujud dalam teks. (4) Tunjukkan alternatif dalam perkataan dengan vokal samar-samar. Teks: [di sini]
2) Bacaan berlapis (asal + pemudahan):
Hasilkan DUA lajur untuk transliterasi Uthmaniyyah yang disahkan berikut: (1) Transliterasi asal (sentuhan), (2) Bacaan ringkas ke dalam bahasa Turki hari ini. MENAMBAH makna, menambah tafsiran dalam penyederhanaan; hanya mengemas kini bahasa. Tandai tempat dengan makna yang samar-samar[tidak jelas]. Alih huruf: [di sini]
3) Pengekstrakan istilah dan orang:
Nama peribadi, nama tempat, gelaran dan istilah berkala yang disebut dalam transkripsi di bawah muncul dalam senarai berasingan. Ambil hanya yang dinyatakan dengan JELAS dalam teks; Jangan tambah dengan meneka. Tandakan dengan [?] jika anda tidak pasti sebutannya. Teks: [di sini]
4) Kawalan bacaan yang mencurigakan:
Pengawal paleografi berpengalaman dalam peranan. Dalam transkripsi di bawah, tandakan perkataan yang tidak konsisten dalam makna, tidak sesuai dengan noktah atau tidak sesuai dengan konteks, dan tulis sebab ia mencurigakan. Mengenakan pembetulan muktamad; Hasilkan senarai syak wasangka yang pakar manusia akan bandingkan dengan dokumen. Teks: [di sini]
Gesaan lemah / Gesaan kuat
lemah:
Baca teks Uthmaniyyah ini dan berikan saya terjemahannya.
Ini mendorong AI untuk menghasilkan bacaan tunggal yang muktamad, menyembunyikan kesamaran dan menyesuaikan dalam jurang. Dalam bahasa Turki Uthmaniyyah, ini hampir satu kesilapan yang terjamin.
kuat:
Lihat transliterasi Uthmaniyyah di bawah. Bacaan muktamad: PENGENAAN. Sediakan alternatif yang mungkin untuk setiap perkataan yang samar-samar, tinggalkan bahagian [tidak terbaca], jangan tambah apa-apa yang tiada dalam teks. Berikan bacaan yang dipermudahkan kepada bahasa Turki hari ini dalam lajur yang berasingan, tetapi simpan yang asal. Tandai apa-apa yang anda tidak pasti dengan [?] supaya pakar boleh membandingkannya dengan dokumen. Teks: [di sini]
Perbezaannya: larangan membaca yang ketat, meminta alternatif, mengekalkan ruang kosong dan output berlapis membolehkan pengesahan pakar.
Kesilapan biasa
- Menganggap draf HTR sebagai betul. Dalam bahasa Turki Uthmaniyyah, kebanyakan draf mentah mungkin tidak tepat; Kawalan baris demi baris adalah satu kemestian.
- Satu-satunya bacaan muktamad adalah untuk mengenakan. Jika alternatif disembunyikan dalam perkataan yang vokalnya tidak ditulis, makna yang salah akan direkodkan.
- Mengisi kawasan yang tidak boleh dibaca. Ia harus dilindungi oleh ruang kosong [tidak boleh dibaca], bukan dibuat-buat.
- Mencampurkan yang asli dengan penyederhanaan. Penyederhanaan harus menjadi lapisan yang berasingan; Alih huruf asal tidak boleh diherotkan.
- Melumpuhkan pakar. Tanpa pengetahuan paleografi dan tempoh, bacaan AI adalah tekaan tanpa nilai saintifik.
Secara ringkasnya
Transkripsi Uthmaniyyah dan manuskrip boleh dipercepatkan pada peringkat draf mentah dengan HTR dan AI; Anda mendapat output pertama yang mengurangkan hari bekerja kepada jam. Tetapi tepat di kawasan ini bahawa satu huruf, satu perbezaan vokal mengubah makna; AI cenderung untuk menyembunyikan ketidakpastian dan mengisi jurang. Kaedah yang betul adalah berlapis: garis besar mentah, nota alternatif kekaburan, lapisan pemudahan yang berasingan dan, terutamanya, pengesahan baris demi baris dokumen oleh pakar yang biasa dengan paleografi. AI mempercepatkan bacaan awal; Tanggungjawab saintifik adalah milik pakar.
Tugasan permohonan
Dapatkan transliterasi dokumen Uthmaniyyah atau manuskrip (pengeluaran anda sendiri atau salinan yang diterbitkan). Minta AI untuk bacaan alternatif dengan templat "transliterasi memelihara kekaburan". Kemudian jana lapisan penyederhanaan secara berasingan dengan "bacaan berlapis". Bandingkan setiap perkataan yang ditandakan dengan samar-samar dengan sumber atau kamus pakar; Perhatikan berapa banyak ralat yang akan dihasilkan oleh AI jika ia mengenakan satu bacaan.
senarai semak
- [ ] Saya menggunakan HTR/model yang sesuai dengan tempoh dan gaya penulisan.
- [ ] Saya meminta AI untuk alternatif kepada bacaan yang tepat.
- [ ] Saya melindungi bahagian yang tidak boleh dibaca dengan [tidak boleh dibaca].
- [ ] Saya mengasingkan transliterasi asal daripada penyederhanaan.
- [ ] Saya mempunyai teks terakhir yang disahkan oleh pakar/dokumentari yang mengetahui paleografi.