Üksus 3 / 12

Transkriptsioon: Ottomani türgi keel ja käsikirjad

Kasu:

  • Võimalus seadistada HTR-i ja transliteratsiooni töövoogu ning selgitada, miks töötlemata mustand nõuab asjatundlikku kontrolli rida-realt
  • Võimalus kaitsta loetamatuid alasid, küsides alternatiive, selle asemel, et kehtestada täpset lugemist vokaalide/tähtede ebaselguse korral Osmanite türgi keeles
  • Võimalus eraldada algne transliteratsioon eraldiseisvast lihtsustuskihist, jättes lõpliku teadusliku vastutuse paleograafile

Võib-olla on ajaloouurimise kõige nõudlikum osa käsikirjade ja vanade kirjalike dokumentide loetavaks tekstiks transkribeerimine. Kiri, märkmik, kohtuprotokoll või Ottomani dokument muutub otsitavaks alles pärast selle transkribeerimist. Transkriptsioon on dokumendi sisu (enamasti käsitsi kirjutatud või iidne kiri) ülekandmine kirjutatud loetavaks tekstiks. Osmanite puhul kaasneb sellega sageli transliteratsioon: araabia tähtedega teksti ülekandmine ladina tähestikusse koos selle tähthaaval vastetega.

Trükitekstide jaoks kasutasime OCR-i; Käsitsi kirjutamiseks on vaja teist tehnoloogiat: HTR (Handwritten Text Recognition). HTR on OCR-ile sarnane, kuid palju keerulisem tehnoloogia, mis teisendab käsitsi kirjutatud dokumendid masintekstiks. Selles üksuses näeme, kuidas kasutada HTR-i ja AI-d Ottomani ja käsikirjade transkriptsioonis, veapiire ja seda, miks on kontrollimine siin veelgi kriitilisem.

Miks on käsitsi kirjutamine nii raske?

Käekiri on palju muutlikum kui trükitekst: igal kirjutajal on omanäoline käsi, tähed on omavahel seotud, kasutatakse lühendeid ja erimärke, tint voolab välja, paber kulub. Ottomani türgi keeles on raskused mitmekordistunud:

  • Kontekstuaalsed tähevormid: sama täht kirjutatakse erinevalt sõna algusesse, keskele ja lõppu.
  • Täishäälikuid ei kirjutata: lühikesi täishäälikuid sageli ei kirjutata; lõpetab lugeja kontekstist lähtudes. See tekitab ebaselgusi, nagu "vastuvõtt või tagasilükkamine?"
  • Erinevad kirjutamisstiilid: on erinevaid käekirjastiile nagu rik'a, divani, ta'lik; Igaüks neist nõuab erinevat lugemisoskust.
  • Ottomani sõnavara: araabia ja pärsia sõnad, mida tänapäeva türgi keeles ei eksisteeri.

Seetõttu töötavad HTR ja AI Ottomani türgi keeles palju suurema veamarginaaliga kui trükitud OCR. Asjatundliku paleograafi silm (paleograafia – iidsete kirjutiste lugemise teadus) pole siin tööriist, vaid vajadus.

Töövoog: samm-sammult

1. Valmistage ette dokumendi kvaliteet. Nagu OCR-i puhul, on oluline kõrge eraldusvõime ja hea kontrastsus. See on käekirja puhul veelgi kriitilisem.

2. Valige HTR-mudel. Ottomani, araabia käekirja või konkreetse perioodi jaoks spetsiaalselt koolitatud HTR-mudelid on palju edukamad kui üldmudelid. Katsetage, milline mudel teatud perioodi ja kirjutamisstiili jaoks hästi sobib.

3. Looge toores transkriptsioon. HTR-mudel loob kontuuri. Ottomani türgi keeles on see mustand algus täis vigu, mida kogenud silm peab põhjalikult kontrollima.

4. Kontekstuaalne täiustamine tehisintellektiga. Toorväljundis võivad olla AI-lipu vastuolud, võimalikud lugemisalternatiivid ja kahtlased asukohad. Kuid AI "parandus" on siin eriti riskantne: see võib viidata väljamõeldud lugemisele.

5. Transliteratsioon ja lihtsustamine (kihiline). Araabia tähtedega teksti translitereerimine ladina tähtedesse, millele järgneb selle lihtsustatud lugemine tänapäeva türgi keelde, toodetakse eraldi kihtidena. Originaal ei purune kunagi.

6. Eksperdikontroll. Lõpliku transkriptsiooni kinnitab paleograafiat ja perioodi tundev ekspert, võrreldes seda dokumendiga.

Tähelepanu: Ottomani türgi keeles võib AI kontekstist kirjutamata vokaaliga sõna "arvamisel" toota täiesti vale lugemist ja esitada selle enesekindlas keeles. Tähtede erinevus, näiteks "kabul" asemel "kabil" või "alem" asemel "alim", muudab tähendust täielikult. Iga ebakindel näit tuleks esitada koos alternatiividega ja ühtki lõplikku näitu ei tohiks kehtestada.

Kihid ja vastutus lauaga

kiht

Sisu

AI roll

Eksperdi roll

Pilt

originaaldokument

Allikas

HTR mustand

Toores masin lugemine

toodab

Juhtimine algusest lõpuni

transliteratsioon

Ladina tähe ülevõtmine

eelnõu soovitab

Parandab, parandab

Märkused ebakindlusest

[?] ja alternatiivid

märgid

otsustab

Lihtsustamine

Tänane türgi keel

eelnõu soovitab

Heakskiidud

teaduslik väljaanne

Lõpptekst + märkmed

Ainult ekspert

kolm minikarpi

Juhtum 1 – HTR kiirendas esimest mustandit 5 korda. Doktorant transkribeeriks 200-leheküljelise Ottomani märkmiku. Täielik käsitsi transkriptsioon oli hinnanguliselt 60 tööpäeva. Selle perioodi jaoks treenitud HTR-mudeliga tuli toores süvis välja mõne tunniga; Üliõpilane parandas selle mustandi ja vähendas tööd 12 tööpäeva peale. Kuid ta pidi võrdlema iga lehte dokumendiga rida-realt; Umbes 30% eelnõust oli vale.

Juhtum 2 – üks täht, üks tähendus. Üks teadlane tugines sõnale, mida AI luges "kuberneriks". Ekspertide kontrolli all saadi aru, et see sõna oli tegelikult "eestkostja" (vastutab lapse/inimese eest) ja kuna täishäälik ei olnud märgitud, arvas AI selle valesti. Dokumendi õiguslik tähendus muutus täielikult. Õppetund: Ottomani türgi keeles põhjustab ühe tähe/hääliku erinevus dokumendi tõlgendamise algusest peale; asjatundja on vajalik.

Juhtum 3 – väljamõeldud lõpetamine. Reas, mille tint oli otsa saanud ja millest üks sõna oli loetamatu, täitis tehisintellekt lünga "loogilise" sõnaga. Ekspert mõistis, et see lünk oli tegelikult kohanimi ja et tehisintellekt oli selle välja mõelnud. Tühik on jäänud [loetamatuks]. Õppetund: loetamatut ruumi ei täideta, see on märgistatud.

Neli kopeeritavat malli

1) Transliteratsioon, mis säilitab mitmetähenduslikkuse:

Allpool on Ottomani dokumendi HTR-i toorväljund/transliteratsioon. Sinu ülesandeks on tekst üle vaadata ja võimalikud lugemisvead märgistada. Reeglid: (1) Pakkuge iga sõna kohta, milles te pole kindel, 2-3 võimalikku lugemisalternatiivi, ärge suruge seda peale. (2) Loetamatud alad jätta [loetamatuks], mitte täita. (3) Sõnade LISAMINE, mida tekstis ei ole. (4) Näidake mitmetähenduslike vokaalidega sõnade alternatiive. Tekst: [siin]

2) Kihiline lugemine (originaal + lihtsustamine):

Looge KAKS veergu järgmise kinnitatud Ottomani transliteratsiooni jaoks: (1) algne transliteratsioon (puudutus), (2) lihtsustatud lugemine tänapäeva türgi keelde. tähenduse LISAMINE, tõlgenduse lisamine lihtsustamisel; lihtsalt värskendage keelt. Märkige mitmetähendusliku tähendusega kohad [ebaselge]. Transliteratsioon: [siin]

3) Tähtaja ja isiku väljavõte:

Allolevas transkriptsioonis mainitud isikunimed, kohanimed, pealkirjad ja perioodilised terminid ilmuvad eraldi loendites. Võtke ainult need, mis on tekstis SELGELT mainitud; Ära lisa arvamise teel. Märkige [?]-ga, kui te pole häälduses kindel. Tekst: [siin]

4) Kahtlane lugemiskontroll:

Kogenud paleograafiakontrolör rollis. Märgi allolevas transkriptsioonis sõnad, mis on tähenduselt vastuolus, ei sobi perioodiga või ei sobi konteksti ning kirjuta, miks need on kahtlased. Lõpliku paranduse kehtestamine; Looge kahtluste loend, mida inimekspert dokumendiga võrdleb. Tekst: [siin]

Nõrk viip / Tugev viip

Nõrk:

Lugege seda Ottomani teksti ja andke mulle selle tõlge.

See sunnib AI-d tootma ühtset lõplikku näitu, varjates ebaselgusi ja sobitades lünki. Ottomani türgi keeles on see peaaegu garanteeritud viga.

Tugev:

Vaadake allpool Ottomani transliteratsiooni. Lõplik lugemine: POSITSIOON. Esitage iga mitmetähendusliku sõna jaoks võimalikud alternatiivid, jätke välja [loetamatud] osad, ärge lisage midagi, mida tekstis pole. Andke lihtsustatud lugemine tänasele türgi keelele eraldi veerus, kuid säilitage originaal. Märkige [?]-ga kõik, milles te pole kindel, et ekspert saaks seda dokumendiga võrrelda. Tekst: [siin]

Erinevus: range lugemiskeeld, alternatiivide taotlemine, tühikute säilitamine ja kihiline väljund võimaldavad ekspertkontrolli.

Levinud vead

  • HTR-i mustandi eksimine õigeks. Ottomani türgi keeles võib suur osa toorest süvisest olla ebatäpne; Juhtimine ridade kaupa on kohustuslik.
  • Ainus lõplik lugemine on pealesurumine. Kui alternatiivid on peidetud sõnadesse, mille täishäälikud ei ole kirjutatud, salvestatakse vale tähendus.
  • Loetamatu ala täitmine. See peaks olema kaitstud tühikutega [loematu], mitte väljamõeldud.
  • Originaali segamine lihtsustamisega. Lihtsustamine peaks olema eraldi kiht; Algset transliteratsiooni ei tohiks moonutada.
  • Eksperdi keelamine. Ilma paleograafia ja perioodi teadmisteta on AI näit oletus, millel pole teaduslikku väärtust.

Kokkuvõttes

Ottomani ja käsikirja transkriptsiooni saab HTR-i ja AI-ga töötlemata mustandi etapis oluliselt kiirendada; Saate esimese väljundi, mis vähendab tööpäevade arvu tundideks. Aga just sellel alal muudab üksainus täht, üksik vokaalide erinevus tähendust; AI kipub ebakindlust varjama ja lünki täitma. Õige meetod on kihiline: toores kontuur, alternatiivsed mitmetähenduslikud noodid, eraldiseisev lihtsustuskiht ja ennekõike dokumendi rida-realt kontrollimine paleograafiat tundva eksperdi poolt. AI kiirendab esialgset lugemist; Teaduslik vastutus kuulub eksperdile.

Rakenduse ülesanne

Hankige Ottomani või käsikirjalise dokumendi transliteratsioon (oma toodang või avaldatud koopia). Küsige tehisintellektilt alternatiivset lugemist, kasutades malli „mitmetähenduslikkust säilitav transliteratsioon”. Seejärel genereerige lihtsustuskiht eraldi "kihilise lugemisega". Võrrelge iga ebamääraselt märgitud sõna asjatundliku allika või sõnastikuga; Pange tähele, kui palju vigu AI tekitaks, kui see kehtestaks ühe näidu.

kontrollnimekiri

  • [ ] Kasutasin perioodile ja kirjutamisstiilile vastavat HTR-i/mudelit.
  • [ ] Küsisin AI-lt täpsele näidule alternatiive.
  • [ ] Kaitsesin loetamatud osad funktsiooniga [unreadable].
  • [ ] Hoidsin algse transliteratsiooni lihtsustamisest eraldi.
  • [ ] Lasin lõpliku teksti kontrollida paleograafiat tundval eksperdil/dokumentalistil.