Üksus 4 / 11

Muistsed tekstid, lihtsustamine ja transliteratsioon: Ottomani ja Diivani tekstidega töötamine

Kasu:

  • Teadke lihtsustamise ja transkriptsiooni erinevust ning oskate kasutada tehisintellekti ainult piiratud, kontrollitavate ülesannete jaoks (arusaadavuse tugi, leksikoni hüpotees, lihtsustamise mustand).
  • Võimalus kontrollida iga väljundit originaalteksti ja usaldusväärsete allikatega, vältides selliseid lõkse nagu puuduva teksti täiendamine ja sisu sirgendamine
  • Oskus mõista, et inimfiloloog on asendamatu sellistes teostes nagu transkriptsioon, prosoodia ja teaduslik väljaanne.

Suur osa türgi kirjandusest on kirjutatud keeles, mida tänapäeva lugeja otseselt lugeda ei oska: ottomani türgi keel (Ottomani türgi keel – türgi keel, mis on kirjutatud araabia tähestikus, kasutusel Ottomani impeeriumi ajal, rikastatud araabia ja pärsia sõnade ja väljenditega). Enamik Diivani luulet, ajalooraamatuid, ajalehti ja arhiividokumente on selles keeles. Nende tänapäevasele lugejale kättesaadavaks tegemine nõuab kahte protsessi: transkriptsiooni (teksti tõlkimine ühest tähestikust teise, häälikute säilitamine erimärkidega; näiteks araabia tähtedega teksti muutmine ladina tähtedega) ja lihtsustamine (teksti vanade ja raskete sõnade asendamine sõnadega, millest tänapäeva lugejad aru saavad).

Selles üksuses õpime kasutama tehisintellekti nende ülesannete abilisena — kuid siin on hoiatus tugevam kui kunagi varem: Pärandtekstitöös on tehisintellekti vigade ja hallutsinatsioonide oht väga suur; Iga väljundit ei saa kasutada ilma valdkonna pädeva isiku kontrollimiseta, võrreldes seda algtekstiga. AI võib sõna valesti lugeda, paarilist "lõpetada", luua tähenduse, mida pole olemas. Siin on AI ülevaade ja arutelu tööriist; See ei asenda kunagi asjatundlikku filoloogi.

Miks on risk selles valdkonnas suurem?

Kolmel põhjusel:

  1. Mitmetähenduslik lugemine. Araabia kirjas lühikesi täishäälikuid sageli ei kirjutata; Ühes ja samas tähestringis võib olla mitu sõna. Õige lugemine nõuab konteksti ja asjatundlikkust. AI võib esitada kõige tõenäolisema ennustuse kui "kindel".
  2. Raske sõnavara. Araabia-pärsia fraaside, metafooride (stereotüüpsed kujundid klassikalises luules) ja aruzi (silbi pikkusel põhinev mõõt) peensused diivaanitekstides lähevad pinnapealses lihtsustuses kaduma või moonutatakse.
  3. Kalduvus lõpetada. AI suudab automaatselt täita puuduva või kulunud teksti vastavalt sellele, milline see "peaks" olema. See on tõsine viga filoloogias; on välja mõelda tekst, mida pole olemas.
Tähelepanu: tehisintellektile käskimine "tõlkida see Ottomani paaris" ja väljundi avaldamine ilma seda kontrollimata on selle valdkonna kõige ohtlikum viga. Transkriptsiooni ja lihtsustamise väljundeid tuleks alati võrrelda originaalteksti, usaldusväärse sõnastiku ja võimalusel olemasoleva väljaandega (teadusliku väljaandega).

Kuidas AI ohutult kasutada

Vanemates tekstides kasutage AI-d nende piiratud, kuid kasulike ülesannete jaoks:

  • Arusaamise (sisu) tugi: ladina tähtedega teksti raskete sõnade tänapäevase vaste õppimine mustandina.
  • Sõnastiku hüpotees: sõna võimalikud tähendused on loetletud – seejärel kontrollitakse seda usaldusväärse sõnaraamatu põhjal.
  • Lihtsustatud mustand: lõigu umbkaudne mustand praeguses türgi keeles – seejärel laske eksperdil see üle vaadata.
  • Võrdlus: oma lihtsustuse võrdlemine AI omaga ja tähelepanuta jäetud piirkondade nägemine.

Teisest küljest ärge laske tehisintellektil teha üksi järgmisi ülesandeid: transliteratsioon araabia skripti pildist; teaduslik väljaanne; puuduva teksti täiendamine; pretendeerida lõplikule tähendusele.

Näpunäide. Küsige kahte lihtsustusversiooni: (1) tihe lihtsustamine, mis säilitab tähenduse, (2) loend, mis selgitab sõnade vasteid. Teine loend hõlbustab eksperdil kiiret kinnitust ja muudab tehisintellekti väljamõeldud vastused nähtavaks.

kolm minikarpi

Juhtum 1 – sõnastiku hüpotees säästis aega. Üks magistrant sai tehisintellektilt 30 raske sõna mustandi vaste ladina tähtedega ajalootekstis. 30 ekvivalenti kinnitatud usaldusväärsest sõnastikust; 4 olid valed ja need on parandatud. Sõnastiku sirvimise aeg lühenes oluliselt, kuid kontrollimisetappi ei jäetud vahele.

Juhtum 2 – lõpetamise viga tabati. Teadlane küsis tehisintellektilt kulunud kupleti puuduva osa kohta. AI andis prosoodiale sobiva, sujuva, kuid täielikult väljamõeldud lõpu. Kui uurija vaatas väljaande märkmeid, nägi ta, et see peatükk on tegelikult erinev. Lõks "AI täidab puuduva teksti" on muutunud konkreetseks.

3. juhtum – moonutatud tähenduse lihtsustamine. Toimetaja kasutas tehisintellekti lihtsustatud diivanipaleti; Kuna tehisintellekt tõlkis metafoori (stereotüüpse kujutise) sõna-sõnalt, läks kupleti algne tähendus kaduma. Toimetaja pidas nõu valdkonnaeksperdiga ja tegi sisu säilitava lihtsustuse.

Neli kopeeritavat malli

1) Raske sõna vaste (tingimusel kinnitusel):

Esitage allpool ladina tähtedega vanas türgikeelses tekstis ägestatud sõnade tänaste võimalike vastete LOETELU. Iga sõna juurde märkige "pole kindel, tuleks sõnaraamatust kontrollida". Sõnade lisamine, mida tekstis ei ole, teksti täiendamine.Tekst: [kleebi tekst siia]

2) Kahe versiooni lihtsus:

Lihtsustage järgmist teksti kahel viisil: (1) lähedane versioon, mis säilitab tähenduse ja kujundid, (2) tabel, mis näitab iga muudetud sõna vana/uue vastet. Puuduvate osade täitmine, tähenduse lisamine, mida pole olemas. Märkige koht, kus te pole kindel.Tekst: [kleebi tekst]

3) Lihtsustamise juhtimine:

Allpool on tegelik tekst ja minu lihtsustus. Märkige kohad, kus tähendus on minu versioonis moonutatud, välja jäetud või valesti esitatud. Ärge suruge peale oma versiooni; lihtsalt tooge välja probleemsed kohad ja siduge oma põhjendus tekstiga. Originaal: [...] Minu versioon: [...]

4) Süžee/kontseptsiooni selgitus:

Selgitage klassikalisi pilte ja metafoore järgmises paaris. Igaühe kohta: võimalik tähendus, kasutamine traditsioonis ja märge "tuleb kontrollida asjatundlikust allikast". Ärge tehke lõplikku otsust, esitage ka alternatiivsed näidud. Paar: [kirjutage paar]

Nõrk viip / Tugev viip

Nõrk: "Tõlgige see Osmanite tekst tänapäeva türgi keelde."

Tugev: "Lihtsustage vana türgikeelset teksti allolevate ladina tähtedega; säilitage pildid ja metafoorid, ärge taandage seda sõnasõnaliseks tähenduseks. Näidake iga muudetud sõna vanas/uues tabelis. Täitke puuduv või mitmetähenduslik osa; märkige see kui "ebakindel, peab asjatundja kontrollima". Ärge lisage sõnu ega salme, mida tekstis pole."

Võimas viip sulgeb lõpetamise lõksu, hoiab ära sisu kadumise ja kuvab tabeli, mis muudab kontrollimise lihtsamaks. Nõrk viip jätab ukse lahti, et AI sobiks ja sujuks.

Ülesanne ja turvalaud

äri

AI üksi

Õige kasutamine

Sõna raske tähendus ladina tähttekstis

riskantne

Mustand + sõnastik kinnitus

transliteratsioon araabia kirjast

pole tehtud

asjatundlik filoloog

Lihtsustamine

mustand

Asjatundlikud remonditööd

Täielik puuduv tekst

Absoluutselt tegemata

Väljaanne/ekspert

Selgitus

hüpotees

Ekspertide allika kinnitus

teaduslik väljaanne

pole tehtud

filoloog

Aruz ja meeter: miks on tehisintellektil erilisi raskusi?

Suurem osa klassikalisest türgi luulest on kirjutatud aruzis (silpide pikkusel ja lühidusel põhinev mõõtmissüsteem, mis põhineb mustritel). Selleks, et teha kindlaks, millises aruz-mustris kuppel on, tuleb ükshaaval dešifreerida, kas silbid on pikad või lühikesed, ja mõningaid peensusi (nt ühe pika silbi kaheks lühikeseks lugemine või täishääliku mahajätmine). See on tavaline, kuid väga peen töö ja siin läheb AI sageli valesti: see võib mustrit valesti nimetada, silpi valesti mõõta või soovitada mustrit, mis "kõlab hästi", kuid on vale.

Seetõttu ei ole aruz-meetri määramine AI-ga pimesi tehtud töö; Parimal juhul annab see "kandidaadi" ja keegi, kes tunneb mõõtjat, peab selle kandidaadi ise kuppelt kontrollima. Sama kehtib ka peatuste ja mustrite analüüsi kohta silbimeetris (rahvaluule meeter iga rea ​​silpide arvu järgi); AI võib isegi silpide lugemisel vigu teha. Meeter on koht, kus testitakse kirjandusliku analüüsi täpsust: vale väide mõõtmisele muudab essee algusest peale ebausaldusväärseks.

Ettevaatust: ärge pange AI antud prosoodilise mustri nime uuringusse ilma seda kontrollimata (nt "failatün failatün..."). Mõõtmine on nii tehniline kui ka kultuuriline teadmine ning inimteadmised on selles valdkonnas asendamatud. Kasutage tehisintellekti maksimaalselt juhisena küsimusele "kust peaksin otsima selle paari mõõtu, millised mustrid on võimalikud?"

Levinud vead

  • Transkriptsiooni/lihtsustuse avaldamine ilma seda kinnitamata. Iga väljundit võrreldakse originaaltekstiga.
  • Laske tehisintellektil puuduv tekst täita. See on olematu teksti koostamine; Seda kindlasti ei tehta.
  • Taandada tähendus sõnasõnaliseks tähenduseks. Klassikalisi kujundeid tuleb säilitada.
  • Mõeldes, et ainult lugemine on kindel. Araabia kirjas on levinud mitu lugemist; Küsi alternatiivide kohta.
  • Kriitilise teksti lõpetamine ilma asjatundjaga konsulteerimata. Inimfiloloog on selles valdkonnas asendamatu.

Kokkuvõttes

AI vanades tekstides; See on kasulik, kuid kõrge riskiga tööriist arusaamise toetamiseks, leksikaalseks hüpoteesiks ja lihtsustamiseks. Sellised ülesanded nagu transkriptsioon, väljaandmine ja puuduvate tekstide täiendamine kuuluvad asjatundlikule filoloogile. Kontrollige iga väljatrükki originaalteksti, usaldusväärse sõnastiku ja praeguste väljaannetega; Ärge langege lõpetamise ja lamestamise lõksu. Selles valdkonnas on inimteadmised kiirusest kõrgemad.

Rakenduse ülesanne

Otsige üles lühike, lihtsustatud iidne ladina tähtedega tekst (diivanipaber või ajaloolõik). Hankige tehisintellekti plaan kahe versiooni lihtsustamise malli abil. Seejärel kontrollige iga sõna sõnatabelis usaldusväärse sõnastikuga; Märkige valed linnukesed. Kontrollige, kas vähendate kujutist selle otsese tähenduseni ja vajadusel parandage seda.

kontrollnimekiri

  • [ ] Ma ei lasknud AI-l iseseisvalt araabia skripti transkriptsiooni teha.
  • [ ] Puuduvat/mitmetähenduslikku osa ma ei täitnud.
  • [ ] Sõna vasted kinnitasin usaldusväärsest sõnastikust.
  • [ ] Kontrollisin, kas pildid ja pildid on säilinud.
  • [ ] Konsulteerisin kriitilisele tekstile spetsialiseerunud filoloogiga.