Jednotka 6 / 11

Čtení a překlad epigrafií, starověkých rukopisů a textů

zisky:

  • Schopnost ponechat čtený znak a odhadované dokončení oddělené a označené při přepisu nápisů a rukopisů do konceptu textu pomocí OCR/HTR
  • Schopnost rozpoznat formy halucinací, jako je rozmazané dokončování textu, falešný překlad a vymyšlená atribuce, a porovnat překlad se zdrojem a zpětným překladem.
  • Schopnost porozumět tomu, jak kontext jazyka, písma a žánru určuje spolehlivost umělé inteligence a že závěrečná četba a interpretace náleží odbornému filologovi

Jedním z nejpřímějších zvuků, které nám z minulosti zůstaly, jsou písemné prameny: nápisy vytesané do kamene, hliněné tabulky, papyry, pergamenové rukopisy, náhrobky a pečeti. V této jednotce uvidíme, jak epigrafie (nauka o studiu nápisů vyrytých na tvrdých površích, jako je kámen, kov, keramika), paleografie (odbornost čtení a datování starověkých rukopisů) a umělá inteligence urychlují čtení, překlad a editaci těchto textů, ale proč každé čtení musí být potvrzeno odborným filologem.

Základní princip: AI pomáhá číst slabý text, překládat jazyk a navrhovat možné doplňky; ale konečné přečtení nápisu, doplnění chybějících písmen a významu je na rozhodnutí odborníka znalého jazyka a období. Právě v této oblasti je AI vystavena největšímu riziku halucinací, protože model je velmi náchylný k vyplnění chybějícího nebo slabého textu něčím „věrohodným“, ale vymyšleným.

Kroky pro práci s písemnými prameny

1. Dokumentace. Nápis nebo rukopis je zobrazen ve vysokém rozlišení, ve formátu se zvýšeným kontrastem. Pro nejasné povrchy se používá speciální osvětlení (boční světlo) a techniky jako RTI; AI pomáhá zostřit kontrast a okraje písmen.

2. Rozpoznávání znaků. OCR (Optical Character Recognition) se používá pro tištěný text a HTR (Handwritten Text Recognition) pro ruční psaní. HTR na bázi AI je mocný při přepisování starých rukopisů.

3. Přepis a kompletace. U vybledlých nebo zlomených částí odborník navrhuje možné restaurování na základě gramatiky a paralelních textů. Dokončená písmena jsou vždy označena znaky, jako jsou hranaté závorky; Co se čte a co se předpovídá, se nikdy nezaměňuje.

4. Překlad. Text je přeložen z výchozího jazyka (latina, starověká řečtina, osmanština, klínové písmo atd.). AI poskytuje první návrh překladu; expertní nuance koriguje terminologii a historické souvislosti.

5. Komentář. To, co text říká, kdo jej napsal a k jaké události se vztahuje, jsou historické interpretace a patří odborníkovi.

Tip: Pokud řeknete AI, aby „přečetla a dokončila“ nejasný text, bezpečně doplní mezery. Místo toho řekněte „uvádějte pouze jasně čitelné znaky, ponechte prázdné a označte oblasti, kde si nejste jisti“. Požádejte o vyplnění v samostatném kroku s odůvodněním a nechte si jej potvrdit odborníkem.

Halucinace: největší nebezpečí této oblasti

Nejničivější chybou umělé inteligence v humanitních oborech je výmysl. V této oblasti existují čtyři typické formy:

  • Textová výroba: "Doplní" neexistující část slabého nápisu a přidá neexistující slovo.
  • Falešný překlad: Přeloží slovo, kterému nerozumí plynule, ale nesprávně; Čtenář si toho nemůže všimnout, protože nezná zdroj.
  • Vymyšlený odkaz: Je tam napsáno „Tento nápis byl publikován v této publikaci“, ale tato publikace neexistuje.
  • Nesprávné uvedení/uvedení zdroje: Sebevědomě umístí styl psaní do nesprávného období.

To vše nelze nikdy použít bez potvrzení odborníkem, který vidí zdroj a zná jazyk.

Pozor: To, že je překlad plynulý a přesvědčivý, ještě neznamená, že je správný. Umělá inteligence dokáže dokonce přeměnit klínové písmo, kterému nerozumí, na sebevědomou větu. Někdo, kdo neumí číst zdrojový text, si nikdy nemůže sám ověřit přesnost překladu AI.

tři mini pouzdra

Případ 1 – HTR otevřel archiv. Jeden archiv uchovával tisíce stránek osmanských rukopisů uzavřených pro badatele, protože jejich čtení vyžadovalo odborné znalosti a čas. HTR na bázi umělé inteligence přepisuje sešity do prohledávatelného konceptu textu; Odborníci návrh opravili a nečitelná místa byla označena. Není to fulltext, ale objevil se výkonný skenovací nástroj.

Případ 2 – Zachyceno zhotovené dokončení. Student nechal AI přečíst rozbitý latinský náhrobek; AI ​​"doplnila" chybějící řádek plynulou větou. Epigraf ukázal, že navrhované dokončení bylo fyzicky nemožné, protože v kameni nezbylo místo. Dostavba byla rekonstruována a označena na základě paralelních nápisů.

Případ 3 – Opraven falešný překlad. Jeden tým by ohlásil překlad starověkého řeckého nápisu AI; Když filolog zkontroloval, zjistil, že AI ​​přeložila sloveso ve špatném čase, čímž obrátila význam textu (ať už to byla nabídka nebo památka). Návrat ke zdroji komentář uložil.

Čtyři kopírovatelné šablony

1) Konzervativní transkripce:

Vaše role: asistent přepisu. Na tomto obrázku nápisu/rukopisu uveďte POUZE jasně čitelné znaky. Nečtěte oblasti, které jsou nejasné, rozbité nebo nejisté; Označte jej jako „[nečitelný]“. DOPLŇTE CHYBĚJÍCÍ DÍLY. Všimněte si také postav, které podezříváte.

2) Odůvodněný návrh na doplnění:

Níže je text s přesnými částmi čtení a [mezery]. Navrhněte MOŽNÉ doplňky pro mezery, ale pro každý návrh: (a) odůvodnění (gramatika, paralelní text), (b) zda mezera odpovídá počtu písmen, (c) alternativy. Toto jsou návrhy; Není to definitivní čtení. Uveďte, že je vyžadován souhlas odborníka.

3) Koncept překladu (chráněný zdroj):

Přeložte níže uvedený [jazyk] text. U každé věty ponechte zdrojový text (zarovnejte řádek po řádku). Označte slova, kterými si nejste jisti, a uveďte alternativní překlad. NEVYMLUVUJTE podmínky; Pokud nevíte, napište "nejistý". Toto je návrh; Odborný filolog zkontroluje.

4) Ověření překladu (zpětný překlad):

Přeložte tento překlad ZPĚT do zdrojového jazyka a porovnejte jej s původním zdrojovým textem. Označte části, kde je význam změněn, přidán nebo zrušen. Zkontrolujte zejména čas, předmět a čísla.

Slabá výzva / Silná výzva

Slabá výzva:

Přečtěte si tento starodávný nápis a řekněte nám, co říká.

Ve slabém nápisu AI ​​doplní mezery, může špatně přeložit jazyk a osoba, která nevidí zdroj, si toho nevšimne.

Výkonná výzva:

Na tomto obrázku s nápisem nejprve přepište POUZE jasně čitelné znaky a zakryté části ponechte „[nečitelné]“. Potom SAMOSTATNĚ navrhněte možné doplnění mezer s odůvodněním, ale nenabízejte žádné konkrétní. Nakonec poskytněte návrh překladu a označte slova, kterými si nejste jisti. Všechny podléhají schválení odborníkem.

Rozdíl: první dává fiktivní „čtení“; ten udržuje čtené, predikované a přeložené vrstvy oddělené a ověřitelné.

Jazyky, skripty a znalostní hranice AI

Archeologické texty pokrývají širokou škálu jazyků a písem: latinské a starořecké nápisy, osmanské a arabské rukopisy, klínové tabulky, egyptské hieroglyfy, runové nápisy a další. Znalosti AI v těchto jazycích a skriptech jsou velmi nerovnoměrné. Zatímco návrh překladu může být rozumný pro jazyky s velkým množstvím digitálního textu, jako je latina a starověká řečtina, pro texty, které jsou řídce zdokumentované, dešifrované nebo čtené pouze několika odborníky, je AI téměř zcela nespolehlivá; produkuje přesvědčivé, ale zcela vykonstruované „překlady“ v těchto oblastech.

Je tu také otázka kontextu a žánru. Stejné slovo může mít různé významy v právním dokumentu, modlitebním textu a náhrobku. Odborný filolog rozpozná typ textu (pobožnost, pomník, smlouva, dopis) a přečte slovo ve správném kontextu; AI postrádá tuto obecnou citlivost a vnucuje nejběžnější význam. Zkratky, vzorce a základní výrazy (obzvláště velmi časté v nápisech) snadno uvádějí AI v omyl.

Zlaté pravidlo tedy zní: používejte AI jako akcelerátor pro jazyky, které znáte, jazyky, které můžete ovládat; Nikdy se nespoléhejte pouze na AI překlad v jazyce, který neumíte číst. Někdo, kdo neumí číst zdroj, nemůže ověřit přesnost překladu, a proto nemůže tento překlad proměnit ve vědecké tvrzení.

Tip: Při zadávání textu AI určete jeho jazyk, odhadované období a typ (nápis/dopis/dokument). Znalost kontextu částečně snižuje posun AI směrem k nejběžnějšímu, ale nesprávnému čtení – ale neeliminuje potřebu potvrzení.

Tabulka úkolů písemných zdrojů

Quest

Role AI

lidské rozhodnutí

ověření

vylepšení obrazu

Kontrast/hrana

Výběr kritérií

Srovnání s originálem

OCR/HTR

návrh textu

neurčitý charakter

odborné korektury

dokončení

Doporučení (odůvodněné)

Přijmout/odmítnout

Paralelní text, ovládání polohy

Překlad

návrh

nuance, termín

Zpětný překlad, zdroj

Komentář

Souhrn kontextu

historický význam

odborník, literatura

Časté chyby

  • Dokončení slabého textu. AI zapadá do mezer; Odečet a předpověď by měly být odděleny a označeny.
  • Důvěřovat překladu, aniž byste viděli zdroj. Plynulý překlad není správný překlad.
  • Přijetí vymyšleného připsání. Výrok „Je to v tom vysílání“ vyžaduje potvrzení.
  • Nekontroluje se fyzické umístění dokončení. Návrh se musí vejít do členitého prostoru.
  • Přenechání výkladu AI. Historický význam textu je věcí odborného filologa.

V souhrnu

AI v epigrafii a starověkých textech; Výrazně urychluje vylepšení obrazu, HTR/OCR návrh, návrh dokončení a překlad návrhu a otevírá uzavřené archivy pro výzkum. Ale toto je oblast, kde je riziko halucinací nejvyšší: čtení je odděleno od predikce, jsou označeny doplňky, překlady jsou kontrolovány proti zdroji a zpětnému překladu a závěrečné čtení a interpretace náleží odbornému filologovi.

Aplikační úkol

Vyberte obrázek nápisu nebo rukopisu (z kolekce s otevřeným přístupem). Pomocí šablony „Konzervativní přepis“ extrahujte pouze jasné znaky a poté získejte návrhy mezer pomocí „Návrh odůvodněného dokončení“. Vytvořte návrh překladu a zpětně jej přeložte pomocí šablony „Ověření překladu“ a označte, kam se význam posunul. Pokud je to možné, porovnejte s publikovaným čtením.

kontrolní seznam

  • [ ] Samostatně jsem označil znak přečtený a dokončení předpovědi.
  • [ ] Zkontroloval jsem, že dokončení zapadá do rozbité oblasti.
  • [ ] Překlad jsem porovnal se zdrojovým textem a zadním překladem.
  • [ ] Publikace/citace uvedené YZ jsem potvrdil ve skutečném katalogu.
  • [ ] Závěrečné čtení a výklad jsem nechal na schválení odborníkem.