Gevinster:
- Evne til at opsætte HTR- og translitterations-workflowet og forklare, hvorfor det rå udkast kræver ekspertkontrol linje for linje
- Evne til at beskytte ulæselige områder ved at bede om alternativer i stedet for at påtvinge en præcis læsning i tilfælde af vokal/bogstav tvetydighed på osmannisk tyrkisk
- Evne til at adskille den originale translitteration fra et separat lag af forenkling og holde det endelige videnskabelige ansvar hos palæografen
Den måske mest krævende del af historisk forskning er at transskribere manuskripter og gamle skriftlige dokumenter til læsbar tekst. Et brev, en notesbog, en retsoptegnelse eller et osmannisk dokument bliver først søgbart, efter at det er blevet transskriberet. Transskription er handlingen med at overføre indholdet af et dokument (oftest håndskrevet eller gammelt skrift) til en skrevet, læsbar tekst. I tilfældet med osmannisk er dette ofte ledsaget af translitteration: overførsel af teksten med arabiske bogstaver til det latinske alfabet med dets bogstav-for-bogstav-ækvivalenter.
Vi brugte OCR til trykte tekster; Håndskrift kræver en anden teknologi: HTR (Handwritten Text Recognition). HTR er en teknologi, der ligner OCR, men meget mere udfordrende, der konverterer håndskrevne dokumenter til maskintekst. I denne enhed vil vi se, hvordan man bruger HTR og AI i osmannisk og manuskripttransskription, fejlmarginerne og hvorfor verifikation er endnu mere kritisk her.
Hvorfor er håndskrift så svært?
Håndskrift er meget mere variabel end trykt tekst: hver skribent har en unik hånd, bogstaver er knyttet sammen, forkortelser og specielle tegn bruges, blækket bløder ud, papiret slides. På osmannisk tyrkisk er sværhedsgraden mangedoblet:
- Kontekstuelle bogstavformer: Det samme bogstav skrives forskelligt i begyndelsen, midten og slutningen af ordet.
- Ikke at skrive vokaler: Korte vokaler skrives ofte ikke; læseren fuldender ud fra konteksten. Dette skaber uklarheder såsom "accept eller afvisning?"
- Forskellige skrivestile: Der er forskellige håndskriftstile såsom rik'a, divani, ta'lik; Hver kræver en anden læseekspertise.
- Osmannisk ordforråd: Ord fra arabisk og persisk, der ikke findes på nutidens tyrkisk.
Derfor arbejder HTR og AI med en meget højere fejlmargin på osmannisk tyrkisk end print OCR. En ekspert palæografs øje (paleografi - videnskaben om at læse gamle skrifter) er ikke et værktøj her, men en nødvendighed.
Workflow: trin for trin
1. Forbered dokumentkvalitet. Som med OCR er høj opløsning og god kontrast afgørende. Dette er endnu mere kritisk i håndskrift.
2. Vælg HTR-model. Osmanniske, arabiske håndskrifts- eller HTR-modeller, der er specielt uddannet til en bestemt periode, er meget mere succesrige end generelle modeller. Test hvilken model der fungerer godt for en periode og skrivestil.
3. Generer rå transskription. HTR-modellen producerer en oversigt. På osmannisk tyrkisk er dette udkast en begyndelse fuld af fejl, som et erfarent øje skal tjekke grundigt.
4. Kontekstuel forbedring med AI. Du kan have AI-flag uoverensstemmelser, mulige læsealternativer og mistænkelige placeringer i det rå output. Men AI-"korrektionen" er særligt risikabel her: den kunne tyde på en konstrueret læsning.
5. Translitteration og forenkling (lagdelt). Translitterationen af teksten med arabiske bogstaver til latinske bogstaver, efterfulgt af dens forenklede læsning til nutidens tyrkisk, fremstilles som separate lag. Originalen går aldrig i stykker.
6. Ekspertbekræftelse. Den endelige transskription godkendes af en ekspert med palæografi og periodeviden ved at sammenligne den med dokumentet.
Opmærksomhed: På osmannisk tyrkisk, når man "gætter" et ord med en uskreven vokal fra konteksten, kan AI producere en helt forkert læsning og præsentere det i et sikkert sprog. En forskel i bogstaver, såsom "kabul" i stedet for "kabil" eller "alem" i stedet for "alim", ændrer fuldstændig betydningen. Enhver usikker læsning bør præsenteres med alternativer, og ingen enkelt endelig læsning bør påtvinges.
Lag og ansvar med bord
lag
Indhold
AI's rolle
Ekspertens rolle
Billede
originalt dokument
—
Kilde
HTR udkast
Rå maskinlæsning
producerer
Styr fra start til slut
translitteration
Latinsk bogstavtransponering
udkast foreslår
Retter, retter
Noter om usikkerhed
[?] og alternativer
tegn
bestemmer
Forenkling
Dagens tyrkiske
udkast foreslår
Godkendelser
videnskabelig publikation
Endelig tekst + noter
—
Kun ekspert
tre minisager
Tilfælde 1 — HTR fremskyndede det første udkast med 5x. En doktorand ville transskribere en 200-siders osmannisk notesbog. Fuld manuel transskription blev anslået til 60 hverdage. Med en HTR-model trænet til perioden kom råudkastet ud på få timer; Eleven rettede dette udkast og reducerede arbejdet til 12 arbejdsdage. Men han var nødt til at sammenligne hver side med dokumentet, linje for linje; Omkring 30 % af udkastet var forkert.
Tilfælde 2 - Et bogstav, en betydning. En forsker stolede på et ord, som AI læste som "guvernør". Under ekspertkontrol blev det forstået, at ordet faktisk var "værge" (ansvarlig for et barn/person), og da vokalen ikke var markeret, gættede AI det forkert. Den juridiske betydning af dokumentet var under fuldstændig forandring. Lektion: På osmannisk tyrkisk bevirker en enkelt bogstav/vokalforskel, at dokumentet fortolkes fra begyndelsen; ekspert er påkrævet.
Sag 3 — Fortænkt afslutning. I en linje, hvis blæk var løbet tør, og hvoraf et ord var ulæseligt, udfyldte AI hullet med et "logisk" ord. Eksperten indså, at det hul faktisk var et stednavn, og at AI'en havde gjort det op. Plads tilbage som [ulæselig]. Lektion: ulæselig plads er ikke udfyldt, den er markeret.
Fire kopierbare skabeloner
1) Translitteration, der bevarer tvetydighed:
Nedenfor er HTR rå output/translitteration af et osmannisk dokument. Din opgave er at gennemgå teksten og markere mulige læsefejl. Regler: (1) Tilbyd 2-3 mulige læsealternativer for hvert ord, du ikke er sikker på, påtving ikke et. (2) Efterlad [ulæselig] i de ulæselige områder, udfyld dem ikke. (3) TILFØJELSE af ord, der ikke findes i teksten. (4) Vis alternativer i ord med tvetydige vokaler. Tekst: [her]
2) Lagdelt læsning (original + forenkling):
Generer TO kolonner til følgende verificerede osmanniske translitteration: (1) Original translitteration (touch), (2) Forenklet læsning til nutidens tyrkisk. TILFØJELSE af betydning, tilføjelse af fortolkning i forenkling; bare opdatere sproget. Marker steder med tvetydig betydning [utydelig]. Translitteration: [her]
3) Term- og personudtrækning:
De personnavne, stednavne, titler og periodiske termer nævnt i nedenstående transskription fremgår af separate lister. Tag kun dem, der KLART er nævnt i teksten; Tilføj ikke ved at gætte. Marker med [?], hvis du ikke er sikker på udtalen. Tekst: [her]
4) Mistænkelig læsningskontrol:
En erfaren paleograficontroller i rollen. I nedenstående transskription skal du markere de ord, der er inkonsistente i betydning, ikke passer til punktum eller ikke passer ind i konteksten, og skriv hvorfor de er mistænkelige. Indførelse af endelig korrektion; Generer en liste over mistanker, som den menneskelige ekspert vil sammenligne med dokumentet. Tekst: [her]
Svag prompt / Stærk prompt
Svag:
Læs denne osmanniske tekst og giv mig dens oversættelse.
Dette skubber AI til at producere en enkelt, definitiv læsning, skjuler uklarheder og passer ind i huller. På osmannisk tyrkisk er dette næsten en garanteret fejltagelse.
Stærk:
Se den osmanniske translitteration nedenfor. En endegyldig læsning: PÅLÆGNING. Angiv mulige alternativer for hvert tvetydigt ord, udelad [ulæselige] dele, tilføj ikke noget, der ikke er i teksten. Giv den forenklede læsning til dagens tyrkiske i en separat spalte, men behold originalen. Marker noget, du ikke er sikker på, med [?], så eksperten kan sammenligne det med dokumentet. Tekst: [her]
Forskellen: strengt læseforbud, anmodning om alternativer, bevarelse af hvidt mellemrum og lagdelt output muliggør ekspertverifikation.
Almindelige fejl
- Forkert HTR-udkastet som korrekt. På osmannisk tyrkisk kan meget af det rå udkast være unøjagtigt; Linje for linje kontrol er et must.
- Den eneste endelige læsning er at påtvinge. Hvis alternativer er skjult i ord, hvis vokaler ikke er skrevet, vil den forkerte betydning blive registreret.
- Udfylder det ulæselige område. Det skal være beskyttet af blanktegn [ulæselig], ikke opdigtet.
- Blanding af originalen med forenkling. Forenkling bør være et separat lag; Den originale translitteration bør ikke forvrænges.
- Deaktivering af eksperten. Uden viden om palæografi og periode er AI's læsning et gæt uden videnskabelig værdi.
Sammenfattende
Osmannisk transskription og manuskripttransskription kan fremskyndes kraftigt på råudkaststadiet med HTR og AI; Du får et første output, der reducerer arbejdsdage til timer. Men det er netop på dette område, at et enkelt bogstav, en enkelt vokalforskel ændrer betydningen; AI har en tendens til at skjule usikkerhed og udfylde hullerne. Den korrekte metode er lagdelt: rå kontur, alternative noter af tvetydighed, et separat lag af forenkling og frem for alt, linje for linje verifikation af dokumentet af en ekspert, der er fortrolig med paleografi. AI fremskynder indledende læsning; Det videnskabelige ansvar ligger hos eksperten.
Ansøgningsopgave
Få en translitteration af et osmannisk eller manuskriptdokument (din egen produktion eller en offentliggjort kopi). Bed AI om en alternativ læsning med skabelonen "ambiguity-bevarende translitteration". Generer derefter forenklingslaget separat med "lagdelt læsning". Sammenlign hvert vagt markeret ord med en ekspertkilde eller ordbog; Bemærk, hvor mange fejl AI'en ville producere, hvis den pålagde en enkelt læsning.
tjekliste
- [ ] Jeg brugte en HTR/model, der passer til perioden og skrivestilen.
- [ ] Jeg spurgte AI om alternativer til den nøjagtige læsning.
- [ ] Jeg beskyttede de ulæselige dele med [unreadable].
- [ ] Jeg holdt den originale translitteration adskilt fra forenklingen.
- [ ] Jeg fik den endelige tekst verificeret af en ekspert/dokumentar, der kan paleografi.