Unité 3 / 12

Transcription : turc ottoman et manuscrits

Gains :

  • Capacité à configurer le flux de travail HTR et de translittération et à expliquer pourquoi le brouillon brut nécessite une vérification par un expert ligne par ligne
  • Possibilité de protéger les zones illisibles en demandant des alternatives au lieu d'imposer une lecture précise en cas d'ambiguïté voyelle/lettre en turc ottoman
  • Capacité à séparer la translittération originale d'une couche distincte de simplification, en gardant la responsabilité scientifique finale avec le paléographe

La partie la plus exigeante de la recherche historique consiste peut-être à transcrire des manuscrits et des documents écrits anciens en texte lisible. Une lettre, un cahier, un dossier judiciaire ou un document ottoman ne devient consultable qu'après avoir été transcrit. La transcription est l'acte de transférer le contenu d'un document (le plus souvent manuscrit ou en écriture ancienne) en un texte écrit et lisible. Dans le cas de l'ottoman, cela s'accompagne souvent d'une translittération : transférer le texte en lettres arabes vers l'alphabet latin avec ses équivalents lettre par lettre.

Nous avons utilisé l'OCR pour les textes imprimés ; L’écriture manuscrite nécessite une technologie différente : la HTR (Handwriting Text Recognition). HTR est une technologie similaire à l'OCR mais beaucoup plus complexe qui convertit les documents manuscrits en texte machine. Dans cette unité, nous verrons comment utiliser HTR et AI dans la transcription ottomane et manuscrite, les marges d'erreur et pourquoi la vérification est ici encore plus critique.

Pourquoi l’écriture manuscrite est-elle si difficile ?

L'écriture manuscrite est bien plus variable que le texte imprimé : chaque écrivain a une main unique, les lettres s'enchaînent, des abréviations et des signes spéciaux sont utilisés, l'encre coule, le papier s'use. En turc ottoman, la difficulté est multipliée :

  • Formes de lettres contextuelles : La même lettre s’écrit différemment au début, au milieu et à la fin du mot.
  • Ne pas écrire de voyelles : les voyelles courtes ne sont souvent pas écrites ; le lecteur complète à partir du contexte. Cela crée des ambiguïtés telles que « acceptation ou rejet ? »
  • Différents styles d'écriture : Il existe différents styles d'écriture manuscrite tels que rik'a, divani, ta'lik ; Chacun nécessite une expertise de lecture différente.
  • Vocabulaire ottoman : mots de l'arabe et du persan qui n'existent pas dans le turc d'aujourd'hui.

Par conséquent, HTR et AI fonctionnent avec une marge d’erreur beaucoup plus élevée en turc ottoman que l’OCR imprimé. L’œil d’un paléographe expert (paléographie – science de la lecture des écrits anciens) n’est pas ici un outil, mais une nécessité.

Flux de travail : étape par étape

1. Préparez la qualité du document. Comme pour l’OCR, une haute résolution et un bon contraste sont essentiels. Ceci est encore plus critique en écriture manuscrite.

2. Sélectionnez le modèle HTR. Les modèles ottomans, à écriture arabe ou HTR spécifiquement formés pour une période précise ont beaucoup plus de succès que les modèles généraux. Testez quel modèle fonctionne bien pour une période et un style d’écriture.

3. Générez une transcription brute. Le modèle HTR produit un aperçu. En turc ottoman, cette ébauche est un début semé d’erreurs qu’un œil averti doit vérifier minutieusement.

4. Amélioration contextuelle avec l'IA. Vous pouvez avoir des incohérences de signalement de l'IA, des alternatives de lecture possibles et des emplacements suspects dans la sortie brute. Mais la « correction » de l’IA est ici particulièrement risquée : elle pourrait suggérer une lecture artificielle.

5. Translittération et simplification (en couches). La translittération du texte en lettres arabes en lettres latines, suivie de sa lecture simplifiée en turc d'aujourd'hui, est réalisée en couches distinctes. L'original ne se casse jamais.

6. Vérification par des experts. La transcription finale est approuvée par un expert possédant des connaissances en paléographie et en époque en la comparant avec le document.

Attention : en turc ottoman, lorsqu'elle « devine » un mot avec une voyelle non écrite à partir du contexte, l'IA peut produire une lecture complètement erronée et la présenter dans une langue sûre. Une différence de lettres, comme « kaboul » au lieu de « kabil » ou « alem » au lieu de « alim », en change complètement le sens. Toute lecture incertaine doit être présentée avec des alternatives, et aucune lecture définitive ne doit être imposée.

Couches et responsabilité avec une table

couche

Contenu

Rôle de l'IA

Rôle de l'expert

Images

document original

Source

Projet HTR

Lecture automatique brute

produit

Contrôler du début à la fin

translittération

Transposition de lettres latines

le brouillon suggère

Corrige, corrige

Notes d'incertitude

[?] et alternatives

signes

décide

Simplification

Le turc d'aujourd'hui

le brouillon suggère

Approbations

publication scientifique

Texte final + notes

Expert uniquement

trois mini-cases

Cas 1 — HTR a accéléré la première ébauche de 5 fois. Un doctorant transcrirait un cahier ottoman de 200 pages. La transcription manuelle complète a été estimée à 60 jours ouvrables. Avec un modèle HTR formé pour la période, le projet brut est sorti en quelques heures ; L'étudiant a corrigé cette ébauche et réduit le travail à 12 jours ouvrables. Mais il lui fallait comparer chaque page au document, ligne par ligne ; Environ 30 % du projet était incorrect.

Cas 2 — Une lettre, une signification. Un chercheur s'est appuyé sur un mot que l'IA a lu comme « gouverneur ». Sous contrôle d'experts, il a été compris que le mot était en fait « tuteur » (responsable d'un enfant/personne), et comme la voyelle n'était pas marquée, l'IA l'a mal deviné. La signification juridique du document changeait complètement. Leçon : En turc ottoman, une seule différence lettre/voyelle entraîne l'interprétation du document depuis le début ; un expert est requis.

Cas 3 — Achèvement artificiel. Dans une ligne dont l’encre était épuisée et dont un mot était illisible, l’IA a comblé le vide avec un mot « logique ». L’expert s’est rendu compte que cette lacune était en réalité un nom de lieu et que l’IA l’avait comblée. Espace laissé comme [illisible]. Leçon : l'espace illisible n'est pas rempli, il est marqué.

Quatre modèles copiables

1) Une translittération qui préserve l’ambiguïté :

Vous trouverez ci-dessous la sortie brute/translittération HTR d'un document ottoman. Votre tâche consiste à réviser le texte et à signaler d’éventuelles erreurs de lecture. Règles : (1) Proposez 2 à 3 alternatives de lecture possibles pour chaque mot dont vous n'êtes pas sûr, n'en imposez pas. (2) Laisser [illisible] dans les zones illisibles, ne pas les remplir. (3) AJOUTER des mots qui n'existent pas dans le texte. (4) Montrer des alternatives dans les mots avec des voyelles ambiguës. Texte : [ici]

2) Lecture en couches (original + simplification) :

Générez DEUX colonnes pour la translittération ottomane vérifiée suivante : (1) Translittération originale (tactile), (2) Lecture simplifiée en turc d'aujourd'hui. AJOUTER du sens, ajouter de l'interprétation dans la simplification ; mettez simplement à jour la langue. Marquer les lieux ayant une signification ambiguë [indistinct]. Translittération : [ici]

3) Extraction de termes et de personnes :

Les noms de personnes, noms de lieux, titres et termes périodiques mentionnés dans la transcription ci-dessous apparaissent dans des listes séparées. Ne prenez que ceux CLAIREMENT mentionnés dans le texte ; N'ajoutez pas en devinant. Marquez avec [?] si vous n'êtes pas sûr de la prononciation. Texte : [ici]

4) Contrôle de lecture suspecte :

Un contrôleur de paléographie expérimenté dans le rôle. Dans la transcription ci-dessous, marquez les mots dont le sens est incohérent, ne correspondent pas au point ou au contexte, et écrivez pourquoi ils sont suspects. Imposer une correction définitive ; Générez une liste de soupçons que l'expert humain comparera avec le document. Texte : [ici]

Invite faible/Invite forte

Faible :

Lisez ce texte ottoman et donnez-moi sa traduction.

Cela pousse l’IA à produire une lecture unique et définitive, cachant les ambiguïtés et comblant les lacunes. En turc ottoman, c’est presque une erreur garantie.

Fort:

Découvrez la translittération ottomane ci-dessous. Une lecture définitive : IMPOSITION. Prévoyez des alternatives possibles pour chaque mot ambigu, omettez les parties [illisibles], n'ajoutez rien qui ne soit pas dans le texte. Donnez la lecture simplifiée du turc d'aujourd'hui dans une colonne séparée, mais conservez l'original. Marquez tout ce dont vous n'êtes pas sûr avec [?] afin que l'expert puisse le comparer avec le document. Texte : [ici]

La différence : une interdiction stricte de lecture, la demande d'alternatives, la préservation des espaces et la sortie en couches permettent une vérification par des experts.

Erreurs courantes

  • Confondre le projet HTR avec correct. En turc ottoman, une grande partie du texte brut peut être inexacte ; Le contrôle ligne par ligne est indispensable.
  • La seule lecture définitive est d'imposer. Si des alternatives sont cachées dans des mots dont les voyelles ne sont pas écrites, un sens erroné sera enregistré.
  • Remplir la zone illisible. Il doit être protégé par des espaces [illisibles], et non maquillés.
  • Mélanger l'original avec simplification. La simplification devrait constituer une couche distincte ; La translittération originale ne doit pas être déformée.
  • Désactivation de l'expert. Sans connaissance de la paléographie et de la période, la lecture d'IA est une supposition sans valeur scientifique.

En résumé

La transcription ottomane et manuscrite peut être considérablement accélérée au stade de l’ébauche brute avec HTR et AI ; Vous obtenez un premier résultat qui réduit les journées de travail en heures. Mais c’est précisément dans ce domaine qu’une seule lettre, une seule différence de voyelle change le sens ; L’IA a tendance à cacher l’incertitude et à combler les lacunes. La méthode correcte est superposée : un contour brut, des notes alternatives d'ambiguïté, une couche distincte de simplification et, surtout, une vérification ligne par ligne du document par un expert familier en paléographie. L’IA accélère la lecture initiale ; La responsabilité scientifique appartient à l'expert.

Tâche de candidature

Obtenez une translittération d'un document ottoman ou manuscrit (votre propre production ou une copie publiée). Demandez à l’IA une lecture alternative avec le modèle « translittération préservant l’ambiguïté ». Générez ensuite la couche de simplification séparément avec une "lecture en couches". Comparez chaque mot vaguement marqué avec une source experte ou un dictionnaire ; Notez combien d’erreurs l’IA produirait si elle imposait une seule lecture.

liste de contrôle

  • [ ] J'ai utilisé un HTR/modèle adapté à la période et au style d'écriture.
  • [ ] J'ai demandé à l'IA des alternatives à la lecture exacte.
  • [ ] J'ai protégé les parties illisibles avec [illisible].
  • [ ] J'ai gardé la translittération originale séparée de la simplification.
  • [ ] J'ai fait vérifier le texte final par un expert/documentaire qui connaît la paléographie.