Gains :
- Capacité à mettre en place le workflow de numérisation et OCR (numérisation, prétraitement, reconnaissance, correction, vérification) étape par étape
- Capacité à utiliser l'IA pour corriger les erreurs OCR avec le contexte tout en conservant la ligne de correction et de réécriture et en marquant l'ambiguïté avec [?]
- Comprendre pourquoi les chiffres, les dates et les noms propres doivent être vérifiés visuellement et le rôle du contrôle qualité.
Les millions de pages présentes dans les étagères physiques d’une archive ou d’une bibliothèque ne sont véritablement ouvertes au chercheur que lorsqu’elles sont numérisées et consultables. La numérisation consiste à convertir un document physique en une image numérique en le numérisant ou en le photographiant. Mais la photographie d'une page n'est pas encore du « texte » ; Pour l'ordinateur, c'est toujours une image, vous ne pouvez pas y chercher. C'est là que l'OCR entre en jeu.
OCR (Optical Character Recognition) est une technologie qui reconnaît les lettres imprimées dans une image de document et les convertit en texte lisible par machine et consultable. Dans cette unité, vous apprendrez comment numériser des documents imprimés historiques avec OCR, comment l'IA aide à corriger les erreurs OCR dans ce processus et où l'œil humain est essentiel. (Les textes manuscrits nécessitent une technologie différente ; nous en parlerons dans la prochaine unité.)
Flux de travail de numérisation : étape par étape
1. Préparation et sélection. Numérisez le document avec la meilleure qualité possible. Une règle générale pour la recherche historique est une résolution d’au moins 300 à 400 DPI (points par pouce). La faible résolution fait monter en flèche le taux d’erreur lors de l’étape OCR suivante.
2. Prétraitement de l'image. L'amélioration de l'image avant l'OCR augmente considérablement le succès : redressement de la page numérisée, suppression des imperfections, augmentation du contraste, conversion en noir et blanc. Les outils modernes basés sur l’IA peuvent automatiser cette étape.
3. Application OCR. Vous envoyez l'image au moteur OCR ; Le moteur reconnaît les lettres et produit du texte. La sortie se compose généralement de deux calques : l'image visible du document et un "calque de texte caché consultable" en dessous.
4. Correction (post-correction). La sortie brute de l’OCR n’est jamais parfaite. Les caractères ne sont pas lus correctement en raison d'anciennes polices, de papier jauni, de taches d'encre et d'erreurs de numérisation. C’est là que l’IA est une aide puissante : elle suggère et corrige les erreurs OCR en utilisant le contexte.
5. Vérification et contrôle qualité. Le texte corrigé est vérifié par l'homme sur une base d'échantillon ou complètement. Les zones particulièrement critiques telles que les noms, les dates et les chiffres doivent être vérifiées visuellement.
Pourquoi l'OCR fait des erreurs, comment l'IA aide
Problèmes typiques qui remettent en question l'OCR dans les documents historiques : polices anciennes et sophistiquées, formes de lettres obsolètes telles que le "s" long (ſ), mise en page sur deux colonnes, notes de bas de page, insertions manuscrites, sceaux et encre délavée. Parce qu'un moteur OCR « voit » les lettres une par une, il confond souvent le binaire « rn » avec « m », la lettre « l » avec le chiffre « 1 » et la lettre « O » avec « 0 ».
Les modèles de langage d’IA offrent ici un pouvoir différent : ils comprennent le contexte. Si un moteur OCR écrivait « 1stanbu1 », l'IA pourrait déduire du contexte qu'il devrait s'agir de « Istanbul ». Mais il y a ici un grand danger : lors de la « correction », l'IA peut également modifier le texte. Il peut ajouter « J'ai corrigé » un mot inexistant ou remplir un endroit peu clair avec sa propre supposition. Cela perturbe la fidélité de la transcription.
Attention : La règle d'or en matière de correction OCR est la suivante : l'IA doit uniquement corriger les erreurs de reconnaissance évidentes, et non interpréter ou compléter le contenu du texte. "1stanbu1 → Istanbul" est légitime ; Il ne s’agit pas de remplir un mot illisible de suppositions. Les endroits incertains doivent être marqués d'un [?] et ne doivent pas être inventés.
Types d'erreurs OCR et approche avec un tableau
Type d'erreur
exemple
L’IA peut-elle y remédier ?
contrôle humain
mélange de personnages
rn↔m, l↔1, O↔0
Oui, c'est sûr
échantillon
ancienne forme de lettre
long ſ → s
Oui, c'est sûr
échantillon
Mot effacé/illisible
"ka___n"
Non, je devrais mettre [?]
obligatoire
nom propre/nom de lieu
"Constantiniye"
prudent
obligatoire
Numéro/date
"1867" contre "1857"
risqué
obligatoire
Mise en page (colonne/note de bas de page)
flux mixte
partiellement
obligatoire
Pour résumer l’image en une phrase : l’IA nettoie de manière fiable les erreurs de caractères ordinaires ; Mais les yeux humains sont nécessaires pour détecter les noms spéciaux, les chiffres, les dates et les lieux illisibles.
trois mini-cases
Cas 1 — Les archives des journaux sont devenues consultables. Une bibliothèque universitaire a numérisé 12 000 pages de journaux locaux des années 1930. La précision brute de l'OCR était estimée à 82 % (18 caractères sur 100 étaient incorrects). La correction basée sur l'IA a augmenté la précision à 96 % avec un dictionnaire et un contexte adaptés à la langue du journal. Pour les erreurs restantes, une vérification par échantillon a été effectuée plutôt que par le texte intégral ; La collection est devenue consultable en 3 semaines.
Cas 2 – L’IA a « corrigé » et déformé l’histoire. Un archiviste a demandé à AI de corriger la date "1863" sur l'impression OCR. L’IA a « corrigé » la date à « 1868 » en examinant un autre événement dans le contexte – même si le document disait clairement 1863. Si l’archiviste n’avait pas regardé l’image originale, le catalogue serait entré avec une date erronée. Leçon : les chiffres et les dates ne sont jamais laissés à l'IA, ils sont vérifiés avec l'image.
Cas 3 — Page à deux colonnes confuse. Les pages à deux colonnes d'un annuaire du XIXe siècle étaient mélangées en un seul flux par OCR et les phrases étaient entrelacées. Le résultat brut était illisible. Le texte s'est amélioré lorsque j'ai d'abord divisé la mise en page en régions (segmentation) et traité chaque colonne séparément. Leçon : dans une mise en page complexe, la structure d'abord, le texte ensuite.
Quatre modèles copiables
1) Correction OCR sécurisée :
Vous trouverez ci-dessous la sortie OCR brute d’un document historique. Votre tâche consiste à corriger UNIQUEMENT les erreurs évidentes de reconnaissance optique (par exemple rn → m, 1 → l, 0 → O, long ſ → s). Règles : (1) Interpréter le sens du texte. (2) Corrigez les mots illisibles/ambigus, laissez-les tels quels et marquez avec [?]. (3) PAS d’ajout, de suppression ou de complément de phrases. (4) CHANGER les numéros et les dates ; marquez [numéro ?] en cas de doute. OCR brut : [ici]
2) Rapport de qualité OCR :
Examinez le résultat OCR ci-dessous et produisez un rapport de qualité : (1) Répertoriez les mots avec d'éventuelles erreurs de reconnaissance, (2) Marquez les zones qui semblent illisibles/peu claires, (3) Répertoriez les noms, dates et chiffres spécifiques qui nécessitent une vérification humaine. NE PAS corriger ; générer une liste de contrôle uniquement. Texte : [ici]
3) Aide à l'analyse des colonnes/structures :
Étant donné que le texte OCR ci-dessous provient d’une page à deux colonnes, le flux peut être confus. Réorganisez le texte en paragraphes logiques MAIS ne modifiez, n’ajoutez ou ne supprimez aucun mot. Corrigez simplement la commande. Marquez la commande dont vous n'êtes pas sûr avec [commande ?]. Texte : [ici]
4) Normalisation vers le langage standard (facultatif, couche séparée) :
Produire une version de lecture simplifiée dans l'orthographe actuelle, dans une colonne séparée, AU-DESSUS du texte historique corrigé ci-dessous. NE JAMAIS modifier le texte ORIGINAL ; Laissez la simplification être une couche distincte. Mettez simplement à jour l'orthographe/la prononciation sans ajouter de sens.Original : [ici]
Invite faible/Invite forte
Faible :
Corrigez et embellissez ce texte OCR.
« Beautify » permet à l'IA de réécrire le texte, de combler les omissions et d'interpréter le contenu ; brise la loyauté.
Fort :
Corrigez UNIQUEMENT les erreurs de reconnaissance optique dans cette sortie OCR brute. Ne pas interpréter le sens, ajouter/supprimer des mots, laisser des parties illisibles avec [?], modifier les chiffres et les dates. Montrez chaque correction que vous apportez dans une liste séparée au format "original → correction" afin que je puisse la vérifier. Texte : [ici]
La différence : une obligation limitée, une interdiction de fabrication, une ambiguïté de marquage et une liste traçable de corrections rendent le résultat vérifiable.
Erreurs courantes
- Numérisation à basse résolution. La plupart des erreurs OCR sont causées par de mauvaises images ; Une numérisation de qualité est l’investissement le moins cher.
- Appeler l’IA « rendre beau ». Cela produit de la fluidité plutôt que de la fidélité ; Le document est réécrit.
- Laisser les chiffres et les dates à l’IA. Ceux-ci sont silencieusement corrompus lorsqu'ils sont « corrigés » à partir du contexte ; doit être vérifié par image.
- Remplir la zone illisible avec une supposition. Il devrait être protégé par l'incertitude [?], et non inventé.
- Ne pas contrôler du tout au lieu d'échantillonner. Même une précision de 96 % signifie des milliers d’erreurs sur 12 000 pages ; les zones critiques sont analysées.
En résumé
L'OCR ouvre les archives aux chercheurs en convertissant les documents historiques imprimés en texte consultable. L'IA est une aide puissante pour corriger les erreurs de caractères dans la sortie OCR brute avec le contexte ; Mais il faut tracer la frontière entre édition et réécriture. Une numérisation de haute qualité, des instructions de correction sûres, la préservation de l'ambiguïté avec [?] et la vérification visuelle des noms/dates/numéros rendent la numérisation à la fois rapide et fiable. L'IA nettoie le texte ; Vous êtes le gardien de la fidélité.
Tâche de candidature
Scannez un document historique imprimé (ancien journal, lettre officielle, page de livre) ou prenez une impression OCR. Faites corriger le texte avec le modèle « Correction OCR sécurisée » et demandez des corrections via la liste « original → correction ». Ensuite, supprimez les zones qui nécessitent un contrôle humain avec le « Rapport qualité OCR ». Comparez chaque date et nom propre de la liste à l’image réelle ; Notez combien ont été « corrigés » de manière incorrecte.
liste de contrôle
- [ ] J'ai numérisé le document avec au moins 300 DPI et un bon contraste.
- [ ] J'ai seulement demandé à l'IA une correction d'erreur optique, pas une réécriture.
- [ ] J'ai protégé les parties illisibles avec [?].
- [ ] J'ai vérifié tous les nombres, dates et noms propres avec l'image.
- [ ] J'ai effectué un échantillon ou une vérification complète dans les zones critiques.