Ganancias:
- Capacidad para configurar el flujo de trabajo de transliteración y HTR y explicar por qué el borrador sin procesar requiere una revisión experta línea por línea.
- Capacidad de proteger áreas ilegibles solicitando alternativas en lugar de imponer una lectura precisa en caso de ambigüedad entre vocales y letras en turco otomano
- Capacidad para separar la transliteración original de una capa separada de simplificación, manteniendo la responsabilidad científica final con el paleógrafo.
Quizás la parte más exigente de la investigación histórica sea la transcripción de manuscritos y documentos escritos antiguos en textos legibles. Una carta, un cuaderno, un expediente judicial o un documento otomano sólo se pueden buscar después de haber sido transcritos. La transcripción es el acto de transferir el contenido de un documento (generalmente escrito a mano o en escritura antigua) a un texto escrito y legible. En el caso del otomano, esto suele ir acompañado de transliteración: transferir el texto en letras árabes al alfabeto latino con sus equivalentes letra por letra.
Usamos OCR para textos impresos; La escritura a mano requiere una tecnología diferente: HTR (Reconocimiento de texto escrito a mano). HTR es una tecnología similar al OCR pero mucho más desafiante que convierte documentos escritos a mano en texto automático. En esta unidad veremos cómo usar HTR e IA en la transcripción otomana y manuscrita, los márgenes de error y por qué la verificación es aún más crítica aquí.
¿Por qué es tan difícil escribir a mano?
La escritura a mano es mucho más variable que el texto impreso: cada escritor tiene una mano única, las letras están entrelazadas, se utilizan abreviaturas y signos especiales, la tinta sangra, el papel se desgasta. En turco otomano la dificultad se multiplica:
- Formas de letras contextuales: la misma letra se escribe de manera diferente al principio, en el medio y al final de la palabra.
- No escribir vocales: las vocales cortas a menudo no se escriben; el lector completa a partir del contexto. Esto crea ambigüedades como "¿aceptación o rechazo?"
- Diferentes estilos de escritura: Existen diferentes estilos de escritura a mano como rik'a, divani, ta'lik; Cada uno requiere una experiencia de lectura diferente.
- Vocabulario otomano: palabras del árabe y persa que no existen en el turco actual.
Por lo tanto, HTR y AI funcionan con un margen de error mucho mayor en turco otomano que el OCR impreso. El ojo de un paleógrafo experto (paleografía, la ciencia de leer escritos antiguos) no es aquí una herramienta, sino una necesidad.
Flujo de trabajo: paso a paso
1. Preparar la calidad del documento. Al igual que ocurre con el OCR, la alta resolución y el buen contraste son fundamentales. Esto es aún más crítico en la escritura a mano.
2. Seleccione el modelo HTR. Los modelos otomanos, de escritura árabe o HTR entrenados específicamente para un período específico tienen mucho más éxito que los modelos generales. Pruebe qué modelo funciona bien para un período y estilo de escritura.
3. Genere transcripción sin formato. El modelo HTR produce un esquema. En turco otomano, este borrador es un comienzo lleno de errores que un ojo experimentado debe comprobar minuciosamente.
4. Mejora contextual con IA. Puede tener inconsistencias en las banderas de IA, posibles alternativas de lectura y ubicaciones sospechosas en la salida sin procesar. Pero la “corrección” de la IA es particularmente arriesgada en este caso: podría sugerir una lectura artificial.
5. Transliteración y simplificación (en capas). La transliteración del texto en letras árabes a letras latinas, seguida de su lectura simplificada al turco actual, se realiza en capas separadas. El original nunca se rompe.
6. Verificación pericial. La transcripción final es aprobada por un experto con conocimientos de paleografía y época comparándola con el documento.
Atención: en turco otomano, al "adivinar" una palabra con una vocal no escrita a partir del contexto, la IA puede producir una lectura completamente incorrecta y presentarla en un lenguaje seguro. Una diferencia en las letras, como "kabul" en lugar de "kabil" o "alem" en lugar de "alim", cambia completamente el significado. A cada lectura incierta se le deben presentar alternativas y no se debe imponer ninguna lectura definitiva.
Capas y responsabilidad con una mesa.
capa
Contenido
Papel de la IA
Papel del experto
Imagen
documento original
—
Fuente
Borrador HTR
Lectura automática en bruto
produce
Control de principio a fin
transliteración
Transposición de letras latinas
borrador sugiere
Corrige, corrige
Notas de incertidumbre
[?] y alternativas
señales
decide
Simplificación
El turco de hoy
borrador sugiere
Aprobaciones
publicación científica
Texto final + notas
—
Sólo expertos
tres mini casos
Caso 1: HTR aceleró el primer borrador 5 veces. Un estudiante de doctorado transcribiría un cuaderno otomano de 200 páginas. La transcripción manual completa se estimó en 60 días hábiles. Con un modelo HTR entrenado para el período, el borrador salió en unas pocas horas; El estudiante corrigió este borrador y redujo el trabajo a 12 días hábiles. Pero tuvo que comparar cada página con el documento, línea por línea; Alrededor del 30% del borrador era incorrecto.
Caso 2: Una letra, un significado. Un investigador se basó en una palabra que la IA leyó como "gobernador". Bajo control experto, se entendió que la palabra era en realidad "tutor" (responsable de un niño/persona), y como la vocal no estaba marcada, la IA adivinó mal. El significado jurídico del documento estaba cambiando por completo. Lección: En turco otomano, una sola letra/diferencia de vocal hace que el documento se interprete desde el principio; Se requiere experto.
Caso 3: finalización artificial. En una línea cuya tinta se había acabado y una de las palabras era ilegible, la IA llenó el vacío con una palabra “lógica”. El experto se dio cuenta de que ese hueco era en realidad el nombre de un lugar y que la IA lo había llenado. Espacio dejado como [ilegible]. Lección: el espacio ilegible no se llena, se marca.
Cuatro plantillas copiables
1) Transliteración que preserva la ambigüedad:
A continuación se muestra la salida sin procesar/transliteración de HTR de un documento otomano. Su tarea es revisar el texto y señalar posibles errores de lectura. Reglas: (1) Ofrezca 2-3 posibles alternativas de lectura para cada palabra de la que no esté seguro, no imponga ninguna. (2) Dejar [ilegible] en las áreas ilegibles, no llenarlas. (3) AÑADIR palabras que no existen en el texto. (4) Mostrar alternativas en palabras con vocales ambiguas. Texto: [aquí]
2) Lectura en capas (original + simplificación):
Genere DOS columnas para la siguiente transliteración otomana verificada: (1) Transliteración original (toque), (2) Lectura simplificada al turco actual. AGREGAR significado, agregar interpretación en simplificación; simplemente actualice el idioma. Marque lugares con significado ambiguo [ininteligible]. Transliteración: [aquí]
3) Extracción de término y persona:
Los nombres personales, topónimos, títulos y términos periódicos mencionados en la transcripción siguiente aparecen en listas separadas. Tome sólo aquellos CLARAMENTE mencionados en el texto; No sumes adivinando. Marque con [?] si no está seguro de la pronunciación. Texto: [aquí]
4) Control de lectura sospechosa:
Un controlador de paleografía experimentado en el puesto. En la transcripción a continuación, marque las palabras que tienen un significado inconsistente, que no se ajustan al período o no se ajustan al contexto, y escriba por qué son sospechosas. Imponer corrección definitiva; Generar una lista de sospechas que el experto humano comparará con el documento. Texto: [aquí]
Aviso débil / Aviso fuerte
Débil:
Lee este texto otomano y dame su traducción.
Esto empuja a la IA a producir una lectura única y definitiva, ocultando ambigüedades y llenando huecos. En turco otomano, esto es casi un error garantizado.
Fuerte:
Consulte la transliteración otomana a continuación. Una lectura definitiva: IMPOSICIÓN. Proporcione posibles alternativas para cada palabra ambigua, omita partes [ilegibles], no agregue nada que no esté en el texto. Dé la lectura simplificada al turco de hoy en una columna separada, pero conserve el original. Marque todo aquello de lo que no esté seguro con [?] para que el experto pueda compararlo con el documento. Texto: [aquí]
La diferencia: la estricta prohibición de lectura, la solicitud de alternativas, la preservación de los espacios en blanco y la salida en capas permiten la verificación experta.
Errores comunes
- Confundir el borrador del HTR con correcto. En turco otomano, gran parte del borrador puede ser inexacto; El control línea por línea es imprescindible.
- La única lectura definitiva es imponer. Si se esconden alternativas en palabras cuyas vocales no están escritas, se registrará el significado incorrecto.
- Rellenando el área ilegible. Debe estar protegido por espacios en blanco [ilegibles], no inventados.
- Mezclando el original con la simplificación. La simplificación debería ser una capa separada; La transliteración original no debe distorsionarse.
- Deshabilitar al experto. Sin conocimiento de paleografía y período, la lectura de la IA es una suposición sin valor científico.
En resumen
La transcripción otomana y de manuscritos se puede acelerar enormemente en la etapa de borrador sin procesar con HTR e IA; Obtiene un primer resultado que reduce los días de trabajo a horas. Pero es precisamente en este ámbito donde una sola letra, una sola diferencia vocálica cambia el significado; La IA tiende a ocultar la incertidumbre y llenar los vacíos. El método correcto es el de capas: esquema crudo, notas alternativas de ambigüedad, una capa separada de simplificación y, sobre todo, verificación línea por línea del documento por parte de un experto familiarizado con la paleografía. La IA acelera la lectura inicial; La responsabilidad científica pertenece al experto.
Tarea de aplicación
Obtenga una transliteración de un documento otomano o manuscrito (de su propia producción o de una copia publicada). Pídale a la IA una lectura alternativa con la plantilla de “transliteración que preserva la ambigüedad”. Luego genere la capa de simplificación por separado con "lectura en capas". Compare cada palabra vagamente marcada con una fuente o diccionario experto; Tenga en cuenta cuántos errores produciría la IA si impusiera una sola lectura.
lista de verificación
- [ ] Utilicé un modelo/HTR apropiado para la época y el estilo de escritura.
- [ ] Le pedí a la IA alternativas a la lectura exacta.
- [] Protegí las partes ilegibles con [ilegible].
- [] Mantuve la transliteración original separada de la simplificación.
- [ ] Hice verificar el texto final por un experto/documentalista que conoce la paleografía.