Ganancias:
- Capacidad para corregir documentos escaneados convirtiéndolos a texto con OCR y HTR y comparando el resultado con la imagen real.
- Capacidad para preservar la originalidad e integridad del documento de archivo y evitar que la IA cambie el contenido y realice una restauración fabricada.
- Capacidad para planificar la preservación digital a largo plazo con información de procedencia y formatos duraderos.
Un archivero tiene la tarea de transportar al futuro volúmenes de periódicos de cincuenta años de antigüedad, cartas escritas a mano o fotografías antiguas. Estos documentos se desgastan con el tiempo; Para preservarlos y hacerlos accesibles, se realiza la digitalización: el acto de escanear un documento físico y convertirlo en una copia digital. Pero la detección por sí sola no es suficiente; El objeto digital debe ser localizable, legible y mantenible a largo plazo. En esta unidad, aprenderá a utilizar la inteligencia artificial en el flujo de trabajo de digitalización, transcripción y preservación digital; pero aprenderá por qué será usted responsable de la originalidad y la precisión.
Algunos conceptos. OCR (reconocimiento óptico de caracteres) es una tecnología que convierte el texto de la imagen de un documento en texto editable por máquina. HTR (Reconocimiento de texto escrito a mano) hace el mismo trabajo con documentos escritos a mano y es mucho más difícil. La preservación digital es un esfuerzo planificado para garantizar que los objetos digitales sigan siendo legibles durante décadas, incluso cuando los formatos de archivo se vuelven obsoletos y el software cambia. La IA es un asistente poderoso pero defectuoso en las tres áreas.
Paso a paso: de la digitalización a la preservación
1. Priorizar. No se puede digitalizar todo a la vez. Los documentos más frágiles, más solicitados y más singulares se ponen en primer lugar. Esta es una decisión judicial; La IA ayuda con la edición de listas, pero la institución determina la prioridad.
2. Escanee y aplique OCR/HTR. Escanee el documento en alta resolución y luego use OCR o HTR para extraer el texto. Las herramientas basadas en IA son cada vez mejores aquí, incluso con textos antiguos y difíciles.
3. Corrija y verifique el texto. La salida OCR/HTR nunca es perfecta. Los errores son comunes, especialmente si hay escritos antiguos, páginas manchadas o un manuscrito. Es fundamental comparar el resultado con la imagen real y corregirla.
4. Agregue metadatos e información de protección. Agregue al objeto digital su procedencia, condiciones de escaneo, información de formato y procedencia: de dónde procede el documento y cómo se procesó. Esta información es fundamental para futuras verificaciones y protección.
5. Planifique una protección a largo plazo. Elija formatos de archivo que sean abiertos, comunes y duraderos; respaldo; Realizar un plan de migración en caso de que los formatos queden obsoletos.
Consejo: No acepte la salida de OCR como "texto sin cifrar". Si un sistema de búsqueda trabajara con este texto, las palabras mal reconocidas provocarían que no se encontrara la fuente. Para colecciones críticas, corregir la salida de OCR al ojo humano determina la calidad de todo el acceso posterior.
Autenticidad e integridad del objeto digital.
En el corazón del trabajo de archivo se encuentran la autenticidad y la integridad: la seguridad de que un documento realmente proviene de la fuente reclamada y de que su contenido no ha sido alterado. En este punto, la IA crea una doble amenaza. En primer lugar, durante la corrección o “mejora” de OCR/HTR, la IA puede modificar silenciosamente el texto; Puede agregar una palabra que no existe bajo el nombre "corrección". En segundo lugar, si la "reparación" o "restauración" de la imagen se realiza con IA, es posible que se produzcan detalles no originales.
La regla del archivero es clara: la copia de preservación digital debe ser fiel al original. Cada mejora realizada con IA debe documentarse y siempre debe conservarse el escaneo real (sin procesar). "Embellecer" un documento puede destruir su valor probatorio histórico.
Precaución: Puede resultar tentador "mejorar" una fotografía o un documento antiguo con IA; pero la IA completa las partes que faltan inventándolas. En un documento de archivo, esto significa crear evidencia histórica falsa. El resultado de la restauración nunca reemplaza la fuente original; se almacena como una variante separada y claramente etiquetada.
tres mini casos
Caso 1: Se pueden realizar búsquedas en archivos de periódicos. Una biblioteca ha digitalizado su colección de periódicos locales de 30 años de antigüedad. Con OCR, se transcribieron 90.000 páginas y se pudieron realizar búsquedas; Una búsqueda de temas que antes tomaba días ahora se ha reducido a segundos. Sin embargo, el equipo notó que la precisión del OCR se redujo al 80 % en páginas viejas y manchadas y dio prioridad a corregir los años superiores con el ojo humano.
Caso 2: HTR abrió el manuscrito. Un archivo aplicó HTR a una colección de cartas del siglo XIX difíciles de leer. El sistema ganó gran velocidad según meses de lectura por parte de expertos; Pero cada página de la copia impresa fue comparada con el original por un paleógrafo experto (un experto en escritura antigua), porque había errores en los nombres de personas y lugares.
Caso 3: Falsa “restauración” rechazada. Un equipo consideró "reparar" una fotografía histórica rota con IA. AI completó las partes faciales que faltaban ajustándolas. El archivero se dio cuenta de que estos detalles inventados distorsionarían la evidencia histórica; La imagen reparada se almacenó por separado junto con la original, sólo que estaba claramente etiquetada como "derivado de IA".
Copia de acceso, copia de conservación y decisión de formato.
Una buena práctica en digitalización es separar copias de un mismo objeto para distintos fines. Un maestro de preservación es el objeto digital real que se llevará al futuro, almacenado en la resolución más alta, en formato sin comprimir o sin pérdidas; rara vez se toca. La copia de acceso es una variante más pequeña y de fácil apertura que se presenta al usuario. Esta distinción es importante porque el formato que resulta práctico de usar (pequeño, comprimido) puede no ser adecuado para la conservación a largo plazo; El formato ideal para la conservación (grande, sin pérdidas) resulta engorroso para el uso diario. En este flujo de trabajo, la IA puede ayudar a inventariar archivos, detectar variantes faltantes y mantener la coherencia de los metadatos entre dos copias. Sin embargo, la elección del formato es una decisión de preservación: se deben preferir los formatos abiertos, ampliamente documentados y duraderos (en lugar de los formatos cerrados y propietarios), y se debe tener listo un plan de migración en caso de que los formatos se vuelvan obsoletos con el tiempo. Incluso si AI sugiere un formato, la política de preservación a largo plazo de la institución tiene la última palabra.
Consejo: Para cada objeto digital, lleve un breve registro que responda a las preguntas "¿dónde está la fuente original, en qué formato está la copia de preservación, en qué formato está la copia de acceso y cuál se pone a disposición del usuario?" La combinación de estas tres capas no deja claro cuál es el archivo maestro de confianza en el futuro.
Cuatro plantillas copiables
1) Ayuda para la corrección de salida de OCR:
A continuación se muestra un texto OCR y una descripción de la página real. Solo corrija errores de openOCR (caracteres incorrectos, palabras compuestas/divididas). No cambie el contenido, agregue o elimine palabras. Si no está seguro, márquelo con "[?]". Texto OCR: [aquí]
2) Comprobación de coherencia texto-imagen:
¿Hay alguna adición en el texto corregido a continuación que no se esperaba que estuviera en el documento original (que puede haber sido inventado)? Marque cada parte sospechosa y escriba por qué es sospechosa. Texto: [aquí]
3) Borrador de metadatos de protección:
Genere el esquema de metadatos de preservación para el siguiente objeto digitalizado: fuente, procedencia, fecha/resolución del escaneo, formato de archivo, historial de transacciones. Simplemente use la información que proporcioné y deje en blanco el campo que falta. Información: [aquí]
4) Ayuda para la priorización:
A continuación se muestra la lista de colecciones en espera de digitalización; Ayudar a priorizar en función de la fragilidad, la demanda y la singularidad. Dar una breve justificación de cada recurso; Déjame la decisión final a mí. Lista: [aquí]
Aviso débil / Aviso fuerte
Aviso débil:
Corrija y embellezca este texto escaneado.
“Beautify” invita a la IA a cambiar el contenido, compensar las omisiones; La originalidad del documento de archivo está dañada.
Potente mensaje:
Su función: asistente del editor de digitalización. En el siguiente texto de OCR, corrija SÓLO los errores de reconocimiento explícitos (carácter incorrecto, palabra dividida incorrectamente). No agregue, elimine ni cambie ninguna palabra. Deje "[?]" donde no esté seguro. Muestre cada corrección que realizó en una lista separada. Texto: [aquí]
El potente mensaje limita a la IA a reconocer únicamente errores, le prohíbe tocar el contenido y hace que las correcciones sean rastreables.
Tabla de flujo de trabajo y riesgos
etapa
Contribución de la IA
Riesgo principal
medida de protección
escanear
—
mala calidad
alta resolución
OCR/HTR
Convertir a texto
Errores de reconocimiento
corrección humana
corrección
sugerencia de error
Cambiar contenido
Comparación con el original
restauración
Derivada de imagen
detalle de ajuste
Conserve el original sin editar, etiquételo
protección
Borrador de metadatos
perdida de origen
Registro de procedencia
Errores comunes
- Aceptar la salida OCR sin corrección. Los errores interrumpen la búsqueda y el acceso.
- Llamar a la IA "hacer bella". Cambia el contenido y destruye la originalidad.
- Sustituir la restauración de IA por evidencia real. Los detalles fabricados crean una historia falsa.
- No almacenar el escaneo sin procesar. No se puede verificar ninguna corrección sin el original.
- Omitir información de procedencia. La fiabilidad del documento se vuelve imposible de rastrear.
En resumen
IA en archivos digitales y digitalización; Es una ayuda valiosa que acelera la transcripción OCR/HTR, la redacción de metadatos y la priorización. Pero la esencia del trabajo de archivo es la autenticidad y la integridad: la salida de OCR debe ser corregida por el ojo humano, la IA nunca debe reemplazar silenciosamente el contenido, los derivados de la restauración no deben reemplazar la evidencia original y siempre se debe preservar la información sin procesar del escaneo y la procedencia. Utilice la IA como una herramienta que no "mejore" el documento, sino que lo haga accesible sin dejar de ser fiel a él.
Tarea de aplicación
Obtenga una breve muestra del resultado OCR (ya sea su propia producción o un escaneo real). Corrija solo los errores de reconocimiento con la plantilla "Ayuda para la corrección de salida de OCR", luego verifique si la IA ha agregado contenido con la plantilla "Verificación de coherencia texto-imagen". Luego cree un registro con la información de procedencia y formato del objeto con la plantilla "Borrador de metadatos de preservación".
lista de verificación
- [] Comparé la salida de OCR/HTR con la imagen real y la corregí.
- [] He comprobado que la IA no agrega/cambia contenido.
- [] Mantuve el escaneo sin formato (maestro) por separado y sin cambios.
- [] Agregué información de procedencia y formato a los metadatos.
- [] He etiquetado claramente las variantes de restauración como "derivado de IA".