Unidad 12 / 12

Proyecto de extremo a extremo: procesamiento de una colección de archivos con inteligencia artificial

Ganancias:

  • Capacidad de procesar una colección en un flujo de trabajo de 7 etapas, desde la evaluación ética hasta la publicación, con un punto de control humano en cada etapa.
  • Comprender cómo los puntos de control tempranos evitan que un error (fecha o nombre incorrectos) se propague por toda la cadena.
  • Capacidad para aplicar los principios de preservar el archivo maestro, no guardar en la verificación y declarar el uso de IA en un proyecto holístico.

Las unidades anteriores han cubierto habilidades individuales: digitalización, transcripción, metadatos, escaneo, traducción, verificación, análisis de patrones, recuperación, preservación y ética. Esta unidad final lo combina todo. Un verdadero proyecto de archivo experimenta estos pasos no por separado sino como un flujo de trabajo interconectado. Aquí veremos cómo se puede procesar una colección de principio a fin con un proceso respaldado por IA pero controlado por humanos, paso a paso y con una cadena de control.

El objetivo es posicionar a la IA como un socio que “acelera cada paso pero no tiene la última palabra en ninguno”. Cuando termine esta unidad, le quedará un método holístico que transforma una pila desordenada de documentos en una colección éticamente limpia, verificada y lista para la investigación.

Escenario: lo que tenemos

Digamos que recibe una colección de 250 documentos: algunos impresos (correspondencia impresa, anuncios), algunos manuscritos (cartas, cuadernos), de diferentes fechas, algunos contienen datos personales sensibles. Objetivo: digitalizar, transcribir, catalogar y poner esta colección a disposición de los investigadores. Dividamos el proceso en siete etapas.

Flujo de trabajo de siete pasos

Fase 1: Evaluación y control ético. Conozca la colección primero. ¿Qué documentos contienen datos personales sensibles? ¿Cuál es el estado de los derechos de autor? ¿Existe sensibilidad cultural? Este escaneo determina qué documentos se pueden entregar a herramientas de inteligencia artificial basadas en la nube y cuáles se procesarán solo en un entorno cerrado/aprobado. Si se omite esta etapa, todo el proyecto corre riesgo ético.

Etapa 2: Digitalización. Escanee documentos en alta resolución (al menos 300-400 DPI, buen contraste). Mantenga intactos los archivos originales (maestros); Todo el procesamiento se realizará en las copias.

Etapa 3: extracción de texto. Aplique OCR para documentos impresos y HTR para manuscritos. Haga que la IA limpie la salida sin procesar con instrucciones de “corrección segura”: solo errores ópticos/de reconocimiento, sin comentarios de contenido, lugares ilegibles [?]. Lectura alternativa y control paleógrafo del manuscrito/otomano.

Etapa 4: Metadatos y catalogación. Tener metadatos estándar (Dublin Core/ISAD(G)) redactados para cada documento; Con permiso de "dejar en blanco el campo inexistente". Asigne términos de tema a la lista controlada. Verifique fechas y nombres con documentación.

Etapa 5: Enriquecimiento y modelado. Extraiga entidades (persona/lugar/organización), normalice, produzca relaciones y esquemas de cronograma. Verifique cada patrón en el documento; No hay conexiones artificiales ni cronología.

Etapa 6: herramientas de acceso. Producir un esquema de ayuda para la búsqueda para su recolección; Base la sección de historial únicamente en notas verificadas. Marcar claramente las restricciones de acceso (privacidad/derechos de autor).

Etapa 7 — Verificación, declaración y publicación. Verifique los campos críticos (fecha, nombre, cotización, referencia) por última vez. Declarar el uso de IA. El perito da la aprobación final; La colección está abierta a la investigación.

Consejo: coloque un "punto de control humano" en cada etapa: un experto valida el resultado de la IA antes de pasar a la siguiente etapa. Sin estos puntos de control, un error en la primera etapa (una fecha mal leída) se propagará por toda la cadena y eventualmente se filtrará en el catálogo, el patrón y la guía.

mesa de cadena de control

etapa

El trabajo de la IA

punto de control humano

1. Evaluación ética

Marcado de datos sensibles

Decisión de instalación

2. Digitalización

(Mejora de imagen)

Calidad, protección maestra

3. Extracción de texto

OCR/HTR + corrección segura

Nombre/fecha/verificación de lectura

4. Metadatos

borrador estándar

Confirmación de campo, coincidencia de términos

5. Patrón

entidad, relación, línea de tiempo

Validación en documento

6. Herramienta de acceso

Encontrar borrador de ayuda

Historial y aprobación de restricciones.

7. Liberación

Aprobación final, declaración

tres mini casos

Caso 1: Se detectó un error en la cadena. En un proyecto, en la fase 3, la fecha de un documento decía "1868" en lugar de "1888". Si el punto de control de la etapa 3 no hubiera detectado este error, la fecha se habría distribuido en el catálogo (4), la línea de tiempo (5) y la guía (6). Gracias al punto de control, el error se solucionó en un solo lugar. Lección: la verificación temprana evita que el error se propague a lo largo de la cadena.

Caso 2: El análisis ético salvó el proyecto. 18 de los 250 documentos contenían datos sensibles de personas vivas. El examen ético en la fase 1 los marcó; Estos 18 documentos se procesaron en un entorno cerrado, el resto con herramientas estándar. Habría sido una infracción grave si se omitiera el escaneo y se subiera todo a la nube. Lección: la evaluación ética es el primer paso, no una solución que se agregue más adelante.

Caso 3: Tiempo y esfuerzo. Utilizando el método tradicional, se necesitarían aproximadamente entre 8 y 10 meses para procesar completamente una colección de 250 documentos. Con el flujo de trabajo de punto de control respaldado por IA, el proceso se redujo a aproximadamente 3 meses. Pero los ahorros no provinieron de “la IA hizo todo”, sino de “la IA hizo el trabajo mecánico, centrándose en la verificación humana”. El tiempo dedicado a la verificación no ha disminuido; El tiempo dedicado al trabajo mecánico ha disminuido.

Cuatro plantillas copiables

1) Plan inicial del proyecto:

Tengo una colección de [número] documentos: [combinación de impresos/manuscritos], [punto], algunos de los cuales pueden contener datos confidenciales. Cree un plan de flujo de trabajo de 7 pasos para digitalizar y catalogar esta colección: especifique la tarea de la IA y el punto de control HUMANO en cada etapa. Poner en primer lugar el examen ético.

2) Lista de verificación de transición de etapa:

Terminé la etapa de [nombre artístico]. Producir una lista de verificación de los puntos críticos que necesito verificar antes de pasar a la siguiente etapa: ¿qué hechos (fecha/nombre/referencia) deben verificarse, qué errores pueden propagarse a lo largo de la cadena? Tengo la aprobación final; Dame la lista de verificación.

3) Control de calidad de extremo a extremo:

A continuación se muestran todas las capas de un documento procesado: transcripción, metadatos, activos extraídos. INCONCEPTOS DE FIGURAS entre capas: ¿una fecha en la transcripción coincide con los metadatos? ¿Existen realmente las entidades en el texto? Imposición de corrección; Generar una lista de inconsistencias. Capas: [aquí]

4) Cierre y declaración del proyecto:

En este proyecto de colección, utilicé IA en las siguientes etapas: [lista]. Para la documentación del proyecto: (1) qué soporte de IA se utilizó en qué etapa, (2) cómo se realizó la verificación humana, (3) qué límites/restricciones existen: escriba una nota de cierre honesta y un borrador de la declaración de uso de IA que los incluya.

Aviso débil / Aviso fuerte

Débil:

Procese esta colección a fondo con IA y prepárela para la investigación.

Una sola instrucción de “hacer cualquier cosa” elude el control, los puntos de control y la verificación éticos; Los errores se propagan a lo largo de la cadena.

Fuerte:

Configure un flujo de trabajo de 7 etapas para esta colección, con un punto de control humano en cada etapa. Dejemos que la primera etapa sea la evaluación de ética/privacidad. El resultado producido por la IA en cada etapa se verificará antes de pasar a la siguiente etapa; marcar hechos críticos (fecha/nombre/referencia). En ningún momento la IA tiene la última palabra.

La diferencia: la estructura por fases, la prioridad ética, los puntos de control y el principio de "la gente tiene la última palabra" hacen que todo el proyecto sea seguro y defendible.

Errores comunes

  • Dejar el control ético para el final. El escaneo de privacidad/derechos de autor es el primer paso; Si se agrega más tarde, la infracción ya ocurrió.
  • Pasando por alto los controles. Un error que no se verifica se propaga por toda la cadena.
  • No proteger el archivo maestro. Si el original no se mantiene intacto, la devolución resulta imposible.
  • Ahorro en verificación. La IA acorta el trabajo mecánico; Si se acorta el tiempo de verificación, la calidad disminuye.
  • No declarar el uso de IA. La transparencia es parte de la credibilidad científica de la colección.

En resumen

Un proyecto de archivo de extremo a extremo conecta habilidades individuales en una cadena de control: escaneo ético, digitalización, extracción de texto, metadatos, patrones, herramienta de recuperación y publicación. En cada etapa, la IA acelera el trabajo mecánico; En cada etapa, un puesto de control humano tiene la última palabra. La evaluación ética es la primera etapa, el archivo maestro está protegido, los errores se detectan temprano para que no se propaguen a lo largo de la cadena y el uso de la IA se declara honestamente. Los ahorros no provienen de que la IA haga todo, sino de que el ser humano se libere del trabajo mecánico y se centre en la verificación. La IA se acelera; El hombre garantiza la exactitud y la integridad de la historia.

Tarea de aplicación

Seleccione una colección pequeña (10-20 documentos; su propio material o un conjunto de muestra). Cree un flujo de trabajo de 7 pasos con la plantilla "plan de inicio del proyecto". Ejecute al menos dos documentos a través de este flujo: escaneo ético, extracción de texto, metadatos y una capa de patrón. Verifique cada etapa con una “lista de verificación de transición de etapa”. Finalmente, documente su uso de la IA con la plantilla de “declaración y cierre del proyecto”. Tenga en cuenta qué errores se detectaron en los primeros puntos de control.

lista de verificación

  • [ ] Hice la evaluación de ética/privacidad en la primera etapa.
  • [] Mantuve los archivos maestros intactos.
  • [] Puse un punto de control humano en cada etapa.
  • [] Verifiqué hechos críticos antes de que se propagaran a lo largo de la cadena.
  • [ ] Declaré el uso de IA en el cierre del proyecto.

Examen del módulo

1. ¿Cuál es el posicionamiento más apropiado para la inteligencia artificial en la historia y los archivos?

  • A) La IA es una herramienta de resumen, edición y redacción; Comentario, crítica de fuentes y responsabilidad final pertenecen al experto ✔
  • B) La inteligencia artificial puede decidir por sí sola la autenticidad y el significado del documento, como un historiador
  • C) La inteligencia artificial sólo sirve para traducir texto, no tiene nada que ver con otras tareas de archivo
  • D) Dado que la inteligencia artificial es siempre más imparcial que los humanos, se debe dejar a ella la interpretación histórica.

Descripción: Inteligencia artificial; Es un asistente que edita, escanea, traduce y produce borradores de texto. La crítica de las fuentes, la interpretación, el establecimiento de causa-efecto y la decisión final pertenecen al experto; Una salida no verificada puede conducir a una fuente fabricada, una fecha falsa o un anacronismo.

2. ¿Qué es la alucinación que produce la inteligencia artificial en la investigación histórica?

  • A) La inteligencia artificial procesa un documento muy lentamente
  • B) La inteligencia artificial fabrica una fuente, cita o evento inexistente como real ✔
  • C) Un documento está físicamente dañado
  • D) Un catálogo de archivos no está actualizado

Explicación: La alucinación ocurre cuando la inteligencia artificial fabrica con confianza información, fuentes, citas o eventos que en realidad no existen. Aunque su forma parece perfecta, su contenido no es real; Por lo tanto, en todo catálogo de referencia, cada cita debe verificarse en la fuente original.

3. ¿Cuál es el mejor enfoque para que la inteligencia artificial corrija una salida de OCR?

  • A) Pedir que el texto sea fluido y bonito y que complete lógicamente las partes que faltan.
  • B) Permitirle corregir todos los números y fechas según el contexto.
  • C) Pedirle que corrija únicamente los errores de reconocimiento óptico, que deje áreas ilegibles [?] y que no cambie números/fechas ✔
  • D) Pedir al alumno que complete las palabras ilegibles con la suposición más probable.

Explicación: La regla de oro en la corrección de OCR es corregir sólo errores obvios de reconocimiento óptico (como rn a m, l a 1); no interpretar ni completar el contenido del texto. Las áreas ilegibles están marcadas con [?]; Los números y fechas no se modifican, se verifican con la imagen.

4. ¿Qué se le debe preguntar a la inteligencia artificial a la hora de leer una palabra cuya vocal no está escrita en un texto otomano?

  • A) Dar una lectura única y precisa, agilizando así el trabajo.
  • B) Seleccionar la palabra que hará que el significado sea más fluido y completar los espacios en blanco.
  • C) Completar las partes ilegibles desde sus propios conocimientos generales.
  • D) Ofrecer posibles alternativas de lectura y marcar zonas ambiguas en lugar de imponer una lectura definitiva ✔

Explicación: En turco otomano, la mayoría de las vocales cortas no están escritas; Una sola diferencia de vocal/letra (abul y kabul, wali y vali) cambia completamente el significado. Por tanto, en lugar de imponer una lectura definitiva, conviene plantearse posibles alternativas, conservar las zonas ilegibles y dejar la decisión final al paleógrafo.

5. ¿Cuál es la forma más eficaz de prevenir las alucinaciones cuando la IA produce un borrador de metadatos (registro de catálogo)?

  • A) Otorgar permiso explícitamente para dejar ese campo en blanco si no está incluido en el documento ✔
  • B) Solicitar que se completen todos los campos y no se dejen incompletos.
  • C) Estimación de una fecha basándose en el contenido de documentos sin fecha
  • D) Permitir que la inteligencia artificial genere el código de referencia

Descripción: La presión de relleno obliga a la IA a inventar el documento adivinando la fecha o el creador que no está en el documento. La protección más fuerte contra esto es otorgar permiso explícitamente para dejar el campo en blanco si no está en el documento; Además, los términos temáticos se asignan a un vocabulario controlado.

6. ¿Cómo debería posicionarse en la investigación histórica un resumen de un documento producido por inteligencia artificial?

  • A) Como prueba fiable que puede citarse directamente
  • B) Como mapa de descubrimiento que le dirige al documento real; La evidencia se toma del documento original ✔
  • C) Como recurso adecuado que puede sustituir al propio documento
  • D) Como texto que se puede utilizar en el estudio sin volver nunca al documento.

Descripción: El resumen es un mapa de descubrimiento, no una prueba. Hay algo como esto en este documento, dice ve y mira; No dice exactamente lo que dice en el documento. Si se desea incluir algún evento, cita o dato en el estudio, se debe tomar textualmente del documento original.

7. ¿Cuál es la forma adecuada de evitar anacronismos al traducir un documento histórico para su publicación?

  • A) Reemplazar todos los términos del período con el equivalente más cercano a hoy
  • B) Transmitir el texto lo más fluido y moderno posible.
  • C) Deje los títulos de los períodos y los nombres de las instituciones únicos y agregue una explicación ✔
  • D) Adaptar los nombres propios a su uso actual

Explicación: El anacronismo es la transferencia incorrecta de elementos de un período a otro. Cambiar los títulos de la época, los nombres de las instituciones y los nombres personales a los términos actuales transporta al lector a un mundo que no pertenece a la época. La forma correcta es mantener el término del período y agregar una explicación al lado.

8. ¿Cómo asegurarse de que una referencia de archivo (nombre del fondo, número de expediente) proporcionada por la inteligencia artificial sea real?

  • A) Confiar en la referencia porque su formato parece correcto
  • B) Preguntando nuevamente a la IA si la referencia es correcta
  • C) Aceptar la referencia como verdadera porque es convincente y detallada
  • D) Al encontrar y verificar personalmente la referencia en el catálogo de archivo o fuente confiable ✔

Descripción: La inteligencia artificial puede producir referencias que tienen una forma perfecta pero que en realidad no existen; Una referencia ficticia tiene la misma forma que una referencia real. La única manera de demostrar que existe una referencia es encontrarla donde se encuentra la fuente original (catálogo de archivo, biblioteca).

9. ¿Cómo se debe evaluar un patrón encontrado al realizar análisis de patrones (NER, red, línea de tiempo) con inteligencia artificial?

  • A) Como hipótesis que debe ser verificada en el documento; punto de partida, no resultado ✔
  • B) Como conclusión definitiva que no requiere verificación
  • C) Es un hecho objetivo indiscutible porque es numérico.
  • D) Como resultado que se puede poner en estudio directo porque se encontró inteligencia artificial.

Explicación: Cada patrón es una hipótesis, no una evidencia. Las entidades deben estar vinculadas a la fuente, las diferentes grafías (de la misma persona/lugar) deben normalizarse con la aprobación humana, los números deben cuestionarse por datos faltantes y sesgos de muestreo, y los eventos sin fecha no deben cronologizarse.

10. ¿Por qué la sección biográfica/de historia institucional de un instrumento de búsqueda requiere atención especial?

  • A) Esta sección no es importante y puede publicarse sin verificación.
  • B) Dado que la inteligencia artificial puede agregar eventos inventados, fechas y títulos falsos en esta sección, solo debe basarse en fuentes verificadas ✔
  • C) La inteligencia artificial se puede utilizar de forma segura porque no comete ningún error al escribir la historia.
  • D) Sólo los investigadores llenan esta sección, al archivero no le interesa

Descripción: La sección de historia es donde las alucinaciones suelen aparecer: la IA puede insertar eventos inexistentes, fechas falsas y títulos inventados mientras escribe un texto fluido a partir de información general sobre una persona o institución. Esta sección debe basarse únicamente en fuentes verificadas.

11. ¿Cómo debería responder la inteligencia artificial a la pregunta fáctica de un investigador en un servicio de referencia (consulta)?

  • A) La respuesta a la pregunta debe darse de forma directa y como un hecho definitivo.
  • B) Debe producir una fecha o nombre creíble y comunicárselo al investigador.
  • C) En lugar de proporcionar datos directamente, debe dirigir al investigador a la colección y fuente relevantes ✔
  • D) Debe proporcionar una respuesta completa para que el investigador no necesite acudir a la fuente.

Explicación: En el servicio de referencia, la inteligencia artificial no debe dar una respuesta directa a los hechos, sino que debe dirigir al investigador a la fuente. Porque la respuesta fáctica directa dada por la inteligencia artificial puede ser inventada y el investigador puede confundirla con la fuente. En lugar de decir "La respuesta es esta", debería decir "Mira estos documentos de esta colección".

12. ¿Qué operaciones son aceptables y objetables al procesar la imagen de un documento dañado con inteligencia artificial?

  • A) Todo tipo de operaciones son gratuitas, incluida la cumplimentación de las piezas faltantes.
  • B) No se debe realizar ninguna acción, nunca se debe tocar la imagen
  • C) Completar las secciones que faltan es la acción más valiosa porque completa el documento.
  • D) Se aceptan manipulaciones de legibilidad como contraste/ruido; Es un inconveniente completar las partes que faltan con conjeturas ✔

Explicación: Los procesos que mejoran la legibilidad (contraste, iluminación, reducción de ruido) son aceptables porque no cambian el contenido; Sin embargo, completar con conjeturas las partes faltantes o ilegibles supone el riesgo de producir lo que no está en el documento, es decir, una falsificación histórica. Se conserva el original, se registran las transacciones.

13. ¿Qué se debe hacer antes de procesar un documento de archivo que contiene datos personales confidenciales?

  • A) Escaneo de privacidad y anonimización si es necesario o utilizando una herramienta cerrada/aprobada ✔
  • B) Subir el documento directamente a un vehículo público sin siquiera pensarlo
  • C) Ignorar las preocupaciones de privacidad en aras de la eficiencia
  • D) Superación de restricciones de acceso por razones de eficiencia

Divulgación: cargar documentos que contengan datos confidenciales que identifiquen a personas vivas (salud, religión, origen étnico, dirección) a herramientas públicas basadas en la nube puede ser una violación grave de la privacidad. Primero se debe realizar un análisis de privacidad y, si es necesario, se debe utilizar la anonimización o una herramienta cerrada/aprobada.

14. ¿Cuál es el objetivo principal de un punto de control humano en un proyecto de archivo de un extremo a otro?

  • A) Ralentizar el trabajo de la inteligencia artificial y retrasar el proyecto
  • B) Para evitar que un error (fecha/nombre incorrecto) en una etapa se encadene a todas las etapas posteriores ✔
  • C) Incrementar el trabajo humano y abandonar por completo la automatización
  • D) Garantizar que la inteligencia artificial tenga la última palabra

Descripción: Un punto de control humano en cada etapa garantiza que la salida de la IA se verifique antes de pasar a la siguiente etapa. Sin esto, un error en la primera etapa (una fecha mal leída) se propagaría a lo largo de la cadena a través del catálogo, el patrón y la guía. La verificación temprana garantiza que el error se corrija en un solo lugar.

15. ¿Qué requieren transparencia y autenticidad en el uso de la inteligencia artificial en humanidades y ciencias sociales?

  • A) Mantener en secreto el uso de la inteligencia artificial, asegurando que nadie lo sepa
  • B) Presentar cada texto producido por la inteligencia artificial como una idea original propia.
  • C) Declarar honestamente el uso de la inteligencia artificial y no presentar su producción como trabajo original propio ✔
  • D) Compartir solo los resultados sin explicar los métodos.

Descripción: La transparencia incluye registrar que una transcripción, metadatos o traducción se produjo con la ayuda de inteligencia artificial; La originalidad exige no presentar un comentario producido por la inteligencia artificial como una idea original propia. Esto es esencial para la verificación por parte de investigadores posteriores y para la integridad académica.