Ganancias:
- Capacidad para producir borradores de metadatos de acuerdo con estándares como ISAD(G) o Dublin Core con inteligencia artificial.
- Capacidad para prevenir alucinaciones y asignar términos temáticos a vocabulario controlado con permiso para dejar en blanco
- Capacidad de distinguir qué campos, como fecha, nombre de la persona y código de referencia, requieren aprobación humana y cuáles solo deben ser asignados por la institución.
Un archivo o biblioteca, por muy rico que sea, no se puede encontrar si no está bien definido. Lo que hace que un documento sea “encontrable” es la información descriptiva sobre él: quién lo escribió, cuándo, dónde, cuál es el tema, a qué colección pertenece. Esta información se denomina metadatos (metadatos: datos descriptivos sobre un documento; “datos sobre datos”). La catalogación es el proceso de identificar documentos con estos metadatos y guardarlos en un sistema con capacidad de búsqueda. La clasificación consiste en organizar los documentos según criterios como materia, tipo u origen.
Generar metadatos requiere mucho tiempo; Introducir información de fecha, tema, persona y lugar individualmente para miles de documentos en grandes colecciones puede llevar años. La IA es un potente generador de tiro en este negocio. En esta unidad, veremos cómo generar metadatos con IA, catalogar de acuerdo con estándares (ISAD(G), Dublin Core) y el poder y los peligros de la clasificación automática.
Estándares de archivo: por qué son necesarios
Los metadatos no se ingresan al azar; Existen estándares internacionales para que registros de diferentes instituciones puedan comunicarse entre sí:
- ISAD(G) (Descripción archivística estándar internacional general): Reglas para describir el material de archivo jerárquicamente (a nivel de fondo, serie, archivo, documento). Contiene campos como código de referencia, título, fecha, alcance, creador.
- Dublin Core: Un estándar común que consta de 15 campos básicos para describir recursos digitales (título, creador, tema, fecha, género, formato, fuente, idioma, etc.).
- Fondo: Conjunto de registros formados naturalmente como resultado de las actividades de una sola persona, familia o institución. Es la unidad organizativa básica del archivo.
- Procedencia (origen): Información sobre de quién proviene un documento y por qué mano pasó. En el archivo, los documentos se mantienen juntos según su origen.
Especificar explícitamente el estándar de destino cuando la IA produce metadatos garantiza que la salida se pueda ingresar directamente en la empresa.
Otro concepto clave es el registro de autoridad: un registro que define una forma única, estándar y aprobada del nombre de una persona, lugar o institución. En los documentos históricos, la misma persona o lugar puede aparecer con diferente grafía; El registro de autoridad los vincula a todos en un único formato aprobado para que no se dispersen en la búsqueda. La IA sugiere nombres de un documento; pero asignar este nombre a la forma estándar en el registro de autoridad es trabajo humano. Vincular lo que la IA dice "Ahmed" con "Ahmed Bey (1840-1912)" en el registro de autoridad de la institución preserva la coherencia del catálogo.
Flujo de trabajo: paso a paso
1. Preparar la fuente. Recopile una transcripción o imagen del documento y cualquier información de contexto.
2. Identificar el estándar y las áreas. Dígale a la IA qué estándar (ISAD(G), Dublin Core) y según qué campos producirá resultados.
3. Generar borrador de metadatos. La IA completa campos que se pueden extraer del documento (fecha, persona, lugar, tema, idioma, género); Deja en blanco las áreas que no puede eliminar.
4. Mapa de vocabulario controlado. Los nombres de materias y lugares no son gratuitos en la mayoría de las instituciones, sino que están vinculados a una lista predefinida (vocabulario controlado/tesauro). Asigne los términos temáticos sugeridos por la IA a esta lista.
5. Verificar y confirmar. Cada campo, especialmente la fecha, el nombre y el tema, es comparado por los seres humanos con documentos y registros de autoridad.
Consejo: Otorgue permiso explícito a la IA para "dejar en blanco". De lo contrario, "adivinará" una fecha o un creador que no está en el documento e insertará metadatos falsos en su catálogo. La instrucción "Deje este campo en blanco si no está en el documento" es el escudo más fuerte contra las alucinaciones.
Campos y nivel de confianza en una tabla.
Campo de metadatos
¿Qué tan confiable es la IA?
verificación
idioma
alto
muestra
Tipo de documento
medio-alto
controlar
Nombres de personas/lugares
Medio (error de lectura)
obligatorio
fecha
Bajo-medio (riesgo de fabricación)
obligatorio
Términos temáticos
Medio (generación libre)
Mapa a lista de verificación
Alcance/resumen
medio-alto
Comparar con la fuente
Código de referencia
Ninguno (la institución otorga)
lanzamientos humanos
Resumen: La IA es rápida y confiable en áreas como el idioma y el género; genera borradores en campos como fecha, nombre y asunto, pero se requiere aprobación humana; La IA nunca produce campos institucionales como el código de referencia.
tres mini casos
Caso 1: Borrador de metadatos para 8000 fotografías. Un archivo de la ciudad catalogaba 8.000 fotografías históricas. Las notas al dorso de cada fotografía fueron transcritas y entregadas a la IA; Fecha, ubicación y esquema del tema generados por IA. El equipo humano lo verificó campo por campo y lo mapeó en la lista controlada. Un trabajo estimado de 10 meses se redujo a 3 meses; pero cada fecha y nombre de lugar fueron verificados visualmente.
Caso 2: Historia inventada. Un archivero hizo que AI catalogara una carta sin fecha. YZ miró el contenido de la carta y escribió la fecha "1912" con precisión. Sin embargo, no había ninguna fecha en el documento; La IA predijo. Si el archivero no hubiera añadido la instrucción "dejar en blanco si no está en el documento", el catálogo se habría llenado con una fecha inventada. Lección: el permiso en blanco es obligatorio.
Caso 3: Los términos temáticos libres crearon confusión. AI asignó términos gratuitos similares pero diferentes, como "inmigración", "inmigración", "asentamiento" a documentos similares. Cuando no se asignó al vocabulario controlado, el mismo tema se etiquetó con tres términos diferentes y se dispersó en la búsqueda. La coherencia se logró asignando los términos a una única lista de autoridades. Lección: los términos de los temas no se publican, están vinculados a la lista.
Cuatro plantillas copiables
1) Esquema del Dublin Core:
Extraiga el borrador de metadatos de Dublin Core de la transcripción del documento a continuación. Campos: Título, Creador, Asunto, Descripción, Fecha, Género, Idioma, Ámbito (ubicación/período). Reglas: (1) Utilice únicamente la información CLARAMENTE del texto. (2) Deje el campo que no esté en el texto EN BLANCO, no adivine. (3) Marque el valor del que no está seguro con [?]. Transcripción: [aquí]
2) Proyecto de definición ISAD(G):
Genere un borrador para el siguiente documento en los campos ISAD(G): Título, Fecha(s), Nivel de descripción (documento/archivo), Alcance y contenido (breve resumen), Creador, Idioma. Deje el código de referencia EN BLANCO (la institución lo proporcionará). No agregue ninguna información que no esté en el texto; Deje en blanco el campo inexistente. Documento: [aquí]
3) Sugerencia de términos temáticos (controlada):
Sugiera de 3 a 5 términos temáticos apropiados para el documento siguiente. Primero, confíe en los hechos del documento. A continuación se muestra la lista de terminología controlada de nuestra institución; PRIMERO, selecciónelo de esta lista; si no está en la lista, marque su sugerencia de nuevo término por separado. Lista: [términos]. Documento: [aquí]
4) Verificación de la consistencia del volumen:
A continuación se muestran registros de metadatos de documentos de la misma colección. Marcar inconsistencias: registros que escriben el mismo lugar/persona de manera diferente, diferentes formatos de fecha, diferentes términos para el mismo tema. Corrección IMPOSICIÓN; Simplemente produzca una lista de inconsistencias para que el humano la revise. Registros: [aquí]
Aviso débil / Aviso fuerte
Débil:
Cree un registro de catálogo completo para este documento.
La instrucción "completa" empuja a la IA a llenar cada espacio, es decir, a inventar historias y creadores que no existen.
Fuerte:
El Dublin Core está redactado para este documento. Utilice únicamente información CLARAMENTE incluida en la transcripción; deje el campo inexistente en blanco, no adivine. Seleccione términos de tema de esta lista controlada: [lista]. Marque la fecha y los nombres de las personas con [?] para que pueda verificarlo con el documento. Transcripción: [aquí]
Diferencia: el permiso "dejar en blanco" en lugar de la edición "completa", el cumplimiento controlado de la lista y las marcas de verificación protegen el catálogo contra la fabricación.
Errores comunes
- Significa "llenarlo por completo". Esto lleva a ajustar campos inexistentes; Se debe otorgar el permiso "dejar en blanco".
- Publicación de términos temáticos. Los términos que no se correspondan con el vocabulario controlado distraerán la búsqueda.
- Hacer que la IA prediga la historia. Introducir una fecha ficticia en un documento sin fecha contamina el catálogo.
- Contar con el código de referencia generado por IA. Este es un espacio corporativo y único; la gente tira.
- Sin especificar el estándar. Si no se menciona el estándar, el resultado será un borrador desordenado que no podrá ingresarse en la institución.
En resumen
Los metadatos y la catalogación son la infraestructura invisible que abre el archivo al investigador y requiere mucho esfuerzo. A partir de la transcripción, la IA produce un resumen rápido de campos como fecha, persona, lugar, tema y género; Puede funcionar según estándares como ISAD(G) o Dublin Core. Pero la presión de “completar completamente” empuja a la IA a inventar cosas; El permiso para “dejar en blanco”, la asignación a vocabulario controlado y la confirmación humana de fechas/nombres mantienen el catálogo confiable. AI prepara el borrador; Usted es responsable de la exactitud del catálogo.
Tarea de aplicación
Tome una transcripción de un documento y solicite metadatos a la IA con la plantilla “Dublin Core draft”; Comprueba que deja en blanco campos que no existen. Luego ejecute la plantilla de “sugerencia de términos de tema” con su propia lista de verificación (o de muestra). Finalmente, pruebe algunos registros con una "verificación de coherencia masiva". Tenga en cuenta cuántos campos la IA intenta completar con predicción y cuántos términos temáticos deben asignarse a la lista.
lista de verificación
- [ ] He indicado claramente el estándar objetivo (ISAD(G)/Dublin Core).
- [] Le di el permiso "Dejar el campo en blanco en blanco".
- [] Asigné los términos del tema a la lista controlada.
- [ ] Verifiqué la fecha y los nombres de las personas con el documento/registro de autoridad.
- [ ] Dejé el código de referencia a la institución, no a AI.