Ganhos:
- Capacidade de processar uma coleção em um fluxo de trabalho de 7 etapas, desde a triagem ética até a publicação, com um ponto de verificação humano em cada etapa
- Entenda como os pontos de verificação antecipados evitam que um erro (data/nome errado) se propague por toda a cadeia
- Capacidade de aplicar os princípios de preservação do arquivo mestre, não economizar na verificação e declarar o uso de IA em um projeto holístico
As unidades anteriores cobriram habilidades individuais: digitalização, transcrição, metadados, digitalização, tradução, verificação, análise de padrões, recuperação, preservação e ética. Esta unidade final combina tudo. Um verdadeiro projeto de arquivo experimenta essas etapas não separadamente, mas como um fluxo de trabalho interconectado. Aqui veremos como você pode processar uma coleção do início ao fim com um processo apoiado por IA, mas controlado por humanos, passo a passo e com uma cadeia de controle.
O objetivo é posicionar a IA como um parceiro que “acelera cada passo, mas não tem a palavra final em nenhum passo”. Ao terminar esta unidade, você terá um método holístico que transforma uma pilha confusa de documentos em uma coleção pronta para pesquisa, verificada e eticamente limpa.
Cenário: o que temos
Digamos que você receba um acervo de 250 documentos: alguns impressos (correspondência impressa, anúncios), alguns manuscritos (cartas, cadernos), de datas diferentes, alguns contendo dados pessoais sensíveis. Objetivo: digitalizar, transcrever, catalogar e disponibilizar esse acervo aos pesquisadores. Vamos dividir o processo em sete etapas.
Fluxo de trabalho em sete etapas
Fase 1 — Avaliação e triagem ética. Conheça a coleção primeiro. Quais documentos contêm dados pessoais confidenciais? Qual é o status dos direitos autorais? Existe sensibilidade cultural? Essa digitalização determina quais documentos podem ser entregues a ferramentas de IA baseadas em nuvem e quais serão processados apenas em um ambiente fechado/aprovado. Se esta etapa for ignorada, todo o projeto corre risco ético.
Etapa 2 — Digitalização. Digitalize documentos em alta resolução (pelo menos 300-400 DPI, bom contraste). Mantenha os arquivos originais (mestre) intactos; Todo o processamento será feito nas cópias.
Etapa 3 — Extração de texto. Aplique OCR para documentos impressos e HTR para manuscritos. Faça com que a IA limpe a saída bruta com instruções de “revisão segura” – apenas erros ópticos/de reconhecimento, sem comentários de conteúdo, locais ilegíveis [?]. Leitura alternativa e controle paleográfico para o otomano/manuscrito.
Etapa 4 — Metadados e catalogação. Ter metadados padrão (Dublin Core/ISAD(G)) elaborados para cada documento; Com permissão de "deixar campo inexistente em branco". Mapeie os termos do tópico para a lista controlada. Verifique datas e nomes com documentação.
Etapa 5 — Enriquecimento e padronização. Extrair entidades (pessoa/lugar/organização), normalizar, produzir relacionamentos e contornos de cronograma. Verifique cada padrão no documento; Não há conexões inventadas nem cronologia.
Etapa 6 — Ferramentas de acesso. Produzir esboço de ajuda para coleta; Baseie a seção de histórico apenas em notas verificadas. Marque claramente as restrições de acesso (privacidade/direitos autorais).
Etapa 7 — Verificação, declaração e publicação. Verifique os campos críticos (data, nome, cotação, referência) uma última vez. Declarar o uso de IA. O perito dá a aprovação final; O acervo está aberto para pesquisas.
Dica: Coloque um “ponto de verificação humano” em cada estágio: um especialista valida o resultado da IA antes de passar para o próximo estágio. Sem esses pontos de verificação, um erro no primeiro estágio (uma data mal interpretada) se propagará por toda a cadeia e eventualmente vazará para o catálogo, padrão e guia.
Tabela de cadeia de controle
Palco
O trabalho da IA
posto de controle humano
1. Triagem ética
Marcação de dados confidenciais
Decisão de instalação
2. Digitalização
(Aprimoramento de imagem)
Qualidade, proteção mestre
3. Extração de texto
OCR/HTR + correção segura
Verificação de nome/data/leitura
4. Metadados
rascunho padrão
Confirmação de campo, correspondência de termos
5. Padrão
entidade, relacionamento, linha do tempo
Validação em documento
6. Ferramenta de acesso
Encontrando rascunho de ajuda
Histórico e aprovação de restrições
7. Liberação
-
Aprovação final, declaração
três mini cases
Caso 1 — Erro de cadeia detectado. Num projeto, na fase 3, a data de um documento era "1868" em vez de "1888". Se o ponto de verificação do estágio 3 não tivesse detectado esse erro, a data teria sido espalhada pelo catálogo (4), pela linha do tempo (5) e pelo guia (6). Graças ao checkpoint, o bug foi corrigido em um só lugar. Lição: a verificação antecipada evita que o erro se propague na cadeia.
Caso 2 — A triagem ética salvou o projeto. 18 dos 250 documentos continham dados sensíveis de pessoas vivas. A triagem ética na fase 1 sinalizou isso; esses 18 documentos foram processados em ambiente fechado, o restante com ferramentas padrão. Teria sido uma violação grave se a verificação fosse ignorada e tudo fosse carregado na nuvem. Lição: a triagem ética é o primeiro passo, não uma solução adicionada posteriormente.
Caso 3 — Tempo e esforço. Utilizando o método tradicional, levaria aproximadamente 8 a 10 meses para processar totalmente uma coleção de 250 documentos. Com o fluxo de trabalho do ponto de verificação apoiado por IA, o processo foi reduzido para aproximadamente 3 meses. Mas as poupanças não vieram de “a IA fez tudo”, mas de “a IA fez o trabalho mecânico, focada na verificação humana”. O tempo dedicado à verificação não diminuiu; O tempo dedicado ao trabalho mecânico diminuiu.
Quatro modelos copiáveis
1) Plano inicial do projeto:
Tenho uma coleção de [número] documentos: [combinação de impressão/manuscrito], [período], alguns dos quais podem conter dados confidenciais. Crie um plano de fluxo de trabalho de 7 etapas para digitalizar e catalogar esta coleção: especifique a tarefa da IA e o ponto de verificação HUMANO em cada estágio. Coloque a triagem ética em primeiro lugar.
2) Lista de verificação de transição de estágio:
Terminei a fase [nome artístico]. Produza uma lista de verificação dos pontos críticos que preciso verificar antes de passar para a próxima etapa: quais fatos (data/nome/referência) precisam ser verificados, quais erros podem se propagar na cadeia? Eu tenho a aprovação final; Você me dá a lista de verificação.
3) Controle de qualidade ponta a ponta:
Abaixo estão todas as camadas de um documento processado: transcrição, metadados, ativos extraídos. FIGURA INCONCEITOS entre camadas: uma data na transcrição corresponde aos metadados, as entidades realmente existem no texto? Imposição de correção; Gere uma lista de inconsistências. Camadas: [aqui]
4) Encerramento e declaração do projeto:
Neste projeto de coleção, utilizei IA nas seguintes etapas: [lista]. Para documentação do projeto: (1) qual suporte de IA foi usado em qual estágio, (2) como foi feita a verificação humana, (3) quais limites/restrições existem — escreva uma nota final honesta e um rascunho da declaração de uso de IA que os inclua.
Alerta fraco / Alerta forte
Fraco:
Processe esta coleção minuciosamente com IA e prepare-a para pesquisa.
Uma única instrução “faça qualquer coisa” contorna a triagem ética, os pontos de verificação e a verificação; erros se propagam ao longo da cadeia.
Forte:
Configure um fluxo de trabalho de 7 etapas para esta coleção, com um ponto de verificação humano em cada etapa. Deixe a primeira etapa ser a triagem de ética/privacidade. A saída produzida pela IA em cada estágio será verificada antes de passar para o próximo estágio; marcar fatos críticos (data/nome/referência). Em nenhum momento a IA tem a palavra final.
A diferença: estrutura faseada, prioridade ética, pontos de verificação e o princípio “as pessoas têm a palavra final” tornam todo o projeto seguro e defensável.
Erros comuns
- Deixando a triagem ética para o fim. A verificação de privacidade/direitos autorais é o primeiro passo; Se for adicionado posteriormente, a violação já ocorreu.
- Ignorando pontos de verificação. Um erro que não é verificado se espalha por toda a cadeia.
- Não protegendo o arquivo mestre. Se o original não for mantido intacto, a devolução torna-se impossível.
- Economizando na verificação. A IA encurta o trabalho mecânico; Se o tempo de verificação for reduzido, a qualidade diminui.
- Não declarando o uso de IA. A transparência faz parte da credibilidade científica da coleção.
Resumindo
Um projeto de arquivo de ponta a ponta conecta habilidades individuais em uma cadeia de controle: digitalização ética, digitalização, extração de texto, metadados, padrão, ferramenta de recuperação e publicação. Em cada estágio, a IA acelera o trabalho mecânico; Em cada etapa, um posto de controle humano tem a palavra final. A triagem ética é a primeira etapa, o arquivo mestre é protegido, os erros são detectados precocemente para não se espalharem pela cadeia e o uso da IA é declarado honestamente. A economia não vem da IA fazendo tudo, mas do ser humano livre do trabalho mecânico e focado na verificação. A IA acelera; O homem garante a precisão e integridade da história.
Tarefa de aplicativo
Selecione uma coleção pequena (10 a 20 documentos; seu próprio material ou um conjunto de amostras). Crie um fluxo de trabalho de 7 etapas com o modelo "plano de inicialização do projeto". Execute pelo menos dois documentos por meio desse fluxo: digitalização ética, extração de texto, metadados e uma camada de padrão. Verifique cada estágio com uma “lista de verificação de transição de estágio”. Por fim, documente seu uso de IA com o modelo de “encerramento e declaração do projeto”. Observe quais erros foram detectados nos primeiros pontos de verificação.
lista de verificação
- [ ] Fiz a triagem de ética/privacidade na primeira etapa.
- [] Mantive os arquivos mestres intactos.
- [] Coloquei um posto de controle humano em cada etapa.
- [] Verifiquei fatos críticos antes que eles fossem propagados na cadeia.
- [ ] Declarei o uso de IA no encerramento do projeto.
Exame do Módulo
1. Qual o posicionamento mais adequado para a inteligência artificial na história e no arquivo?
- A) AI é uma ferramenta de resumo, edição e redação; O comentário, a crítica da fonte e a responsabilidade final são do especialista ✔
- B) A inteligência artificial pode decidir sozinha a autenticidade e o significado do documento, como um historiador
- C) A inteligência artificial só funciona para traduzir texto, não tem nada a ver com outras tarefas de arquivo
- D) Como a inteligência artificial é sempre mais imparcial que os humanos, a interpretação histórica deve ser deixada a ela.
Descrição: Inteligência artificial; É um assistente que edita, digitaliza, traduz e produz rascunhos de texto. A crítica da fonte, a interpretação, o estabelecimento de causa e efeito e a decisão final cabem ao perito; Uma saída não verificada pode levar a uma fonte fabricada, a uma data falsa ou a um anacronismo.
2. Qual é a alucinação produzida pela inteligência artificial na pesquisa histórica?
- A) A inteligência artificial processa um documento muito lentamente
- B) A inteligência artificial fabrica uma fonte, citação ou evento inexistente como real ✔
- C) Um documento está fisicamente danificado
- D) Um catálogo de arquivo não está atualizado
Explicação: Alucinação ocorre quando a inteligência artificial fabrica com segurança informações, fontes, citações ou eventos que na verdade não existem. Embora a sua forma pareça perfeita, o seu conteúdo não é real; Portanto, em todo catálogo de referência, toda citação deve ser verificada na fonte original.
3. Qual é a melhor abordagem para corrigir uma saída de OCR por inteligência artificial?
- A) Pedir que o texto seja fluente e bonito e que complete logicamente as partes que faltam.
- B) Permitindo corrigir todos os números e datas com base no contexto
- C) Solicitar que ele corrija apenas erros de reconhecimento óptico, deixe áreas ilegíveis [?] e não altere números/datas ✔
- D) Pedir ao aluno que preencha as palavras ilegíveis com o palpite mais provável.
Explicação: A regra de ouro na correção de OCR é corrigir apenas erros óbvios de reconhecimento óptico (como rn para m, l para 1); não interpretar ou completar o conteúdo do texto. As áreas ilegíveis são marcadas com [?]; Os números e datas não são alterados, são verificados com a imagem.
4. O que se deve perguntar à inteligência artificial quando se trata de ler uma palavra cuja vogal não está escrita num texto otomano?
- A) Proporcionar uma leitura única e precisa, agilizando assim o trabalho
- B) Selecionar a palavra que tornará o significado mais fluente e preencher as lacunas
- C) Completar as partes ilegíveis a partir de seus próprios conhecimentos gerais.
- D) Oferecer possíveis alternativas de leitura e marcar áreas ambíguas em vez de impor uma leitura definitiva ✔
Explicação: No turco otomano, as vogais curtas geralmente não são escritas; Uma única diferença de vogal/letra (abul e kabul, wali e vali) muda completamente o significado. Portanto, em vez de impor uma leitura definitiva, devem-se perguntar possíveis alternativas, preservar as áreas ilegíveis e deixar a decisão final ao paleógrafo.
5. Qual é a maneira mais eficaz de prevenir alucinações quando a IA produz um rascunho de metadados (registro de catálogo)?
- A) Conceda explicitamente permissão para deixar esse campo em branco caso não esteja incluído no documento ✔
- B) Solicitar que todos os campos sejam preenchidos e não deixados incompletos.
- C) Estimar uma data com base no conteúdo de documentos sem data
- D) Permitir que a inteligência artificial gere o código de referência
Descrição: A pressão de preenchimento força a IA a redigir o documento adivinhando a data ou o criador que não está no documento. A proteção mais forte contra isso é conceder explicitamente permissão para deixar o campo em branco se não estiver no documento; Além disso, os termos do tópico são mapeados para vocabulário controlado.
6. Como deve ser posicionado um resumo documental produzido por inteligência artificial na pesquisa histórica?
- A) Como evidência confiável que pode ser citada diretamente
- B) Como um mapa de descoberta que direciona você para o documento real; As provas são retiradas do documento original ✔
- C) Como recurso adequado que pode substituir o próprio documento
- D) Como um texto que pode ser utilizado no estudo sem nunca retornar ao documento
Descrição: O resumo é um mapa de descoberta, não uma prova. Há algo assim neste documento, diz vá e olhe; Não diz exatamente o que diz no documento. Se um evento, citação ou dado for incluído no estudo, ele deverá ser extraído literalmente do documento original.
7. Qual a forma correta de evitar anacronismos ao traduzir um documento histórico para publicação?
- A) Substituindo todos os termos do período pelo equivalente mais próximo de hoje
- B) Para transmitir o texto o mais fluente e moderno possível
- C) Deixe os títulos dos períodos e nomes das instituições exclusivos e adicione uma explicação ✔
- D) Adaptação de nomes próprios ao seu uso atual
Explicação: Anacronismo é a transferência errada de elementos de um período para outro. A mudança de títulos de época, nomes de instituições e nomes pessoais para os termos atuais transporta o leitor para um mundo que não pertence ao período. A maneira correta é manter o prazo do período e adicionar uma explicação ao lado.
8. Como ter certeza de que uma referência de arquivo (nome do fundo, número do arquivo) fornecida pela inteligência artificial é real?
- A) Confiar na referência porque seu formato parece correto
- B) Perguntando novamente à IA se a referência está correta
- C) Aceitar a referência como verdadeira porque é convincente e detalhada
- D) Encontrando e verificando pessoalmente a referência no catálogo do arquivo ou em fonte confiável ✔
Descrição: A inteligência artificial pode produzir referências que são perfeitas na forma, mas que na verdade não existem; Uma referência fictícia tem a mesma forma que uma referência real. A única maneira de provar que existe uma referência é encontrá-la no local onde a fonte original está localizada (catálogo de arquivo, biblioteca).
9. Como deve ser avaliado um padrão encontrado ao realizar análise de padrões (NER, rede, linha do tempo) com inteligência artificial?
- A) Como hipótese que precisa ser verificada no documento; ponto de partida, não resultado ✔
- B) Como conclusão definitiva que não requer verificação
- C) É um fato objetivo indiscutível porque é numérico.
- D) Como resultado que pode ser colocado em estudo direto porque encontrou inteligência artificial
Explicação: Todo padrão é uma hipótese, não uma evidência. As entidades devem estar vinculadas à fonte, diferentes grafias (da mesma pessoa/local) devem ser normalizadas com aprovação humana, os números devem ser questionados quanto a dados faltantes e viés de amostragem, e eventos sem data não devem ser cronologizados.
10. Por que a seção de história biográfica/institucional em um auxílio para busca requer atenção especial?
- A) Esta seção não é importante e pode ser publicada sem verificação
- B) Como a inteligência artificial pode adicionar eventos fabricados, datas e títulos falsos nesta seção, ela deve confiar apenas em fontes verificadas ✔
- C) A inteligência artificial pode ser usada com segurança porque não comete erros ao escrever a história.
- D) Somente pesquisadores preenchem esta seção, o arquivista não está interessado
Descrição: A seção de história é onde a alucinação aparece com mais frequência: a IA pode inserir eventos inexistentes, datas falsas e títulos inventados enquanto escreve um texto fluente a partir de informações gerais sobre uma pessoa ou instituição. Esta seção deve ser baseada apenas em fontes verificadas.
11. Como a inteligência artificial deve responder à questão factual de um pesquisador em um serviço de referência (consulta)?
- A) A resposta à pergunta deve ser dada diretamente e como um fato definitivo.
- B) Deve produzir uma data ou nome confiável e transmiti-lo ao pesquisador.
- C) Em vez de fornecer os fatos diretamente, deve direcionar o pesquisador à coleção e fonte relevantes ✔
- D) Deve fornecer uma resposta completa para que o pesquisador não precise ir à fonte.
Explicação: No serviço de referência, a inteligência artificial não deve dar uma resposta direta aos fatos, mas deve direcionar o pesquisador à fonte. Porque a resposta factual direta dada pela inteligência artificial pode ser fabricada e o pesquisador pode confundi-la com a fonte. Em vez de dizer “A resposta é esta”, deveria dizer “Veja estes documentos nesta coleção”.
12. Quais operações são aceitáveis e questionáveis ao processar uma imagem de documento danificada com inteligência artificial?
- A) Todos os tipos de operações são gratuitas, inclusive o preenchimento das partes faltantes.
- B) Nenhuma ação deve ser tomada, a imagem nunca deve ser tocada
- C) Preencher as seções que faltam é a ação mais valiosa porque completa o documento.
- D) Manipulações de legibilidade, como contraste/ruído, são aceitáveis; É inconveniente preencher as partes que faltam com suposições ✔
Explicação: Os processos que melhoram a legibilidade (contraste, iluminação, redução de ruído) são aceitáveis porque não alteram o conteúdo; Porém, preencher partes faltantes/ilegíveis com suposições é o risco de produzir o que não está no documento, ou seja, falsificação histórica. O original é preservado, as transações são registradas.
13. O que precisa ser feito antes de processar um documento de arquivo que contenha dados pessoais sensíveis?
- A) Verificação de privacidade e anonimato, se necessário, ou usando uma ferramenta fechada/aprovada ✔
- B) Carregar o documento diretamente em um veículo público sem sequer pensar nisso
- C) Ignorar preocupações com privacidade em prol da eficiência
- D) Superação de restrições de acesso por razões de eficiência
Divulgação: O upload de documentos contendo dados confidenciais que identificam pessoas vivas (saúde, religião, etnia, endereço) para ferramentas públicas baseadas na nuvem pode ser uma grave violação de privacidade. A triagem de privacidade deve ser feita primeiro; o anonimato ou uma ferramenta fechada/aprovada deve ser usada, se necessário.
14. Qual é o objetivo principal de um ponto de verificação humano em um projeto de arquivo de ponta a ponta?
- A) Retardando o trabalho da inteligência artificial e atrasando o projeto
- B) Para evitar que um erro (data/nome incorreto) em uma etapa seja encadeado a todas as etapas subsequentes ✔
- C) Aumentar o trabalho humano e abandonar completamente a automação
- D) Garantir que a inteligência artificial tenha a última palavra
Descrição: Um ponto de verificação humano em cada estágio garante que a saída da IA seja verificada antes de passar para o próximo estágio. Sem isso, um erro no primeiro estágio (uma data mal interpretada) se propagaria pela cadeia através do catálogo, padrão e guia. A verificação antecipada garante que o erro seja corrigido em um só lugar.
15. O que exigem transparência e autenticidade na utilização da inteligência artificial nas ciências humanas e sociais?
- A) Manter em segredo o uso da inteligência artificial, garantindo que ninguém saiba
- B) Apresentar cada texto produzido pela inteligência artificial como sua própria ideia original
- C) Declarar honestamente o uso de inteligência artificial e não apresentar seu resultado como trabalho original ✔
- D) Compartilhando apenas os resultados sem explicar os métodos
Descrição: A transparência inclui o registo de que uma transcrição, metadados ou tradução foi produzida com a ajuda de inteligência artificial; A originalidade exige não apresentar um comentário produzido pela inteligência artificial como uma ideia original. Isto é essencial para a verificação por pesquisadores subsequentes e para a integridade acadêmica.