Ganhos:
- Capacidade de manter a integridade dos dados enquanto digitaliza e padroniza unidades de registro, como contexto/locus, estratigrafia e Matriz de Harris com inteligência artificial
- Capacidade de proteger dados brutos e manter cada transformação rastreável contra o risco de a inteligência artificial completar dados faltantes e fazer alterações silenciosas
- Entenda por que o dicionário controlado, os metadados e os princípios abertos/FAIR são essenciais para a usabilidade futura dos dados.
O valor científico de uma escavação não reside nas descobertas de ouro que dela emergem, mas na qualidade dos seus registos. Uma descoberta que não esteja bem documentada é quase irrelevante para a ciência; Porque é um objeto que não se sabe onde, em que camada e com que se encontra, é simplesmente um objeto lindo. Nesta unidade, veremos o registro de escavação (a transcrição sistemática e o banco de dados de cada contexto, descoberta e observação) e como a IA pode acelerar a entrada, organização e padronização de dados, mas por que a responsabilidade pela integridade dos dados permanece com os humanos.
Princípio básico: a IA ajuda a organizar registros dispersos, padronizá-los e encontrar inconsistências; Mas quais dados são precisos, se um registro reflete a verdade e a integridade dos dados são responsabilidades humanas. A IA corrige a forma dos dados, mas não garante a sua precisão.
Unidades básicas do registro arqueológico
Contexto/local. Cada escavação divide o local em unidades de contexto (contexto/locus – um depósito, camada, poço ou parede individual; a menor unidade de significado da escavação). Cada contexto recebe um número único e todas as descobertas são associadas a esse número.
Estratigrafia e Matriz de Harris. A estratigrafia (a relação antes-depois das camadas umas em relação às outras) é a base da datação relativa. A Matriz de Harris (um diagrama que mostra a ordenação dos contextos entre si) visualiza essas relações. A IA ajuda a detectar relações estratigráficas inconsistentes (por exemplo, um erro cíclico “A está acima e abaixo de B”).
Encontre o inventário. Cada descoberta; O contexto é registrado com número, tipo, tamanho, material, estado e fotografia.
Padrões de dados. Padrões comuns são usados para tornar os registros compartilháveis e comparáveis. CIDOC-CRM (uma estrutura/ontologia conceptual internacional desenvolvida para descrever dados do património cultural) permite que dados de diferentes instituições comuniquem entre si. É utilizado um dicionário controlado de termos (uma lista aprovada que garante que todos usam o mesmo termo para o mesmo conceito).
Dica: Use IA para “organizar e auditar” dados, não para “interpretá-los”. “Quais números de contexto são contraditórios nesses registros?” É uma boa pergunta; “A que período pertence este contexto?” É uma decisão especializada. Onde a IA é mais forte é na verificação de consistência.
Funções da IA no registro e no banco de dados
- Digitalização. Cadernos de escavação escritos à mão, cartões de inventário e desenhos antigos são importados para o banco de dados com reconhecimento de texto alimentado por IA (link para HTR na unidade 6).
- Padronização. Diferentes grafias ("bizâncio", "Bizâncio", "byz.") são mapeadas no dicionário controlado; datas e medidas são uniformizadas.
- Verificação de consistência. Erros como número de contexto ausente, estratigrafia contraditória, uso do mesmo número em duas descobertas diferentes são marcados.
- Consulta e resumo. Consultas como “Todas as descobertas de vidro no seguinte contexto” e tabelas de resumo são geradas rapidamente.
Cuidado: Ao padronizar, a IA pode modificar os dados silenciosamente enquanto tenta “consertá-los”; por exemplo, ele pode arredondar uma medida para um valor “razoável” ou preencher uma leitura incerta com sua própria estimativa. Toda alteração automática deve ser rastreável e o registro original deve ser preservado. Os dados brutos nunca são substituídos.
três mini cases
Caso 1 — A digitalização salvou o arquivo. Um museu armazenava 40 anos de cartões de inventário manuscritos (cerca de 22.000 cartões) sob risco de serem perdidos. O reconhecimento e a padronização de texto com tecnologia de IA importaram os cartões para um banco de dados pesquisável; Cada cartão foi verificado com base em amostras por um examinador humano, e as áreas ilegíveis foram marcadas como “não claras”.
Caso 2 — Verificação de inconsistência encontrou erros. Uma equipe de escavação fez com que a IA auditasse o banco de dados no final da temporada; YZ marcou que três descobertas tinham o mesmo número de contexto, mas informações de camada conflitantes. A revisão revelou um erro de entrada de dados; se não fosse corrigido, teria distorcido a interpretação estratigráfica.
Caso 3 — Alteração silenciosa detectada. Ao padronizar as medições, um assistente percebeu que a IA estava interpretando alguns valores “0” como “zero” em vez de “ausentes”; isso distorceu o comprimento das peças quebradas. O processo foi reconstruído para preservar os dados originais, mas manter as alterações em uma coluna separada.
Quatro modelos copiáveis
1) Padronização (dicionário controlado):
Sua função: assistente de organização de dados. Mapeie os valores de [campo:material/período/tipo] nos seguintes registros para o seguinte dicionário controlado: [listadedicionário]. ALTERAR valores que não possuem equivalentes no dicionário; Marque como "sem correspondência". Relate cada alteração como um par original-novo; exclusão de dados brutos.
2) Verificação de consistência:
Encontre inconsistências nos seguintes registros de escavação: números de contexto repetitivos, campos obrigatórios ausentes, relações estratigráficas conflitantes, datas/medições estranhas. Liste cada problema com o número de registro e deixe que EU resolva; não mude você mesmo.
3) Controle lógico Harris Matrix:
Abaixo estão as relações estratigráficas entre contextos (A acima/abaixo de B). Existe uma contradição lógica (loop, relacionamento bidirecional)? Mostre quais contextos, se houver. Não comente; apenas verifique a consistência lógica.
4) Consulta e tabela resumo:
O seguinte extrato do dump do banco de dados abaixo: [por exemplo. encontrar distribuição de tipos por contexto]. Forneça o resultado como uma tabela, especificando de quais registros cada linha é derivada. NÃO ADICIONE nenhum valor que não exista nos dados; Se estiver vazio, escreva "sem dados".
Alerta fraco / Alerta forte
Alerta fraco:
Corrija os dados da escavação e preencha os itens faltantes.
“Preencher as lacunas” permite que a IA ajuste os dados; O resultado é uma base de dados pouco fiável onde se misturam factos e ficção.
Alerta poderoso:
Marque APENAS inconsistências formais (ortografia, formato de data, ID duplicado) nos dados de escavação abaixo. COMPLETE valores ausentes; Deixe como "incompleto". Liste cada alteração proposta junto com a original; Eu darei a aprovação. Alterando dados brutos.
Diferença: o primeiro corrompe os dados silenciosamente; O segundo controla e deixa a decisão para o humano.
Bom modelo de dados: campos, relacionamentos e metadados
Um banco de dados arqueológico não é uma tabela arbitrária, mas um modelo de dados bem pensado (um modelo de quais tabelas, quais campos e em quais relacionamentos os dados serão organizados). O princípio básico é que tudo depende do contexto: achados para o contexto, contextos entre si (estratigrafia) e para o campo. Cada registro carrega uma identidade (ID) única e os relacionamentos são estabelecidos por meio dessas identidades; Uma descoberta refere-se a um único contexto; um contexto pode conter muitas descobertas.
Tão importantes quanto a gravação são os metadados (dados sobre os próprios dados: quem os gravou, quando, por que método, qual versão). Um registo que não se sabe por quem, quando e com que confiança foi introduzido não pode ser questionado no futuro. A IA é útil para verificar o preenchimento consistente dos campos de metadados e sinalizar metadados ausentes.
Outro princípio crítico é um formato aberto e sustentável. Em vez de bloquear os dados em software proprietário e fechado, mantê-los próximos aos padrões abertos (tabelas baseadas em texto, esquemas documentados) garante que os dados possam ser lidos décadas depois. Os dados arqueológicos são produzidos não para uma única publicação, mas para as gerações futuras; É por isso que os princípios FAIR (Encontrar, Acessível, Interoperável e Reutilizável de dados) tornaram-se cada vez mais padrão. A IA é útil para rotular seus dados de acordo com esses princípios e encontrar deficiências; Mas cabe a você decidir quais dados permanecerão abertos e quais permanecerão sensíveis (confidenciais).
Dica: Ao configurar seu banco de dados, pergunte-se: "Alguém que não sabe disso pode abri-lo e entendê-lo em 10 anos?" perguntar. Explique suas abreviações em um glossário, preencha os campos de metadados e faça backup dos dados brutos em formato aberto.
Tabela de tarefas de registro/banco de dados
Missão
Papel da IA
decisão humana
regra de proteção
digitalização
reconhecimento de texto
Confirmação de leitura vaga
A varredura bruta é armazenada
padronização
Mapear para dicionário
Decisão de valor incompatível
O original está preservado
Consistência
Marcação de contradição
correção
A mudança é rastreada
estratigrafia
Controle lógico
Comentário
Aprovação de especialista matricial
Consulta/resumo
Produção de mesa
Comente, escolha
Fidelidade aos dados
Erros comuns
- Completando dados faltantes. IA inventa; Os que faltam devem permanecer “incompletos”.
- Substituindo os dados brutos. O original é sempre preservado; as alterações são mantidas separadas.
- Não percebendo mudanças silenciosas. Cada conversão automática deve ser relatada e auditada.
- Ignorando o padrão. Sem um dicionário controlado e um modelo comum, os dados não podem ser partilhados.
- Fazer com que a IA realize a interpretação estratigráfica. A IA encontra contradições lógicas; O comentário é para o especialista.
Em resumo
IA em registro e banco de dados de escavação; Proporciona grande rapidez nos trabalhos de digitalização, padronização, verificação de consistência e consulta. Mas a integridade dos dados é sagrada: nenhuma parte faltante é deixada intacta, os dados brutos são preservados, cada alteração é rastreada e a interpretação estratigráfica pertence ao especialista. Bons registros são o legado mais valioso que a escavação deixa para o futuro.
Tarefa de aplicativo
Preparar uma pequena tabela de dados de escavação de amostra (10-20 registros); colocou deliberadamente algumas inconsistências lá (ID duplicado, data distorcida, camada conflitante). Faça com que a IA os encontre com os padrões de “verificação de consistência” e “verificação lógica da matriz Harris”; em seguida, escreva um dicionário controlado e mapeie o campo de material para o modelo "Padronização" e certifique-se de preservar os dados brutos.
lista de verificação
- [] Armazenei os dados brutos separadamente, sem modificações.
- [ ] Não fiz a IA completar as partes que faltavam; Deixei como "incompleto".
- [] Verifiquei cada alteração automática com o original.
- [] Usei dicionário controlado e padrão de dados.
- [ ] Fiz a interpretação estratigráfica com base na opinião de especialistas.