Unidade 8 / 12

Análise de conteúdo e descoberta de padrões

Ganhos:

  • Capacidade de extrair padrões de grandes conjuntos de texto usando técnicas como NER, extração de relacionamento, linha do tempo e análise de rede
  • Ser capaz de ver o padrão como uma hipótese e não como uma evidência, ligando as entidades à fonte e normalizando-as com a aprovação humana
  • Capacidade de compreender como os números podem ser enganosos devido à falta de dados e ao viés de amostragem, e de evitar relações e cronologias inventadas.

A pesquisa histórica não envolve apenas a leitura de documentos individuais; frequentemente procurando padrões em grandes conjuntos de documentos. Em que contextos um determinado nome aparece ao longo dos anos? Quais pessoas estão associadas a um assentamento? Como um tópico muda com o tempo? Quem está se correspondendo com quem? Tais questões exigem a análise não de um único documento, mas de centenas de documentos coletivamente. Isto é frequentemente chamado de humanidades digitais – a aplicação de métodos computacionais a áreas como história e literatura.

A IA é poderosa na extração de informações estruturadas de grandes conjuntos de texto. Nesta unidade você aprenderá NER (reconhecimento de entidade nomeada), extração de padrões e relacionamentos, lógica de modelagem de tópicos e criação de linha do tempo; mas também discutiremos a armadilha mais perigosa dessas técnicas – a IA apresentando-se como tendo “encontrado” um padrão que não existe.

Técnicas básicas

  • NER (Reconhecimento de Entidade Nomeada): Extração automática de entidades como pessoa, local, instituição, data do texto. Produz uma lista como "Todos os nomes de lugares mencionados nestes 500 documentos" em minutos.
  • Inferência de relacionamento: Marcação de vínculos entre entidades (“Pessoa X no lugar Y”, “A corresponde a B”).
  • Modelagem de tópicos: encontrar estatisticamente grupos de tópicos recorrentes em um grande conjunto de texto. Mostra quais temas estão concentrados em qual período.
  • Inferência de linha do tempo: organização de eventos datados em documentos em ordem cronológica.
  • Análise de rede: Visualizando as relações interpessoais/institucionais como uma rede (quem é o centro, quem é o ponto de conexão).

O objetivo comum de tudo isso é revelar estruturas que não aparecem em um único documento, mas que aparecem em toda a coleção. Essas técnicas tornam visíveis padrões que nunca seriam visíveis apenas através da leitura. Mas cada um deles é um “sinal”, não uma “evidência”; É fundamental verificar o que se encontra no documento original.

Um conceito frequentemente utilizado neste campo é a distinção entre leitura atenta (ler um texto em profundidade, linha a linha) e leitura à distância (olhar centenas/milhares de textos em conjunto, estatisticamente). A IA torna possível a leitura remota: você vê padrões em um corpus grande o suficiente para durar uma única vida humana. Mas quando a leitura à distância aponta para um padrão, é necessário voltar à leitura atenta, ou seja, ao documento original, para lhe dar sentido. Os dois métodos não são intercambiáveis; Um mostra o padrão, o outro dá o seu significado. A pesquisa mais robusta usa ambos juntos.

Dica: Use a análise de padrões como gerador de hipóteses: “A IA detectou um padrão aqui, é real?” Em seguida, verifique esse padrão nos documentos, um por um. O padrão é o ponto de partida da sua pesquisa, não o resultado.

Fluxo de trabalho: passo a passo

1. Esclareça a questão. “Quais pessoas aparecem juntas com mais frequência nesta coleção?” Uma pergunta de padrão claro como.

2. Prepare e rotule os dados. Organize o texto com referências de origem para que quaisquer recursos encontrados possam ser vinculados ao documento.

3. A entidade/padrão aparece. Gere NER, relacionamento ou cronograma com IA.

4. Normalize. Combine diferentes grafias da mesma pessoa/lugar (“Istambul / Istambul / Kostantiniyye” o mesmo lugar?). Esta etapa é crítica; Se for omitido, o padrão desmoronará.

5. Verifique no documento. Verifique os documentos reais em busca de padrões significativos sinalizados. Certifique-se de que a IA não adicione um link inventado.

6. Comente. O que o padrão significa é o julgamento do historiador; A IA apenas marca o padrão.

Armadilha de números e estatísticas

A análise de padrões muitas vezes produz números: “o nome X ocorre 47 vezes”, “esse tema está presente em 30% dos documentos”. Esses números parecem objetivos, mas podem ser enganosos:

  • Dados em falta: Se a recolha já estiver incompleta (documentos foram perdidos, um grupo nunca foi registado), o número reflecte os documentos sobreviventes e não a realidade.
  • Erro de normalização: Se a mesma pessoa for escrita de forma diferente e contada separadamente, o número estará incorreto.
  • Perda de contexto: “ocorre 47 vezes” não diz nada; A forma como é passado (positivo/negativo, sujeito/objeto) é importante.

saída padrão

significado aparente

risco real

"X ocorre 47 vezes"

pessoa importante

Coleção incompleta, variação ortográfica

"Tema 30%"

tópico dominante

viés de amostragem

"AB frequentemente juntos"

relacionamento íntimo

Coincidência, falta de contexto

"linha do tempo"

cronologia exata

Documentos não datados, pedido fabricado

três mini cases

Caso 1 — A análise da rede revelou um intermediário oculto. Um pesquisador examinou uma coleção de correspondência de 800 cartas. Com a IA, foi determinado quem escreveu para quem e uma rede foi criada. A rede mostrou que uma pessoa aparentemente insignificante à primeira vista era na verdade o principal ponto de contato entre os dois grupos. O pesquisador concentrou-se nas cartas dessa pessoa e chegou a uma nova descoberta. Mas primeiro verifiquei todos os links nos documentos.

Caso 2 — Erro de normalização corrompeu o número. Um aluno pediu que contassem o número de vezes que um lugar aparecia nos documentos. Como a IA contou separadamente três grafias diferentes do mesmo lugar, o número acabou sendo um terço do número real. Quando as grafias foram combinadas, o lugar estava, na verdade, na terceira posição de ocorrência mais frequente. Lição: sem normalização o número não é confiável.

Caso 3 — Cronograma inventado. Um pesquisador criou uma linha do tempo a partir de documentos sem data. A IA organizou os eventos desconhecidos em uma ordem “lógica” e apresentou uma cronologia precisa. Porém, essa sequência não estava nos documentos, a IA a inventou. Lição: a linha do tempo é construída apenas a partir de eventos que possuem data no documento; o resto permanece "sem data".

Quatro modelos copiáveis

1) NER (inferência de entidade):

As pessoas, locais, instituições e datas mencionadas nos documentos abaixo aparecem como listas SEPARADAS. Indicar em que documento (referência) cada entidade é mencionada. Tome apenas o que está CLARAMENTE declarado no texto; adicione por palpite. Marque [?] se não tiver certeza da pronúncia. Documentos: [aqui]

2) Normalização da entidade:

Na lista de entidades abaixo, agrupe diferentes grafias que possam ser a mesma pessoa/lugar (por exemplo, "Istambul / Kostantiniyye"). Sugira o possível formato comum para cada grupo, MAS não imponha a combinação exata; Adicione a nota "talvez o mesmo, deixe as pessoas verificarem". Deixe como está se não tiver certeza. Lista: [aqui]

3) Esboço de relacionamento/rede:

Extraia os links "quem é parente de quem" do seguinte conjunto de correspondência/documentos. Para cada link, indique em qual documento (referência) ele se baseia. FEZ uma relação que não está CLARAMENTE no documento. Marque links ambíguos [indistintos]. Documentação: [aqui]

4) Cronograma datado:

Liste em ordem cronológica apenas os eventos CLARAMENTE declarados nos seguintes documentos; Vincule cada evento à sua fonte. Liste os eventos com datas incertas separadamente sob o título “sem data”, NÃO os coloque em ordem. NÃO invente a data estimada. Documentação: [aqui]

Alerta fraco / Alerta forte

Fraco:

Analise esses documentos e extraia padrões, relacionamentos e cronogramas importantes.

“Extrair padrões importantes” leva a IA a inventar conexões inexistentes e cronologias precisas, apresentando números sem normalização.

Forte:

Extrai as entidades pessoa/local/instituição dos documentos a seguir conectando cada uma à referência do documento. Marque grafias diferentes que podem ser iguais a "podem ser mescladas", mas não mescladas. Relacionamentos que não estão claramente indicados no documento e eventos com datas incertas NÃO FALSÃO; mantenha aqueles sem datas separados. Documentação: [aqui]

A diferença: a atribuição à fonte, deixar a normalização para os humanos, a proibição de laços/histórias fictícias e a separação de eventos não datados tornam o padrão defensável.

Erros comuns

  • Confundindo o padrão com evidência. O padrão é a hipótese; é verificado no documento.
  • Ignorando a normalização. Diferentes grafias da mesma entidade distorcem o número e a rede.
  • Confiança cega nos números. A coleta incompleta e o viés de amostragem tornam o número enganoso.
  • Cronograma inventado. Eventos sem data não estão incluídos na cronologia.
  • Ignorando o contexto. Não é “quantas vezes foi aprovado”, mas “como foi aprovado” que é importante.

Resumindo

A análise de conteúdo e a descoberta de padrões são um campo poderoso onde a IA torna visíveis estruturas que não seriam visíveis apenas através da leitura: extração de entidades, redes de relacionamento, clusters de tópicos, cronogramas. Mas todo padrão é uma hipótese, não uma evidência. Vincule ativos à fonte, normalize cuidadosamente e com validação humana, consulte números em busca de dados ausentes e distorções, evite relações e cronologias inventadas. A IA marca o padrão; O que isso significa e se é verdade é o julgamento do historiador.

Tarefa de aplicativo

Colete pelo menos 15 documentos (com referências). Extraia entidades de pessoas e locais com o modelo "NER". Em seguida, agrupe as diferentes grafias com "normalização de entidade" e verifique você mesmo os grupos. Por fim, execute o modelo de “linha do tempo datada” e veja quantos eventos permanecem “sem data”. Compare quantos links ou cronologias inventadas a IA produziria com uma solicitação inadequada.

lista de verificação

  • [] Eu defini claramente minha questão padrão.
  • [ ] Tenho cada entidade vinculada à referência do documento.
  • [] Normalizei a digitação de entidade e combinei-a com a aprovação humana.
  • [] Eu questionei os números por falta de dados e preconceitos.
  • [ ] Não coloquei os acontecimentos sem data em cronologia, guardei-os separadamente.