Unidade 8 / 11

Análise de Dados e Validação Estatística

Ganhos:

  • Capacidade de escolher o teste adequado ao tipo e distribuição dos dados e verificar os pressupostos (normalidade, variância)
  • Capacidade de compreender o verdadeiro significado do valor p e relatar os resultados com tamanho do efeito e intervalo de confiança
  • Proteção contra p-hacking com separação de verificação de descoberta, correção de múltiplas comparações e relatórios completos

O experimento acabou, os dados chegaram. Agora estamos na fase mais crítica e mais equivocada: analisar os dados corretamente e interpretar os resultados com honestidade. Os dados biológicos são frequentemente ruidosos, instáveis ​​e multivariados. A seleção incorreta de testes, violações implícitas de suposições e p-hacking inconsciente (tentar uma análise até obter o resultado desejado) são as principais causas da crise de reprodutibilidade na literatura biológica publicada. A IA ajuda você a escolher o teste certo, verificar suposições e escrever código de análise; mas a integridade estatística é de sua responsabilidade.

Nesta unidade, abordaremos testes estatísticos comuns, verificações de suposições e maneiras de se proteger contra p-hacking.

Escolhendo o teste certo

A escolha do teste depende do tipo e distribuição dos dados. A inteligência artificial irá ajudá-lo a fazer essa escolha, mas você não deve aplicá-la cegamente:

  • Dois grupos, dados contínuos, distribuição normal: teste t independente.
  • Dois grupos, não normais: Mann-Whitney U (não paramétrico: não requer suposição de distribuição).
  • Mais de dois grupos: ANOVA (análise de variância) + teste post-hoc.
  • Dados categóricos (contagens): teste qui-quadrado ou exato de Fisher.
  • Relacionamento: Correlação (Pearson/Spearman) ou regressão.
Dica: visualize os dados antes de selecionar o teste. Um histograma ou boxplot mostra instantaneamente a normalidade e os valores discrepantes que um teste t exige. “Gráfico primeiro, teste depois” é um bom hábito.

Verificando suposições

Todo teste tem suposições ocultas. O teste t assume distribuição normal e igualdade de variâncias; Se estes forem violados, o resultado será enganoso. A IA escreve código que verifica estas suposições:

Função: Você é um assistente de bioestatística. Tarefa: Escreva um código que verifique as suposições de um teste t antes de comparar dois grupos de dados: normalidade (Shapiro-Wilk), igualdade de variância (Levene). Se a suposição for violada, diga-me qual teste alternativo devo seguir. Forneça código Python com comentários.

O código redireciona você para Mann-Whitney se a normalidade for quebrada. Esse fluxo “verifique primeiro, decida depois” evita que você execute o teste errado.

p-hacking e como se proteger

p-hacking é analisar dados de diferentes maneiras até p<0,05: tentar diferentes testes, descartar seletivamente outliers, adicionar/remover grupos, relatar o que é "significativo" entre um grande número de variáveis. Esta é a principal fonte de descobertas falsas. Formas de proteção:

  1. Fixe o plano de análise antecipadamente (Unidade 7).
  2. Relate todos os testes, não apenas aqueles que mostram significância.
  3. Corrigir comparação múltipla (FDR/Bonferroni).
  4. Forneça o tamanho do efeito e o intervalo de confiança próximo ao valor p.
  5. Descoberta e validação separadas: teste o que você encontra no conjunto de descobertas em um conjunto independente.

Passo a passo: uma análise honesta

  1. Visualize os dados (dispersão, outlier).
  2. Verifique as suposições.
  3. Execute o teste que você predeterminou.
  4. Corrigir comparação múltipla.
  5. Tamanho do efeito do relatório + intervalo de confiança.
  6. Escreva as limitações claramente.

Modelos de prompt copiáveis

Visualize o rendimento: plote histogramas e boxplots para cada grupo, sinalize valores discrepantes. Em seguida, interprete as colunas normality.Data: [nome]. Forneça código Python com comentários.

Quero comparar meus dois grupos. Características dos dados: [tipo, N, distribuição].Qual teste é apropriado? Verifique as suposições, execute o teste, relate o tamanho do efeito E o intervalo de confiança de 95% COM o valor p.

Testei 15 genes diferentes em minha análise. Forneça o código que aplica a correção de Bonferroni e Benjamini-Hochberg e explique a diferença entre os dois métodos.

Alerta fraco / Alerta forte

Fraco: "Esses dois grupos são diferentes, faça um teste t."

Forte: "Eu tenho dois grupos (controle n=18, tratamento n=20), a variável dependente é a atividade enzimática (contínua). Primeiro visualize a distribuição e teste a normalidade com Shapiro-Wilk. Se normal, aplique o teste t, se não, Mann-Whitney. Relate o resultado com valor p, tamanho do efeito (d de Cohen ou classificação biserial) e intervalo de confiança de 95%. Explique qual teste você escolheu e por quê."

Diferença: o prompt poderoso possui tipo de dados, números de amostra, verificação de suposições e solicitação de relatório completo. O modelo segue o caminho certo em vez de aplicar cegamente o teste t.

três mini cases

Caso 1 — Teste errado: Um aluno aplicou um teste t a dados significativamente distorcidos (não normais) e encontrou p=0,048. Quando a inteligência artificial adicionou a verificação de normalidade, os dados não saíram normais; Com Mann-Whitney, p=0,11. O resultado real não teve sentido. Lição: testar sem verificar a suposição é enganoso.

Caso 2 — Descarte seletivo de valores discrepantes: Um pesquisador excluiu dois pontos “atípicos” para tornar o resultado significativo. O modelo enfatizou que o descarte de valores discrepantes deveria ser baseado em uma regra predefinida (por exemplo, método IQR) e relatado; exclusão arbitrária é p-hacking. Lição: defina a regra de outlier de antemão.

Caso 3 — Recuperação do tamanho do efeito: Um estudo teve p=0,001 mas o tamanho do efeito (d=0,1) foi quase zero; a grande amostra mostrou que a diferença insignificante era significativa. Quando a inteligência artificial relatou o tamanho do efeito, descobriu-se que a descoberta não tinha valor prático. Lição: Só porque p é pequeno não importa.

gráfico de comparação

Estado

abordagem correta

Para ser evitado

dados anormais

Teste não paramétrico

Teste t forçado

multiteste

Aplicar correção

Bruto p<0,05

atípico

Regra predefinida

exclusão arbitrária

resultado significativo

Tamanho do efeito + IC

apenas p

descoberta de descoberta

Validar em conjunto independente

Finalize em um conjunto

Erros comuns

  • Teste de hipótese não controlado: Significância espúria com testes falsos.
  • p-hacking: Tentar análise até dar o resultado desejado.
  • Relatando apenas o valor p: omitindo o tamanho do efeito e o intervalo de confiança.
  • Não corrigindo comparações múltiplas: falsos positivos.
  • Salto de causalidade: Inferindo causalidade a partir da correlação.
Cuidado: a IA não "produzirá" o resultado desejado, mas escreverá com prazer o código para o teste errado se for enganada. Você tem integridade estatística: relata todos os ensaios, planeja a análise com antecedência e nunca perde o tamanho do efeito. Trabalhe com um bioestatístico para análises que levem à publicação.

verdadeiro significado do valor p

O conceito mais incompreendido em biologia é o valor p. O valor p não é a “probabilidade da hipótese ser verdadeira”; É “a probabilidade de ver uma diferença tão grande ou mais extrema do que a que você observa, quando na realidade não há diferença”. Essa distinção sutil, mas crítica, é fundamental para não exagerar os resultados. p=0,03 não significa “o efeito é 97% real”. Ao fazer com que a IA interprete um resultado, verifique se ela utiliza esta definição corretamente; O modelo às vezes pode repetir interpretações errôneas comuns.

O intervalo de confiança (CI) é muitas vezes mais informativo do que o valor p porque mostra a magnitude e a incerteza do efeito em conjunto. “Diferença de 2,4 vezes (IC 95%: 1,8-3,1)” diz muito mais do que “p<0,05”: tanto a direção do efeito, sua magnitude e a precisão com que foi medido. Destaque GA em seus relatórios.

Use a definição correta do valor p ao interpretar meu resultado. Evite afirmações incorretas como “probabilidade do efeito ser verdadeiro”. Em vez disso, explique o significado prático em termos do tamanho do efeito e do intervalo de confiança de 95%. Resultado: [dados]

Correlação, causalidade e dados observacionais

A maioria dos dados biológicos são observacionais: você vê algo mudando com outra coisa, mas não consegue ver o que causa o quê. A frase “a expressão do gene X se correlaciona com a doença” não indica que X causa doença; A doença pode estar aumentando X, ou um terceiro fator pode estar afetando ambos. A causalidade só pode ser estabelecida através da experimentação intervencionista (alterando X e medindo o resultado). A IA pode, sem saber, usar linguagem causal (“causa”, “leva a”) em seus textos; revise cada frase de conclusão a partir desta perspectiva, expressando resultados observacionais em linguagem correlacional (“correlacionado”, “variando junto”).

Separando dados emparelhados e independentes

A distinção mais frequentemente negligenciada na seleção de testes é se as amostras são independentes ou pareadas. Se você estiver fazendo medições antes e depois do mesmo indivíduo (por exemplo, valores sanguíneos dos mesmos pacientes antes e depois do tratamento), essas medições não são independentes; É necessário um teste pareado. Usar o teste t independente de duas amostras aqui descarta informações de correspondência nos dados e reduz o poder; Pode até reverter o resultado. A regra é simples: “Essas duas medidas vêm da mesma unidade biológica?” Se a resposta for sim, utiliza-se o teste pareado (teste t pareado ou teste dos postos sinalizados de Wilcoxon); se não, utiliza-se o teste independente. Ao solicitar testes de inteligência artificial, certifique-se de especificar a estrutura de correspondência de seus dados; Se você não especificar, o modelo muitas vezes assume independência e recomenda o teste errado.

Eu tenho dois conjuntos de medidas. Importante: essas medidas foram realizadas antes/depois dos MESMOS indivíduos (pareados). Escolha o teste certo que leva em consideração essa correspondência (teste t pareado ou Wilcoxon), verifique suas suposições e relate o tamanho do efeito. Não presuma independência.

Resumindo

Análise precisa de dados; escolher o teste apropriado para o tipo de dados, verificar suposições, corrigir comparações múltiplas e relatar o tamanho do efeito e o intervalo de confiança, além do valor p. O maior perigo é o p-hacking; O antídoto é um plano de análise antecipado, relatórios completos e separação entre descoberta e verificação. A inteligência artificial é uma ajuda poderosa na seleção de testes e na verificação de suposições, mas a integridade estatística reside no ser humano.

Tarefa de aplicativo

Pegue um conjunto de dados (seus próprios dados ou uma amostra) com dois grupos. Primeiro, faça com que a IA escreva um código que visualize os dados e teste a normalidade. Dependendo do resultado, aplique o teste apropriado (teste t ou Mann-Whitney) e relate o tamanho do efeito e o intervalo de confiança juntamente com o valor p. Em seguida, compare o efeito de comparações múltiplas sem correção e com correção no resultado.

lista de verificação

  • [] Visualizei os dados antes de testar.
  • [] Verifiquei as suposições do teste (normalidade, variância).
  • [ ] Escolhi o teste adequado, não apliquei cegamente o teste t.
  • [] Corrigi a comparação múltipla.
  • Eu relatei o [] valor p, bem como o tamanho do efeito e o intervalo de confiança.
  • [] Fixei o plano de análise com antecedência e evitei p-hacking.