Ganhos:
- Capacidade de reportar resultados empíricos ao público-alvo (académico, político, gestão) com o apoio da inteligência artificial, numa linguagem honesta e inequívoca
- Capacidade de redigir conclusões, limitações e declarações éticas (confidencialidade de dados, conflito de interesses, divulgação do uso de inteligência artificial) e evitar apresentações enganosas
- A capacidade da inteligência artificial de reconhecer rascunhos de relatórios que produzem linguagem exagerada, unilateral ou causal e manter que a responsabilidade pelo texto final e pelas reivindicações cabe ao pesquisador.
Exame do Módulo
1. Um investigador pergunta 'Qual é o coeficiente de correlação entre desemprego e inflação em Türkiye entre 2015 e 2020?' sem fornecer quaisquer dados à inteligência artificial. ele pergunta e escreve o número 0,62 diretamente em seu artigo. Qual é o erro fundamental nesta abordagem?
- A) Esperar estatísticas concretas da inteligência artificial sem fornecer dados verificados; ✔ Usar um número que pode ter sido inventado sem verificação
- B) O coeficiente de correlação nunca deve ser utilizado em um artigo.
- C) A correlação não pode ser calculada entre desemprego e inflação
- D) A inteligência artificial só poderá acessar dados após 2020
Explicação: O modelo de linguagem de IA não pode produzir estatísticas sem acessar o conjunto de dados; O número que ele dá é provavelmente uma alucinação (fabricada). Coeficientes, proporções e resultados de testes devem ser calculados a partir dos dados verificados do próprio pesquisador, e não retirados da memória do modelo.
2. O que significa que os dados em falta são “não perdidos aleatoriamente” (MNAR) e porque é que isso é importante?
- A) A deficiência se deve ao próprio valor não observado; É por isso que uma tarefa simples pode criar preconceitos ✔
- B) Os dados desaparecem de forma completamente aleatória e não criam qualquer viés.
- C) Os dados ausentes devem sempre ser resolvidos excluindo a linha.
- D) Os dados faltantes não afetam de forma alguma a análise.
Explicação: No caso de MNAR (Missing Not At Random), a falta em si depende da magnitude do valor não observado (por exemplo, pessoas com rendimentos elevados não comunicam os seus rendimentos). Neste caso, a simples eliminação ou atribuição média dá resultados tendenciosos; O mecanismo da deficiência deve ser modelado. O método de atribuição sugerido pela inteligência artificial não deve ser aplicado cegamente sem o conhecimento deste mecanismo.
3. Um analista faz com que a IA crie um gráfico de barras e a IA inicia o eixo y em 40 em vez de zero. A diferença real de 2% entre os dois grupos parece enorme no gráfico. Qual é a abordagem correta?
- A) Iniciar o eixo do zero ou alterar o tipo de gráfico; ✔ para mostrar o verdadeiro tamanho da diferença sem enganar
- B) Usar o gráfico como está porque a IA faz a melhor escolha
- C) Iniciando o eixo em 45 para aumentar ainda mais a diferença
- D) Nunca use recursos visuais em vez de gráficos de barras
Explicação: Em um gráfico de barras, o eixo tracejado (o eixo y que não começa em zero) engana ao exagerar pequenas diferenças. Na visualização honesta, o eixo dos gráficos de barras deve começar do zero ou a diferença deve ser declarada de forma clara e consciente. É responsabilidade do analista verificar a imagem e corrigi-la se necessário.
4. Como é que o facto de um coeficiente ser “significativo” (p<0,05) na regressão linear é frequentemente mal representado na interpretação da inteligência artificial?
- A) Apresentação exagerada de significância, pois o efeito é grande e importante ou a causalidade é estabelecida ✔
- B) A significância sempre indica que o efeito é pequeno
- C) p<0,05 prova que o coeficiente está absolutamente correto
- D) Coeficientes significativos nunca devem ser reportados.
Explicação: A significância estatística está relacionada com a força da evidência de que o efeito é diferente de zero; Isso não significa que o efeito seja grande, importante ou causal. A IA apresenta frequentemente a palavra “significativo” como “impacto significativo/forte”. O pesquisador também deve avaliar o tamanho do efeito, o intervalo de confiança e o contexto.
5. A que se refere o termo “p-hacking” e por que a IA pode facilitar isso?
- A) Tentar múltiplas análises até fazer sentido; A IA faz isso muito rapidamente, aumentando o risco ✔
- B) Analisando dados uma vez e com um plano pré-determinado
- C) expandir a amostra para aumentar o valor p
- D) Relatar apenas estatísticas descritivas
Explicação: p-hacking é tentar diferentes variáveis, subamostras, transformações ou modelos até que surja um resultado significativo; isso produz descobertas espúrias baseadas no acaso. Como a IA pode testar dezenas de variantes de modelos em segundos, ela pode acelerar o p-hacking sem um plano honesto. Defesa; pré-registro, plano de análise fixo e correção de comparações múltiplas.
6. Por que encontrar uma regressão R-quadrada alta entre duas séries temporais não estacionárias (raiz unitária) pode ser enganoso?
- A) Regressão espúria pode ocorrer devido a tendência comum; ✔ Alto rendimento R-quadrado sem relação real
- B) Um R-quadrado alto sempre prova uma forte relação causal.
- C) Séries não estacionárias não podem ser inseridas em regressão.
- D) R-quadrado não pode ser calculado em séries temporais
Explicação: Se não houver uma relação de cointegração comum entre séries não estacionárias, a regressão espúria pode produzir R-quadrado elevado e coeficiente significativo apenas devido à tendência comum; enquanto não existe um relacionamento real. Portanto, testes de estacionariedade e raiz unitária devem ser feitos primeiro e, se necessário, devem ser feitas diferenças ou testada a cointegração.
7. Qual suposição básica se baseia na validade do projeto Diferença-em-Diferenças?
- A) Suposição de tendências paralelas: os grupos seguiriam a mesma direção se não houvesse intervenção ✔
- B) Os grupos de tratamento e controle são exatamente os mesmos no início
- C) Distribuição normal da amostra
- D) As variáveis não contêm dados faltantes
Explicação: DiD assume que, na ausência da intervenção, a variável de resultado para os grupos de tratamento e de controlo teria evoluído paralelamente ao longo do tempo (suposição de tendências paralelas). Se esta suposição não for atendida, a estimativa é tendenciosa. A IA pode produzir o código DiD, mas é função do pesquisador defender e testar tendências paralelas.
8. Qual das alternativas a seguir é uma prática obrigatória para uma análise reprodutível?
- A) Corrigindo a semente em etapas aleatórias, gravando versões e código do pacote ✔
- B) Copie manualmente os resultados para a planilha e exclua o código
- C) É normal ver resultados diferentes em cada execução.
- D) Manter apenas gráficos finais, não compartilhar dados e códigos
Descrição: Reprodutibilidade; O mesmo resultado pode ser obtido novamente com os mesmos dados e código. Corrigir a semente em etapas aleatórias, salvar versões de pacotes e executar o código dentro do documento (programação alfabetizada) são os pilares disso. Copiar resultados manualmente ou etapas sem registro baseadas em clique prejudica a reprodutibilidade.
9. O que a heterocedasticidade distorce uma regressão linear e qual é a sua solução comum?
- A) Distorce os erros padrão; a solução são erros padrão robustos ou transformação apropriada ✔
- B) Invalida completamente as estimativas dos coeficientes e não tem solução
- C) Sempre reduz R ao quadrado a zero
- D) Ocorre apenas se a amostra for muito pequena e puder ser ignorada
Explicação: A heterocedasticidade deixa as estimativas dos coeficientes imparciais, mas calcula mal os erros padrão; Isso torna os valores p e os intervalos de confiança não confiáveis. Uma solução comum é usar erros padrão robustos/HC ou conversão apropriada. É preciso verificar se a solução sugerida pela IA realmente resolve o problema, em vez de ocultá-lo.
10. Um pesquisador carrega microdados contendo informações de identificação do paciente e renda em uma ferramenta pública de bate-papo de IA e diz “fazer regressão”. Qual é o principal problema desse comportamento?
- A) O upload de dados pessoais/licenciados para uma ferramenta externa constitui uma violação de confidencialidade e contrato ✔
- B) A regressão não pode ser feita por inteligência artificial
- C) Microdados não são adequados para regressão
- D) A IA sempre calcula mal a regressão
Explicação: Dados pessoais/especiais, como identidade e renda, são protegidos pelo KVKK/GDPR e pela maioria dos acordos de uso de dados; Carregá-los para um dispositivo externo que possa armazenar dados é uma violação. O caminho certo; Anonimizar dados, utilizando ferramentas seguras locais/institucionais, ou simplesmente solicitar código à inteligência artificial e executar o código em seu próprio ambiente.
11. O que se observa quando a multicolinearidade é alta?
- A) Os coeficientes tornam-se instáveis e os erros padrão tornam-se inflacionados; Os coeficientes individuais podem não ter sentido ✔
- B) R ao quadrado sempre diminui para zero
- C) As estimativas dos coeficientes tornam-se cada vez mais precisas
- D) A escala da variável dependente muda
Explicação: Em alta multicolinearidade, as variáveis independentes estão fortemente correlacionadas entre si; As estimativas dos coeficientes tornam-se instáveis, os erros padrão tornam-se inflacionados e os coeficientes individuais podem revelar-se insignificantes, enquanto o modelo global pode ser significativo. É diagnosticado por critérios como VIF. A inteligência artificial pode sugerir a eliminação de variáveis, mas cabe ao pesquisador decidir qual variável deve permanecer teórica.
12. O que é poder estatístico e qual é o risco de um estudo de baixo poder?
- A) Possibilidade de detectar o efeito existente; baixa potência perde os efeitos verdadeiros e torna as descobertas não confiáveis ✔
- B) probabilidade de redução do valor p; menor potência sempre fornece resultados mais confiáveis
- C) Um valor constante independente do tamanho da amostra
- D) Um conceito que só é válido quando se utiliza inteligência artificial
Explicação: Potência é a probabilidade de detectar um efeito que realmente existe (1 menos erro tipo II). Estudos de baixa potência podem perder os efeitos verdadeiros; Além disso, os poucos resultados significativos podem acarretar um tamanho de efeito exagerado (“maldição do vencedor”) e a taxa de falsos positivos aumenta. Portanto, o cálculo do poder/amostra é importante antes da análise.
13. Por que é eticamente necessário divulgar o uso de inteligência artificial em um artigo?
- A) Pela transparência e responsabilização; ✔ leitores e árbitros podem avaliar o processo e a responsabilidade permanece com o autor
- B) O uso de inteligência artificial invalida automaticamente os resultados
- C) Solicitado por revistas apenas para fins publicitários
- D) Transferência dos direitos autorais da explicação para a inteligência artificial
Divulgação: A transparência é necessária para que o leitor e revisores possam avaliar como os resultados foram produzidos; Muitas revistas e instituições exigem agora a divulgação do uso da IA. Além disso, como a inteligência artificial pode produzir erros/alucinações, é uma questão de honestidade afirmar que a responsabilidade é do autor e quais etapas foram auditadas.
14. O que a 'restrição de exclusão' exige no método da Variável do Instrumento (IV)?
- A) A ferramenta afeta o resultado apenas através da variável interna, não existe outra forma direta ✔
- B) O instrumento não possui relação com a variável desfecho.
- C) O instrumento não tem relação com a variável endógena.
- D) A média é sempre uma variável binária (0/1)
Explicação: A restrição de exclusão exige que o instrumento afecte a variável de resultado apenas através da variável explicativa endógena e não através de quaisquer outros meios directos ou factores não observados. Esta suposição não pode ser totalmente testada a partir dos dados; É defendido em bases teóricas e institucionais. A IA pode escrever o código IV, mas é função do pesquisador defender a validade da ferramenta.
15. O que significa o problema do 'Jardim de bifurcações' em análises flexíveis sem pré-registro?
- A) Muitas escolhas de análise razoáveis feitas com base nos dados aumentam a taxa de falsos positivos, mesmo involuntariamente ✔
- B) Os métodos de análise devem ser únicos e obrigatórios
- C) Um problema que só ocorre quando ocorre trapaça intencional.
- D) Uma situação que desaparece espontaneamente à medida que a amostra cresce
Explicação: Depois de visualizar os dados, o pesquisador pode fazer muitas escolhas razoáveis sobre qual variável, subgrupo, transformação ou limite usar. Mesmo que não haja um único 'p-hacking intencional', esta flexibilidade aumenta a taxa de falsos positivos porque o significativo é efetivamente escolhido a partir de um grande número de análises. O pré-registo e um plano de análise fixo limitam esta flexibilidade.