Unidade 4 / 11

Regressão Linear: Construção de Modelo, Interpretação de Coeficientes e Suposições

Ganhos:

  • Capacidade de construir um modelo de regressão linear com suporte de inteligência artificial e interpretar coeficientes, erros padrão e R-quadrado em uma linguagem precisa e não causal
  • Capacidade de compreender os pressupostos básicos nos quais o modelo se baseia (linearidade, exogeneidade, variância constante) e o que acontece quando são violados, e utilizar inteligência artificial para controle de pressupostos.
  • Capacidade de reconhecer e corrigir afirmações causais excessivas e problemas variáveis ​​negligenciados em interpretações de coeficientes produzidos pela inteligência artificial

A regressão linear é a espinha dorsal da econometria e da estatística aplicada. Na sua forma mais simples, estima como uma variável dependente (o resultado que se pretende explicar, como o rendimento) varia através de uma relação linear com uma ou mais variáveis ​​independentes (fatores explicativos, como anos de escolaridade, experiência). O modelo tem a forma: renda = β0 + β1·educação + β2·experiência + u. Aqui, os coeficientes β (beta) mostram o tamanho da relação e u mostra o termo de erro (todos os efeitos não observados) que o modelo não consegue explicar. Nesta unidade, veremos como a inteligência artificial (IA) acelera a construção e a interpretação de regressões, mas também por que a interpretação de coeficientes é onde os erros são cometidos com mais frequência.

Vamos colocar o propósito básico desde o início: a IA escreve o código de regressão, organiza a tabela de saída, produz um rascunho para interpretação dos coeficientes. Mas cabe a você decidir quais variáveis ​​entram no modelo (especificação do modelo), se o coeficiente é interpretado como causal ou relacional e se há uma variável negligenciada. O hábito mais perigoso da IA ​​é apresentar coeficientes de regressão comuns em linguagem causal, como “X aumenta Y”; enquanto a maioria das regressões mostra apenas relacionamento (correlação).

Fluxo de trabalho de regressão passo a passo

1. Construa o modelo com teoria. Quais variáveis ​​serão dependentes e quais serão independentes vêm do conhecimento e da teoria de campo, não da estatística. A lógica de "Quais fatores afetam logicamente este resultado?" não é a lógica de “tudo o que eu colocar nos dados, o coeficiente será significativo”.

2. Adivinhe. O método mais comum é OLS (Mínimos Quadrados Ordinários): ele seleciona os coeficientes de forma a minimizar a soma das diferenças quadradas entre os valores observados e previstos. A IA gera o código para isso (lm() em R, statsmodels em Python) instantaneamente.

3. Leia a saída. Procure quatro coisas no resultado da regressão: coeficiente (direção e magnitude da relação), erro padrão (incerteza de estimativa do coeficiente), estatística t e valor p (força de evidência de que o coeficiente é diferente de zero), R-quadrado (quanto da variação na variável dependente o modelo explica, variando de 0 a 1). Um R-quadrado alto não significa um “bom modelo”; Não há causalidade alguma.

4. Interprete o coeficiente corretamente. Se o coeficiente de educação for 1.200, a interpretação correta é: “Sendo outras variáveis ​​constantes, um aumento de um ano na educação está associado a uma média de 1.200 unidades de renda mais elevada”. Interpretação errada: "Mais um ano de educação aumenta a renda em 1.200." A segunda é a alegação de causalidade e só pode ser defendida com um design apropriado (unidade 9).

5. Verifique as suposições. A validade da regressão depende de certas suposições (abaixo). IA gera código de diagnóstico; Você faz o comentário.

Suposições básicas de regressão linear

As suposições nas quais o modelo linear clássico se baseia são necessárias para que os coeficientes sejam imparciais (centrados nas linhas) e os erros padrão sejam confiáveis:

  • Linearidade: A relação é linear em parâmetros (esticada em termos logarítmicos/quadrados, se necessário).
  • Exogeneidade (média condicional zero): O termo de erro não está correlacionado com as variáveis ​​explicativas. Esta é a suposição mais crítica e mais frequentemente violada; a violação cria viés de variável omitida.
  • Variância constante (homocedasticidade): A variância do termo de erro é a mesma em todas as observações (violação: heterocedasticidade — unidade 5).
  • Ausência de autocorrelação: Os erros são independentes entre si (violações frequentes na série temporal — unidades 5 e 8).
  • Ausência de multicolinearidade extrema: As variáveis ​​explicativas não são quase idênticas entre si (unidade 5).
Cuidado: O problema mais perigoso é o viés variável negligenciado. Se você deixar de fora um fator do seu modelo que está relacionado tanto à renda quanto à educação (por exemplo, histórico familiar, habilidade), o coeficiente de educação assume o efeito desse fator ausente e fica inflacionado. A IA não pode conhecer a variável que falta; Somente seu conhecimento de campo pode capturá-lo.

Tabela de comparação: interpretação de coeficiente verdadeiro vs. errado

saída

Interpretação incorreta (causal)

Interpretação correta (relacional)

coeficiente de escolaridade = 1.200

“A educação aumenta a renda em 1.200”

“Um ano a mais de educação, ceteris paribus, está associado a 1.200 rendimentos mais elevados.”

R² = 0,68

“O modelo captou a realidade”

“68% da mudança é explicada; não mostra causalidade”

p < 0,01

“O impacto é enorme”

“Forte evidência de que o coeficiente é diferente de zero; a magnitude é discreta”

coeficiente negativo

"X reduz Y"

"À medida que X aumenta, a média de Y diminui; por que há outro problema?"

Quatro prompts copiáveis

1. Gerando código de regressão:

Sua função: assistente de código econométrico. Não compartilho os dados, quero o código R. No data.frame 'dados', renda (dependente), escolaridade, experiência, gênero (categórico). Tarefa: escrever código de regressão com lm() para renda ~ educação + experiência + gênero, mostrar o resultado resumido e o intervalo de confiança (confint) dos coeficientes. Explique cada parte com uma linha de comentário. Vou correr e verificar o resultado.

2. Esboço de interpretação de coeficientes (em linguagem relacional):

Interprete a saída da regressão abaixo, mas REGRAS: - escreva coeficientes em linguagem RELACIONAL (“associados a”), NÃO use linguagem causal, - adicione “constantes de outras variáveis”, - apresente R ao quadrado como 'causalidade', - não confunda significância com tamanho do efeito.

3. Código de verificação de suposição:

Escreva um código de diagnóstico de suposição para o modelo renda ~ educação + experiência (R): gráficos de ajuste de resíduos (residuais), gráfico QQ, distribuição de resíduos. Explique na linha de comentários qual suposição cada gráfico testa. Sugerir correção; Basta produzir um diagnóstico e eu tomarei a decisão.

4. Consulta de variável perdida:

Ajude-me a considerar o risco de viés variável negligenciado no modelo renda-educação. Liste possíveis variáveis ​​que estão relacionadas tanto com o rendimento como com a educação, mas que NÃO estão no modelo (por exemplo, antecedentes familiares, região, capacidade) e explique em que direção cada uma pode enviesar o coeficiente de educação. Isto não é uma certeza, seja uma lista de considerações; Eu tomarei a decisão.

Alerta fraco / Alerta forte

Alerta fraco:

Interprete esta saída de regressão e explique os resultados.

Este prompt libera a IA; muito provavelmente produz frases causais e exageradas como “a formação aumenta o rendimento” e “o modelo é muito bem sucedido”.

Alerta poderoso:

Sua função: assistente de econometria cuidadoso. Interprete a saída, mas: (1) escreva todos os coeficientes em linguagem relacional, (2) use o padrão "todo o resto ceteris paribus", (3) não confunda R-quadrado com causalidade, (4) separe a significância do tamanho do efeito, (5) observe a falha em testar a suposição de exogeneidade do modelo e o risco de variáveis ​​negligenciadas. Saída: [tabela]

A diferença: a vontade forte proíbe a linguagem causal, tornando visíveis a ambiguidade e os limites da suposição.

três mini cases

Caso 1 — Armadilha da linguagem causal. Um analista descobriu que o coeficiente de publicidade era de 2,4 em sua regressão de vendas de publicidade e usou o modelo de IA como está: “Cada unidade gasta em publicidade aumenta as vendas em 2,4 unidades”. A administração inflou o orçamento de acordo; enquanto que durante os períodos de vendas elevadas já havia mais publicidade (causalidade reversa) e o coeficiente refletia isso. Lição: a regressão comum não é evidência de causalidade; a direção não é clara.

Caso 2 — Variável negligenciada. Num estudo, o coeficiente rendimento-educação foi de 1.900. Quando a escolaridade dos pais e a região foram adicionadas ao modelo, o coeficiente caiu para 1,150. No primeiro modelo, a educação assumiu, na verdade, parte da influência da origem familiar. Lição: uma variável ausente, mas correlacionada, inflaciona o coeficiente; Considere possíveis deficiências no conhecimento do domínio.

Caso 3 — Ilusão de R-quadrado elevado. Um aluno viu R²=0,94 e disse “meu modelo é perfeito”. Mas uma das variáveis ​​independentes era quase idêntica à variável dependente (item já incluído na venda). O modelo não explicava a realidade, explicava-se a si mesmo. Lição: R-quadrado alto não garante a qualidade do modelo; A verificação lógica é necessária.

Erros comuns

  • Interpretando o coeficiente causalmente. A linguagem “aumenta/diminui” é falsa, a menos que seja defendida pelo design; Diga "associado a".
  • Ignorando a variável negligenciada. Um fator ausente associado a X e Y distorce o coeficiente; Considere possíveis deficiências.
  • Confundir o R ​​ao quadrado com uma medida de sucesso. Um R-quadrado alto não significa causalidade ou um modelo correto; Pode até ser um sinal de vazamento variável.
  • Confundindo significado com grandeza. p<0,05 não indica que o efeito seja grande; Veja também a magnitude prática do coeficiente.
  • Interpretar suposições sem verificá-las. As violações distorcem os erros padrão e a interpretação; o diagnóstico não pode ser esquecido.
Dica: Para cada coeficiente, pergunte "Posso explicar esta relação na direção oposta? Ou existe um terceiro fator que afeta ambos?" Essas duas questões interrompem a interpretação causal exagerada antes mesmo de a caneta tocar o papel.

Em resumo

A regressão linear é a ferramenta básica para medir a relação de um resultado com fatores explicativos. A IA produz rapidamente o código do modelo, o layout de saída e o esboço de interpretação; mas a especificação do modelo, a interpretação relacional do coeficiente e o risco de variáveis ​​negligenciadas são de responsabilidade do especialista. O erro mais comum é apresentar o coeficiente como causal (“aumentos”); a linguagem correta é relacional ("relaciona-se com, sendo todo o resto constante"). R-quadrado alto não é sucesso ou causalidade; Nenhuma interpretação é segura sem verificar as suposições (especialmente a exogeneidade).

Tarefa de aplicativo

Configure uma regressão com uma variável dependente e pelo menos duas variáveis ​​independentes em um conjunto de dados. Solicite o código da IA ​​e execute-o. Primeiro, faça com que a IA interprete os coeficientes em linguagem relacional e, em seguida, revise e corrija cada afirmação causal. Adicione uma variável potencialmente relacionada ao modelo e observe como o coeficiente principal muda e interprete isso em um parágrafo dentro da estrutura do viés de variável omitida. Finalmente, produza gráficos de diagnóstico de suposições e observe quais suposições parecem sólidas e quais parecem questionáveis.

lista de verificação

  • [ ] Construí o modelo com base na teoria e no conhecimento de campo, não em dados.
  • [ ] Interpretei os coeficientes em linguagem relacional ("relativos a, ceteris paribus").
  • [] Observei que as reivindicações causais exigem um design separado.
  • [ ] Testei a sensibilidade do coeficiente principal considerando possíveis variáveis ​​negligenciadas.
  • [ ] Não apresentei o R-quadrado como medida de sucesso/causalidade.
  • [ ] Produziu e interpretou gráficos hipotéticos de diagnóstico; Avaliei se houve violação.