Unidad 7 / 11

Soporte de modelos econométricos: regresión, causalidad e interpretación

Ganancias:

  • Capacidad para leer con precisión el resultado de la regresión (coeficiente, error estándar, valor p, R cuadrado) y evaluar críticamente la interpretación de la inteligencia artificial.
  • Capacidad para reconocer obstáculos como la distinción correlación-causalidad, la endogeneidad, las variables omitidas y la regresión espuria, y frenar el lenguaje causal excesivo de la inteligencia artificial.
  • Capacidad para utilizar inteligencia artificial para la configuración del modelo, el código y la redacción de pruebas de diagnóstico, dejando la responsabilidad de la selección e interpretación del modelo a los humanos.

La econometría es la disciplina que prueba la teoría económica con datos, y la regresión es su herramienta básica. "¿Cuánto aumenta el consumo a medida que aumenta la renta?", "¿Cuál es la relación entre interés e inversión?" Preguntas como estas se cuantifican mediante regresión. La IA es a la vez muy útil y muy peligrosa en esta área: escribe código de modelo y pruebas de diagnóstico en segundos, pero a menudo es demasiado causal y demasiado precisa al interpretar el resultado. Pronuncia la frase "X aumenta Y" con fluidez; mientras que la mayoría de las regresiones miden sólo una relación. La esencia de esta unidad es: utilizar IA para la configuración del modelo, el código y las pruebas de diagnóstico; pero mantenga la responsabilidad de la selección del modelo, el juicio de causalidad y la interpretación en lo humano.

Lectura del resultado de regresión

El resultado de una regresión simple busca cuatro cosas:

  • Coeficiente. Una estimación de cuánto cambia la variable dependiente cuando la variable explicativa aumenta en una unidad. El signo (más/menos) y la magnitud deben tener significado económico.
  • Error estándar. La incertidumbre de la estimación del coeficiente; Si es menor, la estimación es más precisa.
  • valor p. La probabilidad de que el coeficiente parezca tan grande bajo el supuesto de que es "en realidad cero". Se dice que una p pequeña (< 0,05) es “estadísticamente significativa”, pero esto no implica importancia económica ni causalidad.
  • R cuadrado. Cuánto del cambio en la variable dependiente explica el modelo. Un R cuadrado alto no significa que sea el "modelo correcto"; También puede ser elevado en regresiones espurias.
Consejo: No confunda significancia estadística con significancia económica. Incluso un efecto muy pequeño, prácticamente insignificante, puede resultar "significativo" (p pequeña) en una muestra grande. En primer lugar, "¿Es económicamente importante el tamaño de este coeficiente?" ', luego busque significado.

Correlación no es causalidad: errores clásicos

Ésta es la advertencia central de la econometría. La relación encontrada mediante la regresión a menudo no es de causalidad. Principales obstáculos:

  • Variable omitida. Un tercer factor que afecta tanto a X como a Y pero que no está en el modelo crea una relación espuria entre X e Y. (Ejemplo: si se omite "capacidad" en la relación entre educación e ingresos, el coeficiente será engañoso).
  • Causalidad inversa (endogeneidad). Si bien se piensa que X afecta a Y, tal vez Y afecte a X o los dos son mutuos. (Cifras policiales y delincuencia: ¿aumentó la policía porque aumentó la delincuencia?)
  • Pseudo regresión. Dos series no estacionarias (de tendencia) pueden producir coeficientes R cuadrado elevados y significativos aunque no exista una relación real entre ellos. Simplemente porque ambos crecen con el tiempo.
  • Sesgo de selección. Si la muestra no es aleatoria, la relación se mide sesgada.

La afirmación de causalidad sólo puede establecerse con un diseño apropiado (métodos como experimento controlado, experimento natural, variable instrumental, diferencias en diferencias) y supuestos claros. La inteligencia artificial a menudo pasa por alto esta sutileza.

Precaución: Si la IA dice "esta variable aumenta/disminuye eso", frena inmediatamente. Problema: ¿Se omite alguna variable? ¿Es posible la causalidad inversa? ¿Las series son estacionarias? Ninguna frase causal entra en el informe hasta que se formulan estas tres preguntas.

Pruebas diagnósticas

Para que una regresión sea confiable se prueban sus supuestos: patrón de residuos (términos de error) (autocorrelación), heterocedasticidad (heterocedasticidad), multicolinealidad (las variables explicativas son muy similares entre sí), distribución normal. La inteligencia artificial escribe el código de estas pruebas; pero es trabajo del economista interpretar los resultados y ajustar el modelo en consecuencia.

tres mini casos

Caso 1: Regresión espuria. Un investigador hizo una regresión de dos series de tendencias (una de gasto nominal, otra de cantidad nominal); El R cuadrado fue de 0,98, el coeficiente fue altamente significativo. La IA "es una relación sólida", dijo. El investigador probó la estacionariedad: ambas series eran no estacionarias. Una vez que se separaron, la relación desapareció en gran medida. El alto R cuadrado se debió simplemente a que ambos crecieron con el tiempo. Se detecta una regresión espuria.

Caso 2: variable omitida. Un análisis encontró que "la inversión en publicidad aumenta las ventas". El economista preguntó: ¿hay un efecto estacional en el modelo? No lo hubo. Tanto la publicidad como las ventas estaban aumentando antes de las vacaciones; Parte de la relación fue la estacionalidad. Cuando se agregaron variables ficticias de temporada, el coeficiente de publicidad se hizo más pequeño. La afirmación causal se ha suavizado.

Caso 3: Significativo pero insignificante. En un conjunto grande de microdatos, el coeficiente fue p<0,001; La IA tiene un "fuerte impacto", dijo. Pero la magnitud del coeficiente fue prácticamente insignificante (un gran cambio en el ingreso movió el resultado en una milésima). El economista lo enmarcó correctamente como “estadísticamente significativo pero económicamente insignificante”. La importancia no reemplazaba a la importancia.

Tabla de moderación de comentarios

inteligencia artificial dice

El economista pregunta

"X aumenta Y"

¿Variable omitida? ¿Causalidad inversa?

"R cuadrado es alto, el modelo es bueno"

¿Las series son estacionarias? ¿Regresión falsa?

"p<0,05, significativo"

¿El tamaño importa económicamente?

"Coeficiente 0,3"

¿Son su signo y unidad compatibles con la teoría?

"La relación es fuerte"

¿Está sesgada la selección de la muestra?

Cuatro plantillas copiables

1) Croquis de instalación del modelo:

Examinaré la siguiente cuestión económica: [pregunta]. Variable dependiente: [Y]. Descriptores candidatos: [X]. Sugiérame una configuración de regresión inicial adecuada (código de modelos de estadísticas). Explique qué variables de control son necesarias y por qué. NO afirme causalidad; Utilice un lenguaje de relación.

2) Pruebas diagnósticas:

Escriba en código las pruebas de diagnóstico para la regresión que configuré: autocorrelación, heterocedasticidad, multicolinealidad, dispersión de residuos y estacionariedad (si es una serie de tiempo). Escriba brevemente cómo interpretar el resultado de cada prueba y qué hacer si hay problemas.

3) Control de causalidad:

Interprete el resultado de esta regresión, pero primero compruebe estos tres errores: (1) ¿podría haber una variable omitida y cuál, (2) es posible la causalidad inversa, (3) las series son estacionarias/existe riesgo de regresión espuria? Indique claramente si el resultado debe interpretarse como causal o meramente relacional.

4) Distinción significado-importancia:

Interprete el siguiente coeficiente: valor [x], error estándar [y], valor p [z]. Evalúe la significancia estadística por separado y la significancia económica por separado: ¿es la magnitud de este coeficiente un efecto prácticamente significativo? Concretar la magnitud del impacto en un escenario de ejemplo.

Aviso débil / Aviso fuerte

Aviso débil:

Haz una regresión con estas variables e interpreta el resultado.

La inteligencia artificial lo interpreta en un lenguaje causal, sin realizar pruebas diagnósticas ni comprobar la estacionariedad; se omite la regresión espuria o la variable omitida.

Potente mensaje:

La variable dependiente es el consumo, el ingreso explicativo; series mensuales de tendencia. Pruebe primero la estacionariedad; Obtenga la diferencia si es necesario. Configurar la regresión, ejecutar pruebas de diagnóstico (autocorrelación, heterocedasticidad). Discutir explícitamente los riesgos de las variables omitidas y la causalidad inversa al interpretar el resultado; Utilice un lenguaje relacional en lugar de causal. Evalúe la importancia y la importancia económica por separado y proporcione el código para cada paso.

Errores comunes

  • Confundir correlación con causalidad. El error más común y más caro.
  • Confundir un R cuadrado alto con calidad. También es elevado en regresiones espurias.
  • Pasando por alto el control de estasis. Las series de tendencia producen relaciones espurias.
  • Confundir significado con significado. Una p pequeña no significa un efecto grande.
  • Saltarse pruebas diagnósticas. El supuesto violado anula toda la inferencia.
  • Aceptar el lenguaje causal de la IA tal como está. El juicio pertenece al hombre.

En resumen

La regresión es una herramienta poderosa pero problemática. Lectura correcta del coeficiente, error estándar, valor p y R cuadrado; distinguir entre correlación y causalidad; comprobar las variables omitidas, la causalidad inversa y los obstáculos de la regresión espuria; Es necesario distinguir entre trascendencia e importancia económica. La IA se está acelerando en la generación de códigos y diagnósticos, pero habla de manera demasiado causal; La elección del modelo y el juicio de causalidad recae en el economista.

Tarea de aplicación

Configure una regresión simple con los datos que tiene (por ejemplo, consumo-ingreso). Haga que se produzca la configuración con la primera plantilla y las pruebas de diagnóstico con la segunda plantilla. Luego verifique la causalidad con la plantilla 3, nombrando al menos una posible variable omitida y un escenario de causalidad inversa. Traduzca una oración causal de la interpretación inicial de la IA al lenguaje relacional y observe el cambio.

lista de verificación

  • [ ] Leí correctamente el coeficiente, el error estándar, el valor p y el R cuadrado.
  • [ ] Verifiqué la estacionariedad de la serie y eliminé el riesgo de regresión espuria.
  • [] Nombré la variable omitida y las posibilidades de causalidad inversa.
  • [ ] Realicé pruebas de diagnóstico y evalué infracciones.
  • [ ] Evalué la significación estadística y la significancia económica por separado.
  • [ ] He trasladado el lenguaje causal de la inteligencia artificial al lenguaje relacional.
  • [ ] Sostuve que la elección del modelo y el juicio de causalidad eran míos.