Unidad 4 / 11

Regresión lineal: construcción de modelos, interpretación de coeficientes y supuestos

Ganancias:

  • Capacidad para construir un modelo de regresión lineal con soporte de inteligencia artificial e interpretar coeficientes, errores estándar y R cuadrado en un lenguaje preciso y no causal.
  • Capacidad para comprender los supuestos básicos en los que se basa el modelo (linealidad, exogeneidad, varianza constante) y qué sucede cuando se violan, y utilizar inteligencia artificial para el control de supuestos.
  • Capacidad para reconocer y corregir afirmaciones causales excesivas y problemas de variables pasados ​​por alto en interpretaciones de coeficientes producidas por inteligencia artificial.

La regresión lineal es la columna vertebral de la econometría y la estadística aplicada. En su forma más simple, estima cómo varía una variable dependiente (el resultado que se desea explicar, como el ingreso) a través de una relación lineal con una o más variables independientes (factores explicativos, como años de educación, experiencia). El modelo tiene la forma: ingreso = β0 + β1·educación + β2·experiencia + u. Aquí los coeficientes β (beta) muestran el tamaño de la relación y u muestra el término de error (todos los efectos no observados) que el modelo no puede explicar. En esta unidad, veremos cómo la inteligencia artificial (IA) acelera la construcción e interpretación de la regresión, pero por qué la interpretación de coeficientes es donde se cometen errores con mayor frecuencia.

Planteemos el propósito básico desde el principio: AI escribe el código de regresión, organiza la tabla de resultados y produce un borrador para la interpretación de coeficientes. Pero es su decisión qué variables entran en el modelo (especificación del modelo), si el coeficiente se interpreta como causal o relacional y si hay una variable que se pasa por alto. El hábito más peligroso de la IA es presentar coeficientes de regresión ordinarios en un lenguaje causal como "X aumenta Y"; mientras que la mayoría de las regresiones sólo muestran relación (correlación).

Flujo de trabajo de regresión paso a paso

1. Construir el modelo con teoría. Qué variables serán dependientes y cuáles independientes provienen del conocimiento de campo y de la teoría, no de las estadísticas. La lógica de "¿Qué factores afectan lógicamente este resultado?" no es la lógica de "independientemente de lo que ponga en los datos, el coeficiente será significativo".

2. Adivina. El método más común es MCO (Mínimos Cuadrados Ordinarios): selecciona los coeficientes de una manera que minimiza la suma de las diferencias al cuadrado entre los valores observados y predichos. La IA genera el código para esto (lm() en R, statsmodels en Python) sobre la marcha.

3. Lea el resultado. Busque cuatro cosas en el resultado de la regresión: coeficiente (dirección y magnitud de la relación), error estándar (incertidumbre de la estimación del coeficiente), estadístico t y valor p (fuerza de la evidencia de que el coeficiente es diferente de cero), R cuadrado (cuánta variación en la variable dependiente explica el modelo, en un rango de 0 a 1). Un R cuadrado alto no significa un "buen modelo"; No hay ninguna causalidad.

4. Interpretar el coeficiente correctamente. Si el coeficiente de educación es 1.200, la interpretación correcta es: "Siendo constantes las demás variables, un aumento de un año en la educación se asocia con un promedio de 1.200 unidades de ingreso más alto". Interpretación errónea: "Otro año de educación aumenta los ingresos en 1.200". La segunda es la afirmación de causalidad y sólo puede defenderse con un diseño apropiado (unidad 9).

5. Verifique las suposiciones. La validez de la regresión depende de ciertos supuestos (a continuación). La IA genera código de diagnóstico; Tú haces el comentario.

Supuestos básicos de la regresión lineal.

Los supuestos en los que se basa el modelo lineal clásico son necesarios para que los coeficientes sean insesgados (centrados en la línea) y los errores estándar sean confiables:

  • Linealidad: la relación es lineal en parámetros (estirada en términos log/cuadrado si es necesario).
  • Exogeneidad (media condicional cero): el término de error no está correlacionado con las variables explicativas. Ésta es la suposición más crítica y más frecuentemente violada; la violación crea un sesgo de variable omitida.
  • Varianza constante (homoscedasticidad): La varianza del término de error es la misma en todas las observaciones (violación: heterocedasticidad - unidad 5).
  • Ausencia de autocorrelación: los errores son independientes entre sí (violaciones frecuentes en la serie temporal - unidades 5 y 8).
  • Ausencia de multicolinealidad extrema: las variables explicativas no son casi idénticas entre sí (unidad 5).
Precaución: el problema más peligroso es el sesgo variable que se pasa por alto. Si omite un factor de su modelo que está relacionado tanto con el ingreso como con la educación (por ejemplo, antecedentes familiares, capacidad), el coeficiente de educación adquiere el efecto de este factor faltante y se infla. La IA no puede conocer la variable que falta; Sólo su conocimiento de campo puede capturarlo.

Tabla comparativa: interpretación de coeficientes verdaderos versus incorrectos

salida

Interpretación incorrecta (causal)

Interpretación correcta (relacional)

coeficiente de educación = 1.200

"La educación aumenta los ingresos en 1.200"

“Un año más de educación, ceteris paribus, se asocia con 1.200 ingresos más altos”.

R² = 0,68

"La modelo captó la realidad"

"El 68% del cambio se explica; no muestra causalidad"

p<0,01

"El impacto es enorme"

"Fuerte evidencia de que el coeficiente es diferente de cero; la magnitud es discreta"

coeficiente negativo

"X reduce Y"

"A medida que X aumenta, el promedio de Y disminuye; ¿por qué surge otro problema?"

Cuatro indicaciones copiables

1. Generando código de regresión:

Su función: asistente de código econométrico. No comparto los datos, quiero el código R. En el data.frame 'datos', ingresos (dependiente), educación, experiencia, género (categórico). Tarea: escribir código de regresión con lm() para ingresos ~ educación + experiencia + género, mostrar el resultado resumido y el intervalo de confianza (confint) de los coeficientes. Explique cada parte con una línea de comentario. Ejecutaré y verificaré el resultado.

2. Bosquejo de la interpretación de los coeficientes (en lenguaje relacional):

Interprete el resultado de la regresión a continuación, pero REGLAS: - escriba los coeficientes en lenguaje RELACIONAL ("asociado con"), NO use lenguaje causal, - agregue "otras variables constantes", - presente R cuadrado como 'causalidad', - no confunda significancia con tamaño del efecto. Salida: [pegar tabla]

3. Código de verificación de supuesto:

Escriba un código de diagnóstico de suposiciones para el modelo de ingresos ~ educación + experiencia (R): gráficos de ajuste de residuos (residuales), gráficos QQ, distribución de residuos. Explique en la línea de comentarios qué supuesto prueba cada gráfico. Sugerir corrección; Simplemente haga un diagnóstico y yo tomaré la decisión.

4. Consulta de variable perdida:

Ayúdenme a considerar el riesgo de que se pase por alto un sesgo de variable en el modelo de ingresos ~ educación. Enumere las posibles variables que están relacionadas tanto con el ingreso como con la educación pero que NO están en el modelo (por ejemplo, antecedentes familiares, región, capacidad) y explique en qué dirección cada una podría sesgar el coeficiente de educación. Esto no es una certeza, sea una lista de consideraciones; Yo tomaré la decisión.

Aviso débil / Aviso fuerte

Aviso débil:

Interprete el resultado de esta regresión y explique los resultados.

Este mensaje libera la IA; lo más probable es que produzca frases causales y exageradas como "la formación aumenta los ingresos" y "el modelo tiene mucho éxito".

Potente mensaje:

Su función: cuidadoso asistente de econometría. Interprete el resultado, pero: (1) escriba todos los coeficientes en lenguaje relacional, (2) use el patrón "todo lo demás ceteris paribus", (3) no confunda R cuadrado con causalidad, (4) separe la significancia del tamaño del efecto, (5) observe la falla al probar el supuesto de exogeneidad del modelo y el riesgo de variables pasadas por alto. Salida: [tabla]

La diferencia: la voluntad fuerte prohíbe el lenguaje causal, haciendo visibles la ambigüedad y los límites de las suposiciones.

tres mini casos

Caso 1: Trampa del lenguaje causal. Un analista encontró que el coeficiente de publicidad era 2,4 en su regresión de publicidad ~ ventas y utilizó el modelo de IA tal como está: "Cada unidad gastada en publicidad aumenta las ventas en 2,4 unidades". La dirección infló el presupuesto en consecuencia; mientras que en periodos de altas ventas ya había más publicidad (causalidad inversa) y el coeficiente así lo reflejaba. Lección: la regresión ordinaria no es prueba de causalidad; la dirección no está clara.

Caso 2: variable pasada por alto. En un estudio, el coeficiente ingreso ~ educación fue de 1.900. Cuando se agregaron al modelo la educación de los padres y la región, el coeficiente cayó a 1,150. En el primer modelo, la educación asumió parte de la influencia del entorno familiar. Lección: una variable faltante pero correlacionada infla el coeficiente; Considere posibles deficiencias en el conocimiento del dominio.

Caso 3: Ilusión de R cuadrado alto. Un estudiante vio R²=0,94 y dijo "mi modelo es perfecto". Pero una de las variables independientes era casi idéntica a la variable dependiente (un artículo ya incluido en la venta). El modelo no explicaba la realidad, se explicaba a sí mismo. Lección: un R cuadrado alto no garantiza la calidad del modelo; Se requiere verificación lógica.

Errores comunes

  • Interpretar el coeficiente causalmente. El lenguaje “aumenta/disminuye” es falso a menos que se defienda intencionalmente; Diga "asociado con".
  • Ignorando la variable pasada por alto. Un factor faltante asociado tanto con X como con Y sesga el coeficiente; Considere posibles deficiencias.
  • Confundir R-cuadrado con una medida de éxito. Un R cuadrado alto no significa causalidad ni un modelo correcto; Incluso puede ser un signo de fuga variable.
  • Confundir trascendencia con grandeza. p<0,05 no indica que el efecto sea grande; Véase también la magnitud práctica del coeficiente.
  • Interpretar supuestos sin comprobarlos. Las violaciones distorsionan los errores estándar y la interpretación; El diagnóstico no puede pasar desapercibido.
Pista: Para cada coeficiente, pregunte "¿Puedo explicar esta relación en la dirección opuesta? ¿O hay un tercer factor que afecta a ambos?" Estas dos preguntas detienen la sobreinterpretación causal incluso antes de que el bolígrafo toque el papel.

En resumen

La regresión lineal es la herramienta básica para medir la relación de un resultado con los factores explicativos. La IA produce rápidamente el código del modelo, el diseño de salida y el esquema de interpretación; pero la especificación del modelo, la interpretación relacional del coeficiente y el riesgo de variables pasadas por alto son responsabilidad del experto. El error más común es presentar el coeficiente como causal ("aumenta"); el lenguaje correcto es relacional ("se relaciona con, siendo todo lo demás constante"). Un R cuadrado alto no significa éxito ni causalidad; Ninguna interpretación es segura sin comprobar los supuestos (especialmente la exogeneidad).

Tarea de aplicación

Configure una regresión con una variable dependiente y al menos dos variables independientes en un conjunto de datos. Solicita el código a la IA y ejecútalo. Primero, haga que la IA interprete los coeficientes en lenguaje relacional y luego revise y corrija cada afirmación causal. Agregue una variable potencialmente relacionada al modelo y observe cómo cambia el coeficiente principal e interprete esto en un párrafo dentro del marco del sesgo de variable omitida. Finalmente, genere gráficos de diagnóstico de supuestos y observe qué supuestos parecen sólidos y cuáles cuestionables.

lista de verificación

  • [] Construí el modelo basándome en la teoría y el conocimiento de campo, no en datos.
  • [ ] Interpreté los coeficientes en lenguaje relacional ("relativo a, ceteris paribus").
  • [ ] Observé que las afirmaciones causales requieren un diseño separado.
  • [] Probé la sensibilidad del coeficiente principal considerando posibles variables pasadas por alto.
  • [] No presenté R-cuadrado como una medida de éxito/causalidad.
  • [ ] Produjo e interpretó diagramas de diagnóstico hipotéticos; Evalué si hubo infracción.