Unidad 1 / 11

Inteligencia artificial en econometría y estadística: roles, límites, autenticación y privacidad

Ganancias:

  • Ser capaz de distinguir en qué parte del flujo de trabajo empírico (limpieza de datos, código, visualización, interpretación de borradores) la inteligencia artificial ahorra tiempo real y dónde decisiones como la selección del modelo, la afirmación de causalidad y la decisión de publicación se dejan en manos del experto, según el nivel de riesgo de la tarea.
  • Capacidad para aplicar una disciplina que verifica cada salida de la inteligencia artificial (número, coeficiente, código, comentario) a través de los pasos de recálculo, vinculación a la fuente y filtrado estadístico.
  • Capacidad para procesar de forma segura microdatos y conjuntos de datos confidenciales/con licencia dentro del alcance de KVKK/GDPR y los acuerdos de uso de datos y adquirir el hábito de elegir las herramientas adecuadas.

Las mismas preguntas se repiten todos los días en el escritorio de un econometrista o estadístico aplicado: ¿Es confiable este conjunto de datos? ¿Qué hacer con estos valores faltantes? ¿Qué dice realmente el coeficiente de esta regresión? ¿Es esta relación causal o meramente correlacional? Dado que este valor p es significativo, ¿puedo escribirlo en el artículo o en el informe de políticas? Algunas de estas preguntas son repetitivas, requieren mucho código y consumen mucho tiempo: limpiar datos, trazar el mismo gráfico diez veces, depurar código R o Python, encadenar los resultados en una tabla. Otros determinan directamente la validez de un hallazgo, la honestidad de una publicación o la exactitud de una decisión política.

La inteligencia artificial (IA en resumen, IA: sistemas informáticos que pueden producir texto y códigos como los humanos, reconocer patrones, resumir datos y escribir comentarios; la forma más utilizada hoy en día son los grandes modelos de lenguaje, es decir, sistemas que se entrenan en textos enormes y construyen oraciones prediciendo la siguiente palabra) se encuentra justo en el medio de esta tabla. Cuando se usa correctamente, reduce las horas de código de limpieza de datos a minutos, le recuerda la sintaxis de una prueba estadística compleja o redacta la interpretación de un coeficiente. Cuando se usa incorrectamente, presenta un número aparentemente seguro pero completamente inventado, un significado falso o una relación no causal como un "hallazgo".

Esta primera unidad no es una introducción al software. Su propósito es aclarar dónde colocar la IA en su flujo de trabajo empírico y dónde nunca colocarla. La econometría es un campo "crítico para el método" e indirectamente "crítico para la decisión": el coeficiente de un modelo que se construye puede ser el insumo para la decisión de un banco central sobre las tasas de interés, el cambio de política de un regulador o la inversión millonaria de una empresa. Expongamos el principio básico desde el principio: la inteligencia artificial es un asistente de análisis, no un investigador. La responsabilidad y la aprobación final de la selección del modelo, la estrategia de identificación, la afirmación de la causalidad, la publicación y las decisiones políticas recae en el experto competente.

Capas del flujo de trabajo empírico y el lugar de la IA

Es útil dividir un estudio empírico en tres capas. La capa de ejecución es el trabajo técnico del día a día: código de limpieza de datos, dibujo de gráficos, formato de tablas, depuración de sintaxis. La capa de método es la decisión analítica: qué modelo, qué estrategia de identificación, qué prueba, qué verificación de supuestos. La capa de interpretación y decisión es el significado de los hallazgos: lo que dice el coeficiente, si es causal, qué significa para las políticas, si debe publicarse. La IA toca las tres capas, pero con diferente autoridad en cada una. En la capa de ejecución, la IA redacta y genera código rápidamente; En la capa de interpretación y decisión, sólo se da información y el experto toma la decisión.

Definamos algunos términos básicos desde el principio. La econometría es la rama que analiza datos económicos y sociales con métodos estadísticos y mide relaciones. La regresión es un método que modela numéricamente la relación de una variable de resultado (variable dependiente) con una o más variables explicativas (variables independientes). El coeficiente es el número que muestra con cuántas unidades de cambio en promedio se asocia un cambio de una unidad en una variable explicativa en la variable de resultado. El valor p es la probabilidad de que el resultado observado (o un resultado más extremo) ocurra por casualidad cuando en realidad no existe ningún efecto. Explicaremos estos conceptos uno por uno en las siguientes unidades; Por ahora, sepa esto: en todos estos, la IA le brinda el modelo, el código y la explicación, pero no toma decisiones científicas.

La siguiente tabla resume la función y el nivel de riesgo de la IA por misión:

Búsqueda

Papel de la IA

Nivel de riesgo

quien aprueba

Escribir código de desinfección de datos

generador de código

bajo

Analista mismo (con pruebas de código)

Borrador de gráfico/tabla

generador de bocetos

bajo

analista

Recordatorio de sintaxis de prueba/modelo

Asistente de referencia

bajo-medio

analista

Proyecto de interpretación de coeficientes.

borrador del escritor

medio

econometrista

Selección de modelo/estrategia de identificación

entrada auxiliar

alto

investigador experto

Reclamación de causalidad

Sólo un borrador, nunca la última palabra.

muy alto

Experto + revisión por pares

Publicación/decisión política

entrada solamente

muy alto

Investigador/institución responsable

Tenga en cuenta una línea de esta tabla: a medida que aumenta el riesgo, el papel de la IA se reduce y crece la aprobación de los expertos.

Por qué la "verificación" es el corazón de este negocio

Los modelos lingüísticos parecen confiar en su respuesta, pero es posible que no estén seguros. En lenguaje técnico, esto se llama alucinación: es la fabricación por parte del modelo de información inexistente en una frase fluida, como si fuera cierta. Para un econometrista, esto es una trampa mortal. El modelo puede darle un número exacto como "La correlación entre desempleo e inflación en Türkiye entre 2015-2020 es 0,62"; Sin embargo, nunca ha visto tus datos y este número está completamente inventado. O podría decir: “El valor p de la prueba de White fue 0,03”; mientras que no realizó ninguna prueba. Puede llamar a una función R con un argumento que en realidad no existe. Canta los tres con la misma fluidez; Lo único que separa el bien del mal es tu conocimiento y tu hábito de verificar.

La disciplina de verificación consta de tres pasos:

  1. Recalcular/ejecutar en su propio entorno: calcule cada número, proporción, resultado de prueba y coeficiente dado por la IA en R/Python con sus propios datos, no desde la memoria de la IA. Utilice la IA para escribir el código, no para recordar el resultado. Ejecute el código y producirá el resultado.
  2. Enlace a la fuente: confíe en libros de texto, artículos sobre métodos y documentos oficiales para conocer las reglas, fórmulas y definiciones de los métodos. Confirme la afirmación de AI "la suposición de esta prueba es" con una fuente confiable.
  3. Filtro estadístico: pruebe con ojos expertos si el resultado contradice la lógica estadística (supuestos, muestra, tamaño del efecto, incertidumbre). Rechazar un resultado "significativo pero absurdo".
Precaución: Incluir un coeficiente, prueba o interpretación generado por IA en un artículo, tesis o nota de política sin validarlo es como publicar un hallazgo no revisado. El hecho de que la salida sea fluida no es cierto; Sólo porque el número parece seguro, no es real.

Privacidad: los microdatos y los datos con licencia están protegidos de forma privada

Los microdatos (registros únicos a nivel de individuo, hogar, empresa o paciente) se utilizan con frecuencia en econometría. La mayoría de estos datos son datos personales y están protegidos por la KVKK (Ley de Protección de Datos Personales) en Turquía y el RGPD en Europa. Además, TurkStat, los bancos centrales, los proveedores de datos de panel y las fuentes comerciales suelen proporcionar datos con un acuerdo de uso de datos; Estos acuerdos prohíben la transferencia de datos a terceros. Pegar una tabla que contiene información de identidad, ingresos, salud o secretos de la empresa en una herramienta pública de chat de IA es tanto una violación de KVKK/GDPR como una violación de contrato; porque los datos van a un servidor externo y pueden usarse en el entrenamiento de modelos en algunas herramientas.

La regla es simple: mantenga los datos en su propio entorno seguro, solicite a la IA solo código y métodos. El flujo de trabajo ideal es este: solicite a la IA el código de análisis, usted ejecuta el código con los datos reales en su propia computadora/servidor empresarial. Si realmente debe compartir datos, anónimo (elimine los campos de identificación), agregue (promedio/conteo en lugar de individual) y elija herramientas que sean institucionales, tenga un acuerdo de procesamiento de datos y no use sus datos en educación.

tres mini casos

Caso 1: Uso seguro y eficiente. Un investigador primero pasó 6 horas limpiando manualmente 40.000 filas de datos del presupuesto familiar. Sin compartir los datos en absoluto, simplemente describió los nombres y la estructura de las variables a la IA y solicitó un código de limpieza. La IA generó un script R; El investigador ejecutó el código en su propio entorno, verificó el número de líneas y las estadísticas resumidas de cada paso y corrigió dos errores lógicos. Duración: 70 minutos en lugar de 6 horas. Los datos nunca salieron; La responsabilidad quedó en manos del investigador.

Caso 2: trampa numérica no verificada. "¿Cuál es la elasticidad entre el crecimiento del PIB y la inversión extranjera directa?", preguntó un estudiante de posgrado a AI. La IA dio con confianza una cifra de "aproximadamente 0,34" a pesar de que no tenía acceso a ningún dato. El estudiante escribió esto en el resumen de literatura; Cuando su asesor preguntó sobre la fuente, resultó que la cifra no tenía fundamento y era completamente inventada. Error: esperar estadísticas concretas de la IA sin proporcionarle datos ni recursos.

Caso 3 — Confidencialidad e incumplimiento de contrato. Un analista cargó Excel, que recibió de un panel de una empresa autorizada, que contiene el nombre de la empresa y su facturación, en una herramienta de inteligencia artificial disponible públicamente y dijo "hacer regresión del panel". El contrato del proveedor de datos prohibía la transferencia de datos a sistemas de terceros; El incidente provocó una revisión de cumplimiento. La forma correcta era reemplazar los nombres de las empresas con códigos anónimos o no compartir datos y solo solicitar el código de regresión del panel y ejecutarlo en su propio entorno.

Aviso débil / Aviso fuerte

Aviso débil:

Analice la relación entre inflación y desempleo y enuncie el coeficiente.

Esta afirmación es errónea: no se proporcionaron datos a la IA, no está claro qué país, qué período, qué modelo. La IA sólo puede responder con un coeficiente inventado.

Potente mensaje:

Su función: usted es un asistente de análisis que asiste al investigador en econometría. NO comparto los datos contigo; Solo quiero código R EJECUTABLE. Tengo panel anual: variables país, año, desempleo, inflación (todo numérico). Tarea: 1) escribir un código de regresión de panel de efectos fijos para desempleo ~ inflación (paquete plm), 2) explicar cada paso del código con una línea de comentario, 3) tener en cuenta que el coeficiente debe interpretarse como relacional, no CAUSAL, 4) inventar el argumento de función del que no está seguro; Ejecutaré y verificaré el resultado en mi propio entorno.

En esta solicitud no se comparten datos, queda claro el rol, los paquetes, la expectativa de comentarios y la prohibición de "fabricación". Aún debe ejecutar y verificar el resultado usted mismo.

La siguiente tabla resume las reglas de una oración en esta lección:

principio

¿Qué significa?

La IA es un asistente

La decisión científica y la responsabilidad son del experto.

Solicite el código, produzca el resultado.

La IA no recuerda el número; lo ejecutas y calculas

mantener datos

Los datos micro/licenciados no salen del entorno seguro

verificar

Se verifica cada problema, código, comentario; se rechaza la fabricación

Errores comunes

  • Esperar estadísticas concretas de la IA sin dar datos. El modelo no puede acceder a los datos; El coeficiente, la correlación y el valor p que proporciona son falsos. Solicite siempre el código y produzca el resultado usted mismo.
  • Depender de funciones alucinatorias. La IA puede sugerir una función o argumento de R/Python que no existe. No acepte el código sin ejecutarlo y verificarlo.
  • Subida de microdatos a herramienta pública. Es una violación de KVKK/GDPR y del acuerdo de uso de datos. Anonimice los datos o no los comparta en absoluto.
  • Confundir fluidez con precisión. Una reseña bien escrita puede ser inexacta. La belleza de la frase no es una prueba.
  • Aceptar lenguaje causal sin control. YZ suele decir “X aumenta Y”; mientras que la mayoría de las regresiones sólo muestran relaciones. Defender la afirmación causal con diseño.
Consejo: cuando trabaje con IA, hágase esta pregunta: "Si un árbitro o auditor solicita este resultado, ¿puedo mostrar la fuente y el relato?" Si la respuesta es no, la salida aún no está lista para su uso.

En resumen

La IA proporciona una aceleración real y masiva en la capa de ejecución (código, limpieza, gráfico, borrador) del flujo de trabajo de econometría y estadística; sin embargo, la selección del modelo, la causalidad, la interpretación, la publicación y las decisiones políticas pertenecen al experto. Tres disciplinas básicas: no recordarle el número a la IA, solicitar el código y generar y verificar el resultado usted mismo; no elimine datos micro/licenciados del entorno seguro; filtrar estadísticamente cada salida. Un resultado de IA no verificado es tan riesgoso como un hallazgo no revisado.

Tarea de aplicación

Considere su propio conjunto de datos (o un ejemplo). Pídale a la IA código R o Python que produzca estadísticas descriptivas y un gráfico simple simplemente describiendo la estructura de la variable, sin compartir los datos. Ejecute el código entrante en su propio entorno. Luego mantenga una lista de verificación: (1) el código se ejecutó sin errores, (2) es el número de líneas/observaciones que esperaba, (3) cuál de las oraciones de comentarios de la IA usa lenguaje causal y debe corregirse. En un párrafo, escribe sobre la vez que la IA te salvó y al menos un error que detectaste.

lista de verificación

  • [] No hice que la IA pidiera estadísticas concretas; Solicité el código y produje el resultado yo mismo.
  • [] Volví a calcular cada número y resultado de prueba que dio en mi propio entorno.
  • [] Verifiqué que las funciones/argumentos que utiliza realmente existen.
  • [] No subí datos micro/personales/con licencia a una herramienta pública.
  • [] Marqué los comentarios que contenían lenguaje causal y los moví al lenguaje relacional.
  • [ ] Puedo mostrar la fuente y la contabilidad del resultado a un auditor.