Ganancias:
- Capacidad para explorar la distribución, el centro, la dispersión y las anomalías de variables con gráficos apropiados (histograma, diagrama de caja, diagrama de dispersión).
- Capacidad para interpretar correctamente la correlación y leerla junto con el diagrama de dispersión, sin confundirla con causalidad.
- Capacidad para comprender que las estadísticas resumidas pueden ser engañosas (lección de Anscombe) y desarrollar hipótesis que determinen la dirección del modelado.
Antes de construir un modelo, es necesario conocer los datos. Así como un médico no prescribe medicamentos sin examinar al paciente, un científico de datos no construye un modelo sin "examinar" los datos. Este examen se llama análisis exploratorio de datos (EDA para abreviar): es la fase de descubrir la distribución, las relaciones, las sorpresas y las trampas de los datos de forma visual y gráfica. El propósito de EDA es generar hipótesis, detectar errores y determinar la dirección del modelado. La inteligencia artificial es un asistente muy poderoso en esta etapa: sugiere qué gráfico es adecuado, escribe su código, interpreta una distribución. Pero una persona decide, con su conocimiento de campo, si el patrón que ve es real o una coincidencia.
¿Qué busca EDA?
EDA busca respuestas a cuatro preguntas. Distribución: ¿Cómo se distribuye cada variable? ¿Es simétrica, asimétrica o con dos picos? Tendencia central y dispersión: ¿cuáles son la media, la mediana y la desviación estándar? Relaciones: ¿Cómo se relacionan las variables entre sí? Anomalías: ¿Hay valores, lagunas o agrupaciones inesperados? Estas cuatro preguntas determinan qué característica funcionará y qué modelo es apropiado.
Definamos algunos conceptos básicos. Un histograma es una gráfica que divide los valores de una variable numérica en intervalos y muestra cuántas observaciones hay en cada intervalo; Es la forma más rápida de ver la distribución. La asimetría es el desplazamiento de la distribución en una dirección; Variables como el ingreso están sesgadas hacia la derecha (la mayoría es baja, pocas son muy altas). Un diagrama de caja muestra la mediana, los cuartiles y los valores atípicos de un vistazo. Un diagrama de dispersión muestra la relación de dos variables numéricas con una nube de puntos.
Correlación: hay una relación pero cuidado
Correlación: una medida de cómo dos variables se mueven juntas; un número entre -1 y +1 es la herramienta más utilizada e incomprendida de EDA. +1 significa co-aumento perfecto, -1 significa relación inversa perfecta, 0 significa sin relación lineal. Hay dos grandes trampas. Primero, la famosa regla: correlación no es causalidad. Aumentan los casos de asfixia con la venta de helados; no porque uno lleve al otro, sino porque el verano (la tercera variable oculta) desencadena ambos. En segundo lugar, la correlación sólo mide la relación lineal; Puede indicar una relación fuerte pero curvilínea cercana a 0. Por lo tanto, cuando observe la correlación, asegúrese de observar también el diagrama de dispersión.
Precaución: cuando la IA proporciona un número de correlación, puede caer en un lenguaje causal como "A aumenta B". Esto es peligroso. La correlación sólo indica movimiento conjunto; Sólo la experiencia, el conocimiento del dominio y una inferencia cuidadosa establecen la razón.
Cuarteto de Anscombe: ¿por qué no mirar simplemente el número?
Hay un ejemplo famoso en estadística: el cuarteto de Anscombe. Cuatro conjuntos de datos diferentes tienen casi la misma media, la misma varianza y la misma correlación (0,82); Pero cuando se representan gráficamente, se ven completamente diferentes: una línea recta, otra curva, otra nube arrastrada por un único valor atípico. La lección es clara: las estadísticas resumidas son engañosas, mirar el gráfico es imprescindible. La IA puede proporcionar promedios y correlaciones, pero confiar en esos números sin ver el gráfico es caer en la trampa de Anscombe.
La siguiente tabla resume qué cuadro se ajusta a cada pregunta:
Pregunta
gráfico adecuado
que muestra
Distribución de una sola variable
Histograma / KDE
Forma, asimetría, número de vértices.
Centro y valores atípicos
Diagrama de caja
Mediana, cuartiles, valores atípicos
Relación de dos números
gráfico de dispersión
Dirección, fuerza, curvatura.
Comparación de categorías
gráfico de barras
Diferencia entre grupos
cambiar con el tiempo
gráfico de líneas
Tendencia, estacionalidad
relación multivariada
Mapa de calor de correlación
Matriz de relaciones generales
La paradoja de Simpson: los datos agregados pueden mentir
Una trampa furtiva en EDA que hay que tener en cuenta es la paradoja de Simpson: un patrón puede mostrar una dirección cuando se examinan todos los datos juntos, pero inversa cuando los datos se dividen en subgrupos significativos. Ejemplo clásico: la tasa general de aceptación de mujeres solicitantes en una universidad parece ser más baja que la de los hombres; Pero cuando se analiza departamento por departamento, la tasa de aceptación de las mujeres es mayor que la de los hombres en la mayoría de los departamentos. ¿De donde? Las mujeres postularon a departamentos más competitivos (tasas de aceptación más bajas); El número combinado almacena esta variable oculta. La lección es clara: al observar un total o un promedio, asegúrese de comprobar si ese número cuenta la misma historia cuando se desglosa en subgrupos significativos (segmento, período, canal). Cuando la IA le proporciona una tasa combinada, preguntar "¿sigue siendo válida cuando la segmenta?" detectará la mayoría de los resultados engañosos desde el principio.
tres mini casos
Caso 1: Dos colinas escondidas. Un analista encontró que la edad promedio de los clientes era 41 años y los describió como una "multitud de mediana edad". Pero el histograma mostró dos picos: los grupos de edad de 22 a 28 años y de 55 a 62 años. El promedio de 41 en realidad no representaba a nadie. Lección: trazar la distribución antes de confiar en la media.
Caso 2: Correlación espuria. Un equipo encontró una correlación de 0,78 entre “inversión publicitaria” y “ventas” y duplicó el presupuesto. Sin embargo, lo que desencadenó ambas fueron las campañas estacionales; durante el período fuera de campaña, la relación cayó a 0,10. La publicidad adicional de 340 mil TL no produjo el rendimiento esperado. Lección: confundir correlación con causalidad es costoso.
Caso 3: La línea trazada por el único contrario. Un análisis inmobiliario mostró una fuerte relación entre los metros cuadrados y el precio (r=0,80). Cuando se dibujó el diagrama de dispersión, casi toda la relación fue creada por una sola villa de lujo de 12 millones de TL; Cuando se eliminó ese punto, la correlación cayó a 0,31. Lección: lea siempre la correlación junto con el diagrama de dispersión.
Cuatro plantillas copiables
1) Resumen automático de EDA:
Tengo pandas df. Escriba código que produzca: (1) df.info() y df.describe(), (2) histograma para cada columna numérica, (3) recuento para cada columna categórica. No comentes, solo genera el código de descubrimiento; Interpreto los patrones.
2) Correlación + visual (con la salvedad de causalidad):
Escriba código que dibuje una matriz de correlación y un mapa de calor para las columnas numéricas. También dibuja un diagrama de dispersión de los 3 pares más correlacionados. Agregue una línea de comentario al resultado para recordarle que la correlación no implica causalidad. No haga afirmaciones causales.
3) Diagnóstico de distribución:
Para la columna "ingresos_tl": escriba código que produzca histograma, diagrama de caja, valor de asimetría y comparación mediana/media. Interpretaré si la distribución está sesgada o no; solo da el código.
4) Comparación de segmentos:
Compare clientes por "canal" (web/móvil): escriba código que produzca un diagrama de caja del monto promedio, el monto mediano, el número de pedidos y la distribución del monto para cada canal. Sugiero qué prueba es apropiada para la significación estadística de la diferencia entre los dos canales, pero la decisión depende de mí.
Aviso débil / Aviso fuerte
Aviso débil:
Encuentra algo interesante en estos datos.
"Interesante" no está definido; La IA no ve los datos, por lo que los inventa o hace declaraciones generales. No hay dirección, ni variables, ni propósito.
Potente mensaje:
Su función: asistente de la EDA. columnas df: edad (int), ingresos_tl (flotante), ciudad (categoría), canal (web/móvil), cantidad (flotante). Finalidad: descubrir los factores que afectan a la "cantidad". Tarea: (1) código que traza la distribución del monto, (2) gráficos de distribución entre monto, edad e ingresos_tl, (3) diagrama de caja del monto en el desglose del canal. Establecer una reclamación causal; Simplemente genera el código de descubrimiento y yo interpretaré el patrón.
Aquí quedan claros el propósito, las variables y el límite de “reivindicar causalidad”.
Errores comunes
- Basándose únicamente en estadísticas resumidas. Como muestra el cuarteto de Anscombe, la misma media esconde distribuciones muy diferentes; ver cuadro.
- Confundir correlación con causalidad. La coacción no indica que una lleve a la otra; Cuidado con las variables ocultas.
- Observando la correlación sin un diagrama de dispersión. Un solo valor atípico o curvilinealidad confunde el número.
- Resumiendo una distribución de dos picos/sesgada con la media. Es posible que el promedio no represente a nadie.
- Saltándose EDA y yendo directo al modelo. Los datos no reconocidos significan un modelo ciego.
Consejo: con cada nuevo conjunto de datos, dedique los primeros 30 minutos a dibujar gráficos: histograma de cada número, diagrama de dispersión de pares significativos, gráfico de barras de categorías. Estos 30 minutos evitan futuros errores de modelado en los próximos días.
En resumen
EDA es la fase de conocimiento de los datos antes de construir un modelo y busca respuestas a cuatro preguntas: distribución, dispersión central, relaciones y anomalías. Las estadísticas resumidas pueden ser engañosas; mirar el gráfico es imprescindible (conferencia de Anscombe). La correlación es una herramienta poderosa, pero la causalidad no lo es y definitivamente debe leerse junto con un diagrama de dispersión. La IA es un gran acelerador para sugerir gráficos y escribir código; Pero la gente interpreta con su conocimiento de campo si el patrón que ven es real o una coincidencia.
Tarea de aplicación
Elija un conjunto de datos y simplemente haga EDA: extraiga un histograma de al menos tres variables numéricas, un diagrama de dispersión de dos pares de variables y un mapa de calor de correlación. Encuentre al menos una “sorpresa” (como una distribución con dos picos, un candidato a correlación espuria, una relación atraída por un único valor atípico) y explíquela en una oración. Escriba sin hacer afirmaciones causales.
lista de verificación
- [ ] ¿He graficado la distribución de cada variable numérica?
- [] ¿Miré las correlaciones con el diagrama de dispersión?
- [] ¿He mantenido separadas la causalidad y la correlación?
- [] ¿No noté distribuciones sesgadas o con dos picos y confié ciegamente en la media?
- [ ] ¿He derivado al menos un aspecto/hipótesis del modelado a partir de mis hallazgos de EDA?