Ganancias:
- Capacidad para producir estadísticas descriptivas y gráficos de distribución/relación con soporte de inteligencia artificial y elegir el tipo de gráfico correcto según los datos y la pregunta.
- Capacidad para reconocer elecciones engañosas (eje discontinuo, escala inapropiada, suavizado excesivo) en imágenes producidas por inteligencia artificial y aplicar principios de visualización honestos.
- Poder distinguir que el análisis exploratorio es para generar hipótesis y la trampa de hacer descubrimiento y confirmación con los mismos datos (lo que abre la puerta al p-hacking).
Después de limpiar los datos, el primer trabajo del investigador empírico es llegar a conocerlos. Esta etapa se llama análisis exploratorio de datos (EDA - Exploratory Data Analysis): es el proceso de examinar los datos con gráficos y estadísticas resumidas y ver su estructura, patrones y sorpresas. El objetivo no es probar una hipótesis todavía, sino familiarizarse con los datos, generar preguntas y sentar las bases para el modelo que construirá en el futuro. En esta unidad, veremos cómo la inteligencia artificial (IA) acelera la EDA y la visualización, pero por qué los gráficos que produce deben auditarse cuidadosamente.
Primero hagamos dos distinciones básicas. Primero, la estadística descriptiva (números que resumen datos como media, mediana, desviación estándar, cuartiles) y la visualización (que muestra gráficamente la misma información) se complementan entre sí; Juntos describen los datos. En segundo lugar, y lo más importante: hay que distinguir entre descubrimiento y confirmación. El análisis exploratorio sirve para generar hipótesis; Explorar la hipótesis con los mismos datos y decir "La probé y la encontré significativa" abre la puerta al p-hacking, que veremos en la siguiente unidad. Es gratis mirar los datos y ver un patrón; Pero declarar que ese patrón es un "hallazgo probado" en los mismos datos es engañoso.
Análisis exploratorio paso a paso
1. Vista univariada. Examine cada variable individualmente: ¿su distribución es simétrica o asimétrica? cuantas colinas hay; ¿Dónde están los valores atípicos? Para variables numéricas, histograma (gráfico que muestra la frecuencia dividiendo los valores en rangos) y diagrama de caja (gráfico de caja: gráfico que muestra la mediana, el cuartil y los valores extremos); Para variables categóricas, utilice tablas de frecuencia y gráficos de barras.
2. Vista bivariada. Vea la relación entre dos variables: diagrama de dispersión para dos variables numéricas (muestra cada observación como un punto en el plano xy), diagrama de caja agrupado para numérico-categórico, tabla cruzada para dos categóricos. Antes de mirar el coeficiente de correlación, asegúrese de mirar el diagrama de dispersión: la misma correlación puede mostrar patrones muy diferentes (el famoso cuarteto de Anscombe lo demuestra; cuatro conjuntos de datos tienen estadísticas casi idénticas, pero cuando se trazan resultan ser completamente diferentes).
3. Elija el tipo de gráfico correcto. El tipo de gráfico depende de su pregunta y tipo de datos. Histograma de distribución; esparcirse por la relación; gráfico de líneas para cambios a lo largo del tiempo; gráfico de barras para comparación de categorías; (cuidadosamente) barra apilada para la proporción de partes al todo. La IA genera código rápidamente para usted, pero la decisión de "qué gráfico para cada pregunta" es suya.
4. Tenga en cuenta el patrón, no declare resultados. Registre cualquier patrón interesante que vea como una "nota de descubrimiento", pero no lo considere un hallazgo confirmado. La confirmación se realiza en un paso separado, preferiblemente con datos separados o un cronograma predeterminado.
Principios de visualización honestos
El gráfico convence; Por tanto, su poder engañoso también es elevado. La IA puede tomar decisiones estéticas pero a veces engañosas. Consulte estas políticas:
- En los gráficos de barras, el eje y debe comenzar en cero. El eje discontinuo muestra diferencias pequeñas como grandes.
- La escala debe ser consistente. Si se comparan dos gráficos, utilice el mismo rango de ejes.
- El suavizado excesivo puede ocultar el verdadero patrón. Una línea de tendencia se ve bien, pero si "suaviza" demasiado los datos, puede ser engañosa.
- El color y la decoración 3D distorsionan la atención, no los datos. Elija la simplicidad.
- Los datos faltantes y el tamaño de la muestra deben ser visibles. "n=12" y "n=12.000" no deberían tener el mismo aspecto.
Atención: El hecho de que los gráficos producidos por la IA sean hermosos no es cierto. El error más común que comete es no comenzar el eje desde cero en el gráfico de barras y exagerar la diferencia entre los dos grupos. Compruebe siempre el eje.
Cuadro comparativo: pregunta → cuadro
preguntar
tabla correcta
Error común
¿Cómo se distribuye esta variable?
Histograma/diagrama de caja
usar gráfico circular
¿Están relacionadas dos variables numéricas?
diagrama de dispersión
Solo mirando el número de correlaciones
¿Cómo ha cambiado con el tiempo?
gráfico de líneas
Contar una tendencia con un gráfico de barras
¿Cuál es la diferencia entre grupos?
Caja/barra agrupada (desde cero)
Varilla de eje truncado
¿Relación parte-todo?
Barra apilada (con precaución)
Gráfico circular de múltiples sectores
Cuatro indicaciones copiables
1. Código de descubrimiento automático:
Su función: asistente de la EDA. No comparto los datos, quiero el código R (ggplot2). Hay variables numéricas (ingresos, edad, gastos) y categóricas (región, educación) en el marco de datos de 'datos'. Tarea: escribir código que produzca un histograma para cada número, un gráfico de barras para cada categórico y un diagrama de dispersión para los ingresos y la edad. En los gráficos de barras, deje que el eje y comience desde CERO. Agregar línea de comentario.
2. Revisión de correlación (correlación + visual juntos):
Escriba un código que calcule la correlación de Pearson para ingresos y gastos y trace un diagrama de dispersión + tendencia lineal. Agregue una línea de comentario que me recuerde examinar el gráfico antes de CONFIAR en el recuento de correlación (advertencia de Anscombe). No suavices demasiado la línea de tendencia.
3. Auditoría de integridad:
Consulte el siguiente código ggplot para una visualización honesta:[código]. Verifique y corrija lo siguiente: ¿el eje y comienza desde cero, la escala es consistente, el tamaño de la muestra es visible, hay un suavizado excesivo? Explica la justificación de cada corrección que hiciste.
4. Elaborar una nota de descubrimiento (no un hallazgo):
Con base en los gráficos que produzco, enumere OBSERVACIONES como una 'nota de descubrimiento'; escriba cada elemento en el lenguaje de "hipótesis a probar", no de "hallazgo concluyente". Ejemplo: 'Los ingresos en la educación superior PARECE más repartidos; debe probarse con datos separados.' Evite declaraciones causales y definitivas.
Aviso débil / Aviso fuerte
Aviso débil:
Haz bonitos gráficos del rendimiento y dime qué significan.
Este mensaje invita a conclusiones engañosas: “hermoso” se centra en la estética, mientras que “lo que significa” empuja a la IA a saltar del descubrimiento a la conclusión definitiva. Siguen comentarios causales y exagerados.
Potente mensaje:
Su función: asistente honesto de EDA. Tarea: (1) elegir el tipo de gráfico que se adapte a mi pregunta y escribir la justificación, (2) comenzar el eje desde cero en los gráficos de barras, (3) interpretar el resultado en lenguaje NOTA DE DESCUBRIMIENTO: ninguna afirmación definitiva/causal sugiere hipótesis en lenguaje "debe ser probado", (4) avisarme si la muestra es pequeña (n<30). Ejecutaré el gráfico en mi propio entorno y lo verificaré.
Diferencia: una voluntad fuerte justifica el tipo de gráfico, impone reglas de honestidad y no confunde descubrimiento con confirmación.
tres mini casos
Caso 1: exageración del eje discreto. Un analista mostró las puntuaciones de satisfacción de dos ramas (7,8 y 8,0; sobre 10) en un gráfico de barras. Al iniciar el eje YZ desde 7,5, la segunda rama parecía casi dos veces más alta que la primera; mientras que la diferencia fue sólo del 2,5%. La dirección estaba a punto de recompensar a una sucursal que tenía una impresión equivocada. Cuando comencé el eje desde cero la diferencia era casi invisible. Lección: la elección del eje por sí sola cambia la percepción.
Caso 2: Confiar en la correlación y saltarse el gráfico. Un investigador vio r = 0,81 entre dos variables y escribió "fuerte relación lineal". Cuando su consultor le pidió el diagrama de dispersión, vio que la relación en realidad se debía a una única observación extrema, y cuando se eliminó ese punto, la correlación cayó a 0,12. Lección: el recuento de correlaciones no sustituye a un gráfico; Siempre mira la dispersión.
Caso 3: Confundir descubrimiento con confirmación. Un estudiante analizó todas las correlaciones por pares en un conjunto de datos de 40 variables, seleccionó la más alta (r=0,52) y escribió: "encontramos una relación significativa entre educación y ahorro (p=0,004)". Sin embargo, había cientos de pares en 40 variables; elegir el más alto fue un hallazgo falso debido al azar. Lección: el patrón descubierto no puede “probarse y declararse significativo” en los mismos datos; Se requiere confirmación por separado.
Errores comunes
- No iniciar el eje desde cero en el gráfico de barras. Exagera la pequeña diferencia; La mentira visual más común. Comprueba siempre.
- Mirando la correlación y omitiendo el gráfico. La misma correlación proviene de patrones muy diferentes; puede encajar en una relación atípica. Primero, dispersión.
- Considerando el patrón encontrado en el descubrimiento como "evidencia" en los mismos datos. Ésta es la puerta de entrada al p-hacking; La confirmación se realiza por separado.
- Tipo de gráfico incorrecto. Las coincidencias como barra para tendencia y pastel para distribución son engañosas. Elija un género según la pregunta.
- Ocultar el tamaño de la muestra. n=8 y n=8000 no deberían verse iguales en el mismo gráfico; Se debe mostrar la incertidumbre.
Consejo: antes de publicar un gráfico, pregúntese: "¿Cambiaría la historia si cambiara el eje?" Si la respuesta es sí, probablemente iniciaste el giro desde un lugar deshonesto.
En resumen
El análisis de datos exploratorio es la fase de encontrar los datos, ver patrones y generar hipótesis; No es una confirmación. La IA genera rápidamente estadísticas descriptivas y código de gráfico, pero usted elige el tipo de gráfico según su pregunta y controla los principios de equidad (eje cero, escala consistente, incertidumbre aparente). Mire la dispersión antes de confiar en el número de correlación; No declare el patrón que encontró en el descubrimiento como "evidencia" en los mismos datos. Un gráfico hermoso de IA no significa un gráfico correcto.
Tarea de aplicación
Seleccione al menos tres variables en un conjunto de datos. Solicite a la IA y ejecute código que produzca gráficos exploratorios (histograma, dispersión, recuadro) con un mensaje que aplique reglas de honestidad. Para cada gráfico: verifique (1) la idoneidad del tipo de gráfico para la pregunta, (2) la honestidad del eje, (3) la visibilidad del tamaño de la muestra. Escriba al menos una “nota de descubrimiento” en lenguaje de hipótesis (“…parece ser probado por separado”). Examine una correlación tanto con el conteo como con la dispersión e informe si hay una discrepancia entre ellos.
lista de verificación
- [] Elegí el tipo de gráfico según mi pregunta y tipo de datos.
- [] En los gráficos de barras, comienzo el eje y desde cero; Revisé la honestidad del eje.
- [] Miré el diagrama de dispersión antes de confiar en la correlación.
- [] Reflejé el tamaño de la muestra y la incertidumbre en el gráfico.
- [] Escribí los patrones que encontré en la exploración como "hipótesis a probar" en lugar de "evidencia".
- [] Noté que no usaría los mismos datos para la confirmación y que se requería un paso por separado.