Ganancias:
- Capacidad para reconocer tipos de datos faltantes (MCAR/MAR/MNAR), valores atípicos y errores de codificación y utilizar IA con los datos correctos para producir códigos de limpieza y diagnósticos.
- Capacidad de ver cómo cada paso de limpieza (eliminación, asignación, transformación) sugerido por la inteligencia artificial afectará el resultado del análisis y establecerá un flujo de trabajo reversible y documentado.
- Sostener que las decisiones de limpieza se basan en el conocimiento del proceso que genera datos y que la inteligencia artificial es un asistente supervisado, no un autómata ciego.
Todo analista experimentado sabe una verdad: la mayor parte del tiempo de un proyecto empírico no es modelado, sino limpieza de datos (el trabajo de corregir errores, omisiones e inconsistencias en los datos y prepararlos para el análisis). Como regla general, entre el 70% y el 80% del tiempo se dedica a comprender, limpiar y transformar datos; sólo queda entre un 20 y un 30 % para el análisis real. En esta unidad, veremos paso a paso cómo la inteligencia artificial (IA) alivia esta pesada carga, pero qué decisiones deben seguir siendo tuyas y por qué.
Pongamos primero dos hechos básicos. En primer lugar, las decisiones de limpieza se basan en su conocimiento del proceso que produce los datos: sólo usted sabe por qué falta un valor, por qué un número es demasiado grande. La IA no ve los datos, no conoce el contexto; Escribe código, no toma decisiones. En segundo lugar, cada paso de limpieza puede cambiar el resultado del análisis. Eliminar un valor atípico puede invertir el coeficiente; Completar lo que falta con la media puede reducir artificialmente la varianza. Por lo tanto, la limpieza debe ser reversible y documentada: nunca toque los datos sin procesar, realice cada paso en el código, registre el impacto de cada paso.
Flujo de trabajo de limpieza paso a paso
1. Conozca los datos. Primero vea la estructura: número de filas (observaciones) y columnas (variables), tipo de cada variable (numérica, categórica, fecha), resumen estadístico, número de faltantes. Puedes pedirle a la IA este código de "perfil de datos"; Pero lees el resultado y haces preguntas como "¿por qué esta variable aparece como texto?"
2. Comprender y clasificar los datos faltantes. Los datos faltantes se dividen en tres tipos. MCAR (Missing Completely At Random): la falta no se debe a nada, por ejemplo un sensor falló de forma aleatoria. MAR (Missing At Random): la falta depende de otras variables observadas, por ejemplo las personas mayores dejan una pregunta en blanco con más frecuencia, pero ya sabes la edad. MNAR (Missing Not At Random): la falta depende del valor no observado en sí mismo; por ejemplo, las personas con altos ingresos no declaran sus ingresos. Esta distinción es fundamental porque determina el método de solución y la IA no puede decidirlo por usted.
3. Afrontar la deficiencia. Opciones: eliminación por listas, imputación de media/mediana, imputación múltiple basada en modelos. La eliminación en MCAR es relativamente segura pero reduce el tamaño de la muestra. La asignación múltiple es más apropiada en MAR. Ningún método simple garantiza la imparcialidad en MNAR; Se debe modelar el mecanismo de deficiencia o al menos se debe realizar un análisis de sensibilidad. Llenar la maldad es fácil pero peligroso: reduce la variación, debilita las relaciones y oculta la incertidumbre.
4. Examinar los valores atípicos. Un valor atípico es una observación que se encuentra muy alejada de las demás. Separe las dos preguntas: ¿Es esto un error (se escribió 999 años en la entrada de datos) o es un valor real pero atípico (ingresos de un multimillonario)? Corregir errores; No elimine los valores atípicos verdaderos porque representan datos. Eliminar el valor atípico "porque le molesta" está sesgando los datos hacia el resultado.
5. Codificación y coherencia. Estandarice las categorías ("Masculino", "masculino", "E", todo en un solo código), coloque las fechas en un formato, las unidades en una escala, detecte filas duplicadas. Esta es la fase menos riesgosa en la que la IA ayuda mejor.
6. Documentar y congelar. Registre cada paso con código y una línea de comentario, manteniendo separados los datos sin procesar y los limpios. Entonces, cuando un árbitro pregunta "¿por qué se descartaron estas observaciones?" Tienes tu respuesta lista.
Precaución: No tome decisiones de limpieza basándose en los resultados. Eliminar una línea que dice "Cuando eliminas esta línea, el coeficiente se vuelve significativo" es la forma más insidiosa de p-hacking, que veremos en la siguiente unidad.
Tabla comparativa: métodos de datos faltantes
Método
¿Cuándo es apropiado?
riesgo
Papel de la IA
Eliminar una fila
MCAR, baja tasa de faltantes
La muestra se hace más pequeña, sesgo en MAR/MNAR
Escribe el código; tu decides
Asignación de media/mediana
Análisis preliminar rápido
Reduce la variación, oculta la relación.
Es fácil pero no lo recomiendo; debería advertir
Asignación múltiple (MI)
MAR, variables importantes
Si no se instala correctamente será engañoso
Recomienda código y paquete (ratones)
Modelado de mecanismos
MNAR
Complejo, intensivo en suposiciones
Sólo borrador; se requiere experto
Cuatro indicaciones copiables
1. Elaboración de perfiles de datos:
Su función: asistente de limpieza de datos. No comparto los datos, quiero el código R. Tengo un data.frame llamado 'dígito'; variables: id, edad (numérica), ingresos (numérica), educación (categórica), región (categórica), fecha (fecha). Tarea: escribir código que produzca tipo, número faltante y tasa para cada variable, estadísticas resumidas para las numéricas y tabla de frecuencia para las categóricas. Agregar línea de comentario.
2. Diagnóstico de datos faltantes:
Escriba un código que examine el patrón que falta para los datos de 'dígitos' anteriores: - la tasa de falta de cada variable, - una tabla/gráfico simple que muestre la relación de falta con otras variables. Miraré el resultado del código y haré la distinción MCAR/MAR/MNAR; Usted simplemente produce la herramienta de diagnóstico, NO decide el método de asignación.
3. Inspección de valores atípicos (no eliminación):
Escriba código para la variable 'ingreso' que examine los valores atípicos SIN BORRAR: diagrama de caja, límites basados en IQR y tabla que enumere observaciones + valores atípicos. Veré si estos son errores o son reales. Agregar eliminación automática.
4. Estandarización de codificación:
En la variable 'educación', los valores se escriben mixtos: “Primaria”, “primaria”, “PRIMARIA”, “Secundaria”, “preparatoria”, “Universidad”, “univ”. Escriba código R que los recodifica en categorías consistentes; Muestre la tabla de mapeo claramente para que pueda confirmar cada conversión. Establezca el valor que no reconoce en "DESCONOCIDO".
Aviso débil / Aviso fuerte
Aviso débil:
Limpiar los datos, llenar los vacíos, descartar los valores atípicos.
Esta exigencia es peligrosa: otorga autoridad ciega a la IA. Qué tipo de falta, qué tipo de relleno, qué verdad contradictoria, nada de esto está claro. El resultado puede ser un conjunto de datos secretamente sesgado.
Potente mensaje:
Tu rol: asistente de limpieza, no eres quien toma las decisiones. Vaya paso a paso y escriba código que informe el impacto de CADA paso: 1) muestre el patrón que falta (NO elimine/rellene), 2) enumere los candidatos atípicos (NO elimine), 3) solucione las inconsistencias de categorías con la tabla de mapeo. Imprima el recuento de filas y la estadística resumida después de cada paso para que pueda ver y confirmar el cambio. Inserción automática de asignación/eliminación.
La diferencia es clara: una fuerte voluntad posiciona a la IA como un asistente supervisado, produciendo pasos reversibles y documentados.
tres mini casos
Caso 1: trampa de asignación promedio. A los datos de ingresos de un analista para 5.000 personas les faltaba un 18%. Le dijo a AI que "llenara los vacíos"; La IA los promedió todos. Resultado: la varianza del ingreso disminuyó un 22% y el coeficiente de la relación educación-ingreso resultó ser más débil de lo que era. Manera correcta: la deficiencia era MAR (debido a la educación), tuvo que ser cubierta por asignación múltiple (ratones). Lección: el método de llenado depende del mecanismo.
Caso 2: la limpieza de valores atípicos revierte el hallazgo. Había tres empresas muy grandes (0,6% de la observación total) en los datos de una empresa. Estos fueron eliminados por sugerencia de "limpieza" de la IA; El coeficiente de economías de escala pasó de positivo a negativo. Sin embargo, esas 3 empresas eran reales y una parte importante de la industria. La forma correcta era informar con una estimación completa y sólida en lugar de eliminarlo. Lección: los verdaderos valores atípicos son los datos, no el ruido.
Caso 3: error de codificación silencioso. En un panel, la variable de fecha venía en dos formatos diferentes ("2020-03-01" y "01/03/2020"). Cuando el código de combinación producido por la IA los confundió con valores diferentes, 1.400 observaciones no coincidieron y las tasas de crecimiento se volvieron ridículas. No importaría si el analista no comprobara el recuento de filas. Lección: el recuento de observaciones y los controles de cordura después de cada paso son imprescindibles.
Errores comunes
- Llenando ciegamente el vacío con el promedio. Reduce la varianza, oculta la incertidumbre y crea sesgos en MAR/MNAR. Primero clasifica el mecanismo.
- Eliminando el valor atípico "porque molesta". Los verdaderos valores atípicos representan los datos; eliminar es distorsionar el resultado. Corrija lo que está mal, mantenga lo que es real.
- Aprovechando datos sin procesar. Nunca modifique los datos sin procesar; Realice toda la limpieza con el código en una copia separada para poder revertirlo.
- No medir el impacto de los pasos. Si el recuento de filas y las estadísticas resumidas no se verifican después de cada paso, se acumularán errores silenciosos.
- Limpieza como resultado. La lógica de "Cuando agregas esta línea, el resultado mejora" es p-hacking; La limpieza debe planificarse antes e independientemente del resultado del análisis.
Consejo: mantenga una tabla "antes/después" que coloque las mismas estadísticas básicas (media, mediana, número de observaciones, algunas correlaciones) una al lado de la otra antes y después de la limpieza. Un salto inesperado es el mejor presagio de un error oculto.
En resumen
La limpieza de datos es la fase del trabajo empírico que requiere más tiempo y toma de decisiones. La IA es un poderoso generador de código en esto, pero no puede tomar las decisiones: usted clasifica el tipo de datos faltantes (MCAR/MAR/MNAR), determina si el valor atípico es un error o es real, mantiene cada paso reversible y documentado. En lugar de darle a la IA una autoridad “clara” y ciega, establezca un flujo de trabajo paso a paso cuyo impacto se mida y valide. Verificar el número de observaciones y las estadísticas resumidas después de cada paso es el mejor antídoto contra los errores silenciosos.
Tarea de aplicación
Seleccione al menos dos variables que contengan valores faltantes y atípicos en un conjunto de datos (sus propios datos o un conjunto de muestra). Solicite un código de diagnóstico de la IA a través del mensaje "paso a paso, no eliminar/completar" arriba y ejecútelo. Clasifica la deficiencia como MCAR/MAR/MNAR y escribe tu justificación en una frase. Examina los candidatos contradictorios uno por uno y decide cuál es un error y cuál es real. Finalmente, genere una tabla "antes-después" antes/después de la limpieza e informe si hay algún cambio inesperado.
lista de verificación
- [] Limpié los datos sin procesar en una copia separada sin cambiarlos.
- [ ] Clasifiqué la deficiencia como MCAR/MAR/MNAR y elegí el método en consecuencia.
- [ ] Examiné los valores atípicos uno por uno si eran errores o reales; No lo borré a ciegas.
- [] Verifiqué la cantidad de observaciones y estadísticas resumidas después de cada paso de limpieza.
- [] Documenté todos los pasos con código y una línea de comentario; reversible.
- [ ] Basé la limpieza en el conocimiento del proceso que produce los datos, no en el resultado del análisis.