Ganancias:
- Capacidad para distinguir el flujo de trabajo de seis etapas de la ciencia de datos (definición de problemas, recopilación, limpieza, descubrimiento, modelado, comunicación) y la autoridad bajo la cual trabaja la inteligencia artificial en cada etapa, según el nivel de riesgo de la tarea.
- Capacidad para aplicar una disciplina que verifica cada salida de inteligencia artificial conectándola a la fuente, ejecutándola, comparándola y pasándola por un filtrado experto.
- Capacidad de convertir los principios de reproducibilidad y privacidad (escritura en código, anonimización) en hábitos de análisis desde el primer día.
Todos los días, datos sin procesar, confusos y, a menudo, “mentirosos” llegan al escritorio de un científico de datos. En la tabla de ventas, la columna de fecha está escrita en tres formatos diferentes; los números de clientes están en blanco en algunas líneas; El nombre de una columna es "ingresos", pero contiene valores tanto en TL como en USD. El trabajo de la ciencia de datos es tomar una decisión confiable a partir de este caos: recopilar los datos, limpiarlos, explorarlos, construir un modelo, validar el resultado y convertirlo en una historia. La inteligencia artificial (IA, o IA para abreviar: sistemas informáticos que pueden generar texto y código, reconocer patrones, resumir y hacer predicciones) puede tocar cada eslabón de esta cadena: escribir código de limpieza en minutos, recomendar gráficos para análisis exploratorios, interpretar la métrica de un modelo, corregir una consulta SQL. Pero la misma IA también puede brindarle una fabricación confiable, como una "correlación de 0,72", para datos que nunca ha visto.
Esta primera unidad no es una introducción a la biblioteca. Su propósito es aclarar dónde colocar la IA en el flujo de trabajo de la ciencia de datos y dónde nunca colocarla. Expongamos el principio básico desde el principio: la IA es un asistente, no un científico de datos. La decisión de qué datos recopilar, qué métrica decidir, si poner un modelo en producción y dónde trazar límites éticos recae en el experto competente. Un resultado de IA no verificado es riesgoso, al igual que un informe de análisis no firmado.
Flujo de trabajo de ciencia de datos: mapa de un extremo a otro
Para comprender un proyecto de datos, resulta útil dividirlo en seis fases. Todo este módulo sigue este mapa.
1. Definición del problema: ¿Qué medimos, por qué y para respaldar qué decisión? Esta fase no está delegada a la IA; Es la persona quien define el trabajo.
2. Recolección de datos: Identificación de fuentes, extracción de datos, muestreo. (Unidad 2)
3. Limpieza y preprocesamiento de datos: valor faltante, valor atípico, conversión de tipo. (Unidad 3)
4. Análisis exploratorio de datos (EDA - Exploratory Data Analysis, etapa de reconocer la distribución y relaciones de los datos "a ojo"): (Unidad 4)
5. Ingeniería y modelado de características: Generación de variables, selección de algoritmos, entrenamiento, evaluación. (Unidad 5, 6, 7)
6. Comunicación y producción: Visualización, story, MLOps (disciplina de llevar el modelo en vivo y monitorearlo). (Unidad 8, 11)
La IA opera con una autoridad diferente en cada una de estas seis etapas. La siguiente tabla resume esta distribución de autoridad; Esta es la tabla más importante del módulo.
etapa
Papel de la IA
Nivel de riesgo
quien aprueba
Definición del problema
compañero de lluvia de ideas
bajo
Científico de datos + parte interesada
Escribe un código de limpieza
Generador de bocetos de código
medio
Científico de datos (lee el código)
Comentario de la EDA
sugeridor de patrones
medio
científico de datos
Generación de características
Generador de ideas y códigos.
medio-alto
El control de fugas es imprescindible
Selección de modelo/métrica
consultor
alto
científico de datos
Decisión de poner en producción.
entrada auxiliar
muy alto
Equipo + dueño de negocio
Aprobación de ética/privacidad
estimulante
muy alto
humano, siempre
Tenga en cuenta la única frase de este cuadro: a medida que aumentan los riesgos, el papel de la IA se reduce y la aprobación humana crece.
Por qué la verificación es el corazón de este negocio
Los modelos de lenguaje de IA parecen seguros, pero es posible que no lo sean. En lenguaje técnico, esto se llama alucinación: es la fabricación por parte del modelo de información inexistente en una oración fluida como si fuera cierta. En la ciencia de datos, esto se presenta de tres formas. El primero es un número falso: si le preguntas al modelo "cuál es el importe medio del pedido" sin dar ningún dato, te dirá un número con seguridad, aunque nunca haya visto tus datos. La segunda es una función que no existe: el modelo puede sugerir una función que no existe en absoluto, como pandas.read_excel_fast(). En tercer lugar, interpretación estadística incorrecta: el modelo puede repetir sin problemas un error estadístico clásico como "el valor p es 0,04, por lo que la hipótesis es correcta en un 96%".
La disciplina de verificación consta de tres pasos:
- Enlace a la fuente: cada número, tasa y tendencia debe provenir de sus datos, no de la memoria de la IA. Utilice IA para código que opere con datos, no para que recuerde datos.
- Ejecute y compare: ejecute usted mismo cada fragmento de código proporcionado por la IA; Compare cada métrica que produce con una línea de base independiente.
- Filtro experto: compruebe usted mismo si el resultado contradice las estadísticas y el conocimiento del dominio.
Precaución: poner un análisis escrito por la IA en una presentación sin ejecutarlo ni leerlo es como presentar un informe sin firmar. Sólo porque el código funcione no significa que sea correcto; Un código que suma la columna incorrecta también funciona sin errores.
Reproducibilidad: poder producir el mismo resultado dos veces
El principio silencioso pero fundamental de la ciencia de datos es la reproducibilidad: cuando se vuelve a ejecutar un análisis seis meses después o en una computadora diferente, se obtiene el mismo resultado. Este riesgo aumenta cuando se trabaja con IA, porque cuando le dices a la IA que "haga este gráfico" y lo reproduzca manualmente, los pasos desaparecen. Regla: cada paso debe estar registrado en el código y control de versiones (como Git); En los pasos que involucran aleatoriedad, la semilla aleatoria (el valor inicial del generador de números aleatorios; si es fijo, el resultado será repetible) debe ser fija. Profundizaremos en este tema en la Unidad 10; Por ahora, adquiera este hábito: "No haga clic a mano, escriba en código".
tres mini casos
Caso 1: Aceleración segura. Un analista de comercio electrónico normalmente dedicaría medio día a limpiar una tabla de pedidos de 240.000 filas. Le dio los nombres de las columnas y las primeras 5 filas (sin datos personales) a la IA y pidió el código de limpieza de pandas. La IA produjo un borrador en 8 segundos; El analista leyó el código línea por línea, solucionó un error en el análisis de la fecha y lo ejecutó. Duración: 35 minutos en lugar de 4 horas. La IA proporcionó el código, la verificación quedó en manos del humano.
Caso 2: La trampa métrica inventada. Un pasante preguntó a la IA: "¿Qué tan preciso es el bosque aleatorio en estos datos?" sin entrenar el modelo en absoluto. "Aproximadamente el 89%", dijo AI. El pasante puso esto en la presentación; Cuando se entrenó el modelo real, la precisión fue del 71%. Error: esperar métricas sin proporcionar datos y modelos a la IA.
Caso 3: Fuga silenciosa. Un equipo implementó la idea sugerida por la IA de "agregar la media de la variable objetivo como una característica" sin cuestionarla. El modelo tuvo un rendimiento del 98% en el conjunto de prueba, pero falló en producción porque la función estaba filtrando información futura (fuga de datos, Unidad 10). Error: no filtrar estadísticamente la recomendación de IA.
Aviso débil / Aviso fuerte
Aviso débil:
Analice estos datos de ventas y dígame el ingreso promedio.
Esta afirmación es errónea: a la IA no se le proporcionaron datos, por lo que el “ingreso promedio” sólo puede compensarse. Ni las columnas, ni el período, ni la moneda están claros.
Potente mensaje:
Su función: asistente que ayuda a un científico de datos. Tengo un DataFrame de pandas: df. Columnas: - fecha_pedido (texto, en formato "2024-03-01") - cantidad_tl (decimal, NaN en algunas filas) - id_cliente (entero) Tarea: (1) escribir código pandas que calcule la cantidad promedio, (2) explicar cómo maneja los valores NaN, (3) enumerar las suposiciones que hace el código. No invente el contenido de los datos; simplemente genere el código y lo ejecutaré y verificaré el resultado.
En esta solicitud quedan claros el esquema, la expectativa y la "prohibición de fabricación". Aún debe ejecutar y verificar el resultado usted mismo.
Los inicios de la ética y la privacidad
La ciencia de datos a menudo trabaja con datos personales: registros de clientes, pacientes y empleados. KVKK (Ley de Protección de Datos Personales) en Türkiye y GDPR en Europa protegen estos datos. Pegar su nombre real, identificación, correo electrónico o dirección en una herramienta pública de inteligencia artificial es una infracción. Regla: anonimice los datos antes de compartirlos, proporcione solo el esquema (nombres de columnas, tipos) y una fila de ejemplo ficticia si es necesario. Profundizaremos el tema de la ética en la Unidad 11; Pongamos el principio desde el principio: para comprender los datos, a menudo es suficiente compartir su estructura, no su contenido.
Errores comunes
- Esperando números/métricas sin dar datos a la IA. El modelo no puede acceder a los datos; El número que da es falso. Tenga siempre el resultado calculado y ejecútelo.
- Pensando que el código de trabajo es correcto. El código que manipula la columna incorrecta también se ejecuta sin errores; No te fíes sin leer la lógica.
- Pegar datos personales reales en la herramienta abierta. Nombre, número de identificación, correo electrónico nunca se comparten; El diagrama es suficiente.
- Realizar los pasos manualmente y no escribirlos en el código. Los análisis que no son reproducibles no son fiables.
- Aceptar la interpretación de las estadísticas por parte de la IA sin lugar a dudas. La IA puede repetir errores clásicos en conceptos como el valor p y la correlación.
Consejo: incluya una breve "línea de regla" en cada una de sus sesiones de IA: "No invente el contenido de los datos; simplemente genere código/análisis y lo ejecutaré y verificaré el resultado; indique 'no estoy seguro' cuando no esté seguro". Esta única frase reduce significativamente el riesgo de sufrir alucinaciones.
En resumen
La IA es un poderoso asistente en la ciencia de datos: acelera la limpieza del código, la interpretación de EDA, la recomendación de modelos y la visualización. Pero la definición de problemas, la selección de métricas, las decisiones de producción y los límites éticos pertenecen a los humanos. El flujo de trabajo tiene seis etapas y el papel de la IA se reduce a medida que aumenta el riesgo. Tres hábitos son la base de todo: vinculación de fuentes (validación), reproducibilidad (codificación) y anonimización (confidencialidad). Una vez que internalice estos tres, cada herramienta del resto del módulo se convertirá en un acelerador seguro para usted.
Tarea de aplicación
Simplemente haga un esquema de una tabla pequeña que tenga (o una hipotética): nombres de columnas, tipos y 2 o 3 filas de ejemplo ficticias (sin datos personales reales). Solicite a la IA un código de estadísticas resumidas utilizando la plantilla "Potente mensaje" anterior. Ejecute el código, compare el resultado con un valor manual, verifique si hay suposiciones falsas y anote sus hallazgos en 5 viñetas.
lista de verificación
- [] ¿Acabo de darle a la IA un esquema y una muestra falsa en lugar de datos personales reales?
- [] ¿Leí y ejecuté el código que produjo línea por línea?
- [] ¿He verificado de forma independiente cada número en el resultado?
- [] ¿He escrito cada paso del análisis en el código y lo he hecho repetible?
- [ ] ¿He determinado el nivel de riesgo de la misión y he asignado la decisión final a un humano?