Unidade 1 / 11

Introdução à Inteligência Artificial em Ciência e Análise de Dados: Fluxo de Trabalho, Funções, Limites, Validação e Ética

Ganhos:

  • Capacidade de distinguir o fluxo de trabalho de seis estágios da ciência de dados (definição do problema, coleta, limpeza, descoberta, modelagem, comunicação) e a autoridade sob a qual a inteligência artificial trabalha em cada estágio, de acordo com o nível de risco da tarefa
  • Capacidade de aplicar uma disciplina que verifica cada saída de inteligência artificial conectando-a à fonte, executando-a e comparando-a e passando-a por filtragem especializada.
  • Capacidade de transformar princípios de reprodutibilidade e privacidade (escrita em código, anonimato) em hábitos de análise desde o primeiro dia

Dados brutos, confusos e muitas vezes “mentirosos” chegam à mesa de um cientista de dados todos os dias. Na tabela de vendas, a coluna data é escrita em três formatos diferentes; os números dos clientes estão em branco em algumas linhas; O nome de uma coluna é “renda”, mas contém valores em TL e USD. O trabalho da ciência de dados é tomar uma decisão confiável nesse caos: coletar os dados, limpá-los, explorá-los, construir um modelo, validar o resultado e transformá-lo em uma história. A inteligência artificial (IA, ou IA, para abreviar, sistemas de computador que podem gerar texto e código, reconhecer padrões, resumir e fazer previsões) pode tocar todos os elos desta cadeia: escrever código de limpeza em minutos, recomendar gráficos para análise exploratória, interpretar a métrica de um modelo, corrigir uma consulta SQL. Mas a mesma IA também pode fornecer uma fabricação confiável, como “correlação 0,72” para dados que ela nunca viu.

Esta primeira unidade não é uma introdução à biblioteca. Seu objetivo é esclarecer onde colocar a IA no fluxo de trabalho da ciência de dados e onde nunca colocá-la. Vamos expor o princípio básico desde o início: a IA é uma assistente, não uma cientista de dados. A decisão sobre quais dados coletar, qual métrica decidir, se colocar um modelo em produção e onde traçar limites éticos cabe ao especialista competente. Um resultado de IA não verificado é arriscado, assim como um relatório de análise não assinado.

Fluxo de trabalho de ciência de dados: mapa ponta a ponta

Para compreender um projeto de dados, é útil dividi-lo em seis fases. Todo este módulo segue este mapa.

1. Definição do problema: O que medimos, por que, para apoiar qual decisão? Esta fase não é delegada à IA; É a pessoa que define o trabalho.

2. Coleta de dados: Identificação de fontes, extração de dados, amostragem. (Unidade 2)

3. Limpeza e pré-processamento de dados: valor ausente, outlier, conversão de tipo. (Unidade 3)

4. Análise exploratória de dados (EDA - Exploratory Data Analysis, etapa de reconhecimento da distribuição e relações dos dados “a olho”): (Unidade 4)

5. Engenharia e modelagem de recursos: geração de variáveis, seleção de algoritmos, treinamento, avaliação. (Unidade 5, 6, 7)

6. Comunicação e produção: Visualização, história, MLOps (disciplina de levar o modelo ao vivo e monitorá-lo). (Unidade 8, 11)

A IA opera com uma autoridade diferente em cada um desses seis estágios. A tabela abaixo resume esta distribuição de autoridade; Esta é a tabela mais importante do módulo.

Palco

Papel da IA

Nível de risco

Quem aprova

Definição do problema

parceiro de brainstorming

baixo

Cientista de dados + parte interessada

Escreva um código de limpeza

Gerador de esboço de código

médio

Cientista de dados (lê código)

Comentário EDA

sugeridor de padrões

médio

cientista de dados

Geração de recursos

Gerador de ideias e códigos

médio-alto

O controle de vazamento é essencial

Seleção/métrica de modelo

consultor

alto

cientista de dados

Decisão de colocar em produção

entrada auxiliar

muito alto

Equipe + empresário

Aprovação de ética/privacidade

estimulante

muito alto

humano, sempre

Tenha em mente a única frase deste gráfico: à medida que os riscos aumentam, o papel da IA diminui e a aprovação humana aumenta.

Por que a verificação é o coração deste negócio

Os modelos de linguagem de IA parecem seguros, mas podem não ter certeza. Em linguagem técnica, isso é chamado de alucinação: é a fabricação, pelo modelo, de informações inexistentes em uma frase fluente, como se fossem verdadeiras. Na ciência de dados, isso ocorre de três formas. O primeiro é um número falso: se você perguntar ao modelo “qual é o valor médio do pedido” sem fornecer nenhum dado, ele lhe dirá um número com segurança, mesmo que nunca tenha visto seus dados. A segunda é uma função que não existe: o modelo pode sugerir uma função que não existe, como pandas.read_excel_fast(). Terceiro, interpretação estatística incorreta: o modelo pode repetir suavemente um erro estatístico clássico como “o valor p é 0,04, então a hipótese está 96% correta”.

A disciplina de verificação consiste em três etapas:

  1. Link para a fonte: cada número, taxa e tendência deve vir dos seus dados, não da memória da IA. Use IA para código que opera com dados, não para lembrar dados.
  2. Execute e compare: execute você mesmo cada trecho de código fornecido pela IA; Compare cada métrica produzida com uma linha de base independente.
  3. Filtro especialista: teste você mesmo se a saída contradiz as estatísticas e o conhecimento do domínio.
Cuidado: Colocar uma análise escrita pela IA em uma apresentação sem executá-la e lê-la é como apresentar um relatório não assinado. Só porque o código funciona não significa que esteja correto; Um código que soma a coluna errada também funciona sem erros.

Reprodutibilidade: ser capaz de produzir o mesmo resultado duas vezes

O princípio silencioso, mas crítico, da ciência de dados é a reprodutibilidade: quando você executa uma análise novamente seis meses depois ou em um computador diferente, obtém o mesmo resultado. Esse risco aumenta quando se trabalha com IA, porque quando você diz à IA para “fazer esse gráfico” e reproduzi-lo manualmente, as etapas desaparecem. Regra: cada passo deve ser registrado no código e controle de versão (como o Git); Nas etapas que envolvem aleatoriedade, a semente aleatória (o valor inicial do gerador de números aleatórios; se for fixada, o resultado será repetível) deve ser fixada. Aprofundaremos este tema na Unidade 10; Por enquanto, adquira este hábito: “Não clique manualmente, escreva em código”.

três mini cases

Caso 1 — Aceleração segura. Um analista de comércio eletrônico normalmente passaria meio dia limpando uma tabela de pedidos de 240 mil linhas. Ele deu os nomes das colunas e as primeiras 5 linhas (sem dados pessoais) à IA e pediu o código de limpeza do pandas. A IA produziu um rascunho em 8 segundos; O analista leu o código linha por linha, corrigiu um erro na análise de data e o executou. Duração: 35 minutos em vez de 4 horas. A IA forneceu o código, a verificação permaneceu com o humano.

Caso 2 — A armadilha métrica inventada. Um estagiário perguntou à IA: “Quão precisa é a floresta aleatória nesses dados?” sem treinar o modelo. “Cerca de 89%”, disse AI. O estagiário colocou isso na apresentação; Quando o modelo real foi treinado, a precisão foi de 71%. Erro: esperar por métricas sem fornecer dados e modelos à IA.

Caso 3 — Vazamento silencioso. Uma equipe implementou a ideia sugerida pela IA de “adicionar a média da variável alvo como um recurso” sem questioná-la. O modelo teve um desempenho de 98% no conjunto de testes, mas travou na produção porque o recurso estava vazando informações futuras (vazamento de dados, Unidade 10). Erro: não filtrar estatisticamente a recomendação da IA.

Alerta fraco / Alerta forte

Alerta fraco:

Analise esses dados de vendas e me diga a receita média.

Esta afirmação é falha: a IA não recebeu dados, então a “renda média” só pode ser compensada. Nem as colunas, nem o período, nem a moeda são claros.

Alerta poderoso:

Sua função: assistente ajudando um cientista de dados. Eu tenho um DataFrame do pandas: df. Colunas: - order_date (texto, no formato "2024-03-01") - amount_tl (decimal, NaN em algumas linhas) - customer_id (inteiro) Tarefa: (1) escrever o código pandas que calcula o valor médio, (2) explicar como ele lida com valores NaN, (3) listar as suposições que o código faz. Não invente o conteúdo dos dados; basta gerar o código e eu executarei e verificarei o resultado.

Neste pedido ficam claros o esquema, a expectativa e a “proibição de fabricação”. Você ainda executa e verifica a saída sozinho.

Os primórdios da ética e da privacidade

A ciência de dados geralmente trabalha com dados pessoais: registros de clientes, pacientes e funcionários. A KVKK (Lei de Proteção de Dados Pessoais) na Turquia e o GDPR na Europa protegem esses dados. Colar seu nome real, ID, e-mail ou endereço em uma ferramenta pública de IA é uma violação. Regra: anonimize os dados antes de compartilhar, forneça apenas esquema (nomes de colunas, tipos) e linha de exemplo fictícia, se necessário. Aprofundaremos o tema ética na Unidade 11; Vamos colocar o princípio desde o início: para compreender os dados, muitas vezes é suficiente compartilhar sua estrutura, e não seu conteúdo.

Erros comuns

  • Esperar por números/métricas sem fornecer dados à IA. O modelo não pode acessar os dados; O número que ele dá é falso. Sempre tenha o resultado calculado e executado.
  • Pensando que o código de trabalho está correto. O código que manipula a coluna errada também é executado sem erros; Não confie sem ler a lógica.
  • Colando dados pessoais reais na ferramenta aberta. Nome, número de identificação e e-mail nunca são compartilhados; O diagrama é suficiente.
  • Executar as etapas manualmente e não escrevê-las no código. A análise que não é reproduzível não é confiável.
  • Aceitar a interpretação das estatísticas pela IA sem questionar. A IA pode repetir erros clássicos em conceitos como valor p e correlação.
Dica: inclua uma pequena "linha de regra" em cada uma de suas sessões de IA: "Não crie o conteúdo dos dados; apenas gere o código/análise e eu executarei e verificarei o resultado; indique 'não tenho certeza' onde você não tiver certeza." Esta única frase reduz significativamente o risco de alucinações.

Resumindo

A IA é um assistente poderoso na ciência de dados: acelera a limpeza de código, a interpretação de EDA, a recomendação de modelos e a visualização. Mas a definição do problema, a seleção de métricas, a decisão de produção e os limites éticos pertencem aos humanos. O fluxo de trabalho tem seis estágios e o papel da IA ​​diminui à medida que o risco aumenta. Três hábitos são a base de tudo: vinculação de fontes (validação), reprodutibilidade (codificação) e anonimato (confidencialidade). Depois de internalizar esses três, cada ferramenta do restante do módulo se tornará um acelerador seguro para você.

Tarefa de aplicativo

Basta criar um esquema de uma pequena tabela que você possui (ou hipotética): nomes de colunas, tipos e 2 a 3 linhas de exemplo fictícias (sem dados pessoais reais). Peça à IA um código de estatísticas resumidas usando o modelo "Prompt poderoso" acima. Execute o código, compare a saída com um valor manual, verifique se há suposições falsas e anote suas descobertas em 5 marcadores.

lista de verificação

  • [] Acabei de fornecer à IA um esquema e uma amostra falsa em vez de dados pessoais reais?
  • [] Eu li e executei o código produzido linha por linha?
  • [] Verifiquei independentemente cada número na saída?
  • [] Escrevi cada etapa da análise no código e tornei-a repetível?
  • [ ] Determinei o nível de risco da missão e atribuí a decisão final a um humano?