Câștiguri:
- Abilitatea de a distinge fluxul de lucru în șase etape al științei datelor (definirea problemei, colectarea, curățarea, descoperirea, modelarea, comunicarea) și autoritatea sub care funcționează inteligența artificială în fiecare etapă, în funcție de nivelul de risc al sarcinii
- Abilitatea de a aplica o disciplină care verifică fiecare ieșire de inteligență artificială conectându-l la sursă, rulând-o și comparând-o și trecând-o printr-o filtrare expertă.
- Abilitatea de a transforma principiile de reproductibilitate și de confidențialitate (scrierea în cod, anonimizarea) în obiceiuri de analiză din prima zi
Datele brute, dezordonate și adesea „mincinoase” ajung zilnic pe biroul unui cercetător de date. În tabelul de vânzări, coloana de dată este scrisă în trei formate diferite; numerele clienților sunt goale în unele rânduri; Numele unei coloane este „venit”, dar conține atât valori TL, cât și USD. Sarcina științei datelor este să ia o decizie de încredere din acest haos: să colecteze datele, să le curețe, să le exploreze, să construiască un model, să valideze rezultatul și să le transforme într-o poveste. Inteligența artificială (AI sau AI pentru scurt – sisteme de computer care pot genera text și cod, recunoaște modele, rezuma și face predicții) poate atinge fiecare verigă din acest lanț: scrierea codului de curățare în câteva minute, recomandarea de grafice pentru analiză exploratorie, interpretarea valorii unui model, corectarea unei interogări SQL. Dar aceeași IA vă poate oferi și o fabricație sigură, cum ar fi „corelația 0,72” pentru date pe care nu le-a văzut niciodată.
Această primă unitate nu este o introducere în bibliotecă. Scopul său este de a clarifica unde să puneți AI în fluxul de lucru al științei datelor și unde să nu o puneți niciodată. Să expunem principiul de bază de la început: AI este un asistent, nu un cercetător de date. Decizia cu privire la ce date să colecteze, la ce măsură să decidă, dacă să punem un model în producție și unde să trasăm limite etice revine expertului competent. O ieșire AI neverificată este riscantă, la fel ca un raport de analiză nesemnat.
Flux de lucru pentru știința datelor: hartă de la capăt la capăt
Pentru a înțelege un proiect de date, este util să îl împărțim în șase faze. Întregul modul urmează această hartă.
1. Definirea problemei: Ce măsurăm, de ce, pentru a sprijini ce decizie? Această fază nu este delegată AI; Este persoana care definește postul.
2. Colectarea datelor: Identificarea surselor, extragerea datelor, eșantionarea. (Unitatea 2)
3. Curățarea și preprocesarea datelor: valoare lipsă, valori aberante, conversie de tip. (Unitatea 3)
4. Analiza exploratorie a datelor (EDA - Exploratory Data Analysis, etapa recunoașterii distribuției și relațiilor datelor „pe ochi”): (Unitatea 4)
5. Ingineria și modelarea caracteristicilor: generare de variabile, selecție algoritm, antrenament, evaluare. (Unitatea 5, 6, 7)
6. Comunicare și producție: Vizualizare, poveste, MLOps (disciplina de a prelua modelul live și de a-l monitoriza). (Unitatea 8, 11)
AI operează cu o autoritate diferită în fiecare dintre aceste șase etape. Tabelul de mai jos rezumă această distribuție a autorității; Acesta este cel mai important tabel al modulului.
Scena
Rolul AI
Nivel de risc
Cine aprobă
Definirea problemei
partener de brainstorming
scăzută
Data scientist + stakeholder
Scrieți un cod de curățare
Generator de schițe de cod
mediu
Data scientist (citește codul)
Comentariu EDA
sugerator de modele
mediu
cercetător de date
Generare de caracteristici
Generator de idei și coduri
mediu-înalt
Controlul scurgerilor este o necesitate
Selectarea modelului/metric
consultant
înalt
cercetător de date
Decizia de punere în producție
intrare auxiliară
foarte sus
Echipa + proprietar de afaceri
Aprobare de etică/confidențialitate
stimulent
foarte sus
uman, mereu
Țineți minte singura propoziție din acest grafic: pe măsură ce miza crește, rolul AI se micșorează și aprobarea umană crește.
De ce verificarea este inima acestei afaceri
Modelele de limbaj AI par sigure, dar este posibil să nu fie sigure. În limbajul tehnic, aceasta se numește halucinație: este fabricarea de către model a informațiilor inexistente într-o propoziție fluentă ca și cum ar fi adevărată. În știința datelor, acest lucru vine în trei forme. Primul este un număr fals: dacă întrebi modelul „care este suma medie a comenzii” fără a oferi date, acesta îți va spune cu încredere un număr, deși nu ți-a văzut niciodată datele. A doua este o funcție care nu există: modelul poate sugera o funcție care nu există deloc, cum ar fi pandas.read_excel_fast(). În al treilea rând, interpretare statistică incorectă: modelul poate repeta fără probleme o eroare statistică clasică, cum ar fi „valoarea p este 0,04, deci ipoteza este corectă în proporție de 96%.
Disciplina de verificare constă în trei etape:
- Link către sursă: fiecare număr, rata și tendință ar trebui să provină din datele tale, nu din memoria AI. Folosiți AI pentru codul care funcționează pe date, nu pentru ca acesta să-și amintească datele.
- Rulați și comparați: rulați fiecare bucată de cod dată de AI; Comparați fiecare măsură pe care o produce cu o linie de bază independentă.
- Filtru expert: testați singur dacă rezultatul contrazice statisticile și cunoștințele de domeniu.
Atenție: A pune o analiză scrisă de AI într-o prezentare fără a o rula și a o citi este ca și cum ai prezenta un raport nesemnat. Doar pentru că codul funcționează nu înseamnă că este corect; Un cod care însumează coloana greșită funcționează și fără erori.
Reproductibilitate: a putea produce același rezultat de două ori
Principiul tăcut, dar critic al științei datelor este reproductibilitatea: atunci când executați din nou o analiză șase luni mai târziu sau pe un alt computer, obțineți același rezultat. Acest risc crește atunci când lucrați cu AI, deoarece atunci când îi spuneți AI „să facă acest grafic” și să îl redați manual, pașii dispar. Regulă: fiecare pas trebuie înregistrat în codul și controlul versiunii (cum ar fi Git); În pașii care implică aleatorie, semințele aleatorii (valoarea inițială a generatorului de numere aleatoare; dacă este fixată, rezultatul va fi repetabil) ar trebui să fie fixată. Vom aprofunda acest subiect în Unitatea 10; Deocamdată, ia acest obicei: „Nu faceți clic de mână, scrieți în cod”.
trei mini cutii
Cazul 1 — Accelerație sigură. Un analist de comerț electronic ar petrece, în mod normal, o jumătate de zi pentru a șterge un tabel de comenzi de 240 de mii de rânduri. El a dat numele coloanelor și primele 5 rânduri (fără date personale) AI și a cerut codul de curățare a panda. AI a produs schița în 8 secunde; Analistul a citit codul linie cu linie, a remediat o eroare în analiza datei și a rulat-o. Durata: 35 de minute în loc de 4 ore. AI a furnizat codul, verificarea a rămas la om.
Cazul 2 — Capcana metrică inventată. Un stagiar a întrebat AI: „Cât de precisă este pădurea aleatoare pe aceste date?” fără a antrena deloc modelul. „Aproximativ 89%”, a spus AI. Internul a pus acest lucru în prezentare; Când modelul real a fost antrenat, precizia a fost de 71%. Greșeală: așteptarea valorilor fără a oferi date și modele AI.
Cazul 3 — Scurgere silențioasă. O echipă a implementat ideea sugerată de AI de „adăugați media variabilei țintă ca caracteristică” fără a o pune sub semnul întrebării. Modelul a avut rezultate de 98% pe setul de testare, dar s-a prăbușit în producție, deoarece caracteristica scurgea informații viitoare (scurgere de date, Unitatea 10). Greșeală: Nu filtrarea statistică a recomandării AI.
Prompt slab / Prompt puternic
Prompt slab:
Analizați aceste date de vânzări și spuneți-mi venitul mediu.
Această afirmație este eronată: AI nu au primit date, așa că „venitul mediu” poate fi doar recuperat. Nici coloanele, nici perioada, nici moneda nu sunt clare.
Solicitare puternică:
Rolul tău: asistent care ajută un cercetător de date. Am un panda DataFrame: df. Coloane:- data_comandă (text, în formatul „2024-03-01”)- cantitate_tl (zecimală, NaN pe unele rânduri)- id-client (întreg) Sarcină: (1) scrie codul Pandas care calculează suma medie, (2) explică cum gestionează valorile NaN, (3) enumera ipotezele pe care le face codul. Nu inventați conținutul datelor; doar generează cod și voi rula și verific rezultatul.
În această cerere, schema, așteptarea și „interzicerea fabricării” sunt clare. Încă rulați și verificați singur rezultatul.
Începuturile eticii și confidențialității
Știința datelor lucrează adesea cu date personale: înregistrările clienților, pacienților, angajaților. KVKK (Legea privind protecția datelor cu caracter personal) în Türkiye și GDPR în Europa protejează aceste date. Lipirea numelui, ID-ului, e-mailului sau adresei dvs. reale într-un instrument public AI este o încălcare. Regulă: anonimizați datele înainte de partajare, furnizați doar schema (numele coloanelor, tipurile) și un exemplu de rând fals dacă este necesar. Vom aprofunda subiectul eticii în Unitatea 11; Să punem principiul de la început: pentru a înțelege datele, este deseori suficient să împărtășiți structura, nu conținutul.
Greșeli comune
- Așteptați numere/valori fără a oferi date AI. Modelul nu poate accesa datele; Numărul pe care îl dă este fals. Aveți întotdeauna rezultatul calculat și rulați.
- Crezând că codul de lucru este corect. Codul care manipulează coloana greșită rulează și fără erori; Nu ai încredere fără să citești logica.
- Lipirea datelor personale reale în instrumentul deschis. Numele, numărul ID, e-mailul nu sunt niciodată partajate; Diagrama este suficientă.
- Faceți pașii manual și nu le scrieți în cod. Analiza care nu este reproductibilă este nesigură.
- Acceptând interpretarea AI a statisticilor fără îndoială. AI poate repeta greșelile clasice în concepte precum valoarea p și corelația.
Sfat: Includeți o scurtă „linie de regulă” în fiecare dintre sesiunile dvs. de AI: „Nu creați conținutul datelor; doar generați cod/analiza și voi rula și voi verifica rezultatul; indicați „nu sunt sigur” unde nu sunteți sigur.” Această singură propoziție reduce semnificativ riscul de halucinații.
În concluzie
AI este un asistent puternic în știința datelor: accelerează codul de curățare, interpretarea EDA, recomandarea modelului și vizualizarea. Dar definirea problemei, selecția metrică, decizia de producție și limitele etice aparțin oamenilor. Fluxul de lucru are șase etape, iar rolul AI devine mai mic pe măsură ce riscul crește. Trei obiceiuri stau la baza tuturor: legarea surselor (validare), reproductibilitatea (codificarea) și anonimizarea (confidențialitatea). Odată ce le interiorizați pe acestea trei, fiecare instrument din restul modulului devine un accelerator sigur pentru dvs.
Sarcina de aplicare
Doar faceți o schemă a unui tabel mic pe care îl aveți (sau unul ipotetic): nume de coloane, tipuri și 2-3 rânduri exemple simulate (fără date personale reale). Solicitați AI un cod rezumat al statisticilor folosind șablonul „Prompt puternic” de mai sus. Rulați codul, comparați rezultatul cu o valoare manuală, verificați orice presupunere falsă și notați-vă constatările în 5 puncte.
lista de verificare
- [ ] Tocmai am dat AI o schemă și un eșantion fals în loc de date personale reale?
- [ ] Am citit și am rulat codul pe care l-a produs linie cu linie?
- [ ] Am verificat independent fiecare număr din rezultat?
- [ ] Am scris fiecare pas al analizei în cod și am făcut-o repetabilă?
- [ ] Am determinat nivelul de risc al misiunii și am atribuit decizia finală unui om?