Enhed 1 / 11

Introduktion til kunstig intelligens i datavidenskab og analyse: Workflow, roller, grænser, validering og etik

Gevinster:

  • Evne til at skelne mellem de seks-trins arbejdsgange inden for datavidenskab (problemdefinition, indsamling, rengøring, opdagelse, modellering, kommunikation) og den autoritet, under hvilken kunstig intelligens fungerer på hvert trin, i henhold til opgavens risikoniveau
  • Evne til at anvende en disciplin, der verificerer hver kunstig intelligens-output ved at forbinde den til kilden, køre og sammenligne den og sende den gennem ekspertfiltrering.
  • Evne til at gøre reproducerbarhed og privatlivsprincipper (skrivning til kode, anonymisering) til analysevaner fra dag ét

Rå, rodet og ofte "løgnagtig" data lander på en dataforskers skrivebord hver dag. I salgstabellen er datokolonnen skrevet i tre forskellige formater; kundenumre er tomme i nogle linjer; Navnet på en kolonne er "indkomst", men den indeholder både TL- og USD-værdier. Datavidenskabens opgave er at træffe en pålidelig beslutning ud af dette kaos: Indsaml dataene, rens dem, udforsk dem, byg en model, valider resultatet og forvandl det til en historie. Kunstig intelligens (AI eller AI for kort – computersystemer, der kan generere tekst og kode, genkende mønstre, opsummere og lave forudsigelser) kan røre ved hvert led i denne kæde: at skrive oprydningskode på få minutter, anbefale grafer til udforskende analyse, fortolke en models metrik, korrigere en SQL-forespørgsel. Men den samme AI kan også give dig en sikker fremstilling såsom "korrelation 0,72" for data, den aldrig har set.

Denne første enhed er ikke en biblioteksintroduktion. Dens formål er at afklare, hvor AI skal placeres i datavidenskabens arbejdsgang, og hvor den aldrig skal placeres. Lad os fastlægge det grundlæggende princip fra begyndelsen: AI er en assistent, ikke en dataforsker. Beslutningen om, hvilke data der skal indsamles, hvilken metrik der skal tages stilling til, om en model skal sættes i produktion, og hvor der skal trækkes etiske grænser, ligger hos den kompetente ekspert. Et ikke-verificeret AI-output er risikabelt, ligesom en usigneret analyserapport.

Data science workflow: ende-til-ende kort

For at forstå et dataprojekt er det nyttigt at opdele det i seks faser. Hele dette modul følger dette kort.

1. Problemdefinition: Hvad måler vi, hvorfor, for at understøtte hvilken beslutning? Denne fase er ikke delegeret til AI; Det er personen, der definerer jobbet.

2. Dataindsamling: Identifikation af kilder, udtræk af data, stikprøveudtagning. (Enhed 2)

3. Datarensning og forbehandling: Manglende værdi, outlier, typekonvertering. (Enhed 3)

4. Eksplorativ dataanalyse (EDA - Exploratory Data Analysis, stadiet for genkendelse af fordelingen og relationerne mellem dataene "ved øjet"): (Enhed 4)

5. Feature engineering og modellering: Variabel generering, algoritmevalg, træning, evaluering. (Enhed 5, 6, 7)

6. Kommunikation og produktion: Visualisering, historie, MLOps (disciplin med at tage modellen live og overvåge den). (Enhed 8, 11)

AI opererer med en anden autoritet i hver af disse seks stadier. Tabellen nedenfor opsummerer denne fordeling af myndighed; Dette er den vigtigste enkelt tabel i modulet.

Scene

AI's rolle

Risikoniveau

Hvem godkender

Problemdefinition

brainstorming partner

lav

Data scientist + stakeholder

Skriv en oprydningskode

Kode skitse generator

medium

Data scientist (læser kode)

EDA kommentar

mønsterforslag

medium

data scientist

Feature generation

Idé- og kodegenerator

medium-høj

Lækagekontrol er et must

Modelvalg/metrik

konsulent

høj

data scientist

Beslutning om at sætte i produktion

hjælpeindgang

meget høj

Team + virksomhedsejer

Etik/privatlivsgodkendelse

stimulerende

meget høj

menneske, altid

Husk den ene sætning fra dette diagram: Efterhånden som indsatsen stiger, skrumper AI's rolle, og menneskelig godkendelse vokser.

Hvorfor verifikation er hjertet i denne virksomhed

AI-sprogmodeller ser sikre ud, men de er måske ikke sikre. På fagsprog kaldes dette hallucination: Det er modellens fremstilling af ikke-eksisterende information i en flydende sætning, som om den var sand. Inden for datavidenskab kommer dette i tre former. Det første er et falsk nummer: Hvis du spørger modellen "hvad er det gennemsnitlige ordrebeløb" uden at give nogen data, vil den trygt fortælle dig et tal, selvom den aldrig har set dine data. Den anden er en funktion, der ikke eksisterer: Modellen kan foreslå en funktion, der slet ikke eksisterer, såsom pandas.read_excel_fast(). For det tredje, ukorrekt statistisk fortolkning: modellen kan uden problemer gentage en klassisk statistisk fejl som "p-værdi er 0,04, så hypotesen er 96% korrekt".

Verifikationsdisciplinen består af tre trin:

  1. Link til kilde: Hvert tal, hastighed og tendens skal komme fra dine data, ikke AI'ens hukommelse. Brug AI til kode, der opererer på data, ikke for at den skal huske data.
  2. Kør og sammenlign: Kør hvert stykke kode givet af AI’en selv; Sammenlign hver metrik, den producerer, med en uafhængig baseline.
  3. Ekspertfilter: Test selv, om outputtet modsiger statistik og domæneviden.
Forsigtig: At indsætte en analyse skrevet af AI i en præsentation uden at køre og læse den er som at præsentere en usigneret rapport. Bare fordi koden virker, betyder det ikke, at den er korrekt; En kode, der summerer den forkerte kolonne, fungerer også uden fejl.

Reproducerbarhed: at kunne producere det samme resultat to gange

Datavidenskabens tavse, men kritiske princip er reproducerbarhed: Når du kører en analyse igen seks måneder senere eller på en anden computer, får du det samme resultat. Denne risiko øges, når du arbejder med AI, for når du fortæller AI'en om at "lave denne graf" og afspille den manuelt, forsvinder trinene. Regel: hvert trin skal registreres i koden og versionskontrollen (som Git); I trin, der involverer tilfældighed, bør det tilfældige seed (startværdien af ​​tilfældig talgeneratoren; hvis det er fast, vil resultatet kunne gentages) fastsættes. Vi vil uddybe dette emne i enhed 10; Indtil videre, få denne vane: "Klik ikke i hånden, skriv i kode."

tre minisager

Tilfælde 1 — Sikker acceleration. En e-handelsanalytiker ville normalt bruge en halv dag på at rydde en ordretabel på 240 tusinde rækker. Han gav kolonnenavnene og de første 5 rækker (uden personlige data) til AI og bad om pandaernes rensekode. AI producerede udkast på 8 sekunder; Analytikeren læste koden linje for linje, rettede en fejl i datoparsing og kørte den. Varighed: 35 minutter i stedet for 4 timer. AI leverede kode, verifikationen forblev hos mennesket.

Tilfælde 2 — Den sammensatte metriske fælde. En praktikant spurgte AI'en: "Hvor nøjagtig er tilfældig skov på disse data?" uden overhovedet at træne modellen. "Omkring 89%," sagde AI. Praktikanten lagde dette ind i oplægget; Da den rigtige model blev trænet, var nøjagtigheden 71%. Fejl: Venter på metrics uden at give data og modeller til AI.

Tilfælde 3 — Lydløs lækage. Et hold implementerede den AI-foreslåede idé om "tilføj gennemsnittet af målvariablen som en funktion" uden at stille spørgsmålstegn ved det. Modellen præsterede 98 % på testsættet, men styrtede ned i produktionen, fordi funktionen lækkede fremtidig information (datalæk, enhed 10). Fejl: Filtrerer ikke AI-anbefalingen statistisk.

Svag prompt / Stærk prompt

Svag prompt:

Analyser disse salgsdata og fortæl mig den gennemsnitlige omsætning.

Denne påstand er mangelfuld: AI blev ikke givet data, så den "gennemsnitlige indkomst" kan kun gøres op. Hverken kolonnerne, perioden eller valutaen er tydelige.

Kraftig prompt:

Din rolle: assistent, der hjælper en dataforsker. Jeg har en pandas DataFrame: df. Kolonner:- ordredato (tekst, i formatet "2024-03-01")- mængde_tl (decimal, NaN i nogle rækker)- kunde_id (heltal) Opgave: (1) skriv pandas-kode, der beregner den gennemsnitlige mængde,(2) forklar, hvordan den håndterer NaN-værdier,(3) angiv de antagelser, koden gør. Lav ikke dataindholdet. bare generer kode, og jeg vil køre og verificere resultatet.

I denne anmodning er ordningen, forventningen og "fabrikationsforbuddet" tydelige. Du kører stadig og verificerer outputtet selv.

Begyndelsen af etik og privatliv

Datavidenskab arbejder ofte med personlige data: kunde-, patient-, medarbejderjournaler. KVKK (Personal Data Protection Law) i Türkiye og GDPR i Europa beskytter disse data. At indsætte dit rigtige navn, ID, e-mail eller adresse i et offentligt AI-værktøj er en overtrædelse. Regel: anonymiser data før deling, angiv kun skema (kolonnenavne, typer) og dummy-eksempelrække, hvis det er nødvendigt. Vi vil uddybe emnet etik i enhed 11; Lad os sætte princippet fra begyndelsen: For at forstå data er det ofte nok at dele dets struktur, ikke dets indhold.

Almindelige fejl

  • Venter på tal/metrics uden at give data til AI. Modellen kan ikke få adgang til dataene; Nummeret han giver er falsk. Få altid resultatet beregnet og kørt.
  • Tænker at arbejdskoden er korrekt. Den kode, der manipulerer den forkerte kolonne, kører også uden fejl; Stol ikke på uden at læse logikken.
  • Indsættelse af rigtige personlige data i det åbne værktøj. Navn, ID-nummer, e-mail deles aldrig; Diagrammet er nok.
  • At udføre trinene manuelt og ikke skrive dem ind i koden. Analyse, der ikke er reproducerbar, er upålidelig.
  • Accepterer AI's fortolkning af statistik uden spørgsmål. AI kan gentage klassiske fejl i begreber som p-værdi og korrelation.
Tip: Inkluder en kort "regellinje" i hver af dine AI-sessioner: "Lad være med at lave dataindholdet, generer bare kode/analyse, så kører jeg og verificerer resultatet; angiv 'ikke sikker', hvor du er usikker." Denne enkelt sætning reducerer risikoen for hallucinationer markant.

Sammenfattende

AI er en kraftfuld assistent inden for datavidenskab: den accelererer rensekode, EDA-fortolkning, modelanbefaling og visualisering. Men problemdefinition, metrisk udvælgelse, produktionsbeslutning og etiske grænser tilhører mennesker. Arbejdsgangen har seks trin, og AI'ens rolle bliver mindre, efterhånden som risikoen stiger. Tre vaner er grundlaget for alt: kildelinking (validering), reproducerbarhed (kodning) og anonymisering (fortrolighed). Når du har internaliseret disse tre, bliver hvert værktøj i resten af ​​modulet en sikker accelerator for dig.

Ansøgningsopgave

Lav bare et skema af en lille tabel, du har (eller en hypotetisk): kolonnenavne, typer og 2-3 dummy-eksempelrækker (uden rigtige personlige data). Bed AI om en oversigtsstatistikkode ved hjælp af skabelonen "Kraftfuld prompt" ovenfor. Kør koden, sammenlign outputtet med en manuel værdi, kontroller for falske antagelser, og noter dine resultater i 5 punkttegn.

tjekliste

  • [ ] Har jeg lige givet AI’en et skema og en falsk prøve i stedet for rigtige personlige data?
  • [ ] Har jeg læst og kørt koden, den producerede linje for linje?
  • [ ] Har jeg uafhængigt verificeret hvert tal i outputtet?
  • [ ] Har jeg skrevet hvert trin af analysen ind i koden og gjort det gentageligt?
  • [ ] Har jeg bestemt risikoniveauet for missionen og tildelt den endelige beslutning til et menneske?