Enhet 1 / 11

Introduksjon til kunstig intelligens i datavitenskap og analyse: arbeidsflyt, roller, grenser, validering og etikk

Gevinster:

  • Evne til å skille mellom seks-trinns arbeidsflyt for datavitenskap (problemdefinisjon, innsamling, rengjøring, oppdagelse, modellering, kommunikasjon) og autoriteten som kunstig intelligens fungerer under på hvert trinn, i henhold til oppgaverisikonivået
  • Evne til å bruke en disiplin som verifiserer hver kunstig intelligens-utgang ved å koble den til kilden, kjøre og sammenligne den, og sende den gjennom ekspertfiltrering.
  • Evne til å gjøre reproduserbarhet og personvernprinsipper (skriving til kode, anonymisering) til analysevaner fra dag én

Rå, rotete og ofte "løgnaktige" data lander på skrivebordet til en dataforsker hver dag. I salgstabellen er datokolonnen skrevet i tre ulike formater; kundenumre er tomme på noen linjer; Navnet på en kolonne er "inntekt", men den inneholder både TL- og USD-verdier. Datavitenskapens jobb er å ta en pålitelig avgjørelse ut av dette kaoset: samle inn dataene, rense dem, utforske dem, bygge en modell, validere resultatet og gjøre det om til en historie. Kunstig intelligens (AI, eller AI for kort – datasystemer som kan generere tekst og kode, gjenkjenne mønstre, oppsummere og lage spådommer) kan berøre alle ledd i denne kjeden: skrive oppryddingskode på minutter, anbefale grafer for utforskende analyse, tolke en modells beregning, korrigere en SQL-spørring. Men den samme AI kan også gi deg en sikker fabrikasjon som "korrelasjon 0,72" for data den aldri har sett.

Denne første enheten er ikke en bibliotekintroduksjon. Formålet er å avklare hvor AI skal plasseres i datavitenskapens arbeidsflyt og hvor den aldri skal plasseres. La oss legge ut det grunnleggende prinsippet fra begynnelsen: AI er en assistent, ikke en dataforsker. Beslutningen om hvilke data som skal samles inn, hvilken metrikk som skal bestemmes, om en modell skal settes i produksjon, og hvor etiske grenser skal trekkes, ligger hos den kompetente eksperten. En ubekreftet AI-utgang er risikabelt, det samme er en usignert analyserapport.

Datavitenskap arbeidsflyt: ende-til-ende kart

For å forstå et dataprosjekt er det nyttig å dele det ned i seks faser. Hele denne modulen følger dette kartet.

1. Problemdefinisjon: Hva måler vi, hvorfor, for å støtte hvilken beslutning? Denne fasen er ikke delegert til AI; Det er personen som definerer jobben.

2. Datainnsamling: Identifisere kilder, trekke ut data, prøvetaking. (Enhet 2)

3. Datarensing og forbehandling: Manglende verdi, uteligger, typekonvertering. (Enhet 3)

4. Undersøkende dataanalyse (EDA - Exploratory Data Analysis, stadiet for å gjenkjenne distribusjonen og relasjonene til dataene "ved øyet"): (Enhet 4)

5. Funksjonsteknikk og modellering: Variabel generering, algoritmevalg, opplæring, evaluering. (Enhet 5, 6, 7)

6. Kommunikasjon og produksjon: Visualisering, historie, MLOps (disiplin med å ta modellen live og overvåke den). (Enhet 8, 11)

AI opererer med en annen autoritet i hver av disse seks stadiene. Tabellen nedenfor oppsummerer denne fordeling av myndighet; Dette er den viktigste enkelttabellen i modulen.

Scene

Rollen til AI

Risikonivå

Hvem godkjenner

Problemdefinisjon

idédugnadspartner

lav

Dataviter + interessent

Skriv en oppryddingskode

Kodeskissegenerator

medium

Dataforsker (leser kode)

EDA-kommentar

mønsterforslag

medium

dataforsker

Funksjonsgenerering

Ide- og kodegenerator

middels høy

Lekkasjekontroll er et must

Modellvalg/metrikk

konsulent

høy

dataforsker

Beslutning om å sette i produksjon

hjelpeinngang

veldig høy

Team + bedriftseier

Etikk/personverngodkjenning

stimulerende

veldig høy

menneskelig, alltid

Husk den ene setningen fra dette diagrammet: etter hvert som innsatsen øker, krymper AIs rolle og menneskelig godkjenning vokser.

Hvorfor verifisering er hjertet i denne virksomheten

AI-språkmodeller ser sikre ut, men de er kanskje ikke sikre. På fagspråket kalles dette hallusinasjon: det er modellens fabrikasjon av ikke-eksisterende informasjon i en flytende setning som om den var sann. I datavitenskap kommer dette i tre former. Det første er et falskt tall: hvis du spør modellen "hva er gjennomsnittlig ordrebeløp" uten å oppgi noen data, vil den trygt fortelle deg et tall, selv om den aldri har sett dataene dine. Den andre er en funksjon som ikke eksisterer: modellen kan foreslå en funksjon som ikke eksisterer i det hele tatt, for eksempel pandas.read_excel_fast(). For det tredje, feil statistisk tolkning: modellen kan jevnt gjenta en klassisk statistisk feil som "p-verdi er 0,04, så hypotesen er 96% riktig".

Verifikasjonsdisiplinen består av tre trinn:

  1. Link til kilde: Hvert tall, rate og trend skal komme fra dataene dine, ikke AI-minnet. Bruk AI for kode som opererer på data, ikke for at den skal huske data.
  2. Kjør og sammenlign: Kjør hver kodebit gitt av AI-en selv; Sammenlign hver beregning den produserer med en uavhengig grunnlinje.
  3. Ekspertfilter: Test selv om utdataene motsier statistikk og domenekunnskap.
Forsiktig: Å sette en analyse skrevet av AI inn i en presentasjon uten å kjøre og lese den er som å presentere en usignert rapport. Bare fordi koden fungerer betyr ikke det at den er riktig; En kode som summerer feil kolonne fungerer også uten feil.

Reproduserbarhet: å kunne produsere det samme resultatet to ganger

Det tause, men kritiske prinsippet for datavitenskap er reproduserbarhet: når du kjører en analyse på nytt seks måneder senere eller på en annen datamaskin, får du det samme resultatet. Denne risikoen øker når du arbeider med AI, fordi når du forteller AI å "lage denne grafen" og spille den manuelt, forsvinner trinnene. Regel: hvert trinn må være registrert i koden og versjonskontrollen (som Git); I trinn som involverer tilfeldighet, bør det tilfeldige frøet (startverdien til tilfeldig tallgeneratoren; hvis det er fast, vil resultatet være repeterbart) fikses. Vi vil utdype dette temaet i enhet 10; For nå, få denne vanen: "Ikke klikk for hånd, skriv inn kode."

tre minisaker

Tilfelle 1 — Sikker akselerasjon. En e-handelsanalytiker vil normalt bruke en halv dag på å rydde en ordretabell på 240 tusen rader. Han ga kolonnenavnene og de første 5 radene (uten personlige data) til AI og ba om rensekoden for pandaene. AI produserte utkast på 8 sekunder; Analytikeren leste koden linje for linje, fikset en feil i datoanalysen og kjørte den. Varighet: 35 minutter i stedet for 4 timer. AI ga kode, verifisering forble hos mennesket.

Tilfelle 2 — Den sammensatte metriske fellen. En praktikant spurte AI: "Hvor nøyaktig er tilfeldig skog på disse dataene?" uten å trene modellen i det hele tatt. "Omtrent 89%," sa AI. Praktikanten la dette inn i presentasjonen; Når den virkelige modellen ble trent, var nøyaktigheten 71 %. Feil: Venter på beregninger uten å gi data og modeller til AI.

Tilfelle 3 — Stille lekkasje. Et team implementerte den AI-foreslåtte ideen om å "legge til gjennomsnittet av målvariabelen som en funksjon" uten å stille spørsmål ved det. Modellen presterte 98 % på testsettet, men krasjet i produksjon fordi funksjonen lekket fremtidig informasjon (datalekkasje, enhet 10). Feil: Filtrerer ikke AI-anbefalingen statistisk.

Svak forespørsel / Sterk forespørsel

Svak melding:

Analyser disse salgsdataene og fortell meg gjennomsnittlig inntekt.

Denne påstanden er feil: AI ble ikke gitt data, så den "gjennomsnittlige inntekten" kan bare gjøres opp. Verken kolonnene, perioden eller valutaen er tydelige.

Kraftig ledetekst:

Din rolle: assistent som hjelper en dataforsker. Jeg har en pandas DataFrame: df. Kolonner:- ordredato (tekst, i formatet "2024-03-01")- beløp_tl (desimal, NaN i noen rader)- kunde_id (heltall) Oppgave: (1) skriv pandaskode som beregner gjennomsnittsbeløpet,(2) forklar hvordan den håndterer NaN-verdier,(3) oppgi antakelsene koden gjør. Ikke lag opp datainnholdet; bare generer kode, så kjører jeg og verifiserer resultatet.

I denne forespørselen er ordningen, forventningen og «fabrikasjonsforbudet» tydelig. Du kjører fortsatt og verifiserer utdataene selv.

Begynnelsen på etikk og personvern

Datavitenskap jobber ofte med personopplysninger: kunde-, pasient-, ansattjournaler. KVKK (Personal Data Protection Law) i Türkiye og GDPR i Europa beskytter disse dataene. Å lime inn ditt virkelige navn, ID, e-postadresse eller adresse i et offentlig AI-verktøy er et brudd. Regel: anonymiser data før deling, oppgi bare skjema (kolonnenavn, typer) og dummy-eksempelrad om nødvendig. Vi vil utdype temaet etikk i enhet 11; La oss sette prinsippet fra begynnelsen: For å forstå dataene er det ofte nok å dele strukturen, ikke innholdet.

Vanlige feil

  • Venter på tall/metrikker uten å gi data til AI. Modellen kan ikke få tilgang til dataene; Nummeret han oppgir er falskt. Få alltid resultatet beregnet og kjør.
  • Tenker at arbeidskoden er riktig. Koden som manipulerer feil kolonne kjører også uten feil; Ikke stol uten å lese logikken.
  • Lim inn ekte personopplysninger i det åpne verktøyet. Navn, ID-nummer, e-post deles aldri; Diagrammet er nok.
  • Utføre trinnene manuelt og ikke skrive dem inn i koden. Analyse som ikke er reproduserbar er upålitelig.
  • Aksepterer AIs tolkning av statistikk uten spørsmål. AI kan gjenta klassiske feil i begreper som p-verdi og korrelasjon.
Tips: Inkluder en kort "regellinje" i hver av AI-øktene dine: "Ikke lag opp datainnholdet; generer bare kode/analyse, så kjører jeg og verifiserer resultatet; angi 'usikker' hvor du er usikker." Denne enkeltsetningen reduserer risikoen for hallusinasjoner betydelig.

Oppsummert

AI er en kraftig assistent innen datavitenskap: den akselererer rensekode, EDA-tolkning, modellanbefaling og visualisering. Men problemdefinisjon, metrisk utvalg, produksjonsbeslutning og etiske grenser tilhører mennesker. Arbeidsflyten har seks stadier, og AIs rolle blir mindre etter hvert som risikoen øker. Tre vaner er grunnlaget for alt: kildekobling (validering), reproduserbarhet (koding) og anonymisering (konfidensialitet). Når du internaliserer disse tre, blir hvert verktøy i resten av modulen en sikker akselerator for deg.

Søknadsoppgave

Bare lag et skjema av en liten tabell du har (eller en hypotetisk): kolonnenavn, typer og 2-3 dummy-eksempelrader (uten ekte personlige data). Be AI om en sammendragsstatistikkkode ved å bruke malen "Kraftig ledetekst" ovenfor. Kjør koden, sammenlign utdataene med en manuell verdi, se etter eventuelle falske antakelser, og noter funnene dine i 5 punkt.

sjekkliste

  • [ ] Gir jeg bare AI et skjema og en falsk prøve i stedet for ekte personopplysninger?
  • [ ] Leste og kjørte jeg koden den produserte linje for linje?
  • [ ] Har jeg uavhengig verifisert hvert tall i utdataene?
  • [ ] Har jeg skrevet hvert trinn av analysen inn i koden og gjort den repeterbar?
  • [ ] Har jeg bestemt risikonivået for oppdraget og tildelt den endelige avgjørelsen til et menneske?