Vinster:
- Förmåga att särskilja datavetenskapens sexstegs arbetsflöde (problemdefinition, insamling, rengöring, upptäckt, modellering, kommunikation) och den auktoritet under vilken artificiell intelligens fungerar i varje steg, enligt uppgiftsrisknivån
- Möjlighet att tillämpa en disciplin som verifierar varje artificiell intelligens-utdata genom att ansluta den till källan, köra och jämföra den och skicka den genom expertfiltrering.
- Förmåga att omvandla reproducerbarhet och integritetsprinciper (skriva till kod, anonymisering) till analysvanor från dag ett
Rå, rörig och ofta "ljugande" data landar på en dataforskares skrivbord varje dag. I försäljningstabellen är datumkolumnen skriven i tre olika format; kundnummer är tomma på vissa rader; Namnet på en kolumn är "inkomst", men den innehåller både TL- och USD-värden. Datavetenskapens uppgift är att fatta ett tillförlitligt beslut ur detta kaos: samla in data, rensa den, utforska den, bygga en modell, validera resultatet och förvandla den till en berättelse. Artificiell intelligens (AI, eller AI för kort – datorsystem som kan generera text och kod, känna igen mönster, sammanfatta och göra förutsägelser) kan röra varje länk i denna kedja: skriva rensningskod på några minuter, rekommendera grafer för utforskande analys, tolka en modells mått, korrigera en SQL-fråga. Men samma AI kan också ge dig en säker tillverkning som "korrelation 0,72" för data som den aldrig har sett.
Denna första enhet är inte en biblioteksintroduktion. Syftet är att klargöra var AI ska placeras i datavetenskapens arbetsflöde och var den aldrig ska placeras. Låt oss lägga upp grundprincipen från början: AI är en assistent, inte en datavetare. Beslutet om vilken data som ska samlas in, vilket mått man ska besluta om, om man ska sätta en modell i produktion och var man ska dra etiska gränser ligger hos den behöriga experten. En overifierad AI-utgång är riskabel, liksom en osignerad analysrapport.
Datavetenskap arbetsflöde: karta från slut till ände
För att förstå ett dataprojekt är det bra att dela upp det i sex faser. Hela denna modul följer denna karta.
1. Problemdefinition: Vad mäter vi, varför, för att stödja vilket beslut? Denna fas är inte delegerad till AI; Det är personen som definierar jobbet.
2. Datainsamling: Identifiera källor, extrahera data, provtagning. (Enhet 2)
3. Datarensning och förbearbetning: Saknat värde, extremvärde, typkonvertering. (Enhet 3)
4. Undersökande dataanalys (EDA - Exploratory Data Analysis, stadiet för att känna igen distributionen och relationerna mellan data "genom ögat"): (Enhet 4)
5. Funktionsteknik och modellering: Variabel generering, val av algoritmer, utbildning, utvärdering. (Enhet 5, 6, 7)
6. Kommunikation och produktion: Visualisering, story, MLOps (disciplin att ta modellen live och övervaka den). (Enhet 8, 11)
AI arbetar med olika auktoriteter i vart och ett av dessa sex steg. Tabellen nedan sammanfattar denna befogenhetsfördelning; Detta är den enskilt viktigaste tabellen i modulen.
Scen
AI:s roll
Risknivå
Vem godkänner
Problemdefinition
brainstorming partner
låg
Data scientist + intressent
Skriv en rensningskod
Kodskissgenerator
medium
Dataforskare (läser kod)
EDA kommentar
mönsterförslag
medium
datavetare
Funktionsgenerering
Idé- och kodgenerator
medelhög
Läckagekontroll är ett måste
Modellval/mått
konsult
hög
data scientist
Beslut om att sätta i produktion
hjälpingång
mycket hög
Team + företagsägare
Etik/integritetsgodkännande
stimulerande medel
mycket hög
mänsklig, alltid
Kom ihåg den ena meningen från det här diagrammet: när insatserna ökar, krymper AI:s roll och mänskligt godkännande växer.
Varför verifiering är hjärtat i denna verksamhet
AI-språkmodeller ser säkra ut, men de kanske inte är säkra. På fackspråk kallas detta för hallucination: det är modellens tillverkning av icke-existerande information i en flytande mening som om den vore sann. Inom datavetenskap kommer detta i tre former. Det första är ett falskt nummer: om du frågar modellen "vad är det genomsnittliga beställningsbeloppet" utan att ange några uppgifter, kommer den med säkerhet att berätta ett nummer, även om den aldrig har sett dina uppgifter. Den andra är en funktion som inte finns: modellen kan föreslå en funktion som inte existerar alls, till exempel pandas.read_excel_fast(). För det tredje, felaktig statistisk tolkning: modellen kan smidigt upprepa ett klassiskt statistiskt fel som "p-värdet är 0,04, så hypotesen är 96% korrekt".
Verifieringsdisciplinen består av tre steg:
- Länk till källa: Varje siffra, hastighet och trend bör komma från dina data, inte AI:s minne. Använd AI för kod som fungerar på data, inte för att den ska komma ihåg data.
- Kör och jämför: Kör varje kod som ges av AI själv; Jämför varje mätvärde som den producerar med en oberoende baslinje.
- Expertfilter: Testa själv om resultatet strider mot statistik och domänkunskap.
Varning: Att lägga in en analys skriven av AI i en presentation utan att köra och läsa den är som att presentera en osignerad rapport. Bara för att koden fungerar betyder det inte att den är korrekt; En kod som summerar fel kolumn fungerar också utan fel.
Reproducerbarhet: att kunna producera samma resultat två gånger
Den tysta men kritiska principen för datavetenskap är reproducerbarhet: när du kör en analys igen sex månader senare eller på en annan dator får du samma resultat. Denna risk ökar när du arbetar med AI, för när du säger åt AI:n att "göra den här grafen" och spela den manuellt, försvinner stegen. Regel: varje steg måste registreras i koden och versionskontrollen (som Git); I steg som involverar slumpmässighet bör det slumpmässiga fröet (det initiala värdet för slumptalsgeneratorn; om det är fixat kommer resultatet att vara repeterbart) fastställas. Vi kommer att fördjupa detta ämne i enhet 10; För nu, ta den här vanan: "Klicka inte för hand, skriv i kod."
tre minifodral
Fall 1 — Säker acceleration. En e-handelsanalytiker skulle normalt ägna en halv dag åt att rensa en ordertabell med 240 tusen rader. Han gav kolumnnamnen och de första 5 raderna (utan personliga uppgifter) till AI och bad om pandornas rengöringskod. AI producerade utkast på 8 sekunder; Analytikern läste koden rad för rad, fixade ett fel i datumanalys och körde den. Längd: 35 minuter istället för 4 timmar. AI gav kod, verifiering förblev hos människan.
Fall 2 — Den påhittade metriska fällan. En praktikant frågade AI:n "Hur exakt är slumpmässig skog på dessa data?" utan att träna modellen alls. "Omkring 89%," sa AI. Praktikanten lade in detta i presentationen; När den riktiga modellen tränades var noggrannheten 71 %. Misstag: Väntar på mätvärden utan att ge data och modeller till AI.
Fall 3 — Tyst läcka. Ett team implementerade den AI-föreslagna idén att "lägga till medelvärdet för målvariabeln som en funktion" utan att ifrågasätta det. Modellen presterade 98 % på testsetet men kraschade i produktionen eftersom funktionen läckte framtida information (dataläcka, enhet 10). Misstag: Filtrerar inte AI-rekommendationen statistiskt.
Svag prompt / Stark prompt
Svag uppmaning:
Analysera dessa försäljningsdata och berätta för mig den genomsnittliga intäkten.
Detta påstående är felaktigt: AI gavs inte data, så den "genomsnittliga inkomsten" kan bara kompenseras. Varken kolumnerna, perioden eller valutan är tydliga.
Kraftfull uppmaning:
Din roll: assistent som hjälper en datavetare. Jag har en pandas DataFrame: df. Kolumner:- order_date (text, i formatet "2024-03-01")- amount_tl (decimal, NaN i vissa rader)- customer_id (heltal) Uppgift: (1) skriv pandaskod som beräknar medelbeloppet,(2) förklara hur den hanterar NaN-värden,(3) ange de antaganden koden gör. Gör inte upp datainnehållet; generera bara kod så kör jag och verifierar resultatet.
I denna begäran är upplägget, förväntningarna och "tillverkningsförbudet" tydliga. Du kör fortfarande och verifierar utdata själv.
Början till etik och integritet
Data science arbetar ofta med personuppgifter: kund-, patient-, personalregister. KVKK (Personal Data Protection Law) i Turkiet och GDPR i Europa skyddar dessa uppgifter. Att klistra in ditt riktiga namn, ID, e-postadress eller adress i ett offentligt AI-verktyg är en överträdelse. Regel: anonymisera data innan delning, tillhandahåll endast schema (kolumnnamn, typer) och dummy-exempelrad om det behövs. Vi kommer att fördjupa ämnet etik i enhet 11; Låt oss sätta principen från början: För att förstå data räcker det ofta att dela dess struktur, inte dess innehåll.
Vanliga misstag
- Väntar på siffror/mått utan att ge data till AI. Modellen kan inte komma åt data; Numret han ger är falskt. Låt alltid resultatet beräknas och köras.
- Tänker att arbetskoden är korrekt. Koden som manipulerar fel kolumn körs också utan fel; Lita inte utan att läsa logiken.
- Klistra in riktiga personuppgifter i det öppna verktyget. Namn, ID-nummer, e-post delas aldrig; Diagrammet räcker.
- Göra stegen manuellt och inte skriva in dem i koden. Analyser som inte är reproducerbara är opålitliga.
- Accepterar AI:s tolkning av statistik utan att ifrågasätta. AI kan upprepa klassiska misstag i begrepp som p-värde och korrelation.
Tips: Inkludera en kort "regelrad" i var och en av dina AI-sessioner: "Skapa inte datainnehållet, generera bara kod/analys så kör jag och verifierar resultatet; ange "osäker" där du är osäker." Denna enda mening minskar risken för hallucinationer avsevärt.
Sammanfattningsvis
AI är en kraftfull assistent inom datavetenskap: den accelererar rengöringskod, EDA-tolkning, modellrekommendationer och visualisering. Men problemdefinition, metriskt urval, produktionsbeslut och etiska gränser tillhör människor. Arbetsflödet har sex steg, och AI:s roll blir mindre när risken ökar. Tre vanor är grunden för allt: källkoppling (validering), reproducerbarhet (kodning) och anonymisering (sekretess). När du väl internaliserat dessa tre blir varje verktyg i resten av modulen en säker accelerator för dig.
Applikationsuppgift
Gör bara ett schema av en liten tabell du har (eller en hypotetisk): kolumnnamn, typer och 2-3 dummy-exempelrader (utan riktiga personliga data). Be AI om en sammanfattande statistikkod med hjälp av mallen "Kraftfull prompt" ovan. Kör koden, jämför resultatet med ett manuellt värde, kontrollera om det finns falska antaganden och notera dina resultat i 5 punktpunkter.
checklista
- [ ] Gav jag bara AI:n ett schema och ett falskt prov istället för riktiga personuppgifter?
- [ ] Läste och körde jag koden den producerade rad för rad?
- [ ] Har jag självständigt verifierat varje nummer i utgången?
- [ ] Har jag skrivit in varje steg i analysen i koden och gjort den repeterbar?
- [ ] Har jag bestämt risknivån för uppdraget och tilldelat en människa det slutliga beslutet?