Dobici:
- Sposobnost da se razlikuje šestostepeni tok rada nauke o podacima (definacija problema, prikupljanje, čišćenje, otkrivanje, modeliranje, komunikacija) i autoritet pod kojim umjetna inteligencija radi u svakoj fazi, prema nivou rizika zadatka
- Sposobnost primjene discipline koja provjerava svaki izlaz umjetne inteligencije tako što ga povezuje s izvorom, pokreće ga i upoređuje i prolazi kroz stručno filtriranje.
- Sposobnost pretvaranja principa ponovljivosti i privatnosti (pisanje u kod, anonimizacija) u navike analize od prvog dana
Sirovi, neuredni i često „lažljivi“ podaci svakodnevno padaju na sto naučnika. U tabeli prodaje, stupac datuma je upisan u tri različita formata; brojevi kupaca su prazni u nekim redovima; Naziv kolone je "prihod", ali sadrži i TL i USD vrijednosti. Posao nauke o podacima je donijeti pouzdanu odluku iz ovog haosa: prikupiti podatke, očistiti ih, istražiti ih, izgraditi model, potvrditi rezultat i pretvoriti ga u priču. Umjetna inteligencija (AI ili skraćeno AI – kompjuterski sistemi koji mogu generirati tekst i kod, prepoznati obrasce, sumirati i predviđati) može dotaknuti svaku kariku u ovom lancu: pisanje koda za čišćenje za nekoliko minuta, preporučivanje grafikona za istraživačku analizu, tumačenje metrike modela, ispravljanje SQL upita. Ali isti AI vam takođe može dati pouzdanu izmišljotinu kao što je "korelacija 0,72" za podatke koje nikada nije vidio.
Ova prva jedinica nije uvod u biblioteku. Njegova svrha je da razjasni gdje staviti AI u radni tok nauke o podacima, a gdje ga nikada ne staviti. Izložimo osnovni princip od početka: AI je pomoćnik, a ne naučnik podataka. Odluka o tome koje podatke prikupiti, za koju metriku odlučiti, da li će model staviti u proizvodnju i gdje povući etičke granice ostaje na kompetentnom stručnjaku. Neprovjereni AI izlaz je rizičan, kao i nepotpisani izvještaj o analizi.
Tok rada nauke o podacima: mapa od kraja do kraja
Da biste razumjeli projekt podataka, korisno je podijeliti ga na šest faza. Cijeli ovaj modul prati ovu mapu.
1. Definicija problema: Šta mjerimo, zašto, da bismo podržali koju odluku? Ova faza nije delegirana AI; Osoba je ta koja definiše posao.
2. Prikupljanje podataka: Identifikacija izvora, izdvajanje podataka, uzorkovanje. (Jedinica 2)
3. Čišćenje podataka i prethodna obrada: Nedostaje vrijednost, izvanredna vrijednost, konverzija tipa. (Jedinica 3)
4. Eksplorativna analiza podataka (EDA - Exploratory Data Analysis, faza prepoznavanja distribucije i odnosa podataka "na oko"): (4. jedinica)
5. Inženjering i modeliranje karakteristika: generiranje varijable, izbor algoritama, obuka, evaluacija. (Jedinica 5, 6, 7)
6. Komunikacija i produkcija: Vizualizacija, priča, MLOps (disciplina preuzimanja modela uživo i praćenja). (Jedinica 8, 11)
AI djeluje s različitim ovlaštenjima u svakoj od ovih šest faza. Tabela ispod rezimira ovu raspodjelu ovlaštenja; Ovo je najvažnija tabela modula.
Stage
Uloga AI
Nivo rizika
Ko odobrava
Definicija problema
brainstorming partner
nisko
Naučnik podataka + dioničar
Napišite kod za čišćenje
Generator skice koda
srednje
Naučnik podataka (čita kod)
Komentar EDA
šablona sugestor
srednje
naučnik podataka
Generacija karakteristika
Generator ideja i kodova
srednje visok
Kontrola curenja je obavezna
Izbor modela/metrika
konsultant
visoko
naučnik podataka
Odluka o puštanju u proizvodnju
pomoćni ulaz
veoma visoko
Tim + vlasnik firme
Odobrenje etike/privatnosti
stimulans
veoma visoko
ljudski, uvek
Imajte na umu jednu rečenicu iz ovog grafikona: kako se ulozi povećavaju, uloga AI se smanjuje, a ljudsko odobravanje raste.
Zašto je verifikacija srce ovog posla
Modeli AI jezika izgledaju sigurno, ali možda nisu sigurni. Tehničkim jezikom to se zove halucinacija: to je modelova izmišljotina nepostojećih informacija u tečnoj rečenici kao da je istinita. U nauci o podacima, ovo dolazi u tri oblika. Prvi je lažni broj: ako pitate model "koji je prosječni iznos narudžbe" bez davanja podataka, on će vam sa sigurnošću reći broj, iako nikada nije vidio vaše podatke. Druga je funkcija koja ne postoji: model može predložiti funkciju koja uopće ne postoji, kao što je pandas.read_excel_fast(). Treće, netačna statistička interpretacija: model može glatko ponoviti klasičnu statističku grešku kao što je „p-vrijednost je 0,04, tako da je hipoteza 96% tačna“.
Disciplina verifikacije se sastoji od tri koraka:
- Link do izvora: Svaki broj, stopa i trend treba da potiču iz vaših podataka, a ne iz memorije veštačke inteligencije. Koristite AI za kod koji radi na podacima, a ne za pamćenje podataka.
- Pokrenite i uporedite: Pokrenite svaki dio koda koji vam je dala AI; Uporedite svaku metriku koju proizvodi sa nezavisnom bazom.
- Ekspertski filter: sami provjerite da li je rezultat u suprotnosti sa statistikom i znanjem o domeni.
Oprez: Stavljanje analize koju je napisala AI u prezentaciju bez pokretanja i čitanja je kao predstavljanje nepotpisanog izvještaja. Samo zato što kod radi ne znači da je ispravan; Kod koji zbraja pogrešnu kolonu također radi bez grešaka.
Reproducibilnost: mogućnost da dvaput proizvede isti rezultat
Tihi, ali kritični princip nauke o podacima je ponovljivost: kada ponovo pokrenete analizu šest meseci kasnije ili na drugom računaru, dobijate isti rezultat. Ovaj rizik se povećava kada radite sa AI, jer kada kažete AI da "napravi ovaj grafikon" i reproducira ga ručno, koraci nestaju. Pravilo: svaki korak mora biti registriran u kodu i kontroli verzija (kao Git); U koracima koji uključuju slučajnost, nasumično sjeme (početna vrijednost generatora slučajnih brojeva; ako je fiksno, rezultat će biti ponovljiv) treba biti fiksiran. Ovu temu ćemo produbiti u jedinici 10; Za sada steknite ovu naviku: "Ne klikajte rukom, pišite u kodu."
tri mini kofera
Slučaj 1 — Sigurno ubrzanje. Analitičar e-trgovine bi obično proveo pola dana čisteći tabelu narudžbi od 240 hiljada redova. Dao je nazive kolona i prvih 5 redova (bez ličnih podataka) AI i zatražio šifru za čišćenje pandi. AI je napravio nacrt za 8 sekundi; Analitičar je pročitao kod red po red, popravio grešku u raščlanjivanju datuma i pokrenuo ga. Trajanje: 35 minuta umjesto 4 sata. AI je dao kod, verifikacija je ostala kod čovjeka.
Slučaj 2 — Izmišljena metrička zamka. Jedan pripravnik je upitao AI: "Koliko je nasumična šuma tačna na ovim podacima?" bez ikakve obuke modela. „Oko 89%“, rekao je AI. Stažista je ovo stavila u prezentaciju; Kada je pravi model bio obučen, tačnost je bila 71%. Greška: Čekanje na metriku bez davanja podataka i modela AI.
Slučaj 3 — Tiho curenje. Jedan tim je implementirao ideju koju je predložila umjetna inteligencija o "dodavanju srednje vrijednosti ciljne varijable kao karakteristike" bez dovođenja u pitanje. Model je postigao 98% na testnom setu, ali je pao u proizvodnji jer je funkcija propuštala buduće informacije (curenje podataka, jedinica 10). Greška: nije statistički filtrirana preporuka AI.
Slaba prompt / Jaka prompt
Slab upit:
Analizirajte ove podatke o prodaji i recite mi prosječan prihod.
Ova tvrdnja je pogrešna: AI nisu dobili podatke, tako da se "prosječni prihod" može samo nadoknaditi. Ni kolone, ni period, ni valuta nisu jasni.
Snažan upit:
Vaša uloga: asistent koji pomaže istraživaču podataka. Imam pandas DataFrame: df. Kolone:- order_date (tekst, u formatu "2024-03-01")- amount_tl (decimalni, NaN u nekim redovima)- customer_id (cijeli broj) Zadatak: (1) napisati pandas kod koji izračunava prosječni iznos, (2) objasniti kako rukuje NaN vrijednostima, (3) navesti pretpostavke koje kod daje. Ne izmišljajte sadržaj podataka; samo generiraj kod i ja ću pokrenuti i provjeriti rezultat.
U ovom zahtjevu, shema, očekivanje i "zabrana izmišljotina" su jasni. I dalje pokrećete i sami provjeravate izlaz.
Počeci etike i privatnosti
Nauka o podacima često radi sa ličnim podacima: evidencijama kupaca, pacijenata, zaposlenih. KVKK (Zakon o zaštiti ličnih podataka) u Turskoj i GDPR u Evropi štite ove podatke. Lijepljenje vašeg pravog imena, ID-a, e-pošte ili adrese u javni AI alat je kršenje. Pravilo: anonimizirajte podatke prije dijeljenja, navedite samo shemu (nazive kolona, tipove) i lažni primjer reda ako je potrebno. Temu etike ćemo produbiti u jedinici 11; Postavimo princip od početka: za razumijevanje podataka često je dovoljno dijeliti njihovu strukturu, a ne njihov sadržaj.
Uobičajene greške
- Čekanje na brojeve/metrike bez davanja podataka AI. Model ne može pristupiti podacima; Broj koji daje je lažan. Uvijek imajte rezultat izračunati i pokrenuti.
- Misleći da je radni kod ispravan. Kod koji manipulira pogrešnom kolonom također radi bez grešaka; Ne vjerujte bez čitanja logike.
- Lepljenje stvarnih ličnih podataka u otvoreni alat. Ime, ID broj, e-mail se nikada ne dijele; Dijagram je dovoljan.
- Izvođenje koraka ručno, a ne upisivanje u kod. Analiza koja nije ponovljiva je nepouzdana.
- Prihvatanje AI tumačenja statistike bez sumnje. AI može ponoviti klasične greške u konceptima kao što su p-vrijednost i korelacija.
Savjet: Uključite kratku "redu pravila" u svaku od vaših AI sesija: "Ne izmišljajte sadržaj podataka; samo generirajte kod/analizu i ja ću pokrenuti i provjeriti rezultat; naznačite 'nisam siguran' gdje niste sigurni." Ova pojedinačna rečenica značajno smanjuje rizik od halucinacija.
Ukratko
AI je moćan asistent u nauci o podacima: ubrzava čišćenje koda, EDA interpretaciju, preporuku modela i vizualizaciju. Ali definicija problema, odabir metrike, odluka o proizvodnji i etičke granice pripadaju ljudima. Tok posla ima šest faza, a uloga AI postaje sve manja kako se rizik povećava. Tri navike su temelj svega: povezivanje izvora (validacija), reproducibilnost (kodiranje) i anonimizacija (povjerljivost). Kada usvojite ova tri, svaki alat u ostatku modula postaje siguran akcelerator za vas.
Zadatak aplikacije
Samo napravite šemu male tabele koju imate (ili hipotetičke): imena kolona, tipovi i 2-3 lažna primera reda (bez stvarnih ličnih podataka). Zatražite od AI-a sažetak statističkog koda koristeći gornji predložak "Moćni prompt". Pokrenite kod, uporedite izlaz sa ručnom vrijednošću, provjerite ima li lažnih pretpostavki i zabilježite svoje nalaze u 5 tačaka.
kontrolna lista
- [ ] Jesam li upravo dao AI šemu i lažni uzorak umjesto pravih ličnih podataka?
- [ ] Da li sam pročitao i pokrenuo kod koji je proizveo red po red?
- [ ] Jesam li nezavisno provjerio svaki broj u izlazu?
- [ ] Da li sam svaki korak analize napisao u kodu i učinio ga ponovljivim?
- [ ] Jesam li odredio nivo rizika misije i konačnu odluku dodijelio čovjeku?