Dobici:
- Sposobnost razlikovanja šestostupanjskog tijeka rada znanosti o podacima (definiranje problema, prikupljanje, čišćenje, otkrivanje, modeliranje, komunikacija) i ovlaštenja pod kojima umjetna inteligencija radi u svakoj fazi, u skladu s razinom rizika zadatka
- Sposobnost primjene discipline koja provjerava svaki izlaz umjetne inteligencije povezivanjem s izvorom, pokretanjem i usporedbom te propuštanjem kroz stručno filtriranje.
- Sposobnost pretvaranja načela ponovljivosti i privatnosti (pisanje u kod, anonimizacija) u navike analize od prvog dana
Sirovi, neuredni i često "lažljivi" podaci svaki dan dospijevaju na stol podatkovnog znanstvenika. U tablici prodaje, stupac datuma je napisan u tri različita formata; brojevi kupaca su prazni u nekim redovima; Naziv stupca je "prihod", ali sadrži vrijednosti TL i USD. Posao znanosti o podacima je donijeti pouzdanu odluku iz ovog kaosa: prikupiti podatke, očistiti ih, istražiti, izgraditi model, potvrditi rezultat i pretvoriti ga u priču. Umjetna inteligencija (AI ili skraćeno AI—računalni sustavi koji mogu generirati tekst i kod, prepoznavati obrasce, sažimati i predviđati) može dodirnuti svaku kariku u ovom lancu: pisanje koda za čišćenje u nekoliko minuta, preporučivanje grafikona za istraživačku analizu, tumačenje metrike modela, ispravljanje SQL upita. Ali ista umjetna inteligencija također vam može dati pouzdanu izmišljotinu kao što je "korelacija 0,72" za podatke koje nikada nije vidjela.
Ova prva jedinica nije uvod u knjižnicu. Njegova je svrha razjasniti gdje staviti AI u radni tijek znanosti o podacima, a gdje ga nikada ne staviti. Izložimo osnovno načelo od početka: AI je pomoćnik, a ne podatkovni znanstvenik. Odluka o tome koje podatke prikupiti, koju metriku odlučiti, hoće li model staviti u proizvodnju i gdje povući etičke granice ostaje na kompetentnom stručnjaku. Neprovjereni AI izlaz je riskantan, kao i nepotpisano izvješće analize.
Tijek rada znanosti o podacima: karta od kraja do kraja
Da biste razumjeli podatkovni projekt, korisno ga je podijeliti u šest faza. Cijeli ovaj modul prati ovu kartu.
1. Definicija problema: Što mjerimo, zašto, kako bismo podržali koju odluku? Ova faza nije delegirana AI; Osoba je ta koja definira posao.
2. Prikupljanje podataka: Identificiranje izvora, izdvajanje podataka, uzorkovanje. (jedinica 2)
3. Čišćenje podataka i predobrada: vrijednost koja nedostaje, outlier, pretvorba tipa. (jedinica 3)
4. Istraživačka analiza podataka (EDA - Exploratory Data Analysis, faza prepoznavanja distribucije i odnosa podataka "na oko"): (Jedinica 4)
5. Inženjering značajki i modeliranje: Generiranje varijabli, odabir algoritma, obuka, evaluacija. (Jedinica 5, 6, 7)
6. Komunikacija i produkcija: Vizualizacija, priča, MLOps (disciplina uzimanja modela uživo i praćenja). (Jedinica 8, 11)
AI djeluje s drugačijim autoritetom u svakoj od ovih šest faza. Donja tablica sažima ovu raspodjelu ovlasti; Ovo je najvažnija tablica modula.
Pozornica
Uloga umjetne inteligencije
Razina rizika
Tko odobrava
Definicija problema
brainstorming partner
nizak
Znanstvenik za podatke + dionik
Napišite kod za čišćenje
Generator skica koda
srednji
Znanstvenik za podatke (čita kod)
EDA komentar
uzorak sugerator
srednji
podatkovni znanstvenik
Generiranje značajki
Generator ideja i kodova
srednje-visoka
Kontrola curenja je obavezna
Odabir modela/metrika
savjetnik
visoka
podatkovni znanstvenik
Odluka o puštanju u proizvodnju
pomoćni ulaz
vrlo visoko
Tim + vlasnik tvrtke
Odobrenje etike/privatnosti
stimulans
vrlo visoko
ljudski, uvijek
Imajte na umu jednu rečenicu iz ove tablice: kako ulozi rastu, uloga umjetne inteligencije se smanjuje, a ljudsko odobravanje raste.
Zašto je provjera srce ovog posla
Jezični modeli umjetne inteligencije izgledaju sigurni, ali možda nisu sigurni. Stručnim jezikom to se zove halucinacija: to je modelovo izmišljanje nepostojećih informacija u tečnoj rečenici kao da su istinite. U znanosti o podacima to dolazi u tri oblika. Prvi je lažni broj: ako pitate model "koliki je prosječni iznos narudžbe" bez navođenja podataka, on će vam pouzdano reći broj, iako nikada nije vidio vaše podatke. Druga je funkcija koja ne postoji: model može predložiti funkciju koja uopće ne postoji, kao što je pandas.read_excel_fast(). Treće, netočna statistička interpretacija: model može glatko ponoviti klasičnu statističku pogrešku kao što je "p-vrijednost je 0,04, tako da je hipoteza 96% točna".
Disciplina provjere sastoji se od tri koraka:
- Veza na izvor: Svaki broj, stopa i trend trebaju potjecati iz vaših podataka, a ne iz memorije umjetne inteligencije. Koristite AI za kod koji radi s podacima, a ne za pamćenje podataka.
- Pokrenite i usporedite: sami pokrenite svaki dio koda koji daje AI; Usporedite svaku metriku koju proizvodi s neovisnom osnovnom linijom.
- Stručni filtar: testirajte sami je li rezultat u suprotnosti sa statistikom i znanjem o domeni.
Oprez: Stavljanje analize koju je napisao AI u prezentaciju bez pokretanja i čitanja je kao predstavljanje nepotpisanog izvješća. Samo zato što kôd radi ne znači da je ispravan; Kod koji zbraja krivi stupac također radi bez grešaka.
Ponovljivost: mogućnost dva puta proizvesti isti rezultat
Tiho, ali kritično načelo znanosti o podacima je ponovljivost: kada ponovno pokrenete analizu šest mjeseci kasnije ili na drugom računalu, dobit ćete isti rezultat. Ovaj rizik se povećava kada radite s umjetnom inteligencijom, jer kada kažete umjetnoj inteligenciji da "napravi ovaj grafikon" i reproducira ga ručno, koraci nestaju. Pravilo: svaki korak mora biti registriran u kodu i kontroli verzija (kao Git); U koracima koji uključuju nasumičnost, nasumično sjeme (početna vrijednost generatora nasumičnog broja; ako je fiksirana, rezultat će biti ponovljiv) treba biti fiksirana. Ovu ćemo temu produbiti u 10. jedinici; Za sada steknite ovu naviku: "Nemoj klikati rukom, piši u kodu."
tri mini kućišta
Slučaj 1 — Sigurno ubrzanje. Analitičar e-trgovine obično bi proveo pola dana čisteći tablicu narudžbi od 240 tisuća redaka. Dao je nazive stupaca i prvih 5 redaka (bez osobnih podataka) AI-u i zatražio kod za čišćenje pandi. AI je napravio gaz u 8 sekundi; Analitičar je pročitao kod redak po redak, popravio pogrešku u raščlanjivanju datuma i pokrenuo ga. Trajanje: 35 minuta umjesto 4 sata. AI je dao kod, provjera je ostala na čovjeku.
Slučaj 2 — Izmišljena metrička zamka. Pripravnik je upitao AI: "Koliko je točna nasumična šuma na ovim podacima?" bez ikakve obuke modela. "Oko 89%", rekao je AI. Pripravnik je ovo stavio u prezentaciju; Kada je pravi model treniran, točnost je bila 71%. Pogreška: čekanje metrike bez davanja podataka i modela AI-ju.
Slučaj 3 — Tiho curenje. Jedan je tim implementirao ideju koju je predložila umjetna inteligencija o "dodavanju srednje vrijednosti ciljne varijable kao značajke" bez preispitivanja. Model je imao 98% rezultata na testnom skupu, ali se srušio u proizvodnji jer je značajka otkrivala buduće informacije (curenje podataka, jedinica 10). Pogreška: Ne filtrira statistički AI preporuku.
Slab upit / Jak upit
Slab upit:
Analizirajte ove podatke o prodaji i recite mi prosječni prihod.
Ova tvrdnja je manjkava: umjetnoj inteligenciji nisu dani podaci, tako da se “prosječni prihod” može samo izmisliti. Ni stupci, ni razdoblje, ni valuta nisu jasni.
Snažan upit:
Vaša uloga: pomoćnik koji pomaže podatkovnom znanstveniku. Imam pandas DataFrame: df. Stupci:- order_date (tekst, u formatu "2024-03-01")- amount_tl (decimalno, NaN u nekim recima)- customer_id (cijeli broj) Zadatak: (1) napišite pandas kod koji izračunava prosječni iznos, (2) objasnite kako obrađuje NaN vrijednosti, (3) navedite pretpostavke koje kod donosi. Nemojte izmišljati sadržaj podataka; samo generiraj kod i ja ću pokrenuti i provjeriti rezultat.
U tom zahtjevu jasna je shema, očekivanje i "zabrana izmišljanja". Još uvijek sami pokrećete i provjeravate izlaz.
Počeci etike i privatnosti
Znanost o podacima često radi s osobnim podacima: dosijeima klijenata, pacijenata, zaposlenika. KVKK (Zakon o zaštiti osobnih podataka) u Turskoj i GDPR u Europi štite ove podatke. Lijepljenje vašeg pravog imena, ID-a, e-pošte ili adrese u javni AI alat predstavlja kršenje. Pravilo: anonimizirajte podatke prije dijeljenja, navedite samo shemu (nazivi stupaca, vrste) i lažni primjer retka ako je potrebno. Produbit ćemo temu etike u jedinici 11; Postavimo princip od početka: za razumijevanje podataka često je dovoljno podijeliti njihovu strukturu, a ne sadržaj.
Uobičajene greške
- Čekanje brojeva/mjernih podataka bez davanja podataka umjetnoj inteligenciji. Model ne može pristupiti podacima; Broj koji daje je lažan. Uvijek izračunajte i pokrenite rezultat.
- Misleći da je radni kod točan. Kod koji manipulira pogrešnim stupcem također radi bez grešaka; Ne vjerujte bez čitanja logike.
- Lijepljenje stvarnih osobnih podataka u otvoreni alat. Ime, broj osobne iskaznice, e-mail se nikada ne dijele; Dovoljan je dijagram.
- Izvođenje koraka ručno i ne upisivanje u kod. Analiza koja nije ponovljiva je nepouzdana.
- Prihvaćanje AI-jeve interpretacije statistike bez pitanja. AI može ponoviti klasične pogreške u konceptima kao što su p-vrijednost i korelacija.
Savjet: Uključite kratki "redak pravila" u svaku svoju AI sesiju: "Nemojte izmišljati sadržaj podataka; samo generirajte kod/analizu i ja ću pokrenuti i potvrditi rezultat; naznačite 'nisam siguran' tamo gdje niste sigurni." Ova jedna rečenica značajno smanjuje rizik od halucinacija.
Ukratko
AI je moćan pomoćnik u znanosti o podacima: ubrzava čišćenje koda, EDA interpretaciju, preporuku modela i vizualizaciju. Ali definiranje problema, odabir metrike, odluka o proizvodnji i etičke granice pripadaju ljudima. Tijek rada ima šest faza, a uloga umjetne inteligencije postaje manja kako se rizik povećava. Tri su navike temelj svega: povezivanje izvora (provjera valjanosti), ponovljivost (kodiranje) i anonimizacija (povjerljivost). Nakon što usvojite ovo troje, svaki alat u ostatku modula postaje siguran akcelerator za vas.
Zadatak aplikacije
Samo napravite shemu male tablice koju imate (ili hipotetske): nazive stupaca, tipove i 2-3 lažna primjera retka (bez pravih osobnih podataka). Zatražite kod umjetne inteligencije za sažeti statistički kod pomoću gornjeg predloška "Powerful prompt". Pokrenite kod, usporedite izlaz s ručnom vrijednošću, provjerite ima li lažnih pretpostavki i zabilježite svoje nalaze u pet točaka.
popis za provjeru
- [ ] Jesam li AI-ju upravo dao shemu i lažni uzorak umjesto pravih osobnih podataka?
- [ ] Jesam li pročitao i pokrenuo kod koji je proizveo redak po redak?
- [ ] Jesam li neovisno provjerio svaki broj u izlazu?
- [ ] Jesam li svaki korak analize zapisao u kod i učinio ga ponovljivim?
- [ ] Jesam li odredio razinu rizika misije i dodijelio konačnu odluku čovjeku?