Pelnas:
- Gebėjimas atskirti šešių etapų duomenų mokslo darbo eigą (problemos apibrėžimas, rinkimas, valymas, atradimas, modeliavimas, komunikacija) ir autoritetą, kuriam vadovauja dirbtinis intelektas kiekviename etape, pagal užduoties rizikos lygį.
- Gebėjimas pritaikyti discipliną, kuri patikrina kiekvieną dirbtinio intelekto išvestį, prijungdama ją prie šaltinio, paleisdama ir palygindama bei perduodama per ekspertų filtravimą.
- Galimybė atkuriamumo ir privatumo principus (rašymas į kodą, anonimiškumas) nuo pat pirmos dienos paversti analizės įpročiais
Neapdoroti, netvarkingi ir dažnai „melagingi“ duomenys kasdien patenka ant duomenų mokslininko stalo. Pardavimo lentelėje datos stulpelis rašomas trimis skirtingais formatais; klientų numeriai kai kuriose eilutėse yra tušti; Stulpelio pavadinimas yra „pajamos“, tačiau jame yra ir TL, ir USD reikšmės. Duomenų mokslo darbas yra priimti patikimą sprendimą iš šio chaoso: rinkti duomenis, išvalyti, ištirti, sukurti modelį, patvirtinti rezultatą ir paversti jį istorija. Dirbtinis intelektas (AI arba trumpai AI – kompiuterinės sistemos, galinčios generuoti tekstą ir kodą, atpažinti šablonus, apibendrinti ir prognozuoti) gali paliesti kiekvieną šios grandinės grandį: parašyti valymo kodą per kelias minutes, rekomenduoti grafikus tiriamajai analizei, interpretuoti modelio metriką, taisyti SQL užklausą. Tačiau tas pats AI taip pat gali suteikti jums patikimą prasmę, pvz., „koreliaciją 0,72“ duomenims, kurių jis niekada nematė.
Šis pirmasis skyrius nėra bibliotekos įvadas. Jo tikslas – paaiškinti, kur AI įdėti į duomenų mokslo darbo eigą ir kur jo niekada nedėti. Iš pradžių išdėstykime pagrindinį principą: AI yra asistentas, o ne duomenų mokslininkas. Kompetentingas ekspertas sprendžia, kokius duomenis rinkti, dėl kokios metrikos nuspręsti, ar pradėti gaminti modelį ir kur nubrėžti etines ribas. Nepatvirtinta AI išvestis yra rizikinga, kaip ir nepasirašyta analizės ataskaita.
Duomenų mokslo darbo eiga: žemėlapis nuo pabaigos iki galo
Norint suprasti duomenų projektą, naudinga jį suskirstyti į šešis etapus. Visas šis modulis seka šį žemėlapį.
1. Problemos apibrėžimas: ką matuojame, kodėl, kad paremtume kokį sprendimą? Šis etapas nėra deleguotas AI; Tai asmuo, kuris apibrėžia darbą.
2. Duomenų rinkimas: šaltinių nustatymas, duomenų ištraukimas, atranka. (2 skyrius)
3. Duomenų valymas ir išankstinis apdorojimas: trūksta reikšmės, nuokrypio, tipo konvertavimas. (3 skyrius)
4. Tiriamoji duomenų analizė (EDA – Exploratory Data Analysis, duomenų pasiskirstymo ir ryšių atpažinimo „iš akies“ etapas): (4 skyrius)
5. Funkcijų inžinerija ir modeliavimas: Kintamųjų generavimas, algoritmų pasirinkimas, mokymas, įvertinimas. (5, 6, 7 skyrius)
6. Komunikacija ir gamyba: Vizualizacija, istorija, MLOps (modelio priėmimo gyvai ir jo stebėjimo disciplina). (8, 11 skyrius)
Kiekviename iš šių šešių etapų AI veikia su skirtinga institucija. Toliau pateiktoje lentelėje apibendrintas šis įgaliojimų pasiskirstymas; Tai vienintelė svarbiausia modulio lentelė.
Scena
AI vaidmuo
Rizikos lygis
Kas pritaria
Problemos apibrėžimas
smegenų šturmo partneris
žemas
Duomenų mokslininkas + suinteresuotoji šalis
Parašykite valymo kodą
Kodo eskizų generatorius
vidutinis
Duomenų mokslininkas (skaito kodą)
EDA komentaras
modelio siūlytojas
vidutinis
duomenų mokslininkas
Funkcijų generavimas
Idėjų ir kodų generatorius
vidutinio aukšto
Nuotėkio kontrolė yra būtina
Modelio pasirinkimas/metrika
konsultantas
aukštas
duomenų mokslininkas
Sprendimas pradėti gaminti
pagalbinis įėjimas
labai aukštas
Komanda + įmonės savininkas
Etikos/privatumo patvirtinimas
stimuliatorius
labai aukštas
žmogus, visada
Atsiminkite vieną šios diagramos sakinį: didėjant statymui dirbtinio intelekto vaidmuo mažėja ir žmonių pritarimas auga.
Kodėl patvirtinimas yra šio verslo esmė
AI kalbos modeliai atrodo tikri, bet gali būti tikri. Techninėje kalboje tai vadinama haliucinacija: tai modelio neegzistuojančios informacijos išgalvojimas sklandžiu sakiniu, tarsi ji būtų tiesa. Duomenų moksle tai būna trijų formų. Pirmasis – netikras numeris: jei modelio paklausite „kokia vidutinė užsakymo suma“, nepateikdami jokių duomenų, jis užtikrintai pasakys numerį, nors niekada ir nematė jūsų duomenų. Antroji yra neegzistuojanti funkcija: modelis gali pasiūlyti funkciją, kurios visai nėra, pvz., pandas.read_excel_fast(). Trečia, neteisingas statistinis aiškinimas: modelis gali sklandžiai pakartoti klasikinę statistinę klaidą, tokią kaip „p reikšmė yra 0,04, taigi hipotezė yra 96% teisinga“.
Patikrinimo disciplina susideda iš trijų etapų:
- Nuoroda į šaltinį: kiekvienas skaičius, rodiklis ir tendencija turi būti gaunami iš jūsų duomenų, o ne iš AI atminties. Naudokite dirbtinį intelektą kodui, kuris veikia su duomenimis, o ne tam, kad įsimintų duomenis.
- Vykdykite ir palyginkite: paleiskite kiekvieną AI pateiktą kodo dalį; Palyginkite kiekvieną jos sukurtą metriką su nepriklausoma bazine linija.
- Ekspertų filtras: patikrinkite patys, ar išvestis prieštarauja statistikai ir srities žinioms.
Atsargiai: AI parašytos analizės įtraukimas į pristatymą jo nepaleidus ir neperskaičius prilygsta nepasirašytos ataskaitos pateikimui. Vien todėl, kad kodas veikia, dar nereiškia, kad jis teisingas; Neteisingą stulpelį susumuojantis kodas taip pat veikia be klaidų.
Atkuriamumas: galimybė gauti tą patį rezultatą du kartus
Tylus, bet kritiškas duomenų mokslo principas yra atkuriamumas: atlikę analizę dar kartą po šešių mėnesių arba kitame kompiuteryje, gaunate tą patį rezultatą. Ši rizika padidėja dirbant su AI, nes kai liepiate AI „sudaryti šį grafiką“ ir paleisti jį rankiniu būdu, žingsniai išnyksta. Taisyklė: kiekvienas veiksmas turi būti užregistruotas kode ir versijos valdiklyje (kaip Git); Žingsniais, susijusiais su atsitiktinumu, turėtų būti nustatyta atsitiktinė sėkla (pradinė atsitiktinių skaičių generatoriaus reikšmė; jei fiksuota, rezultatas bus pakartojamas). Pagilinsime šią temą 10 skyriuje; Kol kas įsisavinkite šį įprotį: „Nespauskite ranka, rašykite kodą“.
trys mini dėklai
1 atvejis – saugus pagreitis. Elektroninės prekybos analitikas paprastai praleistų pusę dienos, kad išvalytų 240 tūkstančių eilučių užsakymų lentelę. Jis AI davė stulpelių pavadinimus ir pirmąsias 5 eilutes (be asmens duomenų) ir paprašė pandų valymo kodo. AI sukūrė juodraštį per 8 sekundes; Analitikas perskaitė kodą eilutę po eilutės, ištaisė datos analizės klaidą ir jį paleido. Trukmė: 35 minutės vietoj 4 valandų. AI pateikė kodą, patvirtinimas liko žmogui.
2 atvejis. Sugalvotas metrinis gaudyklė. Stažuotojas paklausė AI: „Ar šie duomenys yra atsitiktiniai? visai netreniruodamas modelio. „Apie 89 proc.“, – sakė AI. Stažuotojas tai įtraukė į pristatymą; Kai buvo apmokytas tikras modelis, tikslumas buvo 71%. Klaida: laukiama metrikos nepateikiant duomenų ir modelių dirbtiniam intelektui.
3 atvejis – tylus nuotėkis. Viena komanda įgyvendino AI pasiūlytą idėją „pridėti tikslinio kintamojo vidurkį kaip ypatybę“ jos neabejodama. Modelis atliko 98 % bandymo rinkinio, tačiau gamybos metu sudužo, nes dėl funkcijos nutekėjo būsimos informacijos (duomenų nutekėjimas, 10 skyrius). Klaida: statistiškai nefiltruojama AI rekomendacija.
Silpnas raginimas / Stiprus raginimas
Silpnas raginimas:
Išanalizuokite šiuos pardavimo duomenis ir pasakykite man vidutines pajamas.
Šis teiginys yra klaidingas: AI nebuvo pateikti duomenys, todėl „vidutinės pajamos“ gali būti tik skaičiuojamos. Neaiškūs nei stulpeliai, nei laikotarpis, nei valiuta.
Galingas raginimas:
Jūsų vaidmuo: padėjėjas, padedantis duomenų mokslininkui. Turiu pandos DataFrame: df. Stulpeliai:- order_date (tekstas, formatu "2024-03-01")- suma_tl (dešimtainis, NaN kai kuriose eilutėse)- customer_id (sveikasis skaičius)Užduotis: (1) parašykite pandos kodą, kuris apskaičiuoja vidutinę sumą, (2) paaiškinkite, kaip jis tvarko NaN reikšmes, (3) išvardykite prielaidas, kurias daro kodas. Nesudarykite duomenų turinio; tiesiog sugeneruosiu kodą ir aš paleisiu ir patikrinsiu rezultatą.
Šiame prašyme aiški schema, lūkesčiai ir „draudimas gaminti“. Jūs vis tiek paleidžiate ir patikrinate išvestį patys.
Etikos ir privatumo užuomazgos
Duomenų mokslas dažnai dirba su asmens duomenimis: klientų, pacientų, darbuotojų įrašais. Šiuos duomenis saugo KVKK (asmens duomenų apsaugos įstatymas) Turkijoje ir GDPR Europoje. Tikro vardo, ID, el. pašto ar adreso įklijavimas į viešą AI įrankį yra pažeidimas. Taisyklė: anonimizuoti duomenis prieš dalinantis, jei reikia, pateikite tik schemą (stulpelių pavadinimus, tipus) ir netikrą pavyzdinę eilutę. Etikos temą gilinsime 11 skyriuje; Išdėskime principą nuo pat pradžių: norint suprasti duomenis, dažnai pakanka dalytis jų struktūra, o ne turiniu.
Dažnos klaidos
- Laukiama skaičių / metrikų nepateikiant duomenų AI. Modelis negali pasiekti duomenų; Jo duotas skaičius yra netikras. Visada apskaičiuokite rezultatą ir paleiskite.
- Mano, kad darbo kodas yra teisingas. Kodas, kuris manipuliuoja netinkamu stulpeliu, taip pat veikia be klaidų; Nepasitikėk neperskaitęs logikos.
- Tikrų asmens duomenų įklijavimas į atvirą įrankį. Vardas, ID numeris, el. paštas niekada nebendrinami; Pakanka diagramos.
- Atlikite veiksmus rankiniu būdu ir neįrašykite jų į kodą. Analizė, kurios negalima atkurti, yra nepatikima.
- Neabejotinai priimamas AI statistikos interpretavimas. AI gali pakartoti klasikines klaidas tokiose sąvokose kaip p vertė ir koreliacija.
Patarimas: į kiekvieną dirbtinio intelekto seansą įtraukite trumpą „taisyklės eilutę“: „Nesudarykite duomenų turinio; tiesiog sugeneruosiu kodą / analizę ir aš paleisiu bei patikrinsiu rezultatą; nurodykite „nesate tikri“, kur nesate tikri. Šis vienas sakinys žymiai sumažina haliucinacijų riziką.
Apibendrinant
AI yra galingas duomenų mokslo asistentas: jis pagreitina valymo kodą, EDA interpretaciją, modelių rekomendacijas ir vizualizavimą. Tačiau problemos apibrėžimas, metrinis pasirinkimas, gamybos sprendimas ir etinės ribos priklauso žmonėms. Darbo eiga susideda iš šešių etapų, o AI vaidmuo mažėja didėjant rizikai. Trys įpročiai yra visko pagrindas: šaltinio susiejimas (patvirtinimas), atkuriamumas (kodavimas) ir anonimiškumas (konfidencialumas). Kai įsisavinsite šiuos tris elementus, kiekvienas įrankis likusioje modulio dalyje taps saugiu greitintuvu.
Taikymo užduotis
Tiesiog sukurkite nedidelės turimos (arba hipotetinės) lentelės schemą: stulpelių pavadinimai, tipai ir 2–3 fiktyvios pavyzdžių eilutės (be tikrų asmens duomenų). Paprašykite AI pateikti suvestinės statistikos kodą naudodami anksčiau pateiktą šabloną „Galingas raginimas“. Paleiskite kodą, palyginkite išvestį su rankine verte, patikrinkite, ar nėra klaidingų prielaidų, ir pažymėkite savo išvadas 5 ženkleliais.
kontrolinis sąrašas
- [ ] Ar aš tiesiog pateikiau AI schemą ir netikrą pavyzdį, o ne tikrus asmens duomenis?
- [ ] Ar perskaičiau ir paleidau jo sukurtą kodą eilutė po eilutės?
- [ ] Ar aš atskirai patikrinau kiekvieną išvestyje esantį skaičių?
- [ ] Ar kiekvieną analizės žingsnį įrašiau į kodą ir padariau jį pakartojamą?
- [ ] Ar aš nustatiau misijos rizikos lygį ir paskyriau galutinį sprendimą žmogui?