Vienetas 1 / 11

Duomenų mokslo ir analizės dirbtinio intelekto įvadas: darbo eiga, vaidmenys, ribos, patvirtinimas ir etika

Pelnas:

  • Gebėjimas atskirti šešių etapų duomenų mokslo darbo eigą (problemos apibrėžimas, rinkimas, valymas, atradimas, modeliavimas, komunikacija) ir autoritetą, kuriam vadovauja dirbtinis intelektas kiekviename etape, pagal užduoties rizikos lygį.
  • Gebėjimas pritaikyti discipliną, kuri patikrina kiekvieną dirbtinio intelekto išvestį, prijungdama ją prie šaltinio, paleisdama ir palygindama bei perduodama per ekspertų filtravimą.
  • Galimybė atkuriamumo ir privatumo principus (rašymas į kodą, anonimiškumas) nuo pat pirmos dienos paversti analizės įpročiais

Neapdoroti, netvarkingi ir dažnai „melagingi“ duomenys kasdien patenka ant duomenų mokslininko stalo. Pardavimo lentelėje datos stulpelis rašomas trimis skirtingais formatais; klientų numeriai kai kuriose eilutėse yra tušti; Stulpelio pavadinimas yra „pajamos“, tačiau jame yra ir TL, ir USD reikšmės. Duomenų mokslo darbas yra priimti patikimą sprendimą iš šio chaoso: rinkti duomenis, išvalyti, ištirti, sukurti modelį, patvirtinti rezultatą ir paversti jį istorija. Dirbtinis intelektas (AI arba trumpai AI – kompiuterinės sistemos, galinčios generuoti tekstą ir kodą, atpažinti šablonus, apibendrinti ir prognozuoti) gali paliesti kiekvieną šios grandinės grandį: parašyti valymo kodą per kelias minutes, rekomenduoti grafikus tiriamajai analizei, interpretuoti modelio metriką, taisyti SQL užklausą. Tačiau tas pats AI taip pat gali suteikti jums patikimą prasmę, pvz., „koreliaciją 0,72“ duomenims, kurių jis niekada nematė.

Šis pirmasis skyrius nėra bibliotekos įvadas. Jo tikslas – paaiškinti, kur AI įdėti į duomenų mokslo darbo eigą ir kur jo niekada nedėti. Iš pradžių išdėstykime pagrindinį principą: AI yra asistentas, o ne duomenų mokslininkas. Kompetentingas ekspertas sprendžia, kokius duomenis rinkti, dėl kokios metrikos nuspręsti, ar pradėti gaminti modelį ir kur nubrėžti etines ribas. Nepatvirtinta AI išvestis yra rizikinga, kaip ir nepasirašyta analizės ataskaita.

Duomenų mokslo darbo eiga: žemėlapis nuo pabaigos iki galo

Norint suprasti duomenų projektą, naudinga jį suskirstyti į šešis etapus. Visas šis modulis seka šį žemėlapį.

1. Problemos apibrėžimas: ką matuojame, kodėl, kad paremtume kokį sprendimą? Šis etapas nėra deleguotas AI; Tai asmuo, kuris apibrėžia darbą.

2. Duomenų rinkimas: šaltinių nustatymas, duomenų ištraukimas, atranka. (2 skyrius)

3. Duomenų valymas ir išankstinis apdorojimas: trūksta reikšmės, nuokrypio, tipo konvertavimas. (3 skyrius)

4. Tiriamoji duomenų analizė (EDA – Exploratory Data Analysis, duomenų pasiskirstymo ir ryšių atpažinimo „iš akies“ etapas): (4 skyrius)

5. Funkcijų inžinerija ir modeliavimas: Kintamųjų generavimas, algoritmų pasirinkimas, mokymas, įvertinimas. (5, 6, 7 skyrius)

6. Komunikacija ir gamyba: Vizualizacija, istorija, MLOps (modelio priėmimo gyvai ir jo stebėjimo disciplina). (8, 11 skyrius)

Kiekviename iš šių šešių etapų AI veikia su skirtinga institucija. Toliau pateiktoje lentelėje apibendrintas šis įgaliojimų pasiskirstymas; Tai vienintelė svarbiausia modulio lentelė.

Scena

AI vaidmuo

Rizikos lygis

Kas pritaria

Problemos apibrėžimas

smegenų šturmo partneris

žemas

Duomenų mokslininkas + suinteresuotoji šalis

Parašykite valymo kodą

Kodo eskizų generatorius

vidutinis

Duomenų mokslininkas (skaito kodą)

EDA komentaras

modelio siūlytojas

vidutinis

duomenų mokslininkas

Funkcijų generavimas

Idėjų ir kodų generatorius

vidutinio aukšto

Nuotėkio kontrolė yra būtina

Modelio pasirinkimas/metrika

konsultantas

aukštas

duomenų mokslininkas

Sprendimas pradėti gaminti

pagalbinis įėjimas

labai aukštas

Komanda + įmonės savininkas

Etikos/privatumo patvirtinimas

stimuliatorius

labai aukštas

žmogus, visada

Atsiminkite vieną šios diagramos sakinį: didėjant statymui dirbtinio intelekto vaidmuo mažėja ir žmonių pritarimas auga.

Kodėl patvirtinimas yra šio verslo esmė

AI kalbos modeliai atrodo tikri, bet gali būti tikri. Techninėje kalboje tai vadinama haliucinacija: tai modelio neegzistuojančios informacijos išgalvojimas sklandžiu sakiniu, tarsi ji būtų tiesa. Duomenų moksle tai būna trijų formų. Pirmasis – netikras numeris: jei modelio paklausite „kokia vidutinė užsakymo suma“, nepateikdami jokių duomenų, jis užtikrintai pasakys numerį, nors niekada ir nematė jūsų duomenų. Antroji yra neegzistuojanti funkcija: modelis gali pasiūlyti funkciją, kurios visai nėra, pvz., pandas.read_excel_fast(). Trečia, neteisingas statistinis aiškinimas: modelis gali sklandžiai pakartoti klasikinę statistinę klaidą, tokią kaip „p reikšmė yra 0,04, taigi hipotezė yra 96% teisinga“.

Patikrinimo disciplina susideda iš trijų etapų:

  1. Nuoroda į šaltinį: kiekvienas skaičius, rodiklis ir tendencija turi būti gaunami iš jūsų duomenų, o ne iš AI atminties. Naudokite dirbtinį intelektą kodui, kuris veikia su duomenimis, o ne tam, kad įsimintų duomenis.
  2. Vykdykite ir palyginkite: paleiskite kiekvieną AI pateiktą kodo dalį; Palyginkite kiekvieną jos sukurtą metriką su nepriklausoma bazine linija.
  3. Ekspertų filtras: patikrinkite patys, ar išvestis prieštarauja statistikai ir srities žinioms.
Atsargiai: AI parašytos analizės įtraukimas į pristatymą jo nepaleidus ir neperskaičius prilygsta nepasirašytos ataskaitos pateikimui. Vien todėl, kad kodas veikia, dar nereiškia, kad jis teisingas; Neteisingą stulpelį susumuojantis kodas taip pat veikia be klaidų.

Atkuriamumas: galimybė gauti tą patį rezultatą du kartus

Tylus, bet kritiškas duomenų mokslo principas yra atkuriamumas: atlikę analizę dar kartą po šešių mėnesių arba kitame kompiuteryje, gaunate tą patį rezultatą. Ši rizika padidėja dirbant su AI, nes kai liepiate AI „sudaryti šį grafiką“ ir paleisti jį rankiniu būdu, žingsniai išnyksta. Taisyklė: kiekvienas veiksmas turi būti užregistruotas kode ir versijos valdiklyje (kaip Git); Žingsniais, susijusiais su atsitiktinumu, turėtų būti nustatyta atsitiktinė sėkla (pradinė atsitiktinių skaičių generatoriaus reikšmė; jei fiksuota, rezultatas bus pakartojamas). Pagilinsime šią temą 10 skyriuje; Kol kas įsisavinkite šį įprotį: „Nespauskite ranka, rašykite kodą“.

trys mini dėklai

1 atvejis – saugus pagreitis. Elektroninės prekybos analitikas paprastai praleistų pusę dienos, kad išvalytų 240 tūkstančių eilučių užsakymų lentelę. Jis AI davė stulpelių pavadinimus ir pirmąsias 5 eilutes (be asmens duomenų) ir paprašė pandų valymo kodo. AI sukūrė juodraštį per 8 sekundes; Analitikas perskaitė kodą eilutę po eilutės, ištaisė datos analizės klaidą ir jį paleido. Trukmė: 35 minutės vietoj 4 valandų. AI pateikė kodą, patvirtinimas liko žmogui.

2 atvejis. Sugalvotas metrinis gaudyklė. Stažuotojas paklausė AI: „Ar šie duomenys yra atsitiktiniai? visai netreniruodamas modelio. „Apie 89 proc.“, – sakė AI. Stažuotojas tai įtraukė į pristatymą; Kai buvo apmokytas tikras modelis, tikslumas buvo 71%. Klaida: laukiama metrikos nepateikiant duomenų ir modelių dirbtiniam intelektui.

3 atvejis – tylus nuotėkis. Viena komanda įgyvendino AI pasiūlytą idėją „pridėti tikslinio kintamojo vidurkį kaip ypatybę“ jos neabejodama. Modelis atliko 98 % bandymo rinkinio, tačiau gamybos metu sudužo, nes dėl funkcijos nutekėjo būsimos informacijos (duomenų nutekėjimas, 10 skyrius). Klaida: statistiškai nefiltruojama AI rekomendacija.

Silpnas raginimas / Stiprus raginimas

Silpnas raginimas:

Išanalizuokite šiuos pardavimo duomenis ir pasakykite man vidutines pajamas.

Šis teiginys yra klaidingas: AI nebuvo pateikti duomenys, todėl „vidutinės pajamos“ gali būti tik skaičiuojamos. Neaiškūs nei stulpeliai, nei laikotarpis, nei valiuta.

Galingas raginimas:

Jūsų vaidmuo: padėjėjas, padedantis duomenų mokslininkui. Turiu pandos DataFrame: df. Stulpeliai:- order_date (tekstas, formatu "2024-03-01")- suma_tl (dešimtainis, NaN kai kuriose eilutėse)- customer_id (sveikasis skaičius)Užduotis: (1) parašykite pandos kodą, kuris apskaičiuoja vidutinę sumą, (2) paaiškinkite, kaip jis tvarko NaN reikšmes, (3) išvardykite prielaidas, kurias daro kodas. Nesudarykite duomenų turinio; tiesiog sugeneruosiu kodą ir aš paleisiu ir patikrinsiu rezultatą.

Šiame prašyme aiški schema, lūkesčiai ir „draudimas gaminti“. Jūs vis tiek paleidžiate ir patikrinate išvestį patys.

Etikos ir privatumo užuomazgos

Duomenų mokslas dažnai dirba su asmens duomenimis: klientų, pacientų, darbuotojų įrašais. Šiuos duomenis saugo KVKK (asmens duomenų apsaugos įstatymas) Turkijoje ir GDPR Europoje. Tikro vardo, ID, el. pašto ar adreso įklijavimas į viešą AI įrankį yra pažeidimas. Taisyklė: anonimizuoti duomenis prieš dalinantis, jei reikia, pateikite tik schemą (stulpelių pavadinimus, tipus) ir netikrą pavyzdinę eilutę. Etikos temą gilinsime 11 skyriuje; Išdėskime principą nuo pat pradžių: norint suprasti duomenis, dažnai pakanka dalytis jų struktūra, o ne turiniu.

Dažnos klaidos

  • Laukiama skaičių / metrikų nepateikiant duomenų AI. Modelis negali pasiekti duomenų; Jo duotas skaičius yra netikras. Visada apskaičiuokite rezultatą ir paleiskite.
  • Mano, kad darbo kodas yra teisingas. Kodas, kuris manipuliuoja netinkamu stulpeliu, taip pat veikia be klaidų; Nepasitikėk neperskaitęs logikos.
  • Tikrų asmens duomenų įklijavimas į atvirą įrankį. Vardas, ID numeris, el. paštas niekada nebendrinami; Pakanka diagramos.
  • Atlikite veiksmus rankiniu būdu ir neįrašykite jų į kodą. Analizė, kurios negalima atkurti, yra nepatikima.
  • Neabejotinai priimamas AI statistikos interpretavimas. AI gali pakartoti klasikines klaidas tokiose sąvokose kaip p vertė ir koreliacija.
Patarimas: į kiekvieną dirbtinio intelekto seansą įtraukite trumpą „taisyklės eilutę“: „Nesudarykite duomenų turinio; tiesiog sugeneruosiu kodą / analizę ir aš paleisiu bei patikrinsiu rezultatą; nurodykite „nesate tikri“, kur nesate tikri. Šis vienas sakinys žymiai sumažina haliucinacijų riziką.

Apibendrinant

AI yra galingas duomenų mokslo asistentas: jis pagreitina valymo kodą, EDA interpretaciją, modelių rekomendacijas ir vizualizavimą. Tačiau problemos apibrėžimas, metrinis pasirinkimas, gamybos sprendimas ir etinės ribos priklauso žmonėms. Darbo eiga susideda iš šešių etapų, o AI vaidmuo mažėja didėjant rizikai. Trys įpročiai yra visko pagrindas: šaltinio susiejimas (patvirtinimas), atkuriamumas (kodavimas) ir anonimiškumas (konfidencialumas). Kai įsisavinsite šiuos tris elementus, kiekvienas įrankis likusioje modulio dalyje taps saugiu greitintuvu.

Taikymo užduotis

Tiesiog sukurkite nedidelės turimos (arba hipotetinės) lentelės schemą: stulpelių pavadinimai, tipai ir 2–3 fiktyvios pavyzdžių eilutės (be tikrų asmens duomenų). Paprašykite AI pateikti suvestinės statistikos kodą naudodami anksčiau pateiktą šabloną „Galingas raginimas“. Paleiskite kodą, palyginkite išvestį su rankine verte, patikrinkite, ar nėra klaidingų prielaidų, ir pažymėkite savo išvadas 5 ženkleliais.

kontrolinis sąrašas

  • [ ] Ar aš tiesiog pateikiau AI schemą ir netikrą pavyzdį, o ne tikrus asmens duomenis?
  • [ ] Ar perskaičiau ir paleidau jo sukurtą kodą eilutė po eilutės?
  • [ ] Ar aš atskirai patikrinau kiekvieną išvestyje esantį skaičių?
  • [ ] Ar kiekvieną analizės žingsnį įrašiau į kodą ir padariau jį pakartojamą?
  • [ ] Ar aš nustatiau misijos rizikos lygį ir paskyriau galutinį sprendimą žmogui?