Enota 1 / 11

Uvod v umetno inteligenco v podatkovni znanosti in analitiki: potek dela, vloge, meje, validacija in etika

Dobički:

  • Sposobnost razlikovanja šeststopenjskega delovnega toka znanosti o podatkih (opredelitev problema, zbiranje, čiščenje, odkrivanje, modeliranje, komunikacija) in avtoritete, pod katerimi deluje umetna inteligenca na vsaki stopnji, glede na stopnjo tveganja naloge
  • Sposobnost uporabe discipline, ki preverja vsak izhod umetne inteligence tako, da ga poveže z virom, izvaja in primerja ter posreduje skozi strokovno filtriranje.
  • Sposobnost spremeniti ponovljivost in načela zasebnosti (zapisovanje v kodo, anonimizacija) v analitične navade od prvega dne

Surovi, neurejeni in pogosto »lažnivi« podatki vsak dan pristanejo na mizi podatkovnega znanstvenika. V tabeli prodaje je stolpec datuma zapisan v treh različnih oblikah; številke strank so v nekaterih vrsticah prazne; Ime stolpca je "dohodek", vendar vsebuje vrednosti TL in USD. Naloga podatkovne znanosti je sprejeti zanesljivo odločitev iz tega kaosa: zbrati podatke, jih očistiti, raziskati, zgraditi model, potrditi rezultat in ga spremeniti v zgodbo. Umetna inteligenca (AI ali na kratko AI – računalniški sistemi, ki lahko ustvarijo besedilo in kodo, prepoznajo vzorce, povzemajo in napovedujejo) se lahko dotaknejo vsakega člena v tej verigi: pisanje kode za čiščenje v minutah, priporočilo grafov za raziskovalno analizo, interpretacija metrike modela, popravljanje poizvedbe SQL. Toda isti AI vam lahko zagotovi tudi zanesljivo izmišljotino, kot je "korelacija 0,72" za podatke, ki jih še nikoli ni videl.

Ta prva enota ni uvod v knjižnico. Njegov namen je razjasniti, kam postaviti umetno inteligenco v potek dela podatkovne znanosti in kam je nikoli. Postavimo osnovno načelo od začetka: AI je pomočnik, ne podatkovni znanstvenik. Odločitev o tem, katere podatke zbirati, za katero meritev se odločiti, ali dati model v proizvodnjo in kje potegniti etične meje, je v rokah kompetentnega strokovnjaka. Nepreverjen rezultat AI je tvegan, prav tako nepodpisano poročilo o analizi.

Potek dela podatkovne znanosti: zemljevid od konca do konca

Da bi razumeli podatkovni projekt, ga je koristno razdeliti na šest faz. Celoten modul sledi temu zemljevidu.

1. Opredelitev problema: Kaj merimo, zakaj, v podporo kateri odločitvi? Ta faza ni prenesena na AI; Oseba je tista, ki definira delo.

2. Zbiranje podatkov: Identifikacija virov, pridobivanje podatkov, vzorčenje. (enota 2)

3. Čiščenje podatkov in predhodna obdelava: manjkajoča vrednost, izstopajoča vrednost, pretvorba tipa. (Enota 3)

4. Raziskovalna analiza podatkov (EDA - Exploratory Data Analysis, stopnja prepoznavanja porazdelitve in odnosov podatkov »na oko«): (Enota 4)

5. Inženiring in modeliranje funkcij: generiranje spremenljivk, izbira algoritmov, usposabljanje, vrednotenje. (Enota 5, 6, 7)

6. Komunikacija in produkcija: Vizualizacija, zgodba, MLOps (disciplina prenosa modela v živo in spremljanje). (Enota 8, 11)

AI deluje z drugačno avtoriteto v vsaki od teh šestih stopenj. Spodnja tabela povzema to porazdelitev pooblastil; To je najpomembnejša tabela v modulu.

Oder

Vloga AI

Stopnja tveganja

Kdo odobri

Opredelitev problema

partner za brainstorming

nizka

Podatkovni znanstvenik + deležnik

Napišite kodo za čiščenje

Generator kodnih skic

srednje

Podatkovni znanstvenik (bere kodo)

komentar EDA

predlagatelj vzorcev

srednje

podatkovni znanstvenik

Generiranje funkcij

Generator idej in kod

srednje visoka

Nadzor puščanja je obvezen

Izbira/metrika modela

svetovalec

visoka

podatkovni znanstvenik

Odločitev za začetek proizvodnje

pomožni vhod

zelo visoko

Ekipa + lastnik podjetja

Odobritev etike/zasebnosti

poživilo

zelo visoko

človek, vedno

Upoštevajte en stavek iz te tabele: ko vložki naraščajo, se vloga umetne inteligence zmanjšuje in odobravanje ljudi raste.

Zakaj je preverjanje srce tega posla

Jezikovni modeli umetne inteligence so videti zanesljivi, vendar morda niso prepričani. V tehničnem jeziku se to imenuje halucinacija: to je izmišljotina neobstoječe informacije v tekočem stavku, kot da bi bila resnična. V podatkovni znanosti je to v treh oblikah. Prva je ponarejena številka: če vprašate model "koliko je povprečni znesek naročila", ne da bi navedli kakršne koli podatke, vam bo samozavestno povedal številko, čeprav nikoli ni videl vaših podatkov. Druga je funkcija, ki ne obstaja: model lahko predlaga funkcijo, ki sploh ne obstaja, na primer pandas.read_excel_fast(). Tretjič, napačna statistična interpretacija: model lahko gladko ponovi klasično statistično napako, kot je "p-vrednost je 0,04, torej je hipoteza 96% pravilna".

Disciplina preverjanja je sestavljena iz treh korakov:

  1. Povezava do vira: Vsaka številka, stopnja in trend bi morali izhajati iz vaših podatkov, ne iz pomnilnika AI. Uporabite AI za kodo, ki deluje na podatkih, ne za to, da si zapomni podatke.
  2. Zaženite in primerjajte: sami zaženite vsak kos kode, ki jo je dal AI; Primerjajte vsako metriko, ki jo ustvari, z neodvisno osnovno linijo.
  3. Strokovni filter: sami preizkusite, ali je rezultat v nasprotju s statistiko in znanjem o domeni.
Pozor: Če analizo, ki jo je napisal umetna inteligenca, vnesete v predstavitev, ne da bi jo zagnali in prebrali, je kot da bi predstavili nepodpisano poročilo. Samo zato, ker koda deluje, še ne pomeni, da je pravilna; Brez napak deluje tudi koda, ki sešteje napačen stolpec.

Ponovljivost: zmožnost dvakratnega ustvarjanja istega rezultata

Tiho, a kritično načelo podatkovne znanosti je ponovljivost: ko znova izvedete analizo šest mesecev pozneje ali na drugem računalniku, dobite enak rezultat. To tveganje se poveča pri delu z umetno inteligenco, ker ko umetni inteligenci rečete, naj "naredi ta graf" in ga predvaja ročno, koraki izginejo. Pravilo: vsak korak mora biti registriran v kodi in nadzoru različic (kot Git); V korakih, ki vključujejo naključnost, je treba določiti naključno seme (začetno vrednost generatorja naključnih števil; če je določena, bo rezultat ponovljiv). To temo bomo poglobili v 10. enoti; Za zdaj se navadite: "Ne klikaj ročno, piši v kodi."

trije mini kovčki

Primer 1 – Varno pospeševanje. Analitik e-trgovine bi običajno porabil pol dneva za čiščenje tabele naročil z 240 tisoč vrsticami. Umetni inteligenci je dal imena stolpcev in prvih 5 vrstic (brez osebnih podatkov) in prosil za kodo za čiščenje pand. AI je ustvaril osnutek v 8 sekundah; Analitik je prebral kodo vrstico za vrstico, popravil napako pri razčlenjevanju datuma in jo zagnal. Trajanje: 35 minut namesto 4 ur. AI je zagotovil kodo, preverjanje je ostalo pri človeku.

2. primer – izmišljena metrična past. Pripravnik je vprašal AI: "Kako natančen je naključni gozd na teh podatkih?" brez treniranja modela. "Približno 89 %," je rekel AI. Pripravnik je to vnesel v predstavitev; Ko je bil pravi model usposobljen, je bila natančnost 71 %. Napaka: čakanje na metrike brez posredovanja podatkov in modelov AI.

Primer 3 – Tiho puščanje. Ena ekipa je implementirala zamisel, ki jo je predlagala umetna inteligenca, "dodaj srednjo vrednost ciljne spremenljivke kot funkcijo", ne da bi o tem dvomila. Model se je na testnem nizu izkazal za 98 %, vendar se je v proizvodnji zrušil, ker je funkcija uhajala prihodnje informacije (puščanje podatkov, enota 10). Napaka: priporočilo AI ni statistično filtrirano.

Šibek poziv/močan poziv

Šibek poziv:

Analizirajte te podatke o prodaji in mi povejte povprečni prihodek.

Ta trditev je napačna: AI ni prejel podatkov, zato je mogoče "povprečni dohodek" le nadoknaditi. Niti stolpci, niti obdobje, niti valuta niso jasni.

Močan poziv:

Vaša vloga: pomočnik, ki pomaga podatkovnemu znanstveniku. Imam pandas DataFrame: df. Stolpci:- datum_naročila (besedilo, v obliki "2024-03-01")- znesek_tl (decimalno, NaN v nekaterih vrsticah)- customer_id (celo število) Naloga: (1) napišite kodo pandas, ki izračuna povprečni znesek, (2) razložite, kako obravnava vrednosti NaN, (3) navedite predpostavke, ki jih naredi koda. Ne izmišljujte vsebine podatkov; samo ustvari kodo, jaz pa bom zagnal in preveril rezultat.

V tej zahtevi so shema, pričakovanje in »prepoved izmišljotin« jasni. Še vedno izvajate in sami preverjate izhod.

Začetki etike in zasebnosti

Podatkovna znanost pogosto dela z osebnimi podatki: evidence strank, bolnikov, zaposlenih. KVKK (Zakon o varstvu osebnih podatkov) v Turčiji in GDPR v Evropi ščitita te podatke. Lepljenje vašega pravega imena, ID-ja, e-pošte ali naslova v javno orodje AI je kršitev. Pravilo: anonimizirajte podatke pred skupno rabo, navedite samo shemo (imena stolpcev, vrste) in navidezno vzorčno vrstico, če je potrebno. Temo etike bomo poglobili v 11. enoti; Postavimo načelo od začetka: Za razumevanje podatkov je pogosto dovolj, da delimo njihovo strukturo in ne vsebine.

Pogoste napake

  • Čakanje na številke/metrike brez posredovanja podatkov AI. Model ne more dostopati do podatkov; Številka, ki jo daje, je lažna. Rezultat vedno izračunajte in zaženite.
  • Mislim, da je delovna koda pravilna. Tudi koda, ki manipulira z napačnim stolpcem, deluje brez napak; Ne zaupajte, ne da bi prebrali logiko.
  • Lepljenje resničnih osebnih podatkov v odprto orodje. Ime, osebna številka, e-pošta se nikoli ne delijo; Diagram je dovolj.
  • Korake izvajate ročno in jih ne zapisujete v kodo. Analiza, ki ni ponovljiva, je nezanesljiva.
  • Sprejemanje AI-jeve razlage statistike brez vprašanj. AI lahko ponovi klasične napake v konceptih, kot sta p-vrednost in korelacija.
Namig: V vsako sejo umetne inteligence vključite kratko "vrstico pravila": "Ne izmišljujte podatkovne vsebine; samo ustvarite kodo/analizo in zagnal bom in preveril rezultat; navedite 'nisem prepričan', kjer niste prepričani." Ta en sam stavek bistveno zmanjša tveganje za halucinacije.

Če povzamem

Umetna inteligenca je močan pomočnik v znanosti o podatkih: pospeši čiščenje kode, interpretacijo EDA, priporočilo modela in vizualizacijo. Toda opredelitev problema, izbira metrike, proizvodna odločitev in etične meje pripadajo ljudem. Potek dela ima šest stopenj, vloga umetne inteligence pa postaja manjša, ko se tveganje povečuje. Tri navade so temelj vsega: povezovanje vira (validacija), ponovljivost (kodiranje) in anonimizacija (zaupnost). Ko ponotranjite ta tri, postane vsako orodje v preostalem modulu varen pospeševalnik za vas.

Aplikacijska naloga

Samo naredite shemo majhne tabele, ki jo imate (ali hipotetične): imena stolpcev, vrste in 2-3 navidezne vzorčne vrstice (brez pravih osebnih podatkov). Prosite AI za kodo povzetka statistike z uporabo zgornje predloge »Zmogljiv poziv«. Zaženite kodo, primerjajte izhod z ročno vrednostjo, preverite morebitne lažne predpostavke in zabeležite svoje ugotovitve v 5 točkah.

kontrolni seznam

  • [ ] Ali sem AI pravkar dal shemo in lažni vzorec namesto resničnih osebnih podatkov?
  • [ ] Ali sem prebral in zagnal kodo, ki jo je ustvarila vrstico za vrstico?
  • [ ] Ali sem neodvisno preveril vsako številko v izhodu?
  • [ ] Ali sem vsak korak analize zapisal v kodo in jo naredil ponovljivo?
  • [ ] Ali sem določil stopnjo tveganja misije in končno odločitev zaupal človeku?