Njësia 1 / 11

Hyrje në inteligjencën artificiale në shkencën dhe analizën e të dhënave: Rrjedha e punës, rolet, kufijtë, verifikimi dhe etika

Fitimet:

  • Aftësia për të dalluar rrjedhën e punës me gjashtë faza të shkencës së të dhënave (përkufizimi i problemit, mbledhja, pastrimi, zbulimi, modelimi, komunikimi) dhe autoriteti nën të cilin funksionon inteligjenca artificiale në çdo fazë, sipas nivelit të rrezikut të detyrës
  • Aftësia për të aplikuar një disiplinë që verifikon çdo dalje të inteligjencës artificiale duke e lidhur atë me burimin, duke e ekzekutuar dhe krahasuar atë dhe duke e kaluar përmes filtrimit të ekspertëve.
  • Aftësia për të kthyer riprodhueshmërinë dhe parimet e privatësisë (shkrimi në kod, anonimizimi) në zakone analize që nga dita e parë

Të dhënat e papërpunuara, të çrregullta dhe shpesh “të gënjyera” vendosen në tavolinën e një shkencëtari të të dhënave çdo ditë. Në tabelën e shitjeve, kolona e datës shkruhet në tre formate të ndryshme; numrat e klientëve janë bosh në disa rreshta; Emri i një kolone është "të ardhura", por përmban të dyja vlerat TL dhe USD. Detyra e shkencës së të dhënave është të marrë një vendim të besueshëm nga ky kaos: të mbledhë të dhënat, t'i pastrojë, t'i eksplorojë, të ndërtojë një model, të vërtetojë rezultatin dhe ta kthejë atë në një histori. Inteligjenca artificiale (AI, ose shkurt AI, sisteme kompjuterike që mund të gjenerojnë tekst dhe kod, të njohin modele, të përmbledhin dhe të bëjnë parashikime) mund të prekë çdo hallkë në këtë zinxhir: shkrimi i kodit të pastrimit në minuta, rekomandimi i grafikëve për analiza eksploruese, interpretimi i metrikës së një modeli, korrigjimi i një pyetjeje SQL. Por e njëjta AI mund t'ju japë gjithashtu një trillim të sigurt si "korrelacioni 0.72" për të dhënat që nuk i ka parë kurrë.

Kjo njësi e parë nuk është një hyrje në bibliotekë. Qëllimi i tij është të sqarojë se ku duhet vendosur AI në rrjedhën e punës të shkencës së të dhënave dhe ku nuk duhet vendosur kurrë. Le të parashtrojmë parimin bazë që në fillim: AI është një asistent, jo një shkencëtar i të dhënave. Vendimi se çfarë të dhënash të mblidhen, çfarë metrike të vendoset, nëse do të vihet një model në prodhim dhe ku të vihen kufijtë etikë varet nga eksperti kompetent. Një rezultat i paverifikuar i AI është i rrezikshëm, siç është një raport analize i panënshkruar.

Rrjedha e punës e shkencës së të dhënave: harta nga fundi në fund

Për të kuptuar një projekt të dhënash, është e dobishme ta ndash atë në gjashtë faza. I gjithë ky modul ndjek këtë hartë.

1. Përkufizimi i problemit: Çfarë masim, pse, për të mbështetur cilin vendim? Kjo fazë nuk i është deleguar UA; Është personi që përcakton punën.

2. Mbledhja e të dhënave: Identifikimi i burimeve, nxjerrja e të dhënave, marrja e mostrave. (Njësia 2)

3. Pastrimi dhe parapërpunimi i të dhënave: Mungon vlera, vlera e jashtme, konvertimi i tipit. (Njësia 3)

4. Analiza e të dhënave eksplorative (EDA - Exploratory Data Analysis, faza e njohjes së shpërndarjes dhe marrëdhënieve të të dhënave "me sy"): (Njësia 4)

5. Inxhinieri dhe modelimi i veçorive: Gjenerimi i ndryshueshëm, përzgjedhja e algoritmit, trajnimi, vlerësimi. (Njësia 5, 6, 7)

6. Komunikimi dhe prodhimi: Vizualizimi, historia, MLOps (disiplina e marrjes së modelit live dhe monitorimi i tij). (Njësia 8, 11)

AI operon me një autoritet të ndryshëm në secilën nga këto gjashtë faza. Tabela e mëposhtme përmbledh këtë shpërndarje të autoritetit; Kjo është tabela e vetme më e rëndësishme e modulit.

Skena

Roli i AI

Niveli i rrezikut

Kush e miraton

Përcaktimi i problemit

partner i stuhisë së ideve

të ulëta

Shkencëtar i të dhënave + palë e interesuar

Shkruani një kod pastrimi

Gjenerator i skicave të kodit

e mesme

Shkencëtar i të dhënave (lexon kodin)

Komenti i EDA-s

sugjerues modeli

e mesme

shkencëtar i të dhënave

Gjenerimi i veçorive

Gjenerues i ideve dhe kodeve

mesatar-i lartë

Kontrolli i rrjedhjeve është i domosdoshëm

Zgjedhja/metrika e modelit

konsulent

lartë

shkencëtar i të dhënave

Vendimi për të vënë në prodhim

hyrje ndihmëse

shumë e lartë

Ekipi + pronar biznesi

Miratimi i etikës/privatësisë

stimulues

shumë e lartë

njerëzore, gjithmonë

Mbani në mend fjalinë e vetme nga kjo tabelë: ndërsa aksionet rriten, roli i AI zvogëlohet dhe miratimi njerëzor rritet.

Pse verifikimi është zemra e këtij biznesi

Modelet e gjuhës së AI duken të sigurta, por mund të mos jenë të sigurta. Në gjuhën teknike, kjo quhet halucinacion: është fabrikimi i modelit të informacionit joekzistent në një fjali të rrjedhshme sikur të ishte e vërtetë. Në shkencën e të dhënave, kjo vjen në tre forma. I pari është një numër fals: nëse pyet modelin "sa është shuma mesatare e porosisë" pa dhënë asnjë të dhënë, ai do t'ju tregojë me siguri një numër, edhe pse nuk i ka parë kurrë të dhënat tuaja. I dyti është një funksion që nuk ekziston: modeli mund të sugjerojë një funksion që nuk ekziston fare, siç është pandas.read_excel_fast(). Së treti, interpretimi i gabuar statistikor: modeli mund të përsërisë pa probleme një gabim statistikor klasik të tillë si "p-vlera është 0.04, kështu që hipoteza është 96% e saktë".

Disiplina e verifikimit përbëhet nga tre hapa:

  1. Lidhja me burimin: Çdo numër, normë dhe tendencë duhet të vijë nga të dhënat tuaja, jo nga kujtesa e AI. Përdorni AI për kodin që funksionon në të dhëna, jo që ajo të kujtojë të dhënat.
  2. Ekzekutoni dhe krahasoni: Drejtoni çdo pjesë të kodit të dhënë nga vetë AI; Krahasoni çdo metrikë që prodhon me një bazë të pavarur.
  3. Filtri i ekspertëve: Provoni vetë nëse rezultati bie ndesh me statistikat dhe njohuritë e fushës.
Kujdes: Vendosja e një analize të shkruar nga AI në një prezantim pa e drejtuar dhe lexuar është si të prezantosh një raport të panënshkruar. Vetëm për shkak se kodi funksionon nuk do të thotë se është i saktë; Një kod që përmbledh kolonën e gabuar gjithashtu funksionon pa gabime.

Riprodhueshmëria: të jesh në gjendje të prodhosh të njëjtin rezultat dy herë

Parimi i heshtur, por kritik i shkencës së të dhënave është riprodhueshmëria: kur kryeni përsëri një analizë gjashtë muaj më vonë ose në një kompjuter tjetër, merrni të njëjtin rezultat. Ky rrezik rritet kur punoni me AI, sepse kur i thoni AI-së të "bëjë këtë grafik" dhe ta luajë me dorë, hapat zhduken. Rregulli: çdo hap duhet të regjistrohet në kodin dhe kontrollin e versionit (si Git); Në hapat që përfshijnë rastësinë, fara e rastësishme (vlera fillestare e gjeneruesit të numrave të rastësishëm; nëse fiksohet, rezultati do të jetë i përsëritshëm) duhet të fiksohet. Këtë temë do ta thellojmë në Kapitullin 10; Tani për tani, merrni këtë zakon: "Mos klikoni me dorë, shkruani me kod".

tre mini kuti

Rasti 1 - Nxitimi i sigurt. Një analist i tregtisë elektronike normalisht do të kalonte gjysmë dite duke pastruar një tabelë porosish prej 240 mijë rreshtash. Ai i dha emrat e kolonave dhe 5 rreshtat e parë (pa të dhëna personale) tek AI dhe kërkoi kodin e pastrimit të pandave. AI prodhoi draft në 8 sekonda; Analisti lexoi kodin rresht pas rreshti, rregulloi një gabim në analizimin e datave dhe e ekzekutoi atë. Kohëzgjatja: 35 minuta në vend të 4 orësh. AI dha kodin, verifikimi mbeti me njeriun.

Rasti 2 - Kurthi metrikë i krijuar. Një praktikant e pyeti AI, "Sa i saktë është pylli i rastësishëm në këto të dhëna?" pa e trajnuar fare modelin. “Rreth 89%,” tha AI. Praktikanti e vuri këtë në prezantim; Kur modeli i vërtetë u trajnua, saktësia ishte 71%. Gabim: Pritja e matjeve pa i dhënë të dhëna dhe modele AI.

Rasti 3 - Rrjedhje e heshtur. Një ekip zbatoi idenë e sugjeruar nga AI për "shtimin e mesatares së ndryshores së synuar si veçori" pa e vënë në dyshim atë. Modeli performoi 98% në grupin e provës, por u rrëzua në prodhim sepse funksioni po rrjedh informacione të ardhshme (rrjedhje e të dhënave, Njësia 10). Gabim: Mos filtrimi statistikor i rekomandimit të AI.

Prompt i dobët / Prompt i fortë

Njoftim i dobët:

Analizoni këto të dhëna nga shitjet dhe më tregoni të ardhurat mesatare.

Ky pretendim është i gabuar: AI nuk i janë dhënë të dhëna, kështu që "të ardhurat mesatare" mund të krijohen vetëm. As kolonat, as periudha, as monedha nuk janë të qarta.

Njoftim i fuqishëm:

Roli juaj: asistent që ndihmon një shkencëtar të të dhënave. Unë kam një panda DataFrame: df. Kolonat:- data_orderi (teksti, në formatin "2024-03-01")- shuma_tl (dhjetore, NaN në disa rreshta)- ID_ja e klientit (numër i plotë) Detyrë: (1) shkruani kodin e pandave që llogarit shumën mesatare, (2) shpjegoni se si i trajton vlerat NaN, (3) listoni kodin që bën supozimet. Mos krijoni përmbajtjen e të dhënave; thjesht gjeneroni kodin dhe unë do të ekzekutoj dhe verifikoj rezultatin.

Në këtë kërkesë duket qartë skema, pritshmëria dhe “ndalimi i sajimit”. Ju ende ekzekutoni dhe verifikoni vetë rezultatin.

Fillimet e etikës dhe privatësisë

Shkenca e të dhënave shpesh punon me të dhënat personale: të dhënat e klientit, pacientit, punonjësit. KVKK (Ligji për Mbrojtjen e të Dhënave Personale) në Turqi dhe GDPR në Evropë i mbrojnë këto të dhëna. Vendosja e emrit tuaj të vërtetë, ID-së, emailit ose adresës në një mjet publik të AI është një shkelje. Rregulli: anonimizoni të dhënat përpara ndarjes, jepni vetëm skemën (emrat e kolonave, llojet) dhe rreshtin e shembullit të rremë nëse është e nevojshme. Temën e etikës do ta thellojmë në kapitullin 11; Le të vendosim nga fillimi parimin: Për të kuptuar të dhënat, shpesh mjafton të ndash strukturën e tyre, jo përmbajtjen e tyre.

Gabimet e zakonshme

  • Në pritje të numrave/metrikave pa i dhënë të dhëna AI. Modeli nuk mund të aksesojë të dhënat; Numri që ai jep është i rremë. Gjithmonë keni rezultatin e llogaritur dhe të drejtuar.
  • Duke menduar se kodi i punës është i saktë. Kodi që manipulon kolonën e gabuar gjithashtu funksionon pa gabime; Mos besoni pa lexuar logjikën.
  • Ngjitja e të dhënave reale personale në mjetin e hapur. Emri, numri i ID-së, posta elektronike nuk ndahen kurrë; Diagrami është i mjaftueshëm.
  • Kryerja e hapave me dorë dhe mos shkrimi i tyre në kod. Analiza që nuk është e riprodhueshme është e pabesueshme.
  • Pranimi i interpretimit të statistikave nga AI pa diskutim. AI mund të përsërisë gabimet klasike në koncepte të tilla si p-vlera dhe korrelacioni.
Këshillë: Përfshini një "vijë rregulli" të shkurtër në secilën nga sesionet tuaja të AI: "Mos krijoni përmbajtjen e të dhënave; thjesht krijoni kodin/analizën dhe unë do të ekzekutoj dhe do të verifikoj rezultatin; tregoni "nuk jam i sigurt" ku nuk jeni i sigurt". Kjo fjali e vetme ul ndjeshëm rrezikun e halucinacioneve.

Në përmbledhje

AI është një asistent i fuqishëm në shkencën e të dhënave: përshpejton kodin e pastrimit, interpretimin EDA, rekomandimin e modelit dhe vizualizimin. Por përcaktimi i problemit, përzgjedhja metrike, vendimi i prodhimit dhe kufijtë etikë u përkasin njerëzve. Rrjedha e punës ka gjashtë faza dhe roli i AI bëhet më i vogël me rritjen e rrezikut. Tre zakone janë themeli i gjithçkaje: lidhja e burimit (vlefshmëria), riprodhueshmëria (kodimi) dhe anonimizimi (konfidencialiteti). Pasi t'i përvetësoni këto tre, çdo mjet në pjesën tjetër të modulit bëhet një përshpejtues i sigurt për ju.

Detyra e aplikimit

Mjafton të bëni një skemë të një tabele të vogël që keni (ose një hipotetike): emrat e kolonave, llojet dhe 2-3 rreshta shembullor të rremë (pa të dhëna reale personale). Kërkoni nga AI një kod përmbledhës të statistikave duke përdorur shabllonin "Powerful Prompt" më sipër. Drejtoni kodin, krahasoni rezultatin me një vlerë manuale, kontrolloni për çdo supozim të rremë dhe shënoni gjetjet tuaja në 5 pika.

listë kontrolli

  • [ ] A i dhashë AI-së një skemë dhe një mostër të rreme në vend të të dhënave reale personale?
  • [ ] A e lexova dhe ekzekutova kodin që ai prodhoi rresht pas rreshti?
  • [ ] A e kam verifikuar në mënyrë të pavarur çdo numër në dalje?
  • [ ] A e kam shkruar çdo hap të analizës në kod dhe e kam bërë atë të përsëritshëm?
  • [ ] A e kam përcaktuar nivelin e rrezikut të misionit dhe a ia kam caktuar vendimin përfundimtar një njeriu?