Üksus 1 / 11

Sissejuhatus tehisintellekti andmeteaduses ja -analüütikas: töövoog, rollid, piirid, valideerimine ja eetika

Kasu:

  • Oskus eristada andmeteaduse kuueastmelist töövoogu (probleemide määratlemine, kogumine, puhastamine, avastamine, modelleerimine, kommunikatsioon) ja autoriteeti, mille all tehisintellekt igal etapil töötab, vastavalt ülesande riskitasemele
  • Võimalus rakendada distsipliini, mis kontrollib iga tehisintellekti väljundit, ühendades selle allikaga, käivitades ja võrdledes ning läbides asjatundliku filtreerimise.
  • Võimalus muuta reprodutseeritavuse ja privaatsuse põhimõtted (koodiks kirjutamine, anonüümseks muutmine) analüüsiharjumusteks alates esimesest päevast

Toored, segased ja sageli "valetavad" andmed satuvad andmeteadlase töölauale iga päev. Müügitabelis on kuupäeva veerg kirjutatud kolmes erinevas vormingus; kliendinumbrid on mõnel real tühjad; Veeru nimi on "tulu", kuid see sisaldab nii TL kui ka USD väärtusi. Andmeteaduse ülesanne on teha sellest kaosest usaldusväärne otsus: koguda andmed, puhastada need, uurida, ehitada mudel, kinnitada tulemus ja muuta see looks. Tehisintellekt (AI või lühidalt AI – arvutisüsteemid, mis suudavad luua teksti ja koodi, tuvastada mustreid, teha kokkuvõtteid ja teha prognoose) võivad puudutada selle ahela kõiki lülisid: kirjutada puhastuskoodi minutitega, soovitada graafikuid uurivaks analüüsiks, tõlgendada mudeli mõõdikuid, parandada SQL-päringut. Kuid sama tehisintellekt võib anda teile ka enesekindla väljamõeldise, näiteks "korrelatsiooni 0,72" andmete jaoks, mida ta pole kunagi näinud.

See esimene osa ei ole raamatukogu tutvustus. Selle eesmärk on selgitada, kuhu AI andmeteaduse töövoosse panna ja kuhu seda mitte kunagi panna. Paneme algusest peale aluspõhimõtte paika: AI on assistent, mitte andmeteadlane. Otsuse, milliseid andmeid koguda, millise mõõdiku järgi otsustada, kas mudel tootmisse viia ja kuhu tõmmata eetilised piirid, otsustab pädev ekspert. Kontrollimata tehisintellekti väljund on riskantne, nagu ka allkirjastamata analüüsiaruanne.

Andmeteaduse töövoog: otsast lõpuni kaart

Andmeprojekti mõistmiseks on kasulik jagada see kuueks faasiks. Kogu see moodul järgib seda kaarti.

1. Probleemi definitsioon: mida me mõõdame, miks, millise otsuse toetamiseks? Seda etappi ei delegeerita tehisintellektile; See on inimene, kes määrab töö.

2. Andmete kogumine: allikate tuvastamine, andmete väljavõtmine, proovide võtmine. (Üksus 2)

3. Andmete puhastamine ja eeltöötlus: puuduv väärtus, kõrvalekalle, tüübi teisendus. (Üksus 3)

4. Uurimuslik andmete analüüs (EDA – Exploratory Data Analysis, andmete jaotuse ja seoste "silma järgi" äratundmise etapp): (Unit 4)

5. Funktsioonide projekteerimine ja modelleerimine: muutujate genereerimine, algoritmi valik, koolitus, hindamine. (Üksus 5, 6, 7)

6. Kommunikatsioon ja tootmine: Visualiseerimine, lugu, MLOps (modelli live’i võtmise ja selle jälgimise distsipliin). (Üksus 8, 11)

Tehisintellektil on igas kuues etapis erinev volitus. Allolev tabel võtab selle volituste jaotuse kokku; See on mooduli kõige olulisem tabel.

Lava

AI roll

Riski tase

Kes kiidab heaks

Probleemi määratlus

ajurünnaku partner

madal

Andmeteadlane + huvirühm

Kirjutage puhastuskood

Koodisketši generaator

keskmine

Andmeteadlane (loeb koodi)

EDA kommentaar

mustri soovitaja

keskmine

andmeteadlane

Funktsioonide genereerimine

Idee ja koodi generaator

keskmine-kõrge

Lekkekontroll on kohustuslik

Mudeli valik/mõõdik

konsultant

kõrge

andmeteadlane

Otsus tootmisse panna

abisisend

väga kõrge

Meeskond + ettevõtte omanik

Eetika/privaatsuse heakskiit

stimulant

väga kõrge

inimene, alati

Pidage meeles selle diagrammi ühte lauset: kui panused tõusevad, väheneb tehisintellekti roll ja inimeste heakskiit kasvab.

Miks on kinnitamine selle ettevõtte keskmes?

AI keelemudelid näivad kindlad, kuid ei pruugi olla kindlad. Tehnilises keeles nimetatakse seda hallutsinatsiooniks: see on mudeli poolt olematu teabe väljamõeldis ladusas lauses, nagu see oleks tõsi. Andmeteaduses on see kolmel kujul. Esimene on võltsnumber: kui küsite mudelilt andmeid andmata "mis on keskmine tellimuse summa", ütleb ta teile enesekindlalt numbri, kuigi pole kunagi teie andmeid näinud. Teine on funktsioon, mida pole olemas: mudel võib soovitada funktsiooni, mida pole üldse olemas, näiteks pandas.read_excel_fast(). Kolmandaks, vale statistiline tõlgendus: mudel võib sujuvalt korrata klassikalist statistilist viga, näiteks "p-väärtus on 0,04, seega on hüpotees 96% õige".

Kontrollimise distsipliin koosneb kolmest etapist:

  1. Link allikale: iga number, määr ja trend peaksid pärinema teie andmetest, mitte tehisintellekti mälust. Kasutage tehisintellekti koodi jaoks, mis töötab andmetega, mitte andmete meeldejätmiseks.
  2. Käivitage ja võrrelge: käivitage ise iga AI-i antud koodiosa; Võrrelge iga selle loodud mõõdikut sõltumatu lähtetasemega.
  3. Ekspertfilter: testige ise, kas väljund on vastuolus statistika ja domeeni teadmistega.
Ettevaatust. Tehisintellekti koostatud analüüsi panemine esitlusse ilma käivitamata ja seda lugemata on nagu allkirjastamata aruande esitamine. See, et kood töötab, ei tähenda, et see on õige; Kood, mis summeerib vale veeru, töötab samuti vigadeta.

Reprodutseeritavus: võime anda sama tulemuse kaks korda

Andmeteaduse vaikne, kuid kriitiline põhimõte on reprodutseeritavus: kui käivitate analüüsi kuus kuud hiljem või mõnes teises arvutis, saate sama tulemuse. See risk suureneb tehisintellektiga töötades, sest kui käsite tehisintellektil "tee see graafik" ja esitate seda käsitsi, kaovad sammud. Reegel: iga samm peab olema koodis ja versioonikontrollis registreeritud (nagu Git); Juhuslikkusega seotud etappides peaks olema fikseeritud juhuslik seeme (juhuslike arvude generaatori algväärtus; kui see on fikseeritud, on tulemus korratav). Süvendame seda teemat 10. peatükis; Praegu omandage see harjumus: "Ära klõpsake käsitsi, kirjutage koodi sisse."

kolm minikarpi

Juhtum 1 – ohutu kiirendus. E-kaubanduse analüütik kulutaks tavaliselt pool päeva 240 tuhande rea tellimuste tabeli puhastamisele. Ta andis tehisintellektile veergude nimed ja esimesed 5 rida (ilma isikuandmeteta) ning küsis pandade puhastuskoodi. AI tekitas mustandi 8 sekundiga; Analüütik luges koodi rida rea ​​haaval, parandas kuupäeva parsimisel vea ja käivitas selle. Kestus: 4 tunni asemel 35 minutit. AI andis koodi, kontrollimine jäi inimesele.

Juhtum 2 – valmis meetriline lõks. Praktikant küsis tehisintellektilt: "Kui täpne on juhuslik mets nendel andmetel?" modelli üldse treenimata. "Umbes 89%," ütles AI. Praktikant pani selle esitlusse; Kui päris modelli välja õpetati, oli täpsus 71%. Viga: mõõdikute ootamine ilma AI-le andmeid ja mudeleid esitamata.

Juhtum 3 – vaikne leke. Üks meeskond rakendas tehisintellekti soovitatud ideed "lisada sihtmuutuja keskmine tunnusena" ilma seda kahtluse alla seadmata. Mudel toimis testikomplektis 98%, kuid jooksis tootmises kokku, kuna funktsioon lekitas tulevast teavet (andmete leke, üksus 10). Viga: AI soovitust ei filtreerita statistiliselt.

Nõrk viip / Tugev viip

Nõrk viip:

Analüüsige neid müügiandmeid ja öelge mulle keskmine tulu.

See väide on vigane: tehisintellektile andmeid ei antud, nii et "keskmist sissetulekut" saab ainult arvutada. Ei veerud, periood ega valuuta pole selged.

Võimas viip:

Sinu roll: assistent, kes aitab andmeteadlast. Mul on panda DataFrame: df. Veerud:- order_date (tekst, formaadis "2024-03-01")- summa_tl (kümnend, mõnel real NaN)- kliendi_id (täisarv) Ülesanne: (1) kirjutage pandakood, mis arvutab keskmise summa, (2) selgitage, kuidas see käsitleb NaN väärtusi, (3) loetlege koodi eeldused. Ärge moodustage andmete sisu; lihtsalt genereerige kood ja ma käivitan ja kontrollin tulemust.

Selles taotluses on skeem, ootus ja "fabritseerimiskeeld" selged. Ikka jooksete ja kontrollite väljundit ise.

Eetika ja privaatsuse algus

Andmeteadus töötab sageli isikuandmetega: kliendi-, patsiendi-, töötajakirjetega. Neid andmeid kaitsevad KVKK (isikuandmete kaitse seadus) Türkiye's ja GDPR Euroopas. Oma pärisnime, ID, e-posti või aadressi kleepimine avalikku tehisintellekti tööriista on rikkumine. Reegel: muutke andmed enne jagamist anonüümseks, esitage vajadusel ainult skeem (veerunimed, tüübid) ja näidisrida. Eetika teemat süvendame 11. üksuses; Paneme põhimõtte algusest peale: andmete mõistmiseks piisab sageli nende struktuuri, mitte sisu jagamisest.

Levinud vead

  • Ootan numbreid/mõõdikuid ilma tehisintellektile andmeid edastamata. Mudel ei pääse andmetele juurde; Tema antud number on võlts. Laske alati tulemus arvutada ja käivitada.
  • Arvates, et töökood on õige. Vale veeruga manipuleeriv kood töötab samuti vigadeta; Ärge usaldage loogikat lugemata.
  • Tõeliste isikuandmete kleepimine avatud tööriista. Nime, ID numbrit, e-posti ei jagata kunagi; Diagrammist piisab.
  • Toimingute käsitsi tegemine ja nende koodi mitte kirjutamine. Analüüs, mis ei ole reprodutseeritav, on ebausaldusväärne.
  • AI-poolse statistika tõlgendusega nõustumine kahtlusteta. AI võib korrata klassikalisi vigu sellistes mõistetes nagu p-väärtus ja korrelatsioon.
Näpunäide. Lisage igasse tehisintellekti seansile lühike "reeglirida": "Ära moodusta andmesisu; lihtsalt genereerige kood/analüüs ja ma käivitan ja kontrollin tulemust; märkige "pole kindel", kus te pole kindel." See üksainus lause vähendab oluliselt hallutsinatsioonide riski.

Kokkuvõttes

AI on andmeteaduse võimas assistent: see kiirendab puhastuskoodi, EDA tõlgendamist, mudelite soovitamist ja visualiseerimist. Kuid probleemi määratlemine, mõõdiku valik, tootmisotsus ja eetilised piirid kuuluvad inimestele. Töövoos on kuus etappi ja tehisintellekti roll väheneb riski suurenedes. Kolm harjumust on kõige aluseks: allika linkimine (valideerimine), reprodutseeritavus (kodeerimine) ja anonüümsus (konfidentsiaalsus). Kui olete need kolm kasutusele võtnud, muutub iga ülejäänud mooduli tööriist teie jaoks turvaliseks kiirendiks.

Rakenduse ülesanne

Lihtsalt koostage väikese (või hüpoteetilise) tabeli skeem: veergude nimed, tüübid ja 2–3 näidisrida (ilma tegelike isikuandmeteta). Küsige tehisintellektilt kokkuvõtvat statistikakoodi, kasutades ülalolevat malli „Võimas viip”. Käivitage kood, võrrelge väljundit käsitsi väärtusega, kontrollige võltsoletusi ja märkige oma leiud 5 täppi.

kontrollnimekiri

  • [ ] Kas ma andsin tehisintellektile tegelike isikuandmete asemel lihtsalt skeemi ja võltsproovi?
  • [ ] Kas ma lugesin ja käivitasin selle loodud koodi rida rea ​​haaval?
  • [ ] Kas olen iga numbrit väljundis iseseisvalt kontrollinud?
  • [ ] Kas olen kirjutanud iga analüüsi sammu koodi sisse ja muutnud selle korratavaks?
  • [ ] Kas olen määranud missiooni riskitaseme ja määranud lõpliku otsuse inimesele?