Yksikkö 1 / 11

Tietojen ja analytiikan tekoälyn johdanto: työnkulku, roolit, rajat, validointi ja etiikka

Voitot:

  • Kyky erottaa datatieteen kuusivaiheinen työnkulku (ongelman määrittely, kerääminen, puhdistaminen, löytäminen, mallintaminen, viestintä) ja auktoriteetti, jolla tekoäly toimii kussakin vaiheessa tehtävän riskitason mukaan
  • Kyky soveltaa tieteenalaa, joka varmistaa jokaisen tekoälyn tuotoksen yhdistämällä sen lähteeseen, suorittamalla ja vertaamalla sitä ja läpäisemällä sen asiantuntijasuodatuksen.
  • Kyky muuttaa uusittavuus- ja tietosuojaperiaatteet (koodiksi kirjoittaminen, anonymisointi) analysointitottumuksiksi heti ensimmäisestä päivästä lähtien

Raaka, sotkuinen ja usein "valheellinen" data laskeutuu datatieteilijän työpöydälle joka päivä. Myyntitaulukossa päivämääräsarake kirjoitetaan kolmessa eri muodossa; asiakasnumerot ovat tyhjiä joillakin riveillä; Sarakkeen nimi on "tulo", mutta se sisältää sekä TL- että USD-arvot. Datatieteen tehtävänä on tehdä luotettava päätös tästä kaaoksesta: kerätä dataa, puhdistaa se, tutkia sitä, rakentaa malli, validoida tulos ja muuttaa se tarinaksi. Tekoäly (AI tai lyhyesti AI – tietokonejärjestelmät, jotka voivat luoda tekstiä ja koodia, tunnistaa kuvioita, tehdä yhteenvetoja ja tehdä ennusteita) voi koskettaa tämän ketjun jokaista lenkkiä: puhdistuskoodin kirjoittaminen minuuteissa, kaavioiden suositteleminen tutkivaan analyysiin, mallin mittareiden tulkitseminen, SQL-kyselyn korjaaminen. Mutta sama tekoäly voi myös antaa sinulle luotettavan fiktion, kuten "korrelaation 0,72" datalle, jota se ei ole koskaan nähnyt.

Tämä ensimmäinen osa ei ole kirjaston esittely. Sen tarkoituksena on selventää, mihin tekoäly tulisi sijoittaa datatieteen työnkulkuun ja mihin sitä ei koskaan saa laittaa. Kerrotaanpa perusperiaate alusta alkaen: tekoäly on assistentti, ei datatieteilijä. Päätös siitä, mitä dataa kerätään, mitä mittaria valitaan, otetaanko malli tuotantoon ja mihin vedetään eettiset rajat, kuuluu pätevälle asiantuntijalle. Vahvistamaton tekoälytulos on riskialtista, samoin kuin allekirjoittamaton analyysiraportti.

Datatieteen työnkulku: päästä päähän -kartta

Tietoprojektin ymmärtämiseksi on hyödyllistä jakaa se kuuteen vaiheeseen. Tämä koko moduuli seuraa tätä karttaa.

1. Ongelman määritelmä: Mitä mittaamme, miksi, minkä päätöksen tueksi? Tätä vaihetta ei ole delegoitu tekoälylle; Se on henkilö, joka määrittelee työn.

2. Tiedonkeruu: Lähteiden tunnistaminen, tiedon poimiminen, näytteenotto. (yksikkö 2)

3. Tietojen puhdistus ja esikäsittely: Puuttuva arvo, outlier, tyypin muunnos. (yksikkö 3)

4. Tutkiva data-analyysi (EDA - Exploratory Data Analysis, vaihe, jossa tietojen jakautuminen ja suhteet tunnistetaan "silmällä"): (Osa 4)

5. Ominaisuussuunnittelu ja mallintaminen: Muuttujien generointi, algoritmin valinta, koulutus, arviointi. (Osikko 5, 6, 7)

6. Viestintä ja tuotanto: Visualisointi, tarina, MLOps (mallin ottaminen livenä ja sen seuranta). (Osa 8, 11)

Tekoäly toimii eri viranomaisilla kussakin näistä kuudesta vaiheesta. Alla olevassa taulukossa on yhteenveto tästä valtuuksien jakautumisesta; Tämä on moduulin tärkein yksittäinen taulukko.

Vaihe

AI:n rooli

Riskitaso

Kuka hyväksyy

Ongelman määritelmä

aivoriihi kumppani

alhainen

Datatieteilijä + sidosryhmä

Kirjoita puhdistuskoodi

Koodiluonnoksen generaattori

keskikokoinen

Datatieteilijä (lukee koodia)

EDA:n kommentti

mallin ehdottaja

keskikokoinen

datatieteilijä

Ominaisuuden sukupolvi

Idea- ja koodigeneraattori

keskikorkea

Vuodontorjunta on välttämätöntä

Mallin valinta/mittari

konsultti

korkea

datatieteilijä

Päätös ottaa tuotantoon

aputulo

erittäin korkea

Tiimi + yrittäjä

Etiikka/yksityisyyden hyväksyntä

stimulantti

erittäin korkea

ihminen, aina

Muista yksi lause tästä kaaviosta: kun panokset nousevat, tekoälyn rooli pienenee ja ihmisten hyväksyntä kasvaa.

Miksi vahvistaminen on tämän liiketoiminnan ydin

AI-kielimallit näyttävät varmilta, mutta ne eivät välttämättä ole varmoja. Teknisellä kielellä tätä kutsutaan hallusinaatioksi: se on mallin valmistamaa ei-olemassa olevaa tietoa sujuvassa lauseessa ikään kuin se olisi totta. Datatieteessä tämä on kolmessa muodossa. Ensimmäinen on väärennösnumero: jos kysyt mallilta "mikä on keskimääräinen tilausmäärä" antamatta mitään tietoja, se kertoo sinulle varmasti numeron, vaikka se ei ole koskaan nähnyt tietojasi. Toinen on funktio, jota ei ole olemassa: malli voi ehdottaa funktiota, jota ei ole ollenkaan, kuten pandas.read_excel_fast(). Kolmanneksi virheellinen tilastollinen tulkinta: malli voi sujuvasti toistaa klassisen tilastovirheen, kuten "p-arvo on 0,04, joten hypoteesi on 96% oikea".

Varmistuskuri koostuu kolmesta vaiheesta:

  1. Linkki lähteeseen: Jokaisen luvun, nopeuden ja trendin tulee olla peräisin tiedoistasi, ei tekoälyn muistista. Käytä tekoälyä koodiin, joka toimii datalla, ei siihen, että se muistaa dataa.
  2. Suorita ja vertaa: Suorita jokainen tekoälyn antama koodi itse; Vertaa jokaista sen tuottamaa mittaria itsenäiseen lähtötasoon.
  3. Asiantuntijasuodatin: Testaa itse, onko tulos ristiriidassa tilastojen ja toimialuetietojen kanssa.
Varoitus: Tekoälyn kirjoittaman analyysin laittaminen esitykseen suorittamatta ja lukematta on kuin allekirjoittamattoman raportin esittäminen. Vain siksi, että koodi toimii, ei tarkoita, että se on oikea; Koodi, joka summaa väärän sarakkeen, toimii myös ilman virheitä.

Toistettavuus: pystymme tuottamaan saman tuloksen kahdesti

Datatieteen hiljainen mutta kriittinen periaate on toistettavuus: kun teet analyysin uudelleen kuuden kuukauden kuluttua tai toisella tietokoneella, saat saman tuloksen. Tämä riski kasvaa, kun työskentelet tekoälyn kanssa, koska kun käsket tekoälyä "tekemään tämä kaavio" ja toistamaan sen manuaalisesti, vaiheet katoavat. Sääntö: jokainen vaihe on rekisteröitävä koodiin ja versionhallintaan (kuten Git); Satunnaisuutta koskevissa vaiheissa satunnaissiemen (satunnaislukugeneraattorin alkuarvo; jos se on kiinteä, tulos on toistettavissa) tulee olla kiinteä. Syvennämme tätä aihetta luvussa 10; Ota toistaiseksi tämä tapa: "Älä napsauta käsin, kirjoita koodi."

kolme minilaukkua

Tapaus 1 – Turvallinen kiihdytys. Verkkokaupan analyytikko kuluttaisi normaalisti puoli päivää 240 tuhannen rivin tilaustaulukon selvittämiseen. Hän antoi sarakkeiden nimet ja ensimmäiset 5 riviä (ilman henkilötietoja) tekoälylle ja pyysi pandan puhdistuskoodia. AI tuotti luonnoksen 8 sekunnissa; Analyytikko luki koodin rivi riviltä, ​​korjasi virheen päivämäärän jäsentämisessä ja suoritti sen. Kesto: 35 minuuttia 4 tunnin sijaan. Tekoäly toimitti koodin, varmistus jäi ihmiselle.

Tapaus 2 – Valmistettu metriloukku. Harjoittelija kysyi tekoälyltä: "Kuinka tarkkaa satunnainen metsä on näissä tiedoissa?" ilman mallin koulutusta. "Noin 89%", AI sanoi. Harjoittelija laittoi tämän esitykseen; Kun oikea malli koulutettiin, tarkkuus oli 71 %. Virhe: Odotetaan mittareita antamatta tietoja ja malleja tekoälylle.

Tapaus 3 – Äänetön vuoto. Yksi tiimi toteutti tekoälyn ehdottaman idean "lisää kohdemuuttujan keskiarvo ominaisuudeksi" kyseenalaistamatta sitä. Malli suoritti 98 % testisarjasta, mutta kaatui tuotannossa, koska ominaisuus vuoti tulevaisuuden tietoja (tietovuoto, yksikkö 10). Virhe: AI-suositusta ei suodateta tilastollisesti.

Heikko kehote / Vahva kehote

Heikko kehote:

Analysoi nämä myyntitiedot ja kerro minulle keskimääräinen tulo.

Tämä väite on virheellinen: tekoälylle ei annettu tietoja, joten "keskimääräiset tulot" voidaan vain laskea. Sarakkeet, jakso tai valuutta eivät ole selkeitä.

Tehokas kehotus:

Sinun roolisi: datatieteilijän avustaja. Minulla on pandas DataFrame: df. Sarakkeet:- order_date (teksti, muodossa "2024-03-01")- summa_tl (desimaali, NaN joissakin riveissä)- customer_id (kokonaisluku) Tehtävä: (1) kirjoita pandas-koodi, joka laskee keskimääräisen summan,(2) kerro kuinka se käsittelee NaN-arvoja,(3) luettele koodin oletukset. Älä muodosta datasisältöä; luo vain koodi ja suoritan ja tarkistan tuloksen.

Tässä pyynnössä järjestelmä, odotukset ja "valmistuskielto" ovat selvät. Suoritat edelleen ja tarkistat tulosteen itse.

Etiikka ja yksityisyyden alku

Tietotiede työskentelee usein henkilötietojen kanssa: asiakas-, potilas-, työntekijätietueet. Türkiyen KVKK (Personal Data Protection Law) ja GDPR Euroopassa suojaavat näitä tietoja. Oikean nimesi, henkilötunnuksesi, sähköpostiosoitteesi tai osoitteesi liittäminen julkiseen tekoälytyökaluun on rikkomus. Sääntö: anonymisoi tiedot ennen jakamista, anna vain skeema (sarakkeiden nimet, tyypit) ja tyhjä esimerkkirivi tarvittaessa. Syvennämme etiikan aihetta luvussa 11; Laitetaan periaate alusta alkaen: Datan ymmärtämiseen riittää usein sen rakenteen, ei sisällön jakaminen.

Yleisiä virheitä

  • Odotetaan lukuja/mittareita antamatta tietoja tekoälylle. Malli ei pääse käsiksi tietoihin; Hänen antamansa numero on väärennös. Laske aina tulos ja suorita se.
  • Ajattelee, että toimintakoodi on oikea. Väärää saraketta käsittelevä koodi toimii myös ilman virheitä; Älä luota lukematta logiikkaa.
  • Oikeiden henkilötietojen liittäminen avoimeen työkaluun. Nimeä, henkilötunnusta, sähköpostiosoitetta ei koskaan jaeta; Kaavio riittää.
  • Tee vaiheet manuaalisesti ja älä kirjoita niitä koodiin. Analyysi, jota ei voida toistaa, on epäluotettava.
  • Hyväksymme tekoälyn tulkinnan tilastoista epäilemättä. Tekoäly voi toistaa klassisia virheitä käsitteissä, kuten p-arvo ja korrelaatio.
Vinkki: Sisällytä jokaiseen tekoälyistuntoon lyhyt "sääntörivi": "Älä keksi datasisältöä; luo vain koodi/analyysi, niin minä suoritan ja tarkistan tuloksen; ilmoita "en ole varma", jos olet epävarma." Tämä yksittäinen lause vähentää merkittävästi hallusinaatioiden riskiä.

Yhteenvetona

AI on tehokas apulainen datatieteessä: se nopeuttaa puhdistuskoodia, EDA-tulkintaa, mallisuositusta ja visualisointia. Mutta ongelman määrittely, metrien valinta, tuotantopäätös ja eettiset rajat kuuluvat ihmisille. Työnkulussa on kuusi vaihetta, ja tekoälyn rooli pienenee riskin kasvaessa. Kolme tapaa ovat kaiken perusta: lähdelinkitys (validointi), toistettavuus (koodaus) ja anonymisointi (luottamuksellisuus). Kun sisällytät nämä kolme, jokaisesta moduulin muun työkalusta tulee turvallinen kiihdytin sinulle.

Sovellustehtävä

Tee vain kaavio pienestä sinulla olevasta taulukosta (tai hypoteettisesta): sarakkeiden nimet, tyypit ja 2-3 valeesimerkkiriviä (ilman oikeita henkilötietoja). Pyydä tekoälyltä yhteenvetotilastokoodi käyttämällä yllä olevaa "Tehokas kehote" -mallia. Suorita koodi, vertaa tulosta manuaaliseen arvoon, tarkista, onko virheellisiä oletuksia, ja merkitse havainnot viiteen luettelokohtaan.

tarkistuslista

  • [ ] Annoinko tekoälylle vain skeeman ja väärennetyn näytteen oikeiden henkilötietojen sijaan?
  • [ ] Luinko ja suoritinko sen tuottaman koodin rivi riviltä?
  • [ ] Olenko tarkistanut jokaisen tulosteen numeron itsenäisesti?
  • [ ] Olenko kirjoittanut analyysin jokaisen vaiheen koodiin ja tehnyt siitä toistettavan?
  • [ ] Olenko määrittänyt tehtävän riskitason ja antanut lopullisen päätöksen ihmiselle?