Faida:
- Uwezo wa kutofautisha mtiririko wa kazi wa hatua sita za sayansi ya data (ufafanuzi wa shida, ukusanyaji, kusafisha, ugunduzi, uundaji wa mfano, mawasiliano) na mamlaka ambayo akili ya bandia hufanya kazi katika kila hatua, kulingana na kiwango cha hatari ya kazi.
- Uwezo wa kutumia taaluma ambayo inathibitisha kila pato la akili bandia kwa kuiunganisha na chanzo, kuiendesha na kuilinganisha, na kuipitisha kupitia uchujaji wa kitaalamu.
- Uwezo wa kubadilisha uzalishaji tena na kanuni za faragha (kuandika kuwa msimbo, kutotambulisha) kuwa tabia za uchanganuzi kutoka siku ya kwanza.
Data ghafi, yenye fujo, na mara nyingi "ya uongo" hutua kwenye dawati la mwanasayansi wa data kila siku. Katika jedwali la mauzo, safu ya tarehe imeandikwa katika miundo mitatu tofauti; nambari za mteja ni tupu katika baadhi ya mistari; Jina la safu wima ni "mapato", lakini lina thamani zote za TL na USD. Kazi ya sayansi ya data ni kufanya uamuzi wa kuaminika kutoka kwa machafuko haya: kukusanya data, kuitakasa, kuichunguza, kuunda mfano, kuthibitisha matokeo, na kuibadilisha kuwa hadithi. Akili Bandia (AI, au AI kwa mifumo fupi ya kompyuta inayoweza kutoa maandishi na msimbo, kutambua ruwaza, kufupisha na kufanya ubashiri) inaweza kugusa kila kiungo kwenye mlolongo huu: kuandika msimbo wa kusafisha kwa dakika, kupendekeza grafu kwa uchanganuzi wa uchunguzi, kutafsiri kipimo cha modeli, kusahihisha hoja ya SQL. Lakini AI hiyo hiyo inaweza pia kukupa upotoshaji wa ujasiri kama vile "uunganisho 0.72" kwa data ambayo haijawahi kuona.
Sehemu hii ya kwanza sio utangulizi wa maktaba. Madhumuni yake ni kufafanua mahali pa kuweka AI katika mtiririko wa sayansi ya data na wapi kamwe kuiweka. Hebu tuweke kanuni ya msingi tangu mwanzo: AI ni msaidizi, si mwanasayansi wa data. Uamuzi wa data ya kukusanya, kipimo gani cha kuamua, ikiwa muundo utawekwa katika uzalishaji, na mahali pa kuchora mipaka ya kimaadili unategemea mtaalamu aliye na ujuzi. Utoaji wa AI ambao haujathibitishwa ni hatari, kama ilivyo ripoti ya uchanganuzi ambayo haijatiwa saini.
Mtiririko wa kazi wa sayansi ya data: ramani ya mwisho-hadi-mwisho
Ili kuelewa mradi wa data, ni vyema kuugawanya katika awamu sita. Moduli hii yote inafuata ramani hii.
1. Ufafanuzi wa tatizo: Je, tunapima nini, kwa nini, ili kuunga mkono uamuzi upi? Awamu hii haijakabidhiwa kwa AI; Ni mtu anayefafanua kazi.
2. Ukusanyaji wa data: Kubainisha vyanzo, kutoa data, sampuli. (Kitengo cha 2)
3. Kusafisha na kuchakata data: Thamani haipo, nje, ubadilishaji wa aina. (Kitengo cha 3)
4. Uchambuzi wa data ya uchunguzi (EDA - Uchambuzi wa Data ya Uchunguzi, hatua ya kutambua usambazaji na uhusiano wa data "kwa jicho"): (Kitengo cha 4)
5. Uhandisi wa kipengele na modeli: Kizazi kinachobadilika, uteuzi wa algorithm, mafunzo, tathmini. (Kitengo cha 5, 6, 7)
6. Mawasiliano na uzalishaji: Taswira, hadithi, MLOps (nidhamu ya kuchukua modeli moja kwa moja na kuifuatilia). (Kitengo cha 8, 11)
AI hufanya kazi na mamlaka tofauti katika kila moja ya hatua hizi sita. Jedwali hapa chini linatoa muhtasari wa mgawanyo huu wa mamlaka; Hii ndio jedwali moja muhimu zaidi la moduli.
Jukwaa
Jukumu la AI
Kiwango cha hatari
Nani anaidhinisha
Ufafanuzi wa tatizo
mdau wa bongo
chini
Mwanasayansi wa data + mdau
Andika msimbo wa kusafisha
Jenereta ya mchoro wa kanuni
kati
Mwanasayansi wa data (anasoma msimbo)
Maoni ya EDA
pendekezo la muundo
kati
mwanasayansi wa data
Kizazi cha kipengele
Wazo na jenereta ya msimbo
kati-juu
Udhibiti wa uvujaji ni lazima
Uteuzi wa kielelezo/ kipimo
mshauri
juu
mwanasayansi wa data
Uamuzi wa kuweka katika uzalishaji
pembejeo msaidizi
juu sana
Timu + mmiliki wa biashara
Idhini ya maadili/faragha
kichocheo
juu sana
binadamu, daima
Kumbuka sentensi moja kutoka kwa chati hii: jinsi vigingi vinavyoongezeka, jukumu la AI linapungua na idhini ya mwanadamu inakua.
Kwa nini uthibitishaji ndio kiini cha biashara hii
Miundo ya lugha ya AI inaonekana hakika, lakini huenda haina uhakika. Katika lugha ya kitaalamu, hii inaitwa hallucination: ni uundaji wa modeli wa habari ambazo hazipo katika sentensi fasaha kana kwamba ni kweli. Katika sayansi ya data, hii inakuja katika aina tatu. Ya kwanza ni nambari bandia: ukiuliza mfano "kiasi gani cha wastani cha agizo" bila kutoa data yoyote, itakuambia nambari kwa ujasiri, ingawa haijawahi kuona data yako. Ya pili ni chaguo za kukokotoa ambazo hazipo: modeli inaweza kupendekeza chaguo za kukokotoa ambazo hazipo kabisa, kama vile pandas.read_excel_fast(). Tatu, tafsiri ya takwimu isiyo sahihi: modeli inaweza kurudia kwa urahisi kosa la kawaida la takwimu kama vile "thamani ya p ni 0.04, kwa hivyo dhana ni sahihi 96%.
Nidhamu ya uthibitishaji ina hatua tatu:
- Unganisha kwa chanzo: Kila nambari, kiwango, na mwelekeo unapaswa kutoka kwa data yako, sio kumbukumbu ya AI. Tumia AI kwa msimbo unaofanya kazi kwenye data, si kwa ajili ya kukumbuka data.
- Endesha na ulinganishe: Endesha kila kipande cha msimbo ulichopewa na AI mwenyewe; Linganisha kila kipimo kinachozalisha na msingi huru.
- Kichujio cha kitaalam: Jipime mwenyewe ikiwa matokeo yanakinzana na takwimu na maarifa ya kikoa.
Tahadhari: Kuweka uchanganuzi ulioandikwa na AI katika wasilisho bila kuliendesha na kulisoma ni kama kuwasilisha ripoti ambayo haijasainiwa. Kwa sababu tu msimbo hufanya kazi haimaanishi kuwa ni sahihi; Msimbo unaojumuisha safu wima isiyo sahihi pia hufanya kazi bila hitilafu.
Reproducibility: kuwa na uwezo wa kutoa matokeo sawa mara mbili
Kanuni ya kimya lakini muhimu ya sayansi ya data ni reproducibility: unapofanya uchambuzi tena miezi sita baadaye au kwenye kompyuta tofauti, unapata matokeo sawa. Hatari hii huongezeka wakati wa kufanya kazi na AI, kwa sababu unapoiambia AI "tengeneza grafu hii" na kuicheza kwa mikono, hatua hupotea. Sheria: kila hatua lazima isajiliwe katika msimbo na udhibiti wa toleo (kama Git); Katika hatua zinazohusisha unasihi, mbegu nasibu (thamani ya awali ya jenereta ya nambari nasibu; ikiwa imerekebishwa, matokeo yatarudiwa) inapaswa kusasishwa. Tutaongeza mada hii katika Sura ya 10; Kwa sasa, ingia katika tabia hii: "Usibonye kwa mkono, andika kwa kanuni."
kesi tatu ndogo
Kesi ya 1 - Kuongeza kasi kwa usalama. Mchambuzi wa biashara ya mtandaoni kwa kawaida angetumia nusu siku kusafisha jedwali la kuagiza la safu mlalo elfu 240. Alitoa majina ya safu na safu 5 za kwanza (bila data ya kibinafsi) kwa AI na akauliza nambari ya kusafisha pandas. AI ilitoa rasimu katika sekunde 8; Mchambuzi alisoma msimbo kwa mstari, akarekebisha hitilafu katika uchanganuzi wa tarehe, na akaiendesha. Muda: Dakika 35 badala ya saa 4. AI ilitoa nambari, uthibitishaji ulibaki kwa mwanadamu.
Kesi ya 2 - Mtego wa metriki iliyoundwa. Mfanyikazi wa ndani aliuliza AI, "Je, msitu wa nasibu ni sahihi kiasi gani kwenye data hii?" bila kufundisha mfano kabisa. "Takriban 89%," AI ilisema. Mwanafunzi aliweka hili katika uwasilishaji; Wakati mfano halisi ulipofunzwa, usahihi ulikuwa 71%. Kosa: Kusubiri vipimo bila kutoa data na miundo kwa AI.
Kesi 3 - Uvujaji wa kimya. Timu moja ilitekeleza wazo lililopendekezwa na AI la "ongeza maana ya utofauti unaolengwa kama kipengele" bila kuhoji. Muundo huu ulifanya 98% kwenye seti ya majaribio lakini ikaanguka katika toleo la umma kwa sababu kipengele kilikuwa kikivuja taarifa za siku zijazo (uvujaji wa data, Kitengo cha 10). Kosa: Sio kuchuja kwa takwimu pendekezo la AI.
Mwongozo dhaifu / Mwongozo thabiti
Agizo dhaifu:
Changanua data hii ya mauzo na uniambie wastani wa mapato.
Dai hili ni potofu: AI haikupewa data, kwa hivyo "mapato ya wastani" yanaweza tu kufanywa. Wala nguzo, wala kipindi, wala sarafu ni wazi.
Agizo lenye nguvu:
Jukumu lako: msaidizi anayesaidia mwanasayansi wa data. Nina pandas DataFrame: df. Safu wima:- tarehe_ya_tarehe (maandishi, katika umbizo la "2024-03-01")- kiasi_tl (desimali, NaN katika baadhi ya safu)- kitambulisho cha mteja (jumla)Kazi: (1) andika msimbo wa panda unaokokotoa kiasi cha wastani,(2) eleza jinsi inavyoshughulikia thamani za NaN,(3) orodhesha mawazo ambayo msimbo hufanya. Usitengeneze maudhui ya data; toa nambari tu na nitaendesha na kuthibitisha matokeo.
Katika ombi hili, mpango, matarajio na "marufuku ya uzushi" ni wazi. Bado unaendesha na kuthibitisha pato mwenyewe.
Mwanzo wa maadili na faragha
Sayansi ya data mara nyingi hufanya kazi na data ya kibinafsi: mteja, mgonjwa, rekodi za mfanyakazi. KVKK (Sheria ya Kulinda Data ya Kibinafsi) nchini Türkiye na GDPR barani Ulaya hulinda data hii. Kubandika jina lako halisi, kitambulisho, barua pepe au anwani kwenye zana ya umma ya AI ni ukiukaji. Sheria: ficha utambulisho wa data kabla ya kushiriki, toa tu taratibu (majina ya safu wima, aina) na safu mlalo ya mfano dummy ikihitajika. Tutaongeza mada ya maadili katika Sura ya 11; Hebu tuweke kanuni tangu mwanzo: Ili kuelewa data, kugawana muundo wake, sio maudhui yake, mara nyingi inatosha.
Makosa ya kawaida
- Inasubiri nambari/metriki bila kutoa data kwa AI. Mfano hauwezi kufikia data; Namba anayotoa ni fake. Daima kuwa na matokeo mahesabu na kukimbia.
- Kufikiri kwamba kanuni ya kazi ni sahihi. Nambari inayodhibiti safu isiyo sahihi pia huendesha bila makosa; Usiamini bila kusoma mantiki.
- Kubandika data halisi ya kibinafsi kwenye zana iliyo wazi. Jina, nambari ya kitambulisho, barua-pepe hazishirikiwi kamwe; Mchoro ni wa kutosha.
- Kufanya hatua kwa mikono na sio kuziandika kwenye nambari. Uchambuzi ambao hauwezi kuzaliana hautegemewi.
- Kukubali tafsiri ya AI ya takwimu bila swali. AI inaweza kurudia makosa ya kawaida katika dhana kama vile thamani ya p na uunganisho.
Kidokezo: Jumuisha "mstari wa sheria" mfupi katika kila kipindi chako cha AI: "Usitengeneze maudhui ya data; toa tu msimbo/uchanganuzi na nitaendesha na kuthibitisha matokeo; onyesha 'sina uhakika' mahali ambapo huna uhakika." Sentensi hii moja inapunguza kwa kiasi kikubwa hatari ya maono.
Kwa muhtasari
AI ni msaidizi mwenye nguvu katika sayansi ya data: huharakisha msimbo wa kusafisha, tafsiri ya EDA, pendekezo la mfano na taswira. Lakini ufafanuzi wa tatizo, uteuzi wa kipimo, uamuzi wa uzalishaji na mipaka ya maadili ni ya wanadamu. Mtiririko wa kazi una hatua sita, na jukumu la AI linakuwa ndogo kadiri hatari inavyoongezeka. Tabia tatu ndizo msingi wa kila kitu: kuunganisha chanzo (uthibitishaji), uzalishaji tena (usimbaji), na kutokutambulisha (usiri). Mara tu unapoweka hizi tatu ndani, kila zana katika sehemu nyingine ya moduli inakuwa kichapuzi salama kwako.
Jukumu la maombi
Tengeneza tu schema ya jedwali ndogo ulilonalo (au la dhahania): majina ya safu wima, aina, na safu mlalo 2-3 za mfano (bila data halisi ya kibinafsi). Uliza AI msimbo wa takwimu kwa kutumia kiolezo cha "Kidokezo chenye Nguvu" hapo juu. Tekeleza msimbo, linganisha pato na thamani ya mwongozo, angalia mawazo yoyote ya uwongo, na utambue matokeo yako katika nukta 5 za vitone.
orodha ya ukaguzi
- [ ] Je, niliipa AI schema na sampuli bandia badala ya data halisi ya kibinafsi?
- [ ] Je, nilisoma na kuendesha msimbo uliotoa mstari kwa mstari?
- [ ] Je, nimethibitisha kwa kujitegemea kila nambari kwenye matokeo?
- [ ] Je, nimeandika kila hatua ya uchanganuzi kwenye msimbo na kuifanya irudiwe?
- [ ] Je, nimeamua kiwango cha hatari cha misheni na kumpa mwanadamu uamuzi wa mwisho?