Mga nadagdag:
- Kakayahang makilala ang anim na yugto ng daloy ng trabaho ng agham ng data (kahulugan ng problema, koleksyon, paglilinis, pagtuklas, pagmomodelo, komunikasyon) at ang awtoridad kung saan gumagana ang artificial intelligence sa bawat yugto, ayon sa antas ng panganib sa gawain
- Kakayahang maglapat ng disiplina na nagpapatunay sa bawat output ng artificial intelligence sa pamamagitan ng pagkonekta nito sa pinagmulan, pagpapatakbo at paghahambing nito, at pagpasa nito sa pamamagitan ng pag-filter ng eksperto.
- Kakayahang gawing mga gawi sa pagsusuri ang mga prinsipyo ng reproducibility at privacy (pagsusulat sa code, anonymization) mula sa unang araw
Ang hilaw, magulo, at madalas na "sinungaling" na data ay dumarating sa desk ng data scientist araw-araw. Sa talahanayan ng mga benta, ang column ng petsa ay nakasulat sa tatlong magkakaibang format; blangko ang mga numero ng customer sa ilang linya; Ang pangalan ng isang column ay "kita", ngunit naglalaman ito ng parehong mga halaga ng TL at USD. Ang trabaho ng data science ay gumawa ng mapagkakatiwalaang desisyon mula sa kaguluhang ito: kolektahin ang data, linisin ito, galugarin ito, bumuo ng isang modelo, patunayan ang resulta, at gawin itong isang kuwento. Ang artificial intelligence (AI, o AI para sa maikling—mga computer system na maaaring makabuo ng text at code, kumikilala ng mga pattern, magbubuod, at gumawa ng mga hula) ay maaaring hawakan ang bawat link sa chain na ito: pagsusulat ng cleanup code sa ilang minuto, pagrerekomenda ng mga graph para sa pagsusuri ng eksplorasyon, pagbibigay-kahulugan sa sukatan ng modelo, pagwawasto ng isang query sa SQL. Ngunit ang parehong AI ay maaari ding magbigay sa iyo ng kumpiyansa na katha tulad ng "correlation 0.72" para sa data na hindi pa nito nakita.
Ang unang yunit na ito ay hindi isang panimula sa aklatan. Ang layunin nito ay linawin kung saan ilalagay ang AI sa data science workflow at kung saan hindi ito ilalagay. Ilatag natin ang pangunahing prinsipyo mula sa simula: AI ay isang katulong, hindi isang data scientist. Ang desisyon ng kung anong data ang kolektahin, kung anong sukatan ang pagpapasya, kung maglalagay ng modelo sa produksyon, at kung saan bubuo ng mga etikal na hangganan ay nakasalalay sa karampatang eksperto. Ang isang hindi na-verify na output ng AI ay mapanganib, gayundin ang isang hindi napirmahang ulat ng pagsusuri.
Daloy ng trabaho sa data science: end-to-end na mapa
Upang maunawaan ang isang proyekto ng data, makatutulong na hatiin ito sa anim na yugto. Ang buong modyul na ito ay sumusunod sa mapang ito.
1. Depinisyon ng problema: Ano ang sinusukat natin, bakit, para suportahan ang aling desisyon? Ang bahaging ito ay hindi itinalaga sa AI; Ito ay ang tao na tumutukoy sa trabaho.
2. Pangongolekta ng data: Pagtukoy sa mga mapagkukunan, pagkuha ng data, pag-sample. (Yunit 2)
3. Paglilinis at paunang pagproseso ng data: Nawawalang halaga, outlier, uri ng conversion. (Yunit 3)
4. Exploratory data analysis (EDA - Exploratory Data Analysis, ang yugto ng pagkilala sa distribusyon at mga relasyon ng data "sa pamamagitan ng mata"): (Unit 4)
5. Tampok na engineering at pagmomodelo: Variable generation, pagpili ng algorithm, pagsasanay, pagsusuri. (Yunit 5, 6, 7)
6. Komunikasyon at produksyon: Visualization, kwento, MLOps (disiplina ng pagkuha ng modelo nang live at pagsubaybay nito). (Unit 8, 11)
Gumagana ang AI na may ibang awtoridad sa bawat isa sa anim na yugtong ito. Ang talahanayan sa ibaba ay nagbubuod sa pamamahagi ng awtoridad na ito; Ito ang nag-iisang pinakamahalagang talahanayan ng modyul.
entablado
Papel ng AI
Antas ng panganib
Sino ang pumayag
Depinisyon ng problema
kasosyo sa brainstorming
mababa
Data scientist + stakeholder
Sumulat ng cleanup code
Generator ng code sketch
daluyan
Data scientist (nagbabasa ng code)
komento ng EDA
tagapagpahiwatig ng pattern
daluyan
data scientist
Pagbuo ng tampok
Generator ng ideya at code
katamtaman-mataas
Ang kontrol sa pagtagas ay kinakailangan
Pagpili/sukatan ng modelo
consultant
mataas
data scientist
Desisyon na ilagay sa produksyon
pantulong na input
napakataas
Team + may-ari ng negosyo
Pag-apruba sa etika/privacy
pampasigla
napakataas
tao, palagi
Tandaan ang isang pangungusap mula sa chart na ito: habang tumataas ang mga stake, lumiliit ang tungkulin ng AI at lumalaki ang pag-apruba ng tao.
Bakit ang pag-verify ang puso ng negosyong ito
Ang mga modelo ng wika ng AI ay mukhang sigurado, ngunit maaaring hindi sila sigurado. Sa teknikal na wika, ito ay tinatawag na guni-guni: ito ay katha ng modelo ng hindi umiiral na impormasyon sa isang matatas na pangungusap na parang ito ay totoo. Sa data science, ito ay dumating sa tatlong anyo. Ang una ay isang pekeng numero: kung tatanungin mo ang modelo ng "ano ang average na halaga ng order" nang hindi nagbibigay ng anumang data, kumpiyansa itong magsasabi sa iyo ng isang numero, kahit na hindi pa nito nakita ang iyong data. Ang pangalawa ay isang function na hindi umiiral: ang modelo ay maaaring magmungkahi ng isang function na wala sa lahat, tulad ng pandas.read_excel_fast(). Pangatlo, maling interpretasyong istatistika: ang modelo ay maaaring maayos na ulitin ang isang klasikong error sa istatistika tulad ng "p-value ay 0.04, kaya ang hypothesis ay 96% tama".
Ang disiplina sa pagpapatunay ay binubuo ng tatlong hakbang:
- Link sa pinagmulan: Ang bawat numero, rate, at trend ay dapat magmula sa iyong data, hindi sa memorya ng AI. Gamitin ang AI para sa code na gumagana sa data, hindi para maalala nito ang data.
- Patakbuhin at ihambing: Patakbuhin ang bawat piraso ng code na ibinigay ng AI mismo; Ihambing ang bawat sukatan na ginagawa nito sa isang independiyenteng baseline.
- Expert filter: Subukan para sa iyong sarili kung ang output ay sumasalungat sa mga istatistika at kaalaman sa domain.
Pag-iingat: Ang paglalagay ng pagsusuri na isinulat ng AI sa isang presentasyon nang hindi tumatakbo at binabasa ito ay tulad ng paglalahad ng isang hindi napirmahang ulat. Dahil lamang sa gumagana ang code ay hindi nangangahulugan na ito ay tama; Gumagana rin ang isang code na nagsusuma sa maling column nang walang mga error.
Reproducibility: kakayahang makagawa ng parehong resulta nang dalawang beses
Ang tahimik ngunit kritikal na prinsipyo ng data science ay reproducibility: kapag nagpatakbo ka muli ng pagsusuri pagkalipas ng anim na buwan o sa ibang computer, makakakuha ka ng parehong resulta. Ang panganib na ito ay tumataas kapag nagtatrabaho sa AI, dahil kapag sinabi mo sa AI na "gawin ang graph na ito" at manu-manong i-play ito, mawawala ang mga hakbang. Panuntunan: ang bawat hakbang ay dapat na nakarehistro sa code at kontrol ng bersyon (tulad ng Git); Sa mga hakbang na kinasasangkutan ng randomness, ang random na binhi (ang paunang halaga ng random number generator; kung maayos, ang resulta ay mauulit) ay dapat na maayos. Palalalimin natin ang paksang ito sa Yunit 10; Sa ngayon, gawin ang ugali na ito: "Huwag mag-click sa pamamagitan ng kamay, magsulat sa code."
tatlong mini case
Case 1 — Ligtas na acceleration. Karaniwang gumugugol ng kalahating araw ang isang analyst ng e-commerce sa pag-clear ng order table ng 240 thousand row. Ibinigay niya ang mga pangalan ng column at ang unang 5 row (nang walang personal na data) sa AI at humingi ng pandas cleaning code. Gumawa ng draft ang AI sa loob ng 8 segundo; Binasa ng analyst ang linya ng code sa bawat linya, nag-ayos ng error sa pag-parse ng petsa, at pinatakbo ito. Tagal: 35 minuto sa halip na 4 na oras. Nagbigay ang AI ng code, nanatili ang pag-verify sa tao.
Case 2 — Ang ginawang metric trap. Tinanong ng isang intern ang AI, "Gaano katumpak ang random na kagubatan sa data na ito?" nang walang pagsasanay sa modelo sa lahat. "Mga 89%," sabi ni AI. Inilagay ito ng intern sa pagtatanghal; Kapag ang tunay na modelo ay sinanay, ang katumpakan ay 71%. Pagkakamali: Naghihintay ng mga sukatan nang hindi nagbibigay ng data at mga modelo sa AI.
Kaso 3 — Tahimik na pagtagas. Ipinatupad ng isang koponan ang ideyang iminungkahi ng AI na "idagdag ang ibig sabihin ng target na variable bilang isang tampok" nang hindi ito tinatanong. Nagsagawa ang modelo ng 98% sa set ng pagsubok ngunit nag-crash sa produksyon dahil ang feature ay naglalabas ng impormasyon sa hinaharap (data leak, Unit 10). Pagkakamali: Hindi na-filter sa istatistika ang rekomendasyon ng AI.
Mahinang prompt / Malakas na prompt
Mahinang prompt:
Suriin ang data ng benta na ito at sabihin sa akin ang average na kita.
Ang claim na ito ay may depekto: ang AI ay hindi binigyan ng data, kaya ang "average na kita" ay maaari lamang gawin. Hindi malinaw ang mga column, o ang panahon, o ang pera.
Napakahusay na prompt:
Ang iyong tungkulin: katulong na tumutulong sa isang data scientist. Mayroon akong isang pandas DataFrame: df. Mga Column:- order_date (text, sa format na "2024-03-01")- amount_tl (decimal, NaN sa ilang row)- customer_id (integer)Task: (1) sumulat ng pandas code na kinakalkula ang average na halaga,(2) ipaliwanag kung paano nito pinangangasiwaan ang mga halaga ng NaN,(3) ilista ang mga pagpapalagay na ginagawa ng code. Huwag gumawa ng nilalaman ng data; bumuo lamang ng code at ako ay tatakbo at i-verify ang resulta.
Sa kahilingang ito, malinaw ang pamamaraan, ang inaasahan at ang "pagbabawal sa katha." Ikaw pa rin ang tumakbo at i-verify ang output sa iyong sarili.
Ang simula ng etika at privacy
Ang data science ay madalas na gumagana sa personal na data: customer, pasyente, mga tala ng empleyado. Pinoprotektahan ng KVKK (Personal Data Protection Law) sa Türkiye at GDPR sa Europe ang data na ito. Ang pag-paste ng iyong tunay na pangalan, ID, email o address sa isang pampublikong AI tool ay isang paglabag. Panuntunan: i-anonymize ang data bago ibahagi, magbigay lamang ng schema (mga pangalan ng column, mga uri) at dummy na halimbawang row kung kinakailangan. Palalalimin natin ang paksa ng etika sa Yunit 11; Ilagay natin ang prinsipyo mula sa simula: Upang maunawaan ang data, ang pagbabahagi ng istraktura nito, hindi ang nilalaman nito, ay kadalasang sapat.
Mga karaniwang pagkakamali
- Naghihintay ng mga numero/sukatan nang hindi nagbibigay ng data sa AI. Hindi ma-access ng modelo ang data; Fake ang number na binibigay niya. Palaging kalkulahin at patakbuhin ang resulta.
- Iniisip na tama ang gumaganang code. Ang code na nagmamanipula sa maling column ay tumatakbo rin nang walang mga error; Huwag magtiwala nang hindi binabasa ang lohika.
- Pag-paste ng totoong personal na data sa bukas na tool. Hindi kailanman ibinabahagi ang pangalan, numero ng ID, e-mail; Ang diagram ay sapat na.
- Manu-manong ginagawa ang mga hakbang at hindi isinusulat ang mga ito sa code. Ang pagsusuri na hindi maaaring kopyahin ay hindi mapagkakatiwalaan.
- Pagtanggap sa interpretasyon ng AI ng mga istatistika nang walang tanong. Maaaring ulitin ng AI ang mga klasikong pagkakamali sa mga konsepto tulad ng p-value at ugnayan.
Tip: Magsama ng maikling "linya ng panuntunan" sa bawat isa sa iyong mga sesyon ng AI: "Huwag gumawa ng nilalaman ng data; bumuo lang ng code/analysis at tatakbo ako at i-verify ang resulta; ipahiwatig ang 'hindi sigurado' kung saan ka hindi sigurado." Ang solong pangungusap na ito ay makabuluhang binabawasan ang panganib ng mga guni-guni.
Sa buod
Ang AI ay isang makapangyarihang katulong sa data science: pinapabilis nito ang paglilinis ng code, interpretasyon ng EDA, rekomendasyon ng modelo at visualization. Ngunit ang kahulugan ng problema, pagpili ng sukatan, desisyon sa produksyon at mga hangganan ng etika ay nabibilang sa mga tao. Ang daloy ng trabaho ay may anim na yugto, at ang papel ng AI ay nagiging mas maliit habang tumataas ang panganib. Tatlong gawi ang pundasyon ng lahat: source linking (validation), reproducibility (coding), at anonymization (confidentiality). Kapag na-internalize mo ang tatlong ito, ang bawat tool sa natitirang bahagi ng module ay magiging isang ligtas na accelerator para sa iyo.
Gawain ng aplikasyon
Gumawa lang ng schema ng maliit na table na mayroon ka (o hypothetical): mga pangalan ng column, uri, at 2-3 dummy na halimbawang row (nang walang totoong personal na data). Humingi sa AI ng isang summary stats code gamit ang "Powerful prompt" na template sa itaas. Patakbuhin ang code, ihambing ang output sa isang manu-manong halaga, suriin para sa anumang mga huwad na pagpapalagay, at tandaan ang iyong mga natuklasan sa 5 bullet point.
checklist
- [ ] Binigyan ko lang ba ang AI ng schema at pekeng sample sa halip na totoong personal na data?
- [ ] Nabasa ko ba at pinatakbo ang code na ginawa nito sa bawat linya?
- [ ] Independyente ko bang na-verify ang bawat numero sa output?
- [ ] Isinulat ko ba ang bawat hakbang ng pagsusuri sa code at ginawa itong nauulit?
- [ ] Natukoy ko ba ang antas ng panganib ng misyon at itinalaga ang huling desisyon sa isang tao?