Vienība 1 / 11

Ievads mākslīgajā intelektā datu zinātnē un analīzē: darbplūsma, lomas, robežas, validācija un ētika

Ieguvumi:

  • Spēja atšķirt sešu posmu datu zinātnes darbplūsmu (problēmu definēšana, vākšana, tīrīšana, atklāšana, modelēšana, komunikācija) un autoritāti, saskaņā ar kuru mākslīgais intelekts darbojas katrā posmā, atbilstoši uzdevuma riska līmenim
  • Spēja pielietot disciplīnu, kas pārbauda katru mākslīgā intelekta izvadi, savienojot to ar avotu, palaižot un salīdzinot to un izlaižot to caur ekspertu filtrēšanu.
  • Spēja reproducējamības un privātuma principus (rakstīšana kodā, anonimizācija) pārvērst analīzes paradumos jau no pirmās dienas

Neapstrādāti, nekārtīgi un bieži vien “melīgi” dati katru dienu nokļūst uz datu zinātnieka galda. Pārdošanas tabulā datuma kolonna ir ierakstīta trīs dažādos formātos; klientu numuri dažās rindās ir tukši; Kolonnas nosaukums ir "ienākumi", bet tajā ir gan TL, gan USD vērtības. Datu zinātnes uzdevums ir pieņemt uzticamu lēmumu no šī haosa: apkopot datus, notīrīt tos, izpētīt tos, izveidot modeli, apstiprināt rezultātu un pārvērst to stāstā. Mākslīgais intelekts (AI jeb saīsināti AI — datorsistēmas, kas var ģenerēt tekstu un kodu, atpazīt modeļus, apkopot un veikt prognozes) var pieskarties katrai saitei šajā ķēdē: rakstīt tīrīšanas kodu minūtēs, ieteikt grafikus izpētes analīzei, interpretēt modeļa metriku, labot SQL vaicājumu. Taču tas pats AI var arī sniegt jums pārliecinošu izdomājumu, piemēram, "korelāciju 0,72" datiem, ko tas nekad nav redzējis.

Šī pirmā vienība nav bibliotēkas ievads. Tās mērķis ir precizēt, kur datu zinātnes darbplūsmā ievietot AI un kur to nekad nelikt. No sākuma izklāstīsim pamatprincipu: AI ir palīgs, nevis datu zinātnieks. Kompetentais eksperts izlemj, kādus datus vākt, kādu metriku izvēlēties, vai modeli ieviest ražošanā un kur novilkt ētiskās robežas. Nepārbaudīta AI izvade ir riskanta, tāpat kā neparakstīts analīzes ziņojums.

Datu zinātnes darbplūsma: pilnīga karte

Lai izprastu datu projektu, ir lietderīgi to sadalīt sešās fāzēs. Viss modulis seko šai kartei.

1. Problēmas definīcija: ko mēs mērām, kāpēc, lai atbalstītu kādu lēmumu? Šis posms nav deleģēts AI; Tā ir persona, kas nosaka darbu.

2. Datu vākšana: avotu identificēšana, datu iegūšana, paraugu ņemšana. (2. vienība)

3. Datu tīrīšana un pirmapstrāde: trūkst vērtības, izņēmuma, tipa konvertēšana. (3. vienība)

4. Izpētes datu analīze (EDA — Exploratory Data Analysis, datu sadalījuma un attiecību atpazīšanas posms "ar aci"): (4. nodaļa)

5. Iezīmju projektēšana un modelēšana: mainīgo ģenerēšana, algoritmu izvēle, apmācība, novērtēšana. (5., 6., 7. vienība)

6. Komunikācija un producēšana: Vizualizācija, stāsts, MLOps (modeles uzņemšanas un novērošanas disciplīna). (8., 11. vienība)

AI darbojas ar atšķirīgu autoritāti katrā no šiem sešiem posmiem. Tālāk esošajā tabulā ir apkopots šis pilnvaru sadalījums; Šī ir vienīgā vissvarīgākā moduļa tabula.

Skatuves

AI loma

Riska līmenis

Kas apstiprina

Problēmas definīcija

prāta vētras partneris

zems

Datu zinātnieks + ieinteresētā persona

Uzrakstiet tīrīšanas kodu

Kodu skiču ģenerators

vidējs

Datu zinātnieks (nolasa kodu)

EDA komentārs

modeļa ieteicējs

vidējs

datu zinātnieks

Funkciju ģenerēšana

Ideju un kodu ģenerators

vidēji augsts

Noplūdes kontrole ir obligāta

Modeļa izvēle/metrika

konsultants

augsts

datu zinātnieks

Lēmums par nodošanu ražošanā

palīgieeja

ļoti augsts

Komanda + uzņēmuma īpašnieks

Ētikas/privātuma apstiprināšana

stimulants

ļoti augsts

cilvēks, vienmēr

Paturiet prātā vienu teikumu no šīs diagrammas: pieaugot likmei, mākslīgā intelekta loma samazinās un cilvēku piekrišana pieaug.

Kāpēc verifikācija ir šī biznesa pamatā?

AI valodas modeļi izskatās droši, taču tie var nebūt pārliecināti. Tehniskajā valodā to sauc par halucinācijām: tā ir modeļa neesošas informācijas safabricēšana raitā teikumā, it kā tā būtu patiesība. Datu zinātnē tas izpaužas trīs veidos. Pirmais ir viltots numurs: ja modelim jautāsiet "kāda ir vidējā pasūtījuma summa", nesniedzot nekādus datus, tas jums droši pateiks numuru, lai gan nekad nav redzējis jūsu datus. Otrā ir funkcija, kas neeksistē: modelis var ieteikt funkciju, kas vispār neeksistē, piemēram, pandas.read_excel_fast(). Treškārt, nepareiza statistiskā interpretācija: modelis var vienmērīgi atkārtot klasisku statistikas kļūdu, piemēram, "p vērtība ir 0,04, tāpēc hipotēze ir 96% pareiza".

Pārbaudes disciplīna sastāv no trim posmiem:

  1. Saite uz avotu: katram skaitlim, rādītājam un tendencei ir jānāk no jūsu datiem, nevis AI atmiņas. Izmantojiet AI kodam, kas darbojas ar datiem, nevis lai tas atcerētos datus.
  2. Palaist un salīdziniet: pats palaidiet katru mākslīgā intelekta piešķirto koda daļu; Salīdziniet katru tā izveidoto metriku ar neatkarīgu bāzes līniju.
  3. Ekspertu filtrs: pārbaudiet pats, vai izvade nav pretrunā statistikai un domēna zināšanām.
Uzmanību: AI uzrakstītas analīzes ievietošana prezentācijā bez palaišanas un lasīšanas ir kā neparakstīta pārskata prezentēšana. Tas, ka kods darbojas, nenozīmē, ka tas ir pareizs; Arī kods, kas summē nepareizo kolonnu, darbojas bez kļūdām.

Reproducējamība: spēja iegūt vienu un to pašu rezultātu divas reizes

Datu zinātnes klusais, bet kritiskais princips ir reproducējamība: veicot analīzi vēlreiz pēc sešiem mēnešiem vai citā datorā, tiek iegūts tāds pats rezultāts. Šis risks palielinās, strādājot ar AI, jo, pasakot AI “izveidot šo grafiku” un atskaņot to manuāli, soļi pazūd. Noteikums: katrs solis ir jāreģistrē kodā un versiju kontrolē (piemēram, Git); Posmos, kas saistīti ar nejaušību, ir jānosaka nejaušības sākums (gadījuma skaitļu ģeneratora sākotnējā vērtība; ja tas ir fiksēts, rezultāts būs atkārtojams). Šo tēmu padziļināsim 10. nodaļā; Pagaidām izveidojiet šo ieradumu: "Neklikšķiniet ar roku, ierakstiet kodu."

trīs mini futrāļi

1. gadījums — drošs paātrinājums. E-komercijas analītiķis parasti pavada pusi dienas, lai notīrītu pasūtījumu tabulu ar 240 tūkstošiem rindu. Viņš iedeva AI kolonnu nosaukumus un pirmās 5 rindas (bez personas datiem) un lūdza pandu tīrīšanas kodu. AI izveidoja melnrakstu 8 sekundēs; Analītiķis nolasīja kodu pēc rindas, izlaboja datuma parsēšanas kļūdu un palaida to. Ilgums: 35 minūtes 4 stundu vietā. AI nodrošināja kodu, pārbaude palika cilvēka ziņā.

2. gadījums — izdomātais metriskais slazds. Interns jautāja AI: "Cik precīzi ir izlases mežs uz šiem datiem?" vispār neapmācot modeli. "Apmēram 89%," sacīja AI. Praktikants to ievietoja prezentācijā; Kad īsts modelis tika apmācīts, precizitāte bija 71%. Kļūda: tiek gaidīta metrika, nesniedzot AI datus un modeļus.

3. gadījums — klusa noplūde. Viena komanda īstenoja AI ieteikto ideju “pievienot mērķa mainīgā vidējo vērtību kā līdzekli”, neapšaubot to. Modelis testa komplektā darbojās 98%, taču ražošanas laikā avarēja, jo funkcija nopludināja turpmāko informāciju (datu noplūde, 10. vienība). Kļūda: nav statistiski filtrēts AI ieteikums.

Vāja uzvedne / spēcīga uzvedne

Vāja uzvedne:

Analizējiet šos pārdošanas datus un pastāstiet man vidējos ieņēmumus.

Šis apgalvojums ir kļūdains: AI netika sniegti dati, tāpēc “vidējos ienākumus” var tikai izdomāt. Nav skaidras ne ailes, ne periods, ne valūta.

Spēcīga uzvedne:

Jūsu loma: asistents, kas palīdz datu zinātniekam. Man ir pandas DataFrame: df. Kolonnas:- order_date (teksts, formātā "2024-03-01")- summa_tl (decimāldaļa, NaN dažās rindās)- customer_id (vesels skaitlis) Uzdevums: (1) uzrakstiet pandas kodu, kas aprēķina vidējo summu, (2) paskaidrojiet, kā tas apstrādā NaN vērtības, (3) uzskaitiet koda pieņēmumus. Neveidojiet datu saturu; vienkārši ģenerējiet kodu, un es palaidīšu un pārbaudīšu rezultātu.

Šajā pieprasījumā ir skaidra shēma, cerības un "fabricēšanas aizliegums". Jūs joprojām palaižat un pārbaudāt izvadi pats.

Ētikas un privātuma pirmsākumi

Datu zinātne bieži strādā ar personas datiem: klientu, pacientu, darbinieku ierakstiem. KVKK (Personas datu aizsardzības likums) Turkiye un GDPR Eiropā aizsargā šos datus. Īstā vārda, ID, e-pasta vai adreses ielīmēšana publiskā AI rīkā ir pārkāpums. Noteikums: anonimizēt datus pirms kopīgošanas, norādiet tikai shēmu (kolonnu nosaukumus, veidus) un fiktīvu piemēru rindu, ja nepieciešams. Ētikas tēmu padziļināsim 11.nodaļā; Izvirzīsim principu no sākuma: lai izprastu datus, bieži vien pietiek ar to struktūru, nevis saturu.

Biežas kļūdas

  • Gaida skaitļus/metriku, nesniedzot datus AI. Modelis nevar piekļūt datiem; Viņa norādītais numurs ir viltots. Vienmēr aprēķiniet rezultātu un palaidiet to.
  • Domājot, ka darba kods ir pareizs. Kods, kas manipulē ar nepareizo kolonnu, arī darbojas bez kļūdām; Neuzticieties, neizlasot loģiku.
  • Reālu personas datu ielīmēšana atvērtajā rīkā. Vārds, ID numurs, e-pasts nekad netiek izpausts; Pietiek ar diagrammu.
  • Veicot darbības manuāli un neierakstot tās kodā. Analīze, kas nav reproducējama, nav uzticama.
  • Bez šaubām pieņemt AI interpretāciju par statistiku. AI var atkārtot klasiskās kļūdas tādos jēdzienos kā p-vērtība un korelācija.
Padoms. Katrā AI sesijā iekļaujiet īsu "noteikumu rindiņu": "Neveidojiet datu saturu; vienkārši ģenerējiet kodu/analīzi, un es izpildīšu un pārbaudīšu rezultātu; norādiet "nav pārliecināts", ja neesat pārliecināts." Šis viens teikums ievērojami samazina halucināciju risku.

Rezumējot

AI ir spēcīgs palīgs datu zinātnē: tas paātrina tīrīšanas kodu, EDA interpretāciju, modeļa ieteikumus un vizualizāciju. Taču problēmas definēšana, metrikas izvēle, ražošanas lēmums un ētiskās robežas pieder cilvēkiem. Darbplūsmai ir seši posmi, un AI loma kļūst mazāka, palielinoties riskam. Visa pamatā ir trīs ieradumi: avotu saistīšana (validācija), reproducējamība (kodēšana) un anonimizācija (konfidencialitāte). Kad būsiet internalizējis šos trīs rīkus, katrs pārējā moduļa rīks kļūs par drošu paātrinātāju.

Lietojumprogrammas uzdevums

Vienkārši izveidojiet nelielas (vai hipotētiskas) tabulas shēmu: kolonnu nosaukumi, veidi un 2–3 fiktīvas piemēru rindas (bez reāliem personas datiem). Pieprasiet AI kopsavilkuma statistikas kodu, izmantojot iepriekš redzamo veidni “Jaudīga uzvedne”. Palaidiet kodu, salīdziniet izvadi ar manuālo vērtību, pārbaudiet, vai nav viltus pieņēmumu, un atzīmējiet savus atradumus 5 aizzīmju punktos.

kontrolsaraksts

  • [ ] Vai es tikko sniedzu AI shēmu un viltotu paraugu, nevis reālus personas datus?
  • [ ] Vai es izlasīju un palaidu kodu, ko tas izveidoja rindu pa rindiņai?
  • [ ] Vai esmu neatkarīgi pārbaudījis katru izvades numuru?
  • [ ] Vai esmu ierakstījis katru analīzes soli kodā un padarījis to atkārtojamu?
  • [ ] Vai esmu noteicis misijas riska pakāpi un galīgo lēmumu piešķīris cilvēkam?