Jednotka 1 / 11

Úvod do umelej inteligencie v dátovej vede a analýze: pracovný postup, úlohy, hranice, validácia a etika

zisky:

  • Schopnosť rozlíšiť šesťstupňový pracovný tok dátovej vedy (definícia problému, zber, čistenie, objavovanie, modelovanie, komunikácia) a autoritu, pod ktorou umelá inteligencia pracuje v každej fáze, podľa úrovne rizika úlohy
  • Schopnosť aplikovať disciplínu, ktorá overí každý výstup umelej inteligencie tak, že ho pripojí k zdroju, spustí a porovná a prejde cez expertné filtrovanie.
  • Schopnosť premeniť reprodukovateľnosť a zásady ochrany osobných údajov (zápis do kódu, anonymizácia) na analytické návyky od prvého dňa

Surové, chaotické a často „klamavé“ dáta pristávajú na stole dátových vedcov každý deň. V tabuľke predajov je stĺpec dátumu zapísaný v troch rôznych formátoch; čísla zákazníkov sú v niektorých riadkoch prázdne; Názov stĺpca je „príjem“, ale obsahuje hodnoty TL aj USD. Úlohou dátovej vedy je urobiť spoľahlivé rozhodnutie z tohto chaosu: zhromaždiť dáta, vyčistiť ich, preskúmať, zostaviť model, overiť výsledok a premeniť ho na príbeh. Umelá inteligencia (AI alebo skrátene AI – počítačové systémy, ktoré dokážu generovať text a kód, rozpoznávať vzory, sumarizovať a vytvárať predpovede) sa môže dotknúť každého článku v tomto reťazci: písanie čistiaceho kódu v priebehu niekoľkých minút, odporúčanie grafov na prieskumnú analýzu, interpretácia metriky modelu, oprava SQL dotazu. Rovnaká AI vám však môže poskytnúť aj dôveryhodný výmysel, ako napríklad „koreláciu 0,72“ pre údaje, ktoré nikdy nevidel.

Táto prvá jednotka nie je úvodom do knižnice. Jeho účelom je objasniť, kam zaradiť AI do pracovného toku dátovej vedy a kam ju nikdy nezaradiť. Uveďme si základný princíp od začiatku: AI je asistent, nie dátový vedec. Rozhodnutie o tom, aké údaje zbierať, pre akú metriku sa rozhodnúť, či uviesť model do výroby a kde vytýčiť etické hranice, je na kompetentnom odborníkovi. Neoverený výstup AI je riskantný, rovnako ako nepodpísaná správa o analýze.

Pracovný postup pre vedu o údajoch: mapa typu end-to-end

Na pochopenie dátového projektu je užitočné rozdeliť ho do šiestich fáz. Celý tento modul sleduje túto mapu.

1. Definícia problému: Čo meriame, prečo, na podporu ktorého rozhodnutia? Táto fáza nie je delegovaná na AI; Je to osoba, ktorá definuje prácu.

2. Zber údajov: Identifikácia zdrojov, extrahovanie údajov, vzorkovanie. (Jednotka 2)

3. Čistenie a predspracovanie údajov: Chýbajúca hodnota, odľahlá hodnota, konverzia typu. (Jednotka 3)

4. Prieskumná analýza údajov (EDA – Prieskumná analýza údajov, štádium rozpoznávania distribúcie a vzťahov medzi údajmi „od oka“): (Jednotka 4)

5. Inžinierstvo prvkov a modelovanie: Generovanie premenných, výber algoritmu, školenie, vyhodnotenie. (Jednotka 5, 6, 7)

6. Komunikácia a produkcia: Vizualizácia, príbeh, MLOps (disciplína zobrať model naživo a sledovať ho). (Jednotka 8, 11)

AI pracuje s inou autoritou v každej z týchto šiestich fáz. Nižšie uvedená tabuľka sumarizuje toto rozdelenie právomocí; Toto je najdôležitejšia tabuľka modulu.

Etapa

Úloha AI

Úroveň rizika

Kto schvaľuje

Definícia problému

brainstormingový partner

nízka

Dátový vedec + zainteresovaná strana

Napíšte kód čistenia

Generátor náčrtu kódu

stredná

Dátový vedec (číta kód)

Komentár EDA

navrhovateľ vzorov

stredná

dátový vedec

Generovanie funkcií

Generátor nápadov a kódov

stredne vysoká

Kontrola úniku je nevyhnutnosťou

Výber modelu/metrika

poradca

vysoká

dátový vedec

Rozhodnutie uviesť do výroby

pomocný vstup

veľmi vysoká

Tím + majiteľ firmy

Schválenie etiky/ochrany súkromia

stimulant

veľmi vysoká

človek, vždy

Majte na pamäti jednu vetu z tohto grafu: ako rastú stávky, rola AI sa zmenšuje a ľudská podpora rastie.

Prečo je overovanie srdcom tohto podnikania

Jazykové modely AI vyzerajú isto, no nemusia si byť istí. V odbornom jazyku sa tomu hovorí halucinácia: ide o modelový výmysel neexistujúcej informácie v plynulej vete, ako keby to bola pravda. V dátovej vede to prichádza v troch formách. Prvým je falošné číslo: ak sa spýtate modelu „aká je priemerná suma objednávky“ bez uvedenia akýchkoľvek údajov, s istotou vám povie číslo, aj keď vaše údaje nikdy nevidel. Druhá je funkcia, ktorá neexistuje: model môže navrhnúť funkciu, ktorá vôbec neexistuje, ako napríklad pandas.read_excel_fast(). Po tretie, nesprávna štatistická interpretácia: model môže hladko opakovať klasickú štatistickú chybu, ako napríklad „p-hodnota je 0,04, takže hypotéza je na 96 % správna“.

Overovacia disciplína pozostáva z troch krokov:

  1. Odkaz na zdroj: Každé číslo, rýchlosť a trend by mali pochádzať z vašich údajov, nie z pamäte AI. Použite AI na kód, ktorý pracuje s údajmi, nie na zapamätanie údajov.
  2. Spustite a porovnajte: Spustite každý kus kódu, ktorý vám dáva AI; Porovnajte každú metriku, ktorú vytvorí, s nezávislou základnou hodnotou.
  3. Expertný filter: Otestujte si sami, či je výstup v rozpore so štatistikou a znalosťou domény.
Upozornenie: Vloženie analýzy napísanej AI do prezentácie bez spustenia a čítania je ako prezentácia nepodpísanej správy. To, že kód funguje, neznamená, že je správny; Kód, ktorý sčítava nesprávny stĺpec, tiež funguje bez chýb.

Reprodukovateľnosť: schopnosť vytvoriť rovnaký výsledok dvakrát

Tichým, ale kritickým princípom vedy o údajoch je reprodukovateľnosť: keď znova spustíte analýzu o šesť mesiacov neskôr alebo na inom počítači, získate rovnaký výsledok. Toto riziko sa zvyšuje pri práci s AI, pretože keď poviete AI, aby „urobila tento graf“ a prehrala ho manuálne, kroky zmiznú. Pravidlo: každý krok musí byť zaregistrovaný v kóde a správe verzií (ako Git); V krokoch zahŕňajúcich náhodnosť by sa mal zafixovať náhodný základ (počiatočná hodnota generátora náhodných čísel; ak je opravený, výsledok bude opakovateľný). Túto tému prehĺbime v 10. bloku; Zatiaľ si osvojte tento zvyk: „Neklikajte ručne, píšte kódom.“

tri mini prípady

Prípad 1 – Bezpečné zrýchlenie. Analytik elektronického obchodu by za normálnych okolností strávil pol dňa čistením tabuľky objednávok s 240 tisíc riadkami. Dal názvy stĺpcov a prvých 5 riadkov (bez osobných údajov) AI a požiadal o čistiaci kód pre pandy. AI vytvorila návrh za 8 sekúnd; Analytik prečítal kód riadok po riadku, opravil chybu v analýze dátumu a spustil ho. Trvanie: 35 minút namiesto 4 hodín. AI poskytla kód, overenie zostalo na človeku.

Prípad 2 – Zhotovená metrická pasca. Stážista sa spýtal AI: "Ako presný je náhodný les na týchto údajoch?" bez trénovania modelu vôbec. "Asi 89%," povedala AI. Stážista to vložil do prezentácie; Keď bol trénovaný skutočný model, presnosť bola 71%. Chyba: Čakanie na metriky bez poskytnutia údajov a modelov AI.

Prípad 3 – Tichý únik. Jeden tím implementoval myšlienku „pridať priemer cieľovej premennej ako funkciu“ navrhnutú AI bez toho, aby to spochybňoval. Model fungoval na 98 % na testovacej súprave, ale vo výrobe sa zrútil, pretože funkcia unikala budúce informácie (únik údajov, jednotka 10). Chyba: Štatistické filtrovanie odporúčania AI.

Slabá výzva / Silná výzva

Slabá výzva:

Analyzujte tieto údaje o predaji a povedzte mi priemerný príjem.

Toto tvrdenie je chybné: AI neboli poskytnuté údaje, takže „priemerný príjem“ je možné len vymyslieť. Nie sú jasné ani stĺpce, ani obdobie, ani mena.

Výkonná výzva:

Vaša úloha: asistent pomáhajúci dátovému vedcovi. Mám pandas DataFrame: df. Stĺpce:- dátum_objednávky (text, vo formáte "2024-03-01")- množstvo_tl (desatinné, NaN v niektorých riadkoch)- customer_id (celé číslo)Úloha: (1) napíšte kód pandy, ktorý vypočíta priemerné množstvo, (2) vysvetlite, ako narába s hodnotami NaN, (3) uveďte predpoklady, ktoré kód vytvára. Nevymýšľajte obsah údajov; stačí vygenerovať kód a ja spustím a overím výsledok.

V tejto žiadosti je jasná schéma, očakávanie a „zákaz výroby“. Stále spúšťate a overujete výstup sami.

Začiatky etiky a súkromia

Dátová veda často pracuje s osobnými údajmi: záznamy zákazníkov, pacientov, zamestnancov. KVKK (zákon o ochrane osobných údajov) v Türkiye a GDPR v Európe chránia tieto údaje. Prilepenie vášho skutočného mena, ID, e-mailu alebo adresy do verejného nástroja AI je porušením pravidiel. Pravidlo: pred zdieľaním anonymizujte údaje, v prípade potreby uveďte iba schému (názvy stĺpcov, typy) a riadok s fiktívnym príkladom. V 11. bloku prehĺbime tému etiky; Povedzme si princíp od začiatku: Na pochopenie údajov často stačí zdieľanie ich štruktúry, nie obsahu.

Časté chyby

  • Čakanie na čísla/metriky bez poskytnutia údajov AI. Model nemá prístup k údajom; Číslo, ktoré uvádza, je falošné. Vždy si nechajte vypočítať výsledok a spustite.
  • Myslieť si, že pracovný kód je správny. Kód, ktorý manipuluje s nesprávnym stĺpcom, tiež beží bez chýb; Neverte bez prečítania logiky.
  • Vkladanie skutočných osobných údajov do otvoreného nástroja. Meno, IČO, e-mail sa nikdy nezdieľa; Schéma stačí.
  • Robiť kroky ručne a nezapisovať ich do kódu. Analýza, ktorá nie je reprodukovateľná, je nespoľahlivá.
  • Bez akýchkoľvek pochybností prijímame interpretáciu štatistík AI. Umelá inteligencia môže opakovať klasické chyby v konceptoch ako p-hodnota a korelácia.
Tip: Do každej relácie AI zahrňte krátky „riadok pravidiel“: „Nevytvárajte obsah údajov, vygenerujte kód/analýzu a ja spustím a overím výsledok; tam, kde si nie ste istí, uveďte „nie som si istý“. Táto jediná veta výrazne znižuje riziko halucinácií.

V súhrne

AI je výkonným pomocníkom v oblasti vedy o údajoch: urýchľuje čistenie kódu, interpretáciu EDA, odporúčanie modelu a vizualizáciu. Ale definícia problému, výber metrík, výrobné rozhodnutie a etické hranice patria k ľuďom. Pracovný postup má šesť fáz a úloha AI sa zmenšuje so zvyšujúcim sa rizikom. Základom všetkého sú tri zvyky: prepojenie so zdrojom (validácia), reprodukovateľnosť (kódovanie) a anonymizácia (dôvernosť). Keď tieto tri internalizujete, každý nástroj vo zvyšku modulu sa pre vás stane bezpečným akcelerátorom.

Aplikačná úloha

Vytvorte si schému malej tabuľky, ktorú máte (alebo hypotetickú): názvy stĺpcov, typy a 2-3 fiktívne príklady riadkov (bez skutočných osobných údajov). Požiadajte AI ​​ o súhrnný štatistický kód pomocou šablóny „Výkonná výzva“ vyššie. Spustite kód, porovnajte výstup s manuálnou hodnotou, skontrolujte akékoľvek falošné predpoklady a poznačte si svoje zistenia v 5 odrážkach.

kontrolný zoznam

  • [ ] Dal som umelej inteligencii len schému a falošnú vzorku namiesto skutočných osobných údajov?
  • [ ] Čítal som a spustil som kód, ktorý vytvoril, riadok po riadku?
  • [ ] Overil som nezávisle každé číslo vo výstupe?
  • [ ] Zapísal som každý krok analýzy do kódu a urobil som ho opakovateľným?
  • [ ] Stanovil som úroveň rizika misie a pridelil som konečné rozhodnutie človeku?