zisky:
- Schopnost rozlišit šestistupňový pracovní tok datové vědy (definice problému, sběr, čištění, objevování, modelování, komunikace) a autoritu, pod kterou umělá inteligence v každé fázi pracuje, podle úrovně rizika úkolu
- Schopnost aplikovat disciplínu, která ověřuje každý výstup umělé inteligence tak, že jej připojí ke zdroji, spustí a porovná a projde expertním filtrováním.
- Schopnost přeměnit reprodukovatelnost a zásady ochrany osobních údajů (zápis do kódu, anonymizace) na analytické návyky od prvního dne
Syrová, chaotická a často „lhaná“ data přistávají na stole datových vědců každý den. V tabulce prodejů je sloupec data zapsán ve třech různých formátech; čísla zákazníků jsou na některých řádcích prázdná; Název sloupce je „income“, ale obsahuje hodnoty TL i USD. Úkolem datové vědy je učinit spolehlivé rozhodnutí z tohoto chaosu: shromáždit data, vyčistit je, prozkoumat je, vytvořit model, ověřit výsledek a přeměnit je v příběh. Umělá inteligence (AI nebo zkráceně AI – počítačové systémy, které dokážou generovat text a kód, rozpoznávat vzory, sumarizovat a vytvářet předpovědi) se může dotknout každého článku v tomto řetězci: napsat kód pro vyčištění během několika minut, doporučit grafy pro průzkumnou analýzu, interpretovat metriku modelu, opravit dotaz SQL. Ale stejná umělá inteligence vám také může poskytnout sebevědomý výmysl, jako je „korelace 0,72“ pro data, která nikdy neviděla.
Tato první jednotka není úvodem do knihovny. Jeho účelem je objasnit, kam zařadit AI do pracovního postupu datové vědy a kam ji nikdy nedávat. Uveďme si základní princip od začátku: AI je asistent, nikoli datový vědec. Rozhodnutí o tom, jaká data sbírat, pro jakou metriku se rozhodnout, zda uvést model do výroby a kde vymezit etické hranice, spočívá na kompetentním expertovi. Neověřený výstup AI je riskantní, stejně jako nepodepsaná zpráva o analýze.
Pracovní postup datové vědy: komplexní mapa
Pro pochopení datového projektu je užitečné rozdělit jej do šesti fází. Celý tento modul sleduje tuto mapu.
1. Definice problému: Co měříme, proč, abychom podpořili které rozhodnutí? Tato fáze není delegována na AI; Je to osoba, která definuje práci.
2. Sběr dat: Identifikace zdrojů, extrahování dat, vzorkování. (Jednotka 2)
3. Čištění a předzpracování dat: Chybějící hodnota, odlehlá hodnota, převod typu. (Jednotka 3)
4. Průzkumná analýza dat (EDA - Exploratory Data Analysis, fáze rozpoznání distribuce a vztahů dat "od oka"): (Unit 4)
5. Funkce a modelování: Generování proměnných, výběr algoritmu, trénování, vyhodnocování. (Jednotka 5, 6, 7)
6. Komunikace a produkce: Vizualizace, příběh, MLOps (disciplína živého snímání modelu a jeho sledování). (Jednotka 8, 11)
Umělá inteligence funguje v každé z těchto šesti fází s jinou autoritou. Níže uvedená tabulka shrnuje toto rozdělení pravomocí; Toto je jediná nejdůležitější tabulka modulu.
Jeviště
Role AI
Úroveň rizika
Kdo schvaluje
Definice problému
brainstormingový partner
nízká
Datový vědec + stakeholder
Napište kód čištění
Generátor náčrtu kódu
střední
Datový vědec (čte kód)
Komentář EDA
navrhovatel vzorů
střední
datový vědec
Generování funkcí
Generátor nápadů a kódu
středně vysoká
Kontrola úniku je nutností
Výběr modelu/metrika
poradce
vysoká
datový vědec
Rozhodnutí o uvedení do výroby
pomocný vstup
velmi vysoká
Tým + majitel firmy
Schválení etiky/ochrany soukromí
stimulant
velmi vysoká
člověk, vždycky
Mějte na paměti jednu větu z tohoto grafu: jak se zvyšuje sázka, role AI se zmenšuje a lidský souhlas roste.
Proč je ověřování srdcem tohoto podnikání
Jazykové modely AI vypadají jistě, ale nemusí si být jisti. V odborném jazyce se tomu říká halucinace: je to modelovo vymýšlení neexistující informace v plynulé větě, jako by to byla pravda. V datové vědě to přichází ve třech formách. První je falešné číslo: pokud se zeptáte modelu „jaká je průměrná částka objednávky“, aniž byste uvedli jakékoli údaje, sebevědomě vám sdělí číslo, i když vaše data nikdy neviděl. Druhá je funkce, která neexistuje: model může navrhnout funkci, která vůbec neexistuje, jako je pandas.read_excel_fast(). Za třetí, nesprávná statistická interpretace: model může plynule opakovat klasickou statistickou chybu jako „p-hodnota je 0,04, takže hypotéza je z 96 % správná“.
Ověřovací disciplína se skládá ze tří kroků:
- Odkaz na zdroj: Každé číslo, rychlost a trend by měly pocházet z vašich dat, nikoli z paměti AI. AI používejte pro kód, který pracuje s daty, ne pro zapamatování dat.
- Spustit a porovnat: Spusťte každý kus kódu zadaný AI sami; Porovnejte každou metriku, kterou vytvoří, s nezávislou základní linií.
- Expertní filtr: Otestujte si sami, zda výstup odporuje statistikám a znalostem domény.
Upozornění: Vložení analýzy napsané umělou inteligencí do prezentace bez jejího spuštění a čtení je jako předkládání nepodepsané zprávy. To, že kód funguje, neznamená, že je správný; Kód, který sečte nesprávný sloupec, také funguje bez chyb.
Reprodukovatelnost: schopnost vytvořit stejný výsledek dvakrát
Tichým, ale kritickým principem datové vědy je reprodukovatelnost: když znovu spustíte analýzu o šest měsíců později nebo na jiném počítači, získáte stejný výsledek. Toto riziko se zvyšuje při práci s AI, protože když řeknete AI, aby „udělala tento graf“ a přehrála jej ručně, kroky zmizí. Pravidlo: každý krok musí být registrován v kódu a řízení verzí (jako Git); V krocích zahrnujících náhodnost by měl být náhodný výchozí bod (počáteční hodnota generátoru náhodných čísel; pokud je pevně stanoven, výsledek bude opakovatelný). Toto téma prohloubíme v Unit 10; Prozatím si osvojte tento zvyk: "Neklikejte ručně, pište kódem."
tři mini pouzdra
Případ 1 — Bezpečné zrychlení. Analytik elektronického obchodu by normálně strávil půl dne čištěním tabulky objednávek s 240 tisíci řádky. Předal názvy sloupců a prvních 5 řádků (bez osobních údajů) AI a požádal o kód čištění pand. AI vytvořila návrh za 8 sekund; Analytik přečetl kód řádek po řádku, opravil chybu v analýze data a spustil jej. Doba trvání: 35 minut místo 4 hodin. AI poskytla kód, ověření zůstalo u člověka.
Případ 2 – Složená metrická past. Stážista se zeptal AI: "Jak přesný je náhodný les na těchto datech?" aniž byste model vůbec trénovali. "Asi 89 %," řekla AI. Stážista to vložil do prezentace; Když byl trénován skutečný model, přesnost byla 71%. Chyba: Čekání na metriky bez poskytnutí dat a modelů AI.
Případ 3 – Tichý únik. Jeden tým implementoval myšlenku „přidat průměr cílové proměnné jako funkci“ navrženou AI, aniž by to zpochybňoval. Model fungoval na 98 % na testovací sadě, ale ve výrobě se zhroutil, protože funkce unikala budoucí informace (únik dat, jednotka 10). Chyba: Není statisticky filtrováno doporučení AI.
Slabá výzva / Silná výzva
Slabá výzva:
Analyzujte tyto údaje o prodeji a řekněte mi průměrný příjem.
Toto tvrzení je chybné: AI nebyla poskytnuta data, takže „průměrný příjem“ lze pouze vymyslet. Nejsou jasné ani sloupce, ani období, ani měna.
Výkonná výzva:
Vaše role: asistent pomáhající datovému vědci. Mám pandas DataFrame: df. Sloupce:- datum_objednávky (text, ve formátu "2024-03-01")- částka_tl (desetinné, NaN v některých řádcích)- customer_id (celé číslo) Úkol: (1) napište kód pandy, který vypočítá průměrné množství, (2) vysvětlete, jak nakládá s hodnotami NaN, (3) vyjmenujte předpoklady, které kód vytváří. Nevytvářejte obsah dat; stačí vygenerovat kód a já spustím a ověřím výsledek.
V této žádosti je jasné schéma, očekávání a „zákaz výroby“. Stále spouštíte a ověřujete výstup sami.
Počátky etiky a soukromí
Data science často pracuje s osobními údaji: záznamy zákazníků, pacientů, zaměstnanců. KVKK (zákon o ochraně osobních údajů) v Turecku a GDPR v Evropě tato data chrání. Vložení vašeho skutečného jména, ID, e-mailu nebo adresy do veřejného nástroje umělé inteligence je porušením zásad. Pravidlo: před sdílením anonymizujte data, v případě potřeby uveďte pouze schéma (názvy sloupců, typy) a fiktivní příklad řádku. Téma etiky prohloubíme v Unit 11; Řekněme princip od začátku: K pochopení dat často postačí sdílení jejich struktury, nikoli obsahu.
Časté chyby
- Čekání na čísla/metriky bez poskytnutí dat AI. Model nemá přístup k datům; Číslo, které uvádí, je falešné. Vždy si nechte spočítat výsledek a spustit.
- Myslí si, že pracovní kód je správný. Kód, který manipuluje s nesprávným sloupcem, také běží bez chyb; Nevěřte bez přečtení logiky.
- Vkládání skutečných osobních údajů do otevřeného nástroje. Jméno, IČO, e-mail nejsou nikdy sdíleny; Schéma stačí.
- Proveďte kroky ručně a nezapisujte je do kódu. Analýza, která není reprodukovatelná, je nespolehlivá.
- Bez otázek přijímáme interpretaci statistik AI. Umělá inteligence může opakovat klasické chyby v pojmech, jako je p-hodnota a korelace.
Tip: Do každé své relace umělé inteligence zahrňte krátkou „čáru pravidla“: „Nevytvářejte obsah dat; vygenerujte kód/analýzu a já spustím a ověřím výsledek; tam, kde si nejste jisti, uveďte „nejsem si jistý“. Tato jediná věta výrazně snižuje riziko halucinací.
V souhrnu
Umělá inteligence je výkonným pomocníkem v oblasti datové vědy: urychluje čištění kódu, interpretaci EDA, doporučení modelu a vizualizaci. Ale definice problému, výběr metrik, výrobní rozhodnutí a etické hranice patří k lidem. Pracovní postup má šest fází a role AI se s rostoucím rizikem zmenšuje. Základem všeho jsou tři návyky: propojování zdrojů (validace), reprodukovatelnost (kódování) a anonymizace (důvěrnost). Jakmile tyto tři internalizujete, každý nástroj ve zbytku modulu se pro vás stane bezpečným akcelerátorem.
Aplikační úkol
Udělejte si schéma malé tabulky, kterou máte (nebo hypotetickou): názvy sloupců, typy a 2–3 fiktivní ukázkové řádky (bez skutečných osobních údajů). Požádejte AI o kód souhrnné statistiky pomocí výše uvedené šablony „Výkonná výzva“. Spusťte kód, porovnejte výstup s manuální hodnotou, zkontrolujte případné falešné předpoklady a svá zjištění si poznamenejte v 5 odrážkách.
kontrolní seznam
- [ ] Dal jsem právě AI schéma a falešný vzorek místo skutečných osobních údajů?
- [ ] Přečetl jsem a spustil jsem kód, který vytvořil, řádek po řádku?
- [ ] Ověřil jsem nezávisle každé číslo ve výstupu?
- [ ] Zapsal jsem každý krok analýzy do kódu a udělal jsem ho opakovatelným?
- [ ] Stanovil jsem míru rizika mise a přidělil konečné rozhodnutí člověku?