zisky:
- Schopnost prozkoumat distribuci, střed, šíření a anomálie proměnných pomocí vhodných grafů (histogram, krabicový graf, bodový graf).
- Schopnost správně interpretovat korelaci a číst ji společně s bodovým grafem, aniž by se zaměňovala s kauzalitou
- Schopnost pochopit, že souhrnné statistiky mohou být zavádějící (lekce Anscombe) a rozvíjet hypotézy, které určují směr modelování.
Před stavbou modelu je nutné znát data. Stejně jako lékař nepředepisuje léky bez vyšetření pacienta, ani datový vědec nesestaví model bez „prozkoumání“ dat. Toto zkoumání se nazývá exploratory data analysis (zkráceně EDA): je to fáze zjišťování distribuce, vztahů, překvapení a pastí dat vizuálně a graficky. Účelem EDA je generovat hypotézy, zachytit chyby a určit směr modelování. Umělá inteligence je v této fázi velmi silným pomocníkem: navrhuje, který graf je vhodný, píše jeho kód, interpretuje distribuci. Ale člověk se svými znalostmi v oboru rozhoduje, zda vzor, který vidí, je skutečný nebo náhodný.
Co hledá EDA?
EDA hledá odpovědi na čtyři otázky. Distribuce: Jak je každá proměnná rozdělena – je symetrická, zkosená nebo dvouvrcholová? Centrální tendence a šíření: Jaký je průměr, medián, směrodatná odchylka? Vztahy: Jak spolu proměnné souvisí? Anomálie: Existují neočekávané hodnoty, mezery, seskupení? Tyto čtyři otázky určují, která funkce bude fungovat a který model je vhodný.
Pojďme si definovat některé základní pojmy. Histogram je graf, který rozděluje hodnoty číselné proměnné do intervalů a ukazuje, kolik pozorování je v každém intervalu; Je to nejrychlejší způsob, jak zobrazit distribuci. Šikmost je posun distribuce jedním směrem; Proměnné, jako je příjem, jsou vychýleny doprava (většina nízká, několik velmi vysoká). Krabicový graf ukazuje medián, kvartily a odlehlé hodnoty na první pohled. Bodový graf ukazuje vztah dvou číselných proměnných s mračnem bodů.
Korelace: existuje vztah, ale buďte opatrní
Korelace — míra toho, jak se dvě proměnné pohybují společně; číslo mezi -1 a +1 — je nejpoužívanějším a nejvíce nepochopeným nástrojem EDA. +1 znamená perfektní ko-navýšení, -1 znamená perfektní inverzní vztah, 0 znamená žádný lineární vztah. Jsou tam dvě velké pasti. Za prvé, slavné pravidlo: korelace není kauzalita. S prodejem zmrzliny přibývají obaly na dušení; ne proto, že jedno vede k druhému, ale protože léto (skrytá třetí proměnná) spouští obojí. Za druhé, korelace měří pouze lineární vztah; Může to znamenat silný, ale křivočarý vztah blízko 0. Když se tedy díváte na korelaci, nezapomeňte se také podívat na bodový graf.
Upozornění: Když AI uvede korelační číslo, může sklouznout do kauzálního jazyka jako „A zvyšuje B“. To je nebezpečné. Korelace označuje pouze společný pohyb; Pouze zkušenost, znalost domény a pečlivé vyvozování stanoví důvod.
Anscombe quartet: proč se nedívat jen na číslo
Ve statistikách je slavný příklad: Anscombův kvartet. Čtyři různé soubory dat mají téměř stejný průměr, stejný rozptyl a stejnou korelaci (0,82); Ale když se zobrazí v grafu, vypadají úplně jinak – jedna přímka, jedna zakřivená, jedna mrak tažený jedinou odlehlou hodnotou. Poučení je jasné: souhrnné statistiky jsou zavádějící, pohled do grafu je nutností. Umělá inteligence vám může poskytnout průměry a korelace, ale důvěřovat těmto číslům, aniž byste viděli graf, spadá do pasti Anscombe.
Tabulka níže shrnuje, který graf odpovídá které otázce:
Otázka
vhodná grafika
Co ukazuje
Distribuce jedné proměnné
Histogram / KDE
Tvar, šikmost, počet vrcholů
Střed a odlehlé hodnoty
Krabicová zápletka
Medián, kvartily, odlehlé hodnoty
Vztah dvou čísel
bodový graf
Směr, síla, zakřivení
Srovnání kategorií
sloupcový graf
Rozdíl mezi skupinami
měnit v průběhu času
spojnicový graf
Trend, sezónnost
Vícerozměrný vztah
Korelační tepelná mapa
Obecná matice vztahů
Simpsonův paradox: agregovaná data mohou lhát
Záludnou pastí v EDA, které je třeba si uvědomit, je Simpsonův paradox: vzor může ukazovat jeden směr, když jsou všechna data zkoumána společně, ale naopak, když jsou data rozdělena do smysluplných podskupin. Klasický příklad: celková míra přijetí uchazeček na univerzitu se zdá být nižší než u mužů; Ale když se podíváme na oddělení po oddělení, míra přijetí žen je ve většině oddělení vyšší než u mužů. odkud? Ženy se hlásily do více konkurenceschopných (nižší míra přijetí) oddělení; Kombinované číslo ukládá tuto skrytou proměnnou. Poučení je jasné: když se podíváte na součet nebo průměr, nezapomeňte zkontrolovat, zda toto číslo vypovídá o stejném příběhu, když je rozděleno do smysluplných podskupin (segment, období, kanál). Když vám AI poskytne kombinovanou sazbu, dotaz „je to stále platné, když ji segmentujete“, brzy zachytí většinu zavádějících výsledků.
tři mini pouzdra
Případ 1 – Dva skryté kopce. Jeden analytik zjistil, že průměrný věk zákazníka je 41 let a uvedl to jako „dav středního věku“. Histogram však ukázal dva vrcholy: věkové skupiny 22–28 a 55–62 let. Průměrných 41 ve skutečnosti nikoho nepředstavovalo. Lekce: zakreslete rozdělení, než budete důvěřovat průměru.
Případ 2 – Falešná korelace. Jeden tým zjistil korelaci 0,78 mezi „výdaji na reklamu“ a „prodejem“ a zdvojnásobil rozpočet. Co však spustilo obě, byly sezónní kampaně; během období mimo kampaň poklesl vztah na 0,10. Dodatečná reklama 340 tisíc TL nepřinesla očekávanou návratnost. Ponaučení: zaměňovat korelaci za příčinnou souvislost je drahé.
Případ 3 – Čára nakreslená osamělým kontrariánem. Analýza nemovitostí ukázala silný vztah mezi rozlohou a cenou (r=0,80). Když byl nakreslen bodový graf, téměř celý vztah vytvořila jediná luxusní vila za 12 milionů TL; Když byl tento bod odstraněn, korelace klesla na 0,31. Ponaučení: vždy čtěte korelaci spolu s bodovým grafem.
Čtyři kopírovatelné šablony
1) Automatické shrnutí EDA:
Mám pandy df. Napište kód, který vytvoří: (1) df.info() a df.describe(), (2) histogram pro každý číselný sloupec, (3) počet pro každý kategorický sloupec. Nekomentujte, pouze vygenerujte vyhledávací kód; Vykládám vzory.
2) Korelace + vizuální (s výhradou kauzality):
Napište kód, který nakreslí korelační matici a teplotní mapu pro číselné sloupce. Nakreslete také bodový graf 3 nejvyšších korelovaných párů. Přidejte k výstupu řádek komentáře, který vám připomene, že korelace neznamená příčinnou souvislost. Nečiňte kauzální nároky.
3) Diagnostika distribuce:
Pro sloupec "income_tl": napište kód, který vytvoří histogram, krabicový graf, hodnotu šikmosti a srovnání mediánu a průměru. Vysvětlím, zda je distribuce zkreslená nebo ne; stačí zadat kód.
4) Srovnání segmentů:
Porovnejte zákazníky podle „kanálu“ (web/mobil): napište kód, který vytvoří krabicový graf průměrné částky, mediánu, počtu objednávek a distribuce množství pro každý kanál. Navrhněte, který test je vhodný pro statistickou významnost rozdílu mezi dvěma kanály, ale rozhodnutí je na mně.
Slabá výzva / Silná výzva
Slabá výzva:
Najděte v těchto datech něco zajímavého.
„Zajímavé“ není definováno; AI data nevidí, takže si je buď vymýšlí, nebo dělá obecná prohlášení. Neexistuje žádný směr, žádné proměnné, žádný účel.
Výkonná výzva:
Vaše role: asistent EDA. df sloupce: věk (int), příjem_tl (float), město (kategorie), kanál (web/mobil), částka (float). Účel: odhalit faktory ovlivňující „množství“. Úkol: (1) kód vykreslující rozdělení částky, (2) grafy rozdělení mezi částkou a věkem a income_tl, (3) krabicový graf částky v členění podle kanálů. Zřízení kauzálního nároku; Stačí vygenerovat vyhledávací kód a já vyložím vzor.
Zde je účel, proměnné a hranice „tvrdit kauzalitu“ jasné.
Časté chyby
- Spoléhat se pouze na souhrnné statistiky. Jak ukazuje Anscombova čtveřice, stejný průměr skrývá velmi odlišné distribuce; viz graf.
- Záměna korelace za příčinnou souvislost. Spolupůsobení neznamená, že jedno vede k druhému; Pozor na skryté proměnné.
- Pohled na korelaci bez bodového grafu. Jediná odlehlá hodnota nebo křivočarost uvádí číslo v omyl.
- Shrnutí dvouvrcholového/šikmého rozdělení s průměrem. Průměr nemusí nikoho reprezentovat.
- Přeskočit EDA a jít přímo k modelu. Nerozpoznaná data znamenají slepý model.
Tip: S každým novým souborem dat věnujte prvních 30 minut kreslení grafů: histogram každého číselného údaje, bodový graf významných párů, sloupcový graf kategorií. Těchto 30 minut zabrání budoucím chybám při modelování v příštích dnech.
V souhrnu
EDA je fáze seznamování se s daty před vytvořením modelu a hledá odpovědi na čtyři otázky: distribuce, rozmístění ve středu, vztahy a anomálie. Souhrnné statistiky mohou být zavádějící; pohled na graf je nutností (přednáška Anscombe). Korelace je mocný nástroj, ale kauzalita není a rozhodně by se měla číst ve spojení s bodovým grafem. AI je skvělý akcelerátor pro navrhování grafiky a psaní kódu; Lidé však svými znalostmi v terénu interpretují, zda vzor, který vidí, je skutečný nebo náhodný.
Aplikační úkol
Vyberte si datovou sadu a jednoduše proveďte EDA: extrahujte histogram alespoň tří numerických proměnných, bodový graf dvou párů proměnných a korelační tepelnou mapu. Najděte alespoň jedno „překvapení“ (jako je rozdělení se dvěma vrcholy, kandidát na falešnou korelaci, vztah přitahovaný jedinou odlehlou hodnotou) a vysvětlete ho jednou větou. Pište bez jakýchkoli kauzálních tvrzení.
kontrolní seznam
- [ ] Vytvořil jsem graf rozložení každé číselné proměnné?
- [ ] Díval jsem se na korelace s bodovým grafem?
- [ ] Udržel jsem kauzalitu a korelaci odděleně?
- [ ] Copak jsem si nevšiml zkreslených nebo dvouvrcholových distribucí a slepě jsem nevěřil průměru?
- [ ] Odvodil jsem ze svých zjištění EDA alespoň jeden modelovací aspekt/hypotézu?