Добици:
- Способност истраживања дистрибуције, центра, ширења и аномалија варијабли са одговарајућим графиконима (хистограм, бокс дијаграм, дијаграм распршивања).
- Способност правилног тумачења корелације и читања заједно са дијаграмом распршивања, без бркања са узрочности
- Способност разумевања да сумарна статистика може да доведе у заблуду (Анскомбова лекција) и развија хипотезе које одређују правац моделирања.
Пре изградње модела потребно је познавати податке. Као што лекар не прописује лекове без прегледа пацијента, научник података не гради модел без „испитивања“ података. Ово испитивање се зове истраживачка анализа података (скраћено ЕДА): то је фаза откривања дистрибуције, односа, изненађења и замки података визуелно и графички. Сврха ЕДА је да генерише хипотезе, ухвати грешке и одреди правац моделирања. Вештачка интелигенција је веома моћан помоћник у овој фази: она предлаже који графикон је прикладан, пише свој код, тумачи дистрибуцију. Али особа одлучује, својим знањем на терену, да ли је образац који види стваран или случајан.
Шта ЕДА тражи?
ЕДА тражи одговоре на четири питања. Дистрибуција: Како је свака варијабла распоређена - да ли је симетрична, накривљена или са два врха? Централна тенденција и ширење: Која су средња вредност, медијана, стандардна девијација? Односи: Како су варијабле повезане једна са другом? Аномалије: Постоје ли неочекиване вредности, празнине, груписања? Ова четири питања одређују која функција ће радити и који модел је одговарајући.
Хајде да дефинишемо неке основне појмове. Хистограм је график који дели вредности нумеричке променљиве у интервале и показује колико је посматрања у сваком интервалу; То је најбржи начин да видите дистрибуцију. Косност је померање дистрибуције у једном правцу; Варијабле као што је приход су нагнуте удесно (већина ниска, неколико веома висока). Оквирни дијаграм приказује медијану, квартиле и граничне вредности на први поглед. Дијаграм расипања показује однос две нумеричке променљиве са облаком тачака.
Корелација: постоји веза, али будите опрезни
Корелација — мера како се две варијабле крећу заједно; број између -1 и +1 — је најчешће коришћено и највише погрешно схваћено средство ЕДА. +1 значи савршено ко-повећање, -1 значи савршен инверзни однос, 0 значи да нема линеарне везе. Постоје две велике замке. Прво, познато правило: корелација није узрочна веза. Случајеви гушења се повећавају са продајом сладоледа; не зато што једно води ка другом, већ зато што лето (скривена трећа варијабла) покреће обоје. Друго, корелација мери само линеарни однос; То може указивати на јак, али криволинијски однос близу 0. Дакле, када гледате корелацију, обавезно погледајте и дијаграм расејања.
Опрез: Када АИ да корелациони број, он може да пређе у узрочни језик као што је „А повећава Б“. Ово је опасно. Корелација само указује на заједничко кретање; Само искуство, знање из домена и пажљиво закључивање утврђују разлог.
Анскомб квартет: зашто не погледате само број
У статистици је чувен пример: квартет Анскомб. Четири различита скупа података имају скоро исту средњу вредност, исту варијансу и исту корелацију (0,82); Али када су приказани на графикону, изгледају потпуно другачије - једна равна линија, једна закривљена, један облак који је повукао један изузетак. Поука је јасна: збирни статистички подаци су погрешни, гледање графикона је обавезно. АИ вам може дати просеке и корелације, али веровање тим бројевима без гледања графикона пада у Анскомбову замку.
Табела у наставку резимира који графикон одговара којем питању:
Питање
одговарајућа графика
Шта показује
Дистрибуција једне варијабле
Хистограм / КДЕ
Облик, закривљеност, број врхова
Центар и изванредни
Бок плот
Медијана, квартили, одступници
Однос два броја
распршени графикон
Правац, снага, закривљеност
Поређење категорија
тракасти графикон
Разлика између група
мењају се током времена
линијски графикон
Тренд, сезоналност
Мултиваријантни однос
Корелациона топлотна карта
Матрица општег односа
Симпсонов парадокс: агрегирани подаци могу лагати
Подмукла замка у ЕДА коју треба бити свестан је Симпсонов парадокс: образац може показати један правац када се сви подаци испитују заједно, али обрнуто када су подаци подељени у смислене подгрупе. Класичан пример: чини се да је укупна стопа прихватања за кандидаткиње на универзитету нижа него за мушкарце; Али када се посматра одељење по одељење, стопа прихватања жена је већа од мушкараца у већини одељења. Одакле? Жене су се пријављивале на конкурентније (ниже стопе прихватања) одељења; Комбиновани број чува ову скривену променљиву. Поука је јасна: када гледате укупан или просек, обавезно проверите да ли тај број говори исту причу када се подели на значајне подгрупе (сегмент, период, канал). Када вам АИ да комбиновану стопу, питање „да ли још увек важи када је сегментирате“ ће рано ухватити већину обмањујућих резултата.
три мини кофера
Случај 1 — Два скривена брда. Један аналитичар је утврдио да је просечна старост купаца 41 година и пријавио га као „средовечну гомилу“. Али хистограм је показао два врха: старосне групе 22-28 и 55-62 године. Просек 41 заправо није представљао никога. Лекција: нацртајте дистрибуцију пре него што верујете средњој вредности.
Случај 2 — Лажна корелација. Један тим је открио корелацију од 0,78 између „потрошње на огласе“ и „продаје“ и удвостручио је буџет. Међутим, оно што је покренуло и једно и друго биле су сезонске кампање; током периода ван кампање, однос је пао на 0,10. Додатно оглашавање од 340 хиљада ТЛ није дало очекивани повраћај. Поука: погрешна корелација за узрочност је скупа.
Случај 3 — Линија коју је повукао усамљени противник. Анализа некретнина показала је јаку везу између квадратуре и цене (р=0,80). Када је нацртан дијаграм распршивања, скоро цео однос је креирала једна луксузна вила од 12 милиона ТЛ; Када је та тачка уклоњена, корелација је пала на 0,31. Лекција: увек читајте корелацију заједно са дијаграмом распршивања.
Четири шаблона за копирање
1) Аутоматски ЕДА резиме:
Имам панде дф. Напишите код који производи: (1) дф.инфо() и дф.десцрибе(), (2) хистограм за сваку нумеричку колону, (3) број за сваку категоричку колону. Немојте коментарисати, само генеришите код за откривање; тумачим обрасце.
2) Корелација + визуелна (уз напомену узрочности):
Напишите код који црта матрицу корелације и топлотну мапу за нумеричке колоне. Такође нацртајте дијаграм расејања 3 највиша корелирана пара. Додајте ред за коментар у излаз који вас подсећа да корелација не имплицира узрочност. Немојте износити узрочне тврдње.
3) Дијагноза дистрибуције:
За колону „инцоме_тл“: напишите код који производи хистограм, дијаграм оквира, вредност искривљености и поређење медијане/средње вредности. Ја ћу тумачити да ли је дистрибуција искривљена или не; само дај код.
4) Поређење сегмената:
Упоредите купце према „каналу“ (веб/мобилни): напишите код који производи оквир просечног износа, средњег износа, броја поруџбина и дистрибуције износа за сваки канал. Предложите који тест је прикладан за статистичку значајност разлике између два канала, али одлука је на мени.
Слаби промпт / Јаки промпт
Слабо обавештење:
Пронађите нешто занимљиво у овим подацима.
„Занимљиво“ је недефинисано; АИ не види податке, па их или измишља или даје опште изјаве. Нема смера, нема варијабли, нема сврхе.
Снажан упит:
Ваша улога: ЕДА асистент. дф колоне: аге (инт), приход_тл (флоат), град (категорија), канал (веб/мобилни), износ (флоат). Сврха: открити факторе који утичу на "количину". Задатак: (1) код за цртање дистрибуције износа, (2) графикони дистрибуције између износа и старости и прихода_тл, (3) оквирни дијаграм износа у рашчлањењу канала. Утврђивање узрочне тврдње; Само генеришите код за откривање и ја ћу протумачити образац.
Овде су јасни сврха, варијабле и граница "тврдње о узрочности".
Уобичајене грешке
- Ослањајући се искључиво на збирну статистику. Као што показује квартет Ансцомбе, иста средња вредност крије веома различите дистрибуције; види графикон.
- Погрешна корелација за узрочност. Ко-акција не указује да једно води ка другом; Чувајте се скривених варијабли.
- Гледајући корелацију без дијаграма расејања. Један изузетак или закривљеност доводи у заблуду број.
- Сумирање дистрибуције са два врха/искривљена средња вредност. Просек можда не представља никога.
- Прескакање ЕДА и прелазак право на модел. Непрепознати подаци значе слепи модел.
Савет: Са сваким новим скупом података, проведите првих 30 минута само цртајући графиконе: хистограм сваког нумеричког броја, дијаграм расејања значајних парова, тракасти графикон категорија. Ових 30 минута спречава будуће грешке у моделирању у данима који долазе.
Укратко
ЕДА је фаза упознавања података пре изградње модела и тражи одговоре на четири питања: дистрибуција, ширење центра, односи и аномалије. Сумарни статистички подаци могу бити погрешни; гледање графика је обавезно (Анскомб предавање). Корелација је моћно средство, али узрочност није и дефинитивно треба да се чита заједно са дијаграмом распршивања. АИ је одличан акцелератор за предлагање графике и писање кода; Али људи својим знањем на терену тумаче да ли је образац који виде стваран или случајност.
Задатак апликације
Изаберите скуп података и само урадите ЕДА: издвојите хистограм од најмање три нумеричке варијабле, дијаграм расејања два пара варијабли и корелационе топлотне карте. Пронађите најмање једно „изненађење“ (као што је дистрибуција са два врха, кандидат за лажну корелацију, однос привучен једним изузетком) и објасните га у једној реченици. Пишите без икаквих узрочно-последичних тврдњи.
контролна листа
- [ ] Да ли сам нацртао дистрибуцију сваке нумеричке променљиве?
- [ ] Да ли сам погледао корелације са дијаграмом расејања?
- [ ] Да ли сам држао узрочност и корелацију одвојено?
- [ ] Зар нисам приметио искривљене дистрибуције или расподеле са два врха и слепо веровао средњој вредности?
- [ ] Да ли сам извео барем један аспект/хипотезу моделирања из мојих налаза ЕДА?