Печалби:
- Възможност за създаване на описателна статистика и диаграми на разпределение/взаимоотношения с поддръжка на изкуствен интелект и избор на правилния тип диаграма според данните и въпроса
- Способност за разпознаване на подвеждащи избори (пунктирана ос, неподходящ мащаб, прекомерно изглаждане) в изображения, създадени от изкуствен интелект, и прилагане на честни принципи на визуализация
- Да можеш да разграничиш, че проучвателният анализ е за генериране на хипотези и капана да правиш открития и потвърждения с едни и същи данни (което отваря вратата за p-хакване).
След почистване на данните, първата работа на емпиричния изследовател е да ги опознае. Този етап се нарича проучвателен анализ на данни (EDA - Exploratory Data Analysis): това е процес на изследване на данните с графики и обобщена статистика и виждане на тяхната структура, модели и изненади. Целта все още не е да тествате хипотеза, а да се запознаете с данните, да генерирате въпроси и да поставите основите на модела, който ще изградите в бъдеще. В тази част ще видим как изкуственият интелект (AI) ускорява EDA и визуализацията, но защо графиките, които произвежда, трябва да бъдат внимателно одитирани.
Нека първо направим две основни разграничения. Първо, описателната статистика (числа, които обобщават данни като средно, медиана, стандартно отклонение, квартили) и визуализацията (показваща една и съща информация графично) се допълват взаимно; Заедно те описват данните. Второ, и най-критично: откриването и потвърждението трябва да се разграничават. Проучвателният анализ е за генериране на хипотези; Проучването на хипотезата със същите данни и казването „тествах го и го намерих за значимо“ отваря вратата към p-хакването, което ще видим в следващата част. Безплатно е да разгледате данните и да видите модел; Но обявяването на този модел за „доказано откритие“ в същите данни е подвеждащо.
Проучвателен анализ стъпка по стъпка
1. Едновариантен изглед. Разгледайте всяка променлива поотделно: дали нейното разпределение е симетрично или изкривено; колко хълмове има; Къде са отклоненията? За числени променливи, хистограма (диаграма, показваща честотата чрез разделяне на стойностите на диапазони) и boxplot (boxplot — диаграма, показваща медиана, квартил и екстремни стойности); За категориални променливи използвайте честотни таблици и стълбовидни диаграми.
2. Двумерен изглед. Вижте връзката между две променливи: диаграма на разсейване за две числени променливи (показва всяко наблюдение като точка в равнината x-y), групирана диаграма в кутия за числово-категориална, кръстосана таблица за две категориални. Преди да разгледате коефициента на корелация, не забравяйте да погледнете диаграмата на разсейване: една и съща корелация може да показва много различни модели (известният квартет Anscombe демонстрира това; четири набора от данни имат почти идентични статистики, но когато се начертаят, те се оказват напълно различни).
3. Изберете правилния тип диаграма. Типът диаграма зависи от вашия въпрос и тип данни. Хистограма за разпределение; разпръскване за връзка; линейна диаграма за промяна във времето; лентова диаграма за сравнение на категории; (внимателно) подредена лента за съотношението на частите към цялото. AI бързо генерира код вместо вас, но решението „коя графика за кой въпрос“ е ваше.
4. Обърнете внимание на модела, не декларирайте резултати. Запишете всеки интересен модел, който видите, като „бележка за откритие“, но не го считайте за потвърдено откритие. Потвърждението се извършва в отделна стъпка, за предпочитане с отделни данни или предварително определен график.
Честни принципи на визуализация
Графиката убеждава; Следователно неговата подвеждаща сила също е висока. AI може да направи естетически, но понякога подвеждащи избори. Проверете тези правила:
- В стълбовидни диаграми оста y трябва да започва от нула. Прекъснатата ос показва малки разлики като големи.
- Мащабът трябва да е последователен. Ако се сравняват две диаграми, използвайте същия диапазон на осите.
- Прекомерното изглаждане може да скрие истинския модел. Линията на тенденция изглежда добре, но ако „изглажда“ данните твърде много, може да бъде подвеждаща.
- Цветът и 3D декорацията изкривяват вниманието, а не данните. Изберете простотата.
- Липсващите данни и размерът на извадката трябва да са видими. „n=12“ и „n=12 000“ не трябва да изглеждат еднакво.
Внимание: Само защото графиките, произведени от AI, са красиви, те не са верни. Най-честата грешка, която прави, е, че не започва оста от нула в стълбовата диаграма и преувеличава разликата между двете групи. Винаги проверявайте оста.
Сравнителна таблица: въпрос → диаграма
Попитайте
правилна диаграма
Често срещана грешка
Как се разпределя тази променлива?
Хистограма/кутийка
използвайте кръгова диаграма
Свързани ли са две числови променливи?
Точкова диаграма
Просто гледам броя на корелациите
Как се промени с времето?
линейна диаграма
Разказване на тенденция със стълбовидна диаграма
Каква е разликата между групите?
Групирана кутия/лента (от нулата)
Пръчка с пресечена ос
Съотношение част-цяло?
Подредена лента (с повишено внимание)
Многослойна кръгова диаграма
Четири подкани за копиране
1. Код за автоматично откриване:
Вашата роля: EDA асистент. Не споделям данните, искам кода R (ggplot2). Има числени (доходи, възраст, разходи) и категорични (регион, образование) променливи в data.frame „данни“. Задача: напишете код, който произвежда хистограма за всяко число, стълбовидна диаграма за всяка категория и диаграма на разсейване за доход~възраст. В стълбовидни диаграми нека оста y да започва от НУЛА. Добавете ред за коментар.
2. Преглед на корелацията (корелация + визуално заедно):
Напишете код, който едновременно изчислява корелацията на Pearson за приходите и разходите и начертава точкова диаграма + линейна тенденция. Добавете ред за коментар, напомнящ ми да прегледам диаграмата, преди да СЕ ДОВЕРИМ на броя на корелациите (предупреждение от Anscombe). Не изглаждайте прекалено линията на тренда.
3. Одит на почтеността:
Проверете следния код на ggplot за честна визуализация: [код]. Проверете и коригирайте следното: у-оста започва ли от нула, постоянен ли е мащабът, видим ли е размерът на извадката, има ли прекомерно изглаждане? Обяснете обосновката за всяка корекция, която сте направили.
4. Изготвяне на бележка за откритие (не откритие):
Въз основа на графиките, които създавам, избройте НАБЛЮДЕНИЯТА като „бележка за откритие“; напишете всеки елемент на езика на „хипотеза за проверка“, а не на „окончателна констатация“. Пример: „Доходите във висшето образование ИЗГЛЕЖДАТ по-разпръснати; трябва да се тества с отделни данни.' Избягвайте причинно-следствени и окончателни твърдения.
Слаба подкана / Силна подкана
Слаба подкана:
Направете хубави графики от доходността и ми кажете какво означават.
Тази подкана подканва към подвеждащ резултат: „красиво“ се фокусира върху естетиката, докато „какво означава“ подтиква AI да скочи от откритието до окончателното заключение. Следват причинно-следствени, преувеличени коментари.
Мощна подкана:
Вашата роля: честен асистент на EDA. Задача: (1) изберете типа диаграма, която отговаря на въпроса ми, и напишете обосновката, (2) започнете оста от нула в стълбовидни диаграми, (3) интерпретирайте изхода на езика DISCOVERY NOTE: няма окончателно/причинно твърдение, предлагайте хипотеза на езика „трябва да се тества“, (4) предупредете ме, ако извадката е малка (n<30). Ще стартирам диаграмата в собствената си среда и ще проверя то.
Разлика: силната воля оправдава типа карта, налага правила за честност и не бърка откритието с потвърждението.
три мини калъфа
Случай 1 — Преувеличение на дискретната ос. Анализатор показа резултатите за удовлетвореност на два клона (7,8 и 8,0; от 10) в стълбовидна диаграма. При започване на оста YZ от 7,5, вторият клон изглежда почти два пъти по-висок от първия; докато разликата е само 2,5%. Ръководството се канеше да награди клон под погрешно впечатление. Когато започнах оста от нулата, разликата беше почти невидима. Урок: изборът на оста сам по себе си променя възприятието.
Случай 2 — Доверяване на корелацията и пропускане на диаграмата. Изследовател видя r = 0,81 между две променливи и написа „силна линейна връзка“. Когато неговият консултант поиска диаграмата на разсейване, се видя, че връзката всъщност се дължи на едно екстремно наблюдение и когато тази точка беше премахната, корелацията спадна до 0,12. Урок: броят на корелациите не е заместител на графика; винаги гледайте скатера.
Случай 3 — Объркващо откритие с потвърждение. Един студент разгледа всички корелации по двойки в набор от данни от 40 променливи, избра най-високата (r=0,52) и написа: „открихме значителна връзка между образованието и спестяванията (p=0,004).“ Въпреки това имаше стотици двойки в 40 променливи; изборът на най-високата беше грешна констатация поради случайност. Урок: откритият модел не може да бъде „тестван и обявен за значим“ в същите данни; Изисква се отделно потвърждение.
Често срещани грешки
- Оста не започва от нула в лентовата диаграма. Преувеличава малката разлика; Най-обикновената визуална лъжа. Винаги проверявайте.
- Гледайки корелацията и пропускайки диаграмата. Една и съща корелация идва от много различни модели; може да пасне на извънредна връзка. Първо, разпръскване.
- Като се има предвид моделът, открит в откритието, като „доказателство“ в същите данни. Това е вратата към p-хакерството; Потвърждението се извършва отделно.
- Грешен тип диаграма. Съвпадения като лента за тенденция и пай за разпределение са подвеждащи. Изберете жанр въз основа на въпроса.
- Скриване на размера на извадката. n=8 и n=8 000 не трябва да изглеждат еднакво на една и съща графика; трябва да се покаже несигурност.
Съвет: Преди да публикувате диаграма, запитайте се: „Ще се промени ли историята, ако променя оста?“ Ако отговорът е да, вероятно сте започнали пивота от нечестно място.
В обобщение
Проучвателният анализ на данни е фазата на среща с данните, виждане на модели и генериране на хипотези; Не е потвърждение. AI бързо генерира описателна статистика и графичен код, но вие избирате типа на графиката въз основа на вашия въпрос и контролирате принципите на справедливост (нулева ос, последователен мащаб, очевидна несигурност). Погледнете разсейването, преди да се доверите на корелационното число; Не декларирайте модела, който сте открили при откриването, като „доказателство“ в същите данни. Красивата графика на AI не означава правилна графика.
Задача за приложение
Изберете поне три променливи в набор от данни. Помолете изкуствения интелект за и изпълнете код, който създава проучвателни графики (хистограма, разпръснати, поставени в кутия) с подкана, която налага правилата за честност. За всяка диаграма: проверете (1) съответствието на типа на диаграмата с въпроса, (2) честността на оста, (3) видимостта на размера на извадката. Напишете поне една „бележка за откритие“ на езика на хипотезата („…изглежда, че се тества отделно“). Проучете корелация както с броя, така и с разсейването и докладвайте, ако има несъответствие между тях.
контролен списък
- [ ] Избрах типа диаграма въз основа на моя въпрос и тип данни.
- [ ] В стълбовидни диаграми започвам у-оста от нула; Проверих честността на оста.
- [ ] Погледнах диаграмата на разсейване, преди да се доверя на корелацията.
- [ ] Отразих размера на извадката и несигурността върху графиката.
- [ ] Написах моделите, които открих в изследването, като „хипотеза за проверка“, а не като „доказателство“.
- [ ] Отбелязах, че няма да използвам същите данни за потвърждение и че е необходима отделна стъпка.