единици
1. Въведение в изкуствения интелект в науката за данните и анализа: работен процес, роли, граници, валидиране и етика 2. Събиране на данни и разбиране на източника: схема, вземане на проби, качество и информираност за течове 3. Почистване и предварителна обработка на данни: Липсваща стойност, отклонение и преобразуване на типа 4. Проучвателен анализ на данни (EDA): Разпределения, връзки и първоначални прозрения 5. Инженеринг на функции: Генериране на варианти, кодиране, мащабиране и избягване на изтичане 6. Изграждане на модел: дефиниране на проблем, избор на алгоритъм и разделяне на обучение/тест 7. Оценка на модела: показатели, кръстосано валидиране и екстремно обучение 8. Визуализация и разказване на истории: точни графики, честни графики 9. Генериране на код: AI-подпомогнат анализ с Python (pandas) и SQL 10. Изтичане на данни и възпроизводимост: тихи бедствия и дисциплина 11. Фондация MLOps, етика, поверителност и отговорен анализ
единица 4 / 11

Проучвателен анализ на данни (EDA): Разпределения, връзки и първоначални прозрения

Печалби:

  • Способност за изследване на разпределението, центъра, разпространението и аномалиите на променливите с подходящи графики (хистограма, квадратна диаграма, точкова диаграма).
  • Способност за правилно интерпретиране на корелацията и четенето й заедно с диаграмата на разсейване, без да се бърка с причинно-следствената връзка
  • Способност да се разбере, че обобщената статистика може да бъде подвеждаща (урок по Anscombe) и да се разработят хипотези, които определят посоката на моделиране.

Преди да изградите модел, е необходимо да знаете данните. Точно както лекарят не предписва лекарства, без да прегледа пациента, специалистът по данни не изгражда модел, без да „изследва“ данните. Този преглед се нарича проучвателен анализ на данни (накратко EDA): това е фазата на откриване на разпределението, връзките, изненадите и капаните на данните визуално и графично. Целта на EDA е да генерира хипотези, да улавя грешки и да определя посоката на моделиране. Изкуственият интелект е много мощен помощник на този етап: той предлага коя диаграма е подходяща, пише нейния код, интерпретира разпределение. Но човек решава, със своите полеви познания, дали моделът, който вижда, е реален или е случайност.

Какво търси EDA?

EDA търси отговори на четири въпроса. Разпределение: Как се разпределя всяка променлива – симетрично ли е, изкривено или с два пика? Централна тенденция и разпространение: Какви са средната стойност, медианата, стандартното отклонение? Връзки: Как променливите са свързани една с друга? Аномалии: Има ли неочаквани стойности, пропуски, групи? Тези четири въпроса определят коя функция ще работи и кой модел е подходящ.

Нека дефинираме някои основни понятия. Хистограмата е графика, която разделя стойностите на числова променлива на интервали и показва колко наблюдения има във всеки интервал; Това е най-бързият начин да видите разпределението. Изкривеността е изместване на разпределението в една посока; Променливи като доход са изкривени надясно (повечето са ниски, малко са много високи). Кутия графика показва медианата, квартилите и отклоненията с един поглед. Точкова диаграма показва връзката на две числени променливи с облак от точки.

Съотношение: има връзка, но бъдете внимателни

Корелация — мярка за това как две променливи се движат заедно; число между -1 и +1 — е най-използваният и най-неразбран инструмент на EDA. +1 означава перфектно съувеличение, -1 означава перфектна обратна връзка, 0 означава липса на линейна връзка. Има два големи капана. Първо, известното правило: корелацията не е причинно-следствена връзка. Случаите на задавяне се увеличават с продажбите на сладолед; не защото едното води до другото, а защото лятото (скритата трета променлива) задейства и двете. Второ, корелацията измерва само линейната зависимост; Може да показва силна, но криволинейна връзка, близка до 0. Така че, когато разглеждате корелацията, не забравяйте да погледнете и диаграмата на разсейване.

Внимание: Когато изкуственият интелект даде число на корелация, той може да премине към причинно-следствен език като „А увеличава Б“. Това е опасно. Корелацията само показва движение заедно; Само опитът, познаването на областта и внимателното заключение установяват причината.

Квартет Anscombe: защо просто не погледнете номера

В статистиката има известен пример: квартетът Anscombe. Четири различни набора от данни имат почти една и съща средна стойност, същата дисперсия и същата корелация (0,82); Но когато са изобразени на графика, те изглеждат напълно различно - една права линия, една извита, едната е облак, теглен от един-единствен отклонение. Урокът е ясен: обобщената статистика е подвеждаща, гледането на графиката е задължително. AI може да ви даде средни стойности и корелации, но да се доверите на тези числа, без да видите графиката, попадате в капана на Anscombe.

Таблицата по-долу обобщава коя диаграма отговаря на кой въпрос:

Въпрос

подходяща графика

Какво показва

Разпределение на една променлива

Хистограма / KDE

Форма, наклон, брой върхове

Център и крайни части

Бокс парцел

Медиана, квартили, отклонения

Връзка на две числа

точкова диаграма

Посока, сила, кривина

Сравнение на категории

стълбовидна диаграма

Разлика между групите

променят се във времето

линейна диаграма

Тенденция, сезонност

Многовариантна връзка

Корелационна топлинна карта

Обща матрица на отношенията

Парадоксът на Симпсън: обобщените данни могат да лъжат

Подъл капан в EDA, за който трябва да знаете, е парадоксът на Симпсън: моделът може да показва една посока, когато всички данни се изследват заедно, но обратното, когато данните са разделени на значими подгрупи. Класически пример: общият процент на прием за кандидат-жени в университет изглежда по-нисък, отколкото за мъже; Но когато се разглежда отдел по отдел, степента на приемане на жените е по-висока от тази на мъжете в повечето отдели. откъде? Жените са кандидатствали в по-конкурентни (по-ниски нива на приемане) отдели; Комбинираното число съхранява тази скрита променлива. Урокът е ясен: когато разглеждате общо или средно, не забравяйте да проверите дали това число разказва същата история, когато е разделено на значими подгрупи (сегмент, период, канал). Когато изкуственият интелект ви даде комбиниран процент, въпросът „все още ли е валиден, когато го сегментирате“ ще улови повечето подвеждащи резултати в началото.

три мини калъфа

Случай 1 — Два скрити хълма. Един анализатор установи, че средната възраст на клиента е 41 години и го отчете като „тълпа на средна възраст“. Но хистограмата показва два пика: възрастовите групи 22-28 и 55-62. Средните 41 всъщност не представляват никого. Урок: начертайте разпределението, преди да се доверите на средната стойност.

Случай 2 — Фалшива корелация. Един екип откри корелация 0,78 между „разходи за реклама“ и „продажби“ и удвои бюджета. Но това, което предизвика и двете, бяха сезонни кампании; по време на периода извън кампанията връзката спадна до 0,10. 340 хиляди TL допълнителна реклама не донесоха очакваната възвръщаемост. Поука: грешката на корелацията с причинно-следствената връзка е скъпа.

Случай 3 — Линията, начертана от самотния противоположник. Анализ на недвижими имоти показа силна връзка между квадратни кадри и цена (r=0,80). Когато беше начертана диаграмата, почти цялата връзка беше създадена от една луксозна вила за 12 милиона TL; Когато тази точка беше премахната, корелацията спадна до 0,31. Урок: винаги четете корелацията заедно с диаграмата на разсейване.

Четири копируеми шаблона

1) Автоматично резюме на EDA:

Имам панди df. Напишете код, който произвежда: (1) df.info() и df.describe(), (2) хистограма за всяка цифрова колона, (3) брой за всяка категориална колона. Не коментирайте, просто генерирайте кода за откриване; Тълкувам моделите.

2) Корелация + визуално (с уговорката за причинно-следствената връзка):

Напишете код, който чертае корелационна матрица и топлинна карта за цифровите колони. Също така начертайте диаграма на разсейване на 3-те най-високо корелирани двойки. Добавете ред за коментар към изхода, който ви напомня, че корелацията не предполага причинно-следствена връзка. Не правете причинно-следствени твърдения.

3) Диагноза на разпространението:

За колоната "income_tl": напишете код, който произвежда хистограма, квадратна диаграма, стойност на изкривяване и сравнение на медиана/средно. Ще тълкувам дали разпределението е изкривено или не; просто дайте кода.

4) Сравнение на сегменти:

Сравнете клиентите по „канал“ (уеб/мобилен): напишете код, който създава графика на средната сума, средната сума, броя на поръчките и разпределението на сумата за всеки канал. Предложете кой тест е подходящ за статистическа значимост на разликата между двата канала, но решението зависи от мен.

Слаба подкана / Силна подкана

Слаба подкана:

Намерете нещо интересно в тези данни.

„Интересно“ не е дефинирано; AI не вижда данните, така че или ги измисля, или прави общи изявления. Няма посока, няма променливи, няма цел.

Мощна подкана:

Вашата роля: EDA асистент. df колони: възраст (int), earn_tl (float), град (категория), канал (web/mobile), сума (float). Цел: да се открият факторите, влияещи върху "сумата". Задача: (1) код, изобразяващ разпределението на сумата, (2) графики на разпределение между сума и възраст и earno_tl, (3) графична графика на сумата в разбивка на канала. Установяване на каузален иск; Просто генерирайте кода за откриване и аз ще интерпретирам модела.

Тук целта, променливите и границата на „претенцията за причинно-следствена връзка“ са ясни.

Често срещани грешки

  • Разчитайки само на обобщена статистика. Както показва квартетът Anscombe, една и съща средна стойност крие много различни разпределения; виж графиката.
  • Грешна корелация за причинно-следствена връзка. Съвместното действие не означава, че едното води до другото; Пазете се от скрити променливи.
  • Разглеждане на корелация без диаграма на разсейване. Едно отклонение или криволинейност подвежда числото.
  • Обобщаване на двувърхово/изкривено разпределение със средната стойност. Средната стойност може да не представлява никого.
  • Пропускане на EDA и преминаване направо към модела. Неразпознатите данни означават сляп модел.
Съвет: С всеки нов набор от данни прекарайте първите 30 минути само в чертане на графики: хистограма на всяко число, точкова диаграма на значими двойки, стълбовидна диаграма на категории. Тези 30 минути предотвратяват бъдещи грешки при моделирането за дни напред.

В обобщение

EDA е фазата на запознаване с данните преди изграждането на модел и търси отговори на четири въпроса: разпределение, централно разпространение, връзки и аномалии. Обобщената статистика може да бъде подвеждаща; гледането на графиката е задължително (лекция на Anscombe). Корелацията е мощен инструмент, но причинно-следствената връзка не е и определено трябва да се чете заедно с диаграмата на разсейване. AI е чудесен ускорител за предлагане на графики и писане на код; Но хората интерпретират със своите полеви познания дали моделът, който виждат, е реален или е съвпадение.

Задача за приложение

Изберете набор от данни и просто направете EDA: извлечете хистограма от поне три числови променливи, диаграма на разсейване на две двойки променливи и корелационна топлинна карта. Намерете поне една „изненада“ (като разпределение с два пика, кандидат за фалшива корелация, връзка, привлечена от единично отклонение) и го обяснете с едно изречение. Пишете, без да правите причинно-следствени твърдения.

контролен списък

  • [ ] Направил ли съм графика на разпределението на всяка числена променлива?
  • [ ] Погледнах ли корелациите с диаграмата на разсейване?
  • [ ] Разделил ли съм причинно-следствената връзка и корелацията?
  • [ ] Не забелязах ли изкривени или двупикови разпределения и не се доверих сляпо на средната стойност?
  • [ ] Извлякъл ли съм поне един аспект/хипотеза на моделиране от моите открития на EDA?