одиниці
1. Вступ до штучного інтелекту в науці про дані та аналітиці: робочий процес, ролі, межі, перевірка та етика 2. Збір даних і розуміння джерела: схема, вибірка, якість і усвідомлення витоків 3. Очищення та попередня обробка даних: відсутнє значення, перетворення викидів і типів 4. Дослідницький аналіз даних (EDA): розподіли, взаємозв’язки та початкове розуміння 5. Розробка функцій: генерація варіантів, кодування, масштабування та уникнення витоку 6. Побудова моделі: визначення проблеми, вибір алгоритму та розділення на навчання/тест 7. Оцінка моделі: показники, перехресна перевірка та екстремальне навчання 8. Візуалізація та оповідання: точна графіка, чесна графіка 9. Генерація коду: аналіз за допомогою ШІ за допомогою Python (pandas) і SQL 10. Витік даних і відтворюваність: тихі катастрофи та дисципліна 11. MLOps Foundation, етика, конфіденційність і відповідальна аналітика
одиниця 4 / 11

Дослідницький аналіз даних (EDA): розподіли, взаємозв’язки та початкове розуміння

Прибуток:

  • Здатність досліджувати розподіл, центр, розкид і аномалії змінних за допомогою відповідних графіків (гістограма, коробчаста діаграма, діаграма розсіювання).
  • Здатність правильно інтерпретувати кореляцію та читати її разом із діаграмою розсіювання, не плутаючи її з причинністю
  • Уміння розуміти, що зведена статистика може вводити в оману (урок Anscombe) і розробляти гіпотези, які визначають напрямок моделювання.

Перш ніж будувати модель, необхідно знати дані. Подібно до того, як лікар не призначає ліки, не обстеживши пацієнта, фахівець із обробки даних не будує модель, не «вивчивши» дані. Це обстеження називається пошуковим аналізом даних (скорочено EDA): це фаза виявлення розподілу, зв’язків, сюрпризів і пасток даних візуально та графічно. Метою EDA є створення гіпотез, виявлення помилок і визначення напрямку моделювання. Штучний інтелект на цьому етапі дуже потужний помічник: він підказує, яка діаграма підходить, пише її код, інтерпретує розподіл. Але людина вирішує, володіючи своїми знаннями, чи є візерунок, який він бачить, реальним чи збігом.

Що шукає EDA?

EDA шукає відповіді на чотири питання. Розподіл: як розподіляється кожна змінна — симетрично, з перекосом чи з двома піками? Центральна тенденція та поширення: що таке середнє, медіана, стандартне відхилення? Зв’язки: як змінні пов’язані між собою? Аномалії: чи є неочікувані значення, прогалини, групування? Ці чотири запитання визначають, яка функція працюватиме та яка модель підходить.

Давайте визначимо основні поняття. Гістограма - це графік, який ділить значення числової змінної на інтервали та показує, скільки спостережень міститься в кожному інтервалі; Це найшвидший спосіб побачити розподіл. Асиметрія — зміщення розподілу в одному напрямку; Такі змінні, як дохід, зміщені вправо (більшість низька, небагато дуже висока). Коробчатий графік миттєво показує медіану, квартилі та викиди. Точкова діаграма показує зв’язок двох числових змінних із хмарою точок.

Співвідношення: взаємозв’язок є, але будьте обережні

Кореляція — міра того, як дві змінні рухаються разом; число від -1 до +1 — це найбільш використовуваний і найбільш неправильно зрозумілий інструмент EDA. +1 означає ідеальне співзбільшення, -1 означає ідеальне обернене співвідношення, 0 означає відсутність лінійного співвідношення. Є дві великі пастки. По-перше, знамените правило: кореляція не є причинно-наслідковим зв’язком. Випадки задухи збільшуються з продажем морозива; не тому, що одне веде до іншого, а тому, що літо (прихована третя змінна) запускає обидва. По-друге, кореляція вимірює лише лінійний зв’язок; Це може вказувати на сильний, але криволінійний зв’язок, близький до 0. Тому, дивлячись на кореляцію, обов’язково подивіться також на діаграму розсіювання.

Застереження: коли штучний інтелект дає число кореляції, воно може перейти до причинно-наслідкової мови, як-от «A збільшує B». Це небезпечно. Кореляція вказує лише на рух разом; Лише досвід, знання галузі та ретельний висновок визначають причину.

Квартет Anscombe: чому б просто не подивитися на номер

У статистиці є відомий приклад: квартет Анскомб. Чотири різні набори даних мають майже однакове середнє значення, однакову дисперсію та однакову кореляцію (0,82); Але на графіку вони виглядають зовсім по-різному — одна пряма лінія, одна вигнута, одна — хмара, яку тягне один викид. Урок зрозумілий: зведені статистичні дані вводять в оману, дивитися на графік необхідно. ШІ може дати вам середні значення та кореляції, але довіряти цим цифрам, не бачачи графіка, означає потрапляти в пастку Анскомба.

Таблиця нижче підсумовує, яка діаграма відповідає якому питанню:

Питання

відповідна графіка

Що показує

Розподіл однієї змінної

Гістограма / KDE

Форма, косоподібність, кількість вершин

Центр і викиди

Коробка сюжету

Медіана, квартилі, викиди

Зв'язок двох чисел

точкова діаграма

Напрямок, сила, кривизна

Порівняння категорій

стовпчаста діаграма

Різниця між групами

змінюватися з часом

лінійна діаграма

Тренд, сезонність

Багатоваріантний зв'язок

Кореляційна теплова карта

Загальна матриця зв'язків

Парадокс Сімпсона: сукупні дані можуть брехати

Прихована пастка в EDA, про яку слід пам’ятати, — це парадокс Сімпсона: шаблон може показувати один напрямок, коли всі дані досліджуються разом, але навпаки, коли дані розділені на значущі підгрупи. Класичний приклад: загальний рівень прийняття жінок-абітурієнтів до університету виявляється нижчим, ніж чоловіків; Але якщо поглянути на відділ за відділом, то в більшості відділів рівень прийому жінок вищий, ніж чоловіків. Звідки? Жінки подали документи на більш конкурентоспроможні (нижчі показники прийому) відділення; Комбіноване число зберігає цю приховану змінну. Урок зрозумілий: дивлячись на загальну чи середню суму, обов’язково перевірте, чи ця цифра розповідає ту саму історію, якщо її розбити на значущі підгрупи (сегмент, період, канал). Коли штучний інтелект дає вам об’єднану оцінку, запитання «чи вона все ще дійсна, коли ви її сегментуєте», дозволить на ранній стадії виявити більшість оманливих результатів.

три міні-чохла

Випадок 1 — Два прихованих пагорба. Один аналітик виявив, що середній вік клієнта становить 41 рік і назвав його «натовпом середнього віку». Але гістограма показала два піки: вікові групи 22-28 і 55-62 роки. Середній показник 41 фактично нікого не представляв. Урок: побудуйте графік розподілу, перш ніж довіряти середньому значенню.

Випадок 2 — Хибна кореляція. Одна команда виявила кореляцію 0,78 між «витратами на рекламу» та «продажами» та подвоїла бюджет. Однак причиною обох були сезонні кампанії; у період поза кампанією співвідношення впало до 0,10. 340 тисяч TL додаткової реклами не принесли очікуваного прибутку. Урок: плутати кореляцію з причинно-наслідковим зв’язком дорого.

Випадок 3 — Лінія, проведена самотнім протилежним. Аналіз нерухомості показав сильний зв’язок між квадратними метрами та ціною (r=0,80). Коли була проведена точкова діаграма, майже весь зв’язок був створений однією розкішною віллою вартістю 12 мільйонів TL; Коли цю точку було видалено, кореляція впала до 0,31. Урок: завжди читайте кореляцію разом із діаграмою розсіювання.

Чотири шаблони, які можна копіювати

1) Автоматичний підсумок EDA:

У мене є панди df. Напишіть код, який створює: (1) df.info() і df.describe(), (2) гістограму для кожного числового стовпця, (3) кількість для кожного категорійного стовпця. Не коментуйте, просто згенеруйте код відкриття; Інтерпретую візерунки.

2) Кореляція + візуальний (із застереженням про причинність):

Напишіть код, який малює кореляційну матрицю та теплову карту для числових стовпців. Також намалюйте діаграму розсіювання 3 найбільш корельованих пар. Додайте рядок коментаря до вихідних даних із нагадуванням про те, що кореляція не передбачає причинно-наслідкового зв’язку. Не робіть причинно-наслідкових претензій.

3) Діагностика розподілу:

Для стовпця "income_tl": напишіть код, який створюватиме гістограму, коробковий графік, значення асиметрії та порівняння медіани/середнього. Я буду тлумачити, чи спотворений розподіл чи ні; просто дайте код.

4) Порівняння сегментів:

Порівняйте клієнтів за «каналом» (веб/мобільний): напишіть код, який створює коробкову діаграму середньої суми, медіанної суми, кількості замовлень і розподілу суми для кожного каналу. Запропонуйте, який тест підходить для статистичної значущості різниці між двома каналами, але рішення за мною.

Слабка підказка / Сильна підказка

Слабка підказка:

Знайдіть у цих даних щось цікаве.

«Цікаво» не визначено; ШІ не бачить даних, тому він або створює їх, або робить загальні заяви. Немає ні напрямку, ні змінних, ні мети.

Потужна підказка:

Ваша роль: асистент EDA. Стовпці df: age (int), earning_tl (float), city (category), channel (web/mobile), сума (float). Мета: виявити фактори, що впливають на «суму». Завдання: (1) побудувати графік розподілу суми в коді, (2) графіки розподілу між сумою, віком і прибутком_tl, (3) діаграму коробки суми в розподілі каналів. Встановлення причинного позову; Просто згенеруйте код відкриття, і я інтерпретую шаблон.

Тут мета, змінні та межа «твердження про причинність» зрозумілі.

Поширені помилки

  • Покладаючись виключно на підсумкову статистику. Як показує квартет Anscombe, те саме середнє значення приховує дуже різні розподіли; дивіться діаграму.
  • Помилково приймаючи кореляцію за причинно-наслідковий зв’язок. Співпраця не означає, що одне веде до іншого; Остерігайтеся прихованих змінних.
  • Дивлячись на кореляцію без діаграми розсіювання. Один викид або криволінійність вводить число в оману.
  • Підведення підсумків двопікового/скошеного розподілу із середнім значенням. Середнє значення може не представляти нікого.
  • Пропускаємо EDA та переходимо безпосередньо до моделі. Нерозпізнані дані означають сліпу модель.
Порада: з кожним новим набором даних приділяйте перші 30 хвилин лише малюванню графіків: гістограми кожного числа, діаграми розсіювання значущих пар, стовпчастої діаграми категорій. Ці 30 хвилин запобігають майбутнім помилкам моделювання на кілька днів.

Підсумовуючи

EDA — це етап ознайомлення з даними перед побудовою моделі та пошук відповідей на чотири запитання: розподіл, центральне поширення, взаємозв’язки та аномалії. Зведена статистика може вводити в оману; дивитися на графік є обов’язковим (лекція Anscombe). Кореляція є потужним інструментом, але причинно-наслідковий зв’язок не є таким, і його обов’язково слід розглядати в поєднанні з діаграмою розсіювання. AI є чудовим прискорювачем для пропонування графіки та написання коду; Але люди інтерпретують свої знання про те, чи є візерунок, який вони бачать, реальним чи збігом.

Аплікаційне завдання

Виберіть набір даних і просто виконайте EDA: витягніть гістограму принаймні трьох числових змінних, діаграму розсіювання двох пар змінних і кореляційну теплову карту. Знайдіть принаймні один «сюрприз» (наприклад, розподіл із двома піками, кандидат на помилкову кореляцію, взаємозв’язок, притягнутий одним викидом) і поясніть це одним реченням. Пишіть без будь-яких причинно-наслідкових тверджень.

контрольний список

  • [ ] Чи я склав графік розподілу кожної числової змінної?
  • [ ] Чи дивився я на кореляції з діаграмою розсіювання?
  • [ ] Чи розділив я причинність і кореляцію?
  • [ ] Хіба я не помічав спотворені або двопікові розподіли і сліпо довіряв середньому?
  • [ ] Чи вивів я принаймні один аспект моделювання/гіпотезу з моїх висновків EDA?