одиниці
1. Штучний інтелект в економетриці та статистиці: ролі, межі, автентифікація та конфіденційність 2. Очищення та підготовка даних: відсутні дані, викиди та кодування 3. Дослідницький аналіз і візуалізація даних: побудова графіків та інтерпретація за допомогою штучного інтелекту 4. Лінійна регресія: побудова моделі, інтерпретація коефіцієнтів та припущення 5. Регресійна діагностика та порушення: колінеарність, гетероскедастичність, автокореляція 6. Перевірка гіпотези та p-value: значимість, сила та численні порівняння 7. p-hacking, HARKing і статистична цілісність: підводні камені в епоху штучного інтелекту 8. Аналіз часових рядів: стаціонарність, ARIMA та прогнозування 9. Причинно-наслідковий зв'язок і аналіз політики: DiD, IV, RDD і штучний інтелект 10. Генерація коду та відтворюваність: R/Python, керування версіями та відтворюваність 11. Написання звітів, комунікація та етика: представлення результатів і повідомлення про межі
одиниця 3 / 11

Дослідницький аналіз і візуалізація даних: побудова графіків та інтерпретація за допомогою штучного інтелекту

Прибуток:

  • Можливість створювати описову статистику та діаграми розподілу/зв’язків із підтримкою штучного інтелекту та вибирати правильний тип діаграми відповідно до даних і питань
  • Здатність розпізнавати оманливі варіанти (пунктирна вісь, невідповідний масштаб, надмірне згладжування) на зображеннях, створених штучним інтелектом, і застосовувати принципи чесної візуалізації
  • Можливість розрізнити, що дослідницький аналіз призначений для генерування гіпотез і пастки відкриття та підтвердження за допомогою тих самих даних (що відкриває двері для p-хакінгу).

Після очищення даних першим завданням емпіричного дослідника є ознайомлення з ними. Цей етап називається пошуковим аналізом даних (EDA - Exploratory Data Analysis): це процес вивчення даних за допомогою графіків і підсумкових статистичних даних і визначення їх структури, закономірностей і несподіванок. Мета полягає не в тому, щоб перевірити гіпотезу, а в тому, щоб ознайомитися з даними, створити запитання та закласти основу для моделі, яку ви будуватимете в майбутньому. У цьому розділі ми побачимо, як штучний інтелект (AI) прискорює EDA та візуалізацію, але чому графіку, яку він створює, потрібно ретельно перевіряти.

Давайте спочатку зробимо дві основні відмінності. По-перше, описова статистика (числа, які підсумовують такі дані, як середнє значення, медіана, стандартне відхилення, квартилі) та візуалізація (показ тієї самої інформації графічно) доповнюють одна одну; Разом вони описують дані. По-друге, і найважливіше: слід розрізняти відкриття та підтвердження. Дослідницький аналіз призначений для створення гіпотез; Дослідження гіпотези з тими самими даними та вислів «Я її перевірив і знайшов її значущу» відкриває двері для p-хакінгу, який ми побачимо в наступному розділі. Ви можете безкоштовно дивитися на дані та бачити шаблон; Але оголошення цієї закономірності «перевіреною знахідкою» в тих самих даних вводить в оману.

Покроковий пошуковий аналіз

1. Однофакторний погляд. Перевірте кожну змінну окремо: чи є її розподіл симетричним чи перекошеним; скільки там пагорбів; Де викиди? Для числових змінних гістограма (діаграма, що показує частоту шляхом поділу значень на діапазони) і boxplot (коробкова діаграма — діаграма, що показує медіану, квартиль і екстремальні значення); Для категоріальних змінних використовуйте частотні таблиці та стовпчасті діаграми.

2. Двоваріантний погляд. Перегляньте взаємозв’язок між двома змінними: точкова діаграма для двох числових змінних (показує кожне спостереження як точка на площині x-y), згрупована прямокутна діаграма для числових категорій, перехресна таблиця для двох категоріальних. Перш ніж дивитися на коефіцієнт кореляції, обов’язково подивіться на діаграму розсіювання: одна й та сама кореляція може показувати дуже різні закономірності (відомий квартет Анскомба демонструє це; чотири набори даних мають майже однакову статистику, але при побудові вони виявляються абсолютно різними).

3. Виберіть правильний тип діаграми. Тип діаграми залежить від вашого запитання та типу даних. Гістограма для розподілу; розсіювання для відносин; лінійна діаграма змін у часі; стовпчаста діаграма для порівняння категорій; (акуратно) складена планка за співвідношенням частин до цілого. ШІ швидко генерує код для вас, але рішення «який графік для якого питання» залишається за вами.

4. Зверніть увагу на шаблон, не оголошуйте результати. Запишіть будь-який цікавий візерунок, який ви бачите, як «нотатку про відкриття», але не вважайте це підтвердженою знахідкою. Підтвердження виконується на окремому етапі, бажано з окремими даними або заздалегідь визначеним графіком.

Принципи чесної візуалізації

Графіка переконує; Тому його оманлива сила також висока. ШІ може робити естетичні, але іноді оманливі рішення. Перевірте ці правила:

  • У стовпчастих діаграмах вісь y повинна починатися з нуля. Пунктирна вісь показує малі відмінності як великі.
  • Масштаб повинен бути послідовним. Якщо порівнюються дві діаграми, використовуйте той самий діапазон осей.
  • Надмірне згладжування може приховати справжній малюнок. Лінія тренду виглядає гарно, але якщо вона занадто «згладжує» дані, це може ввести в оману.
  • Колір і 3D-оздоблення спотворюють увагу, а не дані. Обирайте простоту.
  • Мають бути видимі відсутні дані та розмір вибірки. "n=12" і "n=12 000" не повинні виглядати однаково.
Увага: тільки тому, що створена ШІ графіка красива, вона не відповідає дійсності. Найпоширеніша помилка, яку він робить, полягає в тому, що не починає вісь з нуля на гістограмі та перебільшує різницю між двома групами. Завжди перевіряйте вісь.

Порівняльна таблиця: питання → схема

Запитуйте

правильна діаграма

Поширена помилка

Як розподіляється ця змінна?

Гістограма/коробковий графік

використовувати кругову діаграму

Чи пов’язані дві числові змінні?

Діаграма розсіювання

Просто дивлячись на кількість кореляцій

Як воно змінилося з часом?

лінійна діаграма

Визначення тенденції за допомогою гістограми

Яка різниця між групами?

Згрупований ящик/бар (з нуля)

Стрижень усіченої осі

Співвідношення частини до цілого?

Багатошарова планка (з обережністю)

Багатозрізова кругова діаграма

Чотири підказки, які можна копіювати

1. Код автоматичного виявлення:

Ваша роль: асистент EDA. Я не надаю дані, мені потрібен код R (ggplot2). Є числові (дохід, вік, витрати) і категоріальні (регіон, освіта) змінні в data.frame «дані». Завдання: написати код, який створює гістограму для кожного числа, стовпчасту діаграму для кожної категорії та діаграму розсіювання для доходу~віку. У стовпчастих діаграмах нехай вісь y починається з НУЛЯ. Додайте рядок коментаря.

2. Кореляційний огляд (кореляція + візуальне разом):

Напишіть код, який обчислює кореляцію Пірсона для доходів і витрат і будує діаграму розсіювання + лінійний тренд. Додайте рядок коментаря, який нагадає мені перевірити діаграму, перш ніж ДОВІРИТИ підрахунку кореляції (попередження Anscombe). Не надто згладжуйте лінію тренду.

3. Аудит доброчесності:

Перевірте наступний код ggplot для чесної візуалізації: [код]. Перевірте та виправте наступне: чи вісь y починається з нуля, чи відповідає масштаб, чи видно розмір вибірки, чи є надмірне згладжування? Поясніть обґрунтування кожного зробленого виправлення.

4. Виготовлення записки про відкриття (не знахідки):

На основі графіків, які я створюю, перелічіть СПОСТЕРЕЖЕННЯ як «примітку про відкриття»; напишіть кожен пункт мовою «гіпотези, яку потрібно перевірити», а не «переконливого висновку». Приклад: «Дохід від вищої освіти ВИДАЄТЬСЯ більш розподіленим; слід перевірити з окремими даними.' Уникайте причинно-наслідкових і остаточних тверджень.

Слабка підказка / Сильна підказка

Слабка підказка:

Побудуйте гарні графіки з прибутку та скажіть мені, що вони означають.

Це підказка викликає оманливі результати: «красиве» зосереджується на естетиці, тоді як «що це означає» спонукає ШІ переходити від відкриття до остаточного висновку. Слідують причинно-наслідкові, перебільшені коментарі.

Потужна підказка:

Ваша роль: чесний помічник EDA. Завдання: (1) вибрати тип діаграми, який відповідає моєму питанню, і написати обґрунтування, (2) розпочати вісь з нуля на стовпчастих діаграмах, (3) інтерпретувати вихідні дані мовою DISCOVERY NOTE: немає остаточного/причинного твердження, запропонувати гіпотезу мовою «потрібно перевірити», (4) попередити мене, якщо вибірка мала (n<30). Я запусту діаграму у своєму власному середовищі та перевірю це.

Відмінність: сильна воля виправдовує тип діаграми, нав'язує правила чесності та не плутає відкриття з підтвердженням.

три міні-чохла

Випадок 1 — Перебільшення дискретної осі. Аналітик показав оцінки задоволеності двох гілок (7,8 і 8,0; з 10) на гістограмі. При початку осі YZ від 7,5 друга гілка виявилася майже вдвічі вищою за першу; тоді як різниця становила лише 2,5%. Керівництво збиралося винагородити філію під неправильним враженням. Коли я почав вісь з нуля, різниця була майже непомітна. Урок: сам вибір осі змінює сприйняття.

Випадок 2 — довіряти кореляції та пропускати діаграму. Дослідник побачив r = 0,81 між двома змінними і написав «сильний лінійний зв’язок». Коли його консультант запитав діаграму розсіювання, було видно, що зв’язок фактично пов’язаний з одним екстремальним спостереженням, і коли цю точку було видалено, кореляція впала до 0,12. Урок: підрахунок кореляції не може замінити графік; завжди дивіться на розкид.

Випадок 3 — плутання відкриття з підтвердженням. Один студент розглянув усі попарні кореляції в наборі даних із 40 змінних, вибрав найвищий (r=0,52) і написав: «Ми виявили значний зв’язок між освітою та заощадженнями (p=0,004)». Проте були сотні пар у 40 змінних; вибір найвищого був хибним висновком через випадковість. Урок: виявлену закономірність не можна «перевірити та оголосити значущою» в тих самих даних; Потрібне окреме підтвердження.

Поширені помилки

  • Не починається вісь з нуля на гістограмі. Це перебільшує невелику різницю; Найпоширеніша візуальна брехня. Завжди перевіряйте.
  • Дивлячись на кореляцію та пропускаючи діаграму. Та сама кореляція випливає з дуже різних моделей; може відповідати нестандартним відносинам. По-перше, розсіювання.
  • Розглядаючи шаблон, знайдений у відкритті, як «доказ» у тих самих даних. Це шлях до p-хакінгу; Підтвердження здійснюється окремо.
  • Неправильний тип діаграми. Такі збіги, як стовпець для тенденції та пиріг для розподілу, вводять в оману. Виберіть жанр на основі питання.
  • Приховування розміру вибірки. n=8 і n=8000 не повинні виглядати однаково на одному графіку; невизначеність повинна бути показана.
Порада. Перш ніж публікувати діаграму, запитайте себе: "Чи зміниться історія, якщо я змінив вісь?" Якщо відповідь ствердна, ви, ймовірно, запустили центр з нечесного місця.

Підсумовуючи

Дослідницький аналіз даних — це фаза знайомства з даними, виявлення закономірностей і генерування гіпотез; Це не підтвердження. ШІ швидко генерує описову статистику та код графіка, але ви вибираєте тип графіка на основі свого запитання та контролюєте принципи справедливості (нульова вісь, узгоджений масштаб, явна невизначеність). Подивіться на розкид, перш ніж довіряти числу кореляції; Не оголошуйте шаблон, який ви знайшли під час відкриття, як «доказ» у тих самих даних. Красивий графік ШІ не означає правильний графік.

Аплікаційне завдання

Виберіть принаймні три змінні в наборі даних. Попросіть штучного інтелекту та запустіть код, який створює дослідницькі графіки (гістограми, точкові, прямокутні) із підказкою, яка забезпечує виконання правил чесності. Для кожної діаграми: перевірте (1) відповідність типу діаграми питанню, (2) чесність осі, (3) видимість розміру вибірки. Напишіть принаймні одну «нотатку про відкриття» мовою гіпотези («…здається, перевіряється окремо»). Вивчіть кореляцію як з підрахунком, так і з розкидом і повідомте, якщо між ними є розбіжності.

контрольний список

  • [ ] Я вибрав тип діаграми на основі свого запитання та типу даних.
  • [ ] На стовпчастих діаграмах я починаю вісь y з нуля; Я перевірив вісь чесність.
  • [ ] Я подивився на діаграму розсіювання, перш ніж повірити кореляції.
  • [ ] Я відобразив розмір вибірки та невизначеність на графіку.
  • [] Я написав закономірності, які знайшов під час дослідження, як "гіпотезу, яку потрібно перевірити", а не як "доказ".
  • [ ] Я зазначив, що не буду використовувати ті самі дані для підтвердження, і що потрібен окремий крок.