одиниця 3 / 11

Очищення даних, перетворення та дослідницький аналіз (з підтримкою Python/pandas)

Прибуток:

  • Здатність очищати необроблені економічні дані (пропущені спостереження, плутанина одиниць, невідповідність частоти) і готувати їх для аналізу за допомогою штучного інтелекту
  • Можливість друкувати стандартні економічні перетворення, такі як реальна номінальна конверсія, індексація, темпи зростання, сезонне коригування, як код у штучному інтелекті та перевіряти їх вручну
  • Здатність розпізнавати дані за допомогою дослідницького аналізу даних (зведена статистика, розподіл, викиди, кореляція) і критично читати підсумки штучного інтелекту

Економічні дані рідко надходять готовими для аналізу. У таблиці, яку ви завантажили з TURKSTAT, бракує кількох місяців, один стовпець представлено як текст із тисячею дужок, обмінний курс у турецькому форматі, як-от "1,234,56", одна серія є місячною, а інша – квартальною. Більшу частину часу економіст витрачає не на аналіз, а на підготовку даних для аналізу. Саме тут штучний інтелект є справжнім прискорювачем із низьким ризиком: він пропонує кроки очищення, пише pandas (бібліотеку обробки даних Python), кодує стандартні економічні трансформації. Але цей блок також має незмінне правило: ви читаєте кожне перетворення, написане штучним інтелектом, і перевіряєте його вручну принаймні в одному спостереженні. Якщо реальний номінальний цикл знаходиться на неправильній основі, весь аналіз тихо занепадає.

Прибирання: які проблеми, як їх вирішити?

Найпоширеніші проблеми в економічних даних та їх логіка:

  • Неповне спостереження. Один місяць/квартал порожній. Рішення залежить від контексту: якщо воно насправді не існує, воно залишається порожнім; Якщо є технічна прогалина, виконується ретельна інтерполяція, але межа між виготовленням тонка.
  • Плутанина одиниць і форматів. Текст «12.345.6» необхідно перетворити на число; мільйон/мільярд має стати послідовним.
  • Невідповідність частоти. Щоб об’єднати місячні та квартальні ряди, один з них агрегується (щомісяця чи кварталу) — чи є він середнім, загальним або на кінець періоду, залежить від характеру показника (відмінність запас/потік).
  • Викидні (екстремальні) значення. Якщо спостереження різко відхиляється: це реальна подія (криза, підвищення цін) чи помилка даних? Розбирається перед видаленням.
  • Вирівнювання дати. Формати дат і визначення періодів різних серій синхронізовані.
Увага: заповнення відсутніх даних здається невинним, але це економічне рішення. Заповнення кризового місяця «середнім значенням сусідніх місяців» означає видалення цієї кризи з аналізу. Перш ніж заповнювати, запитайте "чому існує ця прогалина?" Дайте відповідь на запитання.

Стандартні економічні перетворення

Трансформації та їх визначення в щоденному репертуарі економіста:

  • Номінальний → Реальний. Коригування на вплив ціни: реальна вартість = номінальна вартість / індекс цін × 100. Базовий рік дефлятора (коригуючий індекс) визначає основу результату.
  • Індексація. Перемасштабування ряду так, щоб вибраний період = 100; Це корисно для порівняння серій різних розмірів.
  • Швидкість росту. Річний: (такий самий період цього періоду / минулого року − 1) × 100. Періодична і річна ставка – це різні речі; Плутати - поширена помилка.
  • Сезонна корекція. Очищення регулярних сезонних впливів (літній туризм, відпустка); Необроблені ряди та сезонно скориговані ряди розповідають різні історії.
  • Ковзне середнє. Згладження шуму та надання тенденції видимості.
  • Логарифми та розрізнення. Розглянути динаміку зростання та стаціонарність (поглибимо в одиницю часового ряду).
Порада: під час кожного перетворення вас запитуватимуть "що сталося з одиницею та базою?" запитати. База дійсного ряду є базою дефлятора; Базою індексованого ряду є обраний вами період. Записуйте це, щоб уникнути помилок у майбутньому.

Дослідницький аналіз даних (EDA)

Необхідно розпізнати дані перед введенням їх у модель. Дослідницький аналіз даних (EDA) включає: підсумкову статистику (середнє значення, медіана, стандартне відхилення, мінімально-максимальне відхилення), форму розподілу, курс у часі, викиди та кореляцію між рядами. AI швидко генерує код для цих кроків; Ваше завдання полягає в тому, щоб прочитати результат економічним поглядом: «Чи це середнє обґрунтоване? Ця кореляція є збігом чи відомим зв’язком?»

Застереження: кореляція тут є лише засобом ідентифікації, а не доказом причинно-наслідкового зв’язку. Той факт, що дві серії рухаються разом (наприклад, продаж морозива та утоплення — обидві викликані літом), не обов’язково означає, що одна тягне за собою іншу. Ми поглибимо це розрізнення в розділі 7.

три міні-чохла

Випадок 1 — Неправильна база дефлятора. Аналітик попросив штучний інтелект написати код для реалізації ряду заробітної плати. Код спрацював, результат виглядав прийнятним, але аналітик вручну обчислив 2020 на кроці CALCULATE, і це не спрацювало. Проблема: штучний інтелект використовував дефлятор з базою 2003=100 і запитував ряд заробітної плати з цінами 2015 року; Основи були суперечливими. Код був виправлений одним рядком, вся серія стала на свої місця.

Випадок 2 — помилка тихого звуку. Установа скоротила дані щодо експорту в тисячах доларів та імпорту в мільйонах доларів. Коли штучний інтелект вилучив два для «зовнішньоторговельного балансу», результатом став абсурдний дефіцит. Перегляд мінімально-максимального значення в EDA виявив помилку: порядок величини двох серій відрізнявся в 1000 разів. Після того, як одиницю було вирівняно, баланс був правильним.

Випадок 3 — Викид не видаляється. Один місяць у серії був надзвичайно низьким. ШІ запропонував "викид, давайте очистимо його". Аналітик дослідив: того місяця виробництво фактично зупинилося через стихійне лихо. Цінність була реальною; Його видалення спотворить історію. Замість вилучення зробили виноску. «Чітка» рекомендація штучного інтелекту не була дотримана сліпо.

Таблиця перевірки перетворення

Перетворення

формула суть

ручна КПП

реалізації

номінальний / ціновий індекс × 100

База дефлятора = база результату?

річний приріст

(т/т-12міс − 1)×100

Обчисліть період на папері

індексація

ряд/базовий період × 100

Чи значення базового періоду дорівнює 100?

Щомісяця→кварталу

потік: збір / запас: кінець періоду

Правильний спосіб збору?

ковзне середнє

середнє за останній n період

Чи правильна довжина вікна?

Чотири шаблони, які можна копіювати

1) План очищення:

У мене є ці вихідні дані: [стовпці та зразки рядків]. Створіть план очищення, щоб підготуватися до аналізу: відсутнє значення, проблема з одиницею/форматом, вирівнювання дати, вирівнювання частоти, можливі викиди. Поясніть одним реченням, чому потрібен кожен крок. Поки що не пишіть код; дозвольте мені спочатку підтвердити план.

2) код очищення панди:

Напишіть код панди відповідно до затвердженого мною плану. Нехай код вказує, що він робить на кожному кроці, за допомогою рядка коментаря; Він друкує кількість рядків і відсутніх значень після перетворення. Не стирайте мовчки жодне спостереження; Повідомляйте про кожен видалений рядок.

3) Реалізація (піддається перевірці):

Реалізуйте цей номінальний ряд за допомогою [індекс цін]. Чітко напишіть базовий рік дефлятора, коли ви його використовуєте; Укажіть, що є основою отриманого ряду. Покажіть мені обліковий запис крок за кроком за один період, щоб я міг підтвердити його вручну.

4) Резюме дослідницького аналізу:

Напишіть дослідницький код аналізу для таких очищених даних: зведеної статистики, графіка часових рядів, сканування викидів і кореляційної матриці. Під час інтерпретації результатів чітко поясніть, що виявлені вами кореляції не є ПРИЧИННО-НАСЛІДКОВИМ ЗВ’ЯЗКОМ, і перерахуйте 3 моменти, які мені впадають в очі.

Слабка підказка / Сильна підказка

Слабка підказка:

Очистіть ці дані.

AI діє з припущеннями, не знаючи, що чистити; Ви можете видалити спостереження, змінити одиниці виміру, ви не помітите.

Потужна підказка:

У цих місячних даних зовнішньої торгівлі експорт наведено в «тис. доларів США», а імпорт — у «мільйонах доларів США». Зробіть два рівних у «мільйонах доларів США», позначте відсутні місяці, але НЕ ЗАПОВНЮЙТЕ, вирівняйте дати до кінця місяця. Виведіть, скільки рядків зазнає впливу на кожному кроці; мовчки не видаляти жодного рядка. Потім покажіть баланс за один місяць таким чином, щоб я міг перевірити вручну.

Поширені помилки

  • Запуск коду перетворення без його читання. Неправильна база/одиниця мовчки псує весь аналіз.
  • Заповнення відсутніх даних без роздумів. Стирання періоду кризи/катастрофи середнім.
  • Автоматично відкидати викиди. Прийняття реальної події за помилку даних.
  • Плутання сезонного і річного зростання. Вони мають різні розміри.
  • Неправильне поєднання частот. Збір серії запасів і обробка їх як потоку.
  • Помилково приймаючи кореляцію в EDA за причинність. Прийняття засобу розпізнавання як доказу.

Підсумовуючи

Очищення та перетворення даних — це невидимі, але вирішальні 80 відсотків економічного аналізу. Штучний інтелект різко прискорює цю механічну роботу; але ви повинні прочитати кожен крок очищення та кожне перетворення та вручну перевірити принаймні одне спостереження. Рішення щодо бази дефлятора, одиниці, частоти та викидів є економічними рішеннями, і їх не можна сліпо залишати штучному інтелекту. Дослідницький аналіз вводить дані, але кореляція не є причинно-наслідковим зв’язком.

Аплікаційне завдання

Завантажте фактичну необроблену серію (наприклад, місячний ІСЦ і серію номінальної заробітної плати/доходу). Створіть план очищення за допомогою 1-го шаблону, згенеруйте код за допомогою 2-го шаблону та реалізуйте серію за допомогою 3-го шаблону. Потім обчисліть реальну вартість одного періоду на папері та порівняйте її з результатом штучного інтелекту. Якщо ви виявите невідповідність, діагностуйте та виправте її джерело (база/блок) і зверніть увагу на прогрес.

контрольний список

  • [ ] Я переглянув і схвалив план очищення перед написанням коду.
  • [ ] Штучний інтелект повідомив про видалення/зміну кожного рядка; Без тихого видалення.
  • [ ] Під час заповнення відсутніх даних ви можете запитати "чому це пусто?" Я відповів на запитання.
  • [ ] Я дослідив, чи був викид реальною подією чи помилкою даних.
  • [ ] Під час реалізації я перевірив, що база дефлятора та база результату збігаються.
  • [ ] Я вручну перерахував конвертацію принаймні одного періоду.
  • [ ] Я не представив кореляції в EDA як причинно-наслідковий зв’язок.