Печалби:
- Възможност за почистване на сурови икономически данни (липсващи наблюдения, объркване на единици, честотно несъответствие) и подготовката им за анализ с помощта на изкуствен интелект
- Възможност за отпечатване на стандартни икономически трансформации като реално номинално преобразуване, индексация, темп на растеж, сезонна корекция като код в изкуствен интелект и проверката им ръчно
- Способност за разпознаване на данни чрез проучвателен анализ на данни (обобщена статистика, разпределение, извънредни стойности, корелация) и критично четене на резюмета на изкуствен интелект
Икономическите данни рядко идват готови за анализ. В таблица, която сте изтеглили от TURKSTAT, липсват няколко месеца, една колона идва като текст с хиляда скоби, обменният курс е в турски формат като „1,234,56“, едната серия е месечна, а другата е тримесечна. По-голямата част от времето на икономиста се изразходва не в анализи, а в подготовка на данните за анализ. Това е мястото, където AI е истински ускорител с нисък риск: той предлага стъпки за почистване, пише pandas (библиотека за обработка на данни на Python), кодира стандартни икономически трансформации. Но тази единица също има неизменно правило: Вие четете всяка трансформация, написана от изкуствен интелект, и я проверявате ръчно в поне едно наблюдение. Ако реално-номиналният цикъл е на грешна основа, целият анализ тихо се разпада.
Почистване: какви проблеми, как да ги разрешим?
Най-често срещаните проблеми в икономическите данни и тяхната логика:
- Непълно наблюдение. Един месец/тримесечие е празен. Решението зависи от контекста: ако действително не съществува, остава празно; Ако има технически пропуск, се прави внимателна интерполация, но границата между изработката е тънка.
- Объркване на единици и формати. Текстът "12.345.6" трябва да бъде преобразуван в число; милион/милиард трябва да станат последователни.
- Несъответствие на честотата. За да се комбинират месечни и тримесечни серии, едната се агрегира (месечно към тримесечно) — дали е средно, общо или в края на периода зависи от естеството на индикатора (разлика наличност/поток).
- Извънредни (екстремни) стойности. Ако дадено наблюдение се отклонява силно: дали това е реално събитие (криза, покачване на цените) или грешка в данните? Разбира се преди изтриване.
- Подравняване по дата. Форматите на датата и дефинициите на периоди от различни серии са синхронизирани.
Внимание: Попълването на липсващи данни изглежда невинно, но това е икономично решение. Попълването на кризисен месец със "средната стойност на съседните месеци" означава изтриване на тази криза от анализа. Преди да попълните, попитайте "защо съществува тази празнина?" Отговорете на въпроса.
Стандартни икономически трансформации
Трансформации и техните определения в ежедневния репертоар на един икономист:
- Номинален → Реален. Корекция за ценовото въздействие: реална стойност = номинална стойност / ценови индекс × 100. Базовата година на дефлатора (коригиращ индекс) определя основата на резултата.
- Индексиране. Премащабиране на серия, така че избран период = 100; Полезно е за сравняване на серии с различни размери.
- Скорост на растеж. Годишен: (същият период през този период / миналата година − 1) × 100. Периодичният и годишният процент са различни неща; Объркването е често срещана грешка.
- Сезонна корекция. Пречистване на обичайните сезонни ефекти (летен туризъм, почивки); Суровите серии и сезонно коригираните серии разказват различни истории.
- Пълзяща средна. Изглаждане на шума и правене на тенденцията видима.
- Логаритми и разлики. Да се изследва динамиката на растежа и стационарността (ще се задълбочи в единицата времеви ред).
Съвет: При всяко преобразуване ще бъдете попитани "какво се случи с единицата и базата?" попитайте. Базата на реалния ред е основата на дефлатора; Основата на индексираните серии е избраният от вас период. Запазването на това записано предотвратява бъдещи грешки.
Проучвателен анализ на данни (EDA)
Необходимо е данните да бъдат разпознати преди въвеждането им в модела. Проучвателният анализ на данни (EDA) включва: обобщена статистика (средно, медиана, стандартно отклонение, min-max), форма на разпределението, курс във времето, отклонения и корелация между сериите. AI бързо генерира кода за тези стъпки; Вашата работа е да прочетете резултата с икономически поглед: "Тази средна стойност разумна ли е? Тази корелация съвпадение ли е или известна връзка?"
Внимание: Корелацията тук е само средство за идентификация, а не доказателство за причинно-следствена връзка. Фактът, че две серии се движат заедно (напр. продажби на сладолед и удавяния – и двете предизвикани от лятото), не означава непременно, че едната води до другата. Ще задълбочим това разграничение в раздел 7.
три мини калъфа
Случай 1 — Неправилна база на дефлатора. Един анализатор накара изкуствения интелект да напише код, за да реализира сериите на заплатите. Кодът проработи, резултатът изглеждаше разумен — но анализаторът ръчно изчисли 2020 в стъпката CALCULATE и това не проработи. Проблем: изкуственият интелект използва дефлатора с база 2003=100 и поиска серията на заплатите с цени от 2015 г.; Основите бяха противоречиви. Кодът беше поправен с корекция на един ред, цялата серия си дойде на мястото.
Случай 2 — Грешка при безшумен звук. Една институция е намалила данните за износа в хиляди долари и вноса в милиони долари. Когато изкуственият интелект премахна двете за „външнотърговския баланс“, резултатът беше абсурден дефицит. Изгледът min-max в EDA разкри грешката: порядъкът на величината на двете серии се различаваше с коефициент 1000. След като единицата беше изравнена, балансът беше правилен.
Случай 3 — Неизтриване на отклонението. Един месец в серия беше изключително нисък. AI предложи "извънреден, нека го изчистим". Анализаторът разследва: производството всъщност е спряло поради природно бедствие през този месец. Стойността беше реална; Изтриването му би изкривило историята. Вместо заличаване, беше бележка под линия. „Ясната“ препоръка на AI не беше последвана сляпо.
Таблица за валидиране на преобразуване
Преобразуване
формула есенция
ръчна контролна точка
реализация
номинал / ценови индекс × 100
База на дефлатора = база на резултатите?
годишен прираст
(t / t-12 месеца − 1)×100
Изчислете период на хартия
индексиране
серия/базисен период × 100
Стойността на базовия период 100 ли е?
Месечно→тримесечно
поток: събиране / запас: край на периода
Правилен метод на събиране?
пълзяща средна
средно за последния n период
Правилна ли е дължината на прозореца?
Четири копируеми шаблона
1) План за почистване:
Имам тези необработени данни: [колони и примерни редове]. Изгответе план за почистване, за да се подготвите за анализ: липсваща стойност, проблем с единица/формат, изравняване на дата, изравняване на честотата, възможни извънредни стойности. Обяснете с едно изречение защо е необходима всяка стъпка. Все още не пишете код; нека първо да потвърдя плана.
2) код за почистване на pandas:
Напишете кода на pandas според одобрения от мен план. Нека кодът показва какво прави на всяка стъпка с ред за коментар; Той отпечатва броя на редовете и липсващите стойности след преобразуването. Не изтривайте мълчаливо никакви наблюдения; Докладвайте всеки ред, който изтриете.
3) Реализация (подлежи на проверка):
Реализирайте тази номинална серия с [ценови индекс]. Напишете ясно базовата година на дефлатора, когато го използвате; Посочете каква е основата на получената серия. Покажете ми акаунта стъпка по стъпка за един период, за да мога да го проверя ръчно.
4) Обобщение на проучвателния анализ:
Напишете код за проучвателен анализ за следните изчистени данни: обобщена статистика, графика на времеви редове, сканиране на извънредни стойности и корелационна матрица. Когато интерпретирате резултатите, изяснете, че корелациите, които откривате, не са ПРИЧИННО-СЛЕДСТВЕНИ и избройте 3 точки, които се открояват за мен.
Слаба подкана / Силна подкана
Слаба подкана:
Изчистете тези данни.
AI действа с предположения, без да знае какво да почисти; Можете да изтриете наблюдения, да промените единици, няма да забележите.
Мощна подкана:
В тези месечни данни за външната търговия износът е в "хиляди USD", а вносът е в "милиони USD". Направете двете равни в "милиони щатски долара", маркирайте липсващите месеци, но НЕ ПОПЪЛВАЙТЕ, подравнете датите към края на месеца. Отпечатайте колко реда са засегнати на всяка стъпка; безшумно изтриване на редове. След това покажете баланса за един месец по начин, който мога да проверя ръчно.
Често срещани грешки
- Изпълнение на кода за преобразуване, без да го четете. Грешната база/единица тихо разваля целия анализ.
- Попълване на липсващи данни без мислене. Заличаване на периода на криза/бедствие със средната стойност.
- Автоматично отхвърляне на отклоненията. Объркайте реално събитие с грешка в данните.
- Объркващ сезонен и годишен растеж. Двата са различни размери.
- Неправилно комбиниране на честоти. Събиране на серията запаси и обработването им като поток.
- Грешка на корелацията в EDA за причинно-следствена връзка. Погрешно приемане на инструмента за разпознаване като доказателство.
В обобщение
Почистването и трансформирането на данни са невидимите, но решаващи 80 процента от икономическия анализ. Изкуственият интелект драстично ускорява тази механична работа; но от вас зависи да прочетете всяка стъпка за почистване и всяка трансформация и ръчно да проверите поне едно наблюдение. Решенията за базата на дефлатора, единицата, честотата и извънредните стойности са икономически решения и не могат да бъдат сляпо оставени на изкуствения интелект. Проучвателният анализ въвежда данни, но корелацията не е причинно-следствена връзка.
Задача за приложение
Изтеглете действителна необработена серия (напр. месечен CPI и номинална серия от заплати/доход). Създайте план за почистване с първия шаблон, генерирайте кода с втория шаблон и реализирайте серията с третия шаблон. След това изчислете реалната стойност на един период на хартия и я сравнете с резултата от изкуствения интелект. Ако откриете несъответствие, диагностицирайте и коригирайте неговия източник (база/устройство) и отбележете напредъка.
контролен списък
- [ ] Прегледах и одобрих плана за почистване, преди кодът да бъде написан.
- [ ] Изтрих/промених всеки ред от докладвания изкуствен интелект; Без тихо изтриване.
- [ ] Когато попълвате липсващи данни, може да попитате "защо е празно?" Отговорих на въпроса.
- [ ] Проучих дали отклонението е реално събитие или грешка в данните.
- [ ] При реализацията проверих, че базата на дефлатора и базата на резултата съвпадат.
- [ ] Ръчно преизчислих преобразуването на поне един период.
- [ ] Не представих корелациите в EDA като причинно-следствена връзка.