единици
1. Изкуствен интелект в иконометрията и статистиката: роли, граници, автентификация и поверителност 2. Почистване и подготовка на данни: липсващи данни, отклонения и кодиране 3. Проучвателен анализ на данни и визуализация: Графика и интерпретация с изкуствен интелект 4. Линейна регресия: Изграждане на модел, тълкуване на коефициенти и предположения 5. Регресионна диагностика и нарушения: колинеарност, хетероскедастичност, автокорелация 6. Тестване на хипотеза и p-стойност: значимост, сила и множество сравнения 7. p-hacking, HARKing и статистическа цялост: Клопки в епохата на изкуствения интелект 8. Анализ на времеви редове: стационарност, ARIMA и прогнозиране 9. Причинно-следствена връзка и анализ на политиката: DiD, IV, RDD и изкуствен интелект 10. Генериране на код и възпроизводимост: R/Python, създаване на версии и възпроизводимост 11. Писане на доклади, комуникация и етика: Представяне на резултати и съобщаване на граници
единица 8 / 11

Анализ на времеви редове: стационарност, ARIMA и прогнозиране

Печалби:

  • Способност за разбиране на концепциите за тенденция, сезонност, стационарност и единичен корен и използване на изкуствен интелект с точни данни за моделиране и прогнозиране на времеви редове.
  • Възможност за интерпретиране на ARIMA/сезонни модели и прогнозиране на несигурност (доверителен интервал, остатъчен анализ) и избягване на фалшива регресия
  • Да можеш да различиш, че прогнозите на изкуствения интелект се основават на минали модели и че експертната преценка излиза на преден план в периоди на структурен срив и криза.

Голяма част от данните, които са хлябът и маслото на икономисти и финансови анализатори, са времеви редове: стойности на една и съща променлива, измерени на редовни интервали във времето (месечна инфлация, дневна цена на акциите, тримесечен БВП). Времевите редове се различават фундаментално от обикновените данни от напречно сечение, тъй като наблюденията не са независими: днешната стойност зависи от вчерашната. Тази зависимост е както възможност (можем да предвидим бъдещето), така и опасност (тук обикновената регресия лесно подвежда). В тази част ще видим как изкуственият интелект (AI) ускорява моделирането и прогнозирането на времеви редове, но защо най-опасният капан – фалшивата регресия – изисква внимание.

Основни понятия

Времевият ред обикновено съдържа три компонента: тенденция (дългосрочна възходяща/низходяща тенденция), сезонност (редовен модел, който се повтаря през цялата година, напр. увеличен туризъм през лятото) и цикъл/шум (остатъчна променливост). Преди моделирането, най-критичната характеристика на серията е стационарността.

Стационарна серия е серия, чиито статистически свойства (средна стойност, дисперсия) остават постоянни във времето. Нестационарната серия съдържа тенденция, нейната дисперсия нараства или има единичен корен. Единичен корен е структура, в която серията постоянно "помни" шокове и не се връща към средната си стойност; Такава серия се държи като случайна разходка. Защо е важно? Тъй като регресията между две нестационарни серии може да доведе до висок R-квадрат и значими коефициенти, дори ако в действителност няма връзка - това се нарича фалшива регресия. Само общата тенденция прави двете серии да изглеждат „сродни“.

Внимание: Две нарастващи серии (напр. населението на една страна и продажбите на сладолед в друга страна) могат да бъдат силно свързани; тъй като и двете се увеличават с времето. Това не е връзка, а илюзия за обща тенденция. Не забравяйте да проверите стационарността, преди да започнете регресия във времевия ред.

Стъпка по стъпка работен процес на времеви серии

1. Визуализирайте. Начертайте серията: има ли тенденция, има ли сезонност, променя ли се дисперсията с времето, има ли структурно прекъсване (внезапна промяна на нивото)?

2. Тествайте стационарността. ADF тест (Augmented Dickey-Fuller) и KPSS тест тест единица корен/стационарност. Двете се допълват взаимно: в ADF нулевата хипотеза е „има единичен корен“, в KPSS е „стационарна“. По-безопасно е да използвате и двете заедно.

3. Застой. Ако серията е нестационарна, тя обикновено се различава (разликата на последователните наблюдения; това премахва тенденцията). Еднократното диференциране прави "интегрирани от първи ред" (I(1)) серии стационарни. Трансформацията на регистрационния файл също помага, ако дисперсията нараства.

4. Изградете модел. Най-разпространената рамка е ARIMA (Авторегресивна интегрирана подвижна средна стойност): тя комбинира компонентите AR (зависимост на серията от нейните собствени минали стойности), I (степен на разлика), MA (ефект от минали грешки). При наличие на сезонност се използва SARIMA. AI генерира код за инструменти за автоматичен избор като auto.arima; Но не приемайте сляпо автоматичния избор.

5. Проверете за остатъци. Остатъците на един добър модел трябва да са бял шум: без модел, без автокорелация. Тестът Ljung-Box тества това. Ако все още има модел в остатъците, моделът е непълен.

6. Прогнозирайте и покажете несигурност. Прогнозата не е един ред; винаги се дава с доверителен/приблизителен интервал. Диапазонът се разширява с удължаване на хоризонта - това е знак за честност, а не за недостатък.

Коинтеграция: реална връзка с нестационарни серии

Две нестационарни серии не винаги дават фалшиви връзки. Ако има реално дългосрочно равновесие между тях (те се движат заедно), това се нарича коинтеграция и може да се моделира с модела за коригиране на грешки (ECM). Така че решението не е „разлика и изхвърляне на информацията“; е първо да се тества коинтеграцията. Това разграничение разграничава фалшивата регресия от истинската дългосрочна корелация и е теоретично съображение, което AI не може да реши сам.

сравнителна диаграма

Статус

симптом

правилен подход

стационарни серии

Постоянна средна стойност/дисперсия

Директно АРЧИРАНЕ

С тенденция (единичен корен)

Непрекъснато покачване, ADF е безсмислено

Разлика, след това модел

Две нестационарни серии

Високото R² може да е фалшиво

Първо, тест за коинтеграция

сезонен

Годишен повтарящ се модел

SARIMA / сезонна разлика

структурно прекъсване

Внезапна промяна на нивото/наклона

Тест за счупване, експертна преценка

Четири подкани за копиране

1. Диагноза на стационарността:

Вашата роля: асистент за времеви редове. Искам R код, не споделям данните. 'series' е месечен времеви ред (ts обект). Задача: (1) начертайте серията и автокорелационните (ACF/PACF) графики, (2) приложете ADF и KPSS тестовете, (3) обяснете как да интерпретирате резултатите заедно. Аз ще взема решение да взема разликата; Вие поставяте диагноза.

2. Изграждане на модел (под надзор):

Серията ми изглежда неподвижна при първа разлика. Предложете модел с auto.arima, но: (1) обяснете избраните (p, d, q) поръчки и ЗАЩО са избрани, (2) добавете код, за да тествате дали остатъците са бял шум с Ljung-Box, (3) напомнете ми да не приемам сляпо автоматичния избор.

3. Предупреждение за фалшива регресия:

Искам да настроя регресия между моите два времеви реда (X, Y), но и двата са детрендирани. Напишете код на работен поток, който проверява риска от фалшива регресия: първо тествайте стационарността и на двете, след това приложете тест за коинтеграция (Engle-Granger или Johansen). Преди да стартирам lm() директно, спрете ме и обяснете защо е опасно.

4. Прогноза и несигурност:

Напишете код, който създава 12-месечна прогноза напред с модела ARIMA, който създадох; Начертайте оценката с нейните 80% и 95% доверителни интервали. Добавете бележка под диаграмата, че прогнозата се основава на минали модели и може да стане невалидна в случай на структурен срив/криза.

Слаба подкана / Силна подкана

Слаба подкана:

Намерете връзката на тези две серии с регресията и прогнозирайте следващата година.

Това твърдение е покана за капана на фалшивата регресия: ако регресията е настроена без проверка за стационарност, се появява висок R-квадрат, но безсмислена „връзка“ и неоправдана оценка.

Мощна подкана:

Вашата роля: внимателен асистент за времеви серии. Продължете стъпка по стъпка: (1) тествайте стационарността на серията и отчета, (2) ако не са стационарни, НЕ правете директна регресия, първо тествайте коинтеграцията, (3) ако създавате прогноза, не забравяйте да добавите доверителен интервал и да напишете предупреждение за структурно прекъсване. Оставете решението на мен на всяка стъпка; автоматичен прогрес.

Разлика: силното търсене изисква стационарност и коинтеграция преди регресия, представяйки оценката с несигурност.

три мини калъфа

Случай 1 — Фалшива регресия. Анализатор установи R²=0,91, p<0,001 между две нарастващи серии (оборот на един сектор и потребление на енергия на друга държава) и написа „силна връзка“. Когато неговият консултант поиска теста за стационарност, се видя, че и двамата имат единични корени и когато бяха взети разликите им, връзката (r = 0,04) напълно изчезна. Високият R-квадрат беше просто илюзия за обща тенденция. Урок: регресията на времеви редове е ненадеждна без тестване за стационарност.

Случай 2 — Сляпо доверие в автоматичния модел. Ученик използва модела, избран от auto.arima, без да го изследва; той вече не забелязва значителна сезонност, оставаща в анализа му. Моделът системно подценяваше летните месеци. Тестът на Ljung-Box показа автокорелация в остатъците. Правилният начин: беше да се добави сезонният компонент (SARIMA). Урок: автоматичният избор е началото, а не последната дума; Трябва да се проверят остатъците.

Случай 3 — Прогноза за срутване при структурно прекъсване. Един модел прогнозира търсенето за 2020 г. с данни за 2019 г.; доверителният интервал беше тесен, оценката беше уверена. Големият шок (пандемия) от 2020 г. напълно провали прогнозата, защото моделът познаваше само модела от миналото. Поука: прогнозирането на времеви редове предполага, че миналото ще бъде подобно на бъдещето; По време на криза/срив експертната преценка е на преден план.

Често срещани грешки

  • Установяване на регресия без проверка за стационарност. Фалшивата регресия създава висок R-квадрат, но незначителна връзка; Първо приложете ADF/KPSS.
  • Разграничаване и прескачане на коинтеграцията. Ако има истинска дългосрочна връзка, сляпото вземане на разликата изхвърля информация; Първо тествайте коинтеграцията.
  • Използване на автоматичния модел без проверка. auto.arima е добър старт, но ненадежден без проверка на остатъците (Ljung-Box).
  • Представяне на оценката като един ред. Оценката без доверителен интервал създава фалшива точност; Винаги показвайте несигурност.
  • Игнориране на структурното прекъсване. Кризата/смяната на режима нарушава миналия модел; Моделът не може да знае това, необходима е експертна преценка.
Съвет: Преди да напишете констатация за времеви серии, погледнете отново необработената графика на серията. Ясна тенденция или прекъсване, което виждате със собствените си очи, е най-силното предупреждение, което нито един тест не трябва да ви кара да забравяте.

В обобщение

При анализа на времеви редове наблюденията не са независими; Това едновременно дава предсказваща сила и създава клопки като фалшива регресия. Тествайте стационарността (ADF/KPSS) преди моделиране; тествайте коинтеграция, вместо директно установяване на регресия между нестационарни серии; Проверете остатъците на модела ARIMA/SARIMA, докато се появи бял шум; Винаги представяйте оценката с доверителен интервал. AI генерира кода за всички тези стъпки, но експертът контролира автоматичния избор на модел, решението за коинтеграция и тълкуването на структурното прекъсване. Прогнозата се основава на миналото; Във времена на криза човешката преценка има последната дума.

Задача за приложение

Изберете времева серия (месечна или тримесечна). Преди AI поискайте и стартирайте диагностика на стационарност (графика, ACF/PACF, ADF, KPSS) и класифицирайте серията като стационарна/нестационарна. Разграничете, ако е необходимо, настройте модел ARIMA/SARIMA и проверете остатъците с Ljung-Box. Направете прогноза за 6-12 периода напред и я начертайте с доверителен интервал. И накрая, помислете в параграф как прогнозата ви може да е грешна, ако има структурна повреда в данните ви.

контролен списък

  • [ ] Начертах серията и визуално разгледах тенденциите, сезонността и прекъсванията.
  • [ ] Тествах стационарност с ADF и KPSS; Получих необходимата разлика.
  • [] Избягнах директната регресия и тествах коинтеграция между нестационарни серии.
  • [ ] Проверих остатъците на модела (Ljung-Box) и потвърдих, че това е бял шум.
  • [ ] Представих оценката с доверителен интервал; Не го дадох като един ред.
  • [ ] Отбелязах границите на прогнозиране в случай на структурен срив/криза.