Единици
1. Вештачка интелигенција во економетријата и статистиката: улоги, граници, автентикација и приватност 2. Чистење и подготовка на податоци: Недостасуваат податоци, оддалечени и кодирање 3. Истражувачка анализа и визуелизација на податоци: графика и интерпретација со вештачка интелигенција 4. Линеарна регресија: Изградба на модел, толкување на коефициентот и претпоставки 5. Регресиска дијагностика и прекршувања: колинеарност, хетероскедастичност, автокорелација 6. Тестирање на хипотези и p-вредност: Значење, моќ и повеќекратни споредби 7. p-хакирање, HARKing и статистички интегритет: стапици во ерата на вештачката интелигенција 8. Анализа на временски серии: стационарност, ARIMA и предвидување 9. Причина и анализа на политики: DiD, IV, RDD и вештачка интелигенција 10. Генерирање и репродуктивност на кодови: R/Python, верзии и репродуктивност 11. Пишување извештаи, комуникација и етика: презентирање резултати и граници на комуникација
Единица 8 / 11

Анализа на временски серии: стационарност, ARIMA и предвидување

Добивки:

  • Способност да се разберат концептите на тренд, сезонска, стационарност и единичен корен и употреба на вештачка интелигенција со точни податоци за моделирање и прогнозирање на временски серии.
  • Способност да се интерпретираат ARIMA/сезонски модели и да се предвиди несигурност (интервал на доверба, резидуална анализа) и да се избегне лажна регресија
  • Да се биде способен да разликува дека предвидувањето на вештачката интелигенција се заснова на минатите шеми и дека стручното расудување доаѓа до израз во периоди на структурна пауза и криза.

Голем дел од податоците што им се лебот на економистите и финансиските аналитичари се временски серии: вредностите на истата променлива мерени во редовни интервали низ времето (месечна инфлација, дневна цена на акциите, квартален БДП). Временските серии фундаментално се разликуваат од обичните податоци за пресек бидејќи набљудувањата не се независни: денешната вредност зависи од вчера. Оваа зависност е и можност (можеме да ја предвидиме иднината) и опасност (обичната регресија овде лесно доведува во заблуда). Во оваа единица, ќе видиме како вештачката интелигенција (ВИ) го забрзува моделирањето и прогнозирањето на временските серии, но зошто најопасната замка - лажната регресија - бара внимание.

Основни концепти

Временската серија генерално содржи три компоненти: тренд (долгорочен нагорен/надолен тренд), сезонска (редовна шема што се повторува во текот на годината, на пр. зголемен туризам во лето) и циклус/шум (преостаната нестабилност). Пред моделирањето, најкритична карактеристика на серијата е неподвижноста.

Стационарна серија е серија чии статистички својства (средна вредност, варијанса) остануваат константни со текот на времето. Нестационарна серија содржи тренд, нејзината варијанса расте или има единичен корен. Единечниот корен е структура во која серијата трајно „се сеќава“ на шокови и не се враќа на својата средина; Ваквата серија се однесува како случајна прошетка. Зошто е важно? Бидејќи регресијата помеѓу две нестационарни серии може да произведе високи R-квадратни и значајни коефициенти дури и ако нема врска во реалноста - ова се нарекува лажна регресија. Само заедничкиот тренд прави двете серии да изгледаат како „поврзани“.

Внимание: Две серии во пораст (на пр. населението на една земја и продажбата на сладолед во друга земја) може да бидат во голема корелација; бидејќи и двете се зголемуваат со текот на времето. Ова не е врска, туку илузија на заеднички тренд. Не заборавајте да ја проверите стационарноста пред да започнете со регресија во временските серии.

Работен тек на временски серии чекор-по-чекор

1. Визуелизирајте. Зацртајте ја серијата: дали има тренд, дали има сезонска, дали варијансата се менува со текот на времето, дали има структурен прекин (ненадејна промена на нивото)?

2. Тестирајте ја стационарноста. ADF тест (Augmented Dickey-Fuller) и KPSS тест единица корен/стационарност. Двете се надополнуваат: во ADF нултата хипотеза е „постои единичен корен“, во KPSS е „стационарна“. Побезбедно е да се користат и двете заедно.

3. Стагнира. Ако серијата е нестационарна, таа обично се разликува (разликата на последователни набљудувања; ова го отстранува трендот). Диференцирањето еднаш ја прави стационарна серијата „интегрирана од прв ред“ (I(1)). Трансформацијата на дневниците исто така помага ако варијансата расте.

4. Изградете модел. Најчестата рамка е ARIMA (AutoRegressive Integrated Moving Average): Ги комбинира компонентите AR (зависност на серијата од сопствените минати вредности), I (степен на диференцијација), MA (ефект од минатите грешки). Доколку има сезонски, се користи SARIMA. Вештачката интелигенција генерира код за алатки за автоматско избирање како што е auto.arima; Но, немојте слепо да прифаќате автоматско избирање.

5. Проверете дали има остатоци. Остатоците од добар модел треба да бидат бел шум: без шема, без автокорелација. Тестот Ljung-Box го тестира ова. Ако сè уште има шема во остатоците, моделот е нецелосен.

6. Предвидете и покажете несигурност. Прогнозата не е една линија; секогаш дадена со интервал на доверба/проценка. Опсегот се зголемува како што се издолжува хоризонтот - ова е знак на искреност, а не мана.

Коинтеграција: реален однос со нестационарни серии

Две нестационарни серии не секогаш даваат лажни врски. Ако постои вистинска долгорочна рамнотежа меѓу нив (тие се движат заедно), тоа се нарекува коинтеграција и може да се моделира со моделот за корекција на грешки (ECM). Значи решението не е „разлика и фрлање на информациите“; е прво да се тестира коинтеграцијата. Оваа разлика ја разликува лажната регресија од вистинската долгорочна корелација и е теоретско размислување дека вештачката интелигенција не може сама да одлучи.

споредбена табела

Статус

симптом

правилен пристап

стационарна серија

Постојана средина/варијанса

Директно ЛАКУВАЊЕ

Со тренд (единичен корен)

Континуиран пораст, ADF е бесмислен

Разлика, па модел

Две нестационарни серии

Високиот R² може да биде лажен

Прво, тест за коинтеграција

сезонски

Годишна шема за повторување

САРИМА / сезонска разлика

структурен прекин

Ненадејна промена на нивото/наклонот

Тест за кршење, стручна проценка

Четири потсетници за копирање

1. Дијагноза на стационарност:

Вашата улога: асистент за временски серии. Сакам R код, не ги споделувам податоците. „серија“ е месечна временска серија (ts објект). Задача: (1) нацртајте графикони за серии и автокорелација (ACF/PACF), (2) применувајте ги тестовите ADF и KPSS, (3) објаснете како да ги интерпретирате резултатите заедно. Јас ќе донесам одлука да ја земам разликата; Вие правите дијагноза.

2. Изградба на модел (надгледувана):

Мојата серија изгледа неподвижна на првата разлика. Предложете модел со auto.arima, но: (1) објаснете ги избраните (p, d, q) нарачки и ЗОШТО се избрани, (2) додадете код за да тестирате дали остатоците се бел шум со Ljung-Box, (3) потсетете ме да не го прифаќам слепо автоматското избирање.

3. Лажно предупредување за регресија:

Сакам да поставам регресија помеѓу моите две временски серии (X, Y), но и двете се детрендирани. Напишете код за работниот тек кој го проверува ризикот од лажна регресија: прво тестирајте ја стационарноста на двете, а потоа применете го тестот за коинтеграција (Енгл-Гренџер или Јохансен). Пред да трчам директно со lm(), запрете ме и објаснете зошто е опасно.

4. Предвидување и неизвесност:

Напишете код кој произведува 12-месечна прогноза со моделот ARIMA што го создадов; Нацртајте ја проценката со нејзините интервали на доверба од 80% и 95%. Додадете забелешка под графиконот дека предвидувањето се заснова на минатите шеми и може да стане неважечко во случај на структурен прекин/криза.

Слаб промпт / Силен промпт

Слаба навестување:

Најдете го односот на овие две серии со регресија и предвидете ја следната година.

Ова тврдење е покана за стапицата за лажна регресија: ако регресијата се постави без проверка на стационарност, се појавува висок R-квадрат, но бесмислена „врска“ и неоправдана проценка.

Моќен потсетник:

Вашата улога: внимателен асистент за временски серии. Продолжете чекор по чекор: (1) тестирајте ја стационарноста на двете серии и извештајот, (2) ако тие не се стационарни, НЕ правете директна регресија, прво тестирајте ја коинтеграцијата, (3) ако изработите прогноза, задолжително додајте интервал на доверба и напишете предупредување за структурно прекинување. Оставете ми ја одлуката на секој чекор; автоматски напредок.

Разлика: силната побарувачка бара стационарност и коинтеграција пред регресија, прикажувајќи ја проценката со неизвесност.

три мини футроли

Случај 1 - Лажна регресија. Еден аналитичар најде R²=0,91, p<0,001 помеѓу две растечки серии (промет на еден сектор и потрошувачка на енергија во друга земја) и напиша „силна врска“. Кога неговиот консултант побарал тест за стационарност, се видело дека и двајцата имаат единични корени, а кога биле земени нивните разлики, врската (r = 0,04) целосно исчезнала. Високиот R-квадрат беше само илузија на заеднички тренд. Поука: регресијата на временските серии е неверодостојна без тестирање за стационарност.

Случај 2 - Слепа доверба во автоматскиот модел. Еден ученик го користел моделот избран од auto.arima без да го испита; тој повеќе не забележал значителна сезонска состојба во неговата анализа. Манекенката систематски ги потценуваше летните месеци. Тестот Ljung-Box покажа автокорелација во резидуалите. Точен начин: беше да се додаде сезонската компонента (SARIMA). Лекција: автоматскиот избор е почеток, а не последен збор; Остатоците мора да се проверат.

Случај 3 - Прогнозиран колапс при структурен прекин. Еден модел ја предвиде побарувачката за 2020 година со податоци од 2019 година; интервалот на доверба беше тесен, проценката беше сигурна. Големиот шок (пандемија) од 2020 година целосно го разнесе предвидувањето бидејќи моделот ја знаеше само претходната шема. Лекција: предвидувањето временски серии претпоставува дека минатото ќе биде слично на иднината; Во време на криза/распад, стручната проценка доаѓа до израз.

Вообичаени грешки

  • Воспоставување на регресија без проверка на стационарност. Лажната регресија произведува висок R-квадрат, но незначителен однос; Прво нанесете ADF/KPSS.
  • Диференцирање и прескокнување на коинтеграцијата. Ако постои вистинска долгорочна врска, слепо преземањето на разликата ги фрла информациите; Прво тестирајте ја коинтеграцијата.
  • Користење на автоматскиот модел без да го проверите. auto.arima е добар почеток, но несигурен без проверка на остатоците (Ljung-Box).
  • Презентирање на проценката како една линија. Проценката без интервал на доверба создава лажна прецизност; Секогаш покажувајте неизвесност.
  • Игнорирање на структурниот прекин. Кризата/промената на режимот ја нарушува претходната шема; Моделот не може да го знае ова, потребна е стручна проценка.
Совет: Пред да напишете наод за временска серија, погледнете го повторно необработениот график на серијата. Јасен тренд или прекин што го гледате со свои очи е најсилното предупредување дека ниту еден тест не треба да ве натера да заборавите.

Сумирано

Во анализата на временските серии, набљудувањата не се независни; Ова истовремено дава моќ на предвидување и создава замки како што е лажна регресија. Тест на стационарност (ADF/KPSS) пред моделирање; тестирање на коинтеграција наместо директно воспоставување на регресија помеѓу нестационарни серии; Проверете ги остатоците од моделот ARIMA/SARIMA додека не се појави бел шум; Секогаш прикажувајте ја проценката со интервал на доверба. AI го генерира кодот за сите овие чекори, но експертот го контролира автоматскиот избор на модел, одлуката за коинтеграција и интерпретацијата на структурните прекини. Предвидувањето се заснова на минатото; Во време на криза, човечкото расудување го има последниот збор.

Задача за апликација

Изберете временска серија (месечна или квартална). Пред вештачката интелигенција, побарајте и стартувајте дијагностика за стационарност (график, ACF/PACF, ADF, KPSS) и класифицирајте ја серијата како стационарна/нестационарна. Разликувајте ако е потребно, поставете модел ARIMA/SARIMA и проверете ги остатоците со Ljung-Box. Направете прогноза од 6-12 периоди и исцртајте ја со интервал на доверба. Конечно, размислете во параграф како вашето предвидување би можело да биде погрешно ако има структурна пауза во вашите податоци.

листа за проверка

  • [ ] Ја зацртав серијата и визуелно ги испитав трендовите, сезонството и паузите.
  • [ ] Ја тестирав стационарноста со ADF и KPSS; Ја добив потребната разлика.
  • [ ] Избегнав директна регресија и ја тестирав коинтеграцијата помеѓу нестационарни серии.
  • [ ] Ги проверив остатоците од моделот (Ljung-Box) и потврдив дека станува збор за бел шум.
  • [ ] Ја претставив проценката со интервал на доверба; Јас не го дадов како еден ред.
  • [ ] Ги забележав границите на предвидување во случај на структурен прекин/криза.