단위 8 / 11

시계열 분석: 정상성, ARIMA 및 예측

이득:

  • 추세, 계절성, 정상성 및 단위근의 개념을 이해하고, 시계열 모델링 및 예측을 위해 정확한 데이터를 갖춘 인공지능을 사용할 수 있는 능력.
  • ARIMA/계절 모델 및 예측 불확실성(신뢰 구간, 잔차 분석)을 해석하고 허위 회귀를 방지하는 능력
  • 인공지능 예측은 과거 패턴을 기반으로 한다는 점과 구조적 붕괴와 위기 상황에서는 전문가 판단이 앞선다는 점을 구별할 수 있다.

경제학자와 금융 분석가의 기본이 되는 데이터의 대부분은 시계열입니다. 즉, 시간이 지남에 따라 일정한 간격으로 측정된 동일한 변수의 값(월별 인플레이션, 일일 주가, 분기별 GDP)입니다. 시계열은 관측값이 독립적이지 않기 때문에 일반 단면 데이터와 근본적으로 다릅니다. 즉, 오늘의 값은 어제에 따라 달라집니다. 이러한 의존성은 기회(미래를 예측할 수 있음)이자 위험(일반적인 회귀는 여기서 쉽게 오해할 수 있음)입니다. 이 단원에서는 인공 지능(AI)이 어떻게 시계열 모델링 및 예측을 가속화하는지 알아보고 가장 위험한 함정인 허위 회귀에 주의가 필요한 이유를 알아봅니다.

기본 개념

시계열은 일반적으로 추세(장기적인 상승/하락 추세), 계절성(1년 내내 반복되는 규칙적인 패턴, 예를 들어 여름철 관광 증가), 주기/노이즈(잔여 변동성)의 세 가지 구성요소로 구성됩니다. 모델링에 앞서 시리즈의 가장 중요한 특징은 정상성(stationarity)입니다.

고정 계열은 통계적 속성(평균, 분산)이 시간이 지나도 일정하게 유지되는 계열입니다. 비정상 계열에는 추세가 포함되어 있고, 변동이 커지거나 단위근이 있습니다. 단위근은 계열이 충격을 영구적으로 "기억"하고 평균으로 돌아가지 않는 구조입니다. 이러한 계열은 무작위 걷기처럼 동작합니다. 왜 중요합니까? 두 개의 정상이 아닌 계열 간의 회귀는 실제로 관계가 없더라도 높은 R-제곱 및 유의미한 계수를 생성할 수 있기 때문에 이를 허위 회귀라고 합니다. 공통 추세만이 두 계열을 "관련된" 것처럼 보이게 만듭니다.

주의: 두 가지 상승 계열(예: 한 국가의 인구와 다른 국가의 아이스크림 판매량)은 높은 상관관계를 가질 수 있습니다. 둘 다 시간이 지남에 따라 증가하기 때문입니다. 이것은 관계가 아니라 일반적인 추세에 대한 환상입니다. 시계열에서 회귀를 시작하기 전에 정상성을 확인하십시오.

단계별 시계열 워크플로

1. 시각화. 계열을 플롯합니다. 추세가 있습니까, 계절성이 있습니까, 시간이 지남에 따라 분산이 변합니까, 구조적 중단(갑작스러운 수준 변화)이 있습니까?

2. 정상성을 테스트합니다. ADF 테스트(Augmented Dickey-Fuller) 및 KPSS 테스트 단위 루트/정상성 테스트. 이 둘은 서로를 보완합니다. ADF에서 귀무가설은 "단위근이 있습니다"이고, KPSS에서는 "고정"입니다. 두 가지를 함께 사용하는 것이 더 안전합니다.

3. 침체. 계열이 정상적이지 않은 경우 일반적으로 차이가 발생합니다(연속 관측치의 차이, 이로 인해 추세가 제거됨). 한 번 미분하면 "1차 통합"(I(1)) 계열이 고정됩니다. 로그 변환은 분산이 커지는 경우에도 도움이 됩니다.

4. 모델을 구축합니다. 가장 일반적인 프레임워크는 ARIMA(AutoRegressive Integrated Moving Average)입니다. ARIMA(과거 값에 대한 계열의 종속성), I(차이 정도), MA(과거 오류의 효과) 구성요소를 결합합니다. 계절성이 있는 경우 SARIMA가 사용됩니다. AI는 auto.arima와 같은 자동 선택 도구를 위한 코드를 생성합니다. 그러나 자동 선택을 맹목적으로 받아들이지는 마십시오.

5. 남은 음식이 있는지 확인하세요. 좋은 모델의 잔차는 패턴이나 자기 상관이 없는 백색 잡음이어야 합니다. Ljung-Box 테스트는 이를 테스트합니다. 잔차에 여전히 패턴이 있으면 모델이 불완전한 것입니다.

6. 불확실성을 예측하고 보여줍니다. 예측은 한 줄이 아닙니다. 항상 신뢰/추정 구간과 함께 제공됩니다. 지평선이 길어질수록 범위도 넓어집니다. 이는 결함이 아니라 정직함의 표시입니다.

공적분: 고정되지 않은 계열과의 실제 관계

두 개의 비정상 계열이 항상 가짜 관계를 제공하는 것은 아닙니다. 둘 사이에 실제 장기 균형이 있는 경우(함께 이동하는 경우) 이를 공적분이라고 하며 오류 수정 모델(ECM)을 사용하여 모델링할 수 있습니다. 따라서 해결책은 "차이를 보고 정보를 버리는 것"이 ​​아닙니다. 먼저 공적분을 테스트하는 것입니다. 이러한 구별은 허위 회귀와 실제 장기 상관 관계를 구별하며 AI가 스스로 결정할 수 없는 이론적 고려 사항입니다.

비교 차트

상태

증상

올바른 접근

고정 시리즈

상수 평균/분산

다이렉트 ARCHING

추세 포함(단위 루트)

계속 상승, ADF는 의미가 없습니다

차이점, 그 다음 모델

두 개의 비고정식 시리즈

높은 R²는 가짜일 수 있습니다.

첫째, 공적분 테스트

계절의

연간 반복 패턴

SARIMA / 계절의 차이

구조적 파괴

급격한 레벨/경사 변화

파손시험, 전문가 판단

복사 가능한 프롬프트 4개

1. 정상성 진단:

귀하의 역할: 시계열 도우미. R 코드를 원하지만 데이터를 공유하지 않습니다. 'series'는 월별 시계열(ts 객체)입니다. 작업: (1) 계열 및 자기 상관(ACF/PACF) 그래프 그리기, (2) ADF 및 KPSS 테스트 적용, (3) 결과를 함께 해석하는 방법을 설명합니다. 나는 차이를 감수하기로 결정을 내릴 것입니다. 진단을 내리게 됩니다.

2. 모델 구축(감독):

내 계열은 첫 번째 차이에서 고정된 것처럼 보입니다. auto.arima를 사용하여 모델을 제안합니다. (1) 선택한 (p, d, q) 순서와 선택한 이유를 설명하고, (2) Ljung-Box를 사용하여 잔차가 백색 잡음인지 테스트하는 코드를 추가하고, (3) 자동 선택을 맹목적으로 받아들이지 않도록 상기시켜줍니다.

3. 가짜 회귀 경고:

두 시계열(X, Y) 사이에 회귀를 설정하고 싶지만 둘 다 추세가 제거되었습니다. 허위 회귀의 위험을 확인하는 워크플로 코드를 작성합니다. 먼저 두 가지 모두의 정상성을 테스트한 다음 공적분 테스트(Engle-Granger 또는 Johansen)를 적용합니다. lm()을 직접 실행하기 전에 중지하고 이것이 왜 위험한지 설명하십시오.

4. 예측과 불확실성:

내가 만든 ARIMA 모델을 사용하여 12개월 향후 예측을 생성하는 코드를 작성하세요. 80% 및 95% 신뢰구간을 사용하여 추정값을 표시합니다. 예측은 과거 패턴을 기반으로 하며 구조적 중단/위기 발생 시 무효화될 수 있다는 메모를 차트 아래에 추가하세요.

약한 프롬프트 / 강한 프롬프트

약한 프롬프트:

회귀분석을 통해 이 두 계열의 관계를 찾고 다음 연도를 예측합니다.

이 주장은 잘못된 회귀 함정에 대한 초대입니다. 정상성을 확인하지 않고 회귀를 설정하면 R-제곱은 높지만 의미 없는 "관계"와 부당한 추정치가 나타납니다.

강력한 프롬프트:

귀하의 역할: 주의 깊은 시계열 도우미. 단계별로 진행하십시오. (1) 시리즈와 보고서 모두의 정상성을 테스트하십시오. (2) 정상적이지 않은 경우 직접 회귀를 수행하지 말고 먼저 공적분을 테스트하십시오. (3) 예측을 생성하는 경우 신뢰 구간을 추가하고 구조적 중단 경고를 작성하십시오. 모든 단계에서 결정은 나에게 맡기십시오. 자동 진행.

차이점: 강한 수요에는 회귀 이전에 정상성과 공적분이 필요하므로 추정치는 불확실성이 있습니다.

세 개의 미니 케이스

사례 1 - 가짜 회귀. 한 분석가는 두 상승 계열(한 부문의 매출과 다른 국가의 에너지 소비) 사이에서 R²=0.91, p<0.001을 발견하고 "강한 관계"라고 썼습니다. 그의 컨설턴트가 정상성 검정을 요청했을 때 둘 다 단위근을 갖고 있는 것으로 나타났고, 차이를 취하면 관계(r=0.04)가 완전히 사라졌다. 높은 R-제곱은 단지 일반적인 추세에 대한 환상일 뿐입니다. 교훈: 시계열 회귀는 정상성 테스트 없이는 신뢰할 수 없습니다.

사례 2 - 자동 모델에 대한 맹목적인 신뢰. 한 학생이 auto.arima에서 선택한 모델을 검토하지 않고 사용했습니다. 그는 더 이상 자신의 분석에 중요한 계절성이 남아 있음을 발견하지 못했습니다. 이 모델은 여름철을 체계적으로 과소평가했습니다. Ljung-Box 검정에서는 잔차의 자기상관이 나타났습니다. 올바른 방법: 계절 구성요소(SARIMA)를 추가하는 것이었습니다. 교훈: 자동 선택은 끝이 아니라 시작입니다. 잔량을 확인해야 합니다.

사례 3 - 구조적 붕괴로 인한 예측 붕괴. 한 모델은 2019년 데이터를 사용하여 2020년 수요를 예측했습니다. 신뢰 구간이 좁았고 추정치가 확실했습니다. 2020년의 빅쇼크(팬데믹)는 모델이 과거 패턴만 알고 있었기 때문에 예측을 완전히 깨뜨렸습니다. 교훈: 시계열 예측은 과거가 미래와 유사할 것이라고 가정합니다. 위기/고장 상황에서는 전문가의 판단이 우선시됩니다.

일반적인 실수

  • 정상성을 확인하지 않고 회귀를 설정합니다. 가짜 회귀는 높은 R-제곱을 생성하지만 중요하지 않은 관계를 생성합니다. ADF/KPSS를 먼저 적용하십시오.
  • 공적분을 차별화하고 생략합니다. 실제로 장기적인 관계가 있다면 맹목적으로 차이를 취하는 것은 정보를 버리는 것입니다. 먼저 공적분을 테스트하세요.
  • 확인하지 않고 자동 모델을 사용합니다. auto.arima는 좋은 시작이지만 잔차를 확인하지 않으면 신뢰할 수 없습니다(Ljung-Box).
  • 추정치를 한 줄로 표시합니다. 신뢰 구간 없이 추정하면 잘못된 정밀도가 생성됩니다. 항상 불확실성을 보여주세요.
  • 구조적 중단을 무시합니다. 위기/정권 변화는 과거 패턴을 혼란에 빠뜨립니다. 이는 모델이 알 수 없으므로 전문가의 판단이 필요하다.
팁: 시계열 결과를 작성하기 전에 시계열의 원시 그래프를 다시 살펴보세요. 눈으로 직접 확인하는 확실한 추세나 브레이크는 어떤 테스트도 잊어서는 안 된다는 가장 강력한 경고입니다.

요약하면

시계열 분석에서 관측치는 독립적이지 않습니다. 이는 예측력을 제공하고 허위 회귀와 같은 함정을 만듭니다. 모델링 전 정상성(ADF/KPSS)을 테스트합니다. 비정상 계열 간의 회귀를 직접 설정하는 대신 공적분을 테스트합니다. 백색 잡음이 나타날 때까지 ARIMA/SARIMA 모델의 잔차를 확인합니다. 항상 신뢰 구간과 함께 추정치를 제시하십시오. AI는 이 모든 단계에 대한 코드를 생성하지만 전문가는 자동 모델 선택, 공적분 결정 및 구조적 중단 해석을 제어합니다. 예측은 과거를 기반으로 합니다. 위기의 순간에는 인간의 판단이 최종 결정을 내립니다.

응용과제

시계열(월별 또는 분기별)을 선택합니다. AI 이전에 정상성 진단(그래프, ACF/PACF, ADF, KPSS)을 요청 및 실행하고 계열을 정지/비고정으로 분류합니다. 필요한 경우 미분하고 ARIMA/SARIMA 모델을 설정하고 Ljung-Box로 잔차를 확인합니다. 6-12 기간의 향후 예측을 생성하고 신뢰 구간을 사용하여 그래프를 그립니다. 마지막으로, 데이터에 구조적 결함이 있는 경우 예측이 어떻게 잘못될 수 있는지 한 단락에서 고려하세요.

체크리스트

  • [ ] 시리즈를 구성하고 추세, 계절성, 휴식 시간을 시각적으로 조사했습니다.
  • [ ] ADF 및 KPSS를 사용하여 정상성을 테스트했습니다. 나는 필요한 차이를 얻었습니다.
  • [ ] 직접 회귀를 피하고 비정상 계열 간의 공적분을 테스트했습니다.
  • [ ] 모델잔차(Ljung-Box)를 확인하여 백색잡음인 것을 확인하였습니다.
  • [ ] 나는 신뢰구간을 포함한 추정치를 제시했습니다. 나는 그것을 한 줄로주지 않았습니다.
  • [ ] 구조적 붕괴/위기 발생 시 예측의 한계에 주목했습니다.