નફો:
- વલણ, મોસમ, સ્થિરતા અને એકમ રુટના ખ્યાલોને સમજવાની ક્ષમતા અને સમય શ્રેણીના મોડેલિંગ અને આગાહી માટે ચોક્કસ ડેટા સાથે કૃત્રિમ બુદ્ધિનો ઉપયોગ કરવાની ક્ષમતા.
- ARIMA/મોસમી મોડલનું અર્થઘટન કરવાની અને અનિશ્ચિતતાની આગાહી કરવાની ક્ષમતા (વિશ્વાસ અંતરાલ, અવશેષ વિશ્લેષણ) અને બનાવટી રીગ્રેશન ટાળવા
- કૃત્રિમ બુદ્ધિમત્તાની આગાહી ભૂતકાળની પેટર્ન પર આધારિત છે અને માળખાકીય વિરામ અને કટોકટીના સમયગાળામાં નિષ્ણાતનો ચુકાદો સામે આવે છે તે પારખવામાં સક્ષમ બનવું.
અર્થશાસ્ત્રીઓ અને નાણાકીય વિશ્લેષકોનો મોટાભાગનો ડેટા સમય શ્રેણી છે: સમયાંતરે નિયમિત અંતરાલો પર માપવામાં આવતા સમાન ચલના મૂલ્યો (માસિક ફુગાવો, દૈનિક શેરની કિંમત, ત્રિમાસિક જીડીપી). સમય શ્રેણી સામાન્ય ક્રોસ-વિભાગીય ડેટાથી મૂળભૂત રીતે અલગ પડે છે કારણ કે અવલોકનો સ્વતંત્ર નથી: આજનું મૂલ્ય ગઈકાલ પર આધારિત છે. આ અવલંબન એક તક છે (આપણે ભવિષ્યની આગાહી કરી શકીએ છીએ) અને જોખમ (સામાન્ય રીગ્રેશન અહીં સરળતાથી ગેરમાર્ગે દોરે છે). આ એકમમાં, આપણે જોઈશું કે આર્ટિફિશિયલ ઈન્ટેલિજન્સ (AI) સમય શ્રેણીના મોડેલિંગ અને આગાહીને કેવી રીતે વેગ આપે છે, પરંતુ શા માટે સૌથી ખતરનાક ટ્રેપ-પ્રતિગમન-ધ્યાન જરૂરી છે.
મૂળભૂત ખ્યાલો
સમય શ્રેણીમાં સામાન્ય રીતે ત્રણ ઘટકો હોય છે: વલણ (લાંબા ગાળાનું ઉપર/નીચેનું વલણ), મોસમ (નિયમિત પેટર્ન જે આખા વર્ષ દરમિયાન પુનરાવર્તિત થાય છે, દા.ત. ઉનાળામાં પ્રવાસન વધે છે), અને ચક્ર/અવાજ (શેષ અસ્થિરતા). મોડેલિંગ પહેલાં, શ્રેણીની સૌથી મહત્વપૂર્ણ લાક્ષણિકતા સ્થિરતા છે.
સ્થિર શ્રેણી એ એવી શ્રેણી છે કે જેના આંકડાકીય ગુણધર્મો (મીન, ભિન્નતા) સમય જતાં સ્થિર રહે છે. બિન-સ્થિર શ્રેણીમાં વલણ હોય છે, તેનો તફાવત વધે છે અથવા તેમાં એકમ મૂળ હોય છે. એકમ રુટ એ એક માળખું છે જેમાં શ્રેણી કાયમી ધોરણે "યાદ રાખે છે" આંચકો આપે છે અને તેના સરેરાશ પર પાછી આવતી નથી; આવી શ્રેણી રેન્ડમ વોકની જેમ વર્તે છે. શા માટે તે મહત્વનું છે? કારણ કે વાસ્તવિકતામાં કોઈ સંબંધ ન હોવા છતાં પણ બે બિન-સ્થિર શ્રેણી વચ્ચેનું રીગ્રેસન ઉચ્ચ R- વર્ગ અને નોંધપાત્ર ગુણાંક ઉત્પન્ન કરી શકે છે - આને બનાવટી રીગ્રેસન કહેવામાં આવે છે. માત્ર સામાન્ય વલણ જ બે શ્રેણીઓ "સંબંધિત" હોવાનું જણાય છે.
સાવધાની: બે વધતી શ્રેણીઓ (દા.ત. એક દેશની વસ્તી અને બીજા દેશની આઈસ્ક્રીમનું વેચાણ) અત્યંત સહસંબંધિત હોઈ શકે છે; કારણ કે તે બંને સમય સાથે વધે છે. આ કોઈ સંબંધ નથી, પરંતુ સામાન્ય વલણનો ભ્રમ છે. સમય શ્રેણીમાં રીગ્રેસન શરૂ કરતા પહેલા સ્થિરતા તપાસવાની ખાતરી કરો.
સ્ટેપ-બાય-સ્ટેપ ટાઇમ સિરીઝ વર્કફ્લો
1. વિઝ્યુઅલાઈઝ કરો. શ્રેણીની રચના કરો: શું ત્યાં કોઈ વલણ છે, શું ત્યાં મોસમ છે, શું સમય સાથે તફાવત બદલાય છે, શું કોઈ માળખાકીય વિરામ (અચાનક સ્તરમાં ફેરફાર) છે?
2. પરીક્ષણ સ્થિરતા. ADF ટેસ્ટ (ઓગમેન્ટેડ ડિકી-ફુલર) અને KPSS ટેસ્ટ ટેસ્ટ યુનિટ રૂટ/સ્ટેશનરિટી. બે એકબીજાના પૂરક છે: ADF માં શૂન્ય પૂર્વધારણા "એક એકમ મૂળ છે", KPSS માં તે "સ્થિર" છે. બંનેનો એકસાથે ઉપયોગ કરવો વધુ સલામત છે.
3. સ્થિર. જો શ્રેણી બિન-સ્થિર હોય, તો તે સામાન્ય રીતે અલગ પડે છે (ક્રમિક અવલોકનોનો તફાવત; આ વલણને દૂર કરે છે). એકવાર ભિન્નતા કરવાથી "પ્રથમ ક્રમ સંકલિત" (I(1)) શ્રેણી સ્થિર બને છે. જો વિભિન્નતા વધી રહી હોય તો લોગ ટ્રાન્સફોર્મેશન પણ મદદ કરે છે.
4. એક મોડેલ બનાવો. સૌથી સામાન્ય માળખું એઆરઆઈએમએ (ઓટો રીગ્રેસિવ ઈન્ટિગ્રેટેડ મૂવિંગ એવરેજ) છે: તે ઘટકો AR (તેના પોતાના ભૂતકાળના મૂલ્યો પર શ્રેણીની અવલંબન), I (અંતરની ડિગ્રી), MA (ભૂતકાળની ભૂલોની અસર) ને જોડે છે. જો ત્યાં મોસમ હોય, તો SARIMA નો ઉપયોગ થાય છે. AI ઓટોમેટિક સિલેક્શન ટૂલ્સ માટે કોડ જનરેટ કરે છે જેમ કે auto.arima; પરંતુ સ્વચાલિત પસંદગીને આંખ બંધ કરીને સ્વીકારશો નહીં.
5. અવશેષો માટે તપાસો. સારા મોડેલના અવશેષો સફેદ ઘોંઘાટ હોવા જોઈએ: કોઈ પેટર્ન નથી, કોઈ સ્વતઃસંબંધ નથી. લ્યુંગ-બોક્સ ટેસ્ટ આનું પરીક્ષણ કરે છે. જો અવશેષોમાં હજુ પણ પેટર્ન છે, તો મોડેલ અધૂરું છે.
6. આગાહી કરો અને અનિશ્ચિતતા બતાવો. આગાહી એક લીટી નથી; હંમેશા વિશ્વાસ/અંદાજ અંતરાલ સાથે આપવામાં આવે છે. જેમ જેમ ક્ષિતિજ લંબાતું જાય તેમ તેમ શ્રેણી વિસ્તરતી જાય છે - આ પ્રમાણિકતાની નિશાની છે, ખામી નથી.
એકીકરણ: બિન-સ્થિર શ્રેણી સાથે વાસ્તવિક સંબંધ
બે બિન-સ્થિર શ્રેણી હંમેશા બનાવટી સંબંધો આપતા નથી. જો તેમની વચ્ચે વાસ્તવિક લાંબા ગાળાની સંતુલન હોય (તેઓ એકસાથે આગળ વધે છે), તો તેને કોઇન્ટીગ્રેશન કહેવામાં આવે છે અને તેને એરર કરેક્શન મોડલ (ECM) સાથે મોડેલ કરી શકાય છે. તેથી ઉકેલ "માહિતી તફાવત અને ફેંકવું" નથી; સૌપ્રથમ સંકલનનું પરીક્ષણ કરવું છે. આ તફાવત સાચા લાંબા ગાળાના સહસંબંધથી બનાવટી રીગ્રેસનને અલગ પાડે છે અને એક સૈદ્ધાંતિક વિચારણા છે કે AI તેના પોતાના પર નિર્ણય કરી શકતું નથી.
સરખામણી ચાર્ટ
સ્થિતિ
લક્ષણ
યોગ્ય અભિગમ
સ્થિર શ્રેણી
સતત સરેરાશ/વિચલન
ડાયરેક્ટ ARCHING
વલણ સાથે (એકમ રૂટ)
સતત વધારો, ADF અર્થહીન છે
તફાવત, પછી મોડેલ
બે બિન-સ્થિર શ્રેણી
ઉચ્ચ R² નકલી હોઈ શકે છે
પ્રથમ, સંકલન પરીક્ષણ
મોસમી
વાર્ષિક પુનરાવર્તિત પેટર્ન
SARIMA / મોસમી તફાવત
માળખાકીય વિરામ
અચાનક સ્તર/ઢાળમાં ફેરફાર
બ્રેકેજ ટેસ્ટ, નિષ્ણાત ચુકાદો
ચાર નકલ કરી શકાય તેવા સંકેતો
1. સ્થિરતા નિદાન:
તમારી ભૂમિકા: સમય શ્રેણી સહાયક. મને આર કોડ જોઈએ છે, હું ડેટા શેર કરતો નથી. 'શ્રેણી' એ માસિક સમય શ્રેણી (ts ઑબ્જેક્ટ) છે. કાર્ય: (1) શ્રેણી અને સ્વતઃસંબંધ (ACF/PACF) ગ્રાફ દોરો, (2) ADF અને KPSS પરીક્ષણો લાગુ કરો, (3) પરિણામોનું એકસાથે અર્થઘટન કેવી રીતે કરવું તે સમજાવો. હું તફાવત લેવાનો નિર્ણય કરીશ; તમે નિદાન ઉત્પન્ન કરો છો.
2. મોડેલ બિલ્ડિંગ (નિરીક્ષણ):
મારી શ્રેણી પ્રથમ તફાવત પર સ્થિર દેખાય છે. auto.arima સાથે મૉડલ પ્રસ્તાવિત કરો પરંતુ: (1) પસંદ કરેલ (p, d, q) ઑર્ડર અને તેઓ શા માટે પસંદ કરવામાં આવ્યા હતા તે સમજાવો, (2) Ljung-Box સાથેના અવશેષો સફેદ અવાજ છે કે કેમ તે ચકાસવા માટે કોડ ઉમેરો, (3) મને યાદ કરાવો કે આપોઆપ પસંદગીને આંખ આડા કાન ન કરો.
3. નકલી રીગ્રેશન ચેતવણી:
હું મારી બે ટાઈમ સીરિઝ (X, Y) વચ્ચે રીગ્રેસન સેટ કરવા માંગુ છું પરંતુ તે બંને ડિટ્રેન્ડેડ છે. વર્કફ્લો કોડ લખો જે બનાવટી રીગ્રેસનનું જોખમ તપાસે છે: પ્રથમ બંનેની સ્થિરતાનું પરીક્ષણ કરો, પછી એક સંકલન પરીક્ષણ લાગુ કરો (એન્ગલ-ગ્રેન્જર અથવા જોહાન્સેન). હું સીધો lm() ચલાવું તે પહેલાં, મને રોકો અને સમજાવો કે તે શા માટે જોખમી છે.
4. અનુમાન અને અનિશ્ચિતતા:
એક કોડ લખો જે મેં બનાવેલ ARIMA મોડલ સાથે 12-મહિનાની આગળની આગાહી કરે છે; તેના 80% અને 95% આત્મવિશ્વાસ અંતરાલ સાથે અંદાજ કાઢો. ચાર્ટની નીચે એક નોંધ ઉમેરો કે આગાહી ભૂતકાળની પેટર્ન પર આધારિત છે અને માળખાકીય વિરામ/કટોકટીની સ્થિતિમાં તે અમાન્ય બની શકે છે.
નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ
નબળા પ્રોમ્પ્ટ:
રીગ્રેસન સાથે આ બે શ્રેણીનો સંબંધ શોધો અને આગામી વર્ષની આગાહી કરો.
આ દાવો ખોટા રીગ્રેસન ટ્રેપને આમંત્રણ છે: જો સ્થિરતાની તપાસ કર્યા વિના રીગ્રેસન સેટ કરવામાં આવે છે, તો એક ઉચ્ચ R-ચોરસ પરંતુ અર્થહીન "સંબંધ" અને એક અયોગ્ય અંદાજ બહાર આવે છે.
શક્તિશાળી પ્રોમ્પ્ટ:
તમારી ભૂમિકા: સાવચેત સમય શ્રેણી સહાયક. તબક્કાવાર આગળ વધો: (1) શ્રેણી અને અહેવાલ બંનેની સ્થિરતાનું પરીક્ષણ કરો, (2) જો તેઓ સ્થિર ન હોય તો, ડાયરેક્ટ રીગ્રેસન ન કરો, પહેલા એકીકરણનું પરીક્ષણ કરો, (3) જો તમે આગાહી કરો છો, તો વિશ્વાસ અંતરાલ ઉમેરવાની ખાતરી કરો અને માળખાકીય વિરામ ચેતવણી લખો. દરેક પગલે નિર્ણય મારા પર છોડો; આપોઆપ પ્રગતિ.
તફાવત: મજબૂત માંગને અનુમાનને અનિશ્ચિતતા સાથે રજૂ કરીને, રીગ્રેસન પહેલાં સ્થિરતા અને એકીકરણની જરૂર છે.
ત્રણ નાના કેસો
કેસ 1 - નકલી રીગ્રેસન. એક વિશ્લેષકે R²=0.91, p<0.001 બે વધતી શ્રેણી (એક ક્ષેત્રનું ટર્નઓવર અને બીજા દેશનો ઉર્જા વપરાશ) વચ્ચે શોધી કાઢ્યું અને "મજબૂત સંબંધ" લખ્યું. જ્યારે તેમના કન્સલ્ટન્ટે સ્થિરતા પરીક્ષણ માટે પૂછ્યું, ત્યારે એવું જોવામાં આવ્યું કે બંનેના એકમ મૂળ છે, અને જ્યારે તેમના તફાવતો લેવામાં આવ્યા, ત્યારે સંબંધ (r = 0.04) સંપૂર્ણપણે અદૃશ્ય થઈ ગયો. ઉચ્ચ R-ચોરસ એ સામાન્ય વલણનો માત્ર ભ્રમ હતો. પાઠ: સ્થિરતા માટે પરીક્ષણ કર્યા વિના સમય શ્રેણી રીગ્રેસન અવિશ્વસનીય છે.
કેસ 2 - સ્વચાલિત મોડેલમાં આંધળો વિશ્વાસ. એક વિદ્યાર્થીએ auto.arima દ્વારા પસંદ કરેલ મોડેલની તપાસ કર્યા વિના તેનો ઉપયોગ કર્યો; તેણે હવે તેના વિશ્લેષણમાં બાકી રહેલી નોંધપાત્ર મોસમની નોંધ લીધી નથી. મોડલ વ્યવસ્થિત રીતે ઉનાળાના મહિનાઓને ઓછો અંદાજ આપે છે. લ્યુંગ-બોક્સ પરીક્ષણે અવશેષોમાં સ્વતઃસંબંધ દર્શાવ્યો હતો. સાચી રીત: મોસમી ઘટક (SARIMA) ઉમેરવાનો હતો. પાઠ: સ્વયંસંચાલિત પસંદગી એ શરૂઆત છે, અંતિમ શબ્દ નથી; અવશેષો તપાસવા જ જોઈએ.
કેસ 3 - માળખાકીય વિરામ પર અનુમાન પતન. એક મોડેલે 2019ના ડેટા સાથે 2020ની માંગની આગાહી કરી હતી; આત્મવિશ્વાસ અંતરાલ સાંકડો હતો, અંદાજ વિશ્વાસ હતો. 2020 ના મોટા આંચકા (રોગચાળો) એ આગાહીને સંપૂર્ણપણે ઉડાવી દીધી કારણ કે મોડેલ ફક્ત ભૂતકાળની પેટર્ન જાણતો હતો. પાઠ: સમય શ્રેણીની આગાહી ધારે છે કે ભૂતકાળ ભવિષ્ય જેવો જ હશે; કટોકટી/ભંગાણના સમયે, નિષ્ણાતનો ચુકાદો સામે આવે છે.
સામાન્ય ભૂલો
- સ્થિરતા માટે તપાસ કર્યા વિના રીગ્રેસન સ્થાપિત કરવું. બનાવટી રીગ્રેસન ઉચ્ચ R-ચોરસ પરંતુ મામૂલી સંબંધ પેદા કરે છે; પહેલા ADF/KPSS લાગુ કરો.
- ભિન્નતા અને એકીકરણને અવગણવું. જો કોઈ વાસ્તવિક લાંબા ગાળાના સંબંધ હોય, તો આંધળાપણે તફાવત લેવાથી માહિતી દૂર થઈ જાય છે; પ્રથમ સંકલનનું પરીક્ષણ કરો.
- ઓટોમેટિક મોડલને તપાસ્યા વગર વાપરવું. auto.arima એક સારી શરૂઆત છે પરંતુ અવશેષો (લજુંગ-બોક્સ) તપાસ્યા વિના અવિશ્વસનીય છે.
- અંદાજને સિંગલ લાઇન તરીકે રજૂ કરી રહ્યાં છીએ. આત્મવિશ્વાસના અંતરાલ વિનાનો અંદાજ ખોટી ચોકસાઇ બનાવે છે; હંમેશા અનિશ્ચિતતા બતાવો.
- માળખાકીય વિરામને અવગણવું. કટોકટી/શાસન પરિવર્તન ભૂતકાળની પેટર્નને વિક્ષેપિત કરે છે; મોડેલ આ જાણી શકતું નથી, નિષ્ણાત ચુકાદો જરૂરી છે.
ટીપ: સમય શ્રેણી શોધવાનું લખતા પહેલા, શ્રેણીના કાચા આલેખને ફરીથી જુઓ. સ્પષ્ટ વલણ અથવા વિરામ જે તમે તમારી પોતાની આંખોથી જુઓ છો તે સૌથી મજબૂત ચેતવણી છે કે કોઈપણ પરીક્ષણ તમને ભૂલી ન જાય.
સારાંશમાં
સમય શ્રેણી વિશ્લેષણમાં, અવલોકનો સ્વતંત્ર નથી; આ બંને આગાહી કરવાની શક્તિ આપે છે અને બનાવટી રીગ્રેસન જેવી મુશ્કેલીઓ બનાવે છે. મૉડલિંગ પહેલાં પરીક્ષણ સ્થિરતા (ADF/KPSS); બિન-સ્થિર શ્રેણી વચ્ચે પ્રત્યક્ષ રીતે રીગ્રેસન સ્થાપિત કરવાને બદલે સંકલનનું પરીક્ષણ કરો; જ્યાં સુધી સફેદ અવાજ ન થાય ત્યાં સુધી ARIMA/SARIMA મોડલના અવશેષો તપાસો; હંમેશા વિશ્વાસ અંતરાલ સાથે અંદાજ રજૂ કરો. AI આ તમામ પગલાં માટે કોડ જનરેટ કરે છે, પરંતુ નિષ્ણાત ઓટોમેટિક મોડલ પસંદગી, એકીકરણ નિર્ણય અને માળખાકીય વિરામ અર્થઘટનને નિયંત્રિત કરે છે. આગાહી ભૂતકાળ પર આધારિત છે; કટોકટીના સમયમાં, માનવ ચુકાદો અંતિમ કહે છે.
એપ્લિકેશન કાર્ય
સમય શ્રેણી (માસિક અથવા ત્રિમાસિક) પસંદ કરો. AI પહેલાં, સ્ટેશનરીટી ડાયગ્નોસ્ટિક્સની વિનંતી કરો અને ચલાવો (ગ્રાફ, ACF/PACF, ADF, KPSS) અને શ્રેણીને સ્થિર/બિન-સ્થિર તરીકે વર્ગીકૃત કરો. જો જરૂરી હોય તો તફાવત કરો, ARIMA/SARIMA મોડલ સેટ કરો અને Ljung-Box વડે અવશેષો તપાસો. 6-12 પીરિયડ ફોરવર્ડ ફોરકાસ્ટ બનાવો અને તેને કોન્ફીડન્સ ઈન્ટરવલ સાથે પ્લોટ કરો. છેલ્લે, એક ફકરામાં ધ્યાનમાં લો કે જો તમારા ડેટામાં માળખાકીય વિરામ હોય તો તમારી આગાહી કેવી રીતે ખોટી હોઈ શકે છે.
ચેકલિસ્ટ
- [ ] મેં શ્રેણીની રચના કરી અને વલણો, મોસમ અને વિરામની દૃષ્ટિની તપાસ કરી.
- [ ] મેં ADF અને KPSS સાથે સ્થિરતાનું પરીક્ષણ કર્યું; મને જરૂરી તફાવત મળ્યો.
- [ ] મેં સીધું રીગ્રેસન ટાળ્યું અને બિન-સ્થિર શ્રેણી વચ્ચેના એકીકરણનું પરીક્ષણ કર્યું.
- [ ] મેં મોડલના અવશેષો (લજુંગ-બોક્સ) તપાસ્યા અને પુષ્ટિ કરી કે તે સફેદ અવાજ હતો.
- [ ] મેં વિશ્વાસ અંતરાલ સાથે અંદાજ રજૂ કર્યો; મેં તેને એક લીટી તરીકે આપી નથી.
- માળખાકીય વિરામ/સંકટના કિસ્સામાં મેં આગાહીની મર્યાદાઓ નોંધી છે.