એકમો
1. અર્થશાસ્ત્રમાં આર્ટિફિશિયલ ઇન્ટેલિજન્સનો પરિચય: ભૂમિકાઓ, સીમાઓ, માન્યતા અને ડેટા એથિક્સ 2. ઇકોનોમિક ડેટા કલેક્શન અને સોર્સ વેરિફિકેશન: તુર્કસ્ટેટ, ઇવીડીએસ, આઇએમએફ, વર્લ્ડ બેંક, ફ્રેડ 3. ડેટા ક્લીનિંગ, ટ્રાન્સફોર્મેશન અને એક્સપ્લોરેટરી એનાલિસિસ (પાયથોન/પાંડા સપોર્ટ સાથે) 4. સમય શ્રેણી વિશ્લેષણ અને આગાહી આધાર 5. મેક્રોઇકોનોમિક ઇન્ડિકેટર્સનું અર્થઘટન: ફુગાવો, વૃદ્ધિ, બેરોજગારી, કરન્ટ એકાઉન્ટ બેલેન્સ 6. દૃશ્ય મોડેલિંગ અને સંવેદનશીલતા વિશ્લેષણ 7. ઇકોનોમેટ્રિક મોડલ સપોર્ટ: રીગ્રેસન, કોઝેશન અને અર્થઘટન 8. સાહિત્ય સમીક્ષા અને આર્થિક સંશોધન સંશ્લેષણ 9. નીતિ નોંધ, અહેવાલ અને સંક્ષિપ્ત લેખન 10. ઇકોનોમિક ડેટા વિઝ્યુલાઇઝેશન અને ડેશબોર્ડ 11. સીમાઓ, મોડલ જોખમ, નીતિશાસ્ત્ર, ગોપનીયતા અને શાસન
એકમ 3 / 11

ડેટા ક્લીનિંગ, ટ્રાન્સફોર્મેશન અને એક્સપ્લોરેટરી એનાલિસિસ (પાયથોન/પાંડા સપોર્ટ સાથે)

નફો:

  • કાચો આર્થિક ડેટા (ગુમ થયેલ અવલોકનો, એકમ મૂંઝવણ, આવર્તન મેળ ન ખાતો) સાફ કરવાની ક્ષમતા અને તેને કૃત્રિમ બુદ્ધિની મદદથી વિશ્લેષણ માટે તૈયાર કરવાની ક્ષમતા
  • કૃત્રિમ બુદ્ધિમત્તામાં કોડ તરીકે પ્રમાણભૂત આર્થિક પરિવર્તનો જેમ કે વાસ્તવિક-નોમિનલ રૂપાંતરણ, ઇન્ડેક્સેશન, વૃદ્ધિ દર, મોસમી ગોઠવણ છાપવાની ક્ષમતા અને તેને જાતે ચકાસવાની ક્ષમતા
  • સંશોધનાત્મક ડેટા વિશ્લેષણ (સારાંશ આંકડા, વિતરણ, આઉટલીયર, સહસંબંધ) દ્વારા ડેટાને ઓળખવાની ક્ષમતા અને આર્ટિફિશિયલ ઇન્ટેલિજન્સ સારાંશને વિવેચનાત્મક રીતે વાંચવાની ક્ષમતા

આર્થિક ડેટા ભાગ્યે જ વિશ્લેષણ માટે તૈયાર થાય છે. તમે TURKSTAT થી ડાઉનલોડ કરેલ કોષ્ટકમાં, કેટલાક મહિના ખૂટે છે, એક કૉલમ હજાર કૌંસ સાથે ટેક્સ્ટ તરીકે આવે છે, વિનિમય દર "1.234,56" જેવા ટર્કિશ ફોર્મેટમાં છે, એક શ્રેણી માસિક છે અને બીજી ત્રિમાસિક છે. અર્થશાસ્ત્રીનો મોટાભાગનો સમય પૃથ્થકરણમાં નહીં, પરંતુ ડેટાને વિશ્લેષણ માટે તૈયાર કરવામાં ખર્ચવામાં આવે છે. આ તે છે જ્યાં AI એ વાસ્તવિક, ઓછા-જોખમ પ્રવેગક છે: તે સફાઈના પગલાં સૂચવે છે, પાંડા લખે છે (પાયથોનની ડેટા પ્રોસેસિંગ લાઇબ્રેરી), માનક આર્થિક પરિવર્તનને કોડિફાય કરે છે. પરંતુ આ એકમનો પણ એક અપરિવર્તનશીલ નિયમ છે: તમે આર્ટિફિશિયલ ઇન્ટેલિજન્સ દ્વારા લખેલા દરેક રૂપાંતરણને વાંચો છો અને ઓછામાં ઓછા એક અવલોકનમાં તેને જાતે ચકાસો છો. જો વાસ્તવિક-નોમિનલ ચક્ર ખોટા પગથિયાં પર હોય, તો સમગ્ર વિશ્લેષણ શાંતિથી ક્ષીણ થઈ જાય છે.

સફાઈ: કઈ સમસ્યાઓ, તેમને કેવી રીતે હલ કરવી?

આર્થિક ડેટા અને તેમના તર્કમાં સૌથી સામાન્ય સમસ્યાઓ:

  • અધૂરું અવલોકન. એક મહિનો/ક્વાર્ટર ખાલી છે. ઉકેલ સંદર્ભ પર આધાર રાખે છે: જો તે વાસ્તવમાં અસ્તિત્વમાં નથી, તો તેને ખાલી છોડી દેવામાં આવે છે; જો ટેકનિકલ ગેપ હોય, તો સાવચેતીપૂર્વક પ્રક્ષેપણ કરવામાં આવે છે — પરંતુ ફેબ્રિકેશન વચ્ચેની રેખા પાતળી છે.
  • એકમો અને બંધારણોની મૂંઝવણ. ટેક્સ્ટ "12.345.6" ને નંબરમાં રૂપાંતરિત કરવું આવશ્યક છે; મિલિયન/બિલિયન સુસંગત બનવું જોઈએ.
  • આવર્તન મેળ ખાતી નથી. માસિક અને ત્રિમાસિક શ્રેણીને જોડવા માટે, એક એગ્રીગેટેડ છે (માસિકથી ત્રિમાસિક) — પછી ભલે તે સરેરાશ હોય, કુલ હોય કે અવધિનો અંત સૂચકની પ્રકૃતિ (સ્ટોક/ફ્લો ડિસ્ટિંક્શન) પર આધાર રાખે છે.
  • બાહ્ય (આત્યંતિક) મૂલ્યો. જો કોઈ અવલોકન જંગલી રીતે વિચલિત થાય છે: શું તે વાસ્તવિક ઘટના છે (કટોકટી, ભાવ વધારો), અથવા ડેટા ભૂલ છે? તે કાઢી નાખતા પહેલા સમજાય છે.
  • તારીખ સંરેખણ. વિવિધ શ્રેણીની તારીખ ફોર્મેટ અને સમયગાળાની વ્યાખ્યાઓ સમન્વયિત થાય છે.
ધ્યાન: ખૂટતો ડેટા ભરવો નિર્દોષ લાગે છે, પરંતુ તે એક આર્થિક નિર્ણય છે. "પડોશી મહિનાઓની સરેરાશ" સાથે કટોકટીનો મહિનો ભરવાનો અર્થ એ છે કે વિશ્લેષણમાંથી તે કટોકટી કાઢી નાખવી. ભરતા પહેલા, પૂછો "આ ગેપ શા માટે અસ્તિત્વમાં છે?" પ્રશ્નનો જવાબ આપો.

માનક આર્થિક પરિવર્તનો

અર્થશાસ્ત્રીના દૈનિક ભંડારમાં પરિવર્તન અને તેમની વ્યાખ્યાઓ:

  • નામાંકિત → વાસ્તવિક. ભાવની અસર માટે સમાયોજિત કરવું: વાસ્તવિક મૂલ્ય = નજીવી કિંમત / કિંમત સૂચકાંક × 100. ડિફ્લેટરનું પાયાનું વર્ષ (અનુક્રમણિકા સમાયોજિત કરવું) પરિણામનો આધાર નક્કી કરે છે.
  • અનુક્રમણિકા. શ્રેણીને પુનઃસ્કેલ કરવી જેથી પસંદ કરેલ સમયગાળો = 100; તે વિવિધ કદની શ્રેણીની તુલના કરવા માટે ઉપયોગી છે.
  • વૃદ્ધિ દર. વાર્ષિક: (આ સમયગાળો / ગયા વર્ષે સમાન સમયગાળા − 1) × 100. સામયિક અને વાર્ષિક દર અલગ વસ્તુઓ છે; મૂંઝવણ એ સામાન્ય ભૂલ છે.
  • મોસમી કરેક્શન. નિયમિત મોસમી અસરોને શુદ્ધ કરવું (ઉનાળામાં પ્રવાસન, રજાઓ); કાચી શ્રેણી અને ઋતુ પ્રમાણે ગોઠવાયેલી શ્રેણી જુદી જુદી વાર્તાઓ કહે છે.
  • મૂવિંગ એવરેજ. અવાજને સરળ બનાવવો અને વલણને દૃશ્યમાન બનાવવું.
  • લઘુગણક અને તફાવત. વૃદ્ધિની ગતિશીલતા અને સ્થિરતાની તપાસ કરવા માટે (સમય શ્રેણીના એકમમાં ઊંડું થશે).
ટીપ: દરેક રૂપાંતરણ સાથે તમને પૂછવામાં આવશે કે "એકમ અને આધારનું શું થયું?" પૂછો વાસ્તવિક શ્રેણીનો આધાર ડિફ્લેટરનો આધાર છે; અનુક્રમિત શ્રેણીનો આધાર તમે પસંદ કરો છો તે સમયગાળો છે. આ લખીને રાખવાથી ભવિષ્યમાં થતી ભૂલો અટકે છે.

સંશોધનાત્મક ડેટા વિશ્લેષણ (EDA)

મોડેલમાં દાખલ કરતા પહેલા ડેટાને ઓળખવો જરૂરી છે. એક્સપ્લોરેટરી ડેટા એનાલિસિસ (EDA) માં સમાવેશ થાય છે: સારાંશ આંકડા (મીન, સરેરાશ, પ્રમાણભૂત વિચલન, લઘુત્તમ-મહત્તમ), વિતરણનો આકાર, સમય જતાં અભ્યાસક્રમ, આઉટલાયર અને શ્રેણી વચ્ચેનો સંબંધ. AI ઝડપથી આ પગલાંઓ માટે કોડ જનરેટ કરે છે; તમારું કાર્ય આર્થિક આંખ સાથે આઉટપુટ વાંચવાનું છે: "શું આ સરેરાશ વાજબી છે? શું આ સહસંબંધ એક સંયોગ છે કે જાણીતો સંબંધ?"

સાવધાન: સહસંબંધ અહીં માત્ર ઓળખનું સાધન છે, કારણનો પુરાવો નથી. હકીકત એ છે કે બે શ્રેણીઓ એકસાથે આગળ વધે છે (દા.ત., આઈસ્ક્રીમનું વેચાણ અને ડૂબવું-બંને ઉનાળાથી શરૂ થાય છે) એ જરૂરી નથી કે એક બીજા તરફ દોરી જાય છે. અમે એકમ 7 માં આ તફાવતને વધુ ઊંડો કરીશું.

ત્રણ નાના કેસો

કેસ 1 - ખોટો ડિફ્લેટર આધાર. એક વિશ્લેષક પાસે વેતન શ્રેણીને સાકાર કરવા માટે આર્ટિફિશિયલ ઈન્ટેલિજન્સ રાઈટ કોડ હતો. કોડે કામ કર્યું, પરિણામ વાજબી લાગ્યું — પરંતુ વિશ્લેષકે 2020 ની જાતે ગણતરીના પગલામાં ગણતરી કરી અને તે કામ ન કર્યું. સમસ્યા: આર્ટિફિશિયલ ઇન્ટેલિજન્સે 2003=100ના આધાર સાથે ડિફ્લેટરનો ઉપયોગ કર્યો અને 2015ના ભાવ સાથે વેતન શ્રેણીની વિનંતી કરી; પાયા વિરોધાભાસી હતા. કોડ એક જ લાઇન ફિક્સ સાથે રિપેર કરવામાં આવ્યો હતો, સમગ્ર શ્રેણી સ્થાને પડી હતી.

કેસ 2 - સાયલન્ટ વોલ્યુમ ભૂલ. એક સંસ્થાએ નિકાસનો ડેટા હજાર ડોલરમાં અને આયાત મિલિયન ડોલરમાં ઘટાડી હતી. જ્યારે કૃત્રિમ બુદ્ધિમત્તાએ "વિદેશી વેપાર સંતુલન" માટે બંનેને દૂર કર્યા, ત્યારે પરિણામ વાહિયાત ખાધ હતું. EDA માં ન્યૂનતમ-મહત્તમ દૃશ્યે ભૂલ જાહેર કરી: બે શ્રેણીની તીવ્રતાનો ક્રમ 1000 ના પરિબળથી અલગ છે. એકવાર એકમ બરાબર થઈ જાય પછી સંતુલન સાચો હતો.

કેસ 3 - આઉટલીયરને કાઢી નાંખવાનું નથી. શ્રેણીમાં એક મહિનો અસાધારણ રીતે ઓછો હતો. એઆઈએ સૂચવ્યું "આઉટલીયર, ચાલો તેને સાફ કરીએ". વિશ્લેષકે તપાસ કરી: તે મહિને કુદરતી આપત્તિને કારણે ઉત્પાદન ખરેખર બંધ થઈ ગયું હતું. કિંમત વાસ્તવિક હતી; તેને કાઢી નાખવાથી ઈતિહાસ વિકૃત થશે. કાઢી નાખવાને બદલે ફૂટનોટ કરવામાં આવી હતી. AI ની "સ્પષ્ટ" ભલામણને આંધળાપણે અનુસરવામાં આવી ન હતી.

રૂપાંતર માન્યતા કોષ્ટક

રૂપાંતર

સૂત્ર સાર

મેન્યુઅલ ચેકપોઇન્ટ

અનુભૂતિ

નજીવી / કિંમત અનુક્રમણિકા × 100

ડિફ્લેટર આધાર = પરિણામ આધાર?

વાર્ષિક વૃદ્ધિ

(t/t-12મહિનો − 1)×100

કાગળ પર સમયગાળાની ગણતરી કરો

અનુક્રમણિકા

શ્રેણી/બેઝ પીરિયડ × 100

શું મૂળ અવધિ મૂલ્ય 100 છે?

માસિક → ત્રિમાસિક

પ્રવાહ: એકત્રિત / સ્ટોક: સમયગાળાની સમાપ્તિ

યોગ્ય સંગ્રહ પદ્ધતિ?

મૂવિંગ એવરેજ

છેલ્લા n સમયગાળાની સરેરાશ

શું વિન્ડોની લંબાઈ સાચી છે?

ચાર નકલ કરી શકાય તેવા નમૂનાઓ

1) સફાઈ યોજના:

મારી પાસે આ કાચો ડેટા છે: [કૉલમ્સ અને સેમ્પલ પંક્તિઓ]. વિશ્લેષણ માટે તૈયાર કરવા માટે સફાઈ યોજના સાથે આવો: ખૂટતું મૂલ્ય, એકમ/ફોર્મેટ સમસ્યા, તારીખ ગોઠવણી, આવર્તન સંરેખણ, સંભવિત આઉટલાયર. દરેક પગલું શા માટે જરૂરી છે તે એક વાક્યમાં સમજાવો. હજુ સુધી કોડ લખશો નહીં; મને પહેલા પ્લાન કન્ફર્મ કરવા દો.

2) પાંડા ક્લીનઅપ કોડ:

મેં મંજૂર કરેલી યોજના અનુસાર પાંડા કોડ લખો. કોડને ટિપ્પણી લાઇન સાથે દરેક પગલા પર તે શું કરે છે તે દર્શાવવા દો; તે રૂપાંતરણ પછી પંક્તિઓની સંખ્યા અને ગુમ થયેલ મૂલ્યો છાપે છે. ચુપચાપ કોઈપણ અવલોકન ભૂંસી નાખશો નહીં; તમે કાઢી નાખેલી દરેક લાઇનની જાણ કરો.

3) અનુભૂતિ (ચકાસણી કરી શકાય તેવી):

[કિંમત સૂચકાંક] સાથે આ નજીવી શ્રેણીને સમજો. જ્યારે તમે તેનો ઉપયોગ કરો ત્યારે ડિફ્લેટરનું આધાર વર્ષ સ્પષ્ટપણે લખો; પરિણામી શ્રેણીનો આધાર શું છે તે સ્પષ્ટ કરો. મને એક જ સમયગાળા માટે સ્ટેપ બાય સ્ટેપ એકાઉન્ટ બતાવો જેથી હું તેને મેન્યુઅલી ચકાસી શકું.

4) સંશોધનાત્મક વિશ્લેષણ સારાંશ:

નીચેના સાફ કરેલા ડેટા માટે સંશોધનાત્મક વિશ્લેષણ કોડ લખો: સારાંશ આંકડા, સમય શ્રેણી પ્લોટ, આઉટલીયર સ્કેન અને સહસંબંધ મેટ્રિક્સ. પરિણામોનું અર્થઘટન કરતી વખતે, તે સ્પષ્ટ કરો કે તમે જે સહસંબંધો શોધો છો તે CAUSAL નથી અને 3 મુદ્દાઓની સૂચિ બનાવો જે મારા માટે અલગ છે.

નબળા પ્રોમ્પ્ટ / મજબૂત પ્રોમ્પ્ટ

નબળા પ્રોમ્પ્ટ:

આ ડેટા સાફ કરો.

AI શું સાફ કરવું તે જાણ્યા વિના ધારણાઓ સાથે કાર્ય કરે છે; તમે અવલોકનો કાઢી શકો છો, એકમો બદલી શકો છો, તમે નોંધશો નહીં.

શક્તિશાળી પ્રોમ્પ્ટ:

આ માસિક વિદેશી વેપાર ડેટામાં, નિકાસ "હજાર USD" માં છે અને આયાત "મિલિયન USD" માં છે. બેને "મિલિયન USD" માં સમાન બનાવો, ખૂટતા મહિનાઓને ચિહ્નિત કરો પરંતુ ભરશો નહીં, તારીખોને મહિનાના અંત સુધી સંરેખિત કરો. દરેક પગલા પર કેટલી પંક્તિઓ અસરગ્રસ્ત છે તે છાપો; શાંતિપૂર્વક કોઈ પંક્તિઓ કાઢી નાખો. પછી એક મહિનાનું બેલેન્સ એવી રીતે બતાવો કે હું મેન્યુઅલી ચેક કરી શકું.

સામાન્ય ભૂલો

  • રૂપાંતર કોડને વાંચ્યા વિના ચલાવો. ખોટો આધાર/એકમ શાંતિપૂર્વક સમગ્ર વિશ્લેષણને બગાડે છે.
  • વિચાર્યા વગર ખૂટતો ડેટા ભરવો. કટોકટી/આપત્તિના સમયગાળાને સરેરાશ સાથે ભૂંસી નાખવું.
  • આઉટલીયર્સને આપમેળે કાઢી નાખો. ડેટા ભૂલ માટે વાસ્તવિક ઇવેન્ટને ભૂલ કરવી.
  • મૂંઝવણભરી મોસમી અને વાર્ષિક વૃદ્ધિ. બે અલગ અલગ કદના છે.
  • ફ્રીક્વન્સીઝને ખોટી રીતે જોડવી. સ્ટોક સીરીઝ એકઠી કરવી અને તેને ફ્લો તરીકે પ્રોસેસ કરવી.
  • કાર્યકારણ માટે EDA માં સહસંબંધની ભૂલ કરવી. પુરાવા તરીકે માન્યતા સાધનને ભૂલ કરવી.

સારાંશમાં

ડેટા ક્લિનિંગ અને ટ્રાન્સફોર્મેશન એ અદ્રશ્ય પરંતુ નિર્ણાયક 80 ટકા આર્થિક વિશ્લેષણ છે. કૃત્રિમ બુદ્ધિ નાટકીય રીતે આ યાંત્રિક કાર્યને ઝડપી બનાવે છે; પરંતુ દરેક ક્લીનઅપ સ્ટેપ અને દરેક ટ્રાન્સફોર્મેશન વાંચવું અને ઓછામાં ઓછું એક અવલોકન જાતે ચકાસવું તે તમારા પર છે. ડિફ્લેટર બેઝ, યુનિટ, ફ્રીક્વન્સી અને આઉટલીયર નિર્ણયો આર્થિક નિર્ણયો છે અને તેને આંધળી રીતે કૃત્રિમ બુદ્ધિમત્તા પર છોડી શકાય નહીં. સંશોધનાત્મક પૃથ્થકરણ ડેટા રજૂ કરે છે, પરંતુ ત્યાં સહસંબંધ નથી.

એપ્લિકેશન કાર્ય

વાસ્તવિક કાચી શ્રેણી ડાઉનલોડ કરો (દા.ત. માસિક CPI અને નજીવી વેતન/આવક શ્રેણી). 1લા નમૂના સાથે સફાઈ યોજના બનાવો, 2જા નમૂના સાથે કોડ જનરેટ કરો અને 3જા નમૂના સાથે શ્રેણીને સમજો. પછી કાગળ પર એક જ સમયગાળાના વાસ્તવિક મૂલ્યની ગણતરી કરો અને તેને કૃત્રિમ બુદ્ધિના આઉટપુટ સાથે સરખાવો. જો તમને કોઈ મેળ ખાતું નથી, તો તેના સ્ત્રોત (આધાર/એકમ)નું નિદાન કરો અને તેને સુધારો અને પ્રગતિની નોંધ લો.

ચેકલિસ્ટ

  • [ ] કોડ લખાય તે પહેલાં મેં સફાઈ યોજનાની સમીક્ષા કરી અને તેને મંજૂરી આપી.
  • [ ] કૃત્રિમ બુદ્ધિમત્તા દ્વારા રિપોર્ટ કરાયેલી દરેક લાઇનને મેં કાઢી નાખી/બદલેલી છે; કોઈ સાયલન્ટ ડિલીટ નથી.
  • ગુમ થયેલ ડેટા ભરતી વખતે તમે પૂછી શકો છો "કેમ ખાલી છે?" મેં પ્રશ્નનો જવાબ આપ્યો.
  • [ ] મેં તપાસ કરી કે આઉટલીયર વાસ્તવિક ઘટના હતી કે ડેટાની ભૂલ.
  • [ ] અનુભૂતિમાં, મેં ચકાસ્યું કે ડિફ્લેટર બેઝ અને પરિણામ બેઝ મેચ થાય છે.
  • [ ] મેં ઓછામાં ઓછા એક સમયગાળાના રૂપાંતરણની મેન્યુઅલી ગણતરી કરી.
  • [ ] મેં કારણ તરીકે EDA માં સહસંબંધ રજૂ કર્યા નથી.