Mga nadagdag:
- Kakayahang linisin ang hilaw na data ng ekonomiya (nawawalang mga obserbasyon, pagkalito sa unit, frequency mismatch) at ihanda ito para sa pagsusuri sa tulong ng artificial intelligence
- Kakayahang mag-print ng mga karaniwang pagbabagong pang-ekonomiya tulad ng real-nominal na conversion, indexation, rate ng paglago, pana-panahong pagsasaayos bilang code sa artificial intelligence at manu-manong i-verify ang mga ito
- Kakayahang kilalanin ang data sa pamamagitan ng exploratory data analysis (summary statistics, distribution, outlier, correlation) at kritikal na pagbasa ng mga buod ng artificial intelligence
Ang data ng ekonomiya ay bihirang handa para sa pagsusuri. Sa isang talahanayan na iyong na-download mula sa TURKSTAT, ilang buwan ang nawawala, isang column ang dumating bilang text na may libong bracket, ang exchange rate ay nasa Turkish na format tulad ng "1.234,56", isang serye ay buwanan at ang isa ay quarterly. Karamihan sa oras ng ekonomista ay ginugugol hindi sa pagsusuri, ngunit sa paghahanda ng data para sa pagsusuri. Ito ay kung saan ang AI ay isang tunay, mababang-panganib na accelerator: nagmumungkahi ito ng mga hakbang sa paglilinis, nagsusulat ng mga pandas (library sa pagpoproseso ng data ng Python), nagko-code ng mga karaniwang pagbabagong pang-ekonomiya. Ngunit mayroon ding hindi nababagong panuntunan ang unit na ito: Binabasa mo ang bawat pagbabagong isinulat ng artificial intelligence at manu-manong i-verify ito sa kahit isang obserbasyon. Kung ang real-nominal cycle ay nasa maling footing, ang buong pagsusuri ay tahimik na nabubulok.
Paglilinis: anong mga problema, paano malutas ang mga ito?
Ang pinakakaraniwang problema sa data ng ekonomiya at ang kanilang lohika:
- Hindi kumpletong pagmamasid. Walang laman ang isang buwan/quarter. Ang solusyon ay depende sa konteksto: kung ito ay hindi aktwal na umiiral, ito ay iwanang blangko; Kung mayroong teknikal na agwat, ang maingat na interpolation ay ginagawa — ngunit ang linya sa pagitan ng katha ay manipis.
- Pagkalito ng mga unit at format. Ang tekstong "12.345.6" ay dapat ma-convert sa isang numero; milyon/bilyon ay dapat maging pare-pareho.
- Hindi tugma ang dalas. Upang pagsamahin ang isang buwanan at quarterly na serye, ang isa ay pinagsama-sama (buwan-buwan hanggang quarterly) — ito man ay average, kabuuan o katapusan ng panahon ay depende sa katangian ng indicator (stock/flow distinction).
- Outlier (matinding) halaga. Kung ang isang obserbasyon ay lumihis nang husto: ito ba ay isang tunay na kaganapan (krisis, pagtaas ng presyo), o isang error sa data? Naiintindihan ito bago tanggalin.
- Pag-align ng petsa. Ang mga format ng petsa at mga kahulugan ng panahon ng iba't ibang serye ay naka-synchronize.
Pansin: Ang pagpuno sa nawawalang data ay tila inosente, ngunit ito ay isang pang-ekonomiyang desisyon. Ang pagpuno sa isang buwan ng krisis ng "average ng mga kalapit na buwan" ay nangangahulugan ng pagtanggal ng krisis na iyon mula sa pagsusuri. Bago punan, itanong "bakit umiiral ang puwang na ito?" Sagutin ang tanong.
Mga karaniwang pagbabago sa ekonomiya
Mga pagbabagong-anyo at ang kanilang mga kahulugan sa pang-araw-araw na repertoire ng isang ekonomista:
- Nominal → Totoo. Pagsasaayos para sa epekto sa presyo: tunay na halaga = nominal na halaga / index ng presyo × 100. Tinutukoy ng batayang taon ng deflator (pagsasaayos ng index) ang base ng resulta.
- Pag-index. Pag-rescale ng isang serye upang ang isang napiling yugto ay = 100; Ito ay kapaki-pakinabang para sa paghahambing ng mga serye ng iba't ibang laki.
- Rate ng paglago. Taunang: (parehong panahon sa panahong ito / noong nakaraang taon − 1) × 100. Ang periodic at annualized rate ay magkaibang bagay; Ang pagkalito ay isang karaniwang pagkakamali.
- Pana-panahong pagwawasto. Purifying regular seasonal effect (summer tourism, holidays); Ang hilaw na serye at ang seasonally adjusted na serye ay nagsasabi ng iba't ibang kuwento.
- Moving average. Pinapaalis ang ingay at ginagawang nakikita ang trend.
- Logarithms at pagkakaiba. Upang suriin ang dynamics ng paglago at stationarity (magpapalalim sa unit ng time series).
Tip: Sa bawat conversion, tatanungin ka "ano ang nangyari sa unit at base?" magtanong. Ang base ng totoong serye ay ang base ng deflator; Ang batayan ng na-index na serye ay ang panahon na pipiliin mo. Ang pagpapanatiling nakasulat na ito ay pumipigil sa mga pagkakamali sa hinaharap.
Exploratory data analysis (EDA)
Kinakailangang kilalanin ang data bago ito ipasok sa modelo. Kasama sa Exploratory data analysis (EDA) ang: summary statistics (mean, median, standard deviation, min-max), hugis ng distribusyon, kurso sa paglipas ng panahon, outlier at ugnayan sa pagitan ng serye. Mabilis na nabuo ng AI ang code para sa mga hakbang na ito; Ang iyong trabaho ay basahin ang output nang may pang-ekonomiyang mata: "Ang average ba na ito ay makatwiran? Ang ugnayan ba na ito ay isang pagkakataon o isang kilalang relasyon?"
Babala: Ang ugnayan ay isang paraan lamang ng pagkakakilanlan dito, hindi patunay ng sanhi. Ang katotohanan na ang dalawang serye ay gumagalaw nang magkasama (hal., pagbebenta ng ice cream at pagkalunod-parehong na-trigger ng tag-araw) ay hindi nangangahulugang nagsasaad na ang isa ay humahantong sa isa pa. Palalalimin natin ang pagkakaibang ito sa yunit 7.
tatlong mini case
Case 1 — Maling base ng deflator. Ang isang analyst ay nagkaroon ng artificial intelligence write code upang mapagtanto ang serye ng sahod. Gumagana ang code, mukhang makatwiran ang resulta — ngunit manu-manong kinakalkula ng analyst ang 2020 sa hakbang na CALCULATE at hindi ito gumana. Problema: ginamit ng artificial intelligence ang deflator na may base na 2003=100 at hiniling ang serye ng sahod na may mga presyo noong 2015; Ang mga base ay nagkakasalungatan. Ang code ay naayos sa isang solong linya ng pag-aayos, ang buong serye ay nahulog sa lugar.
Case 2 — Error sa tahimik na volume. Binawasan ng isang institusyon ang data ng pag-export sa libong dolyar at pag-import sa milyong dolyar. Nang alisin ng artificial intelligence ang dalawa para sa "foreign trade balance", ang resulta ay isang absurd deficit. Ang min-max na view sa EDA ay nagsiwalat ng error: ang pagkakasunud-sunod ng magnitude ng dalawang serye ay naiba ng isang factor na 1000. Kapag ang unit ay napantayan ang balanse ay tama.
Case 3 — Hindi tinatanggal ang outlier. Ang isang buwan sa isang serye ay napakababa. Iminungkahi ng AI na "outlier, linisin natin ito". Ang analyst ay nag-imbestiga: ang produksyon ay talagang tumigil dahil sa isang natural na sakuna sa buwang iyon. Ang halaga ay totoo; Ang pagtanggal nito ay makakasira ng kasaysayan. Sa halip na tanggalin, ito ay footnote. Ang "malinaw" na rekomendasyon ng AI ay hindi sinunod nang walang taros.
Talahanayan ng pagpapatunay ng conversion
Pagbabalik-loob
kakanyahan ng formula
manu-manong checkpoint
pagsasakatuparan
nominal / index ng presyo × 100
Deflator base = base ng kinalabasan?
taunang paglago
(t / t-12month − 1)×100
Kalkulahin ang isang tuldok sa papel
pag-index
serye/base period × 100
100 ba ang base period value?
Buwan-buwan→ quarterly
daloy: collect / stock: end of period
Tamang paraan ng pagkolekta?
moving average
huling n panahon average
Tama ba ang haba ng bintana?
Apat na maaaring kopyahin na mga template
1) Plano sa paglilinis:
Mayroon akong raw data na ito: [mga column at sample row]. Gumawa ng plano sa paglilinis para maghanda para sa pagsusuri: nawawalang halaga, isyu sa unit/format, alignment ng petsa, frequency alignment, posibleng outlier. Ipaliwanag sa isang pangungusap kung bakit kailangan ang bawat hakbang. Huwag magsulat ng code pa; kumpirmahin ko muna ang plano.
2) pandas cleanup code:
Sumulat ng pandas code ayon sa planong inaprubahan ko. Hayaang ipahiwatig ng code kung ano ang ginagawa nito sa bawat hakbang na may linya ng komento; Ini-print nito ang bilang ng mga hilera at nawawalang mga halaga pagkatapos ng conversion. Huwag tahimik na burahin ang anumang pagmamasid; Iulat ang bawat linyang tatanggalin mo.
3) Pagsasakatuparan (mapapatunayan):
Alamin ang nominal na seryeng ito gamit ang [index ng presyo]. Isulat nang malinaw ang batayang taon ng deflator kapag ginamit mo ito; Tukuyin kung ano ang base ng resultang serye. Ipakita sa akin ang account nang sunud-sunod para sa isang panahon para ma-verify ko ito nang manu-mano.
4) Buod ng pagsusuri sa pagtuklas:
Sumulat ng exploratory analysis code para sa sumusunod na nalinis na data: summary statistics, time series plot, outlier scan, at correlation matrix. Kapag binibigyang kahulugan ang mga resulta, gawing malinaw na ang mga ugnayang makikita mo ay hindi SANHI at maglista ng 3 puntos na kapansin-pansin sa akin.
Mahinang prompt / Malakas na prompt
Mahinang prompt:
I-clear ang data na ito.
Ang AI ay kumikilos nang may mga pagpapalagay nang hindi alam kung ano ang lilinisin; Maaari mong tanggalin ang mga obserbasyon, baguhin ang mga yunit, hindi mo mapapansin.
Napakahusay na prompt:
Sa buwanang data ng dayuhang kalakalan na ito, ang mga pag-export ay nasa "libong USD" at ang mga pag-import ay nasa "milyong USD". Gawing pantay ang dalawa sa "million USD", markahan ang mga nawawalang buwan ngunit HUWAG PUNUAN, ihanay ang mga petsa sa katapusan ng buwan. I-print kung gaano karaming mga hilera ang apektado sa bawat hakbang; tahimik na tanggalin ang walang mga hilera. Pagkatapos ay ipakita ang balanse para sa isang buwan sa paraang maaari kong manu-manong suriin.
Mga karaniwang pagkakamali
- Pagpapatakbo ng conversion code nang hindi ito binabasa. Ang maling base/unit ay tahimik na sumisira sa buong pagsusuri.
- Pinupunan ang nawawalang data nang hindi nag-iisip. Binura ang panahon ng krisis/sakuna na may average.
- Awtomatikong itapon ang mga outlier. Napagkakamalang isang totoong kaganapan ang isang error sa data.
- Nakalilito na pana-panahon at taunang paglago. Magkaiba ang laki ng dalawa.
- Maling pagsasama-sama ng mga frequency. Pagkolekta ng serye ng stock at pagproseso nito bilang isang daloy.
- Napagkamalan ang ugnayan sa EDA para sa causality. Ipagkamali ang tool sa pagkilala bilang ebidensya.
Sa buod
Ang paglilinis at pagbabago ng data ay ang hindi nakikita ngunit mapagpasyang 80 porsiyento ng pagsusuri sa ekonomiya. Ang artipisyal na katalinuhan ay kapansin-pansing nagpapabilis sa gawaing mekanikal na ito; ngunit nasa iyo na basahin ang bawat hakbang sa paglilinis at bawat pagbabago at manu-manong i-verify ang kahit isang obserbasyon. Deflator base, unit, frequency at outlier na mga desisyon ay mga desisyong pang-ekonomiya at hindi maaaring bulag na ipaubaya sa artificial intelligence. Ang pagsusuri sa pagtuklas ay nagpapakilala ng data, ngunit ang ugnayan doon ay walang sanhi.
Gawain ng aplikasyon
Mag-download ng aktwal na raw na serye (hal. buwanang CPI at isang nominal na sahod/serye ng kita). Gumawa ng plano sa paglilinis gamit ang 1st template, gawin ang code gamit ang 2nd template, at isakatuparan ang serye na may 3rd template. Pagkatapos ay kalkulahin ang tunay na halaga ng isang solong panahon sa papel at ihambing ito sa output ng artificial intelligence. Kung makakita ka ng hindi pagkakatugma, i-diagnose at itama ang pinagmulan nito (base/unit) at tandaan ang pag-usad.
checklist
- [ ] Sinuri at inaprubahan ko ang plano sa paglilinis bago isulat ang code.
- [ ] Tinanggal/binago ko ang bawat linya ng iniulat na artificial intelligence; Walang tahimik na pagtanggal.
- [ ] Kapag pinupunan ang nawawalang data maaari mong itanong "bakit ito walang laman?" sagot ko sa tanong.
- [ ] Inimbestigahan ko kung ang outlier ay isang tunay na kaganapan o isang error sa data.
- [ ] Sa pagsasakatuparan, na-verify ko na ang base ng deflator at ang base ng kinalabasan ay tumutugma.
- [ ] Manu-mano kong kinalkula muli ang conversion ng kahit isang panahon.
- [ ] Hindi ako nagpakita ng mga ugnayan sa EDA bilang sanhi.