Yunit 2 / 11

Pang-ekonomiyang Pagkolekta ng Data at Pag-verify ng Pinagmulan: TURKSTAT, EVDS, IMF, World Bank, FRED

Mga nadagdag:

  • Kakayahang maghambing ng mga pangunahing mapagkukunan ng data ng ekonomiya (TURKSTAT, CBRT EVDS, IMF WEO, World Bank, Eurostat, FRED) ayon sa layunin, saklaw, dalas ng pag-update at pagiging maaasahan at piliin ang tamang pinagmulan
  • Kakayahang gumamit ng artificial intelligence para sa paghahanap ng data source, serial code/pagtutugma ng paglalarawan at pag-download ng code generation, at kumpirmahin ang bawat resulta sa opisyal na pinagmulan
  • Kakayahang makita kung paano ang bersyon (rebisyon), base year, unit at mga pagkakaiba sa kahulugan ay nakakagambala sa pagsusuri at nagkakaroon ng ugali ng pag-verify ng metadata

Ang bawat pagsusuri sa ekonomiya ay nagsisimula sa data, at ang kalidad ng pagsusuri ay hindi kailanman lalampas sa kalidad ng data. Ang prinsipyo ng "garbage in, garbage out" ay gumagana nang hindi maiiwasan sa ekonomiya: kahit na ang pinaka-eleganteng modelo, batay sa maling base, maling kahulugan, o maling panahon, ay mali. Sa unit na ito, gagamit kami ng artificial intelligence para mahanap ang tamang data, tumugma sa mga serial code at isulat ang download code; Ngunit hindi magbabago ang isang ginintuang tuntunin: Ang pigura ay nagmula sa opisyal na pangunahing mapagkukunan, hindi mula sa artipisyal na katalinuhan. Maaaring ipakita sa iyo ng AI ang daan patungo sa pinagmulan; nakukuha mo ang data mismo mula sa pinagmulang iyon.

Kilalanin natin ang mga pangunahing mapagkukunan

Kasama sa compass ng isang ekonomista ang mga sumusunod na mapagkukunan. Ang layunin, saklaw at ritmo ng pag-update ng bawat isa ay iba.

TURKSTAT (Turkish Statistical Institute). Opisyal na awtoridad sa istatistika ng Türkiye. Inflation (CPI/PPI), GDP, labor force, foreign trade, industrial production, populasyon. Ito ang pangunahing pinagmumulan ng mga numerong partikular sa Türkiye.

CBRT EVDS (Electronic Data Distribution System). Data portal ng Bangko Sentral. Halaga ng palitan, interes, suplay ng pera, balanse ng mga pagbabayad, kasalukuyang balanse, mga reserba, mga survey ng inaasahan. Ang unang paghinto para sa data sa pananalapi at pera.

IMF (International Monetary Fund). Lalo na ang database ng WEO (World Economic Outlook): cross-country comparative GDP, inflation, utang, balanse sa kasalukuyang account at mga projection. Tamang-tama para sa internasyonal na paghahambing; Ngunit ang mga projection ay mga hula, hindi mga realisasyon.

World Bank (World Bank — WDI). Mga Tagapagpahiwatig ng Pag-unlad ng Mundo: pag-unlad, kahirapan, edukasyon, kalusugan, mga tagapagpahiwatig ng imprastraktura; mahabang makasaysayang serye at paghahambing ng bansa.

Eurostat. Tanggapan ng istatistika ng European Union; Harmonized (maihahambing) na data para sa mga bansa sa EU. Ang mga serye tulad ng HICP (harmonized inflation) ay ginagamit sa EU benchmarking.

FRED (Federal Reserve Economic Data). Napakalaking serye ng St. Louis Fed; Nag-aalok ng mabilis at programmable access (API) para sa US at global na macro-financial data.

OECD. Mga comparative indicator, nangungunang indicator, productivity at welfare series para sa mga binuo na ekonomiya.

Tip: Ang sagot sa tanong na "tamang pinagmulan" ay depende sa layunin. TURKSTAT para sa opisyal na inflation ng Türkiye; IMF/World Bank upang ihambing ang Türkiye sa 30 bansa; FRED para sa interes ng US. Ang pagkuha ng parehong tagapagpahiwatig mula sa maling pinagmulan ay isang tahimik na pagkakamali.

Mga tahimik na mapagkukunan ng error: rebisyon, batayang taon, yunit, paglalarawan

Ang pinaka-mapanganib na mga error sa data ng ekonomiya ay walang ingay. Kilalanin ang apat:

  • Rebisyon (bersyon). Maraming tagapagpahiwatig (GDP, balanse ng mga pagbabayad) ang binago buwan pagkatapos ng unang ipahayag ang mga ito. Magiiba ang "provisional" figure ngayon, ang "final" figure pagkatapos ng tatlong buwan. Alamin kung aling vintage (bersyon) ang iyong ginagamit.
  • Batayang taon. Ang mga indeks ay itinatag batay sa isang batayang taon (=100). Mali na direktang paghambingin ang dalawang serye na may magkaibang mga batayang taon.
  • Yunit. Milyon o bilyon, TL o dolyar, kasalukuyan o nakapirming presyo? Ang pagkalito ng unit ay ang pinakakaraniwang error sa pagsusuri.
  • Kahulugan/saklaw. Ano ang kahulugan ng "kawalan ng trabaho"? Anong mga item ang hindi kasama ng "core inflation"? Maaaring magkaiba ang sukat ng dalawang serye na may parehong pangalan.
Pag-iingat: Kung ang figure para sa parehong indicator mula sa dalawang source ay hindi tumutugma, ang iyong unang palagay ay hindi dapat "may nagsisinungaling" ngunit "may pagkakaiba sa kahulugan/base/saklaw/rebisyon." I-align muna ang metadata (data citation).

Hakbang-hakbang: Pangongolekta ng data na pinapagana ng AI

  1. Linawin ang pangangailangan. Aling indicator, aling bansa/lalawigan, aling panahon, anong dalas (buwan-buwan/quarterly/taon), anong kahulugan?
  2. Pumili ng pinagmulan. Ipaliwanag ang layunin sa AI at imungkahi ang naaangkop na pangunahing pinagmulan at buong pangalan ng serye.
  3. I-validate ang metadata. Kumpirmahin ang yunit, batayang taon, paglalarawan at petsa ng pag-update ng napiling serye sa opisyal na pahina.
  4. Buuin ang download code. Para sa mga may API, tulad ng FRED/World Bank, sumulat ng Python code sa AI; Alisin ang mga hakbang sa pag-download para sa TURKSTAT/EVDS.
  5. Unang suriin. Pagkatapos dumating ang data, tingnan ang bilang ng mga row/column, mga nawawalang value, outlier at hanay ng petsa.
  6. Pagkumpirma ng pinagmulan. Ihambing ang hindi bababa sa ilang mga obserbasyon sa opisyal na publikasyon; Eksaktong tugma ba ito?

tatlong mini case

Case 1 — Base year trap. Isang analyst ang nakakuha ng industrial production index mula sa dalawang magkahiwalay na pag-aaral; ang isa ay batay sa 2015=100 at ang isa ay batay sa 2021=100. "Pagsamahin ang mga ito," sinabi niya sa artificial intelligence. Kung nilaktawan niya ang pagsusuri ng metadata, ilalagay niya ang mga indeks nang magkatabi at makakakita siya ng pekeng pagtalon. Nakuha niya ang base difference sa control step, ginawang common base ang dalawa at pagkatapos ay pinagsama ang mga ito. Wala na ang pekeng bounce.

Case 2 — Fabricated na output ng API. Sinabi ng isang mananaliksik sa artificial intelligence, "Iguhit ang GDP per capita ng Türkiye mula sa World Bank"; Ibinalik ng AI ang parehong code at isang talahanayan ng mga numero bilang "sample na output". Hindi ginamit ng mananaliksik ang talahanayan; pinatakbo lang ang code at kinuha ang data mula sa totoong API. Pagkatapos ay napagtanto niya na ang mga numerong isinulat ng artificial intelligence bilang "mga halimbawa" ay talagang 10-15 porsiyentong diskwento. Tool ng code, hindi numero; Ito ang tamang pag-uugali.

Case 3 — Pagkakaiba ng rebisyon. Sa isang tala na inilathala anim na buwan na ang nakalipas, isinulat ng isang institusyon na ang quarterly growth ay 4.0 percent; Sa kasalukuyang data ng TÜİK, ang parehong quarter ay binago sa 3.5 porsyento. Sa bagong ulat, sinabi ng analyst sa isang footnote kung aling bersyon ang ginamit niya at ipinaliwanag ang pagkakaiba sa pagitan ng dalawang figure na may rebisyon. Napanatili ng transparency ang kredibilidad.

Talahanayan ng pagpili ng pinagmulan

Layunin

Angkop na pangunahing mapagkukunan

Pansin

Türkiye inflation (CPI/PPI)

TURKSTAT

Batayang taon, pagkakaiba ng core/headline

Halaga ng palitan, interes, kasalukuyang balanse, mga reserba

CBRT EVDS

Rebisyon, kahulugan ng serye

Paghahambing ng GDP/inflation sa pagitan ng mga bansa

IMF WEO

Projection ≠ pagsasakatuparan

Pag-unlad/mahabang makasaysayang serye

World Bank WDI

Saklaw, nawawalang taon

EU harmonized indicator

Eurostat

kahulugan ng HICP

US/global macrofinance, API

FRED

Katayuan ng pana-panahong pagsasaayos

Apat na maaaring kopyahin na mga template

1) Pinagmulan at pagtutugma ng serye:

Kailangan ko ang sumusunod na tagapagpahiwatig: [tagapagpahiwatig, bansa/lalawigan, panahon, dalas, paglalarawan]. Irekomenda ang pinakaangkop na pangunahing opisyal na pinagmulan at buong pangalan ng serye para dito. Ilista ang mga puntong kailangan kong i-verify tungkol sa unit, batayang taon, at paglalarawan ng serye. Huwag magbigay ng mga numero; Sabihin mo lang kung saan at paano ito bibilhin.

2) FRED/World Bank download code:

Sumulat ng code sa Python gamit ang [FRED/World Bank] API na nagda-download ng sumusunod na serye: [code/name ng serye], [range ng petsa]. Dinadala ng code ang data sa pandasDataFrame, ini-print ang una/huling 5 row at ang bilang ng mga nawawalang value. Huwag mo akong bigyan ng halimbawa/made-up figure; magbigay lang ng working code.

3) Listahan ng pagpapatunay ng metadata:

Gagamitin ko ang sumusunod na serye: [serye]. Gumawa ng checklist ng metadata na kailangan mong i-verify bago gamitin: volume, base year, seasonal adjustment status, definition/scope, update date, revision status. Para sa bawat item, isulat ang "ano at saan kumpirmahin" sa isang pangungusap.

4) Dalawang diagnosis ng hindi pagkakatugma ng mapagkukunan:

Nakuha ko ang parehong indicator mula sa dalawang source at ang mga numero ay magkaiba: Source A: [value, imprint]. Pinagmulan B: [halaga, imprint]. Ilista ang mga posibleng inosenteng dahilan para sa pagkakaibang ito (kahulugan, base, saklaw, pana-panahong pagsasaayos, rebisyon, pera) at sabihin sa akin kung paano suriin ang bawat isa. Huwag sabihing "mali ang isa"; Tulungan mo muna akong ipaliwanag ang pagkakaiba.

Mahinang prompt / Malakas na prompt

Mahinang prompt:

Bigyan mo ako ng data ng paglago ng Türkiye sa nakalipas na 10 taon.

Ang AI ay nagbubuhos ng isang larawan mula sa memorya nito, posibleng luma at bahagyang gawa; Walang pinanggalingan o imprint.

Napakahusay na prompt:

Gagamitin ko ang 2014-2023 Türkiye taunang totoong paglago ng GDP. Sabihin sa akin ang pangunahing pinagmumulan nito (TURKSTAT) at ang buong pangalan ng serye; sabihin sa akin kung ang serye ay nakapirming presyo at kung saan titingnan upang i-verify ang batayang taon. Ibigay din ang mga hakbang/code para i-download ang data na ito. Huwag gumawa ng mga numero sa kanilang sarili.

Mga karaniwang pagkakamali

  • Napagkamalan ang talahanayan ng "sample na output" ng artificial intelligence para sa totoong data. Ang mga numerong iyon ay maaaring gawa-gawa; gamitin lang ang code/guideline.
  • Paghahambing ng dalawang serye nang hindi inihanay ang metadata. Ang pagkakaiba sa base/unit/kahulugan ay nagbubunga ng mga huwad na resulta.
  • Napagkamalan ang isang projection para sa katotohanan. Ang bilang ng susunod na taon sa IMF WEO ay isang pagtatantya.
  • Hindi pinapansin ang rebisyon. Hindi sinasabi kung aling bersyon ang iyong ginagamit.
  • Hindi tugma ang dalas. Pagsasama-sama ng buwanang serye sa quarterly na serye nang walang pagwawasto.
  • Hindi binanggit ang pinagmulan sa mga talababa. Ang figure na hindi masusubaybayan ay isang figure na hindi mapanghawakan.

Sa buod

Ang kapangyarihan ng pagsusuri ay ang kapangyarihan ng data. Gamitin ang AI para mahanap ang tamang source, itugma ang serye at magsulat ng download code; ngunit palaging kunin ang figure mula sa pangunahing opisyal na pinagmulan (TURKSTAT, EVDS, IMF, World Bank, Eurostat, FRED). I-neutralize ang mga tahimik na source ng error gaya ng rebisyon, base year, volume, at paglalarawan sa pamamagitan ng pag-align ng metadata. Kung magkasalungat ang dalawang source, ihambing muna ang attribution.

Gawain ng aplikasyon

Pumili ng indicator na madalas mong gamitin sa iyong negosyo. I-extract sa AI ang source at metadata checklist na may mga template 1 at 3 sa itaas. Pagkatapos ay hanapin ang parehong indicator mula sa dalawang magkaibang pinagmulan (hal. TURKSTAT at World Bank) at ihambing ang mga numero; Kung may pagkakaiba, suriin ang dahilan gamit ang template 4 at tandaan ang iyong natuklasan sa tatlong pangungusap.

checklist

  • [ ] Pinili ko ang pangunahing mapagkukunan na angkop para sa aking layunin (ginawa ko ang pagkakaiba sa pagitan ng opisyal / internasyonal na paghahambing ng Türkiye).
  • [ ] Na-verify ko ang unit, batayang taon, paglalarawan at petsa ng pag-update ng serye mula sa opisyal na pahina.
  • [ ] Ginamit ko ang data na kinuha ko mula sa totoong pinagmulan, hindi ang "mga sample na numero" na ibinigay ng artificial intelligence.
  • [ ] Inihambing ko ang hindi bababa sa ilang mga obserbasyon verbatim sa opisyal na publikasyon.
  • [ ] Sinuri ko ang status ng rebisyon/bersyon at binanggit ang bersyon na ginagamit ko.
  • [ ] Ipinaliwanag ko ang dalawang salungatan sa pinagmulan sa pamamagitan ng pag-align ng metadata.
  • [ ] Ginawa kong masubaybayan ang pinagmulan ng bawat figure na ginamit ko gamit ang footnote.