Gevinster:
- Evne til at rense rå økonomiske data (manglende observationer, enhedsforvirring, frekvensmismatch) og gøre dem klar til analyse ved hjælp af kunstig intelligens
- Evne til at udskrive standard økonomiske transformationer såsom real-nominel konvertering, indeksering, vækstrate, sæsonjustering som kode til kunstig intelligens og verificere dem manuelt
- Evne til at genkende data gennem undersøgende dataanalyse (sammenfattende statistik, distribution, outliers, korrelation) og kritisk læse resuméer af kunstig intelligens
Økonomiske data kommer sjældent klar til analyse. I en tabel du har downloadet fra TURKSTAT mangler nogle måneder, en kolonne kommer som tekst med tusinde parenteser, valutakursen er i tyrkisk format som "1.234,56", den ene serie er månedlig og den anden er kvartalsvis. Det meste af økonomens tid bruges ikke på analyse, men på at gøre data klar til analyse. Det er her AI er en reel accelerator med lav risiko: den foreslår oprydningstrin, skriver pandas (Pythons databehandlingsbibliotek), kodificerer standard økonomiske transformationer. Men denne enhed har også en uforanderlig regel: Du læser hver transformation skrevet af kunstig intelligens og verificerer den manuelt i mindst én observation. Hvis den real-nominelle cyklus er på det forkerte grundlag, forfalder hele analysen stille og roligt.
Rengøring: hvilke problemer, hvordan løser man dem?
De mest almindelige problemer i økonomiske data og deres logik:
- Ufuldstændig observation. En måned/kvartal er tom. Løsningen afhænger af konteksten: hvis den faktisk ikke eksisterer, efterlades den tom; Hvis der er et teknisk hul, udføres omhyggelig interpolation - men grænsen mellem fremstilling er tynd.
- Forvirring af enheder og formater. Teksten "12.345.6" skal konverteres til et tal; million/milliard bør blive konsekvent.
- Frekvens uoverensstemmelse. For at kombinere en månedlig og kvartalsvis serie aggregeres en (månedlig til kvartalsvis) - om den er gennemsnitlig, total eller slutningen af perioden afhænger af indikatorens art (beholdning/flow-forskel).
- Outlier (ekstrem) værdier. Hvis en observation afviger vildt: er det en reel begivenhed (krise, prisstigning) eller en datafejl? Det er forstået før sletning.
- Datojustering. Datoformater og periodedefinitioner for forskellige serier synkroniseres.
Bemærk: At udfylde manglende data virker uskyldigt, men det er en økonomisk beslutning. At fylde en krisemåned med "gennemsnittet af nabomåneder" betyder at slette krisen fra analysen. Inden du udfylder, spørg "hvorfor eksisterer dette hul?" Besvar spørgsmålet.
Standard økonomiske transformationer
Transformationer og deres definitioner i en økonoms daglige repertoire:
- Nominel → Ægte. Justering for prispåvirkning: reel værdi = nominel værdi / prisindeks × 100. Basisåret for deflatoren (justerende indeks) bestemmer grundlaget for resultatet.
- Indeksering. Omskalering af en serie, så en valgt periode = 100; Det er nyttigt til at sammenligne serier af forskellige størrelser.
- Væksthastighed. Årlig: (samme periode denne periode / sidste år − 1) × 100. Periodisk og annualiseret sats er forskellige ting; Forvirring er en almindelig fejl.
- Sæsonkorrektion. Rensende regelmæssige sæsonmæssige effekter (sommerturisme, ferier); Råserien og den sæsonkorrigerede serie fortæller forskellige historier.
- Glidende gennemsnit. Udjævner støjen og gør trenden synlig.
- Logaritmer og differentiering. At undersøge vækstdynamik og stationaritet (vil blive dybere i tidsserieenheden).
Tip: Ved hver konvertering bliver du spurgt "hvad skete der med enheden og basen?" spørge. Basen af den rigtige serie er basen af deflatoren; Grundlaget for den indekserede serie er den periode, du vælger. At holde dette nedskrevet forhindrer fremtidige fejl.
Udforskende dataanalyse (EDA)
Det er nødvendigt at genkende dataene, før de indtastes i modellen. Eksplorativ dataanalyse (EDA) omfatter: opsummerende statistik (middelværdi, median, standardafvigelse, min-max), fordelingsform, forløb over tid, outliers og korrelation mellem serier. AI genererer hurtigt koden til disse trin; Din opgave er at læse outputtet med et økonomisk øje: "Er dette gennemsnit rimeligt? Er denne sammenhæng en tilfældighed eller et kendt forhold?"
Forsigtig: Korrelation er kun et middel til identifikation her, ikke bevis for årsagssammenhæng. Det faktum, at to serier flytter sammen (f.eks. issalg og drukninger - begge udløst af sommeren) indikerer ikke nødvendigvis, at det ene fører til det andet. Vi vil uddybe denne sondring i enhed 7.
tre minisager
Tilfælde 1 — Forkert deflatorbase. En analytiker fik den kunstige intelligens til at skrive kode til at realisere lønrækken. Koden virkede, resultatet så fornuftigt ud - men analytikeren beregnede manuelt 2020 i CALCUATE-trinnet, og det virkede ikke. Problem: den kunstige intelligens brugte deflatoren med en base på 2003=100 og anmodede om lønserien med 2015-priser; Baserne var modstridende. Koden blev repareret med en enkelt linje fix, hele serien faldt på plads.
Tilfælde 2 — Tavs lydstyrkefejl. En institution havde reduceret eksportdata i tusinde dollars og import i millioner dollars. Da den kunstige intelligens fjernede de to for "udenrigshandelsbalancen", var resultatet et absurd underskud. Min-max-visningen i EDA afslørede fejlen: størrelsesordenen af de to serier afveg med en faktor på 1000. Når enheden var udlignet, var balancen korrekt.
Tilfælde 3 — Sletning af outlieren ikke. En måned i træk var ekstraordinært lavt. AI foreslog "outlier, lad os rense det". Analytikeren undersøgte: produktionen var faktisk stoppet på grund af en naturkatastrofe den måned. Værdien var reel; Sletning ville forvrænge historien. I stedet for sletning blev det noteret med fodnoter. AI's "klare" anbefaling blev ikke fulgt blindt.
Konverteringsvalideringstabel
Konvertering
formel essens
manuelt kontrolpunkt
erkendelse
nominelt / prisindeks × 100
Deflatorbase = resultatbase?
årlig vækst
(t / t-12 måneder − 1)×100
Beregn en periode på papir
indeksering
serie/basisperiode × 100
Er basisperiodeværdien 100?
Månedligt→kvartalt
flow: indsamle / lager: slutningen af perioden
Korrekt indsamlingsmetode?
glidende gennemsnit
sidste n periode gennemsnit
Er vindueslængden korrekt?
Fire kopierbare skabeloner
1) Rengøringsplan:
Jeg har disse rådata: [kolonner og prøverækker]. Kom med en rengøringsplan for at forberede analyse: manglende værdi, problem med enhed/format, datojustering, frekvensjustering, mulige outliers. Forklar i én sætning, hvorfor hvert trin er nødvendigt. Skriv ikke kode endnu; lad mig bekræfte planen først.
2) pandas oprydningskode:
Skriv pandas kode i henhold til den plan, jeg godkendte. Lad koden angive, hvad den gør ved hvert trin med en kommentarlinje; Den udskriver antallet af rækker og manglende værdier efter konverteringen. Slet ikke stille nogen observation; Rapporter hver linje, du sletter.
3) Realisering (verificerbar):
Realiser denne nominelle serie med [prisindeks]. Skriv tydeligt basisåret for deflatoren, når du bruger den; Angiv, hvad bunden af den resulterende serie er. Vis mig kontoen trin for trin for en enkelt periode, så jeg kan bekræfte den manuelt.
4) Opsummerende analyseoversigt:
Skriv udforskende analysekode for følgende rensede data: opsummerende statistik, tidsserieplot, outlier-scanning og korrelationsmatrix. Når du fortolker resultaterne, skal du gøre det klart, at de sammenhænge, du finder, ikke er KAUSALE og opregn 3 punkter, der skiller sig ud for mig.
Svag prompt / Stærk prompt
Svag prompt:
Ryd disse data.
AI handler med antagelser uden at vide, hvad der skal renses; Du kan slette observationer, ændre enheder, du vil ikke bemærke.
Kraftig prompt:
I disse månedlige udenrigshandelsdata er eksporten i "tusind USD", og importen er i "millioner USD". Gør de to lige i "million USD", marker de manglende måneder, men FYLD IKKE, juster datoerne til slutningen af måneden. Udskriv, hvor mange rækker der er berørt ved hvert trin; slet ingen rækker stille. Vis derefter saldoen for en enkelt måned på en måde, som jeg manuelt kan tjekke.
Almindelige fejl
- Kører konverteringskoden uden at læse den. Den forkerte base/enhed ødelægger lydløst hele analysen.
- At udfylde manglende data uden at tænke. Sletning af krise-/katastrofeperioden med gennemsnittet.
- Kassér automatisk outliers. Forveksler en reel hændelse med en datafejl.
- Forvirrende sæson- og årlig vækst. De to er forskellige størrelser.
- Kombination af frekvenser forkert. Indsamling af lagerserien og bearbejdning af den som et flow.
- Forveksler korrelationen i EDA med kausalitet. At tage fejl af genkendelsesværktøjet som bevis.
Sammenfattende
Datarensning og transformation er de usynlige, men afgørende 80 procent af økonomisk analyse. Kunstig intelligens fremskynder dette mekaniske arbejde dramatisk; men det er op til dig at læse hvert oprydningstrin og hver transformation og manuelt bekræfte mindst én observation. Deflatorbase-, enheds-, frekvens- og outlier-beslutninger er økonomiske beslutninger og kan ikke blindt overlades til kunstig intelligens. Eksplorativ analyse introducerer data, men sammenhæng er der ikke årsagssammenhæng.
Ansøgningsopgave
Download en faktisk råserie (f.eks. månedlig CPI og en nominel løn/indkomstserie). Lav en rengøringsplan med 1. skabelon, få koden genereret med 2. skabelon, og realiser serien med 3. skabelon. Beregn derefter den reelle værdi af en enkelt periode på papir og sammenlign den med outputtet af kunstig intelligens. Hvis du finder en uoverensstemmelse, skal du diagnosticere og rette dens kilde (base/enhed) og notere fremskridtene.
tjekliste
- [ ] Jeg gennemgik og godkendte oprydningsplanen, før koden blev skrevet.
- [ ] Jeg fik hver linje slettet/ændret af den kunstige intelligens rapporteret; Ingen stille sletning.
- [ ] Når du udfylder manglende data, kan du spørge "hvorfor er den tom?" Jeg besvarede spørgsmålet.
- [ ] Jeg undersøgte, om afvigelsen var en reel hændelse eller en datafejl.
- [ ] I realiseringen bekræftede jeg, at deflatorbasen og resultatbasen matcher.
- [ ] Jeg har manuelt genberegnet konverteringen af mindst én periode.
- [ ] Jeg præsenterede ikke korrelationer i EDA som årsagssammenhæng.