Winst:
- Mogelijkheid om ruwe economische gegevens (ontbrekende waarnemingen, eenheidsverwarring, frequentie-mismatch) op te schonen en gereed te maken voor analyse met behulp van kunstmatige intelligentie
- Mogelijkheid om standaard economische transformaties zoals reëel-nominale conversie, indexering, groeipercentage en seizoensaanpassing als code in kunstmatige intelligentie af te drukken en deze handmatig te verifiëren
- Vermogen om gegevens te herkennen door middel van verkennende gegevensanalyse (samenvattende statistieken, distributie, uitschieters, correlatie) en kritisch lezen van samenvattingen van kunstmatige intelligentie
Economische gegevens zijn zelden gereed voor analyse. In een tabel die u van TURKSTAT hebt gedownload, ontbreken enkele maanden, één kolom komt als tekst met duizend haakjes, de wisselkoers is in Turks formaat zoals "1.234,56", de ene reeks is maandelijks en de andere is driemaandelijks. Het grootste deel van de tijd van de econoom besteedt hij niet aan analyse, maar aan het gereedmaken van de gegevens voor analyse. Dit is waar AI een echte versneller met een laag risico is: het suggereert opruimstappen, schrijft panda's (de gegevensverwerkingsbibliotheek van Python) en codificeert standaard economische transformaties. Maar deze eenheid heeft ook een onveranderlijke regel: je leest elke transformatie die door kunstmatige intelligentie is geschreven en verifieert deze handmatig in ten minste één observatie. Als de reëel-nominale cyclus op de verkeerde voet staat, vervalt de hele analyse stilletjes.
Schoonmaken: welke problemen, hoe deze op te lossen?
De meest voorkomende problemen in economische gegevens en hun logica:
- Onvolledige observatie. Eén maand/kwartaal is leeg. De oplossing hangt af van de context: als het niet echt bestaat, wordt het blanco gelaten; Als er een technische kloof is, wordt er zorgvuldig geïnterpoleerd, maar de grens tussen fabricage is dun.
- Verwarring van eenheden en formaten. De tekst "12.345.6" moet worden omgezet naar een getal; miljoen/miljard moet consistent worden.
- Frequentie komt niet overeen. Om een maandelijkse en driemaandelijkse reeks te combineren, wordt er één geaggregeerd (maandelijks tot driemaandelijks). Of het nu gaat om een gemiddelde, een totaalreeks of een einde van de periode, hangt af van de aard van de indicator (onderscheid tussen aandelen en stromen).
- Uitschieter (extreme) waarden. Als een waarneming enorm afwijkt: is het een echte gebeurtenis (crisis, prijsstijging) of een datafout? Het is begrepen voordat het wordt verwijderd.
- Datumuitlijning. Datumformaten en periodedefinities van verschillende reeksen worden gesynchroniseerd.
Let op: Het invullen van ontbrekende gegevens lijkt onschuldig, maar het is een economische beslissing. Het vullen van een crisismaand met het ‘gemiddelde van de aangrenzende maanden’ betekent dat die crisis uit de analyse wordt verwijderd. Vraag voordat u dit invult: "Waarom bestaat deze kloof?" Beantwoord de vraag.
Standaard economische transformaties
Transformaties en hun definities in het dagelijkse repertoire van een econoom:
- Nominaal → Reëel. Aanpassing voor prijsimpact: reële waarde = nominale waarde / prijsindex × 100. Het basisjaar van de deflator (aanpassingsindex) bepaalt de basis van het resultaat.
- Indexering. Een reeks opnieuw schalen zodat een geselecteerde periode = 100; Het is handig voor het vergelijken van series van verschillende groottes.
- Groeisnelheid. Jaarlijks: (dezelfde periode deze periode / vorig jaar − 1) × 100. Periodiek en op jaarbasis zijn verschillende dingen; Verwarren is een veelgemaakte fout.
- Seizoenscorrectie. Zuiveren van reguliere seizoensinvloeden (zomertoerisme, vakanties); De rauwe series en de seizoensgecorrigeerde series vertellen verschillende verhalen.
- voortschrijdend gemiddelde. De ruis wegnemen en de trend zichtbaar maken.
- Logaritmen en differentiatie. Onderzoek naar groeidynamiek en stationariteit (zal dieper ingaan in de tijdreekseenheid).
Tip: Bij elke conversie wordt u gevraagd: "Wat is er met de eenheid en de basis gebeurd?" vragen. De basis van de echte serie is de basis van de deflator; De basis van de geïndexeerde reeks is de periode die u kiest. Door dit opgeschreven te houden, voorkom je toekomstige fouten.
Verkennende data-analyse (EDA)
Het is noodzakelijk om de gegevens te herkennen voordat deze in het model worden ingevoerd. Exploratieve data-analyse (EDA) omvat: samenvattende statistieken (gemiddelde, mediaan, standaarddeviatie, min-max), vorm van de verdeling, verloop in de tijd, uitschieters en correlatie tussen reeksen. AI genereert snel de code voor deze stappen; Jouw taak is om de resultaten met een economisch oog te lezen: "Is dit gemiddelde redelijk? Is deze correlatie toeval of een bekende relatie?"
Let op: correlatie is hier slechts een identificatiemiddel, geen bewijs van oorzakelijk verband. Het feit dat twee series samengaan (bijvoorbeeld de verkoop van ijs en verdrinkingen – beide veroorzaakt door de zomer) betekent niet noodzakelijkerwijs dat de een tot de ander leidt. In unit 7 zullen we dit onderscheid verdiepen.
drie minikoffers
Geval 1 — Onjuiste deflatorbasis. Een analist liet de kunstmatige intelligentie code schrijven om de loonreeksen te realiseren. De code werkte, het resultaat zag er redelijk uit, maar de analist berekende handmatig 2020 in de stap CALCULATE en het werkte niet. Probleem: de kunstmatige intelligentie gebruikte de deflator met een basis van 2003=100 en vroeg om de loonreeksen met prijzen van 2015; De bases waren met elkaar in conflict. De code werd gerepareerd met een enkele regelfix, de hele serie viel op zijn plaats.
Geval 2 — Stille volumefout. Een instelling had de exportgegevens in duizend dollar en de import in miljoen dollar teruggebracht. Toen de kunstmatige intelligentie deze twee voor de ‘buitenlandse handelsbalans’ verwijderde, was het resultaat een absurd tekort. De min-max-weergave in EDA bracht de fout aan het licht: de orde van grootte van de twee reeksen verschilde met een factor 1000. Nadat de eenheid gelijk was gemaakt, was de balans correct.
Geval 3 — De uitbijter niet verwijderen. Eén maand in een reeks was buitengewoon laag. AI suggereerde "uitbijter, laten we het opruimen". De analist onderzocht het: de productie was die maand feitelijk gestopt vanwege een natuurramp. De waarde was reëel; Het verwijderen ervan zou de geschiedenis vertekenen. In plaats van verwijdering werd er een voetnoot bij gezet. De ‘duidelijke’ aanbeveling van de AI werd niet blindelings opgevolgd.
Conversievalidatietabel
Conversie
formule essentie
handmatig controlepunt
realisatie
nominaal / prijsindex × 100
Deflatorbasis = uitkomstbasis?
jaarlijkse groei
(t / t-12maand − 1)×100
Bereken een periode op papier
indexering
serie/basisperiode × 100
Is de basisperiodewaarde 100?
Maandelijks → driemaandelijks
stroom: verzamelen / voorraad: einde periode
Juiste incassomethode?
voortschrijdend gemiddelde
gemiddelde van de laatste n periode
Is de raamlengte correct?
Vier kopieerbare sjablonen
1) Reinigingsplan:
Ik heb deze onbewerkte gegevens: [kolommen en voorbeeldrijen]. Stel een schoonmaakplan op ter voorbereiding op de analyse: ontbrekende waarde, probleem met eenheid/formaat, datumuitlijning, frequentieuitlijning, mogelijke uitschieters. Leg in één zin uit waarom elke stap nodig is. Schrijf nog geen code; Laat mij eerst het plan bevestigen.
2) Panda's opruimcode:
Schrijf pandacode volgens het plan dat ik heb goedgekeurd. Laat de code bij elke stap aangeven wat hij doet met een commentaarregel; Het drukt het aantal rijen en ontbrekende waarden af na de conversie. Wis niet stilletjes welke observatie dan ook; Rapporteer elke regel die u verwijdert.
3) Realisatie (controleerbaar):
Realiseer deze nominale reeks met [prijsindex]. Schrijf duidelijk het basisjaar van de deflator wanneer u deze gebruikt; Geef op wat de basis van de resulterende reeks is. Laat mij de rekening stap voor stap zien voor één periode, zodat ik deze handmatig kan verifiëren.
4) Samenvatting van de verkennende analyse:
Schrijf verkennende analysecode voor de volgende opgeschoonde gegevens: samenvattende statistieken, tijdreeksplot, uitbijterscan en correlatiematrix. Maak bij het interpreteren van de resultaten duidelijk dat de correlaties die je vindt niet OORZAAK zijn en noem drie punten die mij opvallen.
Zwakke prompt/sterke prompt
Zwakke prompt:
Wis deze gegevens.
AI handelt met aannames zonder te weten wat schoon te maken; Je kunt observaties verwijderen, eenheden veranderen, je merkt het niet.
Krachtige prompt:
In deze maandelijkse gegevens over de buitenlandse handel wordt de export uitgedrukt in "duizend USD" en de import in "miljoen USD". Maak de twee gelijk in "miljoen USD", markeer de ontbrekende maanden maar VUL NIET IN, lijn de datums uit met het einde van de maand. Print hoeveel rijen bij elke stap betrokken zijn; verwijder stil geen rijen. Toon dan het saldo van een enkele maand op een manier die ik handmatig kan controleren.
Veel voorkomende fouten
- Voer de conversiecode uit zonder deze te lezen. De verkeerde basis/eenheid corrumpeert stilletjes de hele analyse.
- Ontbrekende gegevens invullen zonder na te denken. De crisis-/rampperiode uitwissen met het gemiddelde.
- Uitschieters automatisch weggooien. Een echte gebeurtenis aanzien voor een datafout.
- Verwarrende seizoens- en jaarlijkse groei. De twee zijn verschillende maten.
- Frequenties verkeerd combineren. Het verzamelen van de voorraadreeksen en deze als stroom verwerken.
- De correlatie in EDA verwarren met causaliteit. Het herkenningsinstrument als bewijs beschouwen.
Samengevat
Het opschonen en transformeren van data is de onzichtbare maar beslissende 80 procent van de economische analyse. Kunstmatige intelligentie versnelt dit mechanische werk dramatisch; maar het is aan jou om elke opschoonstap en elke transformatie te lezen en ten minste één observatie handmatig te verifiëren. Beslissingen over deflatorbasis, eenheid, frequentie en uitbijter zijn economische beslissingen en kunnen niet blindelings aan kunstmatige intelligentie worden overgelaten. Verkennende analyse introduceert gegevens, maar correlatie is daar geen oorzakelijk verband.
Applicatie taak
Download een actuele ruwe reeks (bijvoorbeeld maandelijkse CPI en een reeks nominale lonen/inkomens). Maak een schoonmaakplan met het 1e sjabloon, laat de code genereren met het 2e sjabloon en realiseer de serie met het 3e sjabloon. Bereken vervolgens de werkelijke waarde van een enkele periode op papier en vergelijk deze met de output van kunstmatige intelligentie. Als u een discrepantie ontdekt, diagnosticeer en corrigeer dan de bron ervan (basis/eenheid) en noteer de voortgang.
controlelijst
- [ ] Ik heb het opruimplan beoordeeld en goedgekeurd voordat de code werd geschreven.
- [ ] Ik heb elke regel laten verwijderen/wijzigen door de gerapporteerde kunstmatige intelligentie; Geen stille verwijdering.
- [ ] Bij het invullen van ontbrekende gegevens kunt u zich afvragen: "Waarom zijn deze leeg?" Ik beantwoordde de vraag.
- [ ] Ik heb onderzocht of de uitbijter een echte gebeurtenis was of een datafout.
- [ ] Bij het besef heb ik geverifieerd dat de deflatorbasis en de uitkomstbasis overeenkomen.
- [ ] Ik heb de conversie van minimaal één periode handmatig herberekend.
- [ ] Ik heb correlaties in EDA niet als oorzakelijk verband gepresenteerd.