Gewinne:
- Möglichkeit, rohe Wirtschaftsdaten (fehlende Beobachtungen, Einheitenverwirrung, Frequenzinkongruenz) zu bereinigen und mithilfe künstlicher Intelligenz für die Analyse vorzubereiten
- Möglichkeit, standardmäßige Wirtschaftstransformationen wie Real-Nominal-Umrechnung, Indexierung, Wachstumsrate, Saisonbereinigung als Code in künstliche Intelligenz zu drucken und manuell zu überprüfen
- Fähigkeit, Daten durch explorative Datenanalyse (Zusammenfassungsstatistik, Verteilung, Ausreißer, Korrelation) zu erkennen und Zusammenfassungen der künstlichen Intelligenz kritisch zu lesen
Wirtschaftsdaten liegen selten bereit für eine Analyse. In einer Tabelle, die Sie von TURKSTAT heruntergeladen haben, fehlen einige Monate, eine Spalte ist Text mit tausend Klammern, der Wechselkurs ist im türkischen Format wie „1,234,56“, eine Reihe ist monatlich und die andere ist vierteljährlich. Die meiste Zeit eines Wirtschaftswissenschaftlers wird nicht mit der Analyse verbracht, sondern damit, die Daten für die Analyse vorzubereiten. Hier ist KI ein echter, risikoarmer Beschleuniger: Sie schlägt Aufräumschritte vor, schreibt Pandas (Pythons Datenverarbeitungsbibliothek) und kodifiziert standardmäßige wirtschaftliche Transformationen. Aber auch diese Einheit hat eine unveränderliche Regel: Sie lesen jede von künstlicher Intelligenz geschriebene Transformation und verifizieren sie manuell in mindestens einer Beobachtung. Wenn der Real-Nominal-Zyklus auf einer falschen Grundlage steht, verfällt die gesamte Analyse stillschweigend.
Reinigung: Welche Probleme, wie kann man sie lösen?
Die häufigsten Probleme bei Wirtschaftsdaten und ihre Logik:
- Unvollständige Beobachtung. Ein Monat/Quartal ist leer. Die Lösung hängt vom Kontext ab: Wenn sie tatsächlich nicht existiert, bleibt sie leer; Wenn es eine technische Lücke gibt, erfolgt eine sorgfältige Interpolation – aber die Grenze zwischen Herstellung ist schmal.
- Verwirrung von Einheiten und Formaten. Der Text „12.345.6“ muss in eine Zahl umgewandelt werden; Million/Milliarde sollte konsistent werden.
- Frequenzinkongruenz. Um eine monatliche und eine vierteljährliche Reihe zu kombinieren, wird eine davon aggregiert (monatlich bis vierteljährlich) – ob es sich um einen Durchschnitt, einen Gesamtwert oder einen Periodenendwert handelt, hängt von der Art des Indikators ab (Bestands-/Flussunterscheidung).
- Ausreißerwerte (extreme Werte). Wenn eine Beobachtung stark abweicht: Handelt es sich um ein reales Ereignis (Krise, Preisanstieg) oder um einen Datenfehler? Es wird vor dem Löschen verstanden.
- Datumsausrichtung. Datumsformate und Periodendefinitionen verschiedener Serien werden synchronisiert.
Achtung: Das Ausfüllen fehlender Daten scheint harmlos, ist aber eine wirtschaftliche Entscheidung. Das Füllen eines Krisenmonats mit dem „Durchschnitt benachbarter Monate“ bedeutet, dass diese Krise aus der Analyse gelöscht wird. Fragen Sie vor dem Ausfüllen: „Warum besteht diese Lücke?“ Beantworten Sie die Frage.
Standardökonomische Transformationen
Transformationen und ihre Definitionen im täglichen Repertoire eines Ökonomen:
- Nominal → Real. Bereinigt um Preisauswirkungen: Realwert = Nominalwert / Preisindex × 100. Das Basisjahr des Deflators (Anpassungsindex) bestimmt die Basis des Ergebnisses.
- Indizierung. Neuskalierung einer Reihe, so dass ein ausgewählter Zeitraum = 100; Es ist nützlich, um Serien unterschiedlicher Größe zu vergleichen.
- Wachstumsrate. Jährlich: (gleicher Zeitraum in diesem Zeitraum / letztes Jahr − 1) × 100. Periodische und annualisierte Rate sind verschiedene Dinge; Verwirren ist ein häufiger Fehler.
- Saisonale Korrektur. Reinigung regelmäßiger saisonaler Effekte (Sommertourismus, Feiertage); Die Rohserie und die saisonbereinigte Serie erzählen unterschiedliche Geschichten.
- Gleitender Durchschnitt. Den Lärm glätten und den Trend sichtbar machen.
- Logarithmen und Differenzierung. Wachstumsdynamik und Stationarität untersuchen (wird in der Zeitreiheneinheit vertieft).
Tipp: Bei jedem Umbau werden Sie gefragt: „Was ist mit der Einheit und der Basis passiert?“ fragen. Die Basis der realen Reihe ist die Basis des Deflators; Die Basis der indizierten Reihe ist der von Ihnen gewählte Zeitraum. Wenn Sie dies schriftlich festhalten, vermeiden Sie zukünftige Fehler.
Explorative Datenanalyse (EDA)
Es ist notwendig, die Daten zu erkennen, bevor sie in das Modell eingegeben werden. Die explorative Datenanalyse (EDA) umfasst: zusammenfassende Statistiken (Mittelwert, Median, Standardabweichung, Min-Max), Form der Verteilung, Verlauf über die Zeit, Ausreißer und Korrelation zwischen Reihen. KI generiert schnell den Code für diese Schritte; Ihre Aufgabe ist es, die Ausgabe mit einem wirtschaftlichen Blick zu lesen: „Ist dieser Durchschnitt vernünftig? Ist diese Korrelation ein Zufall oder eine bekannte Beziehung?“
Achtung: Korrelation ist hier nur ein Mittel zur Identifizierung, kein Beweis für einen Kausalzusammenhang. Die Tatsache, dass zwei Serien zusammenlaufen (z. B. Eisverkauf und Ertrinken – beides ausgelöst durch den Sommer), bedeutet nicht unbedingt, dass die eine zur anderen führt. Wir werden diese Unterscheidung in Einheit 7 vertiefen.
drei Mini-Koffer
Fall 1 – Falsche Deflatorbasis. Ein Analyst ließ die künstliche Intelligenz Code schreiben, um die Lohnreihen zu realisieren. Der Code funktionierte, das Ergebnis sah vernünftig aus – aber der Analyst hat das Jahr 2020 im Schritt CALCULATE manuell berechnet und es hat nicht funktioniert. Problem: Die künstliche Intelligenz verwendete den Deflator mit einer Basis von 2003=100 und forderte die Lohnreihe mit Preisen von 2015 an; Die Grundlagen waren widersprüchlich. Der Code wurde mit einem einzeiligen Fix repariert, die gesamte Serie passte zusammen.
Fall 2 – Silent-Volume-Fehler. Eine Institution hatte die Exportdaten in Tausend Dollar und die Importe in Millionen Dollar reduziert. Als die künstliche Intelligenz die beiden für die „Außenhandelsbilanz“ entfernte, ergab sich ein absurdes Defizit. Die Min-Max-Ansicht in EDA offenbarte den Fehler: Die Größenordnung der beiden Serien unterschied sich um den Faktor 1000. Nachdem die Einheit angeglichen war, war die Balance korrekt.
Fall 3 – Der Ausreißer wird nicht gelöscht. Ein Monat in Folge war außergewöhnlich niedrig. Die KI schlug vor: „Ausreißer, lasst es uns bereinigen“. Der Analyst untersuchte: Aufgrund einer Naturkatastrophe in diesem Monat war die Produktion tatsächlich eingestellt worden. Der Wert war real; Eine Löschung würde den Verlauf verzerren. Anstelle einer Löschung wurde es mit einer Fußnote versehen. Der „klaren“ Empfehlung der KI wurde nicht blind gefolgt.
Konvertierungsvalidierungstabelle
Konvertierung
Formel-Essenz
manueller Kontrollpunkt
Erkenntnis
Nominal / Preisindex × 100
Deflatorbasis = Ergebnisbasis?
jährliches Wachstum
(t / t-12Monat − 1)×100
Berechnen Sie einen Zeitraum auf Papier
Indizierung
Serie/Basiszeitraum × 100
Ist der Basiszeitraumwert 100?
Monatlich→vierteljährlich
Fluss: Sammeln / Lagern: Ende der Periode
Richtige Sammelmethode?
gleitender Durchschnitt
Durchschnitt der letzten n Perioden
Stimmt die Fensterlänge?
Vier kopierbare Vorlagen
1) Reinigungsplan:
Ich habe diese Rohdaten: [Spalten und Beispielzeilen]. Erstellen Sie einen Reinigungsplan zur Vorbereitung der Analyse: fehlender Wert, Einheits-/Formatproblem, Datumsausrichtung, Häufigkeitsausrichtung, mögliche Ausreißer. Erklären Sie in einem Satz, warum jeder Schritt notwendig ist. Schreiben Sie noch keinen Code; Lassen Sie mich zunächst den Plan bestätigen.
2) Pandas-Bereinigungscode:
Schreiben Sie Pandas-Code gemäß dem von mir genehmigten Plan. Lassen Sie den Code mit einer Kommentarzeile angeben, was er bei jedem Schritt tut. Es gibt die Anzahl der Zeilen und fehlenden Werte nach der Konvertierung aus. Löschen Sie keine Beobachtung stillschweigend; Melden Sie jede Zeile, die Sie löschen.
3) Umsetzung (nachweisbar):
Realisieren Sie diese Nominalreihe mit [Preisindex]. Geben Sie das Basisjahr des Deflators deutlich an, wenn Sie ihn verwenden. Geben Sie die Basis der resultierenden Reihe an. Zeigen Sie mir das Konto Schritt für Schritt für einen einzelnen Zeitraum, damit ich es manuell überprüfen kann.
4) Zusammenfassung der explorativen Analyse:
Schreiben Sie explorativen Analysecode für die folgenden bereinigten Daten: zusammenfassende Statistiken, Zeitreihendiagramm, Ausreißerscan und Korrelationsmatrix. Machen Sie bei der Interpretation der Ergebnisse deutlich, dass die Zusammenhänge, die Sie finden, nicht kausal sind und nennen Sie 3 Punkte, die mir auffallen.
Schwache Eingabeaufforderung / Starke Eingabeaufforderung
Schwache Eingabeaufforderung:
Löschen Sie diese Daten.
KI handelt mit Annahmen, ohne zu wissen, was sie bereinigen soll; Sie können Beobachtungen löschen, Einheiten ändern, Sie werden es nicht bemerken.
Kraftvolle Aufforderung:
In diesen monatlichen Außenhandelsdaten werden die Exporte in „Tausend USD“ und die Importe in „Millionen USD“ angegeben. Machen Sie die beiden in „Millionen USD“ gleich, markieren Sie die fehlenden Monate, füllen Sie sie jedoch NICHT aus und richten Sie die Daten am Ende des Monats aus. Drucken Sie aus, wie viele Zeilen bei jedem Schritt betroffen sind. Keine Zeilen stillschweigend löschen. Zeigen Sie dann den Saldo für einen einzelnen Monat so an, dass ich ihn manuell überprüfen kann.
Häufige Fehler
- Den Konvertierungscode ausführen, ohne ihn zu lesen. Die falsche Basis/Einheit verfälscht stillschweigend die gesamte Analyse.
- Fehlende Daten ohne nachzudenken ergänzen. Die Krisen-/Katastrophenperiode mit dem Durchschnitt auslöschen.
- Ausreißer automatisch verwerfen. Ein reales Ereignis mit einem Datenfehler verwechseln.
- Verwirrendes saisonales und jährliches Wachstum. Die beiden sind unterschiedlich groß.
- Frequenzen falsch kombinieren. Sammeln Sie die Bestandsserie und verarbeiten Sie sie als Fluss.
- Die Korrelation in EDA wird mit Kausalität verwechselt. Das Erkennungstool als Beweismittel verwechseln.
Zusammenfassend
Datenbereinigung und -transformation sind die unsichtbaren, aber entscheidenden 80 Prozent der Wirtschaftsanalyse. Künstliche Intelligenz beschleunigt diese mechanische Arbeit enorm; Es liegt jedoch an Ihnen, jeden Bereinigungsschritt und jede Transformation zu lesen und mindestens eine Beobachtung manuell zu überprüfen. Entscheidungen über Deflatorbasis, Einheit, Häufigkeit und Ausreißer sind wirtschaftliche Entscheidungen und können nicht blind der künstlichen Intelligenz überlassen werden. Bei der explorativen Analyse werden Daten eingeführt, aber durch Korrelation ergibt sich kein Kausalzusammenhang.
Anwendungsaufgabe
Laden Sie eine tatsächliche Rohdatenreihe herunter (z. B. den monatlichen VPI und eine Nominallohn-/Einkommensreihe). Erstellen Sie einen Reinigungsplan mit der 1. Vorlage, lassen Sie den Code mit der 2. Vorlage generieren und realisieren Sie die Serie mit der 3. Vorlage. Berechnen Sie dann den tatsächlichen Wert einer einzelnen Periode auf dem Papier und vergleichen Sie ihn mit dem Ergebnis künstlicher Intelligenz. Wenn Sie eine Nichtübereinstimmung feststellen, diagnostizieren und korrigieren Sie die Ursache (Basis/Einheit) und notieren Sie den Fortschritt.
Checkliste
- [ ] Ich habe den Bereinigungsplan überprüft und genehmigt, bevor der Code geschrieben wurde.
- [ ] Ich habe jede Zeile von der künstlichen Intelligenz löschen/ändern lassen; Kein stilles Löschen.
- [ ] Beim Ausfüllen fehlender Daten fragen Sie sich möglicherweise: „Warum ist es leer?“ Ich habe die Frage beantwortet.
- [ ] Ich habe untersucht, ob der Ausreißer ein reales Ereignis oder ein Datenfehler war.
- [ ] Bei der Realisierung habe ich überprüft, ob die Deflatorbasis und die Ergebnisbasis übereinstimmen.
- [ ] Ich habe die Umrechnung von mindestens einer Periode manuell neu berechnet.
- [ ] Ich habe Korrelationen in EDA nicht als Kausalität dargestellt.