Jednostka 3 / 11

Czyszczenie danych, transformacja i analiza eksploracyjna (z obsługą Pythona/pand)

Zyski:

  • Możliwość oczyszczenia surowych danych ekonomicznych (brakujące obserwacje, pomieszanie jednostek, niedopasowanie częstotliwości) i przygotowania ich do analizy za pomocą sztucznej inteligencji
  • Możliwość wydrukowania standardowych przekształceń gospodarczych takich jak przeliczenie realno-nominalne, indeksacja, dynamika wzrostu, korekta sezonowa w postaci kodu do sztucznej inteligencji i ich ręcznej weryfikacji
  • Umiejętność rozpoznawania danych poprzez eksploracyjną analizę danych (statystyki podsumowujące, dystrybucja, wartości odstające, korelacja) i krytyczne czytanie podsumowań sztucznej inteligencji

Dane ekonomiczne rzadko są gotowe do analizy. W tabeli pobranej z TURKSTAT brakuje kilku miesięcy, jedna kolumna zawiera tekst z tysiącem nawiasów, kurs wymiany jest w formacie tureckim, np. „1.234,56”, jedna seria jest miesięczna, a druga kwartalna. Większość czasu ekonomisty nie spędza na analizie, ale na przygotowywaniu danych do analizy. W tym miejscu sztuczna inteligencja jest prawdziwym akceleratorem niskiego ryzyka: sugeruje kroki porządkowe, pisze pandy (bibliotekę przetwarzania danych w Pythonie), kodyfikuje standardowe transformacje gospodarcze. Ale i w tej jednostce obowiązuje niezmienna zasada: każdą transformację zapisaną przez sztuczną inteligencję czytasz i weryfikujesz ją ręcznie w przynajmniej jednej obserwacji. Jeżeli cykl realno-nominalny jest oparty na niewłaściwych podstawach, cała analiza po cichu zanika.

Sprzątanie: jakie problemy, jak je rozwiązać?

Najczęstsze problemy danych ekonomicznych i ich logika:

  • Niekompletna obserwacja. Jeden miesiąc/kwartał jest pusty. Rozwiązanie zależy od kontekstu: jeśli w rzeczywistości nie istnieje, pozostawia się je puste; Jeśli istnieje luka techniczna, przeprowadza się ostrożną interpolację, ale granica pomiędzy produkcją jest cienka.
  • Pomieszanie jednostek i formatów. Tekst „12.345.6” należy przekonwertować na liczbę; milion/miliard powinny stać się spójne.
  • Niedopasowanie częstotliwości. Aby połączyć szereg miesięczny i kwartalny, należy zastosować szereg agregowany (miesięczny do kwartalnego) — to, czy jest to cykl średni, całkowity czy koniec okresu, zależy od charakteru wskaźnika (rozróżnienie stanu/przepływu).
  • Wartości odstające (ekstremalne). Jeśli obserwacje odbiegają od normy: czy jest to rzeczywiste wydarzenie (kryzys, podwyżka cen), czy błąd w danych? Rozumie się to przed usunięciem.
  • Wyrównanie daty. Synchronizowane są formaty dat i definicje okresów różnych serii.
Uwaga: Uzupełnienie brakujących danych wydaje się niewinne, jednak jest to decyzja ekonomiczna. Wypełnienie miesiąca kryzysowego „średnią miesięcy sąsiednich” oznacza usunięcie tego kryzysu z analizy. Przed wypełnieniem zapytaj „dlaczego istnieje ta luka?” Odpowiedz na pytanie.

Standardowe przemiany gospodarcze

Przekształcenia i ich definicje w codziennym repertuarze ekonomisty:

  • Nominalny → Rzeczywisty. Korekta o wpływ cen: wartość realna = wartość nominalna / wskaźnik cen × 100. Podstawą wyniku jest rok bazowy deflatora (wskaźnik korygujący).
  • Indeksowanie. Przeskalowanie serii tak, aby wybrany okres = 100; Jest to przydatne do porównywania serii o różnych rozmiarach.
  • Tempo wzrostu. Roczna: (ten sam okres w tym okresie / ostatni rok – 1) × 100. Stawka okresowa i roczna to różne rzeczy; Zamieszanie jest częstym błędem.
  • Korekta sezonowa. Oczyszczanie regularnych efektów sezonowych (turystyka letnia, wczasy); Serie surowe i serie dostosowane sezonowo opowiadają różne historie.
  • Średnia krocząca. Wygładzenie szumu i uwidocznienie trendu.
  • Logarytmy i różniczkowanie. Zbadanie dynamiki wzrostu i stacjonarności (pogłębię się w jednostce szeregów czasowych).
Wskazówka: przy każdej konwersji zostaniesz zapytany „co się stało z jednostką i bazą?” zapytać. Podstawą szeregu rzeczywistego jest podstawa deflatora; Podstawą szeregu indeksowanego jest wybrany przez Ciebie okres. Zapisanie tego pozwoli uniknąć błędów w przyszłości.

Eksploracyjna analiza danych (EDA)

Konieczne jest rozpoznanie danych przed wprowadzeniem ich do modelu. Eksploracyjna analiza danych (EDA) obejmuje: statystyki podsumowujące (średnia, mediana, odchylenie standardowe, min-max), kształt rozkładu, przebieg w czasie, wartości odstające i korelację między seriami. AI szybko generuje kod dla tych kroków; Twoim zadaniem jest odczytanie wyników ekonomicznie: „Czy ta średnia jest rozsądna? Czy ta korelacja to przypadek czy znana zależność?”

Uwaga: korelacja jest tutaj jedynie środkiem identyfikacji, a nie dowodem związku przyczynowego. Fakt, że dwie serie występują razem (np. sprzedaż lodów i utonięcia – obie spowodowane latem) niekoniecznie oznacza, że ​​jedna prowadzi do drugiej. Pogłębimy to rozróżnienie w części 7.

trzy mini etui

Przypadek 1 — Nieprawidłowa podstawa deflatora. Analityk zlecił sztucznej inteligencji napisanie kodu w celu realizacji szeregu płac. Kod zadziałał, wynik wyglądał rozsądnie — ale analityk ręcznie obliczył rok 2020 w kroku OBLICZ i to nie zadziałało. Problem: sztuczna inteligencja użyła deflatora o podstawie 2003=100 i zażądała szeregu płac z cenami z 2015 roku; Podstawy były sprzeczne. Kod został naprawiony za pomocą poprawki w jednej linijce, cała seria znalazła się na swoim miejscu.

Przypadek 2 — Błąd cichej głośności. Pewna instytucja obniżyła dane dotyczące eksportu w tysiącach dolarów i importu w milionach dolarów. Kiedy sztuczna inteligencja usunęła te dwa elementy z „bilansu handlu zagranicznego”, efektem był absurdalny deficyt. Widok wartości min-maks w EDA ujawnił błąd: rząd wielkości obu serii różnił się 1000-krotnie. Po wyrównaniu jednostek równowaga była prawidłowa.

Przypadek 3 — Nieusunięcie wartości odstającej. Jeden miesiąc z serii był wyjątkowo niski. Sztuczna inteligencja zasugerowała „wartość odstającą, wyczyśćmy ją”. Analityk zbadał: produkcja faktycznie została zatrzymana w tym miesiącu z powodu klęski żywiołowej. Wartość była prawdziwa; Usunięcie go zniekształciłoby historię. Zamiast skreślić, został dodany przypis. „Jasnych” zaleceń AI nie zastosowano się ślepo.

Tabela sprawdzania konwersji

Konwersja

esencja formuły

ręczny punkt kontrolny

realizacja

nominalny / wskaźnik cen × 100

Baza deflatora = baza wyniku?

roczny wzrost

(t/t-12mies. – 1)×100

Oblicz okres na papierze

indeksowanie

seria/okres bazowy × 100

Czy wartość okresu bazowego wynosi 100?

Miesięcznie → kwartalnie

przepływ: odbiór / magazyn: koniec okresu

Prawidłowa metoda zbierania?

średnia ruchoma

średnia z ostatniego n okresu

Czy długość okna jest prawidłowa?

Cztery szablony do kopiowania

1) Plan czyszczenia:

Mam te surowe dane: [kolumny i przykładowe wiersze]. Opracuj plan czyszczenia, aby przygotować się do analizy: brakująca wartość, problem z jednostką/formatem, wyrównanie dat, wyrównanie częstotliwości, możliwe wartości odstające. Wyjaśnij w jednym zdaniu, dlaczego każdy krok jest konieczny. Nie pisz jeszcze kodu; pozwól mi najpierw potwierdzić plan.

2) kod czyszczenia pand:

Napisz kod pandy zgodnie z zatwierdzonym przeze mnie planem. Niech kod wskazuje, co robi na każdym kroku, za pomocą linii komentarza; Wypisuje liczbę wierszy i brakujące wartości po konwersji. Nie usuwaj po cichu żadnych obserwacji; Zgłaszaj każdą usuniętą linię.

3) Realizacja (weryfikowalna):

Zrealizuj tę nominalną serię za pomocą [wskaźnika cen]. Zapisz wyraźnie rok bazowy deflatora, kiedy go używasz; Określ, jaka jest podstawa wynikowego szeregu. Pokaż mi konto krok po kroku za jeden okres, żebym mógł je zweryfikować ręcznie.

4) Podsumowanie analizy eksploracyjnej:

Napisz kod analizy eksploracyjnej dla następujących oczyszczonych danych: statystyki podsumowujące, wykres szeregów czasowych, skanowanie wartości odstających i macierz korelacji. Interpretując wyniki, wyjaśnij, że znalezione korelacje nie mają charakteru PRZYCZYNOWEGO i wymień 3 punkty, które moim zdaniem wyróżniają się.

Słaba zachęta/silna zachęta

Słaba zachęta:

Wyczyść te dane.

AI działa z założeniami, nie wiedząc, co wyczyścić; Możesz usuwać obserwacje, zmieniać jednostki, czego nie zauważysz.

Potężny monit:

W tych miesięcznych danych dotyczących handlu zagranicznego eksport jest w „tys. USD”, a import w „mln USD”. Zrównaj te dwie kwoty w „milionach USD”, zaznacz brakujące miesiące, ale NIE WYPEŁNIAJ, wyrównaj daty do końca miesiąca. Wydrukuj liczbę wierszy, których dotyczy każdy krok; cicho nie usuwaj żadnych wierszy. Następnie pokaż saldo za jeden miesiąc w sposób, który będę mógł sprawdzić ręcznie.

Typowe błędy

  • Uruchamianie kodu konwersji bez jego czytania. Niewłaściwa baza/jednostka po cichu psuje całą analizę.
  • Uzupełnianie brakujących danych bez zastanowienia. Wymazywanie okresu kryzysu/katastrofy za pomocą średniej.
  • Automatycznie odrzucaj wartości odstające. Mylenie prawdziwego zdarzenia z błędem danych.
  • Mylący wzrost sezonowy i roczny. Obydwa mają różne rozmiary.
  • Nieprawidłowe łączenie częstotliwości. Zbieranie serii zapasów i przetwarzanie ich jako przepływu.
  • Mylenie korelacji w EDA z przyczynowością. Uznanie narzędzia rozpoznawczego za dowód.

Podsumowując

Czyszczenie i przekształcanie danych to niewidoczne, ale decydujące 80 procent analizy ekonomicznej. Sztuczna inteligencja radykalnie przyspiesza tę mechaniczną pracę; ale do Ciebie należy przeczytanie każdego etapu czyszczenia i każdej transformacji oraz ręczne zweryfikowanie co najmniej jednej obserwacji. Decyzje dotyczące podstawy, jednostki, częstotliwości i wartości odstających deflatora są decyzjami ekonomicznymi i nie można ich ślepo pozostawić sztucznej inteligencji. Analiza eksploracyjna wprowadza dane, ale korelacja nie ma związku przyczynowego.

Zadanie aplikacji

Pobierz rzeczywistą surową serię (np. miesięczny CPI i serię nominalnych wynagrodzeń/dochodów). Utwórz plan sprzątania za pomocą pierwszego szablonu, wygeneruj kod za pomocą drugiego szablonu i zrealizuj serię za pomocą trzeciego szablonu. Następnie oblicz rzeczywistą wartość pojedynczego okresu na papierze i porównaj ją z wynikami sztucznej inteligencji. Jeśli znajdziesz niezgodność, zdiagnozuj i popraw jej źródło (podstawę/jednostkę) i zanotuj postęp.

lista kontrolna

  • [ ] Sprawdziłem i zatwierdziłem plan czyszczenia przed napisaniem kodu.
  • [ ] Sztuczna inteligencja poinformowała, że ​​każda linia została usunięta/zmieniona; Żadnego cichego usuwania.
  • [ ] Podczas uzupełniania brakujących danych możesz zapytać "dlaczego są puste?" Odpowiedziałem na pytanie.
  • [ ] Sprawdziłem, czy wartość odstająca była rzeczywistym zdarzeniem, czy błędem w danych.
  • [ ] W realizacji sprawdziłem, czy podstawa deflatora i podstawa wyniku są zgodne.
  • [ ] Ręcznie przeliczyłem przeliczenie co najmniej jednego okresu.
  • [ ] Nie przedstawiłem korelacji w EDA jako związku przyczynowego.