zisky:
- Schopnost vyčistit nezpracovaná ekonomická data (chybějící pozorování, záměna jednotek, nesoulad frekvencí) a připravit je na analýzu pomocí umělé inteligence
- Schopnost tisknout standardní ekonomické transformace, jako je reálná nominální konverze, indexace, tempo růstu, sezónní úpravy, jako kód do umělé inteligence a ručně je ověřovat
- Schopnost rozpoznávat data pomocí průzkumné analýzy dat (souhrnné statistiky, distribuce, odlehlé hodnoty, korelace) a kriticky číst souhrny umělé inteligence
Ekonomická data jsou zřídkakdy připravena k analýze. V tabulce, kterou jste stáhli z TURKSTAT, chybí některé měsíce, jeden sloupec je jako text s tisíci závorkami, směnný kurz je v tureckém formátu jako "1.234,56", jedna řada je měsíční a druhá čtvrtletní. Většinu času ekonom netráví analýzou, ale přípravou dat pro analýzu. Zde je umělá inteligence skutečným akcelerátorem s nízkým rizikem: navrhuje kroky čištění, zapisuje pandy (knihovna pro zpracování dat Pythonu), kodifikuje standardní ekonomické transformace. Tato jednotka má ale také neměnné pravidlo: Každou transformaci napsanou umělou inteligencí čtete a ručně ověřujete alespoň v jednom pozorování. Pokud je reálný nominální cyklus na špatných základech, celá analýza tiše upadá.
Čištění: jaké problémy, jak je řešit?
Nejčastější problémy v ekonomických datech a jejich logika:
- Neúplné pozorování. Jeden měsíc/čtvrtletí je prázdný. Řešení závisí na kontextu: pokud ve skutečnosti neexistuje, je ponecháno prázdné; Pokud existuje technická mezera, provede se pečlivá interpolace – ale hranice mezi výrobou je tenká.
- Záměna jednotek a formátů. Text "12.345.6" musí být převeden na číslo; milion/miliarda by měla být konzistentní.
- Nesoulad frekvence. Aby bylo možné kombinovat měsíční a čtvrtletní řadu, jedna se agreguje (měsíční až čtvrtletní) — zda je průměrná, celková nebo na konci období, závisí na povaze ukazatele (rozlišení stav/tok).
- Odlehlé (extrémní) hodnoty. Pokud se pozorování výrazně odchyluje: jedná se o skutečnou událost (krize, zvýšení cen) nebo o chybu v datech? Rozumí se před smazáním.
- Zarovnání data. Formáty data a definice období různých řad jsou synchronizovány.
Pozor: Doplnění chybějících údajů se zdá nevinné, ale je to ekonomické rozhodnutí. Vyplnění krizového měsíce „průměrem sousedních měsíců“ znamená odstranění krize z analýzy. Před vyplněním se zeptejte "proč tato mezera existuje?" Odpovězte na otázku.
Standardní ekonomické transformace
Proměny a jejich definice v denním repertoáru ekonoma:
- Nominální → Skutečné. Očištění o cenový dopad: reálná hodnota = nominální hodnota / cenový index × 100. Základní rok deflátoru (opravný index) určuje základ výsledku.
- Indexování. Změna měřítka řady tak, aby zvolené období = 100; Je to užitečné pro porovnávání sérií různých velikostí.
- Rychlost růstu. Roční: (stejné období toto období / minulý rok − 1) × 100. Periodická a roční sazba jsou různé věci; Záměna je běžná chyba.
- Sezónní korekce. Očištění pravidelných sezónních vlivů (letní turistika, dovolená); Syrové série a sezónně upravené série vyprávějí různé příběhy.
- Klouzavý průměr. Vyhlazení hluku a zviditelnění trendu.
- Logaritmy a diferencování. Zkoumat dynamiku růstu a stacionaritu (bude se prohlubovat v jednotce časové řady).
Tip: Při každé konverzi budete dotázáni "co se stalo s jednotkou a základnou?" požádat. Základem skutečné řady je základna deflátoru; Základem indexované řady je období, které si zvolíte. Tím, že si to zapíšete, předejdete budoucím chybám.
Průzkumná analýza dat (EDA)
Před zadáním do modelu je nutné data rozpoznat. Průzkumná analýza dat (EDA) zahrnuje: souhrnné statistiky (průměr, medián, standardní odchylka, min-max), tvar rozdělení, průběh v čase, odlehlé hodnoty a korelace mezi řadami. AI rychle vygeneruje kód pro tyto kroky; Vaším úkolem je číst výstup ekonomickým pohledem: "Je tento průměr rozumný? Je tato korelace náhoda nebo známý vztah?"
Pozor: Korelace je zde pouze prostředkem identifikace, nikoli důkazem příčinné souvislosti. Skutečnost, že se dvě série pohybují společně (např. prodej zmrzliny a utopení – obě spouštěné létem), nemusí nutně znamenat, že jedna vede k druhé. Tento rozdíl prohloubíme v bloku 7.
tři mini pouzdra
Případ 1 – Nesprávná základna deflátoru. Analytik nechal umělou inteligenci napsat kód k realizaci mzdových řad. Kód fungoval, výsledek vypadal rozumně – ale analytik ručně vypočítal rok 2020 v kroku CALCULATE a nefungovalo to. Problém: umělá inteligence použila deflátor se základem 2003=100 a požádala o mzdovou řadu s cenami roku 2015; Základny byly protichůdné. Kód byl opraven jedinou opravou, celá série zapadla na své místo.
Případ 2 — Chyba tiché hlasitosti. Instituce snížila údaje o vývozu v tisících dolarů a dovozy v milionech dolarů. Když umělá inteligence odstranila dvojku pro „zahraniční obchodní bilanci“, výsledkem byl absurdní deficit. Zobrazení min-max v EDA odhalilo chybu: řádová velikost obou sérií se lišila faktorem 1000. Jakmile byla jednotka vyrovnána, vyvážení bylo správné.
Případ 3 – Neodstranění odlehlé hodnoty. Jeden měsíc v sérii byl mimořádně nízký. AI navrhla „odlehlejší, pojďme to vyčistit“. Analytik vyšetřoval: výroba se ten měsíc skutečně zastavila kvůli přírodní katastrofě. Hodnota byla skutečná; Jeho smazání by zkreslilo historii. Místo škrtnutí byla poznámka pod čarou. „Jasné“ doporučení AI nebylo slepě následováno.
Tabulka ověření konverze
Konverze
formule esence
ruční kontrolní bod
realizace
nominální / cenový index × 100
Deflátorová základna = výsledná základna?
roční růst
(t/t-12měsíců − 1)×100
Vypočítejte období na papíře
indexování
série/základní období × 100
Je hodnota základního období 100?
Měsíčně→čtvrtletně
tok: sběr / zásoba: konec období
Správný způsob sběru?
klouzavý průměr
průměr za poslední n období
Je délka okna správná?
Čtyři kopírovatelné šablony
1) Plán úklidu:
Mám tato nezpracovaná data: [sloupce a ukázkové řádky]. Vypracujte plán čištění, který se připraví na analýzu: chybějící hodnota, problém s jednotkou/formátem, zarovnání data, zarovnání frekvence, možné odlehlé hodnoty. Vysvětlete jednou větou, proč je každý krok nezbytný. Ještě nepište kód; dovolte mi nejprve potvrdit plán.
2) kód čištění pandy:
Napište kód pandy podle plánu, který jsem schválil. Nechte kód označit, co dělá v každém kroku, pomocí řádku komentáře; Po převodu vytiskne počet řádků a chybějící hodnoty. Nemažte tiše žádné pozorování; Nahlaste každý řádek, který smažete.
3) Realizace (ověřitelná):
Realizujte tuto nominální řadu pomocí [cenový index]. Jasně zapište základní rok deflátoru, když jej používáte; Určete, jaký je základ výsledné řady. Ukažte mi účet krok za krokem na jedno období, abych ho mohl ověřit ručně.
4) Shrnutí průzkumné analýzy:
Napište kód průzkumné analýzy pro následující vyčištěná data: souhrnné statistiky, graf časové řady, sken odlehlých hodnot a korelační matice. Při interpretaci výsledků si ujasněte, že korelace, které najdete, nejsou KAZÁLNÍ a uveďte 3 body, které mi vynikají.
Slabá výzva / Silná výzva
Slabá výzva:
Vymažte tato data.
AI jedná s předpoklady, aniž by věděla, co vyčistit; Můžete mazat pozorování, měnit jednotky, nevšimnete si toho.
Výkonná výzva:
V těchto měsíčních údajích o zahraničním obchodu je vývoz v „tisících USD“ a dovoz v „milionech USD“. Udělejte dva stejné v „milionech USD“, označte chybějící měsíce, ale NEVYPLŇUJTE, zarovnejte data ke konci měsíce. Vytiskněte, kolik řádků je ovlivněno v každém kroku; tiše smazat žádné řádky. Poté zobrazit zůstatek za jeden měsíc způsobem, který mohu ručně zkontrolovat.
Časté chyby
- Spuštění konverzního kódu bez jeho čtení. Špatná základna/jednotka tiše naruší celou analýzu.
- Doplnění chybějících údajů bez přemýšlení. Vymazání období krize/katastrofy s průměrem.
- Automaticky vyřadit odlehlé hodnoty. Záměna skutečné události za chybu dat.
- Matoucí sezónní a roční růst. Oba jsou různé velikosti.
- Nesprávná kombinace frekvencí. Shromažďování série zásob a její zpracování jako toku.
- Záměna korelace v EDA za kauzalitu. Záměna rozpoznávacího nástroje za důkaz.
V souhrnu
Čištění a transformace dat je neviditelných, ale rozhodujících 80 procent ekonomické analýzy. Umělá inteligence tuto mechanickou práci dramaticky urychluje; ale je na vás, abyste si přečetli každý krok čištění a každou transformaci a ručně ověřili alespoň jedno pozorování. Rozhodnutí základny, jednotky, frekvence a odlehlých hodnot deflátoru jsou ekonomická rozhodnutí a nelze je slepě přenechat umělé inteligenci. Průzkumná analýza zavádí data, ale korelace tam není kauzalita.
Aplikační úkol
Stáhněte si skutečnou nezpracovanou řadu (např. měsíční CPI a řadu nominálních mezd/příjmů). Vytvořte plán čištění pomocí 1. šablony, nechte si vygenerovat kód pomocí 2. šablony a realizujte sérii pomocí 3. šablony. Poté na papíře spočítejte skutečnou hodnotu jedné periody a porovnejte ji s výstupem umělé inteligence. Pokud zjistíte nesoulad, diagnostikujte a opravte jeho zdroj (základnu/jednotku) a zaznamenejte si průběh.
kontrolní seznam
- [ ] Před napsáním kódu jsem zkontroloval a schválil plán čištění.
- [ ] Nechal jsem vymazat/změnit každý řádek umělou inteligencí nahlášenou; Žádné tiché mazání.
- [ ] Při vyplňování chybějících údajů se můžete ptát "proč je prázdný?" odpověděl jsem na otázku.
- [ ] Zkoumal jsem, zda odlehlá hodnota byla skutečnou událostí nebo chybou v datech.
- [ ] Při realizaci jsem ověřil, že se deflátorová báze a výsledná báze shodují.
- [ ] Ručně jsem přepočítal převod alespoň jednoho období.
- [ ] Korelace v EDA jsem neuvedl jako příčinnou souvislost.