zisky:
- Umět rozlišit, kde v empirickém workflow (čištění dat, kód, vizualizace, interpretace návrhu) umělá inteligence šetří reálný čas a kde jsou rozhodnutí, jako je výběr modelu, tvrzení o kauzality a rozhodnutí o publikaci, ponechána na odborníkovi, podle úrovně rizika úkolu
- Schopnost aplikovat disciplínu, která ověřuje každý výstup umělé inteligence (číslo, koeficient, kód, komentář) prostřednictvím kroků přepočtu, propojení se zdrojem a statistického filtrování.
- Schopnost bezpečně zpracovávat mikrodata a důvěrné/licencované datové soubory v rámci KVKK/GDPR a dohod o používání dat a osvojit si návyk volit vhodné nástroje.
Stejné otázky se opakují každý den na stole ekonometrie nebo aplikovaného statistika: Je tento soubor dat spolehlivý; Co dělat s těmito chybějícími hodnotami? Co skutečně říká koeficient této regrese? Je tento vztah kauzální nebo pouze korelační? Protože je tato p-hodnota významná, mohu ji napsat do článku nebo stručného popisu zásad? Některé z těchto otázek jsou opakující se, náročné na kód a zdlouhavé: čištění dat, desetkrát vykreslení stejného grafu, ladění kódu R nebo Python, řetězení výsledků do tabulky. Jiné přímo určují platnost nálezu, poctivost publikace nebo přesnost politického rozhodnutí.
Umělá inteligence (AI ve zkratce AI - počítačové systémy, které dokážou produkovat text a kód jako lidé, rozpoznávat vzory, sumarizovat data a psát komentáře; nejpoužívanější formou jsou dnes velké jazykové modely, tedy systémy, které jsou trénované na obrovském textu a sestavují věty pomocí predikce dalšího slova) sedí přímo uprostřed této tabulky. Při správném použití zkrátí hodiny kódu čištění dat na minuty, připomene syntaxi složitého statistického testu nebo navrhne interpretaci koeficientu. Při nesprávném použití představuje jako „nález“ zdánlivě jisté, ale zcela vymyšlené číslo, falešnou významnost nebo nekauzální vztah.
Tato první jednotka není úvodem do softwaru. Jeho účelem je objasnit, kam zařadit AI do svého empirického pracovního postupu a kam ji nikdy nezařadit. Ekonometrie je pole „kritické pro metodu“ i nepřímo „kritické pro rozhodnutí“: koeficient modelu, který vytvoříte, může být vstupem pro rozhodnutí centrální banky o úrokové sazbě, změnu politiky regulátora nebo milionovou investici firmy. Uveďme si základní princip od začátku: Umělá inteligence je asistent analýzy, nikoli výzkumník. Odpovědnost a konečné schválení výběru modelu, strategie identifikace, prosazování kauzality, zveřejnění a politických rozhodnutí spočívá na kompetentním expertovi.
Vrstvy empirického workflow a místo AI
Empirickou studii je užitečné rozdělit do tří vrstev. Prováděcí vrstva je každodenní technická práce: kód čištění dat, kreslení grafů, formátování tabulek, ladění syntaxe. Metodickou vrstvou je analytické rozhodnutí: který model, která identifikační strategie, který test, která kontrola předpokladů. Interpretační a rozhodovací vrstva je smyslem zjištění: co koeficient říká, je to kauzální, co to znamená pro politiku, má-li být zveřejněno. AI se dotýká všech tří vrstev, ale v každé s jinou autoritou. Na prováděcí vrstvě AI rychle navrhuje a generuje kód; Na interpretační a rozhodovací vrstvě je dán pouze vstup a rozhodnutí činí odborník.
Pojďme si na začátek definovat pár základních pojmů. Ekonometrie je obor, který analyzuje ekonomická a sociální data statistickými metodami a měří vztahy. Regrese je metoda, která numericky modeluje vztah výsledné proměnné (závislé proměnné) s jednou nebo více vysvětlujícími proměnnými (nezávisle proměnné). Koeficient je číslo, které ukazuje, s kolika jednotkami změny v průměru je spojena změna jedné jednotky ve vysvětlující proměnné ve výsledné proměnné. Hodnota p je pravděpodobnost, že k pozorovanému výsledku (nebo k extrémnějšímu výsledku) dojde náhodou, když ve skutečnosti žádný účinek neexistuje. Tyto pojmy vysvětlíme jeden po druhém v následujících celcích; Prozatím vězte toto: Ve všech těchto věcech vám AI poskytuje plán, kód a vysvětlení, ale nečiní vědecká rozhodnutí.
Následující tabulka shrnuje roli a úroveň rizika AI podle mise:
Quest
Role AI
Úroveň rizika
Kdo schvaluje
Zápis kódu dezinfekce dat
generátor kódu
nízká
Sám analytik (s testováním kódu)
Návrh grafu/tabulky
generátor skic
nízká
analytik
Připomenutí syntaxe testu/modelu
Referenční asistent
nízká-střední
analytik
Interpretace koeficientu návrhu
autor návrhu
střední
ekonometr
Výběr strategie modelu/identifikace
pomocný vstup
vysoká
odborný výzkumník
Příčinné tvrzení
Jen návrh, nikdy poslední slovo
velmi vysoká
Expert + peer review
Publikace/politické rozhodnutí
pouze vstup
velmi vysoká
Odpovědný vyšetřovatel/instituce
Mějte na paměti jeden řádek v této tabulce: s rostoucím rizikem se zmenšuje role umělé inteligence a roste souhlas odborníků.
Proč je "ověření" srdcem tohoto podnikání
Jazykové modely se zdají být sebevědomé ve své odpovědi, ale nemusí si být jisti. V odborném jazyce se tomu říká halucinace: je to modelovo vymýšlení neexistující informace v plynulé větě, jako by to byla pravda. Pro ekonometra je to smrtící past. Model vám může poskytnout přesné číslo, například „Korelace mezi nezaměstnaností a inflací v Turecku mezi 2015-2020 je 0,62“; Vaše údaje však nikdy neviděl a toto číslo je zcela vymyšlené. Nebo by to mohlo říct: „P-hodnota bílého testu byla 0,03“; zatímco neprovedl žádné testy. Může volat funkci R s argumentem, který ve skutečnosti neexistuje. Všechny tři zpívá se stejnou plynulostí; Jediná věc, která odděluje správné od špatného, jsou vaše znalosti a váš zvyk ověřovat.
Ověřovací disciplína se skládá ze tří kroků:
- Přepočítat / spustit ve svém vlastním prostředí: Spočítejte každé číslo, poměr, výsledek testu a koeficient daný AI v R/Pythonu s vašimi vlastními daty, nikoli z paměti AI. Použijte AI k napsání kódu, ne k zapamatování výsledku. Spusťte kód a vytvoříte výstup.
- Odkaz na zdroj: Pravidla metod, vzorce a definice najdete v učebnicích, článcích o metodách a oficiálních dokumentech. Potvrďte tvrzení AI „předpoklad tohoto testu je“ se spolehlivým zdrojem.
- Statistický filtr: Otestujte očima odborníka, zda výstup odporuje statistické logice (předpoklady, vzorek, velikost účinku, nejistota). Odmítněte „smysluplný, ale absurdní“ výsledek.
Upozornění: Vložení koeficientu, testu nebo interpretace generované umělou inteligencí do článku, práce nebo poznámky k zásadám, aniž byste to ověřili, je jako zveřejnit nezkontrolované zjištění. Jen proto, že výstup je plynulý, není pravda; Jen proto, že se číslo zdá jisté, není skutečné.
Soukromí: mikrodata a licencovaná data jsou chráněna soukromě
Mikrodata (jednotlivé záznamy na úrovni jednotlivce, domácnosti, firmy nebo pacienta) se často používají v ekonometrii. Většina těchto údajů jsou osobní údaje a jsou chráněny podle KVKK (zákon o ochraně osobních údajů) v Turecku a GDPR v Evropě. Kromě toho společnost TurkStat, centrální banky, poskytovatelé panelových dat a komerční zdroje často poskytují data se smlouvou o používání dat; Tyto smlouvy zakazují předávání údajů třetím stranám. Vložení tabulky obsahující informace o identitě, příjmech, zdraví nebo firemních tajemstvích do veřejného chatovacího nástroje AI je porušením KVKK/GDPR i porušením smlouvy; protože data jdou na externí server a lze je použít v modelovém trénování v některých nástrojích.
Pravidlo je jednoduché: uchovávat data v jejich vlastním bezpečném prostředí, požádat AI pouze o kód a metody. Ideální pracovní postup je tento: požádejte AI o kód analýzy, spustíte kód se skutečnými daty na svém vlastním počítači/podnikovém serveru. Pokud opravdu musíte sdílet data, anonymizujte (odstraňte pole ID), agregujte (spíše průměr/počet než individuální) a vyberte si nástroje, které jsou institucionální, mají smlouvu o zpracování dat a nepoužívejte svá data ve vzdělávání.
tři mini pouzdra
Případ 1 — Bezpečné a efektivní použití. Jeden výzkumník nejprve strávil 6 hodin ručním čištěním 40 000 řádků údajů o domácím rozpočtu. Aniž by vůbec sdílel data, pouze popsal názvy a strukturu proměnných AI a požádal o čisticí kód. AI vygenerovala R skript; Výzkumník spustil kód ve svém vlastním prostředí, zkontroloval počet řádků a souhrnné statistiky každého kroku a opravil dvě logické chyby. Délka: 70 minut místo 6 hodin. Data nikdy nevyšla; Zodpovědnost zůstala na výzkumníkovi.
Případ 2 – Neověřená past na čísla. „Jaká je elasticita mezi růstem HDP a přímými zahraničními investicemi,“ zeptal se postgraduální student AI. Umělá inteligence s jistotou poskytla číslo „asi 0,34“, i když neměla přístup k žádným datům. Student to napsal do shrnutí literatury; Když se jeho poradce zeptal na zdroj, ukázalo se, že číslo nemá žádný základ a je zcela vymyšlené. Chyba: Očekávání konkrétních statistik od umělé inteligence, aniž byste jí poskytli data a zdroje.
Případ 3 — Důvěrnost a porušení smlouvy. Analytik nahrál Excel, který obdržel od licencovaného panelu společnosti, obsahující název společnosti a obrat, do veřejně dostupného nástroje AI a řekl „proveďte regresi panelu“. Smlouva poskytovatele údajů zakazovala předávání údajů do systémů třetích stran; Incident si vyžádal kontrolu souladu. Správným způsobem bylo nahradit názvy společností anonymními kódy nebo nesdílet žádná data a pouze si vyžádat regresní kód panelu a spustit jej ve vlastním prostředí.
Slabá výzva / Silná výzva
Slabá výzva:
Analyzujte vztah mezi inflací a nezaměstnaností a uveďte koeficient.
Toto tvrzení je chybné: AI nebyla poskytnuta žádná data, není jasné, která země, které období a jaký model. AI může odpovědět pouze vytvořeným koeficientem.
Výkonná výzva:
Vaše role: jste asistent analýzy a pomáháte ekonometrickému výzkumníkovi. Údaje s vámi NESdílím; Chci jen RUNNABLE R kód. Mám roční panel: proměnné země, rok, nezaměstnanost, inflace (vše číselné). Úkol: 1) napište regresní kód panelu s pevnými efekty pro nezaměstnanost ~ inflaci (balíček plm), 2) vysvětlete každý krok v kódu řádkem komentáře, 3) všimněte si, že koeficient by měl být interpretován jako relační, nikoli KAZÁLNÍ, 4) vymyslete argument funkce, kterým si nejste jisti; Výsledek spustím a ověřím ve vlastním prostředí.
V této žádosti se nesdílí žádná data, je jasná role, balíčky, očekávání komentářů a zákaz „fabrikace“. Stále spouštíte a ověřujete výstup sami.
Následující tabulka shrnuje pravidla jedné věty v této lekci:
princip
co to znamená
AI je asistent
Vědecké rozhodnutí a odpovědnost náleží odborníkovi
Vyžádejte si kód, vytvořte výsledek
AI si číslo nepamatuje; spustíte to a spočítáte
uchovávat data
Mikro/licencovaná data neopouštějí zabezpečené prostředí
ověřit
Každý problém, kód, komentář je kontrolován; výroba je zamítnuta
Časté chyby
- Očekávání konkrétních statistik od umělé inteligence bez poskytnutí údajů. Model nemá přístup k datům; Koeficient, korelace a p-hodnota, které dává, jsou falešné. Vždy si vyžádejte kód a výsledek vypracujte sami.
- Spoléhání na halucinační funkce. AI může navrhnout funkci nebo argument R/Pythonu, který neexistuje. Nepřijímejte kód bez spuštění a ověření.
- Nahrávání mikrodat do veřejného nástroje. Je to porušení KVKK/GDPR a smlouvy o používání dat. Data anonymizovat nebo je vůbec nesdílet.
- Záměna plynulosti za přesnost. Dobře napsaná recenze může být nepřesná. Krása věty není důkazem.
- Přijetí kauzálního jazyka bez kontroly. YZ často říká „X zvyšuje Y“; zatímco většina regresí ukazuje pouze vztahy. Braňte kauzální nárok pomocí designu.
Tip: Při práci s umělou inteligencí si položte tuto otázku: „Pokud o tento výstup požádá rozhodčí nebo auditor, mohu ukázat zdroj a účet?“ Pokud je odpověď ne, výstup ještě není připraven k použití.
V souhrnu
Umělá inteligence poskytuje skutečné a masivní zrychlení v prováděcí vrstvě (kód, vyčištění, graf, návrh) pracovního postupu ekonometrie a statistiky; výběr modelu, kauzalita, interpretace, publikace a politická rozhodnutí však náleží odborníkovi. Tři základní disciplíny: nepřipomínejte AI číslo, požádejte o kód a vygenerujte a ověřte si výsledek sami; neodstraňujte mikro/licencovaná data ze zabezpečeného prostředí; statistický filtr každý výstup. Neověřený výstup AI je stejně riskantní jako nezkontrolovaný nález.
Aplikační úkol
Zvažte svůj vlastní (nebo příklad) soubor dat. Požádejte AI o kód R nebo Python, který vytváří popisné statistiky a jednoduchý graf jednoduchým popisem proměnné struktury, aniž byste sdíleli data. Spusťte příchozí kód ve svém vlastním prostředí. Pak si udělejte kontrolní seznam: (1) zda kód běžel bez chyb, (2) je počet řádků/pozorování, jak jste očekávali, (3) která z vět AI komentářů používá kauzální jazyk a měla by být opravena. V jednom odstavci napište o čase, kdy vás AI zachránila, a alespoň o jedné chybě, kterou jste zachytili.
kontrolní seznam
- [ ] Nenutil jsem AI požádat o konkrétní statistiky; Vyžádal jsem si kód a sám vytvořil výsledek.
- [ ] V mém vlastním prostředí jsem přepočítal každé číslo a výsledek testu.
- [ ] Ověřil jsem, že funkce/argumenty, které používá, skutečně existují.
- [ ] Nenahrál jsem mikro/osobní/licencovaná data do veřejného nástroje.
- [ ] Označil jsem komentáře obsahující kauzální jazyk a přesunul je do relačního jazyka.
- [ ] Jsem schopen ukázat zdroj a vyúčtování výstupu auditorovi.