zisky:
- Byť schopný rozlíšiť, kde v empirickom pracovnom toku (čistenie dát, kód, vizualizácia, interpretácia návrhu) umelá inteligencia šetrí reálny čas a kde sú rozhodnutia ako výber modelu, tvrdenie o príčinnej súvislosti a rozhodnutie o zverejnení ponechané na odborníkovi, podľa úrovne rizika úlohy
- Schopnosť aplikovať disciplínu, ktorá overí každý výstup umelej inteligencie (číslo, koeficient, kód, komentár) prostredníctvom krokov prepočtu, prepojenia na zdroj a štatistického filtrovania.
- Schopnosť bezpečne spracovávať mikroúdaje a dôverné/licencované dátové súbory v rámci KVKK/GDPR a zmlúv o využívaní údajov a osvojiť si návyk zvoliť si vhodné nástroje.
Rovnaké otázky sa opakujú každý deň na stole ekonometra alebo aplikovaného štatistika: Je tento súbor údajov spoľahlivý? Čo robiť s týmito chýbajúcimi hodnotami? Čo skutočne hovorí koeficient tejto regresie? Je tento vzťah kauzálny alebo len korelačný? Keďže je táto p-hodnota významná, môžem ju napísať do článku alebo stručného prehľadu pravidiel? Niektoré z týchto otázok sa opakujú, sú náročné na kód a sú časovo náročné: čistenie údajov, desaťkrát vykreslenie rovnakého grafu, ladenie kódu R alebo Python, reťazenie výsledkov do tabuľky. Iné priamo určujú platnosť zistenia, čestnosť publikácie alebo presnosť politického rozhodnutia.
Umelá inteligencia (v skratke AI – počítačové systémy, ktoré dokážu produkovať text a kód ako ľudia, rozpoznávať vzory, sumarizovať dáta a písať komentáre; dnes najpoužívanejšou formou sú veľké jazykové modely, teda systémy, ktoré sú trénované na veľkom texte a zostavujú vety predikciou nasledujúceho slova) sedí priamo v strede tejto tabuľky. Pri správnom použití skráti hodiny kódu čistenia dát na minúty, pripomenie syntax zložitého štatistického testu alebo načrtne interpretáciu koeficientu. Pri nesprávnom použití predstavuje zdanlivo isté, ale úplne vymyslené číslo, falošnú významnosť alebo nekauzálny vzťah ako „nález“.
Táto prvá jednotka nie je úvodom do softvéru. Jeho účelom je objasniť, kam zaradiť AI do svojho empirického pracovného postupu a kam ju nikdy nezaradiť. Ekonometria je oblasť „kritická pre metódu“ aj nepriamo „kritická pre rozhodnutie“: koeficient modelu, ktorý vytvoríte, môže byť vstupom pre rozhodnutie centrálnej banky o úrokovej sadzbe, zmenu politiky regulátora alebo miliónovú investíciu firmy. Uveďme si základný princíp od začiatku: Umelá inteligencia je asistent analýzy, nie výskumník. Zodpovednosť a konečné schválenie výberu modelu, stratégie identifikácie, presadzovania kauzality, publikovania a politických rozhodnutí spočíva na kompetentnom odborníkovi.
Vrstvy empirického pracovného toku a miesto AI
Je užitočné rozdeliť empirickú štúdiu do troch vrstiev. Realizačná vrstva je každodenná technická práca: kód na čistenie dát, kreslenie grafov, formátovanie tabuliek, ladenie syntaxe. Vrstva metódy je analytické rozhodnutie: ktorý model, ktorá stratégia identifikácie, ktorý test, ktorá kontrola predpokladov. Interpretačná a rozhodovacia vrstva je zmyslom zistení: čo hovorí koeficient, je to kauzálne, čo to znamená pre politiku, ak by to bolo zverejnené. AI sa dotýka všetkých troch vrstiev, no v každej má inú autoritu. Na realizačnej vrstve AI rýchlo navrhuje a generuje kód; Na interpretačnej a rozhodovacej vrstve sa zadáva iba vstup a rozhodnutie robí odborník.
Poďme si na začiatok definovať niekoľko základných pojmov. Ekonometria je odvetvie, ktoré analyzuje ekonomické a sociálne údaje štatistickými metódami a meria vzťahy. Regresia je metóda, ktorá numericky modeluje vzťah výstupnej premennej (závislej premennej) s jednou alebo viacerými vysvetľujúcimi premennými (nezávisle premenné). Koeficient je číslo, ktoré ukazuje, s koľkými jednotkami zmeny v priemere súvisí jednojednotková zmena vo vysvetľujúcej premennej vo výslednej premennej. Hodnota p je pravdepodobnosť, že k pozorovanému výsledku (alebo k extrémnejšiemu výsledku) dôjde náhodou, keď v skutočnosti neexistuje žiadny účinok. Tieto pojmy vysvetlíme jeden po druhom v nasledujúcich celkoch; Zatiaľ vedzte toto: AI vám poskytuje plán, kód a vysvetlenie, ale nerobí vedecké rozhodnutia.
Nasledujúca tabuľka sumarizuje úlohu a úroveň rizika AI podľa misií:
Quest
Úloha AI
Úroveň rizika
Kto schvaľuje
Zápis kódu na dezinfekciu údajov
generátor kódu
nízka
Samotný analytik (s testovaním kódu)
Návrh grafu/tabuľky
generátor náčrtov
nízka
analytik
Pripomenutie syntaxe testu/modelu
Referenčný asistent
nízka-stredná
analytik
Interpretácia koeficientu návrhu
návrhár
stredná
ekonometra
Výber modelu/identifikačnej stratégie
pomocný vstup
vysoká
odborný výskumník
Tvrdenie o príčinnej súvislosti
Len návrh, nikdy nie posledné slovo
veľmi vysoká
Expert + peer review
Publikácia/politické rozhodnutie
iba vstup
veľmi vysoká
Zodpovedný vyšetrovateľ/inštitúcia
Majte na pamäti jeden riadok v tejto tabuľke: s rastúcim rizikom sa zmenšuje úloha AI a rastie súhlas odborníkov.
Prečo je „overovanie“ srdcom tohto podnikania
Jazykové modely sa zdajú byť sebavedomé vo svojej odpovedi, no nemusia si byť isté. V odbornom jazyku sa tomu hovorí halucinácia: ide o modelový výmysel neexistujúcej informácie v plynulej vete, ako keby to bola pravda. Pre ekonometra je to smrteľná pasca. Model vám môže poskytnúť presné číslo, ako napríklad „Korelácia medzi nezamestnanosťou a infláciou v Turecku medzi rokmi 2015-2020 je 0,62“; Vaše údaje však nikdy nevidel a toto číslo je úplne vymyslené. Alebo by to mohlo povedať: „P-hodnota bieleho testu bola 0,03“; zatiaľ čo nevykonal žiadne testy. Môže volať funkciu R s argumentom, ktorý v skutočnosti neexistuje. Všetky tri spieva s rovnakou plynulosťou; Jediná vec, ktorá oddeľuje správne od nesprávneho, sú vaše znalosti a váš zvyk overovať si.
Overovacia disciplína pozostáva z troch krokov:
- Prepočítať / spustiť vo svojom vlastnom prostredí: Vypočítajte každé číslo, pomer, výsledok testu a koeficient daný AI v R/Pythone s vašimi vlastnými údajmi, nie z pamäte AI. Použite AI na napísanie kódu, nie na zapamätanie výsledku. Spustite kód a vytvoríte výstup.
- Odkaz na zdroj: Pri pravidlách, vzorcoch a definíciách metód sa spoliehajte na učebnice, články o metódach a oficiálne dokumenty. Potvrďte tvrdenie AI „predpoklad tohto testu je“ so spoľahlivým zdrojom.
- Štatistický filter: Testujte očami experta, či výstup odporuje štatistickej logike (predpoklady, vzorka, veľkosť účinku, neistota). Odmietnite „zmysluplný, ale absurdný“ výsledok.
Upozornenie: Vloženie koeficientu, testu alebo interpretácie vygenerovaného AI do článku, práce alebo poznámky k zásadám bez toho, aby ste to overili, je ako zverejnenie nepreskúmaného zistenia. Len preto, že výstup je plynulý, nie je pravda; Len preto, že sa číslo zdá isté, nie je skutočné.
Súkromie: mikroúdaje a licencované údaje sú chránené súkromne
Mikroúdaje (jednotlivé záznamy na úrovni jednotlivca, domácnosti, firmy alebo pacienta) sa často používajú v ekonometrii. Väčšina týchto údajov sú osobné údaje a sú chránené podľa KVKK (zákon o ochrane osobných údajov) v Turecku a GDPR v Európe. Okrem toho TurkStat, centrálne banky, poskytovatelia panelových údajov a komerčné zdroje často poskytujú údaje so zmluvou o používaní údajov; Tieto zmluvy zakazujú prenos údajov tretím stranám. Prilepenie tabuľky obsahujúcej informácie o identite, príjmoch, zdraví alebo firemných tajomstvách do verejného chatovacieho nástroja AI je porušením KVKK/GDPR aj porušením zmluvy; pretože údaje idú na externý server a možno ich použiť pri modelovaní v niektorých nástrojoch.
Pravidlo je jednoduché: uchovávajte údaje vo vlastnom bezpečnom prostredí, požiadajte AI len o kód a metódy. Ideálny pracovný postup je tento: požiadajte AI o analytický kód, spustíte kód so skutočnými údajmi na svojom vlastnom počítači/podnikovom serveri. Ak naozaj musíte zdieľať údaje, anonymizujte (odstráňte polia ID), agregujte (skôr priemer/počet ako individuálne) a vyberte si nástroje, ktoré sú inštitucionálne, majú zmluvu o spracovaní údajov a nepoužívajte svoje údaje vo vzdelávaní.
tri mini prípady
Prípad 1 – Bezpečné a efektívne používanie. Jeden výskumník najprv strávil 6 hodín manuálnym čistením 40 000 riadkov údajov o rozpočte domácností. Bez zdieľania údajov iba opísal názvy a štruktúru premenných AI a požiadal o čistiaci kód. AI vygenerovala R skript; Výskumník spustil kód vo svojom vlastnom prostredí, skontroloval počet riadkov a súhrnné štatistiky každého kroku a opravil dve logické chyby. Trvanie: 70 minút namiesto 6 hodín. Údaje nikdy nevyšli; Zodpovednosť zostala na výskumníkovi.
Prípad 2 – Neoverená pasca na čísla. „Aká je elasticita medzi rastom HDP a priamymi zahraničnými investíciami,“ spýtal sa študent AI. AI s istotou dávala číslo „asi 0,34“, aj keď nemala prístup k žiadnym údajom. Študent to napísal do súhrnu literatúry; Keď sa jeho poradca spýtal na zdroj, ukázalo sa, že číslo nemá žiadny základ a je úplne vymyslené. Chyba: Očakávanie konkrétnych štatistík od AI bez poskytnutia údajov a zdrojov.
Prípad 3 – Dôvernosť a porušenie zmluvy. Analytik nahral Excel, ktorý dostal od licencovaného panela spoločnosti a ktorý obsahoval názov spoločnosti a obrat, do verejne dostupného nástroja AI a povedal „urobte panelovú regresiu“. Zmluva s poskytovateľom údajov zakazuje prenos údajov do systémov tretích strán; Incident si vyžiadal kontrolu súladu. Správnou cestou bolo nahradiť názvy spoločností anonymnými kódmi alebo nezdieľať žiadne údaje a vyžiadať si len regresný kód panelu a spustiť ho vo vlastnom prostredí.
Slabá výzva / Silná výzva
Slabá výzva:
Analyzujte vzťah medzi infláciou a nezamestnanosťou a uveďte koeficient.
Toto tvrdenie je nesprávne: AI neboli poskytnuté žiadne údaje, nie je jasné, ktorá krajina, ktoré obdobie a aký model. AI môže odpovedať len s vymysleným koeficientom.
Výkonná výzva:
Vaša úloha: ste asistent analýzy, ktorý pomáha výskumníkovi v oblasti ekonometrie. Údaje s vami NEZDIEĽAM; Chcem len RUNNABLE R kód. Mám ročný panel: premenné krajina, rok, nezamestnanosť, inflácia (všetky číselné). Úloha: 1) napíšte regresný kód panelu s fixnými efektmi pre nezamestnanosť ~ infláciu (balíček plm), 2) vysvetlite každý krok v kóde riadkom s komentárom, 3) všimnite si, že koeficient by sa mal interpretovať ako relačný, nie PRÍČINNÝ, 4) vymyslite argument funkcie, ktorým si nie ste istí; Spustím a overím výsledok vo vlastnom prostredí.
V tejto žiadosti sa nezdieľajú žiadne údaje, je jasná úloha, balíky, očakávanie komentárov a zákaz „výroby“. Stále spúšťate a overujete výstup sami.
Nasledujúca tabuľka zhŕňa pravidlá jednej vety v tejto lekcii:
princíp
čo to znamená
AI je asistent
Vedecké rozhodnutie a zodpovednosť patrí odborníkovi
Vyžiadajte si kód, vytvorte výsledok
AI si nepamätá číslo; spustíte to a vypočítate
uchovávať údaje
Mikro/licencované údaje neopúšťajú zabezpečené prostredie
overiť
Každý problém, kód, komentár je kontrolovaný; výroba sa zamieta
Časté chyby
- Očakávanie konkrétnych štatistík od AI bez poskytnutia údajov. Model nemá prístup k údajom; Koeficient, korelácia a p-hodnota, ktoré dáva, sú falošné. Vždy si vyžiadajte kód a sami vytvorte výsledok.
- Spoliehanie sa na halucinačné funkcie. AI môže navrhnúť funkciu alebo argument R/Pythonu, ktorý neexistuje. Neprijímajte kód bez spustenia a overenia.
- Nahrávanie mikrodát do verejného nástroja. Ide o porušenie KVKK/GDPR a zmluvy o používaní údajov. Údaje anonymizovať alebo ich vôbec nezdieľať.
- Zámena plynulosti za presnosť. Dobre napísaná recenzia môže byť nepresná. Krása vety nie je dôkazom.
- Akceptovanie kauzálneho jazyka bez kontroly. YZ často hovorí „X zvyšuje Y“; zatiaľ čo väčšina regresií ukazuje len vzťahy. Obhajujte kauzálny nárok dizajnom.
Tip: Pri práci s AI si položte túto otázku: „Ak o tento výstup požiada rozhodca alebo audítor, môžem ukázať zdroj a účet?“ Ak je odpoveď nie, výstup ešte nie je pripravený na použitie.
V súhrne
AI poskytuje skutočné a masívne zrýchlenie vo vykonávacej vrstve (kód, vyčistenie, graf, návrh) pracovného toku ekonometrie a štatistiky; výber modelu, kauzalita, interpretácia, publikovanie a politické rozhodnutia však patria odborníkovi. Tri základné disciplíny: nepripomínajte AI číslo, požiadajte o kód a vygenerujte a overte si výsledok sami; neodstraňujte mikro/licencované údaje zo zabezpečeného prostredia; štatistický filter každého výstupu. Neoverený výstup AI je rovnako riskantný ako nepreskúmaný nález.
Aplikačná úloha
Zvážte svoj vlastný (alebo príklad) súbor údajov. Požiadajte AI o kód R alebo Python, ktorý vytvára popisné štatistiky a jednoduchý graf jednoduchým popisom premennej štruktúry bez zdieľania údajov. Spustite prichádzajúci kód vo svojom vlastnom prostredí. Potom si urobte kontrolný zoznam: (1) či kód bežal bez chýb, (2) je počet riadkov/pozorovaní, ako ste očakávali, (3) ktorá z viet komentárov AI používa kauzálny jazyk a mala by byť opravená. V jednom odseku napíšte čas, ktorý vás AI zachránila, a aspoň jednu chybu, ktorú ste zachytili.
kontrolný zoznam
- [ ] Neprinútil som AI žiadať konkrétne štatistiky; Požiadal som o kód a sám som vytvoril výsledok.
- [ ] Prepočítal som každé číslo a výsledok testu v mojom vlastnom prostredí.
- [ ] Overil som si, že funkcie/argumenty, ktoré používa, skutočne existujú.
- [ ] Nenahral som mikro/osobné/licencované údaje do verejného nástroja.
- [ ] Označil som komentáre obsahujúce kauzálny jazyk a presunul ich do relačného jazyka.
- [ ] Som schopný ukázať zdroj a účtovanie výstupu audítorovi.