Enota 1 / 11

Umetna inteligenca v ekonometriji in statistiki: vloge, meje, avtentikacija in zasebnost

Dobički:

  • Sposobnost razlikovanja, kje v empiričnem delovnem toku (čiščenje podatkov, koda, vizualizacija, interpretacija osnutka) umetna inteligenca prihrani realni čas in kje so odločitve, kot so izbira modela, trditev o vzročnosti in odločitev o objavi, prepuščene strokovnjaku, glede na stopnjo tveganja naloge
  • Sposobnost uporabe discipline, ki preverja vsak izhod umetne inteligence (število, koeficient, koda, komentar) s koraki ponovnega izračuna, povezovanja z virom in statističnega filtriranja.
  • Sposobnost varne obdelave mikropodatkov in zaupnih/licenčnih nizov podatkov v okviru KVKK/GDPR in pogodb o uporabi podatkov ter pridobitev navade izbire ustreznih orodij.

Ista vprašanja se vsak dan ponavljajo na mizi ekonometrikov ali uporabnih statistik: ali je ta niz podatkov zanesljiv; Kaj storiti s temi manjkajočimi vrednostmi? Kaj v resnici pove koeficient te regresije? Je to razmerje vzročno ali zgolj korelacijsko? Ker je ta p-vrednost pomembna, jo lahko zapišem v članek ali povzetek politike? Nekatera od teh vprašanj se ponavljajo, zahtevajo veliko kode in zamudno: čiščenje podatkov, desetkratno risanje istega grafa, odpravljanje napak v kodi R ali Python, nizanje rezultatov v tabelo. Drugi neposredno določajo veljavnost ugotovitve, poštenost objave ali točnost politične odločitve.

Umetna inteligenca (skratka AI – računalniški sistemi, ki lahko proizvajajo besedilo in kodirajo kot ljudje, prepoznavajo vzorce, povzemajo podatke in pišejo komentarje; danes najbolj uporabljena oblika so veliki jezikovni modeli, to je sistemi, ki se urijo na ogromnem besedilu in gradijo stavke s predvidevanjem naslednje besede) sedi čisto na sredini te tabele. Ob pravilni uporabi skrajša ure kode za čiščenje podatkov na minute, vas spomni na sintakso zapletenega statističnega testa ali pripravi osnutek interpretacije koeficienta. Če se uporablja nepravilno, predstavlja navidezno zanesljivo, a popolnoma izmišljeno število, lažen pomen ali nevzročno razmerje kot "ugotovitev".

Ta prva enota ni uvod v programsko opremo. Njegov namen je razjasniti, kam umetno inteligenco postaviti v vaš empirični potek dela in kam je nikoli. Ekonometrija je področje, ki je "kritično za metode" in posredno "kritično za odločitve": koeficient modela, ki ga zgradite, je lahko vhodni podatek za odločitev centralne banke o obrestni meri, spremembo politike regulatorja ali milijonsko naložbo podjetja. Postavimo osnovno načelo od začetka: umetna inteligenca je pomočnik pri analizi, ne raziskovalec. Odgovornost za in končno odobritev izbire modela, strategije identifikacije, uveljavitve vzročnosti, objave in političnih odločitev je v rokah pristojnega strokovnjaka.

Plasti empiričnega delovnega toka in mesto AI

Koristno je empirično študijo razdeliti na tri plasti. Izvedbena plast je vsakodnevno tehnično delo: koda za čiščenje podatkov, risanje grafov, oblikovanje tabel, odpravljanje napak v sintaksi. Plast metode je analitična odločitev: kateri model, katera strategija identifikacije, kateri test, katero preverjanje predpostavk. Plast interpretacije in odločanja je pomen ugotovitev: kaj pravi koeficient, ali je vzročen, kaj pomeni za politiko, ali naj bo objavljen. AI se dotika vseh treh plasti, vendar z različno avtoriteto v vsaki. Na izvršilni ravni AI hitro pripravi osnutke in ustvari kodo; Na ravni razlage in odločanja se posreduje samo vnos in strokovnjak sprejme odločitev.

Na začetku opredelimo nekaj osnovnih pojmov. Ekonometrija je veja, ki analizira ekonomske in družbene podatke s statističnimi metodami in meri razmerja. Regresija je metoda, ki numerično modelira razmerje spremenljivke izida (odvisne spremenljivke) z eno ali več pojasnjevalnimi spremenljivkami (neodvisne spremenljivke). Koeficient je število, ki kaže, s koliko enotami spremembe je v povprečju povezana sprememba ene enote pojasnjevalne spremenljivke v spremenljivki izida. P-vrednost je verjetnost, da bi se opazovani izid (ali bolj skrajni izid) zgodil po naključju, ko učinka dejansko ni. Te koncepte bomo razložili enega za drugim v naslednjih enotah; Za zdaj vedite naslednje: pri vseh teh vam AI daje načrt, kodo in razlago, vendar ne sprejema znanstvenih odločitev.

Naslednja tabela povzema vlogo in stopnjo tveganja umetne inteligence po nalogah:

Iskanje

Vloga AI

Stopnja tveganja

Kdo odobri

Pisanje kode za čiščenje podatkov

generator kode

nizka

Sam analitik (s testiranjem kode)

Osnutek grafikona/tabele

generator skic

nizka

analitik

Opomnik sintakse testa/modela

Referenčni pomočnik

nizko-srednje

analitik

Razlaga osnutka koeficienta

pisec osnutkov

srednje

ekonometričar

Izbira strategije modela/identifikacije

pomožni vhod

visoka

strokovni raziskovalec

Trditev o vzročni zvezi

Samo osnutek, nikoli zadnja beseda

zelo visoko

Strokovni + strokovni pregled

Odločitev o objavi/politiki

samo vnos

zelo visoko

Odgovorni raziskovalec/institucija

Upoštevajte eno vrstico v tej tabeli: ko tveganje narašča, se vloga umetne inteligence zmanjšuje in odobravanje strokovnjakov narašča.

Zakaj je "preverjanje" srce tega posla

Zdi se, da so jezikovni modeli prepričani v svoj odgovor, vendar morda niso prepričani. V tehničnem jeziku se temu reče halucinacija: gre za izmišljotino neobstoječih informacij v tekočem stavku, kot da bi bile resnične. Za ekonometrika je to smrtonosna past. Model vam lahko da natančno številko, kot je "Korelacija med brezposelnostjo in inflacijo v Turčiji med 2015–2020 je 0,62"; Vendar nikoli ni videl vaših podatkov in ta številka je popolnoma izmišljena. Lahko pa piše: "P-vrednost belega testa je bila 0,03"; medtem ko ni opravil nobenih testov. Lahko pokliče funkcijo R z argumentom, ki dejansko ne obstaja. Vse tri poje enako tekoče; Edina stvar, ki loči dobro od napačnega, je vaše znanje in vaša navada preverjanja.

Disciplina preverjanja je sestavljena iz treh korakov:

  1. Ponovno izračunajte/zaženite v svojem okolju: izračunajte vsako število, razmerje, rezultat testa in koeficient, ki ga poda AI v R/Python, z lastnimi podatki, ne iz pomnilnika AI. Uporabite AI za pisanje kode, ne za zapomnitev rezultata. Zaženite kodo in ustvarite izhod.
  2. Povezava do vira: Za pravila, formule in definicije metod se zanesite na učbenike, članke o metodah in uradne dokumente. Potrdite izjavo AI "predpostavka tega testa je" z zanesljivim virom.
  3. Statistični filter: s strokovnimi očmi preizkusite, ali je rezultat v nasprotju s statistično logiko (predpostavke, vzorec, velikost učinka, negotovost). Zavrnite "smiseln, a absurden" rezultat.
Pozor: vnos koeficienta, testa ali interpretacije, ustvarjenega z umetno inteligenco, v članek, diplomsko nalogo ali opombo o pravilniku, ne da bi ga potrdili, je kot objava nepregledane ugotovitve. Samo zato, ker je izhod tekoč, ni res; Samo zato, ker se številka zdi gotova, ni resnična.

Zasebnost: mikropodatki in licenčni podatki so zasebno zaščiteni

Mikropodatki (enotni zapisi na ravni posameznika, gospodinjstva, podjetja ali bolnika) se pogosto uporabljajo v ekonometriji. Večina teh podatkov je osebnih podatkov in jih ščiti KVKK (Zakon o varstvu osebnih podatkov) v Turčiji in GDPR v Evropi. Poleg tega TurkStat, centralne banke, ponudniki panelnih podatkov in komercialni viri pogosto zagotavljajo podatke s pogodbo o uporabi podatkov; Te pogodbe prepovedujejo prenos podatkov tretjim osebam. Lepljenje tabele, ki vsebuje informacije o identiteti, dohodku, zdravju ali skrivnosti podjetja, v javno orodje za klepet z umetno inteligenco je tako kršitev KVKK/GDPR kot kršitev pogodbe; ker gredo podatki na zunanji strežnik in jih je mogoče uporabiti pri usposabljanju modela v nekaterih orodjih.

Pravilo je preprosto: podatke hranite v lastnem varnem okolju, AI zahtevajte le kodo in metode. Idealen potek dela je naslednji: prosite AI za kodo analize, kodo zaženete z resničnimi podatki na svojem računalniku/strežniku podjetja. Če res morate deliti podatke, anonimizirajte (odstranite ID polja), združite (povprečje/štetje namesto posameznika) in izberite orodja, ki so institucionalna, imate pogodbo o obdelavi podatkov in ne uporabljajte svojih podatkov v izobraževanju.

trije mini kovčki

Primer 1 – Varna in učinkovita uporaba. En raziskovalec je najprej porabil 6 ur za ročno čiščenje 40.000 vrstic podatkov o gospodinjskem proračunu. Ne da bi sploh delil podatke, je samo opisal imena in strukturo spremenljivk AI in prosil za kodo za čiščenje. AI je ustvaril skript R; Raziskovalec je zagnal kodo v svojem okolju, preveril število vrstic in povzetek statistike vsakega koraka ter popravil dve logični napaki. Trajanje: 70 minut namesto 6 ur. Podatki nikoli niso šli ven; Odgovornost je ostala na raziskovalcu.

2. primer — past nepreverjenih številk. "Kakšna je elastičnost med rastjo BDP in neposrednimi tujimi naložbami," je diplomant vprašal AI. AI je samozavestno dal številko "približno 0,34", čeprav ni imel dostopa do nobenih podatkov. Študent je to zapisal v povzetek literature; Ko je njegov svetovalec vprašal o viru, se je izkazalo, da številka nima podlage in je popolnoma izmišljena. Napaka: pričakovati konkretne statistične podatke od umetne inteligence, ne da bi ji posredovali podatke in vire.

Primer 3 – Zaupnost in kršitev pogodbe. Analitik je Excel, ki ga je prejel od plošče z licenciranim podjetjem, vseboval ime podjetja in promet, naložil v javno dostopno orodje AI in rekel "izvedi regresijo plošče". Pogodba ponudnika podatkov je prepovedovala prenos podatkov v sisteme tretjih oseb; Incident je spodbudil pregled skladnosti. Pravi način je bil nadomestiti imena podjetij z anonimnimi kodami ali pa ne deliti nobenih podatkov in zahtevati samo regresijsko kodo panela in jo izvajati v svojem okolju.

Šibek poziv/močan poziv

Šibek poziv:

Analizirajte razmerje med inflacijo in brezposelnostjo ter navedite koeficient.

Ta trditev je napačna: AI ni bil posredovan noben podatek, ni jasno, katera država, katero obdobje, kateri model. Umetna inteligenca lahko odgovori le z izmišljenim koeficientom.

Močan poziv:

Vaša vloga: ste asistent pri analizi, ki pomaga raziskovalcu ekonometrike. Podatkov NE delim z vami; Želim samo kodo RUNNABLE R. Imam letni panel: spremenljivke država, leto, brezposelnost, inflacija (vse številske). Naloga: 1) napišite regresijsko kodo plošče s fiksnimi učinki za brezposelnost ~ inflacijo (paket plm), 2) razložite vsak korak v kodi z vrstico za komentar, 3) upoštevajte, da je treba koeficient razlagati kot relacijski, ne VZROČNI, 4) sestavite argument funkcije, o katerem niste prepričani; Potekel bom in preveril rezultat v svojem okolju.

V tej zahtevi se podatki ne delijo, vloga, paketi, pričakovanje komentarjev in prepoved "izdelave" so jasni. Še vedno izvajate in sami preverjate izhod.

Naslednja tabela povzema pravila enega stavka v tej lekciji:

načelo

Kaj to pomeni

AI je pomočnik

Znanstvena odločitev in odgovornost pripada strokovnjaku

Zahtevajte kodo, ustvarite rezultat

AI si ne zapomni številke; zaženeš in izračunaš

hraniti podatke

Mikro/licencirani podatki ne zapustijo varnega okolja

preveriti

Vsaka številka, koda, komentar je preverjen; izdelava je zavrnjena

Pogoste napake

  • Pričakovanje konkretnih statističnih podatkov od umetne inteligence brez podajanja podatkov. Model ne more dostopati do podatkov; Koeficient, korelacija in p-vrednost, ki jih daje, so lažni. Vedno zahtevajte kodo in izdelajte rezultat sami.
  • Zanašanje na halucinacijske funkcije. AI lahko predlaga funkcijo ali argument R/Python, ki ne obstaja. Ne sprejmite kode, ne da bi jo zagnali in preverili.
  • Nalaganje mikropodatkov v javno orodje. Gre za kršitev KVKK/GDPR in pogodbe o uporabi podatkov. Anonimizirajte podatke ali jih sploh ne delite.
  • Tekočnost zamenjuje za natančnost. Dobro napisana ocena je lahko netočna. Lepota stavka ni dokaz.
  • Sprejemanje vzročnega jezika brez nadzora. YZ pogosto pravi, da "X poveča Y"; medtem ko večina regresij prikazuje samo razmerja. Zagovarjajte vzročno trditev z načrtom.
Namig: Ko delate z umetno inteligenco, si zastavite naslednje vprašanje: »Če sodnik ali revizor zahteva ta rezultat, ali lahko pokažem vir in račun?« Če je odgovor ne, izhod še ni pripravljen za uporabo.

Če povzamem

Umetna inteligenca zagotavlja resnično in veliko pospešitev v izvedbenem sloju (koda, čiščenje, graf, osnutek) delovnega toka ekonometrije in statistike; vendar izbira modela, vzročnost, razlaga, objava in politične odločitve pripadajo strokovnjaku. Tri osnovne discipline: ne spomnite AI ​​na številko, prosite za kodo in sami ustvarite in preverite rezultat; ne odstranjujte mikro/licenciranih podatkov iz varnega okolja; statistični filter vsakega izhoda. Nepreverjen rezultat AI je prav tako tvegan kot nepreverjena ugotovitev.

Aplikacijska naloga

Razmislite o svojem (ali primer) naboru podatkov. Vprašajte umetno inteligenco za kodo R ali Python, ki ustvari opisno statistiko in preprost graf s preprostim opisom spremenljive strukture, ne da bi delili podatke. Zaženite dohodno kodo v svojem okolju. Nato vodite kontrolni seznam: (1) ali je koda delovala brez napak, (2) je število vrstic/opazanj, kot ste pričakovali, (3) kateri od stavkov komentarja AI uporablja vzročni jezik in bi ga bilo treba popraviti. V enem odstavku napišite, koliko časa vas je umetna inteligenca rešila, in vsaj eno napako, ki ste jo ujeli.

kontrolni seznam

  • [ ] AI nisem zahteval konkretnih statističnih podatkov; Zahteval sem kodo in sam izdelal rezultat.
  • [ ] Ponovno sem izračunal vsako število in rezultat testa, ki ga je dal v svojem okolju.
  • [ ] Preveril sem, da funkcije/argumenti, ki jih uporablja, dejansko obstajajo.
  • [ ] Nisem naložil mikro/osebnih/licenciranih podatkov v javno orodje.
  • [ ] Označil sem komentarje, ki vsebujejo vzročni jezik, in jih premaknil v relacijski jezik.
  • [ ] Revizorju lahko pokažem vir in računovodstvo rezultatov.