Jedinica 1 / 11

Umjetna inteligencija u ekonometriji i statistici: uloge, granice, autentifikacija i privatnost

Dobici:

  • Biti u stanju razlikovati gdje u empirijskom tijeku rada (čišćenje podataka, kod, vizualizacija, interpretacija nacrta) umjetna inteligencija štedi stvarno vrijeme, a gdje su odluke kao što su odabir modela, tvrdnja o kauzalnosti i odluka o objavljivanju prepuštene stručnjaku, u skladu s razinom rizika zadatka
  • Sposobnost primjene discipline koja provjerava svaki izlaz umjetne inteligencije (broj, koeficijent, kod, komentar) kroz korake ponovnog izračuna, povezivanja s izvorom i statističkog filtriranja.
  • Sposobnost sigurne obrade mikropodataka i povjerljivih/licenciranih skupova podataka u okviru KVKK/GDPR i ugovora o korištenju podataka te stjecanje navike odabira odgovarajućih alata.

Ista se pitanja ponavljaju svaki dan na stolu ekonometričara ili primijenjenih statističara: je li ovaj skup podataka pouzdan; Što učiniti s tim vrijednostima koje nedostaju? Što zapravo govori koeficijent ove regresije? Je li ovaj odnos uzročno-posljedični ili samo korelacijski? Budući da je ova p-vrijednost značajna, mogu li je napisati u članku ili sažetku politike? Neka od ovih pitanja se ponavljaju, zahtijevaju veliki broj kodova i oduzimaju puno vremena: čišćenje podataka, iscrtavanje istog grafikona deset puta, otklanjanje pogrešaka R ili Python koda, nizanje rezultata u tablicu. Drugi izravno određuju valjanost nalaza, poštenje objave ili točnost političke odluke.

Umjetna inteligencija (AI ukratko, AI - računalni sustavi koji mogu proizvoditi tekst i kodirati poput ljudi, prepoznavati obrasce, sažimati podatke i pisati komentare; danas se najčešće koriste veliki jezični modeli, odnosno sustavi koji se treniraju na ogromnom tekstu i grade rečenice predviđajući sljedeću riječ) nalazi se točno u sredini ove tablice. Kada se pravilno koristi, smanjuje sate koda za čišćenje podataka na minute, podsjeća vas na sintaksu složenog statističkog testa ili nacrta tumačenje koeficijenta. Kada se koristi neispravno, predstavlja naizgled siguran, ali potpuno izmišljen broj, lažno značenje ili nekauzalni odnos kao "nalaz".

Ova prva jedinica nije uvod u softver. Njegova je svrha razjasniti gdje staviti AI u svoj empirijski radni tijek, a gdje ga nikada. Ekonometrija je i "kritično za metode" i neizravno "kritično za odlučivanje" polje: koeficijent modela koji izgradite može biti input za odluku središnje banke o kamatnoj stopi, promjenu politike regulatora ili investiciju tvrtke od milijun dolara. Izložimo osnovno načelo od početka: Umjetna inteligencija je pomoćnik u analizi, a ne istraživač. Odgovornost i konačno odobrenje odabira modela, strategije identifikacije, utvrđivanja uzročnosti, objavljivanja i političkih odluka leži na kompetentnom stručnjaku.

Slojevi empirijskog tijeka rada i mjesto umjetne inteligencije

Korisno je empirijsku studiju podijeliti u tri sloja. Izvršni sloj je svakodnevni tehnički posao: kod za čišćenje podataka, crtanje grafikona, formatiranje tablice, otklanjanje pogrešaka u sintaksi. Sloj metode je analitička odluka: koji model, koja strategija identifikacije, koji test, koja provjera pretpostavki. Sloj tumačenja i odlučivanja je značenje nalaza: što koeficijent govori, je li uzročan, što znači za politiku, treba li biti objavljen. AI dotiče sva tri sloja, ali s različitim autoritetom u svakom. Na izvršnom sloju AI brzo crta i generira kod; Na razini tumačenja i odlučivanja daje se samo input i stručnjak donosi odluku.

Definirajmo nekoliko osnovnih pojmova od početka. Ekonometrija je grana koja analizira ekonomske i društvene podatke statističkim metodama i mjeri odnose. Regresija je metoda koja numerički modelira odnos varijable ishoda (ovisne varijable) s jednom ili više eksplanatornih varijabli (neovisnih varijabli). Koeficijent je broj koji pokazuje s koliko je jedinica promjene u prosjeku promjena jedne jedinice u eksplanatornoj varijabli povezana u varijabli ishoda. P-vrijednost je vjerojatnost da bi se promatrani ishod (ili ekstremniji ishod) dogodio slučajno kada učinak zapravo ne postoji. Objasnit ćemo ove pojmove jedan po jedan u sljedećim jedinicama; Za sada znajte ovo: u svemu tome AI vam daje nacrt, kôd i objašnjenje, ali ne donosi znanstvene odluke.

Sljedeća tablica sažima ulogu i razinu rizika umjetne inteligencije po misiji:

Potraga

Uloga umjetne inteligencije

Razina rizika

Tko odobrava

Pisanje koda za čišćenje podataka

generator koda

nizak

Sam analitičar (uz testiranje koda)

Nacrt grafikona/tablice

generator skica

nizak

analitičar

Podsjetnik na sintaksu testa/modela

Referentni asistent

nisko-srednje

analitičar

Tumačenje koeficijenta nacrta

pisac nacrta

srednji

ekonometričar

Odabir strategije modela/identifikacije

pomoćni ulaz

visoka

stručni istraživač

Tvrdnja o uzročnosti

Samo nacrt, nikad posljednja riječ

vrlo visoko

Stručna + kolegijalna recenzija

Publikacija/politička odluka

samo unos

vrlo visoko

Odgovorni istraživač/institucija

Imajte na umu jedan redak u ovoj tablici: kako rizik raste, uloga umjetne inteligencije se smanjuje, a odobravanje stručnjaka raste.

Zašto je "provjera" srce ovog posla

Čini se da su jezični modeli sigurni u svoj odgovor, ali možda nisu sigurni. Tehničkim jezikom to se zove halucinacija: to je modelovo izmišljanje nepostojećih informacija u tečnoj rečenici, baš kao da je istina. Za ekonometričara ovo je smrtonosna zamka. Model vam može dati točan broj kao što je "Korelacija između nezaposlenosti i inflacije u Turskoj između 2015.-2020. je 0,62"; Međutim, on nikada nije vidio vaše podatke i ovaj broj je potpuno izmišljen. Ili bi moglo pisati: "p-vrijednost bijelog testa bila je 0,03"; dok nije proveo nikakve testove. Može pozvati R funkciju s argumentom koji zapravo ne postoji. Sve tri pjeva jednako tečno; Jedina stvar koja odvaja dobro od zla je vaše znanje i vaša navika provjeravanja.

Disciplina provjere sastoji se od tri koraka:

  1. Ponovno izračunajte / pokrenite u vlastitom okruženju: Izračunajte svaki broj, omjer, rezultat testa i koeficijent koji daje AI u R/Python s vašim vlastitim podacima, a ne iz AI memorije. Koristite AI za pisanje koda, a ne za pamćenje rezultata. Pokrenite kod, proizvest ćete izlaz.
  2. Veza na izvor: Oslonite se na udžbenike, članke o metodama i službene dokumente za pravila, formule i definicije metoda. Potvrdite AI-jevu izjavu "pretpostavka ovog testa je" pouzdanim izvorom.
  3. Statistički filtar: Stručnim očima provjerite proturječi li rezultat statističkoj logici (pretpostavke, uzorak, veličina učinka, nesigurnost). Odbacite "značajan, ali apsurdan" rezultat.
Oprez: Stavljanje koeficijenta, testa ili tumačenja generiranog umjetnom inteligencijom u članak, tezu ili bilješku o politici bez potvrđivanja je poput objavljivanja nerevidiranog nalaza. Samo zato što je izlaz tečan nije istina; Samo zato što se broj čini sigurnim, on nije stvaran.

Privatnost: mikro podaci i licencirani podaci zaštićeni su privatno

Mikropodaci (pojedinačni zapisi na razini pojedinca, kućanstva, tvrtke ili pacijenta) često se koriste u ekonometriji. Većina ovih podataka su osobni podaci i zaštićeni su KVKK (Zakon o zaštiti osobnih podataka) u Turskoj i GDPR u Europi. Dodatno, TurkStat, središnje banke, davatelji panelnih podataka i komercijalni izvori često daju podatke uz ugovor o korištenju podataka; Ovi ugovori zabranjuju prijenos podataka trećim stranama. Lijepljenje tablice koja sadrži informacije o identitetu, prihodu, zdravlju ili tajnama tvrtke u javni AI chat alat je i kršenje KVKK/GDPR i kršenje ugovora; jer podaci idu na vanjski poslužitelj i mogu se koristiti u obuci modela u nekim alatima.

Pravilo je jednostavno: čuvajte podatke u vlastitom sigurnom okruženju, pitajte AI samo za kod i metode. Idealan tijek rada je sljedeći: zatražite od umjetne inteligencije kod za analizu, a vi pokrenite kod sa stvarnim podacima na vlastitom računalu/poslužitelju poduzeća. Ako stvarno morate dijeliti podatke, anonimizirajte (uklonite ID polja), agregirajte (prosjek/broj umjesto pojedinačnih) i odaberite alate koji su institucionalni, imate ugovor o obradi podataka i nemojte koristiti svoje podatke u obrazovanju.

tri mini kućišta

Slučaj 1 — sigurna i učinkovita uporaba. Jedan je istraživač prvo proveo 6 sati ručno čisteći 40 000 redaka podataka o kućnom proračunu. Uopće nije podijelio podatke, samo je AI-ju opisao imena i strukturu varijabli i zatražio kod za čišćenje. AI je generirao R skriptu; Istraživač je pokrenuo kod u vlastitom okruženju, provjerio broj redaka i sumarnu statistiku svakog koraka i popravio dvije logičke pogreške. Trajanje: 70 minuta umjesto 6 sati. Podaci nikada nisu izašli; Odgovornost je ostala na istraživaču.

Slučaj 2 — Neprovjerena zamka brojeva. "Kolika je elastičnost između rasta BDP-a i izravnih stranih ulaganja", upitao je AI jedan diplomirani student. AI je pouzdano dao broj od "oko 0,34" iako nije imao pristup nikakvim podacima. Učenik je ovo napisao u sažetku literature; Kada je njegov savjetnik pitao za izvor, pokazalo se da brojka nema temelja i da je potpuno izmišljena. Pogreška: Očekivati ​​konkretne statistike od umjetne inteligencije bez davanja podataka i resursa.

Slučaj 3 — Povjerljivost i kršenje ugovora. Analitičar je učitao Excel, koji je dobio od panela licencirane tvrtke, koji je sadržavao naziv tvrtke i promet, u javno dostupan AI alat i rekao "napravite regresiju panela". Ugovor davatelja podataka zabranjivao je prijenos podataka sustavima trećih strana; Incident je potaknuo pregled sukladnosti. Pravi način bio je zamijeniti nazive tvrtki anonimnim kodovima ili ne dijeliti podatke i samo zatražiti regresijski kod panela i pokrenuti ga u vlastitom okruženju.

Slab upit / Jak upit

Slab upit:

Analizirajte odnos inflacije i nezaposlenosti i navedite koeficijent.

Ova tvrdnja je pogrešna: AI-ju nisu dani nikakvi podaci, nije jasno koja je zemlja, koje razdoblje, koji model. AI može odgovoriti samo s izmišljenim koeficijentom.

Snažan upit:

Vaša uloga: vi ste asistent analize koji pomaže ekonometrijskim istraživačima. NE dijelim podatke s vama; Samo želim RUNNABLE R kod. Imam godišnji panel: varijable država, godina, nezaposlenost, inflacija (sve numeričke). Zadatak: 1) napišite regresijski kod ploče s fiksnim učincima za nezaposlenost ~ inflaciju (paket plm), 2) objasnite svaki korak u kodu retkom komentara, 3) imajte na umu da se koeficijent treba tumačiti kao relacijski, a ne UZROČNO, 4) sastavite argument funkcije za koji niste sigurni; Trčat ću i provjeriti rezultat u vlastitom okruženju.

U ovom zahtjevu se ne dijele podaci, uloga, paketi, očekivanje komentara i zabrana "izmišljanja" su jasni. Još uvijek sami pokrećete i provjeravate izlaz.

Sljedeća tablica sažima pravila od jedne rečenice u ovoj lekciji:

princip

Što to znači

AI je pomoćnik

Znanstvena odluka i odgovornost pripada stručnjaku

Zatražite kod, proizvedite rezultat

AI se ne sjeća broja; pokrenete ga i izračunate

čuvati podatke

Mikro/licencirani podaci ne napuštaju sigurno okruženje

potvrditi

Svaki problem, kod, komentar se provjerava; izmišljotina se odbija

Uobičajene greške

  • Očekivanje konkretnih statistika od umjetne inteligencije bez davanja podataka. Model ne može pristupiti podacima; Koeficijent, korelacija i p-vrijednost koje daje su lažni. Uvijek zatražite kod i sami proizvedite rezultat.
  • Oslanjanje na halucinatorne funkcije. AI može predložiti R/Python funkciju ili argument koji ne postoji. Ne prihvaćajte kod bez pokretanja i provjere.
  • Prijenos mikropodataka u javni alat. To je kršenje KVKK/GDPR i ugovora o korištenju podataka. Anonimizirajte podatke ili ih uopće nemojte dijeliti.
  • Zamjena tečnosti za točnost. Dobro napisana recenzija može biti netočna. Ljepota rečenice nije dokaz.
  • Prihvaćanje kauzalnog jezika bez kontrole. YZ često kaže "X povećava Y"; dok većina regresija pokazuje samo odnose. Obranite kauzalnu tvrdnju dizajnom.
Savjet: kada radite s umjetnom inteligencijom, postavite si ovo pitanje: "Ako sudac ili revizor zatraži ovaj rezultat, mogu li pokazati izvor i račun?" Ako je odgovor ne, izlaz još nije spreman za upotrebu.

Ukratko

AI pruža stvarno i veliko ubrzanje u izvršnom sloju (kod, čišćenje, grafikon, nacrt) ekonometrijskog i statističkog tijeka rada; međutim, odabir modela, uzročnost, tumačenje, objavljivanje i političke odluke pripadaju stručnjaku. Tri osnovne discipline: ne podsjećajte AI na broj, tražite kod i sami generirajte i provjerite rezultat; nemojte uklanjati mikro/licencirane podatke iz sigurnog okruženja; statistički filter svakog izlaza. Neprovjereni rezultat umjetne inteligencije jednako je riskantan kao i nerevidirani nalaz.

Zadatak aplikacije

Razmotrite vlastiti (ili primjer) skup podataka. Zatražite AI za R ili Python kod koji proizvodi deskriptivnu statistiku i jednostavan grafikon jednostavnim opisom strukture varijable, bez dijeljenja podataka. Pokrenite dolazni kod u vlastitom okruženju. Zatim vodite popis za provjeru: (1) je li se kod izvodio bez pogrešaka, (2) je broj redaka/zapažanja kao što ste očekivali, (3) koja od AI-jevih rečenica komentara koristi uzročni jezik i treba je popraviti. U jednom odlomku napišite koliko vas je vrijeme AI spasio i barem jednu grešku koju ste uhvatili.

popis za provjeru

  • [ ] Nisam natjerao AI da traži konkretne statistike; Zatražio sam kod i sam proizveo rezultat.
  • [ ] Ponovno sam izračunao svaki broj i rezultat testa koji je dao u mom okruženju.
  • [ ] Provjerio sam postoje li funkcije/argumenti koje koristi.
  • [ ] Nisam prenio mikro/osobne/licencirane podatke u javni alat.
  • [ ] Označio sam komentare koji sadrže kauzalni jezik i premjestio ih na relacijski jezik.
  • [ ] Mogu revizoru pokazati izvor i računovodstvo rezultata.