Jedinica 1 / 11

Umjetna inteligencija u ekonometriji i statistici: uloge, granice, autentifikacija i privatnost

Dobici:

  • Mogućnost razlikovanja gdje u empirijskom toku rada (čišćenje podataka, kod, vizualizacija, nacrt interpretacije) umjetna inteligencija štedi u stvarnom vremenu, a gdje su odluke kao što su odabir modela, tvrdnja o uzročnosti i odluka o objavljivanju prepuštene stručnjaku, prema nivou rizika zadatka
  • Sposobnost primjene discipline koja provjerava svaki izlaz umjetne inteligencije (broj, koeficijent, kod, komentar) kroz korake ponovnog izračunavanja, povezivanja sa izvorom i statističkog filtriranja.
  • Sposobnost bezbedne obrade mikro podataka i poverljivih/licenciranih skupova podataka u okviru KVKK/GDPR i ugovora o korišćenju podataka i sticanje navike odabira odgovarajućih alata.

Svakodnevno se ponavljaju ista pitanja na stolu ekonometričara ili primijenjenog statističara: Da li je ovaj skup podataka pouzdan; Šta učiniti s ovim nedostajućim vrijednostima? Šta zapravo govori koeficijent ove regresije? Je li ova veza uzročna ili samo korelacija? Budući da je ova p-vrijednost značajna, mogu li je napisati u članku ili sažetku politike? Neka od ovih pitanja se ponavljaju, zahtijevaju mnogo koda i oduzimaju vrijeme: čišćenje podataka, crtanje istog grafikona deset puta, otklanjanje grešaka u R ili Python kodu, stringovanje rezultata u tabelu. Drugi direktno određuju valjanost nalaza, poštenje publikacije ili tačnost političke odluke.

Umjetna inteligencija (ukratko AI – kompjuterski sistemi koji mogu proizvoditi tekst i kod poput ljudi, prepoznavati obrasce, sumirati podatke i pisati komentare; najčešće korišteni oblik danas su veliki jezički modeli, odnosno sistemi koji se obučavaju na ogromnom tekstu i grade rečenice predviđajući sljedeću riječ) nalazi se tačno u sredini ove tabele. Kada se pravilno koristi, smanjuje sate koda za čišćenje podataka na minute, podsjeća vas na sintaksu složenog statističkog testa ili pravi nacrt interpretacije koeficijenta. Kada se koristi pogrešno, predstavlja naizgled siguran, ali potpuno izmišljen broj, lažni značaj ili ne-uzročnu vezu kao "nalaz".

Ova prva jedinica nije uvod u softver. Njegova svrha je da razjasni gdje staviti AI u svoj empirijski radni tok, a gdje ga nikada ne staviti. Ekonometrija je i polje "kritično za metodu" i indirektno "kritično" za odlučivanje: koeficijent modela koji gradite može biti input za odluku centralne banke o kamatnoj stopi, promjenu politike regulatora ili milionsku investiciju firme. Izložimo osnovni princip od početka: Umjetna inteligencija je pomoćnik u analizi, a ne istraživač. Odgovornost za i konačno odobrenje izbora modela, strategije identifikacije, utvrđivanja uzročnosti, objavljivanja i odluka o politici je na kompetentnom stručnjaku.

Slojevi empirijskog toka rada i mjesto AI

Korisno je podijeliti empirijsku studiju u tri sloja. Izvršni sloj je svakodnevni tehnički posao: kod za čišćenje podataka, crtanje grafikona, formatiranje tabele, otklanjanje grešaka u sintaksi. Sloj metode je analitička odluka: koji model, koja strategija identifikacije, koji test, koja provjera pretpostavke. Sloj tumačenja i odlučivanja je značenje nalaza: šta koeficijent kaže, da li je uzročno, šta znači za politiku, ako se objavi. AI dodiruje sva tri sloja, ali sa različitim autoritetom u svakom. Na izvršnom sloju, AI brzo izrađuje i generiše kod; Na sloju tumačenja i odlučivanja, daje se samo input i ekspert donosi odluku.

Hajde da od početka definišemo nekoliko osnovnih pojmova. Ekonometrija je grana koja analizira ekonomske i društvene podatke statističkim metodama i mjeri odnose. Regresija je metoda koja numerički modelira odnos varijable ishoda (zavisne varijable) sa jednom ili više varijabli koje objašnjavaju (nezavisne varijable). Koeficijent je broj koji pokazuje sa koliko je jedinica promjene u prosjeku povezana promjena od jedne jedinice u varijabli koja objašnjava ishod. P-vrijednost je vjerovatnoća da će se posmatrani ishod (ili ekstremniji ishod) dogoditi slučajno kada nikakav efekat zapravo ne postoji. Objasnit ćemo ove koncepte jedan po jedan u sljedećim jedinicama; Za sada, znajte ovo: u svemu tome, AI vam daje nacrt, kod i objašnjenje, ali ne donosi naučne odluke.

Sljedeća tabela rezimira ulogu i nivo rizika AI po misiji:

Quest

Uloga AI

Nivo rizika

Ko odobrava

Pisanje koda za saniranje podataka

generator koda

nisko

Sam analitičar (sa testiranjem koda)

Nacrt grafikona/tabele

generator skica

nisko

analitičar

Podsjetnik na sintaksu testa/modela

Referentni asistent

nisko-srednje

analitičar

Nacrt tumačenja koeficijenta

pisac nacrta

srednje

ekonometričar

Izbor modela/strategije identifikacije

pomoćni ulaz

visoko

stručni istraživač

Tužba o uzročnosti

Samo nacrt, nikad konačna riječ

veoma visoko

Stručna + recenzija kolega

Publikacija/odluka o politici

samo unos

veoma visoko

Odgovorni istražitelj/institucija

Imajte na umu jednu liniju u ovoj tabeli: kako rizik raste, uloga AI se smanjuje, a odobravanje stručnjaka raste.

Zašto je "verifikacija" srce ovog posla

Jezički modeli izgledaju sigurni u svoj odgovor, ali možda nisu sigurni. Tehničkim jezikom, to se zove halucinacija: to je modelovo izmišljanje nepostojećih informacija u tečnoj rečenici, baš kao da je istina. Za ekonometričara ovo je smrtonosna zamka. Model vam može dati tačan broj kao što je "Korelacija između nezaposlenosti i inflacije u Turskoj između 2015.-2020. je 0,62"; Međutim, on nikada nije vidio vaše podatke i ovaj broj je potpuno izmišljen. Ili bi moglo reći: “P-vrijednost bijelog testa bila je 0,03”; dok nije izvršio nikakve testove. Može pozvati R funkciju s argumentom koji zapravo ne postoji. Sve tri pjeva jednako tečno; Jedina stvar koja razlikuje dobro od pogrešnog je vaše znanje i vaša navika provjere.

Disciplina verifikacije se sastoji od tri koraka:

  1. Ponovo izračunajte / pokrenite u svom okruženju: Izračunajte svaki broj, omjer, rezultat testa i koeficijent koji daje AI u R/Pythonu sa svojim vlastitim podacima, a ne iz memorije AI. Koristite AI da napišete kod, a ne da zapamtite rezultat. Pokrenite kod, proizvodite izlaz.
  2. Link do izvora: Oslonite se na udžbenike, članke o metodama i zvanične dokumente za pravila, formule i definicije metoda. Potvrdite izjavu AI "pretpostavka ovog testa je" sa pouzdanim izvorom.
  3. Statistički filter: Testirajte očima stručnjaka da li je rezultat u suprotnosti sa statističkom logikom (pretpostavke, uzorak, veličina efekta, nesigurnost). Odbacite "smislen, ali apsurdan" rezultat.
Oprez: Stavljanje koeficijenta, testa ili tumačenja generiranog umjetnom inteligencijom u članak, tezu ili bilješku o politici bez potvrđivanja je kao objavljivanje nepregledanog nalaza. Samo zato što je izlaz tečan nije tačno; Samo zato što broj izgleda siguran, nije stvaran.

Privatnost: mikro podaci i licencirani podaci su privatno zaštićeni

Mikropodaci (pojedinačni zapisi na nivou pojedinca, domaćinstva, firme ili pacijenta) se često koriste u ekonometriji. Većina ovih podataka su lični podaci i zaštićeni su KVKK (Zakon o zaštiti ličnih podataka) u Turskoj i GDPR u Evropi. Uz to, TurkStat, centralne banke, pružaoci panel podataka i komercijalni izvori često daju podatke uz ugovor o korištenju podataka; Ovi ugovori zabranjuju prenos podataka trećim licima. Lijepljenje tabele koja sadrži informacije o identitetu, prihodu, zdravstvenim ili poslovnim tajnama u javni AI alat za ćaskanje je i kršenje KVKK/GDPR i kršenje ugovora; jer podaci idu na eksterni server i mogu se koristiti u obuci modela u nekim alatima.

Pravilo je jednostavno: čuvajte podatke u vlastitom sigurnom okruženju, tražite od AI samo kod i metode. Idealan tok posla je sljedeći: zatražite od AI kod za analizu, a vi pokrećete kod sa stvarnim podacima na vlastitom računaru/serveru preduzeća. Ako zaista morate dijeliti podatke, anonimizirajte ih (uklonite ID polja), agregirajte (prosjek/broj umjesto pojedinačnih) i odaberite alate koji su institucionalni, imaju ugovor o obradi podataka i ne koristite svoje podatke u obrazovanju.

tri mini kofera

Slučaj 1 — Sigurna i efikasna upotreba. Jedan istraživač je prvo proveo 6 sati ručno čisteći 40.000 redova podataka o kućnom budžetu. Bez dijeljenja podataka uopće, on je samo opisao imena varijabli i strukturu AI-u i zatražio kod za čišćenje. AI je generirao R skriptu; Istraživač je pokrenuo kod u svom okruženju, provjerio broj redova i zbirnu statistiku svakog koraka i popravio dvije logičke greške. Trajanje: 70 minuta umjesto 6 sati. Podaci nikada nisu izašli; Odgovornost je ostala na istraživaču.

Slučaj 2 — Neprovjerena zamka broja. „Koja je elastičnost između rasta BDP-a i stranih direktnih investicija“, upitao je AI jedan diplomirani student. AI je samouvjereno dao broj od "oko 0,34" iako nije imao pristup nikakvim podacima. Student je ovo napisao u sažetku literature; Kada je njegov savjetnik pitao za izvor, ispostavilo se da je broj bez osnova i da je potpuno izmišljen. Greška: Očekivati ​​konkretne statistike od AI bez davanja podataka i resursa.

Slučaj 3 — Povjerljivost i kršenje ugovora. Analitičar je prenio Excel, koji je dobio od licencirane kompanije, sa nazivom kompanije i prometom, u javno dostupan alat za umjetnu inteligenciju i rekao "uradite regresiju panela". Ugovor dobavljača podataka zabranjivao je prenos podataka na sisteme trećih strana; Incident je doveo do revizije usklađenosti. Pravi način je bio da se nazivi kompanija zamijene anonimnim kodovima ili da se ne razmjenjuju podaci i da se samo zatraži regresijski kod panela i pokrene u vlastitom okruženju.

Slaba prompt / Jaka prompt

Slab upit:

Analizirajte odnos između inflacije i nezaposlenosti i navedite koeficijent.

Ova tvrdnja je pogrešna: AI nisu dati podaci, nije jasno koja zemlja, koji period, koji model. AI može odgovoriti samo sa izmišljenim koeficijentom.

Snažan upit:

Vaša uloga: vi ste asistent analize koji pomaže istraživaču ekonometrije. NE DELIM podatke sa vama; Samo želim RUNNABLE R kod. Imam godišnji panel: varijable zemlja, godina, nezaposlenost, inflacija (sve numerički). Zadatak: 1) napišite regresijski kod panela fiksnih efekata za nezaposlenost ~ inflaciju (plm paket), 2) objasnite svaki korak u kodu uz red za komentare, 3) obratite pažnju da koeficijent treba tumačiti kao relacioni, a ne UZROČNI, 4) sastavite argument funkcije za koji niste sigurni; Ja ću pokrenuti i provjeriti rezultat u svom okruženju.

U ovom zahtjevu se ne dijele nikakvi podaci, jasni su uloga, paketi, očekivanje komentara i zabrana "fabrikacije". I dalje pokrećete i sami provjeravate izlaz.

Sljedeća tabela sažima pravila od jedne rečenice u ovoj lekciji:

princip

šta to znači

AI je asistent

Naučna odluka i odgovornost pripada stručnjaku

Zatražite kod, dajte rezultat

AI ne pamti broj; pokrenite ga i izračunajte

čuvati podatke

Mikro/licencirani podaci ne napuštaju sigurno okruženje

verify

Svaki problem, kod, komentar se provjerava; izmišljotina je odbijena

Uobičajene greške

  • Očekivanje konkretne statistike od AI bez davanja podataka. Model ne može pristupiti podacima; Koeficijent, korelacija i p-vrijednost koje daje su lažni. Uvijek zatražite kod i sami izradite rezultat.
  • Oslanjanje na halucinatorne funkcije. AI može predložiti R/Python funkciju ili argument koji ne postoji. Nemojte prihvatiti kod bez pokretanja i provjere.
  • Prijenos mikropodataka na javni alat. To je kršenje KVKK/GDPR i ugovora o korištenju podataka. Anonimizirajte podatke ili ih nemojte uopće dijeliti.
  • Greška tečnost za tačnost. Dobro napisana recenzija može biti netačna. Ljepota rečenice nije dokaz.
  • Prihvatanje kauzalnog jezika bez kontrole. YZ često kaže "X povećava Y"; dok većina regresija pokazuje samo odnose. Odbranite uzročnu tvrdnju dizajnom.
Savjet: Kada radite s umjetnom inteligencijom, postavite sebi ovo pitanje: „Ako sudija ili revizor zatraži ovaj rezultat, mogu li pokazati izvor i račun?“ Ako je odgovor ne, izlaz još nije spreman za upotrebu.

Ukratko

AI pruža stvarno i ogromno ubrzanje u sloju izvršavanja (kod, čišćenje, grafikon, nacrt) ekonometrije i toka statistike; međutim, odabir modela, uzročnost, tumačenje, objavljivanje i političke odluke pripadaju ekspertu. Tri osnovne discipline: ne podsjećajte AI na broj, tražite kod i sami generirajte i provjerite rezultat; ne uklanjajte mikro/licencirane podatke iz sigurnog okruženja; statistički filtrirati svaki izlaz. Neprovjereni izlaz umjetne inteligencije jednako je rizičan kao i neprovjereni nalaz.

Zadatak aplikacije

Razmotrite svoj vlastiti (ili primjer) skup podataka. Zatražite od AI R ili Python kod koji proizvodi deskriptivnu statistiku i jednostavan grafikon jednostavnim opisom varijabilne strukture, bez dijeljenja podataka. Pokrenite dolazni kod u svom okruženju. Zatim zadržite kontrolnu listu: (1) da li je kod radio bez grešaka, (2) je broj redova/zapažanja kako ste očekivali, (3) koja od rečenica komentara AI-a koristi uzročni jezik i treba da bude ispravljena. U jednom pasusu napišite o vremenu koje vas je AI spasio i o barem jednoj grešci koju ste uhvatili.

kontrolna lista

  • [ ] Nisam naterao AI da traži konkretne statistike; Zatražio sam kod i sam proizveo rezultat.
  • [ ] Ponovo sam izračunao svaki broj i rezultat testa koje je dao u svom okruženju.
  • [ ] Potvrdio sam da funkcije/argumenti koje koristi zaista postoje.
  • [ ] Nisam uploadovao mikro/lične/licencirane podatke na javni alat.
  • [ ] Označio sam komentare koji sadrže kauzalni jezik i premjestio ih na relacijski jezik.
  • [ ] Ja sam u mogućnosti da pokažem izvor i računovodstvo rezultata revizoru.