Yksikkö 1 / 11

Tekoäly ekonometriassa ja tilastoissa: roolit, rajat, todennus ja yksityisyys

Voitot:

  • Kyky erottaa missä empiirisessä työnkulussa (tietojen puhdistus, koodi, visualisointi, tulkintaluonnos) tekoäly säästää reaaliaikaa ja missä päätökset, kuten mallin valinta, syy-seurausväite ja julkaisupäätös jätetään asiantuntijalle tehtävän riskitason mukaan
  • Kyky soveltaa kurinalaisuutta, joka varmistaa jokaisen tekoälyn tulosteen (luku, kerroin, koodi, kommentti) uudelleenlaskennan, lähteeseen linkittämisen ja tilastollisen suodatuksen vaiheiden kautta.
  • Kyky käsitellä turvallisesti mikrodataa ja luottamuksellisia/lisensoituja tietojoukkoja KVKK/GDPR:n ja datan käyttösopimusten puitteissa ja oppia valitsemaan sopivia työkaluja.

Samat kysymykset toistuvat joka päivä ekonometrin tai soveltavan tilastotieteilijän työpöydällä: Onko tämä tietojoukko luotettava? Mitä tehdä näille puuttuville arvoille? Mitä tämän regression kerroin todella sanoo? Onko tämä suhde kausaalinen vai vain korrelaatio? Koska tämä p-arvo on merkittävä, voinko kirjoittaa sen artikkeliin tai toimintaohjeeseen? Jotkut näistä kysymyksistä ovat toistuvia, koodiintensiivisiä ja aikaa vieviä: tietojen puhdistaminen, saman kaavion piirtäminen kymmenen kertaa, R- tai Python-koodin virheenkorjaus, tulosten merkkijono taulukkoon. Toiset määrittävät suoraan havainnon pätevyyden, julkaisun rehellisyyden tai poliittisen päätöksen tarkkuuden.

Tekoäly (lyhyesti AI - tietokonejärjestelmät, jotka pystyvät tuottamaan tekstiä ja koodia kuten ihmiset, tunnistamaan kuvioita, tiivistämään dataa ja kirjoittamaan kommentteja; nykyään eniten käytetty muoto ovat suuria kielimalleja, eli järjestelmät, jotka harjoitellaan valtavaan tekstiin ja rakentavat lauseita ennustamalla seuraavan sanan) istuu aivan tämän taulukon keskellä. Oikein käytettynä se lyhentää tunnin tietojen puhdistuskoodin minuuteiksi, muistuttaa monimutkaisen tilastollisen testin syntaksista tai laatii kertoimen tulkinnan. Väärin käytettynä se esittää "löydöksenä" näennäisen varman mutta täysin keksityn luvun, väärän merkityksen tai ei-syy-yhteyden.

Tämä ensimmäinen yksikkö ei ole ohjelmiston esittely. Sen tarkoitus on selventää, mihin tekoäly kannattaa sijoittaa empiiriseen työnkulkuun ja mihin sitä ei koskaan laita. Ekonometria on sekä "menetelmien kannalta kriittinen" että epäsuorasti "päätöskriittinen" ala: rakentamasi mallin kerroin voi olla panos keskuspankin korkopäätökseen, sääntelijän politiikan muutokseen tai yrityksen miljoonan dollarin sijoitukseen. Laitetaanpa perusperiaate alusta alkaen esille: Tekoäly on analyysiassistentti, ei tutkija. Vastuu mallin valinnasta, tunnistusstrategiasta, syy-seuraussuhteen väittämisestä, julkaisemisesta ja poliittisista päätöksistä ja lopullinen hyväksyntä on pätevällä asiantuntijalla.

Empiirisen työnkulun kerrokset ja tekoälyn paikka

Empiirinen tutkimus on hyödyllistä jakaa kolmeen kerrokseen. Suorituskerros on päivittäistä teknistä työtä: tietojen puhdistuskoodi, kaavion piirtäminen, taulukon muotoilu, syntaksin virheenkorjaus. Menetelmäkerros on analyyttinen päätös: mikä malli, mikä tunnistusstrategia, mikä testi, mikä oletuksen tarkistus. Tulkinta- ja päätöskerros on tulosten merkitys: mitä kerroin sanoo, onko se kausaalista, mitä se tarkoittaa politiikan kannalta, pitäisikö se julkaista. Tekoäly koskettaa kaikkia kolmea kerrosta, mutta jokaisessa on erilainen auktoriteetti. Suorituskerroksessa tekoäly luonnostelee ja luo koodin nopeasti; Tulkinta- ja päätöstasolla annetaan vain panos ja asiantuntija tekee päätöksen.

Määritellään muutama perustermi alusta alkaen. Ekonometria on ala, joka analysoi taloudellista ja sosiaalista tietoa tilastollisilla menetelmillä ja mittaa suhteita. Regressio on menetelmä, joka mallintaa numeerisesti tulosmuuttujan (riippuvaisen muuttujan) suhdetta yhteen tai useampaan selittävään muuttujaan (riippumattomaan muuttujaan). Kerroin on luku, joka osoittaa, kuinka moneen muutosyksikköön keskimäärin yhden yksikön muutos selittävässä muuttujassa liittyy tulosmuuttujaan. P-arvo on todennäköisyys, että havaittu tulos (tai äärimmäisempi tulos) tapahtuisi sattumalta, kun vaikutusta ei todellakaan ole. Selitämme nämä käsitteet yksitellen seuraavissa yksiköissä; Tiedä toistaiseksi tämä: kaikissa näissä tekoäly antaa sinulle suunnitelman, koodin ja selityksen, mutta se ei tee tieteellisiä päätöksiä.

Seuraavassa taulukossa on yhteenveto tekoälyn roolista ja riskitasosta tehtävän mukaan:

Quest

AI:n rooli

Riskitaso

Kuka hyväksyy

Kirjoitetaan tietojen puhdistuskoodia

koodigeneraattori

alhainen

Analyytikko itse (kooditestauksen kanssa)

Kaavio/taulukkoluonnos

luonnosgeneraattori

alhainen

analyytikko

Testaa/mallin syntaksimuistutus

Referenssiassistentti

matala-keskinen

analyytikko

Luonnos kertoimen tulkinnasta

luonnoksen kirjoittaja

keskikokoinen

ekonometikko

Mallin/tunnistusstrategian valinta

aputulo

korkea

asiantuntija tutkija

Syy-yhteyttä koskeva väite

Vain luonnos, ei koskaan lopullinen sana

erittäin korkea

Asiantuntija + vertaisarviointi

Julkaisu/politiikkapäätös

vain syöttö

erittäin korkea

Vastuullinen tutkija/laitos

Pidä mielessä tämän taulukon yksi rivi: riskin kasvaessa tekoälyn rooli pienenee ja asiantuntijoiden hyväksyntä kasvaa.

Miksi "vahvistus" on tämän liiketoiminnan ydin

Kielimallit näyttävät luottavaisilta vastauksessaan, mutta he eivät välttämättä ole varmoja. Teknisellä kielellä tätä kutsutaan hallusinaatioksi: se on mallin valmistamaa olematonta tietoa sujuvassa lauseessa, aivan kuin se olisi totta. Taloustieteilijälle tämä on tappava ansa. Malli voi antaa sinulle tarkan luvun, kuten "Türkiyen työttömyyden ja inflaation välinen korrelaatio vuosina 2015-2020 on 0,62"; Hän ei kuitenkaan ole koskaan nähnyt tietojasi, ja tämä numero on täysin keksitty. Tai se voi sanoa: "Valkoisen testin p-arvo oli 0,03"; kun taas se ei suorittanut mitään testejä. Se voi kutsua R-funktiota argumentilla, jota ei todellisuudessa ole olemassa. Hän laulaa kaikkia kolmea samalla sujuvuudella; Ainoa asia, joka erottaa oikean väärästä, on tietosi ja tapasi todentaa.

Varmistuskuri koostuu kolmesta vaiheesta:

  1. Laske uudelleen / suorita omassa ympäristössäsi: Laske jokainen tekoälyn R/Pythonissa antama luku, suhde, testitulos ja kerroin omilla tiedoillasi, ei tekoälyn muistista. Käytä tekoälyä koodin kirjoittamiseen, älä muista tulosta. Suorita koodi, tuot tulosteen.
  2. Linkki lähteeseen: Käytä oppikirjoja, menetelmäartikkeleita ja virallisia asiakirjoja menetelmäsäännöissä, kaavoissa ja määritelmissä. Vahvista tekoälyn väite "tämän testin oletus on" luotettavasta lähteestä.
  3. Tilastollinen suodatin: Testaa asiantuntevin silmin, onko tulos ristiriidassa tilastollisen logiikan kanssa (oletukset, näyte, efektin koko, epävarmuus). Hylkää "merkittävä mutta absurdi" tulos.
Varoitus: Tekoälyn luoman kertoimen, testin tai tulkinnan lisääminen artikkeliin, tutkielmaan tai käytäntöhuomautukseen vahvistamatta sitä on kuin tarkistamattoman löydön julkaiseminen. Vain siksi, että tulos on sujuva, ei ole totta; Vain koska numero näyttää varmalta, se ei ole totta.

Yksityisyys: mikrotiedot ja lisensoidut tiedot ovat yksityisesti suojattuja

Mikrodataa (yksittäisiä tietueita yksilön, kotitalouden, yrityksen tai potilaan tasolla) käytetään usein ekonometriassa. Suurin osa näistä tiedoista on henkilötietoja, ja ne on suojattu KVKK:n (Personal Data Protection Law) -lain (Türkiye) ja GDPR:n mukaisesti Euroopassa. Lisäksi TurkStat, keskuspankit, paneelitietojen toimittajat ja kaupalliset lähteet toimittavat tietoja usein tiedonkäyttösopimuksella; Nämä sopimukset kieltävät tietojen siirtämisen kolmansille osapuolille. Identiteettitietoja, tuloja, terveyttä tai yrityssalaisuuksia sisältävän taulukon liittäminen julkiseen AI-chat-työkaluun on sekä KVKK/GDPR-rikkomus että sopimusrikkomus; koska tiedot menevät ulkoiselle palvelimelle ja niitä voidaan käyttää mallikoulutuksessa joissakin työkaluissa.

Sääntö on yksinkertainen: säilytä tiedot omassa turvallisessa ympäristössään, pyydä tekoälyltä vain koodia ja menetelmiä. Ihanteellinen työnkulku on tämä: pyydä tekoälyltä analyysikoodi, suoritat koodin oikeilla tiedoilla omalla tietokoneellasi/yrityspalvelimellasi. Jos sinun on todellakin jaettava tietoja, anonymisoi (poista ID-kentät), aggregoi (keskiarvo/luku mieluummin kuin yksittäinen) ja valitse työkalut, jotka ovat institutionaalisia, joilla on tietojenkäsittelysopimus, äläkä käytä tietojasi koulutuksessa.

kolme minilaukkua

Tapaus 1 – Turvallinen ja tehokas käyttö. Eräs tutkija käytti ensin kuusi tuntia puhdistaakseen manuaalisesti 40 000 riviä kotitalouden budjettitietoja. Jakamatta tietoja ollenkaan, hän kuvaili vain muuttujien nimet ja rakenteen tekoälylle ja pyysi puhdistuskoodia. AI loi R-skriptin; Tutkija suoritti koodin omassa ympäristössään, tarkasti jokaisen vaiheen rivien lukumäärän ja yhteenvetotilastot sekä korjasi kaksi logiikkavirhettä. Kesto: 70 minuuttia 6 tunnin sijaan. Tiedot eivät koskaan sammuneet; Vastuu jäi tutkijalle.

Tapaus 2 — Vahvistamaton numeroloukku. "Mikä on BKT:n kasvun ja suorien ulkomaisten investointien välinen joustavuus", jatko-opiskelija kysyi AI:ltä. Tekoäly antoi luottavaisesti luvun "noin 0,34", vaikka sillä ei ollut pääsyä tietoihin. Opiskelija kirjoitti tämän kirjallisuustiivistelmään; Kun hänen neuvonantajansa kysyi lähteestä, kävi ilmi, että numerolla ei ollut perustetta ja se oli täysin väärennetty. Virhe: Odotetaan konkreettisia tilastoja tekoälyltä antamatta sille tietoja ja resursseja.

Tapaus 3 – Luottamuksellisuus ja sopimusrikkomus. Analyytikko latasi Excelin, jonka hän sai lisensoidulta yrityksen paneelilta ja joka sisälsi yrityksen nimen ja liikevaihdon, julkisesti saatavilla olevaan tekoälytyökaluun ja sanoi "tee paneeliregressio". Tietojen toimittajan sopimus kielsi tietojen siirtämisen kolmansien osapuolten järjestelmiin; Tapaus johti vaatimustenmukaisuustarkastukseen. Oikea tapa oli korvata yritysten nimet anonyymeillä koodeilla tai olla jakamatta tietoja ja pyytää vain paneelin regressiokoodi ja ajaa se omassa ympäristössään.

Heikko kehote / Vahva kehote

Heikko kehote:

Analysoi inflaation ja työttömyyden suhdetta ja kerro kerroin.

Tämä väite on väärä: tekoälylle ei annettu tietoja, ei ole selvää, mikä maa, mikä ajanjakso, mikä malli. Tekoäly voi vastata vain keksityllä kertoimella.

Tehokas kehotus:

Tehtäväsi: olet ekonometriatutkijaa avustava analyysiassistentti. EN jaa tietoja kanssasi; Haluan vain RUNNABLE R -koodin. Minulla on vuosipaneeli: muuttujat maa, vuosi, työttömyys, inflaatio (kaikki numeeriset). Tehtävä: 1) kirjoita kiinteiden vaikutusten paneelin regressiokoodi työttömyyden ~ inflaatiolle (plm-paketti), 2) selitä jokainen koodin vaihe kommenttirivillä, 3) huomioi, että kerroin tulee tulkita relaatioksi, ei SYY-, 4) muodosta funktion argumentti, josta et ole varma; Ajan ja tarkistan tuloksen omassa ympäristössäni.

Tässä pyynnössä ei jaeta tietoja, rooli, paketit, kommenttien odotukset ja "valmistuksen" kielto ovat selvät. Suoritat edelleen ja tarkistat tulosteen itse.

Seuraavassa taulukossa on yhteenveto tämän oppitunnin yhden lauseen säännöistä:

periaatetta

Mitä se tarkoittaa?

AI on avustaja

Tieteellinen päätös ja vastuu kuuluu asiantuntijalle

Pyydä koodi, tuo tulos

Tekoäly ei muista numeroa; suoritat sen ja lasket

säilyttää tiedot

Mikro-/lisensoidut tiedot eivät poistu suojatusta ympäristöstä

vahvistaa

Jokainen ongelma, koodi, kommentti tarkistetaan; valmistus hylätään

Yleisiä virheitä

  • Odotetaan konkreettisia tilastoja tekoälyltä antamatta tietoja. Malli ei pääse käsiksi tietoihin; Sen antama kerroin, korrelaatio ja p-arvo ovat vääriä. Pyydä aina koodi ja tee tulos itse.
  • Luottaa hallusinatorisiin toimintoihin. Tekoäly voi ehdottaa R/Python-funktiota tai -argumenttia, jota ei ole olemassa. Älä hyväksy koodia suorittamatta ja tarkistamatta sitä.
  • Ladataan mikrodataa julkiseen työkaluun. Se rikkoo KVKK/GDPR:ää ja datankäyttösopimusta. Anonymisoi tiedot tai älä jaa niitä ollenkaan.
  • Erottelee sujuvuutta tarkkuuteen. Hyvin kirjoitettu arvostelu voi olla epätarkka. Lauseen kauneus ei ole todiste.
  • Kausaalisen kielen hyväksyminen ilman valvontaa. YZ sanoo usein "X lisää Y"; kun taas useimmat regressiot osoittavat vain suhteita. Puolusta kausaaliväitettä suunnittelulla.
Vinkki: Kun työskentelet tekoälyn kanssa, kysy itseltäsi seuraava kysymys: "Jos erotuomari tai tarkastaja pyytää tätä tulostetta, voinko näyttää lähteen ja tilin?" Jos vastaus on ei, tuloste ei ole vielä valmis käytettäväksi.

Yhteenvetona

Tekoäly tarjoaa todellisen ja massiivisen kiihdytyksen ekonometiikan ja tilastojen työnkulun suoritustasolla (koodi, puhdistus, kaavio, luonnos); Mallin valinta, syy-yhteys, tulkinta, julkaiseminen ja politiikkapäätökset kuuluvat kuitenkin asiantuntijalle. Kolme perusoppia: älä muistuta tekoälyä numerosta, kysy koodia ja luo ja tarkista tulos itse; älä poista mikro-/lisensoituja tietoja suojatusta ympäristöstä; tilastollinen suodatin jokaiselle ulostulolle. Vahvistamaton tekoälytulos on yhtä vaarallinen kuin tarkistamaton löydös.

Sovellustehtävä

Harkitse omaa (tai esimerkkiä) tietojoukkoasi. Pyydä tekoälyltä R- tai Python-koodi, joka tuottaa kuvaavia tilastoja ja yksinkertaisen kaavion yksinkertaisesti kuvaamalla muuttujan rakennetta jakamatta tietoja. Suorita saapuva koodi omassa ympäristössäsi. Pidä sitten tarkistuslista: (1) suoritettiinko koodi ilman virheitä, (2) rivien/havaintojen määrä odotetusti, (3) mikä tekoälyn kommenttilauseista käyttää kausaalista kieltä ja se pitäisi korjata. Kirjoita yhdessä kappaleessa ajasta, jonka tekoäly pelasti, ja vähintään yhdestä havaitsemastasi viasta.

tarkistuslista

  • [ ] En pakottanut tekoälyä kysymään konkreettisia tilastoja; Pyysin koodin ja tein tuloksen itse.
  • [ ] Laskin uudelleen jokaisen sen antaman luvun ja testituloksen omassa ympäristössäni.
  • [ ] Varmistin, että sen käyttämät funktiot/argumentit ovat todella olemassa.
  • [ ] En ladannut mikro-/henkilökohtaisia/lisensoituja tietoja julkiseen työkaluun.
  • [ ] Merkitsin kausaalikieltä sisältävät kommentit ja siirsin ne relaatiokieleen.
  • [ ] Pystyn näyttämään tuotoksen lähteen ja kirjanpidon tilintarkastajalle.