Kasu:
- Oskus teha vahet, kus empiirilises töövoos (andmete puhastamine, kood, visualiseerimine, mustandtõlgendus) säästab tehisintellekt reaalaega ning kus jäetakse sellised otsused nagu mudeli valik, põhjusliku seose väide ja avaldamise otsus eksperdi teha, vastavalt ülesande riskitasemele.
- Võimalus rakendada distsipliini, mis kontrollib iga tehisintellekti väljundit (arv, koefitsient, kood, kommentaar) ümberarvutamise, allikaga linkimise ja statistilise filtreerimise etappide kaudu.
- Võimalus turvaliselt töödelda mikroandmeid ja konfidentsiaalseid/litsentsitud andmekogumeid KVKK/GDPR ja andmekasutuslepingute raames ning omandada harjumus valida sobivaid tööriistu.
Samad küsimused korduvad iga päev ökonomeetriku või rakendusstatistiku töölaual: Kas see andmekogum on usaldusväärne; Mida teha nende puuduvate väärtustega? Mida selle regressiooni koefitsient tegelikult ütleb? Kas see seos on põhjuslik või ainult korrelatsioon? Kuna see p-väärtus on oluline, kas ma saan selle artiklisse või poliitikakirjeldusse kirjutada? Mõned neist küsimustest on korduvad, koodimahukad ja aeganõudvad: andmete puhastamine, sama graafiku kümme korda joonistamine, R- või Pythoni koodi silumine, tulemuste tabelisse stringimine. Teised määravad otseselt järelduse kehtivuse, väljaande aususe või poliitilise otsuse täpsuse.
Tehisintellekt (lühidalt tehisintellekt, AI – arvutisüsteemid, mis suudavad inimeste kombel teksti ja koodi toota, mustreid tuvastada, andmeid kokku võtta ja kommentaare kirjutada; tänapäeval on enimkasutatav vorm suurkeelemudelid ehk süsteemid, mis on treenitud tohutule tekstile ja koostavad lauseid, ennustades järgmist sõna) asub selle tabeli keskel. Õige kasutamise korral vähendab see tundidepikkust andmete puhastamise koodi minutiteks, tuletab meelde keeruka statistilise testi süntaksit või koostab koefitsiendi tõlgenduse. Ebaõigel kasutamisel esitab see "leiuna" näiliselt kindla, kuid täiesti väljamõeldud arvu, vale tähenduse või mittepõhjusliku seose.
See esimene seade ei ole tarkvara tutvustus. Selle eesmärk on selgitada, kuhu AI oma empiirilises töövoos paigutada ja kuhu seda mitte kunagi panna. Ökonomeetria on nii "meetodikriitiline" kui ka kaudselt "otsustuskriitiline" valdkond: teie koostatud mudeli koefitsient võib olla keskpanga intressimääraotsuse, regulaatori poliitika muutmise või ettevõtte miljoni dollari suuruse investeeringu sisendiks. Paneme algusest peale aluspõhimõtte paika: tehisintellekt on analüüsiassistent, mitte uurija. Vastutus mudeli valiku, identifitseerimisstrateegia, põhjusliku seose kinnitamise, avaldamise ja poliitikaotsuste lõpliku kinnitamise eest lasub pädeval eksperdil.
Empiirilise töövoo kihid ja tehisintellekti koht
Kasulik on jagada empiiriline uurimus kolmeks kihiks. Täitmiskihiks on igapäevane tehniline töö: andmete puhastuskood, graafiku joonistamine, tabeli vormindamine, süntaksi silumine. Meetodikiht on analüütiline otsus: milline mudel, milline identifitseerimisstrateegia, milline test, milline eelduse kontroll. Tõlgendus- ja otsustuskiht on tulemuste tähendus: mida koefitsient ütleb, kas see on põhjuslik, mida see poliitika jaoks tähendab, kas see tuleks avaldada. AI puudutab kõiki kolme kihti, kuid igaühel on erinev volitus. Täitmiskihis koostab ja genereerib tehisintellekt kiiresti koodi; Tõlgendus- ja otsustuskihis antakse ainult sisend ja ekspert teeb otsuse.
Määratleme algusest peale mõned põhimõisted. Ökonomeetria on haru, mis analüüsib majandus- ja sotsiaalandmeid statistiliste meetoditega ning mõõdab seoseid. Regressioon on meetod, mis modelleerib numbriliselt tulemuse muutuja (sõltuva muutuja) seost ühe või mitme seletava muutujaga (sõltumatu muutuja). Koefitsient on arv, mis näitab, kui mitme muutuse ühikuga on keskmiselt seostatud ühe ühikuline selgitava muutuja muutus tulemusmuutujas. P-väärtus on tõenäosus, et vaadeldud tulemus (või äärmuslikum tulemus) ilmneb juhuslikult, kui mõju tegelikult ei eksisteeri. Selgitame neid mõisteid ükshaaval järgmistes üksustes; Praegu teadke seda: tehisintellekt annab teile kõigis neis plaani, koodi ja selgituse, kuid ei tee teaduslikke otsuseid.
Järgmine tabel võtab kokku AI rolli ja riskitaseme missioonide kaupa:
Quest
AI roll
Riski tase
Kes kiidab heaks
Andmete puhastamise koodi kirjutamine
koodi generaator
madal
Analüütik ise (koos kooditestiga)
Diagrammi/tabeli mustand
visandite generaator
madal
analüütik
Testi/mudeli süntaksi meeldetuletus
Viide assistent
madal-keskmine
analüütik
Koefitsientide tõlgendamise eelnõu
mustandi kirjutaja
keskmine
ökonomeetrik
Mudeli/tuvastusstrateegia valik
abisisend
kõrge
asjatundlik uurija
Põhjusliku seose väide
Lihtsalt mustand, mitte kunagi lõplik sõna
väga kõrge
Ekspert + eksperdihinnang
Väljaanne/poliitiline otsus
ainult sisend
väga kõrge
Vastutav uurija/asutus
Pidage meeles selle tabeli ühte rida: riski suurenedes väheneb tehisintellekti roll ja ekspertide heakskiit kasvab.
Miks "kinnitamine" on selle ettevõtte süda
Keelemudelid näivad oma vastuses kindlad, kuid nad ei pruugi olla kindlad. Tehnilises keeles nimetatakse seda hallutsinatsiooniks: see on mudeli poolt olematu teabe väljamõeldis ladusas lauses, just nagu see oleks tõsi. Ökonomeetriku jaoks on see surmav lõks. Mudel võib anda teile täpse arvu, näiteks "Türkiye tööpuuduse ja inflatsiooni vaheline korrelatsioon aastatel 2015-2020 on 0,62"; Kuid ta pole kunagi teie andmeid näinud ja see number on täiesti välja mõeldud. Või võib öelda: "Valge testi p-väärtus oli 0,03"; samas kui see ei teinud ühtegi testi. See võib kutsuda R-funktsiooni argumendiga, mida tegelikult ei eksisteeri. Ta laulab kõiki kolme ühesuguse ladususega; Ainus, mis eristab õiget valest, on teie teadmised ja harjumus kontrollida.
Kontrollimise distsipliin koosneb kolmest etapist:
- Arvutage ümber / käivitage oma keskkonnas: arvutage iga arv, suhe, testitulemus ja koefitsient, mille AI andab R/Pythonis oma andmetega, mitte tehisintellekti mälust. Kasutage AI-d koodi kirjutamiseks, mitte tulemuse meeldejätmiseks. Käivitage kood, toodate väljundi.
- Link allikale: meetodireeglite, valemite ja definitsioonide leidmiseks tuginege õpikutele, meetodite artiklitele ja ametlikele dokumentidele. Kinnitage usaldusväärse allikaga tehisintellekti väide "selle testi eeldus on".
- Statistiline filter: testige asjatundliku pilguga, kas väljund on vastuolus statistilise loogikaga (eeldused, valim, efekti suurus, määramatus). Lükka tagasi "tähenduslik, kuid absurdne" tulemus.
Ettevaatust. Tehisintellekti loodud koefitsiendi, testi või tõlgenduse lisamine artiklisse, lõputöösse või poliitikamärkusesse ilma seda kinnitamata on nagu läbivaatamata leiu avaldamine. See, et väljund on ladus, ei vasta tõele; Lihtsalt sellepärast, et number tundub kindel, pole see reaalne.
Privaatsus: mikroandmed ja litsentsitud andmed on privaatselt kaitstud
Mikroandmeid (üksikuid kirjeid üksikisiku, leibkonna, ettevõtte või patsiendi tasandil) kasutatakse ökonomeetrias sageli. Enamik neist andmetest on isikuandmed ja on kaitstud KVKK (isikuandmete kaitse seaduse) alusel Türkiye's ja GDPR-iga Euroopas. Lisaks esitavad TurkStat, keskpangad, paneeliandmete pakkujad ja kommertsallikad sageli andmeid andmekasutuslepinguga; Need lepingud keelavad andmete edastamise kolmandatele isikutele. Isikuandmete, sissetulekute, tervise- või ettevõttesaladusi sisaldava tabeli kleepimine avalikku tehisintellekti vestlustööriista on nii KVKK/GDPR kui ka lepingu rikkumine; sest andmed lähevad välisserverisse ja neid saab kasutada mõne tööriista mudelikoolituses.
Reegel on lihtne: hoidke andmeid oma turvalises keskkonnas, küsige AI-lt ainult koodi ja meetodeid. Ideaalne töövoog on järgmine: küsige AI-lt analüüsikoodi, käivitate koodi tegelike andmetega oma arvutis/ettevõtte serveris. Kui peate tõesti andmeid jagama, anonüümseks muutke (eemaldage ID-väljad), koondage (keskmine/loendage, mitte üksikud) ja valige tööriistad, mis on institutsionaalsed, millel on andmetöötlusleping ja ärge kasutage oma andmeid õppetöös.
kolm minikarpi
Juhtum 1 – ohutu ja tõhus kasutamine. Üks teadlane kulutas kõigepealt 6 tundi, et puhastada käsitsi 40 000 rida leibkonna eelarve andmeid. Andmeid üldse jagamata kirjeldas ta lihtsalt AI-le muutujate nimesid ja struktuuri ning küsis puhastuskoodi. AI genereeris R-skripti; Teadlane käivitas koodi oma keskkonnas, kontrollis ridade arvu ja iga sammu kokkuvõtvat statistikat ning parandas kaks loogikaviga. Kestus: 6 tunni asemel 70 minutit. Andmed ei kustunud kunagi; Vastutus jäi uurijale.
Juhtum 2 – kontrollimata numbrilõks. "Milline on elastsus SKT kasvu ja välismaiste otseinvesteeringute vahel," küsis üks magistrant AI-lt. AI andis enesekindlalt arvu "umbes 0,34", kuigi tal polnud juurdepääsu andmetele. Õpilane kirjutas selle kirjanduse kokkuvõttesse; Kui tema nõunik allika kohta küsis, selgus, et sellel numbril polnud alust ja see oli täiesti väljamõeldud. Viga: AI-lt oodatakse konkreetset statistikat ilma andmeid ja ressursse andmata.
Juhtum 3 – konfidentsiaalsus ja lepingu rikkumine. Analüütik laadis Exceli, mille ta sai litsentsitud ettevõtte paneelilt, sisaldades ettevõtte nime ja käivet, avalikult kättesaadavasse tehisintellekti tööriista ning ütles: "tee paneeli regressioon". Andmepakkuja leping keelas andmete edastamise kolmandate isikute süsteemidesse; Juhtum ajendas vastavuskontrolli. Õige viis oli asendada ettevõtete nimed anonüümsete koodidega või mitte jagada andmeid ning küsida ainult paneeli regressioonikoodi ja käivitada see oma keskkonnas.
Nõrk viip / Tugev viip
Nõrk viip:
Analüüsige inflatsiooni ja tööpuuduse vahelist seost ning nimetage koefitsient.
See väide on vale: AI-le andmeid ei antud, pole selge, mis riik, mis periood, mis mudel. AI saab vastata ainult väljamõeldud koefitsiendiga.
Võimas viip:
Sinu roll: oled analüüsiassistent, kes abistab ökonomeetriauurijat. MA EI JAGA andmeid teiega; Ma tahan lihtsalt RUNNABLE R-koodi. Mul on aastane paneel: muutujad riik, aasta, töötus, inflatsioon (kõik numbrid). Ülesanne: 1) kirjutage fikseeritud efektide paneeli regressioonikood tööpuuduse ~ inflatsiooni kohta (plm pakett), 2) selgitage koodi iga sammu kommentaarireaga, 3) pange tähele, et koefitsienti tuleks tõlgendada relatsioonilisena, mitte PÕHJUSLIKUNA, 4) koostage funktsiooni argument, milles te pole kindel; Ma jooksen ja kontrollin tulemust oma keskkonnas.
Selles päringus andmeid ei jagata, roll, paketid, kommentaaride ootus ja "valmistamise" keeld on selged. Ikka jooksete ja kontrollite väljundit ise.
Järgmine tabel võtab kokku selle õppetunni ühelause reeglid:
põhimõte
Mida see tähendab
AI on assistent
Teaduslik otsus ja vastutus kuulub eksperdile
Küsi koodi, too tulemus
AI ei mäleta numbrit; käivitate selle ja arvutate
andmeid hoidma
Mikro-/litsentsitud andmed ei lahku turvalisest keskkonnast
kontrollida
Iga väljaannet, koodi, kommentaari kontrollitakse; väljamõeldis lükatakse tagasi
Levinud vead
- AI-lt oodatakse konkreetset statistikat ilma andmeid esitamata. Mudel ei pääse andmetele juurde; Selle antud koefitsient, korrelatsioon ja p-väärtus on võlts. Küsige alati koodi ja koostage tulemus ise.
- Tuginedes hallutsinatoorsetele funktsioonidele. AI võib soovitada R/Pythoni funktsiooni või argumenti, mida pole olemas. Ärge aktsepteerige koodi ilma seda käivitamata ja kontrollimata.
- Mikroandmete üleslaadimine avalikku tööriista. Tegemist on KVKK/GDPR ja andmekasutuslepingu rikkumisega. Muutke andmed anonüümseks või ärge jagage neid üldse.
- Segi ajab sujuvust täpsusega. Hästi kirjutatud ülevaade võib olla ebatäpne. Lause ilu ei ole tõestus.
- Põhjusliku keele aktsepteerimine ilma kontrollita. YZ ütleb sageli "X suurendab Y"; kusjuures enamik regressioone näitab ainult seoseid. Kaitske põhjuslikku väidet disainiga.
Näpunäide: tehisintellektiga töötades esitage endale järgmine küsimus: "Kui kohtunik või audiitor küsib seda väljundit, kas ma saan näidata allikat ja kontot?" Kui vastus on eitav, pole väljund veel kasutamiseks valmis.
Kokkuvõttes
AI pakub ökonomeetria ja statistika töövoo täitmiskihis (kood, puhastus, graafik, mustand) tõelist ja tohutut kiirendust; mudeli valik, põhjuslik seos, tõlgendamine, avaldamine ja poliitikaotsused kuuluvad aga eksperdile. Kolm põhidistsipliini: ärge tuletage AI-le numbrit meelde, küsige koodi ning genereerige ja kontrollige tulemust ise; ärge eemaldage turvalisest keskkonnast mikro-/litsentsitud andmeid; iga väljundi statistiline filter. Kontrollimata tehisintellekti väljund on sama riskantne kui läbivaatamata leid.
Rakenduse ülesanne
Mõelge oma (või näidis) andmekogumile. Küsige AI-lt R- või Pythoni koodi, mis toodab kirjeldavat statistikat ja lihtsat graafikut, kirjeldades lihtsalt muutuja struktuuri, ilma andmeid jagamata. Käivitage sissetulev kood oma keskkonnas. Seejärel pidage meeles kontrollnimekirja: (1) kas kood jooksis vigadeta, (2) on ridade/vaatluste arv, nagu eeldasite, (3) milline AI kommentaarilausetest kasutab põhjuslikku keelt ja tuleks parandada. Ühes lõigus kirjutage ajast, mil tehisintellekt teid päästis, ja vähemalt ühest veast, mille tabasite.
kontrollnimekiri
- [ ] Ma ei pannud tehisintellekti konkreetset statistikat küsima; Küsisin koodi ja andsin tulemuse ise.
- [ ] Arvutasin iga selle antud arvu ja testitulemuse enda keskkonnas ümber.
- [ ] Kontrollisin, et funktsioonid/argumendid, mida see kasutab, on tegelikult olemas.
- [ ] Ma ei laadinud avalikku tööriista üles mikro-/isiklikke/litsentsitud andmeid.
- [ ] Märkisin põhjuslikku keelt sisaldavad kommentaarid ja tõstsin need relatsioonikeelde.
- [ ] Oskan audiitorile näidata väljundi allikat ja arvestust.