Kasu:
- Võimalus täpselt lugeda regressiooniväljundit (koefitsient, standardviga, p-väärtus, R-ruut) ja kriitiliselt hinnata tehisintellekti tõlgendust
- Võimalus ära tunda lõkse, nagu korrelatsiooni ja põhjusliku seose eristamine, endogeensus, väljajäetud muutujad ja vale regressioon, ning ohjeldada tehisintellekti liigset põhjuslikku keelt
- Võimalus kasutada tehisintellekti mudeli seadistamisel, koodide ja diagnostiliste testide koostamisel, jättes mudeli valiku ja tõlgendamise vastutuse inimestele
Ökonomeetria on majandusteooria andmetega testimise distsipliin ja regressioon on selle põhitööriist. "Kui palju suureneb tarbimine sissetulekute kasvades?", "Milline on intresside ja investeeringute seos?" Sellised küsimused kvantifitseeritakse regressiooni abil. AI on selles valdkonnas ühtaegu väga kasulik ja väga ohtlik: see kirjutab mudelikoodi ja diagnostilised testid sekunditega, kuid on väljundi tõlgendamisel sageli liiga põhjuslik ja liiga täpne. Räägib lause "X suurendab Y" ladusalt; kusjuures enamik regressioone mõõdab ainult ühte suhet. Selle seadme põhisisu on järgmine: kasutage AI-d mudeli seadistamiseks, koodi ja diagnostiliseks testimiseks; kuid vastutus mudeli valiku, põhjuslike seoste hindamise ja tõlgendamise eest jääb inimese kanda.
Regressiooniväljundi lugemine
Lihtsa regressiooni väljundis otsitakse nelja asja:
- Koefitsient. Hinnang selle kohta, kui palju sõltuv muutuja muutub, kui selgitav muutuja suureneb ühe ühiku võrra. Märgil (pluss/miinus) ja suurus peab olema majanduslik tähendus.
- Standardviga. koefitsiendi hinnangu määramatus; Kui see on väiksem, on hinnang täpsem.
- p-väärtus. Tõenäosus, et koefitsient ilmub nii suurena, eeldusel, et see on "tegelikult null". Väikest p (< 0,05) peetakse statistiliselt oluliseks, kuid see ei tähenda majanduslikku tähtsust ega põhjuslikku seost.
- R-ruut. Kui suure osa sõltuva muutuja muutusest mudel seletab. Kõrge R-ruut ei tähenda "õiget mudelit"; Samuti võib see olla suur valede regressioonide korral.
Näpunäide: ärge ajage statistilist olulisust segamini majandusliku tähtsusega. Isegi väga väike, praktiliselt ebaoluline mõju võib suures valimis osutuda "oluliseks" (väike p). Esiteks: "Kas selle koefitsiendi suurus on majanduslikult oluline?" ', siis otsige tähtsust.
Korrelatsioon ei ole põhjuslik seos: klassikalised lõksud
See on ökonomeetria keskmes olev hoiatus. Regressiooniga leitud seos ei ole sageli põhjuslik seos. Peamised lõksud:
- Muutuja välja jäetud. Kolmas tegur, mis mõjutab nii X-i kui ka Y-d, kuid mida mudelis ei ole, loob võltssuhte X ja Y vahel. (Näide: kui hariduse ja sissetuleku vahelises seoses jäetakse "võime" välja, on koefitsient eksitav.)
- Vastupidine põhjuslikkus (endogeensus). Kuigi arvatakse, et X mõjutab Y-d, võib Y mõjutab X-i või on need kaks vastastikust. (Politsei arv ja kuritegevus: kas politsei suurenes kuritegevuse suurenemise tõttu?)
- Pseudo regressioon. Kaks mittestatsionaarset (trendivat) seeriat võivad anda kõrged R-ruudus ja olulised koefitsiendid, kuigi nende vahel puudub tegelik seos. Lihtsalt sellepärast, et nad mõlemad aja jooksul kasvavad.
- Valiku eelarvamus. Kui valim ei ole juhuslik, mõõdetakse seost viltu.
Põhjusliku seose väidet saab kindlaks teha ainult sobiva ülesehitusega (meetodid nagu kontrollitud eksperiment, looduslik eksperiment, instrumentaalne muutuja, erinevus-erinevus) ja selgete eeldustega. Tehisintellekt jätab selle peenuse sageli kahe silma vahele.
Ettevaatust: kui AI ütleb "see muutuja suurendab/vähendab seda", pidurdage kohe. Probleem: kas mõni muutuja on välja jäetud? Kas vastupidine põhjuslik seos on võimalik? Kas sarjad on paigal? Ükski põhjuslik lause ei sisene aruandesse enne, kui need kolm küsimust on esitatud.
Diagnostilised testid
Et regressioon oleks usaldusväärne, testitakse selle eeldusi: jääkide muster (veaterminid) (autokorrelatsioon), heteroskedastilisus (heteroskedastilisus), multikollineaarsus (seletavad muutujad on üksteisega väga sarnased), normaaljaotus. Tehisintellekt kirjutab nende testide jaoks koodi; kuid majandusteadlase ülesanne on tulemusi tõlgendada ja mudelit vastavalt kohandada.
kolm minikarpi
Juhtum 1 – võlts regressioon. Teadlane taandas kahte trendisarja (üks nominaalne kulu, üks nominaalne teine kogus); R-ruut oli 0,98, koefitsient oli väga oluline. AI "on tugev suhe," ütles ta. Teadlane testis statsionaarsust: mõlemad seeriad olid mittestatsionaarsed. Kui nad lahku läksid, kadus suhe suures osas. Kõrge R-ruut tulenes lihtsalt sellest, et nad mõlemad aja jooksul kasvasid. Tabatud võlts taandareng.
Juhtum 2 – muutuja välja jäetud. Üks analüüs näitas, et "reklaamikulud suurendavad müüki". Majandusteadlane küsis: kas mudelis on hooajaline mõju? Ei olnud. Nii reklaam kui ka müük suurenesid enne pühi; Osa suhtest oli hooajalisus. Kui lisati hooaja dummy muutujad, muutus reklaami koefitsient väiksemaks. Põhjuslikku väidet on pehmendatud.
Juhtum 3 – oluline, kuid ebaoluline. Suures mikroandmete kogumis oli koefitsient p<0,001; AI "tugev mõju," ütles ta. Kuid koefitsiendi suurus oli praktiliselt tühine (suur sissetulekumuutus nihutas tulemust ühe tuhandiku võrra). Majandusteadlane sõnastas selle õigesti kui "statistiliselt oluline, kuid majanduslikult ebaoluline". Tähtsus ei asendanud tähtsust.
Kommentaaride modereerimise tabel
ütleb tehisintellekt
Küsib majandusteadlane
"X suurendab Y"
Kas muutuja on välja jäetud? Vastupidine põhjuslik seos?
"R-ruut on kõrge, mudel on hea"
Kas sarjad on paigal? Võlts regressioon?
"p<0,05, oluline"
Kas suurus on majanduslikult oluline?
"Koefitsient 0,3"
Kas selle märk ja ühik ühilduvad teooriaga?
"Suhe on tugev"
Kas valimi valimine on kallutatud?
Neli kopeeritavat malli
1) Mudeli paigaldamise eskiis:
Uurin järgmist majandusküsimust: [küsimus]. Sõltuv muutuja: [Y]. Kandidaadid: [X-id]. Soovitage mulle sobivat algset regressiooni seadistust (statsmodelsi kood). Selgitage, milliseid juhtmuutujaid on vaja ja miks. EI VÄIDA põhjuslikku seost; Kasutage suhtekeelt.
2) Diagnostilised testid:
Kirjutage koodi sisse minu seadistatud regressiooni diagnostilised testid: autokorrelatsioon, heteroskedastilisus, multikollineaarsus, jääkide dispersioon ja statsionaarsus (kui see on aegrida). Kirjutage lühidalt, kuidas iga testi tulemust tõlgendada ja mida teha probleemide korral.
3) põhjusliku seose kontroll:
Tõlgendage seda regressioonitulemust, kuid kontrollige esmalt neid kolme lõksu: (1) kas muutuja võib olla välja jäetud ja milline neist, (2) kas pöördpõhjuslikkus on võimalik, (3) kas seeria on paigal / kas on olemas vale regressiooni oht? Öelge selgelt, kas tulemust tuleks tõlgendada põhjusliku või pelgalt suhtelisena.
4) Olulisuse ja tähtsuse eristamine:
Tõlgendage järgmist koefitsienti: väärtus [x], standardviga [y], p-väärtus [z]. Hinda statistilist olulisust eraldi, majanduslikku olulisust eraldi: kas selle koefitsiendi suurus on praktiliselt oluline mõju? Täpsustage mõju suurust näidisstsenaariumis.
Nõrk viip / Tugev viip
Nõrk viip:
Tehke nende muutujatega regressioon ja tõlgendage tulemust.
Tehisintellekt tõlgendab seda põhjuslikus keeles, ilma diagnostilisi teste tegemata või statsionaarsust kontrollimata; vale regressioon või välja jäetud muutuja jäetakse vahele.
Võimas viip:
Sõltuv muutuja on tarbimine, selgitav tulu; igakuised trendisarjad. Esmalt katsetage statsionaarsust; vajadusel saada vahet. Seadistage regressioon, tehke diagnostilised testid (autokorrelatsioon, heteroskedastilisus). Arutlege tulemuse tõlgendamisel selgelt väljajäetud muutujate ja vastupidise põhjuslikkuse riskide üle; Kasutage pigem suhtelist kui põhjuslikku keelt. Hinnake tähtsust ja majanduslikku tähtsust eraldi ning andke iga sammu kood.
Levinud vead
- Põhjusliku seose eksimine. Kõige tavalisem ja kallim viga.
- Segades kõrget R-ruutu kvaliteediga. Samuti on sellel palju võltsregressioone.
- Staasikontrollist möödahiilimine. Trendikad sarjad loovad võltssuhteid.
- Tähenduslikkuse ja tähenduslikkuse segi ajamine. Väike p ei tähenda suurt mõju.
- Diagnostiliste testide vahelejätmine. Rikkutud oletus kummutab kogu järelduse.
- AI põhjusliku keele aktsepteerimine sellisena, nagu see on. Kohtuotsus kuulub inimesele.
Kokkuvõttes
Regressioon on võimas, kuid lõksu tööriist. Lugemistegur, standardviga, p-väärtus ja R-ruut õigesti; korrelatsiooni ja põhjusliku seose eristamine; väljajäetud muutujate, pöördpõhjuslikkuse ja vale regressiooni lõkse kontrollimine; On vaja teha vahet olulisusel ja majanduslikul tähtsusel. AI kiirendab koodide ja diagnooside loomist, kuid see räägib liiga põhjuslikult; Mudeli valik ja põhjusliku seose hinnang jääb majandusteadlasele.
Rakenduse ülesanne
Seadistage oma olemasolevate andmetega (nt tarbimine-sissetulek) lihtne regressioon. Laske seadistus luua 1. malliga ja diagnostikatestid 2. malliga. Seejärel kontrollige põhjuslikku seost malliga 3, nimetades vähemalt ühe võimaliku väljajäetud muutuja ja ühe vastupidise põhjusliku seose stsenaariumi. Tõlgi AI algse tõlgenduse põhjuslik lause relatsioonikeelde ja märkige muudatus üles.
kontrollnimekiri
- [ ] Lugesin õigesti koefitsiendi, standardvea, p-väärtuse ja R-ruudu.
- [ ] Kontrollisin seeria statsionaarsust ja välistasin võltsregressiooni ohu.
- [ ] Nimetasin väljajäetud muutuja ja pöördpõhjuslikkuse võimalused.
- [ ] Tegin diagnostilisi teste ja hindasin rikkumisi.
- [ ] Hindasin eraldi statistilist olulisust ja majanduslikku olulisust.
- [ ] Olen tõmmanud tehisintellekti põhjusliku keele suhtekeelde.
- [ ] Jäin kindlaks, et mudeli valik ja põhjuslikkuse otsus oli minu teha.