Pelnas:
- Gebėjimas atskirti, kur empirinėje darbo eigoje (duomenų valymas, kodas, vizualizacija, juodraščio interpretacija) dirbtinis intelektas sutaupo realų laiką, o kur sprendimus, tokius kaip modelio pasirinkimas, priežastinio ryšio tvirtinimas ir sprendimas paskelbti, palieka ekspertui, atsižvelgiant į užduoties rizikos lygį.
- Gebėjimas taikyti discipliną, kuri patikrina kiekvieną dirbtinio intelekto išvestį (skaičius, koeficientas, kodas, komentaras) perskaičiavimo, susiejimo su šaltiniu ir statistinio filtravimo etapais.
- Gebėjimas saugiai apdoroti mikroduomenis ir konfidencialius/licencijuotus duomenų rinkinius pagal KVKK/GDPR ir duomenų naudojimo sutartis bei įgyti įprotį pasirinkti tinkamus įrankius.
Kasdien prie ekonometriko ar taikomosios statistikos stalo kartojasi tie patys klausimai: ar šis duomenų rinkinys patikimas; Ką daryti su šiomis trūkstamomis vertybėmis? Ką iš tikrųjų sako šios regresijos koeficientas? Ar šis ryšys yra priežastinis, ar tik koreliacinis? Kadangi ši p reikšmė yra reikšminga, ar galiu ją įrašyti straipsnyje arba politikos santraukoje? Kai kurie iš šių klausimų kartojasi, reikalauja daug kodo ir užima daug laiko: duomenų valymas, to paties grafiko braižymas dešimt kartų, R arba Python kodo derinimas, rezultatų suvedimas į lentelę. Kiti tiesiogiai lemia išvados pagrįstumą, publikacijos sąžiningumą arba politinio sprendimo tikslumą.
Dirbtinis intelektas (trumpiau tariant, AI – kompiuterinės sistemos, galinčios kurti tekstą ir kodą kaip žmonės, atpažinti šablonus, apibendrinti duomenis ir rašyti komentarus; šiandien dažniausiai naudojama didžiųjų kalbų modeliai, tai yra sistemos, kurios treniruojasi ant didžiulio teksto ir kuria sakinius numatant kitą žodį) yra šios lentelės viduryje. Tinkamai naudojant, jis sutrumpina valandų valandas trunkantį duomenų valymo kodą iki minučių, primena sudėtingo statistinio testo sintaksę arba parengia koeficiento interpretaciją. Neteisingai vartojamas jis pateikia iš pažiūros užtikrintą, bet visiškai išgalvotą skaičių, klaidingą reikšmę arba ne priežastinį ryšį kaip „radinį“.
Šis pirmasis vienetas nėra programinės įrangos įvadas. Jo tikslas – paaiškinti, kur empirinėje darbo eigoje įdėti dirbtinį intelektą ir kur jo nedėti. Ekonometrija yra ir „metodams kritiška“, ir netiesiogiai „sprendimams svarbi“ sritis: jūsų sukurto modelio koeficientas gali būti centrinio banko sprendimo dėl palūkanų normos, reguliavimo institucijos politikos pasikeitimo arba įmonės milijoninės investicijos įvestis. Iš pradžių išdėstykime pagrindinį principą: Dirbtinis intelektas yra analizės asistentas, o ne tyrinėtojas. Atsakomybė už modelio parinkimą, identifikavimo strategiją, priežastingumo tvirtinimą, paskelbimą ir politinius sprendimus bei galutinį jo patvirtinimą tenka kompetentingam ekspertui.
Empirinės darbo eigos sluoksniai ir AI vieta
Naudinga empirinį tyrimą suskirstyti į tris sluoksnius. Vykdymo sluoksnis yra kasdienis techninis darbas: duomenų valymo kodas, grafiko braižymas, lentelės formatavimas, sintaksės derinimas. Metodo sluoksnis yra analitinis sprendimas: kuris modelis, kokia identifikavimo strategija, kuris testas, kuris prielaidų patikrinimas. Aiškinimo ir sprendimų lygmuo yra išvadų prasmė: ką sako koeficientas, ar jis yra priežastinis, ką jis reiškia politikai, ar jis turėtų būti skelbiamas. AI paliečia visus tris sluoksnius, bet kiekviename turi skirtingą autoritetą. Vykdymo lygmenyje AI greitai parengia ir generuoja kodą; Aiškinimo ir sprendimo lygmenyje pateikiama tik įvestis ir ekspertas priima sprendimą.
Apibrėžkime keletą pagrindinių terminų nuo pat pradžių. Ekonometrija – tai šaka, kuri statistiniais metodais analizuoja ekonominius ir socialinius duomenis bei matuoja ryšius. Regresija – tai metodas, kuris skaitmeniniu būdu modeliuoja rezultato kintamojo (priklausomo kintamojo) ryšį su vienu ar daugiau aiškinamųjų kintamųjų (nepriklausomų kintamųjų). Koeficientas yra skaičius, parodantis, su kiek pokyčio vienetų vidutiniškai yra susijęs vieno aiškinamojo kintamojo pokytis rezultato kintamajame. P reikšmė yra tikimybė, kad stebimas rezultatas (arba ekstremalesnis rezultatas) įvyks atsitiktinai, kai iš tikrųjų jokio poveikio nėra. Šias sąvokas po vieną paaiškinsime šiuose vienetuose; Kol kas žinokite tai: AI suteikia jums planą, kodą ir paaiškinimą, bet nepriima mokslinių sprendimų.
Šioje lentelėje apibendrinamas AI vaidmuo ir rizikos lygis pagal misiją:
Quest
AI vaidmuo
Rizikos lygis
Kas pritaria
Duomenų valymo kodo rašymas
kodų generatorius
žemas
Pats analitikas (su kodo testavimu)
Diagramos/lentelės juodraštis
eskizų generatorius
žemas
analitikas
Bandymo / modelio sintaksės priminimas
Referencinis asistentas
žemas-vidutinis
analitikas
Koeficiento aiškinimo projektas
juodraščio rašytojas
vidutinis
ekonometrikas
Modelio/identifikavimo strategijos pasirinkimas
pagalbinis įėjimas
aukštas
ekspertas tyrėjas
Priežastinio ryšio teiginys
Tik juodraštis, niekada galutinis žodis
labai aukštas
Ekspertas + kolegų vertinimas
Publikavimas / politikos sprendimas
tik įvestis
labai aukštas
Atsakingas tyrėjas/institucija
Atsiminkite vieną šios lentelės eilutę: didėjant rizikai, dirbtinio intelekto vaidmuo mažėja ir ekspertų pritarimas auga.
Kodėl „patikrinimas“ yra šio verslo esmė
Kalbos modeliai atrodo įsitikinę savo atsakymu, tačiau jie gali būti ne tikri. Techninėje kalboje tai vadinama haliucinacija: tai modelio neegzistuojančios informacijos išgalvojimas sklandžiu sakiniu, lyg tai būtų tiesa. Ekonometrikui tai yra mirtini spąstai. Modelis gali pateikti tikslų skaičių, pvz., „Koreliacija tarp nedarbo ir infliacijos Turkijoje 2015–2020 m. yra 0,62“; Tačiau jis niekada nematė jūsų duomenų ir šis skaičius yra visiškai sugalvotas. Arba gali sakyti: „Baltojo testo p vertė buvo 0,03“; kadangi ji neatliko jokių bandymų. Jis gali iškviesti R funkciją su argumentu, kuris iš tikrųjų neegzistuoja. Jis dainuoja visus tris vienodai sklandžiai; Vienintelis dalykas, kuris skiria teisingą nuo neteisingo, yra jūsų žinios ir įprotis tikrinti.
Patikrinimo disciplina susideda iš trijų etapų:
- Perskaičiuokite / paleiskite savo aplinkoje: apskaičiuokite kiekvieną skaičių, santykį, testo rezultatą ir koeficientą, kurį DI pateikia R/Python, naudodami savo duomenis, o ne iš AI atminties. Naudokite AI norėdami parašyti kodą, o ne prisiminti rezultatą. Paleiskite kodą, sukursite išvestį.
- Nuoroda į šaltinį: pasikliaukite vadovėliais, metodų straipsniais ir oficialiais dokumentais metodų taisyklėmis, formulėmis ir apibrėžimais. Patvirtinkite AI teiginį „šio testo prielaida yra“ su patikimu šaltiniu.
- Statistinis filtras: ekspertų akimis patikrinkite, ar išvestis prieštarauja statistinei logikai (prielaidos, pavyzdys, efekto dydis, neapibrėžtis). Atmeskite „prasmingą, bet absurdišką“ rezultatą.
Atsargiai: dirbtinio intelekto sugeneruoto koeficiento, testo ar interpretacijos įtraukimas į straipsnį, disertaciją ar politikos pastabą jų nepatvirtinus prilygsta neperžiūrėtos išvados paskelbimui. Vien todėl, kad išvestis sklandžiai, nėra tiesa; Vien todėl, kad skaičius atrodo tikras, jis nėra tikras.
Privatumas: mikro duomenys ir licencijuoti duomenys yra apsaugoti privačiai
Mikroduomenys (pavieniai įrašai asmens, namų ūkio, įmonės ar paciento lygmeniu) dažnai naudojami ekonometrijoje. Dauguma šių duomenų yra asmens duomenys ir yra saugomi pagal KVKK (asmens duomenų apsaugos įstatymą) Turkijoje ir GDPR Europoje. Be to, TurkStat, centriniai bankai, skydinių duomenų teikėjai ir komerciniai šaltiniai dažnai pateikia duomenis su duomenų naudojimo sutartimi; Šios sutartys draudžia perduoti duomenis trečiosioms šalims. Lentelės su tapatybės informacija, pajamomis, sveikatos ar įmonės paslaptimis įklijavimas į viešą AI pokalbių įrankį yra ir KVKK/BDAR pažeidimas, ir sutarties pažeidimas; nes duomenys patenka į išorinį serverį ir gali būti naudojami modeliuojant kai kuriuos įrankius.
Taisyklė paprasta: saugokite duomenis savo saugioje aplinkoje, prašykite AI tik kodo ir metodų. Ideali darbo eiga yra tokia: paprašykite AI pateikti analizės kodą, paleiskite kodą su tikrais duomenimis savo kompiuteryje / įmonės serveryje. Jei tikrai turite dalytis duomenimis, anonimizuoti (pašalinti ID laukus), apibendrinti (vidutiniškai / skaičiuoti, o ne individualiai) ir pasirinkti įrankius, kurie yra instituciniai, turite duomenų tvarkymo sutartį ir nenaudokite savo duomenų švietimui.
trys mini dėklai
1 atvejis – saugus ir efektyvus naudojimas. Vienas tyrėjas pirmiausia praleido 6 valandas rankiniu būdu išvalydamas 40 000 namų ūkio biudžeto duomenų eilučių. Visiškai nesidalydamas duomenimis, jis tiesiog apibūdino kintamųjų pavadinimus ir struktūrą AI ir paprašė valymo kodo. AI sukūrė R scenarijų; Tyrėjas paleido kodą savo aplinkoje, patikrino eilučių skaičių ir kiekvieno žingsnio suvestinę statistiką bei ištaisė dvi logikos klaidas. Trukmė: 70 minučių vietoj 6 valandų. Duomenys niekada neišnyko; Atsakomybė liko tyrėjui.
2 atvejis – nepatvirtintų skaičių gaudyklė. „Koks elastingumas tarp BVP augimo ir tiesioginių užsienio investicijų“, – AI paklausė absolventas. AI užtikrintai nurodė skaičių „apie 0,34“, nors neturėjo prieigos prie jokių duomenų. Studentas tai parašė literatūros santraukoje; Jo patarėjui paklausus apie šaltinį, paaiškėjo, kad šis skaičius neturėjo jokio pagrindo ir buvo visiškai išgalvotas. Klaida: tikimasi konkrečios statistikos iš AI, nesuteikiant jai duomenų ir išteklių.
3 atvejis. Konfidencialumas ir sutarties pažeidimas. Analitikas į viešai prieinamą AI įrankį įkėlė „Excel“, kurią gavo iš licencijuotos įmonės skydelio, kurioje buvo nurodytas įmonės pavadinimas ir apyvarta, ir pasakė „padaryti skydelio regresiją“. Duomenų teikėjo sutartimi buvo uždrausta perduoti duomenis į trečiųjų šalių sistemas; Įvykis paskatino atitikties patikrinimą. Tinkamas būdas buvo pakeisti įmonių pavadinimus anoniminiais kodais arba nebendrinti duomenų ir paprašyti tik skydelio regresijos kodo ir paleisti jį savo aplinkoje.
Silpnas raginimas / Stiprus raginimas
Silpnas raginimas:
Išanalizuoti ryšį tarp infliacijos ir nedarbo ir nurodyti koeficientą.
Šis teiginys klaidingas: AI nebuvo pateikti duomenys, neaišku, kuri šalis, koks laikotarpis, koks modelis. AI gali atsakyti tik išgalvotu koeficientu.
Galingas raginimas:
Jūsų vaidmuo: esate analizės asistentas, padedantis ekonometrijos tyrėjui. Duomenimis su jumis NEDALINKIU; Aš tik noriu RUNNABLE R kodo. Turiu metinę panelę: kintamieji šalis, metai, nedarbas, infliacija (visi skaitiniai). Užduotis: 1) parašykite fiksuotų efektų skydelio regresijos kodą nedarbui ~ infliacijai (plm paketas), 2) paaiškinkite kiekvieną kodo žingsnį komentaro eilute, 3) atkreipkite dėmesį, kad koeficientas turi būti interpretuojamas kaip reliacinis, o ne PRIEŽASTINIS, 4) sudarykite funkcijos argumentą, dėl kurio nesate tikri; Aš paleisiu ir patikrinsiu rezultatą savo aplinkoje.
Šioje užklausoje nėra dalijamasi jokiais duomenimis, aiškūs vaidmuo, paketai, komentarų laukimas ir draudimas „gaminti“. Jūs vis tiek paleidžiate ir patikrinate išvestį patys.
Šioje lentelėje apibendrinamos vieno sakinio taisyklės šioje pamokoje:
principu
Ką tai reiškia
AI yra asistentas
Mokslinis sprendimas ir atsakomybė priklauso ekspertui
Paprašykite kodo, pateikite rezultatą
AI neprisimena skaičiaus; paleidi ir apskaičiuoji
saugoti duomenis
Mikro/licencijuoti duomenys nepalieka saugios aplinkos
patikrinti
Kiekvienas numeris, kodas, komentaras yra tikrinamas; pagaminimas atmetamas
Dažnos klaidos
- Tikimasi konkrečios statistikos iš AI be duomenų. Modelis negali pasiekti duomenų; Jo pateiktas koeficientas, koreliacija ir p reikšmė yra netikri. Visada paprašykite kodo ir pateikite rezultatą.
- Remdamiesi haliucinacinėmis funkcijomis. AI gali pasiūlyti R/Python funkciją arba argumentą, kurio nėra. Nepriimkite kodo jo nepaleidę ir nepatikrinę.
- Mikroduomenys įkeliami į viešąjį įrankį. Tai yra KVKK/BDAR ir duomenų naudojimo sutarties pažeidimas. Anonimizuoti duomenis arba jų visai nesidalyti.
- Sklandumas klaidinamas su tikslumu. Gerai parašyta apžvalga gali būti netiksli. Sakinio grožis nėra įrodymas.
- Priežastinės kalbos priėmimas be kontrolės. YZ dažnai sako „X padidina Y“; tuo tarpu dauguma regresijų parodo tik ryšius. Ginti priežastinį reikalavimą su dizainu.
Patarimas: dirbdami su AI užduokite sau šį klausimą: „Jei teisėjas ar auditorius paprašys šios išvesties, ar galiu parodyti šaltinį ir paskyrą? Jei atsakymas yra neigiamas, išvestis dar nėra paruošta naudoti.
Apibendrinant
AI suteikia realų ir didžiulį pagreitį ekonometrijos ir statistikos darbo eigos vykdymo lygyje (kodas, išvalymas, grafikas, juodraštis); tačiau modelio parinkimas, priežastinis ryšys, aiškinimas, publikavimas ir politiniai sprendimai priklauso ekspertui. Trys pagrindinės disciplinos: nepriminkite AI skaičiaus, paprašykite kodo ir patys generuokite bei patikrinkite rezultatą; nepašalinti mikro/licencijuotų duomenų iš saugios aplinkos; statistinis filtras kiekvieną išvestį. Nepatvirtinta AI išvestis yra tokia pat rizikinga kaip ir neperžiūrėtas radinys.
Taikymo užduotis
Apsvarstykite savo (arba pavyzdinį) duomenų rinkinį. Paprašykite dirbtinio intelekto R arba Python kodo, kuris sukuria aprašomąją statistiką ir paprastą grafiką, tiesiog aprašydami kintamojo struktūrą, nesidalydami duomenimis. Paleiskite gaunamą kodą savo aplinkoje. Tada turėkite kontrolinį sąrašą: (1) ar kodas buvo paleistas be klaidų, (2) yra eilučių / stebėjimų skaičius, kaip tikėjotės, (3) kuris iš AI komentarų sakinių naudoja priežastinę kalbą ir turėtų būti pataisytas. Vienoje pastraipoje parašykite apie laiką, kurį AI išgelbėjo, ir bent vieną klaidą, kurią pastebėjote.
kontrolinis sąrašas
- [ ] Aš neverčiau dirbtinio intelekto prašyti konkrečios statistikos; Paprašiau kodo ir pats pateikiau rezultatą.
- [ ] Kiekvieną skaičių ir jo pateiktą testo rezultatą perskaičiavau savo aplinkoje.
- [ ] Patikrinau, kad jos naudojamos funkcijos/argumentai iš tikrųjų egzistuoja.
- [ ] Neįkėliau mikro / asmeninių / licencijuotų duomenų į viešąjį įrankį.
- [ ] Pažymėjau komentarus, kuriuose yra priežastinės kalbos, ir perkėliau juos į santykinę kalbą.
- [ ] Galiu parodyti auditoriui produkcijos šaltinį ir apskaitą.