Vienība 1 / 11

Mākslīgais intelekts ekonometrikā un statistikā: lomas, robežas, autentifikācija un privātums

Ieguvumi:

  • Spēja atšķirt, kur empīriskajā darbplūsmā (datu tīrīšana, kods, vizualizācija, interpretācijas melnraksts) mākslīgais intelekts ietaupa reālo laiku un kur tādus lēmumus kā modeļa izvēle, cēloņsakarības apgalvojums un lēmums par publikāciju atstāj eksperta ziņā atbilstoši uzdevuma riska līmenim.
  • Spēja pielietot disciplīnu, kas pārbauda katru mākslīgā intelekta izvadi (skaitlis, koeficients, kods, komentārs), izmantojot pārrēķinu, saistīšanas ar avotu un statistisko filtrēšanu.
  • Spēja droši apstrādāt mikrodatus un konfidenciālas/licencētas datu kopas KVKK/GDPR un datu lietošanas līgumu ietvaros un iegūt ieradumu izvēlēties piemērotus rīkus.

Uz ekonometrija vai statistiķa galda katru dienu atkārtojas tie paši jautājumi: vai šī datu kopa ir uzticama; Ko darīt ar šīm trūkstošajām vērtībām? Ko īsti saka šīs regresijas koeficients? Vai šīs attiecības ir cēloņsakarības vai tikai korelācijas? Tā kā šī p vērtība ir nozīmīga, vai varu to ierakstīt rakstā vai politikas īsumā? Daži no šiem jautājumiem ir atkārtoti, kodietilpīgi un laikietilpīgi: datu tīrīšana, vienas un tās pašas diagrammas attēlošana desmit reizes, R vai Python koda atkļūdošana, rezultātu sastādīšana tabulā. Citi tieši nosaka konstatējuma pamatotību, publikācijas godīgumu vai politikas lēmuma precizitāti.

Mākslīgais intelekts (īsumā AI — datorsistēmas, kas spēj radīt tekstu un kodu līdzīgi kā cilvēki, atpazīt modeļus, apkopot datus un rakstīt komentārus; mūsdienās visbiežāk izmantotais veids ir lielo valodu modeļi, tas ir, sistēmas, kas tiek apmācītas uz milzīgu tekstu un veido teikumus, paredzot nākamo vārdu) atrodas šīs tabulas vidū. Pareizi lietojot, tas samazina stundu datu tīrīšanas kodu līdz minūtēm, atgādina par sarežģīta statistiskā testa sintaksi vai izstrādā koeficienta interpretāciju. Ja to lieto nepareizi, tas uzrāda šķietami drošu, bet pilnīgi izdomātu skaitli, nepatiesu nozīmi vai necēloņsakarību kā "atradumu".

Šī pirmā vienība nav programmatūras ievads. Tās mērķis ir precizēt, kur AI savā empīriskajā darbplūsmā ievietot un kur to nekad nelikt. Ekonometrija ir gan "metodēm kritiska", gan netieši "lēmumkritiska" joma: jūsu izveidotā modeļa koeficients var būt centrālās bankas lēmumā par procentu likmi, regulatora politikas izmaiņām vai uzņēmuma miljonu dolāru investīcijām. No sākuma izklāstīsim pamatprincipu: Mākslīgais intelekts ir analīzes palīgs, nevis pētnieks. Kompetentais eksperts ir atbildīgs par modeļa izvēli, identifikācijas stratēģiju, cēloņsakarības apstiprināšanu, publicēšanu un politikas lēmumiem un to galīgo apstiprināšanu.

Empīriskās darbplūsmas slāņi un AI vieta

Empīrisko pētījumu ir lietderīgi sadalīt trīs slāņos. Izpildes slānis ir ikdienas tehniskais darbs: datu tīrīšanas kods, grafiku zīmēšana, tabulas formatēšana, sintakses atkļūdošana. Metodes slānis ir analītiskais lēmums: kurš modelis, kura identifikācijas stratēģija, kura pārbaude, kura pieņēmuma pārbaude. Interpretācijas un lēmumu slānis ir secinājumu nozīme: ko koeficients saka, vai tas ir cēloņsakarība, ko tas nozīmē politikai, vai tas ir jāpublicē. AI skar visus trīs slāņus, taču katrā no tiem ir atšķirīga autoritāte. Izpildes slānī AI ātri izstrādā un ģenerē kodu; Interpretācijas un lēmuma slānī tiek sniegta tikai ievade, un eksperts pieņem lēmumu.

No sākuma definēsim dažus pamatjēdzienus. Ekonometrija ir nozare, kas analizē ekonomiskos un sociālos datus ar statistikas metodēm un mēra attiecības. Regresija ir metode, kas skaitliski modelē iznākuma mainīgā (atkarīgā mainīgā) attiecības ar vienu vai vairākiem skaidrojošiem mainīgajiem (neatkarīgiem mainīgajiem). Koeficients ir skaitlis, kas parāda, ar cik izmaiņu vienībām vidēji ir saistītas vienas vienības izmaiņas iznākuma mainīgajā. P-vērtība ir iespējamība, ka novērotais iznākums (vai ekstrēmāks iznākums) notiktu nejauši, ja efekts faktiski nepastāv. Mēs šos jēdzienus skaidrosim pa vienam turpmākajās vienībās; Pagaidām ziniet to: visās šajās AI sniedz jums plānu, kodu un skaidrojumu, taču tas nepieņem zinātniskus lēmumus.

Šajā tabulā ir apkopota AI loma un riska līmenis pēc misijas:

Meklējumi

AI loma

Riska līmenis

Kas apstiprina

Datu sanitizācijas koda rakstīšana

kodu ģenerators

zems

Pats analītiķis (ar koda testēšanu)

Diagrammas/tabulas melnraksts

skiču ģenerators

zems

analītiķis

Testa/modeļa sintakses atgādinājums

Atsauces palīgs

zems-vidējs

analītiķis

Koeficientu interpretācijas projekts

melnrakstu rakstnieks

vidējs

ekonometris

Modeļa/identifikācijas stratēģijas izvēle

palīgieeja

augsts

eksperts pētnieks

Cēloņsakarības apgalvojums

Tikai melnraksts, nekad galīgais vārds

ļoti augsts

Eksperts + salīdzinošā pārskatīšana

Publikācija/politikas lēmums

tikai ievade

ļoti augsts

Atbildīgais izmeklētājs/institūcija

Paturiet prātā vienu šīs tabulas rindiņu: pieaugot riskam, AI loma samazinās un ekspertu apstiprinājums pieaug.

Kāpēc "pārbaude" ir šī biznesa pamatā

Valodu modeļi šķiet pārliecināti savā atbildē, taču viņi var nebūt pārliecināti. Tehniskajā valodā to sauc par halucinācijām: tā ir modeļa neesošas informācijas safabricēšana raitā teikumā, it kā tā būtu patiesība. Ekonometristam tas ir nāvējošs lamatas. Modelis var sniegt precīzu skaitli, piemēram, "Korelācija starp bezdarbu un inflāciju Tirkijā laikposmā no 2015. līdz 2020. gadam ir 0,62"; Taču viņš nekad nav redzējis tavus datus un šis skaitlis ir pilnībā izdomāts. Vai arī tas varētu teikt: “Baltā testa p-vērtība bija 0,03”; tā kā tajā netika veiktas nekādas pārbaudes. Tas var izsaukt R funkciju ar argumentu, kas faktiski neeksistē. Viņš dzied visus trīs ar tādu pašu raitu; Vienīgais, kas atšķir pareizo no nepareizā, ir jūsu zināšanas un ieradums pārbaudīt.

Pārbaudes disciplīna sastāv no trim posmiem:

  1. Pārrēķināt / palaist savā vidē: aprēķiniet katru skaitli, koeficientu, testa rezultātu un koeficientu, ko AI sniedz R/Python, izmantojot savus datus, nevis no AI atmiņas. Izmantojiet AI, lai ierakstītu kodu, nevis lai atcerētos rezultātu. Palaidiet kodu, jūs izveidojat izvadi.
  2. Saite uz avotu: paļaujieties uz mācību grāmatām, metožu rakstiem un oficiālajiem dokumentiem, lai iegūtu metodes noteikumus, formulas un definīcijas. Apstipriniet AI apgalvojumu "šī testa pieņēmums ir" ar uzticamu avotu.
  3. Statistikas filtrs: ar eksperta acīm pārbaudiet, vai rezultāts nav pretrunā statistikas loģikai (pieņēmumi, izlase, efekta lielums, nenoteiktība). Noraidiet "jēgpilnu, bet absurdu" rezultātu.
Uzmanību: AI ģenerēta koeficienta, testa vai interpretācijas ievietošana rakstā, disertācijā vai politikas piezīmē, to neapstiprinot, ir kā nepārskatīta atraduma publicēšana. Tikai tāpēc, ka izvade ir tekoša, nav patiesība; Tikai tāpēc, ka skaitlis šķiet skaidrs, tas nav īsts.

Privātums: mikrodati un licencētie dati tiek aizsargāti privāti

Mikrodatus (atsevišķus ierakstus indivīda, mājsaimniecības, uzņēmuma vai pacienta līmenī) bieži izmanto ekonometrikā. Lielākā daļa šo datu ir personas dati, un tie ir aizsargāti saskaņā ar KVKK (personas datu aizsardzības likumu) Turcijā un GDPR Eiropā. Turklāt TurkStat, centrālās bankas, paneļu datu nodrošinātāji un komerciālie avoti bieži sniedz datus ar datu izmantošanas līgumu; Šie līgumi aizliedz nodot datus trešajām personām. Tabulas ar identitātes informāciju, ienākumiem, veselības vai uzņēmuma noslēpumiem ielīmēšana publiskā AI tērzēšanas rīkā ir gan KVKK/VDAR pārkāpums, gan līguma pārkāpums; jo dati nonāk ārējā serverī un tos var izmantot modeļu apmācībā dažos rīkos.

Noteikums ir vienkāršs: saglabājiet datus savā drošajā vidē, lūdziet AI tikai kodu un metodes. Ideālā darbplūsma ir šāda: pajautājiet AI analīzes kodu, jūs palaižat kodu ar reālajiem datiem savā datorā/uzņēmuma serverī. Ja jums patiešām ir jādalās ar datiem, anonimizējiet (noņemiet ID laukus), apkopojiet (vidēji/skaitiet, nevis individuāli) un izvēlieties rīkus, kas ir institucionāli, ar datu apstrādes līgumu un neizmantojiet savus datus izglītībā.

trīs mini futrāļi

1. gadījums — droša un efektīva lietošana. Viens pētnieks vispirms pavadīja 6 stundas, manuāli tīrot 40 000 mājsaimniecības budžeta datu rindu. Nemaz nedaloties ar datiem, viņš vienkārši aprakstīja mainīgo nosaukumus un struktūru AI un lūdza tīrīšanas kodu. AI ģenerēja R skriptu; Pētnieks palaida kodu savā vidē, pārbaudīja rindu skaitu un katra soļa kopsavilkuma statistiku un izlaboja divas loģikas kļūdas. Ilgums: 70 minūtes 6 stundu vietā. Dati nekad nepazuda; Atbildība palika pētniekam.

2. gadījums — nepārbaudīts numuru slazds. "Kāda ir elastība starp IKP pieaugumu un ārvalstu tiešajām investīcijām," AI jautāja absolvents. AI pārliecinoši deva skaitli "apmēram 0,34", lai gan tam nebija piekļuves nekādiem datiem. To skolēns rakstīja literatūras kopsavilkumā; Kad viņa padomnieks jautāja par avotu, izrādījās, ka numuram nav nekāda pamata un tas ir pilnībā safabricēts. Kļūda: tiek gaidīta konkrēta statistika no AI, nesniedzot tai datus un resursus.

3. gadījums — Konfidencialitāte un līguma pārkāpums. Kāds analītiķis publiski pieejamā mākslīgā intelekta rīkā augšupielādēja programmu Excel, ko viņš saņēma no licencēta uzņēmuma paneļa, kurā bija norādīts uzņēmuma nosaukums un apgrozījums, un teica: "veiciet paneļa regresiju". Datu sniedzēja līgums aizliedza datu pārsūtīšanu uz trešo personu sistēmām; Negadījums izraisīja atbilstības pārbaudi. Pareizais veids bija aizstāt uzņēmumu nosaukumus ar anonīmiem kodiem vai nekoplietot datus un tikai pieprasīt paneļa regresijas kodu un palaist to savā vidē.

Vāja uzvedne / spēcīga uzvedne

Vāja uzvedne:

Analizēt sakarību starp inflāciju un bezdarbu un noteikt koeficientu.

Šis apgalvojums ir nepareizs: AI netika sniegti dati, nav skaidrs, kura valsts, kurā periodā, kurš modelis. AI var atbildēt tikai ar izdomātu koeficientu.

Spēcīga uzvedne:

Jūsu loma: jūs esat analīzes asistents, kas palīdz ekonometrijas pētniekam. ES NEkoplietoju datus ar jums; Es tikai vēlos RUNNABLE R kodu. Man ir gada panelis: mainīgie lielumi valsts, gads, bezdarbs, inflācija (visi skaitļi). Uzdevums: 1) uzrakstiet fiksēto efektu paneļa regresijas kodu bezdarbam ~ inflācijai (plm pakete), 2) izskaidrojiet katru koda soli ar komentāru rindiņu, 3) atzīmējiet, ka koeficients ir jāinterpretē kā relāciju, nevis CĒLOŅS, 4) izveidojiet funkcijas argumentu, par kuru neesat pārliecināts; Es darbošos un pārbaudīšu rezultātu savā vidē.

Šajā pieprasījumā dati netiek dalīti, loma, paketes, komentāru gaidīšana un "izgatavošanas" aizliegums ir skaidri. Jūs joprojām palaižat un pārbaudāt izvadi pats.

Šajā tabulā ir apkopoti šīs nodarbības viena teikuma noteikumi:

principu

Ko tas nozīmē

AI ir palīgs

Zinātniskais lēmums un atbildība ir ekspertam

Pieprasiet kodu, izveidojiet rezultātu

AI neatceras numuru; tu palaiž to un aprēķini

saglabāt datus

Mikro/licencētie dati neatstāj drošo vidi

pārbaudīt

Katrs jautājums, kods, komentārs tiek pārbaudīts; izdomājums tiek noraidīts

Biežas kļūdas

  • Gaidām konkrētu statistiku no AI, nesniedzot datus. Modelis nevar piekļūt datiem; Koeficients, korelācija un p-vērtība, ko tas dod, ir viltoti. Vienmēr pieprasiet kodu un sagatavojiet rezultātu pats.
  • Paļaušanās uz halucinācijas funkcijām. AI var ieteikt R/Python funkciju vai argumentu, kas neeksistē. Nepieņemiet kodu, to nepalaižot un nepārbaudot.
  • Mikrodatu augšupielāde publiskajā rīkā. Tas ir KVKK/GDPR un datu lietošanas līguma pārkāpums. Anonimizēt datus vai nekoplietot tos vispār.
  • Plūsmu sajauc ar precizitāti. Labi uzrakstīts pārskats var būt neprecīzs. Teikuma skaistums nav pierādījums.
  • Cēloņas valodas pieņemšana bez kontroles. YZ bieži saka: “X palielina Y”; tā kā lielākā daļa regresiju parāda tikai attiecības. Aizstāvēt cēloņsakarību ar dizainu.
Padoms. Strādājot ar mākslīgo intelektu, uzdodiet sev šādu jautājumu: "Ja tiesnesis vai auditors pieprasa šo rezultātu, vai varu parādīt avotu un kontu?" Ja atbilde ir nē, izvade vēl nav gatava lietošanai.

Rezumējot

AI nodrošina reālu un milzīgu paātrinājumu ekonometrijas un statistikas darbplūsmas izpildes slānī (kods, tīrīšana, grafiks, melnraksts); tomēr modeļu izvēle, cēloņsakarība, interpretācija, publicēšana un politikas lēmumi pieder ekspertam. Trīs pamata disciplīnas: neatgādiniet AI numuru, pieprasiet kodu un pats ģenerējiet un pārbaudiet rezultātu; neizņemiet mikro/licencētos datus no drošās vides; statistiskais filtrs katru izvadi. Nepārbaudīta AI izvade ir tikpat riskanta kā nepārskatīts atradums.

Lietojumprogrammas uzdevums

Apsveriet savu (vai piemēru) datu kopu. Pieprasiet AI R vai Python kodu, kas veido aprakstošu statistiku un vienkāršu grafiku, vienkārši aprakstot mainīgo struktūru, nekoplietojot datus. Palaidiet ienākošo kodu savā vidē. Pēc tam saglabājiet kontrolsarakstu: (1) vai kods tika palaists bez kļūdām, (2) ir rindu/novērojumu skaits, kā jūs gaidījāt, (3) kurš no AI komentāru teikumiem izmanto cēloņsakarību un ir jālabo. Vienā rindkopā uzrakstiet par laiku, ko AI jūs izglāba, un vismaz vienu kļūdu, kuru esat noķēris.

kontrolsaraksts

  • [ ] Es neliku AI prasīt konkrētu statistiku; Es pieprasīju kodu un pats uzrādīju rezultātu.
  • [ ] Es pārrēķināju katru skaitli un testa rezultātu, ko tas sniedza savā vidē.
  • [ ] Es pārbaudīju, vai tajā izmantotās funkcijas/argumenti patiešām pastāv.
  • [ ] Es neaugšupielādēju mikro/personas/licencētus datus publiskā rīkā.
  • [ ] Es atzīmēju komentārus, kas satur cēloņsakarību, un pārvietoju tos uz relāciju valodu.
  • [ ] Es varu parādīt revidentam iznākuma avotu un uzskaiti.