Yunit 1 / 11

Artificial Intelligence sa Econometrics at Statistics: Mga Tungkulin, Hangganan, Authentication at Privacy

Mga nadagdag:

  • Ang kakayahang tukuyin kung saan sa empirical na daloy ng trabaho (paglilinis ng data, code, visualization, draft interpretation) ang artificial intelligence ay nakakatipid ng real time at kung saan ang mga desisyon tulad ng pagpili ng modelo, pag-angkin ng sanhi at desisyon sa paglalathala ay ipinaubaya sa eksperto, ayon sa antas ng panganib sa gawain
  • Kakayahang maglapat ng disiplina na nagpapatunay sa bawat output ng artificial intelligence (numero, coefficient, code, komento) sa pamamagitan ng mga hakbang ng muling pagkalkula, pag-link sa pinagmulan at pagsala ng istatistika.
  • Kakayahang ligtas na magproseso ng micro data at kumpidensyal/lisensyadong data set sa loob ng saklaw ng KVKK/GDPR at mga kasunduan sa paggamit ng data at makuha ang ugali ng pagpili ng mga naaangkop na tool.

Ang parehong mga tanong ay umuulit araw-araw sa isang econometrician o inilapat na statistician's desk: Maasahan ba ang set ng data na ito; Ano ang gagawin sa mga nawawalang halagang ito? Ano ba talaga ang sinasabi ng coefficient ng regression na ito? Ang relasyon ba na ito ay sanhi o ugnayan lamang? Dahil ang p-value na ito ay makabuluhan, maaari ko bang isulat ito sa artikulo o maikling patakaran? Ang ilan sa mga tanong na ito ay paulit-ulit, code-intensive, at matagal: paglilinis ng data, pag-plot ng parehong graph ng sampung beses, pag-debug ng R o Python code, paglalagay ng mga resulta sa isang talahanayan. Ang iba ay direktang tinutukoy ang bisa ng isang paghahanap, ang katapatan ng isang publikasyon, o ang katumpakan ng isang desisyon sa patakaran.

Ang artificial intelligence (AI sa madaling salita, AI - mga computer system na maaaring gumawa ng text at code tulad ng mga tao, kumikilala ng mga pattern, nagbubuod ng data at magsulat ng mga komento; ang pinaka ginagamit na form ngayon ay malalaking modelo ng wika, iyon ay, mga system na sinanay sa malaking teksto at bumuo ng mga pangungusap sa pamamagitan ng paghula sa susunod na salita) ay nasa gitna mismo ng talahanayang ito. Kapag ginamit nang tama, binabawasan nito ang mga oras ng code sa paglilinis ng data sa mga minuto, nagpapaalala sa iyo ng syntax ng isang kumplikadong istatistikal na pagsubok, o nag-draft ng interpretasyon ng isang koepisyent. Kapag ginamit nang hindi tama, nagpapakita ito ng isang tila sigurado ngunit ganap na gawa-gawang numero, isang maling kabuluhan, o isang relasyong hindi sanhi bilang isang "paghahanap".

Ang unang yunit na ito ay hindi isang pagpapakilala ng software. Ang layunin nito ay linawin kung saan ilalagay ang AI sa iyong empirical na daloy ng trabaho at kung saan hindi ito ilalagay. Ang Econometrics ay parehong field na "kritikal sa pamamaraan" at hindi direktang "kritikal sa desisyon": ang koepisyent ng isang modelo na iyong binuo ay maaaring maging input sa desisyon ng rate ng interes ng sentral na bangko, pagbabago ng patakaran ng regulator, o milyong dolyar na pamumuhunan ng kumpanya. Ilatag natin ang pangunahing prinsipyo mula sa simula: Ang artificial intelligence ay isang katulong sa pagsusuri, hindi isang mananaliksik. Ang pananagutan para sa at huling pag-apruba ng pagpili ng modelo, diskarte sa pagkilala, paggigiit ng sanhi, paglalathala at mga desisyon sa patakaran ay nakasalalay sa karampatang eksperto.

Mga layer ng empirical workflow at ang lugar ng AI

Kapaki-pakinabang na hatiin ang isang empirical na pag-aaral sa tatlong layer. Ang execution layer ay ang pang-araw-araw na teknikal na gawain: data cleaning code, graph drawing, table formatting, syntax debugging. Ang layer ng pamamaraan ay ang analytical na desisyon: aling modelo, aling diskarte sa pagkakakilanlan, aling pagsubok, alin ang pagsusuri sa pagpapalagay. Ang layer ng interpretasyon at desisyon ay ang kahulugan ng mga natuklasan: kung ano ang sinasabi ng koepisyent, ito ba ay sanhi, ano ang ibig sabihin nito para sa patakaran, kung ito ay mailathala. Hinahawakan ng AI ang lahat ng tatlong layer, ngunit may iba't ibang awtoridad sa bawat isa. Sa execution layer, mabilis na nag-draft at bumubuo ng code ang AI; Sa layer ng interpretasyon at desisyon, input lamang ang ibinibigay at ang eksperto ang gumagawa ng desisyon.

Tukuyin natin ang ilang pangunahing termino mula sa simula. Ang Econometrics ay ang sangay na nagsusuri ng pang-ekonomiya at panlipunang data gamit ang mga istatistikal na pamamaraan at sumusukat sa mga ugnayan. Ang regression ay isang pamamaraan na ayon sa numero ay nagmomodelo ng relasyon ng isang variable na kinalabasan (dependent variable) na may isa o higit pang mga variable na nagpapaliwanag (mga independiyenteng variable). Ang koepisyent ay ang bilang na nagpapakita kung gaano karaming mga yunit ng pagbabago sa karaniwan ang isang pagbabago sa isang yunit sa isang nagpapaliwanag na variable na nauugnay sa variable ng kinalabasan. Ang p-value ay ang posibilidad na ang naobserbahang kinalabasan (o isang mas matinding kinalabasan) ay mangyayari nang nagkataon kapag walang epekto ang aktwal na umiiral. Isa-isa nating ipapaliwanag ang mga konseptong ito sa mga sumusunod na yunit; Sa ngayon, alamin ito: Sa lahat ng ito, binibigyan ka ng AI ng blueprint, code, at paliwanag, ngunit hindi ito gumagawa ng mga siyentipikong desisyon.

Ang sumusunod na talahanayan ay nagbubuod sa tungkulin at antas ng panganib ng AI ayon sa misyon:

Paghanap

Papel ng AI

Antas ng panganib

Sino ang pumayag

Pagsusulat ng data sanitization code

generator ng code

mababa

Analyst mismo (na may code testing)

Burador ng tsart/talahanayan

sketch generator

mababa

analyst

Paalala ng syntax sa pagsubok/modelo

Reference assistant

low-medium

analyst

Draft coefficient interpretasyon

draft writer

daluyan

ekonomiko

Pagpili ng modelo/pagkilala sa diskarte

pantulong na input

mataas

dalubhasang mananaliksik

Claim ng sanhi

Isang draft lang, hindi ang huling salita

napakataas

Expert + peer review

Pagpapasya sa publikasyon/patakaran

input lamang

napakataas

Responsableng imbestigador/institusyon

Tandaan ang isang linya sa talahanayang ito: habang tumataas ang panganib, lumiliit ang papel ng AI at lumalaki ang pag-apruba ng eksperto.

Bakit "pag-verify" ang puso ng negosyong ito

Ang mga modelo ng wika ay tila tiwala sa kanilang sagot, ngunit maaaring hindi sila sigurado. Sa teknikal na wika, ito ay tinatawag na guni-guni: ito ay katha ng modelo ng hindi umiiral na impormasyon sa isang matatas na pangungusap, na para bang ito ay totoo. Para sa isang econometrician, ito ay isang nakamamatay na bitag. Ang modelo ay maaaring magbigay sa iyo ng eksaktong numero gaya ng "Ang ugnayan sa pagitan ng kawalan ng trabaho at inflation sa Türkiye sa pagitan ng 2015-2020 ay 0.62"; Gayunpaman, hindi pa niya nakita ang iyong data at ang numerong ito ay ganap na binubuo. O maaari itong sabihin, "Ang white test p-value ay 0.03"; samantalang hindi ito nagpatakbo ng anumang mga pagsubok. Maaari itong tumawag sa isang R function na may isang argumento na hindi talaga umiiral. Inaawit niya ang lahat ng tatlo na may parehong katatasan; Ang tanging bagay na naghihiwalay sa tama sa mali ay ang iyong kaalaman at ang iyong ugali sa pag-verify.

Ang disiplina sa pagpapatunay ay binubuo ng tatlong hakbang:

  1. Muling kalkulahin / tumakbo sa iyong sariling kapaligiran: Kalkulahin ang bawat numero, ratio, resulta ng pagsubok at koepisyent na ibinigay ng AI sa R/Python gamit ang iyong sariling data, hindi mula sa memorya ng AI. Gamitin ang AI upang isulat ang code, hindi para matandaan ang resulta. Patakbuhin ang code, gumawa ka ng output.
  2. Link sa pinagmulan: Umasa sa mga aklat-aralin, mga artikulo ng pamamaraan, at mga opisyal na dokumento para sa mga panuntunan sa pamamaraan, mga formula, at mga kahulugan. Kumpirmahin ang pahayag ng AI na "the assumption of this test is" na may mapagkakatiwalaang source.
  3. Filter ng istatistika: Subukan sa mga mata ng eksperto kung sumasalungat ang output sa lohika ng istatistika (mga pagpapalagay, sample, laki ng epekto, kawalan ng katiyakan). Tanggihan ang isang "makahulugan ngunit walang katotohanan" na resulta.
Babala: Ang paglalagay ng koepisyent, pagsubok, o interpretasyon na binuo ng AI sa isang artikulo, thesis, o tala ng patakaran nang hindi ito pinapatunayan ay parang pag-publish ng hindi pa nasusuri na paghahanap. Dahil lamang sa ang output ay matatas ay hindi totoo; Dahil lang sa tila tiyak ang bilang, hindi ito totoo.

Privacy: pribado na pinoprotektahan ang micro data at lisensyadong data

Ang microdata (iisang talaan sa antas ng indibidwal, sambahayan, kompanya o pasyente) ay madalas na ginagamit sa econometrics. Karamihan sa data na ito ay personal na data at protektado sa ilalim ng KVKK (Personal Data Protection Law) sa Türkiye at GDPR sa Europe. Bukod pa rito, ang TurkStat, mga sentral na bangko, mga tagapagbigay ng data ng panel at mga pinagmumulan ng komersyal ay kadalasang nagbibigay ng data na may kasunduan sa paggamit ng data; Ang mga kasunduang ito ay nagbabawal sa paglilipat ng data sa mga ikatlong partido. Ang pag-paste ng talahanayan na naglalaman ng impormasyon ng pagkakakilanlan, kita, kalusugan o mga lihim ng kumpanya sa isang pampublikong AI chat tool ay parehong paglabag sa KVKK/GDPR at isang paglabag sa kontrata; dahil ang data ay napupunta sa isang panlabas na server at maaaring magamit sa pagsasanay ng modelo sa ilang mga tool.

Ang panuntunan ay simple: panatilihin ang data sa sarili nitong ligtas na kapaligiran, tanungin lamang ang AI para sa code at mga pamamaraan. Ang perpektong daloy ng trabaho ay ito: tanungin ang AI para sa code ng pagsusuri, pinapatakbo mo ang code gamit ang totoong data sa iyong sariling computer/enterprise server. Kung talagang kailangan mong magbahagi ng data, i-anonymize (alisin ang mga field ng ID), pagsama-samahin (average/bilang sa halip na indibidwal), at pumili ng mga tool na institusyonal, may kasunduan sa pagproseso ng data, at huwag gamitin ang iyong data sa edukasyon.

tatlong mini case

Kaso 1 — Ligtas at mahusay na paggamit. Isang mananaliksik ang unang gumugol ng 6 na oras nang manu-mano sa paglilinis ng 40,000 hilera ng data ng badyet ng sambahayan. Nang walang pagbabahagi ng data, inilarawan lamang niya ang mga variable na pangalan at istraktura sa AI at humingi ng isang code ng paglilinis. Ang AI ay nakabuo ng isang R script; Pinatakbo ng mananaliksik ang code sa sarili niyang kapaligiran, sinuri ang bilang ng mga linya at buod na istatistika ng bawat hakbang, at inayos ang dalawang logic error. Tagal: 70 minuto sa halip na 6 na oras. Ang data ay hindi kailanman lumabas; Ang responsibilidad ay nanatili sa mananaliksik.

Kaso 2 — Hindi na-verify na bitag ng numero. "Ano ang elasticity sa pagitan ng GDP growth at foreign direct investment," tanong ng isang nagtapos na estudyante sa AI. Ang AI ay may kumpiyansa na nagbigay ng bilang ng "mga 0.34" kahit na wala itong access sa anumang data. Isinulat ito ng mag-aaral sa buod ng panitikan; Nang tanungin ng kanyang tagapayo ang pinagmulan, lumabas na walang basehan ang numero at gawa-gawa lamang. Pagkakamali: Inaasahan ang mga konkretong istatistika mula sa AI nang hindi nagbibigay ng data at mapagkukunan dito.

Kaso 3 — Pagkakumpidensyal at paglabag sa kontrata. Isang analyst ang nag-upload ng Excel, na natanggap niya mula sa isang lisensyadong panel ng kumpanya, na naglalaman ng pangalan ng kumpanya at turnover, sa isang pampublikong magagamit na tool ng AI at sinabing "gawin ang panel regression." Ipinagbabawal ng kontrata ng data provider ang paglipat ng data sa mga third-party system; Nag-udyok ang insidente ng pagsusuri sa pagsunod. Ang tamang paraan ay palitan ang mga pangalan ng kumpanya ng mga anonymous na code o magbahagi ng walang data at humiling lamang ng panel regression code at patakbuhin ito sa sarili nitong kapaligiran.

Mahinang prompt / Malakas na prompt

Mahinang prompt:

Suriin ang kaugnayan sa pagitan ng inflation at kawalan ng trabaho at sabihin ang koepisyent.

Mali ang claim na ito: Walang ibinigay na data sa AI, hindi malinaw kung aling bansa, aling panahon, aling modelo. Makakasagot lang ang AI gamit ang isang made-up na koepisyent.

Napakahusay na prompt:

Ang iyong tungkulin: isa kang katulong sa pagsusuri na tumutulong sa mananaliksik ng econometrics. HINDI KO ibinabahagi sa iyo ang data; Gusto ko lang RUNNABLE R code. Mayroon akong taunang panel: mga variable na bansa, taon, kawalan ng trabaho, inflation (lahat ng numero). Gawain: 1) magsulat ng fixed effects panel regression code para sa kawalan ng trabaho ~ inflation (plm package), 2) ipaliwanag ang bawat hakbang sa code na may linya ng komento, 3) tandaan na ang coefficient ay dapat bigyang kahulugan bilang relational, hindi CAUSAL, 4) bumubuo sa argumento ng function na hindi ka sigurado; Tatakbo ako at i-verify ang resulta sa sarili kong kapaligiran.

Sa kahilingang ito, walang ibinabahaging data, malinaw ang tungkulin, mga pakete, inaasahan ng mga komento at ang pagbabawal sa "fabrication". Ikaw pa rin ang tumakbo at i-verify ang output sa iyong sarili.

Ang sumusunod na talahanayan ay nagbubuod sa mga tuntunin ng isang pangungusap sa araling ito:

prinsipyo

Ano ang ibig sabihin nito

Si AI ay isang katulong

Ang siyentipikong desisyon at responsibilidad ay pag-aari ng eksperto

Hilingin ang code, ilabas ang resulta

Hindi naaalala ng AI ang numero; patakbuhin mo ito at kalkulahin

panatilihin ang data

Ang micro/licensed data ay hindi umaalis sa secure na kapaligiran

patunayan

Ang bawat isyu, code, komento ay sinusuri; ang katha ay tinatanggihan

Mga karaniwang pagkakamali

  • Inaasahan ang mga konkretong istatistika mula sa AI nang hindi nagbibigay ng data. Hindi ma-access ng modelo ang data; Ang coefficient, correlation at p-value na ibinibigay nito ay peke. Palaging hilingin ang code at ikaw mismo ang gumawa ng resulta.
  • Umaasa sa mga function ng hallucinatory. Maaaring magmungkahi ang AI ng R/Python function o argument na wala. Huwag tanggapin ang code nang hindi tumatakbo at bini-verify ito.
  • Pag-upload ng microdata sa pampublikong tool. Ito ay isang paglabag sa KVKK/GDPR at kasunduan sa paggamit ng data. I-anonymize ang data o huwag itong ibahagi.
  • Napagkakamalang katatasan para sa katumpakan. Ang isang mahusay na nakasulat na pagsusuri ay maaaring hindi tumpak. Ang kagandahan ng pangungusap ay hindi patunay.
  • Pagtanggap ng sanhi ng wika nang walang kontrol. Madalas na sinasabi ng YZ na "Ang X ay nagpapataas ng Y"; samantalang karamihan sa mga regression ay nagpapakita lamang ng mga relasyon. Ipagtanggol ang sanhi ng paghahabol na may disenyo.
Tip: Kapag nagtatrabaho sa AI, itanong sa iyong sarili ang tanong na ito: "Kung hihilingin ng referee o auditor ang output na ito, maaari ko bang ipakita ang pinagmulan at account?" Kung ang sagot ay hindi, ang output ay hindi pa handang gamitin.

Sa buod

Nagbibigay ang AI ng tunay at napakalaking acceleration sa execution layer (code, cleanup, graph, draft) ng econometrics at statistics workflow; gayunpaman, ang pagpili ng modelo, sanhi, interpretasyon, publikasyon at mga desisyon sa patakaran ay pagmamay-ari ng eksperto. Tatlong pangunahing disiplina: huwag paalalahanan ang AI ng numero, hilingin ang code at bumuo at i-verify ang resulta sa iyong sarili; huwag tanggalin ang micro/licensed data mula sa secure na kapaligiran; statistical filter bawat output. Ang isang hindi na-verify na output ng AI ay kasing peligro ng isang hindi nasuri na paghahanap.

Gawain ng aplikasyon

Isaalang-alang ang iyong sariling (o isang halimbawa) set ng data. Tanungin ang AI ​​para sa R ​​o Python code na gumagawa ng mga deskriptibong istatistika at isang simpleng graph sa pamamagitan lamang ng paglalarawan sa variable na istraktura, nang hindi ibinabahagi ang data. Patakbuhin ang papasok na code sa iyong sariling kapaligiran. Pagkatapos ay panatilihin ang isang checklist: (1) tumakbo ba ang code nang walang mga error, (2) ay ang bilang ng mga linya/obserbasyon gaya ng iyong inaasahan, (3) kung alin sa mga pangungusap ng komento ng AI ang gumagamit ng causal language at dapat ayusin. Sa isang talata, isulat ang tungkol sa oras na iniligtas ka ng AI at kahit isang bug na nahuli mo.

checklist

  • [ ] Hindi ko ginawa ang AI na humingi ng mga konkretong istatistika; Hiniling ko ang code at ako mismo ang gumawa ng resulta.
  • [ ] Muli kong kinakalkula ang bawat numero at resulta ng pagsubok na ibinigay nito sa sarili kong kapaligiran.
  • [ ] Na-verify ko na ang mga function/argument na ginagamit nito ay talagang umiiral.
  • [ ] Hindi ako nag-upload ng micro/personal/licensed data sa isang pampublikong tool.
  • [ ] Minarkahan ko ang mga komentong naglalaman ng causal language at inilipat ang mga ito sa relational na wika.
  • [ ] Naipakita ko ang pinagmulan at accounting ng output sa isang auditor.