Fitimet:
- Të jesh në gjendje të dallosh se ku në rrjedhën empirike të punës (pastrimi i të dhënave, kodi, vizualizimi, interpretimi i draftit) inteligjenca artificiale kursen kohë reale dhe ku vendime të tilla si përzgjedhja e modelit, pretendimi i shkakësisë dhe vendimi i publikimit i lihen ekspertit, sipas nivelit të rrezikut të detyrës.
- Aftësia për të aplikuar një disiplinë që verifikon çdo dalje të inteligjencës artificiale (numër, koeficient, kod, koment) përmes hapave të rillogaritjes, lidhjes me burimin dhe filtrimit statistikor.
- Aftësia për të përpunuar në mënyrë të sigurtë mikro të dhënat dhe grupet e të dhënave konfidenciale/të licencuara brenda fushës së KVKK/GDPR dhe marrëveshjeve të përdorimit të të dhënave dhe për të fituar zakonin e zgjedhjes së mjeteve të përshtatshme.
Të njëjtat pyetje përsëriten çdo ditë në tryezën e një ekonometristi ose statisticieni të aplikuar: A është i besueshëm ky grup i të dhënave; Çfarë duhet bërë me këto vlera që mungojnë? Çfarë thotë në të vërtetë koeficienti i këtij regresioni? A është kjo marrëdhënie shkakësore apo thjesht korrelative? Për shkak se kjo vlerë p është e rëndësishme, a mund ta shkruaj atë në artikull ose në përmbledhjen e politikave? Disa nga këto pyetje janë të përsëritura, me kod intensiv dhe kërkojnë kohë: pastrimi i të dhënave, vizatimi i të njëjtit grafik dhjetë herë, korrigjimi i kodit R ose Python, vendosja e rezultateve në një tabelë. Të tjerët përcaktojnë drejtpërdrejt vlefshmërinë e një gjetjeje, ndershmërinë e një publikimi ose saktësinë e një vendimi të politikës.
Inteligjenca artificiale (shkurtimisht AI - sisteme kompjuterike që mund të prodhojnë tekst dhe kod si njerëzit, të njohin modele, të përmbledhin të dhënat dhe të shkruajnë komente; forma më e përdorur sot janë modelet e mëdha gjuhësore, domethënë sistemet që trajnohen në tekst të madh dhe ndërtojnë fjali duke parashikuar fjalën tjetër) qëndron pikërisht në mes të kësaj tabele. Kur përdoret si duhet, ai redukton orët e kodit të pastrimit të të dhënave në minuta, ju kujton sintaksën e një testi kompleks statistikor ose harton interpretimin e një koeficienti. Kur përdoret gabimisht, ai paraqet një numër në dukje të sigurt, por plotësisht të fabrikuar, një domethënie të rreme ose një marrëdhënie jo shkakësore si "gjetje".
Kjo njësi e parë nuk është një prezantim i softuerit. Qëllimi i tij është të sqarojë se ku të vendosni AI në rrjedhën tuaj empirike të punës dhe ku nuk duhet ta vendosni kurrë. Ekonometria është një fushë "metodë kritike" dhe indirekt "kritike për vendimet": koeficienti i një modeli që ndërtoni mund të jetë kontributi i vendimit të një banke qendrore për normën e interesit, ndryshimi i politikës së një rregullatori ose investimi milion dollarësh i një firme. Le të parashtrojmë parimin bazë që në fillim: Inteligjenca artificiale është një asistent analize, jo një studiues. Përgjegjësia për dhe miratimi përfundimtar i përzgjedhjes së modelit, strategjisë së identifikimit, pohimit të shkakësisë, publikimit dhe vendimeve të politikave i takon ekspertit kompetent.
Shtresat e rrjedhës së punës empirike dhe vendi i AI
Është e dobishme që një studim empirik të ndahet në tre shtresa. Shtresa e ekzekutimit është puna teknike e përditshme: kodi i pastrimit të të dhënave, vizatimi i grafikut, formatimi i tabelës, korrigjimi i sintaksës. Shtresa e metodës është vendimi analitik: cili model, cila strategji identifikimi, cili test, cili kontroll i supozimeve. Shtresa e interpretimit dhe e vendimit është kuptimi i gjetjeve: çfarë thotë koeficienti, a është shkakësor, çfarë do të thotë për politikën, nëse duhet të publikohet. AI prek të tre shtresat, por me autoritet të ndryshëm në secilën. Në shtresën e ekzekutimit, AI harton dhe gjeneron shpejt kodin; Në shtresën e interpretimit dhe vendimit, jepet vetëm inputi dhe eksperti merr vendimin.
Le të përcaktojmë disa terma bazë që në fillim. Ekonometria është dega që analizon të dhënat ekonomike dhe sociale me metoda statistikore dhe mat marrëdhëniet. Regresioni është një metodë që modelon numerikisht marrëdhënien e një ndryshoreje rezultati (ndryshore e varur) me një ose më shumë variabla shpjegues (ndryshore të pavarura). Koeficienti është numri që tregon se me sa njësi ndryshimi shoqërohet mesatarisht një ndryshim me një njësi në një variabël shpjegues në variablin e rezultatit. Vlera p është probabiliteti që rezultati i vëzhguar (ose një rezultat më ekstrem) të ndodhte rastësisht kur nuk ekziston asnjë efekt. Ne do t'i shpjegojmë këto koncepte një nga një në njësitë e mëposhtme; Tani për tani, dijeni këtë: në të gjitha këto, AI ju jep planin, kodin dhe shpjegimin, por nuk merr vendime shkencore.
Tabela e mëposhtme përmbledh rolin dhe nivelin e rrezikut të AI sipas misionit:
Kërkimi
Roli i AI
Niveli i rrezikut
Kush e miraton
Shkrimi i kodit të sanimit të të dhënave
gjenerator kodesh
të ulëta
Vetë analisti (me testimin e kodit)
Drafti i grafikut/tabelës
gjenerator skicash
të ulëta
analist
Përkujtues sintaksor test/model
Asistent referencë
të ulët-mesatare
analist
Draft interpretimi i koeficientit
draft shkrimtar
e mesme
ekonomist
Zgjedhja e modelit/strategjisë së identifikimit
hyrje ndihmëse
lartë
studiues ekspert
Pretendimi shkakësor
Vetëm një draft, kurrë fjala përfundimtare
shumë e lartë
Ekspert + rishikim kolegial
Publikimi/vendimi i politikës
vetëm hyrje
shumë e lartë
Hetues/institucion përgjegjës
Mbani në mend rreshtin e vetëm në këtë tabelë: ndërsa rreziku rritet, roli i AI zvogëlohet dhe miratimi i ekspertëve rritet.
Pse “verifikimi” është zemra e këtij biznesi
Modelet gjuhësore duken të sigurta në përgjigjen e tyre, por mund të mos jenë të sigurt. Në gjuhën teknike, kjo quhet halucinacion: është fabrikimi i modelit të informacionit joekzistent në një fjali të rrjedhshme, njësoj sikur të ishte e vërtetë. Për një ekonometri, kjo është një kurth vdekjeprurëse. Modeli mund t'ju japë një numër të saktë si "Korrelacioni midis papunësisë dhe inflacionit në Turqi midis 2015-2020 është 0.62"; Megjithatë, ai nuk i ka parë kurrë të dhënat tuaja dhe ky numër është plotësisht i sajuar. Ose mund të thuhet, "P-vlera e testit të bardhë ishte 0.03"; ndërsa nuk ka kryer asnjë provë. Mund të thërrasë një funksion R me një argument që nuk ekziston në të vërtetë. Ai i këndon të treja me të njëjtën rrjedhshmëri; E vetmja gjë që ndan të drejtën nga e gabuara është njohuria juaj dhe zakoni juaj për të verifikuar.
Disiplina e verifikimit përbëhet nga tre hapa:
- Rillogaritni / ekzekutoni në mjedisin tuaj: Llogaritni çdo numër, raport, rezultat testimi dhe koeficient të dhënë nga AI në R/Python me të dhënat tuaja, jo nga kujtesa e AI. Përdorni AI për të shkruar kodin, jo për të kujtuar rezultatin. Drejtoni kodin, ju prodhoni rezultatin.
- Lidhja me burimin: Mbështetuni në tekstet shkollore, artikujt e metodave dhe dokumentet zyrtare për rregullat, formulat dhe përkufizimet e metodave. Konfirmoni deklaratën e AI "supozimi i këtij testi është" me një burim të besueshëm.
- Filtri statistikor: Testoni me sytë e ekspertëve nëse rezultati bie ndesh me logjikën statistikore (supozimet, mostra, madhësia e efektit, pasiguria). Refuzoni një rezultat "kuptimplotë, por absurd".
Kujdes: Vendosja e një koeficienti, testi ose interpretimi të krijuar nga AI në një artikull, tezë ose shënim politikash pa e vërtetuar është si të publikosh një gjetje të pashqyrtuar. Vetëm për shkak se prodhimi është i rrjedhshëm nuk është e vërtetë; Vetëm për shkak se numri duket i sigurt, nuk është real.
Privatësia: mikro të dhënat dhe të dhënat e licencuara mbrohen privatisht
Mikro të dhënat (regjistrat e vetëm në nivel individual, familjeje, firme ose pacienti) përdoren shpesh në ekonometri. Shumica e këtyre të dhënave janë të dhëna personale dhe mbrohen sipas KVKK (Ligji për Mbrojtjen e të Dhënave Personale) në Turqi dhe GDPR në Evropë. Përveç kësaj, TurkStat, bankat qendrore, ofruesit e të dhënave panel dhe burimet komerciale shpesh ofrojnë të dhëna me një marrëveshje për përdorimin e të dhënave; Këto marrëveshje ndalojnë transferimin e të dhënave te palët e treta. Ngjitja e një tabele që përmban informacione identiteti, të ardhura, shëndetësi ose sekrete të kompanisë në një mjet bisede publike të AI është një shkelje e KVKK/GDPR dhe një shkelje e kontratës; sepse të dhënat shkojnë në një server të jashtëm dhe mund të përdoren në trajnimin e modeleve në disa mjete.
Rregulli është i thjeshtë: mbajini të dhënat në mjedisin e tyre të sigurt, kërkoni nga AI vetëm kodin dhe metodat. Rrjedha ideale e punës është kjo: kërkoni nga AI kodin e analizës, ju ekzekutoni kodin me të dhënat reale në kompjuterin tuaj/serverin e ndërmarrjes. Nëse vërtet duhet të ndani të dhëna, anonimizoni (hiqni fushat e ID-së), grumbulloni (mesatare/numëro sesa individuale) dhe zgjidhni mjete që janë institucionale, kanë një marrëveshje për përpunimin e të dhënave dhe nuk i përdorni të dhënat tuaja në arsim.
tre mini kuti
Rasti 1 - Përdorimi i sigurt dhe efikas. Një studiues fillimisht kaloi 6 orë duke pastruar manualisht 40,000 rreshta të të dhënave të buxhetit të familjes. Pa i ndarë fare të dhënat, ai thjesht përshkroi emrat dhe strukturën e variablave në AI dhe kërkoi një kod pastrimi. AI gjeneroi një skript R; Studiuesi ekzekutoi kodin në mjedisin e tij, kontrolloi numrin e rreshtave dhe statistikat përmbledhëse të secilit hap dhe rregulloi dy gabime logjike. Kohëzgjatja: 70 minuta në vend të 6 orësh. Të dhënat nuk dolën kurrë; Përgjegjësia i mbeti studiuesit.
Rasti 2 - Kurthi i numrave të paverifikuar. "Cili është elasticiteti midis rritjes së PBB-së dhe investimeve të huaja direkte," pyeti një student i diplomuar për AI. AI me besim dha një numër "rreth 0.34" edhe pse nuk kishte akses në asnjë të dhënë. Nxënësi e ka shkruar këtë në përmbledhjen e literaturës; Kur këshilltari i tij pyeti për burimin, rezultoi se numri nuk kishte bazë dhe ishte tërësisht i sajuar. Gabim: Pritja e statistikave konkrete nga AI pa dhënë të dhëna dhe burime për të.
Rasti 3 — Konfidencialiteti dhe shkelja e kontratës. Një analist ngarkoi Excel, të cilin e mori nga një panel i licencuar kompanie, që përmbante emrin e kompanisë dhe qarkullimin, në një mjet AI të disponueshëm publikisht dhe tha "bëni regresionin e panelit". Kontrata e ofruesit të të dhënave ndalonte transferimin e të dhënave në sistemet e palëve të treta; Incidenti nxiti një rishikim të pajtueshmërisë. Mënyra e duhur ishte të zëvendësoheshin emrat e kompanive me kode anonime ose të mos ndaheshin të dhëna dhe të kërkohej vetëm kodi i regresionit të panelit dhe të ekzekutohej në mjedisin e vet.
Prompt i dobët / Prompt i fortë
Njoftim i dobët:
Analizoni lidhjen midis inflacionit dhe papunësisë dhe tregoni koeficientin.
Ky pretendim është i gabuar: Asnjë të dhënë nuk i është dhënë UA, nuk është e qartë se cili shtet, cili periudhë, cili model. AI mund të përgjigjet vetëm me një koeficient të krijuar.
Njoftim i fuqishëm:
Roli juaj: ju jeni një asistent analize që ndihmon studiuesin e ekonometrisë. NUK I ndaj të dhënat me ju; Unë dua vetëm kodin R RUNNABLE. Kam panel vjetor: variablat shteti, viti, papunësia, inflacioni (të gjitha numerike). Detyrë: 1) shkruani një kod regresioni të panelit me efekte fikse për papunësinë ~ inflacionin (paketë plm), 2) shpjegoni çdo hap në kod me një rresht komenti, 3) vini re se koeficienti duhet të interpretohet si relacional, jo KAUSAL, 4) krijoni argumentin e funksionit për të cilin nuk jeni të sigurt; Unë do të vrapoj dhe do të verifikoj rezultatin në mjedisin tim.
Në këtë kërkesë nuk ndahet asnjë e dhënë, është i qartë roli, paketat, pritshmëria e komenteve dhe ndalimi i “fabrikimit”. Ju ende ekzekutoni dhe verifikoni vetë rezultatin.
Tabela e mëposhtme përmbledh rregullat me një fjali në këtë mësim:
parim
çfarë do të thotë
AI është një asistent
Vendimi dhe përgjegjësia shkencore i takon ekspertit
Kërkoni kodin, jepni rezultatin
AI nuk e mban mend numrin; ju e drejtoni dhe llogaritni
mbani të dhëna
Të dhënat mikro/të licencuara nuk largohen nga mjedisi i sigurt
verifikoni
Çdo çështje, kod, koment kontrollohet; fabrikimi refuzohet
Gabimet e zakonshme
- Presim statistika konkrete nga AI pa dhënë të dhëna. Modeli nuk mund të aksesojë të dhënat; Koeficienti, korrelacioni dhe vlera p që jep janë të rreme. Kërkoni gjithmonë kodin dhe nxirrni vetë rezultatin.
- Duke u mbështetur në funksionet halucinative. AI mund të sugjerojë një funksion ose argument R/Python që nuk ekziston. Mos e pranoni kodin pa e ekzekutuar dhe verifikuar atë.
- Ngarkimi i mikro të dhënave në mjetin publik. Është shkelje e KVKK/GDPR dhe marrëveshjes së përdorimit të të dhënave. Anonimizo të dhënat ose mos i ndaj fare.
- Gabimi i rrjedhshmërisë për saktësinë. Një rishikim i shkruar mirë mund të jetë i pasaktë. Bukuria e fjalisë nuk është provë.
- Pranimi i gjuhës shkakësore pa kontroll. YZ shpesh thotë "X rrit Y"; ndërsa shumica e regresioneve tregojnë vetëm marrëdhënie. Mbroni pretendimin shkakësor me dizajn.
Këshillë: Kur punoni me AI, bëni vetes këtë pyetje: "Nëse një arbitër ose auditor kërkon këtë rezultat, a mund të tregoj burimin dhe llogarinë?" Nëse përgjigja është jo, produkti nuk është ende gati për përdorim.
Në përmbledhje
AI ofron një përshpejtim real dhe masiv në shtresën e ekzekutimit (kodi, pastrimi, grafiku, drafti) i rrjedhës së punës së ekonometrisë dhe statistikave; megjithatë, përzgjedhja e modelit, shkakësia, interpretimi, publikimi dhe vendimet e politikave i përkasin ekspertit. Tre disiplina bazë: mos ia kujtoni AI-së numrin, kërkoni kodin dhe gjeneroni dhe verifikoni vetë rezultatin; mos hiqni të dhënat mikro/të licencuara nga mjedisi i sigurt; filtro statistikore çdo dalje. Një rezultat i paverifikuar i AI është po aq i rrezikshëm sa një gjetje e pashqyrtuar.
Detyra e aplikimit
Merrni parasysh grupin tuaj të të dhënave (ose një shembull). Kërkoni nga AI për kodin R ose Python që prodhon statistika përshkruese dhe një grafik të thjeshtë duke përshkruar thjesht strukturën e variablave, pa ndarë të dhënat. Ekzekutoni kodin hyrës në mjedisin tuaj. Pastaj mbani një listë kontrolli: (1) a funksionoi kodi pa gabime, (2) është numri i rreshtave/vëzhgimeve siç prisnit, (3) cila nga fjalitë e komenteve të AI përdor gjuhë shkakësore dhe duhet të rregullohet. Në një paragraf, shkruani për kohën kur AI ju shpëtoi dhe të paktën një gabim që keni kapur.
listë kontrolli
- [ ] Unë nuk e detyrova UA të kërkojë statistika konkrete; Kërkova kodin dhe e nxora vetë rezultatin.
- [ ] Rillogarita çdo numër dhe rezultat testimi që ai dha në mjedisin tim.
- [ ] Kam verifikuar që funksionet/argumentet që përdor ekzistojnë në të vërtetë.
- [ ] Nuk ngarkova të dhëna mikro/personale/të licencuara në një mjet publik.
- [ ] I shënova komentet që përmbajnë gjuhë shkakësore dhe i zhvendosa në gjuhën relacionale.
- [ ] Unë jam në gjendje t'i tregoj një auditori burimin dhe kontabilitetin e prodhimit.