Nyereség:
- Meg tudja különböztetni, hogy az empirikus munkafolyamatban (adattisztítás, kódolás, vizualizáció, piszkozatértelmezés) a mesterséges intelligencia hol takarít meg valós időt, és hol marad a szakértőre olyan döntés, mint a modellválasztás, az ok-okozati összefüggés megállapítása és a publikálási döntés a feladat kockázati szintjének megfelelően.
- Képes egy olyan tudományág alkalmazására, amely minden mesterséges intelligencia kimenetet (számot, együtthatót, kódot, megjegyzést) az újraszámítás, a forráshoz való kapcsolódás és a statisztikai szűrés lépésein keresztül igazol.
- Képes a Mikroadatok és bizalmas/engedélyezett adatkészletek biztonságos feldolgozására a KVKK/GDPR és az adathasználati szerződések keretein belül, és elsajátítani a megfelelő eszközök kiválasztásának szokását.
Nap mint nap ugyanazok a kérdések merülnek fel egy ökonometrikus vagy alkalmazott statisztikus asztalán: Megbízható-e ez az adathalmaz; Mi a teendő ezekkel a hiányzó értékekkel? Mit mond valójában ennek a regressziónak az együtthatója? Ez a kapcsolat ok-okozati jellegű, vagy csak korrelációs? Mivel ez a p-érték szignifikáns, beírhatom a cikkbe vagy az irányelvek ismertetőjébe? Néhány ilyen kérdés ismétlődő, kód-intenzív és időigényes: adatok tisztítása, ugyanazon grafikon tízszeres ábrázolása, R vagy Python kód hibakeresése, az eredmények táblázatba fűzése. Mások közvetlenül határozzák meg egy megállapítás érvényességét, egy publikáció őszinteségét vagy egy politikai döntés pontosságát.
A mesterséges intelligencia (röviden AI - számítógépes rendszerek, amelyek képesek szöveget és kódot előállítani, mint az ember, felismerni a mintákat, összegezni az adatokat és megjegyzéseket írni; a manapság leggyakrabban használt formája a nagy nyelvi modellek, vagyis olyan rendszerek, amelyek hatalmas szövegre edzenek, és a következő szó előrejelzésével mondatokat építenek) a táblázat közepén helyezkedik el. Helyes használat esetén percekre csökkenti az órákon át tartó adattisztító kódot, emlékezteti egy összetett statisztikai teszt szintaxisára, vagy megszerkeszti egy együttható értelmezését. Helytelenül használva egy biztosnak tűnő, de teljesen kitalált számot, hamis szignifikanciát, vagy nem okozati összefüggést mutat be "leletként".
Ez az első egység nem egy szoftverbevezető. Célja annak tisztázása, hogy az empirikus munkafolyamatban hol helyezze el a mesterséges intelligenciát, és hová ne helyezze soha. Az ökonometria egyszerre "módszerkritikus" és közvetve "döntéskritikus" terület: az Ön által felépített modell együtthatója lehet a jegybank kamatdöntésének, a szabályozói politika megváltoztatásának vagy egy cég milliós befektetésének inputja. Az elejétől fogva fogalmazzuk meg az alapelvet: A mesterséges intelligencia elemzési asszisztens, nem kutató. A modellválasztás, az azonosítási stratégia, az ok-okozati összefüggés megállapítása, a közzététel és a politikai döntések felelőssége és végleges jóváhagyása az illetékes szakértőt terheli.
Az empirikus munkafolyamat rétegei és az AI helye
Célszerű egy empirikus vizsgálatot három rétegre osztani. A végrehajtási réteg a napi technikai munka: adattisztító kód, grafikonrajz, táblázat formázás, szintaktikai hibakeresés. A módszerréteg az analitikus döntés: melyik modell, melyik azonosítási stratégia, melyik teszt, melyik feltételezés ellenőrzése. Az értelmezési és döntési réteg a megállapítások jelentése: mit mond az együttható, ok-okozati összefüggésben van-e, mit jelent a politika szempontjából, közzé kell tenni. Az AI mindhárom réteget érinti, de mindegyikben más-más jogosultsággal. A végrehajtási rétegben az AI gyorsan vázlatokat készít és generál kódot; Az értelmezési és döntési szinten csak input adják meg, és a szakértő hozza meg a döntést.
Az elejétől fogva határozzunk meg néhány alapvető fogalmat. Az ökonometria az az ág, amely statisztikai módszerekkel elemzi a gazdasági és társadalmi adatokat, és méri az összefüggéseket. A regresszió egy olyan módszer, amely numerikusan modellezi egy kimeneti változó (függő változó) kapcsolatát egy vagy több magyarázó változóval (független változókkal). Az együttható az a szám, amely megmutatja, hogy átlagosan hány egységnyi változáshoz kapcsolódik egy magyarázó változó egy egységnyi változása a kimeneti változóban. A p-érték annak a valószínűsége, hogy a megfigyelt eredmény (vagy egy szélsőségesebb kimenetel) véletlenül bekövetkezik, amikor ténylegesen nincs hatás. Ezeket a fogalmakat egyenként magyarázzuk el a következő egységekben; Egyelőre tudd ezt: ezekben az AI megadja a tervezetet, a kódot és a magyarázatot, de nem hoz tudományos döntéseket.
Az alábbi táblázat összefoglalja az AI szerepét és kockázati szintjét küldetésenként:
Quest
Az AI szerepe
Kockázati szint
Aki jóváhagyja
Adatfertőtlenítő kód írása
kódgenerátor
alacsony
Maga az elemző (kódteszttel)
Diagram/tábla vázlat
vázlatgenerátor
alacsony
elemzője
Teszt/modell szintaxis emlékeztető
Referencia asszisztens
alacsony-közepes
elemzője
Együttható értelmezés tervezete
tervezet írója
közepes
közgazdász
Modell/azonosítási stratégia kiválasztása
segéd bemenet
magas
szakértő kutató
Ok-okozati összefüggés állítása
Csak vázlat, soha nem a végső szó
nagyon magas
Szakértő + szakértői értékelés
Közzététel/politikai döntés
csak bemenet
nagyon magas
Felelős vizsgáló/intézmény
Tartsa szem előtt a táblázat egyetlen sorát: a kockázat növekedésével a mesterséges intelligencia szerepe csökken, a szakértői jóváhagyás pedig nő.
Miért az „ellenőrzés” a szíve ennek az üzletnek?
A nyelvi modellek biztosnak tűnnek a válaszukban, de lehet, hogy nem biztosak benne. A szaknyelven ezt hallucinációnak hívják: ez a modell nem létező információból való kitalálása egy gördülékeny mondatban, mintha igaz lenne. Egy ökonometrikus számára ez halálos csapda. A modell pontos számot tud adni, például "A korreláció a munkanélküliség és az infláció között Türkiye-ben 2015 és 2020 között 0,62"; Ő azonban soha nem látta az Ön adatait, és ez a szám teljesen kitalált. Vagy azt mondhatja: „A fehér teszt p-értéke 0,03 volt”; miközben semmilyen tesztet nem futtatott. Meghívhat egy R függvényt olyan argumentummal, amely valójában nem létezik. Mindhármat ugyanolyan folyékonyan énekli; Az egyetlen dolog, ami elválasztja a jót a rossztól, az a tudásod és az ellenőrzési szokásod.
Az ellenőrzési fegyelem három lépésből áll:
- Újraszámítás / futtatás a saját környezetében: Az AI által R/Pythonban megadott minden számot, arányt, teszteredményt és együtthatót saját adataival számítson ki, ne az AI memóriájából. Használja az AI-t a kód megírásához, ne az eredmény megjegyezéséhez. Futtassa a kódot, és előállítja a kimenetet.
- Hivatkozás a forrásra: Támaszkodjon a tankönyvekre, a módszerekről szóló cikkekre és a hivatalos dokumentumokra a módszerszabályok, képletek és definíciók tekintetében. Erősítse meg a mesterséges intelligencia azon kijelentését, hogy "a teszt feltételezése az" egy megbízható forrással.
- Statisztikai szűrő: Szakértői szemmel tesztelje, hogy a kimenet ellentmond-e a statisztikai logikának (feltételezések, minta, hatásméret, bizonytalanság). Az "értelmes, de abszurd" eredmény elutasítása.
Figyelem: A mesterséges intelligencia által generált együttható, teszt vagy értelmezés érvényesítése nélkül elhelyezni egy cikkben, tézisben vagy szakpolitikai megjegyzésben, mint egy felülvizsgálatlan megállapítás közzététele. Csak azért, mert a kimenet gördülékeny, nem igaz; Csak azért, mert a szám biztosnak tűnik, nem valós.
Adatvédelem: a mikroadatok és a licencbe vett adatok magánvédelem alatt állnak
Az ökonometriában gyakran használják a mikroadatokat (egyéni, háztartási, vállalati vagy betegszintű egyedi rekordok). Ezen adatok többsége személyes adat, és Türkiye-ban a KVKK (személyes adatvédelmi törvény) és Európában a GDPR értelmében védett. Ezenkívül a TurkStat, a központi bankok, a paneladat-szolgáltatók és a kereskedelmi források gyakran adathasználati szerződéssel is szolgáltatnak adatokat; Ezek a megállapodások tiltják az adatok harmadik félnek történő továbbítását. Személyazonossági információkat, jövedelmet, egészségügyi vagy vállalati titkokat tartalmazó táblázat beillesztése egy nyilvános mesterséges intelligencia csevegőeszközbe a KVKK/GDPR megsértése és szerződésszegés is egyben; mert az adatok egy külső szerverre kerülnek és egyes eszközökben modellképzésben használhatók.
A szabály egyszerű: tartsa az adatokat a saját biztonságos környezetben, csak kódot és módszereket kérjen az AI-tól. Az ideális munkafolyamat a következő: kérje az AI-tól az elemzési kódot, a kódot a valós adatokkal futtatja a saját számítógépén/vállalati szerverén. Ha valóban meg kell osztania az adatokat, anonimizálja (eltávolítsa az azonosító mezőket), összesítse (átlag/számlálja, nem egyéni), és válasszon olyan eszközöket, amelyek intézményiek, adatkezelési szerződéssel rendelkeznek, és nem használják fel adatait oktatásban.
három mini tok
1. eset – Biztonságos és hatékony használat. Egy kutató először 6 órát töltött a háztartási költségvetési adatok 40 000 sorának manuális tisztításával. Az adatok megosztása nélkül csak leírta a változók nevét és szerkezetét az AI-nak, és kért egy tisztító kódot. Az AI egy R-szkriptet generált; A kutató saját környezetében lefuttatta a kódot, ellenőrizte a sorok számát és az egyes lépések összesítő statisztikáit, valamint két logikai hibát javított. Időtartam: 6 óra helyett 70 perc. Az adatok soha nem mentek ki; A felelősség a kutatóé maradt.
2. eset – Ellenőrizetlen számcsapda. „Mi a rugalmasság a GDP növekedése és a közvetlen külföldi befektetések között” – kérdezte egy végzős hallgató az AI-tól. Az AI magabiztosan "körülbelül 0,34"-et adott, annak ellenére, hogy semmilyen adathoz nem férhetett hozzá. A hallgató ezt írta az irodalmi összefoglalóba; Amikor tanácsadója a forrás felől érdeklődött, kiderült, hogy a számnak nincs alapja, és teljesen kitalált. Hiba: Konkrét statisztikákat várunk az AI-tól anélkül, hogy adatokat és erőforrásokat adnánk neki.
3. eset – Titoktartás és szerződésszegés. Egy elemző feltöltötte az Excelt, amelyet egy licenccel rendelkező vállalati paneltől kapott, és amely tartalmazza a cég nevét és forgalmát, egy nyilvánosan elérhető mesterségesintelligencia-eszközbe, és azt mondta, hogy "végezzen panelregressziót". Az adatszolgáltató szerződése megtiltotta az adatok külső rendszerekhez történő továbbítását; Az incidens megfelelőségi felülvizsgálatot indított. A helyes út az volt, hogy a cégneveket anonim kódokra cserélték, vagy nem osztottak meg adatokat, és csak a panel regressziós kódját kérték le, és futtatták azt a saját környezetben.
Gyenge felszólítás / Erős felszólítás
Gyenge felszólítás:
Elemezze az infláció és a munkanélküliség közötti kapcsolatot, és adja meg az együtthatót!
Ez az állítás téves: nem adtak adatot az MI-nek, nem világos, hogy melyik ország, melyik időszak, melyik modell. Az AI csak egy kitalált együtthatóval tud válaszolni.
Erőteljes felszólítás:
Az Ön szerepe: Ön az ökonometrikus kutatót segítő elemző asszisztens. NEM osztom meg veled az adatokat; Csak RUNNABLE R kódot szeretnék. Van éves panelem: változók ország, év, munkanélküliség, infláció (mind numerikus). Feladat: 1) írjon egy fix hatások panel regressziós kódját a munkanélküliség ~ inflációhoz (plm csomag), 2) magyarázza el a kód minden lépését egy megjegyzéssorral, 3) vegye figyelembe, hogy az együtthatót relációsnak kell értelmezni, nem OKOZAT-nak, 4) állítsa be a függvény argumentumot, amelyben nem vagy biztos; Futtatom és ellenőrzöm az eredményt a saját környezetemben.
Ebben a kérésben adatot nem osztanak meg, egyértelmű a szerepkör, a csomagok, a megjegyzések elvárása és a "gyártás" tilalma. Ön továbbra is futtatja és ellenőrzi a kimenetet.
Az alábbi táblázat összefoglalja az egymondatos szabályokat ebben a leckében:
elv
Mit jelent
Az AI egy asszisztens
A tudományos döntés és a felelősség a szakértőt illeti
Kérje a kódot, készítse el az eredményt
Az MI nem emlékszik a számra; lefuttatod és kiszámolod
adatokat tárolni
A mikro/licenszelt adatok nem hagyják el a biztonságos környezetet
ellenőrizni
Minden kiadás, kód, megjegyzés ellenőrzésre kerül; a kitalációt elutasítják
Gyakori hibák
- Konkrét statisztikákat várunk az AI-tól adatszolgáltatás nélkül. A modell nem fér hozzá az adatokhoz; Az általa megadott együttható, korreláció és p-érték hamis. Mindig kérje a kódot, és készítse el az eredményt saját maga.
- A hallucinációs funkciókra támaszkodva. Az AI olyan R/Python függvényt vagy argumentumot javasolhat, amely nem létezik. Ne fogadja el a kódot futtatás és ellenőrzés nélkül.
- Mikroadatok feltöltése nyilvános eszközre. Ez a KVKK/GDPR és az adathasználati megállapodás megsértése. Anonimizálja az adatokat, vagy egyáltalán ne ossza meg.
- A folyékonyságot összetéveszti a pontossággal. Egy jól megírt értékelés pontatlan lehet. A mondat szépsége nem bizonyíték.
- Az oksági nyelvezet ellenőrzés nélkül elfogadása. YZ gyakran azt mondja, hogy „X növeli Y”-t; míg a legtöbb regresszió csak összefüggéseket mutat. Védje meg az ok-okozati összefüggést tervezéssel.
Tipp: Amikor mesterséges intelligenciával dolgozik, tedd fel magadnak ezt a kérdést: „Ha egy játékvezető vagy auditor kéri ezt a kimenetet, meg tudom mutatni a forrást és a fiókot?” Ha a válasz nem, akkor a kimenet még nem áll készen a használatra.
Összefoglalva
Az AI valós és hatalmas felgyorsítást biztosít az ökonometriai és statisztikai munkafolyamat végrehajtási rétegében (kód, tisztítás, grafikon, vázlat); a modellválasztás, az ok-okozati összefüggés, az értelmezés, a publikálás és a szakpolitikai döntések azonban a szakértőt illetik. Három alapvető tudományág: ne emlékeztesse az AI-t a számra, kérje el a kódot, és maga hozza létre és ellenőrizze az eredményt; ne távolítsa el a mikro/licenszelt adatokat a biztonságos környezetből; statisztikai szűrő minden kimenetet. Egy ellenőrizetlen mesterséges intelligencia kimenet ugyanolyan kockázatos, mint egy át nem vizsgált lelet.
Pályázati feladat
Vegye figyelembe a saját (vagy egy példa) adatkészletét. Kérjen az AI-tól olyan R vagy Python kódot, amely leíró statisztikákat és egyszerű grafikont állít elő a változó szerkezetének egyszerű leírásával, az adatok megosztása nélkül. Futtassa a bejövő kódot a saját környezetében. Ezután készítsen egy ellenőrzőlistát: (1) hiba nélkül futott-e a kód, (2) a sorok/megfigyelések száma, ahogyan azt várta, (3) az AI melyik megjegyzésmondata használ ok-okozati nyelvezetet, és azt kell javítani. Az egyik bekezdésben írjon arról, hogy mennyi időt mentett meg a mesterséges intelligencia, és legalább egy hibát, amelyet elkapott.
ellenőrző lista
- [ ] Nem kértem az MI-t konkrét statisztikákat; Kértem a kódot, és magam készítettem az eredményt.
- [ ] Minden általa adott számot és vizsgálati eredményt a saját környezetemben újraszámoltam.
- [ ] Ellenőriztem, hogy az általa használt függvények/argumentumok valóban léteznek.
- [ ] Nem töltöttem fel nyilvános eszközre mikro/személyes/engedélyezett adatokat.
- [ ] A kauzális nyelvet tartalmazó megjegyzéseket megjelöltem és áthelyeztem a relációs nyelvre.
- [ ] Képes vagyok könyvvizsgálónak bemutatni az output forrását és elszámolását.