Gevinster:
- At kunne skelne, hvor i den empiriske arbejdsgang (datarensning, kode, visualisering, udkastfortolkning) kunstig intelligens sparer realtid, og hvor beslutninger som modelvalg, kausalitetspåstand og publiceringsbeslutning overlades til eksperten, alt efter opgavens risikoniveau.
- Evne til at anvende en disciplin, der verificerer hver kunstig intelligens-output (antal, koefficient, kode, kommentar) gennem trinnene med genberegning, linkning til kilden og statistisk filtrering.
- Evne til sikkert at behandle mikrodata og fortrolige/licenserede datasæt inden for rammerne af KVKK/GDPR og databrugsaftaler og tilegne sig en vane med at vælge passende værktøjer.
De samme spørgsmål går igen hver dag på en økonometricians eller anvendte statistikers skrivebord: Er dette datasæt pålideligt; Hvad skal man gøre med disse manglende værdier? Hvad siger koefficienten for denne regression egentlig? Er denne sammenhæng kausal eller blot korrelationel? Fordi denne p-værdi er signifikant, kan jeg så skrive den i artiklen eller politikoversigten? Nogle af disse spørgsmål er gentagne, kodeintensive og tidskrævende: rensning af data, plotning af den samme graf ti gange, fejlretning af R- eller Python-kode, string af resultaterne i en tabel. Andre bestemmer direkte gyldigheden af en konstatering, ærligheden af en publikation eller nøjagtigheden af en politisk beslutning.
Kunstig intelligens (AI kort fortalt, AI - computersystemer, der kan producere tekst og kode som mennesker, genkende mønstre, opsummere data og skrive kommentarer; den mest brugte form i dag er store sprogmodeller, det vil sige systemer, der trænes på stor tekst og bygger sætninger ved at forudsige det næste ord) sidder lige i midten af denne tabel. Når den bruges korrekt, reducerer den timers datarensningskode til minutter, minder dig om syntaksen i en kompleks statistisk test eller udarbejder fortolkningen af en koefficient. Når det bruges forkert, præsenterer det et tilsyneladende sikkert, men fuldstændigt opdigtet tal, en falsk betydning eller en ikke-årsagssammenhæng som et "fund".
Denne første enhed er ikke en softwareintroduktion. Dens formål er at afklare, hvor AI skal placeres i din empiriske arbejdsgang, og hvor den aldrig skal placeres. Økonometri er både et "metodekritisk" og indirekte "beslutningskritisk" felt: koefficienten for en model, du bygger, kan være input til en centralbanks rentebeslutning, en regulators politikændring eller en virksomheds millioninvesteringer. Lad os fastlægge det grundlæggende princip fra begyndelsen: Kunstig intelligens er en analyseassistent, ikke en forsker. Ansvaret for og endelig godkendelse af modelvalg, identifikationsstrategi, påstand om årsagssammenhæng, offentliggørelse og politiske beslutninger påhviler den kompetente ekspert.
Lag af den empiriske arbejdsgang og stedet for AI
Det er nyttigt at opdele en empirisk undersøgelse i tre lag. Eksekveringslaget er det daglige tekniske arbejde: datarensningskode, graftegning, tabelformatering, syntaksfejlretning. Metodelaget er den analytiske beslutning: hvilken model, hvilken identifikationsstrategi, hvilken test, hvilken antagelseskontrol. Fortolknings- og beslutningslaget er meningen med resultaterne: hvad koefficienten siger, er det kausalt, hvad betyder det for politik, hvis det skal offentliggøres. AI berører alle tre lag, men med forskellig autoritet i hvert. På eksekveringslaget udarbejder og genererer AI hurtigt kode; På fortolknings- og beslutningslaget gives der kun input, og eksperten træffer beslutningen.
Lad os definere et par grundlæggende udtryk fra begyndelsen. Econometrics er den branche, der analyserer økonomiske og sociale data med statistiske metoder og måler sammenhænge. Regression er en metode, der numerisk modellerer sammenhængen mellem en udfaldsvariabel (afhængig variabel) med en eller flere forklarende variable (uafhængige variable). Koefficienten er det tal, der viser, hvor mange ændringsenheder i gennemsnit en ændring på én enhed i en forklarende variabel er forbundet med i udfaldsvariablen. P-værdien er sandsynligheden for, at det observerede udfald (eller et mere ekstremt udfald) ville forekomme tilfældigt, når der faktisk ikke eksisterer nogen effekt. Vi vil forklare disse begreber en efter en i de følgende enheder; For nu, ved dette: I alle disse giver AI dig planen, koden og forklaringen, men den træffer ikke videnskabelige beslutninger.
Følgende tabel opsummerer rollen og risikoniveauet for AI efter mission:
Quest
AI's rolle
Risikoniveau
Hvem godkender
Skrivning af datasaneringskode
kode generator
lav
Analytiker selv (med kodetest)
Diagram/tabel udkast
skitse generator
lav
analytiker
Test/model syntaks påmindelse
Referenceassistent
lav-middel
analytiker
Udkast til koefficientfortolkning
udkast til forfatter
medium
økonometr
Valg af model/identifikationsstrategi
hjælpeindgang
høj
ekspert forsker
Årsagspåstand
Bare et udkast, aldrig det sidste ord
meget høj
Ekspert + peer review
Offentliggørelse/politisk beslutning
kun input
meget høj
Ansvarlig efterforsker/institution
Husk den ene linje i denne tabel: Efterhånden som risikoen stiger, skrumper AI's rolle, og ekspertgodkendelsen vokser.
Hvorfor "verifikation" er hjertet i denne forretning
Sprogmodeller virker sikre på deres svar, men de er måske ikke sikre. På fagsprog kaldes dette hallucination: Det er modellens fremstilling af ikke-eksisterende information i en flydende sætning, ligesom om den var sand. For en økonometiker er dette en dødbringende fælde. Modellen kan give dig et nøjagtigt tal såsom "Korrelationen mellem arbejdsløshed og inflation i Türkiye mellem 2015-2020 er 0,62"; Han har dog aldrig set dine data, og dette tal er fuldstændig opfundet. Eller det kan sige, "Hvid test p-værdi var 0,03"; hvorimod den ikke kørte nogen test. Den kan kalde en R-funktion med et argument, der faktisk ikke eksisterer. Han synger alle tre med samme flydende; Det eneste, der adskiller rigtigt fra forkert, er din viden og din vane med at verificere.
Verifikationsdisciplinen består af tre trin:
- Genberegn / kør i dit eget miljø: Beregn hvert tal, forhold, testresultat og koefficient givet af AI'en i R/Python med dine egne data, ikke fra AI'ens hukommelse. Brug AI til at skrive koden, ikke til at huske resultatet. Kør koden, du producerer outputtet.
- Link til kilde: Stol på lærebøger, metodeartikler og officielle dokumenter for metoderegler, formler og definitioner. Bekræft AI's erklæring "antagelsen af denne test er" med en pålidelig kilde.
- Statistisk filter: Test med ekspertøjne, om outputtet modsiger statistisk logik (antagelser, stikprøve, effektstørrelse, usikkerhed). Afvis et "meningsfuldt, men absurd" resultat.
Forsigtig: At sætte en AI-genereret koefficient, test eller fortolkning i en artikel, afhandling eller politiknote uden at validere den, er som at offentliggøre en ugennemgået konstatering. Bare fordi outputtet er flydende, er det ikke sandt; Bare fordi tallet virker sikkert, er det ikke rigtigt.
Fortrolighed: Mikrodata og licenserede data er beskyttet privat
Mikrodata (enkelte registreringer på individ-, husstands-, virksomheds- eller patientniveau) bruges ofte i økonometri. De fleste af disse data er personlige data og er beskyttet under KVKK (Personal Data Protection Law) i Türkiye og GDPR i Europa. Derudover leverer TurkStat, centralbanker, paneldataudbydere og kommercielle kilder ofte data med en databrugsaftale; Disse aftaler forbyder overførsel af data til tredjeparter. At indsætte en tabel med identitetsoplysninger, indkomst, helbred eller virksomhedshemmeligheder i et offentligt AI-chatværktøj er både en KVKK/GDPR-overtrædelse og en kontraktovertrædelse; fordi dataene går til en ekstern server og kan bruges i modeltræning i nogle værktøjer.
Reglen er enkel: Opbevar dataene i deres eget sikre miljø, spørg kun AI om kode og metoder. Den ideelle arbejdsgang er dette: spørg AI om analysekoden, du kører koden med de rigtige data på din egen computer/virksomhedsserver. Hvis du virkelig skal dele data, så anonymiser (fjern ID-felter), aggregér (gennemsnit/tæl frem for individuelt), og vælg værktøjer, der er institutionelle, har en databehandleraftale og ikke bruger dine data i uddannelse.
tre minisager
Case 1 — Sikker og effektiv brug. En forsker brugte først 6 timer på manuelt at rense 40.000 rækker af husstandsbudgetdata. Uden overhovedet at dele dataene beskrev han blot variabelnavnene og strukturen til AI og bad om en rensekode. AI’en genererede et R-script; Forskeren kørte koden i sit eget miljø, tjekkede antallet af linjer og opsummerende statistik for hvert trin og rettede to logiske fejl. Varighed: 70 minutter i stedet for 6 timer. Dataene gik aldrig ud; Ansvaret forblev hos forskeren.
Tilfælde 2 — Uverificeret talfælde. "Hvad er elasticiteten mellem BNP-vækst og udenlandske direkte investeringer," spurgte en kandidatstuderende AI. AI gav selvsikkert et tal på "omkring 0,34", selvom den ikke havde adgang til nogen data. Det skrev eleven i litteraturresuméet; Da hans rådgiver spurgte til kilden, viste det sig, at tallet ikke havde noget grundlag og var fuldstændig opdigtet. Fejl: Forventer konkret statistik fra AI uden at give data og ressourcer til det.
Sag 3 — Fortrolighed og kontraktbrud. En analytiker uploadede Excel, som han modtog fra et licenseret virksomhedspanel, indeholdende firmanavnet og omsætningen, til et offentligt tilgængeligt AI-værktøj og sagde "gør panelregression." Dataudbyderens kontrakt forbød overførsel af data til tredjepartssystemer; Hændelsen førte til en overholdelsesgennemgang. Den rigtige måde var at erstatte virksomhedsnavnene med anonyme koder eller at dele ingen data og kun anmode om panelregressionskoden og køre den i sit eget miljø.
Svag prompt / Stærk prompt
Svag prompt:
Analyser sammenhængen mellem inflation og arbejdsløshed og angiv koefficienten.
Denne påstand er forkert: Ingen data blev givet til AI, det er ikke klart hvilket land, hvilken periode, hvilken model. AI kan kun svare med en sammensat koefficient.
Kraftig prompt:
Din rolle: Du er analyseassistent, der assisterer økonometriforskeren. Jeg deler IKKE dataene med dig; Jeg vil bare have RUNNABLE R-kode. Jeg har et årligt panel: variabler land, år, arbejdsløshed, inflation (alle numeriske). Opgave: 1) skriv en fast effektpanel regressionskode for arbejdsløshed ~ inflation (plm-pakke), 2) forklar hvert trin i koden med en kommentarlinje, 3) bemærk at koefficienten skal tolkes som relationel, ikke CAUSAL, 4) opstil funktionsargumentet, som du ikke er sikker på; Jeg vil køre og verificere resultatet i mit eget miljø.
I denne anmodning deles ingen data, rollen, pakker, forventning om kommentarer og forbuddet mod "fabrikation" er tydelige. Du kører stadig og verificerer outputtet selv.
Følgende tabel opsummerer reglerne med én sætning i denne lektion:
princip
Hvad betyder det
AI er en assistent
Den videnskabelige beslutning og ansvaret tilhører eksperten
Anmod om koden, frembring resultatet
AI'en husker ikke nummeret; du kører det og beregner
opbevare data
Mikro/licenserede data forlader ikke det sikre miljø
verificere
Hvert problem, kode, kommentar kontrolleres; fabrikation afvises
Almindelige fejl
- Forventer konkret statistik fra AI uden at give data. Modellen kan ikke få adgang til dataene; Koefficienten, korrelationen og p-værdien den giver er falske. Bed altid om koden og lav selv resultatet.
- Stoler på hallucinatoriske funktioner. AI kan foreslå en R/Python-funktion eller et argument, der ikke eksisterer. Accepter ikke koden uden at køre og bekræfte den.
- Uploader mikrodata til offentligt værktøj. Det er en overtrædelse af KVKK/GDPR og databrugsaftale. Anonymiser data eller del dem slet ikke.
- Forkert flydende for nøjagtighed. En velskrevet anmeldelse kan være unøjagtig. Det smukke ved sætningen er ikke bevis.
- Accepter kausalt sprog uden kontrol. YZ siger ofte "X øger Y"; hvorimod de fleste regressioner kun viser relationer. Forsvar årsagspåstanden med design.
Tip: Når du arbejder med kunstig intelligens, skal du stille dig selv dette spørgsmål: "Hvis en dommer eller revisor beder om dette output, kan jeg så vise kilden og kontoen?" Hvis svaret er nej, er outputtet endnu ikke klar til brug.
Sammenfattende
AI giver en reel og massiv acceleration i eksekveringslaget (kode, oprydning, graf, udkast) af økonometri og statistik workflow; modelvalg, kausalitet, fortolkning, offentliggørelse og politiske beslutninger tilhører dog eksperten. Tre grundlæggende discipliner: minde ikke AI’en om nummeret, spørg efter koden og generér og verificere resultatet selv; fjern ikke mikro-/licenserede data fra det sikre miljø; statistisk filter hver udgang. Et ubekræftet AI-output er lige så risikabelt som et ikke-gennemgået fund.
Ansøgningsopgave
Overvej dit eget (eller et eksempel) datasæt. Spørg AI for R- eller Python-kode, der producerer beskrivende statistik og en simpel graf ved blot at beskrive den variable struktur uden at dele dataene. Kør den indkommende kode i dit eget miljø. Hold derefter en tjekliste: (1) kørte koden uden fejl, (2) er antallet af linjer/observationer, som du forventede, (3) hvilken af AI's kommentarsætninger bruger kausalt sprog og bør rettes. I et afsnit skal du skrive om den tid, AI reddede dig og mindst én fejl, du fangede.
tjekliste
- [ ] Jeg fik ikke AI'en til at bede om konkrete statistikker; Jeg anmodede om koden og producerede selv resultatet.
- [ ] Jeg genberegnede hvert tal og hvert testresultat, det gav i mit eget miljø.
- [ ] Jeg bekræftede, at de funktioner/argumenter, den bruger, faktisk eksisterer.
- [ ] Jeg uploadede ikke mikro/personlige/licenserede data til et offentligt værktøj.
- [ ] Jeg markerede kommentarerne indeholdende kausalt sprog og flyttede dem til relationelt sprog.
- [ ] Jeg er i stand til at vise kilden og regnskabet for outputtet til en revisor.