Enhed 11 / 11

Rapportskrivning, kommunikation og etik: Præsentation af resultater og kommunikation af grænser

Gevinster:

  • Evne til at rapportere empiriske resultater til målgruppen (akademisk, politik, ledelse) med støtte fra kunstig intelligens i et ærligt og utvetydigt sprog
  • Evne til fuldt ud at skrive konklusioner, begrænsninger og etiske udsagn (datafortrolighed, interessekonflikt, afsløring af brug af kunstig intelligens) og undgå vildledende præsentation
  • Kunstig intelligenss evne til at genkende udkast til rapporter, der producerer overdrevet, ensidigt eller kausalt sprog, og opretholde dette ansvar for den endelige tekst og påstande påhviler forskeren.

Modul eksamen

1. En forsker spørger 'Hvad er korrelationskoefficienten mellem arbejdsløshed og inflation i Türkiye mellem 2015 og 2020?' uden at give nogen data til kunstig intelligens. spørger han og skriver tallet 0,62 direkte ind i sin artikel. Hvad er den grundlæggende fejl i denne tilgang?

  • A) Forventer konkrete statistikker fra kunstig intelligens uden at give verificerede data; ✔ Brug af et nummer, der kan være opdigtet uden at bekræfte det
  • B) Korrelationskoefficienten bør aldrig bruges i en artikel.
  • C) Der kan ikke beregnes sammenhæng mellem arbejdsløshed og inflation
  • D) Kunstig intelligens kan først få adgang til data efter 2020

Forklaring: AI-sprogmodellen kan ikke producere statistik uden at få adgang til datasættet; Det tal, han giver, er højst sandsynligt en hallucination (fremstillet). Koefficienter, forhold og testresultater bør beregnes ud fra forskerens egne verificerede data, ikke taget fra modellens hukommelse.

2. Hvad betyder det, at manglende data 'ikke mangler tilfældigt' (MNAR), og hvorfor er det vigtigt?

  • A) Manglen skyldes selve den uobserverede værdi; Derfor kan simpel opgave skabe bias ✔
  • B) Data forsvinder helt tilfældigt og skaber ingen bias.
  • C) Manglende data skal altid løses ved at slette rækken.
  • D) Manglende data påvirker ikke analysen på nogen måde.

Forklaring: I tilfælde af MNAR (Missing Not At Random) afhænger selve manglen af ​​størrelsen af ​​den uobserverede værdi (f.eks. rapporterer højtlønnede ikke deres indkomst). I dette tilfælde giver simpel sletning eller gennemsnitlig tildeling skæve resultater; Mekanismen bag manglen skal modelleres. Den tildelingsmetode, der foreslås af kunstig intelligens, bør ikke anvendes blindt uden at kende denne mekanisme.

3. En analytiker får AI'en til at lave et søjlediagram, og AI'en starter y-aksen ved 40 i stedet for nul. Den faktiske forskel på 2 % mellem de to grupper ser enorm ud på grafen. Hvad er den rigtige tilgang?

  • A) Start af aksen fra bunden eller ændring af diagramtypen; ✔ for at vise forskellens sande størrelse uden at vildlede
  • B) Brug af diagrammet som det er, fordi AI træffer det bedste valg
  • C) Start af aksen ved 45 for at gøre forskellen endnu større
  • D) Brug aldrig visuals i stedet for søjlediagrammer

Forklaring: I et søjlediagram vildleder den stiplede akse (y-aksen, der ikke starter fra nul) ved at overdrive små forskelle. I ærlig visualisering bør aksen for søjlediagrammer starte fra nul, eller forskellen skal bevidst angives klart. Det er analytikerens ansvar at verificere billedet og rette det om nødvendigt.

4. Hvordan bliver det faktum, at en koefficient er 'signifikant' (p<0,05) i lineær regression ofte misrepræsenteret i fortolkningen af ​​kunstig intelligens?

  • A) Overdreven præsentation af betydning, da effekten er stor og vigtig eller kausalitet er etableret ✔
  • B) Signifikans indikerer altid, at effekten er lille
  • C) p<0,05 beviser, at koefficienten er helt korrekt
  • D) Signifikante koefficienter bør aldrig rapporteres.

Forklaring: Statistisk signifikans relaterer sig til styrken af ​​evidens for, at effekten er forskellig fra nul; Det betyder ikke, at effekten er stor, vigtig eller kausal. AI præsenterer ofte ordet 'signifikant' som 'betydelig/stærk påvirkning'. Forskeren bør også evaluere effektstørrelsen, konfidensintervallet og konteksten.

5. Hvad refererer begrebet 'p-hacking' til, og hvorfor kan AI gøre det nemmere?

  • A) Prøver flere analyser, indtil det giver mening; AI gør dette meget hurtigt, hvilket øger risikoen ✔
  • B) Analyse af data én gang og med en forudbestemt plan
  • C) udvidelse af prøven for at øge p-værdien
  • D) Indberetning af kun beskrivende statistik

Forklaring: p-hacking er at prøve forskellige variabler, subsamples, transformationer eller modeller, indtil et meningsfuldt resultat fremkommer; dette giver falske fund baseret på tilfældigheder. Da AI kan prøve snesevis af modelvarianter på få sekunder, kan det fremskynde p-hacking uden en ærlig plan. Forsvar; præregistrering, fast analyseplan og multiple sammenligningskorrektion.

6. Hvorfor kan det være misvisende at finde en høj R-kvadratregression mellem to ikke-stationære (enhedsrod) tidsserier?

  • A) Falsk regression kan forekomme på grund af almindelig tendens; ✔ Højt R-kvadrat output uden reelt forhold
  • B) En høj R-kvadrat viser altid en stærk årsagssammenhæng.
  • C) Ikke-stationære serier kan slet ikke indgå i regression.
  • D) R-kvadrat kan ikke beregnes i tidsserier

Forklaring: Hvis der ikke er et fælles kointegrationsforhold mellem ikke-stationære serier, kan falsk regression kun producere høj R-kvadrat og signifikant koefficient på grund af fælles tendens; hvorimod der ikke er noget reelt forhold. Derfor bør stationaritets- og enhedsrodtest udføres først, og om nødvendigt bør der tages forskelle, eller kointegration bør testes.

7. Hvilken grundlæggende antagelse er baseret på gyldigheden af ​​Difference-in-Differences-designet?

  • A) Parallelle tendenser antagelse: grupper ville følge samme retning, hvis der ikke var nogen intervention ✔
  • B) Behandlings- og kontrolgrupper er nøjagtig de samme i begyndelsen
  • C) Normalfordeling af prøven
  • D) Variabler indeholder ingen manglende data

Forklaring: DiD antager, at udfaldsvariablen for behandlings- og kontrolgrupperne i fravær af interventionen ville have forløbet parallelt over tid (antagelse af parallelle tendenser). Hvis denne forudsætning ikke er opfyldt, er estimatet skævt. AI kan producere DiD-koden, men det er forskerens opgave at forsvare og teste parallelle tendenser.

8. Hvilket af følgende er obligatorisk praksis for en reproducerbar analyse?

  • A) Fastsættelse af frøet i tilfældige trin, registrering af pakkeversioner og kode ✔
  • B) Kopier resultaterne manuelt til regnearket og slet koden
  • C) Det er normalt at se forskellige resultater i hver kørsel.
  • D) Beholder kun den endelige grafik, ikke deler data og kode

Beskrivelse: Reproducerbarhed; Det samme resultat kan opnås igen med de samme data og kode. At rette frøet i tilfældige trin, gemme pakkeversioner og udføre koden i dokumentet (læserær programmering) er hjørnestenene i dette. Kopiering af resultater manuelt eller klikbaserede, ikke-loggende trin forringer reproducerbarheden.

9. Hvad forvrænger heteroskedasticitet en lineær regression, og hvad er dens almindelige løsning?

  • A) Det forvrænger standardfejl; løsningen er robuste standardfejl eller passende transformation ✔
  • B) Det ugyldiggør fuldstændigt koefficientestimaterne og har ingen løsning
  • C) Reducerer altid R-kvadrat til nul
  • D) Opstår kun, hvis prøven er meget lille og kan ignoreres

Forklaring: Heteroskedasticitet efterlader koefficientestimater upartiske, men fejlberegner standardfejl; Dette gør p-værdier og konfidensintervaller upålidelige. En almindelig løsning er at bruge robuste/HC-standardfejl eller passende konvertering. Det skal verificeres, at løsningen foreslået af AI faktisk løser problemet i stedet for at skjule det.

10. En forsker uploader mikrodata, der indeholder identifikationsoplysninger og indkomst på patientniveau, til et offentligt AI-chatværktøj og siger "gør regression". Hvad er hovedproblemet med denne adfærd?

  • A) Upload af personlige/licenserede data til et eksternt værktøj udgør et brud på fortrolighed og kontrakt ✔
  • B) Regression kan slet ikke ske ved kunstig intelligens
  • C) Mikrodata er slet ikke egnet til regression
  • D) AI fejlberegner altid regressionen

Forklaring: Personlige/særlige data såsom identitet og indkomst er beskyttet under KVKK/GDPR og de fleste databrugsaftaler; At uploade dem til en ekstern enhed, der kan gemme data, er en overtrædelse. Den rigtige måde; Anonymisering af data, brug af lokale/institutionelle sikre værktøjer eller blot at anmode om kode fra kunstig intelligens og køre koden i sit eget miljø.

11. Hvad observeres, når multikollineariteten er høj?

  • A) Koefficienter bliver ustabile og standardfejl bliver oppustet; Individuelle koefficienter kan vise sig at være meningsløse ✔
  • B) R-kvadrat falder altid til nul
  • C) Koefficientestimater bliver hele tiden mere præcise
  • D) Skalaen af den afhængige variabel ændres

Forklaring: Ved høj multikolinearitet er uafhængige variable stærkt korrelerede med hinanden; Koefficientestimater bliver ustabile, standardfejl bliver oppustede, og individuelle koefficienter kan vise sig at være ubetydelige, mens den overordnede model kan være signifikant. Det diagnosticeres efter kriterier som VIF. Kunstig intelligens kan foreslå variabel eliminering, men det er op til forskeren at beslutte, hvilken variabel der skal forblive teoretisk.

12. Hvad er statistisk magt, og hvad er risikoen ved en lav-effekt undersøgelse?

  • A) Mulighed for at detektere den eksisterende effekt; lav effekt går glip af sande effekter og gør resultater upålidelige ✔
  • B) sandsynlighed for at reducere p-værdien; lavere effekt giver altid mere pålidelige resultater
  • C) En konstant værdi uafhængig af stikprøvestørrelsen
  • D) Et begreb, der kun er gyldigt, når kunstig intelligens bruges

Forklaring: Effekt er sandsynligheden for at detektere en effekt, der faktisk eksisterer (1 minus type II fejl). Lav-powered undersøgelser kan gå glip af sande effekter; Derudover kan de få signifikante resultater have en overdreven effektstørrelse ('vinderens forbandelse'), og antallet af falske positive stiger. Derfor er effekt/prøveberegning vigtig før analyse.

13. Hvorfor er det etisk nødvendigt at oplyse brugen af ​​kunstig intelligens i en artikel?

  • A) For gennemsigtighed og ansvarlighed; ✔ læsere og referenter kan evaluere processen, og ansvaret forbliver hos forfatteren
  • B) Brugen af kunstig intelligens gør automatisk resultaterne ugyldige
  • C) Anmodet af magasiner kun til reklameformål
  • D) Overførsel af ophavsretten til forklaringen til kunstig intelligens

Offentliggørelse: Gennemsigtighed er nødvendig, så læseren og anmelderne kan vurdere, hvordan resultaterne blev produceret; Mange tidsskrifter og institutioner kræver nu offentliggørelse af AI-brug. Derudover, da kunstig intelligens kan give fejl/hallucinationer, er det et spørgsmål om ærlighed at sige, at ansvaret forbliver hos forfatteren, og hvilke trin der blev revideret.

14. Hvad kræver "udelukkelsesrestriktionen" i instrumentvariabelmetoden (IV)?

  • A) Værktøjet påvirker kun resultatet gennem den interne variabel, der er ingen anden direkte vej ✔
  • B) Instrumentet har ingen sammenhæng med udfaldsvariablen.
  • C) Instrumentet er ikke relateret til den endogene variabel.
  • D) Middel er altid en binær (0/1) variabel

Forklaring: Eksklusionsbegrænsningen kræver, at instrumentet kun påvirker udfaldsvariablen gennem den endogene forklaringsvariabel og ikke gennem andre direkte midler eller uobserverede faktorer. Denne antagelse kan ikke testes fuldt ud ud fra data; Det forsvares på teoretiske og institutionelle grunde. AI kan skrive IV-koden, men det er forskerens opgave at forsvare værktøjets gyldighed.

15. Hvad betyder 'Garden of forking paths'-problemet i fleksible analyser uden forhåndsregistrering?

  • A) For mange rimelige analysevalg, der er truffet baseret på dataene, øger antallet af falske positive, endda utilsigtet ✔
  • B) Analysemetoder skal være enkeltstående og obligatoriske
  • C) Et problem, der kun opstår, når der forekommer bevidst snyd.
  • D) En situation, der forsvinder spontant, efterhånden som prøven vokser

Forklaring: Efter at have set dataene kan forskeren træffe mange rimelige valg om, hvilken variabel, undergruppe, transformation eller tærskel der skal bruges. Selvom der ikke er en enkelt 'tilsigtet p-hacking', øger denne fleksibilitet den falske positive rate, fordi den signifikante er effektivt valgt fra et stort antal analyser. Forhåndsregistrering og en fast analyseplan begrænser denne fleksibilitet.