Üksus 11 / 11

Aruannete kirjutamine, suhtlemine ja eetika: tulemuste esitamine ja piiride teavitamine

Kasu:

  • Võimalus teatada tehisintellekti toel empiirilistest leidudest sihtrühmale (akadeemiline, poliitika, juhtkond) ausas ja ühemõttelises keeles
  • Oskus kirjutada täielikult järeldusi, piiranguid ja eetilisi väiteid (andmete konfidentsiaalsus, huvide konflikt, tehisintellekti kasutamise avalikustamine) ning vältida eksitavat esitust
  • Tehisintellekti võime ära tunda aruannete kavandeid, mis toovad esile liialdatud, ühekülgse või põhjusliku keelekasutuse, ning säilitada vastutus lõpliku teksti ja väidete eest lasub uurijal.

Mooduli eksam

1. Teadlane küsib: "Milline on korrelatsioonikordaja töötuse ja inflatsiooni vahel Türkiye linnas aastatel 2015–2020?" tehisintellektile andmeid andmata. küsib ta ja kirjutab numbri 0,62 otse oma artiklisse. Mis on selle lähenemisviisi põhiline viga?

  • A) Ootame tehisintellektilt konkreetset statistikat ilma kontrollitud andmeid esitamata; ✔ Kasutades numbrit, mis võib olla välja mõeldud ilma seda kinnitamata
  • B) Korrelatsioonikordajat ei tohi kunagi artiklis kasutada.
  • C) Tööpuuduse ja inflatsiooni vahelist seost ei saa arvutada
  • D) Tehisintellekt pääseb andmetele juurde alles pärast 2020. aastat

Selgitus: AI keelemudel ei saa statistikat toota ilma andmestikule juurdepääsuta; Tema antud number on suure tõenäosusega hallutsinatsioon (fabritseeritud). Koefitsiendid, suhted ja testitulemused tuleks arvutada uurija enda kontrollitud andmete põhjal, mitte võtta mudeli mälust.

2. Mida tähendab puuduvate andmete olek "ei puudu juhuslikult" (MNAR) ja miks see oluline on?

  • A) Puudus on tingitud jälgimata väärtusest endast; Seetõttu võib lihtne ülesanne tekitada eelarvamusi ✔
  • B) Andmed kaovad täiesti juhuslikult ega tekita kallutamist.
  • C) Puuduvad andmed tuleks alati lahendada rea ​​kustutamisega.
  • D) Puuduvad andmed ei mõjuta analüüsi kuidagi.

Selgitus: MNAR (Missing Not At Random) puhul sõltub puudujääk ise jälgimata väärtuse suurusest (nt kõrgepalgalised ei teata oma sissetulekust). Sel juhul annab lihtne kustutamine või keskmine määramine kallutatud tulemusi; Puuduse tekkemehhanism tuleb modelleerida. Tehisintellekti soovitatud määramismeetodit ei tohiks pimesi, ilma seda mehhanismi tundmata rakendada.

3. Analüütik laseb AI-l koostada tulpdiagrammi ja tehisintellekt alustab y-telge nulli asemel 40-st. Tegelik 2% erinevus kahe rühma vahel paistab graafikul tohutu. Milline on õige lähenemine?

  • A) telje alustamine nullist või diagrammi tüübi muutmine; ✔ et näidata erinevuse tegelikku suurust ilma eksitamiseta
  • B) Diagrammi kasutamine sellisel kujul, kuna AI teeb parima valiku
  • C) Alustades telge 45-st, et muuta erinevus veelgi suuremaks
  • D) Ärge kunagi kasutage tulpdiagrammide asemel visuaale

Selgitus: tulpdiagrammis eksitab katkendtelg (y-telg, mis ei alga nullist) väikeste erinevustega liialdades. Ausal visualiseerimisel peaks tulpdiagrammide telg algama nullist või erinevus teadlikult selgelt välja öeldud. Analüütiku kohustus on pilti kontrollida ja vajadusel parandada.

4. Kuidas on tehisintellekti tõlgendamisel sageli valesti esitatud tõsiasi, et koefitsient on lineaarses regressioonis 'oluline' (p<0,05)?

  • A) Olulisuse liialdatud esitus, kuna mõju on suur ja oluline või põhjuslik seos on tuvastatud ✔
  • B) Olulisus näitab alati, et mõju on väike
  • C) p<0,05 tõestab, et koefitsient on absoluutselt õige
  • D) Märkimisväärseid koefitsiente ei tohi kunagi esitada.

Selgitus: Statistiline olulisus on seotud tõendite tugevusega, et mõju erineb nullist; See ei tähenda, et mõju on suur, oluline või põhjuslik. AI esitab sageli sõna "märkimisväärne" kui "märkimisväärne/tugev mõju". Uurija peaks hindama ka efekti suurust, usaldusvahemikku ja konteksti.

5. Millele viitab mõiste "p-häkkimine" ja miks saab tehisintellekt seda lihtsamaks teha?

  • A) mitme analüüsi proovimine, kuni see on mõttekas; AI teeb seda väga kiiresti, suurendades riski ✔
  • B) Andmete analüüsimine üks kord ja etteantud plaaniga
  • C) valimi laiendamine p-väärtuse suurendamiseks
  • D) Ainult kirjeldava statistika esitamine

Selgitus: p-häkkimine proovib erinevaid muutujaid, alamvalimi, teisendusi või mudeleid, kuni saadakse tähendusrikas tulemus; see toob kaasa võltstulemused, mis põhinevad juhusel. Kuna AI saab sekunditega proovida kümneid mudelivariante, võib see p-häkkimist kiirendada ilma ausa plaanita. Kaitse; eelregistreerimine, fikseeritud analüüsiplaan ja mitmekordse võrdluse korrigeerimine.

6. Miks võib kõrge R-ruudu regressiooni leidmine kahe mittestatsionaarse (ühikjuur) aegrea vahel olla eksitav?

  • A) Tavalise suundumuse tõttu võib tekkida vale regressioon; ✔ Kõrge R-ruudu väljund ilma tegeliku seoseta
  • B) Kõrge R-ruut tõestab alati tugevat põhjuslikku seost.
  • C) Mittestatsionaarseid seeriaid ei saa üldse regressiooni sisestada.
  • D) R-ruutu ei saa aegridades arvutada

Selgitus: kui mittestatsionaarsete jadate vahel puudub ühine kointegratsioonisuhe, võib vale regressioon anda kõrge R-ruudu ja olulise koefitsiendi ainult ühise trendi tõttu; samas kui tõelist suhet pole. Seetõttu tuleks esmalt teha statsionaarsuse ja ühikjuure testid ning vajadusel võtta erinevused või testida kointegratsiooni.

7. Milline põhieeldus põhineb Difference-in-Differences kavandi kehtivusel?

  • A) Paralleelsete trendide eeldus: rühmad järgiksid sama suunda, kui sekkumist ei toimuks ✔
  • B) Ravi- ja kontrollrühmad on alguses täpselt samad
  • C) Proovi normaaljaotus
  • D) Muutujad ei sisalda puuduvaid andmeid

Selgitus: DiD eeldab, et sekkumise puudumisel oleks ravi- ja kontrollrühmade tulemuste muutuja aja jooksul kulgenud paralleelselt (paralleelsete suundumuste eeldus). Kui see eeldus ei ole täidetud, on hinnang kallutatud. AI suudab toota DiD-koodi, kuid teadlase ülesanne on kaitsta ja katsetada paralleelseid suundumusi.

8. Milline järgmistest on reprodutseeritava analüüsi jaoks kohustuslik?

  • A) Seemne fikseerimine juhuslike sammudega, pakendi versioonide ja koodi salvestamine ✔
  • B) Kopeerige tulemused käsitsi arvutustabelisse ja kustutage kood
  • C) On normaalne, et igal jooksul näete erinevaid tulemusi.
  • D) Ainult lõpliku graafika säilitamine, andmete ja koodi mitte jagamine

Kirjeldus: Reprodutseeritavus; Sama tulemuse saab uuesti samade andmete ja koodiga. Selle nurgakivideks on seemne fikseerimine juhuslike sammude kaupa, paketiversioonide salvestamine ja koodi käivitamine dokumendis (kirjaoskaja programmeerimine). Tulemuste käsitsi kopeerimine või klõpsupõhine mittelogimisetapid kahjustab reprodutseeritavust.

9. Mida moonutab heteroskedastilisus lineaarset regressiooni ja milline on selle levinud lahendus?

  • A) See moonutab standardvigu; lahendus on robustsed standardvead või sobiv teisendus ✔
  • B) See muudab koefitsiendi hinnangud täielikult kehtetuks ja sellel pole lahendust
  • C) Vähendab R-ruudu alati nulliks
  • D) Esineb ainult siis, kui valim on väga väike ja seda saab ignoreerida

Selgitus: Heteroskedastilisus jätab koefitsiendi hinnangud erapooletuks, kuid arvutab standardvead valesti; See muudab p-väärtused ja usaldusvahemikud ebausaldusväärseks. Levinud lahendus on kasutada robustseid/HC standardvigu või sobivat teisendust. Tuleb kontrollida, et tehisintellekti pakutud lahendus lahendab probleemi, mitte ei varja seda.

10. Teadlane laadib avalikku tehisintellekti vestlustööriista üles mikroandmed, mis sisaldavad patsiendi taseme tuvastamise teavet ja sissetulekuid, ning ütleb „tee regressioon”. Mis on selle käitumise peamine probleem?

  • A) Isikuandmete/litsentsitud andmete üleslaadimine välisele tööriistale kujutab endast konfidentsiaalsuse ja lepingu rikkumist ✔
  • B) Regressiooni ei saa tehisintellekt üldse teha
  • C) Mikroandmed ei sobi regressiooniks üldse
  • D) AI arvutab regressiooni alati valesti

Selgitus: Isiku-/eriandmed, nagu identiteet ja sissetulek, on kaitstud KVKK/GDPR ja enamiku andmekasutuslepingute alusel; Nende üleslaadimine välisseadmesse, mis suudab andmeid salvestada, on rikkumine. Õige tee; Andmete anonüümseks muutmine, kohalike/institutsiooniliste turvaliste tööriistade kasutamine või lihtsalt tehisintellektilt koodi küsimine ja koodi käivitamine oma keskkonnas.

11. Mida täheldatakse, kui multikollineaarsus on kõrge?

  • A) Koefitsiendid muutuvad ebastabiilseks ja standardvead suurenevad; Üksikud koefitsiendid võivad osutuda mõttetuks ✔
  • B) R-ruut väheneb alati nullini
  • C) Koefitsientide hinnangud muutuvad kogu aeg täpsemaks
  • D) Sõltuva muutuja skaala muutub

Selgitus: Suure multikollineaarsuse korral on sõltumatud muutujad üksteisega tugevas korrelatsioonis; Koefitsientide hinnangud muutuvad ebastabiilseks, standardvead suurenevad ja üksikud koefitsiendid võivad osutuda ebaolulisteks, samas kui üldine mudel võib olla oluline. Seda diagnoositakse selliste kriteeriumide alusel nagu VIF. Tehisintellekt võib soovitada muutujate kõrvaldamist, kuid teadlase otsustada, milline muutuja peaks jääma teoreetiliseks.

12. Mis on statistiline võimsus ja milline on väikese võimsusega uuringu risk?

  • A) Olemasoleva efekti tuvastamise võimalus; madal võimsus jätab tõelised efektid puudu ja muudab tulemused ebausaldusväärseks ✔
  • B) p-väärtuse vähendamise tõenäosus; väiksem võimsus annab alati usaldusväärsemad tulemused
  • C) valimi suurusest sõltumatu konstantne väärtus
  • D) Mõiste, mis kehtib ainult tehisintellekti kasutamisel

Selgitus: Võimsus on tegelikult eksisteeriva efekti tuvastamise tõenäosus (1 miinus II tüüpi viga). Madala võimsusega uuringud võivad tegelikke mõjusid kaotada; Lisaks võivad vähesed olulised tulemused kaasa tuua liialdatud efekti (“võitja needus”) ja valepositiivsete tulemuste määr suureneb. Seetõttu on võimsuse/valimi arvutamine enne analüüsi oluline.

13. Miks on tehisintellekti kasutamise avalikustamine artiklis eetiliselt vajalik?

  • A) läbipaistvuse ja vastutuse tagamiseks; ✔ Lugejad ja kohtunikud saavad protsessi hinnata ning vastutus jääb autorile
  • B) Tehisintellekti kasutamine muudab tulemused automaatselt kehtetuks
  • C) Ajakirjad taotlevad ainult reklaami eesmärgil
  • D) Selgituse autoriõiguse üleandmine tehisintellektile

Avalikustamine: läbipaistvus on vajalik, et lugeja ja arvustajad saaksid hinnata, kuidas tulemused saadi; Paljud ajakirjad ja asutused nõuavad nüüd tehisintellekti kasutamise avalikustamist. Lisaks, kuna tehisintellekt võib tekitada vigu/hallutsinatsioone, tuleb ausalt öelda, et vastutus jääb autorile ja milliseid samme auditeeriti.

14. Mida nõuab välistamispiirang instrumendimuutuja (IV) meetodis?

  • A) Tööriist mõjutab tulemust ainult sisemise muutuja kaudu, muud otsest teed pole ✔
  • B) Instrumendil puudub seos tulemuse muutujaga.
  • C) Instrument ei ole endogeense muutujaga seotud.
  • D) Means on alati binaarne (0/1) muutuja

Selgitus: välistamispiirang eeldab, et instrument mõjutaks tulemusmuutujat ainult endogeense seletava muutuja kaudu, mitte aga muude otseste vahendite või jälgimata tegurite kaudu. Seda eeldust ei saa andmete põhjal täielikult kontrollida; Seda kaitstakse teoreetilistel ja institutsionaalsetel alustel. Tehisintellekt võib kirjutada IV koodi, kuid teadlase ülesanne on kaitsta tööriista kehtivust.

15. Mida tähendab „hargnevate teede aia” probleem paindlikes eelregistreerimiseta analüüsides?

  • A) Andmete põhjal tehtud liiga paljud mõistlikud analüüsivalikud suurendavad isegi tahtmatult valepositiivsuse määra ✔
  • B) Analüüsimeetodid peavad olema üksikud ja kohustuslikud
  • C) Probleem, mis ilmneb ainult tahtliku petmise korral.
  • D) Olukord, mis kaob valimi kasvades spontaanselt

Selgitus: Pärast andmete vaatamist saab uurija teha palju mõistlikke valikuid, millist muutujat, alarühma, teisendust või läve kasutada. Isegi kui puudub üks "tahtlik p-häkkimine", suurendab see paindlikkus valepositiivsuse määra, kuna oluline valitakse tõhusalt paljude analüüside hulgast. Eelregistreerimine ja fikseeritud analüüsiplaan piiravad seda paindlikkust.