Vienetas 11 / 11

Ataskaitų rašymas, komunikacija ir etika: rezultatų pateikimas ir ribų perdavimas

Pelnas:

  • Gebėjimas, naudojant dirbtinį intelektą, sąžininga ir nedviprasmiška kalba pranešti apie empirines išvadas tikslinei auditorijai (akademinei, politikai, vadovybei)
  • Gebėjimas visapusiškai parašyti išvadas, apribojimus ir etinius teiginius (duomenų konfidencialumas, interesų konfliktas, dirbtinio intelekto naudojimo atskleidimas) ir išvengti klaidinančio pateikimo
  • Dirbtinio intelekto gebėjimas atpažinti ataskaitų projektus, kuriuose pateikiama perdėta, vienpusė ar priežastinė kalba, ir išlaikyti atsakomybę už galutinį tekstą bei teiginius tenka tyrėjui.

Modulio egzaminas

1. Tyrėjas klausia: „Koks koreliacijos koeficientas tarp nedarbo ir infliacijos Turkijoje 2015–2020 m.?“ nesuteikdamas jokių duomenų dirbtiniam intelektui. – klausia jis ir tiesiai į savo straipsnį įrašo skaičių 0,62. Kokia esminė šio požiūrio klaida?

  • A) Tikėtis konkrečios statistikos iš dirbtinio intelekto nepateikus patikrintų duomenų; ✔ Naudoti numerį, kuris galėjo būti sugalvotas jo nepatvirtinus
  • B) Straipsnyje niekada neturėtų būti naudojamas koreliacijos koeficientas.
  • C) Koreliacijos tarp nedarbo ir infliacijos apskaičiuoti negalima
  • D) Dirbtinis intelektas gali pasiekti duomenis tik po 2020 m

Paaiškinimas: AI kalbos modelis negali pateikti statistikos nepasiekęs duomenų rinkinio; Skaičius, kurį jis pateikia, greičiausiai yra haliucinacija (išgalvota). Koeficientai, koeficientai ir bandymų rezultatai turėtų būti skaičiuojami iš paties tyrėjo patikrintų duomenų, o ne paimti iš modelio atminties.

2. Ką reiškia, kad trūkstami duomenys yra „netrūksta atsitiktinai“ (MNAR) ir kodėl tai svarbu?

  • A) Trūkumas atsirado dėl pačios nepastebėtos vertės; Štai kodėl paprasta užduotis gali sukelti šališkumą ✔
  • B) Duomenys išnyksta visiškai atsitiktinai ir nesukuria jokio šališkumo.
  • C) Trūkstami duomenys visada turi būti pašalinti ištrinant eilutę.
  • D) Duomenų trūkumas neturi jokios įtakos analizei.

Paaiškinimas: MNAR (Missing Not At Random) atveju pats trūkumas priklauso nuo nepastebėtos vertės dydžio (pvz., daug uždirbantys asmenys nepraneša apie savo pajamas). Šiuo atveju paprastas ištrynimas arba vidutinis priskyrimas duoda šališkus rezultatus; Reikia modeliuoti trūkumo mechanizmą. Dirbtinio intelekto pasiūlytas priskyrimo metodas neturėtų būti taikomas aklai, nežinant šio mechanizmo.

3. Analitikas DI sudaro juostinę diagramą, o AI pradeda y ašį nuo 40, o ne nuo nulio. Faktinis 2% skirtumas tarp dviejų grupių grafike atrodo didžiulis. Koks yra teisingas požiūris?

  • A) Ašies paleidimas nuo nulio arba diagramos tipo keitimas; ✔ parodyti tikrąjį skirtumo dydį neklaidinant
  • B) Diagramos naudojimas taip, kaip yra, nes AI daro geriausią pasirinkimą
  • C) Pradedant ašį nuo 45, kad skirtumas būtų dar didesnis
  • D) Niekada nenaudokite vaizdinių elementų vietoj juostinių diagramų

Paaiškinimas: juostinėje diagramoje brūkšninė ašis (y ašis, kuri neprasideda nuo nulio) klaidina perdėdama nedidelius skirtumus. Sąžiningai vizualizuojant juostų diagramų ašis turėtų prasidėti nuo nulio arba skirtumas turėtų būti sąmoningai aiškiai nurodytas. Analitiko pareiga yra patikrinti vaizdą ir, jei reikia, jį pataisyti.

4. Kaip tai, kad koeficientas yra „reikšmingas“ (p<0,05) tiesinėje regresijoje, dažnai klaidingai pateikiamas aiškinant dirbtinį intelektą?

  • A) Perdėtas reikšmingumo pateikimas, nes poveikis yra didelis ir svarbus arba nustatytas priežastinis ryšys ✔
  • B) Reikšmė visada rodo, kad poveikis yra mažas
  • C) p<0,05 įrodo, kad koeficientas yra visiškai teisingas
  • D) Reikšmingi koeficientai niekada neturėtų būti pranešami.

Paaiškinimas: Statistinis reikšmingumas yra susijęs su įrodymų, kad poveikis skiriasi nuo nulio, stiprumu; Tai nereiškia, kad poveikis yra didelis, svarbus ar priežastinis. DI dažnai pateikia žodį „reikšmingas“ kaip „reikšmingas / stiprus poveikis“. Tyrėjas taip pat turėtų įvertinti poveikio dydį, pasikliautinąjį intervalą ir kontekstą.

5. Ką reiškia terminas „p-hacking“ ir kodėl dirbtinis intelektas gali tai palengvinti?

  • A) Bandyti atlikti keletą analizių, kol tai prasminga; AI tai daro labai greitai, padidindama riziką ✔
  • B) Duomenų analizė vieną kartą ir pagal iš anksto numatytą planą
  • C) imties išplėtimas, kad padidėtų p reikšmė
  • D) Pateikti tik aprašomąją statistiką

Paaiškinimas: p-hacking bando įvairius kintamuosius, pavyzdžius, transformacijas ar modelius, kol gaunamas reikšmingas rezultatas; tai sukuria klaidingus atsitiktinumu pagrįstus atradimus. Kadangi dirbtinis intelektas per kelias sekundes gali išbandyti daugybę modelių variantų, jis gali pagreitinti įsilaužimą be sąžiningo plano. Gynyba; išankstinė registracija, fiksuotas analizės planas ir daugkartinio palyginimo korekcija.

6. Kodėl didelės R kvadrato regresijos tarp dviejų nestacionarių (vieneto šaknų) laiko eilučių nustatymas gali būti klaidinantis?

  • A) Dėl bendros tendencijos gali atsirasti klaidinga regresija; ✔ Didelė R kvadrato išvestis be tikro ryšio
  • B) Didelis R kvadratas visada įrodo stiprų priežastinį ryšį.
  • C) Nestacionarios eilutės iš viso negali būti įtrauktos į regresiją.
  • D) R kvadrato negalima apskaičiuoti laiko eilutėse

Paaiškinimas: jei nėra bendro kointegracijos ryšio tarp nestacionarių eilučių, klaidinga regresija gali sukurti didelį R kvadrato ir reikšmingą koeficientą tik dėl bendros tendencijos; tuo tarpu tikrų santykių nėra. Todėl pirmiausia reikia atlikti stacionarumo ir vienetinės šaknies testus, o prireikus imti skirtumus arba išbandyti kointegraciją.

7. Kokia pagrindinė prielaida grindžiama skirtumų dizaino pagrįstumu?

  • A) Lygiagrečių tendencijų prielaida: grupės eitų ta pačia kryptimi, jei nebūtų įsikišimo ✔
  • B) Gydymo ir kontrolinės grupės pradžioje yra lygiai tokios pačios
  • C) Normalus mėginio pasiskirstymas
  • D) Kintamuosiuose nėra jokių trūkstamų duomenų

Paaiškinimas: DiD daro prielaidą, kad be intervencijos gydymo ir kontrolinių grupių rezultatų kintamasis laikui bėgant būtų pasikeitęs lygiagrečiai (lygiagrečių tendencijų prielaida). Jei ši prielaida nesilaikoma, įvertinimas yra šališkas. AI gali sukurti DiD kodą, tačiau tyrėjo darbas yra ginti ir išbandyti lygiagrečias tendencijas.

8. Kuris iš šių dalykų yra privalomas atkuriamosios analizės praktika?

  • A) Sėklos tvirtinimas atsitiktiniais žingsniais, įrašant pakuotės versijas ir kodą ✔
  • B) Rankiniu būdu nukopijuokite rezultatus į skaičiuoklę ir ištrinkite kodą
  • C) Normalu, kad kiekviename bėgime matote skirtingus rezultatus.
  • D) Išsaugokite tik galutinę grafiką, nesidalindami duomenimis ir kodu

Aprašymas: Atkuriamumas; Tą patį rezultatą vėl galima gauti naudojant tuos pačius duomenis ir kodą. Tai kertiniai akmenys yra sėklos taisymas atsitiktiniais žingsniais, paketo versijų išsaugojimas ir kodo vykdymas dokumente (raštingas programavimas). Rezultatų kopijavimas rankiniu būdu arba paspaudimais pagrįsti, neregistruojami veiksmai pablogina atkuriamumą.

9. Ką heteroskedastiškumas iškreipia tiesinę regresiją ir koks yra jo bendras sprendimas?

  • A) iškraipo standartines klaidas; sprendimas yra tvirtos standartinės klaidos arba atitinkama transformacija ✔
  • B) Jis visiškai paneigia koeficientų įverčius ir neturi sprendimo
  • C) Visada sumažina R kvadratą iki nulio
  • D) Pasitaiko tik tuo atveju, jei imtis yra labai maža ir gali būti ignoruojama

Paaiškinimas: Heteroskedastiškumas palieka nešališkus koeficiento įverčius, bet klaidingai apskaičiuoja standartines klaidas; Dėl to p vertės ir pasikliautinieji intervalai tampa nepatikimi. Įprastas sprendimas yra naudoti patikimas/HC standartines klaidas arba atitinkamą konvertavimą. Reikia patikrinti, ar AI pasiūlytas sprendimas iš tikrųjų išsprendžia problemą, o ne ją slepia.

10. Tyrėjas įkelia mikroduomenis su paciento identifikavimo informacija ir pajamomis į viešą AI pokalbių įrankį ir sako „padaryti regresiją“. Kokia yra pagrindinė tokio elgesio problema?

  • A) Asmens / licencijuotų duomenų įkėlimas į išorinį įrankį yra konfidencialumo ir sutarties pažeidimas ✔
  • B) Regresijos dirbtinis intelektas apskritai negali padaryti
  • C) Mikro duomenys visai netinka regresijai
  • D) AI visada klaidingai apskaičiuoja regresiją

Paaiškinimas: Asmens / specialūs duomenys, tokie kaip tapatybė ir pajamos, yra apsaugoti pagal KVKK/BDAR ir daugumą duomenų naudojimo sutarčių; Jų įkėlimas į išorinį įrenginį, kuriame galima saugoti duomenis, yra pažeidimas. Teisingas kelias; Duomenų anonimiškumas, vietinių/institucinių saugių įrankių naudojimas arba tiesiog dirbtinio intelekto kodo užklausimas ir kodo paleidimas savo aplinkoje.

11. Kas stebima, kai daugiakolineariškumas didelis?

  • A) Koeficientai tampa nestabilūs, o standartinės paklaidos tampa išpūstos; Individualūs koeficientai gali pasirodyti beprasmiai ✔
  • B) R kvadratas visada sumažėja iki nulio
  • C) Koeficientų įverčiai visą laiką tampa tikslesni
  • D) Keičiasi priklausomo kintamojo skalė

Paaiškinimas: Esant dideliam daugiakolineariškumui, nepriklausomi kintamieji stipriai koreliuoja vienas su kitu; Koeficientų įverčiai tampa nestabilūs, standartinės paklaidos išpūstos, o atskiri koeficientai gali pasirodyti nereikšmingi, o bendras modelis gali būti reikšmingas. Jis diagnozuojamas pagal tokius kriterijus kaip VIF. Dirbtinis intelektas gali pasiūlyti pašalinti kintamąjį, tačiau tyrėjas turi nuspręsti, kuris kintamasis turėtų likti teorinis.

12. Kas yra statistinė galia ir kokia yra mažos galios tyrimo rizika?

  • A) Galimybė aptikti esamą poveikį; maža galia praranda tikrąjį poveikį, todėl išvados tampa nepatikimos ✔
  • B) p reikšmės sumažinimo tikimybė; mažesnė galia visada suteikia patikimesnių rezultatų
  • C) pastovi vertė, nepriklausoma nuo imties dydžio
  • D) Sąvoka, kuri galioja tik tada, kai naudojamas dirbtinis intelektas

Paaiškinimas: Galia yra tikimybė aptikti faktiškai egzistuojantį efektą (1 minus II tipo klaida). Mažos galios tyrimai gali nepastebėti tikrojo poveikio; Be to, keli reikšmingi rezultatai gali turėti perdėtą efekto dydį („nugalėtojo prakeiksmas“) ir padidėti klaidingų teigiamų rezultatų rodiklis. Todėl prieš analizę svarbu apskaičiuoti galią / mėginį.

13. Kodėl etiškai būtina straipsnyje atskleisti dirbtinio intelekto naudojimą?

  • A) už skaidrumą ir atskaitomybę; ✔ Skaitytojai ir referentai gali įvertinti procesą, o atsakomybė lieka autoriui
  • B) Dirbtinio intelekto naudojimas automatiškai anuliuoja rezultatus
  • C) Žurnalų prašoma tik reklamos tikslais
  • D) paaiškinimo autorių teisių perdavimas dirbtiniam intelektui

Atskleidimas: skaidrumas būtinas, kad skaitytojas ir recenzentai galėtų įvertinti, kaip buvo gauti rezultatai; Daugelis žurnalų ir institucijų dabar reikalauja atskleisti AI naudojimą. Be to, kadangi dirbtinis intelektas gali sukelti klaidų / haliucinacijų, sąžiningai reikia pasakyti, kad atsakomybė tenka autoriui ir kurie veiksmai buvo patikrinti.

14. Ko reikalauja „išskyrimo apribojimas“ taikant instrumento kintamojo (IV) metodą?

  • A) Įrankis įtakoja rezultatą tik per vidinį kintamąjį, kito tiesioginio būdo nėra ✔
  • B) Priemonė neturi ryšio su rezultato kintamuoju.
  • C) Priemonė nesusijusi su endogeniniu kintamuoju.
  • D) Means visada yra dvejetainis (0/1) kintamasis

Paaiškinimas: Išskyrimo apribojimas reikalauja, kad priemonė paveiktų rezultato kintamąjį tik per endogeninį aiškinamąjį kintamąjį, o ne per kitas tiesiogines priemones ar nepastebėtus veiksnius. Šios prielaidos negalima visiškai patikrinti remiantis duomenimis; Jis ginamas teoriniais ir instituciniais pagrindais. AI gali parašyti IV kodą, tačiau tyrėjo darbas yra apginti įrankio galiojimą.

15. Ką reiškia problema „Išsišakojančių takų sodas“ lanksčiose analizėse be išankstinės registracijos?

  • A) Per daug pagrįstų analizės pasirinkimų, priimtų remiantis duomenimis, net ir netyčia padidina klaidingų teigiamų rezultatų rodiklį ✔
  • B) Analizės metodai turi būti pavieniai ir privalomi
  • C) Problema, kuri iškyla tik tada, kai įvyksta tyčinis sukčiavimas.
  • D) Situacija, kuri savaime išnyksta, kai mėginys auga

Paaiškinimas: peržiūrėjęs duomenis, tyrėjas gali priimti daug pagrįstų pasirinkimų, kurį kintamąjį, pogrupį, transformaciją ar slenkstį naudoti. Net jei nėra vieno „tyčinio p įsilaužimo“, šis lankstumas padidina klaidingų teigiamų rezultatų rodiklį, nes reikšmingas efektyviai pasirenkamas iš daugybės analizių. Išankstinė registracija ir fiksuotas analizės planas riboja šį lankstumą.