Enota 11 / 11

Pisanje poročil, komunikacija in etika: Predstavitev rezultatov in sporočanje meja

Dobički:

  • Sposobnost poročanja o empiričnih ugotovitvah ciljnemu občinstvu (akademsko, politično, vodstvo) s podporo umetne inteligence, v poštenem in nedvoumnem jeziku
  • Sposobnost popolnega pisanja zaključkov, omejitev in etičnih izjav (zaupnost podatkov, navzkrižje interesov, razkritje uporabe umetne inteligence) in izogibanje zavajajočemu predstavljanju
  • Sposobnost umetne inteligence, da prepozna osnutke poročil, ki ustvarjajo pretiran, enostranski ali vzročni jezik, in ohrani, da odgovornost za končno besedilo in trditve nosi raziskovalec.

Modulni izpit

1. Raziskovalec sprašuje: "Kakšen je korelacijski koeficient med brezposelnostjo in inflacijo v Turčiji med letoma 2015 in 2020?" ne da bi posredovali kakršne koli podatke umetni inteligenci. vpraša in zapiše številko 0,62 neposredno v svoj članek. Kaj je temeljna napaka v tem pristopu?

  • A) Pričakovati konkretne statistike od umetne inteligence brez podajanja preverjenih podatkov; ✔ Uporaba številke, ki je bila morda izmišljena brez preverjanja
  • B) Korelacijski koeficient se nikoli ne sme uporabiti v članku.
  • C) Korelacije med brezposelnostjo in inflacijo ni mogoče izračunati
  • D) Umetna inteligenca lahko do podatkov dostopa šele po letu 2020

Pojasnilo: Jezikovni model AI ne more proizvesti statistike brez dostopa do nabora podatkov; Številka, ki jo navaja, je najverjetneje halucinacija (izmišljena). Koeficiente, razmerja in rezultate testov je treba izračunati iz preverjenih podatkov raziskovalca, ne pa iz pomnilnika modela.

2. Kaj pomeni, da manjkajoči podatki niso "naključno manjkajoči" (MNAR) in zakaj je to pomembno?

  • A) Pomanjkljivost je posledica same neopažene vrednosti; Zato lahko preprosta dodelitev povzroči pristranskost ✔
  • B) Podatki izginejo povsem naključno in ne ustvarjajo nobene pristranskosti.
  • C) Manjkajoče podatke je treba vedno odpraviti z brisanjem vrstice.
  • D) Manjkajoči podatki na noben način ne vplivajo na analizo.

Pojasnilo: V primeru MNAR (Missing Not At Random) je manjkanje samo odvisno od velikosti neopazovane vrednosti (npr. ljudje z visokimi zaslužki ne poročajo o svojem dohodku). V tem primeru preprosto brisanje ali povprečna dodelitev daje pristranske rezultate; Mehanizem pomanjkanja je treba modelirati. Metode dodeljevanja, ki jo predlaga umetna inteligenca, ne bi smeli uporabiti na slepo brez poznavanja tega mehanizma.

3. Analitik ima AI, da naredi palični grafikon in AI začne os y pri 40 namesto na nič. Dejanska razlika 2 % med obema skupinama je na grafu videti ogromna. Kakšen je pravi pristop?

  • A) Zagon osi iz nič ali sprememba vrste grafikona; ✔ prikazati pravo velikost razlike brez zavajanja
  • B) Uporaba grafikona takšnega, kot je, ker je umetna inteligenca najboljša izbira
  • C) Začetek osi pri 45, da bo razlika še večja
  • D) Nikoli ne uporabljajte vizualnih elementov namesto paličnih grafikonov

Pojasnilo: V paličnem grafikonu črtkana os (os y, ki se ne začne od nič) zavaja s pretiravanjem majhnih razlik. Pri pošteni vizualizaciji se mora os paličnih grafikonov začeti od nič ali pa mora biti razlika zavestno jasno izražena. Odgovornost analitika je, da preveri sliko in jo po potrebi popravi.

4. Kako je dejstvo, da je koeficient 'pomemben' (p<0,05) v linearni regresiji, pogosto napačno predstavljeno v interpretaciji umetne inteligence?

  • A) Pretirana predstavitev pomembnosti, saj je učinek velik in pomemben ali pa je vzročna zveza ugotovljena ✔
  • B) Pomembnost vedno kaže, da je učinek majhen
  • C) p<0,05 dokazuje, da je koeficient popolnoma pravilen
  • D) Pomembnih koeficientov se ne sme nikoli poročati.

Pojasnilo: statistična pomembnost se nanaša na moč dokazov, da je učinek drugačen od nič; To ne pomeni, da je učinek velik, pomemben ali vzročen. AI besedo 'pomemben' pogosto predstavlja kot 'pomemben/močan vpliv'. Raziskovalec mora oceniti tudi velikost učinka, interval zaupanja in kontekst.

5. Na kaj se nanaša izraz 'p-hacking' in zakaj ga lahko AI olajša?

  • A) Preizkušanje več analiz, dokler ni smiselno; AI to naredi zelo hitro, kar poveča tveganje ✔
  • B) Enkratna analiza podatkov in po vnaprej določenem načrtu
  • C) razširitev vzorca za povečanje p-vrednosti
  • D) Poročanje samo o opisni statistiki

Pojasnilo: p-hekanje preizkuša različne spremenljivke, podvzorce, transformacije ali modele, dokler ne pride do pomembnega rezultata; to povzroči lažne ugotovitve, ki temeljijo na naključju. Ker lahko AI v nekaj sekundah preizkusi na desetine različic modela, lahko pospeši p-hekanje brez poštenega načrta. obramba; predregistracija, fiksni načrt analize in popravek večkratne primerjave.

6. Zakaj bi lahko bilo iskanje visoke regresije R-kvadrata med dvema nestacionarnima časovnima vrstama (enotski koren) zavajajoče?

  • A) Lahko pride do lažne regresije zaradi skupnega trenda; ✔ Visok rezultat na R-kvadrat brez resničnega razmerja
  • B) Visok R-kvadrat vedno dokazuje močno vzročno zvezo.
  • C) Nestacionarnih vrst sploh ni mogoče vnesti v regresijo.
  • D) R-kvadrata ni mogoče izračunati v časovni vrsti

Pojasnilo: Če med nestacionarnimi serijami ni skupnega kointegracijskega razmerja, lahko lažna regresija povzroči visok R-kvadrat in pomemben koeficient samo zaradi skupnega trenda; medtem ko ni pravega odnosa. Zato je treba najprej opraviti test stacionarnosti in enotskega korena ter po potrebi vzeti razlike ali preizkusiti kointegracijo.

7. Katera osnovna predpostavka temelji na veljavnosti zasnove razlike v razlikah?

  • A) Predpostavka o vzporednih trendih: skupine bi sledile isti smeri, če ne bi bilo intervencije ✔
  • B) Zdravstvena in kontrolna skupina sta na začetku popolnoma enaki
  • C) Normalna porazdelitev vzorca
  • D) Spremenljivke ne vsebujejo manjkajočih podatkov

Pojasnilo: DiD predpostavlja, da bi v odsotnosti intervencije spremenljivka izida za skupino za zdravljenje in kontrolno skupino skozi čas tekla vzporedno (predpostavka o vzporednih trendih). Če ta predpostavka ni izpolnjena, je ocena pristranska. Umetna inteligenca lahko ustvari kodo DiD, vendar je naloga raziskovalca, da brani in testira vzporedne trende.

8. Kaj od naslednjega je obvezna praksa za ponovljivo analizo?

  • A) Popravljanje semena v naključnih korakih, snemanje različic paketa in kode ✔
  • B) Ročno kopirajte rezultate v preglednico in izbrišite kodo
  • C) Normalno je videti različne rezultate v vsaki vožnji.
  • D) Ohranjanje samo končne grafike, brez izmenjave podatkov in kode

Opis: ponovljivost; Isti rezultat je mogoče znova dobiti z istimi podatki in kodo. Temelji tega so popravljanje semena v naključnih korakih, shranjevanje različic paketov in izvajanje kode v dokumentu (pismeno programiranje). Ročno kopiranje rezultatov ali koraki brez beleženja na podlagi klika poslabšajo ponovljivost.

9. Kaj heteroskedastičnost popači linearno regresijo in kakšna je njena skupna rešitev?

  • A) Izkrivlja standardne napake; rešitev so robustne standardne napake ali ustrezna transformacija ✔
  • B) Popolnoma razveljavi ocene koeficientov in nima rešitve
  • C) R-kvadrat vedno zmanjša na nič
  • D) Pojavi se samo, če je vzorec zelo majhen in ga je mogoče prezreti

Pojasnilo: heteroskedastičnost pušča ocene koeficientov nepristranske, vendar napačno izračuna standardne napake; Zaradi tega so p-vrednosti in intervali zaupanja nezanesljivi. Običajna rešitev je uporaba robustnih/HC standardnih napak ali ustrezne pretvorbe. Preveriti je treba, ali rešitev, ki jo predlaga umetna inteligenca, dejansko odpravi težavo, namesto da jo prikrije.

10. Raziskovalec naloži mikropodatke, ki vsebujejo informacije o identifikaciji in dohodku na ravni pacienta, v javno orodje za klepet z umetno inteligenco in reče 'naredi regresijo'. Kaj je glavna težava tega vedenja?

  • A) Nalaganje osebnih/licenciranih podatkov v zunanje orodje pomeni kršitev zaupnosti in pogodbe ✔
  • B) Umetna inteligenca sploh ne more narediti regresije
  • C) Mikro podatki sploh niso primerni za regresijo
  • D) AI vedno napačno izračuna regresijo

Pojasnilo: Osebni/posebni podatki, kot so identiteta in dohodek, so zaščiteni v skladu s KVKK/GDPR in večino pogodb o uporabi podatkov; Njihovo nalaganje na zunanjo napravo, ki lahko shranjuje podatke, je kršitev. Pravi način; Anonimiziranje podatkov, uporaba lokalnih/institucionalnih varnih orodij ali preprosto zahtevanje kode od umetne inteligence in izvajanje kode v lastnem okolju.

11. Kaj se opazi pri visoki multikolinearnosti?

  • A) Koeficienti postanejo nestabilni in standardne napake postanejo napihnjene; Posamezni koeficienti se lahko izkažejo za nesmiselne ✔
  • B) R-kvadrat se vedno zmanjša na nič
  • C) Ocene koeficientov postajajo vse bolj natančne
  • D) Lestvica odvisne spremenljivke se spremeni

Pojasnilo: Pri visoki multikolinearnosti so neodvisne spremenljivke med seboj močno povezane; Ocene koeficientov postanejo nestabilne, standardne napake postanejo napihnjene in posamezni koeficienti se lahko izkažejo za nepomembne, celoten model pa je lahko pomemben. Diagnosticira se z merili, kot je VIF. Umetna inteligenca lahko predlaga izločitev spremenljivke, vendar se mora raziskovalec odločiti, katera spremenljivka naj ostane teoretična.

12. Kaj je statistična moč in kakšno je tveganje študije nizke moči?

  • A) Možnost zaznave obstoječega učinka; nizka moč zgreši prave učinke in naredi ugotovitve nezanesljive ✔
  • B) verjetnost zmanjšanja p-vrednosti; manjša moč daje vedno zanesljivejše rezultate
  • C) Konstantna vrednost, neodvisna od velikosti vzorca
  • D) Koncept, ki je veljaven le ob uporabi umetne inteligence

Pojasnilo: moč je verjetnost zaznavanja učinka, ki dejansko obstaja (1 minus napaka tipa II). Študije nizke moči lahko spregledajo prave učinke; Poleg tega ima nekaj pomembnih rezultatov lahko pretirano velikost učinka ("prekletstvo zmagovalca") in stopnja lažno pozitivnih rezultatov se poveča. Zato je izračun moči/vzorca pomemben pred analizo.

13. Zakaj je etično nujno razkriti uporabo umetne inteligence v članku?

  • A) Za preglednost in odgovornost; ✔ bralci in sodniki lahko ocenijo postopek, odgovornost pa ostane na avtorju
  • B) Uporaba umetne inteligence samodejno razveljavi rezultate
  • C) Revije zahtevajo le v oglaševalske namene
  • D) Prenos avtorskih pravic razlage na umetno inteligenco

Razkritje: Preglednost je potrebna, da lahko bralec in recenzenti ocenijo, kako so bili rezultati ustvarjeni; Številne revije in ustanove zdaj zahtevajo razkritje uporabe umetne inteligence. Poleg tega, ker lahko umetna inteligenca povzroči napake/halucinacije, je stvar poštenosti trditi, da odgovornost ostaja avtor in kateri koraki so bili revidirani.

14. Kaj zahteva 'omejitev izključitve' v metodi spremenljivke instrumenta (IV)?

  • A) Orodje vpliva na rezultat samo prek notranje spremenljivke, drugega neposrednega načina ni ✔
  • B) Instrument ni povezan s spremenljivko rezultata.
  • C) Instrument ni povezan z endogeno spremenljivko.
  • D) Srednje je vedno binarna (0/1) spremenljivka

Pojasnilo: Omejitev izključitve zahteva, da instrument vpliva na spremenljivko rezultata samo prek endogene pojasnjevalne spremenljivke in ne prek drugih neposrednih sredstev ali neopazovanih dejavnikov. Te predpostavke ni mogoče v celoti preveriti na podlagi podatkov; Zagovarja se na teoretičnih in institucionalnih osnovah. AI lahko napiše kodo IV, vendar je naloga raziskovalca, da brani veljavnost orodja.

15. Kaj pomeni problem 'Garden of forking paths' pri prilagodljivih analizah brez predregistracije?

  • A) Preveč razumnih analiznih odločitev, ki temeljijo na podatkih, povečajo lažno pozitivno stopnjo, tudi nenamerno ✔
  • B) Analitske metode morajo biti enotne in obvezne
  • C) Težava, ki se pojavi le, ko pride do namernega goljufanja.
  • D) Situacija, ki spontano izgine, ko vzorec raste

Pojasnilo: Po ogledu podatkov lahko raziskovalec naredi veliko razumnih odločitev o tem, katero spremenljivko, podskupino, transformacijo ali prag uporabiti. Tudi če ni enega samega „namernega p-hekanja“, ta prilagodljivost poveča lažno pozitivno stopnjo, ker je pomembna učinkovito izbrana iz velikega števila analiz. Predregistracija in fiksni načrt analize omejujejo to prilagodljivost.