Njësia 11 / 11

Shkrimi i raportit, komunikimi dhe etika: prezantimi i rezultateve dhe komunikimi i kufijve

Fitimet:

  • Aftësia për të raportuar gjetjet empirike tek audienca e synuar (akademike, politika, menaxhmenti) me mbështetjen e inteligjencës artificiale, në një gjuhë të sinqertë dhe të paqartë
  • Aftësia për të shkruar plotësisht konkluzionet, kufizimet dhe deklaratat etike (konfidencialiteti i të dhënave, konflikti i interesit, zbulimi i përdorimit të inteligjencës artificiale) dhe për të shmangur paraqitjen mashtruese
  • Aftësia e inteligjencës artificiale për të njohur draftet e raporteve që prodhojnë gjuhë të ekzagjeruar, të njëanshme ose kauzale dhe të ruajë atë përgjegjësi për tekstin dhe pretendimet përfundimtare i takon studiuesit.

Provimi i Modulit

1. Një studiues pyet 'Cili është koeficienti i korrelacionit midis papunësisë dhe inflacionit në Turqi midis 2015 dhe 2020?' pa i dhënë asnjë të dhënë inteligjencës artificiale. ai pyet dhe shkruan numrin 0.62 direkt në artikullin e tij. Cili është gabimi themelor në këtë qasje?

  • A) Pritja e statistikave konkrete nga inteligjenca artificiale pa dhënë të dhëna të verifikuara; ✔ Përdorimi i një numri që mund të jetë krijuar pa e verifikuar atë
  • B) Koeficienti i korrelacionit nuk duhet të përdoret kurrë në një artikull.
  • C) Nuk mund të llogaritet korrelacioni ndërmjet papunësisë dhe inflacionit
  • D) Inteligjenca artificiale mund të aksesojë të dhënat vetëm pas vitit 2020

Shpjegim: Modeli i gjuhës së AI nuk mund të prodhojë statistika pa qasje në grupin e të dhënave; Numri që ai jep është me shumë mundësi një halucinacion (i sajuar). Koeficientët, raportet dhe rezultatet e testit duhet të llogariten nga të dhënat e verifikuara të vetë studiuesit, jo të marra nga kujtesa e modelit.

2. Çfarë do të thotë që të dhënat që mungojnë 'të mos mungojnë në mënyrë të rastësishme' (MNAR) dhe pse është e rëndësishme?

  • A) Mangësia është për shkak të vetë vlerës së pavërejtur; Kjo është arsyeja pse caktimi i thjeshtë mund të krijojë paragjykim ✔
  • B) Të dhënat zhduken krejtësisht rastësisht dhe nuk krijojnë asnjë paragjykim.
  • C) Të dhënat që mungojnë duhet të zgjidhen gjithmonë duke fshirë rreshtin.
  • D) Mungesa e të dhënave nuk ndikon në analizë në asnjë mënyrë.

Shpjegim: Në rastin e MNAR (Mungon Jo Rastësisht), vetë mungesa varet nga madhësia e vlerës së pavëzhguar (p.sh. personat me fitim të lartë nuk raportojnë të ardhurat e tyre). Në këtë rast, fshirja e thjeshtë ose caktimi mesatar jep rezultate të njëanshme; Duhet të modelohet mekanizmi i mungesës. Metoda e caktimit e sugjeruar nga inteligjenca artificiale nuk duhet të zbatohet verbërisht pa e ditur këtë mekanizëm.

3. Një analist bën që AI të bëjë një grafik me shtylla dhe AI ​​fillon boshtin y në 40 në vend të zeros. Dallimi aktual prej 2% midis dy grupeve duket i madh në grafik. Cila është qasja e duhur?

  • A) Nisja e boshtit nga e para ose ndryshimi i llojit të grafikut; ✔ për të treguar madhësinë e vërtetë të ndryshimit pa mashtruar
  • B) Përdorimi i grafikut siç është sepse AI bën zgjedhjen më të mirë
  • C) Nisja e boshtit në 45 për të bërë diferencën edhe më të madhe
  • D) Asnjëherë mos përdorni pamje vizuale në vend të grafikëve me shtylla

Shpjegim: Në një grafik me shtylla, boshti i ndërprerë (boshti y që nuk fillon nga zero) çorienton duke ekzagjeruar diferencat e vogla. Në vizualizimin e sinqertë, boshti i grafikëve me shtylla duhet të fillojë nga zero ose ndryshimi duhet të shprehet qartë me vetëdije. Është përgjegjësi e analistit të verifikojë imazhin dhe ta korrigjojë nëse është e nevojshme.

4. Si keqinterpretohet shpesh fakti që një koeficient është 'i rëndësishëm' (p<0.05) në regresionin linear në interpretimin e inteligjencës artificiale?

  • A) Paraqitja e ekzagjeruar e rëndësisë pasi efekti është i madh dhe i rëndësishëm ose përcaktohet shkakësia ✔
  • B) Rëndësia tregon gjithmonë se efekti është i vogël
  • C) p<0.05 vërteton se koeficienti është absolutisht i saktë
  • D) Koeficientët e rëndësishëm nuk duhet të raportohen kurrë.

Shpjegimi: Rëndësia statistikore lidhet me fuqinë e provave që efekti është i ndryshëm nga zero; Nuk do të thotë që efekti është i madh, i rëndësishëm apo shkakësor. AI shpesh e paraqet fjalën 'i rëndësishëm' si 'ndikim i rëndësishëm/i fortë'. Studiuesi gjithashtu duhet të vlerësojë madhësinë e efektit, intervalin e besimit dhe kontekstin.

5. Çfarë i referohet termi 'p-hacking' dhe pse AI mund ta bëjë më të lehtë?

  • A) Provimi i analizave të shumta derisa të ketë kuptim; AI e bën këtë shumë shpejt, duke rritur rrezikun ✔
  • B) Analizimi i të dhënave një herë dhe me një plan të paracaktuar
  • C) zgjerimi i kampionit për të rritur vlerën p
  • D) Raportimi vetëm i statistikave përshkruese

Shpjegim: p-hacking është duke provuar variabla, nën-mostra, transformime ose modele të ndryshme derisa të dalë një rezultat kuptimplotë; kjo prodhon gjetje të rreme të bazuara në rastësi. Meqenëse AI mund të provojë dhjetëra variante modelesh në sekonda, mund të shpejtojë hakimin e p pa një plan të ndershëm. Mbrojtja; pararegjistrimi, plani i analizës fikse dhe korrigjimi i krahasimit të shumëfishtë.

6. Pse gjetja e një regresioni me katror të lartë R ndërmjet dy serive kohore jo-stacionare (rrënjë njësi) mund të jetë mashtruese?

  • A) Regresioni i rremë mund të ndodhë për shkak të tendencës së zakonshme; ✔ Prodhim i lartë me katror R pa marrëdhënie reale
  • B) Një R-katror i lartë provon gjithmonë një lidhje të fortë shkakësore.
  • C) Seritë jo-stacionare nuk mund të futen fare në regresion.
  • D) R-katrori nuk mund të llogaritet në seri kohore

Shpjegim: Nëse nuk ka lidhje të përbashkët kointegrimi ndërmjet serive jo-stacionare, regresioni i rremë mund të prodhojë koeficient R-katror të lartë dhe të rëndësishëm vetëm për shkak të tendencës së përbashkët; kurse nuk ka lidhje reale. Prandaj, fillimisht duhet të bëhen testet e stacionaritetit dhe të rrënjës së njësisë dhe nëse është e nevojshme, të merren diferencat ose të testohet kointegrimi.

7. Cili supozim bazë bazohet në vlefshmërinë e dizajnit Difference-in-Differences?

  • A) Supozimi i tendencave paralele: grupet do të ndiqnin të njëjtin drejtim nëse nuk do të kishte ndërhyrje ✔
  • B) Grupet e trajtimit dhe të kontrollit janë saktësisht të njëjta në fillim
  • C) Shpërndarja normale e kampionit
  • D) Variablat nuk përmbajnë asnjë të dhënë që mungon

Shpjegimi: DiD supozon se në mungesë të ndërhyrjes, variabla e rezultatit për grupet e trajtimit dhe të kontrollit do të kishte ecur paralelisht me kalimin e kohës (supozimi i tendencave paralele). Nëse ky supozim nuk përmbushet, vlerësimi është i njëanshëm. AI mund të prodhojë kodin DiD, por është detyra e studiuesit të mbrojë dhe testojë tendencat paralele.

8. Cila nga sa vijon është praktikë e detyrueshme për një analizë të riprodhueshme?

  • A) Rregullimi i farës në hapa të rastësishëm, regjistrimi i versioneve të paketës dhe kodit ✔
  • B) Kopjoni manualisht rezultatet në tabelë dhe fshini kodin
  • C) Është normale të shohësh rezultate të ndryshme në çdo vrapim.
  • D) Mbajtja vetëm e grafikëve përfundimtare, duke mos shkëmbyer të dhëna dhe kode

Përshkrimi: Riprodhueshmëria; I njëjti rezultat mund të merret përsëri me të njëjtat të dhëna dhe kod. Rregullimi i farës në hapa të rastësishëm, ruajtja e versioneve të paketës dhe ekzekutimi i kodit brenda dokumentit (programimi i shkolluar) janë themelet e kësaj. Kopjimi i rezultateve me dorë ose hapat e bazuar në klikime, pa regjistrim, dëmton riprodhueshmërinë.

9. Çfarë shtrembëron heteroskedasticiteti një regresion linear dhe cila është zgjidhja e zakonshme e tij?

  • A) Deformon gabimet standarde; zgjidhja është gabime të forta standarde ose transformim i duhur ✔
  • B) Zhvlerëson plotësisht vlerësimet e koeficientëve dhe nuk ka zgjidhje
  • C) Gjithmonë e zvogëlon R-katrorin në zero
  • D) Ndodh vetëm nëse kampioni është shumë i vogël dhe mund të injorohet

Shpjegim: Heteroskedasticiteti i lë vlerësimet e koeficientëve të paanshëm, por llogarit gabimisht gabimet standarde; Kjo i bën vlerat p dhe intervalet e besimit jo të besueshme. Një zgjidhje e zakonshme është përdorimi i gabimeve standarde të fuqishme/HC ose konvertimi i duhur. Duhet të verifikohet që zgjidhja e sugjeruar nga AI në të vërtetë e rregullon problemin në vend që ta fshehë atë.

10. Një studiues ngarkon mikro të dhëna që përmbajnë informacione identifikimi dhe të ardhura të nivelit të pacientit në një mjet bisede publike të AI dhe thotë 'bëj regresion'. Cili është problemi kryesor me këtë sjellje?

  • A) Ngarkimi i të dhënave personale/të licencuara në një mjet të jashtëm përbën një shkelje të konfidencialitetit dhe kontratës ✔
  • B) Regresioni nuk mund të bëhet fare nga inteligjenca artificiale
  • C) Mikro të dhënat nuk janë aspak të përshtatshme për regresion
  • D) AI gjithmonë llogarit gabimisht regresionin

Shpjegim: Të dhënat personale/të veçanta si identiteti dhe të ardhurat mbrohen sipas KVKK/GDPR dhe shumicës së marrëveshjeve të përdorimit të të dhënave; Ngarkimi i tyre në një pajisje të jashtme që mund të ruajë të dhëna është një shkelje. Mënyra e duhur; Anonimizimi i të dhënave, përdorimi i mjeteve të sigurta lokale/institucionale, ose thjesht kërkimi i kodit nga inteligjenca artificiale dhe ekzekutimi i kodit në mjedisin e tij.

11. Çfarë vërehet kur multikolineariteti është i lartë?

  • A) Koeficientët bëhen të paqëndrueshëm dhe gabimet standarde rriten; Koeficientët individualë mund të rezultojnë të pakuptimtë ✔
  • B) R-katrori gjithmonë zvogëlohet në zero
  • C) Vlerësimet e koeficientëve bëhen më të sakta gjatë gjithë kohës
  • D) Ndryshon shkalla e ndryshores së varur

Shpjegim: Në multikolinearitet të lartë, variablat e pavarur janë të lidhur ngushtë me njëri-tjetrin; Vlerësimet e koeficientëve bëhen të paqëndrueshme, gabimet standarde bëhen të fryra dhe koeficientët individualë mund të rezultojnë të parëndësishëm, ndërsa modeli i përgjithshëm mund të jetë i rëndësishëm. Diagnostikohet me kritere si VIF. Inteligjenca artificiale mund të sugjerojë eliminimin e variablave, por i takon studiuesit të vendosë se cila variabël duhet të mbetet teorike.

12. Çfarë është fuqia statistikore dhe cili është rreziku i një studimi me fuqi të ulët?

  • A) Mundësia e zbulimit të efektit ekzistues; fuqia e ulët humbet efektet e vërteta dhe i bën gjetjet jo të besueshme ✔
  • B) probabiliteti i zvogëlimit të vlerës p; fuqia më e ulët jep gjithmonë rezultate më të besueshme
  • C) Një vlerë konstante e pavarur nga madhësia e kampionit
  • D) Një koncept që vlen vetëm kur përdoret inteligjenca artificiale

Shpjegim: Fuqia është probabiliteti i zbulimit të një efekti që ekziston në të vërtetë (1 minus gabimi i tipit II). Studimet me fuqi të ulët mund të humbasin efektet e vërteta; Për më tepër, disa rezultate të rëndësishme mund të kenë një madhësi të ekzagjeruar të efektit ('mallkimi i fituesit') dhe norma false pozitive rritet. Prandaj, llogaritja e fuqisë/kampionit është e rëndësishme përpara analizës.

13. Pse është etikisht e nevojshme të zbulohet përdorimi i inteligjencës artificiale në një artikull?

  • A) Për transparencë dhe llogaridhënie; ✔ Lexuesit dhe gjyqtarët mund të vlerësojnë procesin dhe përgjegjësia mbetet e autorit
  • B) Përdorimi i inteligjencës artificiale zhvlerëson automatikisht rezultatet
  • C) Kërkohet nga revistat vetëm për qëllime reklamimi
  • D) Kalimi i të drejtës së autorit të shpjegimit tek inteligjenca artificiale

Zbulimi: Transparenca është e nevojshme në mënyrë që lexuesi dhe rishikuesit të mund të vlerësojnë se si janë prodhuar rezultatet; Shumë revista dhe institucione tani kërkojnë zbulimin e përdorimit të AI. Për më tepër, meqenëse inteligjenca artificiale mund të prodhojë gabime/halucinacione, është çështje ndershmërie të thuhet se përgjegjësia i mbetet autorit dhe cilat hapa janë audituar.

14. Çfarë kërkon 'kufizimi i përjashtimit' në metodën e Variablës së Instrumentit (IV)?

  • A) Mjeti ndikon në rezultat vetëm përmes ndryshores së brendshme, nuk ka asnjë mënyrë tjetër të drejtpërdrejtë ✔
  • B) Instrumenti nuk ka lidhje me variablin e rezultatit.
  • C) Instrumenti nuk ka lidhje me variablin endogjen.
  • D) Mesatarja është gjithmonë një ndryshore binare (0/1).

Shpjegimi: Kufizimi i përjashtimit kërkon që instrumenti të ndikojë në variablin e rezultatit vetëm nëpërmjet variablit shpjegues endogjen dhe jo nëpërmjet ndonjë mjeti tjetër të drejtpërdrejtë ose faktorëve të pavëzhguar. Ky supozim nuk mund të testohet plotësisht nga të dhënat; Ajo mbrohet në baza teorike dhe institucionale. AI mund të shkruajë kodin IV, por është detyra e studiuesit të mbrojë vlefshmërinë e mjetit.

15. Çfarë do të thotë problemi 'Kopshti i shtigjeve të pirunave' në analizat fleksibël pa regjistrim paraprak?

  • A) Shumë zgjedhje të arsyeshme analize të bëra në bazë të të dhënave rrisin shkallën false pozitive, edhe pa dashje ✔
  • B) Metodat e analizës duhet të jenë të vetme dhe të detyrueshme
  • C) Një problem që shfaqet vetëm kur ndodh mashtrimi i qëllimshëm.
  • D) Një situatë që zhduket spontanisht me rritjen e mostrës

Shpjegim: Pas shikimit të të dhënave, studiuesi mund të bëjë shumë zgjedhje të arsyeshme se cilën variabël, nëngrup, transformim ose prag do të përdorë. Edhe nëse nuk ka asnjë 'p-hakim të qëllimshëm' të vetëm, ky fleksibilitet rrit shkallën false pozitive sepse ai i rëndësishëm zgjidhet efektivisht nga një numër i madh analizash. Regjistrimi paraprak dhe një plan analize fikse e kufizojnë këtë fleksibilitet.