Dobici:
- Sposobnost izvještavanja o empirijskim nalazima ciljnoj publici (akademskoj, politici, menadžmentu) uz podršku umjetne inteligencije, na iskrenom i nedvosmislenom jeziku
- Sposobnost potpunog pisanja zaključaka, ograničenja i etičkih izjava (povjerljivost podataka, sukob interesa, otkrivanje korištenja umjetne inteligencije) i izbjegavanje obmanjujuće prezentacije
- Sposobnost veštačke inteligencije da prepozna nacrte izveštaja koji proizvode preuveličan, jednostran ili uzročno-posledičan jezik i zadrži tu odgovornost za konačni tekst i tvrdnje leži na istraživaču.
Modul Exam
1. Istraživač se pita 'Koji je koeficijent korelacije između nezaposlenosti i inflacije u Turskoj između 2015. i 2020. godine?' bez davanja ikakvih podataka vještačkoj inteligenciji. on pita i upisuje broj 0,62 direktno u svoj članak. Šta je suštinska greška u ovom pristupu?
- A) Očekivati konkretne statistike od vještačke inteligencije bez davanja provjerenih podataka; ✔ Korištenje broja koji je možda izmišljen bez provjere
- B) Koeficijent korelacije nikada ne treba koristiti u članku.
- C) Ne može se izračunati korelacija između nezaposlenosti i inflacije
- D) Vještačka inteligencija može pristupiti podacima tek nakon 2020
Objašnjenje: AI jezički model ne može proizvesti statistiku bez pristupa skupu podataka; Broj koji daje najvjerovatnije je halucinacija (izmišljena). Koeficijente, omjere i rezultate testa treba izračunati iz vlastitih potvrđenih podataka istraživača, a ne uzeti iz memorije modela.
2. Šta znači da podaci koji nedostaju 'ne nestaju nasumično' (MNAR) i zašto je to važno?
- A) Nedostatak je zbog same neopažene vrijednosti; Zato jednostavno zadavanje može stvoriti pristrasnost ✔
- B) Podaci nestaju potpuno nasumično i ne stvaraju nikakvu pristrasnost.
- C) Podatke koji nedostaju uvijek treba riješiti brisanjem reda.
- D) Podaci koji nedostaju ni na koji način ne utiču na analizu.
Objašnjenje: U slučaju MNAR-a (Missing Not At Random), sam nedostatak ovisi o veličini neopažene vrijednosti (npr. visoko zarađivači ne prijavljuju svoje prihode). U ovom slučaju, jednostavno brisanje ili prosječno dodjeljivanje daje pristrasne rezultate; Mehanizam nedostatka se mora modelirati. Metoda dodjeljivanja koju predlaže umjetna inteligencija ne bi se trebala primjenjivati slijepo bez poznavanja ovog mehanizma.
3. Analitičar ima AI da napravi trakasti grafikon, a AI započinje y-os na 40 umjesto od nule. Stvarna razlika od 2% između ove dvije grupe izgleda ogromna na grafikonu. Šta je pravi pristup?
- A) Pokretanje ose od nule ili promjena tipa grafikona; ✔ da pokaže pravu veličinu razlike bez obmanjivanja
- B) Korišćenje grafikona kakav jeste jer AI čini najbolji izbor
- C) Pokretanje ose na 45 da bi razlika bila još veća
- D) Nikada nemojte koristiti vizualne prikaze umjesto trakastih dijagrama
Objašnjenje: U trakastom grafikonu, isprekidana os (y-osa koja ne počinje od nule) dovodi u zabludu preuveličavanjem malih razlika. U iskrenoj vizualizaciji, os trakastog grafikona treba da počinje od nule ili razlika treba biti svjesno jasno izražena. Odgovornost analitičara je da provjeri sliku i ispravi je ako je potrebno.
4. Kako se činjenica da je koeficijent 'značajan' (p<0,05) u linearnoj regresiji često pogrešno predstavlja u tumačenju umjetne inteligencije?
- A) Preuveličano predstavljanje značaja jer je efekat velik i važan ili je utvrđena uzročnost ✔
- B) Značajnost uvek ukazuje da je efekat mali
- C) p<0,05 dokazuje da je koeficijent apsolutno tačan
- D) Značajni koeficijenti nikada ne bi trebali biti prijavljeni.
Objašnjenje: Statistička značajnost se odnosi na snagu dokaza da je efekat različit od nule; To ne znači da je efekat velik, važan ili uzročan. AI često predstavlja riječ 'značajan' kao 'značajan/snažan utjecaj'. Istraživač takođe treba da proceni veličinu efekta, interval poverenja i kontekst.
5. Na šta se odnosi pojam 'p-hacking' i zašto AI to može olakšati?
- A) Pokušaj više analiza dok ne dobije smisla; AI to radi vrlo brzo, povećavajući rizik ✔
- B) Jednokratna analiza podataka i sa unaprijed određenim planom
- C) proširenje uzorka radi povećanja p-vrijednosti
- D) Izvještavanje samo o deskriptivnoj statistici
Objašnjenje: p-hakiranje pokušava različite varijable, poduzorke, transformacije ili modele dok se ne pojavi smislen rezultat; ovo proizvodi lažne nalaze zasnovane na slučaju. Budući da AI može isprobati desetine varijanti modela u sekundi, može ubrzati p-hakovanje bez poštenog plana. odbrana; predregistracija, fiksni plan analize i višestruka korekcija poređenja.
6. Zašto bi pronalaženje visoke regresije R-kvadrata između dvije nestacionarne (jedinični korijen) vremenske serije moglo biti pogrešno?
- A) Lažna regresija može nastati zbog uobičajenog trenda; ✔ Visok R-kvadrat izlaz bez stvarnog odnosa
- B) Visok R-kvadrat uvijek dokazuje jaku uzročnu vezu.
- C) Nestacionarni nizovi se uopće ne mogu unijeti u regresiju.
- D) R-kvadrat se ne može izračunati u vremenskim serijama
Objašnjenje: Ako ne postoji zajednički kointegracijski odnos između nestacionarnih serija, lažna regresija može proizvesti visok R-kvadrat i značajan koeficijent samo zbog zajedničkog trenda; dok ne postoji pravi odnos. Stoga prvo treba uraditi testove stacionarnosti i jediničnog korijena, a ako je potrebno, treba uzeti razlike ili testirati kointegraciju.
7. Koja je osnovna pretpostavka zasnovana na validnosti dizajna razlika u razlikama?
- A) Pretpostavka paralelnih trendova: grupe bi slijedile isti smjer da nije bilo intervencije ✔
- B) Tretman i kontrolna grupa su potpuno iste na početku
- C) Normalna distribucija uzorka
- D) Varijable ne sadrže podatke koji nedostaju
Objašnjenje: DiD pretpostavlja da bi u odsustvu intervencije varijabla ishoda za tretiranu i kontrolnu grupu tekla paralelno tokom vremena (pretpostavka paralelnih trendova). Ako ova pretpostavka nije ispunjena, procjena je pristrasna. AI može proizvesti DiD kod, ali posao je istraživača da brani i testira paralelne trendove.
8. Šta od sljedećeg je obavezna praksa za ponovljivu analizu?
- A) Fiksiranje sjemena u nasumičnim koracima, snimanje verzija paketa i koda ✔
- B) Ručno kopirajte rezultate u tabelu i izbrišite kod
- C) Normalno je vidjeti različite rezultate u svakoj vožnji.
- D) Zadržavanje samo finalne grafike, ne dijeljenje podataka i koda
Opis: Reproducibilnost; Isti rezultat se može ponovo dobiti sa istim podacima i kodom. Popravljanje semena u nasumičnim koracima, čuvanje verzija paketa i izvršavanje koda unutar dokumenta (pismeno programiranje) su kamen temeljac ovoga. Ručno kopiranje rezultata ili korake bez evidentiranja na osnovu klika narušava ponovljivost.
9. Šta heteroskedastičnost iskrivljuje linearnu regresiju i koje je njeno uobičajeno rješenje?
- A) Iskrivljuje standardne greške; rješenje su robusne standardne greške ili odgovarajuća transformacija ✔
- B) Potpuno poništava procjene koeficijenata i nema rješenja
- C) Uvijek reducira R-kvadrat na nulu
- D) Javlja se samo ako je uzorak vrlo mali i može se zanemariti
Objašnjenje: Heteroscedastičnost ostavlja procjene koeficijenta nepristrasnim, ali pogrešno izračunava standardne greške; To čini p-vrijednosti i intervale povjerenja nepouzdanim. Uobičajeno rješenje je korištenje robusnih/HC standardnih grešaka ili odgovarajuća konverzija. Mora se provjeriti da rješenje koje je predložila AI zapravo rješava problem, a ne skriva ga.
10. Istraživač postavlja mikropodatke koji sadrže identifikacione informacije i prihode na nivou pacijenta u javni AI alat za ćaskanje i kaže 'napravi regresiju'. Šta je glavni problem ovakvog ponašanja?
- A) Učitavanje ličnih/licenciranih podataka na eksterni alat predstavlja kršenje povjerljivosti i ugovora ✔
- B) Regresiju uopće ne može napraviti umjetna inteligencija
- C) Mikro podaci uopće nisu prikladni za regresiju
- D) AI uvijek pogrešno izračuna regresiju
Objašnjenje: Lični/posebni podaci kao što su identitet i prihod su zaštićeni prema KVKK/GDPR i većini ugovora o korištenju podataka; Njihovo otpremanje na vanjski uređaj koji može pohraniti podatke predstavlja kršenje. Pravi put; Anonimiziranje podataka, korištenje lokalnih/institucionalnih sigurnih alata ili jednostavno traženje koda od umjetne inteligencije i pokretanje koda u vlastitom okruženju.
11. Šta se opaža kada je multikolinearnost visoka?
- A) Koeficijenti postaju nestabilni i standardne greške postaju naduvane; Pojedinačni koeficijenti mogu se pokazati besmislenim ✔
- B) R-kvadrat se uvijek smanjuje na nulu
- C) Procjene koeficijenata sve vrijeme postaju preciznije
- D) Razmjer zavisne varijable se mijenja
Objašnjenje: U visokoj multikolinearnosti, nezavisne varijable su u snažnoj korelaciji jedna s drugom; Procjene koeficijenata postaju nestabilne, standardne greške postaju naduvane, a pojedinačni koeficijenti mogu ispasti beznačajni, dok cjelokupni model može biti značajan. Dijagnostikuje se kriterijumima kao što je VIF. Umjetna inteligencija može predložiti eliminaciju varijabli, ali na istraživaču je da odluči koja varijabla treba ostati teoretska.
12. Šta je statistička moć i koji je rizik studije male snage?
- A) Mogućnost detekcije postojećeg efekta; mala snaga propušta prave efekte i čini nalaze nepouzdanim ✔
- B) vjerovatnoća smanjenja p-vrijednosti; niža snaga uvijek daje pouzdanije rezultate
- C) Konstantna vrijednost neovisna o veličini uzorka
- D) Koncept koji vrijedi samo kada se koristi umjetna inteligencija
Objašnjenje: Snaga je vjerojatnost otkrivanja efekta koji stvarno postoji (1 minus greška tipa II). Studije male snage mogu propustiti prave efekte; Uz to, nekoliko značajnih rezultata može imati preuveličanu veličinu efekta ('prokletstvo pobjednika') i povećava se stopa lažnih pozitivnih rezultata. Stoga je proračun snage/uzorka važan prije analize.
13. Zašto je etički neophodno otkriti upotrebu umjetne inteligencije u članku?
- A) Za transparentnost i odgovornost; ✔ Čitaoci i recenzenti mogu ocijeniti proces i odgovornost ostaje na autoru
- B) Upotreba umjetne inteligencije automatski poništava rezultate
- C) Zatraženi od strane časopisa samo u reklamne svrhe
- D) Prenošenje autorskih prava na objašnjenje na vještačku inteligenciju
Otkrivanje: Transparentnost je neophodna kako bi čitalac i recenzenti mogli da procene kako su rezultati proizvedeni; Mnogi časopisi i institucije sada zahtijevaju otkrivanje upotrebe AI. Osim toga, budući da umjetna inteligencija može proizvesti greške/halucinacije, pošteno je reći da odgovornost ostaje na autoru i koji su koraci revidirani.
14. Šta zahtijeva 'ograničenje isključenja' u metodi varijable instrumenta (IV)?
- A) Alat utiče na rezultat samo preko interne varijable, nema drugog direktnog načina ✔
- B) Instrument nema vezu sa varijablom ishoda.
- C) Instrument nije povezan sa endogenom varijablom.
- D) Srednja vrijednost je uvijek binarna (0/1) varijabla
Objašnjenje: Ograničenje isključenja zahtijeva da instrument utječe na varijablu ishoda samo kroz endogenu eksplanatornu varijablu, a ne kroz bilo koja druga direktna sredstva ili neopažene faktore. Ova pretpostavka se ne može u potpunosti testirati na osnovu podataka; Brani se na teorijskim i institucionalnim osnovama. AI može napisati IV kod, ali je posao istraživača da brani valjanost alata.
15. Šta znači problem 'Bašta staza koje se račvaju' u fleksibilnim analizama bez predregistracije?
- A) Previše razumnih izbora analize napravljenih na osnovu podataka povećava stopu lažno pozitivnih, čak i nenamjerno ✔
- B) Metode analize moraju biti pojedinačne i obavezne
- C) Problem koji se javlja samo kada dođe do namjernog varanja.
- D) Situacija koja spontano nestaje kako uzorak raste
Objašnjenje: Nakon pregleda podataka, istraživač može napraviti mnogo razumnih izbora o tome koju će varijablu, podgrupu, transformaciju ili prag koristiti. Čak i ako ne postoji jedno 'namjerno p-hakovanje', ova fleksibilnost povećava stopu lažnih pozitivnih rezultata jer se značajna efektivno bira iz velikog broja analiza. Predregistracija i fiksni plan analize ograničavaju ovu fleksibilnost.