Dobici:
- Sposobnost izvješćivanja o empirijskim nalazima ciljnoj publici (akademsko društvo, politika, menadžment) uz podršku umjetne inteligencije, na iskrenom i nedvosmislenom jeziku
- Sposobnost potpunog pisanja zaključaka, ograničenja i etičkih izjava (povjerljivost podataka, sukob interesa, otkrivanje korištenja umjetne inteligencije) i izbjegavanje pogrešne prezentacije
- Sposobnost umjetne inteligencije da prepozna nacrte izvješća koji proizvode pretjeran, jednostran ili kauzalni jezik i zadrži da odgovornost za konačni tekst i tvrdnje leži na istraživaču.
Modul ispit
1. Istraživač pita 'Koji je koeficijent korelacije između nezaposlenosti i inflacije u Turskoj između 2015. i 2020.?' bez davanja ikakvih podataka umjetnoj inteligenciji. pita on i upisuje broj 0,62 izravno u svoj članak. Koja je temeljna pogreška u ovom pristupu?
- A) Očekivati konkretne statistike od umjetne inteligencije bez davanja provjerenih podataka; ✔ Korištenje broja koji je možda izmišljen bez provjere
- B) Koeficijent korelacije nikada se ne smije koristiti u članku.
- C) Ne može se izračunati korelacija između nezaposlenosti i inflacije
- D) Umjetna inteligencija može pristupiti podacima tek nakon 2020
Objašnjenje: AI jezični model ne može proizvesti statistiku bez pristupa skupu podataka; Broj koji navodi najvjerojatnije je halucinacija (izmišljena). Koeficijenti, omjeri i rezultati ispitivanja trebali bi se izračunati iz vlastitih provjerenih podataka istraživača, a ne uzeti iz memorije modela.
2. Što za podatke koji nedostaju znači da ne nedostaju nasumično (MNAR) i zašto je to važno?
- A) Nedostatak je posljedica same neuočene vrijednosti; Zato jednostavno dodjeljivanje može stvoriti pristranost ✔
- B) Podaci nestaju potpuno nasumično i ne stvaraju nikakvu pristranost.
- C) Podatke koji nedostaju uvijek treba riješiti brisanjem retka.
- D) Podaci koji nedostaju ni na koji način ne utječu na analizu.
Objašnjenje: U slučaju MNAR (Missing Not At Random), sam nedostatak ovisi o veličini neuočene vrijednosti (npr. osobe s visokim primanjima ne prijavljuju svoje prihode). U ovom slučaju, jednostavno brisanje ili prosječno dodjeljivanje daje pristrane rezultate; Mehanizam nedostatka mora se modelirati. Metoda dodjele koju predlaže umjetna inteligencija ne bi se trebala primjenjivati slijepo bez poznavanja ovog mehanizma.
3. Analitičar ima umjetnu inteligenciju da napravi trakasti grafikon, a umjetna inteligencija počinje y-os na 40 umjesto na nuli. Stvarna razlika od 2% između dvije skupine izgleda golema na grafikonu. Koji je pravi pristup?
- A) Pokretanje osi od nule ili promjena vrste grafikona; ✔ pokazati pravu veličinu razlike bez obmane
- B) Korištenje grafikona kakav jest jer umjetna inteligencija daje najbolji izbor
- C) Pokretanje osi od 45 kako bi razlika bila još veća
- D) Nikada nemojte koristiti vizualne elemente umjesto stupčastih grafikona
Objašnjenje: U trakastom dijagramu isprekidana os (y-os koja ne počinje od nule) dovodi u zabludu preuveličavanjem malih razlika. U poštenoj vizualizaciji, os trakastih dijagrama trebala bi krenuti od nule ili bi razlika trebala biti svjesno jasno navedena. Odgovornost analitičara je provjeriti sliku i ispraviti je ako je potrebno.
4. Kako se činjenica da je koeficijent 'značajan' (p<0,05) u linearnoj regresiji često pogrešno predstavlja u tumačenju umjetne inteligencije?
- A) Pretjerano predstavljanje značaja jer je učinak velik i važan ili je uzročnost utvrđena ✔
- B) Značaj uvijek ukazuje na to da je učinak mali
- C) p<0,05 dokazuje da je koeficijent apsolutno točan
- D) Značajni koeficijenti se nikada ne bi trebali prijaviti.
Objašnjenje: Statistička značajnost odnosi se na snagu dokaza da je učinak različit od nule; To ne znači da je učinak velik, važan ili uzročan. AI često predstavlja riječ 'značajno' kao 'značajan/jak utjecaj'. Istraživač također treba procijeniti veličinu učinka, interval pouzdanosti i kontekst.
5. Na što se odnosi pojam 'p-hakiranje' i zašto ga AI može olakšati?
- A) Isprobavanje višestrukih analiza dok ne postane smisleno; AI to čini vrlo brzo, povećavajući rizik ✔
- B) Jednokratna analiza podataka s unaprijed određenim planom
- C) proširenje uzorka za povećanje p-vrijednosti
- D) Izvještavanje samo o deskriptivnoj statistici
Objašnjenje: p-hakiranje je isprobavanje različitih varijabli, poduzoraka, transformacija ili modela dok se ne pojavi smisleni rezultat; ovo proizvodi lažne nalaze temeljene na slučaju. Budući da AI može isprobati desetke varijanti modela u sekundi, može ubrzati p-hakiranje bez poštenog plana. Obrana; predbilježba, fiksni plan analize i korekcija višestruke usporedbe.
6. Zašto bi nalaženje visokog R-kvadrata regresije između dva nestacionarna (jediničnog korijena) vremenska niza moglo dovesti u zabludu?
- A) Lažna regresija može se pojaviti zbog zajedničkog trenda; ✔ Visok rezultat R-kvadrata bez stvarnog odnosa
- B) Visoki R-kvadrat uvijek dokazuje jaku uzročnu vezu.
- C) Nestacionarni niz se uopće ne može unijeti u regresiju.
- D) R-kvadrat se ne može izračunati u vremenskoj seriji
Objašnjenje: Ako ne postoji zajednički kointegracijski odnos između nestacionarnih nizova, lažna regresija može proizvesti visoki R-kvadrat i značajan koeficijent samo zbog zajedničkog trenda; dok nema pravog odnosa. Stoga bi prvo trebalo napraviti testove stacionarnosti i jediničnog korijena, a ako je potrebno, uzeti razlike ili testirati kointegraciju.
7. Koja se osnovna pretpostavka temelji na valjanosti dizajna razlika u razlikama?
- A) Pretpostavka o paralelnim trendovima: grupe bi slijedile isti smjer da nije bilo intervencije ✔
- B) Terapijska i kontrolna skupina potpuno su iste na početku
- C) Normalna raspodjela uzorka
- D) Varijable ne sadrže podatke koji nedostaju
Objašnjenje: DiD pretpostavlja da bi u nedostatku intervencije varijabla ishoda za liječenu i kontrolnu skupinu tekla paralelno tijekom vremena (pretpostavka paralelnih trendova). Ako ova pretpostavka nije ispunjena, procjena je pristrana. AI može proizvesti DiD kod, ali posao je istraživača braniti i testirati paralelne trendove.
8. Što je od sljedećeg obvezna praksa za ponovljivu analizu?
- A) Popravljanje sjemena u nasumičnim koracima, snimanje verzija paketa i koda ✔
- B) Ručno kopirajte rezultate u proračunsku tablicu i izbrišite kod
- C) Normalno je vidjeti različite rezultate u svakoj vožnji.
- D) Zadržavanje samo konačne grafike, bez dijeljenja podataka i koda
Opis: ponovljivost; Isti rezultat može se ponovno dobiti s istim podacima i kodom. Popravljanje seeda u nasumičnim koracima, spremanje verzija paketa i izvršavanje koda unutar dokumenta (pismeno programiranje) kamen su temeljac ovoga. Ručno kopiranje rezultata ili koraci koji se temelje na klikovima i koji se ne bilježe smanjuju ponovljivost.
9. Što heteroskedastičnost iskrivljuje linearnu regresiju i koje je njezino uobičajeno rješenje?
- A) Iskrivljuje standardne pogreške; rješenje su robusne standardne pogreške ili odgovarajuća transformacija ✔
- B) Potpuno poništava procjene koeficijenata i nema rješenja
- C) Uvijek svodi R-kvadrat na nulu
- D) Javlja se samo ako je uzorak vrlo malen i može se zanemariti
Objašnjenje: Heteroskedastičnost ostavlja procjene koeficijenata nepristranim, ali pogrešno izračunava standardne pogreške; To čini p-vrijednosti i intervale pouzdanosti nepouzdanima. Uobičajeno rješenje je korištenje robusnih/HC standardnih pogrešaka ili odgovarajuće pretvorbe. Mora se provjeriti da rješenje koje predlaže AI zapravo rješava problem, a ne da ga skriva.
10. Istraživač učitava mikropodatke koji sadrže podatke o identifikaciji i prihodu na razini pacijenta u javni AI chat alat i kaže 'napravi regresiju'. Koji je glavni problem s ovim ponašanjem?
- A) Prijenos osobnih/licenciranih podataka na vanjski alat predstavlja kršenje povjerljivosti i ugovora ✔
- B) Regresiju uopće ne može učiniti umjetna inteligencija
- C) Mikro podaci uopće nisu prikladni za regresiju
- D) AI uvijek pogrešno izračunava regresiju
Objašnjenje: Osobni/posebni podaci kao što su identitet i prihod zaštićeni su KVKK/GDPR i većinom ugovora o korištenju podataka; Njihov prijenos na vanjski uređaj koji može pohranjivati podatke predstavlja kršenje. Pravi način; Anonimiziranje podataka, korištenje lokalnih/institucionalnih sigurnih alata ili jednostavno traženje koda od umjetne inteligencije i pokretanje koda u vlastitom okruženju.
11. Što se opaža kada je multikolinearnost velika?
- A) Koeficijenti postaju nestabilni i standardne pogreške postaju napuhane; Pojedinačni koeficijenti mogu se pokazati besmislenim ✔
- B) R-kvadrat se uvijek smanjuje na nulu
- C) Procjene koeficijenata postaju sve preciznije
- D) Mjenja se skala zavisne varijable
Objašnjenje: U visokoj multikolinearnosti, nezavisne varijable su snažno povezane jedna s drugom; Procjene koeficijenata postaju nestabilne, standardne pogreške postaju napuhane, a pojedinačni koeficijenti mogu ispasti beznačajni, dok ukupni model može biti značajan. Dijagnosticira se kriterijima kao što je VIF. Umjetna inteligencija može predložiti uklanjanje varijabli, ali na istraživaču je da odluči koja varijabla treba ostati teoretska.
12. Što je statistička snaga i koliki je rizik studije niske snage?
- A) Mogućnost otkrivanja postojećeg učinka; mala snaga propušta prave učinke i čini nalaze nepouzdanima ✔
- B) vjerojatnost smanjenja p-vrijednosti; manja snaga uvijek daje pouzdanije rezultate
- C) Konstantna vrijednost neovisna o veličini uzorka
- D) Koncept koji vrijedi samo kada se koristi umjetna inteligencija
Objašnjenje: Snaga je vjerojatnost otkrivanja učinka koji stvarno postoji (1 minus pogreška tipa II). Studije niske snage mogu propustiti prave učinke; Osim toga, nekoliko značajnih rezultata može imati pretjeranu veličinu učinka ('prokletstvo pobjednika') i stopa lažno pozitivnih rezultata se povećava. Stoga je izračun snage/uzorka važan prije analize.
13. Zašto je etički nužno otkriti korištenje umjetne inteligencije u članku?
- A) Za transparentnost i odgovornost; ✔ čitatelji i recenzenti mogu ocijeniti postupak, a odgovornost ostaje na autoru
- B) Korištenje umjetne inteligencije automatski poništava rezultate
- C) Traže ga časopisi samo u reklamne svrhe
- D) Prijenos autorskih prava objašnjenja na umjetnu inteligenciju
Objavljivanje: Transparentnost je neophodna kako bi čitatelj i recenzenti mogli procijeniti kako su rezultati proizvedeni; Mnogi časopisi i institucije sada zahtijevaju otkrivanje upotrebe umjetne inteligencije. Osim toga, budući da umjetna inteligencija može proizvesti pogreške/halucinacije, stvar je poštenja reći da odgovornost ostaje na autoru i koji su koraci revidirani.
14. Što zahtijeva 'ograničenje isključenja' u metodi instrument varijable (IV)?
- A) Alat utječe na rezultat samo preko unutarnje varijable, ne postoji drugi izravan način ✔
- B) Instrument nema veze s varijablom ishoda.
- C) Instrument nije povezan s endogenom varijablom.
- D) Srednje je uvijek binarna (0/1) varijabla
Objašnjenje: Ograničenje isključenja zahtijeva da instrument utječe na varijablu ishoda samo putem endogene eksplanatorne varijable, a ne putem drugih izravnih sredstava ili neopaženih čimbenika. Ova se pretpostavka ne može u potpunosti provjeriti na temelju podataka; Brani se na teorijskim i institucionalnim osnovama. AI može napisati IV kod, ali posao je istraživača da brani valjanost alata.
15. Što znači problem 'Vrt račvanja' u fleksibilnim analizama bez predbilježbe?
- A) Previše razumnih analiza napravljenih na temelju podataka povećava stopu lažno pozitivnih rezultata, čak i nenamjerno ✔
- B) Metode analize moraju biti jedinstvene i obvezne
- C) Problem koji se javlja samo kada se dogodi namjerno varanje.
- D) Situacija koja spontano nestaje kako uzorak raste
Objašnjenje: Nakon pregledavanja podataka, istraživač može napraviti mnogo razumnih izbora o tome koju će varijablu, podskupinu, transformaciju ili prag koristiti. Čak i ako nema pojedinačnog 'namjernog p-hakiranja', ova fleksibilnost povećava stopu lažno pozitivnih rezultata jer se značajna uspješno odabire iz velikog broja analiza. Predregistracija i fiksni plan analize ograničavaju ovu fleksibilnost.