zisky:
- Schopnost hlásit empirická zjištění cílové skupině (akademická, politická, management) s podporou umělé inteligence, čestným a jednoznačným jazykem
- Schopnost plně sepsat závěry, omezení a etická prohlášení (důvěrnost dat, střet zájmů, zveřejnění použití umělé inteligence) a vyhnout se zavádějící prezentaci
- Schopnost umělé inteligence rozpoznat návrhy zpráv, které produkují přehnaný, jednostranný nebo kauzální jazyk, a zachovat, že odpovědnost za konečný text a tvrzení spočívá na výzkumníkovi.
Modulová zkouška
1. Výzkumník se ptá: "Jaký je korelační koeficient mezi nezaměstnaností a inflací v Turecku v letech 2015 až 2020?" aniž by umělá inteligence poskytla jakákoli data. ptá se a přímo do svého článku píše číslo 0,62. Jaká je zásadní chyba tohoto přístupu?
- A) Očekávání konkrétních statistik od umělé inteligence bez poskytnutí ověřených údajů; ✔ Použití čísla, které mohlo být vymyšleno bez jeho ověření
- B) V článku by nikdy neměl být použit korelační koeficient.
- C) Nelze vypočítat korelaci mezi nezaměstnaností a inflací
- D) Umělá inteligence má přístup k datům až po roce 2020
Vysvětlení: Jazykový model AI nemůže vytvářet statistiky bez přístupu k datové množině; Číslo, které uvádí, je s největší pravděpodobností halucinace (vymyšlená). Koeficienty, poměry a výsledky testů by měly být vypočteny z vlastních ověřených dat výzkumníka, nikoli převzaty z paměti modelu.
2. Co znamená, že chybějící data „nechybějí náhodně“ (MNAR) a proč je to důležité?
- A) nedostatek je způsoben samotnou nepozorovanou hodnotou; To je důvod, proč jednoduché zadání může způsobit zkreslení ✔
- B) Data mizí zcela náhodně a nevytváří žádné zkreslení.
- C) Chybějící údaje by měly být vždy vyřešeny smazáním řádku.
- D) Chybějící data nemají na analýzu žádný vliv.
Vysvětlení: V případě MNAR (Missing Not At Random) závisí samotná chybějící hodnota na velikosti nepozorované hodnoty (např. osoby s vysokými příjmy neuvádějí své příjmy). V tomto případě jednoduché vymazání nebo průměrné přiřazení dává zkreslené výsledky; Mechanismus nedostatku musí být modelován. Metoda přiřazení navržená umělou inteligencí by neměla být aplikována slepě bez znalosti tohoto mechanismu.
3. Analytik nechá AI vytvořit sloupcový graf a AI začne osu y na 40 místo nuly. Skutečný rozdíl 2 % mezi těmito dvěma skupinami vypadá na grafu obrovský. Jaký je správný přístup?
- A) Spuštění osy od začátku nebo změna typu grafu; ✔ ukázat skutečnou velikost rozdílu bez zavádějícího
- B) Použijte graf tak, jak je, protože AI je nejlepší volbou
- C) Začátek osy na 45, aby byl rozdíl ještě větší
- D) Nikdy nepoužívejte vizuální prvky místo sloupcových grafů
Vysvětlení: Ve sloupcovém grafu je přerušovaná osa (osa y, která nezačíná od nuly) zavádějící tím, že zveličuje malé rozdíly. V poctivé vizualizaci by osa sloupcových grafů měla začínat od nuly nebo by měl být rozdíl vědomě jasně uveden. Je odpovědností analytika obrázek ověřit a v případě potřeby opravit.
4. Jak je v interpretaci umělé inteligence často chybně uváděna skutečnost, že koeficient je „významný“ (p<0,05) v lineární regresi?
- A) Přehnaná prezentace významu, protože účinek je velký a důležitý nebo je prokázána kauzalita ✔
- B) Význam vždy naznačuje, že účinek je malý
- C) p<0,05 dokazuje, že koeficient je naprosto správný
- D) Významné koeficienty by se nikdy neměly uvádět.
Vysvětlení: Statistická významnost se týká síly důkazu, že účinek je odlišný od nuly; Neznamená to, že účinek je velký, důležitý nebo kauzální. AI často prezentuje slovo „významný“ jako „významný/silný dopad“. Výzkumník by měl také vyhodnotit velikost účinku, interval spolehlivosti a kontext.
5. Co znamená pojem „p-hacking“ a proč jej může AI usnadnit?
- A) Zkoušet více analýz, dokud to nedává smysl; AI to dělá velmi rychle a zvyšuje riziko ✔
- B) Analýza dat jednou a podle předem stanoveného plánu
- C) rozšíření vzorku pro zvýšení p-hodnoty
- D) Vykazování pouze popisné statistiky
Vysvětlení: p-hacking zkouší různé proměnné, dílčí vzorky, transformace nebo modely, dokud se neobjeví smysluplný výsledek; to vytváří falešné nálezy založené na náhodě. Vzhledem k tomu, že umělá inteligence může vyzkoušet desítky modelových variant během několika sekund, může urychlit p-hacking bez poctivého plánu. Obrana; předregistrace, pevný plán analýzy a oprava vícenásobného srovnání.
6. Proč může být nalezení vysoké R-kvadrát regrese mezi dvěma nestacionárními (jednotkový kořen) časovými řadami zavádějící?
- A) Nepravá regrese může nastat kvůli společnému trendu; ✔ Vysoký výkon R-kvadrát bez skutečného vztahu
- B) Vysoká R-kvadrát vždy dokazuje silný kauzální vztah.
- C) Nestacionární řady nelze do regrese vůbec vstupovat.
- D) R-squared nelze vypočítat v časové řadě
Vysvětlení: Pokud mezi nestacionárními řadami neexistuje společný kointegrační vztah, může falešná regrese produkovat vysokou R-kvadrát a významný koeficient pouze díky společnému trendu; zatímco neexistuje žádný skutečný vztah. Proto by měly být nejprve provedeny testy stacionarity a jednotkového kořene a v případě potřeby by měly být zjištěny rozdíly nebo by měla být testována kointegrace.
7. Jaký základní předpoklad je založen na platnosti návrhu Difference-in-Differences?
- A) Předpoklad paralelních trendů: skupiny by sledovaly stejný směr, pokud by neexistovala žádná intervence ✔
- B) Léčebná a kontrolní skupina jsou na začátku úplně stejné
- C) Normální rozdělení vzorku
- D) Proměnné neobsahují žádná chybějící data
Vysvětlení: DiD předpokládá, že v případě absence intervence by se výsledná proměnná pro léčebnou a kontrolní skupinu vyvíjela paralelně v čase (předpoklad paralelních trendů). Pokud tento předpoklad není splněn, je odhad zkreslený. AI dokáže vytvořit kód DiD, ale úkolem výzkumníka je bránit a testovat paralelní trendy.
8. Který z následujících postupů je povinným postupem pro reprodukovatelnou analýzu?
- A) Fixování semene v náhodných krocích, zaznamenávání verzí balíčků a kódu ✔
- B) Ručně zkopírujte výsledky do tabulky a smažte kód
- C) Je normální vidět různé výsledky v každém běhu.
- D) Zachování pouze finální grafiky, nesdílení dat a kódu
Popis: Reprodukovatelnost; Stejný výsledek lze získat znovu se stejnými daty a kódem. Oprava seedu v náhodných krocích, ukládání verzí balíčků a spouštění kódu v dokumentu (gramotné programování) jsou základními kameny toho. Ruční kopírování výsledků nebo kroky bez protokolování na základě kliknutí narušují reprodukovatelnost.
9. Čím heteroskedasticita zkresluje lineární regresi a jaké je její společné řešení?
- A) Zkresluje standardní chyby; řešením jsou robustní standardní chyby nebo vhodná transformace ✔
- B) Zcela znehodnocuje odhady koeficientů a nemá řešení
- C) Vždy snižuje R-square na nulu
- D) Vyskytuje se pouze v případě, že je vzorek velmi malý a lze jej ignorovat
Vysvětlení: Heteroscedasticita ponechává odhady koeficientů nestranné, ale chybně počítá standardní chyby; Díky tomu jsou p-hodnoty a intervaly spolehlivosti nespolehlivé. Běžným řešením je použití robustních/HC standardních chyb nebo vhodné konverze. Je třeba ověřit, že řešení navržené umělou inteligencí problém ve skutečnosti řeší, nikoli jej skrývá.
10. Výzkumník nahraje mikrodata obsahující identifikační informace na úrovni pacienta a příjem do veřejného chatovacího nástroje AI a řekne „proveďte regresi“. Jaký je hlavní problém tohoto chování?
- A) Nahrání osobních/licencovaných údajů do externího nástroje představuje porušení důvěrnosti a smlouvy ✔
- B) Regresi neumí umělá inteligence vůbec
- C) Mikrodata nejsou pro regresi vůbec vhodná
- D) AI vždy špatně vypočítá regresi
Vysvětlení: Osobní/zvláštní údaje, jako je identita a příjem, jsou chráněny podle KVKK/GDPR a většiny smluv o používání údajů; Jejich nahrání na externí zařízení, které může ukládat data, je porušením pravidel. Správná cesta; Anonymizace dat, používání místních/institucionálních zabezpečených nástrojů nebo jednoduše vyžádání kódu od umělé inteligence a spuštění kódu ve vlastním prostředí.
11. Co je pozorováno, když je multikolinearita vysoká?
- A) Koeficienty se stanou nestabilními a standardní chyby se nafouknou; Jednotlivé koeficienty se mohou ukázat jako nesmyslné ✔
- B) R-squared vždy klesá na nulu
- C) Odhady koeficientů jsou stále přesnější
- D) Měřítka závislé proměnné se mění
Vysvětlení: Při vysoké multikolinearitě jsou nezávislé proměnné navzájem silně korelovány; Odhady koeficientů se stanou nestabilními, standardní chyby se nafouknou a jednotlivé koeficienty se mohou ukázat jako nevýznamné, zatímco celkový model může být významný. Diagnostikuje se podle kritérií, jako je VIF. Umělá inteligence může navrhnout eliminaci proměnné, ale je na výzkumníkovi, aby rozhodl, která proměnná by měla zůstat teoretická.
12. Co je statistická síla a jaké je riziko nízkovýkonové studie?
- A) Možnost detekce existujícího efektu; nízký výkon postrádá skutečné účinky a činí zjištění nespolehlivá ✔
- B) pravděpodobnost snížení p-hodnoty; nižší výkon vždy poskytuje spolehlivější výsledky
- C) Konstantní hodnota nezávislá na velikosti vzorku
- D) Koncept, který je platný pouze při použití umělé inteligence
Vysvětlení: Výkon je pravděpodobnost detekce efektu, který skutečně existuje (1 mínus chyba typu II). Studie s nízkým výkonem mohou postrádat skutečné účinky; Kromě toho může několik významných výsledků nést přehnanou velikost účinku („prokletí vítěze“) a zvyšuje se míra falešně pozitivních výsledků. Proto je před analýzou důležitý výpočet výkonu/vzorku.
13. Proč je eticky nutné zveřejňovat použití umělé inteligence v článku?
- A) Pro transparentnost a odpovědnost; ✔ čtenáři a recenzenti mohou proces hodnotit a odpovědnost zůstává na autorovi
- B) Použití umělé inteligence automaticky znehodnocuje výsledky
- C) Žádané časopisy pouze pro reklamní účely
- D) Přenesení autorských práv k vysvětlení na umělou inteligenci
Zveřejnění: Transparentnost je nezbytná, aby čtenář a recenzenti mohli vyhodnotit, jak byly výsledky vytvořeny; Mnoho časopisů a institucí nyní vyžaduje zveřejnění používání AI. Navíc, protože umělá inteligence může produkovat chyby/halucinace, je věcí poctivosti prohlásit, že odpovědnost zůstává na autorovi a které kroky byly auditovány.
14. Co vyžaduje „omezení vyloučení“ v metodě Instrument Variable (IV)?
- A) Nástroj ovlivňuje výsledek pouze prostřednictvím interní proměnné, jiná přímá cesta neexistuje ✔
- B) Nástroj nemá žádný vztah s výslednou proměnnou.
- C) Nástroj nesouvisí s endogenní proměnnou.
- D) Průměr je vždy binární (0/1) proměnná
Vysvětlení: Vylučovací omezení vyžaduje, aby nástroj ovlivňoval výslednou proměnnou pouze prostřednictvím endogenní vysvětlující proměnné a nikoli prostřednictvím jakýchkoli jiných přímých prostředků nebo nepozorovaných faktorů. Tento předpoklad nelze plně otestovat z dat; Je obhajován na teoretické a institucionální půdě. AI může napsat kód IV, ale je úkolem výzkumníka obhájit platnost nástroje.
15. Co znamená problém „Zahrada rozvětvených cest“ ve flexibilních analýzách bez předběžné registrace?
- A) Příliš mnoho rozumných analýz provedených na základě dat zvyšuje míru falešně pozitivních výsledků, a to i neúmyslně ✔
- B) Metody analýzy musí být jediné a povinné
- C) Problém, který nastane pouze tehdy, když dojde k úmyslnému podvádění.
- D) Situace, která spontánně mizí, jak vzorek roste
Vysvětlení: Po zobrazení dat může výzkumník učinit mnoho rozumných rozhodnutí, kterou proměnnou, podskupinu, transformaci nebo prahovou hodnotu použít. I když neexistuje jediný „úmyslný p-hacking“, tato flexibilita zvyšuje míru falešně pozitivních výsledků, protože významná z nich je efektivně vybrána z velkého počtu analýz. Předběžná registrace a pevný plán analýzy tuto flexibilitu omezují.