zisky:
- Pochopte, že p-hacking, HARKing, selektivní hlášení a zahrada rozvětvených cest produkují falešná zjištění a uvidíte, jak umělá inteligence může tyto pasti urychlit.
- Schopnost vytvořit obranu, jako je předběžná registrace, plán analýzy, disciplína vícenásobného srovnání a analýza citlivosti s podporou umělé inteligence
- Schopnost internalizovat poctivý návrh požadavků, který umožní umělé inteligenci odmítnout požadavky typu „najít smysluplný výsledek“ a že konečná odpovědnost leží na výzkumníkovi.
V předchozí části jsme viděli, co je p-hodnota a co není. V této jednotce se podíváme na temnější téma, systematické pasti, které ohrožují statistickou integritu. Většina z nich není záměrné podvádění; Jde o zákeřné mechanismy, do kterých spadají i badatelé s dobrými úmysly, aniž by si to uvědomovali. A umělá inteligence (AI) tyto nástrahy usnadňuje a urychluje, protože umožňuje provádět desítky analýz během několika sekund. Cílem této jednotky je zavést disciplínu, která přemění AI ze „stroje na hledání smysluplných výsledků“ v poctivého pomocníka.
Základní úskalí
p-hacking (hledání p-hodnoty): Zkouší znovu analýzu různými způsoby, dokud není získán významný výsledek (p<0,05). Přidávání a odstraňování proměnných, výběr dílčích vzorků, změna definice odlehlých hodnot, zkoušení různých transformací, používání různých výsledných proměnných, zastavení sběru dat, když to začne mít smysl... Každý pokus dává novou „šanci“; Pokud se budete dostatečně snažit, jeden z nich se ukáže jako smysluplný, i když ve skutečnosti nemá žádný účinek. Výsledek: falešné nálezy, které byly publikovány, ale nereprodukovatelné.
HARKing (Hypothesizing After the Results are Known): Vytváření hypotézy poté, co viděl výsledky a prezentovat ji jako „Takhle jsem to předpovídal od začátku“. Podíváte se na data a najdete nejpozoruhodnější vztah, pak napíšete papír, jako by byl navržen k testování této hypotézy. To uvádí čtenáře v omyl tím, že se objev jeví jako potvrzení.
Selektivní zpravodajství (cherry-picking): Vykazování jen těch „dobrých“ z desítek analýz a tiché pohřbívání zbytku. To je také známé jako "problém se zásuvkou souborů": nesmyslné výsledky zůstávají v zásuvce, takže literatura je systematicky zaujatá.
Zahrada rozdvojených cest: termín Andrewa Gelmana. I bez jediného záměrného p-hackingu činí výzkumník mnoho rozumných rozhodnutí na základě dat (která proměnná, která prahová hodnota, která podskupina, která transformace). Těchto vyšetřovacích stupňů volnosti je tak mnoho, že si z mnoha analýz efektivně vybíráte ten smysluplný – dokonce bez jakéhokoli špatného úmyslu. Výsledkem je opět rostoucí míra falešně pozitivních výsledků.
Pozor: Většina z těchto pastí nejsou záměrné triky. Součet zdánlivě nevinných kroků jako „Právě jsem vyzkoušel pár dalších modelů“, „bylo to čistší, když jsem odstranil odlehlou hodnotu“, „v této podskupině je efekt jasnější“ může přinést falešné zjištění. Upřímnost je věcí metody, ne záměru.
Proč AI zvětšuje tyto pasti?
Ruční vyzkoušení 3 modelů zabere čas; YZ vyrábí 50 modelových variant, 10 různých konverzí, 8 podskupin během několika minut. Tato síla je katastrofální bez poctivého plánu: požadavek jako „najděte smysluplný vztah v těchto datech“ nebo „vytvořte model, který tuto hypotézu podporuje“ promění AI přímo v motor p-hackingu. AI také chce být nápomocná; má tendenci najít „smysluplný“ výsledek, který vás uspokojí. Proto je váš pohotový návrh první obrannou linií poctivosti.
Obrana: férové jednání
1. Předregistrace: Znamená to zaznamenat vaši hypotézu, proměnné, model a testy písemně (případně na platformě s časovým razítkem) před provedením analýzy. Objev je tedy oddělen od potvrzení; vše, co poté změníte, je označeno jako „průzkumník“.
2. Plán analýzy: I když nemůžete provést záznam předem, před ponořením se do dat sepište plán analýzy: primární hypotéza, primární výsledná proměnná, hlavní model. Od začátku rozlišujte mezi „hlavní analýzou“ a „dodatečnou/průzkumnou analýzou“ a udržujte jej ve zprávě.
3. Vše nahlaste: Neschovávejte modely, které jste vyzkoušeli. V části „analýza citlivosti“ (kontrola robustnosti) ukažte, jak různé specifikace mění výsledek. Zjištění je silné pouze tehdy, pokud obstojí pod mnoha přijatelnými volbami.
4. Disciplína vícenásobného porovnávání: Pokud jste provedli příliš mnoho testů, opravte je (jednotka 6). Odpovězte na otázku "Kolik testů jsem provedl?" čestně.
5. Analýza citlivosti: Zopakujte své hlavní zjištění s jiným vzorkem, jinou kontrolní sadou a jinou transformací. Pokud se výsledek změní, neschovávejte to, nahlaste to.
Srovnávací tabulka: poctivý vs. past
Aplikace
tvar pasti
Upřímný ekvivalent
Výběr modelu
Zkouším, dokud to nedává smysl (p-hacking)
Předem naplánovaný hlavní model
hypotéza
Montáž po faktu (HARKing)
Předem nahrané, před daty
Hlášení
Neukazujte jen ty krásné
Všechny specifikace + citlivost
podskupina
Výběr toho nejvýraznějšího
Předdefinované, opravitelné
sběr dat
Zastavte se, když to má smysl
předem určený vzorek
Čtyři kopírovatelné výzvy
1. Rámec poctivých nároků:
Vaše role: poctivý statistický asistent. Mým cílem NENÍ najít smysluplný výsledek, ale najít ten správný výsledek. PRAVIDLA:- NEDÁVEJTE mi návrhy typu „zkuste modely, dokud to nebude mít smysl“,- řekněte mi, pokud navrhnete více specifikací, všechny je třeba nahlásit,- varujte mě před jakýmikoli kroky, které by mohly vést k p-hackingu. Pomozte mi nejprve objasnit můj hlavní model, oddělte objev od potvrzení.
2. Návrh plánu analýzy:
Pomozte mi navrhnout předběžný plán analýzy pro studii: primární hypotéza, primární výsledná proměnná, specifikace hlavního modelu, předem definované podskupiny, strategie vícenásobného srovnání. Umístěte „průzkumné“ a „potvrzující“ analýzy do samostatných nadpisů. Připomeňte mi, abych to vyplnil, aniž bych se díval na data.
3. Analýza citlivosti:
Mým hlavním zjištěním je napsat kód analýzy citlivosti (R) pro Mým cílem je VIDĚT, jak solidní je výsledek, NE vybrat ten nejlepší; zobrazit všechny výsledky.
4. Vlastní monitorování:
Vysvětlím svůj proces analýzy; Dejte mi kontrolní seznam pro p-hacking / HARKing / selektivní hlášení a označte, které z mých kroků jsou riskantní. Zeptejte se mě, kolik modelů/testů jsem vyzkoušel a které z nich plánuji nahlásit.
Slabá výzva / Silná výzva
Slabá výzva:
Které proměnné vykazují významné vztahy v těchto datech, najděte nejlepší model.
Tato výzva je přímou instrukcí p-hackingu: AI vyzkouší desítky kombinací a představí tu, která „dává největší smysl“. Výsledkem je téměř jistě falešný nález, který nelze zopakovat.
Výkonná výzva:
Vaše role: čestný asistent. HLAVNÍ model, který jsem předem určil, je: Y ~ X + ovládací prvky. Napište kód, který předpovídá tento model. NEHLEDEJTE jiný „smysluplnější“ model. Navrhněte také analýzu citlivosti, abych viděl robustnost výsledku, ale vězte, že budu hlásit VŠECHNY výsledky, nevyberu ten nejlepší. Nenechte mě odepsat jakákoliv průzkumná zjištění jako „potvrzená“.
Rozdíl: silná vůle opraví hlavní model, zakáže vyhledávání a vyžaduje nahlášení všech výsledků.
tři mini pouzdra
Případ 1 – Podskupinový lov. Jeden výzkumník nezjistil žádný účinek v celém vzorku; Zeptal se AI "ve které podskupině je to významné?" YZ skenoval kombinace věku, pohlaví a regionu a zjistil „p = 0,03 u městských žen ve věku 35-44“. Článek byl založen na této podskupině. Jeho replikace neměla žádný účinek: byl to výsledek náhody desítek podskupin. Lekce: vybraná podskupina poté, co data HARKing, nepotvrzuje.
Případ 2 – Hledání konverze. Vztah, který se ve formě studentské úrovně ukazuje jako nesmyslný; zkusil to v log, odmocnina, čtverec a lag; Našel p=0,048 ve formě log-log a uvedl pouze to. Naštěstí jedna z 5 vyzkoušených forem překročila práh. Správný způsob byl: předem vybrat formulář s teorií a zobrazit výsledek všech formulářů v tabulce citlivosti. Ponaučení: selektivní vykazování vytváří falešný význam.
Případ 3 – Jak funguje poctivé rámování. Před analýzou se předem zaregistroval jeden tým: jedna primární hypotéza, jeden hlavní model, dvě předem definované podskupiny, Bonferroniho korekce. Hlavní efekt nebyl významný, ale tým to poctivě hlásil; Průzkumný jedinec označil jeden nález jako „potřebný v budoucnu otestovat“. Studie byla reprodukovatelná a spolehlivá. Ponaučení: poctivé plánování stojí za to i při „selhání“.
Časté chyby
- Řekněte AI, aby „našla smysluplné výsledky“. Toto je přímý p-hacking; Dejte AI do poctivého rámce, žádejte přesnost, ne výsledky.
- Prezentace objevu jako potvrzení (HARKing). Je zavádějící psát hypotézu stanovenou za data jako „předpověděl jsem to od začátku“; Označte průzkumný nález.
- Jen hlásí dobré výsledky. Zobrazit všechny testované specifikace; Skrytí analýzy sentimentu narušuje integritu.
- Screening podskupiny/konverze. Výběr nejvýznamnější z desítek podskupin nebo transformací vede k falešným zjištěním; identifikovat a opravit předem.
- Zapomínáš, kolik testů jsi udělal. Sledujte celkový počet pokusů; Žádná p-hodnota nemůže být interpretována čestně bez znalosti tohoto čísla.
Tip: Než si nález zapíšete, zeptejte se sami sebe: "Kolik způsobů jsem tiše vyzkoušel, dokud jsem nenašel tento výsledek, a hlásím je všechny?" Pokud některé eseje zůstanou v šuplíku, vaše zpráva vypadá silnější, než je.
V souhrnu
p-hacking, HARKing, selektivní zpravodajství a zahrada rozvětvených cest; Mnohé z nich jsou pasti, které fungují neúmyslně, ale produkují falešné, nereprodukovatelné nálezy. AI tyto nástrahy urychluje, protože může okamžitě vyzkoušet desítky analýz; Požadavky typu „najít smysluplné výsledky“ promění AI v motor p-hackingu. Obrana; oddělení objevu od potvrzení pomocí plánu předběžné registrace a analýzy, nahlášení všech specifikací a analýzy citlivosti, oprava vícenásobných srovnání a uvedení umělé inteligence do poctivého rámce, který vyžaduje „správný výsledek“. Konečná odpovědnost je vždy na výzkumníkovi.
Aplikační úkol
Než se podíváte na data, vyberte si výzkumnou otázku a napište stručný plán analýzy: primární hypotéza, hlavní model, primární výsledná proměnná, předem definované podskupiny, strategie vícenásobného srovnání. Poté odhadněte hlavní model. Poté proveďte analýzu citlivosti (různé kontroly, odlehlá hodnota zahrnuta/vyloučena, jiná forma funkce) a všechny výsledky zobrazte v jediné tabulce. V jednom odstavci zhodnoťte, které kroky představují riziko p-hackingu a jak je váš poctivý framework omezuje.
kontrolní seznam
- [ ] Před ponořením do dat jsem napsal plán analýzy/hlavní model.
- [ ] Průzkumné a konfirmační analýzy jsem označil samostatně; Nenaslouchal jsem.
- [ ] Nahlásil jsem všechny specifikace, které jsem zkoušel; Nevybrala jsem si jen tu krásnou.
- [ ] Podskupiny a transformace jsem definoval předem, neskenoval jsem je po datech.
- [ ] Sledoval jsem, kolik testů jsem provedl, a použil potřebnou opravu.
- [ ] AI jsem použil v kontextu „najít pravdu“ spíše než „najít to smysluplné“; Převzal jsem zodpovědnost.