Јединице
1. Вештачка интелигенција у економетрији и статистици: улоге, границе, аутентификација и приватност 2. Чишћење и припрема података: подаци који недостају, недостаци и кодирање 3. Истраживачка анализа и визуелизација података: цртање и тумачење помоћу вештачке интелигенције 4. Линеарна регресија: изградња модела, интерпретација коефицијената и претпоставке 5. Дијагностика регресије и кршења: колинеарност, хетероскедастичност, аутокорелација 6. Тестирање хипотеза и п-вредност: значајност, моћ и вишеструка поређења 7. п-хаковање, ХАРКинг и статистички интегритет: Замке у доба вештачке интелигенције 8. Анализа временских серија: стационарност, АРИМА и предвиђање 9. Узрочна веза и анализа политике: ДиД, ИВ, РДД и вештачка интелигенција 10. Генерисање кода и репродуктивност: Р/Питхон, верзија и репродуктивност 11. Писање извештаја, комуникација и етика: представљање резултата и комуницирање граница
Јединица 7 / 11

п-хаковање, ХАРКинг и статистички интегритет: Замке у доба вештачке интелигенције

Добици:

  • Схватите да п-хаковање, ХАРКинг, селективно извештавање и башта рачваћих стаза производе лажне налазе и видите како вештачка интелигенција може да убрза ове замке
  • Способност успостављања одбране као што су предрегистрација, план анализе, дисциплина вишеструког поређења и анализа осетљивости уз подршку вештачке интелигенције
  • Бити у стању да интернализује искрен дизајн захтева који ће омогућити вештачкој интелигенцији да одбије захтеве типа „пронађи смислени резултат“ и да коначну одговорност лежи на истраживачу.

У претходној јединици смо видели шта је п-вредност, а шта није. У овој јединици ћемо се осврнути на мрачнију тему, систематске замке које угрожавају статистички интегритет. Већина њих није намерно варање; То су подмукли механизми у које чак и добронамерни истраживачи упадају а да тога нису ни свесни. А вештачка интелигенција (АИ) чини ове замке и лакшим и бржим, јер омогућава покретање десетина анализа у секунди. Циљ ове јединице је да успостави дисциплину која ће АИ трансформисати из "машине за проналажење смислених резултата" у поштеног асистента.

Основне замке

п-хаковање (лов на п-вредност): Поново покушава анализу на различите начине док се не добије значајан резултат (п<0,05). Додавање и уклањање променљивих, одабир подузорака, промена дефиниције оутлиерс-а, испробавање различитих трансформација, коришћење различитих варијабли исхода, заустављање прикупљања података када то постане смислено... Сваки покушај даје нову „шансу“; Ако се довољно потрудите, један од њих ће се показати смисленим, чак и ако заправо нема ефекта. Резултат: лажни налази који су објављени, али нису поновљиви.

ХАРКинг (Хипотеза након што су резултати познати): Израда хипотезе након што се виде резултати и представљање као „Овако сам то предвидео од почетка“. Гледате податке и проналазите најупечатљивију везу, а затим пишете рад као да је дизајниран да тестира ту хипотезу. Ово обмањује читаоца тако што откриће изгледа као потврда.

Селективно извештавање (брање трешања): Извештај само оних „добрих“ из десетина анализа и тихо сахрањивање осталих. Ово је такође познато као „проблем са фиоком датотека“: бесмислени резултати остају у фиоци, чинећи литературу систематски пристрасном.

Врт стаза које се рачвају: термин Ендруа Гелмана. Чак и без једног намерног п-хаковања, истраживач доноси многе разумне изборе на основу података (која променљива, који праг, која подгрупа, која трансформација). Ови истраживачки степени слободе су толико бројни да ефективно бирате онај који има смисла из мноштва анализа — чак и без икакве зле намере. Резултат је опет растућа стопа лажних позитивних резултата.

Опрез: Већина ових замки нису намерни трикови. Збир наизглед невиних корака као што су „управо сам пробао још неколико модела“, „било је чистије када сам уклонио граничник“, „ефекат је јаснији у овој подгрупи“ може произвести лажан налаз. Искреност је питање методе, а не намере.

Зашто АИ повећава ове замке?

За ручно испробавање 3 модела потребно је време; ИЗ производи 50 варијанти модела, 10 различитих конверзија, 8 подгрупа за неколико минута. Ова моћ је катастрофална без поштеног плана: захтев попут „пронађи смислену везу у овим подацима“ или „изгради модел који подржава ову хипотезу“ претвара вештачку интелигенцију директно у п-хацкинг мотор. АИ такође жели да буде од помоћи; има тенденцију да нађе "смислени" исход који ће вас задовољити. Зато је ваш брз дизајн прва линија одбране поштења.

Одбрана: поштено пословање

1. Претходна регистрација: То значи да снимите своју хипотезу, варијабле, модел и тестове у писаном облику (могуће на платформи са временским жигом) пре извођења анализе. Дакле, откривање је одвојено од потврде; све што касније промените је означено као „истраживалац“.

2. План анализе: Чак и ако не можете унапред да снимите, напишите план анализе пре него што уђете у податке: примарна хипотеза, примарна варијабла исхода, главни модел. Успоставите разлику између „главне анализе“ и „додатне/истраживачке анализе“ од почетка и одржавајте је у извештају.

3. Пријавите све: Не скривајте моделе које сте испробали. У одељку „анализа осетљивости“ (провера робусности) покажите како различите спецификације мењају резултат. Налаз је јак само ако се издржи под многим вероватним изборима.

4. Дисциплина вишеструког поређења: Ако сте урадили превише тестова, исправите их (јединица 6). Одговорите на питање "Колико сам тестова урадио?" искрено.

5. Анализа осетљивости: Поновите свој главни налаз са другим узорком, различитим контролним скупом и различитом трансформацијом. Ако се резултат промени, немојте га сакрити, пријавите га.

Упоредни графикон: поштен вс. замка

Апликација

облик замке

Искрен еквивалент

Избор модела

Покушавам док нема смисла (п-хаковање)

Унапред планирани мастер модел

хипотеза

Уклапање након чињенице (ХАРКинг)

Унапред снимљено, пре података

Извештавање

Немојте само показати лепе

Све спецификације + осетљивост

подгрупа

Одабир најупечатљивијих

Унапред дефинисан, поправљив

прикупљање података

Стани када има смисла

унапред одређен узорак

Четири упита за копирање

1. Поштени оквир тврдњи:

Ваша улога: асистент за поштену статистику. Мој циљ НИЈЕ да пронађем смислен резултат, већ да пронађем прави резултат. ПРАВИЛА:- НЕМОЈТЕ ми давати предлоге типа „пробајте моделе док не буде смислено“,- реците ми ако предлажете више спецификација да све треба да буду пријављене,- упозорите ме на све кораке који би могли да доведу до п-хаковања. Помозите ми да прво разјасним свој главни модел, одвојите откриће од потврде.

2. Нацрт плана анализе:

Помозите ми да нацртам прелиминарни план анализе за студију: примарна хипотеза, примарна варијабла исхода, главна спецификација модела, унапред дефинисане подгрупе, стратегија вишеструког поређења. Ставите "истраживачке" и "потврдне" анализе у одвојене наслове. Подсети ме да ово попуним БЕЗ ГЛЕДАЊА података.

3. Анализа осетљивости:

Мој главни налаз је писање кода за анализу осетљивости (Р) за Мој циљ је да ВИДИМ колико је солидан резултат, А НЕ да изаберем најбољи; прикажи све резултате.

4. Самоконтрола:

Објаснићу свој процес анализе; Дајте ми контролну листу за п-хаковање / ХАРКинг / селективно извештавање и означите који од мојих корака су ризични. Питајте ме колико сам модела/тестова испробао и које планирам да пријавим.

Слаби промпт / Јаки промпт

Слабо обавештење:

Које варијабле показују значајне односе у овим подацима, пронађите најбољи модел.

Овај упит је директно п-хаковање инструкција: АИ покушава на десетине комбинација и представља ону која „има највише смисла“. Резултат је готово сигурно лажан налаз који се не може поновити.

Снажан упит:

Ваша улога: поштени помоћник. ГЛАВНИ модел који сам унапред одредио је: И ~ Кс + контроле. Напишите код који предвиђа овај модел. НЕМОЈТЕ тражити други „смисленији“ модел. Такође предложите анализу осетљивости како бих могао да видим робусност резултата, али знајте да ћу пријавити СВЕ резултате, а не изабрати најбољи. Не дозволите да отпишем било какве истраживачке налазе као „потврђене“.

Разлика: јака воља поправља главни модел, забрањује претраживање и захтева да се сви резултати пријаве.

три мини кофера

Случај 1 — Лов подгрупе. Један истраживач није нашао никакав ефекат у укупном узорку; Питао је АИ "у којој је подгрупи значајан?" ИЗ је скенирао комбинације старости, пола и региона и пронашао „п = 0,03 код урбаних жена старости 35-44 године“. Чланак је заснован на овој подгрупи. Његова репликација није наишла на никакав ефекат: ово је био резултат случајности десетина подгрупа. Лекција: изабрана подгрупа након података се ХАРКинг, не потврђује.

Случај 2 — Тражење конверзије. Однос који се испоставља бесмисленим у облику студентског нивоа; пробао у облику дневника, квадратног корена, квадрата и облика заостајања; Нашао је п=0,048 у лог-лог облику и пријавио само то. Срећом, један од 5 испробаних форми је прешао праг. Исправан начин је био: унапред одабрати форму са теоријом и приказати резултат свих облика у табели осетљивости. Поука: селективно извештавање производи лажни значај.

Случај 3 — Како функционише поштено уоквиривање. Један тим је унапред регистрован пре анализе: једна примарна хипотеза, један главни модел, две унапред дефинисане подгрупе, Бонферонијева корекција. Главни ефекат није био значајан, али тим је то искрено пријавио; Истраживачка особа је означила један налаз као „треба да буде тестиран у будућности“. Студија је била поновљива и поуздана. Поука: поштено планирање чини чак и „неуспешан” исход вредним труда.

Уобичајене грешке

  • Рећи АИ да „пронађе смислене резултате“. Ово је право п-хаковање; Ставите АИ у поштен оквир, тражећи тачност, а не резултате.
  • Представљање открића као потврде (ХАРКинг). Погрешно је писати хипотезу успостављену након података као „предвидио сам је од почетка“; Означите истраживачки налаз.
  • Само извештавам о добрим резултатима. Прикажи све тестиране спецификације; Скривање анализе осећања угрожава интегритет.
  • Скрининг подгрупе/конверзије. Одабир најзначајније од десетина подгрупа или трансформација производи лажне налазе; унапред идентификовати и поправити.
  • Заборављајући колико сте тестова урадили. Пратите укупан број покушаја; Ниједна п-вредност се не може искрено тумачити без познавања овог броја.
Савет: Пре него што запишете налаз, запитајте се: „Колико сам начина у тишини покушао док нисам нашао овај резултат, и да ли их све пријављујем?“ Ако неки од есеја остану у фиоци, ваш извештај изгледа јачи него што јесте.

Укратко

п-хаковање, ХАРКинг, селективно извештавање и башта стаза које се рачвају; Многе су замке које делују ненамерно, али дају лажне, непоновљиве налазе. АИ убрзава ове замке јер може одмах да испроба десетине анализа; Захтеви типа „пронађи смислене резултате“ претварају вештачку интелигенцију у механизам за хаковање. одбрана; одвајање открића од потврде са планом унапред регистрације и анализе, извештавање о свим спецификацијама и анализама осетљивости, исправљање вишеструких поређења и стављање АИ у поштен оквир који захтева „тачан резултат“. Коначна одговорност увек лежи на истраживачу.

Задатак апликације

Изаберите истраживачко питање и напишите кратак план анализе пре него што погледате податке: примарна хипотеза, главни модел, примарна варијабла исхода, унапред дефинисане подгрупе, стратегија вишеструког поређења. Затим процените главни модел. Затим урадите анализу осетљивости (различите контроле, изузетак укључен/искључен, различит облик функције) и прикажите све резултате у једној табели. У једном пасусу процените који кораци представљају ризик од п-хаковања и како их ваш поштен оквир ограничава.

контролна листа

  • [ ] Написао сам план анализе/мастер модел пре него што сам уронио у податке.
  • [ ] Посебно сам означио истраживачку и потврдну анализу; Нисам ХАРКинг.
  • [ ] Пријавио сам све спецификације које сам испробао; Нисам изабрао само лепу.
  • [ ] Подгрупе и трансформације сам унапред дефинисао, нисам их скенирао након података.
  • [ ] Пратио сам колико сам тестова обавио и применио неопходну корекцију.
  • [ ] Користио сам вештачку интелигенцију у контексту „пронађи истину“ уместо „нађи да има смисла“; Ја сам преузео одговорност.