Табыстар:
- Нөлдік гипотезаны, p-мәнін, сенімділік интервалын және статистикалық қуатты дұрыс анықтау және тест таңдау мен интерпретациялауда жасанды интеллектті пайдалану мүмкіндігі.
- p-мәнінің не екенін және емес екенін ажырата білу (эффект өлшемі емес, дәлдік ықтималдығы емес) және неліктен бірнеше салыстыруды түзету қажет екенін түсіну
- Мағынаны маңыздылықпен шатастыратын жасанды интеллект жасаған пікірлерді тану және оларды әсер мөлшері мен белгісіздікпен хабарлау мүмкіндігі
Статистиканың ең көп қолданылатын және түсінбейтін құралы – гипотезаны тексеру. Негізгі идея қарапайым: бізде талап бар (мысалы, «осы екі топтың орташа мәні әртүрлі») және оған қарама-қарсы, нөлдік гипотеза (H0 — «шын мәнінде ешқандай айырмашылық жоқ»). Сынақ деректердің нөлдік гипотезамен қаншалықты сәйкес келетінін өлшейді. Бұл бөлімде біз жасанды интеллект (AI) тестті таңдау мен түсіндіруді қалай жеңілдететінін көреміз, бірақ p-мәнінің айналасындағы тұзақтар неге соншалықты кең таралған және қауіпті. Басынан бастайық: AI қандай сынақ синтаксисін жазу керектігін біледі; бірақ тест болжамының қанағаттандырылғанын және нәтиженің шын мәнінде нені білдіретінін түсіндіру сіздің міндетіңіз.
Шын мәнінде p-мәні қандай?
p-мәні - сіз байқаған нәтиженің немесе одан да төтенше нәтиженің нөлдік гипотеза ақиқат болғанда кездейсоқ пайда болу ықтималдығы (яғни, іс жүзінде ешқандай әсер жоқ). Кішкентай p-мәні (0,05 - дәстүрлі шек) «егер шынымен әсер болмаса, мұндай деректерді көру таңқаларлық» дегенді білдіреді; Бұл нөлдік гипотезаға қарсы дәлел болып саналады.
Енді AI жиі шатастыратын p-мәні не екенін түсінейік:
- p-мәні нөлдік гипотезаның ақиқат болу ықтималдығы емес. p=0,03 «әсер етпеудің 3% ықтималдығы бар» дегенді білдірмейді.
- p-мәні әсердің өлшемін көрсетпейді. Өте аз әсер үлкен үлгіде аздаған p-мәнін бере алады.
- p-мәні қорытындының маңызды немесе нақты екенін дәлелдемейді. “Елеулі” – статистикалық термин, “маңызды” – үкім.
- p>0,05 «әсер жоқ» дегенді білдірмейді; Бұл «біз бұл деректермен әсерді көрсете алмадық» дегенді білдіреді. Айғақтардың жоқтығы жоқтың дәлелі болып табылмайды.
Абайлаңыз: AI түсіндірудегі ең көп тараған қате «маңызды» сөзін «маңызды/күшті/негізгі әсер» ретінде көрсету болып табылады. Статистикалық маңыздылық пен практикалық маңыздылық екі бөлек нәрсе; Әрқашан екеуін бөлек хабарлаңыз.
Сенім аралығы және әсер мөлшері: бай ақпарат
Жалғыз p-мәнінің орнына сенімділік интервалы әлдеқайда ақпараттандырады: ол сіздің бағалауыңыз үшін қолайлы мәндер ауқымын береді. «Эффект 1200, 95% сенімді интервал [300, 2100]» сөйлемі бағытты да, шаманы да, белгісіздікті де көрсетеді; «p<0,05» жай ғана «нөлден алыс» дейді. Қазіргі статистикалық тәжірибе р-мәнін жалғыз емес пайдаланады; әсер мөлшері + сенімділік аралығы + p-мәні үштігімен есеп беруді ұсынады.
Статистикалық қуат және үлгі
Статистикалық қуат – нақты бар әсерді анықтау ықтималдығы (1 минус II типті қате ықтималдығы, яғни «нақты әсерді жоғалту»). Қуаттылығы төмен зерттеу екі тәуекелге ұшырайды: (1) ол шынайы әсерлерді жіберіп алады (жалған теріс); (2) елеулі болып шығатын аздаған нәтижелер шамадан тыс шамадан тыс шамадан тыс шамадан тыс шамадан тыс нәтиже береді — жеңімпаздың қарғысы деп аталады, өйткені тек жоғарылатылған болжамдар табалдырықтан өте алады. Сондықтан талдау алдында қуатты/үлгіні есептеу жақсы тәжірибе болып табылады. AI осы тіркелгі үшін кодты жасайды; Мақсатты әсер өлшемін теориямен анықтайсыз.
Бірнеше салыстыру мәселесі
Тестілеу кезінде 0,05 шегі «жалған позитивтердің 5% қаупін» білдіреді. Бірақ егер сіз 20 сынақ жасасаңыз, олардың барлығы шынымен тиімсіз болса да, орташа есеппен біреуі кездейсоқ p<0,05 береді деп күтілуде. Бұл көп салыстыру мәселесі деп аталады. Жалған позитивтердің ықтималдығы айнымалылардың, ішкі топтардың немесе нәтиже айнымалыларының көп саны сыналғанда жылдам артады. Шешім табалдырықты түзету болып табылады: Бонферрони (шекті сынақтар санына бөлу — қатаң), жалған табу жылдамдығын (FDR) бақылайтын Холм немесе Бенджамин-Хочберг әдістері. Бұл қауіп АИ жасында одан да арта түседі, өйткені AI бірнеше секунд ішінде ондаған сынақтарды жасай алады — бұл келесі бөлімнің тікелей тақырыбы (p-hacking).
Салыстыру кестесі: p-мәні нені айтады және нені айтпайды
өрнек
Бұл рас па?
Сипаттама
"p=0,02, әсер етпеу ықтималдығы 2%"
қате
p Н0 ықтималдығы емес
«p<0,05, әсері үлкен»
қате
p өлшемді көрсетпейді
"p=0,20, әсері жоқ"
қате
Көрсете алмау - жоқтық емес
«p<0,05, H0 қарсы дәлелдер бар»
Рас
Сақ және нақты
"Эффект 1.200 [300;2.100], p=0.01"
ең жақсы
Өлшем + белгісіздік + дәлел
Көшірілетін төрт шақыру
1. Дұрыс тестті таңдау:
Сіздің рөліңіз: статистикалық тестілеу бойынша көмекші. Мен екі тәуелсіз топтың (үздіксіз айнымалы) орташа мәнін салыстырғым келеді. Маған беріңіз: қандай сынақ орынды (оның жорамалдарымен: қалыптылық, дисперсия теңдігі), егер болжам орындалмаса, балама (мысалы, Уэлч, Манн-Уитни) және R коды. Мен нәтижені іске қосып, болжамдарды тексеремін.
2. p-мәнін дұрыс хабарлау:
Төменде сынақ нәтижесін хабарлаңыз, бірақ ЕРЕЖЕЛЕР:- p-мәнін «H0 ықтималдығы» немесе «әсер өлшемі» ретінде көрсетпеңіз,- әсер өлшемін және 95% сенімділік интервалын қосуды ұмытпаңыз,- «маңызды» және «маңызды» деп бөлек жазыңыз,- p>0,05 болса, «әсері жоқ» демеңіз, «көрсете алмадық» деңіз. Шығару: [қою]
3. Қуатты/үлгіні есептеу:
Мен экспериментті жоспарлап отырмын: екі топ, күтілетін әсер мөлшері (Коэн d) ~0,4, қуат 0,80, альфа 0,05. Қажетті үлгі өлшемін есептейтін R кодын жазыңыз (pwr пакеті) және төмен қуатты зерттеудің тәуекелдерін түсіндіріңіз (жеңімпаздың қарғысы).
4. Бірнеше салыстыруды түзету:
Мен 15 жеке гипотеза сынақтарын жасадым және менде p-мәндері бар. Bonferroni және Benjamin-Hochberg (FDR) түзетулерін қолданатын R кодын жазыңыз, екі әдіс арасындағы айырмашылықты түсіндіріңіз және неге жалаңаш p<0,05 дегенге сенбеу керектігін бір сөйлеммен қорытындылаңыз.
Әлсіз шақыру / Күшті шақыру
Әлсіз шақыру:
Бұл сынақтың нәтижесі маңызды ма? Нәтижеге түсініктеме беріңіз.
Бұл талап AI-ны «мағыналы/мағынасыз» екілік жүйесінде ұстайды; шамасы мен мәнділігін шатастыратын сөйлем тудыруы мүмкін, мысалы, «иә, бұл маңызды, әсері күшті».
Күшті шақыру:
Сіздің рөліңіз: мұқият статистикалық көмекші. Нәтижені түсіндіріңіз, бірақ: (1) әсер өлшемін + 95% сенімділік аралығын + p-мәнін бірге беріңіз, (2) мәнді мәнділіктен ажыратыңыз, (3) «көрсете алмадым» бойынша p>0,05, (4) қанша сынақ жасағанымды сұраңыз; Егер біреуден көп болса, бірнеше салыстыруды түзетуді ұсыныңыз, (5) сынақтың болжамдарын тексеру керек екенін еске түсіріңіз.
Айырмашылық: күшті шақыру бай есептерді қамтамасыз етеді және p-мәні тұзақтарынан қорғайды.
үш шағын іс
1-жағдай – Үлкен іріктеудегі маңызды емес «маңыздылық». Бір талдаушы 500 000 бақылауы бар деректерде p<0,001 деңгейінде екі топ арасындағы орташа айырмашылықты «өте маңызды» деп тапты. Бірақ айырмашылық небәрі 0,3 ұпай (100-ден) болды және іс жүзінде мағынасыз болды. Үлкен үлгі тіпті кішкентай айырмашылықты «маңызды» етті. Әсер мөлшері туралы хабарланған кезде, нәтиже шамалы болды. Сабақ: мәнділік шама емес; Егер n үлкен болса, әрбір айырмашылық маңызды.
2-жағдай – Бірнеше сынақ иллюзиясы. Бір команда 22 нәтиже айнымалысын сынады; Олардың біреуі p=0,04 көрсетті және «әсерін таптық» деп жарияланды. Bonferroni түзетуімен табалдырық 0,05/22 = 0,0023 дейін төмендеді; 0,04 бұл межеден өте алмады. Жалғыз «мағыналы» нәтиже 22 сынақтан кездейсоқ шығар еді. Сабақ: көп тестілеу кезінде түзету қажет.
3-жағдай - Қуатсыздық және жеңімпаздың қарғысы. Шағын пилоттық зерттеу (әр топқа n=15) әсер өте үлкен (d=0,9) және маңызды деп тапты. Үлкен репликация зерттеуі әсерді d = 0,2 дейін төмендетті. Шағын үлгі шектен асып кетуге ғана мүмкіндік берді. Сабақ: Төмен қуатта айтарлықтай әсер өлшемдеріне сенуге болмайды.
Жалпы қателер
- Маңыздылықты маңыздылықпен/шамамен шатастыру. р аз болғандықтан ғана әсер үлкен емес; Әсер өлшемін бөлек хабарлаңыз.
- p-мәнін H0 ықтималдығымен қателесу. p «әсердің болмауы ықтималдығы» емес; концептуалды түрде ерекшеленеді.
- Көрсеткіш p>0,05 «әсер жоқ». Көрсетпеу жоқтың дәлелі болып табылмайды; Белгісіздікті көрсетіңіз.
- Көп тестілеу үшін түзетілмейді. Тым көп сынақтар жалған оң нәтиже береді; Bonferroni/FDR қолданбасын қолданыңыз.
- Қуатты елемеу. Кішігірім үлгідегі маңызды әсер асыра сипатталады; Талдау алдында қуатты есептеңіз.
Кеңес: Нәтижені «маңызды» деп есептемес бұрын, екі сұрақ қойыңыз: «Әсер іс жүзінде маңызды ма (магнитудасы)?» және «Мен бұл нәтижені тапқанға дейін қанша сынақтан өттім?» Екінші сұрақ - адалдық лакмус сынағы.
Қысқаша
Гипотезаны тестілеу және p-мәні күшті, бірақ дұрыс түсінілмеген құралдар. p-мәні – нөлдік гипотеза ақиқат болғанда деректерді көру ықтималдығы; Н0 ықтималдығы әсердің шамасы немесе табылғанның маңыздылығы емес. Әрқашан әсер мөлшері мен сенімділік аралығымен бірге маңыздылығын хабарлаңыз; p>0,05 «әсер жоқ» деп оқымаңыз; көптеген сынақтарды орындаған болсаңыз, бірнеше салыстыру түзетуін қолданыңыз; Төмен қуатты зерттеулердің шамадан тыс әсер ету қаупін ескеріңіз. AI сынақ кодын және сызбасын шығарады; Маңыздылық пен маңыздылықты ажырату және болжамдарды тексеру сіздің жауапкершілігіңіз.
Қолданбалы тапсырма
Деректер жиынындағы екі топ арасындағы құралдарды салыстыру. AI-дан сәйкес сынақты (болжамдарымен) және кодты сұраңыз, оны іске қосыңыз және болжамдарды тексеріңіз. Нәтижені үш компонентпен хабарлаңыз: әсер мөлшері, 95% сенімділік аралығы, p-мәні. Содан кейін бір деректер бойынша қанша түрлі салыстырулар жасауға болатынын ойлаңыз; Бірнеше сынақты орындаған болсаңыз, Bonferroni немесе FDR түзетуін қолданыңыз және нәтиже әлі де орындалса, хабарлаңыз. Соңында, талдауыңыз үшін шамамен қуатты бағалауды жазыңыз.
бақылау парағы
- [ ] Мен оның болжамдары бар сынақты таңдадым және болжамдарды тексердім.
- [ ] Мен нәтижені әсер өлшемі + сенімділік аралығы + p-мәні ретінде хабарладым.
- [ ] Мен «маңызды» және «маңызды» дегенді бөлек ұстадым; Мен p H0 ықтималдығы деп ойламадым.
- [ ] Мен p>0,05 деп жаздым, «әсер жоқ» емес, «көрсете алмадық» деп.
- [ ] Бірнеше сынақты орындасам, бірнеше салыстыру түзетуін қолдандым.
- [ ] Мен іріктеу қуатын бағаладым; Мен төмен қуаттағы әсер өлшеміне сақ болдым.