Ieguvumi:
- Spēja pareizi definēt nulles hipotēzi, p-vērtību, ticamības intervālu un statistisko jaudu un izmantot mākslīgo intelektu testa atlasē un interpretācijā.
- Spēja atšķirt, kas ir un kas nav p-vērtība (nav efekta lielums, ne precizitātes varbūtība) un saprast, kāpēc ir nepieciešama daudzkārtēja salīdzināšanas korekcija
- Spēja atpazīt mākslīgā intelekta komentārus, kas jauc nozīmīgumu ar būtiskumu, un ziņot par tiem ar ietekmes lielumu un nenoteiktību
Visbiežāk izmantotais un visvairāk pārprastais statistikas rīks ir hipotēžu pārbaude. Pamatideja ir vienkārša: mums ir apgalvojums (piemēram, “šo divu grupu vidējais rādītājs ir atšķirīgs”) un tā pretstats, nulles hipotēze (H0 — “atšķirības faktiski nav”). Tests nosaka, cik labi dati sakrīt ar nulles hipotēzi. Šajā nodaļā mēs redzēsim, kā mākslīgais intelekts (AI) atvieglo testa atlasi un interpretāciju, taču kāpēc ar p-vērtību saistītās nepilnības ir tik izplatītas un bīstamas. Sāksim no sākuma: AI zina, kuru testa sintakse rakstīt; bet jūsu uzdevums ir interpretēt, vai testa pieņēmums ir izpildīts un ko īsti nozīmē rezultāts.
Kas patiesībā ir p-vērtība?
P-vērtība ir iespējamība, ka jūsu novērotais rezultāts vai ekstrēmāks iznākums iestāsies nejauši, ja nulles hipotēze ir patiesa (t.i., efekta faktiski nav). Neliela p vērtība (0,05 ir tradicionālais slieksnis) nozīmē, ka "būtu pārsteidzoši redzēt šādus datus, ja tiešām nebūtu ietekmes"; Tas tiek uzskatīts par pierādījumu pret nulles hipotēzi.
Tagad noskaidrosim, kas nav p-vērtība — ko AI bieži sajauc:
- P vērtība nav varbūtība, ka nulles hipotēze ir patiesa. p=0,03 nenozīmē "iedarbības neesamības iespējamība ir 3%.
- P vērtība nenorāda efekta lielumu. Ļoti mazs efekts var dot nelielu p vērtību lielā paraugā.
- P-vērtība nepierāda, ka atradums ir nozīmīgs vai reāls. “Nozīmīgs” ir statistikas termins, “nozīmīgs” ir spriedums.
- p>0,05 nenozīmē "bez efekta"; Tas nozīmē, ka "mēs nevarējām parādīt efektu ar šiem datiem". Pierādījumu neesamība nav pierādījums neesamībai.
Uzmanību! Visbiežāk sastopamā mākslīgā intelekta interpretācijas kļūda ir vārda “nozīmīgs” attēlojums kā “nozīmīga/spēcīga/liela ietekme”. Statistiskā nozīme un praktiskā nozīme ir divas dažādas lietas; Vienmēr ziņojiet par abiem atsevišķi.
Pārliecības intervāls un efekta lielums: bagātāka informācija
Atsevišķas p vērtības vietā ticamības intervāls ir daudz informatīvāks: tas sniedz ticamu vērtību diapazonu jūsu novērtējumam. Teikums "Efekts 1200, 95% ticamības intervāls [300, 2100]" parāda gan virzienu, gan lielumu, gan nenoteiktību; "p<0,05" tikai saka "tālu no nulles". Mūsdienu statistikas praksē p-vērtība netiek izmantota atsevišķi; iesaka ziņot, izmantojot trio efektu lielums + ticamības intervāls + p-vērtība.
Statistiskā jauda un izlase
Statistiskā jauda ir varbūtība atklāt efektu, kas faktiski pastāv (1 mīnus II tipa kļūdas varbūtība, t.i., "trūkst patiesā efekta"). Nepietiekams pētījums ir pakļauts diviem riskiem: (1) tam nav patiesas ietekmes (viltus negatīvs); (2) dažiem rezultātiem, kas izrādās nozīmīgi, ir palielināti lielumi — tā sauktais uzvarētāja lāsts, jo tikai palielinātas prognozes var šķērsot slieksni. Tāpēc ir laba prakse pirms analīzes aprēķināt jaudu/paraugu. AI ģenerē kodu šim kontam; Jūs nosakāt mērķa efekta lielumu ar teoriju.
Vairāku salīdzināšanas problēma
Veicot testu, slieksnis 0,05 nozīmē "5% viltus pozitīvu rezultātu risks". Bet, ja veicat 20 testus, vidēji viens nejauši uzrādīs p<0,05, pat ja tie visi faktiski ir neefektīvi. To sauc par vairāku salīdzināšanas problēmu. Viltus pozitīvu rezultātu iespējamība strauji palielinās, ja tiek pārbaudīts liels skaits mainīgo, apakšgrupu vai iznākuma mainīgo. Risinājums ir labot slieksni: Bonferroni (dalot slieksni ar testu skaitu - stingra), Holma vai Benjamini-Hochberg metodes, kas kontrolē viltus atklāšanas ātrumu (FDR). Šis risks kļūst vēl lielāks AI laikmetā, jo AI var veikt desmitiem testu sekundēs — tas ir tiešais nākamās vienības priekšmets (p-uzlaušana).
Salīdzinājuma tabula: ko saka p-vērtība un ko tā nepasaka
izteiksme
Vai tā ir taisnība?
Apraksts
"p=0,02, varbūtība, ka nebūs ietekmes, ir 2%"
nepareizi
p nav H0 varbūtība
"p<0,05, efekts ir liels"
nepareizi
p nenorāda izmēru
"p=0,20, bez ietekmes"
nepareizi
Nespēja parādīt nav prombūtne
"p<0,05, ir pierādījumi pret H0"
Taisnība
Piesardzīgs un precīzs
"Efekts 1,200 [300;2,100], p=0,01"
labākais
Izmērs + nenoteiktība + pierādījumi
Četras kopējamas uzvednes
1. Pareizā testa izvēle:
Jūsu loma: statistiskās pārbaudes palīgs. Es vēlos salīdzināt divu neatkarīgu grupu vidējo vērtību (nepārtraukts mainīgais). Dodiet man: kurš tests ir piemērots (ar tā pieņēmumiem: normalitāte, dispersijas vienlīdzība), alternatīvu, ja pieņēmums nav izpildīts (piemēram, Welch, Mann-Whitney) un R kodu. Es izpildīšu rezultātu un pārbaudīšu pieņēmumus.
2. Pareiza p vērtības ziņošana:
Tālāk ziņojiet par testa rezultātu, bet NOTEIKUMI:- NEPIEDZIET p-vērtību kā "H0 varbūtību" vai "efekta lielumu",- noteikti iekļaujiet efekta lielumu un 95% ticamības intervālu,- rakstiet atsevišķi "nozīmīgs" un "nozīmīgs",- ja p>0,05, NESAKIET "nav efekta", sakiet "mēs nevarējām parādīt". Izvade: [ielīmēt]
3. Jaudas/parauga aprēķins:
Plānoju eksperimentu: divas grupas, paredzamā efekta lielums (Koena d) ~0.4, jauda 0.80, alfa 0.05. Uzrakstiet R kodu, kas aprēķina nepieciešamo izlases lielumu (pwr pakotne) un izskaidro mazjaudas pētījuma riskus (uzvarētāja lāsts).
4. Vairāku salīdzināšanas labojums:
Esmu veicis 15 atsevišķus hipotēžu testus, un man ir p vērtības. Uzrakstiet R kodu, kas izmanto Bonferroni un Benjamin-Hochberg (FDR) korekcijas, izskaidrojiet atšķirību starp abām metodēm un vienā teikumā apkopojiet, kāpēc man nevajadzētu uzticēties tukšajam p<0,05.
Vāja uzvedne / spēcīga uzvedne
Vāja uzvedne:
Vai šī testa rezultātam ir nozīme? Komentējiet rezultātu.
Šis apgalvojums iesprosto AI binārajā “jēgpilnajā/nejēgpilnajā”; visticamāk, rada teikumu, kas jauc lielumu ar nozīmīgumu, piemēram, "jā, tas ir nozīmīgi, efekts ir spēcīgs."
Spēcīga uzvedne:
Jūsu loma: uzmanīgs statistikas asistents. Interpretējiet rezultātu, bet: (1) norādiet efekta lielumu + 95% ticamības intervālu + p-vērtību kopā, (2) atdaliet nozīmīgumu no nozīmīguma, (3) p>0,05 "nevarēja parādīt", (4) jautājiet, cik testu es veicu; Ja ir vairāk nekā viens, iesakiet vairākkārtēju salīdzināšanas korekciju, (5) atgādiniet, ka ir jāpārbauda testa pieņēmumi.
Atšķirība: spēcīga uzvedne nodrošina bagātīgu pārskatu sniegšanu un aizsargā pret p-vērtību slazdiem.
trīs mini futrāļi
1. gadījums — nenozīmīga “nozīmība” lielā izlasē. Viens analītiķis konstatēja, ka vidējā atšķirība starp abām grupām ir "ļoti nozīmīga" pie p<0,001 datos ar 500 000 novērojumiem. Bet starpība bija tikai 0,3 punkti (no 100) un praktiski bezjēdzīga. Milzīgais paraugs pat niecīgo atšķirību padarīja "nozīmīgu". Kad tika ziņots par ietekmes lielumu, atklājums tika atzīts par nenozīmīgu. Nodarbība: nozīme nav lielums; Ja n ir liels, katra atšķirība ir nozīmīga.
2. gadījums — vairākkārtējas pārbaudes ilūzija. Viena komanda pārbaudīja 22 iznākuma mainīgos; Viens no tiem uzrādīja p=0,04 un tika paziņots kā "mēs atradām efektu". Ar Bonferroni korekciju slieksnis samazinājās līdz 0,05/22 = 0,0023; 0,04 nepārsniedza šo slieksni. Vienīgais "jēgpilnais" rezultāts būtu bijis nejauši no 22 izmēģinājumiem. Nodarbība: pārbaudot daudz, ir nepieciešama korekcija.
3. gadījums — Underpower un uzvarētāja lāsts. Neliels izmēģinājuma pētījums (n=15 katrā grupā) atklāja, ka efekts ir ļoti liels (d=0,9) un nozīmīgs. Liels replikācijas pētījums samazināja efektu līdz d = 0,2. Nelielā izlase bija ļāvusi tikai pārvērtēt slieksni. Nodarbība: Ievērojamiem efekta izmēriem ar zemu jaudu nevar uzticēties.
Biežas kļūdas
- Jēgīguma jaukšana ar svarīgumu/lielumu. Efekts nav liels tikai tāpēc, ka p ir mazs; Atsevišķi ziņojiet par efekta lielumu.
- P-vērtības kļūdaina varbūtība H0. p nav "iedarbības neesamības varbūtība"; ir konceptuāli atšķirīgs.
- Lasot p>0,05 kā "bez efekta". Neuzrādīšana nav prombūtnes pierādījums; Nosakiet nenoteiktību.
- Nav labots vairākkārtējai pārbaudei. Pārāk daudz testu rada viltus pozitīvus rezultātus; Uzklājiet Bonferroni/FDR.
- Spēka ignorēšana. Būtiskā ietekme mazajā izlasē ir pārspīlēta; Pirms analīzes aprēķiniet jaudu.
Padoms. Pirms rezultātu norakstīšanas kā “nozīmīgu”, uzdodiet divus jautājumus: “Vai efekts ir praktiski nozīmīgs (lielums)?” un "Cik testu es veicu, pirms atradu šo rezultātu?" Otrs jautājums ir godīguma lakmusa papīrs.
Rezumējot
Hipotēžu pārbaude un p-vērtība ir spēcīgi, bet pārprasti rīki. P-vērtība ir iespēja redzēt datus, ja nulles hipotēze ir patiesa; H0 varbūtība nav ietekmes lielums vai atraduma nozīmīgums. Vienmēr ziņojiet par nozīmīgumu kopā ar efekta lielumu un ticamības intervālu; Nelasīt p>0,05 kā "bez efekta"; piemērot vairāku salīdzināšanas korekciju, ja esat veicis daudzus testus; Esiet informēts par pārspīlētas ietekmes risku no mazjaudas pētījumiem. AI izstrādā testa kodu un projektu; Jūsu pienākums ir atšķirt jēgpilnību no būtiskuma un pārbaudīt pieņēmumus.
Lietojumprogrammas uzdevums
Veiciet divu datu kopas grupu vidējo salīdzinājumu. Jautājiet AI par atbilstošo testu (ar tā pieņēmumiem) un kodu, palaidiet to un pārbaudiet pieņēmumus. Norādiet rezultātu, izmantojot trīs komponentus: efekta lielumu, 95% ticamības intervālu, p-vērtību. Pēc tam padomājiet par to, cik daudz dažādu salīdzinājumu varat veikt ar tiem pašiem datiem; Ja esat veicis vairākus testus, izmantojiet Bonferroni vai FDR korekciju un ziņojiet, vai rezultāts joprojām ir spēkā. Visbeidzot, analīzei uzrakstiet aptuvenu jaudas novērtējumu.
kontrolsaraksts
- [ ] Es izvēlējos testu ar tā pieņēmumiem un pārbaudīju pieņēmumus.
- [ ] Es ziņoju par rezultātu kā efekta lielumu + ticamības intervālu + p-vērtību.
- [ ] Es nošķīru “nozīmīgo” un “svarīgo”; Es nedomāju, ka p ir H0 varbūtība.
- [ ] Es uzrakstīju p>0,05 kā "mēs nevarējām to parādīt", nevis kā "bez efekta".
- [ ] Es izmantoju vairāku salīdzināšanas korekciju, ja veicu vairākus testus.
- [ ] Es novērtēju izlases jaudu; Es biju piesardzīgs par efekta lielumu zemā jaudā.