Mga nadagdag:
- Kakayahang pumili ng pagsusulit na angkop sa uri at pamamahagi ng data at suriin ang mga pagpapalagay (normalidad, pagkakaiba-iba)
- Kakayahang maunawaan ang tunay na kahulugan ng p-value at iulat ang mga resulta na may sukat ng epekto at agwat ng kumpiyansa
- Proteksyon mula sa p-hacking na may paghihiwalay sa pagtuklas-pag-verify, pagwawasto ng maramihang paghahambing at buong pag-uulat
Ang eksperimento ay tapos na, ang data ay nasa. Ngayon tayo ay nasa pinakakritikal at pinakamaling yugto: pagsusuri ng data nang tama at pagbibigay-kahulugan sa mga resulta nang matapat. Ang biological data ay madalas na maingay, hindi matatag at multivariate. Ang maling pagpili ng pagsusulit, mga paglabag sa implicit assumption, at unconscious p-hacking (pagsusubok ng pagsusuri hanggang sa maibigay nito ang ninanais na resulta) ay ang mga pangunahing sanhi ng krisis sa muling paggawa sa nai-publish na biological literature. Tinutulungan ka ng AI na piliin ang tamang pagsubok, suriin ang mga pagpapalagay, at isulat ang code ng pagsusuri; ngunit ang integridad ng istatistika ay responsibilidad mo.
Sa yunit na ito, sasaklawin namin ang mga karaniwang pagsusuri sa istatistika, pagsusuri sa pagpapalagay, at mga paraan upang protektahan ang iyong sarili mula sa p-hacking.
Pagpili ng tamang pagsubok
Ang pagpili ng pagsubok ay depende sa uri at pamamahagi ng data. Tutulungan ka ng artificial intelligence na gawin ang pagpipiliang ito, ngunit hindi mo ito dapat ilapat nang walang taros:
- Dalawang grupo, tuluy-tuloy na data, normal na distribusyon: Independent t-test.
- Dalawang pangkat, hindi normal: Mann-Whitney U (non-parametric: hindi nangangailangan ng pagpapalagay ng pamamahagi).
- Higit sa dalawang pangkat: ANOVA (pagsusuri ng pagkakaiba) + post-hoc test.
- Pangkategoryang data (mga bilang): Chi-square o Fisher na eksaktong pagsubok.
- Relasyon: Kaugnayan (Pearson/Spearman) o regression.
Tip: I-visualize ang data bago piliin ang pagsubok. Ang isang histogram o boxplot ay agad na nagpapakita ng normalidad at mga outlier na kinakailangan ng t-test. "Graph muna, test later" magandang ugali.
Sinusuri ang mga pagpapalagay
Ang bawat pagsubok ay may mga nakatagong pagpapalagay. Ipinapalagay ng t-test ang normal na distribusyon at pagkakapantay-pantay ng pagkakaiba; Kung ang mga ito ay nilabag, ang resulta ay mapanlinlang. Nagsusulat ang AI ng code na sumusuri sa mga pagpapalagay na ito:
Tungkulin: Isa kang katulong sa biostatistics. Gawain: Sumulat ng code na sumusuri sa mga pagpapalagay ng t-test bago ihambing ang dalawang pangkat ng data: normalidad (Shapiro-Wilk), pagkakapantay-pantay ng pagkakaiba (Levene). Kung nilabag ang palagay, sabihin sa akin kung aling alternatibong pagsubok ang dapat kong ipagpatuloy. Magbigay ng Python code na may mga komento.
Ire-redirect ka ng code sa Mann-Whitney kung nasira ang normalidad. Pinipigilan ka nitong "suriin muna, magpasya mamaya" na gawin ang maling pagsubok.
p-hacking at kung paano protektahan ang iyong sarili
Ang p-hacking ay nagsusuri ng data sa iba't ibang paraan hanggang sa p<0.05: sumubok ng iba't ibang pagsubok, piling itinatapon ang mga outlier, pagdaragdag/pag-alis ng mga grupo, pag-uulat kung ano ang "makabuluhan" sa isang malaking bilang ng mga variable. Ito ang pangunahing pinagmumulan ng mga pekeng pagtuklas. Mga paraan ng proteksyon:
- Ayusin ang plano ng pagsusuri nang maaga (Yunit 7).
- Iulat ang lahat ng mga pagsusulit, hindi lamang ang mga nagpapakita ng kahalagahan.
- Ayusin ang maramihang paghahambing (FDR/Bonferroni).
- Ibigay ang laki ng epekto at agwat ng kumpiyansa sa tabi ng p-value.
- Paghiwalayin ang pagtuklas at pagpapatunay: Subukan kung ano ang nahanap mo sa hanay ng pagtuklas sa isang independiyenteng hanay.
Hakbang sa hakbang: isang matapat na pagsusuri
- I-visualize ang data (scatter, outlier).
- Suriin ang mga pagpapalagay.
- Gawin ang pagsubok na iyong paunang natukoy.
- Ayusin ang maramihang paghahambing.
- Iulat ang laki ng epekto + agwat ng kumpiyansa.
- Isulat nang malinaw ang mga limitasyon.
Nakokopya na mga template ng prompt
I-visualize ang throughput: plot histograms at boxplots para sa bawat grupo, flag outlier. Pagkatapos ay bigyang-kahulugan ang normality.Mga column ng data: [name]. Magbigay ng Python code na may mga komento.
Gusto kong ikumpara ang dalawang grupo ko. Mga katangian ng datos: [type, N, distribution].Aling pagsusulit ang angkop? Suriin ang mga pagpapalagay, gawin ang pagsubok, iulat ang laki ng epekto AT 95% agwat ng kumpiyansa NA MAY p-value.
Sinubukan ko ang 15 iba't ibang mga gene sa aking pagsusuri. Ibigay ang code na nalalapat sa Bonferroni at Benjamini-Hochberg correction at ipaliwanag ang pagkakaiba sa pagitan ng dalawang pamamaraan.
Mahinang prompt / Malakas na prompt
Mahina: "Magkaiba ba ang dalawang grupong ito, gumawa ng t-test."
Strong: "Mayroon akong dalawang grupo (control n=18, treatment n=20), ang dependent variable ay enzyme activity (continuous). I-visualize muna ang distribution at subukan ang normality sa Shapiro-Wilk. Kung normal, ilapat ang t-test, kung hindi, Mann-Whitney. Iulat ang resulta na may p-value, effect size (Cohen's d o rank-biserial) at 95% na agwat ng pagsubok.
Pagkakaiba: Ang malakas na prompt ay may uri ng data, mga sample na numero, pagsusuri sa pagpapalagay at buong kahilingan sa pag-uulat. Ang modelo ay sumusunod sa tamang landas sa halip na walang taros na paglalapat ng t-test.
tatlong mini case
Kaso 1 — Maling pagsusulit: Naglapat ang isang mag-aaral ng t-test sa makabuluhang baluktot (hindi normal) na data at natagpuan ang p=0.048. Kapag idinagdag ng artificial intelligence ang normality check, ang data ay hindi lumabas na normal; Sa Mann-Whitney, p=0.11. Ang aktwal na resulta ay walang kahulugan. Aralin: ang pagsubok nang hindi sinusuri ang palagay ay nakaliligaw.
Case 2 — Selective outlier discard: Tinanggal ng isang researcher ang dalawang “outlier” na puntos para maging makabuluhan ang resulta. Binigyang-diin ng modelo na ang outlier na pagtatapon ay dapat na nakabatay sa isang paunang natukoy na panuntunan (hal., IQR method) at iniulat; Ang arbitrary na pagtanggal ay p-hacking. Aralin: itakda muna ang outlier na tuntunin.
Kaso 3 — Pagbawi ng laki ng epekto: Ang isang pag-aaral ay nagkaroon ng p=0.001 ngunit ang laki ng epekto (d=0.1) ay halos zero; ang malaking sample ay nagpakita ng hindi gaanong pagkakaiba upang maging makabuluhan. Kapag iniulat ng artificial intelligence ang laki ng epekto, ang paghahanap ay natagpuan na walang praktikal na halaga. Lesson: Hindi mahalaga kung maliit lang ang p.
tsart ng paghahambing
Katayuan
tamang diskarte
Para iwasan
abnormal na data
Nonparametric na pagsubok
Sapilitang t-test
maraming pagsubok
Ilapat ang pagwawasto
krudo p<0.05
outlier
Paunang natukoy na panuntunan
di-makatwirang pagtanggal
makabuluhang resulta
Laki ng effect + CI
p
paghahanap ng pagtuklas
I-validate sa independent set
I-finalize sa isang set
Mga karaniwang pagkakamali
- Hypothesis uncontrolled testing: Huwad na kahalagahan sa maling pagsubok.
- p-hacking: Sinusubukang pagsusuri hanggang sa maibigay nito ang ninanais na resulta.
- Pag-uulat lamang ng p-value: Inaalis ang laki ng epekto at agwat ng kumpiyansa.
- Hindi pagwawasto para sa maraming paghahambing: Mga maling positibo.
- Causation jumping: Paghihinuha ng causality mula sa ugnayan.
Babala: Ang AI ay hindi "maglalabas" ng resulta na gusto mo, ngunit masayang isusulat ang code para sa maling pagsubok kung maliligaw. Mayroon kang istatistikal na integridad: iulat ang lahat ng pagsubok, planuhin ang pagsusuri nang maaga, huwag palampasin ang laki ng epekto. Makipagtulungan sa isang biostatistician para sa mga pagsusuri na humahantong sa publikasyon.
tunay na kahulugan ng p-value
Ang pinaka hindi maintindihan na konsepto sa biology ay ang p-value. Ang p-value ay hindi ang "probability ng hypothesis na maging totoo"; Ito ay "ang posibilidad na makita ang isang pagkakaiba bilang malaki o mas matinding kaysa sa kung ano ang iyong naobserbahan, kapag sa katotohanan ay walang pagkakaiba." Ang banayad ngunit kritikal na pagkakaibang ito ay susi upang hindi palakihin ang mga resulta. Ang p=0.03 ay hindi nangangahulugang "ang epekto ay 97% totoo". Kapag nagkakaroon ng AI ng interpretasyon ng isang resulta, tiyaking ginagamit nito nang tama ang kahulugang ito; Minsan ay maaaring ulitin ng modelo ang karaniwang maling interpretasyon.
Ang confidence interval (CI) ay kadalasang mas nagbibigay-kaalaman kaysa sa p-value dahil ipinapakita nito ang laki at kawalan ng katiyakan ng epekto nang magkasama. "Pagkakaiba 2.4-fold (95% CI: 1.8-3.1)" sabi ng higit pa kaysa sa "p<0.05": parehong direksyon ng epekto, magnitude nito, at kung gaano ito katumpak na sinusukat. I-highlight ang GA sa iyong mga ulat.
Gamitin ang tamang kahulugan ng p-value kapag binibigyang kahulugan ang aking resulta. Iwasan ang mga maling pahayag gaya ng "probability of the effect being true." Sa halip, ipaliwanag ang praktikal na kahulugan sa mga tuntunin ng laki ng epekto at 95% agwat ng kumpiyansa. Resulta: [data]
Data ng ugnayan, sanhi at pagmamasid
Karamihan sa biological data ay obserbasyonal: may nakikita kang nagbabago sa ibang bagay, ngunit hindi mo makita kung ano ang sanhi kung ano. Ang pangungusap na "expression ng gene X ay nauugnay sa sakit" ay hindi nagpapahiwatig na ang X ay nagdudulot ng sakit; Ang sakit ay maaaring tumataas na X, o ang ikatlong salik ay maaaring makaapekto sa pareho. Ang sanhi ay maaari lamang itatag sa pamamagitan ng interventional experimentation (pagpapalit ng X at pagsukat ng resulta). Maaaring hindi sinasadyang gumamit ng causal language ang AI ("causes," "leads to") sa iyong mga text; suriin ang bawat pangungusap na konklusyon mula sa pananaw na ito, na nagpapahayag ng mga natuklasan sa obserbasyon sa wikang may kaugnayan ("kaugnay," "nag-iiba-iba").
Paghihiwalay ng nakapares at independiyenteng data
Ang pinakamadalas na hindi napapansing pagkakaiba sa pagpili ng pagsubok ay kung ang mga sample ay independyente o ipinares. Kung kumukuha ka bago at pagkatapos ng mga sukat mula sa parehong indibidwal (halimbawa, mga halaga ng dugo ng parehong mga pasyente bago at pagkatapos ng paggamot), ang mga sukat na ito ay hindi independyente; Kinakailangan ang isang paired test. Ang paggamit ng independiyenteng dalawang-sample na t-test dito ay nagtatapon ng impormasyon ng pagtutugma sa data at binabawasan ang kapangyarihan; Maaaring baligtarin pa nito ang kinalabasan. Ang panuntunan ay simple: "Nanggagaling ba ang dalawang sukat na ito sa parehong biological unit?" Kung oo ang sagot, gagamitin ang paired test (paired t-test o Wilcoxon signed rank test), kung hindi, independent test ang gagamitin. Kapag humingi ka ng artificial intelligence para sa mga pagsubok, tiyaking tukuyin ang istraktura ng pagtutugma ng iyong data; Kung hindi mo tinukoy, ang modelo ay madalas na nagpapalagay ng kalayaan at nagrerekomenda ng maling pagsubok.
Mayroon akong dalawang hanay ng mga sukat. Mahalaga: ang mga sukat na ito ay kinuha bago/pagkatapos ng mga SAME na indibidwal (ipinares). Piliin ang tamang pagsubok na isinasaalang-alang ang tugmang ito (ipinares na t-test o Wilcoxon), suriin ang iyong mga pagpapalagay at iulat ang laki ng epekto. Huwag ipagpalagay ang kalayaan.
Sa buod
Tumpak na pagsusuri ng data; pagpili ng naaangkop na pagsubok para sa uri ng data, pagsuri ng mga pagpapalagay, pagwawasto ng maraming paghahambing, at pag-uulat ng laki ng epekto at agwat ng kumpiyansa bilang karagdagan sa p-value. Ang pinakamalaking panganib ay p-hacking; Ang antidote ay isang plano sa paunang pagsusuri, buong pag-uulat, at paghihiwalay sa pag-verify ng pagtuklas. Ang artificial intelligence ay isang makapangyarihang tulong sa pagpili ng pagsusulit at pagsusuri ng pagpapalagay, ngunit ang integridad ng istatistika ay nakasalalay sa tao.
Gawain ng aplikasyon
Kumuha ng set ng data (sarili mong data o sample) na may dalawang pangkat. Una ay mayroon ang AI na sumulat ng code na nagpapakita ng data at mga pagsubok para sa normalidad. Depende sa resulta, ilapat ang naaangkop na pagsubok (t-test o Mann-Whitney) at iulat ang laki ng epekto at agwat ng kumpiyansa kasama ang p-value. Pagkatapos ay ihambing ang epekto ng maraming paghahambing nang walang pagwawasto at may pagwawasto sa resulta.
checklist
- [ ] Na-visualize ko ang data bago subukan.
- [ ] Sinuri ko ang test assumptions (normality, variance).
- [ ] Pinili ko ang naaangkop na pagsusulit, hindi ko bulag na inilapat ang t-test.
- [ ] Inayos ko ang maramihang paghahambing.
- Iniulat ko ang [ ] p-value pati na rin ang laki ng epekto at agwat ng kumpiyansa.
- [ ] Inayos ko nang maaga ang plano ng pagsusuri at iniwasan ang p-hacking.