Gevinster:
- Evne til at vælge den test, der passer til typen og fordelingen af dataene og kontrollere antagelserne (normalitet, varians)
- Evne til at forstå den sande betydning af p-værdien og rapportere resultaterne med effektstørrelse og konfidensinterval
- Beskyttelse mod p-hacking med adskillelse af opdagelsesbekræftelse, korrektion af flere sammenligninger og fuld rapportering
Eksperimentet er slut, dataene er inde. Nu er vi på det mest kritiske og mest fejlagtige stadie: at analysere dataene korrekt og fortolke resultaterne ærligt. Biologiske data er ofte støjende, ustabile og multivariate. Forkert testudvælgelse, implicitte antagelsesbrud og ubevidst p-hacking (at prøve en analyse, indtil den giver det ønskede resultat) er de primære årsager til reproducerbarhedskrisen i den offentliggjorte biologiske litteratur. AI hjælper dig med at vælge den rigtige test, kontrollere antagelser og skrive analysekode; men statistisk integritet er dit ansvar.
I denne enhed vil vi dække almindelige statistiske test, antagelsestjek og måder at beskytte dig selv mod p-hacking.
Valg af den rigtige test
Valget af test afhænger af typen og fordeling af dataene. Kunstig intelligens vil hjælpe dig med at træffe dette valg, men du bør ikke anvende det blindt:
- To grupper, kontinuerlige data, normalfordeling: Uafhængig t-test.
- To grupper, ikke-normale: Mann-Whitney U (ikke-parametrisk: kræver ikke distributionsantagelse).
- Mere end to grupper: ANOVA (variansanalyse) + post-hoc test.
- Kategoriske data (tæller): Chi-square eller Fisher eksakt test.
- Relation: Korrelation (Pearson/Spearman) eller regression.
Tip: Visualiser dataene, før du vælger testen. Et histogram eller boxplot viser øjeblikkeligt den normalitet og afvigelser, som en t-test kræver. "Graf først, test senere" er en god vane.
Kontrol af antagelser
Hver test har skjulte antagelser. t-testen antager normalfordeling og varianslighed; Hvis disse overtrædes, vil resultatet være vildledende. AI skriver kode, der kontrollerer disse antagelser:
Rolle: Du er biostatistikassistent. Opgave: Skriv kode, der kontrollerer antagelserne for en t-test, før du sammenligner to grupper af data: normalitet (Shapiro-Wilk), varianslighed (Levene). Hvis antagelsen er overtrådt, så fortæl mig, hvilken alternativ test jeg skal gå videre. Giv Python-kode med kommentarer.
Koden omdirigerer dig til Mann-Whitney, hvis normaliteten er brudt. Dette "tjek først, beslut senere"-flow forhindrer dig i at udføre den forkerte test.
p-hacking og hvordan du beskytter dig selv
p-hacking er at analysere data på forskellige måder indtil p<0,05: prøve forskellige tests, selektivt kassere outliers, tilføje/fjerne grupper, rapportere, hvad der er "signifikant" blandt en lang række variable. Dette er hovedkilden til falske opdagelser. Måder til beskyttelse:
- Ret analyseplanen på forhånd (Enhed 7).
- Rapporter alle tests, ikke kun dem, der viser betydning.
- Ret flere sammenligninger (FDR/Bonferroni).
- Angiv effektstørrelsen og konfidensintervallet ved siden af p-værdien.
- Separat opdagelse og validering: Test, hvad du finder i opdagelsessættet på et uafhængigt sæt.
Trin for trin: en ærlig analyse
- Visualiser dataene (scatter, outlier).
- Tjek antagelserne.
- Udfør den test, du forudbestemte.
- Ret flere sammenligninger.
- Rapporter effektstørrelse + konfidensinterval.
- Skriv begrænsningerne tydeligt.
Kopierbare promptskabeloner
Visualiser gennemløb: plot histogrammer og boxplot for hver gruppe, flag outliers. Fortolk derefter normalitet. Datakolonner: [navn]. Giv Python-kode med kommentarer.
Jeg vil gerne sammenligne mine to grupper. Karakteristika for dataene: [type, N, fordeling]. Hvilken test er passende? Tjek antagelser, udfør testen, rapporter effektstørrelse OG 95 % konfidensinterval MED p-værdi.
Jeg testede for 15 forskellige gener i min analyse. Angiv koden, der anvender Bonferroni- og Benjamini-Hochberg-korrektionen, og forklar forskellen mellem de to metoder.
Svag prompt / Stærk prompt
Svag: "Er disse to grupper forskellige, lav en t-test."
Stærk: "Jeg har to grupper (kontrol n=18, behandling n=20), den afhængige variabel er enzymaktivitet (kontinuerlig). Visualiser først fordelingen og test normaliteten med Shapiro-Wilk. Hvis normal, anvend t-test, hvis ikke, Mann-Whitney. Rapporter resultatet med p-værdi, effektstørrelse (Cohen's d eller rank-biserial konfidensielle og rank-biseriel konfidensielle og rank-biserielle konfidensioner). og hvorfor."
Forskel: Den kraftfulde prompt har datatype, prøvenumre, antagelseskontrol og fuld rapporteringsanmodning. Modellen følger den rigtige vej i stedet for blindt at anvende t-test.
tre minisager
Case 1 — Forkert test: En elev anvendte en t-test på signifikant skæve (ikke-normale) data og fandt p=0,048. Da den kunstige intelligens tilføjede normalitetskontrollen, kom dataene ikke ud som normale; Med Mann-Whitney er p=0,11. Det faktiske resultat var meningsløst. Lektion: test uden at kontrollere antagelsen er vildledende.
Case 2 — Selektivt afvigende kassering: En forsker slettede to "outlier"-punkter for at gøre resultatet meningsfuldt. Modellen understregede, at outlier-kassering skulle baseres på en foruddefineret regel (f.eks. IQR-metoden) og rapporteres; vilkårlig sletning er p-hacking. Lektion: Indstil outlier-reglen på forhånd.
Case 3 — Gendannelse af effektstørrelse: En undersøgelse havde p=0,001, men effektstørrelsen (d=0,1) var næsten nul; den store stikprøve viste, at den ubetydelige forskel var signifikant. Da den kunstige intelligens rapporterede effektstørrelsen, viste det sig, at resultatet ikke havde nogen praktisk værdi. Lektion: Bare fordi p er lille, betyder det ikke noget.
sammenligningsdiagram
Status
rigtige tilgang
Skal undgås
unormale data
Ikke-parametrisk test
Tvunget t-test
multi test
Anvend rettelse
Rå p<0,05
afvigende
Foruddefineret regel
vilkårlig sletning
væsentligt resultat
Effektstørrelse + CI
bare s
opdagelse
Valider på uafhængigt sæt
Afslut i ét sæt
Almindelige fejl
- Hypotese ukontrolleret testning: falsk betydning med falsk testning.
- p-hacking: Prøver analyse indtil det giver det ønskede resultat.
- Rapportering kun p-værdi: Udeladelse af effektstørrelse og konfidensinterval.
- Ikke korrigeret for flere sammenligninger: Falske positive.
- Årsagsspring: Udledning af kausalitet fra korrelation.
Forsigtig: AI vil ikke "producere" det resultat, du ønsker, men vil med glæde skrive koden til den forkerte test, hvis den bliver vildledt. Du har statistisk integritet: rapporter alle forsøg, planlæg analysen på forhånd, gå aldrig glip af effektstørrelsen. Samarbejde med en biostatistiker for analyser, der fører til publicering.
reelle betydning af p-værdi
Det mest misforståede begreb i biologi er p-værdien. P-værdien er ikke "sandsynligheden for, at hypotesen er sand"; Det er "sandsynligheden for at se en forskel som stor eller mere ekstrem end hvad du observerer, når der i virkeligheden ikke er nogen forskel." Denne subtile, men kritiske skelnen er nøglen til ikke at overdrive resultaterne. p=0,03 betyder ikke "effekten er 97% reel". Når AI fortolker et resultat, skal du kontrollere, at den bruger denne definition korrekt; Modellen kan nogle gange gentage almindelig fejlfortolkning.
Konfidensintervallet (CI) er ofte mere informativt end p-værdien, fordi det viser størrelsen og usikkerheden af effekten tilsammen. "Forskel 2,4 gange (95 % CI: 1,8-3,1)" siger meget mere end "p<0,05": både retningen af effekten, dens størrelse og hvor præcist den blev målt. Fremhæv GA i dine rapporter.
Brug den korrekte definition af p-værdien, når du fortolker mit resultat. Undgå forkerte udsagn som "sandsynlighed for, at effekten er sand." Forklar i stedet den praktiske betydning i form af effektstørrelsen og 95 % konfidensinterval. Resultat: [data]
Korrelation, årsagssammenhæng og observationsdata
De fleste biologiske data er observationelle: du ser noget ændre sig med noget andet, men du kan ikke se, hvad der forårsager hvad. Sætningen "udtryk af gen X korrelerer med sygdom" indikerer ikke, at X forårsager sygdom; Sygdommen kan være stigende X, eller en tredje faktor kan påvirke begge. Kausalitet kan kun fastslås gennem interventionel eksperimentering (ændring af X og måling af resultatet). AI kan ubevidst bruge kausalt sprog ("årsager", "fører til") i dine tekster; gennemgå hver konklusionssætning fra dette perspektiv, og udtrykke observationsresultater i korrelationssprog ("korreleret", "varierende sammen").
Adskillelse af parrede og uafhængige data
Den hyppigst oversete skelnen i testvalg er, om prøverne er uafhængige eller parrede. Hvis du tager før og efter målinger fra den samme person (for eksempel blodværdier fra de samme patienter før og efter behandling), er disse målinger ikke uafhængige; En parret test er påkrævet. Brug af den uafhængige to-sample t-test her kasserer matchinformation i dataene og reducerer strøm; Det kan endda vende resultatet. Reglen er enkel: "Kommer disse to målinger fra den samme biologiske enhed?" Hvis svaret er ja, anvendes parret test (parret t-test eller Wilcoxon signed rank test), hvis nej, anvendes uafhængig test. Når du beder kunstig intelligens om test, skal du sørge for at angive matchstrukturen for dine data; Hvis du ikke specificerer, antager modellen ofte uafhængighed og anbefaler den forkerte test.
Jeg har to sæt mål. Vigtigt: disse målinger blev taget før/efter de SAMME individer (parret). Vælg den rigtige test, der tager højde for dette match (parret t-test eller Wilcoxon), tjek dine antagelser og rapporter med effektstørrelsen. Antag ikke uafhængighed.
Sammenfattende
Nøjagtig dataanalyse; at vælge den passende test for typen af data, kontrollere antagelser, korrigere flere sammenligninger og rapportere effektstørrelsen og konfidensintervallet ud over p-værdien. Den største fare er p-hacking; Modgiften er en forhåndsanalyseplan, fuld rapportering og adskillelse af opdagelsesbekræftelse. Kunstig intelligens er en stærk hjælp til testudvælgelse og antagelseskontrol, men statistisk integritet ligger hos mennesket.
Ansøgningsopgave
Tag et datasæt (dine egne data eller en prøve) med to grupper. Først skal du have AI-skrivekoden, der visualiserer dataene og tester for normalitet. Afhængigt af resultatet skal du anvende den passende test (t-test eller Mann-Whitney) og rapportere effektstørrelsen og konfidensintervallet sammen med p-værdien. Sammenlign derefter effekten af flere sammenligninger uden korrektion og med korrektion på resultatet.
tjekliste
- [ ] Jeg visualiserede dataene før test.
- [ ] Jeg tjekkede testantagelserne (normalitet, varians).
- [ ] Jeg valgte den passende test, jeg anvendte ikke blindt t-testen.
- [ ] Jeg har rettet flere sammenligninger.
- Jeg rapporterede [ ] p-værdien samt effektstørrelsen og konfidensintervallet.
- [ ] Jeg fiksede analyseplanen på forhånd og undgik p-hacking.