Enhet 8 / 11

Dataanalyse og statistisk validering

Gevinster:

  • Evne til å velge testen som passer til typen og distribusjonen av dataene og kontrollere forutsetningene (normalitet, varians)
  • Evne til å forstå den sanne betydningen av p-verdien og rapportere resultatene med effektstørrelse og konfidensintervall
  • Beskyttelse mot p-hacking med separasjon av oppdagelsesverifisering, korrigering av flere sammenligninger og full rapportering

Eksperimentet er over, dataene er inne. Nå er vi på det mest kritiske og mest feilaktige stadiet: å analysere dataene riktig og tolke resultatene ærlig. Biologiske data er ofte støyende, ustabile og multivariate. Feil testvalg, implisitte antakelsesbrudd og ubevisst p-hacking (prøver en analyse til den gir ønsket resultat) er de primære årsakene til reproduserbarhetskrisen i den publiserte biologiske litteraturen. AI hjelper deg å velge riktig test, sjekke forutsetninger og skrive analysekode; men statistisk integritet er ditt ansvar.

I denne enheten vil vi dekke vanlige statistiske tester, forutsetningskontroller og måter å beskytte deg selv mot p-hacking.

Velge riktig test

Valget av test avhenger av type og distribusjon av dataene. Kunstig intelligens vil hjelpe deg med å ta dette valget, men du bør ikke bruke det blindt:

  • To grupper, kontinuerlige data, normalfordeling: Uavhengig t-test.
  • To grupper, ikke-normale: Mann-Whitney U (ikke-parametrisk: krever ikke distribusjonsantagelse).
  • Mer enn to grupper: ANOVA (variansanalyse) + post-hoc test.
  • Kategoriske data (teller): Chi-square eller Fisher eksakt test.
  • Relasjon: Korrelasjon (Pearson/Spearman) eller regresjon.
Tips: Visualiser dataene før du velger testen. Et histogram eller boksplott viser umiddelbart normaliteten og uteliggene som en t-test krever. «Graph first, test later» er en god vane.

Sjekker forutsetninger

Hver test har skjulte antakelser. t-testen forutsetter normalfordeling og varianslikhet; Hvis disse brytes, vil resultatet være misvisende. AI skriver kode som sjekker disse forutsetningene:

Rolle: Du er biostatistikkassistent. Oppgave: Skriv kode som sjekker antakelsene til en t-test før du sammenligner to grupper av data: normalitet (Shapiro-Wilk), varianslikhet (Levene). Hvis forutsetningen brytes, fortell meg hvilken alternativ test jeg bør gå videre på. Gi Python-kode med kommentarer.

Koden omdirigerer deg til Mann-Whitney hvis normaliteten er brutt. Denne "sjekk først, avgjør senere"-flyten hindrer deg i å utføre feil test.

p-hacking og hvordan du kan beskytte deg selv

p-hacking er å analysere data på forskjellige måter frem til p<0,05: prøve forskjellige tester, selektivt forkaste uteliggere, legge til/fjerne grupper, rapportere hva som er "signifikant" blant et stort antall variabler. Dette er hovedkilden til falske funn. Måter å beskytte:

  1. Fiks analyseplanen på forhånd (enhet 7).
  2. Rapporter alle tester, ikke bare de som viser betydning.
  3. Fiks flere sammenligninger (FDR/Bonferroni).
  4. Angi effektstørrelsen og konfidensintervallet ved siden av p-verdien.
  5. Separat oppdagelse og validering: Test det du finner i oppdagelsessettet på et uavhengig sett.

Trinn for trinn: en ærlig analyse

  1. Visualiser dataene (scatter, outlier).
  2. Sjekk forutsetningene.
  3. Utfør testen du forhåndsbestemt.
  4. Fiks flere sammenligninger.
  5. Rapporter effektstørrelse + konfidensintervall.
  6. Skriv begrensningene tydelig.

Kopierbare spørsmålsmaler

Visualiser gjennomstrømning: plott histogrammer og boksplott for hver gruppe, flaggavvikere. Tolk deretter normalitet. Datakolonner: [navn]. Gi Python-kode med kommentarer.

Jeg ønsker å sammenligne mine to grupper. Dataenes kjennetegn: [type, N, distribusjon]. Hvilken test er passende? Sjekk forutsetninger, utfør testen, rapporter effektstørrelse OG 95 % konfidensintervall MED p-verdi.

Jeg testet for 15 forskjellige gener i analysen min. Gi koden som bruker Bonferroni- og Benjamini-Hochberg-korreksjonen og forklar forskjellen mellom de to metodene.

Svak forespørsel / Sterk forespørsel

Svak: "Er disse to gruppene forskjellige, gjør en t-test."

Sterkt: "Jeg har to grupper (kontroll n=18, behandling n=20), den avhengige variabelen er enzymaktivitet (kontinuerlig). Visualiser først fordelingen og test normaliteten med Shapiro-Wilk. Hvis normal, bruk t-test, hvis ikke, Mann-Whitney. Rapporter resultatet med p-verdi, effektstørrelse (Cohens d eller rang-biserial konfidensielle og 9-5% konfidensielle tester). og hvorfor."

Forskjell: Den kraftige ledeteksten har datatype, prøvenummer, forutsetningskontroll og fullstendig rapporteringsforespørsel. Modellen følger den rette veien i stedet for blindt å bruke t-test.

tre minisaker

Tilfelle 1 – Feil test: En student brukte en t-test på signifikant skjeve (ikke-normale) data og fant p=0,048. Da den kunstige intelligensen la til normalitetskontrollen, kom ikke dataene ut som normale; Med Mann-Whitney, p=0,11. Det faktiske resultatet var meningsløst. Leksjon: testing uten å sjekke antagelsen er misvisende.

Tilfelle 2 – Selektiv avvikende forkastelse: En forsker slettet to "avvikende" punkter for å gjøre resultatet meningsfullt. Modellen la vekt på at avvikende kassering skulle baseres på en forhåndsdefinert regel (f.eks. IQR-metoden) og rapporteres; vilkårlig sletting er p-hacking. Leksjon: angi avvikerregelen på forhånd.

Case 3 — Effektstørrelsesgjenoppretting: En studie hadde p=0,001, men effektstørrelsen (d=0,1) var nesten null; det store utvalget viste at den ubetydelige forskjellen var signifikant. Da den kunstige intelligensen rapporterte effektstørrelsen, ble funnet å ikke ha noen praktisk verdi. Leksjon: Bare fordi p er liten spiller ingen rolle.

sammenligningsdiagram

Status

riktig tilnærming

Å unngås

unormale data

Ikke-parametrisk test

Tvunget t-test

multitest

Bruk korrigering

Rå p<0,05

uteligger

Forhåndsdefinert regel

vilkårlig sletting

betydelig resultat

Effektstørrelse + CI

bare s

funn

Valider på uavhengig sett

Fullfør i ett sett

Vanlige feil

  • Hypotese ukontrollert testing: falsk betydning med falsk testing.
  • p-hacking: Prøver analyse til det gir ønsket resultat.
  • Rapporterer kun p-verdi: Utelater effektstørrelse og konfidensintervall.
  • Ikke korrigert for flere sammenligninger: Falske positive.
  • Årsakshopping: Å utlede årsakssammenheng fra korrelasjon.
Forsiktig: AI vil ikke "produsere" resultatet du ønsker, men vil gjerne skrive koden for feil test hvis den blir villedet. Du har statistisk integritet: rapporter alle forsøk, planlegg analysen på forhånd, gå aldri glipp av effektstørrelsen. Samarbeide med en biostatistiker for analyser som fører til publisering.

reell betydning av p-verdi

Det mest misforståtte konseptet i biologi er p-verdien. P-verdien er ikke "sannsynligheten for at hypotesen er sann"; Det er "sannsynligheten for å se en forskjell som stor eller mer ekstrem enn det du observerer, når det i virkeligheten ikke er noen forskjell." Dette subtile, men kritiske skillet er nøkkelen til ikke å overdrive resultatene. p=0,03 betyr ikke "effekten er 97% reell". Når du får AI til å tolke et resultat, sjekk at den bruker denne definisjonen riktig; Modellen kan noen ganger gjenta vanlig feiltolkning.

Konfidensintervallet (CI) er ofte mer informativt enn p-verdien fordi det viser størrelsen og usikkerheten til effekten sammen. "Differanse 2,4 ganger (95 % KI: 1,8-3,1)" sier mye mer enn "p<0,05": både retningen på effekten, dens størrelse og hvor nøyaktig den ble målt. Fremhev GA i rapportene dine.

Bruk riktig definisjon av p-verdien når du tolker resultatet mitt. Unngå uriktige utsagn som "sannsynlighet for at effekten er sann." Forklar i stedet den praktiske betydningen i form av effektstørrelsen og 95 % konfidensintervall. Resultat: [data]

Korrelasjon, årsakssammenheng og observasjonsdata

De fleste biologiske data er observasjonsmessige: du ser noe endres med noe annet, men du kan ikke se hva som forårsaker hva. Setningen "uttrykk av gen X korrelerer med sykdom" indikerer ikke at X forårsaker sykdom; Sykdommen kan øke X, eller en tredje faktor kan påvirke begge. Kausalitet kan bare fastslås gjennom intervensjonell eksperimentering (endre X og måle resultatet). AI kan ubevisst bruke kausalt språk ("årsaker", "fører til") i tekstene dine; gjennomgå hver konklusjonssetning fra dette perspektivet, og uttrykk observasjonsfunn på korrelasjonsspråk ("korrelert", "varierer sammen").

Separering av sammenkoblede og uavhengige data

Den mest oversette forskjellen i testvalg er om prøvene er uavhengige eller sammenkoblede. Hvis du tar før og etter målinger fra samme individ (for eksempel blodverdier fra de samme pasientene før og etter behandling), er disse målingene ikke uavhengige; En paret test er nødvendig. Ved å bruke den uavhengige to-sample t-testen her forkastes samsvarsinformasjon i dataene og reduserer kraften; Det kan til og med snu resultatet. Regelen er enkel: "Kommer disse to målingene fra samme biologiske enhet?" Hvis svaret er ja, brukes paret test (paret t-test eller Wilcoxon signert rangtest), hvis nei, brukes uavhengig test. Når du ber kunstig intelligens om tester, sørg for å spesifisere samsvarsstrukturen til dataene dine; Hvis du ikke spesifiserer, antar modellen ofte uavhengighet og anbefaler feil test.

Jeg har to sett med mål. Viktig: disse målingene ble tatt før/etter de SAMME individene (paret). Velg riktig test som tar hensyn til denne matchen (paret t-test eller Wilcoxon), sjekk dine antakelser og rapporter med effektstørrelsen. Ikke anta uavhengighet.

Oppsummert

Nøyaktig dataanalyse; velge riktig test for typen data, sjekke antakelser, korrigere flere sammenligninger og rapportere effektstørrelsen og konfidensintervallet i tillegg til p-verdien. Den største faren er p-hacking; Motgiften er en forhåndsanalyseplan, full rapportering og separasjon av oppdagelsesverifisering. Kunstig intelligens er et kraftig hjelpemiddel i testutvelgelse og forutsetningskontroll, men statistisk integritet ligger hos mennesket.

Søknadsoppgave

Ta et datasett (dine egne data eller en prøve) med to grupper. Ha først AI-skrivekoden som visualiserer dataene og tester for normalitet. Avhengig av resultatet, bruk den aktuelle testen (t-test eller Mann-Whitney) og rapporter effektstørrelsen og konfidensintervallet sammen med p-verdien. Sammenlign deretter effekten av flere sammenligninger uten korreksjon og med korreksjon på resultatet.

sjekkliste

  • [ ] Jeg visualiserte dataene før testing.
  • [ ] Jeg sjekket testforutsetningene (normalitet, varians).
  • [ ] Jeg valgte den passende testen, jeg brukte ikke blindt på t-testen.
  • [ ] Jeg fikset flere sammenligninger.
  • Jeg rapporterte [ ] p-verdien samt effektstørrelsen og konfidensintervallet.
  • [ ] Jeg fikset analyseplanen på forhånd og unngikk p-hacking.