Vinster:
- Förmåga att välja det test som är lämpligt för typen och distributionen av data och kontrollera antagandena (normalitet, varians)
- Förmåga att förstå den sanna innebörden av p-värdet och rapportera resultaten med effektstorlek och konfidensintervall
- Skydd mot p-hacking med upptäckt-verifieringsseparation, korrigering av flera jämförelser och fullständig rapportering
Experimentet är över, data är inne. Nu är vi i det mest kritiska och mest felaktiga skedet: att analysera data korrekt och tolka resultaten ärligt. Biologiska data är ofta bullriga, instabila och multivariata. Felaktigt testval, implicita antagandebrott och omedvetet p-hacking (försöker en analys tills det ger önskat resultat) är de primära orsakerna till reproducerbarhetskrisen i den publicerade biologiska litteraturen. AI hjälper dig att välja rätt test, kontrollera antaganden och skriva analyskod; men statistisk integritet är ditt ansvar.
I den här enheten kommer vi att täcka vanliga statistiska tester, antagandekontroller och sätt att skydda dig mot p-hacking.
Att välja rätt test
Valet av test beror på typen och distributionen av data. Artificiell intelligens hjälper dig att göra detta val, men du bör inte tillämpa det blint:
- Två grupper, kontinuerliga data, normalfördelning: Oberoende t-test.
- Två grupper, icke-normala: Mann-Whitney U (icke-parametrisk: kräver inte distributionsantagande).
- Fler än två grupper: ANOVA (variansanalys) + post-hoc test.
- Kategoriska data (antal): Chi-square eller Fisher exakt test.
- Relation: Korrelation (Pearson/Spearman) eller regression.
Tips: Visualisera data innan du väljer testet. Ett histogram eller boxplot visar omedelbart normaliteten och extremvärdena som ett t-test kräver. "Graph first, test later" är en god vana.
Kontrollerar antaganden
Varje test har dolda antaganden. t-testet antar normalfördelning och varianslikhet; Om dessa överträds blir resultatet missvisande. AI skriver kod som kontrollerar dessa antaganden:
Roll: Du är biostatistikassistent. Uppgift: Skriv kod som kontrollerar antagandena för ett t-test innan du jämför två grupper av data: normalitet (Shapiro-Wilk), varianslikhet (Levene). Om antagandet kränks, berätta för mig vilket alternativt test jag ska gå vidare. Ge Python-kod med kommentarer.
Koden omdirigerar dig till Mann-Whitney om normaliteten bryts. Detta "kolla först, bestäm dig senare"-flödet hindrar dig från att utföra fel test.
p-hacking och hur du skyddar dig
p-hacking är att analysera data på olika sätt fram till p<0,05: prova olika tester, selektivt kassera extremvärden, lägga till/ta bort grupper, rapportera vad som är "signifikant" bland ett stort antal variabler. Detta är huvudkällan till falska upptäckter. Skyddssätt:
- Fixa analysplanen i förväg (enhet 7).
- Rapportera alla tester, inte bara de som visar signifikans.
- Fixa flera jämförelser (FDR/Bonferroni).
- Ange effektstorleken och konfidensintervallet bredvid p-värdet.
- Separat upptäckt och validering: Testa vad du hittar i upptäcktsuppsättningen på en oberoende uppsättning.
Steg för steg: en ärlig analys
- Visualisera data (scatter, outlier).
- Kontrollera antagandena.
- Utför det test du förutbestämt.
- Fixa flera jämförelser.
- Rapportera effektstorlek + konfidensintervall.
- Skriv begränsningarna tydligt.
Kopierbara promptmallar
Visualisera genomströmning: plotta histogram och boxplots för varje grupp, flagga extremvärden. Tolka sedan normalitet. Datakolumner: [namn]. Ge Python-kod med kommentarer.
Jag vill jämföra mina två grupper. Datas egenskaper: [typ, N, distribution]. Vilket test är lämpligt? Kontrollera antaganden, utför testet, rapportera effektstorlek OCH 95 % konfidensintervall MED p-värde.
Jag testade för 15 olika gener i min analys. Ge koden som tillämpar Bonferroni- och Benjamini-Hochberg-korrigeringen och förklara skillnaden mellan de två metoderna.
Svag prompt / Stark prompt
Svag: "Är dessa två grupper olika, gör ett t-test."
Stark: "Jag har två grupper (kontroll n=18, behandling n=20), den beroende variabeln är enzymaktivitet (kontinuerlig). Visualisera först fördelningen och testa normaliteten med Shapiro-Wilk. Om normalt, applicera t-test, om inte, Mann-Whitney. Rapportera resultatet med p-värde, effektstorlek (Cohens d eller rank-biseriellt konfidensiellt och rank-biseriellt konfidensintervall och rank-biseriellt). och varför."
Skillnad: Den kraftfulla prompten har datatyp, provnummer, antagandekontroll och fullständig rapportbegäran. Modellen följer rätt väg istället för att blint tillämpa t-test.
tre minifodral
Fall 1 — Fel test: En elev tillämpade ett t-test på signifikant skeva (icke-normala) data och fann p=0,048. När den artificiella intelligensen lade till normalitetskontrollen kom uppgifterna inte ut som normala; Med Mann-Whitney, p=0,11. Det faktiska resultatet var meningslöst. Lektion: att testa utan att kontrollera antagandet är missvisande.
Fall 2 – Selektivt avvikande kassering: En forskare tog bort två "avvikande" punkter för att göra resultatet meningsfullt. Modellen betonade att outlier-kassering bör baseras på en fördefinierad regel (t.ex. IQR-metoden) och rapporteras; godtycklig radering är p-hacking. Lektion: ställ in extremregeln i förväg.
Fall 3 — Effektstorleksåtervinning: En studie hade p=0,001 men effektstorleken (d=0,1) var nästan noll; det stora urvalet visade att den obetydliga skillnaden var signifikant. När den artificiella intelligensen rapporterade effektstorleken visade sig fyndet inte ha något praktiskt värde. Lektion: Bara för att p är litet spelar ingen roll.
jämförelsediagram
Status
rätt tillvägagångssätt
Att undvikas
onormala uppgifter
Icke-parametriskt test
Tvångsmässigt t-test
multitest
Tillämpa korrigering
Rå p<0,05
avvikande
Fördefinierad regel
godtycklig radering
betydande resultat
Effektstorlek + CI
bara sid
upptäckt fynd
Validera på oberoende uppsättning
Slutför i ett set
Vanliga misstag
- Hypotes okontrollerad testning: falsk signifikans med falsk testning.
- p-hacking: Försöker analysera tills det ger önskat resultat.
- Rapporterar endast p-värde: Utelämnar effektstorlek och konfidensintervall.
- Inte korrigera för flera jämförelser: Falska positiva.
- Causation jumping: Att sluta sig till kausalitet från korrelation.
Varning: AI kommer inte att "producera" det resultat du vill ha, men kommer gärna att skriva koden för fel test om den blir vilseledd. Du har statistisk integritet: rapportera alla försök, planera analysen i förväg, missa aldrig effektstorleken. Arbeta med en biostatistiker för analyser som leder till publicering.
verklig betydelse av p-värde
Det mest missförstådda begreppet inom biologi är p-värdet. P-värdet är inte "sannolikheten för att hypotesen är sann"; Det är "sannolikheten att se en skillnad som stor eller mer extrem än vad du observerar, när det i verkligheten inte finns någon skillnad." Denna subtila men kritiska distinktion är nyckeln till att inte överdriva resultaten. p=0,03 betyder inte "effekten är 97% verklig". När du låter AI tolka ett resultat, kontrollera att den använder denna definition korrekt; Modellen kan ibland upprepa vanliga misstolkningar.
Konfidensintervallet (CI) är ofta mer informativt än p-värdet eftersom det visar effektens storlek och osäkerhet tillsammans. "2,4-faldig skillnad (95 % KI: 1,8-3,1)" säger mycket mer än "p<0,05": både effektens riktning, dess storlek och hur exakt den mättes. Markera GA i dina rapporter.
Använd korrekt definition av p-värdet när du tolkar mitt resultat. Undvik felaktiga påståenden som "sannolikheten att effekten är sann." Förklara istället den praktiska innebörden i termer av effektstorlek och 95 % konfidensintervall. Resultat: [data]
Korrelation, orsakssamband och observationsdata
De flesta biologiska data är observationsbaserade: du ser något förändras med något annat, men du kan inte se vad som orsakar vad. Meningen "uttryck av gen X korrelerar med sjukdom" indikerar inte att X orsakar sjukdom; Sjukdomen kan öka X, eller en tredje faktor kan påverka båda. Kausalitet kan endast fastställas genom interventionell experimentering (ändra X och mäta resultatet). AI kan omedvetet använda kausalt språk ("orsaker", "leder till") i dina texter; granska varje slutsats ur detta perspektiv och uttrycka observationsfynd i korrelationsspråk ("korrelerade", "varierar tillsammans").
Separera parade och oberoende data
Den mest förbisedda distinktionen vid testval är om proverna är oberoende eller parade. Om du tar före och efter mätningar från samma individ (till exempel blodvärden från samma patienter före och efter behandling), är dessa mätningar inte oberoende; Ett parat test krävs. Genom att använda det oberoende t-testet med två prov här kasseras matchningsinformation i data och minskar effekten; Det kan till och med vända resultatet. Regeln är enkel: "Kommer dessa två mätningar från samma biologiska enhet?" Om svaret är ja, används parat test (parat t-test eller Wilcoxon signed rank test), om inte används oberoende test. När du ber artificiell intelligens om tester, var noga med att specificera matchningsstrukturen för dina data; Om du inte specificerar, utgår modellen ofta från oberoende och rekommenderar fel test.
Jag har två uppsättningar mått. Viktigt: dessa mätningar gjordes före/efter SAMMA individer (parade). Välj rätt test som tar hänsyn till denna matchning (parat t-test eller Wilcoxon), kontrollera dina antaganden och rapportera med effektstorleken. Anta inte självständighet.
Sammanfattningsvis
Noggrann dataanalys; att välja lämpligt test för typen av data, kontrollera antaganden, korrigera flera jämförelser och rapportera effektstorlek och konfidensintervall utöver p-värdet. Den största faran är p-hacking; Motgiftet är en förhandsanalysplan, fullständig rapportering och separation av upptäckt-verifiering. Artificiell intelligens är ett kraftfullt hjälpmedel vid testval och antagandekontroll, men statistisk integritet ligger hos människan.
Applikationsuppgift
Ta en datamängd (din egen data eller ett prov) med två grupper. Ha först AI-skrivkoden som visualiserar data och testar för normalitet. Beroende på resultatet, använd lämpligt test (t-test eller Mann-Whitney) och rapportera effektstorleken och konfidensintervallet tillsammans med p-värdet. Jämför sedan effekten av flera jämförelser utan korrigering och med korrigering på resultatet.
checklista
- [ ] Jag visualiserade data innan jag testade.
- [ ] Jag kontrollerade testantagandena (normalitet, varians).
- [ ] Jag valde lämpligt test, jag tillämpade inte blint t-testet.
- [ ] Jag fixade flera jämförelser.
- Jag rapporterade [ ] p-värdet samt effektstorlek och konfidensintervall.
- [ ] Jag fixade analysplanen i förväg och undvek p-hacking.