Winst:
- Vermogen om de test te kiezen die geschikt is voor het type en de distributie van de gegevens en om de aannames te controleren (normaliteit, variantie)
- Vermogen om de ware betekenis van de p-waarde te begrijpen en de resultaten te rapporteren met effectgrootte en betrouwbaarheidsinterval
- Bescherming tegen p-hacking met scheiding van ontdekking en verificatie, meervoudige vergelijkingscorrectie en volledige rapportage
Het experiment is voorbij, de data zijn binnen. Nu bevinden we ons in de meest kritische en meest foute fase: het correct analyseren van de data en het eerlijk interpreteren van de resultaten. Biologische gegevens zijn vaak luidruchtig, onstabiel en multivariabel. Onjuiste testselectie, schendingen van impliciete aannames en onbewust p-hacken (een analyse proberen totdat deze het gewenste resultaat oplevert) zijn de belangrijkste oorzaken van de reproduceerbaarheidscrisis in de gepubliceerde biologische literatuur. AI helpt u de juiste test te kiezen, aannames te controleren en analysecode te schrijven; maar statistische integriteit is uw verantwoordelijkheid.
In dit onderdeel behandelen we algemene statistische tests, controles van aannames en manieren om jezelf tegen p-hacking te beschermen.
Het kiezen van de juiste toets
De keuze van de test is afhankelijk van het type en de distributie van de gegevens. Kunstmatige intelligentie helpt je bij het maken van deze keuze, maar je moet het niet blindelings toepassen:
- Twee groepen, continue gegevens, normale verdeling: onafhankelijke t-test.
- Twee groepen, niet-normaal: Mann-Whitney U (niet-parametrisch: geen verdelingsaanname vereist).
- Meer dan twee groepen: ANOVA (variantieanalyse) + post-hoc-test.
- Categorische gegevens (tellingen): Chi-kwadraat- of Fisher-exacte test.
- Relatie: Correlatie (Pearson/Spearman) of regressie.
Tip: Visualiseer de gegevens voordat u de test selecteert. Een histogram of boxplot toont onmiddellijk de normaliteit en uitschieters die een t-test vereist. ‘Eerst een grafiek maken, later testen’ is een goede gewoonte.
Aannames controleren
Elke test heeft verborgen aannames. De t-test gaat uit van een normale verdeling en gelijkheid van variantie; Als deze worden overtreden, is het resultaat misleidend. AI schrijft code die deze aannames controleert:
Rol: Je bent assistent biostatistiek. Taak: Schrijf code die de aannames van een t-toets controleert voordat twee groepen gegevens worden vergeleken: normaliteit (Shapiro-Wilk), gelijkheid van variantie (Levene). Als de aanname wordt geschonden, vertel me dan met welke alternatieve test ik verder moet. Geef Python-code met commentaar.
De code leidt u door naar Mann-Whitney als de normaliteit wordt verbroken. Deze ‘eerst controleren, later beslissen’-stroom voorkomt dat u de verkeerde test uitvoert.
p-hacking en hoe u uzelf kunt beschermen
p-hacking analyseert gegevens op verschillende manieren tot p<0,05: verschillende tests uitproberen, selectief uitschieters weggooien, groepen toevoegen/verwijderen, rapporteren wat "significant" is onder een groot aantal variabelen. Dit is de belangrijkste bron van valse ontdekkingen. Manieren van bescherming:
- Leg het analyseplan vooraf vast (Unit 7).
- Rapporteer alle tests, niet alleen de tests die significantie aantonen.
- Meerdere vergelijkingen repareren (FDR/Bonferroni).
- Geef de effectgrootte en het betrouwbaarheidsinterval naast de p-waarde.
- Afzonderlijke ontdekking en validatie: Test wat u in de ontdekkingsset vindt op een onafhankelijke set.
Stap voor stap: een eerlijke analyse
- Visualiseer de gegevens (spreiding, uitbijter).
- Controleer de aannames.
- Voer de test uit die u vooraf hebt bepaald.
- Meerdere vergelijkingen repareren.
- Rapporteer effectgrootte + betrouwbaarheidsinterval.
- Schrijf de beperkingen duidelijk op.
Kopieerbare promptsjablonen
Visualiseer de doorvoer: plot histogrammen en boxplots voor elke groep, markeer uitschieters. Interpreteer vervolgens normality.Data-kolommen: [naam]. Geef Python-code met commentaar.
Ik wil mijn twee groepen vergelijken. Kenmerken van de gegevens: [type, N, verdeling]. Welke test is geschikt? Controleer aannames, voer de test uit, rapporteer de effectgrootte EN 95% betrouwbaarheidsinterval MET p-waarde.
Ik heb in mijn analyse op 15 verschillende genen getest. Geef de code die de Bonferroni- en Benjamini-Hochberg-correctie toepast en leg het verschil tussen de twee methoden uit.
Zwakke prompt/sterke prompt
Zwak: "Zijn deze twee groepen verschillend, doe een t-test."
Strong: "Ik heb twee groepen (controle n=18, behandeling n=20), de afhankelijke variabele is enzymactiviteit (continu). Visualiseer eerst de verdeling en test de normaliteit met Shapiro-Wilk. Indien normaal, pas dan de t-test toe, zo niet Mann-Whitney. Rapporteer het resultaat met p-waarde, effectgrootte (Cohen's d of rank-biseriaal) en 95% betrouwbaarheidsinterval. Leg uit welke test je hebt gekozen en waarom."
Verschil: De krachtige prompt heeft gegevenstype, monsternummers, controle van aannames en een volledig rapportageverzoek. Het model volgt het juiste pad in plaats van blindelings de t-test toe te passen.
drie minikoffers
Geval 1 – Verkeerde test: Een leerling paste een t-test toe op aanzienlijk scheve (niet-normale) gegevens en vond p=0,048. Toen de kunstmatige intelligentie de normaliteitscontrole toevoegde, kwamen de gegevens er niet normaal uit; Met Mann-Whitney is p=0,11. Het werkelijke resultaat was zinloos. Les: testen zonder de aanname te controleren is misleidend.
Geval 2 – Selectieve verwijdering van uitschieters: een onderzoeker verwijderde twee “uitschieters” om het resultaat betekenisvol te maken. Het model benadrukte dat het weggooien van uitschieters gebaseerd moet zijn op een vooraf gedefinieerde regel (bijvoorbeeld de IQR-methode) en gerapporteerd moet worden; willekeurige verwijdering is p-hacking. Les: stel vooraf de uitschieterregel in.
Geval 3 – Herstel van de effectgrootte: Eén onderzoek had p=0,001, maar de effectgrootte (d=0,1) was bijna nul; uit de grote steekproef bleek dat het onbeduidende verschil significant was. Toen de kunstmatige intelligentie de effectgrootte rapporteerde, bleek de bevinding geen praktische waarde te hebben. Les: Het feit dat p klein is, doet er niet toe.
vergelijkingstabel
Status
juiste aanpak
Te vermijden
abnormale gegevens
Niet-parametrische test
Geforceerde t-test
multi-test
Correctie toepassen
Ruw p<0,05
uitschieter
Vooraf gedefinieerde regel
willekeurige verwijdering
aanzienlijk resultaat
Effectgrootte + CI
gewoon blz
ontdekking vinden
Valideer op onafhankelijke set
Finaliseer in één set
Veel voorkomende fouten
- Hypothese ongecontroleerd testen: valse significantie bij valse testen.
- p-hacking: Analyse proberen totdat deze het gewenste resultaat oplevert.
- Alleen p-waarde rapporteren: effectgrootte en betrouwbaarheidsinterval weglaten.
- Geen correctie voor meerdere vergelijkingen: valse positieven.
- Oorzakelijk springen: causaliteit afleiden uit correlatie.
Let op: AI zal niet het gewenste resultaat "produceren", maar zal met plezier de code voor de verkeerde test schrijven als hij wordt misleid. U beschikt over statistische integriteit: rapporteer alle onderzoeken, plan de analyse vooraf, mis nooit de effectgrootte. Werk samen met een biostatisticus voor analyses die tot publicatie leiden.
echte betekenis van p-waarde
Het meest verkeerd begrepen concept in de biologie is de p-waarde. De p-waarde is niet de "waarschijnlijkheid dat de hypothese waar is"; Het is "de waarschijnlijkheid dat je een verschil ziet dat even groot of extremer is dan wat je waarneemt, terwijl er in werkelijkheid geen verschil is." Dit subtiele maar kritische onderscheid is van cruciaal belang om de resultaten niet te overdrijven. p=0,03 betekent niet dat "het effect voor 97% reëel is". Wanneer u de AI een resultaat laat interpreteren, controleer dan of deze deze definitie correct gebruikt; Het model kan soms veelvoorkomende misinterpretaties herhalen.
Het betrouwbaarheidsinterval (CI) is vaak informatiever dan de p-waarde, omdat het de omvang en de onzekerheid van het effect samen weergeeft. ‘2,4-voudig verschil (95% BI: 1,8-3,1)’ zegt veel meer dan ‘p<0,05’: zowel de richting van het effect, de omvang ervan, als hoe nauwkeurig het werd gemeten. Markeer GA in uw rapporten.
Gebruik de juiste definitie van de p-waarde bij het interpreteren van mijn resultaat. Vermijd onjuiste uitspraken zoals 'de waarschijnlijkheid dat het effect waar is'. Leg in plaats daarvan de praktische betekenis uit in termen van de effectgrootte en het 95% betrouwbaarheidsinterval. Resultaat: [gegevens]
Correlatie, causaliteit en observationele gegevens
De meeste biologische gegevens zijn observationeel: je ziet iets veranderen met iets anders, maar je kunt niet zien wat de oorzaak is. De zin “expressie van gen X correleert met ziekte” geeft niet aan dat X ziekte veroorzaakt; De ziekte kan X verhogen, of een derde factor kan beide beïnvloeden. Causaliteit kan alleen worden vastgesteld door middel van interventioneel experimenteren (X veranderen en het resultaat meten). AI gebruikt mogelijk onbewust causale taal (“oorzaken”, “leidt tot”) in uw teksten; bekijk elke conclusiezin vanuit dit perspectief en druk observatiebevindingen uit in correlatieve taal (“gecorreleerd”, “samen variëren”).
Gekoppelde en onafhankelijke gegevens scheiden
Het vaakst over het hoofd geziene onderscheid bij de testselectie is of de monsters onafhankelijk of gepaard zijn. Als u voor en na metingen bij dezelfde persoon doet (bijvoorbeeld bloedwaarden van dezelfde patiënten voor en na de behandeling), zijn deze metingen niet onafhankelijk; Een gepaarde test is vereist. Door hier de onafhankelijke t-test met twee steekproeven te gebruiken, wordt matchinformatie in de gegevens weggegooid en wordt het vermogen verminderd; Het kan de uitkomst zelfs omkeren. De regel is simpel: "Komen deze twee metingen uit dezelfde biologische eenheid?" Als het antwoord ja is, wordt er een gepaarde test (paired t-test of Wilcoxon Signed Rank Test) gebruikt. Als dat niet het geval is, wordt er een onafhankelijke test gebruikt. Wanneer u kunstmatige intelligentie om tests vraagt, zorg er dan voor dat u de matchstructuur van uw gegevens specificeert; Als u dit niet specificeert, gaat het model vaak uit van onafhankelijkheid en beveelt het de verkeerde test aan.
Ik heb twee sets metingen. Belangrijk: deze metingen zijn vóór/na DEZELFDE individuen (gepaard) uitgevoerd. Kies de juiste test die rekening houdt met deze match (paired t-test of Wilcoxon), controleer je aannames en rapporteer met de effectgrootte. Ga niet uit van onafhankelijkheid.
Samengevat
Nauwkeurige data-analyse; het kiezen van de juiste test voor het type gegevens, het controleren van aannames, het corrigeren van meerdere vergelijkingen en het rapporteren van de effectgrootte en het betrouwbaarheidsinterval naast de p-waarde. Het grootste gevaar is p-hacking; Het tegengif is een vooraf analyseplan, volledige rapportage en scheiding tussen ontdekking en verificatie. Kunstmatige intelligentie is een krachtig hulpmiddel bij het selecteren van tests en het controleren van aannames, maar de statistische integriteit ligt bij de mens.
Applicatie taak
Neem een dataset (uw eigen data of een steekproef) met twee groepen. Laat eerst de AI code schrijven die de gegevens visualiseert en test op normaliteit. Afhankelijk van het resultaat past u de juiste test toe (t-test of Mann-Whitney) en rapporteert u de effectgrootte en het betrouwbaarheidsinterval samen met de p-waarde. Vergelijk vervolgens het effect van meerdere vergelijkingen zonder correctie en met correctie op het resultaat.
controlelijst
- [ ] Ik visualiseerde de gegevens voordat ik ging testen.
- [ ] Ik controleerde de testaannames (normaliteit, variantie).
- [ ] Ik heb de juiste test gekozen, ik heb de t-test niet blindelings toegepast.
- [ ] Ik heb meerdere vergelijkingen opgelost.
- Ik rapporteerde de [ ] p-waarde, evenals de effectgrootte en het betrouwbaarheidsinterval.
- [ ] Ik heb het analyseplan vooraf vastgelegd en p-hacking vermeden.