Jedinica 8 / 11

Analiza podataka i statistička validacija

Dobici:

  • Sposobnost odabira testa koji odgovara vrsti i distribuciji podataka i provjere pretpostavki (normalnost, varijansa)
  • Sposobnost razumevanja pravog značenja p-vrednosti i izveštavanja o rezultatima sa veličinom efekta i intervalom poverenja
  • Zaštita od p-hackinga s razdvajanjem otkrivanja i provjere, ispravkom višestrukog poređenja i punim izvještavanjem

Eksperiment je završen, podaci su ušli. Sada smo u najkritičnijoj i najpogrešnijoj fazi: ispravno analiziramo podatke i iskreno interpretiramo rezultate. Biološki podaci su često bučni, nestabilni i multivarijantni. Pogrešan odabir testa, implicitna kršenja pretpostavki i nesvjesno p-hakiranje (pokušavanje analize dok ne da željeni rezultat) primarni su uzroci krize reproduktivnosti u objavljenoj biološkoj literaturi. AI vam pomaže da odaberete pravi test, provjerite pretpostavke i napišete kod za analizu; ali statistički integritet je vaša odgovornost.

U ovoj jedinici ćemo pokriti uobičajene statističke testove, provjere pretpostavki i načine da se zaštitite od p-hackinga.

Odabir pravog testa

Izbor testa zavisi od vrste i distribucije podataka. Umjetna inteligencija će vam pomoći da napravite ovaj izbor, ali ne biste je trebali slijepo primjenjivati:

  • Dvije grupe, kontinuirani podaci, normalna distribucija: Nezavisni t-test.
  • Dvije grupe, nenormalne: Mann-Whitney U (neparametarski: ne zahtijeva pretpostavku o raspodjeli).
  • Više od dvije grupe: ANOVA (analiza varijanse) + post-hoc test.
  • Kategorički podaci (broji): Hi-kvadrat ili Fišerov egzaktni test.
  • Odnos: Korelacija (Pearson/Spearman) ili regresija.
Savjet: Vizualizirajte podatke prije odabira testa. Histogram ili dijagram u kutiji trenutno pokazuju normalnost i odstupanja koje t-test zahtijeva. "Prvo graf, testirajte kasnije" je dobra navika.

Provjera pretpostavki

Svaki test ima skrivene pretpostavke. T-test pretpostavlja normalnu distribuciju i jednakost varijanse; Ako se oni prekrše, rezultat će biti pogrešan. AI piše kod koji provjerava ove pretpostavke:

Uloga: Vi ste asistent za biostatistiku. Zadatak: Napišite kod koji provjerava pretpostavke t-testa prije poređenja dvije grupe podataka: normalnost (Shapiro-Wilk), jednakost varijanse (Levene). Ako je pretpostavka prekršena, recite mi na koji alternativni test da pređem. Dajte Python kod sa komentarima.

Kod vas preusmjerava na Mann-Whitney ako je normalnost narušena. Ovaj tok "prvo provjeri, odluči kasnije" sprečava vas da izvršite pogrešan test.

p-hacking i kako se zaštititi

p-hakiranje analizira podatke na različite načine do p<0,05: isprobavanje različitih testova, selektivno odbacivanje outliera, dodavanje/uklanjanje grupa, izvještavanje o tome šta je "značajno" među velikim brojem varijabli. Ovo je glavni izvor lažnih otkrića. Načini zaštite:

  1. Unaprijed fiksirajte plan analize (Jedinica 7).
  2. Prijavite sve testove, a ne samo one koji pokazuju značaj.
  3. Popravi višestruko poređenje (FDR/Bonferroni).
  4. Navedite veličinu efekta i interval pouzdanosti pored p-vrijednosti.
  5. Odvojeno otkrivanje i provjera valjanosti: Testirajte ono što pronađete u skupu za otkrivanje na nezavisnom skupu.

Korak po korak: iskrena analiza

  1. Vizualizirajte podatke (raspršeno, izvanredno).
  2. Provjerite pretpostavke.
  3. Izvršite test koji ste unaprijed odredili.
  4. Ispravi višestruko poređenje.
  5. Izvještaj o veličini efekta + interval povjerenja.
  6. Jasno napišite ograničenja.

Predlošci upita koji se mogu kopirati

Vizualizirajte propusnost: nacrtajte histograme i dijagrame okvira za svaku grupu, označite granične vrijednosti. Zatim interpretirajte normalnost. Stupci podataka: [ime]. Dajte Python kod sa komentarima.

Želim da uporedim svoje dve grupe. Karakteristike podataka: [tip, N, distribucija]. Koji je test prikladan? Provjerite pretpostavke, izvršite test, prijavite veličinu efekta I 95% interval pouzdanosti SA p-vrijednošću.

U svojoj analizi sam testirao 15 različitih gena. Navedite kod koji primjenjuje Bonferronijevu i Benjamini-Hochbergovu korekciju i objasnite razliku između ove dvije metode.

Slaba prompt / Jaka prompt

Slabo: "Jesu li ove dvije grupe različite, uradite t-test."

Snažan: "Imam dvije grupe (kontrola n=18, tretman n=20), zavisna varijabla je aktivnost enzima (kontinuirano). Prvo vizualizirajte distribuciju i testirajte normalnost sa Shapiro-Wilkom. Ako je normalno, primijenite t-test, ako ne, Mann-Whitney. Prijavite rezultat s p-vrijednošću, veličinom efekta (Cohen-biserial% ili ex-biserial rank). test koji ste izabrali i zašto."

Razlika: Snažan prompt ima tip podataka, brojeve uzoraka, provjeru pretpostavki i zahtjev za potpuni izvještaj. Model slijedi pravi put umjesto da slijepo primjenjuje t-test.

tri mini kofera

Slučaj 1 — Pogrešan test: Učenik je primijenio t-test na značajno iskrivljene (nenormalne) podatke i našao p=0,048. Kada je umjetna inteligencija dodala provjeru normalnosti, podaci nisu ispali normalni; Sa Mann-Whitneyjem, p=0,11. Stvarni rezultat je bio besmislen. Pouka: testiranje bez provjere pretpostavke je pogrešno.

Slučaj 2 — Odbacivanje selektivnog odstupanja: Istraživač je izbrisao dvije „izuzetne“ tačke da bi rezultat bio smislen. Model je naglasio da bi odbacivanje izvanrednih vrijednosti trebalo biti zasnovano na unaprijed definiranom pravilu (npr. IQR metoda) i prijavljeno; proizvoljno brisanje je p-hakovanje. Lekcija: unaprijed postavite pravilo vanrednog stanja.

Slučaj 3 — Oporavak veličine efekta: Jedna studija je imala p=0,001, ali je veličina efekta (d=0,1) bila skoro nula; veliki uzorak je pokazao da je beznačajna razlika značajna. Kada je umjetna inteligencija objavila veličinu efekta, otkrilo se da nalaz nema praktičnu vrijednost. Lekcija: Nije važno samo zato što je p malo.

uporedni grafikon

Status

pravi pristup

Treba izbjegavati

abnormalni podaci

Neparametarski test

Prisilni t-test

multi test

Primijenite korekciju

Sirova p<0,05

outlier

Unaprijed definisano pravilo

proizvoljno brisanje

značajan rezultat

Veličina efekta + CI

samo str

otkriće nalaz

Validacija na nezavisnom skupu

Finalizirajte u jednom setu

Uobičajene greške

  • Nekontrolisano testiranje hipoteze: lažni značaj sa lažnim testiranjem.
  • p-hacking: Pokušaj analize dok ne da željeni rezultat.
  • Izvještavanje samo o p-vrijednosti: izostavljanje veličine efekta i intervala pouzdanosti.
  • Bez korekcije za višestruka poređenja: Lažno pozitivni.
  • Uzročno skakanje: Zaključivanje uzročnosti iz korelacije.
Oprez: AI neće "proizvesti" rezultat koji želite, ali će rado napisati kod za pogrešan test ako bude zaveden. Imate statistički integritet: prijavite sva ispitivanja, planirajte analizu unaprijed, nikada ne propustite veličinu efekta. Radite sa biostatičarom za analize koje vode do objave.

pravo značenje p-vrednosti

Najneshvaćeniji koncept u biologiji je p-vrijednost. P-vrijednost nije "vjerovatnoća da je hipoteza tačna"; To je "vjerovatnoća da vidite razliku kao veliku ili ekstremniju od onoga što vidite, kada u stvarnosti nema razlike." Ova suptilna, ali kritična razlika je ključna da ne preuveličavate rezultate. p=0,03 ne znači "efekat je 97% stvaran". Kada AI interpretira rezultat, provjerite koristi li ovu definiciju ispravno; Model ponekad može ponoviti uobičajenu pogrešnu interpretaciju.

Interval pouzdanosti (CI) je često informativniji od p-vrijednosti jer zajedno pokazuje veličinu i neizvjesnost efekta. “Razlika 2,4 puta (95% CI: 1,8-3,1)” govori mnogo više od “p<0,05”: i smjer efekta, njegova veličina i koliko je precizno izmjeren. Istaknite GA u svojim izvještajima.

Koristite ispravnu definiciju p-vrijednosti kada tumačite moj rezultat. Izbjegavajte netačne izjave kao što je "vjerovatnoća da je učinak istinit." Umjesto toga, objasnite praktično značenje u smislu veličine efekta i intervala pouzdanosti od 95%. Rezultat: [podaci]

Korelacija, uzročnost i podaci opservacije

Većina bioloških podataka je opservacijski: vidite da se nešto mijenja s nečim drugim, ali ne možete vidjeti šta uzrokuje šta. Rečenica „ekspresija gena X u korelaciji sa bolešću“ ne ukazuje da X izaziva bolest; Bolest može povećati X, ili treći faktor može utjecati na oba. Uzročnost se može utvrditi samo interventnim eksperimentiranjem (promjena X i mjerenje rezultata). AI može nesvjesno koristiti kauzalni jezik (“uzroci”, “dovodi do”) u vašim tekstovima; pregledajte svaku zaključnu rečenicu iz ove perspektive, izražavajući opservacijske nalaze na korelacionom jeziku („korelirano“, „zajedno variraju“).

Razdvajanje uparenih i nezavisnih podataka

Razlika koja se najčešće zanemaruje u odabiru testa je da li su uzorci nezavisni ili upareni. Ako vršite mjerenja prije i poslije iste osobe (na primjer, krvne vrijednosti istih pacijenata prije i nakon tretmana), ova mjerenja nisu nezavisna; Potreban je upareni test. Korišćenje nezavisnog t-testa sa dva uzorka ovde odbacuje informacije o podudaranju u podacima i smanjuje snagu; Možda čak i preokrene ishod. Pravilo je jednostavno: "Da li ova dva mjerenja potiču iz iste biološke jedinice?" Ako je odgovor da, koristi se upareni test (upareni t-test ili Wilcoxon signed rank test), ako ne, koristi se nezavisni test. Kada tražite od umjetne inteligencije testove, obavezno navedite strukturu podudaranja vaših podataka; Ako ne navedete, model često pretpostavlja nezavisnost i preporučuje pogrešan test.

Imam dva seta mjerenja. Važno: ova mjerenja su napravljena prije/poslije ISTIH osoba (uparene). Odaberite pravi test koji uzima u obzir ovo podudaranje (upareni t-test ili Wilcoxon), provjerite svoje pretpostavke i prijavite veličinu efekta. Ne pretpostavljajte nezavisnost.

Ukratko

Precizna analiza podataka; odabir odgovarajućeg testa za tip podataka, provjeru pretpostavki, ispravljanje višestrukih poređenja i izvještavanje o veličini efekta i intervalu pouzdanosti pored p-vrijednosti. Najveća opasnost je p-hakovanje; Protuotrov je plan analize unaprijed, potpuno izvještavanje i razdvajanje otkrivanja i verifikacije. Umjetna inteligencija je moćna pomoć u odabiru testova i provjeri pretpostavki, ali statistički integritet leži na čovjeku.

Zadatak aplikacije

Uzmite skup podataka (vaše podatke ili uzorak) sa dvije grupe. Prvo neka AI napiše kod koji vizualizira podatke i testira normalnost. Ovisno o rezultatu, primijenite odgovarajući test (t-test ili Mann-Whitney) i navedite veličinu efekta i interval pouzdanosti zajedno sa p-vrijednošću. Zatim usporedite učinak višestrukih poređenja bez korekcije i s korekcijom na rezultat.

kontrolna lista

  • [ ] Vizualizirao sam podatke prije testiranja.
  • [ ] Provjerio sam pretpostavke testa (normalnost, varijansa).
  • [ ] Izabrao sam odgovarajući test, nisam slijepo primjenjivao t-test.
  • [ ] Ispravio sam višestruko poređenje.
  • Prijavio sam [ ] p-vrijednost, kao i veličinu efekta i interval pouzdanosti.
  • [ ] Unaprijed sam popravio plan analize i izbjegao p-hakovanje.