zisky:
- Schopnost vytvořit jasnou hypotézu, přesné kontroly, randomizaci, zaslepení a předchozí analýzu síly do experimentálního návrhu
- Schopnost odlišit biologické opakování od opakování technického a vyhnout se chybě pseudoreplikace
- Schopnost zabránit p-hackingu na prvním místě stanovením plánu analýzy před experimentem (předběžné nahrávání)
Nejdražší chybou v biologii je špatně navržený experiment. Nesprávná analýza může být opravena později; Ale data shromážděná s nedostatečným počtem opakování, nekontrolovanými nebo smíšenými proměnnými nemohou být obnovena žádnou statistikou. "Odpadky dovnitř, odpadky ven." Proto musí být experiment před zahájením správně navržen. Umělá inteligence je v této fázi návrhu mocným partnerem pro myšlení: vyvolává kontrolní skupiny, píše kód, který provádí analýzu síly (výpočet počtu vzorků potřebných k zachycení hledaného rozdílu), zpochybňuje matoucí proměnné. Ale konečné rozhodnutí o designu je na vás se znalostí domény.
V této jednotce probereme součásti dobrého experimentálního návrhu a jak v tomto procesu využít umělou inteligenci.
Komponenty dobrého experimentálního designu
- Jasná hypotéza: Testovatelné, měřitelné tvrzení. Jako "Tento lék zpomaluje růst buněk."
- Nezávislá a závislá proměnná: Co měníte (dávku léku), co měříte (počet buněk)?
- Kontrolní skupina: Srovnávací skupina, která nedostala žádnou intervenci. Bez toho nemůžete znát důvod rozdílu.
- Replikace: Biologická replikace (různí jedinci/kultury) se liší od replikace technické (opakované měření stejného vzorku); Skutečná síla je v biologickém opakování.
- Randomizace: Náhodná distribuce vzorků do skupin a pořadí zpracování; snižuje zaujatost.
- Oslepení: Osoba provádějící měření neví, která skupina je která; zabraňuje subjektivnímu zkreslení.
- Analýza výkonu: Výpočet předem, kolik vzorků je potřeba k zachycení očekávaného účinku s 80% pravděpodobností.
Tip: Předejte experimentální návrh AI, aby jej „kritizovala“. "Jaká kontrola v tomto plánu chybí, jakou matoucí proměnnou jsem vynechal?" Otázka odhaluje mezery, které při samostatném přemýšlení nevidíte.
Analýza síly: proč a jak
Velmi malý vzorek může způsobit, že i skutečný rozdíl se bude zdát "nevýznamný" (nízký výkon); Příliš velký vzorek představuje plýtvání zdroji a nevýznamné rozdíly se mohou jevit jako „významné“. Správný počet se zjistí analýzou výkonu a závisí na: očekávané velikosti účinku, přijaté chybovosti (alfa a beta) a variabilitě dat.
Role: Jste asistentem experimentálního designu a biostatistiky. Úkol: Proveďte analýzu výkonu pro experiment porovnávající dvě skupiny. Napište kód, který vypočítá počet vzorků potřebných na skupinu s očekávanou velikostí účinku Cohenovo d = 0,8, alfa = 0,05, výkon = 0,80. Statsmodely a vysvětlete předpoklady.
Spustíte kód; například dostanete výsledek jako "26 vzorků na skupinu". Porovnáte to s rozpočtem experimentu a vytvoříte realistický plán.
Krok za krokem: navrhování experimentu
- Napište hypotézu: Jedna věta, měřitelná.
- Definujte proměnné: Nezávislé, závislé, konstantní.
- Identifikujte kontroly: negativní kontrola, pozitivní kontrola, kontrola s vehikulem.
- Vyjmenujte mixéry: Čas, šarže, teplota, experimentátor – jak budou řízeny?
- Proveďte analýzu síly: Vypočítejte počet potřebných opakování.
- Plánujte randomizaci a zaslepení.
- Napište plán analýzy předem: Před experimentem si určete, který test použijete (zabraňuje p-hackingu).
Kopírovatelné šablony výzev
Kritizujte můj experimentální plán. Najděte slabá místa, pokud jde o: kontrolní skupinu, počet opakování, randomizaci, zaslepení, zmatky. Pro každý nedostatek navrhněte konkrétní nápravu. Plán: [text]
Vysvětlete na příkladu rozdíl mezi biologickým opakováním a technickým opakováním. Podle mých zkušeností [vysvětlení], který by měl být kolik a proč?
Chci opravit svůj plán analýzy PŘED experimentem. Výtěžek: [design]. Který statistický test je vhodný, které předpoklady bych měl zkontrolovat, bude existovat více srovnání? Pište krok za krokem.
Slabá výzva / Silná výzva
Slabé: „Navrhněte experiment.“
Strong: „Chci otestovat, zda Drug
Rozdíl: V silné výzvě jsou hypotéza, proměnné, doba měření a dostupné kontroly jasné; Model poskytuje konkrétní zpětnou vazbu vhodnou pro daný obor.
tři mini pouzdra
Případ 1 – Efekt okraje: Jeden tým experimentoval na 96jamkové destičce; Výsledky byly zvláštní. Umělá inteligence připomněla, že okrajové jamky destičky se chovají odlišně v důsledku odpařování (efekt okraje) a navrhla používat okraje jako kontroly a náhodně distribuovat vzorky. Při opakování se zvýšila konzistence.
Případ 2 – Pseudoreplikace: Student odebral 10 vzorků tkáně jedné myši a řekl „n=10“. Jedná se však o 10 technických opakování; biologické n je stále 1. Když model vysvětlil tento rozdíl, student přepracoval experiment se 6 myšmi. Poučení: statistické n je biologická jednotka.
Případ 3 — Nedostatečný výkon: Jedna skupina provedla 4 vzorky na skupinu a nedosáhla skutečného účinku (p=0,09). Analýza výkonu ukázala, že 4 vzorky poskytly pouze 35% výkon. Pokud by model předem vypočítal správný počet vzorků, experiment by byl buď nastaven s dostatečným výkonem, nebo by vůbec nezačal. Lekce: Počítejte výkon předem, ne později.
srovnávací graf
koncepce
Správná aplikace
častá chyba
znovu
Počítejte biologické opakování
myslete na technické opakování
ovládání
Negativní+pozitivní+přenašeč
nekontrolovaný experiment
Randomizace
Skupina a pořadí náhodně
Sekvenční zpracování
moc
Počítejte před experimentem
neohlížej se
plán analýzy
pin předem
Výběr testů na základě dat
Časté chyby
- Přeskočení kontrolní skupiny: Způsobí, že příčina rozdílu nebude interpretovatelná.
- Pseudoopakování: Uvažování technického opakování jako biologického n vytváří pseudovýznam.
- Neprovádí se analýza výkonu: Nedostatečný nebo nehospodárný odběr vzorků.
- Ignorování zkreslovačů: Efekty jako dávka, umístění, čas zkreslují výsledek.
- Následný výběr testu analýzy: Hledání testu, který dává požadovaný výsledek (p-hacking).
Upozornění: Umělá inteligence vám poskytuje statistiky a návrhy návrhů, ale vyžaduje doménovou znalost biologického významu experimentu a toho, jaká kontrola je skutečně potřeba. Žádná analýza nemůže zachránit špatně navržený experiment; Před zahájením experimentu si ujasněte návrh, nejlépe se statistikem.
S ohledem na zdroje variability
Neopěvovaným hrdinou dobrého designu je přemýšlet dopředu o tom, odkud se variabilita dat bere. Biologická variabilita (přirozený rozdíl mezi jednotlivci) je nevyhnutelná a to, co chcete studovat; Technická variabilita (chyba pipety, odchylka zařízení, rozdíl dne) je hluk a měla by být snížena. Způsob, jak tyto dva oddělit, je v návrhu: distribuce technické variability s randomizací a zaslepení, vzorkování biologické variability s dostatečným opakováním.
Je užitečné začít tím, že budete mít seznam AI možných zdrojů variability ve vašem experimentu. Například v experimentu s buněčnou kulturou: počet pasáží (kolikrát byly buňky rozděleny), šarže média, umístění inkubátoru, doba sklizně. Znalost těchto zdrojů vám umožňuje rozhodnout, které z nich zachovat konstantní a které náhodně vybrat.
Uveďte všechny možné zdroje variability (biologické a technické) v následujícím experimentu; U každého navrhněte „ponechat fixní“, „randomizovat“ nebo „uložit a přidat do modelu jako proměnnou“. Experiment: [popis]
Předběžná registrace: nejmocnější nástroj integrity
Nejúčinnější formou stanovení plánu analýzy před experimentem je předregistrace: zaznamenávání vaší hypotézy, velikosti vzorku a plánu analýzy na místě s časovým razítkem před sběrem dat. To eliminuje pozdější pochyby o tom, že „zkoušel jsem analýzu, dokud jsem nedostal, co jsem chtěl“, a výrazně to zvyšuje důvěryhodnost vaší práce. Umělá inteligence vám může pomoci navrhnout váš termínový list, objasnit hypotézu a napsat plán analýzy. Tímto způsobem budete mít vytvořený nejsilnější štít proti p-hackingu, který uvidíme v Unit 8, než experiment začne.
Konstrukční rozdíly podle typu experimentu
Ne každý biologický experiment se řídí stejným vzorem; Konstrukce se liší v závislosti na typu problému. Experiment dávka-odpověď vyžaduje více dávek a model křivky; Jedna dávka nestačí. V experimentu s časovou řadou určuje design vzdálenost a závislost bodů měření (přeměření stejného jedince). V terénní/ekologické studii vystupuje do popředí náhodný výběr a prostorová závislost (podobnost blízkých bodů). Řeknete AI typ vašeho experimentu a zeptáte se, „jaké konstrukční prvky jsou pro tento typ kritické?“ Dotaz: umožňuje včas zachytit přehlédnutou komponentu. Ale pamatujte: model připomíná obecné principy, nezná biologické detaily vašeho systému.
V souhrnu
Solidní experiment; Je založena na jasné hypotéze, přesných kontrolách, dostatečném biologickém opakování, randomizaci, zaslepení a předem vypočítané síle. Umělá inteligence je výkonný partner, který tyto komponenty stahuje, píše kód analýzy výkonu a kritizuje váš plán. Ale biologický význam a konečné rozhodnutí o designu je na vás. Oprava plánu analýzy před experimentem je protijed na past na p-hacking, kterou uvidíme v další jednotce.
Aplikační úkol
Popište experiment, který máte na mysli (nebo příklad), v jednom odstavci: hypotéza, proměnné, kontroly, plánovaná replikace. Nechal jste umělou inteligenci kritizovat tento plán; Vyjmenujte chybějící ovládací prvky a mixéry. Poté vytiskněte kód analýzy výkonu (s hodnotami d a alfa) a nechte jej vypočítat požadovaný počet vzorků. Upravte svůj plán pomocí této zpětné vazby.
kontrolní seznam
- [ ] Svou hypotézu jsem napsal v jedné měřitelné větě.
- [ ] Určil jsem potřebné kontrolní skupiny (negativní/pozitivní/přenašeč).
- [ ] Biologické a technické opakování jsem rozlišil správně.
- [ ] Před experimentem jsem provedl analýzu výkonu.
- [ ] Plánoval jsem randomizaci a zaslepení.
- [ ] Opravil jsem test analýzy, aniž bych viděl data.